账号密码登录
微信安全登录
微信扫描二维码登录

登录后绑定QQ、微信即可实现信息互通

手机验证码登录
找回密码返回
邮箱找回 手机找回
注册账号返回
其他登录方式
分享
  • 收藏
    X
    tesseract-ocr的问题。我装好后下了个英文文章,可以识别出来,但是我自己做了一个主是四个数字的验证码却输出是空
    76
    0

    费了好大的劲 装好了tesseract-ocr 真的好坑这个东西
    python层面的包 我也装好好几个 tesserorc , pytesser, pytsseract

    网上资料极其乱,我到现在都 不明白 在PYTHON层面上 上面这三个包有啥区别。

    然后以为可以了,自己做了一个最简单的验证码,就是白底黑字四个数字,居然输得出empty page 崩溃了
    折腾了好久。都不明白为啥 难道这么简单的都 识别不了?
    然后我弄了个纯英文的文章,满长的,在那跑了好久 居然全给识别出来了。我晕了

    难道tesseract-ocr的 tessdata里面没有数字识别?

    大佬们这要咋办,这种情况该怎么处理了 有点蒙了

    0
    打赏
    收藏
    点击回答
        全部回答
    • 0
    • 川长思鸟来 普通会员 1楼

      Tesseract-OCR库识别英文文章的精度和验证码识别的问题,是两个不同的问题。

      对于识别文章,Tesseract-OCR库提供了大量的预训练模型和词汇表,可以自动识别出文章中的实体和语义。但是,对于验证码,它并不直接支持识别。你需要使用其他的OCR工具,比如Python的pytesseract库,或者专门的验证码识别软件,比如Anki、Jframe等。

      对于验证码识别,你需要提供对应的编码(通常是ASCII码或UTF-8编码),并且需要按照正确的格式(通常是四位数字、字母、空格)进行输入。Tesseract-OCR库并不能自动识别验证码,你需要手动输入。

      你可以尝试以下步骤:

      1. 在你的文本文件中,用Tesseract-OCR识别文章。如果你的文本文件是UTF-8编码的,你可以使用pytesseract.pytesseract.tesseract_cmd --language=eng命令,然后将识别出来的文本输出到一个文件中。

      2. 使用你自己的验证码识别软件(比如Anki、Jframe等),将识别出的文本和你提供的编码进行匹配,看看是否正确。

      3. 如果你的验证码识别失败,你可以检查你的输入是否正确。可能你需要检查你的编码格式是否正确,或者你的输入是否符合验证码的格式要求。

      希望这些信息对你有所帮助。如果你还有其他问题,欢迎随时向我提问。

    更多回答
    扫一扫访问手机版
    • 回到顶部
    • 回到顶部