java使用tesseract-ocr进行文字识别

提示:文章写完后,目录可以自动生成,如何生成可参考右边的帮助文档

文章目录

  • 前言
  • 一、tesseract-ocr是什么?
  • 二、使用步骤
    • 1.下载exe安装包
    • 2.安装
    • 3.使用
    • 3.设置全局path
    • 二、java如何进行调用
      • 1.引入依赖
      • 2.demo使用
      • 3.环境变量配置

        前言

        公司使用AI进行OCR文字识别效果不好,并且提供的服务不稳定,本次查找到使用java也能连接的OCR开源项目进行识别的学习


        一、tesseract-ocr是什么?

        tesseract-ocr是一个开源的OCR文字识别项目,目前版本已经更新到5.X.X了,并且提供多种环境的安装,本次我们在window进行安装并且使用。

        二、使用步骤

        1.下载exe安装包

        说明:tesseract-ocr目前训练的数据是放在tessdata文件夹下,后缀为traineddata文件,目前支持100多种语言。今天安装的为第三方支持的安装包。

        https://github.com/UB-Mannheim/tesseract/wiki
        

        该页面下有支持64位和32位的安装包

        tesseract-ocr-w32-setup-5.3.0.20221222.exe (32 bit) and
        tesseract-ocr-w64-setup-5.3.0.20221222.exe (64 bit) resp.
        

        ``

        2.安装

        在软件安装时,默认只会安装英文训练的数据集合,要使用其他文字,需要在安装时,进行勾选。

        3.使用

        该exe安装的软件可以直接使用tesseract.exe进行命令行执行文字识别。进入到exe存在的目录下。cmd进入到命命令执行框

        //官方
        tesseract imagename outputbase [-l lang] [--oem ocrenginemode] [--psm pagesegmode] [configfiles...]
        

        imagename :图片的位置

        outputbase:输出的文件名字,不加后缀保存为txt格式

        -l lang:识别的语言类型,不加默认为英文,中文使用-l chi_sim,使用多种语言识别如 -l eng+deu

        –psm pagesegmode:参数

        –oem:使用识别的引擎,新版都是用 --oem 1(LSTM模式)

        configfiles: 可以执行输入的格式如 pdf, hocr ,tsv

        -psm 后携带的参数:
        0 =方向和脚本检测(OSD)。
        1 =自动页面分割与OSD。
        2 =自动页面分割,但没有OSD,或OCR
        3 =全自动页面分割,无OSD。(默认)
        4 =假设一列文本大小可变。
        5 =假设有一个垂直对齐的文本块。
        6 =假设有一个统一的文本块。
        7 =将图像视为单个文本行。
        8 =把图像看成一个单词。
        9 =把图像看成一个圆圈里的单个单词。
        10 =将图像视为单个字符。
        -l lang和/或-psm pagesegmode必须出现在任何configfile之前。
        
        tesseract.exe C:\Users\Lenovo\Pictures\联想截图\联想截图_20230220144409.png out -l chi_sim
        

        识别结果默认为out.txt在exe目录下

        3.设置全局path

        要想在其他目录使用tesseract.exe工具,那么奖该工具父目录添加到环境变量中

        二、java如何进行调用

        1.引入依赖

        tess4j是针对java对tesseract封装调用的api依赖,我们只需要在项目中引入pom即可开箱使用,注意,版本可能会影响,目前我引入的版本为5.0.0

           net.sourceforge.tess4j tess4j 5.0.0 

        2.demo使用

         public static void main(String[] args) throws IOException { // 创建实例
            ITesseract instance = new Tesseract();
            // 设置识别语言
         
            //instance.setLanguage("chi_sim");
            instance.setLanguage("jpn");
            // 设置识别引擎
         
            instance.setOcrEngineMode(1);
            instance.setPageSegMode(6);
         
            // 读取文件
         
            BufferedImage image = ImageIO.read(new File("C:\\Users\\Lenovo\\Pictures\\联想截图\\联想截图_20230220143248.png"));
            try { // 识别
                //String res = instance.doOCR(new File("C:\\Users\\Lenovo\\Pictures\\联想截图\\联想截图_20230220144409.png"));
                String result = instance.doOCR(image);
                System.out.println(result);
           } catch (TesseractException e) { System.err.println(e.getMessage());
           }
         }
        

        注意:在新版本中识别引擎不能为0,否则报错

        3.环境变量配置

        我是用idea时需要配置环境变量,告知tessdata文件夹的位置,并且加入到Environment variables:TESSDATA_PREFIX=D:\Tesseract-OCR\tessdata