Tutorial sa Tesseract OCR para sa Windows, Python, at .NET

Huling pag-update: 10/10/2025
May-akda: Isaac
  • Multi-language na suporta at mga format ng output para sa mahusay na pag-scan.
  • Madaling pagsasama sa Sawa (Pytesseract) at .NET ecosystem.
  • Dinadala ng IronOCR ang mga preprocessing at high-level na API sa Tesseract.

Tutorial sa Tesseract OCR

Kung interesado ka sa pag-convert ng mga larawan o PDF sa nae-edit na teksto nang hindi nahihirapan sa mga kumplikadong tool, o I-extract ang text mula sa mga larawan sa Windows 11, ang magandang balita ay ngayon Ang Tesseract OCR ay isang malakas, libre at napaka-flexible na solusyonSa praktikal na gabay na ito, sinusuri namin kung ano ito, kung paano i-install ito Windows, kung paano ito i-validate mula sa console, at kung paano ito isama sa parehong Python (sa pamamagitan ng Pytesseract) at .NET, pati na rin ang isang malawakang ginagamit na alternatibo sa ecosystem na iyon: IronOCR.

Higit pa sa pag-install at pag-click sa pindutan, makikita mo kung paano ihanda ang kapaligiran, kung saan idaragdag ang maipapatupad na landas, kung ano ang gagawin kung lumitaw ang karaniwang error TesseractNotFoundError sa Python, at kung paano iproseso ang mga teksto sa maraming wika (Espanyol, Ingles, Pranses, Portuges, at kahit na mga pakete tulad ng Math) sa loob ng mga application. Ang layunin ay para sa iyo na magkaroon ng isang matatag, handa sa produksyon na OCR workflow., sumasaklaw mula sa linya ng comandos hanggang sa gamitin sa C# na may mga partikular na aklatan.

Ano ang Tesseract OCR?

Ang Tesseract ay isang open source na OCR engine, na inilathala sa ilalim ng lisensya ng Apache 2.0. Ito ay isinilang noong 80s sa Hewlett‑Packard at ngayon ay pinananatili ng komunidad na may malakas na drive na GoogleMalinaw ang misyon nito: pag-aralan ang mga pixel sa isang imahe (TIFF, PNG, JPEG, bukod sa iba pa) para makita ang mga character, salita, at linya, at i-output ang content bilang text na nababasa ng machine.

Malayang magagamit ito mula sa command line, na ginagawang mas madali ang automation at scripting. Bilang karagdagan, sinusuportahan nito ang maraming wika at maaaring sanayin para sa mga bagong font o alpabeto., kung kaya't karaniwan ito sa pag-digitize ng dokumento, pagproseso ng invoice, pag-archive o accessibility.

I-download at i-install ang Tesseract sa Windows

Sa Windows, ang pinakadirektang ruta ay ang paggamit ng pre-compiled installer. Ang pangunahing mapagkukunan ay ang opisyal na imbakan sa GitHub (tesseract-ocr/tesseract), kung saan makikita mo ang mga naka-sign na binary at mga kamakailang bersyon.

Sa mga magagamit na installer, karaniwan nang makakita ng mga pakete tulad ng tesseract-ocr-w64-setup-5.3.0.20221222.exe (64 piraso). I-download at patakbuhin itoGagabayan ka ng wizard sa sunud-sunod na pag-setup, kabilang ang pagpili ng wika ng installer at mga language pack.

Data ng wika at wika ng installer

Sa panahon ng pag-install, hihilingin sa iyo ng wizard na piliin ang iyong wika. Ang Ingles ay karaniwang default, ngunit maaari kang magdagdag ng mga karagdagang pakete gaya ng Spanish, French, o kahit na mga espesyal na module tulad ng Math kung kailangan mo ang mga ito. Tinutukoy ng pagpipiliang ito kung aling mga modelo ang kinopya sa direktoryo ng data (tessdata).

Lisensya, mga gumagamit at mga bahagi

Ang Tesseract ay ipinamahagi sa Apache Lisensya 2.0, para magamit at maipamahagi mo ito nang may kakayahang umangkop. Hihilingin sa iyo ng installer na tanggapin ang lisensya, piliin kung i-install para sa isang user o para sa lahat ng user, at pumili ng mga bahagi. Ang mga kapaki-pakinabang na elemento ay pinili bilang default, tulad ng ScrollView, mga tool sa pagsasanay, mga shortcut, at data ng wika.

Landas ng pag-install at folder ng Start menu

Papayagan ka ng wizard na piliin ang folder na patutunguhan. Isulat ang landas na iyon, kakailanganin mo ito para sa variable ng kapaligiran. Pagkatapos ay maaari mong pangalanan ang folder ng Start menu kung saan nilikha ang mga shortcut. Kapag tapos na, i-click ang I-install, at kapag natapos na, i-click ang Tapos upang isara.

  Paano paganahin ang nested virtualization sa Hyper-V

Idagdag ang Tesseract sa environment variable sa Windows

Upang patakbuhin ang tesseract command mula sa anumang window cmd o PowerShell, ito ay maginhawa idagdag ang folder ng pag-install sa path ng system. Sa ganitong paraan malalaman ng Windows kung saan mahahanap ang executable nang walang ganap na mga landas.

Pumunta sa Start menu search at i-type ang "mga variable ng kapaligiran" o "mga advanced na setting ng system." Sa window ng System Properties, pumunta sa tab na Advanced at i-click Mga variable sa kapaligiran.

Sa block ng System Variables, piliin Landas, i-click ang I-edit at pagkatapos ay Bago. Idikit ang landas kung saan naka-install ang Tesseract (halimbawa, C:\Program Files\Tesseract-OCR) at kumpirmahin gamit ang OK sa lahat ng window.

Suriin ang pag-install mula sa console

Buksan ang cmd o PowerShell at patakbuhin ang: tesseractKung maayos ang lahat, makikita mo ang mensahe ng paggamit, ang naka-install na bersyon, at isang listahan ng mga opsyon na sinusuportahan ng utility. Kinukumpirma ng pagsubok na ito na tama ang Path at ang binary ay tumugon.

I-install ang Tesseract sa macOS

Sa macOS, maaari mong i-install ang utility mula sa mga manager ng package. Sa Homebrew, tumakbo brew install tesseract. Kung gumagamit ka ng MacPorts, ang katumbas na utos ay sudo port install tesseract. Parehong ruta i-download at irehistro ang executable upang gamitin ito mula sa Pandulo.

Pagkakaiba sa pagitan ng Tesseract at Pytesseract

Ito ay maginhawa upang paghiwalayin ang mga konsepto: Ang Tesseract ay ang OCR engine, ang binary na gumagawa ng pagkilala. Ang Pytesseract ay isang wrapper para sa Python na tumatawag sa engine na iyon at nag-format ng output para sa iyong mga script. Kung nagtatrabaho ka sa Python, kakailanganin mong naka-install ang Tesseract sa iyong system at Pytesseract sa iyong kapaligiran.

Pangunahing paggamit sa Python at solusyon sa TesseractNotFoundError

Ang isa sa mga pinakakaraniwang pagkakamali kapag nagsimula ka sa Python ay TesseractNotFoundError. Nangyayari ito kapag hindi nahanap ng Pytesseract ang engine executable, kadalasan dahil wala ito sa Path o hindi naitakda ang path sa script.

Upang maiwasan ito sa Windows, maaari mong itakda ang landas nang tahasan sa iyong code sa pamamagitan ng pagturo sa executable. Minimal na halimbawa sa Pytesseract:

import pytesseract
from PIL import Image

# Ajusta esta ruta a tu instalación real en Windows
pytesseract.pytesseract.tesseract_cmd = r'C:\\Program Files\\Tesseract-OCR\\tesseract.exe'

texto = pytesseract.image_to_string(Image.open('mi_imagen.png'), lang='spa')
print(texto)

Gayundin, tiyaking available ang language pack na kailangan mo (halimbawa, spa para sa Espanyol). Kung hindi, i-install ang sinanay na data na iyon sa tamang direktoryo ng tessdata. Niresolba nito ang karamihan sa mga insidente. kapag nagsisimula sa Python.

Multilingual OCR: Mga Konsepto at Kasanayan

Sa mga proyektong may dokumentasyong multilinggwal (mga invoice, kontrata o makasaysayang archive), Pinapayagan ka ng Tesseract na pagsamahin ang mga wika upang mapabuti ang pagtuklas kapag magkakasamang nabubuhay ang magkakaibang mga teksto. Ang susi ay ang pagkakaroon ng naaangkop na .traineddata file sa loob ng tessdata.

Kapag naghalo ang nilalaman, halimbawa, Ingles, Espanyol at Pranses, maaari mong sabihin sa makina na gawin ito. isaalang-alang ang maramihang mga alpabeto at pattern nang sabay-sabayNalalapat din ito sa mas mataas na antas ng mga aklatan tulad ng IronOCR sa .NET.

Lumikha ng isang proyekto sa Visual Studio at gamitin ang Tesseract.NET

Kung nagtatrabaho ka sa kapaligiran ng Microsoft, buksan ang Visual Studio at lumikha ng isang Application ng Console (o anumang template na gusto mo). Pangalanan ang iyong proyekto, piliin ang .NET na bersyon, at sa paggawa ng iyong solusyon, handa ka nang pamahalaan ang mga pakete gamit ang NuGet.

  Mga tip sa kung paano i-Password Shield Phrase Paperwork sa PC at Mac

I-install ang Tesseract sa iyong computer (tulad ng ipinaliwanag namin) at sa loob ng proyekto idagdag ang package Tesseract o Tesseract.NET mula sa NuGet Package Manager. Ito ay nagdaragdag ng wrapper para sa pakikipag-ugnayan sa engine mula sa C#.

Ang isang halimbawa para sa pagbabasa ng isang imahe na may maraming wika ay maaaring magmukhang ganito, na nagpapahiwatig ng landas sa tessdata at ang listahan ng mga wika:

using System;
using System.Drawing;
using Tesseract;

class Program
{
    static void Main()
    {
        // Ruta a los archivos de datos de idioma (.traineddata)
        string tessDataPath = @"./tessdata";
        // Imagen a procesar
        string imagePath = @"ruta_a_tu_imagen.png";

        using (var img = Pix.LoadFromFile(imagePath))
        using (var engine = new TesseractEngine(tessDataPath, "eng+spa+fra", EngineMode.Default))
        using (var page = engine.Process(img))
        {
            string text = page.GetText();
            Console.WriteLine("Recognized Text:");
            Console.WriteLine(text);
        }
    }
}

Tiyaking umiiral ang sumusunod sa folder ng tessdata: .traineddata para sa bawat wika na iyong ipinahayag. Ang karaniwang test suite ay eng+spa+fra, ngunit maaari mo itong palawakin upang umangkop sa iyong mga pangangailangan.

IronOCR: Tesseract-based .NET library

Sa .NET ecosystem mayroong isang productivity-oriented na opsyon na tinatawag IronOCR, na umaasa sa Tesseract ngunit nag-aalok ng mataas na antas ng API, malawak na dokumentasyon, at preprocessing utility. Naka-install ito mula sa NuGet sa Visual Studio gamit ang tagahanap ng package.

Ang pangunahing paggamit nito para sa pagbabasa ng teksto ng isang imahe ay napakadirekta. Simpleng halimbawa:

using IronOcr;

var ocr = new IronTesseract();
string texto = ocr.Read(@"test-files/redacted-employmentapp.png").Text;
Console.WriteLine(texto);

Kung mas gusto mo ang higit na kontrol sa input (maraming larawan, pagsasaayos, atbp.), maaari kang bumuo ng OcrInput at ipasa ito sa makina. Halimbawa sa paggamit ng pattern:

using IronOcr;

var Ocr = new IronTesseract();
using (var Input = new OcrInput())
{
    Input.AddImage("test-files/redacted-employmentapp.png");
    var Result = Ocr.Read(Input);
    Console.WriteLine(Result.Text);
}

Ang isang pangunahing bentahe ay iyon Sinusuportahan ng IronOCR ang higit sa 120 mga wika, isinasama ang awtomatikong pag-detect at nagdaragdag ng paglilinis ng imahe, pagbabawas ng ingay, at mga tool sa pagwawasto ng artifact na, sa pagsasagawa, nagpapabuti sa katumpakan sa mahihirap na dokumento.

I-install ang IronOCR gamit ang NuGet at mga language pack

Para idagdag ito sa iyong solusyon, buksan ang Visual Studio at mag-navigate sa Tools > NuGet Package Manager > Manage Packages for Solution. Maghanap para sa "IronOCR" at piliin ang pangunahing paketeKung plano mong gumamit ng mga karagdagang wika, i-install din ang mga kinakailangang language pack.

Sa mga multilinggwal na proyekto, tandaan na ang Ingles ay karaniwang magagamit bilang default, ngunit Para sa Espanyol o Pranses dapat mong idagdag ang kanilang mga paketeMakakatipid ito ng oras sa pagtatakda ng Language property sa engine.

Pagbabasa ng Maramihang Wika gamit ang IronOCR (C#)

Ang sumusunod na halimbawa ay nagpapakita kung paano pagsamahin ang tatlong wika at iproseso ang isang imahe. Ito ay isang natural na setup kapag hindi ka sigurado kung aling wika ang nangingibabaw sa bawat dokumento:

using IronOcr;

class Program
{
    static void Main(string[] args)
    {
        var Ocr = new IronTesseract();
        Ocr.Language = OcrLanguage.English + OcrLanguage.Spanish + OcrLanguage.French;

        var inputFile = @"ruta\\a\\tu\\imagen.png";
        using (var input = new OcrInput(inputFile))
        {
            var result = Ocr.Read(input);
            Console.WriteLine("Text:");
            Console.WriteLine(result.Text);
        }
    }
}

Bilang karagdagan sa simpleng API, ang IronOCR ay namumukod-tangi para sa pagsasama preprocessing ng imahe (deskew, binarization, paglilinis ng gilid), na kadalasang nagreresulta sa mas maraming tagumpay sa mga na-scan na dokumento o mga larawan na may hindi pantay na liwanag.

Mga kalamangan at pagsasaalang-alang ng IronOCR kumpara sa "purong" Tesseract

Habang ang Tesseract ay libre at lubhang nababaluktot, nag-aalok ang IronOCR ng isang mas direktang karanasan sa .NET, na may dokumentasyon, mga halimbawa, at mga feature na handa sa negosyo. Binanggit ng mga source ng kumpanya ang katumpakan ng pagtuklas na humigit-kumulang 99,8% sa ilalim ng mainam na mga kondisyon, kasama ng suporta sa multithreading at aktibong pagpapanatili.

  Paano madaling buksan ang mga BUP file sa iyong computer

Ay din mas palakaibigan sa pagsasama (pag-setup lang, mga sample na proyekto, at magkakaugnay na mga API), na may suporta para sa higit sa 120 mga wika, kabilang ang mga kumplikado at multilingguwal na kaso sa parehong dokumento. Bilang kapalit, ang IronOCR ay pagmamay-ari at binabayaran, na may panghabambuhay na paglilisensya at 24/7 na mga opsyon sa suporta para sa mga customer.

Pinakamahuhusay na kagawian upang mapabuti ang katumpakan ng OCR

Kahit na ang makina ay matatag, ang mga resulta ay lubos na nakadepende sa kalidad ng mga larawan. Subukang gumamit ng matataas na resolution, iwasan ang ingay at mga artifact, maayos na ihanay ang dokumento at pagbutihin ang contrast. Kung nagtatrabaho ka sa mga larawan, mag-ingat sa pag-iilaw at tamang skew bago magsagawa ng OCR.

Sa "purong" Tesseract, maaaring kailanganin na gawing normal ang mga larawan o maglapat ng mga pre-filter upang makakuha ng magagandang resulta. Ang mga tool tulad ng IronOCR ay tumutulong sa pamamagitan ng pag-automate ng karamihan sa preprocessing na ito., na pinapasimple ang paghahatid ng malinis na mga teksto sa mga sitwasyong hinihingi.

Output at mga format na maaari mong buuin

Bilang karagdagan sa payak na teksto, ang Tesseract ay maaaring gumawa mga output sa HTML/hOCR o mga PDF na may mapipiling textBinubuksan nito ang pinto sa pag-index, paghahanap, at pag-highlight ng mga fragment sa loob ng mga dokumento, o pagsasama ng mga ito sa mga digital archiving workflow kung saan mahalaga ang mga kakayahan sa paghahanap.

Bilang karagdagan sa plain text, ang Tesseract ay maaaring gumawa ng HTML/hOCR na output o mga PDF na may mapipiling text, na ginagawang madali upang i-convert ang PDF sa Word at ipagpatuloy ang pag-edit.

Sa mga custom na pagsasama, magagawa mo post-process ang resulta, maglapat ng mga spell check o mga modelo ng NLP para pagyamanin ang mga entity, gawing normal ang mga numero, at maghanda ng content para sa mga database o mga tool sa pagsusuri.

Pinatnubayang Pag-install sa Windows: Mga Highlight ng Wizard

Kung gusto mo ng mabilis na checklist ng wizard: piliin ang wika ng installer, tanggapin ang lisensya ng Apache 2.0, magpasya kung para sa iyo ang pag-install o para sa lahat ng user, at iwanang aktibo ang mga inirekumendang sangkap (ScrollView, mga tool sa pagsasanay, mga shortcut at data ng wika).

Piliin ang destination folder (tandaang kopyahin ito sa Path), pangalanan ang Start menu folder kung naaangkop, at pindutin ang I-install. Kapag tapos na, patunayan gamit ang "tesseract" sa console upang matiyak na tumutugon nang tama ang lahat sa iyong device.

Pag-install gamit ang mga pre-compiled na pakete at pagpili ng mga wika

Kapag nag-download ka mula sa GitHub, makakakita ka ng ilang installer at build para sa iba't ibang arkitektura. Pumili ng 64-bit kung sinusuportahan ito ng iyong system.Sa wizard, maaari kang pumili ng mga partikular na wika; ito ay isang magandang ideya. i-install ang mga gagamitin mo (Spanish, Portuguese, French, Math, atbp.) upang maiwasan ang mga kasunod na paghahanap.

Kung kailangan mong palawakin sa ibang mga wika sa ibang pagkakataon, maaari mong idagdag ang kanilang .traineddata sa folder ng tessdata. Ang modularity ay isa sa mga malakas na punto ng engine upang umangkop sa iba't ibang mga domain.

Paano i-convert ang PDF sa Word para sa pag-edit
Kaugnay na artikulo:
I-convert ang PDF sa Word para sa pag-edit: mga online na pamamaraan, Word, at OCR