+420 724 079 792 [email protected]

Jak OCR převede obrázek dokumentu na prohledávatelný text

Optické rozpoznávání textu je klíčová část digitalizace. Bez OCR máte pouze obrázky dokumentů. S OCR máte prohledávatelný archiv.

Co je OCR a proč na tom záleží

Skenování dokumentu vytvoří obrázek. Obrázek vypadá jako dokument, ale počítač v něm nevidí text, jen pixely. Nemůžete v něm nic vyhledat, zkopírovat ani automaticky zpracovat.

OCR, neboli optické rozpoznávání znaků, analyzuje obrázek a identifikuje v něm jednotlivá písmena, čísla a interpunkci. Výsledný text se uloží jako neviditelná vrstva pod obrázkem v PDF souboru.

Výsledek vypadá přesně jako původní dokument, ale text v něm je prohledávatelný. Hledáte fakturu od konkrétního dodavatele z roku 2019? Napíšete název a archiv vám ji najde za sekundu.

Obrázek dokumentu
Pixely, žádný text
OCR zpracování
Analýza znaků
Prohledávatelné PDF
Plný text dostupný

Co OCR zpracování zahrnuje

Vícejazyčné rozpoznávání

Zpracujeme dokumenty v češtině, slovenštině, němčině a angličtině. Systém rozpozná jazyk automaticky nebo jej nastavíme ručně pro lepší přesnost.

Tabulky a struktury

OCR rozpoznává nejen plynulý text, ale i tabulkové struktury. Faktury s řádkovými položkami, tabulky v smlouvách nebo technické specifikace.

Různé typy písma

Moderní OCR engine zvládne strojový tisk, tiskací písmo i různé fonty. Ručně psaný text je obtížnější, informujeme vás o reálné přesnosti u konkrétních dokumentů.

Fulltextové vyhledávání

Po OCR zpracování lze v archívu vyhledávat přes všechny dokumenty najednou. Jedno klíčové slovo, číslo faktury nebo jméno dodavatele najde relevantní dokumenty okamžitě.

Detailní záběr na OCR rozpoznávání textu z naskenovaného dokumentu na monitoru

Co ovlivňuje kvalitu OCR

OCR není magický proces. Kvalita výstupu závisí na několika faktorech, které vám předem vysvětlíme.

Stav originálu

Čistý, nepoškozený dokument dává nejlepší výsledky. Zvrásnělé, vybledlé nebo poškozené dokumenty mohou mít nižší přesnost rozpoznávání.

Rozlišení skenu

Proto skenujeme v dostatečném rozlišení. Nízké DPI je nejčastější příčinou špatného OCR, i když originál je v pořádku.

Typ textu

Strojový tisk je pro OCR nejjednodušší. Ručně psaný text, zejména kurzíva, je technicky náročnější a přesnost bývá nižší.

Chcete vyzkoušet OCR na vzorku vašich dokumentů?

Pošlete nám pár stránek a ukážeme vám, jak bude výsledek vypadat.