Njohja optike e karaktereve
Zgjidhja optike e karaktereve ose leximi optik i karaktereve ( OCR ) është konvertimi elektronik ose mekanik i imazheve që përmbajnë tekst të shtypur, të shkruar me dorë ose të shtypur në tekst të koduar nga makina, qoftë nga një dokument i skanuar, një foto e një dokumenti, një foto dokumenti, një foto e një skene (p.sh. tekst në tabela apo tabele reklamash në një foto peizazhi), ose nga teksti i nëntitulluar i shfaqur mbi një imazh (p.sh. gjatë një transmetimi televiziv).[1]
Përdoret gjerësisht si një formë e futjes së të dhënave nga dokumente të shtypura në letër. – si pasaporta, fatura, ekstrakte bankare, fatura të kompjuterizuara, karta biznesi, posta, të dhëna të shtypura ose çdo dokument tjetër i përshtatshëm - është një metodë e zakonshme e dixhitalizimit e teksteve të shtypura në mënyrë që ato të mund të redaktohen elektronikisht, të kërkohen, të ruhen në mënyrë më kompakte, të shfaqen në internet dhe të përdoren në procese makinerike siç janë informatika kognitive, përkthimi automatik, (nxjerrja) tekst-në-të-folur, të dhënat kyçe dhe nxjerrja e të dhënave nga teksti .OCR është një fushë kërkimore që lidhet me njohjen e modeleve, inteligjencën artificiale dhe vizionin kompjuterik .
Versionet e hershme duhej të trajnoheshin me imazhe të secilit karakter dhe dhe funksiononin me një font të vetëm. Sistemet moderne, të afta të prodhojnë saktësi të lartë për shumicën e shkronjave janë tani të zakonshme dhe dhe mbështesin një sërë formatimesh të skedarëve të imazhit.[2] Disa sisteme janë të afta të riprodhojnë daljen e formatuar duke iu afruar shumë faqes origjinale duke përfshirë imazhe, kolona dhe elementë të tjerë jo-tekstualë.
Historia
[Redakto | Redakto nëpërmjet kodit]Fillimet e njohjes optike të karaktereve mund të gjurmohen te teknologjitë e lidhura me telegrafinë dhe krijimin e pajisjeve lexuese për të verbërit.[3] Në vitin 1914, Emanuel Goldberg zhvilloi një makinë që lexonte karaktere dhe i shndërronte ato në kod telegrafik standard.[4] Njëkohësisht, Edmund Fournier d'Albe zhvilloi Optophone- in, një skaner dore që, kur lëvizte mbi një faqe të shtypur, prodhonte tinguj që korrespondonin me shkronja ose karaktere specifike.[5]
Në fund të viteve 1920 dhe në fillim te viteve 1930, Emanuel Goldberg zhvilloi atë që ai e quajti një "Makinë Statistikore" për kërkimin në arkivat e mikrofilmave duke përdorur një sistem optik njohjes së kodeve. Në vitin 1931, atij iu dha Patenta Amerikane numër 1,838,389 për këtë shpikje. Patenta u ble nga IBM .[6]
Përdoruesit me shikim të kufizuar
[Redakto | Redakto nëpërmjet kodit]Në vitin 1974, Ray Kurzweil themeloi kompaninë Kurzweil Computer Products, Inc. dhe vazhdoi zhvillimin e OCR-së shumëfontëshe, e cila mund të njihte tekst të shtypur pothuajse në çdo font. (Kurzweil shpesh vlerësohet si shpikësi i omni-font OCR, por ajo ishte tashmë në përdorim nga kompani të ndryshme, përfshirë CompuScan, në fund të viteve 1960 dhe në vitet 1970[3][7] ) Kurzweil e përdori këtë teknologji për të krijuar një makinë leximi për njerëzit e verbër, në mënyrë që një kompjuter t'u lexonte tekst me zë të lartë. Pajisja përfshinte një skaner të sheshtë të tipit CCD dhe një sintetizues tekst-në-fjalë. Më 13 janar 1976, produkti i përfunduar u prezantua në një konferencë shtypi të gjerë të drejtuar nga Kurzweil dhe udhëheqësit e Federatës Kombëtare të të Verbërve .[8] Në vitin 1978, Kurzweil Computer Products filloi të shiste një versioni komercial të programit për njohjen optike të karaktereve. LexisNexis ishte një nga klientët e parë, dhe e bleu programin për të ngarkuar dokumente ligjore dhe materiale lajmesh në bazat e saj të të dhënave online që sapo kishin filluar të zhvilloheshin. Dy vite më vonë, Kurzweil ia shiti kompaninë e tij Xerox-it, e cila më vonë e veçoi siScansoft, që më pas u bashkua me Nuance Communications .
Në vitet 2000, OCR u bë i disponueshëm në internet si një shërbim (WebOCR), në një mjedis të cloud computing, si dhe në aplikacione mobile, përfshirë përkthimin në kohë reale të shenjave në gjuhë të huaj përmes një smartphone. Me shfaqjen e smartphone-ve dhe smartglasses, OCR mund të përdoret në aplikacione mobile të lidhura me internetin që nxjerrin tekstin nga imazhet e kapura duke përdorur kamerën e pajisjes. Këto pajisje që nuk kanë funksionalitet të integruar OCR zakonisht përdorin një API OCR për të nxjerrë tekstin nga skedari i imazhit të kapur nga pajisja.[9] API-ja e OCR-it kthen tekstin e nxjerrë, së bashku me informacionin rreth vendndodhjes së tekstit të zbuluar në imazhin origjinal përsëri te aplikacioni i pajisjes për përpunim të mëtejshëm (siç është teksti në të folur) ose shfaqje.
Sisteme të ndryshme komerciale dhe me burim të hapur OCR janë të disponueshme për shumicën e sistemeve të zakonshme të shkrimit, duke përfshirë karakteret Latine, Cirilike, Arabe, Hebraike, Indiane, Bengale (Bangla), Devanagari, Tamile, Kineze, Japoneze dhe Koreane.
Aplikacionet
[Redakto | Redakto nëpërmjet kodit]Motorët e OCR-it janë zhvilluar në aplikacione softuerësh që specializohen në fusha të ndryshme, të tilla si faturat e blerjeve, faturat, çekët dhe dokumentet ligjore të faturimit.
Softueri mund të përdoret për:
- Futja e të dhënave për dokumente biznesi, p.sh. çekë, pasaporta, fatura, deklarata bankare dhe fatura
- Njohja automatike e targës
- Njohja e pasaportave dhe nxjerrja e informacionit në aeroporte
- Nxjerrja automatike e informacionit kryesor nga dokumentet e sigurimit
- Njohja e shenjave të trafikut[10]
- Nxjerrja e informacionit të kartës së biznesit në një listë kontaktesh[11]
- Krijimi i versioneve tekstuale të dokumenteve të shtypura, p.sh. skanimi i librave për Projektin Gutenberg
- Bërja e imazheve elektronike të dokumenteve të shtypura të kërkueshme, p.sh. Google Books
- Konvertimi i shkrimit të dorës në kohë reale për të kontrolluar një kompjuter ( llogaritja me stilolaps )
- Mposhtja ose testimi i qëndrueshmërisë së sistemeve anti-bot CAPTCHA, megjithëse këto janë projektuar posaçërisht për të parandaluar OCR-në.[12]
- Teknologji ndihmëse për përdoruesit e verbër dhe me shikim të kufizuar
- Shkrimi i udhëzimeve për automjetet duke identifikuar imazhet CAD në një bazë të dhënash që janë të përshtatshme për dizajnin e automjetit ndërsa ai ndryshon në kohë reale
- Duke i bërë dokumentet e skanuara të kërkueshme duke i konvertuar ato në PDF
Llojet
[Redakto | Redakto nëpërmjet kodit]- Njohja optike e karaktereve (OCR) – synon tekstin e shkruar me makinë shkrimi, një glif ose karakter në të njëjtën kohë.
- Njohja optike e fjalëve – synon tekstin e shkruar me makinë shkrimi, një fjalë në një kohë (për gjuhët që përdorin një hapësirë si ndarës fjalësh ). Zakonisht quhet thjesht "OCR".
- Njohja inteligjente e karaktereve (ICR) – gjithashtu synon tekstin e shkruar me dorë të shtypur ose tekstin kursiv, një glif ose karakter në të njëjtën kohë, zakonisht duke përfshirë të mësuarit automatik .
- Njohja inteligjente e fjalëve (IWR) – gjithashtu synon tekstin e shkruar me dorë ose tekstin kursiv, një fjalë në të njëjtën kohë. Kjo është veçanërisht e dobishme për gjuhët ku glifet nuk janë të ndara në shkrimin kursiv.
OCR zakonisht është një proces offline, i cili analizon një dokument statik. Ekzistojnë gjithashtu shërbime bazuar në cloud të cilat ofrojnë një shërbim online OCR API. Analiza e lëvizjes së shkrimit të dorës mund të përdoret si input për njohjen e shkrimit me dorë .[13] Në vend që të përdorë vetëm format e glifeve dhe fjalëve, kjo teknikë është në gjendje të kapë lëvizjen, si p.sh. rendin në të cilin vizatohen segmentet, drejtimin, dhe mënyrën e vendosjes dhe ngritjes së stilolapsit. Ky informacion shtesë mund ta bëjë procesin më të saktë. Kjo teknologji njihet gjithashtu si "njohje e karaktereve online", "njohje dinamike e karaktereve", "njohje e karaktereve në kohë reale" dhe "njohje inteligjente e karaktereve".
Teknikat
[Redakto | Redakto nëpërmjet kodit]Para-përpunim
[Redakto | Redakto nëpërmjet kodit]Softueri OCR shpesh i nënshtrohet parapërpunimit imazhet për të përmirësuar mundësinë e një njohjeje të suksesshme. Teknikat përfshijnë:[14]
- Heqja e shtrembërimit – Nëse dokumenti nuk ishte i pozicionuar si duhet gjatë skanimit, mund të jetë e nevojshme të anohet disa gradë në drejtim të akrepave të orës ose në drejtim të kundër të akrepave të orës në mënyrë që rreshtat e tekstit të jenë plotësisht horizontalë ose vertikalë.
- Zbutje e njollave – heqja e njollave pozitive dhe negative, zbutja e skajeve
- Binarizimi – konvertimi i një imazhi nga ngjyra ose gri në të zezë e të bardhë (i quajtur imazh binar sepse ka dy ngjyra). Detyra kryhet si një mënyrë e thjeshtë për të ndarë tekstin (ose çdo përbërës tjetër të dëshiruar të imazhit) nga sfondi.[15] Detyra e binarizimit është e nevojshme pasi shumica e algoritmeve të njohjes komerciale punojnë vetëm në imazhe binare, pasi është më e thjeshtë për ta bërë këtë.[16] Përveç kësaj, efektiviteti i binarizimit ndikon në një masë të konsiderueshme në cilësinë e njohjes së karaktereve, dhe merren vendime të kujdesshme në zgjedhjen e binarizimit të përdorur për një lloj të caktuar të imazhit hyrës; pasi cilësia e metodës së përdorur për të marrë rezultatin binar varet nga lloji i imazhit (dokument i skanuar, imazh teksti i skenës, dokument historik i degraduar, etj.).[17][18]
- Heqja e vijës – Pastrimi i kutive dhe vijave jo-glifike
- Analiza e rënditjes ose zonimi – Identifikimi i kolonave, paragrafëve, mbishkrimeve etj., si blloqe të dallueshme. Veçanërisht i rëndësishëm në paraqitjet dhe tabelat me shumë kolona .
- Zbulimi i rreshtave dhe fjalëve – Vendosja e një linje bazë për format e fjalëve dhe të karaktereve, duke i ndarë fjalët sipas nevojës.
- Njohja e skriptit – Në dokumentet shumëgjuhëshe, shkrimi mund të ndryshojë në nivelin e fjalëve dhe për këtë arsye, identifikimi i shkrimit është i nevojshëm, përpara se të aktivizohet OCR-ja e duhur për të trajtuar shkrimin specifik.[19]
- Izolimi ose segmentimi i personazheve – Për OCR-në për karakter, karakteret e shumta që janë të lidhura për shkak të artefakteve të imazhit duhet të ndahen; karakteret e vetme që janë të ndara në pjesë të shumta për shkak të artefakteve duhet të lidhen.
- Normalizimi i raportit të aspektit dhe shkallës[20]
Segmentimi i fonteve me gjerësi fikse realizohet në mënyre relativisht të thjeshtë duke e rreshtuar imazhin me një rrjet uniforme bazuar në vendet ku vijat vertikale të rrjetit kanë më pak gjasa të kryqëzohen me zona të zeza. Për fontet proporcionale, nevojiten teknika më të sofistikuara sepse hapësira e bardhë midis shkronjave ndonjëherë mund të jetë më e madhe se ajo midis fjalëve, dhe vijat vertikale mund të ndërpriten me më shumë se një karakter.[21]
Njohja e tekstit
[Redakto | Redakto nëpërmjet kodit]Ekzistojnë dy lloje bazë të algoritmeve kryesore të OCR-it, të cilët mund të prodhojnë një listë të renditur të karaktereve kandidat.[22]
- Përputhja e matricës përfshin krahasimin e një imazhi me një glif të ruajtur në bazë piksel-për-piksel; njihet edhe si përputhje modeli, njohje modeli ose korrelacion imazhi . Kjo varet nga izolimi i saktë i glifit hyrës nga pjesa tjetër e imazhit, dhe në faktin që glifi i ruajtur është në një font të ngjashëm dhe në të njëjtën shkallë. Kjo teknikë funksionon më së miri me tekstin e shkruar me makinë shkrimi dhe nuk funksionon mirë kur hasen fonte të reja. Kjo është teknika që OCR-ja e hershme fizike e bazuar në fotoqeliza zbatohet, mjaft drejtpërdrejt.
- Nxjerrja e karakteristikave i zbërthen glifet në "karakteristika" si vija, cikle të mbyllura, drejtimi i vijës, dhe kryqëzimet e vijave. Karakteristikat e nxjerrjes zvogëlojnë dimensionalitetin e përfaqësimit dhe e bëjnë procesin e njohjes më efikas nga ana llogaritëse.. Këto karakteristika krahasohen me një përfaqësim abstrakt vektorial të një karakteri, i cili mund të reduktohet në një ose më shumë prototipa glifesh. Teknikat e përgjithshme të zbulimit të karakteristikave në vizionin kompjuterik janë të zbatueshme për këtë lloj OCR-je, e cila shihet zakonisht në njohjen "inteligjente" të shkrimit të dorës dhe në shumicën e softuerëve modernë OCR.[23] Klasifikuesit e fqinjëve më të afërt, siç është algoritmi k-fqinjë më të afërt, përdoren për të krahasuar karakteristikat e imazhit me karakteristikat e ruajtura të glifeve dhe për të zgjedhur përputhjen më të afërt.[24]
Softuerët të tillë si Cuneiform dhe Tesseract përdorin një qasje dy-fazore për njohjen e karaktereve. Faza e dytë njihet si njohje adaptive dhe përdor format e shkronjave të njohura me besim të lartë gjatë fazës së parë për të njohur më mirë shkronjat e mbetura në fazën e dytë. Kjo është e dobishme për fonte jo të zakonshme ose për skanime me cilësi të ulët ku fonti është i shtrembëruar (p.sh. i paqartë ose i zbehur).[21]
Që prej dhjetor 2016[përditëso][[Kategoria:Artikuj që përmbajnë deklarata potencialisht të vjetruara nga Gabim shprehjeje: Operator i papritur <]], softueri modern i OCR përfshinGoogle Docs OCR, ABBYY FineReader, dhe Transym.[23] Të tjerët si OCRopus dhe Tesseract përdorin rrjete nervore të cilat trajnohen për të njohur rreshta të tërë teksti në vend që të përqendrohen në karaktere të vetme.
Një teknikë e njohur si OCR përsëritëse e pret automatikisht një dokument në seksione bazuar në formatin e faqes.Më pas, OCR kryhet në secilën seksion individualisht duke përdorur variabla të ndryshueshme të nivelit të besimit të karaktereve për të maksimizuar saktësinë e OCR-it në nivel faqeje.Për këtë metodë është lëshuar një patentë nga Zyra e Patentave të Shteteve të Bashkuara.[25]
Rezultati i OCR-it mund të ruhet në formati standardizuar ALTO, një skemë XML e dedikuar që administrohet nga Biblioteka e Kongresit të Shteteve të Bashkuara. Formatet e tjera të zakonshme përfshijnë hOCR dhe PAGE XML .
Për një listë të softuerëve për njohjen optike të karaktereve, shihni Krahasimin e softuerëve për njohjen optike të karaktereve .
Përpunimi pasues
[Redakto | Redakto nëpërmjet kodit]Saktësia e OCR-it mund të rritet nëse rezultati kufizohet nga një leksikon – një listë fjalësh që lejohen të shfaqen në një dokument.[14] Kjo mund të jetë, për shembull, të gjitha fjalët në gjuhën angleze, ose një leksikon më teknik për një fushë specifike. Kjo teknikë mund të paraqes probleme nëse dokumenti përmban fjalë që nuk gjenden në leksikon, si emrat e veçantë . Tesseract përdor fjalorin e tij për të ndikuar në hapin e segmentimit të karaktereve, duke përmirësuar saktësinë.[21]
Rrjedha e daljes mund të jetë një rrjedhë ose skedar teksti i thjeshtë i karaktereve, por sistemet më të sofistikuara OCR-it mund të ruajnë strukturën origjinale të faqes dhe të prodhojnë, për shembull, një PDF të anotuar që përfshin si imazhin origjinal të faqes ashtu edhe një përfaqësim tekstual të kërkueshëm.
Analiza e fqinjëve të afërt mund të përdorë frekuencat e bashkë-përdorimit për të korrigjuar gabimet, duke vënë re se disa fjalë shpesh shfaqen së bashku.[26] Për shembull, "Washington, DC" është zakonisht shumë më e zakonshme në anglisht sesa "Washington DOC".
Njohja e gramatikës së gjuhës që po skanohet mund të ndihmojë gjithashtu në përcaktimin nëse një fjalë është më e mundshme të jetë një folje apo një emër, për shembull, duke mundësuar kështu një saktësi më të madhe.
Algoritmi i Distancës Levenshtein është përdorur gjithashtu në pas-përpunimin e OCR-it për të optimizuar më tej rezultatet nga një OCR API.[27]
Optimizime specifike për aplikacionin
[Redakto | Redakto nëpërmjet kodit]Në vitet e fundit,ofruesit kryesorë të teknologjisë OCR filluan të modifikojnë sistemet OCR për të përpunuar më në mënyrë efikase lloje të caktuara të të dhënave hyrëse. Përveç një leksikoni specifik për aplikacionin, performanca më e mirë mund të përmirësohet duke marrë parasysh rregullat e biznesit, shprehjet standarde, ose informacionin e pasur të përmbajtur në imazhe me ngjyra. Kjo strategji quhet "OCR e Orientuar nga Aplikacioni" ose "OCR e Personalizuar" dhe është aplikuar në OCR të targa automjetesh, faturave, pamjeve të ekranit, kartave të identitetit, patentave të drejtimit dhe prodhimit të automjeteve .
The New York Times ka përshtatur teknologjinë OCR në një mjet pronësor të quajtur Document Helper, që i mundëson ekipit të tyre interaktiv të lajmeve të përshpejtojë përpunimin e dokumenteve që duhet të rishikohen. Ata vërejnë se kjo u mundëson atyre të përpunojnë deri në 5,400 faqe në orë në përgatitje për gazetarët që të rishikojnë përmbajtjen.[28]
Zgjidhje alternative
[Redakto | Redakto nëpërmjet kodit]Ekzistojnë disa teknika për të zgjidhur problemin e njohjes së karaktereve duke përdorur mënyra të tjera përveç algoritmeve të përmirësuara të OCR-së.
Detyrimi i të dhënave më të mira
[Redakto | Redakto nëpërmjet kodit]Fonte të veçanta si OCR-A, OCR-B ose MICR, me përmasa, hapësira dhe forma karakteresh të përcaktuara saktësisht, lejojnë një shkallë më të lartë saktësie gjatë transkriptimit në përpunimin e çekëve bankarë. Disa motorë të njohur OCR janë dizajnuar për të kapur tekst në fontet e njohura si Arial ose Times New Roman, dhe nuk janë në gjendje të kapin tekst në këto fonte të specializuara që janë shumë të ndryshme nga fontet e përdorura zakonisht. Për shkak se Google Tesseract mund të trajnohet për të njohur fonta të reja, ai mund të njohë edhe fontet OCR-A, OCR-B dhe MICR.[29]
Kuti të segmentuara janë kuti të shtypura paraprakisht që nxisin njerëzit të shkruajnë më qartë – një glifë për çdo kuti.[26] Ato shpesh shtypen me një ngjyrë të zbehtë e cila mund të hiqet lehtësisht nga sistemi OCR.[26]
Palm OS përdorte një grup të veçantë glifesh, të njohur si Graffiti, të ngjashme me shkronjat angleze të shtypura, por të thjeshtuara ose të modifikuara për t’u njohur më lehtë nga hardueri i kufizuar i platformës. Përdoruesit duhej të mësonin mënyrën e shkrimit të këtyre glifeve.
OCR-ja e bazuar në zonë e kufizon imazhin në një pjesë të caktuar të një dokumentit. Kjo shpesh quhet OCR me shabllonit .
Crowdsourcing
[Redakto | Redakto nëpërmjet kodit]Crowdsourcing-u i njerëzve për të kryer njohjen e karaktereve mund të përpunojë shpejt imazhet, ashtu si OCR i drejtuar nga kompjuteri, por me saktësi më të lartë në njohjen e imazheve sesa ajo që arrihet përmes kompjuterëve. Sistemet praktike përfshijnë Amazon Mechanical Turk dhe reCAPTCHA . Biblioteka Kombëtare e Finlandës ka zhvilluar një ndërfaqe online ku përdoruesit mund të korrigjojnë tekstet e OCR në formatin standardizuar ALTO.[30] Crowdsourcing-u është përdorur gjithashtu jo për të kryer drejtpërdrejt njohjen e karaktereve, por për të ftuar zhvillues të softuerëve të krijojnë algoritme të përpunimit të imazhit, për shembull, përmes përdorimit të turneve të renditjes .[31]
Saktësia
[Redakto | Redakto nëpërmjet kodit]
[[Skeda:Google_Ngrams_(English_2012)_ocurrence_of_laft_and_last.png|parapamje|Ndodhja e fjalëve laft dhe last në bazën e të dhënave n-gram të Google, bazuar në skanimet OCR për korpusin "English 2012"[32][33]
Njohja e tekstit të daktilografuar me alfabet latin, ende nuk është 100% e saktë edhe kur imazhet janë të qarta. Një studim i bazuar në njohjen e faqeve të gazetave të shekullit të 19-të dhe fillimit të shekullit të 20-të arriti në përfundimin se saktësia e OCR-së karakter për karakter nga softuerët komercialë OCR varionte nga 81% në 99%;[34] saktësia e plotë mund të arrihet përmes rishikimit njerëzor ose Verifikimit me Fjalor të të Dhënave. Fusha të tjera – përfshirë njohjen e shkrimit me dorë në formë shtypi, shkrimit kursiv dhe tekstit të shtypur në alfabete të tjera (sidomos gjuhët e Azisë Lindore të cilat kanë shumë vija për një karakter të vetëm) – ende janë objekt hulumtimi aktiv. Baza e të dhënave MNIST përdoret zakonisht për testimin e aftësisë së sistemeve për të testuar aftësinë e sistemeve për të njohur shifrat e shkruara me dorë.
Shkallët e saktësisë mund të maten në disa mënyra, dhe mënyra se si maten mund të ndikojë shumë në shkallën e raportuar të saktësisë. Për shembull, nëse konteksti i fjalës (një leksikon fjalësh) nuk përdoret për të korrigjuar softuerin kur ai gjen fjalë që nuk ekzistojnë, një normë gabimi prej 1% në karaktere (99% saktësi) mund të rezultojë në një normë gabimi prej 5% ose më keq, nëse matja bazohet në faktin nëse çdo fjalë e plotë është njohur pa letra të pasakta. Përdorimi i një grupi të dhënash mjaftueshëm të madh është i rëndësishëm në zgjidhjet e njohjes së shkrimit me dorë të bazuara në rrjete neuronale. Nga ana tjetër, krijimi i prodhimit të grupeve të të dhënave natyrore është shumë i ndërlikuar dhe kërkon shumë kohë.[35]
Një shembull i vështirësive të natyrshme në digjitalizimin e teksteve të vjetra është pamundësia e OCR-it për të dalluar midis karaktereve " s të gjata " dhe shkronjës "f".[36][32]
Sistemet OCR të bazuara në internet për të njohur shkrimin me dorë në kohë reale janë bërë të njohura si produkte komerciale vitet e fundit. (shih historinë e Tablet PC-ve ). Shkalla e saktësisë prej 80% deri në 90% për karaktere të shkruara me dorë në mënyrë të pastër dhe të rregullt, por edhe kjo shkallë saktësie përkthehet në dhjetëra gabime për faqe, duke e bërë teknologjinë të përdorshme vetëm në aplikacione shumë të kufizuara. [ nevojitet citim ]
Njohja e tekstit kursiv është një fushë kërkimi ende aktive, me shkallë saktësie edhe më të ulët sesa ajo e shkrimit me dorë të shtypur. Shkallë më të larta njohjeje për shkrimin e përgjithshëm kursiv me shumë gjasë nuk do të jenë të mundshme pa përdorimin e informacionit kontekstual ose gramatikor. Për shembull, njohja e fjalëve të plota nga një fjalor është më e lehtë sesa përpjekja për të analizuar karakteret individualë nga shkrimi kursiv. Leximi i rreshtit të shumës në një çek (i cili gjithmonë shkruhet si numër me fjalë) është një shembull ku përdorimi i një fjalori më të vogël mund të rrisë ndjeshëm shkallën e njohjes. Forma e karaktereve individuale kursive thjesht nuk përmbanë mjaftueshëm informacion për të njohur me saktësi (më shumë se 98%) gjithë shkrimin e dorës kursiv. [ nevojitet citim ]
Shumica e programeve lejojnë përdoruesit të vendosin "shkallët e besueshmërisë". Kjo do të thotë se nëse softueri nuk arrin nivelin e dëshiruar të saktësisë, përdoruesi mund të njoftohet për rishikim manual.
Një gabim i shkaktuar nga skanimi OCR në disa raste quhet skanim (nga një analogji me termi “typo” ).[37]
Unicode
[Redakto | Redakto nëpërmjet kodit]Karakteret për të mbështetjem e OCR-it u shtuan në Standardin Unicode në qershor 1993, me publikimin e versionit 1.1.
Disa nga këto karaktere janë të lidhura me fontet specifike për MICR, OCR-A ose OCR-B . Stampa:Unicode chart Optical Character Recognition
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- 1 2 Schantz, Herbert F. (1982). The history of OCR, optical character recognition (në anglisht). [Manchester Center, Vt.]: Recognition Technologies Users Association. ISBN 9780943072012.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- ↑ "Emanuel Goldberg, Electronic Document Retrieval, And Vannevar Bush's Memex". people.ischool.berkeley.edu (në anglisht). Marrë më 2025-12-09.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- ↑ "Kurzweil Computer Products". www.kurzweiltech.com (në anglisht). Marrë më 2025-12-09.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- ↑ Zeng, Qing-An (2015). Wireless Communications, Networking and Applications: Proceedings of WCNA 2014 (në anglisht). Springer. ISBN 978-81-322-2580-5.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- 1 2 "Optical Character Recognition (OCR) – How it works" (në anglisht). Nicomsoft.com. Marrë më 2013-06-16.
- ↑ Sezgin, Mehmet; Sankur, Bulent (2004). "Survey over image thresholding techniques and quantitative performance evaluation" (PDF). Journal of Electronic Imaging (në anglisht). 13 (1): 146. Bibcode:2004JEI....13..146S. doi:10.1117/1.1631315. Arkivuar nga origjinali (PDF) më 16 tetor 2015. Marrë më 2 maj 2015.
- ↑ Gupta, Maya R.; Jacobson, Nathaniel P.; Garcia, Eric K. (2007). "OCR binarisation and image pre-processing for searching historical documents" (PDF). Pattern Recognition (në anglisht). 40 (2): 389. Bibcode:2007PatRe..40..389G. doi:10.1016/j.patcog.2006.04.043. Arkivuar nga origjinali (PDF) më 16 tetor 2015. Marrë më 2 maj 2015.
- ↑ Trier, Oeivind Due; Jain, Anil K. (1995). "Goal-directed evaluation of binarisation methods" (PDF). IEEE Transactions on Pattern Analysis and Machine Intelligence (në anglisht). 17 (12): 1191–1201. doi:10.1109/34.476511. Arkivuar (PDF) nga origjinali më 2015-10-16. Marrë më 2 maj 2015.
- ↑ Milyaev, Sergey; Barinova, Olga; Novikova, Tatiana; Kohli, Pushmeet; Lempitsky, Victor (2013). "Image Binarization for End-to-End Text Understanding in Natural Images". 2013 12th International Conference on Document Analysis and Recognition (PDF) (në anglisht). fq. 128–132. doi:10.1109/ICDAR.2013.33. ISBN 978-0-7695-4999-6. Arkivuar (PDF) nga origjinali më 2017-11-13. Marrë më 2 maj 2015.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- 1 2 3 Smith, Ray (2007). "An Overview of the Tesseract OCR Engine" (PDF) (në anglisht). Arkivuar nga origjinali (PDF) më 28 shtator 2010. Marrë më 2013-05-23.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- 1 2 "How OCR Software Works" (në anglisht). OCRWizard. Arkivuar nga origjinali më 16 gusht 2009. Marrë më 2013-06-16.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- 1 2 3 Woodford, Chris (2012-01-30). "How does OCR document scanning work?" (në anglisht). Explain that Stuff. Marrë më 2013-06-16.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- 1 2 "Google Books Ngram Viewer". books.google.com (në anglisht). Marrë më 2023-07-20.
When we generated the original Ngram Viewer corpora in 2009, our OCR wasn't as good […]. This was especially obvious in pre-19th century English, where the long s
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
- ↑ "OCR Document". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 15 prill 2016.
Referime
[Redakto | Redakto nëpërmjet kodit]- Unicode OCR – Diapazoni Heksadecimal: 2440-245F Njohja Optike e Karaktereve në Unicode
- Bibliografi e shënuar e referencave për njohjen e karaktereve të shkrimit të dorës dhe informatikën me stilolaps
Stampa:OCRStampa:Natural Language ProcessingStampa:Computer vision footer
Shih edhe
- Efekti i Inteligjencës Artificiale
- Aplikimet e Inteligjencës Artificiale
- Krahasimi i softuerëve të njohjes optike të karaktereve
- Linguistika Kompjuterike
- Bibliotekë Dixhitale
- Zyrë Postare Dixhitale
- Stilolaps Dixhital
- eScriptorium
- Arkiv Institucional
- Lexueshmëri
- Lista e Teknologjive të Reja dhe në Zhvillim
- Zgjidhja për Njohjen e Karaktereve me Ink të Drejtpërdrejtë
- Njohja e Karaktereve me Ink Magnetik
- Njohja Optike e Muzikës
- OCR në Gjuhët Indiane
- Njohja Optike e Shenjave
- Korniza e AI
- Njohja e Skicave
- Njohja e të Folurit
- Tesseract OCR engine
- Regjistrimi i Zërit
Referencat
- 1. "OCR Document". Haven OnDemand. Arkivuar nga origjinali më 15 prill 2016.
- 2. "Supported Media Formats". Haven OnDemand (në anglisht). Arkivuar nga origjinali më 19 prill 2016.
- 3. Schantz, Herbert F. (1982). The history of OCR, optical character recognition (në anglisht). [Manchester Center, Vt.]: Recognition Technologies Users Association. ISBN 9780943072012.
- 4. Dhavale, Sunita Vikrant (2017). Advanced Image-Based Spam Detection and Filtering Techniques (në anglisht). Hershey, PA: IGI Global. fq. 91. ISBN 9781683180142.
- 5. d'Albe, E. E. F. (1 korrik 1914). "On a Type-Reading Optophone". Proceedings of the Royal Society A: Mathematical, Physical and Engineering Sciences (në anglisht). 90 (619): 373–375. Bibcode:1914RSPSA..90..373D. doi:10.1098/rspa.1914.0061.
- 6. "The History of OCR". Data Processing Magazine (në anglisht). 12: 46. 1970.
- 7. "Extracting text from images using OCR on Android" (në anglisht). 27 qershor 2015. Arkivuar nga origjinali më 15 mars 2016.
- 8. "[Tutorial] OCR on Google Glass" (në anglisht). 23 tetor 2014. Arkivuar nga origjinali më 5 mars 2016.
- 9. Zeng, Qing-An (2015). Wireless Communications, Networking and Applications: Proceedings of WCNA 2014 (në anglisht). Springer. ISBN 978-81-322-2580-5.
- 10. "[javascript] Using OCR and Entity Extraction for LinkedIn Company Lookup" (në anglisht). 22 korrik 2014. Arkivuar nga origjinali më 17 prill 2016.
- 11. "How To Crack Captchas" (në anglisht). andrewt.net. 2006-06-28. Marrë më 2013-06-16.
- 12. "Breaking a Visual CAPTCHA" (në anglisht). Cs.sfu.ca. 2002-12-10. Marrë më 2013-06-16.
- 13. Resig, John (2009-01-23). "John Resig – OCR and Neural Nets in JavaScript" (në anglisht). Ejohn.org. Marrë më 2013-06-16.
- 14. Tappert, C. C.; Suen, C. Y.; Wakahara, T. (1990). "The state of the art in online handwriting recognition". IEEE Transactions on Pattern Analysis and Machine Intelligence (në anglisht). 12 (8): 787. doi:10.1109/34.57669. S2CID 42920826.
- 15. "Optical Character Recognition (OCR) – How it works" (në anglisht). Nicomsoft.com. Marrë më 2013-06-16.
- 16. Sezgin, Mehmet; Sankur, Bulent (2004). "Survey over image thresholding techniques and quantitative performance evaluation" (PDF). Journal of Electronic Imaging (në anglisht). 13 (1): 146. Bibcode:2004JEI....13..146S. doi:10.1117/1.1631315. Arkivuar nga origjinali (PDF) më 16 tetor 2015. Marrë më 2 maj 2015.
- 17. Gupta, Maya R.; Jacobson, Nathaniel P.; Garcia, Eric K. (2007). "OCR binarisation and image pre-processing for searching historical documents" (PDF). Pattern Recognition (në anglisht). 40 (2): 389. Bibcode:2007PatRe..40..389G. doi:10.1016/j.patcog.2006.04.043. Arkivuar nga origjinali (PDF) më 16 tetor 2015. Marrë më 2 maj 2015.
- 18. Trier, Oeivind Due; Jain, Anil K. (1995). "Goal-directed evaluation of binarisation methods" (PDF). IEEE Transactions on Pattern Analysis and Machine Intelligence (në anglisht). 17 (12): 1191–1201. doi:10.1109/34.476511. Arkivuar (PDF) nga origjinali më 2015-10-16. Marrë më 2 maj 2015.
- 19. Milyaev, Sergey; Barinova, Olga; Novikova, Tatiana; Kohli, Pushmeet; Lempitsky, Victor (2013). "Image Binarization for End-to-End Text Understanding in Natural Images". 2013 12th International Conference on Document Analysis and Recognition (PDF) (në anglisht). fq. 128–132. doi:10.1109/ICDAR.2013.33. ISBN 978-0-7695-4999-6. S2CID 8947361. Arkivuar (PDF) nga origjinali më 2017-11-13. Marrë më 2 maj 2015.
- 20. Pati, P.B.; Ramakrishnan, A.G. (1987-05-29). "Word Level Multi-script Identification". Pattern Recognition Letters (në anglisht). 29 (9): 1218–1229. Bibcode:2008PaReL..29.1218P. doi:10.1016/j.patrec.2008.01.027.
- 21. "Basic OCR in OpenCV | Damiles" (në anglisht). Blog.damiles.com. 2008-11-20. Marrë më 2013-06-16.
- 22. Smith, Ray (2007). "An Overview of the Tesseract OCR Engine" (PDF) (në anglisht). Arkivuar nga origjinali (PDF) më 28 shtator 2010. Marrë më 2013-05-23.
- 23. "OCR Introduction" (në anglisht). Dataid.com. Marrë më 2013-06-16.
- 24. "How OCR Software Works" (në anglisht). OCRWizard. Arkivuar nga origjinali më 16 gusht 2009. Marrë më 2013-06-16.
- 25. "The basic pattern recognition and classification with openCV | Damiles" (në anglisht). Blog.damiles.com. 2008-11-14. Marrë më 2013-06-16.
- 26. Assefi, Mehdi (dhjetor 2016). "OCR as a Service: An Experimental Evaluation of Google Docs OCR, Tesseract, ABBYY FineReader, and Transym". ResearchGate (në anglisht).
- 27. "How the Best OCR Technology Captures 99.91% of Data". www.bisok.com (në anglisht). Marrë më 2021-05-27.
- 28. Woodford, Chris (2012-01-30). "How does OCR document scanning work?" (në anglisht). Explain that Stuff. Marrë më 2013-06-16.
- 29. "How to optimize results from the OCR API when extracting text from an image? - Haven OnDemand Developer Community" (në anglisht). Arkivuar nga origjinali më 22 mars 2016.
- 30. Fehr, Tiff (2019-03-26). "How We Sped Through 900 Pages of Cohen Documents in Under 10 Minutes". The New York Times (në anglishte amerikane). ISSN 0362-4331. Marrë më 2023-06-16.
- 31. "Train Your Tesseract". Train Your Tesseract (në anglisht). 20 shtator 2018. Marrë më 20 shtator 2018.
- 32. "What is the point of an online interactive OCR text editor? - Fenno-Ugrica" (në anglisht). 2014-02-21.
- 33. Riedl, C.; Zanibbi, R.; Hearst, M. A.; Zhu, S.; Menietti, M.; Crusan, J.; Metelsky, I.; Lakhani, K. (20 shkurt 2016). "Detecting Figures and Part Labels in Patents: Competition-Based Development of Image Processing Algorithms". International Journal on Document Analysis and Recognition (në anglisht). 19 (2): 155. arXiv:1410.6751. doi:10.1007/s10032-016-0260-8. S2CID 11873638.
- 34. "Google Books Ngram Viewer". books.google.com (në anglisht). Marrë më 2023-07-20.
When we generated the original Ngram Viewer corpora in 2009, our OCR wasn't as good […]. This was especially obvious in pre-19th century English, where the elongated medial-s (ſ) was often interpreted as an f, […]. Here's evidence of the improvements we've made since then, using the corpus operator to compare the 2009, 2012 and 2019 versions […]
- 35. "Code and Data to evaluate OCR accuracy, originally from UNLV/ISRI" (në anglisht). Google Code Archive.
- 36. Holley, Rose (prill 2009). "How Good Can It Get? Analysing and Improving OCR Accuracy in Large Scale Historic Newspaper Digitisation Programs" (në anglisht). D-Lib Magazine. Marrë më 5 janar 2014.
- 37. Suen, C.Y.; Plamondon, R.; Tappert, A.; Thomassen, A.; Ward, J.R.; Yamamoto, K. (1987-05-29). Future Challenges in Handwriting and Computer Applications. 3rd International Symposium on Handwriting and Computer Applications, Montreal, May 29, 1987 (në anglisht). Marrë më 2008-10-03.
- 38. Mohseni, Maedeh Haji Agha; Azmi, Reza; Layeghi, Kamran; Maleki, Sajad (2019). Comparison of Synthesized and Natural Datasets in Neural Network Based Handwriting Solutions (në anglisht). ITCT. Arkivuar nga origjinali më 6 mars 2025. Marrë më 9 dhjetor 2025 – nëpërmjet Civilica.
- 39. Kapidakis, Sarantos; Mazurek, Cezary; Werla, Marcin (2015). Research and Advanced Technology for Digital Libraries (PDF) (në anglisht). Springer. fq. 257. doi:10.1007/978-3-319-24592-8. ISBN 9783319245928. Arkivuar nga origjinali më 3 nëntor 2025.
- 40. Atkinson, Kristine H. (2015). "Reinventing nonpatent literature for pharmaceutical patenting". Pharmaceutical Patent Analyst (në anglisht). 4 (5): 371–375. doi:10.4155/ppa.15.21. PMID 26389649.
- 41. "scanno". Hoopoes (në anglisht). maj 2001.