Kāpēc šis rīks ir noderīgs
Atgūstiet atlasāmu tekstu no tikai attēlu paziņojumiem, vēstulēm vai arhivētiem skenējumiem, ja PDF failā nav lietojama iegultā teksta slāņa.
Izvēlieties pilnīgu, QA apstiprinātu izdevumu, kas publicēts šai vietnei.
Renderējiet līdz desmit lappusēm no skenēta PDF un secīgi atpazīstiet līdz angļu tekstu vienā vietējā OCR darbiniekā, neaugšupielādējot dokumentu.
Gatavs. Jūsu darba dati paliek šajā pārlūkprogrammā.
Faili paliek šajā ierīcē. Apstrāde izmanto tikai pārlūkprogrammas API; nekas netiek augšupielādēts YTSave, multivides API vai starpniekserverī.
Atgūstiet atlasāmu tekstu no tikai attēlu paziņojumiem, vēstulēm vai arhivētiem skenējumiem, ja PDF failā nav lietojama iegultā teksta slāņa.
Piesprausts PDF.js attēlo katru ierobežoto lapu secībā; viens piesprausts Tesseract.js darbinieks atpazīst audeklu, atbrīvo līdz un pāriet uz nākamo lapu kopējā pikseļu budžeta ietvaros.
Izvēlieties trīs lappušu skenētu vēstuli, izmantojiet 1,5× automātisko izkārtojumu, pārskatiet katru lappušu atdalītāju un ticamības kopsavilkumu, pēc tam lejupielādējiet vienu UTF-8 teksta failu.
Aprēķins ir deterministisks un paskaidro validācijas kļūdas, nevis klusi maina nederīgu ievadi.
Ievade un izvade paliek šajā cilnē. Kopēšana un lejupielāde notiek, izmantojot pārlūkprogrammas API, bez augšupielādes serverī.
Katrs palaidums ziņo savu rīka režīmu, laikspiedolu un ievades/izvades izmēru, lai pārveidotos datus varētu auditēt.