Varför detta verktyg är användbart
Återställ sökbar text från rapporter, utlåtanden och digitalt skapade dokument innan du sammanfattar, indexerar eller granskar deras innehåll.
Välj en komplett, QA-godkänd utgåva publicerad för denna webbplats.
Extrahera det inbäddade textlagret från en lokal PDF till en UTF-8-textfil utan att ladda upp dokumentet eller låtsas utföra OCR.
Klar. Dina arbetsdata finns kvar i den här webbläsaren.
Filerna stannar på den här enheten. Bearbetningen använder bara webbläsarens API:er; ingenting laddas upp till YTSave, media-API:t eller en proxy.
Återställ sökbar text från rapporter, utlåtanden och digitalt skapade dokument innan du sammanfattar, indexerar eller granskar deras innehåll.
Mozilla PDF.js läser varje sidans inbäddade textobjekt i webbläsarens minne, bevarar uttryckliga radbrytningar och stoppar vid de konfigurerade gränserna för sidor och tecken.
Välj en textbaserad PDF, bekräfta antalet läsbara sidor och tecken och ladda sedan ner en vanlig UTF-8-kopia. Skannade sidor som endast innehåller bilder genererar korrekt ingen påhittad text.
Beräkningen är deterministisk och förklarar valideringsfel istället för att tyst ändra ogiltig inmatning.
Inmatning och utmatning sker i den här fliken, medan kopiering och nedladdning sker via webbläsarens API:er utan serveruppladdning.
Varje körning rapporterar sitt verktygsläge, tidsstämpel och in-/utdatastorlek så att omvandlade data kan granskas.