mousePDF · PDF-tekstgenkendelse (OCR)
pdf ocr · tekstgenkendelse · uden upload

PDF-tekstgenkendelse (OCR) — uden upload

Læg et usynligt, søgbart tekstlag over skannede eller billedbaserede PDF-sider. Genkendelsen kører helt i din browser, din fil bliver aldrig uploadet.

✓ Intet bliver uploadet ✓ Helt gratis ✓ Ingen konto
Annonce
Skærmbillede af mousePDF-editoren
sådan gør du

I tre trin

01

Åbn en PDF

Træk en skannet eller billedbaseret PDF ind i vinduet, eller vælg den.

02

Vælg sprog & omfang

Fastlæg genkendelsessproget, og bestem om kun den aktuelle side eller hele dokumentet skal genkendes.

03

Eksportér

Gem PDF med søgbart, usynligt tekstlag — sidebilledet forbliver visuelt uændret.

Typisk tilfælde: gøre skannede dokumenter søgbare

Skannede kontrakter, fakturaer eller bøger indeholder ofte kun et sidebillede, ingen ægte tekst — man kan hverken søge i dem eller kopiere tekst. mousePDF genkender teksten lokalt i browseren og lægger den usynligt over billedet, så søgning og kopiering fungerer, uden at sidens udseende ændrer sig.

Annonce

Tekstgenkendelse i browseren — og hvad der er særligt ved det

OCR hører til de opgaver, hvor man ellers næsten uundgåeligt uploader noget: genkendelsen kræver en sprogmodel, og den ligger normalt på en server. Her kører den i din browser; kun modellen indlæses, aldrig din fil.

Det er netop vigtigt ved de dokumenter, man skanner: kontrakter, lønsedler, lægebreve, kopier af ID-kort. En skanning er et billede — og før den bliver søgbar, skal noget læse den. At dette noget kører på din egen enhed i din browser, er den egentlige forskel.

28 sprog er tilgængelige til OCR. Modellen for det valgte sprog indlæses først, når genkendelsen rent faktisk køres — siden forbliver derfor let, og du henter kun det, du har brug for.

Hvor genkendelsen når sine grænser

Ikke-latinske skriftsystemer mangler bevidst. Ikke kyrillisk, ikke kinesisk, japansk eller koreansk, ikke arabisk, hebraisk, devanagari eller thai. Modellerne til det er betydeligt større, og træfsikkerheden mærkbart lavere — et resultat, man skal rette tegn for tegn, hjælper ingen. Græsk er med, fordi det i den henseende ikke falder i samme kategori.

Genkendelsen er aldrig fejlfri. Den læser ud fra pixels, hvad der engang var tekst. En ren skanning med lige retning giver meget gode resultater; et skævt mobilfoto i dårligt lys, en kruset håndskrift eller en usædvanlig prydskrift markant dårligere. Den, der genbruger teksten, bør læse den igennem — det gælder for enhver OCR-behandlet version, ikke kun denne.

Sidens udseende ændrer sig ikke. Den genkendte tekst lægges som et usynligt lag over billedet: du ser stadig din skanning, men kan søge og markere i den. Genkendelsesfejl er derfor ikke synlige i billedet — de viser sig først, når du kopierer tekst ud.

OCR er også nyttig efter komprimering af en PDF: dér bliver sider til billeder og mister deres tekstlag — tekstgenkendelsen genopretter det.

ofte stillede spørgsmål

Ofte stillede spørgsmål

Bliver mit dokument uploadet til tekstgenkendelsen? +

Nej. Genkendelsen kører helt i browseren via en lokalt indlæst OCR-motor — filen forlader aldrig din enhed.

Hvilke sprog understøttes? +

Et bredt udvalg af europæiske sprog med latinsk eller græsk skrift. Skriftsystemer som kinesisk, arabisk, kyrillisk eller devanagari understøttes i øjeblikket ikke til OCR.

Hvor lang tid tager genkendelsen? +

Afhængigt af antal sider og enhedens ydeevne fra få sekunder til nogle minutter.

Ændrer tekstgenkendelsen sidens udseende? +

Nej. Sidebilledet forbliver præcis det samme, det genkendte tekstlag ligger usynligt ovenpå — kun søgning og kopiering bliver dermed muligt.

Hvor god er genkendelsen ved dårligt skannede eller håndskrevne dokumenter? +

Genkendelsen fungerer bedst ved rent trykte, letlæselige tekster. Ved håndskrevne noter eller stærkt støjfyldte skanninger falder nøjagtigheden — så kan enkelte tegn genkendes forkert eller mangle.

Hvilke sprog genkendes? +

28, alle med latinsk skrift plus græsk. Ikke-latinske skriftsystemer som kyrillisk, kinesisk, arabisk, hebraisk eller thai er bevidst ikke med — træfsikkerheden ville være markant dårligere der.

Hvor præcis er genkendelsen? +

Ved en ren, lige skanning meget god; ved skæve mobilfotos, dårligt lys eller håndskrift mærkbart dårligere. Den, der genbruger teksten, bør læse den igennem.

Ser mit dokument anderledes ud efter tekstgenkendelsen? +

Nej. Den genkendte tekst kommer som et usynligt lag over billedet — siden ser ud som før, men er søgbar.

flere værktøjer

Dette kunne også hjælpe

Komprimér PDF

Formindsk billedtunge PDF-filer markant — siderne bliver til billeder i processen.

Konvertér PDF til PDF/A

Konvertér til det arkivvenlige PDF/A-format — til myndigheder og langtidsopbevaring.

Konvertér PDF til Word

Eksportér PDF-tekst som en redigerbar Word-fil — uden upload.

Redigér PDF-tekst

Klik på eksisterende tekst i PDF'en, og erstat den med ny.

Annonce

Åbn editor →