mousePDF · PDF-Texterkennung (OCR)
pdf ocr · texterkennung · ohne upload

PDF-Texterkennung (OCR) ohne Upload

Lege eine unsichtbare, durchsuchbare Textebene über gescannte oder als Bild vorliegende PDF-Seiten. Die Erkennung läuft vollständig in deinem Browser, deine Datei wird nie hochgeladen.

✓ Nichts wird hochgeladen ✓ Komplett kostenlos ✓ Ohne Konto
Anzeige
Bildschirmfoto des mousePDF-Editors
so geht's

In drei Schritten

01

PDF öffnen

Gescanntes oder bildbasiertes PDF per Drag-and-drop in das Fenster ziehen oder auswählen.

02

Sprache & Umfang wählen

Erkennungssprache festlegen und entscheiden, ob nur die aktuelle Seite oder das ganze Dokument erkannt werden soll.

03

Exportieren

PDF mit durchsuchbarer, unsichtbarer Textebene speichern. Das Seitenbild bleibt optisch unverändert.

Gescannte Dokumente durchsuchbar machen

Eingescannte Verträge, Rechnungen oder Bücher enthalten oft nur ein Seitenbild, keinen echten Text, und man kann darin weder suchen noch Text kopieren. mousePDF erkennt den Text lokal im Browser und legt ihn unsichtbar über das Bild, sodass Suche und Kopieren funktionieren, ohne dass sich am Aussehen der Seite etwas ändert.

Anzeige

Warum Erkennung auf dem eigenen Gerät ungewöhnlich ist

OCR gehört zu den Aufgaben, für die man sonst fast zwangsläufig etwas hochlädt: Die Erkennung braucht ein Sprachmodell, und das liegt üblicherweise auf einem Server. Hier läuft sie in deinem Browser; geladen wird nur das Modell, nie deine Datei.

Das ist genau bei den Dokumenten wichtig, die man einscannt: Verträge, Gehaltsabrechnungen, Arztbriefe, Ausweiskopien. Ein Scan ist ein Bild, und bevor er durchsuchbar wird, muss ihn etwas lesen. Dass dieses Etwas auf deinem eigenen Gerät in deinem Browser läuft, ist der eigentliche Unterschied.

28 Sprachen stehen zur Verfügung für OCR. Das Modell der gewählten Sprache wird erst beim tatsächlichen Lauf nachgeladen. Die Seite bleibt dadurch leicht, und du lädst nur, was du brauchst.

Wo die Erkennung an ihre Grenzen kommt

Nicht-lateinische Schriften fehlen bewusst. Kein Kyrillisch, kein Chinesisch, Japanisch oder Koreanisch, kein Arabisch, Hebräisch, Devanagari oder Thai. Die Modelle dafür sind deutlich größer und die Trefferquote spürbar niedriger, und ein Ergebnis, das man Zeichen für Zeichen nachkorrigieren muss, hilft niemandem. Griechisch ist dabei, weil es in dieser Hinsicht nicht in dieselbe Klasse fällt.

Die Erkennung ist nie fehlerfrei. Sie liest aus Pixeln zurück, was einmal Text war. Ein sauberer Scan mit gerader Ausrichtung liefert sehr gute Ergebnisse; ein schiefes Handyfoto bei schlechtem Licht, eine krakelige Handschrift oder eine ungewöhnliche Zierschrift deutlich schlechtere. Wer den Text weiterverwendet, sollte ihn gegenlesen, und das gilt für jede OCR bearbeitete Version, nicht nur für diese.

Das Aussehen der Seite ändert sich nicht. Der erkannte Text wird als unsichtbare Schicht über das Bild gelegt: Du siehst weiterhin deinen Scan, kannst darin aber suchen und markieren. Erkennungsfehler sind deshalb im Bild nicht sichtbar. Sie zeigen sich erst, wenn du Text herauskopierst.

Nützlich ist OCR auch nach dem Komprimieren eines PDF: Dabei werden Seiten zu Bildern und verlieren ihre Textschicht, die die Texterkennung neu anlegt.

faq

Häufige Fragen

Wird mein Dokument für die Texterkennung hochgeladen? +

Nein. Die Erkennung läuft vollständig im Browser über eine lokal geladene OCR-Engine, und die Datei verlässt nie dein Gerät.

Welche Sprachen werden unterstützt? +

Eine größere Auswahl europäischer Sprachen mit lateinischer oder griechischer Schrift. Schriften wie Chinesisch, Arabisch, Kyrillisch oder Devanagari werden aktuell nicht für OCR unterstützt.

Wie lange dauert die Erkennung? +

Je nach Seitenzahl und Geräteleistung einige Sekunden bis wenige Minuten.

Verändert die Texterkennung das Aussehen der Seite? +

Nein. Das Seitenbild bleibt exakt gleich, die erkannte Textebene liegt unsichtbar darüber und macht nur Suche und Kopieren möglich.

Wie gut ist die Erkennung bei schlecht gescannten oder handschriftlichen Dokumenten? +

Die Erkennung funktioniert am besten bei sauber gedruckten, gut lesbaren Texten. Bei handschriftlichen Notizen oder stark verrauschten Scans sinkt die Genauigkeit; dann können einzelne Zeichen falsch erkannt werden oder fehlen.

Welche Sprachen werden erkannt? +

28, alle mit lateinischer Schrift plus Griechisch. Nicht-lateinische Schriften wie Kyrillisch, Chinesisch, Arabisch, Hebräisch oder Thai sind bewusst nicht dabei, weil die Trefferquote dort deutlich schlechter wäre.

Wie genau ist die Erkennung? +

Bei einem sauberen, geraden Scan sehr gut; bei schiefen Handyfotos, schlechtem Licht oder Handschrift merklich schlechter. Wer den Text weiterverwendet, sollte ihn gegenlesen.

Sieht mein Dokument nach der Texterkennung anders aus? +

Nein. Der erkannte Text kommt als unsichtbare Schicht über das Bild, die Seite sieht also aus wie vorher, ist aber durchsuchbar.

weitere werkzeuge

Das könnte auch helfen

PDF komprimieren

Bildlastige PDFs deutlich verkleinern, wobei die Seiten zu Bildern werden.

PDF in PDF/A umwandeln

In das archivfreundliche PDF/A-Format umwandeln, für Behörden und Langzeitablage.

PDF in Word umwandeln

PDF-Text als bearbeitbare Word-Datei exportieren, ohne Upload.

PDF-Text bearbeiten

Vorhandenen Text im PDF anklicken und durch neuen ersetzen.

Anzeige

Editor öffnen →