PDF in Text

Text aus PDF kopieren – ohne kaputte Zeilenumbrüche

Ein Absatz aus dem PDF soll in eine E-Mail, ein Word-Dokument oder ein Übersetzungstool. Nach dem Einfügen endet jede Zeile mit einem Umbruch, Wörter sind mit „Silben- trennung“ zerrissen – oder es lässt sich gar nichts markieren. So kommst du an sauberen Text.

Direkt loslegen: PDF laden, Text als sauberen Fließtext kopieren oder als TXT speichern – auch aus Scans. Kostenlos, ohne Upload.

Text aus PDF holen

Warum kopierter PDF-Text kaputt ist

Ein PDF ist für den Druck gemacht. Es speichert nicht „Absatz mit diesem Text“, sondern „diese Buchstaben an genau dieser Position“. Zeilen, Absätze und Spalten ergeben sich nur aus der Anordnung. Beim Kopieren rät das Programm, wo eine Zeile endet – und setzt dort einen harten Umbruch.

ProblemUrsache
Umbruch nach jeder ZeileJede Zeile ist im PDF ein eigenes Textstück.
„Bundes- regierung“Die Silbentrennung des Layouts wird als echter Bindestrich mitkopiert.
Spalten durcheinanderZeilen aus linker und rechter Spalte werden abwechselnd gelesen.
Seltsame Zeichen statt TextDie Schrift ist ohne Zeichenzuordnung eingebettet – der Text ist für Programme nicht lesbar.
Gar nichts markierbarDas PDF ist ein Scan (nur Bild) oder das Kopieren ist per Rechteeinstellung gesperrt.

Sauberer Text in drei Schritten

  1. PDF laden. Datei in PDF in Text ziehen. Der Text aller Seiten erscheint im Textfeld.
  2. Einstellungen prüfen. „Zeilenumbrüche in Absätzen entfernen“ und „Silbentrennung zusammenfügen“ sind voreingestellt. Aufzählungen und nummerierte Listen bleiben dabei erhalten. Nur bestimmte Seiten? Unter „Seiten“ z. B. 3-5, 8 eintragen.
  3. Kopieren oder speichern. „Text kopieren“ legt alles in die Zwischenablage, „Als TXT speichern“ lädt eine Textdatei herunter.

Das PDF verlässt deinen Rechner nicht. Auch Verträge, Gutachten oder Arztbriefe kannst du bedenkenlos umwandeln – der Text wird im Browser ausgelesen.

Fließtext statt Zeilensalat – PDF hineinziehen, kopieren, fertig.

Wenn sich nichts markieren lässt

Gescannte PDFs: Texterkennung

Findet das Tool Seiten ohne Text, erscheint ein Hinweis mit dem Knopf „Text per OCR erkennen“. Die Erkennung (Tesseract) läuft ebenfalls in deinem Browser und liest Deutsch und Englisch. Beim ersten Mal lädt sie etwa 20 MB Erkennungsdaten, danach geht es schneller.

Alternativen: Word, Acrobat, pdftotext

Microsoft Word

Word öffnet PDFs direkt und wandelt sie in ein bearbeitbares Dokument um. Gut für einfache Layouts; bei komplexen Seiten entstehen viele Textfelder und Umbrüche.

Adobe Acrobat

„Als Text speichern“ und die Texterkennung gibt es in den kostenpflichtigen Versionen. Im kostenlosen Reader nur Markieren und Kopieren.

Google Docs

PDF in Google Drive hochladen und mit Google Docs öffnen – Drive führt dabei eine Texterkennung durch. Die Datei liegt danach allerdings bei Google.

Kommandozeile

pdftotext aus Poppler holt Text in Sekunden aus vielen PDFs, ocrmypdf macht Scans durchsuchbar.

pdftotext -layout dokument.pdf dokument.txt
ocrmypdf -l deu scan.pdf scan-durchsuchbar.pdf

Text jetzt aus dem PDF holen

Sauberer Fließtext ohne Zeilensalat, kopieren oder als TXT speichern – auch aus Scans per OCR. Kostenlos, ohne Upload.

Häufige Fragen

Warum hat kopierter PDF-Text so viele Zeilenumbrüche?

PDFs speichern Text Zeile für Zeile an festen Positionen. Beim Kopieren wird jedes Zeilenende zum harten Umbruch.

Wie entferne ich die Zeilenumbrüche?

Mit „PDF in Text“: Die Option „Zeilenumbrüche in Absätzen entfernen“ verbindet die Zeilen wieder zu Absätzen, Listen bleiben erhalten.

Kann ich Text aus einem gescannten PDF kopieren?

Ja, mit Texterkennung (OCR). Das Tool erkennt Seiten ohne Text und liest sie auf Wunsch per OCR aus – direkt im Browser.

Wird mein PDF hochgeladen?

Nein. Auch die Texterkennung läuft lokal. Geladen werden nur einmalig die Erkennungsdaten.

Bleibt die Formatierung erhalten?

Nein, das Ergebnis ist reiner Text ohne Fett, Schriftgrößen oder Tabellenlinien.

Was passiert mit mehrspaltigen Layouts?

Sie werden meist richtig der Reihe nach gelesen, bei komplexen Layouts können Spalten aber durcheinandergeraten.

Kann ich nur einzelne Seiten umwandeln?

Ja. Unter „Seiten“ zum Beispiel 1-3, 5 eintragen.

Quellen

  1. Tesseract OCR und Tesseract.js – die Texterkennung, die das Tool im Browser nutzt (englisch).
  2. Poppler (pdftotext) und OCRmyPDF (englisch).
  3. PDF.js – die Open-Source-Bibliothek, mit der das Tool den Text ausliest.

Text aus PDF kopieren ohne Zeilensalat – kostenlos, ohne Upload.

Zum Tool