PDF-zu-Excel-Konverter

Extrahiere den Text eines PDFs in Zeilen und Spalten einer Excel-Datei (.xlsx), direkt in deinem Browser.

Dieses Tool läuft vollständig in deinem Browser. Deine Dateien werden niemals auf einen Server hochgeladen.

Drop a PDF here or click to upload

Was dieses Tool macht

Extrahiert den Text jeder Seite zusammen mit seiner Position auf der Seite, gruppiert Elemente, die sich eine Zeile teilen, in eine Zeile und gruppiert Elemente, die durch eine breite horizontale Lücke getrennt sind, in separate Spalten — und speichert das Ergebnis dann als .xlsx-Tabelle.

So wird es verwendet

Ziehe eine PDF-Datei hinein oder wähle sie aus. Das Tool analysiert die Textpositionen jeder Seite und erzeugt eine herunterladbare .xlsx-Datei, mit einer leeren Zeile zwischen den einzelnen ursprünglichen PDF-Seiten.

Durchgerechnetes Beispiel

Lade invoice.pdf (eine Seite mit einer einfachen zweispaltigen Liste von Artikelnamen und Preisen) hoch und erhältst invoice.xlsx, mit jedem Artikelnamen in Spalte A und seinem Preis in Spalte B, eine Zeile pro Zeile.

Wie Zeilen und Spalten erkannt werden

Dies ist eine positionsbasierte Heuristik, keine echte Tabellenerkennung: Text auf ungefähr derselben vertikalen Position wird zu einer Zeile, und innerhalb einer Zeile beginnt eine Lücke, die breiter als ein kleiner Schwellenwert ist, zwischen zwei Textstücken eine neue Spalte. Das funktioniert gut für einfache, rasterausgerichtete Tabellen und Listen.

Wann das nicht gut funktioniert

Komplexe Layouts — mehrspaltige Artikel, PDFs mit zusammengeführten oder gedrehten Tabellenzellen oder Text, der nicht an einem sauberen Raster ausgerichtet ist — werden in Zeilen und Spalten extrahiert, die nicht der visuellen Tabellenstruktur entsprechen. Überprüfe das Ergebnis und passe es von Hand an, wenn es über eine einfache Tabelle hinausgeht.

Grenzen

Gescannte PDFs (Seiten, die Bilder von Text sind, ohne echte Textebene) erzeugen leere Zeilen, da dieses Tool keine OCR durchführt. Jeder Wert wird als reiner Text extrahiert — Zahlen werden nicht in Excels numerischen Typ umgewandelt, daher müssen Formeln, die sich darauf beziehen, möglicherweise zuerst neu formatiert werden.

Datenschutz

Sowohl das Lesen des PDFs als auch das Erzeugen der Tabelle laufen vollständig in deinem Browser ab, wobei pdf.js für die Textextraktion verwendet wird. Deine Datei wird niemals auf einen Server hochgeladen.

Häufig gestellte Fragen

Wird dadurch jede Tabelle aus einem PDF korrekt extrahiert?
Nicht immer — es wird eine positionsbasierte Heuristik verwendet (gleiche Zeile = Zeile, breite horizontale Lücke = neue Spalte), die für einfache, rasterausgerichtete Tabellen gut funktioniert, aber komplexe oder unregelmäßige Layouts falsch interpretieren kann.
Funktioniert das mit einem gescannten PDF?
Nein — eine gescannte Seite hat keine echte Textebene zum Lesen, nur Pixel, daher entstehen leere Zeilen; dafür bräuchtest du stattdessen ein OCR-Tool.
Werden die Zahlen als echte Zahlen extrahiert?
Nein — jede Zelle wird als reiner Text extrahiert, daher musst du zahlenähnliche Zellen eventuell in Excels Zahlenformat umwandeln, bevor du sie in Formeln verwendest.