PDF-zu-Excel-Konverter
Extrahiere den Text eines PDFs in Zeilen und Spalten einer Excel-Datei (.xlsx), direkt in deinem Browser.
Dieses Tool läuft vollständig in deinem Browser. Deine Dateien werden niemals auf einen Server hochgeladen.
Drop a PDF here or click to upload
Was dieses Tool macht
Extrahiert den Text jeder Seite zusammen mit seiner Position auf der Seite, gruppiert Elemente, die sich eine Zeile teilen, in eine Zeile und gruppiert Elemente, die durch eine breite horizontale Lücke getrennt sind, in separate Spalten — und speichert das Ergebnis dann als .xlsx-Tabelle.
So wird es verwendet
Ziehe eine PDF-Datei hinein oder wähle sie aus. Das Tool analysiert die Textpositionen jeder Seite und erzeugt eine herunterladbare .xlsx-Datei, mit einer leeren Zeile zwischen den einzelnen ursprünglichen PDF-Seiten.
Durchgerechnetes Beispiel
Lade invoice.pdf (eine Seite mit einer einfachen zweispaltigen Liste von Artikelnamen und Preisen) hoch und erhältst invoice.xlsx, mit jedem Artikelnamen in Spalte A und seinem Preis in Spalte B, eine Zeile pro Zeile.
Wie Zeilen und Spalten erkannt werden
Dies ist eine positionsbasierte Heuristik, keine echte Tabellenerkennung: Text auf ungefähr derselben vertikalen Position wird zu einer Zeile, und innerhalb einer Zeile beginnt eine Lücke, die breiter als ein kleiner Schwellenwert ist, zwischen zwei Textstücken eine neue Spalte. Das funktioniert gut für einfache, rasterausgerichtete Tabellen und Listen.
Wann das nicht gut funktioniert
Komplexe Layouts — mehrspaltige Artikel, PDFs mit zusammengeführten oder gedrehten Tabellenzellen oder Text, der nicht an einem sauberen Raster ausgerichtet ist — werden in Zeilen und Spalten extrahiert, die nicht der visuellen Tabellenstruktur entsprechen. Überprüfe das Ergebnis und passe es von Hand an, wenn es über eine einfache Tabelle hinausgeht.
Grenzen
Gescannte PDFs (Seiten, die Bilder von Text sind, ohne echte Textebene) erzeugen leere Zeilen, da dieses Tool keine OCR durchführt. Jeder Wert wird als reiner Text extrahiert — Zahlen werden nicht in Excels numerischen Typ umgewandelt, daher müssen Formeln, die sich darauf beziehen, möglicherweise zuerst neu formatiert werden.
Datenschutz
Sowohl das Lesen des PDFs als auch das Erzeugen der Tabelle laufen vollständig in deinem Browser ab, wobei pdf.js für die Textextraktion verwendet wird. Deine Datei wird niemals auf einen Server hochgeladen.
Häufig gestellte Fragen
- Wird dadurch jede Tabelle aus einem PDF korrekt extrahiert?
- Nicht immer — es wird eine positionsbasierte Heuristik verwendet (gleiche Zeile = Zeile, breite horizontale Lücke = neue Spalte), die für einfache, rasterausgerichtete Tabellen gut funktioniert, aber komplexe oder unregelmäßige Layouts falsch interpretieren kann.
- Funktioniert das mit einem gescannten PDF?
- Nein — eine gescannte Seite hat keine echte Textebene zum Lesen, nur Pixel, daher entstehen leere Zeilen; dafür bräuchtest du stattdessen ein OCR-Tool.
- Werden die Zahlen als echte Zahlen extrahiert?
- Nein — jede Zelle wird als reiner Text extrahiert, daher musst du zahlenähnliche Zellen eventuell in Excels Zahlenformat umwandeln, bevor du sie in Formeln verwendest.
Ähnliche Tools
Excel-zu-PDF-Konverter
Wandle das erste Tabellenblatt einer Excel-Datei direkt in deinem Browser in ein einfaches Tabellen-PDF um.
PDF-zu-Word-Konverter
Extrahiere Text aus einem PDF in ein bearbeitbares Word-Dokument (.docx), direkt in deinem Browser.
Excel-zu-SQL-Insert-Generator
Wandle Excel- oder CSV-Zeilen kostenlos in einsatzbereite SQL-INSERT-Anweisungen um.