JSON-Ausgabe
Die Beispiel-HTML-Tabelle erzeugt dieses JSON:
[
{ "Name": "Alice", "Age": "30", "City": "Istanbul" },
{ "Name": "Bob", "Age": "25", "City": "Ankara" }
]
Die erste <tr> definiert die Eigenschaftsnamen. Jede folgende <tr> wird zu einem Objekt im Array. Zellenwerte sind immer Strings, da HTML keine Typinformation hat.
Wie HTML-Tabellen auf JSON abgebildet werden
HTML-Tabellen haben eine natürliche tabellarische Struktur, die direkt auf ein Array von Objekten abgebildet wird.
| HTML-Element | JSON-Entsprechung |
|---|---|
<table> | Root-Array |
<tr> (erste Zeile) | Objektschlüssel |
<tr> (folgende Zeilen) | Array-Elemente |
<td> / <th> | Eigenschaftswert |
<thead> + <tbody> | Kopfzeile + Datenzeilen |
Der Konverter liest die erste Zeile als Schema und jede folgende Zeile als Daten. Wenn die Tabelle <thead> und <tbody> verwendet, kommt die Kopfzeile von <thead> und die Datenzeilen von <tbody>.
Wann HTML zu JSON konvertieren
Web-Scraping
HTML-Seiten zeigen Daten in Tabellen für menschliche Lesbarkeit an, aber du brauchst diese Daten als strukturiertes JSON für programmatik Nutzung. Das Konvertieren einer HTML-Tabelle zu JSON gibt dir ein Array von Objekten, das du filtern, sortieren und transformieren kannst, ohne HTML selbst zu parsen.
Datenmigration
Legacy-Systeme exportieren Berichte häufig als HTML-Seiten. Wenn du diese Daten in ein modernes System importieren musst, ist das Konvertieren der HTML-Tabellen zu JSON schneller als das Schreiben eines benutzerdefinierten Parsers für jedes Legacy-Exportformat.
API-Workarounds
Einige Websites stellen Daten nur als HTML-Tabellen bereit, nicht als JSON-APIs. Das Konvertieren von HTML zu JSON in deinem Browser ermöglicht das Extrahieren der Daten ohne Serverzugriff oder CORS-Einschränkungen.
Dokumentenverarbeitung
PDF- und HTML-Dokumente enthalten tabellarische Daten, die extrahiert werden müssen. Das Konvertieren der HTML-Darstellung zu JSON gibt dir eine saubere Datenstruktur, die du in Analyse-Tools oder Datenbanken einspeisen kannst.
Umgang mit Grenzfällen
Leere Zellen
HTML-Tabellen haben häufig leere <td></td>-Elemente für fehlende Daten. Der Konverter erzeugt leere Strings für diese Zellen in der JSON-Ausgabe. Du kannst das JSON nachbearbeiten, um leere Strings durch null zu ersetzen, falls deine Anwendung das erwartet.
Kopfzeilenerkennung
Der Konverter geht davon aus, dass die erste Zeile die Kopfzeile ist. Tabellen, die mit einer Titelzeile oder Caption beginnen, erfordern, dass der Titel vor der Konvertierung entfernt wird. Tabellen ohne klare Kopfzeile erhalten generische Spaltennamen.
Mehrere Tabellen
HTML-Seiten enthalten häufig mehrere Tabellen. Der Konverter verarbeitet jede Tabelle separat. Wenn du HTML mit mehreren Tabellen einfügst, erhältst du ein JSON-Array für jede. Wähle die Tabelle aus der Ausgabe, die du brauchst.
Einschränkungen
HTML-Tabellen sind Präsentation, nicht Daten. Der Konverter extrahiert Inhalt, aber verliert Styling, Links, Bilder und Inline-Formatierung. Wenn eine Zelle sowohl Text als auch einen Link enthält, erhältst du den Textinhalt ohne die URL. Für die Extraktion von reichhaltigen Inhalten benötigst du einen fortgeschritteneren Scraper, der die vollständige DOM-Struktur parsen kann.