Ziel
🗣️ Wolfgang Fahl → 🤖 Agent/Delphi: Gibt es eine Quelle für das Reichsadressbuch 1942, wie es früher
genevolu.de benutzt hat? Wir wollen die Geodaten sammeln. Alle Bilder herunterladen ist nicht das Problem.
Befund
✍️🤖 Agent/Delphi: Genevolu (Mario Fraust, 2008) nutzte nicht das Reichsadressbuch, sondern das
Reichs-Telefonbuch 1942 mit ca. 2,6 Mio. Anschlüssen; die Transkription wurde nie veröffentlicht,
der Dienst ist nicht mehr erreichbar. Das Reichs-Telefonbuch 1942 (44. Ausgabe, 5 Bände) liegt nur
als Archivexemplar (Staatsarchiv Leipzig, GStA PK, HU Berlin, Deutsches Museum) und als DVD-Faksimile
von bogon.de (2006, Datenbankrecht seit 2021 abgelaufen) vor. Die UB der HU Berlin hat die Ausgaben
1934, 1935 und 1938 auf digi-hub digitalisiert, mit ABBYY-ALTO-Volltext und IIIF-Bildern.
GenWiki: https://wiki.genealogy.net/Deutsches_Reich/Reichstelefonbuch_1942
Entscheidung
✍️🤖 Agent/Delphi: 1938 ist die 42. Ausgabe vor Krieg, Evakuierung und Vertreibung und sofort nutzbar;
1942 deckt zusätzlich Österreich, Sudetenland und die Ostgebiete ab und braucht eine Digitalisierung
(kostenloser Wunschbuch-Antrag beim Fachinformationsdienst Geschichtswissenschaft für das Exemplar
des Deutschen Museums). Start mit 1938.
👁️🧑 Wolfgang Fahl ✓
Arbeitsumgebung
✍️🤖 Agent/Delphi:
| Element |
Eckdaten |
| fur |
Hauptserver, Ubuntu 24.04 LTS, 125 GB RAM, GTX 1650 4 GB, Ollama 0.32.1 mit qwen3-vl 4b und 30b |
| yuyu |
4 TB SSD an fur, Zweck CompGen-Images, 367 GB frei |
| Arbeitsverzeichnis |
/hd/yuyu/reichstelefonbuch mit 1938// ALTO und 1938/images//full/ Bilder |
| Skripte |
getrtb und getrtbimg, RCS im Arbeitsverzeichnis und in diesem Repository |
Korpus 1938
✍️🤖 Agent/Delphi: 3 Bände, 4583 Seiten, Originalscans 4381 x 5298 Pixel.
| Teil |
Umfang |
| ALTO XML |
4583 Dateien, ca. 1,3 GB |
| Bilder in voller Auflösung |
4583 Dateien, ca. 18 GB |
| Textzeilen, hochgerechnet |
ca. 2,3 Mio. |
Download mit den beiden resumefähigen Skripten der Arbeitsumgebung: getrtb für ALTO, getrtbimg für
Bilder mit Band, Seitenbereich, Log je Lauf, Fortschritt und ETA.
Ortsregister
✍️🤖 Agent/Delphi: Band 1 beginnt mit einem Ortsregister des ganzen Reichs, fünf Spalten, ca. 500
Einträge je Seite: Ort mit Kreis oder Land als Unterscheidung und entweder Seitenzahl (Hauptort mit
eigener Liste) oder "s. Hauptort". Dittozeichen „ bedeutet gleiche Seite wie die Zeile darüber.
Aus 76 Registerseiten: 38 596 "s."-Verweise, 808 Seitenverweise; Hochrechnung ca. 100 000 Ortsnamen
mit Hauptort. Das ist die Eingabe für die Ortsauflösung: Name, Kreis, Hauptort.
Ansatz
🗣️ Wolfgang Fahl → 🤖 Agent/Delphi: Wir müssen bei den vollaufgelösten Bildern wahrscheinlich selbst
die Spalten rauslösen, damit die OCR gut funktioniert und wir die Modelle nicht überlasten.
Für die Ortsauflösung eine Abstimmung zwischen mehreren Diensten statt GOV allein, wie in
locator.py von genwiki2024.
✍️🤖 Agent/Delphi: Die ALTO-Dateien enthalten je Seite fünf TextBlocks mit Pixelkoordinaten, einen
je Spalte; damit werden Spaltenbilder von ca. 850 x 5000 Pixel mit ca. 100 Einträgen geschnitten.
Ortsauflösung: Name plus Kreis gegen GOV, Kandidaten aus GOV, Wikidata und Nominatim mit
Distanzprüfung, Konfidenz je Ort, Ergebnis je Registerzeichenkette gecacht.
OCR-Test
🗣️ Wolfgang Fahl → 🤖 Agent/Delphi: Der OCR-Test fehlt in den nächsten Schritten, wir diskutieren ihn zuerst. Prozent ist ein schlechtes Maß für OCR, wir zählen absolut je Seite und nach Fehlerarten: Zeichen, Segmentierung, Zeile, Symbol.
✍️🤖 Agent/Delphi: Seite 20 Band 1, Spalte 1, 116 Einträge, Spaltenbild aus den ALTO-TextLine-Rändern geschnitten, Referenz vom Spaltenbild gelesen (Durchsicht durch Wolfgang Fahl offen). Vollständiges Ergebnis mit allen falschen Paaren in ocrtest.md, Skripte cutcols.py, ocrtest.sh, ocrscore.py im Repository.
| Kandidat |
falsch oder fehlend von 116 |
Zeichen sub/ins/del |
Segmentierung |
Zeile fehlt/erfunden |
Ditto verloren |
| ChatGPT, Modell offen, Spaltenbild |
11 |
8/3/3 |
0 |
0/0 |
0 |
| ABBYY ALTO, HU Berlin |
21 |
12/90/8 |
8 |
2/0 |
5 |
| qwen3-vl:4b, Ollama, noah und fur, Kontext 8192 |
42 |
2/30/10 |
37 |
1/0 |
7 |
| tesseract 5 deu |
58 |
35/304/129 |
17 |
33/22 |
4 |
| qwen3-vl:30b |
CUDA out of memory auf 6 GB und 4 GB |
|
|
|
|
Befunde: ABBYY verliert alle Dittozeichen und verwechselt rn mit m; qwen3-vl:4b trennt Wörter durch Leerzeichen; die ALTO-Dateien der API liegen bei Band 1 und 3 alphabetisch nach Quelldateiname, nicht in Seitenfolge, die Seite steht im ALTO-Element fileName; Band 2 liegt in Seitenfolge, ist aber Tesseract-Ausgabe (intranda 2019), nicht ABBYY.
Nächste Schritte