Skip to content
GitLab
Projects Groups Topics Snippets
  • /
  • Help
    • Help
    • Support
    • Community forum
    • Submit feedback
    • Contribute to GitLab
  • Sign in
  • N nvx2026
  • Project information
    • Project information
    • Activity
    • Labels
    • Members
  • Repository
    • Repository
    • Files
    • Commits
    • Branches
    • Tags
    • Contributor statistics
    • Graph
    • Compare revisions
  • Issues 7
    • Issues 7
    • List
    • Boards
    • Service Desk
    • Milestones
  • Merge requests 0
    • Merge requests 0
  • CI/CD
    • CI/CD
    • Pipelines
    • Jobs
    • Schedules
  • Deployments
    • Deployments
    • Environments
    • Releases
  • Packages and registries
    • Packages and registries
    • Package Registry
    • Terraform modules
  • Monitor
    • Monitor
    • Incidents
  • Analytics
    • Analytics
    • Value stream
    • CI/CD
    • Repository
  • Wiki
    • Wiki
  • Snippets
    • Snippets
  • Activity
  • Graph
  • Create a new issue
  • Jobs
  • Commits
  • Issue Boards
Collapse sidebar
  • Wolfgang Fahl
  • nvx2026
  • Issues
  • #5
Closed
Open
Issue created Sep 12, 2026 by Wolfgang Fahl@WolfgangFahlOwner

Reichstelefonbuch 1938 als Quelle für die Namensverbreitungskarte

Ziel

🗣️ Wolfgang Fahl → 🤖 Agent/Delphi: Gibt es eine Quelle für das Reichsadressbuch 1942, wie es früher genevolu.de benutzt hat? Wir wollen die Geodaten sammeln. Alle Bilder herunterladen ist nicht das Problem.

Befund

✍️🤖 Agent/Delphi: Genevolu (Mario Fraust, 2008) nutzte nicht das Reichsadressbuch, sondern das Reichs-Telefonbuch 1942 mit ca. 2,6 Mio. Anschlüssen; die Transkription wurde nie veröffentlicht, der Dienst ist nicht mehr erreichbar. Das Reichs-Telefonbuch 1942 (44. Ausgabe, 5 Bände) liegt nur als Archivexemplar (Staatsarchiv Leipzig, GStA PK, HU Berlin, Deutsches Museum) und als DVD-Faksimile von bogon.de (2006, Datenbankrecht seit 2021 abgelaufen) vor. Die UB der HU Berlin hat die Ausgaben 1934, 1935 und 1938 auf digi-hub digitalisiert, mit ABBYY-ALTO-Volltext und IIIF-Bildern. GenWiki: https://wiki.genealogy.net/Deutsches_Reich/Reichstelefonbuch_1942

Entscheidung

✍️🤖 Agent/Delphi: 1938 ist die 42. Ausgabe vor Krieg, Evakuierung und Vertreibung und sofort nutzbar; 1942 deckt zusätzlich Österreich, Sudetenland und die Ostgebiete ab und braucht eine Digitalisierung (kostenloser Wunschbuch-Antrag beim Fachinformationsdienst Geschichtswissenschaft für das Exemplar des Deutschen Museums). Start mit 1938. 👁️🧑 Wolfgang Fahl ✓

Arbeitsumgebung

✍️🤖 Agent/Delphi:

Element Eckdaten
fur Hauptserver, Ubuntu 24.04 LTS, 125 GB RAM, GTX 1650 4 GB, Ollama 0.32.1 mit qwen3-vl 4b und 30b
yuyu 4 TB SSD an fur, Zweck CompGen-Images, 367 GB frei
Arbeitsverzeichnis /hd/yuyu/reichstelefonbuch mit 1938// ALTO und 1938/images//full/ Bilder
Skripte getrtb und getrtbimg, RCS im Arbeitsverzeichnis und in diesem Repository

Korpus 1938

✍️🤖 Agent/Delphi: 3 Bände, 4583 Seiten, Originalscans 4381 x 5298 Pixel.

Teil Umfang
ALTO XML 4583 Dateien, ca. 1,3 GB
Bilder in voller Auflösung 4583 Dateien, ca. 18 GB
Textzeilen, hochgerechnet ca. 2,3 Mio.

Download mit den beiden resumefähigen Skripten der Arbeitsumgebung: getrtb für ALTO, getrtbimg für Bilder mit Band, Seitenbereich, Log je Lauf, Fortschritt und ETA.

Ortsregister

✍️🤖 Agent/Delphi: Band 1 beginnt mit einem Ortsregister des ganzen Reichs, fünf Spalten, ca. 500 Einträge je Seite: Ort mit Kreis oder Land als Unterscheidung und entweder Seitenzahl (Hauptort mit eigener Liste) oder "s. Hauptort". Dittozeichen „ bedeutet gleiche Seite wie die Zeile darüber. Aus 76 Registerseiten: 38 596 "s."-Verweise, 808 Seitenverweise; Hochrechnung ca. 100 000 Ortsnamen mit Hauptort. Das ist die Eingabe für die Ortsauflösung: Name, Kreis, Hauptort.

Ansatz

🗣️ Wolfgang Fahl → 🤖 Agent/Delphi: Wir müssen bei den vollaufgelösten Bildern wahrscheinlich selbst die Spalten rauslösen, damit die OCR gut funktioniert und wir die Modelle nicht überlasten. Für die Ortsauflösung eine Abstimmung zwischen mehreren Diensten statt GOV allein, wie in locator.py von genwiki2024.

✍️🤖 Agent/Delphi: Die ALTO-Dateien enthalten je Seite fünf TextBlocks mit Pixelkoordinaten, einen je Spalte; damit werden Spaltenbilder von ca. 850 x 5000 Pixel mit ca. 100 Einträgen geschnitten. Ortsauflösung: Name plus Kreis gegen GOV, Kandidaten aus GOV, Wikidata und Nominatim mit Distanzprüfung, Konfidenz je Ort, Ergebnis je Registerzeichenkette gecacht.

OCR-Test

🗣️ Wolfgang Fahl → 🤖 Agent/Delphi: Der OCR-Test fehlt in den nächsten Schritten, wir diskutieren ihn zuerst. Prozent ist ein schlechtes Maß für OCR, wir zählen absolut je Seite und nach Fehlerarten: Zeichen, Segmentierung, Zeile, Symbol.

✍️🤖 Agent/Delphi: Seite 20 Band 1, Spalte 1, 116 Einträge, Spaltenbild aus den ALTO-TextLine-Rändern geschnitten, Referenz vom Spaltenbild gelesen (Durchsicht durch Wolfgang Fahl offen). Vollständiges Ergebnis mit allen falschen Paaren in ocrtest.md, Skripte cutcols.py, ocrtest.sh, ocrscore.py im Repository.

Kandidat falsch oder fehlend von 116 Zeichen sub/ins/del Segmentierung Zeile fehlt/erfunden Ditto verloren
ChatGPT, Modell offen, Spaltenbild 11 8/3/3 0 0/0 0
ABBYY ALTO, HU Berlin 21 12/90/8 8 2/0 5
qwen3-vl:4b, Ollama, noah und fur, Kontext 8192 42 2/30/10 37 1/0 7
tesseract 5 deu 58 35/304/129 17 33/22 4
qwen3-vl:30b CUDA out of memory auf 6 GB und 4 GB

Befunde: ABBYY verliert alle Dittozeichen und verwechselt rn mit m; qwen3-vl:4b trennt Wörter durch Leerzeichen; die ALTO-Dateien der API liegen bei Band 1 und 3 alphabetisch nach Quelldateiname, nicht in Seitenfolge, die Seite steht im ALTO-Element fileName; Band 2 liegt in Seitenfolge, ist aber Tesseract-Ausgabe (intranda 2019), nicht ABBYY.

Nächste Schritte

  • Zuordnung Bild zu ALTO je Band über fileName mit xq, siehe Kommentar 5861
  • Spaltenschnitt aus ALTO-Koordinaten als Werkzeug im Repository
  • OCR-Test: Durchsicht der Referenz, Listenseite, Cloud-Leser mit Token- und Preismessung, Kosten-Nutzen je Leser und Leserkombination
  • Referenz mit DES: einige Seiten von Menschen mit KI kuratiert (🗣️ Wolfgang Fahl)
  • Registerparser: Ort, Zusatz, Hauptort, Seite; Dittozeichen auflösen
  • Ortsauflösung mit Abstimmung und Konfidenz
  • Namensverteilung 1938 je Hauptort als Karte
  • Wunschbuch-Antrag für 1942
Edited Sep 12, 2026 by Wolfgang Fahl
Assignee
Assign to
Time tracking

Impressum | Datenschutz