Methodik und Datenqualität
Wie OpenPlenum die amtlichen Protokolle einliest und verknüpft, und wo dabei Fehler entstehen können.
Datenquellen und Abdeckung
OpenPlenum bezieht Plenarprotokolle, Stammdaten und Drucksachen aus öffentlichen Angeboten des Deutschen Bundestages, insbesondere dem Dokumentations- und Informationssystem DIP. Erfasst werden derzeit die Wahlperioden 19, 20 und 21. Die Quelldaten und ihre Verfügbarkeit bestimmen, wie vollständig einzelne Zeiträume dargestellt werden können.
Import und Strukturierung
Die Pipeline lädt XML- und Metadaten, erkennt Sitzungen, Tagesordnungspunkte, Reden und die Vermerke zu Reaktionen und speichert sie getrennt. Ein Transformationsschritt verknüpft Reden mit Personenprofilen und Drucksachen. Der Prozess läuft regelmäßig. Das sichtbare Datum in Quellenboxen zeigt, auf welchem Import- oder Sitzungsstand eine Darstellung beruht.
Personen und Fraktionen
Wo eindeutige Bundestags-IDs vorliegen, werden sie direkt verwendet. Fehlen sie, kann eine zeitlich begrenzte Zuordnung über Namen und Mitgliedschaftsdaten erfolgen. Mehrdeutige Namen werden nicht erzwungen zugeordnet. Fraktionszugehörigkeiten können sich ändern; die Zuordnung soll deshalb zur jeweiligen Wahlperiode und zum Sitzungsdatum passen.
Reaktionen und Reaktionswert
Der Reaktionswert zählt, wie oft das Protokoll während einer Rede Reaktionen aus dem Saal vermerkt. Ein Zwischenruf zählt 3 Punkte, Lachen 2, Beifall und jede andere Reaktion 1. Enthält die Rede eine Zwischenfrage, kommen einmalig 5 Punkte dazu. Der Wert sagt nichts über die Qualität einer Rede. Er misst auch weder Lautstärke noch Zustimmung, und er sagt nichts über die politische Bedeutung einer Rede. Technisch heißt er heat_score. Ein Vermerk, also eine Klammer im Protokoll wie „(Beifall bei der SPD – Zuruf von der AfD)“, kann mehrere Reaktionen enthalten. Die Stufen des Reaktionswerts stehen auf der Seite Datenbasis.
Suche und Themenseiten
Die Volltextsuche verwendet deutsche Sprachregeln in PostgreSQL. Kuratierte Themenseiten kombinieren eine kleine, sichtbare Liste geprüfter Begriffe per ODER. Eine Rede wird dabei nur einmal gezählt, auch wenn mehrere Begriffe passen. Trefferzahlen zeigen ausdrücklich verwendete Sprache und sind keine automatische Themenklassifikation. Synonyme oder fachlich verwandte Reden können fehlen; beiläufige Nennungen können enthalten sein.
Debattenseiten
Eine Debatte entspricht einem Tagesordnungspunkt innerhalb einer Sitzung. Sie wird für Suchmaschinen nur freigegeben, wenn ein Datum, ein aussagekräftiger Titel und mindestens zwei Reden vorliegen. Die Seite zeigt kurze Ausschnitte; der vollständige Wortlaut bleibt auf den Rede- und Sitzungsseiten erreichbar.
Bekannte Grenzen und Korrekturen
Automatisches XML-Parsing kann bei ungewöhnlichen Protokollstrukturen scheitern. Rollen, Reaktionen, Dokumentnummern und Personen können fehlen oder falsch verbunden sein. OpenPlenum ändert den Wortlaut nicht, sondern gliedert ihn nur in Absätze, Reaktionen und Sprecherwechsel. Bei Abweichungen gilt das verlinkte amtliche Protokoll. Fehler melden Sie per E-Mail an die Adresse im Impressum.
Reproduzierbarkeit
Der Quellcode wird veröffentlicht, sobald das Repository freigegeben ist. Die Seite Datenbasis beschreibt bereits jetzt Herkunft und Bedeutung der dargestellten Felder.