Files
irrlichtandClaude Sonnet 5 ac7d8c7e69 Initiales Ingest-Repo (aus gdelt-bot/ingest überführt)
Poller, Schema, Quadlet-Units und Quellenregister aus dem Monorepo
gdelt-bot in ein eigenes Repo ausgelagert.

Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01VzNVf1KaHPZ1fzJT2jd18j
2026-09-04 20:08:22 +02:00

219 lines
4.9 KiB
TOML

# Quellenregister
#
# Einzige Wahrheit ueber die Quellen. Der Poller synchronisiert die Tabelle
# `quellen` bei jedem Start aus dieser Datei.
#
# lizenz_status:
# offen - robots.txt erlaubt den Abruf, Feed wird gepollt
# gesperrt - robots.txt oder AGB verbieten den Abruf, Feed wird NICHT gepollt
# ungeprueft - noch nicht geprueft, wird NICHT gepollt
#
# `aktiv = false` schaltet eine Quelle ab, ohne sie aus dem Register zu loeschen.
# Geloescht wird nie: die Historie soll nachvollziehbar bleiben.
#
# Geprueft am 2026-09-04 mit User-Agent aus poller.py (siehe USER_AGENT).
# Neupruefung: `python poller.py --check-robots`
[[quelle]]
id = "tagesschau"
name = "tagesschau.de"
typ = "rss"
url = "https://www.tagesschau.de/index~rss2.xml"
land = "DE"
traeger = "oeffentlich-rechtlich"
ressort = "allgemein"
lizenz_status = "offen"
robots_geprueft_am = 2026-09-04
aktiv = true
[[quelle]]
id = "spiegel"
name = "Der Spiegel"
typ = "rss"
url = "https://www.spiegel.de/schlagzeilen/index.rss"
land = "DE"
traeger = "privat"
ressort = "allgemein"
lizenz_status = "offen"
robots_geprueft_am = 2026-09-04
aktiv = true
[[quelle]]
id = "zeit"
name = "Die Zeit"
typ = "rss"
url = "https://newsfeed.zeit.de/index"
land = "DE"
traeger = "privat"
ressort = "allgemein"
lizenz_status = "offen"
robots_geprueft_am = 2026-09-04
aktiv = true
[[quelle]]
id = "faz"
name = "Frankfurter Allgemeine Zeitung"
typ = "rss"
url = "https://www.faz.net/rss/aktuell/"
land = "DE"
traeger = "privat"
ressort = "allgemein"
lizenz_status = "offen"
robots_geprueft_am = 2026-09-04
aktiv = true
[[quelle]]
id = "sz"
name = "Sueddeutsche Zeitung"
typ = "rss"
url = "https://rss.sueddeutsche.de/rss/Topthemen"
land = "DE"
traeger = "privat"
ressort = "allgemein"
lizenz_status = "offen"
robots_geprueft_am = 2026-09-04
aktiv = true
[[quelle]]
id = "welt"
name = "Die Welt"
typ = "rss"
url = "https://www.welt.de/feeds/latest.rss"
land = "DE"
traeger = "privat"
ressort = "allgemein"
lizenz_status = "offen"
robots_geprueft_am = 2026-09-04
aktiv = true
[[quelle]]
id = "taz"
name = "die tageszeitung"
typ = "rss"
url = "https://taz.de/!p4608;rss/"
land = "DE"
traeger = "genossenschaft"
ressort = "allgemein"
lizenz_status = "offen"
robots_geprueft_am = 2026-09-04
aktiv = true
[[quelle]]
id = "ntv"
name = "n-tv"
typ = "rss"
url = "https://www.n-tv.de/rss"
land = "DE"
traeger = "privat"
ressort = "allgemein"
lizenz_status = "offen"
robots_geprueft_am = 2026-09-04
aktiv = true
[[quelle]]
id = "heise"
name = "heise online"
typ = "rss"
url = "https://www.heise.de/rss/heise-atom.xml"
land = "DE"
traeger = "privat"
ressort = "technik"
lizenz_status = "offen"
robots_geprueft_am = 2026-09-04
aktiv = true
[[quelle]]
id = "dlf"
name = "Deutschlandfunk"
typ = "rss"
url = "https://www.deutschlandfunk.de/nachrichten-100.rss"
land = "DE"
traeger = "oeffentlich-rechtlich"
ressort = "allgemein"
lizenz_status = "offen"
robots_geprueft_am = 2026-09-04
aktiv = true
[[quelle]]
id = "handelsblatt"
name = "Handelsblatt"
typ = "rss"
url = "https://www.handelsblatt.com/contentexport/feed/schlagzeilen"
land = "DE"
traeger = "privat"
ressort = "wirtschaft"
lizenz_status = "offen"
robots_geprueft_am = 2026-09-04
aktiv = true
[[quelle]]
id = "derstandard"
name = "Der Standard"
typ = "rss"
url = "https://www.derstandard.at/rss"
land = "AT"
traeger = "privat"
ressort = "allgemein"
lizenz_status = "offen"
robots_geprueft_am = 2026-09-04
aktiv = true
# --- gesperrt: robots.txt verbietet den Abruf des Feed-Pfades ---------------
[[quelle]]
id = "fr"
name = "Frankfurter Rundschau"
typ = "rss"
url = "https://www.fr.de/rssfeed.rdf"
land = "DE"
traeger = "privat"
ressort = "allgemein"
lizenz_status = "gesperrt"
robots_geprueft_am = 2026-09-04
aktiv = false
notiz = "robots.txt: Disallow fuer den Feed-Pfad (geprueft 2026-09-04)"
[[quelle]]
id = "nzz"
name = "Neue Zuercher Zeitung"
typ = "rss"
url = "https://www.nzz.ch/recent.rss"
land = "CH"
traeger = "privat"
ressort = "allgemein"
lizenz_status = "gesperrt"
robots_geprueft_am = 2026-09-04
aktiv = false
notiz = "robots.txt: Disallow fuer den Feed-Pfad (geprueft 2026-09-04)"
# --- kaputt / offen ---------------------------------------------------------
[[quelle]]
id = "br24"
name = "BR24"
typ = "rss"
url = "https://www.br.de/nachrichten/rss/alle-meldungen.xml"
land = "DE"
traeger = "oeffentlich-rechtlich"
ressort = "allgemein"
lizenz_status = "ungeprueft"
aktiv = false
notiz = "URL liefert 404 (2026-09-04), Ersatz-URL suchen"
# --- Telegram: Register vorbereitet, Fetcher noch nicht implementiert -------
# Die Bot-API kann fremde Kanaele nicht lesen. Noetig ist MTProto (Telethon)
# mit eigener api_id/api_hash von my.telegram.org. `t.me/s/<kanal>` waere die
# Notloesung, ist aber HTML-Scraping und bricht bei Markup-Aenderungen.
[[quelle]]
id = "tg_tagesschau"
name = "tagesschau (Telegram)"
typ = "telegram"
url = "tagesschau"
land = "DE"
traeger = "oeffentlich-rechtlich"
ressort = "allgemein"
lizenz_status = "ungeprueft"
aktiv = false
notiz = "Fetcher fehlt noch (Telethon)"