Initiales Ingest-Repo (aus gdelt-bot/ingest überführt)
Poller, Schema, Quadlet-Units und Quellenregister aus dem Monorepo gdelt-bot in ein eigenes Repo ausgelagert. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01VzNVf1KaHPZ1fzJT2jd18j
This commit is contained in:
+218
@@ -0,0 +1,218 @@
|
||||
# Quellenregister
|
||||
#
|
||||
# Einzige Wahrheit ueber die Quellen. Der Poller synchronisiert die Tabelle
|
||||
# `quellen` bei jedem Start aus dieser Datei.
|
||||
#
|
||||
# lizenz_status:
|
||||
# offen - robots.txt erlaubt den Abruf, Feed wird gepollt
|
||||
# gesperrt - robots.txt oder AGB verbieten den Abruf, Feed wird NICHT gepollt
|
||||
# ungeprueft - noch nicht geprueft, wird NICHT gepollt
|
||||
#
|
||||
# `aktiv = false` schaltet eine Quelle ab, ohne sie aus dem Register zu loeschen.
|
||||
# Geloescht wird nie: die Historie soll nachvollziehbar bleiben.
|
||||
#
|
||||
# Geprueft am 2026-09-04 mit User-Agent aus poller.py (siehe USER_AGENT).
|
||||
# Neupruefung: `python poller.py --check-robots`
|
||||
|
||||
[[quelle]]
|
||||
id = "tagesschau"
|
||||
name = "tagesschau.de"
|
||||
typ = "rss"
|
||||
url = "https://www.tagesschau.de/index~rss2.xml"
|
||||
land = "DE"
|
||||
traeger = "oeffentlich-rechtlich"
|
||||
ressort = "allgemein"
|
||||
lizenz_status = "offen"
|
||||
robots_geprueft_am = 2026-09-04
|
||||
aktiv = true
|
||||
|
||||
[[quelle]]
|
||||
id = "spiegel"
|
||||
name = "Der Spiegel"
|
||||
typ = "rss"
|
||||
url = "https://www.spiegel.de/schlagzeilen/index.rss"
|
||||
land = "DE"
|
||||
traeger = "privat"
|
||||
ressort = "allgemein"
|
||||
lizenz_status = "offen"
|
||||
robots_geprueft_am = 2026-09-04
|
||||
aktiv = true
|
||||
|
||||
[[quelle]]
|
||||
id = "zeit"
|
||||
name = "Die Zeit"
|
||||
typ = "rss"
|
||||
url = "https://newsfeed.zeit.de/index"
|
||||
land = "DE"
|
||||
traeger = "privat"
|
||||
ressort = "allgemein"
|
||||
lizenz_status = "offen"
|
||||
robots_geprueft_am = 2026-09-04
|
||||
aktiv = true
|
||||
|
||||
[[quelle]]
|
||||
id = "faz"
|
||||
name = "Frankfurter Allgemeine Zeitung"
|
||||
typ = "rss"
|
||||
url = "https://www.faz.net/rss/aktuell/"
|
||||
land = "DE"
|
||||
traeger = "privat"
|
||||
ressort = "allgemein"
|
||||
lizenz_status = "offen"
|
||||
robots_geprueft_am = 2026-09-04
|
||||
aktiv = true
|
||||
|
||||
[[quelle]]
|
||||
id = "sz"
|
||||
name = "Sueddeutsche Zeitung"
|
||||
typ = "rss"
|
||||
url = "https://rss.sueddeutsche.de/rss/Topthemen"
|
||||
land = "DE"
|
||||
traeger = "privat"
|
||||
ressort = "allgemein"
|
||||
lizenz_status = "offen"
|
||||
robots_geprueft_am = 2026-09-04
|
||||
aktiv = true
|
||||
|
||||
[[quelle]]
|
||||
id = "welt"
|
||||
name = "Die Welt"
|
||||
typ = "rss"
|
||||
url = "https://www.welt.de/feeds/latest.rss"
|
||||
land = "DE"
|
||||
traeger = "privat"
|
||||
ressort = "allgemein"
|
||||
lizenz_status = "offen"
|
||||
robots_geprueft_am = 2026-09-04
|
||||
aktiv = true
|
||||
|
||||
[[quelle]]
|
||||
id = "taz"
|
||||
name = "die tageszeitung"
|
||||
typ = "rss"
|
||||
url = "https://taz.de/!p4608;rss/"
|
||||
land = "DE"
|
||||
traeger = "genossenschaft"
|
||||
ressort = "allgemein"
|
||||
lizenz_status = "offen"
|
||||
robots_geprueft_am = 2026-09-04
|
||||
aktiv = true
|
||||
|
||||
[[quelle]]
|
||||
id = "ntv"
|
||||
name = "n-tv"
|
||||
typ = "rss"
|
||||
url = "https://www.n-tv.de/rss"
|
||||
land = "DE"
|
||||
traeger = "privat"
|
||||
ressort = "allgemein"
|
||||
lizenz_status = "offen"
|
||||
robots_geprueft_am = 2026-09-04
|
||||
aktiv = true
|
||||
|
||||
[[quelle]]
|
||||
id = "heise"
|
||||
name = "heise online"
|
||||
typ = "rss"
|
||||
url = "https://www.heise.de/rss/heise-atom.xml"
|
||||
land = "DE"
|
||||
traeger = "privat"
|
||||
ressort = "technik"
|
||||
lizenz_status = "offen"
|
||||
robots_geprueft_am = 2026-09-04
|
||||
aktiv = true
|
||||
|
||||
[[quelle]]
|
||||
id = "dlf"
|
||||
name = "Deutschlandfunk"
|
||||
typ = "rss"
|
||||
url = "https://www.deutschlandfunk.de/nachrichten-100.rss"
|
||||
land = "DE"
|
||||
traeger = "oeffentlich-rechtlich"
|
||||
ressort = "allgemein"
|
||||
lizenz_status = "offen"
|
||||
robots_geprueft_am = 2026-09-04
|
||||
aktiv = true
|
||||
|
||||
[[quelle]]
|
||||
id = "handelsblatt"
|
||||
name = "Handelsblatt"
|
||||
typ = "rss"
|
||||
url = "https://www.handelsblatt.com/contentexport/feed/schlagzeilen"
|
||||
land = "DE"
|
||||
traeger = "privat"
|
||||
ressort = "wirtschaft"
|
||||
lizenz_status = "offen"
|
||||
robots_geprueft_am = 2026-09-04
|
||||
aktiv = true
|
||||
|
||||
[[quelle]]
|
||||
id = "derstandard"
|
||||
name = "Der Standard"
|
||||
typ = "rss"
|
||||
url = "https://www.derstandard.at/rss"
|
||||
land = "AT"
|
||||
traeger = "privat"
|
||||
ressort = "allgemein"
|
||||
lizenz_status = "offen"
|
||||
robots_geprueft_am = 2026-09-04
|
||||
aktiv = true
|
||||
|
||||
# --- gesperrt: robots.txt verbietet den Abruf des Feed-Pfades ---------------
|
||||
|
||||
[[quelle]]
|
||||
id = "fr"
|
||||
name = "Frankfurter Rundschau"
|
||||
typ = "rss"
|
||||
url = "https://www.fr.de/rssfeed.rdf"
|
||||
land = "DE"
|
||||
traeger = "privat"
|
||||
ressort = "allgemein"
|
||||
lizenz_status = "gesperrt"
|
||||
robots_geprueft_am = 2026-09-04
|
||||
aktiv = false
|
||||
notiz = "robots.txt: Disallow fuer den Feed-Pfad (geprueft 2026-09-04)"
|
||||
|
||||
[[quelle]]
|
||||
id = "nzz"
|
||||
name = "Neue Zuercher Zeitung"
|
||||
typ = "rss"
|
||||
url = "https://www.nzz.ch/recent.rss"
|
||||
land = "CH"
|
||||
traeger = "privat"
|
||||
ressort = "allgemein"
|
||||
lizenz_status = "gesperrt"
|
||||
robots_geprueft_am = 2026-09-04
|
||||
aktiv = false
|
||||
notiz = "robots.txt: Disallow fuer den Feed-Pfad (geprueft 2026-09-04)"
|
||||
|
||||
# --- kaputt / offen ---------------------------------------------------------
|
||||
|
||||
[[quelle]]
|
||||
id = "br24"
|
||||
name = "BR24"
|
||||
typ = "rss"
|
||||
url = "https://www.br.de/nachrichten/rss/alle-meldungen.xml"
|
||||
land = "DE"
|
||||
traeger = "oeffentlich-rechtlich"
|
||||
ressort = "allgemein"
|
||||
lizenz_status = "ungeprueft"
|
||||
aktiv = false
|
||||
notiz = "URL liefert 404 (2026-09-04), Ersatz-URL suchen"
|
||||
|
||||
# --- Telegram: Register vorbereitet, Fetcher noch nicht implementiert -------
|
||||
# Die Bot-API kann fremde Kanaele nicht lesen. Noetig ist MTProto (Telethon)
|
||||
# mit eigener api_id/api_hash von my.telegram.org. `t.me/s/<kanal>` waere die
|
||||
# Notloesung, ist aber HTML-Scraping und bricht bei Markup-Aenderungen.
|
||||
|
||||
[[quelle]]
|
||||
id = "tg_tagesschau"
|
||||
name = "tagesschau (Telegram)"
|
||||
typ = "telegram"
|
||||
url = "tagesschau"
|
||||
land = "DE"
|
||||
traeger = "oeffentlich-rechtlich"
|
||||
ressort = "allgemein"
|
||||
lizenz_status = "ungeprueft"
|
||||
aktiv = false
|
||||
notiz = "Fetcher fehlt noch (Telethon)"
|
||||
Reference in New Issue
Block a user