Warum scheint ChatGPT den Wikipedia-Artikel meines Unternehmens wörtlich zu übernehmen, wenn ich nach uns frage?
Weil Wikipedia gleichzeitig in den Trainingsdaten des Modells verankert ist, ein bevorzugtes Ziel für den Live-Abruf darstellt und die strukturierte Entitätsebene (Knowledge Graph und Wikidata) speist, die einige Suchmaschinen direkt abfragen. Alle drei Wege führen zum selben Artikel. Wenn ein Unternehmen also über einen verfügt, orientiert sich die KI-Antwort meist eng daran.
Wenn ChatGPT Ihnen scheinbar Ihren eigenen Wikipedia-Artikel vorliest, hat das einen strukturellen Grund. Wikipedia erreicht eine KI-Engine über drei separate Kanäle gleichzeitig: Trainingsdaten, Live-Abruf und strukturierte Entitätsdaten. Da alle drei auf denselben Artikel zusammenlaufen, orientiert sich die KI-Antwort über ein Unternehmen meist eng am Wikipedia-Artikel. Hier ist eine Erklärung, wie jeder Kanal funktioniert.

Kanal 1: Trainingsdaten
Wikipedia war Teil des grundlegenden Trainingskorpus für die führenden KI-Modelle. BERT, eine der Architekturen, die die meisten modernen Sprachmodelle beeinflusst hat, wurde mit rund 2,5 Milliarden Wörtern der englischsprachigen Wikipedia sowie mit Buchtexten trainiert. GPT-3 enthielt etwa 3 Milliarden Wikipedia-Token in seinem Trainingsmix. Da dieses Training stattfindet, bevor eine spezifische Suchanfrage gestellt wird, verfügt das Modell bereits über eine grundlegende Beschreibung der meisten Entitäten mit Wikipedia-Artikeln, noch bevor es auf das Live-Web zugreift.
Kanal 2: Live-Abruf
Suchmaschinen mit Abruffunktion, die zum Zeitpunkt der Anfrage Live-Websuchen durchführen, zitieren Wikipedia durchweg als eine ihrer am höchsten gewichteten Quellen. Semrush-Daten aus einer mehrmonatigen Zitationsstudie ergaben, dass Reddit und Wikipedia die beiden am häufigsten zitierten Domains von ChatGPT blieben. Die Analyse von Zitationsmustern über KI-Plattformen hinweg durch Profound ergab, dass Wikipedia die am häufigsten zitierte Einzelquelle von ChatGPT ist und im gemessenen Zeitraum rund 7,8 % der gesamten Zitationen ausmachte. Wenn eine Engine Seiten abruft, um eine Antwort zu generieren, ist der Wikipedia-Artikel für die genannte Entität in der Regel eine der ersten Seiten, die sie heranzieht.
Kanal 3: Strukturierte Entitätsdaten
Wikipedia ist eng mit Wikidata verknüpft, das als zentraler Knotenpunkt fungiert und alle Sprachversionen eines Artikels mit einem zugrunde liegenden Entitätsdatensatz verbindet. Die Sitelinks von Wikidata ermöglichen eine einfache Navigation zwischen den Sprachversionen, wobei das verknüpfte Wikidata-Objekt als Referenzpunkt dient. Dies ist ein Grund dafür, warum in verschiedenen Sprachausgaben konsistente Fakten auftauchen. Der Knowledge Graph von Google, der Knowledge Panels antreibt und Gemini sowie die Übersicht mit KI speist, greift auf dieselbe Ebene zurück. Selbst eine Engine, die den Text des Wikipedia-Artikels nicht liest, kann also Entitätsfakten – Gründungsdatum, Hauptsitz, Führungsebene, Kategorie – abrufen, die aus der Infobox desselben Artikels stammen.
Warum der Eindruck einer wörtlichen Übernahme entsteht und was die Belege zeigen
KI-Text, der sich eng an spezifische Wikipedia-Formulierungen anlehnt, ist das Ergebnis aller drei Kanäle, die dieselbe Quelle verstärken. Die Gewichtung im Training, die Präferenz beim Live-Abruf und die Entitätsdatenebene verweisen alle auf denselben Artikel, sodass die Synthese diesem folgt. Wie genau ein bestimmtes Modell den exakten Wortlaut des Artikels wiedergibt, variiert je nach Modellarchitektur und Art der Suchanfrage. Bisher hat keine veröffentlichte Messung eine wörtliche Übereinstimmungsrate quantifiziert. Die Zitationsdaten belegen jedoch, dass Wikipedia einer der am stärksten gewichteten Inputs ist. Wenn der Artikel einen Fehler, eine unglückliche Formulierung oder eine veraltete Beschreibung enthält, ist es genau diese Version des Unternehmens, die die KI tendenziell ausgibt.
Was Sie dagegen tun können
Da alle drei Kanäle auf denselben Artikel zurückgehen, ist die Verbesserung des Artikels eine der wirkungsvollsten Maßnahmen in einem KI-Reputationsprogramm. Die Arbeit erfolgt über die ordnungsgemäß offengelegten Kanäle für Interessenkonflikte: Bearbeitungsanfragen auf der Diskussionsseite unter Angabe verlässlicher Sekundärquellen, Verbesserungen der Belege und die Wahrung eines neutralen Standpunkts. Das Ziel ist kein schmeichelhafter Artikel, sondern ein korrekter, ausgewogener und gut belegter. Denn genau diese Eigenschaften halten den Artikel glaubwürdig genug, damit sich die Engines weiterhin darauf verlassen.
Zuletzt überprüft: 19/05/2026