LLM-Poisoning
LLM-Poisoning (auf Deutsch: „KI-Vergiftung“) ist ein gezielter Angriff auf ein KI-Modell (wie ChatGPT oder Google Gemini), bei dem Angreifer bewusst falsche oder manipulierte Daten in die Trainingsdaten der KI einschleusen.
Das Ziel ist es, das Modell zu manipulieren, damit es später Fehler macht, falsche Antworten gibt oder Sicherheitsregeln umgeht.
Ein einfaches Beispiel - dazu, wie es funktioniert:
Stellt euch vor, ein Kind lernt Früchte anhand eines Bilderbuchs.
• Normalerweise lernt es: Ein roter, runder Ball mit einem Stiel ist ein Apfel.
• Nun schleicht sich nachts jemand ins Zimmer und überklebt heimlich alle Bilder von Äpfeln mit dem Wort „Banane“.
• Wenn das Kind das nächste Mal einen echten Apfel sieht, wird es voller Überzeugung sagen: „Das ist eine Banane!“
Genau das passiert beim LLM-Poisoning.
Da KIs mit riesigen Datenmengen aus dem Internet trainiert werden, können Angreifer manipulierte Webseiten, Forenbeiträge oder Fake-News-Artikel platzieren. Wenn die KI diese Daten liest und daraus lernt, übernimmt sie die Fehler.
Das Ziel ist es, das Modell zu manipulieren, damit es später Fehler macht, falsche Antworten gibt oder Sicherheitsregeln umgeht.
Ein einfaches Beispiel - dazu, wie es funktioniert:
Stellt euch vor, ein Kind lernt Früchte anhand eines Bilderbuchs.
• Normalerweise lernt es: Ein roter, runder Ball mit einem Stiel ist ein Apfel.
• Nun schleicht sich nachts jemand ins Zimmer und überklebt heimlich alle Bilder von Äpfeln mit dem Wort „Banane“.
• Wenn das Kind das nächste Mal einen echten Apfel sieht, wird es voller Überzeugung sagen: „Das ist eine Banane!“
Genau das passiert beim LLM-Poisoning.
Da KIs mit riesigen Datenmengen aus dem Internet trainiert werden, können Angreifer manipulierte Webseiten, Forenbeiträge oder Fake-News-Artikel platzieren. Wenn die KI diese Daten liest und daraus lernt, übernimmt sie die Fehler.
Zuletzt bearbeitet von Pesu07 am 03.10.2026 um 06:16 Uhr