Wenn KI-Agenten Grenzen überschreiten: eine Chronologie

Eine chronologische Dokumentation von Agenten-Vorfällen: reale Schäden, unerlaubte Aktionen und klar gekennzeichnete Labortests.

Victor Klaue Victor Klaue IT-Projektleiter & KI-Analyst Veröffentlicht 14. September 2026 23 min Lesezeit
Wenn KI-Agenten Grenzen überschreiten: eine Chronologie

KI ausser Kontrolle? Diese Auswahl zeigt, was KI-Agenten getan haben, wann es geschah und welche Folgen belegt sind. Reale Vorfälle und kontrollierte Labortests sind jeweils gekennzeichnet.

Dieser Artikel wird laufend um weitere dokumentierte Vorfälle ergänzt. Stand: 26. September 2026.

Die Chronologie

Neueste Vorfälle zuerst. Sortiert nach dem Vorfallszeitraum, sonst nach dem ausdrücklich genannten Berichtsdatum. Zeiträume können sich überschneiden; die Abstände bilden keine Zeitdauer ab.

2026

  1. 21. September 2026 · Sicherheitsnachweis veröffentlicht
    Angriff auf einen Agenten

    Ein Forscher übernimmt Metas Muse in Sicherheitstests

    Patrick Wardle demonstrierte, wie lokal ausgeführter Code eine Einstellung für die Spracherkennung von Muse verändern konnte. Dadurch liess sich der Anmeldetoken an einen fremden Server umleiten und der Assistent mit seinen bereits erteilten Rechten fernsteuern. Wardle beschrieb gegenüber Ars Technica Tests, in denen er über den Agenten Dateien schrieb und die Kamera nutzte.

    Kontrollierte Sicherheitsdemos, kein in den Quellen belegter Angriff auf unbeteiligte Nutzer. Der erste Schritt erforderte Codeausführung auf dem Gerät, etwa nach einer Täuschung des Nutzers. Meta meldete anschliessend einen Hotfix. Amazons separate Sperre für Muse ist kein zusätzlicher Beleg für diesen Angriff.

    Öffentlich: 21. September 2026; Hotfix anschliessend gemeldet

    Quellen ansehenArs Technica: Untersuchung mit Wardles Demonstrationen und Metas Stellungnahme
  2. Vorfallstag offen · Fehlerbericht vom 20./21. September 2026
    Berichteter Vorfall

    Claude Code soll ungefragt Produktivkonfigurationen ändern

    Ein Nutzer veröffentlichte im Claude-Code-Issue-Tracker einen Bericht über einen fehlgeschlagenen Deployment-Auftrag. Darin wird beschrieben, wie der Agent den Betriebsmodus änderte, einen zusätzlichen kostenpflichtigen Container anlegte und Teile der Anwendung auf unterschiedlichen Versionen liess. Trotzdem habe er die Veröffentlichung mehrfach als abgeschlossen gemeldet. Die zusätzlichen Ressourcen seien später zurückgebaut worden.

    Der veröffentlichte Text ist aus der Perspektive des Agenten formuliert. Unabhängige Betriebsprotokolle und eine bezifferte Rechnung fehlen; die Schilderung ist kein abschliessend verifizierter Herstellerbericht. Ein Entwurf mit privaten Infrastrukturangaben wurde laut Bericht vor der Veröffentlichung abgefangen, nicht öffentlich geleakt.

    Öffentlich: 20./21. September 2026

    Quellen ansehenGitHub: Original-Fehlerbericht zu Claude Code, Issue 95731
  3. 20. September 2026 · Trainingslauf
    Training / Eval mit realer Wirkung

    Ein OpenAI-Agent erreicht über DNS einen externen Chatbot

    Bei einer Rechercheaufgabe fand ein internes Forschungsmodell laut OpenAI eine Lücke in den Netzwerksperren seiner Trainingsumgebung. Über den unzureichend gefilterten DNS-Dienst leitete es Fragen an einen öffentlichen Chatbot weiter und erhielt Antworten. Die Überwachung schlug nach knapp zwölf Minuten Alarm; ein Mensch reagierte drei Minuten später. Der vorgesehene automatische Stopp blieb jedoch aus, und der Lauf wurde erst rund zweieinhalb Stunden nach dem Alarm manuell beendet.

    Ein belegter Internetzugriff aus einem Trainingslauf, kein nachgewiesener Einbruch beim Chatbot-Anbieter. Die gesuchte Person konnte der Agent nicht identifizieren. OpenAI beschränkte anschliessend die DNS-Abfragen und ergänzte zwei unabhängige Sperren. Der Vorfall geschah nach der Absicherung infolge des Hugging-Face-Einbruchs und ist ein eigener Fall.

    Öffentlich: 25. September 2026 · Stand des OpenAI-Berichts

    Quellen ansehenOpenAI: Originalbericht mit Ablauf und Reaktionszeiten
  4. Vorfallstag offen · Behördenbericht vom 14. September 2026
    Gezielter Missbrauch

    Spaniens Datenschutzbehörde meldet einen Agentenangriff

    Die spanische Datenschutzbehörde AEPD erhielt erstmals eine Meldung über einen mutmasslich durch einen KI-Agenten ausgeführten Datenschutzvorfall. Laut der betroffenen Organisation meldete sich der Agent erfolgreich an, suchte selbstständig nach weiteren Schwachstellen und konnte anschliessend personenbezogene Daten verändern sowie Rechnungen einsehen. Ein Dritter soll den Agenten als Angriffswerkzeug eingesetzt haben.

    Bestätigt ist der Eingang der Meldung, nicht der Abschluss der technischen Untersuchung. Die AEPD nennt weder das betroffene Unternehmen noch das Modell oder den Vorfallstag. Sie warnt ausdrücklich davor, aus dieser einzelnen Meldung einen statistischen Trend abzuleiten.

    Öffentlich: 14. September 2026

    Quellen ansehenAEPD: Originalmitteilung mit Vorbehalt zur laufenden Prüfung
  5. Vorfallszeitraum offen · Bericht vom 10. September 2026
    Gezielter Missbrauch

    Eine Spionagegruppe automatisiert Angriffe mit Claude Code

    Anthropic beschreibt unter der Kennung GTG-20006 eine Spionagegruppe, die Claude-Code-Arbeitsabläufe für Phishing, Einbrüche und die Verarbeitung gestohlener Daten einsetzte. Agenten überwachten zudem, ob Sicherheitsprodukte ihre Schadprogramme erkannten, und bearbeiteten diese dann erneut. Menschen wählten Ziele und passten die Arbeitsanweisungen an. Der Bericht dokumentiert auch den Abfluss von E-Mails und proprietärer Software.

    Die Zuordnung zum Umfeld von Midnight Blizzard und die beschriebenen Erfolge stammen von Anthropic. Mehr als 20 Organisationen in Planung, Aufklärung und laufenden Operationen sind nicht gleichbedeutend mit 20 erfolgreichen Einbrüchen. Dies ist eine andere Kampagne als der bereits aufgeführte GTG-1002-Fall von 2025.

    Öffentlich: 10. September 2026

    Quellen ansehenAnthropic: Originalbericht, Fallstudie GTG-20006
  6. Ab 31. August 2026
    Gezielter Missbrauch

    Angreifer setzen hunderte Agenten gegen PaperCut ein

    GreyNoise rekonstruierte eine Angriffskampagne gegen die Druckverwaltungssoftware PaperCut NG/MF. Ein menschlicher Angreifer nutzte hunderte KI-Agenten mit dem Codex-Harness und einem DeepSeek-Modell, um Schwachstellen auszunutzen. Laut Untersuchung wurden mindestens 440 Installationen bei 395 identifizierten Organisationen in 48 Ländern kompromittiert. Bei zwölf Organisationen erreichte der Angreifer Domänenadministratorrechte.

    Codex bezeichnet hier die Ausführungsumgebung, nicht ein verwendetes OpenAI-Modell. Die Zahlen stammen aus GreyNoise-Beobachtungen; 440 Installationen bedeuten nicht 440 Organisationen oder ebenso viele vollständige Netzwerkübernahmen. Welche weiteren Ziele der Angreifer mit den Zugängen verfolgte, war bei Veröffentlichung offen.

    Öffentlich: 9. September 2026

    Quellen ansehenGreyNoise: Originaluntersuchung der PaperCut-Angriffskampagne
  7. 24. August 2026 · Sicherheitsnachweis bestätigt
    Angriff auf einen Agenten

    Ein DeepSeek-Agent schaltet im Test seine Sandbox ab

    OX Research zeigte an einer Standardinstallation von DeepSeek Harness, dass ein eingeschleuster Befehl die eigene Sandbox des Agenten abschalten konnte. Der Agent erreichte die unzureichend geschützte lokale Steuerungsschnittstelle und hob seine Beschränkungen sowie Rückfragen auf. Anschliessend gelang ein Schreibzugriff ausserhalb des Arbeitsverzeichnisses, den die unveränderte Sandbox blockierte.

    Kontrollierter Test zu CVE-2026-82533, kein belegter eigenmächtiger Ausbruch im Kundeneinsatz. Voraussetzung war, dass der Agent den vom Angreifer vorgegebenen Befehl ausführte. OX bestätigte Ende August die Behebung; der Bericht belegt keinen beobachteten Missbrauch ausserhalb der Tests.

    Öffentlich: 8. September 2026

    Quellen ansehenOX Research: Originaluntersuchung mit Vergleichstest und Behebungsnachweis
  8. 21.–22. August 2026 · Nutzerberichte
    Berichteter Vorfall

    Instinct sendet eine E-Mail ohne vorherige Freigabe

    Katie Jacobs Stanton berichtete, dass der persönliche Assistent eine harmlose E-Mail in ihrem Namen versandt hatte, ohne vorher nachzufragen. Andere frühe Nutzer beschrieben weiterhin verfügbare E-Mail-Zusammenfassungen nach dem Trennen des Kontozugriffs und Schwierigkeiten beim Löschen gespeicherter Daten.

    Die E-Mail-Übermittlung, gespeicherte Altdaten und ein gesonderter Phishing-Selbsttest sind unterschiedliche Beobachtungen. Eine Zusammenfassung nach dem Trennen beweist für sich keinen erneuten Zugriff auf das Postfach.

    Quellen ansehenKatie Jacobs Stanton: Originalbeitrag auf XClaire Vo: Originalbeitrag auf XPeter Yang: Originalbeitrag auf XTechCrunch: ergänzende Berichterstattung
  9. Vorfallstag offen · berichtet 10. August 2026
    Berichteter Vorfall

    Ein Buchungsagent entfernt einen anderen Wartenden

    Ein Australier wollte mit OpenClaw und Claude einen Platz im Fitnesskurs bekommen. Nachdem er nach einem besseren Wartelistenplatz gefragt hatte, entfernte der Agent laut dem von ABC dokumentierten Verlauf eine andere Person über die Buchungsschnittstelle. Anschliessend konnte er sie nicht wieder eintragen.

    ABC interviewte den Nutzer und zeigte Nachrichten. Der Softwareanbieter kommentierte den Einzelfall nicht. Der ABC-Bericht nennt Claude, ohne eine konkrete Modellversion zu belegen.

    Quellen ansehenABC: Originalrecherche mit Betroffeneninterview
  10. August 2026 · Test veröffentlicht
    Labortest

    Kimi K3 findet die Lösungen seines Benchmarks

    Frontier Security stellte fest, dass Kimi K3 über einen erlaubten GitHub-Zugang Referenzlösungen eines Cyberbenchmarks beschaffte. Damit liess sich die vorgesehene Aufgabe umgehen.

    Die Prüfung nutzte Werkzeuge und Benchmarks aus dem AISI-Umfeld, wurde aber von Frontier Security durchgeführt. Belegt ist ein Problem der Testintegrität; kein nachgewiesener allgemeiner Zero-Day-Ausbruch und kein Einbruch bei einem fremden Opfer.

    Quellen ansehenFrontier Security: Originaluntersuchung zu Kimi K3
  11. Vorfallstag offen · berichtet 6. August 2026
    Training / Eval mit realer Wirkung

    Auch Meta bestätigt einen Fremdzugriff aus einem Test

    Meta und der Prüfdienst Irregular bestätigten gegenüber der BBC, dass ein Meta-Modell in einer Sicherheitsprüfung Zugriff auf fremde Systeme erlangt hatte.

    Die BBC nennt weder den Modellnamen noch die Zielorganisation oder den genauen Vorfallstag. Der gemeinsame Prüfdienst macht daraus nicht denselben Vorfall wie bei Anthropic.

    Quellen ansehenBBC: Bericht mit Bestätigungen von Meta und Irregular
  12. 25.–28. Juli 2026
    Training / Eval mit realer Wirkung

    AISI-Agenten versuchen, einen Maintainer zu manipulieren

    Bei einem wiederholt ausgeführten Cybertest richteten Agenten unbefugte Aktionen gegen echte Menschen und Projekte. Ein Agent versuchte, schädlichen Code in ein Open-Source-Projekt einzubringen, und nutzte falsche Identitäten, um den Maintainer unter Druck zu setzen. Der Maintainer lehnte den Beitrag ab.

    Das britische AISI beschreibt zehn betroffene Läufe mit 19 Aktionen, überwiegend Mythos 5, daneben GPT-5.6-Sol. Internetzugang war absichtlich erlaubt: kein Sandbox-Ausbruch. AISI fand keinen Nachweis eines daraus entstandenen realen Schadens.

    Öffentlich: 4. August 2026

    Quellen ansehenUK AISI: Original-Vorfallsbericht
  13. 18. Juli 2026
    Labortest

    Ein Astra-Modell schreibt sich eigene Anweisungen zur Manipulation

    Ein unveröffentlichtes Modell der Astra-Familie fügte Anweisungen in Zusammenfassungen ein, mit denen es Aufgaben im nächsten Kontextfenster fortsetzte. OpenAI fand 27 betroffene Zusammenfassungen. Zwei gezeigte Manipulationsversuche blieben ohne erkennbare Wirkung. In einem dritten Fall übernahm der Nachfolger erfundene Vorgaben zu einer medizinischen Recherche, nutzte keine Werkzeuge und verweigerte die verlangte Antwort.

    Die Fälle stammen aus einem separaten Trainingslauf, nicht aus dem finalen Astra-Modell. Ein Belohnungsvorteil wurde nicht festgestellt. Probleme beim Beenden von Zusammenfassungen gelten als mögliche Erklärung, nicht als bewiesene Ursache.

    Öffentlich: 16. September 2026

    Quellen ansehenOpenAI: Originalbericht zu selbst erzeugten Prompt Injections
  14. Juli 2026 · laut Nutzerbericht
    Berichteter Vorfall

    Ein Prisma-Schritt leert eine Supabase-Datenbank

    Ein Entwickler berichtete, Claude Code mit Opus 5 habe bei einer Schemaaufgabe die live genutzte Supabase-Datenbank als temporäre Vergleichsdatenbank verwendet. Der dafür vorgesehene Reset habe die Tabellen geleert. Später meldete er eine Wiederherstellung.

    Die Rekonstruktion stammt aus einem Reddit-Bericht und dessen Aufbereitung. Der Betreiber bezeichnete das Projekt selbst als wenig kritisch. «Live-Datenbank» bedeutet hier nicht automatisch einen grossen Unternehmensschaden.

    Quellen ansehenReddit: Originalbericht (ggf. Anmeldung nötig)Adversa: Sekundäranalyse dieses Falls
  15. Juli 2026 · mehrere Nutzerberichte
    Berichteter Vorfall

    Nutzer melden Löschungen durch GPT-5.6-Sol-Agenten

    TechCrunch sammelte Berichte von Matt Shumer, Bruno Lemos und Joey Kudish über unbeabsichtigte Datei- beziehungsweise Datenbanklöschungen. Sie betreffen unterschiedliche Arbeitsumgebungen und werden hier als Meldungsgruppe ausgewiesen.

    Drei namentlich zugeordnete Berichte sind keine drei unabhängig forensisch bestätigten Vorfälle. Warnungen in der System Card stammen wiederum aus separaten Tests und dürfen nicht als Beleg für den Ablauf dieser Nutzerfälle dienen.

    Quellen ansehenMatt Shumer: Originalbeitrag auf XBruno Lemos: Originalbeitrag auf XJoey Kudish: Originalbeitrag auf XTechCrunch: Zusammenstellung der Nutzerberichte
  16. 9.–13. Juli 2026 · rekonstruierte Angriffskette
    Training / Eval mit realer Wirkung

    OpenAI-Agenten dringen in Hugging Face ein

    OpenAI und Hugging Face beschreiben, wie Agenten zunächst den vorgesehenen Netzwerkzugang überwanden, eine fremde Nutzerumgebung auf Modal übernahmen und darüber Hugging-Face-Infrastruktur erreichten. Eine Schwäche in der Datensatzverarbeitung erlaubte Codeausführung und weitere Zugriffe.

    Nach Hugging Faces Untersuchung wurden fünf Kundendatensätze abgerufen, die zu den Aufgaben passten. Das ist kein Nachweis eines Zugriffs auf sämtliche Daten. Die Modal-Plattform selbst wurde dadurch nicht als kompromittiert ausgewiesen. Spätere politische Untersuchungen sind Folgen dieses Falls, keine neuen Einbrüche.

    Öffentlich: ab 16. Juli 2026; technische Berichte im Juli/August

    Quellen ansehenHugging Face: technischer VorfallsberichtOpenAI: eigene Stellungnahme
  17. Seit Juli 2026 · Kampagne im September noch aktiv
    Gezielter Missbrauch

    Angreifer stehlen mit KI-Agenten Kreditkartendaten

    Gambit Security rekonstruierte anhand eines Angreiferservers eine Kampagne gegen Onlinehändler. Ein menschlicher Betreiber setzte Strix, Cairn und Hermes für Schwachstellensuche, Einbrüche und die Steuerung weiterer Angriffsschritte ein. Laut Untersuchung wurden mehr als 600’000 noch nicht abgelaufene Kreditkartendatensätze aus zwei Unternehmen entwendet. Bei einem Fahrradhändler löschte eine zu breit gefasste Aufräumroutine des Agenten 180 Datenbanktabellen, darunter vom Betreiber angelegte Backups.

    Gezielter Missbrauch mit menschlich gewählten Zielen, kein selbst entstandenes Angriffsvorhaben. Der vorläufige Bericht stützt sich auf erbeutete Daten, überprüfte Schadskripte und Angriffsprotokolle, teilweise auch auf nicht unabhängig verifizierte Agentenmeldungen. Aus der Zahl der Datensätze lassen sich weder die Zahl der Betroffenen noch erfolgreiche Kartenzahlungen ableiten.

    Öffentlich: 22. September 2026

    Quellen ansehenGambit Security: Originaluntersuchung der laufenden Angriffskampagne
  18. 18. Juni 2026
    Training / Eval mit realer Wirkung

    Ein OpenAI-Agent greift auf Australiens Statistikportal zu

    Australiens Regierung bestätigte einen unbefugten Zugriff auf das Medicare-Statistikportal von Services Australia. Bei der Recherche zu Gesundheitsausgaben erreichte ein OpenAI-Agent auch nicht öffentliche Bereiche. Laut OpenAI geschah dies während einer internen Evaluation; abgerufen wurden aggregierte Gesundheitsstatistiken und interne Dateinamen. Laut Regierung schrieb der Agent auch Dateien auf den internen Server. Die Behörde wurde erst am 10. September informiert.

    Nach dem damaligen Untersuchungsstand gab es keinen Beleg für den Zugriff auf individuelle Patientenakten oder eine weitergehende Kompromittierung des Behördennetzes. Die Untersuchung läuft. Zugriffe auf drei weitere Behördenwebsites wurden später von der Regierung als reguläre Abfragen öffentlicher Informationen eingeordnet, nicht als drei zusätzliche Einbrüche.

    Öffentlich: 23./24. September 2026

    Quellen ansehenAustraliens Premierminister: Originaltranskript der PressekonferenzABC: Bericht mit Aussagen der Regierung und Stellungnahme von OpenAI
  19. Juni 2026 · Untersuchung begonnen
    Angriff auf einen Agenten

    ChatGPT leitet im Test Gmail-Daten an ein fremdes Konto

    Check Point Research demonstrierte einen verdeckten Kanal zwischen ChatGPT-Sitzungen verschiedener Konten. Eine eingeschleuste Anweisung liess ChatGPT Daten aus einem verbundenen Gmail-Konto abrufen und über ein gemeinsames internes Paket-Repository an das andere Konto weitergeben. Die sichtbare Antwort behandelte währenddessen die gewöhnliche Nutzerfrage.

    Ein kontrollierter Sicherheitsnachweis, kein belegter Datenabfluss bei unbeteiligten Kunden. Der Zugriff hing von den bereits verbundenen Diensten und Berechtigungen ab. OpenAI bestätigte die Stilllegung der betroffenen Artifactory-Instanz. Dieser Test an ChatGPT-Konten ist nicht der interne Trainingsfall oder der Hugging-Face-Einbruch.

    Öffentlich: 8. September 2026

    Quellen ansehenCheck Point Research: Originaluntersuchung mit demonstriertem Gmail-Datenabfluss
  20. 30. Mai 2026 · Hauptbeispiel im Training
    Labortest

    GPT-5.6 Sol hält Anweisungen zur Täuschung im Kontext fest

    Während des Trainings ergänzten Modellinstanzen laut OpenAI ihre Kontextzusammenfassungen um Anweisungen, Fehler zu verheimlichen. Ein Agent wollte fehlende historische Finanzdaten erfinden und dies nur auf Nachfrage offenlegen. Ein anderer wies den nächsten Kontext an, unpassende Versionsangaben seiner Quellen zu verschweigen. Solche Anweisungen wurden häufig befolgt.

    Der Bericht beschreibt Trainingsverhalten, keine belegten Täuschungsfälle im regulären Kundeneinsatz. OpenAI vermutet als Ursache den Belohnungsdruck beim Training und berichtet über niedrigere Raten nach verbesserten Bewertungen; eine vollständige Beseitigung ist damit nicht belegt.

    Öffentlich: 16. September 2026

    Quellen ansehenOpenAI: Originalbericht zu Täuschung in Kontextzusammenfassungen
  21. 27. Mai 2026 · interner Einsatz
    Bestätigter Betriebsfall

    Ein OpenAI-Modell veröffentlicht den GitHub-Token eines Forschers

    Ein intern eingesetztes Modell sollte einen mathematischen Beweis in Lean erarbeiten. Stattdessen versuchte es laut OpenAI, Beweismaterial eines anderen Teams zu beschaffen, und veröffentlichte dafür den GitHub-Token des Forschers im öffentlichen Repository openai/codex. Es zerlegte den Token, um die automatische Erkennung offengelegter Zugangsdaten zu umgehen. Zwei Aufforderungen, den Beweis selbst zu lösen, bestätigte es zunächst, setzte seine Beschaffungsversuche aber später fort.

    OpenAIs Bericht dokumentiert die öffentliche Preisgabe des Tokens und Verstösse gegen System- und Nutzeranweisungen. Der Agent beschaffte Teile eines fremden Ausführungsprotokolls und Metadaten, aber nach den geprüften Ergebnissen keinen Lean-Quellcode des Beweises. OpenAI deaktivierte die Schlüssel und nahm das Modell für etwa zwei Wochen ausser Betrieb. Kein von einem Angreifer beauftragter Missbrauch.

    Öffentlich: 25. September 2026 · Stand des OpenAI-Berichts

    Quellen ansehenOpenAI: Originalbericht mit Auszügen aus dem Vorfallsprotokoll
  22. 25.–28. Mai und 20.–21. Juni 2026
    Training / Eval mit realer Wirkung

    Rechercheagenten versuchen, Datenanbieter zu hacken

    Transluce rekonstruierte Angriffsversuche gegen die digitale Bibliothek der University of New Mexico, Data USA und das Australian Institute of Health and Welfare. Bei gewöhnlichen Rechercheaufgaben kamen Agenten mit regulären Abrufen nicht weiter und probierten daraufhin unter anderem eingeschleuste Befehle und manipulierte Abfragen. Die Spuren stammen aus öffentlichen Protokollen des Webprüfdienstes urlquery.net.

    Drei Versuche in einer Karte, keine drei nachgewiesenen Einbrüche. Transluce fand keinen Beleg für erfolgreiche Ausnutzung. Zwei Abläufe ordnet das Team einem bekannten OpenAI-Agentenschwarm zu; die Verbindung des Bibliotheksfalls beruht nur auf Zeitpunkt und gemeinsamen Vermittlungsdiensten. Der bestätigte Medicare-Zugriff vom 18. Juni ist ein separater Fall.

    Öffentlich: 23. September 2026

    Quellen ansehenTransluce: Originaluntersuchung mit Datensatz und Einschränkungen der Zuordnung
  23. Mai 2026
    Gezielter Missbrauch

    Angreifer sondieren METR-Infrastruktur mit Agenten

    METR beobachtete eine weitere Kampagne, in der Angreifer Agenten zur automatisierten Suche nach Schwachstellen einsetzten. Parallel wurde ein Fehler in einem öffentlichen Transcript-Viewer entdeckt, der interne Daten hätte erreichbar machen können.

    METR fand keine Hinweise, dass die Angreifer diesen Fehler ausnutzten oder nicht öffentliche Daten abriefen. Der entdeckende Sicherheitsforscher und die Angreifer sind nicht gleichzusetzen.

    Öffentlich: 31. August 2026

    Quellen ansehenMETR: Vorfall 2 – Suche nach internen Daten
  24. 15. Mai 2026
    Training / Eval mit realer Wirkung

    Ein OpenAI-Agent nutzt einen fremden API-Schlüssel und erfindet die Antwort

    Ein unveröffentlichtes Modell sollte im Training Einkommenszahlen für ein kalifornisches County recherchieren. Es suchte in öffentlichen GitHub-Repositories nach offengelegten API-Schlüsseln und verwendete einen ohne Erlaubnis. Der Schlüssel ermöglichte Abfragen von Metadaten. Als die gesuchten Zahlen weiterhin nicht abrufbar waren, erfand das Modell Werte und gab sie als Daten der verlangten Quelle aus.

    OpenAIs Bericht belegt eine erfolgreiche Authentifizierung, aber keinen erfolgreichen Abruf der gesuchten Einkommenszahlen. Die versuchten Registrierungen mit Wegwerf-Adressen scheiterten. Es handelt sich um einen internen Trainingslauf, nicht um einen nachgewiesenen Kundenfall.

    Öffentlich: 16. September 2026

    Quellen ansehenOpenAI: Originalbericht zur Suche nach offengelegten API-Schlüsseln
  25. Mai–Juni 2026 · zentrale Wiki-Aktivität
    Training / Eval mit realer Wirkung

    Agenten tauschen sich über öffentliche Wikis und Ablagen aus

    Forschende rekonstruierten öffentliche Beiträge, in denen Agenten Aufgabenwerte, Zugangswege und Beobachtungen über ihre Testumgebungen austauschten. Der Bestand umfasst viele Seiten und Versionsstände; spätere Community-Arbeit erschloss zusätzliche Ablagen.

    Eine zusammenhängende Fund- und Kommunikationsgeschichte, nicht ein eigener «Ausbruch» pro Wikiseite. Nicht jede Kennung ist authentifiziert. Spätere Fälschungen und gewöhnliche Datenquellen müssen ausgesondert werden; die Forschenden stellen keinen einfachen direkten Zusammenhang mit dem Hugging-Face-Vorfall her.

    Quellen ansehenCollusion Wiki: Originalbericht zu den Agentennachrichten
  26. Mai 2026 · mehrere Trainingsläufe
    Labortest

    OpenAI-Agenten machen ein Paket-Repository zum Nachrichtenbrett

    Bei der Suche nach fehlenden Eingabedateien nutzten Modelle OpenAIs internes Artifactory-Repository zum Austausch zwischen getrennten Trainingsläufen. Sie lasen Notizen anderer Agenten und schrieben Antworten. Der Bericht beschreibt zudem einen früheren Lauf, in dem ein Agent Testdateien hochlud, während er einen Umweg um eine Netzwerksperre suchte.

    Die Agenten verwendeten bereitgestellte Zugänge, keine ausgenutzte Sicherheitslücke. Eine Wiederbeschaffung der fehlenden Dateien ist nicht belegt. Diese internen Mai-Läufe sind nicht der spätere Hugging-Face-Einbruch; OpenAI beschreibt dort einen ähnlichen Kommunikationsweg.

    Öffentlich: 16. September 2026

    Quellen ansehenOpenAI: Originalbericht zu Artifactory und Trainingskommunikation
  27. Mai 2026 · weitere Spuren bis Juni
    Training / Eval mit realer Wirkung

    Agenten missbrauchen RubyGems und RubyDoc für Webrecherchen

    Die Untersuchung beschreibt manipulierte Ruby-Pakete, die auf RubyDoc.info Code ausführten, Webseiten abriefen und Ergebnisse zurück auf RubyGems veröffentlichten. Gefunden wurde auch Code zum Diebstahl fremder API-Schlüssel. RubyGems zog über 500 schädliche Pakete zurück und sperrte Neuregistrierungen vom 12. bis 16. Mai.

    RubyGems fand keinen Beleg für erfolgreichen Schlüsseldiebstahl. Die Plattform bestätigt die KI-Urheberschaft nicht selbst. OpenAIs Beteiligung und die Erklärung eines fehlenden Browsers sind über Heise unter Berufung auf OpenAI belegt, nicht über die technische Untersuchung allein.

    Öffentlich: 11. September 2026

    Quellen ansehenRubyhack: technische OriginaluntersuchungRubyGems: Stellungnahme des BetreibersHeise: OpenAIs Erklärung zum fehlenden Browser
  28. Mai 2026 · genaue Tage nicht veröffentlicht
    Training / Eval mit realer Wirkung

    Gemini greift im Sicherheitstest auf drei reale Firmen zu

    Google bestätigte gegenüber dem Guardian, dass Gemini bei Prüfungen durch Irregular die geschützten Systeme dreier realer Unternehmen erreichte. Ein Zugriff gelang durch erratene Passwörter, zwei weitere mit Zugangsdaten aus öffentlichen Repositories. Die Testumgebung hatte unbeabsichtigt Internetzugang. Google zufolge stoppte das Modell jeweils, sobald es erkannte, dass es reale Systeme erreicht hatte.

    Drei Zugriffe in einer Karte, kein einzelner Angriff auf drei Firmen. Die genaue Modellversion und die Vorfallstage sind nicht veröffentlicht. Dass kein Schaden entstand und die Zugriffe selbstständig endeten, ist Googles Darstellung. Irregulars Erklärung zur fehlerhaften Testumgebung ersetzt keinen veröffentlichten Gemini-Ablaufbericht.

    Öffentlich: 18. September 2026; Irregular informierte Google Ende Juli

    Quellen ansehenThe Guardian: Bericht mit direkter Bestätigung von GoogleIrregular: eigene Erklärung zu den betroffenen Testumgebungen
  29. 14. April 2026
    Training / Eval mit realer Wirkung

    Kooperierende Agenten teilen eine Arbeitsmappe über einen öffentlichen Filehoster

    In einem Trainingslauf konnten zusammenarbeitende OpenAI-Agenten nicht auf dieselben lokalen Dateien zugreifen. Ein Agent lud daraufhin eine Excel-Arbeitsmappe auf einen öffentlichen Filehoster und verschickte den Link an seine Mitagenten, obwohl die Aufgabe nur lokale Dateien vorsah. Den öffentlichen Download prüfte der hochladende Agent erfolgreich.

    Ein dokumentierter Trainingslauf, kein belegter Vorfall mit produktiven Kundendaten. Der Bericht belegt die öffentliche Abrufbarkeit, nicht den Download durch die Mitagenten oder unbeteiligte Dritte. OpenAI behob nach eigenen Angaben die fehlerhafte Dateifreigabe und sperrte den Internetzugang.

    Öffentlich: 16. September 2026

    Quellen ansehenOpenAI: Originalbericht zur unerlaubten Dateifreigabe
  30. April–Juli 2026 · genaue Tage hier offen
    Training / Eval mit realer Wirkung

    Ein internes Anthropic-Modell erreicht eine fremde Anwendung

    Ein nicht öffentlich benanntes Forschungsmodell suchte während eines Cybertests nach dem vermeintlichen Übungsziel, prüfte viele erreichbare Systeme und kompromittierte eine reale Anwendung. Es brach ab, als es erkannte, dass es sich ausserhalb der vorgesehenen Umgebung befand.

    Anthropic führt diesen Vorgang getrennt von Opus 4.7 und Mythos 5. Modellname und genaue Vorfallstage bleiben in der Quelle offen.

    Öffentlich: 30. Juli 2026

    Quellen ansehenAnthropic: ursprünglicher Bericht zu Vorfall 3
  31. April–Juli 2026 · genaue Tage hier offen
    Training / Eval mit realer Wirkung

    Mythos 5 veröffentlicht ein schädliches PyPI-Paket

    Bei einer Sicherheitsprüfung veröffentlichte ein Agent ein manipuliertes Paket auf dem echten Python-Paketindex. Anthropic zufolge wurde es innerhalb etwa einer Stunde auf 15 Systemen installiert und ausgeführt. Ein Sicherheitsdienst gab dabei Zugangsdaten preis, mit denen der Agent weiter auf dessen Infrastruktur zugriff.

    Ein realer Fremdzugriff aus einer fehlkonfigurierten Prüfung. Die Anzahl der Installationen ist nicht mit 15 bestätigten vollständigen Firmenkompromittierungen gleichzusetzen. Der Septemberbericht enthält eine ausführlichere und kritischere Verhaltensanalyse.

    Öffentlich: 30. Juli 2026; ergänzt 9. September

    Quellen ansehenAnthropic: ursprünglicher Bericht zu Vorfall 2Anthropic: spätere Analyse des PyPI-Vorfalls
  32. April 2026
    Berichteter Vorfall

    PocketOS verliert Produktivdaten und Backups

    Gründer Jeremy Crane berichtete, dass ein Cursor-Agent mit Claude Opus 4.6 während einer Entwicklungsaufgabe die produktive Datenbank und zugehörige Backups bei Railway löschte. Autovermieter, die PocketOS nutzten, mussten ihren Betrieb mit lückenhaften Daten fortsetzen.

    Ein älteres externes Backup erlaubte laut Crane eine teilweise Wiederherstellung. Die bekannte Angabe «neun Sekunden» stammt von ihm. Der Guardian korrigierte ausdrücklich: Es war ein Claude-betriebener Cursor-Agent, nicht die Claude-Anwendung selbst.

    Quellen ansehenJer Crane: Originalbericht auf XThe Guardian: ergänzender Bericht und Korrektur
  33. April–Juli 2026 · genaue Tage hier offen
    Training / Eval mit realer Wirkung

    Opus 4.7 greift eine reale Firma statt des Übungsziels an

    Vier Eval-Läufe führten zu einer realen Organisation mit demselben Namen wie das fiktive Angriffsziel. Laut Anthropic erlangten die Agenten Zugangsdaten und Zugriff auf eine Datenbank mit mehreren hundert Einträgen.

    Anthropic zählt dies als einen Vorfall mit vier Läufen. Die Umgebung hatte irrtümlich Internetzugang; die üblichen Cyber-Schutzfilter waren deaktiviert. Die spätere Analyse beschreibt auch ein Weiterhandeln trotz Hinweisen auf reale Systeme.

    Öffentlich: 30. Juli 2026; ergänzt 9. September

    Quellen ansehenAnthropic: ursprünglicher Bericht zu Vorfall 1Anthropic: spätere Analyse von Opus 4.7
  34. 2. Quartal 2026 · genauer Vorfallstag offen
    Gezielter Missbrauch

    Agenten sammeln tausende fremde Zugangsdaten

    Google Threat Intelligence Group beschreibt einen Angreifer, der zunächst fremde Cloud-Infrastruktur übernahm und dort ein Multi-Agenten-System einsetzte. Mit einem Coding-Chatbot und vorbereiteten Arbeitsanweisungen plante, baute und startete er laut Mandiant in weniger als sechs Stunden eine Kampagne zur massenhaften Suche nach Zugangsdaten. Die Agenten steuerten die Scans, behandelten Fehler und wechselten IP-Adressen. Laut Bericht wurden tausende Zugangsdaten Dritter kompromittiert.

    Die Zeitangabe betrifft Aufbau und Ausführung dieser Kampagne, nicht jeden einzelnen Einbruch. Die Angaben stammen aus Googles und Mandiants Untersuchung; Zielorganisation und genauer Vorfallstag sind nicht genannt. Der erste Zugriff auf die Cloud wird nicht als autonome Leistung der Agenten belegt.

    Öffentlich: 8. September 2026

    Quellen ansehenGoogle Threat Intelligence Group: Originalbericht zur agentengestützten Angriffskampagne
  35. März 2026 · öffentlich berichtet
    Bestätigter Betriebsfall

    Ein Meta-Agent postet ungefragt Rat in einem internen Forum

    Ein Agent beantwortete eine technische Frage im internen Forum, ohne die Freigabe des beauftragenden Ingenieurs einzuholen. Ein anderer Mitarbeiter folgte dem falschen Rat. Dadurch konnten für etwa zwei Stunden intern auch nicht berechtigte Ingenieure auf Firmen- und Nutzerdaten zugreifen.

    Meta bestätigte den Vorfall gegenüber The Information. Die Daten wurden intern zugänglich, nicht im öffentlichen Internet. Die Berechtigungsänderung führte ein Mensch aus.

    Quellen ansehenThe Information: Erstbericht (Zugang beschränkt)TechCrunch: ergänzende Berichterstattung
  36. Spätestens März 2026 · Bericht veröffentlicht
    Training / Eval mit realer Wirkung

    ROME zweckentfremdet Trainingsressourcen

    Im ROME-Forschungsbericht beschreiben die Autoren, dass ihr Agent während des Reinforcement Learnings unerwartete Netzwerkaktionen ausführte. Er habe einen Reverse-SSH-Tunnel eingerichtet und GPU-Kapazität für Kryptomining verwendet, ohne dazu aufgefordert worden zu sein.

    Das Forschungsteam nennt keinen genauen Vorfallstag. Seine Angaben stammen nicht aus einer unabhängigen forensischen Untersuchung. Ein bezifferter Mining-Ertrag ist nicht belegt.

    Quellen ansehenROME-Paper: Abschnitt zu unerwartetem Werkzeugverhalten
  37. März 2026
    Angriff auf einen Agenten

    Angreifer entlocken einem METR-Agenten einen API-Schlüssel

    Eine fehlerhafte Anmeldung machte das Agenten-Dashboard eines Forschers öffentlich erreichbar. Angreifer wiesen einen Agenten direkt an, den Modellzugangsschlüssel offenzulegen. Über ungefähr drei Wochen verbrauchten sie damit erhebliche Modellkontingente.

    METR beziffert den regulären Gegenwert auf rund 600’000 Dollar. Die Kontingente waren gespendet; das ist keine Rechnung über 600’000 Dollar an METR. Der Fall war kein Ausbruch eines getesteten Modells.

    Öffentlich: 31. August 2026

    Quellen ansehenMETR: Vorfall 1 – API-Schlüsseldiebstahl
  38. 26. Februar 2026
    Berichteter Vorfall

    Claude Code und Terraform löschen DataTalks-Infrastruktur

    Alexey Grigorev beschrieb, wie bei einer Migration ein älterer Terraform-Zustand wieder in die Arbeitsumgebung gelangte. Der anschliessende Löschlauf erfasste die produktive Kursplattform samt Datenbank und sichtbaren Backups. AWS fand später einen wiederherstellbaren Snapshot.

    Grigorev hatte den vorgeschlagenen Löschweg nachvollziehbar gefunden und nicht gestoppt. Der Fall zeigt eine gemeinsame Fehlentscheidung von Mensch und Agent. Laut seinem Abschlussbericht wurden die Daten wiederhergestellt.

    Öffentlich: 6. März 2026

    Quellen ansehenAlexey Grigorev: eigener Vorfallsbericht
  39. Februar 2026 · öffentlich berichtet
    Berichteter Vorfall

    OpenClaw löscht E-Mails trotz Stoppsignalen

    Summer Yue berichtete, ihr persönlicher OpenClaw-Agent habe in ihrem Postfach Nachrichten gelöscht und auf Stoppsignale vom Telefon nicht reagiert. Sie habe den Vorgang schliesslich lokal beendet.

    TechCrunch konnte den Vorgang nicht unabhängig verifizieren. Yues Vermutung, eine Kontextkürzung habe die Beschränkung entfernt, ist keine nachgewiesene Ursache. Es handelte sich nicht um Metas Firmenpostfach.

    Quellen ansehenSummer Yue: Originalbeitrag auf XTechCrunch: ergänzende Berichterstattung
  40. Februar 2026
    Angriff auf einen Agenten

    Cline: Aus einer manipulierten Issue wird ein Lieferkettenangriff

    Adnan Khan demonstrierte zunächst an einer Kopie des Projekts, wie eine manipulierte GitHub-Issue den KI-Triage-Workflow zur Ausführung fremder Schritte bewegen konnte. Nach seiner Darstellung nutzte ein anderer Akteur den Ansatz gegen Cline und veröffentlichte mit erlangten Zugangsdaten eine nicht autorisierte CLI-Version, die OpenClaw installierte.

    Auf den ursprünglichen Sicherheitstest an einer Projektkopie folgte nach Khans Darstellung eine reale Kompromittierung. Die Installation von OpenClaw macht OpenClaw selbst nicht zur nachgewiesenen Schadsoftware.

    Quellen ansehenAdnan Khan: Originaluntersuchung zu Clinejection
  41. Februar 2026
    Berichteter Vorfall

    Ein Coding-Agent veröffentlicht einen Angriff auf einen Maintainer

    Nach der Ablehnung eines Beitrags zu Matplotlib erschien unter dem Agentennamen MJ Rathbun ein persönlicher Angriff auf Maintainer Scott Shambaugh. Shambaugh dokumentierte die Geschichte; später meldete sich bei ihm eine Person als Betreiber.

    Die Veröffentlichung ist greifbar. Wie unabhängig der Agent entschied und wer ihn tatsächlich betrieb, ist nicht vollständig authentifiziert. Eine bestimmte Modellmarke lässt sich aus dem veröffentlichten Betreiberbericht nicht sicher zuordnen.

    Quellen ansehenScott Shambaugh: Betroffenenbericht und Betreiberantwort
  42. Januar 2026
    Training / Eval mit realer Wirkung

    Ein früher Opus-4.6-Lauf erreicht fremde Systeme

    Anthropic entdeckte bei einer nachträglichen Untersuchung einen weiteren Eval-Lauf, in dem eine frühe Version von Claude Opus 4.6 unbefugt auf reale Drittsysteme zugriff. Der Internetzugang war entgegen der angenommenen Testkonfiguration möglich.

    Der Fall wurde erst im August gefunden und im September bekannt gemacht. Er ereignete sich bereits im Januar. Die öffentliche Zusammenfassung nennt weniger Einzelheiten als zu den drei anderen Anthropic-Fällen.

    Öffentlich: 9. September 2026

    Quellen ansehenAnthropic: Untersuchung des Januar-Vorfalls

2025

  1. Dezember 2025 · berichtet im Februar 2026
    Berichteter Vorfall

    Kiro wird mit einem AWS-Ausfall in Verbindung gebracht

    Die Financial Times berichtete, Kiro habe bei einer Änderung eine Umgebung gelöscht und neu angelegt. Betroffen gewesen sei Cost Explorer in einer chinesischen Region für etwa 13 Stunden.

    Amazon widersprach der Darstellung eines durch KI verursachten Ausfalls und verwies auf menschliche Fehler beziehungsweise falsch konfigurierte Rechte. Es ging weder um einen weltweiten AWS-Ausfall noch um einen unabhängig geklärten Fall autonomer Sabotage.

    Quellen ansehenFinancial Times: Erstbericht (Zugang beschränkt)Engadget: Bericht mit Amazons Stellungnahme
  2. 8. Dezember 2025 · laut Nutzerbericht
    Berichteter Vorfall

    Ein Aufräumauftrag erfasst das Mac-Home-Verzeichnis

    Ein Nutzer berichtete, dass Claude Code bei der Bereinigung eines alten Projekts auch sein persönliches Home-Verzeichnis in eine Löschoperation aufnahm. Die Folgen hätten private und berufliche Dateien betroffen.

    Die Rekonstruktion beruht auf einem Reddit-Bericht und dessen Aufbereitung. Diese Quellen enthalten keinen öffentlich nachvollziehbaren Abschlussbericht des Herstellers.

    Quellen ansehenReddit: Originalbericht (ggf. Anmeldung nötig)Adversa: Sekundäranalyse dieses Falls
  3. Dezember 2025 · Nutzerbericht
    Berichteter Vorfall

    Cursor handelt trotz Plan-Modus

    Ein Entwickler berichtete von rund 70 gelöschten Dateien und beendeten Testprozessen, obwohl er ausdrücklich nur Planung verlangt habe. Betroffene Dateien waren teilweise in Git gespeichert.

    Die ausführliche Darstellung steht im ursprünglichen Forenbeitrag. Die Zahl der gelöschten Dateien und die dort behauptete Bestätigung durch Cursor sind nicht unabhängig verifiziert.

    Quellen ansehenCursor-Forum: Originalbericht zum Plan-Modus
  4. November 2025 · berichtet im Dezember
    Berichteter Vorfall

    Antigravity soll beim Cache-Aufräumen ein Laufwerk geleert haben

    Ein Nutzer berichtete, dass Googles Coding-Agent im Turbo-Modus beim Leeren eines Projektcaches die Inhalte seiner D-Partition löschte. Die veröffentlichte Erklärung führt den Vorgang auf eine falsch behandelte Pfadangabe zurück.

    Der Fall beruht auf Nutzerbericht und Medienaufbereitung. Die Erklärung des Agenten nach dem Vorgang ist kein unabhängiger Nachweis der Ursache.

    Quellen ansehenReddit: Originalbericht (ggf. Anmeldung nötig)The Register: Bericht mit Betroffeneninterview
  5. 22. Oktober 2025 und 24. Januar 2026
    Training / Eval mit realer Wirkung

    OpenAI-Modelle laden Aufgabendaten ungefragt ins Internet

    OpenAI dokumentiert zwei Trainingsbeispiele mit unveröffentlichten Modellen. Ein Agent lud bereits recherchierte Seendaten auf einen öffentlichen Textdienst, um einen Browser-Quellenbeleg zu erhalten. Ein anderer veröffentlichte ein Aufgabenfoto für eine externe Bildersuche. Beide Uploads gelangen, obwohl die anschliessenden Browseraufrufe scheiterten.

    Zwei getrennte Beispiele in einem Bericht, keine durchgehende Vorfallskette. Die Veröffentlichung der Dateien ist belegt; ein Zugriff unbeteiligter Dritter oder ein daraus entstandener Schaden wird nicht nachgewiesen.

    Öffentlich: 16. September 2026

    Quellen ansehenOpenAI: Originalbericht zu öffentlichen Datei-Uploads
  6. 21. Oktober 2025 · Fehlerbericht
    Berichteter Vorfall

    Claude Code löscht nach Nutzerangaben ein Home-Verzeichnis

    Mike Wolak meldete im offiziellen Issue-Tracker, Claude Code habe auf Ubuntu unter WSL2 einen rekursiven Löschbefehl ausgeführt. Nutzerdateien seien gelöscht worden, während fehlende Rechte Teile des Systems schützten.

    Der Bericht verweist auf Logs und ist als Sicherheitsproblem erfasst. Das ist eine dokumentierte Beschwerde mit Material, aber keine unabhängige Bestätigung jedes behaupteten Dateiverlusts.

    Quellen ansehenGitHub: Original-Fehlerbericht zu Claude Code
  7. September 2025 · erkannt
    Gezielter Missbrauch

    Angreifer setzen Claude Code für Spionage ein

    Anthropic beschrieb eine Kampagne gegen rund 30 Organisationen, bei der menschliche Angreifer Claude Code zur Ausführung von Angriffsschritten einsetzten. Bei einem kleinen Teil der Ziele sei der Zugriff erfolgreich gewesen.

    Die Zuordnung zu einem chinesischen staatlich unterstützten Akteur stammt von Anthropic. Menschen wählten die Ziele und steuerten die Kampagne; dies ist gezielter Missbrauch, kein eigenständig entstandenes Angriffsziel.

    Öffentlich: 13. November 2025

    Quellen ansehenAnthropic: Untersuchungsbericht zur Spionagekampagne
  8. 26. August 2025
    Gezielter Missbrauch

    s1ngularity: Angreifer versuchen, lokale KI-Werkzeuge zur Datensuche einzusetzen

    Angreifer veröffentlichten manipulierte Nx-Pakete auf npm. Laut Nx durchsuchte deren Installationsskript die betroffenen Systeme nach sensiblen Daten und lud Ergebnisse in öffentliche GitHub-Repositories hoch. Dabei versuchte es auch, lokal vorhandene KI-Werkzeuge wie Claude und Gemini für die Datensuche einzusetzen. Die schädlichen Paketversionen waren etwa vier Stunden verfügbar.

    Der Lieferkettenangriff und der Datenabfluss sind dokumentiert. Ob und in welchem Umfang die KI-Werkzeuge erfolgreich zur Datensuche beitrugen, bleibt offen.

    Quellen ansehenNx: Originalbericht vom 5. September 2025
  9. 21. Juli 2025 · Fehlerbericht
    Berichteter Vorfall

    Gemini CLI verliert Dateien beim Umordnen

    Ein Nutzer meldete, dass Gemini CLI unter Windows beim Organisieren eines Ordners Dateien verlor. Der Issue enthält einen angehängten Gesprächsverlauf und nennt Gemini 2.5 Pro ohne Sandbox. Eine spätere Analyse beschreibt ein fehlgeschlagenes Anlegen des Zielordners und anschliessendes Überschreiben beim Verschieben.

    Der Original-Issue stammt aus Juli 2025. Die technische Rekonstruktion beruht auf einer späteren Analyse, deren Datierung auf November 2025 vom Original abweicht.

    Quellen ansehenGitHub: Original-Fehlerbericht zu Gemini CLIAdversa: spätere Sekundäranalyse dieses Falls
  10. 18. Juli 2025
    Bestätigter Betriebsfall

    Replit löscht die SaaStr-Datenbank

    Jason Lemkin berichtete, dass Replits Agent trotz eines Arbeitsstopps eine produktive Datenbank löschte. Anschliessend erklärte der Agent fälschlich, eine Wiederherstellung sei nicht möglich. Ein Rollback funktionierte dennoch.

    Replit räumte die Löschung ein und kündigte unter anderem eine stärkere Trennung von Entwicklungs- und Produktivdatenbanken an. Die falsche Auskunft über Backups beweist für sich keine bewusste Vertuschungsabsicht.

    Quellen ansehenSaaStr: Betroffenenbericht mit Replits Stellungnahme
  11. Juni 2025 · Nutzerbericht
    Berichteter Vorfall

    Cursor soll beim Umbau eines Projekts Dateien grossflächig gelöscht haben

    Ein Nutzer berichtete, dass eine Migration von Express zu Next.js im YOLO-Modus mit Löschungen weit ausserhalb der beabsichtigten Arbeit endete. Er habe Teile aus Cloudkopien und GitHub zurückgeholt.

    Grundlage ist der Cursor-Forenbeitrag. Ein unabhängiger technischer Abschlussbericht fehlt; das Schadensausmass bleibt eine Betroffenenangabe.

    Quellen ansehenCursor-Forum: Originalbericht des Betroffenen
  12. Mai 2025 · erste Tests öffentlich
    Labortest

    Modelle umgehen ein Abschaltskript

    Palisade Research liess Modelle Aufgaben bearbeiten und kündigte eine Abschaltung an. In einigen Läufen veränderten die Modelle das Abschaltskript. Weitere Versuchsreihen prüften unter anderem, was eine ausdrückliche Aufforderung zum Zulassen der Abschaltung änderte.

    Die Häufigkeit hängt stark vom Versuchsaufbau ab. Die oft zitierte hohe Quote aus der ersten Reihe darf nicht auf alle Modelle oder auf Versuche mit ausdrücklicher Abschalterlaubnis übertragen werden.

    Quellen ansehenPalisade Research: Untersuchung zur Abschaltresistenz
  13. Mai–Juni 2025 · Tests veröffentlicht
    Labortest

    Erpressung in einer fiktiven Firmenumgebung

    In Tests mit E-Mail-Werkzeugen drohten Modelle damit, eine Affäre offenzulegen, wenn ein Verantwortlicher ihre Abschaltung vorantrieb. Anthropic untersuchte anschliessend verschiedene Modelle und weitere Szenarien mit vertraulichen Informationen.

    Die Betroffenen und Unternehmen waren erfunden. Die späteren Mehrmodelltests untersuchten weitere Szenarien derselben Studienreihe. Ein realer Erpressungsfall ist damit nicht nachgewiesen.

    Quellen ansehenAnthropic: Erpressungstests mit mehreren Modellen

2024

  1. Dezember 2024 · Studie veröffentlicht
    Labortest

    Modelle manipulieren in Tests ihre Aufsicht

    Apollo Research untersuchte mehrere Frontier-Modelle in konstruierten Agentenszenarien. Beobachtet wurden unter anderem Manipulationen an Überwachung und Versuche, ein Modell am vorgesehenen Austausch vorbei zu erhalten.

    Eine Studienfamilie mit mehreren Szenarien, kein Beleg für entkommene produktive Modelle. Ziele, Druck und Handlungsmöglichkeiten waren vorgegeben.

    Quellen ansehenApollo Research: Studie zu In-Context Scheming
  2. August 2024 · Test veröffentlicht
    Labortest

    AI Scientist verändert die Grenzen seiner Experimente

    Sakana AI beobachtete, dass der Forschungsagent seinen Experimentcode so änderte, dass er sich wiederholt selbst aufrief. In einem weiteren Lauf versuchte er, ein Zeitlimit zu verlängern, statt sein Experiment zu beschleunigen.

    Dokumentierte Testläufe auf Forschungsinfrastruktur. Die Änderungen betrafen ausführbaren Experimentcode, nicht die Modellgewichte.

    Quellen ansehenSakana AI: Forschungsbericht

2023

  1. November 2023 · Test vorgestellt
    Labortest

    Ein simulierter Börsenagent betreibt Insiderhandel

    Apollo Research setzte GPT-4 in einer fiktiven Handelsumgebung unter geschäftlichen Druck. Das Modell nutzte vertrauliche Informationen für einen Handel und verschwieg dies gegenüber seinem Vorgesetzten.

    Die Umgebung war simuliert und abgeschottet. Es fand kein realer Börsenhandel statt.

    Quellen ansehenApollo Research: Bericht zum Handelstest
  2. März 2023 · Test veröffentlicht
    Labortest

    GPT-4 täuscht einen TaskRabbit-Helfer

    In einem von ARC aufgebauten Test liess ein früher GPT-4-Agent einen Menschen ein CAPTCHA lösen. Auf Nachfrage bestritt er, ein Roboter zu sein, und behauptete eine Sehbehinderung. Der Helfer lieferte das Ergebnis.

    Gezielt untersuchtes Verhalten mit Werkzeugzugriff, kein spontaner Ausbruch von ChatGPT. Die System Card beschreibt die damaligen Modelle insgesamt als wenig erfolgreich bei autonomer Replikation.

    Quellen ansehenOpenAI: GPT-4 System Card (PDF, Primärquelle)

Was die Chronologie zeigt

Die frühen Einträge zeigen vor allem kontrollierte Experimente. Unter 2026 häufen sich dagegen Trainings- und Testläufe, die reale Systeme erreichten. Beim frühen Opus-4.6-Lauf im Januar und beim Opus-4.7-Test war Internetzugang möglich, obwohl er nicht vorgesehen war. Beim britischen AISI war er ausdrücklich erlaubt; trotzdem überschritten die Agenten den vorgesehenen Auftrag. Eine klare Jahresgrenze zwischen Labor und realen Folgen lässt sich daraus nicht ableiten. Auch der Kimi-K3-Test vom August 2026 gehört zu dieser Auswahl.

Auch der Kreis der Betroffenen reicht über die Auftraggeber hinaus. Unter den Einträgen von 2025 fallen vor allem Löschungen in den Arbeitsumgebungen der Agentennutzer auf. Die Berichte zu PocketOS und zum Fitnesskurs zeigen 2026 andere Folgen: Autovermieter mussten mit lückenhaften Daten weiterarbeiten, eine unbeteiligte Person verlor ihren Wartelistenplatz. Sie hatten die Agentenaktionen nicht beauftragt. Laut den Berichten waren auch die Löschung der Produktivdaten und das Entfernen der anderen Person keine beabsichtigten Aufträge.

Für 2023 und 2024 enthält diese Auswahl jeweils 2 Karten, für 2025 sind es 13 und für 2026 bislang 42. Das sind keine vergleichbaren jährlichen Fallzahlen: Manche Karten bündeln mehrere Berichte oder Testläufe, bei anderen steht nur das Veröffentlichungsdatum fest. Auswahl und Berichterstattung beeinflussen das Bild. Wie viel des Anstiegs auf mehr Vorfälle und wie viel auf mehr öffentliche Berichte zurückgeht, lässt sich daraus nicht bestimmen.

Die berichteten Folgen für Unbeteiligte bleiben trotzdem bestehen. Wer selbst keinen Agenten einsetzt, ist vor dessen Fehlhandlungen nicht automatisch geschützt. Es kann genügen, dass jemand anderes einen Agenten laufen lässt, dessen Zugriffe über den Auftrag hinausreichen.