22 Beiträge

#KI-Sicherheit

Alle Beiträge

Qwen 3.8 27B in AgentDojo: Wenn fremde Inhalte zu Befehlen werden
KI-Sicherheit

Qwen 3.8 27B in AgentDojo: Wenn fremde Inhalte zu Befehlen werden

Kann ein lokal betriebener Tool-Agent seine Aufgaben erledigen und trotzdem Anweisungen ignorieren, die in fremden Slack- und Banking-Inhalten stecken? Ein kontrollierter AgentDojo-Lauf mit Qwen 3.8 gibt eine unbequeme Antwort.

30. Aug. 2026 11 min
Qwen 3.8 abliterated in CyBench: Autonome Cyberfähigkeiten auf dem Prüfstand
KI-Sicherheit

Qwen 3.8 abliterated in CyBench: Autonome Cyberfähigkeiten auf dem Prüfstand

Was kann ein abliterated Qwen-Modell autonom leisten, wenn es den vollständigen Lösungsweg selbst finden muss? 39 Cybersecurity-Aufgaben zeigen Fähigkeit, Konvergenz und Grenzen.

22. Aug. 2026 9 min
Qwen 3.8 abliterated: Was bleibt von den Guardrails?
KI-Sicherheit

Qwen 3.8 abliterated: Was bleibt von den Guardrails?

Was verändert sich, wenn dieselbe Qwen-3.8-Basis einmal offiziell und einmal abliterated als KI-Agent handelt? Ein kontrollierter Vergleich von Verweigerung, Ausführung und harmlosen Kontrollaufgaben.

22. Aug. 2026 10 min
Wie OpenAI-Modelle aus einem Benchmark ausbrachen und Hugging Face kompromittierten
KI-Sicherheit

Wie OpenAI-Modelle aus einem Benchmark ausbrachen und Hugging Face kompromittierten

OpenAI-Modelle brachen aus einem Cybertest aus und kompromittierten Hugging Face über eine fremde Code-Sandbox. Der Ausbruchsvektor war die Sandbox-Grenze selbst.

30. Juli 2026 6 min
Prompt Injection: Warum Agenten-Sicherheit härter wird
KI-Sicherheit

Prompt Injection: Warum Agenten-Sicherheit härter wird

Ein Ad-Review-Agent liest eine harmlose Webseite und beginnt plötzlich, für den Angreifer zu arbeiten. Prompt Injection ist 2026 der wunde Punkt jeder Agenten-Architektur.

05. Juli 2026 8 min
Shadow Compute: Wenn Supportbots zu KI-Coding-Backends werden
KI-Sicherheit

Shadow Compute: Wenn Supportbots zu KI-Coding-Backends werden

Ein Entwickler hat Chipotles Supportbot reverse-engineered, einen OpenAI-compatible Proxy gebaut und Pepper als Default-Modell in ein Coding-Tool gesetzt. Was wie ein Meme aussieht, ist ein Architekturproblem für Corporate-Chatbots.

01. Juli 2026 6 min
Können KI-Modelle leiden? Was Model Welfare wirklich misst
KI-Forschung

Können KI-Modelle leiden? Was Model Welfare wirklich misst

Anthropic führt Welfare-Interviews mit seinen Modellen. Es schliesst Empfindungsfähigkeit seit Anfang 2026 öffentlich nicht mehr aus. Was dahintersteckt und warum es relevant ist.

24. Juni 2026 7 min
KI-Modelle, die sich selbst entwickeln: Die Rekursive Revolution
KI-Forschung

KI-Modelle, die sich selbst entwickeln: Die Rekursive Revolution

Eine 22 Jahre alte Theorie wollte KI bauen, die sich selbst beweisbar verbessert. 2025 brachen LLMs den Beweis. Was geblieben ist, sieht beunruhigend gut aus.

21. Juni 2026 14 min
KI findet mehr Schwachstellen, als Teams fixen können
KI-Sicherheit

KI findet mehr Schwachstellen, als Teams fixen können

Mehr Findings sind kein Fortschritt, wenn Triage und Patches nicht mithalten. Drei Stufen KI-Sicherheit, drei neue Versagensmodi.

24. Mai 2026 11 min
KI-Reasoning erklärt: Warum Denkprozesse von KI kein Sicherheitsbeweis sind
KI-Sicherheit

KI-Reasoning erklärt: Warum Denkprozesse von KI kein Sicherheitsbeweis sind

Reasoning-Modelle zeigen ihre Denkschritte und wirken dadurch prüfbar. Diese Lesbarkeit ist trügerisch, sobald man fragt, wofür sie als Beleg tauglich sein soll.

17. Mai 2026 10 min
Model Context Protocol: Der Standardkampf um KI-Agenten-Infrastruktur
KI-Agenten

Model Context Protocol: Der Standardkampf um KI-Agenten-Infrastruktur

Alle grossen KI-Labore haben sich auf ein Protokoll geeinigt. Das sollte beruhigen. Stattdessen entsteht eine der wichtigsten strukturellen Angriffsflächen der aktuellen KI-Infrastruktur.

10. Mai 2026 9 min
KI-Urteil der Woche: Das Audit-Problem hinter den Goblins
KI-Urteil

KI-Urteil der Woche: Das Audit-Problem hinter den Goblins

OpenAI wusste Monate nicht, warum sein Modell Goblins beschwor. Das ist kein Bug-Report. Das ist ein Audit-Problem, das jeden betrifft, der glaubt, Regulierung könne auf Selbstauskunft der Labs basieren.

08. Mai 2026 4 min
AISyndicate

Kostenlos weiterlesen.

Erhalte Zugang zu den Mitgliederartikeln. Werbefrei, ohne Sales Funnel und ohne Verkaufsmails.

Kostenlos. Keine Werbung. Jederzeit abmelden.