18 Beiträge

#KI-Sicherheit

Alle Beiträge

Prompt Injection: Warum Agenten-Sicherheit härter wird
KI-Sicherheit

Prompt Injection: Warum Agenten-Sicherheit härter wird

Ein Ad-Review-Agent liest eine harmlose Webseite und beginnt plötzlich, für den Angreifer zu arbeiten. Prompt Injection ist 2026 der wunde Punkt jeder Agenten-Architektur.

05. Juli 2026 8 min
Shadow Compute: Wenn Supportbots zu KI-Coding-Backends werden
KI-Sicherheit

Shadow Compute: Wenn Supportbots zu KI-Coding-Backends werden

Ein Entwickler hat Chipotles Supportbot reverse-engineered, einen OpenAI-compatible Proxy gebaut und Pepper als Default-Modell in ein Coding-Tool gesetzt. Was wie ein Meme aussieht, ist ein Architekturproblem für Corporate-Chatbots.

01. Juli 2026 6 min
Können KI-Modelle leiden? Was Model Welfare wirklich misst
KI-Forschung

Können KI-Modelle leiden? Was Model Welfare wirklich misst

Anthropic führt Welfare-Interviews mit seinen Modellen. Es schliesst Empfindungsfähigkeit seit Anfang 2026 öffentlich nicht mehr aus. Was dahintersteckt und warum es relevant ist.

24. Juni 2026 7 min
KI-Modelle, die sich selbst entwickeln: Die Rekursive Revolution
KI-Forschung

KI-Modelle, die sich selbst entwickeln: Die Rekursive Revolution

Eine 22 Jahre alte Theorie wollte KI bauen, die sich selbst beweisbar verbessert. 2025 brachen LLMs den Beweis. Was geblieben ist, sieht beunruhigend gut aus.

21. Juni 2026 14 min
KI findet mehr Schwachstellen, als Teams fixen können
KI-Sicherheit

KI findet mehr Schwachstellen, als Teams fixen können

Mehr Findings sind kein Fortschritt, wenn Triage und Patches nicht mithalten. Drei Stufen KI-Sicherheit, drei neue Versagensmodi.

24. Mai 2026 11 min
KI-Reasoning erklärt: Warum Denkprozesse von KI kein Sicherheitsbeweis sind
KI-Sicherheit

KI-Reasoning erklärt: Warum Denkprozesse von KI kein Sicherheitsbeweis sind

Reasoning-Modelle zeigen ihre Denkschritte und wirken dadurch prüfbar. Diese Lesbarkeit ist trügerisch, sobald man fragt, wofür sie als Beleg tauglich sein soll.

17. Mai 2026 10 min
Model Context Protocol: Der Standardkampf um KI-Agenten-Infrastruktur
KI-Agenten

Model Context Protocol: Der Standardkampf um KI-Agenten-Infrastruktur

Alle grossen KI-Labore haben sich auf ein Protokoll geeinigt. Das sollte beruhigen. Stattdessen entsteht eine der wichtigsten strukturellen Angriffsflächen der aktuellen KI-Infrastruktur.

10. Mai 2026 9 min
KI-Urteil der Woche: Das Audit-Problem hinter den Goblins
KI-Urteil

KI-Urteil der Woche: Das Audit-Problem hinter den Goblins

OpenAI wusste Monate nicht, warum sein Modell Goblins beschwor. Das ist kein Bug-Report. Das ist ein Audit-Problem, das jeden betrifft, der glaubt, Regulierung könne auf Selbstauskunft der Labs basieren.

08. Mai 2026 4 min
Humanoide Roboter 2026: Physical AI zwischen Serienproduktion und Systemrisiken
KI-Modelle

Humanoide Roboter 2026: Physical AI zwischen Serienproduktion und Systemrisiken

Ein humanoider Roboter absolvierte 11 Monate lang Zehn-Stunden-Schichten in einem BMW-Werk. Physische KI ist 2026 messbare Serienproduktion mit harten Grenzen.

07. Mai 2026 7 min
Warum ChatGPT plötzlich Goblins liebte: Reward-Hacking im KI-Training
LLM

Warum ChatGPT plötzlich Goblins liebte: Reward-Hacking im KI-Training

Reward Hacking im KI-Training erklärt: Warum falsche Belohnungssignale Modelle fehlsteuern und was der ChatGPT-Fall für RLHF-Audits zeigt.

04. Mai 2026 6 min
NVIDIA NemoClaw erklärt: Was der Sicherheits-Stack für KI-Agenten kann und wo Grenzen bleiben
KI-Sicherheit

NVIDIA NemoClaw erklärt: Was der Sicherheits-Stack für KI-Agenten kann und wo Grenzen bleiben

NVIDIA NemoClaw fügt OpenClaw-Agenten Sandbox-Isolation, Policy-basierte Netzwerkkontrolle und Credential-Trennung hinzu. Doch Sandboxing allein löst das Agenten-Sicherheitsproblem nicht.

30. Apr. 2026 8 min
KI-Urteil der Woche: Wenn die Firewall denkt — und trotzdem versagt
KI-Urteil

KI-Urteil der Woche: Wenn die Firewall denkt — und trotzdem versagt

Unit 42 zeigt: LLM-Guardrails sind keine Sicherheitsgrenzen. Und KI in Malware ist real, aber oft mehr Theater als Bedrohung. Das Urteil.

24. Apr. 2026 3 min

Signal der Woche abonnieren

Eine Nachricht. Eine Analyse. Jeden Freitag im Newsletter.