#KI-Sicherheit
Alle Beiträge
Prompt Injection: Warum Agenten-Sicherheit härter wird
Ein Ad-Review-Agent liest eine harmlose Webseite und beginnt plötzlich, für den Angreifer zu arbeiten. Prompt Injection ist 2026 der wunde Punkt jeder Agenten-Architektur.
Shadow Compute: Wenn Supportbots zu KI-Coding-Backends werden
Ein Entwickler hat Chipotles Supportbot reverse-engineered, einen OpenAI-compatible Proxy gebaut und Pepper als Default-Modell in ein Coding-Tool gesetzt. Was wie ein Meme aussieht, ist ein Architekturproblem für Corporate-Chatbots.
Können KI-Modelle leiden? Was Model Welfare wirklich misst
Anthropic führt Welfare-Interviews mit seinen Modellen. Es schliesst Empfindungsfähigkeit seit Anfang 2026 öffentlich nicht mehr aus. Was dahintersteckt und warum es relevant ist.
KI-Modelle, die sich selbst entwickeln: Die Rekursive Revolution
Eine 22 Jahre alte Theorie wollte KI bauen, die sich selbst beweisbar verbessert. 2025 brachen LLMs den Beweis. Was geblieben ist, sieht beunruhigend gut aus.
KI findet mehr Schwachstellen, als Teams fixen können
Mehr Findings sind kein Fortschritt, wenn Triage und Patches nicht mithalten. Drei Stufen KI-Sicherheit, drei neue Versagensmodi.
KI-Reasoning erklärt: Warum Denkprozesse von KI kein Sicherheitsbeweis sind
Reasoning-Modelle zeigen ihre Denkschritte und wirken dadurch prüfbar. Diese Lesbarkeit ist trügerisch, sobald man fragt, wofür sie als Beleg tauglich sein soll.
Model Context Protocol: Der Standardkampf um KI-Agenten-Infrastruktur
Alle grossen KI-Labore haben sich auf ein Protokoll geeinigt. Das sollte beruhigen. Stattdessen entsteht eine der wichtigsten strukturellen Angriffsflächen der aktuellen KI-Infrastruktur.
KI-Urteil der Woche: Das Audit-Problem hinter den Goblins
OpenAI wusste Monate nicht, warum sein Modell Goblins beschwor. Das ist kein Bug-Report. Das ist ein Audit-Problem, das jeden betrifft, der glaubt, Regulierung könne auf Selbstauskunft der Labs basieren.
Humanoide Roboter 2026: Physical AI zwischen Serienproduktion und Systemrisiken
Ein humanoider Roboter absolvierte 11 Monate lang Zehn-Stunden-Schichten in einem BMW-Werk. Physische KI ist 2026 messbare Serienproduktion mit harten Grenzen.
Warum ChatGPT plötzlich Goblins liebte: Reward-Hacking im KI-Training
Reward Hacking im KI-Training erklärt: Warum falsche Belohnungssignale Modelle fehlsteuern und was der ChatGPT-Fall für RLHF-Audits zeigt.
NVIDIA NemoClaw erklärt: Was der Sicherheits-Stack für KI-Agenten kann und wo Grenzen bleiben
NVIDIA NemoClaw fügt OpenClaw-Agenten Sandbox-Isolation, Policy-basierte Netzwerkkontrolle und Credential-Trennung hinzu. Doch Sandboxing allein löst das Agenten-Sicherheitsproblem nicht.
KI-Urteil der Woche: Wenn die Firewall denkt — und trotzdem versagt
Unit 42 zeigt: LLM-Guardrails sind keine Sicherheitsgrenzen. Und KI in Malware ist real, aber oft mehr Theater als Bedrohung. Das Urteil.