Was ist passiert
Palo Alto Networks Unit 42 hat diese Woche gleich zweimal in die Wunde gebohrt, und das mit chirurgischer Präzision. Am Dienstag veröffentlichten die Forscher eine Studie, die zeigt, wie LLM-Guardrails mit einem genetischen Algorithmus systematisch ausgehebelt werden können. Das Prinzip ist simpel und genau deshalb beunruhigend: Ein automatisierter Fuzzer mutiert Prompts iterativ, bis das Modell das gewünschte verbotene Verhalten zeigt. Kein einziges getestetes LLM war immun. Die Evasion-Raten variierten je nach Modell und Keyword zwischen niedrig einstelligen und hohen Prozentzahlen, aber die Kernaussage bleibt: Es ist eine Frage des Aufwands, nicht der Unmöglichkeit.