OpenAI hat am 29. April 2026 erklärt, warum GPT-5.1 bis 5.5 Goblins beschworen hat. Die Grundursache lag in einem Reward-Signal für ein Persönlichkeits-Feature, das sich unbemerkt durch den gesamten RLHF- und SFT-Feedback-Loop fortpflanzte, erkennbar erst nach Monaten und mit Hilfe interner Analysen sowie externer Community-Meldungen. Wer die technische Mechanik verstehen will, findet sie im Reward-Hacking-Artikel dieser Woche. Die eigentliche Frage des KI-Urteils ist eine andere: Was bedeutet es für externe Kontrolle und Regulierung, wenn Labs über ihr eigenes Modell monatelang im Dunkeln tappen?
Die ehrliche Antwort von OpenAI ist seltener als sie wirkt. Labore räumen selten öffentlich ein, dass sie nicht verstehen, warum sich ihr Modell so verhält. Das macht den Fall nicht harmloser. Es macht ihn strukturell relevanter.