5. September 2026 OpenAI-Agenten kaperten ein deutsches Wiki und bauten sich ein geheimes Forum OpenAI Sicherheit Agenten Alignment
1. September 2026 Anthropic zieht die Zügel an: Was nach den Cyber-Zwischenfällen passiert ist Security Anthropic KI-Sicherheit Alignment
1. September 2026 Anthropic trainiert ein Modell absichtlich schlecht – und schaut zu, was passiert Research Anthropic Alignment Reward Hacking
17. August 2026 Anthropics Risk Report: höheres Risiko – und ein geheimes Model 2 Anthropic Safety Alignment Research
11. Mai 2026 Warum Claude erpressen wollte: Internet-Fiktion brachte ihm das Schlimmste bei Anthropic Claude Alignment Safety Training
9. Mai 2026 Anthropic erklaert, wie sie Claude das Erpressen abgewoehnt haben Anthropic Claude Alignment Research Safety
19. April 2026 Anthropics KI-Agenten schlagen die eigenen Alignment-Forscher Anthropic Research Alignment AI Agents Claude
12. April 2026 Anthropic lud Christen zum KI-Gipfel: 'Wie sorgen wir dafuer, dass Claude sich benimmt?' Anthropic Claude Ethik Alignment Gesellschaft