1. September 2026 Anthropic trainiert ein Modell absichtlich schlecht – und schaut zu, was passiert Research Anthropic Alignment Reward Hacking