17. Juli 2026 Kimi K3: 2,8 Billionen Parameter — und plötzlich kostet ein chinesisches Modell so viel wie Sonnet Open Source Modelle Benchmarks
9. Juli 2026 OpenAI prüft SWE-Bench Pro — und findet fast ein Drittel fehlerhafte Aufgaben OpenAI Benchmarks Coding Research
22. Juni 2026 GPT-5.6 Launch-Woche: OpenAI steht unter Zugzwang OpenAI GPT-5.6 Model-Release Benchmarks Competition
22. Mai 2026 Cursor Composer 2.5: So gut wie Opus 4.7, ein Zehntel der Kosten Cursor Composer AI Coding Benchmarks Developer
25. April 2026 GPT-5.5 vs Claude Opus 4.7: Das Benchmark-Duell im Detail GPT-5.5 Claude Opus 4.7 Benchmarks Vergleich
16. April 2026 Nature-Studie: KI-Agenten scheitern an komplexen wissenschaftlichen Aufgaben KI-Agenten Forschung Stanford Nature Benchmarks
10. April 2026 GLM-5.1: Das Open-Source-Modell, das 8 Stunden autonom arbeitet Open Source GLM Agenten Benchmarks
19. März 2026 DeepMind will AGI messbar machen — und startet einen Hackathon dafuer Google DeepMind AGI Benchmarks Forschung Kaggle