July 17, 2026 Kimi K3: 2.8 Trillion Parameters — and Suddenly a Chinese Model Costs as Much as Sonnet Open Source Modelle Benchmarks
July 9, 2026 OpenAI Audits SWE-Bench Pro — and Finds Nearly a Third of Tasks Broken OpenAI Benchmarks Coding Research
June 22, 2026 GPT-5.6 Launch Week: OpenAI Needs to Deliver OpenAI GPT-5.6 Model-Release Benchmarks Competition
May 22, 2026 Cursor Composer 2.5: Matching Opus 4.7 at One-Tenth the Cost Cursor Composer AI Coding Benchmarks Developer
April 25, 2026 GPT-5.5 vs Claude Opus 4.7: The Benchmark Showdown in Detail GPT-5.5 Claude Opus 4.7 Benchmarks Comparison
April 16, 2026 Nature Study: AI Agents Fail at Complex Scientific Tasks AI Agents Research Stanford Nature Benchmarks
April 10, 2026 GLM-5.1: The Open-Source Model That Works Autonomously for 8 Hours Open Source GLM Agents Benchmarks
March 19, 2026 DeepMind Wants to Measure AGI — and Launches a Hackathon to Build the Tests Google DeepMind AGI Benchmarks Research Kaggle