Models Are Getting Dumber on Purpose
- Reasoning scores keep climbing while per-token compute keeps dropping.
- GLM-5.2 scores 99.2% on AIME 2026 with about 40 billion parameters active per token.
- Qwen3.5 scores 91.3% with 17 billion active.
Unverified
- Reasoning scores keep climbing while per-token compute keeps dropping.
- GLM-5.2 scores 99.2% on AIME 2026 with about 40 billion parameters active per token.
- Qwen3.5 scores 91.3% with 17 billion active.
Sources: W4g1