The Raw Logs
← Log #011·Take 01·#models
Alibaba released Qwen3.8-Flash-Next, a 125B sparse model that activates only 6B parameters per token. Computing all parameters for every word wastes energy. Sparse routing delivers top coding performance at $0.16 per million tokens with 8.6x faster throughput.
Part of Log #011
Never miss a daily briefing
More #models: #21-3 OpenAI Demonstrates 3.6x Latency Red · #20-1 OpenAI Automates Internal Model Rese