v0.34.4-rc0: mlx: speed up Qwen 3.8 prompt processing (#18550)
mlx: speed up Qwen 3.8 prompt processing Use MLX's gated-delta kernel for long scans and fold dense MLP global scales into SwiGLU. address comments
What moved
mlx: speed up Qwen 3.8 prompt processing Use MLX's gated-delta kernel for long scans and fold dense MLP global scales into SwiGLU. address comments
Why it matters
Filed as a public note from Ollama, 2026-09-23. Tagged Hardware.
On the record
- Filed from the Ollama official RSS on 2026-09-23.
- Primary source host: github.com.
- mlx: speed up Qwen 3.8 prompt processing Use MLX's gated-delta kernel for long scans and fold dense MLP global scales into SwiGLU.
Primary source
github.com
github.com
Desk
Logged as brief 034
Logged as brief 034