Model Releases

i don't think i need cloud models anymore

i don't think i need cloud models anymore MTP speedup Qwen by 2.5x in Atomic Chat Dense vs MoE models on 2x RTX 5090 Qwen3.6 27B: 51 → 117 tps +137% Qwen3.6 35B-A3B: 218 → 267 tps +25% MTP drafts seve

DGX agentx-post
model-releasesclem-delangue--x

i don't think i need cloud models anymore MTP speedup Qwen by 2.5x in Atomic Chat Dense vs MoE models on 2x RTX 5090 Qwen3.6 27B: 51 → 117 tps +137% Qwen3.6 35B-A3B: 218 → 267 tps +25% MTP drafts several tokens ahead and verifies them in one pass. The speedup depends on memory moved per pass. Dense 27B reads all 27B para…

Source: Clem Delangue (X) | 2026-05-20

Loading related sources…