3000 tok/s prefill; 120 tok/s decode on Strix Halo. This is a fork of gufo to support Qwen 3.6 35B A3B for workloads that prioritizes speed over intelligence. - NinjaPear/gufo-Qwen3.6-35B-A3B-Q6dense
0 comments
No comments yet.
Related stories
- MoE Analysis Qwen[3.5|3.6]35B-A3Bgslaller.github.ioHacker News · 1 points · 4 days ago
- Hacker News · 186 points · 3 days ago
- Hacker News · 1 points · 7 days ago
- Hacker News · 1 points · 3 days ago
- ThinkingCap-Qwen3.8-27B: the same answers, 37% less thinkingbottlecapai.comHacker News · 2 points · 9 days ago
- Hacker News · 455 points · 12 days ago