RTX 5090 + RAM 128GBでQwen3.8-Flash-Nextをllama.cppで動かしてみた
検証日:2026年8月27日 Qwen3.8-Flash-Nextは125B規模のMoEモデルですが、RTX 5090 32GBとRAM 128GBの1台構成でも動作しました。 UnslothのUD-Q2_K_XL量子化とQwen3.8-Flash-Next対応版のllama.cppを使い、64kコンテキストで設定を詰めた結果、短文生成で約48.0 tokens/s、約16kトークンの入力後でも43.3 tokens/sを記録しました。prefillは約1,429 tokens/s、約16kトークン入力時のTTFT(最初のトークンが返るまでの時間)は約11秒です。 この記事ではモデルの出...
1 件のブックマーク
X に入る文: 「125B の MoE を 1 台構成で動かした記録。量子化と設定が具体的で再現しやすい。」— awesome-linus / RTX 5090 + RAM 128GBでQwen3.8-Flash-Nextをllama.cppで動かしてみた