ブログ

旧世代のRTX 3090でQwen3.8-27Bを高速動作させる:1枚のGPUで実現する262Kコンテキストの可能性

今回は、Andrew Zhu氏の執筆した 100 Tokens/Second on One RTX 3090 Ti: Qwen3.8–27B, Full 262K Context, One GPU という記事の内容を参考に、型落ちと思われがちなコンシューマー向けGPUが、最新の最適化によってどれほどのパフォーマンスを発揮できるようになったのかを整理してみます。

ローカルLLMの話題です。参考まで。


概要:1枚のGPUで「高密度27Bモデル」を動かす

これまで、Qwen3.8-27Bのような大規模なモデルを高品質(Q8量子化など)で動かすには、約28GB以上のVRAMが必要とされてきました。そのため、VRAMが24GBであるRTX 3090や4090を1枚使った構成ではメモリが不足し、速度や精度を犠牲にするか、あるいは2枚のGPUを連結して動作させるのが一般的でした。

しかし、最新の最適化手法を組み合わせることで、2020年に発売されたRTX 3090であっても、262Kという巨大なコンテキストウィンドウを維持しながら、100トークン/秒に近い速度で推論が可能であることが分かってきました。

パフォーマンスの実測値

実際に測定された各GPUの推論パフォーマンス(スループット)を以下の表にまとめました。ここではデコード(生成)速度と、プロンプトの読み込み(プリフィル)速度を比較しています。

GPUモデル デコード速度 (tok/s) プロンプト・プリフィル (t/s)
RTX 3090 65 – 80 1,000 – 1,300
RTX 3090 Ti 70 – 100 1,200 – 1,700
RTX 5090 150 – 180 3,000 – 4,000

この数値が意味すること

人間が自然に文章を読み進める速度は約30トークン/秒程度と言われています。RTX 3090の「65~80トークン/秒」という数字は、人間が読むよりも遥かに速く、AIとのリアルタイムな対話において全くストレスを感じないレベルに達していることを示しています。

また、最新のRTX 5090であればその倍以上の速度が出ていますが、5年前のハードウェアである3090シリーズでこれだけのパフォーマンスが出せる点は、ローカルLLMの運用において大きな意味を持ちます。

仕組みと処理の流れ

なぜ、これまで2枚のGPUが必要だった構成が1枚で完結し、かつ高速化できたのでしょうか。そこには効率的なメモリ管理と、量子化技術の進歩があると考えられます。

処理の全体像は以下のようなイメージです。

flowchart TD
  Input["入力プロンプト<br>(最大262Kトークン)"] --> PreFill["プリフィル処理<br>(並列計算による高速読み込み)"]
  PreFill --> KV_Cache["最適化されたKVキャッシュ<br>(VRAM消費を抑制)"]
  KV_Cache --> GPU_Infer["GPU単体での推論<br>(RTX 3090 / 24GB)"]
  GPU_Infer --> Decode["デコード処理<br>(逐次トークン生成)"]
  Decode --> Output["生成出力<br>(100 tok/s 程度の高速応答)"]

  style GPU_Infer fill:#f9f,stroke:#333,stroke-width:2px

以前は28GB必要だったモデルでも、量子化パラメータの調整やKVキャッシュ(過去の対話内容を保持するメモリ領域)の圧縮技術を組み合わせることで、24GBの枠内に収めることが可能になったようです。これにより、GPU間通信のオーバーヘッドがなくなり、結果として1枚のGPUで動かした方がスループットが向上するという現象が起きています。

実務におけるメリット

この構成をローカル環境で構築できることには、いくつかの具体的なメリットがあるかと思います。

  1. コスト効率の向上 中古市場で流通しているRTX 3090を活用すれば、高価なH100などのサーバー用GPUを借りることなく、実用的な速度のAIエージェントを構築できます。
  2. 長大なコンテキストの活用 262Kというコンテキストウィンドウがあれば、本一冊分に相当するドキュメントを一度に読み込ませて、その内容に基づいた回答を得ることができます。
  3. プライバシーと応答性 外部APIを介さないため、機密情報の漏洩リスクを抑えつつ、ローカルネットワーク内で高速な応答が可能です。

まとめ

今回の事例は、AIの性能を引き出すのはハードウェアの世代交代だけではなく、ソフトウェア側の最適化がいかに重要であるかを物語っているように感じます。最新のRTX 5090が圧倒的なのは確かですが、工夫次第で数年前のカードも「AI専用マシン」として第一線で活用できるというのは、非常に面白い状況ではないでしょうか。

もし手元に眠っている、あるいは安価に入手できる24GBクラスのGPUがあれば、こうした最新モデルの実行を試してみると、その進化を実感できるかもしれません。

参照記事