生成AIやLLMを動かすためにクラウドGPUを借りるとき、つい「1時間いくら」で比べたくなる。だが最初に効くのは価格ではなく、そのGPUのVRAMに、動かしたいモデルが載るかだ。載らなければどれだけ安くても動かない。
結論(早見)
①まず必要VRAMを見積もる。ざっくり「パラメータ数×2バイト(fp16)」が下限で、7Bモデルなら約14GB、量子化(4bit)すればその1/4程度。②VRAMが足りるGPUの中で時間単価を比べる。H100/A100は高性能だが高い、L4/T4/RTX系は安いが大きいモデルは載らない。③手軽さ(環境構築の手間・従量課金の粒度・起動の速さ)は時給に隠れたコスト。秒課金か時間課金か、コンテナが用意されているかで実費が変わる。④短時間の実験ならサーバーレス型、長時間の学習なら専有インスタンスが基本。
見るべき3軸
| 軸 | 意味 | 落とし穴 |
|---|---|---|
| VRAM(GB) | モデルが載るかの上限 | 足りないと単価は無意味 |
| 料金/時間($/hr) | 実行コスト | 秒課金か時間課金かで実費が変わる |
| 手軽さ | 環境構築・起動の速さ | 「安いが自分で全部組む」型は時間を食う |
深掘り
量子化でVRAM要件は大きく下げられる
fp16では収まらないモデルも、8bitや4bitに量子化すれば必要VRAMが半分〜1/4になる。「載らないから上位GPU」の前に量子化を検討すると、1段安いGPUで足りることが多い。ただし精度はわずかに落ちる。
「安い」の裏に環境構築コストが隠れている
時間単価が最安の業者ほど、CUDAやドライバ、コンテナを自前で用意させる傾向がある。すぐ使えるテンプレートやサーバーレス推論が用意された業者は、単価が高くても総コストで勝つことがある。実験の回数が多い人ほどこの差が効く。
従量課金の粒度を必ず確認
起動しっぱなしの課金か、リクエスト単位か。断続的に使うなら秒課金・サーバーレスが有利、常時稼働なら時間契約が有利。使い方と課金方式が噛み合っていないと、単価が安くても請求は膨らむ。
▶ クラウドGPU星空で、VRAM・時間単価・手軽さの重みからあなたの一台を選ぶ
※料金・提供GPUは各社で頻繁に改定されます。実際の必要VRAMはモデルの実装・バッチサイズ・系列長で変わります。最新の公式料金と自分の構成での実測を確認してください。