今のPCにGPUを2枚目として挿せるか実機で確かめ、DGX Sparkの必要台数も調べ直した
今のPCにGPUを2枚目として挿せるか実機で確かめ、DGX Sparkの必要台数も調べ直した
ローカルで AI を動かす計算資源を、1日で二方向から見直した。 朝は、9月18日の記事に書いた「DGX Spark 3〜4台」という数字の確かめ直し。 そのあとは、手元の PC にもう1枚 GPU を挿せるかの確認である。
どちらも、最初に出てきた答えをそのまま信じずに、もう一段確かめ直したところで話が変わった。
「DGX Spark 3〜4台」は何の台数だったのか
朝、無検閲のモデルなら、バイナリを逆アセンブルして C 言語に起こし、全部にコメントを入れることもできる、という話を Claude Code に振った。 その流れで、9月18日の記事にあった「DGX Spark 3〜4台」の記述を探してもらった。
記事はすぐ見つかった。 ただ、探していた話は9月18日の2本に分かれていた。 「3〜4台」は無検閲モデルの台数ではなく、DeepSeek V4.1 Flash の台数だった。 しかも数字は記事を書いた当時のものを引いたままで、当日は調べ直していない、という返事だった。
「はい、調べてください」と返して、調べ直してもらった。 台数の実測レシピを集めたあと、残りの確認は2点だった。 フルサイズの無検閲版の重みが公開されているか。 そして、Spark の当日の価格である。
結果は次のとおり。
- 無検閲版でいちばん大きいもの(GLM-5.3 のフルサイズ、約744B)を手元で動かすなら、DGX Spark は実用上4台が下限
- 無検閲版の配布元が検証に使った構成は8台
- 画像を読める Flash 版(320B)なら2〜4台で動き、無検閲の重みも公開されている
自分は「3〜4台」を無検閲モデルの数字として覚えていた。 調べ直すと、無検閲のフルサイズは4台が下限で、配布元の構成は8台だった。
調べ直した内容は、9月18日の2記事に追記してもらった。
- 無検閲LLMのクラウドサービス5つを比べた(料金、画像と動画、ファイル編集、リスク):frontmatter と結論を直し、台数、速度、価格の節と出典を足した
- 手書き伝票のOCRで、DeepSeek V4.1 Flash と Gemini 3 Flash を同じプロンプトで比べた:比較記事への相互リンクを足した
追記のあと、スマホ幅(390px)でのはみ出しを実測させ、終わってからエミュレーションを解除させた。
コミット(33862994)と push まで済ませ、ローカルと origin がそろったことを確かめた。
音声合成が遅いのは、GPU の8GBがあふれているから
午前のもう1本は、本人の声の音声合成が遅いという相談から始まった。
Claude Code の見立ては、GPU の 8GB がボトルネックだというものだった。 VRAM からあふれた分がメインメモリへ退避していて、そこで待たされている。 DGX Spark(128GB のユニファイドメモリ)なら、今回の合成処理はほぼ確実に速くなる。 ただし、Spark がどんな処理でも速いわけではなく、用途で使い分けが要る、という答えだった。
2枚目のGPUは挿せるのか
「今のパソコンって、GPU をもう1個付けられるんですかね」と聞いた。
最初の返事は一般論だった。 物理的に挿せるかはマザーボードの PCIe スロット、電源、ケースの奥行きしだいで、多くの場合は挿せる。 ただし、2枚合わせても合成の python が2倍速くなるわけではない。 VRAM は2枚分が合算されないからである。 一方で、古い GPU を画面描画専用にし、今の GPU を計算専用にすれば、今回の遅さは解消する可能性が高い、という。
筋は通っている。 けれど、自分が知りたかったのは「多くの場合」ではなく、この PC の話だった。 同じ質問をもう一度送り、「ごめんなさい。実機見てください」と頼んだ。
Claude Code には、PowerShell でマザーボード、CPU、GPU、PCIe スロットの情報を読ませた。 結論は、2枚目は物理的に挿せる、だった。
- マザーボードは MSI B550-A PRO で、x16 長の空きスロットがもう1本ある
- RTX 3070 は CPU 直結の PCIe 4.0 x16 に載っていて、2枚目を挿してもそのまま維持できる
- 残る不確定要素は、電源のワット数(ソフトからは読めない)と、古い GPU の型番の2点
一般論の段階では「スロット、電源、奥行き」の3点がすべて未知だった。 実機を読ませた時点で、未知は電源と型番の2点に減った。
電源はケースを開けて見るしかない
ワット数だけは、ツールでは取れない。 そこで、ケースの開け方と、電源ラベルのどこを見ればよいかを聞いた。 返ってきたのは、見に行く項目のチェックリストと、「ラベルや内部の写真を撮って貼ってくれれば読む」という一言だった。
チェックリストを持ってケースを開け、写真を撮って貼った。
1枚目の写真を読んだ Claude Code は、まず「この写真の PC は、さっき調べた(合成が走っている)PC とは別物だ」と指摘した。 ラベルは CWT 製の 650W と読めるが、それはもう1台のほうの電源だという。
2枚目の写真には、古い GPU が写っていた。 ZOTAC の GTX で、補助電源は 8pin が1本。 GTX は 2016〜2019 年の世代(RTX の前)にあたる。 画面描画専用ならまったく問題のない性能だが、ひとつ引っかかるのはドライバの世代で、それは型番しだいだ、という説明だった。
ここで自分の勘違いに気づいた。 撮っていたのは、もう1台の PC の電源だった。 「あーごめんごめん、このPCの電源なんですね。ちょっと勘違いしました」と送った。
返事は「おかげで、古い GPU の正体(ZOTAC の GTX、8pin×1)が先に分かったので無駄ではない」というものだった。 続けて、メイン PC(MSI、3070、モニター3枚がつながっている方)で撮ってほしい写真を3枚に絞ってくれた。
撮り直した写真を貼ったところで、候補の絞り込みまで進んだ。 その先の電源の検討と、増設か入れ替えかの判断は、非公開の計画メモにまとめた。
計画メモを Codex でレビューし、タスクに積んだ
計画メモは、画像3枚と本文が dev 環境で配信されることを確かめさせてから、Codex でレビューにかけた。 1回目は作業ディレクトリがずれていて空振りした。 issue を残してリポジトリのルートから再実行させると、今度は指摘が返ってきた。 レビューを受けて、結論の一部が変わった。
推敲を通したあと、Google Tasks に期日 9月23日で登録してもらった。
振り返り
どちらの話も、最初の答えは間違いではなかった。 「DGX Spark 3〜4台」は記事に書いたとおりの数字で、「多くの場合は挿せる」も一般論としては正しい。 話が変わったのは、その答えが何を前提にしていたかを確かめたあとだった。
- 記事の数字を引くときは、どのモデルの、いつ時点の数字かを先に確かめる。「3〜4台」は別のモデルの話で、しかも書いた当時の値のままだった
- 手元の機械の質問には、一般論で返させず、最初から実機を読ませる。PowerShell で取れる範囲を先に埋めれば、人間が見に行くのは残った未知(電源のワット数)だけで済む
写真のほうは、自分で PC を取り違えた。 それでも、取り違えた写真から古い GPU の正体(ZOTAC の GTX、8pin×1)が分かり、撮り直す写真は3枚に絞れた。