[{"data":1,"prerenderedAt":623},["ShallowReactive",2],{"content-/voicebox-local-ai-voice-studio":3,"all-pages-for-dir":603,"related-/voicebox-local-ai-voice-studio":604,"og-image-/voicebox-local-ai-voice-studio":622},{"id":4,"title":5,"body":6,"category":582,"concepts":583,"description":584,"extension":585,"meta":586,"navigation":587,"ogImage":583,"path":588,"project_name":589,"published":590,"publishedAt":591,"seo":592,"stem":593,"tags":594,"todo":601,"unpublished":590,"updatedAt":591,"__hash__":602},"pages/2026-07/2026-07-25/voicebox-local-ai-voice-studio.md","voicebox調査メモ — RTX 3070（8GB）でローカルAIボイススタジオは動くか",{"type":7,"value":8,"toc":572},"minimark",[9,13,17,33,36,49,71,74,77,84,149,152,156,164,268,271,274,278,285,339,342,407,416,420,423,426,453,456,486,489,498,502,505,508,522,525,568],[10,11,5],"h1",{"id":12},"voicebox調査メモ-rtx-30708gbでローカルaiボイススタジオは動くか",[14,15,16],"h2",{"id":16},"結論",[18,19,20,24,27,30],"ul",{},[21,22,23],"li",{},"voiceboxはRTX 3070（VRAM 8GB）で動く。主要エンジンは最大でも1.7Bパラメータ（VRAM約3.4〜4.2GB）で、音声入力用のWhisperを同時に載せても8GBに収まる",[21,25,26],{},"Windows用MSIインストーラーに「CUDA版」と「any GPU（DirectML）版」があり、RTX 3070ならCUDA版を選ぶ。初回起動時にCUDAライブラリ約4GBを追加ダウンロードする",[21,28,29],{},"日本語でボイスクローンしたい場合、対応エンジンは実質Qwen3-TTS一択。このモデルは2026年1月に手動セットアップで検証済みで、voiceboxはその作業をGUIアプリに置き換えるものと位置づけられる",[21,31,32],{},"日本語圏の実機レビューは「無料・ローカルでこの精度なら十分」が多数派。不満（イントネーションの乱れ・生成速度）は中身のQwen3-TTS由来で、voicebox固有の価値はMCPサーバー内蔵によるエージェント連携にある",[14,34,35],{"id":35},"voiceboxとは",[37,38,39,48],"p",{},[40,41,47],"a",{"href":42,"target":43,"rel":44},"https://github.com/jamiepine/voicebox","_blank",[45,46],"noopener","noreferrer","jamiepine/voicebox","は「The open-source AI voice studio」を掲げるローカル実行型の音声AIツール。ElevenLabs（音声生成）とWispr Flow（音声入力）が担っている機能を1つのデスクトップアプリに統合している。できることは3つある。",[50,51,52,59,65],"ol",{},[21,53,54,58],{},[55,56,57],"strong",{},"Voice Clone",": 音声サンプルから声を複製する",[21,60,61,64],{},[55,62,63],{},"Generate Speech",": テキストから音声を生成する（TTS）",[21,66,67,70],{},[55,68,69],{},"Dictate",": 任意のアプリに音声入力する（STT。エンジンはOpenAI Whisper）",[37,72,73],{},"Tauri製のデスクトップアプリで、Windows / macOS / Linuxに対応する。クラウドAPIを使わずすべてローカルGPU（またはCPU）で推論する点がElevenLabsやFish Audioとの違いになる。",[14,75,76],{"id":76},"過去記事との関係",[37,78,79,80,83],{},"「以前voiceboxを調べたことがあるか」をリポジトリ全体（公開記事＋memo）から検索した結果、",[55,81,82],{},"voicebox自体を扱った記事はなかった","。ただし同ジャンルの記事が3本あり、記憶の混同はおそらくこれが原因だろう。",[85,86,87,103],"table",{},[88,89,90],"thead",{},[91,92,93,97,100],"tr",{},[94,95,96],"th",{},"記事",[94,98,99],{},"日付",[94,101,102],{},"voiceboxとの関係",[104,105,106,121,135],"tbody",{},[91,107,108,115,118],{},[109,110,111],"td",{},[40,112,114],{"href":113},"/qwen3-tts-guide","Qwen3-TTS セットアップ & 使い方ガイド",[109,116,117],{},"2026-01-23",[109,119,120],{},"voiceboxの主力TTSエンジンと同じモデル。Python環境を手動構築して検証済み",[91,122,123,129,132],{},[109,124,125],{},[40,126,128],{"href":127},"/fish-audio-s2-voice-clone","Fish Audio S2 ボイスクローン",[109,130,131],{},"2026-03-17",[109,133,134],{},"クラウド型ボイスクローンの比較対象",[91,136,137,143,146],{},[109,138,139],{},[40,140,142],{"href":141},"/elevenlabs-tts-comparison","ElevenLabs TTS比較",[109,144,145],{},"2026-03-16",[109,147,148],{},"voiceboxが置き換えを狙うサービスそのもの",[37,150,151],{},"つまりvoiceboxは新規の技術ではなく、1月にコマンドラインで動かしたQwen3-TTSをインストーラー1発のGUIアプリとして包み直したものと捉えられる。",[14,153,155],{"id":154},"gpu要件の判断-rtx-30708gbで足りる","GPU要件の判断 — RTX 3070（8GB）で足りる",[37,157,158,159,163],{},"手元のGPUを",[160,161,162],"code",{},"nvidia-smi","で確認すると、RTX 3070 / VRAM 8,192 MiB / ドライバ591.86だった。これに対してvoiceboxが同梱する主要エンジンのVRAM目安は次のとおり。",[85,165,166,185],{},[88,167,168],{},[91,169,170,173,176,179,182],{},[94,171,172],{},"エンジン",[94,174,175],{},"サイズ",[94,177,178],{},"VRAM目安",[94,180,181],{},"対応言語",[94,183,184],{},"RTX 3070での可否",[104,186,187,204,220,235,251],{},[91,188,189,192,195,198,201],{},[109,190,191],{},"Qwen3-TTS 1.7B",[109,193,194],{},"1.7B",[109,196,197],{},"約3.4〜4.2GB",[109,199,200],{},"10言語（日本語含む）",[109,202,203],{},"動く",[91,205,206,209,212,215,218],{},[109,207,208],{},"LuxTTS",[109,210,211],{},"軽量",[109,213,214],{},"約1GB",[109,216,217],{},"英語のみ",[109,219,203],{},[91,221,222,225,228,231,233],{},[109,223,224],{},"Chatterbox Turbo",[109,226,227],{},"350M",[109,229,230],{},"1GB未満",[109,232,217],{},[109,234,203],{},[91,236,237,240,243,246,249],{},[109,238,239],{},"Kokoro",[109,241,242],{},"82M",[109,244,245],{},"ごく僅か（CPUでもリアルタイム）",[109,247,248],{},"8言語",[109,250,203],{},[91,252,253,256,259,262,265],{},[109,254,255],{},"Whisper（STT）",[109,257,258],{},"large-v3",[109,260,261],{},"約3GB",[109,263,264],{},"多言語",[109,266,267],{},"TTSと併用可",[37,269,270],{},"一般には「8GB以上推奨、3BクラスのTTSモデルは12GB以上」とされるが、voiceboxの同梱エンジンは最大でも1.7Bなので、8GBは推奨ラインの下限をちょうど満たす。Qwen3-TTS（約4GB）とWhisper large-v3（約3GB）を同時にロードしても計7GB程度で、8GBに収まる計算になる。",[37,272,273],{},"なおCPU実行も可能で、Kokoro 82MはモダンなCPUでリアルタイムに生成でき、LuxTTSはCPUで150倍速を超えると公式ドキュメントに記載がある。英語だけならGPUなしでも実用になる。",[14,275,277],{"id":276},"エージェントからの使いやすさ-mcpサーバーを内蔵","エージェントからの使いやすさ — MCPサーバーを内蔵",[37,279,280,281,284],{},"voiceboxはMCP（Model Context Protocol）サーバーを内蔵しており、Claude Code・Cursor・ClineなどのコーディングエージェントがローカルHTTP経由（",[160,282,283],{},"http://127.0.0.1:17493/mcp","）で直接呼び出せる。エージェント側に公開されるツールは4つ。",[85,286,287,297],{},[88,288,289],{},[91,290,291,294],{},[94,292,293],{},"ツール",[94,295,296],{},"機能",[104,298,299,309,319,329],{},[91,300,301,306],{},[109,302,303],{},[160,304,305],{},"voicebox.speak",[109,307,308],{},"テキストを指定の声（クローン声を含む）で読み上げる",[91,310,311,316],{},[109,312,313],{},[160,314,315],{},"voicebox.transcribe",[109,317,318],{},"音声ファイルをWhisperで文字起こしする",[91,320,321,326],{},[109,322,323],{},[160,324,325],{},"voicebox.list_captures",[109,327,328],{},"最近の録音と文字起こし結果を一覧する",[91,330,331,336],{},[109,332,333],{},[160,334,335],{},"voicebox.list_profiles",[109,337,338],{},"クローン声・プリセット声を一覧する",[37,340,341],{},"Claude Codeへの登録はコマンド1行で済む。",[343,344,349],"pre",{"className":345,"code":346,"language":347,"meta":348,"style":348},"language-bash shiki shiki-themes vitesse-light vitesse-light","claude mcp add voicebox --transport http \\\n  --url http://127.0.0.1:17493/mcp \\\n  --header \"X-Voicebox-Client-Id: claude-code\"\n","bash","",[160,350,351,380,391],{"__ignoreMap":348},[352,353,356,360,364,367,370,374,377],"span",{"class":354,"line":355},"line",1,[352,357,359],{"class":358},"senZ8","claude",[352,361,363],{"class":362},"sdGka"," mcp",[352,365,366],{"class":362}," add",[352,368,369],{"class":362}," voicebox",[352,371,373],{"class":372},"snbK4"," --transport",[352,375,376],{"class":362}," http",[352,378,379],{"class":372}," \\\n",[352,381,383,386,389],{"class":354,"line":382},2,[352,384,385],{"class":372},"  --url",[352,387,388],{"class":362}," http://127.0.0.1:17493/mcp",[352,390,379],{"class":372},[352,392,394,397,401,404],{"class":354,"line":393},3,[352,395,396],{"class":372},"  --header",[352,398,400],{"class":399},"sMJiu"," \"",[352,402,403],{"class":362},"X-Voicebox-Client-Id: claude-code",[352,405,406],{"class":399},"\"\n",[37,408,409,410,415],{},"「ビルドが終わったら自分のクローン声で知らせる」「エージェントが書いた原稿をそのままナレーション化する」といった連携を、追加開発なしで組めることになる。Qwen3-TTSを手で動かす構成にはないvoicebox固有の価値がここにあり、",[40,411,414],{"href":412,"target":43,"rel":413},"https://syusodo.co.jp/tech-blog/articles/repo-jamiepine-voicebox",[45,46],"→ 秋霜堂のテックブログ","もMCP統合を「他のOSSには見られない差別化ポイント」と評している。",[14,417,419],{"id":418},"日本語圏の評判-品質の評価は実質qwen3-ttsの評価","日本語圏の評判 — 品質の評価は実質Qwen3-TTSの評価",[37,421,422],{},"X（Twitter）の日本語ポストをGrok検索で集めた（2026年3月以降、宣伝系を除いて実機レビューを優先）。全体としては「無料・ローカルでこの精度なら十分」という好意的評価が多数派で、不満はイントネーションと生成速度に集中している。",[37,424,425],{},"ポジティブな評価:",[18,427,428,437,445],{},[21,429,430,431,436],{},"AIコンサル会社代表: 「声クローンのツール一通り試したけど、無料でこの精度はvoicebox一択だった」「数秒でここまで再現されるのは普通に怖い」（",[40,432,435],{"href":433,"target":43,"rel":434},"https://x.com/fuji_ai_/status/2075905453939384830",[45,46],"→ @fuji_ai_のポスト","）",[21,438,439,440,436],{},"印刷会社SE: 「かなーーり似ていると思います！ただ、NVIDIAのGPUがなく、CPUだけで計算しているので、めっちゃくちゃ時間掛かります」（",[40,441,444],{"href":442,"target":43,"rel":443},"https://x.com/jdash2000/status/2079206551315968042",[45,46],"→ @jdash2000のポスト",[21,446,447,448,436],{},"「ガチでナレーションいらないレベルです。問題は生成が遅いくらい？」（",[40,449,452],{"href":450,"target":43,"rel":451},"https://x.com/tomotravel_pm/status/2080297685140308186",[45,46],"→ @tomotravel_pmのポスト",[37,454,455],{},"ネガティブな評価・注意点:",[18,457,458,466,474],{},[21,459,460,461,436],{},"「イントネーションが時々変になる事があるな」（",[40,462,465],{"href":463,"target":43,"rel":464},"https://x.com/musicteach23/status/2079134388600684578",[45,46],"→ @musicteach23のポスト",[21,467,468,469,436],{},"実測レポート: アプリ600MB＋初回モデルDL約5GB（Qwen3-TTS 1.7B）。抑揚の制御機能はない（",[40,470,473],{"href":471,"target":43,"rel":472},"https://x.com/nondemo_LowT/status/2079015157129470453",[45,46],"→ @nondemo_LowTのポスト",[21,475,476,477,480,481,436],{},"モデルDL中にアプリを閉じると起動不能になるバグ。",[160,478,479],{},"AppData\\Roaming\\sh.voicebox"," の削除で復旧する（",[40,482,485],{"href":483,"target":43,"rel":484},"https://x.com/dotBoTEN/status/2079453594462683642",[45,46],"→ @dotBoTENのポスト",[37,487,488],{},"押さえておきたいのは、品質への評価（似ている・イントネーションが変・CPUで遅い）はラッパーであるvoiceboxではなく、中身のQwen3-TTS 1.7Bに帰属する点だ。イントネーションの乱れはvoiceboxのアップデートでは直らず、Qwen側のモデル更新を待つことになる。voicebox固有の評価にあたるのは、バグ・UX・MCP連携への言及のほうになる。",[37,490,491,492,497],{},"なおGitHubスターは4.6万を超えており（2026-07-25時点）、海外の熱狂ぶりに比べると日本語圏は「実務系アカウントが試して概ね好評」という段階にある。",[40,493,496],{"href":494,"target":43,"rel":495},"https://note.com/kazu_t/n/n649d265f0c8d",[45,46],"→ AI Academy創業者・谷一徳氏のnote記事","（品質評価部分は有料）など、解説記事も出始めている。",[14,499,501],{"id":500},"windowsでのインストールと注意点","Windowsでのインストールと注意点",[37,503,504],{},"インストールはGitHubのリリースからMSIを落とすだけでよい。開発版を動かす場合はBun / Rust / Python 3.11+ / Tauriの前提環境が必要になるが、MSI利用なら不要だ。",[37,506,507],{},"注意点は2つある。",[50,509,510,516],{},[21,511,512,515],{},[55,513,514],{},"初回起動時のダウンロードが大きい","。アプリ本体とは別に、サーバーコア（200〜400MB）とCUDAライブラリ（約4GB）を追加ダウンロードする。回線とディスクに余裕を持って始める",[21,517,518,521],{},[55,519,520],{},"日本語対応エンジンはQwen3-TTSとKokoroのみ","。LuxTTSとChatterbox Turboは英語専用なので、日本語のボイスクローン目的ならQwen3-TTSを使うことになる",[14,523,524],{"id":524},"出典",[18,526,527,533,540,547,554,561],{},[21,528,529],{},[40,530,532],{"href":42,"target":43,"rel":531},[45,46],"→ jamiepine/voicebox（GitHub）",[21,534,535],{},[40,536,539],{"href":537,"target":43,"rel":538},"https://github.com/jamiepine/voicebox/blob/main/docs/content/docs/overview/gpu-acceleration.mdx",[45,46],"→ voicebox公式ドキュメント: GPU acceleration",[21,541,542],{},[40,543,546],{"href":544,"target":43,"rel":545},"https://starlog.is/articles/ai-dev-tools/jamiepine-voicebox/",[45,46],"→ Starlog: Voicebox — The 7-Engine AI Voice Studio",[21,548,549],{},[40,550,553],{"href":551,"target":43,"rel":552},"https://www.spheron.network/tools/gpu-recommender/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/",[45,46],"→ Spheron: Qwen3-TTS 1.7B VRAM Requirements",[21,555,556],{},[40,557,560],{"href":558,"target":43,"rel":559},"https://github.com/jamiepine/voicebox/blob/main/backend/mcp_server/README.md",[45,46],"→ voicebox MCPサーバー README",[21,562,563],{},[40,564,567],{"href":565,"target":43,"rel":566},"https://www.star-history.com/jamiepine/voicebox/",[45,46],"→ Star History: jamiepine/voicebox",[569,570,571],"style",{},"html pre.shiki code .senZ8, html code.shiki .senZ8{--shiki-default:#59873A;--shiki-dark:#59873A}html pre.shiki code .sdGka, html code.shiki .sdGka{--shiki-default:#B56959;--shiki-dark:#B56959}html pre.shiki code .snbK4, html code.shiki .snbK4{--shiki-default:#A65E2B;--shiki-dark:#A65E2B}html pre.shiki code .sMJiu, html code.shiki .sMJiu{--shiki-default:#B5695977;--shiki-dark:#B5695977}html .default .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}html.dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}",{"title":348,"searchDepth":382,"depth":382,"links":573},[574,575,576,577,578,579,580,581],{"id":16,"depth":382,"text":16},{"id":35,"depth":382,"text":35},{"id":76,"depth":382,"text":76},{"id":154,"depth":382,"text":155},{"id":276,"depth":382,"text":277},{"id":418,"depth":382,"text":419},{"id":500,"depth":382,"text":501},{"id":524,"depth":382,"text":524},"dev",null,"jamiepine製のオープンソース音声AIツールvoiceboxを調査。RTX 3070（VRAM 8GB）で足りるかの判断、過去に調べたQwen3-TTS・Fish Audioとの関係、日本語圏の評判、MCP連携によるコーディングエージェントからの使い方を整理する","md",{},true,"/voicebox-local-ai-voice-studio","misc-dev",false,"2026-07-25T00:00:00.000Z",{"title":5,"description":584},"2026-07/2026-07-25/voicebox-local-ai-voice-studio",[595,596,597,598,599,600],"voicebox","tts","voice-clone","qwen3-tts","gpu","windows","memo","gWVGO4Qn99-Cki7mB14R8bMPWRQeKTaTp2N0tkP-haI",[],[605,607,611,614,618],{"title":114,"path":113,"publishedAt":606},"2026-01-23T00:00:00.000Z",{"title":608,"path":609,"publishedAt":610},"DN_SuperBook_PDF_Converter 導入ガイド","/dn_superbook_pdf_converter_setup_guide","2026-01-26T00:00:00.000Z",{"title":612,"path":613,"publishedAt":591},"テキストファイルにパスワードをかける前に — 1Passwordのセキュアノートと保管庫","/1password-notes-and-vaults",{"title":615,"path":616,"publishedAt":617},"1Password SSH AgentでコーディングエージェントのSSH接続を安全にする","/1password-ssh-agent-coding-agent-setup","2026-07-23T00:00:00.000Z",{"title":619,"path":620,"publishedAt":621},"Joy-ConをStream Deck代わりにしてパソコンとターミナルを操作できるか調べた","/joycon-stream-deck-terminal-control","2026-07-21T00:00:00.000Z","https://log.eurekapu.com/og/blog/voicebox-local-ai-voice-studio.png?v=2026-07-25T00%3A00%3A00.000Z&title=voicebox%E8%AA%BF%E6%9F%BB%E3%83%A1%E3%83%A2%20%E2%80%94%20RTX%203070%EF%BC%888GB%EF%BC%89%E3%81%A7%E3%83%AD%E3%83%BC%E3%82%AB%E3%83%ABAI%E3%83%9C%E3%82%A4%E3%82%B9%E3%82%B9%E3%82%BF%E3%82%B8%E3%82%AA%E3%81%AF%E5%8B%95%E3%81%8F%E3%81%8B&author=Kei%20Komatsu&sig=a749c6dd1c277b7f",1785099347075]