[{"data":1,"prerenderedAt":304},["ShallowReactive",2],{"content-/voice-clone-tts-course-narration-research":3,"all-pages-for-dir":283,"related-/voice-clone-tts-course-narration-research":284,"og-image-/voice-clone-tts-course-narration-research":303},{"id":4,"title":5,"body":6,"category":264,"concepts":265,"description":266,"extension":267,"meta":268,"navigation":269,"ogImage":265,"path":270,"project_name":271,"published":272,"publishedAt":273,"seo":274,"source":275,"stem":276,"tags":277,"todo":265,"unpublished":272,"updatedAt":265,"__hash__":282},"pages/2026-09/2026-09-24/voice-clone-tts-course-narration-research.md","講座ナレーションを自分の声で作るTTS調査：Irodori-TTSのボイスデザイン、Gemini TTSの制約、Fish Audioの料金とDrama 3",{"type":7,"value":8,"toc":252},"minimark",[9,13,17,22,25,70,74,77,80,83,87,90,93,106,109,113,116,119,122,125,129,132,135,228,231,239,243,246,249],[10,11,5],"h1",{"id":12},"講座ナレーションを自分の声で作るtts調査irodori-ttsのボイスデザインgemini-ttsの制約fish-audioの料金とdrama-3",[14,15,16],"p",{},"Excel の基礎講座の音声は、いま Irodori-TTS に自分の声の録音を渡して作っている。\nこの日は朝の6時台から昼前にかけて、その声の作り方について、3つのセッションで Claude Code に質問を重ねた。\n気になっていたのは、有料のツールに乗り換えれば今より良い声になるのか、という点である。\n良くなるなら、最終的に決まった音声だけはそちらに流してもいいと考えていた。",[18,19,21],"h2",{"id":20},"テキストでボイスデザインは何を指すのか","「テキストでボイスデザイン」は何を指すのか",[14,23,24],{},"最初の疑問は、Irodori-TTS の「テキストでボイスデザインができる」という言い回しだった。\nClaude Code によれば、見本の音声を渡さなくても、「落ち着いた、近い距離感の女性話者」のような説明文（キャプション）だけで、合成する声を指定できる機能だという。\n講座のナレーションで使っているのは、本人の声の録音を渡して声を写すやり方のほうである。\n同じ Irodori-TTS の中に、声の指定方法が2つある。",[26,27,28,44],"table",{},[29,30,31],"thead",{},[32,33,34,38,41],"tr",{},[35,36,37],"th",{},"指定方法",[35,39,40],{},"渡すもの",[35,42,43],{},"講座での扱い",[45,46,47,59],"tbody",{},[32,48,49,53,56],{},[50,51,52],"td",{},"ボイスデザイン",[50,54,55],{},"声の特徴を書いた説明文（キャプション）",[50,57,58],{},"使っていない",[32,60,61,64,67],{},[50,62,63],{},"録音から声を写す",[50,65,66],{},"本人の声の録音",[50,68,69],{},"いま使っている",[18,71,73],{"id":72},"gemini-の-tts-に自分の声を学習させられるか","Gemini の TTS に自分の声を学習させられるか",[14,75,76],{},"7時台には、もう一歩踏み込んだ。\nGemini のような TTS に自分の音声をアップロードして、喋らせることはできないか。\n有料でも、より良い音声になるツールはないか。\nこれを調べて、非公開のドキュメントにまとめるよう頼んだ。\n料金の目安を出すために、講座の台本が全部で何文字あるかも数えてもらった。",[14,78,79],{},"返ってきた答えは、Gemini では自分の声は使えない、だった。\nGemini-TTS で選べるのは、用意された28種類の声だけである。\nGoogle で自分の声を使えるのは Chirp 3 の「Instant Custom Voice」だけで、それも営業窓口への申請が通った人しか使えない。\n調べた内容は、非公開のドキュメントに残してもらった。\nこの時点の答えは、10時台にクローン対応の Gemini 3.8 Flash TTS が見つかって変わることになる。",[14,81,82],{},"作業の途中で、dev サーバーが止まった。\nメモリが足りなくなったため、バックグラウンドで動いていたサーバーを Claude Code が自動で止めたという。\n通知の記録を見るかぎり、止まったのはこのセッションではなく、別のセッションで起動していたサーバーのようだった。\nサーバー自体の不具合ではなく、ドキュメントの本体もファイルとして残っていた。",[18,84,86],{"id":85},"fish-audio-で講座全編を作るといくらかかるか","Fish Audio で講座全編を作るといくらかかるか",[14,88,89],{},"昼前、Fish Audio でボイスクローンして講座を作ったときの料金を聞き直した。\n朝に調べたドキュメントに、見込みが残っているはずだった。",[14,91,92],{},"まとめてあった数字は次のとおりである。",[94,95,96,100,103],"ul",{},[97,98,99],"li",{},"講座全編（約8時間分）を1回合成すると、API の従量課金で約 $8",[97,101,102],{},"サブスクなら、Pro プラン1か月分の $100",[97,104,105],{},"直しが出るたびに作り直すので、実際はこの1.5〜2倍を見ておく",[14,107,108],{},"$8 と $100 の開きについては、次のやりとりで補足があった。\n$8 は、API の単価で計算した値である。\nただし、商用で使うにはサブスク契約も要る。\nそのため実際の費用は、Plus（月 $11〜15）と API 料金の約 $8 を足した額になりそうだ、という見立てに変わった。",[18,110,112],{"id":111},"drama3とはどのモデルか","「Drama3」とはどのモデルか",[14,114,115],{},"同じやりとりの中で、この日リリースされたらしい「Drama3」も調べてもらった。\nなかなか良さそうに見えていた。",[14,117,118],{},"ところが、その名前ではモデルが見つからなかった。\n候補として、Google の新しい Gemini 3.8 TTS（ボイスクローン対応）の公式情報を確かめてもらった。\nその日に出たもので当てはまりそうなのは Gemini 3.8 Flash TTS だ、というのが最初の答えである。",[14,120,121],{},"Gemini の TTS もクローンできるらしい。\nただ、変な制約を課されるらしいので、それで大丈夫かも確認してもらった。",[14,123,124],{},"次の返答で、ドラマ3は Fish Audio の新モデルだと話がつながった。\n正体は、Fish Audio が9月24日に出した Drama 3（プレビュー版）である。\nGemini 3.8 Flash TTS は、名前を探す途中で挙がった別の候補だったことになる。\nそこからは、Drama 3 の調査と Gemini の制約の確認を並行して進めてもらった。",[18,126,128],{"id":127},"gemini-のクローンの制約は支障になるか","Gemini のクローンの制約は支障になるか",[14,130,131],{},"先に答えが出たのは Gemini の制約のほうだった。\n自分の声を日本で使う分には、いま分かっている制約はどれも支障にならなさそうだ、という。\nただし、商用で使うときの条件はまだ確認できていない。\nこの点は、保留のまま残った。",[18,133,134],{"id":134},"この日の時点の選択肢",[26,136,137,150],{},[29,138,139],{},[32,140,141,144,147],{},[35,142,143],{},"選択肢",[35,145,146],{},"自分の声",[35,148,149],{},"この日に分かったこと",[45,151,152,163,174,185,195,206,217],{},[32,153,154,157,160],{},[50,155,156],{},"Irodori-TTS（録音から声を写す）",[50,158,159],{},"使える",[50,161,162],{},"いま講座のナレーションに使っている",[32,164,165,168,171],{},[50,166,167],{},"Irodori-TTS（ボイスデザイン）",[50,169,170],{},"見本の音声を使わない",[50,172,173],{},"説明文（キャプション）だけで声を指定する",[32,175,176,179,182],{},[50,177,178],{},"Gemini-TTS",[50,180,181],{},"使えない",[50,183,184],{},"選べるのは用意された28種類の声だけ",[32,186,187,190,192],{},[50,188,189],{},"Chirp 3 Instant Custom Voice",[50,191,159],{},[50,193,194],{},"営業窓口への申請が通った人だけ",[32,196,197,200,203],{},[50,198,199],{},"Gemini 3.8 Flash TTS",[50,201,202],{},"クローン対応",[50,204,205],{},"日本で自分の声を使う分には、分かっている制約は支障にならなさそう。商用の条件は未確認",[32,207,208,211,214],{},[50,209,210],{},"Fish Audio",[50,212,213],{},"ボイスクローン",[50,215,216],{},"全編1回の合成で API 約 $8。商用には Plus（月 $11〜15）も要る見込み",[32,218,219,222,225],{},[50,220,221],{},"Fish Audio Drama 3（プレビュー版）",[50,223,224],{},"未確認",[50,226,227],{},"9月24日に公開",[18,229,230],{"id":230},"学び",[94,232,233,236],{},[97,234,235],{},"Irodori-TTS の「テキストでボイスデザイン」は、録音を渡さずに説明文だけで声を指定する機能で、自分の声を写す使い方とは別の指定方法だった",[97,237,238],{},"料金の見込みは、API の単価だけでは足りない。商用で使うなら、サブスク契約の分も足して考える",[18,240,242],{"id":241},"翌日1区間で聞き比べる","翌日、1区間で聞き比べる",[14,244,245],{},"最後に、Drama 3 を実際に試す作業を翌日に回した。\n貼り付けた内容をもとに、add-task で Google タスクへ登録してもらった。\n途中でメモ欄の見出しが照合で見つからず、中身を確かめ直してから登録が通った。",[14,247,248],{},"登録先は9月25日で、タイトルは「Fish Audio Drama 3（プレビュー）を試す：Excel講座の1区間で Irodori-TTS と聞き比べ」である。\nメモ欄には、翌日の Claude Code にそのまま貼れる手順を入れてもらった。",[14,250,251],{},"Drama 3 の声は、いまの Irodori-TTS の声を上回るのか。\nこの日の時点では、まだ1区間も聞き比べていない。",{"title":253,"searchDepth":254,"depth":254,"links":255},"",2,[256,257,258,259,260,261,262,263],{"id":20,"depth":254,"text":21},{"id":72,"depth":254,"text":73},{"id":85,"depth":254,"text":86},{"id":111,"depth":254,"text":112},{"id":127,"depth":254,"text":128},{"id":134,"depth":254,"text":134},{"id":230,"depth":254,"text":230},{"id":241,"depth":254,"text":242},"dev",null,"Excelの基礎講座の音声を自分の声で作るため、Irodori-TTSの「テキストでボイスデザイン」の意味、Gemini TTSで自分の声が使えるか、Fish Audioで講座全編を合成したときの料金見込み、当日公開のDrama 3（プレビュー）を調べた記録。","md",{},true,"/voice-clone-tts-course-narration-research","misc-dev",false,"2026-09-24T00:00:00.000Z",{"title":5,"description":266},"make-diary","2026-09/2026-09-24/voice-clone-tts-course-narration-research",[278,213,279,210,280,281],"TTS","Irodori-TTS","Gemini","講座制作","h0x-aNvVUTR6hGtPN9LSD5ml8imWbrEDst1vD8oJCkc",[],[285,289,293,297,300],{"title":286,"path":287,"publishedAt":288},"Fish Audioの無料APIで自分の声を合成し、音声透かしをAudioSealとWavMarkで調べた記録（Irodori-TTSとの比較）","/fish-audio-free-api-watermark-seed-check","2026-09-25T00:00:00.000Z",{"title":290,"path":291,"publishedAt":292},"Fish Audio S2でボイスクローン - 自分の声でTTS生成する実験記録","/fish-audio-s2-voice-clone","2026-03-17T00:00:00.000Z",{"title":294,"path":295,"publishedAt":296},"2026年3月18日の開発日記 - 教材コンテンツ音声化＆インタラクティブ実装を一気通貫","/2026-03-18-diary","2026-03-18T00:00:00.000Z",{"title":298,"path":299,"publishedAt":296},"Fish Audio v2/v3とElevenLabsで教材ナレーション音声を一括生成した記録","/fish-audio-tts-narration-generation",{"title":301,"path":302,"publishedAt":288},"2026年9月25日の開発日記 - 並行セッションがメモリを取り合い、関数の章をMacへ送った","/2026-09-25-diary","https://log.eurekapu.com/og/blog/voice-clone-tts-course-narration-research.png?v=2026-09-24T00%3A00%3A00.000Z&title=%E8%AC%9B%E5%BA%A7%E3%83%8A%E3%83%AC%E3%83%BC%E3%82%B7%E3%83%A7%E3%83%B3%E3%82%92%E8%87%AA%E5%88%86%E3%81%AE%E5%A3%B0%E3%81%A7%E4%BD%9C%E3%82%8BTTS%E8%AA%BF%E6%9F%BB%EF%BC%9AIrodori-TTS%E3%81%AE%E3%83%9C%E3%82%A4%E3%82%B9%E3%83%87%E3%82%B6%E3%82%A4%E3%83%B3%E3%80%81Gemini%20TTS%E3%81%AE%E5%88%B6%E7%B4%84%E3%80%81Fish%20Audio%E3%81%AE%E6%96%99%E9%87%91%E3%81%A8Drama%203&author=Kei%20Komatsu&sig=cc22f24f32b92015",1790469281371]