講座ナレーションを自分の声で作るTTS調査:Irodori-TTSのボイスデザイン、Gemini TTSの制約、Fish Audioの料金とDrama 3
講座ナレーションを自分の声で作るTTS調査:Irodori-TTSのボイスデザイン、Gemini TTSの制約、Fish Audioの料金とDrama 3
Excel の基礎講座の音声は、いま Irodori-TTS に自分の声の録音を渡して作っている。 この日は朝の6時台から昼前にかけて、その声の作り方について、3つのセッションで Claude Code に質問を重ねた。 気になっていたのは、有料のツールに乗り換えれば今より良い声になるのか、という点である。 良くなるなら、最終的に決まった音声だけはそちらに流してもいいと考えていた。
「テキストでボイスデザイン」は何を指すのか
最初の疑問は、Irodori-TTS の「テキストでボイスデザインができる」という言い回しだった。 Claude Code によれば、見本の音声を渡さなくても、「落ち着いた、近い距離感の女性話者」のような説明文(キャプション)だけで、合成する声を指定できる機能だという。 講座のナレーションで使っているのは、本人の声の録音を渡して声を写すやり方のほうである。 同じ Irodori-TTS の中に、声の指定方法が2つある。
| 指定方法 | 渡すもの | 講座での扱い |
|---|---|---|
| ボイスデザイン | 声の特徴を書いた説明文(キャプション) | 使っていない |
| 録音から声を写す | 本人の声の録音 | いま使っている |
Gemini の TTS に自分の声を学習させられるか
7時台には、もう一歩踏み込んだ。 Gemini のような TTS に自分の音声をアップロードして、喋らせることはできないか。 有料でも、より良い音声になるツールはないか。 これを調べて、非公開のドキュメントにまとめるよう頼んだ。 料金の目安を出すために、講座の台本が全部で何文字あるかも数えてもらった。
返ってきた答えは、Gemini では自分の声は使えない、だった。 Gemini-TTS で選べるのは、用意された28種類の声だけである。 Google で自分の声を使えるのは Chirp 3 の「Instant Custom Voice」だけで、それも営業窓口への申請が通った人しか使えない。 調べた内容は、非公開のドキュメントに残してもらった。 この時点の答えは、10時台にクローン対応の Gemini 3.8 Flash TTS が見つかって変わることになる。
作業の途中で、dev サーバーが止まった。 メモリが足りなくなったため、バックグラウンドで動いていたサーバーを Claude Code が自動で止めたという。 通知の記録を見るかぎり、止まったのはこのセッションではなく、別のセッションで起動していたサーバーのようだった。 サーバー自体の不具合ではなく、ドキュメントの本体もファイルとして残っていた。
Fish Audio で講座全編を作るといくらかかるか
昼前、Fish Audio でボイスクローンして講座を作ったときの料金を聞き直した。 朝に調べたドキュメントに、見込みが残っているはずだった。
まとめてあった数字は次のとおりである。
- 講座全編(約8時間分)を1回合成すると、API の従量課金で約 $8
- サブスクなら、Pro プラン1か月分の $100
- 直しが出るたびに作り直すので、実際はこの1.5〜2倍を見ておく
$8 と $100 の開きについては、次のやりとりで補足があった。 $8 は、API の単価で計算した値である。 ただし、商用で使うにはサブスク契約も要る。 そのため実際の費用は、Plus(月 $11〜15)と API 料金の約 $8 を足した額になりそうだ、という見立てに変わった。
「Drama3」とはどのモデルか
同じやりとりの中で、この日リリースされたらしい「Drama3」も調べてもらった。 なかなか良さそうに見えていた。
ところが、その名前ではモデルが見つからなかった。 候補として、Google の新しい Gemini 3.8 TTS(ボイスクローン対応)の公式情報を確かめてもらった。 その日に出たもので当てはまりそうなのは Gemini 3.8 Flash TTS だ、というのが最初の答えである。
Gemini の TTS もクローンできるらしい。 ただ、変な制約を課されるらしいので、それで大丈夫かも確認してもらった。
次の返答で、ドラマ3は Fish Audio の新モデルだと話がつながった。 正体は、Fish Audio が9月24日に出した Drama 3(プレビュー版)である。 Gemini 3.8 Flash TTS は、名前を探す途中で挙がった別の候補だったことになる。 そこからは、Drama 3 の調査と Gemini の制約の確認を並行して進めてもらった。
Gemini のクローンの制約は支障になるか
先に答えが出たのは Gemini の制約のほうだった。 自分の声を日本で使う分には、いま分かっている制約はどれも支障にならなさそうだ、という。 ただし、商用で使うときの条件はまだ確認できていない。 この点は、保留のまま残った。
この日の時点の選択肢
| 選択肢 | 自分の声 | この日に分かったこと |
|---|---|---|
| Irodori-TTS(録音から声を写す) | 使える | いま講座のナレーションに使っている |
| Irodori-TTS(ボイスデザイン) | 見本の音声を使わない | 説明文(キャプション)だけで声を指定する |
| Gemini-TTS | 使えない | 選べるのは用意された28種類の声だけ |
| Chirp 3 Instant Custom Voice | 使える | 営業窓口への申請が通った人だけ |
| Gemini 3.8 Flash TTS | クローン対応 | 日本で自分の声を使う分には、分かっている制約は支障にならなさそう。商用の条件は未確認 |
| Fish Audio | ボイスクローン | 全編1回の合成で API 約 $8。商用には Plus(月 $11〜15)も要る見込み |
| Fish Audio Drama 3(プレビュー版) | 未確認 | 9月24日に公開 |
学び
- Irodori-TTS の「テキストでボイスデザイン」は、録音を渡さずに説明文だけで声を指定する機能で、自分の声を写す使い方とは別の指定方法だった
- 料金の見込みは、API の単価だけでは足りない。商用で使うなら、サブスク契約の分も足して考える
翌日、1区間で聞き比べる
最後に、Drama 3 を実際に試す作業を翌日に回した。 貼り付けた内容をもとに、add-task で Google タスクへ登録してもらった。 途中でメモ欄の見出しが照合で見つからず、中身を確かめ直してから登録が通った。
登録先は9月25日で、タイトルは「Fish Audio Drama 3(プレビュー)を試す:Excel講座の1区間で Irodori-TTS と聞き比べ」である。 メモ欄には、翌日の Claude Code にそのまま貼れる手順を入れてもらった。
Drama 3 の声は、いまの Irodori-TTS の声を上回るのか。 この日の時点では、まだ1区間も聞き比べていない。