講座ナレーションを自分の声で作るTTS調査:Irodori-TTSのボイスデザイン、Gemini TTSの制約、Fish Audioの料金とDrama 3

開発misc-dev

講座ナレーションを自分の声で作るTTS調査:Irodori-TTSのボイスデザイン、Gemini TTSの制約、Fish Audioの料金とDrama 3

Excel の基礎講座の音声は、いま Irodori-TTS に自分の声の録音を渡して作っている。 この日は朝の6時台から昼前にかけて、その声の作り方について、3つのセッションで Claude Code に質問を重ねた。 気になっていたのは、有料のツールに乗り換えれば今より良い声になるのか、という点である。 良くなるなら、最終的に決まった音声だけはそちらに流してもいいと考えていた。

「テキストでボイスデザイン」は何を指すのか

最初の疑問は、Irodori-TTS の「テキストでボイスデザインができる」という言い回しだった。 Claude Code によれば、見本の音声を渡さなくても、「落ち着いた、近い距離感の女性話者」のような説明文(キャプション)だけで、合成する声を指定できる機能だという。 講座のナレーションで使っているのは、本人の声の録音を渡して声を写すやり方のほうである。 同じ Irodori-TTS の中に、声の指定方法が2つある。

指定方法渡すもの講座での扱い
ボイスデザイン声の特徴を書いた説明文(キャプション)使っていない
録音から声を写す本人の声の録音いま使っている

Gemini の TTS に自分の声を学習させられるか

7時台には、もう一歩踏み込んだ。 Gemini のような TTS に自分の音声をアップロードして、喋らせることはできないか。 有料でも、より良い音声になるツールはないか。 これを調べて、非公開のドキュメントにまとめるよう頼んだ。 料金の目安を出すために、講座の台本が全部で何文字あるかも数えてもらった。

返ってきた答えは、Gemini では自分の声は使えない、だった。 Gemini-TTS で選べるのは、用意された28種類の声だけである。 Google で自分の声を使えるのは Chirp 3 の「Instant Custom Voice」だけで、それも営業窓口への申請が通った人しか使えない。 調べた内容は、非公開のドキュメントに残してもらった。 この時点の答えは、10時台にクローン対応の Gemini 3.8 Flash TTS が見つかって変わることになる。

作業の途中で、dev サーバーが止まった。 メモリが足りなくなったため、バックグラウンドで動いていたサーバーを Claude Code が自動で止めたという。 通知の記録を見るかぎり、止まったのはこのセッションではなく、別のセッションで起動していたサーバーのようだった。 サーバー自体の不具合ではなく、ドキュメントの本体もファイルとして残っていた。

Fish Audio で講座全編を作るといくらかかるか

昼前、Fish Audio でボイスクローンして講座を作ったときの料金を聞き直した。 朝に調べたドキュメントに、見込みが残っているはずだった。

まとめてあった数字は次のとおりである。

  • 講座全編(約8時間分)を1回合成すると、API の従量課金で約 $8
  • サブスクなら、Pro プラン1か月分の $100
  • 直しが出るたびに作り直すので、実際はこの1.5〜2倍を見ておく

$8 と $100 の開きについては、次のやりとりで補足があった。 $8 は、API の単価で計算した値である。 ただし、商用で使うにはサブスク契約も要る。 そのため実際の費用は、Plus(月 $11〜15)と API 料金の約 $8 を足した額になりそうだ、という見立てに変わった。

「Drama3」とはどのモデルか

同じやりとりの中で、この日リリースされたらしい「Drama3」も調べてもらった。 なかなか良さそうに見えていた。

ところが、その名前ではモデルが見つからなかった。 候補として、Google の新しい Gemini 3.8 TTS(ボイスクローン対応)の公式情報を確かめてもらった。 その日に出たもので当てはまりそうなのは Gemini 3.8 Flash TTS だ、というのが最初の答えである。

Gemini の TTS もクローンできるらしい。 ただ、変な制約を課されるらしいので、それで大丈夫かも確認してもらった。

次の返答で、ドラマ3は Fish Audio の新モデルだと話がつながった。 正体は、Fish Audio が9月24日に出した Drama 3(プレビュー版)である。 Gemini 3.8 Flash TTS は、名前を探す途中で挙がった別の候補だったことになる。 そこからは、Drama 3 の調査と Gemini の制約の確認を並行して進めてもらった。

Gemini のクローンの制約は支障になるか

先に答えが出たのは Gemini の制約のほうだった。 自分の声を日本で使う分には、いま分かっている制約はどれも支障にならなさそうだ、という。 ただし、商用で使うときの条件はまだ確認できていない。 この点は、保留のまま残った。

この日の時点の選択肢

選択肢自分の声この日に分かったこと
Irodori-TTS(録音から声を写す)使えるいま講座のナレーションに使っている
Irodori-TTS(ボイスデザイン)見本の音声を使わない説明文(キャプション)だけで声を指定する
Gemini-TTS使えない選べるのは用意された28種類の声だけ
Chirp 3 Instant Custom Voice使える営業窓口への申請が通った人だけ
Gemini 3.8 Flash TTSクローン対応日本で自分の声を使う分には、分かっている制約は支障にならなさそう。商用の条件は未確認
Fish Audioボイスクローン全編1回の合成で API 約 $8。商用には Plus(月 $11〜15)も要る見込み
Fish Audio Drama 3(プレビュー版)未確認9月24日に公開

学び

  • Irodori-TTS の「テキストでボイスデザイン」は、録音を渡さずに説明文だけで声を指定する機能で、自分の声を写す使い方とは別の指定方法だった
  • 料金の見込みは、API の単価だけでは足りない。商用で使うなら、サブスク契約の分も足して考える

翌日、1区間で聞き比べる

最後に、Drama 3 を実際に試す作業を翌日に回した。 貼り付けた内容をもとに、add-task で Google タスクへ登録してもらった。 途中でメモ欄の見出しが照合で見つからず、中身を確かめ直してから登録が通った。

登録先は9月25日で、タイトルは「Fish Audio Drama 3(プレビュー)を試す:Excel講座の1区間で Irodori-TTS と聞き比べ」である。 メモ欄には、翌日の Claude Code にそのまま貼れる手順を入れてもらった。

Drama 3 の声は、いまの Irodori-TTS の声を上回るのか。 この日の時点では、まだ1区間も聞き比べていない。

#TTS#ボイスクローン#Irodori-TTS#Fish Audio#Gemini#講座制作