ローカル音声合成AI(声のクローン)3モデル 導入・テスト

自宅の GALLERIA 2台(RTX 3080 Ti 12GB ×2)に、ナレーション用の音声合成AIを3本入れています。自分の声・他の人の声を数十秒の録音から真似させて、宣伝動画のナレーションに使えるかを比べます。結果はこのページに自動で載ります(3分ごと更新)。

まず、あなたの声を20秒ください

3モデルとも「短い録音から声を真似る」タイプです。声のサンプルが届くと、その声で同じ原稿を読ませて並べます。

声を録音するページを開く

スマホでもPCでも開けます(マイクの使用許可を求められます)。録音済みの音声ファイルを選んで送ることもできます。

読み込み中…

入れた3本と、選んだ理由

モデル機体得意ライセンス
Qwen3-TTS 1.7B
Alibaba・2026年1月公開
GALLERIA2 3秒の録音で声を真似る。文章で声を設計できる(「落ち着いた40代男性の低い声」など)。日本語・英語・フランス語ほか10言語Apache-2.0
商用可
GPT-SoVITS v4
日本で人気・少量学習型
GALLERIA1 日本語の再現度が最上位クラス。1分の音声を追加学習させると本人そっくりに寄る。生成が速いMIT
商用可
CosyVoice 3 (0.5B)
Alibaba・多言語最強クラス
GALLERIA2 9言語+方言。感情や話し方を言葉で指示できる。導入が最も素直で安定Apache-2.0
商用可
候補に挙げて、今回外したもの(理由つき)
モデル外した理由
Fish Speech S2 / OpenAudio品質は高いが商用利用が別契約。宣伝動画に使えないので除外
XTTS-v2 (Coqui)定番だが非商用ライセンス。日本語も新型に見劣り
F5-TTS手軽だが学習データ由来で非商用の制約が付く
IndexTTS-2感情制御は優秀。ただし1本2分半と遅い
Style-Bert-VITS2 / AivisSpeech日本語ナレーションは自然。ただし自分の声にするには学習が必要で手軽さに欠ける(必要なら後から追加可)
VOICEVOX商用可で高品質だが声を真似られない(既製キャラのみ)。今回の目的と違う
Kokoro-82M軽くて自然だがクローン非対応

読ませる原稿(3モデル共通)

① 日本語ナレーション(BASECORD宣伝)

  
② 英語

  
③ フランス語(プラチナワイン宣伝調)

 

声のサンプル(参照音声)

まだ届いていません。

生成結果

声の設計バリエーション

本人の声を複製したものではありません。低さ、明るさ、テンポ、間、テレビショッピング風などの特徴を文章で指定して作った検証音声です。新しく作ったものが上になるよう、生成日時の新しい順に1行ずつ並べています。

読み込み中…