自分の声でText to Speech Create Your Own Voice

自分の声を登録してText to Speechで活用する「Create Your Own Voice」機能が追加されました。
AI音声”ElevenLabs”の拡張機能がVYONDに追加されました。
利用できるのはEnterprise、Agencyプランのみとなります。

このエントリーの目次

Create Your Own Voice 使い方


Create Your Own Voice 自分の声を登録する 7分13秒

画像解説

HOME画面左「+Create」をクリックして「Text to Speech」を開きます。左上の”Create your own voiceを選択

もしくはVYOND StudioのText to Speechから”+Create your own voice”からも選択できます。

ポップアップウィンドウが開き、手順が表示されます。最初に自身の音声ファイルを用意します。こちらの画面では
音声の録音の注意書きが書いてあります。

すべきこと
1~2分間の明瞭な音声を録音してください
静かで反響のない環境で録音してください
1つの言語に統一してください
自然な口調で、一定のペースで話してください
質問や断定文など、さまざまな文体を組み合わせて使用してください
してはいけないこと
3分以上録音しないでください
背景騒音や音楽がある場所で録音しないでください
ささやいたり、大声を出したりしないでください

NEXTをクリックすると音声ファイルのアップロード画面が表示されます。用意した音声ファイル(mp3,wav,m4a)をドラッグしてアップロードします。
「音質や録音品質」はMP3やWAVといったコーデックそのものを指すのではなく、音声がどのように録音されたかを指します。ただし、オーディオコーデックに関しては、128 kbps以上のMP3を使用することをお勧めします。ビットレートが高くても、クローンの品質に大きな影響は与えません。

音声サンプルを確認した後、お使いのデバイスのマイクを使用して、以下の同意文をライブ録音してください:
「私の名前は[フルネーム]です。この音声を録音することにより、私はVyondに対し、
私の音声サンプルを使用して私の声のデジタルコピーを作成することを許可します。
このデジタルコピーにアクセスできるのは私のみです。パスコードは[パスコード]です」

[フルネーム]を自分の名前に置き換えてください。同意文は、はっきりと聞き取れ、理解できるものでなければなりません。現在、同意文は英語でのみ受け付けています。
ランダムに生成されたパスコードを、はっきりと正確に読み上げてください。
必要な同意文が正しく読み上げられていない場合、または同意チェックボックスにチェックが入っていない場合、
ボイスクローンの生成処理は行えません。

システムが同意文が正しく読み上げられたことを確認した後、音声が作成されます。音声に名前を付けて
「Create voice」をクリックします。

およそ1分ほどで音声が追加されました。Text to Speechの音源として活用できます

音声サンプル

私自身の声でサンプルを作成しました。おかしなイントネーションの部分はPronunciationsを使って修正します。

アップロード用の音声サンプルの準備

独自のカスタムボイスを作成するには、まずモデルの学習およびカスタムボイスの生成に必要な音声サンプルをアップロードする必要があります。音声サンプルのために1分から2分の音声を録音する必要がありますが、以下は実際に録音した読み上げ文章です。
声の特徴を学習しやすいように、平叙文・疑問文・感情表現・数字・固有名詞・短文・長文をバランスよく含めるのがおすすめということで、AIに何パターンかを生成してもらいました。

パターン1 約1分40秒

こんにちは。今日は、音声サンプルの収録を行います。
朝起きて窓を開けると、少し涼しい風が入ってきました。
空は青く、遠くには白い雲が見えています。こんな日は、どこかへ出かけたくなりますね。
ところで、今日の予定はもう確認しましたか?
午前10時から打ち合わせがあり、午後2時にはオンライン会議を予定しています。
資料の準備はできていますか?もし時間に余裕があれば、事前に内容を確認しておきましょう。
新しいことを始めるときは、少し不安を感じることがあります。
しかし、一つずつ試していけば、意外と簡単に進められるものです。
大切なのは、最初から完璧を目指さないことです。
「これは本当に必要だろうか?」
「もっと分かりやすい方法はないだろうか?」
そんな疑問を持つことから、新しいアイデアが生まれることもあります。
例えば、文章だけでは伝わりにくい内容でも、動画や音声を使うことで、
より分かりやすく説明できます。1分、3分、5分と、目的に合わせて内容を整理することも重要です。
それでは、少し表情を変えて読んでみます。これは素晴らしいですね!
本当にこんなことができるんですか?
なるほど、それなら安心しました。
少し難しそうですが、まずは試してみましょう。今日より明日、明日より来週。
少しずつ改善を続けることで、大きな成果につながっていきます。
以上で、音声サンプルの収録を終了します。
ありがとうございました。

パターン2 約1分30秒

こんにちは。今日は、AIのカスタムボイスを作るために、日本語の音声を録音します。
あ、い、う、え、お。
朝、家を出ると、青い空と白い雲が見えました。
駅まで歩いていると、小さな鳥の声が聞こえてきます。
今日は何時から仕事を始めますか?
午前9時ですか、それとも10時ですか?
私は午後3時から、重要な打ち合わせを予定しています。
数字も読んでみましょう。
ゼロ、1、2、3、4、5、6、7、8、9、10。
20、30、50、100、500、1000。
2026年9月11日、午後3時30分です。
学校、銀行、病院、工場、会社。
東京、大阪、京都、北海道、沖縄。
きゃ、きゅ、きょ。しゃ、しゅ、しょ。ちゃ、ちゅ、ちょ。
が、ぎ、ぐ、げ、ご。ざ、じ、ず、ぜ、ぞ。
ぱ、ぴ、ぷ、ぺ、ぽ。
これは面白いですね!
本当にできるのでしょうか?
大丈夫です。焦らず、ゆっくり進めていきましょう。
サービス・ビヨンド・組合せ・
以上で、音声サンプルの録音を終了します。
ありがとうございました。

これら2つの文言で2つの音声を作成しましたが、大きな差はありませんでした。今後入力する文字や発音の修正を重ねることで音声も学習していくと思われます。
ぜひ ご活用ください

AI Avatars で自分のアバターも作成できます

テキストから音声を作る 音声合成 Text to Speech

14日無料体験版でVYONDをお試しください

この記事が気に入ったら
いいね または フォローしてね!

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!
このエントリーの目次