AI · 2026年9月13日

他の言語でも公開 Português (Brasil)

2026年の音声合成、テキスト準備が品質を左右

A square object with a purple light coming out of it
Milad Fakurian / Unsplash

2026年における人工知能による音声合成は、テキストの挿入、モデルと声の選択、ファイルのダウンロードという手順で完了し、所要時間は約1分である。BotHubのサービスでは、このプロセスは単一の入力欄、2つのドロップダウンリスト、そして1つのボタンで構成される。しかし、生成された最初のファイルは、モデルの性能に関係なく、多くの場合廃棄される。モデルは間やイントネーション、疑問文と断定文の区別を適切に処理し、テキスト指示による表現の調整も可能である。問題となるのは、特定の語彙や記号の読み方である。例えば、二重意味を持つ語句、標準規格の番号、通貨記号付きの数値、ラテン文字の略語、ローマ数字、そして「ё」の欠落が、聞き手が最初に感じる誤りの原因となる。

これらの誤りは、後のイントネーションの質を無意味にする。したがって、テキストの事前準備が最も重要な工程となる。テキストの準備では、意味を補完する要素を手動で記述する必要がある。ロシア語のアクセントの曖昧さは、文脈の変更や、特定の記号を用いた明示的な指示によって解決される。数値は、格変化や単位の問題を避けるため、音声合成用のテキストでは必ず言葉で記述すべきである。略語は、文字読みと単語読み、および混合構造に分類され、混合構造は文字ごとに読み上げられるため、言葉での書き換えが推奨される。ラテン文字は、発音の混乱を防ぐために音訳される。ローマ数字はラテン文字として読み上げられるため、言葉に書き換える必要がある。

「ё」は、意味の誤解を防ぐため、文学作品や固有名詞を含むテキストでは手動で挿入すべきである。モデルごとの1リクエストあたりのテキスト上限は10倍の差がある。OpenAIのモデルは4096文字、ElevenLabsのモデルは5000文字から40000文字まで様々である。上限を超えるテキストは分割して処理する必要があるが、分割点は文字数ではなく、意味の境界、すなわち段落やセクションの末尾、そして完了した文の後に設定すべきである。カンマで分割すると、イントネーションが途切れる。