
拓海先生、最近「歌声を別人の声に変える技術」が話題だと聞いたのですが、うちの業務に関係ありますかね。現場は保守的で、投資して失敗したくないんです。

素晴らしい着眼点ですね!歌声変換は、例えばナレーションの声質を統一したり、音声コンテンツの多言語展開で声を合わせたりと、実務的な応用が見込めるんですよ。大丈夫、一緒に順を追って整理しましょう。

まず基本から教えてください。従来の音声変換と何が違うのですか?うちの現場では録音環境が違う人同士を合わせたいという要望があります。

端的に言うと、今回の手法は”非並列データ”、つまり同じ歌を複数人が別録音で歌っているデータがなくても学習できる点が革新的です。投資対効果の観点で言えば、手間とコストが下がる可能性があります。要点は3つです。1) 元音声の内容を声の個性から切り離すこと、2) その内容を目標の声質に変換すること、3) 元のピッチ情報を活かして自然さを保つこと、です。

内容の切り離し、ですか。うーん、要するに歌の中身(何を歌っているか)だけを取り出して、別の人の声に載せ替えるということですか?

その理解で合っていますよ。具体的には、Automatic Speech Recognition (ASR) 自動音声認識で歌詞や発音の確率的表現を得て、そこから声の個性(誰の声か)を除いた表現を作ります。技術的な言い回しだとPhonetic Posteriorgrams (PPG) フォネティック・ポスター確率系列を用いるのですが、比喩すると歌の『設計図』だけを抽出する作業です。

なるほど。実際にデータはどれくらい必要ですか。うちには歌手の大量データなんてありませんし、現場の発注者からは短尺の素材しか来ません。

良い質問です。今回の研究では、ターゲット話者(歌手)のラベルなし音声だけでモデル調整が可能であり、比較的少量のターゲット音声で初期成果が出せます。現場適用ではまず既存の音声を使って小さく試し、効果が見えたらスケールアップする段取りが現実的です。

技術的には難しいようですが、現場に落とし込むにはどの点がハードルになりそうですか。あと品質はどう担保するのですか。

実運用のハードルは主に二つです。一つは音質と自然さの担保で、これはF0(基本周波数)とaperiodic(非周期成分)を元音声から保持して復元に使う工夫である程度解決できます。もう一つは評価で、主観評価(人の聞き取り)を中心に運用要件を定める必要があります。要点を3つにまとめると、1) 初期の小規模PoCで評価基準を作る、2) 音源の前処理を安定化する、3) 段階的にデータを集めてモデルを適合させる、です。

これって要するに、既にある歌声から歌詞と音程の要素を取り出し、それを別の人の声質に再合成することで、録音条件が違っても声の統一ができるということですか?

まさにその理解で問題ありません。ビジネス的には、制作コストの削減やブランド音声の統一、ローカライズ時の品質維持といったメリットが見込めます。怖がる必要はありません、段階的にやれば必ず成果を出せるんです。

承知しました。最後に私の理解を整理させてください。要は非並列データで学習でき、少ないターゲット音声で声の個性を再現しつつ、元の歌のピッチは活かして自然に合成する、ということですね。これならまずは小さく試して効果を見てから判断できます。ありがとうございました。


