2026-08-19
Cartesia、44言語対応の音声AI「Sonic‑3.6」β公開 自然な多言語読み上げで競合ベンチマーク首位に
音声AIスタートアップCartesiaが、新しい音声生成モデル「Sonic‑3.6」のベータ版提供を開始しました。Sonic‑3.6は44言語に対応したテキスト読み上げモデルで、外部評価サイトArtificial Analysisの音声ベンチマークにおいて既存モデルを上回るスコアを記録したとされています。従来のテキスト読み上げ(TTS)と比べてイントネーションやブレス(息継ぎ)の表現が自然で、長時間の音声でも「機械音声らしさ」が目立ちにくい点が特徴です。また、単に多言語をサポートするだけでなく、同じ文章でも場面に応じて話速や抑揚を変える「スタイル制御」のパラメータも強化され、コンタクトセンターの自動応答や動画ナレーション、教育コンテンツなど幅広い用途が想定されています。ベータ段階では開発者向けAPIとして提供され、一部ユーザーには商用利用も許可されているとのことです。音声生成AIを巡っては、ボイスクローン(他人の声を真似る技術)悪用への懸念も強く、Cartesiaも本人確認済み声優の合成に限定するなど、権利処理と安全対策をどこまで設計できるかが、今後の普及の鍵になりそうです。