First35は、単なる一般的な批評にとどまらない音声AIで話し方をスコアリングします。何を、どのように測定し、1つのスコアに反映しているのかを説明します。
生の30秒の音声をChatGPTやGeminiにアップロードしても、返ってくるのは一般的な批評だけです。First35は、ローカルで計測した音声データ(ピッチ、音量、間、タイミング)とあなたの練習トレンドを組み合わせ、豊富なコンテキストとして音声AIに渡します。単に音声をLLMにつなぐことは誰でもできますが、そこに何を添えるかを知っている会社は多くありません。
大事な言葉に、効果的にメリハリをつけられていますか?声量の変化が少なく平坦に聞こえる話し方はスコアが低くなり、伝えたい言葉を意図的に強調できていると高くなります。
元データ 録音全体を50msごとに区切ったRMS振幅。
算出内容 dB単位のダイナミックレンジ。無音を除いた有声音フレームのRMSについて、90パーセンタイルと10パーセンタイルの差を見ます。
スライダーを動かすと、ダイナミックレンジがどのようにスコアに反映されるかを確認できます。
声の高さに自然な変化がありますか?それとも単調に聞こえていますか?抑揚に幅があるほど、より生き生きとして聞こえます。ただし、歌うように極端な抑揚は減点されます。ちょうどよい範囲を評価します。
元データ フレームごとの基本周波数(F0)を自己相関で推定します。
算出内容 F0の四分位範囲を中央値F0で割った値です。声域の個人差を補正するために使います。
目安は0.10〜0.40です。低すぎると単調に、高すぎると歌うように聞こえます。
文末を上げず、自信を持って言い切れていますか?文末が疑問文のように上がる「語尾上がり」が多いと、自分の言葉に確信がないように聞こえやすくなります。聞き手は、言葉の内容より先にその印象を受け取ることがあります。
面接、ピッチ、交流会などでは、語尾上がりが多いと、実際の経験やスキルに関係なく、自信がない、経験が浅い、立場が弱いと受け取られやすくなります。文末を安定させることは、落ち着いて信頼感のある話し方に近づくための近道です。
元データ 各フレームのF0を使います。これは指標2と同じピッチ情報です。
算出内容 各フレーズの最後400msにおける線形回帰の傾きを、半音/秒で見ます。400ms以上の無音でフレーズを区切ります。
傾きが +2 st/s を超える場合、語尾が上がっていると判定します。スコア = 100 ×(1 − 語尾上がりのフレーズ数 / 全フレーズ数)。
各点は1つのフレーズを表します。緑は下降または平坦で安定した終わり方、赤は語尾上がりです。
自然なリズムで話せていますか?それとも、不自然な沈黙で流れが止まっていませんか?短い間は伝わりやすさを助けますが、長い間が多いと、ためらっている印象につながります。
元データ RMSが−45dBFS未満のフレームを無音として判定します。 < −45 dBFS.
算出内容 400ms以上続く無音の回数と長さを見ます。
2回までの間は減点なし。それ以上は1回につき−10点。2秒を超える長い間は追加で減点されます。
総合スコアは、4つのサブスコアの単純平均です。重みづけや見えない補正はありません。
各項目を動かして、総合スコアがどう変わるか確認できます。
現時点では、4つの項目を同じ重みで扱う設計にしています。それぞれが、話し方の異なる側面を測っているためです。たとえば、緊張していても話の流れが整理されている人は、間の取り方が高く、メリハリが低く出ることがあります。落ち着いていても単調に聞こえる人は、安定感が高く、表現力が低く出ることがあります。同じ重みづけにすることで、バランスのよい話し方を評価します。
今後のバージョンでは、地域ごとに重みづけを調整していく予定です。話し方の受け取られ方は、文化や地域によって変わります。ある文化では自信があるように聞こえる話し方が、別の文化では強すぎる印象になることもあります。各市場の聞き手が実際にどう受け取るかを学びながら、スコアの組み合わせ方を調整していきます。
1分あたりの語数は、音声認識を使って計測し、フィードバック画面には参考情報として表示します。ただし、総合スコアには含めません。文字起こしは常に完全ではないため、これを含めると、実際の話し方とは関係のない要因で総合スコアにノイズが入る可能性があります。