ブラウザの音声認識サービスを利用する仕組み
このツールは,Web Speech APIのSpeechRecognition,またはwebkitSpeechRecognitionを使ってマイクの音声を文字に変換します.音声認識エンジンの実装はブラウザに委ねられます.Chromeなどでは外部の認識サービスを利用する場合があり,ブラウザ上で操作できることと,音声が端末内だけで処理されることは同じではありません.
認識の開始・停止と言語設定
言語を選び,開始ボタンを押してマイクの使用を許可すると認識が始まります.日本語,英語,中国語,スペイン語を選択できますが,利用できる言語や認識精度はブラウザのサービスに依存します.停止ボタンで認識を終了でき,ページを離れる際も停止処理を実行します.
確定したテキストの表示と編集
認識結果のうちisFinalがtrueになった文字列を,テキスト欄に追記します.中間結果の取得は有効ですが,未確定の文字列を表示する機能はありません.認識後はテキスト欄で誤変換を修正し,コピーボタンで別のアプリに貼り付けられます.話者の識別,タイムスタンプ,SRTやMarkdownファイルの自動書き出しは実装していません.
音声の送信と保存に関する注意
このツールはローカル認識を強制していないため,音声が外部へ送信されないことやオフラインで使えることは保証できません.外部の認識サービスがどのように音声を保存・利用するかは,利用するブラウザとサービスの方針をご確認ください.機密情報を含む会話の入力は避けてください.テキスト欄に自動保存機能はないため,必要な結果はページを閉じる前にコピーして保存します.
精度と継続時間の制約
continuousを有効にしていますが,無音,通信切断,権限変更,ブラウザの制限などで認識が終了する場合があります.長時間途切れないことや,誤認識がないことは保証できません.雑音を減らし,話す言語を正しく選んで,短い発話で動作を確認してください.人名,数値,専門用語は原文と照合して修正する必要があります.
利用手順とトラブル対応
まず機密情報を含まない短い文章で認識を試します.結果が表示されたら停止し,編集とコピーを確認します.マイク権限を拒否した場合はブラウザ設定で許可を確認してください.API非対応の場合は対応するブラウザを利用します.ネットワークや認識サービスのエラーが続く場合は入力を停止し,通信環境を確認してください.