8音声AIUXパターン ノート

8音声AIUXパターン

1922年に登場した初の音声起動玩具であるRadio Rexは、音のパターンが応答を引き起こすというシンプルな原理を導入しました。この基本的な概念は、何十年にもわたって音声対応デバイスに受け継がれ、Siri、Alexa、Google Assistantのような主要なインターフェースは意図抽出に焦点を当ててきました。大規模言語モデルと音声モデルの最近の進歩は、ボイスAIに革命をもたらし、新しいユースケースとインタラクションパターンを可能にしました。この記事では、AIエージェントの認識される役割、主要なデザイン上の決定、およびそれぞれの制限を分析しながら、8つの新しいボイスAI UIパターンを概説します。最初のパターンは、アニメーションまたは超リアルなアバターが対面でのインタラクションを提供し、つながりと感情的なサポートの感覚を育むアバタービデオ/ボイスコールです。デザイン上の考慮事項には、AIの個性と、リアルなアバターで不気味の谷を乗り越えるという課題が含まれます。2番目のパターンであるターンバイターンは、話すことと聞くことの視覚的な手がかりを伴う厳密なターンテーキングを採用しています。これは、制御された教育的な交換が望まれる構造化されたチュータリングまたは評価に理想的であり、顔がないことはインタラクションに焦点を維持するのに役立ちます。決定的に、割り込みの余地がないため、明確なターンのシナリオに限定されます。AI電話は、カスタマーサポート、リードの適格性確認、または予約のために実際の電話インタラクションを模倣します。エージェントは音声のみのサービスエージェントとして機能し、会話のアークデザインと、言葉だけで伝えられる個性に依存します。重要な制限は、スクロールバックできないことであり、重要な情報の確認が必要になります。ボイス拡張チャットは、テキストチャットに音声モダリティを重ね合わせ、ユーザーがタイプする代わりに話すことができるようにします。エージェントは汎用の音声アシスタントとして機能し、全画面音声モードまたはチャット内のインラインで表示されます。このパターンはマルチモーダルエクスペリエンスをサポートしますが、コードやテーブルなど、音声で伝えるのが難しい複雑な出力が制限される可能性があります。音声からテキストへの変換は、会話エージェントなしで、話された入力をテキストに文字起こしする純粋に実用的なツールです。その有効性は、出力の精度とコンテキストに適応する能力に完全に依存します。音声による修正は、タイピングよりも遅いことが多いため、編集用のカスタムキーボードのようなソリューションにつながります。スクリプトビデオ+ボイスは、事前に録画されたビデオと音声入力を組み合わせます。人間の教師として認識される仮想チューターは、事前に撮影された応答を選択することにより、ユーザーの入力に基づいてフィードバックを提供します。これにより、没入型の学習環境が作成されますが、すべての分岐を撮影するプロセスにより、コンテンツの拡大や更新がコストがかかり、遅くなります。
CdXz5zHNQW_gjst8UD3wp.jpeg