声のエンジン
「会話」の「声のエンジン」で、誰が聞いて話すかを選びます。既定は、この Mac の音声認識、会話のモデル、読み上げを組み合わせる構成です。
GPT-Live か Gemini Live を選ぶと、マイクの音声をそのまま提供元に送り、提供元の声で話します。相槌、聞き取り、話し終わりと割り込みの判定はモデルが行い、この Mac の音声認識と読み上げ、つなぎの一言、MaAI は使いません。エンジンを変えたら、マイクを入れ直します。
| エンジン | 判断とツール | 料金の目安 | 必要なキー |
|---|---|---|---|
| GPT-Live | GPT-Live が受け答えの間合いを受け持ち、中身は会話のモデルに任せます。会話のモデルの文を GPT-Live が自分の声で読みます。 | セッションが開いている時間で 1 分 $0.05 | OpenAI |
| Gemini Live | Gemini 自身が判断して ASIST のツールを呼びます。実行は ASIST が行うので、書き込みの確認画面はそのまま出ます。会話のモデルは使いません。 | 音声の入力 1 分 $0.005、出力 1 分 $0.018 |
セッションは話し始めたときに開き、会話が止まって「会話が止まってから閉じるまで」(既定 90 秒)が過ぎると閉じます。閉じているあいだは課金されません。次に話しかけると、直前 3 秒の音声を溜めてから開き直すので、言い始めは欠けません。上の HUD に、接続、応答までの時間、セッションの分数、料金の見積もりが出ます。マイクをオフにすると、セッションを閉じます。
声は提供元が用意しているものから選び、「試聴」で同梱の見本を聞けます。試聴に API は使いません。会話ログには、実際に聞こえた入力と出力の転写を書きます。記憶の整理はこのログから行うので、エンジンを変えても同じ材料で動きます。

