BLOG

ホットトラッキング 007|Google が Gemini 3.8 Live と Extended Thinking を発表:「声に出して考える」音声 Agent、そして試験監督も自社が務める答案用紙

Kael Zhang
AIVoiceGoogle
广告 · Advertisement

ホットトラッキング:注目の発表 × 技術的判断 × 実用的アドバイス。 著者:永亮


9月15日、Google 公式ブログ(署名は Gemini Audio Team の Tom Ouyang と Malini Jaganathan)で、音声モデル2種が一挙に公開されました。Gemini 3.8 Live と Gemini 3.8 Live Extended Thinking です。前者はスケールとコスト効率を主軸に、対話インテリジェンスと視覚理解を強調。後者は高複雑度タスクを狙ったもので、売りは「推論しながら話す」こと——モデルは考えながら話し、確認が必要な箇所ではまず「Let me check that…」と一言口にしてから、リアルタイムで進捗を報告します。同じ日、開発者は Gemini API と AI Studio からすぐに呼び出せます。個人ユーザーは Search Live、Gemini Live アプリ、Workspace で新機能を順次利用できるようになります。企業向け版は引き続きプライベートプレビューのままです。音声 Agent という分野は今年とても熱く、各社が強調するのは「おしゃべりができる」ではなく「仕事をこなせる」という点です。Google は今回、かなりの攻めの姿勢を見せています。公式の説明によれば、Extended Thinking は第三者ランキング Artificial Analysis の Speech to Speech Quality Index で1位(82.6)を獲得しました。しかし、この成績表は行を追って読む価値があります——というのも、試験を監督する側も、答案を書く側も、試験場を出ていく側も、かなりの部分が同じ会社なのですから。

何がリリースされたのか

まず、公式発表の確定的な情報を並べます。そのすべては 9 月 15 日付の公式ブログによるものです:

2 つのモデルは役割分担が明確です。Gemini 3.8 Live はスケール路線です:コスト効率を優先し、会話中に 97 の言語を自動的に切り替えられ、準リアルタイムの視覚入力も受け付けます——発表デモには、対局の盤面を見るものや、スケッチ 1 枚から React コンポーネントを直接書き出すものが含まれていました。さらに、ツール呼び出しや API リクエストをバックグラウンドで実行でき、進行中の会話を中断しません。Gemini 3.8 Live Extended Thinking は高複雑度向けの路線です:多段階の推論タスクを担当し、その特長は「思考プロセスを声に出す」こと——ユーザーは、モデルがいつ資料を調べていて、いつ計算しているのかを耳で確認でき、沈黙の中でただ結果を待つだけ、ということがありません。

提供形態は 3 つの層に分かれています。開発者向けの層は当日から利用可能:Gemini API と AI Studio が同時に公開されました。個人向けの層はサブスクリプションによる段階提供です:Search Live、Gemini Live アプリ、Workspace の Docs Live / Gmail Live / Keep Live で、機能は Google AI Pro と Ultra の 2 つのサブスクリプションプランに紐づいており、全員が同じ日にすべての機能を利用できるわけではありません。エンタープライズ向けの層は引き続きプライベートプレビュー:Gemini Enterprise の顧客は申請が必要です。

周辺の整備も万全です:音声出力には SynthID ウォーターマークが付いており、公式から model card も公開されました。パートナーエコシステムのリストには、Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents が名を連ねています。顧客からの支持としては、Salesforce、Genspark、Lumeris が挙がっています。

公式スコアカードの読み方

この部分は必ずゆっくり読む必要がある。数字の出どころがそれぞれ異なり、その重みも違うからだ。

サードパーティのランキングに由来するものは2つある。Extended Thinking は Artificial Analysis の Speech to Speech Quality Index で1位、スコアは82.6。そして Speech Agent Arena のユーザー嗜好ランキングでは2位だった。この2つは外部機関によるテストであり、独立した評価と見なせる。

公式自社集計に由来するものは、τ-Voice エージェントのタスク完了率 68.6%、Sierra τ-Voice-banking シナリオ 35.1%、Big Bench Audio 97.7%。この数字には現時点で独立系サードパーティによる再現がなく、本文では「公式発表値」と呼ぶしかない。

最も興味深いのは ServiceNow EVA-Bench の項目だ。公式ブログの言い方では、Extended Thinking は「精度と会話品質のパレートフロンティアを押し上げた」とされる。しかし直後に一行の自注が付いている——テストは Gemini Enterprise Agent Platform の Live API 上で実行された、と。これを訳すと——この企業カスタマーサポートシナリオの benchmark は、Google 自社の Agent プラットフォームの上で走っている、ということだ。EVA-Bench 自体は ServiceNow の評価フレームワークであり、これは事実だ。しかし実行環境は自社スタックであり、この限定条件は公式自身が書き添えているのだから、読者も自分で覚えておくべきだ。

したがって、このスコアカードの読み方はこうだ。サードパーティの部分はそのまま引用してよい。自社発表値の部分にはラベルを付けること。そして EVA-Bench の項目は、「サードパーティのフレームワーク」と「自社コース」という両方の半分を同時に覚えておくことだ。

冷静なもう半分

今回、本気で語りたかったのはまさにこの部分だ。五つの論点を、重みの順に並べる。

一つ目:自社の発表イベントと自社のベンチマークスコア。正直だが、完全には正直ではない。 AI ベンダーが自社プラットフォームで自社の成績を発表するのは業界の慣例であり、驚くには当たらない。ただし今回は、誠実さを示す材料がすでに用意されていた。EVA-Bench の「Gemini Enterprise Agent Platform の Live API 上で実行」という自己注記は、公式が自ら利益相反を明示したも同然だ。これはインチキではない――限定条件は明示されている。だが、独立した検証でもない。本当の穴はここにある。τ-Voice や Big Bench Audio といった美しい数値は、発表資料全体を通じて、どの外部機関による再現もされていないということだ。発表イベントの勢いはいずれ薄れる。これらの数値を第三者がもう一度測るかどうかこそが、その数値が立ち止れるかどうかの鍵になる。

二つ目:「Extended Thinking」の命名学――声に出す思考は、推論の透明性か、擬人化された演出か。 テキストモデルでは、思考の連鎖は一字一句監査でき、スクリーンショットに残し、疑問を呈することもできる。音声では話が違う。耳にするのは流暢な「Let me check that…」というひと言だが、モデルは本当に検索し、計算しているのか、それとも訓練された口頭の型であなたをなだめているだけなのか? 音声対話における「思考」は、テキストのように監査できない――リスナーには推論プロセスを見る権限もなければ、「本物の多段階推論」と「演出された多段階推論」を区別する手段もない。レイテンシを「思考」としてパッケージするのは、エンジニアリングの上ではエレガントなプロダクト判断だ。しかしナラティブの上では、「extended thinking」という言葉がテキスト時代に積み上げてきた信頼を、こっそり持ち去っている。透明性と演出の間には「音声」という一枚が隔たっており、その音声の意味づけは現時点ではベンダー自身が定めている。

三つ目:約束と実現の間には、サブスクリプションの階層とプレビューの対象リストが横たわっている。 発表当日に開発者が API を使えたのは事実だ。しかし個人向けの Workspace フルセット――Docs Live、Gmail Live、Keep Live――は Pro / Ultra サブスクリプションで階層分けされており、「発表された」と「あなたが使える」の間にはペイウォールという一枚が横たわる。企業向けの目玉である Gemini Enterprise は依然プライベートプレビューのままで、申請制、不透明、スケジュール未定だ。これは Google だけの問題ではなく、「発表はフルラインナップ、提供は階層化」という業界全体の常態だ。だが読者にとっては、発表イベントのデモ映像を覚えるより、「すでにリリース済み」の三つの階層を区別することのほうがはるかに重要だ。

四つ目:音声 Agent の定番三項目は、今回も独立した答えを得られなかった。 音声 Agent が実務で使えるかを評価するうえで、三つの指標は避けて通れない。割り込み処理(ユーザーが口を挟んだとき、モデルがどれだけ早く止まれるか)、エンドツーエンドのレイテンシ(話し始めるまでどれだけ待たされるか)、ツール呼び出しの信頼性(API を呼び出したと言って、実際に呼び出しは成功したのか)。今回の発表資料には、この三つの指標に関する第三者による再現データが示されていない。デモのチェスや React コンポーネントの描画は見事だったが、デモは一度きりの成功であり、定番三項目は一万回の成功率で測るものだ。独立系の評価が出るまでは、「実務で使える」というひと言は割り引いて聞くべきだ。

五つ目:SynthID は検出用ウォーターマークであり、責任の仕組みではない。 AI 音声にウォーターマークを埋め込むのは良いことで、事後の識別に役立つ。しかしウォーターマークが答えられるのは「この音声は AI が生成したものか」という問いだけだ。「この AI 音声が誤ったことを言った場合、誰が責任を負うのか」という問いには答えられない。音声 Agent がユーザーに代わって情報を調べ、結論を読み上げ、バックグラウンドでツールを呼び終えたあとにミスが起きたときの責任の連鎖――モデル、プラットフォーム、統合事業者、クライアント――は、現時点でいかなるウォーターマークもカバーできていない。検出ツールを責任の枠組みのように語るのは、発表イベントのナラティブにありがちなすり替えだ。

もしあなたが開発者なら

「今すぐ使える / まずは様子見 / 選定で何を見るか」の3つに分けて述べます:

今すぐ使えるもの:Gemini API と AI Studio は当日から利用可能で、音声 Agent のプロトタイプならすぐに取りかかれます。97言語の自動切り替えが公式の主張どおりに実現できるなら、多言語カスタマーサポートや海外展開する製品にとって実質的なセールスポイントになります――ただし、まず自分の持つコーパスで一通りテストし、発表会のデモを検収基準にしないでください。バックグラウンドでのツール呼び出しが会話を中断しないという設計は、プロトタイプで重点的に体験する価値があります。これが「アシスタント」と「社員」の違いを決めるからです。

まずは様子見すべきもの:Gemini Enterprise のプライベートプレビューにおける Agent Platform 機能は、一般公開され独立系の評価が出てから評価しましょう。Workspace の一式はサブスクリプションの階層別に提供されるため、購入前に自分のチームが実際にどの階層に該当するかを確認してください。「声に出す思考」による進行ナレーションについては、推論の証拠ではなく UI のヒントとして扱う形で自社製品を設計することをおすすめします――あなたのユーザーも同様に、音声の内容を監査できないのですから。

選定で見るべき指標:最終的にどこを選ぶにせよ、音声 Agent の選定では次の5つの数値に注目してください――割り込みへの応答時間、エンドツーエンドのレイテンシ、ツール呼び出しの成功率(ユースケース別に集計し、合算値ではない)、多言語切り替えの実効的な成功率(公式デモの言語ではなく、自分のターゲット言語でテストする)、1タスクあたりのコスト(Extended Thinking のような多段階推論モードのコストは通常モデルの数倍になるため、事前に確認を)。これら5つの数値は、発表会ではどれひとつ示されません。自分で benchmark を行うか、第三者機関の測定を待つしかありません。

おわりに

Google が今回発表した技術的な中身は本物だ:推論と発話の同時進行、会話を中断しないバックグラウンドでのツール呼び出し、97 言語の切り替え——どれをひとつ取り上げても、同業他社が緊張するに値するものだ。しかし、発表会の語りの水増しもまた本物だ:自社が自ら試験監督を務める答案、監査不能な「思考」、サブスクリプション階層で分けられた「全量リリース」、第三者による再現を欠くお馴染みの三点セット、そして責任のフレームワークへと包装された検出ウォーターマーク。音声 Agent の競争は後半戦に突入した。争われているのは、誰のデモがより目を見張るかではなく、誰の数値が部外者の再検証に耐えうるかだ。Gemini 3.8 Live の答案はすでに提出済みで、採点権は第三者の手の中にある——この回ではまず答案を書き写しておく。答えが合っているかどうかは、他人が採点し終えてから話すことにしよう。

参考情報

  • Google 公式ブログ:Gemini 3.8 Live および Gemini 3.8 Live Extended Thinking の発表記事(2026-09-15、署名:Tom Ouyang、Malini Jaganathan、Gemini Audio Team)
  • 公式ブログに添付の model card(2026-09-15)
  • 公式ブログが引用するサードパーティのランキング:Artificial Analysis Speech to Speech Quality Index、Speech Agent Arena(2026-09-15 時点のランキング集計基準)
广告 · Advertisement

よくある質問

何が新しく発表されたか?

GoogleはGemini 3.8 LiveとExtended Thinkingを発表し、音声Agentの新機能を提供した。これらのモデルはスケールとコスト効率を重視し、高複雑度タスク対応を特徴としている。

Extended Thinkingの特徴は何か?

Extended Thinkingは多段階の推論タスクを担当し、ユーザーがモデルの思考プロセスをリアルタイムで確認できる。これにより、モデルが資料を調べたり計算しているかをユーザーが聞き取ることができる。

提供形態はどのように分かれているか?

提供形態は開発者向け、個人向け、企業向けの3つの層に分かれている。開発者向けは即日利用可能で、個人向けはサブスクリプションで提供され、企業向けは引き続きプライベートプレビューのままである。