Gemini 3.5 Transcribeとは
Gemini 3.5 Transcribeは、Googleが提供する音声認識・文字起こし専用のAIモデルです。Googleは「これまでで最も高精度な音声テキスト変換モデル」と位置づけ、2026年8月26日に公開プレビューとして提供を始めました。
従来型の音声認識は、雑音、言い淀み、専門用語、固有名詞が重なると誤認識しやすい傾向があります。Gemini 3.5 Transcribeは音声を単に文字へ置き換えるだけでなく、話者の意図を踏まえて読みやすい文章へ整えるSmart Transcriptionを備えています。
提供形態は、リアルタイム音声向けと録音済み音声向けの2種類です。どちらもGemini API(Application Programming Interface、ソフトウェア間の接続仕様)から利用できます。
| 用途 | モデル名 | 接続先 |
|---|---|---|
| リアルタイム文字起こし | `gemini-3.5-transcribe-live` | Live API |
| 録音済み音声の文字起こし | `gemini-3.5-transcribe` | Interactions API |
Googleの公式発表では、音声エージェント、リアルタイム字幕、会議記録、通話後の分析などが用途として挙げられています。開発者はGoogle AI Studioで試し、必要に応じてアプリへ組み込めます。
関連記事:Geminiとは?できること・料金プラン・モデル体系とChatGPTとの違い
Gemini 3.5 Transcribeの精度と主な機能
精度を見るときは、WER(Word Error Rate、単語誤り率)を確認します。WERは文字起こし結果に含まれる単語の置換・削除・挿入の割合で、数値が低いほど誤りが少ないことを示します。
WERはストリーミング4.0%、非ストリーミング2.6%
Googleが引用するArtificial Analysisの測定では、平均WERはストリーミングで4.0%、非ストリーミングで2.6%です。多言語音声認識ベンチマークのFLEURS(Few-shot Learning Evaluation of Universal Representations of Speech)では、それぞれ5.50%と5.04%でした。
| 測定条件 | ストリーミング | 非ストリーミング |
|---|---|---|
| Artificial Analysisの平均WER | 4.0% | 2.6% |
| FLEURSのWER | 5.50% | 5.04% |
また、前世代のChirp 3と比べ、音声入力から最終結果が確定するまでの時間は70%短縮されたと説明されています(出典: Google公式発表)。これらは特定の測定条件に基づく値であり、日本語の会議音声や自社環境で同じ精度を保証するものではありません。
SmartとVerbatimの2モードを選べる
録音内容を読みやすく整えるならSmart、発話を忠実に残すならVerbatimを選びます。用途に合わないモードを選ぶと、必要な言い淀みが消えたり、逆に不要なフィラーが大量に残ったりします。
- Smart:フィラー、重複、言い直しを整理し、句読点、段落、箇条書き、日付、金額などを読みやすく整えます。
- Verbatim:発話内容をなるべく忠実に残し、話者分離や単語単位のタイムスタンプと組み合わせられます。
たとえば「火曜日、いや水曜日の2時」と話した場合、Smartは最終意図を反映した「水曜日の2時」に整理します。インタビューの言い回しを保存したい場合はVerbatim、議事メモをそのまま読める形にしたい場合はSmartが候補です。
85言語超の自動検出とカスタム語彙に対応する
Gemini 3.5 Transcribeは85を超える言語・ロケールを自動検出します。1つの発話中で言語が切り替わるコードスイッチにも対応し、言語を事前指定できる場合はBCP 47形式の言語コードを渡せます。
専門用語や製品名にはカスタム語彙を利用できます。最大1,000語を登録できますが、Google公式ドキュメントは、通常は100語以内のほうが良い結果を得やすいと案内しています。
話者分離と単語タイムスタンプを付けられる
録音済み音声では、最大8人まで声を分けてspk_1、spk_2のような話者ラベルを付けられます。ただし3人以上の話者帰属は試験的な機能です。
各単語の開始・終了時刻も出力できます。字幕の同期や該当箇所の再生に使えますが、単語タイムスタンプを有効にすると文字起こし全体の精度が下がる可能性があります。
Gemini 3.5 TranscribeのLive APIとInteractions APIの違い
2つのAPIは、同じ音声を違う速度で処理するだけではありません。対応できる長さ、話者分離、タイムスタンプ、接続方式が異なるため、用途から選ぶ必要があります。
| 比較項目 | Live API | Interactions API |
|---|---|---|
| モデル | `gemini-3.5-transcribe-live` | `gemini-3.5-transcribe` |
| 主な用途 | 音声入力、字幕、対話 | 会議、通話、録音ファイル |
| 処理方式 | WebSocketで双方向ストリーミング | 音声ファイルをアップロードして一括処理 |
| 最大時間 | 連続10分 | 通常1時間、話者分離・単語タイムスタンプ使用時30分 |
| 話者分離 | 非対応 | 最大8人、3人以上は試験的 |
| タイムスタンプ | 発話単位 | 単語単位 |
| Smartモード | 対応 | 対応 |
リアルタイム入力にはLive APIを使う
Live APIはWebSocketを通じて音声を継続送信し、途中結果と確定結果を受け取ります。公式サンプルは16kHzのPCM音声を送信し、モデルにgemini-3.5-transcribe-liveを指定しています。
話している途中は低遅延の暫定結果が返り、発話が終わると確定結果が返ります。自動音声区間検出を使うほか、ボタン操作に合わせて発話の開始と終了を明示することもできます。
AIエージェントを「どう作り、どう育てるか」を、GiftX記事制作エージェントの実物で解説。
録音済み音声にはInteractions APIを使う
Interactions APIでは、音声ファイルをFiles APIへアップロードし、gemini-3.5-transcribeへ渡します。会議やインタビューのように、処理後の品質、話者ラベル、単語タイムスタンプを優先する用途に向いています。
処理の流れは次の3段階です。
- Google AI StudioでAPIキーを用意し、Google Gen AI SDKを設定します。
- MP3などの音声ファイルをFiles APIへアップロードします。
- Interactions APIでモデル、音声URI、文字起こしモードを指定して実行します。
まずは短い音声でSmartとVerbatimを比較すると、自分の用途で残したい情報と消したい情報を判断しやすくなります。
Gemini 3.5 Transcribeは日本語に対応している
Gemini APIの録音済み音声とLive APIの対応言語一覧には、どちらも日本語のja-JPが明記されています。APIでは言語コードを省略して自動検出させる方法と、ja-JPを指定する方法を選べます。
ただし、APIの日本語対応と、GeminiアプリやGboardなど各製品で使える言語は分けて考える必要があります。提供開始時点の状況は次のとおりです。
- Gemini API:録音済み音声とリアルタイム音声の両方で
ja-JPをサポートしています。 - GeminiアプリのmacOS版:英語で提供されています。
- GboardのRambler:一部の国・言語で提供されています。利用可否はGboardの対応一覧で確認が必要です。
- Chrome:Webフォームへの音声入力は近日提供予定です。
この違いを押さえずに「日本語対応」とだけ理解すると、目的の画面で機能が見つからない可能性があります。日本語音声を開発用途で試す場合は、現時点ではGoogle AI StudioからGemini APIを使う経路が明確です。
Gemini 3.5 Transcribeの料金
Gemini 3.5 Transcribeには無料枠と有料枠があります。料金は音声入力トークンとテキスト出力トークンの合計で決まり、Googleは1分あたりの概算も公開しています(2026年8月時点、出典: ai.google.dev)。
| モデル | 無料枠 | 有料の入力 | 有料の出力 | 1分あたり概算 | 時点・出典 |
|---|---|---|---|---|---|
| Gemini 3.5 Transcribe Live | 入出力とも無料 | 100万音声トークンあたり3.50ドル、約0.005ドル/分 | 100万テキストトークンあたり21ドル、約0.004ドル/分 | 約0.009ドル/分 | 2026年8月時点、出典: ai.google.dev |
| Gemini 3.5 Transcribe | 入出力とも無料 | 100万音声トークンあたり2ドル、約0.003ドル/分 | 100万テキストトークンあたり12ドル、約0.002ドル/分 | 約0.005ドル/分 | 2026年8月時点、出典: ai.google.dev |
60分処理した場合の概算は、Liveが約0.54ドル、録音済み音声が約0.30ドルです。実際の請求額は音声と出力テキストのトークン数で変わるため、固定の分単価ではありません(2026年8月時点、出典: ai.google.dev)。
料金表では、無料枠に送信したデータはGoogle製品の改善に使われる場合があり、有料枠では使われないとされています。音声に機密情報や個人情報が含まれる場合は、安さだけで無料枠を選ばず、利用規約、保存方針、社内ルールを確認してください。
Gemini 3.5 Transcribeを使う前に確認したい制約
Gemini 3.5 Transcribeは公開プレビューです。本番へ組み込む前に、音声の長さ、必要な付加情報、評価データ、製品側の提供状況を確認します。
音声の長さと必要機能を先に決める
Live APIの連続セッションは最大10分です。長時間の会議や講演をリアルタイム処理する場合は、セッションの再接続や分割を設計する必要があります。
録音済み音声は通常リクエストで最大1時間ですが、話者分離または単語タイムスタンプを有効にすると最大30分です。30分を超える録音は分割し、境界で発話が切れないように重複区間を設ける方法を検討します。
Smartと詳細な注釈は同時に使えない
録音済み音声では、Smartモードと話者分離・単語タイムスタンプを同時に利用できません。整形済みの文章が欲しいのか、誰がいつ話したかを残したいのかを決めてから設定します。
Live APIでも、話者分離と単語単位のタイムスタンプは使えません。必要な場合は音声を保存し、終了後にInteractions APIで処理する二段構成が候補になります。
自分の音声で精度を測る
公表WERは比較の目安になりますが、マイク、雑音、話速、固有名詞、言語の混在によって結果は変わります。導入判断では、実際に扱う音声から代表サンプルを用意します。
確認項目には、文字の正しさだけでなく、話者ラベル、数字、製品名、時刻、句読点、言い直しの扱いも含めます。SmartとVerbatimを同じ音声で比較し、用途ごとの合格基準を決めると評価しやすくなります。
全国8,000人調査で、AIの活用方法によって生産性向上に約3.8倍の差が生まれることが判明。
AIエージェント導入で陥りがちな3つの落とし穴
Gemini 3.5 Transcribeは、音声を入力にしたAIエージェントの部品として利用できます。ただし、高い音声認識精度だけで一連の処理が自動化されるわけではありません。
文字起こし後に要約、保存、通知までつなぐ場合は、周辺処理の設計と評価が欠かせません。モデルの選定だけでなく、失敗時に人が確認する境界も先に決めます。
いきなり全ての音声処理を置き換える
会議、通話、音声入力を一気に置き換えると、用途ごとの精度基準や例外処理が曖昧になります。代表的な1種類の音声に絞り、合格条件を決めてから広げます。
壮大なAI戦略から考えて手が止まる
全社の音声データ活用を先に設計すると、検証範囲が膨らみます。まずは録音ファイルの文字起こしなど、入力と期待結果が明確な作業から試します。
既製チャット型AIだけで業務フローを完結させる
チャット画面で文字起こしできても、ファイル受け取り、保存、確認、他システムへの連携は残ります。API、権限、エラー処理まで含めて業務フローに組み込みます。
スモールスタートで1業務をAIエージェントに任せる
最初は1種類の音声、1つの出力先、1人の確認担当に限定します。精度と例外を記録し、安定してから対象時間や利用者を増やすほうが改善点を特定しやすくなります。
GiftXでは、こうしたスモールスタート前提のAIエージェント構築を1業務単位から伴走支援しています。詳細はAIエージェント構築支援サービスをご覧ください。
Gemini 3.5 Transcribeに関するよくある質問
Gemini 3.5 Transcribeは無料で使えますか?
Gemini APIには無料枠があり、Google AI Studioでも試せます。料金表上、無料枠は入出力とも無料ですが、送信データが製品改善に利用される場合があります。機密性の高い音声は有料枠の扱いと利用規約を確認してください。
Gemini 3.5 Transcribeは日本語を文字起こしできますか?
はい。録音済み音声用とLive API用の公式対応言語一覧に、日本語ja-JPが記載されています。ただし、Geminiアプリ、Gboard、Chromeでの機能提供言語はAPIと同一ではありません。
話者分離は何人まで対応しますか?
録音済み音声では最大8人まで対応します。ただし3人以上の話者帰属は試験的です。Live APIは話者分離に対応していません。
文字起こしできる音声は何分までですか?
Live APIは1セッション最大10分です。録音済み音声は通常1時間までですが、話者分離または単語タイムスタンプを使う場合は30分までです。
SmartモードとVerbatimモードの違いは何ですか?
Smartはフィラーや言い直しを整理し、読みやすい文章へ整えます。Verbatimは発話を忠実に残し、録音済み音声では話者分離や単語タイムスタンプと組み合わせられます。
まとめ
Gemini 3.5 Transcribeは、85言語超の自動検出、Smart Transcription、カスタム語彙、話者分離、単語タイムスタンプを備えた音声認識モデルです。日本語ja-JPも公式対応言語に含まれています。
リアルタイム処理にはLive API、録音済み音声にはInteractions APIを使います。料金と速度だけでなく、10分・30分・1時間の上限や、Smartと詳細注釈の非互換も踏まえて選ぶ必要があります。
本番導入では、まず1種類の音声を対象に、SmartとVerbatimの両方を試してください。スモールスタートで1業務の精度と例外を把握してから広げることが、安定したAIエージェント化につながります。
音声AIの導入を1業務から進めたい方へ
本記事で紹介したAIエージェントの活用に向けて、自社の業務でも具体的に進めたい・相談したいとお考えの方は、ぜひGiftX AIエージェント構築支援までお問い合わせください。
GiftX AIエージェント構築支援では、貴社の業務に合わせて1業務単位のスモールスタートから本番運用まで、AIエージェント構築をワンストップで支援します。ユースケースの洗い出しから、概念実証(PoC)、本番運用、社内ナレッジ化まで伴走します。
AI活用にご関心のある方は、ぜひ一度ご相談ください。
▶ GiftX AIエージェント構築支援の詳細・お問い合わせはこちら