Google 推出 Gemini 3.5 Transcribe,專門處理「語音轉文字」工作。和一般把錄音丟給 AI 再要求摘要不同,它的核心任務是先把聲音準確轉成可使用的文字,並支援自動辨識語言、區分說話者、時間戳記與專有名詞提示等功能。
如果你的工作常碰到會議錄音、訪談、課程、Podcast 或客服通話,這項更新值得注意。它真正解決的問題不是「AI 能不能聽懂聲音」,而是如何把大量錄音更有效率地變成後續可以搜尋、整理與分析的文字資料。
Gemini 3.5 Transcribe 是什麼?
Gemini 3.5 Transcribe 是 Google 在 2026 年 8 月推出的語音轉文字模型,也就是 Speech-to-Text。
你可以把它想成一位專門負責「聽打」的 AI:輸入 MP3、WAV、M4A 等音訊後,模型會辨識裡面的語音並輸出文字;Google 另外提供 Live 版本,可以處理即時串流的聲音。
目前 Gemini 3.5 Transcribe 主要透過 Gemini API 提供,開發者可以在 Google AI Studio 嘗試,再將它整合進自己的網站、App 或企業工作流程。
因此,如果你只是一般 Gemini App 使用者,要注意它並不是「打開 Gemini 就會多出一個會議逐字稿按鈕」這麼簡單。它目前更像是一項底層能力,讓開發者與企業可以建立自己的語音應用。
Gemini 3.5 Transcribe 可以做什麼?
一般語音轉文字最基本的工作,就是「聽到什麼、寫出什麼」。Gemini 3.5 Transcribe 則加入幾項對實際工作特別有用的功能。
| 功能 | 可以解決什麼問題 |
| 自動語言辨識 | 不必每次手動指定錄音語言 |
| 說話者辨識 | 區分會議中不同人的發言 |
| 字詞層級時間戳記 | 找出某句話出現在錄音的哪個時間 |
| 自訂詞彙 | 提高人名、品牌、縮寫與專業術語的辨識機會 |
| Smart transcription | 移除部分贅詞、口吃與重複內容,整理成較容易閱讀的文字 |
| Live transcription | 將正在進行的語音即時轉成文字 |
其中最值得一般工作者理解的,是「逐字轉錄」和「智慧轉錄」其實是兩種不同需求。
要完整逐字稿,還是整理好的文字?
Gemini 3.5 Transcribe 提供 verbatim 與 smart 兩種主要轉錄模式。
Verbatim:盡量保留原本說法
Verbatim 可以理解成「逐字稿模式」。
例如會議中有人說:
「呃,我覺得我們可以星期二……啊不對,改星期三下午兩點開會。」
逐字稿的重點是保留實際發言,因此贅詞、重複或自己修正的內容可能會留下來。
這種模式適合訪談紀錄、研究資料、需要核對原話的會議,以及後續還要搭配時間戳記找回原始錄音的情境。
Gemini 3.5 Transcribe 的說話者辨識與字詞層級時間戳記,也是在這類模式下使用。
Smart:直接整理成比較好讀的版本
如果你的目的不是保存每一個「嗯、呃」,而是想快速得到可閱讀的會議文字,Smart transcription 會更實用。
同一句話經過整理後,可能變成:
「我們改成星期三下午 2 點開會。」
Google 表示,Smart 模式會處理口語贅詞、重複、說到一半重新修正等情況,也會協助加入標點、段落,以及整理日期、數字等格式。
但要注意,Smart 模式已經不是純粹的逐字紀錄。涉及訪談引用、法律紀錄或其他必須保留原話的工作時,不應直接把整理後的版本當成原始發言。
開會時最實用的是「分辨誰說了什麼」
多人會議的逐字稿有一個常見問題:文字全部轉出來了,卻不知道每句話是誰講的。
Gemini 3.5 Transcribe 支援 Speaker diarization,也就是「說話者分離」。
系統可以把不同聲音標記成不同說話者,例如:
spk_1:下週先完成第一版提案。
spk_2:那數據資料我星期五以前補上。
spk_1:好,完成後再安排內部審稿。
Google 文件目前說明最多可支援 8 位說話者,其中 3 位以上的說話者歸屬仍屬實驗性功能。
這項能力對會議、訪談、焦點團體與客服通話特別實用。不過 AI 能區分聲音,不代表一定知道「spk_1 就是王經理」。實際應用時,仍可能需要再把說話者標籤和真實姓名對應起來。
專有名詞很多,也可以先告訴 AI
語音辨識常常不是敗在一般中文,而是公司內部才會出現的詞。
例如產品名稱、人名、客戶公司名稱、英文縮寫、醫療或科技術語,發音相近時很容易被辨識成另一個字。
Gemini 3.5 Transcribe 提供 Custom vocabulary 功能,可以事先加入最多 1,000 個詞彙,讓模型在辨識時參考。
假設你要整理一場 AI 技術會議,就可以預先提供:
「Gemini、Kubernetes、BigQuery、n8n」
對企業來說,這比每次產生逐字稿後,再人工搜尋並修改大量專有名詞更有應用價值。
中文可以使用嗎?
可以,但要注意「中文」本身還有不同語言與地區設定。
Google 官方支援語言清單目前包含簡體中文 Mandarin Chinese,也列出繁體粵語 Cantonese(Traditional)等多種語言與地區設定;模型同時支援自動語言偵測,以及對話過程中切換語言。
因此,遇到「中文講到一半穿插英文產品名稱」的會議,模型可以在不需要每次手動切換設定的情況下處理不同語言。
不過語音辨識的實際準確度仍會受到口音、收音品質、背景噪音、多人同時講話與專有名詞影響。重要會議不能因為 AI 有自動辨識功能,就省略人工確認。
Gemini 3.5 Transcribe 適合哪些工作?
如果只是偶爾錄一段自己的語音備忘,不一定需要特別使用新的 API。
真正適合這類語音轉文字模型的,是「錄音很多,而且轉成文字後還有下一步工作」的情境。
例如公司每週有大量會議,可以建立:
錄音 → 轉錄 → 整理發言 → 擷取待辦事項 → 產生會議摘要。
內容創作者則可以把:
訪談錄音 → 逐字稿 → 找出重點段落 → 整理文章素材。
老師或研究工作者也可以將課程、訪談或研究錄音先轉成可搜尋的文字,再進行後續整理。
真正值得注意的地方,是語音逐漸可以直接成為 AI 工作流程的「輸入資料」,不需要人工先花幾個小時把聲音打成文字。
Gemini 3.5 Transcribe 和一般 Gemini 有什麼不同?
兩者都能處理音訊,但工作目的不同。
一般 Gemini 的音訊理解比較適合「理解內容」。例如提供一段錄音,再詢問:
「這段訪談的三個主要觀點是什麼?」
Gemini 3.5 Transcribe 則專門處理「轉錄」,例如:
「完整寫出每個人說了什麼,區分不同說話者,並保留時間資訊。」
所以選擇工具時,可以先問自己:
如果最重要的是「理解這段聲音在說什麼」,使用一般音訊理解能力即可;如果需要建立可靠、可繼續處理的逐字稿資料,專門的 Transcribe 模型會更符合需求。
Gemini 3.5 Transcribe 免費嗎?
Google Gemini Developer API 目前提供 Free Tier,但免費方案只開放特定模型與有限使用量,實際可用額度仍應以 Google AI Studio 顯示為準。
依 Google 目前公布的付費價格,Gemini 3.5 Transcribe 音訊輸入估算約為每分鐘 0.003 美元、文字輸出約每分鐘 0.002 美元,合計估算約每分鐘 0.005 美元。
即時版本 Gemini 3.5 Transcribe Live 的估算綜合費率則約為每分鐘 0.009 美元。
這些是 API 開發者價格,不等於一般 Gemini 訂閱方案的月費,而且 Google 後續仍可能調整計價方式。正式大量使用前,應直接確認最新官方價格。
使用 AI 做會議逐字稿,要注意什麼?
第一個問題不是模型準不準,而是「這段錄音能不能上傳」。
公司內部會議可能包含客戶資料、商業機密、員工資訊或尚未公開的決策。使用任何雲端 AI 服務前,都應先確認公司的資訊安全規範、帳號方案與資料使用政策。
第二個問題是逐字稿仍可能出錯。
人名、金額、日期、專業術語與決策內容尤其值得人工核對。如果一句辨識錯誤會影響合約、報價或工作指派,就應回頭確認原始錄音,而不是只看 AI 整理後的版本。
最後,要分清楚「逐字稿」和「摘要」。
Smart transcription 可以讓文字變乾淨,但經過整理的內容已經包含 AI 的處理。如果需要證明某個人實際說過什麼,保留原始音檔與 verbatim 版本會比較合適。
一般人現在需要特別學 Gemini 3.5 Transcribe 嗎?
如果你不寫程式,也不需要因為新模型推出就立刻研究 API。
更值得先學的是判斷自己的工作流程:
「我有哪些資訊原本存在聲音裡,現在必須人工整理才能繼續工作?」
只要答案包括大量會議、訪談、課程、客服或影音素材,語音轉文字就可能成為值得自動化的一個環節。
例如不要只停在「幫我產生逐字稿」,而是思考:
錄音 → 文字 → 重點 → 任務 → 可交付成果
當 AI 能把聲音變成結構化資料後,後面的摘要、分類、搜尋與自動化才真正開始。
如果你想進一步了解如何把不同 AI 工具放進日常工作,也可以從海豚 AI 學院的免費試看開始,先從自己每天會重複做的工作找出適合 AI 協助的環節。
常見問題 FAQ
Gemini 3.5 Transcribe 可以即時把說話內容變成文字嗎?
可以。Google 另外提供 gemini-3.5-transcribe-live,透過 Live API 接收持續的音訊串流,並即時回傳轉錄結果。
可以辨識不同說話者嗎?
可以。Gemini 3.5 Transcribe 支援 Speaker diarization,可將不同聲音標示為不同說話者。Google 目前文件列出最多支援 8 位說話者,但 3 位以上的說話者歸屬仍屬實驗性功能。
可以直接拿來整理會議紀錄嗎?
它最核心的功能是把語音轉成文字。取得逐字稿後,可以再搭配 Gemini 或其他 AI,整理會議摘要、決議與待辦事項。若使用 Smart transcription,也能先把部分口語贅詞與重複內容整理掉。
Smart transcription 和逐字稿有什麼差別?
逐字稿模式重視保留實際說話內容;Smart transcription 則會移除部分贅詞、修正口語中途更改的內容,並整理格式。需要精確引用原話時,應優先保留逐字版本。
資料來源
Google|Introducing Gemini 3.5 Transcribe
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
Google AI for Developers|Gemini 3.5 Transcribe
https://ai.google.dev/gemini-api/docs/models/gemini-3.5-transcribe
Google AI for Developers|Audio transcription
https://ai.google.dev/gemini-api/docs/transcribe
Google AI for Developers|Live transcription with Gemini Live API
https://ai.google.dev/gemini-api/docs/live-api/live-transcribe
Google AI for Developers|Gemini Developer API pricing
