Google 為 Gemini Audio 加入新轉錄模型,主打自動辨識 85 種以上語言、分辨最多三位語者,還能自動清掉口頭禪與贅字。但拉到同業一起比,它既不是最準、也不是最便宜的那一個。
(前情提要:注意》你拍的照片、說過的話,Google 現在要存下來訓練 AI 了(如何關閉教學))
(背景補充:德國法院裁定: Google AI 摘要不實內容須負責,免責聲明不管用)
這次 Google 端出的新模型叫 Gemini 3.5 Transcribe,除了會自動砍掉「嗯、啊」這類贅字,它能自動辨識 85 種以上的語言,也能抓出對話裡的專業術語,不用用戶事先設定語言別。
用戶還可以先給模型一份自訂詞彙表,把公司名稱、產品名稱、特殊拼法先教給它,模型轉錄時就會直接套用,不用事後手動一一修改,對常開會議、常錄訪談的用戶算是省了一道工。
分辨最多三位讀者
對著預先錄好的音檔,它最多能分辨三位語者是誰在講話,並且附上字級時間戳,方便剪輯或做逐字稿檢索。
至於轉錄品質怎麼衡量?業界慣用「字錯率」(word error rate),也就是機器聽打稿跟真人聽打稿之間差了多少字,數字越低代表機器聽得越準。Google 官方公告給出的數字是:串流模式(邊講邊即時轉出文字)平均字錯率 4.0%,非串流模式(整段講完再一次輸出)則是 2.6%;在 FLEURS 這個多語言基準測試上,串流 5.50%、非串流 5.04%。
跟前一代 Chirp 3 相比,官方說最終轉錄的延遲改善了 70%,也就是講完話到看見完整逐字稿的等待時間縮短不少。
即時串流走的是 Live API(gemini-3.5-transcribe-live),預錄音檔則走 Interactions API(gemini-3.5-transcribe),兩條產品線分開服務不同情境。
這次更新從今天起在 macOS 版 Gemini app 以英文上線,Android 的 Rambler 聽寫功能則在部分國家與語言開放;開發者可以透過 AI Studio 與 Antigravity,在 Gemini API 公開預覽(先開放給開發者測試)階段搶先使用,Chrome 瀏覽器的支援則還在路上。
獨立榜單只排第四
不過 Google 說的「重大進展」是跟自家上一代模型比。放到整個語音轉錄市場攤開來看,情況完全不同。
第三方跑分平台 Artificial Analysis 的 AA-WER 榜單,把各家轉錄模型放在同一把尺上量字錯率與價格,結果 Gemini 3.5 Transcribe 的字錯率是 2.6%,價格為每 1,000 分鐘 5 美元。排在它前面的,有 ElevenLabs 的 Scribe v2,字錯率 2.2%,價格卻只要每 1,000 分鐘 3.67 美元,又準又便宜;微軟 Azure 的 MAI-Transcribe-1.5 是 2.4%;Smallest.ai 的 Pulse Pro 同樣是 2.4%。
換句話說,光是字錯率這項指標,Google 前面就還站著三家對手,沒有一家是省油的燈。
再往下看,AssemblyAI 的 Universal-3 Pro 字錯率 3.1%、每 1,000 分鐘 3.50 美元;OpenAI 的 GPT-4o Transcribe 是 4.0%、6 美元;Deepgram 的 Nova-3 則是 5.2%、4.30 美元。攤開榜單,語音轉錄早就是一片紅海,ElevenLabs、微軟、AssemblyAI、Deepgram、OpenAI 全部擠在同一張表上比價比準度。
Google 這次是後進者在追趕排名,不是領跑者在拉開差距。唯一站在它這邊的變數是通路:Scribe v2 得靠開發者主動去接 API,Gemini 3.5 Transcribe 卻能直接塞進 Gemini app、Android 的聽寫功能與之後的 Chrome,一次觸及數以億計的一般用戶。
📍相關報導📍
Google最強AI「Gemini」爆造假!谷歌承認影片經剪輯、非即時語音、有用 Prompt
Google AI筆記NotebookLM新增「Audio Overview」,兩步驟將文字轉成Podcast
Google 推出「Skills」功能:Chrome 一鍵執行 AI 指令,快速上手教學

