舊金山 AI 新創 Tavus 10 月 1 日發表即時視訊模型 Griffin,稱它是第一個通過「視訊圖靈測試」的模型。在 Tavus 自家實驗中,54 名受試者有 48% 在 1 分鐘視訊後認為對方是真人。Tavus 也表示新模型因安全疑慮暫不對客戶開放。
(前情提要:V 神:GPT-4已通過圖靈測試,研究顯示人類有56%機率誤認GPT-4為人類)
(背景補充:當本人也無法證明自己不是 AI,鑑識專家建議:和親友對個秘密暗號吧)
重點摘要
- Tavus 稱 54 名受試者中 48% 視訊 1 分鐘後,認為 Griffin-Lite 是真人
- NVIDIA VideoFDB 感知軌 Griffin-Lite 得 3.73 分,人類參考為 4.20 分
- X 社群註記指出 48% 出自 Tavus 自家研究,未經獨立驗證
舊金山 AI 新創 Tavus 10 月 1 日發表新模型 Griffin,在官方 X 貼文與研究文章中稱它是「第一個通過視訊圖靈測試的模型」。Tavus 公布的自家實驗中,54 名受試者和研究預覽版 Griffin-Lite 視訊 1 分鐘,事後有 26 人(48%)認為對方是真人。
Introducing Griffin, the first model to pass the video Turing test.
48% of people who talked to it live thought it was a real human. Previous systems have had a pass rate <3%. It is #1 on NVIDIA's benchmark for full-duplex AI video.
It’s the first Human Interaction Model (HIM). pic.twitter.com/eb11XbC8Xr
— Tavus (@tavus) October 1, 2026
用同一套程序測試 Tavus 前代系統時,41 人中只有 1 人(2.4%)這樣認為。從 2.4% 到 48%,等於從幾乎每個人都認得出對面是 AI,變成將近一半的人沒認出來。推文寫前代系統的比例「不到 3%」,研究文章列出的實驗結果是 2.4%。
Tavus 把 Griffin 稱為「人類互動模型」(Human Interaction Model,HIM)。它把看、聽、說和生成人臉影片放進同一個系統,可以邊說邊聽,也會留意對方的表情和停頓。Griffin-Lite 目前只開放給少數「受信任的測試者」做研究預覽,不提供客戶使用。
實驗由 Tavus 自己設計與公布
據 Tavus 官方文章說明,受試者透過一個「獨立研究平台」招募。他們被告知會和另一位參與者配對,視訊 1 分鐘,聊「今年期待什麼」。對方其實是 Tavus 的 AI 角色(Tavus 稱為 PAL),臉、聲音和回應都由 Griffin-Lite 即時生成。
通話結束後,受試者先寫下對方的回答,替對方的自然度與可信度打分數。問卷最後才問他們有沒有想過對方可能不是真人,以及何時想到。最後所有人都被告知對方是 AI。
Tavus 表示,認為對方是真人的受試者平均信心 79%,認為是 AI 的平均信心 81%。超過一半受試者說通話中沒想過這個可能,起疑的人多半在前 20 秒就起疑。以 7 分為滿分,受試者替 Griffin-Lite 的自然度打 5.4 分、可信度打 5.6 分,「對話流暢自然」為 4.9 分,是五個評分項目中最低的。
Tavus 沒有公布受試者的年齡與地區分布,也沒有寫出招募平台的名稱。Protos 的報導同樣指出受試者人口組成未公開。
目前,48% 和「視訊圖靈測試」的說法出自 Tavus 自己的研究,這些研究沒有經過獨立驗證,也沒有採用標準協議。
Decrypt 也指出,這和英國數學家圖靈(Alan Turing)1950 年提出的經典版本不同。經典圖靈測試由評審同時和看不見的一個真人與一台機器對話,再判斷哪一個是人。Tavus 的實驗中,沒有人事先被告知對面可能是機器。
文字對話方面,加州大學聖地牙哥分校(UC San Diego)研究人員 Cameron Jones 與 Benjamin Bergen 2025 年 3 月發表論文。實驗照經典格式,受試者同時和一位真人及一個 AI 文字對話 5 分鐘,再判斷誰是真人。GPT-4.5 被要求扮演擬人角色時,有 73% 的情況被判定為真人,比真人參與者被選中的次數還多。
NVIDIA 排行榜的分數與 Tavus 公布一致
Tavus 另稱 Griffin 在 NVIDIA 的全雙工影音對話基準 VideoFDB 排名第一。全雙工指 AI 可以同時聽、看、說,不必等對方講完才回話。根據 NVIDIA 研究頁,VideoFDB 由 NVIDIA 與 David AI 的研究人員建立,題目是 237 段真實視訊通話片段。評分由語言模型擔任評審,每個項目 0 到 5 分。
基準分成兩軌。感知軌看 AI 能不能讀懂對方的表情、視線和動作,生成軌看 AI 自己產出的聲音與畫面自不自然。Tavus 稱這些分數由 NVIDIA 在 2026 年 9 月評分。動區比對 NVIDIA 研究頁上的排行榜,Tavus 引用的分數都對得上。
| 項目 | Griffin-Lite | 分數次佳系統 | 人類參考 |
|---|---|---|---|
| 生成軌總分(0 到 5) | 3.83 | 2.80(Gemini 2.5+Anam) | 3.92 |
| 感知軌總分(0 到 5) | 3.73 | 3.44(MiniCPM-o 4.5,只給聲音) | 4.20 |
| 說話時機一致度(生成/感知) | 62.8%/73.8% | 44%/72% | 78%/90% |
| 回應延遲中位數(生成/感知) | 1.89 秒/2.23 秒 | 2.84 秒/0.92 秒 | 0.9 秒/1.4 秒 |
資料來源為 NVIDIA VideoFDB 排行榜,動區 10 月 3 日查詢。說話時機一致度是指 AI 決定何時開口,和參考對話裡真人的時機有多接近。
Tavus 稱安全揭露功能還在開發
Tavus 的技術說明提到,Griffin-Lite 的語音生成可用約 10 秒的音檔複製說話者的聲音。影片則從一張參考照片即時生成整個畫面,包含手勢與背景。
官方在安全段落寫道,讓人類互動模型成為自然溝通介面的特性,同樣能欺騙人類,讓人誤以為對方不是 AI。Tavus 表示,安全釋出前還需要更多對齊與安全程序。公司正在開發安全揭露功能,也和處理 AI 安全的組織合作。想試用 Griffin-Lite 的人要填表申請成為測試者。
不少網路評論者表示,如果這套 AI 視訊服務開始普及,詐騙就可以直接用視訊來騙人了,各位讀者一定要當心,最好跟家中成員約定好一個特殊的「暗號」,一但談論到錢的事情,才能確認真的是家人。
常見問題
Tavus Griffin 真的通過圖靈測試了嗎
這是 Tavus 自己的說法。它讓 54 人視訊 1 分鐘,48% 認為對方是真人,但受試者事先不知道可能是 AI。X 社群註記指出結果未經獨立驗證,也沒有採用標準協議。
怎麼防範 AI 深偽視訊詐騙
FBI 2024 年 12 月建議和家人約定秘密字詞確認身分。警政署 165 宣導建議談到錢先打親友原本的電話查證,並請對方轉頭、在臉前揮手看有沒有破綻。
📍相關報導📍
3 秒就能複製你的聲音,FBI 證實 AI 詐騙飆增:責任在機構不在阿嬤

