社群近日傳出 Gemini 4 Pro 疑似已在 Arena 平台進行匿名測試,多支對比影片引爆討論。但 Google 與 Arena 至今都未證實。
(前情提要:Google 被傳實現 RSI,爆料者秀截圖、金鑰遭收回)
(背景補充:算力不夠?用戶曝在 Codex 選 GPT-6 Astra 模型卻全程跑 GPT-5.5)
近日,多支「Gemini 4 Pro 對戰 GPT-6、Fable 5」的比較影片衝上熱搜,並傳言「Gemini 4 疑似已潛入 Arena 盲測」。但截至發稿,Google 與 Arena 官方都未證實,沒有新模型公告,排行榜上也找不到 Gemini 4 的蹤影。
而流傳的多支影片來自 AI 應用建構平台 YouWare 的官方帳號,貼文用同一組提示詞對比 Gemini 4 與 GPT-6 的生成結果,形容 Gemini 4「表現驚艷」,並附連結導流到自家平台體驗。
Insane!!! 😎
Gemini 4 Pro shook me again today.One prompt. Two mechanical butterflies.
Same Arena prompt vs Fable 5.1 Max.
Gemini 4 Pro: ~10 min. Fable: ~30 min.
Luminous wings. Intricate clockwork. Beautiful motion.You? Which journey wins?
What will Gemini 4 Pro create… https://t.co/ZXER3p01bS pic.twitter.com/jWrXGRuA75
— YouWare (@YouWareAI) September 19, 2026
幽靈測試的起點
幽靈測試的傳言最早可追溯自 X 用戶 @NFT_Chen 於 9 月 17 日貼文:Arena 盲測裡,「Gemini 3.8 Flash」選項突然變聰明,3D 空間與物理理解躍進,生成汽車場景要花 2 至 3 分鐘。
他還在貼文中列出所謂「內部探測」結果:declared_model 顯示 3.8 Flash,runtime_engine 卻是 Argon-B02,checkpoint(模型訓練中存下的快照,僅供內部測試)編號 G4P-INT-ARGON-SEPT11-B02。
同一天,另一個帳號 @LuminaBench 稱看到同一 checkpoint,約 5 分鐘生成一座「體素寶塔」;另有帳號用鵜鶘 SVG 測試、或以 1,000 顆行星的指令碼,把模型逼到瀏覽器字元上限崩潰。
🚨重磅!Gemini 4.0 Pro已在 Arena 中开启幽灵测试!
社区实测“Gemini 3.8 Flash”背后疑似挂上内部代号 Argon 的 4 Pro checkpoint。
关键证据:
🔹Arena Battle Mode 随机命中「3.8 Flash」,画质/3D 突然远超日常 Flash🔹内部探测显示 declared_model=3.8 Flash,runtime_engine=Argon-B02… https://t.co/1mrdhWtgXf pic.twitter.com/9JJ7OIGKoF
— SuSu_酥酥👅 (@NFT_Chen) September 17, 2026
證據撐得住嗎?
不過問題是,這些「內部探測」多半只是問模型「你是誰」得到的自述,語言模型對自身身分的描述本就不可靠,這類字串可能只是幻覺,稱不上鑑識證據。
且目前發佈最多比較影片的 YouWare 每則貼文都導流自家頁面、也沒有說明為何它能試用的。儘管 Google 過去確實在 Arena 匿名測試過未發布模型,加上官方已證實 Gemini 4 在訓練中,但目前細節仍無從查證。
唯一能確認的事
回到官方說法,Google 今年 7 月 21 日表示已啟動「迄今最具野心的預訓練」用於 Gemini 4,執行長 Sundar Pichai 於 7 月下旬財報電話會議重申此事,此外發布日期、定價、型號與基準測試全未鬆口。
在 Google 正式開口之前,Arena 裡那個特別聰明的「3.8 Flash」究竟是誰,只有 Google 自己知道答案。
📍相關報導📍
OpenAI 公開 Astra 精選作品:80 款網站、App、遊戲一鍵複製
谷歌 AI 落後 OpenAI?分析師:準備看 TPU 晶片逆風翻盤

