• 【超完整懶人包】認識比特幣!原理與應用全面解析|動區新手村
  • BlockTempo Beginner – 動區新手村
  • Home 3
  • 不只加密貨幣,談談那些你不知道的區塊鏈應用|動區新手村
  • 動區動趨 BlockTempo – 最有影響力的區塊鏈新聞媒體 (比特幣, 加密貨幣)
  • 所有文章
  • 最完整的「區塊鏈入門懶人包」|動區新手村
  • 服務條款 (Terms of Use)
  • 關於 BlockTempo
  • 隱私政策政策頁面 / Privacy Policy
動區動趨-最具影響力的區塊鏈新聞媒體
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
No Result
View All Result
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
No Result
View All Result
動區動趨-最具影響力的區塊鏈新聞媒體
No Result
View All Result
Home 區塊鏈商業應用 AI

工程師接上 Claude、Grok、GPT 開真車!只有 Astra 真正跑完

Mickey帽鼠 by Mickey帽鼠
2026-09-30
in AI, 技術
A A
36
SHARES
分享至Facebook分享至Twitter

三名美國灣區的工程師讓四款通用模型在停車場開一輛真的 Toyota Corolla。部分模型曾以安全為由拒開,團隊把 MCP 伺服器改名為「DrivingBench Sandbox」並更新提示詞後才穩定肯開,只有 GPT-6 Astra 開完全程。
(前情提要:最驚悚 AI 實驗:命令機器人拿刀刺嬰兒娃娃)
(背景補充:美國公路安全保險協會:Waymo 自動駕駛肇事率低人類 68%)

本文目錄

Toggle
  • 一定要叫 Sandbox 才穩定
  • 只有 GPT-6 Astra 跑完約 130 公尺
  • 低速停車場實驗,模型思考時車子不會停
重點摘要
  • 只有 GPT-6 Astra 跑完,用時 5 分 22 秒
  • Fable 最好跑到 45%,Grok 僅 11%
  • MCP 改名 Sandbox 加新提示詞,模型才穩定開車

三名舊金山灣區工程師發起 DrivingBench 實驗,讓通用大型語言模型開一輛真的 2022 年款 Toyota Corolla。模型透過工具直接控制方向盤、油門與煞車。任務是開過停車場裡用小型三角錐排出的賽道。實驗結果 9 月 21 日公開,參賽的四款模型只有 OpenAI 的 GPT-6 Astra 跑完全程。

據 DrivingBench 報告,模型一開始並不肯開。部分模型(尤其是 GPT-6 Astra)有時會以安全為由,拒絕操控實體車輛。停車場完全淨空,提示詞也說明了低速上限與有人踩煞車待命,模型有時仍會拒絕。團隊最後把連接模型與車輛的 MCP 伺服器改名為「DrivingBench Sandbox」。換上這個名稱與最新版提示詞後,模型才穩定開起真車。

團隊成員是 Aditya Ramabadran、Tobias Gessler 與 Simon Mahns,三個人是 AI 數學新創 Axiom Math 的同事,在工作中認識。

參賽模型包括 OpenAI 的 GPT-6 Astra 與 GPT-5.6 Sol、Anthropic 的 Claude Fable 5.1,以及 Grok 4.6。

一定要叫 Sandbox 才穩定

車輛這端用的是 comma.ai 的 comma four。這是一款裝在擋風玻璃上的車用裝置,搭配開源駕駛輔助軟體 openpilot 使用。兩者合起來能控制車子的轉向與車速。團隊在 openpilot 上加裝自己的控制程式,再透過 MCP 把車子交給模型操作。

MCP(Model Context Protocol)是讓 AI 模型呼叫外部工具的標準介面。DrivingBench 給模型三個工具,observe 回傳鏡頭畫面與車速,stop_now 立即煞車。set_motion 負責下達方向、轉向幅度、速度與持續秒數。GPT-6 Astra 與 GPT-5.6 Sol 在 Codex 裡執行,Claude Fable 5.1 用 Claude Code,Grok 4.6 用 Cursor。四款的推理強度都設在中等(medium)。

Aditya Ramabadran 向 404 Media 表示,GPT-6 Astra 在很多情況下都拒絕開車。團隊花了好幾個小時反覆修改提示詞與各項命名,才讓它穩定開車。團隊試過把任務說成「模擬」,他說有一部分時候有效。報告則寫說,模型有時看到鏡頭傳回的真實畫面,就判斷這是真的。

報告指出,最後效果最好的做法「不知為何」是把 MCP 名稱改成「DrivingBench Sandbox」。Sandbox 就是沙盒,軟體業用這個詞指和真實環境隔開的測試環境。Aditya Ramabadran 說,改用這版提示詞後,模型「幾乎不會再拒絕」。

只有 GPT-6 Astra 跑完約 130 公尺

賽道設在灣區一座大型停車場,預定路線約 130 公尺。途中有左轉、直線、緩彎和兩個右轉。終點是藍色三角錐圍出的停車格,模型要把車停進去才算完賽。每款模型最多有 3 次機會,都在同一個對話裡進行,失敗後先被要求檢討再重來。

進度的算法是看車子沿著賽道中心線前進多遠,偏離中心線 4 公尺以上的部分不算。GPT-6 Astra 第 1 次跑到 49%,第 2 次完賽,用時 5 分 22 秒,GPS 量得行駛 134.7 公尺。平均下來每小時約 1.5 公里,比一般人走路還慢。這趟用掉約 660 萬個 token(模型處理文字的計量單位),以牌價計算約 7.74 美元。

Claude Fable 5.1 最好的是第 3 次,跑到 45%,報告形容和 GPT-6 Astra 第 1 次一樣走到約一半。其餘嘗試都沒能通過第一個彎,Grok 4.6 最好成績是 11%,GPT-5.6 Sol 三次都停在 6%。被報告特別點名會拒絕開車的 GPT-6 Astra,也是這次唯一完賽的模型。

報告說,失敗主因出在「感知」,也就是從鏡頭畫面判讀環境。賽道開頭有一排斜向擺放的三角錐,模型要判斷車道在這排三角錐的哪一側。Claude Fable 5.1 第 2 次失敗後檢討:「我又選錯邊界的那一側了。那條斜的三角錐線是車道的左緣,不是右緣。」GPT-5.6 Sol 則檢討自己誤把三角錐顏色當成左右邊界,提示詞其實寫明三角錐有多種顏色。

報告認為 GPT-6 Astra 與 Claude Fable 5.1 都有在對話中學習的跡象。GPT-6 Astra 第 1 次失敗後檢討,寫到自己太早判定車身已經對正,又把速度加到每秒 1.5 公尺。它也寫下,之後在彎道附近要把速度降到每秒 0.5 到 0.8 公尺。第 2 次它的車速都在每秒 0.8 公尺以內,約時速 2.9 公里,24 個指令有 20 個把轉向設在上限 100%。

Claude Fable 5.1 一開始把轉向設在 60% 到 100%,檢討時認為幅度太大,之後改成預設 30%。第 3 次它一開始就寫下要讓斜的三角錐線保持在左側,順利開完長直線。不過它沒留夠空間,沒能完成下一個右轉。

低速停車場實驗,模型思考時車子不會停

實驗全程在空曠停車場低速進行,沒有開上一般道路。程式把車速限制在每秒 0.5 到 3.5 公尺,約時速 1.8 到 12.6 公里。車速超過每秒 6 公尺(約時速 21.6 公里),系統就會取消動作並解除控制。

每次嘗試由駕駛座上的真人按下方向盤的 RES 鍵啟動。openpilot 規定車子從靜止起步前,要先有人按下這個鍵。這名駕駛全程把腳放在煞車上方,車子出界或快要撞上障礙物、路緣時就踩煞車。

模型思考時車子不會停下,前一個指令會繼續執行到時間結束。報告的系統圖標示,模型每次思考約 2 到 30 秒。Aditya Ramabadran 表示,車速每秒 1 公尺時,模型想 10 秒,車子就已經開出 10 公尺。

報告統計,GPT-6 Astra 大約每 5 到 6 秒查看一次畫面。Claude Fable 5.1 第 2 次嘗試共 190 秒,車子只動了 31 秒,其餘多半停著等模型推理。報告指出,只有 GPT-6 Astra 與 GPT-5.6 Sol 曾在前一個指令結束前就送出新指令。

團隊用的 comma four 目前也在美國國家公路交通安全管理局(NHTSA)的調查範圍內。NHTSA 9 月 21 日對 comma.ai 開啟初步調查,估計涵蓋約 3 萬台裝置。範圍包括 comma three、comma 3X、comma four 與 openpilot 軟體。

調查起因是 5 起事故,裝有 comma 裝置的車輛撞上同車道停止或慢速的前車。其中 2 起共造成 3 人死亡,另有 11 人受傷。這項調查針對的是道路事故,和 DrivingBench 的停車場實驗無關。

Aditya Ramabadran 對 404 Media 表示,團隊無意證明把 ChatGPT 接上自家車代步是可行的做法。團隊計畫在下一版讓每款模型重複測試多次,並比較不同推理強度。下一版也會測更多模型,改用更難或更長的賽道。

報告結論寫道,模型能在這項測試中成功,代表安全、對齊與評測方面還有迫切的工作要做。對齊指讓模型的行為符合人類意圖。團隊表示,這方面很快會公布更多內容。

常見問題

大型語言模型可以開真的車嗎

測試 4 款通用模型,只有 GPT-6 Astra 第 2 次跑完,用時 5 分 22 秒。車速上限每秒 3.5 公尺,真人全程待命踩煞車。

為什麼 AI 模型會拒絕開真車

部分模型(尤其 GPT-6 Astra)發現是真車就拒絕。團隊把 MCP 伺服器改名 Sandbox 並更新提示詞後,才穩定開車。

加入動區 Telegram 頻道

📍相關報導📍

21 年解不開的德軍密電,GPT-6 Astra 花兩天成功破譯

特斯拉 Cybercab 出師不力?監管首日就出手調查,實際登記上路只有 45 輛

Waymo 自動駕駛車宣布進軍新加坡,預計 2028 年上路

Tags: ChatGPTClaude Fable 5.1GPT-6 AstraMCP自動駕駛


關於我們

動區動趨

為您帶來最即時最全面
區塊鏈世界脈動剖析
之動感新聞站

訂閱我們的最新消息

動區精選-為您整理一週間的國際動態

戰略夥伴

Foresight Ventures Foresight News MEXC

主題分類

  • 關於 BlockTempo

動區動趨 BlockTempo © All Rights Reserved.

No Result
View All Result
  • 所有文章
  • 搶先看
  • 市場脈動
  • 商業應用
  • 區塊鏈新手教學
  • 區塊鏈技術
  • 數據洞察
  • 政府法規
  • RootData

動區動趨 BlockTempo © All Rights Reserved.