GPT-6 Astra 在韓國修能(韓國版學測)的 AI 評測拿下 450 分滿分,是第一個全科零失分的模型。第二名 GPT-5.6 拿 448.5 分,兩者只差 1.5 分,Astra 卻只用 35.7 萬 tokens,比第二名少約 17%。
(前情提要:數值怪 GPT-6 Astra 發布:跑分驚人 OpenAI 喊 AGI 時刻來了(附實測效果))
(背景補充:GPT-6 Astra 零失誤通關 48 關 CAPTCHA,「我不是機器人」驗證正在失守)
重點摘要
- GPT-6 Astra 韓國修能評測 450 分滿分
- 第二名 GPT-5.6 拿 448.5 分,只差 1.5 分
- Astra 只花 35.7 萬 tokens,比第二名更省
韓國大學修學能力試驗(韓文「수능」,相當於台灣的學測)出現第一個全科滿分的 AI 模型。據 韓國日報 報導,GPT-6 Astra 在針對 AI 的修能評測中拿下 450 分滿分,國語、數學、英語、韓國史,加上物理 I、化學 I、生物 I、社會文化這幾個選考科目,全部沒有失分。
修能是韓國高中生升大學最主要的全國性考試,每年一次,成績能決定校系落點。450 分是這份評測記錄的總分上限,一題都不能錯才拿得到。一個模型在這份考卷上全對,在韓國就足以變成新聞。
不過滿分跟第二名的差距只有 1.5 分。
- GPT-5.6 以 448.5 分排第二
- GPT-5.4 的 448 分排第三
- Claude Fable 5.1 拿 447.5 分排第四
- Gemini 3.1 Pro 的 445 分排第五。
前五名全部擠在 5 分之內,1.5 分放在 450 分的總分裡是 0.3%,第二名跟滿分的距離就只有這麼多。
不准上網搜尋的「真考試」
這次評測跑在 GitHub 上的「2026 學年度修能 LLM 解題紀錄」頁面,題目用的是 2025 年實際施行的 2026 學年度修能考題,也就是韓國考生真的考過的那一份。過程中不准使用外部網路搜尋,模型只能靠訓練時學到的東西作答。
這個限制讓分數比較有意義,可以上網查的話,選擇題答案在網路上早就找得到,考的就不是解題能力,而是搜尋能力。
考試形式也會左右成績,Gemini 3.1 Pro 之前在只考兩個科目的形式下被記為 450 分滿分,換到這次的全科綜合評測就掉到 445 分。科目一多、題型跨度變大,成績就守不住。這也是為什麼同一個模型在不同評測裡分數會差這麼多,看排名之前要先看它考了幾科。
滿分也最省token
Astra 解完整份考卷只用了 35.7 萬 tokens。tokens 是模型讀寫文字的計算單位,用掉越多代表它想得越久、跑一次越貴。同一份考卷,GPT-5.6 用了 42.9 萬,Claude Fable 5.1 用了 56.2 萬。
換算下來,Astra 比第二名少用約 17%,比 Claude Fable 5.1 少了三成六,差距是 20.5 萬 tokens。分數只差 1.5 分,算力消耗卻差了三分之一以上,這份榜單真正分得開的是後面這個數字。
報導引述李承鉉(Lee Seung-hyun)教授的解讀,Astra 一邊壓縮與修改自己的解題計畫,一邊維持了推理脈絡,重點在結構效率而不是原始智力。這個說法對得上榜單,分數已經沒有多少空間可以再拉開,能拉開的是同一題用幾步算完。
常見問題
GPT-6 Astra 韓國學測考了幾分
450 分滿分,四個必考科目加選考科目全部沒有失分。第二名 GPT-5.6 拿 448.5 分,前五名的分數全部擠在 5 分之內。
AI 考出滿分代表 AGI 已經來了嗎
受訪業界人士說學測分數不是一切,AI 的價值在解開還沒有答案的難題。OpenAI 總裁與黃仁勳都說 AGI 已到,韓國政界與學界仍在辯論。
📍相關報導📍
MIT 校長:有了 AI 還要唸大學嗎?高等教育的歷史大斷點

