累計 位不重複訪客
快速找分類 🤖 AI 對話 🎨 AI 生圖 🎬 AI 影片 🎵 語音音樂 💻 寫程式 ✍️ 寫作文案 ⚡ 辦公效率 🔍 搜尋研究 🦾 AI 代理 🎁 免費總表
首頁 問問貓說 AI

問問貓AI 工具總表ChatGPT

【2026 實查】GPT-6 Astra 機器手臂 19/20 被瘋傳:原作者自己列了四個限制,先別當成定論

🐾 一分鐘快查
  • 免費版:有
  • 最低付費方案:US$8/月起
  • 免費額度:免費版每月 NT$0,人人可用(2026-08-09 台灣連線直讀官網 chatgpt.com/zh-Hant/pricing)。官網逐條列 …
  • 最後查核:2026-09-08

文章最後更新:2026-09-07

2026-09-04,一份叫做「GPT-6 Astra on robotic manipulation」的實測報告在 Hacker News 上衝到 229 分。標題數字非常搶眼:OpenAI 的新旗艦 GPT-6 Astra 讓機器手臂把方塊放進碗裡,20 次成功 19 次;Claude Fable 5.1 只有 8 次。

這種數字最容易被轉貼成「某某模型完勝」。我們直接去讀原始報告頁,把它的完整表格、成本、耗時抄下來,也把作者自己寫在文章裡的四個限制一起列出來。查核日 2026-09-07。

一、這個實驗到底怎麼做的

報告來自 Robocurve,是他們先前比較 Claude Fable 5 與 Fable 5.1 的後續篇——也就是說,硬體、任務、代理策略都沿用上一輪,只是把 GPT-6 Astra 放進同一組條件再跑一次。

  • 硬體:雙臂 I2RT YAM arms,每隻手臂 6 個自由度,平行夾爪。
  • 代理策略:Inspect Robots agent policy(與前一輪相同)。
  • 任務一:把桌上的紅色方塊撿起來放進碗裡。
  • 任務二:抓住藍色圓形拼圖片中央的把手,放進板子上對應的圓形凹槽。
  • 規模:三個模型 × 兩個任務 × 各 20 次,合計 120 次試驗。
  • 評分:由人類評分者依「最高完成階段」計分(0 沒有有意義的接近、1 碰到物件、2 離開桌面、3 移到放置點上方、4 放進最終位置),所以失敗的試驗也會記錄它走到哪一步。

二、完整數字(不是只有那個 19/20)

任務模型平均階段完成數完成率每次輸出 token每次估計成本每次分鐘
方塊進碗Fable 51.301/205%19.2kUS$2.698.2
方塊進碗Fable 5.12.408/2040%12.9kUS$2.126.8
方塊進碗GPT-6 Astra3.9519/2095%2.1kUS$0.942.5
拼圖進凹槽Fable 51.500/200%16.3kUS$2.637.9
拼圖進凹槽Fable 5.12.352/2010%10.5kUS$2.185.9
拼圖進凹槽GPT-6 Astra2.002/2010%2.7kUS$1.363.4

被瘋傳的只有第一組。但第二組任務三個模型全部不行:Astra 2/20、Fable 5.1 也是 2/20,完成率同樣是 10%。報告原文寫得很直白——Astra 會走到凹槽前面,然後卡在跟 Fable 一模一樣的最後一步

換句話說,這份報告真正說的是:簡單的抓放,Astra 明顯拉開差距;需要對位精度的插入動作,目前誰都做不到。

三、比完成率更值得看的是 token 用量

表格裡最容易被略過、但其實最有訊息量的一欄是「每次輸出 token」:

  • 方塊進碗:Astra 每次 2.1k,Fable 5.1 是 12.9k、Fable 5 是 19.2k——差了 6 到 9 倍
  • 耗時也跟著差:2.5 分鐘 vs 6.8 分鐘 vs 8.2 分鐘。

報告因此得到「約 2.3 倍便宜、2.4 倍完成率」的結論。對想把模型接進真實工作流程的人來說,這一欄比完成率更實際:同樣一件事,話少的模型不只比較快,帳單也比較短。

四、作者自己承認的四個限制(這段才是重點)

原始報告有一段明列限制,轉貼的人幾乎都沒帶到:

  1. Astra 的試驗是在 Fable 那批做完兩天後才跑的,而且沒有交錯進行。 兩批之間的環境差異無法排除。
  2. 評分是人工評的,而且評分者知道當下跑的是哪一個模型——作者原文寫「scores are open to unconscious bias」,也就是無意識偏誤的空間存在。
  3. 成本用的是牌價(list price)。作者自己補了一句:若有偏差,Astra 的成本反而是被高估的。
  4. 所有模型都只跑 medium reasoning effort(中等推理強度)。 沒有測高強度設定下的表現。

第 1 點和第 2 點在任何一份正式基準測試裡都會被要求改掉(交錯執行、盲評)。作者願意主動寫出來,這份報告的誠實度其實高於多數行銷型評測——但也正因為他寫了,引用它的人就不該把 19/20 當成定案結論。

五、對一般使用者的實際意義

三件事:

  • 這不是 OpenAI 官方的機器人基準。它是第三方在自己的硬體與代理策略下跑出來的結果,不代表官方宣稱的能力範圍。
  • 「機器手臂」不等於你買得到的產品。這裡測的是「模型能不能透過代理策略操控既有手臂」,不是 OpenAI 出了機器人。
  • 真正可以拿來用的是成本與耗時那兩欄。如果你正在評估要不要把工作流程換到新模型,「同一任務輸出 token 少 6 倍」比「完成率 95%」更能換算成你的帳單。

至於 GPT-6 Astra 本身現在誰能用、API 怎麼算錢,我們另外實查過官方模型頁與計價門檻,整理在 GPT-6 Astra 上線:訂閱戶還拿不到,API 超過 272K 直接雙倍計價


本文依據 Robocurve 原始報告(2026-09-04 發布)直讀整理,並對照 Hacker News 討論串熱度,查核日 2026-09-07。本報告為第三方實測、非 OpenAI 官方基準,且作者已自行揭露四項實驗限制,引用時請一併說明。方案與模型價格整理見 ChatGPT 工具頁

阿莫和皮米怎麼看

AMO 阿莫 專挑毛病
問問貓阿莫提醒你,ChatGPT免費版限制不少喔!只能有限度用GPT-5.5 Instant,訊息、上傳、圖像生成都有限額,而且圖像生成還特別慢。深度研究、記憶、上下文這些也都有額度限制,連桌面版都有限制。上下文視窗只有27K,單次輸入大概12頁文字,推理模型更是「視情況而定」,回應速度也說「受系統限制」,可能很慢。官網沒說每天能問幾則,這點要自己注意,別踩雷了。付費方案有些資料也還沒完全確認,像Pro Max這個名字,官網就沒看到,要小心喔。
PIMI 皮米 說優勢
問問貓皮米覺得,ChatGPT超划算啦!免費版人人都能用,每月NT$0,就能體驗AI威力,還能無限存對話紀錄,想退出模型訓練也能選。雖然免費版有些限制,但基本功能都有,對一般問問貓來說很夠用了。如果用量大一點,Go方案每月NT$270,就能加量不加功能,上下文視窗變54K,單次輸入約40頁,速度也快多了。Plus方案NT$690,用量更大,推理模型上下文有256K,更適合進階的問問貓。Pro方案雖然貴,但上下文視窗和單次輸入上限都超高,追求極致效能的你,這CP值絕對有!
所以到底要不要付錢?

如果你只是想試試AI、偶爾用用,免費版就夠了;需要更多用量或速度,才考慮付費方案。

接下來看這些

同一工具的其他實查文

前往官方網站

本頁部分連結為聯盟連結,經由連結購買本站可能獲得分潤,不影響你的價格,也不影響本站的資料與評價。

🐾 3 秒找最划算:回答三題,雙貓直接推薦