OpenAI GPT-6 Astra自主通关《传送门》 耗时24小时成本571美元
驱动中国9月7日消息,OpenAI旗下新一代大模型GPT-6 Astra近日完成一项颇具挑战性的测试:在不依赖人工提示的情况下,自主通关3D解谜游戏《传送门》。整个通关过程耗时24小时,累计计算成本约571美元。这一结果被视为大模型在复杂空间推理与长时序决策能力上的又一次重要验证。
《传送门》是Valve公司推出的经典第一人称解谜游戏,玩家需要利用传送枪在三维关卡中制造空间通路,通过观察、规划与试错解开层层谜题。相比棋牌或文字类游戏,《传送门》对模型提出了更高要求:既要理解三维物理规则,又要记住前后步骤,还需在漫长探索中保持目标一致性。GPT-6 Astra能够独立完成全流程,说明其在环境交互、目标拆解与自我纠错方面具备了相当水平。
据相关测试记录,GPT-6 Astra并非通过暴力搜索或作弊脚本通关,而是借助视觉输入实时观察游戏画面,经过反复尝试逐步推导出正确解法。24小时的耗时表明,模型在面对困难谜题时会进行长时间“思考”和试错,并非简单套用已有攻略。571美元的成本则反映了大规模计算资源在推理过程中的消耗,这一数字也让外界对大模型落地复杂任务的真实代价有了更直观的认知。
这并非OpenAI首次让模型挑战电子游戏。此前,其研究团队曾用游戏环境锻炼智能体的决策能力,但多数集中在《我的世界》等沙盒或简单规则游戏。此次攻克《传送门》这类强逻辑、弱暗示的解谜游戏,意味着模型不仅能“玩”,还开始在虚拟空间中形成类似人类的物理直觉与因果推理。有分析人士指出,这种能力若迁移到机器人控制、自动化运维或科研实验设计等领域,可能带来更实际的应用价值。
值得注意的是,GPT-6 Astra在测试中展现出的“耐心”与“专注度”同样引人关注。面对反复失败,模型没有出现明显的状态崩溃或目标漂移,而是持续调整策略。这种稳定性对于未来AI系统在真实环境中承担长周期任务至关重要。不过,也有专家提醒,游戏通关成绩虽然亮眼,但虚拟环境与真实世界仍有巨大差距,从“会玩游戏”到“解决实际问题”还需要更稳健的泛化能力。
从行业视角看,OpenAI此次公开测试数据,既是对自身模型能力的展示,也为AI评测提供了新思路。传统基准测试多围绕文本问答或代码生成展开,而《传送门》这样的任务更能反映智能体在动态环境中的综合表现。随着大模型竞争进入深水区,类似“通关复杂游戏”的评测或将成为衡量模型智能水平的新标尺。
截至目前,OpenAI尚未公布GPT-6 Astra的技术细节及正式发布时间,但此番通关《传送门》的消息已引发社区热议。有开发者评论称,如果该模型能在更低成本下复现此成绩,那么距离真正“自主智能体”走进生产环境或许不再遥远。后续是否会有更多游戏或仿真场景的测试结果放出,值得持续关注。