决策模型Jev一周通关宝可梦红

决策模型Jev一周内通关《宝可梦红》。该模型由ClaudeOpus5辅助调整选项,历经474次迭代修正循环错误,最终击败冠军进入游戏名人堂。

决策模型 Jev 在一周内通关《宝可梦 红》

据开发者项目页面披露,TypeSafe AI 推出的决策模型 Jev 于 2026 年 9 月 23 日成功击败《宝可梦 红》中的精英四队及冠军,正式进入游戏名人堂。整个通关过程耗时不到一周。

Jev耗时不到一周通关

与需要数周甚至数月才能完成游戏的传统聊天机器人不同,Jev 的核心机制是从预设选项列表中进行选择。尽管具备自主决策能力,但 Jev 并非完全独立运行:Anthropic 的 Claude Opus 5 作为“教练”角色介入,实时监控游戏日志并动态调整选项及其措辞,以辅助 Jev 进行游戏。

Jev 的技术架构与协作模式

Jev 是一款近期发布的决策模型,其特点是返回带有置信度数字的解决方案。它既不是聊天机器人,也不是法学学士(LLM)。在游戏中,Jev 基于事实列出选项,并根据概率选择最优解,不涉及屏幕读取或文字图像生成。

标准代理公司(Standard Agents Inc.)创始人安德鲁·博伊德 (Andrew Boyd) 最初在 X 平台上宣布该项目,并预测胜利将在一周内实现。游戏通过浏览器或终端直播,观众可通过 Jev 的聊天界面参与互动。

让我们走!杰夫玩的是波克蒙。或在你的终端运行 `npx jev-plays-pokemon`跟随 (与聊天!) 在一个 TUI.需要 Github oAuth 进行聊天。杰夫是播放者和聊天主持人。2026 年 9 月 17 日

当 Jev 陷入困境时,Claude Opus 5 会通过修改可用选项和数据来提供协助。这种依赖关系凸显了专用决策模型的优势与局限。

迭代优化与社区参与

项目页面的变更日志记录了 474 条条目,主要包含游戏失败日志及对应的策略调整。例如,Jev 曾出现“走进洛雷莱的封闭入口 53 次”、“在 10 分钟内穿过一个岩石道梯子 124 次”等错误行为。此外,Jev 曾在击败所有四名精英教练后输给冠军阿拉卡扎姆,被迫重新挑战全部精英队,最终在当天晚些时候击败冠军。

为了平衡准确性与成本,开发团队对 Claude Opus 进行了调优。利用 TypeSafe 模型的笔记,发送给 Jev 的文本量减少了约三分之二,并采用单词而非数字表示。针对 Jev 陷入循环的问题,请求频率从每秒一次调整为每六秒一次。人类观众也参与其中,他们在聊天中发送的建议被用于改进 Jev 的选择列表。

其他实验案例对比

Frigade 的克里斯蒂安·马蒂森 (Christian Mathiesen) 展示了另一种基于 Jev 的方法。根据 README 文档,该方案允许 Jev 读取游戏内存以列出合法选项,但禁止写入内存。马蒂森指出,其首个版本允许 Jev 直接选择按“A”,导致游戏从未离开过托盘城。他估计该方法的成本约为每 24 小时 1.70 美元。

另一项由开发者 stmonty 进行的《宝可梦 红》实验采用了完全不同的路径。stmonty 在一张 RTX 3080 Ti 显卡上,利用超过 42,000 帧的游戏画面训练了一个小型世界模型。博客文章显示,从大木博士实验室存档开始,该模型在 100 次尝试中有 52 次成功选择了初始宝可梦。与 Jev 的实验相比,stmonty 的模型接收的目标和辅助信息更少,必须仅通过截图学习每个输入的作用。

行业反响与总结

据 LangChain 介绍,自 9 月份推出以来,Jev 获得了相当大的响应,10 天内有多个开发者参与了游戏测试。这一成功表明,与专业模型的合作可以有意义地改善问题解决能力。

正如此前报道所述,开放式任务更适合 LLM,而结构化决策任务则适合专用模型。相比之下,使用 Anthropic 的 Claude Plays Pokémon 流(当时运行 Opus 4.5)至今仍未完成《宝可梦 红》的通关,而 Jev 的开发团队已率先取得突破。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读