单卡RTX 3080 Ti训练小模型通关红色宝可梦

开发者用单张RTX 3080 Ti训练出1250万参数模型,通关《红色宝可梦》。该模型基于LeWorldModel架构,通过压缩状态与无奖励学习机制,在4.2万帧数据上从零开始训练实现自主决策。

开发者在单张 RTX 3080 Ti 上训练小型 AI 模型通关《红色宝可梦》

开发者 stmonty 利用一张 NVIDIA GeForce RTX 3080 Ti 显卡,成功训练出一个能够游玩经典游戏《红色宝可梦》的小型人工智能模型。该项目基于著名 AI 科学家 Yann LeCun 提出的 LeWorldModel 研究架构。LeCun 此前离开 Meta 后,通过 AMI 实验室继续推进世界模型的相关研究。

1250万参数模型通关

据 stmonty 在其博客文章“教导一个玩 Play 的世界模型”中介绍,该模型仅包含约 1250 万个参数,代码于去年 9 月完成编写。stmonty 在讨论论坛中表示,这一项目旨在探索学习与乐趣的结合方式。

技术原理:压缩状态与无奖励学习

该世界模型的核心机制在于观察按键操作对屏幕产生的影响。与传统方法不同,模型并不预测完整的下一帧画面,而是将状态压缩为仅由 192 个数字组成的摘要。这种初始训练阶段采用“无奖励”模式,因为模型尚未识别出游戏的获胜条件。其设计思路遵循了一篇发表于 2026 年 3 月的论文,该论文指出,拥有约 1500 万参数的单个 JEPA(联合嵌入预测架构)模型即可在单一 GPU 上进行有效训练,这与 stmonty 的项目规模相当。

训练过程与数据构成

完整的训练流程使用了来自大木博士实验室存档功能的数据,共计 42,382 帧灰度图像,并进行了超过 1,000 次短程运行。数据集包含预设路线、混合随机按键操作的相同路线以及完全随机的漫游行为。stmonty 强调,引入随机漫游数据至关重要,否则仅在干净路径上训练的模型可能会陷入局部最优解,例如学会在对话框出现时反复按下 A 键,却无法理解 B 键的功能。该模型是从零开始针对此项目专门训练的。

规划策略与测试结果

模型的决策规划通过尝试 14 个按键序列来实现,这些尝试是在模型内部模拟而非直接在游戏中的操作。每一轮生成 512 个计划样本,搜索算法保留其中八分之一,即 64 个候选方案,直至最终计划在模拟器中执行。stmonty 推测,失败的主要原因之一是当玩家没有宝可梦时,基于模型预测的微小误差会随时间复合放大。

经过微调后的下一次尝试取得了成功。在 52 架飞机(注:原文此处语境可能指代某种测试单元或比喻,依原文保留)中,模型选择了启动器,而随机按键的对照组成功率为零。尽管从保存点开始反复按 A 键也能达成类似效果,但项目的核心目标是让模型自主发现解决方案。这一结果虽温和,但证明了小型模型可以根据特定任务进行定制化调整。

未来挑战与开源信息

接下来的目标是从实验室出发,走到教授处,完成对话并真正选择一个宝可梦。开发者表示:“我怀疑难度随着计划长度的增加呈指数级增长。”他在回复中进一步指出,简单扩大当前模型规模可能不足以实现这一目标。

近期已有多个独立案例使用 Jev 决策模型、Ness 带或自定义代码成功击败《红色宝可梦》,显示小型模型对于业余爱好者而言仍具可行性。该项目的代码已在 GitHub 上以 lePokeRed 名称开源,支持 CUDA GPU 运行。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读