本期立意AI 可以在 Atari、Dota、星际争霸、3D 开放世界里反复“玩游戏”,为什么小朋友玩二十分钟就要停?这一期,赫小妹试图把赛车游戏包装成“人类游戏体验实验”,爸爸则把“AI玩”和“人类玩”拆成两件事:AI不是为了开心通关,而是在规则清楚、反馈快速、成本很低的虚拟世界里练习观察、选择、试错和计划。
节目也把另一条线讲清楚:游戏公司让 AI 当虚拟玩家,不是为了制造一个把玩家打哭的超级怪物,而是为了帮开发者反复测试关卡、找 bug、检查卡死和作弊路线。最后父女俩回到孩子真正关心的问题:可以有“家庭游戏体验观察员时间”,但不能把 AI 研究当成无限玩游戏的通行证。
主播列表本期金句AI玩游戏,很多时候不是娱乐,而是在练习怎么做决定。
游戏像AI的训练场:有规则、有反馈、能重复试错,犯错成本低。
赢了一款游戏,不等于通关智能;要看它厉害在哪里、在什么限制下厉害。
最厉害的AI,不一定是最好玩的游戏AI。
游戏里的AI要服务“好玩”和“公平”,不是只负责把玩家打哭。
本期你将会听到为什么强化学习喜欢游戏这种“选择题连环轰炸”的环境。
Atari 游戏为什么曾经是 AI 从像素和分数中学习的经典测试场。
Dota 2、星际争霸这类复杂游戏,为什么能测试长期规划、不完全信息和团队配合。
为什么 DeepMind SIMA 这类项目不只是为了刷高分,而是研究能在 3D 虚拟世界中听指令行动的智能体。
游戏公司为什么会用虚拟玩家自动化测试关卡、路径、难度和漏洞。
为什么游戏里的敌人不是越聪明越好:玩家需要挑战,也需要公平和机会。
奖励设计为什么很重要:目标写窄了,AI和小孩都可能学会钻空子。
亲子互动问题如果你设计一个游戏,让 AI 来当测试员,你最想让它帮你检查什么?是找 bug、测难度,还是发现一条人类玩家根本想不到的奇怪路线?
也可以和孩子约定一次“家庭游戏体验观察员时间”:玩完以后不只报分数,而是记录三件事:哪里最容易卡住,哪里最让你想继续玩,哪里让你觉得不公平。
配乐Jump Up, Super Star! — Kate Davis(用户提供)
配图DeepMind 从 Atari 画面像素和分数反馈中训练智能体
图:DeepMind / Google Research 相关文章配图。来源:Google Research Blog,许可见源页面。
AlphaStar 把星际争霸 II 用作复杂决策与多智能体学习测试场
图:AlphaStar 相关资料图。来源:Google DeepMind Blog,许可见源页面。
SIMA 在 3D 虚拟世界中按照自然语言指令行动
图:SIMA 相关资料图。来源:Google DeepMind Blog,许可见源页面。
Unity 介绍用虚拟玩家自动化 playtest
图:虚拟玩家自动化 playtest。来源:Unity Blog,许可见源页面。
Unity ML-Agents:游戏和仿真可作为训练智能体的环境
图:Unity ML-Agents 学习环境示意。来源:Unity ML-Agents 文档,许可见源页面。
参考资料DeepMind / Nature:Human-level control through deep reinforcement learning,2015。
Google Research Blog:From Pixels to Actions: Human-level control through Deep Reinforcement Learning。
OpenAI:OpenAI Five defeats Dota 2 world champions。
Google DeepMind:AlphaStar: Grandmaster level in StarCraft II using multi-agent reinforcement learning。
Google DeepMind:A generalist AI agent for 3D virtual environments / SIMA。
Unity ML-Agents Toolkit documentation:games and simulations as environments for training intelligent agents。
Unity Blog:Automate your playtesting: Create virtual players for game simulation。
在小宇宙查看该单集文稿