开悟初赛为1v1模式
别觉得这些都是空中楼阁,事实上,通过游戏来锻炼AI,早就不是第一次了。还记得当年打败李世石的阿尔法狗吗?它就是早期游戏AI的雏形,而谷歌的阿尔法团队在当时其实也针对《星际争霸》开发了另一个深度学习AI: 阿尔法星。并在19年年初和世界知名的星际选手对上过一次,结果和围棋相同,人类基本毫无反抗之力,1-10落败。
到了年底,阿尔法星交出的最新成绩单是:超越99.8%的人类玩家,在神族、人族和虫族都达到宗师级别。要知道,《星际争霸》作为最有挑战的即时战略游戏之一,游戏中不仅需要协调短期和长期目标,还要应对意外情况,难度不是一般的大。而阿尔法星在其APM,视野都跟人类玩家保持一致的情况下,依旧实现了对神族、人族、虫族的完全驾驭,还解锁了许多地图。
阿尔法星的“成绩单”
而2017年由OpenAI“修炼”的智能体,则单挑苦练了半辈子Dota的人类玩家Dendi,并获得了胜利。OpenAI也没有停下研究的脚步,他们在次年将这个智能体升级为OpenAI Five,以5V5模式对战人类顶级阵容,结果又是以100%胜率大胜人类。
回到《王者荣耀》身上来,如果你对去年五月份还有印象,一定还记得那个让无数人哭天喊地的超强AI“绝悟”,它由腾讯AILab联合王者荣耀团队于2017年12月起研发,其1v1版本首次露面是在2018年的KPL秋季总决赛上,并在次年八月份于吉隆坡举办的王者荣耀“世界冠军杯”半决赛的特设环境中与职业选手的5V5对抗游戏当中获得胜利,之后在同年的上海ChinaJoy现场,“绝悟”也开放了和业余选手1V1竞争的体验测试,四天一共进行了2100场对抗,最终取得了99.8%的胜率。
而“开悟”大赛,就是科学家们在《王者荣耀》这个特定的环境中,对多智能体之间的博弈展开研究,属于 强化学习领域范畴。难点之一,就在于智能体的每一个决策与动作,都会对全局产生非常复杂的变化,例如走位、出装策略等等,这些都对合作与竞争,以及完成特定任务背后的算法,提出了高难度的要求。
会连招的AI
那在游戏里研究AI,对我们有什么意义呢?有,而且意义重大,《王者荣耀》这类实时战略MOBA游戏不同于传统棋盘游戏和雅达利游戏,前者需要更高难度的复杂操作,所处的游戏环境也会更加复杂。以《王者荣耀》为例,一局游戏当中可能会涉及10^600 种游戏可能性以及10^18000 中可能的游戏操作,并且这还只是基础,AI还需要在MOBA游戏当中发动GANK、防御、诱导对手、补刀等复杂动作,而且还可能涉及到复杂的技能连招。
上文说过,在《王者荣耀》里研究AI,属于强化学习的范畴,某种意义上讲,强化学习算法越复杂,就越具备解决复杂问题的通用智能,为了让AI的算法更复杂,就需要一个特定的复杂场景,才能更好的贴近真实世界中人类决策时面对的环境,而实时战略游戏,就是一个很好的选择。
AI算法学会了“打游戏”之后,便拥有了向现实生活靠拢,解决更多问题的基础,有助于打通教育、研究与产业落地之间的通路,让AI为医疗、工业、农业、交通等现实场景中的AI落地提供助力。拿近年来大火的自动驾驶来说,在面临突发、不确定性问题时,需要作出精准的决策才能避免意外的发生,这就离不开通过强化学习方法的大量训练,如果把这个场景搬到游戏里,让AI具备了这样的能力,再回馈到自动驾驶技术上,是不是就更有价值了?
游戏中训练AI有望推动产业发展
AI一路走来,不断超越人类,也在不断制造游戏中及AI算法的里程碑。也许,我们是应该重新看待一下游戏的价值了。返回搜狐,查看更多