本文章由 LLM 参与完成。
不知从什么时候起,我玩 steam 游戏开始追求全成就通关,乃至这个游戏达到全成就的容易程度,也成为我考量是否购入新游戏的重要依据。我第一个做到全成就的游戏是「天下第一」的《女神异闻录5皇家版》,或许因为它太令人沉浸其中而不自觉的想要多探索一些内容;直到我写下这篇文章的时刻,我已经有七个游戏(包括 CS2 和 Wallpaper Engine)完美通关。

我拿这个问题询问 ChatGPT ,它给出的答案是「你对“玩游戏这件事的奖励机制”发生了变化」。简单来说,也就是我的游戏目标发生了变化。以前玩游戏,我更在意的是游戏本身是否有趣,当时我也玩过没有成就的,甚至一百余个成就的小众但优质的游戏,丝毫不关注成就的数量。但现在,游戏逐渐变成了一件需要完成的事情,通关只是一个阶段,最让我产生满足感的,却是那个 100% 的成就进度。
这也是为什么,我现在会把全成就作为购买一款游戏的重要考量。一款游戏如果需要几十上百个小时的重复劳动,或者存在极其苛刻、容易错过的成就,我甚至会在购买之前就开始犹豫。因为在潜意识里,我已经不只是考虑「这款游戏好不好玩」,而是在考虑:
「我能不能把它完整地完成?」
这是一件很奇怪的事情。成就本来只是游戏之外附加的一套奖励系统,却逐渐影响了我对游戏本身的选择,甚至影响了我是否愿意继续玩下去。
奖励(Award)是人工智能领域,尤其是强化学习(Reinforcement Learning, RL)中的重要概念。智能体(Agent)会在环境(Environment)中采取行动,并根据行动获得的奖励不断调整自己的行为。如果某种行为能够带来更高的奖励,那么智能体就更倾向于重复这种行为。在最简单的形式下,可以把一次行动获得的奖励写成:
其中 表示智能体当前所处的状态(State), 表示采取的行动(Action),而 则表示在状态 下采取行动 后得到的奖励。
一个游戏中的玩家可以被粗略地看作 Agent,游戏世界是 Environment。击败 boss、完成任务、获得装备、升级,都可以产生不同程度的 Reward。Agent 并不需要被直接告知「你应该这样玩」,而是通过不断尝试,逐渐学会哪些行为能够带来更高的回报。于是,一款游戏可能同时存在至少两套奖励:
- 游戏内部的 Reward,鼓励我继续探索游戏世界;
- Steam 成就的 Reward,则鼓励我不断提高自己的完成度。
同时成就的 Reward 的权重会变得更高,而「全成就」恰好是其最明确的终点。这就引出了强化学习中的另一个概念:稀疏奖励(Sparse Reward)。稀疏奖励指的是在绝大多数时间步,智能体收到的奖励为 0 或无意义的常数,只有在极少数关键时刻(如任务成功或失败)才收到有意义的奖励。
如果把它类比到 Steam 全成就,我连续玩几个小时,只是在探索、战斗、看剧情。这些事情当然有乐趣,但从成就的 Reward 来看,我可能什么都没有得到。直到悦耳的成就弹出的音乐骤然响起,那一瞬间,游戏给了我一个非常明确的 Reward,尤其是最后一个成就。当 Steam 的成就完成度变为 100% 时,它所带来的满足感远远超过了前面那些零散的成就,因为这意味着我终于抵达了那个明确的终点。于是,100% 本身就成为了奖励。
但问题也恰恰出现在这里。如果奖励真的能够塑造行为,那么当我越来越依赖成就提供的奖励,我是不是也在逐渐改变自己的游戏方式?我开始主动寻找能够快速获得成就的路线,尽量在不被剧透的情况下查看攻略,规划哪些成就应该优先完成,避免错过需要多周目的内容,甚至在购买游戏之前就钻研它的成就列表。
这时候,我又想到了人工智能导论中的另一个概念,那就是启发式搜索(Heuristic Search)。在搜索问题中,我们通常需要从一个初始状态出发,通过不断选择行动,最终抵达目标状态。启发式函数 的作用,就是估计当前节点距离目标还有多远,从而帮助搜索算法更有效率地寻找路径。
最经典的启发式搜索算法之一就是 A* 算法:
这三个函数非常重要:
- :已经付出的成本
- :从现在到目标的预计成本
- :预计走完整条路线的总成本
启发式搜索并非严格计算答案,而是在提供一个经验性的判断,让算法优先探索那些看起来更有希望的路径。而追求全成就的玩家,似乎也在做着类似的事情。初始状态:0% 成就,目标状态:100% 成就。中间则是一系列可以选择的行动:推进主线、探索地图、收集物品、完成支线、挑战高难度、完成隐藏任务……而我会估计剩余成就需要多少时间、哪些成就容易错过、哪些任务可以同时完成,以及怎样安排游玩顺序才能更快达到 100%。
全成就之所以能够吸引我,是因为 100% 被赋予了足够强的 Reward;而一旦我接受了这个目标,我就会开始规划路线、评估成本、寻找捷径。我原本只是想玩一个游戏,却逐渐开始像一个搜索算法一样优化自己的行动。或许这就是为什么我现在越来越在意全成就——我逐渐学会了用一种最大化奖励、最小化成本、寻找最优路径的方式去玩游戏。
如今的人类竟然逐渐变成了 Agent 的模样。或者说,我们从数学搭建起强化学习的模型,根据我们自身完成任务的方式,赋予 Agent 能够像我们一样思考并解决问题的能力。在这个时代,我们已经相当于笨笨的 Agent,相比于日渐更迭的智能体已经是无能为力,一边使用 AI 完成无聊的 task,一边祈祷自己的未来不要被硅基生命取代。我不知道未来的我们会处于如何的境地,但至少,Agent 虽然明白什么是奖励,它也不能体会到当我们历经无数挑战,最后一个奖杯达成时所感受到的心情。

Comments NOTHING