让大模型直接接管整个游戏世界,看起来是最省事的方案。大发娱乐官网偏偏没有这样做,原因不在于模型不够聪明,而在于有些事情必须算得对、算得一样。

先算一笔账,但这只是最浅的理由

设想一座有8万名AI居民的城市(模拟示例,仅用来演示逻辑)。如果让大模型接管居民行为,哪怕每人每小时只决策一次,一天就是80000乘以24,即192万次调用。再乘上商业、体育、战略几个域,光是调用成本,任何一台手机或者一个服务器集群都扛不住。

但成本是最不值得深挖的理由。因为成本问题可以靠更快的模型、更便宜的推理去缓解,而接下来几个问题,模型再快再便宜也解决不了。它们来自大模型的工作方式本身:擅长在模糊的情境里给出一个说得通的判断,不擅长在精确的约束里保持每个数字对得上。

失败一:账对不上

假设让模型直接“运行”一家杂货店。它写道:“老板今天补货500单位,货架恢复充足。”这句话读起来毫无问题,但世界里有三本账需要同时变化:供应商的库存要减少500,杂货店的库存要增加500,老板的现金要减少对应的货款。如果这三步由模型分别叙述,任何一步漏写、写成498或者写成两次,世界总量就凭空多出一块或少了一块。

短时间内没人会发现。跑上几十周以后,物价曲线开始出现说不清的漂移,玩家去查,却找不到一个具体的错误位置,因为每一步单独看都“合理”。这类问题在模拟里叫守恒被破坏。传统的模拟器天生擅长守恒,因为它的每次转移都是一次带来源和去向的加减法。大模型不是不能做加减法,而是没有任何机制强迫它每次都做对,更没有机制在它做错时报警。

失败二:同一天跑两遍,结果不一样

存档、回放、排错、多人同步,这几件事都依赖一个前提:给定同一份世界状态和同一批指令,第二次运行得到同样的结果。模拟器可以用固定的随机种子做到这一点。大模型即使把温度调到很低,也会因为模型版本更新、服务端批处理的顺序差异等原因,在不同时间给出不同的文本。

这意味着玩家读档以后,昨天发生过的事今天可能变了样;也意味着当玩家反馈“这里有个奇怪的结果”,开发者无法重现。更尴尬的是,如果两个玩家在多人世界里看到同一座城市,两边模型各自给出不同的判断,世界就分叉了。所以决定“世界状态是什么”的那部分,必须交给可复现的确定性逻辑,而不是一次性的生成结果。

失败三:战略里,分不清聪明和作弊

战略游戏里,AI的信息边界就是公平的边界。一个敌方指挥官应当只知道自己侦察到的东西。可如果让大模型接管战略AI,最省事的做法是把整份世界状态塞进提示词,这就等于让它读取了战争迷雾。即使不塞全局状态,模型也可能从玩家最近几步的行动里推断出“玩家一定在这里部署了兵力”,而这种推断到底属于合理的适应还是隐性作弊,很难说清。

另一个问题是模型对措辞过于敏感。Max Lamparth 等人在2024年的 arXiv 研究中,让214名国家安全专家参与美中危机推演,并与由大语言模型模拟的团队作对比,发现模型团队更具攻击性,行为强烈受场景措辞影响;即使设定“和平主义者”或“侵略性反社会者”这类极端人格,表现也没有显著区别。这个结论只适用于他们测试的模型和场景,但它提醒我们:一个被措辞牵着走的决策者,无法被当作稳定的对手。战略游戏需要的是同样的局面给出一致的、可预期的反应,而不是每次描述稍有不同就走向另一条路。

失败四:看起来合理,不等于和现实相符

城市模拟里的居民日程读起来自然:早上通勤,中午吃饭,晚上回家。但“读起来自然”和“与真实规律吻合”是两回事。Gustavo H. Santos 等人在2026年的 arXiv 论文里,用大巴黎和上海的真实移动数据去检验 AgentSociety 与 CitySim 两个基于大模型的城市模拟器,比较了出行距离分布、停留时间、起终点流量等指标,结论是叙事上合理,但与真实移动规律存在显著差距,而且行为多样性对提示词配置不稳定。

对一个游戏来说,这个差距不一定是缺陷,游戏不必与现实一一对应。但前提是设计者知道差距在哪里,并且能够调整。如果世界的核心状态完全是模型生成的文本,就无从校准:没有一个数值可以被拿去和目标分布比较,也没有一个参数可以被调整。世界怎样发现自己跑偏、又怎样被拉回来,AI模拟世界的验证和校准一文有专门的讨论;这里只强调一点:能校准的前提,是状态存放在模拟器的数值里,而不是存放在一段段生成的文字里。

存档里存什么,决定了世界能不能复现

失败二的解法,藏在存档的内容里。大发娱乐的存档保存的是模拟器的状态和一份已通过的提案日志,而不是模型生成的那些散文。回放一段历史时,系统不会重新去问模型“当时你怎么想的”,而是直接按日志把当时通过的提案重新执行一遍,因此每次回放的结果一致。

这样一来,模型的输出即使有随机性,也只会影响“下一个提案是什么”,不会影响“已经发生的事是什么”。过去被日志固定住,未来才允许有变化。多人世界的同步也是同样的道理:各端交换的是通过校验的提案,而不是各自模型的判断。

大发娱乐的做法:模型只能交“提案单”

把四种失败放在一起,会发现它们指向同一个原则:世界状态不能由大模型直接写入。大发娱乐的设计里,大模型的位置是提案者。它读取一份经过裁剪的世界摘要,只能产出一张结构化的提案单,格式固定,由模拟器逐项检查后决定是否执行。

提案字段 示例内容(模拟示例)谁来校验校验不通过时
意图 把仓库补给向前线调运 模拟器检查该行动是否合法 拒绝并说明原因
作用对象第三补给站、第二师 检查对象是否存在、是否归己方 拒绝
资源请求 调运补给300单位 检查库存、运力、路程耗时 按可用量削减或退回
信息来源 侦察报告第12条 检查该信息己方是否真的已知 拒绝,防止读取迷雾
理由摘要 预计三天后前线补给告急不参与判定,仅入日志

这张表里有两个值得强调的设计。其一,“信息来源”这一栏让战争迷雾不再依赖模型的自觉:模型引用了自己不该知道的东西,提案就被否决。其二,“理由摘要”不参与判定。模型可以把话说得再漂亮,也不能靠文字说服模拟器;能不能执行,只看数字和规则。

提案被拒绝后,原因会作为反馈退回给模型,让它调整后再提一次,最多两次。两次仍不通过,就使用规则代码给出的保底行为。这样即使模型偶尔出错,世界也不会因此停摆或崩坏。

这套分工在混合游戏AI的设计说明中还有更细的展开。在大发娱乐AI大模型这一层,模型本身可以被替换、升级,而世界状态和规则不受影响,因为两者之间隔着一份固定的提案接口。

让模型多做一点,但要给每一处划边界

说不让模型控制整个世界,并不是说不让它做事。有三个位置,模型确实比规则代码更合适。

  • 长期计划。战略回合里的多步规划,比如“三个回合内先稳住补给线,再推进”,规则代码写起来繁琐,模型可以给出候选,模拟器再逐步验证可执行性。
  • 罕见情境。大部分居民、球员、店主的日常决策由规则处理,只有当规则给不出合理答案时才升级到模型。哪些事件会触发升级,见模拟游戏为什么不能给每个NPC每秒调用一次大模型
  • 叙事与解释。把一串数字变化说成玩家看得懂的话。这里模型只改写,不产生新的数字。

每一处都要配三样东西:调用频率上限,一天最多几次;预算,占整体算力的比例;降级方案,模型不可用或超时的时候,规则代码接手。没有这三样,模型就会悄悄长成一个新的瓶颈。多Agent规模变大后,这些边界如何影响吞吐,吞吐会先被这些边界限制,而不是被模型本身的速度限制。

什么时候可以放权更多?一个可操作的判断是看错误的代价。叙事文字写偏了,玩家读到一句别扭的话,代价很小,可以放手;战略计划提偏了,被模拟器否决,代价是多花一次调用,也可以接受;而涉及账目、库存、合同、位置这类数据的写入,一旦出错就会污染后续所有推算,必须始终留在模拟器手里。大发娱乐官网所说的“混合”,本质上就是按错误代价给权限分级。

模型是顾问,账本要有别人保管

一个团队里,最会出主意的人往往不是最适合保管账本的人。大模型在游戏里也是这样:它可以提议、解释、想象,却不该拥有直接修改世界状态的权力。一份提案单被模拟器拒绝时,玩家看到的不是崩坏,而是一条“这个想法行不通,因为补给不够”的反馈,这才是模拟游戏应有的体验:世界有自己的规矩,连最聪明的角色也得守。