全球数字财富领导者

Decision Is All You Need ! 世纪华通冲进决策大模型新赛道

2026-09-24 13:53:20
金融界
金融界
关注
0
0
获赞
粉丝
喜欢 0 0收藏举报
— 分享 —
摘要:近日,由前OpenAI研究员Diogo Almeida创建的TypeSafe AI发布了决策模型Jev。它不聊天、不生成文字,只在给定选项里输出概率,官方称在这类任务上比现有大模型快两个数量级。寥寥几天,Jev刷屏全球AI圈。热度背后,一个判断正在浮出水面:大模型的竞赛,上半场解决的是“会说

近日,由前OpenAI研究员Diogo Almeida创建的TypeSafe AI发布了决策模型Jev。它不聊天、不生成文字,只在给定选项里输出概率,官方称在这类任务上比现有大模型快两个数量级。寥寥几天,Jev刷屏全球AI圈。热度背后,一个判断正在浮出水面:大模型的竞赛,上半场解决的是“会说话”,下半场要比的是“会做事、能执行、懂决策”。

热闹不只属于AI圈。就在海外Jev引爆讨论的同时,国内已经有一条新的技术路线,从产业土壤里自己长了出来。世纪华通旗下子公司天游软件联合查比曰(上海)信息科技有限公司,已经自研出一套决策模型,并在多款游戏中完成闭环验证——该模型不仅通关了《2048》游戏,还在《神庙逃亡》游戏中持续创造新的纪录,目前已超过70000米,而且模型单次决策延迟压缩到毫秒级,参数量控制在50M以内。

当前在AI大模型领域,多数玩家都在从通用生成大模型切入,先解决对话与图文生成,再向下寻找落地场景。而世纪华通以游戏业务为原点向上攻坚,直接瞄准行为决策模型。“做决策模型不是纯AI公司的专利。”天游软件CEO纪敏说道。在他看来,游戏公司做AI,起点不是模型,而是业务。

过去两年,国内大模型赛道百花齐放,不少企业集中资源攻坚通用生成模型,但行业也逐步暴露出一些结构性矛盾。手握算法底座的模型公司,缺少真实、高频、强反馈的业务场景;手握海量场景与真实用户行为数据的产业公司,大多停留在调用第三方模型做应用,很少下场自研底层模型。模型公司向下找场景,场景公司向上做模型,两条路正在交汇,双方看中的是同一种稀缺资源:真实应用数据的反哺。

世纪华通董事长王佶对此早有预判。他认为AI已经告别了单纯的技术突围阶段,正式迈入应用重构时代,游戏不仅是游戏,而是前沿科技的练兵场,且有望成为AI时代第一大应用。这一判断,也是天游AI团队持续投入底层模型研发的源动力。依托集团二十余年游戏行业的业务和数据沉淀,以及在算力基础设施上的长期布局,为底层模型的预训练打下了坚实硬件基础。因而这条路,不是跟风、追热点做出来的,而是从真实业务的痛点里长出来的。

作为世纪华通游戏板块重要子公司,天游软件运营《街头篮球》IP逾20年,已是国内运动竞技类游戏第一品牌。但在玩家看不见的后台,研发团队长期尝试用AI赋能游戏全链路运营,在大量测试中摸到了通用生成模型的天花板。即便0.5B规模的小参数模型,依然跟不上游戏高速博弈的节奏。而其根源在于生成式模型的固有链路,必须先理解语言,再组织语言,最后转化输出动作,这套“翻译链路”带来不可消除的推理延迟。

这一次,团队的取舍很干脆,砍掉冗余的文本生成能力,把全部参数聚焦决策本身,并提出“Decision Is All You Need”理念。模型不再输入文字、输出文字,而是直接输入环境状态、输出动作决策概率。不为文字表达预留参数开销,模型规模大幅压缩,换来毫秒级推理和更低的算力消耗。

纪敏打过一个比方,主流通用大模型更像人类深度思考的大脑,接收信息后需要完整的推理规划,再输出结果;而公司自研的这套决策模型,能够把大量决策规律内化到模型中,根据当前状态快速给出下一步动作,这样更接近人的小脑与反射系统,把千万次训练沉淀为肌肉记忆,面对复杂环境缩短整条决策链路,从而实现极速响应与持续闭环行动。

海外爆火的Jev,是AI企业从算法侧出发的技术产物;天游软件的这套模型,则源自游戏业务的真实痛点。二者虽然起点完全不同,却奔向同一个方向。“路线不一样,方向是一样的,”纪敏说:“Jev的走红,也为行业讲清楚了一件事,AI不一定非要会聊天,直接做判断、输出动作,同样是一条价值巨大的路线。”

目前,这套模型的能力已经在游戏环境里得到了实打实的验证。团队将游戏局面、历史动作、对手行为、资源状态、长期目标统一编码为状态向量,训练模型学习不同局面下的选择逻辑。更特别的一点是,团队引入了海量真人玩家行为的数据来参与训练,模型不只学习理论上的最优解,更学习真实玩家的行为分布。同一个局面,不同水平、不同风格的玩家会做出不同选择,模型学会的是复刻真实人类的决策概率。

能力的迁移也在加速。在部分策略类游戏中,模型已经拿到正向业务数据反馈;动作类、竞技类游戏的验证工作正在推进,工程化落地持续加速。

更重要的是,这套决策模型的用途不止于操控游戏内角色。依托同一套预训练底座,模型可以接收游戏实时运营数据,对留存、LTV等核心指标做预判,辅助运营人员制定策略。同一套底座,既能做游戏内智能体的行为决策,也能承担游戏业务的经营决策。

当然,要实现模型从零自研,背后是三个缺一不可的条件。第一,从零预训练的能力,这套模型没有基于任何开源基模微调;第二,海量真实的对局与玩家行为数据;第三,可持续迭代的真实落地场景。天游软件背靠母公司世纪华通扎根多年的游戏业务,恰好同时具备这三项基础,这也是很多通用大模型厂商难以复制的壁垒。

“虽是业务型公司,但世纪华通也在扎扎实实地围绕其业务做更基础的研究。”纪敏说。在他看来,游戏企业手握真实场景与海量真实数据,而大模型迭代恰恰极度依赖真实业务数据的反哺,模型公司与产业公司的边界正在变得模糊,这也是团队持续加码决策模型的原因。

游戏环境对错误容忍度相对更高,但这不代表可以随意试错。纪敏特别提到,所有上线前都经过大规模反复测试,审慎推进落地。“决策模型可能会成为游戏AI的一个独立技术方向。”纪敏判断,未来的游戏AI体系里,负责对话的、负责内容生成的、负责判断与行动的模型,将各司其职、分工协作。对比当下行业扎堆的通用生成大模型,决策模型瞄准“行为执行”这一更硬核的未来。

对天游软件和其母公司世纪华通而言,这场底层大模型的突围,不是追逐一时的热点,也不会止步于一次前沿技术的发布。下一步,团队会持续打磨这套决策模型底座,把它带进更多游戏产品,同时探索游戏之外的产业决策场景。或许未来,当行业还在比拼聊天、生成能力的时候,欲穷千里目的世纪华通的决策模型,又会更上一层楼。

敬告读者:本文为转载发布,不代表本网站赞同其观点和对其真实性负责。FX168财经仅提供信息发布平台,文章或有细微删改。
go