新智元"因果AI与世界模型"文章系统性学习与深度洞察分析报告#
本报告基于新智元微信公众号发布的文章进行系统性学习与深度洞察分析,分为"学习笔记"(技术内容理解)与"洞察总结"(行业趋势与战略洞察)两个层次。
第一部分:学习笔记(技术内容理解)#
1. 文章基本信息#
项目 |
内容 |
|---|---|
文章标题 |
世界模型成为AI核心战场,底层密码"因果"终于藏不住了(依正文内容概括) |
发布方 |
新智元(微信公众号,国内知名AI媒体) |
所属栏目 |
ASI启示录 |
文章URL |
https://mp.weixin.qq.com/s/stcgM_ps00Pr6gKOq0g5Pw |
文章主题 |
2026年世界模型成为AI核心战场,底层密码是"因果";零犀科技六年押注因果AI的探索与技术架构 |
核心对象 |
零犀科技(2018年创立于北京)、因果大模型、社会行为系统世界模型 |
理论源头 |
Judea Pearl(图灵奖得主、贝叶斯网络之父)的三级因果阶梯 |
2. 核心主题与范式转变概述#
文章围绕一个核心命题展开:下一代商业AI是因果科学驱动的,从"相关性"走向"因果性"是AI行业的分水岭。
范式转变的核心逻辑可概括为以下递进链条:
行业现状的反思:过去三年AI圈的信仰是"更大的LLM=AGI",但切入真实商业场景后致命短板暴露——AI算得出用户"说了什么",却不懂用户"为何开口"。底层逻辑仅有四个字:统计相关。
世界模型的兴起:行业共识从"把模型做得更大、把数据喂得更多"转向"让AI真正理解真实物理世界"。AI需要从"预测下一个词"走向"预测下一种状态",从"生成一个答案"走向"判断一个行动可能带来的后果"。
因果是底层密码:世界模型真正要解决的不只是把画面生成得多逼真,而是必须能回答"如果我这样做,世界会怎样"——而"预测后果"恰恰就是因果的内核。
范式跃迁:从"看见什么、生成什么"走向"如何干预、如何预测行动后果",AI必须理解"为什么",才能预测"行动的后果"。
3. 信息结构与逻辑框架分析#
3.1 文章七个主要部分划分#
文章采用经典的"行业背景→理论溯源→公司案例→理念创新→技术详解→业务落地→总结升华"递进结构:
序号 |
部分名称 |
对应原文标题线索 |
核心内容 |
|---|---|---|---|
① |
世界模型热潮引入 |
"都2026了,全世界才为「因果」上头" |
介绍李飞飞World Labs、LeCun AMI Labs、谷歌Genie 3等集体押注世界模型的行业背景,引出"AI下一步不能只靠更大模型"的共识 |
② |
因果理论溯源 |
(承上启下段落) |
溯源至Judea Pearl的因果科学,介绍三级因果阶梯(观察、干预、反事实),论证"预测后果"是因果的内核 |
③ |
零犀六年押注 |
"有人已押注了六年" |
介绍零犀科技2018创立、2020押注因果AI、2022 WAIC论坛、2024核心专利、2025网信办备案的发展历程 |
④ |
社会行为系统世界模型 |
"世界模型,不止物理世界" |
提出社会行为系统世界模型理念,与物理世界模型对比,阐述底层共性与对象差异 |
⑤ |
因果大模型技术详解 |
"把「社会行为世界模型」,装进 LLM 里" + "三层架构:把因果闭环变成工程系统" |
系统阐述三步推演链、Pearl三级阶梯工程化落地、三层架构、八种干预载体、七项验证机制 |
⑥ |
业务落地 |
"跑通一个闭环,价值兑现了" |
介绍Agentic Sales多智能体体系,将因果大模型能力嵌入业务持续运转 |
⑦ |
总结升华 |
"下一代商业AI,是因果科学驱动的" |
回应开篇问题,点明从"相关性"走向"因果性"的范式转变,升华零犀六年赌注被行业验证的主题 |
3.2 作者论证思路与逻辑递进#
文章采用**"问题驱动→理论溯源→案例佐证→技术展开→价值兑现→认知升华"**的论证链条:
问题驱动:以世界模型热潮为切入点,提出"什么叫理解世界"的根本问题
理论溯源:将答案追溯到Judea Pearl的因果科学,建立理论权威性
案例佐证:引入零犀科技六年押注的真实案例,证明因果AI不是空谈
理念创新:提出"社会行为系统世界模型"的广义世界模型路线
技术展开:从三步推演链到三层架构,层层递进地展开技术细节
价值兑现:以Agentic Sales证明技术能落地为业务结果
认知升华:回到范式转变的宏大命题,完成"六年赌注被验证"的叙事闭环
3.3 写作手法分析#
行业热潮引入:以李飞飞、LeCun等权威人物的动向开场,建立话题的紧迫性与权威性
权威理论背书:引用Judea Pearl的图灵奖身份与三级因果阶梯,为因果AI建立理论正统性
对比叙事:物理世界模型 vs 社会行为系统世界模型的对比,凸显零犀的独特定位
技术分层阐述:从三步推演链到三级阶梯到三层架构,由浅入深、层次分明
价值升华:以"六年赌注被行业验证"完成叙事闭环,强化"前瞻判断"的叙事张力
悬念与揭示:"一家中国公司,早已在这条人迹罕至的路上,默默跋涉了六年"——先制造悬念再揭示零犀
3.4 核心论点#
文章的核心论点可提炼为:
下一代商业AI是因果科学驱动的。从"相关性"走向"因果性"是AI行业的分水岭;世界模型的底层密码是"因果";零犀科技六年押注因果AI的路线,正在被2026年行业的集体觉醒反复验证。
4. 零犀科技发展脉络#
4.1 关键里程碑时间线#
时间 |
里程碑事件 |
战略意义 |
|---|---|---|
2018年 |
零犀科技创立于北京,核心团队脱胎于原百度人工智能团队 |
国内最早一批探索大语言模型技术的先驱;团队具备AI领域十余年深厚积淀,为后续因果AI路线奠定技术基础 |
2020年 |
团队踏上因果AI赛道 |
在大模型尚未成为行业热点时,做出"押注因果AI"的战略判断;这是后续所有动作的起点,体现了对AI演进方向的超前认知 |
2022年 |
在WAIC(世界人工智能大会)联合中国通信工业协会人工智能专委会主办"下一代可信AI——认知兴起,因果探路"主题论坛 |
将全球因果AI顶尖专家(Judea Pearl、周晓华、刘礼、吴忠泽)聚在同一桌;在"大模型"都还是新词的年份,已在讨论"AI如何走向可信、可解释";建立了因果AI的学术与行业话语权 |
2024年 |
完成"因果AI与大模型融合"的核心专利申请,并启动国际布局 |
在最讲究"谁先谁后"的专利领域,成为第一家将因果AI与大模型技术进行系统性结合的公司;通过专利布局构建技术护城河 |
2025年底 |
网信办备案名单中,零犀大模型官方名字为"因果"大模型 |
获得官方认可;敢于将前沿技术范式直接作为大模型官方备案名,体现技术路线的纯粹性与战略定力 |
4.2 发展脉络的战略价值分析#
零犀的发展脉络呈现出**"超前判断→学术布道→专利卡位→官方背书"**的战略递进逻辑:
超前判断(2020):在行业热衷于LLM规模扩展时,识别到"统计相关"的天花板,押注因果AI——这是战略眼光的体现
学术布道(2022):通过WAIC论坛聚集全球因果AI顶尖专家,建立思想领导力与学术网络——这是话语权的构建
专利卡位(2024):在因果AI与大模型融合的关键技术节点完成专利申请——这是技术护城河的构建
官方背书(2025):网信办备案"因果"大模型——这是合规性与官方认可的双重背书
这条脉络的核心特征是**"在无人区潜伏,在主战场兑现"**——每一步都踩在行业认知演进的前面,从"太超前"到"步步踩点"的转化,体现的是判断被时间验证的过程。
5. 因果大模型技术详解#
5.1 三步推演链(因→干预→果)#
零犀因果大模型的核心推演框架,试图建模的不只是表层关联,而是现象背后的生成机制、作用路径与干预效应。这条链可拆成三步:
步骤 |
名称 |
功能描述 |
设计目标 |
|---|---|---|---|
第一步 |
因 |
从对话、语音、图像、用户状态、历史行为和上下文中抽取信息,识别真实意图、关键约束与潜在风险 |
回答"为什么会产生某种意图",识别影响结果的关键变量 |
第二步 |
干预 |
基于变量关系,生成可能改变结果的行动策略(如进一步探询、澄清误解、降低不确定性、调整表达路径、补充关键信息、推进下一步动作) |
不只是预测结果,而是主动生成可能改变结果的策略 |
第三步 |
果 |
将策略落地为具体回复、任务动作或执行方案,并经过事实校验、规则约束、合规审查与多候选重排 |
输出更稳妥的结果,确保结果可追溯、可校验 |
设计哲学:通用大模型擅长基于上下文生成"下一句合适的话",而零犀的因果大模型进一步追问——为什么应该这样回应、这种回应会带来什么变化、有没有更优的行动路径。核心差异在于从"模仿专家"转向"沉淀专家判断中可拆解、可评估、可迭代的部分"。
5.2 Pearl三级因果阶梯工程化落地#
Judea Pearl将因果能力拆成著名的三级阶梯——观察(看到什么)、干预(做了会怎样)、反事实(如果当时不这样会怎样)。零犀因果大模型的能力体系正是沿着这三级构建:
阶梯层级 |
Pearl原义 |
零犀工程化落地 |
能力跃迁 |
|---|---|---|---|
L1 关联 |
观察:看到什么 |
基于行业知识图谱,识别业务变量之间真正的关键影响因素,建立因果链路 |
从"识别现象"升级为"理解原因" |
L2 干预 |
干预:做了会怎样 |
不止于预测结果,而是基于因果判断动态生成策略,主动干预业务过程(需求挖掘、异议处理、路径优化) |
从"预测结果"升级为"影响结果" |
L3 反事实 |
反事实:如果当时不这样会怎样 |
在真实结果反馈后复盘"如果当时换一种打法,会不会更好",用反事实推演持续自我优化 |
从"接受结果"升级为"持续优化" |
关键洞察:今天的通用大模型并非完全不具备因果推理能力,但其核心训练范式仍建立在对海量观察数据的统计学习之上。它们可以在语言层面描述"为什么",却很难在复杂业务场景中稳定、可验证地回答"做了会怎样"以及"如果当时换一种做法会怎样"。零犀的工程化正是补齐这两级能力的缺失。
5.3 三层架构详解#
零犀将L1到L3的能力组织成一个闭环:轨迹记录 → 因果归因 → 候选干预 → 结果验证 → 选择提交/回滚。这套工程架构可拆成三层:
底层:轨迹与证据——回答"发生了什么"#
核心任务:记录完整轨迹,包括用户状态、上下文信息、交互过程、模型动作、工具调用、约束命中、输出结果和反馈信号
设计目标:不是"让AI永远不幻觉",而是让AI的关键判断有证据、有来源、有过程记录;留下可复盘的状态链(输入状态→系统动作→动作结果)
对应Pearl阶梯:第一层"观察"
工程价值:为下一层"归因"做准备——只有先知道"发生了什么",才可能判断哪些变量真正影响了结果
中层:因果归因与候选干预——回答"为什么发生"#
核心任务:将任务轨迹转化为证据,对证据做归因分析(结果贡献最大的因素、造成风险的步骤、值得保留的决策节点等),随后生成候选干预
归因本质:不是简单打分,而是把结果拆回到原因链上——任务成功是因为识别对了真实意图,还是策略路径更合理?任务失败是因为信息不足,还是判断错了关键变量?
干预边界:不是让模型随意自改,而是在明确边界内,对影响结果的能力变量进行有控制的调整
对应Pearl阶梯:第二层"干预"
工程价值:从"问结果会怎样"升级为"如果我改变某个策略、流程或能力组件,结果会不会变好"
上层:验证与反事实选择——回答"哪种做法更优"#
核心任务:对候选干预进行多目标综合评估,在多个可能路径之间进行比较(保持原有策略 vs 采用不同干预方案)
设计理念:社会行为系统中优化不能只看单一指标——某策略可能提升短期效果却带来更高风险;某表达可能更有说服力却模糊合规边界
评估维度:结果质量、过程合理性、策略新颖性、能力保持、事实一致性、成本控制、风险边界与能力漂移
决策机制:只有当候选干预在多项维度上通过验证,且未突破风险、成本与安全边界时,才会提交进入固化流程;否则选择回滚或重新生成方案
对应Pearl阶梯:第三层"反事实"
工程价值:自优化是一套受控的因果实验系统,每一次能力变化都需完成原因识别、候选干预、结果验证和路径比较
5.4 三类干预层面的设计思想#
中层生成的候选干预大致发生在三个层面:
干预层面 |
干预对象 |
设计思想 |
解决的问题 |
|---|---|---|---|
第一类:认知与表达层面 |
Prompt、上下文、Memory |
调整Prompt、补充上下文、更新Memory,让模型更准确地理解任务意图、用户偏好和场景约束 |
减少"答得像但没答到点上"的情况 |
第二类:策略与执行层面 |
Skill、Workflow、Tool Policy |
增强某类Skill、优化Workflow、调整Tool Policy,让模型不只是生成回复,而是选择更合理的行动路径、调用更合适的工具、按更稳妥步骤推进任务 |
复杂任务中的行动路径选择与工具调用优化 |
第三类:验证与安全层面 |
Eval Suite、Adapter、Runtime |
补充Eval Suite、适配特定场景Adapter、修正Runtime中权限/成本/安全策略 |
让每一次能力变化都能被评测、被约束、被回滚,避免不可控的黑箱自改 |
设计哲学:这三个层面体现了从"理解层"到"执行层"再到"保障层"的递进,确保干预是有边界、有控制、可验证的,而非无约束的自改。
5.5 因果驱动闭环的工程价值#
将三层连起来看,零犀的工程架构不是简单的多Agent拼装,也不是普通的任务自动化,而是一套因果驱动的行动闭环:
观察状态、记录轨迹 → 基于任务证据完成归因分析、识别关键变量 → 生成有边界的候选干预、调整策略/流程/能力组件 → 多目标验证与反事实比较 → 决定提交固化或回滚
工程价值体现在三个维度:
持续进化:AI不再只依赖一次性的语言生成,而是把每一次真实任务都转化为下一次优化的因果样本
可追溯性:每一次能力变化都有原因识别、候选干预、结果验证和路径比较的完整记录
受控自优化:不是无约束的模型自改,而是在风险、成本、安全边界内的受控实验
5.6 三步推演链、三级阶梯、三层架构的映射关系#
三套"三"的体系之间存在清晰的对应映射关系:
维度 |
三步推演链 |
Pearl三级阶梯 |
三层架构 |
|---|---|---|---|
第一层 |
因(信息抽取与意图识别) |
L1 关联(观察) |
底层:轨迹与证据(回答"发生了什么") |
第二层 |
干预(策略生成) |
L2 干预(做了会怎样) |
中层:因果归因与候选干预(回答"为什么发生") |
第三层 |
果(结果落地与校验) |
L3 反事实(如果当时不这样会怎样) |
上层:验证与反事实选择(回答"哪种做法更优") |
映射逻辑:
三步推演链是逻辑流程层面(因→干预→果),描述推演的步骤顺序
Pearl三级阶梯是能力层级层面(观察→干预→反事实),描述因果推理的能力深度
三层架构是工程系统层面(轨迹→归因→验证),描述系统的物理结构
三者本质上是对同一套因果闭环的不同视角描述:推演链是"过程视角",因果阶梯是"能力视角",三层架构是"工程视角"。三者共同构成了从理论到工程的全链路落地。
6. 八种干预载体与七项验证机制一览#
6.1 八种干预载体#
在零犀的因果框架里,Prompt、Memory、Skill、Tool Policy、Workflow、Eval Suite、Adapter、Runtime等模块不是孤立的工程组件,而是一组可被识别、可被调整、可被验证的"干预载体"。它们共同服务于同一个目标:改变系统中的某个能力变量,观察它是否真的改善了结果。
序号 |
干预载体 |
所属干预层面 |
在因果框架中的角色 |
|---|---|---|---|
1 |
Prompt |
认知与表达层面 |
调整提示词,让模型更准确理解任务意图 |
2 |
Memory |
认知与表达层面 |
更新记忆,捕捉用户偏好与场景约束 |
3 |
Skill |
策略与执行层面 |
增强特定技能,应对复杂任务场景 |
4 |
Tool Policy |
策略与执行层面 |
调整工具使用策略,确保调用更合适的工具 |
5 |
Workflow |
策略与执行层面 |
优化工作流,让任务按更稳妥步骤推进 |
6 |
Eval Suite |
验证与安全层面 |
补充评测套件,让能力变化可被评测 |
7 |
Adapter |
验证与安全层面 |
适配特定场景,实现能力精细调控 |
8 |
Runtime |
验证与安全层面 |
修正运行时权限、成本与安全策略,确保可控可回滚 |
6.2 七项验证机制#
上层构建的多目标验证机制,不只判断任务是否完成,还会同时评估多个维度。在具体实现上:
序号 |
验证机制 |
全称(依上下文推断) |
评估维度 |
|---|---|---|---|
1 |
ORM |
Outcome Reward Model(结果奖励模型) |
评估最终结果 |
2 |
PRM |
Process Reward Model(过程奖励模型) |
评估中间过程 |
3 |
Novelty |
新颖性检测 |
判断新策略是否具备有效探索价值 |
4 |
Retain |
能力保持检查 |
检查原有能力是否被破坏 |
5 |
Verification |
事实验证 |
验证事实与外部证据 |
6 |
Constraints |
约束检查 |
约束安全、权限、隐私与成本 |
7 |
Drift |
能力漂移检测 |
检测能力分布是否发生异常偏移 |
设计思想:这七项机制共同构成了一个多维度的安全网,确保候选干预在多项维度上通过验证且未突破风险、成本与安全边界时,才会被提交进入固化流程。这体现了"优化不能只看单一指标"的设计哲学——避免短期效果提升却带来更高风险、合规边界模糊或长期稳定性受损。
7. 社会行为系统世界模型分析#
7.1 与物理世界模型的对比#
文章提出了一个重要的理念创新:世界模型不止物理世界。两类世界模型的本质区别如下:
对比维度 |
物理世界模型 |
社会行为系统世界模型 |
|---|---|---|
变量类型 |
位置、速度、边界、障碍物 |
人的意图、信任、偏好、情绪、关系、约束与反馈 |
推演对象 |
物体如何运动;空间、物体、环境的状态变化 |
人如何理解、选择与行动;认知、信任、偏好、决策路径的变化 |
典型场景 |
机器人向前迈出一步,周围空间如何变化;自动驾驶转向后道路、车辆与行人状态如何重新排列 |
一次交互后用户认知如何变化;一个策略介入后信任阈值是否被打开;一次回应后风险偏好、决策路径和后续行动如何被重塑 |
规律性质 |
物理规律 |
社会行为规律 |
建模难度 |
相对标准化(物理规律明确) |
更非标、更复杂(人的行为难以用确定规律描述) |
7.2 底层共性#
尽管对象不同,但两类世界模型底层追问的是同一句话:"如果我这样做,接下来会发生什么?"
共性可概括为同一套因果推演结构:
给定一个状态 → 采取一个行动 → 预测一个结果 → 如果结果不理想 → 通过反事实复盘找到更好的行动
物理世界模型:AI学习的是一个动作之后空间、物体和环境的变化
社会行为系统世界模型:AI学习的是一次交互之后人的认知、信任、偏好和行动的变化
核心洞察:零犀走的是一条广义世界模型路线——不是去建模物体如何运动,而是去建模人如何理解、选择与行动;不是去推演物理环境的状态转移,而是去推演社会行为系统中的因果变化。对象不同,底层命题却相同:理解原因,预测后果,优化行动。
7.3 创新价值#
社会行为系统世界模型的提出,扩展了"世界模型"这一概念的适用边界:
概念扩展:将世界模型从"物理环境"扩展到"社会行为系统",使世界模型的应用场景从机器人、自动驾驶延伸到销售、服务、决策等以人为本的商业场景
变量重构:将世界模型的变量从物理量(位置、速度)重构为社会行为量(意图、信任、偏好、情绪),为商业AI提供了新的建模对象
时代坐标:当世界模型成为全球AI核心战场时,零犀过去六年押注的方向获得了一个更大的时代坐标——下一代AI的竞争不只是生成能力的竞争,而是世界建模能力的竞争,而这个世界既包括物理世界,也包括社会行为世界
8. Agentic Sales业务落地分析#
8.1 设计思路#
零犀将因果大模型的能力组织成一套以因果大模型为底座的Agentic Sales多智能体体系,让"理解为什么"这件事真正嵌进业务里持续运转,而非停在演示层。
核心设计理念:
以因果大模型为底座(而非通用LLM)
多智能体协作(而非单一模型)
持续运转在业务中(而非演示层)
将"理解为什么"嵌入业务流程(而非仅生成回复)
8.2 过程反馈机制与过程奖励模型#
围绕三步推演链,零犀搭建了一套过程反馈机制,这是其区别于通用大模型的关键设计:
设计思想:
不只看最终结果好不好,而是把中间过程拆成多个可评估节点
可评估节点包括:意图识别是否准确、关键变量是否抓住、策略选择是否合理、风险判断是否充分、话术是否合规、下一步行动是否清晰
这些中间信号进入过程奖励模型(PRM),对模型的推理路径进行持续校准
结合真实反馈与强化学习,模型可以不断优化从"识别原因"到"生成策略"再到"执行动作"的完整链路
与通用大模型的对比:
通用大模型:基于上下文生成"下一句合适的话"
零犀因果大模型:进一步追问"为什么应该这样回应""这种回应会带来什么变化""有没有更优的行动路径"
核心差异:零犀不是让LLM只在语言层面模仿专家,而是把专家判断中可拆解、可评估、可迭代的部分,沉淀成模型可以学习的过程信号。这是从"模仿专家"到"沉淀专家判断过程"的范式跃迁。
9. 关键概念与数据一览表#
9.1 关键技术概念#
概念 |
基于原文的解释 |
|---|---|
因果大模型 |
零犀自研的大模型,官方备案名为"因果"大模型,将因果推演框架装进LLM,建模现象背后的生成机制、作用路径与干预效应 |
世界模型 |
AI下一阶段的核心战场,要求AI从"预测下一个词"走向"预测下一种状态",能回答"如果我这样做,世界会怎样" |
社会行为系统世界模型 |
零犀提出的广义世界模型路线,不建模物体如何运动,而建模人如何理解、选择与行动;推演社会行为系统中的因果变化 |
因果驱动闭环 |
轨迹记录→因果归因→候选干预→结果验证→提交/回滚的完整闭环,把每次真实任务转化为下一次优化的因果样本 |
三步推演链 |
因(信息抽取与意图识别)→干预(策略生成)→果(结果落地与校验)的推演框架 |
Pearl三级因果阶梯 |
L1关联(观察)/L2干预(做了会怎样)/L3反事实(如果当时不这样会怎样),Judea Pearl提出的因果能力分级 |
三层架构 |
底层(轨迹与证据)/中层(因果归因与候选干预)/上层(验证与反事实选择)的工程系统 |
八种干预载体 |
Prompt、Memory、Skill、Tool Policy、Workflow、Eval Suite、Adapter、Runtime——可被识别、调整、验证的工程组件 |
七项验证机制 |
ORM、PRM、Novelty、Retain、Verification、Constraints、Drift——多目标验证机制的七个评估维度 |
过程反馈机制 |
把中间过程拆成多个可评估节点,通过过程奖励模型(PRM)对推理路径持续校准的机制 |
Agentic Sales |
以因果大模型为底座的多智能体业务体系,将"理解为什么"嵌入业务持续运转 |
ORM |
Outcome Reward Model,结果奖励模型,评估最终结果 |
PRM |
Process Reward Model,过程奖励模型,评估中间过程 |
9.2 提到的公司与产品#
公司/产品 |
相关信息 |
|---|---|
零犀科技 |
2018年创立于北京,核心团队脱胎于原百度人工智能团队,2020年起押注因果AI |
李飞飞 World Labs |
50亿估值,世界模型赛道代表 |
LeCun AMI Labs |
十亿种子轮,LeCun出走创立,世界模型赛道代表 |
谷歌 Genie 3 |
让文本生成的世界第一次具备实时可交互、可导航的形态 |
9.3 提到的人物#
人物 |
身份 |
相关信息 |
|---|---|---|
Judea Pearl |
图灵奖得主、贝叶斯网络之父 |
因果科学的思想源头;提出三级因果阶梯;2022年出席零犀WAIC论坛 |
周晓华 |
北大讲席教授 |
2022年出席零犀WAIC因果AI论坛 |
刘礼 |
重大教授 |
2022年出席零犀WAIC因果AI论坛 |
吴忠泽 |
国家科技部原副部长 |
2022年在线发表WAIC论坛致辞 |
李飞飞 |
World Labs创始人 |
50亿估值押注世界模型 |
LeCun |
AMI Labs创始人 |
十亿种子轮押注世界模型 |
10. 核心观点提炼#
观点一:世界模型的底层密码是"因果"#
原文支撑:"破局的答案,就藏在「世界模型」最底层的两个字里:因果。"
世界模型真正要解决的不只是把画面生成得多逼真,它必须能回答"如果我这样做,世界会怎样"——预测行动的后果、推演下一个状态。而"预测后果"恰恰就是因果的内核。世界模型这股浪潮,将坐了几十年学术冷板凳的因果科学硬生生拽回了时代的聚光灯下。
观点二:AI必须从"相关性"走向"因果性"#
原文支撑:"AI不能只会「看见」和「生成」,它必须理解「为什么」,才能预测「行动的后果」。"
过去三年AI圈的信仰是"更大的LLM=AGI",但切入真实商业场景后致命短板暴露——AI算得出用户"说了什么",却不懂用户"为何开口"。底层逻辑只有"统计相关",只认得"伴随出现"的轨迹,却不懂因果科学的内核。范式转变的方向是从"预测下一个词"走向"预测下一种状态",从"生成一个答案"走向"判断一个行动可能带来的后果"。
观点三:社会行为系统世界模型是广义世界模型路线#
原文支撑:"不是去建模物体如何运动,而是去建模人如何理解、选择与行动;不是去推演物理环境的状态转移,而是去推演社会行为系统中的因果变化。"
物理世界只是世界模型的一种对象。社会行为系统世界模型将变量从位置、速度、边界重构为人的意图、信任、偏好、情绪、关系、约束与反馈。对象不同,底层命题却相同:理解原因,预测后果,优化行动。这扩展了世界模型的适用边界,使其从机器人、自动驾驶延伸到以人为本的商业场景。
观点四:因果驱动闭环让AI从一次性生成走向持续进化#
原文支撑:"AI不再只依赖一次性的语言生成。而是把每一次真实任务都转化为下一次优化的因果样本。"
零犀的工程架构不是简单的多Agent拼装,而是一套因果驱动的行动闭环。系统先观察状态、记录轨迹,再基于任务证据完成归因分析,识别影响结果的关键变量;随后生成有边界的候选干预,对策略、流程或能力组件进行调整;最后通过多目标验证与反事实比较,决定是否提交固化,或在未通过验证时回滚。这使AI具备了持续进化的能力。
观点五:因果AI从学术冷板凳到行业主战场的演进已被验证#
原文支撑:"六年前那个看起来「太超前」的赌注,正在2026年,被整个行业反复验证。"
当行业2026年才开始热烈拥抱因果时,零犀的技术路线图上早已密密麻麻地写满了因果两个字。从2020年押注因果AI,到2022年WAIC聚集全球因果AI最强大脑,到2024年核心专利申请,再到2025年网信办备案"因果"大模型——这条脉络体现了"在无人区潜伏,在主战场兑现"的战略定力,也证明了因果AI从学术到工程的演进路径是可行的。
第二部分:洞察总结(行业趋势与战略洞察)#
1. "从相关性到因果性"范式转变的三重意义#
1.1 理论层:Pearl因果阶梯从学术到工程的跨越#
Judea Pearl用一生论证一件事:机器学习与AI最难啃的骨头,本质上都是因果问题。他将因果能力拆成三级阶梯——观察、干预、反事实——这长期以来停留在学术理论层面。
零犀的工程化实践表明,Pearl的理论框架可以被映射为具体的能力体系:
L1关联→基于行业知识图谱识别关键影响因素
L2干预→基于因果判断动态生成策略
L3反事实→用反事实推演持续自我优化
这一跨越的意义在于:因果科学不再是哲学讨论,而是可工程化、可验证、可迭代的技术体系。 它证明了学术理论可以通过"三步推演链+三层架构+八种干预载体+七项验证机制"的系统设计,落地为实际运行的产品。
1.2 技术层:因果大模型架构创新#
零犀因果大模型的架构创新体现在三个层面:
推演框架的内嵌:不是给LLM外面套一层规则,而是把"因→干预→果→反事实"的因果链变成模型可以持续运行、持续验证、持续进化的系统
干预载体的系统化设计:将Prompt、Memory、Skill、Tool Policy、Workflow、Eval Suite、Adapter、Runtime等工程组件重新定义为"可被识别、可被调整、可被验证的干预载体",使其服务于因果干预的目标
多目标验证机制:通过ORM、PRM、Novelty、Retain、Verification、Constraints、Drift七项机制,构建了多维度的安全网,确保优化不只看单一指标
这一架构创新的核心价值在于:它将因果推理从"模型能力"转化为"系统能力"——不是要求单个模型具备完整的因果推理能力,而是通过系统设计让因果闭环可运行、可验证、可进化。
1.3 应用层:商业AI价值兑现与可信AI建设#
范式转变在应用层的意义体现在两个方面:
商业价值兑现:
通用大模型在复杂商业场景中的致命短板是"算得出用户说了什么,却不懂用户为何开口"
因果大模型通过"理解为什么"嵌入业务持续运转,从"模仿专家"升级为"沉淀专家判断过程"
Agentic Sales多智能体体系证明因果AI能落地为真实业务结果,而非停留在演示层
可信AI建设:
因果驱动闭环让AI的关键判断有证据、有来源、有过程记录
多目标验证机制确保AI的优化在风险、成本、安全边界内进行
反事实推演使AI的决策可追溯、可复盘、可修正
这回应了行业对"可信AI"与"可解释AI"的核心诉求
2. 社会行为系统世界模型的创新价值#
2.1 概念创新:从物理世界到社会行为世界#
社会行为系统世界模型的提出,是对"世界模型"概念的重要扩展。它打破了"世界模型=物理世界模型"的狭义理解,将世界模型的适用边界从机器人、自动驾驶等物理场景延伸到销售、服务、决策等社会行为场景。
这一扩展的创新价值在于:
变量重构:将世界模型的变量从物理量(位置、速度、边界)重构为社会行为量(意图、信任、偏好、情绪、关系、约束、反馈)
场景扩展:使世界模型技术可应用于更广泛的商业场景,而不仅限于物理环境交互
认知升维:将"理解世界"从"理解物理环境如何变化"升维到"理解人如何理解、选择与行动"
2.2 方法论价值:广义世界模型路线#
零犀走的是一条广义世界模型路线——核心命题不是"建模什么对象",而是"能否回答如果我这样做,接下来会发生什么"。
这一方法论的价值在于:
抽象层次的统一:物理世界模型与社会行为系统世界模型底层追问的是同一句话,遵循同一套因果推演结构(状态→行动→结果→反事实)
技术复用的可能:两类世界模型可以共享因果推理的底层框架,差异仅在变量定义与规律建模
应用边界的拓展:世界模型不再局限于具身智能,而可广泛应用于任何涉及"状态-行动-结果"推演的场景
2.3 风险与挑战#
需要客观认识到,社会行为系统世界模型相比物理世界模型面临更大的建模挑战:
人的行为难以用确定规律描述,社会行为系统的"物理定律"远比物理世界复杂
意图、信任、偏好等变量的量化与测量难度远高于位置、速度等物理量
文章对这一挑战的讨论较为简略,更多停留在理念层面,缺乏对建模难度的深入探讨
3. 因果驱动闭环的工程价值与可信AI建设意义#
3.1 工程价值#
因果驱动闭环(轨迹记录→因果归因→候选干预→结果验证→提交/回滚)的工程价值体现在三个维度:
持续进化能力:将每次真实任务转化为下一次优化的因果样本,使AI具备了从经验中学习并持续改进的能力。这与传统LLM"一次训练、固定能力"的模式形成本质区别。
可追溯性与可解释性:每一次能力变化都有完整的原因识别、候选干预、结果验证和路径比较记录。AI不再只输出一个看似合理的答案,而是留下可复盘的状态链。
受控自优化:干预不是无约束的模型自改,而是在明确边界内对能力变量的有控制调整,配合多目标验证机制确保安全可控。
3.2 对可信AI与可解释AI建设的价值#
因果驱动闭环对可信AI与可解释AI建设具有直接价值:
可信AI层面:
底层的轨迹与证据机制让AI的关键判断有证据、有来源、有过程记录
多目标验证机制中的Constraints约束安全、权限、隐私与成本
Drift检测能力分布异常偏移,防止能力退化
回滚机制确保未通过验证的干预不会进入系统
可解释AI层面:
中层的因果归因机制将结果拆回到原因链上,回答"为什么发生"
过程反馈机制将中间过程拆成多个可评估节点,使推理路径可审视
反事实推演使AI的决策逻辑可比较、可复盘
这一闭环的核心贡献在于:它将"可解释"从"事后解释"升级为"过程中的归因"——不是在结果出来后再解释为什么,而是在过程中就完成原因识别、干预生成与结果验证,使可解释性内嵌于系统运行而非外挂于结果。
4. 行业趋势判断#
4.1 因果AI从学术冷板凳到行业主战场的演进#
文章揭示了一个重要的行业趋势:因果AI正从学术冷板凳走向行业主战场。
演进脉络:
学术期(长期):Judea Pearl等学者长期论证因果是AI最难啃的骨头,但行业主流关注统计学习与规模扩展
觉醒期(2026年):世界模型热潮将因果科学从冷板凳拽回聚光灯下,行业集体意识到"AI不能只会看见和生成,必须理解为什么"
工程期(正在进行):零犀等公司开始将因果理论工程化为可运行的产品系统
主战期(未来):因果AI有望从单一公司实践扩展为行业共识的技术范式
驱动力:
LLM在真实商业场景的致命短板暴露(只认得"伴随出现"的轨迹,不懂因果)
世界模型提出新要求(从"看见什么、生成什么"到"如何干预、如何预测行动后果")
行业共识转变(从"更大模型+更多数据"到"理解世界、预测后果")
4.2 世界模型热潮与因果AI的时代坐标关系#
世界模型与因果AI的关系可概括为:因果是世界模型的底层密码。
关系逻辑:
世界模型要求AI能回答"如果我这样做,世界会怎样"——这本质上是因果推理问题
"预测后果"是因果的内核,也是世界模型的核心能力要求
因此,世界模型的集体觉醒,本质上是行业终于被逼到了因果认知的台阶上
时代坐标:
对大多数公司而言,因果AI是2026年才到来的新命题
对零犀而言,这是2020年就写在起跑线上的答案
当世界终于开始为"因果"上头时,零犀早已把这条路走成了别人还在找的地图
这一时代坐标关系意味着:因果AI不是世界模型的附属概念,而是世界模型的底层基础。 谁能在因果推理上取得突破,谁就能在世界模型赛道上占据优势。
4.3 趋势判断的审慎思考#
需要审慎看待的是,因果AI作为行业趋势仍处于早期阶段:
文章主要基于零犀一家的实践,缺乏行业整体的验证
"2026年行业集体觉醒"的表述带有较强的叙事色彩,实际行业认知可能更为分散
因果AI的工程化难度尚未被充分讨论,技术成熟度有待验证
通用大模型厂商(如OpenAI、Anthropic等)对因果AI的态度未被提及
5. 可复用的方法论启示与认知模型#
5.1 因果阶梯工程化方法论#
启示:学术理论可以通过"理论分级→能力映射→工程落地"的路径实现工程化。
Pearl三级因果阶梯的工程化落地提供了一套可复用的方法论:
将抽象理论(观察/干预/反事实)映射为具体能力(识别原因/生成策略/复盘优化)
将能力映射为工程系统(轨迹证据/因果归因/验证选择)
每一级都有明确的"跃迁目标"(从识别现象到理解原因,从预测结果到影响结果,从接受结果到持续优化)
认知模型:理论→能力→工程的三层映射模型,可用于任何学术理论的工程化落地。
5.2 干预载体设计方法论#
启示:复杂系统中的"干预"应该通过可识别、可调整、可验证的载体来实现,而非无约束的自改。
零犀将八种工程组件(Prompt、Memory、Skill、Tool Policy、Workflow、Eval Suite、Adapter、Runtime)重新定义为"干预载体",按三个层面(认知与表达/策略与执行/验证与安全)组织。
认知模型:干预=载体×层面×边界。有效的系统干预需要明确:
干预的载体是什么(哪些组件可被调整)
干预属于哪个层面(认知/执行/保障)
干预的边界在哪里(在什么范围内调整是安全的)
5.3 多目标验证机制设计方法论#
启示:系统优化不能只看单一指标,需要多维度的验证机制构成安全网。
零犀的七项验证机制(ORM评估结果、PRM评估过程、Novelty判断探索价值、Retain检查能力保持、Verification验证事实、Constraints约束安全、Drift检测漂移)构成了一个完整的验证体系。
认知模型:优化≠提升单一指标。有效的优化验证需要覆盖:
结果维度(ORM)
过程维度(PRM)
探索维度(Novelty)
保持维度(Retain)
事实维度(Verification)
约束维度(Constraints)
稳定维度(Drift)
5.4 因果闭环系统设计方法论#
启示:AI系统的持续进化需要因果驱动的闭环设计,而非一次性的训练与部署。
零犀的因果驱动闭环(轨迹记录→因果归因→候选干预→结果验证→提交/回滚)提供了一套可复用的系统设计模式。
认知模型:闭环=观察→归因→干预→验证→决策。任何需要持续进化的AI系统都可以参考这一闭环:
先观察记录(发生了什么)
再归因分析(为什么发生)
然后生成干预(如何改变)
接着验证评估(改变是否有效)
最后决策提交或回滚(是否固化)
5.5 "广义世界模型"认知模型#
启示:世界模型的核心不是"建模什么对象",而是"能否回答行动后果的预测问题"。
认知模型:世界模型=状态+行动+结果预测+反事实复盘。只要一个系统满足这一结构,无论是物理世界还是社会行为系统,都可以用世界模型的框架来建模。
6. 信息评估与批判性分析#
6.1 准确性评估#
技术概念的准确性:
Judea Pearl的三级因果阶梯(观察/干预/反事实)引用准确,与Pearl在《Causality》等著作中提出的理论一致
"统计相关"与"因果推理"的区分表述准确,符合因果科学的基本共识
ORM(结果奖励模型)与PRM(过程奖励模型)的概念使用准确,与当前强化学习领域的研究方向一致
"从预测下一个词走向预测下一种状态"的表述准确捕捉了世界模型与LLM的本质区别
需注意的准确性问题:
文章对零犀技术架构的描述较为概念化,缺乏具体的技术实现细节(如模型参数、训练数据、性能指标等)
"内部测试和真实任务复盘中差异更明显"的表述未提供具体的量化数据支撑
八种干预载体与七项验证机制的概念框架较为清晰,但缺乏工程实现的深入描述
6.2 权威性评估#
支持权威性的因素:
引用了Judea Pearl(图灵奖得主、贝叶斯网络之父)的理论,建立了理论权威性
提及2022年WAIC论坛有Judea Pearl、周晓华、刘礼等学者出席,有国家科技部原副部长吴忠泽在线致辞
零犀大模型获得网信办备案,具备一定的官方认可
2024年完成核心专利申请,在知识产权层面具备先发优势
需审慎看待的权威性问题:
文章主要基于零犀科技一家的实践与视角,缺乏第三方独立验证
文章未引用同行评审的学术论文或独立测试报告
WAIC论坛的出席本身不等于学术 endorsement,论坛性质的聚集与学术背书有本质区别
网信办备案是合规性要求而非技术先进性认证
专利申请是知识产权保护而非技术验证
6.3 时效性评估#
支持时效性的因素:
文章发布于2026年世界模型成为AI核心战场的背景下,紧扣当前行业热点
提及李飞飞World Labs、LeCun AMI Labs、谷歌Genie 3等最新行业动态
零犀2025年底网信办备案的信息具有时效性
需注意的时效性问题:
文章将"2026年行业集体觉醒因果"作为叙事前提,但这一判断带有较强的主观色彩
零犀的技术实践始于2020年,文章是对六年积累的回顾性叙述,部分内容可能经过后视镜式的美化
文章未提供零犀技术架构的最新迭代状态与技术指标
6.4 倾向性识别——企业宣传/软文特征分析#
文章具有明显的企业宣传/软文倾向,具体表现在以下几个方面:
宣传性表述(Promotional Language)的识别#
宣传性表述 |
性质分析 |
|---|---|
"一家中国黑马早已在无人区潜伏6年" |
典型的宣传性叙事,使用"黑马""无人区"等渲染性词汇 |
"把AI大模型的命门彻底打透" |
夸大性表述,"彻底打透"缺乏量化支撑 |
"步步踩点" |
后视镜式美化,将历史选择描绘为精准预判 |
"极致的纯粹" |
情感性评价,非客观描述 |
"一家公司,敢于将一个前沿技术范式,直接作为大模型的官方备案名。这本身,就是一种极致的纯粹" |
典型的品牌升华话术 |
"零犀等来的不是运气,而是一个判断被时间验证的过程" |
宣传性升华 |
"零犀早已把这条路,走成了别人还在找的地图" |
诗意化宣传语言 |
"六年前那个看起来「太超前」的赌注,正在2026年,被整个行业反复验证" |
典型的"先见之明"叙事 |
事实陈述与宣传性表述的区分#
可识别的事实陈述:
零犀2018年创立于北京,核心团队脱胎于原百度人工智能团队
2020年起押注因果AI赛道
2022年在WAIC主办因果AI主题论坛
2024年完成核心专利申请
2025年网信办备案"因果"大模型
技术架构包括三步推演链、三级阶梯、三层架构、八种干预载体、七项验证机制
宣传性表述的特征:
大量使用渲染性词汇(黑马、无人区、命门、极致、纯粹)
采用"先知先行者"的叙事框架("一家公司早已…六年")
将公司选择描绘为"被时间验证的赌注"
缺乏量化的技术指标与独立的性能验证
将行业趋势与单一公司紧密绑定,暗示因果关系
软文特征的总体判断#
文章具有企业宣传/软文的典型特征:
单一公司聚焦:全文围绕零犀科技展开,将其描绘为因果AI的唯一代表
缺乏对比与批判:未提及其他因果AI实践者,未讨论技术路线的局限性与挑战
叙事张力构建:通过"硅谷2026年才如梦初醒 vs 中国黑马潜伏6年"的对比构建叙事张力
情感化语言:大量使用渲染性与情感化词汇
缺乏技术深度:对技术架构的描述停留在概念层面,缺乏可验证的技术细节
来源单一:信息主要来自零犀科技自身或其主办的论坛,缺乏独立第三方信源
客观评估:文章作为媒体宣传内容,在传播因果AI理念、介绍零犀技术路线方面具有一定参考价值。但读者应清醒认识到其作为企业宣传/软文的倾向性,区分其中的事实陈述与宣传性表述,不宜将宣传性叙事等同于客观技术验证。对于文章中提及的技术架构与能力,建议参考独立的技术评测与同行评审研究进行交叉验证。
结语#
本文对新智元发布的"因果AI与世界模型"文章进行了系统性学习与深度洞察分析。
学习笔记层面,报告完整梳理了文章的七个主要部分、零犀科技的发展脉络、因果大模型的技术架构(三步推演链、Pearl三级阶梯工程化落地、三层架构、八种干预载体、七项验证机制)、社会行为系统世界模型理念以及Agentic Sales业务落地设计。核心结论是:零犀构建了一套从理论(Pearl因果阶梯)到能力(三步推演链)到工程(三层架构)的完整因果AI技术体系。
洞察总结层面,报告分析了"从相关性到因果性"范式转变的三重意义(理论层/技术层/应用层)、社会行为系统世界模型的创新价值、因果驱动闭环对可信AI建设的价值,以及因果AI从学术冷板凳到行业主战场的演进趋势。同时,报告客观评估了文章的准确性、权威性与时效性,并识别了其作为企业宣传/软文的明显倾向性,建议读者区分事实陈述与宣传性表述,对技术能力进行独立验证。
核心启示:因果AI的工程化实践(因果阶梯→能力映射→工程系统→干预载体→验证机制→闭环进化)为AI从"统计拟合"走向"因果推理"提供了可参考的技术路线。社会行为系统世界模型的提出拓展了世界模型的适用边界。因果驱动闭环为可信AI与可解释AI建设提供了工程化路径。这些启示对AI大模型技术演进方向、因果AI工程化实践具有实际参考价值。