三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

奇点大会的因果推理讨论,推荐系统能怎么用

奇点大会的因果推理讨论,推荐系统能怎么用

从相关性到因果性:推荐系统为何需要换一套思维

做推荐的同学对这套流程再熟悉不过:收集用户行为日志,训练预测模型,上线A/B测试,看CTR、转化率、停留时长。但一个长期困扰很多人的问题是——模型预测得准,业务效果就一定好吗?

奇点智能技术大会(2026)的可信AI专场里,因果推理成了一个高频词。这不是赶时髦。传统推荐模型本质上是在做相关性建模:用户看过A后点了B,模型学到"A→B"的统计关联。但相关性不等于因果性。平台给用户推了优惠券,订单涨了,到底是优惠券的作用,还是这批用户本来就要买?把"看了又看"模块从首页撤掉,GMV跌了,是因为模块真有用,还是仅仅因为它占据了曝光位?

因果推理要回答的正是这类"如果……会怎样"的反事实问题。对算法工程师而言,这意味着从"预测用户会做什么"转向"评估干预措施的真实效果"。

对奇点智能大会(2026)的完整技术议题感兴趣,可前往奇点大会官方渠道免费获取PPT详细资料。

因果推断与相关性建模:不是替代,是互补

先澄清一个常见误解:因果推理不是要取代现有的深度学习推荐模型。两者解决的问题域不同。

相关性建模的优势在于利用海量信号做精准预测。用户画像、物品属性、上下文特征,这些信息的统计关联足以支撑起"猜你喜欢"的基本盘。但它的局限也很明显——无法回答策略性问题。运营同学问"把推荐列表从9个改成6个,用户满意度会变吗",纯预测模型给不出答案,因为历史数据里没有这个"因"对应的"果"。

因果推断的核心工具是潜在结果框架结构因果模型。简单说,就是想办法估计"用户在接受干预T时的结果Y"与"同一用户不接受干预时的结果Y"之间的差异。这个差异才是干预的真实效应,而不是简单对比两组用户的观测数据。

在推荐系统里,这对应着几个典型场景:算法策略调整、产品功能改版、运营活动上线。这些场景的共同特点是,你想知道的不是"用户会点什么",而是"我这样做之后,用户行为会怎么变"。

A/B测试走不通时,怎么办

理想情况下,跑个A/B测试就能拿到因果效应。但大会上的讨论很务实:很多业务场景下,A/B测试要么成本太高,要么根本不可行。

样本受限的场景最为典型。新品冷启动、长尾物品、小众用户群,能分到的流量不足以支撑统计显著性。这时候可以借助因果推断的降维方法:用倾向得分匹配(PSM)找到与实验组最相似的对照组,或者构建工具变量来隔离干预的纯净效应。一个实用的经验是,在推荐系统中,用户的"自然曝光机会"常常可以作为工具变量——不是所有人都能刷到某个位置,这个"能否刷到"本身就可以用来估计位置效应。

策略不可随机化的场景也很常见。比如你想评估"给用户打标签提醒"的效果,但标签系统一旦上线就是全量,无法做到随机分组。这时候需要依赖观察性因果推断:利用历史数据中已经存在的"自然实验",通过双重差分(DID)或合成控制法来构造反事实。关键在于找到处理组和对照组在干预前的平行趋势假设是否成立,这在推荐日志里通常需要仔细筛选时间窗口。

长期效应与干扰效应是另一个难点。推荐系统的干预往往有溢出效应:给用户A改了推荐策略,可能通过社交关系影响到用户B。传统的A/B测试假设用户之间独立,这在社交网络场景下基本失效。大会上有嘉宾提到,他们采用网络因果推断的方法,把用户间的交互结构显式建模进因果图,才能分离出真实的个体处理效应。

反事实推理:让推荐"说得清、道得明"

可信AI的另一个诉求是可解释性。用户问"为什么给我推这个",运营问"这个物品为什么排前面",不能只给出一堆特征权重。

反事实推理在这里的价值是生成结构化的解释。不是罗列"因为你浏览过X、Y、Z",而是回答"如果我没看过X,推荐结果会变吗"。这种解释更接近人类的因果直觉,也更容易被业务方理解和验证。

一个具体做法是在推荐模型中嵌入因果归因模块。以电商推荐为例,模型可以输出每个历史行为对当前推荐结果的因果贡献度,而非简单的注意力权重。区别在于,注意力权重反映的是统计相关性,而因果贡献度需要通过干预模拟来计算——"移除"某个行为后,推荐分布的变化程度。

这在内容分发场景也有应用。当需要解释"为什么降低某类内容的曝光"时,反事实推理可以量化:如果这类内容的供给量减少10%,用户整体消费时长会如何变化?是会被其他内容替代,还是直接导致用户流失?这种分析对内容治理策略的制定至关重要。

电商推荐案例:何时该引入因果建模

假设你在负责一个电商平台的"猜你喜欢"模块,业务方提出两个诉求:一是评估把"相似推荐"改成"搭配推荐"对客单价的影响;二是解释为什么某些用户频繁收到同一品类的推送。

第一个诉求是典型的因果效应估计问题。直接对比改版前后的客单价会混淆时间趋势、季节因素等干扰。更严谨的做法是:选取一部分用户作为实验组,将"相似推荐"策略替换为"搭配推荐",同时利用历史数据构建因果森林双重机器学习模型,估计异质性处理效应——哪些用户对搭配推荐更敏感,是价格敏感型还是品质导向型?这能帮助业务方做更精细化的策略投放,而不是一刀切。

第二个诉求涉及推荐的公平性与多样性。用户反复看到同一品类,可能是因为模型过度拟合了短期行为,也可能是用户确实具有稳定的品类偏好。通过反事实模拟,可以生成"如果用户过去没有购买过该品类,模型会推什么"的虚拟推荐列表,对比实际推荐列表的差异,从而判断模型是否存在"路径依赖"或"信息茧房"效应。

引入因果建模的时机判断:当业务问题从"预测什么"转向"评估什么"、"解释什么"时,就是因果方法该上场的时候。不要为了用因果而用因果,如果纯粹是排序优化、点击率预估,现有的深度学习模型已经足够。

团队需要补上的知识储备

对算法团队而言,因果推理不是简单调个包就能上手的。几个关键的能力缺口:

统计基础。理解条件独立性、混杂因素、选择偏差这些概念,比会跑几个因果推断库更重要。推荐系统里的偏差来源尤其复杂:位置偏差、曝光偏差、流行度偏差,这些都需要在因果框架下重新理解。

因果图建模。能把业务问题抽象成因果图,识别哪些变量是混淆变量、哪些是中介变量、哪些是工具变量。这需要对业务机制有深入理解,不是纯技术活。

与现有架构的融合。因果推断模块如何嵌入在线推荐流程?是离线做策略评估,还是在线实时计算?这涉及到工程架构的设计,也是很多团队落地时的实际难点。

一个务实的建议是从小处着手:先选一个具体的决策场景,用因果推断方法做一次完整的分析,跑通数据链路、验证业务价值,再逐步扩展。奇点大会的议题设置也体现了这个思路——不是鼓吹因果推理包治百病,而是强调在合适的场景下、以正确的方式引入,才能真正提升推荐系统的决策质量。

推荐阅读
📢最后,说一件事2026 奇点智能大会,终于要和大家见面了。
11 月 20-21 日·北京,奇点智能研究院联合 CSDN,把两场技术大会放在了同一个时空里

奇点智能技术大会(始于 2016)——聊大模型、AI Native、企业级 AI 落地、多模态与世界模型;

C++ 及系统软件技术大会(始于 2005)——聊现代 C++ 演进、AI 算力与推理优化、高性能低时延系统。

为什么要放在一起?因为我们越来越相信——上层 AI 应用的爆发,离不开底层系统软件的支撑;而底层技术的演进方向,也正在被 AI 重新定义。

这次大会汇聚 70+ 位技术专家、18 个主题、1000+ 同行到场。如果你也在这些方向上做研究、做产品、做工程,别错过。

← 返回列表