1. 项目概述
在联盟营销生态中,推广者(Promoter)的价值评估一直是个关键问题。传统方法只关注推广者直接带来的销量(Self-sales),却忽视了他们在社交网络中通过转发、分享所产生的链式传播价值。这种"直接贡献"评估范式存在明显局限性,导致资源配置次优和激励机制不公平。
阿里妈妈技术团队首次定义了衡量推广者间接贡献的新指标——传播规模(Propagation Scale),并提出了创新的两阶段解耦预测框架DNTS(Dynamic Network-based Two-stage forecasting)。该框架不再直接拟合复杂的目标,而是将其解耦为预测更平稳的基础信号(自销量)和预测动态的推广网络结构(传播关系)这两个子任务,最后通过合成机制得到"传播规模"的精准预估。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心问题与技术挑战
2.1 传统评估范式的局限性
传统"直接贡献"评估范式存在两个主要问题:
-
价值衡量偏差:无法识别具备传播价值的关键节点。如图1(a)所示,推广者P1可能被判定为无效推广者,但实际上正是他的转发行为激活了下游推广者P2和P3,最终促成订单。
-
资源分配失准:平台会将更多资源倾斜给"收割者"(如P3),而忽视"播种者"(如P1)的培育和激励,长期将损害生态健康。
2.2 传播规模预测的技术挑战
直接预测传播规模面临两大技术难点:
-
信号不平滑:传播规模受整个下游推广网络影响,呈现出剧烈波动,难以直接预测。
-
推广网络高度动态:商品每天的推广网络都不同,形成庞大且动态演化的网络集合。传统基于GNN的时序预测方法假设图结构是静态的,无法解决这个问题。
3. DNTS框架设计
3.1 两阶段解耦预测思路
DNTS框架的核心创新是将复杂的传播规模预测任务拆解为两个更稳定的基础元素预测:
- 基础信号预测:预测每个推广者未来的自销量(Self-sales)
- 结构预测:预测节点间的传播关系(后代关系)
最后通过合成机制完成最终传播规模的预测。这种解耦方式显著降低了预测难度。
3.2 基础信号预测通路
采用一维时间卷积模块,通过多尺度卷积核的Inception策略:
- 从历史自销量序列中提取多样的时序模式
- 通过门控机制融合不同尺度的特征
- 输出未来自销量的预测值
这种设计能够有效捕捉自销量相对平稳的时序规律。
3.3 结构预测通路
针对推广网络高度动态的特点,设计了"局部+全局"双重编码器:
3.3.1 局部动态编码
- 使用深度优先搜索(DFS)预处理获取每个推广者的后代集合
- 基于注意力机制聚合后代信息
- 利用GRU捕捉时态模式
3.3.2 全局动态编码
- 将同一天所有商品的推广网络整合为超图
- 推广者作为节点,商品参与关系作为超边
- 执行超图卷积捕捉跨商品全局推广偏好
- 使用GRU对时间依赖关系建模
3.4 传播规模合成机制
在获得预测的自销量和结构表征后:
- 预测贡献系数矩阵(后代关系概率×节点自销量激活率)
- 使用Gumbel-Softmax采样可能的后代集合
- 通过矩阵乘法聚合机制合成最终传播规模
这种设计确保只保留激活率和自销量均大于零的有效后代,提高预测准确性。
4. 工业级挑战与解决方案
4.1 数据稀疏性问题
问题表现:线上商品数量达亿级,但每个商品相关的推广者只是其中一小部分。
解决方案:
- 构建商品级推广者子表
- 所有图计算在子集上进行
- 既保证效率又缓解稀疏问题
4.2 高波动性问题
问题表现:商品推广热度可能在几天内爆发,大部分时间推广活动是"沉默"的。
解决方案:
- 增加推广者激活预测辅助任务
- 预测未来哪些推广者会是"活跃"的
- 使用激活状态作为门控,过滤"沉默"推广者
5. 实验验证
5.1 离线实验设置
- 数据集:三个不同时间跨度的大规模工业级数据集(7-days, 15-days, 30-days)
- 对比基线:DCRNN、STGCN、LSGCN、MTGNN、TPGNN等SOTA模型
- 评估指标:MAPE(平均绝对百分比误差)和MSLE(均方对数误差)
5.2 离线实验结果
- DNTS在所有数据集上均显著优于基线模型
- 在30-days数据集上,相比TPGNN取得11.3%的MSLE相对提升和4.1%的MAPE相对提升
- 诊断实验验证了两阶段解耦范式的有效性
5.3 在线实验结果
- 在阿里妈妈推荐平台部署DNTS
- 优化召回阶段的推广者评估指标
- 取得GMV +2.52%和销量Sales+2.40%的业务提升
6. 关键创新点
- 新评估指标:首次提出传播规模(Propagation Scale)概念,量化推广者的间接传播价值
- 新预测范式:两阶段解耦预测,将复杂问题分解为更易解决的子任务
- 动态网络处理:局部+全局双重编码器有效捕捉高度动态的推广网络特征
- 工业级解决方案:针对数据稀疏性和高波动性的专门设计
7. 实际应用价值
- 更公平的激励机制:准确识别具备传播价值的关键节点,给予合理激励
- 更优的资源分配:基于全面价值评估进行预算分配,提升ROI
- 生态健康度提升:平衡"播种者"和"收割者"的资源分配,促进生态多元发展
- 业务指标提升:实际部署带来显著的GMV和销量增长
8. 技术实现细节
8.1 动态网络表征学习
- 时间感知的节点嵌入:每个推广者的表征会随时间演化
- 商品特异性建模:不同商品的推广网络结构差异被充分考虑
- 跨商品信息共享:通过超图卷积实现知识迁移
8.2 合成机制设计
- 可微分采样:Gumbel-Softmax实现端到端训练
- 自适应过滤:自动排除无效后代节点
- 非线性组合:捕捉自销量与网络结构的复杂交互
8.3 模型训练技巧
- 多任务学习:主任务与辅助任务联合优化
- 课程学习:先易后难的训练策略
- 动态负采样:针对高度不平衡数据的采样策略
9. 扩展应用场景
DNTS框架不仅适用于联盟营销场景,还可扩展至:
- 社交网络影响力预测:预测用户内容传播范围
- 流行病传播建模:预测疾病传播规模和路径
- 信息扩散分析:追踪和预测网络热点话题传播
10. 未来改进方向
- 多模态信息融合:结合文本、图像等推广内容特征
- 因果推理增强:区分相关性和因果性,提高可解释性
- 实时预测优化:降低推理延迟,支持秒级预测
- 跨平台泛化:适应不同电商平台的推广生态
在实际部署DNTS框架时,有几个关键经验值得分享:
-
数据预处理至关重要:推广网络的构建质量直接影响模型性能。我们开发了高效的分布式归因算法,确保推广链路的准确追溯。
-
动态子图采样策略:针对海量商品和推广者,我们设计了基于热度排名的动态采样策略,在保证覆盖度的同时控制计算成本。
-
在线服务优化:将模型预测从天级优化到小时级更新,同时通过量化压缩技术将模型大小减少60%,满足线上服务的低延迟要求。
-
AB测试设计:采用分层分流技术,确保实验组和对照组的可比性,准确评估模型带来的业务增量。
这个项目最深刻的体会是:在复杂的实际业务场景中,有时需要跳出传统建模思路,从问题本质出发设计新的评估范式和解决方案。DNTS框架的价值不仅在于技术创新,更在于它改变了我们对推广者价值的认知方式,为联盟营销生态的健康发展提供了新的技术基础。
