1. 项目概述
在联盟营销生态中,淘客推广者(Promoter)扮演着关键角色,他们通过社交网络传播商品信息,直接影响商品的销售表现。传统评估方法仅关注推广者直接带来的销量(Self-sales),忽视了其在社交网络中产生的链式传播价值。这种"直接贡献"评估范式存在明显局限性,可能导致资源配置次优和激励机制不公平。
阿里妈妈技术团队提出从"直接贡献"评估到"传播价值"评估的范式迁移,首次定义了衡量推广者间接贡献的新指标——传播规模(Propagation Scale)。该指标考虑了推广者通过转发、分享所产生的链式传播价值,能更全面地评估推广者的综合价值。
关键洞察:传播规模预测的难点在于目标信号本身不平滑,且依赖的推广网络高度动态变化。直接预测传播规模极具挑战性。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心问题与技术挑战
2.1 传播规模的定义与计算
传播规模是指所有推广者直接或间接参与促成的订单销量总和。具体计算过程如下:
- 通过归因分析追溯每笔订单的完整推广链路
- 识别推广者在各链路中的参与情况
- 累计所有相关订单的销量
举例说明:
- 推广者A→B→C促成订单1(销量10)
- 推广者A→D促成订单2(销量5)
- 则A的传播规模为15(10+5),B为10,D为5
2.2 主要技术挑战
- 信号不平滑性:传播规模受整个下游推广网络影响,波动剧烈
- 网络动态性:推广网络每天变化,形成庞大的动态演化网络集合
- 数据稀疏性:线上商品数量庞大,但每个商品相关的推广者比例小
- 高波动性:推广活动可能突然爆发或长期沉默
3. DNTS框架设计
3.1 两阶段解耦预测思路
DNTS框架创新性地将传播规模预测解耦为两个子任务:
- 基础信号预测:预测更平稳的自销量(Self-sales)
- 结构预测:预测动态的推广网络结构(传播关系)
最后通过合成机制得到传播规模的精准预估。
3.2 基础信号预测通路
采用一维时间卷积模块,关键设计包括:
- 多尺度卷积核的Inception策略提取多样时序模式
- 门控机制融合不同尺度特征
- 输出未来自销量的预测值
技术优势:
- 专门处理平稳时序信号
- 捕捉商品销量的多周期模式
- 计算效率高,适合大规模部署
3.3 结构预测通路
3.3.1 局部动态编码
- 使用DFS算法预处理获取每个推广者的后代集合
- 基于注意力机制聚合后代信息
- 利用GRU捕捉时态模式
关键技术点:
- 后代关系定义为存在至少一条连通路径
- 注意力权重反映不同后代的重要性
- GRU记忆单元保留长期依赖关系
3.3.2 全局动态编码
- 将同一天所有商品的推广网络整合为超图
- 推广者作为节点,商品参与关系作为超边
- 执行超图卷积:
- 节点到超边聚合
- 超边到节点更新
- 使用GRU对时间依赖建模
数学表达:
H_e^(l) = σ(∑{v∈e} W_v H_v^(l-1)/|e|)
H_v^(l) = σ(∑ W_e H_e^(l)/|{e∋v}|)
3.4 传播规模合成
- 预测贡献系数矩阵:
- 后代关系概率矩阵
- 节点自销量激活率矩阵
- 使用Gumbel-Softmax采样可能的后代集合
- 矩阵乘法聚合有效成分:
Ŷ = ·R·X̂
合成机制特点:
- 自动过滤无效后代(自销量为零或激活率为零)
- 仅保留同时满足激活率和自销量大于零的有效成分
- 可微分,支持端到端训练
4. 工业级部署方案
4.1 应对数据稀疏性
- 构建商品级推广者子表
- 动态维护每个商品的相关推广者子集
- 所有图计算在子集上进行
优势:
- 大幅减少计算量
- 避免全图计算的资源浪费
- 提高模型收敛速度
4.2 处理高波动性
- 增加推广者激活预测辅助任务
- 预测未来时间点的活跃推广者
- 使用激活状态作为门控信号
- 过滤"沉默"推广者
技术效果:
- 降低噪声干扰
- 聚焦有效信号
- 提升预测稳定性
5. 实验验证
5.1 数据集与评估指标
- 三个工业级数据集:
- AM-30(30天跨度)
- AM-60(60天跨度)
- AM-90(90天跨度)
- 核心指标:
- MAPE(平均绝对百分比误差)
- MSLE(均方对数误差)
5.2 离线实验结果
-
对比基线:
- DCRNN
- STGCN
- LSGCN
- MTGNN
- TPGNN
-
性能表现:
- DNTS在所有数据集上全面领先
- 在AM-30上相对TPGNN提升11.3% MSLE和4.1% MAPE
- 更长历史数据带来更好表现
5.3 诊断性实验
比较三种预测模式:
-
传统端到端(直接预测传播规模):
- GNN几乎无提升
- 直接处理非平滑信号效果差
-
基础信号(仅预测自销量):
- 性能明显优于模式一
- 平稳信号更易预测
-
两阶段范式(DNTS):
- GNN带来显著提升
- 验证解耦思路的有效性
5.4 在线A/B测试
- 部署场景:阿里妈妈推荐平台召回阶段
- 关键指标:
- GMV提升2.52%
- 销量提升2.40%
- 业务价值:
- 更精准的传播规模预测
- 提升召回质量
- 优化资源配置
6. 技术创新点总结
-
评估范式迁移:
- 从直接贡献到传播价值
- 更全面衡量推广者价值
-
两阶段解耦框架:
- 分离信号预测与结构预测
- 各子任务更易学习
-
动态网络处理:
- 局部+全局双重编码
- 超图卷积捕捉跨商品模式
-
工业级优化:
- 商品级子表解决稀疏性
- 激活预测缓解波动性
7. 实际应用建议
-
数据准备阶段:
- 确保订单归因链路完整
- 维护推广者关系图谱
- 收集足够历史时序数据
-
模型训练技巧:
- 先预训练基础信号预测模块
- 逐步引入结构预测任务
- 使用课程学习策略
-
线上部署注意:
- 监控数据分布变化
- 定期更新推广者子表
- 设置异常值处理机制
-
业务应用方向:
- 精准营销预算分配
- 推广者价值评估
- 佣金激励方案优化
8. 未来改进方向
-
多模态信息融合:
- 结合商品图像/文本特征
- 引入推广者画像数据
-
跨领域迁移学习:
- 不同商品类别的知识共享
- 冷启动推广者预测
-
实时预测系统:
- 流式数据处理
- 在线模型更新
- 低延迟推理
-
因果推理增强:
- 识别真正的传播影响
- 减少混杂因素干扰
在实际业务场景中应用DNTS框架时,需要特别注意数据质量对模型性能的影响。我们发现在推广链路归因不完整的情况下,模型预测会出现显著偏差。建议投入足够资源确保数据采集和处理的准确性,这是发挥模型效果的基础保障。
