在计算广告领域,实时竞价(RTB)是核心范式:当用户在媒体端产生一次曝光机会时,广告交易平台向所有竞争广告主发起竞价请求,广告主通过 DSP 的自动竞价算法实时出价,最高出价者赢得展示。这一过程中,广告主只需设定高层目标(如目标 CPA、预算上限),自动竞价算法便自动完成全部出价决策 —— 它已经成为现代计算广告不可或缺的基础设施。
然而,长期以来自动竞价研究和基准主要停留在 DSP 视角,关注单一广告主的转化最大化。以快手广告系统为代表,真实工业场景中的自动竞价已经运行在统一平台体系内:流量供给、广告主投放和竞价交易相互耦合,自动竞价算法算法不仅要优化单个广告主效果,也需要兼顾多广告主竞争下的平台整体效率与约束稳定性。面向这一问题,快手联合东南大学、南洋理工大学共同提出 PlatformBid—— 业界首个从统一广告平台视角设计的综合自动竞价基准;同时,团队提出了基于 Flow Matching(流匹配)的新方法 BidFlow。相关成果已发表于 KDD 2026。
论文标题:PlatformBid: An Auto-Bidding Benchmark from a Unified Advertising Platform's Perspective
代码仓库:https://github.com/YsTvT/PlatformBid
论文地址:https://arxiv.org/pdf/2607.27265
一、研究背景:被忽视的 "平台视角"
传统自动竞价研究以 DSP 为中心,核心目标是为单个广告主优化竞价策略,使其在竞争中获取更多转化。iPinYou、AuctionNet 等公开基准都沿袭了这一范式:评估单个广告主面对固定历史出价的竞价表现。
但行业格局已根本改变:
平台整合趋势:真实工业广告系统已将 SSP、DSP 和广告交易引擎内部整合,广告主之间的竞价发生在平台内部,而非跨平台的外部竞价;
评估缺位:现有基准无法评估 "当所有广告主同时采用新算法时,平台整体收入和广告主公平性如何变化" 这一关键问题;
竞争动态缺失:AuctionNet 等基准通过顺序替换广告主、回放历史出价来评估,无法捕捉多个广告主同时调整策略时的动态竞争。
单广告主的最优不等于平台全局的最优。从 DSP 视角到平台视角的范式转变正是本工作要解决的核心问题。
二、PlatformBid 基准设计
2.1 问题定义:平台视角的形式化
PlatformBid 首先从统一平台视角重新定义了自动竞价优化问题。与传统 DSP 公式相比,最关键的区别在于显式引入了平台级目标约束 O_l:
其中 O_l 可以要求平台总收入不低于基线策略水平,类似于线上 A/B 测试的要求。竞价策略采用多参数线性出价形式,算法在粗粒度时间间隔(如 30 分钟)更新参数,为复杂算法留出充足计算空间。
2.2 三大评估设置
基于平台实际业务场景,PlatformBid 设计了三个代表性评估设置,准确反映真实世界的自动竞价竞争动态:
设置 2:异质竞争(Heterogeneous Competition)
将广告主分为两组:N/2=24 个基线广告主使用固定的参考策略(vanilla Decision Transformer),N/2=24 个测试广告主使用待评估算法。这一设置映射线上算法灰度测试场景 —— 新算法仅部署给部分广告主,需要确保测试广告主性能提升的同时不损害基线广告主的表现。
设置 3:促销竞争(Promotional Competition)
模拟大促活动(如黑色星期五):7 个广告主预算翻倍,所有广告主使用相同算法。分别报告促销广告主、非促销广告主和平台整体指标。这一设置测试两个关键能力:一是促销广告主能否有效利用扩展预算,并在预算提升后仍满足 CPA 约束;二是非促销广告主能否在竞争加剧的环境中维持稳定投放效果。
2.3 评估指标
PlatformBid 采用平台级和广告主级双维度指标体系:
平台级指标:转化量(Conversion)、预算利用率(Budget Utilization)
广告主级指标:CPA 比率(CPA Ratio)、CPA 比率方差(CPA Ratio Variance)、超限率(Exceed Rate)、合格率(Qualified Rate)
综合指标 Score:平衡平台收入与广告主满意度:
该指标反映平台对可持续增长的偏好 —— 通过违反约束获得的高转化会被惩罚,因为这种行为侵蚀广告主信任和平台长期健康。
2.4 数据与实现
PlatformBid 基于 AuctionNet 数据集构建,包含 48 个广告主在多样化预算和 CPA 约束下采集的 480K 训练轨迹,提供 Dense 和 Sparse 两种奖励稀疏度变体。关键扩展在于:从 AuctionNet 的单广告主孤立评估,转变为多广告主共享拍卖环境的交互式模拟。为防止广告主合谋压价损害平台收入,引入了底价机制(设为历史最低成交价的 80%)。
三、BidFlow:基于 Flow Matching 的自动竞价方法
3.1 动机:多模态竞价分布的挑战
在 PlatformBid 的新设置下,现有自动竞价方法表现受限。其根本原因是平台级竞争环境引入了更复杂的市场波动和竞争动态,对建模多模态竞价分布的能力提出了更高要求。
三类现有方法的局限性:
经典控制方法(如 PID):基于固定数学公式,无法适应复杂市场动态;
强化学习方法(如 BCQ、IQL):假设单峰动作分布(如高斯策略),难以表达多模态竞价策略;
生成式方法:Decision Transformer 类方法(GAS、GAVE)通常建模确定性或单峰高斯分布;扩散模型类方法(CBD)表达能力虽强,但迭代去噪导致推理速度慢,难以满足竞价系统的延迟要求。
为此,团队提出 BidFlow—— 利用 Flow Matching 的强大分布建模能力,同时通过 Q 值引导蒸馏实现高效单步推理。
3.2 BidFlow 架构
BidFlow 由三个核心组件构成,联合训练:
(1)Critic 网络
通过标准时序差分学习训练,估计状态 - 动作价值:
(2)BC Flow 策略
通过 Flow Matching 训练行为克隆策略,学习速度场将高斯噪声转化为动作:
其中 a_t = (1-t) a_0 + ta 为线性插值。推理时通过 Euler 方法在 M 步内数值求解 ODE 生成动作。
(3)单步策略
将多步 BC Flow 蒸馏为单步策略,同时通过 Q 值最大化实现性能超越:
第一项从 BC Flow 蒸馏知识,第二项最大化 Q 值以超越行为克隆,控制正则化强度。三个组件在每次迭代中联合训练。部署时仅使用单步策略,实现高效推理,无需迭代采样。
3.3 算法流程
算法首先初始化价值网络、目标价值网络、BC Flow 策略和单步策略。每轮从离线数据集中采样,依次完成价值估计、流匹配训练,并通过 Euler 方法生成蒸馏目标,用于优化单步策略。训练过程中持续软更新目标网络,收敛后仅保留单步策略进行在线出价,以兼顾策略性能与推理效率。
四、实验结果与分析
4.1 设置 1:同质竞争 —— 全量部署的全面领先
在 Dense 数据集上,BidFlow 以 348.04 的 Score 显著领先所有基线方法(次优 GAS 为 314.27),同时保持最低的 CPA 超限率(0.25)和最低 CPA 比率方差(0.03)。在 Sparse 数据集上,BidFlow 同样以 30.59 的 Score 取得最佳表现。这表明 BidFlow 在所有广告主采用相同策略的全量部署场景下,能有效平衡广告主目标和平台福利。
4.2 设置 2:异质竞争 —— 灰度测试的稳健表现
在 Dense 数据集上,BidFlow 在平台整体 Conversion(347.96)上表现最佳,且不损害基线广告主表现。但在 Sparse 数据集上,BidFlow 出现性能退化(目标组 Score 35.97 vs DT score 43.91)—— 分析表明这与 DT score 和 DT 基线共享相同 Transformer 骨干、形成低出价合谋均衡有关,而非 BidFlow 本身的架构缺陷。
4.3 设置 3:促销竞争 —— 极端预算不平衡下的泛化
BidFlow 在促销广告主(Dense Score 701.48)和非促销广告主(Dense Score 297.25)上均取得最优表现,平台整体 Score(356.20)领先所有基线。这证明 BidFlow 在预算翻倍的极端条件下仍能有效扩展竞价策略,同时保持对 CPA 约束的严格遵守。
4.4 关键发现:算法演进的复合收益与竞争 - 合作洞察
从 PID 到 BidFlow,算法演进带来了复合收益:
转化提升显著:设置 1 中 BidFlow 较 PID 转化提升 95%,Sparse 数据集提升 3 倍;
方差即竞争强度:CPA 比率方差与整体 Score 呈强负相关。BidFlow 以最低方差实现最高 Score,而 PID 以最高方差表现最差。低方差策略展现 “合作” 特征,使多个广告主同时达标;高方差策略则反映破坏性过度竞争,导致预算耗尽和平台收入下降。
4.5 跨数据集验证:iPinYou
为验证 PlatformBid 的通用性,团队在结构差异显著的 iPinYou 数据集上进行了跨数据集验证。BidFlow 在所有三个设置上均排名第一,进一步确认了 PlatformBid 和 BidFlow 不受特定数据源束缚。
五、线上实验验证
为验证 BidFlow 在真实生产环境中的有效性,团队在快手电商广告场景部署了 BidFlow,与线上最强基线(经过充分调优的 DT 方法 + 专用奖励设计)进行对比。
0.68% 的预期消耗提升不仅证明了 BidFlow 在更复杂的工业场景中的优越性,也验证了 PlatformBid 的离线 - 在线一致性 —— 离线基准结果能有效指导真实世界的自动竞价算法开发。目前 BidFlow 已在快手电商广告场景全量部署。
六、意义与展望
这项工作的价值在于重新定义了自动竞价算法的评估维度:从 "单广告主最优" 走向 "平台全局共赢"。并且借鉴 Flow Matching(流匹配)技术,提出 BidFlow 自动出价算法,增强出价算法的分布建模能力。
PlatformBid 提供了首个平台级自动竞价基准,三种代表性设置(同质、异质、促销竞争)系统覆盖了真实业务场景,让平台级收入与广告主公平性第一次变得可评测、可分析;
BidFlow 利用 Flow Matching 的强大分布建模能力和 Q 值引导蒸馏的高效推理,在大多数设置下达到 SOTA,线上实验验证了其离线 - 在线一致性;
竞争 - 合作洞察揭示了 CPA 比率方差作为竞争强度代理指标的作用 —— 低方差的 "合作型" 策略促进集体福利,为平台算法选择提供了理论指导。
七、团队介绍
快手商业化算法客户机制中心团队负责广告出价、广告投放、品牌广告、综合平台业务、小说业务,致力于构建业界领先的智能投放平台,通过强化学习、生成模型、大模型等技术,带来收入增长。团队成员来自顶尖高校,相关技术成果发表在ICLR/NeurIPS/ICML/KDD/SIGIR/WWW等顶级会议。其中出价相关技术获得NeurIPS 2024广告出价比赛双赛道冠军,推荐技术获得WSDM 2026最佳长文提名奖。
八、热招岗位
广告算法工程师-【客户机制】
职位描述:
构建业界领先的广告智能投放平台,通过强化学习、生成模型、大模型等技术,最大化广告主长短期收益;
重点行业广告匹配、排序算法策略的实现与优化;
客户策略机制设计,包括竞价、分配与客户生态优化等;
广告客户增长、留存与营销效率提升,客户差异化策略产品研发。
任职要求:
熟悉常用的编程语言Python/Java/C++之一,精通数据结构与常用算法;
理解广告算法,业务,技术架构,熟悉常用的广告/推荐模型,具备2年以上搜索广告或展示广告相关经验;
数据驱动,有较强的数据挖掘能力和分析能力;
有广告相关竞价、oCPX出价、召回和效果优化策略相关经验者优先。
加分项:
在顶级学术会议(ICML & NIPS & ICLR, WWW & KDD & SIGIR)上发表过paper。
【快Star】广告大模型算法工程师
职位描述:
探索和打造下一代 AI 驱动的广告生成、推荐与竞价系统。致力于将 AIGC、大语言模型(LLM)、多模态大模型(MLLM)、博弈论以及强化学习(RL)等前沿技术,应用于业务的各个核心环节,提升平台商业效率与用户体验;
参与端到端大模型应用系统的设计与落地,涵盖模型训练、算法优化、系统部署及业务集成;
深入研究大模型在广告创意生成、广告推荐、机制设计、用户建模、Query建模、智能竞价等领域的创新应用;
与业务、产品、系统、平台等多团队紧密合作,在真实超大规模数据和复杂业务场景中打磨技术;
持续跟进行业前沿技术,探索具备商业价值与学术创新的解决方案,推动技术落地与规模化应用。
任职要求:
硕士及以上学历,计算机、人工智能、机器学习、应用数学等相关专业;
扎实的工程实现能力,熟练掌握 Python、C/C++、Java 等至少一门主流编程语言,有较强动手能力,了解目前常见的机器学习或者深度学习框架;
熟悉大语言模型、多模态大模型、AIGC生成技术、深度学习、强化学习等相关领域;
具备良好的算法能力与系统架构思维,能够在复杂工程场景下落地大模型应用;
具备良好的业务理解能力与跨团队沟通协作能力,能快速融入业务与技术双驱动的复杂环境;
对学术前沿有浓厚兴趣,具备较强的学习能力与问题分析能力,善于利用前沿技术解决实际问题。
加分项:
有 AIGC 广告生成、多模态语义建模、生成式推荐、强化学习等在搜索/推荐/广告系统中的应用经验;
有大模型训练、微调(SFT, RLHF)、轻量化、在线推理优化等经验;
有广告竞价机制设计、算法博弈、机制优化等研究或实践经历;
在人工智能、计算机视觉、自然语言处理、搜索推荐系统、广告算法等领域的顶级会议/期刊以第一作者发表过文章,或者有相关的开源项目贡献经验;
在ACM-ICPC/NOI/IOI等编程竞赛或机器学习相关竞赛拿过奖项。
投递方式:
扫描下方二维码投递,或投递简历至邮箱:[email protected]
推荐站内搜索:最好用的开发软件、免费开源系统、渗透测试工具云盘下载、最新渗透测试资料、最新黑客工具下载……




还没有评论,来说两句吧...