尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

社交网络穿透下的异网赢回真实性验证模型实践

社交网络穿透下的异网赢回真实性验证模型实践 携号转网全面落地之后运营商的用户流动明显加快“异网用户赢回”从过去CRM里的一个常规动作变成了存量经营的重头戏。但真正让我下决心做这套东西的是某个月渠道报表上的一个数字某代理渠道赢回量环比涨了近三倍区域经理高兴得不行说新话术效果炸裂。我顺手拉了这批用户的次月在网率35%。也就是说每赢回100个用户下个月有35个又走了。佣金照发数字很好看但真实留存一塌糊涂。后面的两个月我基本都在啃一个问题如何区分哪些赢回是真实有效的哪些只是渠道在“做数据”。最终落地的方案就是这套“异网用户赢回真实性验证模型”核心思路是跳出单用户视角把赢回行为和用户周边的社交网络叠在一起看通过社交网络穿透来重新评估每个渠道的真实贡献。这套方法对运营商的客户经营、数据分析、风控反欺诈团队以及做电信数据建模的同行都有直接的参考价值。1. 项目背景与核心问题拆解1.1 异网赢回运营商到底在抢什么人先说清楚“异网用户”是什么。在国内电信市场用户转网后自然就分成了本网用户和异网用户。异网赢回简单说就是对着已经流失到竞争对手那边的用户做召回通过外呼、短信、地推、线上广告、终端补贴、专属权益这些手段把用户拉回本网。这个场景和普通的拉新完全不同。拉新面对的是新用户决策链路短、需求明确赢回面对的是曾经在本网待过、因为资费、信号、服务或终端等原因离开的用户他们对本网的槽点非常清楚对运营商的话术也有天然免疫力。所以赢回转化率普遍不高行业里的外呼赢回基准通常在1.5%到3%之间。赢回的另一个特点是高度依赖渠道。自有外呼能做但人力有限、触达率低所以大部分运营商都会把赢回任务分发给代理渠道去跑。代理渠道按“成功携入且激活”的放号量拿佣金部分省市还会加一个“在网时长”的阶梯奖励。这里就埋下了真实的激励扭曲按量计佣天然会催生刷量冲动。尤其是当赢回目标的筛选条件不严的时候渠道完全可以在海量异网名单里挑“容易成交”的人甚至自己制造“成交”。1.2 “真实性验证”到底难在哪很多人以为真实性验证就是“实名认证过了就是真的”。但在赢回场景里实名认证只是最低线。我们复盘大量赢回用户后把“真实”拆成了三个层面第一层是身份真实性也就是这个携入行为是不是用户本人意愿。渠道拿用户身份证复印件批量开户、代客下单、伪造电子签名都能通过实名系统校验但根本不是本人操作。第二层是行为真实性也就是用户携入后是否真实使用。正常用户转网过来头三天必然有大量的通话、短信验证码、APP活跃、流量消耗。而渠道刷量用户往往激活后长时间零通话、零流量就是一张“养卡”。第三层是在网真实性也就是用户是否能持续留网一段时间。这里的典型作弊手法是“洗佣金”渠道用少量真实用户身份做携入拿完首月佣金后就批量离网然后再用新一批号码继续操作形成滚动套利。传统验证手段基本靠人工审核入网单据、电话回访、比对开户照片。这套流程对付零星作弊可以一旦渠道采用名单化、工厂化的操作模式人工复核根本跟不上。更麻烦的是虚假赢回的用户在CRM里看起来和正常用户几乎没有差别单看字段查不出来。1.3 社交网络穿透把评估视角从单点拉到网络我做这套项目最核心的一个转变是放弃了“只看用户本人”的评估思路把视角拉到了用户周边的社交网络上。为什么这么做因为我发现真实赢回行为和虚假赢回行为在社交网络上呈现出的结构有非常明显的差异。一个真实用户决定转网通常不是孤立决策。他可能因为家人都用本网、因为同事推荐了某个套餐、因为小区宽带和手机融合更划算。所以真实赢回用户身边往往能找到和他有稳定通话、共同WiFi、同小区驻留的其他关联用户而且这些关联用户中本网用户的占比往往不低甚至会出现“一个人转网后带动两三个人跟着转”的现象。相反渠道制造的虚假赢回用户通常来自少量终端、少量WiFi环境下批量开户在社交图谱里呈现出高度聚集的星型结构或链条结构缺少真实生活中那种复杂、松散、多维度的社交关系。基于这个差异我们可以通过社交网络穿透来完成两件事一是识别黑灰产式的虚假聚集二是发现真实社交传播带来的增量价值。前者解决“防作弊”后者解决“算功劳”——正因为有后者渠道效果评估才能从“单次赢回是否真实”升级到“这次赢回是否带动了周围人”。2. 整体方案设计与技术选型2.1 核心指标框架从“赢回率”到“真实赢回系数”项目一开始业务方给我的需求很直接“我要一个能证明渠道没作弊的报表。”但我很清楚一个“是否作弊”的黑白名单报表解决不了问题还会引发渠道和业务之间的无数扯皮。所以我设计了一套分层指标体系最顶层是一个复合指标叫“真实赢回系数”它不是单一模型输出而是三个维度的加权合成指标计算口径说明真实性得分基于真实性判定模型的概率分衡量该赢回用户是真实携入的概率是基础门槛在网贡献次月在网、月均通话/流量达标衡量用户是否真实使用并留存社交传播贡献该用户关联社交圈内后续新增赢回/新入网数量衡量该用户带来的网络效应价值最终一个渠道的月度效果分就是把该渠道所有赢回用户的真实赢回系数累加后除以该渠道总赢回量。这个“真实赢回率”就是每个渠道的真金白银直接挂钩佣金系数和次月结算比例。这个设计的妙处在于它不是用“一票否决”的方式去定渠道的生死而是把质量折算成比例。渠道可以做高赢回量但真实赢回率上不去拿到的钱一样少。业务方和渠道方都不再有借口所有争议都能落到一个可解释的计算公式上。2.2 模型体系真实性判定、赢回增益与渠道归因这套项目里实际上有三个模型在协同工作不是一个模型包打天下。第一个是真实性判定模型解决“这个赢回用户真不真”的问题。它用历史审计样本人工复核确定过真假的用户做监督学习特征包括用户行为、终端、社交图谱特征、渠道触点特征输出一个0到1的真实性概率。第二个是赢回增益模型解决“用户本来会不会回来”的问题。这里用到了Uplift Model的思路。比如某个渠道触达了1000个异网用户其中200个回了网转化率20%。但问题在于这200个用户里可能有一部分本来就会因为其他因素回网并不完全是这个渠道的功劳。Uplift模型就是利用随机对照实验或观测数据的因果推断方法估算每个用户在“被该渠道触达”和“未被触达”两种情形下的赢回概率差这个差值才是渠道的真实增量贡献。第三个是社交穿透归因模型解决“赢回用户是谁拉回来的”和“他又影响了谁”的问题。一级归因还是传统的首个触点渠道归因二级归因则沿着社交网络做扩散评估把“种子用户带动周边用户转网”的部分计入对应渠道的传播贡献。这三个模型各有分工上游到下游形成串行关系真实性判定过滤掉虚假用户赢回增益压缩渠道功劳水分社交穿透归因补充渠道的网络价值。2.3 技术选型的取舍技术选型我在项目之初踩过不少弯路这里直接说说最终沉淀下来的方案数据处理和特征工程用Spark主要是量级太大——全量用户的通话详单和信令数据单日就是几十亿条。社交图谱的构建和社区发现用GraphX图规模在千万节点级别Louvain社区发现跑一次大约需要一个小时能接受。图特征查询和异常子图探索用Neo4j用来做案例回溯和可视化效率很高。真实性判定模型用LightGBM赢回增益模型用因果森林或者LightGBMUplift封装。为什么不直接上深度图神经网络核心原因是这套模型要面向渠道审计和佣金结算业务对每个score的解释需求极高。渠道方会拿着单个用户来质问“为什么说我不真实”用GNN很难给出让人信服的归因解释而树模型配合SHAP至少能说清楚“是因为该用户在30天内同一个WiFi下出现了6次新开户”。还有一个选型细节规则引擎不能省。模型再强也需要在硬规则边界上兜底。比如身份证黑名单、IMEI高频换机、激活后零通话零流量这些规则必须无条件优先于模型分数。逻辑很简单——渠道可以反驳模型但无法反驳“同一身份证当天开了3个号”这种铁证。3. 数据基础与特征工程实战3.1 数据盘点与合规边界做真实性和社交穿透分析数据基础是第一道坎。我们可以用到的数据分为两类一类是本网侧数据包括CRM资料、计费账单、通话详单、信令位置、WiFi连接记录、APP活跃日志、投诉工单、历史营销触达记录。这些数据质量高、字段全是特征工程的主力。另一类是异网侧数据要谨慎得多。这部分只有通过合规渠道获得的用户转网记录、携号转网查询记录、外呼意向登记以及一些脱敏后的第三方标签。异网用户在没有入网之前我们对他的行为和社交关系几乎一无所知这就决定了社交网络穿透的评估只能在“他入网后”通过他周边的本网关系反向回溯。合规方面整个项目严格遵循个人信息保护法相关要求所有数据完成去标识化处理社交关系边只保留统计聚合特征不落明细到业务库。涉及敏感个人信息的字段全部做加密存储和按需授权读取。这一点不是走过场而是必须从技术架构上限制数据访问面否则项目上线前就会被合规部门拦下。3.2 用户与行为特征体系在特征工程层面我把特征分成五组每组都有几个高价值的核心特征用户静态特征年龄段、历史入网时长、历史ARPU档位、离网原因标签、历史套餐偏好、终端品牌与价位。这里最有用的是“历史ARPU档位”——它直接刻画了用户离网前的价值高价值用户赢回后的真实性通常远高于低价值用户。离网后行为特征离网时长、携号转网查询次数、异网套餐使用天数通过IMEI在网识别、回到本网营业厅/APP的访问次数。一个离网半年后还在持续查转网资费的用户其赢回真实性天然更高。营销响应特征外呼接听率、短信点击率、意向等级、最近一次触点距离携入的时间间隔。这类特征在赢回增益模型里是主力。激活后行为特征激活后首日通话次数、首周流量消耗、国内主叫时长、短信验证码次数、常用APP活跃天数。正常用户转网后前三天至少有大量验证码短信和语音业务而养卡用户几乎静默。终端更换特征IMEI是否常驻本机、15天内是否换机、同IMEI下开户数量、同终端同时激活号码数量。这个特征组是识别“人机分离”批量操作的利器。3.3 社交网络特征与图谱构建社交图谱是整个项目的技术难点和亮点。我直接说我们是怎么建的以及踩过的坑。节点就是用户分为本网活跃用户、历史离网用户和赢回用户三类。边的构建有三个来源通话关系基于通话详单构建双向边。主叫和被叫都有记录才算强连接单向呼叫的权重打折扣。权重公式综合了通话频次、总时长、平均时长和双向性最终取对数归一化到0到1区间。同WiFi关系基于家庭宽带网关的接入记录构建。同一个WiFi下同时出现的用户大概率是家人或室友这是非常强的社交关系证据。但要注意公共WiFi场景比如商场、地铁、公司网络这类场景下的共连必须用“夜间时段长时间驻留”来过滤否则会出现大量虚假的弱连接。同基站共址关系基于信令数据构建。同一用户经常在同一基站下同一时段出现的两个号码可能存在通勤或居住关联。这个特征噪音较大通常只作为辅助边权重设得很低。图谱建好之后对每个赢回用户提取以下社交特征关联本网用户数、强关系数量、通话网络内的社区规模、社区内本网用户渗透率、与种子用户的最短路径长度、节点中介中心性。这里有一个非常重要的业务经验评估社交穿透价值时不要只看图的结构特征还要结合时间窗。社交传播的典型路径是用户A在某月10日转网A的强关系用户B在15日到30日之间也转网A和B的社区里还有其他本网用户。这个时间窗内的“先后接力”才是穿透的直接证据无时间窗的纯结构关联说服力不足。4. 模型实现与效果评估流程4.1 真实性判定模型真实性判定模型本质上是一个二分类模型正样本是“经人工复核确认为真实赢回”的用户负样本是“经审计确认存在作弊行为”的用户。样本来源主要有两个一是历史稽核中定性为渠道违规的用户二是随机抽样人工回访产生的标定样本。模型特征就来自上一章说的五组特征重点加上了图的异常特征比如用户所在连通分量的规模、连通分量内赢回用户占比、共同WiFi下的同时开户数量、同IMEI链路的用户数。训练时对类别不平衡做了处理作弊样本的正负比大约是1比8用了过采样和调整样本权重。评估指标上我用召回率作为主要指标因为对渠道审计来说漏掉一个作弊渠道的代价远大于误伤一个正常渠道。误伤可以通过申诉复核来修正漏掉就是真金白银的流失。最终模型AUC在0.91左右在历史数据上的作弊渠道召回率达到87%。但我们并不只看模型分而是设计了三级输出真实概率大于0.85直接放行计入渠道真实赢回量真实概率在0.5到0.85之间进入人工复核队列抽检回访真实概率低于0.5或触发硬规则直接标记为疑似虚假赢回不计入渠道佣金结算这套三档机制上线后很关键它避免了单一分数和渠道直接对立给了业务方复核的缓冲空间。4.2 社交穿透归因如何把“影子触达”算到渠道头上社交穿透归因是整套方案里争议最大的部分因为一旦把“关联用户带来的增量”计入某个渠道的功劳就等于把原本属于其他渠道的功劳做了再分配。我的做法是分成两步走。第一步先把“一级归属”定清楚。赢回用户入网后以他入网前7天内的营销触点记录为准首个有效触点归属到对应渠道。如果同一用户在多个渠道有触点则按时间优先 最后互动优先的规则协商归属。第二步再做“二级扩散归属”。当一个用户被判定为真实赢回后我们去他所在的社交网络社区里找在未来15到30天时间里还有没有其他异网用户也赢回了本网。如果有且这两个用户在赢回前就存在明确的强社交关系强通话、同WiFi共址等那么后续的赢回用户会被部分计入第一个用户的赢回渠道作为“社交传播贡献”。这里最容易引起争议的是“怎么确认后一个用户是受前一个影响”。我们的处理是设定一个严苛条件前一个用户必须在后一个用户赢回前的7天内和后一个用户有至少三次双向通话或一次同WiFi过夜共现并且后一个用户未在本期被任何渠道触发过有效营销触点。满足所有条件才能算作社交传播否则一律归到渠道主动触达。这个限制条件极大减少了“看着像传播实际是巧合”的误判也让渠道无法通过注册小号互相制造虚假传播。整个传播贡献最后通过一个衰减系数加权超过两跳的关系不再计算。4.3 渠道效果评估与迭代闭环渠道效果评估的最终输出是每月一张“渠道真实贡献报表”。报表里的核心指标包括指标说明赢回量该渠道本月携入用户总数真实赢回率通过真实性校验的用户数 / 赢回量次月在网率赢回用户中第二个月仍活跃的用户占比零次通话率激活后7天内零通话、零流量的用户占比社交传播系数该渠道赢回用户带来的二级传播赢回数 / 该渠道赢回用户数渠道净增益值基于Uplift模型计算的真实纯增量用户数未达标离网率首月离网且真实性校验未通过的用户数 / 赢回量这张报表同时发给市场部、渠道管理部和财务部。佣金结算直接按“真实赢回率”和“未达标离网率”两个指标的加权结果进行系数调整。比如真实赢回率低于70%的渠道佣金系数直接打五折次月再恢复到0.8连续两个月低于60%的渠道暂停赢回业务权限。这套闭环跑起来之后效果是立竿见影的。跑通的当季度整体赢回用户的次月离网率从标杆月的22%降到了9.8%零通话率从15%降到了4.3%渠道佣金支出反而下降了18%。渠道方也从最初的激烈反对到后来主动调整了话术和客户筛选标准——因为他们发现靠低质量用户刷量已经拿不到钱了。5. 实战复盘两个截然相反的案例5.1 案例一WiFi聚簇曝光的渠道作弊这个案例发生在系统上线后第三个月。一个地级市的代理渠道赢回量突然飙升从月均300多户涨到900多户区域汇报里说是启用了新的话术和“校园合伙人”模式。但我们的真实性报表显示该渠道的真实赢回率只有41%次月离网率高达38%两项都是全省最差。按常规方式排查这组赢回用户的实名认证都正常照片对比也看不出明显问题。我们于是把社交图谱拉出来看问题立刻现形了。这批赢回用户中有超过60%的新开户分布在同一个WiFi下而这个WiFi的注册地点是该渠道门店旁边的出租屋。图谱里呈现出非常典型的星型结构一个核心节点渠道工作人员持有的手机号和大量新入网用户有同WiFi共现关系且这些用户之间多数没有通话关系。另一个异常线索是终端。这批用户的IMEI高度集中有70%的号码在同一台改机工具上激活过15天内换机次数超过3次。我们把这些证据做成可视化报告后提交给稽核部门人工上门抽查了20户有17户表示“不知道这张卡”“没有办过转网”。后续确认是渠道拿到了目标名单后批量代客下单利用用户已授权的历史信息违规开户。最终结果该渠道佣金全额追回渠道资格取消相关责任人列入行业黑名单。这批规则在事件发生后做了固化同WiFi下30天内新开户超过5户、同IMEI下开户超过3个直接触发硬规则拦截不只是事后审计。5.2 案例二小区社交圈带来的真实增量和案例一形成鲜明对比的是另一个渠道的“意外收获”。某互联网代理渠道通过短视频投放拉回了一批中高端用户按传统归因方式这批用户的赢回成本很高单位获客成本超过了两百元业务方一度说要砍掉这个渠道的预算。但从社交穿透归因的报表里我们发现了一个有意思的现象这批用户里有一个赢回用户后续带动了同小区两个邻居转网。这两个邻居此前没有任何营销触点就是因为在同一个宽带WiFi下长期共现、且和种子用户有高频双向通话被判定为社交传播贡献计入该渠道。顺着这个线索深挖该渠道的社交传播系数达到了0.18显著高于全省均值0.05。也就是说这个渠道每赢回100个用户会额外带来18个由社交关系驱动的免费赢回。把这部分传播价值折算进获客成本后实际单位成本降到了七十多元渠道的性价比排名从倒数第三跃升到正数第二。这件事给业务方最大的启发是渠道效果评估不能只看单次触达更要看用户背后的社交涟漪。后来我们把社交传播系数纳入了预算分配模型对高传播渠道给予额外加成对低传播渠道压缩投放预算。6. 常见问题与排坑实录6.1 数据可用性与合规问题Q异网用户在本网没有任何数据社交穿透怎么做这是新手最容易卡住的问题。实际执行中社交穿透不是直接在异网用户身上做而是在他入网后回溯他入网前一段时间内与本网用户的历史交互。如果他在入网前和本网用户有稳定的通话、同WiFi共址等关系这些关系可以从历史数据中重建。所以真正要解决的是“异网用户关联本网用户”的映射而不是“追踪异网用户本身”。Q合规上有没有红线有而且很硬。社交关系、位置轨迹、WiFi记录都属于敏感信息。我们的处理原则是能画边、不落点能聚合、不明文。具体说就是社交边只保留聚合统计特征不保留可以反推关系的具体明细WiFi共现只记录“是否共现”和“共现频次”不记录WiFi的物理地址。上线前合规会审花了两周但这一步省不掉。6.2 模型效果问题Q作弊样本太少模型训练效果不稳定怎么办我们面临过同样的困境历史审计样本不到两千个分布还不均衡。解决办法有两个一是把人工回访的抽检率从千分之一提升到百分之一两个月内就能积累超过五千个标定样本二是采用半监督思路先用规则强特征的聚簇结果做伪标签再和人工标注合并训练。后者有一定风险需要人工对伪标签质量做周度抽样评估。QUplift模型结果不显著怎么办关键在用对时间窗和对照组。我们发现赢回场景最适合的时间窗是触达后30天小于30天很多用户还没完成决策大于60天会有太多外部干扰因素。对照组的选择也要格外小心直接用没有触达的用户做对比会有严重的选择性偏差建议先做PSM配平。如果配平后ATT平均处理效应仍然很小那说明这个渠道确实只有量没有效这个结论本身就有价值。6.3 业务落地问题Q渠道不认模型结果反复申诉怎么处理这是必然会出现的问题。我们的应对办法是建立申诉-复核-修正机制。渠道对某一批用户的真实性标记有异议可以提交补充材料申请人工复核。复核不通过的案例要形成定期的复盘会把原因归纳成规则或特征补充到模型里。上线前一定要让渠道管理部参与规则评审否则他们会把模型当成“让渠道少拿钱的黑盒”天然对抗。Q销售部门和风控部门目标冲突怎么办销售部门要增量风控部门要真实目标天然有张力。我的经验是不要试图让某一方做妥协而是把“真实赢回系数”同时纳入两边的KPI。销售完成了1000个赢回但真实赢回率只有60%按折算只能算600个风控发现了异常但不能只拦截要输出改进建议。当两个部门都看同一个数冲突就会大幅减少。项目上线到现在有半年多了我个人体会最深的一点是这套方案真正的价值不是把模型调得多准而是让“真实性”从一个模糊的口号变成了一套可计算、可申诉、可迭代的机制。渠道和业务团队最终接受的也不是某个模型而是一套公平的规则。下一步我计划把社交穿透的思路运用到异网新用户场景并尝试引入实时流计算把周级的评估压缩到天级。这个方向还有很多值得挖的地方后面有进展再来分享。
返回列表