尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

从0到1构建用户画像系统:政策快报平台的实践

从0到1构建用户画像系统:政策快报平台的实践 政策快报平台的核心功能之一是“智能推荐”——把用户可能感兴趣的政策推送到他面前。推荐准不准取决于用户画像的精准度。如果只知道用户是“制造业”系统只能推荐“制造业”标签下的所有政策范围太宽精准度有限。如果知道用户是“汽车零部件制造、营收5000万、关注技改补贴、近期搜索过专精特新”推荐就能精准很多。用户画像系统就是用来构建这个“用户理解层”的。本文复盘政策快报平台用户画像系统从0到1的搭建过程。用户画像系统的3个核心模块模块一数据采集——用户画像的“原材料”用户画像是怎么来的不是猜的是从用户行为中“算”出来的。画像系统的第一步是采集用户数据包括注册信息、行为数据、反馈数据。注册信息包括用户注册时填写的行业、地区、企业规模等这是画像的“种子数据”。行为数据包括用户点击了哪些政策、搜索了什么关键词、停留了多久、收藏了什么政策反映用户的真实兴趣比注册信息更准确。反馈数据包括用户标记“不感兴趣”的政策和用户发起申报咨询的项目反映用户的明确偏好和转化意向。数据采集的原则是“尽可能采集但不过度采集”只采集对推荐有直接帮助的数据。模块二标签体系——用户画像的“骨架”原始数据需要转化成可用的标签标签体系的设计决定了画像的表达能力。政策快报平台的标签体系分几个维度行业标签按三级分类制造业→汽车零部件→新能源汽车零部件企业规模标签按营收和人数分段政策类型标签按项目性质分类资金补贴、资质认定、税收优惠、人才政策行为标签描述用户的行为偏好高频搜索者、深度阅读者、申报转化者。标签体系既要足够细能区分不同用户又不能太碎否则数据稀疏无法形成有效画像。政策快报平台目前维护约200个标签覆盖行业、地区、规模、行为四个维度。模块三画像计算——从数据到画像采集了数据、设计了标签体系下一步是“算”出每个用户的画像。政策快报平台画像计算包含三个层次基础层根据注册信息直接打标签用户选了“制造业”就加上制造业标签行为层根据用户行为更新标签权重用户点击了3条专精特新政策专精特新标签权重3搜索了“技改补贴”技改补贴标签权重2预测层根据相似用户的行为推断潜在兴趣同一行业的其他用户都关注了某类政策但该用户还没关注系统预测他可能也有兴趣。画像计算每天凌晨执行一次更新所有用户的标签权重。实时行为如用户刚刚点击了一条政策通过在线服务即时更新确保推荐时效性。用户画像的技术选型存储方案选择画像数据的特点是多维度标签权重。用关系型数据库存储用户标签、用Redis缓存热数据用Elasticsearch支持画像检索。更新机制离线全量计算每天凌晨更新所有用户画像在线增量更新实时行为即时更新Redis缓存。更新周期需要根据业务特点权衡画像更新越频繁计算成本越高更新间隔太长又无法反映用户的最新兴趣变化。效果数据指标无画像系统有画像系统推荐点击率约18%约36%用户停留时长2.1分钟/天3.8分钟/天推荐准确率约22%约45%新用户冷启动时间约2周约3天经验总结从简单开始逐步丰富。最早的用户画像只有“行业地区”2个标签现在有约200个标签用了3年逐步扩展。不要一开始就想建“完美画像系统”。行为比问卷更真实。用户自己选的标签注册时填的和实际点击的内容往往不一致。优先使用行为数据。标签不是越多越好。每增加一个标签维度计算复杂度都会上升。标签数量需要和计算能力匹配在画像精度和系统性能之间找到平衡。用户画像系统是推荐系统的基础设施。画像越精准推荐越准。政策快报平台的实践表明从行业、地区等基础标签开始逐步叠加行为数据和预测数据画像精度会持续提升。
返回列表