同一支球队的三位球迷,想看的东西不一样
先设想一个举例场景:甲队有三位长期关注的球迷。第一位是青训爱好者,他关心的是二队和U19出了哪些新人,哪位年轻中场上了替补席;第二位是战术型球迷,他想知道对手为什么总能在边路制造二打一,教练换了三中卫之后压迫线有没有后移;第三位只在比赛日出现,开赛前三分钟打开手机,只想扫一眼首发名单、谁伤停、要不要赶回家看直播。
传统体育内容平台的常见做法,是按热度或球队标签推送:只要标签是“甲队”,三个人看到的首页几乎一样,都是最近的赛果、转会传闻和热门评论。这种做法并不算错,它的优点是简单、稳定、容易解释,缺点是把“球迷”看成了一个整体。上面三个人的真实需求分别落在球员成长、战术结构和快速信息三处,标签层面完全看不出差别。
所以江南体育AI的出发点不是“怎样推更多内容”,而是“怎样弄清这个人是怎样关心体育的”。内容的供给其实从来不缺,缺的是把合适的内容在合适的时刻用合适的深度交给合适的人。这一点也是我们把球迷内容当作一个独立方向来研究的原因:它更像一个理解问题,而不只是一个排序问题。
把兴趣拆开:球队、球员、赛事、内容类型、阅读深度
“他喜欢什么”这个问题太粗,需要拆成几个互相独立的维度,否则任何一次点击都只能被折叠成一个模糊的标签。我们倾向于把画像拆成下面五层:
- 球队兴趣:关注哪支或哪几支球队,是主队情结,还是同时关注几支风格相近的球队。
- 球员兴趣:关注具体球员,还是关注某个位置、某种角色,例如“后腰”或“出球中卫”。
- 赛事兴趣:联赛、杯赛、国际比赛的偏好,以及对淘汰赛与常规赛的关注差异。
- 内容类型:赛前分析、赛后复盘、数据卡、战术图解、青训新闻、转会消息、赛程提醒等。
- 阅读深度:是三行扫读,还是愿意把一篇几千字的战术分析读完。
这五层里,前三层回答“关心什么对象”,后两层回答“希望怎样被告知”。很多推荐系统只做前三层,因此会出现一种熟悉的尴尬:系统知道你关心甲队,却总给你推一条你根本不会点开的长篇评论,因为它不知道你只想要两分钟的速览。
阅读深度尤其容易被忽略。它不能靠用户自己填写,因为大多数人并不清楚自己的阅读习惯;它更适合从行为里慢慢推断,例如同一类内容平均读到哪一段、是否展开过数据卡的详细项、是否回头看过某个图表。当然,这里的推断只能是“倾向”,不应当变成“定论”,后文会说到这一点。
短期兴趣与长期兴趣,不能共用一个开关
回到开头举例的场景。假设某位球迷连续三天点开同一位边锋的新闻。如果系统把这看成“他喜欢这位边锋”,接下来一周他的首页就会被这位边锋占满。但真实情况可能有两种:一种是这位边锋刚好被曝出转会传闻,热度只维持几天;另一种是这位球迷长期在追这类边路球员的技术特点。
两种情况要用不同的方式处理,办法是给信号分层:
- 短期信号:近几天的点击、搜索、停留,权重高但衰减快。它的作用是让首页“跟得上此刻的热点”,比如比赛日前后对相关球队的关注会明显上升。
- 长期信号:跨周、跨月反复出现的行为,权重上升慢,也衰减得慢。只有一个话题在多个时间段里都被主动选择,才写入长期画像。
- 事件驱动的临时兴趣:例如一场杯赛、一次国际比赛周期,它会带来集中的关注,但赛事结束后应当自动降级,而不是留在画像里。
一个实用的判断标准是:如果没有新的热点新闻推动,这个兴趣还会不会自己出现?如果会,它更可能是长期兴趣;如果不会,它就更像被事件带出来的短期兴趣。这个判断并不完美,比如新球员刚加盟时的关注可能是短期的,也可能会慢慢变成长期的,所以长期画像的更新要保守,宁可慢一点,也不要因为一次热点就改写一个人的兴趣结构。
信号从哪来:显性反馈与隐性反馈
画像的原料是反馈,反馈有两类,各有各的问题。
| 类型 | 举例 | 优点 | 主要风险 |
|---|---|---|---|
| 显性反馈 | 关注球队、点“不感兴趣”、在设置里勾选偏好 | 意图明确,几乎不需要猜 | 用户不愿意填,填了也可能过时 |
| 隐性反馈 | 点击、停留、滑动、收藏、分享、重复打开 | 数量大,能覆盖用户自己说不清的偏好 | 容易被标题吸引的点击误导,含有偶然性 |
隐性反馈里最容易出错的是“点击”。标题起得夸张会带来点击,但点开后立刻退出,这条信号的意思恰恰相反。所以点击本身不应当被当成正向信号,需要和停留时长、是否读到后半段、是否回访相关内容一起判断。同样,“收藏”比“点击”更接近真实兴趣,“主动搜索某个球员”比“被推荐后点开”更接近真实兴趣。
显性反馈的价值在于纠错。一位用户只要点过一次“不想再看这类内容”,系统就应当立刻、明显地照办,而不是把这条当成一个权重稍微降低的普通信号。用户在被误解时的耐心很短,一次明确的否定被忽略,比十次推荐不准更伤信任。
冷启动:没有历史时,别装作已经了解用户
新用户没有任何行为数据,这是个性化系统最尴尬的时刻。常见的错误是用热门内容硬撑,或者让用户一次性勾选几十个标签。前者让所有新用户看到同样的首页,后者让用户在还没看到任何价值之前就先做一份问卷。
更合理的做法是把冷启动拆成很小的几步:先只问一两个最影响首页结构的问题,比如“你更想看比赛,还是做训练”“你更想快速扫一眼,还是愿意深入阅读”。江南体育App在首次使用时的入口设计,正是沿着这个思路展开的,具体可以看首次使用为什么先问看比赛还是做训练。之后再靠前几次的真实使用逐步补充:用户点开了第一篇赛前分析,就多观察这一类的阅读深度;用户第一次打开数据卡,就记录他先看了哪几项。
冷启动阶段还有一个原则:没有把握的地方就保持宽泛,不要硬猜。一位新用户只看过两篇甲队的内容,把他直接归为“甲队铁杆球迷”,并不比把他放在一个较宽的“关注中超和欧洲联赛”的位置更准确。宽泛的推荐虽然平淡,但不会在早期就把用户推进错误的兴趣通道。
画像要让用户看见,并且改得动
个性化系统最容易被质疑的地方是“你到底根据什么在推荐”。如果画像是一个用户看不见的黑箱,任何一次不准确的推荐都会变成“它在偷偷窥探我”的印象。江南体育AI更倾向于把画像做成一个可以打开的页面:
- 用户可以看到系统当前理解的兴趣,例如“球队:甲队;内容类型:赛前分析、青训;阅读深度:偏好速览”,并且每一项都标明大致来源,是自己选的,还是根据行为推断的。
- 每一项都可以一键删除、暂停或者改成“只在比赛日显示”。
- 用户可以整体清空画像重新开始,也可以只关闭个性化,让首页回到按时间与热度排序的样子。
这样做有两个直接的好处。第一,用户的修正会变成最高质量的反馈:一个人亲手删掉的兴趣,比任何模型推断都更可靠。第二,可见性本身会约束设计:只要画像是给用户看的,系统就不太会往里写一些难以解释的推断,比如某个不便说明的敏感属性。
隐私方面,我们的设计倾向是最小化:只保留生成个性化所必需的行为摘要,能在设备端完成的推断尽量放在设备端,不需要保存原始点击记录的场景就不保存。具体的数据处理方式以隐私说明与App内公布的内容为准。
个性化改变的是组织方式,不是事实
个性化有一条不应当逾越的边界:它改变内容的选择、排序和深度,不改变事实。同一场比赛,比分、阵容、进球时间、红黄牌,所有用户看到的都必须一致。战术型球迷看到的是更长的推进路线分析,快速浏览型球迷看到的是更短的要点清单,但两者背后引用的是同一份经过核验的比赛数据。
这条边界的实际意义在于:如果个性化可以改变事实,用户之间就会形成一种彼此看不见的分歧,同一场比赛在不同人那里有不同版本。这既伤害信任,也会让内容治理无从下手。因此在设计上,内容生成之前应当先确定事实层,个性化只作用在事实层之上的表达层。这个思路与赛前分析为什么不能只拼历史数据里的做法是一致的:先确认哪些数据是当前有效的,再谈怎样为不同的人组织它。
IBM 2026年球迷调查显示,44%的受访者更看重信息的高准确性,23%更看重速度,准确性也被列为建立对AI体育洞察信任的首要因素。这份调查并没有讨论个性化,我们引用它只是想说明:球迷对AI内容的第一要求是别出错。个性化再细致,也不能以牺牲这一条为代价。
还没解决的问题
有几个问题我们目前只有倾向性的判断,没有确定的答案:
- 推断与尊重的界线。从行为里推断一个人喜欢什么是合理的,但推断得太细,用户会觉得被“看穿”。哪些推断应当只留在内部排序里,哪些可以写进用户可见的画像,需要持续修正。
- 个性化会不会越推越窄。把用户喜欢的东西推得越准,他见到陌生内容的机会就越少。这是一个独立且重要的话题,我们在个性化体育内容会不会越推越窄里单独讨论了保留“陌生但相关”内容的办法。
- 兴趣的自然变化。一个人的兴趣会因为换工作、换城市、孩子开始踢球而改变,画像需要有能力发现这种变化,又不能对偶然波动反应过度。
- 评价方式。点击率高,不一定说明用户真的觉得有用。更接近价值的指标,例如用户是否在读完后回头查看相关内容、是否主动修改画像,都比较难量化,需要更细致的观察。
对江南体育AI而言,个性化不是一个“开或关”的功能,而是一种对用户的持续理解,这种理解应当保持谦逊:能被看见,能被纠正,不越过事实的边界。目标不是让球迷看到更多,而是让每位球迷更容易看到他真正在乎的那一部分。