一个观察:用得更多,信得更少
想象一个场景。周末赛前,你在手机上看到一段AI生成的赛前简介,里面写着某位主力前锋“本赛季状态火热”。你不确定他是否已经伤愈复出,也不确定这条“状态”指的是最近几场还是整个赛季。这时你需要的不是更多段落,而是一个能核对的依据。
这种感受在调查数据里有对应的痕迹。IBM于2026年8月发布的体育球迷调查,覆盖约2万名球迷(20,589人)、12个国家,调查在2026年6月进行。其中几项与本文相关:
- 使用AI的球迷比例从52%升到69%。
- 对AI生成体育内容的信任度为59%,此前为63%。
- 44%的受访者更看重信息的高准确性,23%更看重速度。
- 准确性是建立对AI体育洞察信任的首要因素,占45%。
放在一起看,是一条相当清楚的线索:使用在增加,信任略有回落,而当被问到“最重要的是什么”时,准确性排在速度前面。
这些数字能说明什么,不能说明什么
数字很容易被过度解读,所以先划清边界。
能说明的:
- AI已经进入球迷的日常信息获取,不再只是尝鲜。
- 使用量增加与信任度提升并不是同一回事,两者可以背离。
- 对相当一部分球迷来说,准确性比速度更重要,至少在这项调查的口径里是这样。
不能说明的:
- 它没有讨论个性化内容是否更受欢迎,也没有比较不同类型球迷的偏好。
- 它没有说明信任下降的具体原因,我们不能把责任归到某类内容或某个产品上。
- 它是一次问卷,反映的是受访者的态度,而不是内容的真实错误率。
我们引用这项调查,是把它当作一个方向性的提醒,而不是证明某种产品做法“有效”的依据。后面的产品推论,是江南体育AI自己的设计思路,需要在实践中继续检验。
从“准确”到“可核查”:内容生产的四道关卡
球迷说“要准确”,落到内容系统里,不能只靠一句“让模型别出错”。更可行的做法是把准确性拆成生产链路上的四道关卡,每一道都有具体的动作。
一、Data Grounding:先有数据,再有文字
生成内容之前,先确定这段话用到的事实来自哪份结构化数据:比分、阵容、伤停、赛程、球员统计。模型可以负责组织和表达,但不应该凭“记忆”补事实。举例来说,某条赛前内容要写“甲队近五场取得三场胜利”,这个数字应当是从赛程数据里算出来的,而不是由模型估一个听起来合理的说法。
这一步的关键是数据的时效与语境。教练变了、阵容变了、关键球员伤停,旧的历史数据就可能不再适用,这一点在赛前分析为什么不能只拼历史数据里有更完整的讨论。
二、Fact Checking:生成后再校验一遍
即使数据锚定了,生成的文字仍可能出错,比如把两个球员的数据张冠李戴,或者把“射正”写成“射门”。所以要有自动校验:文中出现的数字、球员姓名、时间、比赛结果,逐项与数据源比对,不一致就拦截或重写。校验规则越贴近体育语义(例如进球不可能超过射门),越容易抓到错误。
三、Source Attribution:让读者知道信息从哪来
来源标注不是可有可无的装饰。当内容里有一个数据,读者应当能大致知道它来自哪一类数据、更新到什么时候。这并非让每条内容都附上冗长的脚注,而是在关键数据旁提供可展开的“依据”,例如“数据截至某场比赛结束后”。有了这个入口,信任才有可以落脚的地方。
四、Human Review:高风险内容留给人
不是所有内容都需要人工审核,但应当有分级:影响较大、语境复杂或涉及争议的内容,比如伤病相关表述、纪律处分、转会传闻,宁可慢一点,由编辑确认后再发布。让模型自己判断“我是否确定”是不够的,人工审核的价值在于它是独立于模型的第二道防线。
个性化让准确性变得更难,还是更容易
个性化的方向是“不同球迷看到不同内容”,这会带来一个直接的治理问题:内容的版本变多了,需要核验的对象也随之成倍增加。一场比赛如果生成几十个面向不同关注点的版本,每个版本里的数字是否一致、是否和同一份数据对齐,就成了新的工程问题。
我们的判断是,个性化应当发生在选择与排序上,而不是发生在事实上。也就是说,不同的人可以先看到不同的信息,但同一个事实,在所有版本里只能有一个答案。这样,核验的重心就从“逐篇检查”转向“检查事实层是否唯一、正确”。关于个性化本身的设计,可以看球迷真正想看的不是“更多内容”。
速度与准确的平衡:一个设计上的折中
调查里更多球迷选择准确性,并不意味着速度不重要。更合理的做法,是让不同性质的内容采用不同的节奏:
| 内容类型 | 更适合的策略(示意) |
|---|---|
| 已确认的比分、赛果 | 快速发布,来源直接来自数据源 |
| 需要语境判断的分析 | 稍慢,经过核验后发布 |
| 尚未证实的信息 | 明确标注为待确认,或暂不发布 |
这个表是设计思路的示意,并不代表任何已经上线的系统的实际策略。
对读者一侧的设计:让核对变得省力
准确性不只是后台的事。如果读者想核对一条信息,却要跳出页面、打开另外三个网站,那么再严格的后台核验也很难转化成信任。更实际的做法,是把“核对”做成阅读动作的一部分。
- 关键数字可点开:比分、出场时间、伤停状态这类容易引发争议的信息,点开后能看到依据与更新时间。
- 不确定就直说:数据缺失或来源不一致时,内容里应当写明“暂无确认”,而不是用一个流畅但没有依据的句子填上。
- 更正可见:内容被修改时保留一条简短的更正记录,让读者知道哪里变了、为什么变。
- 允许反馈:读者发现问题可以直接指出,反馈进入核验队列,而不是石沉大海。
这些设计有一个共同点:它们承认系统会出错,并把出错之后的处理方式摆到读者面前。相比宣称“内容绝对准确”,这种做法更容易建立长期的可信度。举例来说,假设一条赛后内容因为数据源延迟,把某次射门记在了错误的球员名下,几分钟后被更正并标注了原因,读者对这份内容的判断,往往比看到一份从未出错的“完美”记录更稳定。
还没解决的问题
写到这里,也要承认这套做法的限制。
- 数据源本身会出错。锚定在错误的数据上,只会把错误写得更工整。数据入库时需要独立的核验,但这意味着成本与延迟。
- 核验规则覆盖不了全部语义。数字容易校验,“这场比赛的转折点在哪里”这类判断却很难用规则完全约束。
- 来源标注会增加阅读负担。标得太多会打断阅读,标得太少又起不到信任作用,标注的粒度需要反复试。
- 信任是长期积累的。一次严重的事实错误,可能抵消很多次正确。对内容系统来说,更值得投入的是“错了之后如何更正并留下记录”。
关于实时场景中事实与表达的取舍,可以参考AI体育主播为什么容易把事实正确和表达自然顾此失彼。我们会继续跟踪这类调查与研究,但产品判断仍以自己的设计与测试为准。