把形象拿掉,看剩下什么

讨论数字人时,最先被注意到的往往是外观:脸是否自然、口型是否对得上、表情是否僵硬。这些当然重要,但它们只是最外面的一层。

一个简单的检验办法是:把形象整体隐藏,只保留数字人给出的内容。这时如果一段播报仍然事实正确,一条训练建议仍然对症,那么价值来自形象之外的部分;如果没有形象就没有内容,说明它只是把预先写好的文字读出来。

在体育场景里,这个检验尤其有意义。一位数字主播讲错了比分,无论它的嘴型多么自然,用户记住的只有“这个信息不可靠”。一位数字教练把一个正常的动作误判为错误,用户也不会因为它形象亲切就原谅这次纠错。外观决定第一印象,系统决定长期信任。

表现层:形象、声音与动作

先把表现层说清楚,这样才能看出它在整体里的位置。表现层包含:

  • 形象:外观、服饰、场景与品牌风格。
  • 声音:音色、语速、情绪,以及体育术语的读法。
  • 口型与表情:让语音与面部同步,传递语气。
  • 肢体动作:手势、站姿,在教练场景里还包括示范动作。

表现层的特点是可替换、可调整,并且不承担事实判断。同一套内容,换一个形象、换一种声音,都应该保持结论不变。这也是一个设计检验:如果换了形象就会改变内容的对错,说明表现层与判断层没有分开。

智能层:七种能力各管什么

在表现层之下,数字人需要的是一套协同工作的能力。我们把它归纳成七项:

能力 负责什么 在体育场景里的例子(示意)
数据 接入实时与历史信息 赛事事件流、训练记录、传感器信号
知识 规则、术语、方法 越位规则、压迫的含义、深蹲的动作要点
语音 听懂与说出 识别用户提问,合成播报或讲解
视觉 看懂画面 比赛画面里的球员位置,摄像头里的人体姿态
记忆 记住用户与上下文 用户关注哪支球队,上次训练卡在哪个动作
实时交互 在时间约束下响应 被打断后立即停下,赛场变化后放弃过期内容
动作形体与示范数字人演示与用户动作有差异的部分

这七项不是七个孤立的模型,而是七类职责。有的用大模型承担,有的用专门的姿态、追踪或语音模型承担,有的甚至完全不用模型,而是用规则与数据库。合理的做法是让每个职责由最适合的方式完成,再通过清楚的接口连接起来,这一点在大模型与姿态模型如何协作中有更详细的讨论。

体育数字人额外需要的三类专业知识

通用的数字人可以陪人聊天、讲故事、回答常识。体育场景则要求更多专业内容,至少有三类:

第一,体育规则与赛事结构。 越位、点球、加时赛、积分规则、联赛赛制,这些是事实性知识,必须准确。模型凭记忆回答容易出错,所以规则类内容更适合来自经过维护的知识库。

第二,比赛上下文。 同一个数据在不同语境里含义不同。某位球员本场跑动距离较少,可能因为他刚替补上场,也可能因为战术要求他留在后方。数字主播需要知道当前的比赛阶段、阵容与战术变化,才能避免把数字讲成误导性的结论。

第三,运动技术要点。 深蹲时髋部后移、跑步时触地方式、羽毛球击球时的转体,这些技术描述要能与动作数据对应起来。教练如果只会说通用的鼓励,不会把“膝盖内扣”与“脚掌压力分布”联系起来,就谈不上教学。

缺少这三类知识时,数字人往往表现为“语言很流畅,内容很外行”,这种问题比明显的错误更难被发现。

记忆:记住什么,忘记什么

记忆是数字人区别于一次性问答工具的重要一环,也是最需要谨慎设计的一环。

值得记住的,是与体验直接相关的偏好:用户关注的球队、喜欢的讲解深度、上次训练里持续出现的动作问题。不该被默认保留的,是与当前任务无关的敏感信息。更合理的做法包括:

  1. 记忆内容对用户可见,可以查看、修改和清除。
  2. 训练和身体相关的记录,与球迷内容的兴趣记录分开管理,按需要授权。
  3. 记忆只影响表达和排序,不改变事实与安全建议。

这一点与数字体育Agent如何执行任务也相关:一个能主动做事的系统,更需要清楚的权限与确认边界。

实时交互:时间是数字人独有的约束

文本问答可以慢一点,数字人不行。它有几个与时间相关的要求:

  • 可打断:用户中途提问或者比赛出现新事件时,能立即停下正在说的内容。
  • 可丢弃:已经过期的内容不应该被继续播完。
  • 可降级:某一环节变慢时,退回更保守、更简短的表述。

这些要求决定了数字人系统不是“生成一段话再朗读”那么简单,而是一条需要调度的实时链路。

两个例子:主播与教练拿掉形象以后

用两个举例的场景,看看拿掉形象后各自还剩什么。

数字主播。 假设比赛第七十分钟,甲队完成一次换人。事件流里出现“换人”事件,系统需要确认这条事件有效,找到对应的下场与上场球员,再判断这次换人是否值得讲:如果只是常规换人,一句话带过;如果换上的是一名防守型中场,而甲队正在领先,就值得补充一句战术意图。整个过程中,没有一步需要形象参与。形象只在最后,把这句话说出来。

数字教练。 假设用户做了一组深蹲,摄像头捕捉到后半程膝盖有内扣的趋势。系统需要从骨骼关键点算出角度变化,判断这是偶发还是连续出现,再决定是立刻提醒、留到组间说,还是放到训练后总结,最后把结论变成“下一组先放慢下蹲速度,让膝盖对准脚尖方向”这样的一句话。形象同样只是最后一步。

这两个例子里,真正花力气的都是“形象之前”的环节。也正因为如此,我们说数字人的价值在系统,而不在头像。

几个常见的误区

围绕数字人,有几种常见的误解,值得一并澄清:

  • “拟真度越高越好。” 拟真度提升的是亲和力,不能替代准确性。过于拟真而内容不可靠,反而会放大误导。
  • “一个大模型就是一个数字人的大脑。” 大模型擅长语言表达与推理,但比分、姿态、心率这类结构化信息,更适合由专门的数据与模型提供,再交给语言模型去表达。
  • “数字人越像真人越不需要说明边界。” 恰恰相反,越像真人,越需要明确告知用户它是AI,以及它能做什么、不能做什么。
  • “个性化就是让数字人更懂我。” 个性化改变的是讲法与侧重,不应该改变事实,更不应该在没有授权时收集与任务无关的数据。

怎样判断一个体育数字人是否可信

从上面的层次出发,可以给出一份朴素的检查清单,读者在评估任何体育数字人产品时都可以用:

  1. 关掉形象,内容是否仍然成立?
  2. 关键事实(比分、人名、时间、数据)能否追溯到来源?
  3. 出错时有没有撤回、更正或保守表述的机制?
  4. 反馈是否与用户的具体动作或具体场景对应,而不是通用的套话?
  5. 个人记录是否可见、可改,并且按需授权?
以上是系统设计的方向与评估思路,并不表示所有环节都已经达到同样的成熟度。文中的场景与数字均为示意,具体能力以江南体育官网后续公布的信息为准。

小结

数字人的外观是表现层,值得认真做,但它不是价值所在。价值来自数据、知识、语音、视觉、记忆、实时交互与动作这一整套系统,而体育场景又叠加了规则、赛事上下文和运动技术三类专业要求。江南体育官网谈数字人,谈的主要是这套系统,而不是那张脸。