把形象拿掉,看剩下什么
讨论数字人时,最先被注意到的往往是外观:脸是否自然、口型是否对得上、表情是否僵硬。这些当然重要,但它们只是最外面的一层。
一个简单的检验办法是:把形象整体隐藏,只保留数字人给出的内容。这时如果一段播报仍然事实正确,一条训练建议仍然对症,那么价值来自形象之外的部分;如果没有形象就没有内容,说明它只是把预先写好的文字读出来。
在体育场景里,这个检验尤其有意义。一位数字主播讲错了比分,无论它的嘴型多么自然,用户记住的只有“这个信息不可靠”。一位数字教练把一个正常的动作误判为错误,用户也不会因为它形象亲切就原谅这次纠错。外观决定第一印象,系统决定长期信任。
表现层:形象、声音与动作
先把表现层说清楚,这样才能看出它在整体里的位置。表现层包含:
- 形象:外观、服饰、场景与品牌风格。
- 声音:音色、语速、情绪,以及体育术语的读法。
- 口型与表情:让语音与面部同步,传递语气。
- 肢体动作:手势、站姿,在教练场景里还包括示范动作。
表现层的特点是可替换、可调整,并且不承担事实判断。同一套内容,换一个形象、换一种声音,都应该保持结论不变。这也是一个设计检验:如果换了形象就会改变内容的对错,说明表现层与判断层没有分开。
智能层:七种能力各管什么
在表现层之下,数字人需要的是一套协同工作的能力。我们把它归纳成七项:
| 能力 | 负责什么 | 在体育场景里的例子(示意) |
|---|---|---|
| 数据 | 接入实时与历史信息 | 赛事事件流、训练记录、传感器信号 |
| 知识 | 规则、术语、方法 | 越位规则、压迫的含义、深蹲的动作要点 |
| 语音 | 听懂与说出 | 识别用户提问,合成播报或讲解 |
| 视觉 | 看懂画面 | 比赛画面里的球员位置,摄像头里的人体姿态 |
| 记忆 | 记住用户与上下文 | 用户关注哪支球队,上次训练卡在哪个动作 |
| 实时交互 | 在时间约束下响应 | 被打断后立即停下,赛场变化后放弃过期内容 |
| 动作 | 形体与示范 | 数字人演示与用户动作有差异的部分 |
这七项不是七个孤立的模型,而是七类职责。有的用大模型承担,有的用专门的姿态、追踪或语音模型承担,有的甚至完全不用模型,而是用规则与数据库。合理的做法是让每个职责由最适合的方式完成,再通过清楚的接口连接起来,这一点在大模型与姿态模型如何协作中有更详细的讨论。
体育数字人额外需要的三类专业知识
通用的数字人可以陪人聊天、讲故事、回答常识。体育场景则要求更多专业内容,至少有三类:
第一,体育规则与赛事结构。 越位、点球、加时赛、积分规则、联赛赛制,这些是事实性知识,必须准确。模型凭记忆回答容易出错,所以规则类内容更适合来自经过维护的知识库。
第二,比赛上下文。 同一个数据在不同语境里含义不同。某位球员本场跑动距离较少,可能因为他刚替补上场,也可能因为战术要求他留在后方。数字主播需要知道当前的比赛阶段、阵容与战术变化,才能避免把数字讲成误导性的结论。
第三,运动技术要点。 深蹲时髋部后移、跑步时触地方式、羽毛球击球时的转体,这些技术描述要能与动作数据对应起来。教练如果只会说通用的鼓励,不会把“膝盖内扣”与“脚掌压力分布”联系起来,就谈不上教学。
缺少这三类知识时,数字人往往表现为“语言很流畅,内容很外行”,这种问题比明显的错误更难被发现。
记忆:记住什么,忘记什么
记忆是数字人区别于一次性问答工具的重要一环,也是最需要谨慎设计的一环。
值得记住的,是与体验直接相关的偏好:用户关注的球队、喜欢的讲解深度、上次训练里持续出现的动作问题。不该被默认保留的,是与当前任务无关的敏感信息。更合理的做法包括:
- 记忆内容对用户可见,可以查看、修改和清除。
- 训练和身体相关的记录,与球迷内容的兴趣记录分开管理,按需要授权。
- 记忆只影响表达和排序,不改变事实与安全建议。
这一点与数字体育Agent如何执行任务也相关:一个能主动做事的系统,更需要清楚的权限与确认边界。
实时交互:时间是数字人独有的约束
文本问答可以慢一点,数字人不行。它有几个与时间相关的要求:
- 可打断:用户中途提问或者比赛出现新事件时,能立即停下正在说的内容。
- 可丢弃:已经过期的内容不应该被继续播完。
- 可降级:某一环节变慢时,退回更保守、更简短的表述。
这些要求决定了数字人系统不是“生成一段话再朗读”那么简单,而是一条需要调度的实时链路。
两个例子:主播与教练拿掉形象以后
用两个举例的场景,看看拿掉形象后各自还剩什么。
数字主播。 假设比赛第七十分钟,甲队完成一次换人。事件流里出现“换人”事件,系统需要确认这条事件有效,找到对应的下场与上场球员,再判断这次换人是否值得讲:如果只是常规换人,一句话带过;如果换上的是一名防守型中场,而甲队正在领先,就值得补充一句战术意图。整个过程中,没有一步需要形象参与。形象只在最后,把这句话说出来。
数字教练。 假设用户做了一组深蹲,摄像头捕捉到后半程膝盖有内扣的趋势。系统需要从骨骼关键点算出角度变化,判断这是偶发还是连续出现,再决定是立刻提醒、留到组间说,还是放到训练后总结,最后把结论变成“下一组先放慢下蹲速度,让膝盖对准脚尖方向”这样的一句话。形象同样只是最后一步。
这两个例子里,真正花力气的都是“形象之前”的环节。也正因为如此,我们说数字人的价值在系统,而不在头像。
几个常见的误区
围绕数字人,有几种常见的误解,值得一并澄清:
- “拟真度越高越好。” 拟真度提升的是亲和力,不能替代准确性。过于拟真而内容不可靠,反而会放大误导。
- “一个大模型就是一个数字人的大脑。” 大模型擅长语言表达与推理,但比分、姿态、心率这类结构化信息,更适合由专门的数据与模型提供,再交给语言模型去表达。
- “数字人越像真人越不需要说明边界。” 恰恰相反,越像真人,越需要明确告知用户它是AI,以及它能做什么、不能做什么。
- “个性化就是让数字人更懂我。” 个性化改变的是讲法与侧重,不应该改变事实,更不应该在没有授权时收集与任务无关的数据。
怎样判断一个体育数字人是否可信
从上面的层次出发,可以给出一份朴素的检查清单,读者在评估任何体育数字人产品时都可以用:
- 关掉形象,内容是否仍然成立?
- 关键事实(比分、人名、时间、数据)能否追溯到来源?
- 出错时有没有撤回、更正或保守表述的机制?
- 反馈是否与用户的具体动作或具体场景对应,而不是通用的套话?
- 个人记录是否可见、可改,并且按需授权?
小结
数字人的外观是表现层,值得认真做,但它不是价值所在。价值来自数据、知识、语音、视觉、记忆、实时交互与动作这一整套系统,而体育场景又叠加了规则、赛事上下文和运动技术三类专业要求。江南体育官网谈数字人,谈的主要是这套系统,而不是那张脸。