一个观察:头像不再是重点
设想一个下蹲训练的场景。用户对着手机做了一组动作,屏幕里的数字人微笑着说:“做得不错,继续保持。”但这个动作里,髋部其实没有充分后移,膝盖也向内收了一点。头像很亲切,反馈却没有价值。
这个场景说明了当前研究关注点的变化:外观和语气已经不再是难点,难点在“看懂”和“说对”。因此近期的一些研究方向,不再把数字人当作单纯的表现层,而是把它放进一个更完整的动作反馈系统里,从输入、判断到输出各自承担明确的职责。
本文只做定性梳理,不引用具体的研究者、期刊或数字,也不把这些方向当作已经成熟的结论。
研究方向一:从二维关键点走向三维动作重建
早期的动作分析常常基于二维关键点:从一张图像里找出关节的位置。它的局限是缺少深度信息,身体某个部位被遮挡、拍摄角度偏斜时,关节位置就不可靠,例如从侧面看下蹲和从正面看下蹲,得到的判断可能完全不同。
三维动作重建试图还原人体在空间中的姿态,把关节角度、身体朝向、重心位置作为更稳定的表示。它的价值在于:
- 动作的比较可以在同一个空间里进行,而不受机位影响。
- 左右差异、幅度、节奏这类指标更容易稳定地计算。
- 可以把用户的动作与目标动作对齐,只提取“差在哪里”。
这一方向对产品的启发是,动作理解应当输出结构化的中间结果,而不是直接输出一句评语。关于为什么看懂动作和教会动作是两件事,我们在3D动作模型的文章里有更详细的讨论。
研究方向二:让语言模型生成教练反馈
有了动作数据,下一步是把数据变成人话。近期的一些探索,是把三维动作重建得到的信息交给语言模型,由它生成面向普通用户的反馈。
它的吸引力在于表达灵活:同样一个错误,可以对新手说得更通俗,对有经验的人说得更精确。但这里有几个必须处理的风险:
- 模型可能把不确定的判断说得很肯定。动作分析本身有误差,语言模型却会给出流畅而自信的句子。
- 模型可能编造原因。它可能给出听起来合理、其实没有数据支持的解释。
- 反馈过多会增加负担。一次说太多问题,用户反而无从下手。
所以更合理的设计是,把语言模型放在“表达”的位置,而不是“判断”的位置:动作分析模块给出经过筛选的问题清单与优先级,语言模型只负责把它们转成清晰的建议,并受到事实约束。这与我们在多模型协作方面的思路一致,可以参考大模型负责说,姿态模型负责看。
研究方向三:疲劳信号触发虚拟形象反馈
另一个值得注意的方向,是把疲劳检测与虚拟形象反馈联系起来。有研究原型尝试在检测到疲劳迹象时,让虚拟形象给出不同形式的提示,而不是无论何时都用同样的方式说话。
这背后的逻辑很朴素:疲劳时动作容易变形,继续要求高强度可能增加受伤风险,此时的合适反馈可能是放慢节奏、降低难度或建议休息,而不是再叠加一条动作纠正。
对产品设计的启发有两点:
- 反馈时机与内容应当依据状态调整。不是每个错误都要立刻开口,反馈应当参考动作阶段、错误的严重程度和疲劳变化。
- 虚拟形象是反馈的载体之一,而不是全部。同样的信息可以用视觉标注、简短语音或训练后总结来传达。
更完整的讨论见虚拟教练到底什么时候应该开口。
研究方向四:增强现实与动作技能教学
第四个方向是把数字人放进增强现实里,让用户在真实空间中跟着虚拟形象学习动作。它的想法是,让示范和用户处于同一个空间,而不是隔着屏幕看一个平面视频。
这里的核心问题不是渲染效果,而是对齐:虚拟形象的位置、大小、朝向,是否与用户所处的空间和自身体型匹配,示范的是“标准动作”还是“这个用户此刻可以做到的动作”。不匹配的示范可能会让用户模仿出错误的姿势。
这一方向目前更多处于探索阶段,我们把它视为需要谨慎评估的方向,而不是可以直接落地的方案。
对产品设计的几点启发
把上面几个方向合起来看,可以归纳出一条设计主线:数字人教练应当是一条完整的反馈链路,形象只是最后一步。
| 环节 | 职责 | 应当输出什么 |
|---|---|---|
| 动作理解 | 还原三维动作,找出与目标的差异 | 结构化的差异与置信度 |
| 反馈决策 | 判断先纠正什么、何时说 | 优先级与时机 |
| 语言生成 | 把决策转成易懂的建议 | 简短、可执行的话 |
| 形象演示 | 只演示差异,而不是重演整套动作 | 视觉提示或局部示范 |
表中并没有涉及任何具体数值。如果要用示意数字说明,可以假设某次训练里检出三个动作问题,系统只选择其中最影响安全的一个先反馈,其余的留到训练结束后总结。这样的取舍,比“每个问题都提醒”更接近好教练的做法。
还没解决的问题
- 遮挡与复杂环境。家里的空间狭小、光线不佳、衣物宽松,都会让三维重建不稳定。
- 个体差异。每个人的身体条件、伤病史和训练目标不同,“标准动作”并不总是适用。
- 语言的可靠性。语言模型生成的反馈如何验证是否忠实于动作数据,仍是一个需要持续评估的问题。
- 信任与安全。用户容易过度相信一个形象逼真的教练。训练中出现疼痛或不适时,应当停止训练,必要时咨询专业医生,数字人教练不能替代专业指导。
- 评估方法。怎样判断一次反馈是不是“有效”,需要长期的用户观察,而不是一次演示的观感。
我们会继续关注这些方向,并保持谨慎:先把动作看清楚,再谈说得好听。