穿透烟雾:RAPTR 如何利用雷达和弱标签进行 3D 人体姿态估计

穿透烟雾:RAPTR 如何利用雷达和弱标签进行 3D 人体姿态估计

想象一下,消防员进入一栋充满烟雾的建筑。能见度为零。标准摄像头毫无用处。或者考虑一家养老护理机构,监测老人跌倒至关重要,但在卧室安装视频摄像头严重侵犯隐私。

这正是 雷达 (Radar) 大显身手的场景。与摄像头不同,雷达信号可以穿透烟雾和黑暗,并且不会捕捉可识别的面部特征,从而保护了隐私。然而,教计算机纯粹从雷达数据中“看”出人体骨架 (即姿态估计) 极其困难。

传统上,训练这些 AI 模型需要昂贵的实验室级设备来捕捉 3D“地面真值 (ground truth) ”标签——想想好莱坞电影中使用的动作捕捉服。这一要求使得在现实世界中部署雷达感知系统成本高昂且难以扩展。

RAPTR (RAdar Pose esTimation using tRansformer,基于 Transformer 的雷达姿态估计) 应运而生。这项新研究提出了一种利用雷达估计精确 3D 人体姿态的方法,但它有一个转折点: 它不需要那些昂贵的 3D 标签。相反,它使用“弱监督”进行学习——即廉价、易于获取的标签,如 2D 视频标注和粗略的 3D 边界框。

在这篇文章中,我们将解构 RAPTR,了解它是如何利用巧妙的 Transformer 架构和新颖的“伪 3D (Pseudo-3D) ”注意力机制,将模糊的雷达热图转化为精确的 3D 人体骨架的。

背景: 为什么是雷达?为什么是现在?#人体姿态估计——识别手肘、膝盖和肩膀等关节的任务——主要由计算机视觉 (RGB 摄像头) 主导。但摄像头有局限性。它们在低光照下失效,会被障碍物阻挡,并引发严重的隐私问题。

毫米波 (mmWave) 雷达是替代方案。它发射无线电波并监听反射。它能提供深度信息、速度 (通过多普勒效应) ,并在恶劣条件下工作。然而,原始雷达数据稀疏且充满噪声。它看起来不像照片;它看起来像一团幽灵般的斑点。

标签瓶颈#要训练神经网络在这些斑点中找到关节,通常需要 细粒度 3D 关键点标签 。 获取这些数据需要 VICON 系统 (多个同步红外摄像头) 或激光雷达 (LiDAR) 装置。你不可能轻易地把雷达带进杂乱的公寓并获得这些数据。

RAPTR背后的研究人员问道: 我们能否使用更容易获取的标签来训练 3D 雷达模型?

他们专注于两种“廉价”的标签类型:

3D 边界框 (BBoxes) : 人在房间里的大致位置。2D 关键点: 关节在标准视频图像中出现的位置 (易于人工标注) 。利用这些弱标签生成精确的 3D 姿态是 RAPTR 的核心创新。

理解数据: 多视图雷达#在深入了解网络之前,让我们先看看输入数据。该系统使用两个雷达阵列: 一个水平阵列和一个垂直阵列。

如上图所示,雷达数据最初是极坐标 (距离-方位角和距离-仰角) 。系统将这些转换为笛卡尔坐标 (X, Y, Z) 热图:

水平视图: 从上往下的视角显示场景 (鸟瞰图) 。垂直视图: 从侧面显示场景 (仰视图) 。通过结合这两个视图,模型可以推断出物体的 3D 位置。

RAPTR 架构#RAPTR 建立在 Transformer 架构之上。Transformer 因驱动 GPT 等大语言模型而闻名,它非常擅长发现数据不同部分之间的关系 (注意力机制) 。RAPTR 将其调整用于空间雷达数据。

该架构分为三个主要阶段:

跨视图编码器 (Cross-View Encoder) : 提取特征。伪 3D 姿态解码器 (第一阶段) : 找到人。伪 3D 关节解码器 (第二阶段) : 找到姿势。

第一阶段: 跨视图编码器#过程始于一个作为主干的标准卷积神经网络 (ResNet) ,用于从雷达图像中提取特征。这些特征被传递给 跨视图编码器 。

该编码器融合了水平和垂直视图的信息。它使用一种称为“交叉注意力”的机制,水平特征会询问垂直特征: “在这个深度你看到了什么?”,反之亦然。这确保了模型建立对 3D 空间的统一理解,而不是将两个视图视为独立的图像。

第二阶段: 两阶段解码器#这是 RAPTR 与标准方法不同的地方。大多数模型试图一次性预测所有关节。RAPTR 分解了这项工作,以更好地处理雷达数据的模糊性。

阶段 1: 姿态解码器 (寻找“在哪里”)#第一个解码器不寻找手肘或膝盖。它寻找 人。它使用一组可学习的“姿态查询 (Pose Queries) ”。

这里的目标是估计一个 模板姿态——想象一个僵硬的人体模型站在中立位置。解码器预测这个人体模型在 3D 世界中的位置。它使用廉价的 3D 边界框 标签来学习这一点。如果人体模型在框内,模型就完成了任务。

阶段 2: 关节解码器 (寻找“怎么动”)#一旦模型知道了人 在哪里 (并拥有一个粗略的模板) , 关节解码器 就会接手。它会对模板进行微调。它弯曲手肘,移动腿部,并倾斜头部。

它使用 2D 关键点 标签来学习这一点。它将其 3D 猜测投影到 2D 相机平面上,并检查是否与视频标注匹配。

上图漂亮地展示了这一点。在第一行 (姿态解码器) 中,模型预测了一个位于正确位置的僵硬标准姿态。在中间行 (关节解码器) 中,那个僵硬的姿态被放松并调整,以匹配用户的实际行走动作。

引擎: 伪 3D 可变形注意力#Transformer 实际上是如何“看”雷达数据的?标准的 Transformer 会查看 3D 体积中的每一个像素,这在计算上极其昂贵。

RAPTR 使用 可变形注意力 (Deformable Attention) 。 这意味着模型学习只关注几个重要的点 (采样点) ,而不是整个图像。然而,现有的方法通常在 2D 中执行此操作。RAPTR 引入了 伪 3D 可变形注意力 。

过程如下:

3D 参考点: 模型在 3D 雷达空间中选取一个参考点 \((x, y, z)\)。3D 偏移量: 它计算偏移量 \((\Delta x, \Delta y, \Delta z)\) 以在 3D 空间附近找到感兴趣的采样点。投影: 这些 3D 点随后被投影到 2D 水平和垂直雷达热图上。采样: 模型从这些特定的 2D 位置抓取特征。

\[

\mathbf { f } _ { \mathrm { h o r } } ^ { ( i ) } = \mathbf { F } _ { \mathrm { h o r } } ( x + \Delta x _ { i } , z + \Delta z _ { i } ) , \quad \mathbf { f } _ { \mathrm { v e r } } ^ { ( i ) } = \mathbf { F } _ { \mathrm { v e r } } ( y + \Delta y _ { i } , z + \Delta z _ { i } ) \quad i = 1 , \cdots , N _ { \mathrm { o f f s e t } } .

\]

通过首先在 3D 中定义采样,RAPTR 确保了几何一致性。如果你只是分别在水平图上预测 2D 点和在垂直图上预测 2D 点,它们可能无法对齐形成一个有效的 3D 点。

如上面的比较所示,标准方法 (b) 将注意力分割为解耦的 2D 操作。RAPTR (a) 保持统一的 3D 参考,这使得它更准确且更具扩展性,特别是如果以后添加更多雷达视图 (如第 3 或第 4 个雷达) 。

从弱标签中学习: 结构化损失#拼图的最后一块是网络如何学习。由于没有“完美”的 3D 骨架进行对比,研究人员设计了一个 结构化损失函数 。

\[

{ \mathcal { L } } = { \frac { 1 } { N ^ { \prime } } } \sum _ { i = 1 } ^ { N ^ { \prime } } ( \lambda _ { \mathrm { 1 } } { \mathcal { L } } _ { \mathrm { t e m p 1 a t e } } + \lambda _ { \mathrm { 2 } } { \mathcal { L } } _ { \mathrm { g r a v i t y } } + \lambda _ { \mathrm { 3 } } { \mathcal { L } } _ { \mathrm { k p t 2 D } } + \lambda _ { \mathrm { 4 } } { \mathcal { L } } _ { \mathrm {0 K S } } ) + \lambda _ { \mathrm { 5 } } { \mathcal { L } } _ { \mathrm { c l s } } ,

\]这个公式可能看起来令人生畏,但它可以分解为合乎逻辑的部分:

\(\mathcal{L}_{template}\) (3D 模板损失) : 用于第一个解码器。它确保预测的“人体模型”位于 3D 边界框 标签的中心。这本质上是将人锚定在 3D 空间中。\(\mathcal{L}_{gravity}\) (3D 重力损失) : 确保最终细化姿态的质心与边界框的中心对齐。这可以防止四肢漂离身体太远。\(\mathcal{L}_{kpt2D}\) (2D 关键点损失) : 模型将其 3D 关节投影到相机视图上。然后,它测量这些投影点与 2D 标签 之间的距离。这教导模型四肢是 如何 弯曲的。通过结合“在哪里” (来自 3D 框) 和“怎么动” (来自 2D 图像) ,模型生成了一个同时满足这两个约束的几何上有效的 3D 姿态。

实验与结果#研究人员在两个数据集上测试了 RAPTR: HIBER 和 MMVR 。 他们将其与其他基于雷达的方法 (如 HRRadarPose 和 QRFPose) 进行了比较。

定量性能#使用的主要指标是 MPJPE (平均关节位置误差) ,单位为厘米。数值越低越好。

在 HIBER 数据集上 (表 1) ,RAPTR 实现了 22.32 厘米 的总体误差。与其竞争对手相比,这是一个巨大的进步。例如,Person-in-WiFi 3D 的误差为 58.25 厘米,最接近的竞争对手 HRRadarPose 为 33.96 厘米。

这意味着 RAPTR 将误差减少了大约 34% 到 61% 。

在 MMVR 数据集上 (表 2) ,由于无法获得精确的 3D 标签进行评估,他们测量了预测姿态与地面真值边界框的拟合程度 (“中心距离”) 。RAPTR 实现了 31.41 厘米 的中心距离,而其他方法则超过 136 厘米。这表明 RAPTR 在将人体正确放置在 3D 房间中方面要好得多。

定性性能: 眼见为实#数字固然好,但可视化更能说明问题。

看上面的图片 (来自 HIBER) 。

蓝线: 地面真值 (Ground truth) 。红线: 预测值 (Predictions) 。注意第三行 (HRRadarPose) 和第二行 (QRFPose)。骨架经常看起来被“压扁”了,或者四肢向不可能的方向挥舞。

现在看第一行 (RAPTR)。红色骨架紧紧贴合蓝线。尽管它是用弱标签训练的,RAPTR 理解人体的 结构。它知道腿不会脱离臀部,手臂有特定的长度。

图 12 进一步突出了 RAPTR 的鲁棒性。在列 (c) (MMVR P1S1) 中,请注意 RAPTR (顶部的红色骨架) 与 2D 标签 (顶部的蓝色火柴人) 相比,捕捉手臂姿势的效果有多好。

为什么它效果更好?#消融研究 (移除特征以观察效果的测试) 表明 两阶段解码器 至关重要。

如果移除 模板损失 (阶段 1) ,模型会对深度感到困惑。如果移除 重力损失 , 四肢开始漂移。如果移除 伪 3D 注意力 并使用标准的 2D 注意力,误差会增加约 4%。结论: 室内感知的未来#RAPTR 代表了隐私保护感知领域迈出的重要一步。通过证明我们可以仅使用 弱监督 (3D 框和 2D 点) 获得高质量的 3D 姿态,作者消除了一个主要的准入门槛。我们不再需要百万美元的动作捕捉工作室来训练雷达模型。

其影响是广泛的:

医疗保健: 无需摄像头即可监测患者跌倒或进行步态分析。智能建筑: 根据精确的人体活动自动调节照明和暖通空调。搜救: 在烟雾或雾气中定位受害者。RAPTR 证明,只要有正确的架构——特别是尊重世界 3D 几何结构的架构——雷达可以像摄像头一样具有描述性,且没有任何视觉侵扰。

相关推荐

世界杯接吻 连接世界杯
000-365 bet

世界杯接吻 连接世界杯

📅 07-28 👁️ 5717
手臂发麻什么原因和征兆
bt365网上娱乐

手臂发麻什么原因和征兆

📅 09-27 👁️ 161
盘点:2025年排名前十的人事系统厂商
000-365 bet

盘点:2025年排名前十的人事系统厂商

📅 01-25 👁️ 1107