HybridSim:用于毫米波人体感知的物理-学习混合数字孪生

📅 2026/7/24 23:12:00 👁️ 阅读次数 📝 编程学习
HybridSim:用于毫米波人体感知的物理-学习混合数字孪生

大家读完觉得有帮助记得关注和点赞!!!

摘要

针对动态人体运动的高保真毫米波雷达信号仿真,对于开发基于雷达的人体感知模型非常有价值;然而,针对特定部署地点收集精确标注的测量数据仍然代价高昂。我们提出了 HybridSim,一种物理-学习混合仿真器,能够在固定的室内房间配置下,从动态人体网格合成毫米波雷达信号,并将传播过程明确解耦为两个分量。为参数化人体对象,我们使用三平面表示提取人体特征,并采用图卷积网络来稳定优化并缓解梯度不稳定性。直接信号路径通过基于逆渲染的微表面双向反射分布函数(BRDF)公式建模,以捕获主要的表面反射。同时,间接路径通过将三维高斯泼溅与虚拟接收器几何相结合来近似,以拟合和重现场地特定的多径干扰模式,其计算成本远低于显式全光线追踪。在固定房间设置下的实验表明,与基于物理的参考相比,HybridSim 具有更好的一致性,并在使用 HybridSim 进行场地特定数据增强时,在下游基于雷达的人体感知任务上获得了持续的性能提升。

图1:HybridSim:基于物理-学习与解耦混合渲染的动态人体运动毫米波仿真。HybridSim 通过将传播解耦为直接路径(基于逆渲染)和间接路径(基于三维高斯泼溅),从动态人体网格和室内场景合成逼真的毫米波信号。与现有仿真器相比,HybridSim 在距离-多普勒热图中保留了细粒度运动学细节,显示出对物理真实测量数据的高保真度。


1 引言

毫米波雷达由于其对照明条件的鲁棒性和隐私保护特性,为基于视觉的人体感知系统提供了一种稳健且经济的替代方案。开发稳健的雷达感知深度学习模型需要涵盖多样化人体活动的大规模训练数据集。在物理环境中收集和标注此类数据极其耗费资源。因此,通过物理仿真合成高保真雷达信号成为扩展训练数据集并弥合合成数据与真实测量之间领域差距的实用解决方案 。

现有的毫米波仿真方法在渲染连续动态人体运动时面临独特的挑战。与高密度激光雷达不同,毫米波雷达产生极其稀疏的空间测量数据。因此,基于雷达的人体感知严重依赖随时间变化的微多普勒特征,而非密集的空间几何,来推断动作。基于物理的光线追踪框架提供了精确的电磁传播模型,但在评估高阶多径交互时存在指数级计算复杂度 [7152831, 10.1145/3625687.3625798]。此外,某些光线追踪方法高度依赖环境的精确扫描几何,使其不利于普适部署 [10556262]。相反,近期的神经表示方法将辐射场和高斯泼溅适应到射频领域 [10.1145/3570361.3592527, 11355734]。虽然这些方法在静态场地特定信道建模方面表现出色,但它们本质上将动态人体的主要表面散射与复杂的环境多径反射纠缠在一起。这种纠缠会降低随时间变化的微多普勒特征的合成质量,而这些特征对于在单传感器设置中识别关节运动学至关重要。其他数据驱动的生成方法和物理增强器解决了这些效率问题,但往往牺牲了相干多径干扰和物理保真度 [10.1145/3560905.3568542, 10.1145/3570361.3613302]。

为解决这些局限性,我们提出了 HybridSim,一种物理与学习混合的仿真器,旨在从静态室内环境中的动态人体网格合成逼真的中频毫米波信号。我们将复杂的电磁传播解耦为两个不同且可解释的分量。对于直接信号路径,我们采用基于逆渲染的微表面双向反射分布函数公式,精确捕获来自人体对象和房间边界的锐利一次反射。同时,我们通过将几何约束的三维高斯泼溅(3DGS)[10.1145/3592433] 与放置在房间边界上的代理虚拟接收器相结合来建模间接路径。该公式作为一种高效的多散射体替代模型,以显著低于显式多跳光线追踪的计算成本学习和重建场地特定的多径干扰模式。

通过显式解耦直接表面散射与间接环境多径效应,我们的框架在生成的距离-多普勒热图中保留了细粒度运动学细节。广泛评估证实,合成信号对真实测量数据保持高物理保真度。此外,使用模拟数据进行数据增强显著提高了下游基于雷达的人体活动识别模型在跨对象和仿真到真实评估协议下的分类准确率。本研究的主要贡献包括:一种用于高效动态雷达合成的新型解耦渲染架构,一种用于建模复杂多径效应的统一多散射体方法,以及仿真器在增强实际人体感知应用中的经验验证。


2 相关工作

2.1 射频合成

虽然毫米波系统如 mmMesh [10.1145/3458864.3467679] 和 M4esh [10.1145/3560905.3568545] 提供了稳健且保护隐私的人体姿态估计,但其对未见活动的泛化能力常常受限于全面真实世界训练数据的稀缺。

为应对这些局限,已开发了许多方法。数据驱动方法如 SynMotion [10.1145/3560905.3568542] 直接从基于视觉的骨骼数据生成雷达信号,而 mmGPE [10.1145/3570361.3613302] 等方法则采用物理仿真增强器来模拟人体反射。

光线追踪射频仿真。 基于物理的仿真依赖几何光学和光线追踪来近似电磁传播。Yun 和 Iskander 的开创性工作 [7152831] 提供了建模这些多径效应的方法,合理解释了信号如何与环境交互。Schüßler 等人 [9533181] 将其扩展到汽车环境中的大规模 MIMO 阵列。RF-Genesis [10.1145/3625687.3625798] 将光线追踪与扩散模型相结合,以在多样化环境中扩展视觉到射频的数据生成。虽然这些光线追踪管道实现了高物理保真度,但其计算成本随高阶多径交互呈指数增长,使其对连续动态运动合成效率低下。

可微分射频渲染。 为实现参数估计和端到端优化,近期工作引入了可微分射频渲染。Hofmann 等人 [10892639] 将逆渲染适应到近场雷达,以从测量中重建材料属性。类似地,InverTwin [chen2025invertwinsolvinginverseproblems] 通过解决射频仿真中的局部非凸性和边界不连续性,面向数字孪生构建。然而,这些方法主要面向逆问题求解,而非作为高度关节化人体动态的高效前向仿真器。

神经射频表示。 单体仿真器的不灵活性促使了神经射频表示的发展。RFCanvas [10.1145/3666025.3699351] 和 RFScape [11092981] 等框架将视觉先验与神经距离场融合,以构建可编辑的信道模型。同时,辐射场和 3DGS [10.1145/3503250, 10.1145/3592433] 已被适应于射频传播。开创这一转变的 NeRF2 [10.1145/3570361.3592527] 将光学神经辐射场转换到射频领域,采用复数值多层感知器建模幅度和相位,并结合基于 Friis 的光线追踪模型。RF-3DGS [11355734] 从稀疏测量中重建无线电辐射场,而 GSRF [yang2025gsrfcomplexvalued3dgaussian] 引入了具有方向基的复数值高斯基元来建模幅度和相位。

虽然这些方法在静态信道建模方面表现出色,但动态人体感知提出了独特要求。模拟信号必须保留关节运动的时变微多普勒特征,同时保持对相干多径干扰的保真度。现有的神经方法常常纠缠这些现象,使得难以将移动目标与静态环境反射分离。此外,某些方法依赖分布式多传感器设置,并在实际单传感器场景中会遭受显著的性能下降。HybridSim 通过显式解耦基于双向反射分布函数(BRDF)的主要散射与基于 3DGS 的多径反射来解决这些差距。

2.2 人体建模

参数化人体模型,如 SCAPE [10.1145/3596711.3596797]、SMPL [10.1145/2816795.2818013] 和 SMPL-X [8953319],使用应用于固定拓扑网格的紧凑形状和姿态参数来表示 3D 人体,实现高效动画和优化。在 HybridSim 中,我们使用 SMPL 作为网格模板来获取动态人体姿态。

图2:我们框架的管道。我们使用三平面表示从标准姿态中提取人体特征,并通过位置编码获取场景特征。为建模直接路径,人体特征被掩码并通过图卷积网络重建,以生成空间正则化的嵌入。这些增强特征由 BRDF 解码器处理,以预测包括粗糙度和消光系数在内的材料属性。同时,对于间接路径,未掩码的三平面特征被馈入 3DGS 解码器以预测旋转、球谐函数、反射率、缩放和顶点偏移等参数。两组解码参数均通过线性混合蒙皮转换到动态目标姿态空间。最后,我们合成直接和间接信号,并计算与真实信号的损失。


3 方法

概述。 HybridSim 是一个物理-学习混合框架,以动态人体网格序列和静态房间配置为输入,输出高保真中频(IF)毫米波雷达信号。如图 2 所示,我们通过将复杂电磁传播解耦为两个可解释的分量来实现这一合成:主要直接路径和多径间接反射路径。

具体而言,第 3.1 节介绍了人体对象和房间边界的神经特征表示以及动态可见性计算。接下来,第 3.2 节使用微表面逆渲染建模直接路径以捕获锐利的一次反射。第 3.3 节详述了我们用于间接路径的统一多散射体替代模型,该模型通过 3DGS 和代理边界几何近似复杂的环境多径效应。最后,第 3.4 节概述了用于端到端优化的距离-多普勒域损失函数。

3.1 神经特征表示与可见性

为有效建模复杂的室内电磁环境,我们使用不同的神经表示参数化动态人体对象和静态场景。我们使用三平面表示 [9880428, 10655076] 从标准 SMPL 网格中提取人体目标的空间特征。将标准顶点映射到这三个正交特征平面中,产生一种本质上对关节姿态保持不变的连续表示。

对于静态房间组件,我们不依赖复杂的扫描几何,而是相对于雷达收发器使用标量距离配置参数化构建环境边界。基于这些空间限制,我们为每个平面表面(包括墙壁、地板和天花板)生成合成的、基于网格的点云。静态内部物体(如家具)不需要显式几何建模。相反,其复杂的电磁散射效应被隐含地吸收并表示为由这些代理边界分布的、可学习的神经参数。然后我们对这些归一化坐标应用周期性位置编码,以产生场景特征嵌入,使网络能够学习模拟环境中的高频空间变化。

物理精确的雷达仿真天然要求严格处理自遮挡以及对象与环境之间的相互视线遮挡。为实现这一点,我们使用隐藏点移除(HPR)算法 [10.1016/j.cag.2010.03.002] 动态确定所有散射体的可见性。可见性计算的详细实现在补充材料第 6 节中提供。

3.2 直接路径仿真

直接信号路径严格评估从人体和静态房间边界直接返回接收器的单次反射(即视线散射)雷达回波。通过将该路径纯粹定义为 1 跳传播,我们将复杂雷达信号解耦为学习的幅度分量和物理推导的相位分量。

为确定散射幅度,我们首先将提取的神经特征通过一个带有随机掩码的图卷积网络(GCN)[10.1007/s11063-020-10404-7],该网络模拟部分可见性并鼓励鲁棒的特征恢复。在毫米波频率下,人体表面可以很好地近似为分段平滑的电磁材料场;将每个网格顶点视为独立散射体会忽略这种空间相干性,并可能在推断的材料参数中引入非物理的高频变化。GCN 通过网格图上的类拉普拉斯传播引入一个软结构先验,鼓励局部一致的隐式材料嵌入,并在 BRDF 参数的高灵敏度下提高优化稳定性。特别是,平滑效应缓解了梯度集中在小部分顶点上的问题,否则这些顶点可能主导更新并导致训练中逆渲染阶段的瞬时内存尖峰。因此,我们严格将 GCN 用作训练时的正则化器(在训练中与随机掩码一起随机启用),以稳定收敛并提高对部分可见性的泛化能力。在推理期间,我们直接解码收敛后的隐式特征而不进行额外的图传播,因为进一步的消息传递可能引入不必要的空间平滑,从而抑制合理的高频散射变化,而连续性先验已通过训练被吸收到学习的隐式场中。更多分析和消融实验见补充材料第 10 节。

人体特征和编码的场景特征被馈入 BRDF 解码器,以预测物理材料参数,包括表面粗糙度、金属混合因子和复折射率。这些参数与姿态化 SMPL 网格和静态墙面的表面法线一起,定义了一组统一的直接路径散射体 𝒫_direct。对于每个散射体 p ∈ 𝒫_direct 在时刻 t,我们使用带有复菲涅尔方程的 BRDF 公式 [10892639] 建模散射幅度 L_p。更多细节见补充材料第 7 节。

虽然网络预测幅度,但相位完全由传播物理通过总延迟决定:

其中 c 表示光速,x_tx 是发射器位置,x_rx 是接收器位置。复信号公式中的相位项由载波频率 f₀、啁啾斜率 S 和该传播延迟驱动。

通过结合学习幅度和物理相位,最终的直接毫米波信号被合成为所有全局可见散射体贡献的相干求和:

在该方程中,S_im_direct(t) 表示接收器处的聚合信号,求和遍历来自动态人体网格和静态房间边界的统一可见散射中心子集 p∈vis(通过 HPR 动态确定)。遵循 mmGPE [10.1145/3570361.3613302] 中的方程,我们也省略了可忽略的残余视频相位(RVP)项。雷达信号合成与标准光学渲染之间的一个根本物理区别是,传统的双向反射分布函数和 3DGS 管道将 3D 属性投影到高分辨率 2D 图像平面上进行逐像素着色和混合,而单个雷达接收天线实际上充当空间点汇(即单像素传感器)。因此,接收器不是执行空间光栅化,而是将所有可见散射中心的复电磁波相干叠加成一个统一的时间域序列。最终,分母显式考虑物理自由空间衰减,使信号幅度与发射器、散射元件和接收器之间的几何距离成反比缩放。

(a)

(b)

图3:使用表面对齐的高斯补丁和代理墙面几何的间接路径仿真示意图。(a) 动态人体网格被增强以几何约束的高斯基元。为防止不受约束的体积膨胀,这些散射元素被展平为 2D 表面补丁,其主轴对齐到局部切平面并沿表面法线压缩。(b) 传统光线追踪与所提代理墙面几何方法的比较。传统多跳光线追踪(左,红色路径)涉及连续且不利于优化的过程,而所提框架(右)通过在房间边界上实例化虚拟墙面接收器来离散化多径环境。该公式将复杂间接反射简化为可微分的三段传播模型,如从人体上不同散射点出发的不同绿色和紫色路径所示。

3.3 间接路径仿真:统一多散射体替代模型

间接路径专门用于多跳反射(≥2 跳),涵盖人体到墙壁、地板到墙壁以及墙壁到墙壁的交互。为严格防止与单跳直接路径重复计数,显式多跳光线追踪面临指数级计算复杂度且众所周知不利于优化。我们不是跟踪不可预测的离散光线,而是引入一个物理上可辩护的统一多散射体公式,并结合代理边界几何。

我们不将环境边界仅视为光滑镜面,而是使用几何约束的 3DGS 将动态人体网格和静态房间布局(墙壁、地板和天花板)离散化为一组统一的主动散射元素。令 𝒫_ind = 𝒫_human ∪ 𝒫_env 表示间接路径的全局散射体组合集。

令 𝒦 表示房间边界的集合。我们在每个边界 k∈𝒦 上实例化一组代理虚拟接收器 x_{w,k}。此设计将复杂、难以处理的多跳积分转换为一个高效、可微分的三段传播模型:发射器 x_tx → 中间散射体 p ∈ 𝒫_ind → 代理接收器 x_{w,k} → 物理接收器 x_rx。

由于中间散射体 p 从统一集合 𝒫_ind 中采样,该公式充当了一个物理约束的神经表示,显式学习场地特定的环境多径特征。它不分析计算二次反射,而是将空间多径纹理编码到 3DGS 的可训练参数中。3DGS 解码器将为每个补丁预测球谐函数、不透明度、缩放和偏移等参数 [10.1145/3592433],产生朝向代理接收器 x_{w,k} 评估的方向幅度 SH_{p,k}(x_p(t), ω_{p→w,k})。为防止无约束高斯典型的体积膨胀,这些散射元素被公式化为严格遵循底层几何拓扑的扁平化 2D 表面补丁。

全局间接信号通过相干求和所有代理边界及其各自可见散射体(排除同一边界上的自交)的贡献来合成:

其中 τ_{p,k}(t) = (||x_tx - x_p(t)|| + ||x_p(t) - x_{w,k}|| + ||x_{w,k} - x_rx||)/c 定义了代理传播延迟。

通过直接汇总从人体和环境向代理边界散射的多径能量,此全局求和充当了多跳光线追踪的鲁棒、利于优化的替代模型,通过将复杂多径干扰特征编码为空间纹理来保留它们,完全避免了分析多跳计算的过高计算开销。

3.4 损失函数

为在频率变换之前弥合仿真到真实的差距,我们向理想化合成信号中注入零均值复高斯噪声。噪声标准差由一个可学习速率乘以信号平均幅度来动态参数化(在第 4.9 节中进一步分析)。

直接优化原始时域复信号非常困难。雷达绝对相位对运动跟踪和几何重建中的亚毫米级误差极其敏感;这些不可避免的仿真与真实之间的错位会完全扭曲绝对相位,使原始复数均方误差(MSE)不适用于网络监督 [chen2023differentiableradiofrequencyray, richeek2024mmwave]。因此,我们采用仅幅度策略,通过二维快速傅里叶变换(FFT)将信号处理为距离-多普勒(RD)幅度热图。

关键地,代理几何公式描绘了运动学驱动路径演化与数据驱动电磁效应之间的界面。虽然现实多径涉及复杂且常常难以处理的现象(如极化、频率相关吸收和反射相关相位偏移),但我们的混合设计为几何和学习分配了互补角色。代理延迟 τ_{p,k}(t) 显式建模时变传播延迟,从而强加主要多普勒演化受路径长度变化率(dτ/dt)的几何速率支配。在此公式下,静态的、材料相关的相位偏移主要影响相对干涉图案,但不改变由 τ_{p,k}(t) 编码的运动学诱导多普勒趋势。同时,神经 3DGS 参数(SH_{p,k})作为一个紧凑替代模型,吸收未建模的电磁衰减和散射强度。这种分离约束了学习分量的自由度,并凭经验减少了拟合与运动无关的热图纹理的趋势,正如第 4.6 节消融研究所支持的那样。

此外,原始雷达反射具有巨大的动态范围,强主反射可能垄断梯度并掩盖重要的运动学细节(更多细节见补充材料第 8 节)。我们通过应用 20 log₁₀(·) 变换将幅度转换为分贝(dB)尺度来平衡此优化惩罚。

该框架通过最小化对数热图之间的均方误差(MSE)进行端到端优化:

其中 ℱ_RD(·) 表示顺序 2D RD FFT 操作,索引 n 遍历展平 RD 热图矩阵中的所有 N 个区间。


4 实验

4.1 实现细节

我们使用 mmMesh 数据集 [10.1145/3458864.3467679] 实现我们的框架,该数据集通过配备 3 个发射(TX)和 4 个接收(RX)天线的商用 TI AWR1843BOOST 毫米波雷达收集信号。在训练阶段,我们选择由单个主要对象执行的八个不同动作序列。每个序列包含约 3,000 帧,我们将其中 80% 的数据用于优化网络权重。整个框架在单张 NVIDIA RTX 4090 GPU 上端到端训练,峰值内存占用约 20 GB,耗时约七小时。在推理阶段,合成一个动作每帧不到 1 秒。

4.2 基线

基线选择严格限于与实验设置具有可比硬件和信号配置的方法。中频(IF)和 RD 热图的合成固有地与底层雷达信号模型耦合,该模型包括波形、中心频率、带宽和啁啾调度,以及天线阵列配置,如收发器几何和虚拟信道布置。许多现有毫米波合成方法假设不同的收发器设置或依赖多视图感知,使得相应输出与所提出的单雷达管道根本不可比。关键地,若干当代方法的闭源性质排除了精确复现和公平基准测试。因此,比较评估主要聚焦于 mmGPE [10.1145/3570361.3613302] 和 RF-Genesis [10.1145/3625687.3625798],因为这些框架与目标配置最接近。

4.3 评估协议

为在固定场景下评估合成质量和跨对象泛化性,我们建立了 2 种测试设置。对于对象内合成,我们评估训练对象剩余 20% 的帧,其中包含未见过的动态姿态。对于跨对象评估,我们在一个新的执行相同八个动作类别(每个 3,000 帧)的人体对象上测试模型。这验证了框架是过拟合主要对象的体型,还是学习了可迁移的物理散射属性。我们使用 3 个标准指标定量测量生成的 RD 热图保真度:峰值信噪比(PSNR)、结构相似性指数(SSIM)和学习感知图像块相似度(LPIPS)。所有实验在相同房间布局中进行,数据集组成的更多细节见补充材料第 11 节。

4.4 主要结果:距离-多普勒合成

如表 1 所示,HybridSim 在两种设置下均优于所有基线,尤其值得注意的是 LPIPS 显著降低,表明具有优越的结构保真度。这在图 4 中得到了视觉佐证:我们的框架准确保留了与物理真实值匹配的细粒度运动学。直接路径、间接路径和学习噪声贡献的额外定性分解见补充材料第 13 节。

表1:mmMesh 数据集上的定量评估。我们报告了生成 RD 热图的 PSNR、SSIM 和 LPIPS 指标。评估分为两种设置:对象内(测试训练对象 20% 未见帧)和跨对象(测试同一场景中未见人体执行 8 个动作,每个 3,000 帧)。

方法

未见帧(对象内)

未见人体(跨对象)

PSNR ↑

SSIM ↑

LPIPS ↓

PSNR ↑

SSIM ↑

LPIPS ↓

RF-Genesis [10.1145/3625687.3625798]

20.03

0.219

0.274

20.02

0.218

0.271

mmGPE [10.1145/3570361.3613302]

20.09

0.221

0.261

20.09

0.220

0.253

HybridSim(我们的)

22.30

0.262

0.089

22.29

0.262

0.084

表2:下游任务人体活动识别性能。mmAP 分类网络仅在不同仿真器生成的合成数据上训练,并直接在真实世界真实测量数据上测试。在真实数据上更高的准确率表示更小的仿真到真实领域差距。

训练来源(仿真器)

准确率 (%) ↑

F1分数 ↑

RF-Genesis

30.68

0.2584

mmGPE

54.22

0.4990

HybridSim(我们的)

92.07

0.9216

图4:RD 热图的定性比较。红色框提供了由关节化人体肢体运动产生的微多普勒特征的放大视图。与现有基线仿真器(mmGPE 和 RF-Genesis)相比,HybridSim 合成的信号显示出显著更高的视觉保真度,与物理真实值匹配,准确保留了细粒度运动学细节。

4.5 下游任务:人体活动识别

为验证所提仿真器在弥合仿真到真实领域差距方面的实际效用,我们在下游人体活动识别(HAR)任务上评估了框架的性能。我们采用 mmAP 模型 [10825019] 作为分类主干,该模型利用三种热图(即时间-多普勒、时间-距离和时间-角度)对人体活动进行分类。

在仿真到真实评估协议下,我们仅在八个动作类别中为未见对象生成的合成数据上训练分类器,然后直接在相应的物理真实测量数据上测试。此下游评估的纳入至关重要,因为标准重建指标往往不能完全反映雷达散射截面(RCS)动力学的保真度。像 PSNR 这样的指标提供了像素级相似性的全局度量,但由于雷达数据的稀疏性而存在固有偏差。由于人体运动的微多普勒特征仅占据热图内的边缘区域,背景噪声基底主导了空间区域。因此,合成关键运动学语义的实质性改进仅能带来全局 PSNR 的增量增益。

下游 HAR 任务通过严厉惩罚物理上不真实的伪影和缺失的微多普勒分量,提供了更具代表性的评估。如表 2 所示,在 HybridSim 数据上训练的模型达到 92.07% 的识别准确率。这相比 mmGPE(54.22%)实现了 37.85% 的绝对增益,尽管 HybridSim 在跨对象设置下(表 1)PSNR 仅显示出适度的 10.9% 改进(从 20.09 到 22.29)。这种差异证实了在真实传感器数据上的分类准确率是衡量仿真器是否保留了稳健真实世界雷达感知所需基本运动语义的更可靠指标。

为进一步评估跨对象泛化性并增加下游评估的多样性,我们还在另一个留出的人体对象上进行了 HAR 评估。这些补充结果见补充材料第 9 节,并进一步证实了 HybridSim 的鲁棒性。

表3:渲染公式的消融研究。我们将我们的完整解耦架构与一种“耦合 3DGS”变体进行比较,该变体中直接和间接信号路径在统一的纯高斯补丁表示下建模,不使用 BRDF。评估在未见对象上进行,包括 8 个动作,报告 RD 合成保真度和 HAR 性能。

方法

合成指标

下游任务(HAR)

PSNR ↑

SSIM ↑

LPIPS ↓

准确率 (%) ↑

F1分数 ↑

HybridSim(耦合 3DGS)

19.12

0.252

0.099

85.61

0.8492

HybridSim(带 BRDF)

22.29

0.262

0.084

92.07

0.9216

4.6 消融研究:解耦混合渲染的影响

为评估解耦物理-学习架构的必要性,我们进行了聚焦于渲染公式的消融研究。我们构建了一个称为“耦合 3DGS”的变体,其中直接和间接信号路径被统一,完全使用高斯补丁建模。此配置移除了 BRDF 模型,迫使网络使用球谐函数隐式学习所有波-表面交互。与我们的跨对象协议一致,我们在 RD 热图合成任务和下游人体活动识别任务上使用未见对象评估此变体。

定量结果总结于表 3,表明当路径耦合时所有指标均出现性能下降。具体地,PSNR 从 22.29 dB 显著下降至 19.12 dB。由于高斯补丁依赖低阶球谐函数表示视角相关幅度,它难以准确合成主要直接路径特征的锐利、高方向性镜面反射。此外,在单一表示中统一直接和间接路径迫使网络隐式解析复杂多径干扰,严重纠缠动态人体运动学与静态环境反射。这种物理解耦和显式 BRDF 约束的缺失严重影响了下游性能,分类准确率从完整 HybridSim 模型的 92.07% 降至 85.61%,F1 分数从 0.9216 降至 0.8492。这种下降证实,当这些不同的物理现象耦合时,网络会过拟合训练数据,无法捕获鲁棒仿真到真实泛化所需的固有微多普勒语义。这些发现证实了显式解缠主要表面反射与复杂环境多径效应对于高保真雷达仿真是至关重要的。

4.7 消融研究:直接路径与间接路径的贡献

补充材料图 10 显示,直接路径承载了主要的人体运动响应,而间接路径贡献了较弱的场景相关多径反射。定量地,移除间接路径使 HAR 性能从 92.07% 准确率 / 0.9216 F1 分数降至 88.96% / 0.8874。这表明间接路径不是人体运动线索的主要来源,但提供了互补的多径信息,改善了 Sim2Real 对齐。

我们还添加了一个基于理想镜面反射的二跳几何光线追踪基线。在该基线中,直接路径与我们的保持一致,仅替换基于 3DGS 的间接路径。该基线需要 3.44 秒/帧,而我们的方法需要不到 1 秒/帧,每帧运行时间减少了 70% 以上。其 HAR 准确率降至 41.6%,主要是因为固定的经验反射系数无法建模场地特定的多径响应。由此产生的虚假高能反射扭曲了 RD 热图并损害了 HAR 训练,支持了我们的间接路径设计。

4.8 消融研究:场地特定的第二场景适应

由于 mmMesh 数据集不包含第二个房间布局,我们重新利用了另一个自采数据集。该数据集包含一名男性执行 12 个新动作,8 个用于训练,4 个用于评估。这些动作的运动幅度小于主论文中的动作(详情见补充材料第 11 节)。HybridSim 达到 22.01 dB PSNR、0.241 SSIM、0.108 LPIPS,以及 HAR 准确率 88.68% / F1 分数 0.8875。这表明 HybridSim 可以适应新的房间布局。此处的 HAR 较低部分归因于由较小运动幅度引起的较弱肢体相关反射,这使得细粒度动作区分更加困难。

4.9 消融研究:噪声基底对仿真到真实对齐的影响

为评估动态噪声注入对弥合仿真到真实领域差距的影响,我们在 HAR 任务下比较了具有不同噪声基底策略的 HybridSim 变体。如第 3.4 节所述,理想化物理仿真固有地缺乏真实世界测量中存在的传感器噪声。我们将不可预测的环境和硬件噪声基底的近似委托给统计学习。不注入合成噪声时,在纯净模拟数据上训练的下游分类器倾向于过拟合于不切实际的干净背景。如表 4 所示,没有任何噪声注入的变体,记为 HybridSim(无噪声),仅达到 72.79% 的准确率和 0.6790 的 F1 分数。这一显著性能下降突显了背景噪声对于鲁棒仿真到真实迁移的必要性。

为建立比较的控制变量,我们评估了一个注入固定噪声基底的变体。它使用与第 4.5 节基线方法相同的恒定噪声水平;细节见补充材料第 12 节。应用此匹配的静态噪声将分类准确率提升至 90.51%,F1 分数提升至 0.9068。在完全相同的噪声约束下超越基线,证明了主要性能驱动因素是解耦的物理-学习架构而非噪声增强。具有动态优化噪声水平的完整模型达到了最高的准确率 92.07% 和 F1 分数 0.9216。这种渐进式的仿真到真实对齐在图 5 中视觉上明显。与零噪声仿真不切实际的干净背景相比,在训练期间学习最优噪声率直接将合成数据分布与物理真实值的统计特性对齐,进一步缩小了仿真到真实的差距。

表4:下游 HAR 任务上噪声注入策略的定量评估。我们比较了在无噪声、固定噪声和可学习噪声的模拟数据上训练的模型的分类准确率和 F1 分数。

训练来源(仿真器)

准确率 (%) ↑

F1分数 ↑

HybridSim(无噪声)

72.79

0.6790

HybridSim(固定噪声)

90.51

0.9068

HybridSim(可学习噪声)

92.07

0.9216

图5:不同噪声注入策略下生成的距离-多普勒热图的视觉比较。从左到右:无噪声仿真、固定噪声仿真、可学习噪声仿真和真实值。可学习噪声策略产生的背景噪声分布最接近真实传感器测量。


5 结论与局限

在本文中,我们提出了 HybridSim,一种物理-学习混合仿真器,旨在从动态人体网格合成高保真毫米波雷达 RD 热图。通过将信号传播显式解耦为基于逆渲染的直接路径和基于 3DGS 的间接路径,该框架成功地将主要表面散射与复杂环境多径效应解缠。广泛评估以及在下游人体活动识别任务中的显著改进,证明了 HybridSim 在弥合仿真到真实领域差距方面相比现有基线的优越能力。

虽然 HybridSim 对未见人体目标展现出鲁棒的跨对象泛化性,但当前静态场景表示针对特定训练环境进行了优化,需要为新室内布局进行参数微调。一个引人注目的未来研究方向是将泛化神经场景先验整合进来,以将环境特征嵌入与特定房间几何解耦。此扩展旨在促进对任意新环境的零样本或快速少样本适应,从而进一步推进合成雷达数据生成在普适人体感知应用中的可扩展性。