作者介绍
胡庭恺,西南大学电子信息工程学院,计算机科学与技术专业在读博士研究生,主要研究方向为无监督毫米波雷达SAR成像,长期致力于毫米波雷达与深度学习的交叉融合研究,尤其关注技术成果的工程转化能力与商业化落地潜力。亦在探索AI Agent技术在电子信息工程领域的赋能场景与应用实践。
很多雷达手势系统“网络很快,整机却不快”,因为 Range-Doppler、微多普勒等特征图前面还堵着 FFT、加窗和杂波处理。
这篇工作选择直接吃 FMCW 原始复值 ADC 立方体,用 (2+1)D 复值卷积在时域学空时特征,并把 Monte Carlo Dropout 与 Deep Ensemble 接进不确定性估计。
结果是 10 类手势 99.38% 准确率、仅约 6.75k 参数;在 Jetson Nano 上端到端 2.75 ms,相对多种 FFT 管线总时延快 4× 到 86×。代码和数据已公开,边缘雷达交互如果还在为预处理延迟买单,值得认真看这套 FFT-free 路线。
原论文信息
论文标题:Complex-Valued (2+1)D Convolutional Neural Networks for Real-Time Hand Gesture Recognition on Edge Devices with FMCW Radar
发表日期:2026年7月
发表单位:PHENIKAA University;Shibaura Institute of Technology;Vietnam National University, Hanoi
期刊:IEEE Transactions on Aerospace and Electronic Systems
原文链接:https://doi.org/10.1109/TAES.2026.3709269
开源代码:https://github.com/thetuantrinh/Hand-Gesture-Recognition.git
通讯作者:Minhhuy Le,PHENIKAA University
手势网络很快,系统却仍在等 FFT?
近距人机交互里,FMCW 雷达能在暗光、遮挡和隐私敏感场景下工作。工程上拖后腿的,常常不是最后那层分类头,而是特征图流水线。
一次识别若先做多维 FFT、再拼 Range-Doppler / 微多普勒 / 角度图,预处理就可能吃掉十几到上百毫秒。论文复现对照里,有的 3D RDI 预处理到约 164 ms,而分类网络本身可能只有数毫秒。
难点很具体:
- ⚡ 预处理税高:窗长、FFT 长度、重叠率都会改变端到端延迟。
- 📡 信息被提前切块:只保留幅度谱时,相位关系容易在前端就丢。
- 🌧️ 噪声下要敢不敢用:交互系统不仅要类别,还要知道何时不置信。
现有路线的典型困境:
- FFT 特征 + CNN/LSTM:精度高,但边缘总延迟受前端绑定。
- 轻量频谱 CNN:模型可压小,仍难绕开 FFT。
- 已有 Fourier-free 尝试:方向对,但精度、参数量或可部署性还不够齐。
这篇文章工作的目标很明确:把雷达手势识别做成真正可在边缘实时跑的端到端复值网络,并补上不确定性。
从“先变频谱再识别”到“复值网络直读 ADC”
作者把系统主线改成:原始中频复信号直接进网络。
关键判断:与其在前端用 FFT 人工切出距离-速度图,不如让复值卷积同时利用幅度与相位,在时域学出手势的空时结构。
FFT-free 输入
雷达是 TI AWR1243,77–81 GHz,带宽 4 GHz,3Tx×4Rx。每帧 128 chirps、每 chirp 64 ADC 点,帧率 20 fps。
一个样本堆 20 帧(约 1 s)原始复数据,手势距离主要在 10–50 cm。
跳过 FFT 也意味着噪声和杂波没有被经典前端“洗干净”,所以网络必须更会从原始域分出有用运动。
复值运算
复卷积按复数乘法展开实虚交叉项,随后接复批归一化和 C-ReLU。
分类时对复特征幅度做 Softmax。
这样相位不是事后拼接通道,而是卷积归纳偏置的一部分。
(2+1)D 因式分解控参数
完整 3D 复卷积参数更贵。
作者拆成:
- STCV:在快时间-慢时间平面抽空间/距离-多普勒相关结构;
- TCCV:再沿通道-时间融合天线维信息。
同设定下,(2+1)D CVNet 约 6.75k 参数,传统 3D CNN 约 17.04k,参数量大约少 2.53×,准确率反而从 97.93% 到 99.38%。
不确定性不是附加题
训练和推理可启用 Monte Carlo Dropout,也可训练多个独立模型做 Deep Ensemble。噪声恶化时,多通行推断用来压低盲目自信。
算法怎么跑起来?
数据与标签
10 类:下压、上拉、逆时针、顺时针、放大、缩小、左、右、无手、静止举手(UKN)。
处理后总样本约 38809,8 人训练、2 人验证,按人划分,避免同人泄漏。
前向主路径
输入复立方体后,残差块内重复“复卷积 → 复 BN → C-ReLU”,并用 (2+1)D 分解降低 3D 核成本;全局池化后输出 10 类。
硬件资源落点:计算从“多维 FFT + 实值 CNN”改成“纯网络 MAC”。
论文在 Jetson Nano(FP16、batch=8)测到约 7.28 GMACs / 14.55 GFLOPs,网络端到端 2.75 ms。
FFT 管线的延迟大头往往在预处理,不在分类头,把预处理删掉,整机才从“看起来实时”变成“测下来实时”。
不确定性推断
- MC-D:同一模型多次 dropout 前向,平均概率,方差/熵作不确定度。
- DEL:多模型独立训练后平均,校准通常更好,成本也更高。
99.38% 只是分数,2.75 ms 才是系统故事
干净验证集上,(2+1)D CVNet 准确率 99.38%。混淆矩阵里多数类别在 98.1%–100%,UKN 约 98.1%。
同数据复现对照中,不少 FFT 特征方法可到 98% 左右,但参数量与总延迟通常更高;传统 3D CNN 直吃原始数据也有 97.93%,仍低于复值 (2+1)D。公开 BGT60 相关集合上,方法报到 94.05%,高于文中 ResNet-18 对照的 90.78%。
真正拉开差距的是边缘总时延(Jetson Nano):
- 本方法预处理0 ms,总时延2.75 ms(约 364 FPS)
- 对照 FFT 管线总时延常见约11.8 ms 到 166 ms
- 论文概括为整体快约4×–86×
功耗侧文中提到约 4.5 W、GPU 利用率约 20.3% 的测量口径,说明它不是靠堆算力硬推。
噪声方面,作者给验证集加 AGWN,扫 -5 到 20 dB。
干净/高 SNR 时三种推断都接近 99%、ECE 约 0.023,噪声加重后,MC-D 与 DEL 相对单次前向大约有 3%–16% 的准确率收益,DEL 校准更好。
🔧 工程可行性翻译
雷达 20 fps 时帧周期 50 ms。2.75 ms 推理只占帧周期约 5.5%,就算加上采集搬运,仍有预算做滑动窗口、投票或安全互锁。
和“分类 1 ms、FFT 30–150 ms”的系统相比,用户体感延迟会完全不同。
代价是:MC-D/DEL 的多通行会成倍吃时延,实时闭环里更适合“平时单次前向,低置信再触发多通行复核”。
从实验室采集到噪声应力测试
采集在室内完成,手距雷达 10–50 cm,天线罩用低损耗介质塑料。
图中可见实验布置与类别样本分布。
需要保持冷静的边界:
- 噪声是可控加性高斯白噪声,不是完整多径、电机干扰或雷达互扰;
- 距离包络偏近距,远距手势未充分验证;
- 当前是片段分类,不是连续手势切分与在线词表扩展。
即便如此,作者把总延迟测到 Jetson Nano,并把代码数据公开,已经比很多“只报 GPU 准确率”的工作更接近工程。
边缘雷达交互“删掉 FFT”之后
若模组算力有限、交互又要求低时延,FFT-free 复值网络提供了一条可验证路径:把延迟预算从预处理夺回给系统逻辑。
可迁移方向包括:
- 笔记本/白电近距隔空手势(0.1–0.5 m);
- 辅助机器人床旁短距指令,并结合不确定度做“不确信就请求重复”;
- 其他短距 FMCW 时域学习任务,如近距存在检测或简单动作开关。
更大的判断是:当边缘芯片算力不再宽裕时,雷达感知的优化重点会从“更漂亮的中间特征图”,转向“哪些经典前端步骤其实可以被可学习算子替换”。
作者三问
1. 不做 FFT,网络如何还能分出手势?
中频复信号里已经编码了散射点的距离相位与运动引起的时变。
复值卷积保留实虚耦合,(2+1)D 结构再分别挖空时图案和通道关系。
FFT 是一种固定基变换;这里改由数据学习更任务化的时域滤波器。
2. 2.75 ms 是否意味着任意边缘芯片都能实时?
只说明在 Jetson Nano、FP16、论文设定下测到了这个数。换到 MCU 或更小 NPU,算子支持、内存带宽和复数量化方案都会变。
它证明的是“总链路可以不再被 FFT 绑架”,不是“所有硬件都自动 2.75 ms”。
3. 有了不确定性,产品就能安全上线吗?
它提供了拒识和二次确认的信号,尤其在低 SNR 时有增益。
但当前噪声模型偏合成,真实误触发成本还要结合连续手势、背景人体和多径场景重测。
不确定度是安全机制的输入,不是安全机制本身。
作者测评
学术/科研价值:★★★★☆
把复值网络、(2+1)D 分解、FFT-free 雷达前端和不确定性估计收到同一边缘 HGR 框架,并用统一数据重跑多种 SOTA,证据扎实。代码数据公开进一步抬高复现价值。噪声类型和远距/连续手势仍偏窄,理论分析少于系统贡献。
工业/工程价值:★★★★★
少见地把“预处理时延”当成一等指标,并在 Jetson Nano 给出端到端 2.75 ms 与功耗/利用率口径。对边缘交互,这比再涨 0.5 个点准确率更关键。距工业量产还差:连续识别、远距、真实干扰和更低功耗器件移植。
商业/产品价值:★★★★☆
一句话可传达:雷达手势不必先做完 FFT 再识别,边缘端可以几毫秒级出结果。消费电子、智慧座舱近距控制和护理机器人都可能是付费场景,且开源降低评估成本。商品化仍要补手势词表扩展、误触发率与外观/结构集成验证。
可能的问题:
- 距离主要 10–50 cm,桌面/座舱远一些的交互未充分覆盖。
- 噪声实验以 AGWN 为主,真实多径与硬件损伤不足。
- 片段式 10 类分类不等于连续手势系统。
- MC-D/DEL 提升稳健性的同时会增加推断成本。
- 复值算子在部分 NPU/MCU 工具链上支持仍不完整。
主要参考文献
Trinh, T. T., Tan, P. X., Van, K. N., Tram, P. V. B., Nguyen, X., Dang, K. N., & Le, M. (2026). Complex-Valued (2+1)D Convolutional Neural Networks for Real-Time Hand Gesture Recognition on Edge Devices with FMCW Radar. IEEE Transactions on Aerospace and Electronic Systems. https://doi.org/10.1109/TAES.2026.3709269
本文仅代表个人理解及观点,不构成任何论文审核或项目落地推荐意见,具体以相关组织评审结果为准。论文内容如有理解偏差,以原文为准。欢迎就论文内容交流探讨,理性发言哦~
关于 SuperRadar 社区
SuperRadar是深圳承泰科技股份有限公司核心 Sponsor 的开放社区,聚焦感知、
AI算法、多传感器融合、机器人、智能交通、工业安全、低空经济等方向,
致力于通过开放技术基座、开发者工具、场景实践和生态共创,推动毫米波雷达感知技术进步与智能感知行业发展。
GitHub:https://github.com/super-radar
官网:https://www.superradar.cn
联系小助手:superradar01