智元感知面试,杂乱桌面上抓目标物体的pipeline你能画出来吗

📅 2026/7/30 22:48:16 👁️ 阅读次数 📝 编程学习
智元感知面试,杂乱桌面上抓目标物体的pipeline你能画出来吗

上篇聊完VLA模型之后,后台有读者说:"大模型听着很厉害,但没有底层的感知模块,大模型连桌上的杯子在哪都找不到。"这话说得太对了。感知算法工程师在智元的团队里扮演的是"机器人的眼睛"这个角色——不管上层的大模型多聪明,如果感知模块给的信息不准,一切都是白搭。

智元的感知岗面试跟大疆、宇树的视觉岗侧重点不同。大疆偏航拍感知,宇树偏地形感知,智元偏的是桌面操作场景下的3D感知——在杂乱的桌面上精确地检测、分割和定位各种物体,还要算出最佳的抓取点。

3D场景理解:从点云到语义

面试官的第一个问题从整体pipeline切入。"给你一个RGB-D相机拍的桌面场景,你怎么输出每个物体的3D包围盒和语义标签?"

完整的3D场景理解pipeline大致分几步:首先是点云生成——用深度相机的内参把深度图转成3D点云;然后做平面分割——用RANSAC把桌面平面去掉,剩下的就是桌上的物体;接着做物体级实例分割——把点云分成一个个独立的物体簇,常用的方法是基于超体素聚类的Supervoxel Segmentation或者深度学习模型PointGroup;最后对每个物体簇做语义分类(用PointNet++或者DGCNN分类)和3D包围盒拟合(最小包围盒或者OBB)。

面试官追问:"物体之间有遮挡怎么办?一个杯子被一本书挡住了一半,你的分割能把它完整分出来吗?"

遮挡是桌面场景感知最大的挑战。被遮挡的物体在点云里只有部分可见,直接