AI 搬家复原 Agent 项目报告书:让 DGX Spark 记住一个家的秩序
AI 搬家复原 Agent 项目报告书:让 DGX Spark 记住一个家的秩序
赛事名称:第二届 DGX Spark Hackathon 黑客松比赛
项目名称:AI 搬家复原 Agent
开源仓库:https://github.com/seandongAne/niantoutongda-dgx-spark
Demo 视频:https://www.bilibili.com/video/BV1KbKH6sEuP/?vd_source=11420bee6af944cfd208ce18c89a53d7
赛事征文:https://zhuanlan.zhihu.com/p/2062866864926089565
团队名称:念头通达
AI 辅助说明:本文使用 AI 工具进行结构化整理和语言润色;项目指标、技术边界和证据路径来自项目仓库中的实际运行记录。
摘要
本报告书介绍 DGX Spark Hackathon 项目 AI 搬家复原 Agent。项目从三段旧居视频、一段口述旁白和一段新居扫描出发,在 DGX Spark 本地完成可信物品记忆、生活组合、新家空间理解、约束布局和任务卡生成,并通过 trace replay 和 SHA-256 bundle 保证结果可复核。
搬家真正困难的部分,往往不是把物品从 A 点运到 B 点,而是把一个家已经形成的使用习惯、物品关系和空间秩序,一起迁移到新环境。传统搬家服务交付的是箱子,传统收纳服务依赖人工经验,而用户真正痛苦的是:到了新家之后找不到东西,原本顺手的生活组合被拆散,厨房、书桌、洗漱、儿童用品、老人常用物品等日常动线突然失效。
AI 搬家复原 Agent 面向这个真实场景,构建了一套运行在 NVIDIA DGX Spark 上的本地多模态 Agent 系统。系统接收三段旧居视频、一段口述旁白和一段新居扫描,自动生成可信物品记忆、生活组合、新家目标区域、约束布局和可执行搬家任务卡,并通过 trace replay、bundle 和 SHA-256 产物索引保证结论可复核。
在完整实测链路中,系统将 3306 个原始视觉实体收敛为 20 件可信物品,把澄清问题控制在 4 个以内;20 件物品被组织为 3 个生活组合和 2 个独立收纳单元;新居侧从 2278 条空间观测中形成 168 个候选区域,自动确定 5 个最终区域;布局求解输出PLAN_READY,生成 5 张可执行任务卡;最终 bundle 收录 44 份带 SHA-256 的阶段产物,四 Agent 主链 replay 结果为PASS。
本项目的核心价值不是“识别出更多物品”,而是把家庭空间中的物品、习惯、区域和执行动作组织成一条可计算、可执行、可验收、可回放的链路。它展示了 DGX Spark 在隐私敏感、多模态、本地推理、模型优化和 Agent 编排上的平台优势。
目录
- 项目概述:名称、目标与背景
- 作品介绍:功能与核心亮点
- 系统架构与技术实现
- 多 Agent 协作设计
- 模型与算法方案
- NVIDIA SDK / 模型 / StepFun 使用说明
- DGX Spark 本地部署与模型优化
- 项目完整性与实测结果
- 安全、隐私与合规
- Demo 演示视频与展示口径
- 团队分工与贡献
- 项目价值与评审要点总结
- 未来展望
- 结语
- 附录
1. 项目概述:名称、目标与背景
1.1 项目名称
AI 搬家复原 Agent:让 DGX Spark 记住一个家的秩序。
1.2 一句话介绍
AI 搬家复原 Agent 是一套运行于 NVIDIA DGX Spark 的本地多模态智能体系统。它不是简单识别“有什么物品”,而是理解用户旧家的物品关系、生活习惯和空间秩序,并在新家生成可执行的复原方案,让搬家从“物品迁移”升级为“生活方式恢复”,它是一套可以被重新建立的生活秩序。
1.3 项目目标
本项目要解决的不是普通的“图片识别”问题,而是一个真实的家庭空间复原问题:
- 从旧居视频和口述中恢复可信物品记忆。
- 判断哪些物品经常一起使用,应该作为生活组合一起搬、一起放、一起验收。
- 从新居扫描中理解可用区域和空间约束。
- 在容量、支撑、电源、共置、互斥、风险等条件下生成布局方案。
- 把布局方案编译成搬家人员可以直接执行的任务卡。
- 通过结构化 trace、bundle 和 SHA-256 证据证明每一步结论可以复查。
最终交付不是一张“识别清单”,而是一套从旧家到新家的生活秩序迁移方案。
1.4 项目背景
搬家场景里,用户表面上需要的是“打包、运输、上门还原”,真正困难却经常发生在搬家之后:
- 常用物品找不到。
- 原来一起使用的东西被拆散。
- 书桌、厨房、梳妆台、洗漱区、展示柜等区域的使用习惯失效。
- 用户只记得“这个东西以前放得很顺手”,却很难说清楚它和哪些物品、哪些区域、哪些动作绑定在一起。
- 收纳管理师需要反复询问生活习惯,把隐性的使用关系重新翻译成箱单、标签、摆放建议和验收标准。
传统清单只能记录“有什么”,很难记录“为什么这些东西应该在一起”。普通视觉识别也只能回答“画面里有什么”,很难回答“这些东西在旧家承担什么生活功能,到新家应该如何恢复”。这正是多模态 Agent 可以切入的地方:它不只是识别物品,而是把物品关系、使用场景和空间约束一起建模。
1.5 行业落地价值
本项目可以服务于多个真实业务场景:
| 场景 | 价值 |
|---|---|
| 家庭搬家 | 减少开箱混乱,恢复原有生活动线 |
| 收纳管理师 | 沉淀预勘、访谈、箱单、摆放建议和验收证据 |
| 搬家公司 | 从“运输箱子”升级为“交付可复原的生活秩序” |
| 长租公寓 / 民宿 | 快速生成标准化布置和复位方案 |
| 适老化改造 | 保留老人习惯,把常用物品映射到更安全的位置 |
| 家政与资产盘点 | 建立可审计的家庭物品状态记录 |
| 保险与理赔 | 形成带证据链的家庭资产变化记录 |
| 家务机器人 / 家庭具身智能 | 为机器人提供家庭物品记忆、空间语义、任务拆解和执行约束,成为未来家务机器人的指令中枢之一 |
因此,它不是一个只为比赛而设定的玩具问题,而是一个具有明确 B2C、B2B2C 和行业服务延展空间的本地 AI 应用。更进一步看,项目沉淀的“物品在哪里、常和什么一起使用、适合放到哪个区域、执行时有哪些约束”这类家庭语义资产,也可以成为未来家务机器人理解家庭环境和接受高层指令的中枢能力之一。
2. 作品介绍:功能与核心亮点
2.1 输入与输出
系统输入包括:
- 三段旧居视频:随手拍摄旧家中物品、区域、柜体、桌面和生活组合。
- 一段口述旁白:用户说明生活习惯、常用物品、摆放偏好和需要保留的动线。
- 一段新居扫描:拍摄新家可用区域、柜体、桌面、墙架、梳妆台等空间。
系统输出包括:
- 可信物品清单。
- 最少澄清问题。
- 生活组合和装箱单元。
- 新家可用区域和目标区域。
- 约束布局方案。
- 可执行任务卡。
- 可回放审计 trace。
- 带 SHA-256 的成果 bundle。
整体流程如下:
旧居视频 + 口述旁白 + 新居扫描 -> 多模态感知 -> 可信物品记忆 -> 生活组合关系 -> 新家区域理解 -> 约束布局求解 -> 搬家任务卡 -> trace replay + bundle 证据回放2.2 核心功能
功能一:从嘈杂视频中建立可信物品记忆
旧家视频不是干净的商品图,而是普通家庭空间中的真实拍摄:遮挡、重复、角度变化、相似物品、画面模糊都会影响识别。系统先进行开放词汇检测和跨视角重识别,再通过质量门和 Agent 判断收敛为可信物品。
实测结果:
- 原始视觉实体:3306 个。
- 候选链接:2043 条。
- 可信物品:20 件。
- 可信物品置信度均值:1.0。
- 下游可用物品:20 件。
功能二:把物品清单升级为生活组合
搬家不是单件物品移动,而是生活组合迁移。例如杯子和饮品、学习文具、洗漱护理用品、玩具、零食等往往具有共同使用关系。系统通过视觉证据、口述旁白和结构化规则,将可信物品组织成可搬运、可摆放、可验收的组合。
实测结果:
- 20 件可信物品。
- 3 个生活组合。
- 2 个独立收纳单元。
- 5 个最终搬运箱 / 摆放单元。
- 覆盖 20/20。
功能三:自动理解新家可用区域
新居扫描中可能出现大量视觉候选区域。SPACE Agent 将新家视频中的空间观测归并、筛选和评分,最终确定可用于摆放的目标区域。
实测结果:
- 新家空间观测:2278 条。
- 候选区域:168 个。
- 自动接受区域:5 个。
- 需要人工标注区域:0 个。
- 预期锚点覆盖率:1.0。
- 空间门状态:
PASS。
功能四:约束布局与任务卡生成
EXEC Agent 将生活组合、区域信息和约束条件交给 OR-Tools CP-SAT 进行求解。布局不只考虑“能不能放”,还考虑支撑类型、区域容量、电源证据、同放、互斥和禁放等硬约束。
实测结果:
- 布局状态:
PLAN_READY。 - 搬运单元:5 个。
- 任务卡:5 张。
- 冲突:0。
- 覆盖物品:20/20。
典型任务卡示例包括:
study_stationery -> auto_study_desk_01cups_and_drinks -> auto_display_cabinet_01toiletries_and_care -> auto_vanity_01technical_toys_pack -> auto_wall_shelf_01technical_snacks_pack -> auto_chest_of_drawers_01
功能五:审计回放和证据包
为了避免“视频看起来可以,但无法复核”的问题,系统将 Agent 之间的关键交接记录为结构化消息。最终主链包括:
ENTITIES_READYGROUPS_READYPLACEMENT_READYTASKS_READY
四个 Agent producer 分别为:
MEMGROUPSPACEEXEC
最终 replay 状态为PASS,bundle 收录 44 份阶段产物及对应 SHA-256。
2.3 作品亮点总结
本项目有五个核心亮点:
- 真实场景强:从收纳管理师和家庭搬家痛点出发,不是抽象 Demo。
- 技术闭环完整:旧家感知、新家理解、布局求解、任务卡、审计回放全部打通。
- 多 Agent 不停留在概念:Agent 间使用结构化契约、消息哈希和 trace replay。
- 平台适配明确:DGX Spark 本地承载多模态模型、推理、训练、求解和证据回放。
- 工程边界诚实:对 TensorRT FP16、StepFun 云端辅助、真实搬后验收等均明确边界,不夸大结果。
3. 系统架构与技术实现
3.1 总体架构
系统分为六层:
| 层级 | 作用 | 关键技术 |
|---|---|---|
| 输入层 | 接收旧居视频、口述旁白、新居扫描 | 视频、音频、文本 |
| 多模态感知层 | 识别物品、抽取旁白、理解图文属性 | Step-Audio 2 mini、Grounding DINO、DINOv2、Nemotron |
| 可信记忆层 | 把 raw 检测结果收敛为可信物品 | ReID、质量门、投影头、结构化库存 |
| Agent 编排层 | 分阶段完成记忆、组合、空间、执行 | MEM / GROUP / SPACE / EXEC |
| 求解与交付层 | 生成布局和任务卡 | OR-Tools CP-SAT、任务卡渲染 |
| 证据审计层 | 支持复核、回放和公开提交 | JSONL、bundle、SHA-256、replay |
3.2 数据流
三段旧居视频 -> Grounding DINO 开放词汇检测 -> DINOv2 + 投影头跨视角特征 -> ReID / 匈牙利匹配 / hard negative / 质量门 -> MEM Agent 可信物品记忆 一段口述旁白 -> Step-Audio 2 mini 转写与结构化 -> 生活习惯线索 -> GROUP Agent 生活组合 一段新居扫描 -> 空间观测 -> 候选区域 -> SPACE Agent 目标区域 可信物品 + 生活组合 + 目标区域 -> EXEC Agent -> OR-Tools CP-SAT -> PLAN_READY -> 任务卡 -> trace replay / bundle3.3 为什么不是普通识别系统
普通识别系统通常只回答:
这张图里有什么?本项目要回答的是:
这些物品在旧家里承担什么生活功能? 哪些东西应该一起搬? 到新家后放在哪个区域才符合原有使用习惯? 这个结论能不能被复核? 搬家人员能不能直接执行?因此,系统重点不在单点模型能力,而在“从多模态证据到可执行计划”的完整工程链路。
4. 多 Agent 协作设计
4.1 四个 Agent 的职责
| Agent | 核心问题 | 输入 | 输出 |
|---|---|---|---|
| MEM Agent | 哪些物品是真实可信、可进入下游的? | raw 检测、ReID、旁白线索 | 可信物品清单、最少澄清问题 |
| GROUP Agent | 哪些物品应该一起搬、一起放? | 可信物品、生活事实 | 生活组合、独立收纳单元、箱单 |
| SPACE Agent | 新家哪些区域可用? | 新居扫描、空间观测 | 目标区域、区域约束 |
| EXEC Agent | 如何生成可执行计划? | 组合、区域、约束 | 布局方案、任务卡、验收清单 |
4.2 结构化通信
Agent 之间不依赖隐式聊天上下文,而是通过结构化契约通信。核心特点包括:
- 使用 Pydantic v2 定义数据结构。
- 使用 JSON / JSONL 记录消息。
- 每条消息带
message_id、producer 和因果引用。 - 关键 payload 记录 SHA-256 hash。
- 主链动作可以 replay。
这让多 Agent 协作从“概念分工”落到了“可审计的工程边界”。
4.3 主链 replay
最终主链 replay 报告显示:
| 指标 | 结果 |
|---|---|
| message_count | 4 |
| AgentHandoff | 4 |
| producer | MEM / GROUP / SPACE / EXEC |
| main_chain complete | 1 |
| status | PASS |
对应四个动作:
ENTITIES_READY GROUPS_READY PLACEMENT_READY TASKS_READY这说明系统已经完成从实体、组合、摆放到任务的闭环,而不是只完成其中一个局部环节。
验收阶段还在 Spark 上以独立进程完成了 MEM / SPACE 并行 fan-out 与 EXEC 确定性 fan-in,让多 Agent 不只是文档里的角色划分,而是具备可验证进程边界的工程实现。
5. 模型与算法方案
5.1 Step-Audio 2 mini:旁白理解
家庭空间中的很多关键信息不是视觉可以直接判断的,例如:
- 哪些物品经常一起使用。
- 哪些东西是孩子常用、老人常用或工作常用。
- 哪些位置是用户长期习惯。
- 哪些物品虽然不相邻,但属于同一生活任务。
Step-Audio 2 mini 用于口述旁白理解,将自然语言转化为结构化生活线索,辅助 GROUP Agent 建立生活组合。
5.2 Grounding DINO:开放词汇目标发现
旧居视频不是标准数据集图片。系统使用 Grounding DINO 做开放词汇目标发现,尽可能召回物品候选,然后通过后续质量门和 Agent 逻辑收敛。
本项目没有把 raw 检测结果直接当作最终结果,而是将 3306 个原始视觉实体收敛为 20 件可信物品。这样的设计更符合真实应用:召回可以宽,但进入下游计划的物品必须可信。
5.3 DINOv2 + 投影头:跨视角物品复原
搬家视频中,同一个物品可能在多个镜头出现,也可能被遮挡、旋转或只露出局部。系统使用 DINOv2 冻结视觉骨干配合轻量投影头,提取跨视角物品特征,再结合匈牙利匹配、hard negative、多视角约束和质量门完成 ReID。
当前展示口径:
- 跨视频完整合并:17/20。
- 多策略联合 R@1:
495/577 = 0.8579。 - 统计来源:baseline、v2、v3 正确命中的并集。
研发调优口径中,项目在 Spark 本地训练 DINOv2 轻量投影头,并扫描 18 组工作点,使 ReID R@1 提升到 0.8475,同时将澄清量从 1379 降至 677。最终展示口径则进一步收束到比赛可读的可信库存链路:3306 个原始视觉实体进入主链,最终沉淀为 20 件可信物品和 4 个以内关键澄清问题。
5.4 Nemotron Nano 12B V2 VL:本地图文属性抽取
系统使用NVIDIA-Nemotron-Nano-12B-v2-VL-NVFP4-QAD进行本地图文属性抽取和展示命名辅助。通过 vLLM 服务化后,真实图文工况吞吐从 BF16 Transformers 路径约 1.7 tok/s 提升到 25.4 tok/s,约 15 倍提升。
这部分直接服务 DGX Spark 平台适配:模型运行在本地,家庭图像不需要上传云端,同时具备足够演示和批处理吞吐。
5.5 OR-Tools CP-SAT:约束布局求解
布局阶段不是简单规则匹配,而是约束求解。EXEC Agent 将生活组合和目标区域交给 OR-Tools CP-SAT,在以下约束下求解:
- 支撑类型兼容。
- 区域容量。
- 电源证据。
- 同放约束。
- 互斥约束。
- 禁放规则。
最终求解状态为PLAN_READY,冲突为 0。
6. NVIDIA SDK / 模型 / StepFun 使用说明
6.1 NVIDIA 相关模型与工具
| 模型 / 工具 | 使用位置 | 项目作用 |
|---|---|---|
| DGX Spark | 本地计算底座 | 承载视觉、语音、VLM、训练、推理、求解和证据回放 |
| Nemotron Nano 12B V2 VL NVFP4-QAD | 图文属性抽取 | 本地处理家庭图像属性,支持展示命名和结构化属性 |
| vLLM | 模型服务化 | OpenAI 兼容接口,本地图文吞吐提升 |
| NVFP4 | 模型量化 | 降低权重体积,提升本地 VLM 推理效率 |
| Grounding DINO | 开放词汇检测 | 从旧居视频中召回候选物品 |
| DINOv2 | 视觉特征 | 跨视角物品复原和投影头训练 |
| TensorRT | 运行时优化探索 | 验证 FP32/FP16 引擎、评估等价性和速度边界 |
| torch.compile | 生产路径优化 | 保持 FP32 等价性的稳定加速路径 |
6.2 StepFun 使用说明
项目中使用了 StepFun 阶跃星辰相关能力,但明确区分“运行时主链”和“开发期辅助”:
- Step-Audio 2 mini:用于旁白理解,是输入结构化环节的一部分。
- StepFun 3.7 Flash:用于开发期难样本归因、伪标签建议、调优和文字整理辅助。
正式演示运行时不依赖云端多模态推理。这样的边界有两个意义:
- 保持家庭视频和旁白尽量在 DGX Spark 本地处理,符合隐私敏感场景。
- 避免把开发期调优工具包装成生产运行依赖,保持技术口径诚实。
6.3 不是“堆工具”,而是按职责分层
本项目使用的模型和工具并不是为了堆叠名词,而是各自负责一个清晰问题:
- Step-Audio 解决“用户怎么描述生活习惯”。
- Grounding DINO 解决“画面中可能有什么”。
- DINOv2 / ReID 解决“不同镜头里是不是同一件东西”。
- Nemotron 解决“本地图文属性如何抽取和命名”。
- OR-Tools 解决“布局方案如何满足约束”。
- trace replay 解决“结果如何复查”。
7. DGX Spark 本地部署与模型优化
7.1 为什么适合 DGX Spark
AI 搬家复原 Agent 适合 DGX Spark,不是因为它需要把单个模型跑得更大,而是因为它同时具备四个特点:
- 数据隐私敏感:家庭视频、旁白、空间结构、物品资产都不适合默认上传云端。
- 多模型协同:视觉检测、ReID、语音理解、VLM 属性抽取、组合优化、Agent 回放需要在同一台机器上协作。
- 本地吞吐要求:演示和批处理需要稳定低延迟,不能每一步都等待云端返回。
- 证据可回放:中间产物、模型输出、布局结果和审计消息需要统一管理。
DGX Spark 的 GB10 计算底座、128 GB 统一内存和 NVIDIA 生态工具链,正好支撑这种“隐私敏感 + 多模态 + Agent 编排 + 证据回放”的应用形态。
7.2 本地部署思路
项目部署目标:
- 在 DGX Spark 上放置模型权重和运行环境。
- 本地启动 Nemotron NVFP4 + vLLM 服务。
- 运行视觉、语音、ReID、空间理解和布局求解脚本。
- 生成成果页、任务卡和 bundle。
- 通过测试和 trace replay 复核结果。
公开仓库复核步骤示例:
gitclone https://github.com/seandongAne/niantoutongda-dgx-spark.gitcdniantoutongda-dgx-spark python-mvenv .venvsource.venv/bin/activate pipinstall-rrequirements.txt python-mpytest backend/tests-qpython scripts/replay_trace.py results/hero/s1-auto-final-v1/audit/events.jsonl--strict--reportresults/hero/s1-auto-final-v1/audit/local-replay-report.json python-mhttp.server8000-dresults/hero/s1-auto-final-v1Windows 用户可将虚拟环境激活命令替换为:
.\.venv\Scripts\Activate.ps1然后打开:
http://localhost:8000/7.3 Nemotron NVFP4 + vLLM 优化
项目验证了两条 Nemotron 路径:
| 路径 | 状态 | 图文工况吞吐 |
|---|---|---|
| BF16 Transformers | 已验证 fallback | 约 1.7 tok/s |
| NVFP4 + vLLM | 已上线主路 | 25.4 tok/s |
真实图文工况下,NVFP4 + vLLM 将 128-token 属性抽取从约 75 秒降低到约 5 秒,适合作为批量 crop 属性抽取的主路。
7.4 TensorRT 与等价性边界
项目尝试了 TensorRT FP16 加速,但没有把速度最高的路径直接写成生产成果。原因是:本项目的视觉链路不是单帧分类,而是依赖阈值、边距、滞回、候选关系和下游组合的连续决策。低精度可能导致贴阈值样本翻转,进而影响可信库存、生活组合和任务卡。
因此,面向视觉推理链路的 TensorRT 部署仍按“引擎构建、输出一致性、吞吐测试、证据链接入”的工程顺序推进;测试结果会进入同一套可回放证据链,而不是用单次加速数字替代端到端质量判断。
最终工程口径:
| 优化方向 | 结果 | 是否作为正式口径 |
|---|---|---|
| TensorRT FP16 | 有速度潜力,但低精度会影响边界样本稳定性 | 不进入正式生产口径 |
| TensorRT FP32 | 用于等价性审计和边界验证 | 作为探索证据 |
| torch.compile FP32 | 约 1.170 倍,保持等价性 | 进入正式口径 |
这部分体现了项目的工程判断:速度重要,但在可审计的多阶段 Agent 链路中,等价性和稳定性优先于单点加速数字。
8. 项目完整性与实测结果
8.1 端到端闭环
项目已经完成以下完整链路:
旧家视频 -> 3306 原始视觉实体 -> 20 件可信物品 -> 4 个以内澄清问题 -> 3 个生活组合 + 2 个独立收纳单元 -> 新家 2278 条空间观测 -> 168 个候选区域 -> 5 个最终区域 -> PLAN_READY -> 5 张任务卡 -> trace replay PASS -> 44 份 SHA-256 产物8.2 核心指标表
| 阶段 | 指标 | 结果 | 证据路径 |
|---|---|---|---|
| 旧家感知 | 原始视觉实体 | 3306 | results/hero/s1-auto-final-v1/inventory/metrics.json |
| 可信库存 | 可信物品 | 20 | results/hero/s1-auto-final-v1/inventory/metrics.json |
| 澄清压缩 | 澄清问题 | 4 / cap 4 | results/hero/s1-auto-final-v1/inventory/metrics.json |
| 生活组合 | 生活组合 | 3 | results/hero/s1-auto-final-v1/group/metrics.json |
| 独立收纳 | 技术收纳单元 | 2 | results/hero/s1-auto-final-v1/group/metrics.json |
| 装箱 / 摆放单元 | box_count | 5 | results/hero/s1-auto-final-v1/group/metrics.json |
| 物品覆盖 | covered_canonical_item_count | 20/20 | results/hero/s1-auto-final-v1/group/metrics.json |
| 新家空间 | 空间观测 | 2278 | results/hero/s1-auto-final-v1/spatial/metrics.json |
| 新家区域 | 候选区域 | 168 | results/hero/s1-auto-final-v1/spatial/metrics.json |
| 自动空间 | 自动接受区域 | 5 | results/hero/s1-auto-final-v1/spatial/metrics.json |
| 布局求解 | solver_status | PLAN_READY | results/hero/s1-auto-final-v1/layout/plan.json |
| 任务卡 | 任务卡数量 | 5 | results/hero/s1-auto-final-v1/taskcards/taskcards.md |
| 审计回放 | replay status | PASS | results/hero/s1-auto-final-v1/audit/replay-report.json |
| 证据包 | SHA-256 产物 | 44 | results/hero/s1-auto-final-v1/bundle.json |
8.3 成果页入口
仓库中的正式成果页入口:
results/hero/s1-auto-final-v1/index.html results/hero/s1-auto-final-v1/AI搬家复原_队友展示_单文件.html results/hero/s1-auto-final-v1/showcase_metrics.json成果页的展示主线建议聚焦四个数字:
3306 -> 20 <= 4 个关键问题 自动空间 5/5 5 张任务卡这组数字能帮助我们迅速理解项目价值:系统不是展示一堆原始检测框,而是把嘈杂输入压缩成可执行计划。
9. 安全、隐私与合规
家庭空间数据高度敏感,包含生活习惯、家庭结构、物品资产和空间布局。项目把安全和隐私作为技术方案的前提,而不是上线前的附加项。
已执行的安全纪律:
- 家庭视频和旁白优先在 DGX Spark 本地处理。
.env不进入公开仓库。- 公开仓库只保留
.env.example。 - API Key、SSH Key、模型权重、TensorRT engine、ONNX 大件和原始大视频不公开提交。
- 大文件通过限时预签名 URL 中转。
- 公开材料中对 AI 辅助内容进行标注。
- 对尚未完成的真实搬后验收不做过度宣称。
项目早期还对 Spark 环境进行了安全清理和健康检查,避免在不可信节点上继续处理敏感家庭数据。这个纪律与场景直接相关:如果家庭数据链路不可信,模型能力越强,潜在风险越大。
10. Demo 演示视频与展示口径
10.1 Demo 视频地址
[B站 Demo 演示视频:AI 搬家复原 Agent]:https://www.bilibili.com/video/BV1KbKH6sEuP/?vd_source=11420bee6af944cfd208ce18c89a53d7
11. 团队分工与贡献
| 成员 | 角色 | 主要贡献 |
|---|---|---|
| 【NTTD-Sean】 | 整体项目 / 核心工程 | 负责项目技术路线、系统架构、四 Agent 主链、DGX Spark 部署、模型与算法集成、指标验证、证据链和最终工程收束 |
| 【NTTD-思源】 | 创意与场景策划 | 负责作品叙事、应用场景延展 、团队照片呈现 |
| 【NTTD-廷子】 | 视频拍摄与素材组织 | 负责旧居视频、新居扫描、口述素材、团队素材的拍摄组织和素材整理 |
| 【NTTD-大生】 | Demo 演示与传播包装 | 负责评审价值表达、B站发布和展示材料视觉呈现 |
| 【NTTD-Moon】 | 材料组织与协调统筹 | 负责报告书、开源提交信息、CSDN 发布材料、知乎“十日谈”征文、组委会表单和团队资料整理 |
12. 项目价值与评审要点总结
12.1 项目实用性、行业落地价值与技术创新性:
本项目从真实搬家和收纳管理痛点出发,不是为了比赛临时构造一个单点识别 Demo。它把“搬家后恢复生活秩序”转化为可计算任务,在家庭搬家、收纳管理、适老化改造、长租公寓、民宿复位、家政交接、资产盘点等场景具备落地价值,并可进一步延展为未来家务机器人的家庭记忆与指令中枢。
创新点在于:
- 从物品识别升级为生活组合复原。
- 从单张图理解升级为旧家到新家的空间迁移。
- 从自然语言建议升级为可执行任务卡。
- 从人工执行清单升级为面向家务机器人、机械臂或移动服务机器人的高层任务指令。
- 从黑盒结果升级为可回放证据链。
12.2 智能体融合与模型优化技术深度:
项目不是简单串联多个模型,而是通过 MEM / GROUP / SPACE / EXEC 四 Agent 完成分工:
- MEM 建立可信物品记忆。
- GROUP 恢复生活组合。
- SPACE 理解新家区域。
- EXEC 生成布局和任务卡。
模型优化方面,项目验证了 Nemotron NVFP4 + vLLM、DINOv2 投影头、TensorRT 等价性审计、torch.compileFP32 等路径,并把 StepFun 明确定位为开发期调优辅助。技术深度不仅体现在用了哪些模型,也体现在知道哪些结果可以进入正式口径,哪些只能作为探索证据。
12.3 项目完整性:
项目已完成:
旧家视频 -> 可信库存 -> 生活组合 -> 新家空间 -> 布局求解 -> 任务卡 -> 审计回放并且每个阶段都有对应结果文件和 bundle 证据。相比只展示一个识别界面的 Demo,本项目完成了前后端逻辑、数据契约、测试、文档和演示成果页。
12.4 平台适配性:
项目充分体现 DGX Spark 平台价值:
- 本地处理隐私敏感家庭数据。
- 单机承载视觉、语音、VLM、训练、推理、求解和审计。
- 使用 NVIDIA Nemotron、NVFP4、vLLM、Grounding DINO、DINOv2、TensorRT /
torch.compile等工具链。 - 明确模型权重、API Key 和原始数据的安全边界。
12.5 演示效果:
Demo 重点展示:
- 真实旧家和新家素材。
3306 -> 20的可信库存收敛。3+2的生活组合。2278 -> 168 -> 5的新家空间理解。PLAN_READY和 5 张任务卡。- Nemotron NVFP4 + vLLM 的本地优化效果。
- trace replay
PASS。
演示目标不是炫技,而是让我们能够更直观地看到:系统确实把旧家的生活组合带到了新家。
12.6 赛事征文:
征文链接:DGX Spark 黑客松十日谈
13. 未来展望
13.1 短期增强
- 补充真实用户访谈证据。
- 增加真实搬后照片验收。
- 完善仓库根目录 README 和证据索引。
- 发布 Demo 视频链接。
- 将成果页和任务卡进一步产品化。
13.2 产品化方向
- 为收纳管理师提供预勘和复原工作台。
- 为搬家公司提供“箱单 + 摆放 + 验收”增值服务。
- 为适老化改造提供老人习惯迁移方案。
- 为公寓和民宿提供空间复位模板。
- 为家政、保险和资产盘点提供家庭物品状态证据链。
- 为家务机器人提供家庭环境的语义地图、物品记忆、区域约束和高层任务指令,使其不只“看见物体”,还能理解物品关系、家庭习惯和执行优先级。
13.3 技术演进
- 扩大多家庭、多户型、多拍摄质量数据集。
- 增强相似物品 ReID 和弱纹理物品识别。
- 加入用户反馈闭环,持续优化澄清问题排序。
- 引入更丰富的空间安全约束。
- 将任务卡扩展为可交互执行清单。
- 将任务卡进一步抽象为机器人可消费的任务协议,例如“把常用水杯放回展示柜上层”“把学习文具归位到书桌右侧抽屉”等带目标区域、约束条件和验收标准的结构化指令。
结语
AI 搬家复原 Agent 的核心创新,不是把一个视觉识别或空间识别的 Demo 包装成搬家场景,而是把“旧家的生活秩序如何迁移到新家”拆成了可计算、可执行、可验收、可回放的多模态 Agent 闭环。
它用 DGX Spark 本地承载隐私敏感的家庭视频和旁白,用多模型协同恢复物品、关系和空间,用四 Agent 契约生成任务卡,用 trace replay 和 SHA-256 证据证明结果可复核;同时,它没有把失败探索写成成果,而是把 StepFun、Nemotron、TensorRT、FP16 和torch.compile各自放在真实位置上。
这就是本项目面向本次比赛的核心判断:它有真实场景、有完整闭环、有平台适配、有技术深度,也有可审计的工程边界。
附录:
14.1 项目说明文档
项目说明文档地址:https://blog.csdn.net/weixin_42963573/article/details/163082319?spm=1011.2415.3001.10575&sharefrom=mp_manage_link
14.2 项目提交材料清单
| 项目材料 | Url地址 | 发布平台 |
|---|---|---|
| 项目 | https://github.com/seandongAne/niantoutongda-dgx-spark | Github |
| 报告书 | https://blog.csdn.net/weixin_42963573/article/details/163086487?spm=1011.2415.3001.10575&sharefrom=mp_manage_link | CSDN |
| Demo演示视频 | https://www.bilibili.com/video/BV1KbKH6sEuP/?vd_source=11420bee6af944cfd208ce18c89a53d7 | bilibili |
| “十日谈”征文 | https://zhuanlan.zhihu.com/p/2062866864926089565 | 知乎 |
| 项目说明文档 | https://blog.csdn.net/weixin_42963573/article/details/163082319?spm=1011.2415.3001.10575&sharefrom=mp_manage_link | CSDN |