单目流式 4D 重建与点追踪:18 天 / 两个月投稿决策与实验方案
研究决策稿 · 2026-09-08
面向:课题组内部选题、分工与实验启动。
已确认条件:单目 RGB,未知相机位姿,动态长视频;1 位主力、2–3 位辅助;8 张 H20D 约 70% 时间可用;部分相关方法环境和数据已准备齐。辅助同学的全职比例、统一评测的完成程度、H20D 实测吞吐尚未确认。
本文延续已有文献综述,重点回答“现在值得押哪条线、怎样证明、何时停止”。文献事实、代码审阅发现与我们提出的研究假说分开表述。所有预期收益阈值均是投入决策标准,不是已有实验结果或录用概率。
1. 我的判断与优先级
18 天:优先验证 A“多时刻运动证据约束的跨窗口身份交接”;若已有稳定优化器且诊断指向几何退化,再考虑 B“小状态可观测性约束 TTO”。两个月:以 C“跨遮挡持续维护身份后验并纠正几何”为主要候选,同时用前两周诊断判断是否改选 B。D“重复预测与新增证据分离”是后端能力较强时的备选。
这些是四个候选,不建议四线同时开发,更不建议拆成四篇论文。A 与 C 很可能是同一研究主线的短、长周期版本。人员增加最适合并行完成评测、强基线和反证实验,主力仍应只负责一个核心方法。
对“可中稿”的负责任判断是:目前可以评价工程可行性和论文潜力,尚不能评价实际录用把握。我们缺的不是更多候选名字,而是一个强基线解释不了、在真实未知相机设定下确实存在的失效机制。18 天新做一篇完整顶会论文属于有条件冲刺;两个月更适合建立完整论证。
| 候选 | 最适合周期 | 核心问题 | 工程判断 | 论文潜力及首要风险 | 我的选择 |
|---|---|---|---|---|---|
| A 多时刻身份交接 | 18 天;可延伸至两个月 | 单点位置接近时,跨窗交接是否换了物质点身份? | 冻结模型,接口和匹配层改动,较可控 | 中等潜力;容易被视为普通 tracklet association / stitching | 18 天先做 72 小时验证 |
| B 可观测方向约束的小状态 TTO | 两个月;18 天需已有优化基础 | 为什么自监督残差下降,世界动态轨迹反而变差? | 输出空间低维优化可做;严谨证据更难 | 若成立较适合 ICLR;可能完全被 robust BA / trust region / SVD 截断解释 | 诊断指向几何退化时选它 |
| C 持续身份后验与重现纠错 | 两个月 | 遮挡期的猜测为何会变成下一窗口的“可靠身份”? | 需要关联、状态维护和局部几何反馈 | 上限较高;Point4D、TAPNext++、Point2Pose 已占据许多直观做法 | 两个月重点候选,必须过两周门槛 |
| D 新观测与重复模型先验分离 | 两个月 | 相同图像反复进入窗口,是否导致过度确信和错误固化? | 需要可靠 fixed-lag 后端和边缘化实现 | 有机制价值;信息重复计算与相关滤波本身不是新问题 | 只有诊断证实时启动 |
不建议作为当前主线:泛 confidence gate、普通滑窗 Sim(3) 拼接、给 Test3R 加动态 loss、只加入 Kalman filter、单独动态 token pruning,以及从头训练新的联合 4D 大模型。下一节解释为什么这些路线的新增空间已经很窄。
如果目标主要是 CVPR,A/C 的视觉问题及长时身份证据较直接;如果目标主要是 ICLR,B/D 更需要把问题上升为可验证的推断/适配机制,并展示跨骨干有效性。这是研究定位判断,不是会议偏好的确定规则。
2. 哪些直观创新已经被占据
| 已有工作与一手证据 | 已经做了什么 | 对我们选题的约束 |
|---|---|---|
| St4RTrack,Feng 等,2025;官方实现 | 联合重建/追踪与 per-video TTA;官方后来修正动态像素 confidence 塌缩并给出 reweight 版本 | 联合任务、动态加权和几何一致性 TTA 不能独立算贡献;正式比较应使用当前修正版 |
| C4D,Wang 等,ICCV 2025,§3.3 | 冻结点图模型,结合短期光流、长期点轨迹优化深度与相机;另有轨迹平滑 | “冻结前端 + tracking 帮助 4D 优化”已有直接先例 |
| LoRA3D,Lu 等,2024/ICLR 2025、Test3R,Yuan 等,2025、Online3R,Zhou 等,2026 | 分别覆盖 confidence 重校准与 LoRA、共享参考图一致性 prompt 优化、在线 prompt 与局部/关键帧监督 | 更换 adapter、增加一致性项或改成滑窗,不能替代新的失效解释 |
| V-DPM,Sucar 等,2026、TAPVid-MV,Koppula 等,2026-09,附录 C | 长视频窗口处理、几何对齐与轨迹交接已有具体实现/评测做法 | streaming 不能只等于套 sliding window;单目实验不能使用该多视角基准的额外输入 |
| Point4D,公开原稿,§3.3 / 附录 C | 已有 3D endpoint 递推、固定初见外观描述子;Selection chaining 按投影深度一致性选择交接帧 | “3D query + 固定身份记忆 + 挑可靠 anchor”重合很高 |
| TAPNext++,2026-04 | 长序列训练与重新检测评价已有明确设计 | 不能把长遮挡、redetection 或长序列 finetune 本身作为新问题 |
| Point2Pose,2026-04,§3.3–3.4 | RGB-D 刚体跟踪中已有多 pose 假设、几何评分选择、图优化与遮挡后恢复 | “多假设 + 几何选择 + 联合优化”这个组合也不是空白 |
| D4RT,2025/2026,§2.3、OmniX,2026-07、DELTAv2,2025 | 分别已有时空冗余查询削减、动态稀疏轨迹解码、时间降采样/插值相关实验 | 稀疏解码路线必须赢过简单时间采样和现有专门方法 |
| DynOSAM 官方项目、DM-VIO 官方项目 | 动态对象增量估计、延迟边缘化等已有成熟先例 | fixed memory、Schur complement、保留旧信息不应单独包装创新 |
Point4D 的直接全文抓取受限,本次使用原 PDF 的可检索正文/附录片段;其作者、确切发布日、代码及录用状态未确认。上述机制重合足以要求加入强基线,但不能据此作“它没有某能力”的断言。其他条目以论文或作者仓库为依据,读取日期均为 2026-09-08。
3. A:多时刻运动证据约束的身份交接——18 天首选试验
3.1 论文问题应该怎样说
研究假说:窗口边界会把几何上接近、物质身份不同的点混在一起;一个短重叠区间里的运动证据,比单个端点或单帧深度一致性更能区分这些点。
例子是双手接触、两条腿交叉、物体从相近深度经过。一次投影位置可能正确,交接后的轨迹却跟到了另一块表面。长视频里少数此类错误可能造成不可恢复的身份漂移。我们必须先测出这个现象,再决定是否值得写论文。
已有 Point4D 和 TAPVid-MV 的交接机制是本方案直接前提;多时刻匹配本身也属于经典思路。拟投稿贡献必须落在:揭示 DPM 跨窗身份失效、给出针对该失效的交接准则,以及证明它解决了普通重叠平均不能解决的错误。Point4D 原稿、TAPVid-MV 附录 C
3.2 最小实现
冻结 V-DPM。18 天默认先做固定延迟分块版:W=24、O=16、stride=8,每到8个新帧发布这一块的结果;稳态采集等待最多7帧,另加计算时间,首个24帧窗口的初始化等待单列。D1 若 profile 要求缩小配置,先改完并锁定全部对照。维护 Q=512/1024 个固定物质点身份及其源像素。这些是原型配置,不是已验证最优值;该主表不能标成零延迟严格因果。
- 新旧窗口在相同物理时刻对齐。优先使用可靠背景/共同可见几何估计 robust Sim(3),避免把两个不同时刻的动态点硬对齐。
- 在共同坐标系中,为旧身份及新窗口候选源像素提取 m=3–5 个共同有效时刻的 3D 轨迹片段。有效性仅由预测相机、图像范围、预测深度一致性或经核验的可见性头判断,不能直接把 V-DPM confidence 当 visibility;GT visibility 只作诊断。有效时刻不足时拒绝匹配。
- 先做局部稀疏候选搜索,再计算多时刻位置、运动增量及邻域关系的一致性;按最优候选与次优候选之间的差距判断歧义。
- 证据不足则保留“暂失”状态,不把投影到图像边缘或遮挡表面的点当作成功交接。首版暂失时输出最后可靠世界坐标或固定速度外推,并标记不可见;下一窗口用保留描述子与扩大搜索区域重新生成候选。所有方法采用同一暂失回退策略,点仍留在完整评价集合。若保留旧源图再次推理,必须把它计入输入、状态内存和计算。
- 首版只改变关联;不要同时添加复杂 TTA、可学习 memory 和全局 BA。
一个可实现的匹配代价是:
这里 A 是两窗口间对齐变换,\(\mathcal O_{ij}\) 仅包括共同有效观测;\(\Sigma\) 是经验证的归一化尺度或噪声模型,不能默认网络 confidence 就是协方差。位置项、增量项、邻域项须逐项消融。
真实代码边界:V-DPM 提供源图像像素到目标时刻的 DPM,不是任意世界 3D query 接口。需要在新源帧投影并采样其轨迹场。为了取得重叠时刻签名而增加的解码也要计入计算,不能视为免费。V-DPM model.py、decoder.py
3.3 决定是否能投的实验
| 实验 | 要排除的解释 |
|---|---|
| endpoint、Point4D Selection、普通 overlap trajectory average、多时刻代价,保持同一前端与窗口 | 是否只是更好选帧或轨迹平滑 |
| 相同预算的 2D forward–backward、多时刻 2D 匹配、3D 匹配 | 3D 运动证据是否必要;不是多算几帧就涨点 |
| 随机平移窗口边界;统计交接后 16/32 帧误差跳变 | 收益是否来自挑选有利边界 |
| 跨 1/2/4/8 次交接及 256/512/1024/全长前缀 | 是否实际减少累计身份漂移 |
| GT camera / GT depth 逐项替换,仅作诊断 | 分清几何误差、身份交接误差、源模型本身失败 |
| 完整 query 集的官方分数 + 暂失比例 + risk–coverage | 是否靠拒绝困难点制造涨分 |
72 小时门槛:预先固定 6–10 个验证长片,先实现 Selection/overlap average。若多时刻签名不能在多个序列稳定胜过二者,或根本找不到交接诱发的身份错误,停止。可把“动态后段误差约下降 10%、误交接率约下降 20%”设为内部继续线;不将其写成预期结果。
身份错误须操作化定义:有物质点 ID 时直接核查;只有稀疏 GT tracks 时,只在候选 GT 点充分分离的事件上统计误关联,其余称为跟踪误差,不能仅凭 EPE 大就断言 identity switch。
3.4 论文边界与可能的审稿意见
最危险的意见是“这只是 trajectory stitching”。回应需要一张交接机制图、一个可重复干预实验和跨骨干结果,单纯平均指标涨几个点不足。
A 第一版主要改 tracking,未必改重建。 若深度/相机都不变,应准确定位为“重建模型支持的长时 3D tracking”。若要声称重建与 tracking 互益,可在已有轻量几何优化器里只替换接受的轨迹约束,证明相同预算下几何也改善;18 天内没有此证据就收窄题目,不能把冻结几何的输出冒充新重建成果。
4. B:可观测方向约束的小状态 TTO——有优化基础才适合 18 天
4.1 比“加 confidence”更具体的问题
研究假说:单目动态场景里,相机、深度和物体运动可以相互补偿。优化器沿缺少观测支持的方向更新时,自监督损失会下降,但真实世界轨迹更差。
必须区分两件事:物理状态在当前观测下是否可辨识,以及网络参数的梯度是否小。它们不是同一个问题。上一轮综述中“可观测性 TTA”具有研究价值,但作为 18 天首选过于宽泛;这次将其收窄为输出状态上的小变量优化。
C4D 已做 tracking/flow 引导的几何优化;LoRA3D 已有 confidence 校准;LEAP-VO 已用长期点轨迹、动态/不确定性过滤辅助位姿。因此“鲁棒 residual + 小步更新”应作为强 baseline。C4D §3.3、LoRA3D、LEAP-VO,CVPR 2024
4.2 第一版怎样做
冻结骨干、固定预测内参。活动窗口 W=8/16,约 512 条轨迹;只优化相机 SE(3) 小增量、每帧相对 log-depth scale,以及必要时 8/16 个局部运动组的低维残差。在全局初始化时固定世界 pose 和一个尺度规范;初始化帧移出后,通过已发布世界锚点或边界先验传递规范,不能每窗把首帧重置为单位 pose 和新尺度。先不反传到网络,不引入 LoRA/prompt。
图像对应构成数据约束;预测深度、点图、运动构成神经先验,或明确标记为相关伪测量。对应关系本身也由模型估计,需要稳健处理。不能把同源预测深度当成独立真实观测,从而人为增加“可观测方向”。分别消融仅图像对应、加入几何伪测量的版本,明确区分数据项与先验项:
在去掉 gauge、按噪声与变量尺度白化后,检查相对先验的信息方向;这里 H_obs 只表达所选数据约束在局部线性化下的支持:
可在弱方向保留先验/限幅,只在足够支持的方向接受更新。这里要求先验矩阵在选定状态空间内可逆或明确正则化。这只是可运行起点;广义特征分解、截断 SVD 或阻尼本身不构成创新,也不是完整非线性可观测性证明。
若走两个月版本,进一步把更新拆成相机、尺度、局部运动的物理子空间,并用未参与拟合的当前/过去观测检查候选更新是否成立。不同点/时间的留出观测减少过拟合,但仍共享图像和前端,不能称为统计独立真值。
代码可实现性:V-DPM 的 camera head 从 aggregator 取特征,动态 point head 从 decoder 取特征;仅修改 decoder prompt 不会更新 camera。首版显式相机变量更直接。St4RTrack 的公开 TTA 脚本是窗口采样训练流程,loss 中使用 offline CoTracker,必须改为仅访问已到达帧,才能比较在线版本。V-DPM model.py、St4RTrack train_tta.sh、losses.py
4.3 必不可少的基线与反证
| 对照 | 必须保持相同 | 作用 |
|---|---|---|
| 无优化 | 前端、输入、窗口、查询 | 确認 TTO 总收益 |
| 普通小状态优化 | 变量、残差、迭代步数 | 分离“优化了”与“怎样优化” |
| Huber + visibility + confidence + trust region | 同一变量与计算量 | 排除常规稳健化即可解释 |
| 截断 SVD / 对角阻尼 / 按参数组冻结 | 同样的局部信息矩阵 | 排除普通数值稳定化解释 |
| 本方法去掉观测/先验分离,或去掉留出检验 | 其余实现一致 | 证明主机制 |
| 更大窗口 / 更多普通优化步骤 | 端到端总 GPU 时间近似相同 | 排除增加预算解释 |
先在已有验证数据上做低视差、纯旋转附近、物体与相机同向运动、较多动态前景、遮挡后的错误反馈分层。自然序列为主,可控扰动仅作机制诊断;不能让算法读取 GT 分层标签。
早期决定:D3–5 若没有稳定出现“loss 下降而 world error 上升”,不要硬写可观测性故事。D8 若仍无法超过强稳健 baseline,就取消18天该方向。若要继续两个月,W3 前必须显示方向选择确实对应物理退化,而且收益超过简单组冻结/阻尼。
支持联合 4D 的必要证据是 2×2 消融:geometry update 开/关 × track feedback 开/关。若所有 tracking 收益在 GT camera 下消失,可以成为相机校正工作,但不要声称解决物质点身份。
5. C:跨遮挡持续维护身份后验,并在重现时纠正几何——两个月重点候选
5.1 精确新增空间
研究假说:确定性轨迹在遮挡期的猜测,被跨窗口递推反复当成可靠查询;重现时错误关联与几何漂移互相解释,导致错误身份无法恢复。应持续保留多个可能身份/位置,直到新的可见证据到来。
Point4D 已保留固定初见描述子并使用 3D query 递推;TAPNext++ 已关注长期重检测;Point2Pose 已在重现当帧构造多个刚体 pose 并作几何选择。因此,候选新增点只能是:跨时间持续维护非刚性物质点的关联分布,区分预测和新观测,并处理预测相机/深度与身份关联之间的耦合错误。 单纯 RGB 替换 RGB-D、刚体改局部刚体都不够。Point4D、TAPNext++、Point2Pose §3.3–3.4
5.2 表示、更新及训练边界
每个身份保留初始可靠外观、局部邻域、最近可靠可见时刻,以及最多 H=3/4 个位置/速度/不确定性/关联权重假设。限制活动点数、休眠身份数和活动帧数;全部查询历史不是无限留在 GPU/CPU 里。
- 可见时:由当前匹配、邻域关系、深度及相机一致性更新状态;只有关联通过验证才更新可靠外观。
- 遮挡时:传播先验及不确定性,不把预测位置当成新的坐标测量,不连续“自我确认”。完全不可观测时不承诺准确恢复任意运动。
- 遮挡与出视野分开:有可信深度及遮挡解释时,可施加点在前方遮挡面之后的单侧深度约束;出视野时不能套用该约束。预测深度不可靠时削弱或关闭此项。
- 重现时:外观搜索给出多个候选;几何和局部物质点邻域联合验证“原身份 + 几何漂移”或“新错误表面 + 几何可靠”等解释,避免一个错点拖动相机。
- 几何反馈:接受的关联只更新当前活动状态;若重写过去 L 帧结果,明确报告固定延迟版本,不能与严格因果结果混表。
可用 mixture likelihood,而不是先平均几条可能轨迹:
再加可信遮挡约束、邻域项和过程先验。这个表达式是方法原型,MHT/mixture 模型本身并非新发明。
首版完全冻结前端。若候选评分确实需要学习,只训练小 association / uncertainty head;训练输入来自冻结前端的真实预测及扰动,监督使用 PointOdyssey train 等已有标注。不能只用 GT depth/pose 训练再期望测试适应预测几何。未经实测不承诺参数量、训练时长或收敛。
5.3 必须打败谁
- 相同前端的 endpoint / Selection chaining。
- 固定初见描述子 + 单高斯状态 + confidence gate。
- 仅在重现当帧产生多假设并选一个,与持续维护后验比较。
- Point2Pose 式 sequential RANSAC + 同源预测深度几何评分 + 局部图优化;在非刚性场景加局部刚体分组版本。这是机制对照,独立实现要如实标注。
- 多假设但把每次模型预测都当新测量;检验“预测/观测分离”是否必要。
- 完整方案去掉几何反馈,检验是否真正重建与追踪互益。
- 长期 2D tracker + 相同几何 lifting,以及一个有公共实现的 3D tracker。输入和训练数据条件另列,不强行伪装同骨干。
对照中的预测深度必须来自相同可用 RGB 前端;GT depth 只作诊断。Point2Pose 的 RGB-D 原版数值不能当成同输入主表胜负。
5.4 两周门槛与论文证据
W1 先测候选集的 oracle recall:若正确重现点根本不在候选集中,应改候选生成,而不是继续堆复杂后验更新。W2 必须证明“持续保留分布”优于“重现当帧生成并选择假设”。否则该方向的新颖性和必要性都不足。
完整证据包括重现分桶 1–16、17–64、65–128、>128 帧;重现后的正确恢复、误捕获及恢复延迟;动态世界轨迹、深度和相机指标;固定 Q/B/H 的内存和尾部延迟。不同数据集事件少的桶明确给样本量,不将不稳定的小桶均值作为主结论。
继续投入可要求:两个数据源的长遮挡恢复稳定改善,误捕获率不上升,动态 world-track 尾部误差约下降 10% 以上。这是内部阈值;最终若只有 2D redetection 提升,应收窄为 tracking,不能包装成完整 4D 突破。
6. D:把新增观测与重复模型先验分开——两个月后端备选
6.1 先证明一个具体问题
研究假说:重叠窗口共享大量图像,多次模型预测相关;后端却可能把它们当成独立测量不断累积,出现残差更小、置信更高、世界轨迹反而更差。
这个现象尚未在我们的模型上实测。普通滤波、SLAM 已长期处理信息重复计算;动态因子图也并非新概念。新论文必须锁定“基础模型随上下文刷新、输出相关先验”的具体来源,并超过普通 fixed-lag BA。DynOSAM、DM-VIO
6.2 最小原型
将因子分成:
- 唯一观测约束:带源图像、时间、像素/物质身份的可见观测。每条物理观测不重复提交。
- 当前模型先验:当前窗口对深度、点图、运动的预测;上下文更新时替换旧先验,不默认作为独立新证据叠加。
- 历史摘要:仅在观测离开活动窗口时边缘化一次;保存固定预算摘要。
“来自同图像”不意味着两次预测完全无新增信息:更长上下文可能新增有效证据。算法不能简单删除所有重叠预测,必须区分重复来源与新增上下文。去重只是起点。
先在小状态规模做精确 Schur 版本,再比较固定秩摘要。若进一步保留 camera–motion 交叉信息,必须说明取舍依据,并比较对角摘要、普通 top-eigenvalue、均匀关键帧和 reservoir。不能只因用了 Schur 就声称创新。固定 Q/B/摘要秩下才谈工作内存有界;永久存储所有历史输出的磁盘开销另算。
6.3 决胜实验与停止条件
在同一序列上改变 overlap、同一证据的重复更新次数、历史重放次数,保持新输入和查询集合一致。观察误差、校准、内存随长度的变化。模型 confidence 若未经校准,先称 confidence 分数,不将其直接解释为概率。
必须比较普通 fixed-lag BA、按重复次数归一化权重、只保留最近预测、常规保守相关融合、完整历史优化上界。如果权重除以重复次数就获得同样收益,或规范 BA 本来没有此问题,应停止该方向。
W2 必须有可重复的来源相关性干预结果;W4 必须超过普通 BA/简单去重,并在第二骨干复现。该方向对实验设计和后端正确性要求最高,不建议作为18天临时转向。
7. 所有方向共用的评测合同
7.1 输入、因果性与输出
主设定使用单路 RGB,pose 全部预测;相机内参是否已知单列,默认主系统采用预测或初始化估计的 K,不隐含使用 GT K。若数据协议提供 K,可另设“已知内参、未知外参”表格。
在时刻 t 只允许看到 \(I_{\le t}\)。已有双向短窗网络可以对“截止当前的过去窗口”运行;不能把一整块未来帧送入网络,却把块内早期结果计为零延迟。若按 chunk 等待后统一发布,报告实际最大等待帧数。反复前缀推理是因果的,但未必高效。
严格因果表输出当前 pose、当前规定分辨率点图、固定 query 集在当前时刻的位置与可见性;A 的18天默认分块版另列固定延迟表。定义新 query 到达规则,另列全程老 query 与新生 query 结果。追加未来帧后已发布结果不变,是可以直接做的因果检查。
因果表只评分 t≥t_query。若官方协议包含查询前的历史轨迹,另报完整标准协议并标明需要回溯/离线;修改评分掩码后的结果称“派生因果协议”,不冒称原版官方分数。固定延迟版同时报告帧的拍摄、可用与发布时刻,不能只标算法内部窗口长度。
TTA teacher、动态 mask、深度模型、模型特征缓存都遵守同样时间边界。每个测试视频重置适配状态;不从测试集学跨视频参数。
7.2 数据与用途
| 数据 | 本项目用途 | 使用边界 |
|---|---|---|
| PointOdyssey 官方发布 | 开发失效机制;完整长序列 tracking / world drift;小头训练用 train split | v1.2 公布 13 条 test;先固定 val 开发,不从 test 挑有利长片 |
| Dynamic Replica 官方项目 | 第二个动态长序列数据源;完整 900 帧 test 视频 | 主输入仅用一侧 RGB;另一视角/GT depth/pose 只用于官方评价或诊断 |
| TAPVid-3D 官方数据和评测 | 真实域官方 3D tracking,防止只在合成数据成立 | minival 适合调试,不能充当完整最终成绩;至少预先指定一个完整来源协议并公开范围 |
| TAPVid-MV | 学习公平拼接/几何对照及附加评测设计 | 主任务多视角,不把多视角信息带入单目主结果 |
| TAPNext++ 的重检测定义 | 参考重现评价方式 | 在 PO/DR 上移植属于派生协议,要公开事件构建、阈值和计分代码 |
18 天的最低完整证据建议是两类合成长序列 + 一个完整真实来源协议;达不到时如实缩小结论,不把零散 demo 当真实域泛化。短序列标准评测仍保留,用于说明方法不是牺牲正常场景换长序列分数。
7.3 指标、归一化与公平性
- 标准协议与因果表:标准协议使用原 evaluator、评分范围与官方尺度处理;严格因果/固定延迟的派生表明确任何 query 评分掩码改动,沿用 AJ/APD 等指标定义但不与原版分数直接混排。不同数据集指标不能直接混成一个平均分。
- 长程诊断:在单一统一世界 gauge 下报告动态/静态 world error、P50/P95、末段误差、长度曲线;有可用 GT 才给对应指标。
- 尺度:保留官方对齐主表;另做初始化前缀定尺度后冻结的漂移诊断。GT 仅供评分端求规范,不进入算法。禁止每窗口对 GT 重新 Sim(3) 对齐后宣称没有漂移。
- 几何:有标注的数据上报告动态/静态 depth error、相机 ATE/RPE;点云误差与轨迹物质身份误差分开。
- 遮挡:评价重新可见后的恢复和错关联;遮挡中不可辨识的任意运动不作为方法保证。
- 计算:分辨率、query 数、输出时刻、延迟、输入帧数一致;报告含前端、teacher、TTO、交接和导出的端到端时间,以及 GPU/CPU 工作内存。
- 统计:以视频/序列为重采样单位给配对置信区间,避免把高度相关的像素当独立样本。小头训练用至少 3 个种子;确定性 training-free 方法不必无意义重跑随机种子。
- 调参:阈值和停止规则只在 val 固定;测试集只用于冻结配置后的报告。记录前端训练数据,不能把预训练已见过某来源宣传为完全未见域。
两个月论文建议有五组主证据:标准准确率、完整长序列、真实域、遮挡/退化分层、质量—计算—内存曲线。每一组都围绕一个机制,不需要堆十几个来源不明的 leaderboard。
8. 18 天排期:9 月 8 日至 9 月 25 日内部完稿
| 时间 | 主力 | 辅助并行工作 | 明确交付与决策 |
|---|---|---|---|
| D1–2,9/8–9/9 | 锁定坐标/查询合同、stride、最大等待与发布规则;A 原型,或已有优化器上的 B 诊断 | 辅助 1 核 evaluator/数据;辅助 2 跑强基线和 H20D profile;第 3 人可整理相关工作和可视化 | 一个可端到端复现的 baseline;固定验证长片;含初始化/交接解码的实测预算 |
| D3,9/10 | 判断核心假说是否存在 | 独立核查失败例,排除坐标/尺度 bug | A 的 72 小时 go/no-go;最多保留一个主方向 |
| D4–6,9/11–9/13 | 完成唯一核心模块 | Selection/普通稳健优化等关键对照,真实域预跑 | 至少一张机制图和一张强基线对照表 |
| D7–8,9/14–9/15 | 复核效应是否被简单方法解释 | 第二数据源、等预算、query coverage 检查 | D8 决定是否继续18天投稿;不合格转两个月 |
| D9–12,9/16–9/19 | 冻结超参与方法,写主文 | 跑完整测试;另一骨干最小移植;摘要与账户材料 | 官方摘要截止前完成注册;主结果表成形 |
| D13–15,9/20–9/22 | 机制消融与失败分析 | 配对统计、速度/内存、图表和代码核查 | 完整初稿;只补影响结论的实验 |
| D16–18,9/23–9/25 | 通篇审稿与论点收缩 | 复现关键配置、核引用/匿名化/补充材料 | 9/25 内部定稿,保留正式截止前缓冲 |
D8 继续投稿的建议标准:至少两个独立数据源支持核心机制;最关键强 baseline 跑通;预计能完成真实协议;不是只在挑选例子上有效;论文可以用一句话说明“什么新证据/机制改变了什么行为”。达不到就转两个月,不在最后十天不断换模块。
若选择 B,D3 可以只判断“loss 与真实误差背离”是否存在,但 D5 前必须有普通优化与稳健 baseline。若连基础优化器都需从头接,不以18天为合理承诺。
9. 两个月排期与人员安排
以 9/8 启动、11 月上旬完成主体为目标;把 CVPR 截止前最后一周多留给复核,不继续发明新模块。
| 周期 | 共同任务 | 选择 C 时 | 选择 B / D 时 |
|---|---|---|---|
| W1,9/8–9/14 | 统一 baseline、H20D profile、数据协议与 oracle 诊断 | 候选召回、遮挡事件、固定描述子基线 | B:误差背离;D:重复证据干预 |
| W2,9/15–9/21 | 冻结主假说,停止次要路线 | 持续后验 vs 当帧多假设选择 | B:robust/truncated-SVD 对照;D:规范 fixed-lag BA |
| W3–4,9/22–10/5 | 完成一个主要算法,不重训大骨干 | 遮挡更新/重现关联,必要时小头训练 | B:物理子空间与检验;D:唯一提交与摘要 |
| W5,10/6–10/12 | 联合任务的互益证据,第二骨干 | 关联反馈几何 | 验证不是只改善静态 pose |
| W6,10/13–10/19 | 冻结超参,完整长片与真实域 | 全长遮挡恢复及错误捕获 | 退化/重叠密度及等预算 |
| W7,10/20–10/26 | 主文、消融、失败分析 | 把非刚性与刚体子集分开 | 与经典优化解释逐项对比 |
| W8,10/27–11/2 | 复现关键表、统计、补充与代码整理 | 同左 | 同左 |
| 11/3–11/8 | 内部审稿、锁定所有主结论 | 不新增模块 | 不新增模块 |
| 11/9 至正式截止 | 注册、独立复核、修订和投稿 | 仅补必要证据 | 仅补必要证据 |
建议主力始终负责算法与论证;辅助 1 负责 evaluator/数据,辅助 2 负责基线/计算统计,第 3 人如可用则负责独立复现、文献与图表。没有假定辅助同学都全职;资源不齐时先削减第二骨干的扩展实验,不削减关键反证基线。
A 若在18天内未达投稿强度,但确认交接身份问题存在,可自然转入 C 的长期身份后验;若主要误差来自相机/尺度退化,则转 B。不要在同一稿里同时硬塞 A+B+C+D。
10. 8 张 H20D 的预算:容量够不够取决于评测成本
由用户给出的可用比例计算,18 天容量上界为:
60 天为 8064 GPUh。两个月排期实际按日历略有差异,这里统一用60天作预算基数。它们不是实测吞吐,更不等于 A100/H100 的 GPUh,也不意味着随时有连续8卡。
| 用途 | 18 天建议承诺量 / GPUh | 两个月建议承诺量 / GPUh |
|---|---|---|
| 基线、坐标与数据验证 | 200 | 500 |
| 核心失效诊断及 pilot | 250 | 600 |
| 可选小头训练 | 0 | 800 |
| 冻结配置后主评测 | 600 | 1600 |
| 机制消融与等预算对照 | 350 | 1300 |
| 第二骨干、真实域与稳健性 | 250 | 900 |
| 关键复核 | 150 | 300 |
| 合计 | 1800 | 6000 |
| 容量余量 | 619.2 | 2064 |
表中是任务上限分配,不是从硬件基准推得的时长预测。主要用独立单卡视频作业,保留 checkpoint;只有微调阶段安排连续多卡。若8卡70%不可用时间已包含排队,不要在利用率估算中重复扣减;余量用于故障、试错和未预计实验。
每类实验按实际端到端测量重算:
例如,若所有测试共 80,000 帧、8 个配置、每配置平均10秒/帧且每作业1卡,仅这组实验就需约1778 GPUh;这是假设算例,说明 TTO 大消融会快速吃完18天预算。不能用“参数少”推断“评测便宜”。
已有研究日志中的32帧 StreamDPM profile 记录 decoder 21.49秒、wall 26.84秒、allocated约27.52GiB,但设备只标为某实验室 GPU0;不能把它当 H20D 测量。日志也不能证明当前 unified evaluator 全部正确。这些资产支持优先复用现有路径,而不是重新搭整个系统。
D1 必测 W=8/16/24、固定 query/分辨率、TTO 0/1/3/5步的端到端成本。缓存同一因果前端预测可减少开发消融成本;论文部署计时仍加回前端和 teacher。
11. 为什么不把解码加速列为主要投稿方向
它适合两天验证的工程备选,但新颖性风险比 A/B 高。D4RT 已削减时空重复查询;OmniX 已稀疏轨迹解码;DELTAv2 已研究时间采样/插值;TraceAnything 用连续轨迹场表示视频。D4RT、OmniX、DELTAv2、TraceAnything 官方实现
若做,严格限定为冻结现有 DPM,保持所有输入帧、源 query 和最终输出时刻一致,减少目标时间 decoder 执行次数。必须胜过均匀取样 + nearest/linear/cubic、固定运动阈值采样、低分辨率和完整 decoder。
V-DPM 官方 inference 循环各目标时刻。仅改成“只输出当前时刻”是不同输出合同,公平 streaming baseline 也应只 decode 当前时刻。时间条件进入每层 attention,不能默认存在精确跨时间 KV cache;DPT 先密集解码再采样不会省掉主要稠密运算。model.py、decoder.py
用未来端点插值只能称固定延迟/离线;严格因果需要外推或当前帧触发纠正。可把同精度端到端约2倍提速、且显著优于均匀插值设为独立论文继续线,但这是目标,不是已有结果。若只能获得小幅改进,作为主论文的工程模块或开源工具更合适。
12. 实际截稿与投稿策略
截至2026-09-08,官方日期如下。AoE 为 UTC−12,北京时间为 UTC+8,换算相差20小时;应以官方系统最终显示为准。
| 会议 / 事项 | 官方 AoE 日期 | 北京时间 |
|---|---|---|
| ICLR 2027 摘要 | 2026-09-18 23:59 | 2026-09-19 19:59 |
| ICLR 2027 正文 | 2026-09-25 23:59 | 2026-09-26 19:59 |
| CVPR 2027 注册 | 2026-11-10 日终 | 2026-11-11 19:59 |
| CVPR 2027 正文 | 2026-11-16 日终 | 2026-11-17 19:59 |
| CVPR 2027 补充材料 | 2026-11-23 日终 | 2026-11-24 19:59 |
来源:ICLR 2027 官方 CFP、CVPR 2027 官方 CFP。第三方预测截稿不用于此排期。
ICLR 的最终决定为12月16日,晚于 CVPR 投稿截止;两个会议均限制实质相同工作同时在投。因此这两段周期是择一/转轨计划:18天达标则考虑 ICLR;未提交或按适用规则完成撤稿后可考虑 CVPR,不能把“先投 ICLR 再等拒稿投本届 CVPR”当成自然时间顺序。A 与 C 若是同一工作的阶段扩展,也不能默认作为两篇同期独立投稿。ICLR CFP、ICLR 作者指南、CVPR CFP
日志显示团队另有较成熟的全景 4D 数据/稿件积累。若那项工作仍未发表、已有足够主结果且与当前计划相关,18天用于补齐它的长时 tracking 证据可能比新开论文更现实。但其投稿状态与实际完成度未核实,本文不据此改变已经确认的单目 RGB 主设定,也不把现有稿件资产当作新方案已有结果。
13. 接下来 72 小时具体交付
- 第1天:一个可信 baseline 包。 锁定前端 checkpoint/commit、单目输入、K/pose来源、坐标转换、因果窗口和 query 合同;跑通两条完整长片;完成 H20D profile。
- 第2天:一张失效来源表。 对固定验证集区分源 tracker 失败、跨窗身份错误、几何/尺度漂移、遮挡后错误固化;完成 Selection 和普通稳健方法的关键对照。
- 第3天:只选一条主线。 交接错误明确且 A 超过简单对照,冲18天 A;几何退化主导且已有优化基础,选 B;长遮挡状态固化最明显,直接按两个月 C;只有出现重复证据干预效应才选 D。
我的最终取舍:18天优先 A 的窄问题;两个月优先验证 C 与 B 的机制,再择一。 若目的是更有说服力的完整“4D 重建 + tracking”论文,两个月更符合当前证据和团队条件。不要为了赶18天,把一个尚未打败强拼接/稳健优化的模块硬包装成世界模型。
本次已完成定向文献、近邻反证和官方代码路径审阅;未实际运行模型、训练或测量 H20D。方向的新颖性判断仍有边界,特别是 Point4D 全文访问受限,以及各机制的真实效应尚待实验。Markdown 已作结构、链接清单和数值核查,不宣称完成 PDF/排版渲染验收。