Skip to content

单目流式 4D 重建与点追踪:18 天 / 两个月投稿决策与实验方案

研究决策稿 · 2026-09-08
面向:课题组内部选题、分工与实验启动。
已确认条件:单目 RGB,未知相机位姿,动态长视频;1 位主力、2–3 位辅助;8 张 H20D 约 70% 时间可用;部分相关方法环境和数据已准备齐。辅助同学的全职比例、统一评测的完成程度、H20D 实测吞吐尚未确认。
本文延续已有文献综述,重点回答“现在值得押哪条线、怎样证明、何时停止”。文献事实、代码审阅发现与我们提出的研究假说分开表述。所有预期收益阈值均是投入决策标准,不是已有实验结果或录用概率。

1. 我的判断与优先级

18 天:优先验证 A“多时刻运动证据约束的跨窗口身份交接”;若已有稳定优化器且诊断指向几何退化,再考虑 B“小状态可观测性约束 TTO”。两个月:以 C“跨遮挡持续维护身份后验并纠正几何”为主要候选,同时用前两周诊断判断是否改选 B。D“重复预测与新增证据分离”是后端能力较强时的备选。

这些是四个候选,不建议四线同时开发,更不建议拆成四篇论文。A 与 C 很可能是同一研究主线的短、长周期版本。人员增加最适合并行完成评测、强基线和反证实验,主力仍应只负责一个核心方法。

对“可中稿”的负责任判断是:目前可以评价工程可行性和论文潜力,尚不能评价实际录用把握。我们缺的不是更多候选名字,而是一个强基线解释不了、在真实未知相机设定下确实存在的失效机制。18 天新做一篇完整顶会论文属于有条件冲刺;两个月更适合建立完整论证。

候选 最适合周期 核心问题 工程判断 论文潜力及首要风险 我的选择
A 多时刻身份交接 18 天;可延伸至两个月 单点位置接近时,跨窗交接是否换了物质点身份? 冻结模型,接口和匹配层改动,较可控 中等潜力;容易被视为普通 tracklet association / stitching 18 天先做 72 小时验证
B 可观测方向约束的小状态 TTO 两个月;18 天需已有优化基础 为什么自监督残差下降,世界动态轨迹反而变差? 输出空间低维优化可做;严谨证据更难 若成立较适合 ICLR;可能完全被 robust BA / trust region / SVD 截断解释 诊断指向几何退化时选它
C 持续身份后验与重现纠错 两个月 遮挡期的猜测为何会变成下一窗口的“可靠身份”? 需要关联、状态维护和局部几何反馈 上限较高;Point4D、TAPNext++、Point2Pose 已占据许多直观做法 两个月重点候选,必须过两周门槛
D 新观测与重复模型先验分离 两个月 相同图像反复进入窗口,是否导致过度确信和错误固化? 需要可靠 fixed-lag 后端和边缘化实现 有机制价值;信息重复计算与相关滤波本身不是新问题 只有诊断证实时启动

不建议作为当前主线:泛 confidence gate、普通滑窗 Sim(3) 拼接、给 Test3R 加动态 loss、只加入 Kalman filter、单独动态 token pruning,以及从头训练新的联合 4D 大模型。下一节解释为什么这些路线的新增空间已经很窄。

如果目标主要是 CVPR,A/C 的视觉问题及长时身份证据较直接;如果目标主要是 ICLR,B/D 更需要把问题上升为可验证的推断/适配机制,并展示跨骨干有效性。这是研究定位判断,不是会议偏好的确定规则。

2. 哪些直观创新已经被占据

已有工作与一手证据 已经做了什么 对我们选题的约束
St4RTrack,Feng 等,2025;官方实现 联合重建/追踪与 per-video TTA;官方后来修正动态像素 confidence 塌缩并给出 reweight 版本 联合任务、动态加权和几何一致性 TTA 不能独立算贡献;正式比较应使用当前修正版
C4D,Wang 等,ICCV 2025,§3.3 冻结点图模型,结合短期光流、长期点轨迹优化深度与相机;另有轨迹平滑 “冻结前端 + tracking 帮助 4D 优化”已有直接先例
LoRA3D,Lu 等,2024/ICLR 2025Test3R,Yuan 等,2025Online3R,Zhou 等,2026 分别覆盖 confidence 重校准与 LoRA、共享参考图一致性 prompt 优化、在线 prompt 与局部/关键帧监督 更换 adapter、增加一致性项或改成滑窗,不能替代新的失效解释
V-DPM,Sucar 等,2026TAPVid-MV,Koppula 等,2026-09,附录 C 长视频窗口处理、几何对齐与轨迹交接已有具体实现/评测做法 streaming 不能只等于套 sliding window;单目实验不能使用该多视角基准的额外输入
Point4D,公开原稿,§3.3 / 附录 C 已有 3D endpoint 递推、固定初见外观描述子;Selection chaining 按投影深度一致性选择交接帧 “3D query + 固定身份记忆 + 挑可靠 anchor”重合很高
TAPNext++,2026-04 长序列训练与重新检测评价已有明确设计 不能把长遮挡、redetection 或长序列 finetune 本身作为新问题
Point2Pose,2026-04,§3.3–3.4 RGB-D 刚体跟踪中已有多 pose 假设、几何评分选择、图优化与遮挡后恢复 “多假设 + 几何选择 + 联合优化”这个组合也不是空白
D4RT,2025/2026,§2.3OmniX,2026-07DELTAv2,2025 分别已有时空冗余查询削减、动态稀疏轨迹解码、时间降采样/插值相关实验 稀疏解码路线必须赢过简单时间采样和现有专门方法
DynOSAM 官方项目DM-VIO 官方项目 动态对象增量估计、延迟边缘化等已有成熟先例 fixed memory、Schur complement、保留旧信息不应单独包装创新

Point4D 的直接全文抓取受限,本次使用原 PDF 的可检索正文/附录片段;其作者、确切发布日、代码及录用状态未确认。上述机制重合足以要求加入强基线,但不能据此作“它没有某能力”的断言。其他条目以论文或作者仓库为依据,读取日期均为 2026-09-08。

3. A:多时刻运动证据约束的身份交接——18 天首选试验

3.1 论文问题应该怎样说

研究假说:窗口边界会把几何上接近、物质身份不同的点混在一起;一个短重叠区间里的运动证据,比单个端点或单帧深度一致性更能区分这些点。

例子是双手接触、两条腿交叉、物体从相近深度经过。一次投影位置可能正确,交接后的轨迹却跟到了另一块表面。长视频里少数此类错误可能造成不可恢复的身份漂移。我们必须先测出这个现象,再决定是否值得写论文。

已有 Point4D 和 TAPVid-MV 的交接机制是本方案直接前提;多时刻匹配本身也属于经典思路。拟投稿贡献必须落在:揭示 DPM 跨窗身份失效、给出针对该失效的交接准则,以及证明它解决了普通重叠平均不能解决的错误。Point4D 原稿TAPVid-MV 附录 C

3.2 最小实现

冻结 V-DPM。18 天默认先做固定延迟分块版:W=24、O=16、stride=8,每到8个新帧发布这一块的结果;稳态采集等待最多7帧,另加计算时间,首个24帧窗口的初始化等待单列。D1 若 profile 要求缩小配置,先改完并锁定全部对照。维护 Q=512/1024 个固定物质点身份及其源像素。这些是原型配置,不是已验证最优值;该主表不能标成零延迟严格因果。

  1. 新旧窗口在相同物理时刻对齐。优先使用可靠背景/共同可见几何估计 robust Sim(3),避免把两个不同时刻的动态点硬对齐。
  2. 在共同坐标系中,为旧身份及新窗口候选源像素提取 m=3–5 个共同有效时刻的 3D 轨迹片段。有效性仅由预测相机、图像范围、预测深度一致性或经核验的可见性头判断,不能直接把 V-DPM confidence 当 visibility;GT visibility 只作诊断。有效时刻不足时拒绝匹配。
  3. 先做局部稀疏候选搜索,再计算多时刻位置、运动增量及邻域关系的一致性;按最优候选与次优候选之间的差距判断歧义。
  4. 证据不足则保留“暂失”状态,不把投影到图像边缘或遮挡表面的点当作成功交接。首版暂失时输出最后可靠世界坐标或固定速度外推,并标记不可见;下一窗口用保留描述子与扩大搜索区域重新生成候选。所有方法采用同一暂失回退策略,点仍留在完整评价集合。若保留旧源图再次推理,必须把它计入输入、状态内存和计算。
  5. 首版只改变关联;不要同时添加复杂 TTA、可学习 memory 和全局 BA。

一个可实现的匹配代价是:

\[ c(i,j)=\frac{1}{|\mathcal O_{ij}|} \sum_{\tau\in\mathcal O_{ij}} \rho\!\left(\|X_i^{old}(\tau)-A X_j^{new}(\tau)\|_{\Sigma}^{2}\right) +\lambda_v E_{\Delta X}+\lambda_nE_{\mathrm{neighbor}} . \]

这里 A 是两窗口间对齐变换,\(\mathcal O_{ij}\) 仅包括共同有效观测;\(\Sigma\) 是经验证的归一化尺度或噪声模型,不能默认网络 confidence 就是协方差。位置项、增量项、邻域项须逐项消融。

真实代码边界:V-DPM 提供源图像像素到目标时刻的 DPM,不是任意世界 3D query 接口。需要在新源帧投影并采样其轨迹场。为了取得重叠时刻签名而增加的解码也要计入计算,不能视为免费。V-DPM model.pydecoder.py

3.3 决定是否能投的实验

实验 要排除的解释
endpoint、Point4D Selection、普通 overlap trajectory average、多时刻代价,保持同一前端与窗口 是否只是更好选帧或轨迹平滑
相同预算的 2D forward–backward、多时刻 2D 匹配、3D 匹配 3D 运动证据是否必要;不是多算几帧就涨点
随机平移窗口边界;统计交接后 16/32 帧误差跳变 收益是否来自挑选有利边界
跨 1/2/4/8 次交接及 256/512/1024/全长前缀 是否实际减少累计身份漂移
GT camera / GT depth 逐项替换,仅作诊断 分清几何误差、身份交接误差、源模型本身失败
完整 query 集的官方分数 + 暂失比例 + risk–coverage 是否靠拒绝困难点制造涨分

72 小时门槛:预先固定 6–10 个验证长片,先实现 Selection/overlap average。若多时刻签名不能在多个序列稳定胜过二者,或根本找不到交接诱发的身份错误,停止。可把“动态后段误差约下降 10%、误交接率约下降 20%”设为内部继续线;不将其写成预期结果。

身份错误须操作化定义:有物质点 ID 时直接核查;只有稀疏 GT tracks 时,只在候选 GT 点充分分离的事件上统计误关联,其余称为跟踪误差,不能仅凭 EPE 大就断言 identity switch。

3.4 论文边界与可能的审稿意见

最危险的意见是“这只是 trajectory stitching”。回应需要一张交接机制图、一个可重复干预实验和跨骨干结果,单纯平均指标涨几个点不足。

A 第一版主要改 tracking,未必改重建。 若深度/相机都不变,应准确定位为“重建模型支持的长时 3D tracking”。若要声称重建与 tracking 互益,可在已有轻量几何优化器里只替换接受的轨迹约束,证明相同预算下几何也改善;18 天内没有此证据就收窄题目,不能把冻结几何的输出冒充新重建成果。

4. B:可观测方向约束的小状态 TTO——有优化基础才适合 18 天

4.1 比“加 confidence”更具体的问题

研究假说:单目动态场景里,相机、深度和物体运动可以相互补偿。优化器沿缺少观测支持的方向更新时,自监督损失会下降,但真实世界轨迹更差。

必须区分两件事:物理状态在当前观测下是否可辨识,以及网络参数的梯度是否小。它们不是同一个问题。上一轮综述中“可观测性 TTA”具有研究价值,但作为 18 天首选过于宽泛;这次将其收窄为输出状态上的小变量优化。

C4D 已做 tracking/flow 引导的几何优化;LoRA3D 已有 confidence 校准;LEAP-VO 已用长期点轨迹、动态/不确定性过滤辅助位姿。因此“鲁棒 residual + 小步更新”应作为强 baseline。C4D §3.3LoRA3DLEAP-VO,CVPR 2024

4.2 第一版怎样做

冻结骨干、固定预测内参。活动窗口 W=8/16,约 512 条轨迹;只优化相机 SE(3) 小增量、每帧相对 log-depth scale,以及必要时 8/16 个局部运动组的低维残差。在全局初始化时固定世界 pose 和一个尺度规范;初始化帧移出后,通过已发布世界锚点或边界先验传递规范,不能每窗把首帧重置为单位 pose 和新尺度。先不反传到网络,不引入 LoRA/prompt。

图像对应构成数据约束;预测深度、点图、运动构成神经先验,或明确标记为相关伪测量。对应关系本身也由模型估计,需要稳健处理。不能把同源预测深度当成独立真实观测,从而人为增加“可观测方向”。分别消融仅图像对应、加入几何伪测量的版本,明确区分数据项与先验项:

\[ E(s)=E_{\mathrm{obs}}(s)+E_{\mathrm{prior}}(s). \]

在去掉 gauge、按噪声与变量尺度白化后,检查相对先验的信息方向;这里 H_obs 只表达所选数据约束在局部线性化下的支持:

\[ H_{\mathrm{obs}}v=\lambda H_{\mathrm{prior}}v. \]

可在弱方向保留先验/限幅,只在足够支持的方向接受更新。这里要求先验矩阵在选定状态空间内可逆或明确正则化。这只是可运行起点;广义特征分解、截断 SVD 或阻尼本身不构成创新,也不是完整非线性可观测性证明。

若走两个月版本,进一步把更新拆成相机、尺度、局部运动的物理子空间,并用未参与拟合的当前/过去观测检查候选更新是否成立。不同点/时间的留出观测减少过拟合,但仍共享图像和前端,不能称为统计独立真值。

代码可实现性:V-DPM 的 camera head 从 aggregator 取特征,动态 point head 从 decoder 取特征;仅修改 decoder prompt 不会更新 camera。首版显式相机变量更直接。St4RTrack 的公开 TTA 脚本是窗口采样训练流程,loss 中使用 offline CoTracker,必须改为仅访问已到达帧,才能比较在线版本。V-DPM model.pySt4RTrack train_tta.shlosses.py

4.3 必不可少的基线与反证

对照 必须保持相同 作用
无优化 前端、输入、窗口、查询 确認 TTO 总收益
普通小状态优化 变量、残差、迭代步数 分离“优化了”与“怎样优化”
Huber + visibility + confidence + trust region 同一变量与计算量 排除常规稳健化即可解释
截断 SVD / 对角阻尼 / 按参数组冻结 同样的局部信息矩阵 排除普通数值稳定化解释
本方法去掉观测/先验分离,或去掉留出检验 其余实现一致 证明主机制
更大窗口 / 更多普通优化步骤 端到端总 GPU 时间近似相同 排除增加预算解释

先在已有验证数据上做低视差、纯旋转附近、物体与相机同向运动、较多动态前景、遮挡后的错误反馈分层。自然序列为主,可控扰动仅作机制诊断;不能让算法读取 GT 分层标签。

早期决定:D3–5 若没有稳定出现“loss 下降而 world error 上升”,不要硬写可观测性故事。D8 若仍无法超过强稳健 baseline,就取消18天该方向。若要继续两个月,W3 前必须显示方向选择确实对应物理退化,而且收益超过简单组冻结/阻尼。

支持联合 4D 的必要证据是 2×2 消融:geometry update 开/关 × track feedback 开/关。若所有 tracking 收益在 GT camera 下消失,可以成为相机校正工作,但不要声称解决物质点身份。

5. C:跨遮挡持续维护身份后验,并在重现时纠正几何——两个月重点候选

5.1 精确新增空间

研究假说:确定性轨迹在遮挡期的猜测,被跨窗口递推反复当成可靠查询;重现时错误关联与几何漂移互相解释,导致错误身份无法恢复。应持续保留多个可能身份/位置,直到新的可见证据到来。

Point4D 已保留固定初见描述子并使用 3D query 递推;TAPNext++ 已关注长期重检测;Point2Pose 已在重现当帧构造多个刚体 pose 并作几何选择。因此,候选新增点只能是:跨时间持续维护非刚性物质点的关联分布,区分预测和新观测,并处理预测相机/深度与身份关联之间的耦合错误。 单纯 RGB 替换 RGB-D、刚体改局部刚体都不够。Point4DTAPNext++Point2Pose §3.3–3.4

5.2 表示、更新及训练边界

每个身份保留初始可靠外观、局部邻域、最近可靠可见时刻,以及最多 H=3/4 个位置/速度/不确定性/关联权重假设。限制活动点数、休眠身份数和活动帧数;全部查询历史不是无限留在 GPU/CPU 里。

  • 可见时:由当前匹配、邻域关系、深度及相机一致性更新状态;只有关联通过验证才更新可靠外观。
  • 遮挡时:传播先验及不确定性,不把预测位置当成新的坐标测量,不连续“自我确认”。完全不可观测时不承诺准确恢复任意运动。
  • 遮挡与出视野分开:有可信深度及遮挡解释时,可施加点在前方遮挡面之后的单侧深度约束;出视野时不能套用该约束。预测深度不可靠时削弱或关闭此项。
  • 重现时:外观搜索给出多个候选;几何和局部物质点邻域联合验证“原身份 + 几何漂移”或“新错误表面 + 几何可靠”等解释,避免一个错点拖动相机。
  • 几何反馈:接受的关联只更新当前活动状态;若重写过去 L 帧结果,明确报告固定延迟版本,不能与严格因果结果混表。

可用 mixture likelihood,而不是先平均几条可能轨迹:

\[ E_{\mathrm{assoc}}= -\sum_{(i,t)\in\mathcal V} \log\sum_{h=1}^{H} w_{ih} \exp\{-\rho(r^{2D}_{ih})-\lambda_z\rho(r^z_{ih})-\lambda_f d(f_{ih},f_i)\}. \]

再加可信遮挡约束、邻域项和过程先验。这个表达式是方法原型,MHT/mixture 模型本身并非新发明。

首版完全冻结前端。若候选评分确实需要学习,只训练小 association / uncertainty head;训练输入来自冻结前端的真实预测及扰动,监督使用 PointOdyssey train 等已有标注。不能只用 GT depth/pose 训练再期望测试适应预测几何。未经实测不承诺参数量、训练时长或收敛。

5.3 必须打败谁

  1. 相同前端的 endpoint / Selection chaining。
  2. 固定初见描述子 + 单高斯状态 + confidence gate。
  3. 仅在重现当帧产生多假设并选一个,与持续维护后验比较。
  4. Point2Pose 式 sequential RANSAC + 同源预测深度几何评分 + 局部图优化;在非刚性场景加局部刚体分组版本。这是机制对照,独立实现要如实标注。
  5. 多假设但把每次模型预测都当新测量;检验“预测/观测分离”是否必要。
  6. 完整方案去掉几何反馈,检验是否真正重建与追踪互益。
  7. 长期 2D tracker + 相同几何 lifting,以及一个有公共实现的 3D tracker。输入和训练数据条件另列,不强行伪装同骨干。

对照中的预测深度必须来自相同可用 RGB 前端;GT depth 只作诊断。Point2Pose 的 RGB-D 原版数值不能当成同输入主表胜负。

5.4 两周门槛与论文证据

W1 先测候选集的 oracle recall:若正确重现点根本不在候选集中,应改候选生成,而不是继续堆复杂后验更新。W2 必须证明“持续保留分布”优于“重现当帧生成并选择假设”。否则该方向的新颖性和必要性都不足。

完整证据包括重现分桶 1–16、17–64、65–128、>128 帧;重现后的正确恢复、误捕获及恢复延迟;动态世界轨迹、深度和相机指标;固定 Q/B/H 的内存和尾部延迟。不同数据集事件少的桶明确给样本量,不将不稳定的小桶均值作为主结论。

继续投入可要求:两个数据源的长遮挡恢复稳定改善,误捕获率不上升,动态 world-track 尾部误差约下降 10% 以上。这是内部阈值;最终若只有 2D redetection 提升,应收窄为 tracking,不能包装成完整 4D 突破。

6. D:把新增观测与重复模型先验分开——两个月后端备选

6.1 先证明一个具体问题

研究假说:重叠窗口共享大量图像,多次模型预测相关;后端却可能把它们当成独立测量不断累积,出现残差更小、置信更高、世界轨迹反而更差。

这个现象尚未在我们的模型上实测。普通滤波、SLAM 已长期处理信息重复计算;动态因子图也并非新概念。新论文必须锁定“基础模型随上下文刷新、输出相关先验”的具体来源,并超过普通 fixed-lag BA。DynOSAMDM-VIO

6.2 最小原型

将因子分成:

  • 唯一观测约束:带源图像、时间、像素/物质身份的可见观测。每条物理观测不重复提交。
  • 当前模型先验:当前窗口对深度、点图、运动的预测;上下文更新时替换旧先验,不默认作为独立新证据叠加。
  • 历史摘要:仅在观测离开活动窗口时边缘化一次;保存固定预算摘要。
\[ E=E_{\mathrm{unique\ observations}} +\lambda E_{\mathrm{current\ neural\ prior}} +\|R_m\delta s-b_m\|^2 . \]

“来自同图像”不意味着两次预测完全无新增信息:更长上下文可能新增有效证据。算法不能简单删除所有重叠预测,必须区分重复来源与新增上下文。去重只是起点。

先在小状态规模做精确 Schur 版本,再比较固定秩摘要。若进一步保留 camera–motion 交叉信息,必须说明取舍依据,并比较对角摘要、普通 top-eigenvalue、均匀关键帧和 reservoir。不能只因用了 Schur 就声称创新。固定 Q/B/摘要秩下才谈工作内存有界;永久存储所有历史输出的磁盘开销另算。

6.3 决胜实验与停止条件

在同一序列上改变 overlap、同一证据的重复更新次数、历史重放次数,保持新输入和查询集合一致。观察误差、校准、内存随长度的变化。模型 confidence 若未经校准,先称 confidence 分数,不将其直接解释为概率。

必须比较普通 fixed-lag BA、按重复次数归一化权重、只保留最近预测、常规保守相关融合、完整历史优化上界。如果权重除以重复次数就获得同样收益,或规范 BA 本来没有此问题,应停止该方向。

W2 必须有可重复的来源相关性干预结果;W4 必须超过普通 BA/简单去重,并在第二骨干复现。该方向对实验设计和后端正确性要求最高,不建议作为18天临时转向。

7. 所有方向共用的评测合同

7.1 输入、因果性与输出

主设定使用单路 RGB,pose 全部预测;相机内参是否已知单列,默认主系统采用预测或初始化估计的 K,不隐含使用 GT K。若数据协议提供 K,可另设“已知内参、未知外参”表格。

在时刻 t 只允许看到 \(I_{\le t}\)。已有双向短窗网络可以对“截止当前的过去窗口”运行;不能把一整块未来帧送入网络,却把块内早期结果计为零延迟。若按 chunk 等待后统一发布,报告实际最大等待帧数。反复前缀推理是因果的,但未必高效。

严格因果表输出当前 pose、当前规定分辨率点图、固定 query 集在当前时刻的位置与可见性;A 的18天默认分块版另列固定延迟表。定义新 query 到达规则,另列全程老 query 与新生 query 结果。追加未来帧后已发布结果不变,是可以直接做的因果检查。

因果表只评分 t≥t_query。若官方协议包含查询前的历史轨迹,另报完整标准协议并标明需要回溯/离线;修改评分掩码后的结果称“派生因果协议”,不冒称原版官方分数。固定延迟版同时报告帧的拍摄、可用与发布时刻,不能只标算法内部窗口长度。

TTA teacher、动态 mask、深度模型、模型特征缓存都遵守同样时间边界。每个测试视频重置适配状态;不从测试集学跨视频参数。

7.2 数据与用途

数据 本项目用途 使用边界
PointOdyssey 官方发布 开发失效机制;完整长序列 tracking / world drift;小头训练用 train split v1.2 公布 13 条 test;先固定 val 开发,不从 test 挑有利长片
Dynamic Replica 官方项目 第二个动态长序列数据源;完整 900 帧 test 视频 主输入仅用一侧 RGB;另一视角/GT depth/pose 只用于官方评价或诊断
TAPVid-3D 官方数据和评测 真实域官方 3D tracking,防止只在合成数据成立 minival 适合调试,不能充当完整最终成绩;至少预先指定一个完整来源协议并公开范围
TAPVid-MV 学习公平拼接/几何对照及附加评测设计 主任务多视角,不把多视角信息带入单目主结果
TAPNext++ 的重检测定义 参考重现评价方式 在 PO/DR 上移植属于派生协议,要公开事件构建、阈值和计分代码

18 天的最低完整证据建议是两类合成长序列 + 一个完整真实来源协议;达不到时如实缩小结论,不把零散 demo 当真实域泛化。短序列标准评测仍保留,用于说明方法不是牺牲正常场景换长序列分数。

7.3 指标、归一化与公平性

  • 标准协议与因果表:标准协议使用原 evaluator、评分范围与官方尺度处理;严格因果/固定延迟的派生表明确任何 query 评分掩码改动,沿用 AJ/APD 等指标定义但不与原版分数直接混排。不同数据集指标不能直接混成一个平均分。
  • 长程诊断:在单一统一世界 gauge 下报告动态/静态 world error、P50/P95、末段误差、长度曲线;有可用 GT 才给对应指标。
  • 尺度:保留官方对齐主表;另做初始化前缀定尺度后冻结的漂移诊断。GT 仅供评分端求规范,不进入算法。禁止每窗口对 GT 重新 Sim(3) 对齐后宣称没有漂移。
  • 几何:有标注的数据上报告动态/静态 depth error、相机 ATE/RPE;点云误差与轨迹物质身份误差分开。
  • 遮挡:评价重新可见后的恢复和错关联;遮挡中不可辨识的任意运动不作为方法保证。
  • 计算:分辨率、query 数、输出时刻、延迟、输入帧数一致;报告含前端、teacher、TTO、交接和导出的端到端时间,以及 GPU/CPU 工作内存。
  • 统计:以视频/序列为重采样单位给配对置信区间,避免把高度相关的像素当独立样本。小头训练用至少 3 个种子;确定性 training-free 方法不必无意义重跑随机种子。
  • 调参:阈值和停止规则只在 val 固定;测试集只用于冻结配置后的报告。记录前端训练数据,不能把预训练已见过某来源宣传为完全未见域。

两个月论文建议有五组主证据:标准准确率、完整长序列、真实域、遮挡/退化分层、质量—计算—内存曲线。每一组都围绕一个机制,不需要堆十几个来源不明的 leaderboard。

8. 18 天排期:9 月 8 日至 9 月 25 日内部完稿

时间 主力 辅助并行工作 明确交付与决策
D1–2,9/8–9/9 锁定坐标/查询合同、stride、最大等待与发布规则;A 原型,或已有优化器上的 B 诊断 辅助 1 核 evaluator/数据;辅助 2 跑强基线和 H20D profile;第 3 人可整理相关工作和可视化 一个可端到端复现的 baseline;固定验证长片;含初始化/交接解码的实测预算
D3,9/10 判断核心假说是否存在 独立核查失败例,排除坐标/尺度 bug A 的 72 小时 go/no-go;最多保留一个主方向
D4–6,9/11–9/13 完成唯一核心模块 Selection/普通稳健优化等关键对照,真实域预跑 至少一张机制图和一张强基线对照表
D7–8,9/14–9/15 复核效应是否被简单方法解释 第二数据源、等预算、query coverage 检查 D8 决定是否继续18天投稿;不合格转两个月
D9–12,9/16–9/19 冻结超参与方法,写主文 跑完整测试;另一骨干最小移植;摘要与账户材料 官方摘要截止前完成注册;主结果表成形
D13–15,9/20–9/22 机制消融与失败分析 配对统计、速度/内存、图表和代码核查 完整初稿;只补影响结论的实验
D16–18,9/23–9/25 通篇审稿与论点收缩 复现关键配置、核引用/匿名化/补充材料 9/25 内部定稿,保留正式截止前缓冲

D8 继续投稿的建议标准:至少两个独立数据源支持核心机制;最关键强 baseline 跑通;预计能完成真实协议;不是只在挑选例子上有效;论文可以用一句话说明“什么新证据/机制改变了什么行为”。达不到就转两个月,不在最后十天不断换模块。

若选择 B,D3 可以只判断“loss 与真实误差背离”是否存在,但 D5 前必须有普通优化与稳健 baseline。若连基础优化器都需从头接,不以18天为合理承诺。

9. 两个月排期与人员安排

以 9/8 启动、11 月上旬完成主体为目标;把 CVPR 截止前最后一周多留给复核,不继续发明新模块。

周期 共同任务 选择 C 时 选择 B / D 时
W1,9/8–9/14 统一 baseline、H20D profile、数据协议与 oracle 诊断 候选召回、遮挡事件、固定描述子基线 B:误差背离;D:重复证据干预
W2,9/15–9/21 冻结主假说,停止次要路线 持续后验 vs 当帧多假设选择 B:robust/truncated-SVD 对照;D:规范 fixed-lag BA
W3–4,9/22–10/5 完成一个主要算法,不重训大骨干 遮挡更新/重现关联,必要时小头训练 B:物理子空间与检验;D:唯一提交与摘要
W5,10/6–10/12 联合任务的互益证据,第二骨干 关联反馈几何 验证不是只改善静态 pose
W6,10/13–10/19 冻结超参,完整长片与真实域 全长遮挡恢复及错误捕获 退化/重叠密度及等预算
W7,10/20–10/26 主文、消融、失败分析 把非刚性与刚体子集分开 与经典优化解释逐项对比
W8,10/27–11/2 复现关键表、统计、补充与代码整理 同左 同左
11/3–11/8 内部审稿、锁定所有主结论 不新增模块 不新增模块
11/9 至正式截止 注册、独立复核、修订和投稿 仅补必要证据 仅补必要证据

建议主力始终负责算法与论证;辅助 1 负责 evaluator/数据,辅助 2 负责基线/计算统计,第 3 人如可用则负责独立复现、文献与图表。没有假定辅助同学都全职;资源不齐时先削减第二骨干的扩展实验,不削减关键反证基线。

A 若在18天内未达投稿强度,但确认交接身份问题存在,可自然转入 C 的长期身份后验;若主要误差来自相机/尺度退化,则转 B。不要在同一稿里同时硬塞 A+B+C+D。

10. 8 张 H20D 的预算:容量够不够取决于评测成本

由用户给出的可用比例计算,18 天容量上界为:

\[ 8\times24\times18\times0.7=2419.2\ \mathrm{GPUh}. \]

60 天为 8064 GPUh。两个月排期实际按日历略有差异,这里统一用60天作预算基数。它们不是实测吞吐,更不等于 A100/H100 的 GPUh,也不意味着随时有连续8卡。

用途 18 天建议承诺量 / GPUh 两个月建议承诺量 / GPUh
基线、坐标与数据验证 200 500
核心失效诊断及 pilot 250 600
可选小头训练 0 800
冻结配置后主评测 600 1600
机制消融与等预算对照 350 1300
第二骨干、真实域与稳健性 250 900
关键复核 150 300
合计 1800 6000
容量余量 619.2 2064

表中是任务上限分配,不是从硬件基准推得的时长预测。主要用独立单卡视频作业,保留 checkpoint;只有微调阶段安排连续多卡。若8卡70%不可用时间已包含排队,不要在利用率估算中重复扣减;余量用于故障、试错和未预计实验。

每类实验按实际端到端测量重算:

\[ \mathrm{GPUh}= \sum_{\mathrm{runs}} \frac{G\,[t_{\mathrm{prep}}+N_{\mathrm{frames}}t_{\mathrm{frame}}]}{3600}. \]

例如,若所有测试共 80,000 帧、8 个配置、每配置平均10秒/帧且每作业1卡,仅这组实验就需约1778 GPUh;这是假设算例,说明 TTO 大消融会快速吃完18天预算。不能用“参数少”推断“评测便宜”。

已有研究日志中的32帧 StreamDPM profile 记录 decoder 21.49秒、wall 26.84秒、allocated约27.52GiB,但设备只标为某实验室 GPU0;不能把它当 H20D 测量。日志也不能证明当前 unified evaluator 全部正确。这些资产支持优先复用现有路径,而不是重新搭整个系统。

D1 必测 W=8/16/24、固定 query/分辨率、TTO 0/1/3/5步的端到端成本。缓存同一因果前端预测可减少开发消融成本;论文部署计时仍加回前端和 teacher。

11. 为什么不把解码加速列为主要投稿方向

它适合两天验证的工程备选,但新颖性风险比 A/B 高。D4RT 已削减时空重复查询;OmniX 已稀疏轨迹解码;DELTAv2 已研究时间采样/插值;TraceAnything 用连续轨迹场表示视频。D4RTOmniXDELTAv2TraceAnything 官方实现

若做,严格限定为冻结现有 DPM,保持所有输入帧、源 query 和最终输出时刻一致,减少目标时间 decoder 执行次数。必须胜过均匀取样 + nearest/linear/cubic、固定运动阈值采样、低分辨率和完整 decoder。

V-DPM 官方 inference 循环各目标时刻。仅改成“只输出当前时刻”是不同输出合同,公平 streaming baseline 也应只 decode 当前时刻。时间条件进入每层 attention,不能默认存在精确跨时间 KV cache;DPT 先密集解码再采样不会省掉主要稠密运算。model.pydecoder.py

用未来端点插值只能称固定延迟/离线;严格因果需要外推或当前帧触发纠正。可把同精度端到端约2倍提速、且显著优于均匀插值设为独立论文继续线,但这是目标,不是已有结果。若只能获得小幅改进,作为主论文的工程模块或开源工具更合适。

12. 实际截稿与投稿策略

截至2026-09-08,官方日期如下。AoE 为 UTC−12,北京时间为 UTC+8,换算相差20小时;应以官方系统最终显示为准。

会议 / 事项 官方 AoE 日期 北京时间
ICLR 2027 摘要 2026-09-18 23:59 2026-09-19 19:59
ICLR 2027 正文 2026-09-25 23:59 2026-09-26 19:59
CVPR 2027 注册 2026-11-10 日终 2026-11-11 19:59
CVPR 2027 正文 2026-11-16 日终 2026-11-17 19:59
CVPR 2027 补充材料 2026-11-23 日终 2026-11-24 19:59

来源:ICLR 2027 官方 CFPCVPR 2027 官方 CFP。第三方预测截稿不用于此排期。

ICLR 的最终决定为12月16日,晚于 CVPR 投稿截止;两个会议均限制实质相同工作同时在投。因此这两段周期是择一/转轨计划:18天达标则考虑 ICLR;未提交或按适用规则完成撤稿后可考虑 CVPR,不能把“先投 ICLR 再等拒稿投本届 CVPR”当成自然时间顺序。A 与 C 若是同一工作的阶段扩展,也不能默认作为两篇同期独立投稿。ICLR CFPICLR 作者指南CVPR CFP

日志显示团队另有较成熟的全景 4D 数据/稿件积累。若那项工作仍未发表、已有足够主结果且与当前计划相关,18天用于补齐它的长时 tracking 证据可能比新开论文更现实。但其投稿状态与实际完成度未核实,本文不据此改变已经确认的单目 RGB 主设定,也不把现有稿件资产当作新方案已有结果。

13. 接下来 72 小时具体交付

  1. 第1天:一个可信 baseline 包。 锁定前端 checkpoint/commit、单目输入、K/pose来源、坐标转换、因果窗口和 query 合同;跑通两条完整长片;完成 H20D profile。
  2. 第2天:一张失效来源表。 对固定验证集区分源 tracker 失败、跨窗身份错误、几何/尺度漂移、遮挡后错误固化;完成 Selection 和普通稳健方法的关键对照。
  3. 第3天:只选一条主线。 交接错误明确且 A 超过简单对照,冲18天 A;几何退化主导且已有优化基础,选 B;长遮挡状态固化最明显,直接按两个月 C;只有出现重复证据干预效应才选 D。

我的最终取舍:18天优先 A 的窄问题;两个月优先验证 C 与 B 的机制,再择一。 若目的是更有说服力的完整“4D 重建 + tracking”论文,两个月更符合当前证据和团队条件。不要为了赶18天,把一个尚未打败强拼接/稳健优化的模块硬包装成世界模型。

本次已完成定向文献、近邻反证和官方代码路径审阅;未实际运行模型、训练或测量 H20D。方向的新颖性判断仍有边界,特别是 Point4D 全文访问受限,以及各机制的真实效应尚待实验。Markdown 已作结构、链接清单和数值核查,不宣称完成 PDF/排版渲染验收。