ThermoMetric · Experiment report ·
TartanRGBT 上的 MoGe-3-L
微调与完整评估
训练 objective 仍在下降,但真正用于模型选择的 Day4 validation AbsRel 已在 epoch 4 达到最佳。本报告把训练拟合、验证泛化、Day5 测试与 MS² 跨数据集结果分开呈现。
直接结论
如果你说的 loss 是 training objective:是,停止时它还在下降。
epoch 4→8 又下降 11.7%。但 Day4 validation AbsRel 同期从 0.6713 恶化到 0.7329;因此这是典型的“训练集继续拟合、held-out 泛化不再改善”。现有证据支持保留 epoch-4 checkpoint,不支持从 epoch-8 按原配置盲目续训。至于 epoch 9–15 是否可能重新恢复,当前没有运行证据,只有一次关闭 early stopping 的诊断实验才能回答。
3 h 06 m 45 s
实际训练时长
Epoch 4
最佳 Day4 checkpoint
2,864 / 5,370
实际 / 原计划 optimizer steps(53.3%)
4 × H20
global batch 32;rank-0 peak 39.29 GiB
训练收敛与 early stopping
两条曲线使用独立纵轴;训练 objective 与 AbsRel 不是同一个量,不能直接比较绝对值。checkpoint 只按完整 Day4 validation AbsRel 选择。
| Epoch | Optimizer step | Train objective ↓ | Day4 AbsRel ↓ | 相对最佳 | 状态 |
|---|---|---|---|---|---|
| Init | 0 | — | 2.226781 | +231.7% | Released initialization |
| 1 | 358 | 0.347058 | 1.733003 | +158.2% | Backbone frozen |
| 2 | 716 | 0.234902 | 1.122483 | +67.2% | Backbone warm-up |
| 3 | 1,074 | 0.138751 | 0.782047 | +16.5% | Cosine decay |
| 4 | 1,432 | 0.127641 | 0.671304 | Best | ✓ saved checkpoint |
| 5 | 1,790 | 0.121929 | 0.778901 | +16.0% | stale 1 |
| 6 | 2,148 | 0.117955 | 0.717403 | +6.9% | stale 2 |
| 7 | 2,506 | 0.114923 | 0.743332 | +10.7% | stale 3;受 min_epoch 约束继续 |
| 8 | 2,864 | 0.112672 | 0.732945 | +9.2% | early stop |
为什么 epoch 8 停,而不是 epoch 7?
patience=3,但同时规定 minimum_epochs=8。epoch 7 已累计三次 stale validation,却尚未达到最小 epoch;epoch 8 再次没有超过 epoch-4 best(至少改善 1e-4),于是停止。该 run 标记为 early_stopped=true、stopped_by_step_budget=false,不是超时、OOM 或任务失败。训练配置
uint16 thermal
512×640
512×640
P1–P99 + CLAHE
bilateral
bilateral
复制三通道
MoGe-3-L
MoGe-3-L
camera-space
point maps
point maps
FoundationStereo
thermal-plane points
thermal-plane points
数据与模型
| Train | 11,456 帧;Day1–3;27 trajectories |
| Validation | 4,633 帧;Day4;16 trajectories |
| Protected test | 854 帧;Day5;3 trajectories |
| 总计 | 16,943 帧;1 Hz;46 trajectories |
| 模型 | Released MoGe-3-L / v3 / 370M |
| 输入 | 仅 thermal;无 RGB;无 test-time alignment |
| Target | FoundationStereo → 标定 3D 投影至 thermal plane |
| 深度定义 | thermal camera-axis z,0.1–100 m |
| 监督 coverage | 全库均值 57.28%;holes 不进入 loss |
计算与优化
| GPU | 4× NVIDIA H20(physical 4–7) |
| Precision | MoGe-3 BF16 mixed;TF32 matmul |
| Batch | 8 / rank;global 32;accumulation 1 |
| Steps / epoch | 358 |
| Optimizer | AdamW;weight decay 0.01;clip grad 1.0 |
| Head LR | 1e-5 |
| Refiner LR | 2e-5 |
| Backbone LR | 1e-6;前 10% steps frozen |
| Schedule | 537 freeze + 537 warm-up + cosine decay |
| Tokens / refinement | 1,200 tokens;3 steps 用于 50% micro-batches |
完整 loss 定义
| Component | Weight | 作用 |
|---|---|---|
| Affine-invariant global point loss | 1.0 | 约束全局 camera-space 几何;align resolution 48 |
| Radial-partition local point loss | 1.0 | 局部点图结构;alpha 4.0 |
| Metric-scale loss | 0.1 | 恢复以米为单位的尺度 |
| Normal / mask / edge loss | 0 | 本次 run 未使用;因此没有直接边界锐度约束 |
完整 evaluation
所有结果均为 replicated thermal input → native thermal-plane depth;不使用 RGB、median scaling、scale/shift alignment 或 prediction warp。Tartan prediction 为 512×640,MS² 为 256×640;不匹配会 fail-closed。
| Metric | Released | Tartan finetuned | 变化 |
|---|---|---|---|
| AbsRel ↓ | 0.622039 | 0.305739 | −50.85% |
| SqRel ↓ | 6.424770 | 3.481997 | −45.80% |
| RMSE ↓ | 11.5217 m | 9.7445 m | −15.43% |
| RMSE log ↓ | 0.710308 | 0.471454 | −33.63% |
| SILog ↓ | 48.7473 | 37.2849 | −23.51% |
| δ1 ↑ | 0.275717 | 0.527853 | +25.21 pp |
| δ2 ↑ | 0.500881 | 0.741677 | +24.08 pp |
| δ3 ↑ | 0.669543 | 0.846451 | +17.69 pp |
| Prediction coverage ↑ | 100% | 100% | 不变 |
| Edge F1 @2px ↑ | 0.017307 | 0.013186 | −23.81% |
| Edge jump MAE ↓ | 5.6876 m | 5.6478 m | −0.70% |
854 帧完整 protected Day5;177,274,855 evaluated pixels;target coverage 63.35%。Target 是 FoundationStereo 派生伪深度,不是独立 sensor GT。
| Metric | Released | Tartan finetuned | 变化 |
|---|---|---|---|
| AbsRel ↓ | 0.362485 | 0.224645 | −38.03% |
| SqRel ↓ | 4.880416 | 2.550208 | −47.75% |
| RMSE ↓ | 10.0206 m | 8.9396 m | −10.79% |
| RMSE log ↓ | 0.346790 | 0.331143 | −4.51% |
| SILog ↓ | 21.7965 | 30.9821 | +42.14% |
| δ1 ↑ | 0.454994 | 0.629878 | +17.49 pp |
| δ2 ↑ | 0.814744 | 0.881692 | +6.69 pp |
| δ3 ↑ | 0.954608 | 0.948524 | −0.61 pp |
| Prediction coverage ↑ | 100% | 100% | 不变 |
MS² fixed Day-100;9,677,304 evaluated pixels;dense RGB-teacher thermal-plane target coverage 59.07%。这是跨数据集泛化,不是 MS² in-domain training。
| Metric | Released | Tartan finetuned | 变化 |
|---|---|---|---|
| AbsRel ↓ | 0.329040 | 0.170187 | −48.28% |
| SqRel ↓ | 3.192184 | 1.263131 | −60.43% |
| RMSE ↓ | 8.2105 m | 6.0687 m | −26.09% |
| RMSE log ↓ | 0.304023 | 0.253502 | −16.62% |
| SILog ↓ | 15.7549 | 22.9747 | +45.83% |
| δ1 ↑ | 0.448072 | 0.724039 | +27.60 pp |
| δ2 ↑ | 0.841674 | 0.930063 | +8.84 pp |
| δ3 ↑ | 0.974766 | 0.971856 | −0.29 pp |
| Prediction coverage ↑ | 100% | 100% | 不变 |
MS² fixed Day-100;3,691,593 evaluated pixels;独立 sparse LiDAR coverage 22.53%。绝对尺度改善明显,但 SILog 表明局部相对结构不稳定。
| MS² target / metric | Released | Tartan-trained | MS² in-domain trained |
|---|---|---|---|
| Dense AbsRel ↓ | 0.3625 | 0.2246 | 0.09548 |
| Dense RMSE ↓ | 10.021 | 8.940 | 4.785 |
| Dense δ1 ↑ | 0.455 | 0.630 | 0.920 |
| Sparse AbsRel ↓ | 0.3290 | 0.1702 | 0.1124 |
| Sparse RMSE ↓ | 8.211 | 6.069 | 4.669 |
| Sparse δ1 ↑ | 0.448 | 0.724 | 0.883 |
MS² in-domain checkpoint 仅作为同 identity 上下文:它直接在 MS² Day dense teacher 上训练,因此不是与 Tartan-trained checkpoint 等价的数据协议。
修正后的定性结果
关于上一版可视化 bug
旧图错误地用 target-valid mask 裁剪 released 与 finetuned prediction,使预测看起来也带有 projected target 的孔洞/轮廓。该错误只影响定性显示,不影响定量指标,因为指标本来就应该在 target-valid support 上计算。当前报告使用修复后的 native-plane run。
研究判断与下一步
已经成立
- Tartan finetuning 显著恢复 metric scale:Day5 AbsRel 降低 50.85%。
- 效果能跨数据集迁移到 MS²:Sparse LiDAR AbsRel 降低 48.28%。
- 训练/验证/test trajectory 完全隔离,epoch-4 checkpoint 未读取 Day5。
尚未解决
- 边界没有改善:Tartan Edge F1 反而降低 23.81%。
- MS² SILog 恶化,说明绝对尺度改善不等于局部 shape 更可靠。
- 当前 loss 没有 normal、edge 或 dense-completion 约束。
不建议:直接从 epoch-8 权重按原 LR/loss 继续训练。
建议:从 epoch-4 best 开一个新、预注册的诊断 run:更低 head/refiner LR、backbone 冻结更久,并加入 boundary/support-aware 目标;另做一次关闭 early stopping 跑满 15 epochs 的“是否回升”对照。后者是诊断收敛假设,不应覆盖当前 best checkpoint。
建议:从 epoch-4 best 开一个新、预注册的诊断 run:更低 head/refiner LR、backbone 冻结更久,并加入 boundary/support-aware 目标;另做一次关闭 early stopping 跑满 15 epochs 的“是否回升”对照。后者是诊断收敛假设,不应覆盖当前 best checkpoint。
复现与 provenance
| Training run | 20260829-134335_tartanrgbt-moge3l-ddp4-full |
| Training commit | 2bb3e2ee9e150c95cf36c7a6aaee57abae0a1e11 |
| Selected checkpoint | epoch 4 / step 1,432 / SHA256 a2e4b95f…c271 |
| Evaluation run | 20260830-025126_tartanrgbt-native-plane-eval |
| Evaluation commit | d1aa358c31e5766110c6fd7d3bc70c45c6190340 |
| Evaluation runtime | 247.62 s;one H20;peak 8.57 GiB allocated |
| Released checkpoint SHA256 | 9b41b7b9…7925 |
| Manifest SHA256 | 30ab772f…8151 |
| Environment | thermometric Conda;PyTorch 2.13.0+cu130;driver 580.105.08 |
| Selection | Day4 validation AbsRel only;test_metrics_seen=false |
Evidence boundary
TartanRGBT target 是 FoundationStereo 派生 pseudo-depth,并非独立 sensor ground truth;因此 Day5 数字证明的是对该 stereo target 的拟合与泛化。MS² sparse LiDAR 提供独立、但稀疏的跨数据集几何证据。所有主指标均不做 test-time scale/shift/median alignment。