ThermoMetric · Experiment report ·

TartanRGBT 上的 MoGe-3-L
微调与完整评估

训练 objective 仍在下降,但真正用于模型选择的 Day4 validation AbsRel 已在 epoch 4 达到最佳。本报告把训练拟合、验证泛化、Day5 测试与 MS² 跨数据集结果分开呈现。

直接结论

如果你说的 loss 是 training objective:是,停止时它还在下降。 epoch 4→8 又下降 11.7%。但 Day4 validation AbsRel 同期从 0.6713 恶化到 0.7329;因此这是典型的“训练集继续拟合、held-out 泛化不再改善”。现有证据支持保留 epoch-4 checkpoint,不支持从 epoch-8 按原配置盲目续训。至于 epoch 9–15 是否可能重新恢复,当前没有运行证据,只有一次关闭 early stopping 的诊断实验才能回答。
3 h 06 m 45 s
实际训练时长
Epoch 4
最佳 Day4 checkpoint
2,864 / 5,370
实际 / 原计划 optimizer steps(53.3%)
4 × H20
global batch 32;rank-0 peak 39.29 GiB

训练收敛与 early stopping

两条曲线使用独立纵轴;训练 objective 与 AbsRel 不是同一个量,不能直接比较绝对值。checkpoint 只按完整 Day4 validation AbsRel 选择。

EpochOptimizer stepTrain objective ↓Day4 AbsRel ↓相对最佳状态
Init02.226781+231.7%Released initialization
13580.3470581.733003+158.2%Backbone frozen
27160.2349021.122483+67.2%Backbone warm-up
31,0740.1387510.782047+16.5%Cosine decay
41,4320.1276410.671304Best✓ saved checkpoint
51,7900.1219290.778901+16.0%stale 1
62,1480.1179550.717403+6.9%stale 2
72,5060.1149230.743332+10.7%stale 3;受 min_epoch 约束继续
82,8640.1126720.732945+9.2%early stop
为什么 epoch 8 停,而不是 epoch 7?
patience=3,但同时规定 minimum_epochs=8。epoch 7 已累计三次 stale validation,却尚未达到最小 epoch;epoch 8 再次没有超过 epoch-4 best(至少改善 1e-4),于是停止。该 run 标记为 early_stopped=truestopped_by_step_budget=false,不是超时、OOM 或任务失败。

训练配置

uint16 thermal
512×640
P1–P99 + CLAHE
bilateral
复制三通道
MoGe-3-L
camera-space
point maps
FoundationStereo
thermal-plane points

数据与模型

Train11,456 帧;Day1–3;27 trajectories
Validation4,633 帧;Day4;16 trajectories
Protected test854 帧;Day5;3 trajectories
总计16,943 帧;1 Hz;46 trajectories
模型Released MoGe-3-L / v3 / 370M
输入仅 thermal;无 RGB;无 test-time alignment
TargetFoundationStereo → 标定 3D 投影至 thermal plane
深度定义thermal camera-axis z,0.1–100 m
监督 coverage全库均值 57.28%;holes 不进入 loss

计算与优化

GPU4× NVIDIA H20(physical 4–7)
PrecisionMoGe-3 BF16 mixed;TF32 matmul
Batch8 / rank;global 32;accumulation 1
Steps / epoch358
OptimizerAdamW;weight decay 0.01;clip grad 1.0
Head LR1e-5
Refiner LR2e-5
Backbone LR1e-6;前 10% steps frozen
Schedule537 freeze + 537 warm-up + cosine decay
Tokens / refinement1,200 tokens;3 steps 用于 50% micro-batches
完整 loss 定义
ComponentWeight作用
Affine-invariant global point loss1.0约束全局 camera-space 几何;align resolution 48
Radial-partition local point loss1.0局部点图结构;alpha 4.0
Metric-scale loss0.1恢复以米为单位的尺度
Normal / mask / edge loss0本次 run 未使用;因此没有直接边界锐度约束

完整 evaluation

所有结果均为 replicated thermal input → native thermal-plane depth;不使用 RGB、median scaling、scale/shift alignment 或 prediction warp。Tartan prediction 为 512×640,MS² 为 256×640;不匹配会 fail-closed。
MetricReleasedTartan finetuned变化
AbsRel ↓0.6220390.305739−50.85%
SqRel ↓6.4247703.481997−45.80%
RMSE ↓11.5217 m9.7445 m−15.43%
RMSE log ↓0.7103080.471454−33.63%
SILog ↓48.747337.2849−23.51%
δ1 ↑0.2757170.527853+25.21 pp
δ2 ↑0.5008810.741677+24.08 pp
δ3 ↑0.6695430.846451+17.69 pp
Prediction coverage ↑100%100%不变
Edge F1 @2px ↑0.0173070.013186−23.81%
Edge jump MAE ↓5.6876 m5.6478 m−0.70%

854 帧完整 protected Day5;177,274,855 evaluated pixels;target coverage 63.35%。Target 是 FoundationStereo 派生伪深度,不是独立 sensor GT。

MetricReleasedTartan finetuned变化
AbsRel ↓0.3624850.224645−38.03%
SqRel ↓4.8804162.550208−47.75%
RMSE ↓10.0206 m8.9396 m−10.79%
RMSE log ↓0.3467900.331143−4.51%
SILog ↓21.796530.9821+42.14%
δ1 ↑0.4549940.629878+17.49 pp
δ2 ↑0.8147440.881692+6.69 pp
δ3 ↑0.9546080.948524−0.61 pp
Prediction coverage ↑100%100%不变

MS² fixed Day-100;9,677,304 evaluated pixels;dense RGB-teacher thermal-plane target coverage 59.07%。这是跨数据集泛化,不是 MS² in-domain training。

MetricReleasedTartan finetuned变化
AbsRel ↓0.3290400.170187−48.28%
SqRel ↓3.1921841.263131−60.43%
RMSE ↓8.2105 m6.0687 m−26.09%
RMSE log ↓0.3040230.253502−16.62%
SILog ↓15.754922.9747+45.83%
δ1 ↑0.4480720.724039+27.60 pp
δ2 ↑0.8416740.930063+8.84 pp
δ3 ↑0.9747660.971856−0.29 pp
Prediction coverage ↑100%100%不变

MS² fixed Day-100;3,691,593 evaluated pixels;独立 sparse LiDAR coverage 22.53%。绝对尺度改善明显,但 SILog 表明局部相对结构不稳定。

MS² target / metricReleasedTartan-trainedMS² in-domain trained
Dense AbsRel ↓0.36250.22460.09548
Dense RMSE ↓10.0218.9404.785
Dense δ1 ↑0.4550.6300.920
Sparse AbsRel ↓0.32900.17020.1124
Sparse RMSE ↓8.2116.0694.669
Sparse δ1 ↑0.4480.7240.883

MS² in-domain checkpoint 仅作为同 identity 上下文:它直接在 MS² Day dense teacher 上训练,因此不是与 Tartan-trained checkpoint 等价的数据协议。

修正后的定性结果

TartanRGBT Day5 thermal、FoundationStereo、released MoGe-3-L 与 finetuned MoGe-3-L 对比
固定 0–10 m turbo 色标。FoundationStereo 列保留投影孔洞;两种预测列展示模型完整 dense thermal-plane output,不再套 target mask。Finetuned 恢复了部分门洞和房间布局,但明显平滑。
MS² Day-100 thermal、dense teacher、sparse LiDAR 与模型深度对比
固定 0–50 m turbo 色标。Tartan-trained checkpoint 在 MS² 上修正大尺度距离,但物体边缘与局部结构仍比 teacher 平滑;这与更好的 AbsRel、较差的 SILog 同时成立。
关于上一版可视化 bug
旧图错误地用 target-valid mask 裁剪 released 与 finetuned prediction,使预测看起来也带有 projected target 的孔洞/轮廓。该错误只影响定性显示,不影响定量指标,因为指标本来就应该在 target-valid support 上计算。当前报告使用修复后的 native-plane run。

研究判断与下一步

已经成立

  • Tartan finetuning 显著恢复 metric scale:Day5 AbsRel 降低 50.85%。
  • 效果能跨数据集迁移到 MS²:Sparse LiDAR AbsRel 降低 48.28%。
  • 训练/验证/test trajectory 完全隔离,epoch-4 checkpoint 未读取 Day5。

尚未解决

  • 边界没有改善:Tartan Edge F1 反而降低 23.81%。
  • MS² SILog 恶化,说明绝对尺度改善不等于局部 shape 更可靠。
  • 当前 loss 没有 normal、edge 或 dense-completion 约束。
不建议:直接从 epoch-8 权重按原 LR/loss 继续训练。
建议:从 epoch-4 best 开一个新、预注册的诊断 run:更低 head/refiner LR、backbone 冻结更久,并加入 boundary/support-aware 目标;另做一次关闭 early stopping 跑满 15 epochs 的“是否回升”对照。后者是诊断收敛假设,不应覆盖当前 best checkpoint。

复现与 provenance

Training run20260829-134335_tartanrgbt-moge3l-ddp4-full
Training commit2bb3e2ee9e150c95cf36c7a6aaee57abae0a1e11
Selected checkpointepoch 4 / step 1,432 / SHA256 a2e4b95f…c271
Evaluation run20260830-025126_tartanrgbt-native-plane-eval
Evaluation commitd1aa358c31e5766110c6fd7d3bc70c45c6190340
Evaluation runtime247.62 s;one H20;peak 8.57 GiB allocated
Released checkpoint SHA2569b41b7b9…7925
Manifest SHA25630ab772f…8151
Environmentthermometric Conda;PyTorch 2.13.0+cu130;driver 580.105.08
SelectionDay4 validation AbsRel only;test_metrics_seen=false
Evidence boundary
TartanRGBT target 是 FoundationStereo 派生 pseudo-depth,并非独立 sensor ground truth;因此 Day5 数字证明的是对该 stereo target 的拟合与泛化。MS² sparse LiDAR 提供独立、但稀疏的跨数据集几何证据。所有主指标均不做 test-time scale/shift/median alignment。