论文标准实现
NavDP_VLN_Final/
├── habitat_train/
│ ├── train.py # 主训练脚本
│ ├── vln_env.py # Habitat环境
│ └── vision_encoder.py # 视觉编码器
│
├── models/
│ └── navdp_vln_clip.py # 完整模型
│
├── data/
│ ├── R2R_train.json
│ ├── R2R_val_seen.json
│ ├── R2R_val_unseen.json
│ └── mp3d/ # Matterport3D场景
│
├── checkpoints/ # 训练输出
├── logs/ # 训练日志
└── train.sh # 启动脚本
- Text Encoder: CLIP-ViT-B/32 (frozen, 63M参数)
- Policy: NavDP Diffusion (150M参数)
- Transformer: 8层, 8头, 384维
- RGBD Tokens: 128
- Environment: Habitat-Sim实时渲染
- Training: 8-GPU DDP
# 启动训练
bash train.sh
# 监控
tail -f logs/train.log- Epochs: 30
- Episodes/epoch: 500/GPU
- Learning Rate: 1e-4
- Scheduler: CosineAnnealing
- Optimizer: AdamW
- 预计时间: ~40小时