Skip to content

Latest commit

 

History

2 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 

Repository files navigation

NavDP-VLN: Vision-Language Navigation with CLIP and Diffusion Policy

论文标准实现

项目结构

NavDP_VLN_Final/
├── habitat_train/
│   ├── train.py              # 主训练脚本
│   ├── vln_env.py            # Habitat环境
│   └── vision_encoder.py     # 视觉编码器
│
├── models/
│   └── navdp_vln_clip.py     # 完整模型
│
├── data/
│   ├── R2R_train.json
│   ├── R2R_val_seen.json
│   ├── R2R_val_unseen.json
│   └── mp3d/                 # Matterport3D场景
│
├── checkpoints/              # 训练输出
├── logs/                     # 训练日志
└── train.sh                  # 启动脚本

配置

  • Text Encoder: CLIP-ViT-B/32 (frozen, 63M参数)
  • Policy: NavDP Diffusion (150M参数)
  • Transformer: 8层, 8头, 384维
  • RGBD Tokens: 128
  • Environment: Habitat-Sim实时渲染
  • Training: 8-GPU DDP

快速开始

# 启动训练
bash train.sh

# 监控
tail -f logs/train.log

训练参数

  • Epochs: 30
  • Episodes/epoch: 500/GPU
  • Learning Rate: 1e-4
  • Scheduler: CosineAnnealing
  • Optimizer: AdamW
  • 预计时间: ~40小时

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages