0d35646dc9
- actorForward: deterministic param, uses mean-only when PPOB_EVAL_ONLY=1 (eval was adding unit Gaussian noise to every action — unreliable scores) - warm_start.py: log_std initialized to -1.0 (std≈0.37) instead of copying snapshot values (were 2.27-4.68 → std 9-108, completely drowning signal) - training.env: LOG_STD_CEILING 0.0→-0.5 (cap exploration at std≈0.6)
19 lines
479 B
Bash
19 lines
479 B
Bash
# TRAINING_OPPONENT=Fire
|
|
TRAINING_ROUNDS=30000
|
|
PPOB_LOG_FILE=/home/davide/Projects/SirRoboGarage/tools/training_runner/logs/fire_training.jsonl
|
|
PPOB_LR=1e-4
|
|
PPOB_UPDATE_INTERVAL=10
|
|
PPOB_CLIP_EPSILON=0.2
|
|
PPOB_ENTROPY_COEFF=0.001
|
|
PPOB_VALUE_LOSS_COEFF=0.5
|
|
PPOB_MAX_GRAD_NORM=0.5
|
|
PPOB_GAMMA=0.99
|
|
PPOB_LAM=0.95
|
|
PPOB_EPOCHS=4
|
|
PPOB_MINI_BATCH_SIZE=64
|
|
PPOB_LOG_STD_FLOOR=-3.0
|
|
PPOB_LOG_STD_CEILING=-0.5
|
|
PPOB_INITIAL_LOG_STD=-0.5
|
|
|
|
# PPOB_EVAL_ONLY=1 → freeze training (pure evaluation)
|