Files
SirRoboGarage/tools/training_runner/training.env
T
SirStone ca3e3d2272 tune(PPO_Bot): logStd=-2.0 (std≈0.135), entropy=0, ceiling=-1.0
Stochastic eval at std≈0.37 was 0/10 vs Corners (deterministic: 10/10).
Warm-start policy is correct but brittle — any noise breaks it.
- log_std initialized to -2.0 (std≈0.135) for moderate exploration
- entropy_coeff=0.0 (no push toward exploration during fine-tuning)
- logStd ceiling=-1.0 (cap at std≈0.37)
2026-08-20 15:28:15 +02:00

19 lines
477 B
Bash

# TRAINING_OPPONENT=Fire
TRAINING_ROUNDS=30000
PPOB_LOG_FILE=/home/davide/Projects/SirRoboGarage/tools/training_runner/logs/fire_training.jsonl
PPOB_LR=1e-4
PPOB_UPDATE_INTERVAL=10
PPOB_CLIP_EPSILON=0.2
PPOB_ENTROPY_COEFF=0.0
PPOB_VALUE_LOSS_COEFF=0.5
PPOB_MAX_GRAD_NORM=0.5
PPOB_GAMMA=0.99
PPOB_LAM=0.95
PPOB_EPOCHS=4
PPOB_MINI_BATCH_SIZE=64
PPOB_LOG_STD_FLOOR=-3.0
PPOB_LOG_STD_CEILING=-1.0
PPOB_INITIAL_LOG_STD=-0.5
# PPOB_EVAL_ONLY=1 → freeze training (pure evaluation)