Files
terminus-pi-trl-async-grpo/summary.json

216 lines
6.8 KiB
JSON
Raw Normal View History

{
"model": "Qwen/Qwen3-0.6B",
"trainer": "async-grpo",
"experiment": "first-command",
"env_url": "http://ip-26-0-168-52.ec2.internal:8000",
"vllm_server_url": "http://ip-26-0-168-95.ec2.internal:8000",
"hub_model_id": "burtenshaw/terminus-pi-trl-async-grpo",
"trackio_project": "terminus-pi-trl",
"report_to": "trackio",
"push_to_hub": true,
"run_name": "terminus-async-grpo-22179048",
"max_inflight_tasks": 2,
"output_dir": "/fsx/benjamin_burtenshaw/OpenEnv-codex-terminus-pi-trl-space/examples/end_to_end/tbench2_pi_trl/logs/output-22179048",
"train_result": {
"train_runtime": 189.2986,
"train_samples_per_second": 0.127,
"train_steps_per_second": 0.063,
"total_flos": 69970898190336.0,
"train_loss": 0.0,
"epoch": 1.0
},
"log_history": [
{
"loss": 0.0,
"grad_norm": 0.0,
"learning_rate": 5.833333333333334e-07,
"ratio": 0.9964810609817505,
"kl": 7.434934377670288e-05,
"entropy": 0.033603236079216,
"clip_ratio": 0.0,
"reward": 1.0,
"reward_std": 0.0,
"rewards/terminus_reward": 1.0,
"tools/call_frequency": 4.0,
"tools/failure_frequency": 0.0,
"generation_tok_per_s": 60.3897705078125,
"scoring_time_ms": 117.16629791259766,
"wait_scoring_ms": 68.45825958251953,
"buffer_qsize": 6.0,
"queue_wait_time_s": 4.076957702636719e-05,
"completions/mean_length": 55.0,
"training_tok/s": 6.806692854321114,
"forward_time_s": 0.07218480110168457,
"train_seq_len": 1104.0,
"weight_sync_time_s": 0.13250494003295898,
"epoch": 0.5,
"step": 6
},
{
"loss": 0.0,
"grad_norm": 0.0,
"learning_rate": 5e-07,
"ratio": 0.9964810609817505,
"kl": 7.434934377670288e-05,
"entropy": 0.033603236079216,
"clip_ratio": 0.0,
"reward": 1.0,
"reward_std": 0.0,
"rewards/terminus_reward": 1.0,
"tools/call_frequency": 4.0,
"tools/failure_frequency": 0.0,
"generation_tok_per_s": 63.50257110595703,
"scoring_time_ms": 112.0641860961914,
"wait_scoring_ms": 65.2970199584961,
"buffer_qsize": 8.0,
"queue_wait_time_s": 4.649162292480469e-05,
"completions/mean_length": 55.0,
"training_tok/s": 7.36189168170205,
"forward_time_s": 0.0719459056854248,
"train_seq_len": 1104.0,
"weight_sync_time_s": 0.13101506233215332,
"epoch": 0.5833333333333334,
"step": 7
},
{
"loss": 0.0,
"grad_norm": 0.0,
"learning_rate": 4.1666666666666667e-07,
"ratio": 0.9969766139984131,
"kl": 6.689117435598746e-05,
"entropy": 0.03523017838597298,
"clip_ratio": 0.0,
"reward": 1.0,
"reward_std": 0.0,
"rewards/terminus_reward": 1.0,
"tools/call_frequency": 4.0,
"tools/failure_frequency": 0.0,
"generation_tok_per_s": 74.39502716064453,
"scoring_time_ms": 69.75615692138672,
"wait_scoring_ms": 69.68431854248047,
"buffer_qsize": 30.0,
"queue_wait_time_s": 1.728534698486328e-05,
"completions/mean_length": 54.0,
"training_tok/s": 7.294061649219052,
"forward_time_s": 0.06849026679992676,
"train_seq_len": 1102.0,
"weight_sync_time_s": 0.14867115020751953,
"epoch": 0.6666666666666666,
"step": 8
},
{
"loss": 0.0,
"grad_norm": 0.0,
"learning_rate": 3.333333333333333e-07,
"ratio": 0.9962551593780518,
"kl": 9.892778325593099e-05,
"entropy": 0.046233903616666794,
"clip_ratio": 0.0,
"reward": 1.0,
"reward_std": 0.0,
"rewards/terminus_reward": 1.0,
"tools/call_frequency": 4.0,
"tools/failure_frequency": 0.0,
"generation_tok_per_s": 75.64350891113281,
"scoring_time_ms": 209.5857391357422,
"wait_scoring_ms": 63.70707702636719,
"buffer_qsize": 52.0,
"queue_wait_time_s": 1.7404556274414062e-05,
"completions/mean_length": 54.5,
"training_tok/s": 7.281059343739894,
"forward_time_s": 0.07220792770385742,
"train_seq_len": 1103.0,
"weight_sync_time_s": 0.13945603370666504,
"epoch": 0.75,
"step": 9
},
{
"loss": 0.0,
"grad_norm": 0.0,
"learning_rate": 2.5e-07,
"ratio": 0.9962551593780518,
"kl": 9.892778325593099e-05,
"entropy": 0.046233903616666794,
"clip_ratio": 0.0,
"reward": 1.0,
"reward_std": 0.0,
"rewards/terminus_reward": 1.0,
"tools/call_frequency": 4.0,
"tools/failure_frequency": 0.0,
"generation_tok_per_s": 76.56906127929688,
"scoring_time_ms": 236.5457305908203,
"wait_scoring_ms": 75.78178405761719,
"buffer_qsize": 72.0,
"queue_wait_time_s": 2.372264862060547e-05,
"completions/mean_length": 54.5,
"training_tok/s": 7.482828130727307,
"forward_time_s": 0.07097864151000977,
"train_seq_len": 1103.0,
"weight_sync_time_s": 0.13311219215393066,
"epoch": 0.8333333333333334,
"step": 10
},
{
"loss": 0.0,
"grad_norm": 0.0,
"learning_rate": 1.6666666666666665e-07,
"ratio": 0.9964330792427063,
"kl": 7.718314009252936e-05,
"entropy": 0.033603236079216,
"clip_ratio": 0.0,
"reward": 1.0,
"reward_std": 0.0,
"rewards/terminus_reward": 1.0,
"tools/call_frequency": 4.0,
"tools/failure_frequency": 0.0,
"generation_tok_per_s": 77.19235229492188,
"scoring_time_ms": 125.87603759765625,
"wait_scoring_ms": 60.385467529296875,
"buffer_qsize": 90.0,
"queue_wait_time_s": 2.276897430419922e-05,
"completions/mean_length": 55.0,
"training_tok/s": 7.519044330838157,
"forward_time_s": 0.07587862014770508,
"train_seq_len": 1104.0,
"weight_sync_time_s": 0.15876269340515137,
"epoch": 0.9166666666666666,
"step": 11
},
{
"loss": 0.0,
"grad_norm": 0.0,
"learning_rate": 8.333333333333333e-08,
"ratio": 0.9964810609817505,
"kl": 7.434934377670288e-05,
"entropy": 0.033603236079216,
"clip_ratio": 0.0,
"reward": 1.0,
"reward_std": 0.0,
"rewards/terminus_reward": 1.0,
"tools/call_frequency": 4.0,
"tools/failure_frequency": 0.0,
"generation_tok_per_s": 77.44713592529297,
"scoring_time_ms": 170.81890869140625,
"wait_scoring_ms": 62.718727111816406,
"buffer_qsize": 112.0,
"queue_wait_time_s": 2.2172927856445312e-05,
"completions/mean_length": 55.0,
"training_tok/s": 7.1332620460814224,
"forward_time_s": 0.07349634170532227,
"train_seq_len": 1104.0,
"weight_sync_time_s": 0.13324546813964844,
"epoch": 1.0,
"step": 12
},
{
"train_runtime": 189.2986,
"train_samples_per_second": 0.127,
"train_steps_per_second": 0.063,
"total_flos": 69970898190336.0,
"train_loss": 0.0,
"epoch": 1.0,
"step": 12
}
]
}