{ "model": "Qwen/Qwen3-0.6B", "trainer": "async-grpo", "experiment": "first-command", "env_url": "http://ip-26-0-168-52.ec2.internal:8000", "vllm_server_url": "http://ip-26-0-168-95.ec2.internal:8000", "hub_model_id": "burtenshaw/terminus-pi-trl-async-grpo", "trackio_project": "terminus-pi-trl", "report_to": "trackio", "push_to_hub": true, "run_name": "terminus-async-grpo-22179048", "max_inflight_tasks": 2, "output_dir": "/fsx/benjamin_burtenshaw/OpenEnv-codex-terminus-pi-trl-space/examples/end_to_end/tbench2_pi_trl/logs/output-22179048", "train_result": { "train_runtime": 189.2986, "train_samples_per_second": 0.127, "train_steps_per_second": 0.063, "total_flos": 69970898190336.0, "train_loss": 0.0, "epoch": 1.0 }, "log_history": [ { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 5.833333333333334e-07, "ratio": 0.9964810609817505, "kl": 7.434934377670288e-05, "entropy": 0.033603236079216, "clip_ratio": 0.0, "reward": 1.0, "reward_std": 0.0, "rewards/terminus_reward": 1.0, "tools/call_frequency": 4.0, "tools/failure_frequency": 0.0, "generation_tok_per_s": 60.3897705078125, "scoring_time_ms": 117.16629791259766, "wait_scoring_ms": 68.45825958251953, "buffer_qsize": 6.0, "queue_wait_time_s": 4.076957702636719e-05, "completions/mean_length": 55.0, "training_tok/s": 6.806692854321114, "forward_time_s": 0.07218480110168457, "train_seq_len": 1104.0, "weight_sync_time_s": 0.13250494003295898, "epoch": 0.5, "step": 6 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 5e-07, "ratio": 0.9964810609817505, "kl": 7.434934377670288e-05, "entropy": 0.033603236079216, "clip_ratio": 0.0, "reward": 1.0, "reward_std": 0.0, "rewards/terminus_reward": 1.0, "tools/call_frequency": 4.0, "tools/failure_frequency": 0.0, "generation_tok_per_s": 63.50257110595703, "scoring_time_ms": 112.0641860961914, "wait_scoring_ms": 65.2970199584961, "buffer_qsize": 8.0, "queue_wait_time_s": 4.649162292480469e-05, "completions/mean_length": 55.0, "training_tok/s": 7.36189168170205, "forward_time_s": 0.0719459056854248, "train_seq_len": 1104.0, "weight_sync_time_s": 0.13101506233215332, "epoch": 0.5833333333333334, "step": 7 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 4.1666666666666667e-07, "ratio": 0.9969766139984131, "kl": 6.689117435598746e-05, "entropy": 0.03523017838597298, "clip_ratio": 0.0, "reward": 1.0, "reward_std": 0.0, "rewards/terminus_reward": 1.0, "tools/call_frequency": 4.0, "tools/failure_frequency": 0.0, "generation_tok_per_s": 74.39502716064453, "scoring_time_ms": 69.75615692138672, "wait_scoring_ms": 69.68431854248047, "buffer_qsize": 30.0, "queue_wait_time_s": 1.728534698486328e-05, "completions/mean_length": 54.0, "training_tok/s": 7.294061649219052, "forward_time_s": 0.06849026679992676, "train_seq_len": 1102.0, "weight_sync_time_s": 0.14867115020751953, "epoch": 0.6666666666666666, "step": 8 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 3.333333333333333e-07, "ratio": 0.9962551593780518, "kl": 9.892778325593099e-05, "entropy": 0.046233903616666794, "clip_ratio": 0.0, "reward": 1.0, "reward_std": 0.0, "rewards/terminus_reward": 1.0, "tools/call_frequency": 4.0, "tools/failure_frequency": 0.0, "generation_tok_per_s": 75.64350891113281, "scoring_time_ms": 209.5857391357422, "wait_scoring_ms": 63.70707702636719, "buffer_qsize": 52.0, "queue_wait_time_s": 1.7404556274414062e-05, "completions/mean_length": 54.5, "training_tok/s": 7.281059343739894, "forward_time_s": 0.07220792770385742, "train_seq_len": 1103.0, "weight_sync_time_s": 0.13945603370666504, "epoch": 0.75, "step": 9 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 2.5e-07, "ratio": 0.9962551593780518, "kl": 9.892778325593099e-05, "entropy": 0.046233903616666794, "clip_ratio": 0.0, "reward": 1.0, "reward_std": 0.0, "rewards/terminus_reward": 1.0, "tools/call_frequency": 4.0, "tools/failure_frequency": 0.0, "generation_tok_per_s": 76.56906127929688, "scoring_time_ms": 236.5457305908203, "wait_scoring_ms": 75.78178405761719, "buffer_qsize": 72.0, "queue_wait_time_s": 2.372264862060547e-05, "completions/mean_length": 54.5, "training_tok/s": 7.482828130727307, "forward_time_s": 0.07097864151000977, "train_seq_len": 1103.0, "weight_sync_time_s": 0.13311219215393066, "epoch": 0.8333333333333334, "step": 10 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 1.6666666666666665e-07, "ratio": 0.9964330792427063, "kl": 7.718314009252936e-05, "entropy": 0.033603236079216, "clip_ratio": 0.0, "reward": 1.0, "reward_std": 0.0, "rewards/terminus_reward": 1.0, "tools/call_frequency": 4.0, "tools/failure_frequency": 0.0, "generation_tok_per_s": 77.19235229492188, "scoring_time_ms": 125.87603759765625, "wait_scoring_ms": 60.385467529296875, "buffer_qsize": 90.0, "queue_wait_time_s": 2.276897430419922e-05, "completions/mean_length": 55.0, "training_tok/s": 7.519044330838157, "forward_time_s": 0.07587862014770508, "train_seq_len": 1104.0, "weight_sync_time_s": 0.15876269340515137, "epoch": 0.9166666666666666, "step": 11 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 8.333333333333333e-08, "ratio": 0.9964810609817505, "kl": 7.434934377670288e-05, "entropy": 0.033603236079216, "clip_ratio": 0.0, "reward": 1.0, "reward_std": 0.0, "rewards/terminus_reward": 1.0, "tools/call_frequency": 4.0, "tools/failure_frequency": 0.0, "generation_tok_per_s": 77.44713592529297, "scoring_time_ms": 170.81890869140625, "wait_scoring_ms": 62.718727111816406, "buffer_qsize": 112.0, "queue_wait_time_s": 2.2172927856445312e-05, "completions/mean_length": 55.0, "training_tok/s": 7.1332620460814224, "forward_time_s": 0.07349634170532227, "train_seq_len": 1104.0, "weight_sync_time_s": 0.13324546813964844, "epoch": 1.0, "step": 12 }, { "train_runtime": 189.2986, "train_samples_per_second": 0.127, "train_steps_per_second": 0.063, "total_flos": 69970898190336.0, "train_loss": 0.0, "epoch": 1.0, "step": 12 } ] }