{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.6394884092725819, "eval_steps": 500, "global_step": 100, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0639488409272582, "grad_norm": 34.1801643371582, "learning_rate": 2.8125e-07, "logits/chosen": -3.5118160247802734, "logits/rejected": -5.780074596405029, "logps/chosen": -185.06735229492188, "logps/rejected": -44.872135162353516, "loss": 0.6948, "rewards/accuracies": 0.3812499940395355, "rewards/chosen": -0.00896346103399992, "rewards/margins": -0.0022051387932151556, "rewards/rejected": -0.006758322007954121, "step": 10 }, { "epoch": 0.1278976818545164, "grad_norm": 31.33914566040039, "learning_rate": 4.893617021276595e-07, "logits/chosen": -3.459812641143799, "logits/rejected": -5.795159816741943, "logps/chosen": -184.6004180908203, "logps/rejected": -45.62327575683594, "loss": 0.6527, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 0.012581730261445045, "rewards/margins": 0.08460129797458649, "rewards/rejected": -0.072019562125206, "step": 20 }, { "epoch": 0.19184652278177458, "grad_norm": 25.785869598388672, "learning_rate": 4.5390070921985813e-07, "logits/chosen": -3.524862289428711, "logits/rejected": -5.835035800933838, "logps/chosen": -185.87277221679688, "logps/rejected": -48.05480194091797, "loss": 0.5261, "rewards/accuracies": 1.0, "rewards/chosen": 0.04550371319055557, "rewards/margins": 0.37238603830337524, "rewards/rejected": -0.32688233256340027, "step": 30 }, { "epoch": 0.2557953637090328, "grad_norm": 17.68821144104004, "learning_rate": 4.184397163120567e-07, "logits/chosen": -3.496417999267578, "logits/rejected": -5.88121223449707, "logps/chosen": -182.35060119628906, "logps/rejected": -51.58687210083008, "loss": 0.3762, "rewards/accuracies": 1.0, "rewards/chosen": 0.11964114010334015, "rewards/margins": 0.7925335168838501, "rewards/rejected": -0.6728923320770264, "step": 40 }, { "epoch": 0.31974420463629094, "grad_norm": 13.102643966674805, "learning_rate": 3.829787234042553e-07, "logits/chosen": -3.518444776535034, "logits/rejected": -5.8981804847717285, "logps/chosen": -182.53024291992188, "logps/rejected": -55.42652130126953, "loss": 0.2457, "rewards/accuracies": 1.0, "rewards/chosen": 0.2259349524974823, "rewards/margins": 1.2894086837768555, "rewards/rejected": -1.0634738206863403, "step": 50 }, { "epoch": 0.38369304556354916, "grad_norm": 7.4990034103393555, "learning_rate": 3.475177304964539e-07, "logits/chosen": -3.5364508628845215, "logits/rejected": -5.861163139343262, "logps/chosen": -182.3606719970703, "logps/rejected": -59.04890823364258, "loss": 0.1486, "rewards/accuracies": 1.0, "rewards/chosen": 0.42806726694107056, "rewards/margins": 1.8459545373916626, "rewards/rejected": -1.4178870916366577, "step": 60 }, { "epoch": 0.44764188649080733, "grad_norm": 4.712187767028809, "learning_rate": 3.1205673758865245e-07, "logits/chosen": -3.4948315620422363, "logits/rejected": -5.790167331695557, "logps/chosen": -179.1177215576172, "logps/rejected": -62.539405822753906, "loss": 0.086, "rewards/accuracies": 1.0, "rewards/chosen": 0.6628400683403015, "rewards/margins": 2.428367853164673, "rewards/rejected": -1.7655279636383057, "step": 70 }, { "epoch": 0.5115907274180655, "grad_norm": 2.8228342533111572, "learning_rate": 2.7659574468085106e-07, "logits/chosen": -3.5341973304748535, "logits/rejected": -5.6943488121032715, "logps/chosen": -176.5838165283203, "logps/rejected": -65.91018676757812, "loss": 0.0486, "rewards/accuracies": 1.0, "rewards/chosen": 0.9148324728012085, "rewards/margins": 3.0173087120056152, "rewards/rejected": -2.1024765968322754, "step": 80 }, { "epoch": 0.5755395683453237, "grad_norm": 1.7507271766662598, "learning_rate": 2.411347517730496e-07, "logits/chosen": -3.482938289642334, "logits/rejected": -5.569075584411621, "logps/chosen": -171.7285919189453, "logps/rejected": -69.48970031738281, "loss": 0.0275, "rewards/accuracies": 1.0, "rewards/chosen": 1.1483333110809326, "rewards/margins": 3.605067014694214, "rewards/rejected": -2.456733465194702, "step": 90 }, { "epoch": 0.6394884092725819, "grad_norm": 1.236215353012085, "learning_rate": 2.0567375886524822e-07, "logits/chosen": -3.5123608112335205, "logits/rejected": -5.456024646759033, "logps/chosen": -171.9407958984375, "logps/rejected": -73.64480590820312, "loss": 0.0153, "rewards/accuracies": 1.0, "rewards/chosen": 1.32476007938385, "rewards/margins": 4.2044148445129395, "rewards/rejected": -2.8796544075012207, "step": 100 } ], "logging_steps": 10, "max_steps": 157, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }