{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 100, "global_step": 63, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 2.308793434500694, "epoch": 0.963855421686747, "grad_norm": 1.8339245319366455, "learning_rate": 1.9000000000000002e-06, "logits/chosen": 0.41484330565815475, "logits/rejected": 0.5456838045995205, "logps/chosen": -49.526001167297366, "logps/rejected": -59.49296364784241, "loss": 0.6891121387481689, "mean_token_accuracy": 0.22993013681843877, "num_tokens": 37803.0, "rewards/accuracies": 0.759375, "rewards/chosen": 7.2634290063433585e-06, "rewards/margins": 0.008121937591931782, "rewards/rejected": -0.008114674211174133, "step": 20 }, { "entropy": 2.277806546114668, "epoch": 1.9156626506024095, "grad_norm": 2.0258429050445557, "learning_rate": 3.900000000000001e-06, "logits/chosen": 0.4389253231148894, "logits/rejected": 0.5264429102267841, "logps/chosen": -48.951683044433594, "logps/rejected": -61.126885426195365, "loss": 0.61369309425354, "mean_token_accuracy": 0.22803395109463342, "num_tokens": 74911.0, "rewards/accuracies": 1.0, "rewards/chosen": 0.004455907024219161, "rewards/margins": 0.17089249783113034, "rewards/rejected": -0.1664365911031071, "step": 40 }, { "entropy": 2.1899878133701374, "epoch": 2.8674698795180724, "grad_norm": 1.5958611965179443, "learning_rate": 5.9e-06, "logits/chosen": 0.36904452201936805, "logits/rejected": 0.4032783324493887, "logps/chosen": -48.9308927028994, "logps/rejected": -66.71900814394408, "loss": 0.40452375411987307, "mean_token_accuracy": 0.21395687834371493, "num_tokens": 112046.0, "rewards/accuracies": 1.0, "rewards/chosen": 0.009511558775188802, "rewards/margins": 0.7412423389621928, "rewards/rejected": -0.731730774988102, "step": 60 }, { "epoch": 3.0, "eval_entropy": 2.0709543228149414, "eval_logits/chosen": 0.3332947482681086, "eval_logits/rejected": 0.30760469286591857, "eval_logps/chosen": -49.526841735839845, "eval_logps/rejected": -74.71841888427734, "eval_loss": 0.23298563063144684, "eval_mean_token_accuracy": 0.1670339286327362, "eval_num_tokens": 117000.0, "eval_rewards/accuracies": 1.0, "eval_rewards/chosen": -0.007996635138988495, "eval_rewards/margins": 1.3904076099395752, "eval_rewards/rejected": -1.3984042167663575, "eval_runtime": 0.8652, "eval_samples_per_second": 20.803, "eval_steps_per_second": 5.779, "step": 63 } ], "logging_steps": 20, "max_steps": 63, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2301025416609792.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }