{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 50, "global_step": 63, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 2.555550271272659, "epoch": 0.08, "grad_norm": 175.83624267578125, "learning_rate": 2.8571428571428573e-06, "logits/chosen": 0.41239441768472307, "logits/rejected": 0.4313717963372231, "logps/chosen": -157.81461162567138, "logps/rejected": -150.4321650505066, "loss": 0.6844395637512207, "mean_token_accuracy": 0.45540447160601616, "num_tokens": 63280.0, "rewards/accuracies": 0.55, "rewards/chosen": 0.09316946864128113, "rewards/margins": 0.030635011196136475, "rewards/rejected": 0.06253445744514466, "step": 5 }, { "entropy": 2.584770825505257, "epoch": 0.16, "grad_norm": 275.8374938964844, "learning_rate": 4.984280524733107e-06, "logits/chosen": 0.23018057449154425, "logits/rejected": 0.4137123508420314, "logps/chosen": -160.37082138061524, "logps/rejected": -154.9328401565552, "loss": 0.848213005065918, "mean_token_accuracy": 0.4679958797991276, "num_tokens": 128751.0, "rewards/accuracies": 0.4625, "rewards/chosen": 0.06873167753219604, "rewards/margins": -0.08100449442863464, "rewards/rejected": 0.1497361719608307, "step": 10 }, { "entropy": 2.485997956991196, "epoch": 0.24, "grad_norm": 273.0233154296875, "learning_rate": 4.809698831278217e-06, "logits/chosen": 0.1816923364201413, "logits/rejected": 0.23945612540369207, "logps/chosen": -151.38499155044556, "logps/rejected": -163.4970989227295, "loss": 0.8470439910888672, "mean_token_accuracy": 0.4733552895486355, "num_tokens": 194142.0, "rewards/accuracies": 0.45, "rewards/chosen": -0.32968448400497435, "rewards/margins": 0.06030769646167755, "rewards/rejected": -0.3899921804666519, "step": 15 }, { "entropy": 2.5318914532661436, "epoch": 0.32, "grad_norm": 234.37681579589844, "learning_rate": 4.454578706170075e-06, "logits/chosen": 0.07677000825058375, "logits/rejected": 0.18887137972641857, "logps/chosen": -135.0070219039917, "logps/rejected": -135.28493957519532, "loss": 0.9311827659606934, "mean_token_accuracy": 0.4595716767013073, "num_tokens": 254871.0, "rewards/accuracies": 0.5375, "rewards/chosen": -0.7181475728750228, "rewards/margins": 0.2766463726758957, "rewards/rejected": -0.9947939455509186, "step": 20 }, { "entropy": 2.462447080016136, "epoch": 0.4, "grad_norm": 250.9570770263672, "learning_rate": 3.946678240449515e-06, "logits/chosen": 0.20993061968672994, "logits/rejected": 0.20386893310256043, "logps/chosen": -145.39961681365966, "logps/rejected": -137.4315857887268, "loss": 0.9580174446105957, "mean_token_accuracy": 0.45824490338563917, "num_tokens": 317752.0, "rewards/accuracies": 0.58125, "rewards/chosen": -0.7164888560771943, "rewards/margins": 0.16717674732208251, "rewards/rejected": -0.8836656033992767, "step": 25 }, { "entropy": 2.4387545943260194, "epoch": 0.48, "grad_norm": 316.4103088378906, "learning_rate": 3.3256976548879183e-06, "logits/chosen": 0.21743581064338796, "logits/rejected": 0.2765391890690152, "logps/chosen": -148.74287595748902, "logps/rejected": -147.26203107833862, "loss": 0.9910862922668457, "mean_token_accuracy": 0.4532994642853737, "num_tokens": 387452.0, "rewards/accuracies": 0.5125, "rewards/chosen": -0.2023364007472992, "rewards/margins": 0.1426894724369049, "rewards/rejected": -0.3450258731842041, "step": 30 }, { "entropy": 2.469076004624367, "epoch": 0.56, "grad_norm": 256.6429748535156, "learning_rate": 2.6401761180929798e-06, "logits/chosen": 0.18299585651420763, "logits/rejected": 0.250682400907656, "logps/chosen": -178.9021216392517, "logps/rejected": -171.8313166618347, "loss": 0.8882085800170898, "mean_token_accuracy": 0.47426797077059746, "num_tokens": 454873.0, "rewards/accuracies": 0.53125, "rewards/chosen": 0.1502027690410614, "rewards/margins": 0.38659809827804564, "rewards/rejected": -0.23639532923698425, "step": 35 }, { "entropy": 2.4749947816133497, "epoch": 0.64, "grad_norm": 248.1305694580078, "learning_rate": 1.9436976651092143e-06, "logits/chosen": 0.27816104129128527, "logits/rejected": 0.37676442462284854, "logps/chosen": -157.81686353683472, "logps/rejected": -158.98215370178224, "loss": 1.0146113395690919, "mean_token_accuracy": 0.465312571823597, "num_tokens": 518527.0, "rewards/accuracies": 0.55625, "rewards/chosen": 0.05624905824661255, "rewards/margins": 0.09228863418102265, "rewards/rejected": -0.036039575934410095, "step": 40 }, { "entropy": 2.409931382536888, "epoch": 0.72, "grad_norm": 219.939697265625, "learning_rate": 1.2907027822369006e-06, "logits/chosen": 0.2784307162908892, "logits/rejected": 0.3215469827251049, "logps/chosen": -153.8018159866333, "logps/rejected": -159.60495262145997, "loss": 0.921458625793457, "mean_token_accuracy": 0.4758016161620617, "num_tokens": 586496.0, "rewards/accuracies": 0.525, "rewards/chosen": 0.1898827075958252, "rewards/margins": 0.46674283146858214, "rewards/rejected": -0.27686012387275694, "step": 45 }, { "entropy": 2.4379068195819853, "epoch": 0.8, "grad_norm": 235.46241760253906, "learning_rate": 7.322330470336314e-07, "logits/chosen": 0.28584471002719647, "logits/rejected": 0.3651064125555795, "logps/chosen": -163.8307611465454, "logps/rejected": -163.46687126159668, "loss": 0.979340648651123, "mean_token_accuracy": 0.4653128065168858, "num_tokens": 659345.0, "rewards/accuracies": 0.5, "rewards/chosen": 0.16986804008483886, "rewards/margins": 0.1913771450519562, "rewards/rejected": -0.02150910496711731, "step": 50 }, { "epoch": 0.8, "eval_entropy": 2.5069966416358946, "eval_logits/chosen": 0.29315065189355716, "eval_logits/rejected": 0.348470281243937, "eval_logps/chosen": -161.13176106262208, "eval_logps/rejected": -153.30834275054931, "eval_loss": 0.9624814391136169, "eval_mean_token_accuracy": 0.4618878421783447, "eval_num_tokens": 659345.0, "eval_rewards/accuracies": 0.531, "eval_rewards/chosen": 0.1580237216949463, "eval_rewards/margins": 0.2344533715248108, "eval_rewards/rejected": -0.0764296498298645, "eval_runtime": 203.9137, "eval_samples_per_second": 4.904, "eval_steps_per_second": 1.226, "step": 50 }, { "entropy": 2.47237910926342, "epoch": 0.88, "grad_norm": 254.37533569335938, "learning_rate": 3.119414452281158e-07, "logits/chosen": 0.31621869752899623, "logits/rejected": 0.438719071421892, "logps/chosen": -148.24002447128296, "logps/rejected": -142.998854637146, "loss": 0.9957857131958008, "mean_token_accuracy": 0.47029968202114103, "num_tokens": 731475.0, "rewards/accuracies": 0.59375, "rewards/chosen": 0.2521739423274994, "rewards/margins": 0.1846893012523651, "rewards/rejected": 0.06748464107513427, "step": 55 }, { "entropy": 2.4306333363056183, "epoch": 0.96, "grad_norm": 226.28863525390625, "learning_rate": 6.268021954544095e-08, "logits/chosen": 0.27655188516120244, "logits/rejected": 0.40121284602477314, "logps/chosen": -156.78616828918456, "logps/rejected": -163.7671283721924, "loss": 0.8905390739440918, "mean_token_accuracy": 0.4723482772707939, "num_tokens": 797757.0, "rewards/accuracies": 0.5125, "rewards/chosen": 0.2607013940811157, "rewards/margins": 0.30302430391311647, "rewards/rejected": -0.04232290983200073, "step": 60 }, { "epoch": 1.0, "eval_entropy": 2.5108700938224793, "eval_logits/chosen": 0.2960853689074952, "eval_logits/rejected": 0.35102944673757674, "eval_logps/chosen": -161.2097156829834, "eval_logps/rejected": -153.38722127532958, "eval_loss": 0.9581051468849182, "eval_mean_token_accuracy": 0.4621651805639267, "eval_num_tokens": 829784.0, "eval_rewards/accuracies": 0.532, "eval_rewards/chosen": 0.11904637241363525, "eval_rewards/margins": 0.23491560649871826, "eval_rewards/rejected": -0.11586923408508301, "eval_runtime": 204.736, "eval_samples_per_second": 4.884, "eval_steps_per_second": 1.221, "step": 63 } ], "logging_steps": 5, "max_steps": 63, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3267470732328960.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }