{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 292, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 7.594140625, "epoch": 0.03432003432003432, "grad_norm": 86.33226300367427, "kl": 6.39765625, "learning_rate": 1.5e-07, "logits/chosen": -107184128.0, "logits/rejected": -105178726.4, "logps/chosen": -9729.8, "logps/rejected": -10091.2, "loss": 0.4985076904296875, "num_tokens": 1000098.0, "rewards/chosen": -0.04769744873046875, "rewards/margins": 0.019524288177490235, "rewards/rejected": -0.06722173690795899, "step": 10 }, { "entropy": 7.608984375, "epoch": 0.06864006864006864, "grad_norm": 127.51161758392736, "kl": 9.834375, "learning_rate": 3.166666666666666e-07, "logits/chosen": -111175270.4, "logits/rejected": -110572339.2, "logps/chosen": -10525.6, "logps/rejected": -10866.0, "loss": 0.5047119140625, "num_tokens": 2059302.0, "rewards/chosen": -0.09103813171386718, "rewards/margins": -0.06356315612792969, "rewards/rejected": -0.0274749755859375, "step": 20 }, { "entropy": 7.582421875, "epoch": 0.10296010296010295, "grad_norm": 92.88485309688424, "kl": 0.2046875, "learning_rate": 4.833333333333333e-07, "logits/chosen": -106351820.8, "logits/rejected": -105293414.4, "logps/chosen": -10041.6, "logps/rejected": -10261.0, "loss": 0.49964599609375, "num_tokens": 3087752.0, "rewards/chosen": -0.5374847412109375, "rewards/margins": 0.03810577392578125, "rewards/rejected": -0.5755905151367188, "step": 30 }, { "entropy": 7.533984375, "epoch": 0.13728013728013727, "grad_norm": 61.54426686277499, "kl": 0.0, "learning_rate": 4.985456442051682e-07, "logits/chosen": -99627827.2, "logits/rejected": -95980748.8, "logps/chosen": -9881.0, "logps/rejected": -10339.0, "loss": 0.5043426513671875, "num_tokens": 4100561.0, "rewards/chosen": -1.321875, "rewards/margins": 0.0261962890625, "rewards/rejected": -1.3480712890625, "step": 40 }, { "entropy": 7.523828125, "epoch": 0.1716001716001716, "grad_norm": 122.84522486033784, "kl": 0.09375, "learning_rate": 4.935399618791793e-07, "logits/chosen": -98726707.2, "logits/rejected": -96527974.4, "logps/chosen": -9919.9, "logps/rejected": -10279.2, "loss": 0.4984130859375, "num_tokens": 5111368.0, "rewards/chosen": -1.801904296875, "rewards/margins": 0.1624755859375, "rewards/rejected": -1.9643798828125, "step": 50 }, { "entropy": 7.54296875, "epoch": 0.2059202059202059, "grad_norm": 75.96355510905495, "kl": 3.9984375, "learning_rate": 4.850368660819092e-07, "logits/chosen": -106171596.8, "logits/rejected": -105942220.8, "logps/chosen": -10453.6, "logps/rejected": -10825.2, "loss": 0.495751953125, "num_tokens": 6159442.0, "rewards/chosen": -0.5387272834777832, "rewards/margins": 0.12462263107299805, "rewards/rejected": -0.6633499145507813, "step": 60 }, { "entropy": 7.62265625, "epoch": 0.24024024024024024, "grad_norm": 109.08719788934083, "kl": 37.352734375, "learning_rate": 4.731584675403184e-07, "logits/chosen": -113573888.0, "logits/rejected": -110988492.8, "logps/chosen": -9306.4, "logps/rejected": -9616.2, "loss": 0.5021636962890625, "num_tokens": 7148746.0, "rewards/chosen": 0.21960601806640626, "rewards/margins": 0.003122711181640625, "rewards/rejected": 0.21648330688476564, "step": 70 }, { "entropy": 7.659765625, "epoch": 0.27456027456027454, "grad_norm": 58.939359796249065, "kl": 171.0875, "learning_rate": 4.5807534881817183e-07, "logits/chosen": -114412748.8, "logits/rejected": -113252761.6, "logps/chosen": -9437.6, "logps/rejected": -9837.6, "loss": 0.4959259033203125, "num_tokens": 8139737.0, "rewards/chosen": 1.7338134765625, "rewards/margins": 0.0449676513671875, "rewards/rejected": 1.6888458251953125, "step": 80 }, { "entropy": 7.712109375, "epoch": 0.3088803088803089, "grad_norm": 83.72781850857909, "kl": 330.3125, "learning_rate": 4.400041146246136e-07, "logits/chosen": -129309081.6, "logits/rejected": -125432627.2, "logps/chosen": -9531.0, "logps/rejected": -10017.2, "loss": 0.50328369140625, "num_tokens": 9171482.0, "rewards/chosen": 3.218115234375, "rewards/margins": -0.171630859375, "rewards/rejected": 3.38974609375, "step": 90 }, { "entropy": 7.815625, "epoch": 0.3432003432003432, "grad_norm": 61.619761951920744, "kl": 569.35, "learning_rate": 4.1920428121079e-07, "logits/chosen": -142609612.8, "logits/rejected": -140650086.4, "logps/chosen": -9252.6, "logps/rejected": -9623.2, "loss": 0.5056427001953125, "num_tokens": 10204959.0, "rewards/chosen": 5.598828125, "rewards/margins": -0.18271484375, "rewards/rejected": 5.78154296875, "step": 100 }, { "entropy": 7.884765625, "epoch": 0.37752037752037754, "grad_norm": 45.03461918952044, "kl": 831.45, "learning_rate": 3.959745495250818e-07, "logits/chosen": -151001497.6, "logits/rejected": -147940966.4, "logps/chosen": -8605.2, "logps/rejected": -9020.0, "loss": 0.50517578125, "num_tokens": 11188498.0, "rewards/chosen": 8.1416015625, "rewards/margins": -0.340234375, "rewards/rejected": 8.4818359375, "step": 110 }, { "entropy": 7.975390625, "epoch": 0.4118404118404118, "grad_norm": 36.350000413332154, "kl": 1201.625, "learning_rate": 3.7064851564718353e-07, "logits/chosen": -181908275.2, "logits/rejected": -178755993.6, "logps/chosen": -8662.0, "logps/rejected": -8825.2, "loss": 0.496246337890625, "num_tokens": 12220511.0, "rewards/chosen": 12.016015625, "rewards/margins": -0.000390625, "rewards/rejected": 12.01640625, "step": 120 }, { "entropy": 7.977734375, "epoch": 0.44616044616044614, "grad_norm": 31.597257913649155, "kl": 1435.55, "learning_rate": 3.4358988010236103e-07, "logits/chosen": -203227136.0, "logits/rejected": -201883648.0, "logps/chosen": -8452.6, "logps/rejected": -8621.8, "loss": 0.4972412109375, "num_tokens": 13250325.0, "rewards/chosen": 14.191796875, "rewards/margins": -0.3341796875, "rewards/rejected": 14.5259765625, "step": 130 }, { "entropy": 7.975390625, "epoch": 0.4804804804804805, "grad_norm": 21.621622249090635, "kl": 1731.0, "learning_rate": 3.1518722485366754e-07, "logits/chosen": -222298112.0, "logits/rejected": -219827404.8, "logps/chosen": -8690.0, "logps/rejected": -8949.2, "loss": 0.50311279296875, "num_tokens": 14326309.0, "rewards/chosen": 16.971484375, "rewards/margins": -0.696484375, "rewards/rejected": 17.66796875, "step": 140 }, { "entropy": 7.954296875, "epoch": 0.5148005148005148, "grad_norm": 21.811975809486956, "kl": 1867.15, "learning_rate": 2.8584843297836277e-07, "logits/chosen": -228825497.6, "logits/rejected": -228071833.6, "logps/chosen": -7983.8, "logps/rejected": -8123.0, "loss": 0.4952362060546875, "num_tokens": 15346427.0, "rewards/chosen": 18.575390625, "rewards/margins": -0.193359375, "rewards/rejected": 18.76875, "step": 150 }, { "entropy": 7.976953125, "epoch": 0.5491205491205491, "grad_norm": 33.183727711509015, "kl": 1883.8, "learning_rate": 2.5599483116609544e-07, "logits/chosen": -228923801.6, "logits/rejected": -224670515.2, "logps/chosen": -8062.4, "logps/rejected": -8387.2, "loss": 0.5054046630859375, "num_tokens": 16366642.0, "rewards/chosen": 18.32421875, "rewards/margins": -1.030078125, "rewards/rejected": 19.354296875, "step": 160 }, { "entropy": 8.000390625, "epoch": 0.5834405834405835, "grad_norm": 12.850165739096068, "kl": 1952.45, "learning_rate": 2.2605513915689874e-07, "logits/chosen": -230529433.6, "logits/rejected": -228432281.6, "logps/chosen": -7903.6, "logps/rejected": -8130.6, "loss": 0.50506591796875, "num_tokens": 17380939.0, "rewards/chosen": 19.238671875, "rewards/margins": -0.577734375, "rewards/rejected": 19.81640625, "step": 170 }, { "entropy": 7.98984375, "epoch": 0.6177606177606177, "grad_norm": 9.466663342172486, "kl": 2113.5, "learning_rate": 1.9645931300952795e-07, "logits/chosen": -245137408.0, "logits/rejected": -241355980.8, "logps/chosen": -7811.6, "logps/rejected": -8251.0, "loss": 0.5172149658203125, "num_tokens": 18421034.0, "rewards/chosen": 20.554296875, "rewards/margins": -1.14609375, "rewards/rejected": 21.700390625, "step": 180 }, { "entropy": 7.917578125, "epoch": 0.6520806520806521, "grad_norm": 8.76687486946907, "kl": 2130.25, "learning_rate": 1.6763237061535008e-07, "logits/chosen": -243918438.4, "logits/rejected": -240589209.6, "logps/chosen": -7463.2, "logps/rejected": -7685.8, "loss": 0.500433349609375, "num_tokens": 19430090.0, "rewards/chosen": 20.763671875, "rewards/margins": -1.073828125, "rewards/rejected": 21.8375, "step": 190 }, { "entropy": 7.755078125, "epoch": 0.6864006864006864, "grad_norm": 11.01172644517593, "kl": 2340.1, "learning_rate": 1.3998828812795932e-07, "logits/chosen": -260092723.2, "logits/rejected": -258008678.4, "logps/chosen": -7685.4, "logps/rejected": -7937.2, "loss": 0.5029571533203125, "num_tokens": 20459910.0, "rewards/chosen": 22.9265625, "rewards/margins": -0.95234375, "rewards/rejected": 23.87890625, "step": 200 }, { "entropy": 7.675390625, "epoch": 0.7207207207207207, "grad_norm": 30.85091198701311, "kl": 2452.7, "learning_rate": 1.1392405496029076e-07, "logits/chosen": -270807859.2, "logits/rejected": -269208780.8, "logps/chosen": -7861.9, "logps/rejected": -8111.2, "loss": 0.5022857666015625, "num_tokens": 21493036.0, "rewards/chosen": 23.9083984375, "rewards/margins": -1.2330078125, "rewards/rejected": 25.14140625, "step": 210 }, { "entropy": 7.585546875, "epoch": 0.7550407550407551, "grad_norm": 15.36265057914587, "kl": 2365.5, "learning_rate": 8.981397272385738e-08, "logits/chosen": -266141696.0, "logits/rejected": -263979008.0, "logps/chosen": -7420.0, "logps/rejected": -7809.0, "loss": 0.510125732421875, "num_tokens": 22497542.0, "rewards/chosen": 23.06484375, "rewards/margins": -1.197265625, "rewards/rejected": 24.262109375, "step": 220 }, { "entropy": 7.594140625, "epoch": 0.7893607893607893, "grad_norm": 6.546387154998616, "kl": 2397.8, "learning_rate": 6.800427998154968e-08, "logits/chosen": -275847577.6, "logits/rejected": -274078105.6, "logps/chosen": -7580.4, "logps/rejected": -7842.4, "loss": 0.4974273681640625, "num_tokens": 23534012.0, "rewards/chosen": 23.476953125, "rewards/margins": -0.99921875, "rewards/rejected": 24.476171875, "step": 230 }, { "entropy": 7.50078125, "epoch": 0.8236808236808236, "grad_norm": 24.903868525956547, "kl": 2610.4, "learning_rate": 4.8808180006509356e-08, "logits/chosen": -296511078.4, "logits/rejected": -293443993.6, "logps/chosen": -8122.0, "logps/rejected": -8423.6, "loss": 0.50238037109375, "num_tokens": 24628737.0, "rewards/chosen": 25.5359375, "rewards/margins": -1.14375, "rewards/rejected": 26.6796875, "step": 240 }, { "entropy": 7.55234375, "epoch": 0.858000858000858, "grad_norm": 15.268579913892744, "kl": 2629.2, "learning_rate": 3.250134295213053e-08, "logits/chosen": -288122470.4, "logits/rejected": -284799795.2, "logps/chosen": -7932.2, "logps/rejected": -8312.4, "loss": 0.5093109130859375, "num_tokens": 25690351.0, "rewards/chosen": 25.858984375, "rewards/margins": -0.870703125, "rewards/rejected": 26.7296875, "step": 250 }, { "entropy": 7.44453125, "epoch": 0.8923208923208923, "grad_norm": 15.110634441696666, "kl": 2613.15, "learning_rate": 1.9317947025340232e-08, "logits/chosen": -292644454.4, "logits/rejected": -290822553.6, "logps/chosen": -8003.2, "logps/rejected": -8455.0, "loss": 0.5151123046875, "num_tokens": 26763232.0, "rewards/chosen": 25.44453125, "rewards/margins": -1.375, "rewards/rejected": 26.81953125, "step": 260 }, { "entropy": 7.478515625, "epoch": 0.9266409266409267, "grad_norm": 13.312675942972383, "kl": 2433.15, "learning_rate": 9.447315514833353e-09, "logits/chosen": -276883046.4, "logits/rejected": -270277017.6, "logps/chosen": -7410.8, "logps/rejected": -7717.0, "loss": 0.5004669189453125, "num_tokens": 27765238.0, "rewards/chosen": 23.782421875, "rewards/margins": -1.104296875, "rewards/rejected": 24.88671875, "step": 270 }, { "entropy": 7.510546875, "epoch": 0.960960960960961, "grad_norm": 10.274017437444142, "kl": 2346.1, "learning_rate": 3.0311979690147426e-09, "logits/chosen": -259797811.2, "logits/rejected": -256979763.2, "logps/chosen": -7306.8, "logps/rejected": -7390.2, "loss": 0.500830078125, "num_tokens": 28731039.0, "rewards/chosen": 23.248828125, "rewards/margins": -0.418359375, "rewards/rejected": 23.6671875, "step": 280 }, { "entropy": 7.46171875, "epoch": 0.9952809952809952, "grad_norm": 6.810163426768989, "kl": 2498.55, "learning_rate": 1.6173456793908135e-10, "logits/chosen": -279746969.6, "logits/rejected": -278174105.6, "logps/chosen": -7759.2, "logps/rejected": -7908.0, "loss": 0.5092376708984375, "num_tokens": 29763064.0, "rewards/chosen": 24.6875, "rewards/margins": -0.61796875, "rewards/rejected": 25.30546875, "step": 290 }, { "epoch": 1.0, "eval_entropy": 7.5152138157894735, "eval_kl": 2432.842105263158, "eval_logits/chosen": -280314718.31578946, "eval_logits/rejected": -277313859.3684211, "eval_logps/chosen": -7510.631578947368, "eval_logps/rejected": -7763.578947368421, "eval_loss": 0.5068327188491821, "eval_num_tokens": 29885865.0, "eval_rewards/chosen": 24.02014802631579, "eval_rewards/margins": -0.6217105263157895, "eval_rewards/rejected": 24.64185855263158, "eval_runtime": 43.731, "eval_samples_per_second": 27.623, "eval_steps_per_second": 1.738, "step": 292 } ], "logging_steps": 10, "max_steps": 292, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 7245703888896.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }