{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 292, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.034327397554172925, "grad_norm": 0.13235517649406559, "learning_rate": 1.5e-07, "logits/chosen": -1.796875, "logits/rejected": -1.7734375, "logps/chosen": -0.279296875, "logps/rejected": -0.287109375, "loss": 0.6910988092422485, "rewards/accuracies": 0.871874988079071, "rewards/chosen": 2.3506689071655273, "rewards/margins": 0.8857603073120117, "rewards/rejected": 1.4649085998535156, "step": 10 }, { "epoch": 0.06865479510834585, "grad_norm": 0.46053938490310314, "learning_rate": 3.166666666666666e-07, "logits/chosen": -1.71875, "logits/rejected": -1.6484375, "logps/chosen": -0.287109375, "logps/rejected": -0.30078125, "loss": 0.6888490915298462, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": 3.4280261993408203, "rewards/margins": 1.77581787109375, "rewards/rejected": 1.6522083282470703, "step": 20 }, { "epoch": 0.10298219266251878, "grad_norm": 0.5748589989414592, "learning_rate": 4.833333333333333e-07, "logits/chosen": -1.8359375, "logits/rejected": -1.7734375, "logps/chosen": -0.275390625, "logps/rejected": -0.291015625, "loss": 0.6906450986862183, "rewards/accuracies": 0.846875011920929, "rewards/chosen": 2.2481327056884766, "rewards/margins": 1.028005599975586, "rewards/rejected": 1.2201271057128906, "step": 30 }, { "epoch": 0.1373095902166917, "grad_norm": 0.2006004776289312, "learning_rate": 4.985456442051682e-07, "logits/chosen": -1.8515625, "logits/rejected": -1.8203125, "logps/chosen": -0.287109375, "logps/rejected": -0.3046875, "loss": 0.6906946897506714, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": 2.435636520385742, "rewards/margins": 1.0178546905517578, "rewards/rejected": 1.4177818298339844, "step": 40 }, { "epoch": 0.1716369877708646, "grad_norm": 0.18428774018840577, "learning_rate": 4.935399618791793e-07, "logits/chosen": -1.828125, "logits/rejected": -1.7890625, "logps/chosen": -0.28125, "logps/rejected": -0.30078125, "loss": 0.6899381875991821, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.6294727325439453, "rewards/margins": 1.3235273361206055, "rewards/rejected": 1.3059453964233398, "step": 50 }, { "epoch": 0.20596438532503755, "grad_norm": 0.18512484897108686, "learning_rate": 4.850368660819092e-07, "logits/chosen": -1.921875, "logits/rejected": -1.8125, "logps/chosen": -0.287109375, "logps/rejected": -0.314453125, "loss": 0.6910680532455444, "rewards/accuracies": 0.875, "rewards/chosen": 1.676849365234375, "rewards/margins": 0.8419876098632812, "rewards/rejected": 0.8348617553710938, "step": 60 }, { "epoch": 0.24029178287921046, "grad_norm": 1.1253206572256385, "learning_rate": 4.731584675403184e-07, "logits/chosen": -1.734375, "logits/rejected": -1.65625, "logps/chosen": -0.36328125, "logps/rejected": -0.419921875, "loss": 0.6878849267959595, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.3861775398254395, "rewards/margins": 2.1874728202819824, "rewards/rejected": 0.19870471954345703, "step": 70 }, { "epoch": 0.2746191804333834, "grad_norm": 0.26830425166650457, "learning_rate": 4.5807534881817183e-07, "logits/chosen": -1.9140625, "logits/rejected": -1.84375, "logps/chosen": -0.419921875, "logps/rejected": -0.396484375, "loss": 0.6916324496269226, "rewards/accuracies": 0.878125011920929, "rewards/chosen": 0.9153213500976562, "rewards/margins": 0.7323864102363586, "rewards/rejected": 0.18293499946594238, "step": 80 }, { "epoch": 0.3089465779875563, "grad_norm": 0.44824632017143134, "learning_rate": 4.400041146246136e-07, "logits/chosen": -1.8984375, "logits/rejected": -1.828125, "logps/chosen": -0.50390625, "logps/rejected": -0.58203125, "loss": 0.6880173683166504, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 0.8662147521972656, "rewards/margins": 2.2269763946533203, "rewards/rejected": -1.3607616424560547, "step": 90 }, { "epoch": 0.3432739755417292, "grad_norm": 0.1410533748955083, "learning_rate": 4.1920428121079e-07, "logits/chosen": -2.0, "logits/rejected": -1.9609375, "logps/chosen": -0.33984375, "logps/rejected": -0.64453125, "loss": 0.685782790184021, "rewards/accuracies": 0.871874988079071, "rewards/chosen": 1.1494998931884766, "rewards/margins": 3.4339561462402344, "rewards/rejected": -2.284456253051758, "step": 100 }, { "epoch": 0.3776013730959022, "grad_norm": 0.5379072097770938, "learning_rate": 3.959745495250818e-07, "logits/chosen": -2.15625, "logits/rejected": -2.09375, "logps/chosen": -0.54296875, "logps/rejected": -0.81640625, "loss": 0.6863765716552734, "rewards/accuracies": 0.903124988079071, "rewards/chosen": -0.4936180114746094, "rewards/margins": 3.31402587890625, "rewards/rejected": -3.8076438903808594, "step": 110 }, { "epoch": 0.4119287706500751, "grad_norm": 0.632156995264805, "learning_rate": 3.7064851564718353e-07, "logits/chosen": -2.125, "logits/rejected": -2.046875, "logps/chosen": -0.78515625, "logps/rejected": -1.2578125, "loss": 0.68132483959198, "rewards/accuracies": 0.8656250238418579, "rewards/chosen": -2.0970020294189453, "rewards/margins": 5.965912818908691, "rewards/rejected": -8.062914848327637, "step": 120 }, { "epoch": 0.446256168204248, "grad_norm": 0.29509039010906096, "learning_rate": 3.4358988010236103e-07, "logits/chosen": -2.171875, "logits/rejected": -2.125, "logps/chosen": -0.77734375, "logps/rejected": -0.76953125, "loss": 0.6925566792488098, "rewards/accuracies": 0.8531249761581421, "rewards/chosen": -2.3850326538085938, "rewards/margins": 1.1250333786010742, "rewards/rejected": -3.510066270828247, "step": 130 }, { "epoch": 0.4805835657584209, "grad_norm": 0.47331294084946895, "learning_rate": 3.1518722485366754e-07, "logits/chosen": -2.15625, "logits/rejected": -2.09375, "logps/chosen": -0.70703125, "logps/rejected": -1.0078125, "loss": 0.6853899359703064, "rewards/accuracies": 0.840624988079071, "rewards/chosen": -1.8102607727050781, "rewards/margins": 3.870941162109375, "rewards/rejected": -5.681201934814453, "step": 140 }, { "epoch": 0.5149109633125939, "grad_norm": 0.1721985746029916, "learning_rate": 2.8584843297836277e-07, "logits/chosen": -2.1875, "logits/rejected": -2.140625, "logps/chosen": -0.96875, "logps/rejected": -1.53125, "loss": 0.6819590926170349, "rewards/accuracies": 0.8531249761581421, "rewards/chosen": -4.2430419921875, "rewards/margins": 6.290306091308594, "rewards/rejected": -10.533348083496094, "step": 150 }, { "epoch": 0.5492383608667668, "grad_norm": 0.3995964568343347, "learning_rate": 2.5599483116609544e-07, "logits/chosen": -2.234375, "logits/rejected": -2.1875, "logps/chosen": -0.75390625, "logps/rejected": -1.390625, "loss": 0.6798478364944458, "rewards/accuracies": 0.84375, "rewards/chosen": -2.2219924926757812, "rewards/margins": 7.207763671875, "rewards/rejected": -9.429756164550781, "step": 160 }, { "epoch": 0.5835657584209397, "grad_norm": 0.6243919555680963, "learning_rate": 2.2605513915689874e-07, "logits/chosen": -2.296875, "logits/rejected": -2.265625, "logps/chosen": -0.83984375, "logps/rejected": -1.34375, "loss": 0.6825442314147949, "rewards/accuracies": 0.840624988079071, "rewards/chosen": -2.7797412872314453, "rewards/margins": 5.878034591674805, "rewards/rejected": -8.65777587890625, "step": 170 }, { "epoch": 0.6178931559751126, "grad_norm": 1.1278942630482116, "learning_rate": 1.9645931300952795e-07, "logits/chosen": -2.28125, "logits/rejected": -2.234375, "logps/chosen": -0.88671875, "logps/rejected": -1.2578125, "loss": 0.6869114637374878, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -3.503103256225586, "rewards/margins": 4.543584823608398, "rewards/rejected": -8.046688079833984, "step": 180 }, { "epoch": 0.6522205535292855, "grad_norm": 0.557496853431999, "learning_rate": 1.6763237061535008e-07, "logits/chosen": -2.265625, "logits/rejected": -2.234375, "logps/chosen": -0.6484375, "logps/rejected": -1.1015625, "loss": 0.6827899217605591, "rewards/accuracies": 0.815625011920929, "rewards/chosen": -1.5933113098144531, "rewards/margins": 5.051255226135254, "rewards/rejected": -6.644566535949707, "step": 190 }, { "epoch": 0.6865479510834585, "grad_norm": 0.17143843440576617, "learning_rate": 1.3998828812795932e-07, "logits/chosen": -2.375, "logits/rejected": -2.296875, "logps/chosen": -0.7109375, "logps/rejected": -0.96484375, "loss": 0.6855746507644653, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -1.8840103149414062, "rewards/margins": 3.5195465087890625, "rewards/rejected": -5.403556823730469, "step": 200 }, { "epoch": 0.7208753486376314, "grad_norm": 0.3704174071598696, "learning_rate": 1.1392405496029076e-07, "logits/chosen": -2.421875, "logits/rejected": -2.375, "logps/chosen": -0.90234375, "logps/rejected": -1.3671875, "loss": 0.6831818222999573, "rewards/accuracies": 0.84375, "rewards/chosen": -3.901020050048828, "rewards/margins": 5.629344940185547, "rewards/rejected": -9.530364990234375, "step": 210 }, { "epoch": 0.7552027461918044, "grad_norm": 0.29755655034839396, "learning_rate": 8.981397272385738e-08, "logits/chosen": -2.390625, "logits/rejected": -2.265625, "logps/chosen": -0.5625, "logps/rejected": -0.86328125, "loss": 0.6854575276374817, "rewards/accuracies": 0.856249988079071, "rewards/chosen": -0.9891986846923828, "rewards/margins": 3.597726821899414, "rewards/rejected": -4.586925506591797, "step": 220 }, { "epoch": 0.7895301437459773, "grad_norm": 0.5727075004030926, "learning_rate": 6.800427998154968e-08, "logits/chosen": -2.421875, "logits/rejected": -2.296875, "logps/chosen": -1.15625, "logps/rejected": -2.296875, "loss": 0.6726676225662231, "rewards/accuracies": 0.840624988079071, "rewards/chosen": -5.837119102478027, "rewards/margins": 11.716462135314941, "rewards/rejected": -17.55358123779297, "step": 230 }, { "epoch": 0.8238575413001502, "grad_norm": 0.20114138622145075, "learning_rate": 4.8808180006509356e-08, "logits/chosen": -2.328125, "logits/rejected": -2.265625, "logps/chosen": -0.94140625, "logps/rejected": -1.3515625, "loss": 0.6838194727897644, "rewards/accuracies": 0.8031250238418579, "rewards/chosen": -3.888202667236328, "rewards/margins": 5.167751312255859, "rewards/rejected": -9.055953979492188, "step": 240 }, { "epoch": 0.8581849388543231, "grad_norm": 0.4933550514010035, "learning_rate": 3.250134295213053e-08, "logits/chosen": -2.375, "logits/rejected": -2.328125, "logps/chosen": -0.76171875, "logps/rejected": -0.95703125, "loss": 0.6869604587554932, "rewards/accuracies": 0.846875011920929, "rewards/chosen": -2.8221282958984375, "rewards/margins": 2.9920434951782227, "rewards/rejected": -5.81417179107666, "step": 250 }, { "epoch": 0.892512336408496, "grad_norm": 0.6922209770737316, "learning_rate": 1.9317947025340232e-08, "logits/chosen": -2.296875, "logits/rejected": -2.21875, "logps/chosen": -1.4765625, "logps/rejected": -1.5234375, "loss": 0.6916182637214661, "rewards/accuracies": 0.828125, "rewards/chosen": -8.145744323730469, "rewards/margins": 2.6402759552001953, "rewards/rejected": -10.786020278930664, "step": 260 }, { "epoch": 0.9268397339626689, "grad_norm": 0.4424320735292111, "learning_rate": 9.447315514833353e-09, "logits/chosen": -2.375, "logits/rejected": -2.3125, "logps/chosen": -0.84375, "logps/rejected": -1.03125, "loss": 0.6869756579399109, "rewards/accuracies": 0.84375, "rewards/chosen": -3.4899368286132812, "rewards/margins": 2.9231185913085938, "rewards/rejected": -6.413055419921875, "step": 270 }, { "epoch": 0.9611671315168419, "grad_norm": 0.3058992016047687, "learning_rate": 3.0311979690147426e-09, "logits/chosen": -2.359375, "logits/rejected": -2.25, "logps/chosen": -0.9921875, "logps/rejected": -1.3515625, "loss": 0.6848438382148743, "rewards/accuracies": 0.859375, "rewards/chosen": -4.557971954345703, "rewards/margins": 4.624332427978516, "rewards/rejected": -9.182304382324219, "step": 280 }, { "epoch": 0.9954945290710148, "grad_norm": 0.19881067947724387, "learning_rate": 1.6173456793908135e-10, "logits/chosen": -2.375, "logits/rejected": -2.34375, "logps/chosen": -0.94921875, "logps/rejected": -1.3125, "loss": 0.6863315105438232, "rewards/accuracies": 0.859375, "rewards/chosen": -4.277503967285156, "rewards/margins": 4.613258361816406, "rewards/rejected": -8.890762329101562, "step": 290 }, { "epoch": 1.0, "step": 292, "total_flos": 0.0, "train_loss": 0.6846090351065545, "train_runtime": 26441.528, "train_samples_per_second": 0.705, "train_steps_per_second": 0.011 } ], "logging_steps": 10, "max_steps": 292, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }