{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 292, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.034327397554172925, "grad_norm": 0.027326168841644558, "learning_rate": 1.5e-07, "logits/chosen": -1.796875, "logits/rejected": -1.78125, "logps/chosen": -0.279296875, "logps/rejected": -0.287109375, "loss": 0.6927052736282349, "rewards/accuracies": 0.875, "rewards/chosen": 2.3672189712524414, "rewards/margins": 0.8975496292114258, "rewards/rejected": 1.4696693420410156, "step": 10 }, { "epoch": 0.06865479510834585, "grad_norm": 0.09921485553278094, "learning_rate": 3.166666666666666e-07, "logits/chosen": -1.71875, "logits/rejected": -1.6484375, "logps/chosen": -0.28515625, "logps/rejected": -0.302734375, "loss": 0.6922475099563599, "rewards/accuracies": 0.8968750238418579, "rewards/chosen": 3.4436473846435547, "rewards/margins": 1.8109512329101562, "rewards/rejected": 1.6326961517333984, "step": 20 }, { "epoch": 0.10298219266251878, "grad_norm": 0.10420540005955876, "learning_rate": 4.833333333333333e-07, "logits/chosen": -1.8359375, "logits/rejected": -1.7734375, "logps/chosen": -0.275390625, "logps/rejected": -0.291015625, "loss": 0.6926367282867432, "rewards/accuracies": 0.859375, "rewards/chosen": 2.249516487121582, "rewards/margins": 1.0263261795043945, "rewards/rejected": 1.2231903076171875, "step": 30 }, { "epoch": 0.1373095902166917, "grad_norm": 0.03849402823923644, "learning_rate": 4.985456442051682e-07, "logits/chosen": -1.8515625, "logits/rejected": -1.8203125, "logps/chosen": -0.2890625, "logps/rejected": -0.306640625, "loss": 0.6926412582397461, "rewards/accuracies": 0.8843749761581421, "rewards/chosen": 2.4276199340820312, "rewards/margins": 1.0192298889160156, "rewards/rejected": 1.4083900451660156, "step": 40 }, { "epoch": 0.1716369877708646, "grad_norm": 0.0374673819672732, "learning_rate": 4.935399618791793e-07, "logits/chosen": -1.828125, "logits/rejected": -1.7890625, "logps/chosen": -0.279296875, "logps/rejected": -0.296875, "loss": 0.6924989223480225, "rewards/accuracies": 0.8531249761581421, "rewards/chosen": 2.6443328857421875, "rewards/margins": 1.3047637939453125, "rewards/rejected": 1.339569091796875, "step": 50 }, { "epoch": 0.20596438532503755, "grad_norm": 0.03365931058119091, "learning_rate": 4.850368660819092e-07, "logits/chosen": -1.921875, "logits/rejected": -1.8125, "logps/chosen": -0.283203125, "logps/rejected": -0.30859375, "loss": 0.6927420496940613, "rewards/accuracies": 0.878125011920929, "rewards/chosen": 1.7035331726074219, "rewards/margins": 0.8122596740722656, "rewards/rejected": 0.8912734985351562, "step": 60 }, { "epoch": 0.24029178287921046, "grad_norm": 0.17635150812873454, "learning_rate": 4.731584675403184e-07, "logits/chosen": -1.7265625, "logits/rejected": -1.6484375, "logps/chosen": -0.345703125, "logps/rejected": -0.390625, "loss": 0.6921142935752869, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.563936948776245, "rewards/margins": 2.078953504562378, "rewards/rejected": 0.4849834442138672, "step": 70 }, { "epoch": 0.2746191804333834, "grad_norm": 0.06545776403341849, "learning_rate": 4.5807534881817183e-07, "logits/chosen": -1.90625, "logits/rejected": -1.8359375, "logps/chosen": -0.40234375, "logps/rejected": -0.380859375, "loss": 0.6927981376647949, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": 1.0752201080322266, "rewards/margins": 0.7200770378112793, "rewards/rejected": 0.35514307022094727, "step": 80 }, { "epoch": 0.3089465779875563, "grad_norm": 0.09027203287016318, "learning_rate": 4.400041146246136e-07, "logits/chosen": -1.890625, "logits/rejected": -1.8125, "logps/chosen": -0.478515625, "logps/rejected": -0.5546875, "loss": 0.692075788974762, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.1104850769042969, "rewards/margins": 2.175220489501953, "rewards/rejected": -1.0647354125976562, "step": 90 }, { "epoch": 0.3432739755417292, "grad_norm": 0.031074765621602243, "learning_rate": 4.1920428121079e-07, "logits/chosen": -1.9921875, "logits/rejected": -1.9453125, "logps/chosen": -0.337890625, "logps/rejected": -0.63671875, "loss": 0.6915220618247986, "rewards/accuracies": 0.8656250238418579, "rewards/chosen": 1.155731201171875, "rewards/margins": 3.3451175689697266, "rewards/rejected": -2.1893863677978516, "step": 100 }, { "epoch": 0.3776013730959022, "grad_norm": 0.16180777732568963, "learning_rate": 3.959745495250818e-07, "logits/chosen": -2.15625, "logits/rejected": -2.09375, "logps/chosen": -0.5625, "logps/rejected": -0.84765625, "loss": 0.6915071606636047, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -0.6894073486328125, "rewards/margins": 3.4209938049316406, "rewards/rejected": -4.110401153564453, "step": 110 }, { "epoch": 0.4119287706500751, "grad_norm": 0.1511404746628019, "learning_rate": 3.7064851564718353e-07, "logits/chosen": -2.140625, "logits/rejected": -2.0625, "logps/chosen": -0.85546875, "logps/rejected": -1.3515625, "loss": 0.6901899576187134, "rewards/accuracies": 0.859375, "rewards/chosen": -2.8015074729919434, "rewards/margins": 6.206118106842041, "rewards/rejected": -9.007625579833984, "step": 120 }, { "epoch": 0.446256168204248, "grad_norm": 0.06160115608776609, "learning_rate": 3.4358988010236103e-07, "logits/chosen": -2.203125, "logits/rejected": -2.15625, "logps/chosen": -0.85546875, "logps/rejected": -0.8359375, "loss": 0.6927467584609985, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -3.158720016479492, "rewards/margins": 1.0240888595581055, "rewards/rejected": -4.182808876037598, "step": 130 }, { "epoch": 0.4805835657584209, "grad_norm": 0.10523155517981944, "learning_rate": 3.1518722485366754e-07, "logits/chosen": -2.203125, "logits/rejected": -2.140625, "logps/chosen": -0.8671875, "logps/rejected": -1.21875, "loss": 0.6911064386367798, "rewards/accuracies": 0.84375, "rewards/chosen": -3.4415740966796875, "rewards/margins": 4.292812347412109, "rewards/rejected": -7.734386444091797, "step": 140 }, { "epoch": 0.5149109633125939, "grad_norm": 0.035179212929538226, "learning_rate": 2.8584843297836277e-07, "logits/chosen": -2.25, "logits/rejected": -2.203125, "logps/chosen": -1.1328125, "logps/rejected": -1.7578125, "loss": 0.6899595856666565, "rewards/accuracies": 0.828125, "rewards/chosen": -5.875, "rewards/margins": 6.893577575683594, "rewards/rejected": -12.768577575683594, "step": 150 }, { "epoch": 0.5492383608667668, "grad_norm": 0.1450101366240538, "learning_rate": 2.5599483116609544e-07, "logits/chosen": -2.296875, "logits/rejected": -2.25, "logps/chosen": -0.87890625, "logps/rejected": -1.5625, "loss": 0.6895779371261597, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -3.4518814086914062, "rewards/margins": 7.646453857421875, "rewards/rejected": -11.098335266113281, "step": 160 }, { "epoch": 0.5835657584209397, "grad_norm": 0.1420016679190622, "learning_rate": 2.2605513915689874e-07, "logits/chosen": -2.359375, "logits/rejected": -2.328125, "logps/chosen": -0.94921875, "logps/rejected": -1.5078125, "loss": 0.6901618242263794, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -3.8529891967773438, "rewards/margins": 6.436831474304199, "rewards/rejected": -10.28982162475586, "step": 170 }, { "epoch": 0.6178931559751126, "grad_norm": 0.20453016696700213, "learning_rate": 1.9645931300952795e-07, "logits/chosen": -2.359375, "logits/rejected": -2.296875, "logps/chosen": -1.0, "logps/rejected": -1.4375, "loss": 0.6908394694328308, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -4.656373023986816, "rewards/margins": 5.2327375411987305, "rewards/rejected": -9.889110565185547, "step": 180 }, { "epoch": 0.6522205535292855, "grad_norm": 0.21323000370650325, "learning_rate": 1.6763237061535008e-07, "logits/chosen": -2.34375, "logits/rejected": -2.3125, "logps/chosen": -0.73828125, "logps/rejected": -1.2734375, "loss": 0.6903473734855652, "rewards/accuracies": 0.796875, "rewards/chosen": -2.4973716735839844, "rewards/margins": 5.884622573852539, "rewards/rejected": -8.381994247436523, "step": 190 }, { "epoch": 0.6865479510834585, "grad_norm": 0.0442944969938989, "learning_rate": 1.3998828812795932e-07, "logits/chosen": -2.46875, "logits/rejected": -2.375, "logps/chosen": -0.82421875, "logps/rejected": -1.1484375, "loss": 0.6911455392837524, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -3.016143798828125, "rewards/margins": 4.1826019287109375, "rewards/rejected": -7.1987457275390625, "step": 200 }, { "epoch": 0.7208753486376314, "grad_norm": 0.0814027642592345, "learning_rate": 1.1392405496029076e-07, "logits/chosen": -2.5, "logits/rejected": -2.453125, "logps/chosen": -1.0078125, "logps/rejected": -1.546875, "loss": 0.6901921629905701, "rewards/accuracies": 0.828125, "rewards/chosen": -4.940196990966797, "rewards/margins": 6.411693572998047, "rewards/rejected": -11.351890563964844, "step": 210 }, { "epoch": 0.7552027461918044, "grad_norm": 0.10252141292193413, "learning_rate": 8.981397272385738e-08, "logits/chosen": -2.46875, "logits/rejected": -2.34375, "logps/chosen": -0.6328125, "logps/rejected": -0.9765625, "loss": 0.6912047266960144, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -1.6905670166015625, "rewards/margins": 4.028224945068359, "rewards/rejected": -5.718791961669922, "step": 220 }, { "epoch": 0.7895301437459773, "grad_norm": 0.18710535460212382, "learning_rate": 6.800427998154968e-08, "logits/chosen": -2.5, "logits/rejected": -2.390625, "logps/chosen": -1.3359375, "logps/rejected": -2.71875, "loss": 0.6866771578788757, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -7.6492438316345215, "rewards/margins": 14.053179740905762, "rewards/rejected": -21.702423095703125, "step": 230 }, { "epoch": 0.8238575413001502, "grad_norm": 0.07263049786204931, "learning_rate": 4.8808180006509356e-08, "logits/chosen": -2.40625, "logits/rejected": -2.34375, "logps/chosen": -1.1015625, "logps/rejected": -1.5625, "loss": 0.6904851198196411, "rewards/accuracies": 0.7906249761581421, "rewards/chosen": -5.462257385253906, "rewards/margins": 5.7797698974609375, "rewards/rejected": -11.242027282714844, "step": 240 }, { "epoch": 0.8581849388543231, "grad_norm": 0.13311409487376344, "learning_rate": 3.250134295213053e-08, "logits/chosen": -2.453125, "logits/rejected": -2.40625, "logps/chosen": -0.859375, "logps/rejected": -1.078125, "loss": 0.6915887594223022, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -3.7892303466796875, "rewards/margins": 3.248276472091675, "rewards/rejected": -7.037507057189941, "step": 250 }, { "epoch": 0.892512336408496, "grad_norm": 0.18186649279991612, "learning_rate": 1.9317947025340232e-08, "logits/chosen": -2.390625, "logits/rejected": -2.296875, "logps/chosen": -1.734375, "logps/rejected": -1.828125, "loss": 0.6919444799423218, "rewards/accuracies": 0.8218749761581421, "rewards/chosen": -10.762340545654297, "rewards/margins": 3.087606430053711, "rewards/rejected": -13.849946975708008, "step": 260 }, { "epoch": 0.9268397339626689, "grad_norm": 0.08411697914723029, "learning_rate": 9.447315514833353e-09, "logits/chosen": -2.453125, "logits/rejected": -2.390625, "logps/chosen": -0.98828125, "logps/rejected": -1.203125, "loss": 0.6915868520736694, "rewards/accuracies": 0.809374988079071, "rewards/chosen": -4.930023193359375, "rewards/margins": 3.2534637451171875, "rewards/rejected": -8.183486938476562, "step": 270 }, { "epoch": 0.9611671315168419, "grad_norm": 0.0866651631371244, "learning_rate": 3.0311979690147426e-09, "logits/chosen": -2.421875, "logits/rejected": -2.3125, "logps/chosen": -1.1328125, "logps/rejected": -1.5859375, "loss": 0.6905649900436401, "rewards/accuracies": 0.840624988079071, "rewards/chosen": -5.979114532470703, "rewards/margins": 5.5533447265625, "rewards/rejected": -11.532459259033203, "step": 280 }, { "epoch": 0.9954945290710148, "grad_norm": 0.17593981054033778, "learning_rate": 1.6173456793908135e-10, "logits/chosen": -2.46875, "logits/rejected": -2.4375, "logps/chosen": -1.09375, "logps/rejected": -1.5078125, "loss": 0.690861165523529, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -5.743495941162109, "rewards/margins": 5.161052703857422, "rewards/rejected": -10.904548645019531, "step": 290 }, { "epoch": 1.0, "step": 292, "total_flos": 0.0, "train_loss": 0.6896600347675689, "train_runtime": 29629.3533, "train_samples_per_second": 0.629, "train_steps_per_second": 0.01 } ], "logging_steps": 10, "max_steps": 292, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }