{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 84, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.0289964377880096, "epoch": 0.011904761904761904, "grad_norm": 27.125, "learning_rate": 2e-05, "loss": 2.2931, "mean_token_accuracy": 0.5738132819533348, "num_tokens": 29832.0, "step": 1 }, { "entropy": 1.44026979804039, "epoch": 0.023809523809523808, "grad_norm": 6.3125, "learning_rate": 1.999922292480975e-05, "loss": 1.5703, "mean_token_accuracy": 0.6421284079551697, "num_tokens": 58835.0, "step": 2 }, { "entropy": 1.6413304507732391, "epoch": 0.03571428571428571, "grad_norm": 4.0625, "learning_rate": 1.9996891820008165e-05, "loss": 1.5037, "mean_token_accuracy": 0.6544012948870659, "num_tokens": 88089.0, "step": 3 }, { "entropy": 1.4298747032880783, "epoch": 0.047619047619047616, "grad_norm": 3.171875, "learning_rate": 1.9993007047883988e-05, "loss": 1.3305, "mean_token_accuracy": 0.6857858076691628, "num_tokens": 116996.0, "step": 4 }, { "entropy": 1.266538918018341, "epoch": 0.05952380952380952, "grad_norm": 2.53125, "learning_rate": 1.9987569212189224e-05, "loss": 1.2618, "mean_token_accuracy": 0.6996989399194717, "num_tokens": 146502.0, "step": 5 }, { "entropy": 1.1705086678266525, "epoch": 0.07142857142857142, "grad_norm": 2.515625, "learning_rate": 1.9980579158045322e-05, "loss": 1.2323, "mean_token_accuracy": 0.6959410309791565, "num_tokens": 175000.0, "step": 6 }, { "entropy": 1.1460798904299736, "epoch": 0.08333333333333333, "grad_norm": 2.546875, "learning_rate": 1.9972037971811802e-05, "loss": 1.2006, "mean_token_accuracy": 0.7042278572916985, "num_tokens": 203581.0, "step": 7 }, { "entropy": 1.086261309683323, "epoch": 0.09523809523809523, "grad_norm": 2.28125, "learning_rate": 1.9961946980917457e-05, "loss": 1.1341, "mean_token_accuracy": 0.7203333824872971, "num_tokens": 233225.0, "step": 8 }, { "entropy": 1.1471993625164032, "epoch": 0.10714285714285714, "grad_norm": 2.25, "learning_rate": 1.9950307753654016e-05, "loss": 1.1864, "mean_token_accuracy": 0.7060119584202766, "num_tokens": 261557.0, "step": 9 }, { "entropy": 1.1250567734241486, "epoch": 0.11904761904761904, "grad_norm": 2.125, "learning_rate": 1.9937122098932428e-05, "loss": 1.1066, "mean_token_accuracy": 0.717756524682045, "num_tokens": 290843.0, "step": 10 }, { "entropy": 1.0941710397601128, "epoch": 0.13095238095238096, "grad_norm": 1.921875, "learning_rate": 1.9922392066001724e-05, "loss": 1.0633, "mean_token_accuracy": 0.7308941036462784, "num_tokens": 320963.0, "step": 11 }, { "entropy": 1.0973558276891708, "epoch": 0.14285714285714285, "grad_norm": 2.03125, "learning_rate": 1.9906119944130527e-05, "loss": 1.0542, "mean_token_accuracy": 0.7335255369544029, "num_tokens": 350648.0, "step": 12 }, { "entropy": 1.0850690826773643, "epoch": 0.15476190476190477, "grad_norm": 2.0625, "learning_rate": 1.9888308262251286e-05, "loss": 1.0634, "mean_token_accuracy": 0.7266389280557632, "num_tokens": 380096.0, "step": 13 }, { "entropy": 1.0478279069066048, "epoch": 0.16666666666666666, "grad_norm": 2.171875, "learning_rate": 1.9868959788567213e-05, "loss": 1.057, "mean_token_accuracy": 0.7326076179742813, "num_tokens": 407435.0, "step": 14 }, { "entropy": 1.0213893577456474, "epoch": 0.17857142857142858, "grad_norm": 2.0, "learning_rate": 1.9848077530122083e-05, "loss": 1.012, "mean_token_accuracy": 0.7387356385588646, "num_tokens": 435734.0, "step": 15 }, { "entropy": 1.07327102124691, "epoch": 0.19047619047619047, "grad_norm": 2.03125, "learning_rate": 1.9825664732332886e-05, "loss": 1.0868, "mean_token_accuracy": 0.7211552038788795, "num_tokens": 464973.0, "step": 16 }, { "entropy": 1.0235116630792618, "epoch": 0.20238095238095238, "grad_norm": 1.984375, "learning_rate": 1.9801724878485438e-05, "loss": 1.0377, "mean_token_accuracy": 0.7334162965416908, "num_tokens": 493135.0, "step": 17 }, { "entropy": 0.9607449993491173, "epoch": 0.21428571428571427, "grad_norm": 1.8984375, "learning_rate": 1.977626168919305e-05, "loss": 0.9745, "mean_token_accuracy": 0.7495110481977463, "num_tokens": 522656.0, "step": 18 }, { "entropy": 1.0044650733470917, "epoch": 0.2261904761904762, "grad_norm": 1.8984375, "learning_rate": 1.9749279121818235e-05, "loss": 1.0128, "mean_token_accuracy": 0.7394910976290703, "num_tokens": 551875.0, "step": 19 }, { "entropy": 1.009770929813385, "epoch": 0.23809523809523808, "grad_norm": 1.921875, "learning_rate": 1.9720781369857747e-05, "loss": 1.0019, "mean_token_accuracy": 0.7396527603268623, "num_tokens": 580523.0, "step": 20 }, { "entropy": 1.0536553114652634, "epoch": 0.25, "grad_norm": 1.9140625, "learning_rate": 1.969077286229078e-05, "loss": 1.0288, "mean_token_accuracy": 0.7323001325130463, "num_tokens": 609771.0, "step": 21 }, { "entropy": 0.964533656835556, "epoch": 0.2619047619047619, "grad_norm": 1.828125, "learning_rate": 1.9659258262890683e-05, "loss": 0.9512, "mean_token_accuracy": 0.7494053766131401, "num_tokens": 639104.0, "step": 22 }, { "entropy": 0.9821470007300377, "epoch": 0.27380952380952384, "grad_norm": 1.890625, "learning_rate": 1.962624246950012e-05, "loss": 0.9739, "mean_token_accuracy": 0.7434249892830849, "num_tokens": 667792.0, "step": 23 }, { "entropy": 0.9782575219869614, "epoch": 0.2857142857142857, "grad_norm": 1.796875, "learning_rate": 1.9591730613269878e-05, "loss": 0.9898, "mean_token_accuracy": 0.7400899454951286, "num_tokens": 696742.0, "step": 24 }, { "entropy": 0.942177914083004, "epoch": 0.2976190476190476, "grad_norm": 1.859375, "learning_rate": 1.955572805786141e-05, "loss": 0.9489, "mean_token_accuracy": 0.7481768950819969, "num_tokens": 725968.0, "step": 25 }, { "entropy": 0.9274484664201736, "epoch": 0.30952380952380953, "grad_norm": 1.921875, "learning_rate": 1.9518240398613226e-05, "loss": 0.9505, "mean_token_accuracy": 0.7481107041239738, "num_tokens": 755689.0, "step": 26 }, { "entropy": 0.9720096439123154, "epoch": 0.32142857142857145, "grad_norm": 1.8828125, "learning_rate": 1.947927346167132e-05, "loss": 0.9928, "mean_token_accuracy": 0.7357244342565536, "num_tokens": 784977.0, "step": 27 }, { "entropy": 0.9152235984802246, "epoch": 0.3333333333333333, "grad_norm": 1.8046875, "learning_rate": 1.9438833303083677e-05, "loss": 0.9064, "mean_token_accuracy": 0.7547181248664856, "num_tokens": 814048.0, "step": 28 }, { "entropy": 0.9777852222323418, "epoch": 0.34523809523809523, "grad_norm": 1.8359375, "learning_rate": 1.9396926207859085e-05, "loss": 0.9833, "mean_token_accuracy": 0.7389796674251556, "num_tokens": 843602.0, "step": 29 }, { "entropy": 0.9311033263802528, "epoch": 0.35714285714285715, "grad_norm": 2.875, "learning_rate": 1.935355868899034e-05, "loss": 0.9277, "mean_token_accuracy": 0.7512769624590874, "num_tokens": 871915.0, "step": 30 }, { "entropy": 0.97285395860672, "epoch": 0.36904761904761907, "grad_norm": 1.8984375, "learning_rate": 1.9308737486442045e-05, "loss": 0.9626, "mean_token_accuracy": 0.7445296198129654, "num_tokens": 900851.0, "step": 31 }, { "entropy": 0.8841484859585762, "epoch": 0.38095238095238093, "grad_norm": 1.7421875, "learning_rate": 1.926246956610309e-05, "loss": 0.8828, "mean_token_accuracy": 0.7655422911047935, "num_tokens": 929498.0, "step": 32 }, { "entropy": 0.9625014588236809, "epoch": 0.39285714285714285, "grad_norm": 1.7890625, "learning_rate": 1.921476211870408e-05, "loss": 0.9449, "mean_token_accuracy": 0.7469100803136826, "num_tokens": 958933.0, "step": 33 }, { "entropy": 0.9233517870306969, "epoch": 0.40476190476190477, "grad_norm": 1.765625, "learning_rate": 1.9165622558699763e-05, "loss": 0.9282, "mean_token_accuracy": 0.7555889263749123, "num_tokens": 987731.0, "step": 34 }, { "entropy": 0.9165640994906425, "epoch": 0.4166666666666667, "grad_norm": 1.7265625, "learning_rate": 1.9115058523116734e-05, "loss": 0.8923, "mean_token_accuracy": 0.761642724275589, "num_tokens": 1017002.0, "step": 35 }, { "entropy": 0.9459593519568443, "epoch": 0.42857142857142855, "grad_norm": 1.6953125, "learning_rate": 1.9063077870366504e-05, "loss": 0.9472, "mean_token_accuracy": 0.7494409009814262, "num_tokens": 1046678.0, "step": 36 }, { "entropy": 0.9148919209837914, "epoch": 0.44047619047619047, "grad_norm": 1.8046875, "learning_rate": 1.900968867902419e-05, "loss": 0.9092, "mean_token_accuracy": 0.7560340315103531, "num_tokens": 1074445.0, "step": 37 }, { "entropy": 0.8793367967009544, "epoch": 0.4523809523809524, "grad_norm": 1.875, "learning_rate": 1.895489924657301e-05, "loss": 0.864, "mean_token_accuracy": 0.767846867442131, "num_tokens": 1103620.0, "step": 38 }, { "entropy": 0.9116434380412102, "epoch": 0.4642857142857143, "grad_norm": 1.828125, "learning_rate": 1.8898718088114688e-05, "loss": 0.8928, "mean_token_accuracy": 0.7605250775814056, "num_tokens": 1132637.0, "step": 39 }, { "entropy": 0.8998617604374886, "epoch": 0.47619047619047616, "grad_norm": 1.6796875, "learning_rate": 1.8841153935046098e-05, "loss": 0.8715, "mean_token_accuracy": 0.7635523602366447, "num_tokens": 1161527.0, "step": 40 }, { "entropy": 0.8533368110656738, "epoch": 0.4880952380952381, "grad_norm": 1.7109375, "learning_rate": 1.8782215733702286e-05, "loss": 0.86, "mean_token_accuracy": 0.7679954171180725, "num_tokens": 1190701.0, "step": 41 }, { "entropy": 0.9144820719957352, "epoch": 0.5, "grad_norm": 1.9140625, "learning_rate": 1.8721912643966055e-05, "loss": 0.9308, "mean_token_accuracy": 0.7519562095403671, "num_tokens": 1218835.0, "step": 42 }, { "entropy": 0.8947170972824097, "epoch": 0.5119047619047619, "grad_norm": 1.78125, "learning_rate": 1.866025403784439e-05, "loss": 0.8931, "mean_token_accuracy": 0.7597509473562241, "num_tokens": 1248679.0, "step": 43 }, { "entropy": 0.8477422297000885, "epoch": 0.5238095238095238, "grad_norm": 1.7890625, "learning_rate": 1.8597249498011906e-05, "loss": 0.8518, "mean_token_accuracy": 0.772525392472744, "num_tokens": 1277106.0, "step": 44 }, { "entropy": 0.9015490636229515, "epoch": 0.5357142857142857, "grad_norm": 1.8046875, "learning_rate": 1.8532908816321557e-05, "loss": 0.9015, "mean_token_accuracy": 0.7591351941227913, "num_tokens": 1305983.0, "step": 45 }, { "entropy": 0.931048758327961, "epoch": 0.5476190476190477, "grad_norm": 1.8515625, "learning_rate": 1.8467241992282842e-05, "loss": 0.9067, "mean_token_accuracy": 0.7518437430262566, "num_tokens": 1334578.0, "step": 46 }, { "entropy": 0.8747421428561211, "epoch": 0.5595238095238095, "grad_norm": 1.796875, "learning_rate": 1.8400259231507716e-05, "loss": 0.8576, "mean_token_accuracy": 0.7661429345607758, "num_tokens": 1362873.0, "step": 47 }, { "entropy": 0.8680180609226227, "epoch": 0.5714285714285714, "grad_norm": 1.7734375, "learning_rate": 1.833197094412449e-05, "loss": 0.8586, "mean_token_accuracy": 0.7713808715343475, "num_tokens": 1391315.0, "step": 48 }, { "entropy": 0.8663084208965302, "epoch": 0.5833333333333334, "grad_norm": 1.7734375, "learning_rate": 1.826238774315995e-05, "loss": 0.8471, "mean_token_accuracy": 0.7667829617857933, "num_tokens": 1419829.0, "step": 49 }, { "entropy": 0.8798943981528282, "epoch": 0.5952380952380952, "grad_norm": 1.84375, "learning_rate": 1.819152044288992e-05, "loss": 0.8961, "mean_token_accuracy": 0.7574765011668205, "num_tokens": 1447790.0, "step": 50 }, { "entropy": 0.8617029711604118, "epoch": 0.6071428571428571, "grad_norm": 1.8671875, "learning_rate": 1.811938005715857e-05, "loss": 0.8544, "mean_token_accuracy": 0.7637034431099892, "num_tokens": 1476278.0, "step": 51 }, { "entropy": 0.9306018576025963, "epoch": 0.6190476190476191, "grad_norm": 1.9453125, "learning_rate": 1.8045977797666685e-05, "loss": 0.9506, "mean_token_accuracy": 0.7459357306361198, "num_tokens": 1503947.0, "step": 52 }, { "entropy": 0.8792530596256256, "epoch": 0.6309523809523809, "grad_norm": 1.8046875, "learning_rate": 1.7971325072229227e-05, "loss": 0.9022, "mean_token_accuracy": 0.7546841576695442, "num_tokens": 1533531.0, "step": 53 }, { "entropy": 0.8904775232076645, "epoch": 0.6428571428571429, "grad_norm": 1.890625, "learning_rate": 1.7895433483002356e-05, "loss": 0.9174, "mean_token_accuracy": 0.757450558245182, "num_tokens": 1561412.0, "step": 54 }, { "entropy": 0.8826311081647873, "epoch": 0.6547619047619048, "grad_norm": 1.8828125, "learning_rate": 1.78183148246803e-05, "loss": 0.8745, "mean_token_accuracy": 0.7593515664339066, "num_tokens": 1590336.0, "step": 55 }, { "entropy": 0.8883182108402252, "epoch": 0.6666666666666666, "grad_norm": 1.703125, "learning_rate": 1.7739981082662275e-05, "loss": 0.8739, "mean_token_accuracy": 0.7626457437872887, "num_tokens": 1620442.0, "step": 56 }, { "entropy": 0.9116549044847488, "epoch": 0.6785714285714286, "grad_norm": 1.7734375, "learning_rate": 1.766044443118978e-05, "loss": 0.8924, "mean_token_accuracy": 0.7594088986515999, "num_tokens": 1648762.0, "step": 57 }, { "entropy": 0.8485553786158562, "epoch": 0.6904761904761905, "grad_norm": 1.734375, "learning_rate": 1.757971723145453e-05, "loss": 0.8377, "mean_token_accuracy": 0.7698637396097183, "num_tokens": 1677464.0, "step": 58 }, { "entropy": 0.8704692050814629, "epoch": 0.7023809523809523, "grad_norm": 1.7890625, "learning_rate": 1.7497812029677344e-05, "loss": 0.856, "mean_token_accuracy": 0.7654970586299896, "num_tokens": 1704994.0, "step": 59 }, { "entropy": 0.8928592056035995, "epoch": 0.7142857142857143, "grad_norm": 1.6953125, "learning_rate": 1.741474155515827e-05, "loss": 0.8711, "mean_token_accuracy": 0.7633472010493279, "num_tokens": 1734202.0, "step": 60 }, { "entropy": 0.89468764513731, "epoch": 0.7261904761904762, "grad_norm": 1.734375, "learning_rate": 1.7330518718298263e-05, "loss": 0.8823, "mean_token_accuracy": 0.7610758692026138, "num_tokens": 1763541.0, "step": 61 }, { "entropy": 0.8784511089324951, "epoch": 0.7380952380952381, "grad_norm": 1.6953125, "learning_rate": 1.7245156608592727e-05, "loss": 0.8538, "mean_token_accuracy": 0.7677165567874908, "num_tokens": 1793196.0, "step": 62 }, { "entropy": 0.909877359867096, "epoch": 0.75, "grad_norm": 1.9140625, "learning_rate": 1.7158668492597186e-05, "loss": 0.9132, "mean_token_accuracy": 0.7523172721266747, "num_tokens": 1821023.0, "step": 63 }, { "entropy": 0.8661764934659004, "epoch": 0.7619047619047619, "grad_norm": 1.828125, "learning_rate": 1.7071067811865477e-05, "loss": 0.8799, "mean_token_accuracy": 0.7596996948122978, "num_tokens": 1849586.0, "step": 64 }, { "entropy": 0.886342890560627, "epoch": 0.7738095238095238, "grad_norm": 1.7890625, "learning_rate": 1.698236818086073e-05, "loss": 0.902, "mean_token_accuracy": 0.7548638582229614, "num_tokens": 1878622.0, "step": 65 }, { "entropy": 0.83852668851614, "epoch": 0.7857142857142857, "grad_norm": 1.75, "learning_rate": 1.689258338483947e-05, "loss": 0.844, "mean_token_accuracy": 0.7697297856211662, "num_tokens": 1907725.0, "step": 66 }, { "entropy": 0.8709945902228355, "epoch": 0.7976190476190477, "grad_norm": 1.7265625, "learning_rate": 1.6801727377709195e-05, "loss": 0.8592, "mean_token_accuracy": 0.7622527256608009, "num_tokens": 1936209.0, "step": 67 }, { "entropy": 0.8294754698872566, "epoch": 0.8095238095238095, "grad_norm": 1.7578125, "learning_rate": 1.67098142798597e-05, "loss": 0.835, "mean_token_accuracy": 0.7706626355648041, "num_tokens": 1964915.0, "step": 68 }, { "entropy": 0.8466374576091766, "epoch": 0.8214285714285714, "grad_norm": 1.8359375, "learning_rate": 1.6616858375968596e-05, "loss": 0.8614, "mean_token_accuracy": 0.7639145851135254, "num_tokens": 1993606.0, "step": 69 }, { "entropy": 0.8547898903489113, "epoch": 0.8333333333333334, "grad_norm": 1.78125, "learning_rate": 1.6522874112781213e-05, "loss": 0.8612, "mean_token_accuracy": 0.7676523253321648, "num_tokens": 2022472.0, "step": 70 }, { "entropy": 0.8490668088197708, "epoch": 0.8452380952380952, "grad_norm": 1.84375, "learning_rate": 1.6427876096865394e-05, "loss": 0.8569, "mean_token_accuracy": 0.7640745714306831, "num_tokens": 2052746.0, "step": 71 }, { "entropy": 0.8580184206366539, "epoch": 0.8571428571428571, "grad_norm": 1.75, "learning_rate": 1.6331879092341402e-05, "loss": 0.858, "mean_token_accuracy": 0.7627410292625427, "num_tokens": 2081889.0, "step": 72 }, { "entropy": 0.8156702071428299, "epoch": 0.8690476190476191, "grad_norm": 1.5390625, "learning_rate": 1.6234898018587336e-05, "loss": 0.7916, "mean_token_accuracy": 0.7771949768066406, "num_tokens": 2111616.0, "step": 73 }, { "entropy": 0.8689733147621155, "epoch": 0.8809523809523809, "grad_norm": 1.78125, "learning_rate": 1.6136947947920477e-05, "loss": 0.8629, "mean_token_accuracy": 0.7629422098398209, "num_tokens": 2140433.0, "step": 74 }, { "entropy": 0.8075756058096886, "epoch": 0.8928571428571429, "grad_norm": 1.6171875, "learning_rate": 1.6038044103254775e-05, "loss": 0.8032, "mean_token_accuracy": 0.7750532627105713, "num_tokens": 2170414.0, "step": 75 }, { "entropy": 0.8746250569820404, "epoch": 0.9047619047619048, "grad_norm": 1.765625, "learning_rate": 1.5938201855735017e-05, "loss": 0.8793, "mean_token_accuracy": 0.7575968354940414, "num_tokens": 2198868.0, "step": 76 }, { "entropy": 0.8024050742387772, "epoch": 0.9166666666666666, "grad_norm": 1.6796875, "learning_rate": 1.5837436722347902e-05, "loss": 0.7813, "mean_token_accuracy": 0.7871535196900368, "num_tokens": 2228134.0, "step": 77 }, { "entropy": 0.8507664054632187, "epoch": 0.9285714285714286, "grad_norm": 1.75, "learning_rate": 1.573576436351046e-05, "loss": 0.8437, "mean_token_accuracy": 0.7693362981081009, "num_tokens": 2257447.0, "step": 78 }, { "entropy": 0.8141358867287636, "epoch": 0.9404761904761905, "grad_norm": 1.65625, "learning_rate": 1.563320058063622e-05, "loss": 0.8081, "mean_token_accuracy": 0.7764901369810104, "num_tokens": 2286749.0, "step": 79 }, { "entropy": 0.843724861741066, "epoch": 0.9523809523809523, "grad_norm": 1.7421875, "learning_rate": 1.5529761313679396e-05, "loss": 0.8281, "mean_token_accuracy": 0.7666148692369461, "num_tokens": 2315039.0, "step": 80 }, { "entropy": 0.8586638569831848, "epoch": 0.9642857142857143, "grad_norm": 1.7578125, "learning_rate": 1.5425462638657597e-05, "loss": 0.8867, "mean_token_accuracy": 0.760459378361702, "num_tokens": 2344737.0, "step": 81 }, { "entropy": 0.8165242671966553, "epoch": 0.9761904761904762, "grad_norm": 1.765625, "learning_rate": 1.5320320765153367e-05, "loss": 0.8006, "mean_token_accuracy": 0.7785647809505463, "num_tokens": 2373710.0, "step": 82 }, { "entropy": 0.8401609510183334, "epoch": 0.9880952380952381, "grad_norm": 1.765625, "learning_rate": 1.5214352033794981e-05, "loss": 0.8466, "mean_token_accuracy": 0.7677159905433655, "num_tokens": 2402610.0, "step": 83 }, { "entropy": 0.8437637463212013, "epoch": 1.0, "grad_norm": 1.8046875, "learning_rate": 1.5107572913716859e-05, "loss": 0.8714, "mean_token_accuracy": 0.7612484693527222, "num_tokens": 2430019.0, "step": 84 }, { "epoch": 1.0, "eval_entropy": 0.8333023413022359, "eval_loss": 0.8408388495445251, "eval_mean_token_accuracy": 0.7681567951043446, "eval_num_tokens": 2430019.0, "eval_runtime": 19.0307, "eval_samples_per_second": 7.882, "eval_steps_per_second": 7.882, "step": 84 } ], "logging_steps": 1.0, "max_steps": 252, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 5.565870266351002e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }