{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.035640459049112554, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742571830749512, "epoch": 0.0003564045904911255, "grad_norm": 5.375, "learning_rate": 2e-06, "loss": 10.7796, "mean_token_accuracy": 0.0001526242063846439, "num_tokens": 11399.0, "step": 5 }, { "entropy": 10.742592334747314, "epoch": 0.000712809180982251, "grad_norm": 5.65625, "learning_rate": 4.5e-06, "loss": 10.7732, "mean_token_accuracy": 0.00015220778295770286, "num_tokens": 22686.0, "step": 10 }, { "entropy": 10.742580223083497, "epoch": 0.0010692137714733766, "grad_norm": 5.28125, "learning_rate": 7e-06, "loss": 10.7223, "mean_token_accuracy": 0.0, "num_tokens": 32728.0, "step": 15 }, { "entropy": 10.742625427246093, "epoch": 0.001425618361964502, "grad_norm": 5.25, "learning_rate": 9.5e-06, "loss": 10.6798, "mean_token_accuracy": 0.0005484026798512787, "num_tokens": 42808.0, "step": 20 }, { "entropy": 10.742498874664307, "epoch": 0.0017820229524556277, "grad_norm": 4.75, "learning_rate": 1.2e-05, "loss": 10.5751, "mean_token_accuracy": 0.006744108803104609, "num_tokens": 54058.0, "step": 25 }, { "entropy": 10.742173194885254, "epoch": 0.002138427542946753, "grad_norm": 3.96875, "learning_rate": 1.4500000000000002e-05, "loss": 10.4546, "mean_token_accuracy": 0.025261138379573823, "num_tokens": 65338.0, "step": 30 }, { "entropy": 10.741145706176757, "epoch": 0.0024948321334378786, "grad_norm": 3.9375, "learning_rate": 1.7000000000000003e-05, "loss": 10.2901, "mean_token_accuracy": 0.034458070248365405, "num_tokens": 76598.0, "step": 35 }, { "entropy": 10.738759613037109, "epoch": 0.002851236723929004, "grad_norm": 2.65625, "learning_rate": 1.95e-05, "loss": 10.1426, "mean_token_accuracy": 0.039705483429133895, "num_tokens": 87364.0, "step": 40 }, { "entropy": 10.735179233551026, "epoch": 0.00320764131442013, "grad_norm": 2.359375, "learning_rate": 2.2e-05, "loss": 10.0394, "mean_token_accuracy": 0.04000021629035473, "num_tokens": 99019.0, "step": 45 }, { "entropy": 10.732727909088135, "epoch": 0.0035640459049112554, "grad_norm": 2.171875, "learning_rate": 2.4500000000000003e-05, "loss": 9.9672, "mean_token_accuracy": 0.04283946715295315, "num_tokens": 111087.0, "step": 50 }, { "entropy": 10.73162260055542, "epoch": 0.00392045049540238, "grad_norm": 2.140625, "learning_rate": 2.7e-05, "loss": 9.9085, "mean_token_accuracy": 0.03926678970456123, "num_tokens": 123401.0, "step": 55 }, { "entropy": 10.730762577056884, "epoch": 0.004276855085893506, "grad_norm": 2.171875, "learning_rate": 2.95e-05, "loss": 9.8396, "mean_token_accuracy": 0.04287007227540016, "num_tokens": 135554.0, "step": 60 }, { "entropy": 10.729378986358643, "epoch": 0.004633259676384632, "grad_norm": 2.09375, "learning_rate": 3.2e-05, "loss": 9.7598, "mean_token_accuracy": 0.0466454017907381, "num_tokens": 146700.0, "step": 65 }, { "entropy": 10.726875305175781, "epoch": 0.004989664266875757, "grad_norm": 1.9453125, "learning_rate": 3.4500000000000005e-05, "loss": 9.7227, "mean_token_accuracy": 0.041810817271471026, "num_tokens": 157606.0, "step": 70 }, { "entropy": 10.724038028717041, "epoch": 0.005346068857366883, "grad_norm": 1.9453125, "learning_rate": 3.7e-05, "loss": 9.664, "mean_token_accuracy": 0.04535525776445866, "num_tokens": 168705.0, "step": 75 }, { "entropy": 10.720051860809326, "epoch": 0.005702473447858008, "grad_norm": 2.09375, "learning_rate": 3.95e-05, "loss": 9.6147, "mean_token_accuracy": 0.04609923996031284, "num_tokens": 181497.0, "step": 80 }, { "entropy": 10.71345911026001, "epoch": 0.006058878038349134, "grad_norm": 1.9609375, "learning_rate": 4.2000000000000004e-05, "loss": 9.5166, "mean_token_accuracy": 0.0461752537637949, "num_tokens": 192991.0, "step": 85 }, { "entropy": 10.705201339721679, "epoch": 0.00641528262884026, "grad_norm": 2.109375, "learning_rate": 4.45e-05, "loss": 9.3949, "mean_token_accuracy": 0.049161479249596594, "num_tokens": 203969.0, "step": 90 }, { "entropy": 10.695504951477051, "epoch": 0.006771687219331385, "grad_norm": 1.8984375, "learning_rate": 4.7000000000000004e-05, "loss": 9.3681, "mean_token_accuracy": 0.049966185539960864, "num_tokens": 215809.0, "step": 95 }, { "entropy": 10.68418607711792, "epoch": 0.007128091809822511, "grad_norm": 1.796875, "learning_rate": 4.9500000000000004e-05, "loss": 9.316, "mean_token_accuracy": 0.048291167616844176, "num_tokens": 227826.0, "step": 100 }, { "entropy": 10.668262958526611, "epoch": 0.007484496400313636, "grad_norm": 1.9609375, "learning_rate": 5.2e-05, "loss": 9.1803, "mean_token_accuracy": 0.058137640729546546, "num_tokens": 240073.0, "step": 105 }, { "entropy": 10.644538402557373, "epoch": 0.00784090099080476, "grad_norm": 1.96875, "learning_rate": 5.45e-05, "loss": 9.0385, "mean_token_accuracy": 0.057943309843540194, "num_tokens": 251073.0, "step": 110 }, { "entropy": 10.616683769226075, "epoch": 0.008197305581295887, "grad_norm": 1.71875, "learning_rate": 5.7e-05, "loss": 9.0264, "mean_token_accuracy": 0.05736844353377819, "num_tokens": 264607.0, "step": 115 }, { "entropy": 10.58455696105957, "epoch": 0.008553710171787013, "grad_norm": 1.875, "learning_rate": 5.9499999999999996e-05, "loss": 8.7984, "mean_token_accuracy": 0.06613890007138253, "num_tokens": 275688.0, "step": 120 }, { "entropy": 10.523236083984376, "epoch": 0.008910114762278138, "grad_norm": 1.78125, "learning_rate": 6.2e-05, "loss": 8.652, "mean_token_accuracy": 0.06381725408136844, "num_tokens": 287024.0, "step": 125 }, { "entropy": 10.454036426544189, "epoch": 0.009266519352769264, "grad_norm": 1.828125, "learning_rate": 6.450000000000001e-05, "loss": 8.5662, "mean_token_accuracy": 0.06661000251770019, "num_tokens": 297605.0, "step": 130 }, { "entropy": 10.365349960327148, "epoch": 0.009622923943260388, "grad_norm": 1.828125, "learning_rate": 6.7e-05, "loss": 8.4279, "mean_token_accuracy": 0.06779800169169903, "num_tokens": 307956.0, "step": 135 }, { "entropy": 10.26084508895874, "epoch": 0.009979328533751514, "grad_norm": 1.6640625, "learning_rate": 6.950000000000001e-05, "loss": 8.3001, "mean_token_accuracy": 0.06663309819996358, "num_tokens": 318724.0, "step": 140 }, { "entropy": 10.160690593719483, "epoch": 0.01033573312424264, "grad_norm": 1.6015625, "learning_rate": 7.2e-05, "loss": 8.1425, "mean_token_accuracy": 0.07099423781037331, "num_tokens": 330488.0, "step": 145 }, { "entropy": 10.021271991729737, "epoch": 0.010692137714733766, "grad_norm": 1.359375, "learning_rate": 7.45e-05, "loss": 8.1226, "mean_token_accuracy": 0.07147609815001488, "num_tokens": 343057.0, "step": 150 }, { "entropy": 9.84426851272583, "epoch": 0.011048542305224892, "grad_norm": 1.265625, "learning_rate": 7.7e-05, "loss": 7.922, "mean_token_accuracy": 0.07516647689044476, "num_tokens": 355224.0, "step": 155 }, { "entropy": 9.662067031860351, "epoch": 0.011404946895716016, "grad_norm": 1.2421875, "learning_rate": 7.950000000000001e-05, "loss": 7.8644, "mean_token_accuracy": 0.07227759584784507, "num_tokens": 366926.0, "step": 160 }, { "entropy": 9.455039691925048, "epoch": 0.011761351486207142, "grad_norm": 1.171875, "learning_rate": 8.2e-05, "loss": 7.742, "mean_token_accuracy": 0.07173869498074055, "num_tokens": 378180.0, "step": 165 }, { "entropy": 9.217700099945068, "epoch": 0.012117756076698268, "grad_norm": 1.2265625, "learning_rate": 8.450000000000001e-05, "loss": 7.6739, "mean_token_accuracy": 0.07917889729142188, "num_tokens": 388639.0, "step": 170 }, { "entropy": 8.98402910232544, "epoch": 0.012474160667189394, "grad_norm": 1.0859375, "learning_rate": 8.7e-05, "loss": 7.563, "mean_token_accuracy": 0.08437970206141472, "num_tokens": 398752.0, "step": 175 }, { "entropy": 8.738731479644775, "epoch": 0.01283056525768052, "grad_norm": 0.88671875, "learning_rate": 8.95e-05, "loss": 7.4995, "mean_token_accuracy": 0.07861107215285301, "num_tokens": 411341.0, "step": 180 }, { "entropy": 8.582833385467529, "epoch": 0.013186969848171644, "grad_norm": 0.87890625, "learning_rate": 9.2e-05, "loss": 7.4019, "mean_token_accuracy": 0.07919293940067292, "num_tokens": 421736.0, "step": 185 }, { "entropy": 8.410860538482666, "epoch": 0.01354337443866277, "grad_norm": 0.87109375, "learning_rate": 9.45e-05, "loss": 7.4428, "mean_token_accuracy": 0.08342698290944099, "num_tokens": 432934.0, "step": 190 }, { "entropy": 8.250172996520996, "epoch": 0.013899779029153896, "grad_norm": 0.953125, "learning_rate": 9.7e-05, "loss": 7.3743, "mean_token_accuracy": 0.08416533321142197, "num_tokens": 442929.0, "step": 195 }, { "entropy": 8.198361492156982, "epoch": 0.014256183619645021, "grad_norm": 0.84375, "learning_rate": 9.95e-05, "loss": 7.3499, "mean_token_accuracy": 0.08039835765957833, "num_tokens": 455544.0, "step": 200 }, { "entropy": 8.08715353012085, "epoch": 0.014612588210136147, "grad_norm": 0.84375, "learning_rate": 0.000102, "loss": 7.2678, "mean_token_accuracy": 0.08803733438253403, "num_tokens": 466476.0, "step": 205 }, { "entropy": 8.042504119873048, "epoch": 0.014968992800627271, "grad_norm": 1.0859375, "learning_rate": 0.00010449999999999999, "loss": 7.2552, "mean_token_accuracy": 0.08520074412226677, "num_tokens": 477149.0, "step": 210 }, { "entropy": 7.974717617034912, "epoch": 0.015325397391118397, "grad_norm": 1.15625, "learning_rate": 0.000107, "loss": 7.3936, "mean_token_accuracy": 0.0847919188439846, "num_tokens": 489684.0, "step": 215 }, { "entropy": 7.970945692062378, "epoch": 0.01568180198160952, "grad_norm": 1.1484375, "learning_rate": 0.0001095, "loss": 7.32, "mean_token_accuracy": 0.08788989782333374, "num_tokens": 500724.0, "step": 220 }, { "entropy": 7.915714168548584, "epoch": 0.016038206572100647, "grad_norm": 1.2421875, "learning_rate": 0.000112, "loss": 7.1834, "mean_token_accuracy": 0.09220796525478363, "num_tokens": 511301.0, "step": 225 }, { "entropy": 7.900463056564331, "epoch": 0.016394611162591773, "grad_norm": 1.0625, "learning_rate": 0.0001145, "loss": 7.2187, "mean_token_accuracy": 0.08324612528085709, "num_tokens": 522925.0, "step": 230 }, { "entropy": 7.857335376739502, "epoch": 0.0167510157530829, "grad_norm": 1.0078125, "learning_rate": 0.00011700000000000001, "loss": 7.2262, "mean_token_accuracy": 0.09082898795604706, "num_tokens": 533742.0, "step": 235 }, { "entropy": 7.882049703598023, "epoch": 0.017107420343574025, "grad_norm": 0.89453125, "learning_rate": 0.00011949999999999999, "loss": 7.1824, "mean_token_accuracy": 0.0936901956796646, "num_tokens": 545526.0, "step": 240 }, { "entropy": 7.793568754196167, "epoch": 0.01746382493406515, "grad_norm": 0.96875, "learning_rate": 0.000122, "loss": 7.1257, "mean_token_accuracy": 0.09565059095621109, "num_tokens": 555735.0, "step": 245 }, { "entropy": 7.741059350967407, "epoch": 0.017820229524556277, "grad_norm": 1.0546875, "learning_rate": 0.0001245, "loss": 7.2118, "mean_token_accuracy": 0.09219442456960678, "num_tokens": 568443.0, "step": 250 }, { "entropy": 7.821925401687622, "epoch": 0.018176634115047403, "grad_norm": 1.0, "learning_rate": 0.000127, "loss": 7.1074, "mean_token_accuracy": 0.09640756845474244, "num_tokens": 579091.0, "step": 255 }, { "entropy": 7.703673696517944, "epoch": 0.01853303870553853, "grad_norm": 0.89453125, "learning_rate": 0.0001295, "loss": 7.0316, "mean_token_accuracy": 0.09788540452718734, "num_tokens": 591683.0, "step": 260 }, { "entropy": 7.649093818664551, "epoch": 0.018889443296029654, "grad_norm": 1.03125, "learning_rate": 0.000132, "loss": 7.1601, "mean_token_accuracy": 0.09608315378427505, "num_tokens": 603464.0, "step": 265 }, { "entropy": 7.753079223632812, "epoch": 0.019245847886520777, "grad_norm": 0.91796875, "learning_rate": 0.00013450000000000002, "loss": 7.2118, "mean_token_accuracy": 0.0977549560368061, "num_tokens": 615626.0, "step": 270 }, { "entropy": 7.689573907852173, "epoch": 0.019602252477011903, "grad_norm": 1.0703125, "learning_rate": 0.00013700000000000002, "loss": 7.1333, "mean_token_accuracy": 0.09726834744215011, "num_tokens": 627270.0, "step": 275 }, { "entropy": 7.662051963806152, "epoch": 0.01995865706750303, "grad_norm": 0.9453125, "learning_rate": 0.0001395, "loss": 7.0505, "mean_token_accuracy": 0.09889725744724273, "num_tokens": 638403.0, "step": 280 }, { "entropy": 7.641796112060547, "epoch": 0.020315061657994155, "grad_norm": 1.3046875, "learning_rate": 0.00014199999999999998, "loss": 7.0687, "mean_token_accuracy": 0.10083996653556823, "num_tokens": 650046.0, "step": 285 }, { "entropy": 7.634785175323486, "epoch": 0.02067146624848528, "grad_norm": 1.15625, "learning_rate": 0.0001445, "loss": 6.9997, "mean_token_accuracy": 0.10420416370034218, "num_tokens": 659818.0, "step": 290 }, { "entropy": 7.5922698974609375, "epoch": 0.021027870838976406, "grad_norm": 0.92578125, "learning_rate": 0.000147, "loss": 7.0209, "mean_token_accuracy": 0.10451438650488853, "num_tokens": 672404.0, "step": 295 }, { "entropy": 7.534389448165894, "epoch": 0.021384275429467532, "grad_norm": 0.93359375, "learning_rate": 0.0001495, "loss": 6.9976, "mean_token_accuracy": 0.10352390706539154, "num_tokens": 684048.0, "step": 300 }, { "entropy": 7.588808202743531, "epoch": 0.021740680019958658, "grad_norm": 1.171875, "learning_rate": 0.000152, "loss": 7.0077, "mean_token_accuracy": 0.10355912148952484, "num_tokens": 694590.0, "step": 305 }, { "entropy": 7.526580429077148, "epoch": 0.022097084610449784, "grad_norm": 0.890625, "learning_rate": 0.00015450000000000001, "loss": 6.9348, "mean_token_accuracy": 0.10375382453203201, "num_tokens": 706949.0, "step": 310 }, { "entropy": 7.53011155128479, "epoch": 0.02245348920094091, "grad_norm": 1.015625, "learning_rate": 0.000157, "loss": 7.0441, "mean_token_accuracy": 0.10697530284523964, "num_tokens": 717400.0, "step": 315 }, { "entropy": 7.550104141235352, "epoch": 0.022809893791432032, "grad_norm": 1.125, "learning_rate": 0.0001595, "loss": 6.9815, "mean_token_accuracy": 0.10357886925339699, "num_tokens": 728842.0, "step": 320 }, { "entropy": 7.465000009536743, "epoch": 0.023166298381923158, "grad_norm": 0.92578125, "learning_rate": 0.000162, "loss": 6.9683, "mean_token_accuracy": 0.10274564027786255, "num_tokens": 740598.0, "step": 325 }, { "entropy": 7.529222631454468, "epoch": 0.023522702972414284, "grad_norm": 0.94921875, "learning_rate": 0.00016450000000000001, "loss": 6.9989, "mean_token_accuracy": 0.1049557864665985, "num_tokens": 752512.0, "step": 330 }, { "entropy": 7.580902624130249, "epoch": 0.02387910756290541, "grad_norm": 1.0, "learning_rate": 0.00016700000000000002, "loss": 7.0602, "mean_token_accuracy": 0.09983156248927116, "num_tokens": 764679.0, "step": 335 }, { "entropy": 7.5142491340637205, "epoch": 0.024235512153396536, "grad_norm": 1.0703125, "learning_rate": 0.00016950000000000003, "loss": 7.0932, "mean_token_accuracy": 0.10753691717982292, "num_tokens": 776267.0, "step": 340 }, { "entropy": 7.439674139022827, "epoch": 0.02459191674388766, "grad_norm": 1.0390625, "learning_rate": 0.00017199999999999998, "loss": 6.8853, "mean_token_accuracy": 0.11588529199361801, "num_tokens": 788178.0, "step": 345 }, { "entropy": 7.517330646514893, "epoch": 0.024948321334378788, "grad_norm": 0.9765625, "learning_rate": 0.00017449999999999999, "loss": 6.9833, "mean_token_accuracy": 0.11000660359859467, "num_tokens": 798643.0, "step": 350 }, { "entropy": 7.445536041259766, "epoch": 0.025304725924869913, "grad_norm": 1.25, "learning_rate": 0.000177, "loss": 6.9894, "mean_token_accuracy": 0.10883523225784301, "num_tokens": 809448.0, "step": 355 }, { "entropy": 7.333874130249024, "epoch": 0.02566113051536104, "grad_norm": 0.99609375, "learning_rate": 0.0001795, "loss": 6.9268, "mean_token_accuracy": 0.11306785941123962, "num_tokens": 821107.0, "step": 360 }, { "entropy": 7.386691951751709, "epoch": 0.02601753510585216, "grad_norm": 1.15625, "learning_rate": 0.000182, "loss": 6.8761, "mean_token_accuracy": 0.11081241220235824, "num_tokens": 832800.0, "step": 365 }, { "entropy": 7.474579668045044, "epoch": 0.026373939696343288, "grad_norm": 0.96875, "learning_rate": 0.0001845, "loss": 6.928, "mean_token_accuracy": 0.11076254919171333, "num_tokens": 845207.0, "step": 370 }, { "entropy": 7.365311479568481, "epoch": 0.026730344286834413, "grad_norm": 1.015625, "learning_rate": 0.000187, "loss": 6.9474, "mean_token_accuracy": 0.11366913244128227, "num_tokens": 857270.0, "step": 375 }, { "entropy": 7.398762464523315, "epoch": 0.02708674887732554, "grad_norm": 0.91015625, "learning_rate": 0.0001895, "loss": 6.8581, "mean_token_accuracy": 0.11230278387665749, "num_tokens": 867892.0, "step": 380 }, { "entropy": 7.316660690307617, "epoch": 0.027443153467816665, "grad_norm": 0.91015625, "learning_rate": 0.000192, "loss": 6.7972, "mean_token_accuracy": 0.10899836272001266, "num_tokens": 879516.0, "step": 385 }, { "entropy": 7.332602882385254, "epoch": 0.02779955805830779, "grad_norm": 1.0234375, "learning_rate": 0.0001945, "loss": 6.7966, "mean_token_accuracy": 0.11280329450964928, "num_tokens": 889693.0, "step": 390 }, { "entropy": 7.21000304222107, "epoch": 0.028155962648798917, "grad_norm": 0.9765625, "learning_rate": 0.00019700000000000002, "loss": 6.8075, "mean_token_accuracy": 0.11519677788019181, "num_tokens": 901591.0, "step": 395 }, { "entropy": 7.289150762557983, "epoch": 0.028512367239290043, "grad_norm": 1.0703125, "learning_rate": 0.00019950000000000002, "loss": 6.7701, "mean_token_accuracy": 0.11484072580933571, "num_tokens": 912146.0, "step": 400 }, { "entropy": 7.22770209312439, "epoch": 0.02886877182978117, "grad_norm": 0.921875, "learning_rate": 0.000202, "loss": 6.6398, "mean_token_accuracy": 0.12384215593338013, "num_tokens": 923219.0, "step": 405 }, { "entropy": 7.202323579788208, "epoch": 0.029225176420272295, "grad_norm": 1.1953125, "learning_rate": 0.00020449999999999998, "loss": 6.6816, "mean_token_accuracy": 0.12373454198241234, "num_tokens": 934330.0, "step": 410 }, { "entropy": 7.256154108047485, "epoch": 0.029581581010763417, "grad_norm": 1.046875, "learning_rate": 0.000207, "loss": 6.7722, "mean_token_accuracy": 0.11721484363079071, "num_tokens": 944993.0, "step": 415 }, { "entropy": 7.258368110656738, "epoch": 0.029937985601254543, "grad_norm": 1.4453125, "learning_rate": 0.0002095, "loss": 6.8156, "mean_token_accuracy": 0.11557363644242287, "num_tokens": 955746.0, "step": 420 }, { "entropy": 7.2072389125823975, "epoch": 0.03029439019174567, "grad_norm": 1.0390625, "learning_rate": 0.000212, "loss": 6.8293, "mean_token_accuracy": 0.11993886753916741, "num_tokens": 966600.0, "step": 425 }, { "entropy": 7.266004419326782, "epoch": 0.030650794782236795, "grad_norm": 0.99609375, "learning_rate": 0.0002145, "loss": 6.805, "mean_token_accuracy": 0.1269981436431408, "num_tokens": 976984.0, "step": 430 }, { "entropy": 7.150535726547242, "epoch": 0.03100719937272792, "grad_norm": 0.95703125, "learning_rate": 0.00021700000000000002, "loss": 6.8464, "mean_token_accuracy": 0.11060970276594162, "num_tokens": 990221.0, "step": 435 }, { "entropy": 7.21864423751831, "epoch": 0.03136360396321904, "grad_norm": 1.2734375, "learning_rate": 0.0002195, "loss": 6.7375, "mean_token_accuracy": 0.1192592665553093, "num_tokens": 1001583.0, "step": 440 }, { "entropy": 7.220152044296265, "epoch": 0.03172000855371017, "grad_norm": 1.1953125, "learning_rate": 0.000222, "loss": 6.677, "mean_token_accuracy": 0.12302321866154671, "num_tokens": 1012170.0, "step": 445 }, { "entropy": 7.151835870742798, "epoch": 0.032076413144201295, "grad_norm": 1.125, "learning_rate": 0.0002245, "loss": 6.7166, "mean_token_accuracy": 0.11390936076641082, "num_tokens": 1022948.0, "step": 450 }, { "entropy": 7.09367880821228, "epoch": 0.03243281773469242, "grad_norm": 0.9921875, "learning_rate": 0.00022700000000000002, "loss": 6.7164, "mean_token_accuracy": 0.12434423863887786, "num_tokens": 1034764.0, "step": 455 }, { "entropy": 7.170623111724853, "epoch": 0.03278922232518355, "grad_norm": 0.9921875, "learning_rate": 0.00022950000000000002, "loss": 6.7499, "mean_token_accuracy": 0.12258012518286705, "num_tokens": 1046485.0, "step": 460 }, { "entropy": 7.13931450843811, "epoch": 0.03314562691567467, "grad_norm": 1.0390625, "learning_rate": 0.00023200000000000003, "loss": 6.6814, "mean_token_accuracy": 0.11752169504761696, "num_tokens": 1057819.0, "step": 465 }, { "entropy": 7.144642114639282, "epoch": 0.0335020315061658, "grad_norm": 1.1484375, "learning_rate": 0.00023449999999999998, "loss": 6.734, "mean_token_accuracy": 0.12212828546762466, "num_tokens": 1068905.0, "step": 470 }, { "entropy": 7.147123908996582, "epoch": 0.033858436096656924, "grad_norm": 1.09375, "learning_rate": 0.000237, "loss": 6.73, "mean_token_accuracy": 0.11864650025963783, "num_tokens": 1081033.0, "step": 475 }, { "entropy": 7.132015943527222, "epoch": 0.03421484068714805, "grad_norm": 1.1640625, "learning_rate": 0.0002395, "loss": 6.7168, "mean_token_accuracy": 0.1197434201836586, "num_tokens": 1091294.0, "step": 480 }, { "entropy": 6.992530441284179, "epoch": 0.034571245277639176, "grad_norm": 0.90234375, "learning_rate": 0.000242, "loss": 6.6487, "mean_token_accuracy": 0.11802349910140038, "num_tokens": 1103184.0, "step": 485 }, { "entropy": 7.111927604675293, "epoch": 0.0349276498681303, "grad_norm": 1.1015625, "learning_rate": 0.0002445, "loss": 6.7453, "mean_token_accuracy": 0.11722799465060234, "num_tokens": 1115141.0, "step": 490 }, { "entropy": 7.059013175964355, "epoch": 0.03528405445862143, "grad_norm": 1.0, "learning_rate": 0.000247, "loss": 6.6724, "mean_token_accuracy": 0.12403023093938828, "num_tokens": 1126021.0, "step": 495 }, { "entropy": 7.1118261337280275, "epoch": 0.035640459049112554, "grad_norm": 1.0859375, "learning_rate": 0.0002495, "loss": 6.7861, "mean_token_accuracy": 0.11621439829468727, "num_tokens": 1138198.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 266147382067200.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }