{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.07128091809822511, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742571830749512, "epoch": 0.0003564045904911255, "grad_norm": 5.375, "learning_rate": 2e-06, "loss": 10.7796, "mean_token_accuracy": 0.0001526242063846439, "num_tokens": 11399.0, "step": 5 }, { "entropy": 10.742592334747314, "epoch": 0.000712809180982251, "grad_norm": 5.65625, "learning_rate": 4.5e-06, "loss": 10.7732, "mean_token_accuracy": 0.00015220778295770286, "num_tokens": 22686.0, "step": 10 }, { "entropy": 10.742580223083497, "epoch": 0.0010692137714733766, "grad_norm": 5.28125, "learning_rate": 7e-06, "loss": 10.7223, "mean_token_accuracy": 0.0, "num_tokens": 32728.0, "step": 15 }, { "entropy": 10.742625427246093, "epoch": 0.001425618361964502, "grad_norm": 5.25, "learning_rate": 9.5e-06, "loss": 10.6798, "mean_token_accuracy": 0.0005484026798512787, "num_tokens": 42808.0, "step": 20 }, { "entropy": 10.742498874664307, "epoch": 0.0017820229524556277, "grad_norm": 4.75, "learning_rate": 1.2e-05, "loss": 10.5751, "mean_token_accuracy": 0.006744108803104609, "num_tokens": 54058.0, "step": 25 }, { "entropy": 10.742173194885254, "epoch": 0.002138427542946753, "grad_norm": 3.96875, "learning_rate": 1.4500000000000002e-05, "loss": 10.4546, "mean_token_accuracy": 0.025261138379573823, "num_tokens": 65338.0, "step": 30 }, { "entropy": 10.741145706176757, "epoch": 0.0024948321334378786, "grad_norm": 3.9375, "learning_rate": 1.7000000000000003e-05, "loss": 10.2901, "mean_token_accuracy": 0.034458070248365405, "num_tokens": 76598.0, "step": 35 }, { "entropy": 10.738759613037109, "epoch": 0.002851236723929004, "grad_norm": 2.65625, "learning_rate": 1.95e-05, "loss": 10.1426, "mean_token_accuracy": 0.039705483429133895, "num_tokens": 87364.0, "step": 40 }, { "entropy": 10.735179233551026, "epoch": 0.00320764131442013, "grad_norm": 2.359375, "learning_rate": 2.2e-05, "loss": 10.0394, "mean_token_accuracy": 0.04000021629035473, "num_tokens": 99019.0, "step": 45 }, { "entropy": 10.732727909088135, "epoch": 0.0035640459049112554, "grad_norm": 2.171875, "learning_rate": 2.4500000000000003e-05, "loss": 9.9672, "mean_token_accuracy": 0.04283946715295315, "num_tokens": 111087.0, "step": 50 }, { "entropy": 10.73162260055542, "epoch": 0.00392045049540238, "grad_norm": 2.140625, "learning_rate": 2.7e-05, "loss": 9.9085, "mean_token_accuracy": 0.03926678970456123, "num_tokens": 123401.0, "step": 55 }, { "entropy": 10.730762577056884, "epoch": 0.004276855085893506, "grad_norm": 2.171875, "learning_rate": 2.95e-05, "loss": 9.8396, "mean_token_accuracy": 0.04287007227540016, "num_tokens": 135554.0, "step": 60 }, { "entropy": 10.729378986358643, "epoch": 0.004633259676384632, "grad_norm": 2.09375, "learning_rate": 3.2e-05, "loss": 9.7598, "mean_token_accuracy": 0.0466454017907381, "num_tokens": 146700.0, "step": 65 }, { "entropy": 10.726875305175781, "epoch": 0.004989664266875757, "grad_norm": 1.9453125, "learning_rate": 3.4500000000000005e-05, "loss": 9.7227, "mean_token_accuracy": 0.041810817271471026, "num_tokens": 157606.0, "step": 70 }, { "entropy": 10.724038028717041, "epoch": 0.005346068857366883, "grad_norm": 1.9453125, "learning_rate": 3.7e-05, "loss": 9.664, "mean_token_accuracy": 0.04535525776445866, "num_tokens": 168705.0, "step": 75 }, { "entropy": 10.720051860809326, "epoch": 0.005702473447858008, "grad_norm": 2.09375, "learning_rate": 3.95e-05, "loss": 9.6147, "mean_token_accuracy": 0.04609923996031284, "num_tokens": 181497.0, "step": 80 }, { "entropy": 10.71345911026001, "epoch": 0.006058878038349134, "grad_norm": 1.9609375, "learning_rate": 4.2000000000000004e-05, "loss": 9.5166, "mean_token_accuracy": 0.0461752537637949, "num_tokens": 192991.0, "step": 85 }, { "entropy": 10.705201339721679, "epoch": 0.00641528262884026, "grad_norm": 2.109375, "learning_rate": 4.45e-05, "loss": 9.3949, "mean_token_accuracy": 0.049161479249596594, "num_tokens": 203969.0, "step": 90 }, { "entropy": 10.695504951477051, "epoch": 0.006771687219331385, "grad_norm": 1.8984375, "learning_rate": 4.7000000000000004e-05, "loss": 9.3681, "mean_token_accuracy": 0.049966185539960864, "num_tokens": 215809.0, "step": 95 }, { "entropy": 10.68418607711792, "epoch": 0.007128091809822511, "grad_norm": 1.796875, "learning_rate": 4.9500000000000004e-05, "loss": 9.316, "mean_token_accuracy": 0.048291167616844176, "num_tokens": 227826.0, "step": 100 }, { "entropy": 10.668262958526611, "epoch": 0.007484496400313636, "grad_norm": 1.9609375, "learning_rate": 5.2e-05, "loss": 9.1803, "mean_token_accuracy": 0.058137640729546546, "num_tokens": 240073.0, "step": 105 }, { "entropy": 10.644538402557373, "epoch": 0.00784090099080476, "grad_norm": 1.96875, "learning_rate": 5.45e-05, "loss": 9.0385, "mean_token_accuracy": 0.057943309843540194, "num_tokens": 251073.0, "step": 110 }, { "entropy": 10.616683769226075, "epoch": 0.008197305581295887, "grad_norm": 1.71875, "learning_rate": 5.7e-05, "loss": 9.0264, "mean_token_accuracy": 0.05736844353377819, "num_tokens": 264607.0, "step": 115 }, { "entropy": 10.58455696105957, "epoch": 0.008553710171787013, "grad_norm": 1.875, "learning_rate": 5.9499999999999996e-05, "loss": 8.7984, "mean_token_accuracy": 0.06613890007138253, "num_tokens": 275688.0, "step": 120 }, { "entropy": 10.523236083984376, "epoch": 0.008910114762278138, "grad_norm": 1.78125, "learning_rate": 6.2e-05, "loss": 8.652, "mean_token_accuracy": 0.06381725408136844, "num_tokens": 287024.0, "step": 125 }, { "entropy": 10.454036426544189, "epoch": 0.009266519352769264, "grad_norm": 1.828125, "learning_rate": 6.450000000000001e-05, "loss": 8.5662, "mean_token_accuracy": 0.06661000251770019, "num_tokens": 297605.0, "step": 130 }, { "entropy": 10.365349960327148, "epoch": 0.009622923943260388, "grad_norm": 1.828125, "learning_rate": 6.7e-05, "loss": 8.4279, "mean_token_accuracy": 0.06779800169169903, "num_tokens": 307956.0, "step": 135 }, { "entropy": 10.26084508895874, "epoch": 0.009979328533751514, "grad_norm": 1.6640625, "learning_rate": 6.950000000000001e-05, "loss": 8.3001, "mean_token_accuracy": 0.06663309819996358, "num_tokens": 318724.0, "step": 140 }, { "entropy": 10.160690593719483, "epoch": 0.01033573312424264, "grad_norm": 1.6015625, "learning_rate": 7.2e-05, "loss": 8.1425, "mean_token_accuracy": 0.07099423781037331, "num_tokens": 330488.0, "step": 145 }, { "entropy": 10.021271991729737, "epoch": 0.010692137714733766, "grad_norm": 1.359375, "learning_rate": 7.45e-05, "loss": 8.1226, "mean_token_accuracy": 0.07147609815001488, "num_tokens": 343057.0, "step": 150 }, { "entropy": 9.84426851272583, "epoch": 0.011048542305224892, "grad_norm": 1.265625, "learning_rate": 7.7e-05, "loss": 7.922, "mean_token_accuracy": 0.07516647689044476, "num_tokens": 355224.0, "step": 155 }, { "entropy": 9.662067031860351, "epoch": 0.011404946895716016, "grad_norm": 1.2421875, "learning_rate": 7.950000000000001e-05, "loss": 7.8644, "mean_token_accuracy": 0.07227759584784507, "num_tokens": 366926.0, "step": 160 }, { "entropy": 9.455039691925048, "epoch": 0.011761351486207142, "grad_norm": 1.171875, "learning_rate": 8.2e-05, "loss": 7.742, "mean_token_accuracy": 0.07173869498074055, "num_tokens": 378180.0, "step": 165 }, { "entropy": 9.217700099945068, "epoch": 0.012117756076698268, "grad_norm": 1.2265625, "learning_rate": 8.450000000000001e-05, "loss": 7.6739, "mean_token_accuracy": 0.07917889729142188, "num_tokens": 388639.0, "step": 170 }, { "entropy": 8.98402910232544, "epoch": 0.012474160667189394, "grad_norm": 1.0859375, "learning_rate": 8.7e-05, "loss": 7.563, "mean_token_accuracy": 0.08437970206141472, "num_tokens": 398752.0, "step": 175 }, { "entropy": 8.738731479644775, "epoch": 0.01283056525768052, "grad_norm": 0.88671875, "learning_rate": 8.95e-05, "loss": 7.4995, "mean_token_accuracy": 0.07861107215285301, "num_tokens": 411341.0, "step": 180 }, { "entropy": 8.582833385467529, "epoch": 0.013186969848171644, "grad_norm": 0.87890625, "learning_rate": 9.2e-05, "loss": 7.4019, "mean_token_accuracy": 0.07919293940067292, "num_tokens": 421736.0, "step": 185 }, { "entropy": 8.410860538482666, "epoch": 0.01354337443866277, "grad_norm": 0.87109375, "learning_rate": 9.45e-05, "loss": 7.4428, "mean_token_accuracy": 0.08342698290944099, "num_tokens": 432934.0, "step": 190 }, { "entropy": 8.250172996520996, "epoch": 0.013899779029153896, "grad_norm": 0.953125, "learning_rate": 9.7e-05, "loss": 7.3743, "mean_token_accuracy": 0.08416533321142197, "num_tokens": 442929.0, "step": 195 }, { "entropy": 8.198361492156982, "epoch": 0.014256183619645021, "grad_norm": 0.84375, "learning_rate": 9.95e-05, "loss": 7.3499, "mean_token_accuracy": 0.08039835765957833, "num_tokens": 455544.0, "step": 200 }, { "entropy": 8.08715353012085, "epoch": 0.014612588210136147, "grad_norm": 0.84375, "learning_rate": 0.000102, "loss": 7.2678, "mean_token_accuracy": 0.08803733438253403, "num_tokens": 466476.0, "step": 205 }, { "entropy": 8.042504119873048, "epoch": 0.014968992800627271, "grad_norm": 1.0859375, "learning_rate": 0.00010449999999999999, "loss": 7.2552, "mean_token_accuracy": 0.08520074412226677, "num_tokens": 477149.0, "step": 210 }, { "entropy": 7.974717617034912, "epoch": 0.015325397391118397, "grad_norm": 1.15625, "learning_rate": 0.000107, "loss": 7.3936, "mean_token_accuracy": 0.0847919188439846, "num_tokens": 489684.0, "step": 215 }, { "entropy": 7.970945692062378, "epoch": 0.01568180198160952, "grad_norm": 1.1484375, "learning_rate": 0.0001095, "loss": 7.32, "mean_token_accuracy": 0.08788989782333374, "num_tokens": 500724.0, "step": 220 }, { "entropy": 7.915714168548584, "epoch": 0.016038206572100647, "grad_norm": 1.2421875, "learning_rate": 0.000112, "loss": 7.1834, "mean_token_accuracy": 0.09220796525478363, "num_tokens": 511301.0, "step": 225 }, { "entropy": 7.900463056564331, "epoch": 0.016394611162591773, "grad_norm": 1.0625, "learning_rate": 0.0001145, "loss": 7.2187, "mean_token_accuracy": 0.08324612528085709, "num_tokens": 522925.0, "step": 230 }, { "entropy": 7.857335376739502, "epoch": 0.0167510157530829, "grad_norm": 1.0078125, "learning_rate": 0.00011700000000000001, "loss": 7.2262, "mean_token_accuracy": 0.09082898795604706, "num_tokens": 533742.0, "step": 235 }, { "entropy": 7.882049703598023, "epoch": 0.017107420343574025, "grad_norm": 0.89453125, "learning_rate": 0.00011949999999999999, "loss": 7.1824, "mean_token_accuracy": 0.0936901956796646, "num_tokens": 545526.0, "step": 240 }, { "entropy": 7.793568754196167, "epoch": 0.01746382493406515, "grad_norm": 0.96875, "learning_rate": 0.000122, "loss": 7.1257, "mean_token_accuracy": 0.09565059095621109, "num_tokens": 555735.0, "step": 245 }, { "entropy": 7.741059350967407, "epoch": 0.017820229524556277, "grad_norm": 1.0546875, "learning_rate": 0.0001245, "loss": 7.2118, "mean_token_accuracy": 0.09219442456960678, "num_tokens": 568443.0, "step": 250 }, { "entropy": 7.821925401687622, "epoch": 0.018176634115047403, "grad_norm": 1.0, "learning_rate": 0.000127, "loss": 7.1074, "mean_token_accuracy": 0.09640756845474244, "num_tokens": 579091.0, "step": 255 }, { "entropy": 7.703673696517944, "epoch": 0.01853303870553853, "grad_norm": 0.89453125, "learning_rate": 0.0001295, "loss": 7.0316, "mean_token_accuracy": 0.09788540452718734, "num_tokens": 591683.0, "step": 260 }, { "entropy": 7.649093818664551, "epoch": 0.018889443296029654, "grad_norm": 1.03125, "learning_rate": 0.000132, "loss": 7.1601, "mean_token_accuracy": 0.09608315378427505, "num_tokens": 603464.0, "step": 265 }, { "entropy": 7.753079223632812, "epoch": 0.019245847886520777, "grad_norm": 0.91796875, "learning_rate": 0.00013450000000000002, "loss": 7.2118, "mean_token_accuracy": 0.0977549560368061, "num_tokens": 615626.0, "step": 270 }, { "entropy": 7.689573907852173, "epoch": 0.019602252477011903, "grad_norm": 1.0703125, "learning_rate": 0.00013700000000000002, "loss": 7.1333, "mean_token_accuracy": 0.09726834744215011, "num_tokens": 627270.0, "step": 275 }, { "entropy": 7.662051963806152, "epoch": 0.01995865706750303, "grad_norm": 0.9453125, "learning_rate": 0.0001395, "loss": 7.0505, "mean_token_accuracy": 0.09889725744724273, "num_tokens": 638403.0, "step": 280 }, { "entropy": 7.641796112060547, "epoch": 0.020315061657994155, "grad_norm": 1.3046875, "learning_rate": 0.00014199999999999998, "loss": 7.0687, "mean_token_accuracy": 0.10083996653556823, "num_tokens": 650046.0, "step": 285 }, { "entropy": 7.634785175323486, "epoch": 0.02067146624848528, "grad_norm": 1.15625, "learning_rate": 0.0001445, "loss": 6.9997, "mean_token_accuracy": 0.10420416370034218, "num_tokens": 659818.0, "step": 290 }, { "entropy": 7.5922698974609375, "epoch": 0.021027870838976406, "grad_norm": 0.92578125, "learning_rate": 0.000147, "loss": 7.0209, "mean_token_accuracy": 0.10451438650488853, "num_tokens": 672404.0, "step": 295 }, { "entropy": 7.534389448165894, "epoch": 0.021384275429467532, "grad_norm": 0.93359375, "learning_rate": 0.0001495, "loss": 6.9976, "mean_token_accuracy": 0.10352390706539154, "num_tokens": 684048.0, "step": 300 }, { "entropy": 7.588808202743531, "epoch": 0.021740680019958658, "grad_norm": 1.171875, "learning_rate": 0.000152, "loss": 7.0077, "mean_token_accuracy": 0.10355912148952484, "num_tokens": 694590.0, "step": 305 }, { "entropy": 7.526580429077148, "epoch": 0.022097084610449784, "grad_norm": 0.890625, "learning_rate": 0.00015450000000000001, "loss": 6.9348, "mean_token_accuracy": 0.10375382453203201, "num_tokens": 706949.0, "step": 310 }, { "entropy": 7.53011155128479, "epoch": 0.02245348920094091, "grad_norm": 1.015625, "learning_rate": 0.000157, "loss": 7.0441, "mean_token_accuracy": 0.10697530284523964, "num_tokens": 717400.0, "step": 315 }, { "entropy": 7.550104141235352, "epoch": 0.022809893791432032, "grad_norm": 1.125, "learning_rate": 0.0001595, "loss": 6.9815, "mean_token_accuracy": 0.10357886925339699, "num_tokens": 728842.0, "step": 320 }, { "entropy": 7.465000009536743, "epoch": 0.023166298381923158, "grad_norm": 0.92578125, "learning_rate": 0.000162, "loss": 6.9683, "mean_token_accuracy": 0.10274564027786255, "num_tokens": 740598.0, "step": 325 }, { "entropy": 7.529222631454468, "epoch": 0.023522702972414284, "grad_norm": 0.94921875, "learning_rate": 0.00016450000000000001, "loss": 6.9989, "mean_token_accuracy": 0.1049557864665985, "num_tokens": 752512.0, "step": 330 }, { "entropy": 7.580902624130249, "epoch": 0.02387910756290541, "grad_norm": 1.0, "learning_rate": 0.00016700000000000002, "loss": 7.0602, "mean_token_accuracy": 0.09983156248927116, "num_tokens": 764679.0, "step": 335 }, { "entropy": 7.5142491340637205, "epoch": 0.024235512153396536, "grad_norm": 1.0703125, "learning_rate": 0.00016950000000000003, "loss": 7.0932, "mean_token_accuracy": 0.10753691717982292, "num_tokens": 776267.0, "step": 340 }, { "entropy": 7.439674139022827, "epoch": 0.02459191674388766, "grad_norm": 1.0390625, "learning_rate": 0.00017199999999999998, "loss": 6.8853, "mean_token_accuracy": 0.11588529199361801, "num_tokens": 788178.0, "step": 345 }, { "entropy": 7.517330646514893, "epoch": 0.024948321334378788, "grad_norm": 0.9765625, "learning_rate": 0.00017449999999999999, "loss": 6.9833, "mean_token_accuracy": 0.11000660359859467, "num_tokens": 798643.0, "step": 350 }, { "entropy": 7.445536041259766, "epoch": 0.025304725924869913, "grad_norm": 1.25, "learning_rate": 0.000177, "loss": 6.9894, "mean_token_accuracy": 0.10883523225784301, "num_tokens": 809448.0, "step": 355 }, { "entropy": 7.333874130249024, "epoch": 0.02566113051536104, "grad_norm": 0.99609375, "learning_rate": 0.0001795, "loss": 6.9268, "mean_token_accuracy": 0.11306785941123962, "num_tokens": 821107.0, "step": 360 }, { "entropy": 7.386691951751709, "epoch": 0.02601753510585216, "grad_norm": 1.15625, "learning_rate": 0.000182, "loss": 6.8761, "mean_token_accuracy": 0.11081241220235824, "num_tokens": 832800.0, "step": 365 }, { "entropy": 7.474579668045044, "epoch": 0.026373939696343288, "grad_norm": 0.96875, "learning_rate": 0.0001845, "loss": 6.928, "mean_token_accuracy": 0.11076254919171333, "num_tokens": 845207.0, "step": 370 }, { "entropy": 7.365311479568481, "epoch": 0.026730344286834413, "grad_norm": 1.015625, "learning_rate": 0.000187, "loss": 6.9474, "mean_token_accuracy": 0.11366913244128227, "num_tokens": 857270.0, "step": 375 }, { "entropy": 7.398762464523315, "epoch": 0.02708674887732554, "grad_norm": 0.91015625, "learning_rate": 0.0001895, "loss": 6.8581, "mean_token_accuracy": 0.11230278387665749, "num_tokens": 867892.0, "step": 380 }, { "entropy": 7.316660690307617, "epoch": 0.027443153467816665, "grad_norm": 0.91015625, "learning_rate": 0.000192, "loss": 6.7972, "mean_token_accuracy": 0.10899836272001266, "num_tokens": 879516.0, "step": 385 }, { "entropy": 7.332602882385254, "epoch": 0.02779955805830779, "grad_norm": 1.0234375, "learning_rate": 0.0001945, "loss": 6.7966, "mean_token_accuracy": 0.11280329450964928, "num_tokens": 889693.0, "step": 390 }, { "entropy": 7.21000304222107, "epoch": 0.028155962648798917, "grad_norm": 0.9765625, "learning_rate": 0.00019700000000000002, "loss": 6.8075, "mean_token_accuracy": 0.11519677788019181, "num_tokens": 901591.0, "step": 395 }, { "entropy": 7.289150762557983, "epoch": 0.028512367239290043, "grad_norm": 1.0703125, "learning_rate": 0.00019950000000000002, "loss": 6.7701, "mean_token_accuracy": 0.11484072580933571, "num_tokens": 912146.0, "step": 400 }, { "entropy": 7.22770209312439, "epoch": 0.02886877182978117, "grad_norm": 0.921875, "learning_rate": 0.000202, "loss": 6.6398, "mean_token_accuracy": 0.12384215593338013, "num_tokens": 923219.0, "step": 405 }, { "entropy": 7.202323579788208, "epoch": 0.029225176420272295, "grad_norm": 1.1953125, "learning_rate": 0.00020449999999999998, "loss": 6.6816, "mean_token_accuracy": 0.12373454198241234, "num_tokens": 934330.0, "step": 410 }, { "entropy": 7.256154108047485, "epoch": 0.029581581010763417, "grad_norm": 1.046875, "learning_rate": 0.000207, "loss": 6.7722, "mean_token_accuracy": 0.11721484363079071, "num_tokens": 944993.0, "step": 415 }, { "entropy": 7.258368110656738, "epoch": 0.029937985601254543, "grad_norm": 1.4453125, "learning_rate": 0.0002095, "loss": 6.8156, "mean_token_accuracy": 0.11557363644242287, "num_tokens": 955746.0, "step": 420 }, { "entropy": 7.2072389125823975, "epoch": 0.03029439019174567, "grad_norm": 1.0390625, "learning_rate": 0.000212, "loss": 6.8293, "mean_token_accuracy": 0.11993886753916741, "num_tokens": 966600.0, "step": 425 }, { "entropy": 7.266004419326782, "epoch": 0.030650794782236795, "grad_norm": 0.99609375, "learning_rate": 0.0002145, "loss": 6.805, "mean_token_accuracy": 0.1269981436431408, "num_tokens": 976984.0, "step": 430 }, { "entropy": 7.150535726547242, "epoch": 0.03100719937272792, "grad_norm": 0.95703125, "learning_rate": 0.00021700000000000002, "loss": 6.8464, "mean_token_accuracy": 0.11060970276594162, "num_tokens": 990221.0, "step": 435 }, { "entropy": 7.21864423751831, "epoch": 0.03136360396321904, "grad_norm": 1.2734375, "learning_rate": 0.0002195, "loss": 6.7375, "mean_token_accuracy": 0.1192592665553093, "num_tokens": 1001583.0, "step": 440 }, { "entropy": 7.220152044296265, "epoch": 0.03172000855371017, "grad_norm": 1.1953125, "learning_rate": 0.000222, "loss": 6.677, "mean_token_accuracy": 0.12302321866154671, "num_tokens": 1012170.0, "step": 445 }, { "entropy": 7.151835870742798, "epoch": 0.032076413144201295, "grad_norm": 1.125, "learning_rate": 0.0002245, "loss": 6.7166, "mean_token_accuracy": 0.11390936076641082, "num_tokens": 1022948.0, "step": 450 }, { "entropy": 7.09367880821228, "epoch": 0.03243281773469242, "grad_norm": 0.9921875, "learning_rate": 0.00022700000000000002, "loss": 6.7164, "mean_token_accuracy": 0.12434423863887786, "num_tokens": 1034764.0, "step": 455 }, { "entropy": 7.170623111724853, "epoch": 0.03278922232518355, "grad_norm": 0.9921875, "learning_rate": 0.00022950000000000002, "loss": 6.7499, "mean_token_accuracy": 0.12258012518286705, "num_tokens": 1046485.0, "step": 460 }, { "entropy": 7.13931450843811, "epoch": 0.03314562691567467, "grad_norm": 1.0390625, "learning_rate": 0.00023200000000000003, "loss": 6.6814, "mean_token_accuracy": 0.11752169504761696, "num_tokens": 1057819.0, "step": 465 }, { "entropy": 7.144642114639282, "epoch": 0.0335020315061658, "grad_norm": 1.1484375, "learning_rate": 0.00023449999999999998, "loss": 6.734, "mean_token_accuracy": 0.12212828546762466, "num_tokens": 1068905.0, "step": 470 }, { "entropy": 7.147123908996582, "epoch": 0.033858436096656924, "grad_norm": 1.09375, "learning_rate": 0.000237, "loss": 6.73, "mean_token_accuracy": 0.11864650025963783, "num_tokens": 1081033.0, "step": 475 }, { "entropy": 7.132015943527222, "epoch": 0.03421484068714805, "grad_norm": 1.1640625, "learning_rate": 0.0002395, "loss": 6.7168, "mean_token_accuracy": 0.1197434201836586, "num_tokens": 1091294.0, "step": 480 }, { "entropy": 6.992530441284179, "epoch": 0.034571245277639176, "grad_norm": 0.90234375, "learning_rate": 0.000242, "loss": 6.6487, "mean_token_accuracy": 0.11802349910140038, "num_tokens": 1103184.0, "step": 485 }, { "entropy": 7.111927604675293, "epoch": 0.0349276498681303, "grad_norm": 1.1015625, "learning_rate": 0.0002445, "loss": 6.7453, "mean_token_accuracy": 0.11722799465060234, "num_tokens": 1115141.0, "step": 490 }, { "entropy": 7.059013175964355, "epoch": 0.03528405445862143, "grad_norm": 1.0, "learning_rate": 0.000247, "loss": 6.6724, "mean_token_accuracy": 0.12403023093938828, "num_tokens": 1126021.0, "step": 495 }, { "entropy": 7.1118261337280275, "epoch": 0.035640459049112554, "grad_norm": 1.0859375, "learning_rate": 0.0002495, "loss": 6.7861, "mean_token_accuracy": 0.11621439829468727, "num_tokens": 1138198.0, "step": 500 }, { "entropy": 7.165898847579956, "epoch": 0.03599686363960368, "grad_norm": 1.0703125, "learning_rate": 0.000252, "loss": 6.6867, "mean_token_accuracy": 0.12091630846261978, "num_tokens": 1149477.0, "step": 505 }, { "entropy": 6.95703706741333, "epoch": 0.036353268230094805, "grad_norm": 1.171875, "learning_rate": 0.0002545, "loss": 6.658, "mean_token_accuracy": 0.1214058168232441, "num_tokens": 1160088.0, "step": 510 }, { "entropy": 7.09820671081543, "epoch": 0.03670967282058593, "grad_norm": 1.1328125, "learning_rate": 0.000257, "loss": 6.644, "mean_token_accuracy": 0.119209773093462, "num_tokens": 1171592.0, "step": 515 }, { "entropy": 6.949794054031372, "epoch": 0.03706607741107706, "grad_norm": 1.1796875, "learning_rate": 0.0002595, "loss": 6.5107, "mean_token_accuracy": 0.12729595527052878, "num_tokens": 1182696.0, "step": 520 }, { "entropy": 6.995568799972534, "epoch": 0.03742248200156818, "grad_norm": 0.93359375, "learning_rate": 0.000262, "loss": 6.6161, "mean_token_accuracy": 0.12147256955504418, "num_tokens": 1194334.0, "step": 525 }, { "entropy": 7.04883918762207, "epoch": 0.03777888659205931, "grad_norm": 0.96484375, "learning_rate": 0.00026450000000000003, "loss": 6.7079, "mean_token_accuracy": 0.11811556592583657, "num_tokens": 1206258.0, "step": 530 }, { "entropy": 6.914236545562744, "epoch": 0.03813529118255043, "grad_norm": 1.0234375, "learning_rate": 0.00026700000000000004, "loss": 6.6213, "mean_token_accuracy": 0.1181189239025116, "num_tokens": 1219233.0, "step": 535 }, { "entropy": 7.0149024486541744, "epoch": 0.038491695773041554, "grad_norm": 1.0625, "learning_rate": 0.00026950000000000005, "loss": 6.6481, "mean_token_accuracy": 0.12671870738267899, "num_tokens": 1230581.0, "step": 540 }, { "entropy": 7.061033487319946, "epoch": 0.03884810036353268, "grad_norm": 0.99609375, "learning_rate": 0.00027200000000000005, "loss": 6.6519, "mean_token_accuracy": 0.12108869552612304, "num_tokens": 1242046.0, "step": 545 }, { "entropy": 7.034649324417114, "epoch": 0.039204504954023806, "grad_norm": 1.0078125, "learning_rate": 0.0002745, "loss": 6.6349, "mean_token_accuracy": 0.12597717642784118, "num_tokens": 1254167.0, "step": 550 }, { "entropy": 6.992681217193604, "epoch": 0.03956090954451493, "grad_norm": 1.1015625, "learning_rate": 0.000277, "loss": 6.6283, "mean_token_accuracy": 0.12463193610310555, "num_tokens": 1265613.0, "step": 555 }, { "entropy": 7.001772451400757, "epoch": 0.03991731413500606, "grad_norm": 0.95703125, "learning_rate": 0.0002795, "loss": 6.7235, "mean_token_accuracy": 0.12044223845005035, "num_tokens": 1277347.0, "step": 560 }, { "entropy": 7.027985954284668, "epoch": 0.04027371872549718, "grad_norm": 1.0078125, "learning_rate": 0.00028199999999999997, "loss": 6.6211, "mean_token_accuracy": 0.1214037649333477, "num_tokens": 1289523.0, "step": 565 }, { "entropy": 6.880720520019532, "epoch": 0.04063012331598831, "grad_norm": 0.890625, "learning_rate": 0.0002845, "loss": 6.5531, "mean_token_accuracy": 0.12212896570563317, "num_tokens": 1302811.0, "step": 570 }, { "entropy": 6.998388957977295, "epoch": 0.040986527906479435, "grad_norm": 1.1484375, "learning_rate": 0.000287, "loss": 6.5889, "mean_token_accuracy": 0.12987946718931198, "num_tokens": 1313312.0, "step": 575 }, { "entropy": 6.876024341583252, "epoch": 0.04134293249697056, "grad_norm": 1.1796875, "learning_rate": 0.0002895, "loss": 6.5007, "mean_token_accuracy": 0.12956202328205108, "num_tokens": 1324211.0, "step": 580 }, { "entropy": 6.991645812988281, "epoch": 0.04169933708746169, "grad_norm": 1.078125, "learning_rate": 0.000292, "loss": 6.5618, "mean_token_accuracy": 0.12750987112522125, "num_tokens": 1334630.0, "step": 585 }, { "entropy": 6.935083198547363, "epoch": 0.04205574167795281, "grad_norm": 1.0234375, "learning_rate": 0.0002945, "loss": 6.6521, "mean_token_accuracy": 0.11829652786254882, "num_tokens": 1346765.0, "step": 590 }, { "entropy": 6.905052947998047, "epoch": 0.04241214626844394, "grad_norm": 1.0234375, "learning_rate": 0.000297, "loss": 6.5791, "mean_token_accuracy": 0.12493314743041992, "num_tokens": 1358328.0, "step": 595 }, { "entropy": 6.977377986907959, "epoch": 0.042768550858935064, "grad_norm": 1.125, "learning_rate": 0.0002995, "loss": 6.5177, "mean_token_accuracy": 0.12914821356534958, "num_tokens": 1369679.0, "step": 600 }, { "entropy": 6.795419549942016, "epoch": 0.04312495544942619, "grad_norm": 1.1328125, "learning_rate": 0.000302, "loss": 6.4988, "mean_token_accuracy": 0.131401277333498, "num_tokens": 1380819.0, "step": 605 }, { "entropy": 6.811457586288452, "epoch": 0.043481360039917316, "grad_norm": 1.0546875, "learning_rate": 0.0003045, "loss": 6.4622, "mean_token_accuracy": 0.13207267299294473, "num_tokens": 1391634.0, "step": 610 }, { "entropy": 6.793901538848877, "epoch": 0.04383776463040844, "grad_norm": 1.1171875, "learning_rate": 0.000307, "loss": 6.4491, "mean_token_accuracy": 0.13501692414283753, "num_tokens": 1403502.0, "step": 615 }, { "entropy": 6.929700136184692, "epoch": 0.04419416922089957, "grad_norm": 1.109375, "learning_rate": 0.0003095, "loss": 6.6266, "mean_token_accuracy": 0.12311487495899201, "num_tokens": 1415154.0, "step": 620 }, { "entropy": 6.988297605514527, "epoch": 0.044550573811390694, "grad_norm": 1.0546875, "learning_rate": 0.000312, "loss": 6.6518, "mean_token_accuracy": 0.12687993273139, "num_tokens": 1427373.0, "step": 625 }, { "entropy": 6.761775636672974, "epoch": 0.04490697840188182, "grad_norm": 1.0625, "learning_rate": 0.0003145, "loss": 6.4766, "mean_token_accuracy": 0.12533363997936248, "num_tokens": 1438366.0, "step": 630 }, { "entropy": 6.912030506134033, "epoch": 0.04526338299237294, "grad_norm": 1.1484375, "learning_rate": 0.000317, "loss": 6.5966, "mean_token_accuracy": 0.12334503754973411, "num_tokens": 1450263.0, "step": 635 }, { "entropy": 6.9853339195251465, "epoch": 0.045619787582864064, "grad_norm": 0.921875, "learning_rate": 0.0003195, "loss": 6.6467, "mean_token_accuracy": 0.12394749969244004, "num_tokens": 1461545.0, "step": 640 }, { "entropy": 6.7714978694915775, "epoch": 0.04597619217335519, "grad_norm": 1.09375, "learning_rate": 0.000322, "loss": 6.5482, "mean_token_accuracy": 0.13250895142555236, "num_tokens": 1472475.0, "step": 645 }, { "entropy": 6.914073848724366, "epoch": 0.046332596763846316, "grad_norm": 1.171875, "learning_rate": 0.00032450000000000003, "loss": 6.5147, "mean_token_accuracy": 0.12853944823145866, "num_tokens": 1483360.0, "step": 650 }, { "entropy": 6.7364819049835205, "epoch": 0.04668900135433744, "grad_norm": 0.9765625, "learning_rate": 0.00032700000000000003, "loss": 6.5725, "mean_token_accuracy": 0.126601692289114, "num_tokens": 1495306.0, "step": 655 }, { "entropy": 6.908847141265869, "epoch": 0.04704540594482857, "grad_norm": 1.1640625, "learning_rate": 0.00032950000000000004, "loss": 6.4701, "mean_token_accuracy": 0.1324954815208912, "num_tokens": 1506595.0, "step": 660 }, { "entropy": 6.72453932762146, "epoch": 0.047401810535319694, "grad_norm": 1.0, "learning_rate": 0.00033200000000000005, "loss": 6.4883, "mean_token_accuracy": 0.1351894736289978, "num_tokens": 1517657.0, "step": 665 }, { "entropy": 6.76901330947876, "epoch": 0.04775821512581082, "grad_norm": 1.1875, "learning_rate": 0.00033450000000000005, "loss": 6.5066, "mean_token_accuracy": 0.12837395146489144, "num_tokens": 1528780.0, "step": 670 }, { "entropy": 6.883447074890137, "epoch": 0.048114619716301946, "grad_norm": 1.109375, "learning_rate": 0.000337, "loss": 6.6557, "mean_token_accuracy": 0.12886545956134796, "num_tokens": 1541282.0, "step": 675 }, { "entropy": 6.983727931976318, "epoch": 0.04847102430679307, "grad_norm": 0.921875, "learning_rate": 0.0003395, "loss": 6.6294, "mean_token_accuracy": 0.12646585181355477, "num_tokens": 1552176.0, "step": 680 }, { "entropy": 6.7384772300720215, "epoch": 0.0488274288972842, "grad_norm": 1.078125, "learning_rate": 0.000342, "loss": 6.4845, "mean_token_accuracy": 0.13945906087756157, "num_tokens": 1562610.0, "step": 685 }, { "entropy": 6.775937175750732, "epoch": 0.04918383348777532, "grad_norm": 0.98828125, "learning_rate": 0.00034449999999999997, "loss": 6.5136, "mean_token_accuracy": 0.13401032537221907, "num_tokens": 1573800.0, "step": 690 }, { "entropy": 6.877204656600952, "epoch": 0.04954023807826645, "grad_norm": 1.03125, "learning_rate": 0.000347, "loss": 6.4827, "mean_token_accuracy": 0.13020721524953843, "num_tokens": 1584090.0, "step": 695 }, { "entropy": 6.9024406433105465, "epoch": 0.049896642668757575, "grad_norm": 1.09375, "learning_rate": 0.0003495, "loss": 6.6362, "mean_token_accuracy": 0.1303427055478096, "num_tokens": 1595784.0, "step": 700 }, { "entropy": 6.756772804260254, "epoch": 0.0502530472592487, "grad_norm": 0.98046875, "learning_rate": 0.000352, "loss": 6.482, "mean_token_accuracy": 0.13334475085139275, "num_tokens": 1607655.0, "step": 705 }, { "entropy": 6.8570647716522215, "epoch": 0.05060945184973983, "grad_norm": 1.0546875, "learning_rate": 0.0003545, "loss": 6.5875, "mean_token_accuracy": 0.124277064204216, "num_tokens": 1619488.0, "step": 710 }, { "entropy": 6.745927190780639, "epoch": 0.05096585644023095, "grad_norm": 0.97265625, "learning_rate": 0.000357, "loss": 6.429, "mean_token_accuracy": 0.13606646284461021, "num_tokens": 1631854.0, "step": 715 }, { "entropy": 6.785527133941651, "epoch": 0.05132226103072208, "grad_norm": 0.87109375, "learning_rate": 0.0003595, "loss": 6.4182, "mean_token_accuracy": 0.13637634217739106, "num_tokens": 1643039.0, "step": 720 }, { "entropy": 6.759277868270874, "epoch": 0.051678665621213205, "grad_norm": 1.2578125, "learning_rate": 0.000362, "loss": 6.4038, "mean_token_accuracy": 0.13771493583917618, "num_tokens": 1654398.0, "step": 725 }, { "entropy": 6.646927261352539, "epoch": 0.05203507021170432, "grad_norm": 0.9921875, "learning_rate": 0.0003645, "loss": 6.4415, "mean_token_accuracy": 0.1340085059404373, "num_tokens": 1665853.0, "step": 730 }, { "entropy": 6.707148218154908, "epoch": 0.05239147480219545, "grad_norm": 0.9296875, "learning_rate": 0.000367, "loss": 6.5177, "mean_token_accuracy": 0.12795716300606727, "num_tokens": 1677116.0, "step": 735 }, { "entropy": 6.809055185317993, "epoch": 0.052747879392686575, "grad_norm": 0.96484375, "learning_rate": 0.0003695, "loss": 6.4727, "mean_token_accuracy": 0.12375391125679017, "num_tokens": 1688429.0, "step": 740 }, { "entropy": 6.689341831207275, "epoch": 0.0531042839831777, "grad_norm": 1.1015625, "learning_rate": 0.000372, "loss": 6.4236, "mean_token_accuracy": 0.12736357524991035, "num_tokens": 1698462.0, "step": 745 }, { "entropy": 6.835480451583862, "epoch": 0.05346068857366883, "grad_norm": 0.97265625, "learning_rate": 0.0003745, "loss": 6.5816, "mean_token_accuracy": 0.12983981892466545, "num_tokens": 1710856.0, "step": 750 }, { "entropy": 6.8312695026397705, "epoch": 0.05381709316415995, "grad_norm": 0.9453125, "learning_rate": 0.000377, "loss": 6.4812, "mean_token_accuracy": 0.13393254578113556, "num_tokens": 1721241.0, "step": 755 }, { "entropy": 6.739031744003296, "epoch": 0.05417349775465108, "grad_norm": 0.93359375, "learning_rate": 0.0003795, "loss": 6.5516, "mean_token_accuracy": 0.12359286397695542, "num_tokens": 1733352.0, "step": 760 }, { "entropy": 6.7102278709411625, "epoch": 0.054529902345142205, "grad_norm": 0.97265625, "learning_rate": 0.000382, "loss": 6.4266, "mean_token_accuracy": 0.13157257735729216, "num_tokens": 1744935.0, "step": 765 }, { "entropy": 6.713577079772949, "epoch": 0.05488630693563333, "grad_norm": 1.125, "learning_rate": 0.0003845, "loss": 6.5414, "mean_token_accuracy": 0.13242409154772758, "num_tokens": 1756853.0, "step": 770 }, { "entropy": 6.73391637802124, "epoch": 0.055242711526124456, "grad_norm": 1.015625, "learning_rate": 0.00038700000000000003, "loss": 6.4323, "mean_token_accuracy": 0.13262861594557762, "num_tokens": 1768563.0, "step": 775 }, { "entropy": 6.727639198303223, "epoch": 0.05559911611661558, "grad_norm": 0.94140625, "learning_rate": 0.00038950000000000003, "loss": 6.4837, "mean_token_accuracy": 0.1318040557205677, "num_tokens": 1781122.0, "step": 780 }, { "entropy": 6.765384674072266, "epoch": 0.05595552070710671, "grad_norm": 1.0859375, "learning_rate": 0.00039200000000000004, "loss": 6.4905, "mean_token_accuracy": 0.1305277794599533, "num_tokens": 1792844.0, "step": 785 }, { "entropy": 6.762694787979126, "epoch": 0.056311925297597834, "grad_norm": 0.9921875, "learning_rate": 0.00039450000000000005, "loss": 6.5816, "mean_token_accuracy": 0.13148098587989807, "num_tokens": 1804558.0, "step": 790 }, { "entropy": 6.628223323822022, "epoch": 0.05666832988808896, "grad_norm": 0.984375, "learning_rate": 0.00039700000000000005, "loss": 6.3768, "mean_token_accuracy": 0.1320876434445381, "num_tokens": 1818413.0, "step": 795 }, { "entropy": 6.7265161037445065, "epoch": 0.057024734478580086, "grad_norm": 0.9609375, "learning_rate": 0.0003995, "loss": 6.434, "mean_token_accuracy": 0.12983452826738356, "num_tokens": 1828987.0, "step": 800 }, { "entropy": 6.651925802230835, "epoch": 0.05738113906907121, "grad_norm": 1.109375, "learning_rate": 0.000402, "loss": 6.3597, "mean_token_accuracy": 0.13189667835831642, "num_tokens": 1839797.0, "step": 805 }, { "entropy": 6.78912935256958, "epoch": 0.05773754365956234, "grad_norm": 0.984375, "learning_rate": 0.0004045, "loss": 6.5578, "mean_token_accuracy": 0.13069733381271362, "num_tokens": 1850979.0, "step": 810 }, { "entropy": 6.611517429351807, "epoch": 0.05809394825005346, "grad_norm": 1.0078125, "learning_rate": 0.00040699999999999997, "loss": 6.3432, "mean_token_accuracy": 0.12866022661328316, "num_tokens": 1862328.0, "step": 815 }, { "entropy": 6.648383569717407, "epoch": 0.05845035284054459, "grad_norm": 1.109375, "learning_rate": 0.0004095, "loss": 6.2747, "mean_token_accuracy": 0.13372489884495736, "num_tokens": 1872347.0, "step": 820 }, { "entropy": 6.708392572402954, "epoch": 0.05880675743103571, "grad_norm": 1.0625, "learning_rate": 0.000412, "loss": 6.5044, "mean_token_accuracy": 0.13602936267852783, "num_tokens": 1883523.0, "step": 825 }, { "entropy": 6.62314805984497, "epoch": 0.059163162021526834, "grad_norm": 0.890625, "learning_rate": 0.0004145, "loss": 6.4716, "mean_token_accuracy": 0.13223329558968544, "num_tokens": 1895686.0, "step": 830 }, { "entropy": 6.793389987945557, "epoch": 0.05951956661201796, "grad_norm": 1.046875, "learning_rate": 0.000417, "loss": 6.555, "mean_token_accuracy": 0.13007057085633278, "num_tokens": 1908262.0, "step": 835 }, { "entropy": 6.7379124641418455, "epoch": 0.059875971202509086, "grad_norm": 1.0859375, "learning_rate": 0.0004195, "loss": 6.4524, "mean_token_accuracy": 0.13491783887147904, "num_tokens": 1919907.0, "step": 840 }, { "entropy": 6.659872436523438, "epoch": 0.06023237579300021, "grad_norm": 0.9609375, "learning_rate": 0.000422, "loss": 6.3794, "mean_token_accuracy": 0.13242117315530777, "num_tokens": 1931671.0, "step": 845 }, { "entropy": 6.677573537826538, "epoch": 0.06058878038349134, "grad_norm": 1.0390625, "learning_rate": 0.0004245, "loss": 6.4063, "mean_token_accuracy": 0.1419834591448307, "num_tokens": 1941687.0, "step": 850 }, { "entropy": 6.6825648784637455, "epoch": 0.060945184973982464, "grad_norm": 1.0078125, "learning_rate": 0.000427, "loss": 6.4172, "mean_token_accuracy": 0.13183393254876136, "num_tokens": 1953444.0, "step": 855 }, { "entropy": 6.597352790832519, "epoch": 0.06130158956447359, "grad_norm": 1.0546875, "learning_rate": 0.0004295, "loss": 6.4252, "mean_token_accuracy": 0.1228848785161972, "num_tokens": 1964999.0, "step": 860 }, { "entropy": 6.660594177246094, "epoch": 0.061657994154964715, "grad_norm": 1.03125, "learning_rate": 0.000432, "loss": 6.4603, "mean_token_accuracy": 0.12707777544856072, "num_tokens": 1977452.0, "step": 865 }, { "entropy": 6.819603204727173, "epoch": 0.06201439874545584, "grad_norm": 1.0390625, "learning_rate": 0.0004345, "loss": 6.5555, "mean_token_accuracy": 0.12444835752248765, "num_tokens": 1988362.0, "step": 870 }, { "entropy": 6.520086097717285, "epoch": 0.06237080333594697, "grad_norm": 1.0625, "learning_rate": 0.000437, "loss": 6.3114, "mean_token_accuracy": 0.13859584480524062, "num_tokens": 2000201.0, "step": 875 }, { "entropy": 6.698511362075806, "epoch": 0.06272720792643809, "grad_norm": 0.921875, "learning_rate": 0.0004395, "loss": 6.4336, "mean_token_accuracy": 0.13139647170901297, "num_tokens": 2011944.0, "step": 880 }, { "entropy": 6.610819149017334, "epoch": 0.06308361251692922, "grad_norm": 1.046875, "learning_rate": 0.000442, "loss": 6.456, "mean_token_accuracy": 0.1323610559105873, "num_tokens": 2023630.0, "step": 885 }, { "entropy": 6.629882764816284, "epoch": 0.06344001710742034, "grad_norm": 0.92578125, "learning_rate": 0.0004445, "loss": 6.4278, "mean_token_accuracy": 0.1294134572148323, "num_tokens": 2036171.0, "step": 890 }, { "entropy": 6.699557304382324, "epoch": 0.06379642169791147, "grad_norm": 0.79296875, "learning_rate": 0.000447, "loss": 6.441, "mean_token_accuracy": 0.13226123079657554, "num_tokens": 2049504.0, "step": 895 }, { "entropy": 6.537369918823242, "epoch": 0.06415282628840259, "grad_norm": 1.2421875, "learning_rate": 0.00044950000000000003, "loss": 6.383, "mean_token_accuracy": 0.13730206191539765, "num_tokens": 2059325.0, "step": 900 }, { "entropy": 6.74651985168457, "epoch": 0.06450923087889372, "grad_norm": 1.1015625, "learning_rate": 0.00045200000000000004, "loss": 6.4479, "mean_token_accuracy": 0.13434667736291886, "num_tokens": 2070412.0, "step": 905 }, { "entropy": 6.6923853874206545, "epoch": 0.06486563546938484, "grad_norm": 1.0234375, "learning_rate": 0.00045450000000000004, "loss": 6.4556, "mean_token_accuracy": 0.1349116161465645, "num_tokens": 2080236.0, "step": 910 }, { "entropy": 6.508125162124633, "epoch": 0.06522204005987597, "grad_norm": 1.0078125, "learning_rate": 0.00045700000000000005, "loss": 6.354, "mean_token_accuracy": 0.12869082465767862, "num_tokens": 2091518.0, "step": 915 }, { "entropy": 6.685258865356445, "epoch": 0.0655784446503671, "grad_norm": 0.94921875, "learning_rate": 0.00045950000000000006, "loss": 6.3914, "mean_token_accuracy": 0.13282919228076934, "num_tokens": 2101516.0, "step": 920 }, { "entropy": 6.615972900390625, "epoch": 0.06593484924085823, "grad_norm": 1.0234375, "learning_rate": 0.000462, "loss": 6.3598, "mean_token_accuracy": 0.1325875200331211, "num_tokens": 2112528.0, "step": 925 }, { "entropy": 6.45463752746582, "epoch": 0.06629125383134934, "grad_norm": 1.109375, "learning_rate": 0.0004645, "loss": 6.2579, "mean_token_accuracy": 0.13719168826937675, "num_tokens": 2123141.0, "step": 930 }, { "entropy": 6.491483449935913, "epoch": 0.06664765842184048, "grad_norm": 0.92578125, "learning_rate": 0.000467, "loss": 6.2799, "mean_token_accuracy": 0.13875195309519767, "num_tokens": 2133846.0, "step": 935 }, { "entropy": 6.569090509414673, "epoch": 0.0670040630123316, "grad_norm": 0.9921875, "learning_rate": 0.0004695, "loss": 6.3159, "mean_token_accuracy": 0.1401278555393219, "num_tokens": 2145149.0, "step": 940 }, { "entropy": 6.563496923446655, "epoch": 0.06736046760282273, "grad_norm": 0.96484375, "learning_rate": 0.000472, "loss": 6.4206, "mean_token_accuracy": 0.1346551574766636, "num_tokens": 2157701.0, "step": 945 }, { "entropy": 6.657681465148926, "epoch": 0.06771687219331385, "grad_norm": 1.03125, "learning_rate": 0.0004745, "loss": 6.5454, "mean_token_accuracy": 0.12614896148443222, "num_tokens": 2169628.0, "step": 950 }, { "entropy": 6.63694200515747, "epoch": 0.06807327678380498, "grad_norm": 1.09375, "learning_rate": 0.000477, "loss": 6.4097, "mean_token_accuracy": 0.1357708416879177, "num_tokens": 2180514.0, "step": 955 }, { "entropy": 6.544112730026245, "epoch": 0.0684296813742961, "grad_norm": 1.015625, "learning_rate": 0.0004795, "loss": 6.3959, "mean_token_accuracy": 0.13459453284740447, "num_tokens": 2191444.0, "step": 960 }, { "entropy": 6.548870086669922, "epoch": 0.06878608596478723, "grad_norm": 1.046875, "learning_rate": 0.000482, "loss": 6.2975, "mean_token_accuracy": 0.14402723759412767, "num_tokens": 2201697.0, "step": 965 }, { "entropy": 6.695021486282348, "epoch": 0.06914249055527835, "grad_norm": 0.921875, "learning_rate": 0.0004845, "loss": 6.4719, "mean_token_accuracy": 0.1333928443491459, "num_tokens": 2214445.0, "step": 970 }, { "entropy": 6.353151130676269, "epoch": 0.06949889514576947, "grad_norm": 1.171875, "learning_rate": 0.000487, "loss": 6.3057, "mean_token_accuracy": 0.1354503057897091, "num_tokens": 2225641.0, "step": 975 }, { "entropy": 6.599798679351807, "epoch": 0.0698552997362606, "grad_norm": 0.9921875, "learning_rate": 0.0004895, "loss": 6.3392, "mean_token_accuracy": 0.13334417194128037, "num_tokens": 2236361.0, "step": 980 }, { "entropy": 6.480152273178101, "epoch": 0.07021170432675172, "grad_norm": 0.984375, "learning_rate": 0.000492, "loss": 6.2559, "mean_token_accuracy": 0.13550300300121307, "num_tokens": 2248165.0, "step": 985 }, { "entropy": 6.541980743408203, "epoch": 0.07056810891724286, "grad_norm": 1.046875, "learning_rate": 0.0004945, "loss": 6.3156, "mean_token_accuracy": 0.13731209933757782, "num_tokens": 2259620.0, "step": 990 }, { "entropy": 6.51890196800232, "epoch": 0.07092451350773397, "grad_norm": 1.09375, "learning_rate": 0.000497, "loss": 6.3517, "mean_token_accuracy": 0.13439717069268226, "num_tokens": 2272002.0, "step": 995 }, { "entropy": 6.613651514053345, "epoch": 0.07128091809822511, "grad_norm": 1.0078125, "learning_rate": 0.0004995, "loss": 6.3743, "mean_token_accuracy": 0.13549346923828126, "num_tokens": 2283141.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 539080254259200.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }