{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.6333484779645615, "eval_steps": 500, "global_step": 4000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 7.164702081680298, "epoch": 0.004543389368468878, "grad_norm": 1.0390625, "learning_rate": 2e-06, "loss": 6.747, "mean_token_accuracy": 0.10336653664708137, "num_tokens": 10156.0, "step": 5 }, { "entropy": 7.202920770645141, "epoch": 0.009086778736937756, "grad_norm": 0.953125, "learning_rate": 4.5e-06, "loss": 6.7119, "mean_token_accuracy": 0.10359775125980378, "num_tokens": 20669.0, "step": 10 }, { "entropy": 7.195320177078247, "epoch": 0.013630168105406633, "grad_norm": 1.015625, "learning_rate": 7e-06, "loss": 6.8681, "mean_token_accuracy": 0.10121074020862579, "num_tokens": 30952.0, "step": 15 }, { "entropy": 7.181957340240478, "epoch": 0.01817355747387551, "grad_norm": 1.109375, "learning_rate": 9.5e-06, "loss": 6.6577, "mean_token_accuracy": 0.1091083861887455, "num_tokens": 41429.0, "step": 20 }, { "entropy": 7.118825626373291, "epoch": 0.02271694684234439, "grad_norm": 1.0078125, "learning_rate": 1.2e-05, "loss": 6.6923, "mean_token_accuracy": 0.10817872360348701, "num_tokens": 52166.0, "step": 25 }, { "entropy": 7.141914033889771, "epoch": 0.027260336210813266, "grad_norm": 0.9375, "learning_rate": 1.4500000000000002e-05, "loss": 6.7689, "mean_token_accuracy": 0.10555170774459839, "num_tokens": 61670.0, "step": 30 }, { "entropy": 7.10323133468628, "epoch": 0.03180372557928214, "grad_norm": 0.9296875, "learning_rate": 1.7000000000000003e-05, "loss": 6.7218, "mean_token_accuracy": 0.10314013063907623, "num_tokens": 71702.0, "step": 35 }, { "entropy": 7.063247537612915, "epoch": 0.03634711494775102, "grad_norm": 0.9609375, "learning_rate": 1.95e-05, "loss": 6.6454, "mean_token_accuracy": 0.1140250563621521, "num_tokens": 82840.0, "step": 40 }, { "entropy": 7.078653001785279, "epoch": 0.0408905043162199, "grad_norm": 0.91015625, "learning_rate": 2.2e-05, "loss": 6.6923, "mean_token_accuracy": 0.10924328565597534, "num_tokens": 92290.0, "step": 45 }, { "entropy": 7.114263725280762, "epoch": 0.04543389368468878, "grad_norm": 0.92578125, "learning_rate": 2.4500000000000003e-05, "loss": 6.6761, "mean_token_accuracy": 0.10787095576524734, "num_tokens": 101842.0, "step": 50 }, { "entropy": 7.1406755447387695, "epoch": 0.049977283053157656, "grad_norm": 1.0859375, "learning_rate": 2.7e-05, "loss": 6.8497, "mean_token_accuracy": 0.09816754907369614, "num_tokens": 114030.0, "step": 55 }, { "entropy": 7.09134955406189, "epoch": 0.05452067242162653, "grad_norm": 0.86328125, "learning_rate": 2.95e-05, "loss": 6.7197, "mean_token_accuracy": 0.10756717920303345, "num_tokens": 124349.0, "step": 60 }, { "entropy": 7.176341104507446, "epoch": 0.059064061790095414, "grad_norm": 1.046875, "learning_rate": 3.2e-05, "loss": 6.6648, "mean_token_accuracy": 0.11219555139541626, "num_tokens": 133534.0, "step": 65 }, { "entropy": 7.076372528076172, "epoch": 0.06360745115856428, "grad_norm": 0.92578125, "learning_rate": 3.4500000000000005e-05, "loss": 6.6403, "mean_token_accuracy": 0.10651129633188247, "num_tokens": 144383.0, "step": 70 }, { "entropy": 7.107057428359985, "epoch": 0.06815084052703317, "grad_norm": 0.84765625, "learning_rate": 3.7e-05, "loss": 6.7266, "mean_token_accuracy": 0.10738222151994706, "num_tokens": 155467.0, "step": 75 }, { "entropy": 7.098436498641968, "epoch": 0.07269422989550205, "grad_norm": 0.875, "learning_rate": 3.95e-05, "loss": 6.7741, "mean_token_accuracy": 0.10665511935949326, "num_tokens": 165903.0, "step": 80 }, { "entropy": 7.2096319675445555, "epoch": 0.07723761926397092, "grad_norm": 1.1171875, "learning_rate": 4.2000000000000004e-05, "loss": 6.7301, "mean_token_accuracy": 0.10637103319168091, "num_tokens": 175812.0, "step": 85 }, { "entropy": 7.150934505462646, "epoch": 0.0817810086324398, "grad_norm": 0.97265625, "learning_rate": 4.45e-05, "loss": 6.6271, "mean_token_accuracy": 0.10753465890884399, "num_tokens": 186357.0, "step": 90 }, { "entropy": 7.032349157333374, "epoch": 0.08632439800090867, "grad_norm": 0.93359375, "learning_rate": 4.7000000000000004e-05, "loss": 6.662, "mean_token_accuracy": 0.11050116717815399, "num_tokens": 196124.0, "step": 95 }, { "entropy": 7.046771717071533, "epoch": 0.09086778736937756, "grad_norm": 0.95703125, "learning_rate": 4.9500000000000004e-05, "loss": 6.6174, "mean_token_accuracy": 0.11095911487936974, "num_tokens": 205655.0, "step": 100 }, { "entropy": 7.056599807739258, "epoch": 0.09541117673784644, "grad_norm": 1.1640625, "learning_rate": 5.2e-05, "loss": 6.7337, "mean_token_accuracy": 0.10731556490063668, "num_tokens": 215870.0, "step": 105 }, { "entropy": 7.120891666412353, "epoch": 0.09995456610631531, "grad_norm": 1.015625, "learning_rate": 5.45e-05, "loss": 6.7045, "mean_token_accuracy": 0.10967985242605209, "num_tokens": 225027.0, "step": 110 }, { "entropy": 7.040978288650512, "epoch": 0.10449795547478419, "grad_norm": 0.9609375, "learning_rate": 5.7e-05, "loss": 6.7271, "mean_token_accuracy": 0.10503458082675934, "num_tokens": 236352.0, "step": 115 }, { "entropy": 7.152721691131592, "epoch": 0.10904134484325306, "grad_norm": 0.91015625, "learning_rate": 5.9499999999999996e-05, "loss": 6.6936, "mean_token_accuracy": 0.10544832721352577, "num_tokens": 246713.0, "step": 120 }, { "entropy": 7.054176568984985, "epoch": 0.11358473421172194, "grad_norm": 1.046875, "learning_rate": 6.2e-05, "loss": 6.5967, "mean_token_accuracy": 0.11465176194906235, "num_tokens": 256950.0, "step": 125 }, { "entropy": 7.072789001464844, "epoch": 0.11812812358019083, "grad_norm": 0.84765625, "learning_rate": 6.450000000000001e-05, "loss": 6.7339, "mean_token_accuracy": 0.10439727082848549, "num_tokens": 267345.0, "step": 130 }, { "entropy": 7.1310389041900635, "epoch": 0.1226715129486597, "grad_norm": 1.03125, "learning_rate": 6.7e-05, "loss": 6.5981, "mean_token_accuracy": 0.11395471319556236, "num_tokens": 276782.0, "step": 135 }, { "entropy": 7.0256682395935055, "epoch": 0.12721490231712856, "grad_norm": 1.0078125, "learning_rate": 6.950000000000001e-05, "loss": 6.5486, "mean_token_accuracy": 0.11245746687054634, "num_tokens": 287024.0, "step": 140 }, { "entropy": 7.054018259048462, "epoch": 0.13175829168559747, "grad_norm": 1.0546875, "learning_rate": 7.2e-05, "loss": 6.7399, "mean_token_accuracy": 0.10906066820025444, "num_tokens": 296597.0, "step": 145 }, { "entropy": 7.0501950740814205, "epoch": 0.13630168105406634, "grad_norm": 0.90625, "learning_rate": 7.45e-05, "loss": 6.6133, "mean_token_accuracy": 0.10526569485664368, "num_tokens": 307709.0, "step": 150 }, { "entropy": 7.057605266571045, "epoch": 0.14084507042253522, "grad_norm": 1.0390625, "learning_rate": 7.7e-05, "loss": 6.6945, "mean_token_accuracy": 0.11277502775192261, "num_tokens": 317976.0, "step": 155 }, { "entropy": 7.079123687744141, "epoch": 0.1453884597910041, "grad_norm": 1.1484375, "learning_rate": 7.950000000000001e-05, "loss": 6.5933, "mean_token_accuracy": 0.11109811812639236, "num_tokens": 327319.0, "step": 160 }, { "entropy": 7.128782653808594, "epoch": 0.14993184915947297, "grad_norm": 1.125, "learning_rate": 8.2e-05, "loss": 6.7011, "mean_token_accuracy": 0.10989727601408958, "num_tokens": 337337.0, "step": 165 }, { "entropy": 7.004915237426758, "epoch": 0.15447523852794184, "grad_norm": 1.0625, "learning_rate": 8.450000000000001e-05, "loss": 6.7058, "mean_token_accuracy": 0.10382038801908493, "num_tokens": 347779.0, "step": 170 }, { "entropy": 7.241215610504151, "epoch": 0.15901862789641072, "grad_norm": 1.0390625, "learning_rate": 8.7e-05, "loss": 6.7591, "mean_token_accuracy": 0.10459929779171943, "num_tokens": 358088.0, "step": 175 }, { "entropy": 7.122637462615967, "epoch": 0.1635620172648796, "grad_norm": 1.078125, "learning_rate": 8.95e-05, "loss": 6.6817, "mean_token_accuracy": 0.11470959857106208, "num_tokens": 368314.0, "step": 180 }, { "entropy": 6.984178066253662, "epoch": 0.16810540663334847, "grad_norm": 0.95703125, "learning_rate": 9.2e-05, "loss": 6.6326, "mean_token_accuracy": 0.11613894402980804, "num_tokens": 378406.0, "step": 185 }, { "entropy": 7.127804279327393, "epoch": 0.17264879600181735, "grad_norm": 0.9375, "learning_rate": 9.45e-05, "loss": 6.6571, "mean_token_accuracy": 0.10897257775068284, "num_tokens": 388912.0, "step": 190 }, { "entropy": 7.114015007019043, "epoch": 0.17719218537028622, "grad_norm": 0.9609375, "learning_rate": 9.7e-05, "loss": 6.6681, "mean_token_accuracy": 0.1109640821814537, "num_tokens": 399290.0, "step": 195 }, { "entropy": 7.044808387756348, "epoch": 0.18173557473875512, "grad_norm": 0.8984375, "learning_rate": 9.95e-05, "loss": 6.6228, "mean_token_accuracy": 0.1105850175023079, "num_tokens": 409757.0, "step": 200 }, { "entropy": 7.091672801971436, "epoch": 0.186278964107224, "grad_norm": 1.0, "learning_rate": 0.000102, "loss": 6.7741, "mean_token_accuracy": 0.10671057477593422, "num_tokens": 420182.0, "step": 205 }, { "entropy": 7.1211034774780275, "epoch": 0.19082235347569287, "grad_norm": 1.0234375, "learning_rate": 0.00010449999999999999, "loss": 6.6939, "mean_token_accuracy": 0.10947111174464226, "num_tokens": 429897.0, "step": 210 }, { "entropy": 7.0094818592071535, "epoch": 0.19536574284416175, "grad_norm": 1.1015625, "learning_rate": 0.000107, "loss": 6.603, "mean_token_accuracy": 0.1111033283174038, "num_tokens": 441131.0, "step": 215 }, { "entropy": 7.01470251083374, "epoch": 0.19990913221263062, "grad_norm": 0.8984375, "learning_rate": 0.0001095, "loss": 6.5721, "mean_token_accuracy": 0.1163232870399952, "num_tokens": 451894.0, "step": 220 }, { "entropy": 7.03377857208252, "epoch": 0.2044525215810995, "grad_norm": 1.0546875, "learning_rate": 0.000112, "loss": 6.5484, "mean_token_accuracy": 0.11207679361104965, "num_tokens": 462613.0, "step": 225 }, { "entropy": 6.951374053955078, "epoch": 0.20899591094956838, "grad_norm": 1.1171875, "learning_rate": 0.0001145, "loss": 6.625, "mean_token_accuracy": 0.11543528139591216, "num_tokens": 471606.0, "step": 230 }, { "entropy": 7.040213966369629, "epoch": 0.21353930031803725, "grad_norm": 0.9453125, "learning_rate": 0.00011700000000000001, "loss": 6.5818, "mean_token_accuracy": 0.11347164064645768, "num_tokens": 481559.0, "step": 235 }, { "entropy": 6.928437376022339, "epoch": 0.21808268968650613, "grad_norm": 1.0390625, "learning_rate": 0.00011949999999999999, "loss": 6.6276, "mean_token_accuracy": 0.10829292684793472, "num_tokens": 492766.0, "step": 240 }, { "entropy": 7.141974353790284, "epoch": 0.222626079054975, "grad_norm": 1.0234375, "learning_rate": 0.000122, "loss": 6.6785, "mean_token_accuracy": 0.11198576018214226, "num_tokens": 503357.0, "step": 245 }, { "entropy": 6.953282117843628, "epoch": 0.22716946842344388, "grad_norm": 1.078125, "learning_rate": 0.0001245, "loss": 6.5097, "mean_token_accuracy": 0.11739670410752297, "num_tokens": 513098.0, "step": 250 }, { "entropy": 7.012547636032105, "epoch": 0.23171285779191278, "grad_norm": 1.1640625, "learning_rate": 0.000127, "loss": 6.5831, "mean_token_accuracy": 0.10788592845201492, "num_tokens": 522807.0, "step": 255 }, { "entropy": 7.048117160797119, "epoch": 0.23625624716038165, "grad_norm": 1.03125, "learning_rate": 0.0001295, "loss": 6.6139, "mean_token_accuracy": 0.10738366693258286, "num_tokens": 532670.0, "step": 260 }, { "entropy": 7.000737524032592, "epoch": 0.24079963652885053, "grad_norm": 1.0390625, "learning_rate": 0.000132, "loss": 6.5806, "mean_token_accuracy": 0.11299150884151458, "num_tokens": 543647.0, "step": 265 }, { "entropy": 7.126269912719726, "epoch": 0.2453430258973194, "grad_norm": 1.0390625, "learning_rate": 0.00013450000000000002, "loss": 6.6435, "mean_token_accuracy": 0.1134704515337944, "num_tokens": 553047.0, "step": 270 }, { "entropy": 7.067537927627564, "epoch": 0.24988641526578828, "grad_norm": 1.078125, "learning_rate": 0.00013700000000000002, "loss": 6.701, "mean_token_accuracy": 0.11085810139775276, "num_tokens": 563413.0, "step": 275 }, { "entropy": 7.03962550163269, "epoch": 0.25442980463425713, "grad_norm": 1.0703125, "learning_rate": 0.0001395, "loss": 6.6526, "mean_token_accuracy": 0.1099765919148922, "num_tokens": 573790.0, "step": 280 }, { "entropy": 7.172714424133301, "epoch": 0.25897319400272606, "grad_norm": 1.328125, "learning_rate": 0.00014199999999999998, "loss": 6.545, "mean_token_accuracy": 0.1152808465063572, "num_tokens": 582958.0, "step": 285 }, { "entropy": 6.927952623367309, "epoch": 0.26351658337119493, "grad_norm": 0.96875, "learning_rate": 0.0001445, "loss": 6.5329, "mean_token_accuracy": 0.12143387421965599, "num_tokens": 592886.0, "step": 290 }, { "entropy": 6.983848524093628, "epoch": 0.2680599727396638, "grad_norm": 1.015625, "learning_rate": 0.000147, "loss": 6.5702, "mean_token_accuracy": 0.11255928203463554, "num_tokens": 603692.0, "step": 295 }, { "entropy": 7.033806657791137, "epoch": 0.2726033621081327, "grad_norm": 1.0546875, "learning_rate": 0.0001495, "loss": 6.6197, "mean_token_accuracy": 0.11122355610132217, "num_tokens": 613534.0, "step": 300 }, { "entropy": 7.102828121185302, "epoch": 0.27714675147660156, "grad_norm": 1.1640625, "learning_rate": 0.000152, "loss": 6.5846, "mean_token_accuracy": 0.11281364113092422, "num_tokens": 623862.0, "step": 305 }, { "entropy": 7.014190912246704, "epoch": 0.28169014084507044, "grad_norm": 1.1015625, "learning_rate": 0.00015450000000000001, "loss": 6.6611, "mean_token_accuracy": 0.1106049120426178, "num_tokens": 633759.0, "step": 310 }, { "entropy": 7.044203901290894, "epoch": 0.2862335302135393, "grad_norm": 1.171875, "learning_rate": 0.000157, "loss": 6.574, "mean_token_accuracy": 0.11183998882770538, "num_tokens": 643553.0, "step": 315 }, { "entropy": 6.948228120803833, "epoch": 0.2907769195820082, "grad_norm": 1.03125, "learning_rate": 0.0001595, "loss": 6.497, "mean_token_accuracy": 0.12053277567029, "num_tokens": 653714.0, "step": 320 }, { "entropy": 6.960380268096924, "epoch": 0.29532030895047706, "grad_norm": 1.2109375, "learning_rate": 0.000162, "loss": 6.5218, "mean_token_accuracy": 0.11574947088956833, "num_tokens": 662817.0, "step": 325 }, { "entropy": 7.0484599590301515, "epoch": 0.29986369831894594, "grad_norm": 1.15625, "learning_rate": 0.00016450000000000001, "loss": 6.572, "mean_token_accuracy": 0.11281462013721466, "num_tokens": 672381.0, "step": 330 }, { "entropy": 6.860067987442017, "epoch": 0.3044070876874148, "grad_norm": 1.03125, "learning_rate": 0.00016700000000000002, "loss": 6.4287, "mean_token_accuracy": 0.12099420502781869, "num_tokens": 682525.0, "step": 335 }, { "entropy": 7.027956867218018, "epoch": 0.3089504770558837, "grad_norm": 1.234375, "learning_rate": 0.00016950000000000003, "loss": 6.5667, "mean_token_accuracy": 0.11456256210803986, "num_tokens": 691826.0, "step": 340 }, { "entropy": 6.891661071777344, "epoch": 0.31349386642435256, "grad_norm": 1.359375, "learning_rate": 0.00017199999999999998, "loss": 6.5254, "mean_token_accuracy": 0.12214417457580566, "num_tokens": 701319.0, "step": 345 }, { "entropy": 7.01544942855835, "epoch": 0.31803725579282144, "grad_norm": 1.265625, "learning_rate": 0.00017449999999999999, "loss": 6.6239, "mean_token_accuracy": 0.10927131026983261, "num_tokens": 710888.0, "step": 350 }, { "entropy": 7.045792198181152, "epoch": 0.3225806451612903, "grad_norm": 1.0625, "learning_rate": 0.000177, "loss": 6.5847, "mean_token_accuracy": 0.11403941139578819, "num_tokens": 722516.0, "step": 355 }, { "entropy": 6.957839632034302, "epoch": 0.3271240345297592, "grad_norm": 1.1328125, "learning_rate": 0.0001795, "loss": 6.5389, "mean_token_accuracy": 0.11641027331352234, "num_tokens": 733058.0, "step": 360 }, { "entropy": 6.970429754257202, "epoch": 0.33166742389822806, "grad_norm": 1.0703125, "learning_rate": 0.000182, "loss": 6.6529, "mean_token_accuracy": 0.11699234396219253, "num_tokens": 744832.0, "step": 365 }, { "entropy": 7.030797052383423, "epoch": 0.33621081326669694, "grad_norm": 1.28125, "learning_rate": 0.0001845, "loss": 6.5626, "mean_token_accuracy": 0.11702975407242774, "num_tokens": 755387.0, "step": 370 }, { "entropy": 6.831810474395752, "epoch": 0.3407542026351658, "grad_norm": 1.15625, "learning_rate": 0.000187, "loss": 6.508, "mean_token_accuracy": 0.12129609361290931, "num_tokens": 764455.0, "step": 375 }, { "entropy": 6.996274089813232, "epoch": 0.3452975920036347, "grad_norm": 1.34375, "learning_rate": 0.0001895, "loss": 6.5434, "mean_token_accuracy": 0.11287878677248955, "num_tokens": 774513.0, "step": 380 }, { "entropy": 7.123194169998169, "epoch": 0.34984098137210357, "grad_norm": 1.2421875, "learning_rate": 0.000192, "loss": 6.6528, "mean_token_accuracy": 0.11267266720533371, "num_tokens": 785540.0, "step": 385 }, { "entropy": 6.854208993911743, "epoch": 0.35438437074057244, "grad_norm": 1.234375, "learning_rate": 0.0001945, "loss": 6.5076, "mean_token_accuracy": 0.11473293825984002, "num_tokens": 795233.0, "step": 390 }, { "entropy": 7.00517725944519, "epoch": 0.35892776010904137, "grad_norm": 1.3359375, "learning_rate": 0.00019700000000000002, "loss": 6.5684, "mean_token_accuracy": 0.1153998114168644, "num_tokens": 804855.0, "step": 395 }, { "entropy": 7.046209192276001, "epoch": 0.36347114947751025, "grad_norm": 1.1640625, "learning_rate": 0.00019950000000000002, "loss": 6.5448, "mean_token_accuracy": 0.12049437537789345, "num_tokens": 814818.0, "step": 400 }, { "entropy": 6.930202436447144, "epoch": 0.3680145388459791, "grad_norm": 1.203125, "learning_rate": 0.000202, "loss": 6.5723, "mean_token_accuracy": 0.1219966672360897, "num_tokens": 824622.0, "step": 405 }, { "entropy": 6.988021183013916, "epoch": 0.372557928214448, "grad_norm": 1.21875, "learning_rate": 0.00020449999999999998, "loss": 6.461, "mean_token_accuracy": 0.12495967298746109, "num_tokens": 834813.0, "step": 410 }, { "entropy": 6.910465860366822, "epoch": 0.3771013175829169, "grad_norm": 1.1328125, "learning_rate": 0.000207, "loss": 6.581, "mean_token_accuracy": 0.11608593091368676, "num_tokens": 844887.0, "step": 415 }, { "entropy": 6.913913106918335, "epoch": 0.38164470695138575, "grad_norm": 0.99609375, "learning_rate": 0.0002095, "loss": 6.5676, "mean_token_accuracy": 0.11720148175954818, "num_tokens": 855430.0, "step": 420 }, { "entropy": 6.882201671600342, "epoch": 0.3861880963198546, "grad_norm": 1.0625, "learning_rate": 0.000212, "loss": 6.4109, "mean_token_accuracy": 0.12106730788946152, "num_tokens": 866052.0, "step": 425 }, { "entropy": 6.8772341251373295, "epoch": 0.3907314856883235, "grad_norm": 0.95703125, "learning_rate": 0.0002145, "loss": 6.5837, "mean_token_accuracy": 0.1082363985478878, "num_tokens": 877961.0, "step": 430 }, { "entropy": 6.97900128364563, "epoch": 0.3952748750567924, "grad_norm": 1.25, "learning_rate": 0.00021700000000000002, "loss": 6.5385, "mean_token_accuracy": 0.12003246918320656, "num_tokens": 888386.0, "step": 435 }, { "entropy": 6.899233198165893, "epoch": 0.39981826442526125, "grad_norm": 1.078125, "learning_rate": 0.0002195, "loss": 6.5949, "mean_token_accuracy": 0.11746077984571457, "num_tokens": 898272.0, "step": 440 }, { "entropy": 6.9763165473937985, "epoch": 0.4043616537937301, "grad_norm": 1.109375, "learning_rate": 0.000222, "loss": 6.5239, "mean_token_accuracy": 0.12075713649392128, "num_tokens": 908317.0, "step": 445 }, { "entropy": 6.859544944763184, "epoch": 0.408905043162199, "grad_norm": 1.125, "learning_rate": 0.0002245, "loss": 6.5219, "mean_token_accuracy": 0.11483893692493438, "num_tokens": 917970.0, "step": 450 }, { "entropy": 6.960592794418335, "epoch": 0.4134484325306679, "grad_norm": 1.21875, "learning_rate": 0.00022700000000000002, "loss": 6.5569, "mean_token_accuracy": 0.11286390349268913, "num_tokens": 928132.0, "step": 455 }, { "entropy": 6.958032417297363, "epoch": 0.41799182189913675, "grad_norm": 1.109375, "learning_rate": 0.00022950000000000002, "loss": 6.4882, "mean_token_accuracy": 0.12300693169236183, "num_tokens": 938092.0, "step": 460 }, { "entropy": 6.903001070022583, "epoch": 0.4225352112676056, "grad_norm": 1.015625, "learning_rate": 0.00023200000000000003, "loss": 6.6277, "mean_token_accuracy": 0.11332209631800652, "num_tokens": 948650.0, "step": 465 }, { "entropy": 6.926384496688843, "epoch": 0.4270786006360745, "grad_norm": 1.2734375, "learning_rate": 0.00023449999999999998, "loss": 6.5358, "mean_token_accuracy": 0.12150514349341393, "num_tokens": 960195.0, "step": 470 }, { "entropy": 7.0210436344146725, "epoch": 0.4316219900045434, "grad_norm": 1.3984375, "learning_rate": 0.000237, "loss": 6.5531, "mean_token_accuracy": 0.1211358867585659, "num_tokens": 970608.0, "step": 475 }, { "entropy": 6.86919755935669, "epoch": 0.43616537937301225, "grad_norm": 1.296875, "learning_rate": 0.0002395, "loss": 6.5459, "mean_token_accuracy": 0.11455759704113007, "num_tokens": 981053.0, "step": 480 }, { "entropy": 6.865674066543579, "epoch": 0.4407087687414811, "grad_norm": 1.1796875, "learning_rate": 0.000242, "loss": 6.4754, "mean_token_accuracy": 0.12632407173514365, "num_tokens": 991560.0, "step": 485 }, { "entropy": 6.9210834980010985, "epoch": 0.44525215810995, "grad_norm": 1.2109375, "learning_rate": 0.0002445, "loss": 6.5078, "mean_token_accuracy": 0.11235889717936516, "num_tokens": 1002008.0, "step": 490 }, { "entropy": 6.893827056884765, "epoch": 0.4497955474784189, "grad_norm": 1.140625, "learning_rate": 0.000247, "loss": 6.514, "mean_token_accuracy": 0.12223821952939033, "num_tokens": 1012349.0, "step": 495 }, { "entropy": 6.82147445678711, "epoch": 0.45433893684688775, "grad_norm": 1.203125, "learning_rate": 0.0002495, "loss": 6.4946, "mean_token_accuracy": 0.12133770138025284, "num_tokens": 1022886.0, "step": 500 }, { "epoch": 0.45433893684688775, "eval_entropy": 6.860337434813034, "eval_loss": 6.596576690673828, "eval_mean_token_accuracy": 0.11917702073101387, "eval_num_tokens": 1022886.0, "eval_runtime": 2.0788, "eval_samples_per_second": 1652.391, "eval_steps_per_second": 206.85, "step": 500 }, { "entropy": 7.038683748245239, "epoch": 0.45888232621535663, "grad_norm": 1.1328125, "learning_rate": 0.000252, "loss": 6.553, "mean_token_accuracy": 0.11260545328259468, "num_tokens": 1033129.0, "step": 505 }, { "entropy": 6.75604133605957, "epoch": 0.46342571558382556, "grad_norm": 1.171875, "learning_rate": 0.0002545, "loss": 6.4677, "mean_token_accuracy": 0.12008674815297127, "num_tokens": 1043069.0, "step": 510 }, { "entropy": 6.91235318183899, "epoch": 0.46796910495229443, "grad_norm": 1.0390625, "learning_rate": 0.000257, "loss": 6.5074, "mean_token_accuracy": 0.11930165812373161, "num_tokens": 1054049.0, "step": 515 }, { "entropy": 6.764765977859497, "epoch": 0.4725124943207633, "grad_norm": 1.0625, "learning_rate": 0.0002595, "loss": 6.4839, "mean_token_accuracy": 0.11638501510024071, "num_tokens": 1065155.0, "step": 520 }, { "entropy": 6.8717132091522215, "epoch": 0.4770558836892322, "grad_norm": 1.171875, "learning_rate": 0.000262, "loss": 6.4661, "mean_token_accuracy": 0.12135470137000084, "num_tokens": 1075510.0, "step": 525 }, { "entropy": 6.840530157089233, "epoch": 0.48159927305770106, "grad_norm": 1.0078125, "learning_rate": 0.00026450000000000003, "loss": 6.492, "mean_token_accuracy": 0.11994823887944221, "num_tokens": 1086494.0, "step": 530 }, { "entropy": 6.9312502384185795, "epoch": 0.48614266242616994, "grad_norm": 1.1328125, "learning_rate": 0.00026700000000000004, "loss": 6.5277, "mean_token_accuracy": 0.11823871508240699, "num_tokens": 1097311.0, "step": 535 }, { "entropy": 6.814186382293701, "epoch": 0.4906860517946388, "grad_norm": 1.15625, "learning_rate": 0.00026950000000000005, "loss": 6.4851, "mean_token_accuracy": 0.12035745903849601, "num_tokens": 1107757.0, "step": 540 }, { "entropy": 6.742862415313721, "epoch": 0.4952294411631077, "grad_norm": 1.0625, "learning_rate": 0.00027200000000000005, "loss": 6.3936, "mean_token_accuracy": 0.12132056951522827, "num_tokens": 1118889.0, "step": 545 }, { "entropy": 6.9436932563781735, "epoch": 0.49977283053157656, "grad_norm": 1.1171875, "learning_rate": 0.0002745, "loss": 6.6034, "mean_token_accuracy": 0.11310271173715591, "num_tokens": 1128951.0, "step": 550 }, { "entropy": 6.813915681838989, "epoch": 0.5043162199000454, "grad_norm": 1.2890625, "learning_rate": 0.000277, "loss": 6.4028, "mean_token_accuracy": 0.12124144360423088, "num_tokens": 1138583.0, "step": 555 }, { "entropy": 6.7781116485595705, "epoch": 0.5088596092685143, "grad_norm": 1.1328125, "learning_rate": 0.0002795, "loss": 6.4695, "mean_token_accuracy": 0.12076117545366287, "num_tokens": 1149572.0, "step": 560 }, { "entropy": 6.856851434707641, "epoch": 0.5134029986369832, "grad_norm": 1.1328125, "learning_rate": 0.00028199999999999997, "loss": 6.4544, "mean_token_accuracy": 0.12212569490075112, "num_tokens": 1160532.0, "step": 565 }, { "entropy": 6.8364509582519535, "epoch": 0.5179463880054521, "grad_norm": 1.046875, "learning_rate": 0.0002845, "loss": 6.4427, "mean_token_accuracy": 0.11744874492287635, "num_tokens": 1170915.0, "step": 570 }, { "entropy": 6.748907423019409, "epoch": 0.522489777373921, "grad_norm": 1.0703125, "learning_rate": 0.000287, "loss": 6.4015, "mean_token_accuracy": 0.1268433950841427, "num_tokens": 1180822.0, "step": 575 }, { "entropy": 6.846159839630127, "epoch": 0.5270331667423899, "grad_norm": 1.0703125, "learning_rate": 0.0002895, "loss": 6.4444, "mean_token_accuracy": 0.12061617448925972, "num_tokens": 1190447.0, "step": 580 }, { "entropy": 6.761949729919434, "epoch": 0.5315765561108587, "grad_norm": 1.1796875, "learning_rate": 0.000292, "loss": 6.4939, "mean_token_accuracy": 0.12140641659498215, "num_tokens": 1200951.0, "step": 585 }, { "entropy": 6.874054861068726, "epoch": 0.5361199454793276, "grad_norm": 1.2734375, "learning_rate": 0.0002945, "loss": 6.3761, "mean_token_accuracy": 0.12457154095172882, "num_tokens": 1211846.0, "step": 590 }, { "entropy": 6.5768075466156, "epoch": 0.5406633348477965, "grad_norm": 1.078125, "learning_rate": 0.000297, "loss": 6.3485, "mean_token_accuracy": 0.12247997224330902, "num_tokens": 1222074.0, "step": 595 }, { "entropy": 6.724390697479248, "epoch": 0.5452067242162654, "grad_norm": 1.3359375, "learning_rate": 0.0002995, "loss": 6.4373, "mean_token_accuracy": 0.11953089758753777, "num_tokens": 1231741.0, "step": 600 }, { "entropy": 6.838490581512451, "epoch": 0.5497501135847342, "grad_norm": 1.2109375, "learning_rate": 0.000302, "loss": 6.3576, "mean_token_accuracy": 0.12071707099676132, "num_tokens": 1241078.0, "step": 605 }, { "entropy": 6.763300848007202, "epoch": 0.5542935029532031, "grad_norm": 1.375, "learning_rate": 0.0003045, "loss": 6.5515, "mean_token_accuracy": 0.1141580305993557, "num_tokens": 1251685.0, "step": 610 }, { "entropy": 6.756213283538818, "epoch": 0.558836892321672, "grad_norm": 1.140625, "learning_rate": 0.000307, "loss": 6.4097, "mean_token_accuracy": 0.12805262804031373, "num_tokens": 1262044.0, "step": 615 }, { "entropy": 6.798225259780883, "epoch": 0.5633802816901409, "grad_norm": 1.015625, "learning_rate": 0.0003095, "loss": 6.4144, "mean_token_accuracy": 0.11838038489222527, "num_tokens": 1273647.0, "step": 620 }, { "entropy": 6.815305852890015, "epoch": 0.5679236710586097, "grad_norm": 1.203125, "learning_rate": 0.000312, "loss": 6.4587, "mean_token_accuracy": 0.11831681355834008, "num_tokens": 1284396.0, "step": 625 }, { "entropy": 6.739588737487793, "epoch": 0.5724670604270786, "grad_norm": 1.078125, "learning_rate": 0.0003145, "loss": 6.4554, "mean_token_accuracy": 0.11994302198290825, "num_tokens": 1294339.0, "step": 630 }, { "entropy": 6.743681716918945, "epoch": 0.5770104497955475, "grad_norm": 1.140625, "learning_rate": 0.000317, "loss": 6.3618, "mean_token_accuracy": 0.12565899565815924, "num_tokens": 1304572.0, "step": 635 }, { "entropy": 6.732248544692993, "epoch": 0.5815538391640164, "grad_norm": 1.1171875, "learning_rate": 0.0003195, "loss": 6.4008, "mean_token_accuracy": 0.1283697485923767, "num_tokens": 1314780.0, "step": 640 }, { "entropy": 6.715030288696289, "epoch": 0.5860972285324852, "grad_norm": 1.125, "learning_rate": 0.000322, "loss": 6.4305, "mean_token_accuracy": 0.12055126056075097, "num_tokens": 1325215.0, "step": 645 }, { "entropy": 6.737424755096436, "epoch": 0.5906406179009541, "grad_norm": 1.0625, "learning_rate": 0.00032450000000000003, "loss": 6.3532, "mean_token_accuracy": 0.12564591094851493, "num_tokens": 1334745.0, "step": 650 }, { "entropy": 6.818739223480224, "epoch": 0.595184007269423, "grad_norm": 1.1953125, "learning_rate": 0.00032700000000000003, "loss": 6.4545, "mean_token_accuracy": 0.12319393679499627, "num_tokens": 1345150.0, "step": 655 }, { "entropy": 6.748230791091919, "epoch": 0.5997273966378919, "grad_norm": 1.046875, "learning_rate": 0.00032950000000000004, "loss": 6.4021, "mean_token_accuracy": 0.1250821828842163, "num_tokens": 1355619.0, "step": 660 }, { "entropy": 6.675359725952148, "epoch": 0.6042707860063607, "grad_norm": 1.140625, "learning_rate": 0.00033200000000000005, "loss": 6.3472, "mean_token_accuracy": 0.12429328337311744, "num_tokens": 1365933.0, "step": 665 }, { "entropy": 6.677164220809937, "epoch": 0.6088141753748296, "grad_norm": 1.03125, "learning_rate": 0.00033450000000000005, "loss": 6.3575, "mean_token_accuracy": 0.12597684264183046, "num_tokens": 1376867.0, "step": 670 }, { "entropy": 6.880353355407715, "epoch": 0.6133575647432985, "grad_norm": 1.0703125, "learning_rate": 0.000337, "loss": 6.5086, "mean_token_accuracy": 0.12199193090200425, "num_tokens": 1386739.0, "step": 675 }, { "entropy": 6.659671306610107, "epoch": 0.6179009541117674, "grad_norm": 1.09375, "learning_rate": 0.0003395, "loss": 6.3756, "mean_token_accuracy": 0.12595050930976867, "num_tokens": 1397138.0, "step": 680 }, { "entropy": 6.794150686264038, "epoch": 0.6224443434802363, "grad_norm": 1.1640625, "learning_rate": 0.000342, "loss": 6.4737, "mean_token_accuracy": 0.12353222742676735, "num_tokens": 1408171.0, "step": 685 }, { "entropy": 6.678361701965332, "epoch": 0.6269877328487051, "grad_norm": 1.0546875, "learning_rate": 0.00034449999999999997, "loss": 6.4126, "mean_token_accuracy": 0.11492947861552238, "num_tokens": 1418259.0, "step": 690 }, { "entropy": 6.736178636550903, "epoch": 0.631531122217174, "grad_norm": 1.265625, "learning_rate": 0.000347, "loss": 6.4123, "mean_token_accuracy": 0.1267726466059685, "num_tokens": 1428080.0, "step": 695 }, { "entropy": 6.815822696685791, "epoch": 0.6360745115856429, "grad_norm": 1.15625, "learning_rate": 0.0003495, "loss": 6.4481, "mean_token_accuracy": 0.12076391205191613, "num_tokens": 1438502.0, "step": 700 }, { "entropy": 6.598518657684326, "epoch": 0.6406179009541118, "grad_norm": 1.125, "learning_rate": 0.000352, "loss": 6.3924, "mean_token_accuracy": 0.12057804539799691, "num_tokens": 1448396.0, "step": 705 }, { "entropy": 6.762733507156372, "epoch": 0.6451612903225806, "grad_norm": 1.09375, "learning_rate": 0.0003545, "loss": 6.449, "mean_token_accuracy": 0.11836672648787498, "num_tokens": 1459728.0, "step": 710 }, { "entropy": 6.694298982620239, "epoch": 0.6497046796910495, "grad_norm": 1.2734375, "learning_rate": 0.000357, "loss": 6.3468, "mean_token_accuracy": 0.13057461455464364, "num_tokens": 1469733.0, "step": 715 }, { "entropy": 6.584758949279785, "epoch": 0.6542480690595184, "grad_norm": 1.28125, "learning_rate": 0.0003595, "loss": 6.3337, "mean_token_accuracy": 0.12913667634129525, "num_tokens": 1479004.0, "step": 720 }, { "entropy": 6.664322137832642, "epoch": 0.6587914584279873, "grad_norm": 1.2265625, "learning_rate": 0.000362, "loss": 6.3013, "mean_token_accuracy": 0.12805228009819986, "num_tokens": 1489848.0, "step": 725 }, { "entropy": 6.619141530990601, "epoch": 0.6633348477964561, "grad_norm": 1.0390625, "learning_rate": 0.0003645, "loss": 6.3101, "mean_token_accuracy": 0.123420599848032, "num_tokens": 1500877.0, "step": 730 }, { "entropy": 6.760257053375244, "epoch": 0.667878237164925, "grad_norm": 1.171875, "learning_rate": 0.000367, "loss": 6.4531, "mean_token_accuracy": 0.12081244513392449, "num_tokens": 1511840.0, "step": 735 }, { "entropy": 6.64377269744873, "epoch": 0.6724216265333939, "grad_norm": 1.25, "learning_rate": 0.0003695, "loss": 6.3466, "mean_token_accuracy": 0.12521926909685135, "num_tokens": 1521839.0, "step": 740 }, { "entropy": 6.686690950393677, "epoch": 0.6769650159018628, "grad_norm": 1.25, "learning_rate": 0.000372, "loss": 6.2627, "mean_token_accuracy": 0.13056650534272193, "num_tokens": 1531285.0, "step": 745 }, { "entropy": 6.4388243675231935, "epoch": 0.6815084052703316, "grad_norm": 1.1171875, "learning_rate": 0.0003745, "loss": 6.3123, "mean_token_accuracy": 0.12405181005597114, "num_tokens": 1542027.0, "step": 750 }, { "entropy": 6.806895637512207, "epoch": 0.6860517946388005, "grad_norm": 1.15625, "learning_rate": 0.000377, "loss": 6.4322, "mean_token_accuracy": 0.1271710440516472, "num_tokens": 1552527.0, "step": 755 }, { "entropy": 6.741839790344239, "epoch": 0.6905951840072694, "grad_norm": 1.1171875, "learning_rate": 0.0003795, "loss": 6.4587, "mean_token_accuracy": 0.12079727575182915, "num_tokens": 1562605.0, "step": 760 }, { "entropy": 6.614172458648682, "epoch": 0.6951385733757383, "grad_norm": 1.171875, "learning_rate": 0.000382, "loss": 6.3475, "mean_token_accuracy": 0.1223350152373314, "num_tokens": 1572128.0, "step": 765 }, { "entropy": 6.568692779541015, "epoch": 0.6996819627442071, "grad_norm": 1.375, "learning_rate": 0.0003845, "loss": 6.2926, "mean_token_accuracy": 0.12322064191102981, "num_tokens": 1582352.0, "step": 770 }, { "entropy": 6.704865646362305, "epoch": 0.704225352112676, "grad_norm": 1.1015625, "learning_rate": 0.00038700000000000003, "loss": 6.3801, "mean_token_accuracy": 0.1275831013917923, "num_tokens": 1592887.0, "step": 775 }, { "entropy": 6.567614984512329, "epoch": 0.7087687414811449, "grad_norm": 1.109375, "learning_rate": 0.00038950000000000003, "loss": 6.3225, "mean_token_accuracy": 0.1287633515894413, "num_tokens": 1603564.0, "step": 780 }, { "entropy": 6.488887453079224, "epoch": 0.7133121308496138, "grad_norm": 1.046875, "learning_rate": 0.00039200000000000004, "loss": 6.1767, "mean_token_accuracy": 0.1348121538758278, "num_tokens": 1613270.0, "step": 785 }, { "entropy": 6.569432973861694, "epoch": 0.7178555202180827, "grad_norm": 1.1015625, "learning_rate": 0.00039450000000000005, "loss": 6.2481, "mean_token_accuracy": 0.13376593515276908, "num_tokens": 1623009.0, "step": 790 }, { "entropy": 6.583132648468018, "epoch": 0.7223989095865516, "grad_norm": 1.1328125, "learning_rate": 0.00039700000000000005, "loss": 6.2842, "mean_token_accuracy": 0.12445440068840981, "num_tokens": 1633209.0, "step": 795 }, { "entropy": 6.60934681892395, "epoch": 0.7269422989550205, "grad_norm": 1.328125, "learning_rate": 0.0003995, "loss": 6.3173, "mean_token_accuracy": 0.13005920574069024, "num_tokens": 1643708.0, "step": 800 }, { "entropy": 6.673225450515747, "epoch": 0.7314856883234894, "grad_norm": 1.078125, "learning_rate": 0.000402, "loss": 6.3891, "mean_token_accuracy": 0.1240218348801136, "num_tokens": 1653973.0, "step": 805 }, { "entropy": 6.610533094406128, "epoch": 0.7360290776919582, "grad_norm": 0.9765625, "learning_rate": 0.0004045, "loss": 6.3611, "mean_token_accuracy": 0.12812820374965667, "num_tokens": 1664856.0, "step": 810 }, { "entropy": 6.514911937713623, "epoch": 0.7405724670604271, "grad_norm": 1.2109375, "learning_rate": 0.00040699999999999997, "loss": 6.2889, "mean_token_accuracy": 0.12775621116161345, "num_tokens": 1675935.0, "step": 815 }, { "entropy": 6.640262317657471, "epoch": 0.745115856428896, "grad_norm": 1.2265625, "learning_rate": 0.0004095, "loss": 6.3378, "mean_token_accuracy": 0.12817456051707268, "num_tokens": 1686597.0, "step": 820 }, { "entropy": 6.521266269683838, "epoch": 0.7496592457973649, "grad_norm": 1.0703125, "learning_rate": 0.000412, "loss": 6.2871, "mean_token_accuracy": 0.12973518893122674, "num_tokens": 1697385.0, "step": 825 }, { "entropy": 6.757512378692627, "epoch": 0.7542026351658337, "grad_norm": 1.1171875, "learning_rate": 0.0004145, "loss": 6.334, "mean_token_accuracy": 0.12559274584054947, "num_tokens": 1706680.0, "step": 830 }, { "entropy": 6.525813150405884, "epoch": 0.7587460245343026, "grad_norm": 1.09375, "learning_rate": 0.000417, "loss": 6.3304, "mean_token_accuracy": 0.13286243975162507, "num_tokens": 1716130.0, "step": 835 }, { "entropy": 6.544560527801513, "epoch": 0.7632894139027715, "grad_norm": 1.0703125, "learning_rate": 0.0004195, "loss": 6.266, "mean_token_accuracy": 0.12106607109308243, "num_tokens": 1726835.0, "step": 840 }, { "entropy": 6.625137424468994, "epoch": 0.7678328032712404, "grad_norm": 1.1953125, "learning_rate": 0.000422, "loss": 6.2921, "mean_token_accuracy": 0.13414542749524117, "num_tokens": 1737708.0, "step": 845 }, { "entropy": 6.551477527618408, "epoch": 0.7723761926397092, "grad_norm": 1.09375, "learning_rate": 0.0004245, "loss": 6.2803, "mean_token_accuracy": 0.13080543354153634, "num_tokens": 1747649.0, "step": 850 }, { "entropy": 6.5627717018127445, "epoch": 0.7769195820081781, "grad_norm": 1.1015625, "learning_rate": 0.000427, "loss": 6.3104, "mean_token_accuracy": 0.1241184689104557, "num_tokens": 1758327.0, "step": 855 }, { "entropy": 6.520473337173462, "epoch": 0.781462971376647, "grad_norm": 1.1171875, "learning_rate": 0.0004295, "loss": 6.2597, "mean_token_accuracy": 0.12726373523473739, "num_tokens": 1769767.0, "step": 860 }, { "entropy": 6.632397890090942, "epoch": 0.7860063607451159, "grad_norm": 1.0390625, "learning_rate": 0.000432, "loss": 6.3682, "mean_token_accuracy": 0.12802448347210885, "num_tokens": 1780139.0, "step": 865 }, { "entropy": 6.603162670135498, "epoch": 0.7905497501135847, "grad_norm": 1.0625, "learning_rate": 0.0004345, "loss": 6.2562, "mean_token_accuracy": 0.1305392786860466, "num_tokens": 1790783.0, "step": 870 }, { "entropy": 6.480232000350952, "epoch": 0.7950931394820536, "grad_norm": 1.15625, "learning_rate": 0.000437, "loss": 6.2484, "mean_token_accuracy": 0.1271712563931942, "num_tokens": 1801349.0, "step": 875 }, { "entropy": 6.47876353263855, "epoch": 0.7996365288505225, "grad_norm": 1.0859375, "learning_rate": 0.0004395, "loss": 6.2545, "mean_token_accuracy": 0.12814290598034858, "num_tokens": 1811990.0, "step": 880 }, { "entropy": 6.468902921676635, "epoch": 0.8041799182189914, "grad_norm": 1.171875, "learning_rate": 0.000442, "loss": 6.2642, "mean_token_accuracy": 0.13316571116447448, "num_tokens": 1821725.0, "step": 885 }, { "entropy": 6.512246942520141, "epoch": 0.8087233075874602, "grad_norm": 1.1875, "learning_rate": 0.0004445, "loss": 6.2265, "mean_token_accuracy": 0.12539276257157325, "num_tokens": 1831794.0, "step": 890 }, { "entropy": 6.56938853263855, "epoch": 0.8132666969559291, "grad_norm": 1.1640625, "learning_rate": 0.000447, "loss": 6.3102, "mean_token_accuracy": 0.1250581920146942, "num_tokens": 1842002.0, "step": 895 }, { "entropy": 6.550431156158448, "epoch": 0.817810086324398, "grad_norm": 1.2421875, "learning_rate": 0.00044950000000000003, "loss": 6.2831, "mean_token_accuracy": 0.13148240596055985, "num_tokens": 1852282.0, "step": 900 }, { "entropy": 6.505387592315674, "epoch": 0.8223534756928669, "grad_norm": 1.0625, "learning_rate": 0.00045200000000000004, "loss": 6.2905, "mean_token_accuracy": 0.12270240858197212, "num_tokens": 1862830.0, "step": 905 }, { "entropy": 6.502415466308594, "epoch": 0.8268968650613358, "grad_norm": 1.03125, "learning_rate": 0.00045450000000000004, "loss": 6.2544, "mean_token_accuracy": 0.1273520275950432, "num_tokens": 1872746.0, "step": 910 }, { "entropy": 6.531500625610351, "epoch": 0.8314402544298046, "grad_norm": 1.0703125, "learning_rate": 0.00045700000000000005, "loss": 6.2788, "mean_token_accuracy": 0.12095234766602517, "num_tokens": 1884353.0, "step": 915 }, { "entropy": 6.498415279388428, "epoch": 0.8359836437982735, "grad_norm": 1.09375, "learning_rate": 0.00045950000000000006, "loss": 6.3099, "mean_token_accuracy": 0.12300471439957619, "num_tokens": 1895719.0, "step": 920 }, { "entropy": 6.56763768196106, "epoch": 0.8405270331667424, "grad_norm": 1.0625, "learning_rate": 0.000462, "loss": 6.2461, "mean_token_accuracy": 0.13558438569307327, "num_tokens": 1905905.0, "step": 925 }, { "entropy": 6.554039859771729, "epoch": 0.8450704225352113, "grad_norm": 1.0859375, "learning_rate": 0.0004645, "loss": 6.3486, "mean_token_accuracy": 0.1283061608672142, "num_tokens": 1916010.0, "step": 930 }, { "entropy": 6.483093357086181, "epoch": 0.8496138119036801, "grad_norm": 1.1171875, "learning_rate": 0.000467, "loss": 6.2355, "mean_token_accuracy": 0.12846953123807908, "num_tokens": 1926429.0, "step": 935 }, { "entropy": 6.394514369964599, "epoch": 0.854157201272149, "grad_norm": 1.1015625, "learning_rate": 0.0004695, "loss": 6.1738, "mean_token_accuracy": 0.13184919580817223, "num_tokens": 1936322.0, "step": 940 }, { "entropy": 6.586344194412232, "epoch": 0.8587005906406179, "grad_norm": 1.1875, "learning_rate": 0.000472, "loss": 6.3401, "mean_token_accuracy": 0.12153217419981957, "num_tokens": 1947885.0, "step": 945 }, { "entropy": 6.581201982498169, "epoch": 0.8632439800090868, "grad_norm": 1.1015625, "learning_rate": 0.0004745, "loss": 6.3061, "mean_token_accuracy": 0.1271632768213749, "num_tokens": 1957876.0, "step": 950 }, { "entropy": 6.458595561981201, "epoch": 0.8677873693775556, "grad_norm": 0.96875, "learning_rate": 0.000477, "loss": 6.2884, "mean_token_accuracy": 0.12774469405412675, "num_tokens": 1969531.0, "step": 955 }, { "entropy": 6.469849681854248, "epoch": 0.8723307587460245, "grad_norm": 0.95703125, "learning_rate": 0.0004795, "loss": 6.1585, "mean_token_accuracy": 0.13405076786875725, "num_tokens": 1980787.0, "step": 960 }, { "entropy": 6.426231050491333, "epoch": 0.8768741481144934, "grad_norm": 1.1484375, "learning_rate": 0.000482, "loss": 6.2415, "mean_token_accuracy": 0.13065283447504045, "num_tokens": 1991645.0, "step": 965 }, { "entropy": 6.458543157577514, "epoch": 0.8814175374829623, "grad_norm": 1.046875, "learning_rate": 0.0004845, "loss": 6.2898, "mean_token_accuracy": 0.1293037176132202, "num_tokens": 2002544.0, "step": 970 }, { "entropy": 6.615034198760986, "epoch": 0.8859609268514311, "grad_norm": 0.9453125, "learning_rate": 0.000487, "loss": 6.3558, "mean_token_accuracy": 0.12412808239459991, "num_tokens": 2012813.0, "step": 975 }, { "entropy": 6.439260530471802, "epoch": 0.8905043162199, "grad_norm": 1.0078125, "learning_rate": 0.0004895, "loss": 6.2133, "mean_token_accuracy": 0.1342377170920372, "num_tokens": 2023756.0, "step": 980 }, { "entropy": 6.462012529373169, "epoch": 0.8950477055883689, "grad_norm": 1.0703125, "learning_rate": 0.000492, "loss": 6.2987, "mean_token_accuracy": 0.12924248054623605, "num_tokens": 2034245.0, "step": 985 }, { "entropy": 6.596914148330688, "epoch": 0.8995910949568378, "grad_norm": 1.109375, "learning_rate": 0.0004945, "loss": 6.3289, "mean_token_accuracy": 0.12585399001836778, "num_tokens": 2045635.0, "step": 990 }, { "entropy": 6.438915681838989, "epoch": 0.9041344843253066, "grad_norm": 0.9375, "learning_rate": 0.000497, "loss": 6.2967, "mean_token_accuracy": 0.12629913538694382, "num_tokens": 2056501.0, "step": 995 }, { "entropy": 6.50923523902893, "epoch": 0.9086778736937755, "grad_norm": 1.140625, "learning_rate": 0.0004995, "loss": 6.2941, "mean_token_accuracy": 0.12796490490436555, "num_tokens": 2066540.0, "step": 1000 }, { "epoch": 0.9086778736937755, "eval_entropy": 6.417881159449733, "eval_loss": 6.327642440795898, "eval_mean_token_accuracy": 0.12967643163405185, "eval_num_tokens": 2066540.0, "eval_runtime": 2.0068, "eval_samples_per_second": 1711.686, "eval_steps_per_second": 214.272, "step": 1000 }, { "entropy": 6.502445220947266, "epoch": 0.9132212630622444, "grad_norm": 0.98046875, "learning_rate": 0.0004999998223471442, "loss": 6.1874, "mean_token_accuracy": 0.13226909786462784, "num_tokens": 2077008.0, "step": 1005 }, { "entropy": 6.363942956924438, "epoch": 0.9177646524307133, "grad_norm": 1.046875, "learning_rate": 0.0004999991006328981, "loss": 6.112, "mean_token_accuracy": 0.13485410138964654, "num_tokens": 2087314.0, "step": 1010 }, { "entropy": 6.450909662246704, "epoch": 0.9223080417991822, "grad_norm": 1.015625, "learning_rate": 0.0004999978237557377, "loss": 6.2685, "mean_token_accuracy": 0.13152633085846901, "num_tokens": 2097928.0, "step": 1015 }, { "entropy": 6.427286386489868, "epoch": 0.9268514311676511, "grad_norm": 0.97265625, "learning_rate": 0.0004999959917188137, "loss": 6.2047, "mean_token_accuracy": 0.12667798325419427, "num_tokens": 2108662.0, "step": 1020 }, { "entropy": 6.409921503067016, "epoch": 0.93139482053612, "grad_norm": 1.296875, "learning_rate": 0.0004999936045266462, "loss": 6.2367, "mean_token_accuracy": 0.1287694863975048, "num_tokens": 2118546.0, "step": 1025 }, { "entropy": 6.523617219924927, "epoch": 0.9359382099045889, "grad_norm": 1.109375, "learning_rate": 0.0004999906621851255, "loss": 6.2745, "mean_token_accuracy": 0.12986955642700196, "num_tokens": 2128012.0, "step": 1030 }, { "entropy": 6.3750663757324215, "epoch": 0.9404815992730577, "grad_norm": 1.125, "learning_rate": 0.0004999871647015115, "loss": 6.0978, "mean_token_accuracy": 0.132510943710804, "num_tokens": 2138241.0, "step": 1035 }, { "entropy": 6.501310014724732, "epoch": 0.9450249886415266, "grad_norm": 0.953125, "learning_rate": 0.0004999831120844339, "loss": 6.2676, "mean_token_accuracy": 0.12779484912753106, "num_tokens": 2150780.0, "step": 1040 }, { "entropy": 6.38626651763916, "epoch": 0.9495683780099955, "grad_norm": 1.1015625, "learning_rate": 0.0004999785043438922, "loss": 6.1633, "mean_token_accuracy": 0.12995605394244195, "num_tokens": 2161918.0, "step": 1045 }, { "entropy": 6.3813934326171875, "epoch": 0.9541117673784644, "grad_norm": 0.9921875, "learning_rate": 0.0004999733414912555, "loss": 6.1939, "mean_token_accuracy": 0.13298184126615525, "num_tokens": 2172742.0, "step": 1050 }, { "entropy": 6.343666076660156, "epoch": 0.9586551567469332, "grad_norm": 1.1015625, "learning_rate": 0.0004999676235392626, "loss": 6.1768, "mean_token_accuracy": 0.1389474593102932, "num_tokens": 2182122.0, "step": 1055 }, { "entropy": 6.438647651672364, "epoch": 0.9631985461154021, "grad_norm": 1.203125, "learning_rate": 0.0004999613505020219, "loss": 6.2143, "mean_token_accuracy": 0.13138292282819747, "num_tokens": 2193703.0, "step": 1060 }, { "entropy": 6.378941679000855, "epoch": 0.967741935483871, "grad_norm": 1.21875, "learning_rate": 0.0004999545223950116, "loss": 6.1416, "mean_token_accuracy": 0.1320495679974556, "num_tokens": 2204041.0, "step": 1065 }, { "entropy": 6.3784877300262455, "epoch": 0.9722853248523399, "grad_norm": 1.0546875, "learning_rate": 0.0004999471392350795, "loss": 6.1832, "mean_token_accuracy": 0.13410646393895148, "num_tokens": 2214276.0, "step": 1070 }, { "entropy": 6.416499233245849, "epoch": 0.9768287142208087, "grad_norm": 1.171875, "learning_rate": 0.0004999392010404426, "loss": 6.1602, "mean_token_accuracy": 0.1342863529920578, "num_tokens": 2225390.0, "step": 1075 }, { "entropy": 6.348226547241211, "epoch": 0.9813721035892776, "grad_norm": 1.0234375, "learning_rate": 0.0004999307078306876, "loss": 6.1037, "mean_token_accuracy": 0.13796225488185881, "num_tokens": 2235708.0, "step": 1080 }, { "entropy": 6.427854537963867, "epoch": 0.9859154929577465, "grad_norm": 1.2109375, "learning_rate": 0.0004999216596267708, "loss": 6.1452, "mean_token_accuracy": 0.13566545397043228, "num_tokens": 2246284.0, "step": 1085 }, { "entropy": 6.466590881347656, "epoch": 0.9904588823262154, "grad_norm": 1.1953125, "learning_rate": 0.0004999120564510177, "loss": 6.161, "mean_token_accuracy": 0.1317994177341461, "num_tokens": 2257219.0, "step": 1090 }, { "entropy": 6.246234703063965, "epoch": 0.9950022716946842, "grad_norm": 0.98828125, "learning_rate": 0.000499901898327123, "loss": 6.1683, "mean_token_accuracy": 0.13266120254993438, "num_tokens": 2268019.0, "step": 1095 }, { "entropy": 6.379768943786621, "epoch": 0.9995456610631531, "grad_norm": 1.03125, "learning_rate": 0.0004998911852801512, "loss": 6.179, "mean_token_accuracy": 0.13327732756733895, "num_tokens": 2278382.0, "step": 1100 }, { "entropy": 6.361470010545519, "epoch": 1.003634711494775, "grad_norm": 0.97265625, "learning_rate": 0.0004998799173365355, "loss": 6.0177, "mean_token_accuracy": 0.13881485329733956, "num_tokens": 2288515.0, "step": 1105 }, { "entropy": 6.365941667556763, "epoch": 1.008178100863244, "grad_norm": 1.125, "learning_rate": 0.0004998680945240783, "loss": 5.8731, "mean_token_accuracy": 0.14504974335432053, "num_tokens": 2298396.0, "step": 1110 }, { "entropy": 6.24194712638855, "epoch": 1.0127214902317128, "grad_norm": 1.0859375, "learning_rate": 0.0004998557168719513, "loss": 5.9908, "mean_token_accuracy": 0.1329639032483101, "num_tokens": 2308707.0, "step": 1115 }, { "entropy": 6.378946971893311, "epoch": 1.0172648796001817, "grad_norm": 1.1796875, "learning_rate": 0.0004998427844106954, "loss": 5.914, "mean_token_accuracy": 0.14582742899656295, "num_tokens": 2318981.0, "step": 1120 }, { "entropy": 6.239332389831543, "epoch": 1.0218082689686505, "grad_norm": 1.1640625, "learning_rate": 0.0004998292971722197, "loss": 5.9928, "mean_token_accuracy": 0.14213165417313575, "num_tokens": 2329647.0, "step": 1125 }, { "entropy": 6.303018856048584, "epoch": 1.0263516583371195, "grad_norm": 1.078125, "learning_rate": 0.000499815255189803, "loss": 5.9275, "mean_token_accuracy": 0.14211056828498841, "num_tokens": 2339449.0, "step": 1130 }, { "entropy": 6.345061635971069, "epoch": 1.0308950477055883, "grad_norm": 1.0, "learning_rate": 0.0004998006584980922, "loss": 6.0366, "mean_token_accuracy": 0.14273955971002578, "num_tokens": 2349904.0, "step": 1135 }, { "entropy": 6.281744337081909, "epoch": 1.0354384370740572, "grad_norm": 1.125, "learning_rate": 0.0004997855071331034, "loss": 5.939, "mean_token_accuracy": 0.14582237750291824, "num_tokens": 2359833.0, "step": 1140 }, { "entropy": 6.344684028625489, "epoch": 1.039981826442526, "grad_norm": 1.0390625, "learning_rate": 0.0004997698011322211, "loss": 5.9695, "mean_token_accuracy": 0.1404454529285431, "num_tokens": 2369857.0, "step": 1145 }, { "entropy": 6.369085693359375, "epoch": 1.044525215810995, "grad_norm": 1.1953125, "learning_rate": 0.000499753540534198, "loss": 5.9877, "mean_token_accuracy": 0.14403127133846283, "num_tokens": 2380372.0, "step": 1150 }, { "entropy": 6.24423360824585, "epoch": 1.049068605179464, "grad_norm": 1.078125, "learning_rate": 0.000499736725379156, "loss": 5.9589, "mean_token_accuracy": 0.13899227380752563, "num_tokens": 2391239.0, "step": 1155 }, { "entropy": 6.212188577651977, "epoch": 1.0536119945479328, "grad_norm": 1.0703125, "learning_rate": 0.0004997193557085844, "loss": 5.9435, "mean_token_accuracy": 0.1507773369550705, "num_tokens": 2401178.0, "step": 1160 }, { "entropy": 6.409400558471679, "epoch": 1.0581553839164017, "grad_norm": 1.078125, "learning_rate": 0.0004997014315653413, "loss": 6.025, "mean_token_accuracy": 0.1460119053721428, "num_tokens": 2412496.0, "step": 1165 }, { "entropy": 6.218855905532837, "epoch": 1.0626987732848705, "grad_norm": 1.1328125, "learning_rate": 0.0004996829529936527, "loss": 6.0186, "mean_token_accuracy": 0.14455554634332657, "num_tokens": 2423281.0, "step": 1170 }, { "entropy": 6.283839988708496, "epoch": 1.0672421626533395, "grad_norm": 1.09375, "learning_rate": 0.0004996639200391126, "loss": 5.9554, "mean_token_accuracy": 0.14712593257427214, "num_tokens": 2434078.0, "step": 1175 }, { "entropy": 6.243132781982422, "epoch": 1.0717855520218083, "grad_norm": 1.2890625, "learning_rate": 0.0004996443327486831, "loss": 5.8953, "mean_token_accuracy": 0.14542663395404815, "num_tokens": 2443808.0, "step": 1180 }, { "entropy": 6.092622900009156, "epoch": 1.0763289413902772, "grad_norm": 1.1796875, "learning_rate": 0.0004996241911706937, "loss": 5.9289, "mean_token_accuracy": 0.15093712210655214, "num_tokens": 2453397.0, "step": 1185 }, { "entropy": 6.379008483886719, "epoch": 1.080872330758746, "grad_norm": 1.171875, "learning_rate": 0.0004996034953548418, "loss": 6.0198, "mean_token_accuracy": 0.14048268944025039, "num_tokens": 2464295.0, "step": 1190 }, { "entropy": 6.328823566436768, "epoch": 1.085415720127215, "grad_norm": 1.0546875, "learning_rate": 0.0004995822453521924, "loss": 6.0681, "mean_token_accuracy": 0.1382478453218937, "num_tokens": 2475311.0, "step": 1195 }, { "entropy": 6.300699663162232, "epoch": 1.0899591094956838, "grad_norm": 1.1796875, "learning_rate": 0.0004995604412151776, "loss": 5.9802, "mean_token_accuracy": 0.13811480179429053, "num_tokens": 2485968.0, "step": 1200 }, { "entropy": 6.234206342697144, "epoch": 1.0945024988641527, "grad_norm": 1.125, "learning_rate": 0.000499538082997597, "loss": 6.0021, "mean_token_accuracy": 0.14477231800556184, "num_tokens": 2496183.0, "step": 1205 }, { "entropy": 6.2193512439727785, "epoch": 1.0990458882326215, "grad_norm": 1.0546875, "learning_rate": 0.0004995151707546172, "loss": 5.9721, "mean_token_accuracy": 0.1429495245218277, "num_tokens": 2506242.0, "step": 1210 }, { "entropy": 6.3535772323608395, "epoch": 1.1035892776010905, "grad_norm": 1.140625, "learning_rate": 0.0004994917045427721, "loss": 5.9731, "mean_token_accuracy": 0.1466970331966877, "num_tokens": 2516443.0, "step": 1215 }, { "entropy": 6.175383520126343, "epoch": 1.1081326669695593, "grad_norm": 1.140625, "learning_rate": 0.0004994676844199621, "loss": 5.927, "mean_token_accuracy": 0.1484525978565216, "num_tokens": 2525795.0, "step": 1220 }, { "entropy": 6.23672137260437, "epoch": 1.1126760563380282, "grad_norm": 1.1796875, "learning_rate": 0.0004994431104454543, "loss": 5.9681, "mean_token_accuracy": 0.1421683080494404, "num_tokens": 2535046.0, "step": 1225 }, { "entropy": 6.270539140701294, "epoch": 1.117219445706497, "grad_norm": 1.2734375, "learning_rate": 0.0004994179826798828, "loss": 5.9592, "mean_token_accuracy": 0.1446902185678482, "num_tokens": 2546489.0, "step": 1230 }, { "entropy": 6.0577202320098875, "epoch": 1.121762835074966, "grad_norm": 1.125, "learning_rate": 0.0004993923011852477, "loss": 5.9018, "mean_token_accuracy": 0.14584060609340668, "num_tokens": 2556335.0, "step": 1235 }, { "entropy": 6.330905961990356, "epoch": 1.1263062244434348, "grad_norm": 1.078125, "learning_rate": 0.0004993660660249158, "loss": 5.9263, "mean_token_accuracy": 0.1401267394423485, "num_tokens": 2567647.0, "step": 1240 }, { "entropy": 6.320643138885498, "epoch": 1.1308496138119037, "grad_norm": 1.15625, "learning_rate": 0.0004993392772636194, "loss": 6.1235, "mean_token_accuracy": 0.13722320273518562, "num_tokens": 2578618.0, "step": 1245 }, { "entropy": 6.169188404083252, "epoch": 1.1353930031803725, "grad_norm": 1.2578125, "learning_rate": 0.0004993119349674573, "loss": 5.9388, "mean_token_accuracy": 0.14894965440034866, "num_tokens": 2587797.0, "step": 1250 }, { "entropy": 6.263793468475342, "epoch": 1.1399363925488415, "grad_norm": 0.99609375, "learning_rate": 0.0004992840392038938, "loss": 5.9789, "mean_token_accuracy": 0.13785690888762475, "num_tokens": 2598403.0, "step": 1255 }, { "entropy": 6.228110361099243, "epoch": 1.1444797819173103, "grad_norm": 1.046875, "learning_rate": 0.000499255590041759, "loss": 5.9828, "mean_token_accuracy": 0.1393185056746006, "num_tokens": 2608296.0, "step": 1260 }, { "entropy": 6.268101692199707, "epoch": 1.1490231712857792, "grad_norm": 1.1796875, "learning_rate": 0.0004992265875512485, "loss": 5.9961, "mean_token_accuracy": 0.14061041846871375, "num_tokens": 2617906.0, "step": 1265 }, { "entropy": 6.230483722686768, "epoch": 1.153566560654248, "grad_norm": 1.1484375, "learning_rate": 0.0004991970318039228, "loss": 5.928, "mean_token_accuracy": 0.14462323039770125, "num_tokens": 2627699.0, "step": 1270 }, { "entropy": 6.2316888809204105, "epoch": 1.158109950022717, "grad_norm": 1.0625, "learning_rate": 0.0004991669228727078, "loss": 5.9127, "mean_token_accuracy": 0.1464667573571205, "num_tokens": 2638384.0, "step": 1275 }, { "entropy": 6.133489370346069, "epoch": 1.1626533393911858, "grad_norm": 1.09375, "learning_rate": 0.0004991362608318947, "loss": 5.8514, "mean_token_accuracy": 0.14992269575595857, "num_tokens": 2648279.0, "step": 1280 }, { "entropy": 6.188581752777099, "epoch": 1.1671967287596547, "grad_norm": 1.1171875, "learning_rate": 0.0004991050457571384, "loss": 5.9348, "mean_token_accuracy": 0.13601700812578202, "num_tokens": 2657000.0, "step": 1285 }, { "entropy": 6.2308509349823, "epoch": 1.1717401181281235, "grad_norm": 0.98046875, "learning_rate": 0.0004990732777254594, "loss": 5.9566, "mean_token_accuracy": 0.1467374861240387, "num_tokens": 2667760.0, "step": 1290 }, { "entropy": 6.164466762542725, "epoch": 1.1762835074965925, "grad_norm": 1.046875, "learning_rate": 0.0004990409568152422, "loss": 5.8859, "mean_token_accuracy": 0.14483800679445266, "num_tokens": 2678450.0, "step": 1295 }, { "entropy": 6.205280447006226, "epoch": 1.1808268968650613, "grad_norm": 1.1484375, "learning_rate": 0.0004990080831062352, "loss": 5.9971, "mean_token_accuracy": 0.13332329392433168, "num_tokens": 2689695.0, "step": 1300 }, { "entropy": 6.318863582611084, "epoch": 1.1853702862335302, "grad_norm": 1.1171875, "learning_rate": 0.0004989746566795512, "loss": 6.0088, "mean_token_accuracy": 0.14588286280632018, "num_tokens": 2700414.0, "step": 1305 }, { "entropy": 6.0982919216156, "epoch": 1.189913675601999, "grad_norm": 1.15625, "learning_rate": 0.0004989406776176665, "loss": 5.8444, "mean_token_accuracy": 0.15696054548025132, "num_tokens": 2709985.0, "step": 1310 }, { "entropy": 6.167340230941773, "epoch": 1.194457064970468, "grad_norm": 1.2265625, "learning_rate": 0.000498906146004421, "loss": 5.9796, "mean_token_accuracy": 0.14428043439984323, "num_tokens": 2720990.0, "step": 1315 }, { "entropy": 6.1923376560211185, "epoch": 1.1990004543389368, "grad_norm": 1.1640625, "learning_rate": 0.0004988710619250181, "loss": 5.8866, "mean_token_accuracy": 0.14820230454206468, "num_tokens": 2731285.0, "step": 1320 }, { "entropy": 6.164142608642578, "epoch": 1.2035438437074057, "grad_norm": 1.1328125, "learning_rate": 0.0004988354254660244, "loss": 5.96, "mean_token_accuracy": 0.1433941274881363, "num_tokens": 2741024.0, "step": 1325 }, { "entropy": 6.144341564178466, "epoch": 1.2080872330758745, "grad_norm": 1.0234375, "learning_rate": 0.0004987992367153691, "loss": 5.9114, "mean_token_accuracy": 0.15126630812883377, "num_tokens": 2751447.0, "step": 1330 }, { "entropy": 6.191232109069825, "epoch": 1.2126306224443435, "grad_norm": 1.1171875, "learning_rate": 0.0004987624957623443, "loss": 5.9203, "mean_token_accuracy": 0.14985225796699525, "num_tokens": 2761283.0, "step": 1335 }, { "entropy": 6.0593242168426515, "epoch": 1.2171740118128123, "grad_norm": 1.1875, "learning_rate": 0.0004987252026976049, "loss": 5.8459, "mean_token_accuracy": 0.15530473440885545, "num_tokens": 2771354.0, "step": 1340 }, { "entropy": 6.294860458374023, "epoch": 1.2217174011812812, "grad_norm": 1.09375, "learning_rate": 0.0004986873576131676, "loss": 6.0239, "mean_token_accuracy": 0.14431079253554344, "num_tokens": 2781063.0, "step": 1345 }, { "entropy": 6.217547655105591, "epoch": 1.22626079054975, "grad_norm": 1.1171875, "learning_rate": 0.0004986489606024116, "loss": 5.9304, "mean_token_accuracy": 0.1437186896800995, "num_tokens": 2791103.0, "step": 1350 }, { "entropy": 6.219854211807251, "epoch": 1.230804179918219, "grad_norm": 1.0703125, "learning_rate": 0.0004986100117600776, "loss": 6.0295, "mean_token_accuracy": 0.144706778973341, "num_tokens": 2802382.0, "step": 1355 }, { "entropy": 6.14369158744812, "epoch": 1.235347569286688, "grad_norm": 1.0625, "learning_rate": 0.000498570511182268, "loss": 5.9119, "mean_token_accuracy": 0.14514135867357253, "num_tokens": 2813740.0, "step": 1360 }, { "entropy": 6.21032567024231, "epoch": 1.2398909586551567, "grad_norm": 1.0859375, "learning_rate": 0.0004985304589664465, "loss": 5.9245, "mean_token_accuracy": 0.1452763110399246, "num_tokens": 2824121.0, "step": 1365 }, { "entropy": 6.214183759689331, "epoch": 1.2444343480236255, "grad_norm": 1.1875, "learning_rate": 0.0004984898552114381, "loss": 5.9416, "mean_token_accuracy": 0.1472145602107048, "num_tokens": 2833356.0, "step": 1370 }, { "entropy": 6.167957735061646, "epoch": 1.2489777373920945, "grad_norm": 1.0390625, "learning_rate": 0.0004984487000174283, "loss": 5.9203, "mean_token_accuracy": 0.1406264141201973, "num_tokens": 2843839.0, "step": 1375 }, { "entropy": 6.170833778381348, "epoch": 1.2535211267605635, "grad_norm": 1.0703125, "learning_rate": 0.0004984069934859637, "loss": 5.8777, "mean_token_accuracy": 0.14574506133794785, "num_tokens": 2853523.0, "step": 1380 }, { "entropy": 6.1578349590301515, "epoch": 1.2580645161290323, "grad_norm": 1.1015625, "learning_rate": 0.0004983647357199509, "loss": 5.9262, "mean_token_accuracy": 0.1466248780488968, "num_tokens": 2863226.0, "step": 1385 }, { "entropy": 6.242066144943237, "epoch": 1.262607905497501, "grad_norm": 1.0546875, "learning_rate": 0.0004983219268236567, "loss": 5.9784, "mean_token_accuracy": 0.1478915549814701, "num_tokens": 2873822.0, "step": 1390 }, { "entropy": 6.164571857452392, "epoch": 1.26715129486597, "grad_norm": 1.03125, "learning_rate": 0.0004982785669027079, "loss": 5.859, "mean_token_accuracy": 0.15025245249271393, "num_tokens": 2883645.0, "step": 1395 }, { "entropy": 6.158694410324097, "epoch": 1.271694684234439, "grad_norm": 1.015625, "learning_rate": 0.0004982346560640907, "loss": 5.968, "mean_token_accuracy": 0.14305587261915206, "num_tokens": 2894397.0, "step": 1400 }, { "entropy": 6.159107875823975, "epoch": 1.2762380736029078, "grad_norm": 1.1171875, "learning_rate": 0.0004981901944161507, "loss": 5.9425, "mean_token_accuracy": 0.14893015027046203, "num_tokens": 2904947.0, "step": 1405 }, { "entropy": 6.179767179489136, "epoch": 1.2807814629713765, "grad_norm": 1.015625, "learning_rate": 0.0004981451820685928, "loss": 5.9019, "mean_token_accuracy": 0.14795035123825073, "num_tokens": 2916183.0, "step": 1410 }, { "entropy": 6.076482915878296, "epoch": 1.2853248523398455, "grad_norm": 1.2890625, "learning_rate": 0.0004980996191324802, "loss": 5.83, "mean_token_accuracy": 0.14453127086162568, "num_tokens": 2925429.0, "step": 1415 }, { "entropy": 6.1859314918518065, "epoch": 1.2898682417083145, "grad_norm": 1.0703125, "learning_rate": 0.0004980535057202351, "loss": 5.8751, "mean_token_accuracy": 0.1504214696586132, "num_tokens": 2935142.0, "step": 1420 }, { "entropy": 6.141068983078003, "epoch": 1.2944116310767833, "grad_norm": 1.15625, "learning_rate": 0.0004980068419456378, "loss": 5.9399, "mean_token_accuracy": 0.15101734101772307, "num_tokens": 2945151.0, "step": 1425 }, { "entropy": 6.25739860534668, "epoch": 1.2989550204452522, "grad_norm": 1.1640625, "learning_rate": 0.0004979596279238265, "loss": 6.0315, "mean_token_accuracy": 0.14452726691961287, "num_tokens": 2956015.0, "step": 1430 }, { "entropy": 6.128569793701172, "epoch": 1.303498409813721, "grad_norm": 1.1796875, "learning_rate": 0.0004979118637712969, "loss": 5.8704, "mean_token_accuracy": 0.14910778105258943, "num_tokens": 2965879.0, "step": 1435 }, { "entropy": 6.2099706649780275, "epoch": 1.30804179918219, "grad_norm": 1.1328125, "learning_rate": 0.0004978635496059025, "loss": 5.9521, "mean_token_accuracy": 0.14465083330869674, "num_tokens": 2977021.0, "step": 1440 }, { "entropy": 6.051621627807617, "epoch": 1.3125851885506588, "grad_norm": 1.140625, "learning_rate": 0.0004978146855468537, "loss": 5.8514, "mean_token_accuracy": 0.15206357687711716, "num_tokens": 2987169.0, "step": 1445 }, { "entropy": 6.252909708023071, "epoch": 1.3171285779191277, "grad_norm": 0.98046875, "learning_rate": 0.0004977652717147177, "loss": 5.957, "mean_token_accuracy": 0.14722876995801926, "num_tokens": 2997666.0, "step": 1450 }, { "entropy": 6.1304113388061525, "epoch": 1.3216719672875965, "grad_norm": 1.2109375, "learning_rate": 0.0004977153082314182, "loss": 5.834, "mean_token_accuracy": 0.14632118940353395, "num_tokens": 3007021.0, "step": 1455 }, { "entropy": 6.10150933265686, "epoch": 1.3262153566560655, "grad_norm": 1.1796875, "learning_rate": 0.000497664795220235, "loss": 5.8954, "mean_token_accuracy": 0.15438694655895233, "num_tokens": 3016557.0, "step": 1460 }, { "entropy": 6.080778646469116, "epoch": 1.3307587460245343, "grad_norm": 1.0546875, "learning_rate": 0.0004976137328058042, "loss": 5.8474, "mean_token_accuracy": 0.15140835493803023, "num_tokens": 3026146.0, "step": 1465 }, { "entropy": 6.249139928817749, "epoch": 1.3353021353930032, "grad_norm": 1.046875, "learning_rate": 0.000497562121114117, "loss": 5.914, "mean_token_accuracy": 0.14972909688949584, "num_tokens": 3037234.0, "step": 1470 }, { "entropy": 6.060841608047485, "epoch": 1.339845524761472, "grad_norm": 1.1015625, "learning_rate": 0.0004975099602725202, "loss": 5.8469, "mean_token_accuracy": 0.15097369849681855, "num_tokens": 3047282.0, "step": 1475 }, { "entropy": 6.0163311004638675, "epoch": 1.344388914129941, "grad_norm": 1.0546875, "learning_rate": 0.0004974572504097154, "loss": 5.8775, "mean_token_accuracy": 0.14596813321113586, "num_tokens": 3058648.0, "step": 1480 }, { "entropy": 6.3922360897064205, "epoch": 1.3489323034984098, "grad_norm": 1.0859375, "learning_rate": 0.0004974039916557591, "loss": 6.0521, "mean_token_accuracy": 0.14746224284172058, "num_tokens": 3068996.0, "step": 1485 }, { "entropy": 6.0920412063598635, "epoch": 1.3534756928668787, "grad_norm": 1.1875, "learning_rate": 0.000497350184142062, "loss": 5.8706, "mean_token_accuracy": 0.15449940860271455, "num_tokens": 3078991.0, "step": 1490 }, { "entropy": 6.061806488037109, "epoch": 1.3580190822353475, "grad_norm": 1.0625, "learning_rate": 0.0004972958280013886, "loss": 5.8313, "mean_token_accuracy": 0.14856264963746071, "num_tokens": 3090200.0, "step": 1495 }, { "entropy": 6.064583158493042, "epoch": 1.3625624716038165, "grad_norm": 1.03125, "learning_rate": 0.0004972409233678575, "loss": 5.8824, "mean_token_accuracy": 0.1481930769979954, "num_tokens": 3101971.0, "step": 1500 }, { "epoch": 1.3625624716038165, "eval_entropy": 6.010310361551684, "eval_loss": 6.112026691436768, "eval_mean_token_accuracy": 0.14368421690928382, "eval_num_tokens": 3101971.0, "eval_runtime": 1.9918, "eval_samples_per_second": 1724.537, "eval_steps_per_second": 215.881, "step": 1500 }, { "entropy": 6.155653715133667, "epoch": 1.3671058609722853, "grad_norm": 1.0625, "learning_rate": 0.0004971854703769401, "loss": 5.9744, "mean_token_accuracy": 0.14244725480675696, "num_tokens": 3113381.0, "step": 1505 }, { "entropy": 6.212191724777222, "epoch": 1.3716492503407542, "grad_norm": 0.984375, "learning_rate": 0.0004971294691654616, "loss": 5.9412, "mean_token_accuracy": 0.14757327735424042, "num_tokens": 3125099.0, "step": 1510 }, { "entropy": 6.035371208190918, "epoch": 1.376192639709223, "grad_norm": 1.0390625, "learning_rate": 0.000497072919871599, "loss": 5.8306, "mean_token_accuracy": 0.15051676481962203, "num_tokens": 3135007.0, "step": 1515 }, { "entropy": 6.139113426208496, "epoch": 1.380736029077692, "grad_norm": 1.109375, "learning_rate": 0.0004970158226348824, "loss": 5.8755, "mean_token_accuracy": 0.14846791476011276, "num_tokens": 3145031.0, "step": 1520 }, { "entropy": 6.1009729385375975, "epoch": 1.3852794184461608, "grad_norm": 0.9453125, "learning_rate": 0.0004969581775961932, "loss": 5.9193, "mean_token_accuracy": 0.14607925936579705, "num_tokens": 3156044.0, "step": 1525 }, { "entropy": 6.117117691040039, "epoch": 1.3898228078146297, "grad_norm": 1.1953125, "learning_rate": 0.0004968999848977651, "loss": 5.8252, "mean_token_accuracy": 0.1452489376068115, "num_tokens": 3165124.0, "step": 1530 }, { "entropy": 5.991549634933472, "epoch": 1.3943661971830985, "grad_norm": 1.1015625, "learning_rate": 0.0004968412446831827, "loss": 5.7562, "mean_token_accuracy": 0.15743231400847435, "num_tokens": 3175246.0, "step": 1535 }, { "entropy": 6.174799633026123, "epoch": 1.3989095865515675, "grad_norm": 1.2421875, "learning_rate": 0.0004967819570973816, "loss": 5.8602, "mean_token_accuracy": 0.15806265771389008, "num_tokens": 3184817.0, "step": 1540 }, { "entropy": 6.039784955978393, "epoch": 1.4034529759200365, "grad_norm": 1.0859375, "learning_rate": 0.000496722122286648, "loss": 5.8958, "mean_token_accuracy": 0.13960993736982347, "num_tokens": 3195142.0, "step": 1545 }, { "entropy": 6.100436353683472, "epoch": 1.4079963652885052, "grad_norm": 1.1015625, "learning_rate": 0.0004966617403986185, "loss": 5.8342, "mean_token_accuracy": 0.15092215985059737, "num_tokens": 3205724.0, "step": 1550 }, { "entropy": 6.136019706726074, "epoch": 1.412539754656974, "grad_norm": 0.94921875, "learning_rate": 0.0004966008115822793, "loss": 5.9813, "mean_token_accuracy": 0.143601393699646, "num_tokens": 3216919.0, "step": 1555 }, { "entropy": 6.22254900932312, "epoch": 1.417083144025443, "grad_norm": 0.9609375, "learning_rate": 0.0004965393359879662, "loss": 5.9848, "mean_token_accuracy": 0.1447094537317753, "num_tokens": 3228929.0, "step": 1560 }, { "entropy": 6.096653318405151, "epoch": 1.421626533393912, "grad_norm": 1.109375, "learning_rate": 0.0004964773137673641, "loss": 5.9416, "mean_token_accuracy": 0.150317420065403, "num_tokens": 3239541.0, "step": 1565 }, { "entropy": 6.10661678314209, "epoch": 1.4261699227623807, "grad_norm": 1.0234375, "learning_rate": 0.0004964147450735067, "loss": 5.8266, "mean_token_accuracy": 0.1529161736369133, "num_tokens": 3249527.0, "step": 1570 }, { "entropy": 6.007682275772095, "epoch": 1.4307133121308495, "grad_norm": 0.984375, "learning_rate": 0.000496351630060776, "loss": 5.7383, "mean_token_accuracy": 0.14990039318799972, "num_tokens": 3260497.0, "step": 1575 }, { "entropy": 6.1867749214172365, "epoch": 1.4352567014993185, "grad_norm": 1.171875, "learning_rate": 0.0004962879688849021, "loss": 5.918, "mean_token_accuracy": 0.14759416580200196, "num_tokens": 3270865.0, "step": 1580 }, { "entropy": 6.039413547515869, "epoch": 1.4398000908677875, "grad_norm": 1.1171875, "learning_rate": 0.0004962237617029625, "loss": 5.8479, "mean_token_accuracy": 0.14621682912111283, "num_tokens": 3281531.0, "step": 1585 }, { "entropy": 6.135113286972046, "epoch": 1.4443434802362562, "grad_norm": 1.140625, "learning_rate": 0.0004961590086733821, "loss": 5.8254, "mean_token_accuracy": 0.14780823439359664, "num_tokens": 3291970.0, "step": 1590 }, { "entropy": 6.045197772979736, "epoch": 1.448886869604725, "grad_norm": 1.0390625, "learning_rate": 0.0004960937099559326, "loss": 5.8636, "mean_token_accuracy": 0.15563471540808677, "num_tokens": 3301638.0, "step": 1595 }, { "entropy": 6.2000038623809814, "epoch": 1.453430258973194, "grad_norm": 1.2109375, "learning_rate": 0.0004960278657117321, "loss": 5.9443, "mean_token_accuracy": 0.1489829644560814, "num_tokens": 3311780.0, "step": 1600 }, { "entropy": 6.024671220779419, "epoch": 1.457973648341663, "grad_norm": 1.109375, "learning_rate": 0.0004959614761032446, "loss": 5.7979, "mean_token_accuracy": 0.147994464635849, "num_tokens": 3322096.0, "step": 1605 }, { "entropy": 6.203094100952148, "epoch": 1.4625170377101318, "grad_norm": 1.140625, "learning_rate": 0.00049589454129428, "loss": 5.971, "mean_token_accuracy": 0.14461974278092385, "num_tokens": 3332324.0, "step": 1610 }, { "entropy": 6.002854490280152, "epoch": 1.4670604270786005, "grad_norm": 1.171875, "learning_rate": 0.0004958270614499932, "loss": 5.763, "mean_token_accuracy": 0.16030256152153016, "num_tokens": 3342037.0, "step": 1615 }, { "entropy": 6.113955974578857, "epoch": 1.4716038164470695, "grad_norm": 0.9921875, "learning_rate": 0.0004957590367368841, "loss": 5.8657, "mean_token_accuracy": 0.1496028944849968, "num_tokens": 3353047.0, "step": 1620 }, { "entropy": 6.031614971160889, "epoch": 1.4761472058155385, "grad_norm": 1.0625, "learning_rate": 0.0004956904673227968, "loss": 5.7719, "mean_token_accuracy": 0.14885980635881424, "num_tokens": 3363841.0, "step": 1625 }, { "entropy": 6.0577257633209225, "epoch": 1.4806905951840073, "grad_norm": 1.09375, "learning_rate": 0.0004956213533769195, "loss": 5.8609, "mean_token_accuracy": 0.1518976554274559, "num_tokens": 3374086.0, "step": 1630 }, { "entropy": 6.076325702667236, "epoch": 1.485233984552476, "grad_norm": 1.1015625, "learning_rate": 0.0004955516950697843, "loss": 5.8347, "mean_token_accuracy": 0.15219635143876076, "num_tokens": 3384303.0, "step": 1635 }, { "entropy": 6.076239967346192, "epoch": 1.489777373920945, "grad_norm": 1.109375, "learning_rate": 0.0004954814925732657, "loss": 5.8189, "mean_token_accuracy": 0.15623874068260193, "num_tokens": 3394858.0, "step": 1640 }, { "entropy": 6.027254343032837, "epoch": 1.494320763289414, "grad_norm": 0.984375, "learning_rate": 0.0004954107460605816, "loss": 5.8267, "mean_token_accuracy": 0.15381198078393937, "num_tokens": 3405252.0, "step": 1645 }, { "entropy": 6.210509300231934, "epoch": 1.4988641526578828, "grad_norm": 1.1640625, "learning_rate": 0.0004953394557062922, "loss": 5.8847, "mean_token_accuracy": 0.1505520910024643, "num_tokens": 3416007.0, "step": 1650 }, { "entropy": 6.135774326324463, "epoch": 1.5034075420263515, "grad_norm": 1.1875, "learning_rate": 0.0004952676216862989, "loss": 5.9187, "mean_token_accuracy": 0.1479334443807602, "num_tokens": 3426932.0, "step": 1655 }, { "entropy": 6.015619897842408, "epoch": 1.5079509313948205, "grad_norm": 1.046875, "learning_rate": 0.0004951952441778453, "loss": 5.8104, "mean_token_accuracy": 0.15175799578428267, "num_tokens": 3437262.0, "step": 1660 }, { "entropy": 6.0340088367462155, "epoch": 1.5124943207632895, "grad_norm": 1.015625, "learning_rate": 0.0004951223233595158, "loss": 5.7805, "mean_token_accuracy": 0.1545313701033592, "num_tokens": 3447525.0, "step": 1665 }, { "entropy": 6.12761287689209, "epoch": 1.5170377101317583, "grad_norm": 1.046875, "learning_rate": 0.000495048859411235, "loss": 5.8772, "mean_token_accuracy": 0.15465754568576812, "num_tokens": 3458198.0, "step": 1670 }, { "entropy": 6.002855825424194, "epoch": 1.521581099500227, "grad_norm": 1.046875, "learning_rate": 0.0004949748525142681, "loss": 5.769, "mean_token_accuracy": 0.159763203561306, "num_tokens": 3468149.0, "step": 1675 }, { "entropy": 6.033917808532715, "epoch": 1.526124488868696, "grad_norm": 1.1328125, "learning_rate": 0.0004949003028512195, "loss": 5.7608, "mean_token_accuracy": 0.15041886121034623, "num_tokens": 3478355.0, "step": 1680 }, { "entropy": 6.037674856185913, "epoch": 1.530667878237165, "grad_norm": 1.0703125, "learning_rate": 0.0004948252106060334, "loss": 5.7881, "mean_token_accuracy": 0.1532315917313099, "num_tokens": 3488726.0, "step": 1685 }, { "entropy": 5.994457054138183, "epoch": 1.5352112676056338, "grad_norm": 1.1796875, "learning_rate": 0.0004947495759639923, "loss": 5.7469, "mean_token_accuracy": 0.15575082004070281, "num_tokens": 3498346.0, "step": 1690 }, { "entropy": 5.982219219207764, "epoch": 1.5397546569741025, "grad_norm": 1.125, "learning_rate": 0.0004946733991117171, "loss": 5.8192, "mean_token_accuracy": 0.15100184381008147, "num_tokens": 3508213.0, "step": 1695 }, { "entropy": 6.1639477729797365, "epoch": 1.5442980463425715, "grad_norm": 1.1015625, "learning_rate": 0.0004945966802371668, "loss": 5.9456, "mean_token_accuracy": 0.1517024278640747, "num_tokens": 3518978.0, "step": 1700 }, { "entropy": 6.086548089981079, "epoch": 1.5488414357110405, "grad_norm": 1.0546875, "learning_rate": 0.0004945194195296374, "loss": 5.8769, "mean_token_accuracy": 0.1542578913271427, "num_tokens": 3529328.0, "step": 1705 }, { "entropy": 5.998582649230957, "epoch": 1.5533848250795095, "grad_norm": 1.0, "learning_rate": 0.000494441617179762, "loss": 5.8118, "mean_token_accuracy": 0.1479377903044224, "num_tokens": 3539347.0, "step": 1710 }, { "entropy": 6.077225923538208, "epoch": 1.5579282144479782, "grad_norm": 1.171875, "learning_rate": 0.0004943632733795104, "loss": 5.8254, "mean_token_accuracy": 0.14645756483078004, "num_tokens": 3549798.0, "step": 1715 }, { "entropy": 6.097193574905395, "epoch": 1.562471603816447, "grad_norm": 1.140625, "learning_rate": 0.0004942843883221879, "loss": 5.9228, "mean_token_accuracy": 0.14081277772784234, "num_tokens": 3560363.0, "step": 1720 }, { "entropy": 6.067219400405884, "epoch": 1.567014993184916, "grad_norm": 1.15625, "learning_rate": 0.0004942049622024357, "loss": 5.8596, "mean_token_accuracy": 0.15149142742156982, "num_tokens": 3570080.0, "step": 1725 }, { "entropy": 6.030013561248779, "epoch": 1.571558382553385, "grad_norm": 1.078125, "learning_rate": 0.0004941249952162298, "loss": 5.8609, "mean_token_accuracy": 0.15077890902757646, "num_tokens": 3580053.0, "step": 1730 }, { "entropy": 6.06266942024231, "epoch": 1.5761017719218537, "grad_norm": 1.015625, "learning_rate": 0.0004940444875608807, "loss": 5.935, "mean_token_accuracy": 0.14908838123083115, "num_tokens": 3590119.0, "step": 1735 }, { "entropy": 6.13274450302124, "epoch": 1.5806451612903225, "grad_norm": 1.109375, "learning_rate": 0.0004939634394350332, "loss": 5.917, "mean_token_accuracy": 0.14301933497190475, "num_tokens": 3601809.0, "step": 1740 }, { "entropy": 6.125389242172242, "epoch": 1.5851885506587915, "grad_norm": 1.046875, "learning_rate": 0.0004938818510386654, "loss": 5.7696, "mean_token_accuracy": 0.1557802826166153, "num_tokens": 3611752.0, "step": 1745 }, { "entropy": 5.999754285812378, "epoch": 1.5897319400272605, "grad_norm": 1.109375, "learning_rate": 0.0004937997225730886, "loss": 5.8378, "mean_token_accuracy": 0.14936369210481643, "num_tokens": 3621137.0, "step": 1750 }, { "entropy": 6.069888114929199, "epoch": 1.5942753293957292, "grad_norm": 1.09375, "learning_rate": 0.0004937170542409464, "loss": 5.8157, "mean_token_accuracy": 0.15330246984958648, "num_tokens": 3631567.0, "step": 1755 }, { "entropy": 5.983861780166626, "epoch": 1.598818718764198, "grad_norm": 1.1171875, "learning_rate": 0.000493633846246215, "loss": 5.7763, "mean_token_accuracy": 0.15117551535367965, "num_tokens": 3641145.0, "step": 1760 }, { "entropy": 6.04713807106018, "epoch": 1.603362108132667, "grad_norm": 1.0546875, "learning_rate": 0.0004935500987942018, "loss": 5.8209, "mean_token_accuracy": 0.14794272035360337, "num_tokens": 3651716.0, "step": 1765 }, { "entropy": 6.039504051208496, "epoch": 1.607905497501136, "grad_norm": 1.0625, "learning_rate": 0.0004934658120915452, "loss": 5.7659, "mean_token_accuracy": 0.15761386901140212, "num_tokens": 3662577.0, "step": 1770 }, { "entropy": 5.967999887466431, "epoch": 1.6124488868696047, "grad_norm": 1.03125, "learning_rate": 0.0004933809863462142, "loss": 5.7565, "mean_token_accuracy": 0.15783901810646056, "num_tokens": 3672984.0, "step": 1775 }, { "entropy": 6.058130693435669, "epoch": 1.6169922762380735, "grad_norm": 1.0859375, "learning_rate": 0.0004932956217675082, "loss": 5.8326, "mean_token_accuracy": 0.15765131264925003, "num_tokens": 3682634.0, "step": 1780 }, { "entropy": 6.012119722366333, "epoch": 1.6215356656065425, "grad_norm": 1.1875, "learning_rate": 0.0004932097185660555, "loss": 5.803, "mean_token_accuracy": 0.1533336967229843, "num_tokens": 3693022.0, "step": 1785 }, { "entropy": 5.897359848022461, "epoch": 1.6260790549750115, "grad_norm": 1.171875, "learning_rate": 0.0004931232769538138, "loss": 5.6836, "mean_token_accuracy": 0.15874901562929153, "num_tokens": 3702234.0, "step": 1790 }, { "entropy": 5.99068398475647, "epoch": 1.6306224443434802, "grad_norm": 1.109375, "learning_rate": 0.0004930362971440692, "loss": 5.8666, "mean_token_accuracy": 0.14502066224813462, "num_tokens": 3712235.0, "step": 1795 }, { "entropy": 6.098167991638183, "epoch": 1.635165833711949, "grad_norm": 1.0546875, "learning_rate": 0.0004929487793514358, "loss": 5.7923, "mean_token_accuracy": 0.15776385068893434, "num_tokens": 3722745.0, "step": 1800 }, { "entropy": 5.945577621459961, "epoch": 1.639709223080418, "grad_norm": 1.015625, "learning_rate": 0.000492860723791855, "loss": 5.8415, "mean_token_accuracy": 0.15472140908241272, "num_tokens": 3732942.0, "step": 1805 }, { "entropy": 6.090262937545776, "epoch": 1.644252612448887, "grad_norm": 1.1796875, "learning_rate": 0.0004927721306825952, "loss": 5.8288, "mean_token_accuracy": 0.14960406571626664, "num_tokens": 3743806.0, "step": 1810 }, { "entropy": 5.95607361793518, "epoch": 1.6487960018173557, "grad_norm": 1.0703125, "learning_rate": 0.0004926830002422509, "loss": 5.8201, "mean_token_accuracy": 0.15639638900756836, "num_tokens": 3755115.0, "step": 1815 }, { "entropy": 6.01966667175293, "epoch": 1.6533393911858245, "grad_norm": 1.109375, "learning_rate": 0.000492593332690743, "loss": 5.7753, "mean_token_accuracy": 0.15850363969802855, "num_tokens": 3765867.0, "step": 1820 }, { "entropy": 5.953131103515625, "epoch": 1.6578827805542935, "grad_norm": 1.1328125, "learning_rate": 0.0004925031282493167, "loss": 5.7583, "mean_token_accuracy": 0.15291280448436737, "num_tokens": 3777071.0, "step": 1825 }, { "entropy": 5.994158983230591, "epoch": 1.6624261699227625, "grad_norm": 1.125, "learning_rate": 0.0004924123871405428, "loss": 5.7438, "mean_token_accuracy": 0.15453884303569793, "num_tokens": 3786554.0, "step": 1830 }, { "entropy": 6.0475998878479, "epoch": 1.6669695592912313, "grad_norm": 1.15625, "learning_rate": 0.0004923211095883161, "loss": 5.805, "mean_token_accuracy": 0.15379742309451103, "num_tokens": 3797627.0, "step": 1835 }, { "entropy": 5.9351438045501705, "epoch": 1.6715129486597, "grad_norm": 1.0546875, "learning_rate": 0.0004922292958178546, "loss": 5.7941, "mean_token_accuracy": 0.15232791006565094, "num_tokens": 3808841.0, "step": 1840 }, { "entropy": 6.059771919250489, "epoch": 1.676056338028169, "grad_norm": 1.1640625, "learning_rate": 0.0004921369460557, "loss": 5.8311, "mean_token_accuracy": 0.1511898323893547, "num_tokens": 3818995.0, "step": 1845 }, { "entropy": 6.031847953796387, "epoch": 1.680599727396638, "grad_norm": 1.1640625, "learning_rate": 0.0004920440605297159, "loss": 5.8849, "mean_token_accuracy": 0.14733135402202607, "num_tokens": 3828762.0, "step": 1850 }, { "entropy": 6.046364068984985, "epoch": 1.6851431167651068, "grad_norm": 1.109375, "learning_rate": 0.000491950639469088, "loss": 5.7131, "mean_token_accuracy": 0.1525560736656189, "num_tokens": 3838752.0, "step": 1855 }, { "entropy": 5.9523547172546385, "epoch": 1.6896865061335755, "grad_norm": 1.046875, "learning_rate": 0.0004918566831043238, "loss": 5.7588, "mean_token_accuracy": 0.15982652306556702, "num_tokens": 3849664.0, "step": 1860 }, { "entropy": 5.9417627334594725, "epoch": 1.6942298955020445, "grad_norm": 1.109375, "learning_rate": 0.000491762191667251, "loss": 5.7471, "mean_token_accuracy": 0.162150639295578, "num_tokens": 3859053.0, "step": 1865 }, { "entropy": 5.992360973358155, "epoch": 1.6987732848705135, "grad_norm": 1.09375, "learning_rate": 0.000491667165391018, "loss": 5.8144, "mean_token_accuracy": 0.1509104624390602, "num_tokens": 3869654.0, "step": 1870 }, { "entropy": 5.990663051605225, "epoch": 1.7033166742389823, "grad_norm": 1.1953125, "learning_rate": 0.0004915716045100927, "loss": 5.8171, "mean_token_accuracy": 0.15092908442020417, "num_tokens": 3879678.0, "step": 1875 }, { "entropy": 5.9989344596862795, "epoch": 1.707860063607451, "grad_norm": 1.1796875, "learning_rate": 0.0004914755092602621, "loss": 5.7108, "mean_token_accuracy": 0.15671169608831406, "num_tokens": 3889950.0, "step": 1880 }, { "entropy": 5.903370571136475, "epoch": 1.71240345297592, "grad_norm": 1.03125, "learning_rate": 0.0004913788798786314, "loss": 5.7897, "mean_token_accuracy": 0.1557111695408821, "num_tokens": 3900095.0, "step": 1885 }, { "entropy": 6.113225984573364, "epoch": 1.716946842344389, "grad_norm": 1.2421875, "learning_rate": 0.0004912817166036243, "loss": 5.8433, "mean_token_accuracy": 0.148323355615139, "num_tokens": 3911034.0, "step": 1890 }, { "entropy": 5.947522974014282, "epoch": 1.7214902317128578, "grad_norm": 1.0546875, "learning_rate": 0.0004911840196749813, "loss": 5.8189, "mean_token_accuracy": 0.15346475541591645, "num_tokens": 3922219.0, "step": 1895 }, { "entropy": 6.01598973274231, "epoch": 1.7260336210813265, "grad_norm": 1.0234375, "learning_rate": 0.0004910857893337602, "loss": 5.7796, "mean_token_accuracy": 0.15475602000951766, "num_tokens": 3932235.0, "step": 1900 }, { "entropy": 5.950323963165284, "epoch": 1.7305770104497955, "grad_norm": 1.0625, "learning_rate": 0.0004909870258223342, "loss": 5.7209, "mean_token_accuracy": 0.15549042522907258, "num_tokens": 3941845.0, "step": 1905 }, { "entropy": 5.98919267654419, "epoch": 1.7351203998182645, "grad_norm": 1.09375, "learning_rate": 0.0004908877293843926, "loss": 5.8179, "mean_token_accuracy": 0.1464027062058449, "num_tokens": 3953392.0, "step": 1910 }, { "entropy": 5.958113050460815, "epoch": 1.7396637891867333, "grad_norm": 1.109375, "learning_rate": 0.0004907879002649395, "loss": 5.6751, "mean_token_accuracy": 0.15961584746837615, "num_tokens": 3963294.0, "step": 1915 }, { "entropy": 5.902626276016235, "epoch": 1.744207178555202, "grad_norm": 0.98828125, "learning_rate": 0.0004906875387102935, "loss": 5.7461, "mean_token_accuracy": 0.14919328689575195, "num_tokens": 3973660.0, "step": 1920 }, { "entropy": 6.004216289520263, "epoch": 1.748750567923671, "grad_norm": 1.1484375, "learning_rate": 0.0004905866449680864, "loss": 5.7435, "mean_token_accuracy": 0.15620660185813903, "num_tokens": 3983587.0, "step": 1925 }, { "entropy": 5.990758466720581, "epoch": 1.75329395729214, "grad_norm": 1.0703125, "learning_rate": 0.0004904852192872638, "loss": 5.8026, "mean_token_accuracy": 0.14908624291419983, "num_tokens": 3994346.0, "step": 1930 }, { "entropy": 5.954130840301514, "epoch": 1.757837346660609, "grad_norm": 1.078125, "learning_rate": 0.0004903832619180834, "loss": 5.7775, "mean_token_accuracy": 0.15563612207770347, "num_tokens": 4005234.0, "step": 1935 }, { "entropy": 5.907217693328858, "epoch": 1.7623807360290777, "grad_norm": 1.1171875, "learning_rate": 0.0004902807731121147, "loss": 5.6992, "mean_token_accuracy": 0.1574781894683838, "num_tokens": 4015542.0, "step": 1940 }, { "entropy": 5.887025976181031, "epoch": 1.7669241253975465, "grad_norm": 1.1484375, "learning_rate": 0.0004901777531222389, "loss": 5.7166, "mean_token_accuracy": 0.15762990117073059, "num_tokens": 4024874.0, "step": 1945 }, { "entropy": 6.042590951919555, "epoch": 1.7714675147660155, "grad_norm": 1.09375, "learning_rate": 0.0004900742022026474, "loss": 5.8557, "mean_token_accuracy": 0.15325795263051986, "num_tokens": 4035880.0, "step": 1950 }, { "entropy": 5.995141458511353, "epoch": 1.7760109041344845, "grad_norm": 1.140625, "learning_rate": 0.0004899701206088419, "loss": 5.7431, "mean_token_accuracy": 0.1556558609008789, "num_tokens": 4046484.0, "step": 1955 }, { "entropy": 5.962204217910767, "epoch": 1.7805542935029532, "grad_norm": 1.1328125, "learning_rate": 0.0004898655085976333, "loss": 5.8043, "mean_token_accuracy": 0.1540881484746933, "num_tokens": 4057037.0, "step": 1960 }, { "entropy": 6.083400821685791, "epoch": 1.785097682871422, "grad_norm": 1.203125, "learning_rate": 0.0004897603664271413, "loss": 5.8815, "mean_token_accuracy": 0.15016181543469428, "num_tokens": 4066169.0, "step": 1965 }, { "entropy": 5.898530769348144, "epoch": 1.789641072239891, "grad_norm": 1.078125, "learning_rate": 0.000489654694356794, "loss": 5.793, "mean_token_accuracy": 0.14934501200914382, "num_tokens": 4076697.0, "step": 1970 }, { "entropy": 5.959667587280274, "epoch": 1.79418446160836, "grad_norm": 1.0390625, "learning_rate": 0.0004895484926473265, "loss": 5.6796, "mean_token_accuracy": 0.15848930925130844, "num_tokens": 4087372.0, "step": 1975 }, { "entropy": 6.010518646240234, "epoch": 1.7987278509768287, "grad_norm": 1.03125, "learning_rate": 0.000489441761560781, "loss": 5.7704, "mean_token_accuracy": 0.1524614840745926, "num_tokens": 4097653.0, "step": 1980 }, { "entropy": 5.97412519454956, "epoch": 1.8032712403452975, "grad_norm": 0.98046875, "learning_rate": 0.000489334501360506, "loss": 5.7124, "mean_token_accuracy": 0.15543478727340698, "num_tokens": 4107381.0, "step": 1985 }, { "entropy": 5.963876867294312, "epoch": 1.8078146297137665, "grad_norm": 0.99609375, "learning_rate": 0.0004892267123111551, "loss": 5.8254, "mean_token_accuracy": 0.15286498814821242, "num_tokens": 4118762.0, "step": 1990 }, { "entropy": 5.960270643234253, "epoch": 1.8123580190822355, "grad_norm": 1.0703125, "learning_rate": 0.0004891183946786873, "loss": 5.7181, "mean_token_accuracy": 0.1565595179796219, "num_tokens": 4129011.0, "step": 1995 }, { "entropy": 6.032435035705566, "epoch": 1.8169014084507042, "grad_norm": 1.109375, "learning_rate": 0.0004890095487303655, "loss": 5.7959, "mean_token_accuracy": 0.15029720216989517, "num_tokens": 4138975.0, "step": 2000 }, { "epoch": 1.8169014084507042, "eval_entropy": 5.733916078611862, "eval_loss": 5.95263147354126, "eval_mean_token_accuracy": 0.15108996617586112, "eval_num_tokens": 4138975.0, "eval_runtime": 2.0045, "eval_samples_per_second": 1713.663, "eval_steps_per_second": 214.52, "step": 2000 }, { "entropy": 5.957431030273438, "epoch": 1.821444797819173, "grad_norm": 0.9921875, "learning_rate": 0.0004889001747347562, "loss": 5.82, "mean_token_accuracy": 0.14694613665342332, "num_tokens": 4150164.0, "step": 2005 }, { "entropy": 5.8941168785095215, "epoch": 1.825988187187642, "grad_norm": 1.2734375, "learning_rate": 0.000488790272961729, "loss": 5.7174, "mean_token_accuracy": 0.1589890643954277, "num_tokens": 4159872.0, "step": 2010 }, { "entropy": 6.01587028503418, "epoch": 1.830531576556111, "grad_norm": 1.15625, "learning_rate": 0.0004886798436824556, "loss": 5.7925, "mean_token_accuracy": 0.1506548911333084, "num_tokens": 4170665.0, "step": 2015 }, { "entropy": 5.919941091537476, "epoch": 1.8350749659245797, "grad_norm": 1.03125, "learning_rate": 0.0004885688871694091, "loss": 5.6741, "mean_token_accuracy": 0.16530426144599913, "num_tokens": 4180476.0, "step": 2020 }, { "entropy": 5.971033048629761, "epoch": 1.8396183552930485, "grad_norm": 1.0703125, "learning_rate": 0.0004884574036963639, "loss": 5.82, "mean_token_accuracy": 0.1528342068195343, "num_tokens": 4190740.0, "step": 2025 }, { "entropy": 5.93886661529541, "epoch": 1.8441617446615175, "grad_norm": 1.03125, "learning_rate": 0.0004883453935383941, "loss": 5.6945, "mean_token_accuracy": 0.160904423892498, "num_tokens": 4201504.0, "step": 2030 }, { "entropy": 5.844774293899536, "epoch": 1.8487051340299865, "grad_norm": 1.15625, "learning_rate": 0.0004882328569718738, "loss": 5.6354, "mean_token_accuracy": 0.16651723235845567, "num_tokens": 4211614.0, "step": 2035 }, { "entropy": 5.921957778930664, "epoch": 1.8532485233984552, "grad_norm": 1.125, "learning_rate": 0.0004881197942744758, "loss": 5.7582, "mean_token_accuracy": 0.15619631707668305, "num_tokens": 4221141.0, "step": 2040 }, { "entropy": 5.946128082275391, "epoch": 1.857791912766924, "grad_norm": 1.203125, "learning_rate": 0.0004880062057251711, "loss": 5.7979, "mean_token_accuracy": 0.15570344030857086, "num_tokens": 4231877.0, "step": 2045 }, { "entropy": 5.904908275604248, "epoch": 1.862335302135393, "grad_norm": 1.046875, "learning_rate": 0.000487892091604228, "loss": 5.6137, "mean_token_accuracy": 0.16376969814300538, "num_tokens": 4242331.0, "step": 2050 }, { "entropy": 5.868312120437622, "epoch": 1.866878691503862, "grad_norm": 0.99609375, "learning_rate": 0.00048777745219321186, "loss": 5.6306, "mean_token_accuracy": 0.15482296124100686, "num_tokens": 4252406.0, "step": 2055 }, { "entropy": 5.923862314224243, "epoch": 1.8714220808723308, "grad_norm": 1.015625, "learning_rate": 0.00048766228777498405, "loss": 5.7188, "mean_token_accuracy": 0.15500643700361252, "num_tokens": 4263036.0, "step": 2060 }, { "entropy": 5.9105486392974855, "epoch": 1.8759654702407995, "grad_norm": 1.1328125, "learning_rate": 0.00048754659863370125, "loss": 5.6869, "mean_token_accuracy": 0.16318628638982774, "num_tokens": 4273032.0, "step": 2065 }, { "entropy": 5.891187477111816, "epoch": 1.8805088596092685, "grad_norm": 1.015625, "learning_rate": 0.00048743038505481503, "loss": 5.7554, "mean_token_accuracy": 0.15550417006015776, "num_tokens": 4283360.0, "step": 2070 }, { "entropy": 5.914634132385254, "epoch": 1.8850522489777375, "grad_norm": 1.03125, "learning_rate": 0.0004873136473250708, "loss": 5.7043, "mean_token_accuracy": 0.16062143445014954, "num_tokens": 4292623.0, "step": 2075 }, { "entropy": 5.949255800247192, "epoch": 1.8895956383462063, "grad_norm": 1.0546875, "learning_rate": 0.00048719638573250715, "loss": 5.7261, "mean_token_accuracy": 0.16449115723371505, "num_tokens": 4302817.0, "step": 2080 }, { "entropy": 5.9335943222045895, "epoch": 1.894139027714675, "grad_norm": 1.03125, "learning_rate": 0.0004870786005664555, "loss": 5.7298, "mean_token_accuracy": 0.1570841759443283, "num_tokens": 4313049.0, "step": 2085 }, { "entropy": 5.869911003112793, "epoch": 1.898682417083144, "grad_norm": 1.1796875, "learning_rate": 0.0004869602921175392, "loss": 5.6044, "mean_token_accuracy": 0.16380330324172973, "num_tokens": 4322873.0, "step": 2090 }, { "entropy": 5.847801208496094, "epoch": 1.903225806451613, "grad_norm": 1.0546875, "learning_rate": 0.0004868414606776724, "loss": 5.7607, "mean_token_accuracy": 0.14720506817102433, "num_tokens": 4333339.0, "step": 2095 }, { "entropy": 5.944580936431885, "epoch": 1.9077691958200818, "grad_norm": 1.0078125, "learning_rate": 0.00048672210654005996, "loss": 5.7406, "mean_token_accuracy": 0.1549614280462265, "num_tokens": 4344917.0, "step": 2100 }, { "entropy": 5.832040643692016, "epoch": 1.9123125851885505, "grad_norm": 1.09375, "learning_rate": 0.00048660222999919616, "loss": 5.577, "mean_token_accuracy": 0.16366173475980758, "num_tokens": 4354140.0, "step": 2105 }, { "entropy": 5.891859245300293, "epoch": 1.9168559745570195, "grad_norm": 1.0390625, "learning_rate": 0.0004864818313508647, "loss": 5.8181, "mean_token_accuracy": 0.157329061627388, "num_tokens": 4364976.0, "step": 2110 }, { "entropy": 5.9322466373443605, "epoch": 1.9213993639254885, "grad_norm": 1.109375, "learning_rate": 0.0004863609108921372, "loss": 5.6111, "mean_token_accuracy": 0.1643754079937935, "num_tokens": 4376423.0, "step": 2115 }, { "entropy": 5.966183853149414, "epoch": 1.9259427532939573, "grad_norm": 1.1484375, "learning_rate": 0.0004862394689213728, "loss": 5.7472, "mean_token_accuracy": 0.15724728852510453, "num_tokens": 4387865.0, "step": 2120 }, { "entropy": 5.823707723617554, "epoch": 1.930486142662426, "grad_norm": 1.03125, "learning_rate": 0.0004861175057382175, "loss": 5.732, "mean_token_accuracy": 0.15898389965295792, "num_tokens": 4398275.0, "step": 2125 }, { "entropy": 5.970320463180542, "epoch": 1.935029532030895, "grad_norm": 1.109375, "learning_rate": 0.0004859950216436034, "loss": 5.6557, "mean_token_accuracy": 0.1616579294204712, "num_tokens": 4407396.0, "step": 2130 }, { "entropy": 6.037105226516724, "epoch": 1.939572921399364, "grad_norm": 0.9609375, "learning_rate": 0.0004858720169397478, "loss": 5.9137, "mean_token_accuracy": 0.14634885564446448, "num_tokens": 4419682.0, "step": 2135 }, { "entropy": 5.931360530853271, "epoch": 1.9441163107678328, "grad_norm": 1.1796875, "learning_rate": 0.0004857484919301525, "loss": 5.7751, "mean_token_accuracy": 0.1550420716404915, "num_tokens": 4430590.0, "step": 2140 }, { "entropy": 5.982472848892212, "epoch": 1.9486597001363015, "grad_norm": 0.96875, "learning_rate": 0.0004856244469196034, "loss": 5.693, "mean_token_accuracy": 0.16307468116283416, "num_tokens": 4441979.0, "step": 2145 }, { "entropy": 5.868456172943115, "epoch": 1.9532030895047705, "grad_norm": 1.1015625, "learning_rate": 0.000485499882214169, "loss": 5.7046, "mean_token_accuracy": 0.15840312838554382, "num_tokens": 4451975.0, "step": 2150 }, { "entropy": 5.8398841381072994, "epoch": 1.9577464788732395, "grad_norm": 1.0078125, "learning_rate": 0.0004853747981212003, "loss": 5.6429, "mean_token_accuracy": 0.16072934120893478, "num_tokens": 4462778.0, "step": 2155 }, { "entropy": 5.95463080406189, "epoch": 1.9622898682417085, "grad_norm": 1.0859375, "learning_rate": 0.0004852491949493301, "loss": 5.7018, "mean_token_accuracy": 0.16682704985141755, "num_tokens": 4472461.0, "step": 2160 }, { "entropy": 5.858252239227295, "epoch": 1.9668332576101772, "grad_norm": 1.109375, "learning_rate": 0.0004851230730084716, "loss": 5.654, "mean_token_accuracy": 0.16354322135448457, "num_tokens": 4482507.0, "step": 2165 }, { "entropy": 5.905764532089234, "epoch": 1.971376646978646, "grad_norm": 1.0078125, "learning_rate": 0.00048499643260981816, "loss": 5.6723, "mean_token_accuracy": 0.16208890974521636, "num_tokens": 4492601.0, "step": 2170 }, { "entropy": 5.906562376022339, "epoch": 1.975920036347115, "grad_norm": 1.0234375, "learning_rate": 0.0004848692740658424, "loss": 5.7843, "mean_token_accuracy": 0.1586180418729782, "num_tokens": 4503696.0, "step": 2175 }, { "entropy": 5.909030771255493, "epoch": 1.980463425715584, "grad_norm": 1.1171875, "learning_rate": 0.0004847415976902954, "loss": 5.6686, "mean_token_accuracy": 0.15772291123867035, "num_tokens": 4513649.0, "step": 2180 }, { "entropy": 5.879385900497437, "epoch": 1.9850068150840527, "grad_norm": 1.1640625, "learning_rate": 0.00048461340379820587, "loss": 5.7026, "mean_token_accuracy": 0.1572379268705845, "num_tokens": 4524054.0, "step": 2185 }, { "entropy": 5.965790462493897, "epoch": 1.9895502044525215, "grad_norm": 1.0078125, "learning_rate": 0.00048448469270587945, "loss": 5.6851, "mean_token_accuracy": 0.15851562321186066, "num_tokens": 4535549.0, "step": 2190 }, { "entropy": 5.887549543380738, "epoch": 1.9940935938209905, "grad_norm": 1.1015625, "learning_rate": 0.00048435546473089814, "loss": 5.7269, "mean_token_accuracy": 0.1520995393395424, "num_tokens": 4545654.0, "step": 2195 }, { "entropy": 5.891722345352173, "epoch": 1.9986369831894595, "grad_norm": 1.1171875, "learning_rate": 0.00048422572019211896, "loss": 5.7214, "mean_token_accuracy": 0.16194723248481752, "num_tokens": 4556230.0, "step": 2200 }, { "entropy": 5.862508985731337, "epoch": 2.0027260336210815, "grad_norm": 0.96875, "learning_rate": 0.00048409545940967375, "loss": 5.4891, "mean_token_accuracy": 0.16909081571631962, "num_tokens": 4564486.0, "step": 2205 }, { "entropy": 5.866947984695434, "epoch": 2.00726942298955, "grad_norm": 1.0703125, "learning_rate": 0.000483964682704968, "loss": 5.3756, "mean_token_accuracy": 0.17403068095445634, "num_tokens": 4575026.0, "step": 2210 }, { "entropy": 5.7502704620361325, "epoch": 2.011812812358019, "grad_norm": 1.09375, "learning_rate": 0.00048383339040068024, "loss": 5.4227, "mean_token_accuracy": 0.16631340384483337, "num_tokens": 4585902.0, "step": 2215 }, { "entropy": 6.013295221328735, "epoch": 2.016356201726488, "grad_norm": 1.0078125, "learning_rate": 0.0004837015828207612, "loss": 5.5023, "mean_token_accuracy": 0.17075931578874587, "num_tokens": 4597609.0, "step": 2220 }, { "entropy": 5.831322860717774, "epoch": 2.020899591094957, "grad_norm": 1.0625, "learning_rate": 0.0004835692602904329, "loss": 5.3796, "mean_token_accuracy": 0.17327053993940353, "num_tokens": 4607531.0, "step": 2225 }, { "entropy": 5.847760105133057, "epoch": 2.0254429804634255, "grad_norm": 1.1328125, "learning_rate": 0.0004834364231361882, "loss": 5.4172, "mean_token_accuracy": 0.17092780470848085, "num_tokens": 4618826.0, "step": 2230 }, { "entropy": 5.864540863037109, "epoch": 2.0299863698318945, "grad_norm": 1.0859375, "learning_rate": 0.0004833030716857894, "loss": 5.4269, "mean_token_accuracy": 0.17099900394678116, "num_tokens": 4629526.0, "step": 2235 }, { "entropy": 5.883844804763794, "epoch": 2.0345297592003635, "grad_norm": 1.109375, "learning_rate": 0.00048316920626826807, "loss": 5.4609, "mean_token_accuracy": 0.17029182761907577, "num_tokens": 4639930.0, "step": 2240 }, { "entropy": 5.8077638149261475, "epoch": 2.0390731485688325, "grad_norm": 1.1953125, "learning_rate": 0.00048303482721392363, "loss": 5.3466, "mean_token_accuracy": 0.1779349371790886, "num_tokens": 4649661.0, "step": 2245 }, { "entropy": 5.753513050079346, "epoch": 2.043616537937301, "grad_norm": 1.0078125, "learning_rate": 0.00048289993485432325, "loss": 5.357, "mean_token_accuracy": 0.1814907506108284, "num_tokens": 4660178.0, "step": 2250 }, { "entropy": 5.828481006622314, "epoch": 2.04815992730577, "grad_norm": 1.0625, "learning_rate": 0.00048276452952230036, "loss": 5.4072, "mean_token_accuracy": 0.17419430166482924, "num_tokens": 4670417.0, "step": 2255 }, { "entropy": 5.771015071868897, "epoch": 2.052703316674239, "grad_norm": 1.1796875, "learning_rate": 0.00048262861155195407, "loss": 5.3595, "mean_token_accuracy": 0.18370799124240875, "num_tokens": 4680221.0, "step": 2260 }, { "entropy": 5.85000958442688, "epoch": 2.057246706042708, "grad_norm": 1.140625, "learning_rate": 0.0004824921812786486, "loss": 5.4163, "mean_token_accuracy": 0.17064266949892043, "num_tokens": 4691136.0, "step": 2265 }, { "entropy": 5.672495126724243, "epoch": 2.0617900954111765, "grad_norm": 1.0390625, "learning_rate": 0.000482355239039012, "loss": 5.2621, "mean_token_accuracy": 0.18813103139400483, "num_tokens": 4700879.0, "step": 2270 }, { "entropy": 5.774118232727051, "epoch": 2.0663334847796455, "grad_norm": 1.0234375, "learning_rate": 0.0004822177851709356, "loss": 5.4441, "mean_token_accuracy": 0.16868412047624587, "num_tokens": 4711477.0, "step": 2275 }, { "entropy": 5.8024450778961185, "epoch": 2.0708768741481145, "grad_norm": 1.125, "learning_rate": 0.00048207982001357327, "loss": 5.3989, "mean_token_accuracy": 0.1725125789642334, "num_tokens": 4721973.0, "step": 2280 }, { "entropy": 5.740260934829712, "epoch": 2.0754202635165835, "grad_norm": 1.1484375, "learning_rate": 0.0004819413439073402, "loss": 5.409, "mean_token_accuracy": 0.16820381283760072, "num_tokens": 4732425.0, "step": 2285 }, { "entropy": 5.8100550174713135, "epoch": 2.079963652885052, "grad_norm": 1.0625, "learning_rate": 0.0004818023571939125, "loss": 5.3775, "mean_token_accuracy": 0.17511506080627443, "num_tokens": 4743377.0, "step": 2290 }, { "entropy": 5.785009717941284, "epoch": 2.084507042253521, "grad_norm": 1.1640625, "learning_rate": 0.000481662860216226, "loss": 5.4379, "mean_token_accuracy": 0.17519502490758895, "num_tokens": 4753534.0, "step": 2295 }, { "entropy": 5.75093822479248, "epoch": 2.08905043162199, "grad_norm": 1.1328125, "learning_rate": 0.00048152285331847574, "loss": 5.3868, "mean_token_accuracy": 0.17328918129205703, "num_tokens": 4763159.0, "step": 2300 }, { "entropy": 5.745303726196289, "epoch": 2.093593820990459, "grad_norm": 1.1640625, "learning_rate": 0.0004813823368461148, "loss": 5.3603, "mean_token_accuracy": 0.17843883931636811, "num_tokens": 4773497.0, "step": 2305 }, { "entropy": 5.789405584335327, "epoch": 2.098137210358928, "grad_norm": 1.0703125, "learning_rate": 0.0004812413111458534, "loss": 5.4564, "mean_token_accuracy": 0.17826216220855712, "num_tokens": 4784291.0, "step": 2310 }, { "entropy": 5.762081146240234, "epoch": 2.1026805997273965, "grad_norm": 1.171875, "learning_rate": 0.0004810997765656587, "loss": 5.4045, "mean_token_accuracy": 0.17297512739896775, "num_tokens": 4794762.0, "step": 2315 }, { "entropy": 5.904514455795288, "epoch": 2.1072239890958655, "grad_norm": 1.1328125, "learning_rate": 0.00048095773345475294, "loss": 5.5211, "mean_token_accuracy": 0.17019670754671096, "num_tokens": 4804449.0, "step": 2320 }, { "entropy": 5.740280532836914, "epoch": 2.1117673784643345, "grad_norm": 1.2890625, "learning_rate": 0.00048081518216361367, "loss": 5.3845, "mean_token_accuracy": 0.1749880075454712, "num_tokens": 4814172.0, "step": 2325 }, { "entropy": 5.781768560409546, "epoch": 2.1163107678328035, "grad_norm": 1.0625, "learning_rate": 0.0004806721230439719, "loss": 5.4765, "mean_token_accuracy": 0.17494874447584152, "num_tokens": 4824909.0, "step": 2330 }, { "entropy": 5.897498083114624, "epoch": 2.120854157201272, "grad_norm": 1.1875, "learning_rate": 0.0004805285564488117, "loss": 5.5098, "mean_token_accuracy": 0.17679391503334047, "num_tokens": 4834546.0, "step": 2335 }, { "entropy": 5.77701964378357, "epoch": 2.125397546569741, "grad_norm": 1.15625, "learning_rate": 0.0004803844827323696, "loss": 5.4181, "mean_token_accuracy": 0.17149554044008256, "num_tokens": 4844809.0, "step": 2340 }, { "entropy": 5.741995573043823, "epoch": 2.12994093593821, "grad_norm": 1.1015625, "learning_rate": 0.0004802399022501329, "loss": 5.4035, "mean_token_accuracy": 0.17329975068569184, "num_tokens": 4855883.0, "step": 2345 }, { "entropy": 5.856533098220825, "epoch": 2.134484325306679, "grad_norm": 1.1640625, "learning_rate": 0.0004800948153588397, "loss": 5.4256, "mean_token_accuracy": 0.18001650273799896, "num_tokens": 4865936.0, "step": 2350 }, { "entropy": 5.661838531494141, "epoch": 2.1390277146751475, "grad_norm": 1.1015625, "learning_rate": 0.00047994922241647746, "loss": 5.3683, "mean_token_accuracy": 0.1719723716378212, "num_tokens": 4876621.0, "step": 2355 }, { "entropy": 5.629975748062134, "epoch": 2.1435711040436165, "grad_norm": 1.1875, "learning_rate": 0.00047980312378228244, "loss": 5.3472, "mean_token_accuracy": 0.16937130242586135, "num_tokens": 4886315.0, "step": 2360 }, { "entropy": 5.793085336685181, "epoch": 2.1481144934120855, "grad_norm": 1.171875, "learning_rate": 0.00047965651981673823, "loss": 5.4159, "mean_token_accuracy": 0.17354542315006255, "num_tokens": 4897214.0, "step": 2365 }, { "entropy": 5.7971173286437985, "epoch": 2.1526578827805545, "grad_norm": 1.078125, "learning_rate": 0.00047950941088157576, "loss": 5.4142, "mean_token_accuracy": 0.17415029108524321, "num_tokens": 4907360.0, "step": 2370 }, { "entropy": 5.738719272613525, "epoch": 2.157201272149023, "grad_norm": 1.15625, "learning_rate": 0.0004793617973397715, "loss": 5.3742, "mean_token_accuracy": 0.17936114966869354, "num_tokens": 4917591.0, "step": 2375 }, { "entropy": 5.751534557342529, "epoch": 2.161744661517492, "grad_norm": 1.0859375, "learning_rate": 0.00047921367955554745, "loss": 5.4667, "mean_token_accuracy": 0.1628737047314644, "num_tokens": 4928075.0, "step": 2380 }, { "entropy": 5.775207567214966, "epoch": 2.166288050885961, "grad_norm": 1.1015625, "learning_rate": 0.0004790650578943693, "loss": 5.364, "mean_token_accuracy": 0.17666680067777635, "num_tokens": 4937898.0, "step": 2385 }, { "entropy": 5.718432950973511, "epoch": 2.17083144025443, "grad_norm": 1.0234375, "learning_rate": 0.00047891593272294636, "loss": 5.4201, "mean_token_accuracy": 0.16961177289485932, "num_tokens": 4948152.0, "step": 2390 }, { "entropy": 5.774542379379272, "epoch": 2.1753748296228985, "grad_norm": 1.28125, "learning_rate": 0.00047876630440923, "loss": 5.4039, "mean_token_accuracy": 0.1735743001103401, "num_tokens": 4957973.0, "step": 2395 }, { "entropy": 5.6395844459533695, "epoch": 2.1799182189913675, "grad_norm": 1.140625, "learning_rate": 0.0004786161733224134, "loss": 5.37, "mean_token_accuracy": 0.1769695222377777, "num_tokens": 4967375.0, "step": 2400 }, { "entropy": 5.748891401290893, "epoch": 2.1844616083598365, "grad_norm": 1.09375, "learning_rate": 0.00047846553983293006, "loss": 5.375, "mean_token_accuracy": 0.17679121643304824, "num_tokens": 4977286.0, "step": 2405 }, { "entropy": 5.70573058128357, "epoch": 2.1890049977283055, "grad_norm": 1.15625, "learning_rate": 0.00047831440431245307, "loss": 5.446, "mean_token_accuracy": 0.16882054805755614, "num_tokens": 4987930.0, "step": 2410 }, { "entropy": 5.874832057952881, "epoch": 2.193548387096774, "grad_norm": 1.1171875, "learning_rate": 0.00047816276713389424, "loss": 5.4904, "mean_token_accuracy": 0.17146590054035188, "num_tokens": 4998707.0, "step": 2415 }, { "entropy": 5.6762388229370115, "epoch": 2.198091776465243, "grad_norm": 1.046875, "learning_rate": 0.0004780106286714034, "loss": 5.3429, "mean_token_accuracy": 0.18256889432668685, "num_tokens": 5008540.0, "step": 2420 }, { "entropy": 5.65377779006958, "epoch": 2.202635165833712, "grad_norm": 1.1875, "learning_rate": 0.000477857989300367, "loss": 5.4037, "mean_token_accuracy": 0.1740575209259987, "num_tokens": 5018199.0, "step": 2425 }, { "entropy": 5.783184003829956, "epoch": 2.207178555202181, "grad_norm": 1.15625, "learning_rate": 0.00047770484939740757, "loss": 5.4313, "mean_token_accuracy": 0.17550634741783142, "num_tokens": 5028251.0, "step": 2430 }, { "entropy": 5.690026521682739, "epoch": 2.2117219445706495, "grad_norm": 1.171875, "learning_rate": 0.0004775512093403824, "loss": 5.4305, "mean_token_accuracy": 0.1661398559808731, "num_tokens": 5038290.0, "step": 2435 }, { "entropy": 5.754314851760864, "epoch": 2.2162653339391185, "grad_norm": 1.296875, "learning_rate": 0.00047739706950838327, "loss": 5.3656, "mean_token_accuracy": 0.17466755211353302, "num_tokens": 5048337.0, "step": 2440 }, { "entropy": 5.794387769699097, "epoch": 2.2208087233075875, "grad_norm": 1.0859375, "learning_rate": 0.00047724243028173484, "loss": 5.4149, "mean_token_accuracy": 0.16921241730451583, "num_tokens": 5058533.0, "step": 2445 }, { "entropy": 5.736860704421997, "epoch": 2.2253521126760565, "grad_norm": 1.234375, "learning_rate": 0.00047708729204199406, "loss": 5.425, "mean_token_accuracy": 0.17878113687038422, "num_tokens": 5068556.0, "step": 2450 }, { "entropy": 5.705081224441528, "epoch": 2.229895502044525, "grad_norm": 1.1171875, "learning_rate": 0.000476931655171949, "loss": 5.4989, "mean_token_accuracy": 0.17241994738578797, "num_tokens": 5079317.0, "step": 2455 }, { "entropy": 5.857335472106934, "epoch": 2.234438891412994, "grad_norm": 1.0546875, "learning_rate": 0.0004767755200556183, "loss": 5.4768, "mean_token_accuracy": 0.17653426229953767, "num_tokens": 5089544.0, "step": 2460 }, { "entropy": 5.69089994430542, "epoch": 2.238982280781463, "grad_norm": 1.1796875, "learning_rate": 0.0004766188870782497, "loss": 5.4629, "mean_token_accuracy": 0.16911610066890717, "num_tokens": 5099491.0, "step": 2465 }, { "entropy": 5.829253530502319, "epoch": 2.243525670149932, "grad_norm": 1.0859375, "learning_rate": 0.00047646175662631967, "loss": 5.4575, "mean_token_accuracy": 0.17039169669151305, "num_tokens": 5109523.0, "step": 2470 }, { "entropy": 5.759532070159912, "epoch": 2.2480690595184005, "grad_norm": 1.0859375, "learning_rate": 0.00047630412908753183, "loss": 5.3963, "mean_token_accuracy": 0.17784518748521805, "num_tokens": 5119940.0, "step": 2475 }, { "entropy": 5.748552751541138, "epoch": 2.2526124488868695, "grad_norm": 1.1953125, "learning_rate": 0.00047614600485081657, "loss": 5.3904, "mean_token_accuracy": 0.1798911511898041, "num_tokens": 5129789.0, "step": 2480 }, { "entropy": 5.706392288208008, "epoch": 2.2571558382553385, "grad_norm": 1.0390625, "learning_rate": 0.00047598738430632963, "loss": 5.4041, "mean_token_accuracy": 0.17321959882974625, "num_tokens": 5139570.0, "step": 2485 }, { "entropy": 5.681578493118286, "epoch": 2.2616992276238075, "grad_norm": 0.9921875, "learning_rate": 0.00047582826784545146, "loss": 5.3826, "mean_token_accuracy": 0.16976896524429322, "num_tokens": 5150526.0, "step": 2490 }, { "entropy": 5.695160961151123, "epoch": 2.266242616992276, "grad_norm": 1.0234375, "learning_rate": 0.00047566865586078615, "loss": 5.3188, "mean_token_accuracy": 0.17343409210443497, "num_tokens": 5160895.0, "step": 2495 }, { "entropy": 5.688534450531006, "epoch": 2.270786006360745, "grad_norm": 1.0703125, "learning_rate": 0.00047550854874616047, "loss": 5.322, "mean_token_accuracy": 0.17689472585916519, "num_tokens": 5171054.0, "step": 2500 }, { "epoch": 2.270786006360745, "eval_entropy": 5.541668576972429, "eval_loss": 5.8642683029174805, "eval_mean_token_accuracy": 0.15643741834129013, "eval_num_tokens": 5171054.0, "eval_runtime": 1.9972, "eval_samples_per_second": 1719.94, "eval_steps_per_second": 215.305, "step": 2500 }, { "entropy": 5.750526094436646, "epoch": 2.275329395729214, "grad_norm": 1.0859375, "learning_rate": 0.00047534794689662257, "loss": 5.4866, "mean_token_accuracy": 0.161210834980011, "num_tokens": 5180870.0, "step": 2505 }, { "entropy": 5.781940460205078, "epoch": 2.279872785097683, "grad_norm": 1.1640625, "learning_rate": 0.0004751868507084418, "loss": 5.4249, "mean_token_accuracy": 0.17138221561908723, "num_tokens": 5190388.0, "step": 2510 }, { "entropy": 5.754351997375489, "epoch": 2.284416174466152, "grad_norm": 1.0625, "learning_rate": 0.0004750252605791068, "loss": 5.4041, "mean_token_accuracy": 0.16879990994930266, "num_tokens": 5200582.0, "step": 2515 }, { "entropy": 5.702089405059814, "epoch": 2.2889595638346205, "grad_norm": 1.0859375, "learning_rate": 0.0004748631769073254, "loss": 5.3734, "mean_token_accuracy": 0.17459774017333984, "num_tokens": 5211079.0, "step": 2520 }, { "entropy": 5.780581617355347, "epoch": 2.2935029532030895, "grad_norm": 1.1640625, "learning_rate": 0.0004747006000930227, "loss": 5.5082, "mean_token_accuracy": 0.1652182012796402, "num_tokens": 5221481.0, "step": 2525 }, { "entropy": 5.765790128707886, "epoch": 2.2980463425715585, "grad_norm": 1.1484375, "learning_rate": 0.0004745375305373409, "loss": 5.3764, "mean_token_accuracy": 0.18041289746761321, "num_tokens": 5231387.0, "step": 2530 }, { "entropy": 5.630071687698364, "epoch": 2.302589731940027, "grad_norm": 1.109375, "learning_rate": 0.00047437396864263804, "loss": 5.3328, "mean_token_accuracy": 0.17884562611579896, "num_tokens": 5240758.0, "step": 2535 }, { "entropy": 5.711175584793091, "epoch": 2.307133121308496, "grad_norm": 1.078125, "learning_rate": 0.0004742099148124866, "loss": 5.3573, "mean_token_accuracy": 0.17342581897974013, "num_tokens": 5250839.0, "step": 2540 }, { "entropy": 5.805914258956909, "epoch": 2.311676510676965, "grad_norm": 1.0859375, "learning_rate": 0.0004740453694516734, "loss": 5.453, "mean_token_accuracy": 0.17285922318696975, "num_tokens": 5261554.0, "step": 2545 }, { "entropy": 5.713011932373047, "epoch": 2.316219900045434, "grad_norm": 1.046875, "learning_rate": 0.00047388033296619746, "loss": 5.4246, "mean_token_accuracy": 0.17515779584646224, "num_tokens": 5272422.0, "step": 2550 }, { "entropy": 5.695078659057617, "epoch": 2.320763289413903, "grad_norm": 1.0625, "learning_rate": 0.0004737148057632701, "loss": 5.358, "mean_token_accuracy": 0.16814109086990356, "num_tokens": 5282522.0, "step": 2555 }, { "entropy": 5.746765947341919, "epoch": 2.3253066787823715, "grad_norm": 1.0859375, "learning_rate": 0.0004735487882513131, "loss": 5.4138, "mean_token_accuracy": 0.17494575083255767, "num_tokens": 5293100.0, "step": 2560 }, { "entropy": 5.798492383956909, "epoch": 2.3298500681508405, "grad_norm": 1.1796875, "learning_rate": 0.0004733822808399583, "loss": 5.4457, "mean_token_accuracy": 0.16868271827697753, "num_tokens": 5303103.0, "step": 2565 }, { "entropy": 5.739025545120239, "epoch": 2.3343934575193095, "grad_norm": 1.015625, "learning_rate": 0.00047321528394004615, "loss": 5.424, "mean_token_accuracy": 0.1802881196141243, "num_tokens": 5313765.0, "step": 2570 }, { "entropy": 5.7982371807098385, "epoch": 2.3389368468877785, "grad_norm": 1.21875, "learning_rate": 0.00047304779796362485, "loss": 5.5092, "mean_token_accuracy": 0.1671261727809906, "num_tokens": 5324816.0, "step": 2575 }, { "entropy": 5.689096212387085, "epoch": 2.343480236256247, "grad_norm": 1.0390625, "learning_rate": 0.00047287982332394943, "loss": 5.3867, "mean_token_accuracy": 0.17445023208856583, "num_tokens": 5334882.0, "step": 2580 }, { "entropy": 5.703138446807861, "epoch": 2.348023625624716, "grad_norm": 1.171875, "learning_rate": 0.00047271136043548057, "loss": 5.3817, "mean_token_accuracy": 0.17914554625749587, "num_tokens": 5344623.0, "step": 2585 }, { "entropy": 5.751450252532959, "epoch": 2.352567014993185, "grad_norm": 0.9765625, "learning_rate": 0.0004725424097138838, "loss": 5.403, "mean_token_accuracy": 0.17148876786231995, "num_tokens": 5355786.0, "step": 2590 }, { "entropy": 5.627918767929077, "epoch": 2.357110404361654, "grad_norm": 1.1953125, "learning_rate": 0.00047237297157602816, "loss": 5.4021, "mean_token_accuracy": 0.17087053656578063, "num_tokens": 5366139.0, "step": 2595 }, { "entropy": 5.862655878067017, "epoch": 2.3616537937301225, "grad_norm": 1.0078125, "learning_rate": 0.0004722030464399854, "loss": 5.5003, "mean_token_accuracy": 0.1666705295443535, "num_tokens": 5376890.0, "step": 2600 }, { "entropy": 5.688345241546631, "epoch": 2.3661971830985915, "grad_norm": 1.15625, "learning_rate": 0.000472032634725029, "loss": 5.4076, "mean_token_accuracy": 0.17868503630161287, "num_tokens": 5386602.0, "step": 2605 }, { "entropy": 5.764010620117188, "epoch": 2.3707405724670605, "grad_norm": 1.21875, "learning_rate": 0.00047186173685163273, "loss": 5.4772, "mean_token_accuracy": 0.17160866558551788, "num_tokens": 5397749.0, "step": 2610 }, { "entropy": 5.749241018295288, "epoch": 2.3752839618355295, "grad_norm": 1.1328125, "learning_rate": 0.00047169035324147023, "loss": 5.4346, "mean_token_accuracy": 0.1673075184226036, "num_tokens": 5407666.0, "step": 2615 }, { "entropy": 5.735607671737671, "epoch": 2.379827351203998, "grad_norm": 1.078125, "learning_rate": 0.00047151848431741363, "loss": 5.5142, "mean_token_accuracy": 0.16675720661878585, "num_tokens": 5418668.0, "step": 2620 }, { "entropy": 5.680788135528564, "epoch": 2.384370740572467, "grad_norm": 1.1640625, "learning_rate": 0.0004713461305035322, "loss": 5.3883, "mean_token_accuracy": 0.17995792180299758, "num_tokens": 5429098.0, "step": 2625 }, { "entropy": 5.669166088104248, "epoch": 2.388914129940936, "grad_norm": 1.140625, "learning_rate": 0.000471173292225092, "loss": 5.3324, "mean_token_accuracy": 0.17956721186637878, "num_tokens": 5438997.0, "step": 2630 }, { "entropy": 5.698221731185913, "epoch": 2.393457519309405, "grad_norm": 1.234375, "learning_rate": 0.00047099996990855424, "loss": 5.3997, "mean_token_accuracy": 0.17252164483070373, "num_tokens": 5449315.0, "step": 2635 }, { "entropy": 5.705436658859253, "epoch": 2.3980009086778735, "grad_norm": 1.109375, "learning_rate": 0.00047082616398157456, "loss": 5.4358, "mean_token_accuracy": 0.1685012996196747, "num_tokens": 5460523.0, "step": 2640 }, { "entropy": 5.762444067001343, "epoch": 2.4025442980463425, "grad_norm": 1.1171875, "learning_rate": 0.0004706518748730017, "loss": 5.4614, "mean_token_accuracy": 0.1750774085521698, "num_tokens": 5470012.0, "step": 2645 }, { "entropy": 5.695530652999878, "epoch": 2.4070876874148115, "grad_norm": 1.234375, "learning_rate": 0.0004704771030128768, "loss": 5.4067, "mean_token_accuracy": 0.17659069299697877, "num_tokens": 5480364.0, "step": 2650 }, { "entropy": 5.823437452316284, "epoch": 2.4116310767832805, "grad_norm": 1.1484375, "learning_rate": 0.00047030184883243203, "loss": 5.5352, "mean_token_accuracy": 0.1670384019613266, "num_tokens": 5492138.0, "step": 2655 }, { "entropy": 5.681525564193725, "epoch": 2.416174466151749, "grad_norm": 1.171875, "learning_rate": 0.00047012611276408964, "loss": 5.3091, "mean_token_accuracy": 0.18115043491125107, "num_tokens": 5501935.0, "step": 2660 }, { "entropy": 5.701013469696045, "epoch": 2.420717855520218, "grad_norm": 1.09375, "learning_rate": 0.0004699498952414609, "loss": 5.5091, "mean_token_accuracy": 0.16933519542217254, "num_tokens": 5513993.0, "step": 2665 }, { "entropy": 5.753058958053589, "epoch": 2.425261244888687, "grad_norm": 1.0625, "learning_rate": 0.00046977319669934506, "loss": 5.4287, "mean_token_accuracy": 0.1767013266682625, "num_tokens": 5524822.0, "step": 2670 }, { "entropy": 5.75729718208313, "epoch": 2.429804634257156, "grad_norm": 1.078125, "learning_rate": 0.00046959601757372814, "loss": 5.4127, "mean_token_accuracy": 0.16921148002147673, "num_tokens": 5535583.0, "step": 2675 }, { "entropy": 5.675585603713989, "epoch": 2.4343480236256245, "grad_norm": 1.1328125, "learning_rate": 0.00046941835830178216, "loss": 5.3964, "mean_token_accuracy": 0.1775403916835785, "num_tokens": 5546199.0, "step": 2680 }, { "entropy": 5.69486632347107, "epoch": 2.4388914129940935, "grad_norm": 1.1640625, "learning_rate": 0.00046924021932186357, "loss": 5.3642, "mean_token_accuracy": 0.17965541183948516, "num_tokens": 5556409.0, "step": 2685 }, { "entropy": 5.725578355789184, "epoch": 2.4434348023625625, "grad_norm": 1.109375, "learning_rate": 0.00046906160107351263, "loss": 5.4264, "mean_token_accuracy": 0.17723667919635772, "num_tokens": 5565854.0, "step": 2690 }, { "entropy": 5.748017168045044, "epoch": 2.4479781917310315, "grad_norm": 1.015625, "learning_rate": 0.00046888250399745217, "loss": 5.4639, "mean_token_accuracy": 0.16633473336696625, "num_tokens": 5576194.0, "step": 2695 }, { "entropy": 5.706389665603638, "epoch": 2.4525215810995, "grad_norm": 1.1015625, "learning_rate": 0.00046870292853558646, "loss": 5.3706, "mean_token_accuracy": 0.17574018239974976, "num_tokens": 5586679.0, "step": 2700 }, { "entropy": 5.6699425220489506, "epoch": 2.457064970467969, "grad_norm": 1.0703125, "learning_rate": 0.00046852287513099997, "loss": 5.4121, "mean_token_accuracy": 0.16650531440973282, "num_tokens": 5597268.0, "step": 2705 }, { "entropy": 5.722821760177612, "epoch": 2.461608359836438, "grad_norm": 1.125, "learning_rate": 0.0004683423442279566, "loss": 5.3871, "mean_token_accuracy": 0.17458881437778473, "num_tokens": 5608046.0, "step": 2710 }, { "entropy": 5.689449501037598, "epoch": 2.466151749204907, "grad_norm": 1.0546875, "learning_rate": 0.0004681613362718985, "loss": 5.31, "mean_token_accuracy": 0.17710677087306975, "num_tokens": 5617541.0, "step": 2715 }, { "entropy": 5.7190234661102295, "epoch": 2.470695138573376, "grad_norm": 1.1796875, "learning_rate": 0.0004679798517094447, "loss": 5.3635, "mean_token_accuracy": 0.16786014437675476, "num_tokens": 5628428.0, "step": 2720 }, { "entropy": 5.757678413391114, "epoch": 2.4752385279418445, "grad_norm": 1.078125, "learning_rate": 0.00046779789098839043, "loss": 5.5451, "mean_token_accuracy": 0.15948943719267844, "num_tokens": 5639557.0, "step": 2725 }, { "entropy": 5.786512804031372, "epoch": 2.4797819173103135, "grad_norm": 1.1484375, "learning_rate": 0.00046761545455770555, "loss": 5.5296, "mean_token_accuracy": 0.17010488212108613, "num_tokens": 5650586.0, "step": 2730 }, { "entropy": 5.750928783416748, "epoch": 2.4843253066787825, "grad_norm": 1.21875, "learning_rate": 0.0004674325428675339, "loss": 5.428, "mean_token_accuracy": 0.17482876777648926, "num_tokens": 5661525.0, "step": 2735 }, { "entropy": 5.733806705474853, "epoch": 2.488868696047251, "grad_norm": 1.109375, "learning_rate": 0.0004672491563691919, "loss": 5.4546, "mean_token_accuracy": 0.16926867961883546, "num_tokens": 5671272.0, "step": 2740 }, { "entropy": 5.708602237701416, "epoch": 2.49341208541572, "grad_norm": 1.25, "learning_rate": 0.00046706529551516753, "loss": 5.3802, "mean_token_accuracy": 0.17592664510011674, "num_tokens": 5680384.0, "step": 2745 }, { "entropy": 5.721498632431031, "epoch": 2.497955474784189, "grad_norm": 1.1015625, "learning_rate": 0.00046688096075911905, "loss": 5.401, "mean_token_accuracy": 0.1755047246813774, "num_tokens": 5690983.0, "step": 2750 }, { "entropy": 5.691464233398437, "epoch": 2.502498864152658, "grad_norm": 1.1640625, "learning_rate": 0.0004666961525558743, "loss": 5.4169, "mean_token_accuracy": 0.16735788732767104, "num_tokens": 5702144.0, "step": 2755 }, { "entropy": 5.688137054443359, "epoch": 2.507042253521127, "grad_norm": 1.234375, "learning_rate": 0.000466510871361429, "loss": 5.4744, "mean_token_accuracy": 0.16610317528247834, "num_tokens": 5713283.0, "step": 2760 }, { "entropy": 5.680425405502319, "epoch": 2.5115856428895955, "grad_norm": 1.03125, "learning_rate": 0.00046632511763294615, "loss": 5.4358, "mean_token_accuracy": 0.16601063907146454, "num_tokens": 5724533.0, "step": 2765 }, { "entropy": 5.711917686462402, "epoch": 2.5161290322580645, "grad_norm": 1.1171875, "learning_rate": 0.0004661388918287546, "loss": 5.3873, "mean_token_accuracy": 0.17389980256557463, "num_tokens": 5735186.0, "step": 2770 }, { "entropy": 5.721314525604248, "epoch": 2.5206724216265335, "grad_norm": 1.125, "learning_rate": 0.0004659521944083481, "loss": 5.4661, "mean_token_accuracy": 0.17304984778165816, "num_tokens": 5746537.0, "step": 2775 }, { "entropy": 5.734245824813843, "epoch": 2.525215810995002, "grad_norm": 1.1640625, "learning_rate": 0.0004657650258323838, "loss": 5.4203, "mean_token_accuracy": 0.17387858033180237, "num_tokens": 5756666.0, "step": 2780 }, { "entropy": 5.7586259841918945, "epoch": 2.529759200363471, "grad_norm": 1.125, "learning_rate": 0.00046557738656268166, "loss": 5.4455, "mean_token_accuracy": 0.17220781594514847, "num_tokens": 5766870.0, "step": 2785 }, { "entropy": 5.695646190643311, "epoch": 2.53430258973194, "grad_norm": 1.125, "learning_rate": 0.000465389277062223, "loss": 5.4351, "mean_token_accuracy": 0.17539490461349488, "num_tokens": 5776775.0, "step": 2790 }, { "entropy": 5.776819038391113, "epoch": 2.538845979100409, "grad_norm": 1.109375, "learning_rate": 0.00046520069779514917, "loss": 5.4271, "mean_token_accuracy": 0.17059330493211747, "num_tokens": 5786993.0, "step": 2795 }, { "entropy": 5.665747785568238, "epoch": 2.543389368468878, "grad_norm": 1.203125, "learning_rate": 0.0004650116492267609, "loss": 5.4193, "mean_token_accuracy": 0.17776434123516083, "num_tokens": 5796230.0, "step": 2800 }, { "entropy": 5.786862230300903, "epoch": 2.5479327578373465, "grad_norm": 1.1484375, "learning_rate": 0.0004648221318235165, "loss": 5.4103, "mean_token_accuracy": 0.17467432469129562, "num_tokens": 5807086.0, "step": 2805 }, { "entropy": 5.641618251800537, "epoch": 2.5524761472058155, "grad_norm": 1.0546875, "learning_rate": 0.0004646321460530316, "loss": 5.4449, "mean_token_accuracy": 0.17003494650125503, "num_tokens": 5817897.0, "step": 2810 }, { "entropy": 5.739160108566284, "epoch": 2.5570195365742845, "grad_norm": 1.1171875, "learning_rate": 0.000464441692384077, "loss": 5.3422, "mean_token_accuracy": 0.18196709752082824, "num_tokens": 5827794.0, "step": 2815 }, { "entropy": 5.618197011947632, "epoch": 2.561562925942753, "grad_norm": 1.1875, "learning_rate": 0.0004642507712865784, "loss": 5.4253, "mean_token_accuracy": 0.1728539928793907, "num_tokens": 5837603.0, "step": 2820 }, { "entropy": 5.6844886302947994, "epoch": 2.566106315311222, "grad_norm": 1.140625, "learning_rate": 0.00046405938323161453, "loss": 5.3399, "mean_token_accuracy": 0.1776605576276779, "num_tokens": 5847013.0, "step": 2825 }, { "entropy": 5.677564477920532, "epoch": 2.570649704679691, "grad_norm": 1.296875, "learning_rate": 0.00046386752869141624, "loss": 5.3449, "mean_token_accuracy": 0.1727038323879242, "num_tokens": 5856783.0, "step": 2830 }, { "entropy": 5.68329758644104, "epoch": 2.57519309404816, "grad_norm": 1.203125, "learning_rate": 0.0004636752081393658, "loss": 5.3387, "mean_token_accuracy": 0.18341223597526551, "num_tokens": 5866241.0, "step": 2835 }, { "entropy": 5.6050855159759525, "epoch": 2.579736483416629, "grad_norm": 1.2578125, "learning_rate": 0.00046348242204999487, "loss": 5.3906, "mean_token_accuracy": 0.1770755559206009, "num_tokens": 5876135.0, "step": 2840 }, { "entropy": 5.68485279083252, "epoch": 2.5842798727850975, "grad_norm": 1.140625, "learning_rate": 0.00046328917089898396, "loss": 5.444, "mean_token_accuracy": 0.1759236678481102, "num_tokens": 5886841.0, "step": 2845 }, { "entropy": 5.7248931407928465, "epoch": 2.5888232621535665, "grad_norm": 1.1015625, "learning_rate": 0.0004630954551631612, "loss": 5.3912, "mean_token_accuracy": 0.17576023787260056, "num_tokens": 5896884.0, "step": 2850 }, { "entropy": 5.649676322937012, "epoch": 2.5933666515220355, "grad_norm": 1.3359375, "learning_rate": 0.00046290127532050087, "loss": 5.4261, "mean_token_accuracy": 0.17579701840877532, "num_tokens": 5906194.0, "step": 2855 }, { "entropy": 5.673415470123291, "epoch": 2.5979100408905045, "grad_norm": 1.0390625, "learning_rate": 0.0004627066318501223, "loss": 5.3524, "mean_token_accuracy": 0.1809778705239296, "num_tokens": 5917217.0, "step": 2860 }, { "entropy": 5.642754220962525, "epoch": 2.602453430258973, "grad_norm": 1.25, "learning_rate": 0.00046251152523228906, "loss": 5.2819, "mean_token_accuracy": 0.17782741785049438, "num_tokens": 5926307.0, "step": 2865 }, { "entropy": 5.656463956832885, "epoch": 2.606996819627442, "grad_norm": 1.1171875, "learning_rate": 0.0004623159559484074, "loss": 5.3875, "mean_token_accuracy": 0.1743921473622322, "num_tokens": 5936718.0, "step": 2870 }, { "entropy": 5.604428958892822, "epoch": 2.611540208995911, "grad_norm": 1.125, "learning_rate": 0.0004621199244810248, "loss": 5.35, "mean_token_accuracy": 0.17654486894607543, "num_tokens": 5947870.0, "step": 2875 }, { "entropy": 5.674286794662476, "epoch": 2.61608359836438, "grad_norm": 1.0078125, "learning_rate": 0.00046192343131382964, "loss": 5.5238, "mean_token_accuracy": 0.17045848071575165, "num_tokens": 5959090.0, "step": 2880 }, { "entropy": 5.770153999328613, "epoch": 2.620626987732849, "grad_norm": 1.109375, "learning_rate": 0.00046172647693164926, "loss": 5.4976, "mean_token_accuracy": 0.16692567467689515, "num_tokens": 5970435.0, "step": 2885 }, { "entropy": 5.686746835708618, "epoch": 2.6251703771013175, "grad_norm": 1.2109375, "learning_rate": 0.0004615290618204489, "loss": 5.3168, "mean_token_accuracy": 0.18975419849157332, "num_tokens": 5979732.0, "step": 2890 }, { "entropy": 5.674428415298462, "epoch": 2.6297137664697865, "grad_norm": 1.0390625, "learning_rate": 0.0004613311864673309, "loss": 5.4661, "mean_token_accuracy": 0.17490168213844298, "num_tokens": 5989965.0, "step": 2895 }, { "entropy": 5.7551796436309814, "epoch": 2.6342571558382555, "grad_norm": 1.25, "learning_rate": 0.00046113285136053286, "loss": 5.4457, "mean_token_accuracy": 0.17994607239961624, "num_tokens": 6000752.0, "step": 2900 }, { "entropy": 5.6631536960601805, "epoch": 2.638800545206724, "grad_norm": 1.0390625, "learning_rate": 0.000460934056989427, "loss": 5.4078, "mean_token_accuracy": 0.17297106683254243, "num_tokens": 6011318.0, "step": 2905 }, { "entropy": 5.683416843414307, "epoch": 2.643343934575193, "grad_norm": 1.0546875, "learning_rate": 0.0004607348038445187, "loss": 5.4123, "mean_token_accuracy": 0.17364877313375474, "num_tokens": 6022024.0, "step": 2910 }, { "entropy": 5.628732824325562, "epoch": 2.647887323943662, "grad_norm": 1.0703125, "learning_rate": 0.00046053509241744526, "loss": 5.373, "mean_token_accuracy": 0.17655983418226243, "num_tokens": 6032118.0, "step": 2915 }, { "entropy": 5.689882612228393, "epoch": 2.652430713312131, "grad_norm": 1.234375, "learning_rate": 0.00046033492320097483, "loss": 5.3866, "mean_token_accuracy": 0.18142862915992736, "num_tokens": 6042607.0, "step": 2920 }, { "entropy": 5.61193356513977, "epoch": 2.6569741026806, "grad_norm": 1.109375, "learning_rate": 0.0004601342966890049, "loss": 5.3967, "mean_token_accuracy": 0.1752897545695305, "num_tokens": 6053625.0, "step": 2925 }, { "entropy": 5.695006561279297, "epoch": 2.6615174920490685, "grad_norm": 1.1484375, "learning_rate": 0.00045993321337656163, "loss": 5.3518, "mean_token_accuracy": 0.18216099143028258, "num_tokens": 6063823.0, "step": 2930 }, { "entropy": 5.661330366134644, "epoch": 2.6660608814175375, "grad_norm": 1.1015625, "learning_rate": 0.000459731673759798, "loss": 5.3518, "mean_token_accuracy": 0.17229808866977692, "num_tokens": 6073914.0, "step": 2935 }, { "entropy": 5.658997678756714, "epoch": 2.6706042707860065, "grad_norm": 1.0546875, "learning_rate": 0.00045952967833599303, "loss": 5.3349, "mean_token_accuracy": 0.17754623740911485, "num_tokens": 6085121.0, "step": 2940 }, { "entropy": 5.612066221237183, "epoch": 2.675147660154475, "grad_norm": 1.15625, "learning_rate": 0.0004593272276035502, "loss": 5.261, "mean_token_accuracy": 0.18452934622764589, "num_tokens": 6095324.0, "step": 2945 }, { "entropy": 5.62063684463501, "epoch": 2.679691049522944, "grad_norm": 1.1796875, "learning_rate": 0.0004591243220619969, "loss": 5.3896, "mean_token_accuracy": 0.1811824172735214, "num_tokens": 6104704.0, "step": 2950 }, { "entropy": 5.682147741317749, "epoch": 2.684234438891413, "grad_norm": 1.09375, "learning_rate": 0.000458920962211982, "loss": 5.4886, "mean_token_accuracy": 0.16916490495204925, "num_tokens": 6116569.0, "step": 2955 }, { "entropy": 5.7397918701171875, "epoch": 2.688777828259882, "grad_norm": 1.1015625, "learning_rate": 0.0004587171485552759, "loss": 5.476, "mean_token_accuracy": 0.1748810663819313, "num_tokens": 6126166.0, "step": 2960 }, { "entropy": 5.68087682723999, "epoch": 2.693321217628351, "grad_norm": 1.0703125, "learning_rate": 0.00045851288159476854, "loss": 5.3318, "mean_token_accuracy": 0.18225707560777665, "num_tokens": 6136169.0, "step": 2965 }, { "entropy": 5.696323394775391, "epoch": 2.6978646069968195, "grad_norm": 1.09375, "learning_rate": 0.0004583081618344684, "loss": 5.4163, "mean_token_accuracy": 0.17932215034961702, "num_tokens": 6146249.0, "step": 2970 }, { "entropy": 5.750275993347168, "epoch": 2.7024079963652885, "grad_norm": 1.0390625, "learning_rate": 0.000458102989779501, "loss": 5.4816, "mean_token_accuracy": 0.17407476156949997, "num_tokens": 6156892.0, "step": 2975 }, { "entropy": 5.737551021575928, "epoch": 2.7069513857337575, "grad_norm": 1.171875, "learning_rate": 0.0004578973659361081, "loss": 5.3638, "mean_token_accuracy": 0.18510779440402986, "num_tokens": 6166915.0, "step": 2980 }, { "entropy": 5.62639627456665, "epoch": 2.711494775102226, "grad_norm": 1.1796875, "learning_rate": 0.00045769129081164596, "loss": 5.2982, "mean_token_accuracy": 0.18099016845226287, "num_tokens": 6176837.0, "step": 2985 }, { "entropy": 5.587598085403442, "epoch": 2.716038164470695, "grad_norm": 1.0234375, "learning_rate": 0.0004574847649145845, "loss": 5.3918, "mean_token_accuracy": 0.17472818940877916, "num_tokens": 6188038.0, "step": 2990 }, { "entropy": 5.667161703109741, "epoch": 2.720581553839164, "grad_norm": 1.1875, "learning_rate": 0.000457277788754506, "loss": 5.4258, "mean_token_accuracy": 0.1745101973414421, "num_tokens": 6199835.0, "step": 2995 }, { "entropy": 5.750896167755127, "epoch": 2.725124943207633, "grad_norm": 1.1015625, "learning_rate": 0.00045707036284210344, "loss": 5.3499, "mean_token_accuracy": 0.17623832821846008, "num_tokens": 6209122.0, "step": 3000 }, { "epoch": 2.725124943207633, "eval_entropy": 5.453245504512343, "eval_loss": 5.784785747528076, "eval_mean_token_accuracy": 0.16304942005595496, "eval_num_tokens": 6209122.0, "eval_runtime": 2.0071, "eval_samples_per_second": 1711.42, "eval_steps_per_second": 214.239, "step": 3000 }, { "entropy": 5.6080889225006105, "epoch": 2.729668332576102, "grad_norm": 1.1875, "learning_rate": 0.0004568624876891796, "loss": 5.4026, "mean_token_accuracy": 0.17455950230360032, "num_tokens": 6219317.0, "step": 3005 }, { "entropy": 5.703277206420898, "epoch": 2.7342117219445705, "grad_norm": 1.078125, "learning_rate": 0.00045665416380864587, "loss": 5.4271, "mean_token_accuracy": 0.176008839905262, "num_tokens": 6229561.0, "step": 3010 }, { "entropy": 5.705724906921387, "epoch": 2.7387551113130395, "grad_norm": 1.2109375, "learning_rate": 0.0004564453917145206, "loss": 5.4027, "mean_token_accuracy": 0.17291686087846755, "num_tokens": 6240150.0, "step": 3015 }, { "entropy": 5.610035562515259, "epoch": 2.7432985006815085, "grad_norm": 1.1640625, "learning_rate": 0.0004562361719219283, "loss": 5.2927, "mean_token_accuracy": 0.18002589493989946, "num_tokens": 6250641.0, "step": 3020 }, { "entropy": 5.635480499267578, "epoch": 2.747841890049977, "grad_norm": 1.2109375, "learning_rate": 0.00045602650494709786, "loss": 5.3878, "mean_token_accuracy": 0.16999149918556214, "num_tokens": 6261239.0, "step": 3025 }, { "entropy": 5.697523498535157, "epoch": 2.752385279418446, "grad_norm": 0.98046875, "learning_rate": 0.00045581639130736173, "loss": 5.389, "mean_token_accuracy": 0.1768403857946396, "num_tokens": 6270919.0, "step": 3030 }, { "entropy": 5.7210699081420895, "epoch": 2.756928668786915, "grad_norm": 1.1171875, "learning_rate": 0.0004556058315211546, "loss": 5.4686, "mean_token_accuracy": 0.16550424695014954, "num_tokens": 6283007.0, "step": 3035 }, { "entropy": 5.5354899883270265, "epoch": 2.761472058155384, "grad_norm": 1.1015625, "learning_rate": 0.00045539482610801156, "loss": 5.3136, "mean_token_accuracy": 0.18222982287406922, "num_tokens": 6293596.0, "step": 3040 }, { "entropy": 5.652623891830444, "epoch": 2.766015447523853, "grad_norm": 1.1328125, "learning_rate": 0.0004551833755885677, "loss": 5.3718, "mean_token_accuracy": 0.1778726100921631, "num_tokens": 6304568.0, "step": 3045 }, { "entropy": 5.651189088821411, "epoch": 2.7705588368923215, "grad_norm": 1.1015625, "learning_rate": 0.0004549714804845561, "loss": 5.3416, "mean_token_accuracy": 0.17796921730041504, "num_tokens": 6315275.0, "step": 3050 }, { "entropy": 5.692053127288818, "epoch": 2.7751022262607905, "grad_norm": 1.1015625, "learning_rate": 0.0004547591413188068, "loss": 5.4535, "mean_token_accuracy": 0.17656845301389695, "num_tokens": 6324986.0, "step": 3055 }, { "entropy": 5.660140800476074, "epoch": 2.7796456156292595, "grad_norm": 1.2578125, "learning_rate": 0.0004545463586152456, "loss": 5.4493, "mean_token_accuracy": 0.16845283061265945, "num_tokens": 6336318.0, "step": 3060 }, { "entropy": 5.602566337585449, "epoch": 2.784189004997728, "grad_norm": 1.078125, "learning_rate": 0.0004543331328988927, "loss": 5.3237, "mean_token_accuracy": 0.18113580495119094, "num_tokens": 6345986.0, "step": 3065 }, { "entropy": 5.6237877368927, "epoch": 2.788732394366197, "grad_norm": 1.2265625, "learning_rate": 0.0004541194646958614, "loss": 5.4042, "mean_token_accuracy": 0.1757053703069687, "num_tokens": 6357025.0, "step": 3070 }, { "entropy": 5.704830837249756, "epoch": 2.793275783734666, "grad_norm": 1.09375, "learning_rate": 0.00045390535453335666, "loss": 5.4035, "mean_token_accuracy": 0.1736297681927681, "num_tokens": 6367885.0, "step": 3075 }, { "entropy": 5.54007773399353, "epoch": 2.797819173103135, "grad_norm": 1.2109375, "learning_rate": 0.00045369080293967414, "loss": 5.3366, "mean_token_accuracy": 0.1801164522767067, "num_tokens": 6377729.0, "step": 3080 }, { "entropy": 5.600256299972534, "epoch": 2.802362562471604, "grad_norm": 1.1015625, "learning_rate": 0.00045347581044419846, "loss": 5.3303, "mean_token_accuracy": 0.17931140810251237, "num_tokens": 6387368.0, "step": 3085 }, { "entropy": 5.675865364074707, "epoch": 2.806905951840073, "grad_norm": 1.0703125, "learning_rate": 0.00045326037757740216, "loss": 5.4442, "mean_token_accuracy": 0.17015431225299835, "num_tokens": 6397771.0, "step": 3090 }, { "entropy": 5.682026052474976, "epoch": 2.8114493412085415, "grad_norm": 1.140625, "learning_rate": 0.0004530445048708447, "loss": 5.3057, "mean_token_accuracy": 0.1849225789308548, "num_tokens": 6408238.0, "step": 3095 }, { "entropy": 5.673222589492798, "epoch": 2.8159927305770105, "grad_norm": 1.046875, "learning_rate": 0.00045282819285717024, "loss": 5.4458, "mean_token_accuracy": 0.16830612868070602, "num_tokens": 6419196.0, "step": 3100 }, { "entropy": 5.629798126220703, "epoch": 2.8205361199454795, "grad_norm": 1.0234375, "learning_rate": 0.00045261144207010736, "loss": 5.4008, "mean_token_accuracy": 0.17280980944633484, "num_tokens": 6430342.0, "step": 3105 }, { "entropy": 5.650047159194946, "epoch": 2.825079509313948, "grad_norm": 1.1171875, "learning_rate": 0.00045239425304446684, "loss": 5.2996, "mean_token_accuracy": 0.18436145782470703, "num_tokens": 6440218.0, "step": 3110 }, { "entropy": 5.607442235946655, "epoch": 2.829622898682417, "grad_norm": 1.1328125, "learning_rate": 0.0004521766263161413, "loss": 5.302, "mean_token_accuracy": 0.18424032330513002, "num_tokens": 6450128.0, "step": 3115 }, { "entropy": 5.5780956745147705, "epoch": 2.834166288050886, "grad_norm": 1.140625, "learning_rate": 0.000451958562422103, "loss": 5.3012, "mean_token_accuracy": 0.18950312286615373, "num_tokens": 6459916.0, "step": 3120 }, { "entropy": 5.6977263450622555, "epoch": 2.838709677419355, "grad_norm": 1.0078125, "learning_rate": 0.00045174006190040267, "loss": 5.3548, "mean_token_accuracy": 0.17936145961284639, "num_tokens": 6470250.0, "step": 3125 }, { "entropy": 5.6951452732086185, "epoch": 2.843253066787824, "grad_norm": 1.015625, "learning_rate": 0.000451521125290169, "loss": 5.4429, "mean_token_accuracy": 0.17187969088554383, "num_tokens": 6481623.0, "step": 3130 }, { "entropy": 5.640903949737549, "epoch": 2.8477964561562925, "grad_norm": 1.0390625, "learning_rate": 0.000451301753131606, "loss": 5.3481, "mean_token_accuracy": 0.17956022173166275, "num_tokens": 6492143.0, "step": 3135 }, { "entropy": 5.665499019622803, "epoch": 2.8523398455247615, "grad_norm": 1.1796875, "learning_rate": 0.00045108194596599286, "loss": 5.3607, "mean_token_accuracy": 0.1813562586903572, "num_tokens": 6501643.0, "step": 3140 }, { "entropy": 5.587842512130737, "epoch": 2.8568832348932305, "grad_norm": 1.1953125, "learning_rate": 0.0004508617043356818, "loss": 5.3037, "mean_token_accuracy": 0.1881158947944641, "num_tokens": 6511442.0, "step": 3145 }, { "entropy": 5.587015914916992, "epoch": 2.861426624261699, "grad_norm": 1.125, "learning_rate": 0.0004506410287840972, "loss": 5.2357, "mean_token_accuracy": 0.18846675604581833, "num_tokens": 6521303.0, "step": 3150 }, { "entropy": 5.584110736846924, "epoch": 2.865970013630168, "grad_norm": 1.109375, "learning_rate": 0.000450419919855734, "loss": 5.3678, "mean_token_accuracy": 0.17428743839263916, "num_tokens": 6531143.0, "step": 3155 }, { "entropy": 5.695782089233399, "epoch": 2.870513402998637, "grad_norm": 1.1484375, "learning_rate": 0.0004501983780961566, "loss": 5.4229, "mean_token_accuracy": 0.1739306181669235, "num_tokens": 6540899.0, "step": 3160 }, { "entropy": 5.757632493972778, "epoch": 2.875056792367106, "grad_norm": 1.171875, "learning_rate": 0.0004499764040519972, "loss": 5.4668, "mean_token_accuracy": 0.17104335576295854, "num_tokens": 6552131.0, "step": 3165 }, { "entropy": 5.586829948425293, "epoch": 2.879600181735575, "grad_norm": 1.1171875, "learning_rate": 0.00044975399827095467, "loss": 5.3952, "mean_token_accuracy": 0.17037197798490525, "num_tokens": 6563275.0, "step": 3170 }, { "entropy": 5.6519371509552006, "epoch": 2.8841435711040435, "grad_norm": 1.1015625, "learning_rate": 0.00044953116130179313, "loss": 5.2532, "mean_token_accuracy": 0.18573469817638397, "num_tokens": 6573109.0, "step": 3175 }, { "entropy": 5.556792402267456, "epoch": 2.8886869604725125, "grad_norm": 1.03125, "learning_rate": 0.0004493078936943408, "loss": 5.3776, "mean_token_accuracy": 0.1706434965133667, "num_tokens": 6584978.0, "step": 3180 }, { "entropy": 5.572997808456421, "epoch": 2.8932303498409815, "grad_norm": 1.0625, "learning_rate": 0.0004490841959994882, "loss": 5.3734, "mean_token_accuracy": 0.17502374947071075, "num_tokens": 6595608.0, "step": 3185 }, { "entropy": 5.5755220413208, "epoch": 2.89777373920945, "grad_norm": 1.1015625, "learning_rate": 0.00044886006876918716, "loss": 5.264, "mean_token_accuracy": 0.17897515147924423, "num_tokens": 6605983.0, "step": 3190 }, { "entropy": 5.654182195663452, "epoch": 2.902317128577919, "grad_norm": 0.95703125, "learning_rate": 0.0004486355125564493, "loss": 5.3711, "mean_token_accuracy": 0.17443785071372986, "num_tokens": 6616682.0, "step": 3195 }, { "entropy": 5.737604475021362, "epoch": 2.906860517946388, "grad_norm": 1.1015625, "learning_rate": 0.0004484105279153449, "loss": 5.4166, "mean_token_accuracy": 0.17461859434843063, "num_tokens": 6628715.0, "step": 3200 }, { "entropy": 5.655596923828125, "epoch": 2.911403907314857, "grad_norm": 1.0546875, "learning_rate": 0.000448185115401001, "loss": 5.3999, "mean_token_accuracy": 0.17531391829252244, "num_tokens": 6639219.0, "step": 3205 }, { "entropy": 5.554110765457153, "epoch": 2.915947296683326, "grad_norm": 1.140625, "learning_rate": 0.0004479592755696008, "loss": 5.2806, "mean_token_accuracy": 0.1882808655500412, "num_tokens": 6649516.0, "step": 3210 }, { "entropy": 5.685878038406372, "epoch": 2.9204906860517945, "grad_norm": 1.203125, "learning_rate": 0.00044773300897838137, "loss": 5.4143, "mean_token_accuracy": 0.17875213623046876, "num_tokens": 6659470.0, "step": 3215 }, { "entropy": 5.578742456436157, "epoch": 2.9250340754202635, "grad_norm": 1.1875, "learning_rate": 0.0004475063161856332, "loss": 5.3684, "mean_token_accuracy": 0.1780405804514885, "num_tokens": 6669637.0, "step": 3220 }, { "entropy": 5.572076034545899, "epoch": 2.9295774647887325, "grad_norm": 1.0390625, "learning_rate": 0.0004472791977506983, "loss": 5.3223, "mean_token_accuracy": 0.17649637013673783, "num_tokens": 6680450.0, "step": 3225 }, { "entropy": 5.675052356719971, "epoch": 2.934120854157201, "grad_norm": 1.0859375, "learning_rate": 0.00044705165423396855, "loss": 5.4264, "mean_token_accuracy": 0.17175417840480806, "num_tokens": 6691526.0, "step": 3230 }, { "entropy": 5.653611278533935, "epoch": 2.93866424352567, "grad_norm": 0.99609375, "learning_rate": 0.00044682368619688523, "loss": 5.362, "mean_token_accuracy": 0.18099160641431808, "num_tokens": 6702543.0, "step": 3235 }, { "entropy": 5.644366931915283, "epoch": 2.943207632894139, "grad_norm": 1.171875, "learning_rate": 0.0004465952942019367, "loss": 5.432, "mean_token_accuracy": 0.173517544567585, "num_tokens": 6712374.0, "step": 3240 }, { "entropy": 5.681358289718628, "epoch": 2.947751022262608, "grad_norm": 1.0703125, "learning_rate": 0.00044636647881265745, "loss": 5.3281, "mean_token_accuracy": 0.177579765021801, "num_tokens": 6722091.0, "step": 3245 }, { "entropy": 5.562648773193359, "epoch": 2.952294411631077, "grad_norm": 1.1171875, "learning_rate": 0.0004461372405936269, "loss": 5.3032, "mean_token_accuracy": 0.1880867600440979, "num_tokens": 6732024.0, "step": 3250 }, { "entropy": 5.6726624965667725, "epoch": 2.9568378009995455, "grad_norm": 1.1328125, "learning_rate": 0.0004459075801104673, "loss": 5.4343, "mean_token_accuracy": 0.1747943416237831, "num_tokens": 6741480.0, "step": 3255 }, { "entropy": 5.685817384719849, "epoch": 2.9613811903680145, "grad_norm": 1.0234375, "learning_rate": 0.00044567749792984325, "loss": 5.3025, "mean_token_accuracy": 0.18109937906265258, "num_tokens": 6752504.0, "step": 3260 }, { "entropy": 5.645481538772583, "epoch": 2.9659245797364835, "grad_norm": 1.1875, "learning_rate": 0.00044544699461945966, "loss": 5.358, "mean_token_accuracy": 0.17322249561548234, "num_tokens": 6762945.0, "step": 3265 }, { "entropy": 5.603443384170532, "epoch": 2.970467969104952, "grad_norm": 1.140625, "learning_rate": 0.00044521607074806037, "loss": 5.339, "mean_token_accuracy": 0.1814771443605423, "num_tokens": 6772862.0, "step": 3270 }, { "entropy": 5.667225980758667, "epoch": 2.975011358473421, "grad_norm": 1.1171875, "learning_rate": 0.0004449847268854272, "loss": 5.3583, "mean_token_accuracy": 0.17745987176895142, "num_tokens": 6782912.0, "step": 3275 }, { "entropy": 5.701634693145752, "epoch": 2.97955474784189, "grad_norm": 1.0390625, "learning_rate": 0.0004447529636023782, "loss": 5.3862, "mean_token_accuracy": 0.1821895956993103, "num_tokens": 6793249.0, "step": 3280 }, { "entropy": 5.635831356048584, "epoch": 2.984098137210359, "grad_norm": 1.0234375, "learning_rate": 0.00044452078147076614, "loss": 5.3755, "mean_token_accuracy": 0.17844953536987304, "num_tokens": 6803721.0, "step": 3285 }, { "entropy": 5.752778673171997, "epoch": 2.988641526578828, "grad_norm": 1.0234375, "learning_rate": 0.0004442881810634774, "loss": 5.3653, "mean_token_accuracy": 0.18217482417821884, "num_tokens": 6813637.0, "step": 3290 }, { "entropy": 5.610965538024902, "epoch": 2.9931849159472965, "grad_norm": 1.0234375, "learning_rate": 0.0004440551629544303, "loss": 5.3568, "mean_token_accuracy": 0.1780506655573845, "num_tokens": 6824171.0, "step": 3295 }, { "entropy": 5.5364542484283445, "epoch": 2.9977283053157655, "grad_norm": 1.1015625, "learning_rate": 0.00044382172771857383, "loss": 5.2167, "mean_token_accuracy": 0.18581394702196122, "num_tokens": 6833668.0, "step": 3300 }, { "entropy": 5.594743039872911, "epoch": 3.0018173557473875, "grad_norm": 1.1015625, "learning_rate": 0.0004435878759318864, "loss": 5.1484, "mean_token_accuracy": 0.18705875509315067, "num_tokens": 6842297.0, "step": 3305 }, { "entropy": 5.664475727081299, "epoch": 3.0063607451158565, "grad_norm": 1.0703125, "learning_rate": 0.0004433536081713738, "loss": 5.1472, "mean_token_accuracy": 0.18605576306581498, "num_tokens": 6853124.0, "step": 3310 }, { "entropy": 5.591793251037598, "epoch": 3.0109041344843255, "grad_norm": 1.1015625, "learning_rate": 0.0004431189250150686, "loss": 5.0094, "mean_token_accuracy": 0.20247548967599868, "num_tokens": 6861990.0, "step": 3315 }, { "entropy": 5.624763631820679, "epoch": 3.015447523852794, "grad_norm": 1.09375, "learning_rate": 0.00044288382704202816, "loss": 5.0144, "mean_token_accuracy": 0.19900811612606048, "num_tokens": 6872024.0, "step": 3320 }, { "entropy": 5.57113471031189, "epoch": 3.019990913221263, "grad_norm": 1.1640625, "learning_rate": 0.00044264831483233335, "loss": 5.0806, "mean_token_accuracy": 0.1964230164885521, "num_tokens": 6881205.0, "step": 3325 }, { "entropy": 5.496262645721435, "epoch": 3.024534302589732, "grad_norm": 1.078125, "learning_rate": 0.00044241238896708716, "loss": 5.0401, "mean_token_accuracy": 0.2007389023900032, "num_tokens": 6891741.0, "step": 3330 }, { "entropy": 5.511004686355591, "epoch": 3.029077691958201, "grad_norm": 1.2421875, "learning_rate": 0.0004421760500284131, "loss": 5.1131, "mean_token_accuracy": 0.1915447786450386, "num_tokens": 6902122.0, "step": 3335 }, { "entropy": 5.632760047912598, "epoch": 3.0336210813266695, "grad_norm": 1.1953125, "learning_rate": 0.0004419392985994541, "loss": 5.0626, "mean_token_accuracy": 0.19105150550603867, "num_tokens": 6912129.0, "step": 3340 }, { "entropy": 5.541226196289062, "epoch": 3.0381644706951385, "grad_norm": 1.1796875, "learning_rate": 0.00044170213526437076, "loss": 4.9527, "mean_token_accuracy": 0.20671245455741882, "num_tokens": 6921409.0, "step": 3345 }, { "entropy": 5.493974208831787, "epoch": 3.0427078600636075, "grad_norm": 1.0859375, "learning_rate": 0.00044146456060833994, "loss": 5.0771, "mean_token_accuracy": 0.19682952910661697, "num_tokens": 6932346.0, "step": 3350 }, { "entropy": 5.608472728729248, "epoch": 3.0472512494320765, "grad_norm": 1.171875, "learning_rate": 0.00044122657521755373, "loss": 5.0816, "mean_token_accuracy": 0.1942780375480652, "num_tokens": 6942139.0, "step": 3355 }, { "entropy": 5.59161605834961, "epoch": 3.051794638800545, "grad_norm": 1.125, "learning_rate": 0.00044098817967921716, "loss": 5.0934, "mean_token_accuracy": 0.19804326295852662, "num_tokens": 6952344.0, "step": 3360 }, { "entropy": 5.5765156745910645, "epoch": 3.056338028169014, "grad_norm": 1.1171875, "learning_rate": 0.00044074937458154763, "loss": 5.0691, "mean_token_accuracy": 0.19665647447109222, "num_tokens": 6962430.0, "step": 3365 }, { "entropy": 5.636666584014892, "epoch": 3.060881417537483, "grad_norm": 1.03125, "learning_rate": 0.00044051016051377303, "loss": 5.138, "mean_token_accuracy": 0.18742588460445403, "num_tokens": 6973213.0, "step": 3370 }, { "entropy": 5.541379404067993, "epoch": 3.065424806905952, "grad_norm": 1.1171875, "learning_rate": 0.0004402705380661302, "loss": 5.0742, "mean_token_accuracy": 0.19189217835664749, "num_tokens": 6983896.0, "step": 3375 }, { "entropy": 5.524691247940064, "epoch": 3.0699681962744205, "grad_norm": 1.1796875, "learning_rate": 0.00044003050782986377, "loss": 5.0403, "mean_token_accuracy": 0.20257313102483748, "num_tokens": 6993549.0, "step": 3380 }, { "entropy": 5.529317045211792, "epoch": 3.0745115856428895, "grad_norm": 1.109375, "learning_rate": 0.0004397900703972245, "loss": 5.0797, "mean_token_accuracy": 0.19670161455869675, "num_tokens": 7003893.0, "step": 3385 }, { "entropy": 5.579141569137573, "epoch": 3.0790549750113585, "grad_norm": 1.09375, "learning_rate": 0.0004395492263614677, "loss": 5.1785, "mean_token_accuracy": 0.1873283088207245, "num_tokens": 7014826.0, "step": 3390 }, { "entropy": 5.658420038223267, "epoch": 3.0835983643798275, "grad_norm": 1.1796875, "learning_rate": 0.00043930797631685234, "loss": 5.1128, "mean_token_accuracy": 0.19410496652126313, "num_tokens": 7024758.0, "step": 3395 }, { "entropy": 5.520545101165771, "epoch": 3.088141753748296, "grad_norm": 1.2109375, "learning_rate": 0.00043906632085863876, "loss": 5.0797, "mean_token_accuracy": 0.1996367961168289, "num_tokens": 7034063.0, "step": 3400 }, { "entropy": 5.516371583938598, "epoch": 3.092685143116765, "grad_norm": 1.1953125, "learning_rate": 0.00043882426058308775, "loss": 5.0894, "mean_token_accuracy": 0.18975686132907868, "num_tokens": 7045137.0, "step": 3405 }, { "entropy": 5.492123985290528, "epoch": 3.097228532485234, "grad_norm": 1.015625, "learning_rate": 0.00043858179608745915, "loss": 5.0139, "mean_token_accuracy": 0.19682970494031907, "num_tokens": 7056381.0, "step": 3410 }, { "entropy": 5.642992448806763, "epoch": 3.101771921853703, "grad_norm": 1.171875, "learning_rate": 0.0004383389279700098, "loss": 5.1398, "mean_token_accuracy": 0.18474567979574202, "num_tokens": 7066462.0, "step": 3415 }, { "entropy": 5.620988368988037, "epoch": 3.1063153112221715, "grad_norm": 1.0703125, "learning_rate": 0.00043809565682999274, "loss": 5.1779, "mean_token_accuracy": 0.18971589356660842, "num_tokens": 7078438.0, "step": 3420 }, { "entropy": 5.528593635559082, "epoch": 3.1108587005906405, "grad_norm": 1.0546875, "learning_rate": 0.00043785198326765535, "loss": 5.018, "mean_token_accuracy": 0.1973418489098549, "num_tokens": 7088981.0, "step": 3425 }, { "entropy": 5.5474175930023195, "epoch": 3.1154020899591095, "grad_norm": 1.140625, "learning_rate": 0.00043760790788423785, "loss": 5.091, "mean_token_accuracy": 0.19311785995960234, "num_tokens": 7099407.0, "step": 3430 }, { "entropy": 5.5198742866516115, "epoch": 3.1199454793275785, "grad_norm": 1.2265625, "learning_rate": 0.00043736343128197207, "loss": 4.9994, "mean_token_accuracy": 0.20123654156923293, "num_tokens": 7109454.0, "step": 3435 }, { "entropy": 5.478142929077149, "epoch": 3.124488868696047, "grad_norm": 1.28125, "learning_rate": 0.0004371185540640796, "loss": 5.0888, "mean_token_accuracy": 0.19594966173171996, "num_tokens": 7119639.0, "step": 3440 }, { "entropy": 5.541839599609375, "epoch": 3.129032258064516, "grad_norm": 1.1328125, "learning_rate": 0.00043687327683477077, "loss": 5.0521, "mean_token_accuracy": 0.19495830088853836, "num_tokens": 7129872.0, "step": 3445 }, { "entropy": 5.512017393112183, "epoch": 3.133575647432985, "grad_norm": 1.1640625, "learning_rate": 0.0004366276001992427, "loss": 4.9933, "mean_token_accuracy": 0.2008160024881363, "num_tokens": 7140456.0, "step": 3450 }, { "entropy": 5.468423748016358, "epoch": 3.138119036801454, "grad_norm": 1.25, "learning_rate": 0.000436381524763678, "loss": 5.025, "mean_token_accuracy": 0.1984676942229271, "num_tokens": 7149787.0, "step": 3455 }, { "entropy": 5.509213495254516, "epoch": 3.142662426169923, "grad_norm": 1.2109375, "learning_rate": 0.0004361350511352435, "loss": 5.0056, "mean_token_accuracy": 0.20098166018724442, "num_tokens": 7160482.0, "step": 3460 }, { "entropy": 5.542237043380737, "epoch": 3.1472058155383915, "grad_norm": 1.078125, "learning_rate": 0.0004358881799220882, "loss": 5.0447, "mean_token_accuracy": 0.19270921051502227, "num_tokens": 7170818.0, "step": 3465 }, { "entropy": 5.532478761672974, "epoch": 3.1517492049068605, "grad_norm": 1.2578125, "learning_rate": 0.00043564091173334236, "loss": 5.0817, "mean_token_accuracy": 0.19675188064575194, "num_tokens": 7180770.0, "step": 3470 }, { "entropy": 5.453178882598877, "epoch": 3.1562925942753295, "grad_norm": 1.2578125, "learning_rate": 0.00043539324717911573, "loss": 4.9938, "mean_token_accuracy": 0.20483460128307343, "num_tokens": 7190751.0, "step": 3475 }, { "entropy": 5.509433937072754, "epoch": 3.1608359836437985, "grad_norm": 1.3125, "learning_rate": 0.00043514518687049587, "loss": 5.013, "mean_token_accuracy": 0.20054661780595778, "num_tokens": 7200093.0, "step": 3480 }, { "entropy": 5.63069429397583, "epoch": 3.165379373012267, "grad_norm": 1.109375, "learning_rate": 0.000434896731419547, "loss": 5.1234, "mean_token_accuracy": 0.19962280094623566, "num_tokens": 7210526.0, "step": 3485 }, { "entropy": 5.497222518920898, "epoch": 3.169922762380736, "grad_norm": 1.1953125, "learning_rate": 0.0004346478814393082, "loss": 5.0665, "mean_token_accuracy": 0.19520049244165422, "num_tokens": 7222127.0, "step": 3490 }, { "entropy": 5.426847505569458, "epoch": 3.174466151749205, "grad_norm": 1.0859375, "learning_rate": 0.0004343986375437921, "loss": 5.0317, "mean_token_accuracy": 0.1989658460021019, "num_tokens": 7233418.0, "step": 3495 }, { "entropy": 5.531636142730713, "epoch": 3.179009541117674, "grad_norm": 1.21875, "learning_rate": 0.00043414900034798314, "loss": 5.0904, "mean_token_accuracy": 0.19284862875938416, "num_tokens": 7243743.0, "step": 3500 }, { "epoch": 3.179009541117674, "eval_entropy": 5.294256185930829, "eval_loss": 5.751738548278809, "eval_mean_token_accuracy": 0.16606204542656278, "eval_num_tokens": 7243743.0, "eval_runtime": 1.9999, "eval_samples_per_second": 1717.591, "eval_steps_per_second": 215.011, "step": 3500 }, { "entropy": 5.5030608654022215, "epoch": 3.1835529304861425, "grad_norm": 1.078125, "learning_rate": 0.0004338989704678364, "loss": 5.1264, "mean_token_accuracy": 0.18420005291700364, "num_tokens": 7254906.0, "step": 3505 }, { "entropy": 5.528319406509399, "epoch": 3.1880963198546115, "grad_norm": 1.3125, "learning_rate": 0.00043364854852027566, "loss": 5.0618, "mean_token_accuracy": 0.19399550259113313, "num_tokens": 7264193.0, "step": 3510 }, { "entropy": 5.596078014373779, "epoch": 3.1926397092230805, "grad_norm": 1.25, "learning_rate": 0.0004333977351231924, "loss": 5.1279, "mean_token_accuracy": 0.1943611443042755, "num_tokens": 7273723.0, "step": 3515 }, { "entropy": 5.515632915496826, "epoch": 3.1971830985915495, "grad_norm": 1.125, "learning_rate": 0.00043314653089544336, "loss": 5.1419, "mean_token_accuracy": 0.1859172075986862, "num_tokens": 7284142.0, "step": 3520 }, { "entropy": 5.510475730895996, "epoch": 3.201726487960018, "grad_norm": 1.2421875, "learning_rate": 0.0004328949364568504, "loss": 5.0403, "mean_token_accuracy": 0.20122268050909042, "num_tokens": 7294228.0, "step": 3525 }, { "entropy": 5.51758337020874, "epoch": 3.206269877328487, "grad_norm": 1.21875, "learning_rate": 0.0004326429524281975, "loss": 5.0656, "mean_token_accuracy": 0.1953857108950615, "num_tokens": 7304555.0, "step": 3530 }, { "entropy": 5.540026998519897, "epoch": 3.210813266696956, "grad_norm": 1.15625, "learning_rate": 0.0004323905794312303, "loss": 5.1641, "mean_token_accuracy": 0.18480420261621475, "num_tokens": 7315955.0, "step": 3535 }, { "entropy": 5.542173051834107, "epoch": 3.215356656065425, "grad_norm": 1.234375, "learning_rate": 0.00043213781808865414, "loss": 5.0956, "mean_token_accuracy": 0.18931326568126677, "num_tokens": 7326757.0, "step": 3540 }, { "entropy": 5.4850963115692135, "epoch": 3.2199000454338935, "grad_norm": 1.203125, "learning_rate": 0.0004318846690241324, "loss": 5.0687, "mean_token_accuracy": 0.19748374819755554, "num_tokens": 7335969.0, "step": 3545 }, { "entropy": 5.50565733909607, "epoch": 3.2244434348023625, "grad_norm": 1.28125, "learning_rate": 0.00043163113286228533, "loss": 5.0681, "mean_token_accuracy": 0.19274979531764985, "num_tokens": 7345824.0, "step": 3550 }, { "entropy": 5.556841421127319, "epoch": 3.2289868241708315, "grad_norm": 1.15625, "learning_rate": 0.0004313772102286882, "loss": 5.1442, "mean_token_accuracy": 0.18979265540838242, "num_tokens": 7356292.0, "step": 3555 }, { "entropy": 5.53232216835022, "epoch": 3.2335302135393005, "grad_norm": 1.296875, "learning_rate": 0.0004311229017498698, "loss": 5.1441, "mean_token_accuracy": 0.18825449645519257, "num_tokens": 7366809.0, "step": 3560 }, { "entropy": 5.594621801376343, "epoch": 3.238073602907769, "grad_norm": 1.296875, "learning_rate": 0.000430868208053311, "loss": 5.053, "mean_token_accuracy": 0.20324303656816484, "num_tokens": 7376076.0, "step": 3565 }, { "entropy": 5.48758020401001, "epoch": 3.242616992276238, "grad_norm": 1.1171875, "learning_rate": 0.00043061312976744326, "loss": 5.0772, "mean_token_accuracy": 0.19461447298526763, "num_tokens": 7386338.0, "step": 3570 }, { "entropy": 5.502114915847779, "epoch": 3.247160381644707, "grad_norm": 1.234375, "learning_rate": 0.0004303576675216469, "loss": 5.0528, "mean_token_accuracy": 0.19673527777194977, "num_tokens": 7395792.0, "step": 3575 }, { "entropy": 5.491319179534912, "epoch": 3.251703771013176, "grad_norm": 1.1328125, "learning_rate": 0.00043010182194624957, "loss": 5.0757, "mean_token_accuracy": 0.19470140486955642, "num_tokens": 7405765.0, "step": 3580 }, { "entropy": 5.488127040863037, "epoch": 3.2562471603816445, "grad_norm": 1.2421875, "learning_rate": 0.0004298455936725248, "loss": 5.1261, "mean_token_accuracy": 0.19317075312137605, "num_tokens": 7415213.0, "step": 3585 }, { "entropy": 5.584626817703247, "epoch": 3.2607905497501135, "grad_norm": 1.1171875, "learning_rate": 0.0004295889833326903, "loss": 5.0902, "mean_token_accuracy": 0.1905794084072113, "num_tokens": 7425722.0, "step": 3590 }, { "entropy": 5.599624967575073, "epoch": 3.2653339391185825, "grad_norm": 1.109375, "learning_rate": 0.00042933199155990675, "loss": 5.1524, "mean_token_accuracy": 0.19233058393001556, "num_tokens": 7436240.0, "step": 3595 }, { "entropy": 5.509469032287598, "epoch": 3.2698773284870515, "grad_norm": 1.2109375, "learning_rate": 0.0004290746189882757, "loss": 5.1361, "mean_token_accuracy": 0.18685731738805772, "num_tokens": 7447878.0, "step": 3600 }, { "entropy": 5.56361141204834, "epoch": 3.27442071785552, "grad_norm": 1.2109375, "learning_rate": 0.00042881686625283844, "loss": 5.0981, "mean_token_accuracy": 0.19554533213376998, "num_tokens": 7458635.0, "step": 3605 }, { "entropy": 5.541248416900634, "epoch": 3.278964107223989, "grad_norm": 1.1796875, "learning_rate": 0.0004285587339895742, "loss": 5.1343, "mean_token_accuracy": 0.18703659921884536, "num_tokens": 7468740.0, "step": 3610 }, { "entropy": 5.629860496520996, "epoch": 3.283507496592458, "grad_norm": 1.15625, "learning_rate": 0.00042830022283539863, "loss": 5.19, "mean_token_accuracy": 0.18779015243053437, "num_tokens": 7480977.0, "step": 3615 }, { "entropy": 5.533052587509156, "epoch": 3.288050885960927, "grad_norm": 1.09375, "learning_rate": 0.0004280413334281623, "loss": 5.1774, "mean_token_accuracy": 0.19077278971672057, "num_tokens": 7491758.0, "step": 3620 }, { "entropy": 5.600966930389404, "epoch": 3.292594275329396, "grad_norm": 1.3203125, "learning_rate": 0.00042778206640664915, "loss": 5.1126, "mean_token_accuracy": 0.19315629601478576, "num_tokens": 7500486.0, "step": 3625 }, { "entropy": 5.44861068725586, "epoch": 3.2971376646978645, "grad_norm": 1.1796875, "learning_rate": 0.0004275224224105748, "loss": 5.1165, "mean_token_accuracy": 0.19958876222372054, "num_tokens": 7510371.0, "step": 3630 }, { "entropy": 5.533408546447754, "epoch": 3.3016810540663335, "grad_norm": 1.1484375, "learning_rate": 0.00042726240208058484, "loss": 5.144, "mean_token_accuracy": 0.19472647756338118, "num_tokens": 7520697.0, "step": 3635 }, { "entropy": 5.492074060440063, "epoch": 3.3062244434348025, "grad_norm": 1.1171875, "learning_rate": 0.0004270020060582538, "loss": 5.0553, "mean_token_accuracy": 0.19772299081087114, "num_tokens": 7530757.0, "step": 3640 }, { "entropy": 5.51636757850647, "epoch": 3.310767832803271, "grad_norm": 1.0234375, "learning_rate": 0.00042674123498608285, "loss": 5.1056, "mean_token_accuracy": 0.19229757487773896, "num_tokens": 7541810.0, "step": 3645 }, { "entropy": 5.626980352401733, "epoch": 3.31531122217174, "grad_norm": 1.1171875, "learning_rate": 0.00042648008950749877, "loss": 5.2965, "mean_token_accuracy": 0.17989146560430527, "num_tokens": 7552754.0, "step": 3650 }, { "entropy": 5.574767255783081, "epoch": 3.319854611540209, "grad_norm": 1.28125, "learning_rate": 0.000426218570266852, "loss": 5.0767, "mean_token_accuracy": 0.19806645810604095, "num_tokens": 7562906.0, "step": 3655 }, { "entropy": 5.434383964538574, "epoch": 3.324398000908678, "grad_norm": 1.125, "learning_rate": 0.00042595667790941536, "loss": 5.076, "mean_token_accuracy": 0.19282221794128418, "num_tokens": 7574149.0, "step": 3660 }, { "entropy": 5.442363357543945, "epoch": 3.328941390277147, "grad_norm": 1.109375, "learning_rate": 0.00042569441308138204, "loss": 5.0817, "mean_token_accuracy": 0.20203310549259185, "num_tokens": 7584610.0, "step": 3665 }, { "entropy": 5.542620754241943, "epoch": 3.3334847796456155, "grad_norm": 1.109375, "learning_rate": 0.0004254317764298645, "loss": 5.0317, "mean_token_accuracy": 0.1923823893070221, "num_tokens": 7594954.0, "step": 3670 }, { "entropy": 5.598101663589477, "epoch": 3.3380281690140845, "grad_norm": 1.0546875, "learning_rate": 0.0004251687686028927, "loss": 5.1653, "mean_token_accuracy": 0.17998976409435272, "num_tokens": 7606069.0, "step": 3675 }, { "entropy": 5.43584451675415, "epoch": 3.3425715583825535, "grad_norm": 1.234375, "learning_rate": 0.00042490539024941216, "loss": 5.0002, "mean_token_accuracy": 0.20193633139133454, "num_tokens": 7615671.0, "step": 3680 }, { "entropy": 5.508904314041137, "epoch": 3.347114947751022, "grad_norm": 1.203125, "learning_rate": 0.00042464164201928286, "loss": 5.1961, "mean_token_accuracy": 0.18532725274562836, "num_tokens": 7626740.0, "step": 3685 }, { "entropy": 5.539602279663086, "epoch": 3.351658337119491, "grad_norm": 1.28125, "learning_rate": 0.00042437752456327734, "loss": 5.1183, "mean_token_accuracy": 0.1940290555357933, "num_tokens": 7636459.0, "step": 3690 }, { "entropy": 5.612280559539795, "epoch": 3.35620172648796, "grad_norm": 1.125, "learning_rate": 0.00042411303853307907, "loss": 5.0713, "mean_token_accuracy": 0.19265790432691574, "num_tokens": 7646974.0, "step": 3695 }, { "entropy": 5.406089162826538, "epoch": 3.360745115856429, "grad_norm": 1.1796875, "learning_rate": 0.0004238481845812811, "loss": 5.0436, "mean_token_accuracy": 0.1934661850333214, "num_tokens": 7657372.0, "step": 3700 }, { "entropy": 5.427165126800537, "epoch": 3.365288505224898, "grad_norm": 1.109375, "learning_rate": 0.00042358296336138436, "loss": 5.0878, "mean_token_accuracy": 0.19385142922401427, "num_tokens": 7668972.0, "step": 3705 }, { "entropy": 5.572782802581787, "epoch": 3.3698318945933665, "grad_norm": 1.2265625, "learning_rate": 0.0004233173755277956, "loss": 5.0978, "mean_token_accuracy": 0.2041905164718628, "num_tokens": 7679742.0, "step": 3710 }, { "entropy": 5.518075370788575, "epoch": 3.3743752839618355, "grad_norm": 1.140625, "learning_rate": 0.00042305142173582657, "loss": 5.13, "mean_token_accuracy": 0.19715550690889358, "num_tokens": 7690759.0, "step": 3715 }, { "entropy": 5.507992267608643, "epoch": 3.3789186733303045, "grad_norm": 1.1953125, "learning_rate": 0.00042278510264169165, "loss": 5.0818, "mean_token_accuracy": 0.19355220198631287, "num_tokens": 7700482.0, "step": 3720 }, { "entropy": 5.482635736465454, "epoch": 3.3834620626987735, "grad_norm": 1.265625, "learning_rate": 0.00042251841890250696, "loss": 5.0661, "mean_token_accuracy": 0.1878388524055481, "num_tokens": 7710414.0, "step": 3725 }, { "entropy": 5.54592809677124, "epoch": 3.388005452067242, "grad_norm": 1.1796875, "learning_rate": 0.000422251371176288, "loss": 5.1005, "mean_token_accuracy": 0.19825109988451003, "num_tokens": 7721214.0, "step": 3730 }, { "entropy": 5.497478485107422, "epoch": 3.392548841435711, "grad_norm": 1.0703125, "learning_rate": 0.00042198396012194854, "loss": 5.0537, "mean_token_accuracy": 0.20017760396003723, "num_tokens": 7732551.0, "step": 3735 }, { "entropy": 5.509873962402343, "epoch": 3.39709223080418, "grad_norm": 1.140625, "learning_rate": 0.00042171618639929865, "loss": 5.1599, "mean_token_accuracy": 0.19333608895540239, "num_tokens": 7742266.0, "step": 3740 }, { "entropy": 5.488704776763916, "epoch": 3.401635620172649, "grad_norm": 1.3203125, "learning_rate": 0.00042144805066904345, "loss": 5.009, "mean_token_accuracy": 0.1954241394996643, "num_tokens": 7753152.0, "step": 3745 }, { "entropy": 5.4690587520599365, "epoch": 3.4061790095411175, "grad_norm": 1.1015625, "learning_rate": 0.00042117955359278125, "loss": 5.1049, "mean_token_accuracy": 0.19189360439777375, "num_tokens": 7764420.0, "step": 3750 }, { "entropy": 5.535941791534424, "epoch": 3.4107223989095865, "grad_norm": 1.0546875, "learning_rate": 0.00042091069583300177, "loss": 5.0808, "mean_token_accuracy": 0.1919311374425888, "num_tokens": 7776044.0, "step": 3755 }, { "entropy": 5.4821361064910885, "epoch": 3.4152657882780555, "grad_norm": 1.15625, "learning_rate": 0.0004206414780530849, "loss": 5.1126, "mean_token_accuracy": 0.19450199455022812, "num_tokens": 7786737.0, "step": 3760 }, { "entropy": 5.452231979370117, "epoch": 3.4198091776465245, "grad_norm": 1.2578125, "learning_rate": 0.0004203719009172987, "loss": 5.0369, "mean_token_accuracy": 0.19422636479139327, "num_tokens": 7796974.0, "step": 3765 }, { "entropy": 5.535924434661865, "epoch": 3.424352567014993, "grad_norm": 1.1953125, "learning_rate": 0.000420101965090798, "loss": 5.1955, "mean_token_accuracy": 0.18865609019994736, "num_tokens": 7808221.0, "step": 3770 }, { "entropy": 5.435919141769409, "epoch": 3.428895956383462, "grad_norm": 1.125, "learning_rate": 0.0004198316712396226, "loss": 5.0423, "mean_token_accuracy": 0.19782525449991226, "num_tokens": 7818422.0, "step": 3775 }, { "entropy": 5.497764015197754, "epoch": 3.433439345751931, "grad_norm": 1.0859375, "learning_rate": 0.00041956102003069573, "loss": 5.0539, "mean_token_accuracy": 0.19576893448829652, "num_tokens": 7828313.0, "step": 3780 }, { "entropy": 5.454093313217163, "epoch": 3.4379827351204, "grad_norm": 1.046875, "learning_rate": 0.0004192900121318223, "loss": 5.0925, "mean_token_accuracy": 0.20414010733366011, "num_tokens": 7839493.0, "step": 3785 }, { "entropy": 5.5003832340240475, "epoch": 3.4425261244888685, "grad_norm": 1.234375, "learning_rate": 0.0004190186482116874, "loss": 5.0992, "mean_token_accuracy": 0.1865068718791008, "num_tokens": 7849796.0, "step": 3790 }, { "entropy": 5.463807201385498, "epoch": 3.4470695138573375, "grad_norm": 1.078125, "learning_rate": 0.0004187469289398545, "loss": 5.1444, "mean_token_accuracy": 0.19304777979850768, "num_tokens": 7860865.0, "step": 3795 }, { "entropy": 5.473004722595215, "epoch": 3.4516129032258065, "grad_norm": 1.140625, "learning_rate": 0.00041847485498676385, "loss": 5.0822, "mean_token_accuracy": 0.20007635802030563, "num_tokens": 7871144.0, "step": 3800 }, { "entropy": 5.469412326812744, "epoch": 3.4561562925942755, "grad_norm": 1.2578125, "learning_rate": 0.00041820242702373094, "loss": 5.1271, "mean_token_accuracy": 0.19716734886169435, "num_tokens": 7880916.0, "step": 3805 }, { "entropy": 5.4438964366912845, "epoch": 3.460699681962744, "grad_norm": 1.2890625, "learning_rate": 0.0004179296457229448, "loss": 5.0592, "mean_token_accuracy": 0.19640869945287703, "num_tokens": 7891813.0, "step": 3810 }, { "entropy": 5.542184829711914, "epoch": 3.465243071331213, "grad_norm": 1.2578125, "learning_rate": 0.0004176565117574659, "loss": 5.1173, "mean_token_accuracy": 0.19370521306991578, "num_tokens": 7902697.0, "step": 3815 }, { "entropy": 5.495546579360962, "epoch": 3.469786460699682, "grad_norm": 1.0234375, "learning_rate": 0.0004173830258012255, "loss": 5.0892, "mean_token_accuracy": 0.19609837383031845, "num_tokens": 7912777.0, "step": 3820 }, { "entropy": 5.4906168460845945, "epoch": 3.474329850068151, "grad_norm": 1.1875, "learning_rate": 0.0004171091885290226, "loss": 5.1313, "mean_token_accuracy": 0.19004505276679992, "num_tokens": 7923255.0, "step": 3825 }, { "entropy": 5.467664766311645, "epoch": 3.4788732394366195, "grad_norm": 1.171875, "learning_rate": 0.0004168350006165238, "loss": 5.0017, "mean_token_accuracy": 0.1963506817817688, "num_tokens": 7934268.0, "step": 3830 }, { "entropy": 5.386504459381103, "epoch": 3.4834166288050885, "grad_norm": 1.2578125, "learning_rate": 0.00041656046274026034, "loss": 5.0307, "mean_token_accuracy": 0.19830360263586044, "num_tokens": 7944526.0, "step": 3835 }, { "entropy": 5.490135526657104, "epoch": 3.4879600181735575, "grad_norm": 1.203125, "learning_rate": 0.0004162855755776272, "loss": 5.1348, "mean_token_accuracy": 0.19211395829916, "num_tokens": 7954512.0, "step": 3840 }, { "entropy": 5.497490501403808, "epoch": 3.4925034075420265, "grad_norm": 1.125, "learning_rate": 0.00041601033980688106, "loss": 5.1571, "mean_token_accuracy": 0.1822715610265732, "num_tokens": 7965703.0, "step": 3845 }, { "entropy": 5.550517416000366, "epoch": 3.497046796910495, "grad_norm": 1.1953125, "learning_rate": 0.0004157347561071389, "loss": 5.1132, "mean_token_accuracy": 0.19571154564619064, "num_tokens": 7977822.0, "step": 3850 }, { "entropy": 5.465801143646241, "epoch": 3.501590186278964, "grad_norm": 1.1484375, "learning_rate": 0.00041545882515837604, "loss": 5.0358, "mean_token_accuracy": 0.19362603574991227, "num_tokens": 7988318.0, "step": 3855 }, { "entropy": 5.491103267669677, "epoch": 3.506133575647433, "grad_norm": 1.171875, "learning_rate": 0.00041518254764142477, "loss": 5.0062, "mean_token_accuracy": 0.1980455219745636, "num_tokens": 7998076.0, "step": 3860 }, { "entropy": 5.463761329650879, "epoch": 3.510676965015902, "grad_norm": 1.171875, "learning_rate": 0.00041490592423797226, "loss": 5.1176, "mean_token_accuracy": 0.1959502801299095, "num_tokens": 8007913.0, "step": 3865 }, { "entropy": 5.431157064437866, "epoch": 3.515220354384371, "grad_norm": 1.1640625, "learning_rate": 0.0004146289556305594, "loss": 5.0744, "mean_token_accuracy": 0.1907247170805931, "num_tokens": 8018340.0, "step": 3870 }, { "entropy": 5.571393203735352, "epoch": 3.5197637437528395, "grad_norm": 1.21875, "learning_rate": 0.0004143516425025786, "loss": 5.1197, "mean_token_accuracy": 0.1900700196623802, "num_tokens": 8028312.0, "step": 3875 }, { "entropy": 5.578557729721069, "epoch": 3.5243071331213085, "grad_norm": 1.203125, "learning_rate": 0.0004140739855382724, "loss": 5.1481, "mean_token_accuracy": 0.19704046100378036, "num_tokens": 8038580.0, "step": 3880 }, { "entropy": 5.52321343421936, "epoch": 3.5288505224897775, "grad_norm": 1.2578125, "learning_rate": 0.00041379598542273197, "loss": 5.0953, "mean_token_accuracy": 0.19009448140859603, "num_tokens": 8048365.0, "step": 3885 }, { "entropy": 5.478733491897583, "epoch": 3.533393911858246, "grad_norm": 1.1171875, "learning_rate": 0.00041351764284189464, "loss": 5.152, "mean_token_accuracy": 0.18652414083480834, "num_tokens": 8059638.0, "step": 3890 }, { "entropy": 5.55508828163147, "epoch": 3.537937301226715, "grad_norm": 1.1484375, "learning_rate": 0.0004132389584825433, "loss": 5.2175, "mean_token_accuracy": 0.18808463215827942, "num_tokens": 8070993.0, "step": 3895 }, { "entropy": 5.467888402938843, "epoch": 3.542480690595184, "grad_norm": 1.1953125, "learning_rate": 0.00041295993303230383, "loss": 5.0415, "mean_token_accuracy": 0.2027706667780876, "num_tokens": 8081203.0, "step": 3900 }, { "entropy": 5.417987108230591, "epoch": 3.547024079963653, "grad_norm": 1.125, "learning_rate": 0.0004126805671796438, "loss": 5.0529, "mean_token_accuracy": 0.1934710845351219, "num_tokens": 8091564.0, "step": 3905 }, { "entropy": 5.467380571365356, "epoch": 3.551567469332122, "grad_norm": 1.3125, "learning_rate": 0.0004124008616138707, "loss": 5.0387, "mean_token_accuracy": 0.20112892985343933, "num_tokens": 8100675.0, "step": 3910 }, { "entropy": 5.476384687423706, "epoch": 3.5561108587005905, "grad_norm": 1.296875, "learning_rate": 0.00041212081702513015, "loss": 5.0971, "mean_token_accuracy": 0.20031499713659287, "num_tokens": 8110605.0, "step": 3915 }, { "entropy": 5.512406873703003, "epoch": 3.5606542480690595, "grad_norm": 1.171875, "learning_rate": 0.0004118404341044044, "loss": 5.1441, "mean_token_accuracy": 0.19020797908306122, "num_tokens": 8120910.0, "step": 3920 }, { "entropy": 5.500950288772583, "epoch": 3.5651976374375285, "grad_norm": 1.1640625, "learning_rate": 0.00041155971354351034, "loss": 5.0946, "mean_token_accuracy": 0.19211931824684142, "num_tokens": 8131827.0, "step": 3925 }, { "entropy": 5.483038759231567, "epoch": 3.569741026805997, "grad_norm": 1.234375, "learning_rate": 0.00041127865603509815, "loss": 5.0742, "mean_token_accuracy": 0.1954970568418503, "num_tokens": 8141785.0, "step": 3930 }, { "entropy": 5.507791328430176, "epoch": 3.574284416174466, "grad_norm": 1.25, "learning_rate": 0.0004109972622726493, "loss": 5.0858, "mean_token_accuracy": 0.1933991476893425, "num_tokens": 8151732.0, "step": 3935 }, { "entropy": 5.525823974609375, "epoch": 3.578827805542935, "grad_norm": 1.0703125, "learning_rate": 0.00041071553295047485, "loss": 5.1917, "mean_token_accuracy": 0.1891781210899353, "num_tokens": 8162334.0, "step": 3940 }, { "entropy": 5.454549932479859, "epoch": 3.583371194911404, "grad_norm": 1.203125, "learning_rate": 0.0004104334687637139, "loss": 5.0662, "mean_token_accuracy": 0.1937805950641632, "num_tokens": 8172810.0, "step": 3945 }, { "entropy": 5.443389749526977, "epoch": 3.587914584279873, "grad_norm": 1.0546875, "learning_rate": 0.00041015107040833187, "loss": 5.0946, "mean_token_accuracy": 0.19253693670034408, "num_tokens": 8183240.0, "step": 3950 }, { "entropy": 5.505223894119263, "epoch": 3.5924579736483415, "grad_norm": 1.171875, "learning_rate": 0.0004098683385811185, "loss": 5.034, "mean_token_accuracy": 0.19396354407072067, "num_tokens": 8193824.0, "step": 3955 }, { "entropy": 5.459287023544311, "epoch": 3.5970013630168105, "grad_norm": 1.3984375, "learning_rate": 0.00040958527397968666, "loss": 5.0217, "mean_token_accuracy": 0.20360795110464097, "num_tokens": 8203792.0, "step": 3960 }, { "entropy": 5.523562383651734, "epoch": 3.6015447523852795, "grad_norm": 1.1484375, "learning_rate": 0.0004093018773024699, "loss": 5.2223, "mean_token_accuracy": 0.19078201055526733, "num_tokens": 8214436.0, "step": 3965 }, { "entropy": 5.517093276977539, "epoch": 3.606088141753748, "grad_norm": 1.1484375, "learning_rate": 0.0004090181492487215, "loss": 5.0718, "mean_token_accuracy": 0.19075654000043868, "num_tokens": 8224518.0, "step": 3970 }, { "entropy": 5.515325736999512, "epoch": 3.610631531122217, "grad_norm": 1.234375, "learning_rate": 0.00040873409051851223, "loss": 5.2131, "mean_token_accuracy": 0.18362343162298203, "num_tokens": 8235234.0, "step": 3975 }, { "entropy": 5.451943302154541, "epoch": 3.615174920490686, "grad_norm": 1.140625, "learning_rate": 0.0004084497018127286, "loss": 5.1032, "mean_token_accuracy": 0.19037348181009292, "num_tokens": 8246612.0, "step": 3980 }, { "entropy": 5.555245971679687, "epoch": 3.619718309859155, "grad_norm": 1.25, "learning_rate": 0.0004081649838330717, "loss": 5.0575, "mean_token_accuracy": 0.20067218393087388, "num_tokens": 8256720.0, "step": 3985 }, { "entropy": 5.484178972244263, "epoch": 3.624261699227624, "grad_norm": 1.0703125, "learning_rate": 0.00040787993728205464, "loss": 5.1262, "mean_token_accuracy": 0.19589620977640151, "num_tokens": 8267666.0, "step": 3990 }, { "entropy": 5.520815324783325, "epoch": 3.6288050885960925, "grad_norm": 1.25, "learning_rate": 0.00040759456286300154, "loss": 5.0993, "mean_token_accuracy": 0.19454220235347747, "num_tokens": 8277882.0, "step": 3995 }, { "entropy": 5.499479579925537, "epoch": 3.6333484779645615, "grad_norm": 1.3046875, "learning_rate": 0.00040730886128004544, "loss": 5.0191, "mean_token_accuracy": 0.19699462950229646, "num_tokens": 8286968.0, "step": 4000 }, { "epoch": 3.6333484779645615, "eval_entropy": 5.315180792919425, "eval_loss": 5.70609188079834, "eval_mean_token_accuracy": 0.168532062148632, "eval_num_tokens": 8286968.0, "eval_runtime": 2.0048, "eval_samples_per_second": 1713.389, "eval_steps_per_second": 214.485, "step": 4000 } ], "logging_steps": 5, "max_steps": 11000, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1789765102725120.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }