{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.0653893938403191, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742586898803712, "epoch": 0.0003269469692015955, "grad_norm": 4.25, "learning_rate": 2e-06, "loss": 10.7625, "mean_token_accuracy": 8.849557489156722e-05, "num_tokens": 9940.0, "step": 5 }, { "entropy": 10.74257230758667, "epoch": 0.000653893938403191, "grad_norm": 4.1875, "learning_rate": 4.5e-06, "loss": 10.75, "mean_token_accuracy": 0.0, "num_tokens": 19783.0, "step": 10 }, { "entropy": 10.742555141448975, "epoch": 0.0009808409076047864, "grad_norm": 4.625, "learning_rate": 7e-06, "loss": 10.7384, "mean_token_accuracy": 0.0, "num_tokens": 30189.0, "step": 15 }, { "entropy": 10.742575740814209, "epoch": 0.001307787876806382, "grad_norm": 4.1875, "learning_rate": 9.5e-06, "loss": 10.7067, "mean_token_accuracy": 0.0007516760495491325, "num_tokens": 40463.0, "step": 20 }, { "entropy": 10.742465591430664, "epoch": 0.0016347348460079775, "grad_norm": 4.03125, "learning_rate": 1.2e-05, "loss": 10.6408, "mean_token_accuracy": 0.010044214146910235, "num_tokens": 50919.0, "step": 25 }, { "entropy": 10.742095851898194, "epoch": 0.001961681815209573, "grad_norm": 3.578125, "learning_rate": 1.4500000000000002e-05, "loss": 10.5408, "mean_token_accuracy": 0.027823284920305013, "num_tokens": 61272.0, "step": 30 }, { "entropy": 10.740856456756593, "epoch": 0.0022886287844111684, "grad_norm": 3.078125, "learning_rate": 1.7000000000000003e-05, "loss": 10.4323, "mean_token_accuracy": 0.03470553252846002, "num_tokens": 70877.0, "step": 35 }, { "entropy": 10.73651065826416, "epoch": 0.002615575753612764, "grad_norm": 2.59375, "learning_rate": 1.95e-05, "loss": 10.3205, "mean_token_accuracy": 0.040680671110749245, "num_tokens": 80600.0, "step": 40 }, { "entropy": 10.727530670166015, "epoch": 0.0029425227228143595, "grad_norm": 2.046875, "learning_rate": 2.2e-05, "loss": 10.2476, "mean_token_accuracy": 0.03953301161527634, "num_tokens": 91002.0, "step": 45 }, { "entropy": 10.717786026000976, "epoch": 0.003269469692015955, "grad_norm": 1.921875, "learning_rate": 2.4500000000000003e-05, "loss": 10.1594, "mean_token_accuracy": 0.04255215115845203, "num_tokens": 101156.0, "step": 50 }, { "entropy": 10.710540103912354, "epoch": 0.0035964166612175506, "grad_norm": 1.859375, "learning_rate": 2.7e-05, "loss": 10.1182, "mean_token_accuracy": 0.04170279260724783, "num_tokens": 111896.0, "step": 55 }, { "entropy": 10.705566215515137, "epoch": 0.003923363630419146, "grad_norm": 1.8515625, "learning_rate": 2.95e-05, "loss": 9.9881, "mean_token_accuracy": 0.04833919741213322, "num_tokens": 120899.0, "step": 60 }, { "entropy": 10.698173141479492, "epoch": 0.004250310599620741, "grad_norm": 1.609375, "learning_rate": 3.2e-05, "loss": 10.0328, "mean_token_accuracy": 0.04022225625813007, "num_tokens": 131504.0, "step": 65 }, { "entropy": 10.691369152069091, "epoch": 0.004577257568822337, "grad_norm": 1.7890625, "learning_rate": 3.4500000000000005e-05, "loss": 9.9577, "mean_token_accuracy": 0.04434355236589908, "num_tokens": 142365.0, "step": 70 }, { "entropy": 10.686608409881591, "epoch": 0.004904204538023932, "grad_norm": 1.5625, "learning_rate": 3.7e-05, "loss": 9.9256, "mean_token_accuracy": 0.041293222457170486, "num_tokens": 153481.0, "step": 75 }, { "entropy": 10.679593467712403, "epoch": 0.005231151507225528, "grad_norm": 1.5859375, "learning_rate": 3.95e-05, "loss": 9.8544, "mean_token_accuracy": 0.041375156864523886, "num_tokens": 163941.0, "step": 80 }, { "entropy": 10.669306468963622, "epoch": 0.0055580984764271235, "grad_norm": 1.421875, "learning_rate": 4.2000000000000004e-05, "loss": 9.7936, "mean_token_accuracy": 0.04275329895317555, "num_tokens": 173992.0, "step": 85 }, { "entropy": 10.655621910095215, "epoch": 0.005885045445628719, "grad_norm": 1.515625, "learning_rate": 4.45e-05, "loss": 9.7624, "mean_token_accuracy": 0.0399011442437768, "num_tokens": 184474.0, "step": 90 }, { "entropy": 10.642310905456544, "epoch": 0.006211992414830315, "grad_norm": 1.3359375, "learning_rate": 4.7000000000000004e-05, "loss": 9.7029, "mean_token_accuracy": 0.0412175253033638, "num_tokens": 194998.0, "step": 95 }, { "entropy": 10.629393005371094, "epoch": 0.00653893938403191, "grad_norm": 1.671875, "learning_rate": 4.9500000000000004e-05, "loss": 9.5401, "mean_token_accuracy": 0.05521246679127216, "num_tokens": 203327.0, "step": 100 }, { "entropy": 10.600548839569091, "epoch": 0.006865886353233506, "grad_norm": 1.3828125, "learning_rate": 5.2e-05, "loss": 9.5267, "mean_token_accuracy": 0.05421698726713657, "num_tokens": 213921.0, "step": 105 }, { "entropy": 10.55351276397705, "epoch": 0.007192833322435101, "grad_norm": 1.4609375, "learning_rate": 5.45e-05, "loss": 9.4417, "mean_token_accuracy": 0.05835340581834316, "num_tokens": 225790.0, "step": 110 }, { "entropy": 10.493978023529053, "epoch": 0.007519780291636697, "grad_norm": 1.4765625, "learning_rate": 5.7e-05, "loss": 9.3301, "mean_token_accuracy": 0.056574657931923865, "num_tokens": 235689.0, "step": 115 }, { "entropy": 10.437990379333495, "epoch": 0.007846727260838291, "grad_norm": 1.3046875, "learning_rate": 5.9499999999999996e-05, "loss": 9.2562, "mean_token_accuracy": 0.054686100035905835, "num_tokens": 246525.0, "step": 120 }, { "entropy": 10.380927467346192, "epoch": 0.008173674230039887, "grad_norm": 1.2109375, "learning_rate": 6.2e-05, "loss": 9.1809, "mean_token_accuracy": 0.056523428112268445, "num_tokens": 256642.0, "step": 125 }, { "entropy": 10.325669860839843, "epoch": 0.008500621199241483, "grad_norm": 1.171875, "learning_rate": 6.450000000000001e-05, "loss": 9.1399, "mean_token_accuracy": 0.052699505165219304, "num_tokens": 268145.0, "step": 130 }, { "entropy": 10.2711612701416, "epoch": 0.008827568168443078, "grad_norm": 1.1484375, "learning_rate": 6.7e-05, "loss": 9.02, "mean_token_accuracy": 0.050835156068205836, "num_tokens": 279783.0, "step": 135 }, { "entropy": 10.188286304473877, "epoch": 0.009154515137644674, "grad_norm": 1.0546875, "learning_rate": 6.950000000000001e-05, "loss": 8.9063, "mean_token_accuracy": 0.05600942634046078, "num_tokens": 289723.0, "step": 140 }, { "entropy": 10.073064708709717, "epoch": 0.00948146210684627, "grad_norm": 1.0703125, "learning_rate": 7.2e-05, "loss": 8.8015, "mean_token_accuracy": 0.05663799084722996, "num_tokens": 300002.0, "step": 145 }, { "entropy": 9.98648281097412, "epoch": 0.009808409076047865, "grad_norm": 0.93359375, "learning_rate": 7.45e-05, "loss": 8.777, "mean_token_accuracy": 0.05806488022208214, "num_tokens": 310041.0, "step": 150 }, { "entropy": 9.891202545166015, "epoch": 0.01013535604524946, "grad_norm": 0.9375, "learning_rate": 7.7e-05, "loss": 8.6997, "mean_token_accuracy": 0.05627730451524258, "num_tokens": 321469.0, "step": 155 }, { "entropy": 9.748745250701905, "epoch": 0.010462303014451056, "grad_norm": 0.8671875, "learning_rate": 7.950000000000001e-05, "loss": 8.5702, "mean_token_accuracy": 0.05877697579562664, "num_tokens": 330796.0, "step": 160 }, { "entropy": 9.617728519439698, "epoch": 0.010789249983652651, "grad_norm": 0.953125, "learning_rate": 8.2e-05, "loss": 8.5724, "mean_token_accuracy": 0.05753467902541161, "num_tokens": 341402.0, "step": 165 }, { "entropy": 9.483910274505615, "epoch": 0.011116196952854247, "grad_norm": 0.95703125, "learning_rate": 8.450000000000001e-05, "loss": 8.5709, "mean_token_accuracy": 0.058061816915869716, "num_tokens": 351717.0, "step": 170 }, { "entropy": 9.382616806030274, "epoch": 0.011443143922055843, "grad_norm": 0.9375, "learning_rate": 8.7e-05, "loss": 8.4663, "mean_token_accuracy": 0.057271933555603026, "num_tokens": 361787.0, "step": 175 }, { "entropy": 9.258338737487794, "epoch": 0.011770090891257438, "grad_norm": 0.82421875, "learning_rate": 8.95e-05, "loss": 8.4114, "mean_token_accuracy": 0.05387798622250557, "num_tokens": 371827.0, "step": 180 }, { "entropy": 9.150267505645752, "epoch": 0.012097037860459034, "grad_norm": 0.84765625, "learning_rate": 9.2e-05, "loss": 8.4122, "mean_token_accuracy": 0.06042315401136875, "num_tokens": 382150.0, "step": 185 }, { "entropy": 9.016548824310302, "epoch": 0.01242398482966063, "grad_norm": 0.875, "learning_rate": 9.45e-05, "loss": 8.3316, "mean_token_accuracy": 0.06260293386876584, "num_tokens": 392151.0, "step": 190 }, { "entropy": 8.979074478149414, "epoch": 0.012750931798862225, "grad_norm": 0.8671875, "learning_rate": 9.7e-05, "loss": 8.3421, "mean_token_accuracy": 0.057670443505048755, "num_tokens": 402779.0, "step": 195 }, { "entropy": 8.890014362335204, "epoch": 0.01307787876806382, "grad_norm": 0.7265625, "learning_rate": 9.95e-05, "loss": 8.3466, "mean_token_accuracy": 0.06248428300023079, "num_tokens": 413500.0, "step": 200 }, { "entropy": 8.904778671264648, "epoch": 0.013404825737265416, "grad_norm": 0.8984375, "learning_rate": 0.000102, "loss": 8.2835, "mean_token_accuracy": 0.06201527528464794, "num_tokens": 423054.0, "step": 205 }, { "entropy": 8.856226634979247, "epoch": 0.013731772706467011, "grad_norm": 0.8203125, "learning_rate": 0.00010449999999999999, "loss": 8.3133, "mean_token_accuracy": 0.05689386166632175, "num_tokens": 433002.0, "step": 210 }, { "entropy": 8.779247093200684, "epoch": 0.014058719675668607, "grad_norm": 0.72265625, "learning_rate": 0.000107, "loss": 8.295, "mean_token_accuracy": 0.05818233527243137, "num_tokens": 443492.0, "step": 215 }, { "entropy": 8.777221393585204, "epoch": 0.014385666644870202, "grad_norm": 0.796875, "learning_rate": 0.0001095, "loss": 8.3091, "mean_token_accuracy": 0.062193362042307854, "num_tokens": 453001.0, "step": 220 }, { "entropy": 8.772535514831542, "epoch": 0.014712613614071798, "grad_norm": 0.859375, "learning_rate": 0.000112, "loss": 8.2306, "mean_token_accuracy": 0.06282332614064216, "num_tokens": 462916.0, "step": 225 }, { "entropy": 8.702757263183594, "epoch": 0.015039560583273394, "grad_norm": 0.75390625, "learning_rate": 0.0001145, "loss": 8.2694, "mean_token_accuracy": 0.060815002769231796, "num_tokens": 473549.0, "step": 230 }, { "entropy": 8.745165348052979, "epoch": 0.015366507552474989, "grad_norm": 0.8046875, "learning_rate": 0.00011700000000000001, "loss": 8.2862, "mean_token_accuracy": 0.05802113525569439, "num_tokens": 484472.0, "step": 235 }, { "entropy": 8.76063575744629, "epoch": 0.015693454521676583, "grad_norm": 1.03125, "learning_rate": 0.00011949999999999999, "loss": 8.2251, "mean_token_accuracy": 0.06674037426710129, "num_tokens": 494202.0, "step": 240 }, { "entropy": 8.625239944458007, "epoch": 0.01602040149087818, "grad_norm": 0.78515625, "learning_rate": 0.000122, "loss": 8.1602, "mean_token_accuracy": 0.0650412030518055, "num_tokens": 504635.0, "step": 245 }, { "entropy": 8.66549301147461, "epoch": 0.016347348460079774, "grad_norm": 0.9921875, "learning_rate": 0.0001245, "loss": 8.1881, "mean_token_accuracy": 0.0613247200846672, "num_tokens": 514423.0, "step": 250 }, { "entropy": 8.592597770690919, "epoch": 0.01667429542928137, "grad_norm": 0.82421875, "learning_rate": 0.000127, "loss": 8.2256, "mean_token_accuracy": 0.06521738171577454, "num_tokens": 525820.0, "step": 255 }, { "entropy": 8.587825107574464, "epoch": 0.017001242398482965, "grad_norm": 0.7734375, "learning_rate": 0.0001295, "loss": 8.1931, "mean_token_accuracy": 0.06806896105408669, "num_tokens": 536732.0, "step": 260 }, { "entropy": 8.599881744384765, "epoch": 0.01732818936768456, "grad_norm": 1.140625, "learning_rate": 0.000132, "loss": 8.1843, "mean_token_accuracy": 0.06989322565495967, "num_tokens": 546230.0, "step": 265 }, { "entropy": 8.689265823364257, "epoch": 0.017655136336886156, "grad_norm": 0.953125, "learning_rate": 0.00013450000000000002, "loss": 8.1967, "mean_token_accuracy": 0.0643424428999424, "num_tokens": 556078.0, "step": 270 }, { "entropy": 8.557295227050782, "epoch": 0.017982083306087752, "grad_norm": 0.87890625, "learning_rate": 0.00013700000000000002, "loss": 8.178, "mean_token_accuracy": 0.06810705624520778, "num_tokens": 565385.0, "step": 275 }, { "entropy": 8.595024585723877, "epoch": 0.018309030275289347, "grad_norm": 0.96875, "learning_rate": 0.0001395, "loss": 8.237, "mean_token_accuracy": 0.0639534905552864, "num_tokens": 576066.0, "step": 280 }, { "entropy": 8.57234001159668, "epoch": 0.018635977244490943, "grad_norm": 1.0, "learning_rate": 0.00014199999999999998, "loss": 8.1585, "mean_token_accuracy": 0.0638256598263979, "num_tokens": 587472.0, "step": 285 }, { "entropy": 8.60384578704834, "epoch": 0.01896292421369254, "grad_norm": 0.8828125, "learning_rate": 0.0001445, "loss": 8.1544, "mean_token_accuracy": 0.06674780026078224, "num_tokens": 597400.0, "step": 290 }, { "entropy": 8.587763404846191, "epoch": 0.019289871182894134, "grad_norm": 0.953125, "learning_rate": 0.000147, "loss": 8.2128, "mean_token_accuracy": 0.06767871156334877, "num_tokens": 606856.0, "step": 295 }, { "entropy": 8.573587322235108, "epoch": 0.01961681815209573, "grad_norm": 0.83984375, "learning_rate": 0.0001495, "loss": 8.1472, "mean_token_accuracy": 0.07218570187687874, "num_tokens": 617209.0, "step": 300 }, { "entropy": 8.5530442237854, "epoch": 0.019943765121297325, "grad_norm": 0.87109375, "learning_rate": 0.000152, "loss": 8.153, "mean_token_accuracy": 0.07159969210624695, "num_tokens": 626826.0, "step": 305 }, { "entropy": 8.517343521118164, "epoch": 0.02027071209049892, "grad_norm": 0.9921875, "learning_rate": 0.00015450000000000001, "loss": 8.1166, "mean_token_accuracy": 0.07488984875380993, "num_tokens": 636836.0, "step": 310 }, { "entropy": 8.550188350677491, "epoch": 0.020597659059700516, "grad_norm": 0.89453125, "learning_rate": 0.000157, "loss": 8.2061, "mean_token_accuracy": 0.06659409068524838, "num_tokens": 648177.0, "step": 315 }, { "entropy": 8.58387565612793, "epoch": 0.02092460602890211, "grad_norm": 0.87109375, "learning_rate": 0.0001595, "loss": 8.1801, "mean_token_accuracy": 0.06891246885061264, "num_tokens": 658365.0, "step": 320 }, { "entropy": 8.48437042236328, "epoch": 0.021251552998103707, "grad_norm": 1.7890625, "learning_rate": 0.000162, "loss": 8.0879, "mean_token_accuracy": 0.06931497268378735, "num_tokens": 668980.0, "step": 325 }, { "entropy": 8.547167491912841, "epoch": 0.021578499967305303, "grad_norm": 0.984375, "learning_rate": 0.00016450000000000001, "loss": 8.1331, "mean_token_accuracy": 0.07338778600096703, "num_tokens": 679406.0, "step": 330 }, { "entropy": 8.523040771484375, "epoch": 0.0219054469365069, "grad_norm": 0.953125, "learning_rate": 0.00016700000000000002, "loss": 8.0915, "mean_token_accuracy": 0.07461029291152954, "num_tokens": 689871.0, "step": 335 }, { "entropy": 8.489326858520508, "epoch": 0.022232393905708494, "grad_norm": 1.09375, "learning_rate": 0.00016950000000000003, "loss": 8.0457, "mean_token_accuracy": 0.07580887749791146, "num_tokens": 700969.0, "step": 340 }, { "entropy": 8.469206142425538, "epoch": 0.02255934087491009, "grad_norm": 0.8828125, "learning_rate": 0.00017199999999999998, "loss": 8.0714, "mean_token_accuracy": 0.07064862996339798, "num_tokens": 711153.0, "step": 345 }, { "entropy": 8.425196266174316, "epoch": 0.022886287844111685, "grad_norm": 0.83984375, "learning_rate": 0.00017449999999999999, "loss": 8.0605, "mean_token_accuracy": 0.07229152098298072, "num_tokens": 721475.0, "step": 350 }, { "entropy": 8.458955097198487, "epoch": 0.02321323481331328, "grad_norm": 0.890625, "learning_rate": 0.000177, "loss": 8.1029, "mean_token_accuracy": 0.07589908726513386, "num_tokens": 732823.0, "step": 355 }, { "entropy": 8.45833330154419, "epoch": 0.023540181782514876, "grad_norm": 0.91796875, "learning_rate": 0.0001795, "loss": 8.0594, "mean_token_accuracy": 0.07507128641009331, "num_tokens": 743853.0, "step": 360 }, { "entropy": 8.486702823638916, "epoch": 0.02386712875171647, "grad_norm": 0.94140625, "learning_rate": 0.000182, "loss": 8.1181, "mean_token_accuracy": 0.07701903395354748, "num_tokens": 754579.0, "step": 365 }, { "entropy": 8.394766998291015, "epoch": 0.024194075720918067, "grad_norm": 1.0703125, "learning_rate": 0.0001845, "loss": 8.0894, "mean_token_accuracy": 0.07040258683264256, "num_tokens": 764836.0, "step": 370 }, { "entropy": 8.46137580871582, "epoch": 0.024521022690119663, "grad_norm": 0.87890625, "learning_rate": 0.000187, "loss": 8.0219, "mean_token_accuracy": 0.07322987243533134, "num_tokens": 773961.0, "step": 375 }, { "entropy": 8.43176326751709, "epoch": 0.02484796965932126, "grad_norm": 1.0625, "learning_rate": 0.0001895, "loss": 7.9916, "mean_token_accuracy": 0.0786767140030861, "num_tokens": 784331.0, "step": 380 }, { "entropy": 8.325694942474366, "epoch": 0.025174916628522854, "grad_norm": 1.1171875, "learning_rate": 0.000192, "loss": 7.9694, "mean_token_accuracy": 0.07703853137791157, "num_tokens": 794724.0, "step": 385 }, { "entropy": 8.46515941619873, "epoch": 0.02550186359772445, "grad_norm": 0.9921875, "learning_rate": 0.0001945, "loss": 7.984, "mean_token_accuracy": 0.0744760014116764, "num_tokens": 804680.0, "step": 390 }, { "entropy": 8.296853351593018, "epoch": 0.025828810566926045, "grad_norm": 1.0078125, "learning_rate": 0.00019700000000000002, "loss": 7.9805, "mean_token_accuracy": 0.07433952577412128, "num_tokens": 815066.0, "step": 395 }, { "entropy": 8.427121257781982, "epoch": 0.02615575753612764, "grad_norm": 1.0546875, "learning_rate": 0.00019950000000000002, "loss": 7.9862, "mean_token_accuracy": 0.07774959728121758, "num_tokens": 824958.0, "step": 400 }, { "entropy": 8.403383159637452, "epoch": 0.026482704505329236, "grad_norm": 0.93359375, "learning_rate": 0.000202, "loss": 8.0499, "mean_token_accuracy": 0.07819209098815919, "num_tokens": 835128.0, "step": 405 }, { "entropy": 8.332460689544678, "epoch": 0.02680965147453083, "grad_norm": 0.78515625, "learning_rate": 0.00020449999999999998, "loss": 7.9763, "mean_token_accuracy": 0.07198684960603714, "num_tokens": 844590.0, "step": 410 }, { "entropy": 8.386160278320313, "epoch": 0.027136598443732427, "grad_norm": 0.9296875, "learning_rate": 0.000207, "loss": 7.9597, "mean_token_accuracy": 0.07920237854123116, "num_tokens": 854914.0, "step": 415 }, { "entropy": 8.396887683868409, "epoch": 0.027463545412934023, "grad_norm": 0.953125, "learning_rate": 0.0002095, "loss": 7.9929, "mean_token_accuracy": 0.0751864355057478, "num_tokens": 866171.0, "step": 420 }, { "entropy": 8.301899719238282, "epoch": 0.027790492382135618, "grad_norm": 0.94140625, "learning_rate": 0.000212, "loss": 7.9806, "mean_token_accuracy": 0.07633630074560642, "num_tokens": 876603.0, "step": 425 }, { "entropy": 8.322303676605225, "epoch": 0.028117439351337214, "grad_norm": 0.99609375, "learning_rate": 0.0002145, "loss": 7.913, "mean_token_accuracy": 0.07756362929940223, "num_tokens": 887124.0, "step": 430 }, { "entropy": 8.30418529510498, "epoch": 0.02844438632053881, "grad_norm": 1.609375, "learning_rate": 0.00021700000000000002, "loss": 7.9104, "mean_token_accuracy": 0.08119071945548058, "num_tokens": 897275.0, "step": 435 }, { "entropy": 8.311804008483886, "epoch": 0.028771333289740405, "grad_norm": 0.9140625, "learning_rate": 0.0002195, "loss": 7.8925, "mean_token_accuracy": 0.08083942905068398, "num_tokens": 907174.0, "step": 440 }, { "entropy": 8.347180366516113, "epoch": 0.029098280258942, "grad_norm": 1.015625, "learning_rate": 0.000222, "loss": 7.8892, "mean_token_accuracy": 0.08076051622629166, "num_tokens": 917126.0, "step": 445 }, { "entropy": 8.24964075088501, "epoch": 0.029425227228143596, "grad_norm": 0.94921875, "learning_rate": 0.0002245, "loss": 7.8899, "mean_token_accuracy": 0.08073717057704925, "num_tokens": 926758.0, "step": 450 }, { "entropy": 8.3399188041687, "epoch": 0.02975217419734519, "grad_norm": 0.90234375, "learning_rate": 0.00022700000000000002, "loss": 7.8954, "mean_token_accuracy": 0.08044968619942665, "num_tokens": 936973.0, "step": 455 }, { "entropy": 8.194979095458985, "epoch": 0.030079121166546787, "grad_norm": 0.9453125, "learning_rate": 0.00022950000000000002, "loss": 7.8588, "mean_token_accuracy": 0.07642363831400871, "num_tokens": 946845.0, "step": 460 }, { "entropy": 8.322082328796387, "epoch": 0.030406068135748383, "grad_norm": 1.0390625, "learning_rate": 0.00023200000000000003, "loss": 7.8846, "mean_token_accuracy": 0.08190244510769844, "num_tokens": 956904.0, "step": 465 }, { "entropy": 8.182524299621582, "epoch": 0.030733015104949978, "grad_norm": 1.0625, "learning_rate": 0.00023449999999999998, "loss": 7.8873, "mean_token_accuracy": 0.07898930385708809, "num_tokens": 966133.0, "step": 470 }, { "entropy": 8.294102954864503, "epoch": 0.031059962074151574, "grad_norm": 1.0234375, "learning_rate": 0.000237, "loss": 7.926, "mean_token_accuracy": 0.07419689372181892, "num_tokens": 976889.0, "step": 475 }, { "entropy": 8.3031400680542, "epoch": 0.031386909043353166, "grad_norm": 0.96875, "learning_rate": 0.0002395, "loss": 7.9145, "mean_token_accuracy": 0.081867391243577, "num_tokens": 987385.0, "step": 480 }, { "entropy": 8.210045433044433, "epoch": 0.03171385601255476, "grad_norm": 0.93359375, "learning_rate": 0.000242, "loss": 7.885, "mean_token_accuracy": 0.07997245490550994, "num_tokens": 998116.0, "step": 485 }, { "entropy": 8.263574028015137, "epoch": 0.03204080298175636, "grad_norm": 0.984375, "learning_rate": 0.0002445, "loss": 7.8633, "mean_token_accuracy": 0.0772053673863411, "num_tokens": 1007412.0, "step": 490 }, { "entropy": 8.196787071228027, "epoch": 0.03236774995095795, "grad_norm": 1.0390625, "learning_rate": 0.000247, "loss": 7.8959, "mean_token_accuracy": 0.07670100852847099, "num_tokens": 1016843.0, "step": 495 }, { "entropy": 8.263703727722168, "epoch": 0.03269469692015955, "grad_norm": 1.0546875, "learning_rate": 0.0002495, "loss": 7.8932, "mean_token_accuracy": 0.0816141352057457, "num_tokens": 1027285.0, "step": 500 }, { "entropy": 8.315560626983643, "epoch": 0.033021643889361144, "grad_norm": 0.93359375, "learning_rate": 0.000252, "loss": 7.9129, "mean_token_accuracy": 0.07733861021697522, "num_tokens": 1038229.0, "step": 505 }, { "entropy": 8.19995927810669, "epoch": 0.03334859085856274, "grad_norm": 1.0, "learning_rate": 0.0002545, "loss": 7.8173, "mean_token_accuracy": 0.08648264184594154, "num_tokens": 1048588.0, "step": 510 }, { "entropy": 8.15983600616455, "epoch": 0.033675537827764335, "grad_norm": 0.890625, "learning_rate": 0.000257, "loss": 7.8125, "mean_token_accuracy": 0.08071680292487145, "num_tokens": 1058302.0, "step": 515 }, { "entropy": 8.201696968078613, "epoch": 0.03400248479696593, "grad_norm": 0.9609375, "learning_rate": 0.0002595, "loss": 7.8705, "mean_token_accuracy": 0.07824076637625695, "num_tokens": 1068180.0, "step": 520 }, { "entropy": 8.246702861785888, "epoch": 0.034329431766167526, "grad_norm": 0.953125, "learning_rate": 0.000262, "loss": 7.8135, "mean_token_accuracy": 0.07984001114964485, "num_tokens": 1078647.0, "step": 525 }, { "entropy": 8.176792621612549, "epoch": 0.03465637873536912, "grad_norm": 1.078125, "learning_rate": 0.00026450000000000003, "loss": 7.7095, "mean_token_accuracy": 0.08637883439660073, "num_tokens": 1090037.0, "step": 530 }, { "entropy": 8.036486196517945, "epoch": 0.03498332570457072, "grad_norm": 0.9375, "learning_rate": 0.00026700000000000004, "loss": 7.8181, "mean_token_accuracy": 0.08294081911444665, "num_tokens": 1099809.0, "step": 535 }, { "entropy": 8.157017517089844, "epoch": 0.03531027267377231, "grad_norm": 1.15625, "learning_rate": 0.00026950000000000005, "loss": 7.7552, "mean_token_accuracy": 0.08437421098351479, "num_tokens": 1108856.0, "step": 540 }, { "entropy": 8.248639392852784, "epoch": 0.03563721964297391, "grad_norm": 0.98046875, "learning_rate": 0.00027200000000000005, "loss": 7.7652, "mean_token_accuracy": 0.08347450718283653, "num_tokens": 1119164.0, "step": 545 }, { "entropy": 8.060407495498657, "epoch": 0.035964166612175504, "grad_norm": 0.98046875, "learning_rate": 0.0002745, "loss": 7.788, "mean_token_accuracy": 0.0814676571637392, "num_tokens": 1128977.0, "step": 550 }, { "entropy": 8.216267108917236, "epoch": 0.0362911135813771, "grad_norm": 0.94140625, "learning_rate": 0.000277, "loss": 7.827, "mean_token_accuracy": 0.08007606342434884, "num_tokens": 1140827.0, "step": 555 }, { "entropy": 8.115639066696167, "epoch": 0.036618060550578695, "grad_norm": 0.9609375, "learning_rate": 0.0002795, "loss": 7.6981, "mean_token_accuracy": 0.08105813413858413, "num_tokens": 1151525.0, "step": 560 }, { "entropy": 8.096070718765258, "epoch": 0.03694500751978029, "grad_norm": 0.94140625, "learning_rate": 0.00028199999999999997, "loss": 7.7659, "mean_token_accuracy": 0.0801615871489048, "num_tokens": 1162557.0, "step": 565 }, { "entropy": 8.272269105911255, "epoch": 0.037271954488981886, "grad_norm": 1.28125, "learning_rate": 0.0002845, "loss": 7.8655, "mean_token_accuracy": 0.0812660314142704, "num_tokens": 1173589.0, "step": 570 }, { "entropy": 7.993625926971435, "epoch": 0.03759890145818348, "grad_norm": 1.03125, "learning_rate": 0.000287, "loss": 7.6448, "mean_token_accuracy": 0.0930643081665039, "num_tokens": 1182068.0, "step": 575 }, { "entropy": 8.123176193237304, "epoch": 0.03792584842738508, "grad_norm": 0.93359375, "learning_rate": 0.0002895, "loss": 7.7248, "mean_token_accuracy": 0.08427192792296409, "num_tokens": 1191760.0, "step": 580 }, { "entropy": 8.065930366516113, "epoch": 0.03825279539658667, "grad_norm": 1.046875, "learning_rate": 0.000292, "loss": 7.7145, "mean_token_accuracy": 0.08952126577496529, "num_tokens": 1201397.0, "step": 585 }, { "entropy": 8.175276947021484, "epoch": 0.03857974236578827, "grad_norm": 1.140625, "learning_rate": 0.0002945, "loss": 7.8633, "mean_token_accuracy": 0.07741808891296387, "num_tokens": 1213112.0, "step": 590 }, { "entropy": 8.114381551742554, "epoch": 0.038906689334989863, "grad_norm": 1.0234375, "learning_rate": 0.000297, "loss": 7.7115, "mean_token_accuracy": 0.08719457574188709, "num_tokens": 1223467.0, "step": 595 }, { "entropy": 8.07209553718567, "epoch": 0.03923363630419146, "grad_norm": 1.03125, "learning_rate": 0.0002995, "loss": 7.7887, "mean_token_accuracy": 0.08414009809494019, "num_tokens": 1233608.0, "step": 600 }, { "entropy": 8.15817494392395, "epoch": 0.039560583273393055, "grad_norm": 1.203125, "learning_rate": 0.000302, "loss": 7.7517, "mean_token_accuracy": 0.08470566123723984, "num_tokens": 1244046.0, "step": 605 }, { "entropy": 8.089786720275878, "epoch": 0.03988753024259465, "grad_norm": 0.9765625, "learning_rate": 0.0003045, "loss": 7.7143, "mean_token_accuracy": 0.08831590861082077, "num_tokens": 1254695.0, "step": 610 }, { "entropy": 8.062639665603637, "epoch": 0.040214477211796246, "grad_norm": 0.94921875, "learning_rate": 0.000307, "loss": 7.8058, "mean_token_accuracy": 0.0846620962023735, "num_tokens": 1265154.0, "step": 615 }, { "entropy": 7.999152088165284, "epoch": 0.04054142418099784, "grad_norm": 1.0546875, "learning_rate": 0.0003095, "loss": 7.5586, "mean_token_accuracy": 0.09302469715476036, "num_tokens": 1275886.0, "step": 620 }, { "entropy": 8.077780294418336, "epoch": 0.04086837115019944, "grad_norm": 1.0234375, "learning_rate": 0.000312, "loss": 7.6857, "mean_token_accuracy": 0.08044563606381416, "num_tokens": 1287480.0, "step": 625 }, { "entropy": 7.958800745010376, "epoch": 0.04119531811940103, "grad_norm": 1.2578125, "learning_rate": 0.0003145, "loss": 7.6402, "mean_token_accuracy": 0.09090114459395408, "num_tokens": 1298112.0, "step": 630 }, { "entropy": 8.146269941329956, "epoch": 0.04152226508860263, "grad_norm": 0.99609375, "learning_rate": 0.000317, "loss": 7.6705, "mean_token_accuracy": 0.08611384108662605, "num_tokens": 1307467.0, "step": 635 }, { "entropy": 8.024405574798584, "epoch": 0.04184921205780422, "grad_norm": 1.109375, "learning_rate": 0.0003195, "loss": 7.6882, "mean_token_accuracy": 0.08413859084248543, "num_tokens": 1317672.0, "step": 640 }, { "entropy": 8.048227167129516, "epoch": 0.04217615902700582, "grad_norm": 1.1015625, "learning_rate": 0.000322, "loss": 7.6523, "mean_token_accuracy": 0.08553169891238213, "num_tokens": 1327356.0, "step": 645 }, { "entropy": 8.040998649597167, "epoch": 0.042503105996207415, "grad_norm": 1.140625, "learning_rate": 0.00032450000000000003, "loss": 7.6329, "mean_token_accuracy": 0.08936409875750542, "num_tokens": 1337102.0, "step": 650 }, { "entropy": 8.004605197906494, "epoch": 0.04283005296540901, "grad_norm": 1.109375, "learning_rate": 0.00032700000000000003, "loss": 7.6034, "mean_token_accuracy": 0.09400570839643478, "num_tokens": 1347838.0, "step": 655 }, { "entropy": 7.966688394546509, "epoch": 0.043156999934610606, "grad_norm": 0.98828125, "learning_rate": 0.00032950000000000004, "loss": 7.5846, "mean_token_accuracy": 0.09314541071653366, "num_tokens": 1358215.0, "step": 660 }, { "entropy": 7.922552871704101, "epoch": 0.0434839469038122, "grad_norm": 0.94140625, "learning_rate": 0.00033200000000000005, "loss": 7.6095, "mean_token_accuracy": 0.09053045958280563, "num_tokens": 1368600.0, "step": 665 }, { "entropy": 7.916740226745605, "epoch": 0.0438108938730138, "grad_norm": 0.8984375, "learning_rate": 0.00033450000000000005, "loss": 7.608, "mean_token_accuracy": 0.08972380161285401, "num_tokens": 1379346.0, "step": 670 }, { "entropy": 8.029254817962647, "epoch": 0.04413784084221539, "grad_norm": 1.5078125, "learning_rate": 0.000337, "loss": 7.6048, "mean_token_accuracy": 0.09548353776335716, "num_tokens": 1388576.0, "step": 675 }, { "entropy": 7.907731389999389, "epoch": 0.04446478781141699, "grad_norm": 1.1171875, "learning_rate": 0.0003395, "loss": 7.5208, "mean_token_accuracy": 0.09327051714062691, "num_tokens": 1397992.0, "step": 680 }, { "entropy": 7.827389192581177, "epoch": 0.04479173478061858, "grad_norm": 0.94140625, "learning_rate": 0.000342, "loss": 7.5773, "mean_token_accuracy": 0.09289861097931862, "num_tokens": 1408456.0, "step": 685 }, { "entropy": 8.055600452423096, "epoch": 0.04511868174982018, "grad_norm": 0.94921875, "learning_rate": 0.00034449999999999997, "loss": 7.5757, "mean_token_accuracy": 0.09378794878721237, "num_tokens": 1418993.0, "step": 690 }, { "entropy": 7.86663031578064, "epoch": 0.045445628719021774, "grad_norm": 1.3984375, "learning_rate": 0.000347, "loss": 7.5939, "mean_token_accuracy": 0.08710445463657379, "num_tokens": 1429460.0, "step": 695 }, { "entropy": 7.8636171340942385, "epoch": 0.04577257568822337, "grad_norm": 0.9765625, "learning_rate": 0.0003495, "loss": 7.5391, "mean_token_accuracy": 0.09019159972667694, "num_tokens": 1440192.0, "step": 700 }, { "entropy": 7.97906084060669, "epoch": 0.046099522657424966, "grad_norm": 1.015625, "learning_rate": 0.000352, "loss": 7.6342, "mean_token_accuracy": 0.0882492907345295, "num_tokens": 1450249.0, "step": 705 }, { "entropy": 7.911261796951294, "epoch": 0.04642646962662656, "grad_norm": 0.953125, "learning_rate": 0.0003545, "loss": 7.5229, "mean_token_accuracy": 0.0945440374314785, "num_tokens": 1460206.0, "step": 710 }, { "entropy": 7.852111196517944, "epoch": 0.04675341659582816, "grad_norm": 0.9453125, "learning_rate": 0.000357, "loss": 7.5822, "mean_token_accuracy": 0.0875043123960495, "num_tokens": 1471286.0, "step": 715 }, { "entropy": 7.899617719650268, "epoch": 0.04708036356502975, "grad_norm": 1.03125, "learning_rate": 0.0003595, "loss": 7.5894, "mean_token_accuracy": 0.08737545534968376, "num_tokens": 1481833.0, "step": 720 }, { "entropy": 7.90053505897522, "epoch": 0.04740731053423135, "grad_norm": 0.98828125, "learning_rate": 0.000362, "loss": 7.5022, "mean_token_accuracy": 0.09137436151504516, "num_tokens": 1492146.0, "step": 725 }, { "entropy": 7.905131006240845, "epoch": 0.04773425750343294, "grad_norm": 0.8984375, "learning_rate": 0.0003645, "loss": 7.5583, "mean_token_accuracy": 0.0910822369158268, "num_tokens": 1503115.0, "step": 730 }, { "entropy": 7.848192405700684, "epoch": 0.04806120447263454, "grad_norm": 0.96484375, "learning_rate": 0.000367, "loss": 7.5493, "mean_token_accuracy": 0.09068262204527855, "num_tokens": 1512262.0, "step": 735 }, { "entropy": 7.87175145149231, "epoch": 0.048388151441836134, "grad_norm": 1.125, "learning_rate": 0.0003695, "loss": 7.4803, "mean_token_accuracy": 0.09811543598771096, "num_tokens": 1522170.0, "step": 740 }, { "entropy": 7.936724472045898, "epoch": 0.04871509841103773, "grad_norm": 1.3828125, "learning_rate": 0.000372, "loss": 7.6417, "mean_token_accuracy": 0.08585861697793007, "num_tokens": 1533458.0, "step": 745 }, { "entropy": 7.9000585079193115, "epoch": 0.049042045380239326, "grad_norm": 1.1875, "learning_rate": 0.0003745, "loss": 7.5736, "mean_token_accuracy": 0.09953790158033371, "num_tokens": 1543835.0, "step": 750 }, { "entropy": 7.873013305664062, "epoch": 0.04936899234944092, "grad_norm": 0.96484375, "learning_rate": 0.000377, "loss": 7.5023, "mean_token_accuracy": 0.09043076410889625, "num_tokens": 1554928.0, "step": 755 }, { "entropy": 7.784916687011719, "epoch": 0.04969593931864252, "grad_norm": 1.1875, "learning_rate": 0.0003795, "loss": 7.4625, "mean_token_accuracy": 0.09302246496081353, "num_tokens": 1564982.0, "step": 760 }, { "entropy": 7.8830901145935055, "epoch": 0.05002288628784411, "grad_norm": 1.0078125, "learning_rate": 0.000382, "loss": 7.5068, "mean_token_accuracy": 0.09159085378050805, "num_tokens": 1575637.0, "step": 765 }, { "entropy": 7.892262744903564, "epoch": 0.05034983325704571, "grad_norm": 1.2265625, "learning_rate": 0.0003845, "loss": 7.5898, "mean_token_accuracy": 0.09253510907292366, "num_tokens": 1585759.0, "step": 770 }, { "entropy": 7.846009635925293, "epoch": 0.0506767802262473, "grad_norm": 1.109375, "learning_rate": 0.00038700000000000003, "loss": 7.4773, "mean_token_accuracy": 0.09439707994461059, "num_tokens": 1594608.0, "step": 775 }, { "entropy": 7.758079910278321, "epoch": 0.0510037271954489, "grad_norm": 1.09375, "learning_rate": 0.00038950000000000003, "loss": 7.4379, "mean_token_accuracy": 0.08464471697807312, "num_tokens": 1604956.0, "step": 780 }, { "entropy": 7.864066457748413, "epoch": 0.051330674164650494, "grad_norm": 1.015625, "learning_rate": 0.00039200000000000004, "loss": 7.4555, "mean_token_accuracy": 0.09399656429886818, "num_tokens": 1615408.0, "step": 785 }, { "entropy": 7.705894231796265, "epoch": 0.05165762113385209, "grad_norm": 1.0078125, "learning_rate": 0.00039450000000000005, "loss": 7.4434, "mean_token_accuracy": 0.0980803407728672, "num_tokens": 1626543.0, "step": 790 }, { "entropy": 7.807521486282349, "epoch": 0.051984568103053685, "grad_norm": 1.078125, "learning_rate": 0.00039700000000000005, "loss": 7.43, "mean_token_accuracy": 0.0951707273721695, "num_tokens": 1636850.0, "step": 795 }, { "entropy": 7.735428237915039, "epoch": 0.05231151507225528, "grad_norm": 0.91796875, "learning_rate": 0.0003995, "loss": 7.5189, "mean_token_accuracy": 0.09441551715135574, "num_tokens": 1647375.0, "step": 800 }, { "entropy": 7.788246059417725, "epoch": 0.05263846204145688, "grad_norm": 1.0703125, "learning_rate": 0.000402, "loss": 7.4669, "mean_token_accuracy": 0.09407965168356895, "num_tokens": 1657434.0, "step": 805 }, { "entropy": 7.86806845664978, "epoch": 0.05296540901065847, "grad_norm": 0.9453125, "learning_rate": 0.0004045, "loss": 7.4385, "mean_token_accuracy": 0.0922024630010128, "num_tokens": 1668221.0, "step": 810 }, { "entropy": 7.672569417953492, "epoch": 0.05329235597986007, "grad_norm": 1.078125, "learning_rate": 0.00040699999999999997, "loss": 7.462, "mean_token_accuracy": 0.09654765948653221, "num_tokens": 1678721.0, "step": 815 }, { "entropy": 7.795995044708252, "epoch": 0.05361930294906166, "grad_norm": 0.93359375, "learning_rate": 0.0004095, "loss": 7.4679, "mean_token_accuracy": 0.09245018661022186, "num_tokens": 1689039.0, "step": 820 }, { "entropy": 7.719067335128784, "epoch": 0.05394624991826326, "grad_norm": 1.0546875, "learning_rate": 0.000412, "loss": 7.4611, "mean_token_accuracy": 0.0948771893978119, "num_tokens": 1699256.0, "step": 825 }, { "entropy": 7.75290732383728, "epoch": 0.054273196887464854, "grad_norm": 0.90625, "learning_rate": 0.0004145, "loss": 7.3868, "mean_token_accuracy": 0.09804658442735673, "num_tokens": 1710016.0, "step": 830 }, { "entropy": 7.707308435440064, "epoch": 0.05460014385666645, "grad_norm": 1.0234375, "learning_rate": 0.000417, "loss": 7.4164, "mean_token_accuracy": 0.09161154180765152, "num_tokens": 1721182.0, "step": 835 }, { "entropy": 7.799738645553589, "epoch": 0.054927090825868045, "grad_norm": 1.078125, "learning_rate": 0.0004195, "loss": 7.4668, "mean_token_accuracy": 0.09126882925629616, "num_tokens": 1732103.0, "step": 840 }, { "entropy": 7.8296051025390625, "epoch": 0.05525403779506964, "grad_norm": 1.0390625, "learning_rate": 0.000422, "loss": 7.4576, "mean_token_accuracy": 0.09478752985596657, "num_tokens": 1742277.0, "step": 845 }, { "entropy": 7.736980056762695, "epoch": 0.055580984764271237, "grad_norm": 1.0625, "learning_rate": 0.0004245, "loss": 7.455, "mean_token_accuracy": 0.09304093196988106, "num_tokens": 1754218.0, "step": 850 }, { "entropy": 7.735497045516968, "epoch": 0.05590793173347283, "grad_norm": 1.0390625, "learning_rate": 0.000427, "loss": 7.4101, "mean_token_accuracy": 0.09308908283710479, "num_tokens": 1764923.0, "step": 855 }, { "entropy": 7.713766813278198, "epoch": 0.05623487870267443, "grad_norm": 1.171875, "learning_rate": 0.0004295, "loss": 7.398, "mean_token_accuracy": 0.09707033634185791, "num_tokens": 1775449.0, "step": 860 }, { "entropy": 7.704779767990113, "epoch": 0.05656182567187602, "grad_norm": 1.0625, "learning_rate": 0.000432, "loss": 7.3731, "mean_token_accuracy": 0.09779261127114296, "num_tokens": 1785953.0, "step": 865 }, { "entropy": 7.7207903385162355, "epoch": 0.05688877264107762, "grad_norm": 0.890625, "learning_rate": 0.0004345, "loss": 7.4441, "mean_token_accuracy": 0.09297127351164818, "num_tokens": 1797457.0, "step": 870 }, { "entropy": 7.736868143081665, "epoch": 0.057215719610279214, "grad_norm": 1.1015625, "learning_rate": 0.000437, "loss": 7.3872, "mean_token_accuracy": 0.10122127905488014, "num_tokens": 1807541.0, "step": 875 }, { "entropy": 7.684473037719727, "epoch": 0.05754266657948081, "grad_norm": 0.984375, "learning_rate": 0.0004395, "loss": 7.3048, "mean_token_accuracy": 0.10085586309432984, "num_tokens": 1816942.0, "step": 880 }, { "entropy": 7.610397863388061, "epoch": 0.057869613548682405, "grad_norm": 0.99609375, "learning_rate": 0.000442, "loss": 7.3525, "mean_token_accuracy": 0.09929906353354453, "num_tokens": 1828562.0, "step": 885 }, { "entropy": 7.612261390686035, "epoch": 0.058196560517884, "grad_norm": 1.0859375, "learning_rate": 0.0004445, "loss": 7.3024, "mean_token_accuracy": 0.10415131524205208, "num_tokens": 1838574.0, "step": 890 }, { "entropy": 7.715397071838379, "epoch": 0.058523507487085596, "grad_norm": 1.109375, "learning_rate": 0.000447, "loss": 7.3246, "mean_token_accuracy": 0.09995991289615631, "num_tokens": 1848900.0, "step": 895 }, { "entropy": 7.576214408874511, "epoch": 0.05885045445628719, "grad_norm": 1.1171875, "learning_rate": 0.00044950000000000003, "loss": 7.4536, "mean_token_accuracy": 0.0933345876634121, "num_tokens": 1859476.0, "step": 900 }, { "entropy": 7.741227293014527, "epoch": 0.05917740142548879, "grad_norm": 1.0546875, "learning_rate": 0.00045200000000000004, "loss": 7.3403, "mean_token_accuracy": 0.09792943894863129, "num_tokens": 1868619.0, "step": 905 }, { "entropy": 7.618190813064575, "epoch": 0.05950434839469038, "grad_norm": 1.1953125, "learning_rate": 0.00045450000000000004, "loss": 7.3743, "mean_token_accuracy": 0.1010057270526886, "num_tokens": 1879556.0, "step": 910 }, { "entropy": 7.744381523132324, "epoch": 0.05983129536389198, "grad_norm": 1.0859375, "learning_rate": 0.00045700000000000005, "loss": 7.3751, "mean_token_accuracy": 0.09538345783948898, "num_tokens": 1889780.0, "step": 915 }, { "entropy": 7.59956464767456, "epoch": 0.060158242333093574, "grad_norm": 1.078125, "learning_rate": 0.00045950000000000006, "loss": 7.4062, "mean_token_accuracy": 0.09414401575922966, "num_tokens": 1899718.0, "step": 920 }, { "entropy": 7.656889581680298, "epoch": 0.06048518930229517, "grad_norm": 1.1015625, "learning_rate": 0.000462, "loss": 7.2359, "mean_token_accuracy": 0.1062020257115364, "num_tokens": 1909438.0, "step": 925 }, { "entropy": 7.53996696472168, "epoch": 0.060812136271496765, "grad_norm": 1.015625, "learning_rate": 0.0004645, "loss": 7.3072, "mean_token_accuracy": 0.10201511830091477, "num_tokens": 1918760.0, "step": 930 }, { "entropy": 7.736797237396241, "epoch": 0.06113908324069836, "grad_norm": 0.98046875, "learning_rate": 0.000467, "loss": 7.3208, "mean_token_accuracy": 0.10090500339865685, "num_tokens": 1928233.0, "step": 935 }, { "entropy": 7.606488990783691, "epoch": 0.061466030209899956, "grad_norm": 1.078125, "learning_rate": 0.0004695, "loss": 7.3161, "mean_token_accuracy": 0.09411324411630631, "num_tokens": 1938986.0, "step": 940 }, { "entropy": 7.583484649658203, "epoch": 0.06179297717910155, "grad_norm": 1.0546875, "learning_rate": 0.000472, "loss": 7.293, "mean_token_accuracy": 0.09763783812522889, "num_tokens": 1949641.0, "step": 945 }, { "entropy": 7.595391654968262, "epoch": 0.06211992414830315, "grad_norm": 0.97265625, "learning_rate": 0.0004745, "loss": 7.3934, "mean_token_accuracy": 0.09144764244556428, "num_tokens": 1960353.0, "step": 950 }, { "entropy": 7.65482006072998, "epoch": 0.06244687111750474, "grad_norm": 1.078125, "learning_rate": 0.000477, "loss": 7.3526, "mean_token_accuracy": 0.09364168122410774, "num_tokens": 1970130.0, "step": 955 }, { "entropy": 7.570573472976685, "epoch": 0.06277381808670633, "grad_norm": 0.94921875, "learning_rate": 0.0004795, "loss": 7.3452, "mean_token_accuracy": 0.10097906365990639, "num_tokens": 1980719.0, "step": 960 }, { "entropy": 7.532822942733764, "epoch": 0.06310076505590793, "grad_norm": 0.95703125, "learning_rate": 0.000482, "loss": 7.3065, "mean_token_accuracy": 0.10078293308615685, "num_tokens": 1991468.0, "step": 965 }, { "entropy": 7.633434534072876, "epoch": 0.06342771202510952, "grad_norm": 1.2265625, "learning_rate": 0.0004845, "loss": 7.3062, "mean_token_accuracy": 0.09828223288059235, "num_tokens": 2001845.0, "step": 970 }, { "entropy": 7.534633779525757, "epoch": 0.06375465899431113, "grad_norm": 1.0859375, "learning_rate": 0.000487, "loss": 7.2981, "mean_token_accuracy": 0.09722265526652336, "num_tokens": 2011312.0, "step": 975 }, { "entropy": 7.576405382156372, "epoch": 0.06408160596351271, "grad_norm": 1.03125, "learning_rate": 0.0004895, "loss": 7.2875, "mean_token_accuracy": 0.10305716544389724, "num_tokens": 2020167.0, "step": 980 }, { "entropy": 7.559659147262574, "epoch": 0.06440855293271432, "grad_norm": 1.03125, "learning_rate": 0.000492, "loss": 7.2397, "mean_token_accuracy": 0.10063270106911659, "num_tokens": 2030696.0, "step": 985 }, { "entropy": 7.6030505180358885, "epoch": 0.0647354999019159, "grad_norm": 1.09375, "learning_rate": 0.0004945, "loss": 7.2909, "mean_token_accuracy": 0.10011964365839958, "num_tokens": 2040876.0, "step": 990 }, { "entropy": 7.4642167568206785, "epoch": 0.06506244687111751, "grad_norm": 0.95703125, "learning_rate": 0.000497, "loss": 7.2723, "mean_token_accuracy": 0.10206248015165328, "num_tokens": 2051671.0, "step": 995 }, { "entropy": 7.645249843597412, "epoch": 0.0653893938403191, "grad_norm": 1.0078125, "learning_rate": 0.0004995, "loss": 7.1326, "mean_token_accuracy": 0.10817173942923546, "num_tokens": 2062662.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 482883563520000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }