{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.03269469692015955, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742586898803712, "epoch": 0.0003269469692015955, "grad_norm": 4.25, "learning_rate": 2e-06, "loss": 10.7625, "mean_token_accuracy": 8.849557489156722e-05, "num_tokens": 9940.0, "step": 5 }, { "entropy": 10.74257230758667, "epoch": 0.000653893938403191, "grad_norm": 4.1875, "learning_rate": 4.5e-06, "loss": 10.75, "mean_token_accuracy": 0.0, "num_tokens": 19783.0, "step": 10 }, { "entropy": 10.742555141448975, "epoch": 0.0009808409076047864, "grad_norm": 4.625, "learning_rate": 7e-06, "loss": 10.7384, "mean_token_accuracy": 0.0, "num_tokens": 30189.0, "step": 15 }, { "entropy": 10.742575740814209, "epoch": 0.001307787876806382, "grad_norm": 4.1875, "learning_rate": 9.5e-06, "loss": 10.7067, "mean_token_accuracy": 0.0007516760495491325, "num_tokens": 40463.0, "step": 20 }, { "entropy": 10.742465591430664, "epoch": 0.0016347348460079775, "grad_norm": 4.03125, "learning_rate": 1.2e-05, "loss": 10.6408, "mean_token_accuracy": 0.010044214146910235, "num_tokens": 50919.0, "step": 25 }, { "entropy": 10.742095851898194, "epoch": 0.001961681815209573, "grad_norm": 3.578125, "learning_rate": 1.4500000000000002e-05, "loss": 10.5408, "mean_token_accuracy": 0.027823284920305013, "num_tokens": 61272.0, "step": 30 }, { "entropy": 10.740856456756593, "epoch": 0.0022886287844111684, "grad_norm": 3.078125, "learning_rate": 1.7000000000000003e-05, "loss": 10.4323, "mean_token_accuracy": 0.03470553252846002, "num_tokens": 70877.0, "step": 35 }, { "entropy": 10.73651065826416, "epoch": 0.002615575753612764, "grad_norm": 2.59375, "learning_rate": 1.95e-05, "loss": 10.3205, "mean_token_accuracy": 0.040680671110749245, "num_tokens": 80600.0, "step": 40 }, { "entropy": 10.727530670166015, "epoch": 0.0029425227228143595, "grad_norm": 2.046875, "learning_rate": 2.2e-05, "loss": 10.2476, "mean_token_accuracy": 0.03953301161527634, "num_tokens": 91002.0, "step": 45 }, { "entropy": 10.717786026000976, "epoch": 0.003269469692015955, "grad_norm": 1.921875, "learning_rate": 2.4500000000000003e-05, "loss": 10.1594, "mean_token_accuracy": 0.04255215115845203, "num_tokens": 101156.0, "step": 50 }, { "entropy": 10.710540103912354, "epoch": 0.0035964166612175506, "grad_norm": 1.859375, "learning_rate": 2.7e-05, "loss": 10.1182, "mean_token_accuracy": 0.04170279260724783, "num_tokens": 111896.0, "step": 55 }, { "entropy": 10.705566215515137, "epoch": 0.003923363630419146, "grad_norm": 1.8515625, "learning_rate": 2.95e-05, "loss": 9.9881, "mean_token_accuracy": 0.04833919741213322, "num_tokens": 120899.0, "step": 60 }, { "entropy": 10.698173141479492, "epoch": 0.004250310599620741, "grad_norm": 1.609375, "learning_rate": 3.2e-05, "loss": 10.0328, "mean_token_accuracy": 0.04022225625813007, "num_tokens": 131504.0, "step": 65 }, { "entropy": 10.691369152069091, "epoch": 0.004577257568822337, "grad_norm": 1.7890625, "learning_rate": 3.4500000000000005e-05, "loss": 9.9577, "mean_token_accuracy": 0.04434355236589908, "num_tokens": 142365.0, "step": 70 }, { "entropy": 10.686608409881591, "epoch": 0.004904204538023932, "grad_norm": 1.5625, "learning_rate": 3.7e-05, "loss": 9.9256, "mean_token_accuracy": 0.041293222457170486, "num_tokens": 153481.0, "step": 75 }, { "entropy": 10.679593467712403, "epoch": 0.005231151507225528, "grad_norm": 1.5859375, "learning_rate": 3.95e-05, "loss": 9.8544, "mean_token_accuracy": 0.041375156864523886, "num_tokens": 163941.0, "step": 80 }, { "entropy": 10.669306468963622, "epoch": 0.0055580984764271235, "grad_norm": 1.421875, "learning_rate": 4.2000000000000004e-05, "loss": 9.7936, "mean_token_accuracy": 0.04275329895317555, "num_tokens": 173992.0, "step": 85 }, { "entropy": 10.655621910095215, "epoch": 0.005885045445628719, "grad_norm": 1.515625, "learning_rate": 4.45e-05, "loss": 9.7624, "mean_token_accuracy": 0.0399011442437768, "num_tokens": 184474.0, "step": 90 }, { "entropy": 10.642310905456544, "epoch": 0.006211992414830315, "grad_norm": 1.3359375, "learning_rate": 4.7000000000000004e-05, "loss": 9.7029, "mean_token_accuracy": 0.0412175253033638, "num_tokens": 194998.0, "step": 95 }, { "entropy": 10.629393005371094, "epoch": 0.00653893938403191, "grad_norm": 1.671875, "learning_rate": 4.9500000000000004e-05, "loss": 9.5401, "mean_token_accuracy": 0.05521246679127216, "num_tokens": 203327.0, "step": 100 }, { "entropy": 10.600548839569091, "epoch": 0.006865886353233506, "grad_norm": 1.3828125, "learning_rate": 5.2e-05, "loss": 9.5267, "mean_token_accuracy": 0.05421698726713657, "num_tokens": 213921.0, "step": 105 }, { "entropy": 10.55351276397705, "epoch": 0.007192833322435101, "grad_norm": 1.4609375, "learning_rate": 5.45e-05, "loss": 9.4417, "mean_token_accuracy": 0.05835340581834316, "num_tokens": 225790.0, "step": 110 }, { "entropy": 10.493978023529053, "epoch": 0.007519780291636697, "grad_norm": 1.4765625, "learning_rate": 5.7e-05, "loss": 9.3301, "mean_token_accuracy": 0.056574657931923865, "num_tokens": 235689.0, "step": 115 }, { "entropy": 10.437990379333495, "epoch": 0.007846727260838291, "grad_norm": 1.3046875, "learning_rate": 5.9499999999999996e-05, "loss": 9.2562, "mean_token_accuracy": 0.054686100035905835, "num_tokens": 246525.0, "step": 120 }, { "entropy": 10.380927467346192, "epoch": 0.008173674230039887, "grad_norm": 1.2109375, "learning_rate": 6.2e-05, "loss": 9.1809, "mean_token_accuracy": 0.056523428112268445, "num_tokens": 256642.0, "step": 125 }, { "entropy": 10.325669860839843, "epoch": 0.008500621199241483, "grad_norm": 1.171875, "learning_rate": 6.450000000000001e-05, "loss": 9.1399, "mean_token_accuracy": 0.052699505165219304, "num_tokens": 268145.0, "step": 130 }, { "entropy": 10.2711612701416, "epoch": 0.008827568168443078, "grad_norm": 1.1484375, "learning_rate": 6.7e-05, "loss": 9.02, "mean_token_accuracy": 0.050835156068205836, "num_tokens": 279783.0, "step": 135 }, { "entropy": 10.188286304473877, "epoch": 0.009154515137644674, "grad_norm": 1.0546875, "learning_rate": 6.950000000000001e-05, "loss": 8.9063, "mean_token_accuracy": 0.05600942634046078, "num_tokens": 289723.0, "step": 140 }, { "entropy": 10.073064708709717, "epoch": 0.00948146210684627, "grad_norm": 1.0703125, "learning_rate": 7.2e-05, "loss": 8.8015, "mean_token_accuracy": 0.05663799084722996, "num_tokens": 300002.0, "step": 145 }, { "entropy": 9.98648281097412, "epoch": 0.009808409076047865, "grad_norm": 0.93359375, "learning_rate": 7.45e-05, "loss": 8.777, "mean_token_accuracy": 0.05806488022208214, "num_tokens": 310041.0, "step": 150 }, { "entropy": 9.891202545166015, "epoch": 0.01013535604524946, "grad_norm": 0.9375, "learning_rate": 7.7e-05, "loss": 8.6997, "mean_token_accuracy": 0.05627730451524258, "num_tokens": 321469.0, "step": 155 }, { "entropy": 9.748745250701905, "epoch": 0.010462303014451056, "grad_norm": 0.8671875, "learning_rate": 7.950000000000001e-05, "loss": 8.5702, "mean_token_accuracy": 0.05877697579562664, "num_tokens": 330796.0, "step": 160 }, { "entropy": 9.617728519439698, "epoch": 0.010789249983652651, "grad_norm": 0.953125, "learning_rate": 8.2e-05, "loss": 8.5724, "mean_token_accuracy": 0.05753467902541161, "num_tokens": 341402.0, "step": 165 }, { "entropy": 9.483910274505615, "epoch": 0.011116196952854247, "grad_norm": 0.95703125, "learning_rate": 8.450000000000001e-05, "loss": 8.5709, "mean_token_accuracy": 0.058061816915869716, "num_tokens": 351717.0, "step": 170 }, { "entropy": 9.382616806030274, "epoch": 0.011443143922055843, "grad_norm": 0.9375, "learning_rate": 8.7e-05, "loss": 8.4663, "mean_token_accuracy": 0.057271933555603026, "num_tokens": 361787.0, "step": 175 }, { "entropy": 9.258338737487794, "epoch": 0.011770090891257438, "grad_norm": 0.82421875, "learning_rate": 8.95e-05, "loss": 8.4114, "mean_token_accuracy": 0.05387798622250557, "num_tokens": 371827.0, "step": 180 }, { "entropy": 9.150267505645752, "epoch": 0.012097037860459034, "grad_norm": 0.84765625, "learning_rate": 9.2e-05, "loss": 8.4122, "mean_token_accuracy": 0.06042315401136875, "num_tokens": 382150.0, "step": 185 }, { "entropy": 9.016548824310302, "epoch": 0.01242398482966063, "grad_norm": 0.875, "learning_rate": 9.45e-05, "loss": 8.3316, "mean_token_accuracy": 0.06260293386876584, "num_tokens": 392151.0, "step": 190 }, { "entropy": 8.979074478149414, "epoch": 0.012750931798862225, "grad_norm": 0.8671875, "learning_rate": 9.7e-05, "loss": 8.3421, "mean_token_accuracy": 0.057670443505048755, "num_tokens": 402779.0, "step": 195 }, { "entropy": 8.890014362335204, "epoch": 0.01307787876806382, "grad_norm": 0.7265625, "learning_rate": 9.95e-05, "loss": 8.3466, "mean_token_accuracy": 0.06248428300023079, "num_tokens": 413500.0, "step": 200 }, { "entropy": 8.904778671264648, "epoch": 0.013404825737265416, "grad_norm": 0.8984375, "learning_rate": 0.000102, "loss": 8.2835, "mean_token_accuracy": 0.06201527528464794, "num_tokens": 423054.0, "step": 205 }, { "entropy": 8.856226634979247, "epoch": 0.013731772706467011, "grad_norm": 0.8203125, "learning_rate": 0.00010449999999999999, "loss": 8.3133, "mean_token_accuracy": 0.05689386166632175, "num_tokens": 433002.0, "step": 210 }, { "entropy": 8.779247093200684, "epoch": 0.014058719675668607, "grad_norm": 0.72265625, "learning_rate": 0.000107, "loss": 8.295, "mean_token_accuracy": 0.05818233527243137, "num_tokens": 443492.0, "step": 215 }, { "entropy": 8.777221393585204, "epoch": 0.014385666644870202, "grad_norm": 0.796875, "learning_rate": 0.0001095, "loss": 8.3091, "mean_token_accuracy": 0.062193362042307854, "num_tokens": 453001.0, "step": 220 }, { "entropy": 8.772535514831542, "epoch": 0.014712613614071798, "grad_norm": 0.859375, "learning_rate": 0.000112, "loss": 8.2306, "mean_token_accuracy": 0.06282332614064216, "num_tokens": 462916.0, "step": 225 }, { "entropy": 8.702757263183594, "epoch": 0.015039560583273394, "grad_norm": 0.75390625, "learning_rate": 0.0001145, "loss": 8.2694, "mean_token_accuracy": 0.060815002769231796, "num_tokens": 473549.0, "step": 230 }, { "entropy": 8.745165348052979, "epoch": 0.015366507552474989, "grad_norm": 0.8046875, "learning_rate": 0.00011700000000000001, "loss": 8.2862, "mean_token_accuracy": 0.05802113525569439, "num_tokens": 484472.0, "step": 235 }, { "entropy": 8.76063575744629, "epoch": 0.015693454521676583, "grad_norm": 1.03125, "learning_rate": 0.00011949999999999999, "loss": 8.2251, "mean_token_accuracy": 0.06674037426710129, "num_tokens": 494202.0, "step": 240 }, { "entropy": 8.625239944458007, "epoch": 0.01602040149087818, "grad_norm": 0.78515625, "learning_rate": 0.000122, "loss": 8.1602, "mean_token_accuracy": 0.0650412030518055, "num_tokens": 504635.0, "step": 245 }, { "entropy": 8.66549301147461, "epoch": 0.016347348460079774, "grad_norm": 0.9921875, "learning_rate": 0.0001245, "loss": 8.1881, "mean_token_accuracy": 0.0613247200846672, "num_tokens": 514423.0, "step": 250 }, { "entropy": 8.592597770690919, "epoch": 0.01667429542928137, "grad_norm": 0.82421875, "learning_rate": 0.000127, "loss": 8.2256, "mean_token_accuracy": 0.06521738171577454, "num_tokens": 525820.0, "step": 255 }, { "entropy": 8.587825107574464, "epoch": 0.017001242398482965, "grad_norm": 0.7734375, "learning_rate": 0.0001295, "loss": 8.1931, "mean_token_accuracy": 0.06806896105408669, "num_tokens": 536732.0, "step": 260 }, { "entropy": 8.599881744384765, "epoch": 0.01732818936768456, "grad_norm": 1.140625, "learning_rate": 0.000132, "loss": 8.1843, "mean_token_accuracy": 0.06989322565495967, "num_tokens": 546230.0, "step": 265 }, { "entropy": 8.689265823364257, "epoch": 0.017655136336886156, "grad_norm": 0.953125, "learning_rate": 0.00013450000000000002, "loss": 8.1967, "mean_token_accuracy": 0.0643424428999424, "num_tokens": 556078.0, "step": 270 }, { "entropy": 8.557295227050782, "epoch": 0.017982083306087752, "grad_norm": 0.87890625, "learning_rate": 0.00013700000000000002, "loss": 8.178, "mean_token_accuracy": 0.06810705624520778, "num_tokens": 565385.0, "step": 275 }, { "entropy": 8.595024585723877, "epoch": 0.018309030275289347, "grad_norm": 0.96875, "learning_rate": 0.0001395, "loss": 8.237, "mean_token_accuracy": 0.0639534905552864, "num_tokens": 576066.0, "step": 280 }, { "entropy": 8.57234001159668, "epoch": 0.018635977244490943, "grad_norm": 1.0, "learning_rate": 0.00014199999999999998, "loss": 8.1585, "mean_token_accuracy": 0.0638256598263979, "num_tokens": 587472.0, "step": 285 }, { "entropy": 8.60384578704834, "epoch": 0.01896292421369254, "grad_norm": 0.8828125, "learning_rate": 0.0001445, "loss": 8.1544, "mean_token_accuracy": 0.06674780026078224, "num_tokens": 597400.0, "step": 290 }, { "entropy": 8.587763404846191, "epoch": 0.019289871182894134, "grad_norm": 0.953125, "learning_rate": 0.000147, "loss": 8.2128, "mean_token_accuracy": 0.06767871156334877, "num_tokens": 606856.0, "step": 295 }, { "entropy": 8.573587322235108, "epoch": 0.01961681815209573, "grad_norm": 0.83984375, "learning_rate": 0.0001495, "loss": 8.1472, "mean_token_accuracy": 0.07218570187687874, "num_tokens": 617209.0, "step": 300 }, { "entropy": 8.5530442237854, "epoch": 0.019943765121297325, "grad_norm": 0.87109375, "learning_rate": 0.000152, "loss": 8.153, "mean_token_accuracy": 0.07159969210624695, "num_tokens": 626826.0, "step": 305 }, { "entropy": 8.517343521118164, "epoch": 0.02027071209049892, "grad_norm": 0.9921875, "learning_rate": 0.00015450000000000001, "loss": 8.1166, "mean_token_accuracy": 0.07488984875380993, "num_tokens": 636836.0, "step": 310 }, { "entropy": 8.550188350677491, "epoch": 0.020597659059700516, "grad_norm": 0.89453125, "learning_rate": 0.000157, "loss": 8.2061, "mean_token_accuracy": 0.06659409068524838, "num_tokens": 648177.0, "step": 315 }, { "entropy": 8.58387565612793, "epoch": 0.02092460602890211, "grad_norm": 0.87109375, "learning_rate": 0.0001595, "loss": 8.1801, "mean_token_accuracy": 0.06891246885061264, "num_tokens": 658365.0, "step": 320 }, { "entropy": 8.48437042236328, "epoch": 0.021251552998103707, "grad_norm": 1.7890625, "learning_rate": 0.000162, "loss": 8.0879, "mean_token_accuracy": 0.06931497268378735, "num_tokens": 668980.0, "step": 325 }, { "entropy": 8.547167491912841, "epoch": 0.021578499967305303, "grad_norm": 0.984375, "learning_rate": 0.00016450000000000001, "loss": 8.1331, "mean_token_accuracy": 0.07338778600096703, "num_tokens": 679406.0, "step": 330 }, { "entropy": 8.523040771484375, "epoch": 0.0219054469365069, "grad_norm": 0.953125, "learning_rate": 0.00016700000000000002, "loss": 8.0915, "mean_token_accuracy": 0.07461029291152954, "num_tokens": 689871.0, "step": 335 }, { "entropy": 8.489326858520508, "epoch": 0.022232393905708494, "grad_norm": 1.09375, "learning_rate": 0.00016950000000000003, "loss": 8.0457, "mean_token_accuracy": 0.07580887749791146, "num_tokens": 700969.0, "step": 340 }, { "entropy": 8.469206142425538, "epoch": 0.02255934087491009, "grad_norm": 0.8828125, "learning_rate": 0.00017199999999999998, "loss": 8.0714, "mean_token_accuracy": 0.07064862996339798, "num_tokens": 711153.0, "step": 345 }, { "entropy": 8.425196266174316, "epoch": 0.022886287844111685, "grad_norm": 0.83984375, "learning_rate": 0.00017449999999999999, "loss": 8.0605, "mean_token_accuracy": 0.07229152098298072, "num_tokens": 721475.0, "step": 350 }, { "entropy": 8.458955097198487, "epoch": 0.02321323481331328, "grad_norm": 0.890625, "learning_rate": 0.000177, "loss": 8.1029, "mean_token_accuracy": 0.07589908726513386, "num_tokens": 732823.0, "step": 355 }, { "entropy": 8.45833330154419, "epoch": 0.023540181782514876, "grad_norm": 0.91796875, "learning_rate": 0.0001795, "loss": 8.0594, "mean_token_accuracy": 0.07507128641009331, "num_tokens": 743853.0, "step": 360 }, { "entropy": 8.486702823638916, "epoch": 0.02386712875171647, "grad_norm": 0.94140625, "learning_rate": 0.000182, "loss": 8.1181, "mean_token_accuracy": 0.07701903395354748, "num_tokens": 754579.0, "step": 365 }, { "entropy": 8.394766998291015, "epoch": 0.024194075720918067, "grad_norm": 1.0703125, "learning_rate": 0.0001845, "loss": 8.0894, "mean_token_accuracy": 0.07040258683264256, "num_tokens": 764836.0, "step": 370 }, { "entropy": 8.46137580871582, "epoch": 0.024521022690119663, "grad_norm": 0.87890625, "learning_rate": 0.000187, "loss": 8.0219, "mean_token_accuracy": 0.07322987243533134, "num_tokens": 773961.0, "step": 375 }, { "entropy": 8.43176326751709, "epoch": 0.02484796965932126, "grad_norm": 1.0625, "learning_rate": 0.0001895, "loss": 7.9916, "mean_token_accuracy": 0.0786767140030861, "num_tokens": 784331.0, "step": 380 }, { "entropy": 8.325694942474366, "epoch": 0.025174916628522854, "grad_norm": 1.1171875, "learning_rate": 0.000192, "loss": 7.9694, "mean_token_accuracy": 0.07703853137791157, "num_tokens": 794724.0, "step": 385 }, { "entropy": 8.46515941619873, "epoch": 0.02550186359772445, "grad_norm": 0.9921875, "learning_rate": 0.0001945, "loss": 7.984, "mean_token_accuracy": 0.0744760014116764, "num_tokens": 804680.0, "step": 390 }, { "entropy": 8.296853351593018, "epoch": 0.025828810566926045, "grad_norm": 1.0078125, "learning_rate": 0.00019700000000000002, "loss": 7.9805, "mean_token_accuracy": 0.07433952577412128, "num_tokens": 815066.0, "step": 395 }, { "entropy": 8.427121257781982, "epoch": 0.02615575753612764, "grad_norm": 1.0546875, "learning_rate": 0.00019950000000000002, "loss": 7.9862, "mean_token_accuracy": 0.07774959728121758, "num_tokens": 824958.0, "step": 400 }, { "entropy": 8.403383159637452, "epoch": 0.026482704505329236, "grad_norm": 0.93359375, "learning_rate": 0.000202, "loss": 8.0499, "mean_token_accuracy": 0.07819209098815919, "num_tokens": 835128.0, "step": 405 }, { "entropy": 8.332460689544678, "epoch": 0.02680965147453083, "grad_norm": 0.78515625, "learning_rate": 0.00020449999999999998, "loss": 7.9763, "mean_token_accuracy": 0.07198684960603714, "num_tokens": 844590.0, "step": 410 }, { "entropy": 8.386160278320313, "epoch": 0.027136598443732427, "grad_norm": 0.9296875, "learning_rate": 0.000207, "loss": 7.9597, "mean_token_accuracy": 0.07920237854123116, "num_tokens": 854914.0, "step": 415 }, { "entropy": 8.396887683868409, "epoch": 0.027463545412934023, "grad_norm": 0.953125, "learning_rate": 0.0002095, "loss": 7.9929, "mean_token_accuracy": 0.0751864355057478, "num_tokens": 866171.0, "step": 420 }, { "entropy": 8.301899719238282, "epoch": 0.027790492382135618, "grad_norm": 0.94140625, "learning_rate": 0.000212, "loss": 7.9806, "mean_token_accuracy": 0.07633630074560642, "num_tokens": 876603.0, "step": 425 }, { "entropy": 8.322303676605225, "epoch": 0.028117439351337214, "grad_norm": 0.99609375, "learning_rate": 0.0002145, "loss": 7.913, "mean_token_accuracy": 0.07756362929940223, "num_tokens": 887124.0, "step": 430 }, { "entropy": 8.30418529510498, "epoch": 0.02844438632053881, "grad_norm": 1.609375, "learning_rate": 0.00021700000000000002, "loss": 7.9104, "mean_token_accuracy": 0.08119071945548058, "num_tokens": 897275.0, "step": 435 }, { "entropy": 8.311804008483886, "epoch": 0.028771333289740405, "grad_norm": 0.9140625, "learning_rate": 0.0002195, "loss": 7.8925, "mean_token_accuracy": 0.08083942905068398, "num_tokens": 907174.0, "step": 440 }, { "entropy": 8.347180366516113, "epoch": 0.029098280258942, "grad_norm": 1.015625, "learning_rate": 0.000222, "loss": 7.8892, "mean_token_accuracy": 0.08076051622629166, "num_tokens": 917126.0, "step": 445 }, { "entropy": 8.24964075088501, "epoch": 0.029425227228143596, "grad_norm": 0.94921875, "learning_rate": 0.0002245, "loss": 7.8899, "mean_token_accuracy": 0.08073717057704925, "num_tokens": 926758.0, "step": 450 }, { "entropy": 8.3399188041687, "epoch": 0.02975217419734519, "grad_norm": 0.90234375, "learning_rate": 0.00022700000000000002, "loss": 7.8954, "mean_token_accuracy": 0.08044968619942665, "num_tokens": 936973.0, "step": 455 }, { "entropy": 8.194979095458985, "epoch": 0.030079121166546787, "grad_norm": 0.9453125, "learning_rate": 0.00022950000000000002, "loss": 7.8588, "mean_token_accuracy": 0.07642363831400871, "num_tokens": 946845.0, "step": 460 }, { "entropy": 8.322082328796387, "epoch": 0.030406068135748383, "grad_norm": 1.0390625, "learning_rate": 0.00023200000000000003, "loss": 7.8846, "mean_token_accuracy": 0.08190244510769844, "num_tokens": 956904.0, "step": 465 }, { "entropy": 8.182524299621582, "epoch": 0.030733015104949978, "grad_norm": 1.0625, "learning_rate": 0.00023449999999999998, "loss": 7.8873, "mean_token_accuracy": 0.07898930385708809, "num_tokens": 966133.0, "step": 470 }, { "entropy": 8.294102954864503, "epoch": 0.031059962074151574, "grad_norm": 1.0234375, "learning_rate": 0.000237, "loss": 7.926, "mean_token_accuracy": 0.07419689372181892, "num_tokens": 976889.0, "step": 475 }, { "entropy": 8.3031400680542, "epoch": 0.031386909043353166, "grad_norm": 0.96875, "learning_rate": 0.0002395, "loss": 7.9145, "mean_token_accuracy": 0.081867391243577, "num_tokens": 987385.0, "step": 480 }, { "entropy": 8.210045433044433, "epoch": 0.03171385601255476, "grad_norm": 0.93359375, "learning_rate": 0.000242, "loss": 7.885, "mean_token_accuracy": 0.07997245490550994, "num_tokens": 998116.0, "step": 485 }, { "entropy": 8.263574028015137, "epoch": 0.03204080298175636, "grad_norm": 0.984375, "learning_rate": 0.0002445, "loss": 7.8633, "mean_token_accuracy": 0.0772053673863411, "num_tokens": 1007412.0, "step": 490 }, { "entropy": 8.196787071228027, "epoch": 0.03236774995095795, "grad_norm": 1.0390625, "learning_rate": 0.000247, "loss": 7.8959, "mean_token_accuracy": 0.07670100852847099, "num_tokens": 1016843.0, "step": 495 }, { "entropy": 8.263703727722168, "epoch": 0.03269469692015955, "grad_norm": 1.0546875, "learning_rate": 0.0002495, "loss": 7.8932, "mean_token_accuracy": 0.0816141352057457, "num_tokens": 1027285.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 239505405050880.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }