{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 9.98101898101898, "eval_steps": 500, "global_step": 5000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.74254903793335, "epoch": 0.00999000999000999, "grad_norm": 4.6875, "learning_rate": 2e-06, "loss": 10.8409, "mean_token_accuracy": 0.00010789126390591264, "num_tokens": 17348.0, "step": 5 }, { "entropy": 10.742575931549073, "epoch": 0.01998001998001998, "grad_norm": 5.28125, "learning_rate": 4.5e-06, "loss": 10.8325, "mean_token_accuracy": 6.410256610251963e-05, "num_tokens": 33613.0, "step": 10 }, { "entropy": 10.742553329467773, "epoch": 0.029970029970029972, "grad_norm": 5.0625, "learning_rate": 7e-06, "loss": 10.8012, "mean_token_accuracy": 0.00016108142444863914, "num_tokens": 49416.0, "step": 15 }, { "entropy": 10.742562675476075, "epoch": 0.03996003996003996, "grad_norm": 5.0625, "learning_rate": 9.5e-06, "loss": 10.7438, "mean_token_accuracy": 0.0010525182529818266, "num_tokens": 64663.0, "step": 20 }, { "entropy": 10.742408943176269, "epoch": 0.04995004995004995, "grad_norm": 4.75, "learning_rate": 1.2e-05, "loss": 10.6283, "mean_token_accuracy": 0.03072175462730229, "num_tokens": 79972.0, "step": 25 }, { "entropy": 10.74140043258667, "epoch": 0.059940059940059943, "grad_norm": 4.0, "learning_rate": 1.4500000000000002e-05, "loss": 10.5246, "mean_token_accuracy": 0.05747625604271889, "num_tokens": 96254.0, "step": 30 }, { "entropy": 10.735374069213867, "epoch": 0.06993006993006994, "grad_norm": 2.875, "learning_rate": 1.7000000000000003e-05, "loss": 10.3755, "mean_token_accuracy": 0.06859578937292099, "num_tokens": 112713.0, "step": 35 }, { "entropy": 10.707574653625489, "epoch": 0.07992007992007992, "grad_norm": 2.28125, "learning_rate": 1.95e-05, "loss": 10.1924, "mean_token_accuracy": 0.06884920224547386, "num_tokens": 128259.0, "step": 40 }, { "entropy": 10.654945564270019, "epoch": 0.0899100899100899, "grad_norm": 2.046875, "learning_rate": 2.2e-05, "loss": 10.1434, "mean_token_accuracy": 0.06479340717196465, "num_tokens": 145521.0, "step": 45 }, { "entropy": 10.624096393585205, "epoch": 0.0999000999000999, "grad_norm": 1.7734375, "learning_rate": 2.4500000000000003e-05, "loss": 10.0779, "mean_token_accuracy": 0.06704385466873646, "num_tokens": 162665.0, "step": 50 }, { "entropy": 10.62326774597168, "epoch": 0.10989010989010989, "grad_norm": 1.796875, "learning_rate": 2.7e-05, "loss": 10.0119, "mean_token_accuracy": 0.06695662550628186, "num_tokens": 178901.0, "step": 55 }, { "entropy": 10.61907787322998, "epoch": 0.11988011988011989, "grad_norm": 1.7421875, "learning_rate": 2.95e-05, "loss": 9.9679, "mean_token_accuracy": 0.06775063388049603, "num_tokens": 194617.0, "step": 60 }, { "entropy": 10.605632114410401, "epoch": 0.12987012987012986, "grad_norm": 1.7109375, "learning_rate": 3.2e-05, "loss": 9.8939, "mean_token_accuracy": 0.07534115239977837, "num_tokens": 209675.0, "step": 65 }, { "entropy": 10.59527235031128, "epoch": 0.13986013986013987, "grad_norm": 2.0, "learning_rate": 3.4500000000000005e-05, "loss": 9.8733, "mean_token_accuracy": 0.07048867233097553, "num_tokens": 225848.0, "step": 70 }, { "entropy": 10.599591922760009, "epoch": 0.14985014985014986, "grad_norm": 1.796875, "learning_rate": 3.7e-05, "loss": 9.8167, "mean_token_accuracy": 0.07247593812644482, "num_tokens": 242981.0, "step": 75 }, { "entropy": 10.579588508605957, "epoch": 0.15984015984015984, "grad_norm": 1.546875, "learning_rate": 3.95e-05, "loss": 9.7625, "mean_token_accuracy": 0.07427209392189979, "num_tokens": 258173.0, "step": 80 }, { "entropy": 10.544640350341798, "epoch": 0.16983016983016982, "grad_norm": 1.6484375, "learning_rate": 4.2000000000000004e-05, "loss": 9.69, "mean_token_accuracy": 0.07245487086474896, "num_tokens": 273570.0, "step": 85 }, { "entropy": 10.5300874710083, "epoch": 0.1798201798201798, "grad_norm": 1.5625, "learning_rate": 4.45e-05, "loss": 9.6529, "mean_token_accuracy": 0.07408605217933655, "num_tokens": 290549.0, "step": 90 }, { "entropy": 10.528420066833496, "epoch": 0.18981018981018982, "grad_norm": 1.5390625, "learning_rate": 4.7000000000000004e-05, "loss": 9.6194, "mean_token_accuracy": 0.07625656872987747, "num_tokens": 306856.0, "step": 95 }, { "entropy": 10.485299491882325, "epoch": 0.1998001998001998, "grad_norm": 1.5234375, "learning_rate": 4.9500000000000004e-05, "loss": 9.5443, "mean_token_accuracy": 0.08020635470747947, "num_tokens": 322515.0, "step": 100 }, { "entropy": 10.434676933288575, "epoch": 0.2097902097902098, "grad_norm": 1.609375, "learning_rate": 5.2e-05, "loss": 9.4966, "mean_token_accuracy": 0.07586914226412773, "num_tokens": 337941.0, "step": 105 }, { "entropy": 10.45520372390747, "epoch": 0.21978021978021978, "grad_norm": 1.546875, "learning_rate": 5.45e-05, "loss": 9.4232, "mean_token_accuracy": 0.08006052449345588, "num_tokens": 353788.0, "step": 110 }, { "entropy": 10.380233097076417, "epoch": 0.22977022977022976, "grad_norm": 1.6015625, "learning_rate": 5.7e-05, "loss": 9.3782, "mean_token_accuracy": 0.08523525297641754, "num_tokens": 371012.0, "step": 115 }, { "entropy": 10.3286771774292, "epoch": 0.23976023976023977, "grad_norm": 1.765625, "learning_rate": 5.9499999999999996e-05, "loss": 9.2336, "mean_token_accuracy": 0.08941392749547958, "num_tokens": 387063.0, "step": 120 }, { "entropy": 10.305299186706543, "epoch": 0.24975024975024976, "grad_norm": 1.203125, "learning_rate": 6.2e-05, "loss": 9.2413, "mean_token_accuracy": 0.08080004155635834, "num_tokens": 404360.0, "step": 125 }, { "entropy": 10.245867156982422, "epoch": 0.2597402597402597, "grad_norm": 2.0625, "learning_rate": 6.450000000000001e-05, "loss": 9.0529, "mean_token_accuracy": 0.09887080416083335, "num_tokens": 421267.0, "step": 130 }, { "entropy": 10.113175201416016, "epoch": 0.26973026973026976, "grad_norm": 1.0390625, "learning_rate": 6.7e-05, "loss": 9.0745, "mean_token_accuracy": 0.0869515560567379, "num_tokens": 438900.0, "step": 135 }, { "entropy": 10.11645679473877, "epoch": 0.27972027972027974, "grad_norm": 1.2421875, "learning_rate": 6.950000000000001e-05, "loss": 8.9962, "mean_token_accuracy": 0.08159712329506874, "num_tokens": 454580.0, "step": 140 }, { "entropy": 10.033879661560059, "epoch": 0.2897102897102897, "grad_norm": 0.9375, "learning_rate": 7.2e-05, "loss": 8.9364, "mean_token_accuracy": 0.082859006524086, "num_tokens": 470894.0, "step": 145 }, { "entropy": 9.949287033081054, "epoch": 0.2997002997002997, "grad_norm": 1.15625, "learning_rate": 7.45e-05, "loss": 8.8864, "mean_token_accuracy": 0.0842631220817566, "num_tokens": 487872.0, "step": 150 }, { "entropy": 9.799868774414062, "epoch": 0.3096903096903097, "grad_norm": 1.375, "learning_rate": 7.7e-05, "loss": 8.7141, "mean_token_accuracy": 0.09437366873025894, "num_tokens": 503899.0, "step": 155 }, { "entropy": 9.570561790466309, "epoch": 0.3196803196803197, "grad_norm": 0.83203125, "learning_rate": 7.950000000000001e-05, "loss": 8.6153, "mean_token_accuracy": 0.09862063378095627, "num_tokens": 519023.0, "step": 160 }, { "entropy": 9.580165386199951, "epoch": 0.32967032967032966, "grad_norm": 0.796875, "learning_rate": 8.2e-05, "loss": 8.6321, "mean_token_accuracy": 0.087054193764925, "num_tokens": 535424.0, "step": 165 }, { "entropy": 9.45827875137329, "epoch": 0.33966033966033965, "grad_norm": 0.83203125, "learning_rate": 8.450000000000001e-05, "loss": 8.6716, "mean_token_accuracy": 0.08567041307687759, "num_tokens": 552528.0, "step": 170 }, { "entropy": 9.326940536499023, "epoch": 0.34965034965034963, "grad_norm": 0.70703125, "learning_rate": 8.7e-05, "loss": 8.5523, "mean_token_accuracy": 0.08963110744953155, "num_tokens": 567149.0, "step": 175 }, { "entropy": 9.181477642059326, "epoch": 0.3596403596403596, "grad_norm": 0.8984375, "learning_rate": 8.95e-05, "loss": 8.5255, "mean_token_accuracy": 0.08932835683226585, "num_tokens": 582033.0, "step": 180 }, { "entropy": 9.184029483795166, "epoch": 0.3696303696303696, "grad_norm": 0.9921875, "learning_rate": 9.2e-05, "loss": 8.492, "mean_token_accuracy": 0.09364427700638771, "num_tokens": 598930.0, "step": 185 }, { "entropy": 9.105390739440917, "epoch": 0.37962037962037964, "grad_norm": 0.91015625, "learning_rate": 9.45e-05, "loss": 8.4764, "mean_token_accuracy": 0.08496234193444252, "num_tokens": 615859.0, "step": 190 }, { "entropy": 9.057480430603027, "epoch": 0.38961038961038963, "grad_norm": 0.66015625, "learning_rate": 9.7e-05, "loss": 8.4525, "mean_token_accuracy": 0.09097891747951507, "num_tokens": 631984.0, "step": 195 }, { "entropy": 8.931283473968506, "epoch": 0.3996003996003996, "grad_norm": 0.76171875, "learning_rate": 9.95e-05, "loss": 8.4712, "mean_token_accuracy": 0.09022903516888618, "num_tokens": 648599.0, "step": 200 }, { "entropy": 8.999445819854737, "epoch": 0.4095904095904096, "grad_norm": 0.75, "learning_rate": 0.000102, "loss": 8.5152, "mean_token_accuracy": 0.08909457549452782, "num_tokens": 666196.0, "step": 205 }, { "entropy": 8.872494792938232, "epoch": 0.4195804195804196, "grad_norm": 0.66015625, "learning_rate": 0.00010449999999999999, "loss": 8.4462, "mean_token_accuracy": 0.09361587092280388, "num_tokens": 682848.0, "step": 210 }, { "entropy": 8.852845001220704, "epoch": 0.42957042957042957, "grad_norm": 0.5703125, "learning_rate": 0.000107, "loss": 8.3932, "mean_token_accuracy": 0.0924599327147007, "num_tokens": 700324.0, "step": 215 }, { "entropy": 8.826492881774902, "epoch": 0.43956043956043955, "grad_norm": 0.6796875, "learning_rate": 0.0001095, "loss": 8.438, "mean_token_accuracy": 0.0906071975827217, "num_tokens": 715401.0, "step": 220 }, { "entropy": 8.716631221771241, "epoch": 0.44955044955044954, "grad_norm": 0.68359375, "learning_rate": 0.000112, "loss": 8.4143, "mean_token_accuracy": 0.09328261092305183, "num_tokens": 730372.0, "step": 225 }, { "entropy": 8.727209281921386, "epoch": 0.4595404595404595, "grad_norm": 0.796875, "learning_rate": 0.0001145, "loss": 8.3391, "mean_token_accuracy": 0.09173915013670922, "num_tokens": 745880.0, "step": 230 }, { "entropy": 8.743009567260742, "epoch": 0.4695304695304695, "grad_norm": 0.7265625, "learning_rate": 0.00011700000000000001, "loss": 8.3552, "mean_token_accuracy": 0.09261953458189964, "num_tokens": 761474.0, "step": 235 }, { "entropy": 8.669536972045899, "epoch": 0.47952047952047955, "grad_norm": 0.62890625, "learning_rate": 0.00011949999999999999, "loss": 8.3798, "mean_token_accuracy": 0.09077078998088836, "num_tokens": 776871.0, "step": 240 }, { "entropy": 8.689266204833984, "epoch": 0.48951048951048953, "grad_norm": 0.70703125, "learning_rate": 0.000122, "loss": 8.3659, "mean_token_accuracy": 0.09065382108092308, "num_tokens": 793506.0, "step": 245 }, { "entropy": 8.591617012023926, "epoch": 0.4995004995004995, "grad_norm": 0.68359375, "learning_rate": 0.0001245, "loss": 8.3325, "mean_token_accuracy": 0.09529750868678093, "num_tokens": 808366.0, "step": 250 }, { "entropy": 8.718113708496094, "epoch": 0.5094905094905094, "grad_norm": 0.765625, "learning_rate": 0.000127, "loss": 8.2646, "mean_token_accuracy": 0.10416125357151032, "num_tokens": 825461.0, "step": 255 }, { "entropy": 8.644307136535645, "epoch": 0.5194805194805194, "grad_norm": 0.65625, "learning_rate": 0.0001295, "loss": 8.3552, "mean_token_accuracy": 0.08870847970247268, "num_tokens": 840998.0, "step": 260 }, { "entropy": 8.638798427581786, "epoch": 0.5294705294705294, "grad_norm": 0.70703125, "learning_rate": 0.000132, "loss": 8.4149, "mean_token_accuracy": 0.08986097797751427, "num_tokens": 858383.0, "step": 265 }, { "entropy": 8.622299480438233, "epoch": 0.5394605394605395, "grad_norm": 0.703125, "learning_rate": 0.00013450000000000002, "loss": 8.3192, "mean_token_accuracy": 0.08967429846525192, "num_tokens": 873611.0, "step": 270 }, { "entropy": 8.645909023284911, "epoch": 0.5494505494505495, "grad_norm": 0.8046875, "learning_rate": 0.00013700000000000002, "loss": 8.2318, "mean_token_accuracy": 0.10625835433602333, "num_tokens": 889918.0, "step": 275 }, { "entropy": 8.576266384124756, "epoch": 0.5594405594405595, "grad_norm": 0.80859375, "learning_rate": 0.0001395, "loss": 8.2966, "mean_token_accuracy": 0.1017056480050087, "num_tokens": 906967.0, "step": 280 }, { "entropy": 8.678112125396728, "epoch": 0.5694305694305695, "grad_norm": 0.73828125, "learning_rate": 0.00014199999999999998, "loss": 8.3848, "mean_token_accuracy": 0.09247232899069786, "num_tokens": 922954.0, "step": 285 }, { "entropy": 8.666139221191406, "epoch": 0.5794205794205795, "grad_norm": 0.7734375, "learning_rate": 0.0001445, "loss": 8.3586, "mean_token_accuracy": 0.0921535387635231, "num_tokens": 938920.0, "step": 290 }, { "entropy": 8.631329917907715, "epoch": 0.5894105894105894, "grad_norm": 0.66796875, "learning_rate": 0.000147, "loss": 8.3734, "mean_token_accuracy": 0.0920196034014225, "num_tokens": 956301.0, "step": 295 }, { "entropy": 8.548529148101807, "epoch": 0.5994005994005994, "grad_norm": 0.8515625, "learning_rate": 0.0001495, "loss": 8.2358, "mean_token_accuracy": 0.09958092793822289, "num_tokens": 972454.0, "step": 300 }, { "entropy": 8.61522102355957, "epoch": 0.6093906093906094, "grad_norm": 0.703125, "learning_rate": 0.000152, "loss": 8.333, "mean_token_accuracy": 0.09208913743495942, "num_tokens": 987326.0, "step": 305 }, { "entropy": 8.584405994415283, "epoch": 0.6193806193806194, "grad_norm": 0.69921875, "learning_rate": 0.00015450000000000001, "loss": 8.2977, "mean_token_accuracy": 0.09532473459839821, "num_tokens": 1002448.0, "step": 310 }, { "entropy": 8.536137676239013, "epoch": 0.6293706293706294, "grad_norm": 0.69921875, "learning_rate": 0.000157, "loss": 8.3265, "mean_token_accuracy": 0.09180266484618187, "num_tokens": 1020348.0, "step": 315 }, { "entropy": 8.623396396636963, "epoch": 0.6393606393606394, "grad_norm": 0.7265625, "learning_rate": 0.0001595, "loss": 8.3499, "mean_token_accuracy": 0.08997747674584389, "num_tokens": 1036562.0, "step": 320 }, { "entropy": 8.528428745269775, "epoch": 0.6493506493506493, "grad_norm": 0.7734375, "learning_rate": 0.000162, "loss": 8.3187, "mean_token_accuracy": 0.09452675953507424, "num_tokens": 1053106.0, "step": 325 }, { "entropy": 8.570547008514405, "epoch": 0.6593406593406593, "grad_norm": 0.80078125, "learning_rate": 0.00016450000000000001, "loss": 8.2708, "mean_token_accuracy": 0.09287350997328758, "num_tokens": 1068277.0, "step": 330 }, { "entropy": 8.505113983154297, "epoch": 0.6693306693306693, "grad_norm": 0.7109375, "learning_rate": 0.00016700000000000002, "loss": 8.212, "mean_token_accuracy": 0.10472053438425064, "num_tokens": 1083887.0, "step": 335 }, { "entropy": 8.494814014434814, "epoch": 0.6793206793206793, "grad_norm": 0.65234375, "learning_rate": 0.00016950000000000003, "loss": 8.2264, "mean_token_accuracy": 0.0991443045437336, "num_tokens": 1099791.0, "step": 340 }, { "entropy": 8.513353157043458, "epoch": 0.6893106893106893, "grad_norm": 0.9140625, "learning_rate": 0.00017199999999999998, "loss": 8.2843, "mean_token_accuracy": 0.09210123345255852, "num_tokens": 1116137.0, "step": 345 }, { "entropy": 8.550718784332275, "epoch": 0.6993006993006993, "grad_norm": 0.77734375, "learning_rate": 0.00017449999999999999, "loss": 8.2293, "mean_token_accuracy": 0.10072905272245407, "num_tokens": 1132449.0, "step": 350 }, { "entropy": 8.527479457855225, "epoch": 0.7092907092907093, "grad_norm": 1.1171875, "learning_rate": 0.000177, "loss": 8.3552, "mean_token_accuracy": 0.09086157828569412, "num_tokens": 1148316.0, "step": 355 }, { "entropy": 8.505389308929443, "epoch": 0.7192807192807192, "grad_norm": 0.74609375, "learning_rate": 0.0001795, "loss": 8.2142, "mean_token_accuracy": 0.09256454855203629, "num_tokens": 1164030.0, "step": 360 }, { "entropy": 8.580228328704834, "epoch": 0.7292707292707292, "grad_norm": 0.87109375, "learning_rate": 0.000182, "loss": 8.3049, "mean_token_accuracy": 0.09622592777013779, "num_tokens": 1180624.0, "step": 365 }, { "entropy": 8.496176528930665, "epoch": 0.7392607392607392, "grad_norm": 0.8671875, "learning_rate": 0.0001845, "loss": 8.2815, "mean_token_accuracy": 0.09714617729187011, "num_tokens": 1196986.0, "step": 370 }, { "entropy": 8.580214786529542, "epoch": 0.7492507492507493, "grad_norm": 0.72265625, "learning_rate": 0.000187, "loss": 8.2919, "mean_token_accuracy": 0.09614738449454308, "num_tokens": 1212754.0, "step": 375 }, { "entropy": 8.44631586074829, "epoch": 0.7592407592407593, "grad_norm": 0.91015625, "learning_rate": 0.0001895, "loss": 8.2324, "mean_token_accuracy": 0.09536803364753724, "num_tokens": 1229627.0, "step": 380 }, { "entropy": 8.515226554870605, "epoch": 0.7692307692307693, "grad_norm": 1.1796875, "learning_rate": 0.000192, "loss": 8.1816, "mean_token_accuracy": 0.0967013455927372, "num_tokens": 1245127.0, "step": 385 }, { "entropy": 8.458242416381836, "epoch": 0.7792207792207793, "grad_norm": 0.8125, "learning_rate": 0.0001945, "loss": 8.2483, "mean_token_accuracy": 0.09477976039052009, "num_tokens": 1261438.0, "step": 390 }, { "entropy": 8.479850482940673, "epoch": 0.7892107892107892, "grad_norm": 0.734375, "learning_rate": 0.00019700000000000002, "loss": 8.2152, "mean_token_accuracy": 0.09673597514629365, "num_tokens": 1277476.0, "step": 395 }, { "entropy": 8.536440181732178, "epoch": 0.7992007992007992, "grad_norm": 0.76953125, "learning_rate": 0.00019950000000000002, "loss": 8.1608, "mean_token_accuracy": 0.09755991101264953, "num_tokens": 1294659.0, "step": 400 }, { "entropy": 8.371343421936036, "epoch": 0.8091908091908092, "grad_norm": 0.8203125, "learning_rate": 0.000202, "loss": 8.1319, "mean_token_accuracy": 0.10120925828814506, "num_tokens": 1308829.0, "step": 405 }, { "entropy": 8.464437866210938, "epoch": 0.8191808191808192, "grad_norm": 0.765625, "learning_rate": 0.00020449999999999998, "loss": 8.1896, "mean_token_accuracy": 0.10006042197346687, "num_tokens": 1325659.0, "step": 410 }, { "entropy": 8.507107639312744, "epoch": 0.8291708291708292, "grad_norm": 0.87890625, "learning_rate": 0.000207, "loss": 8.2255, "mean_token_accuracy": 0.09681524932384492, "num_tokens": 1341643.0, "step": 415 }, { "entropy": 8.446794795989991, "epoch": 0.8391608391608392, "grad_norm": 0.9140625, "learning_rate": 0.0002095, "loss": 8.197, "mean_token_accuracy": 0.09735974669456482, "num_tokens": 1359197.0, "step": 420 }, { "entropy": 8.502279472351074, "epoch": 0.8491508491508492, "grad_norm": 0.6796875, "learning_rate": 0.000212, "loss": 8.1875, "mean_token_accuracy": 0.09608993604779244, "num_tokens": 1376107.0, "step": 425 }, { "entropy": 8.477056503295898, "epoch": 0.8591408591408591, "grad_norm": 0.79296875, "learning_rate": 0.0002145, "loss": 8.2042, "mean_token_accuracy": 0.09094029515981675, "num_tokens": 1392232.0, "step": 430 }, { "entropy": 8.460865306854249, "epoch": 0.8691308691308691, "grad_norm": 0.83984375, "learning_rate": 0.00021700000000000002, "loss": 8.1631, "mean_token_accuracy": 0.09813632071018219, "num_tokens": 1406747.0, "step": 435 }, { "entropy": 8.48235101699829, "epoch": 0.8791208791208791, "grad_norm": 0.7890625, "learning_rate": 0.0002195, "loss": 8.1609, "mean_token_accuracy": 0.09457436800003052, "num_tokens": 1423599.0, "step": 440 }, { "entropy": 8.372987842559814, "epoch": 0.8891108891108891, "grad_norm": 1.1640625, "learning_rate": 0.000222, "loss": 8.091, "mean_token_accuracy": 0.1050879828631878, "num_tokens": 1439330.0, "step": 445 }, { "entropy": 8.440707111358643, "epoch": 0.8991008991008991, "grad_norm": 0.66015625, "learning_rate": 0.0002245, "loss": 8.0636, "mean_token_accuracy": 0.10564030036330223, "num_tokens": 1456660.0, "step": 450 }, { "entropy": 8.463158130645752, "epoch": 0.9090909090909091, "grad_norm": 0.77734375, "learning_rate": 0.00022700000000000002, "loss": 8.1173, "mean_token_accuracy": 0.10065716579556465, "num_tokens": 1471619.0, "step": 455 }, { "entropy": 8.29682149887085, "epoch": 0.919080919080919, "grad_norm": 0.90625, "learning_rate": 0.00022950000000000002, "loss": 8.0752, "mean_token_accuracy": 0.09712542369961738, "num_tokens": 1486971.0, "step": 460 }, { "entropy": 8.374618434906006, "epoch": 0.929070929070929, "grad_norm": 0.7890625, "learning_rate": 0.00023200000000000003, "loss": 8.1102, "mean_token_accuracy": 0.09521022215485572, "num_tokens": 1502923.0, "step": 465 }, { "entropy": 8.45193510055542, "epoch": 0.939060939060939, "grad_norm": 1.1015625, "learning_rate": 0.00023449999999999998, "loss": 8.1818, "mean_token_accuracy": 0.09111250266432762, "num_tokens": 1520214.0, "step": 470 }, { "entropy": 8.413396072387695, "epoch": 0.949050949050949, "grad_norm": 0.875, "learning_rate": 0.000237, "loss": 8.0682, "mean_token_accuracy": 0.10277181193232536, "num_tokens": 1534946.0, "step": 475 }, { "entropy": 8.293998527526856, "epoch": 0.9590409590409591, "grad_norm": 0.74609375, "learning_rate": 0.0002395, "loss": 7.9474, "mean_token_accuracy": 0.11179379150271415, "num_tokens": 1551823.0, "step": 480 }, { "entropy": 8.366506767272949, "epoch": 0.9690309690309691, "grad_norm": 0.98828125, "learning_rate": 0.000242, "loss": 8.0529, "mean_token_accuracy": 0.10311459228396416, "num_tokens": 1567354.0, "step": 485 }, { "entropy": 8.338885498046874, "epoch": 0.9790209790209791, "grad_norm": 1.109375, "learning_rate": 0.0002445, "loss": 8.0225, "mean_token_accuracy": 0.09862796664237976, "num_tokens": 1583749.0, "step": 490 }, { "entropy": 8.336707592010498, "epoch": 0.989010989010989, "grad_norm": 0.87890625, "learning_rate": 0.000247, "loss": 8.1258, "mean_token_accuracy": 0.09763901010155678, "num_tokens": 1599678.0, "step": 495 }, { "entropy": 8.445067310333252, "epoch": 0.999000999000999, "grad_norm": 0.99609375, "learning_rate": 0.0002495, "loss": 8.1224, "mean_token_accuracy": 0.0928703673183918, "num_tokens": 1616737.0, "step": 500 }, { "epoch": 0.999000999000999, "eval_entropy": 8.140788088618098, "eval_loss": 8.047406196594238, "eval_mean_token_accuracy": 0.09197118636724111, "eval_num_tokens": 1616737.0, "eval_runtime": 1.1978, "eval_samples_per_second": 1230.577, "eval_steps_per_second": 154.448, "step": 500 }, { "entropy": 8.344965828789604, "epoch": 1.007992007992008, "grad_norm": 0.83203125, "learning_rate": 0.000252, "loss": 8.0423, "mean_token_accuracy": 0.09306528833177355, "num_tokens": 1629911.0, "step": 505 }, { "entropy": 8.31555461883545, "epoch": 1.017982017982018, "grad_norm": 0.75390625, "learning_rate": 0.0002545, "loss": 7.9697, "mean_token_accuracy": 0.0968889206647873, "num_tokens": 1645944.0, "step": 510 }, { "entropy": 8.219412803649902, "epoch": 1.027972027972028, "grad_norm": 0.8125, "learning_rate": 0.000257, "loss": 7.944, "mean_token_accuracy": 0.10192576050758362, "num_tokens": 1660254.0, "step": 515 }, { "entropy": 8.334071922302247, "epoch": 1.037962037962038, "grad_norm": 0.875, "learning_rate": 0.0002595, "loss": 7.9225, "mean_token_accuracy": 0.10587546825408936, "num_tokens": 1675805.0, "step": 520 }, { "entropy": 8.385684299468995, "epoch": 1.0479520479520479, "grad_norm": 0.84375, "learning_rate": 0.000262, "loss": 7.9414, "mean_token_accuracy": 0.09777224585413932, "num_tokens": 1692248.0, "step": 525 }, { "entropy": 8.283127307891846, "epoch": 1.057942057942058, "grad_norm": 0.82421875, "learning_rate": 0.00026450000000000003, "loss": 7.9208, "mean_token_accuracy": 0.10127234905958175, "num_tokens": 1708443.0, "step": 530 }, { "entropy": 8.216063213348388, "epoch": 1.0679320679320679, "grad_norm": 0.9140625, "learning_rate": 0.00026700000000000004, "loss": 7.8234, "mean_token_accuracy": 0.1095321536064148, "num_tokens": 1723977.0, "step": 535 }, { "entropy": 8.342953109741211, "epoch": 1.077922077922078, "grad_norm": 0.85546875, "learning_rate": 0.00026950000000000005, "loss": 7.9888, "mean_token_accuracy": 0.09499371498823166, "num_tokens": 1739362.0, "step": 540 }, { "entropy": 8.271250534057618, "epoch": 1.0879120879120878, "grad_norm": 0.90625, "learning_rate": 0.00027200000000000005, "loss": 7.9808, "mean_token_accuracy": 0.09600954875349998, "num_tokens": 1755106.0, "step": 545 }, { "entropy": 8.257489347457886, "epoch": 1.097902097902098, "grad_norm": 0.87890625, "learning_rate": 0.0002745, "loss": 7.9237, "mean_token_accuracy": 0.09950614199042321, "num_tokens": 1771537.0, "step": 550 }, { "entropy": 8.221052932739259, "epoch": 1.1078921078921078, "grad_norm": 0.921875, "learning_rate": 0.000277, "loss": 7.8883, "mean_token_accuracy": 0.10020415410399437, "num_tokens": 1786942.0, "step": 555 }, { "entropy": 8.243068408966064, "epoch": 1.1178821178821179, "grad_norm": 0.90625, "learning_rate": 0.0002795, "loss": 7.8005, "mean_token_accuracy": 0.10907796397805214, "num_tokens": 1803849.0, "step": 560 }, { "entropy": 8.201099395751953, "epoch": 1.127872127872128, "grad_norm": 0.765625, "learning_rate": 0.00028199999999999997, "loss": 7.8788, "mean_token_accuracy": 0.10487436950206756, "num_tokens": 1820439.0, "step": 565 }, { "entropy": 8.326700115203858, "epoch": 1.1378621378621379, "grad_norm": 0.9453125, "learning_rate": 0.0002845, "loss": 7.9411, "mean_token_accuracy": 0.10306010618805886, "num_tokens": 1836008.0, "step": 570 }, { "entropy": 8.20847806930542, "epoch": 1.1478521478521477, "grad_norm": 0.90625, "learning_rate": 0.000287, "loss": 7.8465, "mean_token_accuracy": 0.10470956414937974, "num_tokens": 1851887.0, "step": 575 }, { "entropy": 8.185382175445557, "epoch": 1.1578421578421578, "grad_norm": 0.84375, "learning_rate": 0.0002895, "loss": 7.8585, "mean_token_accuracy": 0.0996880978345871, "num_tokens": 1866979.0, "step": 580 }, { "entropy": 8.20130467414856, "epoch": 1.167832167832168, "grad_norm": 1.0859375, "learning_rate": 0.000292, "loss": 7.8965, "mean_token_accuracy": 0.09827386811375619, "num_tokens": 1881384.0, "step": 585 }, { "entropy": 8.22911195755005, "epoch": 1.1778221778221778, "grad_norm": 0.76953125, "learning_rate": 0.0002945, "loss": 7.8368, "mean_token_accuracy": 0.10659671127796173, "num_tokens": 1898986.0, "step": 590 }, { "entropy": 8.15971794128418, "epoch": 1.187812187812188, "grad_norm": 0.890625, "learning_rate": 0.000297, "loss": 7.8281, "mean_token_accuracy": 0.10433512926101685, "num_tokens": 1913303.0, "step": 595 }, { "entropy": 8.172107124328614, "epoch": 1.1978021978021978, "grad_norm": 1.09375, "learning_rate": 0.0002995, "loss": 7.8345, "mean_token_accuracy": 0.11005568951368332, "num_tokens": 1928906.0, "step": 600 }, { "entropy": 8.24223837852478, "epoch": 1.2077922077922079, "grad_norm": 0.90625, "learning_rate": 0.000302, "loss": 7.9028, "mean_token_accuracy": 0.10041624084115028, "num_tokens": 1944823.0, "step": 605 }, { "entropy": 8.156695556640624, "epoch": 1.2177822177822177, "grad_norm": 0.9296875, "learning_rate": 0.0003045, "loss": 7.8661, "mean_token_accuracy": 0.10058502033352852, "num_tokens": 1960538.0, "step": 610 }, { "entropy": 8.20977144241333, "epoch": 1.2277722277722278, "grad_norm": 0.92578125, "learning_rate": 0.000307, "loss": 7.8367, "mean_token_accuracy": 0.09877868816256523, "num_tokens": 1979509.0, "step": 615 }, { "entropy": 8.162244510650634, "epoch": 1.2377622377622377, "grad_norm": 0.8515625, "learning_rate": 0.0003095, "loss": 7.7884, "mean_token_accuracy": 0.10074753984808922, "num_tokens": 1995113.0, "step": 620 }, { "entropy": 8.172338390350342, "epoch": 1.2477522477522478, "grad_norm": 0.85546875, "learning_rate": 0.000312, "loss": 7.7659, "mean_token_accuracy": 0.10919720381498337, "num_tokens": 2010212.0, "step": 625 }, { "entropy": 8.09831461906433, "epoch": 1.2577422577422577, "grad_norm": 0.94921875, "learning_rate": 0.0003145, "loss": 7.8129, "mean_token_accuracy": 0.10691071450710296, "num_tokens": 2027483.0, "step": 630 }, { "entropy": 8.133178567886352, "epoch": 1.2677322677322678, "grad_norm": 0.79296875, "learning_rate": 0.000317, "loss": 7.7896, "mean_token_accuracy": 0.10240155979990959, "num_tokens": 2043897.0, "step": 635 }, { "entropy": 8.285891056060791, "epoch": 1.2777222777222776, "grad_norm": 0.78515625, "learning_rate": 0.0003195, "loss": 7.8684, "mean_token_accuracy": 0.0982455164194107, "num_tokens": 2061645.0, "step": 640 }, { "entropy": 8.103964185714721, "epoch": 1.2877122877122877, "grad_norm": 0.984375, "learning_rate": 0.000322, "loss": 7.8364, "mean_token_accuracy": 0.10459044799208642, "num_tokens": 2077751.0, "step": 645 }, { "entropy": 8.161087036132812, "epoch": 1.2977022977022976, "grad_norm": 0.78515625, "learning_rate": 0.00032450000000000003, "loss": 7.8622, "mean_token_accuracy": 0.09868591278791428, "num_tokens": 2093853.0, "step": 650 }, { "entropy": 8.170791816711425, "epoch": 1.3076923076923077, "grad_norm": 0.88671875, "learning_rate": 0.00032700000000000003, "loss": 7.8347, "mean_token_accuracy": 0.09927802458405495, "num_tokens": 2110151.0, "step": 655 }, { "entropy": 8.192026901245118, "epoch": 1.3176823176823178, "grad_norm": 1.1953125, "learning_rate": 0.00032950000000000004, "loss": 7.7538, "mean_token_accuracy": 0.09446207582950591, "num_tokens": 2125584.0, "step": 660 }, { "entropy": 8.104029846191406, "epoch": 1.3276723276723277, "grad_norm": 0.93359375, "learning_rate": 0.00033200000000000005, "loss": 7.7273, "mean_token_accuracy": 0.10806782469153405, "num_tokens": 2142247.0, "step": 665 }, { "entropy": 8.061339807510375, "epoch": 1.3376623376623376, "grad_norm": 1.203125, "learning_rate": 0.00033450000000000005, "loss": 7.6168, "mean_token_accuracy": 0.10972020626068116, "num_tokens": 2159116.0, "step": 670 }, { "entropy": 8.102464294433593, "epoch": 1.3476523476523476, "grad_norm": 0.84375, "learning_rate": 0.000337, "loss": 7.7746, "mean_token_accuracy": 0.09734337553381919, "num_tokens": 2175237.0, "step": 675 }, { "entropy": 8.079360914230346, "epoch": 1.3576423576423577, "grad_norm": 0.88671875, "learning_rate": 0.0003395, "loss": 7.7702, "mean_token_accuracy": 0.10102465003728867, "num_tokens": 2191108.0, "step": 680 }, { "entropy": 8.009714221954345, "epoch": 1.3676323676323676, "grad_norm": 1.140625, "learning_rate": 0.000342, "loss": 7.6556, "mean_token_accuracy": 0.10901543200016021, "num_tokens": 2207404.0, "step": 685 }, { "entropy": 8.017986679077149, "epoch": 1.3776223776223775, "grad_norm": 0.859375, "learning_rate": 0.00034449999999999997, "loss": 7.7225, "mean_token_accuracy": 0.11000798493623734, "num_tokens": 2223891.0, "step": 690 }, { "entropy": 8.004034423828125, "epoch": 1.3876123876123876, "grad_norm": 0.828125, "learning_rate": 0.000347, "loss": 7.688, "mean_token_accuracy": 0.10737730488181114, "num_tokens": 2239750.0, "step": 695 }, { "entropy": 8.089302206039429, "epoch": 1.3976023976023977, "grad_norm": 0.9765625, "learning_rate": 0.0003495, "loss": 7.7918, "mean_token_accuracy": 0.09848668947815895, "num_tokens": 2254475.0, "step": 700 }, { "entropy": 8.038819551467896, "epoch": 1.4075924075924076, "grad_norm": 0.8828125, "learning_rate": 0.000352, "loss": 7.7412, "mean_token_accuracy": 0.10036000534892082, "num_tokens": 2270403.0, "step": 705 }, { "entropy": 8.05772099494934, "epoch": 1.4175824175824177, "grad_norm": 0.82421875, "learning_rate": 0.0003545, "loss": 7.7231, "mean_token_accuracy": 0.10787450224161148, "num_tokens": 2287440.0, "step": 710 }, { "entropy": 8.031018495559692, "epoch": 1.4275724275724275, "grad_norm": 1.0703125, "learning_rate": 0.000357, "loss": 7.5935, "mean_token_accuracy": 0.11669361963868141, "num_tokens": 2303606.0, "step": 715 }, { "entropy": 8.10855507850647, "epoch": 1.4375624375624376, "grad_norm": 0.984375, "learning_rate": 0.0003595, "loss": 7.7629, "mean_token_accuracy": 0.09718288779258728, "num_tokens": 2320304.0, "step": 720 }, { "entropy": 8.033062314987182, "epoch": 1.4475524475524475, "grad_norm": 0.87109375, "learning_rate": 0.000362, "loss": 7.7269, "mean_token_accuracy": 0.10353609770536423, "num_tokens": 2335449.0, "step": 725 }, { "entropy": 7.98488302230835, "epoch": 1.4575424575424576, "grad_norm": 0.7890625, "learning_rate": 0.0003645, "loss": 7.7298, "mean_token_accuracy": 0.1053438015282154, "num_tokens": 2350286.0, "step": 730 }, { "entropy": 8.084484529495239, "epoch": 1.4675324675324675, "grad_norm": 0.83984375, "learning_rate": 0.000367, "loss": 7.6562, "mean_token_accuracy": 0.10364222973585129, "num_tokens": 2367174.0, "step": 735 }, { "entropy": 7.979038953781128, "epoch": 1.4775224775224776, "grad_norm": 0.8671875, "learning_rate": 0.0003695, "loss": 7.744, "mean_token_accuracy": 0.09835705384612084, "num_tokens": 2383379.0, "step": 740 }, { "entropy": 7.950644826889038, "epoch": 1.4875124875124874, "grad_norm": 0.859375, "learning_rate": 0.000372, "loss": 7.6674, "mean_token_accuracy": 0.10948423892259598, "num_tokens": 2400055.0, "step": 745 }, { "entropy": 7.948536825180054, "epoch": 1.4975024975024975, "grad_norm": 0.83203125, "learning_rate": 0.0003745, "loss": 7.7088, "mean_token_accuracy": 0.104210115224123, "num_tokens": 2415445.0, "step": 750 }, { "entropy": 8.104103422164917, "epoch": 1.5074925074925076, "grad_norm": 0.9765625, "learning_rate": 0.000377, "loss": 7.6183, "mean_token_accuracy": 0.1110638789832592, "num_tokens": 2431633.0, "step": 755 }, { "entropy": 7.9167121887207035, "epoch": 1.5174825174825175, "grad_norm": 1.1875, "learning_rate": 0.0003795, "loss": 7.6556, "mean_token_accuracy": 0.10475207418203354, "num_tokens": 2448053.0, "step": 760 }, { "entropy": 8.011196660995484, "epoch": 1.5274725274725274, "grad_norm": 0.80859375, "learning_rate": 0.000382, "loss": 7.7603, "mean_token_accuracy": 0.10242786332964897, "num_tokens": 2464962.0, "step": 765 }, { "entropy": 7.854190301895142, "epoch": 1.5374625374625375, "grad_norm": 0.8828125, "learning_rate": 0.0003845, "loss": 7.6527, "mean_token_accuracy": 0.10968720018863679, "num_tokens": 2481728.0, "step": 770 }, { "entropy": 7.93970217704773, "epoch": 1.5474525474525476, "grad_norm": 0.84765625, "learning_rate": 0.00038700000000000003, "loss": 7.6644, "mean_token_accuracy": 0.10697980225086212, "num_tokens": 2498249.0, "step": 775 }, { "entropy": 7.971722221374511, "epoch": 1.5574425574425574, "grad_norm": 0.98828125, "learning_rate": 0.00038950000000000003, "loss": 7.6869, "mean_token_accuracy": 0.10662917494773864, "num_tokens": 2512832.0, "step": 780 }, { "entropy": 8.0352463722229, "epoch": 1.5674325674325673, "grad_norm": 0.734375, "learning_rate": 0.00039200000000000004, "loss": 7.8105, "mean_token_accuracy": 0.09663845226168633, "num_tokens": 2530065.0, "step": 785 }, { "entropy": 7.965973043441773, "epoch": 1.5774225774225774, "grad_norm": 0.8359375, "learning_rate": 0.00039450000000000005, "loss": 7.6293, "mean_token_accuracy": 0.1142218291759491, "num_tokens": 2546812.0, "step": 790 }, { "entropy": 7.914030504226685, "epoch": 1.5874125874125875, "grad_norm": 0.76171875, "learning_rate": 0.00039700000000000005, "loss": 7.5985, "mean_token_accuracy": 0.10844378024339676, "num_tokens": 2562955.0, "step": 795 }, { "entropy": 7.9991395473480225, "epoch": 1.5974025974025974, "grad_norm": 0.92578125, "learning_rate": 0.0003995, "loss": 7.636, "mean_token_accuracy": 0.10216034278273582, "num_tokens": 2577644.0, "step": 800 }, { "entropy": 7.804229784011841, "epoch": 1.6073926073926073, "grad_norm": 0.8515625, "learning_rate": 0.000402, "loss": 7.479, "mean_token_accuracy": 0.11868006139993667, "num_tokens": 2592888.0, "step": 805 }, { "entropy": 7.826851224899292, "epoch": 1.6173826173826173, "grad_norm": 0.828125, "learning_rate": 0.0004045, "loss": 7.5642, "mean_token_accuracy": 0.10893830135464669, "num_tokens": 2610352.0, "step": 810 }, { "entropy": 7.878586292266846, "epoch": 1.6273726273726274, "grad_norm": 0.90625, "learning_rate": 0.00040699999999999997, "loss": 7.5595, "mean_token_accuracy": 0.10943539440631866, "num_tokens": 2626850.0, "step": 815 }, { "entropy": 7.843348503112793, "epoch": 1.6373626373626373, "grad_norm": 0.90234375, "learning_rate": 0.0004095, "loss": 7.6166, "mean_token_accuracy": 0.10784812793135642, "num_tokens": 2642483.0, "step": 820 }, { "entropy": 7.896633672714233, "epoch": 1.6473526473526472, "grad_norm": 0.75390625, "learning_rate": 0.000412, "loss": 7.6682, "mean_token_accuracy": 0.10058582201600075, "num_tokens": 2658801.0, "step": 825 }, { "entropy": 7.992334079742432, "epoch": 1.6573426573426573, "grad_norm": 0.84765625, "learning_rate": 0.0004145, "loss": 7.6181, "mean_token_accuracy": 0.10562084466218949, "num_tokens": 2674320.0, "step": 830 }, { "entropy": 7.871245288848877, "epoch": 1.6673326673326674, "grad_norm": 0.84765625, "learning_rate": 0.000417, "loss": 7.5569, "mean_token_accuracy": 0.1130405493080616, "num_tokens": 2691468.0, "step": 835 }, { "entropy": 7.854435968399048, "epoch": 1.6773226773226773, "grad_norm": 0.8515625, "learning_rate": 0.0004195, "loss": 7.6132, "mean_token_accuracy": 0.10280844122171402, "num_tokens": 2707795.0, "step": 840 }, { "entropy": 7.798345613479614, "epoch": 1.6873126873126874, "grad_norm": 0.82421875, "learning_rate": 0.000422, "loss": 7.4358, "mean_token_accuracy": 0.12156035900115966, "num_tokens": 2725406.0, "step": 845 }, { "entropy": 7.71482892036438, "epoch": 1.6973026973026974, "grad_norm": 0.9453125, "learning_rate": 0.0004245, "loss": 7.487, "mean_token_accuracy": 0.11422280594706535, "num_tokens": 2741080.0, "step": 850 }, { "entropy": 8.022317790985108, "epoch": 1.7072927072927073, "grad_norm": 0.87890625, "learning_rate": 0.000427, "loss": 7.6872, "mean_token_accuracy": 0.10234800577163697, "num_tokens": 2758052.0, "step": 855 }, { "entropy": 7.710728740692138, "epoch": 1.7172827172827172, "grad_norm": 0.859375, "learning_rate": 0.0004295, "loss": 7.5718, "mean_token_accuracy": 0.10922266095876694, "num_tokens": 2775414.0, "step": 860 }, { "entropy": 7.858629941940308, "epoch": 1.7272727272727273, "grad_norm": 0.9296875, "learning_rate": 0.000432, "loss": 7.6087, "mean_token_accuracy": 0.10396021082997323, "num_tokens": 2792333.0, "step": 865 }, { "entropy": 7.944055700302124, "epoch": 1.7372627372627374, "grad_norm": 0.8046875, "learning_rate": 0.0004345, "loss": 7.7243, "mean_token_accuracy": 0.10027192905545235, "num_tokens": 2807792.0, "step": 870 }, { "entropy": 7.910960578918457, "epoch": 1.7472527472527473, "grad_norm": 0.86328125, "learning_rate": 0.000437, "loss": 7.6288, "mean_token_accuracy": 0.10449600145220757, "num_tokens": 2823819.0, "step": 875 }, { "entropy": 7.87107138633728, "epoch": 1.7572427572427571, "grad_norm": 0.8671875, "learning_rate": 0.0004395, "loss": 7.6212, "mean_token_accuracy": 0.10314707756042481, "num_tokens": 2840026.0, "step": 880 }, { "entropy": 7.746200895309448, "epoch": 1.7672327672327672, "grad_norm": 0.765625, "learning_rate": 0.000442, "loss": 7.4546, "mean_token_accuracy": 0.11674722135066987, "num_tokens": 2857041.0, "step": 885 }, { "entropy": 7.842999696731567, "epoch": 1.7772227772227773, "grad_norm": 0.82421875, "learning_rate": 0.0004445, "loss": 7.5113, "mean_token_accuracy": 0.11269463673233986, "num_tokens": 2871815.0, "step": 890 }, { "entropy": 7.798826599121094, "epoch": 1.7872127872127872, "grad_norm": 0.92578125, "learning_rate": 0.000447, "loss": 7.5082, "mean_token_accuracy": 0.1110450305044651, "num_tokens": 2888902.0, "step": 895 }, { "entropy": 7.773666000366211, "epoch": 1.797202797202797, "grad_norm": 0.921875, "learning_rate": 0.00044950000000000003, "loss": 7.5503, "mean_token_accuracy": 0.10609947964549064, "num_tokens": 2905536.0, "step": 900 }, { "entropy": 7.787226724624634, "epoch": 1.8071928071928072, "grad_norm": 0.79296875, "learning_rate": 0.00045200000000000004, "loss": 7.5587, "mean_token_accuracy": 0.11197240501642228, "num_tokens": 2922542.0, "step": 905 }, { "entropy": 7.839496898651123, "epoch": 1.8171828171828173, "grad_norm": 0.859375, "learning_rate": 0.00045450000000000004, "loss": 7.5326, "mean_token_accuracy": 0.11128943562507629, "num_tokens": 2937418.0, "step": 910 }, { "entropy": 7.7856128215789795, "epoch": 1.8271728271728271, "grad_norm": 0.77734375, "learning_rate": 0.00045700000000000005, "loss": 7.5355, "mean_token_accuracy": 0.10546828433871269, "num_tokens": 2953989.0, "step": 915 }, { "entropy": 7.75637378692627, "epoch": 1.837162837162837, "grad_norm": 0.87109375, "learning_rate": 0.00045950000000000006, "loss": 7.5363, "mean_token_accuracy": 0.10771389603614807, "num_tokens": 2970438.0, "step": 920 }, { "entropy": 7.8310833930969235, "epoch": 1.847152847152847, "grad_norm": 0.90234375, "learning_rate": 0.000462, "loss": 7.5979, "mean_token_accuracy": 0.10760430172085762, "num_tokens": 2986349.0, "step": 925 }, { "entropy": 7.7756389617919925, "epoch": 1.8571428571428572, "grad_norm": 0.8046875, "learning_rate": 0.0004645, "loss": 7.5186, "mean_token_accuracy": 0.10492026805877686, "num_tokens": 3002199.0, "step": 930 }, { "entropy": 7.850647354125977, "epoch": 1.867132867132867, "grad_norm": 0.890625, "learning_rate": 0.000467, "loss": 7.574, "mean_token_accuracy": 0.10573839843273163, "num_tokens": 3019724.0, "step": 935 }, { "entropy": 7.758398199081421, "epoch": 1.8771228771228772, "grad_norm": 1.75, "learning_rate": 0.0004695, "loss": 7.4861, "mean_token_accuracy": 0.11178312376141548, "num_tokens": 3036033.0, "step": 940 }, { "entropy": 7.733203649520874, "epoch": 1.8871128871128873, "grad_norm": 0.84765625, "learning_rate": 0.000472, "loss": 7.5057, "mean_token_accuracy": 0.10797822251915931, "num_tokens": 3050535.0, "step": 945 }, { "entropy": 7.606766033172607, "epoch": 1.8971028971028971, "grad_norm": 0.83984375, "learning_rate": 0.0004745, "loss": 7.4241, "mean_token_accuracy": 0.11418468505144119, "num_tokens": 3067487.0, "step": 950 }, { "entropy": 7.811316347122192, "epoch": 1.907092907092907, "grad_norm": 0.78125, "learning_rate": 0.000477, "loss": 7.4817, "mean_token_accuracy": 0.11279602721333504, "num_tokens": 3083368.0, "step": 955 }, { "entropy": 7.764263772964478, "epoch": 1.9170829170829171, "grad_norm": 0.8515625, "learning_rate": 0.0004795, "loss": 7.5884, "mean_token_accuracy": 0.0996214747428894, "num_tokens": 3100158.0, "step": 960 }, { "entropy": 7.664905261993408, "epoch": 1.9270729270729272, "grad_norm": 0.84375, "learning_rate": 0.000482, "loss": 7.3969, "mean_token_accuracy": 0.11512965932488442, "num_tokens": 3115996.0, "step": 965 }, { "entropy": 7.791405916213989, "epoch": 1.937062937062937, "grad_norm": 0.8203125, "learning_rate": 0.0004845, "loss": 7.5496, "mean_token_accuracy": 0.10718825981020927, "num_tokens": 3133485.0, "step": 970 }, { "entropy": 7.791155099868774, "epoch": 1.947052947052947, "grad_norm": 0.80859375, "learning_rate": 0.000487, "loss": 7.5339, "mean_token_accuracy": 0.10318816006183625, "num_tokens": 3149142.0, "step": 975 }, { "entropy": 7.657593297958374, "epoch": 1.957042957042957, "grad_norm": 0.85546875, "learning_rate": 0.0004895, "loss": 7.4259, "mean_token_accuracy": 0.10956193283200263, "num_tokens": 3166372.0, "step": 980 }, { "entropy": 7.687391233444214, "epoch": 1.9670329670329672, "grad_norm": 0.859375, "learning_rate": 0.000492, "loss": 7.468, "mean_token_accuracy": 0.10778944343328475, "num_tokens": 3183178.0, "step": 985 }, { "entropy": 7.7009885787963865, "epoch": 1.977022977022977, "grad_norm": 0.8046875, "learning_rate": 0.0004945, "loss": 7.4464, "mean_token_accuracy": 0.10527636632323265, "num_tokens": 3198857.0, "step": 990 }, { "entropy": 7.761457204818726, "epoch": 1.987012987012987, "grad_norm": 0.9765625, "learning_rate": 0.000497, "loss": 7.5091, "mean_token_accuracy": 0.10296362712979316, "num_tokens": 3214704.0, "step": 995 }, { "entropy": 7.7881145000457765, "epoch": 1.997002997002997, "grad_norm": 0.8671875, "learning_rate": 0.0004995, "loss": 7.5984, "mean_token_accuracy": 0.10085872560739517, "num_tokens": 3230647.0, "step": 1000 }, { "epoch": 1.997002997002997, "eval_entropy": 7.486649680782008, "eval_loss": 7.484090328216553, "eval_mean_token_accuracy": 0.10077464044899553, "eval_num_tokens": 3230647.0, "eval_runtime": 1.1798, "eval_samples_per_second": 1249.323, "eval_steps_per_second": 156.801, "step": 1000 }, { "entropy": 7.6556399133470325, "epoch": 2.005994005994006, "grad_norm": 0.8515625, "learning_rate": 0.0004999988896704182, "loss": 7.29, "mean_token_accuracy": 0.11673381593492296, "num_tokens": 3244611.0, "step": 1005 }, { "entropy": 7.653675556182861, "epoch": 2.015984015984016, "grad_norm": 0.796875, "learning_rate": 0.000499994378975273, "loss": 7.2449, "mean_token_accuracy": 0.11277795657515526, "num_tokens": 3261376.0, "step": 1010 }, { "entropy": 7.695202302932739, "epoch": 2.0259740259740258, "grad_norm": 0.8515625, "learning_rate": 0.0004999863985884728, "loss": 7.2594, "mean_token_accuracy": 0.11385115906596184, "num_tokens": 3279410.0, "step": 1015 }, { "entropy": 7.74162712097168, "epoch": 2.035964035964036, "grad_norm": 1.1015625, "learning_rate": 0.000499974948633085, "loss": 7.2755, "mean_token_accuracy": 0.10692020803689957, "num_tokens": 3296012.0, "step": 1020 }, { "entropy": 7.66200361251831, "epoch": 2.045954045954046, "grad_norm": 0.90234375, "learning_rate": 0.000499960029285682, "loss": 7.3217, "mean_token_accuracy": 0.10635951608419418, "num_tokens": 3311851.0, "step": 1025 }, { "entropy": 7.610789680480957, "epoch": 2.055944055944056, "grad_norm": 0.79296875, "learning_rate": 0.0004999416407763387, "loss": 7.2673, "mean_token_accuracy": 0.1137266606092453, "num_tokens": 3328590.0, "step": 1030 }, { "entropy": 7.579310369491577, "epoch": 2.065934065934066, "grad_norm": 0.91796875, "learning_rate": 0.0004999197833886285, "loss": 7.141, "mean_token_accuracy": 0.11897332966327667, "num_tokens": 3345266.0, "step": 1035 }, { "entropy": 7.628687334060669, "epoch": 2.075924075924076, "grad_norm": 0.859375, "learning_rate": 0.0004998944574596196, "loss": 7.2871, "mean_token_accuracy": 0.11039503365755081, "num_tokens": 3361141.0, "step": 1040 }, { "entropy": 7.602729368209839, "epoch": 2.085914085914086, "grad_norm": 0.87109375, "learning_rate": 0.0004998656633798689, "loss": 7.1797, "mean_token_accuracy": 0.11323749721050262, "num_tokens": 3377710.0, "step": 1045 }, { "entropy": 7.550437688827515, "epoch": 2.0959040959040958, "grad_norm": 0.9140625, "learning_rate": 0.0004998334015934169, "loss": 7.285, "mean_token_accuracy": 0.11525188460946083, "num_tokens": 3392504.0, "step": 1050 }, { "entropy": 7.673173427581787, "epoch": 2.105894105894106, "grad_norm": 0.828125, "learning_rate": 0.0004997976725977802, "loss": 7.3127, "mean_token_accuracy": 0.10556894540786743, "num_tokens": 3409907.0, "step": 1055 }, { "entropy": 7.63333158493042, "epoch": 2.115884115884116, "grad_norm": 0.76953125, "learning_rate": 0.000499758476943944, "loss": 7.225, "mean_token_accuracy": 0.11469244211912155, "num_tokens": 3426681.0, "step": 1060 }, { "entropy": 7.532991075515747, "epoch": 2.125874125874126, "grad_norm": 0.8828125, "learning_rate": 0.000499715815236354, "loss": 7.2308, "mean_token_accuracy": 0.11743310615420341, "num_tokens": 3441537.0, "step": 1065 }, { "entropy": 7.663446712493896, "epoch": 2.1358641358641357, "grad_norm": 0.75, "learning_rate": 0.0004996696881329063, "loss": 7.2799, "mean_token_accuracy": 0.10578939393162727, "num_tokens": 3458262.0, "step": 1070 }, { "entropy": 7.667473649978637, "epoch": 2.145854145854146, "grad_norm": 0.8515625, "learning_rate": 0.000499620096344938, "loss": 7.3362, "mean_token_accuracy": 0.10832573622465133, "num_tokens": 3473982.0, "step": 1075 }, { "entropy": 7.614191579818725, "epoch": 2.155844155844156, "grad_norm": 0.9296875, "learning_rate": 0.0004995670406372157, "loss": 7.2587, "mean_token_accuracy": 0.11001512333750725, "num_tokens": 3489555.0, "step": 1080 }, { "entropy": 7.515730094909668, "epoch": 2.1658341658341658, "grad_norm": 0.77734375, "learning_rate": 0.0004995105218279244, "loss": 7.2139, "mean_token_accuracy": 0.11276560798287391, "num_tokens": 3506482.0, "step": 1085 }, { "entropy": 7.633500576019287, "epoch": 2.1758241758241756, "grad_norm": 0.8515625, "learning_rate": 0.0004994505407886536, "loss": 7.2319, "mean_token_accuracy": 0.11254712715744972, "num_tokens": 3521621.0, "step": 1090 }, { "entropy": 7.513222789764404, "epoch": 2.185814185814186, "grad_norm": 0.875, "learning_rate": 0.0004993870984443854, "loss": 7.1932, "mean_token_accuracy": 0.11704366132616997, "num_tokens": 3537485.0, "step": 1095 }, { "entropy": 7.469144868850708, "epoch": 2.195804195804196, "grad_norm": 1.0, "learning_rate": 0.0004993201957734791, "loss": 7.0765, "mean_token_accuracy": 0.13212940245866775, "num_tokens": 3553655.0, "step": 1100 }, { "entropy": 7.512252330780029, "epoch": 2.2057942057942057, "grad_norm": 0.81640625, "learning_rate": 0.0004992498338076567, "loss": 7.1613, "mean_token_accuracy": 0.11379173919558525, "num_tokens": 3568923.0, "step": 1105 }, { "entropy": 7.605458927154541, "epoch": 2.2157842157842156, "grad_norm": 0.86328125, "learning_rate": 0.0004991760136319869, "loss": 7.2288, "mean_token_accuracy": 0.11029125973582268, "num_tokens": 3585133.0, "step": 1110 }, { "entropy": 7.509175157546997, "epoch": 2.225774225774226, "grad_norm": 0.86328125, "learning_rate": 0.0004990987363848678, "loss": 7.279, "mean_token_accuracy": 0.10764828473329544, "num_tokens": 3600494.0, "step": 1115 }, { "entropy": 7.560824632644653, "epoch": 2.2357642357642358, "grad_norm": 0.86328125, "learning_rate": 0.0004990180032580105, "loss": 7.2435, "mean_token_accuracy": 0.11270277500152588, "num_tokens": 3615255.0, "step": 1120 }, { "entropy": 7.499869775772095, "epoch": 2.2457542457542456, "grad_norm": 0.765625, "learning_rate": 0.0004989338154964194, "loss": 7.2064, "mean_token_accuracy": 0.11745749786496162, "num_tokens": 3632558.0, "step": 1125 }, { "entropy": 7.446692943572998, "epoch": 2.255744255744256, "grad_norm": 0.86328125, "learning_rate": 0.000498846174398374, "loss": 7.1456, "mean_token_accuracy": 0.11962621659040451, "num_tokens": 3649348.0, "step": 1130 }, { "entropy": 7.542574071884156, "epoch": 2.265734265734266, "grad_norm": 0.7734375, "learning_rate": 0.0004987550813154086, "loss": 7.2743, "mean_token_accuracy": 0.1114236980676651, "num_tokens": 3665180.0, "step": 1135 }, { "entropy": 7.534678602218628, "epoch": 2.2757242757242757, "grad_norm": 0.75, "learning_rate": 0.0004986605376522912, "loss": 7.2108, "mean_token_accuracy": 0.11057249754667282, "num_tokens": 3682680.0, "step": 1140 }, { "entropy": 7.5682820796966555, "epoch": 2.2857142857142856, "grad_norm": 0.8046875, "learning_rate": 0.0004985625448670019, "loss": 7.3165, "mean_token_accuracy": 0.104947979003191, "num_tokens": 3698807.0, "step": 1145 }, { "entropy": 7.427041101455688, "epoch": 2.2957042957042955, "grad_norm": 0.875, "learning_rate": 0.0004984611044707108, "loss": 7.1514, "mean_token_accuracy": 0.12294234782457351, "num_tokens": 3714408.0, "step": 1150 }, { "entropy": 7.46859130859375, "epoch": 2.305694305694306, "grad_norm": 0.84375, "learning_rate": 0.0004983562180277541, "loss": 7.2044, "mean_token_accuracy": 0.11968692690134049, "num_tokens": 3729290.0, "step": 1155 }, { "entropy": 7.515849208831787, "epoch": 2.3156843156843157, "grad_norm": 0.828125, "learning_rate": 0.0004982478871556107, "loss": 7.201, "mean_token_accuracy": 0.12022968605160714, "num_tokens": 3746501.0, "step": 1160 }, { "entropy": 7.499651145935059, "epoch": 2.3256743256743255, "grad_norm": 0.97265625, "learning_rate": 0.0004981361135248767, "loss": 7.2576, "mean_token_accuracy": 0.11078106462955475, "num_tokens": 3762194.0, "step": 1165 }, { "entropy": 7.601353788375855, "epoch": 2.335664335664336, "grad_norm": 0.75, "learning_rate": 0.0004980208988592395, "loss": 7.2088, "mean_token_accuracy": 0.11249012053012848, "num_tokens": 3779048.0, "step": 1170 }, { "entropy": 7.40687837600708, "epoch": 2.3456543456543457, "grad_norm": 0.76953125, "learning_rate": 0.000497902244935452, "loss": 7.1122, "mean_token_accuracy": 0.12347386628389359, "num_tokens": 3797865.0, "step": 1175 }, { "entropy": 7.581765508651733, "epoch": 2.3556443556443556, "grad_norm": 0.83203125, "learning_rate": 0.0004977801535833045, "loss": 7.1779, "mean_token_accuracy": 0.11289282962679863, "num_tokens": 3813050.0, "step": 1180 }, { "entropy": 7.5143575191497805, "epoch": 2.3656343656343655, "grad_norm": 0.76953125, "learning_rate": 0.0004976546266855965, "loss": 7.211, "mean_token_accuracy": 0.11399794220924378, "num_tokens": 3830277.0, "step": 1185 }, { "entropy": 7.516488695144654, "epoch": 2.375624375624376, "grad_norm": 0.921875, "learning_rate": 0.0004975256661781082, "loss": 7.3304, "mean_token_accuracy": 0.10547359213232994, "num_tokens": 3847221.0, "step": 1190 }, { "entropy": 7.528147983551025, "epoch": 2.3856143856143857, "grad_norm": 0.7421875, "learning_rate": 0.0004973932740495701, "loss": 7.2484, "mean_token_accuracy": 0.10972600281238556, "num_tokens": 3864601.0, "step": 1195 }, { "entropy": 7.4062048435211185, "epoch": 2.3956043956043955, "grad_norm": 0.79296875, "learning_rate": 0.0004972574523416325, "loss": 7.1501, "mean_token_accuracy": 0.11819778755307198, "num_tokens": 3881592.0, "step": 1200 }, { "entropy": 7.444576835632324, "epoch": 2.4055944055944054, "grad_norm": 0.77734375, "learning_rate": 0.0004971182031488343, "loss": 6.993, "mean_token_accuracy": 0.1232140153646469, "num_tokens": 3897334.0, "step": 1205 }, { "entropy": 7.580482769012451, "epoch": 2.4155844155844157, "grad_norm": 0.796875, "learning_rate": 0.0004969755286185703, "loss": 7.3508, "mean_token_accuracy": 0.10700739026069642, "num_tokens": 3913001.0, "step": 1210 }, { "entropy": 7.3618980884552006, "epoch": 2.4255744255744256, "grad_norm": 0.8828125, "learning_rate": 0.0004968294309510582, "loss": 7.0278, "mean_token_accuracy": 0.12532524466514589, "num_tokens": 3928884.0, "step": 1215 }, { "entropy": 7.436668968200683, "epoch": 2.4355644355644355, "grad_norm": 0.9375, "learning_rate": 0.0004966799123993049, "loss": 7.1698, "mean_token_accuracy": 0.11884979307651519, "num_tokens": 3944998.0, "step": 1220 }, { "entropy": 7.505033302307129, "epoch": 2.4455544455544453, "grad_norm": 0.8203125, "learning_rate": 0.0004965269752690713, "loss": 7.2213, "mean_token_accuracy": 0.11796300038695336, "num_tokens": 3960650.0, "step": 1225 }, { "entropy": 7.496581268310547, "epoch": 2.4555444555444557, "grad_norm": 0.8203125, "learning_rate": 0.0004963706219188371, "loss": 7.2368, "mean_token_accuracy": 0.11497806310653687, "num_tokens": 3976718.0, "step": 1230 }, { "entropy": 7.4178626537323, "epoch": 2.4655344655344655, "grad_norm": 0.90625, "learning_rate": 0.0004962108547597643, "loss": 7.2299, "mean_token_accuracy": 0.11304686814546586, "num_tokens": 3991637.0, "step": 1235 }, { "entropy": 7.496812868118286, "epoch": 2.4755244755244754, "grad_norm": 1.234375, "learning_rate": 0.0004960476762556604, "loss": 7.1167, "mean_token_accuracy": 0.11393559798598289, "num_tokens": 4007493.0, "step": 1240 }, { "entropy": 7.37399730682373, "epoch": 2.4855144855144857, "grad_norm": 0.890625, "learning_rate": 0.0004958810889229397, "loss": 7.1558, "mean_token_accuracy": 0.11833534240722657, "num_tokens": 4022983.0, "step": 1245 }, { "entropy": 7.5273942947387695, "epoch": 2.4955044955044956, "grad_norm": 0.8515625, "learning_rate": 0.0004957110953305849, "loss": 7.2263, "mean_token_accuracy": 0.11028133109211921, "num_tokens": 4038559.0, "step": 1250 }, { "entropy": 7.440155124664306, "epoch": 2.5054945054945055, "grad_norm": 0.8046875, "learning_rate": 0.0004955376981001076, "loss": 7.1248, "mean_token_accuracy": 0.1180120624601841, "num_tokens": 4054340.0, "step": 1255 }, { "entropy": 7.443907403945923, "epoch": 2.5154845154845153, "grad_norm": 0.73046875, "learning_rate": 0.0004953608999055073, "loss": 7.2768, "mean_token_accuracy": 0.12213831841945648, "num_tokens": 4070874.0, "step": 1260 }, { "entropy": 7.441350984573364, "epoch": 2.5254745254745252, "grad_norm": 0.82421875, "learning_rate": 0.0004951807034732313, "loss": 7.1956, "mean_token_accuracy": 0.11365060582756996, "num_tokens": 4087260.0, "step": 1265 }, { "entropy": 7.531669092178345, "epoch": 2.5354645354645355, "grad_norm": 0.85546875, "learning_rate": 0.0004949971115821311, "loss": 7.1972, "mean_token_accuracy": 0.11016765534877777, "num_tokens": 4103304.0, "step": 1270 }, { "entropy": 7.416958332061768, "epoch": 2.5454545454545454, "grad_norm": 0.83984375, "learning_rate": 0.000494810127063421, "loss": 7.1911, "mean_token_accuracy": 0.11271554231643677, "num_tokens": 4118386.0, "step": 1275 }, { "entropy": 7.376313781738281, "epoch": 2.5554445554445553, "grad_norm": 0.83203125, "learning_rate": 0.0004946197528006335, "loss": 7.1907, "mean_token_accuracy": 0.11462600603699684, "num_tokens": 4136240.0, "step": 1280 }, { "entropy": 7.443999099731445, "epoch": 2.5654345654345656, "grad_norm": 1.1875, "learning_rate": 0.0004944259917295752, "loss": 7.0267, "mean_token_accuracy": 0.12695256918668746, "num_tokens": 4152756.0, "step": 1285 }, { "entropy": 7.382719278335571, "epoch": 2.5754245754245755, "grad_norm": 0.78515625, "learning_rate": 0.0004942288468382818, "loss": 7.2156, "mean_token_accuracy": 0.11339443400502205, "num_tokens": 4169482.0, "step": 1290 }, { "entropy": 7.495740270614624, "epoch": 2.5854145854145854, "grad_norm": 0.953125, "learning_rate": 0.000494028321166971, "loss": 7.1848, "mean_token_accuracy": 0.11903136670589447, "num_tokens": 4184571.0, "step": 1295 }, { "entropy": 7.405131435394287, "epoch": 2.5954045954045952, "grad_norm": 0.828125, "learning_rate": 0.000493824417807997, "loss": 7.088, "mean_token_accuracy": 0.11924583464860916, "num_tokens": 4199725.0, "step": 1300 }, { "entropy": 7.374294948577881, "epoch": 2.6053946053946055, "grad_norm": 0.78125, "learning_rate": 0.0004936171399058017, "loss": 7.1561, "mean_token_accuracy": 0.11412992551922799, "num_tokens": 4216309.0, "step": 1305 }, { "entropy": 7.4032941341400145, "epoch": 2.6153846153846154, "grad_norm": 0.81640625, "learning_rate": 0.0004934064906568668, "loss": 7.1233, "mean_token_accuracy": 0.11502180323004722, "num_tokens": 4230699.0, "step": 1310 }, { "entropy": 7.350087738037109, "epoch": 2.6253746253746253, "grad_norm": 0.8046875, "learning_rate": 0.0004931924733096642, "loss": 7.0452, "mean_token_accuracy": 0.12624117210507393, "num_tokens": 4248243.0, "step": 1315 }, { "entropy": 7.364322996139526, "epoch": 2.6353646353646356, "grad_norm": 0.8203125, "learning_rate": 0.0004929750911646063, "loss": 7.2285, "mean_token_accuracy": 0.11374544575810433, "num_tokens": 4265412.0, "step": 1320 }, { "entropy": 7.47800087928772, "epoch": 2.6453546453546455, "grad_norm": 0.79296875, "learning_rate": 0.0004927543475739947, "loss": 7.1683, "mean_token_accuracy": 0.10902340710163116, "num_tokens": 4281230.0, "step": 1325 }, { "entropy": 7.408435869216919, "epoch": 2.6553446553446554, "grad_norm": 0.82421875, "learning_rate": 0.0004925302459419686, "loss": 7.2304, "mean_token_accuracy": 0.11668918058276176, "num_tokens": 4297593.0, "step": 1330 }, { "entropy": 7.357152318954467, "epoch": 2.6653346653346652, "grad_norm": 0.6875, "learning_rate": 0.0004923027897244524, "loss": 7.1477, "mean_token_accuracy": 0.11671698242425918, "num_tokens": 4314370.0, "step": 1335 }, { "entropy": 7.425278186798096, "epoch": 2.675324675324675, "grad_norm": 0.79296875, "learning_rate": 0.0004920719824291022, "loss": 7.1329, "mean_token_accuracy": 0.12105752229690551, "num_tokens": 4329867.0, "step": 1340 }, { "entropy": 7.410067939758301, "epoch": 2.6853146853146854, "grad_norm": 0.86328125, "learning_rate": 0.0004918378276152522, "loss": 7.1883, "mean_token_accuracy": 0.11553000509738923, "num_tokens": 4346849.0, "step": 1345 }, { "entropy": 7.3710705757141115, "epoch": 2.6953046953046953, "grad_norm": 0.828125, "learning_rate": 0.0004916003288938592, "loss": 7.1308, "mean_token_accuracy": 0.12287419214844704, "num_tokens": 4362591.0, "step": 1350 }, { "entropy": 7.361244201660156, "epoch": 2.705294705294705, "grad_norm": 0.81640625, "learning_rate": 0.0004913594899274474, "loss": 7.0903, "mean_token_accuracy": 0.12431644871830941, "num_tokens": 4378703.0, "step": 1355 }, { "entropy": 7.40083589553833, "epoch": 2.7152847152847155, "grad_norm": 0.85546875, "learning_rate": 0.0004911153144300515, "loss": 7.2019, "mean_token_accuracy": 0.11094269454479218, "num_tokens": 4394967.0, "step": 1360 }, { "entropy": 7.332432651519776, "epoch": 2.7252747252747254, "grad_norm": 0.87890625, "learning_rate": 0.0004908678061671597, "loss": 7.0549, "mean_token_accuracy": 0.12529401928186418, "num_tokens": 4411373.0, "step": 1365 }, { "entropy": 7.3352560043334964, "epoch": 2.7352647352647352, "grad_norm": 0.79296875, "learning_rate": 0.0004906169689556557, "loss": 6.9679, "mean_token_accuracy": 0.129734043776989, "num_tokens": 4427681.0, "step": 1370 }, { "entropy": 7.2624828815460205, "epoch": 2.745254745254745, "grad_norm": 0.84765625, "learning_rate": 0.0004903628066637594, "loss": 7.077, "mean_token_accuracy": 0.12157689854502678, "num_tokens": 4443423.0, "step": 1375 }, { "entropy": 7.387901639938354, "epoch": 2.755244755244755, "grad_norm": 0.8203125, "learning_rate": 0.0004901053232109679, "loss": 7.1599, "mean_token_accuracy": 0.10635504648089408, "num_tokens": 4460698.0, "step": 1380 }, { "entropy": 7.348285722732544, "epoch": 2.7652347652347653, "grad_norm": 0.99609375, "learning_rate": 0.0004898445225679948, "loss": 7.0845, "mean_token_accuracy": 0.11898298934102058, "num_tokens": 4475307.0, "step": 1385 }, { "entropy": 7.374725580215454, "epoch": 2.775224775224775, "grad_norm": 0.75, "learning_rate": 0.000489580408756708, "loss": 7.1782, "mean_token_accuracy": 0.11079153269529343, "num_tokens": 4492766.0, "step": 1390 }, { "entropy": 7.394331741333008, "epoch": 2.785214785214785, "grad_norm": 0.81640625, "learning_rate": 0.0004893129858500699, "loss": 7.1781, "mean_token_accuracy": 0.11092816591262818, "num_tokens": 4508446.0, "step": 1395 }, { "entropy": 7.364388179779053, "epoch": 2.7952047952047954, "grad_norm": 0.74609375, "learning_rate": 0.0004890422579720722, "loss": 7.1235, "mean_token_accuracy": 0.11798743531107903, "num_tokens": 4525208.0, "step": 1400 }, { "entropy": 7.394073629379273, "epoch": 2.8051948051948052, "grad_norm": 0.85546875, "learning_rate": 0.0004887682292976736, "loss": 7.0839, "mean_token_accuracy": 0.12236481755971909, "num_tokens": 4541638.0, "step": 1405 }, { "entropy": 7.301909923553467, "epoch": 2.815184815184815, "grad_norm": 0.8125, "learning_rate": 0.0004884909040527355, "loss": 7.1186, "mean_token_accuracy": 0.11743888035416603, "num_tokens": 4557541.0, "step": 1410 }, { "entropy": 7.287791633605957, "epoch": 2.825174825174825, "grad_norm": 0.83984375, "learning_rate": 0.000488210286513956, "loss": 6.9349, "mean_token_accuracy": 0.12849488556385041, "num_tokens": 4573658.0, "step": 1415 }, { "entropy": 7.36132926940918, "epoch": 2.8351648351648353, "grad_norm": 0.90625, "learning_rate": 0.00048792638100880487, "loss": 7.0927, "mean_token_accuracy": 0.12357950136065483, "num_tokens": 4587683.0, "step": 1420 }, { "entropy": 7.418003797531128, "epoch": 2.845154845154845, "grad_norm": 0.92578125, "learning_rate": 0.00048763919191545607, "loss": 7.1074, "mean_token_accuracy": 0.12282117158174514, "num_tokens": 4603983.0, "step": 1425 }, { "entropy": 7.308845472335816, "epoch": 2.855144855144855, "grad_norm": 0.73046875, "learning_rate": 0.0004873487236627208, "loss": 7.1999, "mean_token_accuracy": 0.1132714070379734, "num_tokens": 4620925.0, "step": 1430 }, { "entropy": 7.363225841522217, "epoch": 2.8651348651348654, "grad_norm": 0.85546875, "learning_rate": 0.0004870549807299788, "loss": 7.0209, "mean_token_accuracy": 0.11996846571564675, "num_tokens": 4639214.0, "step": 1435 }, { "entropy": 7.384830951690674, "epoch": 2.8751248751248752, "grad_norm": 0.74609375, "learning_rate": 0.00048675796764710946, "loss": 7.2084, "mean_token_accuracy": 0.11239797696471214, "num_tokens": 4655289.0, "step": 1440 }, { "entropy": 7.336945819854736, "epoch": 2.885114885114885, "grad_norm": 0.80078125, "learning_rate": 0.00048645768899442194, "loss": 7.1117, "mean_token_accuracy": 0.10905599966645241, "num_tokens": 4669773.0, "step": 1445 }, { "entropy": 7.397378444671631, "epoch": 2.895104895104895, "grad_norm": 0.859375, "learning_rate": 0.0004861541494025845, "loss": 7.0236, "mean_token_accuracy": 0.12204516381025314, "num_tokens": 4685548.0, "step": 1450 }, { "entropy": 7.3122090816497805, "epoch": 2.905094905094905, "grad_norm": 0.80859375, "learning_rate": 0.00048584735355255325, "loss": 7.1617, "mean_token_accuracy": 0.10954023897647858, "num_tokens": 4701784.0, "step": 1455 }, { "entropy": 7.368370532989502, "epoch": 2.915084915084915, "grad_norm": 0.8515625, "learning_rate": 0.00048553730617549964, "loss": 7.1356, "mean_token_accuracy": 0.11558711975812912, "num_tokens": 4717140.0, "step": 1460 }, { "entropy": 7.350918292999268, "epoch": 2.925074925074925, "grad_norm": 0.89453125, "learning_rate": 0.00048522401205273774, "loss": 7.1422, "mean_token_accuracy": 0.11404822468757629, "num_tokens": 4732369.0, "step": 1465 }, { "entropy": 7.320491886138916, "epoch": 2.935064935064935, "grad_norm": 0.8359375, "learning_rate": 0.00048490747601565053, "loss": 7.0975, "mean_token_accuracy": 0.11320897936820984, "num_tokens": 4749723.0, "step": 1470 }, { "entropy": 7.263767099380493, "epoch": 2.9450549450549453, "grad_norm": 0.74609375, "learning_rate": 0.00048458770294561526, "loss": 7.0367, "mean_token_accuracy": 0.1221166156232357, "num_tokens": 4765553.0, "step": 1475 }, { "entropy": 7.377514219284057, "epoch": 2.955044955044955, "grad_norm": 0.8046875, "learning_rate": 0.0004842646977739283, "loss": 7.0588, "mean_token_accuracy": 0.12238560244441032, "num_tokens": 4781903.0, "step": 1480 }, { "entropy": 7.329219675064087, "epoch": 2.965034965034965, "grad_norm": 0.796875, "learning_rate": 0.00048393846548172895, "loss": 7.0711, "mean_token_accuracy": 0.12050119936466216, "num_tokens": 4798075.0, "step": 1485 }, { "entropy": 7.306816673278808, "epoch": 2.975024975024975, "grad_norm": 0.8359375, "learning_rate": 0.0004836090110999226, "loss": 7.0557, "mean_token_accuracy": 0.1145715981721878, "num_tokens": 4813257.0, "step": 1490 }, { "entropy": 7.298364782333374, "epoch": 2.9850149850149847, "grad_norm": 0.796875, "learning_rate": 0.0004832763397091036, "loss": 7.054, "mean_token_accuracy": 0.11942759305238723, "num_tokens": 4829007.0, "step": 1495 }, { "entropy": 7.404904127120972, "epoch": 2.995004995004995, "grad_norm": 0.78515625, "learning_rate": 0.0004829404564394762, "loss": 7.1255, "mean_token_accuracy": 0.1147141508758068, "num_tokens": 4845449.0, "step": 1500 }, { "epoch": 2.995004995004995, "eval_entropy": 7.222840590090365, "eval_loss": 7.199999809265137, "eval_mean_token_accuracy": 0.1078420261676247, "eval_num_tokens": 4845449.0, "eval_runtime": 1.1727, "eval_samples_per_second": 1256.93, "eval_steps_per_second": 157.756, "step": 1500 }, { "entropy": 7.309990617964003, "epoch": 3.003996003996004, "grad_norm": 0.796875, "learning_rate": 0.00048260136647077585, "loss": 6.9455, "mean_token_accuracy": 0.11805139068100187, "num_tokens": 4858156.0, "step": 1505 }, { "entropy": 7.340683937072754, "epoch": 3.013986013986014, "grad_norm": 0.83203125, "learning_rate": 0.00048225907503218946, "loss": 6.8138, "mean_token_accuracy": 0.12144542708992959, "num_tokens": 4873172.0, "step": 1510 }, { "entropy": 7.257332801818848, "epoch": 3.023976023976024, "grad_norm": 0.796875, "learning_rate": 0.00048191358740227444, "loss": 6.7052, "mean_token_accuracy": 0.1332525998353958, "num_tokens": 4890921.0, "step": 1515 }, { "entropy": 7.281058216094971, "epoch": 3.033966033966034, "grad_norm": 0.78515625, "learning_rate": 0.0004815649089088774, "loss": 6.7754, "mean_token_accuracy": 0.12657968327403069, "num_tokens": 4905468.0, "step": 1520 }, { "entropy": 7.217862558364868, "epoch": 3.043956043956044, "grad_norm": 0.79296875, "learning_rate": 0.00048121304492905204, "loss": 6.7605, "mean_token_accuracy": 0.12102149054408073, "num_tokens": 4922178.0, "step": 1525 }, { "entropy": 7.316258478164673, "epoch": 3.053946053946054, "grad_norm": 0.84765625, "learning_rate": 0.0004808580008889762, "loss": 6.7796, "mean_token_accuracy": 0.12334605678915977, "num_tokens": 4937049.0, "step": 1530 }, { "entropy": 7.201441478729248, "epoch": 3.063936063936064, "grad_norm": 0.828125, "learning_rate": 0.0004804997822638683, "loss": 6.773, "mean_token_accuracy": 0.12532677873969078, "num_tokens": 4952697.0, "step": 1535 }, { "entropy": 7.281438684463501, "epoch": 3.073926073926074, "grad_norm": 0.76171875, "learning_rate": 0.00048013839457790243, "loss": 6.7791, "mean_token_accuracy": 0.11991386488080025, "num_tokens": 4968075.0, "step": 1540 }, { "entropy": 7.282547283172607, "epoch": 3.0839160839160837, "grad_norm": 0.96875, "learning_rate": 0.00047977384340412406, "loss": 6.6729, "mean_token_accuracy": 0.12937781289219857, "num_tokens": 4984003.0, "step": 1545 }, { "entropy": 7.2246640682220455, "epoch": 3.093906093906094, "grad_norm": 1.1484375, "learning_rate": 0.00047940613436436304, "loss": 6.7624, "mean_token_accuracy": 0.12386809512972832, "num_tokens": 5000054.0, "step": 1550 }, { "entropy": 7.20565242767334, "epoch": 3.103896103896104, "grad_norm": 0.76171875, "learning_rate": 0.00047903527312914777, "loss": 6.6738, "mean_token_accuracy": 0.12883116900920868, "num_tokens": 5017097.0, "step": 1555 }, { "entropy": 7.172371339797974, "epoch": 3.113886113886114, "grad_norm": 0.76171875, "learning_rate": 0.0004786612654176171, "loss": 6.7014, "mean_token_accuracy": 0.12019376754760742, "num_tokens": 5032868.0, "step": 1560 }, { "entropy": 7.188371467590332, "epoch": 3.1238761238761237, "grad_norm": 0.91796875, "learning_rate": 0.00047828411699743284, "loss": 6.7086, "mean_token_accuracy": 0.13077392801642418, "num_tokens": 5049897.0, "step": 1565 }, { "entropy": 7.309192419052124, "epoch": 3.133866133866134, "grad_norm": 0.80078125, "learning_rate": 0.00047790383368469003, "loss": 6.8366, "mean_token_accuracy": 0.11674531251192093, "num_tokens": 5065611.0, "step": 1570 }, { "entropy": 7.28448896408081, "epoch": 3.143856143856144, "grad_norm": 0.84375, "learning_rate": 0.0004775204213438279, "loss": 6.8225, "mean_token_accuracy": 0.12474308311939239, "num_tokens": 5082059.0, "step": 1575 }, { "entropy": 7.264940309524536, "epoch": 3.1538461538461537, "grad_norm": 0.8828125, "learning_rate": 0.0004771338858875389, "loss": 6.8255, "mean_token_accuracy": 0.11197493076324463, "num_tokens": 5097893.0, "step": 1580 }, { "entropy": 7.158958482742309, "epoch": 3.163836163836164, "grad_norm": 0.87109375, "learning_rate": 0.0004767442332766781, "loss": 6.6944, "mean_token_accuracy": 0.14125925526022912, "num_tokens": 5116091.0, "step": 1585 }, { "entropy": 7.182612323760987, "epoch": 3.173826173826174, "grad_norm": 0.8359375, "learning_rate": 0.0004763514695201706, "loss": 6.7438, "mean_token_accuracy": 0.1299310527741909, "num_tokens": 5132251.0, "step": 1590 }, { "entropy": 7.098526906967163, "epoch": 3.183816183816184, "grad_norm": 0.90625, "learning_rate": 0.00047595560067491955, "loss": 6.6708, "mean_token_accuracy": 0.13742291927337646, "num_tokens": 5147909.0, "step": 1595 }, { "entropy": 7.198202323913574, "epoch": 3.1938061938061937, "grad_norm": 0.94921875, "learning_rate": 0.0004755566328457122, "loss": 6.7299, "mean_token_accuracy": 0.12709784805774688, "num_tokens": 5163932.0, "step": 1600 }, { "entropy": 7.182046699523926, "epoch": 3.203796203796204, "grad_norm": 0.80078125, "learning_rate": 0.0004751545721851261, "loss": 6.7269, "mean_token_accuracy": 0.12986161783337594, "num_tokens": 5180177.0, "step": 1605 }, { "entropy": 7.191233539581299, "epoch": 3.213786213786214, "grad_norm": 0.83203125, "learning_rate": 0.0004747494248934338, "loss": 6.7791, "mean_token_accuracy": 0.12523868530988694, "num_tokens": 5195700.0, "step": 1610 }, { "entropy": 7.228579568862915, "epoch": 3.2237762237762237, "grad_norm": 0.875, "learning_rate": 0.0004743411972185079, "loss": 6.7803, "mean_token_accuracy": 0.12069911062717438, "num_tokens": 5211333.0, "step": 1615 }, { "entropy": 7.109642553329468, "epoch": 3.2337662337662336, "grad_norm": 0.8671875, "learning_rate": 0.0004739298954557241, "loss": 6.7349, "mean_token_accuracy": 0.12927734106779099, "num_tokens": 5227284.0, "step": 1620 }, { "entropy": 7.165005779266357, "epoch": 3.243756243756244, "grad_norm": 0.8671875, "learning_rate": 0.0004735155259478645, "loss": 6.7535, "mean_token_accuracy": 0.13313452303409576, "num_tokens": 5243421.0, "step": 1625 }, { "entropy": 7.205034351348877, "epoch": 3.253746253746254, "grad_norm": 1.046875, "learning_rate": 0.0004730980950850193, "loss": 6.8124, "mean_token_accuracy": 0.12308995798230171, "num_tokens": 5260635.0, "step": 1630 }, { "entropy": 7.242312574386597, "epoch": 3.2637362637362637, "grad_norm": 0.92578125, "learning_rate": 0.000472677609304489, "loss": 6.8308, "mean_token_accuracy": 0.12062100619077683, "num_tokens": 5276940.0, "step": 1635 }, { "entropy": 7.175618886947632, "epoch": 3.2737262737262736, "grad_norm": 0.8359375, "learning_rate": 0.00047225407509068434, "loss": 6.8487, "mean_token_accuracy": 0.12380371615290642, "num_tokens": 5292901.0, "step": 1640 }, { "entropy": 7.139540910720825, "epoch": 3.283716283716284, "grad_norm": 0.921875, "learning_rate": 0.0004718274989750269, "loss": 6.6743, "mean_token_accuracy": 0.12544595673680306, "num_tokens": 5309142.0, "step": 1645 }, { "entropy": 7.211938428878784, "epoch": 3.2937062937062938, "grad_norm": 0.921875, "learning_rate": 0.0004713978875358481, "loss": 6.8071, "mean_token_accuracy": 0.1265795908868313, "num_tokens": 5325647.0, "step": 1650 }, { "entropy": 7.0457368850708, "epoch": 3.3036963036963036, "grad_norm": 0.80859375, "learning_rate": 0.00047096524739828773, "loss": 6.6749, "mean_token_accuracy": 0.13383058980107307, "num_tokens": 5343508.0, "step": 1655 }, { "entropy": 7.2579505443573, "epoch": 3.3136863136863135, "grad_norm": 1.0, "learning_rate": 0.0004705295852341919, "loss": 6.8725, "mean_token_accuracy": 0.11918435022234916, "num_tokens": 5360304.0, "step": 1660 }, { "entropy": 7.1316554069519045, "epoch": 3.323676323676324, "grad_norm": 0.93359375, "learning_rate": 0.00047009090776201025, "loss": 6.7665, "mean_token_accuracy": 0.1313614435493946, "num_tokens": 5375900.0, "step": 1665 }, { "entropy": 7.106399965286255, "epoch": 3.3336663336663337, "grad_norm": 0.88671875, "learning_rate": 0.000469649221746692, "loss": 6.6452, "mean_token_accuracy": 0.1318917080760002, "num_tokens": 5392561.0, "step": 1670 }, { "entropy": 7.146276998519897, "epoch": 3.3436563436563436, "grad_norm": 0.78125, "learning_rate": 0.00046920453399958183, "loss": 6.8447, "mean_token_accuracy": 0.11955956816673279, "num_tokens": 5408621.0, "step": 1675 }, { "entropy": 7.1728660583496096, "epoch": 3.3536463536463534, "grad_norm": 0.84375, "learning_rate": 0.00046875685137831504, "loss": 6.8166, "mean_token_accuracy": 0.12094830945134163, "num_tokens": 5425233.0, "step": 1680 }, { "entropy": 7.126680326461792, "epoch": 3.3636363636363638, "grad_norm": 0.87109375, "learning_rate": 0.0004683061807867113, "loss": 6.7252, "mean_token_accuracy": 0.12711559012532234, "num_tokens": 5440711.0, "step": 1685 }, { "entropy": 7.179180097579956, "epoch": 3.3736263736263736, "grad_norm": 0.86328125, "learning_rate": 0.00046785252917466876, "loss": 6.7219, "mean_token_accuracy": 0.13417968526482582, "num_tokens": 5456876.0, "step": 1690 }, { "entropy": 7.169342565536499, "epoch": 3.3836163836163835, "grad_norm": 0.9296875, "learning_rate": 0.0004673959035380564, "loss": 6.711, "mean_token_accuracy": 0.12825691401958467, "num_tokens": 5471508.0, "step": 1695 }, { "entropy": 7.093486499786377, "epoch": 3.393606393606394, "grad_norm": 0.82421875, "learning_rate": 0.0004669363109186065, "loss": 6.7385, "mean_token_accuracy": 0.13329153656959533, "num_tokens": 5487538.0, "step": 1700 }, { "entropy": 7.131129884719849, "epoch": 3.4035964035964037, "grad_norm": 0.90625, "learning_rate": 0.0004664737584038057, "loss": 6.79, "mean_token_accuracy": 0.12501160874962808, "num_tokens": 5504743.0, "step": 1705 }, { "entropy": 7.080353593826294, "epoch": 3.4135864135864136, "grad_norm": 0.86328125, "learning_rate": 0.000466008253126786, "loss": 6.7621, "mean_token_accuracy": 0.12809988111257553, "num_tokens": 5521316.0, "step": 1710 }, { "entropy": 7.203873348236084, "epoch": 3.4235764235764234, "grad_norm": 0.86328125, "learning_rate": 0.00046553980226621467, "loss": 6.7941, "mean_token_accuracy": 0.12308660298585891, "num_tokens": 5537219.0, "step": 1715 }, { "entropy": 7.163216590881348, "epoch": 3.4335664335664333, "grad_norm": 0.85546875, "learning_rate": 0.0004650684130461834, "loss": 6.7394, "mean_token_accuracy": 0.12020886838436126, "num_tokens": 5553169.0, "step": 1720 }, { "entropy": 7.2141258239746096, "epoch": 3.4435564435564436, "grad_norm": 0.921875, "learning_rate": 0.00046459409273609726, "loss": 6.8279, "mean_token_accuracy": 0.12372163832187652, "num_tokens": 5567737.0, "step": 1725 }, { "entropy": 7.132944536209107, "epoch": 3.4535464535464535, "grad_norm": 0.8671875, "learning_rate": 0.0004641168486505621, "loss": 6.8364, "mean_token_accuracy": 0.12375331446528434, "num_tokens": 5582895.0, "step": 1730 }, { "entropy": 7.04546890258789, "epoch": 3.4635364635364634, "grad_norm": 0.7734375, "learning_rate": 0.00046363668814927196, "loss": 6.6477, "mean_token_accuracy": 0.14077948927879333, "num_tokens": 5600052.0, "step": 1735 }, { "entropy": 7.043627214431763, "epoch": 3.4735264735264737, "grad_norm": 0.734375, "learning_rate": 0.000463153618636896, "loss": 6.5844, "mean_token_accuracy": 0.1464115023612976, "num_tokens": 5616457.0, "step": 1740 }, { "entropy": 7.180050802230835, "epoch": 3.4835164835164836, "grad_norm": 0.78125, "learning_rate": 0.00046266764756296353, "loss": 6.9142, "mean_token_accuracy": 0.11584651321172715, "num_tokens": 5633882.0, "step": 1745 }, { "entropy": 7.109540557861328, "epoch": 3.4935064935064934, "grad_norm": 0.87890625, "learning_rate": 0.0004621787824217497, "loss": 6.7533, "mean_token_accuracy": 0.12787417694926262, "num_tokens": 5650569.0, "step": 1750 }, { "entropy": 7.095486402511597, "epoch": 3.5034965034965033, "grad_norm": 0.8515625, "learning_rate": 0.00046168703075215984, "loss": 6.7958, "mean_token_accuracy": 0.12227514982223511, "num_tokens": 5667246.0, "step": 1755 }, { "entropy": 7.170636796951294, "epoch": 3.5134865134865136, "grad_norm": 0.8671875, "learning_rate": 0.00046119240013761296, "loss": 6.8479, "mean_token_accuracy": 0.12106348723173141, "num_tokens": 5683335.0, "step": 1760 }, { "entropy": 7.064558315277099, "epoch": 3.5234765234765235, "grad_norm": 0.83203125, "learning_rate": 0.00046069489820592494, "loss": 6.7356, "mean_token_accuracy": 0.12260126546025277, "num_tokens": 5698788.0, "step": 1765 }, { "entropy": 7.176153135299683, "epoch": 3.5334665334665334, "grad_norm": 0.8515625, "learning_rate": 0.0004601945326291911, "loss": 6.6829, "mean_token_accuracy": 0.13431058302521706, "num_tokens": 5714442.0, "step": 1770 }, { "entropy": 7.022355699539185, "epoch": 3.5434565434565437, "grad_norm": 0.79296875, "learning_rate": 0.0004596913111236676, "loss": 6.7178, "mean_token_accuracy": 0.13559423461556436, "num_tokens": 5732474.0, "step": 1775 }, { "entropy": 7.124798107147217, "epoch": 3.5534465534465536, "grad_norm": 0.76953125, "learning_rate": 0.00045918524144965256, "loss": 6.7885, "mean_token_accuracy": 0.12556643784046173, "num_tokens": 5750106.0, "step": 1780 }, { "entropy": 7.197141981124878, "epoch": 3.5634365634365635, "grad_norm": 0.87890625, "learning_rate": 0.00045867633141136643, "loss": 6.7928, "mean_token_accuracy": 0.12685323283076286, "num_tokens": 5766190.0, "step": 1785 }, { "entropy": 7.097241735458374, "epoch": 3.5734265734265733, "grad_norm": 0.90234375, "learning_rate": 0.0004581645888568314, "loss": 6.8304, "mean_token_accuracy": 0.11702406927943229, "num_tokens": 5781470.0, "step": 1790 }, { "entropy": 7.181303644180298, "epoch": 3.583416583416583, "grad_norm": 0.80859375, "learning_rate": 0.000457650021677751, "loss": 6.8001, "mean_token_accuracy": 0.12274287939071656, "num_tokens": 5796113.0, "step": 1795 }, { "entropy": 7.104009628295898, "epoch": 3.5934065934065935, "grad_norm": 0.890625, "learning_rate": 0.00045713263780938746, "loss": 6.7815, "mean_token_accuracy": 0.12324125319719315, "num_tokens": 5811353.0, "step": 1800 }, { "entropy": 7.124893665313721, "epoch": 3.6033966033966034, "grad_norm": 0.84765625, "learning_rate": 0.00045661244523044004, "loss": 6.7562, "mean_token_accuracy": 0.12621590569615365, "num_tokens": 5827293.0, "step": 1805 }, { "entropy": 7.037387800216675, "epoch": 3.6133866133866133, "grad_norm": 0.8203125, "learning_rate": 0.000456089451962922, "loss": 6.7026, "mean_token_accuracy": 0.13180168494582176, "num_tokens": 5842089.0, "step": 1810 }, { "entropy": 7.140062618255615, "epoch": 3.6233766233766236, "grad_norm": 0.88671875, "learning_rate": 0.0004555636660720363, "loss": 6.8578, "mean_token_accuracy": 0.11671878173947334, "num_tokens": 5858609.0, "step": 1815 }, { "entropy": 7.031110954284668, "epoch": 3.6333666333666335, "grad_norm": 0.8671875, "learning_rate": 0.000455035095666052, "loss": 6.6328, "mean_token_accuracy": 0.14110387042164801, "num_tokens": 5876041.0, "step": 1820 }, { "entropy": 6.971533203125, "epoch": 3.6433566433566433, "grad_norm": 0.9375, "learning_rate": 0.00045450374889617845, "loss": 6.6081, "mean_token_accuracy": 0.14888231158256532, "num_tokens": 5892310.0, "step": 1825 }, { "entropy": 7.1198341846466064, "epoch": 3.653346653346653, "grad_norm": 0.83203125, "learning_rate": 0.0004539696339564404, "loss": 6.8253, "mean_token_accuracy": 0.11925003081560134, "num_tokens": 5908890.0, "step": 1830 }, { "entropy": 7.0790997505187985, "epoch": 3.663336663336663, "grad_norm": 0.8828125, "learning_rate": 0.00045343275908355055, "loss": 6.6573, "mean_token_accuracy": 0.1363980256021023, "num_tokens": 5924277.0, "step": 1835 }, { "entropy": 6.964910411834717, "epoch": 3.6733266733266734, "grad_norm": 0.80859375, "learning_rate": 0.00045289313255678386, "loss": 6.676, "mean_token_accuracy": 0.1379535473883152, "num_tokens": 5942177.0, "step": 1840 }, { "entropy": 7.128736352920532, "epoch": 3.6833166833166833, "grad_norm": 0.90234375, "learning_rate": 0.000452350762697849, "loss": 6.7822, "mean_token_accuracy": 0.11843417510390282, "num_tokens": 5957797.0, "step": 1845 }, { "entropy": 7.127052879333496, "epoch": 3.693306693306693, "grad_norm": 0.91796875, "learning_rate": 0.00045180565787076, "loss": 6.7712, "mean_token_accuracy": 0.1192670740187168, "num_tokens": 5974816.0, "step": 1850 }, { "entropy": 7.10209698677063, "epoch": 3.7032967032967035, "grad_norm": 0.85546875, "learning_rate": 0.0004512578264817076, "loss": 6.7463, "mean_token_accuracy": 0.1253843389451504, "num_tokens": 5990247.0, "step": 1855 }, { "entropy": 7.069775342941284, "epoch": 3.7132867132867133, "grad_norm": 0.93359375, "learning_rate": 0.00045070727697892954, "loss": 6.7733, "mean_token_accuracy": 0.1255517013370991, "num_tokens": 6007235.0, "step": 1860 }, { "entropy": 7.112951135635376, "epoch": 3.723276723276723, "grad_norm": 0.84765625, "learning_rate": 0.00045015401785258034, "loss": 6.66, "mean_token_accuracy": 0.135778945684433, "num_tokens": 6023449.0, "step": 1865 }, { "entropy": 7.058276891708374, "epoch": 3.733266733266733, "grad_norm": 0.87890625, "learning_rate": 0.00044959805763459995, "loss": 6.7356, "mean_token_accuracy": 0.12650015875697135, "num_tokens": 6039699.0, "step": 1870 }, { "entropy": 7.1094402313232425, "epoch": 3.7432567432567434, "grad_norm": 0.86328125, "learning_rate": 0.00044903940489858274, "loss": 6.7886, "mean_token_accuracy": 0.12622693479061126, "num_tokens": 6055186.0, "step": 1875 }, { "entropy": 7.06230583190918, "epoch": 3.7532467532467533, "grad_norm": 0.84375, "learning_rate": 0.00044847806825964505, "loss": 6.7806, "mean_token_accuracy": 0.12709858492016793, "num_tokens": 6070413.0, "step": 1880 }, { "entropy": 7.0569939613342285, "epoch": 3.763236763236763, "grad_norm": 0.91796875, "learning_rate": 0.0004479140563742922, "loss": 6.7905, "mean_token_accuracy": 0.12550225779414176, "num_tokens": 6086140.0, "step": 1885 }, { "entropy": 7.120326662063599, "epoch": 3.7732267732267735, "grad_norm": 0.87109375, "learning_rate": 0.0004473473779402853, "loss": 6.7136, "mean_token_accuracy": 0.12992869466543197, "num_tokens": 6103766.0, "step": 1890 }, { "entropy": 7.07710452079773, "epoch": 3.7832167832167833, "grad_norm": 0.8203125, "learning_rate": 0.0004467780416965067, "loss": 6.8188, "mean_token_accuracy": 0.1215907171368599, "num_tokens": 6119949.0, "step": 1895 }, { "entropy": 7.073676347732544, "epoch": 3.793206793206793, "grad_norm": 0.96484375, "learning_rate": 0.00044620605642282555, "loss": 6.8142, "mean_token_accuracy": 0.12248084098100662, "num_tokens": 6135242.0, "step": 1900 }, { "entropy": 7.213345336914062, "epoch": 3.803196803196803, "grad_norm": 0.90234375, "learning_rate": 0.00044563143093996247, "loss": 6.8843, "mean_token_accuracy": 0.12051893100142479, "num_tokens": 6151757.0, "step": 1905 }, { "entropy": 6.9489563465118405, "epoch": 3.813186813186813, "grad_norm": 0.796875, "learning_rate": 0.00044505417410935314, "loss": 6.6061, "mean_token_accuracy": 0.14097559526562692, "num_tokens": 6168645.0, "step": 1910 }, { "entropy": 7.026501989364624, "epoch": 3.8231768231768233, "grad_norm": 0.83203125, "learning_rate": 0.000444474294833012, "loss": 6.646, "mean_token_accuracy": 0.13266035094857215, "num_tokens": 6187290.0, "step": 1915 }, { "entropy": 7.148423337936402, "epoch": 3.833166833166833, "grad_norm": 0.76171875, "learning_rate": 0.0004438918020533949, "loss": 6.8282, "mean_token_accuracy": 0.12248983979225159, "num_tokens": 6202559.0, "step": 1920 }, { "entropy": 7.037263345718384, "epoch": 3.843156843156843, "grad_norm": 0.90234375, "learning_rate": 0.0004433067047532611, "loss": 6.6334, "mean_token_accuracy": 0.13536879271268845, "num_tokens": 6218876.0, "step": 1925 }, { "entropy": 6.973905420303344, "epoch": 3.8531468531468533, "grad_norm": 0.8515625, "learning_rate": 0.00044271901195553465, "loss": 6.6515, "mean_token_accuracy": 0.12920384258031845, "num_tokens": 6235305.0, "step": 1930 }, { "entropy": 7.083110713958741, "epoch": 3.863136863136863, "grad_norm": 0.85546875, "learning_rate": 0.00044212873272316564, "loss": 6.7521, "mean_token_accuracy": 0.12410952597856521, "num_tokens": 6250039.0, "step": 1935 }, { "entropy": 7.060521364212036, "epoch": 3.873126873126873, "grad_norm": 0.8203125, "learning_rate": 0.0004415358761589899, "loss": 6.7178, "mean_token_accuracy": 0.13092741817235948, "num_tokens": 6267479.0, "step": 1940 }, { "entropy": 7.0901649475097654, "epoch": 3.883116883116883, "grad_norm": 0.83984375, "learning_rate": 0.00044094045140558914, "loss": 6.8106, "mean_token_accuracy": 0.12367469295859337, "num_tokens": 6283564.0, "step": 1945 }, { "entropy": 7.154060745239258, "epoch": 3.893106893106893, "grad_norm": 0.90625, "learning_rate": 0.0004403424676451497, "loss": 6.8632, "mean_token_accuracy": 0.11547367498278618, "num_tokens": 6298442.0, "step": 1950 }, { "entropy": 7.076562118530274, "epoch": 3.903096903096903, "grad_norm": 0.83203125, "learning_rate": 0.0004397419340993207, "loss": 6.751, "mean_token_accuracy": 0.12074748352169991, "num_tokens": 6314431.0, "step": 1955 }, { "entropy": 7.05272421836853, "epoch": 3.913086913086913, "grad_norm": 0.76953125, "learning_rate": 0.0004391388600290724, "loss": 6.74, "mean_token_accuracy": 0.12377151399850846, "num_tokens": 6331266.0, "step": 1960 }, { "entropy": 7.101782894134521, "epoch": 3.9230769230769234, "grad_norm": 0.82421875, "learning_rate": 0.0004385332547345531, "loss": 6.8382, "mean_token_accuracy": 0.12267978042364121, "num_tokens": 6347366.0, "step": 1965 }, { "entropy": 7.074215984344482, "epoch": 3.9330669330669332, "grad_norm": 0.90625, "learning_rate": 0.00043792512755494564, "loss": 6.7722, "mean_token_accuracy": 0.12224731072783471, "num_tokens": 6363633.0, "step": 1970 }, { "entropy": 7.194826459884643, "epoch": 3.943056943056943, "grad_norm": 0.82421875, "learning_rate": 0.00043731448786832317, "loss": 6.7887, "mean_token_accuracy": 0.12292017713189125, "num_tokens": 6380264.0, "step": 1975 }, { "entropy": 6.990942764282226, "epoch": 3.953046953046953, "grad_norm": 0.8828125, "learning_rate": 0.0004367013450915053, "loss": 6.7275, "mean_token_accuracy": 0.12456048503518105, "num_tokens": 6395969.0, "step": 1980 }, { "entropy": 7.043016624450684, "epoch": 3.963036963036963, "grad_norm": 1.1640625, "learning_rate": 0.00043608570867991196, "loss": 6.7685, "mean_token_accuracy": 0.12395606711506843, "num_tokens": 6411883.0, "step": 1985 }, { "entropy": 6.9693458557128904, "epoch": 3.973026973026973, "grad_norm": 0.85546875, "learning_rate": 0.00043546758812741844, "loss": 6.6734, "mean_token_accuracy": 0.13040299639105796, "num_tokens": 6427476.0, "step": 1990 }, { "entropy": 7.094076013565063, "epoch": 3.983016983016983, "grad_norm": 0.87890625, "learning_rate": 0.0004348469929662081, "loss": 6.6441, "mean_token_accuracy": 0.13878704532980918, "num_tokens": 6443150.0, "step": 1995 }, { "entropy": 7.045284080505371, "epoch": 3.993006993006993, "grad_norm": 0.81640625, "learning_rate": 0.00043422393276662595, "loss": 6.8086, "mean_token_accuracy": 0.12303325086832047, "num_tokens": 6458582.0, "step": 2000 }, { "epoch": 3.993006993006993, "eval_entropy": 6.972401072527911, "eval_loss": 7.0694169998168945, "eval_mean_token_accuracy": 0.11132242733965049, "eval_num_tokens": 6458582.0, "eval_runtime": 1.1886, "eval_samples_per_second": 1240.161, "eval_steps_per_second": 155.651, "step": 2000 }, { "entropy": 7.096401638454861, "epoch": 4.001998001998002, "grad_norm": 0.8828125, "learning_rate": 0.0004335984171370313, "loss": 6.6861, "mean_token_accuracy": 0.12398595362901688, "num_tokens": 6471049.0, "step": 2005 }, { "entropy": 7.000304126739502, "epoch": 4.011988011988012, "grad_norm": 0.953125, "learning_rate": 0.00043297045572364884, "loss": 6.3705, "mean_token_accuracy": 0.13804432302713393, "num_tokens": 6487907.0, "step": 2010 }, { "entropy": 6.896741819381714, "epoch": 4.021978021978022, "grad_norm": 0.77734375, "learning_rate": 0.0004323400582104204, "loss": 6.1813, "mean_token_accuracy": 0.14990440681576728, "num_tokens": 6505062.0, "step": 2015 }, { "entropy": 7.011386251449585, "epoch": 4.031968031968032, "grad_norm": 0.8671875, "learning_rate": 0.00043170723431885537, "loss": 6.36, "mean_token_accuracy": 0.1448569469153881, "num_tokens": 6521057.0, "step": 2020 }, { "entropy": 7.045408296585083, "epoch": 4.041958041958042, "grad_norm": 0.8671875, "learning_rate": 0.0004310719938078811, "loss": 6.4343, "mean_token_accuracy": 0.13550977110862733, "num_tokens": 6535992.0, "step": 2025 }, { "entropy": 6.8560590744018555, "epoch": 4.0519480519480515, "grad_norm": 0.77734375, "learning_rate": 0.0004304343464736921, "loss": 6.2191, "mean_token_accuracy": 0.15562399104237556, "num_tokens": 6553269.0, "step": 2030 }, { "entropy": 7.07580041885376, "epoch": 4.061938061938062, "grad_norm": 0.7890625, "learning_rate": 0.00042979430214959907, "loss": 6.5009, "mean_token_accuracy": 0.12860227823257447, "num_tokens": 6569422.0, "step": 2035 }, { "entropy": 6.976323556900025, "epoch": 4.071928071928072, "grad_norm": 0.859375, "learning_rate": 0.0004291518707058773, "loss": 6.3401, "mean_token_accuracy": 0.14290616512298585, "num_tokens": 6584570.0, "step": 2040 }, { "entropy": 7.041407203674316, "epoch": 4.081918081918082, "grad_norm": 0.8984375, "learning_rate": 0.0004285070620496142, "loss": 6.4703, "mean_token_accuracy": 0.12887632623314857, "num_tokens": 6599297.0, "step": 2045 }, { "entropy": 7.043705081939697, "epoch": 4.091908091908092, "grad_norm": 0.84375, "learning_rate": 0.00042785988612455714, "loss": 6.4822, "mean_token_accuracy": 0.12805523350834846, "num_tokens": 6615073.0, "step": 2050 }, { "entropy": 6.997570323944092, "epoch": 4.101898101898102, "grad_norm": 0.77734375, "learning_rate": 0.00042721035291095927, "loss": 6.3232, "mean_token_accuracy": 0.14648763537406922, "num_tokens": 6631606.0, "step": 2055 }, { "entropy": 6.978628635406494, "epoch": 4.111888111888112, "grad_norm": 0.90234375, "learning_rate": 0.00042655847242542637, "loss": 6.434, "mean_token_accuracy": 0.1406654089689255, "num_tokens": 6647254.0, "step": 2060 }, { "entropy": 6.902737426757812, "epoch": 4.1218781218781215, "grad_norm": 0.8984375, "learning_rate": 0.000425904254720762, "loss": 6.3467, "mean_token_accuracy": 0.14053556472063064, "num_tokens": 6663318.0, "step": 2065 }, { "entropy": 6.984950065612793, "epoch": 4.131868131868132, "grad_norm": 0.859375, "learning_rate": 0.0004252477098858124, "loss": 6.4356, "mean_token_accuracy": 0.13776141479611398, "num_tokens": 6679926.0, "step": 2070 }, { "entropy": 7.005192565917969, "epoch": 4.141858141858142, "grad_norm": 0.8828125, "learning_rate": 0.00042458884804531105, "loss": 6.4349, "mean_token_accuracy": 0.1354406990110874, "num_tokens": 6696056.0, "step": 2075 }, { "entropy": 6.969394207000732, "epoch": 4.151848151848152, "grad_norm": 0.8359375, "learning_rate": 0.0004239276793597227, "loss": 6.4095, "mean_token_accuracy": 0.13926568925380706, "num_tokens": 6711995.0, "step": 2080 }, { "entropy": 7.012915992736817, "epoch": 4.161838161838162, "grad_norm": 0.84765625, "learning_rate": 0.00042326421402508636, "loss": 6.4457, "mean_token_accuracy": 0.13269549906253814, "num_tokens": 6728208.0, "step": 2085 }, { "entropy": 6.903886365890503, "epoch": 4.171828171828172, "grad_norm": 0.9453125, "learning_rate": 0.0004225984622728581, "loss": 6.3407, "mean_token_accuracy": 0.1442622274160385, "num_tokens": 6743270.0, "step": 2090 }, { "entropy": 6.858393859863281, "epoch": 4.181818181818182, "grad_norm": 0.89453125, "learning_rate": 0.00042193043436975365, "loss": 6.2573, "mean_token_accuracy": 0.14693668633699417, "num_tokens": 6759160.0, "step": 2095 }, { "entropy": 6.878496789932251, "epoch": 4.1918081918081915, "grad_norm": 0.83984375, "learning_rate": 0.0004212601406175897, "loss": 6.3036, "mean_token_accuracy": 0.14269134551286697, "num_tokens": 6773939.0, "step": 2100 }, { "entropy": 6.866790342330932, "epoch": 4.201798201798201, "grad_norm": 0.82421875, "learning_rate": 0.00042058759135312504, "loss": 6.2831, "mean_token_accuracy": 0.1496070832014084, "num_tokens": 6790902.0, "step": 2105 }, { "entropy": 6.919366979598999, "epoch": 4.211788211788212, "grad_norm": 0.88671875, "learning_rate": 0.0004199127969479012, "loss": 6.4617, "mean_token_accuracy": 0.1320016346871853, "num_tokens": 6806270.0, "step": 2110 }, { "entropy": 6.988452768325805, "epoch": 4.221778221778222, "grad_norm": 0.83984375, "learning_rate": 0.0004192357678080828, "loss": 6.413, "mean_token_accuracy": 0.14049519151449202, "num_tokens": 6822525.0, "step": 2115 }, { "entropy": 6.913089942932129, "epoch": 4.231768231768232, "grad_norm": 0.8828125, "learning_rate": 0.0004185565143742968, "loss": 6.4793, "mean_token_accuracy": 0.1310143105685711, "num_tokens": 6839091.0, "step": 2120 }, { "entropy": 6.985987806320191, "epoch": 4.241758241758242, "grad_norm": 0.921875, "learning_rate": 0.0004178750471214712, "loss": 6.4358, "mean_token_accuracy": 0.1404714398086071, "num_tokens": 6854277.0, "step": 2125 }, { "entropy": 6.9769031524658205, "epoch": 4.251748251748252, "grad_norm": 0.8828125, "learning_rate": 0.00041719137655867413, "loss": 6.446, "mean_token_accuracy": 0.1365428499877453, "num_tokens": 6870508.0, "step": 2130 }, { "entropy": 6.842640686035156, "epoch": 4.2617382617382615, "grad_norm": 0.88671875, "learning_rate": 0.00041650551322895154, "loss": 6.308, "mean_token_accuracy": 0.14744904339313508, "num_tokens": 6887361.0, "step": 2135 }, { "entropy": 6.900832891464233, "epoch": 4.271728271728271, "grad_norm": 0.91796875, "learning_rate": 0.00041581746770916417, "loss": 6.391, "mean_token_accuracy": 0.13931121453642845, "num_tokens": 6902076.0, "step": 2140 }, { "entropy": 6.8979002952575685, "epoch": 4.281718281718282, "grad_norm": 0.91796875, "learning_rate": 0.0004151272506098253, "loss": 6.4068, "mean_token_accuracy": 0.13438273817300797, "num_tokens": 6917931.0, "step": 2145 }, { "entropy": 6.990635061264038, "epoch": 4.291708291708292, "grad_norm": 0.90234375, "learning_rate": 0.0004144348725749364, "loss": 6.467, "mean_token_accuracy": 0.13701085448265077, "num_tokens": 6934519.0, "step": 2150 }, { "entropy": 6.896759700775147, "epoch": 4.301698301698302, "grad_norm": 0.91796875, "learning_rate": 0.00041374034428182327, "loss": 6.4301, "mean_token_accuracy": 0.13709006011486052, "num_tokens": 6949828.0, "step": 2155 }, { "entropy": 7.042719030380249, "epoch": 4.311688311688312, "grad_norm": 0.85546875, "learning_rate": 0.00041304367644097136, "loss": 6.5346, "mean_token_accuracy": 0.12652225121855737, "num_tokens": 6966874.0, "step": 2160 }, { "entropy": 6.905826568603516, "epoch": 4.321678321678322, "grad_norm": 0.8046875, "learning_rate": 0.00041234487979586055, "loss": 6.4229, "mean_token_accuracy": 0.14220663160085678, "num_tokens": 6984182.0, "step": 2165 }, { "entropy": 6.976738357543946, "epoch": 4.3316683316683315, "grad_norm": 0.796875, "learning_rate": 0.00041164396512279966, "loss": 6.5041, "mean_token_accuracy": 0.13272078856825828, "num_tokens": 7001573.0, "step": 2170 }, { "entropy": 6.99681544303894, "epoch": 4.341658341658341, "grad_norm": 1.03125, "learning_rate": 0.00041094094323075993, "loss": 6.4468, "mean_token_accuracy": 0.14005056545138359, "num_tokens": 7017791.0, "step": 2175 }, { "entropy": 6.963916015625, "epoch": 4.351648351648351, "grad_norm": 0.88671875, "learning_rate": 0.0004102358249612086, "loss": 6.4694, "mean_token_accuracy": 0.12927123457193374, "num_tokens": 7033066.0, "step": 2180 }, { "entropy": 6.970026445388794, "epoch": 4.361638361638362, "grad_norm": 0.828125, "learning_rate": 0.0004095286211879418, "loss": 6.486, "mean_token_accuracy": 0.13157685324549676, "num_tokens": 7051148.0, "step": 2185 }, { "entropy": 6.826376342773438, "epoch": 4.371628371628372, "grad_norm": 0.8828125, "learning_rate": 0.00040881934281691634, "loss": 6.3613, "mean_token_accuracy": 0.14514607787132264, "num_tokens": 7066554.0, "step": 2190 }, { "entropy": 6.967290830612183, "epoch": 4.381618381618382, "grad_norm": 0.87109375, "learning_rate": 0.00040810800078608237, "loss": 6.4716, "mean_token_accuracy": 0.1343966767191887, "num_tokens": 7083247.0, "step": 2195 }, { "entropy": 6.924704074859619, "epoch": 4.391608391608392, "grad_norm": 0.859375, "learning_rate": 0.0004073946060652138, "loss": 6.4479, "mean_token_accuracy": 0.14146102145314216, "num_tokens": 7099104.0, "step": 2200 }, { "entropy": 6.918974208831787, "epoch": 4.4015984015984015, "grad_norm": 0.90234375, "learning_rate": 0.00040667916965573983, "loss": 6.4514, "mean_token_accuracy": 0.14054503217339515, "num_tokens": 7114440.0, "step": 2205 }, { "entropy": 6.896188163757325, "epoch": 4.411588411588411, "grad_norm": 0.77734375, "learning_rate": 0.0004059617025905748, "loss": 6.4507, "mean_token_accuracy": 0.137186661362648, "num_tokens": 7130410.0, "step": 2210 }, { "entropy": 6.846044588088989, "epoch": 4.421578421578421, "grad_norm": 0.9765625, "learning_rate": 0.00040524221593394856, "loss": 6.386, "mean_token_accuracy": 0.1397906646132469, "num_tokens": 7144803.0, "step": 2215 }, { "entropy": 6.887253284454346, "epoch": 4.431568431568431, "grad_norm": 0.99609375, "learning_rate": 0.0004045207207812354, "loss": 6.3791, "mean_token_accuracy": 0.1420623131096363, "num_tokens": 7160680.0, "step": 2220 }, { "entropy": 6.857743835449218, "epoch": 4.441558441558442, "grad_norm": 0.90625, "learning_rate": 0.000403797228258783, "loss": 6.3374, "mean_token_accuracy": 0.13977223932743071, "num_tokens": 7177450.0, "step": 2225 }, { "entropy": 6.882814168930054, "epoch": 4.451548451548452, "grad_norm": 0.92578125, "learning_rate": 0.0004030717495237411, "loss": 6.4604, "mean_token_accuracy": 0.13854006603360175, "num_tokens": 7192482.0, "step": 2230 }, { "entropy": 7.053446912765503, "epoch": 4.461538461538462, "grad_norm": 0.97265625, "learning_rate": 0.0004023442957638892, "loss": 6.4821, "mean_token_accuracy": 0.13466990888118743, "num_tokens": 7209494.0, "step": 2235 }, { "entropy": 6.831972455978393, "epoch": 4.4715284715284715, "grad_norm": 0.875, "learning_rate": 0.0004016148781974643, "loss": 6.3666, "mean_token_accuracy": 0.14500441253185273, "num_tokens": 7225535.0, "step": 2240 }, { "entropy": 6.872930431365967, "epoch": 4.481518481518481, "grad_norm": 0.8515625, "learning_rate": 0.0004008835080729876, "loss": 6.242, "mean_token_accuracy": 0.15063140094280242, "num_tokens": 7243198.0, "step": 2245 }, { "entropy": 6.881392240524292, "epoch": 4.491508491508491, "grad_norm": 0.90234375, "learning_rate": 0.00040015019666909106, "loss": 6.4483, "mean_token_accuracy": 0.13883696421980857, "num_tokens": 7257931.0, "step": 2250 }, { "entropy": 6.950327968597412, "epoch": 4.501498501498501, "grad_norm": 0.88671875, "learning_rate": 0.00039941495529434375, "loss": 6.5614, "mean_token_accuracy": 0.13021408692002295, "num_tokens": 7274631.0, "step": 2255 }, { "entropy": 6.916135692596436, "epoch": 4.511488511488512, "grad_norm": 0.9375, "learning_rate": 0.0003986777952870772, "loss": 6.4462, "mean_token_accuracy": 0.1361345499753952, "num_tokens": 7291300.0, "step": 2260 }, { "entropy": 6.95969672203064, "epoch": 4.521478521478522, "grad_norm": 0.8125, "learning_rate": 0.0003979387280152106, "loss": 6.438, "mean_token_accuracy": 0.14408094808459282, "num_tokens": 7307140.0, "step": 2265 }, { "entropy": 6.837795305252075, "epoch": 4.531468531468532, "grad_norm": 0.9140625, "learning_rate": 0.0003971977648760756, "loss": 6.3903, "mean_token_accuracy": 0.13501906394958496, "num_tokens": 7321578.0, "step": 2270 }, { "entropy": 6.829850673675537, "epoch": 4.5414585414585416, "grad_norm": 0.95703125, "learning_rate": 0.0003964549172962403, "loss": 6.3328, "mean_token_accuracy": 0.14925181940197946, "num_tokens": 7338286.0, "step": 2275 }, { "entropy": 6.935940742492676, "epoch": 4.551448551448551, "grad_norm": 0.84375, "learning_rate": 0.00039571019673133344, "loss": 6.5561, "mean_token_accuracy": 0.1315899409353733, "num_tokens": 7356049.0, "step": 2280 }, { "entropy": 6.860372114181518, "epoch": 4.561438561438561, "grad_norm": 0.80078125, "learning_rate": 0.00039496361466586743, "loss": 6.356, "mean_token_accuracy": 0.14854327514767646, "num_tokens": 7373159.0, "step": 2285 }, { "entropy": 6.784941053390503, "epoch": 4.571428571428571, "grad_norm": 0.984375, "learning_rate": 0.0003942151826130613, "loss": 6.3758, "mean_token_accuracy": 0.14404894411563873, "num_tokens": 7389285.0, "step": 2290 }, { "entropy": 6.826180076599121, "epoch": 4.581418581418581, "grad_norm": 0.796875, "learning_rate": 0.0003934649121146629, "loss": 6.3899, "mean_token_accuracy": 0.14161911457777024, "num_tokens": 7406386.0, "step": 2295 }, { "entropy": 6.977476119995117, "epoch": 4.591408591408591, "grad_norm": 0.953125, "learning_rate": 0.00039271281474077173, "loss": 6.4494, "mean_token_accuracy": 0.13891530334949492, "num_tokens": 7421540.0, "step": 2300 }, { "entropy": 6.839320707321167, "epoch": 4.601398601398602, "grad_norm": 0.78515625, "learning_rate": 0.0003919589020896596, "loss": 6.4227, "mean_token_accuracy": 0.13940232917666434, "num_tokens": 7438394.0, "step": 2305 }, { "entropy": 6.9221405506134035, "epoch": 4.611388611388612, "grad_norm": 0.85546875, "learning_rate": 0.00039120318578759225, "loss": 6.4134, "mean_token_accuracy": 0.1382547177374363, "num_tokens": 7454275.0, "step": 2310 }, { "entropy": 6.931888771057129, "epoch": 4.621378621378621, "grad_norm": 0.98828125, "learning_rate": 0.0003904456774886498, "loss": 6.4787, "mean_token_accuracy": 0.136423047631979, "num_tokens": 7468872.0, "step": 2315 }, { "entropy": 6.7931678771972654, "epoch": 4.631368631368631, "grad_norm": 0.85546875, "learning_rate": 0.0003896863888745475, "loss": 6.4317, "mean_token_accuracy": 0.13883610889315606, "num_tokens": 7485614.0, "step": 2320 }, { "entropy": 6.9771514415740965, "epoch": 4.641358641358641, "grad_norm": 0.8515625, "learning_rate": 0.0003889253316544548, "loss": 6.5143, "mean_token_accuracy": 0.12867238670587539, "num_tokens": 7502577.0, "step": 2325 }, { "entropy": 6.869775629043579, "epoch": 4.651348651348651, "grad_norm": 1.1953125, "learning_rate": 0.00038816251756481577, "loss": 6.4091, "mean_token_accuracy": 0.1344277046620846, "num_tokens": 7519969.0, "step": 2330 }, { "entropy": 7.018423795700073, "epoch": 4.661338661338661, "grad_norm": 0.8515625, "learning_rate": 0.0003873979583691671, "loss": 6.5605, "mean_token_accuracy": 0.12558562383055688, "num_tokens": 7537078.0, "step": 2335 }, { "entropy": 6.866714382171631, "epoch": 4.671328671328672, "grad_norm": 0.75390625, "learning_rate": 0.0003866316658579576, "loss": 6.421, "mean_token_accuracy": 0.13925058171153068, "num_tokens": 7553680.0, "step": 2340 }, { "entropy": 6.901582145690918, "epoch": 4.681318681318682, "grad_norm": 1.0, "learning_rate": 0.00038586365184836556, "loss": 6.4216, "mean_token_accuracy": 0.14001917839050293, "num_tokens": 7569197.0, "step": 2345 }, { "entropy": 6.823400783538818, "epoch": 4.691308691308691, "grad_norm": 0.94140625, "learning_rate": 0.0003850939281841173, "loss": 6.4058, "mean_token_accuracy": 0.13748618736863136, "num_tokens": 7585862.0, "step": 2350 }, { "entropy": 6.835287475585938, "epoch": 4.701298701298701, "grad_norm": 0.890625, "learning_rate": 0.0003843225067353036, "loss": 6.398, "mean_token_accuracy": 0.13771583437919616, "num_tokens": 7600506.0, "step": 2355 }, { "entropy": 6.966355991363526, "epoch": 4.711288711288711, "grad_norm": 1.0390625, "learning_rate": 0.00038354939939819785, "loss": 6.5197, "mean_token_accuracy": 0.1330697476863861, "num_tokens": 7616067.0, "step": 2360 }, { "entropy": 6.843840646743774, "epoch": 4.721278721278721, "grad_norm": 0.9375, "learning_rate": 0.0003827746180950712, "loss": 6.4606, "mean_token_accuracy": 0.13615441247820853, "num_tokens": 7632542.0, "step": 2365 }, { "entropy": 6.873838472366333, "epoch": 4.731268731268731, "grad_norm": 0.9140625, "learning_rate": 0.0003819981747740102, "loss": 6.3692, "mean_token_accuracy": 0.1446195088326931, "num_tokens": 7648752.0, "step": 2370 }, { "entropy": 6.881458282470703, "epoch": 4.741258741258742, "grad_norm": 0.91015625, "learning_rate": 0.0003812200814087309, "loss": 6.4731, "mean_token_accuracy": 0.13235363364219666, "num_tokens": 7664364.0, "step": 2375 }, { "entropy": 6.844540405273437, "epoch": 4.751248751248752, "grad_norm": 1.0234375, "learning_rate": 0.00038044034999839605, "loss": 6.3305, "mean_token_accuracy": 0.14687129333615304, "num_tokens": 7680383.0, "step": 2380 }, { "entropy": 6.817474508285523, "epoch": 4.761238761238761, "grad_norm": 0.8984375, "learning_rate": 0.00037965899256742815, "loss": 6.3914, "mean_token_accuracy": 0.14889568239450454, "num_tokens": 7695832.0, "step": 2385 }, { "entropy": 6.908108520507812, "epoch": 4.771228771228771, "grad_norm": 0.87890625, "learning_rate": 0.00037887602116532556, "loss": 6.5908, "mean_token_accuracy": 0.12793709486722946, "num_tokens": 7712453.0, "step": 2390 }, { "entropy": 6.908516550064087, "epoch": 4.781218781218781, "grad_norm": 0.9140625, "learning_rate": 0.00037809144786647594, "loss": 6.4465, "mean_token_accuracy": 0.13347138911485673, "num_tokens": 7727746.0, "step": 2395 }, { "entropy": 6.907331275939941, "epoch": 4.791208791208791, "grad_norm": 0.8671875, "learning_rate": 0.0003773052847699699, "loss": 6.4219, "mean_token_accuracy": 0.14402018189430238, "num_tokens": 7743878.0, "step": 2400 }, { "entropy": 6.918729639053344, "epoch": 4.801198801198801, "grad_norm": 0.875, "learning_rate": 0.00037651754399941516, "loss": 6.4983, "mean_token_accuracy": 0.1317797139286995, "num_tokens": 7759628.0, "step": 2405 }, { "entropy": 6.908243465423584, "epoch": 4.811188811188811, "grad_norm": 0.92578125, "learning_rate": 0.00037572823770274874, "loss": 6.4725, "mean_token_accuracy": 0.13213906362652778, "num_tokens": 7776560.0, "step": 2410 }, { "entropy": 6.9069239616394045, "epoch": 4.821178821178821, "grad_norm": 0.8984375, "learning_rate": 0.0003749373780520502, "loss": 6.5278, "mean_token_accuracy": 0.13267339393496513, "num_tokens": 7792380.0, "step": 2415 }, { "entropy": 6.858670282363891, "epoch": 4.8311688311688314, "grad_norm": 0.88671875, "learning_rate": 0.00037414497724335365, "loss": 6.4234, "mean_token_accuracy": 0.13867654502391816, "num_tokens": 7807399.0, "step": 2420 }, { "entropy": 6.915921878814697, "epoch": 4.841158841158841, "grad_norm": 0.91796875, "learning_rate": 0.00037335104749645995, "loss": 6.5061, "mean_token_accuracy": 0.13035957515239716, "num_tokens": 7822886.0, "step": 2425 }, { "entropy": 6.822269439697266, "epoch": 4.851148851148851, "grad_norm": 0.87109375, "learning_rate": 0.0003725556010547477, "loss": 6.4195, "mean_token_accuracy": 0.14344688802957534, "num_tokens": 7839566.0, "step": 2430 }, { "entropy": 6.891341876983643, "epoch": 4.861138861138861, "grad_norm": 0.92578125, "learning_rate": 0.0003717586501849853, "loss": 6.4431, "mean_token_accuracy": 0.1357530564069748, "num_tokens": 7855575.0, "step": 2435 }, { "entropy": 6.816015005111694, "epoch": 4.871128871128871, "grad_norm": 0.8828125, "learning_rate": 0.00037096020717714077, "loss": 6.4148, "mean_token_accuracy": 0.14372522458434106, "num_tokens": 7871908.0, "step": 2440 }, { "entropy": 6.912888097763061, "epoch": 4.881118881118881, "grad_norm": 0.9296875, "learning_rate": 0.0003701602843441932, "loss": 6.5089, "mean_token_accuracy": 0.13163238167762756, "num_tokens": 7887986.0, "step": 2445 }, { "entropy": 6.812265014648437, "epoch": 4.891108891108891, "grad_norm": 0.82421875, "learning_rate": 0.0003693588940219422, "loss": 6.3936, "mean_token_accuracy": 0.14253236576914788, "num_tokens": 7905045.0, "step": 2450 }, { "entropy": 6.897704696655273, "epoch": 4.9010989010989015, "grad_norm": 0.875, "learning_rate": 0.00036855604856881794, "loss": 6.3795, "mean_token_accuracy": 0.13932438269257547, "num_tokens": 7920910.0, "step": 2455 }, { "entropy": 6.863029289245605, "epoch": 4.911088911088911, "grad_norm": 0.9375, "learning_rate": 0.00036775176036569037, "loss": 6.5525, "mean_token_accuracy": 0.13276326581835746, "num_tokens": 7938582.0, "step": 2460 }, { "entropy": 6.940312910079956, "epoch": 4.921078921078921, "grad_norm": 0.9375, "learning_rate": 0.00036694604181567857, "loss": 6.5128, "mean_token_accuracy": 0.1404005207121372, "num_tokens": 7956974.0, "step": 2465 }, { "entropy": 6.87377552986145, "epoch": 4.931068931068931, "grad_norm": 0.890625, "learning_rate": 0.00036613890534395926, "loss": 6.42, "mean_token_accuracy": 0.13454653844237327, "num_tokens": 7973039.0, "step": 2470 }, { "entropy": 6.845200920104981, "epoch": 4.941058941058941, "grad_norm": 0.87109375, "learning_rate": 0.00036533036339757546, "loss": 6.4954, "mean_token_accuracy": 0.13850824236869813, "num_tokens": 7990012.0, "step": 2475 }, { "entropy": 6.923229551315307, "epoch": 4.951048951048951, "grad_norm": 0.8984375, "learning_rate": 0.00036452042844524403, "loss": 6.4725, "mean_token_accuracy": 0.13284012898802758, "num_tokens": 8006660.0, "step": 2480 }, { "entropy": 6.894635772705078, "epoch": 4.961038961038961, "grad_norm": 0.9765625, "learning_rate": 0.00036370911297716396, "loss": 6.4136, "mean_token_accuracy": 0.13401512503623964, "num_tokens": 8021882.0, "step": 2485 }, { "entropy": 6.825757074356079, "epoch": 4.9710289710289715, "grad_norm": 0.8828125, "learning_rate": 0.0003628964295048234, "loss": 6.3503, "mean_token_accuracy": 0.14384899139404297, "num_tokens": 8038306.0, "step": 2490 }, { "entropy": 6.828709840774536, "epoch": 4.981018981018981, "grad_norm": 0.89453125, "learning_rate": 0.00036208239056080685, "loss": 6.4431, "mean_token_accuracy": 0.13646155297756196, "num_tokens": 8055064.0, "step": 2495 }, { "entropy": 6.887692546844482, "epoch": 4.991008991008991, "grad_norm": 0.890625, "learning_rate": 0.0003612670086986018, "loss": 6.4128, "mean_token_accuracy": 0.14382297024130822, "num_tokens": 8072444.0, "step": 2500 }, { "epoch": 4.991008991008991, "eval_entropy": 6.7374067306518555, "eval_loss": 7.007086277008057, "eval_mean_token_accuracy": 0.11369705923102998, "eval_num_tokens": 8072444.0, "eval_runtime": 1.1755, "eval_samples_per_second": 1253.942, "eval_steps_per_second": 157.381, "step": 2500 }, { "entropy": 6.898542245229085, "epoch": 5.0, "grad_norm": 2.375, "learning_rate": 0.0003604502964924053, "loss": 6.5935, "mean_token_accuracy": 0.13040180587106281, "num_tokens": 8085445.0, "step": 2505 }, { "entropy": 6.9159050464630125, "epoch": 5.00999000999001, "grad_norm": 0.82421875, "learning_rate": 0.00035963226653692976, "loss": 6.1467, "mean_token_accuracy": 0.14434437677264214, "num_tokens": 8101276.0, "step": 2510 }, { "entropy": 6.878229475021362, "epoch": 5.01998001998002, "grad_norm": 0.82421875, "learning_rate": 0.00035881293144720915, "loss": 6.1114, "mean_token_accuracy": 0.14664856046438218, "num_tokens": 8117868.0, "step": 2515 }, { "entropy": 6.8993446826934814, "epoch": 5.02997002997003, "grad_norm": 0.88671875, "learning_rate": 0.0003579923038584042, "loss": 6.1441, "mean_token_accuracy": 0.15033238381147385, "num_tokens": 8133883.0, "step": 2520 }, { "entropy": 6.782688426971435, "epoch": 5.03996003996004, "grad_norm": 0.8828125, "learning_rate": 0.00035717039642560726, "loss": 6.0688, "mean_token_accuracy": 0.1523089662194252, "num_tokens": 8149073.0, "step": 2525 }, { "entropy": 6.821210479736328, "epoch": 5.04995004995005, "grad_norm": 0.93359375, "learning_rate": 0.0003563472218236479, "loss": 6.0601, "mean_token_accuracy": 0.1525934472680092, "num_tokens": 8166174.0, "step": 2530 }, { "entropy": 6.874574899673462, "epoch": 5.05994005994006, "grad_norm": 0.921875, "learning_rate": 0.0003555227927468967, "loss": 6.1508, "mean_token_accuracy": 0.15101489722728728, "num_tokens": 8180834.0, "step": 2535 }, { "entropy": 6.758509922027588, "epoch": 5.06993006993007, "grad_norm": 0.921875, "learning_rate": 0.00035469712190907, "loss": 6.041, "mean_token_accuracy": 0.15453238114714624, "num_tokens": 8198467.0, "step": 2540 }, { "entropy": 6.832466173171997, "epoch": 5.07992007992008, "grad_norm": 0.93359375, "learning_rate": 0.00035387022204303326, "loss": 6.1572, "mean_token_accuracy": 0.14238883703947067, "num_tokens": 8214233.0, "step": 2545 }, { "entropy": 6.844207906723023, "epoch": 5.08991008991009, "grad_norm": 0.87109375, "learning_rate": 0.00035304210590060564, "loss": 6.2343, "mean_token_accuracy": 0.141249231249094, "num_tokens": 8230846.0, "step": 2550 }, { "entropy": 6.781070899963379, "epoch": 5.0999000999001, "grad_norm": 0.90234375, "learning_rate": 0.00035221278625236234, "loss": 6.0177, "mean_token_accuracy": 0.16515944004058838, "num_tokens": 8247264.0, "step": 2555 }, { "entropy": 6.702904558181762, "epoch": 5.1098901098901095, "grad_norm": 0.94921875, "learning_rate": 0.0003513822758874383, "loss": 6.0765, "mean_token_accuracy": 0.15743518620729446, "num_tokens": 8263681.0, "step": 2560 }, { "entropy": 6.816042900085449, "epoch": 5.11988011988012, "grad_norm": 0.92578125, "learning_rate": 0.00035055058761333064, "loss": 6.2244, "mean_token_accuracy": 0.14425530582666396, "num_tokens": 8280162.0, "step": 2565 }, { "entropy": 6.8803774356842045, "epoch": 5.12987012987013, "grad_norm": 0.91796875, "learning_rate": 0.00034971773425570153, "loss": 6.1981, "mean_token_accuracy": 0.14355578720569612, "num_tokens": 8294381.0, "step": 2570 }, { "entropy": 6.774266910552979, "epoch": 5.13986013986014, "grad_norm": 0.83203125, "learning_rate": 0.00034888372865817994, "loss": 6.1406, "mean_token_accuracy": 0.15092467218637468, "num_tokens": 8311985.0, "step": 2575 }, { "entropy": 6.719998168945312, "epoch": 5.14985014985015, "grad_norm": 0.8828125, "learning_rate": 0.00034804858368216396, "loss": 6.1032, "mean_token_accuracy": 0.15913226455450058, "num_tokens": 8327714.0, "step": 2580 }, { "entropy": 6.780656147003174, "epoch": 5.15984015984016, "grad_norm": 0.83984375, "learning_rate": 0.00034721231220662216, "loss": 6.0884, "mean_token_accuracy": 0.15305961519479752, "num_tokens": 8343470.0, "step": 2585 }, { "entropy": 6.702918148040771, "epoch": 5.16983016983017, "grad_norm": 0.921875, "learning_rate": 0.00034637492712789533, "loss": 6.0909, "mean_token_accuracy": 0.15377210527658464, "num_tokens": 8359459.0, "step": 2590 }, { "entropy": 6.842664051055908, "epoch": 5.1798201798201795, "grad_norm": 0.91015625, "learning_rate": 0.0003455364413594971, "loss": 6.0988, "mean_token_accuracy": 0.15020217299461364, "num_tokens": 8376234.0, "step": 2595 }, { "entropy": 6.84317717552185, "epoch": 5.18981018981019, "grad_norm": 0.9296875, "learning_rate": 0.0003446968678319154, "loss": 6.1142, "mean_token_accuracy": 0.14910392165184022, "num_tokens": 8392264.0, "step": 2600 }, { "entropy": 6.74654631614685, "epoch": 5.1998001998002, "grad_norm": 0.921875, "learning_rate": 0.0003438562194924127, "loss": 6.1557, "mean_token_accuracy": 0.1491137683391571, "num_tokens": 8408780.0, "step": 2605 }, { "entropy": 6.838429307937622, "epoch": 5.20979020979021, "grad_norm": 0.953125, "learning_rate": 0.0003430145093048261, "loss": 6.173, "mean_token_accuracy": 0.1463763326406479, "num_tokens": 8423860.0, "step": 2610 }, { "entropy": 6.72910327911377, "epoch": 5.21978021978022, "grad_norm": 0.94921875, "learning_rate": 0.0003421717502493683, "loss": 6.0764, "mean_token_accuracy": 0.1525864578783512, "num_tokens": 8441772.0, "step": 2615 }, { "entropy": 6.85248498916626, "epoch": 5.22977022977023, "grad_norm": 0.984375, "learning_rate": 0.00034132795532242603, "loss": 6.191, "mean_token_accuracy": 0.14192505776882172, "num_tokens": 8456849.0, "step": 2620 }, { "entropy": 6.789510202407837, "epoch": 5.23976023976024, "grad_norm": 0.9921875, "learning_rate": 0.00034048313753636114, "loss": 6.1595, "mean_token_accuracy": 0.14623874053359032, "num_tokens": 8473380.0, "step": 2625 }, { "entropy": 6.813194751739502, "epoch": 5.2497502497502495, "grad_norm": 1.0234375, "learning_rate": 0.0003396373099193091, "loss": 6.1544, "mean_token_accuracy": 0.14940615892410278, "num_tokens": 8488165.0, "step": 2630 }, { "entropy": 6.619700717926025, "epoch": 5.259740259740259, "grad_norm": 0.95703125, "learning_rate": 0.00033879048551497783, "loss": 6.0124, "mean_token_accuracy": 0.1557314984500408, "num_tokens": 8503552.0, "step": 2635 }, { "entropy": 6.791070652008057, "epoch": 5.26973026973027, "grad_norm": 0.984375, "learning_rate": 0.0003379426773824473, "loss": 6.1493, "mean_token_accuracy": 0.14780891090631484, "num_tokens": 8519896.0, "step": 2640 }, { "entropy": 6.67166690826416, "epoch": 5.27972027972028, "grad_norm": 0.88671875, "learning_rate": 0.0003370938985959678, "loss": 6.0364, "mean_token_accuracy": 0.16298322826623918, "num_tokens": 8535352.0, "step": 2645 }, { "entropy": 6.7639524936676025, "epoch": 5.28971028971029, "grad_norm": 0.98828125, "learning_rate": 0.00033624416224475813, "loss": 6.1027, "mean_token_accuracy": 0.16258821040391921, "num_tokens": 8549844.0, "step": 2650 }, { "entropy": 6.742043781280517, "epoch": 5.2997002997003, "grad_norm": 1.0234375, "learning_rate": 0.000335393481432804, "loss": 6.1016, "mean_token_accuracy": 0.1525222986936569, "num_tokens": 8565525.0, "step": 2655 }, { "entropy": 6.698980665206909, "epoch": 5.30969030969031, "grad_norm": 1.1171875, "learning_rate": 0.000334541869278656, "loss": 6.0574, "mean_token_accuracy": 0.16224250346422195, "num_tokens": 8580249.0, "step": 2660 }, { "entropy": 6.795589780807495, "epoch": 5.3196803196803195, "grad_norm": 0.96484375, "learning_rate": 0.00033368933891522685, "loss": 6.1552, "mean_token_accuracy": 0.147729279845953, "num_tokens": 8596112.0, "step": 2665 }, { "entropy": 6.78569598197937, "epoch": 5.329670329670329, "grad_norm": 1.015625, "learning_rate": 0.0003328359034895894, "loss": 6.1751, "mean_token_accuracy": 0.1452673152089119, "num_tokens": 8611635.0, "step": 2670 }, { "entropy": 6.81738691329956, "epoch": 5.339660339660339, "grad_norm": 0.98828125, "learning_rate": 0.00033198157616277387, "loss": 6.2053, "mean_token_accuracy": 0.1444336473941803, "num_tokens": 8628466.0, "step": 2675 }, { "entropy": 6.836865377426148, "epoch": 5.34965034965035, "grad_norm": 0.88671875, "learning_rate": 0.0003311263701095642, "loss": 6.1745, "mean_token_accuracy": 0.14085533171892167, "num_tokens": 8645216.0, "step": 2680 }, { "entropy": 6.74297685623169, "epoch": 5.35964035964036, "grad_norm": 0.96484375, "learning_rate": 0.000330270298518296, "loss": 6.0872, "mean_token_accuracy": 0.15877077728509903, "num_tokens": 8661963.0, "step": 2685 }, { "entropy": 6.712607049942017, "epoch": 5.36963036963037, "grad_norm": 0.9375, "learning_rate": 0.00032941337459065187, "loss": 6.0998, "mean_token_accuracy": 0.15611788034439086, "num_tokens": 8679267.0, "step": 2690 }, { "entropy": 6.736807870864868, "epoch": 5.37962037962038, "grad_norm": 0.9453125, "learning_rate": 0.0003285556115414591, "loss": 6.0213, "mean_token_accuracy": 0.16383236199617385, "num_tokens": 8694975.0, "step": 2695 }, { "entropy": 6.690615606307984, "epoch": 5.3896103896103895, "grad_norm": 0.96875, "learning_rate": 0.0003276970225984849, "loss": 6.1027, "mean_token_accuracy": 0.14643722102046014, "num_tokens": 8709288.0, "step": 2700 }, { "entropy": 6.825256633758545, "epoch": 5.399600399600399, "grad_norm": 0.94140625, "learning_rate": 0.0003268376210022329, "loss": 6.2596, "mean_token_accuracy": 0.1406122364103794, "num_tokens": 8725984.0, "step": 2705 }, { "entropy": 6.7964051246643065, "epoch": 5.409590409590409, "grad_norm": 1.0234375, "learning_rate": 0.0003259774200057389, "loss": 6.2346, "mean_token_accuracy": 0.13805721700191498, "num_tokens": 8741847.0, "step": 2710 }, { "entropy": 6.787170267105102, "epoch": 5.41958041958042, "grad_norm": 0.94921875, "learning_rate": 0.00032511643287436626, "loss": 6.0868, "mean_token_accuracy": 0.1611674025654793, "num_tokens": 8759195.0, "step": 2715 }, { "entropy": 6.790749502182007, "epoch": 5.42957042957043, "grad_norm": 1.046875, "learning_rate": 0.00032425467288560184, "loss": 6.2106, "mean_token_accuracy": 0.1481250897049904, "num_tokens": 8776572.0, "step": 2720 }, { "entropy": 6.729101610183716, "epoch": 5.43956043956044, "grad_norm": 0.85546875, "learning_rate": 0.0003233921533288505, "loss": 6.1769, "mean_token_accuracy": 0.1502446047961712, "num_tokens": 8792760.0, "step": 2725 }, { "entropy": 6.85574860572815, "epoch": 5.44955044955045, "grad_norm": 0.95703125, "learning_rate": 0.0003225288875052309, "loss": 6.1796, "mean_token_accuracy": 0.1519663080573082, "num_tokens": 8808008.0, "step": 2730 }, { "entropy": 6.772447395324707, "epoch": 5.4595404595404595, "grad_norm": 0.859375, "learning_rate": 0.00032166488872737006, "loss": 6.2447, "mean_token_accuracy": 0.14234700202941894, "num_tokens": 8824637.0, "step": 2735 }, { "entropy": 6.805008840560913, "epoch": 5.469530469530469, "grad_norm": 0.9375, "learning_rate": 0.0003208001703191977, "loss": 6.1787, "mean_token_accuracy": 0.1527337148785591, "num_tokens": 8840686.0, "step": 2740 }, { "entropy": 6.7837025165557865, "epoch": 5.479520479520479, "grad_norm": 0.87109375, "learning_rate": 0.00031993474561574153, "loss": 6.256, "mean_token_accuracy": 0.14082657918334007, "num_tokens": 8859309.0, "step": 2745 }, { "entropy": 6.63448805809021, "epoch": 5.489510489510489, "grad_norm": 0.9453125, "learning_rate": 0.0003190686279629211, "loss": 5.9812, "mean_token_accuracy": 0.15626030266284943, "num_tokens": 8876230.0, "step": 2750 }, { "entropy": 6.840122938156128, "epoch": 5.4995004995005, "grad_norm": 0.93359375, "learning_rate": 0.00031820183071734197, "loss": 6.2296, "mean_token_accuracy": 0.1374724492430687, "num_tokens": 8892568.0, "step": 2755 }, { "entropy": 6.709605073928833, "epoch": 5.50949050949051, "grad_norm": 0.94140625, "learning_rate": 0.00031733436724609005, "loss": 6.1199, "mean_token_accuracy": 0.15228664726018906, "num_tokens": 8908826.0, "step": 2760 }, { "entropy": 6.76680850982666, "epoch": 5.51948051948052, "grad_norm": 0.8125, "learning_rate": 0.00031646625092652506, "loss": 6.1944, "mean_token_accuracy": 0.1489237442612648, "num_tokens": 8925892.0, "step": 2765 }, { "entropy": 6.749977159500122, "epoch": 5.5294705294705295, "grad_norm": 0.9453125, "learning_rate": 0.0003155974951460745, "loss": 6.1902, "mean_token_accuracy": 0.14846026301383972, "num_tokens": 8944276.0, "step": 2770 }, { "entropy": 6.794697666168213, "epoch": 5.539460539460539, "grad_norm": 0.93359375, "learning_rate": 0.0003147281133020274, "loss": 6.1979, "mean_token_accuracy": 0.14596332460641862, "num_tokens": 8960387.0, "step": 2775 }, { "entropy": 6.713502740859985, "epoch": 5.549450549450549, "grad_norm": 0.99609375, "learning_rate": 0.0003138581188013271, "loss": 6.1072, "mean_token_accuracy": 0.15302377194166183, "num_tokens": 8977366.0, "step": 2780 }, { "entropy": 6.782733058929443, "epoch": 5.559440559440559, "grad_norm": 0.90625, "learning_rate": 0.0003129875250603651, "loss": 6.1322, "mean_token_accuracy": 0.14713452458381654, "num_tokens": 8994217.0, "step": 2785 }, { "entropy": 6.758557415008545, "epoch": 5.569430569430569, "grad_norm": 0.953125, "learning_rate": 0.00031211634550477397, "loss": 6.2114, "mean_token_accuracy": 0.1437595844268799, "num_tokens": 9009782.0, "step": 2790 }, { "entropy": 6.554935073852539, "epoch": 5.57942057942058, "grad_norm": 0.9140625, "learning_rate": 0.00031124459356921994, "loss": 5.9289, "mean_token_accuracy": 0.16744150817394257, "num_tokens": 9026968.0, "step": 2795 }, { "entropy": 6.615646171569824, "epoch": 5.58941058941059, "grad_norm": 0.890625, "learning_rate": 0.00031037228269719644, "loss": 6.0043, "mean_token_accuracy": 0.16536734253168106, "num_tokens": 9044406.0, "step": 2800 }, { "entropy": 6.733282613754272, "epoch": 5.5994005994005995, "grad_norm": 0.90625, "learning_rate": 0.00030949942634081614, "loss": 6.1723, "mean_token_accuracy": 0.15546176731586456, "num_tokens": 9061333.0, "step": 2805 }, { "entropy": 6.590979480743409, "epoch": 5.609390609390609, "grad_norm": 0.87109375, "learning_rate": 0.0003086260379606039, "loss": 6.0079, "mean_token_accuracy": 0.1656118005514145, "num_tokens": 9079486.0, "step": 2810 }, { "entropy": 6.820206928253174, "epoch": 5.619380619380619, "grad_norm": 0.99609375, "learning_rate": 0.0003077521310252889, "loss": 6.2631, "mean_token_accuracy": 0.14010816365480422, "num_tokens": 9094409.0, "step": 2815 }, { "entropy": 6.764787817001343, "epoch": 5.629370629370629, "grad_norm": 0.9453125, "learning_rate": 0.0003068777190115971, "loss": 6.1876, "mean_token_accuracy": 0.14723504558205605, "num_tokens": 9110712.0, "step": 2820 }, { "entropy": 6.747758054733277, "epoch": 5.639360639360639, "grad_norm": 0.96484375, "learning_rate": 0.0003060028154040436, "loss": 6.1668, "mean_token_accuracy": 0.15209394842386245, "num_tokens": 9126426.0, "step": 2825 }, { "entropy": 6.803288507461548, "epoch": 5.64935064935065, "grad_norm": 0.9140625, "learning_rate": 0.00030512743369472427, "loss": 6.1557, "mean_token_accuracy": 0.14992619454860687, "num_tokens": 9142901.0, "step": 2830 }, { "entropy": 6.759994745254517, "epoch": 5.65934065934066, "grad_norm": 0.9765625, "learning_rate": 0.0003042515873831079, "loss": 6.1878, "mean_token_accuracy": 0.14862883388996123, "num_tokens": 9158974.0, "step": 2835 }, { "entropy": 6.736810684204102, "epoch": 5.6693306693306695, "grad_norm": 0.9921875, "learning_rate": 0.00030337528997582817, "loss": 6.1618, "mean_token_accuracy": 0.15145443826913835, "num_tokens": 9175144.0, "step": 2840 }, { "entropy": 6.772388362884522, "epoch": 5.679320679320679, "grad_norm": 0.98046875, "learning_rate": 0.00030249855498647513, "loss": 6.2011, "mean_token_accuracy": 0.14533560425043107, "num_tokens": 9190527.0, "step": 2845 }, { "entropy": 6.70671763420105, "epoch": 5.689310689310689, "grad_norm": 0.97265625, "learning_rate": 0.00030162139593538687, "loss": 6.1362, "mean_token_accuracy": 0.15645534694194793, "num_tokens": 9205161.0, "step": 2850 }, { "entropy": 6.652488327026367, "epoch": 5.699300699300699, "grad_norm": 0.86328125, "learning_rate": 0.0003007438263494411, "loss": 6.0405, "mean_token_accuracy": 0.16484805941581726, "num_tokens": 9219903.0, "step": 2855 }, { "entropy": 6.774199056625366, "epoch": 5.709290709290709, "grad_norm": 0.9765625, "learning_rate": 0.0002998658597618463, "loss": 6.2443, "mean_token_accuracy": 0.14615929871797562, "num_tokens": 9235352.0, "step": 2860 }, { "entropy": 6.834502792358398, "epoch": 5.719280719280719, "grad_norm": 0.984375, "learning_rate": 0.0002989875097119335, "loss": 6.2241, "mean_token_accuracy": 0.14444975405931473, "num_tokens": 9251192.0, "step": 2865 }, { "entropy": 6.7178901672363285, "epoch": 5.729270729270729, "grad_norm": 0.94921875, "learning_rate": 0.000298108789744947, "loss": 6.1513, "mean_token_accuracy": 0.15107686445116997, "num_tokens": 9266816.0, "step": 2870 }, { "entropy": 6.755792713165283, "epoch": 5.7392607392607395, "grad_norm": 1.015625, "learning_rate": 0.0002972297134118356, "loss": 6.2339, "mean_token_accuracy": 0.1452716678380966, "num_tokens": 9283248.0, "step": 2875 }, { "entropy": 6.7064189434051515, "epoch": 5.749250749250749, "grad_norm": 1.0078125, "learning_rate": 0.0002963502942690441, "loss": 6.094, "mean_token_accuracy": 0.16428667902946473, "num_tokens": 9300098.0, "step": 2880 }, { "entropy": 6.7218194007873535, "epoch": 5.759240759240759, "grad_norm": 0.9140625, "learning_rate": 0.0002954705458783033, "loss": 6.037, "mean_token_accuracy": 0.14957161098718644, "num_tokens": 9315295.0, "step": 2885 }, { "entropy": 6.6549944400787355, "epoch": 5.769230769230769, "grad_norm": 0.9375, "learning_rate": 0.00029459048180642176, "loss": 6.0487, "mean_token_accuracy": 0.16057559698820115, "num_tokens": 9330543.0, "step": 2890 }, { "entropy": 6.823046875, "epoch": 5.779220779220779, "grad_norm": 0.875, "learning_rate": 0.0002937101156250763, "loss": 6.3435, "mean_token_accuracy": 0.1340113826096058, "num_tokens": 9347648.0, "step": 2895 }, { "entropy": 6.738254690170288, "epoch": 5.789210789210789, "grad_norm": 0.89453125, "learning_rate": 0.0002928294609106022, "loss": 6.1946, "mean_token_accuracy": 0.1494604006409645, "num_tokens": 9363449.0, "step": 2900 }, { "entropy": 6.779056024551392, "epoch": 5.799200799200799, "grad_norm": 0.984375, "learning_rate": 0.0002919485312437849, "loss": 6.2378, "mean_token_accuracy": 0.14085338786244392, "num_tokens": 9379076.0, "step": 2905 }, { "entropy": 6.701514196395874, "epoch": 5.8091908091908095, "grad_norm": 0.890625, "learning_rate": 0.00029106734020964946, "loss": 6.0894, "mean_token_accuracy": 0.15330516248941423, "num_tokens": 9395189.0, "step": 2910 }, { "entropy": 6.644832420349121, "epoch": 5.819180819180819, "grad_norm": 0.8828125, "learning_rate": 0.00029018590139725175, "loss": 6.0975, "mean_token_accuracy": 0.15905272886157035, "num_tokens": 9412628.0, "step": 2915 }, { "entropy": 6.78626971244812, "epoch": 5.829170829170829, "grad_norm": 1.0625, "learning_rate": 0.0002893042283994686, "loss": 6.21, "mean_token_accuracy": 0.1535573847591877, "num_tokens": 9428611.0, "step": 2920 }, { "entropy": 6.741098833084107, "epoch": 5.839160839160839, "grad_norm": 0.97265625, "learning_rate": 0.0002884223348127885, "loss": 6.216, "mean_token_accuracy": 0.1457300677895546, "num_tokens": 9443061.0, "step": 2925 }, { "entropy": 6.764222621917725, "epoch": 5.849150849150849, "grad_norm": 0.94140625, "learning_rate": 0.00028754023423710115, "loss": 6.1228, "mean_token_accuracy": 0.1505616247653961, "num_tokens": 9460297.0, "step": 2930 }, { "entropy": 6.7355364799499515, "epoch": 5.859140859140859, "grad_norm": 0.93359375, "learning_rate": 0.0002866579402754891, "loss": 6.2792, "mean_token_accuracy": 0.14343006461858748, "num_tokens": 9476084.0, "step": 2935 }, { "entropy": 6.835593891143799, "epoch": 5.869130869130869, "grad_norm": 1.0, "learning_rate": 0.0002857754665340162, "loss": 6.2601, "mean_token_accuracy": 0.14737984538078308, "num_tokens": 9491797.0, "step": 2940 }, { "entropy": 6.735013103485107, "epoch": 5.8791208791208796, "grad_norm": 0.8984375, "learning_rate": 0.00028489282662151963, "loss": 6.2271, "mean_token_accuracy": 0.14730442240834235, "num_tokens": 9508132.0, "step": 2945 }, { "entropy": 6.7681694507598875, "epoch": 5.889110889110889, "grad_norm": 1.046875, "learning_rate": 0.00028401003414939855, "loss": 6.2146, "mean_token_accuracy": 0.1433539569377899, "num_tokens": 9522829.0, "step": 2950 }, { "entropy": 6.827762079238892, "epoch": 5.899100899100899, "grad_norm": 0.92578125, "learning_rate": 0.00028312710273140486, "loss": 6.2209, "mean_token_accuracy": 0.1427636742591858, "num_tokens": 9539765.0, "step": 2955 }, { "entropy": 6.7047460079193115, "epoch": 5.909090909090909, "grad_norm": 0.984375, "learning_rate": 0.0002822440459834334, "loss": 6.1373, "mean_token_accuracy": 0.15112546533346177, "num_tokens": 9556115.0, "step": 2960 }, { "entropy": 6.693974304199219, "epoch": 5.919080919080919, "grad_norm": 0.95703125, "learning_rate": 0.00028136087752331153, "loss": 6.1997, "mean_token_accuracy": 0.14960069656372071, "num_tokens": 9572055.0, "step": 2965 }, { "entropy": 6.7659505844116214, "epoch": 5.929070929070929, "grad_norm": 0.96484375, "learning_rate": 0.0002804776109705895, "loss": 6.2547, "mean_token_accuracy": 0.14203526228666305, "num_tokens": 9588193.0, "step": 2970 }, { "entropy": 6.758017873764038, "epoch": 5.939060939060939, "grad_norm": 0.94921875, "learning_rate": 0.0002795942599463301, "loss": 6.221, "mean_token_accuracy": 0.14382123649120332, "num_tokens": 9603330.0, "step": 2975 }, { "entropy": 6.736752033233643, "epoch": 5.949050949050949, "grad_norm": 0.953125, "learning_rate": 0.00027871083807289905, "loss": 6.1896, "mean_token_accuracy": 0.15268184915184974, "num_tokens": 9620703.0, "step": 2980 }, { "entropy": 6.779514265060425, "epoch": 5.959040959040959, "grad_norm": 0.96875, "learning_rate": 0.0002778273589737544, "loss": 6.2397, "mean_token_accuracy": 0.14332889392971992, "num_tokens": 9636420.0, "step": 2985 }, { "entropy": 6.694042062759399, "epoch": 5.969030969030969, "grad_norm": 0.90234375, "learning_rate": 0.0002769438362732367, "loss": 6.1708, "mean_token_accuracy": 0.15217726826667785, "num_tokens": 9653595.0, "step": 2990 }, { "entropy": 6.753486251831054, "epoch": 5.979020979020979, "grad_norm": 0.984375, "learning_rate": 0.00027606028359635897, "loss": 6.0968, "mean_token_accuracy": 0.15684330314397812, "num_tokens": 9670460.0, "step": 2995 }, { "entropy": 6.663070583343506, "epoch": 5.989010989010989, "grad_norm": 0.94921875, "learning_rate": 0.0002751767145685967, "loss": 6.1541, "mean_token_accuracy": 0.15319789946079254, "num_tokens": 9686872.0, "step": 3000 }, { "epoch": 5.989010989010989, "eval_entropy": 6.5131735311972125, "eval_loss": 7.009202480316162, "eval_mean_token_accuracy": 0.11367595379014273, "eval_num_tokens": 9686872.0, "eval_runtime": 1.1756, "eval_samples_per_second": 1253.854, "eval_steps_per_second": 157.37, "step": 3000 }, { "entropy": 6.667050361633301, "epoch": 5.999000999000999, "grad_norm": 1.09375, "learning_rate": 0.00027429314281567714, "loss": 6.1054, "mean_token_accuracy": 0.1524140864610672, "num_tokens": 9701973.0, "step": 3005 }, { "entropy": 6.811369631025526, "epoch": 6.007992007992008, "grad_norm": 0.84765625, "learning_rate": 0.00027340958196336976, "loss": 5.9272, "mean_token_accuracy": 0.15800701909595066, "num_tokens": 9714961.0, "step": 3010 }, { "entropy": 6.794833135604859, "epoch": 6.017982017982018, "grad_norm": 0.89453125, "learning_rate": 0.00027252604563727595, "loss": 6.0496, "mean_token_accuracy": 0.14867913946509362, "num_tokens": 9731013.0, "step": 3015 }, { "entropy": 6.725656223297119, "epoch": 6.027972027972028, "grad_norm": 0.9453125, "learning_rate": 0.00027164254746261875, "loss": 5.9168, "mean_token_accuracy": 0.1591576501727104, "num_tokens": 9746223.0, "step": 3020 }, { "entropy": 6.70501480102539, "epoch": 6.037962037962038, "grad_norm": 0.90625, "learning_rate": 0.0002707591010640332, "loss": 5.8616, "mean_token_accuracy": 0.16593915671110154, "num_tokens": 9762626.0, "step": 3025 }, { "entropy": 6.698665618896484, "epoch": 6.047952047952048, "grad_norm": 0.9609375, "learning_rate": 0.0002698757200653554, "loss": 5.8605, "mean_token_accuracy": 0.1670130595564842, "num_tokens": 9778563.0, "step": 3030 }, { "entropy": 6.726486110687256, "epoch": 6.057942057942058, "grad_norm": 0.9140625, "learning_rate": 0.00026899241808941326, "loss": 5.9336, "mean_token_accuracy": 0.15832085609436036, "num_tokens": 9795250.0, "step": 3035 }, { "entropy": 6.718913221359253, "epoch": 6.067932067932068, "grad_norm": 0.96875, "learning_rate": 0.0002681092087578159, "loss": 5.9569, "mean_token_accuracy": 0.15379346162080765, "num_tokens": 9810695.0, "step": 3040 }, { "entropy": 6.479945373535156, "epoch": 6.077922077922078, "grad_norm": 0.94140625, "learning_rate": 0.0002672261056907437, "loss": 5.6432, "mean_token_accuracy": 0.18392495214939117, "num_tokens": 9826980.0, "step": 3045 }, { "entropy": 6.660666799545288, "epoch": 6.087912087912088, "grad_norm": 0.8125, "learning_rate": 0.00026634312250673863, "loss": 5.8529, "mean_token_accuracy": 0.16628624498844147, "num_tokens": 9842464.0, "step": 3050 }, { "entropy": 6.635022068023682, "epoch": 6.0979020979020975, "grad_norm": 0.94921875, "learning_rate": 0.0002654602728224936, "loss": 5.8526, "mean_token_accuracy": 0.17187197804450988, "num_tokens": 9858358.0, "step": 3055 }, { "entropy": 6.732779121398925, "epoch": 6.107892107892108, "grad_norm": 0.96875, "learning_rate": 0.00026457757025264274, "loss": 5.982, "mean_token_accuracy": 0.1538893237709999, "num_tokens": 9875970.0, "step": 3060 }, { "entropy": 6.8009437084197994, "epoch": 6.117882117882118, "grad_norm": 1.0, "learning_rate": 0.0002636950284095519, "loss": 6.004, "mean_token_accuracy": 0.16047981530427932, "num_tokens": 9891790.0, "step": 3065 }, { "entropy": 6.659499311447144, "epoch": 6.127872127872128, "grad_norm": 1.0234375, "learning_rate": 0.0002628126609031078, "loss": 5.9457, "mean_token_accuracy": 0.16013357043266296, "num_tokens": 9906510.0, "step": 3070 }, { "entropy": 6.662178611755371, "epoch": 6.137862137862138, "grad_norm": 1.046875, "learning_rate": 0.000261930481340509, "loss": 5.8334, "mean_token_accuracy": 0.17112718373537064, "num_tokens": 9921934.0, "step": 3075 }, { "entropy": 6.543264293670655, "epoch": 6.147852147852148, "grad_norm": 1.046875, "learning_rate": 0.00026104850332605575, "loss": 5.7794, "mean_token_accuracy": 0.17351728826761245, "num_tokens": 9937791.0, "step": 3080 }, { "entropy": 6.751798915863037, "epoch": 6.157842157842158, "grad_norm": 1.03125, "learning_rate": 0.00026016674046093995, "loss": 5.9961, "mean_token_accuracy": 0.15603744834661484, "num_tokens": 9952832.0, "step": 3085 }, { "entropy": 6.6119616508483885, "epoch": 6.1678321678321675, "grad_norm": 0.984375, "learning_rate": 0.00025928520634303597, "loss": 5.7803, "mean_token_accuracy": 0.17755611389875411, "num_tokens": 9968868.0, "step": 3090 }, { "entropy": 6.674328279495239, "epoch": 6.177822177822178, "grad_norm": 1.0390625, "learning_rate": 0.0002584039145666903, "loss": 5.9854, "mean_token_accuracy": 0.153406497836113, "num_tokens": 9985335.0, "step": 3095 }, { "entropy": 6.702618741989136, "epoch": 6.187812187812188, "grad_norm": 0.984375, "learning_rate": 0.0002575228787225122, "loss": 5.8918, "mean_token_accuracy": 0.1584560126066208, "num_tokens": 10001340.0, "step": 3100 }, { "entropy": 6.719108009338379, "epoch": 6.197802197802198, "grad_norm": 1.015625, "learning_rate": 0.00025664211239716456, "loss": 6.0052, "mean_token_accuracy": 0.15488356947898865, "num_tokens": 10017113.0, "step": 3105 }, { "entropy": 6.730152177810669, "epoch": 6.207792207792208, "grad_norm": 1.0, "learning_rate": 0.00025576162917315354, "loss": 5.9705, "mean_token_accuracy": 0.15568059384822847, "num_tokens": 10033608.0, "step": 3110 }, { "entropy": 6.674771642684936, "epoch": 6.217782217782218, "grad_norm": 0.9296875, "learning_rate": 0.0002548814426286196, "loss": 5.9112, "mean_token_accuracy": 0.16848817467689514, "num_tokens": 10050082.0, "step": 3115 }, { "entropy": 6.667506265640259, "epoch": 6.227772227772228, "grad_norm": 0.84765625, "learning_rate": 0.0002540015663371282, "loss": 5.9034, "mean_token_accuracy": 0.16528174877166749, "num_tokens": 10066461.0, "step": 3120 }, { "entropy": 6.715219736099243, "epoch": 6.2377622377622375, "grad_norm": 0.9921875, "learning_rate": 0.0002531220138674601, "loss": 5.917, "mean_token_accuracy": 0.15922432541847228, "num_tokens": 10082732.0, "step": 3125 }, { "entropy": 6.733363628387451, "epoch": 6.247752247752247, "grad_norm": 1.0390625, "learning_rate": 0.00025224279878340266, "loss": 5.9678, "mean_token_accuracy": 0.1561704620718956, "num_tokens": 10098532.0, "step": 3130 }, { "entropy": 6.467260646820068, "epoch": 6.257742257742258, "grad_norm": 0.86328125, "learning_rate": 0.00025136393464353997, "loss": 5.7319, "mean_token_accuracy": 0.17858326733112334, "num_tokens": 10115699.0, "step": 3135 }, { "entropy": 6.670676136016846, "epoch": 6.267732267732268, "grad_norm": 0.93359375, "learning_rate": 0.0002504854350010442, "loss": 5.8802, "mean_token_accuracy": 0.16762400567531585, "num_tokens": 10132737.0, "step": 3140 }, { "entropy": 6.539636659622192, "epoch": 6.277722277722278, "grad_norm": 0.95703125, "learning_rate": 0.00024960731340346664, "loss": 5.7859, "mean_token_accuracy": 0.17589905112981796, "num_tokens": 10151355.0, "step": 3145 }, { "entropy": 6.598786783218384, "epoch": 6.287712287712288, "grad_norm": 0.9375, "learning_rate": 0.00024872958339252867, "loss": 5.8141, "mean_token_accuracy": 0.1812353700399399, "num_tokens": 10168882.0, "step": 3150 }, { "entropy": 6.66910457611084, "epoch": 6.297702297702298, "grad_norm": 0.87109375, "learning_rate": 0.0002478522585039129, "loss": 5.9243, "mean_token_accuracy": 0.165535007417202, "num_tokens": 10186027.0, "step": 3155 }, { "entropy": 6.616514539718628, "epoch": 6.3076923076923075, "grad_norm": 1.015625, "learning_rate": 0.00024697535226705437, "loss": 5.8731, "mean_token_accuracy": 0.16666304916143418, "num_tokens": 10202961.0, "step": 3160 }, { "entropy": 6.683314466476441, "epoch": 6.317682317682317, "grad_norm": 0.98828125, "learning_rate": 0.00024609887820493183, "loss": 5.9605, "mean_token_accuracy": 0.1603623390197754, "num_tokens": 10220049.0, "step": 3165 }, { "entropy": 6.586607599258423, "epoch": 6.327672327672328, "grad_norm": 1.0390625, "learning_rate": 0.00024522284983385993, "loss": 5.8334, "mean_token_accuracy": 0.17442394644021988, "num_tokens": 10236202.0, "step": 3170 }, { "entropy": 6.744188976287842, "epoch": 6.337662337662338, "grad_norm": 0.97265625, "learning_rate": 0.0002443472806632797, "loss": 5.9936, "mean_token_accuracy": 0.14994580149650574, "num_tokens": 10252744.0, "step": 3175 }, { "entropy": 6.680088901519776, "epoch": 6.347652347652348, "grad_norm": 0.9765625, "learning_rate": 0.0002434721841955508, "loss": 5.9764, "mean_token_accuracy": 0.15999541878700257, "num_tokens": 10270116.0, "step": 3180 }, { "entropy": 6.6716166019439695, "epoch": 6.357642357642358, "grad_norm": 1.015625, "learning_rate": 0.00024259757392574327, "loss": 5.9068, "mean_token_accuracy": 0.16267402321100236, "num_tokens": 10285535.0, "step": 3185 }, { "entropy": 6.605439949035644, "epoch": 6.367632367632368, "grad_norm": 1.0234375, "learning_rate": 0.00024172346334142957, "loss": 5.8611, "mean_token_accuracy": 0.16832938343286513, "num_tokens": 10301885.0, "step": 3190 }, { "entropy": 6.622616386413574, "epoch": 6.3776223776223775, "grad_norm": 0.94140625, "learning_rate": 0.0002408498659224762, "loss": 5.883, "mean_token_accuracy": 0.16275829821825027, "num_tokens": 10318652.0, "step": 3195 }, { "entropy": 6.561596488952636, "epoch": 6.387612387612387, "grad_norm": 0.98828125, "learning_rate": 0.00023997679514083616, "loss": 5.7633, "mean_token_accuracy": 0.17888872176408768, "num_tokens": 10335472.0, "step": 3200 }, { "entropy": 6.770061922073364, "epoch": 6.397602397602397, "grad_norm": 1.1328125, "learning_rate": 0.00023910426446034056, "loss": 5.9736, "mean_token_accuracy": 0.1615581527352333, "num_tokens": 10351765.0, "step": 3205 }, { "entropy": 6.618225193023681, "epoch": 6.407592407592408, "grad_norm": 1.03125, "learning_rate": 0.00023823228733649228, "loss": 5.8996, "mean_token_accuracy": 0.16589005142450333, "num_tokens": 10367785.0, "step": 3210 }, { "entropy": 6.701905727386475, "epoch": 6.417582417582418, "grad_norm": 1.0390625, "learning_rate": 0.00023736087721625704, "loss": 5.9601, "mean_token_accuracy": 0.15581939220428467, "num_tokens": 10383321.0, "step": 3215 }, { "entropy": 6.667162084579468, "epoch": 6.427572427572428, "grad_norm": 0.97265625, "learning_rate": 0.00023649004753785696, "loss": 5.9097, "mean_token_accuracy": 0.16299981772899627, "num_tokens": 10400408.0, "step": 3220 }, { "entropy": 6.713379383087158, "epoch": 6.437562437562438, "grad_norm": 1.0703125, "learning_rate": 0.0002356198117305629, "loss": 5.9304, "mean_token_accuracy": 0.15914269238710405, "num_tokens": 10416081.0, "step": 3225 }, { "entropy": 6.6272495746612545, "epoch": 6.4475524475524475, "grad_norm": 0.8828125, "learning_rate": 0.00023475018321448754, "loss": 5.9052, "mean_token_accuracy": 0.16455738097429276, "num_tokens": 10433592.0, "step": 3230 }, { "entropy": 6.607774972915649, "epoch": 6.457542457542457, "grad_norm": 0.8984375, "learning_rate": 0.0002338811754003785, "loss": 5.8565, "mean_token_accuracy": 0.16780562996864318, "num_tokens": 10451316.0, "step": 3235 }, { "entropy": 6.640334224700927, "epoch": 6.467532467532467, "grad_norm": 1.0390625, "learning_rate": 0.00023301280168941114, "loss": 5.956, "mean_token_accuracy": 0.15648091286420823, "num_tokens": 10466541.0, "step": 3240 }, { "entropy": 6.626655054092407, "epoch": 6.477522477522477, "grad_norm": 0.94140625, "learning_rate": 0.0002321450754729823, "loss": 5.9533, "mean_token_accuracy": 0.15833957493305206, "num_tokens": 10482801.0, "step": 3245 }, { "entropy": 6.74118275642395, "epoch": 6.487512487512488, "grad_norm": 0.984375, "learning_rate": 0.00023127801013250377, "loss": 6.0075, "mean_token_accuracy": 0.15086964070796965, "num_tokens": 10498760.0, "step": 3250 }, { "entropy": 6.7118512153625485, "epoch": 6.497502497502498, "grad_norm": 1.1328125, "learning_rate": 0.00023041161903919566, "loss": 6.0083, "mean_token_accuracy": 0.15017944872379302, "num_tokens": 10514201.0, "step": 3255 }, { "entropy": 6.69952392578125, "epoch": 6.507492507492508, "grad_norm": 1.0703125, "learning_rate": 0.00022954591555388043, "loss": 5.9465, "mean_token_accuracy": 0.16899550408124925, "num_tokens": 10528651.0, "step": 3260 }, { "entropy": 6.703047037124634, "epoch": 6.5174825174825175, "grad_norm": 1.0859375, "learning_rate": 0.00022868091302677678, "loss": 6.0349, "mean_token_accuracy": 0.15120028406381608, "num_tokens": 10544164.0, "step": 3265 }, { "entropy": 6.736421346664429, "epoch": 6.527472527472527, "grad_norm": 0.984375, "learning_rate": 0.00022781662479729354, "loss": 6.0292, "mean_token_accuracy": 0.15082689970731736, "num_tokens": 10561337.0, "step": 3270 }, { "entropy": 6.639842367172241, "epoch": 6.537462537462537, "grad_norm": 0.9453125, "learning_rate": 0.00022695306419382472, "loss": 5.9328, "mean_token_accuracy": 0.16010500639677047, "num_tokens": 10577567.0, "step": 3275 }, { "entropy": 6.616949653625488, "epoch": 6.547452547452547, "grad_norm": 1.0703125, "learning_rate": 0.00022609024453354283, "loss": 5.8235, "mean_token_accuracy": 0.1706709787249565, "num_tokens": 10594767.0, "step": 3280 }, { "entropy": 6.635041046142578, "epoch": 6.557442557442558, "grad_norm": 0.9765625, "learning_rate": 0.00022522817912219446, "loss": 5.8821, "mean_token_accuracy": 0.16167248860001565, "num_tokens": 10610594.0, "step": 3285 }, { "entropy": 6.632221508026123, "epoch": 6.567432567432568, "grad_norm": 0.9375, "learning_rate": 0.00022436688125389466, "loss": 5.8474, "mean_token_accuracy": 0.16641118377447128, "num_tokens": 10627698.0, "step": 3290 }, { "entropy": 6.583418893814087, "epoch": 6.577422577422578, "grad_norm": 0.9921875, "learning_rate": 0.00022350636421092213, "loss": 5.8707, "mean_token_accuracy": 0.16971496865153313, "num_tokens": 10645744.0, "step": 3295 }, { "entropy": 6.7090983390808105, "epoch": 6.5874125874125875, "grad_norm": 1.03125, "learning_rate": 0.0002226466412635141, "loss": 6.034, "mean_token_accuracy": 0.14708581790328026, "num_tokens": 10661896.0, "step": 3300 }, { "entropy": 6.669993305206299, "epoch": 6.597402597402597, "grad_norm": 1.0390625, "learning_rate": 0.00022178772566966198, "loss": 5.9026, "mean_token_accuracy": 0.16566328555345536, "num_tokens": 10677241.0, "step": 3305 }, { "entropy": 6.60449252128601, "epoch": 6.607392607392607, "grad_norm": 1.0390625, "learning_rate": 0.00022092963067490667, "loss": 5.8478, "mean_token_accuracy": 0.17454764544963836, "num_tokens": 10692716.0, "step": 3310 }, { "entropy": 6.557140254974366, "epoch": 6.617382617382617, "grad_norm": 1.0078125, "learning_rate": 0.0002200723695121347, "loss": 5.8662, "mean_token_accuracy": 0.16653716638684274, "num_tokens": 10709061.0, "step": 3315 }, { "entropy": 6.741697168350219, "epoch": 6.627372627372627, "grad_norm": 1.109375, "learning_rate": 0.0002192159554013735, "loss": 5.9052, "mean_token_accuracy": 0.16193668246269227, "num_tokens": 10723779.0, "step": 3320 }, { "entropy": 6.678752851486206, "epoch": 6.637362637362637, "grad_norm": 1.0703125, "learning_rate": 0.0002183604015495882, "loss": 6.0355, "mean_token_accuracy": 0.15054982751607895, "num_tokens": 10739434.0, "step": 3325 }, { "entropy": 6.753955078125, "epoch": 6.647352647352648, "grad_norm": 1.03125, "learning_rate": 0.00021750572115047744, "loss": 6.0001, "mean_token_accuracy": 0.1533624932169914, "num_tokens": 10755673.0, "step": 3330 }, { "entropy": 6.688982105255127, "epoch": 6.6573426573426575, "grad_norm": 1.1171875, "learning_rate": 0.00021665192738427037, "loss": 5.9595, "mean_token_accuracy": 0.15226165056228638, "num_tokens": 10771391.0, "step": 3335 }, { "entropy": 6.657888507843017, "epoch": 6.667332667332667, "grad_norm": 1.015625, "learning_rate": 0.00021579903341752311, "loss": 5.9731, "mean_token_accuracy": 0.15780570358037949, "num_tokens": 10786521.0, "step": 3340 }, { "entropy": 6.692771291732788, "epoch": 6.677322677322677, "grad_norm": 1.0234375, "learning_rate": 0.00021494705240291556, "loss": 5.9591, "mean_token_accuracy": 0.15971760749816893, "num_tokens": 10802521.0, "step": 3345 }, { "entropy": 6.6980222225189205, "epoch": 6.687312687312687, "grad_norm": 1.09375, "learning_rate": 0.00021409599747904896, "loss": 5.9931, "mean_token_accuracy": 0.1567689597606659, "num_tokens": 10817993.0, "step": 3350 }, { "entropy": 6.713626289367676, "epoch": 6.697302697302697, "grad_norm": 1.0546875, "learning_rate": 0.00021324588177024307, "loss": 6.0065, "mean_token_accuracy": 0.1490321561694145, "num_tokens": 10834115.0, "step": 3355 }, { "entropy": 6.66970043182373, "epoch": 6.707292707292707, "grad_norm": 1.0625, "learning_rate": 0.0002123967183863338, "loss": 5.9272, "mean_token_accuracy": 0.16388960182666779, "num_tokens": 10849695.0, "step": 3360 }, { "entropy": 6.626486682891846, "epoch": 6.717282717282718, "grad_norm": 1.0546875, "learning_rate": 0.00021154852042247092, "loss": 5.9096, "mean_token_accuracy": 0.16861118227243424, "num_tokens": 10866950.0, "step": 3365 }, { "entropy": 6.742733383178711, "epoch": 6.7272727272727275, "grad_norm": 1.1171875, "learning_rate": 0.00021070130095891628, "loss": 6.0537, "mean_token_accuracy": 0.15284008532762527, "num_tokens": 10882035.0, "step": 3370 }, { "entropy": 6.651487350463867, "epoch": 6.737262737262737, "grad_norm": 0.9921875, "learning_rate": 0.00020985507306084218, "loss": 5.9644, "mean_token_accuracy": 0.16457273215055465, "num_tokens": 10898811.0, "step": 3375 }, { "entropy": 6.707548761367798, "epoch": 6.747252747252747, "grad_norm": 0.953125, "learning_rate": 0.00020900984977812964, "loss": 6.0446, "mean_token_accuracy": 0.1516970418393612, "num_tokens": 10914701.0, "step": 3380 }, { "entropy": 6.699026727676392, "epoch": 6.757242757242757, "grad_norm": 1.0234375, "learning_rate": 0.0002081656441451672, "loss": 6.0143, "mean_token_accuracy": 0.15427461713552476, "num_tokens": 10931773.0, "step": 3385 }, { "entropy": 6.6985736846923825, "epoch": 6.767232767232767, "grad_norm": 1.0546875, "learning_rate": 0.00020732246918065005, "loss": 5.9973, "mean_token_accuracy": 0.15959020256996154, "num_tokens": 10947929.0, "step": 3390 }, { "entropy": 6.68319182395935, "epoch": 6.777222777222777, "grad_norm": 1.0625, "learning_rate": 0.00020648033788737914, "loss": 6.0279, "mean_token_accuracy": 0.15430406481027603, "num_tokens": 10964798.0, "step": 3395 }, { "entropy": 6.675410461425781, "epoch": 6.787212787212788, "grad_norm": 1.09375, "learning_rate": 0.00020563926325206094, "loss": 5.9146, "mean_token_accuracy": 0.16917263716459274, "num_tokens": 10980815.0, "step": 3400 }, { "entropy": 6.660783338546753, "epoch": 6.7972027972027975, "grad_norm": 1.03125, "learning_rate": 0.0002047992582451067, "loss": 5.9614, "mean_token_accuracy": 0.1624804586172104, "num_tokens": 10997366.0, "step": 3405 }, { "entropy": 6.663835954666138, "epoch": 6.807192807192807, "grad_norm": 1.0078125, "learning_rate": 0.0002039603358204328, "loss": 5.9983, "mean_token_accuracy": 0.15653773844242097, "num_tokens": 11013609.0, "step": 3410 }, { "entropy": 6.603413772583008, "epoch": 6.817182817182817, "grad_norm": 0.93359375, "learning_rate": 0.00020312250891526063, "loss": 5.8663, "mean_token_accuracy": 0.166923126578331, "num_tokens": 11029362.0, "step": 3415 }, { "entropy": 6.613164949417114, "epoch": 6.827172827172827, "grad_norm": 0.99609375, "learning_rate": 0.00020228579044991786, "loss": 5.9028, "mean_token_accuracy": 0.17450464218854905, "num_tokens": 11046414.0, "step": 3420 }, { "entropy": 6.673628473281861, "epoch": 6.837162837162837, "grad_norm": 1.0390625, "learning_rate": 0.000201450193327638, "loss": 5.9125, "mean_token_accuracy": 0.16300807595252992, "num_tokens": 11062717.0, "step": 3425 }, { "entropy": 6.690763187408447, "epoch": 6.847152847152847, "grad_norm": 1.0078125, "learning_rate": 0.00020061573043436243, "loss": 5.9264, "mean_token_accuracy": 0.15790411382913588, "num_tokens": 11078471.0, "step": 3430 }, { "entropy": 6.696146726608276, "epoch": 6.857142857142857, "grad_norm": 0.99609375, "learning_rate": 0.0001997824146385413, "loss": 6.026, "mean_token_accuracy": 0.1504951074719429, "num_tokens": 11094232.0, "step": 3435 }, { "entropy": 6.708989524841309, "epoch": 6.867132867132867, "grad_norm": 0.890625, "learning_rate": 0.0001989502587909351, "loss": 5.9691, "mean_token_accuracy": 0.15976719558238983, "num_tokens": 11109229.0, "step": 3440 }, { "entropy": 6.651607513427734, "epoch": 6.877122877122877, "grad_norm": 1.046875, "learning_rate": 0.0001981192757244163, "loss": 5.8943, "mean_token_accuracy": 0.16629891097545624, "num_tokens": 11125114.0, "step": 3445 }, { "entropy": 6.711129951477051, "epoch": 6.887112887112887, "grad_norm": 0.99609375, "learning_rate": 0.0001972894782537718, "loss": 6.0519, "mean_token_accuracy": 0.15405267030000686, "num_tokens": 11140448.0, "step": 3450 }, { "entropy": 6.641443872451783, "epoch": 6.897102897102897, "grad_norm": 1.0234375, "learning_rate": 0.00019646087917550505, "loss": 5.9352, "mean_token_accuracy": 0.168939571082592, "num_tokens": 11157443.0, "step": 3455 }, { "entropy": 6.718652534484863, "epoch": 6.907092907092907, "grad_norm": 1.0703125, "learning_rate": 0.00019563349126763902, "loss": 5.9891, "mean_token_accuracy": 0.15499554723501205, "num_tokens": 11172803.0, "step": 3460 }, { "entropy": 6.705828380584717, "epoch": 6.917082917082917, "grad_norm": 1.1015625, "learning_rate": 0.00019480732728951861, "loss": 5.9615, "mean_token_accuracy": 0.16026063561439513, "num_tokens": 11188413.0, "step": 3465 }, { "entropy": 6.677292966842652, "epoch": 6.927072927072927, "grad_norm": 0.9296875, "learning_rate": 0.0001939823999816145, "loss": 6.0443, "mean_token_accuracy": 0.15838810205459594, "num_tokens": 11204696.0, "step": 3470 }, { "entropy": 6.653930139541626, "epoch": 6.937062937062937, "grad_norm": 1.046875, "learning_rate": 0.00019315872206532615, "loss": 5.9758, "mean_token_accuracy": 0.16164977997541427, "num_tokens": 11220370.0, "step": 3475 }, { "entropy": 6.59173583984375, "epoch": 6.947052947052947, "grad_norm": 1.0703125, "learning_rate": 0.00019233630624278602, "loss": 5.8121, "mean_token_accuracy": 0.18040217757225036, "num_tokens": 11236747.0, "step": 3480 }, { "entropy": 6.628941011428833, "epoch": 6.957042957042957, "grad_norm": 1.0390625, "learning_rate": 0.00019151516519666357, "loss": 5.9129, "mean_token_accuracy": 0.16064394265413284, "num_tokens": 11252983.0, "step": 3485 }, { "entropy": 6.6462867736816404, "epoch": 6.967032967032967, "grad_norm": 1.046875, "learning_rate": 0.00019069531158996938, "loss": 5.9991, "mean_token_accuracy": 0.15687418431043626, "num_tokens": 11268874.0, "step": 3490 }, { "entropy": 6.596605920791626, "epoch": 6.977022977022977, "grad_norm": 1.046875, "learning_rate": 0.0001898767580658603, "loss": 5.9186, "mean_token_accuracy": 0.16048318147659302, "num_tokens": 11284585.0, "step": 3495 }, { "entropy": 6.609864950180054, "epoch": 6.987012987012987, "grad_norm": 1.0, "learning_rate": 0.0001890595172474443, "loss": 5.8726, "mean_token_accuracy": 0.16622989922761916, "num_tokens": 11300532.0, "step": 3500 }, { "epoch": 6.987012987012987, "eval_entropy": 6.5176446708473, "eval_loss": 7.017940998077393, "eval_mean_token_accuracy": 0.11280566020994573, "eval_num_tokens": 11300532.0, "eval_runtime": 1.1719, "eval_samples_per_second": 1257.836, "eval_steps_per_second": 157.869, "step": 3500 }, { "entropy": 6.663052368164062, "epoch": 6.997002997002997, "grad_norm": 1.046875, "learning_rate": 0.0001882436017375858, "loss": 5.983, "mean_token_accuracy": 0.15732846558094024, "num_tokens": 11315785.0, "step": 3505 }, { "entropy": 6.7186354001363116, "epoch": 7.005994005994006, "grad_norm": 0.90234375, "learning_rate": 0.00018742902411871126, "loss": 5.9485, "mean_token_accuracy": 0.1631801277399063, "num_tokens": 11330223.0, "step": 3510 }, { "entropy": 6.770174551010132, "epoch": 7.015984015984016, "grad_norm": 1.015625, "learning_rate": 0.0001866157969526153, "loss": 5.8788, "mean_token_accuracy": 0.16505906283855437, "num_tokens": 11345599.0, "step": 3515 }, { "entropy": 6.590628623962402, "epoch": 7.025974025974026, "grad_norm": 1.046875, "learning_rate": 0.0001858039327802667, "loss": 5.7034, "mean_token_accuracy": 0.18024298250675203, "num_tokens": 11360810.0, "step": 3520 }, { "entropy": 6.710958862304688, "epoch": 7.035964035964036, "grad_norm": 1.015625, "learning_rate": 0.00018499344412161546, "loss": 5.8469, "mean_token_accuracy": 0.16105737686157226, "num_tokens": 11377054.0, "step": 3525 }, { "entropy": 6.595843696594239, "epoch": 7.045954045954046, "grad_norm": 1.0546875, "learning_rate": 0.00018418434347539924, "loss": 5.6857, "mean_token_accuracy": 0.18236356526613234, "num_tokens": 11392176.0, "step": 3530 }, { "entropy": 6.686300468444824, "epoch": 7.055944055944056, "grad_norm": 1.09375, "learning_rate": 0.000183376643318951, "loss": 5.8602, "mean_token_accuracy": 0.16392707526683808, "num_tokens": 11408317.0, "step": 3535 }, { "entropy": 6.640545225143432, "epoch": 7.065934065934066, "grad_norm": 1.125, "learning_rate": 0.00018257035610800616, "loss": 5.7243, "mean_token_accuracy": 0.1709170401096344, "num_tokens": 11424129.0, "step": 3540 }, { "entropy": 6.7029365539550785, "epoch": 7.075924075924076, "grad_norm": 0.9609375, "learning_rate": 0.00018176549427651107, "loss": 5.8707, "mean_token_accuracy": 0.15717865973711015, "num_tokens": 11440980.0, "step": 3545 }, { "entropy": 6.645503759384155, "epoch": 7.085914085914086, "grad_norm": 1.078125, "learning_rate": 0.00018096207023643085, "loss": 5.7552, "mean_token_accuracy": 0.17657144963741303, "num_tokens": 11457537.0, "step": 3550 }, { "entropy": 6.592128705978394, "epoch": 7.095904095904096, "grad_norm": 1.046875, "learning_rate": 0.000180160096377558, "loss": 5.736, "mean_token_accuracy": 0.17329273223876954, "num_tokens": 11473485.0, "step": 3555 }, { "entropy": 6.5658777236938475, "epoch": 7.105894105894106, "grad_norm": 1.046875, "learning_rate": 0.00017935958506732147, "loss": 5.7199, "mean_token_accuracy": 0.17719839811325072, "num_tokens": 11489115.0, "step": 3560 }, { "entropy": 6.4145917892456055, "epoch": 7.115884115884116, "grad_norm": 0.890625, "learning_rate": 0.00017856054865059617, "loss": 5.5315, "mean_token_accuracy": 0.1977701485157013, "num_tokens": 11506112.0, "step": 3565 }, { "entropy": 6.563824701309204, "epoch": 7.125874125874126, "grad_norm": 1.1640625, "learning_rate": 0.00017776299944951185, "loss": 5.6643, "mean_token_accuracy": 0.17600979059934616, "num_tokens": 11522151.0, "step": 3570 }, { "entropy": 6.628887128829956, "epoch": 7.135864135864136, "grad_norm": 1.0546875, "learning_rate": 0.00017696694976326394, "loss": 5.7374, "mean_token_accuracy": 0.1760731428861618, "num_tokens": 11536872.0, "step": 3575 }, { "entropy": 6.61938328742981, "epoch": 7.145854145854146, "grad_norm": 1.0859375, "learning_rate": 0.00017617241186792328, "loss": 5.7206, "mean_token_accuracy": 0.17701812982559204, "num_tokens": 11551767.0, "step": 3580 }, { "entropy": 6.632746267318725, "epoch": 7.1558441558441555, "grad_norm": 0.98828125, "learning_rate": 0.0001753793980162472, "loss": 5.8948, "mean_token_accuracy": 0.16603219658136367, "num_tokens": 11570027.0, "step": 3585 }, { "entropy": 6.7298290729522705, "epoch": 7.165834165834166, "grad_norm": 1.03125, "learning_rate": 0.00017458792043749017, "loss": 5.8965, "mean_token_accuracy": 0.1618497535586357, "num_tokens": 11585197.0, "step": 3590 }, { "entropy": 6.628458404541016, "epoch": 7.175824175824176, "grad_norm": 1.0859375, "learning_rate": 0.00017379799133721577, "loss": 5.8133, "mean_token_accuracy": 0.17163033932447433, "num_tokens": 11599479.0, "step": 3595 }, { "entropy": 6.560936355590821, "epoch": 7.185814185814186, "grad_norm": 1.109375, "learning_rate": 0.00017300962289710766, "loss": 5.7055, "mean_token_accuracy": 0.17093463838100434, "num_tokens": 11615656.0, "step": 3600 }, { "entropy": 6.656382131576538, "epoch": 7.195804195804196, "grad_norm": 0.99609375, "learning_rate": 0.0001722228272747826, "loss": 5.7591, "mean_token_accuracy": 0.16903391033411025, "num_tokens": 11631748.0, "step": 3605 }, { "entropy": 6.606511545181275, "epoch": 7.205794205794206, "grad_norm": 1.1484375, "learning_rate": 0.00017143761660360244, "loss": 5.7929, "mean_token_accuracy": 0.1716337412595749, "num_tokens": 11647184.0, "step": 3610 }, { "entropy": 6.531059837341308, "epoch": 7.215784215784216, "grad_norm": 1.0546875, "learning_rate": 0.000170654002992487, "loss": 5.6254, "mean_token_accuracy": 0.184749011695385, "num_tokens": 11662978.0, "step": 3615 }, { "entropy": 6.64908504486084, "epoch": 7.2257742257742255, "grad_norm": 1.0625, "learning_rate": 0.00016987199852572742, "loss": 5.7934, "mean_token_accuracy": 0.17288610935211182, "num_tokens": 11678400.0, "step": 3620 }, { "entropy": 6.6434399604797365, "epoch": 7.235764235764236, "grad_norm": 1.1015625, "learning_rate": 0.00016909161526280016, "loss": 5.7822, "mean_token_accuracy": 0.17110382169485092, "num_tokens": 11694590.0, "step": 3625 }, { "entropy": 6.6768800735473635, "epoch": 7.245754245754246, "grad_norm": 1.078125, "learning_rate": 0.00016831286523818053, "loss": 5.8238, "mean_token_accuracy": 0.16498062908649444, "num_tokens": 11710346.0, "step": 3630 }, { "entropy": 6.645106267929077, "epoch": 7.255744255744256, "grad_norm": 0.984375, "learning_rate": 0.00016753576046115706, "loss": 5.7733, "mean_token_accuracy": 0.16446049362421036, "num_tokens": 11726274.0, "step": 3635 }, { "entropy": 6.4506245136260985, "epoch": 7.265734265734266, "grad_norm": 1.03125, "learning_rate": 0.00016676031291564696, "loss": 5.626, "mean_token_accuracy": 0.19875700473785402, "num_tokens": 11743601.0, "step": 3640 }, { "entropy": 6.555874538421631, "epoch": 7.275724275724276, "grad_norm": 1.0390625, "learning_rate": 0.00016598653456001048, "loss": 5.6669, "mean_token_accuracy": 0.1775301903486252, "num_tokens": 11760623.0, "step": 3645 }, { "entropy": 6.6439752101898195, "epoch": 7.285714285714286, "grad_norm": 1.0546875, "learning_rate": 0.00016521443732686722, "loss": 5.7602, "mean_token_accuracy": 0.17340189814567566, "num_tokens": 11777335.0, "step": 3650 }, { "entropy": 6.518510723114014, "epoch": 7.2957042957042955, "grad_norm": 1.15625, "learning_rate": 0.0001644440331229115, "loss": 5.6888, "mean_token_accuracy": 0.1813320994377136, "num_tokens": 11792737.0, "step": 3655 }, { "entropy": 6.667054319381714, "epoch": 7.305694305694305, "grad_norm": 1.1015625, "learning_rate": 0.00016367533382872932, "loss": 5.824, "mean_token_accuracy": 0.16132206618785858, "num_tokens": 11808369.0, "step": 3660 }, { "entropy": 6.688099050521851, "epoch": 7.315684315684316, "grad_norm": 1.046875, "learning_rate": 0.0001629083512986146, "loss": 5.7941, "mean_token_accuracy": 0.1667774111032486, "num_tokens": 11824556.0, "step": 3665 }, { "entropy": 6.660845756530762, "epoch": 7.325674325674326, "grad_norm": 1.03125, "learning_rate": 0.0001621430973603868, "loss": 5.8061, "mean_token_accuracy": 0.16344435065984725, "num_tokens": 11840897.0, "step": 3670 }, { "entropy": 6.64192214012146, "epoch": 7.335664335664336, "grad_norm": 1.015625, "learning_rate": 0.0001613795838152084, "loss": 5.7924, "mean_token_accuracy": 0.1698761209845543, "num_tokens": 11857226.0, "step": 3675 }, { "entropy": 6.660291385650635, "epoch": 7.345654345654346, "grad_norm": 1.0078125, "learning_rate": 0.0001606178224374027, "loss": 5.8701, "mean_token_accuracy": 0.1639696717262268, "num_tokens": 11873195.0, "step": 3680 }, { "entropy": 6.697933292388916, "epoch": 7.355644355644356, "grad_norm": 1.078125, "learning_rate": 0.00015985782497427236, "loss": 5.9375, "mean_token_accuracy": 0.15698734521865845, "num_tokens": 11889170.0, "step": 3685 }, { "entropy": 6.526859474182129, "epoch": 7.3656343656343655, "grad_norm": 0.93359375, "learning_rate": 0.0001590996031459187, "loss": 5.6298, "mean_token_accuracy": 0.18256762325763704, "num_tokens": 11906389.0, "step": 3690 }, { "entropy": 6.609104919433594, "epoch": 7.375624375624375, "grad_norm": 1.0625, "learning_rate": 0.00015834316864506013, "loss": 5.792, "mean_token_accuracy": 0.17022771388292313, "num_tokens": 11923113.0, "step": 3695 }, { "entropy": 6.59908356666565, "epoch": 7.385614385614385, "grad_norm": 0.98046875, "learning_rate": 0.0001575885331368523, "loss": 5.8181, "mean_token_accuracy": 0.16873762011528015, "num_tokens": 11940350.0, "step": 3700 }, { "entropy": 6.6856931209564205, "epoch": 7.395604395604396, "grad_norm": 1.0546875, "learning_rate": 0.00015683570825870846, "loss": 5.8237, "mean_token_accuracy": 0.16349050849676133, "num_tokens": 11956365.0, "step": 3705 }, { "entropy": 6.627903270721435, "epoch": 7.405594405594406, "grad_norm": 0.95703125, "learning_rate": 0.00015608470562011948, "loss": 5.7364, "mean_token_accuracy": 0.17243467420339584, "num_tokens": 11972909.0, "step": 3710 }, { "entropy": 6.559830951690674, "epoch": 7.415584415584416, "grad_norm": 1.046875, "learning_rate": 0.00015533553680247505, "loss": 5.635, "mean_token_accuracy": 0.17551354616880416, "num_tokens": 11990830.0, "step": 3715 }, { "entropy": 6.6408384323120115, "epoch": 7.425574425574426, "grad_norm": 1.0625, "learning_rate": 0.00015458821335888502, "loss": 5.7692, "mean_token_accuracy": 0.17369808703660966, "num_tokens": 12006737.0, "step": 3720 }, { "entropy": 6.5173032760620115, "epoch": 7.4355644355644355, "grad_norm": 1.09375, "learning_rate": 0.00015384274681400146, "loss": 5.7185, "mean_token_accuracy": 0.17914607673883437, "num_tokens": 12023877.0, "step": 3725 }, { "entropy": 6.583723497390747, "epoch": 7.445554445554445, "grad_norm": 1.1484375, "learning_rate": 0.00015309914866384072, "loss": 5.7294, "mean_token_accuracy": 0.1711476430296898, "num_tokens": 12039095.0, "step": 3730 }, { "entropy": 6.6257102489471436, "epoch": 7.455544455544455, "grad_norm": 1.1328125, "learning_rate": 0.00015235743037560608, "loss": 5.7844, "mean_token_accuracy": 0.17418665140867234, "num_tokens": 12055442.0, "step": 3735 }, { "entropy": 6.602275943756103, "epoch": 7.465534465534466, "grad_norm": 0.9921875, "learning_rate": 0.00015161760338751115, "loss": 5.7968, "mean_token_accuracy": 0.16995560228824616, "num_tokens": 12071654.0, "step": 3740 }, { "entropy": 6.591068696975708, "epoch": 7.475524475524476, "grad_norm": 1.15625, "learning_rate": 0.00015087967910860323, "loss": 5.7699, "mean_token_accuracy": 0.17443897426128388, "num_tokens": 12087203.0, "step": 3745 }, { "entropy": 6.570019960403442, "epoch": 7.485514485514486, "grad_norm": 0.9765625, "learning_rate": 0.00015014366891858756, "loss": 5.7374, "mean_token_accuracy": 0.17059648483991624, "num_tokens": 12104203.0, "step": 3750 }, { "entropy": 6.640076732635498, "epoch": 7.495504495504496, "grad_norm": 0.99609375, "learning_rate": 0.0001494095841676518, "loss": 5.8225, "mean_token_accuracy": 0.1645973727107048, "num_tokens": 12121533.0, "step": 3755 }, { "entropy": 6.626310396194458, "epoch": 7.5054945054945055, "grad_norm": 0.98828125, "learning_rate": 0.00014867743617629102, "loss": 5.8148, "mean_token_accuracy": 0.16853301376104354, "num_tokens": 12137577.0, "step": 3760 }, { "entropy": 6.638473463058472, "epoch": 7.515484515484515, "grad_norm": 1.0703125, "learning_rate": 0.0001479472362351327, "loss": 5.7622, "mean_token_accuracy": 0.171138758957386, "num_tokens": 12154603.0, "step": 3765 }, { "entropy": 6.56121244430542, "epoch": 7.525474525474525, "grad_norm": 1.140625, "learning_rate": 0.00014721899560476339, "loss": 5.6715, "mean_token_accuracy": 0.18207142502069473, "num_tokens": 12169644.0, "step": 3770 }, { "entropy": 6.609803485870361, "epoch": 7.535464535464535, "grad_norm": 1.078125, "learning_rate": 0.0001464927255155545, "loss": 5.8093, "mean_token_accuracy": 0.1713679924607277, "num_tokens": 12185752.0, "step": 3775 }, { "entropy": 6.683682870864868, "epoch": 7.545454545454545, "grad_norm": 1.0546875, "learning_rate": 0.00014576843716748917, "loss": 5.8392, "mean_token_accuracy": 0.16137852072715758, "num_tokens": 12202681.0, "step": 3780 }, { "entropy": 6.608212852478028, "epoch": 7.555444555444556, "grad_norm": 1.0625, "learning_rate": 0.00014504614172998985, "loss": 5.7923, "mean_token_accuracy": 0.1661493569612503, "num_tokens": 12218486.0, "step": 3785 }, { "entropy": 6.606582975387573, "epoch": 7.565434565434566, "grad_norm": 0.93359375, "learning_rate": 0.0001443258503417455, "loss": 5.7175, "mean_token_accuracy": 0.17071602493524551, "num_tokens": 12234345.0, "step": 3790 }, { "entropy": 6.491720485687256, "epoch": 7.5754245754245755, "grad_norm": 0.91796875, "learning_rate": 0.0001436075741105406, "loss": 5.6752, "mean_token_accuracy": 0.18627673089504243, "num_tokens": 12250475.0, "step": 3795 }, { "entropy": 6.573206949234009, "epoch": 7.585414585414585, "grad_norm": 1.140625, "learning_rate": 0.00014289132411308297, "loss": 5.6902, "mean_token_accuracy": 0.18233504593372346, "num_tokens": 12265832.0, "step": 3800 }, { "entropy": 6.690039396286011, "epoch": 7.595404595404595, "grad_norm": 1.125, "learning_rate": 0.0001421771113948338, "loss": 5.8597, "mean_token_accuracy": 0.1667628213763237, "num_tokens": 12280542.0, "step": 3805 }, { "entropy": 6.639490985870362, "epoch": 7.605394605394605, "grad_norm": 1.1328125, "learning_rate": 0.00014146494696983653, "loss": 5.7395, "mean_token_accuracy": 0.18100628554821013, "num_tokens": 12297431.0, "step": 3810 }, { "entropy": 6.658612442016602, "epoch": 7.615384615384615, "grad_norm": 1.0859375, "learning_rate": 0.00014075484182054772, "loss": 5.8318, "mean_token_accuracy": 0.1652776703238487, "num_tokens": 12313842.0, "step": 3815 }, { "entropy": 6.623839044570923, "epoch": 7.625374625374626, "grad_norm": 1.0703125, "learning_rate": 0.0001400468068976673, "loss": 5.845, "mean_token_accuracy": 0.16607776135206223, "num_tokens": 12330189.0, "step": 3820 }, { "entropy": 6.541777229309082, "epoch": 7.635364635364636, "grad_norm": 1.078125, "learning_rate": 0.00013934085311996953, "loss": 5.7004, "mean_token_accuracy": 0.17605072408914565, "num_tokens": 12347674.0, "step": 3825 }, { "entropy": 6.575506019592285, "epoch": 7.6453546453546455, "grad_norm": 1.0625, "learning_rate": 0.00013863699137413484, "loss": 5.6878, "mean_token_accuracy": 0.1856866255402565, "num_tokens": 12363735.0, "step": 3830 }, { "entropy": 6.493249416351318, "epoch": 7.655344655344655, "grad_norm": 1.171875, "learning_rate": 0.00013793523251458235, "loss": 5.7081, "mean_token_accuracy": 0.18060380816459656, "num_tokens": 12379500.0, "step": 3835 }, { "entropy": 6.523749780654907, "epoch": 7.665334665334665, "grad_norm": 0.890625, "learning_rate": 0.00013723558736330167, "loss": 5.6624, "mean_token_accuracy": 0.1814500242471695, "num_tokens": 12396185.0, "step": 3840 }, { "entropy": 6.692793941497802, "epoch": 7.675324675324675, "grad_norm": 1.078125, "learning_rate": 0.0001365380667096864, "loss": 5.8288, "mean_token_accuracy": 0.1681785389780998, "num_tokens": 12412098.0, "step": 3845 }, { "entropy": 6.6270708560943605, "epoch": 7.685314685314685, "grad_norm": 1.1328125, "learning_rate": 0.0001358426813103681, "loss": 5.7793, "mean_token_accuracy": 0.17169039249420165, "num_tokens": 12427402.0, "step": 3850 }, { "entropy": 6.6471555709838865, "epoch": 7.695304695304696, "grad_norm": 1.0625, "learning_rate": 0.0001351494418890498, "loss": 5.854, "mean_token_accuracy": 0.1665297418832779, "num_tokens": 12444069.0, "step": 3855 }, { "entropy": 6.615910863876342, "epoch": 7.705294705294706, "grad_norm": 1.171875, "learning_rate": 0.00013445835913634098, "loss": 5.7905, "mean_token_accuracy": 0.17744431793689727, "num_tokens": 12459775.0, "step": 3860 }, { "entropy": 6.659605598449707, "epoch": 7.7152847152847155, "grad_norm": 1.046875, "learning_rate": 0.00013376944370959242, "loss": 5.848, "mean_token_accuracy": 0.16532238572835922, "num_tokens": 12475063.0, "step": 3865 }, { "entropy": 6.567076969146728, "epoch": 7.725274725274725, "grad_norm": 1.0859375, "learning_rate": 0.0001330827062327324, "loss": 5.7879, "mean_token_accuracy": 0.17397616505622865, "num_tokens": 12492213.0, "step": 3870 }, { "entropy": 6.6325764656066895, "epoch": 7.735264735264735, "grad_norm": 1.1015625, "learning_rate": 0.00013239815729610232, "loss": 5.8131, "mean_token_accuracy": 0.16737518608570098, "num_tokens": 12508064.0, "step": 3875 }, { "entropy": 6.575936412811279, "epoch": 7.745254745254745, "grad_norm": 1.140625, "learning_rate": 0.00013171580745629358, "loss": 5.7211, "mean_token_accuracy": 0.1728257268667221, "num_tokens": 12524706.0, "step": 3880 }, { "entropy": 6.542951965332032, "epoch": 7.755244755244755, "grad_norm": 1.0390625, "learning_rate": 0.00013103566723598488, "loss": 5.7163, "mean_token_accuracy": 0.180866014957428, "num_tokens": 12541422.0, "step": 3885 }, { "entropy": 6.57264256477356, "epoch": 7.765234765234765, "grad_norm": 1.1796875, "learning_rate": 0.00013035774712377975, "loss": 5.7893, "mean_token_accuracy": 0.16629691869020463, "num_tokens": 12556731.0, "step": 3890 }, { "entropy": 6.616151523590088, "epoch": 7.775224775224775, "grad_norm": 1.1640625, "learning_rate": 0.00012968205757404484, "loss": 5.7673, "mean_token_accuracy": 0.1756897434592247, "num_tokens": 12571468.0, "step": 3895 }, { "entropy": 6.567837333679199, "epoch": 7.7852147852147855, "grad_norm": 1.2265625, "learning_rate": 0.00012900860900674904, "loss": 5.7534, "mean_token_accuracy": 0.17781516164541245, "num_tokens": 12586955.0, "step": 3900 }, { "entropy": 6.585996913909912, "epoch": 7.795204795204795, "grad_norm": 1.046875, "learning_rate": 0.00012833741180730233, "loss": 5.7492, "mean_token_accuracy": 0.17664602249860764, "num_tokens": 12601457.0, "step": 3905 }, { "entropy": 6.574141597747802, "epoch": 7.805194805194805, "grad_norm": 1.0078125, "learning_rate": 0.00012766847632639572, "loss": 5.747, "mean_token_accuracy": 0.1792392462491989, "num_tokens": 12620323.0, "step": 3910 }, { "entropy": 6.694469833374024, "epoch": 7.815184815184815, "grad_norm": 1.125, "learning_rate": 0.00012700181287984193, "loss": 5.8571, "mean_token_accuracy": 0.16210900247097015, "num_tokens": 12636255.0, "step": 3915 }, { "entropy": 6.683346748352051, "epoch": 7.825174825174825, "grad_norm": 1.0703125, "learning_rate": 0.00012633743174841604, "loss": 5.8525, "mean_token_accuracy": 0.165432670712471, "num_tokens": 12653080.0, "step": 3920 }, { "entropy": 6.638664627075196, "epoch": 7.835164835164835, "grad_norm": 1.1015625, "learning_rate": 0.00012567534317769682, "loss": 5.8383, "mean_token_accuracy": 0.17068625539541243, "num_tokens": 12669735.0, "step": 3925 }, { "entropy": 6.584664630889892, "epoch": 7.845154845154845, "grad_norm": 0.99609375, "learning_rate": 0.00012501555737790928, "loss": 5.7623, "mean_token_accuracy": 0.17653609067201614, "num_tokens": 12688007.0, "step": 3930 }, { "entropy": 6.553927803039551, "epoch": 7.8551448551448555, "grad_norm": 1.15625, "learning_rate": 0.0001243580845237665, "loss": 5.7411, "mean_token_accuracy": 0.18110772371292114, "num_tokens": 12704528.0, "step": 3935 }, { "entropy": 6.517689895629883, "epoch": 7.865134865134865, "grad_norm": 0.9296875, "learning_rate": 0.00012370293475431332, "loss": 5.6889, "mean_token_accuracy": 0.1780701071023941, "num_tokens": 12721412.0, "step": 3940 }, { "entropy": 6.612676429748535, "epoch": 7.875124875124875, "grad_norm": 1.1015625, "learning_rate": 0.00012305011817276949, "loss": 5.7935, "mean_token_accuracy": 0.16655818223953248, "num_tokens": 12737326.0, "step": 3945 }, { "entropy": 6.6610876560211185, "epoch": 7.885114885114885, "grad_norm": 1.125, "learning_rate": 0.0001223996448463745, "loss": 5.7708, "mean_token_accuracy": 0.1731476902961731, "num_tokens": 12753578.0, "step": 3950 }, { "entropy": 6.641850852966309, "epoch": 7.895104895104895, "grad_norm": 1.109375, "learning_rate": 0.00012175152480623149, "loss": 5.7657, "mean_token_accuracy": 0.17379571497440338, "num_tokens": 12769155.0, "step": 3955 }, { "entropy": 6.652761840820313, "epoch": 7.905094905094905, "grad_norm": 1.03125, "learning_rate": 0.00012110576804715333, "loss": 5.8958, "mean_token_accuracy": 0.1638408362865448, "num_tokens": 12785012.0, "step": 3960 }, { "entropy": 6.5546637058258055, "epoch": 7.915084915084915, "grad_norm": 1.0625, "learning_rate": 0.00012046238452750817, "loss": 5.6593, "mean_token_accuracy": 0.18319484144449233, "num_tokens": 12800924.0, "step": 3965 }, { "entropy": 6.702825546264648, "epoch": 7.9250749250749255, "grad_norm": 1.1640625, "learning_rate": 0.00011982138416906573, "loss": 5.8783, "mean_token_accuracy": 0.16147090941667558, "num_tokens": 12816179.0, "step": 3970 }, { "entropy": 6.60850682258606, "epoch": 7.935064935064935, "grad_norm": 1.046875, "learning_rate": 0.00011918277685684438, "loss": 5.8122, "mean_token_accuracy": 0.17024821043014526, "num_tokens": 12832388.0, "step": 3975 }, { "entropy": 6.5591573238372805, "epoch": 7.945054945054945, "grad_norm": 1.1484375, "learning_rate": 0.00011854657243895896, "loss": 5.769, "mean_token_accuracy": 0.17416453808546067, "num_tokens": 12847852.0, "step": 3980 }, { "entropy": 6.603835201263427, "epoch": 7.955044955044955, "grad_norm": 1.0859375, "learning_rate": 0.00011791278072646868, "loss": 5.7467, "mean_token_accuracy": 0.16768178939819336, "num_tokens": 12863278.0, "step": 3985 }, { "entropy": 6.694379234313965, "epoch": 7.965034965034965, "grad_norm": 1.140625, "learning_rate": 0.00011728141149322567, "loss": 5.815, "mean_token_accuracy": 0.16590357273817063, "num_tokens": 12878267.0, "step": 3990 }, { "entropy": 6.67466402053833, "epoch": 7.975024975024975, "grad_norm": 1.1015625, "learning_rate": 0.00011665247447572459, "loss": 5.8348, "mean_token_accuracy": 0.16098665148019792, "num_tokens": 12896793.0, "step": 3995 }, { "entropy": 6.642387056350708, "epoch": 7.985014985014985, "grad_norm": 1.0234375, "learning_rate": 0.00011602597937295238, "loss": 5.8664, "mean_token_accuracy": 0.15969752222299577, "num_tokens": 12913106.0, "step": 4000 }, { "epoch": 7.985014985014985, "eval_entropy": 6.509865835550669, "eval_loss": 7.048545837402344, "eval_mean_token_accuracy": 0.11117837553894197, "eval_num_tokens": 12913106.0, "eval_runtime": 1.1728, "eval_samples_per_second": 1256.789, "eval_steps_per_second": 157.738, "step": 4000 }, { "entropy": 6.708018589019775, "epoch": 7.995004995004995, "grad_norm": 1.0390625, "learning_rate": 0.00011540193584623844, "loss": 5.8924, "mean_token_accuracy": 0.15913865566253663, "num_tokens": 12929766.0, "step": 4005 }, { "entropy": 6.690499782562256, "epoch": 8.003996003996004, "grad_norm": 1.1171875, "learning_rate": 0.00011478035351910584, "loss": 5.8259, "mean_token_accuracy": 0.17000278333822885, "num_tokens": 12942395.0, "step": 4010 }, { "entropy": 6.546853113174438, "epoch": 8.013986013986013, "grad_norm": 1.1171875, "learning_rate": 0.00011416124197712319, "loss": 5.623, "mean_token_accuracy": 0.18236773759126662, "num_tokens": 12957774.0, "step": 4015 }, { "entropy": 6.658700752258301, "epoch": 8.023976023976024, "grad_norm": 0.984375, "learning_rate": 0.0001135446107677562, "loss": 5.7369, "mean_token_accuracy": 0.16562026292085646, "num_tokens": 12974809.0, "step": 4020 }, { "entropy": 6.59889850616455, "epoch": 8.033966033966035, "grad_norm": 0.98828125, "learning_rate": 0.00011293046940022095, "loss": 5.7123, "mean_token_accuracy": 0.17436665147542954, "num_tokens": 12991862.0, "step": 4025 }, { "entropy": 6.632143354415893, "epoch": 8.043956043956044, "grad_norm": 1.1640625, "learning_rate": 0.00011231882734533716, "loss": 5.7115, "mean_token_accuracy": 0.1777083918452263, "num_tokens": 13007513.0, "step": 4030 }, { "entropy": 6.668722438812256, "epoch": 8.053946053946055, "grad_norm": 1.1171875, "learning_rate": 0.0001117096940353819, "loss": 5.7201, "mean_token_accuracy": 0.17840286195278168, "num_tokens": 13022860.0, "step": 4035 }, { "entropy": 6.576748847961426, "epoch": 8.063936063936064, "grad_norm": 1.1328125, "learning_rate": 0.00011110307886394415, "loss": 5.6638, "mean_token_accuracy": 0.18314001858234405, "num_tokens": 13038599.0, "step": 4040 }, { "entropy": 6.470821046829224, "epoch": 8.073926073926074, "grad_norm": 1.0625, "learning_rate": 0.00011049899118578057, "loss": 5.5455, "mean_token_accuracy": 0.1973014920949936, "num_tokens": 13055336.0, "step": 4045 }, { "entropy": 6.44102463722229, "epoch": 8.083916083916083, "grad_norm": 0.9765625, "learning_rate": 0.00010989744031667037, "loss": 5.4745, "mean_token_accuracy": 0.19715564996004104, "num_tokens": 13072207.0, "step": 4050 }, { "entropy": 6.649979448318481, "epoch": 8.093906093906094, "grad_norm": 1.0390625, "learning_rate": 0.00010929843553327196, "loss": 5.7645, "mean_token_accuracy": 0.16423703730106354, "num_tokens": 13089288.0, "step": 4055 }, { "entropy": 6.555937051773071, "epoch": 8.103896103896103, "grad_norm": 1.125, "learning_rate": 0.00010870198607298022, "loss": 5.588, "mean_token_accuracy": 0.18531972616910936, "num_tokens": 13105701.0, "step": 4060 }, { "entropy": 6.65061388015747, "epoch": 8.113886113886114, "grad_norm": 1.1640625, "learning_rate": 0.00010810810113378372, "loss": 5.721, "mean_token_accuracy": 0.174058136343956, "num_tokens": 13121408.0, "step": 4065 }, { "entropy": 6.628388166427612, "epoch": 8.123876123876125, "grad_norm": 1.0546875, "learning_rate": 0.00010751678987412275, "loss": 5.7365, "mean_token_accuracy": 0.17408246248960496, "num_tokens": 13138933.0, "step": 4070 }, { "entropy": 6.639469766616822, "epoch": 8.133866133866134, "grad_norm": 1.046875, "learning_rate": 0.00010692806141274853, "loss": 5.7174, "mean_token_accuracy": 0.17059729546308516, "num_tokens": 13154595.0, "step": 4075 }, { "entropy": 6.663714361190796, "epoch": 8.143856143856144, "grad_norm": 1.0234375, "learning_rate": 0.00010634192482858217, "loss": 5.7528, "mean_token_accuracy": 0.16723113209009172, "num_tokens": 13170989.0, "step": 4080 }, { "entropy": 6.497771453857422, "epoch": 8.153846153846153, "grad_norm": 1.015625, "learning_rate": 0.00010575838916057498, "loss": 5.6325, "mean_token_accuracy": 0.17844102829694747, "num_tokens": 13186826.0, "step": 4085 }, { "entropy": 6.698178815841675, "epoch": 8.163836163836164, "grad_norm": 1.0078125, "learning_rate": 0.00010517746340756868, "loss": 5.8033, "mean_token_accuracy": 0.16790819466114043, "num_tokens": 13204397.0, "step": 4090 }, { "entropy": 6.57105393409729, "epoch": 8.173826173826173, "grad_norm": 1.15625, "learning_rate": 0.00010459915652815714, "loss": 5.6582, "mean_token_accuracy": 0.18001567721366882, "num_tokens": 13220053.0, "step": 4095 }, { "entropy": 6.64002947807312, "epoch": 8.183816183816184, "grad_norm": 1.0546875, "learning_rate": 0.00010402347744054773, "loss": 5.7661, "mean_token_accuracy": 0.17030880898237227, "num_tokens": 13235215.0, "step": 4100 }, { "entropy": 6.659495115280151, "epoch": 8.193806193806195, "grad_norm": 1.03125, "learning_rate": 0.0001034504350224242, "loss": 5.7478, "mean_token_accuracy": 0.1738527685403824, "num_tokens": 13250691.0, "step": 4105 }, { "entropy": 6.637171983718872, "epoch": 8.203796203796204, "grad_norm": 1.0078125, "learning_rate": 0.00010288003811080962, "loss": 5.6984, "mean_token_accuracy": 0.17765315622091293, "num_tokens": 13267472.0, "step": 4110 }, { "entropy": 6.624198579788208, "epoch": 8.213786213786214, "grad_norm": 1.0625, "learning_rate": 0.00010231229550192983, "loss": 5.6817, "mean_token_accuracy": 0.1793392464518547, "num_tokens": 13282955.0, "step": 4115 }, { "entropy": 6.603564167022705, "epoch": 8.223776223776223, "grad_norm": 1.1171875, "learning_rate": 0.00010174721595107821, "loss": 5.6989, "mean_token_accuracy": 0.17249709963798524, "num_tokens": 13298694.0, "step": 4120 }, { "entropy": 6.58226900100708, "epoch": 8.233766233766234, "grad_norm": 0.9609375, "learning_rate": 0.0001011848081724805, "loss": 5.7171, "mean_token_accuracy": 0.17811179012060166, "num_tokens": 13315612.0, "step": 4125 }, { "entropy": 6.567302083969116, "epoch": 8.243756243756243, "grad_norm": 1.0234375, "learning_rate": 0.00010062508083916045, "loss": 5.6278, "mean_token_accuracy": 0.1853811338543892, "num_tokens": 13331355.0, "step": 4130 }, { "entropy": 6.596056890487671, "epoch": 8.253746253746254, "grad_norm": 1.234375, "learning_rate": 0.0001000680425828058, "loss": 5.6364, "mean_token_accuracy": 0.18015409111976624, "num_tokens": 13347518.0, "step": 4135 }, { "entropy": 6.638355731964111, "epoch": 8.263736263736265, "grad_norm": 1.1484375, "learning_rate": 9.951370199363571e-05, "loss": 5.7551, "mean_token_accuracy": 0.17420727014541626, "num_tokens": 13363202.0, "step": 4140 }, { "entropy": 6.607405948638916, "epoch": 8.273726273726274, "grad_norm": 1.171875, "learning_rate": 9.896206762026768e-05, "loss": 5.6954, "mean_token_accuracy": 0.1751954436302185, "num_tokens": 13377642.0, "step": 4145 }, { "entropy": 6.547289657592773, "epoch": 8.283716283716284, "grad_norm": 1.0078125, "learning_rate": 9.841314796958629e-05, "loss": 5.6681, "mean_token_accuracy": 0.18557562977075576, "num_tokens": 13393359.0, "step": 4150 }, { "entropy": 6.687372255325317, "epoch": 8.293706293706293, "grad_norm": 1.1328125, "learning_rate": 9.786695150661143e-05, "loss": 5.7984, "mean_token_accuracy": 0.16761249154806138, "num_tokens": 13408735.0, "step": 4155 }, { "entropy": 6.576523780822754, "epoch": 8.303696303696304, "grad_norm": 1.1171875, "learning_rate": 9.732348665436843e-05, "loss": 5.6105, "mean_token_accuracy": 0.17739479392766952, "num_tokens": 13424297.0, "step": 4160 }, { "entropy": 6.548263120651245, "epoch": 8.313686313686313, "grad_norm": 1.0859375, "learning_rate": 9.678276179375743e-05, "loss": 5.6429, "mean_token_accuracy": 0.17942492812871932, "num_tokens": 13440476.0, "step": 4165 }, { "entropy": 6.541148376464844, "epoch": 8.323676323676324, "grad_norm": 0.92578125, "learning_rate": 9.624478526342478e-05, "loss": 5.5606, "mean_token_accuracy": 0.18558268696069719, "num_tokens": 13458353.0, "step": 4170 }, { "entropy": 6.618422317504883, "epoch": 8.333666333666333, "grad_norm": 1.1328125, "learning_rate": 9.570956535963412e-05, "loss": 5.6839, "mean_token_accuracy": 0.17825574427843094, "num_tokens": 13474526.0, "step": 4175 }, { "entropy": 6.641184282302857, "epoch": 8.343656343656344, "grad_norm": 1.0859375, "learning_rate": 9.517711033613846e-05, "loss": 5.7364, "mean_token_accuracy": 0.17284598350524902, "num_tokens": 13490227.0, "step": 4180 }, { "entropy": 6.58631157875061, "epoch": 8.353646353646354, "grad_norm": 1.1015625, "learning_rate": 9.464742840405274e-05, "loss": 5.6017, "mean_token_accuracy": 0.1830156460404396, "num_tokens": 13505754.0, "step": 4185 }, { "entropy": 6.455103540420533, "epoch": 8.363636363636363, "grad_norm": 0.92578125, "learning_rate": 9.412052773172788e-05, "loss": 5.6165, "mean_token_accuracy": 0.18646986186504363, "num_tokens": 13523085.0, "step": 4190 }, { "entropy": 6.678836059570313, "epoch": 8.373626373626374, "grad_norm": 0.95703125, "learning_rate": 9.359641644462396e-05, "loss": 5.7984, "mean_token_accuracy": 0.16259211599826812, "num_tokens": 13540287.0, "step": 4195 }, { "entropy": 6.643093872070312, "epoch": 8.383616383616383, "grad_norm": 1.03125, "learning_rate": 9.30751026251853e-05, "loss": 5.6791, "mean_token_accuracy": 0.18442320972681045, "num_tokens": 13558123.0, "step": 4200 }, { "entropy": 6.623868989944458, "epoch": 8.393606393606394, "grad_norm": 0.98046875, "learning_rate": 9.255659431271596e-05, "loss": 5.7682, "mean_token_accuracy": 0.17347396463155745, "num_tokens": 13574506.0, "step": 4205 }, { "entropy": 6.595346117019654, "epoch": 8.403596403596403, "grad_norm": 1.1796875, "learning_rate": 9.204089950325556e-05, "loss": 5.706, "mean_token_accuracy": 0.17174012064933777, "num_tokens": 13590029.0, "step": 4210 }, { "entropy": 6.498262786865235, "epoch": 8.413586413586414, "grad_norm": 0.9765625, "learning_rate": 9.152802614945602e-05, "loss": 5.6391, "mean_token_accuracy": 0.18892084807157516, "num_tokens": 13606874.0, "step": 4215 }, { "entropy": 6.496121406555176, "epoch": 8.423576423576424, "grad_norm": 1.0546875, "learning_rate": 9.101798216045878e-05, "loss": 5.5434, "mean_token_accuracy": 0.19402407258749008, "num_tokens": 13622917.0, "step": 4220 }, { "entropy": 6.665012454986572, "epoch": 8.433566433566433, "grad_norm": 1.046875, "learning_rate": 9.051077540177321e-05, "loss": 5.8039, "mean_token_accuracy": 0.16859310865402222, "num_tokens": 13640171.0, "step": 4225 }, { "entropy": 6.5686780452728275, "epoch": 8.443556443556444, "grad_norm": 1.1171875, "learning_rate": 9.000641369515503e-05, "loss": 5.6966, "mean_token_accuracy": 0.17796669900417328, "num_tokens": 13655878.0, "step": 4230 }, { "entropy": 6.658001899719238, "epoch": 8.453546453546453, "grad_norm": 1.125, "learning_rate": 8.950490481848556e-05, "loss": 5.7701, "mean_token_accuracy": 0.16969959139823915, "num_tokens": 13671605.0, "step": 4235 }, { "entropy": 6.54094090461731, "epoch": 8.463536463536464, "grad_norm": 1.03125, "learning_rate": 8.900625650565214e-05, "loss": 5.5966, "mean_token_accuracy": 0.18110958337783814, "num_tokens": 13688146.0, "step": 4240 }, { "entropy": 6.597197866439819, "epoch": 8.473526473526473, "grad_norm": 1.0078125, "learning_rate": 8.851047644642858e-05, "loss": 5.6176, "mean_token_accuracy": 0.1853731855750084, "num_tokens": 13703828.0, "step": 4245 }, { "entropy": 6.499710273742676, "epoch": 8.483516483516484, "grad_norm": 1.0703125, "learning_rate": 8.801757228635671e-05, "loss": 5.5862, "mean_token_accuracy": 0.18703063279390336, "num_tokens": 13720103.0, "step": 4250 }, { "entropy": 6.524130630493164, "epoch": 8.493506493506494, "grad_norm": 1.015625, "learning_rate": 8.752755162662848e-05, "loss": 5.6257, "mean_token_accuracy": 0.18301298320293427, "num_tokens": 13737114.0, "step": 4255 }, { "entropy": 6.535678672790527, "epoch": 8.503496503496503, "grad_norm": 1.1484375, "learning_rate": 8.704042202396862e-05, "loss": 5.616, "mean_token_accuracy": 0.1779239535331726, "num_tokens": 13754110.0, "step": 4260 }, { "entropy": 6.587699604034424, "epoch": 8.513486513486514, "grad_norm": 1.0703125, "learning_rate": 8.655619099051814e-05, "loss": 5.7088, "mean_token_accuracy": 0.17620895951986312, "num_tokens": 13769571.0, "step": 4265 }, { "entropy": 6.55425500869751, "epoch": 8.523476523476523, "grad_norm": 1.0703125, "learning_rate": 8.607486599371866e-05, "loss": 5.7233, "mean_token_accuracy": 0.1716888353228569, "num_tokens": 13786161.0, "step": 4270 }, { "entropy": 6.614956092834473, "epoch": 8.533466533466534, "grad_norm": 1.109375, "learning_rate": 8.559645445619709e-05, "loss": 5.6745, "mean_token_accuracy": 0.17230432331562043, "num_tokens": 13802207.0, "step": 4275 }, { "entropy": 6.621044254302978, "epoch": 8.543456543456543, "grad_norm": 1.0625, "learning_rate": 8.512096375565107e-05, "loss": 5.6325, "mean_token_accuracy": 0.18163369297981263, "num_tokens": 13818721.0, "step": 4280 }, { "entropy": 6.705506753921509, "epoch": 8.553446553446554, "grad_norm": 1.0546875, "learning_rate": 8.464840122473553e-05, "loss": 5.8224, "mean_token_accuracy": 0.1657765120267868, "num_tokens": 13834595.0, "step": 4285 }, { "entropy": 6.483643627166748, "epoch": 8.563436563436564, "grad_norm": 1.109375, "learning_rate": 8.417877415094919e-05, "loss": 5.6488, "mean_token_accuracy": 0.18199325650930404, "num_tokens": 13851142.0, "step": 4290 }, { "entropy": 6.5265978336334225, "epoch": 8.573426573426573, "grad_norm": 1.09375, "learning_rate": 8.371208977652253e-05, "loss": 5.6404, "mean_token_accuracy": 0.18214704394340514, "num_tokens": 13867050.0, "step": 4295 }, { "entropy": 6.658955001831055, "epoch": 8.583416583416584, "grad_norm": 1.1484375, "learning_rate": 8.324835529830587e-05, "loss": 5.765, "mean_token_accuracy": 0.17089197039604187, "num_tokens": 13883375.0, "step": 4300 }, { "entropy": 6.576166391372681, "epoch": 8.593406593406593, "grad_norm": 1.0625, "learning_rate": 8.278757786765861e-05, "loss": 5.7152, "mean_token_accuracy": 0.17454383373260499, "num_tokens": 13899430.0, "step": 4305 }, { "entropy": 6.534755992889404, "epoch": 8.603396603396604, "grad_norm": 0.94921875, "learning_rate": 8.232976459033866e-05, "loss": 5.6611, "mean_token_accuracy": 0.1825459286570549, "num_tokens": 13915910.0, "step": 4310 }, { "entropy": 6.594773769378662, "epoch": 8.613386613386613, "grad_norm": 1.140625, "learning_rate": 8.187492252639314e-05, "loss": 5.6336, "mean_token_accuracy": 0.18260664790868758, "num_tokens": 13931069.0, "step": 4315 }, { "entropy": 6.613780498504639, "epoch": 8.623376623376624, "grad_norm": 1.1328125, "learning_rate": 8.142305869004937e-05, "loss": 5.7073, "mean_token_accuracy": 0.174365770816803, "num_tokens": 13948003.0, "step": 4320 }, { "entropy": 6.669010639190674, "epoch": 8.633366633366633, "grad_norm": 1.125, "learning_rate": 8.097418004960665e-05, "loss": 5.7612, "mean_token_accuracy": 0.17211959958076478, "num_tokens": 13963686.0, "step": 4325 }, { "entropy": 6.619667053222656, "epoch": 8.643356643356643, "grad_norm": 1.109375, "learning_rate": 8.052829352732883e-05, "loss": 5.7017, "mean_token_accuracy": 0.17622666656970978, "num_tokens": 13979270.0, "step": 4330 }, { "entropy": 6.4729931354522705, "epoch": 8.653346653346654, "grad_norm": 1.15625, "learning_rate": 8.008540599933783e-05, "loss": 5.4983, "mean_token_accuracy": 0.19504622668027877, "num_tokens": 13993112.0, "step": 4335 }, { "entropy": 6.469265794754028, "epoch": 8.663336663336663, "grad_norm": 0.94921875, "learning_rate": 7.964552429550713e-05, "loss": 5.6483, "mean_token_accuracy": 0.19008894711732865, "num_tokens": 14009321.0, "step": 4340 }, { "entropy": 6.624959468841553, "epoch": 8.673326673326674, "grad_norm": 1.0703125, "learning_rate": 7.920865519935673e-05, "loss": 5.7472, "mean_token_accuracy": 0.1696748211979866, "num_tokens": 14025543.0, "step": 4345 }, { "entropy": 6.649390506744385, "epoch": 8.683316683316683, "grad_norm": 1.1953125, "learning_rate": 7.877480544794855e-05, "loss": 5.745, "mean_token_accuracy": 0.1761339247226715, "num_tokens": 14039848.0, "step": 4350 }, { "entropy": 6.480779409408569, "epoch": 8.693306693306694, "grad_norm": 1.0625, "learning_rate": 7.834398173178253e-05, "loss": 5.6407, "mean_token_accuracy": 0.1847129061818123, "num_tokens": 14056524.0, "step": 4355 }, { "entropy": 6.541968441009521, "epoch": 8.703296703296703, "grad_norm": 0.92578125, "learning_rate": 7.791619069469322e-05, "loss": 5.5956, "mean_token_accuracy": 0.18740863651037215, "num_tokens": 14073247.0, "step": 4360 }, { "entropy": 6.6248459815979, "epoch": 8.713286713286713, "grad_norm": 1.0859375, "learning_rate": 7.749143893374765e-05, "loss": 5.72, "mean_token_accuracy": 0.1726437985897064, "num_tokens": 14089763.0, "step": 4365 }, { "entropy": 6.63503794670105, "epoch": 8.723276723276724, "grad_norm": 1.140625, "learning_rate": 7.706973299914339e-05, "loss": 5.7166, "mean_token_accuracy": 0.17455221712589264, "num_tokens": 14104500.0, "step": 4370 }, { "entropy": 6.661465072631836, "epoch": 8.733266733266733, "grad_norm": 1.0859375, "learning_rate": 7.665107939410772e-05, "loss": 5.7566, "mean_token_accuracy": 0.17270952314138413, "num_tokens": 14121550.0, "step": 4375 }, { "entropy": 6.548833560943604, "epoch": 8.743256743256744, "grad_norm": 1.125, "learning_rate": 7.623548457479703e-05, "loss": 5.6636, "mean_token_accuracy": 0.17979439049959184, "num_tokens": 14137644.0, "step": 4380 }, { "entropy": 6.580905103683472, "epoch": 8.753246753246753, "grad_norm": 1.0703125, "learning_rate": 7.58229549501976e-05, "loss": 5.626, "mean_token_accuracy": 0.18286270052194595, "num_tokens": 14154488.0, "step": 4385 }, { "entropy": 6.580533361434936, "epoch": 8.763236763236764, "grad_norm": 1.015625, "learning_rate": 7.541349688202658e-05, "loss": 5.627, "mean_token_accuracy": 0.18657831847667694, "num_tokens": 14170986.0, "step": 4390 }, { "entropy": 6.5391899108886715, "epoch": 8.773226773226773, "grad_norm": 1.109375, "learning_rate": 7.500711668463377e-05, "loss": 5.6776, "mean_token_accuracy": 0.183927683532238, "num_tokens": 14187888.0, "step": 4395 }, { "entropy": 6.559875869750977, "epoch": 8.783216783216783, "grad_norm": 1.1015625, "learning_rate": 7.460382062490472e-05, "loss": 5.6305, "mean_token_accuracy": 0.18580815941095352, "num_tokens": 14203413.0, "step": 4400 }, { "entropy": 6.514205694198608, "epoch": 8.793206793206792, "grad_norm": 0.98828125, "learning_rate": 7.42036149221635e-05, "loss": 5.5971, "mean_token_accuracy": 0.18791152238845826, "num_tokens": 14220550.0, "step": 4405 }, { "entropy": 6.61256971359253, "epoch": 8.803196803196803, "grad_norm": 1.125, "learning_rate": 7.380650574807709e-05, "loss": 5.7474, "mean_token_accuracy": 0.17605276256799698, "num_tokens": 14236555.0, "step": 4410 }, { "entropy": 6.488341522216797, "epoch": 8.813186813186814, "grad_norm": 1.203125, "learning_rate": 7.341249922656016e-05, "loss": 5.6106, "mean_token_accuracy": 0.18714418560266494, "num_tokens": 14254462.0, "step": 4415 }, { "entropy": 6.548106575012207, "epoch": 8.823176823176823, "grad_norm": 1.125, "learning_rate": 7.302160143368084e-05, "loss": 5.6091, "mean_token_accuracy": 0.18026586920022963, "num_tokens": 14270609.0, "step": 4420 }, { "entropy": 6.642305898666382, "epoch": 8.833166833166834, "grad_norm": 1.1328125, "learning_rate": 7.26338183975665e-05, "loss": 5.693, "mean_token_accuracy": 0.17442094534635544, "num_tokens": 14286077.0, "step": 4425 }, { "entropy": 6.612587404251099, "epoch": 8.843156843156843, "grad_norm": 1.046875, "learning_rate": 7.22491560983114e-05, "loss": 5.7443, "mean_token_accuracy": 0.17187173515558243, "num_tokens": 14302448.0, "step": 4430 }, { "entropy": 6.582760763168335, "epoch": 8.853146853146853, "grad_norm": 1.1484375, "learning_rate": 7.186762046788392e-05, "loss": 5.6617, "mean_token_accuracy": 0.1807755261659622, "num_tokens": 14318208.0, "step": 4435 }, { "entropy": 6.611913824081421, "epoch": 8.863136863136862, "grad_norm": 0.9609375, "learning_rate": 7.148921739003554e-05, "loss": 5.7311, "mean_token_accuracy": 0.169320547580719, "num_tokens": 14334594.0, "step": 4440 }, { "entropy": 6.590788841247559, "epoch": 8.873126873126873, "grad_norm": 1.1328125, "learning_rate": 7.11139527002098e-05, "loss": 5.6911, "mean_token_accuracy": 0.17896728515625, "num_tokens": 14350649.0, "step": 4445 }, { "entropy": 6.605124998092651, "epoch": 8.883116883116884, "grad_norm": 1.171875, "learning_rate": 7.074183218545247e-05, "loss": 5.7244, "mean_token_accuracy": 0.17172927409410477, "num_tokens": 14365302.0, "step": 4450 }, { "entropy": 6.580027294158936, "epoch": 8.893106893106893, "grad_norm": 1.0625, "learning_rate": 7.037286158432215e-05, "loss": 5.6471, "mean_token_accuracy": 0.1845197334885597, "num_tokens": 14381498.0, "step": 4455 }, { "entropy": 6.622518825531006, "epoch": 8.903096903096904, "grad_norm": 1.0859375, "learning_rate": 7.000704658680201e-05, "loss": 5.7356, "mean_token_accuracy": 0.1727258250117302, "num_tokens": 14397628.0, "step": 4460 }, { "entropy": 6.5275678634643555, "epoch": 8.913086913086913, "grad_norm": 0.94140625, "learning_rate": 6.964439283421188e-05, "loss": 5.6063, "mean_token_accuracy": 0.17915378659963607, "num_tokens": 14414203.0, "step": 4465 }, { "entropy": 6.596682834625244, "epoch": 8.923076923076923, "grad_norm": 1.234375, "learning_rate": 6.928490591912121e-05, "loss": 5.6491, "mean_token_accuracy": 0.17994030714035034, "num_tokens": 14429568.0, "step": 4470 }, { "entropy": 6.619744682312012, "epoch": 8.933066933066932, "grad_norm": 1.0625, "learning_rate": 6.892859138526286e-05, "loss": 5.6357, "mean_token_accuracy": 0.17897205501794816, "num_tokens": 14444646.0, "step": 4475 }, { "entropy": 6.63206934928894, "epoch": 8.943056943056943, "grad_norm": 1.078125, "learning_rate": 6.857545472744783e-05, "loss": 5.7778, "mean_token_accuracy": 0.17256810367107392, "num_tokens": 14460872.0, "step": 4480 }, { "entropy": 6.6366493701934814, "epoch": 8.953046953046954, "grad_norm": 1.0703125, "learning_rate": 6.822550139148023e-05, "loss": 5.8196, "mean_token_accuracy": 0.17008961588144303, "num_tokens": 14478099.0, "step": 4485 }, { "entropy": 6.674064111709595, "epoch": 8.963036963036963, "grad_norm": 0.98828125, "learning_rate": 6.787873677407333e-05, "loss": 5.8311, "mean_token_accuracy": 0.1671227604150772, "num_tokens": 14494017.0, "step": 4490 }, { "entropy": 6.55450029373169, "epoch": 8.973026973026974, "grad_norm": 1.0, "learning_rate": 6.753516622276655e-05, "loss": 5.7396, "mean_token_accuracy": 0.18682378232479097, "num_tokens": 14511115.0, "step": 4495 }, { "entropy": 6.639289903640747, "epoch": 8.983016983016983, "grad_norm": 1.0625, "learning_rate": 6.719479503584287e-05, "loss": 5.7752, "mean_token_accuracy": 0.17506357729434968, "num_tokens": 14526957.0, "step": 4500 }, { "epoch": 8.983016983016983, "eval_entropy": 6.501000236820531, "eval_loss": 7.067969799041748, "eval_mean_token_accuracy": 0.1109247750728517, "eval_num_tokens": 14526957.0, "eval_runtime": 1.175, "eval_samples_per_second": 1254.474, "eval_steps_per_second": 157.448, "step": 4500 }, { "entropy": 6.585261631011963, "epoch": 8.993006993006993, "grad_norm": 1.0703125, "learning_rate": 6.685762846224697e-05, "loss": 5.6718, "mean_token_accuracy": 0.18094309717416762, "num_tokens": 14545169.0, "step": 4505 }, { "entropy": 6.625105539957683, "epoch": 9.001998001998002, "grad_norm": 0.9765625, "learning_rate": 6.65236717015045e-05, "loss": 5.7152, "mean_token_accuracy": 0.17626477281252542, "num_tokens": 14557658.0, "step": 4510 }, { "entropy": 6.592655420303345, "epoch": 9.011988011988011, "grad_norm": 1.09375, "learning_rate": 6.619292990364191e-05, "loss": 5.6279, "mean_token_accuracy": 0.18174556791782379, "num_tokens": 14573422.0, "step": 4515 }, { "entropy": 6.482929325103759, "epoch": 9.021978021978022, "grad_norm": 1.109375, "learning_rate": 6.586540816910678e-05, "loss": 5.5687, "mean_token_accuracy": 0.19611476510763168, "num_tokens": 14587012.0, "step": 4520 }, { "entropy": 6.544143438339233, "epoch": 9.031968031968033, "grad_norm": 1.03125, "learning_rate": 6.554111154868945e-05, "loss": 5.6175, "mean_token_accuracy": 0.18382574021816253, "num_tokens": 14604156.0, "step": 4525 }, { "entropy": 6.6144325733184814, "epoch": 9.041958041958042, "grad_norm": 1.1796875, "learning_rate": 6.522004504344508e-05, "loss": 5.6651, "mean_token_accuracy": 0.17627399563789367, "num_tokens": 14620874.0, "step": 4530 }, { "entropy": 6.619625854492187, "epoch": 9.051948051948052, "grad_norm": 1.125, "learning_rate": 6.490221360461624e-05, "loss": 5.6753, "mean_token_accuracy": 0.17593786865472794, "num_tokens": 14636396.0, "step": 4535 }, { "entropy": 6.503337097167969, "epoch": 9.061938061938061, "grad_norm": 1.015625, "learning_rate": 6.458762213355685e-05, "loss": 5.4992, "mean_token_accuracy": 0.1959144502878189, "num_tokens": 14653083.0, "step": 4540 }, { "entropy": 6.687210893630981, "epoch": 9.071928071928072, "grad_norm": 1.1171875, "learning_rate": 6.427627548165674e-05, "loss": 5.7131, "mean_token_accuracy": 0.16840833723545073, "num_tokens": 14669321.0, "step": 4545 }, { "entropy": 6.634840440750122, "epoch": 9.081918081918081, "grad_norm": 1.1484375, "learning_rate": 6.396817845026633e-05, "loss": 5.7341, "mean_token_accuracy": 0.18002044707536696, "num_tokens": 14686341.0, "step": 4550 }, { "entropy": 6.47555627822876, "epoch": 9.091908091908092, "grad_norm": 0.85546875, "learning_rate": 6.366333579062292e-05, "loss": 5.5429, "mean_token_accuracy": 0.18737580478191376, "num_tokens": 14703557.0, "step": 4555 }, { "entropy": 6.563258028030395, "epoch": 9.101898101898103, "grad_norm": 1.0, "learning_rate": 6.336175220377752e-05, "loss": 5.5916, "mean_token_accuracy": 0.18967287689447404, "num_tokens": 14720034.0, "step": 4560 }, { "entropy": 6.575451898574829, "epoch": 9.111888111888112, "grad_norm": 1.109375, "learning_rate": 6.306343234052212e-05, "loss": 5.6017, "mean_token_accuracy": 0.18138467222452165, "num_tokens": 14735501.0, "step": 4565 }, { "entropy": 6.603144407272339, "epoch": 9.121878121878122, "grad_norm": 1.0625, "learning_rate": 6.2768380801318e-05, "loss": 5.6264, "mean_token_accuracy": 0.18400662541389465, "num_tokens": 14752413.0, "step": 4570 }, { "entropy": 6.589936113357544, "epoch": 9.131868131868131, "grad_norm": 1.1328125, "learning_rate": 6.247660213622493e-05, "loss": 5.623, "mean_token_accuracy": 0.18086908459663392, "num_tokens": 14768037.0, "step": 4575 }, { "entropy": 6.577788019180298, "epoch": 9.141858141858142, "grad_norm": 1.1796875, "learning_rate": 6.218810084483083e-05, "loss": 5.6345, "mean_token_accuracy": 0.18557588309049605, "num_tokens": 14785432.0, "step": 4580 }, { "entropy": 6.628364515304566, "epoch": 9.151848151848151, "grad_norm": 1.0703125, "learning_rate": 6.190288137618255e-05, "loss": 5.6883, "mean_token_accuracy": 0.1793934240937233, "num_tokens": 14801704.0, "step": 4585 }, { "entropy": 6.5041361331939695, "epoch": 9.161838161838162, "grad_norm": 1.015625, "learning_rate": 6.162094812871711e-05, "loss": 5.5914, "mean_token_accuracy": 0.18742053508758544, "num_tokens": 14818778.0, "step": 4590 }, { "entropy": 6.622739315032959, "epoch": 9.171828171828173, "grad_norm": 1.140625, "learning_rate": 6.134230545019396e-05, "loss": 5.6881, "mean_token_accuracy": 0.18067678958177566, "num_tokens": 14834708.0, "step": 4595 }, { "entropy": 6.587009239196777, "epoch": 9.181818181818182, "grad_norm": 1.046875, "learning_rate": 6.106695763762785e-05, "loss": 5.6205, "mean_token_accuracy": 0.18233224153518676, "num_tokens": 14849794.0, "step": 4600 }, { "entropy": 6.535916137695312, "epoch": 9.191808191808192, "grad_norm": 1.015625, "learning_rate": 6.0794908937222764e-05, "loss": 5.5938, "mean_token_accuracy": 0.1847222089767456, "num_tokens": 14866537.0, "step": 4605 }, { "entropy": 6.5473497867584225, "epoch": 9.201798201798201, "grad_norm": 1.1328125, "learning_rate": 6.052616354430614e-05, "loss": 5.616, "mean_token_accuracy": 0.186315555870533, "num_tokens": 14883569.0, "step": 4610 }, { "entropy": 6.678972244262695, "epoch": 9.211788211788212, "grad_norm": 1.0234375, "learning_rate": 6.026072560326442e-05, "loss": 5.7195, "mean_token_accuracy": 0.16966124027967452, "num_tokens": 14899558.0, "step": 4615 }, { "entropy": 6.565244436264038, "epoch": 9.221778221778221, "grad_norm": 0.87890625, "learning_rate": 5.9998599207478995e-05, "loss": 5.6352, "mean_token_accuracy": 0.17788492292165756, "num_tokens": 14916429.0, "step": 4620 }, { "entropy": 6.484505701065063, "epoch": 9.231768231768232, "grad_norm": 1.1640625, "learning_rate": 5.9739788399263136e-05, "loss": 5.5951, "mean_token_accuracy": 0.1882602885365486, "num_tokens": 14932959.0, "step": 4625 }, { "entropy": 6.606488370895386, "epoch": 9.241758241758241, "grad_norm": 1.1171875, "learning_rate": 5.948429716979973e-05, "loss": 5.668, "mean_token_accuracy": 0.17584800273180007, "num_tokens": 14949120.0, "step": 4630 }, { "entropy": 6.55346302986145, "epoch": 9.251748251748252, "grad_norm": 1.09375, "learning_rate": 5.923212945907954e-05, "loss": 5.6735, "mean_token_accuracy": 0.18046673983335496, "num_tokens": 14965502.0, "step": 4635 }, { "entropy": 6.658154010772705, "epoch": 9.261738261738262, "grad_norm": 1.0546875, "learning_rate": 5.898328915584065e-05, "loss": 5.7632, "mean_token_accuracy": 0.17193507701158522, "num_tokens": 14982273.0, "step": 4640 }, { "entropy": 6.623137092590332, "epoch": 9.271728271728271, "grad_norm": 1.2421875, "learning_rate": 5.873778009750832e-05, "loss": 5.6485, "mean_token_accuracy": 0.17903818935155869, "num_tokens": 14997560.0, "step": 4645 }, { "entropy": 6.543309116363526, "epoch": 9.281718281718282, "grad_norm": 1.03125, "learning_rate": 5.8495606070136e-05, "loss": 5.6143, "mean_token_accuracy": 0.18877297788858413, "num_tokens": 15014859.0, "step": 4650 }, { "entropy": 6.493854427337647, "epoch": 9.291708291708291, "grad_norm": 1.03125, "learning_rate": 5.825677080834671e-05, "loss": 5.563, "mean_token_accuracy": 0.19374835044145583, "num_tokens": 15032166.0, "step": 4655 }, { "entropy": 6.554304027557373, "epoch": 9.301698301698302, "grad_norm": 1.0703125, "learning_rate": 5.802127799527569e-05, "loss": 5.5197, "mean_token_accuracy": 0.18833510726690292, "num_tokens": 15048177.0, "step": 4660 }, { "entropy": 6.486464023590088, "epoch": 9.311688311688311, "grad_norm": 1.1328125, "learning_rate": 5.778913126251338e-05, "loss": 5.5393, "mean_token_accuracy": 0.20071997493505478, "num_tokens": 15064440.0, "step": 4665 }, { "entropy": 6.668011426925659, "epoch": 9.321678321678322, "grad_norm": 0.96875, "learning_rate": 5.756033419004963e-05, "loss": 5.7126, "mean_token_accuracy": 0.17583168745040895, "num_tokens": 15081228.0, "step": 4670 }, { "entropy": 6.662775325775146, "epoch": 9.331668331668332, "grad_norm": 0.96875, "learning_rate": 5.733489030621833e-05, "loss": 5.7157, "mean_token_accuracy": 0.16892925202846526, "num_tokens": 15099256.0, "step": 4675 }, { "entropy": 6.553799486160278, "epoch": 9.341658341658341, "grad_norm": 0.94921875, "learning_rate": 5.711280308764307e-05, "loss": 5.6234, "mean_token_accuracy": 0.17775641828775407, "num_tokens": 15115249.0, "step": 4680 }, { "entropy": 6.516328430175781, "epoch": 9.351648351648352, "grad_norm": 1.1640625, "learning_rate": 5.6894075959183396e-05, "loss": 5.6135, "mean_token_accuracy": 0.18262632936239243, "num_tokens": 15131990.0, "step": 4685 }, { "entropy": 6.630344343185425, "epoch": 9.361638361638361, "grad_norm": 1.109375, "learning_rate": 5.667871229388234e-05, "loss": 5.6814, "mean_token_accuracy": 0.1771764412522316, "num_tokens": 15149519.0, "step": 4690 }, { "entropy": 6.648879337310791, "epoch": 9.371628371628372, "grad_norm": 1.109375, "learning_rate": 5.646671541291398e-05, "loss": 5.7229, "mean_token_accuracy": 0.1753318876028061, "num_tokens": 15165488.0, "step": 4695 }, { "entropy": 6.607115459442139, "epoch": 9.381618381618381, "grad_norm": 1.203125, "learning_rate": 5.625808858553244e-05, "loss": 5.6814, "mean_token_accuracy": 0.17679887861013413, "num_tokens": 15181179.0, "step": 4700 }, { "entropy": 6.65881929397583, "epoch": 9.391608391608392, "grad_norm": 1.1171875, "learning_rate": 5.605283502902151e-05, "loss": 5.7245, "mean_token_accuracy": 0.17249663472175597, "num_tokens": 15197623.0, "step": 4705 }, { "entropy": 6.553147792816162, "epoch": 9.401598401598402, "grad_norm": 1.1953125, "learning_rate": 5.5850957908644986e-05, "loss": 5.6377, "mean_token_accuracy": 0.18265938460826875, "num_tokens": 15211272.0, "step": 4710 }, { "entropy": 6.564072227478027, "epoch": 9.411588411588411, "grad_norm": 1.1640625, "learning_rate": 5.565246033759775e-05, "loss": 5.595, "mean_token_accuracy": 0.18455305248498916, "num_tokens": 15226706.0, "step": 4715 }, { "entropy": 6.623476219177246, "epoch": 9.421578421578422, "grad_norm": 1.15625, "learning_rate": 5.545734537695789e-05, "loss": 5.7312, "mean_token_accuracy": 0.17008535712957382, "num_tokens": 15241792.0, "step": 4720 }, { "entropy": 6.611056518554688, "epoch": 9.431568431568431, "grad_norm": 1.2578125, "learning_rate": 5.526561603563947e-05, "loss": 5.6468, "mean_token_accuracy": 0.18209182620048522, "num_tokens": 15256587.0, "step": 4725 }, { "entropy": 6.468847799301147, "epoch": 9.441558441558442, "grad_norm": 1.1328125, "learning_rate": 5.507727527034616e-05, "loss": 5.5303, "mean_token_accuracy": 0.18883492052555084, "num_tokens": 15273419.0, "step": 4730 }, { "entropy": 6.5579845905303955, "epoch": 9.451548451548451, "grad_norm": 1.1640625, "learning_rate": 5.48923259855255e-05, "loss": 5.6408, "mean_token_accuracy": 0.17856216728687285, "num_tokens": 15289533.0, "step": 4735 }, { "entropy": 6.53039813041687, "epoch": 9.461538461538462, "grad_norm": 1.1328125, "learning_rate": 5.4710771033324294e-05, "loss": 5.6177, "mean_token_accuracy": 0.18866459727287294, "num_tokens": 15305887.0, "step": 4740 }, { "entropy": 6.594729995727539, "epoch": 9.471528471528472, "grad_norm": 1.1015625, "learning_rate": 5.453261321354446e-05, "loss": 5.7227, "mean_token_accuracy": 0.18324811160564422, "num_tokens": 15321973.0, "step": 4745 }, { "entropy": 6.625926780700683, "epoch": 9.481518481518481, "grad_norm": 1.078125, "learning_rate": 5.435785527359999e-05, "loss": 5.6933, "mean_token_accuracy": 0.17576399594545364, "num_tokens": 15338855.0, "step": 4750 }, { "entropy": 6.666522359848022, "epoch": 9.491508491508492, "grad_norm": 1.109375, "learning_rate": 5.418649990847452e-05, "loss": 5.7648, "mean_token_accuracy": 0.17153519093990327, "num_tokens": 15355136.0, "step": 4755 }, { "entropy": 6.527340269088745, "epoch": 9.501498501498501, "grad_norm": 1.203125, "learning_rate": 5.401854976067975e-05, "loss": 5.6211, "mean_token_accuracy": 0.18802438229322432, "num_tokens": 15370860.0, "step": 4760 }, { "entropy": 6.510877084732056, "epoch": 9.511488511488512, "grad_norm": 1.2421875, "learning_rate": 5.3854007420214694e-05, "loss": 5.5353, "mean_token_accuracy": 0.19215515106916428, "num_tokens": 15385922.0, "step": 4765 }, { "entropy": 6.576299238204956, "epoch": 9.521478521478521, "grad_norm": 1.2265625, "learning_rate": 5.3692875424525805e-05, "loss": 5.7025, "mean_token_accuracy": 0.1720760226249695, "num_tokens": 15400532.0, "step": 4770 }, { "entropy": 6.419309186935425, "epoch": 9.531468531468532, "grad_norm": 1.0859375, "learning_rate": 5.3535156258467796e-05, "loss": 5.4746, "mean_token_accuracy": 0.19992665499448775, "num_tokens": 15416836.0, "step": 4775 }, { "entropy": 6.669402933120727, "epoch": 9.54145854145854, "grad_norm": 1.046875, "learning_rate": 5.338085235426531e-05, "loss": 5.7795, "mean_token_accuracy": 0.1709643006324768, "num_tokens": 15433477.0, "step": 4780 }, { "entropy": 6.5836122035980225, "epoch": 9.551448551448551, "grad_norm": 1.15625, "learning_rate": 5.322996609147544e-05, "loss": 5.6287, "mean_token_accuracy": 0.18438417017459868, "num_tokens": 15449328.0, "step": 4785 }, { "entropy": 6.622609043121338, "epoch": 9.561438561438562, "grad_norm": 1.1640625, "learning_rate": 5.308249979695101e-05, "loss": 5.6803, "mean_token_accuracy": 0.17739938497543334, "num_tokens": 15465005.0, "step": 4790 }, { "entropy": 6.546008634567261, "epoch": 9.571428571428571, "grad_norm": 1.1796875, "learning_rate": 5.2938455744804715e-05, "loss": 5.6189, "mean_token_accuracy": 0.1764516532421112, "num_tokens": 15481580.0, "step": 4795 }, { "entropy": 6.579231262207031, "epoch": 9.581418581418582, "grad_norm": 1.109375, "learning_rate": 5.279783615637401e-05, "loss": 5.6163, "mean_token_accuracy": 0.18795849084854127, "num_tokens": 15497323.0, "step": 4800 }, { "entropy": 6.4910914421081545, "epoch": 9.591408591408591, "grad_norm": 0.99609375, "learning_rate": 5.2660643200186906e-05, "loss": 5.6108, "mean_token_accuracy": 0.19072694927453995, "num_tokens": 15514974.0, "step": 4805 }, { "entropy": 6.466121768951416, "epoch": 9.601398601398602, "grad_norm": 1.125, "learning_rate": 5.252687899192851e-05, "loss": 5.5047, "mean_token_accuracy": 0.19480836391448975, "num_tokens": 15531382.0, "step": 4810 }, { "entropy": 6.561569881439209, "epoch": 9.61138861138861, "grad_norm": 1.1875, "learning_rate": 5.239654559440837e-05, "loss": 5.5744, "mean_token_accuracy": 0.18659158498048783, "num_tokens": 15546074.0, "step": 4815 }, { "entropy": 6.536590909957885, "epoch": 9.621378621378621, "grad_norm": 1.09375, "learning_rate": 5.2269645017528745e-05, "loss": 5.5978, "mean_token_accuracy": 0.1881682574748993, "num_tokens": 15562671.0, "step": 4820 }, { "entropy": 6.519865989685059, "epoch": 9.631368631368632, "grad_norm": 1.109375, "learning_rate": 5.2146179218253483e-05, "loss": 5.597, "mean_token_accuracy": 0.18624135553836824, "num_tokens": 15578826.0, "step": 4825 }, { "entropy": 6.545838499069214, "epoch": 9.641358641358641, "grad_norm": 0.9453125, "learning_rate": 5.2026150100577956e-05, "loss": 5.6377, "mean_token_accuracy": 0.1813482329249382, "num_tokens": 15594467.0, "step": 4830 }, { "entropy": 6.598823881149292, "epoch": 9.651348651348652, "grad_norm": 1.078125, "learning_rate": 5.1909559515499627e-05, "loss": 5.7121, "mean_token_accuracy": 0.17370960116386414, "num_tokens": 15609688.0, "step": 4835 }, { "entropy": 6.612124395370484, "epoch": 9.661338661338661, "grad_norm": 1.0546875, "learning_rate": 5.179640926098958e-05, "loss": 5.6696, "mean_token_accuracy": 0.17642810940742493, "num_tokens": 15624654.0, "step": 4840 }, { "entropy": 6.645905065536499, "epoch": 9.671328671328672, "grad_norm": 1.1328125, "learning_rate": 5.1686701081964665e-05, "loss": 5.7333, "mean_token_accuracy": 0.1727768898010254, "num_tokens": 15640640.0, "step": 4845 }, { "entropy": 6.671988248825073, "epoch": 9.68131868131868, "grad_norm": 0.98828125, "learning_rate": 5.158043667026074e-05, "loss": 5.7724, "mean_token_accuracy": 0.16994875222444533, "num_tokens": 15658063.0, "step": 4850 }, { "entropy": 6.574873971939087, "epoch": 9.691308691308691, "grad_norm": 1.1171875, "learning_rate": 5.147761766460653e-05, "loss": 5.6242, "mean_token_accuracy": 0.1849856823682785, "num_tokens": 15674560.0, "step": 4855 }, { "entropy": 6.637097597122192, "epoch": 9.7012987012987, "grad_norm": 1.03125, "learning_rate": 5.1378245650598226e-05, "loss": 5.7305, "mean_token_accuracy": 0.17512189447879792, "num_tokens": 15690128.0, "step": 4860 }, { "entropy": 6.606235408782959, "epoch": 9.711288711288711, "grad_norm": 1.1796875, "learning_rate": 5.128232216067524e-05, "loss": 5.6731, "mean_token_accuracy": 0.17947318404912949, "num_tokens": 15706850.0, "step": 4865 }, { "entropy": 6.599513673782349, "epoch": 9.721278721278722, "grad_norm": 1.21875, "learning_rate": 5.118984867409647e-05, "loss": 5.672, "mean_token_accuracy": 0.17838481813669205, "num_tokens": 15723194.0, "step": 4870 }, { "entropy": 6.643277931213379, "epoch": 9.731268731268731, "grad_norm": 1.0546875, "learning_rate": 5.1100826616917475e-05, "loss": 5.7004, "mean_token_accuracy": 0.17396390289068223, "num_tokens": 15739424.0, "step": 4875 }, { "entropy": 6.52038426399231, "epoch": 9.741258741258742, "grad_norm": 1.0546875, "learning_rate": 5.101525736196847e-05, "loss": 5.6239, "mean_token_accuracy": 0.18808289915323256, "num_tokens": 15755791.0, "step": 4880 }, { "entropy": 6.641349458694458, "epoch": 9.75124875124875, "grad_norm": 1.265625, "learning_rate": 5.093314222883323e-05, "loss": 5.7411, "mean_token_accuracy": 0.16789134442806244, "num_tokens": 15771917.0, "step": 4885 }, { "entropy": 6.479106330871582, "epoch": 9.761238761238761, "grad_norm": 1.171875, "learning_rate": 5.085448248382869e-05, "loss": 5.5448, "mean_token_accuracy": 0.1874668374657631, "num_tokens": 15788311.0, "step": 4890 }, { "entropy": 6.552467679977417, "epoch": 9.77122877122877, "grad_norm": 1.1171875, "learning_rate": 5.0779279339985424e-05, "loss": 5.5966, "mean_token_accuracy": 0.18326291143894197, "num_tokens": 15804603.0, "step": 4895 }, { "entropy": 6.568915796279907, "epoch": 9.781218781218781, "grad_norm": 1.1015625, "learning_rate": 5.0707533957028983e-05, "loss": 5.6522, "mean_token_accuracy": 0.18439037799835206, "num_tokens": 15820625.0, "step": 4900 }, { "entropy": 6.540463066101074, "epoch": 9.791208791208792, "grad_norm": 1.234375, "learning_rate": 5.063924744136187e-05, "loss": 5.5079, "mean_token_accuracy": 0.19837560951709748, "num_tokens": 15836340.0, "step": 4905 }, { "entropy": 6.601055049896241, "epoch": 9.801198801198801, "grad_norm": 1.1328125, "learning_rate": 5.057442084604665e-05, "loss": 5.7326, "mean_token_accuracy": 0.17368686497211455, "num_tokens": 15851604.0, "step": 4910 }, { "entropy": 6.569333505630493, "epoch": 9.811188811188812, "grad_norm": 1.2265625, "learning_rate": 5.0513055170789604e-05, "loss": 5.6637, "mean_token_accuracy": 0.17966740876436232, "num_tokens": 15867066.0, "step": 4915 }, { "entropy": 6.619227552413941, "epoch": 9.82117882117882, "grad_norm": 1.1640625, "learning_rate": 5.0455151361925405e-05, "loss": 5.7351, "mean_token_accuracy": 0.16746960580348969, "num_tokens": 15882640.0, "step": 4920 }, { "entropy": 6.645801162719726, "epoch": 9.831168831168831, "grad_norm": 0.96484375, "learning_rate": 5.040071031240235e-05, "loss": 5.7105, "mean_token_accuracy": 0.1727930173277855, "num_tokens": 15900292.0, "step": 4925 }, { "entropy": 6.617860460281372, "epoch": 9.84115884115884, "grad_norm": 1.1015625, "learning_rate": 5.034973286176881e-05, "loss": 5.6304, "mean_token_accuracy": 0.18506597131490707, "num_tokens": 15916423.0, "step": 4930 }, { "entropy": 6.6556047916412355, "epoch": 9.851148851148851, "grad_norm": 1.1875, "learning_rate": 5.0302219796160134e-05, "loss": 5.7757, "mean_token_accuracy": 0.16685285568237304, "num_tokens": 15932313.0, "step": 4935 }, { "entropy": 6.522368335723877, "epoch": 9.861138861138862, "grad_norm": 1.1484375, "learning_rate": 5.025817184828657e-05, "loss": 5.561, "mean_token_accuracy": 0.18559598326683044, "num_tokens": 15948754.0, "step": 4940 }, { "entropy": 6.592281007766724, "epoch": 9.871128871128871, "grad_norm": 1.109375, "learning_rate": 5.0217589697421946e-05, "loss": 5.6398, "mean_token_accuracy": 0.18047972321510314, "num_tokens": 15964160.0, "step": 4945 }, { "entropy": 6.679210996627807, "epoch": 9.881118881118882, "grad_norm": 1.0390625, "learning_rate": 5.0180473969393244e-05, "loss": 5.7319, "mean_token_accuracy": 0.16809917241334915, "num_tokens": 15981184.0, "step": 4950 }, { "entropy": 6.58340163230896, "epoch": 9.89110889110889, "grad_norm": 1.0625, "learning_rate": 5.014682523657089e-05, "loss": 5.6182, "mean_token_accuracy": 0.1859930247068405, "num_tokens": 15997883.0, "step": 4955 }, { "entropy": 6.644883108139038, "epoch": 9.901098901098901, "grad_norm": 1.078125, "learning_rate": 5.011664401786001e-05, "loss": 5.7319, "mean_token_accuracy": 0.1722308561205864, "num_tokens": 16013860.0, "step": 4960 }, { "entropy": 6.647361135482788, "epoch": 9.91108891108891, "grad_norm": 1.2109375, "learning_rate": 5.008993077869228e-05, "loss": 5.6742, "mean_token_accuracy": 0.17641904950141907, "num_tokens": 16029231.0, "step": 4965 }, { "entropy": 6.586844158172608, "epoch": 9.921078921078921, "grad_norm": 1.1015625, "learning_rate": 5.0066685931018946e-05, "loss": 5.6617, "mean_token_accuracy": 0.18107237070798873, "num_tokens": 16045431.0, "step": 4970 }, { "entropy": 6.605205011367798, "epoch": 9.931068931068932, "grad_norm": 1.1640625, "learning_rate": 5.004690983330425e-05, "loss": 5.6267, "mean_token_accuracy": 0.18259226828813552, "num_tokens": 16060969.0, "step": 4975 }, { "entropy": 6.547778224945068, "epoch": 9.941058941058941, "grad_norm": 1.296875, "learning_rate": 5.003060279052015e-05, "loss": 5.5907, "mean_token_accuracy": 0.18539558351039886, "num_tokens": 16076444.0, "step": 4980 }, { "entropy": 6.529587841033935, "epoch": 9.951048951048952, "grad_norm": 1.046875, "learning_rate": 5.0017765054141375e-05, "loss": 5.6592, "mean_token_accuracy": 0.1831126555800438, "num_tokens": 16092998.0, "step": 4985 }, { "entropy": 6.509506511688232, "epoch": 9.96103896103896, "grad_norm": 1.125, "learning_rate": 5.000839682214173e-05, "loss": 5.5305, "mean_token_accuracy": 0.18782208263874053, "num_tokens": 16108272.0, "step": 4990 }, { "entropy": 6.606856393814087, "epoch": 9.971028971028971, "grad_norm": 1.1328125, "learning_rate": 5.0002498238990904e-05, "loss": 5.719, "mean_token_accuracy": 0.17680859565734863, "num_tokens": 16125117.0, "step": 4995 }, { "entropy": 6.588427019119263, "epoch": 9.98101898101898, "grad_norm": 1.171875, "learning_rate": 5.000006939565238e-05, "loss": 5.6483, "mean_token_accuracy": 0.17816835641860962, "num_tokens": 16141118.0, "step": 5000 }, { "epoch": 9.98101898101898, "eval_entropy": 6.481703235007621, "eval_loss": 7.082968235015869, "eval_mean_token_accuracy": 0.11054416713682381, "eval_num_tokens": 16141118.0, "eval_runtime": 1.1749, "eval_samples_per_second": 1254.622, "eval_steps_per_second": 157.466, "step": 5000 } ], "logging_steps": 5, "max_steps": 5000, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3251594459013120.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }