{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.997002997002997, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.74254903793335, "epoch": 0.00999000999000999, "grad_norm": 4.6875, "learning_rate": 2e-06, "loss": 10.8409, "mean_token_accuracy": 0.00010789126390591264, "num_tokens": 17348.0, "step": 5 }, { "entropy": 10.742575931549073, "epoch": 0.01998001998001998, "grad_norm": 5.28125, "learning_rate": 4.5e-06, "loss": 10.8325, "mean_token_accuracy": 6.410256610251963e-05, "num_tokens": 33613.0, "step": 10 }, { "entropy": 10.742553329467773, "epoch": 0.029970029970029972, "grad_norm": 5.0625, "learning_rate": 7e-06, "loss": 10.8012, "mean_token_accuracy": 0.00016108142444863914, "num_tokens": 49416.0, "step": 15 }, { "entropy": 10.742562675476075, "epoch": 0.03996003996003996, "grad_norm": 5.0625, "learning_rate": 9.5e-06, "loss": 10.7438, "mean_token_accuracy": 0.0010525182529818266, "num_tokens": 64663.0, "step": 20 }, { "entropy": 10.742408943176269, "epoch": 0.04995004995004995, "grad_norm": 4.75, "learning_rate": 1.2e-05, "loss": 10.6283, "mean_token_accuracy": 0.03072175462730229, "num_tokens": 79972.0, "step": 25 }, { "entropy": 10.74140043258667, "epoch": 0.059940059940059943, "grad_norm": 4.0, "learning_rate": 1.4500000000000002e-05, "loss": 10.5246, "mean_token_accuracy": 0.05747625604271889, "num_tokens": 96254.0, "step": 30 }, { "entropy": 10.735374069213867, "epoch": 0.06993006993006994, "grad_norm": 2.875, "learning_rate": 1.7000000000000003e-05, "loss": 10.3755, "mean_token_accuracy": 0.06859578937292099, "num_tokens": 112713.0, "step": 35 }, { "entropy": 10.707574653625489, "epoch": 0.07992007992007992, "grad_norm": 2.28125, "learning_rate": 1.95e-05, "loss": 10.1924, "mean_token_accuracy": 0.06884920224547386, "num_tokens": 128259.0, "step": 40 }, { "entropy": 10.654945564270019, "epoch": 0.0899100899100899, "grad_norm": 2.046875, "learning_rate": 2.2e-05, "loss": 10.1434, "mean_token_accuracy": 0.06479340717196465, "num_tokens": 145521.0, "step": 45 }, { "entropy": 10.624096393585205, "epoch": 0.0999000999000999, "grad_norm": 1.7734375, "learning_rate": 2.4500000000000003e-05, "loss": 10.0779, "mean_token_accuracy": 0.06704385466873646, "num_tokens": 162665.0, "step": 50 }, { "entropy": 10.62326774597168, "epoch": 0.10989010989010989, "grad_norm": 1.796875, "learning_rate": 2.7e-05, "loss": 10.0119, "mean_token_accuracy": 0.06695662550628186, "num_tokens": 178901.0, "step": 55 }, { "entropy": 10.61907787322998, "epoch": 0.11988011988011989, "grad_norm": 1.7421875, "learning_rate": 2.95e-05, "loss": 9.9679, "mean_token_accuracy": 0.06775063388049603, "num_tokens": 194617.0, "step": 60 }, { "entropy": 10.605632114410401, "epoch": 0.12987012987012986, "grad_norm": 1.7109375, "learning_rate": 3.2e-05, "loss": 9.8939, "mean_token_accuracy": 0.07534115239977837, "num_tokens": 209675.0, "step": 65 }, { "entropy": 10.59527235031128, "epoch": 0.13986013986013987, "grad_norm": 2.0, "learning_rate": 3.4500000000000005e-05, "loss": 9.8733, "mean_token_accuracy": 0.07048867233097553, "num_tokens": 225848.0, "step": 70 }, { "entropy": 10.599591922760009, "epoch": 0.14985014985014986, "grad_norm": 1.796875, "learning_rate": 3.7e-05, "loss": 9.8167, "mean_token_accuracy": 0.07247593812644482, "num_tokens": 242981.0, "step": 75 }, { "entropy": 10.579588508605957, "epoch": 0.15984015984015984, "grad_norm": 1.546875, "learning_rate": 3.95e-05, "loss": 9.7625, "mean_token_accuracy": 0.07427209392189979, "num_tokens": 258173.0, "step": 80 }, { "entropy": 10.544640350341798, "epoch": 0.16983016983016982, "grad_norm": 1.6484375, "learning_rate": 4.2000000000000004e-05, "loss": 9.69, "mean_token_accuracy": 0.07245487086474896, "num_tokens": 273570.0, "step": 85 }, { "entropy": 10.5300874710083, "epoch": 0.1798201798201798, "grad_norm": 1.5625, "learning_rate": 4.45e-05, "loss": 9.6529, "mean_token_accuracy": 0.07408605217933655, "num_tokens": 290549.0, "step": 90 }, { "entropy": 10.528420066833496, "epoch": 0.18981018981018982, "grad_norm": 1.5390625, "learning_rate": 4.7000000000000004e-05, "loss": 9.6194, "mean_token_accuracy": 0.07625656872987747, "num_tokens": 306856.0, "step": 95 }, { "entropy": 10.485299491882325, "epoch": 0.1998001998001998, "grad_norm": 1.5234375, "learning_rate": 4.9500000000000004e-05, "loss": 9.5443, "mean_token_accuracy": 0.08020635470747947, "num_tokens": 322515.0, "step": 100 }, { "entropy": 10.434676933288575, "epoch": 0.2097902097902098, "grad_norm": 1.609375, "learning_rate": 5.2e-05, "loss": 9.4966, "mean_token_accuracy": 0.07586914226412773, "num_tokens": 337941.0, "step": 105 }, { "entropy": 10.45520372390747, "epoch": 0.21978021978021978, "grad_norm": 1.546875, "learning_rate": 5.45e-05, "loss": 9.4232, "mean_token_accuracy": 0.08006052449345588, "num_tokens": 353788.0, "step": 110 }, { "entropy": 10.380233097076417, "epoch": 0.22977022977022976, "grad_norm": 1.6015625, "learning_rate": 5.7e-05, "loss": 9.3782, "mean_token_accuracy": 0.08523525297641754, "num_tokens": 371012.0, "step": 115 }, { "entropy": 10.3286771774292, "epoch": 0.23976023976023977, "grad_norm": 1.765625, "learning_rate": 5.9499999999999996e-05, "loss": 9.2336, "mean_token_accuracy": 0.08941392749547958, "num_tokens": 387063.0, "step": 120 }, { "entropy": 10.305299186706543, "epoch": 0.24975024975024976, "grad_norm": 1.203125, "learning_rate": 6.2e-05, "loss": 9.2413, "mean_token_accuracy": 0.08080004155635834, "num_tokens": 404360.0, "step": 125 }, { "entropy": 10.245867156982422, "epoch": 0.2597402597402597, "grad_norm": 2.0625, "learning_rate": 6.450000000000001e-05, "loss": 9.0529, "mean_token_accuracy": 0.09887080416083335, "num_tokens": 421267.0, "step": 130 }, { "entropy": 10.113175201416016, "epoch": 0.26973026973026976, "grad_norm": 1.0390625, "learning_rate": 6.7e-05, "loss": 9.0745, "mean_token_accuracy": 0.0869515560567379, "num_tokens": 438900.0, "step": 135 }, { "entropy": 10.11645679473877, "epoch": 0.27972027972027974, "grad_norm": 1.2421875, "learning_rate": 6.950000000000001e-05, "loss": 8.9962, "mean_token_accuracy": 0.08159712329506874, "num_tokens": 454580.0, "step": 140 }, { "entropy": 10.033879661560059, "epoch": 0.2897102897102897, "grad_norm": 0.9375, "learning_rate": 7.2e-05, "loss": 8.9364, "mean_token_accuracy": 0.082859006524086, "num_tokens": 470894.0, "step": 145 }, { "entropy": 9.949287033081054, "epoch": 0.2997002997002997, "grad_norm": 1.15625, "learning_rate": 7.45e-05, "loss": 8.8864, "mean_token_accuracy": 0.0842631220817566, "num_tokens": 487872.0, "step": 150 }, { "entropy": 9.799868774414062, "epoch": 0.3096903096903097, "grad_norm": 1.375, "learning_rate": 7.7e-05, "loss": 8.7141, "mean_token_accuracy": 0.09437366873025894, "num_tokens": 503899.0, "step": 155 }, { "entropy": 9.570561790466309, "epoch": 0.3196803196803197, "grad_norm": 0.83203125, "learning_rate": 7.950000000000001e-05, "loss": 8.6153, "mean_token_accuracy": 0.09862063378095627, "num_tokens": 519023.0, "step": 160 }, { "entropy": 9.580165386199951, "epoch": 0.32967032967032966, "grad_norm": 0.796875, "learning_rate": 8.2e-05, "loss": 8.6321, "mean_token_accuracy": 0.087054193764925, "num_tokens": 535424.0, "step": 165 }, { "entropy": 9.45827875137329, "epoch": 0.33966033966033965, "grad_norm": 0.83203125, "learning_rate": 8.450000000000001e-05, "loss": 8.6716, "mean_token_accuracy": 0.08567041307687759, "num_tokens": 552528.0, "step": 170 }, { "entropy": 9.326940536499023, "epoch": 0.34965034965034963, "grad_norm": 0.70703125, "learning_rate": 8.7e-05, "loss": 8.5523, "mean_token_accuracy": 0.08963110744953155, "num_tokens": 567149.0, "step": 175 }, { "entropy": 9.181477642059326, "epoch": 0.3596403596403596, "grad_norm": 0.8984375, "learning_rate": 8.95e-05, "loss": 8.5255, "mean_token_accuracy": 0.08932835683226585, "num_tokens": 582033.0, "step": 180 }, { "entropy": 9.184029483795166, "epoch": 0.3696303696303696, "grad_norm": 0.9921875, "learning_rate": 9.2e-05, "loss": 8.492, "mean_token_accuracy": 0.09364427700638771, "num_tokens": 598930.0, "step": 185 }, { "entropy": 9.105390739440917, "epoch": 0.37962037962037964, "grad_norm": 0.91015625, "learning_rate": 9.45e-05, "loss": 8.4764, "mean_token_accuracy": 0.08496234193444252, "num_tokens": 615859.0, "step": 190 }, { "entropy": 9.057480430603027, "epoch": 0.38961038961038963, "grad_norm": 0.66015625, "learning_rate": 9.7e-05, "loss": 8.4525, "mean_token_accuracy": 0.09097891747951507, "num_tokens": 631984.0, "step": 195 }, { "entropy": 8.931283473968506, "epoch": 0.3996003996003996, "grad_norm": 0.76171875, "learning_rate": 9.95e-05, "loss": 8.4712, "mean_token_accuracy": 0.09022903516888618, "num_tokens": 648599.0, "step": 200 }, { "entropy": 8.999445819854737, "epoch": 0.4095904095904096, "grad_norm": 0.75, "learning_rate": 0.000102, "loss": 8.5152, "mean_token_accuracy": 0.08909457549452782, "num_tokens": 666196.0, "step": 205 }, { "entropy": 8.872494792938232, "epoch": 0.4195804195804196, "grad_norm": 0.66015625, "learning_rate": 0.00010449999999999999, "loss": 8.4462, "mean_token_accuracy": 0.09361587092280388, "num_tokens": 682848.0, "step": 210 }, { "entropy": 8.852845001220704, "epoch": 0.42957042957042957, "grad_norm": 0.5703125, "learning_rate": 0.000107, "loss": 8.3932, "mean_token_accuracy": 0.0924599327147007, "num_tokens": 700324.0, "step": 215 }, { "entropy": 8.826492881774902, "epoch": 0.43956043956043955, "grad_norm": 0.6796875, "learning_rate": 0.0001095, "loss": 8.438, "mean_token_accuracy": 0.0906071975827217, "num_tokens": 715401.0, "step": 220 }, { "entropy": 8.716631221771241, "epoch": 0.44955044955044954, "grad_norm": 0.68359375, "learning_rate": 0.000112, "loss": 8.4143, "mean_token_accuracy": 0.09328261092305183, "num_tokens": 730372.0, "step": 225 }, { "entropy": 8.727209281921386, "epoch": 0.4595404595404595, "grad_norm": 0.796875, "learning_rate": 0.0001145, "loss": 8.3391, "mean_token_accuracy": 0.09173915013670922, "num_tokens": 745880.0, "step": 230 }, { "entropy": 8.743009567260742, "epoch": 0.4695304695304695, "grad_norm": 0.7265625, "learning_rate": 0.00011700000000000001, "loss": 8.3552, "mean_token_accuracy": 0.09261953458189964, "num_tokens": 761474.0, "step": 235 }, { "entropy": 8.669536972045899, "epoch": 0.47952047952047955, "grad_norm": 0.62890625, "learning_rate": 0.00011949999999999999, "loss": 8.3798, "mean_token_accuracy": 0.09077078998088836, "num_tokens": 776871.0, "step": 240 }, { "entropy": 8.689266204833984, "epoch": 0.48951048951048953, "grad_norm": 0.70703125, "learning_rate": 0.000122, "loss": 8.3659, "mean_token_accuracy": 0.09065382108092308, "num_tokens": 793506.0, "step": 245 }, { "entropy": 8.591617012023926, "epoch": 0.4995004995004995, "grad_norm": 0.68359375, "learning_rate": 0.0001245, "loss": 8.3325, "mean_token_accuracy": 0.09529750868678093, "num_tokens": 808366.0, "step": 250 }, { "entropy": 8.718113708496094, "epoch": 0.5094905094905094, "grad_norm": 0.765625, "learning_rate": 0.000127, "loss": 8.2646, "mean_token_accuracy": 0.10416125357151032, "num_tokens": 825461.0, "step": 255 }, { "entropy": 8.644307136535645, "epoch": 0.5194805194805194, "grad_norm": 0.65625, "learning_rate": 0.0001295, "loss": 8.3552, "mean_token_accuracy": 0.08870847970247268, "num_tokens": 840998.0, "step": 260 }, { "entropy": 8.638798427581786, "epoch": 0.5294705294705294, "grad_norm": 0.70703125, "learning_rate": 0.000132, "loss": 8.4149, "mean_token_accuracy": 0.08986097797751427, "num_tokens": 858383.0, "step": 265 }, { "entropy": 8.622299480438233, "epoch": 0.5394605394605395, "grad_norm": 0.703125, "learning_rate": 0.00013450000000000002, "loss": 8.3192, "mean_token_accuracy": 0.08967429846525192, "num_tokens": 873611.0, "step": 270 }, { "entropy": 8.645909023284911, "epoch": 0.5494505494505495, "grad_norm": 0.8046875, "learning_rate": 0.00013700000000000002, "loss": 8.2318, "mean_token_accuracy": 0.10625835433602333, "num_tokens": 889918.0, "step": 275 }, { "entropy": 8.576266384124756, "epoch": 0.5594405594405595, "grad_norm": 0.80859375, "learning_rate": 0.0001395, "loss": 8.2966, "mean_token_accuracy": 0.1017056480050087, "num_tokens": 906967.0, "step": 280 }, { "entropy": 8.678112125396728, "epoch": 0.5694305694305695, "grad_norm": 0.73828125, "learning_rate": 0.00014199999999999998, "loss": 8.3848, "mean_token_accuracy": 0.09247232899069786, "num_tokens": 922954.0, "step": 285 }, { "entropy": 8.666139221191406, "epoch": 0.5794205794205795, "grad_norm": 0.7734375, "learning_rate": 0.0001445, "loss": 8.3586, "mean_token_accuracy": 0.0921535387635231, "num_tokens": 938920.0, "step": 290 }, { "entropy": 8.631329917907715, "epoch": 0.5894105894105894, "grad_norm": 0.66796875, "learning_rate": 0.000147, "loss": 8.3734, "mean_token_accuracy": 0.0920196034014225, "num_tokens": 956301.0, "step": 295 }, { "entropy": 8.548529148101807, "epoch": 0.5994005994005994, "grad_norm": 0.8515625, "learning_rate": 0.0001495, "loss": 8.2358, "mean_token_accuracy": 0.09958092793822289, "num_tokens": 972454.0, "step": 300 }, { "entropy": 8.61522102355957, "epoch": 0.6093906093906094, "grad_norm": 0.703125, "learning_rate": 0.000152, "loss": 8.333, "mean_token_accuracy": 0.09208913743495942, "num_tokens": 987326.0, "step": 305 }, { "entropy": 8.584405994415283, "epoch": 0.6193806193806194, "grad_norm": 0.69921875, "learning_rate": 0.00015450000000000001, "loss": 8.2977, "mean_token_accuracy": 0.09532473459839821, "num_tokens": 1002448.0, "step": 310 }, { "entropy": 8.536137676239013, "epoch": 0.6293706293706294, "grad_norm": 0.69921875, "learning_rate": 0.000157, "loss": 8.3265, "mean_token_accuracy": 0.09180266484618187, "num_tokens": 1020348.0, "step": 315 }, { "entropy": 8.623396396636963, "epoch": 0.6393606393606394, "grad_norm": 0.7265625, "learning_rate": 0.0001595, "loss": 8.3499, "mean_token_accuracy": 0.08997747674584389, "num_tokens": 1036562.0, "step": 320 }, { "entropy": 8.528428745269775, "epoch": 0.6493506493506493, "grad_norm": 0.7734375, "learning_rate": 0.000162, "loss": 8.3187, "mean_token_accuracy": 0.09452675953507424, "num_tokens": 1053106.0, "step": 325 }, { "entropy": 8.570547008514405, "epoch": 0.6593406593406593, "grad_norm": 0.80078125, "learning_rate": 0.00016450000000000001, "loss": 8.2708, "mean_token_accuracy": 0.09287350997328758, "num_tokens": 1068277.0, "step": 330 }, { "entropy": 8.505113983154297, "epoch": 0.6693306693306693, "grad_norm": 0.7109375, "learning_rate": 0.00016700000000000002, "loss": 8.212, "mean_token_accuracy": 0.10472053438425064, "num_tokens": 1083887.0, "step": 335 }, { "entropy": 8.494814014434814, "epoch": 0.6793206793206793, "grad_norm": 0.65234375, "learning_rate": 0.00016950000000000003, "loss": 8.2264, "mean_token_accuracy": 0.0991443045437336, "num_tokens": 1099791.0, "step": 340 }, { "entropy": 8.513353157043458, "epoch": 0.6893106893106893, "grad_norm": 0.9140625, "learning_rate": 0.00017199999999999998, "loss": 8.2843, "mean_token_accuracy": 0.09210123345255852, "num_tokens": 1116137.0, "step": 345 }, { "entropy": 8.550718784332275, "epoch": 0.6993006993006993, "grad_norm": 0.77734375, "learning_rate": 0.00017449999999999999, "loss": 8.2293, "mean_token_accuracy": 0.10072905272245407, "num_tokens": 1132449.0, "step": 350 }, { "entropy": 8.527479457855225, "epoch": 0.7092907092907093, "grad_norm": 1.1171875, "learning_rate": 0.000177, "loss": 8.3552, "mean_token_accuracy": 0.09086157828569412, "num_tokens": 1148316.0, "step": 355 }, { "entropy": 8.505389308929443, "epoch": 0.7192807192807192, "grad_norm": 0.74609375, "learning_rate": 0.0001795, "loss": 8.2142, "mean_token_accuracy": 0.09256454855203629, "num_tokens": 1164030.0, "step": 360 }, { "entropy": 8.580228328704834, "epoch": 0.7292707292707292, "grad_norm": 0.87109375, "learning_rate": 0.000182, "loss": 8.3049, "mean_token_accuracy": 0.09622592777013779, "num_tokens": 1180624.0, "step": 365 }, { "entropy": 8.496176528930665, "epoch": 0.7392607392607392, "grad_norm": 0.8671875, "learning_rate": 0.0001845, "loss": 8.2815, "mean_token_accuracy": 0.09714617729187011, "num_tokens": 1196986.0, "step": 370 }, { "entropy": 8.580214786529542, "epoch": 0.7492507492507493, "grad_norm": 0.72265625, "learning_rate": 0.000187, "loss": 8.2919, "mean_token_accuracy": 0.09614738449454308, "num_tokens": 1212754.0, "step": 375 }, { "entropy": 8.44631586074829, "epoch": 0.7592407592407593, "grad_norm": 0.91015625, "learning_rate": 0.0001895, "loss": 8.2324, "mean_token_accuracy": 0.09536803364753724, "num_tokens": 1229627.0, "step": 380 }, { "entropy": 8.515226554870605, "epoch": 0.7692307692307693, "grad_norm": 1.1796875, "learning_rate": 0.000192, "loss": 8.1816, "mean_token_accuracy": 0.0967013455927372, "num_tokens": 1245127.0, "step": 385 }, { "entropy": 8.458242416381836, "epoch": 0.7792207792207793, "grad_norm": 0.8125, "learning_rate": 0.0001945, "loss": 8.2483, "mean_token_accuracy": 0.09477976039052009, "num_tokens": 1261438.0, "step": 390 }, { "entropy": 8.479850482940673, "epoch": 0.7892107892107892, "grad_norm": 0.734375, "learning_rate": 0.00019700000000000002, "loss": 8.2152, "mean_token_accuracy": 0.09673597514629365, "num_tokens": 1277476.0, "step": 395 }, { "entropy": 8.536440181732178, "epoch": 0.7992007992007992, "grad_norm": 0.76953125, "learning_rate": 0.00019950000000000002, "loss": 8.1608, "mean_token_accuracy": 0.09755991101264953, "num_tokens": 1294659.0, "step": 400 }, { "entropy": 8.371343421936036, "epoch": 0.8091908091908092, "grad_norm": 0.8203125, "learning_rate": 0.000202, "loss": 8.1319, "mean_token_accuracy": 0.10120925828814506, "num_tokens": 1308829.0, "step": 405 }, { "entropy": 8.464437866210938, "epoch": 0.8191808191808192, "grad_norm": 0.765625, "learning_rate": 0.00020449999999999998, "loss": 8.1896, "mean_token_accuracy": 0.10006042197346687, "num_tokens": 1325659.0, "step": 410 }, { "entropy": 8.507107639312744, "epoch": 0.8291708291708292, "grad_norm": 0.87890625, "learning_rate": 0.000207, "loss": 8.2255, "mean_token_accuracy": 0.09681524932384492, "num_tokens": 1341643.0, "step": 415 }, { "entropy": 8.446794795989991, "epoch": 0.8391608391608392, "grad_norm": 0.9140625, "learning_rate": 0.0002095, "loss": 8.197, "mean_token_accuracy": 0.09735974669456482, "num_tokens": 1359197.0, "step": 420 }, { "entropy": 8.502279472351074, "epoch": 0.8491508491508492, "grad_norm": 0.6796875, "learning_rate": 0.000212, "loss": 8.1875, "mean_token_accuracy": 0.09608993604779244, "num_tokens": 1376107.0, "step": 425 }, { "entropy": 8.477056503295898, "epoch": 0.8591408591408591, "grad_norm": 0.79296875, "learning_rate": 0.0002145, "loss": 8.2042, "mean_token_accuracy": 0.09094029515981675, "num_tokens": 1392232.0, "step": 430 }, { "entropy": 8.460865306854249, "epoch": 0.8691308691308691, "grad_norm": 0.83984375, "learning_rate": 0.00021700000000000002, "loss": 8.1631, "mean_token_accuracy": 0.09813632071018219, "num_tokens": 1406747.0, "step": 435 }, { "entropy": 8.48235101699829, "epoch": 0.8791208791208791, "grad_norm": 0.7890625, "learning_rate": 0.0002195, "loss": 8.1609, "mean_token_accuracy": 0.09457436800003052, "num_tokens": 1423599.0, "step": 440 }, { "entropy": 8.372987842559814, "epoch": 0.8891108891108891, "grad_norm": 1.1640625, "learning_rate": 0.000222, "loss": 8.091, "mean_token_accuracy": 0.1050879828631878, "num_tokens": 1439330.0, "step": 445 }, { "entropy": 8.440707111358643, "epoch": 0.8991008991008991, "grad_norm": 0.66015625, "learning_rate": 0.0002245, "loss": 8.0636, "mean_token_accuracy": 0.10564030036330223, "num_tokens": 1456660.0, "step": 450 }, { "entropy": 8.463158130645752, "epoch": 0.9090909090909091, "grad_norm": 0.77734375, "learning_rate": 0.00022700000000000002, "loss": 8.1173, "mean_token_accuracy": 0.10065716579556465, "num_tokens": 1471619.0, "step": 455 }, { "entropy": 8.29682149887085, "epoch": 0.919080919080919, "grad_norm": 0.90625, "learning_rate": 0.00022950000000000002, "loss": 8.0752, "mean_token_accuracy": 0.09712542369961738, "num_tokens": 1486971.0, "step": 460 }, { "entropy": 8.374618434906006, "epoch": 0.929070929070929, "grad_norm": 0.7890625, "learning_rate": 0.00023200000000000003, "loss": 8.1102, "mean_token_accuracy": 0.09521022215485572, "num_tokens": 1502923.0, "step": 465 }, { "entropy": 8.45193510055542, "epoch": 0.939060939060939, "grad_norm": 1.1015625, "learning_rate": 0.00023449999999999998, "loss": 8.1818, "mean_token_accuracy": 0.09111250266432762, "num_tokens": 1520214.0, "step": 470 }, { "entropy": 8.413396072387695, "epoch": 0.949050949050949, "grad_norm": 0.875, "learning_rate": 0.000237, "loss": 8.0682, "mean_token_accuracy": 0.10277181193232536, "num_tokens": 1534946.0, "step": 475 }, { "entropy": 8.293998527526856, "epoch": 0.9590409590409591, "grad_norm": 0.74609375, "learning_rate": 0.0002395, "loss": 7.9474, "mean_token_accuracy": 0.11179379150271415, "num_tokens": 1551823.0, "step": 480 }, { "entropy": 8.366506767272949, "epoch": 0.9690309690309691, "grad_norm": 0.98828125, "learning_rate": 0.000242, "loss": 8.0529, "mean_token_accuracy": 0.10311459228396416, "num_tokens": 1567354.0, "step": 485 }, { "entropy": 8.338885498046874, "epoch": 0.9790209790209791, "grad_norm": 1.109375, "learning_rate": 0.0002445, "loss": 8.0225, "mean_token_accuracy": 0.09862796664237976, "num_tokens": 1583749.0, "step": 490 }, { "entropy": 8.336707592010498, "epoch": 0.989010989010989, "grad_norm": 0.87890625, "learning_rate": 0.000247, "loss": 8.1258, "mean_token_accuracy": 0.09763901010155678, "num_tokens": 1599678.0, "step": 495 }, { "entropy": 8.445067310333252, "epoch": 0.999000999000999, "grad_norm": 0.99609375, "learning_rate": 0.0002495, "loss": 8.1224, "mean_token_accuracy": 0.0928703673183918, "num_tokens": 1616737.0, "step": 500 }, { "epoch": 0.999000999000999, "eval_entropy": 8.140788088618098, "eval_loss": 8.047406196594238, "eval_mean_token_accuracy": 0.09197118636724111, "eval_num_tokens": 1616737.0, "eval_runtime": 1.1978, "eval_samples_per_second": 1230.577, "eval_steps_per_second": 154.448, "step": 500 }, { "entropy": 8.344965828789604, "epoch": 1.007992007992008, "grad_norm": 0.83203125, "learning_rate": 0.000252, "loss": 8.0423, "mean_token_accuracy": 0.09306528833177355, "num_tokens": 1629911.0, "step": 505 }, { "entropy": 8.31555461883545, "epoch": 1.017982017982018, "grad_norm": 0.75390625, "learning_rate": 0.0002545, "loss": 7.9697, "mean_token_accuracy": 0.0968889206647873, "num_tokens": 1645944.0, "step": 510 }, { "entropy": 8.219412803649902, "epoch": 1.027972027972028, "grad_norm": 0.8125, "learning_rate": 0.000257, "loss": 7.944, "mean_token_accuracy": 0.10192576050758362, "num_tokens": 1660254.0, "step": 515 }, { "entropy": 8.334071922302247, "epoch": 1.037962037962038, "grad_norm": 0.875, "learning_rate": 0.0002595, "loss": 7.9225, "mean_token_accuracy": 0.10587546825408936, "num_tokens": 1675805.0, "step": 520 }, { "entropy": 8.385684299468995, "epoch": 1.0479520479520479, "grad_norm": 0.84375, "learning_rate": 0.000262, "loss": 7.9414, "mean_token_accuracy": 0.09777224585413932, "num_tokens": 1692248.0, "step": 525 }, { "entropy": 8.283127307891846, "epoch": 1.057942057942058, "grad_norm": 0.82421875, "learning_rate": 0.00026450000000000003, "loss": 7.9208, "mean_token_accuracy": 0.10127234905958175, "num_tokens": 1708443.0, "step": 530 }, { "entropy": 8.216063213348388, "epoch": 1.0679320679320679, "grad_norm": 0.9140625, "learning_rate": 0.00026700000000000004, "loss": 7.8234, "mean_token_accuracy": 0.1095321536064148, "num_tokens": 1723977.0, "step": 535 }, { "entropy": 8.342953109741211, "epoch": 1.077922077922078, "grad_norm": 0.85546875, "learning_rate": 0.00026950000000000005, "loss": 7.9888, "mean_token_accuracy": 0.09499371498823166, "num_tokens": 1739362.0, "step": 540 }, { "entropy": 8.271250534057618, "epoch": 1.0879120879120878, "grad_norm": 0.90625, "learning_rate": 0.00027200000000000005, "loss": 7.9808, "mean_token_accuracy": 0.09600954875349998, "num_tokens": 1755106.0, "step": 545 }, { "entropy": 8.257489347457886, "epoch": 1.097902097902098, "grad_norm": 0.87890625, "learning_rate": 0.0002745, "loss": 7.9237, "mean_token_accuracy": 0.09950614199042321, "num_tokens": 1771537.0, "step": 550 }, { "entropy": 8.221052932739259, "epoch": 1.1078921078921078, "grad_norm": 0.921875, "learning_rate": 0.000277, "loss": 7.8883, "mean_token_accuracy": 0.10020415410399437, "num_tokens": 1786942.0, "step": 555 }, { "entropy": 8.243068408966064, "epoch": 1.1178821178821179, "grad_norm": 0.90625, "learning_rate": 0.0002795, "loss": 7.8005, "mean_token_accuracy": 0.10907796397805214, "num_tokens": 1803849.0, "step": 560 }, { "entropy": 8.201099395751953, "epoch": 1.127872127872128, "grad_norm": 0.765625, "learning_rate": 0.00028199999999999997, "loss": 7.8788, "mean_token_accuracy": 0.10487436950206756, "num_tokens": 1820439.0, "step": 565 }, { "entropy": 8.326700115203858, "epoch": 1.1378621378621379, "grad_norm": 0.9453125, "learning_rate": 0.0002845, "loss": 7.9411, "mean_token_accuracy": 0.10306010618805886, "num_tokens": 1836008.0, "step": 570 }, { "entropy": 8.20847806930542, "epoch": 1.1478521478521477, "grad_norm": 0.90625, "learning_rate": 0.000287, "loss": 7.8465, "mean_token_accuracy": 0.10470956414937974, "num_tokens": 1851887.0, "step": 575 }, { "entropy": 8.185382175445557, "epoch": 1.1578421578421578, "grad_norm": 0.84375, "learning_rate": 0.0002895, "loss": 7.8585, "mean_token_accuracy": 0.0996880978345871, "num_tokens": 1866979.0, "step": 580 }, { "entropy": 8.20130467414856, "epoch": 1.167832167832168, "grad_norm": 1.0859375, "learning_rate": 0.000292, "loss": 7.8965, "mean_token_accuracy": 0.09827386811375619, "num_tokens": 1881384.0, "step": 585 }, { "entropy": 8.22911195755005, "epoch": 1.1778221778221778, "grad_norm": 0.76953125, "learning_rate": 0.0002945, "loss": 7.8368, "mean_token_accuracy": 0.10659671127796173, "num_tokens": 1898986.0, "step": 590 }, { "entropy": 8.15971794128418, "epoch": 1.187812187812188, "grad_norm": 0.890625, "learning_rate": 0.000297, "loss": 7.8281, "mean_token_accuracy": 0.10433512926101685, "num_tokens": 1913303.0, "step": 595 }, { "entropy": 8.172107124328614, "epoch": 1.1978021978021978, "grad_norm": 1.09375, "learning_rate": 0.0002995, "loss": 7.8345, "mean_token_accuracy": 0.11005568951368332, "num_tokens": 1928906.0, "step": 600 }, { "entropy": 8.24223837852478, "epoch": 1.2077922077922079, "grad_norm": 0.90625, "learning_rate": 0.000302, "loss": 7.9028, "mean_token_accuracy": 0.10041624084115028, "num_tokens": 1944823.0, "step": 605 }, { "entropy": 8.156695556640624, "epoch": 1.2177822177822177, "grad_norm": 0.9296875, "learning_rate": 0.0003045, "loss": 7.8661, "mean_token_accuracy": 0.10058502033352852, "num_tokens": 1960538.0, "step": 610 }, { "entropy": 8.20977144241333, "epoch": 1.2277722277722278, "grad_norm": 0.92578125, "learning_rate": 0.000307, "loss": 7.8367, "mean_token_accuracy": 0.09877868816256523, "num_tokens": 1979509.0, "step": 615 }, { "entropy": 8.162244510650634, "epoch": 1.2377622377622377, "grad_norm": 0.8515625, "learning_rate": 0.0003095, "loss": 7.7884, "mean_token_accuracy": 0.10074753984808922, "num_tokens": 1995113.0, "step": 620 }, { "entropy": 8.172338390350342, "epoch": 1.2477522477522478, "grad_norm": 0.85546875, "learning_rate": 0.000312, "loss": 7.7659, "mean_token_accuracy": 0.10919720381498337, "num_tokens": 2010212.0, "step": 625 }, { "entropy": 8.09831461906433, "epoch": 1.2577422577422577, "grad_norm": 0.94921875, "learning_rate": 0.0003145, "loss": 7.8129, "mean_token_accuracy": 0.10691071450710296, "num_tokens": 2027483.0, "step": 630 }, { "entropy": 8.133178567886352, "epoch": 1.2677322677322678, "grad_norm": 0.79296875, "learning_rate": 0.000317, "loss": 7.7896, "mean_token_accuracy": 0.10240155979990959, "num_tokens": 2043897.0, "step": 635 }, { "entropy": 8.285891056060791, "epoch": 1.2777222777222776, "grad_norm": 0.78515625, "learning_rate": 0.0003195, "loss": 7.8684, "mean_token_accuracy": 0.0982455164194107, "num_tokens": 2061645.0, "step": 640 }, { "entropy": 8.103964185714721, "epoch": 1.2877122877122877, "grad_norm": 0.984375, "learning_rate": 0.000322, "loss": 7.8364, "mean_token_accuracy": 0.10459044799208642, "num_tokens": 2077751.0, "step": 645 }, { "entropy": 8.161087036132812, "epoch": 1.2977022977022976, "grad_norm": 0.78515625, "learning_rate": 0.00032450000000000003, "loss": 7.8622, "mean_token_accuracy": 0.09868591278791428, "num_tokens": 2093853.0, "step": 650 }, { "entropy": 8.170791816711425, "epoch": 1.3076923076923077, "grad_norm": 0.88671875, "learning_rate": 0.00032700000000000003, "loss": 7.8347, "mean_token_accuracy": 0.09927802458405495, "num_tokens": 2110151.0, "step": 655 }, { "entropy": 8.192026901245118, "epoch": 1.3176823176823178, "grad_norm": 1.1953125, "learning_rate": 0.00032950000000000004, "loss": 7.7538, "mean_token_accuracy": 0.09446207582950591, "num_tokens": 2125584.0, "step": 660 }, { "entropy": 8.104029846191406, "epoch": 1.3276723276723277, "grad_norm": 0.93359375, "learning_rate": 0.00033200000000000005, "loss": 7.7273, "mean_token_accuracy": 0.10806782469153405, "num_tokens": 2142247.0, "step": 665 }, { "entropy": 8.061339807510375, "epoch": 1.3376623376623376, "grad_norm": 1.203125, "learning_rate": 0.00033450000000000005, "loss": 7.6168, "mean_token_accuracy": 0.10972020626068116, "num_tokens": 2159116.0, "step": 670 }, { "entropy": 8.102464294433593, "epoch": 1.3476523476523476, "grad_norm": 0.84375, "learning_rate": 0.000337, "loss": 7.7746, "mean_token_accuracy": 0.09734337553381919, "num_tokens": 2175237.0, "step": 675 }, { "entropy": 8.079360914230346, "epoch": 1.3576423576423577, "grad_norm": 0.88671875, "learning_rate": 0.0003395, "loss": 7.7702, "mean_token_accuracy": 0.10102465003728867, "num_tokens": 2191108.0, "step": 680 }, { "entropy": 8.009714221954345, "epoch": 1.3676323676323676, "grad_norm": 1.140625, "learning_rate": 0.000342, "loss": 7.6556, "mean_token_accuracy": 0.10901543200016021, "num_tokens": 2207404.0, "step": 685 }, { "entropy": 8.017986679077149, "epoch": 1.3776223776223775, "grad_norm": 0.859375, "learning_rate": 0.00034449999999999997, "loss": 7.7225, "mean_token_accuracy": 0.11000798493623734, "num_tokens": 2223891.0, "step": 690 }, { "entropy": 8.004034423828125, "epoch": 1.3876123876123876, "grad_norm": 0.828125, "learning_rate": 0.000347, "loss": 7.688, "mean_token_accuracy": 0.10737730488181114, "num_tokens": 2239750.0, "step": 695 }, { "entropy": 8.089302206039429, "epoch": 1.3976023976023977, "grad_norm": 0.9765625, "learning_rate": 0.0003495, "loss": 7.7918, "mean_token_accuracy": 0.09848668947815895, "num_tokens": 2254475.0, "step": 700 }, { "entropy": 8.038819551467896, "epoch": 1.4075924075924076, "grad_norm": 0.8828125, "learning_rate": 0.000352, "loss": 7.7412, "mean_token_accuracy": 0.10036000534892082, "num_tokens": 2270403.0, "step": 705 }, { "entropy": 8.05772099494934, "epoch": 1.4175824175824177, "grad_norm": 0.82421875, "learning_rate": 0.0003545, "loss": 7.7231, "mean_token_accuracy": 0.10787450224161148, "num_tokens": 2287440.0, "step": 710 }, { "entropy": 8.031018495559692, "epoch": 1.4275724275724275, "grad_norm": 1.0703125, "learning_rate": 0.000357, "loss": 7.5935, "mean_token_accuracy": 0.11669361963868141, "num_tokens": 2303606.0, "step": 715 }, { "entropy": 8.10855507850647, "epoch": 1.4375624375624376, "grad_norm": 0.984375, "learning_rate": 0.0003595, "loss": 7.7629, "mean_token_accuracy": 0.09718288779258728, "num_tokens": 2320304.0, "step": 720 }, { "entropy": 8.033062314987182, "epoch": 1.4475524475524475, "grad_norm": 0.87109375, "learning_rate": 0.000362, "loss": 7.7269, "mean_token_accuracy": 0.10353609770536423, "num_tokens": 2335449.0, "step": 725 }, { "entropy": 7.98488302230835, "epoch": 1.4575424575424576, "grad_norm": 0.7890625, "learning_rate": 0.0003645, "loss": 7.7298, "mean_token_accuracy": 0.1053438015282154, "num_tokens": 2350286.0, "step": 730 }, { "entropy": 8.084484529495239, "epoch": 1.4675324675324675, "grad_norm": 0.83984375, "learning_rate": 0.000367, "loss": 7.6562, "mean_token_accuracy": 0.10364222973585129, "num_tokens": 2367174.0, "step": 735 }, { "entropy": 7.979038953781128, "epoch": 1.4775224775224776, "grad_norm": 0.8671875, "learning_rate": 0.0003695, "loss": 7.744, "mean_token_accuracy": 0.09835705384612084, "num_tokens": 2383379.0, "step": 740 }, { "entropy": 7.950644826889038, "epoch": 1.4875124875124874, "grad_norm": 0.859375, "learning_rate": 0.000372, "loss": 7.6674, "mean_token_accuracy": 0.10948423892259598, "num_tokens": 2400055.0, "step": 745 }, { "entropy": 7.948536825180054, "epoch": 1.4975024975024975, "grad_norm": 0.83203125, "learning_rate": 0.0003745, "loss": 7.7088, "mean_token_accuracy": 0.104210115224123, "num_tokens": 2415445.0, "step": 750 }, { "entropy": 8.104103422164917, "epoch": 1.5074925074925076, "grad_norm": 0.9765625, "learning_rate": 0.000377, "loss": 7.6183, "mean_token_accuracy": 0.1110638789832592, "num_tokens": 2431633.0, "step": 755 }, { "entropy": 7.9167121887207035, "epoch": 1.5174825174825175, "grad_norm": 1.1875, "learning_rate": 0.0003795, "loss": 7.6556, "mean_token_accuracy": 0.10475207418203354, "num_tokens": 2448053.0, "step": 760 }, { "entropy": 8.011196660995484, "epoch": 1.5274725274725274, "grad_norm": 0.80859375, "learning_rate": 0.000382, "loss": 7.7603, "mean_token_accuracy": 0.10242786332964897, "num_tokens": 2464962.0, "step": 765 }, { "entropy": 7.854190301895142, "epoch": 1.5374625374625375, "grad_norm": 0.8828125, "learning_rate": 0.0003845, "loss": 7.6527, "mean_token_accuracy": 0.10968720018863679, "num_tokens": 2481728.0, "step": 770 }, { "entropy": 7.93970217704773, "epoch": 1.5474525474525476, "grad_norm": 0.84765625, "learning_rate": 0.00038700000000000003, "loss": 7.6644, "mean_token_accuracy": 0.10697980225086212, "num_tokens": 2498249.0, "step": 775 }, { "entropy": 7.971722221374511, "epoch": 1.5574425574425574, "grad_norm": 0.98828125, "learning_rate": 0.00038950000000000003, "loss": 7.6869, "mean_token_accuracy": 0.10662917494773864, "num_tokens": 2512832.0, "step": 780 }, { "entropy": 8.0352463722229, "epoch": 1.5674325674325673, "grad_norm": 0.734375, "learning_rate": 0.00039200000000000004, "loss": 7.8105, "mean_token_accuracy": 0.09663845226168633, "num_tokens": 2530065.0, "step": 785 }, { "entropy": 7.965973043441773, "epoch": 1.5774225774225774, "grad_norm": 0.8359375, "learning_rate": 0.00039450000000000005, "loss": 7.6293, "mean_token_accuracy": 0.1142218291759491, "num_tokens": 2546812.0, "step": 790 }, { "entropy": 7.914030504226685, "epoch": 1.5874125874125875, "grad_norm": 0.76171875, "learning_rate": 0.00039700000000000005, "loss": 7.5985, "mean_token_accuracy": 0.10844378024339676, "num_tokens": 2562955.0, "step": 795 }, { "entropy": 7.9991395473480225, "epoch": 1.5974025974025974, "grad_norm": 0.92578125, "learning_rate": 0.0003995, "loss": 7.636, "mean_token_accuracy": 0.10216034278273582, "num_tokens": 2577644.0, "step": 800 }, { "entropy": 7.804229784011841, "epoch": 1.6073926073926073, "grad_norm": 0.8515625, "learning_rate": 0.000402, "loss": 7.479, "mean_token_accuracy": 0.11868006139993667, "num_tokens": 2592888.0, "step": 805 }, { "entropy": 7.826851224899292, "epoch": 1.6173826173826173, "grad_norm": 0.828125, "learning_rate": 0.0004045, "loss": 7.5642, "mean_token_accuracy": 0.10893830135464669, "num_tokens": 2610352.0, "step": 810 }, { "entropy": 7.878586292266846, "epoch": 1.6273726273726274, "grad_norm": 0.90625, "learning_rate": 0.00040699999999999997, "loss": 7.5595, "mean_token_accuracy": 0.10943539440631866, "num_tokens": 2626850.0, "step": 815 }, { "entropy": 7.843348503112793, "epoch": 1.6373626373626373, "grad_norm": 0.90234375, "learning_rate": 0.0004095, "loss": 7.6166, "mean_token_accuracy": 0.10784812793135642, "num_tokens": 2642483.0, "step": 820 }, { "entropy": 7.896633672714233, "epoch": 1.6473526473526472, "grad_norm": 0.75390625, "learning_rate": 0.000412, "loss": 7.6682, "mean_token_accuracy": 0.10058582201600075, "num_tokens": 2658801.0, "step": 825 }, { "entropy": 7.992334079742432, "epoch": 1.6573426573426573, "grad_norm": 0.84765625, "learning_rate": 0.0004145, "loss": 7.6181, "mean_token_accuracy": 0.10562084466218949, "num_tokens": 2674320.0, "step": 830 }, { "entropy": 7.871245288848877, "epoch": 1.6673326673326674, "grad_norm": 0.84765625, "learning_rate": 0.000417, "loss": 7.5569, "mean_token_accuracy": 0.1130405493080616, "num_tokens": 2691468.0, "step": 835 }, { "entropy": 7.854435968399048, "epoch": 1.6773226773226773, "grad_norm": 0.8515625, "learning_rate": 0.0004195, "loss": 7.6132, "mean_token_accuracy": 0.10280844122171402, "num_tokens": 2707795.0, "step": 840 }, { "entropy": 7.798345613479614, "epoch": 1.6873126873126874, "grad_norm": 0.82421875, "learning_rate": 0.000422, "loss": 7.4358, "mean_token_accuracy": 0.12156035900115966, "num_tokens": 2725406.0, "step": 845 }, { "entropy": 7.71482892036438, "epoch": 1.6973026973026974, "grad_norm": 0.9453125, "learning_rate": 0.0004245, "loss": 7.487, "mean_token_accuracy": 0.11422280594706535, "num_tokens": 2741080.0, "step": 850 }, { "entropy": 8.022317790985108, "epoch": 1.7072927072927073, "grad_norm": 0.87890625, "learning_rate": 0.000427, "loss": 7.6872, "mean_token_accuracy": 0.10234800577163697, "num_tokens": 2758052.0, "step": 855 }, { "entropy": 7.710728740692138, "epoch": 1.7172827172827172, "grad_norm": 0.859375, "learning_rate": 0.0004295, "loss": 7.5718, "mean_token_accuracy": 0.10922266095876694, "num_tokens": 2775414.0, "step": 860 }, { "entropy": 7.858629941940308, "epoch": 1.7272727272727273, "grad_norm": 0.9296875, "learning_rate": 0.000432, "loss": 7.6087, "mean_token_accuracy": 0.10396021082997323, "num_tokens": 2792333.0, "step": 865 }, { "entropy": 7.944055700302124, "epoch": 1.7372627372627374, "grad_norm": 0.8046875, "learning_rate": 0.0004345, "loss": 7.7243, "mean_token_accuracy": 0.10027192905545235, "num_tokens": 2807792.0, "step": 870 }, { "entropy": 7.910960578918457, "epoch": 1.7472527472527473, "grad_norm": 0.86328125, "learning_rate": 0.000437, "loss": 7.6288, "mean_token_accuracy": 0.10449600145220757, "num_tokens": 2823819.0, "step": 875 }, { "entropy": 7.87107138633728, "epoch": 1.7572427572427571, "grad_norm": 0.8671875, "learning_rate": 0.0004395, "loss": 7.6212, "mean_token_accuracy": 0.10314707756042481, "num_tokens": 2840026.0, "step": 880 }, { "entropy": 7.746200895309448, "epoch": 1.7672327672327672, "grad_norm": 0.765625, "learning_rate": 0.000442, "loss": 7.4546, "mean_token_accuracy": 0.11674722135066987, "num_tokens": 2857041.0, "step": 885 }, { "entropy": 7.842999696731567, "epoch": 1.7772227772227773, "grad_norm": 0.82421875, "learning_rate": 0.0004445, "loss": 7.5113, "mean_token_accuracy": 0.11269463673233986, "num_tokens": 2871815.0, "step": 890 }, { "entropy": 7.798826599121094, "epoch": 1.7872127872127872, "grad_norm": 0.92578125, "learning_rate": 0.000447, "loss": 7.5082, "mean_token_accuracy": 0.1110450305044651, "num_tokens": 2888902.0, "step": 895 }, { "entropy": 7.773666000366211, "epoch": 1.797202797202797, "grad_norm": 0.921875, "learning_rate": 0.00044950000000000003, "loss": 7.5503, "mean_token_accuracy": 0.10609947964549064, "num_tokens": 2905536.0, "step": 900 }, { "entropy": 7.787226724624634, "epoch": 1.8071928071928072, "grad_norm": 0.79296875, "learning_rate": 0.00045200000000000004, "loss": 7.5587, "mean_token_accuracy": 0.11197240501642228, "num_tokens": 2922542.0, "step": 905 }, { "entropy": 7.839496898651123, "epoch": 1.8171828171828173, "grad_norm": 0.859375, "learning_rate": 0.00045450000000000004, "loss": 7.5326, "mean_token_accuracy": 0.11128943562507629, "num_tokens": 2937418.0, "step": 910 }, { "entropy": 7.7856128215789795, "epoch": 1.8271728271728271, "grad_norm": 0.77734375, "learning_rate": 0.00045700000000000005, "loss": 7.5355, "mean_token_accuracy": 0.10546828433871269, "num_tokens": 2953989.0, "step": 915 }, { "entropy": 7.75637378692627, "epoch": 1.837162837162837, "grad_norm": 0.87109375, "learning_rate": 0.00045950000000000006, "loss": 7.5363, "mean_token_accuracy": 0.10771389603614807, "num_tokens": 2970438.0, "step": 920 }, { "entropy": 7.8310833930969235, "epoch": 1.847152847152847, "grad_norm": 0.90234375, "learning_rate": 0.000462, "loss": 7.5979, "mean_token_accuracy": 0.10760430172085762, "num_tokens": 2986349.0, "step": 925 }, { "entropy": 7.7756389617919925, "epoch": 1.8571428571428572, "grad_norm": 0.8046875, "learning_rate": 0.0004645, "loss": 7.5186, "mean_token_accuracy": 0.10492026805877686, "num_tokens": 3002199.0, "step": 930 }, { "entropy": 7.850647354125977, "epoch": 1.867132867132867, "grad_norm": 0.890625, "learning_rate": 0.000467, "loss": 7.574, "mean_token_accuracy": 0.10573839843273163, "num_tokens": 3019724.0, "step": 935 }, { "entropy": 7.758398199081421, "epoch": 1.8771228771228772, "grad_norm": 1.75, "learning_rate": 0.0004695, "loss": 7.4861, "mean_token_accuracy": 0.11178312376141548, "num_tokens": 3036033.0, "step": 940 }, { "entropy": 7.733203649520874, "epoch": 1.8871128871128873, "grad_norm": 0.84765625, "learning_rate": 0.000472, "loss": 7.5057, "mean_token_accuracy": 0.10797822251915931, "num_tokens": 3050535.0, "step": 945 }, { "entropy": 7.606766033172607, "epoch": 1.8971028971028971, "grad_norm": 0.83984375, "learning_rate": 0.0004745, "loss": 7.4241, "mean_token_accuracy": 0.11418468505144119, "num_tokens": 3067487.0, "step": 950 }, { "entropy": 7.811316347122192, "epoch": 1.907092907092907, "grad_norm": 0.78125, "learning_rate": 0.000477, "loss": 7.4817, "mean_token_accuracy": 0.11279602721333504, "num_tokens": 3083368.0, "step": 955 }, { "entropy": 7.764263772964478, "epoch": 1.9170829170829171, "grad_norm": 0.8515625, "learning_rate": 0.0004795, "loss": 7.5884, "mean_token_accuracy": 0.0996214747428894, "num_tokens": 3100158.0, "step": 960 }, { "entropy": 7.664905261993408, "epoch": 1.9270729270729272, "grad_norm": 0.84375, "learning_rate": 0.000482, "loss": 7.3969, "mean_token_accuracy": 0.11512965932488442, "num_tokens": 3115996.0, "step": 965 }, { "entropy": 7.791405916213989, "epoch": 1.937062937062937, "grad_norm": 0.8203125, "learning_rate": 0.0004845, "loss": 7.5496, "mean_token_accuracy": 0.10718825981020927, "num_tokens": 3133485.0, "step": 970 }, { "entropy": 7.791155099868774, "epoch": 1.947052947052947, "grad_norm": 0.80859375, "learning_rate": 0.000487, "loss": 7.5339, "mean_token_accuracy": 0.10318816006183625, "num_tokens": 3149142.0, "step": 975 }, { "entropy": 7.657593297958374, "epoch": 1.957042957042957, "grad_norm": 0.85546875, "learning_rate": 0.0004895, "loss": 7.4259, "mean_token_accuracy": 0.10956193283200263, "num_tokens": 3166372.0, "step": 980 }, { "entropy": 7.687391233444214, "epoch": 1.9670329670329672, "grad_norm": 0.859375, "learning_rate": 0.000492, "loss": 7.468, "mean_token_accuracy": 0.10778944343328475, "num_tokens": 3183178.0, "step": 985 }, { "entropy": 7.7009885787963865, "epoch": 1.977022977022977, "grad_norm": 0.8046875, "learning_rate": 0.0004945, "loss": 7.4464, "mean_token_accuracy": 0.10527636632323265, "num_tokens": 3198857.0, "step": 990 }, { "entropy": 7.761457204818726, "epoch": 1.987012987012987, "grad_norm": 0.9765625, "learning_rate": 0.000497, "loss": 7.5091, "mean_token_accuracy": 0.10296362712979316, "num_tokens": 3214704.0, "step": 995 }, { "entropy": 7.7881145000457765, "epoch": 1.997002997002997, "grad_norm": 0.8671875, "learning_rate": 0.0004995, "loss": 7.5984, "mean_token_accuracy": 0.10085872560739517, "num_tokens": 3230647.0, "step": 1000 }, { "epoch": 1.997002997002997, "eval_entropy": 7.486649680782008, "eval_loss": 7.484090328216553, "eval_mean_token_accuracy": 0.10077464044899553, "eval_num_tokens": 3230647.0, "eval_runtime": 1.1798, "eval_samples_per_second": 1249.323, "eval_steps_per_second": 156.801, "step": 1000 } ], "logging_steps": 5, "max_steps": 5000, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 651511770071040.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }