{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.999000999000999, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.74254903793335, "epoch": 0.00999000999000999, "grad_norm": 4.6875, "learning_rate": 2e-06, "loss": 10.8409, "mean_token_accuracy": 0.00010789126390591264, "num_tokens": 17348.0, "step": 5 }, { "entropy": 10.742575931549073, "epoch": 0.01998001998001998, "grad_norm": 5.28125, "learning_rate": 4.5e-06, "loss": 10.8325, "mean_token_accuracy": 6.410256610251963e-05, "num_tokens": 33613.0, "step": 10 }, { "entropy": 10.742553329467773, "epoch": 0.029970029970029972, "grad_norm": 5.0625, "learning_rate": 7e-06, "loss": 10.8012, "mean_token_accuracy": 0.00016108142444863914, "num_tokens": 49416.0, "step": 15 }, { "entropy": 10.742562675476075, "epoch": 0.03996003996003996, "grad_norm": 5.0625, "learning_rate": 9.5e-06, "loss": 10.7438, "mean_token_accuracy": 0.0010525182529818266, "num_tokens": 64663.0, "step": 20 }, { "entropy": 10.742408943176269, "epoch": 0.04995004995004995, "grad_norm": 4.75, "learning_rate": 1.2e-05, "loss": 10.6283, "mean_token_accuracy": 0.03072175462730229, "num_tokens": 79972.0, "step": 25 }, { "entropy": 10.74140043258667, "epoch": 0.059940059940059943, "grad_norm": 4.0, "learning_rate": 1.4500000000000002e-05, "loss": 10.5246, "mean_token_accuracy": 0.05747625604271889, "num_tokens": 96254.0, "step": 30 }, { "entropy": 10.735374069213867, "epoch": 0.06993006993006994, "grad_norm": 2.875, "learning_rate": 1.7000000000000003e-05, "loss": 10.3755, "mean_token_accuracy": 0.06859578937292099, "num_tokens": 112713.0, "step": 35 }, { "entropy": 10.707574653625489, "epoch": 0.07992007992007992, "grad_norm": 2.28125, "learning_rate": 1.95e-05, "loss": 10.1924, "mean_token_accuracy": 0.06884920224547386, "num_tokens": 128259.0, "step": 40 }, { "entropy": 10.654945564270019, "epoch": 0.0899100899100899, "grad_norm": 2.046875, "learning_rate": 2.2e-05, "loss": 10.1434, "mean_token_accuracy": 0.06479340717196465, "num_tokens": 145521.0, "step": 45 }, { "entropy": 10.624096393585205, "epoch": 0.0999000999000999, "grad_norm": 1.7734375, "learning_rate": 2.4500000000000003e-05, "loss": 10.0779, "mean_token_accuracy": 0.06704385466873646, "num_tokens": 162665.0, "step": 50 }, { "entropy": 10.62326774597168, "epoch": 0.10989010989010989, "grad_norm": 1.796875, "learning_rate": 2.7e-05, "loss": 10.0119, "mean_token_accuracy": 0.06695662550628186, "num_tokens": 178901.0, "step": 55 }, { "entropy": 10.61907787322998, "epoch": 0.11988011988011989, "grad_norm": 1.7421875, "learning_rate": 2.95e-05, "loss": 9.9679, "mean_token_accuracy": 0.06775063388049603, "num_tokens": 194617.0, "step": 60 }, { "entropy": 10.605632114410401, "epoch": 0.12987012987012986, "grad_norm": 1.7109375, "learning_rate": 3.2e-05, "loss": 9.8939, "mean_token_accuracy": 0.07534115239977837, "num_tokens": 209675.0, "step": 65 }, { "entropy": 10.59527235031128, "epoch": 0.13986013986013987, "grad_norm": 2.0, "learning_rate": 3.4500000000000005e-05, "loss": 9.8733, "mean_token_accuracy": 0.07048867233097553, "num_tokens": 225848.0, "step": 70 }, { "entropy": 10.599591922760009, "epoch": 0.14985014985014986, "grad_norm": 1.796875, "learning_rate": 3.7e-05, "loss": 9.8167, "mean_token_accuracy": 0.07247593812644482, "num_tokens": 242981.0, "step": 75 }, { "entropy": 10.579588508605957, "epoch": 0.15984015984015984, "grad_norm": 1.546875, "learning_rate": 3.95e-05, "loss": 9.7625, "mean_token_accuracy": 0.07427209392189979, "num_tokens": 258173.0, "step": 80 }, { "entropy": 10.544640350341798, "epoch": 0.16983016983016982, "grad_norm": 1.6484375, "learning_rate": 4.2000000000000004e-05, "loss": 9.69, "mean_token_accuracy": 0.07245487086474896, "num_tokens": 273570.0, "step": 85 }, { "entropy": 10.5300874710083, "epoch": 0.1798201798201798, "grad_norm": 1.5625, "learning_rate": 4.45e-05, "loss": 9.6529, "mean_token_accuracy": 0.07408605217933655, "num_tokens": 290549.0, "step": 90 }, { "entropy": 10.528420066833496, "epoch": 0.18981018981018982, "grad_norm": 1.5390625, "learning_rate": 4.7000000000000004e-05, "loss": 9.6194, "mean_token_accuracy": 0.07625656872987747, "num_tokens": 306856.0, "step": 95 }, { "entropy": 10.485299491882325, "epoch": 0.1998001998001998, "grad_norm": 1.5234375, "learning_rate": 4.9500000000000004e-05, "loss": 9.5443, "mean_token_accuracy": 0.08020635470747947, "num_tokens": 322515.0, "step": 100 }, { "entropy": 10.434676933288575, "epoch": 0.2097902097902098, "grad_norm": 1.609375, "learning_rate": 5.2e-05, "loss": 9.4966, "mean_token_accuracy": 0.07586914226412773, "num_tokens": 337941.0, "step": 105 }, { "entropy": 10.45520372390747, "epoch": 0.21978021978021978, "grad_norm": 1.546875, "learning_rate": 5.45e-05, "loss": 9.4232, "mean_token_accuracy": 0.08006052449345588, "num_tokens": 353788.0, "step": 110 }, { "entropy": 10.380233097076417, "epoch": 0.22977022977022976, "grad_norm": 1.6015625, "learning_rate": 5.7e-05, "loss": 9.3782, "mean_token_accuracy": 0.08523525297641754, "num_tokens": 371012.0, "step": 115 }, { "entropy": 10.3286771774292, "epoch": 0.23976023976023977, "grad_norm": 1.765625, "learning_rate": 5.9499999999999996e-05, "loss": 9.2336, "mean_token_accuracy": 0.08941392749547958, "num_tokens": 387063.0, "step": 120 }, { "entropy": 10.305299186706543, "epoch": 0.24975024975024976, "grad_norm": 1.203125, "learning_rate": 6.2e-05, "loss": 9.2413, "mean_token_accuracy": 0.08080004155635834, "num_tokens": 404360.0, "step": 125 }, { "entropy": 10.245867156982422, "epoch": 0.2597402597402597, "grad_norm": 2.0625, "learning_rate": 6.450000000000001e-05, "loss": 9.0529, "mean_token_accuracy": 0.09887080416083335, "num_tokens": 421267.0, "step": 130 }, { "entropy": 10.113175201416016, "epoch": 0.26973026973026976, "grad_norm": 1.0390625, "learning_rate": 6.7e-05, "loss": 9.0745, "mean_token_accuracy": 0.0869515560567379, "num_tokens": 438900.0, "step": 135 }, { "entropy": 10.11645679473877, "epoch": 0.27972027972027974, "grad_norm": 1.2421875, "learning_rate": 6.950000000000001e-05, "loss": 8.9962, "mean_token_accuracy": 0.08159712329506874, "num_tokens": 454580.0, "step": 140 }, { "entropy": 10.033879661560059, "epoch": 0.2897102897102897, "grad_norm": 0.9375, "learning_rate": 7.2e-05, "loss": 8.9364, "mean_token_accuracy": 0.082859006524086, "num_tokens": 470894.0, "step": 145 }, { "entropy": 9.949287033081054, "epoch": 0.2997002997002997, "grad_norm": 1.15625, "learning_rate": 7.45e-05, "loss": 8.8864, "mean_token_accuracy": 0.0842631220817566, "num_tokens": 487872.0, "step": 150 }, { "entropy": 9.799868774414062, "epoch": 0.3096903096903097, "grad_norm": 1.375, "learning_rate": 7.7e-05, "loss": 8.7141, "mean_token_accuracy": 0.09437366873025894, "num_tokens": 503899.0, "step": 155 }, { "entropy": 9.570561790466309, "epoch": 0.3196803196803197, "grad_norm": 0.83203125, "learning_rate": 7.950000000000001e-05, "loss": 8.6153, "mean_token_accuracy": 0.09862063378095627, "num_tokens": 519023.0, "step": 160 }, { "entropy": 9.580165386199951, "epoch": 0.32967032967032966, "grad_norm": 0.796875, "learning_rate": 8.2e-05, "loss": 8.6321, "mean_token_accuracy": 0.087054193764925, "num_tokens": 535424.0, "step": 165 }, { "entropy": 9.45827875137329, "epoch": 0.33966033966033965, "grad_norm": 0.83203125, "learning_rate": 8.450000000000001e-05, "loss": 8.6716, "mean_token_accuracy": 0.08567041307687759, "num_tokens": 552528.0, "step": 170 }, { "entropy": 9.326940536499023, "epoch": 0.34965034965034963, "grad_norm": 0.70703125, "learning_rate": 8.7e-05, "loss": 8.5523, "mean_token_accuracy": 0.08963110744953155, "num_tokens": 567149.0, "step": 175 }, { "entropy": 9.181477642059326, "epoch": 0.3596403596403596, "grad_norm": 0.8984375, "learning_rate": 8.95e-05, "loss": 8.5255, "mean_token_accuracy": 0.08932835683226585, "num_tokens": 582033.0, "step": 180 }, { "entropy": 9.184029483795166, "epoch": 0.3696303696303696, "grad_norm": 0.9921875, "learning_rate": 9.2e-05, "loss": 8.492, "mean_token_accuracy": 0.09364427700638771, "num_tokens": 598930.0, "step": 185 }, { "entropy": 9.105390739440917, "epoch": 0.37962037962037964, "grad_norm": 0.91015625, "learning_rate": 9.45e-05, "loss": 8.4764, "mean_token_accuracy": 0.08496234193444252, "num_tokens": 615859.0, "step": 190 }, { "entropy": 9.057480430603027, "epoch": 0.38961038961038963, "grad_norm": 0.66015625, "learning_rate": 9.7e-05, "loss": 8.4525, "mean_token_accuracy": 0.09097891747951507, "num_tokens": 631984.0, "step": 195 }, { "entropy": 8.931283473968506, "epoch": 0.3996003996003996, "grad_norm": 0.76171875, "learning_rate": 9.95e-05, "loss": 8.4712, "mean_token_accuracy": 0.09022903516888618, "num_tokens": 648599.0, "step": 200 }, { "entropy": 8.999445819854737, "epoch": 0.4095904095904096, "grad_norm": 0.75, "learning_rate": 0.000102, "loss": 8.5152, "mean_token_accuracy": 0.08909457549452782, "num_tokens": 666196.0, "step": 205 }, { "entropy": 8.872494792938232, "epoch": 0.4195804195804196, "grad_norm": 0.66015625, "learning_rate": 0.00010449999999999999, "loss": 8.4462, "mean_token_accuracy": 0.09361587092280388, "num_tokens": 682848.0, "step": 210 }, { "entropy": 8.852845001220704, "epoch": 0.42957042957042957, "grad_norm": 0.5703125, "learning_rate": 0.000107, "loss": 8.3932, "mean_token_accuracy": 0.0924599327147007, "num_tokens": 700324.0, "step": 215 }, { "entropy": 8.826492881774902, "epoch": 0.43956043956043955, "grad_norm": 0.6796875, "learning_rate": 0.0001095, "loss": 8.438, "mean_token_accuracy": 0.0906071975827217, "num_tokens": 715401.0, "step": 220 }, { "entropy": 8.716631221771241, "epoch": 0.44955044955044954, "grad_norm": 0.68359375, "learning_rate": 0.000112, "loss": 8.4143, "mean_token_accuracy": 0.09328261092305183, "num_tokens": 730372.0, "step": 225 }, { "entropy": 8.727209281921386, "epoch": 0.4595404595404595, "grad_norm": 0.796875, "learning_rate": 0.0001145, "loss": 8.3391, "mean_token_accuracy": 0.09173915013670922, "num_tokens": 745880.0, "step": 230 }, { "entropy": 8.743009567260742, "epoch": 0.4695304695304695, "grad_norm": 0.7265625, "learning_rate": 0.00011700000000000001, "loss": 8.3552, "mean_token_accuracy": 0.09261953458189964, "num_tokens": 761474.0, "step": 235 }, { "entropy": 8.669536972045899, "epoch": 0.47952047952047955, "grad_norm": 0.62890625, "learning_rate": 0.00011949999999999999, "loss": 8.3798, "mean_token_accuracy": 0.09077078998088836, "num_tokens": 776871.0, "step": 240 }, { "entropy": 8.689266204833984, "epoch": 0.48951048951048953, "grad_norm": 0.70703125, "learning_rate": 0.000122, "loss": 8.3659, "mean_token_accuracy": 0.09065382108092308, "num_tokens": 793506.0, "step": 245 }, { "entropy": 8.591617012023926, "epoch": 0.4995004995004995, "grad_norm": 0.68359375, "learning_rate": 0.0001245, "loss": 8.3325, "mean_token_accuracy": 0.09529750868678093, "num_tokens": 808366.0, "step": 250 }, { "entropy": 8.718113708496094, "epoch": 0.5094905094905094, "grad_norm": 0.765625, "learning_rate": 0.000127, "loss": 8.2646, "mean_token_accuracy": 0.10416125357151032, "num_tokens": 825461.0, "step": 255 }, { "entropy": 8.644307136535645, "epoch": 0.5194805194805194, "grad_norm": 0.65625, "learning_rate": 0.0001295, "loss": 8.3552, "mean_token_accuracy": 0.08870847970247268, "num_tokens": 840998.0, "step": 260 }, { "entropy": 8.638798427581786, "epoch": 0.5294705294705294, "grad_norm": 0.70703125, "learning_rate": 0.000132, "loss": 8.4149, "mean_token_accuracy": 0.08986097797751427, "num_tokens": 858383.0, "step": 265 }, { "entropy": 8.622299480438233, "epoch": 0.5394605394605395, "grad_norm": 0.703125, "learning_rate": 0.00013450000000000002, "loss": 8.3192, "mean_token_accuracy": 0.08967429846525192, "num_tokens": 873611.0, "step": 270 }, { "entropy": 8.645909023284911, "epoch": 0.5494505494505495, "grad_norm": 0.8046875, "learning_rate": 0.00013700000000000002, "loss": 8.2318, "mean_token_accuracy": 0.10625835433602333, "num_tokens": 889918.0, "step": 275 }, { "entropy": 8.576266384124756, "epoch": 0.5594405594405595, "grad_norm": 0.80859375, "learning_rate": 0.0001395, "loss": 8.2966, "mean_token_accuracy": 0.1017056480050087, "num_tokens": 906967.0, "step": 280 }, { "entropy": 8.678112125396728, "epoch": 0.5694305694305695, "grad_norm": 0.73828125, "learning_rate": 0.00014199999999999998, "loss": 8.3848, "mean_token_accuracy": 0.09247232899069786, "num_tokens": 922954.0, "step": 285 }, { "entropy": 8.666139221191406, "epoch": 0.5794205794205795, "grad_norm": 0.7734375, "learning_rate": 0.0001445, "loss": 8.3586, "mean_token_accuracy": 0.0921535387635231, "num_tokens": 938920.0, "step": 290 }, { "entropy": 8.631329917907715, "epoch": 0.5894105894105894, "grad_norm": 0.66796875, "learning_rate": 0.000147, "loss": 8.3734, "mean_token_accuracy": 0.0920196034014225, "num_tokens": 956301.0, "step": 295 }, { "entropy": 8.548529148101807, "epoch": 0.5994005994005994, "grad_norm": 0.8515625, "learning_rate": 0.0001495, "loss": 8.2358, "mean_token_accuracy": 0.09958092793822289, "num_tokens": 972454.0, "step": 300 }, { "entropy": 8.61522102355957, "epoch": 0.6093906093906094, "grad_norm": 0.703125, "learning_rate": 0.000152, "loss": 8.333, "mean_token_accuracy": 0.09208913743495942, "num_tokens": 987326.0, "step": 305 }, { "entropy": 8.584405994415283, "epoch": 0.6193806193806194, "grad_norm": 0.69921875, "learning_rate": 0.00015450000000000001, "loss": 8.2977, "mean_token_accuracy": 0.09532473459839821, "num_tokens": 1002448.0, "step": 310 }, { "entropy": 8.536137676239013, "epoch": 0.6293706293706294, "grad_norm": 0.69921875, "learning_rate": 0.000157, "loss": 8.3265, "mean_token_accuracy": 0.09180266484618187, "num_tokens": 1020348.0, "step": 315 }, { "entropy": 8.623396396636963, "epoch": 0.6393606393606394, "grad_norm": 0.7265625, "learning_rate": 0.0001595, "loss": 8.3499, "mean_token_accuracy": 0.08997747674584389, "num_tokens": 1036562.0, "step": 320 }, { "entropy": 8.528428745269775, "epoch": 0.6493506493506493, "grad_norm": 0.7734375, "learning_rate": 0.000162, "loss": 8.3187, "mean_token_accuracy": 0.09452675953507424, "num_tokens": 1053106.0, "step": 325 }, { "entropy": 8.570547008514405, "epoch": 0.6593406593406593, "grad_norm": 0.80078125, "learning_rate": 0.00016450000000000001, "loss": 8.2708, "mean_token_accuracy": 0.09287350997328758, "num_tokens": 1068277.0, "step": 330 }, { "entropy": 8.505113983154297, "epoch": 0.6693306693306693, "grad_norm": 0.7109375, "learning_rate": 0.00016700000000000002, "loss": 8.212, "mean_token_accuracy": 0.10472053438425064, "num_tokens": 1083887.0, "step": 335 }, { "entropy": 8.494814014434814, "epoch": 0.6793206793206793, "grad_norm": 0.65234375, "learning_rate": 0.00016950000000000003, "loss": 8.2264, "mean_token_accuracy": 0.0991443045437336, "num_tokens": 1099791.0, "step": 340 }, { "entropy": 8.513353157043458, "epoch": 0.6893106893106893, "grad_norm": 0.9140625, "learning_rate": 0.00017199999999999998, "loss": 8.2843, "mean_token_accuracy": 0.09210123345255852, "num_tokens": 1116137.0, "step": 345 }, { "entropy": 8.550718784332275, "epoch": 0.6993006993006993, "grad_norm": 0.77734375, "learning_rate": 0.00017449999999999999, "loss": 8.2293, "mean_token_accuracy": 0.10072905272245407, "num_tokens": 1132449.0, "step": 350 }, { "entropy": 8.527479457855225, "epoch": 0.7092907092907093, "grad_norm": 1.1171875, "learning_rate": 0.000177, "loss": 8.3552, "mean_token_accuracy": 0.09086157828569412, "num_tokens": 1148316.0, "step": 355 }, { "entropy": 8.505389308929443, "epoch": 0.7192807192807192, "grad_norm": 0.74609375, "learning_rate": 0.0001795, "loss": 8.2142, "mean_token_accuracy": 0.09256454855203629, "num_tokens": 1164030.0, "step": 360 }, { "entropy": 8.580228328704834, "epoch": 0.7292707292707292, "grad_norm": 0.87109375, "learning_rate": 0.000182, "loss": 8.3049, "mean_token_accuracy": 0.09622592777013779, "num_tokens": 1180624.0, "step": 365 }, { "entropy": 8.496176528930665, "epoch": 0.7392607392607392, "grad_norm": 0.8671875, "learning_rate": 0.0001845, "loss": 8.2815, "mean_token_accuracy": 0.09714617729187011, "num_tokens": 1196986.0, "step": 370 }, { "entropy": 8.580214786529542, "epoch": 0.7492507492507493, "grad_norm": 0.72265625, "learning_rate": 0.000187, "loss": 8.2919, "mean_token_accuracy": 0.09614738449454308, "num_tokens": 1212754.0, "step": 375 }, { "entropy": 8.44631586074829, "epoch": 0.7592407592407593, "grad_norm": 0.91015625, "learning_rate": 0.0001895, "loss": 8.2324, "mean_token_accuracy": 0.09536803364753724, "num_tokens": 1229627.0, "step": 380 }, { "entropy": 8.515226554870605, "epoch": 0.7692307692307693, "grad_norm": 1.1796875, "learning_rate": 0.000192, "loss": 8.1816, "mean_token_accuracy": 0.0967013455927372, "num_tokens": 1245127.0, "step": 385 }, { "entropy": 8.458242416381836, "epoch": 0.7792207792207793, "grad_norm": 0.8125, "learning_rate": 0.0001945, "loss": 8.2483, "mean_token_accuracy": 0.09477976039052009, "num_tokens": 1261438.0, "step": 390 }, { "entropy": 8.479850482940673, "epoch": 0.7892107892107892, "grad_norm": 0.734375, "learning_rate": 0.00019700000000000002, "loss": 8.2152, "mean_token_accuracy": 0.09673597514629365, "num_tokens": 1277476.0, "step": 395 }, { "entropy": 8.536440181732178, "epoch": 0.7992007992007992, "grad_norm": 0.76953125, "learning_rate": 0.00019950000000000002, "loss": 8.1608, "mean_token_accuracy": 0.09755991101264953, "num_tokens": 1294659.0, "step": 400 }, { "entropy": 8.371343421936036, "epoch": 0.8091908091908092, "grad_norm": 0.8203125, "learning_rate": 0.000202, "loss": 8.1319, "mean_token_accuracy": 0.10120925828814506, "num_tokens": 1308829.0, "step": 405 }, { "entropy": 8.464437866210938, "epoch": 0.8191808191808192, "grad_norm": 0.765625, "learning_rate": 0.00020449999999999998, "loss": 8.1896, "mean_token_accuracy": 0.10006042197346687, "num_tokens": 1325659.0, "step": 410 }, { "entropy": 8.507107639312744, "epoch": 0.8291708291708292, "grad_norm": 0.87890625, "learning_rate": 0.000207, "loss": 8.2255, "mean_token_accuracy": 0.09681524932384492, "num_tokens": 1341643.0, "step": 415 }, { "entropy": 8.446794795989991, "epoch": 0.8391608391608392, "grad_norm": 0.9140625, "learning_rate": 0.0002095, "loss": 8.197, "mean_token_accuracy": 0.09735974669456482, "num_tokens": 1359197.0, "step": 420 }, { "entropy": 8.502279472351074, "epoch": 0.8491508491508492, "grad_norm": 0.6796875, "learning_rate": 0.000212, "loss": 8.1875, "mean_token_accuracy": 0.09608993604779244, "num_tokens": 1376107.0, "step": 425 }, { "entropy": 8.477056503295898, "epoch": 0.8591408591408591, "grad_norm": 0.79296875, "learning_rate": 0.0002145, "loss": 8.2042, "mean_token_accuracy": 0.09094029515981675, "num_tokens": 1392232.0, "step": 430 }, { "entropy": 8.460865306854249, "epoch": 0.8691308691308691, "grad_norm": 0.83984375, "learning_rate": 0.00021700000000000002, "loss": 8.1631, "mean_token_accuracy": 0.09813632071018219, "num_tokens": 1406747.0, "step": 435 }, { "entropy": 8.48235101699829, "epoch": 0.8791208791208791, "grad_norm": 0.7890625, "learning_rate": 0.0002195, "loss": 8.1609, "mean_token_accuracy": 0.09457436800003052, "num_tokens": 1423599.0, "step": 440 }, { "entropy": 8.372987842559814, "epoch": 0.8891108891108891, "grad_norm": 1.1640625, "learning_rate": 0.000222, "loss": 8.091, "mean_token_accuracy": 0.1050879828631878, "num_tokens": 1439330.0, "step": 445 }, { "entropy": 8.440707111358643, "epoch": 0.8991008991008991, "grad_norm": 0.66015625, "learning_rate": 0.0002245, "loss": 8.0636, "mean_token_accuracy": 0.10564030036330223, "num_tokens": 1456660.0, "step": 450 }, { "entropy": 8.463158130645752, "epoch": 0.9090909090909091, "grad_norm": 0.77734375, "learning_rate": 0.00022700000000000002, "loss": 8.1173, "mean_token_accuracy": 0.10065716579556465, "num_tokens": 1471619.0, "step": 455 }, { "entropy": 8.29682149887085, "epoch": 0.919080919080919, "grad_norm": 0.90625, "learning_rate": 0.00022950000000000002, "loss": 8.0752, "mean_token_accuracy": 0.09712542369961738, "num_tokens": 1486971.0, "step": 460 }, { "entropy": 8.374618434906006, "epoch": 0.929070929070929, "grad_norm": 0.7890625, "learning_rate": 0.00023200000000000003, "loss": 8.1102, "mean_token_accuracy": 0.09521022215485572, "num_tokens": 1502923.0, "step": 465 }, { "entropy": 8.45193510055542, "epoch": 0.939060939060939, "grad_norm": 1.1015625, "learning_rate": 0.00023449999999999998, "loss": 8.1818, "mean_token_accuracy": 0.09111250266432762, "num_tokens": 1520214.0, "step": 470 }, { "entropy": 8.413396072387695, "epoch": 0.949050949050949, "grad_norm": 0.875, "learning_rate": 0.000237, "loss": 8.0682, "mean_token_accuracy": 0.10277181193232536, "num_tokens": 1534946.0, "step": 475 }, { "entropy": 8.293998527526856, "epoch": 0.9590409590409591, "grad_norm": 0.74609375, "learning_rate": 0.0002395, "loss": 7.9474, "mean_token_accuracy": 0.11179379150271415, "num_tokens": 1551823.0, "step": 480 }, { "entropy": 8.366506767272949, "epoch": 0.9690309690309691, "grad_norm": 0.98828125, "learning_rate": 0.000242, "loss": 8.0529, "mean_token_accuracy": 0.10311459228396416, "num_tokens": 1567354.0, "step": 485 }, { "entropy": 8.338885498046874, "epoch": 0.9790209790209791, "grad_norm": 1.109375, "learning_rate": 0.0002445, "loss": 8.0225, "mean_token_accuracy": 0.09862796664237976, "num_tokens": 1583749.0, "step": 490 }, { "entropy": 8.336707592010498, "epoch": 0.989010989010989, "grad_norm": 0.87890625, "learning_rate": 0.000247, "loss": 8.1258, "mean_token_accuracy": 0.09763901010155678, "num_tokens": 1599678.0, "step": 495 }, { "entropy": 8.445067310333252, "epoch": 0.999000999000999, "grad_norm": 0.99609375, "learning_rate": 0.0002495, "loss": 8.1224, "mean_token_accuracy": 0.0928703673183918, "num_tokens": 1616737.0, "step": 500 }, { "epoch": 0.999000999000999, "eval_entropy": 8.140788088618098, "eval_loss": 8.047406196594238, "eval_mean_token_accuracy": 0.09197118636724111, "eval_num_tokens": 1616737.0, "eval_runtime": 1.1978, "eval_samples_per_second": 1230.577, "eval_steps_per_second": 154.448, "step": 500 } ], "logging_steps": 5, "max_steps": 5000, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 325253177671680.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }