{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.0643583472776419, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742555713653564, "epoch": 0.00032179173638820956, "grad_norm": 4.59375, "learning_rate": 2e-06, "loss": 10.7932, "mean_token_accuracy": 9.85221704468131e-05, "num_tokens": 11506.0, "step": 5 }, { "entropy": 10.742585468292237, "epoch": 0.0006435834727764191, "grad_norm": 5.0, "learning_rate": 4.5e-06, "loss": 10.7664, "mean_token_accuracy": 7.942811935208738e-05, "num_tokens": 21973.0, "step": 10 }, { "entropy": 10.742585182189941, "epoch": 0.0009653752091646286, "grad_norm": 4.6875, "learning_rate": 7e-06, "loss": 10.7473, "mean_token_accuracy": 0.0, "num_tokens": 32763.0, "step": 15 }, { "entropy": 10.742647171020508, "epoch": 0.0012871669455528382, "grad_norm": 4.5, "learning_rate": 9.5e-06, "loss": 10.716, "mean_token_accuracy": 0.00042943707667291163, "num_tokens": 44354.0, "step": 20 }, { "entropy": 10.742597675323486, "epoch": 0.0016089586819410479, "grad_norm": 4.375, "learning_rate": 1.2e-05, "loss": 10.6219, "mean_token_accuracy": 0.0008890067110769451, "num_tokens": 56534.0, "step": 25 }, { "entropy": 10.74241762161255, "epoch": 0.0019307504183292573, "grad_norm": 3.859375, "learning_rate": 1.4500000000000002e-05, "loss": 10.4911, "mean_token_accuracy": 0.009375615860335529, "num_tokens": 67106.0, "step": 30 }, { "entropy": 10.741784954071045, "epoch": 0.002252542154717467, "grad_norm": 3.265625, "learning_rate": 1.7000000000000003e-05, "loss": 10.3831, "mean_token_accuracy": 0.021833056677132846, "num_tokens": 78801.0, "step": 35 }, { "entropy": 10.74044713973999, "epoch": 0.0025743338911056765, "grad_norm": 2.53125, "learning_rate": 1.95e-05, "loss": 10.2405, "mean_token_accuracy": 0.028899907879531384, "num_tokens": 90390.0, "step": 40 }, { "entropy": 10.738579750061035, "epoch": 0.002896125627493886, "grad_norm": 2.265625, "learning_rate": 2.2e-05, "loss": 10.1128, "mean_token_accuracy": 0.036285107396543025, "num_tokens": 101652.0, "step": 45 }, { "entropy": 10.737388038635254, "epoch": 0.0032179173638820957, "grad_norm": 2.0625, "learning_rate": 2.4500000000000003e-05, "loss": 10.0384, "mean_token_accuracy": 0.03730290364474058, "num_tokens": 112068.0, "step": 50 }, { "entropy": 10.737480354309081, "epoch": 0.003539709100270305, "grad_norm": 1.90625, "learning_rate": 2.7e-05, "loss": 10.0098, "mean_token_accuracy": 0.04103992246091366, "num_tokens": 123500.0, "step": 55 }, { "entropy": 10.736884212493896, "epoch": 0.0038615008366585145, "grad_norm": 1.9296875, "learning_rate": 2.95e-05, "loss": 9.9544, "mean_token_accuracy": 0.0359757786616683, "num_tokens": 134456.0, "step": 60 }, { "entropy": 10.7358078956604, "epoch": 0.004183292573046725, "grad_norm": 1.765625, "learning_rate": 3.2e-05, "loss": 9.9017, "mean_token_accuracy": 0.03450035620480776, "num_tokens": 146299.0, "step": 65 }, { "entropy": 10.734182739257813, "epoch": 0.004505084309434934, "grad_norm": 1.9375, "learning_rate": 3.4500000000000005e-05, "loss": 9.8076, "mean_token_accuracy": 0.037839466519653794, "num_tokens": 157494.0, "step": 70 }, { "entropy": 10.73177366256714, "epoch": 0.004826876045823143, "grad_norm": 1.7734375, "learning_rate": 3.7e-05, "loss": 9.7775, "mean_token_accuracy": 0.03611580468714237, "num_tokens": 168226.0, "step": 75 }, { "entropy": 10.728845882415772, "epoch": 0.005148667782211353, "grad_norm": 1.9296875, "learning_rate": 3.95e-05, "loss": 9.6556, "mean_token_accuracy": 0.04190883524715901, "num_tokens": 179311.0, "step": 80 }, { "entropy": 10.725195121765136, "epoch": 0.005470459518599562, "grad_norm": 1.7421875, "learning_rate": 4.2000000000000004e-05, "loss": 9.6267, "mean_token_accuracy": 0.043489571660757065, "num_tokens": 191513.0, "step": 85 }, { "entropy": 10.719332885742187, "epoch": 0.005792251254987772, "grad_norm": 1.8828125, "learning_rate": 4.45e-05, "loss": 9.5397, "mean_token_accuracy": 0.046276621893048285, "num_tokens": 204631.0, "step": 90 }, { "entropy": 10.710766220092774, "epoch": 0.006114042991375981, "grad_norm": 1.7578125, "learning_rate": 4.7000000000000004e-05, "loss": 9.4486, "mean_token_accuracy": 0.0460438147187233, "num_tokens": 215901.0, "step": 95 }, { "entropy": 10.69977626800537, "epoch": 0.0064358347277641914, "grad_norm": 1.8203125, "learning_rate": 4.9500000000000004e-05, "loss": 9.4013, "mean_token_accuracy": 0.044720832630991934, "num_tokens": 228928.0, "step": 100 }, { "entropy": 10.685317134857177, "epoch": 0.006757626464152401, "grad_norm": 1.765625, "learning_rate": 5.2e-05, "loss": 9.3138, "mean_token_accuracy": 0.044154060259461406, "num_tokens": 241543.0, "step": 105 }, { "entropy": 10.66606101989746, "epoch": 0.00707941820054061, "grad_norm": 1.8203125, "learning_rate": 5.45e-05, "loss": 9.1466, "mean_token_accuracy": 0.046302244812250135, "num_tokens": 253267.0, "step": 110 }, { "entropy": 10.636186695098877, "epoch": 0.00740120993692882, "grad_norm": 1.78125, "learning_rate": 5.7e-05, "loss": 9.0141, "mean_token_accuracy": 0.05802988223731518, "num_tokens": 264760.0, "step": 115 }, { "entropy": 10.5947696685791, "epoch": 0.007723001673317029, "grad_norm": 1.75, "learning_rate": 5.9499999999999996e-05, "loss": 8.9075, "mean_token_accuracy": 0.051640312373638156, "num_tokens": 275080.0, "step": 120 }, { "entropy": 10.542396450042725, "epoch": 0.008044793409705238, "grad_norm": 1.7109375, "learning_rate": 6.2e-05, "loss": 8.7919, "mean_token_accuracy": 0.05795170105993748, "num_tokens": 287114.0, "step": 125 }, { "entropy": 10.490421962738036, "epoch": 0.00836658514609345, "grad_norm": 1.6796875, "learning_rate": 6.450000000000001e-05, "loss": 8.6367, "mean_token_accuracy": 0.06025359183549881, "num_tokens": 298732.0, "step": 130 }, { "entropy": 10.417353057861328, "epoch": 0.008688376882481658, "grad_norm": 1.65625, "learning_rate": 6.7e-05, "loss": 8.4641, "mean_token_accuracy": 0.06998355574905872, "num_tokens": 310227.0, "step": 135 }, { "entropy": 10.32230224609375, "epoch": 0.009010168618869868, "grad_norm": 1.4765625, "learning_rate": 6.950000000000001e-05, "loss": 8.3943, "mean_token_accuracy": 0.06697470992803574, "num_tokens": 322724.0, "step": 140 }, { "entropy": 10.228569889068604, "epoch": 0.009331960355258077, "grad_norm": 1.4375, "learning_rate": 7.2e-05, "loss": 8.3137, "mean_token_accuracy": 0.06024596691131592, "num_tokens": 335638.0, "step": 145 }, { "entropy": 10.116732311248779, "epoch": 0.009653752091646286, "grad_norm": 1.453125, "learning_rate": 7.45e-05, "loss": 8.1548, "mean_token_accuracy": 0.07251053638756275, "num_tokens": 346751.0, "step": 150 }, { "entropy": 9.953464126586914, "epoch": 0.009975543828034497, "grad_norm": 1.3359375, "learning_rate": 7.7e-05, "loss": 8.0894, "mean_token_accuracy": 0.07281172573566437, "num_tokens": 357809.0, "step": 155 }, { "entropy": 9.77461576461792, "epoch": 0.010297335564422706, "grad_norm": 1.21875, "learning_rate": 7.950000000000001e-05, "loss": 7.9142, "mean_token_accuracy": 0.06864561475813388, "num_tokens": 369631.0, "step": 160 }, { "entropy": 9.603110790252686, "epoch": 0.010619127300810915, "grad_norm": 1.0390625, "learning_rate": 8.2e-05, "loss": 7.9575, "mean_token_accuracy": 0.06908577904105187, "num_tokens": 380904.0, "step": 165 }, { "entropy": 9.377412414550781, "epoch": 0.010940919037199124, "grad_norm": 1.125, "learning_rate": 8.450000000000001e-05, "loss": 7.7359, "mean_token_accuracy": 0.07545260861515998, "num_tokens": 392898.0, "step": 170 }, { "entropy": 9.168265438079834, "epoch": 0.011262710773587334, "grad_norm": 1.125, "learning_rate": 8.7e-05, "loss": 7.6702, "mean_token_accuracy": 0.07459548935294151, "num_tokens": 404285.0, "step": 175 }, { "entropy": 8.926816463470459, "epoch": 0.011584502509975544, "grad_norm": 1.0, "learning_rate": 8.95e-05, "loss": 7.5717, "mean_token_accuracy": 0.07761912979185581, "num_tokens": 416443.0, "step": 180 }, { "entropy": 8.745314025878907, "epoch": 0.011906294246363754, "grad_norm": 0.96875, "learning_rate": 9.2e-05, "loss": 7.6426, "mean_token_accuracy": 0.0765433344990015, "num_tokens": 426558.0, "step": 185 }, { "entropy": 8.587053394317627, "epoch": 0.012228085982751963, "grad_norm": 1.1796875, "learning_rate": 9.45e-05, "loss": 7.6648, "mean_token_accuracy": 0.07643079459667206, "num_tokens": 437794.0, "step": 190 }, { "entropy": 8.517185878753661, "epoch": 0.012549877719140172, "grad_norm": 1.0546875, "learning_rate": 9.7e-05, "loss": 7.4958, "mean_token_accuracy": 0.07788795456290246, "num_tokens": 448682.0, "step": 195 }, { "entropy": 8.376048374176026, "epoch": 0.012871669455528383, "grad_norm": 1.1640625, "learning_rate": 9.95e-05, "loss": 7.417, "mean_token_accuracy": 0.08175441175699234, "num_tokens": 459699.0, "step": 200 }, { "entropy": 8.276328945159912, "epoch": 0.013193461191916592, "grad_norm": 1.125, "learning_rate": 0.000102, "loss": 7.3537, "mean_token_accuracy": 0.08016520962119103, "num_tokens": 472857.0, "step": 205 }, { "entropy": 8.274100303649902, "epoch": 0.013515252928304801, "grad_norm": 1.0078125, "learning_rate": 0.00010449999999999999, "loss": 7.4194, "mean_token_accuracy": 0.08162855952978135, "num_tokens": 484983.0, "step": 210 }, { "entropy": 8.180224132537841, "epoch": 0.01383704466469301, "grad_norm": 0.99609375, "learning_rate": 0.000107, "loss": 7.3626, "mean_token_accuracy": 0.08450362831354141, "num_tokens": 495973.0, "step": 215 }, { "entropy": 8.187409973144531, "epoch": 0.01415883640108122, "grad_norm": 1.296875, "learning_rate": 0.0001095, "loss": 7.2816, "mean_token_accuracy": 0.090892593562603, "num_tokens": 507017.0, "step": 220 }, { "entropy": 8.120441341400147, "epoch": 0.01448062813746943, "grad_norm": 1.1875, "learning_rate": 0.000112, "loss": 7.36, "mean_token_accuracy": 0.08900276795029641, "num_tokens": 517522.0, "step": 225 }, { "entropy": 8.129059314727783, "epoch": 0.01480241987385764, "grad_norm": 1.015625, "learning_rate": 0.0001145, "loss": 7.3701, "mean_token_accuracy": 0.09131013453006745, "num_tokens": 528240.0, "step": 230 }, { "entropy": 7.994166135787964, "epoch": 0.015124211610245849, "grad_norm": 0.9765625, "learning_rate": 0.00011700000000000001, "loss": 7.328, "mean_token_accuracy": 0.0881452701985836, "num_tokens": 538875.0, "step": 235 }, { "entropy": 8.10927906036377, "epoch": 0.015446003346634058, "grad_norm": 1.109375, "learning_rate": 0.00011949999999999999, "loss": 7.3722, "mean_token_accuracy": 0.08998035714030266, "num_tokens": 549386.0, "step": 240 }, { "entropy": 8.068589448928833, "epoch": 0.015767795083022267, "grad_norm": 1.234375, "learning_rate": 0.000122, "loss": 7.3029, "mean_token_accuracy": 0.08936483487486839, "num_tokens": 559643.0, "step": 245 }, { "entropy": 8.049430751800537, "epoch": 0.016089586819410476, "grad_norm": 1.0546875, "learning_rate": 0.0001245, "loss": 7.2267, "mean_token_accuracy": 0.09506414234638214, "num_tokens": 570932.0, "step": 250 }, { "entropy": 7.93134560585022, "epoch": 0.016411378555798686, "grad_norm": 1.296875, "learning_rate": 0.000127, "loss": 7.2019, "mean_token_accuracy": 0.09725837931036949, "num_tokens": 580258.0, "step": 255 }, { "entropy": 7.893705558776856, "epoch": 0.0167331702921869, "grad_norm": 1.1953125, "learning_rate": 0.0001295, "loss": 7.1337, "mean_token_accuracy": 0.09558385238051414, "num_tokens": 590622.0, "step": 260 }, { "entropy": 7.884620428085327, "epoch": 0.017054962028575107, "grad_norm": 1.0859375, "learning_rate": 0.000132, "loss": 7.1827, "mean_token_accuracy": 0.09120650067925454, "num_tokens": 602202.0, "step": 265 }, { "entropy": 7.823669528961181, "epoch": 0.017376753764963317, "grad_norm": 1.0859375, "learning_rate": 0.00013450000000000002, "loss": 7.1309, "mean_token_accuracy": 0.0979801706969738, "num_tokens": 613864.0, "step": 270 }, { "entropy": 7.87017560005188, "epoch": 0.017698545501351526, "grad_norm": 0.99609375, "learning_rate": 0.00013700000000000002, "loss": 7.2524, "mean_token_accuracy": 0.09466890171170235, "num_tokens": 626884.0, "step": 275 }, { "entropy": 7.857308626174927, "epoch": 0.018020337237739735, "grad_norm": 1.4140625, "learning_rate": 0.0001395, "loss": 7.1612, "mean_token_accuracy": 0.09996400326490402, "num_tokens": 638418.0, "step": 280 }, { "entropy": 7.856085300445557, "epoch": 0.018342128974127944, "grad_norm": 1.125, "learning_rate": 0.00014199999999999998, "loss": 7.1939, "mean_token_accuracy": 0.09103256016969681, "num_tokens": 648376.0, "step": 285 }, { "entropy": 7.9166460037231445, "epoch": 0.018663920710516153, "grad_norm": 1.09375, "learning_rate": 0.0001445, "loss": 7.2464, "mean_token_accuracy": 0.09389530643820762, "num_tokens": 659268.0, "step": 290 }, { "entropy": 7.788627672195434, "epoch": 0.018985712446904363, "grad_norm": 1.03125, "learning_rate": 0.000147, "loss": 7.0223, "mean_token_accuracy": 0.10249627456068992, "num_tokens": 669736.0, "step": 295 }, { "entropy": 7.768741464614868, "epoch": 0.01930750418329257, "grad_norm": 1.0546875, "learning_rate": 0.0001495, "loss": 7.1198, "mean_token_accuracy": 0.0995169997215271, "num_tokens": 681571.0, "step": 300 }, { "entropy": 7.723494529724121, "epoch": 0.01962929591968078, "grad_norm": 0.9375, "learning_rate": 0.000152, "loss": 7.0189, "mean_token_accuracy": 0.10438807159662247, "num_tokens": 692816.0, "step": 305 }, { "entropy": 7.758736324310303, "epoch": 0.019951087656068994, "grad_norm": 1.078125, "learning_rate": 0.00015450000000000001, "loss": 7.1546, "mean_token_accuracy": 0.10238918289542198, "num_tokens": 705089.0, "step": 310 }, { "entropy": 7.666284465789795, "epoch": 0.020272879392457203, "grad_norm": 1.2734375, "learning_rate": 0.000157, "loss": 7.0252, "mean_token_accuracy": 0.10788851976394653, "num_tokens": 716874.0, "step": 315 }, { "entropy": 7.531011438369751, "epoch": 0.020594671128845412, "grad_norm": 1.171875, "learning_rate": 0.0001595, "loss": 6.9807, "mean_token_accuracy": 0.10204816684126854, "num_tokens": 728981.0, "step": 320 }, { "entropy": 7.782111930847168, "epoch": 0.02091646286523362, "grad_norm": 1.109375, "learning_rate": 0.000162, "loss": 7.0871, "mean_token_accuracy": 0.10574771091341972, "num_tokens": 739619.0, "step": 325 }, { "entropy": 7.599967575073242, "epoch": 0.02123825460162183, "grad_norm": 1.1640625, "learning_rate": 0.00016450000000000001, "loss": 7.0537, "mean_token_accuracy": 0.10123220011591912, "num_tokens": 751363.0, "step": 330 }, { "entropy": 7.667736959457398, "epoch": 0.02156004633801004, "grad_norm": 1.15625, "learning_rate": 0.00016700000000000002, "loss": 7.0722, "mean_token_accuracy": 0.10424386709928513, "num_tokens": 762953.0, "step": 335 }, { "entropy": 7.489533710479736, "epoch": 0.02188183807439825, "grad_norm": 1.1796875, "learning_rate": 0.00016950000000000003, "loss": 6.9886, "mean_token_accuracy": 0.10709020495414734, "num_tokens": 775237.0, "step": 340 }, { "entropy": 7.635052871704102, "epoch": 0.022203629810786458, "grad_norm": 1.109375, "learning_rate": 0.00017199999999999998, "loss": 6.9133, "mean_token_accuracy": 0.11272823959589004, "num_tokens": 786262.0, "step": 345 }, { "entropy": 7.458449077606201, "epoch": 0.022525421547174667, "grad_norm": 1.2265625, "learning_rate": 0.00017449999999999999, "loss": 6.9036, "mean_token_accuracy": 0.11083822324872017, "num_tokens": 797201.0, "step": 350 }, { "entropy": 7.504961967468262, "epoch": 0.02284721328356288, "grad_norm": 1.09375, "learning_rate": 0.000177, "loss": 6.8593, "mean_token_accuracy": 0.11371754407882691, "num_tokens": 807671.0, "step": 355 }, { "entropy": 7.4689586639404295, "epoch": 0.02316900501995109, "grad_norm": 1.1015625, "learning_rate": 0.0001795, "loss": 6.8925, "mean_token_accuracy": 0.109658332914114, "num_tokens": 819142.0, "step": 360 }, { "entropy": 7.5210926055908205, "epoch": 0.023490796756339298, "grad_norm": 1.1484375, "learning_rate": 0.000182, "loss": 6.8902, "mean_token_accuracy": 0.11664389371871949, "num_tokens": 829634.0, "step": 365 }, { "entropy": 7.562618398666382, "epoch": 0.023812588492727507, "grad_norm": 1.0625, "learning_rate": 0.0001845, "loss": 6.9457, "mean_token_accuracy": 0.11507059112191201, "num_tokens": 840723.0, "step": 370 }, { "entropy": 7.44709038734436, "epoch": 0.024134380229115716, "grad_norm": 1.1171875, "learning_rate": 0.000187, "loss": 6.9014, "mean_token_accuracy": 0.11120686307549477, "num_tokens": 852299.0, "step": 375 }, { "entropy": 7.542909240722656, "epoch": 0.024456171965503926, "grad_norm": 1.1328125, "learning_rate": 0.0001895, "loss": 6.8845, "mean_token_accuracy": 0.11418962627649307, "num_tokens": 864427.0, "step": 380 }, { "entropy": 7.269602823257446, "epoch": 0.024777963701892135, "grad_norm": 1.1015625, "learning_rate": 0.000192, "loss": 6.8457, "mean_token_accuracy": 0.11314126327633858, "num_tokens": 876188.0, "step": 385 }, { "entropy": 7.539252614974975, "epoch": 0.025099755438280344, "grad_norm": 1.296875, "learning_rate": 0.0001945, "loss": 6.9751, "mean_token_accuracy": 0.10968251451849938, "num_tokens": 886835.0, "step": 390 }, { "entropy": 7.462894248962402, "epoch": 0.025421547174668553, "grad_norm": 1.09375, "learning_rate": 0.00019700000000000002, "loss": 6.8758, "mean_token_accuracy": 0.1175595462322235, "num_tokens": 899609.0, "step": 395 }, { "entropy": 7.514445400238037, "epoch": 0.025743338911056766, "grad_norm": 1.1484375, "learning_rate": 0.00019950000000000002, "loss": 6.9867, "mean_token_accuracy": 0.10821878015995026, "num_tokens": 912114.0, "step": 400 }, { "entropy": 7.434127473831177, "epoch": 0.026065130647444975, "grad_norm": 1.0078125, "learning_rate": 0.000202, "loss": 6.9875, "mean_token_accuracy": 0.1139479123055935, "num_tokens": 923788.0, "step": 405 }, { "entropy": 7.338033294677734, "epoch": 0.026386922383833184, "grad_norm": 1.234375, "learning_rate": 0.00020449999999999998, "loss": 6.6791, "mean_token_accuracy": 0.1255500763654709, "num_tokens": 934952.0, "step": 410 }, { "entropy": 7.422152519226074, "epoch": 0.026708714120221393, "grad_norm": 1.4609375, "learning_rate": 0.000207, "loss": 6.7758, "mean_token_accuracy": 0.11906903460621834, "num_tokens": 945780.0, "step": 415 }, { "entropy": 7.29374885559082, "epoch": 0.027030505856609603, "grad_norm": 1.1015625, "learning_rate": 0.0002095, "loss": 6.7765, "mean_token_accuracy": 0.12052410319447518, "num_tokens": 958502.0, "step": 420 }, { "entropy": 7.422839784622193, "epoch": 0.02735229759299781, "grad_norm": 1.46875, "learning_rate": 0.000212, "loss": 6.8635, "mean_token_accuracy": 0.11772049516439438, "num_tokens": 969339.0, "step": 425 }, { "entropy": 7.215829658508301, "epoch": 0.02767408932938602, "grad_norm": 1.125, "learning_rate": 0.0002145, "loss": 6.7171, "mean_token_accuracy": 0.12233989164233208, "num_tokens": 980260.0, "step": 430 }, { "entropy": 7.2986561298370365, "epoch": 0.02799588106577423, "grad_norm": 1.21875, "learning_rate": 0.00021700000000000002, "loss": 6.6963, "mean_token_accuracy": 0.11892440766096116, "num_tokens": 991960.0, "step": 435 }, { "entropy": 7.193790006637573, "epoch": 0.02831767280216244, "grad_norm": 1.1328125, "learning_rate": 0.0002195, "loss": 6.7273, "mean_token_accuracy": 0.11868971958756447, "num_tokens": 1002083.0, "step": 440 }, { "entropy": 7.308983230590821, "epoch": 0.02863946453855065, "grad_norm": 1.109375, "learning_rate": 0.000222, "loss": 6.7375, "mean_token_accuracy": 0.11723077073693275, "num_tokens": 1012896.0, "step": 445 }, { "entropy": 7.334416151046753, "epoch": 0.02896125627493886, "grad_norm": 1.109375, "learning_rate": 0.0002245, "loss": 6.8189, "mean_token_accuracy": 0.12101824656128883, "num_tokens": 1024570.0, "step": 450 }, { "entropy": 7.2581829071044925, "epoch": 0.02928304801132707, "grad_norm": 1.1640625, "learning_rate": 0.00022700000000000002, "loss": 6.6596, "mean_token_accuracy": 0.1274547331035137, "num_tokens": 1035934.0, "step": 455 }, { "entropy": 7.214243841171265, "epoch": 0.02960483974771528, "grad_norm": 1.109375, "learning_rate": 0.00022950000000000002, "loss": 6.8555, "mean_token_accuracy": 0.11035279110074044, "num_tokens": 1047557.0, "step": 460 }, { "entropy": 7.284564542770386, "epoch": 0.02992663148410349, "grad_norm": 1.0703125, "learning_rate": 0.00023200000000000003, "loss": 6.8011, "mean_token_accuracy": 0.11536358669400215, "num_tokens": 1059387.0, "step": 465 }, { "entropy": 7.255402135848999, "epoch": 0.030248423220491698, "grad_norm": 1.2109375, "learning_rate": 0.00023449999999999998, "loss": 6.8003, "mean_token_accuracy": 0.11578696817159653, "num_tokens": 1070756.0, "step": 470 }, { "entropy": 7.274528503417969, "epoch": 0.030570214956879907, "grad_norm": 1.2734375, "learning_rate": 0.000237, "loss": 6.7873, "mean_token_accuracy": 0.1295149154961109, "num_tokens": 1083147.0, "step": 475 }, { "entropy": 7.171627616882324, "epoch": 0.030892006693268116, "grad_norm": 1.0625, "learning_rate": 0.0002395, "loss": 6.6541, "mean_token_accuracy": 0.12174521461129188, "num_tokens": 1094300.0, "step": 480 }, { "entropy": 7.192223072052002, "epoch": 0.031213798429656325, "grad_norm": 1.015625, "learning_rate": 0.000242, "loss": 6.7988, "mean_token_accuracy": 0.11465005055069924, "num_tokens": 1105991.0, "step": 485 }, { "entropy": 7.2635111808776855, "epoch": 0.031535590166044535, "grad_norm": 1.1875, "learning_rate": 0.0002445, "loss": 6.8278, "mean_token_accuracy": 0.11537677273154259, "num_tokens": 1118065.0, "step": 490 }, { "entropy": 7.217528486251831, "epoch": 0.031857381902432744, "grad_norm": 1.3671875, "learning_rate": 0.000247, "loss": 6.772, "mean_token_accuracy": 0.12680590748786927, "num_tokens": 1130521.0, "step": 495 }, { "entropy": 7.099181175231934, "epoch": 0.03217917363882095, "grad_norm": 1.15625, "learning_rate": 0.0002495, "loss": 6.7436, "mean_token_accuracy": 0.11461131051182746, "num_tokens": 1143241.0, "step": 500 }, { "entropy": 7.2616432189941404, "epoch": 0.03250096537520916, "grad_norm": 1.078125, "learning_rate": 0.000252, "loss": 6.698, "mean_token_accuracy": 0.1210433527827263, "num_tokens": 1154240.0, "step": 505 }, { "entropy": 7.08572096824646, "epoch": 0.03282275711159737, "grad_norm": 1.0390625, "learning_rate": 0.0002545, "loss": 6.6583, "mean_token_accuracy": 0.12035112828016281, "num_tokens": 1166134.0, "step": 510 }, { "entropy": 7.13088059425354, "epoch": 0.03314454884798558, "grad_norm": 1.140625, "learning_rate": 0.000257, "loss": 6.6952, "mean_token_accuracy": 0.12703741267323493, "num_tokens": 1177183.0, "step": 515 }, { "entropy": 7.25070538520813, "epoch": 0.0334663405843738, "grad_norm": 1.15625, "learning_rate": 0.0002595, "loss": 6.8061, "mean_token_accuracy": 0.11820513978600503, "num_tokens": 1189266.0, "step": 520 }, { "entropy": 7.051825141906738, "epoch": 0.033788132320762006, "grad_norm": 1.0390625, "learning_rate": 0.000262, "loss": 6.6082, "mean_token_accuracy": 0.12360260263085365, "num_tokens": 1199718.0, "step": 525 }, { "entropy": 7.207192850112915, "epoch": 0.034109924057150215, "grad_norm": 1.1640625, "learning_rate": 0.00026450000000000003, "loss": 6.7443, "mean_token_accuracy": 0.1214994914829731, "num_tokens": 1210278.0, "step": 530 }, { "entropy": 7.183014011383056, "epoch": 0.034431715793538424, "grad_norm": 1.2109375, "learning_rate": 0.00026700000000000004, "loss": 6.6847, "mean_token_accuracy": 0.12363504841923714, "num_tokens": 1221012.0, "step": 535 }, { "entropy": 7.097731018066407, "epoch": 0.03475350752992663, "grad_norm": 1.078125, "learning_rate": 0.00026950000000000005, "loss": 6.6674, "mean_token_accuracy": 0.1205046035349369, "num_tokens": 1232687.0, "step": 540 }, { "entropy": 7.153340673446655, "epoch": 0.03507529926631484, "grad_norm": 1.1171875, "learning_rate": 0.00027200000000000005, "loss": 6.6428, "mean_token_accuracy": 0.127882944047451, "num_tokens": 1243994.0, "step": 545 }, { "entropy": 7.048250007629394, "epoch": 0.03539709100270305, "grad_norm": 1.203125, "learning_rate": 0.0002745, "loss": 6.6121, "mean_token_accuracy": 0.1261216700077057, "num_tokens": 1254705.0, "step": 550 }, { "entropy": 7.134361505508423, "epoch": 0.03571888273909126, "grad_norm": 1.15625, "learning_rate": 0.000277, "loss": 6.7227, "mean_token_accuracy": 0.12077815011143685, "num_tokens": 1266367.0, "step": 555 }, { "entropy": 7.047533082962036, "epoch": 0.03604067447547947, "grad_norm": 1.3671875, "learning_rate": 0.0002795, "loss": 6.6958, "mean_token_accuracy": 0.12296305298805237, "num_tokens": 1279004.0, "step": 560 }, { "entropy": 7.034592580795288, "epoch": 0.03636246621186768, "grad_norm": 1.1796875, "learning_rate": 0.00028199999999999997, "loss": 6.5162, "mean_token_accuracy": 0.12805850878357888, "num_tokens": 1290980.0, "step": 565 }, { "entropy": 7.040336656570434, "epoch": 0.03668425794825589, "grad_norm": 0.9375, "learning_rate": 0.0002845, "loss": 6.6749, "mean_token_accuracy": 0.12128347530961037, "num_tokens": 1302396.0, "step": 570 }, { "entropy": 7.105546283721924, "epoch": 0.0370060496846441, "grad_norm": 1.2578125, "learning_rate": 0.000287, "loss": 6.6356, "mean_token_accuracy": 0.1311293475329876, "num_tokens": 1312304.0, "step": 575 }, { "entropy": 7.081285810470581, "epoch": 0.03732784142103231, "grad_norm": 1.2890625, "learning_rate": 0.0002895, "loss": 6.7769, "mean_token_accuracy": 0.12450022101402283, "num_tokens": 1325487.0, "step": 580 }, { "entropy": 7.005313682556152, "epoch": 0.037649633157420516, "grad_norm": 1.1484375, "learning_rate": 0.000292, "loss": 6.6247, "mean_token_accuracy": 0.126084253937006, "num_tokens": 1336754.0, "step": 585 }, { "entropy": 7.028646039962768, "epoch": 0.037971424893808725, "grad_norm": 1.2265625, "learning_rate": 0.0002945, "loss": 6.6309, "mean_token_accuracy": 0.12374395728111268, "num_tokens": 1347918.0, "step": 590 }, { "entropy": 7.05291862487793, "epoch": 0.038293216630196934, "grad_norm": 1.0078125, "learning_rate": 0.000297, "loss": 6.6336, "mean_token_accuracy": 0.13012145236134529, "num_tokens": 1359981.0, "step": 595 }, { "entropy": 7.028671169281006, "epoch": 0.03861500836658514, "grad_norm": 1.046875, "learning_rate": 0.0002995, "loss": 6.6423, "mean_token_accuracy": 0.1260800801217556, "num_tokens": 1371359.0, "step": 600 }, { "entropy": 7.067501354217529, "epoch": 0.03893680010297335, "grad_norm": 1.125, "learning_rate": 0.000302, "loss": 6.6909, "mean_token_accuracy": 0.11782569289207459, "num_tokens": 1383829.0, "step": 605 }, { "entropy": 7.0067911624908445, "epoch": 0.03925859183936156, "grad_norm": 1.2578125, "learning_rate": 0.0003045, "loss": 6.5645, "mean_token_accuracy": 0.13620257899165153, "num_tokens": 1394266.0, "step": 610 }, { "entropy": 6.985071325302124, "epoch": 0.03958038357574978, "grad_norm": 1.1015625, "learning_rate": 0.000307, "loss": 6.5691, "mean_token_accuracy": 0.1302391119301319, "num_tokens": 1405798.0, "step": 615 }, { "entropy": 6.973874282836914, "epoch": 0.03990217531213799, "grad_norm": 1.265625, "learning_rate": 0.0003095, "loss": 6.5689, "mean_token_accuracy": 0.13187146857380866, "num_tokens": 1417411.0, "step": 620 }, { "entropy": 7.0129351139068605, "epoch": 0.040223967048526196, "grad_norm": 1.0078125, "learning_rate": 0.000312, "loss": 6.6911, "mean_token_accuracy": 0.12921356335282325, "num_tokens": 1428987.0, "step": 625 }, { "entropy": 6.938956356048584, "epoch": 0.040545758784914405, "grad_norm": 1.25, "learning_rate": 0.0003145, "loss": 6.6049, "mean_token_accuracy": 0.12962101995944977, "num_tokens": 1440023.0, "step": 630 }, { "entropy": 7.100988531112671, "epoch": 0.040867550521302615, "grad_norm": 1.3046875, "learning_rate": 0.000317, "loss": 6.6762, "mean_token_accuracy": 0.1187206856906414, "num_tokens": 1451078.0, "step": 635 }, { "entropy": 7.031370496749878, "epoch": 0.041189342257690824, "grad_norm": 1.0703125, "learning_rate": 0.0003195, "loss": 6.6551, "mean_token_accuracy": 0.12284370735287667, "num_tokens": 1462446.0, "step": 640 }, { "entropy": 6.888606119155884, "epoch": 0.04151113399407903, "grad_norm": 1.3671875, "learning_rate": 0.000322, "loss": 6.5127, "mean_token_accuracy": 0.131097362190485, "num_tokens": 1472084.0, "step": 645 }, { "entropy": 6.948457860946656, "epoch": 0.04183292573046724, "grad_norm": 1.0625, "learning_rate": 0.00032450000000000003, "loss": 6.553, "mean_token_accuracy": 0.1207494542002678, "num_tokens": 1482464.0, "step": 650 }, { "entropy": 6.960102081298828, "epoch": 0.04215471746685545, "grad_norm": 1.1640625, "learning_rate": 0.00032700000000000003, "loss": 6.592, "mean_token_accuracy": 0.12484122142195701, "num_tokens": 1492789.0, "step": 655 }, { "entropy": 6.917847633361816, "epoch": 0.04247650920324366, "grad_norm": 1.140625, "learning_rate": 0.00032950000000000004, "loss": 6.5871, "mean_token_accuracy": 0.1326150640845299, "num_tokens": 1504438.0, "step": 660 }, { "entropy": 7.005792331695557, "epoch": 0.04279830093963187, "grad_norm": 1.0859375, "learning_rate": 0.00033200000000000005, "loss": 6.5294, "mean_token_accuracy": 0.1296870678663254, "num_tokens": 1515430.0, "step": 665 }, { "entropy": 6.8461448669433596, "epoch": 0.04312009267602008, "grad_norm": 1.125, "learning_rate": 0.00033450000000000005, "loss": 6.4998, "mean_token_accuracy": 0.13402296751737594, "num_tokens": 1525804.0, "step": 670 }, { "entropy": 6.924587154388428, "epoch": 0.04344188441240829, "grad_norm": 1.0625, "learning_rate": 0.000337, "loss": 6.5119, "mean_token_accuracy": 0.12666192203760146, "num_tokens": 1537638.0, "step": 675 }, { "entropy": 6.82023057937622, "epoch": 0.0437636761487965, "grad_norm": 1.34375, "learning_rate": 0.0003395, "loss": 6.4856, "mean_token_accuracy": 0.13445887267589568, "num_tokens": 1548232.0, "step": 680 }, { "entropy": 6.93139066696167, "epoch": 0.044085467885184706, "grad_norm": 1.2734375, "learning_rate": 0.000342, "loss": 6.5018, "mean_token_accuracy": 0.13019829168915747, "num_tokens": 1558781.0, "step": 685 }, { "entropy": 6.913920307159424, "epoch": 0.044407259621572916, "grad_norm": 1.1328125, "learning_rate": 0.00034449999999999997, "loss": 6.4656, "mean_token_accuracy": 0.1352573812007904, "num_tokens": 1571387.0, "step": 690 }, { "entropy": 6.8577742099761965, "epoch": 0.044729051357961125, "grad_norm": 1.1640625, "learning_rate": 0.000347, "loss": 6.5251, "mean_token_accuracy": 0.13332423493266105, "num_tokens": 1582471.0, "step": 695 }, { "entropy": 6.825550699234009, "epoch": 0.045050843094349334, "grad_norm": 1.1875, "learning_rate": 0.0003495, "loss": 6.484, "mean_token_accuracy": 0.13259591534733772, "num_tokens": 1592967.0, "step": 700 }, { "entropy": 6.84607195854187, "epoch": 0.04537263483073754, "grad_norm": 1.15625, "learning_rate": 0.000352, "loss": 6.4834, "mean_token_accuracy": 0.1336855672299862, "num_tokens": 1603772.0, "step": 705 }, { "entropy": 6.906696319580078, "epoch": 0.04569442656712576, "grad_norm": 1.1953125, "learning_rate": 0.0003545, "loss": 6.4789, "mean_token_accuracy": 0.12700057551264762, "num_tokens": 1614924.0, "step": 710 }, { "entropy": 6.7945763111114506, "epoch": 0.04601621830351397, "grad_norm": 0.953125, "learning_rate": 0.000357, "loss": 6.4715, "mean_token_accuracy": 0.13077478110790253, "num_tokens": 1626947.0, "step": 715 }, { "entropy": 6.796080684661865, "epoch": 0.04633801003990218, "grad_norm": 1.03125, "learning_rate": 0.0003595, "loss": 6.3518, "mean_token_accuracy": 0.13691332638263704, "num_tokens": 1638651.0, "step": 720 }, { "entropy": 6.753641128540039, "epoch": 0.04665980177629039, "grad_norm": 1.1484375, "learning_rate": 0.000362, "loss": 6.4204, "mean_token_accuracy": 0.1394519940018654, "num_tokens": 1650157.0, "step": 725 }, { "entropy": 6.7741881847381595, "epoch": 0.046981593512678596, "grad_norm": 1.0078125, "learning_rate": 0.0003645, "loss": 6.418, "mean_token_accuracy": 0.133515302836895, "num_tokens": 1661763.0, "step": 730 }, { "entropy": 6.971210908889771, "epoch": 0.047303385249066805, "grad_norm": 1.109375, "learning_rate": 0.000367, "loss": 6.6075, "mean_token_accuracy": 0.12115295752882957, "num_tokens": 1674051.0, "step": 735 }, { "entropy": 6.856794738769532, "epoch": 0.047625176985455014, "grad_norm": 1.2578125, "learning_rate": 0.0003695, "loss": 6.4626, "mean_token_accuracy": 0.1338093623518944, "num_tokens": 1685240.0, "step": 740 }, { "entropy": 6.777393484115601, "epoch": 0.047946968721843224, "grad_norm": 1.0546875, "learning_rate": 0.000372, "loss": 6.4435, "mean_token_accuracy": 0.1303575173020363, "num_tokens": 1697472.0, "step": 745 }, { "entropy": 6.796992444992066, "epoch": 0.04826876045823143, "grad_norm": 1.1171875, "learning_rate": 0.0003745, "loss": 6.4543, "mean_token_accuracy": 0.1324995703995228, "num_tokens": 1708383.0, "step": 750 }, { "entropy": 6.788374280929565, "epoch": 0.04859055219461964, "grad_norm": 1.0390625, "learning_rate": 0.000377, "loss": 6.4631, "mean_token_accuracy": 0.13005806729197503, "num_tokens": 1720367.0, "step": 755 }, { "entropy": 6.780432558059692, "epoch": 0.04891234393100785, "grad_norm": 1.1875, "learning_rate": 0.0003795, "loss": 6.445, "mean_token_accuracy": 0.13468715846538543, "num_tokens": 1731252.0, "step": 760 }, { "entropy": 6.793448638916016, "epoch": 0.04923413566739606, "grad_norm": 1.140625, "learning_rate": 0.000382, "loss": 6.4776, "mean_token_accuracy": 0.1371725916862488, "num_tokens": 1741865.0, "step": 765 }, { "entropy": 6.7858991622924805, "epoch": 0.04955592740378427, "grad_norm": 1.0859375, "learning_rate": 0.0003845, "loss": 6.4394, "mean_token_accuracy": 0.13146187737584114, "num_tokens": 1754036.0, "step": 770 }, { "entropy": 6.814309310913086, "epoch": 0.04987771914017248, "grad_norm": 1.296875, "learning_rate": 0.00038700000000000003, "loss": 6.4836, "mean_token_accuracy": 0.12894209176301957, "num_tokens": 1764717.0, "step": 775 }, { "entropy": 6.754202890396118, "epoch": 0.05019951087656069, "grad_norm": 0.9609375, "learning_rate": 0.00038950000000000003, "loss": 6.383, "mean_token_accuracy": 0.13913563415408134, "num_tokens": 1777078.0, "step": 780 }, { "entropy": 6.852421665191651, "epoch": 0.0505213026129489, "grad_norm": 1.0390625, "learning_rate": 0.00039200000000000004, "loss": 6.453, "mean_token_accuracy": 0.12606742605566978, "num_tokens": 1788393.0, "step": 785 }, { "entropy": 6.727867794036865, "epoch": 0.050843094349337106, "grad_norm": 1.109375, "learning_rate": 0.00039450000000000005, "loss": 6.5638, "mean_token_accuracy": 0.12575344145298004, "num_tokens": 1799535.0, "step": 790 }, { "entropy": 6.849759912490844, "epoch": 0.051164886085725315, "grad_norm": 1.2265625, "learning_rate": 0.00039700000000000005, "loss": 6.3297, "mean_token_accuracy": 0.13775620311498643, "num_tokens": 1809733.0, "step": 795 }, { "entropy": 6.681720924377442, "epoch": 0.05148667782211353, "grad_norm": 0.9609375, "learning_rate": 0.0003995, "loss": 6.3793, "mean_token_accuracy": 0.13796758204698562, "num_tokens": 1821535.0, "step": 800 }, { "entropy": 6.674613428115845, "epoch": 0.05180846955850174, "grad_norm": 1.140625, "learning_rate": 0.000402, "loss": 6.3629, "mean_token_accuracy": 0.13800609484314919, "num_tokens": 1832355.0, "step": 805 }, { "entropy": 6.773230028152466, "epoch": 0.05213026129488995, "grad_norm": 1.0390625, "learning_rate": 0.0004045, "loss": 6.3386, "mean_token_accuracy": 0.1425774149596691, "num_tokens": 1843340.0, "step": 810 }, { "entropy": 6.642430782318115, "epoch": 0.05245205303127816, "grad_norm": 1.265625, "learning_rate": 0.00040699999999999997, "loss": 6.3684, "mean_token_accuracy": 0.13916084170341492, "num_tokens": 1854233.0, "step": 815 }, { "entropy": 6.633238887786865, "epoch": 0.05277384476766637, "grad_norm": 1.046875, "learning_rate": 0.0004095, "loss": 6.3114, "mean_token_accuracy": 0.13679933026432992, "num_tokens": 1864860.0, "step": 820 }, { "entropy": 6.780126476287842, "epoch": 0.05309563650405458, "grad_norm": 1.0625, "learning_rate": 0.000412, "loss": 6.2908, "mean_token_accuracy": 0.14247430860996246, "num_tokens": 1875981.0, "step": 825 }, { "entropy": 6.616991996765137, "epoch": 0.05341742824044279, "grad_norm": 0.99609375, "learning_rate": 0.0004145, "loss": 6.4106, "mean_token_accuracy": 0.13161869645118712, "num_tokens": 1889147.0, "step": 830 }, { "entropy": 6.857424640655518, "epoch": 0.053739219976830996, "grad_norm": 1.1328125, "learning_rate": 0.000417, "loss": 6.4176, "mean_token_accuracy": 0.13287485763430595, "num_tokens": 1900823.0, "step": 835 }, { "entropy": 6.622591257095337, "epoch": 0.054061011713219205, "grad_norm": 1.15625, "learning_rate": 0.0004195, "loss": 6.3323, "mean_token_accuracy": 0.13574840426445006, "num_tokens": 1910882.0, "step": 840 }, { "entropy": 6.52352614402771, "epoch": 0.054382803449607414, "grad_norm": 1.2578125, "learning_rate": 0.000422, "loss": 6.2885, "mean_token_accuracy": 0.1370130032300949, "num_tokens": 1922228.0, "step": 845 }, { "entropy": 6.675861597061157, "epoch": 0.05470459518599562, "grad_norm": 1.125, "learning_rate": 0.0004245, "loss": 6.3254, "mean_token_accuracy": 0.13999047502875328, "num_tokens": 1933400.0, "step": 850 }, { "entropy": 6.6365453720092775, "epoch": 0.05502638692238383, "grad_norm": 1.1171875, "learning_rate": 0.000427, "loss": 6.3747, "mean_token_accuracy": 0.13206338435411452, "num_tokens": 1944717.0, "step": 855 }, { "entropy": 6.806672430038452, "epoch": 0.05534817865877204, "grad_norm": 1.2265625, "learning_rate": 0.0004295, "loss": 6.4465, "mean_token_accuracy": 0.1298723392188549, "num_tokens": 1956116.0, "step": 860 }, { "entropy": 6.787279891967773, "epoch": 0.05566997039516025, "grad_norm": 1.1640625, "learning_rate": 0.000432, "loss": 6.4613, "mean_token_accuracy": 0.13620107173919677, "num_tokens": 1967183.0, "step": 865 }, { "entropy": 6.522842454910278, "epoch": 0.05599176213154846, "grad_norm": 1.0, "learning_rate": 0.0004345, "loss": 6.2558, "mean_token_accuracy": 0.14262447282671928, "num_tokens": 1978943.0, "step": 870 }, { "entropy": 6.580580043792724, "epoch": 0.05631355386793667, "grad_norm": 1.109375, "learning_rate": 0.000437, "loss": 6.2737, "mean_token_accuracy": 0.14003785327076912, "num_tokens": 1990818.0, "step": 875 }, { "entropy": 6.574157285690307, "epoch": 0.05663534560432488, "grad_norm": 1.0390625, "learning_rate": 0.0004395, "loss": 6.2641, "mean_token_accuracy": 0.14258711114525796, "num_tokens": 2002309.0, "step": 880 }, { "entropy": 6.655279111862183, "epoch": 0.05695713734071309, "grad_norm": 0.9453125, "learning_rate": 0.000442, "loss": 6.4362, "mean_token_accuracy": 0.1311865270137787, "num_tokens": 2013131.0, "step": 885 }, { "entropy": 6.861530065536499, "epoch": 0.0572789290771013, "grad_norm": 1.078125, "learning_rate": 0.0004445, "loss": 6.5215, "mean_token_accuracy": 0.12429815754294396, "num_tokens": 2024881.0, "step": 890 }, { "entropy": 6.6120974063873295, "epoch": 0.05760072081348951, "grad_norm": 1.1015625, "learning_rate": 0.000447, "loss": 6.3878, "mean_token_accuracy": 0.13595437854528428, "num_tokens": 2035633.0, "step": 895 }, { "entropy": 6.62742280960083, "epoch": 0.05792251254987772, "grad_norm": 1.125, "learning_rate": 0.00044950000000000003, "loss": 6.2356, "mean_token_accuracy": 0.14306803271174431, "num_tokens": 2046237.0, "step": 900 }, { "entropy": 6.552933835983277, "epoch": 0.05824430428626593, "grad_norm": 1.25, "learning_rate": 0.00045200000000000004, "loss": 6.2148, "mean_token_accuracy": 0.14152271002531053, "num_tokens": 2058158.0, "step": 905 }, { "entropy": 6.638343429565429, "epoch": 0.05856609602265414, "grad_norm": 1.21875, "learning_rate": 0.00045450000000000004, "loss": 6.4302, "mean_token_accuracy": 0.13081190586090088, "num_tokens": 2068364.0, "step": 910 }, { "entropy": 6.667097568511963, "epoch": 0.05888788775904235, "grad_norm": 1.0859375, "learning_rate": 0.00045700000000000005, "loss": 6.3678, "mean_token_accuracy": 0.12357937470078469, "num_tokens": 2080168.0, "step": 915 }, { "entropy": 6.584589195251465, "epoch": 0.05920967949543056, "grad_norm": 1.1171875, "learning_rate": 0.00045950000000000006, "loss": 6.2459, "mean_token_accuracy": 0.14396512135863304, "num_tokens": 2089908.0, "step": 920 }, { "entropy": 6.65417799949646, "epoch": 0.05953147123181877, "grad_norm": 1.0625, "learning_rate": 0.000462, "loss": 6.3424, "mean_token_accuracy": 0.13211728110909463, "num_tokens": 2101403.0, "step": 925 }, { "entropy": 6.49568543434143, "epoch": 0.05985326296820698, "grad_norm": 0.9453125, "learning_rate": 0.0004645, "loss": 6.2153, "mean_token_accuracy": 0.14081560969352722, "num_tokens": 2113940.0, "step": 930 }, { "entropy": 6.544306850433349, "epoch": 0.060175054704595186, "grad_norm": 1.046875, "learning_rate": 0.000467, "loss": 6.2557, "mean_token_accuracy": 0.1435394138097763, "num_tokens": 2124467.0, "step": 935 }, { "entropy": 6.588162183761597, "epoch": 0.060496846440983396, "grad_norm": 1.265625, "learning_rate": 0.0004695, "loss": 6.2399, "mean_token_accuracy": 0.1443529948592186, "num_tokens": 2136147.0, "step": 940 }, { "entropy": 6.542601013183594, "epoch": 0.060818638177371605, "grad_norm": 1.078125, "learning_rate": 0.000472, "loss": 6.2855, "mean_token_accuracy": 0.14248571097850798, "num_tokens": 2147494.0, "step": 945 }, { "entropy": 6.513602781295776, "epoch": 0.061140429913759814, "grad_norm": 1.1328125, "learning_rate": 0.0004745, "loss": 6.1673, "mean_token_accuracy": 0.14396455883979797, "num_tokens": 2157660.0, "step": 950 }, { "entropy": 6.415520524978637, "epoch": 0.06146222165014802, "grad_norm": 0.91796875, "learning_rate": 0.000477, "loss": 6.2775, "mean_token_accuracy": 0.1388951927423477, "num_tokens": 2170629.0, "step": 955 }, { "entropy": 6.536985874176025, "epoch": 0.06178401338653623, "grad_norm": 1.296875, "learning_rate": 0.0004795, "loss": 6.1999, "mean_token_accuracy": 0.14611724615097046, "num_tokens": 2181945.0, "step": 960 }, { "entropy": 6.555672550201416, "epoch": 0.06210580512292444, "grad_norm": 1.03125, "learning_rate": 0.000482, "loss": 6.2884, "mean_token_accuracy": 0.13931862711906434, "num_tokens": 2192975.0, "step": 965 }, { "entropy": 6.523555850982666, "epoch": 0.06242759685931265, "grad_norm": 1.140625, "learning_rate": 0.0004845, "loss": 6.2292, "mean_token_accuracy": 0.14297346845269204, "num_tokens": 2203929.0, "step": 970 }, { "entropy": 6.551759815216064, "epoch": 0.06274938859570087, "grad_norm": 1.0234375, "learning_rate": 0.000487, "loss": 6.2444, "mean_token_accuracy": 0.14618593230843543, "num_tokens": 2214296.0, "step": 975 }, { "entropy": 6.542734003067016, "epoch": 0.06307118033208907, "grad_norm": 1.125, "learning_rate": 0.0004895, "loss": 6.2657, "mean_token_accuracy": 0.1420005366206169, "num_tokens": 2224834.0, "step": 980 }, { "entropy": 6.490674257278442, "epoch": 0.06339297206847729, "grad_norm": 1.1171875, "learning_rate": 0.000492, "loss": 6.1984, "mean_token_accuracy": 0.14470900744199752, "num_tokens": 2236261.0, "step": 985 }, { "entropy": 6.574054622650147, "epoch": 0.06371476380486549, "grad_norm": 1.03125, "learning_rate": 0.0004945, "loss": 6.445, "mean_token_accuracy": 0.1385732315480709, "num_tokens": 2248056.0, "step": 990 }, { "entropy": 6.560631370544433, "epoch": 0.0640365555412537, "grad_norm": 1.046875, "learning_rate": 0.000497, "loss": 6.2375, "mean_token_accuracy": 0.13548775166273117, "num_tokens": 2258304.0, "step": 995 }, { "entropy": 6.553973388671875, "epoch": 0.0643583472776419, "grad_norm": 1.1015625, "learning_rate": 0.0004995, "loss": 6.3626, "mean_token_accuracy": 0.14208254665136338, "num_tokens": 2269541.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 534508976701440.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }