{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.1287166945552838, "eval_steps": 500, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742555713653564, "epoch": 0.00032179173638820956, "grad_norm": 4.59375, "learning_rate": 2e-06, "loss": 10.7932, "mean_token_accuracy": 9.85221704468131e-05, "num_tokens": 11506.0, "step": 5 }, { "entropy": 10.742585468292237, "epoch": 0.0006435834727764191, "grad_norm": 5.0, "learning_rate": 4.5e-06, "loss": 10.7664, "mean_token_accuracy": 7.942811935208738e-05, "num_tokens": 21973.0, "step": 10 }, { "entropy": 10.742585182189941, "epoch": 0.0009653752091646286, "grad_norm": 4.6875, "learning_rate": 7e-06, "loss": 10.7473, "mean_token_accuracy": 0.0, "num_tokens": 32763.0, "step": 15 }, { "entropy": 10.742647171020508, "epoch": 0.0012871669455528382, "grad_norm": 4.5, "learning_rate": 9.5e-06, "loss": 10.716, "mean_token_accuracy": 0.00042943707667291163, "num_tokens": 44354.0, "step": 20 }, { "entropy": 10.742597675323486, "epoch": 0.0016089586819410479, "grad_norm": 4.375, "learning_rate": 1.2e-05, "loss": 10.6219, "mean_token_accuracy": 0.0008890067110769451, "num_tokens": 56534.0, "step": 25 }, { "entropy": 10.74241762161255, "epoch": 0.0019307504183292573, "grad_norm": 3.859375, "learning_rate": 1.4500000000000002e-05, "loss": 10.4911, "mean_token_accuracy": 0.009375615860335529, "num_tokens": 67106.0, "step": 30 }, { "entropy": 10.741784954071045, "epoch": 0.002252542154717467, "grad_norm": 3.265625, "learning_rate": 1.7000000000000003e-05, "loss": 10.3831, "mean_token_accuracy": 0.021833056677132846, "num_tokens": 78801.0, "step": 35 }, { "entropy": 10.74044713973999, "epoch": 0.0025743338911056765, "grad_norm": 2.53125, "learning_rate": 1.95e-05, "loss": 10.2405, "mean_token_accuracy": 0.028899907879531384, "num_tokens": 90390.0, "step": 40 }, { "entropy": 10.738579750061035, "epoch": 0.002896125627493886, "grad_norm": 2.265625, "learning_rate": 2.2e-05, "loss": 10.1128, "mean_token_accuracy": 0.036285107396543025, "num_tokens": 101652.0, "step": 45 }, { "entropy": 10.737388038635254, "epoch": 0.0032179173638820957, "grad_norm": 2.0625, "learning_rate": 2.4500000000000003e-05, "loss": 10.0384, "mean_token_accuracy": 0.03730290364474058, "num_tokens": 112068.0, "step": 50 }, { "entropy": 10.737480354309081, "epoch": 0.003539709100270305, "grad_norm": 1.90625, "learning_rate": 2.7e-05, "loss": 10.0098, "mean_token_accuracy": 0.04103992246091366, "num_tokens": 123500.0, "step": 55 }, { "entropy": 10.736884212493896, "epoch": 0.0038615008366585145, "grad_norm": 1.9296875, "learning_rate": 2.95e-05, "loss": 9.9544, "mean_token_accuracy": 0.0359757786616683, "num_tokens": 134456.0, "step": 60 }, { "entropy": 10.7358078956604, "epoch": 0.004183292573046725, "grad_norm": 1.765625, "learning_rate": 3.2e-05, "loss": 9.9017, "mean_token_accuracy": 0.03450035620480776, "num_tokens": 146299.0, "step": 65 }, { "entropy": 10.734182739257813, "epoch": 0.004505084309434934, "grad_norm": 1.9375, "learning_rate": 3.4500000000000005e-05, "loss": 9.8076, "mean_token_accuracy": 0.037839466519653794, "num_tokens": 157494.0, "step": 70 }, { "entropy": 10.73177366256714, "epoch": 0.004826876045823143, "grad_norm": 1.7734375, "learning_rate": 3.7e-05, "loss": 9.7775, "mean_token_accuracy": 0.03611580468714237, "num_tokens": 168226.0, "step": 75 }, { "entropy": 10.728845882415772, "epoch": 0.005148667782211353, "grad_norm": 1.9296875, "learning_rate": 3.95e-05, "loss": 9.6556, "mean_token_accuracy": 0.04190883524715901, "num_tokens": 179311.0, "step": 80 }, { "entropy": 10.725195121765136, "epoch": 0.005470459518599562, "grad_norm": 1.7421875, "learning_rate": 4.2000000000000004e-05, "loss": 9.6267, "mean_token_accuracy": 0.043489571660757065, "num_tokens": 191513.0, "step": 85 }, { "entropy": 10.719332885742187, "epoch": 0.005792251254987772, "grad_norm": 1.8828125, "learning_rate": 4.45e-05, "loss": 9.5397, "mean_token_accuracy": 0.046276621893048285, "num_tokens": 204631.0, "step": 90 }, { "entropy": 10.710766220092774, "epoch": 0.006114042991375981, "grad_norm": 1.7578125, "learning_rate": 4.7000000000000004e-05, "loss": 9.4486, "mean_token_accuracy": 0.0460438147187233, "num_tokens": 215901.0, "step": 95 }, { "entropy": 10.69977626800537, "epoch": 0.0064358347277641914, "grad_norm": 1.8203125, "learning_rate": 4.9500000000000004e-05, "loss": 9.4013, "mean_token_accuracy": 0.044720832630991934, "num_tokens": 228928.0, "step": 100 }, { "entropy": 10.685317134857177, "epoch": 0.006757626464152401, "grad_norm": 1.765625, "learning_rate": 5.2e-05, "loss": 9.3138, "mean_token_accuracy": 0.044154060259461406, "num_tokens": 241543.0, "step": 105 }, { "entropy": 10.66606101989746, "epoch": 0.00707941820054061, "grad_norm": 1.8203125, "learning_rate": 5.45e-05, "loss": 9.1466, "mean_token_accuracy": 0.046302244812250135, "num_tokens": 253267.0, "step": 110 }, { "entropy": 10.636186695098877, "epoch": 0.00740120993692882, "grad_norm": 1.78125, "learning_rate": 5.7e-05, "loss": 9.0141, "mean_token_accuracy": 0.05802988223731518, "num_tokens": 264760.0, "step": 115 }, { "entropy": 10.5947696685791, "epoch": 0.007723001673317029, "grad_norm": 1.75, "learning_rate": 5.9499999999999996e-05, "loss": 8.9075, "mean_token_accuracy": 0.051640312373638156, "num_tokens": 275080.0, "step": 120 }, { "entropy": 10.542396450042725, "epoch": 0.008044793409705238, "grad_norm": 1.7109375, "learning_rate": 6.2e-05, "loss": 8.7919, "mean_token_accuracy": 0.05795170105993748, "num_tokens": 287114.0, "step": 125 }, { "entropy": 10.490421962738036, "epoch": 0.00836658514609345, "grad_norm": 1.6796875, "learning_rate": 6.450000000000001e-05, "loss": 8.6367, "mean_token_accuracy": 0.06025359183549881, "num_tokens": 298732.0, "step": 130 }, { "entropy": 10.417353057861328, "epoch": 0.008688376882481658, "grad_norm": 1.65625, "learning_rate": 6.7e-05, "loss": 8.4641, "mean_token_accuracy": 0.06998355574905872, "num_tokens": 310227.0, "step": 135 }, { "entropy": 10.32230224609375, "epoch": 0.009010168618869868, "grad_norm": 1.4765625, "learning_rate": 6.950000000000001e-05, "loss": 8.3943, "mean_token_accuracy": 0.06697470992803574, "num_tokens": 322724.0, "step": 140 }, { "entropy": 10.228569889068604, "epoch": 0.009331960355258077, "grad_norm": 1.4375, "learning_rate": 7.2e-05, "loss": 8.3137, "mean_token_accuracy": 0.06024596691131592, "num_tokens": 335638.0, "step": 145 }, { "entropy": 10.116732311248779, "epoch": 0.009653752091646286, "grad_norm": 1.453125, "learning_rate": 7.45e-05, "loss": 8.1548, "mean_token_accuracy": 0.07251053638756275, "num_tokens": 346751.0, "step": 150 }, { "entropy": 9.953464126586914, "epoch": 0.009975543828034497, "grad_norm": 1.3359375, "learning_rate": 7.7e-05, "loss": 8.0894, "mean_token_accuracy": 0.07281172573566437, "num_tokens": 357809.0, "step": 155 }, { "entropy": 9.77461576461792, "epoch": 0.010297335564422706, "grad_norm": 1.21875, "learning_rate": 7.950000000000001e-05, "loss": 7.9142, "mean_token_accuracy": 0.06864561475813388, "num_tokens": 369631.0, "step": 160 }, { "entropy": 9.603110790252686, "epoch": 0.010619127300810915, "grad_norm": 1.0390625, "learning_rate": 8.2e-05, "loss": 7.9575, "mean_token_accuracy": 0.06908577904105187, "num_tokens": 380904.0, "step": 165 }, { "entropy": 9.377412414550781, "epoch": 0.010940919037199124, "grad_norm": 1.125, "learning_rate": 8.450000000000001e-05, "loss": 7.7359, "mean_token_accuracy": 0.07545260861515998, "num_tokens": 392898.0, "step": 170 }, { "entropy": 9.168265438079834, "epoch": 0.011262710773587334, "grad_norm": 1.125, "learning_rate": 8.7e-05, "loss": 7.6702, "mean_token_accuracy": 0.07459548935294151, "num_tokens": 404285.0, "step": 175 }, { "entropy": 8.926816463470459, "epoch": 0.011584502509975544, "grad_norm": 1.0, "learning_rate": 8.95e-05, "loss": 7.5717, "mean_token_accuracy": 0.07761912979185581, "num_tokens": 416443.0, "step": 180 }, { "entropy": 8.745314025878907, "epoch": 0.011906294246363754, "grad_norm": 0.96875, "learning_rate": 9.2e-05, "loss": 7.6426, "mean_token_accuracy": 0.0765433344990015, "num_tokens": 426558.0, "step": 185 }, { "entropy": 8.587053394317627, "epoch": 0.012228085982751963, "grad_norm": 1.1796875, "learning_rate": 9.45e-05, "loss": 7.6648, "mean_token_accuracy": 0.07643079459667206, "num_tokens": 437794.0, "step": 190 }, { "entropy": 8.517185878753661, "epoch": 0.012549877719140172, "grad_norm": 1.0546875, "learning_rate": 9.7e-05, "loss": 7.4958, "mean_token_accuracy": 0.07788795456290246, "num_tokens": 448682.0, "step": 195 }, { "entropy": 8.376048374176026, "epoch": 0.012871669455528383, "grad_norm": 1.1640625, "learning_rate": 9.95e-05, "loss": 7.417, "mean_token_accuracy": 0.08175441175699234, "num_tokens": 459699.0, "step": 200 }, { "entropy": 8.276328945159912, "epoch": 0.013193461191916592, "grad_norm": 1.125, "learning_rate": 0.000102, "loss": 7.3537, "mean_token_accuracy": 0.08016520962119103, "num_tokens": 472857.0, "step": 205 }, { "entropy": 8.274100303649902, "epoch": 0.013515252928304801, "grad_norm": 1.0078125, "learning_rate": 0.00010449999999999999, "loss": 7.4194, "mean_token_accuracy": 0.08162855952978135, "num_tokens": 484983.0, "step": 210 }, { "entropy": 8.180224132537841, "epoch": 0.01383704466469301, "grad_norm": 0.99609375, "learning_rate": 0.000107, "loss": 7.3626, "mean_token_accuracy": 0.08450362831354141, "num_tokens": 495973.0, "step": 215 }, { "entropy": 8.187409973144531, "epoch": 0.01415883640108122, "grad_norm": 1.296875, "learning_rate": 0.0001095, "loss": 7.2816, "mean_token_accuracy": 0.090892593562603, "num_tokens": 507017.0, "step": 220 }, { "entropy": 8.120441341400147, "epoch": 0.01448062813746943, "grad_norm": 1.1875, "learning_rate": 0.000112, "loss": 7.36, "mean_token_accuracy": 0.08900276795029641, "num_tokens": 517522.0, "step": 225 }, { "entropy": 8.129059314727783, "epoch": 0.01480241987385764, "grad_norm": 1.015625, "learning_rate": 0.0001145, "loss": 7.3701, "mean_token_accuracy": 0.09131013453006745, "num_tokens": 528240.0, "step": 230 }, { "entropy": 7.994166135787964, "epoch": 0.015124211610245849, "grad_norm": 0.9765625, "learning_rate": 0.00011700000000000001, "loss": 7.328, "mean_token_accuracy": 0.0881452701985836, "num_tokens": 538875.0, "step": 235 }, { "entropy": 8.10927906036377, "epoch": 0.015446003346634058, "grad_norm": 1.109375, "learning_rate": 0.00011949999999999999, "loss": 7.3722, "mean_token_accuracy": 0.08998035714030266, "num_tokens": 549386.0, "step": 240 }, { "entropy": 8.068589448928833, "epoch": 0.015767795083022267, "grad_norm": 1.234375, "learning_rate": 0.000122, "loss": 7.3029, "mean_token_accuracy": 0.08936483487486839, "num_tokens": 559643.0, "step": 245 }, { "entropy": 8.049430751800537, "epoch": 0.016089586819410476, "grad_norm": 1.0546875, "learning_rate": 0.0001245, "loss": 7.2267, "mean_token_accuracy": 0.09506414234638214, "num_tokens": 570932.0, "step": 250 }, { "entropy": 7.93134560585022, "epoch": 0.016411378555798686, "grad_norm": 1.296875, "learning_rate": 0.000127, "loss": 7.2019, "mean_token_accuracy": 0.09725837931036949, "num_tokens": 580258.0, "step": 255 }, { "entropy": 7.893705558776856, "epoch": 0.0167331702921869, "grad_norm": 1.1953125, "learning_rate": 0.0001295, "loss": 7.1337, "mean_token_accuracy": 0.09558385238051414, "num_tokens": 590622.0, "step": 260 }, { "entropy": 7.884620428085327, "epoch": 0.017054962028575107, "grad_norm": 1.0859375, "learning_rate": 0.000132, "loss": 7.1827, "mean_token_accuracy": 0.09120650067925454, "num_tokens": 602202.0, "step": 265 }, { "entropy": 7.823669528961181, "epoch": 0.017376753764963317, "grad_norm": 1.0859375, "learning_rate": 0.00013450000000000002, "loss": 7.1309, "mean_token_accuracy": 0.0979801706969738, "num_tokens": 613864.0, "step": 270 }, { "entropy": 7.87017560005188, "epoch": 0.017698545501351526, "grad_norm": 0.99609375, "learning_rate": 0.00013700000000000002, "loss": 7.2524, "mean_token_accuracy": 0.09466890171170235, "num_tokens": 626884.0, "step": 275 }, { "entropy": 7.857308626174927, "epoch": 0.018020337237739735, "grad_norm": 1.4140625, "learning_rate": 0.0001395, "loss": 7.1612, "mean_token_accuracy": 0.09996400326490402, "num_tokens": 638418.0, "step": 280 }, { "entropy": 7.856085300445557, "epoch": 0.018342128974127944, "grad_norm": 1.125, "learning_rate": 0.00014199999999999998, "loss": 7.1939, "mean_token_accuracy": 0.09103256016969681, "num_tokens": 648376.0, "step": 285 }, { "entropy": 7.9166460037231445, "epoch": 0.018663920710516153, "grad_norm": 1.09375, "learning_rate": 0.0001445, "loss": 7.2464, "mean_token_accuracy": 0.09389530643820762, "num_tokens": 659268.0, "step": 290 }, { "entropy": 7.788627672195434, "epoch": 0.018985712446904363, "grad_norm": 1.03125, "learning_rate": 0.000147, "loss": 7.0223, "mean_token_accuracy": 0.10249627456068992, "num_tokens": 669736.0, "step": 295 }, { "entropy": 7.768741464614868, "epoch": 0.01930750418329257, "grad_norm": 1.0546875, "learning_rate": 0.0001495, "loss": 7.1198, "mean_token_accuracy": 0.0995169997215271, "num_tokens": 681571.0, "step": 300 }, { "entropy": 7.723494529724121, "epoch": 0.01962929591968078, "grad_norm": 0.9375, "learning_rate": 0.000152, "loss": 7.0189, "mean_token_accuracy": 0.10438807159662247, "num_tokens": 692816.0, "step": 305 }, { "entropy": 7.758736324310303, "epoch": 0.019951087656068994, "grad_norm": 1.078125, "learning_rate": 0.00015450000000000001, "loss": 7.1546, "mean_token_accuracy": 0.10238918289542198, "num_tokens": 705089.0, "step": 310 }, { "entropy": 7.666284465789795, "epoch": 0.020272879392457203, "grad_norm": 1.2734375, "learning_rate": 0.000157, "loss": 7.0252, "mean_token_accuracy": 0.10788851976394653, "num_tokens": 716874.0, "step": 315 }, { "entropy": 7.531011438369751, "epoch": 0.020594671128845412, "grad_norm": 1.171875, "learning_rate": 0.0001595, "loss": 6.9807, "mean_token_accuracy": 0.10204816684126854, "num_tokens": 728981.0, "step": 320 }, { "entropy": 7.782111930847168, "epoch": 0.02091646286523362, "grad_norm": 1.109375, "learning_rate": 0.000162, "loss": 7.0871, "mean_token_accuracy": 0.10574771091341972, "num_tokens": 739619.0, "step": 325 }, { "entropy": 7.599967575073242, "epoch": 0.02123825460162183, "grad_norm": 1.1640625, "learning_rate": 0.00016450000000000001, "loss": 7.0537, "mean_token_accuracy": 0.10123220011591912, "num_tokens": 751363.0, "step": 330 }, { "entropy": 7.667736959457398, "epoch": 0.02156004633801004, "grad_norm": 1.15625, "learning_rate": 0.00016700000000000002, "loss": 7.0722, "mean_token_accuracy": 0.10424386709928513, "num_tokens": 762953.0, "step": 335 }, { "entropy": 7.489533710479736, "epoch": 0.02188183807439825, "grad_norm": 1.1796875, "learning_rate": 0.00016950000000000003, "loss": 6.9886, "mean_token_accuracy": 0.10709020495414734, "num_tokens": 775237.0, "step": 340 }, { "entropy": 7.635052871704102, "epoch": 0.022203629810786458, "grad_norm": 1.109375, "learning_rate": 0.00017199999999999998, "loss": 6.9133, "mean_token_accuracy": 0.11272823959589004, "num_tokens": 786262.0, "step": 345 }, { "entropy": 7.458449077606201, "epoch": 0.022525421547174667, "grad_norm": 1.2265625, "learning_rate": 0.00017449999999999999, "loss": 6.9036, "mean_token_accuracy": 0.11083822324872017, "num_tokens": 797201.0, "step": 350 }, { "entropy": 7.504961967468262, "epoch": 0.02284721328356288, "grad_norm": 1.09375, "learning_rate": 0.000177, "loss": 6.8593, "mean_token_accuracy": 0.11371754407882691, "num_tokens": 807671.0, "step": 355 }, { "entropy": 7.4689586639404295, "epoch": 0.02316900501995109, "grad_norm": 1.1015625, "learning_rate": 0.0001795, "loss": 6.8925, "mean_token_accuracy": 0.109658332914114, "num_tokens": 819142.0, "step": 360 }, { "entropy": 7.5210926055908205, "epoch": 0.023490796756339298, "grad_norm": 1.1484375, "learning_rate": 0.000182, "loss": 6.8902, "mean_token_accuracy": 0.11664389371871949, "num_tokens": 829634.0, "step": 365 }, { "entropy": 7.562618398666382, "epoch": 0.023812588492727507, "grad_norm": 1.0625, "learning_rate": 0.0001845, "loss": 6.9457, "mean_token_accuracy": 0.11507059112191201, "num_tokens": 840723.0, "step": 370 }, { "entropy": 7.44709038734436, "epoch": 0.024134380229115716, "grad_norm": 1.1171875, "learning_rate": 0.000187, "loss": 6.9014, "mean_token_accuracy": 0.11120686307549477, "num_tokens": 852299.0, "step": 375 }, { "entropy": 7.542909240722656, "epoch": 0.024456171965503926, "grad_norm": 1.1328125, "learning_rate": 0.0001895, "loss": 6.8845, "mean_token_accuracy": 0.11418962627649307, "num_tokens": 864427.0, "step": 380 }, { "entropy": 7.269602823257446, "epoch": 0.024777963701892135, "grad_norm": 1.1015625, "learning_rate": 0.000192, "loss": 6.8457, "mean_token_accuracy": 0.11314126327633858, "num_tokens": 876188.0, "step": 385 }, { "entropy": 7.539252614974975, "epoch": 0.025099755438280344, "grad_norm": 1.296875, "learning_rate": 0.0001945, "loss": 6.9751, "mean_token_accuracy": 0.10968251451849938, "num_tokens": 886835.0, "step": 390 }, { "entropy": 7.462894248962402, "epoch": 0.025421547174668553, "grad_norm": 1.09375, "learning_rate": 0.00019700000000000002, "loss": 6.8758, "mean_token_accuracy": 0.1175595462322235, "num_tokens": 899609.0, "step": 395 }, { "entropy": 7.514445400238037, "epoch": 0.025743338911056766, "grad_norm": 1.1484375, "learning_rate": 0.00019950000000000002, "loss": 6.9867, "mean_token_accuracy": 0.10821878015995026, "num_tokens": 912114.0, "step": 400 }, { "entropy": 7.434127473831177, "epoch": 0.026065130647444975, "grad_norm": 1.0078125, "learning_rate": 0.000202, "loss": 6.9875, "mean_token_accuracy": 0.1139479123055935, "num_tokens": 923788.0, "step": 405 }, { "entropy": 7.338033294677734, "epoch": 0.026386922383833184, "grad_norm": 1.234375, "learning_rate": 0.00020449999999999998, "loss": 6.6791, "mean_token_accuracy": 0.1255500763654709, "num_tokens": 934952.0, "step": 410 }, { "entropy": 7.422152519226074, "epoch": 0.026708714120221393, "grad_norm": 1.4609375, "learning_rate": 0.000207, "loss": 6.7758, "mean_token_accuracy": 0.11906903460621834, "num_tokens": 945780.0, "step": 415 }, { "entropy": 7.29374885559082, "epoch": 0.027030505856609603, "grad_norm": 1.1015625, "learning_rate": 0.0002095, "loss": 6.7765, "mean_token_accuracy": 0.12052410319447518, "num_tokens": 958502.0, "step": 420 }, { "entropy": 7.422839784622193, "epoch": 0.02735229759299781, "grad_norm": 1.46875, "learning_rate": 0.000212, "loss": 6.8635, "mean_token_accuracy": 0.11772049516439438, "num_tokens": 969339.0, "step": 425 }, { "entropy": 7.215829658508301, "epoch": 0.02767408932938602, "grad_norm": 1.125, "learning_rate": 0.0002145, "loss": 6.7171, "mean_token_accuracy": 0.12233989164233208, "num_tokens": 980260.0, "step": 430 }, { "entropy": 7.2986561298370365, "epoch": 0.02799588106577423, "grad_norm": 1.21875, "learning_rate": 0.00021700000000000002, "loss": 6.6963, "mean_token_accuracy": 0.11892440766096116, "num_tokens": 991960.0, "step": 435 }, { "entropy": 7.193790006637573, "epoch": 0.02831767280216244, "grad_norm": 1.1328125, "learning_rate": 0.0002195, "loss": 6.7273, "mean_token_accuracy": 0.11868971958756447, "num_tokens": 1002083.0, "step": 440 }, { "entropy": 7.308983230590821, "epoch": 0.02863946453855065, "grad_norm": 1.109375, "learning_rate": 0.000222, "loss": 6.7375, "mean_token_accuracy": 0.11723077073693275, "num_tokens": 1012896.0, "step": 445 }, { "entropy": 7.334416151046753, "epoch": 0.02896125627493886, "grad_norm": 1.109375, "learning_rate": 0.0002245, "loss": 6.8189, "mean_token_accuracy": 0.12101824656128883, "num_tokens": 1024570.0, "step": 450 }, { "entropy": 7.2581829071044925, "epoch": 0.02928304801132707, "grad_norm": 1.1640625, "learning_rate": 0.00022700000000000002, "loss": 6.6596, "mean_token_accuracy": 0.1274547331035137, "num_tokens": 1035934.0, "step": 455 }, { "entropy": 7.214243841171265, "epoch": 0.02960483974771528, "grad_norm": 1.109375, "learning_rate": 0.00022950000000000002, "loss": 6.8555, "mean_token_accuracy": 0.11035279110074044, "num_tokens": 1047557.0, "step": 460 }, { "entropy": 7.284564542770386, "epoch": 0.02992663148410349, "grad_norm": 1.0703125, "learning_rate": 0.00023200000000000003, "loss": 6.8011, "mean_token_accuracy": 0.11536358669400215, "num_tokens": 1059387.0, "step": 465 }, { "entropy": 7.255402135848999, "epoch": 0.030248423220491698, "grad_norm": 1.2109375, "learning_rate": 0.00023449999999999998, "loss": 6.8003, "mean_token_accuracy": 0.11578696817159653, "num_tokens": 1070756.0, "step": 470 }, { "entropy": 7.274528503417969, "epoch": 0.030570214956879907, "grad_norm": 1.2734375, "learning_rate": 0.000237, "loss": 6.7873, "mean_token_accuracy": 0.1295149154961109, "num_tokens": 1083147.0, "step": 475 }, { "entropy": 7.171627616882324, "epoch": 0.030892006693268116, "grad_norm": 1.0625, "learning_rate": 0.0002395, "loss": 6.6541, "mean_token_accuracy": 0.12174521461129188, "num_tokens": 1094300.0, "step": 480 }, { "entropy": 7.192223072052002, "epoch": 0.031213798429656325, "grad_norm": 1.015625, "learning_rate": 0.000242, "loss": 6.7988, "mean_token_accuracy": 0.11465005055069924, "num_tokens": 1105991.0, "step": 485 }, { "entropy": 7.2635111808776855, "epoch": 0.031535590166044535, "grad_norm": 1.1875, "learning_rate": 0.0002445, "loss": 6.8278, "mean_token_accuracy": 0.11537677273154259, "num_tokens": 1118065.0, "step": 490 }, { "entropy": 7.217528486251831, "epoch": 0.031857381902432744, "grad_norm": 1.3671875, "learning_rate": 0.000247, "loss": 6.772, "mean_token_accuracy": 0.12680590748786927, "num_tokens": 1130521.0, "step": 495 }, { "entropy": 7.099181175231934, "epoch": 0.03217917363882095, "grad_norm": 1.15625, "learning_rate": 0.0002495, "loss": 6.7436, "mean_token_accuracy": 0.11461131051182746, "num_tokens": 1143241.0, "step": 500 }, { "entropy": 7.2616432189941404, "epoch": 0.03250096537520916, "grad_norm": 1.078125, "learning_rate": 0.000252, "loss": 6.698, "mean_token_accuracy": 0.1210433527827263, "num_tokens": 1154240.0, "step": 505 }, { "entropy": 7.08572096824646, "epoch": 0.03282275711159737, "grad_norm": 1.0390625, "learning_rate": 0.0002545, "loss": 6.6583, "mean_token_accuracy": 0.12035112828016281, "num_tokens": 1166134.0, "step": 510 }, { "entropy": 7.13088059425354, "epoch": 0.03314454884798558, "grad_norm": 1.140625, "learning_rate": 0.000257, "loss": 6.6952, "mean_token_accuracy": 0.12703741267323493, "num_tokens": 1177183.0, "step": 515 }, { "entropy": 7.25070538520813, "epoch": 0.0334663405843738, "grad_norm": 1.15625, "learning_rate": 0.0002595, "loss": 6.8061, "mean_token_accuracy": 0.11820513978600503, "num_tokens": 1189266.0, "step": 520 }, { "entropy": 7.051825141906738, "epoch": 0.033788132320762006, "grad_norm": 1.0390625, "learning_rate": 0.000262, "loss": 6.6082, "mean_token_accuracy": 0.12360260263085365, "num_tokens": 1199718.0, "step": 525 }, { "entropy": 7.207192850112915, "epoch": 0.034109924057150215, "grad_norm": 1.1640625, "learning_rate": 0.00026450000000000003, "loss": 6.7443, "mean_token_accuracy": 0.1214994914829731, "num_tokens": 1210278.0, "step": 530 }, { "entropy": 7.183014011383056, "epoch": 0.034431715793538424, "grad_norm": 1.2109375, "learning_rate": 0.00026700000000000004, "loss": 6.6847, "mean_token_accuracy": 0.12363504841923714, "num_tokens": 1221012.0, "step": 535 }, { "entropy": 7.097731018066407, "epoch": 0.03475350752992663, "grad_norm": 1.078125, "learning_rate": 0.00026950000000000005, "loss": 6.6674, "mean_token_accuracy": 0.1205046035349369, "num_tokens": 1232687.0, "step": 540 }, { "entropy": 7.153340673446655, "epoch": 0.03507529926631484, "grad_norm": 1.1171875, "learning_rate": 0.00027200000000000005, "loss": 6.6428, "mean_token_accuracy": 0.127882944047451, "num_tokens": 1243994.0, "step": 545 }, { "entropy": 7.048250007629394, "epoch": 0.03539709100270305, "grad_norm": 1.203125, "learning_rate": 0.0002745, "loss": 6.6121, "mean_token_accuracy": 0.1261216700077057, "num_tokens": 1254705.0, "step": 550 }, { "entropy": 7.134361505508423, "epoch": 0.03571888273909126, "grad_norm": 1.15625, "learning_rate": 0.000277, "loss": 6.7227, "mean_token_accuracy": 0.12077815011143685, "num_tokens": 1266367.0, "step": 555 }, { "entropy": 7.047533082962036, "epoch": 0.03604067447547947, "grad_norm": 1.3671875, "learning_rate": 0.0002795, "loss": 6.6958, "mean_token_accuracy": 0.12296305298805237, "num_tokens": 1279004.0, "step": 560 }, { "entropy": 7.034592580795288, "epoch": 0.03636246621186768, "grad_norm": 1.1796875, "learning_rate": 0.00028199999999999997, "loss": 6.5162, "mean_token_accuracy": 0.12805850878357888, "num_tokens": 1290980.0, "step": 565 }, { "entropy": 7.040336656570434, "epoch": 0.03668425794825589, "grad_norm": 0.9375, "learning_rate": 0.0002845, "loss": 6.6749, "mean_token_accuracy": 0.12128347530961037, "num_tokens": 1302396.0, "step": 570 }, { "entropy": 7.105546283721924, "epoch": 0.0370060496846441, "grad_norm": 1.2578125, "learning_rate": 0.000287, "loss": 6.6356, "mean_token_accuracy": 0.1311293475329876, "num_tokens": 1312304.0, "step": 575 }, { "entropy": 7.081285810470581, "epoch": 0.03732784142103231, "grad_norm": 1.2890625, "learning_rate": 0.0002895, "loss": 6.7769, "mean_token_accuracy": 0.12450022101402283, "num_tokens": 1325487.0, "step": 580 }, { "entropy": 7.005313682556152, "epoch": 0.037649633157420516, "grad_norm": 1.1484375, "learning_rate": 0.000292, "loss": 6.6247, "mean_token_accuracy": 0.126084253937006, "num_tokens": 1336754.0, "step": 585 }, { "entropy": 7.028646039962768, "epoch": 0.037971424893808725, "grad_norm": 1.2265625, "learning_rate": 0.0002945, "loss": 6.6309, "mean_token_accuracy": 0.12374395728111268, "num_tokens": 1347918.0, "step": 590 }, { "entropy": 7.05291862487793, "epoch": 0.038293216630196934, "grad_norm": 1.0078125, "learning_rate": 0.000297, "loss": 6.6336, "mean_token_accuracy": 0.13012145236134529, "num_tokens": 1359981.0, "step": 595 }, { "entropy": 7.028671169281006, "epoch": 0.03861500836658514, "grad_norm": 1.046875, "learning_rate": 0.0002995, "loss": 6.6423, "mean_token_accuracy": 0.1260800801217556, "num_tokens": 1371359.0, "step": 600 }, { "entropy": 7.067501354217529, "epoch": 0.03893680010297335, "grad_norm": 1.125, "learning_rate": 0.000302, "loss": 6.6909, "mean_token_accuracy": 0.11782569289207459, "num_tokens": 1383829.0, "step": 605 }, { "entropy": 7.0067911624908445, "epoch": 0.03925859183936156, "grad_norm": 1.2578125, "learning_rate": 0.0003045, "loss": 6.5645, "mean_token_accuracy": 0.13620257899165153, "num_tokens": 1394266.0, "step": 610 }, { "entropy": 6.985071325302124, "epoch": 0.03958038357574978, "grad_norm": 1.1015625, "learning_rate": 0.000307, "loss": 6.5691, "mean_token_accuracy": 0.1302391119301319, "num_tokens": 1405798.0, "step": 615 }, { "entropy": 6.973874282836914, "epoch": 0.03990217531213799, "grad_norm": 1.265625, "learning_rate": 0.0003095, "loss": 6.5689, "mean_token_accuracy": 0.13187146857380866, "num_tokens": 1417411.0, "step": 620 }, { "entropy": 7.0129351139068605, "epoch": 0.040223967048526196, "grad_norm": 1.0078125, "learning_rate": 0.000312, "loss": 6.6911, "mean_token_accuracy": 0.12921356335282325, "num_tokens": 1428987.0, "step": 625 }, { "entropy": 6.938956356048584, "epoch": 0.040545758784914405, "grad_norm": 1.25, "learning_rate": 0.0003145, "loss": 6.6049, "mean_token_accuracy": 0.12962101995944977, "num_tokens": 1440023.0, "step": 630 }, { "entropy": 7.100988531112671, "epoch": 0.040867550521302615, "grad_norm": 1.3046875, "learning_rate": 0.000317, "loss": 6.6762, "mean_token_accuracy": 0.1187206856906414, "num_tokens": 1451078.0, "step": 635 }, { "entropy": 7.031370496749878, "epoch": 0.041189342257690824, "grad_norm": 1.0703125, "learning_rate": 0.0003195, "loss": 6.6551, "mean_token_accuracy": 0.12284370735287667, "num_tokens": 1462446.0, "step": 640 }, { "entropy": 6.888606119155884, "epoch": 0.04151113399407903, "grad_norm": 1.3671875, "learning_rate": 0.000322, "loss": 6.5127, "mean_token_accuracy": 0.131097362190485, "num_tokens": 1472084.0, "step": 645 }, { "entropy": 6.948457860946656, "epoch": 0.04183292573046724, "grad_norm": 1.0625, "learning_rate": 0.00032450000000000003, "loss": 6.553, "mean_token_accuracy": 0.1207494542002678, "num_tokens": 1482464.0, "step": 650 }, { "entropy": 6.960102081298828, "epoch": 0.04215471746685545, "grad_norm": 1.1640625, "learning_rate": 0.00032700000000000003, "loss": 6.592, "mean_token_accuracy": 0.12484122142195701, "num_tokens": 1492789.0, "step": 655 }, { "entropy": 6.917847633361816, "epoch": 0.04247650920324366, "grad_norm": 1.140625, "learning_rate": 0.00032950000000000004, "loss": 6.5871, "mean_token_accuracy": 0.1326150640845299, "num_tokens": 1504438.0, "step": 660 }, { "entropy": 7.005792331695557, "epoch": 0.04279830093963187, "grad_norm": 1.0859375, "learning_rate": 0.00033200000000000005, "loss": 6.5294, "mean_token_accuracy": 0.1296870678663254, "num_tokens": 1515430.0, "step": 665 }, { "entropy": 6.8461448669433596, "epoch": 0.04312009267602008, "grad_norm": 1.125, "learning_rate": 0.00033450000000000005, "loss": 6.4998, "mean_token_accuracy": 0.13402296751737594, "num_tokens": 1525804.0, "step": 670 }, { "entropy": 6.924587154388428, "epoch": 0.04344188441240829, "grad_norm": 1.0625, "learning_rate": 0.000337, "loss": 6.5119, "mean_token_accuracy": 0.12666192203760146, "num_tokens": 1537638.0, "step": 675 }, { "entropy": 6.82023057937622, "epoch": 0.0437636761487965, "grad_norm": 1.34375, "learning_rate": 0.0003395, "loss": 6.4856, "mean_token_accuracy": 0.13445887267589568, "num_tokens": 1548232.0, "step": 680 }, { "entropy": 6.93139066696167, "epoch": 0.044085467885184706, "grad_norm": 1.2734375, "learning_rate": 0.000342, "loss": 6.5018, "mean_token_accuracy": 0.13019829168915747, "num_tokens": 1558781.0, "step": 685 }, { "entropy": 6.913920307159424, "epoch": 0.044407259621572916, "grad_norm": 1.1328125, "learning_rate": 0.00034449999999999997, "loss": 6.4656, "mean_token_accuracy": 0.1352573812007904, "num_tokens": 1571387.0, "step": 690 }, { "entropy": 6.8577742099761965, "epoch": 0.044729051357961125, "grad_norm": 1.1640625, "learning_rate": 0.000347, "loss": 6.5251, "mean_token_accuracy": 0.13332423493266105, "num_tokens": 1582471.0, "step": 695 }, { "entropy": 6.825550699234009, "epoch": 0.045050843094349334, "grad_norm": 1.1875, "learning_rate": 0.0003495, "loss": 6.484, "mean_token_accuracy": 0.13259591534733772, "num_tokens": 1592967.0, "step": 700 }, { "entropy": 6.84607195854187, "epoch": 0.04537263483073754, "grad_norm": 1.15625, "learning_rate": 0.000352, "loss": 6.4834, "mean_token_accuracy": 0.1336855672299862, "num_tokens": 1603772.0, "step": 705 }, { "entropy": 6.906696319580078, "epoch": 0.04569442656712576, "grad_norm": 1.1953125, "learning_rate": 0.0003545, "loss": 6.4789, "mean_token_accuracy": 0.12700057551264762, "num_tokens": 1614924.0, "step": 710 }, { "entropy": 6.7945763111114506, "epoch": 0.04601621830351397, "grad_norm": 0.953125, "learning_rate": 0.000357, "loss": 6.4715, "mean_token_accuracy": 0.13077478110790253, "num_tokens": 1626947.0, "step": 715 }, { "entropy": 6.796080684661865, "epoch": 0.04633801003990218, "grad_norm": 1.03125, "learning_rate": 0.0003595, "loss": 6.3518, "mean_token_accuracy": 0.13691332638263704, "num_tokens": 1638651.0, "step": 720 }, { "entropy": 6.753641128540039, "epoch": 0.04665980177629039, "grad_norm": 1.1484375, "learning_rate": 0.000362, "loss": 6.4204, "mean_token_accuracy": 0.1394519940018654, "num_tokens": 1650157.0, "step": 725 }, { "entropy": 6.7741881847381595, "epoch": 0.046981593512678596, "grad_norm": 1.0078125, "learning_rate": 0.0003645, "loss": 6.418, "mean_token_accuracy": 0.133515302836895, "num_tokens": 1661763.0, "step": 730 }, { "entropy": 6.971210908889771, "epoch": 0.047303385249066805, "grad_norm": 1.109375, "learning_rate": 0.000367, "loss": 6.6075, "mean_token_accuracy": 0.12115295752882957, "num_tokens": 1674051.0, "step": 735 }, { "entropy": 6.856794738769532, "epoch": 0.047625176985455014, "grad_norm": 1.2578125, "learning_rate": 0.0003695, "loss": 6.4626, "mean_token_accuracy": 0.1338093623518944, "num_tokens": 1685240.0, "step": 740 }, { "entropy": 6.777393484115601, "epoch": 0.047946968721843224, "grad_norm": 1.0546875, "learning_rate": 0.000372, "loss": 6.4435, "mean_token_accuracy": 0.1303575173020363, "num_tokens": 1697472.0, "step": 745 }, { "entropy": 6.796992444992066, "epoch": 0.04826876045823143, "grad_norm": 1.1171875, "learning_rate": 0.0003745, "loss": 6.4543, "mean_token_accuracy": 0.1324995703995228, "num_tokens": 1708383.0, "step": 750 }, { "entropy": 6.788374280929565, "epoch": 0.04859055219461964, "grad_norm": 1.0390625, "learning_rate": 0.000377, "loss": 6.4631, "mean_token_accuracy": 0.13005806729197503, "num_tokens": 1720367.0, "step": 755 }, { "entropy": 6.780432558059692, "epoch": 0.04891234393100785, "grad_norm": 1.1875, "learning_rate": 0.0003795, "loss": 6.445, "mean_token_accuracy": 0.13468715846538543, "num_tokens": 1731252.0, "step": 760 }, { "entropy": 6.793448638916016, "epoch": 0.04923413566739606, "grad_norm": 1.140625, "learning_rate": 0.000382, "loss": 6.4776, "mean_token_accuracy": 0.1371725916862488, "num_tokens": 1741865.0, "step": 765 }, { "entropy": 6.7858991622924805, "epoch": 0.04955592740378427, "grad_norm": 1.0859375, "learning_rate": 0.0003845, "loss": 6.4394, "mean_token_accuracy": 0.13146187737584114, "num_tokens": 1754036.0, "step": 770 }, { "entropy": 6.814309310913086, "epoch": 0.04987771914017248, "grad_norm": 1.296875, "learning_rate": 0.00038700000000000003, "loss": 6.4836, "mean_token_accuracy": 0.12894209176301957, "num_tokens": 1764717.0, "step": 775 }, { "entropy": 6.754202890396118, "epoch": 0.05019951087656069, "grad_norm": 0.9609375, "learning_rate": 0.00038950000000000003, "loss": 6.383, "mean_token_accuracy": 0.13913563415408134, "num_tokens": 1777078.0, "step": 780 }, { "entropy": 6.852421665191651, "epoch": 0.0505213026129489, "grad_norm": 1.0390625, "learning_rate": 0.00039200000000000004, "loss": 6.453, "mean_token_accuracy": 0.12606742605566978, "num_tokens": 1788393.0, "step": 785 }, { "entropy": 6.727867794036865, "epoch": 0.050843094349337106, "grad_norm": 1.109375, "learning_rate": 0.00039450000000000005, "loss": 6.5638, "mean_token_accuracy": 0.12575344145298004, "num_tokens": 1799535.0, "step": 790 }, { "entropy": 6.849759912490844, "epoch": 0.051164886085725315, "grad_norm": 1.2265625, "learning_rate": 0.00039700000000000005, "loss": 6.3297, "mean_token_accuracy": 0.13775620311498643, "num_tokens": 1809733.0, "step": 795 }, { "entropy": 6.681720924377442, "epoch": 0.05148667782211353, "grad_norm": 0.9609375, "learning_rate": 0.0003995, "loss": 6.3793, "mean_token_accuracy": 0.13796758204698562, "num_tokens": 1821535.0, "step": 800 }, { "entropy": 6.674613428115845, "epoch": 0.05180846955850174, "grad_norm": 1.140625, "learning_rate": 0.000402, "loss": 6.3629, "mean_token_accuracy": 0.13800609484314919, "num_tokens": 1832355.0, "step": 805 }, { "entropy": 6.773230028152466, "epoch": 0.05213026129488995, "grad_norm": 1.0390625, "learning_rate": 0.0004045, "loss": 6.3386, "mean_token_accuracy": 0.1425774149596691, "num_tokens": 1843340.0, "step": 810 }, { "entropy": 6.642430782318115, "epoch": 0.05245205303127816, "grad_norm": 1.265625, "learning_rate": 0.00040699999999999997, "loss": 6.3684, "mean_token_accuracy": 0.13916084170341492, "num_tokens": 1854233.0, "step": 815 }, { "entropy": 6.633238887786865, "epoch": 0.05277384476766637, "grad_norm": 1.046875, "learning_rate": 0.0004095, "loss": 6.3114, "mean_token_accuracy": 0.13679933026432992, "num_tokens": 1864860.0, "step": 820 }, { "entropy": 6.780126476287842, "epoch": 0.05309563650405458, "grad_norm": 1.0625, "learning_rate": 0.000412, "loss": 6.2908, "mean_token_accuracy": 0.14247430860996246, "num_tokens": 1875981.0, "step": 825 }, { "entropy": 6.616991996765137, "epoch": 0.05341742824044279, "grad_norm": 0.99609375, "learning_rate": 0.0004145, "loss": 6.4106, "mean_token_accuracy": 0.13161869645118712, "num_tokens": 1889147.0, "step": 830 }, { "entropy": 6.857424640655518, "epoch": 0.053739219976830996, "grad_norm": 1.1328125, "learning_rate": 0.000417, "loss": 6.4176, "mean_token_accuracy": 0.13287485763430595, "num_tokens": 1900823.0, "step": 835 }, { "entropy": 6.622591257095337, "epoch": 0.054061011713219205, "grad_norm": 1.15625, "learning_rate": 0.0004195, "loss": 6.3323, "mean_token_accuracy": 0.13574840426445006, "num_tokens": 1910882.0, "step": 840 }, { "entropy": 6.52352614402771, "epoch": 0.054382803449607414, "grad_norm": 1.2578125, "learning_rate": 0.000422, "loss": 6.2885, "mean_token_accuracy": 0.1370130032300949, "num_tokens": 1922228.0, "step": 845 }, { "entropy": 6.675861597061157, "epoch": 0.05470459518599562, "grad_norm": 1.125, "learning_rate": 0.0004245, "loss": 6.3254, "mean_token_accuracy": 0.13999047502875328, "num_tokens": 1933400.0, "step": 850 }, { "entropy": 6.6365453720092775, "epoch": 0.05502638692238383, "grad_norm": 1.1171875, "learning_rate": 0.000427, "loss": 6.3747, "mean_token_accuracy": 0.13206338435411452, "num_tokens": 1944717.0, "step": 855 }, { "entropy": 6.806672430038452, "epoch": 0.05534817865877204, "grad_norm": 1.2265625, "learning_rate": 0.0004295, "loss": 6.4465, "mean_token_accuracy": 0.1298723392188549, "num_tokens": 1956116.0, "step": 860 }, { "entropy": 6.787279891967773, "epoch": 0.05566997039516025, "grad_norm": 1.1640625, "learning_rate": 0.000432, "loss": 6.4613, "mean_token_accuracy": 0.13620107173919677, "num_tokens": 1967183.0, "step": 865 }, { "entropy": 6.522842454910278, "epoch": 0.05599176213154846, "grad_norm": 1.0, "learning_rate": 0.0004345, "loss": 6.2558, "mean_token_accuracy": 0.14262447282671928, "num_tokens": 1978943.0, "step": 870 }, { "entropy": 6.580580043792724, "epoch": 0.05631355386793667, "grad_norm": 1.109375, "learning_rate": 0.000437, "loss": 6.2737, "mean_token_accuracy": 0.14003785327076912, "num_tokens": 1990818.0, "step": 875 }, { "entropy": 6.574157285690307, "epoch": 0.05663534560432488, "grad_norm": 1.0390625, "learning_rate": 0.0004395, "loss": 6.2641, "mean_token_accuracy": 0.14258711114525796, "num_tokens": 2002309.0, "step": 880 }, { "entropy": 6.655279111862183, "epoch": 0.05695713734071309, "grad_norm": 0.9453125, "learning_rate": 0.000442, "loss": 6.4362, "mean_token_accuracy": 0.1311865270137787, "num_tokens": 2013131.0, "step": 885 }, { "entropy": 6.861530065536499, "epoch": 0.0572789290771013, "grad_norm": 1.078125, "learning_rate": 0.0004445, "loss": 6.5215, "mean_token_accuracy": 0.12429815754294396, "num_tokens": 2024881.0, "step": 890 }, { "entropy": 6.6120974063873295, "epoch": 0.05760072081348951, "grad_norm": 1.1015625, "learning_rate": 0.000447, "loss": 6.3878, "mean_token_accuracy": 0.13595437854528428, "num_tokens": 2035633.0, "step": 895 }, { "entropy": 6.62742280960083, "epoch": 0.05792251254987772, "grad_norm": 1.125, "learning_rate": 0.00044950000000000003, "loss": 6.2356, "mean_token_accuracy": 0.14306803271174431, "num_tokens": 2046237.0, "step": 900 }, { "entropy": 6.552933835983277, "epoch": 0.05824430428626593, "grad_norm": 1.25, "learning_rate": 0.00045200000000000004, "loss": 6.2148, "mean_token_accuracy": 0.14152271002531053, "num_tokens": 2058158.0, "step": 905 }, { "entropy": 6.638343429565429, "epoch": 0.05856609602265414, "grad_norm": 1.21875, "learning_rate": 0.00045450000000000004, "loss": 6.4302, "mean_token_accuracy": 0.13081190586090088, "num_tokens": 2068364.0, "step": 910 }, { "entropy": 6.667097568511963, "epoch": 0.05888788775904235, "grad_norm": 1.0859375, "learning_rate": 0.00045700000000000005, "loss": 6.3678, "mean_token_accuracy": 0.12357937470078469, "num_tokens": 2080168.0, "step": 915 }, { "entropy": 6.584589195251465, "epoch": 0.05920967949543056, "grad_norm": 1.1171875, "learning_rate": 0.00045950000000000006, "loss": 6.2459, "mean_token_accuracy": 0.14396512135863304, "num_tokens": 2089908.0, "step": 920 }, { "entropy": 6.65417799949646, "epoch": 0.05953147123181877, "grad_norm": 1.0625, "learning_rate": 0.000462, "loss": 6.3424, "mean_token_accuracy": 0.13211728110909463, "num_tokens": 2101403.0, "step": 925 }, { "entropy": 6.49568543434143, "epoch": 0.05985326296820698, "grad_norm": 0.9453125, "learning_rate": 0.0004645, "loss": 6.2153, "mean_token_accuracy": 0.14081560969352722, "num_tokens": 2113940.0, "step": 930 }, { "entropy": 6.544306850433349, "epoch": 0.060175054704595186, "grad_norm": 1.046875, "learning_rate": 0.000467, "loss": 6.2557, "mean_token_accuracy": 0.1435394138097763, "num_tokens": 2124467.0, "step": 935 }, { "entropy": 6.588162183761597, "epoch": 0.060496846440983396, "grad_norm": 1.265625, "learning_rate": 0.0004695, "loss": 6.2399, "mean_token_accuracy": 0.1443529948592186, "num_tokens": 2136147.0, "step": 940 }, { "entropy": 6.542601013183594, "epoch": 0.060818638177371605, "grad_norm": 1.078125, "learning_rate": 0.000472, "loss": 6.2855, "mean_token_accuracy": 0.14248571097850798, "num_tokens": 2147494.0, "step": 945 }, { "entropy": 6.513602781295776, "epoch": 0.061140429913759814, "grad_norm": 1.1328125, "learning_rate": 0.0004745, "loss": 6.1673, "mean_token_accuracy": 0.14396455883979797, "num_tokens": 2157660.0, "step": 950 }, { "entropy": 6.415520524978637, "epoch": 0.06146222165014802, "grad_norm": 0.91796875, "learning_rate": 0.000477, "loss": 6.2775, "mean_token_accuracy": 0.1388951927423477, "num_tokens": 2170629.0, "step": 955 }, { "entropy": 6.536985874176025, "epoch": 0.06178401338653623, "grad_norm": 1.296875, "learning_rate": 0.0004795, "loss": 6.1999, "mean_token_accuracy": 0.14611724615097046, "num_tokens": 2181945.0, "step": 960 }, { "entropy": 6.555672550201416, "epoch": 0.06210580512292444, "grad_norm": 1.03125, "learning_rate": 0.000482, "loss": 6.2884, "mean_token_accuracy": 0.13931862711906434, "num_tokens": 2192975.0, "step": 965 }, { "entropy": 6.523555850982666, "epoch": 0.06242759685931265, "grad_norm": 1.140625, "learning_rate": 0.0004845, "loss": 6.2292, "mean_token_accuracy": 0.14297346845269204, "num_tokens": 2203929.0, "step": 970 }, { "entropy": 6.551759815216064, "epoch": 0.06274938859570087, "grad_norm": 1.0234375, "learning_rate": 0.000487, "loss": 6.2444, "mean_token_accuracy": 0.14618593230843543, "num_tokens": 2214296.0, "step": 975 }, { "entropy": 6.542734003067016, "epoch": 0.06307118033208907, "grad_norm": 1.125, "learning_rate": 0.0004895, "loss": 6.2657, "mean_token_accuracy": 0.1420005366206169, "num_tokens": 2224834.0, "step": 980 }, { "entropy": 6.490674257278442, "epoch": 0.06339297206847729, "grad_norm": 1.1171875, "learning_rate": 0.000492, "loss": 6.1984, "mean_token_accuracy": 0.14470900744199752, "num_tokens": 2236261.0, "step": 985 }, { "entropy": 6.574054622650147, "epoch": 0.06371476380486549, "grad_norm": 1.03125, "learning_rate": 0.0004945, "loss": 6.445, "mean_token_accuracy": 0.1385732315480709, "num_tokens": 2248056.0, "step": 990 }, { "entropy": 6.560631370544433, "epoch": 0.0640365555412537, "grad_norm": 1.046875, "learning_rate": 0.000497, "loss": 6.2375, "mean_token_accuracy": 0.13548775166273117, "num_tokens": 2258304.0, "step": 995 }, { "entropy": 6.553973388671875, "epoch": 0.0643583472776419, "grad_norm": 1.1015625, "learning_rate": 0.0004995, "loss": 6.3626, "mean_token_accuracy": 0.14208254665136338, "num_tokens": 2269541.0, "step": 1000 }, { "entropy": 6.420248031616211, "epoch": 0.06468013901403012, "grad_norm": 1.21875, "learning_rate": 0.000499998026082006, "loss": 6.1734, "mean_token_accuracy": 0.15447934120893478, "num_tokens": 2280812.0, "step": 1005 }, { "entropy": 6.664107942581177, "epoch": 0.06500193075041832, "grad_norm": 1.1171875, "learning_rate": 0.0004999900070995136, "loss": 6.3506, "mean_token_accuracy": 0.14142308607697487, "num_tokens": 2291833.0, "step": 1010 }, { "entropy": 6.523155164718628, "epoch": 0.06532372248680654, "grad_norm": 1.1328125, "learning_rate": 0.0004999758199023239, "loss": 6.2563, "mean_token_accuracy": 0.145108150690794, "num_tokens": 2302218.0, "step": 1015 }, { "entropy": 6.581012916564942, "epoch": 0.06564551422319474, "grad_norm": 1.078125, "learning_rate": 0.0004999554648793858, "loss": 6.3207, "mean_token_accuracy": 0.13909797295928, "num_tokens": 2313355.0, "step": 1020 }, { "entropy": 6.397714710235595, "epoch": 0.06596730595958296, "grad_norm": 1.25, "learning_rate": 0.0004999289425887425, "loss": 6.1485, "mean_token_accuracy": 0.145339135825634, "num_tokens": 2324652.0, "step": 1025 }, { "entropy": 6.521378660202027, "epoch": 0.06628909769597116, "grad_norm": 1.1328125, "learning_rate": 0.0004998962537575161, "loss": 6.2546, "mean_token_accuracy": 0.1398783229291439, "num_tokens": 2335006.0, "step": 1030 }, { "entropy": 6.371570062637329, "epoch": 0.06661088943235938, "grad_norm": 1.0859375, "learning_rate": 0.0004998573992818874, "loss": 6.1238, "mean_token_accuracy": 0.14918210208415986, "num_tokens": 2347261.0, "step": 1035 }, { "entropy": 6.545182466506958, "epoch": 0.0669326811687476, "grad_norm": 1.0859375, "learning_rate": 0.0004998123802270715, "loss": 6.2314, "mean_token_accuracy": 0.14083297401666642, "num_tokens": 2358106.0, "step": 1040 }, { "entropy": 6.477479410171509, "epoch": 0.0672544729051358, "grad_norm": 1.0703125, "learning_rate": 0.0004997611978272886, "loss": 6.2811, "mean_token_accuracy": 0.14108368679881095, "num_tokens": 2369182.0, "step": 1045 }, { "entropy": 6.415492010116577, "epoch": 0.06757626464152401, "grad_norm": 1.0625, "learning_rate": 0.0004997038534857298, "loss": 6.0323, "mean_token_accuracy": 0.150262039154768, "num_tokens": 2379298.0, "step": 1050 }, { "entropy": 6.391033077239991, "epoch": 0.06789805637791221, "grad_norm": 1.125, "learning_rate": 0.0004996403487745194, "loss": 6.1398, "mean_token_accuracy": 0.14792790189385413, "num_tokens": 2389920.0, "step": 1055 }, { "entropy": 6.480355501174927, "epoch": 0.06821984811430043, "grad_norm": 1.0, "learning_rate": 0.000499570685434671, "loss": 6.2449, "mean_token_accuracy": 0.13905822485685349, "num_tokens": 2401743.0, "step": 1060 }, { "entropy": 6.476265621185303, "epoch": 0.06854163985068863, "grad_norm": 1.125, "learning_rate": 0.0004994948653760405, "loss": 6.2046, "mean_token_accuracy": 0.14363889396190643, "num_tokens": 2411770.0, "step": 1065 }, { "entropy": 6.361932802200317, "epoch": 0.06886343158707685, "grad_norm": 1.21875, "learning_rate": 0.0004994128906772729, "loss": 6.1164, "mean_token_accuracy": 0.14849536269903182, "num_tokens": 2422448.0, "step": 1070 }, { "entropy": 6.517858362197876, "epoch": 0.06918522332346505, "grad_norm": 1.15625, "learning_rate": 0.000499324763585746, "loss": 6.1835, "mean_token_accuracy": 0.14678900837898254, "num_tokens": 2433428.0, "step": 1075 }, { "entropy": 6.331155014038086, "epoch": 0.06950701505985327, "grad_norm": 1.0390625, "learning_rate": 0.0004992304865175085, "loss": 6.1545, "mean_token_accuracy": 0.14461304917931556, "num_tokens": 2445538.0, "step": 1080 }, { "entropy": 6.442676591873169, "epoch": 0.06982880679624147, "grad_norm": 1.125, "learning_rate": 0.0004991300620572138, "loss": 6.1283, "mean_token_accuracy": 0.14782453551888466, "num_tokens": 2455656.0, "step": 1085 }, { "entropy": 6.333368253707886, "epoch": 0.07015059853262968, "grad_norm": 1.21875, "learning_rate": 0.0004990234929580494, "loss": 6.1665, "mean_token_accuracy": 0.14236130341887474, "num_tokens": 2466933.0, "step": 1090 }, { "entropy": 6.4185097217559814, "epoch": 0.07047239026901789, "grad_norm": 1.0703125, "learning_rate": 0.0004989107821416609, "loss": 6.2137, "mean_token_accuracy": 0.14996169060468673, "num_tokens": 2479501.0, "step": 1095 }, { "entropy": 6.408093643188477, "epoch": 0.0707941820054061, "grad_norm": 1.0, "learning_rate": 0.0004987919326980723, "loss": 6.1955, "mean_token_accuracy": 0.13943222388625146, "num_tokens": 2491571.0, "step": 1100 }, { "entropy": 6.328987503051758, "epoch": 0.0711159737417943, "grad_norm": 1.1875, "learning_rate": 0.0004986669478856011, "loss": 6.0414, "mean_token_accuracy": 0.15177379101514815, "num_tokens": 2502517.0, "step": 1105 }, { "entropy": 6.463210535049439, "epoch": 0.07143776547818252, "grad_norm": 1.0390625, "learning_rate": 0.0004985358311307688, "loss": 6.2415, "mean_token_accuracy": 0.14047156423330306, "num_tokens": 2514711.0, "step": 1110 }, { "entropy": 6.4414870262146, "epoch": 0.07175955721457072, "grad_norm": 1.0234375, "learning_rate": 0.0004983985860282081, "loss": 6.2103, "mean_token_accuracy": 0.14568767324090004, "num_tokens": 2526473.0, "step": 1115 }, { "entropy": 6.478610181808472, "epoch": 0.07208134895095894, "grad_norm": 1.1171875, "learning_rate": 0.0004982552163405623, "loss": 6.1723, "mean_token_accuracy": 0.14119128584861756, "num_tokens": 2537346.0, "step": 1120 }, { "entropy": 6.40332260131836, "epoch": 0.07240314068734714, "grad_norm": 1.0703125, "learning_rate": 0.0004981057259983839, "loss": 6.2217, "mean_token_accuracy": 0.13824794590473174, "num_tokens": 2549476.0, "step": 1125 }, { "entropy": 6.371269559860229, "epoch": 0.07272493242373536, "grad_norm": 1.046875, "learning_rate": 0.0004979501191000262, "loss": 6.113, "mean_token_accuracy": 0.14911531060934066, "num_tokens": 2559766.0, "step": 1130 }, { "entropy": 6.425234127044678, "epoch": 0.07304672416012357, "grad_norm": 0.94921875, "learning_rate": 0.0004977883999115311, "loss": 6.2251, "mean_token_accuracy": 0.14199284091591835, "num_tokens": 2571559.0, "step": 1135 }, { "entropy": 6.431259536743164, "epoch": 0.07336851589651178, "grad_norm": 1.03125, "learning_rate": 0.0004976205728665113, "loss": 6.1112, "mean_token_accuracy": 0.15070913657546042, "num_tokens": 2582530.0, "step": 1140 }, { "entropy": 6.24943962097168, "epoch": 0.07369030763289999, "grad_norm": 1.125, "learning_rate": 0.0004974466425660307, "loss": 6.0109, "mean_token_accuracy": 0.15389537215232849, "num_tokens": 2594100.0, "step": 1145 }, { "entropy": 6.366129446029663, "epoch": 0.0740120993692882, "grad_norm": 1.0546875, "learning_rate": 0.0004972666137784759, "loss": 6.2097, "mean_token_accuracy": 0.14721803665161132, "num_tokens": 2605853.0, "step": 1150 }, { "entropy": 6.466001224517822, "epoch": 0.07433389110567641, "grad_norm": 1.046875, "learning_rate": 0.0004970804914394271, "loss": 6.1948, "mean_token_accuracy": 0.14637096226215363, "num_tokens": 2616298.0, "step": 1155 }, { "entropy": 6.396643543243409, "epoch": 0.07465568284206461, "grad_norm": 1.046875, "learning_rate": 0.0004968882806515225, "loss": 6.185, "mean_token_accuracy": 0.14693560302257538, "num_tokens": 2627103.0, "step": 1160 }, { "entropy": 6.439416837692261, "epoch": 0.07497747457845283, "grad_norm": 1.140625, "learning_rate": 0.0004966899866843177, "loss": 6.1133, "mean_token_accuracy": 0.14630427211523056, "num_tokens": 2638657.0, "step": 1165 }, { "entropy": 6.329187059402466, "epoch": 0.07529926631484103, "grad_norm": 1.015625, "learning_rate": 0.000496485614974142, "loss": 6.228, "mean_token_accuracy": 0.1431046985089779, "num_tokens": 2650170.0, "step": 1170 }, { "entropy": 6.464993619918824, "epoch": 0.07562105805122925, "grad_norm": 0.9765625, "learning_rate": 0.0004962751711239492, "loss": 6.1557, "mean_token_accuracy": 0.14459144622087478, "num_tokens": 2662060.0, "step": 1175 }, { "entropy": 6.411845684051514, "epoch": 0.07594284978761745, "grad_norm": 0.94921875, "learning_rate": 0.0004960586609031636, "loss": 6.2545, "mean_token_accuracy": 0.14064157232642174, "num_tokens": 2674031.0, "step": 1180 }, { "entropy": 6.344238042831421, "epoch": 0.07626464152400567, "grad_norm": 0.94140625, "learning_rate": 0.0004958360902475224, "loss": 6.0551, "mean_token_accuracy": 0.15323207825422286, "num_tokens": 2685133.0, "step": 1185 }, { "entropy": 6.328037738800049, "epoch": 0.07658643326039387, "grad_norm": 1.09375, "learning_rate": 0.0004956074652589125, "loss": 6.19, "mean_token_accuracy": 0.14459021687507628, "num_tokens": 2695256.0, "step": 1190 }, { "entropy": 6.494858503341675, "epoch": 0.07690822499678208, "grad_norm": 1.0703125, "learning_rate": 0.0004953727922052035, "loss": 6.1907, "mean_token_accuracy": 0.1448133870959282, "num_tokens": 2705322.0, "step": 1195 }, { "entropy": 6.359596300125122, "epoch": 0.07723001673317029, "grad_norm": 0.953125, "learning_rate": 0.0004951320775200756, "loss": 6.1101, "mean_token_accuracy": 0.14269352331757545, "num_tokens": 2717911.0, "step": 1200 }, { "entropy": 6.399364423751831, "epoch": 0.0775518084695585, "grad_norm": 1.2578125, "learning_rate": 0.0004948853278028436, "loss": 6.2189, "mean_token_accuracy": 0.13950742781162262, "num_tokens": 2729321.0, "step": 1205 }, { "entropy": 6.399625301361084, "epoch": 0.0778736002059467, "grad_norm": 1.078125, "learning_rate": 0.0004946325498182755, "loss": 6.1091, "mean_token_accuracy": 0.14936656802892684, "num_tokens": 2740095.0, "step": 1210 }, { "entropy": 6.198732805252075, "epoch": 0.07819539194233492, "grad_norm": 1.0859375, "learning_rate": 0.0004943737504964076, "loss": 6.0177, "mean_token_accuracy": 0.1528451532125473, "num_tokens": 2750443.0, "step": 1215 }, { "entropy": 6.362048006057739, "epoch": 0.07851718367872312, "grad_norm": 1.0, "learning_rate": 0.000494108936932354, "loss": 6.0327, "mean_token_accuracy": 0.15278265327215196, "num_tokens": 2761578.0, "step": 1220 }, { "entropy": 6.290820360183716, "epoch": 0.07883897541511134, "grad_norm": 1.03125, "learning_rate": 0.0004938381163861124, "loss": 6.1404, "mean_token_accuracy": 0.1517237439751625, "num_tokens": 2773410.0, "step": 1225 }, { "entropy": 6.38767557144165, "epoch": 0.07916076715149956, "grad_norm": 1.0546875, "learning_rate": 0.0004935612962823645, "loss": 6.1139, "mean_token_accuracy": 0.14652161300182343, "num_tokens": 2784507.0, "step": 1230 }, { "entropy": 6.147325468063355, "epoch": 0.07948255888788776, "grad_norm": 1.0234375, "learning_rate": 0.0004932784842102739, "loss": 6.0599, "mean_token_accuracy": 0.15777070224285125, "num_tokens": 2796075.0, "step": 1235 }, { "entropy": 6.353684997558593, "epoch": 0.07980435062427597, "grad_norm": 0.95703125, "learning_rate": 0.0004929896879232758, "loss": 6.0749, "mean_token_accuracy": 0.1501803681254387, "num_tokens": 2808124.0, "step": 1240 }, { "entropy": 6.35121603012085, "epoch": 0.08012614236066418, "grad_norm": 1.0703125, "learning_rate": 0.0004926949153388668, "loss": 6.127, "mean_token_accuracy": 0.1444758579134941, "num_tokens": 2819010.0, "step": 1245 }, { "entropy": 6.343505907058716, "epoch": 0.08044793409705239, "grad_norm": 0.94140625, "learning_rate": 0.0004923941745383859, "loss": 6.0505, "mean_token_accuracy": 0.15336280614137648, "num_tokens": 2829809.0, "step": 1250 }, { "entropy": 6.26406078338623, "epoch": 0.0807697258334406, "grad_norm": 1.1484375, "learning_rate": 0.000492087473766794, "loss": 6.058, "mean_token_accuracy": 0.1509227141737938, "num_tokens": 2841237.0, "step": 1255 }, { "entropy": 6.227289295196533, "epoch": 0.08109151756982881, "grad_norm": 0.94140625, "learning_rate": 0.000491774821432448, "loss": 6.0712, "mean_token_accuracy": 0.14665706008672713, "num_tokens": 2853664.0, "step": 1260 }, { "entropy": 6.25519208908081, "epoch": 0.08141330930621701, "grad_norm": 1.0703125, "learning_rate": 0.0004914562261068693, "loss": 6.0295, "mean_token_accuracy": 0.15138522982597352, "num_tokens": 2864821.0, "step": 1265 }, { "entropy": 6.467222690582275, "epoch": 0.08173510104260523, "grad_norm": 1.09375, "learning_rate": 0.0004911316965245098, "loss": 6.2744, "mean_token_accuracy": 0.1357764020562172, "num_tokens": 2878847.0, "step": 1270 }, { "entropy": 6.337312507629394, "epoch": 0.08205689277899343, "grad_norm": 1.0703125, "learning_rate": 0.000490801241582512, "loss": 6.1474, "mean_token_accuracy": 0.14485098645091057, "num_tokens": 2891172.0, "step": 1275 }, { "entropy": 6.462904167175293, "epoch": 0.08237868451538165, "grad_norm": 1.1171875, "learning_rate": 0.000490464870340465, "loss": 6.2352, "mean_token_accuracy": 0.13823144510388374, "num_tokens": 2902218.0, "step": 1280 }, { "entropy": 6.270657682418824, "epoch": 0.08270047625176985, "grad_norm": 1.078125, "learning_rate": 0.0004901225920201563, "loss": 6.1159, "mean_token_accuracy": 0.14343132004141806, "num_tokens": 2914062.0, "step": 1285 }, { "entropy": 6.360012531280518, "epoch": 0.08302226798815807, "grad_norm": 1.0390625, "learning_rate": 0.000489774416005319, "loss": 6.091, "mean_token_accuracy": 0.1466546781361103, "num_tokens": 2924838.0, "step": 1290 }, { "entropy": 6.255312871932984, "epoch": 0.08334405972454627, "grad_norm": 1.1171875, "learning_rate": 0.0004894203518413742, "loss": 6.0781, "mean_token_accuracy": 0.14694482684135438, "num_tokens": 2936219.0, "step": 1295 }, { "entropy": 6.416478824615479, "epoch": 0.08366585146093448, "grad_norm": 1.0546875, "learning_rate": 0.0004890604092351701, "loss": 6.0683, "mean_token_accuracy": 0.14561905413866044, "num_tokens": 2947195.0, "step": 1300 }, { "entropy": 6.19344310760498, "epoch": 0.08398764319732269, "grad_norm": 1.09375, "learning_rate": 0.000488694598054715, "loss": 6.0338, "mean_token_accuracy": 0.14701765030622482, "num_tokens": 2959322.0, "step": 1305 }, { "entropy": 6.2918178081512455, "epoch": 0.0843094349337109, "grad_norm": 1.015625, "learning_rate": 0.0004883229283289071, "loss": 6.0867, "mean_token_accuracy": 0.14712531566619874, "num_tokens": 2970237.0, "step": 1310 }, { "entropy": 6.260451936721802, "epoch": 0.0846312266700991, "grad_norm": 1.234375, "learning_rate": 0.00048794541024725993, "loss": 6.0424, "mean_token_accuracy": 0.15119363814592363, "num_tokens": 2980701.0, "step": 1315 }, { "entropy": 6.25090856552124, "epoch": 0.08495301840648732, "grad_norm": 1.078125, "learning_rate": 0.0004875620541596221, "loss": 5.9198, "mean_token_accuracy": 0.1514560803771019, "num_tokens": 2992712.0, "step": 1320 }, { "entropy": 6.234271287918091, "epoch": 0.08527481014287554, "grad_norm": 1.59375, "learning_rate": 0.00048717287057589454, "loss": 6.0752, "mean_token_accuracy": 0.14440764486789703, "num_tokens": 3003754.0, "step": 1325 }, { "entropy": 6.255046749114991, "epoch": 0.08559660187926374, "grad_norm": 1.0390625, "learning_rate": 0.0004867778701657417, "loss": 6.0283, "mean_token_accuracy": 0.14669692739844323, "num_tokens": 3015715.0, "step": 1330 }, { "entropy": 6.198978328704834, "epoch": 0.08591839361565196, "grad_norm": 1.109375, "learning_rate": 0.00048637706375829955, "loss": 6.0125, "mean_token_accuracy": 0.15693035572767258, "num_tokens": 3026781.0, "step": 1335 }, { "entropy": 6.3291237354278564, "epoch": 0.08624018535204016, "grad_norm": 1.1328125, "learning_rate": 0.000485970462341878, "loss": 6.0391, "mean_token_accuracy": 0.14689479991793633, "num_tokens": 3037856.0, "step": 1340 }, { "entropy": 6.268665742874146, "epoch": 0.08656197708842837, "grad_norm": 1.1171875, "learning_rate": 0.00048555807706366044, "loss": 6.0847, "mean_token_accuracy": 0.1446255125105381, "num_tokens": 3050109.0, "step": 1345 }, { "entropy": 6.237447834014892, "epoch": 0.08688376882481658, "grad_norm": 1.09375, "learning_rate": 0.00048513991922939756, "loss": 6.0616, "mean_token_accuracy": 0.14234503656625747, "num_tokens": 3060668.0, "step": 1350 }, { "entropy": 6.198616933822632, "epoch": 0.08720556056120479, "grad_norm": 0.96484375, "learning_rate": 0.00048471600030309744, "loss": 6.0421, "mean_token_accuracy": 0.14418703466653823, "num_tokens": 3071176.0, "step": 1355 }, { "entropy": 6.332860994338989, "epoch": 0.087527352297593, "grad_norm": 1.078125, "learning_rate": 0.00048428633190671186, "loss": 6.0403, "mean_token_accuracy": 0.15211065858602524, "num_tokens": 3083180.0, "step": 1360 }, { "entropy": 6.218678760528564, "epoch": 0.08784914403398121, "grad_norm": 1.03125, "learning_rate": 0.0004838509258198167, "loss": 5.9538, "mean_token_accuracy": 0.15536704435944557, "num_tokens": 3093049.0, "step": 1365 }, { "entropy": 6.163859224319458, "epoch": 0.08817093577036941, "grad_norm": 1.03125, "learning_rate": 0.00048340979397929, "loss": 5.987, "mean_token_accuracy": 0.15278939306735992, "num_tokens": 3104979.0, "step": 1370 }, { "entropy": 6.196265602111817, "epoch": 0.08849272750675763, "grad_norm": 1.078125, "learning_rate": 0.00048296294847898386, "loss": 5.9735, "mean_token_accuracy": 0.1589425176382065, "num_tokens": 3117098.0, "step": 1375 }, { "entropy": 6.2933696746826175, "epoch": 0.08881451924314583, "grad_norm": 1.0859375, "learning_rate": 0.0004825104015693934, "loss": 6.0967, "mean_token_accuracy": 0.14706607460975646, "num_tokens": 3127554.0, "step": 1380 }, { "entropy": 6.332402229309082, "epoch": 0.08913631097953405, "grad_norm": 1.296875, "learning_rate": 0.0004820521656573208, "loss": 6.0697, "mean_token_accuracy": 0.15364808216691017, "num_tokens": 3139574.0, "step": 1385 }, { "entropy": 6.154071283340454, "epoch": 0.08945810271592225, "grad_norm": 1.03125, "learning_rate": 0.00048158825330553505, "loss": 5.9452, "mean_token_accuracy": 0.16097584813833238, "num_tokens": 3151687.0, "step": 1390 }, { "entropy": 6.355695199966431, "epoch": 0.08977989445231047, "grad_norm": 1.1015625, "learning_rate": 0.00048111867723242763, "loss": 6.0481, "mean_token_accuracy": 0.15232885181903838, "num_tokens": 3161667.0, "step": 1395 }, { "entropy": 6.16862416267395, "epoch": 0.09010168618869867, "grad_norm": 1.109375, "learning_rate": 0.0004806434503116637, "loss": 6.033, "mean_token_accuracy": 0.15161970853805543, "num_tokens": 3172797.0, "step": 1400 }, { "entropy": 6.239516496658325, "epoch": 0.09042347792508688, "grad_norm": 1.015625, "learning_rate": 0.0004801625855718296, "loss": 5.9882, "mean_token_accuracy": 0.15210439413785934, "num_tokens": 3183970.0, "step": 1405 }, { "entropy": 6.291398382186889, "epoch": 0.09074526966147509, "grad_norm": 1.09375, "learning_rate": 0.00047967609619607477, "loss": 6.0427, "mean_token_accuracy": 0.15301772952079773, "num_tokens": 3194461.0, "step": 1410 }, { "entropy": 6.2756983757019045, "epoch": 0.0910670613978633, "grad_norm": 1.0078125, "learning_rate": 0.0004791839955217513, "loss": 5.9568, "mean_token_accuracy": 0.15461016148328782, "num_tokens": 3204595.0, "step": 1415 }, { "entropy": 6.154314565658569, "epoch": 0.09138885313425152, "grad_norm": 1.046875, "learning_rate": 0.00047868629704004786, "loss": 5.9462, "mean_token_accuracy": 0.1490132212638855, "num_tokens": 3215617.0, "step": 1420 }, { "entropy": 6.124943971633911, "epoch": 0.09171064487063972, "grad_norm": 1.0546875, "learning_rate": 0.00047818301439561965, "loss": 6.0813, "mean_token_accuracy": 0.1486785553395748, "num_tokens": 3227350.0, "step": 1425 }, { "entropy": 6.304641628265381, "epoch": 0.09203243660702794, "grad_norm": 1.8828125, "learning_rate": 0.00047767416138621454, "loss": 6.2063, "mean_token_accuracy": 0.14140090346336365, "num_tokens": 3239473.0, "step": 1430 }, { "entropy": 6.324922275543213, "epoch": 0.09235422834341614, "grad_norm": 1.046875, "learning_rate": 0.000477159751962295, "loss": 5.9684, "mean_token_accuracy": 0.15401543006300927, "num_tokens": 3250360.0, "step": 1435 }, { "entropy": 6.12751088142395, "epoch": 0.09267602007980436, "grad_norm": 1.15625, "learning_rate": 0.00047663980022665507, "loss": 5.9926, "mean_token_accuracy": 0.15175819844007493, "num_tokens": 3260227.0, "step": 1440 }, { "entropy": 6.237259864807129, "epoch": 0.09299781181619256, "grad_norm": 0.96875, "learning_rate": 0.00047611432043403437, "loss": 5.9543, "mean_token_accuracy": 0.151527339220047, "num_tokens": 3271316.0, "step": 1445 }, { "entropy": 6.193226385116577, "epoch": 0.09331960355258077, "grad_norm": 1.1328125, "learning_rate": 0.0004755833269907267, "loss": 6.055, "mean_token_accuracy": 0.15415698066353797, "num_tokens": 3283194.0, "step": 1450 }, { "entropy": 6.226471662521362, "epoch": 0.09364139528896898, "grad_norm": 1.09375, "learning_rate": 0.0004750468344541857, "loss": 5.9492, "mean_token_accuracy": 0.15627116858959197, "num_tokens": 3294337.0, "step": 1455 }, { "entropy": 6.095775890350342, "epoch": 0.09396318702535719, "grad_norm": 1.0546875, "learning_rate": 0.00047450485753262525, "loss": 6.0268, "mean_token_accuracy": 0.1549006626009941, "num_tokens": 3305661.0, "step": 1460 }, { "entropy": 6.316003370285034, "epoch": 0.0942849787617454, "grad_norm": 1.203125, "learning_rate": 0.00047395741108461633, "loss": 5.9668, "mean_token_accuracy": 0.16676316410303116, "num_tokens": 3318457.0, "step": 1465 }, { "entropy": 6.10923490524292, "epoch": 0.09460677049813361, "grad_norm": 1.140625, "learning_rate": 0.00047340451011867985, "loss": 5.9276, "mean_token_accuracy": 0.1575511649250984, "num_tokens": 3329208.0, "step": 1470 }, { "entropy": 6.169835376739502, "epoch": 0.09492856223452181, "grad_norm": 1.09375, "learning_rate": 0.00047284616979287515, "loss": 5.9957, "mean_token_accuracy": 0.15678192675113678, "num_tokens": 3340131.0, "step": 1475 }, { "entropy": 6.147319173812866, "epoch": 0.09525035397091003, "grad_norm": 1.0390625, "learning_rate": 0.00047228240541438433, "loss": 5.927, "mean_token_accuracy": 0.15638188570737838, "num_tokens": 3351416.0, "step": 1480 }, { "entropy": 6.111018514633178, "epoch": 0.09557214570729823, "grad_norm": 0.9375, "learning_rate": 0.00047171323243909257, "loss": 5.9375, "mean_token_accuracy": 0.1552967607975006, "num_tokens": 3363734.0, "step": 1485 }, { "entropy": 6.22268123626709, "epoch": 0.09589393744368645, "grad_norm": 1.078125, "learning_rate": 0.00047113866647116457, "loss": 6.0156, "mean_token_accuracy": 0.15189583972096443, "num_tokens": 3375194.0, "step": 1490 }, { "entropy": 6.290840578079224, "epoch": 0.09621572918007465, "grad_norm": 1.0546875, "learning_rate": 0.0004705587232626164, "loss": 6.1143, "mean_token_accuracy": 0.1482478827238083, "num_tokens": 3387005.0, "step": 1495 }, { "entropy": 6.177110862731934, "epoch": 0.09653752091646287, "grad_norm": 1.0234375, "learning_rate": 0.00046997341871288424, "loss": 5.9724, "mean_token_accuracy": 0.14636649787425995, "num_tokens": 3398902.0, "step": 1500 }, { "entropy": 6.236763906478882, "epoch": 0.09685931265285108, "grad_norm": 1.0078125, "learning_rate": 0.0004693827688683879, "loss": 5.9133, "mean_token_accuracy": 0.15838426500558853, "num_tokens": 3410716.0, "step": 1505 }, { "entropy": 6.154586696624756, "epoch": 0.09718110438923928, "grad_norm": 1.0390625, "learning_rate": 0.0004687867899220914, "loss": 5.961, "mean_token_accuracy": 0.15415489226579665, "num_tokens": 3422252.0, "step": 1510 }, { "entropy": 6.140632581710816, "epoch": 0.0975028961256275, "grad_norm": 1.046875, "learning_rate": 0.00046818549821305846, "loss": 5.8691, "mean_token_accuracy": 0.1620650425553322, "num_tokens": 3433799.0, "step": 1515 }, { "entropy": 6.097218656539917, "epoch": 0.0978246878620157, "grad_norm": 1.0234375, "learning_rate": 0.00046757891022600494, "loss": 5.9079, "mean_token_accuracy": 0.15895169079303742, "num_tokens": 3444754.0, "step": 1520 }, { "entropy": 6.131570863723755, "epoch": 0.09814647959840392, "grad_norm": 0.953125, "learning_rate": 0.0004669670425908471, "loss": 5.8836, "mean_token_accuracy": 0.15784632563591003, "num_tokens": 3456897.0, "step": 1525 }, { "entropy": 6.0702661037445065, "epoch": 0.09846827133479212, "grad_norm": 0.9765625, "learning_rate": 0.0004663499120822451, "loss": 5.835, "mean_token_accuracy": 0.16073963791131973, "num_tokens": 3468415.0, "step": 1530 }, { "entropy": 6.077900362014771, "epoch": 0.09879006307118034, "grad_norm": 0.97265625, "learning_rate": 0.0004657275356191437, "loss": 5.8369, "mean_token_accuracy": 0.15783393234014512, "num_tokens": 3478914.0, "step": 1535 }, { "entropy": 6.247751140594483, "epoch": 0.09911185480756854, "grad_norm": 0.96484375, "learning_rate": 0.00046509993026430804, "loss": 6.0328, "mean_token_accuracy": 0.15122698694467546, "num_tokens": 3490617.0, "step": 1540 }, { "entropy": 6.107704210281372, "epoch": 0.09943364654395676, "grad_norm": 1.0078125, "learning_rate": 0.0004644671132238558, "loss": 5.9323, "mean_token_accuracy": 0.15626108199357985, "num_tokens": 3503145.0, "step": 1545 }, { "entropy": 6.2650384426116945, "epoch": 0.09975543828034496, "grad_norm": 1.046875, "learning_rate": 0.00046382910184678585, "loss": 5.9544, "mean_token_accuracy": 0.1508778765797615, "num_tokens": 3514378.0, "step": 1550 }, { "entropy": 6.066193294525147, "epoch": 0.10007723001673317, "grad_norm": 1.0234375, "learning_rate": 0.0004631859136245025, "loss": 5.9536, "mean_token_accuracy": 0.15337267220020295, "num_tokens": 3524820.0, "step": 1555 }, { "entropy": 6.2549515724182125, "epoch": 0.10039902175312138, "grad_norm": 0.98046875, "learning_rate": 0.0004625375661903357, "loss": 6.0194, "mean_token_accuracy": 0.15266060531139375, "num_tokens": 3537117.0, "step": 1560 }, { "entropy": 6.1690354347229, "epoch": 0.10072081348950959, "grad_norm": 1.03125, "learning_rate": 0.00046188407731905787, "loss": 5.9786, "mean_token_accuracy": 0.15118198990821838, "num_tokens": 3549741.0, "step": 1565 }, { "entropy": 5.9546397686004635, "epoch": 0.1010426052258978, "grad_norm": 1.1171875, "learning_rate": 0.00046122546492639643, "loss": 5.7664, "mean_token_accuracy": 0.16974862962961196, "num_tokens": 3560009.0, "step": 1570 }, { "entropy": 6.1606494903564455, "epoch": 0.10136439696228601, "grad_norm": 1.0546875, "learning_rate": 0.000460561747068543, "loss": 5.8662, "mean_token_accuracy": 0.15560854971408844, "num_tokens": 3570005.0, "step": 1575 }, { "entropy": 6.085360765457153, "epoch": 0.10168618869867421, "grad_norm": 1.0078125, "learning_rate": 0.0004598929419416578, "loss": 5.8876, "mean_token_accuracy": 0.1590146005153656, "num_tokens": 3581017.0, "step": 1580 }, { "entropy": 6.100130701065064, "epoch": 0.10200798043506243, "grad_norm": 0.99609375, "learning_rate": 0.00045921906788137123, "loss": 5.8961, "mean_token_accuracy": 0.16178194135427476, "num_tokens": 3592102.0, "step": 1585 }, { "entropy": 6.079522705078125, "epoch": 0.10232977217145063, "grad_norm": 1.0390625, "learning_rate": 0.00045854014336228115, "loss": 5.8172, "mean_token_accuracy": 0.1636298730969429, "num_tokens": 3602860.0, "step": 1590 }, { "entropy": 6.100549745559692, "epoch": 0.10265156390783885, "grad_norm": 0.96484375, "learning_rate": 0.00045785618699744615, "loss": 5.8923, "mean_token_accuracy": 0.15646297633647918, "num_tokens": 3614265.0, "step": 1595 }, { "entropy": 6.137320423126221, "epoch": 0.10297335564422706, "grad_norm": 1.0234375, "learning_rate": 0.00045716721753787543, "loss": 5.9092, "mean_token_accuracy": 0.1642071709036827, "num_tokens": 3624783.0, "step": 1600 }, { "entropy": 6.103617238998413, "epoch": 0.10329514738061527, "grad_norm": 1.046875, "learning_rate": 0.0004564732538720148, "loss": 5.9007, "mean_token_accuracy": 0.15452659055590628, "num_tokens": 3636671.0, "step": 1605 }, { "entropy": 6.162163400650025, "epoch": 0.10361693911700348, "grad_norm": 1.046875, "learning_rate": 0.00045577431502522877, "loss": 5.9502, "mean_token_accuracy": 0.16308289170265197, "num_tokens": 3648249.0, "step": 1610 }, { "entropy": 6.2008871078491214, "epoch": 0.10393873085339168, "grad_norm": 1.09375, "learning_rate": 0.0004550704201592787, "loss": 5.9927, "mean_token_accuracy": 0.1535536527633667, "num_tokens": 3659625.0, "step": 1615 }, { "entropy": 6.1465507507324215, "epoch": 0.1042605225897799, "grad_norm": 1.0859375, "learning_rate": 0.0004543615885717981, "loss": 5.9086, "mean_token_accuracy": 0.160139761865139, "num_tokens": 3670233.0, "step": 1620 }, { "entropy": 6.0907965183258055, "epoch": 0.1045823143261681, "grad_norm": 1.09375, "learning_rate": 0.00045364783969576296, "loss": 5.8771, "mean_token_accuracy": 0.1571106120944023, "num_tokens": 3680793.0, "step": 1625 }, { "entropy": 6.108975076675415, "epoch": 0.10490410606255632, "grad_norm": 1.0859375, "learning_rate": 0.0004529291930989592, "loss": 5.883, "mean_token_accuracy": 0.17130757123231888, "num_tokens": 3692561.0, "step": 1630 }, { "entropy": 6.049561834335327, "epoch": 0.10522589779894452, "grad_norm": 1.0078125, "learning_rate": 0.0004522056684834464, "loss": 5.887, "mean_token_accuracy": 0.1572432816028595, "num_tokens": 3704306.0, "step": 1635 }, { "entropy": 6.081239366531372, "epoch": 0.10554768953533274, "grad_norm": 1.0703125, "learning_rate": 0.0004514772856850173, "loss": 5.8848, "mean_token_accuracy": 0.16130839735269548, "num_tokens": 3715276.0, "step": 1640 }, { "entropy": 6.184744596481323, "epoch": 0.10586948127172094, "grad_norm": 1.21875, "learning_rate": 0.0004507440646726542, "loss": 6.025, "mean_token_accuracy": 0.1553824484348297, "num_tokens": 3726799.0, "step": 1645 }, { "entropy": 6.106659936904907, "epoch": 0.10619127300810915, "grad_norm": 1.140625, "learning_rate": 0.0004500060255479818, "loss": 5.9149, "mean_token_accuracy": 0.15892969965934753, "num_tokens": 3736648.0, "step": 1650 }, { "entropy": 6.1206361770629885, "epoch": 0.10651306474449736, "grad_norm": 0.9921875, "learning_rate": 0.0004492631885447151, "loss": 5.9212, "mean_token_accuracy": 0.1520114503800869, "num_tokens": 3746940.0, "step": 1655 }, { "entropy": 6.142186498641967, "epoch": 0.10683485648088557, "grad_norm": 1.109375, "learning_rate": 0.00044851557402810616, "loss": 5.86, "mean_token_accuracy": 0.15836223363876342, "num_tokens": 3758099.0, "step": 1660 }, { "entropy": 5.9857617855072025, "epoch": 0.10715664821727378, "grad_norm": 1.0625, "learning_rate": 0.00044776320249438444, "loss": 5.8378, "mean_token_accuracy": 0.16005610525608063, "num_tokens": 3769881.0, "step": 1665 }, { "entropy": 6.105796766281128, "epoch": 0.10747843995366199, "grad_norm": 1.078125, "learning_rate": 0.00044700609457019565, "loss": 5.8723, "mean_token_accuracy": 0.1569559782743454, "num_tokens": 3780925.0, "step": 1670 }, { "entropy": 6.123667669296265, "epoch": 0.1078002316900502, "grad_norm": 1.15625, "learning_rate": 0.0004462442710120359, "loss": 5.978, "mean_token_accuracy": 0.15348947197198867, "num_tokens": 3791941.0, "step": 1675 }, { "entropy": 6.140316152572632, "epoch": 0.10812202342643841, "grad_norm": 1.1328125, "learning_rate": 0.000445477752705683, "loss": 5.9025, "mean_token_accuracy": 0.15857508778572083, "num_tokens": 3803698.0, "step": 1680 }, { "entropy": 6.062806749343872, "epoch": 0.10844381516282661, "grad_norm": 0.98046875, "learning_rate": 0.00044470656066562336, "loss": 5.8514, "mean_token_accuracy": 0.1542954534292221, "num_tokens": 3815681.0, "step": 1685 }, { "entropy": 6.0847492694854735, "epoch": 0.10876560689921483, "grad_norm": 1.0234375, "learning_rate": 0.0004439307160344765, "loss": 5.8906, "mean_token_accuracy": 0.15737924128770828, "num_tokens": 3828074.0, "step": 1690 }, { "entropy": 6.040540266036987, "epoch": 0.10908739863560304, "grad_norm": 1.046875, "learning_rate": 0.00044315024008241473, "loss": 5.8193, "mean_token_accuracy": 0.16169758141040802, "num_tokens": 3838928.0, "step": 1695 }, { "entropy": 6.152355909347534, "epoch": 0.10940919037199125, "grad_norm": 1.0859375, "learning_rate": 0.0004423651542065806, "loss": 5.972, "mean_token_accuracy": 0.14924763143062592, "num_tokens": 3850148.0, "step": 1700 }, { "entropy": 6.210541772842407, "epoch": 0.10973098210837946, "grad_norm": 1.078125, "learning_rate": 0.00044157547993050006, "loss": 5.9284, "mean_token_accuracy": 0.15215876325964928, "num_tokens": 3861099.0, "step": 1705 }, { "entropy": 6.108062696456909, "epoch": 0.11005277384476767, "grad_norm": 1.0625, "learning_rate": 0.00044078123890349227, "loss": 5.8861, "mean_token_accuracy": 0.16254641860723495, "num_tokens": 3872742.0, "step": 1710 }, { "entropy": 6.034341526031494, "epoch": 0.11037456558115588, "grad_norm": 1.1796875, "learning_rate": 0.00043998245290007606, "loss": 5.8189, "mean_token_accuracy": 0.16008612066507338, "num_tokens": 3883573.0, "step": 1715 }, { "entropy": 6.092084360122681, "epoch": 0.11069635731754408, "grad_norm": 1.109375, "learning_rate": 0.00043917914381937323, "loss": 5.8707, "mean_token_accuracy": 0.15305377990007402, "num_tokens": 3894614.0, "step": 1720 }, { "entropy": 5.947681093215943, "epoch": 0.1110181490539323, "grad_norm": 0.9296875, "learning_rate": 0.00043837133368450815, "loss": 5.6755, "mean_token_accuracy": 0.17631727159023286, "num_tokens": 3904217.0, "step": 1725 }, { "entropy": 5.988527441024781, "epoch": 0.1113399407903205, "grad_norm": 1.015625, "learning_rate": 0.0004375590446420037, "loss": 5.8423, "mean_token_accuracy": 0.15377960056066514, "num_tokens": 3916066.0, "step": 1730 }, { "entropy": 6.192314147949219, "epoch": 0.11166173252670872, "grad_norm": 1.1171875, "learning_rate": 0.0004367422989611743, "loss": 5.8629, "mean_token_accuracy": 0.16659451127052308, "num_tokens": 3928106.0, "step": 1735 }, { "entropy": 5.978959846496582, "epoch": 0.11198352426309692, "grad_norm": 1.0546875, "learning_rate": 0.0004359211190335153, "loss": 5.7561, "mean_token_accuracy": 0.16876690536737443, "num_tokens": 3940176.0, "step": 1740 }, { "entropy": 5.962417316436768, "epoch": 0.11230531599948514, "grad_norm": 1.1796875, "learning_rate": 0.00043509552737208923, "loss": 5.8668, "mean_token_accuracy": 0.1604593113064766, "num_tokens": 3951938.0, "step": 1745 }, { "entropy": 6.1542033672332765, "epoch": 0.11262710773587334, "grad_norm": 0.9609375, "learning_rate": 0.00043426554661090853, "loss": 5.8896, "mean_token_accuracy": 0.15797159373760222, "num_tokens": 3962731.0, "step": 1750 }, { "entropy": 6.078965711593628, "epoch": 0.11294889947226155, "grad_norm": 0.98046875, "learning_rate": 0.00043343119950431516, "loss": 5.8989, "mean_token_accuracy": 0.1685984030365944, "num_tokens": 3973841.0, "step": 1755 }, { "entropy": 6.0909887790679935, "epoch": 0.11327069120864976, "grad_norm": 0.90625, "learning_rate": 0.00043259250892635644, "loss": 5.849, "mean_token_accuracy": 0.15423968136310579, "num_tokens": 3985723.0, "step": 1760 }, { "entropy": 5.981694746017456, "epoch": 0.11359248294503797, "grad_norm": 1.015625, "learning_rate": 0.0004317494978701582, "loss": 5.7654, "mean_token_accuracy": 0.16921489387750627, "num_tokens": 3996719.0, "step": 1765 }, { "entropy": 6.0790181159973145, "epoch": 0.11391427468142618, "grad_norm": 1.0390625, "learning_rate": 0.0004309021894472943, "loss": 5.8408, "mean_token_accuracy": 0.1637660652399063, "num_tokens": 4007178.0, "step": 1770 }, { "entropy": 6.193857336044312, "epoch": 0.11423606641781439, "grad_norm": 1.1015625, "learning_rate": 0.0004300506068871534, "loss": 5.9561, "mean_token_accuracy": 0.15705759078264236, "num_tokens": 4017441.0, "step": 1775 }, { "entropy": 6.0972432613372805, "epoch": 0.1145578581542026, "grad_norm": 0.96484375, "learning_rate": 0.00042919477353630135, "loss": 5.9267, "mean_token_accuracy": 0.15945902168750764, "num_tokens": 4028902.0, "step": 1780 }, { "entropy": 6.088161182403565, "epoch": 0.11487964989059081, "grad_norm": 1.078125, "learning_rate": 0.000428334712857842, "loss": 5.8481, "mean_token_accuracy": 0.15834707170724868, "num_tokens": 4039686.0, "step": 1785 }, { "entropy": 6.092359447479248, "epoch": 0.11520144162697903, "grad_norm": 1.03125, "learning_rate": 0.00042747044843077304, "loss": 5.8735, "mean_token_accuracy": 0.15396366342902185, "num_tokens": 4052367.0, "step": 1790 }, { "entropy": 6.024484586715698, "epoch": 0.11552323336336723, "grad_norm": 1.0625, "learning_rate": 0.00042660200394934047, "loss": 5.7914, "mean_token_accuracy": 0.15892019718885422, "num_tokens": 4063200.0, "step": 1795 }, { "entropy": 6.0296402931213375, "epoch": 0.11584502509975544, "grad_norm": 1.0859375, "learning_rate": 0.00042572940322238844, "loss": 5.7621, "mean_token_accuracy": 0.16620553135871888, "num_tokens": 4074896.0, "step": 1800 }, { "entropy": 6.014833593368531, "epoch": 0.11616681683614365, "grad_norm": 0.94921875, "learning_rate": 0.00042485267017270664, "loss": 5.717, "mean_token_accuracy": 0.16428265124559402, "num_tokens": 4086622.0, "step": 1805 }, { "entropy": 5.952508020401001, "epoch": 0.11648860857253186, "grad_norm": 1.046875, "learning_rate": 0.0004239718288363745, "loss": 5.8441, "mean_token_accuracy": 0.16071850210428237, "num_tokens": 4097172.0, "step": 1810 }, { "entropy": 6.073939561843872, "epoch": 0.11681040030892006, "grad_norm": 0.9765625, "learning_rate": 0.0004230869033621023, "loss": 5.8946, "mean_token_accuracy": 0.1668115332722664, "num_tokens": 4108735.0, "step": 1815 }, { "entropy": 6.041821050643921, "epoch": 0.11713219204530828, "grad_norm": 1.328125, "learning_rate": 0.0004221979180105688, "loss": 5.837, "mean_token_accuracy": 0.1618662878870964, "num_tokens": 4119840.0, "step": 1820 }, { "entropy": 6.002658462524414, "epoch": 0.11745398378169648, "grad_norm": 0.9140625, "learning_rate": 0.00042130489715375645, "loss": 5.8832, "mean_token_accuracy": 0.15968891829252244, "num_tokens": 4131999.0, "step": 1825 }, { "entropy": 6.1330491065979, "epoch": 0.1177757755180847, "grad_norm": 0.93359375, "learning_rate": 0.00042040786527428335, "loss": 5.7651, "mean_token_accuracy": 0.16318420171737671, "num_tokens": 4143516.0, "step": 1830 }, { "entropy": 5.996764755249023, "epoch": 0.1180975672544729, "grad_norm": 1.0703125, "learning_rate": 0.0004195068469647315, "loss": 5.8386, "mean_token_accuracy": 0.15657123625278474, "num_tokens": 4153963.0, "step": 1835 }, { "entropy": 5.976077747344971, "epoch": 0.11841935899086112, "grad_norm": 1.078125, "learning_rate": 0.00041860186692697297, "loss": 5.7268, "mean_token_accuracy": 0.1676751896739006, "num_tokens": 4165361.0, "step": 1840 }, { "entropy": 5.975963687896728, "epoch": 0.11874115072724932, "grad_norm": 1.109375, "learning_rate": 0.00041769294997149264, "loss": 5.75, "mean_token_accuracy": 0.16740206331014634, "num_tokens": 4176608.0, "step": 1845 }, { "entropy": 5.930391788482666, "epoch": 0.11906294246363754, "grad_norm": 1.0390625, "learning_rate": 0.0004167801210167081, "loss": 5.7926, "mean_token_accuracy": 0.16247987747192383, "num_tokens": 4188709.0, "step": 1850 }, { "entropy": 6.0283245086669925, "epoch": 0.11938473420002574, "grad_norm": 1.109375, "learning_rate": 0.0004158634050882861, "loss": 5.8113, "mean_token_accuracy": 0.1592404916882515, "num_tokens": 4199079.0, "step": 1855 }, { "entropy": 6.08579740524292, "epoch": 0.11970652593641395, "grad_norm": 1.0859375, "learning_rate": 0.0004149428273184569, "loss": 5.8994, "mean_token_accuracy": 0.1571430966258049, "num_tokens": 4209204.0, "step": 1860 }, { "entropy": 6.115895318984985, "epoch": 0.12002831767280216, "grad_norm": 1.0546875, "learning_rate": 0.0004140184129453253, "loss": 5.896, "mean_token_accuracy": 0.15317915976047516, "num_tokens": 4220270.0, "step": 1865 }, { "entropy": 5.977196741104126, "epoch": 0.12035010940919037, "grad_norm": 0.99609375, "learning_rate": 0.000413090187312178, "loss": 5.7498, "mean_token_accuracy": 0.16569025069475174, "num_tokens": 4232996.0, "step": 1870 }, { "entropy": 5.974374628067016, "epoch": 0.12067190114557858, "grad_norm": 1.015625, "learning_rate": 0.0004121581758667898, "loss": 5.7578, "mean_token_accuracy": 0.1671750284731388, "num_tokens": 4244089.0, "step": 1875 }, { "entropy": 6.00874342918396, "epoch": 0.12099369288196679, "grad_norm": 0.953125, "learning_rate": 0.00041122240416072533, "loss": 5.7989, "mean_token_accuracy": 0.16003866046667098, "num_tokens": 4254939.0, "step": 1880 }, { "entropy": 6.073114728927612, "epoch": 0.12131548461835501, "grad_norm": 0.984375, "learning_rate": 0.0004102828978486385, "loss": 5.8726, "mean_token_accuracy": 0.15603156834840776, "num_tokens": 4266429.0, "step": 1885 }, { "entropy": 5.972569847106934, "epoch": 0.12163727635474321, "grad_norm": 1.03125, "learning_rate": 0.0004093396826875695, "loss": 5.7964, "mean_token_accuracy": 0.15974399149417878, "num_tokens": 4278063.0, "step": 1890 }, { "entropy": 6.0056493282318115, "epoch": 0.12195906809113143, "grad_norm": 1.046875, "learning_rate": 0.00040839278453623837, "loss": 5.8105, "mean_token_accuracy": 0.16451311111450195, "num_tokens": 4290281.0, "step": 1895 }, { "entropy": 6.038688039779663, "epoch": 0.12228085982751963, "grad_norm": 0.97265625, "learning_rate": 0.0004074422293543363, "loss": 5.804, "mean_token_accuracy": 0.15884712487459182, "num_tokens": 4301281.0, "step": 1900 }, { "entropy": 6.016970539093018, "epoch": 0.12260265156390784, "grad_norm": 1.171875, "learning_rate": 0.0004064880432018137, "loss": 5.7658, "mean_token_accuracy": 0.15432919561862946, "num_tokens": 4312406.0, "step": 1905 }, { "entropy": 6.103054714202881, "epoch": 0.12292444330029605, "grad_norm": 0.99609375, "learning_rate": 0.00040553025223816615, "loss": 5.8855, "mean_token_accuracy": 0.15506619587540627, "num_tokens": 4322831.0, "step": 1910 }, { "entropy": 6.005894613265991, "epoch": 0.12324623503668426, "grad_norm": 0.94140625, "learning_rate": 0.00040456888272171653, "loss": 5.8042, "mean_token_accuracy": 0.1634931042790413, "num_tokens": 4334850.0, "step": 1915 }, { "entropy": 6.033585166931152, "epoch": 0.12356802677307246, "grad_norm": 0.859375, "learning_rate": 0.00040360396100889577, "loss": 5.8797, "mean_token_accuracy": 0.1673731878399849, "num_tokens": 4346913.0, "step": 1920 }, { "entropy": 6.02968282699585, "epoch": 0.12388981850946068, "grad_norm": 1.0859375, "learning_rate": 0.0004026355135535202, "loss": 5.7898, "mean_token_accuracy": 0.16513559669256211, "num_tokens": 4357030.0, "step": 1925 }, { "entropy": 5.9573445320129395, "epoch": 0.12421161024584888, "grad_norm": 0.9609375, "learning_rate": 0.000401663566906066, "loss": 5.7356, "mean_token_accuracy": 0.16273822635412216, "num_tokens": 4368562.0, "step": 1930 }, { "entropy": 6.075269746780395, "epoch": 0.1245334019822371, "grad_norm": 0.93359375, "learning_rate": 0.00040068814771294134, "loss": 5.8348, "mean_token_accuracy": 0.1631076753139496, "num_tokens": 4380499.0, "step": 1935 }, { "entropy": 5.973206567764282, "epoch": 0.1248551937186253, "grad_norm": 1.0078125, "learning_rate": 0.0003997092827157562, "loss": 5.6817, "mean_token_accuracy": 0.17137495726346968, "num_tokens": 4391288.0, "step": 1940 }, { "entropy": 6.008097457885742, "epoch": 0.12517698545501352, "grad_norm": 1.015625, "learning_rate": 0.000398726998750589, "loss": 5.8549, "mean_token_accuracy": 0.1622577652335167, "num_tokens": 4402371.0, "step": 1945 }, { "entropy": 6.058371210098267, "epoch": 0.12549877719140173, "grad_norm": 0.953125, "learning_rate": 0.00039774132274725076, "loss": 5.8899, "mean_token_accuracy": 0.16455032378435136, "num_tokens": 4414095.0, "step": 1950 }, { "entropy": 5.990140342712403, "epoch": 0.12582056892778992, "grad_norm": 1.140625, "learning_rate": 0.00039675228172854707, "loss": 5.8451, "mean_token_accuracy": 0.1557239845395088, "num_tokens": 4425878.0, "step": 1955 }, { "entropy": 6.079447650909424, "epoch": 0.12614236066417814, "grad_norm": 1.3515625, "learning_rate": 0.0003957599028095371, "loss": 5.7468, "mean_token_accuracy": 0.16118832379579545, "num_tokens": 4437387.0, "step": 1960 }, { "entropy": 6.004099607467651, "epoch": 0.12646415240056635, "grad_norm": 0.953125, "learning_rate": 0.00039476421319679017, "loss": 5.7359, "mean_token_accuracy": 0.1670518174767494, "num_tokens": 4448457.0, "step": 1965 }, { "entropy": 6.00559983253479, "epoch": 0.12678594413695457, "grad_norm": 0.99609375, "learning_rate": 0.00039376524018764, "loss": 5.7616, "mean_token_accuracy": 0.17010354697704316, "num_tokens": 4460368.0, "step": 1970 }, { "entropy": 5.861134004592896, "epoch": 0.12710773587334276, "grad_norm": 1.03125, "learning_rate": 0.00039276301116943616, "loss": 5.7011, "mean_token_accuracy": 0.16875038146972657, "num_tokens": 4472436.0, "step": 1975 }, { "entropy": 5.954335880279541, "epoch": 0.12742952760973097, "grad_norm": 0.96484375, "learning_rate": 0.0003917575536187936, "loss": 5.745, "mean_token_accuracy": 0.16061961352825166, "num_tokens": 4483945.0, "step": 1980 }, { "entropy": 5.945883464813233, "epoch": 0.1277513193461192, "grad_norm": 1.046875, "learning_rate": 0.00039074889510083894, "loss": 5.7885, "mean_token_accuracy": 0.1619923420250416, "num_tokens": 4494694.0, "step": 1985 }, { "entropy": 6.025341606140136, "epoch": 0.1280731110825074, "grad_norm": 1.2734375, "learning_rate": 0.00038973706326845495, "loss": 5.8042, "mean_token_accuracy": 0.16122044026851653, "num_tokens": 4506454.0, "step": 1990 }, { "entropy": 6.062008476257324, "epoch": 0.12839490281889562, "grad_norm": 1.03125, "learning_rate": 0.0003887220858615225, "loss": 5.7555, "mean_token_accuracy": 0.168570613861084, "num_tokens": 4516921.0, "step": 1995 }, { "entropy": 5.976399898529053, "epoch": 0.1287166945552838, "grad_norm": 0.9921875, "learning_rate": 0.0003877039907061597, "loss": 5.7396, "mean_token_accuracy": 0.16865382939577103, "num_tokens": 4527936.0, "step": 2000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1065543491911680.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }