{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.2574333891105676, "eval_steps": 500, "global_step": 4000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742555713653564, "epoch": 0.00032179173638820956, "grad_norm": 4.59375, "learning_rate": 2e-06, "loss": 10.7932, "mean_token_accuracy": 9.85221704468131e-05, "num_tokens": 11506.0, "step": 5 }, { "entropy": 10.742585468292237, "epoch": 0.0006435834727764191, "grad_norm": 5.0, "learning_rate": 4.5e-06, "loss": 10.7664, "mean_token_accuracy": 7.942811935208738e-05, "num_tokens": 21973.0, "step": 10 }, { "entropy": 10.742585182189941, "epoch": 0.0009653752091646286, "grad_norm": 4.6875, "learning_rate": 7e-06, "loss": 10.7473, "mean_token_accuracy": 0.0, "num_tokens": 32763.0, "step": 15 }, { "entropy": 10.742647171020508, "epoch": 0.0012871669455528382, "grad_norm": 4.5, "learning_rate": 9.5e-06, "loss": 10.716, "mean_token_accuracy": 0.00042943707667291163, "num_tokens": 44354.0, "step": 20 }, { "entropy": 10.742597675323486, "epoch": 0.0016089586819410479, "grad_norm": 4.375, "learning_rate": 1.2e-05, "loss": 10.6219, "mean_token_accuracy": 0.0008890067110769451, "num_tokens": 56534.0, "step": 25 }, { "entropy": 10.74241762161255, "epoch": 0.0019307504183292573, "grad_norm": 3.859375, "learning_rate": 1.4500000000000002e-05, "loss": 10.4911, "mean_token_accuracy": 0.009375615860335529, "num_tokens": 67106.0, "step": 30 }, { "entropy": 10.741784954071045, "epoch": 0.002252542154717467, "grad_norm": 3.265625, "learning_rate": 1.7000000000000003e-05, "loss": 10.3831, "mean_token_accuracy": 0.021833056677132846, "num_tokens": 78801.0, "step": 35 }, { "entropy": 10.74044713973999, "epoch": 0.0025743338911056765, "grad_norm": 2.53125, "learning_rate": 1.95e-05, "loss": 10.2405, "mean_token_accuracy": 0.028899907879531384, "num_tokens": 90390.0, "step": 40 }, { "entropy": 10.738579750061035, "epoch": 0.002896125627493886, "grad_norm": 2.265625, "learning_rate": 2.2e-05, "loss": 10.1128, "mean_token_accuracy": 0.036285107396543025, "num_tokens": 101652.0, "step": 45 }, { "entropy": 10.737388038635254, "epoch": 0.0032179173638820957, "grad_norm": 2.0625, "learning_rate": 2.4500000000000003e-05, "loss": 10.0384, "mean_token_accuracy": 0.03730290364474058, "num_tokens": 112068.0, "step": 50 }, { "entropy": 10.737480354309081, "epoch": 0.003539709100270305, "grad_norm": 1.90625, "learning_rate": 2.7e-05, "loss": 10.0098, "mean_token_accuracy": 0.04103992246091366, "num_tokens": 123500.0, "step": 55 }, { "entropy": 10.736884212493896, "epoch": 0.0038615008366585145, "grad_norm": 1.9296875, "learning_rate": 2.95e-05, "loss": 9.9544, "mean_token_accuracy": 0.0359757786616683, "num_tokens": 134456.0, "step": 60 }, { "entropy": 10.7358078956604, "epoch": 0.004183292573046725, "grad_norm": 1.765625, "learning_rate": 3.2e-05, "loss": 9.9017, "mean_token_accuracy": 0.03450035620480776, "num_tokens": 146299.0, "step": 65 }, { "entropy": 10.734182739257813, "epoch": 0.004505084309434934, "grad_norm": 1.9375, "learning_rate": 3.4500000000000005e-05, "loss": 9.8076, "mean_token_accuracy": 0.037839466519653794, "num_tokens": 157494.0, "step": 70 }, { "entropy": 10.73177366256714, "epoch": 0.004826876045823143, "grad_norm": 1.7734375, "learning_rate": 3.7e-05, "loss": 9.7775, "mean_token_accuracy": 0.03611580468714237, "num_tokens": 168226.0, "step": 75 }, { "entropy": 10.728845882415772, "epoch": 0.005148667782211353, "grad_norm": 1.9296875, "learning_rate": 3.95e-05, "loss": 9.6556, "mean_token_accuracy": 0.04190883524715901, "num_tokens": 179311.0, "step": 80 }, { "entropy": 10.725195121765136, "epoch": 0.005470459518599562, "grad_norm": 1.7421875, "learning_rate": 4.2000000000000004e-05, "loss": 9.6267, "mean_token_accuracy": 0.043489571660757065, "num_tokens": 191513.0, "step": 85 }, { "entropy": 10.719332885742187, "epoch": 0.005792251254987772, "grad_norm": 1.8828125, "learning_rate": 4.45e-05, "loss": 9.5397, "mean_token_accuracy": 0.046276621893048285, "num_tokens": 204631.0, "step": 90 }, { "entropy": 10.710766220092774, "epoch": 0.006114042991375981, "grad_norm": 1.7578125, "learning_rate": 4.7000000000000004e-05, "loss": 9.4486, "mean_token_accuracy": 0.0460438147187233, "num_tokens": 215901.0, "step": 95 }, { "entropy": 10.69977626800537, "epoch": 0.0064358347277641914, "grad_norm": 1.8203125, "learning_rate": 4.9500000000000004e-05, "loss": 9.4013, "mean_token_accuracy": 0.044720832630991934, "num_tokens": 228928.0, "step": 100 }, { "entropy": 10.685317134857177, "epoch": 0.006757626464152401, "grad_norm": 1.765625, "learning_rate": 5.2e-05, "loss": 9.3138, "mean_token_accuracy": 0.044154060259461406, "num_tokens": 241543.0, "step": 105 }, { "entropy": 10.66606101989746, "epoch": 0.00707941820054061, "grad_norm": 1.8203125, "learning_rate": 5.45e-05, "loss": 9.1466, "mean_token_accuracy": 0.046302244812250135, "num_tokens": 253267.0, "step": 110 }, { "entropy": 10.636186695098877, "epoch": 0.00740120993692882, "grad_norm": 1.78125, "learning_rate": 5.7e-05, "loss": 9.0141, "mean_token_accuracy": 0.05802988223731518, "num_tokens": 264760.0, "step": 115 }, { "entropy": 10.5947696685791, "epoch": 0.007723001673317029, "grad_norm": 1.75, "learning_rate": 5.9499999999999996e-05, "loss": 8.9075, "mean_token_accuracy": 0.051640312373638156, "num_tokens": 275080.0, "step": 120 }, { "entropy": 10.542396450042725, "epoch": 0.008044793409705238, "grad_norm": 1.7109375, "learning_rate": 6.2e-05, "loss": 8.7919, "mean_token_accuracy": 0.05795170105993748, "num_tokens": 287114.0, "step": 125 }, { "entropy": 10.490421962738036, "epoch": 0.00836658514609345, "grad_norm": 1.6796875, "learning_rate": 6.450000000000001e-05, "loss": 8.6367, "mean_token_accuracy": 0.06025359183549881, "num_tokens": 298732.0, "step": 130 }, { "entropy": 10.417353057861328, "epoch": 0.008688376882481658, "grad_norm": 1.65625, "learning_rate": 6.7e-05, "loss": 8.4641, "mean_token_accuracy": 0.06998355574905872, "num_tokens": 310227.0, "step": 135 }, { "entropy": 10.32230224609375, "epoch": 0.009010168618869868, "grad_norm": 1.4765625, "learning_rate": 6.950000000000001e-05, "loss": 8.3943, "mean_token_accuracy": 0.06697470992803574, "num_tokens": 322724.0, "step": 140 }, { "entropy": 10.228569889068604, "epoch": 0.009331960355258077, "grad_norm": 1.4375, "learning_rate": 7.2e-05, "loss": 8.3137, "mean_token_accuracy": 0.06024596691131592, "num_tokens": 335638.0, "step": 145 }, { "entropy": 10.116732311248779, "epoch": 0.009653752091646286, "grad_norm": 1.453125, "learning_rate": 7.45e-05, "loss": 8.1548, "mean_token_accuracy": 0.07251053638756275, "num_tokens": 346751.0, "step": 150 }, { "entropy": 9.953464126586914, "epoch": 0.009975543828034497, "grad_norm": 1.3359375, "learning_rate": 7.7e-05, "loss": 8.0894, "mean_token_accuracy": 0.07281172573566437, "num_tokens": 357809.0, "step": 155 }, { "entropy": 9.77461576461792, "epoch": 0.010297335564422706, "grad_norm": 1.21875, "learning_rate": 7.950000000000001e-05, "loss": 7.9142, "mean_token_accuracy": 0.06864561475813388, "num_tokens": 369631.0, "step": 160 }, { "entropy": 9.603110790252686, "epoch": 0.010619127300810915, "grad_norm": 1.0390625, "learning_rate": 8.2e-05, "loss": 7.9575, "mean_token_accuracy": 0.06908577904105187, "num_tokens": 380904.0, "step": 165 }, { "entropy": 9.377412414550781, "epoch": 0.010940919037199124, "grad_norm": 1.125, "learning_rate": 8.450000000000001e-05, "loss": 7.7359, "mean_token_accuracy": 0.07545260861515998, "num_tokens": 392898.0, "step": 170 }, { "entropy": 9.168265438079834, "epoch": 0.011262710773587334, "grad_norm": 1.125, "learning_rate": 8.7e-05, "loss": 7.6702, "mean_token_accuracy": 0.07459548935294151, "num_tokens": 404285.0, "step": 175 }, { "entropy": 8.926816463470459, "epoch": 0.011584502509975544, "grad_norm": 1.0, "learning_rate": 8.95e-05, "loss": 7.5717, "mean_token_accuracy": 0.07761912979185581, "num_tokens": 416443.0, "step": 180 }, { "entropy": 8.745314025878907, "epoch": 0.011906294246363754, "grad_norm": 0.96875, "learning_rate": 9.2e-05, "loss": 7.6426, "mean_token_accuracy": 0.0765433344990015, "num_tokens": 426558.0, "step": 185 }, { "entropy": 8.587053394317627, "epoch": 0.012228085982751963, "grad_norm": 1.1796875, "learning_rate": 9.45e-05, "loss": 7.6648, "mean_token_accuracy": 0.07643079459667206, "num_tokens": 437794.0, "step": 190 }, { "entropy": 8.517185878753661, "epoch": 0.012549877719140172, "grad_norm": 1.0546875, "learning_rate": 9.7e-05, "loss": 7.4958, "mean_token_accuracy": 0.07788795456290246, "num_tokens": 448682.0, "step": 195 }, { "entropy": 8.376048374176026, "epoch": 0.012871669455528383, "grad_norm": 1.1640625, "learning_rate": 9.95e-05, "loss": 7.417, "mean_token_accuracy": 0.08175441175699234, "num_tokens": 459699.0, "step": 200 }, { "entropy": 8.276328945159912, "epoch": 0.013193461191916592, "grad_norm": 1.125, "learning_rate": 0.000102, "loss": 7.3537, "mean_token_accuracy": 0.08016520962119103, "num_tokens": 472857.0, "step": 205 }, { "entropy": 8.274100303649902, "epoch": 0.013515252928304801, "grad_norm": 1.0078125, "learning_rate": 0.00010449999999999999, "loss": 7.4194, "mean_token_accuracy": 0.08162855952978135, "num_tokens": 484983.0, "step": 210 }, { "entropy": 8.180224132537841, "epoch": 0.01383704466469301, "grad_norm": 0.99609375, "learning_rate": 0.000107, "loss": 7.3626, "mean_token_accuracy": 0.08450362831354141, "num_tokens": 495973.0, "step": 215 }, { "entropy": 8.187409973144531, "epoch": 0.01415883640108122, "grad_norm": 1.296875, "learning_rate": 0.0001095, "loss": 7.2816, "mean_token_accuracy": 0.090892593562603, "num_tokens": 507017.0, "step": 220 }, { "entropy": 8.120441341400147, "epoch": 0.01448062813746943, "grad_norm": 1.1875, "learning_rate": 0.000112, "loss": 7.36, "mean_token_accuracy": 0.08900276795029641, "num_tokens": 517522.0, "step": 225 }, { "entropy": 8.129059314727783, "epoch": 0.01480241987385764, "grad_norm": 1.015625, "learning_rate": 0.0001145, "loss": 7.3701, "mean_token_accuracy": 0.09131013453006745, "num_tokens": 528240.0, "step": 230 }, { "entropy": 7.994166135787964, "epoch": 0.015124211610245849, "grad_norm": 0.9765625, "learning_rate": 0.00011700000000000001, "loss": 7.328, "mean_token_accuracy": 0.0881452701985836, "num_tokens": 538875.0, "step": 235 }, { "entropy": 8.10927906036377, "epoch": 0.015446003346634058, "grad_norm": 1.109375, "learning_rate": 0.00011949999999999999, "loss": 7.3722, "mean_token_accuracy": 0.08998035714030266, "num_tokens": 549386.0, "step": 240 }, { "entropy": 8.068589448928833, "epoch": 0.015767795083022267, "grad_norm": 1.234375, "learning_rate": 0.000122, "loss": 7.3029, "mean_token_accuracy": 0.08936483487486839, "num_tokens": 559643.0, "step": 245 }, { "entropy": 8.049430751800537, "epoch": 0.016089586819410476, "grad_norm": 1.0546875, "learning_rate": 0.0001245, "loss": 7.2267, "mean_token_accuracy": 0.09506414234638214, "num_tokens": 570932.0, "step": 250 }, { "entropy": 7.93134560585022, "epoch": 0.016411378555798686, "grad_norm": 1.296875, "learning_rate": 0.000127, "loss": 7.2019, "mean_token_accuracy": 0.09725837931036949, "num_tokens": 580258.0, "step": 255 }, { "entropy": 7.893705558776856, "epoch": 0.0167331702921869, "grad_norm": 1.1953125, "learning_rate": 0.0001295, "loss": 7.1337, "mean_token_accuracy": 0.09558385238051414, "num_tokens": 590622.0, "step": 260 }, { "entropy": 7.884620428085327, "epoch": 0.017054962028575107, "grad_norm": 1.0859375, "learning_rate": 0.000132, "loss": 7.1827, "mean_token_accuracy": 0.09120650067925454, "num_tokens": 602202.0, "step": 265 }, { "entropy": 7.823669528961181, "epoch": 0.017376753764963317, "grad_norm": 1.0859375, "learning_rate": 0.00013450000000000002, "loss": 7.1309, "mean_token_accuracy": 0.0979801706969738, "num_tokens": 613864.0, "step": 270 }, { "entropy": 7.87017560005188, "epoch": 0.017698545501351526, "grad_norm": 0.99609375, "learning_rate": 0.00013700000000000002, "loss": 7.2524, "mean_token_accuracy": 0.09466890171170235, "num_tokens": 626884.0, "step": 275 }, { "entropy": 7.857308626174927, "epoch": 0.018020337237739735, "grad_norm": 1.4140625, "learning_rate": 0.0001395, "loss": 7.1612, "mean_token_accuracy": 0.09996400326490402, "num_tokens": 638418.0, "step": 280 }, { "entropy": 7.856085300445557, "epoch": 0.018342128974127944, "grad_norm": 1.125, "learning_rate": 0.00014199999999999998, "loss": 7.1939, "mean_token_accuracy": 0.09103256016969681, "num_tokens": 648376.0, "step": 285 }, { "entropy": 7.9166460037231445, "epoch": 0.018663920710516153, "grad_norm": 1.09375, "learning_rate": 0.0001445, "loss": 7.2464, "mean_token_accuracy": 0.09389530643820762, "num_tokens": 659268.0, "step": 290 }, { "entropy": 7.788627672195434, "epoch": 0.018985712446904363, "grad_norm": 1.03125, "learning_rate": 0.000147, "loss": 7.0223, "mean_token_accuracy": 0.10249627456068992, "num_tokens": 669736.0, "step": 295 }, { "entropy": 7.768741464614868, "epoch": 0.01930750418329257, "grad_norm": 1.0546875, "learning_rate": 0.0001495, "loss": 7.1198, "mean_token_accuracy": 0.0995169997215271, "num_tokens": 681571.0, "step": 300 }, { "entropy": 7.723494529724121, "epoch": 0.01962929591968078, "grad_norm": 0.9375, "learning_rate": 0.000152, "loss": 7.0189, "mean_token_accuracy": 0.10438807159662247, "num_tokens": 692816.0, "step": 305 }, { "entropy": 7.758736324310303, "epoch": 0.019951087656068994, "grad_norm": 1.078125, "learning_rate": 0.00015450000000000001, "loss": 7.1546, "mean_token_accuracy": 0.10238918289542198, "num_tokens": 705089.0, "step": 310 }, { "entropy": 7.666284465789795, "epoch": 0.020272879392457203, "grad_norm": 1.2734375, "learning_rate": 0.000157, "loss": 7.0252, "mean_token_accuracy": 0.10788851976394653, "num_tokens": 716874.0, "step": 315 }, { "entropy": 7.531011438369751, "epoch": 0.020594671128845412, "grad_norm": 1.171875, "learning_rate": 0.0001595, "loss": 6.9807, "mean_token_accuracy": 0.10204816684126854, "num_tokens": 728981.0, "step": 320 }, { "entropy": 7.782111930847168, "epoch": 0.02091646286523362, "grad_norm": 1.109375, "learning_rate": 0.000162, "loss": 7.0871, "mean_token_accuracy": 0.10574771091341972, "num_tokens": 739619.0, "step": 325 }, { "entropy": 7.599967575073242, "epoch": 0.02123825460162183, "grad_norm": 1.1640625, "learning_rate": 0.00016450000000000001, "loss": 7.0537, "mean_token_accuracy": 0.10123220011591912, "num_tokens": 751363.0, "step": 330 }, { "entropy": 7.667736959457398, "epoch": 0.02156004633801004, "grad_norm": 1.15625, "learning_rate": 0.00016700000000000002, "loss": 7.0722, "mean_token_accuracy": 0.10424386709928513, "num_tokens": 762953.0, "step": 335 }, { "entropy": 7.489533710479736, "epoch": 0.02188183807439825, "grad_norm": 1.1796875, "learning_rate": 0.00016950000000000003, "loss": 6.9886, "mean_token_accuracy": 0.10709020495414734, "num_tokens": 775237.0, "step": 340 }, { "entropy": 7.635052871704102, "epoch": 0.022203629810786458, "grad_norm": 1.109375, "learning_rate": 0.00017199999999999998, "loss": 6.9133, "mean_token_accuracy": 0.11272823959589004, "num_tokens": 786262.0, "step": 345 }, { "entropy": 7.458449077606201, "epoch": 0.022525421547174667, "grad_norm": 1.2265625, "learning_rate": 0.00017449999999999999, "loss": 6.9036, "mean_token_accuracy": 0.11083822324872017, "num_tokens": 797201.0, "step": 350 }, { "entropy": 7.504961967468262, "epoch": 0.02284721328356288, "grad_norm": 1.09375, "learning_rate": 0.000177, "loss": 6.8593, "mean_token_accuracy": 0.11371754407882691, "num_tokens": 807671.0, "step": 355 }, { "entropy": 7.4689586639404295, "epoch": 0.02316900501995109, "grad_norm": 1.1015625, "learning_rate": 0.0001795, "loss": 6.8925, "mean_token_accuracy": 0.109658332914114, "num_tokens": 819142.0, "step": 360 }, { "entropy": 7.5210926055908205, "epoch": 0.023490796756339298, "grad_norm": 1.1484375, "learning_rate": 0.000182, "loss": 6.8902, "mean_token_accuracy": 0.11664389371871949, "num_tokens": 829634.0, "step": 365 }, { "entropy": 7.562618398666382, "epoch": 0.023812588492727507, "grad_norm": 1.0625, "learning_rate": 0.0001845, "loss": 6.9457, "mean_token_accuracy": 0.11507059112191201, "num_tokens": 840723.0, "step": 370 }, { "entropy": 7.44709038734436, "epoch": 0.024134380229115716, "grad_norm": 1.1171875, "learning_rate": 0.000187, "loss": 6.9014, "mean_token_accuracy": 0.11120686307549477, "num_tokens": 852299.0, "step": 375 }, { "entropy": 7.542909240722656, "epoch": 0.024456171965503926, "grad_norm": 1.1328125, "learning_rate": 0.0001895, "loss": 6.8845, "mean_token_accuracy": 0.11418962627649307, "num_tokens": 864427.0, "step": 380 }, { "entropy": 7.269602823257446, "epoch": 0.024777963701892135, "grad_norm": 1.1015625, "learning_rate": 0.000192, "loss": 6.8457, "mean_token_accuracy": 0.11314126327633858, "num_tokens": 876188.0, "step": 385 }, { "entropy": 7.539252614974975, "epoch": 0.025099755438280344, "grad_norm": 1.296875, "learning_rate": 0.0001945, "loss": 6.9751, "mean_token_accuracy": 0.10968251451849938, "num_tokens": 886835.0, "step": 390 }, { "entropy": 7.462894248962402, "epoch": 0.025421547174668553, "grad_norm": 1.09375, "learning_rate": 0.00019700000000000002, "loss": 6.8758, "mean_token_accuracy": 0.1175595462322235, "num_tokens": 899609.0, "step": 395 }, { "entropy": 7.514445400238037, "epoch": 0.025743338911056766, "grad_norm": 1.1484375, "learning_rate": 0.00019950000000000002, "loss": 6.9867, "mean_token_accuracy": 0.10821878015995026, "num_tokens": 912114.0, "step": 400 }, { "entropy": 7.434127473831177, "epoch": 0.026065130647444975, "grad_norm": 1.0078125, "learning_rate": 0.000202, "loss": 6.9875, "mean_token_accuracy": 0.1139479123055935, "num_tokens": 923788.0, "step": 405 }, { "entropy": 7.338033294677734, "epoch": 0.026386922383833184, "grad_norm": 1.234375, "learning_rate": 0.00020449999999999998, "loss": 6.6791, "mean_token_accuracy": 0.1255500763654709, "num_tokens": 934952.0, "step": 410 }, { "entropy": 7.422152519226074, "epoch": 0.026708714120221393, "grad_norm": 1.4609375, "learning_rate": 0.000207, "loss": 6.7758, "mean_token_accuracy": 0.11906903460621834, "num_tokens": 945780.0, "step": 415 }, { "entropy": 7.29374885559082, "epoch": 0.027030505856609603, "grad_norm": 1.1015625, "learning_rate": 0.0002095, "loss": 6.7765, "mean_token_accuracy": 0.12052410319447518, "num_tokens": 958502.0, "step": 420 }, { "entropy": 7.422839784622193, "epoch": 0.02735229759299781, "grad_norm": 1.46875, "learning_rate": 0.000212, "loss": 6.8635, "mean_token_accuracy": 0.11772049516439438, "num_tokens": 969339.0, "step": 425 }, { "entropy": 7.215829658508301, "epoch": 0.02767408932938602, "grad_norm": 1.125, "learning_rate": 0.0002145, "loss": 6.7171, "mean_token_accuracy": 0.12233989164233208, "num_tokens": 980260.0, "step": 430 }, { "entropy": 7.2986561298370365, "epoch": 0.02799588106577423, "grad_norm": 1.21875, "learning_rate": 0.00021700000000000002, "loss": 6.6963, "mean_token_accuracy": 0.11892440766096116, "num_tokens": 991960.0, "step": 435 }, { "entropy": 7.193790006637573, "epoch": 0.02831767280216244, "grad_norm": 1.1328125, "learning_rate": 0.0002195, "loss": 6.7273, "mean_token_accuracy": 0.11868971958756447, "num_tokens": 1002083.0, "step": 440 }, { "entropy": 7.308983230590821, "epoch": 0.02863946453855065, "grad_norm": 1.109375, "learning_rate": 0.000222, "loss": 6.7375, "mean_token_accuracy": 0.11723077073693275, "num_tokens": 1012896.0, "step": 445 }, { "entropy": 7.334416151046753, "epoch": 0.02896125627493886, "grad_norm": 1.109375, "learning_rate": 0.0002245, "loss": 6.8189, "mean_token_accuracy": 0.12101824656128883, "num_tokens": 1024570.0, "step": 450 }, { "entropy": 7.2581829071044925, "epoch": 0.02928304801132707, "grad_norm": 1.1640625, "learning_rate": 0.00022700000000000002, "loss": 6.6596, "mean_token_accuracy": 0.1274547331035137, "num_tokens": 1035934.0, "step": 455 }, { "entropy": 7.214243841171265, "epoch": 0.02960483974771528, "grad_norm": 1.109375, "learning_rate": 0.00022950000000000002, "loss": 6.8555, "mean_token_accuracy": 0.11035279110074044, "num_tokens": 1047557.0, "step": 460 }, { "entropy": 7.284564542770386, "epoch": 0.02992663148410349, "grad_norm": 1.0703125, "learning_rate": 0.00023200000000000003, "loss": 6.8011, "mean_token_accuracy": 0.11536358669400215, "num_tokens": 1059387.0, "step": 465 }, { "entropy": 7.255402135848999, "epoch": 0.030248423220491698, "grad_norm": 1.2109375, "learning_rate": 0.00023449999999999998, "loss": 6.8003, "mean_token_accuracy": 0.11578696817159653, "num_tokens": 1070756.0, "step": 470 }, { "entropy": 7.274528503417969, "epoch": 0.030570214956879907, "grad_norm": 1.2734375, "learning_rate": 0.000237, "loss": 6.7873, "mean_token_accuracy": 0.1295149154961109, "num_tokens": 1083147.0, "step": 475 }, { "entropy": 7.171627616882324, "epoch": 0.030892006693268116, "grad_norm": 1.0625, "learning_rate": 0.0002395, "loss": 6.6541, "mean_token_accuracy": 0.12174521461129188, "num_tokens": 1094300.0, "step": 480 }, { "entropy": 7.192223072052002, "epoch": 0.031213798429656325, "grad_norm": 1.015625, "learning_rate": 0.000242, "loss": 6.7988, "mean_token_accuracy": 0.11465005055069924, "num_tokens": 1105991.0, "step": 485 }, { "entropy": 7.2635111808776855, "epoch": 0.031535590166044535, "grad_norm": 1.1875, "learning_rate": 0.0002445, "loss": 6.8278, "mean_token_accuracy": 0.11537677273154259, "num_tokens": 1118065.0, "step": 490 }, { "entropy": 7.217528486251831, "epoch": 0.031857381902432744, "grad_norm": 1.3671875, "learning_rate": 0.000247, "loss": 6.772, "mean_token_accuracy": 0.12680590748786927, "num_tokens": 1130521.0, "step": 495 }, { "entropy": 7.099181175231934, "epoch": 0.03217917363882095, "grad_norm": 1.15625, "learning_rate": 0.0002495, "loss": 6.7436, "mean_token_accuracy": 0.11461131051182746, "num_tokens": 1143241.0, "step": 500 }, { "entropy": 7.2616432189941404, "epoch": 0.03250096537520916, "grad_norm": 1.078125, "learning_rate": 0.000252, "loss": 6.698, "mean_token_accuracy": 0.1210433527827263, "num_tokens": 1154240.0, "step": 505 }, { "entropy": 7.08572096824646, "epoch": 0.03282275711159737, "grad_norm": 1.0390625, "learning_rate": 0.0002545, "loss": 6.6583, "mean_token_accuracy": 0.12035112828016281, "num_tokens": 1166134.0, "step": 510 }, { "entropy": 7.13088059425354, "epoch": 0.03314454884798558, "grad_norm": 1.140625, "learning_rate": 0.000257, "loss": 6.6952, "mean_token_accuracy": 0.12703741267323493, "num_tokens": 1177183.0, "step": 515 }, { "entropy": 7.25070538520813, "epoch": 0.0334663405843738, "grad_norm": 1.15625, "learning_rate": 0.0002595, "loss": 6.8061, "mean_token_accuracy": 0.11820513978600503, "num_tokens": 1189266.0, "step": 520 }, { "entropy": 7.051825141906738, "epoch": 0.033788132320762006, "grad_norm": 1.0390625, "learning_rate": 0.000262, "loss": 6.6082, "mean_token_accuracy": 0.12360260263085365, "num_tokens": 1199718.0, "step": 525 }, { "entropy": 7.207192850112915, "epoch": 0.034109924057150215, "grad_norm": 1.1640625, "learning_rate": 0.00026450000000000003, "loss": 6.7443, "mean_token_accuracy": 0.1214994914829731, "num_tokens": 1210278.0, "step": 530 }, { "entropy": 7.183014011383056, "epoch": 0.034431715793538424, "grad_norm": 1.2109375, "learning_rate": 0.00026700000000000004, "loss": 6.6847, "mean_token_accuracy": 0.12363504841923714, "num_tokens": 1221012.0, "step": 535 }, { "entropy": 7.097731018066407, "epoch": 0.03475350752992663, "grad_norm": 1.078125, "learning_rate": 0.00026950000000000005, "loss": 6.6674, "mean_token_accuracy": 0.1205046035349369, "num_tokens": 1232687.0, "step": 540 }, { "entropy": 7.153340673446655, "epoch": 0.03507529926631484, "grad_norm": 1.1171875, "learning_rate": 0.00027200000000000005, "loss": 6.6428, "mean_token_accuracy": 0.127882944047451, "num_tokens": 1243994.0, "step": 545 }, { "entropy": 7.048250007629394, "epoch": 0.03539709100270305, "grad_norm": 1.203125, "learning_rate": 0.0002745, "loss": 6.6121, "mean_token_accuracy": 0.1261216700077057, "num_tokens": 1254705.0, "step": 550 }, { "entropy": 7.134361505508423, "epoch": 0.03571888273909126, "grad_norm": 1.15625, "learning_rate": 0.000277, "loss": 6.7227, "mean_token_accuracy": 0.12077815011143685, "num_tokens": 1266367.0, "step": 555 }, { "entropy": 7.047533082962036, "epoch": 0.03604067447547947, "grad_norm": 1.3671875, "learning_rate": 0.0002795, "loss": 6.6958, "mean_token_accuracy": 0.12296305298805237, "num_tokens": 1279004.0, "step": 560 }, { "entropy": 7.034592580795288, "epoch": 0.03636246621186768, "grad_norm": 1.1796875, "learning_rate": 0.00028199999999999997, "loss": 6.5162, "mean_token_accuracy": 0.12805850878357888, "num_tokens": 1290980.0, "step": 565 }, { "entropy": 7.040336656570434, "epoch": 0.03668425794825589, "grad_norm": 0.9375, "learning_rate": 0.0002845, "loss": 6.6749, "mean_token_accuracy": 0.12128347530961037, "num_tokens": 1302396.0, "step": 570 }, { "entropy": 7.105546283721924, "epoch": 0.0370060496846441, "grad_norm": 1.2578125, "learning_rate": 0.000287, "loss": 6.6356, "mean_token_accuracy": 0.1311293475329876, "num_tokens": 1312304.0, "step": 575 }, { "entropy": 7.081285810470581, "epoch": 0.03732784142103231, "grad_norm": 1.2890625, "learning_rate": 0.0002895, "loss": 6.7769, "mean_token_accuracy": 0.12450022101402283, "num_tokens": 1325487.0, "step": 580 }, { "entropy": 7.005313682556152, "epoch": 0.037649633157420516, "grad_norm": 1.1484375, "learning_rate": 0.000292, "loss": 6.6247, "mean_token_accuracy": 0.126084253937006, "num_tokens": 1336754.0, "step": 585 }, { "entropy": 7.028646039962768, "epoch": 0.037971424893808725, "grad_norm": 1.2265625, "learning_rate": 0.0002945, "loss": 6.6309, "mean_token_accuracy": 0.12374395728111268, "num_tokens": 1347918.0, "step": 590 }, { "entropy": 7.05291862487793, "epoch": 0.038293216630196934, "grad_norm": 1.0078125, "learning_rate": 0.000297, "loss": 6.6336, "mean_token_accuracy": 0.13012145236134529, "num_tokens": 1359981.0, "step": 595 }, { "entropy": 7.028671169281006, "epoch": 0.03861500836658514, "grad_norm": 1.046875, "learning_rate": 0.0002995, "loss": 6.6423, "mean_token_accuracy": 0.1260800801217556, "num_tokens": 1371359.0, "step": 600 }, { "entropy": 7.067501354217529, "epoch": 0.03893680010297335, "grad_norm": 1.125, "learning_rate": 0.000302, "loss": 6.6909, "mean_token_accuracy": 0.11782569289207459, "num_tokens": 1383829.0, "step": 605 }, { "entropy": 7.0067911624908445, "epoch": 0.03925859183936156, "grad_norm": 1.2578125, "learning_rate": 0.0003045, "loss": 6.5645, "mean_token_accuracy": 0.13620257899165153, "num_tokens": 1394266.0, "step": 610 }, { "entropy": 6.985071325302124, "epoch": 0.03958038357574978, "grad_norm": 1.1015625, "learning_rate": 0.000307, "loss": 6.5691, "mean_token_accuracy": 0.1302391119301319, "num_tokens": 1405798.0, "step": 615 }, { "entropy": 6.973874282836914, "epoch": 0.03990217531213799, "grad_norm": 1.265625, "learning_rate": 0.0003095, "loss": 6.5689, "mean_token_accuracy": 0.13187146857380866, "num_tokens": 1417411.0, "step": 620 }, { "entropy": 7.0129351139068605, "epoch": 0.040223967048526196, "grad_norm": 1.0078125, "learning_rate": 0.000312, "loss": 6.6911, "mean_token_accuracy": 0.12921356335282325, "num_tokens": 1428987.0, "step": 625 }, { "entropy": 6.938956356048584, "epoch": 0.040545758784914405, "grad_norm": 1.25, "learning_rate": 0.0003145, "loss": 6.6049, "mean_token_accuracy": 0.12962101995944977, "num_tokens": 1440023.0, "step": 630 }, { "entropy": 7.100988531112671, "epoch": 0.040867550521302615, "grad_norm": 1.3046875, "learning_rate": 0.000317, "loss": 6.6762, "mean_token_accuracy": 0.1187206856906414, "num_tokens": 1451078.0, "step": 635 }, { "entropy": 7.031370496749878, "epoch": 0.041189342257690824, "grad_norm": 1.0703125, "learning_rate": 0.0003195, "loss": 6.6551, "mean_token_accuracy": 0.12284370735287667, "num_tokens": 1462446.0, "step": 640 }, { "entropy": 6.888606119155884, "epoch": 0.04151113399407903, "grad_norm": 1.3671875, "learning_rate": 0.000322, "loss": 6.5127, "mean_token_accuracy": 0.131097362190485, "num_tokens": 1472084.0, "step": 645 }, { "entropy": 6.948457860946656, "epoch": 0.04183292573046724, "grad_norm": 1.0625, "learning_rate": 0.00032450000000000003, "loss": 6.553, "mean_token_accuracy": 0.1207494542002678, "num_tokens": 1482464.0, "step": 650 }, { "entropy": 6.960102081298828, "epoch": 0.04215471746685545, "grad_norm": 1.1640625, "learning_rate": 0.00032700000000000003, "loss": 6.592, "mean_token_accuracy": 0.12484122142195701, "num_tokens": 1492789.0, "step": 655 }, { "entropy": 6.917847633361816, "epoch": 0.04247650920324366, "grad_norm": 1.140625, "learning_rate": 0.00032950000000000004, "loss": 6.5871, "mean_token_accuracy": 0.1326150640845299, "num_tokens": 1504438.0, "step": 660 }, { "entropy": 7.005792331695557, "epoch": 0.04279830093963187, "grad_norm": 1.0859375, "learning_rate": 0.00033200000000000005, "loss": 6.5294, "mean_token_accuracy": 0.1296870678663254, "num_tokens": 1515430.0, "step": 665 }, { "entropy": 6.8461448669433596, "epoch": 0.04312009267602008, "grad_norm": 1.125, "learning_rate": 0.00033450000000000005, "loss": 6.4998, "mean_token_accuracy": 0.13402296751737594, "num_tokens": 1525804.0, "step": 670 }, { "entropy": 6.924587154388428, "epoch": 0.04344188441240829, "grad_norm": 1.0625, "learning_rate": 0.000337, "loss": 6.5119, "mean_token_accuracy": 0.12666192203760146, "num_tokens": 1537638.0, "step": 675 }, { "entropy": 6.82023057937622, "epoch": 0.0437636761487965, "grad_norm": 1.34375, "learning_rate": 0.0003395, "loss": 6.4856, "mean_token_accuracy": 0.13445887267589568, "num_tokens": 1548232.0, "step": 680 }, { "entropy": 6.93139066696167, "epoch": 0.044085467885184706, "grad_norm": 1.2734375, "learning_rate": 0.000342, "loss": 6.5018, "mean_token_accuracy": 0.13019829168915747, "num_tokens": 1558781.0, "step": 685 }, { "entropy": 6.913920307159424, "epoch": 0.044407259621572916, "grad_norm": 1.1328125, "learning_rate": 0.00034449999999999997, "loss": 6.4656, "mean_token_accuracy": 0.1352573812007904, "num_tokens": 1571387.0, "step": 690 }, { "entropy": 6.8577742099761965, "epoch": 0.044729051357961125, "grad_norm": 1.1640625, "learning_rate": 0.000347, "loss": 6.5251, "mean_token_accuracy": 0.13332423493266105, "num_tokens": 1582471.0, "step": 695 }, { "entropy": 6.825550699234009, "epoch": 0.045050843094349334, "grad_norm": 1.1875, "learning_rate": 0.0003495, "loss": 6.484, "mean_token_accuracy": 0.13259591534733772, "num_tokens": 1592967.0, "step": 700 }, { "entropy": 6.84607195854187, "epoch": 0.04537263483073754, "grad_norm": 1.15625, "learning_rate": 0.000352, "loss": 6.4834, "mean_token_accuracy": 0.1336855672299862, "num_tokens": 1603772.0, "step": 705 }, { "entropy": 6.906696319580078, "epoch": 0.04569442656712576, "grad_norm": 1.1953125, "learning_rate": 0.0003545, "loss": 6.4789, "mean_token_accuracy": 0.12700057551264762, "num_tokens": 1614924.0, "step": 710 }, { "entropy": 6.7945763111114506, "epoch": 0.04601621830351397, "grad_norm": 0.953125, "learning_rate": 0.000357, "loss": 6.4715, "mean_token_accuracy": 0.13077478110790253, "num_tokens": 1626947.0, "step": 715 }, { "entropy": 6.796080684661865, "epoch": 0.04633801003990218, "grad_norm": 1.03125, "learning_rate": 0.0003595, "loss": 6.3518, "mean_token_accuracy": 0.13691332638263704, "num_tokens": 1638651.0, "step": 720 }, { "entropy": 6.753641128540039, "epoch": 0.04665980177629039, "grad_norm": 1.1484375, "learning_rate": 0.000362, "loss": 6.4204, "mean_token_accuracy": 0.1394519940018654, "num_tokens": 1650157.0, "step": 725 }, { "entropy": 6.7741881847381595, "epoch": 0.046981593512678596, "grad_norm": 1.0078125, "learning_rate": 0.0003645, "loss": 6.418, "mean_token_accuracy": 0.133515302836895, "num_tokens": 1661763.0, "step": 730 }, { "entropy": 6.971210908889771, "epoch": 0.047303385249066805, "grad_norm": 1.109375, "learning_rate": 0.000367, "loss": 6.6075, "mean_token_accuracy": 0.12115295752882957, "num_tokens": 1674051.0, "step": 735 }, { "entropy": 6.856794738769532, "epoch": 0.047625176985455014, "grad_norm": 1.2578125, "learning_rate": 0.0003695, "loss": 6.4626, "mean_token_accuracy": 0.1338093623518944, "num_tokens": 1685240.0, "step": 740 }, { "entropy": 6.777393484115601, "epoch": 0.047946968721843224, "grad_norm": 1.0546875, "learning_rate": 0.000372, "loss": 6.4435, "mean_token_accuracy": 0.1303575173020363, "num_tokens": 1697472.0, "step": 745 }, { "entropy": 6.796992444992066, "epoch": 0.04826876045823143, "grad_norm": 1.1171875, "learning_rate": 0.0003745, "loss": 6.4543, "mean_token_accuracy": 0.1324995703995228, "num_tokens": 1708383.0, "step": 750 }, { "entropy": 6.788374280929565, "epoch": 0.04859055219461964, "grad_norm": 1.0390625, "learning_rate": 0.000377, "loss": 6.4631, "mean_token_accuracy": 0.13005806729197503, "num_tokens": 1720367.0, "step": 755 }, { "entropy": 6.780432558059692, "epoch": 0.04891234393100785, "grad_norm": 1.1875, "learning_rate": 0.0003795, "loss": 6.445, "mean_token_accuracy": 0.13468715846538543, "num_tokens": 1731252.0, "step": 760 }, { "entropy": 6.793448638916016, "epoch": 0.04923413566739606, "grad_norm": 1.140625, "learning_rate": 0.000382, "loss": 6.4776, "mean_token_accuracy": 0.1371725916862488, "num_tokens": 1741865.0, "step": 765 }, { "entropy": 6.7858991622924805, "epoch": 0.04955592740378427, "grad_norm": 1.0859375, "learning_rate": 0.0003845, "loss": 6.4394, "mean_token_accuracy": 0.13146187737584114, "num_tokens": 1754036.0, "step": 770 }, { "entropy": 6.814309310913086, "epoch": 0.04987771914017248, "grad_norm": 1.296875, "learning_rate": 0.00038700000000000003, "loss": 6.4836, "mean_token_accuracy": 0.12894209176301957, "num_tokens": 1764717.0, "step": 775 }, { "entropy": 6.754202890396118, "epoch": 0.05019951087656069, "grad_norm": 0.9609375, "learning_rate": 0.00038950000000000003, "loss": 6.383, "mean_token_accuracy": 0.13913563415408134, "num_tokens": 1777078.0, "step": 780 }, { "entropy": 6.852421665191651, "epoch": 0.0505213026129489, "grad_norm": 1.0390625, "learning_rate": 0.00039200000000000004, "loss": 6.453, "mean_token_accuracy": 0.12606742605566978, "num_tokens": 1788393.0, "step": 785 }, { "entropy": 6.727867794036865, "epoch": 0.050843094349337106, "grad_norm": 1.109375, "learning_rate": 0.00039450000000000005, "loss": 6.5638, "mean_token_accuracy": 0.12575344145298004, "num_tokens": 1799535.0, "step": 790 }, { "entropy": 6.849759912490844, "epoch": 0.051164886085725315, "grad_norm": 1.2265625, "learning_rate": 0.00039700000000000005, "loss": 6.3297, "mean_token_accuracy": 0.13775620311498643, "num_tokens": 1809733.0, "step": 795 }, { "entropy": 6.681720924377442, "epoch": 0.05148667782211353, "grad_norm": 0.9609375, "learning_rate": 0.0003995, "loss": 6.3793, "mean_token_accuracy": 0.13796758204698562, "num_tokens": 1821535.0, "step": 800 }, { "entropy": 6.674613428115845, "epoch": 0.05180846955850174, "grad_norm": 1.140625, "learning_rate": 0.000402, "loss": 6.3629, "mean_token_accuracy": 0.13800609484314919, "num_tokens": 1832355.0, "step": 805 }, { "entropy": 6.773230028152466, "epoch": 0.05213026129488995, "grad_norm": 1.0390625, "learning_rate": 0.0004045, "loss": 6.3386, "mean_token_accuracy": 0.1425774149596691, "num_tokens": 1843340.0, "step": 810 }, { "entropy": 6.642430782318115, "epoch": 0.05245205303127816, "grad_norm": 1.265625, "learning_rate": 0.00040699999999999997, "loss": 6.3684, "mean_token_accuracy": 0.13916084170341492, "num_tokens": 1854233.0, "step": 815 }, { "entropy": 6.633238887786865, "epoch": 0.05277384476766637, "grad_norm": 1.046875, "learning_rate": 0.0004095, "loss": 6.3114, "mean_token_accuracy": 0.13679933026432992, "num_tokens": 1864860.0, "step": 820 }, { "entropy": 6.780126476287842, "epoch": 0.05309563650405458, "grad_norm": 1.0625, "learning_rate": 0.000412, "loss": 6.2908, "mean_token_accuracy": 0.14247430860996246, "num_tokens": 1875981.0, "step": 825 }, { "entropy": 6.616991996765137, "epoch": 0.05341742824044279, "grad_norm": 0.99609375, "learning_rate": 0.0004145, "loss": 6.4106, "mean_token_accuracy": 0.13161869645118712, "num_tokens": 1889147.0, "step": 830 }, { "entropy": 6.857424640655518, "epoch": 0.053739219976830996, "grad_norm": 1.1328125, "learning_rate": 0.000417, "loss": 6.4176, "mean_token_accuracy": 0.13287485763430595, "num_tokens": 1900823.0, "step": 835 }, { "entropy": 6.622591257095337, "epoch": 0.054061011713219205, "grad_norm": 1.15625, "learning_rate": 0.0004195, "loss": 6.3323, "mean_token_accuracy": 0.13574840426445006, "num_tokens": 1910882.0, "step": 840 }, { "entropy": 6.52352614402771, "epoch": 0.054382803449607414, "grad_norm": 1.2578125, "learning_rate": 0.000422, "loss": 6.2885, "mean_token_accuracy": 0.1370130032300949, "num_tokens": 1922228.0, "step": 845 }, { "entropy": 6.675861597061157, "epoch": 0.05470459518599562, "grad_norm": 1.125, "learning_rate": 0.0004245, "loss": 6.3254, "mean_token_accuracy": 0.13999047502875328, "num_tokens": 1933400.0, "step": 850 }, { "entropy": 6.6365453720092775, "epoch": 0.05502638692238383, "grad_norm": 1.1171875, "learning_rate": 0.000427, "loss": 6.3747, "mean_token_accuracy": 0.13206338435411452, "num_tokens": 1944717.0, "step": 855 }, { "entropy": 6.806672430038452, "epoch": 0.05534817865877204, "grad_norm": 1.2265625, "learning_rate": 0.0004295, "loss": 6.4465, "mean_token_accuracy": 0.1298723392188549, "num_tokens": 1956116.0, "step": 860 }, { "entropy": 6.787279891967773, "epoch": 0.05566997039516025, "grad_norm": 1.1640625, "learning_rate": 0.000432, "loss": 6.4613, "mean_token_accuracy": 0.13620107173919677, "num_tokens": 1967183.0, "step": 865 }, { "entropy": 6.522842454910278, "epoch": 0.05599176213154846, "grad_norm": 1.0, "learning_rate": 0.0004345, "loss": 6.2558, "mean_token_accuracy": 0.14262447282671928, "num_tokens": 1978943.0, "step": 870 }, { "entropy": 6.580580043792724, "epoch": 0.05631355386793667, "grad_norm": 1.109375, "learning_rate": 0.000437, "loss": 6.2737, "mean_token_accuracy": 0.14003785327076912, "num_tokens": 1990818.0, "step": 875 }, { "entropy": 6.574157285690307, "epoch": 0.05663534560432488, "grad_norm": 1.0390625, "learning_rate": 0.0004395, "loss": 6.2641, "mean_token_accuracy": 0.14258711114525796, "num_tokens": 2002309.0, "step": 880 }, { "entropy": 6.655279111862183, "epoch": 0.05695713734071309, "grad_norm": 0.9453125, "learning_rate": 0.000442, "loss": 6.4362, "mean_token_accuracy": 0.1311865270137787, "num_tokens": 2013131.0, "step": 885 }, { "entropy": 6.861530065536499, "epoch": 0.0572789290771013, "grad_norm": 1.078125, "learning_rate": 0.0004445, "loss": 6.5215, "mean_token_accuracy": 0.12429815754294396, "num_tokens": 2024881.0, "step": 890 }, { "entropy": 6.6120974063873295, "epoch": 0.05760072081348951, "grad_norm": 1.1015625, "learning_rate": 0.000447, "loss": 6.3878, "mean_token_accuracy": 0.13595437854528428, "num_tokens": 2035633.0, "step": 895 }, { "entropy": 6.62742280960083, "epoch": 0.05792251254987772, "grad_norm": 1.125, "learning_rate": 0.00044950000000000003, "loss": 6.2356, "mean_token_accuracy": 0.14306803271174431, "num_tokens": 2046237.0, "step": 900 }, { "entropy": 6.552933835983277, "epoch": 0.05824430428626593, "grad_norm": 1.25, "learning_rate": 0.00045200000000000004, "loss": 6.2148, "mean_token_accuracy": 0.14152271002531053, "num_tokens": 2058158.0, "step": 905 }, { "entropy": 6.638343429565429, "epoch": 0.05856609602265414, "grad_norm": 1.21875, "learning_rate": 0.00045450000000000004, "loss": 6.4302, "mean_token_accuracy": 0.13081190586090088, "num_tokens": 2068364.0, "step": 910 }, { "entropy": 6.667097568511963, "epoch": 0.05888788775904235, "grad_norm": 1.0859375, "learning_rate": 0.00045700000000000005, "loss": 6.3678, "mean_token_accuracy": 0.12357937470078469, "num_tokens": 2080168.0, "step": 915 }, { "entropy": 6.584589195251465, "epoch": 0.05920967949543056, "grad_norm": 1.1171875, "learning_rate": 0.00045950000000000006, "loss": 6.2459, "mean_token_accuracy": 0.14396512135863304, "num_tokens": 2089908.0, "step": 920 }, { "entropy": 6.65417799949646, "epoch": 0.05953147123181877, "grad_norm": 1.0625, "learning_rate": 0.000462, "loss": 6.3424, "mean_token_accuracy": 0.13211728110909463, "num_tokens": 2101403.0, "step": 925 }, { "entropy": 6.49568543434143, "epoch": 0.05985326296820698, "grad_norm": 0.9453125, "learning_rate": 0.0004645, "loss": 6.2153, "mean_token_accuracy": 0.14081560969352722, "num_tokens": 2113940.0, "step": 930 }, { "entropy": 6.544306850433349, "epoch": 0.060175054704595186, "grad_norm": 1.046875, "learning_rate": 0.000467, "loss": 6.2557, "mean_token_accuracy": 0.1435394138097763, "num_tokens": 2124467.0, "step": 935 }, { "entropy": 6.588162183761597, "epoch": 0.060496846440983396, "grad_norm": 1.265625, "learning_rate": 0.0004695, "loss": 6.2399, "mean_token_accuracy": 0.1443529948592186, "num_tokens": 2136147.0, "step": 940 }, { "entropy": 6.542601013183594, "epoch": 0.060818638177371605, "grad_norm": 1.078125, "learning_rate": 0.000472, "loss": 6.2855, "mean_token_accuracy": 0.14248571097850798, "num_tokens": 2147494.0, "step": 945 }, { "entropy": 6.513602781295776, "epoch": 0.061140429913759814, "grad_norm": 1.1328125, "learning_rate": 0.0004745, "loss": 6.1673, "mean_token_accuracy": 0.14396455883979797, "num_tokens": 2157660.0, "step": 950 }, { "entropy": 6.415520524978637, "epoch": 0.06146222165014802, "grad_norm": 0.91796875, "learning_rate": 0.000477, "loss": 6.2775, "mean_token_accuracy": 0.1388951927423477, "num_tokens": 2170629.0, "step": 955 }, { "entropy": 6.536985874176025, "epoch": 0.06178401338653623, "grad_norm": 1.296875, "learning_rate": 0.0004795, "loss": 6.1999, "mean_token_accuracy": 0.14611724615097046, "num_tokens": 2181945.0, "step": 960 }, { "entropy": 6.555672550201416, "epoch": 0.06210580512292444, "grad_norm": 1.03125, "learning_rate": 0.000482, "loss": 6.2884, "mean_token_accuracy": 0.13931862711906434, "num_tokens": 2192975.0, "step": 965 }, { "entropy": 6.523555850982666, "epoch": 0.06242759685931265, "grad_norm": 1.140625, "learning_rate": 0.0004845, "loss": 6.2292, "mean_token_accuracy": 0.14297346845269204, "num_tokens": 2203929.0, "step": 970 }, { "entropy": 6.551759815216064, "epoch": 0.06274938859570087, "grad_norm": 1.0234375, "learning_rate": 0.000487, "loss": 6.2444, "mean_token_accuracy": 0.14618593230843543, "num_tokens": 2214296.0, "step": 975 }, { "entropy": 6.542734003067016, "epoch": 0.06307118033208907, "grad_norm": 1.125, "learning_rate": 0.0004895, "loss": 6.2657, "mean_token_accuracy": 0.1420005366206169, "num_tokens": 2224834.0, "step": 980 }, { "entropy": 6.490674257278442, "epoch": 0.06339297206847729, "grad_norm": 1.1171875, "learning_rate": 0.000492, "loss": 6.1984, "mean_token_accuracy": 0.14470900744199752, "num_tokens": 2236261.0, "step": 985 }, { "entropy": 6.574054622650147, "epoch": 0.06371476380486549, "grad_norm": 1.03125, "learning_rate": 0.0004945, "loss": 6.445, "mean_token_accuracy": 0.1385732315480709, "num_tokens": 2248056.0, "step": 990 }, { "entropy": 6.560631370544433, "epoch": 0.0640365555412537, "grad_norm": 1.046875, "learning_rate": 0.000497, "loss": 6.2375, "mean_token_accuracy": 0.13548775166273117, "num_tokens": 2258304.0, "step": 995 }, { "entropy": 6.553973388671875, "epoch": 0.0643583472776419, "grad_norm": 1.1015625, "learning_rate": 0.0004995, "loss": 6.3626, "mean_token_accuracy": 0.14208254665136338, "num_tokens": 2269541.0, "step": 1000 }, { "entropy": 6.420248031616211, "epoch": 0.06468013901403012, "grad_norm": 1.21875, "learning_rate": 0.000499998026082006, "loss": 6.1734, "mean_token_accuracy": 0.15447934120893478, "num_tokens": 2280812.0, "step": 1005 }, { "entropy": 6.664107942581177, "epoch": 0.06500193075041832, "grad_norm": 1.1171875, "learning_rate": 0.0004999900070995136, "loss": 6.3506, "mean_token_accuracy": 0.14142308607697487, "num_tokens": 2291833.0, "step": 1010 }, { "entropy": 6.523155164718628, "epoch": 0.06532372248680654, "grad_norm": 1.1328125, "learning_rate": 0.0004999758199023239, "loss": 6.2563, "mean_token_accuracy": 0.145108150690794, "num_tokens": 2302218.0, "step": 1015 }, { "entropy": 6.581012916564942, "epoch": 0.06564551422319474, "grad_norm": 1.078125, "learning_rate": 0.0004999554648793858, "loss": 6.3207, "mean_token_accuracy": 0.13909797295928, "num_tokens": 2313355.0, "step": 1020 }, { "entropy": 6.397714710235595, "epoch": 0.06596730595958296, "grad_norm": 1.25, "learning_rate": 0.0004999289425887425, "loss": 6.1485, "mean_token_accuracy": 0.145339135825634, "num_tokens": 2324652.0, "step": 1025 }, { "entropy": 6.521378660202027, "epoch": 0.06628909769597116, "grad_norm": 1.1328125, "learning_rate": 0.0004998962537575161, "loss": 6.2546, "mean_token_accuracy": 0.1398783229291439, "num_tokens": 2335006.0, "step": 1030 }, { "entropy": 6.371570062637329, "epoch": 0.06661088943235938, "grad_norm": 1.0859375, "learning_rate": 0.0004998573992818874, "loss": 6.1238, "mean_token_accuracy": 0.14918210208415986, "num_tokens": 2347261.0, "step": 1035 }, { "entropy": 6.545182466506958, "epoch": 0.0669326811687476, "grad_norm": 1.0859375, "learning_rate": 0.0004998123802270715, "loss": 6.2314, "mean_token_accuracy": 0.14083297401666642, "num_tokens": 2358106.0, "step": 1040 }, { "entropy": 6.477479410171509, "epoch": 0.0672544729051358, "grad_norm": 1.0703125, "learning_rate": 0.0004997611978272886, "loss": 6.2811, "mean_token_accuracy": 0.14108368679881095, "num_tokens": 2369182.0, "step": 1045 }, { "entropy": 6.415492010116577, "epoch": 0.06757626464152401, "grad_norm": 1.0625, "learning_rate": 0.0004997038534857298, "loss": 6.0323, "mean_token_accuracy": 0.150262039154768, "num_tokens": 2379298.0, "step": 1050 }, { "entropy": 6.391033077239991, "epoch": 0.06789805637791221, "grad_norm": 1.125, "learning_rate": 0.0004996403487745194, "loss": 6.1398, "mean_token_accuracy": 0.14792790189385413, "num_tokens": 2389920.0, "step": 1055 }, { "entropy": 6.480355501174927, "epoch": 0.06821984811430043, "grad_norm": 1.0, "learning_rate": 0.000499570685434671, "loss": 6.2449, "mean_token_accuracy": 0.13905822485685349, "num_tokens": 2401743.0, "step": 1060 }, { "entropy": 6.476265621185303, "epoch": 0.06854163985068863, "grad_norm": 1.125, "learning_rate": 0.0004994948653760405, "loss": 6.2046, "mean_token_accuracy": 0.14363889396190643, "num_tokens": 2411770.0, "step": 1065 }, { "entropy": 6.361932802200317, "epoch": 0.06886343158707685, "grad_norm": 1.21875, "learning_rate": 0.0004994128906772729, "loss": 6.1164, "mean_token_accuracy": 0.14849536269903182, "num_tokens": 2422448.0, "step": 1070 }, { "entropy": 6.517858362197876, "epoch": 0.06918522332346505, "grad_norm": 1.15625, "learning_rate": 0.000499324763585746, "loss": 6.1835, "mean_token_accuracy": 0.14678900837898254, "num_tokens": 2433428.0, "step": 1075 }, { "entropy": 6.331155014038086, "epoch": 0.06950701505985327, "grad_norm": 1.0390625, "learning_rate": 0.0004992304865175085, "loss": 6.1545, "mean_token_accuracy": 0.14461304917931556, "num_tokens": 2445538.0, "step": 1080 }, { "entropy": 6.442676591873169, "epoch": 0.06982880679624147, "grad_norm": 1.125, "learning_rate": 0.0004991300620572138, "loss": 6.1283, "mean_token_accuracy": 0.14782453551888466, "num_tokens": 2455656.0, "step": 1085 }, { "entropy": 6.333368253707886, "epoch": 0.07015059853262968, "grad_norm": 1.21875, "learning_rate": 0.0004990234929580494, "loss": 6.1665, "mean_token_accuracy": 0.14236130341887474, "num_tokens": 2466933.0, "step": 1090 }, { "entropy": 6.4185097217559814, "epoch": 0.07047239026901789, "grad_norm": 1.0703125, "learning_rate": 0.0004989107821416609, "loss": 6.2137, "mean_token_accuracy": 0.14996169060468673, "num_tokens": 2479501.0, "step": 1095 }, { "entropy": 6.408093643188477, "epoch": 0.0707941820054061, "grad_norm": 1.0, "learning_rate": 0.0004987919326980723, "loss": 6.1955, "mean_token_accuracy": 0.13943222388625146, "num_tokens": 2491571.0, "step": 1100 }, { "entropy": 6.328987503051758, "epoch": 0.0711159737417943, "grad_norm": 1.1875, "learning_rate": 0.0004986669478856011, "loss": 6.0414, "mean_token_accuracy": 0.15177379101514815, "num_tokens": 2502517.0, "step": 1105 }, { "entropy": 6.463210535049439, "epoch": 0.07143776547818252, "grad_norm": 1.0390625, "learning_rate": 0.0004985358311307688, "loss": 6.2415, "mean_token_accuracy": 0.14047156423330306, "num_tokens": 2514711.0, "step": 1110 }, { "entropy": 6.4414870262146, "epoch": 0.07175955721457072, "grad_norm": 1.0234375, "learning_rate": 0.0004983985860282081, "loss": 6.2103, "mean_token_accuracy": 0.14568767324090004, "num_tokens": 2526473.0, "step": 1115 }, { "entropy": 6.478610181808472, "epoch": 0.07208134895095894, "grad_norm": 1.1171875, "learning_rate": 0.0004982552163405623, "loss": 6.1723, "mean_token_accuracy": 0.14119128584861756, "num_tokens": 2537346.0, "step": 1120 }, { "entropy": 6.40332260131836, "epoch": 0.07240314068734714, "grad_norm": 1.0703125, "learning_rate": 0.0004981057259983839, "loss": 6.2217, "mean_token_accuracy": 0.13824794590473174, "num_tokens": 2549476.0, "step": 1125 }, { "entropy": 6.371269559860229, "epoch": 0.07272493242373536, "grad_norm": 1.046875, "learning_rate": 0.0004979501191000262, "loss": 6.113, "mean_token_accuracy": 0.14911531060934066, "num_tokens": 2559766.0, "step": 1130 }, { "entropy": 6.425234127044678, "epoch": 0.07304672416012357, "grad_norm": 0.94921875, "learning_rate": 0.0004977883999115311, "loss": 6.2251, "mean_token_accuracy": 0.14199284091591835, "num_tokens": 2571559.0, "step": 1135 }, { "entropy": 6.431259536743164, "epoch": 0.07336851589651178, "grad_norm": 1.03125, "learning_rate": 0.0004976205728665113, "loss": 6.1112, "mean_token_accuracy": 0.15070913657546042, "num_tokens": 2582530.0, "step": 1140 }, { "entropy": 6.24943962097168, "epoch": 0.07369030763289999, "grad_norm": 1.125, "learning_rate": 0.0004974466425660307, "loss": 6.0109, "mean_token_accuracy": 0.15389537215232849, "num_tokens": 2594100.0, "step": 1145 }, { "entropy": 6.366129446029663, "epoch": 0.0740120993692882, "grad_norm": 1.0546875, "learning_rate": 0.0004972666137784759, "loss": 6.2097, "mean_token_accuracy": 0.14721803665161132, "num_tokens": 2605853.0, "step": 1150 }, { "entropy": 6.466001224517822, "epoch": 0.07433389110567641, "grad_norm": 1.046875, "learning_rate": 0.0004970804914394271, "loss": 6.1948, "mean_token_accuracy": 0.14637096226215363, "num_tokens": 2616298.0, "step": 1155 }, { "entropy": 6.396643543243409, "epoch": 0.07465568284206461, "grad_norm": 1.046875, "learning_rate": 0.0004968882806515225, "loss": 6.185, "mean_token_accuracy": 0.14693560302257538, "num_tokens": 2627103.0, "step": 1160 }, { "entropy": 6.439416837692261, "epoch": 0.07497747457845283, "grad_norm": 1.140625, "learning_rate": 0.0004966899866843177, "loss": 6.1133, "mean_token_accuracy": 0.14630427211523056, "num_tokens": 2638657.0, "step": 1165 }, { "entropy": 6.329187059402466, "epoch": 0.07529926631484103, "grad_norm": 1.015625, "learning_rate": 0.000496485614974142, "loss": 6.228, "mean_token_accuracy": 0.1431046985089779, "num_tokens": 2650170.0, "step": 1170 }, { "entropy": 6.464993619918824, "epoch": 0.07562105805122925, "grad_norm": 0.9765625, "learning_rate": 0.0004962751711239492, "loss": 6.1557, "mean_token_accuracy": 0.14459144622087478, "num_tokens": 2662060.0, "step": 1175 }, { "entropy": 6.411845684051514, "epoch": 0.07594284978761745, "grad_norm": 0.94921875, "learning_rate": 0.0004960586609031636, "loss": 6.2545, "mean_token_accuracy": 0.14064157232642174, "num_tokens": 2674031.0, "step": 1180 }, { "entropy": 6.344238042831421, "epoch": 0.07626464152400567, "grad_norm": 0.94140625, "learning_rate": 0.0004958360902475224, "loss": 6.0551, "mean_token_accuracy": 0.15323207825422286, "num_tokens": 2685133.0, "step": 1185 }, { "entropy": 6.328037738800049, "epoch": 0.07658643326039387, "grad_norm": 1.09375, "learning_rate": 0.0004956074652589125, "loss": 6.19, "mean_token_accuracy": 0.14459021687507628, "num_tokens": 2695256.0, "step": 1190 }, { "entropy": 6.494858503341675, "epoch": 0.07690822499678208, "grad_norm": 1.0703125, "learning_rate": 0.0004953727922052035, "loss": 6.1907, "mean_token_accuracy": 0.1448133870959282, "num_tokens": 2705322.0, "step": 1195 }, { "entropy": 6.359596300125122, "epoch": 0.07723001673317029, "grad_norm": 0.953125, "learning_rate": 0.0004951320775200756, "loss": 6.1101, "mean_token_accuracy": 0.14269352331757545, "num_tokens": 2717911.0, "step": 1200 }, { "entropy": 6.399364423751831, "epoch": 0.0775518084695585, "grad_norm": 1.2578125, "learning_rate": 0.0004948853278028436, "loss": 6.2189, "mean_token_accuracy": 0.13950742781162262, "num_tokens": 2729321.0, "step": 1205 }, { "entropy": 6.399625301361084, "epoch": 0.0778736002059467, "grad_norm": 1.078125, "learning_rate": 0.0004946325498182755, "loss": 6.1091, "mean_token_accuracy": 0.14936656802892684, "num_tokens": 2740095.0, "step": 1210 }, { "entropy": 6.198732805252075, "epoch": 0.07819539194233492, "grad_norm": 1.0859375, "learning_rate": 0.0004943737504964076, "loss": 6.0177, "mean_token_accuracy": 0.1528451532125473, "num_tokens": 2750443.0, "step": 1215 }, { "entropy": 6.362048006057739, "epoch": 0.07851718367872312, "grad_norm": 1.0, "learning_rate": 0.000494108936932354, "loss": 6.0327, "mean_token_accuracy": 0.15278265327215196, "num_tokens": 2761578.0, "step": 1220 }, { "entropy": 6.290820360183716, "epoch": 0.07883897541511134, "grad_norm": 1.03125, "learning_rate": 0.0004938381163861124, "loss": 6.1404, "mean_token_accuracy": 0.1517237439751625, "num_tokens": 2773410.0, "step": 1225 }, { "entropy": 6.38767557144165, "epoch": 0.07916076715149956, "grad_norm": 1.0546875, "learning_rate": 0.0004935612962823645, "loss": 6.1139, "mean_token_accuracy": 0.14652161300182343, "num_tokens": 2784507.0, "step": 1230 }, { "entropy": 6.147325468063355, "epoch": 0.07948255888788776, "grad_norm": 1.0234375, "learning_rate": 0.0004932784842102739, "loss": 6.0599, "mean_token_accuracy": 0.15777070224285125, "num_tokens": 2796075.0, "step": 1235 }, { "entropy": 6.353684997558593, "epoch": 0.07980435062427597, "grad_norm": 0.95703125, "learning_rate": 0.0004929896879232758, "loss": 6.0749, "mean_token_accuracy": 0.1501803681254387, "num_tokens": 2808124.0, "step": 1240 }, { "entropy": 6.35121603012085, "epoch": 0.08012614236066418, "grad_norm": 1.0703125, "learning_rate": 0.0004926949153388668, "loss": 6.127, "mean_token_accuracy": 0.1444758579134941, "num_tokens": 2819010.0, "step": 1245 }, { "entropy": 6.343505907058716, "epoch": 0.08044793409705239, "grad_norm": 0.94140625, "learning_rate": 0.0004923941745383859, "loss": 6.0505, "mean_token_accuracy": 0.15336280614137648, "num_tokens": 2829809.0, "step": 1250 }, { "entropy": 6.26406078338623, "epoch": 0.0807697258334406, "grad_norm": 1.1484375, "learning_rate": 0.000492087473766794, "loss": 6.058, "mean_token_accuracy": 0.1509227141737938, "num_tokens": 2841237.0, "step": 1255 }, { "entropy": 6.227289295196533, "epoch": 0.08109151756982881, "grad_norm": 0.94140625, "learning_rate": 0.000491774821432448, "loss": 6.0712, "mean_token_accuracy": 0.14665706008672713, "num_tokens": 2853664.0, "step": 1260 }, { "entropy": 6.25519208908081, "epoch": 0.08141330930621701, "grad_norm": 1.0703125, "learning_rate": 0.0004914562261068693, "loss": 6.0295, "mean_token_accuracy": 0.15138522982597352, "num_tokens": 2864821.0, "step": 1265 }, { "entropy": 6.467222690582275, "epoch": 0.08173510104260523, "grad_norm": 1.09375, "learning_rate": 0.0004911316965245098, "loss": 6.2744, "mean_token_accuracy": 0.1357764020562172, "num_tokens": 2878847.0, "step": 1270 }, { "entropy": 6.337312507629394, "epoch": 0.08205689277899343, "grad_norm": 1.0703125, "learning_rate": 0.000490801241582512, "loss": 6.1474, "mean_token_accuracy": 0.14485098645091057, "num_tokens": 2891172.0, "step": 1275 }, { "entropy": 6.462904167175293, "epoch": 0.08237868451538165, "grad_norm": 1.1171875, "learning_rate": 0.000490464870340465, "loss": 6.2352, "mean_token_accuracy": 0.13823144510388374, "num_tokens": 2902218.0, "step": 1280 }, { "entropy": 6.270657682418824, "epoch": 0.08270047625176985, "grad_norm": 1.078125, "learning_rate": 0.0004901225920201563, "loss": 6.1159, "mean_token_accuracy": 0.14343132004141806, "num_tokens": 2914062.0, "step": 1285 }, { "entropy": 6.360012531280518, "epoch": 0.08302226798815807, "grad_norm": 1.0390625, "learning_rate": 0.000489774416005319, "loss": 6.091, "mean_token_accuracy": 0.1466546781361103, "num_tokens": 2924838.0, "step": 1290 }, { "entropy": 6.255312871932984, "epoch": 0.08334405972454627, "grad_norm": 1.1171875, "learning_rate": 0.0004894203518413742, "loss": 6.0781, "mean_token_accuracy": 0.14694482684135438, "num_tokens": 2936219.0, "step": 1295 }, { "entropy": 6.416478824615479, "epoch": 0.08366585146093448, "grad_norm": 1.0546875, "learning_rate": 0.0004890604092351701, "loss": 6.0683, "mean_token_accuracy": 0.14561905413866044, "num_tokens": 2947195.0, "step": 1300 }, { "entropy": 6.19344310760498, "epoch": 0.08398764319732269, "grad_norm": 1.09375, "learning_rate": 0.000488694598054715, "loss": 6.0338, "mean_token_accuracy": 0.14701765030622482, "num_tokens": 2959322.0, "step": 1305 }, { "entropy": 6.2918178081512455, "epoch": 0.0843094349337109, "grad_norm": 1.015625, "learning_rate": 0.0004883229283289071, "loss": 6.0867, "mean_token_accuracy": 0.14712531566619874, "num_tokens": 2970237.0, "step": 1310 }, { "entropy": 6.260451936721802, "epoch": 0.0846312266700991, "grad_norm": 1.234375, "learning_rate": 0.00048794541024725993, "loss": 6.0424, "mean_token_accuracy": 0.15119363814592363, "num_tokens": 2980701.0, "step": 1315 }, { "entropy": 6.25090856552124, "epoch": 0.08495301840648732, "grad_norm": 1.078125, "learning_rate": 0.0004875620541596221, "loss": 5.9198, "mean_token_accuracy": 0.1514560803771019, "num_tokens": 2992712.0, "step": 1320 }, { "entropy": 6.234271287918091, "epoch": 0.08527481014287554, "grad_norm": 1.59375, "learning_rate": 0.00048717287057589454, "loss": 6.0752, "mean_token_accuracy": 0.14440764486789703, "num_tokens": 3003754.0, "step": 1325 }, { "entropy": 6.255046749114991, "epoch": 0.08559660187926374, "grad_norm": 1.0390625, "learning_rate": 0.0004867778701657417, "loss": 6.0283, "mean_token_accuracy": 0.14669692739844323, "num_tokens": 3015715.0, "step": 1330 }, { "entropy": 6.198978328704834, "epoch": 0.08591839361565196, "grad_norm": 1.109375, "learning_rate": 0.00048637706375829955, "loss": 6.0125, "mean_token_accuracy": 0.15693035572767258, "num_tokens": 3026781.0, "step": 1335 }, { "entropy": 6.3291237354278564, "epoch": 0.08624018535204016, "grad_norm": 1.1328125, "learning_rate": 0.000485970462341878, "loss": 6.0391, "mean_token_accuracy": 0.14689479991793633, "num_tokens": 3037856.0, "step": 1340 }, { "entropy": 6.268665742874146, "epoch": 0.08656197708842837, "grad_norm": 1.1171875, "learning_rate": 0.00048555807706366044, "loss": 6.0847, "mean_token_accuracy": 0.1446255125105381, "num_tokens": 3050109.0, "step": 1345 }, { "entropy": 6.237447834014892, "epoch": 0.08688376882481658, "grad_norm": 1.09375, "learning_rate": 0.00048513991922939756, "loss": 6.0616, "mean_token_accuracy": 0.14234503656625747, "num_tokens": 3060668.0, "step": 1350 }, { "entropy": 6.198616933822632, "epoch": 0.08720556056120479, "grad_norm": 0.96484375, "learning_rate": 0.00048471600030309744, "loss": 6.0421, "mean_token_accuracy": 0.14418703466653823, "num_tokens": 3071176.0, "step": 1355 }, { "entropy": 6.332860994338989, "epoch": 0.087527352297593, "grad_norm": 1.078125, "learning_rate": 0.00048428633190671186, "loss": 6.0403, "mean_token_accuracy": 0.15211065858602524, "num_tokens": 3083180.0, "step": 1360 }, { "entropy": 6.218678760528564, "epoch": 0.08784914403398121, "grad_norm": 1.03125, "learning_rate": 0.0004838509258198167, "loss": 5.9538, "mean_token_accuracy": 0.15536704435944557, "num_tokens": 3093049.0, "step": 1365 }, { "entropy": 6.163859224319458, "epoch": 0.08817093577036941, "grad_norm": 1.03125, "learning_rate": 0.00048340979397929, "loss": 5.987, "mean_token_accuracy": 0.15278939306735992, "num_tokens": 3104979.0, "step": 1370 }, { "entropy": 6.196265602111817, "epoch": 0.08849272750675763, "grad_norm": 1.078125, "learning_rate": 0.00048296294847898386, "loss": 5.9735, "mean_token_accuracy": 0.1589425176382065, "num_tokens": 3117098.0, "step": 1375 }, { "entropy": 6.2933696746826175, "epoch": 0.08881451924314583, "grad_norm": 1.0859375, "learning_rate": 0.0004825104015693934, "loss": 6.0967, "mean_token_accuracy": 0.14706607460975646, "num_tokens": 3127554.0, "step": 1380 }, { "entropy": 6.332402229309082, "epoch": 0.08913631097953405, "grad_norm": 1.296875, "learning_rate": 0.0004820521656573208, "loss": 6.0697, "mean_token_accuracy": 0.15364808216691017, "num_tokens": 3139574.0, "step": 1385 }, { "entropy": 6.154071283340454, "epoch": 0.08945810271592225, "grad_norm": 1.03125, "learning_rate": 0.00048158825330553505, "loss": 5.9452, "mean_token_accuracy": 0.16097584813833238, "num_tokens": 3151687.0, "step": 1390 }, { "entropy": 6.355695199966431, "epoch": 0.08977989445231047, "grad_norm": 1.1015625, "learning_rate": 0.00048111867723242763, "loss": 6.0481, "mean_token_accuracy": 0.15232885181903838, "num_tokens": 3161667.0, "step": 1395 }, { "entropy": 6.16862416267395, "epoch": 0.09010168618869867, "grad_norm": 1.109375, "learning_rate": 0.0004806434503116637, "loss": 6.033, "mean_token_accuracy": 0.15161970853805543, "num_tokens": 3172797.0, "step": 1400 }, { "entropy": 6.239516496658325, "epoch": 0.09042347792508688, "grad_norm": 1.015625, "learning_rate": 0.0004801625855718296, "loss": 5.9882, "mean_token_accuracy": 0.15210439413785934, "num_tokens": 3183970.0, "step": 1405 }, { "entropy": 6.291398382186889, "epoch": 0.09074526966147509, "grad_norm": 1.09375, "learning_rate": 0.00047967609619607477, "loss": 6.0427, "mean_token_accuracy": 0.15301772952079773, "num_tokens": 3194461.0, "step": 1410 }, { "entropy": 6.2756983757019045, "epoch": 0.0910670613978633, "grad_norm": 1.0078125, "learning_rate": 0.0004791839955217513, "loss": 5.9568, "mean_token_accuracy": 0.15461016148328782, "num_tokens": 3204595.0, "step": 1415 }, { "entropy": 6.154314565658569, "epoch": 0.09138885313425152, "grad_norm": 1.046875, "learning_rate": 0.00047868629704004786, "loss": 5.9462, "mean_token_accuracy": 0.1490132212638855, "num_tokens": 3215617.0, "step": 1420 }, { "entropy": 6.124943971633911, "epoch": 0.09171064487063972, "grad_norm": 1.0546875, "learning_rate": 0.00047818301439561965, "loss": 6.0813, "mean_token_accuracy": 0.1486785553395748, "num_tokens": 3227350.0, "step": 1425 }, { "entropy": 6.304641628265381, "epoch": 0.09203243660702794, "grad_norm": 1.8828125, "learning_rate": 0.00047767416138621454, "loss": 6.2063, "mean_token_accuracy": 0.14140090346336365, "num_tokens": 3239473.0, "step": 1430 }, { "entropy": 6.324922275543213, "epoch": 0.09235422834341614, "grad_norm": 1.046875, "learning_rate": 0.000477159751962295, "loss": 5.9684, "mean_token_accuracy": 0.15401543006300927, "num_tokens": 3250360.0, "step": 1435 }, { "entropy": 6.12751088142395, "epoch": 0.09267602007980436, "grad_norm": 1.15625, "learning_rate": 0.00047663980022665507, "loss": 5.9926, "mean_token_accuracy": 0.15175819844007493, "num_tokens": 3260227.0, "step": 1440 }, { "entropy": 6.237259864807129, "epoch": 0.09299781181619256, "grad_norm": 0.96875, "learning_rate": 0.00047611432043403437, "loss": 5.9543, "mean_token_accuracy": 0.151527339220047, "num_tokens": 3271316.0, "step": 1445 }, { "entropy": 6.193226385116577, "epoch": 0.09331960355258077, "grad_norm": 1.1328125, "learning_rate": 0.0004755833269907267, "loss": 6.055, "mean_token_accuracy": 0.15415698066353797, "num_tokens": 3283194.0, "step": 1450 }, { "entropy": 6.226471662521362, "epoch": 0.09364139528896898, "grad_norm": 1.09375, "learning_rate": 0.0004750468344541857, "loss": 5.9492, "mean_token_accuracy": 0.15627116858959197, "num_tokens": 3294337.0, "step": 1455 }, { "entropy": 6.095775890350342, "epoch": 0.09396318702535719, "grad_norm": 1.0546875, "learning_rate": 0.00047450485753262525, "loss": 6.0268, "mean_token_accuracy": 0.1549006626009941, "num_tokens": 3305661.0, "step": 1460 }, { "entropy": 6.316003370285034, "epoch": 0.0942849787617454, "grad_norm": 1.203125, "learning_rate": 0.00047395741108461633, "loss": 5.9668, "mean_token_accuracy": 0.16676316410303116, "num_tokens": 3318457.0, "step": 1465 }, { "entropy": 6.10923490524292, "epoch": 0.09460677049813361, "grad_norm": 1.140625, "learning_rate": 0.00047340451011867985, "loss": 5.9276, "mean_token_accuracy": 0.1575511649250984, "num_tokens": 3329208.0, "step": 1470 }, { "entropy": 6.169835376739502, "epoch": 0.09492856223452181, "grad_norm": 1.09375, "learning_rate": 0.00047284616979287515, "loss": 5.9957, "mean_token_accuracy": 0.15678192675113678, "num_tokens": 3340131.0, "step": 1475 }, { "entropy": 6.147319173812866, "epoch": 0.09525035397091003, "grad_norm": 1.0390625, "learning_rate": 0.00047228240541438433, "loss": 5.927, "mean_token_accuracy": 0.15638188570737838, "num_tokens": 3351416.0, "step": 1480 }, { "entropy": 6.111018514633178, "epoch": 0.09557214570729823, "grad_norm": 0.9375, "learning_rate": 0.00047171323243909257, "loss": 5.9375, "mean_token_accuracy": 0.1552967607975006, "num_tokens": 3363734.0, "step": 1485 }, { "entropy": 6.22268123626709, "epoch": 0.09589393744368645, "grad_norm": 1.078125, "learning_rate": 0.00047113866647116457, "loss": 6.0156, "mean_token_accuracy": 0.15189583972096443, "num_tokens": 3375194.0, "step": 1490 }, { "entropy": 6.290840578079224, "epoch": 0.09621572918007465, "grad_norm": 1.0546875, "learning_rate": 0.0004705587232626164, "loss": 6.1143, "mean_token_accuracy": 0.1482478827238083, "num_tokens": 3387005.0, "step": 1495 }, { "entropy": 6.177110862731934, "epoch": 0.09653752091646287, "grad_norm": 1.0234375, "learning_rate": 0.00046997341871288424, "loss": 5.9724, "mean_token_accuracy": 0.14636649787425995, "num_tokens": 3398902.0, "step": 1500 }, { "entropy": 6.236763906478882, "epoch": 0.09685931265285108, "grad_norm": 1.0078125, "learning_rate": 0.0004693827688683879, "loss": 5.9133, "mean_token_accuracy": 0.15838426500558853, "num_tokens": 3410716.0, "step": 1505 }, { "entropy": 6.154586696624756, "epoch": 0.09718110438923928, "grad_norm": 1.0390625, "learning_rate": 0.0004687867899220914, "loss": 5.961, "mean_token_accuracy": 0.15415489226579665, "num_tokens": 3422252.0, "step": 1510 }, { "entropy": 6.140632581710816, "epoch": 0.0975028961256275, "grad_norm": 1.046875, "learning_rate": 0.00046818549821305846, "loss": 5.8691, "mean_token_accuracy": 0.1620650425553322, "num_tokens": 3433799.0, "step": 1515 }, { "entropy": 6.097218656539917, "epoch": 0.0978246878620157, "grad_norm": 1.0234375, "learning_rate": 0.00046757891022600494, "loss": 5.9079, "mean_token_accuracy": 0.15895169079303742, "num_tokens": 3444754.0, "step": 1520 }, { "entropy": 6.131570863723755, "epoch": 0.09814647959840392, "grad_norm": 0.953125, "learning_rate": 0.0004669670425908471, "loss": 5.8836, "mean_token_accuracy": 0.15784632563591003, "num_tokens": 3456897.0, "step": 1525 }, { "entropy": 6.0702661037445065, "epoch": 0.09846827133479212, "grad_norm": 0.9765625, "learning_rate": 0.0004663499120822451, "loss": 5.835, "mean_token_accuracy": 0.16073963791131973, "num_tokens": 3468415.0, "step": 1530 }, { "entropy": 6.077900362014771, "epoch": 0.09879006307118034, "grad_norm": 0.97265625, "learning_rate": 0.0004657275356191437, "loss": 5.8369, "mean_token_accuracy": 0.15783393234014512, "num_tokens": 3478914.0, "step": 1535 }, { "entropy": 6.247751140594483, "epoch": 0.09911185480756854, "grad_norm": 0.96484375, "learning_rate": 0.00046509993026430804, "loss": 6.0328, "mean_token_accuracy": 0.15122698694467546, "num_tokens": 3490617.0, "step": 1540 }, { "entropy": 6.107704210281372, "epoch": 0.09943364654395676, "grad_norm": 1.0078125, "learning_rate": 0.0004644671132238558, "loss": 5.9323, "mean_token_accuracy": 0.15626108199357985, "num_tokens": 3503145.0, "step": 1545 }, { "entropy": 6.2650384426116945, "epoch": 0.09975543828034496, "grad_norm": 1.046875, "learning_rate": 0.00046382910184678585, "loss": 5.9544, "mean_token_accuracy": 0.1508778765797615, "num_tokens": 3514378.0, "step": 1550 }, { "entropy": 6.066193294525147, "epoch": 0.10007723001673317, "grad_norm": 1.0234375, "learning_rate": 0.0004631859136245025, "loss": 5.9536, "mean_token_accuracy": 0.15337267220020295, "num_tokens": 3524820.0, "step": 1555 }, { "entropy": 6.2549515724182125, "epoch": 0.10039902175312138, "grad_norm": 0.98046875, "learning_rate": 0.0004625375661903357, "loss": 6.0194, "mean_token_accuracy": 0.15266060531139375, "num_tokens": 3537117.0, "step": 1560 }, { "entropy": 6.1690354347229, "epoch": 0.10072081348950959, "grad_norm": 1.03125, "learning_rate": 0.00046188407731905787, "loss": 5.9786, "mean_token_accuracy": 0.15118198990821838, "num_tokens": 3549741.0, "step": 1565 }, { "entropy": 5.9546397686004635, "epoch": 0.1010426052258978, "grad_norm": 1.1171875, "learning_rate": 0.00046122546492639643, "loss": 5.7664, "mean_token_accuracy": 0.16974862962961196, "num_tokens": 3560009.0, "step": 1570 }, { "entropy": 6.1606494903564455, "epoch": 0.10136439696228601, "grad_norm": 1.0546875, "learning_rate": 0.000460561747068543, "loss": 5.8662, "mean_token_accuracy": 0.15560854971408844, "num_tokens": 3570005.0, "step": 1575 }, { "entropy": 6.085360765457153, "epoch": 0.10168618869867421, "grad_norm": 1.0078125, "learning_rate": 0.0004598929419416578, "loss": 5.8876, "mean_token_accuracy": 0.1590146005153656, "num_tokens": 3581017.0, "step": 1580 }, { "entropy": 6.100130701065064, "epoch": 0.10200798043506243, "grad_norm": 0.99609375, "learning_rate": 0.00045921906788137123, "loss": 5.8961, "mean_token_accuracy": 0.16178194135427476, "num_tokens": 3592102.0, "step": 1585 }, { "entropy": 6.079522705078125, "epoch": 0.10232977217145063, "grad_norm": 1.0390625, "learning_rate": 0.00045854014336228115, "loss": 5.8172, "mean_token_accuracy": 0.1636298730969429, "num_tokens": 3602860.0, "step": 1590 }, { "entropy": 6.100549745559692, "epoch": 0.10265156390783885, "grad_norm": 0.96484375, "learning_rate": 0.00045785618699744615, "loss": 5.8923, "mean_token_accuracy": 0.15646297633647918, "num_tokens": 3614265.0, "step": 1595 }, { "entropy": 6.137320423126221, "epoch": 0.10297335564422706, "grad_norm": 1.0234375, "learning_rate": 0.00045716721753787543, "loss": 5.9092, "mean_token_accuracy": 0.1642071709036827, "num_tokens": 3624783.0, "step": 1600 }, { "entropy": 6.103617238998413, "epoch": 0.10329514738061527, "grad_norm": 1.046875, "learning_rate": 0.0004564732538720148, "loss": 5.9007, "mean_token_accuracy": 0.15452659055590628, "num_tokens": 3636671.0, "step": 1605 }, { "entropy": 6.162163400650025, "epoch": 0.10361693911700348, "grad_norm": 1.046875, "learning_rate": 0.00045577431502522877, "loss": 5.9502, "mean_token_accuracy": 0.16308289170265197, "num_tokens": 3648249.0, "step": 1610 }, { "entropy": 6.2008871078491214, "epoch": 0.10393873085339168, "grad_norm": 1.09375, "learning_rate": 0.0004550704201592787, "loss": 5.9927, "mean_token_accuracy": 0.1535536527633667, "num_tokens": 3659625.0, "step": 1615 }, { "entropy": 6.1465507507324215, "epoch": 0.1042605225897799, "grad_norm": 1.0859375, "learning_rate": 0.0004543615885717981, "loss": 5.9086, "mean_token_accuracy": 0.160139761865139, "num_tokens": 3670233.0, "step": 1620 }, { "entropy": 6.0907965183258055, "epoch": 0.1045823143261681, "grad_norm": 1.09375, "learning_rate": 0.00045364783969576296, "loss": 5.8771, "mean_token_accuracy": 0.1571106120944023, "num_tokens": 3680793.0, "step": 1625 }, { "entropy": 6.108975076675415, "epoch": 0.10490410606255632, "grad_norm": 1.0859375, "learning_rate": 0.0004529291930989592, "loss": 5.883, "mean_token_accuracy": 0.17130757123231888, "num_tokens": 3692561.0, "step": 1630 }, { "entropy": 6.049561834335327, "epoch": 0.10522589779894452, "grad_norm": 1.0078125, "learning_rate": 0.0004522056684834464, "loss": 5.887, "mean_token_accuracy": 0.1572432816028595, "num_tokens": 3704306.0, "step": 1635 }, { "entropy": 6.081239366531372, "epoch": 0.10554768953533274, "grad_norm": 1.0703125, "learning_rate": 0.0004514772856850173, "loss": 5.8848, "mean_token_accuracy": 0.16130839735269548, "num_tokens": 3715276.0, "step": 1640 }, { "entropy": 6.184744596481323, "epoch": 0.10586948127172094, "grad_norm": 1.21875, "learning_rate": 0.0004507440646726542, "loss": 6.025, "mean_token_accuracy": 0.1553824484348297, "num_tokens": 3726799.0, "step": 1645 }, { "entropy": 6.106659936904907, "epoch": 0.10619127300810915, "grad_norm": 1.140625, "learning_rate": 0.0004500060255479818, "loss": 5.9149, "mean_token_accuracy": 0.15892969965934753, "num_tokens": 3736648.0, "step": 1650 }, { "entropy": 6.1206361770629885, "epoch": 0.10651306474449736, "grad_norm": 0.9921875, "learning_rate": 0.0004492631885447151, "loss": 5.9212, "mean_token_accuracy": 0.1520114503800869, "num_tokens": 3746940.0, "step": 1655 }, { "entropy": 6.142186498641967, "epoch": 0.10683485648088557, "grad_norm": 1.109375, "learning_rate": 0.00044851557402810616, "loss": 5.86, "mean_token_accuracy": 0.15836223363876342, "num_tokens": 3758099.0, "step": 1660 }, { "entropy": 5.9857617855072025, "epoch": 0.10715664821727378, "grad_norm": 1.0625, "learning_rate": 0.00044776320249438444, "loss": 5.8378, "mean_token_accuracy": 0.16005610525608063, "num_tokens": 3769881.0, "step": 1665 }, { "entropy": 6.105796766281128, "epoch": 0.10747843995366199, "grad_norm": 1.078125, "learning_rate": 0.00044700609457019565, "loss": 5.8723, "mean_token_accuracy": 0.1569559782743454, "num_tokens": 3780925.0, "step": 1670 }, { "entropy": 6.123667669296265, "epoch": 0.1078002316900502, "grad_norm": 1.15625, "learning_rate": 0.0004462442710120359, "loss": 5.978, "mean_token_accuracy": 0.15348947197198867, "num_tokens": 3791941.0, "step": 1675 }, { "entropy": 6.140316152572632, "epoch": 0.10812202342643841, "grad_norm": 1.1328125, "learning_rate": 0.000445477752705683, "loss": 5.9025, "mean_token_accuracy": 0.15857508778572083, "num_tokens": 3803698.0, "step": 1680 }, { "entropy": 6.062806749343872, "epoch": 0.10844381516282661, "grad_norm": 0.98046875, "learning_rate": 0.00044470656066562336, "loss": 5.8514, "mean_token_accuracy": 0.1542954534292221, "num_tokens": 3815681.0, "step": 1685 }, { "entropy": 6.0847492694854735, "epoch": 0.10876560689921483, "grad_norm": 1.0234375, "learning_rate": 0.0004439307160344765, "loss": 5.8906, "mean_token_accuracy": 0.15737924128770828, "num_tokens": 3828074.0, "step": 1690 }, { "entropy": 6.040540266036987, "epoch": 0.10908739863560304, "grad_norm": 1.046875, "learning_rate": 0.00044315024008241473, "loss": 5.8193, "mean_token_accuracy": 0.16169758141040802, "num_tokens": 3838928.0, "step": 1695 }, { "entropy": 6.152355909347534, "epoch": 0.10940919037199125, "grad_norm": 1.0859375, "learning_rate": 0.0004423651542065806, "loss": 5.972, "mean_token_accuracy": 0.14924763143062592, "num_tokens": 3850148.0, "step": 1700 }, { "entropy": 6.210541772842407, "epoch": 0.10973098210837946, "grad_norm": 1.078125, "learning_rate": 0.00044157547993050006, "loss": 5.9284, "mean_token_accuracy": 0.15215876325964928, "num_tokens": 3861099.0, "step": 1705 }, { "entropy": 6.108062696456909, "epoch": 0.11005277384476767, "grad_norm": 1.0625, "learning_rate": 0.00044078123890349227, "loss": 5.8861, "mean_token_accuracy": 0.16254641860723495, "num_tokens": 3872742.0, "step": 1710 }, { "entropy": 6.034341526031494, "epoch": 0.11037456558115588, "grad_norm": 1.1796875, "learning_rate": 0.00043998245290007606, "loss": 5.8189, "mean_token_accuracy": 0.16008612066507338, "num_tokens": 3883573.0, "step": 1715 }, { "entropy": 6.092084360122681, "epoch": 0.11069635731754408, "grad_norm": 1.109375, "learning_rate": 0.00043917914381937323, "loss": 5.8707, "mean_token_accuracy": 0.15305377990007402, "num_tokens": 3894614.0, "step": 1720 }, { "entropy": 5.947681093215943, "epoch": 0.1110181490539323, "grad_norm": 0.9296875, "learning_rate": 0.00043837133368450815, "loss": 5.6755, "mean_token_accuracy": 0.17631727159023286, "num_tokens": 3904217.0, "step": 1725 }, { "entropy": 5.988527441024781, "epoch": 0.1113399407903205, "grad_norm": 1.015625, "learning_rate": 0.0004375590446420037, "loss": 5.8423, "mean_token_accuracy": 0.15377960056066514, "num_tokens": 3916066.0, "step": 1730 }, { "entropy": 6.192314147949219, "epoch": 0.11166173252670872, "grad_norm": 1.1171875, "learning_rate": 0.0004367422989611743, "loss": 5.8629, "mean_token_accuracy": 0.16659451127052308, "num_tokens": 3928106.0, "step": 1735 }, { "entropy": 5.978959846496582, "epoch": 0.11198352426309692, "grad_norm": 1.0546875, "learning_rate": 0.0004359211190335153, "loss": 5.7561, "mean_token_accuracy": 0.16876690536737443, "num_tokens": 3940176.0, "step": 1740 }, { "entropy": 5.962417316436768, "epoch": 0.11230531599948514, "grad_norm": 1.1796875, "learning_rate": 0.00043509552737208923, "loss": 5.8668, "mean_token_accuracy": 0.1604593113064766, "num_tokens": 3951938.0, "step": 1745 }, { "entropy": 6.1542033672332765, "epoch": 0.11262710773587334, "grad_norm": 0.9609375, "learning_rate": 0.00043426554661090853, "loss": 5.8896, "mean_token_accuracy": 0.15797159373760222, "num_tokens": 3962731.0, "step": 1750 }, { "entropy": 6.078965711593628, "epoch": 0.11294889947226155, "grad_norm": 0.98046875, "learning_rate": 0.00043343119950431516, "loss": 5.8989, "mean_token_accuracy": 0.1685984030365944, "num_tokens": 3973841.0, "step": 1755 }, { "entropy": 6.0909887790679935, "epoch": 0.11327069120864976, "grad_norm": 0.90625, "learning_rate": 0.00043259250892635644, "loss": 5.849, "mean_token_accuracy": 0.15423968136310579, "num_tokens": 3985723.0, "step": 1760 }, { "entropy": 5.981694746017456, "epoch": 0.11359248294503797, "grad_norm": 1.015625, "learning_rate": 0.0004317494978701582, "loss": 5.7654, "mean_token_accuracy": 0.16921489387750627, "num_tokens": 3996719.0, "step": 1765 }, { "entropy": 6.0790181159973145, "epoch": 0.11391427468142618, "grad_norm": 1.0390625, "learning_rate": 0.0004309021894472943, "loss": 5.8408, "mean_token_accuracy": 0.1637660652399063, "num_tokens": 4007178.0, "step": 1770 }, { "entropy": 6.193857336044312, "epoch": 0.11423606641781439, "grad_norm": 1.1015625, "learning_rate": 0.0004300506068871534, "loss": 5.9561, "mean_token_accuracy": 0.15705759078264236, "num_tokens": 4017441.0, "step": 1775 }, { "entropy": 6.0972432613372805, "epoch": 0.1145578581542026, "grad_norm": 0.96484375, "learning_rate": 0.00042919477353630135, "loss": 5.9267, "mean_token_accuracy": 0.15945902168750764, "num_tokens": 4028902.0, "step": 1780 }, { "entropy": 6.088161182403565, "epoch": 0.11487964989059081, "grad_norm": 1.078125, "learning_rate": 0.000428334712857842, "loss": 5.8481, "mean_token_accuracy": 0.15834707170724868, "num_tokens": 4039686.0, "step": 1785 }, { "entropy": 6.092359447479248, "epoch": 0.11520144162697903, "grad_norm": 1.03125, "learning_rate": 0.00042747044843077304, "loss": 5.8735, "mean_token_accuracy": 0.15396366342902185, "num_tokens": 4052367.0, "step": 1790 }, { "entropy": 6.024484586715698, "epoch": 0.11552323336336723, "grad_norm": 1.0625, "learning_rate": 0.00042660200394934047, "loss": 5.7914, "mean_token_accuracy": 0.15892019718885422, "num_tokens": 4063200.0, "step": 1795 }, { "entropy": 6.0296402931213375, "epoch": 0.11584502509975544, "grad_norm": 1.0859375, "learning_rate": 0.00042572940322238844, "loss": 5.7621, "mean_token_accuracy": 0.16620553135871888, "num_tokens": 4074896.0, "step": 1800 }, { "entropy": 6.014833593368531, "epoch": 0.11616681683614365, "grad_norm": 0.94921875, "learning_rate": 0.00042485267017270664, "loss": 5.717, "mean_token_accuracy": 0.16428265124559402, "num_tokens": 4086622.0, "step": 1805 }, { "entropy": 5.952508020401001, "epoch": 0.11648860857253186, "grad_norm": 1.046875, "learning_rate": 0.0004239718288363745, "loss": 5.8441, "mean_token_accuracy": 0.16071850210428237, "num_tokens": 4097172.0, "step": 1810 }, { "entropy": 6.073939561843872, "epoch": 0.11681040030892006, "grad_norm": 0.9765625, "learning_rate": 0.0004230869033621023, "loss": 5.8946, "mean_token_accuracy": 0.1668115332722664, "num_tokens": 4108735.0, "step": 1815 }, { "entropy": 6.041821050643921, "epoch": 0.11713219204530828, "grad_norm": 1.328125, "learning_rate": 0.0004221979180105688, "loss": 5.837, "mean_token_accuracy": 0.1618662878870964, "num_tokens": 4119840.0, "step": 1820 }, { "entropy": 6.002658462524414, "epoch": 0.11745398378169648, "grad_norm": 0.9140625, "learning_rate": 0.00042130489715375645, "loss": 5.8832, "mean_token_accuracy": 0.15968891829252244, "num_tokens": 4131999.0, "step": 1825 }, { "entropy": 6.1330491065979, "epoch": 0.1177757755180847, "grad_norm": 0.93359375, "learning_rate": 0.00042040786527428335, "loss": 5.7651, "mean_token_accuracy": 0.16318420171737671, "num_tokens": 4143516.0, "step": 1830 }, { "entropy": 5.996764755249023, "epoch": 0.1180975672544729, "grad_norm": 1.0703125, "learning_rate": 0.0004195068469647315, "loss": 5.8386, "mean_token_accuracy": 0.15657123625278474, "num_tokens": 4153963.0, "step": 1835 }, { "entropy": 5.976077747344971, "epoch": 0.11841935899086112, "grad_norm": 1.078125, "learning_rate": 0.00041860186692697297, "loss": 5.7268, "mean_token_accuracy": 0.1676751896739006, "num_tokens": 4165361.0, "step": 1840 }, { "entropy": 5.975963687896728, "epoch": 0.11874115072724932, "grad_norm": 1.109375, "learning_rate": 0.00041769294997149264, "loss": 5.75, "mean_token_accuracy": 0.16740206331014634, "num_tokens": 4176608.0, "step": 1845 }, { "entropy": 5.930391788482666, "epoch": 0.11906294246363754, "grad_norm": 1.0390625, "learning_rate": 0.0004167801210167081, "loss": 5.7926, "mean_token_accuracy": 0.16247987747192383, "num_tokens": 4188709.0, "step": 1850 }, { "entropy": 6.0283245086669925, "epoch": 0.11938473420002574, "grad_norm": 1.109375, "learning_rate": 0.0004158634050882861, "loss": 5.8113, "mean_token_accuracy": 0.1592404916882515, "num_tokens": 4199079.0, "step": 1855 }, { "entropy": 6.08579740524292, "epoch": 0.11970652593641395, "grad_norm": 1.0859375, "learning_rate": 0.0004149428273184569, "loss": 5.8994, "mean_token_accuracy": 0.1571430966258049, "num_tokens": 4209204.0, "step": 1860 }, { "entropy": 6.115895318984985, "epoch": 0.12002831767280216, "grad_norm": 1.0546875, "learning_rate": 0.0004140184129453253, "loss": 5.896, "mean_token_accuracy": 0.15317915976047516, "num_tokens": 4220270.0, "step": 1865 }, { "entropy": 5.977196741104126, "epoch": 0.12035010940919037, "grad_norm": 0.99609375, "learning_rate": 0.000413090187312178, "loss": 5.7498, "mean_token_accuracy": 0.16569025069475174, "num_tokens": 4232996.0, "step": 1870 }, { "entropy": 5.974374628067016, "epoch": 0.12067190114557858, "grad_norm": 1.015625, "learning_rate": 0.0004121581758667898, "loss": 5.7578, "mean_token_accuracy": 0.1671750284731388, "num_tokens": 4244089.0, "step": 1875 }, { "entropy": 6.00874342918396, "epoch": 0.12099369288196679, "grad_norm": 0.953125, "learning_rate": 0.00041122240416072533, "loss": 5.7989, "mean_token_accuracy": 0.16003866046667098, "num_tokens": 4254939.0, "step": 1880 }, { "entropy": 6.073114728927612, "epoch": 0.12131548461835501, "grad_norm": 0.984375, "learning_rate": 0.0004102828978486385, "loss": 5.8726, "mean_token_accuracy": 0.15603156834840776, "num_tokens": 4266429.0, "step": 1885 }, { "entropy": 5.972569847106934, "epoch": 0.12163727635474321, "grad_norm": 1.03125, "learning_rate": 0.0004093396826875695, "loss": 5.7964, "mean_token_accuracy": 0.15974399149417878, "num_tokens": 4278063.0, "step": 1890 }, { "entropy": 6.0056493282318115, "epoch": 0.12195906809113143, "grad_norm": 1.046875, "learning_rate": 0.00040839278453623837, "loss": 5.8105, "mean_token_accuracy": 0.16451311111450195, "num_tokens": 4290281.0, "step": 1895 }, { "entropy": 6.038688039779663, "epoch": 0.12228085982751963, "grad_norm": 0.97265625, "learning_rate": 0.0004074422293543363, "loss": 5.804, "mean_token_accuracy": 0.15884712487459182, "num_tokens": 4301281.0, "step": 1900 }, { "entropy": 6.016970539093018, "epoch": 0.12260265156390784, "grad_norm": 1.171875, "learning_rate": 0.0004064880432018137, "loss": 5.7658, "mean_token_accuracy": 0.15432919561862946, "num_tokens": 4312406.0, "step": 1905 }, { "entropy": 6.103054714202881, "epoch": 0.12292444330029605, "grad_norm": 0.99609375, "learning_rate": 0.00040553025223816615, "loss": 5.8855, "mean_token_accuracy": 0.15506619587540627, "num_tokens": 4322831.0, "step": 1910 }, { "entropy": 6.005894613265991, "epoch": 0.12324623503668426, "grad_norm": 0.94140625, "learning_rate": 0.00040456888272171653, "loss": 5.8042, "mean_token_accuracy": 0.1634931042790413, "num_tokens": 4334850.0, "step": 1915 }, { "entropy": 6.033585166931152, "epoch": 0.12356802677307246, "grad_norm": 0.859375, "learning_rate": 0.00040360396100889577, "loss": 5.8797, "mean_token_accuracy": 0.1673731878399849, "num_tokens": 4346913.0, "step": 1920 }, { "entropy": 6.02968282699585, "epoch": 0.12388981850946068, "grad_norm": 1.0859375, "learning_rate": 0.0004026355135535202, "loss": 5.7898, "mean_token_accuracy": 0.16513559669256211, "num_tokens": 4357030.0, "step": 1925 }, { "entropy": 5.9573445320129395, "epoch": 0.12421161024584888, "grad_norm": 0.9609375, "learning_rate": 0.000401663566906066, "loss": 5.7356, "mean_token_accuracy": 0.16273822635412216, "num_tokens": 4368562.0, "step": 1930 }, { "entropy": 6.075269746780395, "epoch": 0.1245334019822371, "grad_norm": 0.93359375, "learning_rate": 0.00040068814771294134, "loss": 5.8348, "mean_token_accuracy": 0.1631076753139496, "num_tokens": 4380499.0, "step": 1935 }, { "entropy": 5.973206567764282, "epoch": 0.1248551937186253, "grad_norm": 1.0078125, "learning_rate": 0.0003997092827157562, "loss": 5.6817, "mean_token_accuracy": 0.17137495726346968, "num_tokens": 4391288.0, "step": 1940 }, { "entropy": 6.008097457885742, "epoch": 0.12517698545501352, "grad_norm": 1.015625, "learning_rate": 0.000398726998750589, "loss": 5.8549, "mean_token_accuracy": 0.1622577652335167, "num_tokens": 4402371.0, "step": 1945 }, { "entropy": 6.058371210098267, "epoch": 0.12549877719140173, "grad_norm": 0.953125, "learning_rate": 0.00039774132274725076, "loss": 5.8899, "mean_token_accuracy": 0.16455032378435136, "num_tokens": 4414095.0, "step": 1950 }, { "entropy": 5.990140342712403, "epoch": 0.12582056892778992, "grad_norm": 1.140625, "learning_rate": 0.00039675228172854707, "loss": 5.8451, "mean_token_accuracy": 0.1557239845395088, "num_tokens": 4425878.0, "step": 1955 }, { "entropy": 6.079447650909424, "epoch": 0.12614236066417814, "grad_norm": 1.3515625, "learning_rate": 0.0003957599028095371, "loss": 5.7468, "mean_token_accuracy": 0.16118832379579545, "num_tokens": 4437387.0, "step": 1960 }, { "entropy": 6.004099607467651, "epoch": 0.12646415240056635, "grad_norm": 0.953125, "learning_rate": 0.00039476421319679017, "loss": 5.7359, "mean_token_accuracy": 0.1670518174767494, "num_tokens": 4448457.0, "step": 1965 }, { "entropy": 6.00559983253479, "epoch": 0.12678594413695457, "grad_norm": 0.99609375, "learning_rate": 0.00039376524018764, "loss": 5.7616, "mean_token_accuracy": 0.17010354697704316, "num_tokens": 4460368.0, "step": 1970 }, { "entropy": 5.861134004592896, "epoch": 0.12710773587334276, "grad_norm": 1.03125, "learning_rate": 0.00039276301116943616, "loss": 5.7011, "mean_token_accuracy": 0.16875038146972657, "num_tokens": 4472436.0, "step": 1975 }, { "entropy": 5.954335880279541, "epoch": 0.12742952760973097, "grad_norm": 0.96484375, "learning_rate": 0.0003917575536187936, "loss": 5.745, "mean_token_accuracy": 0.16061961352825166, "num_tokens": 4483945.0, "step": 1980 }, { "entropy": 5.945883464813233, "epoch": 0.1277513193461192, "grad_norm": 1.046875, "learning_rate": 0.00039074889510083894, "loss": 5.7885, "mean_token_accuracy": 0.1619923420250416, "num_tokens": 4494694.0, "step": 1985 }, { "entropy": 6.025341606140136, "epoch": 0.1280731110825074, "grad_norm": 1.2734375, "learning_rate": 0.00038973706326845495, "loss": 5.8042, "mean_token_accuracy": 0.16122044026851653, "num_tokens": 4506454.0, "step": 1990 }, { "entropy": 6.062008476257324, "epoch": 0.12839490281889562, "grad_norm": 1.03125, "learning_rate": 0.0003887220858615225, "loss": 5.7555, "mean_token_accuracy": 0.168570613861084, "num_tokens": 4516921.0, "step": 1995 }, { "entropy": 5.976399898529053, "epoch": 0.1287166945552838, "grad_norm": 0.9921875, "learning_rate": 0.0003877039907061597, "loss": 5.7396, "mean_token_accuracy": 0.16865382939577103, "num_tokens": 4527936.0, "step": 2000 }, { "entropy": 5.930095100402832, "epoch": 0.12903848629167203, "grad_norm": 1.03125, "learning_rate": 0.0003866828057139598, "loss": 5.6907, "mean_token_accuracy": 0.18203285634517669, "num_tokens": 4539990.0, "step": 2005 }, { "entropy": 5.957778596878052, "epoch": 0.12936027802806024, "grad_norm": 1.109375, "learning_rate": 0.00038565855888122503, "loss": 5.6973, "mean_token_accuracy": 0.17339657992124557, "num_tokens": 4550854.0, "step": 2010 }, { "entropy": 5.892444086074829, "epoch": 0.12968206976444846, "grad_norm": 1.15625, "learning_rate": 0.00038463127828819975, "loss": 5.6992, "mean_token_accuracy": 0.16921119540929794, "num_tokens": 4561816.0, "step": 2015 }, { "entropy": 6.0089634418487545, "epoch": 0.13000386150083665, "grad_norm": 0.9609375, "learning_rate": 0.00038360099209830043, "loss": 5.842, "mean_token_accuracy": 0.16256387829780578, "num_tokens": 4574473.0, "step": 2020 }, { "entropy": 6.0421020030975345, "epoch": 0.13032565323722486, "grad_norm": 1.0703125, "learning_rate": 0.0003825677285573433, "loss": 5.7873, "mean_token_accuracy": 0.15837687999010086, "num_tokens": 4584409.0, "step": 2025 }, { "entropy": 5.9742358207702635, "epoch": 0.13064744497361308, "grad_norm": 1.046875, "learning_rate": 0.00038153151599277027, "loss": 5.7748, "mean_token_accuracy": 0.16522695422172545, "num_tokens": 4595478.0, "step": 2030 }, { "entropy": 5.89949779510498, "epoch": 0.1309692367100013, "grad_norm": 1.109375, "learning_rate": 0.0003804923828128723, "loss": 5.6662, "mean_token_accuracy": 0.17313877791166304, "num_tokens": 4604973.0, "step": 2035 }, { "entropy": 5.949093866348266, "epoch": 0.13129102844638948, "grad_norm": 1.078125, "learning_rate": 0.0003794503575060104, "loss": 5.6767, "mean_token_accuracy": 0.17384239584207534, "num_tokens": 4615788.0, "step": 2040 }, { "entropy": 6.062489032745361, "epoch": 0.1316128201827777, "grad_norm": 1.0390625, "learning_rate": 0.00037840546863983484, "loss": 5.8339, "mean_token_accuracy": 0.15843693166971207, "num_tokens": 4627356.0, "step": 2045 }, { "entropy": 5.916549587249756, "epoch": 0.13193461191916592, "grad_norm": 1.0078125, "learning_rate": 0.0003773577448605015, "loss": 5.7283, "mean_token_accuracy": 0.16857298761606215, "num_tokens": 4639141.0, "step": 2050 }, { "entropy": 5.936976480484009, "epoch": 0.13225640365555413, "grad_norm": 0.94921875, "learning_rate": 0.0003763072148918872, "loss": 5.7393, "mean_token_accuracy": 0.16606717854738234, "num_tokens": 4650652.0, "step": 2055 }, { "entropy": 6.040337038040161, "epoch": 0.13257819539194232, "grad_norm": 1.09375, "learning_rate": 0.0003752539075348017, "loss": 5.836, "mean_token_accuracy": 0.1626781165599823, "num_tokens": 4662488.0, "step": 2060 }, { "entropy": 5.9237734317779545, "epoch": 0.13289998712833054, "grad_norm": 1.0859375, "learning_rate": 0.00037419785166619817, "loss": 5.6785, "mean_token_accuracy": 0.17449075877666473, "num_tokens": 4673179.0, "step": 2065 }, { "entropy": 5.899606513977051, "epoch": 0.13322177886471875, "grad_norm": 0.96875, "learning_rate": 0.0003731390762383818, "loss": 5.7106, "mean_token_accuracy": 0.16527393609285354, "num_tokens": 4685638.0, "step": 2070 }, { "entropy": 5.9706236839294435, "epoch": 0.13354357060110697, "grad_norm": 1.0078125, "learning_rate": 0.0003720776102782158, "loss": 5.7273, "mean_token_accuracy": 0.166809344291687, "num_tokens": 4695888.0, "step": 2075 }, { "entropy": 5.946358966827392, "epoch": 0.1338653623374952, "grad_norm": 0.93359375, "learning_rate": 0.00037101348288632555, "loss": 5.8268, "mean_token_accuracy": 0.1696252480149269, "num_tokens": 4709179.0, "step": 2080 }, { "entropy": 5.90604944229126, "epoch": 0.13418715407388337, "grad_norm": 1.09375, "learning_rate": 0.0003699467232363012, "loss": 5.6426, "mean_token_accuracy": 0.17307308316230774, "num_tokens": 4719903.0, "step": 2085 }, { "entropy": 5.87218542098999, "epoch": 0.1345089458102716, "grad_norm": 1.0390625, "learning_rate": 0.0003688773605738973, "loss": 5.6291, "mean_token_accuracy": 0.17803697884082795, "num_tokens": 4730474.0, "step": 2090 }, { "entropy": 6.005245161056519, "epoch": 0.1348307375466598, "grad_norm": 1.1484375, "learning_rate": 0.00036780542421623134, "loss": 5.6674, "mean_token_accuracy": 0.17519882023334504, "num_tokens": 4740224.0, "step": 2095 }, { "entropy": 5.894599723815918, "epoch": 0.13515252928304802, "grad_norm": 1.015625, "learning_rate": 0.0003667309435509802, "loss": 5.7649, "mean_token_accuracy": 0.1648050218820572, "num_tokens": 4752090.0, "step": 2100 }, { "entropy": 5.988539552688598, "epoch": 0.1354743210194362, "grad_norm": 0.9609375, "learning_rate": 0.0003656539480355741, "loss": 5.7122, "mean_token_accuracy": 0.17079789340496063, "num_tokens": 4764255.0, "step": 2105 }, { "entropy": 5.970441818237305, "epoch": 0.13579611275582443, "grad_norm": 1.125, "learning_rate": 0.0003645744671963891, "loss": 5.6798, "mean_token_accuracy": 0.17033676356077193, "num_tokens": 4775180.0, "step": 2110 }, { "entropy": 5.879854440689087, "epoch": 0.13611790449221264, "grad_norm": 0.91796875, "learning_rate": 0.0003634925306279376, "loss": 5.6526, "mean_token_accuracy": 0.1717776834964752, "num_tokens": 4787197.0, "step": 2115 }, { "entropy": 6.032135105133056, "epoch": 0.13643969622860086, "grad_norm": 1.046875, "learning_rate": 0.0003624081679920574, "loss": 5.7933, "mean_token_accuracy": 0.16055777594447135, "num_tokens": 4798183.0, "step": 2120 }, { "entropy": 5.946911716461182, "epoch": 0.13676148796498905, "grad_norm": 1.0546875, "learning_rate": 0.0003613214090170977, "loss": 5.7008, "mean_token_accuracy": 0.16945894658565522, "num_tokens": 4809677.0, "step": 2125 }, { "entropy": 5.951129817962647, "epoch": 0.13708327970137726, "grad_norm": 0.98046875, "learning_rate": 0.0003602322834971048, "loss": 5.8569, "mean_token_accuracy": 0.1617010071873665, "num_tokens": 4821875.0, "step": 2130 }, { "entropy": 5.970095825195313, "epoch": 0.13740507143776548, "grad_norm": 1.046875, "learning_rate": 0.0003591408212910051, "loss": 5.7132, "mean_token_accuracy": 0.16546998172998428, "num_tokens": 4833281.0, "step": 2135 }, { "entropy": 5.967103815078735, "epoch": 0.1377268631741537, "grad_norm": 1.0, "learning_rate": 0.0003580470523217863, "loss": 5.7299, "mean_token_accuracy": 0.1667395293712616, "num_tokens": 4844251.0, "step": 2140 }, { "entropy": 5.953110265731811, "epoch": 0.13804865491054188, "grad_norm": 0.9765625, "learning_rate": 0.0003569510065756771, "loss": 5.7315, "mean_token_accuracy": 0.16552457511425017, "num_tokens": 4854843.0, "step": 2145 }, { "entropy": 5.908506202697754, "epoch": 0.1383704466469301, "grad_norm": 0.92578125, "learning_rate": 0.0003558527141013254, "loss": 5.7069, "mean_token_accuracy": 0.16249925792217254, "num_tokens": 4866958.0, "step": 2150 }, { "entropy": 5.890867042541504, "epoch": 0.13869223838331832, "grad_norm": 1.203125, "learning_rate": 0.0003547522050089742, "loss": 5.5593, "mean_token_accuracy": 0.18277599662542343, "num_tokens": 4879403.0, "step": 2155 }, { "entropy": 5.962781810760498, "epoch": 0.13901403011970653, "grad_norm": 0.984375, "learning_rate": 0.00035364950946963606, "loss": 5.8095, "mean_token_accuracy": 0.16088420003652573, "num_tokens": 4891316.0, "step": 2160 }, { "entropy": 6.006658124923706, "epoch": 0.13933582185609475, "grad_norm": 0.95703125, "learning_rate": 0.0003525446577142663, "loss": 5.766, "mean_token_accuracy": 0.16405210494995118, "num_tokens": 4903546.0, "step": 2165 }, { "entropy": 5.99455156326294, "epoch": 0.13965761359248294, "grad_norm": 0.97265625, "learning_rate": 0.00035143768003293395, "loss": 5.8001, "mean_token_accuracy": 0.1626756399869919, "num_tokens": 4916202.0, "step": 2170 }, { "entropy": 5.99146842956543, "epoch": 0.13997940532887115, "grad_norm": 1.09375, "learning_rate": 0.0003503286067739913, "loss": 5.7106, "mean_token_accuracy": 0.171851447224617, "num_tokens": 4927056.0, "step": 2175 }, { "entropy": 5.879936456680298, "epoch": 0.14030119706525937, "grad_norm": 0.9921875, "learning_rate": 0.00034921746834324193, "loss": 5.6289, "mean_token_accuracy": 0.17143047153949736, "num_tokens": 4936821.0, "step": 2180 }, { "entropy": 6.010110473632812, "epoch": 0.14062298880164759, "grad_norm": 1.015625, "learning_rate": 0.0003481042952031072, "loss": 5.7515, "mean_token_accuracy": 0.16894070506095887, "num_tokens": 4948044.0, "step": 2185 }, { "entropy": 5.966087770462036, "epoch": 0.14094478053803577, "grad_norm": 1.1328125, "learning_rate": 0.0003469891178717911, "loss": 5.766, "mean_token_accuracy": 0.16781144887208937, "num_tokens": 4958458.0, "step": 2190 }, { "entropy": 5.869229793548584, "epoch": 0.141266572274424, "grad_norm": 1.1171875, "learning_rate": 0.0003458719669224436, "loss": 5.6984, "mean_token_accuracy": 0.17290815114974975, "num_tokens": 4968527.0, "step": 2195 }, { "entropy": 5.951484823226929, "epoch": 0.1415883640108122, "grad_norm": 1.0390625, "learning_rate": 0.0003447528729823221, "loss": 5.7485, "mean_token_accuracy": 0.17064488381147386, "num_tokens": 4979071.0, "step": 2200 }, { "entropy": 6.070058870315552, "epoch": 0.14191015574720042, "grad_norm": 1.140625, "learning_rate": 0.0003436318667319525, "loss": 5.7307, "mean_token_accuracy": 0.16755202561616897, "num_tokens": 4991058.0, "step": 2205 }, { "entropy": 5.813839626312256, "epoch": 0.1422319474835886, "grad_norm": 1.0703125, "learning_rate": 0.00034250897890428716, "loss": 5.6744, "mean_token_accuracy": 0.17089736312627793, "num_tokens": 5001097.0, "step": 2210 }, { "entropy": 6.050524139404297, "epoch": 0.14255373921997683, "grad_norm": 0.98828125, "learning_rate": 0.0003413842402838633, "loss": 5.8245, "mean_token_accuracy": 0.15888952016830443, "num_tokens": 5014037.0, "step": 2215 }, { "entropy": 5.979872035980224, "epoch": 0.14287553095636504, "grad_norm": 0.96875, "learning_rate": 0.00034025768170595834, "loss": 5.8193, "mean_token_accuracy": 0.16481905430555344, "num_tokens": 5025762.0, "step": 2220 }, { "entropy": 6.016131353378296, "epoch": 0.14319732269275326, "grad_norm": 1.140625, "learning_rate": 0.0003391293340557446, "loss": 5.7792, "mean_token_accuracy": 0.17447091341018678, "num_tokens": 5037938.0, "step": 2225 }, { "entropy": 5.96392297744751, "epoch": 0.14351911442914145, "grad_norm": 1.0078125, "learning_rate": 0.0003379992282674431, "loss": 5.7024, "mean_token_accuracy": 0.17314245104789733, "num_tokens": 5049291.0, "step": 2230 }, { "entropy": 5.88561372756958, "epoch": 0.14384090616552966, "grad_norm": 1.0078125, "learning_rate": 0.0003368673953234749, "loss": 5.6034, "mean_token_accuracy": 0.177296245098114, "num_tokens": 5060913.0, "step": 2235 }, { "entropy": 6.02073860168457, "epoch": 0.14416269790191788, "grad_norm": 0.98046875, "learning_rate": 0.00033573386625361176, "loss": 5.7962, "mean_token_accuracy": 0.16476802229881288, "num_tokens": 5072208.0, "step": 2240 }, { "entropy": 6.0064239501953125, "epoch": 0.1444844896383061, "grad_norm": 1.09375, "learning_rate": 0.00033459867213412567, "loss": 5.8571, "mean_token_accuracy": 0.15992696732282638, "num_tokens": 5084160.0, "step": 2245 }, { "entropy": 5.891966104507446, "epoch": 0.14480628137469428, "grad_norm": 1.1015625, "learning_rate": 0.000333461844086937, "loss": 5.6344, "mean_token_accuracy": 0.17851366251707076, "num_tokens": 5094787.0, "step": 2250 }, { "entropy": 5.996278238296509, "epoch": 0.1451280731110825, "grad_norm": 0.99609375, "learning_rate": 0.00033232341327876097, "loss": 5.7164, "mean_token_accuracy": 0.16887120753526688, "num_tokens": 5106763.0, "step": 2255 }, { "entropy": 5.9834493637084964, "epoch": 0.14544986484747072, "grad_norm": 1.078125, "learning_rate": 0.0003311834109202531, "loss": 5.7315, "mean_token_accuracy": 0.16468412876129152, "num_tokens": 5117679.0, "step": 2260 }, { "entropy": 5.91273307800293, "epoch": 0.14577165658385893, "grad_norm": 1.0078125, "learning_rate": 0.00033004186826515416, "loss": 5.7731, "mean_token_accuracy": 0.16810884922742844, "num_tokens": 5129297.0, "step": 2265 }, { "entropy": 6.022095489501953, "epoch": 0.14609344832024715, "grad_norm": 1.1171875, "learning_rate": 0.0003288988166094324, "loss": 5.7665, "mean_token_accuracy": 0.17382967174053193, "num_tokens": 5140022.0, "step": 2270 }, { "entropy": 5.876718425750733, "epoch": 0.14641524005663534, "grad_norm": 1.0625, "learning_rate": 0.00032775428729042656, "loss": 5.6844, "mean_token_accuracy": 0.17166135609149932, "num_tokens": 5150547.0, "step": 2275 }, { "entropy": 5.8821056365966795, "epoch": 0.14673703179302355, "grad_norm": 1.0703125, "learning_rate": 0.000326608311685986, "loss": 5.6545, "mean_token_accuracy": 0.17519847750663758, "num_tokens": 5161187.0, "step": 2280 }, { "entropy": 5.971387434005737, "epoch": 0.14705882352941177, "grad_norm": 1.0546875, "learning_rate": 0.0003254609212136108, "loss": 5.7383, "mean_token_accuracy": 0.1704144760966301, "num_tokens": 5172595.0, "step": 2285 }, { "entropy": 6.0557152271270756, "epoch": 0.14738061526579999, "grad_norm": 1.125, "learning_rate": 0.00032431214732959036, "loss": 5.851, "mean_token_accuracy": 0.1618583656847477, "num_tokens": 5184891.0, "step": 2290 }, { "entropy": 5.909618234634399, "epoch": 0.14770240700218817, "grad_norm": 1.03125, "learning_rate": 0.000323162021528141, "loss": 5.6361, "mean_token_accuracy": 0.17127454429864883, "num_tokens": 5195786.0, "step": 2295 }, { "entropy": 6.025302600860596, "epoch": 0.1480241987385764, "grad_norm": 1.109375, "learning_rate": 0.00032201057534054264, "loss": 5.794, "mean_token_accuracy": 0.16409657448530196, "num_tokens": 5205262.0, "step": 2300 }, { "entropy": 5.872673273086548, "epoch": 0.1483459904749646, "grad_norm": 0.9609375, "learning_rate": 0.00032085784033427414, "loss": 5.6292, "mean_token_accuracy": 0.1747882217168808, "num_tokens": 5216452.0, "step": 2305 }, { "entropy": 5.884650564193725, "epoch": 0.14866778221135282, "grad_norm": 0.92578125, "learning_rate": 0.0003197038481121478, "loss": 5.6619, "mean_token_accuracy": 0.17331040054559707, "num_tokens": 5227973.0, "step": 2310 }, { "entropy": 5.884107494354248, "epoch": 0.148989573947741, "grad_norm": 1.0546875, "learning_rate": 0.0003185486303114436, "loss": 5.6719, "mean_token_accuracy": 0.1725606366991997, "num_tokens": 5239374.0, "step": 2315 }, { "entropy": 5.972824001312256, "epoch": 0.14931136568412923, "grad_norm": 1.203125, "learning_rate": 0.0003173922186030409, "loss": 5.6539, "mean_token_accuracy": 0.17623166888952255, "num_tokens": 5249132.0, "step": 2320 }, { "entropy": 5.952067708969116, "epoch": 0.14963315742051744, "grad_norm": 1.015625, "learning_rate": 0.000316234644690551, "loss": 5.7567, "mean_token_accuracy": 0.17128463536500932, "num_tokens": 5261187.0, "step": 2325 }, { "entropy": 5.934161567687989, "epoch": 0.14995494915690566, "grad_norm": 1.0625, "learning_rate": 0.0003150759403094473, "loss": 5.593, "mean_token_accuracy": 0.1803912714123726, "num_tokens": 5272728.0, "step": 2330 }, { "entropy": 5.866814613342285, "epoch": 0.15027674089329385, "grad_norm": 1.1640625, "learning_rate": 0.00031391613722619587, "loss": 5.6355, "mean_token_accuracy": 0.1746446520090103, "num_tokens": 5283718.0, "step": 2335 }, { "entropy": 5.96063380241394, "epoch": 0.15059853262968206, "grad_norm": 1.21875, "learning_rate": 0.000312755267237384, "loss": 5.7475, "mean_token_accuracy": 0.1625522032380104, "num_tokens": 5295225.0, "step": 2340 }, { "entropy": 5.971072101593018, "epoch": 0.15092032436607028, "grad_norm": 1.15625, "learning_rate": 0.0003115933621688488, "loss": 5.7045, "mean_token_accuracy": 0.16386832445859909, "num_tokens": 5306626.0, "step": 2345 }, { "entropy": 5.9291730403900145, "epoch": 0.1512421161024585, "grad_norm": 1.03125, "learning_rate": 0.00031043045387480487, "loss": 5.6993, "mean_token_accuracy": 0.16815454810857772, "num_tokens": 5317561.0, "step": 2350 }, { "entropy": 5.883768558502197, "epoch": 0.1515639078388467, "grad_norm": 1.0, "learning_rate": 0.0003092665742369703, "loss": 5.6189, "mean_token_accuracy": 0.17145977318286895, "num_tokens": 5328927.0, "step": 2355 }, { "entropy": 5.917680644989014, "epoch": 0.1518856995752349, "grad_norm": 0.94140625, "learning_rate": 0.00030810175516369343, "loss": 5.662, "mean_token_accuracy": 0.1667930856347084, "num_tokens": 5341790.0, "step": 2360 }, { "entropy": 5.858035039901734, "epoch": 0.15220749131162312, "grad_norm": 1.1328125, "learning_rate": 0.0003069360285890775, "loss": 5.6849, "mean_token_accuracy": 0.17515698969364166, "num_tokens": 5351574.0, "step": 2365 }, { "entropy": 5.8505940437316895, "epoch": 0.15252928304801133, "grad_norm": 1.046875, "learning_rate": 0.00030576942647210547, "loss": 5.5955, "mean_token_accuracy": 0.1824572429060936, "num_tokens": 5362111.0, "step": 2370 }, { "entropy": 5.920116329193116, "epoch": 0.15285107478439955, "grad_norm": 1.0546875, "learning_rate": 0.00030460198079576355, "loss": 5.683, "mean_token_accuracy": 0.1748235523700714, "num_tokens": 5372972.0, "step": 2375 }, { "entropy": 5.964871454238891, "epoch": 0.15317286652078774, "grad_norm": 1.109375, "learning_rate": 0.0003034337235661648, "loss": 5.6812, "mean_token_accuracy": 0.17000782117247581, "num_tokens": 5384202.0, "step": 2380 }, { "entropy": 5.865831804275513, "epoch": 0.15349465825717595, "grad_norm": 1.0703125, "learning_rate": 0.0003022646868116714, "loss": 5.6494, "mean_token_accuracy": 0.17118988633155824, "num_tokens": 5394532.0, "step": 2385 }, { "entropy": 5.945181751251221, "epoch": 0.15381644999356417, "grad_norm": 1.0078125, "learning_rate": 0.0003010949025820163, "loss": 5.6525, "mean_token_accuracy": 0.17214784026145935, "num_tokens": 5405566.0, "step": 2390 }, { "entropy": 5.847892808914184, "epoch": 0.15413824172995239, "grad_norm": 1.0078125, "learning_rate": 0.0002999244029474252, "loss": 5.588, "mean_token_accuracy": 0.17228065431118011, "num_tokens": 5415987.0, "step": 2395 }, { "entropy": 5.979330921173096, "epoch": 0.15446003346634057, "grad_norm": 1.0078125, "learning_rate": 0.00029875321999773684, "loss": 5.7465, "mean_token_accuracy": 0.17200904488563537, "num_tokens": 5428326.0, "step": 2400 }, { "entropy": 6.06197714805603, "epoch": 0.1547818252027288, "grad_norm": 1.0234375, "learning_rate": 0.00029758138584152333, "loss": 5.7314, "mean_token_accuracy": 0.17323051691055297, "num_tokens": 5438489.0, "step": 2405 }, { "entropy": 5.831584310531616, "epoch": 0.155103616939117, "grad_norm": 1.1875, "learning_rate": 0.0002964089326052102, "loss": 5.6471, "mean_token_accuracy": 0.17835497856140137, "num_tokens": 5450503.0, "step": 2410 }, { "entropy": 5.85852575302124, "epoch": 0.15542540867550522, "grad_norm": 0.9921875, "learning_rate": 0.0002952358924321949, "loss": 5.6778, "mean_token_accuracy": 0.1646075055003166, "num_tokens": 5462462.0, "step": 2415 }, { "entropy": 5.998752212524414, "epoch": 0.1557472004118934, "grad_norm": 1.0546875, "learning_rate": 0.00029406229748196657, "loss": 5.6415, "mean_token_accuracy": 0.16974121928215027, "num_tokens": 5473606.0, "step": 2420 }, { "entropy": 5.839715528488159, "epoch": 0.15606899214828163, "grad_norm": 0.98046875, "learning_rate": 0.0002928881799292235, "loss": 5.6458, "mean_token_accuracy": 0.1760490596294403, "num_tokens": 5485225.0, "step": 2425 }, { "entropy": 5.795893239974975, "epoch": 0.15639078388466984, "grad_norm": 0.95703125, "learning_rate": 0.00029171357196299154, "loss": 5.5689, "mean_token_accuracy": 0.17621443122625352, "num_tokens": 5496414.0, "step": 2430 }, { "entropy": 5.98623046875, "epoch": 0.15671257562105806, "grad_norm": 1.09375, "learning_rate": 0.0002905385057857414, "loss": 5.7821, "mean_token_accuracy": 0.16767961978912355, "num_tokens": 5507782.0, "step": 2435 }, { "entropy": 5.99998369216919, "epoch": 0.15703436735744625, "grad_norm": 0.97265625, "learning_rate": 0.0002893630136125058, "loss": 5.6394, "mean_token_accuracy": 0.1724068120121956, "num_tokens": 5519710.0, "step": 2440 }, { "entropy": 5.949369621276856, "epoch": 0.15735615909383446, "grad_norm": 1.125, "learning_rate": 0.0002881871276699967, "loss": 5.7878, "mean_token_accuracy": 0.16030909568071366, "num_tokens": 5532595.0, "step": 2445 }, { "entropy": 5.943856716156006, "epoch": 0.15767795083022268, "grad_norm": 0.97265625, "learning_rate": 0.00028701088019572114, "loss": 5.7539, "mean_token_accuracy": 0.17245638221502305, "num_tokens": 5544632.0, "step": 2450 }, { "entropy": 5.866825246810913, "epoch": 0.1579997425666109, "grad_norm": 1.0546875, "learning_rate": 0.0002858343034370977, "loss": 5.6876, "mean_token_accuracy": 0.16297770589590072, "num_tokens": 5555772.0, "step": 2455 }, { "entropy": 5.909289836883545, "epoch": 0.1583215343029991, "grad_norm": 1.15625, "learning_rate": 0.00028465742965057267, "loss": 5.6454, "mean_token_accuracy": 0.17697256952524185, "num_tokens": 5566290.0, "step": 2460 }, { "entropy": 5.986184740066529, "epoch": 0.1586433260393873, "grad_norm": 0.9453125, "learning_rate": 0.00028348029110073533, "loss": 5.6812, "mean_token_accuracy": 0.17353546917438506, "num_tokens": 5577635.0, "step": 2465 }, { "entropy": 5.879158306121826, "epoch": 0.15896511777577552, "grad_norm": 0.95703125, "learning_rate": 0.00028230292005943365, "loss": 5.646, "mean_token_accuracy": 0.17922404557466506, "num_tokens": 5588498.0, "step": 2470 }, { "entropy": 5.936116790771484, "epoch": 0.15928690951216373, "grad_norm": 1.0078125, "learning_rate": 0.00028112534880488945, "loss": 5.728, "mean_token_accuracy": 0.1710246592760086, "num_tokens": 5599414.0, "step": 2475 }, { "entropy": 5.948381662368774, "epoch": 0.15960870124855195, "grad_norm": 1.09375, "learning_rate": 0.0002799476096208137, "loss": 5.6494, "mean_token_accuracy": 0.1711360514163971, "num_tokens": 5610743.0, "step": 2480 }, { "entropy": 5.899236011505127, "epoch": 0.15993049298494014, "grad_norm": 1.1953125, "learning_rate": 0.00027876973479552087, "loss": 5.6379, "mean_token_accuracy": 0.17218640968203544, "num_tokens": 5620352.0, "step": 2485 }, { "entropy": 5.906830644607544, "epoch": 0.16025228472132835, "grad_norm": 0.984375, "learning_rate": 0.00027759175662104424, "loss": 5.6545, "mean_token_accuracy": 0.17277627289295197, "num_tokens": 5632978.0, "step": 2490 }, { "entropy": 5.972187471389771, "epoch": 0.16057407645771657, "grad_norm": 1.0234375, "learning_rate": 0.0002764137073922508, "loss": 5.6788, "mean_token_accuracy": 0.17677641212940215, "num_tokens": 5643752.0, "step": 2495 }, { "entropy": 5.936763048171997, "epoch": 0.16089586819410479, "grad_norm": 1.0234375, "learning_rate": 0.00027523561940595505, "loss": 5.6758, "mean_token_accuracy": 0.16948932707309722, "num_tokens": 5654079.0, "step": 2500 }, { "entropy": 5.8479784488677975, "epoch": 0.16121765993049297, "grad_norm": 0.99609375, "learning_rate": 0.0002740575249600342, "loss": 5.6039, "mean_token_accuracy": 0.1728373259305954, "num_tokens": 5665031.0, "step": 2505 }, { "entropy": 5.927531623840332, "epoch": 0.1615394516668812, "grad_norm": 1.0546875, "learning_rate": 0.00027287945635254263, "loss": 5.7457, "mean_token_accuracy": 0.16565068662166596, "num_tokens": 5676617.0, "step": 2510 }, { "entropy": 5.9433318138122555, "epoch": 0.1618612434032694, "grad_norm": 0.98828125, "learning_rate": 0.00027170144588082635, "loss": 5.6884, "mean_token_accuracy": 0.1758946180343628, "num_tokens": 5689340.0, "step": 2515 }, { "entropy": 5.91622314453125, "epoch": 0.16218303513965762, "grad_norm": 0.96875, "learning_rate": 0.00027052352584063763, "loss": 5.63, "mean_token_accuracy": 0.17126861214637756, "num_tokens": 5701028.0, "step": 2520 }, { "entropy": 5.892731046676635, "epoch": 0.1625048268760458, "grad_norm": 0.984375, "learning_rate": 0.00026934572852524907, "loss": 5.6347, "mean_token_accuracy": 0.1719435378909111, "num_tokens": 5712295.0, "step": 2525 }, { "entropy": 5.830513620376587, "epoch": 0.16282661861243403, "grad_norm": 1.0078125, "learning_rate": 0.00026816808622456937, "loss": 5.6259, "mean_token_accuracy": 0.16877489686012268, "num_tokens": 5724057.0, "step": 2530 }, { "entropy": 5.905984783172608, "epoch": 0.16314841034882224, "grad_norm": 1.0859375, "learning_rate": 0.0002669906312242569, "loss": 5.6931, "mean_token_accuracy": 0.1659385308623314, "num_tokens": 5735956.0, "step": 2535 }, { "entropy": 5.981123638153076, "epoch": 0.16347020208521046, "grad_norm": 0.99609375, "learning_rate": 0.00026581339580483525, "loss": 5.6179, "mean_token_accuracy": 0.1778892457485199, "num_tokens": 5748443.0, "step": 2540 }, { "entropy": 5.830804252624512, "epoch": 0.16379199382159867, "grad_norm": 1.03125, "learning_rate": 0.0002646364122408082, "loss": 5.575, "mean_token_accuracy": 0.17451245635747908, "num_tokens": 5758492.0, "step": 2545 }, { "entropy": 5.887456226348877, "epoch": 0.16411378555798686, "grad_norm": 1.0234375, "learning_rate": 0.0002634597127997749, "loss": 5.6786, "mean_token_accuracy": 0.17913737148046494, "num_tokens": 5770356.0, "step": 2550 }, { "entropy": 5.914636135101318, "epoch": 0.16443557729437508, "grad_norm": 1.1484375, "learning_rate": 0.0002622833297415445, "loss": 5.5737, "mean_token_accuracy": 0.17660111784934998, "num_tokens": 5781845.0, "step": 2555 }, { "entropy": 5.889319562911988, "epoch": 0.1647573690307633, "grad_norm": 1.109375, "learning_rate": 0.0002611072953172531, "loss": 5.6828, "mean_token_accuracy": 0.17167230546474457, "num_tokens": 5792984.0, "step": 2560 }, { "entropy": 5.918726396560669, "epoch": 0.1650791607671515, "grad_norm": 1.0, "learning_rate": 0.00025993164176847845, "loss": 5.6159, "mean_token_accuracy": 0.17725659608840943, "num_tokens": 5804281.0, "step": 2565 }, { "entropy": 5.877430152893067, "epoch": 0.1654009525035397, "grad_norm": 1.0, "learning_rate": 0.0002587564013263564, "loss": 5.6489, "mean_token_accuracy": 0.17125423550605773, "num_tokens": 5815492.0, "step": 2570 }, { "entropy": 5.794993495941162, "epoch": 0.16572274423992792, "grad_norm": 0.94140625, "learning_rate": 0.0002575816062106974, "loss": 5.5724, "mean_token_accuracy": 0.1777549132704735, "num_tokens": 5826489.0, "step": 2575 }, { "entropy": 5.906337022781372, "epoch": 0.16604453597631613, "grad_norm": 1.265625, "learning_rate": 0.00025640728862910293, "loss": 5.713, "mean_token_accuracy": 0.17065878510475158, "num_tokens": 5836855.0, "step": 2580 }, { "entropy": 6.010172939300537, "epoch": 0.16636632771270435, "grad_norm": 1.078125, "learning_rate": 0.00025523348077608285, "loss": 5.6922, "mean_token_accuracy": 0.16862486451864242, "num_tokens": 5848375.0, "step": 2585 }, { "entropy": 5.9172264575958256, "epoch": 0.16668811944909254, "grad_norm": 1.078125, "learning_rate": 0.00025406021483217225, "loss": 5.6385, "mean_token_accuracy": 0.17332242280244828, "num_tokens": 5860284.0, "step": 2590 }, { "entropy": 5.86074914932251, "epoch": 0.16700991118548075, "grad_norm": 1.015625, "learning_rate": 0.00025288752296304963, "loss": 5.628, "mean_token_accuracy": 0.17062413394451142, "num_tokens": 5872472.0, "step": 2595 }, { "entropy": 5.948844289779663, "epoch": 0.16733170292186897, "grad_norm": 1.015625, "learning_rate": 0.000251715437318655, "loss": 5.7212, "mean_token_accuracy": 0.16708531975746155, "num_tokens": 5884414.0, "step": 2600 }, { "entropy": 5.904808902740479, "epoch": 0.16765349465825719, "grad_norm": 1.125, "learning_rate": 0.0002505439900323084, "loss": 5.5929, "mean_token_accuracy": 0.17921153455972672, "num_tokens": 5895147.0, "step": 2605 }, { "entropy": 5.946256256103515, "epoch": 0.16797528639464537, "grad_norm": 1.0078125, "learning_rate": 0.00024937321321982894, "loss": 5.6343, "mean_token_accuracy": 0.17322177439928055, "num_tokens": 5906543.0, "step": 2610 }, { "entropy": 5.8588484764099125, "epoch": 0.1682970781310336, "grad_norm": 0.94140625, "learning_rate": 0.00024820313897865433, "loss": 5.6203, "mean_token_accuracy": 0.17429663836956025, "num_tokens": 5919508.0, "step": 2615 }, { "entropy": 5.939959716796875, "epoch": 0.1686188698674218, "grad_norm": 1.0859375, "learning_rate": 0.00024703379938696105, "loss": 5.6404, "mean_token_accuracy": 0.16639098078012465, "num_tokens": 5930505.0, "step": 2620 }, { "entropy": 5.928822755813599, "epoch": 0.16894066160381002, "grad_norm": 1.0, "learning_rate": 0.00024586522650278447, "loss": 5.7255, "mean_token_accuracy": 0.1699993923306465, "num_tokens": 5941923.0, "step": 2625 }, { "entropy": 5.939950799942016, "epoch": 0.1692624533401982, "grad_norm": 1.0625, "learning_rate": 0.00024469745236314064, "loss": 5.6515, "mean_token_accuracy": 0.1743636518716812, "num_tokens": 5952500.0, "step": 2630 }, { "entropy": 5.946257877349853, "epoch": 0.16958424507658643, "grad_norm": 1.0390625, "learning_rate": 0.00024353050898314767, "loss": 5.6208, "mean_token_accuracy": 0.17945975363254546, "num_tokens": 5963627.0, "step": 2635 }, { "entropy": 5.898108673095703, "epoch": 0.16990603681297464, "grad_norm": 1.09375, "learning_rate": 0.00024236442835514743, "loss": 5.6373, "mean_token_accuracy": 0.1774536982178688, "num_tokens": 5974660.0, "step": 2640 }, { "entropy": 5.882275915145874, "epoch": 0.17022782854936286, "grad_norm": 1.046875, "learning_rate": 0.00024119924244782965, "loss": 5.6131, "mean_token_accuracy": 0.17414790391921997, "num_tokens": 5986819.0, "step": 2645 }, { "entropy": 5.823239469528199, "epoch": 0.17054962028575107, "grad_norm": 1.171875, "learning_rate": 0.00024003498320535462, "loss": 5.604, "mean_token_accuracy": 0.17634231597185135, "num_tokens": 5998243.0, "step": 2650 }, { "entropy": 5.872538661956787, "epoch": 0.17087141202213926, "grad_norm": 1.078125, "learning_rate": 0.00023887168254647727, "loss": 5.6067, "mean_token_accuracy": 0.17921123802661895, "num_tokens": 6009380.0, "step": 2655 }, { "entropy": 6.089343547821045, "epoch": 0.17119320375852748, "grad_norm": 1.0390625, "learning_rate": 0.00023770937236367308, "loss": 5.802, "mean_token_accuracy": 0.16261860281229018, "num_tokens": 6021753.0, "step": 2660 }, { "entropy": 5.892279005050659, "epoch": 0.1715149954949157, "grad_norm": 1.0, "learning_rate": 0.00023654808452226278, "loss": 5.657, "mean_token_accuracy": 0.17246316075325013, "num_tokens": 6033119.0, "step": 2665 }, { "entropy": 5.941164112091064, "epoch": 0.1718367872313039, "grad_norm": 0.96484375, "learning_rate": 0.00023538785085953912, "loss": 5.6735, "mean_token_accuracy": 0.17682203650474548, "num_tokens": 6045325.0, "step": 2670 }, { "entropy": 5.892434072494507, "epoch": 0.1721585789676921, "grad_norm": 1.203125, "learning_rate": 0.00023422870318389404, "loss": 5.5603, "mean_token_accuracy": 0.17519785165786744, "num_tokens": 6056644.0, "step": 2675 }, { "entropy": 5.904356002807617, "epoch": 0.17248037070408032, "grad_norm": 1.1328125, "learning_rate": 0.0002330706732739468, "loss": 5.7465, "mean_token_accuracy": 0.17432881295681, "num_tokens": 6068158.0, "step": 2680 }, { "entropy": 5.875325918197632, "epoch": 0.17280216244046853, "grad_norm": 1.1171875, "learning_rate": 0.00023191379287767211, "loss": 5.5609, "mean_token_accuracy": 0.17418941259384155, "num_tokens": 6079805.0, "step": 2685 }, { "entropy": 5.883184814453125, "epoch": 0.17312395417685675, "grad_norm": 1.0546875, "learning_rate": 0.0002307580937115305, "loss": 5.6118, "mean_token_accuracy": 0.17658371925354005, "num_tokens": 6092101.0, "step": 2690 }, { "entropy": 5.8658631324768065, "epoch": 0.17344574591324494, "grad_norm": 1.0078125, "learning_rate": 0.00022960360745959846, "loss": 5.5587, "mean_token_accuracy": 0.1759619951248169, "num_tokens": 6103564.0, "step": 2695 }, { "entropy": 5.8528656482696535, "epoch": 0.17376753764963315, "grad_norm": 0.97265625, "learning_rate": 0.00022845036577269972, "loss": 5.5845, "mean_token_accuracy": 0.17992894500494003, "num_tokens": 6114707.0, "step": 2700 }, { "entropy": 5.885158967971802, "epoch": 0.17408932938602137, "grad_norm": 1.1015625, "learning_rate": 0.00022729840026753777, "loss": 5.7036, "mean_token_accuracy": 0.16926230639219284, "num_tokens": 6126507.0, "step": 2705 }, { "entropy": 5.9504554748535154, "epoch": 0.17441112112240958, "grad_norm": 1.1796875, "learning_rate": 0.0002261477425258287, "loss": 5.6615, "mean_token_accuracy": 0.17415249943733216, "num_tokens": 6138377.0, "step": 2710 }, { "entropy": 5.838265132904053, "epoch": 0.17473291285879777, "grad_norm": 1.1015625, "learning_rate": 0.0002249984240934358, "loss": 5.4843, "mean_token_accuracy": 0.18625319004058838, "num_tokens": 6149191.0, "step": 2715 }, { "entropy": 5.838680934906006, "epoch": 0.175054704595186, "grad_norm": 1.109375, "learning_rate": 0.00022385047647950464, "loss": 5.5459, "mean_token_accuracy": 0.1835317611694336, "num_tokens": 6160578.0, "step": 2720 }, { "entropy": 5.8880737781524655, "epoch": 0.1753764963315742, "grad_norm": 1.0, "learning_rate": 0.0002227039311555986, "loss": 5.671, "mean_token_accuracy": 0.1801140144467354, "num_tokens": 6171946.0, "step": 2725 }, { "entropy": 5.872739171981811, "epoch": 0.17569828806796242, "grad_norm": 1.0234375, "learning_rate": 0.0002215588195548372, "loss": 5.6142, "mean_token_accuracy": 0.17800743728876114, "num_tokens": 6184111.0, "step": 2730 }, { "entropy": 5.855648326873779, "epoch": 0.17602007980435064, "grad_norm": 1.1328125, "learning_rate": 0.00022041517307103337, "loss": 5.5592, "mean_token_accuracy": 0.17568369805812836, "num_tokens": 6195198.0, "step": 2735 }, { "entropy": 5.961105108261108, "epoch": 0.17634187154073883, "grad_norm": 1.1015625, "learning_rate": 0.0002192730230578331, "loss": 5.5833, "mean_token_accuracy": 0.17265253961086274, "num_tokens": 6206238.0, "step": 2740 }, { "entropy": 5.889549732208252, "epoch": 0.17666366327712704, "grad_norm": 1.1015625, "learning_rate": 0.0002181324008278559, "loss": 5.5473, "mean_token_accuracy": 0.180292809009552, "num_tokens": 6216161.0, "step": 2745 }, { "entropy": 5.792704725265503, "epoch": 0.17698545501351526, "grad_norm": 1.0234375, "learning_rate": 0.00021699333765183655, "loss": 5.5374, "mean_token_accuracy": 0.18200374990701676, "num_tokens": 6227615.0, "step": 2750 }, { "entropy": 5.85276985168457, "epoch": 0.17730724674990347, "grad_norm": 0.99609375, "learning_rate": 0.0002158558647577673, "loss": 5.5903, "mean_token_accuracy": 0.17588208019733428, "num_tokens": 6239471.0, "step": 2755 }, { "entropy": 5.907859754562378, "epoch": 0.17762903848629166, "grad_norm": 1.0, "learning_rate": 0.00021472001333004215, "loss": 5.574, "mean_token_accuracy": 0.17951287925243378, "num_tokens": 6250730.0, "step": 2760 }, { "entropy": 5.882738733291626, "epoch": 0.17795083022267988, "grad_norm": 1.0703125, "learning_rate": 0.00021358581450860186, "loss": 5.5453, "mean_token_accuracy": 0.18194909691810607, "num_tokens": 6261848.0, "step": 2765 }, { "entropy": 5.86366605758667, "epoch": 0.1782726219590681, "grad_norm": 0.921875, "learning_rate": 0.0002124532993880799, "loss": 5.6042, "mean_token_accuracy": 0.17284041047096252, "num_tokens": 6273003.0, "step": 2770 }, { "entropy": 5.8970660209655765, "epoch": 0.1785944136954563, "grad_norm": 1.0078125, "learning_rate": 0.00021132249901695044, "loss": 5.6502, "mean_token_accuracy": 0.16750085800886155, "num_tokens": 6285260.0, "step": 2775 }, { "entropy": 5.891424608230591, "epoch": 0.1789162054318445, "grad_norm": 0.99609375, "learning_rate": 0.00021019344439667705, "loss": 5.5835, "mean_token_accuracy": 0.17750193774700165, "num_tokens": 6296361.0, "step": 2780 }, { "entropy": 5.917513799667359, "epoch": 0.17923799716823272, "grad_norm": 1.09375, "learning_rate": 0.00020906616648086213, "loss": 5.6213, "mean_token_accuracy": 0.17909435778856278, "num_tokens": 6307430.0, "step": 2785 }, { "entropy": 5.9073878765106205, "epoch": 0.17955978890462093, "grad_norm": 1.078125, "learning_rate": 0.00020794069617439942, "loss": 5.5831, "mean_token_accuracy": 0.18298793882131575, "num_tokens": 6318384.0, "step": 2790 }, { "entropy": 5.830315208435058, "epoch": 0.17988158064100915, "grad_norm": 0.98046875, "learning_rate": 0.00020681706433262593, "loss": 5.5783, "mean_token_accuracy": 0.18446763157844542, "num_tokens": 6329793.0, "step": 2795 }, { "entropy": 5.857989740371704, "epoch": 0.18020337237739734, "grad_norm": 1.0, "learning_rate": 0.00020569530176047602, "loss": 5.5629, "mean_token_accuracy": 0.17229358553886415, "num_tokens": 6341544.0, "step": 2800 }, { "entropy": 5.872063541412354, "epoch": 0.18052516411378555, "grad_norm": 1.09375, "learning_rate": 0.0002045754392116374, "loss": 5.6211, "mean_token_accuracy": 0.18146874755620956, "num_tokens": 6353806.0, "step": 2805 }, { "entropy": 5.840001201629638, "epoch": 0.18084695585017377, "grad_norm": 0.9609375, "learning_rate": 0.00020345750738770757, "loss": 5.5074, "mean_token_accuracy": 0.17948529869318008, "num_tokens": 6365822.0, "step": 2810 }, { "entropy": 5.850231409072876, "epoch": 0.18116874758656198, "grad_norm": 0.9296875, "learning_rate": 0.00020234153693735214, "loss": 5.5516, "mean_token_accuracy": 0.1814487412571907, "num_tokens": 6377727.0, "step": 2815 }, { "entropy": 5.903557920455933, "epoch": 0.18149053932295017, "grad_norm": 1.1484375, "learning_rate": 0.0002012275584554647, "loss": 5.6061, "mean_token_accuracy": 0.17758110165596008, "num_tokens": 6390226.0, "step": 2820 }, { "entropy": 5.83018159866333, "epoch": 0.1818123310593384, "grad_norm": 1.0546875, "learning_rate": 0.00020011560248232803, "loss": 5.4433, "mean_token_accuracy": 0.18737607151269914, "num_tokens": 6400943.0, "step": 2825 }, { "entropy": 5.900821018218994, "epoch": 0.1821341227957266, "grad_norm": 0.98828125, "learning_rate": 0.00019900569950277692, "loss": 5.671, "mean_token_accuracy": 0.16967140585184098, "num_tokens": 6412047.0, "step": 2830 }, { "entropy": 5.952666616439819, "epoch": 0.18245591453211482, "grad_norm": 1.1328125, "learning_rate": 0.00019789787994536228, "loss": 5.7312, "mean_token_accuracy": 0.1702691435813904, "num_tokens": 6424343.0, "step": 2835 }, { "entropy": 5.922296953201294, "epoch": 0.18277770626850304, "grad_norm": 0.98828125, "learning_rate": 0.00019679217418151667, "loss": 5.6157, "mean_token_accuracy": 0.17290809899568557, "num_tokens": 6435694.0, "step": 2840 }, { "entropy": 5.881535959243775, "epoch": 0.18309949800489123, "grad_norm": 1.046875, "learning_rate": 0.00019568861252472236, "loss": 5.6177, "mean_token_accuracy": 0.17732709050178527, "num_tokens": 6447440.0, "step": 2845 }, { "entropy": 5.867380428314209, "epoch": 0.18342128974127944, "grad_norm": 1.1796875, "learning_rate": 0.00019458722522967952, "loss": 5.5519, "mean_token_accuracy": 0.17906618118286133, "num_tokens": 6457962.0, "step": 2850 }, { "entropy": 5.864987134933472, "epoch": 0.18374308147766766, "grad_norm": 1.109375, "learning_rate": 0.00019348804249147723, "loss": 5.5849, "mean_token_accuracy": 0.1784932255744934, "num_tokens": 6468277.0, "step": 2855 }, { "entropy": 5.9061667919158936, "epoch": 0.18406487321405587, "grad_norm": 1.078125, "learning_rate": 0.0001923910944447655, "loss": 5.5883, "mean_token_accuracy": 0.18092791885137557, "num_tokens": 6478104.0, "step": 2860 }, { "entropy": 5.989743709564209, "epoch": 0.18438666495044406, "grad_norm": 0.9375, "learning_rate": 0.00019129641116292928, "loss": 5.6754, "mean_token_accuracy": 0.1743457078933716, "num_tokens": 6490980.0, "step": 2865 }, { "entropy": 5.916643190383911, "epoch": 0.18470845668683228, "grad_norm": 1.140625, "learning_rate": 0.00019020402265726343, "loss": 5.6629, "mean_token_accuracy": 0.1758493021130562, "num_tokens": 6503317.0, "step": 2870 }, { "entropy": 5.853617477416992, "epoch": 0.1850302484232205, "grad_norm": 1.0234375, "learning_rate": 0.0001891139588761509, "loss": 5.5598, "mean_token_accuracy": 0.18232535123825072, "num_tokens": 6514232.0, "step": 2875 }, { "entropy": 5.876554727554321, "epoch": 0.1853520401596087, "grad_norm": 1.140625, "learning_rate": 0.00018802624970424076, "loss": 5.4804, "mean_token_accuracy": 0.18095476180315018, "num_tokens": 6524155.0, "step": 2880 }, { "entropy": 5.88511323928833, "epoch": 0.1856738318959969, "grad_norm": 1.078125, "learning_rate": 0.00018694092496162945, "loss": 5.5963, "mean_token_accuracy": 0.17882606238126755, "num_tokens": 6535369.0, "step": 2885 }, { "entropy": 5.923252534866333, "epoch": 0.18599562363238512, "grad_norm": 0.9765625, "learning_rate": 0.00018585801440304306, "loss": 5.589, "mean_token_accuracy": 0.1737535759806633, "num_tokens": 6547312.0, "step": 2890 }, { "entropy": 5.88273606300354, "epoch": 0.18631741536877333, "grad_norm": 0.96875, "learning_rate": 0.00018477754771702165, "loss": 5.6103, "mean_token_accuracy": 0.17274145781993866, "num_tokens": 6559574.0, "step": 2895 }, { "entropy": 5.875599479675293, "epoch": 0.18663920710516155, "grad_norm": 1.0, "learning_rate": 0.00018369955452510506, "loss": 5.5181, "mean_token_accuracy": 0.18256721943616866, "num_tokens": 6572349.0, "step": 2900 }, { "entropy": 5.81537275314331, "epoch": 0.18696099884154974, "grad_norm": 1.15625, "learning_rate": 0.0001826240643810212, "loss": 5.5171, "mean_token_accuracy": 0.18569806218147278, "num_tokens": 6583862.0, "step": 2905 }, { "entropy": 5.836563587188721, "epoch": 0.18728279057793795, "grad_norm": 1.0703125, "learning_rate": 0.0001815511067698758, "loss": 5.5209, "mean_token_accuracy": 0.18246111869812012, "num_tokens": 6595483.0, "step": 2910 }, { "entropy": 5.854921579360962, "epoch": 0.18760458231432617, "grad_norm": 1.0390625, "learning_rate": 0.0001804807111073436, "loss": 5.5868, "mean_token_accuracy": 0.17606635093688966, "num_tokens": 6607412.0, "step": 2915 }, { "entropy": 5.744170236587524, "epoch": 0.18792637405071438, "grad_norm": 1.0390625, "learning_rate": 0.0001794129067388625, "loss": 5.3916, "mean_token_accuracy": 0.18843700140714645, "num_tokens": 6619137.0, "step": 2920 }, { "entropy": 5.8060136318206785, "epoch": 0.1882481657871026, "grad_norm": 1.0703125, "learning_rate": 0.00017834772293882868, "loss": 5.5076, "mean_token_accuracy": 0.1844844177365303, "num_tokens": 6629876.0, "step": 2925 }, { "entropy": 5.884723663330078, "epoch": 0.1885699575234908, "grad_norm": 1.078125, "learning_rate": 0.000177285188909794, "loss": 5.5122, "mean_token_accuracy": 0.17733246088027954, "num_tokens": 6640212.0, "step": 2930 }, { "entropy": 5.829393672943115, "epoch": 0.188891749259879, "grad_norm": 0.9765625, "learning_rate": 0.0001762253337816656, "loss": 5.4715, "mean_token_accuracy": 0.18301572650671005, "num_tokens": 6650268.0, "step": 2935 }, { "entropy": 5.87557020187378, "epoch": 0.18921354099626722, "grad_norm": 1.234375, "learning_rate": 0.00017516818661090738, "loss": 5.5687, "mean_token_accuracy": 0.17853922098875047, "num_tokens": 6661839.0, "step": 2940 }, { "entropy": 5.856263828277588, "epoch": 0.18953533273265544, "grad_norm": 1.265625, "learning_rate": 0.0001741137763797428, "loss": 5.5956, "mean_token_accuracy": 0.1787753477692604, "num_tokens": 6672801.0, "step": 2945 }, { "entropy": 5.883411407470703, "epoch": 0.18985712446904363, "grad_norm": 1.109375, "learning_rate": 0.00017306213199536115, "loss": 5.6112, "mean_token_accuracy": 0.18012756556272508, "num_tokens": 6684085.0, "step": 2950 }, { "entropy": 5.875811386108398, "epoch": 0.19017891620543184, "grad_norm": 0.984375, "learning_rate": 0.0001720132822891243, "loss": 5.6033, "mean_token_accuracy": 0.1807347223162651, "num_tokens": 6695170.0, "step": 2955 }, { "entropy": 5.883177757263184, "epoch": 0.19050070794182006, "grad_norm": 1.0, "learning_rate": 0.0001709672560157769, "loss": 5.6043, "mean_token_accuracy": 0.17464618384838104, "num_tokens": 6706505.0, "step": 2960 }, { "entropy": 5.838523197174072, "epoch": 0.19082249967820827, "grad_norm": 1.0859375, "learning_rate": 0.00016992408185265758, "loss": 5.5111, "mean_token_accuracy": 0.18301574140787125, "num_tokens": 6717490.0, "step": 2965 }, { "entropy": 5.884327077865601, "epoch": 0.19114429141459646, "grad_norm": 1.1640625, "learning_rate": 0.00016888378839891298, "loss": 5.5558, "mean_token_accuracy": 0.1750153586268425, "num_tokens": 6728840.0, "step": 2970 }, { "entropy": 5.902485132217407, "epoch": 0.19146608315098468, "grad_norm": 1.234375, "learning_rate": 0.0001678464041747137, "loss": 5.625, "mean_token_accuracy": 0.1751623496413231, "num_tokens": 6740498.0, "step": 2975 }, { "entropy": 5.8105615139007565, "epoch": 0.1917878748873729, "grad_norm": 1.1484375, "learning_rate": 0.00016681195762047223, "loss": 5.4677, "mean_token_accuracy": 0.1858067885041237, "num_tokens": 6751221.0, "step": 2980 }, { "entropy": 5.788748645782471, "epoch": 0.1921096666237611, "grad_norm": 0.890625, "learning_rate": 0.00016578047709606337, "loss": 5.4648, "mean_token_accuracy": 0.18611440062522888, "num_tokens": 6763306.0, "step": 2985 }, { "entropy": 5.860508584976197, "epoch": 0.1924314583601493, "grad_norm": 1.0625, "learning_rate": 0.00016475199088004678, "loss": 5.5821, "mean_token_accuracy": 0.17807333618402482, "num_tokens": 6775402.0, "step": 2990 }, { "entropy": 5.921563768386841, "epoch": 0.19275325009653752, "grad_norm": 1.0703125, "learning_rate": 0.00016372652716889163, "loss": 5.5522, "mean_token_accuracy": 0.18112993687391282, "num_tokens": 6786367.0, "step": 2995 }, { "entropy": 5.957089281082153, "epoch": 0.19307504183292573, "grad_norm": 1.09375, "learning_rate": 0.0001627041140762035, "loss": 5.5209, "mean_token_accuracy": 0.18653607815504075, "num_tokens": 6797350.0, "step": 3000 }, { "entropy": 5.850742816925049, "epoch": 0.19339683356931395, "grad_norm": 1.1328125, "learning_rate": 0.00016168477963195382, "loss": 5.5967, "mean_token_accuracy": 0.18095401376485826, "num_tokens": 6808338.0, "step": 3005 }, { "entropy": 5.78863844871521, "epoch": 0.19371862530570216, "grad_norm": 1.109375, "learning_rate": 0.0001606685517817114, "loss": 5.4693, "mean_token_accuracy": 0.1860291212797165, "num_tokens": 6818422.0, "step": 3010 }, { "entropy": 5.8237865447998045, "epoch": 0.19404041704209035, "grad_norm": 0.99609375, "learning_rate": 0.00015965545838587592, "loss": 5.5801, "mean_token_accuracy": 0.17104513347148895, "num_tokens": 6829640.0, "step": 3015 }, { "entropy": 5.848712491989136, "epoch": 0.19436220877847857, "grad_norm": 0.92578125, "learning_rate": 0.00015864552721891467, "loss": 5.5144, "mean_token_accuracy": 0.17743528336286546, "num_tokens": 6841270.0, "step": 3020 }, { "entropy": 5.803371715545654, "epoch": 0.19468400051486678, "grad_norm": 1.015625, "learning_rate": 0.00015763878596860076, "loss": 5.5154, "mean_token_accuracy": 0.18457495421171188, "num_tokens": 6852576.0, "step": 3025 }, { "entropy": 5.886868190765381, "epoch": 0.195005792251255, "grad_norm": 1.0078125, "learning_rate": 0.00015663526223525412, "loss": 5.5903, "mean_token_accuracy": 0.18297483623027802, "num_tokens": 6863321.0, "step": 3030 }, { "entropy": 5.877092742919922, "epoch": 0.1953275839876432, "grad_norm": 1.1875, "learning_rate": 0.0001556349835309848, "loss": 5.5618, "mean_token_accuracy": 0.176148684322834, "num_tokens": 6875037.0, "step": 3035 }, { "entropy": 5.8996411800384525, "epoch": 0.1956493757240314, "grad_norm": 1.0234375, "learning_rate": 0.0001546379772789389, "loss": 5.5504, "mean_token_accuracy": 0.17518482208251954, "num_tokens": 6885609.0, "step": 3040 }, { "entropy": 5.795802879333496, "epoch": 0.19597116746041962, "grad_norm": 1.0078125, "learning_rate": 0.00015364427081254622, "loss": 5.5253, "mean_token_accuracy": 0.18351076394319535, "num_tokens": 6897631.0, "step": 3045 }, { "entropy": 5.879382991790772, "epoch": 0.19629295919680784, "grad_norm": 1.1484375, "learning_rate": 0.00015265389137477165, "loss": 5.5654, "mean_token_accuracy": 0.17894306480884553, "num_tokens": 6909753.0, "step": 3050 }, { "entropy": 5.935993385314942, "epoch": 0.19661475093319603, "grad_norm": 1.03125, "learning_rate": 0.00015166686611736786, "loss": 5.5967, "mean_token_accuracy": 0.17674631476402283, "num_tokens": 6920620.0, "step": 3055 }, { "entropy": 5.927987861633301, "epoch": 0.19693654266958424, "grad_norm": 1.15625, "learning_rate": 0.00015068322210013064, "loss": 5.6101, "mean_token_accuracy": 0.17744941562414168, "num_tokens": 6931518.0, "step": 3060 }, { "entropy": 5.874757480621338, "epoch": 0.19725833440597246, "grad_norm": 1.0078125, "learning_rate": 0.0001497029862901578, "loss": 5.4881, "mean_token_accuracy": 0.19067199528217316, "num_tokens": 6942490.0, "step": 3065 }, { "entropy": 5.813010120391846, "epoch": 0.19758012614236067, "grad_norm": 1.1328125, "learning_rate": 0.00014872618556110905, "loss": 5.499, "mean_token_accuracy": 0.18798102289438248, "num_tokens": 6953552.0, "step": 3070 }, { "entropy": 5.8256911277771, "epoch": 0.19790191787874886, "grad_norm": 1.0625, "learning_rate": 0.00014775284669246992, "loss": 5.4765, "mean_token_accuracy": 0.19052104651927948, "num_tokens": 6963776.0, "step": 3075 }, { "entropy": 5.864571666717529, "epoch": 0.19822370961513708, "grad_norm": 0.98828125, "learning_rate": 0.00014678299636881716, "loss": 5.5762, "mean_token_accuracy": 0.1808768630027771, "num_tokens": 6974798.0, "step": 3080 }, { "entropy": 5.868327522277832, "epoch": 0.1985455013515253, "grad_norm": 0.9609375, "learning_rate": 0.0001458166611790873, "loss": 5.6123, "mean_token_accuracy": 0.1740301564335823, "num_tokens": 6985849.0, "step": 3085 }, { "entropy": 5.870274543762207, "epoch": 0.1988672930879135, "grad_norm": 0.96875, "learning_rate": 0.00014485386761584773, "loss": 5.5456, "mean_token_accuracy": 0.17518602013587953, "num_tokens": 6996547.0, "step": 3090 }, { "entropy": 5.8277647495269775, "epoch": 0.1991890848243017, "grad_norm": 1.1171875, "learning_rate": 0.00014389464207457042, "loss": 5.4767, "mean_token_accuracy": 0.18118809759616852, "num_tokens": 7008451.0, "step": 3095 }, { "entropy": 5.833849668502808, "epoch": 0.19951087656068991, "grad_norm": 1.109375, "learning_rate": 0.00014293901085290795, "loss": 5.4234, "mean_token_accuracy": 0.19507208466529846, "num_tokens": 7018811.0, "step": 3100 }, { "entropy": 5.909834337234497, "epoch": 0.19983266829707813, "grad_norm": 1.125, "learning_rate": 0.00014198700014997307, "loss": 5.617, "mean_token_accuracy": 0.17597549706697463, "num_tokens": 7029991.0, "step": 3105 }, { "entropy": 5.853272724151611, "epoch": 0.20015446003346635, "grad_norm": 1.0, "learning_rate": 0.00014103863606562016, "loss": 5.5244, "mean_token_accuracy": 0.1778181865811348, "num_tokens": 7041602.0, "step": 3110 }, { "entropy": 5.84766116142273, "epoch": 0.20047625176985456, "grad_norm": 1.0234375, "learning_rate": 0.00014009394459972964, "loss": 5.482, "mean_token_accuracy": 0.18340889364480972, "num_tokens": 7052818.0, "step": 3115 }, { "entropy": 5.813225126266479, "epoch": 0.20079804350624275, "grad_norm": 1.015625, "learning_rate": 0.00013915295165149513, "loss": 5.4683, "mean_token_accuracy": 0.18627272248268129, "num_tokens": 7064018.0, "step": 3120 }, { "entropy": 5.8608612537384035, "epoch": 0.20111983524263097, "grad_norm": 1.25, "learning_rate": 0.00013821568301871384, "loss": 5.5689, "mean_token_accuracy": 0.18183653056621552, "num_tokens": 7076200.0, "step": 3125 }, { "entropy": 5.8212409019470215, "epoch": 0.20144162697901918, "grad_norm": 0.94140625, "learning_rate": 0.00013728216439707862, "loss": 5.4677, "mean_token_accuracy": 0.18109458237886428, "num_tokens": 7088688.0, "step": 3130 }, { "entropy": 5.902452754974365, "epoch": 0.2017634187154074, "grad_norm": 1.0078125, "learning_rate": 0.00013635242137947419, "loss": 5.4938, "mean_token_accuracy": 0.18321633487939834, "num_tokens": 7099885.0, "step": 3135 }, { "entropy": 5.853002834320068, "epoch": 0.2020852104517956, "grad_norm": 0.99609375, "learning_rate": 0.00013542647945527498, "loss": 5.4506, "mean_token_accuracy": 0.190339332818985, "num_tokens": 7110003.0, "step": 3140 }, { "entropy": 5.902886629104614, "epoch": 0.2024070021881838, "grad_norm": 1.0625, "learning_rate": 0.0001345043640096465, "loss": 5.67, "mean_token_accuracy": 0.17207630425691606, "num_tokens": 7121487.0, "step": 3145 }, { "entropy": 5.846290636062622, "epoch": 0.20272879392457202, "grad_norm": 1.0859375, "learning_rate": 0.00013358610032284957, "loss": 5.5388, "mean_token_accuracy": 0.18009190857410431, "num_tokens": 7132143.0, "step": 3150 }, { "entropy": 5.94025993347168, "epoch": 0.20305058566096024, "grad_norm": 1.09375, "learning_rate": 0.000132671713569547, "loss": 5.5887, "mean_token_accuracy": 0.17998658567667009, "num_tokens": 7144607.0, "step": 3155 }, { "entropy": 5.826769399642944, "epoch": 0.20337237739734843, "grad_norm": 1.09375, "learning_rate": 0.0001317612288181136, "loss": 5.4272, "mean_token_accuracy": 0.1863418772816658, "num_tokens": 7154917.0, "step": 3160 }, { "entropy": 5.918270778656006, "epoch": 0.20369416913373664, "grad_norm": 1.0546875, "learning_rate": 0.00013085467102994864, "loss": 5.6312, "mean_token_accuracy": 0.1752564400434494, "num_tokens": 7165749.0, "step": 3165 }, { "entropy": 5.910392236709595, "epoch": 0.20401596087012486, "grad_norm": 1.1484375, "learning_rate": 0.00012995206505879198, "loss": 5.6292, "mean_token_accuracy": 0.17657297551631929, "num_tokens": 7177090.0, "step": 3170 }, { "entropy": 5.845000696182251, "epoch": 0.20433775260651307, "grad_norm": 1.1640625, "learning_rate": 0.0001290534356500421, "loss": 5.5472, "mean_token_accuracy": 0.18226966708898545, "num_tokens": 7186917.0, "step": 3175 }, { "entropy": 5.884703207015991, "epoch": 0.20465954434290126, "grad_norm": 1.09375, "learning_rate": 0.00012815880744007827, "loss": 5.5061, "mean_token_accuracy": 0.18800627291202546, "num_tokens": 7197405.0, "step": 3180 }, { "entropy": 5.821019315719605, "epoch": 0.20498133607928948, "grad_norm": 0.9140625, "learning_rate": 0.00012726820495558483, "loss": 5.5191, "mean_token_accuracy": 0.18462463319301606, "num_tokens": 7208876.0, "step": 3185 }, { "entropy": 5.740750122070312, "epoch": 0.2053031278156777, "grad_norm": 1.03125, "learning_rate": 0.00012638165261287868, "loss": 5.41, "mean_token_accuracy": 0.1912576213479042, "num_tokens": 7219704.0, "step": 3190 }, { "entropy": 5.907505035400391, "epoch": 0.2056249195520659, "grad_norm": 1.0859375, "learning_rate": 0.0001254991747172402, "loss": 5.5443, "mean_token_accuracy": 0.17871226221323014, "num_tokens": 7230795.0, "step": 3195 }, { "entropy": 5.745355749130249, "epoch": 0.20594671128845413, "grad_norm": 1.0625, "learning_rate": 0.00012462079546224662, "loss": 5.3971, "mean_token_accuracy": 0.1892896667122841, "num_tokens": 7241482.0, "step": 3200 }, { "entropy": 5.890973138809204, "epoch": 0.20626850302484231, "grad_norm": 1.0546875, "learning_rate": 0.00012374653892910896, "loss": 5.4774, "mean_token_accuracy": 0.18707510977983474, "num_tokens": 7252570.0, "step": 3205 }, { "entropy": 5.906987476348877, "epoch": 0.20659029476123053, "grad_norm": 1.1328125, "learning_rate": 0.00012287642908601166, "loss": 5.62, "mean_token_accuracy": 0.17761300653219222, "num_tokens": 7263395.0, "step": 3210 }, { "entropy": 5.839287948608399, "epoch": 0.20691208649761875, "grad_norm": 1.171875, "learning_rate": 0.00012201048978745569, "loss": 5.5295, "mean_token_accuracy": 0.17903399616479873, "num_tokens": 7274945.0, "step": 3215 }, { "entropy": 5.981101179122925, "epoch": 0.20723387823400696, "grad_norm": 1.0390625, "learning_rate": 0.00012114874477360427, "loss": 5.6701, "mean_token_accuracy": 0.17274679839611054, "num_tokens": 7286898.0, "step": 3220 }, { "entropy": 5.879058122634888, "epoch": 0.20755566997039515, "grad_norm": 1.09375, "learning_rate": 0.00012029121766963236, "loss": 5.4366, "mean_token_accuracy": 0.19208965003490447, "num_tokens": 7297031.0, "step": 3225 }, { "entropy": 5.873824977874756, "epoch": 0.20787746170678337, "grad_norm": 1.0390625, "learning_rate": 0.00011943793198507858, "loss": 5.5508, "mean_token_accuracy": 0.18732835948467255, "num_tokens": 7307663.0, "step": 3230 }, { "entropy": 5.769041061401367, "epoch": 0.20819925344317158, "grad_norm": 0.98828125, "learning_rate": 0.00011858891111320104, "loss": 5.4909, "mean_token_accuracy": 0.19473303705453873, "num_tokens": 7318837.0, "step": 3235 }, { "entropy": 5.873802280426025, "epoch": 0.2085210451795598, "grad_norm": 0.97265625, "learning_rate": 0.0001177441783303359, "loss": 5.5724, "mean_token_accuracy": 0.1847960337996483, "num_tokens": 7329743.0, "step": 3240 }, { "entropy": 5.875543260574341, "epoch": 0.208842836915948, "grad_norm": 1.09375, "learning_rate": 0.00011690375679525896, "loss": 5.4628, "mean_token_accuracy": 0.18310353606939317, "num_tokens": 7340519.0, "step": 3245 }, { "entropy": 5.892862749099732, "epoch": 0.2091646286523362, "grad_norm": 1.0546875, "learning_rate": 0.00011606766954855124, "loss": 5.5449, "mean_token_accuracy": 0.17758882343769072, "num_tokens": 7350985.0, "step": 3250 }, { "entropy": 5.764450120925903, "epoch": 0.20948642038872442, "grad_norm": 1.03125, "learning_rate": 0.00011523593951196702, "loss": 5.4263, "mean_token_accuracy": 0.19090569019317627, "num_tokens": 7362074.0, "step": 3255 }, { "entropy": 5.864118337631226, "epoch": 0.20980821212511264, "grad_norm": 0.99609375, "learning_rate": 0.00011440858948780523, "loss": 5.5232, "mean_token_accuracy": 0.1757006824016571, "num_tokens": 7373126.0, "step": 3260 }, { "entropy": 5.922864580154419, "epoch": 0.21013000386150082, "grad_norm": 1.0546875, "learning_rate": 0.00011358564215828484, "loss": 5.6081, "mean_token_accuracy": 0.18327721655368806, "num_tokens": 7384522.0, "step": 3265 }, { "entropy": 5.823661375045776, "epoch": 0.21045179559788904, "grad_norm": 1.1640625, "learning_rate": 0.00011276712008492254, "loss": 5.572, "mean_token_accuracy": 0.17490423023700713, "num_tokens": 7396532.0, "step": 3270 }, { "entropy": 5.952251672744751, "epoch": 0.21077358733427726, "grad_norm": 1.03125, "learning_rate": 0.00011195304570791451, "loss": 5.5754, "mean_token_accuracy": 0.18757580667734147, "num_tokens": 7409001.0, "step": 3275 }, { "entropy": 5.97525463104248, "epoch": 0.21109537907066547, "grad_norm": 1.09375, "learning_rate": 0.00011114344134552094, "loss": 5.6315, "mean_token_accuracy": 0.17529956847429276, "num_tokens": 7421719.0, "step": 3280 }, { "entropy": 5.918738889694214, "epoch": 0.21141717080705366, "grad_norm": 1.046875, "learning_rate": 0.0001103383291934545, "loss": 5.5718, "mean_token_accuracy": 0.1830716013908386, "num_tokens": 7432131.0, "step": 3285 }, { "entropy": 5.812813758850098, "epoch": 0.21173896254344188, "grad_norm": 1.0234375, "learning_rate": 0.00010953773132427141, "loss": 5.4517, "mean_token_accuracy": 0.18206114768981935, "num_tokens": 7444824.0, "step": 3290 }, { "entropy": 5.9485008239746096, "epoch": 0.2120607542798301, "grad_norm": 0.8984375, "learning_rate": 0.00010874166968676677, "loss": 5.6495, "mean_token_accuracy": 0.17474880069494247, "num_tokens": 7455958.0, "step": 3295 }, { "entropy": 5.783841991424561, "epoch": 0.2123825460162183, "grad_norm": 1.078125, "learning_rate": 0.00010795016610537251, "loss": 5.4396, "mean_token_accuracy": 0.18824059665203094, "num_tokens": 7466035.0, "step": 3300 }, { "entropy": 5.857382583618164, "epoch": 0.21270433775260653, "grad_norm": 1.03125, "learning_rate": 0.00010716324227955904, "loss": 5.5283, "mean_token_accuracy": 0.1890411213040352, "num_tokens": 7477489.0, "step": 3305 }, { "entropy": 5.874758720397949, "epoch": 0.21302612948899471, "grad_norm": 1.1171875, "learning_rate": 0.0001063809197832406, "loss": 5.5767, "mean_token_accuracy": 0.18500084131956102, "num_tokens": 7489520.0, "step": 3310 }, { "entropy": 5.837612962722778, "epoch": 0.21334792122538293, "grad_norm": 1.03125, "learning_rate": 0.00010560322006418368, "loss": 5.4569, "mean_token_accuracy": 0.18054204285144806, "num_tokens": 7500187.0, "step": 3315 }, { "entropy": 5.8378080368042, "epoch": 0.21366971296177115, "grad_norm": 1.0078125, "learning_rate": 0.00010483016444341887, "loss": 5.4645, "mean_token_accuracy": 0.187653611600399, "num_tokens": 7511255.0, "step": 3320 }, { "entropy": 5.83314733505249, "epoch": 0.21399150469815936, "grad_norm": 1.125, "learning_rate": 0.00010406177411465654, "loss": 5.4855, "mean_token_accuracy": 0.1830440104007721, "num_tokens": 7522188.0, "step": 3325 }, { "entropy": 5.912123537063598, "epoch": 0.21431329643454755, "grad_norm": 1.03125, "learning_rate": 0.00010329807014370562, "loss": 5.6195, "mean_token_accuracy": 0.16992304623126983, "num_tokens": 7533196.0, "step": 3330 }, { "entropy": 5.912050533294678, "epoch": 0.21463508817093577, "grad_norm": 1.0625, "learning_rate": 0.00010253907346789632, "loss": 5.5307, "mean_token_accuracy": 0.18293344378471374, "num_tokens": 7545304.0, "step": 3335 }, { "entropy": 5.9320460796356205, "epoch": 0.21495687990732398, "grad_norm": 1.1796875, "learning_rate": 0.00010178480489550596, "loss": 5.6412, "mean_token_accuracy": 0.177532659471035, "num_tokens": 7556624.0, "step": 3340 }, { "entropy": 5.875843715667725, "epoch": 0.2152786716437122, "grad_norm": 1.0, "learning_rate": 0.00010103528510518836, "loss": 5.5354, "mean_token_accuracy": 0.17972348332405091, "num_tokens": 7568652.0, "step": 3345 }, { "entropy": 5.872285032272339, "epoch": 0.2156004633801004, "grad_norm": 0.90234375, "learning_rate": 0.0001002905346454073, "loss": 5.5527, "mean_token_accuracy": 0.1870116502046585, "num_tokens": 7580230.0, "step": 3350 }, { "entropy": 5.926315689086914, "epoch": 0.2159222551164886, "grad_norm": 0.984375, "learning_rate": 9.955057393387285e-05, "loss": 5.6141, "mean_token_accuracy": 0.17465776950120926, "num_tokens": 7590542.0, "step": 3355 }, { "entropy": 5.973262643814087, "epoch": 0.21624404685287682, "grad_norm": 0.95703125, "learning_rate": 9.88154232569816e-05, "loss": 5.6678, "mean_token_accuracy": 0.17700689733028413, "num_tokens": 7602251.0, "step": 3360 }, { "entropy": 5.806428146362305, "epoch": 0.21656583858926504, "grad_norm": 1.0625, "learning_rate": 9.808510276926075e-05, "loss": 5.3926, "mean_token_accuracy": 0.18678293079137803, "num_tokens": 7614079.0, "step": 3365 }, { "entropy": 5.818891906738282, "epoch": 0.21688763032565322, "grad_norm": 1.0703125, "learning_rate": 9.735963249281549e-05, "loss": 5.4542, "mean_token_accuracy": 0.18217313438653945, "num_tokens": 7624086.0, "step": 3370 }, { "entropy": 5.817193555831909, "epoch": 0.21720942206204144, "grad_norm": 1.09375, "learning_rate": 9.663903231677974e-05, "loss": 5.5231, "mean_token_accuracy": 0.18047023862600325, "num_tokens": 7634857.0, "step": 3375 }, { "entropy": 5.909766912460327, "epoch": 0.21753121379842966, "grad_norm": 1.109375, "learning_rate": 9.592332199677145e-05, "loss": 5.6074, "mean_token_accuracy": 0.18194021433591842, "num_tokens": 7645518.0, "step": 3380 }, { "entropy": 5.954258298873901, "epoch": 0.21785300553481787, "grad_norm": 1.046875, "learning_rate": 9.521252115435061e-05, "loss": 5.5612, "mean_token_accuracy": 0.18331129252910613, "num_tokens": 7657230.0, "step": 3385 }, { "entropy": 5.846446895599366, "epoch": 0.2181747972712061, "grad_norm": 1.046875, "learning_rate": 9.450664927648126e-05, "loss": 5.425, "mean_token_accuracy": 0.18645530790090561, "num_tokens": 7669001.0, "step": 3390 }, { "entropy": 5.88594617843628, "epoch": 0.21849658900759428, "grad_norm": 1.0234375, "learning_rate": 9.380572571499758e-05, "loss": 5.5063, "mean_token_accuracy": 0.18609150797128676, "num_tokens": 7680980.0, "step": 3395 }, { "entropy": 5.872749519348145, "epoch": 0.2188183807439825, "grad_norm": 1.0625, "learning_rate": 9.310976968607307e-05, "loss": 5.5943, "mean_token_accuracy": 0.18469037413597106, "num_tokens": 7693154.0, "step": 3400 }, { "entropy": 5.821022653579712, "epoch": 0.2191401724803707, "grad_norm": 1.0, "learning_rate": 9.241880026969381e-05, "loss": 5.5143, "mean_token_accuracy": 0.18953799158334733, "num_tokens": 7705265.0, "step": 3405 }, { "entropy": 5.984670877456665, "epoch": 0.21946196421675893, "grad_norm": 1.15625, "learning_rate": 9.173283640913537e-05, "loss": 5.6985, "mean_token_accuracy": 0.171326208114624, "num_tokens": 7717544.0, "step": 3410 }, { "entropy": 5.888324356079101, "epoch": 0.21978375595314711, "grad_norm": 1.1640625, "learning_rate": 9.10518969104436e-05, "loss": 5.5696, "mean_token_accuracy": 0.17949428260326386, "num_tokens": 7728552.0, "step": 3415 }, { "entropy": 5.909794282913208, "epoch": 0.22010554768953533, "grad_norm": 0.97265625, "learning_rate": 9.037600044191868e-05, "loss": 5.4969, "mean_token_accuracy": 0.18646027892827988, "num_tokens": 7739401.0, "step": 3420 }, { "entropy": 5.92853274345398, "epoch": 0.22042733942592355, "grad_norm": 1.1484375, "learning_rate": 8.970516553360383e-05, "loss": 5.5402, "mean_token_accuracy": 0.1896229237318039, "num_tokens": 7750299.0, "step": 3425 }, { "entropy": 5.893253469467163, "epoch": 0.22074913116231176, "grad_norm": 1.0703125, "learning_rate": 8.903941057677692e-05, "loss": 5.5408, "mean_token_accuracy": 0.17954692989587784, "num_tokens": 7762580.0, "step": 3430 }, { "entropy": 5.841103792190552, "epoch": 0.22107092289869995, "grad_norm": 1.0625, "learning_rate": 8.837875382344635e-05, "loss": 5.5036, "mean_token_accuracy": 0.18375125974416734, "num_tokens": 7774676.0, "step": 3435 }, { "entropy": 5.876991271972656, "epoch": 0.22139271463508817, "grad_norm": 1.5078125, "learning_rate": 8.772321338585076e-05, "loss": 5.5259, "mean_token_accuracy": 0.17744357883930206, "num_tokens": 7785608.0, "step": 3440 }, { "entropy": 5.830786180496216, "epoch": 0.22171450637147638, "grad_norm": 1.15625, "learning_rate": 8.707280723596242e-05, "loss": 5.5222, "mean_token_accuracy": 0.18369484543800355, "num_tokens": 7796678.0, "step": 3445 }, { "entropy": 5.865593576431275, "epoch": 0.2220362981078646, "grad_norm": 1.171875, "learning_rate": 8.64275532049944e-05, "loss": 5.5895, "mean_token_accuracy": 0.17828627228736876, "num_tokens": 7808920.0, "step": 3450 }, { "entropy": 5.888166809082032, "epoch": 0.2223580898442528, "grad_norm": 0.96875, "learning_rate": 8.578746898291198e-05, "loss": 5.5333, "mean_token_accuracy": 0.18097131848335266, "num_tokens": 7820040.0, "step": 3455 }, { "entropy": 5.848910999298096, "epoch": 0.222679881580641, "grad_norm": 0.9609375, "learning_rate": 8.515257211794742e-05, "loss": 5.4772, "mean_token_accuracy": 0.1874405950307846, "num_tokens": 7831110.0, "step": 3460 }, { "entropy": 5.953870725631714, "epoch": 0.22300167331702922, "grad_norm": 1.0859375, "learning_rate": 8.452288001611896e-05, "loss": 5.5996, "mean_token_accuracy": 0.17662646919488906, "num_tokens": 7842623.0, "step": 3465 }, { "entropy": 5.82674651145935, "epoch": 0.22332346505341744, "grad_norm": 1.0, "learning_rate": 8.389840994075379e-05, "loss": 5.4787, "mean_token_accuracy": 0.18972781896591187, "num_tokens": 7853023.0, "step": 3470 }, { "entropy": 5.915755844116211, "epoch": 0.22364525678980562, "grad_norm": 1.1328125, "learning_rate": 8.327917901201435e-05, "loss": 5.5104, "mean_token_accuracy": 0.18264812529087066, "num_tokens": 7863955.0, "step": 3475 }, { "entropy": 5.8146192073822025, "epoch": 0.22396704852619384, "grad_norm": 0.9609375, "learning_rate": 8.266520420642931e-05, "loss": 5.4345, "mean_token_accuracy": 0.19198110103607177, "num_tokens": 7874963.0, "step": 3480 }, { "entropy": 5.858565187454223, "epoch": 0.22428884026258206, "grad_norm": 1.1796875, "learning_rate": 8.205650235642828e-05, "loss": 5.4237, "mean_token_accuracy": 0.1872129812836647, "num_tokens": 7885191.0, "step": 3485 }, { "entropy": 5.866080856323242, "epoch": 0.22461063199897027, "grad_norm": 1.2421875, "learning_rate": 8.145309014987978e-05, "loss": 5.6356, "mean_token_accuracy": 0.1818981423974037, "num_tokens": 7897147.0, "step": 3490 }, { "entropy": 5.785593795776367, "epoch": 0.2249324237353585, "grad_norm": 1.046875, "learning_rate": 8.085498412963437e-05, "loss": 5.4388, "mean_token_accuracy": 0.1973276451230049, "num_tokens": 7908009.0, "step": 3495 }, { "entropy": 5.8078258514404295, "epoch": 0.22525421547174668, "grad_norm": 1.0625, "learning_rate": 8.026220069307078e-05, "loss": 5.4282, "mean_token_accuracy": 0.19306470155715943, "num_tokens": 7918333.0, "step": 3500 }, { "entropy": 5.691107273101807, "epoch": 0.2255760072081349, "grad_norm": 0.9453125, "learning_rate": 7.967475609164621e-05, "loss": 5.3431, "mean_token_accuracy": 0.19329609870910644, "num_tokens": 7930100.0, "step": 3505 }, { "entropy": 5.796687126159668, "epoch": 0.2258977989445231, "grad_norm": 1.03125, "learning_rate": 7.909266643045124e-05, "loss": 5.4277, "mean_token_accuracy": 0.1856125757098198, "num_tokens": 7942432.0, "step": 3510 }, { "entropy": 5.887915134429932, "epoch": 0.22621959068091133, "grad_norm": 1.109375, "learning_rate": 7.851594766776802e-05, "loss": 5.5467, "mean_token_accuracy": 0.18213534653186797, "num_tokens": 7952579.0, "step": 3515 }, { "entropy": 5.836985349655151, "epoch": 0.2265413824172995, "grad_norm": 1.0625, "learning_rate": 7.794461561463265e-05, "loss": 5.4811, "mean_token_accuracy": 0.18252092748880386, "num_tokens": 7964467.0, "step": 3520 }, { "entropy": 5.845959854125977, "epoch": 0.22686317415368773, "grad_norm": 0.9765625, "learning_rate": 7.7378685934402e-05, "loss": 5.5323, "mean_token_accuracy": 0.18446663171052932, "num_tokens": 7975815.0, "step": 3525 }, { "entropy": 5.859076261520386, "epoch": 0.22718496589007595, "grad_norm": 1.1171875, "learning_rate": 7.68181741423242e-05, "loss": 5.4754, "mean_token_accuracy": 0.19179448038339614, "num_tokens": 7986616.0, "step": 3530 }, { "entropy": 5.829499626159668, "epoch": 0.22750675762646416, "grad_norm": 1.109375, "learning_rate": 7.626309560511313e-05, "loss": 5.405, "mean_token_accuracy": 0.1907363161444664, "num_tokens": 7996344.0, "step": 3535 }, { "entropy": 5.827304458618164, "epoch": 0.22782854936285235, "grad_norm": 1.0078125, "learning_rate": 7.571346554052724e-05, "loss": 5.5629, "mean_token_accuracy": 0.17748289555311203, "num_tokens": 8009215.0, "step": 3540 }, { "entropy": 5.904195022583008, "epoch": 0.22815034109924057, "grad_norm": 0.91796875, "learning_rate": 7.516929901695249e-05, "loss": 5.5328, "mean_token_accuracy": 0.18616870194673538, "num_tokens": 8020545.0, "step": 3545 }, { "entropy": 5.896491050720215, "epoch": 0.22847213283562878, "grad_norm": 1.0859375, "learning_rate": 7.463061095298893e-05, "loss": 5.5756, "mean_token_accuracy": 0.17682287245988845, "num_tokens": 8031068.0, "step": 3550 }, { "entropy": 5.866166591644287, "epoch": 0.228793924572017, "grad_norm": 0.984375, "learning_rate": 7.409741611704198e-05, "loss": 5.5163, "mean_token_accuracy": 0.1917043536901474, "num_tokens": 8043141.0, "step": 3555 }, { "entropy": 5.8629930973052975, "epoch": 0.2291157163084052, "grad_norm": 1.109375, "learning_rate": 7.35697291269174e-05, "loss": 5.5513, "mean_token_accuracy": 0.18674294352531434, "num_tokens": 8053574.0, "step": 3560 }, { "entropy": 5.855707502365112, "epoch": 0.2294375080447934, "grad_norm": 1.1015625, "learning_rate": 7.304756444942056e-05, "loss": 5.513, "mean_token_accuracy": 0.18033841848373414, "num_tokens": 8065551.0, "step": 3565 }, { "entropy": 5.793723726272583, "epoch": 0.22975929978118162, "grad_norm": 1.1171875, "learning_rate": 7.253093639995994e-05, "loss": 5.3816, "mean_token_accuracy": 0.1940824195742607, "num_tokens": 8076137.0, "step": 3570 }, { "entropy": 5.833936023712158, "epoch": 0.23008109151756984, "grad_norm": 1.015625, "learning_rate": 7.20198591421544e-05, "loss": 5.4556, "mean_token_accuracy": 0.1838522344827652, "num_tokens": 8087512.0, "step": 3575 }, { "entropy": 5.801386976242066, "epoch": 0.23040288325395805, "grad_norm": 1.046875, "learning_rate": 7.151434668744517e-05, "loss": 5.4308, "mean_token_accuracy": 0.1907702773809433, "num_tokens": 8099847.0, "step": 3580 }, { "entropy": 5.791101741790771, "epoch": 0.23072467499034624, "grad_norm": 1.1171875, "learning_rate": 7.101441289471153e-05, "loss": 5.4324, "mean_token_accuracy": 0.1796442225575447, "num_tokens": 8110859.0, "step": 3585 }, { "entropy": 5.8158985614776615, "epoch": 0.23104646672673446, "grad_norm": 0.95703125, "learning_rate": 7.052007146989098e-05, "loss": 5.4714, "mean_token_accuracy": 0.19363839328289031, "num_tokens": 8123036.0, "step": 3590 }, { "entropy": 5.937212896347046, "epoch": 0.23136825846312267, "grad_norm": 1.03125, "learning_rate": 7.003133596560341e-05, "loss": 5.5961, "mean_token_accuracy": 0.18883911967277528, "num_tokens": 8135041.0, "step": 3595 }, { "entropy": 5.848029327392578, "epoch": 0.2316900501995109, "grad_norm": 0.9765625, "learning_rate": 6.954821978077952e-05, "loss": 5.4632, "mean_token_accuracy": 0.18244886100292207, "num_tokens": 8146033.0, "step": 3600 }, { "entropy": 5.83494873046875, "epoch": 0.23201184193589908, "grad_norm": 1.0703125, "learning_rate": 6.907073616029356e-05, "loss": 5.4766, "mean_token_accuracy": 0.18512548357248307, "num_tokens": 8158174.0, "step": 3605 }, { "entropy": 5.773124933242798, "epoch": 0.2323336336722873, "grad_norm": 1.0, "learning_rate": 6.85988981946002e-05, "loss": 5.3802, "mean_token_accuracy": 0.20617621392011642, "num_tokens": 8169973.0, "step": 3610 }, { "entropy": 5.805305433273316, "epoch": 0.2326554254086755, "grad_norm": 1.0859375, "learning_rate": 6.813271881937564e-05, "loss": 5.5454, "mean_token_accuracy": 0.18058131486177445, "num_tokens": 8180523.0, "step": 3615 }, { "entropy": 5.8076698780059814, "epoch": 0.23297721714506373, "grad_norm": 1.1171875, "learning_rate": 6.767221081516286e-05, "loss": 5.5025, "mean_token_accuracy": 0.1805886596441269, "num_tokens": 8192432.0, "step": 3620 }, { "entropy": 5.897102975845337, "epoch": 0.2332990088814519, "grad_norm": 1.078125, "learning_rate": 6.72173868070215e-05, "loss": 5.5219, "mean_token_accuracy": 0.1783463850617409, "num_tokens": 8202541.0, "step": 3625 }, { "entropy": 5.881675863265992, "epoch": 0.23362080061784013, "grad_norm": 1.0859375, "learning_rate": 6.676825926418149e-05, "loss": 5.5682, "mean_token_accuracy": 0.18399205058813095, "num_tokens": 8214135.0, "step": 3630 }, { "entropy": 5.97842493057251, "epoch": 0.23394259235422835, "grad_norm": 1.0078125, "learning_rate": 6.632484049970122e-05, "loss": 5.6224, "mean_token_accuracy": 0.17328175008296967, "num_tokens": 8226627.0, "step": 3635 }, { "entropy": 5.904000282287598, "epoch": 0.23426438409061656, "grad_norm": 1.109375, "learning_rate": 6.588714267013019e-05, "loss": 5.5723, "mean_token_accuracy": 0.18750276565551757, "num_tokens": 8237220.0, "step": 3640 }, { "entropy": 5.900056171417236, "epoch": 0.23458617582700475, "grad_norm": 1.03125, "learning_rate": 6.545517777517544e-05, "loss": 5.4598, "mean_token_accuracy": 0.18794340938329696, "num_tokens": 8247806.0, "step": 3645 }, { "entropy": 5.921839237213135, "epoch": 0.23490796756339297, "grad_norm": 0.97265625, "learning_rate": 6.502895765737281e-05, "loss": 5.646, "mean_token_accuracy": 0.16717544943094254, "num_tokens": 8258753.0, "step": 3650 }, { "entropy": 5.85217809677124, "epoch": 0.23522975929978118, "grad_norm": 1.0703125, "learning_rate": 6.460849400176212e-05, "loss": 5.4838, "mean_token_accuracy": 0.19553759396076204, "num_tokens": 8269471.0, "step": 3655 }, { "entropy": 5.8111412048339846, "epoch": 0.2355515510361694, "grad_norm": 1.0703125, "learning_rate": 6.419379833556694e-05, "loss": 5.4542, "mean_token_accuracy": 0.1805116802453995, "num_tokens": 8280947.0, "step": 3660 }, { "entropy": 5.967441463470459, "epoch": 0.2358733427725576, "grad_norm": 1.046875, "learning_rate": 6.378488202787835e-05, "loss": 5.6255, "mean_token_accuracy": 0.17437933683395385, "num_tokens": 8292147.0, "step": 3665 }, { "entropy": 5.8611243724822994, "epoch": 0.2361951345089458, "grad_norm": 1.1328125, "learning_rate": 6.33817562893435e-05, "loss": 5.4958, "mean_token_accuracy": 0.18083027452230455, "num_tokens": 8303576.0, "step": 3670 }, { "entropy": 5.804196071624756, "epoch": 0.23651692624533402, "grad_norm": 1.0234375, "learning_rate": 6.29844321718582e-05, "loss": 5.4077, "mean_token_accuracy": 0.19199006259441376, "num_tokens": 8315394.0, "step": 3675 }, { "entropy": 5.814148235321045, "epoch": 0.23683871798172224, "grad_norm": 0.9765625, "learning_rate": 6.259292056826383e-05, "loss": 5.4701, "mean_token_accuracy": 0.18672968745231627, "num_tokens": 8326882.0, "step": 3680 }, { "entropy": 5.9093386173248295, "epoch": 0.23716050971811045, "grad_norm": 1.09375, "learning_rate": 6.220723221204873e-05, "loss": 5.5248, "mean_token_accuracy": 0.18191382735967637, "num_tokens": 8337883.0, "step": 3685 }, { "entropy": 5.81709303855896, "epoch": 0.23748230145449864, "grad_norm": 1.0234375, "learning_rate": 6.182737767705406e-05, "loss": 5.4634, "mean_token_accuracy": 0.19276946187019348, "num_tokens": 8349206.0, "step": 3690 }, { "entropy": 5.911470508575439, "epoch": 0.23780409319088686, "grad_norm": 1.171875, "learning_rate": 6.145336737718375e-05, "loss": 5.5225, "mean_token_accuracy": 0.18158401399850846, "num_tokens": 8359122.0, "step": 3695 }, { "entropy": 5.839365768432617, "epoch": 0.23812588492727507, "grad_norm": 1.265625, "learning_rate": 6.10852115661191e-05, "loss": 5.4716, "mean_token_accuracy": 0.185002900660038, "num_tokens": 8370311.0, "step": 3700 }, { "entropy": 5.8063208103179935, "epoch": 0.2384476766636633, "grad_norm": 1.046875, "learning_rate": 6.072292033703766e-05, "loss": 5.5295, "mean_token_accuracy": 0.18325390815734863, "num_tokens": 8381721.0, "step": 3705 }, { "entropy": 5.807907390594482, "epoch": 0.23876946840005148, "grad_norm": 1.109375, "learning_rate": 6.036650362233648e-05, "loss": 5.4617, "mean_token_accuracy": 0.1898002117872238, "num_tokens": 8392961.0, "step": 3710 }, { "entropy": 5.819514799118042, "epoch": 0.2390912601364397, "grad_norm": 1.0546875, "learning_rate": 6.0015971193359824e-05, "loss": 5.433, "mean_token_accuracy": 0.18644566535949708, "num_tokens": 8403702.0, "step": 3715 }, { "entropy": 5.821524620056152, "epoch": 0.2394130518728279, "grad_norm": 1.09375, "learning_rate": 5.9671332660131306e-05, "loss": 5.4015, "mean_token_accuracy": 0.18333297669887544, "num_tokens": 8414253.0, "step": 3720 }, { "entropy": 5.765598297119141, "epoch": 0.23973484360921613, "grad_norm": 1.0703125, "learning_rate": 5.933259747109042e-05, "loss": 5.419, "mean_token_accuracy": 0.19855114966630935, "num_tokens": 8425835.0, "step": 3725 }, { "entropy": 5.802558517456054, "epoch": 0.2400566353456043, "grad_norm": 1.21875, "learning_rate": 5.899977491283351e-05, "loss": 5.4871, "mean_token_accuracy": 0.18867317289114, "num_tokens": 8438172.0, "step": 3730 }, { "entropy": 5.833559465408325, "epoch": 0.24037842708199253, "grad_norm": 1.046875, "learning_rate": 5.867287410985908e-05, "loss": 5.4889, "mean_token_accuracy": 0.18983418345451356, "num_tokens": 8449455.0, "step": 3735 }, { "entropy": 5.889695739746093, "epoch": 0.24070021881838075, "grad_norm": 1.1015625, "learning_rate": 5.835190402431779e-05, "loss": 5.5791, "mean_token_accuracy": 0.17455105632543563, "num_tokens": 8460527.0, "step": 3740 }, { "entropy": 5.918327569961548, "epoch": 0.24102201055476896, "grad_norm": 1.1171875, "learning_rate": 5.803687345576673e-05, "loss": 5.5972, "mean_token_accuracy": 0.1712761864066124, "num_tokens": 8471905.0, "step": 3745 }, { "entropy": 5.866776943206787, "epoch": 0.24134380229115715, "grad_norm": 1.0, "learning_rate": 5.7727791040927977e-05, "loss": 5.5857, "mean_token_accuracy": 0.17733631283044815, "num_tokens": 8484749.0, "step": 3750 }, { "entropy": 5.882266855239868, "epoch": 0.24166559402754537, "grad_norm": 1.1171875, "learning_rate": 5.742466525345213e-05, "loss": 5.465, "mean_token_accuracy": 0.18764821588993072, "num_tokens": 8497525.0, "step": 3755 }, { "entropy": 5.908596467971802, "epoch": 0.24198738576393358, "grad_norm": 0.97265625, "learning_rate": 5.7127504403685775e-05, "loss": 5.4265, "mean_token_accuracy": 0.1865800365805626, "num_tokens": 8509741.0, "step": 3760 }, { "entropy": 5.812527656555176, "epoch": 0.2423091775003218, "grad_norm": 1.046875, "learning_rate": 5.6836316638443664e-05, "loss": 5.4091, "mean_token_accuracy": 0.18121858835220336, "num_tokens": 8521118.0, "step": 3765 }, { "entropy": 5.872166967391967, "epoch": 0.24263096923671001, "grad_norm": 1.109375, "learning_rate": 5.655110994078553e-05, "loss": 5.489, "mean_token_accuracy": 0.18178592175245284, "num_tokens": 8532884.0, "step": 3770 }, { "entropy": 5.889322233200073, "epoch": 0.2429527609730982, "grad_norm": 1.0234375, "learning_rate": 5.6271892129797056e-05, "loss": 5.5232, "mean_token_accuracy": 0.18541510552167892, "num_tokens": 8544464.0, "step": 3775 }, { "entropy": 5.840616655349732, "epoch": 0.24327455270948642, "grad_norm": 1.0390625, "learning_rate": 5.599867086037556e-05, "loss": 5.5378, "mean_token_accuracy": 0.183778777718544, "num_tokens": 8556095.0, "step": 3780 }, { "entropy": 5.962187910079956, "epoch": 0.24359634444587464, "grad_norm": 1.0859375, "learning_rate": 5.573145362302012e-05, "loss": 5.6441, "mean_token_accuracy": 0.18180414736270906, "num_tokens": 8568040.0, "step": 3785 }, { "entropy": 5.901077747344971, "epoch": 0.24391813618226285, "grad_norm": 1.078125, "learning_rate": 5.5470247743626404e-05, "loss": 5.5782, "mean_token_accuracy": 0.18014889508485793, "num_tokens": 8580053.0, "step": 3790 }, { "entropy": 5.906141519546509, "epoch": 0.24423992791865104, "grad_norm": 1.140625, "learning_rate": 5.5215060383285414e-05, "loss": 5.6635, "mean_token_accuracy": 0.17005731612443925, "num_tokens": 8591204.0, "step": 3795 }, { "entropy": 5.881397724151611, "epoch": 0.24456171965503926, "grad_norm": 1.3046875, "learning_rate": 5.496589853808759e-05, "loss": 5.4992, "mean_token_accuracy": 0.183411106467247, "num_tokens": 8603198.0, "step": 3800 }, { "entropy": 5.917575120925903, "epoch": 0.24488351139142747, "grad_norm": 1.1171875, "learning_rate": 5.47227690389308e-05, "loss": 5.5862, "mean_token_accuracy": 0.18081898093223572, "num_tokens": 8614424.0, "step": 3805 }, { "entropy": 5.886398124694824, "epoch": 0.2452053031278157, "grad_norm": 1.09375, "learning_rate": 5.448567855133306e-05, "loss": 5.5211, "mean_token_accuracy": 0.18825747072696686, "num_tokens": 8625077.0, "step": 3810 }, { "entropy": 5.7899988174438475, "epoch": 0.24552709486420388, "grad_norm": 1.03125, "learning_rate": 5.425463357524986e-05, "loss": 5.4157, "mean_token_accuracy": 0.19347634315490722, "num_tokens": 8635512.0, "step": 3815 }, { "entropy": 5.87456521987915, "epoch": 0.2458488866005921, "grad_norm": 1.1171875, "learning_rate": 5.402964044489591e-05, "loss": 5.5157, "mean_token_accuracy": 0.18086836785078048, "num_tokens": 8646556.0, "step": 3820 }, { "entropy": 5.875141429901123, "epoch": 0.2461706783369803, "grad_norm": 1.078125, "learning_rate": 5.381070532857153e-05, "loss": 5.4601, "mean_token_accuracy": 0.18676195442676544, "num_tokens": 8657183.0, "step": 3825 }, { "entropy": 5.806210708618164, "epoch": 0.24649247007336852, "grad_norm": 1.0625, "learning_rate": 5.359783422849357e-05, "loss": 5.416, "mean_token_accuracy": 0.1874628782272339, "num_tokens": 8667341.0, "step": 3830 }, { "entropy": 5.880856037139893, "epoch": 0.2468142618097567, "grad_norm": 1.1328125, "learning_rate": 5.3391032980630736e-05, "loss": 5.5686, "mean_token_accuracy": 0.17702104300260543, "num_tokens": 8676918.0, "step": 3835 }, { "entropy": 5.840644454956054, "epoch": 0.24713605354614493, "grad_norm": 1.171875, "learning_rate": 5.31903072545437e-05, "loss": 5.4554, "mean_token_accuracy": 0.18176550567150115, "num_tokens": 8686597.0, "step": 3840 }, { "entropy": 5.956066513061524, "epoch": 0.24745784528253315, "grad_norm": 1.109375, "learning_rate": 5.29956625532297e-05, "loss": 5.6569, "mean_token_accuracy": 0.1792938932776451, "num_tokens": 8697736.0, "step": 3845 }, { "entropy": 5.861971759796143, "epoch": 0.24777963701892136, "grad_norm": 1.125, "learning_rate": 5.280710421297146e-05, "loss": 5.4264, "mean_token_accuracy": 0.18477146476507186, "num_tokens": 8708326.0, "step": 3850 }, { "entropy": 5.8378222465515135, "epoch": 0.24810142875530955, "grad_norm": 1.1640625, "learning_rate": 5.2624637403191165e-05, "loss": 5.4401, "mean_token_accuracy": 0.18861131519079208, "num_tokens": 8718710.0, "step": 3855 }, { "entropy": 5.848637390136719, "epoch": 0.24842322049169777, "grad_norm": 1.0546875, "learning_rate": 5.2448267126308605e-05, "loss": 5.5713, "mean_token_accuracy": 0.18623795509338378, "num_tokens": 8730401.0, "step": 3860 }, { "entropy": 5.837208890914917, "epoch": 0.24874501222808598, "grad_norm": 1.1796875, "learning_rate": 5.2277998217603954e-05, "loss": 5.4749, "mean_token_accuracy": 0.18589100539684295, "num_tokens": 8741741.0, "step": 3865 }, { "entropy": 5.826093864440918, "epoch": 0.2490668039644742, "grad_norm": 1.109375, "learning_rate": 5.211383534508541e-05, "loss": 5.5117, "mean_token_accuracy": 0.18893371075391768, "num_tokens": 8752778.0, "step": 3870 }, { "entropy": 5.858719205856323, "epoch": 0.24938859570086241, "grad_norm": 1.015625, "learning_rate": 5.1955783009361044e-05, "loss": 5.4076, "mean_token_accuracy": 0.18982426524162294, "num_tokens": 8763989.0, "step": 3875 }, { "entropy": 5.926633071899414, "epoch": 0.2497103874372506, "grad_norm": 1.1875, "learning_rate": 5.180384554351543e-05, "loss": 5.59, "mean_token_accuracy": 0.18338559120893477, "num_tokens": 8774653.0, "step": 3880 }, { "entropy": 5.85729570388794, "epoch": 0.25003217917363885, "grad_norm": 1.078125, "learning_rate": 5.1658027112990976e-05, "loss": 5.5475, "mean_token_accuracy": 0.17583149820566177, "num_tokens": 8785616.0, "step": 3885 }, { "entropy": 5.8654481887817385, "epoch": 0.25035397091002703, "grad_norm": 0.9921875, "learning_rate": 5.151833171547365e-05, "loss": 5.4912, "mean_token_accuracy": 0.1948844775557518, "num_tokens": 8797355.0, "step": 3890 }, { "entropy": 5.8619709491729735, "epoch": 0.2506757626464152, "grad_norm": 0.9765625, "learning_rate": 5.1384763180783274e-05, "loss": 5.4638, "mean_token_accuracy": 0.18409107029438018, "num_tokens": 8809781.0, "step": 3895 }, { "entropy": 5.886050701141357, "epoch": 0.25099755438280347, "grad_norm": 0.98046875, "learning_rate": 5.125732517076876e-05, "loss": 5.5335, "mean_token_accuracy": 0.18121555596590042, "num_tokens": 8822343.0, "step": 3900 }, { "entropy": 5.946103477478028, "epoch": 0.25131934611919166, "grad_norm": 1.1953125, "learning_rate": 5.113602117920747e-05, "loss": 5.5927, "mean_token_accuracy": 0.18355872929096223, "num_tokens": 8832853.0, "step": 3905 }, { "entropy": 5.931288146972657, "epoch": 0.25164113785557984, "grad_norm": 0.93359375, "learning_rate": 5.102085453170966e-05, "loss": 5.552, "mean_token_accuracy": 0.18227896988391876, "num_tokens": 8844854.0, "step": 3910 }, { "entropy": 5.886366128921509, "epoch": 0.2519629295919681, "grad_norm": 0.9921875, "learning_rate": 5.091182838562709e-05, "loss": 5.5352, "mean_token_accuracy": 0.18576465547084808, "num_tokens": 8856757.0, "step": 3915 }, { "entropy": 5.7899425506591795, "epoch": 0.2522847213283563, "grad_norm": 1.0078125, "learning_rate": 5.0808945729966716e-05, "loss": 5.4261, "mean_token_accuracy": 0.19099750816822053, "num_tokens": 8868442.0, "step": 3920 }, { "entropy": 5.8660125732421875, "epoch": 0.2526065130647445, "grad_norm": 1.0546875, "learning_rate": 5.071220938530844e-05, "loss": 5.5441, "mean_token_accuracy": 0.18268707096576692, "num_tokens": 8880843.0, "step": 3925 }, { "entropy": 5.87365837097168, "epoch": 0.2529283048011327, "grad_norm": 1.0390625, "learning_rate": 5.0621622003728026e-05, "loss": 5.5324, "mean_token_accuracy": 0.181501904129982, "num_tokens": 8891822.0, "step": 3930 }, { "entropy": 5.848757600784301, "epoch": 0.2532500965375209, "grad_norm": 1.0859375, "learning_rate": 5.053718606872433e-05, "loss": 5.4551, "mean_token_accuracy": 0.18650377690792083, "num_tokens": 8902471.0, "step": 3935 }, { "entropy": 5.8239062309265135, "epoch": 0.25357188827390914, "grad_norm": 1.125, "learning_rate": 5.0458903895151134e-05, "loss": 5.4227, "mean_token_accuracy": 0.1972977876663208, "num_tokens": 8913936.0, "step": 3940 }, { "entropy": 5.9369893074035645, "epoch": 0.25389368001029733, "grad_norm": 1.078125, "learning_rate": 5.038677762915381e-05, "loss": 5.665, "mean_token_accuracy": 0.17409342527389526, "num_tokens": 8924839.0, "step": 3945 }, { "entropy": 5.825077629089355, "epoch": 0.2542154717466855, "grad_norm": 1.015625, "learning_rate": 5.032080924811033e-05, "loss": 5.4643, "mean_token_accuracy": 0.192131507396698, "num_tokens": 8937216.0, "step": 3950 }, { "entropy": 5.879704713821411, "epoch": 0.25453726348307376, "grad_norm": 1.0234375, "learning_rate": 5.026100056057718e-05, "loss": 5.5395, "mean_token_accuracy": 0.18439568430185319, "num_tokens": 8948895.0, "step": 3955 }, { "entropy": 5.8793802738189695, "epoch": 0.25485905521946195, "grad_norm": 0.95703125, "learning_rate": 5.0207353206239764e-05, "loss": 5.5196, "mean_token_accuracy": 0.18757179677486419, "num_tokens": 8959857.0, "step": 3960 }, { "entropy": 5.950325298309326, "epoch": 0.2551808469558502, "grad_norm": 1.1796875, "learning_rate": 5.0159868655867436e-05, "loss": 5.6355, "mean_token_accuracy": 0.1762540727853775, "num_tokens": 8971640.0, "step": 3965 }, { "entropy": 5.855899477005005, "epoch": 0.2555026386922384, "grad_norm": 0.94140625, "learning_rate": 5.011854821127305e-05, "loss": 5.4783, "mean_token_accuracy": 0.18423963487148284, "num_tokens": 8984153.0, "step": 3970 }, { "entropy": 5.85833625793457, "epoch": 0.25582443042862657, "grad_norm": 1.0703125, "learning_rate": 5.008339300527755e-05, "loss": 5.4935, "mean_token_accuracy": 0.19293161183595658, "num_tokens": 8995086.0, "step": 3975 }, { "entropy": 5.920580863952637, "epoch": 0.2561462221650148, "grad_norm": 1.2421875, "learning_rate": 5.005440400167859e-05, "loss": 5.58, "mean_token_accuracy": 0.1857178896665573, "num_tokens": 9006263.0, "step": 3980 }, { "entropy": 5.913726425170898, "epoch": 0.256468013901403, "grad_norm": 1.09375, "learning_rate": 5.003158199522442e-05, "loss": 5.541, "mean_token_accuracy": 0.18821442872285843, "num_tokens": 9016570.0, "step": 3985 }, { "entropy": 5.840539073944091, "epoch": 0.25678980563779125, "grad_norm": 1.0546875, "learning_rate": 5.0014927611591806e-05, "loss": 5.4786, "mean_token_accuracy": 0.18800519406795502, "num_tokens": 9027996.0, "step": 3990 }, { "entropy": 5.791767215728759, "epoch": 0.25711159737417943, "grad_norm": 1.125, "learning_rate": 5.000444130736916e-05, "loss": 5.4354, "mean_token_accuracy": 0.18821485042572023, "num_tokens": 9038295.0, "step": 3995 }, { "entropy": 5.80820107460022, "epoch": 0.2574333891105676, "grad_norm": 1.1015625, "learning_rate": 5.0000123370043736e-05, "loss": 5.4058, "mean_token_accuracy": 0.19184701889753342, "num_tokens": 9048381.0, "step": 4000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2123139304488960.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }