{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.03217917363882095, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742555713653564, "epoch": 0.00032179173638820956, "grad_norm": 4.59375, "learning_rate": 2e-06, "loss": 10.7932, "mean_token_accuracy": 9.85221704468131e-05, "num_tokens": 11506.0, "step": 5 }, { "entropy": 10.742585468292237, "epoch": 0.0006435834727764191, "grad_norm": 5.0, "learning_rate": 4.5e-06, "loss": 10.7664, "mean_token_accuracy": 7.942811935208738e-05, "num_tokens": 21973.0, "step": 10 }, { "entropy": 10.742585182189941, "epoch": 0.0009653752091646286, "grad_norm": 4.6875, "learning_rate": 7e-06, "loss": 10.7473, "mean_token_accuracy": 0.0, "num_tokens": 32763.0, "step": 15 }, { "entropy": 10.742647171020508, "epoch": 0.0012871669455528382, "grad_norm": 4.5, "learning_rate": 9.5e-06, "loss": 10.716, "mean_token_accuracy": 0.00042943707667291163, "num_tokens": 44354.0, "step": 20 }, { "entropy": 10.742597675323486, "epoch": 0.0016089586819410479, "grad_norm": 4.375, "learning_rate": 1.2e-05, "loss": 10.6219, "mean_token_accuracy": 0.0008890067110769451, "num_tokens": 56534.0, "step": 25 }, { "entropy": 10.74241762161255, "epoch": 0.0019307504183292573, "grad_norm": 3.859375, "learning_rate": 1.4500000000000002e-05, "loss": 10.4911, "mean_token_accuracy": 0.009375615860335529, "num_tokens": 67106.0, "step": 30 }, { "entropy": 10.741784954071045, "epoch": 0.002252542154717467, "grad_norm": 3.265625, "learning_rate": 1.7000000000000003e-05, "loss": 10.3831, "mean_token_accuracy": 0.021833056677132846, "num_tokens": 78801.0, "step": 35 }, { "entropy": 10.74044713973999, "epoch": 0.0025743338911056765, "grad_norm": 2.53125, "learning_rate": 1.95e-05, "loss": 10.2405, "mean_token_accuracy": 0.028899907879531384, "num_tokens": 90390.0, "step": 40 }, { "entropy": 10.738579750061035, "epoch": 0.002896125627493886, "grad_norm": 2.265625, "learning_rate": 2.2e-05, "loss": 10.1128, "mean_token_accuracy": 0.036285107396543025, "num_tokens": 101652.0, "step": 45 }, { "entropy": 10.737388038635254, "epoch": 0.0032179173638820957, "grad_norm": 2.0625, "learning_rate": 2.4500000000000003e-05, "loss": 10.0384, "mean_token_accuracy": 0.03730290364474058, "num_tokens": 112068.0, "step": 50 }, { "entropy": 10.737480354309081, "epoch": 0.003539709100270305, "grad_norm": 1.90625, "learning_rate": 2.7e-05, "loss": 10.0098, "mean_token_accuracy": 0.04103992246091366, "num_tokens": 123500.0, "step": 55 }, { "entropy": 10.736884212493896, "epoch": 0.0038615008366585145, "grad_norm": 1.9296875, "learning_rate": 2.95e-05, "loss": 9.9544, "mean_token_accuracy": 0.0359757786616683, "num_tokens": 134456.0, "step": 60 }, { "entropy": 10.7358078956604, "epoch": 0.004183292573046725, "grad_norm": 1.765625, "learning_rate": 3.2e-05, "loss": 9.9017, "mean_token_accuracy": 0.03450035620480776, "num_tokens": 146299.0, "step": 65 }, { "entropy": 10.734182739257813, "epoch": 0.004505084309434934, "grad_norm": 1.9375, "learning_rate": 3.4500000000000005e-05, "loss": 9.8076, "mean_token_accuracy": 0.037839466519653794, "num_tokens": 157494.0, "step": 70 }, { "entropy": 10.73177366256714, "epoch": 0.004826876045823143, "grad_norm": 1.7734375, "learning_rate": 3.7e-05, "loss": 9.7775, "mean_token_accuracy": 0.03611580468714237, "num_tokens": 168226.0, "step": 75 }, { "entropy": 10.728845882415772, "epoch": 0.005148667782211353, "grad_norm": 1.9296875, "learning_rate": 3.95e-05, "loss": 9.6556, "mean_token_accuracy": 0.04190883524715901, "num_tokens": 179311.0, "step": 80 }, { "entropy": 10.725195121765136, "epoch": 0.005470459518599562, "grad_norm": 1.7421875, "learning_rate": 4.2000000000000004e-05, "loss": 9.6267, "mean_token_accuracy": 0.043489571660757065, "num_tokens": 191513.0, "step": 85 }, { "entropy": 10.719332885742187, "epoch": 0.005792251254987772, "grad_norm": 1.8828125, "learning_rate": 4.45e-05, "loss": 9.5397, "mean_token_accuracy": 0.046276621893048285, "num_tokens": 204631.0, "step": 90 }, { "entropy": 10.710766220092774, "epoch": 0.006114042991375981, "grad_norm": 1.7578125, "learning_rate": 4.7000000000000004e-05, "loss": 9.4486, "mean_token_accuracy": 0.0460438147187233, "num_tokens": 215901.0, "step": 95 }, { "entropy": 10.69977626800537, "epoch": 0.0064358347277641914, "grad_norm": 1.8203125, "learning_rate": 4.9500000000000004e-05, "loss": 9.4013, "mean_token_accuracy": 0.044720832630991934, "num_tokens": 228928.0, "step": 100 }, { "entropy": 10.685317134857177, "epoch": 0.006757626464152401, "grad_norm": 1.765625, "learning_rate": 5.2e-05, "loss": 9.3138, "mean_token_accuracy": 0.044154060259461406, "num_tokens": 241543.0, "step": 105 }, { "entropy": 10.66606101989746, "epoch": 0.00707941820054061, "grad_norm": 1.8203125, "learning_rate": 5.45e-05, "loss": 9.1466, "mean_token_accuracy": 0.046302244812250135, "num_tokens": 253267.0, "step": 110 }, { "entropy": 10.636186695098877, "epoch": 0.00740120993692882, "grad_norm": 1.78125, "learning_rate": 5.7e-05, "loss": 9.0141, "mean_token_accuracy": 0.05802988223731518, "num_tokens": 264760.0, "step": 115 }, { "entropy": 10.5947696685791, "epoch": 0.007723001673317029, "grad_norm": 1.75, "learning_rate": 5.9499999999999996e-05, "loss": 8.9075, "mean_token_accuracy": 0.051640312373638156, "num_tokens": 275080.0, "step": 120 }, { "entropy": 10.542396450042725, "epoch": 0.008044793409705238, "grad_norm": 1.7109375, "learning_rate": 6.2e-05, "loss": 8.7919, "mean_token_accuracy": 0.05795170105993748, "num_tokens": 287114.0, "step": 125 }, { "entropy": 10.490421962738036, "epoch": 0.00836658514609345, "grad_norm": 1.6796875, "learning_rate": 6.450000000000001e-05, "loss": 8.6367, "mean_token_accuracy": 0.06025359183549881, "num_tokens": 298732.0, "step": 130 }, { "entropy": 10.417353057861328, "epoch": 0.008688376882481658, "grad_norm": 1.65625, "learning_rate": 6.7e-05, "loss": 8.4641, "mean_token_accuracy": 0.06998355574905872, "num_tokens": 310227.0, "step": 135 }, { "entropy": 10.32230224609375, "epoch": 0.009010168618869868, "grad_norm": 1.4765625, "learning_rate": 6.950000000000001e-05, "loss": 8.3943, "mean_token_accuracy": 0.06697470992803574, "num_tokens": 322724.0, "step": 140 }, { "entropy": 10.228569889068604, "epoch": 0.009331960355258077, "grad_norm": 1.4375, "learning_rate": 7.2e-05, "loss": 8.3137, "mean_token_accuracy": 0.06024596691131592, "num_tokens": 335638.0, "step": 145 }, { "entropy": 10.116732311248779, "epoch": 0.009653752091646286, "grad_norm": 1.453125, "learning_rate": 7.45e-05, "loss": 8.1548, "mean_token_accuracy": 0.07251053638756275, "num_tokens": 346751.0, "step": 150 }, { "entropy": 9.953464126586914, "epoch": 0.009975543828034497, "grad_norm": 1.3359375, "learning_rate": 7.7e-05, "loss": 8.0894, "mean_token_accuracy": 0.07281172573566437, "num_tokens": 357809.0, "step": 155 }, { "entropy": 9.77461576461792, "epoch": 0.010297335564422706, "grad_norm": 1.21875, "learning_rate": 7.950000000000001e-05, "loss": 7.9142, "mean_token_accuracy": 0.06864561475813388, "num_tokens": 369631.0, "step": 160 }, { "entropy": 9.603110790252686, "epoch": 0.010619127300810915, "grad_norm": 1.0390625, "learning_rate": 8.2e-05, "loss": 7.9575, "mean_token_accuracy": 0.06908577904105187, "num_tokens": 380904.0, "step": 165 }, { "entropy": 9.377412414550781, "epoch": 0.010940919037199124, "grad_norm": 1.125, "learning_rate": 8.450000000000001e-05, "loss": 7.7359, "mean_token_accuracy": 0.07545260861515998, "num_tokens": 392898.0, "step": 170 }, { "entropy": 9.168265438079834, "epoch": 0.011262710773587334, "grad_norm": 1.125, "learning_rate": 8.7e-05, "loss": 7.6702, "mean_token_accuracy": 0.07459548935294151, "num_tokens": 404285.0, "step": 175 }, { "entropy": 8.926816463470459, "epoch": 0.011584502509975544, "grad_norm": 1.0, "learning_rate": 8.95e-05, "loss": 7.5717, "mean_token_accuracy": 0.07761912979185581, "num_tokens": 416443.0, "step": 180 }, { "entropy": 8.745314025878907, "epoch": 0.011906294246363754, "grad_norm": 0.96875, "learning_rate": 9.2e-05, "loss": 7.6426, "mean_token_accuracy": 0.0765433344990015, "num_tokens": 426558.0, "step": 185 }, { "entropy": 8.587053394317627, "epoch": 0.012228085982751963, "grad_norm": 1.1796875, "learning_rate": 9.45e-05, "loss": 7.6648, "mean_token_accuracy": 0.07643079459667206, "num_tokens": 437794.0, "step": 190 }, { "entropy": 8.517185878753661, "epoch": 0.012549877719140172, "grad_norm": 1.0546875, "learning_rate": 9.7e-05, "loss": 7.4958, "mean_token_accuracy": 0.07788795456290246, "num_tokens": 448682.0, "step": 195 }, { "entropy": 8.376048374176026, "epoch": 0.012871669455528383, "grad_norm": 1.1640625, "learning_rate": 9.95e-05, "loss": 7.417, "mean_token_accuracy": 0.08175441175699234, "num_tokens": 459699.0, "step": 200 }, { "entropy": 8.276328945159912, "epoch": 0.013193461191916592, "grad_norm": 1.125, "learning_rate": 0.000102, "loss": 7.3537, "mean_token_accuracy": 0.08016520962119103, "num_tokens": 472857.0, "step": 205 }, { "entropy": 8.274100303649902, "epoch": 0.013515252928304801, "grad_norm": 1.0078125, "learning_rate": 0.00010449999999999999, "loss": 7.4194, "mean_token_accuracy": 0.08162855952978135, "num_tokens": 484983.0, "step": 210 }, { "entropy": 8.180224132537841, "epoch": 0.01383704466469301, "grad_norm": 0.99609375, "learning_rate": 0.000107, "loss": 7.3626, "mean_token_accuracy": 0.08450362831354141, "num_tokens": 495973.0, "step": 215 }, { "entropy": 8.187409973144531, "epoch": 0.01415883640108122, "grad_norm": 1.296875, "learning_rate": 0.0001095, "loss": 7.2816, "mean_token_accuracy": 0.090892593562603, "num_tokens": 507017.0, "step": 220 }, { "entropy": 8.120441341400147, "epoch": 0.01448062813746943, "grad_norm": 1.1875, "learning_rate": 0.000112, "loss": 7.36, "mean_token_accuracy": 0.08900276795029641, "num_tokens": 517522.0, "step": 225 }, { "entropy": 8.129059314727783, "epoch": 0.01480241987385764, "grad_norm": 1.015625, "learning_rate": 0.0001145, "loss": 7.3701, "mean_token_accuracy": 0.09131013453006745, "num_tokens": 528240.0, "step": 230 }, { "entropy": 7.994166135787964, "epoch": 0.015124211610245849, "grad_norm": 0.9765625, "learning_rate": 0.00011700000000000001, "loss": 7.328, "mean_token_accuracy": 0.0881452701985836, "num_tokens": 538875.0, "step": 235 }, { "entropy": 8.10927906036377, "epoch": 0.015446003346634058, "grad_norm": 1.109375, "learning_rate": 0.00011949999999999999, "loss": 7.3722, "mean_token_accuracy": 0.08998035714030266, "num_tokens": 549386.0, "step": 240 }, { "entropy": 8.068589448928833, "epoch": 0.015767795083022267, "grad_norm": 1.234375, "learning_rate": 0.000122, "loss": 7.3029, "mean_token_accuracy": 0.08936483487486839, "num_tokens": 559643.0, "step": 245 }, { "entropy": 8.049430751800537, "epoch": 0.016089586819410476, "grad_norm": 1.0546875, "learning_rate": 0.0001245, "loss": 7.2267, "mean_token_accuracy": 0.09506414234638214, "num_tokens": 570932.0, "step": 250 }, { "entropy": 7.93134560585022, "epoch": 0.016411378555798686, "grad_norm": 1.296875, "learning_rate": 0.000127, "loss": 7.2019, "mean_token_accuracy": 0.09725837931036949, "num_tokens": 580258.0, "step": 255 }, { "entropy": 7.893705558776856, "epoch": 0.0167331702921869, "grad_norm": 1.1953125, "learning_rate": 0.0001295, "loss": 7.1337, "mean_token_accuracy": 0.09558385238051414, "num_tokens": 590622.0, "step": 260 }, { "entropy": 7.884620428085327, "epoch": 0.017054962028575107, "grad_norm": 1.0859375, "learning_rate": 0.000132, "loss": 7.1827, "mean_token_accuracy": 0.09120650067925454, "num_tokens": 602202.0, "step": 265 }, { "entropy": 7.823669528961181, "epoch": 0.017376753764963317, "grad_norm": 1.0859375, "learning_rate": 0.00013450000000000002, "loss": 7.1309, "mean_token_accuracy": 0.0979801706969738, "num_tokens": 613864.0, "step": 270 }, { "entropy": 7.87017560005188, "epoch": 0.017698545501351526, "grad_norm": 0.99609375, "learning_rate": 0.00013700000000000002, "loss": 7.2524, "mean_token_accuracy": 0.09466890171170235, "num_tokens": 626884.0, "step": 275 }, { "entropy": 7.857308626174927, "epoch": 0.018020337237739735, "grad_norm": 1.4140625, "learning_rate": 0.0001395, "loss": 7.1612, "mean_token_accuracy": 0.09996400326490402, "num_tokens": 638418.0, "step": 280 }, { "entropy": 7.856085300445557, "epoch": 0.018342128974127944, "grad_norm": 1.125, "learning_rate": 0.00014199999999999998, "loss": 7.1939, "mean_token_accuracy": 0.09103256016969681, "num_tokens": 648376.0, "step": 285 }, { "entropy": 7.9166460037231445, "epoch": 0.018663920710516153, "grad_norm": 1.09375, "learning_rate": 0.0001445, "loss": 7.2464, "mean_token_accuracy": 0.09389530643820762, "num_tokens": 659268.0, "step": 290 }, { "entropy": 7.788627672195434, "epoch": 0.018985712446904363, "grad_norm": 1.03125, "learning_rate": 0.000147, "loss": 7.0223, "mean_token_accuracy": 0.10249627456068992, "num_tokens": 669736.0, "step": 295 }, { "entropy": 7.768741464614868, "epoch": 0.01930750418329257, "grad_norm": 1.0546875, "learning_rate": 0.0001495, "loss": 7.1198, "mean_token_accuracy": 0.0995169997215271, "num_tokens": 681571.0, "step": 300 }, { "entropy": 7.723494529724121, "epoch": 0.01962929591968078, "grad_norm": 0.9375, "learning_rate": 0.000152, "loss": 7.0189, "mean_token_accuracy": 0.10438807159662247, "num_tokens": 692816.0, "step": 305 }, { "entropy": 7.758736324310303, "epoch": 0.019951087656068994, "grad_norm": 1.078125, "learning_rate": 0.00015450000000000001, "loss": 7.1546, "mean_token_accuracy": 0.10238918289542198, "num_tokens": 705089.0, "step": 310 }, { "entropy": 7.666284465789795, "epoch": 0.020272879392457203, "grad_norm": 1.2734375, "learning_rate": 0.000157, "loss": 7.0252, "mean_token_accuracy": 0.10788851976394653, "num_tokens": 716874.0, "step": 315 }, { "entropy": 7.531011438369751, "epoch": 0.020594671128845412, "grad_norm": 1.171875, "learning_rate": 0.0001595, "loss": 6.9807, "mean_token_accuracy": 0.10204816684126854, "num_tokens": 728981.0, "step": 320 }, { "entropy": 7.782111930847168, "epoch": 0.02091646286523362, "grad_norm": 1.109375, "learning_rate": 0.000162, "loss": 7.0871, "mean_token_accuracy": 0.10574771091341972, "num_tokens": 739619.0, "step": 325 }, { "entropy": 7.599967575073242, "epoch": 0.02123825460162183, "grad_norm": 1.1640625, "learning_rate": 0.00016450000000000001, "loss": 7.0537, "mean_token_accuracy": 0.10123220011591912, "num_tokens": 751363.0, "step": 330 }, { "entropy": 7.667736959457398, "epoch": 0.02156004633801004, "grad_norm": 1.15625, "learning_rate": 0.00016700000000000002, "loss": 7.0722, "mean_token_accuracy": 0.10424386709928513, "num_tokens": 762953.0, "step": 335 }, { "entropy": 7.489533710479736, "epoch": 0.02188183807439825, "grad_norm": 1.1796875, "learning_rate": 0.00016950000000000003, "loss": 6.9886, "mean_token_accuracy": 0.10709020495414734, "num_tokens": 775237.0, "step": 340 }, { "entropy": 7.635052871704102, "epoch": 0.022203629810786458, "grad_norm": 1.109375, "learning_rate": 0.00017199999999999998, "loss": 6.9133, "mean_token_accuracy": 0.11272823959589004, "num_tokens": 786262.0, "step": 345 }, { "entropy": 7.458449077606201, "epoch": 0.022525421547174667, "grad_norm": 1.2265625, "learning_rate": 0.00017449999999999999, "loss": 6.9036, "mean_token_accuracy": 0.11083822324872017, "num_tokens": 797201.0, "step": 350 }, { "entropy": 7.504961967468262, "epoch": 0.02284721328356288, "grad_norm": 1.09375, "learning_rate": 0.000177, "loss": 6.8593, "mean_token_accuracy": 0.11371754407882691, "num_tokens": 807671.0, "step": 355 }, { "entropy": 7.4689586639404295, "epoch": 0.02316900501995109, "grad_norm": 1.1015625, "learning_rate": 0.0001795, "loss": 6.8925, "mean_token_accuracy": 0.109658332914114, "num_tokens": 819142.0, "step": 360 }, { "entropy": 7.5210926055908205, "epoch": 0.023490796756339298, "grad_norm": 1.1484375, "learning_rate": 0.000182, "loss": 6.8902, "mean_token_accuracy": 0.11664389371871949, "num_tokens": 829634.0, "step": 365 }, { "entropy": 7.562618398666382, "epoch": 0.023812588492727507, "grad_norm": 1.0625, "learning_rate": 0.0001845, "loss": 6.9457, "mean_token_accuracy": 0.11507059112191201, "num_tokens": 840723.0, "step": 370 }, { "entropy": 7.44709038734436, "epoch": 0.024134380229115716, "grad_norm": 1.1171875, "learning_rate": 0.000187, "loss": 6.9014, "mean_token_accuracy": 0.11120686307549477, "num_tokens": 852299.0, "step": 375 }, { "entropy": 7.542909240722656, "epoch": 0.024456171965503926, "grad_norm": 1.1328125, "learning_rate": 0.0001895, "loss": 6.8845, "mean_token_accuracy": 0.11418962627649307, "num_tokens": 864427.0, "step": 380 }, { "entropy": 7.269602823257446, "epoch": 0.024777963701892135, "grad_norm": 1.1015625, "learning_rate": 0.000192, "loss": 6.8457, "mean_token_accuracy": 0.11314126327633858, "num_tokens": 876188.0, "step": 385 }, { "entropy": 7.539252614974975, "epoch": 0.025099755438280344, "grad_norm": 1.296875, "learning_rate": 0.0001945, "loss": 6.9751, "mean_token_accuracy": 0.10968251451849938, "num_tokens": 886835.0, "step": 390 }, { "entropy": 7.462894248962402, "epoch": 0.025421547174668553, "grad_norm": 1.09375, "learning_rate": 0.00019700000000000002, "loss": 6.8758, "mean_token_accuracy": 0.1175595462322235, "num_tokens": 899609.0, "step": 395 }, { "entropy": 7.514445400238037, "epoch": 0.025743338911056766, "grad_norm": 1.1484375, "learning_rate": 0.00019950000000000002, "loss": 6.9867, "mean_token_accuracy": 0.10821878015995026, "num_tokens": 912114.0, "step": 400 }, { "entropy": 7.434127473831177, "epoch": 0.026065130647444975, "grad_norm": 1.0078125, "learning_rate": 0.000202, "loss": 6.9875, "mean_token_accuracy": 0.1139479123055935, "num_tokens": 923788.0, "step": 405 }, { "entropy": 7.338033294677734, "epoch": 0.026386922383833184, "grad_norm": 1.234375, "learning_rate": 0.00020449999999999998, "loss": 6.6791, "mean_token_accuracy": 0.1255500763654709, "num_tokens": 934952.0, "step": 410 }, { "entropy": 7.422152519226074, "epoch": 0.026708714120221393, "grad_norm": 1.4609375, "learning_rate": 0.000207, "loss": 6.7758, "mean_token_accuracy": 0.11906903460621834, "num_tokens": 945780.0, "step": 415 }, { "entropy": 7.29374885559082, "epoch": 0.027030505856609603, "grad_norm": 1.1015625, "learning_rate": 0.0002095, "loss": 6.7765, "mean_token_accuracy": 0.12052410319447518, "num_tokens": 958502.0, "step": 420 }, { "entropy": 7.422839784622193, "epoch": 0.02735229759299781, "grad_norm": 1.46875, "learning_rate": 0.000212, "loss": 6.8635, "mean_token_accuracy": 0.11772049516439438, "num_tokens": 969339.0, "step": 425 }, { "entropy": 7.215829658508301, "epoch": 0.02767408932938602, "grad_norm": 1.125, "learning_rate": 0.0002145, "loss": 6.7171, "mean_token_accuracy": 0.12233989164233208, "num_tokens": 980260.0, "step": 430 }, { "entropy": 7.2986561298370365, "epoch": 0.02799588106577423, "grad_norm": 1.21875, "learning_rate": 0.00021700000000000002, "loss": 6.6963, "mean_token_accuracy": 0.11892440766096116, "num_tokens": 991960.0, "step": 435 }, { "entropy": 7.193790006637573, "epoch": 0.02831767280216244, "grad_norm": 1.1328125, "learning_rate": 0.0002195, "loss": 6.7273, "mean_token_accuracy": 0.11868971958756447, "num_tokens": 1002083.0, "step": 440 }, { "entropy": 7.308983230590821, "epoch": 0.02863946453855065, "grad_norm": 1.109375, "learning_rate": 0.000222, "loss": 6.7375, "mean_token_accuracy": 0.11723077073693275, "num_tokens": 1012896.0, "step": 445 }, { "entropy": 7.334416151046753, "epoch": 0.02896125627493886, "grad_norm": 1.109375, "learning_rate": 0.0002245, "loss": 6.8189, "mean_token_accuracy": 0.12101824656128883, "num_tokens": 1024570.0, "step": 450 }, { "entropy": 7.2581829071044925, "epoch": 0.02928304801132707, "grad_norm": 1.1640625, "learning_rate": 0.00022700000000000002, "loss": 6.6596, "mean_token_accuracy": 0.1274547331035137, "num_tokens": 1035934.0, "step": 455 }, { "entropy": 7.214243841171265, "epoch": 0.02960483974771528, "grad_norm": 1.109375, "learning_rate": 0.00022950000000000002, "loss": 6.8555, "mean_token_accuracy": 0.11035279110074044, "num_tokens": 1047557.0, "step": 460 }, { "entropy": 7.284564542770386, "epoch": 0.02992663148410349, "grad_norm": 1.0703125, "learning_rate": 0.00023200000000000003, "loss": 6.8011, "mean_token_accuracy": 0.11536358669400215, "num_tokens": 1059387.0, "step": 465 }, { "entropy": 7.255402135848999, "epoch": 0.030248423220491698, "grad_norm": 1.2109375, "learning_rate": 0.00023449999999999998, "loss": 6.8003, "mean_token_accuracy": 0.11578696817159653, "num_tokens": 1070756.0, "step": 470 }, { "entropy": 7.274528503417969, "epoch": 0.030570214956879907, "grad_norm": 1.2734375, "learning_rate": 0.000237, "loss": 6.7873, "mean_token_accuracy": 0.1295149154961109, "num_tokens": 1083147.0, "step": 475 }, { "entropy": 7.171627616882324, "epoch": 0.030892006693268116, "grad_norm": 1.0625, "learning_rate": 0.0002395, "loss": 6.6541, "mean_token_accuracy": 0.12174521461129188, "num_tokens": 1094300.0, "step": 480 }, { "entropy": 7.192223072052002, "epoch": 0.031213798429656325, "grad_norm": 1.015625, "learning_rate": 0.000242, "loss": 6.7988, "mean_token_accuracy": 0.11465005055069924, "num_tokens": 1105991.0, "step": 485 }, { "entropy": 7.2635111808776855, "epoch": 0.031535590166044535, "grad_norm": 1.1875, "learning_rate": 0.0002445, "loss": 6.8278, "mean_token_accuracy": 0.11537677273154259, "num_tokens": 1118065.0, "step": 490 }, { "entropy": 7.217528486251831, "epoch": 0.031857381902432744, "grad_norm": 1.3671875, "learning_rate": 0.000247, "loss": 6.772, "mean_token_accuracy": 0.12680590748786927, "num_tokens": 1130521.0, "step": 495 }, { "entropy": 7.099181175231934, "epoch": 0.03217917363882095, "grad_norm": 1.15625, "learning_rate": 0.0002495, "loss": 6.7436, "mean_token_accuracy": 0.11461131051182746, "num_tokens": 1143241.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 271712573521920.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }