{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.0584487696533988, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691908264160157, "epoch": 0.000292243848266994, "grad_norm": 12.625, "learning_rate": 2e-06, "loss": 10.8406, "mean_token_accuracy": 0.0, "num_tokens": 11114.0, "step": 5 }, { "entropy": 10.691956710815429, "epoch": 0.000584487696533988, "grad_norm": 13.375, "learning_rate": 4.5e-06, "loss": 10.7353, "mean_token_accuracy": 0.00011737089371308685, "num_tokens": 20935.0, "step": 10 }, { "entropy": 10.690714645385743, "epoch": 0.000876731544800982, "grad_norm": 9.4375, "learning_rate": 7e-06, "loss": 10.5144, "mean_token_accuracy": 0.03050256703281775, "num_tokens": 31930.0, "step": 15 }, { "entropy": 10.654311275482177, "epoch": 0.001168975393067976, "grad_norm": 5.96875, "learning_rate": 9.5e-06, "loss": 10.1606, "mean_token_accuracy": 0.05743609480559826, "num_tokens": 41672.0, "step": 20 }, { "entropy": 10.475521564483643, "epoch": 0.00146121924133497, "grad_norm": 3.90625, "learning_rate": 1.2e-05, "loss": 9.9607, "mean_token_accuracy": 0.05290710777044296, "num_tokens": 52510.0, "step": 25 }, { "entropy": 10.543301010131836, "epoch": 0.001753463089601964, "grad_norm": 3.75, "learning_rate": 1.4500000000000002e-05, "loss": 9.8154, "mean_token_accuracy": 0.045297696441411975, "num_tokens": 63214.0, "step": 30 }, { "entropy": 10.49622220993042, "epoch": 0.002045706937868958, "grad_norm": 2.5, "learning_rate": 1.7000000000000003e-05, "loss": 9.7008, "mean_token_accuracy": 0.05302377603948116, "num_tokens": 73942.0, "step": 35 }, { "entropy": 10.475418663024902, "epoch": 0.002337950786135952, "grad_norm": 2.375, "learning_rate": 1.95e-05, "loss": 9.7051, "mean_token_accuracy": 0.05076396390795708, "num_tokens": 84526.0, "step": 40 }, { "entropy": 10.52062005996704, "epoch": 0.0026301946344029457, "grad_norm": 2.234375, "learning_rate": 2.2e-05, "loss": 9.7003, "mean_token_accuracy": 0.04803669825196266, "num_tokens": 95178.0, "step": 45 }, { "entropy": 10.508524227142335, "epoch": 0.00292243848266994, "grad_norm": 2.3125, "learning_rate": 2.4500000000000003e-05, "loss": 9.6047, "mean_token_accuracy": 0.05312369242310524, "num_tokens": 106653.0, "step": 50 }, { "entropy": 10.445098209381104, "epoch": 0.0032146823309369336, "grad_norm": 2.25, "learning_rate": 2.7e-05, "loss": 9.4922, "mean_token_accuracy": 0.058677663654088975, "num_tokens": 115969.0, "step": 55 }, { "entropy": 10.33490447998047, "epoch": 0.003506926179203928, "grad_norm": 2.09375, "learning_rate": 2.95e-05, "loss": 9.469, "mean_token_accuracy": 0.06182386502623558, "num_tokens": 125826.0, "step": 60 }, { "entropy": 10.331936168670655, "epoch": 0.0037991700274709215, "grad_norm": 2.3125, "learning_rate": 3.2e-05, "loss": 9.4398, "mean_token_accuracy": 0.06020851917564869, "num_tokens": 136677.0, "step": 65 }, { "entropy": 10.381442165374756, "epoch": 0.004091413875737916, "grad_norm": 2.03125, "learning_rate": 3.4500000000000005e-05, "loss": 9.3696, "mean_token_accuracy": 0.05836572460830212, "num_tokens": 147535.0, "step": 70 }, { "entropy": 10.336608695983887, "epoch": 0.00438365772400491, "grad_norm": 2.046875, "learning_rate": 3.7e-05, "loss": 9.2591, "mean_token_accuracy": 0.06145334914326668, "num_tokens": 157524.0, "step": 75 }, { "entropy": 10.270106220245362, "epoch": 0.004675901572271904, "grad_norm": 1.6953125, "learning_rate": 3.95e-05, "loss": 9.1922, "mean_token_accuracy": 0.063629350066185, "num_tokens": 168344.0, "step": 80 }, { "entropy": 10.35278034210205, "epoch": 0.004968145420538897, "grad_norm": 1.953125, "learning_rate": 4.2000000000000004e-05, "loss": 9.14, "mean_token_accuracy": 0.05551427491009235, "num_tokens": 178976.0, "step": 85 }, { "entropy": 10.23039789199829, "epoch": 0.0052603892688058915, "grad_norm": 1.8046875, "learning_rate": 4.45e-05, "loss": 9.0429, "mean_token_accuracy": 0.06621964909136295, "num_tokens": 190567.0, "step": 90 }, { "entropy": 10.196823787689208, "epoch": 0.005552633117072886, "grad_norm": 1.8671875, "learning_rate": 4.7000000000000004e-05, "loss": 8.9449, "mean_token_accuracy": 0.07107578478753566, "num_tokens": 201587.0, "step": 95 }, { "entropy": 10.113740062713623, "epoch": 0.00584487696533988, "grad_norm": 1.6953125, "learning_rate": 4.9500000000000004e-05, "loss": 8.8501, "mean_token_accuracy": 0.06472622714936734, "num_tokens": 211913.0, "step": 100 }, { "entropy": 10.149368000030517, "epoch": 0.006137120813606874, "grad_norm": 1.8046875, "learning_rate": 5.2e-05, "loss": 8.7762, "mean_token_accuracy": 0.06379772424697876, "num_tokens": 222247.0, "step": 105 }, { "entropy": 9.989063167572022, "epoch": 0.006429364661873867, "grad_norm": 1.46875, "learning_rate": 5.45e-05, "loss": 8.6212, "mean_token_accuracy": 0.07087173387408256, "num_tokens": 232361.0, "step": 110 }, { "entropy": 9.965903949737548, "epoch": 0.006721608510140861, "grad_norm": 1.578125, "learning_rate": 5.7e-05, "loss": 8.5651, "mean_token_accuracy": 0.06980551891028881, "num_tokens": 242885.0, "step": 115 }, { "entropy": 9.803161907196046, "epoch": 0.007013852358407856, "grad_norm": 1.453125, "learning_rate": 5.9499999999999996e-05, "loss": 8.4687, "mean_token_accuracy": 0.06787880472838878, "num_tokens": 254482.0, "step": 120 }, { "entropy": 9.760642433166504, "epoch": 0.00730609620667485, "grad_norm": 1.40625, "learning_rate": 6.2e-05, "loss": 8.3483, "mean_token_accuracy": 0.06577648222446442, "num_tokens": 265744.0, "step": 125 }, { "entropy": 9.514495658874512, "epoch": 0.007598340054941843, "grad_norm": 1.1640625, "learning_rate": 6.450000000000001e-05, "loss": 8.2621, "mean_token_accuracy": 0.0672954872250557, "num_tokens": 276924.0, "step": 130 }, { "entropy": 9.37683687210083, "epoch": 0.007890583903208837, "grad_norm": 1.375, "learning_rate": 6.7e-05, "loss": 8.1773, "mean_token_accuracy": 0.07101362608373166, "num_tokens": 287779.0, "step": 135 }, { "entropy": 9.18982000350952, "epoch": 0.008182827751475831, "grad_norm": 1.3046875, "learning_rate": 6.950000000000001e-05, "loss": 8.1052, "mean_token_accuracy": 0.07210481017827988, "num_tokens": 298807.0, "step": 140 }, { "entropy": 9.113053703308106, "epoch": 0.008475071599742826, "grad_norm": 1.09375, "learning_rate": 7.2e-05, "loss": 8.1007, "mean_token_accuracy": 0.061491196230053904, "num_tokens": 309760.0, "step": 145 }, { "entropy": 8.824873638153075, "epoch": 0.00876731544800982, "grad_norm": 0.99609375, "learning_rate": 7.45e-05, "loss": 7.9698, "mean_token_accuracy": 0.0695835679769516, "num_tokens": 319750.0, "step": 150 }, { "entropy": 8.6828182220459, "epoch": 0.009059559296276814, "grad_norm": 1.0390625, "learning_rate": 7.7e-05, "loss": 7.8822, "mean_token_accuracy": 0.07002829425036908, "num_tokens": 329931.0, "step": 155 }, { "entropy": 8.598028564453125, "epoch": 0.009351803144543808, "grad_norm": 1.171875, "learning_rate": 7.950000000000001e-05, "loss": 7.9106, "mean_token_accuracy": 0.06758572831749916, "num_tokens": 340457.0, "step": 160 }, { "entropy": 8.501685905456544, "epoch": 0.009644046992810802, "grad_norm": 1.15625, "learning_rate": 8.2e-05, "loss": 7.8105, "mean_token_accuracy": 0.07629426941275597, "num_tokens": 352450.0, "step": 165 }, { "entropy": 8.418387317657471, "epoch": 0.009936290841077795, "grad_norm": 1.15625, "learning_rate": 8.450000000000001e-05, "loss": 7.8297, "mean_token_accuracy": 0.07713140919804573, "num_tokens": 363204.0, "step": 170 }, { "entropy": 8.363510417938233, "epoch": 0.010228534689344789, "grad_norm": 0.9765625, "learning_rate": 8.7e-05, "loss": 7.8784, "mean_token_accuracy": 0.06442252397537232, "num_tokens": 373577.0, "step": 175 }, { "entropy": 8.313191223144532, "epoch": 0.010520778537611783, "grad_norm": 0.98046875, "learning_rate": 8.95e-05, "loss": 7.7833, "mean_token_accuracy": 0.07531154453754425, "num_tokens": 384267.0, "step": 180 }, { "entropy": 8.214359951019286, "epoch": 0.010813022385878777, "grad_norm": 1.078125, "learning_rate": 9.2e-05, "loss": 7.7491, "mean_token_accuracy": 0.06811888329684734, "num_tokens": 394767.0, "step": 185 }, { "entropy": 8.22794075012207, "epoch": 0.011105266234145771, "grad_norm": 1.15625, "learning_rate": 9.45e-05, "loss": 7.7665, "mean_token_accuracy": 0.07282254844903946, "num_tokens": 405807.0, "step": 190 }, { "entropy": 8.217875862121582, "epoch": 0.011397510082412765, "grad_norm": 1.1484375, "learning_rate": 9.7e-05, "loss": 7.7191, "mean_token_accuracy": 0.06757043041288853, "num_tokens": 416381.0, "step": 195 }, { "entropy": 8.152586936950684, "epoch": 0.01168975393067976, "grad_norm": 1.25, "learning_rate": 9.95e-05, "loss": 7.8287, "mean_token_accuracy": 0.07003305219113827, "num_tokens": 427262.0, "step": 200 }, { "entropy": 8.141828060150146, "epoch": 0.011981997778946754, "grad_norm": 1.2734375, "learning_rate": 0.000102, "loss": 7.7651, "mean_token_accuracy": 0.0717297799885273, "num_tokens": 438504.0, "step": 205 }, { "entropy": 8.196744251251221, "epoch": 0.012274241627213748, "grad_norm": 1.0625, "learning_rate": 0.00010449999999999999, "loss": 7.7513, "mean_token_accuracy": 0.07213160172104835, "num_tokens": 449923.0, "step": 210 }, { "entropy": 8.13697328567505, "epoch": 0.01256648547548074, "grad_norm": 0.9921875, "learning_rate": 0.000107, "loss": 7.7046, "mean_token_accuracy": 0.07478658258914947, "num_tokens": 460736.0, "step": 215 }, { "entropy": 8.1306658744812, "epoch": 0.012858729323747735, "grad_norm": 1.03125, "learning_rate": 0.0001095, "loss": 7.8163, "mean_token_accuracy": 0.06586915515363216, "num_tokens": 471513.0, "step": 220 }, { "entropy": 8.089940357208253, "epoch": 0.013150973172014729, "grad_norm": 1.1015625, "learning_rate": 0.000112, "loss": 7.6608, "mean_token_accuracy": 0.07503279075026512, "num_tokens": 482115.0, "step": 225 }, { "entropy": 8.06955795288086, "epoch": 0.013443217020281723, "grad_norm": 1.046875, "learning_rate": 0.0001145, "loss": 7.6789, "mean_token_accuracy": 0.07244161255657673, "num_tokens": 493273.0, "step": 230 }, { "entropy": 8.088439989089967, "epoch": 0.013735460868548717, "grad_norm": 0.921875, "learning_rate": 0.00011700000000000001, "loss": 7.7067, "mean_token_accuracy": 0.07398871332406998, "num_tokens": 503939.0, "step": 235 }, { "entropy": 8.001152181625367, "epoch": 0.014027704716815711, "grad_norm": 0.8671875, "learning_rate": 0.00011949999999999999, "loss": 7.6139, "mean_token_accuracy": 0.07592850960791112, "num_tokens": 515215.0, "step": 240 }, { "entropy": 7.98775544166565, "epoch": 0.014319948565082705, "grad_norm": 1.046875, "learning_rate": 0.000122, "loss": 7.7051, "mean_token_accuracy": 0.07671321779489518, "num_tokens": 526485.0, "step": 245 }, { "entropy": 8.02779312133789, "epoch": 0.0146121924133497, "grad_norm": 1.046875, "learning_rate": 0.0001245, "loss": 7.6616, "mean_token_accuracy": 0.07241038978099823, "num_tokens": 536735.0, "step": 250 }, { "entropy": 8.066807174682618, "epoch": 0.014904436261616694, "grad_norm": 0.9609375, "learning_rate": 0.000127, "loss": 7.7528, "mean_token_accuracy": 0.06985807269811631, "num_tokens": 547326.0, "step": 255 }, { "entropy": 7.9721503257751465, "epoch": 0.015196680109883686, "grad_norm": 1.015625, "learning_rate": 0.0001295, "loss": 7.6367, "mean_token_accuracy": 0.07485130280256272, "num_tokens": 558275.0, "step": 260 }, { "entropy": 7.969989395141601, "epoch": 0.01548892395815068, "grad_norm": 1.0, "learning_rate": 0.000132, "loss": 7.6104, "mean_token_accuracy": 0.0731944501399994, "num_tokens": 569711.0, "step": 265 }, { "entropy": 7.970643997192383, "epoch": 0.015781167806417674, "grad_norm": 0.96484375, "learning_rate": 0.00013450000000000002, "loss": 7.5828, "mean_token_accuracy": 0.07749090045690536, "num_tokens": 579602.0, "step": 270 }, { "entropy": 7.9638073444366455, "epoch": 0.01607341165468467, "grad_norm": 1.078125, "learning_rate": 0.00013700000000000002, "loss": 7.6231, "mean_token_accuracy": 0.07638676390051842, "num_tokens": 590899.0, "step": 275 }, { "entropy": 7.931737279891967, "epoch": 0.016365655502951663, "grad_norm": 1.046875, "learning_rate": 0.0001395, "loss": 7.6258, "mean_token_accuracy": 0.07663728073239326, "num_tokens": 602080.0, "step": 280 }, { "entropy": 7.949186515808106, "epoch": 0.016657899351218655, "grad_norm": 0.96484375, "learning_rate": 0.00014199999999999998, "loss": 7.6619, "mean_token_accuracy": 0.07214237600564957, "num_tokens": 613692.0, "step": 285 }, { "entropy": 7.928168773651123, "epoch": 0.01695014319948565, "grad_norm": 1.1015625, "learning_rate": 0.0001445, "loss": 7.6255, "mean_token_accuracy": 0.07801526971161366, "num_tokens": 625019.0, "step": 290 }, { "entropy": 7.858082962036133, "epoch": 0.017242387047752643, "grad_norm": 1.1328125, "learning_rate": 0.000147, "loss": 7.5324, "mean_token_accuracy": 0.07193354479968547, "num_tokens": 636453.0, "step": 295 }, { "entropy": 7.900658082962036, "epoch": 0.01753463089601964, "grad_norm": 0.9375, "learning_rate": 0.0001495, "loss": 7.5805, "mean_token_accuracy": 0.07368646003305912, "num_tokens": 647272.0, "step": 300 }, { "entropy": 7.980489492416382, "epoch": 0.017826874744286632, "grad_norm": 1.296875, "learning_rate": 0.000152, "loss": 7.5929, "mean_token_accuracy": 0.07068270668387414, "num_tokens": 657724.0, "step": 305 }, { "entropy": 7.874118614196777, "epoch": 0.018119118592553628, "grad_norm": 1.0859375, "learning_rate": 0.00015450000000000001, "loss": 7.5913, "mean_token_accuracy": 0.07631154656410218, "num_tokens": 669183.0, "step": 310 }, { "entropy": 7.852222537994384, "epoch": 0.01841136244082062, "grad_norm": 1.109375, "learning_rate": 0.000157, "loss": 7.5557, "mean_token_accuracy": 0.07173253633081914, "num_tokens": 680439.0, "step": 315 }, { "entropy": 7.902084875106811, "epoch": 0.018703606289087616, "grad_norm": 1.3046875, "learning_rate": 0.0001595, "loss": 7.6115, "mean_token_accuracy": 0.07198056317865849, "num_tokens": 690789.0, "step": 320 }, { "entropy": 7.909448766708374, "epoch": 0.01899585013735461, "grad_norm": 1.0234375, "learning_rate": 0.000162, "loss": 7.5829, "mean_token_accuracy": 0.07492739222943783, "num_tokens": 701818.0, "step": 325 }, { "entropy": 7.837027454376221, "epoch": 0.019288093985621604, "grad_norm": 1.3671875, "learning_rate": 0.00016450000000000001, "loss": 7.5366, "mean_token_accuracy": 0.07418245449662209, "num_tokens": 713344.0, "step": 330 }, { "entropy": 7.862662744522095, "epoch": 0.019580337833888597, "grad_norm": 1.3125, "learning_rate": 0.00016700000000000002, "loss": 7.5289, "mean_token_accuracy": 0.07505915723741055, "num_tokens": 723279.0, "step": 335 }, { "entropy": 7.862085199356079, "epoch": 0.01987258168215559, "grad_norm": 1.09375, "learning_rate": 0.00016950000000000003, "loss": 7.5211, "mean_token_accuracy": 0.07510280013084411, "num_tokens": 733875.0, "step": 340 }, { "entropy": 7.86326003074646, "epoch": 0.020164825530422585, "grad_norm": 1.15625, "learning_rate": 0.00017199999999999998, "loss": 7.5595, "mean_token_accuracy": 0.073441531509161, "num_tokens": 745449.0, "step": 345 }, { "entropy": 7.847935771942138, "epoch": 0.020457069378689578, "grad_norm": 1.0078125, "learning_rate": 0.00017449999999999999, "loss": 7.5717, "mean_token_accuracy": 0.07788249254226684, "num_tokens": 757570.0, "step": 350 }, { "entropy": 7.815750980377198, "epoch": 0.020749313226956573, "grad_norm": 1.0625, "learning_rate": 0.000177, "loss": 7.4513, "mean_token_accuracy": 0.08608488291501999, "num_tokens": 767601.0, "step": 355 }, { "entropy": 7.804518222808838, "epoch": 0.021041557075223566, "grad_norm": 1.1328125, "learning_rate": 0.0001795, "loss": 7.5134, "mean_token_accuracy": 0.07662104293704033, "num_tokens": 777852.0, "step": 360 }, { "entropy": 7.8234796047210695, "epoch": 0.021333800923490562, "grad_norm": 1.1015625, "learning_rate": 0.000182, "loss": 7.4728, "mean_token_accuracy": 0.07879027798771858, "num_tokens": 788339.0, "step": 365 }, { "entropy": 7.763150691986084, "epoch": 0.021626044771757554, "grad_norm": 1.0703125, "learning_rate": 0.0001845, "loss": 7.5509, "mean_token_accuracy": 0.07561626769602299, "num_tokens": 799791.0, "step": 370 }, { "entropy": 7.7915912628173825, "epoch": 0.02191828862002455, "grad_norm": 1.1328125, "learning_rate": 0.000187, "loss": 7.4559, "mean_token_accuracy": 0.07913151681423188, "num_tokens": 810141.0, "step": 375 }, { "entropy": 7.82445068359375, "epoch": 0.022210532468291543, "grad_norm": 0.984375, "learning_rate": 0.0001895, "loss": 7.4938, "mean_token_accuracy": 0.07601816579699516, "num_tokens": 820929.0, "step": 380 }, { "entropy": 7.806576347351074, "epoch": 0.022502776316558535, "grad_norm": 1.4765625, "learning_rate": 0.000192, "loss": 7.4415, "mean_token_accuracy": 0.07921079695224761, "num_tokens": 831340.0, "step": 385 }, { "entropy": 7.650366687774659, "epoch": 0.02279502016482553, "grad_norm": 1.109375, "learning_rate": 0.0001945, "loss": 7.4444, "mean_token_accuracy": 0.07921848297119141, "num_tokens": 841846.0, "step": 390 }, { "entropy": 7.847888851165772, "epoch": 0.023087264013092523, "grad_norm": 1.328125, "learning_rate": 0.00019700000000000002, "loss": 7.4322, "mean_token_accuracy": 0.0797240749001503, "num_tokens": 852089.0, "step": 395 }, { "entropy": 7.713356971740723, "epoch": 0.02337950786135952, "grad_norm": 1.203125, "learning_rate": 0.00019950000000000002, "loss": 7.4116, "mean_token_accuracy": 0.08028053492307663, "num_tokens": 862568.0, "step": 400 }, { "entropy": 7.74327917098999, "epoch": 0.02367175170962651, "grad_norm": 1.09375, "learning_rate": 0.000202, "loss": 7.4684, "mean_token_accuracy": 0.07664722427725792, "num_tokens": 874676.0, "step": 405 }, { "entropy": 7.674819469451904, "epoch": 0.023963995557893508, "grad_norm": 1.125, "learning_rate": 0.00020449999999999998, "loss": 7.3829, "mean_token_accuracy": 0.08288070000708103, "num_tokens": 886338.0, "step": 410 }, { "entropy": 7.71968150138855, "epoch": 0.0242562394061605, "grad_norm": 1.0546875, "learning_rate": 0.000207, "loss": 7.4114, "mean_token_accuracy": 0.07737804017961025, "num_tokens": 896671.0, "step": 415 }, { "entropy": 7.6655017852783205, "epoch": 0.024548483254427496, "grad_norm": 0.9921875, "learning_rate": 0.0002095, "loss": 7.3914, "mean_token_accuracy": 0.07870943620800971, "num_tokens": 908265.0, "step": 420 }, { "entropy": 7.6367028713226315, "epoch": 0.02484072710269449, "grad_norm": 1.0078125, "learning_rate": 0.000212, "loss": 7.3495, "mean_token_accuracy": 0.0839125782251358, "num_tokens": 919024.0, "step": 425 }, { "entropy": 7.721334648132324, "epoch": 0.02513297095096148, "grad_norm": 1.0859375, "learning_rate": 0.0002145, "loss": 7.3314, "mean_token_accuracy": 0.08483307361602783, "num_tokens": 930837.0, "step": 430 }, { "entropy": 7.614313220977783, "epoch": 0.025425214799228477, "grad_norm": 1.2109375, "learning_rate": 0.00021700000000000002, "loss": 7.3096, "mean_token_accuracy": 0.08256931453943253, "num_tokens": 941374.0, "step": 435 }, { "entropy": 7.603088331222534, "epoch": 0.02571745864749547, "grad_norm": 1.0859375, "learning_rate": 0.0002195, "loss": 7.2577, "mean_token_accuracy": 0.08504624664783478, "num_tokens": 953273.0, "step": 440 }, { "entropy": 7.580397319793701, "epoch": 0.026009702495762465, "grad_norm": 1.75, "learning_rate": 0.000222, "loss": 7.2375, "mean_token_accuracy": 0.0916403166949749, "num_tokens": 964882.0, "step": 445 }, { "entropy": 7.614603757858276, "epoch": 0.026301946344029457, "grad_norm": 1.34375, "learning_rate": 0.0002245, "loss": 7.4103, "mean_token_accuracy": 0.08159535191953182, "num_tokens": 974732.0, "step": 450 }, { "entropy": 7.595666790008545, "epoch": 0.026594190192296453, "grad_norm": 1.0859375, "learning_rate": 0.00022700000000000002, "loss": 7.3392, "mean_token_accuracy": 0.07731116712093353, "num_tokens": 985709.0, "step": 455 }, { "entropy": 7.649027681350708, "epoch": 0.026886434040563446, "grad_norm": 1.25, "learning_rate": 0.00022950000000000002, "loss": 7.3048, "mean_token_accuracy": 0.08609704971313477, "num_tokens": 998177.0, "step": 460 }, { "entropy": 7.5427803039550785, "epoch": 0.02717867788883044, "grad_norm": 1.1484375, "learning_rate": 0.00023200000000000003, "loss": 7.2407, "mean_token_accuracy": 0.08310350701212883, "num_tokens": 1008676.0, "step": 465 }, { "entropy": 7.5991309642791744, "epoch": 0.027470921737097434, "grad_norm": 1.0546875, "learning_rate": 0.00023449999999999998, "loss": 7.357, "mean_token_accuracy": 0.08094775602221489, "num_tokens": 1019951.0, "step": 470 }, { "entropy": 7.504101514816284, "epoch": 0.027763165585364426, "grad_norm": 1.2421875, "learning_rate": 0.000237, "loss": 7.2908, "mean_token_accuracy": 0.07796959653496742, "num_tokens": 1030219.0, "step": 475 }, { "entropy": 7.5679099559783936, "epoch": 0.028055409433631422, "grad_norm": 1.1484375, "learning_rate": 0.0002395, "loss": 7.3201, "mean_token_accuracy": 0.08201361894607544, "num_tokens": 1041911.0, "step": 480 }, { "entropy": 7.6739061832427975, "epoch": 0.028347653281898415, "grad_norm": 1.1171875, "learning_rate": 0.000242, "loss": 7.3237, "mean_token_accuracy": 0.08364914655685425, "num_tokens": 1052638.0, "step": 485 }, { "entropy": 7.5074201107025145, "epoch": 0.02863989713016541, "grad_norm": 1.140625, "learning_rate": 0.0002445, "loss": 7.2604, "mean_token_accuracy": 0.08207505084574222, "num_tokens": 1063465.0, "step": 490 }, { "entropy": 7.632791471481323, "epoch": 0.028932140978432403, "grad_norm": 1.078125, "learning_rate": 0.000247, "loss": 7.2625, "mean_token_accuracy": 0.08835876137018203, "num_tokens": 1073583.0, "step": 495 }, { "entropy": 7.605600214004516, "epoch": 0.0292243848266994, "grad_norm": 1.2109375, "learning_rate": 0.0002495, "loss": 7.327, "mean_token_accuracy": 0.08249956965446473, "num_tokens": 1083961.0, "step": 500 }, { "entropy": 7.432604742050171, "epoch": 0.02951662867496639, "grad_norm": 0.91796875, "learning_rate": 0.000252, "loss": 7.1818, "mean_token_accuracy": 0.08461034670472145, "num_tokens": 1095339.0, "step": 505 }, { "entropy": 7.534429121017456, "epoch": 0.029808872523233387, "grad_norm": 1.0390625, "learning_rate": 0.0002545, "loss": 7.2615, "mean_token_accuracy": 0.07991603463888168, "num_tokens": 1105518.0, "step": 510 }, { "entropy": 7.572704219818116, "epoch": 0.03010111637150038, "grad_norm": 0.94140625, "learning_rate": 0.000257, "loss": 7.1485, "mean_token_accuracy": 0.08869004771113395, "num_tokens": 1115666.0, "step": 515 }, { "entropy": 7.499062871932983, "epoch": 0.030393360219767372, "grad_norm": 1.3046875, "learning_rate": 0.0002595, "loss": 7.2854, "mean_token_accuracy": 0.08312782868742943, "num_tokens": 1125827.0, "step": 520 }, { "entropy": 7.49239444732666, "epoch": 0.030685604068034368, "grad_norm": 1.0078125, "learning_rate": 0.000262, "loss": 7.2312, "mean_token_accuracy": 0.08309667333960533, "num_tokens": 1136154.0, "step": 525 }, { "entropy": 7.477995872497559, "epoch": 0.03097784791630136, "grad_norm": 1.1640625, "learning_rate": 0.00026450000000000003, "loss": 7.2247, "mean_token_accuracy": 0.09041514843702317, "num_tokens": 1146392.0, "step": 530 }, { "entropy": 7.515807485580444, "epoch": 0.03127009176456835, "grad_norm": 1.2421875, "learning_rate": 0.00026700000000000004, "loss": 7.2327, "mean_token_accuracy": 0.08347614929080009, "num_tokens": 1157566.0, "step": 535 }, { "entropy": 7.408181762695312, "epoch": 0.03156233561283535, "grad_norm": 1.203125, "learning_rate": 0.00026950000000000005, "loss": 7.2244, "mean_token_accuracy": 0.08636801540851594, "num_tokens": 1167795.0, "step": 540 }, { "entropy": 7.55600643157959, "epoch": 0.031854579461102345, "grad_norm": 1.703125, "learning_rate": 0.00027200000000000005, "loss": 7.1614, "mean_token_accuracy": 0.09404403418302536, "num_tokens": 1178894.0, "step": 545 }, { "entropy": 7.379703378677368, "epoch": 0.03214682330936934, "grad_norm": 1.09375, "learning_rate": 0.0002745, "loss": 7.1863, "mean_token_accuracy": 0.08515683636069298, "num_tokens": 1189361.0, "step": 550 }, { "entropy": 7.44665265083313, "epoch": 0.03243906715763633, "grad_norm": 1.2421875, "learning_rate": 0.000277, "loss": 7.2063, "mean_token_accuracy": 0.08360610157251358, "num_tokens": 1198992.0, "step": 555 }, { "entropy": 7.450517177581787, "epoch": 0.032731311005903325, "grad_norm": 1.1640625, "learning_rate": 0.0002795, "loss": 7.1858, "mean_token_accuracy": 0.08214344829320908, "num_tokens": 1208732.0, "step": 560 }, { "entropy": 7.416987085342408, "epoch": 0.03302355485417032, "grad_norm": 1.1953125, "learning_rate": 0.00028199999999999997, "loss": 7.1961, "mean_token_accuracy": 0.08448583483695984, "num_tokens": 1219015.0, "step": 565 }, { "entropy": 7.383893156051636, "epoch": 0.03331579870243731, "grad_norm": 1.1328125, "learning_rate": 0.0002845, "loss": 7.0907, "mean_token_accuracy": 0.10338108763098716, "num_tokens": 1229227.0, "step": 570 }, { "entropy": 7.4993305683135985, "epoch": 0.033608042550704306, "grad_norm": 1.21875, "learning_rate": 0.000287, "loss": 7.2226, "mean_token_accuracy": 0.08231785595417022, "num_tokens": 1239654.0, "step": 575 }, { "entropy": 7.332780599594116, "epoch": 0.0339002863989713, "grad_norm": 1.0234375, "learning_rate": 0.0002895, "loss": 7.1941, "mean_token_accuracy": 0.08100020363926888, "num_tokens": 1250955.0, "step": 580 }, { "entropy": 7.445628499984741, "epoch": 0.0341925302472383, "grad_norm": 1.078125, "learning_rate": 0.000292, "loss": 7.1521, "mean_token_accuracy": 0.09030932411551476, "num_tokens": 1262574.0, "step": 585 }, { "entropy": 7.327143812179566, "epoch": 0.03448477409550529, "grad_norm": 1.046875, "learning_rate": 0.0002945, "loss": 7.1163, "mean_token_accuracy": 0.09456900656223297, "num_tokens": 1273272.0, "step": 590 }, { "entropy": 7.291459846496582, "epoch": 0.03477701794377228, "grad_norm": 1.0703125, "learning_rate": 0.000297, "loss": 7.1011, "mean_token_accuracy": 0.09272942468523979, "num_tokens": 1284001.0, "step": 595 }, { "entropy": 7.443050575256348, "epoch": 0.03506926179203928, "grad_norm": 1.1640625, "learning_rate": 0.0002995, "loss": 7.1401, "mean_token_accuracy": 0.08779146820306778, "num_tokens": 1294671.0, "step": 600 }, { "entropy": 7.328179550170899, "epoch": 0.035361505640306275, "grad_norm": 1.078125, "learning_rate": 0.000302, "loss": 7.1451, "mean_token_accuracy": 0.09261744394898415, "num_tokens": 1305397.0, "step": 605 }, { "entropy": 7.390170431137085, "epoch": 0.035653749488573264, "grad_norm": 1.359375, "learning_rate": 0.0003045, "loss": 7.1696, "mean_token_accuracy": 0.08689776062965393, "num_tokens": 1317449.0, "step": 610 }, { "entropy": 7.28363561630249, "epoch": 0.03594599333684026, "grad_norm": 1.3046875, "learning_rate": 0.000307, "loss": 7.0866, "mean_token_accuracy": 0.08486035652458668, "num_tokens": 1328645.0, "step": 615 }, { "entropy": 7.2835465431213375, "epoch": 0.036238237185107255, "grad_norm": 1.015625, "learning_rate": 0.0003095, "loss": 7.091, "mean_token_accuracy": 0.0892544224858284, "num_tokens": 1339815.0, "step": 620 }, { "entropy": 7.290801572799682, "epoch": 0.036530481033374244, "grad_norm": 1.1640625, "learning_rate": 0.000312, "loss": 7.0954, "mean_token_accuracy": 0.08872693330049515, "num_tokens": 1350301.0, "step": 625 }, { "entropy": 7.280572080612183, "epoch": 0.03682272488164124, "grad_norm": 1.015625, "learning_rate": 0.0003145, "loss": 7.0829, "mean_token_accuracy": 0.09459017589688301, "num_tokens": 1360928.0, "step": 630 }, { "entropy": 7.34552264213562, "epoch": 0.037114968729908236, "grad_norm": 1.109375, "learning_rate": 0.000317, "loss": 7.1047, "mean_token_accuracy": 0.08707956597208977, "num_tokens": 1371618.0, "step": 635 }, { "entropy": 7.211892175674438, "epoch": 0.03740721257817523, "grad_norm": 1.015625, "learning_rate": 0.0003195, "loss": 7.0702, "mean_token_accuracy": 0.0876346081495285, "num_tokens": 1382824.0, "step": 640 }, { "entropy": 7.2274785995483395, "epoch": 0.03769945642644222, "grad_norm": 0.99609375, "learning_rate": 0.000322, "loss": 7.0401, "mean_token_accuracy": 0.09252982586622238, "num_tokens": 1393244.0, "step": 645 }, { "entropy": 7.224736738204956, "epoch": 0.03799170027470922, "grad_norm": 1.1796875, "learning_rate": 0.00032450000000000003, "loss": 7.0136, "mean_token_accuracy": 0.09895449355244637, "num_tokens": 1403469.0, "step": 650 }, { "entropy": 7.358276271820069, "epoch": 0.03828394412297621, "grad_norm": 0.98828125, "learning_rate": 0.00032700000000000003, "loss": 7.086, "mean_token_accuracy": 0.09135140627622604, "num_tokens": 1413860.0, "step": 655 }, { "entropy": 7.256574583053589, "epoch": 0.03857618797124321, "grad_norm": 1.1484375, "learning_rate": 0.00032950000000000004, "loss": 7.1348, "mean_token_accuracy": 0.08090706467628479, "num_tokens": 1423985.0, "step": 660 }, { "entropy": 7.278745222091675, "epoch": 0.0388684318195102, "grad_norm": 1.1328125, "learning_rate": 0.00033200000000000005, "loss": 7.087, "mean_token_accuracy": 0.09359103664755822, "num_tokens": 1434838.0, "step": 665 }, { "entropy": 7.2903660297393795, "epoch": 0.039160675667777194, "grad_norm": 1.28125, "learning_rate": 0.00033450000000000005, "loss": 7.007, "mean_token_accuracy": 0.08955025300383568, "num_tokens": 1446429.0, "step": 670 }, { "entropy": 7.332035541534424, "epoch": 0.03945291951604419, "grad_norm": 1.1640625, "learning_rate": 0.000337, "loss": 7.1183, "mean_token_accuracy": 0.08762314394116402, "num_tokens": 1456726.0, "step": 675 }, { "entropy": 7.197989416122437, "epoch": 0.03974516336431118, "grad_norm": 1.25, "learning_rate": 0.0003395, "loss": 7.0058, "mean_token_accuracy": 0.09932290315628052, "num_tokens": 1466378.0, "step": 680 }, { "entropy": 7.104801225662231, "epoch": 0.040037407212578174, "grad_norm": 1.9140625, "learning_rate": 0.000342, "loss": 6.9835, "mean_token_accuracy": 0.09476312026381492, "num_tokens": 1477755.0, "step": 685 }, { "entropy": 7.237457656860352, "epoch": 0.04032965106084517, "grad_norm": 1.21875, "learning_rate": 0.00034449999999999997, "loss": 7.036, "mean_token_accuracy": 0.08923429250717163, "num_tokens": 1488209.0, "step": 690 }, { "entropy": 7.137836837768555, "epoch": 0.040621894909112166, "grad_norm": 1.1484375, "learning_rate": 0.000347, "loss": 7.0728, "mean_token_accuracy": 0.08890949785709382, "num_tokens": 1498658.0, "step": 695 }, { "entropy": 7.236037731170654, "epoch": 0.040914138757379155, "grad_norm": 1.1015625, "learning_rate": 0.0003495, "loss": 7.0789, "mean_token_accuracy": 0.0860823355615139, "num_tokens": 1509766.0, "step": 700 }, { "entropy": 7.218784284591675, "epoch": 0.04120638260564615, "grad_norm": 1.671875, "learning_rate": 0.000352, "loss": 6.975, "mean_token_accuracy": 0.0937421977519989, "num_tokens": 1521139.0, "step": 705 }, { "entropy": 7.174445295333863, "epoch": 0.04149862645391315, "grad_norm": 1.171875, "learning_rate": 0.0003545, "loss": 7.0357, "mean_token_accuracy": 0.0900140330195427, "num_tokens": 1531875.0, "step": 710 }, { "entropy": 7.153319358825684, "epoch": 0.041790870302180136, "grad_norm": 1.203125, "learning_rate": 0.000357, "loss": 7.0205, "mean_token_accuracy": 0.08912704512476921, "num_tokens": 1542678.0, "step": 715 }, { "entropy": 7.196989250183106, "epoch": 0.04208311415044713, "grad_norm": 1.1328125, "learning_rate": 0.0003595, "loss": 6.9703, "mean_token_accuracy": 0.09389843866229057, "num_tokens": 1553882.0, "step": 720 }, { "entropy": 7.12842378616333, "epoch": 0.04237535799871413, "grad_norm": 1.0234375, "learning_rate": 0.000362, "loss": 7.0568, "mean_token_accuracy": 0.0915483608841896, "num_tokens": 1564854.0, "step": 725 }, { "entropy": 7.176506567001343, "epoch": 0.042667601846981124, "grad_norm": 1.015625, "learning_rate": 0.0003645, "loss": 6.9303, "mean_token_accuracy": 0.09940993562340736, "num_tokens": 1576112.0, "step": 730 }, { "entropy": 7.137564849853516, "epoch": 0.04295984569524811, "grad_norm": 1.1484375, "learning_rate": 0.000367, "loss": 6.9771, "mean_token_accuracy": 0.0963865041732788, "num_tokens": 1586235.0, "step": 735 }, { "entropy": 7.083181285858155, "epoch": 0.04325208954351511, "grad_norm": 2.046875, "learning_rate": 0.0003695, "loss": 6.9769, "mean_token_accuracy": 0.09416570290923118, "num_tokens": 1596727.0, "step": 740 }, { "entropy": 7.099421977996826, "epoch": 0.043544333391782104, "grad_norm": 1.0703125, "learning_rate": 0.000372, "loss": 6.8926, "mean_token_accuracy": 0.09487500786781311, "num_tokens": 1607008.0, "step": 745 }, { "entropy": 7.178588104248047, "epoch": 0.0438365772400491, "grad_norm": 1.125, "learning_rate": 0.0003745, "loss": 6.9975, "mean_token_accuracy": 0.0891700565814972, "num_tokens": 1618081.0, "step": 750 }, { "entropy": 7.064407539367676, "epoch": 0.04412882108831609, "grad_norm": 1.0234375, "learning_rate": 0.000377, "loss": 6.9569, "mean_token_accuracy": 0.08645836561918259, "num_tokens": 1629095.0, "step": 755 }, { "entropy": 7.101617288589478, "epoch": 0.044421064936583085, "grad_norm": 1.0234375, "learning_rate": 0.0003795, "loss": 6.9537, "mean_token_accuracy": 0.0951661191880703, "num_tokens": 1639861.0, "step": 760 }, { "entropy": 7.189848804473877, "epoch": 0.04471330878485008, "grad_norm": 1.2265625, "learning_rate": 0.000382, "loss": 7.0003, "mean_token_accuracy": 0.09473721534013749, "num_tokens": 1649169.0, "step": 765 }, { "entropy": 6.957789611816406, "epoch": 0.04500555263311707, "grad_norm": 1.0234375, "learning_rate": 0.0003845, "loss": 6.8833, "mean_token_accuracy": 0.10007616281509399, "num_tokens": 1658528.0, "step": 770 }, { "entropy": 7.049975156784058, "epoch": 0.045297796481384066, "grad_norm": 1.0703125, "learning_rate": 0.00038700000000000003, "loss": 6.9657, "mean_token_accuracy": 0.09249654635787011, "num_tokens": 1669231.0, "step": 775 }, { "entropy": 7.0429846286773685, "epoch": 0.04559004032965106, "grad_norm": 1.171875, "learning_rate": 0.00038950000000000003, "loss": 6.8987, "mean_token_accuracy": 0.09256255626678467, "num_tokens": 1680503.0, "step": 780 }, { "entropy": 7.069688749313355, "epoch": 0.04588228417791806, "grad_norm": 0.9921875, "learning_rate": 0.00039200000000000004, "loss": 6.9239, "mean_token_accuracy": 0.09164713248610497, "num_tokens": 1690827.0, "step": 785 }, { "entropy": 7.1588634014129635, "epoch": 0.04617452802618505, "grad_norm": 1.1171875, "learning_rate": 0.00039450000000000005, "loss": 6.992, "mean_token_accuracy": 0.09126574769616128, "num_tokens": 1702931.0, "step": 790 }, { "entropy": 6.960534286499024, "epoch": 0.04646677187445204, "grad_norm": 1.1640625, "learning_rate": 0.00039700000000000005, "loss": 6.8832, "mean_token_accuracy": 0.09681101739406586, "num_tokens": 1712834.0, "step": 795 }, { "entropy": 7.059118413925171, "epoch": 0.04675901572271904, "grad_norm": 1.078125, "learning_rate": 0.0003995, "loss": 6.9505, "mean_token_accuracy": 0.09173840507864953, "num_tokens": 1723289.0, "step": 800 }, { "entropy": 6.98992805480957, "epoch": 0.04705125957098603, "grad_norm": 1.15625, "learning_rate": 0.000402, "loss": 6.9111, "mean_token_accuracy": 0.09471877589821816, "num_tokens": 1734477.0, "step": 805 }, { "entropy": 7.110216426849365, "epoch": 0.04734350341925302, "grad_norm": 1.078125, "learning_rate": 0.0004045, "loss": 6.9201, "mean_token_accuracy": 0.09181275144219399, "num_tokens": 1745187.0, "step": 810 }, { "entropy": 6.9768541812896725, "epoch": 0.04763574726752002, "grad_norm": 1.1875, "learning_rate": 0.00040699999999999997, "loss": 6.8563, "mean_token_accuracy": 0.09723289534449578, "num_tokens": 1756687.0, "step": 815 }, { "entropy": 7.012206411361694, "epoch": 0.047927991115787015, "grad_norm": 1.0078125, "learning_rate": 0.0004095, "loss": 6.9795, "mean_token_accuracy": 0.09605197682976722, "num_tokens": 1767928.0, "step": 820 }, { "entropy": 7.063567161560059, "epoch": 0.048220234964054004, "grad_norm": 1.0625, "learning_rate": 0.000412, "loss": 6.9206, "mean_token_accuracy": 0.0963786244392395, "num_tokens": 1777951.0, "step": 825 }, { "entropy": 6.963260746002197, "epoch": 0.048512478812321, "grad_norm": 1.046875, "learning_rate": 0.0004145, "loss": 6.9047, "mean_token_accuracy": 0.09518637284636497, "num_tokens": 1788598.0, "step": 830 }, { "entropy": 7.022843551635742, "epoch": 0.048804722660587996, "grad_norm": 1.0703125, "learning_rate": 0.000417, "loss": 6.8708, "mean_token_accuracy": 0.0998458556830883, "num_tokens": 1799446.0, "step": 835 }, { "entropy": 7.028498888015747, "epoch": 0.04909696650885499, "grad_norm": 0.984375, "learning_rate": 0.0004195, "loss": 6.8757, "mean_token_accuracy": 0.0957573838531971, "num_tokens": 1809687.0, "step": 840 }, { "entropy": 6.976888608932495, "epoch": 0.04938921035712198, "grad_norm": 1.1953125, "learning_rate": 0.000422, "loss": 6.9107, "mean_token_accuracy": 0.09788398742675782, "num_tokens": 1820535.0, "step": 845 }, { "entropy": 6.943860197067261, "epoch": 0.04968145420538898, "grad_norm": 1.6640625, "learning_rate": 0.0004245, "loss": 6.8376, "mean_token_accuracy": 0.09310686662793159, "num_tokens": 1830834.0, "step": 850 }, { "entropy": 6.961981105804443, "epoch": 0.04997369805365597, "grad_norm": 1.078125, "learning_rate": 0.000427, "loss": 6.8257, "mean_token_accuracy": 0.0944649763405323, "num_tokens": 1842615.0, "step": 855 }, { "entropy": 6.919750738143921, "epoch": 0.05026594190192296, "grad_norm": 1.03125, "learning_rate": 0.0004295, "loss": 6.8328, "mean_token_accuracy": 0.09815948903560638, "num_tokens": 1852844.0, "step": 860 }, { "entropy": 6.876930141448975, "epoch": 0.05055818575018996, "grad_norm": 1.046875, "learning_rate": 0.000432, "loss": 6.8918, "mean_token_accuracy": 0.09418935924768448, "num_tokens": 1862528.0, "step": 865 }, { "entropy": 6.934880113601684, "epoch": 0.05085042959845695, "grad_norm": 0.98046875, "learning_rate": 0.0004345, "loss": 6.8469, "mean_token_accuracy": 0.10216829851269722, "num_tokens": 1873275.0, "step": 870 }, { "entropy": 6.956448936462403, "epoch": 0.05114267344672395, "grad_norm": 1.03125, "learning_rate": 0.000437, "loss": 6.8847, "mean_token_accuracy": 0.09507919698953629, "num_tokens": 1884724.0, "step": 875 }, { "entropy": 7.051344537734986, "epoch": 0.05143491729499094, "grad_norm": 1.125, "learning_rate": 0.0004395, "loss": 6.8598, "mean_token_accuracy": 0.09828044772148133, "num_tokens": 1894705.0, "step": 880 }, { "entropy": 6.862812566757202, "epoch": 0.051727161143257934, "grad_norm": 1.0, "learning_rate": 0.000442, "loss": 6.9184, "mean_token_accuracy": 0.09541104733943939, "num_tokens": 1906553.0, "step": 885 }, { "entropy": 7.020113182067871, "epoch": 0.05201940499152493, "grad_norm": 1.0859375, "learning_rate": 0.0004445, "loss": 6.8544, "mean_token_accuracy": 0.10240027904510499, "num_tokens": 1916628.0, "step": 890 }, { "entropy": 6.766639471054077, "epoch": 0.052311648839791926, "grad_norm": 1.203125, "learning_rate": 0.000447, "loss": 6.6849, "mean_token_accuracy": 0.11086282283067703, "num_tokens": 1926686.0, "step": 895 }, { "entropy": 6.947674942016602, "epoch": 0.052603892688058915, "grad_norm": 1.59375, "learning_rate": 0.00044950000000000003, "loss": 6.8638, "mean_token_accuracy": 0.09778930097818375, "num_tokens": 1938150.0, "step": 900 }, { "entropy": 6.891585969924927, "epoch": 0.05289613653632591, "grad_norm": 1.046875, "learning_rate": 0.00045200000000000004, "loss": 6.873, "mean_token_accuracy": 0.09291322231292724, "num_tokens": 1948617.0, "step": 905 }, { "entropy": 6.900164985656739, "epoch": 0.053188380384592907, "grad_norm": 1.0703125, "learning_rate": 0.00045450000000000004, "loss": 6.8565, "mean_token_accuracy": 0.09954984486103058, "num_tokens": 1958943.0, "step": 910 }, { "entropy": 6.856646156311035, "epoch": 0.053480624232859895, "grad_norm": 0.953125, "learning_rate": 0.00045700000000000005, "loss": 6.7881, "mean_token_accuracy": 0.10126558542251587, "num_tokens": 1968988.0, "step": 915 }, { "entropy": 6.895283889770508, "epoch": 0.05377286808112689, "grad_norm": 0.99609375, "learning_rate": 0.00045950000000000006, "loss": 6.7692, "mean_token_accuracy": 0.10075787082314491, "num_tokens": 1979490.0, "step": 920 }, { "entropy": 6.938627767562866, "epoch": 0.05406511192939389, "grad_norm": 0.97265625, "learning_rate": 0.000462, "loss": 6.8187, "mean_token_accuracy": 0.10156044065952301, "num_tokens": 1990377.0, "step": 925 }, { "entropy": 6.881887578964234, "epoch": 0.05435735577766088, "grad_norm": 1.03125, "learning_rate": 0.0004645, "loss": 6.7914, "mean_token_accuracy": 0.09942576885223389, "num_tokens": 2001678.0, "step": 930 }, { "entropy": 6.809711265563965, "epoch": 0.05464959962592787, "grad_norm": 1.1171875, "learning_rate": 0.000467, "loss": 6.7898, "mean_token_accuracy": 0.11002987027168273, "num_tokens": 2011550.0, "step": 935 }, { "entropy": 6.853000497817993, "epoch": 0.05494184347419487, "grad_norm": 1.1015625, "learning_rate": 0.0004695, "loss": 6.8297, "mean_token_accuracy": 0.10066121965646743, "num_tokens": 2021607.0, "step": 940 }, { "entropy": 6.862749242782593, "epoch": 0.055234087322461864, "grad_norm": 1.0859375, "learning_rate": 0.000472, "loss": 6.8211, "mean_token_accuracy": 0.09814092963933944, "num_tokens": 2030975.0, "step": 945 }, { "entropy": 6.836636781692505, "epoch": 0.05552633117072885, "grad_norm": 1.03125, "learning_rate": 0.0004745, "loss": 6.8844, "mean_token_accuracy": 0.09624653086066245, "num_tokens": 2041799.0, "step": 950 }, { "entropy": 6.891287755966187, "epoch": 0.05581857501899585, "grad_norm": 1.109375, "learning_rate": 0.000477, "loss": 6.7935, "mean_token_accuracy": 0.10220010504126549, "num_tokens": 2052960.0, "step": 955 }, { "entropy": 6.868294525146484, "epoch": 0.056110818867262845, "grad_norm": 1.0390625, "learning_rate": 0.0004795, "loss": 6.8472, "mean_token_accuracy": 0.09924568086862565, "num_tokens": 2064156.0, "step": 960 }, { "entropy": 6.914956092834473, "epoch": 0.05640306271552984, "grad_norm": 1.03125, "learning_rate": 0.000482, "loss": 6.8016, "mean_token_accuracy": 0.100481665879488, "num_tokens": 2074774.0, "step": 965 }, { "entropy": 6.793342113494873, "epoch": 0.05669530656379683, "grad_norm": 0.9140625, "learning_rate": 0.0004845, "loss": 6.8288, "mean_token_accuracy": 0.09989185482263566, "num_tokens": 2086164.0, "step": 970 }, { "entropy": 6.78997688293457, "epoch": 0.056987550412063825, "grad_norm": 1.2578125, "learning_rate": 0.000487, "loss": 6.6708, "mean_token_accuracy": 0.1248696506023407, "num_tokens": 2096268.0, "step": 975 }, { "entropy": 6.888183069229126, "epoch": 0.05727979426033082, "grad_norm": 1.125, "learning_rate": 0.0004895, "loss": 6.8985, "mean_token_accuracy": 0.09069314152002335, "num_tokens": 2108511.0, "step": 980 }, { "entropy": 6.923859405517578, "epoch": 0.05757203810859782, "grad_norm": 1.03125, "learning_rate": 0.000492, "loss": 6.8155, "mean_token_accuracy": 0.09430013298988342, "num_tokens": 2119622.0, "step": 985 }, { "entropy": 6.742640447616577, "epoch": 0.057864281956864806, "grad_norm": 0.953125, "learning_rate": 0.0004945, "loss": 6.8703, "mean_token_accuracy": 0.10323725119233132, "num_tokens": 2131021.0, "step": 990 }, { "entropy": 6.867950057983398, "epoch": 0.0581565258051318, "grad_norm": 1.046875, "learning_rate": 0.000497, "loss": 6.8448, "mean_token_accuracy": 0.10064574256539345, "num_tokens": 2141797.0, "step": 995 }, { "entropy": 6.782402372360229, "epoch": 0.0584487696533988, "grad_norm": 1.171875, "learning_rate": 0.0004995, "loss": 6.7141, "mean_token_accuracy": 0.09859876409173012, "num_tokens": 2153609.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3212952975360000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }