{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.1753463089601964, "eval_steps": 500, "global_step": 3000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691908264160157, "epoch": 0.000292243848266994, "grad_norm": 12.625, "learning_rate": 2e-06, "loss": 10.8406, "mean_token_accuracy": 0.0, "num_tokens": 11114.0, "step": 5 }, { "entropy": 10.691956710815429, "epoch": 0.000584487696533988, "grad_norm": 13.375, "learning_rate": 4.5e-06, "loss": 10.7353, "mean_token_accuracy": 0.00011737089371308685, "num_tokens": 20935.0, "step": 10 }, { "entropy": 10.690714645385743, "epoch": 0.000876731544800982, "grad_norm": 9.4375, "learning_rate": 7e-06, "loss": 10.5144, "mean_token_accuracy": 0.03050256703281775, "num_tokens": 31930.0, "step": 15 }, { "entropy": 10.654311275482177, "epoch": 0.001168975393067976, "grad_norm": 5.96875, "learning_rate": 9.5e-06, "loss": 10.1606, "mean_token_accuracy": 0.05743609480559826, "num_tokens": 41672.0, "step": 20 }, { "entropy": 10.475521564483643, "epoch": 0.00146121924133497, "grad_norm": 3.90625, "learning_rate": 1.2e-05, "loss": 9.9607, "mean_token_accuracy": 0.05290710777044296, "num_tokens": 52510.0, "step": 25 }, { "entropy": 10.543301010131836, "epoch": 0.001753463089601964, "grad_norm": 3.75, "learning_rate": 1.4500000000000002e-05, "loss": 9.8154, "mean_token_accuracy": 0.045297696441411975, "num_tokens": 63214.0, "step": 30 }, { "entropy": 10.49622220993042, "epoch": 0.002045706937868958, "grad_norm": 2.5, "learning_rate": 1.7000000000000003e-05, "loss": 9.7008, "mean_token_accuracy": 0.05302377603948116, "num_tokens": 73942.0, "step": 35 }, { "entropy": 10.475418663024902, "epoch": 0.002337950786135952, "grad_norm": 2.375, "learning_rate": 1.95e-05, "loss": 9.7051, "mean_token_accuracy": 0.05076396390795708, "num_tokens": 84526.0, "step": 40 }, { "entropy": 10.52062005996704, "epoch": 0.0026301946344029457, "grad_norm": 2.234375, "learning_rate": 2.2e-05, "loss": 9.7003, "mean_token_accuracy": 0.04803669825196266, "num_tokens": 95178.0, "step": 45 }, { "entropy": 10.508524227142335, "epoch": 0.00292243848266994, "grad_norm": 2.3125, "learning_rate": 2.4500000000000003e-05, "loss": 9.6047, "mean_token_accuracy": 0.05312369242310524, "num_tokens": 106653.0, "step": 50 }, { "entropy": 10.445098209381104, "epoch": 0.0032146823309369336, "grad_norm": 2.25, "learning_rate": 2.7e-05, "loss": 9.4922, "mean_token_accuracy": 0.058677663654088975, "num_tokens": 115969.0, "step": 55 }, { "entropy": 10.33490447998047, "epoch": 0.003506926179203928, "grad_norm": 2.09375, "learning_rate": 2.95e-05, "loss": 9.469, "mean_token_accuracy": 0.06182386502623558, "num_tokens": 125826.0, "step": 60 }, { "entropy": 10.331936168670655, "epoch": 0.0037991700274709215, "grad_norm": 2.3125, "learning_rate": 3.2e-05, "loss": 9.4398, "mean_token_accuracy": 0.06020851917564869, "num_tokens": 136677.0, "step": 65 }, { "entropy": 10.381442165374756, "epoch": 0.004091413875737916, "grad_norm": 2.03125, "learning_rate": 3.4500000000000005e-05, "loss": 9.3696, "mean_token_accuracy": 0.05836572460830212, "num_tokens": 147535.0, "step": 70 }, { "entropy": 10.336608695983887, "epoch": 0.00438365772400491, "grad_norm": 2.046875, "learning_rate": 3.7e-05, "loss": 9.2591, "mean_token_accuracy": 0.06145334914326668, "num_tokens": 157524.0, "step": 75 }, { "entropy": 10.270106220245362, "epoch": 0.004675901572271904, "grad_norm": 1.6953125, "learning_rate": 3.95e-05, "loss": 9.1922, "mean_token_accuracy": 0.063629350066185, "num_tokens": 168344.0, "step": 80 }, { "entropy": 10.35278034210205, "epoch": 0.004968145420538897, "grad_norm": 1.953125, "learning_rate": 4.2000000000000004e-05, "loss": 9.14, "mean_token_accuracy": 0.05551427491009235, "num_tokens": 178976.0, "step": 85 }, { "entropy": 10.23039789199829, "epoch": 0.0052603892688058915, "grad_norm": 1.8046875, "learning_rate": 4.45e-05, "loss": 9.0429, "mean_token_accuracy": 0.06621964909136295, "num_tokens": 190567.0, "step": 90 }, { "entropy": 10.196823787689208, "epoch": 0.005552633117072886, "grad_norm": 1.8671875, "learning_rate": 4.7000000000000004e-05, "loss": 8.9449, "mean_token_accuracy": 0.07107578478753566, "num_tokens": 201587.0, "step": 95 }, { "entropy": 10.113740062713623, "epoch": 0.00584487696533988, "grad_norm": 1.6953125, "learning_rate": 4.9500000000000004e-05, "loss": 8.8501, "mean_token_accuracy": 0.06472622714936734, "num_tokens": 211913.0, "step": 100 }, { "entropy": 10.149368000030517, "epoch": 0.006137120813606874, "grad_norm": 1.8046875, "learning_rate": 5.2e-05, "loss": 8.7762, "mean_token_accuracy": 0.06379772424697876, "num_tokens": 222247.0, "step": 105 }, { "entropy": 9.989063167572022, "epoch": 0.006429364661873867, "grad_norm": 1.46875, "learning_rate": 5.45e-05, "loss": 8.6212, "mean_token_accuracy": 0.07087173387408256, "num_tokens": 232361.0, "step": 110 }, { "entropy": 9.965903949737548, "epoch": 0.006721608510140861, "grad_norm": 1.578125, "learning_rate": 5.7e-05, "loss": 8.5651, "mean_token_accuracy": 0.06980551891028881, "num_tokens": 242885.0, "step": 115 }, { "entropy": 9.803161907196046, "epoch": 0.007013852358407856, "grad_norm": 1.453125, "learning_rate": 5.9499999999999996e-05, "loss": 8.4687, "mean_token_accuracy": 0.06787880472838878, "num_tokens": 254482.0, "step": 120 }, { "entropy": 9.760642433166504, "epoch": 0.00730609620667485, "grad_norm": 1.40625, "learning_rate": 6.2e-05, "loss": 8.3483, "mean_token_accuracy": 0.06577648222446442, "num_tokens": 265744.0, "step": 125 }, { "entropy": 9.514495658874512, "epoch": 0.007598340054941843, "grad_norm": 1.1640625, "learning_rate": 6.450000000000001e-05, "loss": 8.2621, "mean_token_accuracy": 0.0672954872250557, "num_tokens": 276924.0, "step": 130 }, { "entropy": 9.37683687210083, "epoch": 0.007890583903208837, "grad_norm": 1.375, "learning_rate": 6.7e-05, "loss": 8.1773, "mean_token_accuracy": 0.07101362608373166, "num_tokens": 287779.0, "step": 135 }, { "entropy": 9.18982000350952, "epoch": 0.008182827751475831, "grad_norm": 1.3046875, "learning_rate": 6.950000000000001e-05, "loss": 8.1052, "mean_token_accuracy": 0.07210481017827988, "num_tokens": 298807.0, "step": 140 }, { "entropy": 9.113053703308106, "epoch": 0.008475071599742826, "grad_norm": 1.09375, "learning_rate": 7.2e-05, "loss": 8.1007, "mean_token_accuracy": 0.061491196230053904, "num_tokens": 309760.0, "step": 145 }, { "entropy": 8.824873638153075, "epoch": 0.00876731544800982, "grad_norm": 0.99609375, "learning_rate": 7.45e-05, "loss": 7.9698, "mean_token_accuracy": 0.0695835679769516, "num_tokens": 319750.0, "step": 150 }, { "entropy": 8.6828182220459, "epoch": 0.009059559296276814, "grad_norm": 1.0390625, "learning_rate": 7.7e-05, "loss": 7.8822, "mean_token_accuracy": 0.07002829425036908, "num_tokens": 329931.0, "step": 155 }, { "entropy": 8.598028564453125, "epoch": 0.009351803144543808, "grad_norm": 1.171875, "learning_rate": 7.950000000000001e-05, "loss": 7.9106, "mean_token_accuracy": 0.06758572831749916, "num_tokens": 340457.0, "step": 160 }, { "entropy": 8.501685905456544, "epoch": 0.009644046992810802, "grad_norm": 1.15625, "learning_rate": 8.2e-05, "loss": 7.8105, "mean_token_accuracy": 0.07629426941275597, "num_tokens": 352450.0, "step": 165 }, { "entropy": 8.418387317657471, "epoch": 0.009936290841077795, "grad_norm": 1.15625, "learning_rate": 8.450000000000001e-05, "loss": 7.8297, "mean_token_accuracy": 0.07713140919804573, "num_tokens": 363204.0, "step": 170 }, { "entropy": 8.363510417938233, "epoch": 0.010228534689344789, "grad_norm": 0.9765625, "learning_rate": 8.7e-05, "loss": 7.8784, "mean_token_accuracy": 0.06442252397537232, "num_tokens": 373577.0, "step": 175 }, { "entropy": 8.313191223144532, "epoch": 0.010520778537611783, "grad_norm": 0.98046875, "learning_rate": 8.95e-05, "loss": 7.7833, "mean_token_accuracy": 0.07531154453754425, "num_tokens": 384267.0, "step": 180 }, { "entropy": 8.214359951019286, "epoch": 0.010813022385878777, "grad_norm": 1.078125, "learning_rate": 9.2e-05, "loss": 7.7491, "mean_token_accuracy": 0.06811888329684734, "num_tokens": 394767.0, "step": 185 }, { "entropy": 8.22794075012207, "epoch": 0.011105266234145771, "grad_norm": 1.15625, "learning_rate": 9.45e-05, "loss": 7.7665, "mean_token_accuracy": 0.07282254844903946, "num_tokens": 405807.0, "step": 190 }, { "entropy": 8.217875862121582, "epoch": 0.011397510082412765, "grad_norm": 1.1484375, "learning_rate": 9.7e-05, "loss": 7.7191, "mean_token_accuracy": 0.06757043041288853, "num_tokens": 416381.0, "step": 195 }, { "entropy": 8.152586936950684, "epoch": 0.01168975393067976, "grad_norm": 1.25, "learning_rate": 9.95e-05, "loss": 7.8287, "mean_token_accuracy": 0.07003305219113827, "num_tokens": 427262.0, "step": 200 }, { "entropy": 8.141828060150146, "epoch": 0.011981997778946754, "grad_norm": 1.2734375, "learning_rate": 0.000102, "loss": 7.7651, "mean_token_accuracy": 0.0717297799885273, "num_tokens": 438504.0, "step": 205 }, { "entropy": 8.196744251251221, "epoch": 0.012274241627213748, "grad_norm": 1.0625, "learning_rate": 0.00010449999999999999, "loss": 7.7513, "mean_token_accuracy": 0.07213160172104835, "num_tokens": 449923.0, "step": 210 }, { "entropy": 8.13697328567505, "epoch": 0.01256648547548074, "grad_norm": 0.9921875, "learning_rate": 0.000107, "loss": 7.7046, "mean_token_accuracy": 0.07478658258914947, "num_tokens": 460736.0, "step": 215 }, { "entropy": 8.1306658744812, "epoch": 0.012858729323747735, "grad_norm": 1.03125, "learning_rate": 0.0001095, "loss": 7.8163, "mean_token_accuracy": 0.06586915515363216, "num_tokens": 471513.0, "step": 220 }, { "entropy": 8.089940357208253, "epoch": 0.013150973172014729, "grad_norm": 1.1015625, "learning_rate": 0.000112, "loss": 7.6608, "mean_token_accuracy": 0.07503279075026512, "num_tokens": 482115.0, "step": 225 }, { "entropy": 8.06955795288086, "epoch": 0.013443217020281723, "grad_norm": 1.046875, "learning_rate": 0.0001145, "loss": 7.6789, "mean_token_accuracy": 0.07244161255657673, "num_tokens": 493273.0, "step": 230 }, { "entropy": 8.088439989089967, "epoch": 0.013735460868548717, "grad_norm": 0.921875, "learning_rate": 0.00011700000000000001, "loss": 7.7067, "mean_token_accuracy": 0.07398871332406998, "num_tokens": 503939.0, "step": 235 }, { "entropy": 8.001152181625367, "epoch": 0.014027704716815711, "grad_norm": 0.8671875, "learning_rate": 0.00011949999999999999, "loss": 7.6139, "mean_token_accuracy": 0.07592850960791112, "num_tokens": 515215.0, "step": 240 }, { "entropy": 7.98775544166565, "epoch": 0.014319948565082705, "grad_norm": 1.046875, "learning_rate": 0.000122, "loss": 7.7051, "mean_token_accuracy": 0.07671321779489518, "num_tokens": 526485.0, "step": 245 }, { "entropy": 8.02779312133789, "epoch": 0.0146121924133497, "grad_norm": 1.046875, "learning_rate": 0.0001245, "loss": 7.6616, "mean_token_accuracy": 0.07241038978099823, "num_tokens": 536735.0, "step": 250 }, { "entropy": 8.066807174682618, "epoch": 0.014904436261616694, "grad_norm": 0.9609375, "learning_rate": 0.000127, "loss": 7.7528, "mean_token_accuracy": 0.06985807269811631, "num_tokens": 547326.0, "step": 255 }, { "entropy": 7.9721503257751465, "epoch": 0.015196680109883686, "grad_norm": 1.015625, "learning_rate": 0.0001295, "loss": 7.6367, "mean_token_accuracy": 0.07485130280256272, "num_tokens": 558275.0, "step": 260 }, { "entropy": 7.969989395141601, "epoch": 0.01548892395815068, "grad_norm": 1.0, "learning_rate": 0.000132, "loss": 7.6104, "mean_token_accuracy": 0.0731944501399994, "num_tokens": 569711.0, "step": 265 }, { "entropy": 7.970643997192383, "epoch": 0.015781167806417674, "grad_norm": 0.96484375, "learning_rate": 0.00013450000000000002, "loss": 7.5828, "mean_token_accuracy": 0.07749090045690536, "num_tokens": 579602.0, "step": 270 }, { "entropy": 7.9638073444366455, "epoch": 0.01607341165468467, "grad_norm": 1.078125, "learning_rate": 0.00013700000000000002, "loss": 7.6231, "mean_token_accuracy": 0.07638676390051842, "num_tokens": 590899.0, "step": 275 }, { "entropy": 7.931737279891967, "epoch": 0.016365655502951663, "grad_norm": 1.046875, "learning_rate": 0.0001395, "loss": 7.6258, "mean_token_accuracy": 0.07663728073239326, "num_tokens": 602080.0, "step": 280 }, { "entropy": 7.949186515808106, "epoch": 0.016657899351218655, "grad_norm": 0.96484375, "learning_rate": 0.00014199999999999998, "loss": 7.6619, "mean_token_accuracy": 0.07214237600564957, "num_tokens": 613692.0, "step": 285 }, { "entropy": 7.928168773651123, "epoch": 0.01695014319948565, "grad_norm": 1.1015625, "learning_rate": 0.0001445, "loss": 7.6255, "mean_token_accuracy": 0.07801526971161366, "num_tokens": 625019.0, "step": 290 }, { "entropy": 7.858082962036133, "epoch": 0.017242387047752643, "grad_norm": 1.1328125, "learning_rate": 0.000147, "loss": 7.5324, "mean_token_accuracy": 0.07193354479968547, "num_tokens": 636453.0, "step": 295 }, { "entropy": 7.900658082962036, "epoch": 0.01753463089601964, "grad_norm": 0.9375, "learning_rate": 0.0001495, "loss": 7.5805, "mean_token_accuracy": 0.07368646003305912, "num_tokens": 647272.0, "step": 300 }, { "entropy": 7.980489492416382, "epoch": 0.017826874744286632, "grad_norm": 1.296875, "learning_rate": 0.000152, "loss": 7.5929, "mean_token_accuracy": 0.07068270668387414, "num_tokens": 657724.0, "step": 305 }, { "entropy": 7.874118614196777, "epoch": 0.018119118592553628, "grad_norm": 1.0859375, "learning_rate": 0.00015450000000000001, "loss": 7.5913, "mean_token_accuracy": 0.07631154656410218, "num_tokens": 669183.0, "step": 310 }, { "entropy": 7.852222537994384, "epoch": 0.01841136244082062, "grad_norm": 1.109375, "learning_rate": 0.000157, "loss": 7.5557, "mean_token_accuracy": 0.07173253633081914, "num_tokens": 680439.0, "step": 315 }, { "entropy": 7.902084875106811, "epoch": 0.018703606289087616, "grad_norm": 1.3046875, "learning_rate": 0.0001595, "loss": 7.6115, "mean_token_accuracy": 0.07198056317865849, "num_tokens": 690789.0, "step": 320 }, { "entropy": 7.909448766708374, "epoch": 0.01899585013735461, "grad_norm": 1.0234375, "learning_rate": 0.000162, "loss": 7.5829, "mean_token_accuracy": 0.07492739222943783, "num_tokens": 701818.0, "step": 325 }, { "entropy": 7.837027454376221, "epoch": 0.019288093985621604, "grad_norm": 1.3671875, "learning_rate": 0.00016450000000000001, "loss": 7.5366, "mean_token_accuracy": 0.07418245449662209, "num_tokens": 713344.0, "step": 330 }, { "entropy": 7.862662744522095, "epoch": 0.019580337833888597, "grad_norm": 1.3125, "learning_rate": 0.00016700000000000002, "loss": 7.5289, "mean_token_accuracy": 0.07505915723741055, "num_tokens": 723279.0, "step": 335 }, { "entropy": 7.862085199356079, "epoch": 0.01987258168215559, "grad_norm": 1.09375, "learning_rate": 0.00016950000000000003, "loss": 7.5211, "mean_token_accuracy": 0.07510280013084411, "num_tokens": 733875.0, "step": 340 }, { "entropy": 7.86326003074646, "epoch": 0.020164825530422585, "grad_norm": 1.15625, "learning_rate": 0.00017199999999999998, "loss": 7.5595, "mean_token_accuracy": 0.073441531509161, "num_tokens": 745449.0, "step": 345 }, { "entropy": 7.847935771942138, "epoch": 0.020457069378689578, "grad_norm": 1.0078125, "learning_rate": 0.00017449999999999999, "loss": 7.5717, "mean_token_accuracy": 0.07788249254226684, "num_tokens": 757570.0, "step": 350 }, { "entropy": 7.815750980377198, "epoch": 0.020749313226956573, "grad_norm": 1.0625, "learning_rate": 0.000177, "loss": 7.4513, "mean_token_accuracy": 0.08608488291501999, "num_tokens": 767601.0, "step": 355 }, { "entropy": 7.804518222808838, "epoch": 0.021041557075223566, "grad_norm": 1.1328125, "learning_rate": 0.0001795, "loss": 7.5134, "mean_token_accuracy": 0.07662104293704033, "num_tokens": 777852.0, "step": 360 }, { "entropy": 7.8234796047210695, "epoch": 0.021333800923490562, "grad_norm": 1.1015625, "learning_rate": 0.000182, "loss": 7.4728, "mean_token_accuracy": 0.07879027798771858, "num_tokens": 788339.0, "step": 365 }, { "entropy": 7.763150691986084, "epoch": 0.021626044771757554, "grad_norm": 1.0703125, "learning_rate": 0.0001845, "loss": 7.5509, "mean_token_accuracy": 0.07561626769602299, "num_tokens": 799791.0, "step": 370 }, { "entropy": 7.7915912628173825, "epoch": 0.02191828862002455, "grad_norm": 1.1328125, "learning_rate": 0.000187, "loss": 7.4559, "mean_token_accuracy": 0.07913151681423188, "num_tokens": 810141.0, "step": 375 }, { "entropy": 7.82445068359375, "epoch": 0.022210532468291543, "grad_norm": 0.984375, "learning_rate": 0.0001895, "loss": 7.4938, "mean_token_accuracy": 0.07601816579699516, "num_tokens": 820929.0, "step": 380 }, { "entropy": 7.806576347351074, "epoch": 0.022502776316558535, "grad_norm": 1.4765625, "learning_rate": 0.000192, "loss": 7.4415, "mean_token_accuracy": 0.07921079695224761, "num_tokens": 831340.0, "step": 385 }, { "entropy": 7.650366687774659, "epoch": 0.02279502016482553, "grad_norm": 1.109375, "learning_rate": 0.0001945, "loss": 7.4444, "mean_token_accuracy": 0.07921848297119141, "num_tokens": 841846.0, "step": 390 }, { "entropy": 7.847888851165772, "epoch": 0.023087264013092523, "grad_norm": 1.328125, "learning_rate": 0.00019700000000000002, "loss": 7.4322, "mean_token_accuracy": 0.0797240749001503, "num_tokens": 852089.0, "step": 395 }, { "entropy": 7.713356971740723, "epoch": 0.02337950786135952, "grad_norm": 1.203125, "learning_rate": 0.00019950000000000002, "loss": 7.4116, "mean_token_accuracy": 0.08028053492307663, "num_tokens": 862568.0, "step": 400 }, { "entropy": 7.74327917098999, "epoch": 0.02367175170962651, "grad_norm": 1.09375, "learning_rate": 0.000202, "loss": 7.4684, "mean_token_accuracy": 0.07664722427725792, "num_tokens": 874676.0, "step": 405 }, { "entropy": 7.674819469451904, "epoch": 0.023963995557893508, "grad_norm": 1.125, "learning_rate": 0.00020449999999999998, "loss": 7.3829, "mean_token_accuracy": 0.08288070000708103, "num_tokens": 886338.0, "step": 410 }, { "entropy": 7.71968150138855, "epoch": 0.0242562394061605, "grad_norm": 1.0546875, "learning_rate": 0.000207, "loss": 7.4114, "mean_token_accuracy": 0.07737804017961025, "num_tokens": 896671.0, "step": 415 }, { "entropy": 7.6655017852783205, "epoch": 0.024548483254427496, "grad_norm": 0.9921875, "learning_rate": 0.0002095, "loss": 7.3914, "mean_token_accuracy": 0.07870943620800971, "num_tokens": 908265.0, "step": 420 }, { "entropy": 7.6367028713226315, "epoch": 0.02484072710269449, "grad_norm": 1.0078125, "learning_rate": 0.000212, "loss": 7.3495, "mean_token_accuracy": 0.0839125782251358, "num_tokens": 919024.0, "step": 425 }, { "entropy": 7.721334648132324, "epoch": 0.02513297095096148, "grad_norm": 1.0859375, "learning_rate": 0.0002145, "loss": 7.3314, "mean_token_accuracy": 0.08483307361602783, "num_tokens": 930837.0, "step": 430 }, { "entropy": 7.614313220977783, "epoch": 0.025425214799228477, "grad_norm": 1.2109375, "learning_rate": 0.00021700000000000002, "loss": 7.3096, "mean_token_accuracy": 0.08256931453943253, "num_tokens": 941374.0, "step": 435 }, { "entropy": 7.603088331222534, "epoch": 0.02571745864749547, "grad_norm": 1.0859375, "learning_rate": 0.0002195, "loss": 7.2577, "mean_token_accuracy": 0.08504624664783478, "num_tokens": 953273.0, "step": 440 }, { "entropy": 7.580397319793701, "epoch": 0.026009702495762465, "grad_norm": 1.75, "learning_rate": 0.000222, "loss": 7.2375, "mean_token_accuracy": 0.0916403166949749, "num_tokens": 964882.0, "step": 445 }, { "entropy": 7.614603757858276, "epoch": 0.026301946344029457, "grad_norm": 1.34375, "learning_rate": 0.0002245, "loss": 7.4103, "mean_token_accuracy": 0.08159535191953182, "num_tokens": 974732.0, "step": 450 }, { "entropy": 7.595666790008545, "epoch": 0.026594190192296453, "grad_norm": 1.0859375, "learning_rate": 0.00022700000000000002, "loss": 7.3392, "mean_token_accuracy": 0.07731116712093353, "num_tokens": 985709.0, "step": 455 }, { "entropy": 7.649027681350708, "epoch": 0.026886434040563446, "grad_norm": 1.25, "learning_rate": 0.00022950000000000002, "loss": 7.3048, "mean_token_accuracy": 0.08609704971313477, "num_tokens": 998177.0, "step": 460 }, { "entropy": 7.5427803039550785, "epoch": 0.02717867788883044, "grad_norm": 1.1484375, "learning_rate": 0.00023200000000000003, "loss": 7.2407, "mean_token_accuracy": 0.08310350701212883, "num_tokens": 1008676.0, "step": 465 }, { "entropy": 7.5991309642791744, "epoch": 0.027470921737097434, "grad_norm": 1.0546875, "learning_rate": 0.00023449999999999998, "loss": 7.357, "mean_token_accuracy": 0.08094775602221489, "num_tokens": 1019951.0, "step": 470 }, { "entropy": 7.504101514816284, "epoch": 0.027763165585364426, "grad_norm": 1.2421875, "learning_rate": 0.000237, "loss": 7.2908, "mean_token_accuracy": 0.07796959653496742, "num_tokens": 1030219.0, "step": 475 }, { "entropy": 7.5679099559783936, "epoch": 0.028055409433631422, "grad_norm": 1.1484375, "learning_rate": 0.0002395, "loss": 7.3201, "mean_token_accuracy": 0.08201361894607544, "num_tokens": 1041911.0, "step": 480 }, { "entropy": 7.6739061832427975, "epoch": 0.028347653281898415, "grad_norm": 1.1171875, "learning_rate": 0.000242, "loss": 7.3237, "mean_token_accuracy": 0.08364914655685425, "num_tokens": 1052638.0, "step": 485 }, { "entropy": 7.5074201107025145, "epoch": 0.02863989713016541, "grad_norm": 1.140625, "learning_rate": 0.0002445, "loss": 7.2604, "mean_token_accuracy": 0.08207505084574222, "num_tokens": 1063465.0, "step": 490 }, { "entropy": 7.632791471481323, "epoch": 0.028932140978432403, "grad_norm": 1.078125, "learning_rate": 0.000247, "loss": 7.2625, "mean_token_accuracy": 0.08835876137018203, "num_tokens": 1073583.0, "step": 495 }, { "entropy": 7.605600214004516, "epoch": 0.0292243848266994, "grad_norm": 1.2109375, "learning_rate": 0.0002495, "loss": 7.327, "mean_token_accuracy": 0.08249956965446473, "num_tokens": 1083961.0, "step": 500 }, { "entropy": 7.432604742050171, "epoch": 0.02951662867496639, "grad_norm": 0.91796875, "learning_rate": 0.000252, "loss": 7.1818, "mean_token_accuracy": 0.08461034670472145, "num_tokens": 1095339.0, "step": 505 }, { "entropy": 7.534429121017456, "epoch": 0.029808872523233387, "grad_norm": 1.0390625, "learning_rate": 0.0002545, "loss": 7.2615, "mean_token_accuracy": 0.07991603463888168, "num_tokens": 1105518.0, "step": 510 }, { "entropy": 7.572704219818116, "epoch": 0.03010111637150038, "grad_norm": 0.94140625, "learning_rate": 0.000257, "loss": 7.1485, "mean_token_accuracy": 0.08869004771113395, "num_tokens": 1115666.0, "step": 515 }, { "entropy": 7.499062871932983, "epoch": 0.030393360219767372, "grad_norm": 1.3046875, "learning_rate": 0.0002595, "loss": 7.2854, "mean_token_accuracy": 0.08312782868742943, "num_tokens": 1125827.0, "step": 520 }, { "entropy": 7.49239444732666, "epoch": 0.030685604068034368, "grad_norm": 1.0078125, "learning_rate": 0.000262, "loss": 7.2312, "mean_token_accuracy": 0.08309667333960533, "num_tokens": 1136154.0, "step": 525 }, { "entropy": 7.477995872497559, "epoch": 0.03097784791630136, "grad_norm": 1.1640625, "learning_rate": 0.00026450000000000003, "loss": 7.2247, "mean_token_accuracy": 0.09041514843702317, "num_tokens": 1146392.0, "step": 530 }, { "entropy": 7.515807485580444, "epoch": 0.03127009176456835, "grad_norm": 1.2421875, "learning_rate": 0.00026700000000000004, "loss": 7.2327, "mean_token_accuracy": 0.08347614929080009, "num_tokens": 1157566.0, "step": 535 }, { "entropy": 7.408181762695312, "epoch": 0.03156233561283535, "grad_norm": 1.203125, "learning_rate": 0.00026950000000000005, "loss": 7.2244, "mean_token_accuracy": 0.08636801540851594, "num_tokens": 1167795.0, "step": 540 }, { "entropy": 7.55600643157959, "epoch": 0.031854579461102345, "grad_norm": 1.703125, "learning_rate": 0.00027200000000000005, "loss": 7.1614, "mean_token_accuracy": 0.09404403418302536, "num_tokens": 1178894.0, "step": 545 }, { "entropy": 7.379703378677368, "epoch": 0.03214682330936934, "grad_norm": 1.09375, "learning_rate": 0.0002745, "loss": 7.1863, "mean_token_accuracy": 0.08515683636069298, "num_tokens": 1189361.0, "step": 550 }, { "entropy": 7.44665265083313, "epoch": 0.03243906715763633, "grad_norm": 1.2421875, "learning_rate": 0.000277, "loss": 7.2063, "mean_token_accuracy": 0.08360610157251358, "num_tokens": 1198992.0, "step": 555 }, { "entropy": 7.450517177581787, "epoch": 0.032731311005903325, "grad_norm": 1.1640625, "learning_rate": 0.0002795, "loss": 7.1858, "mean_token_accuracy": 0.08214344829320908, "num_tokens": 1208732.0, "step": 560 }, { "entropy": 7.416987085342408, "epoch": 0.03302355485417032, "grad_norm": 1.1953125, "learning_rate": 0.00028199999999999997, "loss": 7.1961, "mean_token_accuracy": 0.08448583483695984, "num_tokens": 1219015.0, "step": 565 }, { "entropy": 7.383893156051636, "epoch": 0.03331579870243731, "grad_norm": 1.1328125, "learning_rate": 0.0002845, "loss": 7.0907, "mean_token_accuracy": 0.10338108763098716, "num_tokens": 1229227.0, "step": 570 }, { "entropy": 7.4993305683135985, "epoch": 0.033608042550704306, "grad_norm": 1.21875, "learning_rate": 0.000287, "loss": 7.2226, "mean_token_accuracy": 0.08231785595417022, "num_tokens": 1239654.0, "step": 575 }, { "entropy": 7.332780599594116, "epoch": 0.0339002863989713, "grad_norm": 1.0234375, "learning_rate": 0.0002895, "loss": 7.1941, "mean_token_accuracy": 0.08100020363926888, "num_tokens": 1250955.0, "step": 580 }, { "entropy": 7.445628499984741, "epoch": 0.0341925302472383, "grad_norm": 1.078125, "learning_rate": 0.000292, "loss": 7.1521, "mean_token_accuracy": 0.09030932411551476, "num_tokens": 1262574.0, "step": 585 }, { "entropy": 7.327143812179566, "epoch": 0.03448477409550529, "grad_norm": 1.046875, "learning_rate": 0.0002945, "loss": 7.1163, "mean_token_accuracy": 0.09456900656223297, "num_tokens": 1273272.0, "step": 590 }, { "entropy": 7.291459846496582, "epoch": 0.03477701794377228, "grad_norm": 1.0703125, "learning_rate": 0.000297, "loss": 7.1011, "mean_token_accuracy": 0.09272942468523979, "num_tokens": 1284001.0, "step": 595 }, { "entropy": 7.443050575256348, "epoch": 0.03506926179203928, "grad_norm": 1.1640625, "learning_rate": 0.0002995, "loss": 7.1401, "mean_token_accuracy": 0.08779146820306778, "num_tokens": 1294671.0, "step": 600 }, { "entropy": 7.328179550170899, "epoch": 0.035361505640306275, "grad_norm": 1.078125, "learning_rate": 0.000302, "loss": 7.1451, "mean_token_accuracy": 0.09261744394898415, "num_tokens": 1305397.0, "step": 605 }, { "entropy": 7.390170431137085, "epoch": 0.035653749488573264, "grad_norm": 1.359375, "learning_rate": 0.0003045, "loss": 7.1696, "mean_token_accuracy": 0.08689776062965393, "num_tokens": 1317449.0, "step": 610 }, { "entropy": 7.28363561630249, "epoch": 0.03594599333684026, "grad_norm": 1.3046875, "learning_rate": 0.000307, "loss": 7.0866, "mean_token_accuracy": 0.08486035652458668, "num_tokens": 1328645.0, "step": 615 }, { "entropy": 7.2835465431213375, "epoch": 0.036238237185107255, "grad_norm": 1.015625, "learning_rate": 0.0003095, "loss": 7.091, "mean_token_accuracy": 0.0892544224858284, "num_tokens": 1339815.0, "step": 620 }, { "entropy": 7.290801572799682, "epoch": 0.036530481033374244, "grad_norm": 1.1640625, "learning_rate": 0.000312, "loss": 7.0954, "mean_token_accuracy": 0.08872693330049515, "num_tokens": 1350301.0, "step": 625 }, { "entropy": 7.280572080612183, "epoch": 0.03682272488164124, "grad_norm": 1.015625, "learning_rate": 0.0003145, "loss": 7.0829, "mean_token_accuracy": 0.09459017589688301, "num_tokens": 1360928.0, "step": 630 }, { "entropy": 7.34552264213562, "epoch": 0.037114968729908236, "grad_norm": 1.109375, "learning_rate": 0.000317, "loss": 7.1047, "mean_token_accuracy": 0.08707956597208977, "num_tokens": 1371618.0, "step": 635 }, { "entropy": 7.211892175674438, "epoch": 0.03740721257817523, "grad_norm": 1.015625, "learning_rate": 0.0003195, "loss": 7.0702, "mean_token_accuracy": 0.0876346081495285, "num_tokens": 1382824.0, "step": 640 }, { "entropy": 7.2274785995483395, "epoch": 0.03769945642644222, "grad_norm": 0.99609375, "learning_rate": 0.000322, "loss": 7.0401, "mean_token_accuracy": 0.09252982586622238, "num_tokens": 1393244.0, "step": 645 }, { "entropy": 7.224736738204956, "epoch": 0.03799170027470922, "grad_norm": 1.1796875, "learning_rate": 0.00032450000000000003, "loss": 7.0136, "mean_token_accuracy": 0.09895449355244637, "num_tokens": 1403469.0, "step": 650 }, { "entropy": 7.358276271820069, "epoch": 0.03828394412297621, "grad_norm": 0.98828125, "learning_rate": 0.00032700000000000003, "loss": 7.086, "mean_token_accuracy": 0.09135140627622604, "num_tokens": 1413860.0, "step": 655 }, { "entropy": 7.256574583053589, "epoch": 0.03857618797124321, "grad_norm": 1.1484375, "learning_rate": 0.00032950000000000004, "loss": 7.1348, "mean_token_accuracy": 0.08090706467628479, "num_tokens": 1423985.0, "step": 660 }, { "entropy": 7.278745222091675, "epoch": 0.0388684318195102, "grad_norm": 1.1328125, "learning_rate": 0.00033200000000000005, "loss": 7.087, "mean_token_accuracy": 0.09359103664755822, "num_tokens": 1434838.0, "step": 665 }, { "entropy": 7.2903660297393795, "epoch": 0.039160675667777194, "grad_norm": 1.28125, "learning_rate": 0.00033450000000000005, "loss": 7.007, "mean_token_accuracy": 0.08955025300383568, "num_tokens": 1446429.0, "step": 670 }, { "entropy": 7.332035541534424, "epoch": 0.03945291951604419, "grad_norm": 1.1640625, "learning_rate": 0.000337, "loss": 7.1183, "mean_token_accuracy": 0.08762314394116402, "num_tokens": 1456726.0, "step": 675 }, { "entropy": 7.197989416122437, "epoch": 0.03974516336431118, "grad_norm": 1.25, "learning_rate": 0.0003395, "loss": 7.0058, "mean_token_accuracy": 0.09932290315628052, "num_tokens": 1466378.0, "step": 680 }, { "entropy": 7.104801225662231, "epoch": 0.040037407212578174, "grad_norm": 1.9140625, "learning_rate": 0.000342, "loss": 6.9835, "mean_token_accuracy": 0.09476312026381492, "num_tokens": 1477755.0, "step": 685 }, { "entropy": 7.237457656860352, "epoch": 0.04032965106084517, "grad_norm": 1.21875, "learning_rate": 0.00034449999999999997, "loss": 7.036, "mean_token_accuracy": 0.08923429250717163, "num_tokens": 1488209.0, "step": 690 }, { "entropy": 7.137836837768555, "epoch": 0.040621894909112166, "grad_norm": 1.1484375, "learning_rate": 0.000347, "loss": 7.0728, "mean_token_accuracy": 0.08890949785709382, "num_tokens": 1498658.0, "step": 695 }, { "entropy": 7.236037731170654, "epoch": 0.040914138757379155, "grad_norm": 1.1015625, "learning_rate": 0.0003495, "loss": 7.0789, "mean_token_accuracy": 0.0860823355615139, "num_tokens": 1509766.0, "step": 700 }, { "entropy": 7.218784284591675, "epoch": 0.04120638260564615, "grad_norm": 1.671875, "learning_rate": 0.000352, "loss": 6.975, "mean_token_accuracy": 0.0937421977519989, "num_tokens": 1521139.0, "step": 705 }, { "entropy": 7.174445295333863, "epoch": 0.04149862645391315, "grad_norm": 1.171875, "learning_rate": 0.0003545, "loss": 7.0357, "mean_token_accuracy": 0.0900140330195427, "num_tokens": 1531875.0, "step": 710 }, { "entropy": 7.153319358825684, "epoch": 0.041790870302180136, "grad_norm": 1.203125, "learning_rate": 0.000357, "loss": 7.0205, "mean_token_accuracy": 0.08912704512476921, "num_tokens": 1542678.0, "step": 715 }, { "entropy": 7.196989250183106, "epoch": 0.04208311415044713, "grad_norm": 1.1328125, "learning_rate": 0.0003595, "loss": 6.9703, "mean_token_accuracy": 0.09389843866229057, "num_tokens": 1553882.0, "step": 720 }, { "entropy": 7.12842378616333, "epoch": 0.04237535799871413, "grad_norm": 1.0234375, "learning_rate": 0.000362, "loss": 7.0568, "mean_token_accuracy": 0.0915483608841896, "num_tokens": 1564854.0, "step": 725 }, { "entropy": 7.176506567001343, "epoch": 0.042667601846981124, "grad_norm": 1.015625, "learning_rate": 0.0003645, "loss": 6.9303, "mean_token_accuracy": 0.09940993562340736, "num_tokens": 1576112.0, "step": 730 }, { "entropy": 7.137564849853516, "epoch": 0.04295984569524811, "grad_norm": 1.1484375, "learning_rate": 0.000367, "loss": 6.9771, "mean_token_accuracy": 0.0963865041732788, "num_tokens": 1586235.0, "step": 735 }, { "entropy": 7.083181285858155, "epoch": 0.04325208954351511, "grad_norm": 2.046875, "learning_rate": 0.0003695, "loss": 6.9769, "mean_token_accuracy": 0.09416570290923118, "num_tokens": 1596727.0, "step": 740 }, { "entropy": 7.099421977996826, "epoch": 0.043544333391782104, "grad_norm": 1.0703125, "learning_rate": 0.000372, "loss": 6.8926, "mean_token_accuracy": 0.09487500786781311, "num_tokens": 1607008.0, "step": 745 }, { "entropy": 7.178588104248047, "epoch": 0.0438365772400491, "grad_norm": 1.125, "learning_rate": 0.0003745, "loss": 6.9975, "mean_token_accuracy": 0.0891700565814972, "num_tokens": 1618081.0, "step": 750 }, { "entropy": 7.064407539367676, "epoch": 0.04412882108831609, "grad_norm": 1.0234375, "learning_rate": 0.000377, "loss": 6.9569, "mean_token_accuracy": 0.08645836561918259, "num_tokens": 1629095.0, "step": 755 }, { "entropy": 7.101617288589478, "epoch": 0.044421064936583085, "grad_norm": 1.0234375, "learning_rate": 0.0003795, "loss": 6.9537, "mean_token_accuracy": 0.0951661191880703, "num_tokens": 1639861.0, "step": 760 }, { "entropy": 7.189848804473877, "epoch": 0.04471330878485008, "grad_norm": 1.2265625, "learning_rate": 0.000382, "loss": 7.0003, "mean_token_accuracy": 0.09473721534013749, "num_tokens": 1649169.0, "step": 765 }, { "entropy": 6.957789611816406, "epoch": 0.04500555263311707, "grad_norm": 1.0234375, "learning_rate": 0.0003845, "loss": 6.8833, "mean_token_accuracy": 0.10007616281509399, "num_tokens": 1658528.0, "step": 770 }, { "entropy": 7.049975156784058, "epoch": 0.045297796481384066, "grad_norm": 1.0703125, "learning_rate": 0.00038700000000000003, "loss": 6.9657, "mean_token_accuracy": 0.09249654635787011, "num_tokens": 1669231.0, "step": 775 }, { "entropy": 7.0429846286773685, "epoch": 0.04559004032965106, "grad_norm": 1.171875, "learning_rate": 0.00038950000000000003, "loss": 6.8987, "mean_token_accuracy": 0.09256255626678467, "num_tokens": 1680503.0, "step": 780 }, { "entropy": 7.069688749313355, "epoch": 0.04588228417791806, "grad_norm": 0.9921875, "learning_rate": 0.00039200000000000004, "loss": 6.9239, "mean_token_accuracy": 0.09164713248610497, "num_tokens": 1690827.0, "step": 785 }, { "entropy": 7.1588634014129635, "epoch": 0.04617452802618505, "grad_norm": 1.1171875, "learning_rate": 0.00039450000000000005, "loss": 6.992, "mean_token_accuracy": 0.09126574769616128, "num_tokens": 1702931.0, "step": 790 }, { "entropy": 6.960534286499024, "epoch": 0.04646677187445204, "grad_norm": 1.1640625, "learning_rate": 0.00039700000000000005, "loss": 6.8832, "mean_token_accuracy": 0.09681101739406586, "num_tokens": 1712834.0, "step": 795 }, { "entropy": 7.059118413925171, "epoch": 0.04675901572271904, "grad_norm": 1.078125, "learning_rate": 0.0003995, "loss": 6.9505, "mean_token_accuracy": 0.09173840507864953, "num_tokens": 1723289.0, "step": 800 }, { "entropy": 6.98992805480957, "epoch": 0.04705125957098603, "grad_norm": 1.15625, "learning_rate": 0.000402, "loss": 6.9111, "mean_token_accuracy": 0.09471877589821816, "num_tokens": 1734477.0, "step": 805 }, { "entropy": 7.110216426849365, "epoch": 0.04734350341925302, "grad_norm": 1.078125, "learning_rate": 0.0004045, "loss": 6.9201, "mean_token_accuracy": 0.09181275144219399, "num_tokens": 1745187.0, "step": 810 }, { "entropy": 6.9768541812896725, "epoch": 0.04763574726752002, "grad_norm": 1.1875, "learning_rate": 0.00040699999999999997, "loss": 6.8563, "mean_token_accuracy": 0.09723289534449578, "num_tokens": 1756687.0, "step": 815 }, { "entropy": 7.012206411361694, "epoch": 0.047927991115787015, "grad_norm": 1.0078125, "learning_rate": 0.0004095, "loss": 6.9795, "mean_token_accuracy": 0.09605197682976722, "num_tokens": 1767928.0, "step": 820 }, { "entropy": 7.063567161560059, "epoch": 0.048220234964054004, "grad_norm": 1.0625, "learning_rate": 0.000412, "loss": 6.9206, "mean_token_accuracy": 0.0963786244392395, "num_tokens": 1777951.0, "step": 825 }, { "entropy": 6.963260746002197, "epoch": 0.048512478812321, "grad_norm": 1.046875, "learning_rate": 0.0004145, "loss": 6.9047, "mean_token_accuracy": 0.09518637284636497, "num_tokens": 1788598.0, "step": 830 }, { "entropy": 7.022843551635742, "epoch": 0.048804722660587996, "grad_norm": 1.0703125, "learning_rate": 0.000417, "loss": 6.8708, "mean_token_accuracy": 0.0998458556830883, "num_tokens": 1799446.0, "step": 835 }, { "entropy": 7.028498888015747, "epoch": 0.04909696650885499, "grad_norm": 0.984375, "learning_rate": 0.0004195, "loss": 6.8757, "mean_token_accuracy": 0.0957573838531971, "num_tokens": 1809687.0, "step": 840 }, { "entropy": 6.976888608932495, "epoch": 0.04938921035712198, "grad_norm": 1.1953125, "learning_rate": 0.000422, "loss": 6.9107, "mean_token_accuracy": 0.09788398742675782, "num_tokens": 1820535.0, "step": 845 }, { "entropy": 6.943860197067261, "epoch": 0.04968145420538898, "grad_norm": 1.6640625, "learning_rate": 0.0004245, "loss": 6.8376, "mean_token_accuracy": 0.09310686662793159, "num_tokens": 1830834.0, "step": 850 }, { "entropy": 6.961981105804443, "epoch": 0.04997369805365597, "grad_norm": 1.078125, "learning_rate": 0.000427, "loss": 6.8257, "mean_token_accuracy": 0.0944649763405323, "num_tokens": 1842615.0, "step": 855 }, { "entropy": 6.919750738143921, "epoch": 0.05026594190192296, "grad_norm": 1.03125, "learning_rate": 0.0004295, "loss": 6.8328, "mean_token_accuracy": 0.09815948903560638, "num_tokens": 1852844.0, "step": 860 }, { "entropy": 6.876930141448975, "epoch": 0.05055818575018996, "grad_norm": 1.046875, "learning_rate": 0.000432, "loss": 6.8918, "mean_token_accuracy": 0.09418935924768448, "num_tokens": 1862528.0, "step": 865 }, { "entropy": 6.934880113601684, "epoch": 0.05085042959845695, "grad_norm": 0.98046875, "learning_rate": 0.0004345, "loss": 6.8469, "mean_token_accuracy": 0.10216829851269722, "num_tokens": 1873275.0, "step": 870 }, { "entropy": 6.956448936462403, "epoch": 0.05114267344672395, "grad_norm": 1.03125, "learning_rate": 0.000437, "loss": 6.8847, "mean_token_accuracy": 0.09507919698953629, "num_tokens": 1884724.0, "step": 875 }, { "entropy": 7.051344537734986, "epoch": 0.05143491729499094, "grad_norm": 1.125, "learning_rate": 0.0004395, "loss": 6.8598, "mean_token_accuracy": 0.09828044772148133, "num_tokens": 1894705.0, "step": 880 }, { "entropy": 6.862812566757202, "epoch": 0.051727161143257934, "grad_norm": 1.0, "learning_rate": 0.000442, "loss": 6.9184, "mean_token_accuracy": 0.09541104733943939, "num_tokens": 1906553.0, "step": 885 }, { "entropy": 7.020113182067871, "epoch": 0.05201940499152493, "grad_norm": 1.0859375, "learning_rate": 0.0004445, "loss": 6.8544, "mean_token_accuracy": 0.10240027904510499, "num_tokens": 1916628.0, "step": 890 }, { "entropy": 6.766639471054077, "epoch": 0.052311648839791926, "grad_norm": 1.203125, "learning_rate": 0.000447, "loss": 6.6849, "mean_token_accuracy": 0.11086282283067703, "num_tokens": 1926686.0, "step": 895 }, { "entropy": 6.947674942016602, "epoch": 0.052603892688058915, "grad_norm": 1.59375, "learning_rate": 0.00044950000000000003, "loss": 6.8638, "mean_token_accuracy": 0.09778930097818375, "num_tokens": 1938150.0, "step": 900 }, { "entropy": 6.891585969924927, "epoch": 0.05289613653632591, "grad_norm": 1.046875, "learning_rate": 0.00045200000000000004, "loss": 6.873, "mean_token_accuracy": 0.09291322231292724, "num_tokens": 1948617.0, "step": 905 }, { "entropy": 6.900164985656739, "epoch": 0.053188380384592907, "grad_norm": 1.0703125, "learning_rate": 0.00045450000000000004, "loss": 6.8565, "mean_token_accuracy": 0.09954984486103058, "num_tokens": 1958943.0, "step": 910 }, { "entropy": 6.856646156311035, "epoch": 0.053480624232859895, "grad_norm": 0.953125, "learning_rate": 0.00045700000000000005, "loss": 6.7881, "mean_token_accuracy": 0.10126558542251587, "num_tokens": 1968988.0, "step": 915 }, { "entropy": 6.895283889770508, "epoch": 0.05377286808112689, "grad_norm": 0.99609375, "learning_rate": 0.00045950000000000006, "loss": 6.7692, "mean_token_accuracy": 0.10075787082314491, "num_tokens": 1979490.0, "step": 920 }, { "entropy": 6.938627767562866, "epoch": 0.05406511192939389, "grad_norm": 0.97265625, "learning_rate": 0.000462, "loss": 6.8187, "mean_token_accuracy": 0.10156044065952301, "num_tokens": 1990377.0, "step": 925 }, { "entropy": 6.881887578964234, "epoch": 0.05435735577766088, "grad_norm": 1.03125, "learning_rate": 0.0004645, "loss": 6.7914, "mean_token_accuracy": 0.09942576885223389, "num_tokens": 2001678.0, "step": 930 }, { "entropy": 6.809711265563965, "epoch": 0.05464959962592787, "grad_norm": 1.1171875, "learning_rate": 0.000467, "loss": 6.7898, "mean_token_accuracy": 0.11002987027168273, "num_tokens": 2011550.0, "step": 935 }, { "entropy": 6.853000497817993, "epoch": 0.05494184347419487, "grad_norm": 1.1015625, "learning_rate": 0.0004695, "loss": 6.8297, "mean_token_accuracy": 0.10066121965646743, "num_tokens": 2021607.0, "step": 940 }, { "entropy": 6.862749242782593, "epoch": 0.055234087322461864, "grad_norm": 1.0859375, "learning_rate": 0.000472, "loss": 6.8211, "mean_token_accuracy": 0.09814092963933944, "num_tokens": 2030975.0, "step": 945 }, { "entropy": 6.836636781692505, "epoch": 0.05552633117072885, "grad_norm": 1.03125, "learning_rate": 0.0004745, "loss": 6.8844, "mean_token_accuracy": 0.09624653086066245, "num_tokens": 2041799.0, "step": 950 }, { "entropy": 6.891287755966187, "epoch": 0.05581857501899585, "grad_norm": 1.109375, "learning_rate": 0.000477, "loss": 6.7935, "mean_token_accuracy": 0.10220010504126549, "num_tokens": 2052960.0, "step": 955 }, { "entropy": 6.868294525146484, "epoch": 0.056110818867262845, "grad_norm": 1.0390625, "learning_rate": 0.0004795, "loss": 6.8472, "mean_token_accuracy": 0.09924568086862565, "num_tokens": 2064156.0, "step": 960 }, { "entropy": 6.914956092834473, "epoch": 0.05640306271552984, "grad_norm": 1.03125, "learning_rate": 0.000482, "loss": 6.8016, "mean_token_accuracy": 0.100481665879488, "num_tokens": 2074774.0, "step": 965 }, { "entropy": 6.793342113494873, "epoch": 0.05669530656379683, "grad_norm": 0.9140625, "learning_rate": 0.0004845, "loss": 6.8288, "mean_token_accuracy": 0.09989185482263566, "num_tokens": 2086164.0, "step": 970 }, { "entropy": 6.78997688293457, "epoch": 0.056987550412063825, "grad_norm": 1.2578125, "learning_rate": 0.000487, "loss": 6.6708, "mean_token_accuracy": 0.1248696506023407, "num_tokens": 2096268.0, "step": 975 }, { "entropy": 6.888183069229126, "epoch": 0.05727979426033082, "grad_norm": 1.125, "learning_rate": 0.0004895, "loss": 6.8985, "mean_token_accuracy": 0.09069314152002335, "num_tokens": 2108511.0, "step": 980 }, { "entropy": 6.923859405517578, "epoch": 0.05757203810859782, "grad_norm": 1.03125, "learning_rate": 0.000492, "loss": 6.8155, "mean_token_accuracy": 0.09430013298988342, "num_tokens": 2119622.0, "step": 985 }, { "entropy": 6.742640447616577, "epoch": 0.057864281956864806, "grad_norm": 0.953125, "learning_rate": 0.0004945, "loss": 6.8703, "mean_token_accuracy": 0.10323725119233132, "num_tokens": 2131021.0, "step": 990 }, { "entropy": 6.867950057983398, "epoch": 0.0581565258051318, "grad_norm": 1.046875, "learning_rate": 0.000497, "loss": 6.8448, "mean_token_accuracy": 0.10064574256539345, "num_tokens": 2141797.0, "step": 995 }, { "entropy": 6.782402372360229, "epoch": 0.0584487696533988, "grad_norm": 1.171875, "learning_rate": 0.0004995, "loss": 6.7141, "mean_token_accuracy": 0.09859876409173012, "num_tokens": 2153609.0, "step": 1000 }, { "entropy": 6.873832368850708, "epoch": 0.05874101350166579, "grad_norm": 0.98046875, "learning_rate": 0.000499998026082006, "loss": 6.8556, "mean_token_accuracy": 0.09399589225649833, "num_tokens": 2164237.0, "step": 1005 }, { "entropy": 6.912446355819702, "epoch": 0.05903325734993278, "grad_norm": 1.109375, "learning_rate": 0.0004999900070995136, "loss": 6.8018, "mean_token_accuracy": 0.10092566832900048, "num_tokens": 2175035.0, "step": 1010 }, { "entropy": 6.6948404788970945, "epoch": 0.05932550119819978, "grad_norm": 1.0625, "learning_rate": 0.0004999758199023239, "loss": 6.7217, "mean_token_accuracy": 0.10070772990584373, "num_tokens": 2186217.0, "step": 1015 }, { "entropy": 6.849718952178955, "epoch": 0.059617745046466775, "grad_norm": 1.1171875, "learning_rate": 0.0004999554648793858, "loss": 6.7685, "mean_token_accuracy": 0.1027240552008152, "num_tokens": 2197290.0, "step": 1020 }, { "entropy": 6.755612897872925, "epoch": 0.059909988894733764, "grad_norm": 1.1875, "learning_rate": 0.0004999289425887425, "loss": 6.8215, "mean_token_accuracy": 0.09566072076559066, "num_tokens": 2208835.0, "step": 1025 }, { "entropy": 6.851420831680298, "epoch": 0.06020223274300076, "grad_norm": 1.03125, "learning_rate": 0.0004998962537575161, "loss": 6.7081, "mean_token_accuracy": 0.10895594730973243, "num_tokens": 2219153.0, "step": 1030 }, { "entropy": 6.780207109451294, "epoch": 0.060494476591267755, "grad_norm": 1.109375, "learning_rate": 0.0004998573992818874, "loss": 6.7401, "mean_token_accuracy": 0.1018265351653099, "num_tokens": 2230289.0, "step": 1035 }, { "entropy": 6.748766994476318, "epoch": 0.060786720439534744, "grad_norm": 1.0234375, "learning_rate": 0.0004998123802270715, "loss": 6.8198, "mean_token_accuracy": 0.10137188360095024, "num_tokens": 2241768.0, "step": 1040 }, { "entropy": 6.8524377822875975, "epoch": 0.06107896428780174, "grad_norm": 1.0625, "learning_rate": 0.0004997611978272886, "loss": 6.7065, "mean_token_accuracy": 0.10613882467150688, "num_tokens": 2253249.0, "step": 1045 }, { "entropy": 6.758801507949829, "epoch": 0.061371208136068736, "grad_norm": 1.0859375, "learning_rate": 0.0004997038534857298, "loss": 6.7723, "mean_token_accuracy": 0.09954821765422821, "num_tokens": 2263961.0, "step": 1050 }, { "entropy": 6.748946809768677, "epoch": 0.06166345198433573, "grad_norm": 1.109375, "learning_rate": 0.0004996403487745194, "loss": 6.6831, "mean_token_accuracy": 0.10762475430965424, "num_tokens": 2274016.0, "step": 1055 }, { "entropy": 6.716818904876709, "epoch": 0.06195569583260272, "grad_norm": 0.96875, "learning_rate": 0.000499570685434671, "loss": 6.7368, "mean_token_accuracy": 0.10165347680449485, "num_tokens": 2285164.0, "step": 1060 }, { "entropy": 6.843360662460327, "epoch": 0.06224793968086972, "grad_norm": 1.1484375, "learning_rate": 0.0004994948653760405, "loss": 6.7192, "mean_token_accuracy": 0.10079561397433281, "num_tokens": 2294887.0, "step": 1065 }, { "entropy": 6.701195096969604, "epoch": 0.0625401835291367, "grad_norm": 0.94921875, "learning_rate": 0.0004994128906772729, "loss": 6.7315, "mean_token_accuracy": 0.10079780966043472, "num_tokens": 2305787.0, "step": 1070 }, { "entropy": 6.763786745071411, "epoch": 0.0628324273774037, "grad_norm": 0.98046875, "learning_rate": 0.000499324763585746, "loss": 6.7659, "mean_token_accuracy": 0.1027215838432312, "num_tokens": 2316756.0, "step": 1075 }, { "entropy": 6.758350419998169, "epoch": 0.0631246712256707, "grad_norm": 1.0625, "learning_rate": 0.0004992304865175085, "loss": 6.7782, "mean_token_accuracy": 0.10599919855594635, "num_tokens": 2327335.0, "step": 1080 }, { "entropy": 6.76016902923584, "epoch": 0.0634169150739377, "grad_norm": 1.171875, "learning_rate": 0.0004991300620572138, "loss": 6.7328, "mean_token_accuracy": 0.10450217202305793, "num_tokens": 2337182.0, "step": 1085 }, { "entropy": 6.7664146900177, "epoch": 0.06370915892220469, "grad_norm": 1.15625, "learning_rate": 0.0004990234929580494, "loss": 6.7124, "mean_token_accuracy": 0.10350674986839295, "num_tokens": 2347843.0, "step": 1090 }, { "entropy": 6.714575910568238, "epoch": 0.06400140277047169, "grad_norm": 1.25, "learning_rate": 0.0004989107821416609, "loss": 6.7235, "mean_token_accuracy": 0.10555968135595321, "num_tokens": 2358159.0, "step": 1095 }, { "entropy": 6.721023511886597, "epoch": 0.06429364661873868, "grad_norm": 1.140625, "learning_rate": 0.0004987919326980723, "loss": 6.6924, "mean_token_accuracy": 0.10607861652970314, "num_tokens": 2368191.0, "step": 1100 }, { "entropy": 6.734277248382568, "epoch": 0.06458589046700566, "grad_norm": 1.109375, "learning_rate": 0.0004986669478856011, "loss": 6.6338, "mean_token_accuracy": 0.11026455089449883, "num_tokens": 2377672.0, "step": 1105 }, { "entropy": 6.6623273372650145, "epoch": 0.06487813431527266, "grad_norm": 1.0390625, "learning_rate": 0.0004985358311307688, "loss": 6.7138, "mean_token_accuracy": 0.10811490938067436, "num_tokens": 2387612.0, "step": 1110 }, { "entropy": 6.6812506198883055, "epoch": 0.06517037816353966, "grad_norm": 1.1953125, "learning_rate": 0.0004983985860282081, "loss": 6.6572, "mean_token_accuracy": 0.11455306559801101, "num_tokens": 2397198.0, "step": 1115 }, { "entropy": 6.769713687896728, "epoch": 0.06546262201180665, "grad_norm": 1.15625, "learning_rate": 0.0004982552163405623, "loss": 6.7003, "mean_token_accuracy": 0.10592205822467804, "num_tokens": 2407816.0, "step": 1120 }, { "entropy": 6.6080625534057615, "epoch": 0.06575486586007365, "grad_norm": 1.046875, "learning_rate": 0.0004981057259983839, "loss": 6.6798, "mean_token_accuracy": 0.10187085941433907, "num_tokens": 2419537.0, "step": 1125 }, { "entropy": 6.763877916336059, "epoch": 0.06604710970834064, "grad_norm": 1.2109375, "learning_rate": 0.0004979501191000262, "loss": 6.6267, "mean_token_accuracy": 0.10548629984259605, "num_tokens": 2429043.0, "step": 1130 }, { "entropy": 6.634230661392212, "epoch": 0.06633935355660764, "grad_norm": 1.015625, "learning_rate": 0.0004977883999115311, "loss": 6.6642, "mean_token_accuracy": 0.10568090230226516, "num_tokens": 2439469.0, "step": 1135 }, { "entropy": 6.669453048706055, "epoch": 0.06663159740487462, "grad_norm": 1.1953125, "learning_rate": 0.0004976205728665113, "loss": 6.659, "mean_token_accuracy": 0.11069119200110436, "num_tokens": 2449831.0, "step": 1140 }, { "entropy": 6.6411519050598145, "epoch": 0.06692384125314162, "grad_norm": 0.96875, "learning_rate": 0.0004974466425660307, "loss": 6.6127, "mean_token_accuracy": 0.11009648814797401, "num_tokens": 2460709.0, "step": 1145 }, { "entropy": 6.681810665130615, "epoch": 0.06721608510140861, "grad_norm": 0.9453125, "learning_rate": 0.0004972666137784759, "loss": 6.6562, "mean_token_accuracy": 0.11087686195969582, "num_tokens": 2472246.0, "step": 1150 }, { "entropy": 6.661732769012451, "epoch": 0.06750832894967561, "grad_norm": 1.03125, "learning_rate": 0.0004970804914394271, "loss": 6.6214, "mean_token_accuracy": 0.10803418233990669, "num_tokens": 2482793.0, "step": 1155 }, { "entropy": 6.574620342254638, "epoch": 0.0678005727979426, "grad_norm": 1.015625, "learning_rate": 0.0004968882806515225, "loss": 6.6042, "mean_token_accuracy": 0.11461034417152405, "num_tokens": 2493186.0, "step": 1160 }, { "entropy": 6.723605728149414, "epoch": 0.0680928166462096, "grad_norm": 0.98046875, "learning_rate": 0.0004966899866843177, "loss": 6.6715, "mean_token_accuracy": 0.10363015085458756, "num_tokens": 2505100.0, "step": 1165 }, { "entropy": 6.638859796524048, "epoch": 0.0683850604944766, "grad_norm": 0.98046875, "learning_rate": 0.000496485614974142, "loss": 6.6775, "mean_token_accuracy": 0.10529874190688134, "num_tokens": 2515373.0, "step": 1170 }, { "entropy": 6.724088048934936, "epoch": 0.06867730434274359, "grad_norm": 1.046875, "learning_rate": 0.0004962751711239492, "loss": 6.6687, "mean_token_accuracy": 0.10807336121797562, "num_tokens": 2526645.0, "step": 1175 }, { "entropy": 6.642391300201416, "epoch": 0.06896954819101057, "grad_norm": 1.0703125, "learning_rate": 0.0004960586609031636, "loss": 6.6747, "mean_token_accuracy": 0.10391177088022233, "num_tokens": 2537109.0, "step": 1180 }, { "entropy": 6.675477027893066, "epoch": 0.06926179203927757, "grad_norm": 0.9453125, "learning_rate": 0.0004958360902475224, "loss": 6.6186, "mean_token_accuracy": 0.11234116032719613, "num_tokens": 2548709.0, "step": 1185 }, { "entropy": 6.690750455856323, "epoch": 0.06955403588754457, "grad_norm": 1.0078125, "learning_rate": 0.0004956074652589125, "loss": 6.6621, "mean_token_accuracy": 0.10677864402532578, "num_tokens": 2559802.0, "step": 1190 }, { "entropy": 6.617762088775635, "epoch": 0.06984627973581156, "grad_norm": 1.1796875, "learning_rate": 0.0004953727922052035, "loss": 6.6607, "mean_token_accuracy": 0.1037447288632393, "num_tokens": 2570343.0, "step": 1195 }, { "entropy": 6.693934535980224, "epoch": 0.07013852358407856, "grad_norm": 1.078125, "learning_rate": 0.0004951320775200756, "loss": 6.6457, "mean_token_accuracy": 0.1090537242591381, "num_tokens": 2580772.0, "step": 1200 }, { "entropy": 6.620019578933716, "epoch": 0.07043076743234555, "grad_norm": 1.046875, "learning_rate": 0.0004948853278028436, "loss": 6.643, "mean_token_accuracy": 0.10731385722756386, "num_tokens": 2592383.0, "step": 1205 }, { "entropy": 6.674355459213257, "epoch": 0.07072301128061255, "grad_norm": 1.0078125, "learning_rate": 0.0004946325498182755, "loss": 6.6392, "mean_token_accuracy": 0.10924243628978729, "num_tokens": 2602807.0, "step": 1210 }, { "entropy": 6.649422836303711, "epoch": 0.07101525512887953, "grad_norm": 1.046875, "learning_rate": 0.0004943737504964076, "loss": 6.6336, "mean_token_accuracy": 0.10555684268474579, "num_tokens": 2613978.0, "step": 1215 }, { "entropy": 6.645706224441528, "epoch": 0.07130749897714653, "grad_norm": 1.015625, "learning_rate": 0.000494108936932354, "loss": 6.6105, "mean_token_accuracy": 0.10822624936699868, "num_tokens": 2624044.0, "step": 1220 }, { "entropy": 6.6873753547668455, "epoch": 0.07159974282541352, "grad_norm": 1.078125, "learning_rate": 0.0004938381163861124, "loss": 6.6315, "mean_token_accuracy": 0.11078074425458909, "num_tokens": 2635550.0, "step": 1225 }, { "entropy": 6.588435077667237, "epoch": 0.07189198667368052, "grad_norm": 0.94921875, "learning_rate": 0.0004935612962823645, "loss": 6.5788, "mean_token_accuracy": 0.11432232186198235, "num_tokens": 2645343.0, "step": 1230 }, { "entropy": 6.617160987854004, "epoch": 0.07218423052194751, "grad_norm": 1.09375, "learning_rate": 0.0004932784842102739, "loss": 6.646, "mean_token_accuracy": 0.11204688772559165, "num_tokens": 2655366.0, "step": 1235 }, { "entropy": 6.6750807762146, "epoch": 0.07247647437021451, "grad_norm": 1.1328125, "learning_rate": 0.0004929896879232758, "loss": 6.6115, "mean_token_accuracy": 0.1087801031768322, "num_tokens": 2666438.0, "step": 1240 }, { "entropy": 6.569998693466187, "epoch": 0.0727687182184815, "grad_norm": 0.9140625, "learning_rate": 0.0004926949153388668, "loss": 6.5661, "mean_token_accuracy": 0.1062084048986435, "num_tokens": 2677800.0, "step": 1245 }, { "entropy": 6.579834270477295, "epoch": 0.07306096206674849, "grad_norm": 1.0078125, "learning_rate": 0.0004923941745383859, "loss": 6.5762, "mean_token_accuracy": 0.10903873145580292, "num_tokens": 2688876.0, "step": 1250 }, { "entropy": 6.6498009204864506, "epoch": 0.07335320591501548, "grad_norm": 1.0703125, "learning_rate": 0.000492087473766794, "loss": 6.541, "mean_token_accuracy": 0.12037940993905068, "num_tokens": 2700265.0, "step": 1255 }, { "entropy": 6.541846752166748, "epoch": 0.07364544976328248, "grad_norm": 1.0703125, "learning_rate": 0.000491774821432448, "loss": 6.5526, "mean_token_accuracy": 0.11863013431429863, "num_tokens": 2711336.0, "step": 1260 }, { "entropy": 6.63809118270874, "epoch": 0.07393769361154948, "grad_norm": 1.0703125, "learning_rate": 0.0004914562261068693, "loss": 6.6417, "mean_token_accuracy": 0.10962062701582909, "num_tokens": 2722138.0, "step": 1265 }, { "entropy": 6.627244329452514, "epoch": 0.07422993745981647, "grad_norm": 0.921875, "learning_rate": 0.0004911316965245098, "loss": 6.5637, "mean_token_accuracy": 0.1153975710272789, "num_tokens": 2733016.0, "step": 1270 }, { "entropy": 6.589581537246704, "epoch": 0.07452218130808347, "grad_norm": 0.96484375, "learning_rate": 0.000490801241582512, "loss": 6.589, "mean_token_accuracy": 0.11180200576782226, "num_tokens": 2743424.0, "step": 1275 }, { "entropy": 6.650690221786499, "epoch": 0.07481442515635046, "grad_norm": 1.03125, "learning_rate": 0.000490464870340465, "loss": 6.6218, "mean_token_accuracy": 0.11065411493182183, "num_tokens": 2753867.0, "step": 1280 }, { "entropy": 6.561734628677368, "epoch": 0.07510666900461745, "grad_norm": 1.03125, "learning_rate": 0.0004901225920201563, "loss": 6.5209, "mean_token_accuracy": 0.1133801057934761, "num_tokens": 2764602.0, "step": 1285 }, { "entropy": 6.577672100067138, "epoch": 0.07539891285288444, "grad_norm": 0.9140625, "learning_rate": 0.000489774416005319, "loss": 6.6399, "mean_token_accuracy": 0.1088312640786171, "num_tokens": 2775907.0, "step": 1290 }, { "entropy": 6.631254863739014, "epoch": 0.07569115670115144, "grad_norm": 1.1640625, "learning_rate": 0.0004894203518413742, "loss": 6.6094, "mean_token_accuracy": 0.10955363363027573, "num_tokens": 2787455.0, "step": 1295 }, { "entropy": 6.5455607891082765, "epoch": 0.07598340054941843, "grad_norm": 0.92578125, "learning_rate": 0.0004890604092351701, "loss": 6.5188, "mean_token_accuracy": 0.12422384396195411, "num_tokens": 2797600.0, "step": 1300 }, { "entropy": 6.591296243667602, "epoch": 0.07627564439768543, "grad_norm": 1.078125, "learning_rate": 0.000488694598054715, "loss": 6.4734, "mean_token_accuracy": 0.120032849162817, "num_tokens": 2808056.0, "step": 1305 }, { "entropy": 6.517116546630859, "epoch": 0.07656788824595243, "grad_norm": 1.0078125, "learning_rate": 0.0004883229283289071, "loss": 6.5297, "mean_token_accuracy": 0.11552904546260834, "num_tokens": 2817962.0, "step": 1310 }, { "entropy": 6.5853719234466555, "epoch": 0.07686013209421942, "grad_norm": 0.921875, "learning_rate": 0.00048794541024725993, "loss": 6.5356, "mean_token_accuracy": 0.11282036751508713, "num_tokens": 2828769.0, "step": 1315 }, { "entropy": 6.507770824432373, "epoch": 0.07715237594248642, "grad_norm": 1.0703125, "learning_rate": 0.0004875620541596221, "loss": 6.4596, "mean_token_accuracy": 0.12131244838237762, "num_tokens": 2838983.0, "step": 1320 }, { "entropy": 6.5859967231750485, "epoch": 0.0774446197907534, "grad_norm": 1.0859375, "learning_rate": 0.00048717287057589454, "loss": 6.5421, "mean_token_accuracy": 0.1098010502755642, "num_tokens": 2848892.0, "step": 1325 }, { "entropy": 6.555781459808349, "epoch": 0.0777368636390204, "grad_norm": 1.0703125, "learning_rate": 0.0004867778701657417, "loss": 6.4932, "mean_token_accuracy": 0.11479394286870956, "num_tokens": 2859303.0, "step": 1330 }, { "entropy": 6.587380409240723, "epoch": 0.07802910748728739, "grad_norm": 0.96484375, "learning_rate": 0.00048637706375829955, "loss": 6.7083, "mean_token_accuracy": 0.10509744510054589, "num_tokens": 2871318.0, "step": 1335 }, { "entropy": 6.610728073120117, "epoch": 0.07832135133555439, "grad_norm": 0.91796875, "learning_rate": 0.000485970462341878, "loss": 6.5321, "mean_token_accuracy": 0.1154100090265274, "num_tokens": 2882150.0, "step": 1340 }, { "entropy": 6.5057868480682375, "epoch": 0.07861359518382138, "grad_norm": 1.0078125, "learning_rate": 0.00048555807706366044, "loss": 6.5277, "mean_token_accuracy": 0.11850375607609749, "num_tokens": 2892657.0, "step": 1345 }, { "entropy": 6.593202018737793, "epoch": 0.07890583903208838, "grad_norm": 1.1171875, "learning_rate": 0.00048513991922939756, "loss": 6.4756, "mean_token_accuracy": 0.12083587348461151, "num_tokens": 2903298.0, "step": 1350 }, { "entropy": 6.473386001586914, "epoch": 0.07919808288035537, "grad_norm": 1.0078125, "learning_rate": 0.00048471600030309744, "loss": 6.5195, "mean_token_accuracy": 0.11845917701721191, "num_tokens": 2914684.0, "step": 1355 }, { "entropy": 6.5273338794708256, "epoch": 0.07949032672862236, "grad_norm": 1.015625, "learning_rate": 0.00048428633190671186, "loss": 6.4561, "mean_token_accuracy": 0.11816495433449745, "num_tokens": 2925191.0, "step": 1360 }, { "entropy": 6.580375480651855, "epoch": 0.07978257057688935, "grad_norm": 0.9765625, "learning_rate": 0.0004838509258198167, "loss": 6.5132, "mean_token_accuracy": 0.11696040779352188, "num_tokens": 2935498.0, "step": 1365 }, { "entropy": 6.557421731948852, "epoch": 0.08007481442515635, "grad_norm": 1.0859375, "learning_rate": 0.00048340979397929, "loss": 6.4569, "mean_token_accuracy": 0.119329334795475, "num_tokens": 2945590.0, "step": 1370 }, { "entropy": 6.543434095382691, "epoch": 0.08036705827342334, "grad_norm": 1.046875, "learning_rate": 0.00048296294847898386, "loss": 6.4328, "mean_token_accuracy": 0.12298492044210434, "num_tokens": 2954959.0, "step": 1375 }, { "entropy": 6.470787572860718, "epoch": 0.08065930212169034, "grad_norm": 1.0859375, "learning_rate": 0.0004825104015693934, "loss": 6.5096, "mean_token_accuracy": 0.1182025596499443, "num_tokens": 2964808.0, "step": 1380 }, { "entropy": 6.538543033599853, "epoch": 0.08095154596995734, "grad_norm": 1.1015625, "learning_rate": 0.0004820521656573208, "loss": 6.4936, "mean_token_accuracy": 0.12162516564130783, "num_tokens": 2975032.0, "step": 1385 }, { "entropy": 6.520711994171142, "epoch": 0.08124378981822433, "grad_norm": 1.0703125, "learning_rate": 0.00048158825330553505, "loss": 6.455, "mean_token_accuracy": 0.12000622674822807, "num_tokens": 2984426.0, "step": 1390 }, { "entropy": 6.461547470092773, "epoch": 0.08153603366649131, "grad_norm": 0.94140625, "learning_rate": 0.00048111867723242763, "loss": 6.531, "mean_token_accuracy": 0.11707211509346963, "num_tokens": 2994871.0, "step": 1395 }, { "entropy": 6.565800571441651, "epoch": 0.08182827751475831, "grad_norm": 1.046875, "learning_rate": 0.0004806434503116637, "loss": 6.4464, "mean_token_accuracy": 0.12056399285793304, "num_tokens": 3004800.0, "step": 1400 }, { "entropy": 6.511224269866943, "epoch": 0.0821205213630253, "grad_norm": 1.1796875, "learning_rate": 0.0004801625855718296, "loss": 6.533, "mean_token_accuracy": 0.1121494509279728, "num_tokens": 3015561.0, "step": 1405 }, { "entropy": 6.4862833499908445, "epoch": 0.0824127652112923, "grad_norm": 0.984375, "learning_rate": 0.00047967609619607477, "loss": 6.4833, "mean_token_accuracy": 0.1104965016245842, "num_tokens": 3025885.0, "step": 1410 }, { "entropy": 6.561811447143555, "epoch": 0.0827050090595593, "grad_norm": 0.95703125, "learning_rate": 0.0004791839955217513, "loss": 6.4301, "mean_token_accuracy": 0.12150253728032112, "num_tokens": 3035524.0, "step": 1415 }, { "entropy": 6.486034107208252, "epoch": 0.0829972529078263, "grad_norm": 0.9453125, "learning_rate": 0.00047868629704004786, "loss": 6.5348, "mean_token_accuracy": 0.11588730812072753, "num_tokens": 3046957.0, "step": 1420 }, { "entropy": 6.556643438339234, "epoch": 0.08328949675609329, "grad_norm": 1.109375, "learning_rate": 0.00047818301439561965, "loss": 6.4536, "mean_token_accuracy": 0.11856252178549767, "num_tokens": 3056713.0, "step": 1425 }, { "entropy": 6.448641347885132, "epoch": 0.08358174060436027, "grad_norm": 0.96484375, "learning_rate": 0.00047767416138621454, "loss": 6.4515, "mean_token_accuracy": 0.11449124291539192, "num_tokens": 3068369.0, "step": 1430 }, { "entropy": 6.454101324081421, "epoch": 0.08387398445262727, "grad_norm": 0.91796875, "learning_rate": 0.000477159751962295, "loss": 6.5033, "mean_token_accuracy": 0.11825905069708824, "num_tokens": 3079083.0, "step": 1435 }, { "entropy": 6.496670722961426, "epoch": 0.08416622830089426, "grad_norm": 1.046875, "learning_rate": 0.00047663980022665507, "loss": 6.5362, "mean_token_accuracy": 0.11073331981897354, "num_tokens": 3089150.0, "step": 1440 }, { "entropy": 6.540896987915039, "epoch": 0.08445847214916126, "grad_norm": 0.9921875, "learning_rate": 0.00047611432043403437, "loss": 6.4313, "mean_token_accuracy": 0.12387260645627976, "num_tokens": 3098696.0, "step": 1445 }, { "entropy": 6.554162788391113, "epoch": 0.08475071599742826, "grad_norm": 1.046875, "learning_rate": 0.0004755833269907267, "loss": 6.4593, "mean_token_accuracy": 0.11571898385882377, "num_tokens": 3108879.0, "step": 1450 }, { "entropy": 6.521293210983276, "epoch": 0.08504295984569525, "grad_norm": 1.0390625, "learning_rate": 0.0004750468344541857, "loss": 6.4213, "mean_token_accuracy": 0.12200254499912262, "num_tokens": 3118756.0, "step": 1455 }, { "entropy": 6.462752103805542, "epoch": 0.08533520369396225, "grad_norm": 1.0078125, "learning_rate": 0.00047450485753262525, "loss": 6.472, "mean_token_accuracy": 0.11719053238630295, "num_tokens": 3129130.0, "step": 1460 }, { "entropy": 6.469192171096802, "epoch": 0.08562744754222923, "grad_norm": 0.97265625, "learning_rate": 0.00047395741108461633, "loss": 6.4329, "mean_token_accuracy": 0.12074794396758079, "num_tokens": 3139528.0, "step": 1465 }, { "entropy": 6.510004281997681, "epoch": 0.08591969139049623, "grad_norm": 1.1484375, "learning_rate": 0.00047340451011867985, "loss": 6.5121, "mean_token_accuracy": 0.11626194566488265, "num_tokens": 3149456.0, "step": 1470 }, { "entropy": 6.424893188476562, "epoch": 0.08621193523876322, "grad_norm": 1.03125, "learning_rate": 0.00047284616979287515, "loss": 6.4404, "mean_token_accuracy": 0.1183363862335682, "num_tokens": 3159851.0, "step": 1475 }, { "entropy": 6.492526721954346, "epoch": 0.08650417908703022, "grad_norm": 1.0625, "learning_rate": 0.00047228240541438433, "loss": 6.4013, "mean_token_accuracy": 0.12410363852977753, "num_tokens": 3169897.0, "step": 1480 }, { "entropy": 6.505418395996093, "epoch": 0.08679642293529721, "grad_norm": 0.96875, "learning_rate": 0.00047171323243909257, "loss": 6.5236, "mean_token_accuracy": 0.12042340859770775, "num_tokens": 3180696.0, "step": 1485 }, { "entropy": 6.4698486328125, "epoch": 0.08708866678356421, "grad_norm": 0.9921875, "learning_rate": 0.00047113866647116457, "loss": 6.4374, "mean_token_accuracy": 0.11517155095934868, "num_tokens": 3191836.0, "step": 1490 }, { "entropy": 6.432517099380493, "epoch": 0.0873809106318312, "grad_norm": 1.09375, "learning_rate": 0.0004705587232626164, "loss": 6.3758, "mean_token_accuracy": 0.12214858755469322, "num_tokens": 3202009.0, "step": 1495 }, { "entropy": 6.38523383140564, "epoch": 0.0876731544800982, "grad_norm": 0.921875, "learning_rate": 0.00046997341871288424, "loss": 6.3545, "mean_token_accuracy": 0.12869924455881118, "num_tokens": 3212707.0, "step": 1500 }, { "entropy": 6.449147129058838, "epoch": 0.08796539832836518, "grad_norm": 0.98046875, "learning_rate": 0.0004693827688683879, "loss": 6.4027, "mean_token_accuracy": 0.11799835041165352, "num_tokens": 3223007.0, "step": 1505 }, { "entropy": 6.5049091339111325, "epoch": 0.08825764217663218, "grad_norm": 1.1484375, "learning_rate": 0.0004687867899220914, "loss": 6.4222, "mean_token_accuracy": 0.12286672741174698, "num_tokens": 3234634.0, "step": 1510 }, { "entropy": 6.402359294891357, "epoch": 0.08854988602489917, "grad_norm": 1.125, "learning_rate": 0.00046818549821305846, "loss": 6.3971, "mean_token_accuracy": 0.12333594635128975, "num_tokens": 3245338.0, "step": 1515 }, { "entropy": 6.5087133884429935, "epoch": 0.08884212987316617, "grad_norm": 1.125, "learning_rate": 0.00046757891022600494, "loss": 6.4985, "mean_token_accuracy": 0.12035001292824746, "num_tokens": 3255776.0, "step": 1520 }, { "entropy": 6.436366891860962, "epoch": 0.08913437372143317, "grad_norm": 1.015625, "learning_rate": 0.0004669670425908471, "loss": 6.3967, "mean_token_accuracy": 0.12574007660150527, "num_tokens": 3265908.0, "step": 1525 }, { "entropy": 6.488069295883179, "epoch": 0.08942661756970016, "grad_norm": 1.0, "learning_rate": 0.0004663499120822451, "loss": 6.4717, "mean_token_accuracy": 0.11899737641215324, "num_tokens": 3277623.0, "step": 1530 }, { "entropy": 6.431543445587158, "epoch": 0.08971886141796716, "grad_norm": 0.98828125, "learning_rate": 0.0004657275356191437, "loss": 6.4053, "mean_token_accuracy": 0.12159285694360733, "num_tokens": 3288804.0, "step": 1535 }, { "entropy": 6.3821464538574215, "epoch": 0.09001110526623414, "grad_norm": 1.0234375, "learning_rate": 0.00046509993026430804, "loss": 6.4055, "mean_token_accuracy": 0.12484046667814255, "num_tokens": 3299162.0, "step": 1540 }, { "entropy": 6.473441171646118, "epoch": 0.09030334911450114, "grad_norm": 0.99609375, "learning_rate": 0.0004644671132238558, "loss": 6.4532, "mean_token_accuracy": 0.1200271911919117, "num_tokens": 3311425.0, "step": 1545 }, { "entropy": 6.41570463180542, "epoch": 0.09059559296276813, "grad_norm": 1.0078125, "learning_rate": 0.00046382910184678585, "loss": 6.392, "mean_token_accuracy": 0.1237281620502472, "num_tokens": 3322623.0, "step": 1550 }, { "entropy": 6.559175443649292, "epoch": 0.09088783681103513, "grad_norm": 1.0390625, "learning_rate": 0.0004631859136245025, "loss": 6.4016, "mean_token_accuracy": 0.119428800791502, "num_tokens": 3333234.0, "step": 1555 }, { "entropy": 6.382933664321899, "epoch": 0.09118008065930212, "grad_norm": 1.0859375, "learning_rate": 0.0004625375661903357, "loss": 6.4188, "mean_token_accuracy": 0.12374623641371726, "num_tokens": 3343302.0, "step": 1560 }, { "entropy": 6.434831190109253, "epoch": 0.09147232450756912, "grad_norm": 1.15625, "learning_rate": 0.00046188407731905787, "loss": 6.4081, "mean_token_accuracy": 0.11539566516876221, "num_tokens": 3355107.0, "step": 1565 }, { "entropy": 6.464893102645874, "epoch": 0.09176456835583612, "grad_norm": 1.046875, "learning_rate": 0.00046122546492639643, "loss": 6.3832, "mean_token_accuracy": 0.12429433092474937, "num_tokens": 3366459.0, "step": 1570 }, { "entropy": 6.394007062911987, "epoch": 0.0920568122041031, "grad_norm": 1.0234375, "learning_rate": 0.000460561747068543, "loss": 6.3437, "mean_token_accuracy": 0.12754202634096146, "num_tokens": 3377050.0, "step": 1575 }, { "entropy": 6.351640415191651, "epoch": 0.0923490560523701, "grad_norm": 1.140625, "learning_rate": 0.0004598929419416578, "loss": 6.3578, "mean_token_accuracy": 0.12364773005247116, "num_tokens": 3387810.0, "step": 1580 }, { "entropy": 6.372348213195801, "epoch": 0.09264129990063709, "grad_norm": 1.0703125, "learning_rate": 0.00045921906788137123, "loss": 6.3087, "mean_token_accuracy": 0.1251809149980545, "num_tokens": 3398038.0, "step": 1585 }, { "entropy": 6.48484992980957, "epoch": 0.09293354374890408, "grad_norm": 1.09375, "learning_rate": 0.00045854014336228115, "loss": 6.3971, "mean_token_accuracy": 0.12183109745383262, "num_tokens": 3408426.0, "step": 1590 }, { "entropy": 6.383055734634399, "epoch": 0.09322578759717108, "grad_norm": 0.99609375, "learning_rate": 0.00045785618699744615, "loss": 6.3343, "mean_token_accuracy": 0.12766708433628082, "num_tokens": 3419268.0, "step": 1595 }, { "entropy": 6.44209623336792, "epoch": 0.09351803144543808, "grad_norm": 0.9375, "learning_rate": 0.00045716721753787543, "loss": 6.3343, "mean_token_accuracy": 0.1299479439854622, "num_tokens": 3429813.0, "step": 1600 }, { "entropy": 6.311538505554199, "epoch": 0.09381027529370507, "grad_norm": 1.0234375, "learning_rate": 0.0004564732538720148, "loss": 6.3186, "mean_token_accuracy": 0.13134126588702202, "num_tokens": 3440062.0, "step": 1605 }, { "entropy": 6.4730775356292725, "epoch": 0.09410251914197205, "grad_norm": 0.953125, "learning_rate": 0.00045577431502522877, "loss": 6.3151, "mean_token_accuracy": 0.119265066832304, "num_tokens": 3450204.0, "step": 1610 }, { "entropy": 6.293524074554443, "epoch": 0.09439476299023905, "grad_norm": 0.95703125, "learning_rate": 0.0004550704201592787, "loss": 6.3152, "mean_token_accuracy": 0.12793571650981903, "num_tokens": 3460593.0, "step": 1615 }, { "entropy": 6.456835985183716, "epoch": 0.09468700683850605, "grad_norm": 0.95703125, "learning_rate": 0.0004543615885717981, "loss": 6.3474, "mean_token_accuracy": 0.1260027453303337, "num_tokens": 3471617.0, "step": 1620 }, { "entropy": 6.301732873916626, "epoch": 0.09497925068677304, "grad_norm": 1.1328125, "learning_rate": 0.00045364783969576296, "loss": 6.3462, "mean_token_accuracy": 0.1214242309331894, "num_tokens": 3481701.0, "step": 1625 }, { "entropy": 6.368519926071167, "epoch": 0.09527149453504004, "grad_norm": 1.09375, "learning_rate": 0.0004529291930989592, "loss": 6.3516, "mean_token_accuracy": 0.12556039541959763, "num_tokens": 3491148.0, "step": 1630 }, { "entropy": 6.446704864501953, "epoch": 0.09556373838330703, "grad_norm": 0.94921875, "learning_rate": 0.0004522056684834464, "loss": 6.408, "mean_token_accuracy": 0.12289013266563416, "num_tokens": 3501675.0, "step": 1635 }, { "entropy": 6.411620616912842, "epoch": 0.09585598223157403, "grad_norm": 1.078125, "learning_rate": 0.0004514772856850173, "loss": 6.3322, "mean_token_accuracy": 0.12715326100587845, "num_tokens": 3512988.0, "step": 1640 }, { "entropy": 6.336518287658691, "epoch": 0.09614822607984103, "grad_norm": 0.9921875, "learning_rate": 0.0004507440646726542, "loss": 6.3359, "mean_token_accuracy": 0.12428070306777954, "num_tokens": 3524004.0, "step": 1645 }, { "entropy": 6.390318155288696, "epoch": 0.09644046992810801, "grad_norm": 0.9921875, "learning_rate": 0.0004500060255479818, "loss": 6.3273, "mean_token_accuracy": 0.1296905018389225, "num_tokens": 3533627.0, "step": 1650 }, { "entropy": 6.385443687438965, "epoch": 0.096732713776375, "grad_norm": 0.96875, "learning_rate": 0.0004492631885447151, "loss": 6.3199, "mean_token_accuracy": 0.12533507943153382, "num_tokens": 3544798.0, "step": 1655 }, { "entropy": 6.4146082401275635, "epoch": 0.097024957624642, "grad_norm": 0.97265625, "learning_rate": 0.00044851557402810616, "loss": 6.4395, "mean_token_accuracy": 0.12418477311730385, "num_tokens": 3556379.0, "step": 1660 }, { "entropy": 6.486456441879272, "epoch": 0.097317201472909, "grad_norm": 1.015625, "learning_rate": 0.00044776320249438444, "loss": 6.3223, "mean_token_accuracy": 0.12915950194001197, "num_tokens": 3567032.0, "step": 1665 }, { "entropy": 6.362237405776978, "epoch": 0.09760944532117599, "grad_norm": 0.98046875, "learning_rate": 0.00044700609457019565, "loss": 6.3932, "mean_token_accuracy": 0.1188717357814312, "num_tokens": 3578419.0, "step": 1670 }, { "entropy": 6.366336917877197, "epoch": 0.09790168916944299, "grad_norm": 1.03125, "learning_rate": 0.0004462442710120359, "loss": 6.3035, "mean_token_accuracy": 0.12955877259373666, "num_tokens": 3589501.0, "step": 1675 }, { "entropy": 6.345707559585572, "epoch": 0.09819393301770998, "grad_norm": 1.0234375, "learning_rate": 0.000445477752705683, "loss": 6.2906, "mean_token_accuracy": 0.1341054067015648, "num_tokens": 3600162.0, "step": 1680 }, { "entropy": 6.401959180831909, "epoch": 0.09848617686597697, "grad_norm": 1.0078125, "learning_rate": 0.00044470656066562336, "loss": 6.3893, "mean_token_accuracy": 0.12404495999217033, "num_tokens": 3610860.0, "step": 1685 }, { "entropy": 6.393278408050537, "epoch": 0.09877842071424396, "grad_norm": 0.9921875, "learning_rate": 0.0004439307160344765, "loss": 6.3654, "mean_token_accuracy": 0.118367550522089, "num_tokens": 3620989.0, "step": 1690 }, { "entropy": 6.366997861862183, "epoch": 0.09907066456251096, "grad_norm": 0.90625, "learning_rate": 0.00044315024008241473, "loss": 6.2943, "mean_token_accuracy": 0.12480385452508927, "num_tokens": 3631602.0, "step": 1695 }, { "entropy": 6.428997039794922, "epoch": 0.09936290841077795, "grad_norm": 1.0703125, "learning_rate": 0.0004423651542065806, "loss": 6.3501, "mean_token_accuracy": 0.12229208797216415, "num_tokens": 3642326.0, "step": 1700 }, { "entropy": 6.342395067214966, "epoch": 0.09965515225904495, "grad_norm": 1.0859375, "learning_rate": 0.00044157547993050006, "loss": 6.303, "mean_token_accuracy": 0.1299465276300907, "num_tokens": 3652036.0, "step": 1705 }, { "entropy": 6.422306537628174, "epoch": 0.09994739610731194, "grad_norm": 1.09375, "learning_rate": 0.00044078123890349227, "loss": 6.3607, "mean_token_accuracy": 0.1249079592525959, "num_tokens": 3661557.0, "step": 1710 }, { "entropy": 6.4041478633880615, "epoch": 0.10023963995557894, "grad_norm": 0.94140625, "learning_rate": 0.00043998245290007606, "loss": 6.3382, "mean_token_accuracy": 0.12813913747668265, "num_tokens": 3671487.0, "step": 1715 }, { "entropy": 6.363600063323974, "epoch": 0.10053188380384592, "grad_norm": 0.96875, "learning_rate": 0.00043917914381937323, "loss": 6.3671, "mean_token_accuracy": 0.12218450903892517, "num_tokens": 3682873.0, "step": 1720 }, { "entropy": 6.3568596839904785, "epoch": 0.10082412765211292, "grad_norm": 0.96875, "learning_rate": 0.00043837133368450815, "loss": 6.2743, "mean_token_accuracy": 0.12958545982837677, "num_tokens": 3693635.0, "step": 1725 }, { "entropy": 6.338172101974488, "epoch": 0.10111637150037991, "grad_norm": 0.9609375, "learning_rate": 0.0004375590446420037, "loss": 6.2803, "mean_token_accuracy": 0.129776468873024, "num_tokens": 3703777.0, "step": 1730 }, { "entropy": 6.341785001754761, "epoch": 0.10140861534864691, "grad_norm": 1.03125, "learning_rate": 0.0004367422989611743, "loss": 6.3153, "mean_token_accuracy": 0.13043999075889587, "num_tokens": 3716370.0, "step": 1735 }, { "entropy": 6.41265835762024, "epoch": 0.1017008591969139, "grad_norm": 0.94921875, "learning_rate": 0.0004359211190335153, "loss": 6.3648, "mean_token_accuracy": 0.12569364979863168, "num_tokens": 3726473.0, "step": 1740 }, { "entropy": 6.404611396789551, "epoch": 0.1019931030451809, "grad_norm": 1.15625, "learning_rate": 0.00043509552737208923, "loss": 6.3738, "mean_token_accuracy": 0.1196278490126133, "num_tokens": 3737645.0, "step": 1745 }, { "entropy": 6.358111000061035, "epoch": 0.1022853468934479, "grad_norm": 0.953125, "learning_rate": 0.00043426554661090853, "loss": 6.3765, "mean_token_accuracy": 0.12168645784258843, "num_tokens": 3749347.0, "step": 1750 }, { "entropy": 6.338151216506958, "epoch": 0.10257759074171488, "grad_norm": 0.9921875, "learning_rate": 0.00043343119950431516, "loss": 6.3223, "mean_token_accuracy": 0.12965482100844383, "num_tokens": 3760131.0, "step": 1755 }, { "entropy": 6.3946410655975345, "epoch": 0.10286983458998188, "grad_norm": 1.1171875, "learning_rate": 0.00043259250892635644, "loss": 6.3055, "mean_token_accuracy": 0.12608301565051078, "num_tokens": 3770722.0, "step": 1760 }, { "entropy": 6.347224617004395, "epoch": 0.10316207843824887, "grad_norm": 1.0078125, "learning_rate": 0.0004317494978701582, "loss": 6.2764, "mean_token_accuracy": 0.1338924378156662, "num_tokens": 3781562.0, "step": 1765 }, { "entropy": 6.364816331863404, "epoch": 0.10345432228651587, "grad_norm": 0.96875, "learning_rate": 0.0004309021894472943, "loss": 6.2817, "mean_token_accuracy": 0.12620307505130768, "num_tokens": 3791029.0, "step": 1770 }, { "entropy": 6.393705987930298, "epoch": 0.10374656613478286, "grad_norm": 0.96484375, "learning_rate": 0.0004300506068871534, "loss": 6.289, "mean_token_accuracy": 0.13021805733442307, "num_tokens": 3802526.0, "step": 1775 }, { "entropy": 6.30857138633728, "epoch": 0.10403880998304986, "grad_norm": 1.0625, "learning_rate": 0.00042919477353630135, "loss": 6.2654, "mean_token_accuracy": 0.13339556902647018, "num_tokens": 3813394.0, "step": 1780 }, { "entropy": 6.312510919570923, "epoch": 0.10433105383131686, "grad_norm": 0.96875, "learning_rate": 0.000428334712857842, "loss": 6.2581, "mean_token_accuracy": 0.1305323101580143, "num_tokens": 3824852.0, "step": 1785 }, { "entropy": 6.29648756980896, "epoch": 0.10462329767958385, "grad_norm": 0.953125, "learning_rate": 0.00042747044843077304, "loss": 6.2738, "mean_token_accuracy": 0.12493606880307198, "num_tokens": 3835743.0, "step": 1790 }, { "entropy": 6.343502330780029, "epoch": 0.10491554152785083, "grad_norm": 0.9765625, "learning_rate": 0.00042660200394934047, "loss": 6.2605, "mean_token_accuracy": 0.12992578819394113, "num_tokens": 3846897.0, "step": 1795 }, { "entropy": 6.3801350593566895, "epoch": 0.10520778537611783, "grad_norm": 0.94921875, "learning_rate": 0.00042572940322238844, "loss": 6.2724, "mean_token_accuracy": 0.13262551203370093, "num_tokens": 3857351.0, "step": 1800 }, { "entropy": 6.275812339782715, "epoch": 0.10550002922438483, "grad_norm": 1.0703125, "learning_rate": 0.00042485267017270664, "loss": 6.2366, "mean_token_accuracy": 0.13671592473983765, "num_tokens": 3867696.0, "step": 1805 }, { "entropy": 6.325400447845459, "epoch": 0.10579227307265182, "grad_norm": 1.09375, "learning_rate": 0.0004239718288363745, "loss": 6.3275, "mean_token_accuracy": 0.1320234626531601, "num_tokens": 3878473.0, "step": 1810 }, { "entropy": 6.3584887981414795, "epoch": 0.10608451692091882, "grad_norm": 0.97265625, "learning_rate": 0.0004230869033621023, "loss": 6.3161, "mean_token_accuracy": 0.13206197172403336, "num_tokens": 3888750.0, "step": 1815 }, { "entropy": 6.311602640151977, "epoch": 0.10637676076918581, "grad_norm": 1.0390625, "learning_rate": 0.0004221979180105688, "loss": 6.3215, "mean_token_accuracy": 0.12421507909893989, "num_tokens": 3898867.0, "step": 1820 }, { "entropy": 6.32457480430603, "epoch": 0.10666900461745281, "grad_norm": 1.0234375, "learning_rate": 0.00042130489715375645, "loss": 6.258, "mean_token_accuracy": 0.13351302370429038, "num_tokens": 3909103.0, "step": 1825 }, { "entropy": 6.318645715713501, "epoch": 0.10696124846571979, "grad_norm": 1.1171875, "learning_rate": 0.00042040786527428335, "loss": 6.1914, "mean_token_accuracy": 0.13429306745529174, "num_tokens": 3919592.0, "step": 1830 }, { "entropy": 6.346998023986816, "epoch": 0.10725349231398679, "grad_norm": 0.96484375, "learning_rate": 0.0004195068469647315, "loss": 6.2732, "mean_token_accuracy": 0.12874911576509476, "num_tokens": 3930730.0, "step": 1835 }, { "entropy": 6.2924802780151365, "epoch": 0.10754573616225378, "grad_norm": 1.0078125, "learning_rate": 0.00041860186692697297, "loss": 6.2902, "mean_token_accuracy": 0.12385930791497231, "num_tokens": 3942535.0, "step": 1840 }, { "entropy": 6.329216051101684, "epoch": 0.10783798001052078, "grad_norm": 0.9921875, "learning_rate": 0.00041769294997149264, "loss": 6.2765, "mean_token_accuracy": 0.12904328033328055, "num_tokens": 3953651.0, "step": 1845 }, { "entropy": 6.392510271072387, "epoch": 0.10813022385878777, "grad_norm": 0.96875, "learning_rate": 0.0004167801210167081, "loss": 6.2396, "mean_token_accuracy": 0.13275438472628592, "num_tokens": 3963501.0, "step": 1850 }, { "entropy": 6.2914917945861815, "epoch": 0.10842246770705477, "grad_norm": 1.03125, "learning_rate": 0.0004158634050882861, "loss": 6.2307, "mean_token_accuracy": 0.12977104857563973, "num_tokens": 3973617.0, "step": 1855 }, { "entropy": 6.336210870742798, "epoch": 0.10871471155532177, "grad_norm": 0.9609375, "learning_rate": 0.0004149428273184569, "loss": 6.2988, "mean_token_accuracy": 0.12246305719017983, "num_tokens": 3985313.0, "step": 1860 }, { "entropy": 6.2909324169158936, "epoch": 0.10900695540358875, "grad_norm": 1.1015625, "learning_rate": 0.0004140184129453253, "loss": 6.24, "mean_token_accuracy": 0.12916646972298623, "num_tokens": 3995136.0, "step": 1865 }, { "entropy": 6.251706933975219, "epoch": 0.10929919925185574, "grad_norm": 1.2734375, "learning_rate": 0.000413090187312178, "loss": 6.1416, "mean_token_accuracy": 0.14623225331306458, "num_tokens": 4004633.0, "step": 1870 }, { "entropy": 6.329136228561401, "epoch": 0.10959144310012274, "grad_norm": 1.03125, "learning_rate": 0.0004121581758667898, "loss": 6.2446, "mean_token_accuracy": 0.1265272855758667, "num_tokens": 4013949.0, "step": 1875 }, { "entropy": 6.2680024147033695, "epoch": 0.10988368694838974, "grad_norm": 1.03125, "learning_rate": 0.00041122240416072533, "loss": 6.2237, "mean_token_accuracy": 0.13091572299599646, "num_tokens": 4024456.0, "step": 1880 }, { "entropy": 6.260085582733154, "epoch": 0.11017593079665673, "grad_norm": 0.9609375, "learning_rate": 0.0004102828978486385, "loss": 6.2148, "mean_token_accuracy": 0.14045012667775153, "num_tokens": 4035271.0, "step": 1885 }, { "entropy": 6.353982257843017, "epoch": 0.11046817464492373, "grad_norm": 0.984375, "learning_rate": 0.0004093396826875695, "loss": 6.2946, "mean_token_accuracy": 0.13420966342091561, "num_tokens": 4045861.0, "step": 1890 }, { "entropy": 6.334712219238281, "epoch": 0.11076041849319072, "grad_norm": 1.0234375, "learning_rate": 0.00040839278453623837, "loss": 6.1899, "mean_token_accuracy": 0.13066370338201522, "num_tokens": 4056060.0, "step": 1895 }, { "entropy": 6.219831371307373, "epoch": 0.1110526623414577, "grad_norm": 0.8828125, "learning_rate": 0.0004074422293543363, "loss": 6.2573, "mean_token_accuracy": 0.13225416764616965, "num_tokens": 4068098.0, "step": 1900 }, { "entropy": 6.317618751525879, "epoch": 0.1113449061897247, "grad_norm": 0.984375, "learning_rate": 0.0004064880432018137, "loss": 6.1764, "mean_token_accuracy": 0.14364669099450111, "num_tokens": 4079186.0, "step": 1905 }, { "entropy": 6.2356115818023685, "epoch": 0.1116371500379917, "grad_norm": 1.125, "learning_rate": 0.00040553025223816615, "loss": 6.1873, "mean_token_accuracy": 0.1371534802019596, "num_tokens": 4089430.0, "step": 1910 }, { "entropy": 6.309043121337891, "epoch": 0.1119293938862587, "grad_norm": 1.015625, "learning_rate": 0.00040456888272171653, "loss": 6.189, "mean_token_accuracy": 0.13867145776748657, "num_tokens": 4099702.0, "step": 1915 }, { "entropy": 6.352001428604126, "epoch": 0.11222163773452569, "grad_norm": 1.0546875, "learning_rate": 0.00040360396100889577, "loss": 6.2926, "mean_token_accuracy": 0.12570124194025994, "num_tokens": 4111108.0, "step": 1920 }, { "entropy": 6.280226993560791, "epoch": 0.11251388158279269, "grad_norm": 1.0625, "learning_rate": 0.0004026355135535202, "loss": 6.2632, "mean_token_accuracy": 0.12929408848285676, "num_tokens": 4122470.0, "step": 1925 }, { "entropy": 6.2651409149169925, "epoch": 0.11280612543105968, "grad_norm": 1.0625, "learning_rate": 0.000401663566906066, "loss": 6.1811, "mean_token_accuracy": 0.13483544066548347, "num_tokens": 4132652.0, "step": 1930 }, { "entropy": 6.323620223999024, "epoch": 0.11309836927932668, "grad_norm": 1.03125, "learning_rate": 0.00040068814771294134, "loss": 6.2881, "mean_token_accuracy": 0.12270993292331696, "num_tokens": 4143449.0, "step": 1935 }, { "entropy": 6.342724847793579, "epoch": 0.11339061312759366, "grad_norm": 1.0703125, "learning_rate": 0.0003997092827157562, "loss": 6.2089, "mean_token_accuracy": 0.136571054905653, "num_tokens": 4153536.0, "step": 1940 }, { "entropy": 6.257393646240234, "epoch": 0.11368285697586065, "grad_norm": 0.96875, "learning_rate": 0.000398726998750589, "loss": 6.2617, "mean_token_accuracy": 0.1267533928155899, "num_tokens": 4165339.0, "step": 1945 }, { "entropy": 6.361189365386963, "epoch": 0.11397510082412765, "grad_norm": 1.0078125, "learning_rate": 0.00039774132274725076, "loss": 6.3298, "mean_token_accuracy": 0.12190727666020393, "num_tokens": 4177171.0, "step": 1950 }, { "entropy": 6.362505912780762, "epoch": 0.11426734467239465, "grad_norm": 1.046875, "learning_rate": 0.00039675228172854707, "loss": 6.209, "mean_token_accuracy": 0.13935441598296167, "num_tokens": 4186577.0, "step": 1955 }, { "entropy": 6.115205717086792, "epoch": 0.11455958852066164, "grad_norm": 0.953125, "learning_rate": 0.0003957599028095371, "loss": 6.2431, "mean_token_accuracy": 0.13071082010865212, "num_tokens": 4196962.0, "step": 1960 }, { "entropy": 6.336116027832031, "epoch": 0.11485183236892864, "grad_norm": 0.93359375, "learning_rate": 0.00039476421319679017, "loss": 6.2418, "mean_token_accuracy": 0.13397978022694587, "num_tokens": 4207544.0, "step": 1965 }, { "entropy": 6.38735728263855, "epoch": 0.11514407621719563, "grad_norm": 0.984375, "learning_rate": 0.00039376524018764, "loss": 6.2176, "mean_token_accuracy": 0.134936810284853, "num_tokens": 4217359.0, "step": 1970 }, { "entropy": 6.221807336807251, "epoch": 0.11543632006546262, "grad_norm": 1.0, "learning_rate": 0.00039276301116943616, "loss": 6.2375, "mean_token_accuracy": 0.1313203439116478, "num_tokens": 4227826.0, "step": 1975 }, { "entropy": 6.366882801055908, "epoch": 0.11572856391372961, "grad_norm": 0.91796875, "learning_rate": 0.0003917575536187936, "loss": 6.1952, "mean_token_accuracy": 0.12822012454271317, "num_tokens": 4238591.0, "step": 1980 }, { "entropy": 6.311385679244995, "epoch": 0.11602080776199661, "grad_norm": 1.078125, "learning_rate": 0.00039074889510083894, "loss": 6.2126, "mean_token_accuracy": 0.1306764416396618, "num_tokens": 4248771.0, "step": 1985 }, { "entropy": 6.303131580352783, "epoch": 0.1163130516102636, "grad_norm": 0.98828125, "learning_rate": 0.00038973706326845495, "loss": 6.2769, "mean_token_accuracy": 0.1265501409769058, "num_tokens": 4259234.0, "step": 1990 }, { "entropy": 6.277475070953369, "epoch": 0.1166052954585306, "grad_norm": 0.890625, "learning_rate": 0.0003887220858615225, "loss": 6.2888, "mean_token_accuracy": 0.12363493666052819, "num_tokens": 4270891.0, "step": 1995 }, { "entropy": 6.377652549743653, "epoch": 0.1168975393067976, "grad_norm": 1.0546875, "learning_rate": 0.0003877039907061597, "loss": 6.2989, "mean_token_accuracy": 0.1283785842359066, "num_tokens": 4282893.0, "step": 2000 }, { "entropy": 6.249635171890259, "epoch": 0.11718978315506459, "grad_norm": 1.0703125, "learning_rate": 0.0003866828057139598, "loss": 6.1859, "mean_token_accuracy": 0.1322122819721699, "num_tokens": 4292630.0, "step": 2005 }, { "entropy": 6.261950254440308, "epoch": 0.11748202700333157, "grad_norm": 0.93359375, "learning_rate": 0.00038565855888122503, "loss": 6.2306, "mean_token_accuracy": 0.13367020040750505, "num_tokens": 4302849.0, "step": 2010 }, { "entropy": 6.2926130294799805, "epoch": 0.11777427085159857, "grad_norm": 0.94140625, "learning_rate": 0.00038463127828819975, "loss": 6.2355, "mean_token_accuracy": 0.13290671557188033, "num_tokens": 4313178.0, "step": 2015 }, { "entropy": 6.382750606536865, "epoch": 0.11806651469986557, "grad_norm": 1.078125, "learning_rate": 0.00038360099209830043, "loss": 6.2729, "mean_token_accuracy": 0.13396400362253189, "num_tokens": 4323205.0, "step": 2020 }, { "entropy": 6.220796394348144, "epoch": 0.11835875854813256, "grad_norm": 0.9765625, "learning_rate": 0.0003825677285573433, "loss": 6.2158, "mean_token_accuracy": 0.13015230521559715, "num_tokens": 4333840.0, "step": 2025 }, { "entropy": 6.344536399841308, "epoch": 0.11865100239639956, "grad_norm": 0.99609375, "learning_rate": 0.00038153151599277027, "loss": 6.2155, "mean_token_accuracy": 0.13493136763572694, "num_tokens": 4344489.0, "step": 2030 }, { "entropy": 6.278243160247802, "epoch": 0.11894324624466655, "grad_norm": 0.98828125, "learning_rate": 0.0003804923828128723, "loss": 6.1856, "mean_token_accuracy": 0.13395058140158653, "num_tokens": 4355008.0, "step": 2035 }, { "entropy": 6.238671875, "epoch": 0.11923549009293355, "grad_norm": 1.0390625, "learning_rate": 0.0003794503575060104, "loss": 6.2135, "mean_token_accuracy": 0.1329597570002079, "num_tokens": 4365944.0, "step": 2040 }, { "entropy": 6.319523668289184, "epoch": 0.11952773394120053, "grad_norm": 1.0625, "learning_rate": 0.00037840546863983484, "loss": 6.2223, "mean_token_accuracy": 0.13217944651842117, "num_tokens": 4376448.0, "step": 2045 }, { "entropy": 6.299238443374634, "epoch": 0.11981997778946753, "grad_norm": 0.9609375, "learning_rate": 0.0003773577448605015, "loss": 6.1553, "mean_token_accuracy": 0.13440817669034005, "num_tokens": 4386748.0, "step": 2050 }, { "entropy": 6.270139694213867, "epoch": 0.12011222163773452, "grad_norm": 1.0234375, "learning_rate": 0.0003763072148918872, "loss": 6.1454, "mean_token_accuracy": 0.14509789347648622, "num_tokens": 4396956.0, "step": 2055 }, { "entropy": 6.2123939037323, "epoch": 0.12040446548600152, "grad_norm": 1.1171875, "learning_rate": 0.0003752539075348017, "loss": 6.1742, "mean_token_accuracy": 0.1364543430507183, "num_tokens": 4406551.0, "step": 2060 }, { "entropy": 6.310663366317749, "epoch": 0.12069670933426851, "grad_norm": 1.1015625, "learning_rate": 0.00037419785166619817, "loss": 6.1642, "mean_token_accuracy": 0.13440534472465515, "num_tokens": 4416847.0, "step": 2065 }, { "entropy": 6.242231559753418, "epoch": 0.12098895318253551, "grad_norm": 1.078125, "learning_rate": 0.0003731390762383818, "loss": 6.1556, "mean_token_accuracy": 0.1388556867837906, "num_tokens": 4427579.0, "step": 2070 }, { "entropy": 6.2008545875549315, "epoch": 0.1212811970308025, "grad_norm": 1.0703125, "learning_rate": 0.0003720776102782158, "loss": 6.1474, "mean_token_accuracy": 0.13912375494837761, "num_tokens": 4438473.0, "step": 2075 }, { "entropy": 6.234990024566651, "epoch": 0.12157344087906949, "grad_norm": 1.0234375, "learning_rate": 0.00037101348288632555, "loss": 6.1402, "mean_token_accuracy": 0.1427859090268612, "num_tokens": 4448851.0, "step": 2080 }, { "entropy": 6.150416326522827, "epoch": 0.12186568472733648, "grad_norm": 1.0078125, "learning_rate": 0.0003699467232363012, "loss": 6.1615, "mean_token_accuracy": 0.13463753834366798, "num_tokens": 4459612.0, "step": 2085 }, { "entropy": 6.215969181060791, "epoch": 0.12215792857560348, "grad_norm": 1.0, "learning_rate": 0.0003688773605738973, "loss": 6.112, "mean_token_accuracy": 0.13399859592318536, "num_tokens": 4470365.0, "step": 2090 }, { "entropy": 6.249767017364502, "epoch": 0.12245017242387048, "grad_norm": 1.359375, "learning_rate": 0.00036780542421623134, "loss": 6.1956, "mean_token_accuracy": 0.1419701375067234, "num_tokens": 4481329.0, "step": 2095 }, { "entropy": 6.248475027084351, "epoch": 0.12274241627213747, "grad_norm": 1.0859375, "learning_rate": 0.0003667309435509802, "loss": 6.1503, "mean_token_accuracy": 0.12978014945983887, "num_tokens": 4491904.0, "step": 2100 }, { "entropy": 6.251853132247925, "epoch": 0.12303466012040447, "grad_norm": 1.1484375, "learning_rate": 0.0003656539480355741, "loss": 6.0943, "mean_token_accuracy": 0.1463254511356354, "num_tokens": 4501432.0, "step": 2105 }, { "entropy": 6.2275115013122555, "epoch": 0.12332690396867146, "grad_norm": 0.98828125, "learning_rate": 0.0003645744671963891, "loss": 6.096, "mean_token_accuracy": 0.13819159865379332, "num_tokens": 4511512.0, "step": 2110 }, { "entropy": 6.2278444290161135, "epoch": 0.12361914781693846, "grad_norm": 0.98046875, "learning_rate": 0.0003634925306279376, "loss": 6.207, "mean_token_accuracy": 0.13566816449165345, "num_tokens": 4521701.0, "step": 2115 }, { "entropy": 6.278735494613647, "epoch": 0.12391139166520544, "grad_norm": 1.0625, "learning_rate": 0.0003624081679920574, "loss": 6.1613, "mean_token_accuracy": 0.14083656966686248, "num_tokens": 4531512.0, "step": 2120 }, { "entropy": 6.239475536346435, "epoch": 0.12420363551347244, "grad_norm": 1.0390625, "learning_rate": 0.0003613214090170977, "loss": 6.1391, "mean_token_accuracy": 0.1424753561615944, "num_tokens": 4542083.0, "step": 2125 }, { "entropy": 6.218933725357056, "epoch": 0.12449587936173943, "grad_norm": 0.9609375, "learning_rate": 0.0003602322834971048, "loss": 6.1574, "mean_token_accuracy": 0.13780356496572493, "num_tokens": 4553207.0, "step": 2130 }, { "entropy": 6.344869232177734, "epoch": 0.12478812321000643, "grad_norm": 1.0859375, "learning_rate": 0.0003591408212910051, "loss": 6.1931, "mean_token_accuracy": 0.13503697365522385, "num_tokens": 4564349.0, "step": 2135 }, { "entropy": 6.253999805450439, "epoch": 0.1250803670582734, "grad_norm": 1.1484375, "learning_rate": 0.0003580470523217863, "loss": 6.1121, "mean_token_accuracy": 0.1333679050207138, "num_tokens": 4574935.0, "step": 2140 }, { "entropy": 6.1710728168487545, "epoch": 0.12537261090654042, "grad_norm": 1.1484375, "learning_rate": 0.0003569510065756771, "loss": 6.1987, "mean_token_accuracy": 0.1306650847196579, "num_tokens": 4586439.0, "step": 2145 }, { "entropy": 6.208186054229737, "epoch": 0.1256648547548074, "grad_norm": 0.984375, "learning_rate": 0.0003558527141013254, "loss": 6.056, "mean_token_accuracy": 0.14841998964548112, "num_tokens": 4596439.0, "step": 2150 }, { "entropy": 6.174758529663086, "epoch": 0.1259570986030744, "grad_norm": 1.0390625, "learning_rate": 0.0003547522050089742, "loss": 6.1309, "mean_token_accuracy": 0.1388734348118305, "num_tokens": 4606920.0, "step": 2155 }, { "entropy": 6.334303569793701, "epoch": 0.1262493424513414, "grad_norm": 0.9921875, "learning_rate": 0.00035364950946963606, "loss": 6.1975, "mean_token_accuracy": 0.13557516783475876, "num_tokens": 4618234.0, "step": 2160 }, { "entropy": 6.131727790832519, "epoch": 0.1265415862996084, "grad_norm": 1.0390625, "learning_rate": 0.0003525446577142663, "loss": 6.006, "mean_token_accuracy": 0.15448770821094512, "num_tokens": 4629201.0, "step": 2165 }, { "entropy": 6.234293460845947, "epoch": 0.1268338301478754, "grad_norm": 1.0, "learning_rate": 0.00035143768003293395, "loss": 6.2451, "mean_token_accuracy": 0.1372879721224308, "num_tokens": 4641008.0, "step": 2170 }, { "entropy": 6.19882378578186, "epoch": 0.12712607399614237, "grad_norm": 1.015625, "learning_rate": 0.0003503286067739913, "loss": 6.1479, "mean_token_accuracy": 0.1357593283057213, "num_tokens": 4651969.0, "step": 2175 }, { "entropy": 6.329754066467285, "epoch": 0.12741831784440938, "grad_norm": 1.0234375, "learning_rate": 0.00034921746834324193, "loss": 6.1915, "mean_token_accuracy": 0.12660348191857337, "num_tokens": 4663081.0, "step": 2180 }, { "entropy": 6.133418941497803, "epoch": 0.12771056169267636, "grad_norm": 0.9921875, "learning_rate": 0.0003481042952031072, "loss": 5.9656, "mean_token_accuracy": 0.15549228340387344, "num_tokens": 4673147.0, "step": 2185 }, { "entropy": 6.121980333328247, "epoch": 0.12800280554094337, "grad_norm": 1.0234375, "learning_rate": 0.0003469891178717911, "loss": 6.1111, "mean_token_accuracy": 0.138456729054451, "num_tokens": 4683237.0, "step": 2190 }, { "entropy": 6.280539798736572, "epoch": 0.12829504938921035, "grad_norm": 0.95703125, "learning_rate": 0.0003458719669224436, "loss": 6.0805, "mean_token_accuracy": 0.1401494786143303, "num_tokens": 4694541.0, "step": 2195 }, { "entropy": 6.218093156814575, "epoch": 0.12858729323747736, "grad_norm": 0.9921875, "learning_rate": 0.0003447528729823221, "loss": 6.1361, "mean_token_accuracy": 0.13514513298869132, "num_tokens": 4704583.0, "step": 2200 }, { "entropy": 6.1446513652801515, "epoch": 0.12887953708574434, "grad_norm": 1.0859375, "learning_rate": 0.0003436318667319525, "loss": 6.1118, "mean_token_accuracy": 0.14716241881251335, "num_tokens": 4715880.0, "step": 2205 }, { "entropy": 6.24896502494812, "epoch": 0.12917178093401133, "grad_norm": 1.109375, "learning_rate": 0.00034250897890428716, "loss": 6.12, "mean_token_accuracy": 0.13427569568157197, "num_tokens": 4726428.0, "step": 2210 }, { "entropy": 6.245270919799805, "epoch": 0.12946402478227834, "grad_norm": 1.078125, "learning_rate": 0.0003413842402838633, "loss": 6.0904, "mean_token_accuracy": 0.13762594237923623, "num_tokens": 4736782.0, "step": 2215 }, { "entropy": 6.168338775634766, "epoch": 0.12975626863054532, "grad_norm": 0.9296875, "learning_rate": 0.00034025768170595834, "loss": 6.1812, "mean_token_accuracy": 0.14207304567098616, "num_tokens": 4747084.0, "step": 2220 }, { "entropy": 6.260279273986816, "epoch": 0.13004851247881233, "grad_norm": 0.99609375, "learning_rate": 0.0003391293340557446, "loss": 6.1211, "mean_token_accuracy": 0.13106030598282814, "num_tokens": 4758499.0, "step": 2225 }, { "entropy": 6.233145523071289, "epoch": 0.1303407563270793, "grad_norm": 1.046875, "learning_rate": 0.0003379992282674431, "loss": 6.1241, "mean_token_accuracy": 0.1361076258122921, "num_tokens": 4768553.0, "step": 2230 }, { "entropy": 6.198996543884277, "epoch": 0.13063300017534632, "grad_norm": 1.0078125, "learning_rate": 0.0003368673953234749, "loss": 6.0605, "mean_token_accuracy": 0.14450395554304124, "num_tokens": 4778214.0, "step": 2235 }, { "entropy": 6.198760271072388, "epoch": 0.1309252440236133, "grad_norm": 1.0, "learning_rate": 0.00033573386625361176, "loss": 6.133, "mean_token_accuracy": 0.137807933986187, "num_tokens": 4789870.0, "step": 2240 }, { "entropy": 6.0669878959655765, "epoch": 0.13121748787188028, "grad_norm": 1.1328125, "learning_rate": 0.00033459867213412567, "loss": 5.8788, "mean_token_accuracy": 0.16402744203805925, "num_tokens": 4801320.0, "step": 2245 }, { "entropy": 6.114277029037476, "epoch": 0.1315097317201473, "grad_norm": 1.0, "learning_rate": 0.000333461844086937, "loss": 6.1554, "mean_token_accuracy": 0.14035945236682892, "num_tokens": 4812170.0, "step": 2250 }, { "entropy": 6.273629903793335, "epoch": 0.13180197556841428, "grad_norm": 1.15625, "learning_rate": 0.00033232341327876097, "loss": 6.1522, "mean_token_accuracy": 0.13791727647185326, "num_tokens": 4823279.0, "step": 2255 }, { "entropy": 6.267527294158936, "epoch": 0.13209421941668129, "grad_norm": 0.96875, "learning_rate": 0.0003311834109202531, "loss": 6.0096, "mean_token_accuracy": 0.14894347488880158, "num_tokens": 4833590.0, "step": 2260 }, { "entropy": 6.066952228546143, "epoch": 0.13238646326494827, "grad_norm": 1.0703125, "learning_rate": 0.00033004186826515416, "loss": 6.0902, "mean_token_accuracy": 0.13956383019685745, "num_tokens": 4844364.0, "step": 2265 }, { "entropy": 6.272472238540649, "epoch": 0.13267870711321528, "grad_norm": 1.1875, "learning_rate": 0.0003288988166094324, "loss": 6.0771, "mean_token_accuracy": 0.13904936313629152, "num_tokens": 4854375.0, "step": 2270 }, { "entropy": 6.233609294891357, "epoch": 0.13297095096148226, "grad_norm": 1.0390625, "learning_rate": 0.00032775428729042656, "loss": 6.1009, "mean_token_accuracy": 0.1401657611131668, "num_tokens": 4864704.0, "step": 2275 }, { "entropy": 6.175923871994018, "epoch": 0.13326319480974924, "grad_norm": 1.09375, "learning_rate": 0.000326608311685986, "loss": 6.0895, "mean_token_accuracy": 0.1436429314315319, "num_tokens": 4874774.0, "step": 2280 }, { "entropy": 6.119866847991943, "epoch": 0.13355543865801625, "grad_norm": 1.0390625, "learning_rate": 0.0003254609212136108, "loss": 6.1121, "mean_token_accuracy": 0.14237722456455232, "num_tokens": 4886263.0, "step": 2285 }, { "entropy": 6.14636082649231, "epoch": 0.13384768250628323, "grad_norm": 0.98828125, "learning_rate": 0.00032431214732959036, "loss": 6.139, "mean_token_accuracy": 0.13580704405903815, "num_tokens": 4897416.0, "step": 2290 }, { "entropy": 6.2751532077789305, "epoch": 0.13413992635455024, "grad_norm": 1.1015625, "learning_rate": 0.000323162021528141, "loss": 6.0936, "mean_token_accuracy": 0.144794699549675, "num_tokens": 4907710.0, "step": 2295 }, { "entropy": 6.2298330783844, "epoch": 0.13443217020281722, "grad_norm": 1.109375, "learning_rate": 0.00032201057534054264, "loss": 6.155, "mean_token_accuracy": 0.13874071165919305, "num_tokens": 4919190.0, "step": 2300 }, { "entropy": 6.189581823348999, "epoch": 0.13472441405108423, "grad_norm": 0.94140625, "learning_rate": 0.00032085784033427414, "loss": 6.1164, "mean_token_accuracy": 0.1413622170686722, "num_tokens": 4929892.0, "step": 2305 }, { "entropy": 6.261451244354248, "epoch": 0.13501665789935122, "grad_norm": 1.0625, "learning_rate": 0.0003197038481121478, "loss": 6.1305, "mean_token_accuracy": 0.1402155190706253, "num_tokens": 4940649.0, "step": 2310 }, { "entropy": 6.201195812225341, "epoch": 0.1353089017476182, "grad_norm": 1.1640625, "learning_rate": 0.0003185486303114436, "loss": 6.1781, "mean_token_accuracy": 0.1384969875216484, "num_tokens": 4950952.0, "step": 2315 }, { "entropy": 6.243939065933228, "epoch": 0.1356011455958852, "grad_norm": 1.0234375, "learning_rate": 0.0003173922186030409, "loss": 6.0969, "mean_token_accuracy": 0.1391613446176052, "num_tokens": 4961473.0, "step": 2320 }, { "entropy": 6.227145767211914, "epoch": 0.1358933894441522, "grad_norm": 1.046875, "learning_rate": 0.000316234644690551, "loss": 6.158, "mean_token_accuracy": 0.13428287506103515, "num_tokens": 4972702.0, "step": 2325 }, { "entropy": 6.225094270706177, "epoch": 0.1361856332924192, "grad_norm": 0.9765625, "learning_rate": 0.0003150759403094473, "loss": 6.1394, "mean_token_accuracy": 0.13642262294888496, "num_tokens": 4983003.0, "step": 2330 }, { "entropy": 6.138577270507812, "epoch": 0.13647787714068618, "grad_norm": 1.03125, "learning_rate": 0.00031391613722619587, "loss": 6.0828, "mean_token_accuracy": 0.14404839053750038, "num_tokens": 4993378.0, "step": 2335 }, { "entropy": 6.229124355316162, "epoch": 0.1367701209889532, "grad_norm": 1.1875, "learning_rate": 0.000312755267237384, "loss": 6.1788, "mean_token_accuracy": 0.1317272149026394, "num_tokens": 5004076.0, "step": 2340 }, { "entropy": 6.341947317123413, "epoch": 0.13706236483722017, "grad_norm": 1.0078125, "learning_rate": 0.0003115933621688488, "loss": 6.1481, "mean_token_accuracy": 0.1339823916554451, "num_tokens": 5014718.0, "step": 2345 }, { "entropy": 6.240772914886475, "epoch": 0.13735460868548718, "grad_norm": 0.9609375, "learning_rate": 0.00031043045387480487, "loss": 6.1432, "mean_token_accuracy": 0.13380517512559892, "num_tokens": 5026102.0, "step": 2350 }, { "entropy": 6.144141101837159, "epoch": 0.13764685253375417, "grad_norm": 1.09375, "learning_rate": 0.0003092665742369703, "loss": 6.0743, "mean_token_accuracy": 0.13829942494630815, "num_tokens": 5036847.0, "step": 2355 }, { "entropy": 6.189305591583252, "epoch": 0.13793909638202115, "grad_norm": 1.046875, "learning_rate": 0.00030810175516369343, "loss": 6.0016, "mean_token_accuracy": 0.15031686201691627, "num_tokens": 5047751.0, "step": 2360 }, { "entropy": 6.242601823806763, "epoch": 0.13823134023028816, "grad_norm": 0.953125, "learning_rate": 0.0003069360285890775, "loss": 6.0581, "mean_token_accuracy": 0.1428899347782135, "num_tokens": 5057914.0, "step": 2365 }, { "entropy": 6.1711660861969, "epoch": 0.13852358407855514, "grad_norm": 1.1328125, "learning_rate": 0.00030576942647210547, "loss": 6.123, "mean_token_accuracy": 0.13385452926158906, "num_tokens": 5068465.0, "step": 2370 }, { "entropy": 6.139814281463623, "epoch": 0.13881582792682215, "grad_norm": 1.125, "learning_rate": 0.00030460198079576355, "loss": 6.0607, "mean_token_accuracy": 0.14090710505843163, "num_tokens": 5079162.0, "step": 2375 }, { "entropy": 6.18707013130188, "epoch": 0.13910807177508913, "grad_norm": 1.0859375, "learning_rate": 0.0003034337235661648, "loss": 6.1177, "mean_token_accuracy": 0.13520955443382263, "num_tokens": 5089409.0, "step": 2380 }, { "entropy": 6.231440830230713, "epoch": 0.13940031562335614, "grad_norm": 0.97265625, "learning_rate": 0.0003022646868116714, "loss": 6.0331, "mean_token_accuracy": 0.14986666589975356, "num_tokens": 5100150.0, "step": 2385 }, { "entropy": 6.166530799865723, "epoch": 0.13969255947162312, "grad_norm": 1.1875, "learning_rate": 0.0003010949025820163, "loss": 6.006, "mean_token_accuracy": 0.14616978093981742, "num_tokens": 5110601.0, "step": 2390 }, { "entropy": 6.099657964706421, "epoch": 0.1399848033198901, "grad_norm": 1.1484375, "learning_rate": 0.0002999244029474252, "loss": 6.097, "mean_token_accuracy": 0.1380453534424305, "num_tokens": 5119665.0, "step": 2395 }, { "entropy": 6.14389591217041, "epoch": 0.14027704716815712, "grad_norm": 0.98046875, "learning_rate": 0.00029875321999773684, "loss": 6.0084, "mean_token_accuracy": 0.1483282908797264, "num_tokens": 5129712.0, "step": 2400 }, { "entropy": 6.248686361312866, "epoch": 0.1405692910164241, "grad_norm": 0.984375, "learning_rate": 0.00029758138584152333, "loss": 6.1013, "mean_token_accuracy": 0.14273960143327713, "num_tokens": 5139858.0, "step": 2405 }, { "entropy": 6.252632999420166, "epoch": 0.1408615348646911, "grad_norm": 1.25, "learning_rate": 0.0002964089326052102, "loss": 6.0796, "mean_token_accuracy": 0.13942125216126441, "num_tokens": 5149330.0, "step": 2410 }, { "entropy": 6.133875226974487, "epoch": 0.1411537787129581, "grad_norm": 1.140625, "learning_rate": 0.0002952358924321949, "loss": 6.0689, "mean_token_accuracy": 0.14331426620483398, "num_tokens": 5159458.0, "step": 2415 }, { "entropy": 6.215303516387939, "epoch": 0.1414460225612251, "grad_norm": 0.96484375, "learning_rate": 0.00029406229748196657, "loss": 6.0775, "mean_token_accuracy": 0.14083075076341628, "num_tokens": 5170439.0, "step": 2420 }, { "entropy": 6.1326995372772215, "epoch": 0.14173826640949208, "grad_norm": 1.0, "learning_rate": 0.0002928881799292235, "loss": 6.0245, "mean_token_accuracy": 0.14517416507005693, "num_tokens": 5181345.0, "step": 2425 }, { "entropy": 6.190633773803711, "epoch": 0.14203051025775906, "grad_norm": 0.99609375, "learning_rate": 0.00029171357196299154, "loss": 6.0229, "mean_token_accuracy": 0.1475578874349594, "num_tokens": 5191271.0, "step": 2430 }, { "entropy": 6.119750928878784, "epoch": 0.14232275410602607, "grad_norm": 0.9453125, "learning_rate": 0.0002905385057857414, "loss": 6.0537, "mean_token_accuracy": 0.1410386562347412, "num_tokens": 5201868.0, "step": 2435 }, { "entropy": 6.17066764831543, "epoch": 0.14261499795429305, "grad_norm": 1.2109375, "learning_rate": 0.0002893630136125058, "loss": 6.0477, "mean_token_accuracy": 0.14192107766866685, "num_tokens": 5212463.0, "step": 2440 }, { "entropy": 6.21774115562439, "epoch": 0.14290724180256006, "grad_norm": 1.03125, "learning_rate": 0.0002881871276699967, "loss": 6.0601, "mean_token_accuracy": 0.14529359042644502, "num_tokens": 5223485.0, "step": 2445 }, { "entropy": 6.125836896896362, "epoch": 0.14319948565082705, "grad_norm": 1.0390625, "learning_rate": 0.00028701088019572114, "loss": 6.0074, "mean_token_accuracy": 0.15054480880498886, "num_tokens": 5233818.0, "step": 2450 }, { "entropy": 6.130956363677979, "epoch": 0.14349172949909406, "grad_norm": 1.0078125, "learning_rate": 0.0002858343034370977, "loss": 6.0491, "mean_token_accuracy": 0.15077575743198396, "num_tokens": 5244008.0, "step": 2455 }, { "entropy": 6.12300705909729, "epoch": 0.14378397334736104, "grad_norm": 1.0546875, "learning_rate": 0.00028465742965057267, "loss": 5.9782, "mean_token_accuracy": 0.15135489031672478, "num_tokens": 5254263.0, "step": 2460 }, { "entropy": 6.200008344650269, "epoch": 0.14407621719562802, "grad_norm": 1.0703125, "learning_rate": 0.00028348029110073533, "loss": 6.0761, "mean_token_accuracy": 0.1395764470100403, "num_tokens": 5264635.0, "step": 2465 }, { "entropy": 6.163009548187256, "epoch": 0.14436846104389503, "grad_norm": 1.0703125, "learning_rate": 0.00028230292005943365, "loss": 6.0824, "mean_token_accuracy": 0.14634474888443946, "num_tokens": 5275795.0, "step": 2470 }, { "entropy": 6.134585332870484, "epoch": 0.144660704892162, "grad_norm": 1.1875, "learning_rate": 0.00028112534880488945, "loss": 6.018, "mean_token_accuracy": 0.1454907976090908, "num_tokens": 5286188.0, "step": 2475 }, { "entropy": 6.1603742122650145, "epoch": 0.14495294874042902, "grad_norm": 1.1875, "learning_rate": 0.0002799476096208137, "loss": 6.03, "mean_token_accuracy": 0.14633230417966842, "num_tokens": 5296224.0, "step": 2480 }, { "entropy": 6.133947277069092, "epoch": 0.145245192588696, "grad_norm": 0.97265625, "learning_rate": 0.00027876973479552087, "loss": 6.0368, "mean_token_accuracy": 0.1396023951470852, "num_tokens": 5308199.0, "step": 2485 }, { "entropy": 6.183510255813599, "epoch": 0.145537436436963, "grad_norm": 1.140625, "learning_rate": 0.00027759175662104424, "loss": 6.0316, "mean_token_accuracy": 0.144721619784832, "num_tokens": 5319141.0, "step": 2490 }, { "entropy": 6.197761201858521, "epoch": 0.14582968028523, "grad_norm": 0.91796875, "learning_rate": 0.0002764137073922508, "loss": 6.1171, "mean_token_accuracy": 0.142631995677948, "num_tokens": 5331387.0, "step": 2495 }, { "entropy": 6.18598370552063, "epoch": 0.14612192413349698, "grad_norm": 1.234375, "learning_rate": 0.00027523561940595505, "loss": 6.0048, "mean_token_accuracy": 0.14339563697576524, "num_tokens": 5341374.0, "step": 2500 }, { "entropy": 6.174669599533081, "epoch": 0.146414167981764, "grad_norm": 1.0625, "learning_rate": 0.0002740575249600342, "loss": 6.0333, "mean_token_accuracy": 0.14107902571558953, "num_tokens": 5351728.0, "step": 2505 }, { "entropy": 6.136457633972168, "epoch": 0.14670641183003097, "grad_norm": 0.953125, "learning_rate": 0.00027287945635254263, "loss": 6.0228, "mean_token_accuracy": 0.14351108372211457, "num_tokens": 5361365.0, "step": 2510 }, { "entropy": 6.12276177406311, "epoch": 0.14699865567829798, "grad_norm": 1.046875, "learning_rate": 0.00027170144588082635, "loss": 6.0609, "mean_token_accuracy": 0.1400350347161293, "num_tokens": 5372932.0, "step": 2515 }, { "entropy": 6.150847959518432, "epoch": 0.14729089952656496, "grad_norm": 1.09375, "learning_rate": 0.00027052352584063763, "loss": 6.0504, "mean_token_accuracy": 0.14728699624538422, "num_tokens": 5384409.0, "step": 2520 }, { "entropy": 6.156340169906616, "epoch": 0.14758314337483197, "grad_norm": 0.9921875, "learning_rate": 0.00026934572852524907, "loss": 5.965, "mean_token_accuracy": 0.15082458257675171, "num_tokens": 5394068.0, "step": 2525 }, { "entropy": 6.204267501831055, "epoch": 0.14787538722309895, "grad_norm": 1.1015625, "learning_rate": 0.00026816808622456937, "loss": 6.0865, "mean_token_accuracy": 0.13921786993741989, "num_tokens": 5403908.0, "step": 2530 }, { "entropy": 6.225234413146973, "epoch": 0.14816763107136594, "grad_norm": 1.015625, "learning_rate": 0.0002669906312242569, "loss": 6.0186, "mean_token_accuracy": 0.15040699988603592, "num_tokens": 5414845.0, "step": 2535 }, { "entropy": 6.141360950469971, "epoch": 0.14845987491963294, "grad_norm": 1.046875, "learning_rate": 0.00026581339580483525, "loss": 6.0001, "mean_token_accuracy": 0.14684151709079743, "num_tokens": 5424608.0, "step": 2540 }, { "entropy": 6.159800004959107, "epoch": 0.14875211876789993, "grad_norm": 1.015625, "learning_rate": 0.0002646364122408082, "loss": 6.004, "mean_token_accuracy": 0.13847579434514046, "num_tokens": 5436316.0, "step": 2545 }, { "entropy": 6.246420860290527, "epoch": 0.14904436261616694, "grad_norm": 1.0703125, "learning_rate": 0.0002634597127997749, "loss": 6.0445, "mean_token_accuracy": 0.1428648293018341, "num_tokens": 5446112.0, "step": 2550 }, { "entropy": 6.190153360366821, "epoch": 0.14933660646443392, "grad_norm": 0.96484375, "learning_rate": 0.0002622833297415445, "loss": 6.0483, "mean_token_accuracy": 0.14148024693131447, "num_tokens": 5456688.0, "step": 2555 }, { "entropy": 6.108002948760986, "epoch": 0.14962885031270093, "grad_norm": 1.015625, "learning_rate": 0.0002611072953172531, "loss": 5.9824, "mean_token_accuracy": 0.14730729907751083, "num_tokens": 5467590.0, "step": 2560 }, { "entropy": 6.156373453140259, "epoch": 0.1499210941609679, "grad_norm": 0.95703125, "learning_rate": 0.00025993164176847845, "loss": 6.1113, "mean_token_accuracy": 0.1395333632826805, "num_tokens": 5478868.0, "step": 2565 }, { "entropy": 6.222695970535279, "epoch": 0.1502133380092349, "grad_norm": 1.140625, "learning_rate": 0.0002587564013263564, "loss": 6.0203, "mean_token_accuracy": 0.14538112431764602, "num_tokens": 5490024.0, "step": 2570 }, { "entropy": 6.194875288009643, "epoch": 0.1505055818575019, "grad_norm": 1.03125, "learning_rate": 0.0002575816062106974, "loss": 6.0683, "mean_token_accuracy": 0.1446951650083065, "num_tokens": 5500974.0, "step": 2575 }, { "entropy": 6.0988811492919925, "epoch": 0.15079782570576888, "grad_norm": 1.078125, "learning_rate": 0.00025640728862910293, "loss": 5.99, "mean_token_accuracy": 0.14054279178380966, "num_tokens": 5511892.0, "step": 2580 }, { "entropy": 6.213571691513062, "epoch": 0.1510900695540359, "grad_norm": 1.0078125, "learning_rate": 0.00025523348077608285, "loss": 6.1363, "mean_token_accuracy": 0.13551027625799178, "num_tokens": 5523913.0, "step": 2585 }, { "entropy": 6.207326745986938, "epoch": 0.15138231340230288, "grad_norm": 0.98828125, "learning_rate": 0.00025406021483217225, "loss": 5.9974, "mean_token_accuracy": 0.14592078626155852, "num_tokens": 5535885.0, "step": 2590 }, { "entropy": 6.147704076766968, "epoch": 0.15167455725056989, "grad_norm": 1.2890625, "learning_rate": 0.00025288752296304963, "loss": 6.1111, "mean_token_accuracy": 0.13123091459274291, "num_tokens": 5546087.0, "step": 2595 }, { "entropy": 6.185470294952393, "epoch": 0.15196680109883687, "grad_norm": 1.0703125, "learning_rate": 0.000251715437318655, "loss": 6.1152, "mean_token_accuracy": 0.14023130089044572, "num_tokens": 5558295.0, "step": 2600 }, { "entropy": 6.180519771575928, "epoch": 0.15225904494710385, "grad_norm": 1.078125, "learning_rate": 0.0002505439900323084, "loss": 5.9729, "mean_token_accuracy": 0.14424315243959426, "num_tokens": 5568669.0, "step": 2605 }, { "entropy": 6.144853639602661, "epoch": 0.15255128879537086, "grad_norm": 1.015625, "learning_rate": 0.00024937321321982894, "loss": 6.0608, "mean_token_accuracy": 0.14513619095087052, "num_tokens": 5580134.0, "step": 2610 }, { "entropy": 6.166723108291626, "epoch": 0.15284353264363784, "grad_norm": 1.1328125, "learning_rate": 0.00024820313897865433, "loss": 5.9806, "mean_token_accuracy": 0.1495061531662941, "num_tokens": 5589562.0, "step": 2615 }, { "entropy": 6.204195117950439, "epoch": 0.15313577649190485, "grad_norm": 1.015625, "learning_rate": 0.00024703379938696105, "loss": 6.0297, "mean_token_accuracy": 0.1456547960639, "num_tokens": 5599944.0, "step": 2620 }, { "entropy": 6.135628604888916, "epoch": 0.15342802034017183, "grad_norm": 1.0625, "learning_rate": 0.00024586522650278447, "loss": 5.9373, "mean_token_accuracy": 0.15056538432836533, "num_tokens": 5610006.0, "step": 2625 }, { "entropy": 6.095846796035767, "epoch": 0.15372026418843884, "grad_norm": 1.046875, "learning_rate": 0.00024469745236314064, "loss": 6.0063, "mean_token_accuracy": 0.14702416509389876, "num_tokens": 5620287.0, "step": 2630 }, { "entropy": 6.160745286941529, "epoch": 0.15401250803670583, "grad_norm": 1.1484375, "learning_rate": 0.00024353050898314767, "loss": 6.0101, "mean_token_accuracy": 0.14471300393342973, "num_tokens": 5630614.0, "step": 2635 }, { "entropy": 6.184366941452026, "epoch": 0.15430475188497284, "grad_norm": 1.0078125, "learning_rate": 0.00024236442835514743, "loss": 6.065, "mean_token_accuracy": 0.1427292823791504, "num_tokens": 5642097.0, "step": 2640 }, { "entropy": 6.1468581199646, "epoch": 0.15459699573323982, "grad_norm": 1.1796875, "learning_rate": 0.00024119924244782965, "loss": 6.0495, "mean_token_accuracy": 0.14486181885004043, "num_tokens": 5653175.0, "step": 2645 }, { "entropy": 6.176498126983643, "epoch": 0.1548892395815068, "grad_norm": 0.96875, "learning_rate": 0.00024003498320535462, "loss": 6.0397, "mean_token_accuracy": 0.1486806020140648, "num_tokens": 5663618.0, "step": 2650 }, { "entropy": 6.1524573802948, "epoch": 0.1551814834297738, "grad_norm": 0.96484375, "learning_rate": 0.00023887168254647727, "loss": 5.8662, "mean_token_accuracy": 0.15928809642791747, "num_tokens": 5673460.0, "step": 2655 }, { "entropy": 6.117110013961792, "epoch": 0.1554737272780408, "grad_norm": 1.0, "learning_rate": 0.00023770937236367308, "loss": 5.9647, "mean_token_accuracy": 0.14610666707158088, "num_tokens": 5684224.0, "step": 2660 }, { "entropy": 6.169884967803955, "epoch": 0.1557659711263078, "grad_norm": 1.015625, "learning_rate": 0.00023654808452226278, "loss": 6.0092, "mean_token_accuracy": 0.14537236988544464, "num_tokens": 5694440.0, "step": 2665 }, { "entropy": 6.270335865020752, "epoch": 0.15605821497457478, "grad_norm": 1.0703125, "learning_rate": 0.00023538785085953912, "loss": 5.9756, "mean_token_accuracy": 0.14891887456178665, "num_tokens": 5705510.0, "step": 2670 }, { "entropy": 6.14637598991394, "epoch": 0.1563504588228418, "grad_norm": 1.0625, "learning_rate": 0.00023422870318389404, "loss": 6.0757, "mean_token_accuracy": 0.13775510638952254, "num_tokens": 5715837.0, "step": 2675 }, { "entropy": 6.141558599472046, "epoch": 0.15664270267110877, "grad_norm": 1.03125, "learning_rate": 0.0002330706732739468, "loss": 6.0216, "mean_token_accuracy": 0.14345250725746156, "num_tokens": 5726252.0, "step": 2680 }, { "entropy": 6.189908838272094, "epoch": 0.15693494651937576, "grad_norm": 1.078125, "learning_rate": 0.00023191379287767211, "loss": 6.0849, "mean_token_accuracy": 0.1478356420993805, "num_tokens": 5737877.0, "step": 2685 }, { "entropy": 6.146306896209717, "epoch": 0.15722719036764277, "grad_norm": 0.9921875, "learning_rate": 0.0002307580937115305, "loss": 5.9871, "mean_token_accuracy": 0.14808084219694137, "num_tokens": 5748651.0, "step": 2690 }, { "entropy": 6.122118854522705, "epoch": 0.15751943421590975, "grad_norm": 1.0859375, "learning_rate": 0.00022960360745959846, "loss": 5.9736, "mean_token_accuracy": 0.14809395670890807, "num_tokens": 5759505.0, "step": 2695 }, { "entropy": 6.1474289894104, "epoch": 0.15781167806417676, "grad_norm": 1.0859375, "learning_rate": 0.00022845036577269972, "loss": 5.9426, "mean_token_accuracy": 0.14596373289823533, "num_tokens": 5769950.0, "step": 2700 }, { "entropy": 6.1687541007995605, "epoch": 0.15810392191244374, "grad_norm": 1.0, "learning_rate": 0.00022729840026753777, "loss": 5.9615, "mean_token_accuracy": 0.14998023360967636, "num_tokens": 5780446.0, "step": 2705 }, { "entropy": 6.120418357849121, "epoch": 0.15839616576071075, "grad_norm": 1.046875, "learning_rate": 0.0002261477425258287, "loss": 5.9258, "mean_token_accuracy": 0.15237208753824233, "num_tokens": 5790690.0, "step": 2710 }, { "entropy": 6.107910394668579, "epoch": 0.15868840960897773, "grad_norm": 1.0390625, "learning_rate": 0.0002249984240934358, "loss": 6.0245, "mean_token_accuracy": 0.1465037763118744, "num_tokens": 5801718.0, "step": 2715 }, { "entropy": 6.153380298614502, "epoch": 0.1589806534572447, "grad_norm": 1.140625, "learning_rate": 0.00022385047647950464, "loss": 6.0173, "mean_token_accuracy": 0.14355326741933822, "num_tokens": 5812497.0, "step": 2720 }, { "entropy": 6.217546653747559, "epoch": 0.15927289730551172, "grad_norm": 1.1328125, "learning_rate": 0.0002227039311555986, "loss": 5.996, "mean_token_accuracy": 0.1512288361787796, "num_tokens": 5822931.0, "step": 2725 }, { "entropy": 6.135431480407715, "epoch": 0.1595651411537787, "grad_norm": 1.046875, "learning_rate": 0.0002215588195548372, "loss": 5.9476, "mean_token_accuracy": 0.14942701458930968, "num_tokens": 5832942.0, "step": 2730 }, { "entropy": 6.082711219787598, "epoch": 0.15985738500204572, "grad_norm": 1.109375, "learning_rate": 0.00022041517307103337, "loss": 5.9669, "mean_token_accuracy": 0.147607259452343, "num_tokens": 5842830.0, "step": 2735 }, { "entropy": 6.171404552459717, "epoch": 0.1601496288503127, "grad_norm": 0.94921875, "learning_rate": 0.0002192730230578331, "loss": 5.9831, "mean_token_accuracy": 0.14799624383449556, "num_tokens": 5854392.0, "step": 2740 }, { "entropy": 6.240163135528564, "epoch": 0.1604418726985797, "grad_norm": 1.015625, "learning_rate": 0.0002181324008278559, "loss": 6.0057, "mean_token_accuracy": 0.14797792285680772, "num_tokens": 5865582.0, "step": 2745 }, { "entropy": 6.116997337341308, "epoch": 0.1607341165468467, "grad_norm": 1.1328125, "learning_rate": 0.00021699333765183655, "loss": 5.9815, "mean_token_accuracy": 0.14475660845637323, "num_tokens": 5875669.0, "step": 2750 }, { "entropy": 6.127401542663574, "epoch": 0.16102636039511367, "grad_norm": 1.03125, "learning_rate": 0.0002158558647577673, "loss": 5.9434, "mean_token_accuracy": 0.1484316974878311, "num_tokens": 5886287.0, "step": 2755 }, { "entropy": 6.180906200408936, "epoch": 0.16131860424338068, "grad_norm": 1.0078125, "learning_rate": 0.00021472001333004215, "loss": 5.9719, "mean_token_accuracy": 0.15324981957674028, "num_tokens": 5896884.0, "step": 2760 }, { "entropy": 6.086533641815185, "epoch": 0.16161084809164766, "grad_norm": 1.078125, "learning_rate": 0.00021358581450860186, "loss": 6.0778, "mean_token_accuracy": 0.14369169175624846, "num_tokens": 5907741.0, "step": 2765 }, { "entropy": 6.19297423362732, "epoch": 0.16190309193991467, "grad_norm": 0.99609375, "learning_rate": 0.0002124532993880799, "loss": 6.0445, "mean_token_accuracy": 0.15067339986562728, "num_tokens": 5918316.0, "step": 2770 }, { "entropy": 6.206534290313721, "epoch": 0.16219533578818165, "grad_norm": 1.0078125, "learning_rate": 0.00021132249901695044, "loss": 6.0345, "mean_token_accuracy": 0.14590926021337508, "num_tokens": 5929209.0, "step": 2775 }, { "entropy": 6.162505578994751, "epoch": 0.16248757963644866, "grad_norm": 1.03125, "learning_rate": 0.00021019344439667705, "loss": 5.9625, "mean_token_accuracy": 0.15376231223344802, "num_tokens": 5939716.0, "step": 2780 }, { "entropy": 6.096977376937867, "epoch": 0.16277982348471565, "grad_norm": 0.98828125, "learning_rate": 0.00020906616648086213, "loss": 5.9345, "mean_token_accuracy": 0.15220149084925652, "num_tokens": 5950677.0, "step": 2785 }, { "entropy": 6.14203290939331, "epoch": 0.16307206733298263, "grad_norm": 1.0390625, "learning_rate": 0.00020794069617439942, "loss": 5.9595, "mean_token_accuracy": 0.15739378333091736, "num_tokens": 5961458.0, "step": 2790 }, { "entropy": 6.128100252151489, "epoch": 0.16336431118124964, "grad_norm": 1.140625, "learning_rate": 0.00020681706433262593, "loss": 5.9139, "mean_token_accuracy": 0.1479706734418869, "num_tokens": 5971713.0, "step": 2795 }, { "entropy": 6.183289098739624, "epoch": 0.16365655502951662, "grad_norm": 1.0390625, "learning_rate": 0.00020569530176047602, "loss": 6.0772, "mean_token_accuracy": 0.1419707126915455, "num_tokens": 5983418.0, "step": 2800 }, { "entropy": 6.191586256027222, "epoch": 0.16394879887778363, "grad_norm": 1.03125, "learning_rate": 0.0002045754392116374, "loss": 5.9003, "mean_token_accuracy": 0.1545325681567192, "num_tokens": 5993207.0, "step": 2805 }, { "entropy": 6.0872550964355465, "epoch": 0.1642410427260506, "grad_norm": 1.03125, "learning_rate": 0.00020345750738770757, "loss": 6.0021, "mean_token_accuracy": 0.13864434212446214, "num_tokens": 6003545.0, "step": 2810 }, { "entropy": 6.085964632034302, "epoch": 0.16453328657431762, "grad_norm": 1.0, "learning_rate": 0.00020234153693735214, "loss": 6.012, "mean_token_accuracy": 0.14785452485084533, "num_tokens": 6014315.0, "step": 2815 }, { "entropy": 6.1714600086212155, "epoch": 0.1648255304225846, "grad_norm": 0.9453125, "learning_rate": 0.0002012275584554647, "loss": 5.8993, "mean_token_accuracy": 0.14857266694307328, "num_tokens": 6025650.0, "step": 2820 }, { "entropy": 6.173015689849853, "epoch": 0.16511777427085159, "grad_norm": 0.97265625, "learning_rate": 0.00020011560248232803, "loss": 5.9238, "mean_token_accuracy": 0.15145203620195388, "num_tokens": 6036497.0, "step": 2825 }, { "entropy": 6.114911222457886, "epoch": 0.1654100181191186, "grad_norm": 1.046875, "learning_rate": 0.00019900569950277692, "loss": 5.9186, "mean_token_accuracy": 0.14509506672620773, "num_tokens": 6046448.0, "step": 2830 }, { "entropy": 6.103183460235596, "epoch": 0.16570226196738558, "grad_norm": 1.0390625, "learning_rate": 0.00019789787994536228, "loss": 5.9064, "mean_token_accuracy": 0.1442277818918228, "num_tokens": 6056630.0, "step": 2835 }, { "entropy": 6.150169944763183, "epoch": 0.1659945058156526, "grad_norm": 1.0625, "learning_rate": 0.00019679217418151667, "loss": 5.977, "mean_token_accuracy": 0.14322332739830018, "num_tokens": 6067795.0, "step": 2840 }, { "entropy": 6.160370397567749, "epoch": 0.16628674966391957, "grad_norm": 1.25, "learning_rate": 0.00019568861252472236, "loss": 5.9635, "mean_token_accuracy": 0.15829393342137338, "num_tokens": 6079218.0, "step": 2845 }, { "entropy": 6.077237462997436, "epoch": 0.16657899351218658, "grad_norm": 1.0078125, "learning_rate": 0.00019458722522967952, "loss": 5.9647, "mean_token_accuracy": 0.14795371219515802, "num_tokens": 6089707.0, "step": 2850 }, { "entropy": 6.07846040725708, "epoch": 0.16687123736045356, "grad_norm": 0.98828125, "learning_rate": 0.00019348804249147723, "loss": 5.9384, "mean_token_accuracy": 0.15165336057543755, "num_tokens": 6100978.0, "step": 2855 }, { "entropy": 6.13194317817688, "epoch": 0.16716348120872054, "grad_norm": 1.15625, "learning_rate": 0.0001923910944447655, "loss": 5.8704, "mean_token_accuracy": 0.15406306385993956, "num_tokens": 6110188.0, "step": 2860 }, { "entropy": 6.101765441894531, "epoch": 0.16745572505698755, "grad_norm": 1.15625, "learning_rate": 0.00019129641116292928, "loss": 5.9915, "mean_token_accuracy": 0.1535155549645424, "num_tokens": 6121229.0, "step": 2865 }, { "entropy": 6.117405891418457, "epoch": 0.16774796890525454, "grad_norm": 1.1328125, "learning_rate": 0.00019020402265726343, "loss": 5.9978, "mean_token_accuracy": 0.14598261713981628, "num_tokens": 6131022.0, "step": 2870 }, { "entropy": 6.007831478118897, "epoch": 0.16804021275352155, "grad_norm": 1.0234375, "learning_rate": 0.0001891139588761509, "loss": 5.8779, "mean_token_accuracy": 0.1577982038259506, "num_tokens": 6141042.0, "step": 2875 }, { "entropy": 6.141781949996949, "epoch": 0.16833245660178853, "grad_norm": 1.125, "learning_rate": 0.00018802624970424076, "loss": 5.9538, "mean_token_accuracy": 0.15192359536886216, "num_tokens": 6151612.0, "step": 2880 }, { "entropy": 6.113475561141968, "epoch": 0.16862470045005554, "grad_norm": 1.0390625, "learning_rate": 0.00018694092496162945, "loss": 5.9646, "mean_token_accuracy": 0.15292002409696578, "num_tokens": 6162217.0, "step": 2885 }, { "entropy": 6.158190011978149, "epoch": 0.16891694429832252, "grad_norm": 1.2265625, "learning_rate": 0.00018585801440304306, "loss": 6.0026, "mean_token_accuracy": 0.14562622532248498, "num_tokens": 6173309.0, "step": 2890 }, { "entropy": 6.13999080657959, "epoch": 0.1692091881465895, "grad_norm": 1.0546875, "learning_rate": 0.00018477754771702165, "loss": 5.9711, "mean_token_accuracy": 0.1507338523864746, "num_tokens": 6184063.0, "step": 2895 }, { "entropy": 6.118639993667602, "epoch": 0.1695014319948565, "grad_norm": 1.0234375, "learning_rate": 0.00018369955452510506, "loss": 5.9332, "mean_token_accuracy": 0.1492726318538189, "num_tokens": 6196158.0, "step": 2900 }, { "entropy": 6.109470844268799, "epoch": 0.1697936758431235, "grad_norm": 1.0390625, "learning_rate": 0.0001826240643810212, "loss": 5.9259, "mean_token_accuracy": 0.14705996811389924, "num_tokens": 6206801.0, "step": 2905 }, { "entropy": 6.148750877380371, "epoch": 0.1700859196913905, "grad_norm": 1.15625, "learning_rate": 0.0001815511067698758, "loss": 5.9635, "mean_token_accuracy": 0.14651764035224915, "num_tokens": 6217060.0, "step": 2910 }, { "entropy": 6.1042625427246096, "epoch": 0.17037816353965748, "grad_norm": 1.1015625, "learning_rate": 0.0001804807111073436, "loss": 5.9434, "mean_token_accuracy": 0.1508832633495331, "num_tokens": 6228311.0, "step": 2915 }, { "entropy": 6.120675849914551, "epoch": 0.1706704073879245, "grad_norm": 1.140625, "learning_rate": 0.0001794129067388625, "loss": 5.9573, "mean_token_accuracy": 0.15193361714482306, "num_tokens": 6238059.0, "step": 2920 }, { "entropy": 6.105339479446411, "epoch": 0.17096265123619148, "grad_norm": 0.94921875, "learning_rate": 0.00017834772293882868, "loss": 5.9881, "mean_token_accuracy": 0.15223926603794097, "num_tokens": 6248462.0, "step": 2925 }, { "entropy": 6.113849401473999, "epoch": 0.17125489508445846, "grad_norm": 1.0234375, "learning_rate": 0.000177285188909794, "loss": 5.896, "mean_token_accuracy": 0.16324409693479539, "num_tokens": 6257974.0, "step": 2930 }, { "entropy": 6.162052345275879, "epoch": 0.17154713893272547, "grad_norm": 1.0390625, "learning_rate": 0.0001762253337816656, "loss": 5.9998, "mean_token_accuracy": 0.14413103759288787, "num_tokens": 6269296.0, "step": 2935 }, { "entropy": 6.235731172561645, "epoch": 0.17183938278099245, "grad_norm": 1.0625, "learning_rate": 0.00017516818661090738, "loss": 6.021, "mean_token_accuracy": 0.14661357626318933, "num_tokens": 6280104.0, "step": 2940 }, { "entropy": 6.2016058444976805, "epoch": 0.17213162662925946, "grad_norm": 1.0625, "learning_rate": 0.0001741137763797428, "loss": 5.9235, "mean_token_accuracy": 0.15996974259614943, "num_tokens": 6290477.0, "step": 2945 }, { "entropy": 6.1014374732971195, "epoch": 0.17242387047752644, "grad_norm": 1.046875, "learning_rate": 0.00017306213199536115, "loss": 5.8811, "mean_token_accuracy": 0.155573470890522, "num_tokens": 6300927.0, "step": 2950 }, { "entropy": 6.07692322731018, "epoch": 0.17271611432579345, "grad_norm": 0.984375, "learning_rate": 0.0001720132822891243, "loss": 5.9666, "mean_token_accuracy": 0.15099448561668397, "num_tokens": 6311153.0, "step": 2955 }, { "entropy": 6.125264501571655, "epoch": 0.17300835817406043, "grad_norm": 1.046875, "learning_rate": 0.0001709672560157769, "loss": 5.8667, "mean_token_accuracy": 0.15665982216596602, "num_tokens": 6320716.0, "step": 2960 }, { "entropy": 6.191418886184692, "epoch": 0.17330060202232744, "grad_norm": 1.015625, "learning_rate": 0.00016992408185265758, "loss": 6.0206, "mean_token_accuracy": 0.14822266921401023, "num_tokens": 6332432.0, "step": 2965 }, { "entropy": 6.16773829460144, "epoch": 0.17359284587059443, "grad_norm": 1.1015625, "learning_rate": 0.00016888378839891298, "loss": 5.9819, "mean_token_accuracy": 0.14243747442960739, "num_tokens": 6343577.0, "step": 2970 }, { "entropy": 6.12203540802002, "epoch": 0.1738850897188614, "grad_norm": 0.9921875, "learning_rate": 0.0001678464041747137, "loss": 5.9694, "mean_token_accuracy": 0.1483134523034096, "num_tokens": 6353689.0, "step": 2975 }, { "entropy": 6.118208217620849, "epoch": 0.17417733356712842, "grad_norm": 1.078125, "learning_rate": 0.00016681195762047223, "loss": 5.9636, "mean_token_accuracy": 0.1462331682443619, "num_tokens": 6365075.0, "step": 2980 }, { "entropy": 6.1399970054626465, "epoch": 0.1744695774153954, "grad_norm": 1.0859375, "learning_rate": 0.00016578047709606337, "loss": 5.9299, "mean_token_accuracy": 0.1572040408849716, "num_tokens": 6375189.0, "step": 2985 }, { "entropy": 6.107175254821778, "epoch": 0.1747618212636624, "grad_norm": 1.1484375, "learning_rate": 0.00016475199088004678, "loss": 5.9431, "mean_token_accuracy": 0.15101500004529952, "num_tokens": 6385028.0, "step": 2990 }, { "entropy": 6.1307892322540285, "epoch": 0.1750540651119294, "grad_norm": 1.0859375, "learning_rate": 0.00016372652716889163, "loss": 5.9564, "mean_token_accuracy": 0.14733364433050156, "num_tokens": 6395912.0, "step": 2995 }, { "entropy": 6.1601982593536375, "epoch": 0.1753463089601964, "grad_norm": 1.03125, "learning_rate": 0.0001627041140762035, "loss": 5.8768, "mean_token_accuracy": 0.15499357283115386, "num_tokens": 6405993.0, "step": 3000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 9531459735552000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }