{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.8892931671036437, "eval_steps": 3000, "global_step": 27000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691989517211914, "epoch": 0.0005350741077639254, "grad_norm": 10.75, "learning_rate": 2e-06, "loss": 10.8201, "mean_token_accuracy": 0.0, "num_tokens": 10038.0, "step": 5 }, { "entropy": 10.69193468093872, "epoch": 0.0010701482155278507, "grad_norm": 11.9375, "learning_rate": 4.5e-06, "loss": 10.789, "mean_token_accuracy": 0.00010810811072587967, "num_tokens": 21916.0, "step": 10 }, { "entropy": 10.690756225585938, "epoch": 0.0016052223232917758, "grad_norm": 8.875, "learning_rate": 7e-06, "loss": 10.5855, "mean_token_accuracy": 0.029181174421682953, "num_tokens": 33434.0, "step": 15 }, { "entropy": 10.660381984710693, "epoch": 0.0021402964310557014, "grad_norm": 5.71875, "learning_rate": 9.5e-06, "loss": 10.3113, "mean_token_accuracy": 0.04592931531369686, "num_tokens": 44216.0, "step": 20 }, { "entropy": 10.51073760986328, "epoch": 0.0026753705388196263, "grad_norm": 3.71875, "learning_rate": 1.2e-05, "loss": 10.1036, "mean_token_accuracy": 0.04351861346513033, "num_tokens": 54874.0, "step": 25 }, { "entropy": 10.5190824508667, "epoch": 0.0032104446465835517, "grad_norm": 3.09375, "learning_rate": 1.4500000000000002e-05, "loss": 9.9872, "mean_token_accuracy": 0.041112912446260454, "num_tokens": 65085.0, "step": 30 }, { "entropy": 10.547387790679931, "epoch": 0.003745518754347477, "grad_norm": 2.859375, "learning_rate": 1.7000000000000003e-05, "loss": 9.904, "mean_token_accuracy": 0.04395376648753881, "num_tokens": 75601.0, "step": 35 }, { "entropy": 10.474061203002929, "epoch": 0.004280592862111403, "grad_norm": 2.515625, "learning_rate": 1.95e-05, "loss": 9.8879, "mean_token_accuracy": 0.04307105913758278, "num_tokens": 86193.0, "step": 40 }, { "entropy": 10.531705379486084, "epoch": 0.004815666969875327, "grad_norm": 2.40625, "learning_rate": 2.2e-05, "loss": 9.8417, "mean_token_accuracy": 0.043867765367031096, "num_tokens": 96957.0, "step": 45 }, { "entropy": 10.478270435333252, "epoch": 0.005350741077639253, "grad_norm": 2.171875, "learning_rate": 2.4500000000000003e-05, "loss": 9.8114, "mean_token_accuracy": 0.046108495071530343, "num_tokens": 108408.0, "step": 50 }, { "entropy": 10.473760986328125, "epoch": 0.005885815185403178, "grad_norm": 1.7578125, "learning_rate": 2.7e-05, "loss": 9.7686, "mean_token_accuracy": 0.05027508921921253, "num_tokens": 119273.0, "step": 55 }, { "entropy": 10.462549209594727, "epoch": 0.006420889293167103, "grad_norm": 1.921875, "learning_rate": 2.95e-05, "loss": 9.6954, "mean_token_accuracy": 0.05541543699800968, "num_tokens": 130817.0, "step": 60 }, { "entropy": 10.302016353607177, "epoch": 0.006955963400931029, "grad_norm": 1.8671875, "learning_rate": 3.2e-05, "loss": 9.6448, "mean_token_accuracy": 0.05586838573217392, "num_tokens": 142599.0, "step": 65 }, { "entropy": 10.404022407531738, "epoch": 0.007491037508694954, "grad_norm": 1.9609375, "learning_rate": 3.4500000000000005e-05, "loss": 9.5697, "mean_token_accuracy": 0.05663685463368893, "num_tokens": 153617.0, "step": 70 }, { "entropy": 10.37060546875, "epoch": 0.00802611161645888, "grad_norm": 1.6953125, "learning_rate": 3.7e-05, "loss": 9.5239, "mean_token_accuracy": 0.05575243458151817, "num_tokens": 165280.0, "step": 75 }, { "entropy": 10.341149616241456, "epoch": 0.008561185724222806, "grad_norm": 1.546875, "learning_rate": 3.95e-05, "loss": 9.4643, "mean_token_accuracy": 0.055300182476639745, "num_tokens": 176896.0, "step": 80 }, { "entropy": 10.367101669311523, "epoch": 0.00909625983198673, "grad_norm": 1.5859375, "learning_rate": 4.2000000000000004e-05, "loss": 9.4019, "mean_token_accuracy": 0.05629164129495621, "num_tokens": 188000.0, "step": 85 }, { "entropy": 10.27455005645752, "epoch": 0.009631333939750655, "grad_norm": 1.6953125, "learning_rate": 4.45e-05, "loss": 9.3493, "mean_token_accuracy": 0.057158011198043826, "num_tokens": 199360.0, "step": 90 }, { "entropy": 10.319551277160645, "epoch": 0.01016640804751458, "grad_norm": 1.5703125, "learning_rate": 4.7000000000000004e-05, "loss": 9.2957, "mean_token_accuracy": 0.052791529521346095, "num_tokens": 210214.0, "step": 95 }, { "entropy": 10.196423625946045, "epoch": 0.010701482155278505, "grad_norm": 1.5078125, "learning_rate": 4.9500000000000004e-05, "loss": 9.1506, "mean_token_accuracy": 0.06025413721799851, "num_tokens": 220567.0, "step": 100 }, { "entropy": 10.14912462234497, "epoch": 0.011236556263042432, "grad_norm": 1.578125, "learning_rate": 5.2e-05, "loss": 9.057, "mean_token_accuracy": 0.06051998771727085, "num_tokens": 230585.0, "step": 105 }, { "entropy": 10.099914455413819, "epoch": 0.011771630370806356, "grad_norm": 1.53125, "learning_rate": 5.45e-05, "loss": 8.9907, "mean_token_accuracy": 0.06339392885565757, "num_tokens": 241996.0, "step": 110 }, { "entropy": 10.083064746856689, "epoch": 0.012306704478570282, "grad_norm": 1.3671875, "learning_rate": 5.7e-05, "loss": 8.9558, "mean_token_accuracy": 0.05828723199665546, "num_tokens": 253348.0, "step": 115 }, { "entropy": 9.981218147277833, "epoch": 0.012841778586334207, "grad_norm": 1.421875, "learning_rate": 5.9499999999999996e-05, "loss": 8.8376, "mean_token_accuracy": 0.05671278983354568, "num_tokens": 264239.0, "step": 120 }, { "entropy": 9.828715324401855, "epoch": 0.013376852694098133, "grad_norm": 1.2578125, "learning_rate": 6.2e-05, "loss": 8.7502, "mean_token_accuracy": 0.056628919392824176, "num_tokens": 274522.0, "step": 125 }, { "entropy": 9.77067985534668, "epoch": 0.013911926801862057, "grad_norm": 1.34375, "learning_rate": 6.450000000000001e-05, "loss": 8.6474, "mean_token_accuracy": 0.06091504544019699, "num_tokens": 284492.0, "step": 130 }, { "entropy": 9.592880916595458, "epoch": 0.014447000909625984, "grad_norm": 1.40625, "learning_rate": 6.7e-05, "loss": 8.6035, "mean_token_accuracy": 0.05946716032922268, "num_tokens": 294796.0, "step": 135 }, { "entropy": 9.45958080291748, "epoch": 0.014982075017389908, "grad_norm": 1.0, "learning_rate": 6.950000000000001e-05, "loss": 8.574, "mean_token_accuracy": 0.05749143101274967, "num_tokens": 305252.0, "step": 140 }, { "entropy": 9.359578514099121, "epoch": 0.015517149125153834, "grad_norm": 1.0859375, "learning_rate": 7.2e-05, "loss": 8.4804, "mean_token_accuracy": 0.056437050178647044, "num_tokens": 315505.0, "step": 145 }, { "entropy": 9.158096408843994, "epoch": 0.01605222323291776, "grad_norm": 1.5, "learning_rate": 7.45e-05, "loss": 8.4819, "mean_token_accuracy": 0.05990221984684467, "num_tokens": 326997.0, "step": 150 }, { "entropy": 9.094014644622803, "epoch": 0.016587297340681685, "grad_norm": 1.109375, "learning_rate": 7.7e-05, "loss": 8.4165, "mean_token_accuracy": 0.05523004196584225, "num_tokens": 338089.0, "step": 155 }, { "entropy": 8.880174732208252, "epoch": 0.01712237144844561, "grad_norm": 1.234375, "learning_rate": 7.950000000000001e-05, "loss": 8.4077, "mean_token_accuracy": 0.05682347491383553, "num_tokens": 348536.0, "step": 160 }, { "entropy": 8.93060073852539, "epoch": 0.017657445556209534, "grad_norm": 0.9296875, "learning_rate": 8.2e-05, "loss": 8.4181, "mean_token_accuracy": 0.058796605467796324, "num_tokens": 359776.0, "step": 165 }, { "entropy": 8.809493732452392, "epoch": 0.01819251966397346, "grad_norm": 1.015625, "learning_rate": 8.450000000000001e-05, "loss": 8.3472, "mean_token_accuracy": 0.06165213547646999, "num_tokens": 370810.0, "step": 170 }, { "entropy": 8.747115898132325, "epoch": 0.018727593771737387, "grad_norm": 0.94140625, "learning_rate": 8.7e-05, "loss": 8.3511, "mean_token_accuracy": 0.05888295993208885, "num_tokens": 381788.0, "step": 175 }, { "entropy": 8.742884063720703, "epoch": 0.01926266787950131, "grad_norm": 1.0390625, "learning_rate": 8.95e-05, "loss": 8.3376, "mean_token_accuracy": 0.0602983683347702, "num_tokens": 391984.0, "step": 180 }, { "entropy": 8.610486602783203, "epoch": 0.019797741987265235, "grad_norm": 1.0, "learning_rate": 9.2e-05, "loss": 8.3311, "mean_token_accuracy": 0.058925900235772134, "num_tokens": 403430.0, "step": 185 }, { "entropy": 8.670144844055176, "epoch": 0.02033281609502916, "grad_norm": 1.0234375, "learning_rate": 9.45e-05, "loss": 8.318, "mean_token_accuracy": 0.05627542734146118, "num_tokens": 414467.0, "step": 190 }, { "entropy": 8.56268243789673, "epoch": 0.020867890202793088, "grad_norm": 0.921875, "learning_rate": 9.7e-05, "loss": 8.2838, "mean_token_accuracy": 0.06462269835174084, "num_tokens": 425752.0, "step": 195 }, { "entropy": 8.562543296813965, "epoch": 0.02140296431055701, "grad_norm": 0.94921875, "learning_rate": 9.95e-05, "loss": 8.2618, "mean_token_accuracy": 0.06471644267439843, "num_tokens": 435908.0, "step": 200 }, { "entropy": 8.58950891494751, "epoch": 0.021938038418320937, "grad_norm": 1.0390625, "learning_rate": 0.000102, "loss": 8.3051, "mean_token_accuracy": 0.05973440445959568, "num_tokens": 446424.0, "step": 205 }, { "entropy": 8.575794887542724, "epoch": 0.022473112526084863, "grad_norm": 1.03125, "learning_rate": 0.00010449999999999999, "loss": 8.2691, "mean_token_accuracy": 0.0648487914353609, "num_tokens": 456854.0, "step": 210 }, { "entropy": 8.506811428070069, "epoch": 0.02300818663384879, "grad_norm": 1.078125, "learning_rate": 0.000107, "loss": 8.2861, "mean_token_accuracy": 0.06673729792237282, "num_tokens": 467899.0, "step": 215 }, { "entropy": 8.497941493988037, "epoch": 0.023543260741612712, "grad_norm": 1.0078125, "learning_rate": 0.0001095, "loss": 8.2297, "mean_token_accuracy": 0.06340378113090991, "num_tokens": 478683.0, "step": 220 }, { "entropy": 8.574148082733155, "epoch": 0.02407833484937664, "grad_norm": 1.046875, "learning_rate": 0.000112, "loss": 8.2648, "mean_token_accuracy": 0.06170066706836223, "num_tokens": 488745.0, "step": 225 }, { "entropy": 8.4907470703125, "epoch": 0.024613408957140565, "grad_norm": 1.0703125, "learning_rate": 0.0001145, "loss": 8.3431, "mean_token_accuracy": 0.059930100291967395, "num_tokens": 499448.0, "step": 230 }, { "entropy": 8.599916458129883, "epoch": 0.02514848306490449, "grad_norm": 0.95703125, "learning_rate": 0.00011700000000000001, "loss": 8.27, "mean_token_accuracy": 0.0650645636022091, "num_tokens": 510148.0, "step": 235 }, { "entropy": 8.483675956726074, "epoch": 0.025683557172668414, "grad_norm": 1.0078125, "learning_rate": 0.00011949999999999999, "loss": 8.1965, "mean_token_accuracy": 0.06112907975912094, "num_tokens": 522093.0, "step": 240 }, { "entropy": 8.460341262817384, "epoch": 0.02621863128043234, "grad_norm": 1.015625, "learning_rate": 0.000122, "loss": 8.2277, "mean_token_accuracy": 0.06530554480850696, "num_tokens": 532598.0, "step": 245 }, { "entropy": 8.49462070465088, "epoch": 0.026753705388196266, "grad_norm": 1.171875, "learning_rate": 0.0001245, "loss": 8.1956, "mean_token_accuracy": 0.06578520573675632, "num_tokens": 542652.0, "step": 250 }, { "entropy": 8.460633659362793, "epoch": 0.027288779495960192, "grad_norm": 1.015625, "learning_rate": 0.000127, "loss": 8.2328, "mean_token_accuracy": 0.06693280301988125, "num_tokens": 552526.0, "step": 255 }, { "entropy": 8.399180793762207, "epoch": 0.027823853603724115, "grad_norm": 0.98046875, "learning_rate": 0.0001295, "loss": 8.2517, "mean_token_accuracy": 0.06344069167971611, "num_tokens": 563143.0, "step": 260 }, { "entropy": 8.48379201889038, "epoch": 0.02835892771148804, "grad_norm": 0.94921875, "learning_rate": 0.000132, "loss": 8.2149, "mean_token_accuracy": 0.06581672765314579, "num_tokens": 573814.0, "step": 265 }, { "entropy": 8.457896327972412, "epoch": 0.028894001819251967, "grad_norm": 0.890625, "learning_rate": 0.00013450000000000002, "loss": 8.1733, "mean_token_accuracy": 0.07218663729727268, "num_tokens": 585367.0, "step": 270 }, { "entropy": 8.507985496520996, "epoch": 0.02942907592701589, "grad_norm": 3.078125, "learning_rate": 0.00013700000000000002, "loss": 8.2318, "mean_token_accuracy": 0.06521918512880802, "num_tokens": 595902.0, "step": 275 }, { "entropy": 8.41034107208252, "epoch": 0.029964150034779816, "grad_norm": 1.4375, "learning_rate": 0.0001395, "loss": 8.138, "mean_token_accuracy": 0.0642226304858923, "num_tokens": 607178.0, "step": 280 }, { "entropy": 8.431483745574951, "epoch": 0.030499224142543743, "grad_norm": 0.94140625, "learning_rate": 0.00014199999999999998, "loss": 8.1309, "mean_token_accuracy": 0.06817701198160649, "num_tokens": 618604.0, "step": 285 }, { "entropy": 8.404507827758788, "epoch": 0.03103429825030767, "grad_norm": 0.9921875, "learning_rate": 0.0001445, "loss": 8.2, "mean_token_accuracy": 0.0719299040734768, "num_tokens": 628111.0, "step": 290 }, { "entropy": 8.490602397918702, "epoch": 0.03156937235807159, "grad_norm": 1.453125, "learning_rate": 0.000147, "loss": 8.2289, "mean_token_accuracy": 0.06933129876852036, "num_tokens": 639358.0, "step": 295 }, { "entropy": 8.35900354385376, "epoch": 0.03210444646583552, "grad_norm": 1.0078125, "learning_rate": 0.0001495, "loss": 8.0903, "mean_token_accuracy": 0.07086234539747238, "num_tokens": 649504.0, "step": 300 }, { "entropy": 8.400328350067138, "epoch": 0.032639520573599444, "grad_norm": 1.1171875, "learning_rate": 0.000152, "loss": 8.1111, "mean_token_accuracy": 0.0681851863861084, "num_tokens": 659924.0, "step": 305 }, { "entropy": 8.422282886505126, "epoch": 0.03317459468136337, "grad_norm": 1.328125, "learning_rate": 0.00015450000000000001, "loss": 8.15, "mean_token_accuracy": 0.06455899253487588, "num_tokens": 671120.0, "step": 310 }, { "entropy": 8.319589424133301, "epoch": 0.033709668789127296, "grad_norm": 1.0390625, "learning_rate": 0.000157, "loss": 8.1985, "mean_token_accuracy": 0.06430512070655822, "num_tokens": 681956.0, "step": 315 }, { "entropy": 8.48956241607666, "epoch": 0.03424474289689122, "grad_norm": 0.953125, "learning_rate": 0.0001595, "loss": 8.182, "mean_token_accuracy": 0.06503869034349918, "num_tokens": 693226.0, "step": 320 }, { "entropy": 8.33993911743164, "epoch": 0.03477981700465514, "grad_norm": 0.94140625, "learning_rate": 0.000162, "loss": 8.1812, "mean_token_accuracy": 0.07134119421243668, "num_tokens": 704691.0, "step": 325 }, { "entropy": 8.362220954895019, "epoch": 0.03531489111241907, "grad_norm": 0.94921875, "learning_rate": 0.00016450000000000001, "loss": 8.1304, "mean_token_accuracy": 0.062357674539089206, "num_tokens": 716000.0, "step": 330 }, { "entropy": 8.332426834106446, "epoch": 0.035849965220182994, "grad_norm": 0.9296875, "learning_rate": 0.00016700000000000002, "loss": 8.0529, "mean_token_accuracy": 0.06962560564279556, "num_tokens": 726723.0, "step": 335 }, { "entropy": 8.32654685974121, "epoch": 0.03638503932794692, "grad_norm": 1.0390625, "learning_rate": 0.00016950000000000003, "loss": 8.0646, "mean_token_accuracy": 0.07072275690734386, "num_tokens": 736740.0, "step": 340 }, { "entropy": 8.333600425720215, "epoch": 0.03692011343571085, "grad_norm": 1.859375, "learning_rate": 0.00017199999999999998, "loss": 8.1131, "mean_token_accuracy": 0.068069913610816, "num_tokens": 747567.0, "step": 345 }, { "entropy": 8.398985290527344, "epoch": 0.03745518754347477, "grad_norm": 1.03125, "learning_rate": 0.00017449999999999999, "loss": 8.0626, "mean_token_accuracy": 0.06914932392537594, "num_tokens": 757937.0, "step": 350 }, { "entropy": 8.163579368591309, "epoch": 0.0379902616512387, "grad_norm": 1.0234375, "learning_rate": 0.000177, "loss": 8.0955, "mean_token_accuracy": 0.07165054567158222, "num_tokens": 768003.0, "step": 355 }, { "entropy": 8.49596710205078, "epoch": 0.03852533575900262, "grad_norm": 0.9453125, "learning_rate": 0.0001795, "loss": 8.1288, "mean_token_accuracy": 0.06314317509531975, "num_tokens": 779098.0, "step": 360 }, { "entropy": 8.285042762756348, "epoch": 0.039060409866766545, "grad_norm": 1.1796875, "learning_rate": 0.000182, "loss": 8.099, "mean_token_accuracy": 0.06513171158730983, "num_tokens": 790002.0, "step": 365 }, { "entropy": 8.28923921585083, "epoch": 0.03959548397453047, "grad_norm": 1.0234375, "learning_rate": 0.0001845, "loss": 8.0887, "mean_token_accuracy": 0.06843880005180836, "num_tokens": 800444.0, "step": 370 }, { "entropy": 8.375462627410888, "epoch": 0.0401305580822944, "grad_norm": 1.0390625, "learning_rate": 0.000187, "loss": 8.0323, "mean_token_accuracy": 0.0713271751999855, "num_tokens": 810912.0, "step": 375 }, { "entropy": 8.272585010528564, "epoch": 0.04066563219005832, "grad_norm": 0.9375, "learning_rate": 0.0001895, "loss": 8.1198, "mean_token_accuracy": 0.0620170421898365, "num_tokens": 822809.0, "step": 380 }, { "entropy": 8.293894195556641, "epoch": 0.04120070629782225, "grad_norm": 1.0078125, "learning_rate": 0.000192, "loss": 8.0433, "mean_token_accuracy": 0.07052243873476982, "num_tokens": 833362.0, "step": 385 }, { "entropy": 8.276584053039551, "epoch": 0.041735780405586176, "grad_norm": 1.109375, "learning_rate": 0.0001945, "loss": 8.0465, "mean_token_accuracy": 0.07357921116054059, "num_tokens": 844239.0, "step": 390 }, { "entropy": 8.217984676361084, "epoch": 0.0422708545133501, "grad_norm": 1.0546875, "learning_rate": 0.00019700000000000002, "loss": 8.0493, "mean_token_accuracy": 0.06498224660754204, "num_tokens": 855178.0, "step": 395 }, { "entropy": 8.19730110168457, "epoch": 0.04280592862111402, "grad_norm": 1.15625, "learning_rate": 0.00019950000000000002, "loss": 8.0369, "mean_token_accuracy": 0.07206248976290226, "num_tokens": 866120.0, "step": 400 }, { "entropy": 8.337959480285644, "epoch": 0.04334100272887795, "grad_norm": 0.9453125, "learning_rate": 0.000202, "loss": 8.0361, "mean_token_accuracy": 0.07243039160966873, "num_tokens": 876569.0, "step": 405 }, { "entropy": 8.284227752685547, "epoch": 0.043876076836641874, "grad_norm": 0.9921875, "learning_rate": 0.00020449999999999998, "loss": 8.0951, "mean_token_accuracy": 0.06462065242230892, "num_tokens": 887580.0, "step": 410 }, { "entropy": 8.235477828979493, "epoch": 0.0444111509444058, "grad_norm": 1.046875, "learning_rate": 0.000207, "loss": 8.0165, "mean_token_accuracy": 0.0666106827557087, "num_tokens": 897922.0, "step": 415 }, { "entropy": 8.222909069061279, "epoch": 0.044946225052169726, "grad_norm": 1.0234375, "learning_rate": 0.0002095, "loss": 7.9827, "mean_token_accuracy": 0.07159848175942898, "num_tokens": 908522.0, "step": 420 }, { "entropy": 8.27180290222168, "epoch": 0.04548129915993365, "grad_norm": 1.078125, "learning_rate": 0.000212, "loss": 7.9946, "mean_token_accuracy": 0.06654324233531952, "num_tokens": 918253.0, "step": 425 }, { "entropy": 8.194285202026368, "epoch": 0.04601637326769758, "grad_norm": 0.91015625, "learning_rate": 0.0002145, "loss": 8.0034, "mean_token_accuracy": 0.07207662984728813, "num_tokens": 929150.0, "step": 430 }, { "entropy": 8.239371013641357, "epoch": 0.0465514473754615, "grad_norm": 0.94140625, "learning_rate": 0.00021700000000000002, "loss": 8.0511, "mean_token_accuracy": 0.07106035277247429, "num_tokens": 941041.0, "step": 435 }, { "entropy": 8.180944156646728, "epoch": 0.047086521483225424, "grad_norm": 1.59375, "learning_rate": 0.0002195, "loss": 7.9757, "mean_token_accuracy": 0.07760139927268028, "num_tokens": 952714.0, "step": 440 }, { "entropy": 8.150847339630127, "epoch": 0.04762159559098935, "grad_norm": 1.109375, "learning_rate": 0.000222, "loss": 8.0514, "mean_token_accuracy": 0.06907343231141568, "num_tokens": 964330.0, "step": 445 }, { "entropy": 8.246770858764648, "epoch": 0.04815666969875328, "grad_norm": 1.1796875, "learning_rate": 0.0002245, "loss": 7.9805, "mean_token_accuracy": 0.06862297914922237, "num_tokens": 975257.0, "step": 450 }, { "entropy": 8.260761165618897, "epoch": 0.0486917438065172, "grad_norm": 1.09375, "learning_rate": 0.00022700000000000002, "loss": 7.9876, "mean_token_accuracy": 0.07001541927456856, "num_tokens": 986335.0, "step": 455 }, { "entropy": 8.069970512390137, "epoch": 0.04922681791428113, "grad_norm": 0.859375, "learning_rate": 0.00022950000000000002, "loss": 7.8883, "mean_token_accuracy": 0.07471956759691238, "num_tokens": 997521.0, "step": 460 }, { "entropy": 8.172566795349121, "epoch": 0.049761892022045055, "grad_norm": 0.921875, "learning_rate": 0.00023200000000000003, "loss": 7.941, "mean_token_accuracy": 0.0669164728373289, "num_tokens": 1008383.0, "step": 465 }, { "entropy": 8.124609184265136, "epoch": 0.05029696612980898, "grad_norm": 1.09375, "learning_rate": 0.00023449999999999998, "loss": 7.998, "mean_token_accuracy": 0.06806416064500809, "num_tokens": 1020552.0, "step": 470 }, { "entropy": 8.196929836273194, "epoch": 0.0508320402375729, "grad_norm": 0.90625, "learning_rate": 0.000237, "loss": 7.9718, "mean_token_accuracy": 0.07053619101643563, "num_tokens": 1031127.0, "step": 475 }, { "entropy": 8.022743558883667, "epoch": 0.05136711434533683, "grad_norm": 0.890625, "learning_rate": 0.0002395, "loss": 7.8837, "mean_token_accuracy": 0.07386223524808884, "num_tokens": 1043209.0, "step": 480 }, { "entropy": 8.2311222076416, "epoch": 0.05190218845310075, "grad_norm": 0.96875, "learning_rate": 0.000242, "loss": 8.0182, "mean_token_accuracy": 0.06782832555472851, "num_tokens": 1054032.0, "step": 485 }, { "entropy": 8.030213356018066, "epoch": 0.05243726256086468, "grad_norm": 1.03125, "learning_rate": 0.0002445, "loss": 7.8628, "mean_token_accuracy": 0.07288614809513091, "num_tokens": 1064565.0, "step": 490 }, { "entropy": 8.178169107437133, "epoch": 0.052972336668628606, "grad_norm": 0.94140625, "learning_rate": 0.000247, "loss": 7.9975, "mean_token_accuracy": 0.0721826508641243, "num_tokens": 1076352.0, "step": 495 }, { "entropy": 8.112149047851563, "epoch": 0.05350741077639253, "grad_norm": 1.1484375, "learning_rate": 0.0002495, "loss": 7.9381, "mean_token_accuracy": 0.07542271986603737, "num_tokens": 1087697.0, "step": 500 }, { "entropy": 8.137825202941894, "epoch": 0.05404248488415646, "grad_norm": 0.99609375, "learning_rate": 0.000252, "loss": 7.876, "mean_token_accuracy": 0.07182962782680988, "num_tokens": 1098056.0, "step": 505 }, { "entropy": 8.017078876495361, "epoch": 0.054577558991920384, "grad_norm": 1.0, "learning_rate": 0.0002545, "loss": 7.8477, "mean_token_accuracy": 0.07691125422716141, "num_tokens": 1109219.0, "step": 510 }, { "entropy": 8.091530561447144, "epoch": 0.055112633099684304, "grad_norm": 0.94140625, "learning_rate": 0.000257, "loss": 7.9312, "mean_token_accuracy": 0.0700716007500887, "num_tokens": 1120248.0, "step": 515 }, { "entropy": 8.096777963638306, "epoch": 0.05564770720744823, "grad_norm": 1.1171875, "learning_rate": 0.0002595, "loss": 7.9366, "mean_token_accuracy": 0.07186660170555115, "num_tokens": 1131278.0, "step": 520 }, { "entropy": 8.089863491058349, "epoch": 0.056182781315212156, "grad_norm": 1.1875, "learning_rate": 0.000262, "loss": 7.9537, "mean_token_accuracy": 0.06224438659846783, "num_tokens": 1143147.0, "step": 525 }, { "entropy": 8.162030553817749, "epoch": 0.05671785542297608, "grad_norm": 0.89453125, "learning_rate": 0.00026450000000000003, "loss": 7.84, "mean_token_accuracy": 0.0739860113710165, "num_tokens": 1154316.0, "step": 530 }, { "entropy": 7.977855777740478, "epoch": 0.05725292953074001, "grad_norm": 1.0234375, "learning_rate": 0.00026700000000000004, "loss": 7.8967, "mean_token_accuracy": 0.06953345276415349, "num_tokens": 1164696.0, "step": 535 }, { "entropy": 8.048009157180786, "epoch": 0.057788003638503935, "grad_norm": 1.0, "learning_rate": 0.00026950000000000005, "loss": 7.8769, "mean_token_accuracy": 0.07776758968830108, "num_tokens": 1176129.0, "step": 540 }, { "entropy": 8.093161487579346, "epoch": 0.05832307774626786, "grad_norm": 1.0625, "learning_rate": 0.00027200000000000005, "loss": 7.8881, "mean_token_accuracy": 0.07334664314985276, "num_tokens": 1186499.0, "step": 545 }, { "entropy": 8.04116907119751, "epoch": 0.05885815185403178, "grad_norm": 0.98046875, "learning_rate": 0.0002745, "loss": 7.8557, "mean_token_accuracy": 0.07062512040138244, "num_tokens": 1196841.0, "step": 550 }, { "entropy": 8.01404366493225, "epoch": 0.059393225961795706, "grad_norm": 0.91796875, "learning_rate": 0.000277, "loss": 7.8108, "mean_token_accuracy": 0.07467551231384277, "num_tokens": 1207647.0, "step": 555 }, { "entropy": 7.952892255783081, "epoch": 0.05992830006955963, "grad_norm": 1.1015625, "learning_rate": 0.0002795, "loss": 7.801, "mean_token_accuracy": 0.07650438733398915, "num_tokens": 1217072.0, "step": 560 }, { "entropy": 8.061871433258057, "epoch": 0.06046337417732356, "grad_norm": 1.0859375, "learning_rate": 0.00028199999999999997, "loss": 7.9129, "mean_token_accuracy": 0.0698221705853939, "num_tokens": 1228564.0, "step": 565 }, { "entropy": 7.987078428268433, "epoch": 0.060998448285087485, "grad_norm": 0.99609375, "learning_rate": 0.0002845, "loss": 7.8458, "mean_token_accuracy": 0.07497354932129383, "num_tokens": 1238755.0, "step": 570 }, { "entropy": 7.964116954803467, "epoch": 0.06153352239285141, "grad_norm": 1.1484375, "learning_rate": 0.000287, "loss": 7.8004, "mean_token_accuracy": 0.0752273216843605, "num_tokens": 1248968.0, "step": 575 }, { "entropy": 7.962353372573853, "epoch": 0.06206859650061534, "grad_norm": 1.0, "learning_rate": 0.0002895, "loss": 7.7714, "mean_token_accuracy": 0.07172017395496369, "num_tokens": 1259256.0, "step": 580 }, { "entropy": 7.952462911605835, "epoch": 0.06260367060837926, "grad_norm": 1.0859375, "learning_rate": 0.000292, "loss": 7.8067, "mean_token_accuracy": 0.07487296611070633, "num_tokens": 1270469.0, "step": 585 }, { "entropy": 7.963806390762329, "epoch": 0.06313874471614318, "grad_norm": 1.0078125, "learning_rate": 0.0002945, "loss": 7.7694, "mean_token_accuracy": 0.07279012463986874, "num_tokens": 1280558.0, "step": 590 }, { "entropy": 7.986854600906372, "epoch": 0.06367381882390712, "grad_norm": 1.046875, "learning_rate": 0.000297, "loss": 7.8307, "mean_token_accuracy": 0.0718784749507904, "num_tokens": 1291372.0, "step": 595 }, { "entropy": 8.02498688697815, "epoch": 0.06420889293167104, "grad_norm": 0.9921875, "learning_rate": 0.0002995, "loss": 7.9061, "mean_token_accuracy": 0.0674042422324419, "num_tokens": 1302521.0, "step": 600 }, { "entropy": 7.8433699131011965, "epoch": 0.06474396703943497, "grad_norm": 1.109375, "learning_rate": 0.000302, "loss": 7.7274, "mean_token_accuracy": 0.07444682195782662, "num_tokens": 1313632.0, "step": 605 }, { "entropy": 8.005569124221802, "epoch": 0.06527904114719889, "grad_norm": 0.96484375, "learning_rate": 0.0003045, "loss": 7.8118, "mean_token_accuracy": 0.07571293860673904, "num_tokens": 1325247.0, "step": 610 }, { "entropy": 7.937390947341919, "epoch": 0.06581411525496281, "grad_norm": 0.9453125, "learning_rate": 0.000307, "loss": 7.8015, "mean_token_accuracy": 0.075490290671587, "num_tokens": 1336026.0, "step": 615 }, { "entropy": 7.93022665977478, "epoch": 0.06634918936272674, "grad_norm": 0.93359375, "learning_rate": 0.0003095, "loss": 7.7122, "mean_token_accuracy": 0.0769732192158699, "num_tokens": 1346920.0, "step": 620 }, { "entropy": 7.828203010559082, "epoch": 0.06688426347049066, "grad_norm": 1.21875, "learning_rate": 0.000312, "loss": 7.8585, "mean_token_accuracy": 0.0724661260843277, "num_tokens": 1359752.0, "step": 625 }, { "entropy": 8.050937986373901, "epoch": 0.06741933757825459, "grad_norm": 0.95703125, "learning_rate": 0.0003145, "loss": 7.8615, "mean_token_accuracy": 0.07357175201177597, "num_tokens": 1370874.0, "step": 630 }, { "entropy": 7.897751331329346, "epoch": 0.06795441168601851, "grad_norm": 0.9140625, "learning_rate": 0.000317, "loss": 7.7624, "mean_token_accuracy": 0.07756051793694496, "num_tokens": 1382316.0, "step": 635 }, { "entropy": 7.840310096740723, "epoch": 0.06848948579378245, "grad_norm": 1.0, "learning_rate": 0.0003195, "loss": 7.7878, "mean_token_accuracy": 0.07577594220638276, "num_tokens": 1394656.0, "step": 640 }, { "entropy": 7.928963756561279, "epoch": 0.06902455990154636, "grad_norm": 1.0, "learning_rate": 0.000322, "loss": 7.7522, "mean_token_accuracy": 0.07719769552350045, "num_tokens": 1405061.0, "step": 645 }, { "entropy": 7.838529491424561, "epoch": 0.06955963400931028, "grad_norm": 0.9140625, "learning_rate": 0.00032450000000000003, "loss": 7.7183, "mean_token_accuracy": 0.08189134374260902, "num_tokens": 1415573.0, "step": 650 }, { "entropy": 7.810403823852539, "epoch": 0.07009470811707422, "grad_norm": 1.015625, "learning_rate": 0.00032700000000000003, "loss": 7.7436, "mean_token_accuracy": 0.07435674965381622, "num_tokens": 1426103.0, "step": 655 }, { "entropy": 7.886046600341797, "epoch": 0.07062978222483814, "grad_norm": 1.6796875, "learning_rate": 0.00032950000000000004, "loss": 7.7599, "mean_token_accuracy": 0.07234186008572578, "num_tokens": 1437256.0, "step": 660 }, { "entropy": 7.909786796569824, "epoch": 0.07116485633260207, "grad_norm": 1.0859375, "learning_rate": 0.00033200000000000005, "loss": 7.7241, "mean_token_accuracy": 0.0786049198359251, "num_tokens": 1446975.0, "step": 665 }, { "entropy": 7.831602573394775, "epoch": 0.07169993044036599, "grad_norm": 0.99609375, "learning_rate": 0.00033450000000000005, "loss": 7.7425, "mean_token_accuracy": 0.07444198578596115, "num_tokens": 1457751.0, "step": 670 }, { "entropy": 7.829366731643677, "epoch": 0.07223500454812992, "grad_norm": 1.046875, "learning_rate": 0.000337, "loss": 7.7049, "mean_token_accuracy": 0.0754860796034336, "num_tokens": 1468186.0, "step": 675 }, { "entropy": 7.825147390365601, "epoch": 0.07277007865589384, "grad_norm": 0.83203125, "learning_rate": 0.0003395, "loss": 7.7508, "mean_token_accuracy": 0.07570655383169651, "num_tokens": 1479780.0, "step": 680 }, { "entropy": 7.8603636741638185, "epoch": 0.07330515276365776, "grad_norm": 0.94921875, "learning_rate": 0.000342, "loss": 7.6712, "mean_token_accuracy": 0.0832133986055851, "num_tokens": 1490565.0, "step": 685 }, { "entropy": 7.892835903167724, "epoch": 0.0738402268714217, "grad_norm": 0.96875, "learning_rate": 0.00034449999999999997, "loss": 7.7227, "mean_token_accuracy": 0.07809135504066944, "num_tokens": 1501552.0, "step": 690 }, { "entropy": 7.798111057281494, "epoch": 0.07437530097918561, "grad_norm": 0.9375, "learning_rate": 0.000347, "loss": 7.7035, "mean_token_accuracy": 0.07376831583678722, "num_tokens": 1513311.0, "step": 695 }, { "entropy": 7.795570516586304, "epoch": 0.07491037508694955, "grad_norm": 0.98046875, "learning_rate": 0.0003495, "loss": 7.7428, "mean_token_accuracy": 0.08057990670204163, "num_tokens": 1524142.0, "step": 700 }, { "entropy": 7.8165356636047365, "epoch": 0.07544544919471347, "grad_norm": 1.03125, "learning_rate": 0.000352, "loss": 7.7188, "mean_token_accuracy": 0.07599906846880913, "num_tokens": 1535571.0, "step": 705 }, { "entropy": 7.865922546386718, "epoch": 0.0759805233024774, "grad_norm": 0.89453125, "learning_rate": 0.0003545, "loss": 7.7225, "mean_token_accuracy": 0.07798022851347923, "num_tokens": 1546528.0, "step": 710 }, { "entropy": 7.727042579650879, "epoch": 0.07651559741024132, "grad_norm": 0.8828125, "learning_rate": 0.000357, "loss": 7.7386, "mean_token_accuracy": 0.07202219888567925, "num_tokens": 1557264.0, "step": 715 }, { "entropy": 7.867890882492065, "epoch": 0.07705067151800524, "grad_norm": 1.0625, "learning_rate": 0.0003595, "loss": 7.6785, "mean_token_accuracy": 0.08276100754737854, "num_tokens": 1566773.0, "step": 720 }, { "entropy": 7.699678039550781, "epoch": 0.07758574562576917, "grad_norm": 0.96875, "learning_rate": 0.000362, "loss": 7.6459, "mean_token_accuracy": 0.08662735894322396, "num_tokens": 1578173.0, "step": 725 }, { "entropy": 7.779191970825195, "epoch": 0.07812081973353309, "grad_norm": 0.98046875, "learning_rate": 0.0003645, "loss": 7.6221, "mean_token_accuracy": 0.08249625936150551, "num_tokens": 1588537.0, "step": 730 }, { "entropy": 7.7231770038604735, "epoch": 0.07865589384129702, "grad_norm": 0.98046875, "learning_rate": 0.000367, "loss": 7.6355, "mean_token_accuracy": 0.08746174871921539, "num_tokens": 1599159.0, "step": 735 }, { "entropy": 7.7618378639221195, "epoch": 0.07919096794906094, "grad_norm": 0.9921875, "learning_rate": 0.0003695, "loss": 7.6989, "mean_token_accuracy": 0.07925031632184983, "num_tokens": 1610378.0, "step": 740 }, { "entropy": 7.720492362976074, "epoch": 0.07972604205682488, "grad_norm": 1.1328125, "learning_rate": 0.000372, "loss": 7.705, "mean_token_accuracy": 0.07612368240952491, "num_tokens": 1621215.0, "step": 745 }, { "entropy": 7.786748743057251, "epoch": 0.0802611161645888, "grad_norm": 1.0625, "learning_rate": 0.0003745, "loss": 7.6622, "mean_token_accuracy": 0.0790612380951643, "num_tokens": 1631170.0, "step": 750 }, { "entropy": 7.78691840171814, "epoch": 0.08079619027235273, "grad_norm": 0.98828125, "learning_rate": 0.000377, "loss": 7.6574, "mean_token_accuracy": 0.07428538724780083, "num_tokens": 1641897.0, "step": 755 }, { "entropy": 7.766008996963501, "epoch": 0.08133126438011665, "grad_norm": 0.95703125, "learning_rate": 0.0003795, "loss": 7.7353, "mean_token_accuracy": 0.07569916620850563, "num_tokens": 1653592.0, "step": 760 }, { "entropy": 7.616559743881226, "epoch": 0.08186633848788057, "grad_norm": 0.9375, "learning_rate": 0.000382, "loss": 7.6528, "mean_token_accuracy": 0.07474047541618348, "num_tokens": 1665760.0, "step": 765 }, { "entropy": 7.830330228805542, "epoch": 0.0824014125956445, "grad_norm": 0.9609375, "learning_rate": 0.0003845, "loss": 7.6454, "mean_token_accuracy": 0.08570240736007691, "num_tokens": 1676211.0, "step": 770 }, { "entropy": 7.737586927413941, "epoch": 0.08293648670340842, "grad_norm": 1.0, "learning_rate": 0.00038700000000000003, "loss": 7.6666, "mean_token_accuracy": 0.0797475405037403, "num_tokens": 1686405.0, "step": 775 }, { "entropy": 7.75378794670105, "epoch": 0.08347156081117235, "grad_norm": 1.0546875, "learning_rate": 0.00038950000000000003, "loss": 7.6699, "mean_token_accuracy": 0.07950277514755726, "num_tokens": 1697340.0, "step": 780 }, { "entropy": 7.726286888122559, "epoch": 0.08400663491893627, "grad_norm": 1.046875, "learning_rate": 0.00039200000000000004, "loss": 7.5787, "mean_token_accuracy": 0.0861763522028923, "num_tokens": 1707250.0, "step": 785 }, { "entropy": 7.63549427986145, "epoch": 0.0845417090267002, "grad_norm": 1.0078125, "learning_rate": 0.00039450000000000005, "loss": 7.5653, "mean_token_accuracy": 0.0784637302160263, "num_tokens": 1718333.0, "step": 790 }, { "entropy": 7.709765481948852, "epoch": 0.08507678313446412, "grad_norm": 1.0625, "learning_rate": 0.00039700000000000005, "loss": 7.6627, "mean_token_accuracy": 0.07198781482875347, "num_tokens": 1730520.0, "step": 795 }, { "entropy": 7.7255151748657225, "epoch": 0.08561185724222804, "grad_norm": 1.0625, "learning_rate": 0.0003995, "loss": 7.7149, "mean_token_accuracy": 0.07679420076310635, "num_tokens": 1741898.0, "step": 800 }, { "entropy": 7.718593311309815, "epoch": 0.08614693134999198, "grad_norm": 1.09375, "learning_rate": 0.000402, "loss": 7.6508, "mean_token_accuracy": 0.08017718270421029, "num_tokens": 1751671.0, "step": 805 }, { "entropy": 7.577520227432251, "epoch": 0.0866820054577559, "grad_norm": 0.91015625, "learning_rate": 0.0004045, "loss": 7.6669, "mean_token_accuracy": 0.08265335634350776, "num_tokens": 1762076.0, "step": 810 }, { "entropy": 7.796188259124756, "epoch": 0.08721707956551983, "grad_norm": 0.98046875, "learning_rate": 0.00040699999999999997, "loss": 7.642, "mean_token_accuracy": 0.07752098590135574, "num_tokens": 1772666.0, "step": 815 }, { "entropy": 7.724516534805298, "epoch": 0.08775215367328375, "grad_norm": 0.94921875, "learning_rate": 0.0004095, "loss": 7.6572, "mean_token_accuracy": 0.08227546997368336, "num_tokens": 1783621.0, "step": 820 }, { "entropy": 7.700971364974976, "epoch": 0.08828722778104768, "grad_norm": 1.5234375, "learning_rate": 0.000412, "loss": 7.7147, "mean_token_accuracy": 0.07807004414498805, "num_tokens": 1794654.0, "step": 825 }, { "entropy": 7.651264762878418, "epoch": 0.0888223018888116, "grad_norm": 0.88671875, "learning_rate": 0.0004145, "loss": 7.6008, "mean_token_accuracy": 0.0848226711153984, "num_tokens": 1805853.0, "step": 830 }, { "entropy": 7.536796283721924, "epoch": 0.08935737599657552, "grad_norm": 0.9375, "learning_rate": 0.000417, "loss": 7.5896, "mean_token_accuracy": 0.0828265130519867, "num_tokens": 1817006.0, "step": 835 }, { "entropy": 7.733750724792481, "epoch": 0.08989245010433945, "grad_norm": 1.0, "learning_rate": 0.0004195, "loss": 7.583, "mean_token_accuracy": 0.07734453342854977, "num_tokens": 1827166.0, "step": 840 }, { "entropy": 7.7373639106750485, "epoch": 0.09042752421210337, "grad_norm": 1.140625, "learning_rate": 0.000422, "loss": 7.6809, "mean_token_accuracy": 0.07751412987709046, "num_tokens": 1837182.0, "step": 845 }, { "entropy": 7.567351484298706, "epoch": 0.0909625983198673, "grad_norm": 0.94140625, "learning_rate": 0.0004245, "loss": 7.6388, "mean_token_accuracy": 0.07895995602011681, "num_tokens": 1849034.0, "step": 850 }, { "entropy": 7.595164203643799, "epoch": 0.09149767242763122, "grad_norm": 0.98828125, "learning_rate": 0.000427, "loss": 7.5075, "mean_token_accuracy": 0.08833360373973846, "num_tokens": 1859033.0, "step": 855 }, { "entropy": 7.610419750213623, "epoch": 0.09203274653539516, "grad_norm": 0.9765625, "learning_rate": 0.0004295, "loss": 7.6121, "mean_token_accuracy": 0.08088177517056465, "num_tokens": 1870274.0, "step": 860 }, { "entropy": 7.5731220722198485, "epoch": 0.09256782064315908, "grad_norm": 1.265625, "learning_rate": 0.000432, "loss": 7.5611, "mean_token_accuracy": 0.08315053284168243, "num_tokens": 1881306.0, "step": 865 }, { "entropy": 7.561473751068116, "epoch": 0.093102894750923, "grad_norm": 1.0078125, "learning_rate": 0.0004345, "loss": 7.5356, "mean_token_accuracy": 0.08015808910131454, "num_tokens": 1892464.0, "step": 870 }, { "entropy": 7.661314296722412, "epoch": 0.09363796885868693, "grad_norm": 0.9609375, "learning_rate": 0.000437, "loss": 7.6219, "mean_token_accuracy": 0.07585933655500413, "num_tokens": 1903743.0, "step": 875 }, { "entropy": 7.607653522491455, "epoch": 0.09417304296645085, "grad_norm": 1.0, "learning_rate": 0.0004395, "loss": 7.5902, "mean_token_accuracy": 0.08468717783689499, "num_tokens": 1915253.0, "step": 880 }, { "entropy": 7.622669744491577, "epoch": 0.09470811707421478, "grad_norm": 1.2421875, "learning_rate": 0.000442, "loss": 7.5473, "mean_token_accuracy": 0.08187699615955353, "num_tokens": 1926113.0, "step": 885 }, { "entropy": 7.57468581199646, "epoch": 0.0952431911819787, "grad_norm": 0.98046875, "learning_rate": 0.0004445, "loss": 7.6456, "mean_token_accuracy": 0.08173620626330376, "num_tokens": 1937718.0, "step": 890 }, { "entropy": 7.625470066070557, "epoch": 0.09577826528974263, "grad_norm": 1.0234375, "learning_rate": 0.000447, "loss": 7.6334, "mean_token_accuracy": 0.0791581004858017, "num_tokens": 1948307.0, "step": 895 }, { "entropy": 7.575066232681275, "epoch": 0.09631333939750655, "grad_norm": 0.96484375, "learning_rate": 0.00044950000000000003, "loss": 7.4358, "mean_token_accuracy": 0.09009880647063255, "num_tokens": 1957861.0, "step": 900 }, { "entropy": 7.480437755584717, "epoch": 0.09684841350527049, "grad_norm": 0.92578125, "learning_rate": 0.00045200000000000004, "loss": 7.4911, "mean_token_accuracy": 0.08970233350992203, "num_tokens": 1967984.0, "step": 905 }, { "entropy": 7.55365891456604, "epoch": 0.0973834876130344, "grad_norm": 1.0, "learning_rate": 0.00045450000000000004, "loss": 7.4885, "mean_token_accuracy": 0.08413884043693542, "num_tokens": 1978608.0, "step": 910 }, { "entropy": 7.550483322143554, "epoch": 0.09791856172079832, "grad_norm": 0.98828125, "learning_rate": 0.00045700000000000005, "loss": 7.547, "mean_token_accuracy": 0.08248279690742492, "num_tokens": 1989355.0, "step": 915 }, { "entropy": 7.514042758941651, "epoch": 0.09845363582856226, "grad_norm": 0.96484375, "learning_rate": 0.00045950000000000006, "loss": 7.5303, "mean_token_accuracy": 0.08344742506742478, "num_tokens": 1999754.0, "step": 920 }, { "entropy": 7.540969705581665, "epoch": 0.09898870993632618, "grad_norm": 0.99609375, "learning_rate": 0.000462, "loss": 7.5232, "mean_token_accuracy": 0.0832397285848856, "num_tokens": 2010877.0, "step": 925 }, { "entropy": 7.635095930099487, "epoch": 0.09952378404409011, "grad_norm": 0.9140625, "learning_rate": 0.0004645, "loss": 7.6286, "mean_token_accuracy": 0.08003128916025162, "num_tokens": 2022301.0, "step": 930 }, { "entropy": 7.549521160125733, "epoch": 0.10005885815185403, "grad_norm": 0.99609375, "learning_rate": 0.000467, "loss": 7.5119, "mean_token_accuracy": 0.08251530304551125, "num_tokens": 2033537.0, "step": 935 }, { "entropy": 7.477602958679199, "epoch": 0.10059393225961796, "grad_norm": 1.0390625, "learning_rate": 0.0004695, "loss": 7.4502, "mean_token_accuracy": 0.0781034879386425, "num_tokens": 2044360.0, "step": 940 }, { "entropy": 7.583854675292969, "epoch": 0.10112900636738188, "grad_norm": 0.9296875, "learning_rate": 0.000472, "loss": 7.5601, "mean_token_accuracy": 0.08421726487576961, "num_tokens": 2055000.0, "step": 945 }, { "entropy": 7.492854499816895, "epoch": 0.1016640804751458, "grad_norm": 0.9609375, "learning_rate": 0.0004745, "loss": 7.5467, "mean_token_accuracy": 0.08681007251143455, "num_tokens": 2064807.0, "step": 950 }, { "entropy": 7.5536168098449705, "epoch": 0.10219915458290973, "grad_norm": 0.96484375, "learning_rate": 0.000477, "loss": 7.5102, "mean_token_accuracy": 0.08256960362195968, "num_tokens": 2075618.0, "step": 955 }, { "entropy": 7.505359792709351, "epoch": 0.10273422869067365, "grad_norm": 0.953125, "learning_rate": 0.0004795, "loss": 7.5116, "mean_token_accuracy": 0.08244576305150986, "num_tokens": 2086226.0, "step": 960 }, { "entropy": 7.541278457641601, "epoch": 0.10326930279843759, "grad_norm": 0.89453125, "learning_rate": 0.000482, "loss": 7.5116, "mean_token_accuracy": 0.08005514740943909, "num_tokens": 2097222.0, "step": 965 }, { "entropy": 7.481921100616455, "epoch": 0.1038043769062015, "grad_norm": 0.90625, "learning_rate": 0.0004845, "loss": 7.541, "mean_token_accuracy": 0.08661947920918464, "num_tokens": 2108919.0, "step": 970 }, { "entropy": 7.46715989112854, "epoch": 0.10433945101396544, "grad_norm": 0.96875, "learning_rate": 0.000487, "loss": 7.4939, "mean_token_accuracy": 0.08317564725875855, "num_tokens": 2120215.0, "step": 975 }, { "entropy": 7.5228071212768555, "epoch": 0.10487452512172936, "grad_norm": 1.015625, "learning_rate": 0.0004895, "loss": 7.5188, "mean_token_accuracy": 0.0818349651992321, "num_tokens": 2131503.0, "step": 980 }, { "entropy": 7.487857866287231, "epoch": 0.10540959922949328, "grad_norm": 0.96484375, "learning_rate": 0.000492, "loss": 7.4588, "mean_token_accuracy": 0.08936587274074555, "num_tokens": 2141551.0, "step": 985 }, { "entropy": 7.4559633255004885, "epoch": 0.10594467333725721, "grad_norm": 0.92578125, "learning_rate": 0.0004945, "loss": 7.4615, "mean_token_accuracy": 0.08929954171180725, "num_tokens": 2151821.0, "step": 990 }, { "entropy": 7.451591444015503, "epoch": 0.10647974744502113, "grad_norm": 1.03125, "learning_rate": 0.000497, "loss": 7.5065, "mean_token_accuracy": 0.08539062738418579, "num_tokens": 2162474.0, "step": 995 }, { "entropy": 7.53413724899292, "epoch": 0.10701482155278506, "grad_norm": 0.96875, "learning_rate": 0.0004995, "loss": 7.5602, "mean_token_accuracy": 0.08457510098814965, "num_tokens": 2173985.0, "step": 1000 }, { "entropy": 7.5422203063964846, "epoch": 0.10754989566054898, "grad_norm": 0.90625, "learning_rate": 0.0004999999979210101, "loss": 7.5944, "mean_token_accuracy": 0.07782966643571854, "num_tokens": 2186432.0, "step": 1005 }, { "entropy": 7.4759071350097654, "epoch": 0.10808496976831292, "grad_norm": 0.96484375, "learning_rate": 0.0004999999894751138, "loss": 7.4463, "mean_token_accuracy": 0.0834141232073307, "num_tokens": 2197085.0, "step": 1010 }, { "entropy": 7.424153137207031, "epoch": 0.10862004387607684, "grad_norm": 0.98828125, "learning_rate": 0.0004999999745323744, "loss": 7.4486, "mean_token_accuracy": 0.08975227214396, "num_tokens": 2207162.0, "step": 1015 }, { "entropy": 7.464861583709717, "epoch": 0.10915511798384077, "grad_norm": 0.9609375, "learning_rate": 0.0004999999530927923, "loss": 7.5469, "mean_token_accuracy": 0.07938519641757011, "num_tokens": 2218714.0, "step": 1020 }, { "entropy": 7.515410757064819, "epoch": 0.10969019209160469, "grad_norm": 0.96875, "learning_rate": 0.0004999999251563682, "loss": 7.4879, "mean_token_accuracy": 0.08599804565310479, "num_tokens": 2229711.0, "step": 1025 }, { "entropy": 7.45625114440918, "epoch": 0.11022526619936861, "grad_norm": 0.9140625, "learning_rate": 0.0004999998907231029, "loss": 7.4912, "mean_token_accuracy": 0.08116911202669144, "num_tokens": 2239885.0, "step": 1030 }, { "entropy": 7.481421899795532, "epoch": 0.11076034030713254, "grad_norm": 1.0, "learning_rate": 0.0004999998497929974, "loss": 7.4923, "mean_token_accuracy": 0.08827452957630158, "num_tokens": 2250221.0, "step": 1035 }, { "entropy": 7.4760716438293455, "epoch": 0.11129541441489646, "grad_norm": 0.91796875, "learning_rate": 0.0004999998023660527, "loss": 7.5526, "mean_token_accuracy": 0.07815601006150245, "num_tokens": 2261059.0, "step": 1040 }, { "entropy": 7.454020214080811, "epoch": 0.11183048852266039, "grad_norm": 0.8984375, "learning_rate": 0.0004999997484422705, "loss": 7.4273, "mean_token_accuracy": 0.08656688034534454, "num_tokens": 2271174.0, "step": 1045 }, { "entropy": 7.404057025909424, "epoch": 0.11236556263042431, "grad_norm": 1.0625, "learning_rate": 0.0004999996880216521, "loss": 7.5037, "mean_token_accuracy": 0.08764296993613244, "num_tokens": 2282431.0, "step": 1050 }, { "entropy": 7.506435585021973, "epoch": 0.11290063673818825, "grad_norm": 1.109375, "learning_rate": 0.0004999996211041994, "loss": 7.4922, "mean_token_accuracy": 0.08441931083798408, "num_tokens": 2292891.0, "step": 1055 }, { "entropy": 7.472446441650391, "epoch": 0.11343571084595216, "grad_norm": 0.97265625, "learning_rate": 0.0004999995476899141, "loss": 7.5049, "mean_token_accuracy": 0.08200813457369804, "num_tokens": 2303764.0, "step": 1060 }, { "entropy": 7.319696569442749, "epoch": 0.11397078495371608, "grad_norm": 1.0234375, "learning_rate": 0.0004999994677787987, "loss": 7.4002, "mean_token_accuracy": 0.09418007209897042, "num_tokens": 2314172.0, "step": 1065 }, { "entropy": 7.449784660339356, "epoch": 0.11450585906148002, "grad_norm": 1.046875, "learning_rate": 0.0004999993813708551, "loss": 7.3939, "mean_token_accuracy": 0.08950763419270516, "num_tokens": 2324848.0, "step": 1070 }, { "entropy": 7.320974636077881, "epoch": 0.11504093316924394, "grad_norm": 0.89453125, "learning_rate": 0.000499999288466086, "loss": 7.4332, "mean_token_accuracy": 0.08251803517341613, "num_tokens": 2336601.0, "step": 1075 }, { "entropy": 7.46982364654541, "epoch": 0.11557600727700787, "grad_norm": 0.95703125, "learning_rate": 0.0004999991890644941, "loss": 7.4167, "mean_token_accuracy": 0.0846226740628481, "num_tokens": 2347281.0, "step": 1080 }, { "entropy": 7.453939628601074, "epoch": 0.11611108138477179, "grad_norm": 1.0, "learning_rate": 0.0004999990831660822, "loss": 7.4224, "mean_token_accuracy": 0.0908889777958393, "num_tokens": 2358199.0, "step": 1085 }, { "entropy": 7.446761226654052, "epoch": 0.11664615549253572, "grad_norm": 1.0234375, "learning_rate": 0.0004999989707708534, "loss": 7.4877, "mean_token_accuracy": 0.08379835970699787, "num_tokens": 2369092.0, "step": 1090 }, { "entropy": 7.3978382587432865, "epoch": 0.11718122960029964, "grad_norm": 0.984375, "learning_rate": 0.0004999988518788111, "loss": 7.458, "mean_token_accuracy": 0.08341244608163834, "num_tokens": 2378849.0, "step": 1095 }, { "entropy": 7.428147649765014, "epoch": 0.11771630370806356, "grad_norm": 0.90234375, "learning_rate": 0.0004999987264899583, "loss": 7.4385, "mean_token_accuracy": 0.09159169495105743, "num_tokens": 2389587.0, "step": 1100 }, { "entropy": 7.492716360092163, "epoch": 0.1182513778158275, "grad_norm": 0.97265625, "learning_rate": 0.000499998594604299, "loss": 7.434, "mean_token_accuracy": 0.08649549037218093, "num_tokens": 2400442.0, "step": 1105 }, { "entropy": 7.284411334991455, "epoch": 0.11878645192359141, "grad_norm": 0.890625, "learning_rate": 0.000499998456221837, "loss": 7.4154, "mean_token_accuracy": 0.08677608072757721, "num_tokens": 2410771.0, "step": 1110 }, { "entropy": 7.476975584030152, "epoch": 0.11932152603135535, "grad_norm": 1.0, "learning_rate": 0.0004999983113425762, "loss": 7.4299, "mean_token_accuracy": 0.09064068272709846, "num_tokens": 2421112.0, "step": 1115 }, { "entropy": 7.400354480743408, "epoch": 0.11985660013911927, "grad_norm": 0.91796875, "learning_rate": 0.0004999981599665207, "loss": 7.4163, "mean_token_accuracy": 0.08564619868993759, "num_tokens": 2431891.0, "step": 1120 }, { "entropy": 7.315796279907227, "epoch": 0.1203916742468832, "grad_norm": 1.0078125, "learning_rate": 0.0004999980020936748, "loss": 7.3479, "mean_token_accuracy": 0.08722568973898888, "num_tokens": 2442987.0, "step": 1125 }, { "entropy": 7.354978418350219, "epoch": 0.12092674835464712, "grad_norm": 1.09375, "learning_rate": 0.0004999978377240434, "loss": 7.4002, "mean_token_accuracy": 0.08564592450857163, "num_tokens": 2452703.0, "step": 1130 }, { "entropy": 7.375062036514282, "epoch": 0.12146182246241104, "grad_norm": 0.984375, "learning_rate": 0.000499997666857631, "loss": 7.4598, "mean_token_accuracy": 0.08786297589540482, "num_tokens": 2462975.0, "step": 1135 }, { "entropy": 7.394401025772095, "epoch": 0.12199689657017497, "grad_norm": 0.8359375, "learning_rate": 0.0004999974894944426, "loss": 7.4003, "mean_token_accuracy": 0.08598766103386879, "num_tokens": 2473853.0, "step": 1140 }, { "entropy": 7.384897661209107, "epoch": 0.12253197067793889, "grad_norm": 0.90625, "learning_rate": 0.0004999973056344832, "loss": 7.3822, "mean_token_accuracy": 0.08470982015132904, "num_tokens": 2485633.0, "step": 1145 }, { "entropy": 7.337519359588623, "epoch": 0.12306704478570282, "grad_norm": 0.91796875, "learning_rate": 0.0004999971152777583, "loss": 7.3414, "mean_token_accuracy": 0.08668373227119446, "num_tokens": 2496922.0, "step": 1150 }, { "entropy": 7.443722057342529, "epoch": 0.12360211889346674, "grad_norm": 0.87109375, "learning_rate": 0.0004999969184242733, "loss": 7.4147, "mean_token_accuracy": 0.0896741084754467, "num_tokens": 2507890.0, "step": 1155 }, { "entropy": 7.319026279449463, "epoch": 0.12413719300123068, "grad_norm": 1.0390625, "learning_rate": 0.000499996715074034, "loss": 7.4076, "mean_token_accuracy": 0.09130077436566353, "num_tokens": 2519749.0, "step": 1160 }, { "entropy": 7.3418297290802, "epoch": 0.1246722671089946, "grad_norm": 0.97265625, "learning_rate": 0.0004999965052270461, "loss": 7.4121, "mean_token_accuracy": 0.09187431186437607, "num_tokens": 2530666.0, "step": 1165 }, { "entropy": 7.364394998550415, "epoch": 0.12520734121675853, "grad_norm": 0.89453125, "learning_rate": 0.0004999962888833157, "loss": 7.4155, "mean_token_accuracy": 0.08915347754955291, "num_tokens": 2541594.0, "step": 1170 }, { "entropy": 7.363469171524048, "epoch": 0.12574241532452243, "grad_norm": 0.9453125, "learning_rate": 0.0004999960660428491, "loss": 7.3946, "mean_token_accuracy": 0.0930194191634655, "num_tokens": 2552330.0, "step": 1175 }, { "entropy": 7.449467992782592, "epoch": 0.12627748943228637, "grad_norm": 0.87109375, "learning_rate": 0.0004999958367056526, "loss": 7.4494, "mean_token_accuracy": 0.08116971924901009, "num_tokens": 2564601.0, "step": 1180 }, { "entropy": 7.422946262359619, "epoch": 0.1268125635400503, "grad_norm": 0.9921875, "learning_rate": 0.000499995600871733, "loss": 7.4242, "mean_token_accuracy": 0.08717223256826401, "num_tokens": 2575539.0, "step": 1185 }, { "entropy": 7.284857511520386, "epoch": 0.12734763764781423, "grad_norm": 0.89453125, "learning_rate": 0.0004999953585410971, "loss": 7.3588, "mean_token_accuracy": 0.08616523109376431, "num_tokens": 2586635.0, "step": 1190 }, { "entropy": 7.405594778060913, "epoch": 0.12788271175557814, "grad_norm": 1.1171875, "learning_rate": 0.0004999951097137518, "loss": 7.388, "mean_token_accuracy": 0.08991223797202111, "num_tokens": 2596814.0, "step": 1195 }, { "entropy": 7.325789880752564, "epoch": 0.12841778586334207, "grad_norm": 0.86328125, "learning_rate": 0.0004999948543897044, "loss": 7.4089, "mean_token_accuracy": 0.08616380542516708, "num_tokens": 2608087.0, "step": 1200 }, { "entropy": 7.498183393478394, "epoch": 0.128952859971106, "grad_norm": 0.9609375, "learning_rate": 0.0004999945925689621, "loss": 7.41, "mean_token_accuracy": 0.08784973174333573, "num_tokens": 2619377.0, "step": 1205 }, { "entropy": 7.285972166061401, "epoch": 0.12948793407886994, "grad_norm": 1.0234375, "learning_rate": 0.0004999943242515325, "loss": 7.314, "mean_token_accuracy": 0.08880106881260871, "num_tokens": 2629089.0, "step": 1210 }, { "entropy": 7.320152521133423, "epoch": 0.13002300818663384, "grad_norm": 0.8828125, "learning_rate": 0.0004999940494374236, "loss": 7.3835, "mean_token_accuracy": 0.08867338374257087, "num_tokens": 2639743.0, "step": 1215 }, { "entropy": 7.45218596458435, "epoch": 0.13055808229439778, "grad_norm": 1.015625, "learning_rate": 0.000499993768126643, "loss": 7.4254, "mean_token_accuracy": 0.082533248513937, "num_tokens": 2650631.0, "step": 1220 }, { "entropy": 7.268480491638184, "epoch": 0.1310931564021617, "grad_norm": 0.96484375, "learning_rate": 0.000499993480319199, "loss": 7.3811, "mean_token_accuracy": 0.0892926201224327, "num_tokens": 2660197.0, "step": 1225 }, { "entropy": 7.394870710372925, "epoch": 0.13162823050992561, "grad_norm": 0.98828125, "learning_rate": 0.0004999931860150999, "loss": 7.3556, "mean_token_accuracy": 0.08826216235756874, "num_tokens": 2670162.0, "step": 1230 }, { "entropy": 7.390807247161865, "epoch": 0.13216330461768955, "grad_norm": 0.90234375, "learning_rate": 0.0004999928852143541, "loss": 7.3554, "mean_token_accuracy": 0.08857011944055557, "num_tokens": 2681233.0, "step": 1235 }, { "entropy": 7.200170421600342, "epoch": 0.13269837872545348, "grad_norm": 0.87109375, "learning_rate": 0.0004999925779169703, "loss": 7.3187, "mean_token_accuracy": 0.09283828288316727, "num_tokens": 2692145.0, "step": 1240 }, { "entropy": 7.413662004470825, "epoch": 0.13323345283321741, "grad_norm": 0.91015625, "learning_rate": 0.0004999922641229575, "loss": 7.3447, "mean_token_accuracy": 0.09158495515584945, "num_tokens": 2703192.0, "step": 1245 }, { "entropy": 7.324686527252197, "epoch": 0.13376852694098132, "grad_norm": 0.87890625, "learning_rate": 0.0004999919438323248, "loss": 7.3597, "mean_token_accuracy": 0.08890319019556045, "num_tokens": 2714804.0, "step": 1250 }, { "entropy": 7.333380794525146, "epoch": 0.13430360104874525, "grad_norm": 1.046875, "learning_rate": 0.0004999916170450812, "loss": 7.3259, "mean_token_accuracy": 0.09193522408604622, "num_tokens": 2724340.0, "step": 1255 }, { "entropy": 7.259483861923218, "epoch": 0.13483867515650919, "grad_norm": 0.91796875, "learning_rate": 0.0004999912837612364, "loss": 7.3341, "mean_token_accuracy": 0.09227988123893738, "num_tokens": 2735767.0, "step": 1260 }, { "entropy": 7.455391693115234, "epoch": 0.1353737492642731, "grad_norm": 0.91796875, "learning_rate": 0.0004999909439807997, "loss": 7.3851, "mean_token_accuracy": 0.08482631966471672, "num_tokens": 2747658.0, "step": 1265 }, { "entropy": 7.264850521087647, "epoch": 0.13590882337203702, "grad_norm": 1.015625, "learning_rate": 0.0004999905977037813, "loss": 7.2465, "mean_token_accuracy": 0.09336961582303047, "num_tokens": 2757901.0, "step": 1270 }, { "entropy": 7.284139823913574, "epoch": 0.13644389747980096, "grad_norm": 1.015625, "learning_rate": 0.0004999902449301909, "loss": 7.2989, "mean_token_accuracy": 0.0874991238117218, "num_tokens": 2768945.0, "step": 1275 }, { "entropy": 7.24199595451355, "epoch": 0.1369789715875649, "grad_norm": 0.80859375, "learning_rate": 0.0004999898856600387, "loss": 7.271, "mean_token_accuracy": 0.103138717263937, "num_tokens": 2780276.0, "step": 1280 }, { "entropy": 7.350469398498535, "epoch": 0.1375140456953288, "grad_norm": 0.9140625, "learning_rate": 0.0004999895198933354, "loss": 7.3416, "mean_token_accuracy": 0.09537098631262779, "num_tokens": 2791183.0, "step": 1285 }, { "entropy": 7.342680644989014, "epoch": 0.13804911980309273, "grad_norm": 0.94140625, "learning_rate": 0.0004999891476300911, "loss": 7.2607, "mean_token_accuracy": 0.08925738111138344, "num_tokens": 2801928.0, "step": 1290 }, { "entropy": 7.263091659545898, "epoch": 0.13858419391085666, "grad_norm": 0.890625, "learning_rate": 0.000499988768870317, "loss": 7.3525, "mean_token_accuracy": 0.08583549410104752, "num_tokens": 2813415.0, "step": 1295 }, { "entropy": 7.329908657073974, "epoch": 0.13911926801862057, "grad_norm": 0.98046875, "learning_rate": 0.0004999883836140236, "loss": 7.3533, "mean_token_accuracy": 0.08882890194654465, "num_tokens": 2825288.0, "step": 1300 }, { "entropy": 7.312420797348023, "epoch": 0.1396543421263845, "grad_norm": 0.96484375, "learning_rate": 0.0004999879918612224, "loss": 7.3068, "mean_token_accuracy": 0.09304987639188766, "num_tokens": 2836298.0, "step": 1305 }, { "entropy": 7.313601350784301, "epoch": 0.14018941623414843, "grad_norm": 1.03125, "learning_rate": 0.0004999875936119245, "loss": 7.2898, "mean_token_accuracy": 0.0945392332971096, "num_tokens": 2846367.0, "step": 1310 }, { "entropy": 7.240101766586304, "epoch": 0.14072449034191237, "grad_norm": 0.9921875, "learning_rate": 0.0004999871888661415, "loss": 7.3047, "mean_token_accuracy": 0.08923600688576698, "num_tokens": 2856832.0, "step": 1315 }, { "entropy": 7.309039974212647, "epoch": 0.14125956444967627, "grad_norm": 0.9140625, "learning_rate": 0.000499986777623885, "loss": 7.3245, "mean_token_accuracy": 0.08692366257309914, "num_tokens": 2867954.0, "step": 1320 }, { "entropy": 7.439533376693726, "epoch": 0.1417946385574402, "grad_norm": 0.9921875, "learning_rate": 0.0004999863598851669, "loss": 7.3611, "mean_token_accuracy": 0.09297569468617439, "num_tokens": 2878714.0, "step": 1325 }, { "entropy": 7.053972816467285, "epoch": 0.14232971266520414, "grad_norm": 1.3359375, "learning_rate": 0.0004999859356499992, "loss": 7.298, "mean_token_accuracy": 0.10052636489272118, "num_tokens": 2890697.0, "step": 1330 }, { "entropy": 7.382122421264649, "epoch": 0.14286478677296804, "grad_norm": 1.0078125, "learning_rate": 0.0004999855049183943, "loss": 7.3219, "mean_token_accuracy": 0.08626203685998916, "num_tokens": 2901468.0, "step": 1335 }, { "entropy": 7.25765290260315, "epoch": 0.14339986088073198, "grad_norm": 0.94140625, "learning_rate": 0.0004999850676903646, "loss": 7.2671, "mean_token_accuracy": 0.09408968985080719, "num_tokens": 2913466.0, "step": 1340 }, { "entropy": 7.231286239624024, "epoch": 0.1439349349884959, "grad_norm": 0.8984375, "learning_rate": 0.0004999846239659226, "loss": 7.2505, "mean_token_accuracy": 0.09706522151827812, "num_tokens": 2923638.0, "step": 1345 }, { "entropy": 7.269954109191895, "epoch": 0.14447000909625984, "grad_norm": 1.015625, "learning_rate": 0.0004999841737450812, "loss": 7.3357, "mean_token_accuracy": 0.09442631006240845, "num_tokens": 2934790.0, "step": 1350 }, { "entropy": 7.268723440170288, "epoch": 0.14500508320402375, "grad_norm": 1.0234375, "learning_rate": 0.0004999837170278535, "loss": 7.2757, "mean_token_accuracy": 0.08723422512412071, "num_tokens": 2946320.0, "step": 1355 }, { "entropy": 7.3566694259643555, "epoch": 0.14554015731178768, "grad_norm": 1.0546875, "learning_rate": 0.0004999832538142526, "loss": 7.2369, "mean_token_accuracy": 0.09091865047812461, "num_tokens": 2957077.0, "step": 1360 }, { "entropy": 7.177463865280151, "epoch": 0.14607523141955162, "grad_norm": 0.953125, "learning_rate": 0.0004999827841042917, "loss": 7.2678, "mean_token_accuracy": 0.08816000148653984, "num_tokens": 2967286.0, "step": 1365 }, { "entropy": 7.2939177513122555, "epoch": 0.14661030552731552, "grad_norm": 1.34375, "learning_rate": 0.0004999823078979846, "loss": 7.3057, "mean_token_accuracy": 0.09016561508178711, "num_tokens": 2979516.0, "step": 1370 }, { "entropy": 7.379639339447022, "epoch": 0.14714537963507945, "grad_norm": 0.96484375, "learning_rate": 0.0004999818251953449, "loss": 7.419, "mean_token_accuracy": 0.08294185698032379, "num_tokens": 2991594.0, "step": 1375 }, { "entropy": 7.246149206161499, "epoch": 0.1476804537428434, "grad_norm": 1.0234375, "learning_rate": 0.0004999813359963867, "loss": 7.2972, "mean_token_accuracy": 0.08775367885828018, "num_tokens": 3002487.0, "step": 1380 }, { "entropy": 7.372300243377685, "epoch": 0.14821552785060732, "grad_norm": 0.98828125, "learning_rate": 0.0004999808403011241, "loss": 7.3157, "mean_token_accuracy": 0.09396110102534294, "num_tokens": 3013197.0, "step": 1385 }, { "entropy": 7.142706060409546, "epoch": 0.14875060195837123, "grad_norm": 0.8984375, "learning_rate": 0.0004999803381095712, "loss": 7.3451, "mean_token_accuracy": 0.09063652530312538, "num_tokens": 3024512.0, "step": 1390 }, { "entropy": 7.415092658996582, "epoch": 0.14928567606613516, "grad_norm": 0.9296875, "learning_rate": 0.0004999798294217428, "loss": 7.3046, "mean_token_accuracy": 0.08789012357592582, "num_tokens": 3035621.0, "step": 1395 }, { "entropy": 7.229216432571411, "epoch": 0.1498207501738991, "grad_norm": 0.97265625, "learning_rate": 0.0004999793142376533, "loss": 7.2876, "mean_token_accuracy": 0.09253833740949631, "num_tokens": 3046492.0, "step": 1400 }, { "entropy": 7.263148021697998, "epoch": 0.150355824281663, "grad_norm": 0.90625, "learning_rate": 0.0004999787925573177, "loss": 7.3086, "mean_token_accuracy": 0.09204896241426468, "num_tokens": 3057715.0, "step": 1405 }, { "entropy": 7.3932922840118405, "epoch": 0.15089089838942693, "grad_norm": 0.9140625, "learning_rate": 0.0004999782643807513, "loss": 7.2654, "mean_token_accuracy": 0.09031828343868256, "num_tokens": 3068344.0, "step": 1410 }, { "entropy": 7.193799686431885, "epoch": 0.15142597249719086, "grad_norm": 0.8671875, "learning_rate": 0.0004999777297079689, "loss": 7.2547, "mean_token_accuracy": 0.09031877219676972, "num_tokens": 3079576.0, "step": 1415 }, { "entropy": 7.342895412445069, "epoch": 0.1519610466049548, "grad_norm": 0.98046875, "learning_rate": 0.0004999771885389863, "loss": 7.2153, "mean_token_accuracy": 0.09486196860671044, "num_tokens": 3090201.0, "step": 1420 }, { "entropy": 7.1453712463378904, "epoch": 0.1524961207127187, "grad_norm": 1.03125, "learning_rate": 0.0004999766408738189, "loss": 7.1936, "mean_token_accuracy": 0.10047192424535752, "num_tokens": 3099824.0, "step": 1425 }, { "entropy": 7.24136872291565, "epoch": 0.15303119482048264, "grad_norm": 0.90625, "learning_rate": 0.0004999760867124827, "loss": 7.2738, "mean_token_accuracy": 0.09082015976309776, "num_tokens": 3109948.0, "step": 1430 }, { "entropy": 7.299263906478882, "epoch": 0.15356626892824657, "grad_norm": 0.8984375, "learning_rate": 0.0004999755260549937, "loss": 7.2626, "mean_token_accuracy": 0.0974075585603714, "num_tokens": 3121492.0, "step": 1435 }, { "entropy": 7.21744818687439, "epoch": 0.15410134303601047, "grad_norm": 1.671875, "learning_rate": 0.0004999749589013677, "loss": 7.0545, "mean_token_accuracy": 0.10996845588088036, "num_tokens": 3131990.0, "step": 1440 }, { "entropy": 7.1235129833221436, "epoch": 0.1546364171437744, "grad_norm": 0.8828125, "learning_rate": 0.0004999743852516217, "loss": 7.2409, "mean_token_accuracy": 0.0921150028705597, "num_tokens": 3142567.0, "step": 1445 }, { "entropy": 7.32010293006897, "epoch": 0.15517149125153834, "grad_norm": 1.328125, "learning_rate": 0.0004999738051057717, "loss": 7.2522, "mean_token_accuracy": 0.09435679912567138, "num_tokens": 3153083.0, "step": 1450 }, { "entropy": 7.188344669342041, "epoch": 0.15570656535930227, "grad_norm": 0.984375, "learning_rate": 0.0004999732184638347, "loss": 7.2555, "mean_token_accuracy": 0.09004457890987397, "num_tokens": 3163985.0, "step": 1455 }, { "entropy": 7.262719058990479, "epoch": 0.15624163946706618, "grad_norm": 0.92578125, "learning_rate": 0.0004999726253258278, "loss": 7.2392, "mean_token_accuracy": 0.09183276668190957, "num_tokens": 3175259.0, "step": 1460 }, { "entropy": 7.254732751846314, "epoch": 0.1567767135748301, "grad_norm": 0.99609375, "learning_rate": 0.0004999720256917678, "loss": 7.206, "mean_token_accuracy": 0.0977108657360077, "num_tokens": 3185487.0, "step": 1465 }, { "entropy": 7.127510118484497, "epoch": 0.15731178768259405, "grad_norm": 0.94921875, "learning_rate": 0.0004999714195616723, "loss": 7.1831, "mean_token_accuracy": 0.09826227650046349, "num_tokens": 3196200.0, "step": 1470 }, { "entropy": 7.333015441894531, "epoch": 0.15784686179035795, "grad_norm": 0.96875, "learning_rate": 0.0004999708069355586, "loss": 7.3054, "mean_token_accuracy": 0.0843054249882698, "num_tokens": 3207675.0, "step": 1475 }, { "entropy": 7.17571177482605, "epoch": 0.15838193589812188, "grad_norm": 1.078125, "learning_rate": 0.0004999701878134445, "loss": 7.1815, "mean_token_accuracy": 0.09501941055059433, "num_tokens": 3218117.0, "step": 1480 }, { "entropy": 7.304254627227783, "epoch": 0.15891701000588582, "grad_norm": 0.94140625, "learning_rate": 0.0004999695621953477, "loss": 7.2505, "mean_token_accuracy": 0.10208047479391098, "num_tokens": 3229208.0, "step": 1485 }, { "entropy": 7.173984098434448, "epoch": 0.15945208411364975, "grad_norm": 0.96875, "learning_rate": 0.0004999689300812866, "loss": 7.1584, "mean_token_accuracy": 0.101242895424366, "num_tokens": 3239586.0, "step": 1490 }, { "entropy": 7.24401364326477, "epoch": 0.15998715822141366, "grad_norm": 0.8515625, "learning_rate": 0.0004999682914712791, "loss": 7.2254, "mean_token_accuracy": 0.09680869728326798, "num_tokens": 3250103.0, "step": 1495 }, { "entropy": 7.228427124023438, "epoch": 0.1605222323291776, "grad_norm": 0.91015625, "learning_rate": 0.0004999676463653439, "loss": 7.2027, "mean_token_accuracy": 0.10232653468847275, "num_tokens": 3261844.0, "step": 1500 }, { "entropy": 7.227877807617188, "epoch": 0.16105730643694152, "grad_norm": 1.09375, "learning_rate": 0.0004999669947634996, "loss": 7.1639, "mean_token_accuracy": 0.09760255515575408, "num_tokens": 3272073.0, "step": 1505 }, { "entropy": 7.178577184677124, "epoch": 0.16159238054470546, "grad_norm": 0.9609375, "learning_rate": 0.0004999663366657647, "loss": 7.1667, "mean_token_accuracy": 0.09620498046278954, "num_tokens": 3281725.0, "step": 1510 }, { "entropy": 7.214940547943115, "epoch": 0.16212745465246936, "grad_norm": 0.97265625, "learning_rate": 0.0004999656720721586, "loss": 7.3059, "mean_token_accuracy": 0.094396660476923, "num_tokens": 3292708.0, "step": 1515 }, { "entropy": 7.296448183059693, "epoch": 0.1626625287602333, "grad_norm": 0.98828125, "learning_rate": 0.0004999650009827004, "loss": 7.2773, "mean_token_accuracy": 0.09127842709422111, "num_tokens": 3303548.0, "step": 1520 }, { "entropy": 7.19203143119812, "epoch": 0.16319760286799723, "grad_norm": 0.921875, "learning_rate": 0.0004999643233974092, "loss": 7.1486, "mean_token_accuracy": 0.09975013583898544, "num_tokens": 3314261.0, "step": 1525 }, { "entropy": 7.1947274684906, "epoch": 0.16373267697576113, "grad_norm": 0.98046875, "learning_rate": 0.0004999636393163049, "loss": 7.1714, "mean_token_accuracy": 0.09445247575640678, "num_tokens": 3324833.0, "step": 1530 }, { "entropy": 7.053837537765503, "epoch": 0.16426775108352507, "grad_norm": 1.0703125, "learning_rate": 0.0004999629487394071, "loss": 7.0568, "mean_token_accuracy": 0.10237468853592872, "num_tokens": 3334790.0, "step": 1535 }, { "entropy": 7.266930866241455, "epoch": 0.164802825191289, "grad_norm": 1.1484375, "learning_rate": 0.0004999622516667358, "loss": 7.205, "mean_token_accuracy": 0.09691800698637962, "num_tokens": 3345115.0, "step": 1540 }, { "entropy": 7.133483982086181, "epoch": 0.16533789929905293, "grad_norm": 0.875, "learning_rate": 0.000499961548098311, "loss": 7.089, "mean_token_accuracy": 0.10441275909543038, "num_tokens": 3356187.0, "step": 1545 }, { "entropy": 7.117019701004028, "epoch": 0.16587297340681684, "grad_norm": 0.94921875, "learning_rate": 0.0004999608380341533, "loss": 7.1282, "mean_token_accuracy": 0.09887576475739479, "num_tokens": 3367218.0, "step": 1550 }, { "entropy": 7.160897636413575, "epoch": 0.16640804751458077, "grad_norm": 0.98046875, "learning_rate": 0.0004999601214742829, "loss": 7.27, "mean_token_accuracy": 0.08936030119657516, "num_tokens": 3377557.0, "step": 1555 }, { "entropy": 7.371627759933472, "epoch": 0.1669431216223447, "grad_norm": 0.96484375, "learning_rate": 0.0004999593984187206, "loss": 7.2482, "mean_token_accuracy": 0.09751093834638595, "num_tokens": 3387402.0, "step": 1560 }, { "entropy": 7.0916835308074955, "epoch": 0.1674781957301086, "grad_norm": 0.87890625, "learning_rate": 0.0004999586688674872, "loss": 7.1346, "mean_token_accuracy": 0.09648581743240356, "num_tokens": 3397924.0, "step": 1565 }, { "entropy": 7.216659879684448, "epoch": 0.16801326983787254, "grad_norm": 0.94921875, "learning_rate": 0.000499957932820604, "loss": 7.2118, "mean_token_accuracy": 0.08759412840008736, "num_tokens": 3408622.0, "step": 1570 }, { "entropy": 7.262946891784668, "epoch": 0.16854834394563648, "grad_norm": 0.98046875, "learning_rate": 0.000499957190278092, "loss": 7.1622, "mean_token_accuracy": 0.09248490408062934, "num_tokens": 3419692.0, "step": 1575 }, { "entropy": 7.098281383514404, "epoch": 0.1690834180534004, "grad_norm": 1.015625, "learning_rate": 0.0004999564412399728, "loss": 7.2154, "mean_token_accuracy": 0.09459864124655723, "num_tokens": 3430986.0, "step": 1580 }, { "entropy": 7.176830434799195, "epoch": 0.1696184921611643, "grad_norm": 1.0390625, "learning_rate": 0.000499955685706268, "loss": 7.1354, "mean_token_accuracy": 0.09504674524068832, "num_tokens": 3442211.0, "step": 1585 }, { "entropy": 7.03007402420044, "epoch": 0.17015356626892825, "grad_norm": 1.140625, "learning_rate": 0.0004999549236769993, "loss": 7.1229, "mean_token_accuracy": 0.10297105386853218, "num_tokens": 3453585.0, "step": 1590 }, { "entropy": 7.225273466110229, "epoch": 0.17068864037669218, "grad_norm": 1.0078125, "learning_rate": 0.0004999541551521888, "loss": 7.1695, "mean_token_accuracy": 0.0996770367026329, "num_tokens": 3464156.0, "step": 1595 }, { "entropy": 7.249066162109375, "epoch": 0.17122371448445609, "grad_norm": 1.0703125, "learning_rate": 0.0004999533801318587, "loss": 7.2238, "mean_token_accuracy": 0.08952004536986351, "num_tokens": 3474853.0, "step": 1600 }, { "entropy": 7.262774181365967, "epoch": 0.17175878859222002, "grad_norm": 1.03125, "learning_rate": 0.0004999525986160313, "loss": 7.194, "mean_token_accuracy": 0.10073793306946754, "num_tokens": 3486841.0, "step": 1605 }, { "entropy": 7.140778827667236, "epoch": 0.17229386269998395, "grad_norm": 0.9140625, "learning_rate": 0.0004999518106047293, "loss": 7.2169, "mean_token_accuracy": 0.09210691601037979, "num_tokens": 3498735.0, "step": 1610 }, { "entropy": 7.175544404983521, "epoch": 0.17282893680774788, "grad_norm": 0.87890625, "learning_rate": 0.0004999510160979754, "loss": 7.2352, "mean_token_accuracy": 0.10104434639215469, "num_tokens": 3508829.0, "step": 1615 }, { "entropy": 7.1884317874908445, "epoch": 0.1733640109155118, "grad_norm": 0.94921875, "learning_rate": 0.0004999502150957925, "loss": 7.141, "mean_token_accuracy": 0.09438429847359657, "num_tokens": 3519465.0, "step": 1620 }, { "entropy": 7.188577127456665, "epoch": 0.17389908502327572, "grad_norm": 0.93359375, "learning_rate": 0.0004999494075982037, "loss": 7.1086, "mean_token_accuracy": 0.10255491808056831, "num_tokens": 3530401.0, "step": 1625 }, { "entropy": 7.12376561164856, "epoch": 0.17443415913103966, "grad_norm": 0.98828125, "learning_rate": 0.0004999485936052324, "loss": 7.1856, "mean_token_accuracy": 0.09849482700228691, "num_tokens": 3541136.0, "step": 1630 }, { "entropy": 7.288824605941772, "epoch": 0.17496923323880356, "grad_norm": 0.95703125, "learning_rate": 0.000499947773116902, "loss": 7.1753, "mean_token_accuracy": 0.09568259268999099, "num_tokens": 3552525.0, "step": 1635 }, { "entropy": 7.090163278579712, "epoch": 0.1755043073465675, "grad_norm": 0.9140625, "learning_rate": 0.0004999469461332365, "loss": 7.1414, "mean_token_accuracy": 0.09975111782550812, "num_tokens": 3563028.0, "step": 1640 }, { "entropy": 7.199271249771118, "epoch": 0.17603938145433143, "grad_norm": 0.9453125, "learning_rate": 0.0004999461126542592, "loss": 7.0912, "mean_token_accuracy": 0.10047454982995987, "num_tokens": 3573354.0, "step": 1645 }, { "entropy": 6.979637813568115, "epoch": 0.17657445556209536, "grad_norm": 0.83984375, "learning_rate": 0.0004999452726799947, "loss": 7.0802, "mean_token_accuracy": 0.09618928134441376, "num_tokens": 3585576.0, "step": 1650 }, { "entropy": 7.297661590576172, "epoch": 0.17710952966985927, "grad_norm": 0.98828125, "learning_rate": 0.0004999444262104671, "loss": 7.2058, "mean_token_accuracy": 0.08774002119898797, "num_tokens": 3596478.0, "step": 1655 }, { "entropy": 7.110372161865234, "epoch": 0.1776446037776232, "grad_norm": 1.0390625, "learning_rate": 0.0004999435732457007, "loss": 7.153, "mean_token_accuracy": 0.09257297441363335, "num_tokens": 3608014.0, "step": 1660 }, { "entropy": 7.221296691894532, "epoch": 0.17817967788538713, "grad_norm": 0.9921875, "learning_rate": 0.0004999427137857203, "loss": 7.2102, "mean_token_accuracy": 0.09210594072937965, "num_tokens": 3620120.0, "step": 1665 }, { "entropy": 7.107110977172852, "epoch": 0.17871475199315104, "grad_norm": 0.953125, "learning_rate": 0.0004999418478305506, "loss": 7.1096, "mean_token_accuracy": 0.09546202942728996, "num_tokens": 3632578.0, "step": 1670 }, { "entropy": 7.156751394271851, "epoch": 0.17924982610091497, "grad_norm": 0.984375, "learning_rate": 0.0004999409753802167, "loss": 7.131, "mean_token_accuracy": 0.10362366437911988, "num_tokens": 3643245.0, "step": 1675 }, { "entropy": 7.167398452758789, "epoch": 0.1797849002086789, "grad_norm": 0.91015625, "learning_rate": 0.0004999400964347437, "loss": 7.1251, "mean_token_accuracy": 0.09799086153507233, "num_tokens": 3655832.0, "step": 1680 }, { "entropy": 7.151060581207275, "epoch": 0.18031997431644284, "grad_norm": 0.93359375, "learning_rate": 0.0004999392109941571, "loss": 7.1001, "mean_token_accuracy": 0.09830698594450951, "num_tokens": 3666566.0, "step": 1685 }, { "entropy": 7.172510385513306, "epoch": 0.18085504842420674, "grad_norm": 0.91796875, "learning_rate": 0.0004999383190584822, "loss": 7.1298, "mean_token_accuracy": 0.10040193051099777, "num_tokens": 3677572.0, "step": 1690 }, { "entropy": 7.112444877624512, "epoch": 0.18139012253197068, "grad_norm": 0.99609375, "learning_rate": 0.0004999374206277451, "loss": 7.0549, "mean_token_accuracy": 0.09736391827464104, "num_tokens": 3687116.0, "step": 1695 }, { "entropy": 7.057082557678223, "epoch": 0.1819251966397346, "grad_norm": 0.9140625, "learning_rate": 0.0004999365157019717, "loss": 7.1658, "mean_token_accuracy": 0.09722192957997322, "num_tokens": 3697961.0, "step": 1700 }, { "entropy": 7.233665180206299, "epoch": 0.18246027074749852, "grad_norm": 0.9765625, "learning_rate": 0.0004999356042811878, "loss": 7.0802, "mean_token_accuracy": 0.10210576206445694, "num_tokens": 3708834.0, "step": 1705 }, { "entropy": 7.087706089019775, "epoch": 0.18299534485526245, "grad_norm": 0.93359375, "learning_rate": 0.00049993468636542, "loss": 7.1472, "mean_token_accuracy": 0.09556594043970108, "num_tokens": 3719835.0, "step": 1710 }, { "entropy": 7.116140556335449, "epoch": 0.18353041896302638, "grad_norm": 1.03125, "learning_rate": 0.0004999337619546948, "loss": 7.0339, "mean_token_accuracy": 0.10466360598802567, "num_tokens": 3730408.0, "step": 1715 }, { "entropy": 7.085261631011963, "epoch": 0.18406549307079031, "grad_norm": 0.91015625, "learning_rate": 0.0004999328310490387, "loss": 7.1275, "mean_token_accuracy": 0.09871943295001984, "num_tokens": 3741257.0, "step": 1720 }, { "entropy": 7.190493202209472, "epoch": 0.18460056717855422, "grad_norm": 0.96875, "learning_rate": 0.0004999318936484789, "loss": 7.1175, "mean_token_accuracy": 0.10177163109183311, "num_tokens": 3752615.0, "step": 1725 }, { "entropy": 7.106344223022461, "epoch": 0.18513564128631815, "grad_norm": 0.93359375, "learning_rate": 0.0004999309497530422, "loss": 7.1395, "mean_token_accuracy": 0.09094236344099045, "num_tokens": 3763656.0, "step": 1730 }, { "entropy": 7.083023738861084, "epoch": 0.1856707153940821, "grad_norm": 0.91015625, "learning_rate": 0.0004999299993627558, "loss": 7.1148, "mean_token_accuracy": 0.10153383314609528, "num_tokens": 3775257.0, "step": 1735 }, { "entropy": 7.0514672756195065, "epoch": 0.186205789501846, "grad_norm": 0.94921875, "learning_rate": 0.0004999290424776475, "loss": 7.0758, "mean_token_accuracy": 0.1056319996714592, "num_tokens": 3786094.0, "step": 1740 }, { "entropy": 7.330498886108399, "epoch": 0.18674086360960993, "grad_norm": 1.015625, "learning_rate": 0.0004999280790977445, "loss": 7.1657, "mean_token_accuracy": 0.09170655235648155, "num_tokens": 3796672.0, "step": 1745 }, { "entropy": 7.131537580490113, "epoch": 0.18727593771737386, "grad_norm": 0.984375, "learning_rate": 0.000499927109223075, "loss": 7.1508, "mean_token_accuracy": 0.09670756980776787, "num_tokens": 3807910.0, "step": 1750 }, { "entropy": 7.103532934188843, "epoch": 0.1878110118251378, "grad_norm": 0.95703125, "learning_rate": 0.0004999261328536667, "loss": 7.1028, "mean_token_accuracy": 0.1024494618177414, "num_tokens": 3820792.0, "step": 1755 }, { "entropy": 7.02842001914978, "epoch": 0.1883460859329017, "grad_norm": 0.921875, "learning_rate": 0.0004999251499895479, "loss": 7.0234, "mean_token_accuracy": 0.1013932503759861, "num_tokens": 3831126.0, "step": 1760 }, { "entropy": 7.213843870162964, "epoch": 0.18888116004066563, "grad_norm": 0.9140625, "learning_rate": 0.0004999241606307471, "loss": 7.1353, "mean_token_accuracy": 0.10057510435581207, "num_tokens": 3841923.0, "step": 1765 }, { "entropy": 7.119020175933838, "epoch": 0.18941623414842956, "grad_norm": 1.0234375, "learning_rate": 0.0004999231647772927, "loss": 7.0491, "mean_token_accuracy": 0.10542590543627739, "num_tokens": 3852504.0, "step": 1770 }, { "entropy": 6.992453765869141, "epoch": 0.1899513082561935, "grad_norm": 0.96875, "learning_rate": 0.0004999221624292136, "loss": 7.0559, "mean_token_accuracy": 0.10485710874199868, "num_tokens": 3862761.0, "step": 1775 }, { "entropy": 7.134696340560913, "epoch": 0.1904863823639574, "grad_norm": 0.96875, "learning_rate": 0.0004999211535865385, "loss": 7.0556, "mean_token_accuracy": 0.09678238332271576, "num_tokens": 3873662.0, "step": 1780 }, { "entropy": 7.063473129272461, "epoch": 0.19102145647172133, "grad_norm": 0.95703125, "learning_rate": 0.0004999201382492969, "loss": 7.0088, "mean_token_accuracy": 0.10047155022621154, "num_tokens": 3884835.0, "step": 1785 }, { "entropy": 7.110291051864624, "epoch": 0.19155653057948527, "grad_norm": 1.0078125, "learning_rate": 0.0004999191164175178, "loss": 7.154, "mean_token_accuracy": 0.09878607764840126, "num_tokens": 3895073.0, "step": 1790 }, { "entropy": 7.209331798553467, "epoch": 0.19209160468724917, "grad_norm": 0.98828125, "learning_rate": 0.0004999180880912309, "loss": 7.1115, "mean_token_accuracy": 0.09884128645062447, "num_tokens": 3905440.0, "step": 1795 }, { "entropy": 7.072672271728516, "epoch": 0.1926266787950131, "grad_norm": 1.078125, "learning_rate": 0.0004999170532704657, "loss": 7.1145, "mean_token_accuracy": 0.0968818336725235, "num_tokens": 3917135.0, "step": 1800 }, { "entropy": 7.13597002029419, "epoch": 0.19316175290277704, "grad_norm": 0.84375, "learning_rate": 0.0004999160119552523, "loss": 7.117, "mean_token_accuracy": 0.10278327167034149, "num_tokens": 3928247.0, "step": 1805 }, { "entropy": 7.091355848312378, "epoch": 0.19369682701054097, "grad_norm": 0.9375, "learning_rate": 0.0004999149641456206, "loss": 7.1009, "mean_token_accuracy": 0.09872358813881874, "num_tokens": 3938609.0, "step": 1810 }, { "entropy": 7.21585783958435, "epoch": 0.19423190111830488, "grad_norm": 1.046875, "learning_rate": 0.000499913909841601, "loss": 7.0861, "mean_token_accuracy": 0.10127425193786621, "num_tokens": 3949221.0, "step": 1815 }, { "entropy": 7.009944200515747, "epoch": 0.1947669752260688, "grad_norm": 1.015625, "learning_rate": 0.0004999128490432238, "loss": 7.0484, "mean_token_accuracy": 0.09548230320215226, "num_tokens": 3959475.0, "step": 1820 }, { "entropy": 7.083078098297119, "epoch": 0.19530204933383274, "grad_norm": 1.046875, "learning_rate": 0.0004999117817505196, "loss": 7.0515, "mean_token_accuracy": 0.1084510900080204, "num_tokens": 3969638.0, "step": 1825 }, { "entropy": 7.053667259216309, "epoch": 0.19583712344159665, "grad_norm": 0.94140625, "learning_rate": 0.0004999107079635194, "loss": 7.1079, "mean_token_accuracy": 0.10137292668223381, "num_tokens": 3980543.0, "step": 1830 }, { "entropy": 7.355273485183716, "epoch": 0.19637219754936058, "grad_norm": 0.921875, "learning_rate": 0.000499909627682254, "loss": 7.162, "mean_token_accuracy": 0.08682658635079861, "num_tokens": 3993518.0, "step": 1835 }, { "entropy": 7.068727111816406, "epoch": 0.19690727165712452, "grad_norm": 1.046875, "learning_rate": 0.0004999085409067549, "loss": 7.1487, "mean_token_accuracy": 0.09789205938577653, "num_tokens": 4002940.0, "step": 1840 }, { "entropy": 7.013206481933594, "epoch": 0.19744234576488845, "grad_norm": 0.94921875, "learning_rate": 0.0004999074476370531, "loss": 7.0792, "mean_token_accuracy": 0.09683184549212456, "num_tokens": 4013982.0, "step": 1845 }, { "entropy": 7.100980806350708, "epoch": 0.19797741987265235, "grad_norm": 0.98828125, "learning_rate": 0.0004999063478731805, "loss": 7.0638, "mean_token_accuracy": 0.10558338239789009, "num_tokens": 4025607.0, "step": 1850 }, { "entropy": 7.0951310157775875, "epoch": 0.1985124939804163, "grad_norm": 0.9140625, "learning_rate": 0.0004999052416151687, "loss": 7.1104, "mean_token_accuracy": 0.10141080170869828, "num_tokens": 4037467.0, "step": 1855 }, { "entropy": 7.149590158462525, "epoch": 0.19904756808818022, "grad_norm": 0.890625, "learning_rate": 0.0004999041288630496, "loss": 7.1127, "mean_token_accuracy": 0.10126180425286294, "num_tokens": 4049146.0, "step": 1860 }, { "entropy": 7.181366395950318, "epoch": 0.19958264219594413, "grad_norm": 0.90234375, "learning_rate": 0.0004999030096168553, "loss": 7.1485, "mean_token_accuracy": 0.09781184569001197, "num_tokens": 4060500.0, "step": 1865 }, { "entropy": 7.157667875289917, "epoch": 0.20011771630370806, "grad_norm": 1.0234375, "learning_rate": 0.0004999018838766182, "loss": 7.0987, "mean_token_accuracy": 0.0985781691968441, "num_tokens": 4070553.0, "step": 1870 }, { "entropy": 7.14162769317627, "epoch": 0.200652790411472, "grad_norm": 0.98046875, "learning_rate": 0.000499900751642371, "loss": 7.0343, "mean_token_accuracy": 0.11338024884462357, "num_tokens": 4079653.0, "step": 1875 }, { "entropy": 7.015338134765625, "epoch": 0.20118786451923593, "grad_norm": 0.921875, "learning_rate": 0.0004998996129141461, "loss": 7.123, "mean_token_accuracy": 0.09923376441001892, "num_tokens": 4089912.0, "step": 1880 }, { "entropy": 7.212585592269898, "epoch": 0.20172293862699983, "grad_norm": 0.98828125, "learning_rate": 0.0004998984676919764, "loss": 7.0772, "mean_token_accuracy": 0.09714810699224471, "num_tokens": 4100577.0, "step": 1885 }, { "entropy": 7.073903751373291, "epoch": 0.20225801273476376, "grad_norm": 0.96484375, "learning_rate": 0.0004998973159758952, "loss": 7.1033, "mean_token_accuracy": 0.09901956990361213, "num_tokens": 4111752.0, "step": 1890 }, { "entropy": 7.06131501197815, "epoch": 0.2027930868425277, "grad_norm": 1.015625, "learning_rate": 0.0004998961577659355, "loss": 7.0616, "mean_token_accuracy": 0.10182834565639495, "num_tokens": 4122616.0, "step": 1895 }, { "entropy": 7.192514705657959, "epoch": 0.2033281609502916, "grad_norm": 0.90234375, "learning_rate": 0.0004998949930621309, "loss": 7.1547, "mean_token_accuracy": 0.10196215733885765, "num_tokens": 4134275.0, "step": 1900 }, { "entropy": 7.112344741821289, "epoch": 0.20386323505805554, "grad_norm": 1.046875, "learning_rate": 0.0004998938218645149, "loss": 7.0506, "mean_token_accuracy": 0.10170819535851479, "num_tokens": 4146412.0, "step": 1905 }, { "entropy": 7.029837560653687, "epoch": 0.20439830916581947, "grad_norm": 0.91796875, "learning_rate": 0.0004998926441731215, "loss": 7.0512, "mean_token_accuracy": 0.1002343863248825, "num_tokens": 4157592.0, "step": 1910 }, { "entropy": 7.06212477684021, "epoch": 0.2049333832735834, "grad_norm": 0.95703125, "learning_rate": 0.0004998914599879845, "loss": 7.0269, "mean_token_accuracy": 0.09835589304566383, "num_tokens": 4168637.0, "step": 1915 }, { "entropy": 7.0664630889892575, "epoch": 0.2054684573813473, "grad_norm": 0.96875, "learning_rate": 0.0004998902693091382, "loss": 7.0736, "mean_token_accuracy": 0.09925776198506356, "num_tokens": 4179951.0, "step": 1920 }, { "entropy": 7.0451087474823, "epoch": 0.20600353148911124, "grad_norm": 0.96875, "learning_rate": 0.0004998890721366171, "loss": 6.9616, "mean_token_accuracy": 0.10666931569576263, "num_tokens": 4189895.0, "step": 1925 }, { "entropy": 7.097507953643799, "epoch": 0.20653860559687517, "grad_norm": 1.0234375, "learning_rate": 0.0004998878684704556, "loss": 7.0214, "mean_token_accuracy": 0.10524726510047913, "num_tokens": 4199796.0, "step": 1930 }, { "entropy": 7.036600160598755, "epoch": 0.20707367970463908, "grad_norm": 1.0234375, "learning_rate": 0.0004998866583106884, "loss": 7.0461, "mean_token_accuracy": 0.09883956611156464, "num_tokens": 4210428.0, "step": 1935 }, { "entropy": 7.218980216979981, "epoch": 0.207608753812403, "grad_norm": 1.0078125, "learning_rate": 0.0004998854416573506, "loss": 7.1246, "mean_token_accuracy": 0.10078881680965424, "num_tokens": 4221515.0, "step": 1940 }, { "entropy": 7.1100975513458256, "epoch": 0.20814382792016695, "grad_norm": 1.0390625, "learning_rate": 0.0004998842185104772, "loss": 7.1387, "mean_token_accuracy": 0.09548087790608406, "num_tokens": 4232580.0, "step": 1945 }, { "entropy": 7.041958284378052, "epoch": 0.20867890202793088, "grad_norm": 0.96875, "learning_rate": 0.0004998829888701036, "loss": 7.0484, "mean_token_accuracy": 0.10664152652025223, "num_tokens": 4242871.0, "step": 1950 }, { "entropy": 7.147633504867554, "epoch": 0.20921397613569478, "grad_norm": 0.97265625, "learning_rate": 0.0004998817527362654, "loss": 7.0773, "mean_token_accuracy": 0.09752313494682312, "num_tokens": 4253419.0, "step": 1955 }, { "entropy": 7.032255792617798, "epoch": 0.20974905024345872, "grad_norm": 0.93359375, "learning_rate": 0.0004998805101089982, "loss": 7.0528, "mean_token_accuracy": 0.10345240533351899, "num_tokens": 4264327.0, "step": 1960 }, { "entropy": 7.170184564590454, "epoch": 0.21028412435122265, "grad_norm": 0.91796875, "learning_rate": 0.0004998792609883378, "loss": 7.0428, "mean_token_accuracy": 0.10343464836478233, "num_tokens": 4274568.0, "step": 1965 }, { "entropy": 7.056762933731079, "epoch": 0.21081919845898656, "grad_norm": 1.171875, "learning_rate": 0.0004998780053743203, "loss": 7.0324, "mean_token_accuracy": 0.10682544857263565, "num_tokens": 4284895.0, "step": 1970 }, { "entropy": 7.12225079536438, "epoch": 0.2113542725667505, "grad_norm": 0.953125, "learning_rate": 0.0004998767432669822, "loss": 7.0637, "mean_token_accuracy": 0.0994573712348938, "num_tokens": 4297258.0, "step": 1975 }, { "entropy": 7.026572132110596, "epoch": 0.21188934667451442, "grad_norm": 0.9921875, "learning_rate": 0.0004998754746663595, "loss": 6.9842, "mean_token_accuracy": 0.10585973560810089, "num_tokens": 4308307.0, "step": 1980 }, { "entropy": 7.050811910629273, "epoch": 0.21242442078227836, "grad_norm": 0.9296875, "learning_rate": 0.0004998741995724892, "loss": 7.0491, "mean_token_accuracy": 0.10263351649045944, "num_tokens": 4318801.0, "step": 1985 }, { "entropy": 7.070459413528442, "epoch": 0.21295949489004226, "grad_norm": 0.984375, "learning_rate": 0.0004998729179854079, "loss": 7.0252, "mean_token_accuracy": 0.10016985535621643, "num_tokens": 4329531.0, "step": 1990 }, { "entropy": 7.054882478713989, "epoch": 0.2134945689978062, "grad_norm": 0.91796875, "learning_rate": 0.0004998716299051527, "loss": 7.0253, "mean_token_accuracy": 0.10470812693238259, "num_tokens": 4341203.0, "step": 1995 }, { "entropy": 7.026881456375122, "epoch": 0.21402964310557013, "grad_norm": 0.98046875, "learning_rate": 0.0004998703353317609, "loss": 7.0788, "mean_token_accuracy": 0.0973646655678749, "num_tokens": 4352426.0, "step": 2000 }, { "entropy": 7.11639552116394, "epoch": 0.21456471721333403, "grad_norm": 0.94140625, "learning_rate": 0.0004998690342652697, "loss": 7.0103, "mean_token_accuracy": 0.10563170909881592, "num_tokens": 4363413.0, "step": 2005 }, { "entropy": 7.054438829421997, "epoch": 0.21509979132109797, "grad_norm": 0.890625, "learning_rate": 0.0004998677267057166, "loss": 6.951, "mean_token_accuracy": 0.10644056648015976, "num_tokens": 4373470.0, "step": 2010 }, { "entropy": 6.9533806324005125, "epoch": 0.2156348654288619, "grad_norm": 1.015625, "learning_rate": 0.0004998664126531397, "loss": 7.0164, "mean_token_accuracy": 0.10371329113841057, "num_tokens": 4384438.0, "step": 2015 }, { "entropy": 7.1470112800598145, "epoch": 0.21616993953662583, "grad_norm": 0.953125, "learning_rate": 0.0004998650921075766, "loss": 6.9978, "mean_token_accuracy": 0.10406329333782197, "num_tokens": 4395100.0, "step": 2020 }, { "entropy": 6.9813416481018065, "epoch": 0.21670501364438974, "grad_norm": 0.90234375, "learning_rate": 0.0004998637650690656, "loss": 7.1179, "mean_token_accuracy": 0.09519804865121842, "num_tokens": 4407131.0, "step": 2025 }, { "entropy": 7.10913496017456, "epoch": 0.21724008775215367, "grad_norm": 1.046875, "learning_rate": 0.000499862431537645, "loss": 6.9569, "mean_token_accuracy": 0.10057392492890357, "num_tokens": 4417701.0, "step": 2030 }, { "entropy": 6.981591272354126, "epoch": 0.2177751618599176, "grad_norm": 1.109375, "learning_rate": 0.0004998610915133533, "loss": 7.0173, "mean_token_accuracy": 0.10014636293053628, "num_tokens": 4429309.0, "step": 2035 }, { "entropy": 7.007551097869873, "epoch": 0.21831023596768154, "grad_norm": 0.9375, "learning_rate": 0.0004998597449962292, "loss": 7.0663, "mean_token_accuracy": 0.10122283399105073, "num_tokens": 4440850.0, "step": 2040 }, { "entropy": 7.092380857467651, "epoch": 0.21884531007544544, "grad_norm": 0.953125, "learning_rate": 0.0004998583919863115, "loss": 7.0501, "mean_token_accuracy": 0.09975898936390877, "num_tokens": 4451995.0, "step": 2045 }, { "entropy": 6.99484076499939, "epoch": 0.21938038418320938, "grad_norm": 1.046875, "learning_rate": 0.0004998570324836393, "loss": 6.959, "mean_token_accuracy": 0.10816834419965744, "num_tokens": 4461916.0, "step": 2050 }, { "entropy": 7.084143257141113, "epoch": 0.2199154582909733, "grad_norm": 1.0546875, "learning_rate": 0.000499855666488252, "loss": 7.0571, "mean_token_accuracy": 0.10147327557206154, "num_tokens": 4471603.0, "step": 2055 }, { "entropy": 7.105906391143799, "epoch": 0.22045053239873721, "grad_norm": 0.98046875, "learning_rate": 0.0004998542940001889, "loss": 7.083, "mean_token_accuracy": 0.10265670791268348, "num_tokens": 4483166.0, "step": 2060 }, { "entropy": 7.020576333999633, "epoch": 0.22098560650650115, "grad_norm": 1.0, "learning_rate": 0.0004998529150194895, "loss": 7.0022, "mean_token_accuracy": 0.09936799854040146, "num_tokens": 4493824.0, "step": 2065 }, { "entropy": 7.097088718414307, "epoch": 0.22152068061426508, "grad_norm": 0.953125, "learning_rate": 0.0004998515295461939, "loss": 6.9225, "mean_token_accuracy": 0.1188635177910328, "num_tokens": 4505674.0, "step": 2070 }, { "entropy": 6.968977689743042, "epoch": 0.22205575472202901, "grad_norm": 0.97265625, "learning_rate": 0.000499850137580342, "loss": 7.0049, "mean_token_accuracy": 0.10718596279621125, "num_tokens": 4516516.0, "step": 2075 }, { "entropy": 7.039025449752808, "epoch": 0.22259082882979292, "grad_norm": 1.0859375, "learning_rate": 0.0004998487391219739, "loss": 6.9963, "mean_token_accuracy": 0.09949744194746017, "num_tokens": 4527811.0, "step": 2080 }, { "entropy": 7.0311308860778805, "epoch": 0.22312590293755685, "grad_norm": 0.88671875, "learning_rate": 0.0004998473341711301, "loss": 6.9388, "mean_token_accuracy": 0.09995686337351799, "num_tokens": 4538988.0, "step": 2085 }, { "entropy": 7.018882703781128, "epoch": 0.22366097704532079, "grad_norm": 1.03125, "learning_rate": 0.0004998459227278512, "loss": 6.9733, "mean_token_accuracy": 0.1059156596660614, "num_tokens": 4550049.0, "step": 2090 }, { "entropy": 7.072498369216919, "epoch": 0.2241960511530847, "grad_norm": 1.0625, "learning_rate": 0.0004998445047921777, "loss": 7.0719, "mean_token_accuracy": 0.10480737760663032, "num_tokens": 4559784.0, "step": 2095 }, { "entropy": 7.031924390792847, "epoch": 0.22473112526084862, "grad_norm": 1.0625, "learning_rate": 0.0004998430803641509, "loss": 6.9337, "mean_token_accuracy": 0.10361162722110748, "num_tokens": 4569982.0, "step": 2100 }, { "entropy": 6.939174699783325, "epoch": 0.22526619936861256, "grad_norm": 0.93359375, "learning_rate": 0.0004998416494438118, "loss": 6.9534, "mean_token_accuracy": 0.10496753230690956, "num_tokens": 4581117.0, "step": 2105 }, { "entropy": 7.033869123458862, "epoch": 0.2258012734763765, "grad_norm": 1.109375, "learning_rate": 0.0004998402120312014, "loss": 7.0198, "mean_token_accuracy": 0.10706626474857331, "num_tokens": 4592012.0, "step": 2110 }, { "entropy": 7.034424209594727, "epoch": 0.2263363475841404, "grad_norm": 0.96875, "learning_rate": 0.0004998387681263616, "loss": 7.0581, "mean_token_accuracy": 0.10076023638248444, "num_tokens": 4602591.0, "step": 2115 }, { "entropy": 7.038776493072509, "epoch": 0.22687142169190433, "grad_norm": 1.015625, "learning_rate": 0.000499837317729334, "loss": 6.985, "mean_token_accuracy": 0.10343138575553894, "num_tokens": 4613418.0, "step": 2120 }, { "entropy": 6.944168281555176, "epoch": 0.22740649579966826, "grad_norm": 0.90625, "learning_rate": 0.0004998358608401603, "loss": 6.9051, "mean_token_accuracy": 0.11338085606694222, "num_tokens": 4625156.0, "step": 2125 }, { "entropy": 7.1117607116699215, "epoch": 0.22794156990743217, "grad_norm": 0.94140625, "learning_rate": 0.000499834397458883, "loss": 6.937, "mean_token_accuracy": 0.10821644887328148, "num_tokens": 4634523.0, "step": 2130 }, { "entropy": 6.958322238922119, "epoch": 0.2284766440151961, "grad_norm": 1.0, "learning_rate": 0.0004998329275855438, "loss": 6.929, "mean_token_accuracy": 0.11250298544764518, "num_tokens": 4646292.0, "step": 2135 }, { "entropy": 6.985101842880249, "epoch": 0.22901171812296003, "grad_norm": 0.984375, "learning_rate": 0.0004998314512201855, "loss": 6.9099, "mean_token_accuracy": 0.10238043665885925, "num_tokens": 4656417.0, "step": 2140 }, { "entropy": 6.924033832550049, "epoch": 0.22954679223072397, "grad_norm": 1.0703125, "learning_rate": 0.0004998299683628507, "loss": 6.9282, "mean_token_accuracy": 0.10534189045429229, "num_tokens": 4666933.0, "step": 2145 }, { "entropy": 7.059316158294678, "epoch": 0.23008186633848787, "grad_norm": 0.9765625, "learning_rate": 0.0004998284790135821, "loss": 7.1084, "mean_token_accuracy": 0.09782184064388275, "num_tokens": 4678482.0, "step": 2150 }, { "entropy": 7.053033971786499, "epoch": 0.2306169404462518, "grad_norm": 1.0703125, "learning_rate": 0.0004998269831724228, "loss": 6.9481, "mean_token_accuracy": 0.1064787782728672, "num_tokens": 4688454.0, "step": 2155 }, { "entropy": 6.9519795894622805, "epoch": 0.23115201455401574, "grad_norm": 1.0234375, "learning_rate": 0.0004998254808394159, "loss": 6.9839, "mean_token_accuracy": 0.1061179980635643, "num_tokens": 4699545.0, "step": 2160 }, { "entropy": 7.083680486679077, "epoch": 0.23168708866177964, "grad_norm": 0.85546875, "learning_rate": 0.0004998239720146048, "loss": 6.9986, "mean_token_accuracy": 0.10272667407989503, "num_tokens": 4711149.0, "step": 2165 }, { "entropy": 6.961511278152466, "epoch": 0.23222216276954358, "grad_norm": 0.9453125, "learning_rate": 0.0004998224566980332, "loss": 6.9935, "mean_token_accuracy": 0.10200226753950119, "num_tokens": 4722651.0, "step": 2170 }, { "entropy": 7.031105852127075, "epoch": 0.2327572368773075, "grad_norm": 1.046875, "learning_rate": 0.0004998209348897447, "loss": 6.9926, "mean_token_accuracy": 0.09458313658833503, "num_tokens": 4733883.0, "step": 2175 }, { "entropy": 7.135159015655518, "epoch": 0.23329231098507144, "grad_norm": 0.98046875, "learning_rate": 0.0004998194065897833, "loss": 6.955, "mean_token_accuracy": 0.10691621899604797, "num_tokens": 4744517.0, "step": 2180 }, { "entropy": 6.9776819229125975, "epoch": 0.23382738509283535, "grad_norm": 1.0390625, "learning_rate": 0.000499817871798193, "loss": 6.9804, "mean_token_accuracy": 0.11214952319860458, "num_tokens": 4755481.0, "step": 2185 }, { "entropy": 6.972070980072021, "epoch": 0.23436245920059928, "grad_norm": 1.1171875, "learning_rate": 0.0004998163305150185, "loss": 6.9039, "mean_token_accuracy": 0.11068079173564911, "num_tokens": 4765535.0, "step": 2190 }, { "entropy": 6.973287200927734, "epoch": 0.23489753330836322, "grad_norm": 0.98828125, "learning_rate": 0.0004998147827403038, "loss": 7.0273, "mean_token_accuracy": 0.10471541583538055, "num_tokens": 4777045.0, "step": 2195 }, { "entropy": 7.077732086181641, "epoch": 0.23543260741612712, "grad_norm": 0.9921875, "learning_rate": 0.000499813228474094, "loss": 6.9064, "mean_token_accuracy": 0.10825864002108573, "num_tokens": 4787958.0, "step": 2200 }, { "entropy": 6.917084503173828, "epoch": 0.23596768152389105, "grad_norm": 0.953125, "learning_rate": 0.0004998116677164338, "loss": 6.9445, "mean_token_accuracy": 0.10730226412415504, "num_tokens": 4798502.0, "step": 2205 }, { "entropy": 6.931448936462402, "epoch": 0.236502755631655, "grad_norm": 0.9921875, "learning_rate": 0.0004998101004673682, "loss": 6.9413, "mean_token_accuracy": 0.11088823229074478, "num_tokens": 4809179.0, "step": 2210 }, { "entropy": 7.135161733627319, "epoch": 0.23703782973941892, "grad_norm": 1.015625, "learning_rate": 0.0004998085267269426, "loss": 7.0215, "mean_token_accuracy": 0.09467339664697647, "num_tokens": 4819803.0, "step": 2215 }, { "entropy": 7.004361200332641, "epoch": 0.23757290384718283, "grad_norm": 0.96875, "learning_rate": 0.0004998069464952025, "loss": 6.9916, "mean_token_accuracy": 0.10000614672899247, "num_tokens": 4831226.0, "step": 2220 }, { "entropy": 7.049906778335571, "epoch": 0.23810797795494676, "grad_norm": 0.9453125, "learning_rate": 0.0004998053597721932, "loss": 7.0124, "mean_token_accuracy": 0.10538152158260346, "num_tokens": 4842168.0, "step": 2225 }, { "entropy": 7.019608783721924, "epoch": 0.2386430520627107, "grad_norm": 0.94140625, "learning_rate": 0.0004998037665579608, "loss": 6.9621, "mean_token_accuracy": 0.10858180820941925, "num_tokens": 4852655.0, "step": 2230 }, { "entropy": 6.915230321884155, "epoch": 0.2391781261704746, "grad_norm": 0.95703125, "learning_rate": 0.0004998021668525513, "loss": 6.8626, "mean_token_accuracy": 0.10984659045934678, "num_tokens": 4862164.0, "step": 2235 }, { "entropy": 7.046167945861816, "epoch": 0.23971320027823853, "grad_norm": 0.9609375, "learning_rate": 0.0004998005606560107, "loss": 6.9964, "mean_token_accuracy": 0.10990610420703888, "num_tokens": 4874233.0, "step": 2240 }, { "entropy": 6.992388391494751, "epoch": 0.24024827438600246, "grad_norm": 0.953125, "learning_rate": 0.0004997989479683856, "loss": 6.9876, "mean_token_accuracy": 0.1066631942987442, "num_tokens": 4885948.0, "step": 2245 }, { "entropy": 6.963246202468872, "epoch": 0.2407833484937664, "grad_norm": 0.90234375, "learning_rate": 0.0004997973287897224, "loss": 6.9667, "mean_token_accuracy": 0.10817388147115707, "num_tokens": 4897128.0, "step": 2250 }, { "entropy": 6.980781888961792, "epoch": 0.2413184226015303, "grad_norm": 0.98828125, "learning_rate": 0.0004997957031200681, "loss": 6.939, "mean_token_accuracy": 0.11121672838926315, "num_tokens": 4907699.0, "step": 2255 }, { "entropy": 6.887354183197021, "epoch": 0.24185349670929424, "grad_norm": 0.984375, "learning_rate": 0.0004997940709594692, "loss": 6.8796, "mean_token_accuracy": 0.10674800127744674, "num_tokens": 4918772.0, "step": 2260 }, { "entropy": 7.091795778274536, "epoch": 0.24238857081705817, "grad_norm": 1.078125, "learning_rate": 0.0004997924323079733, "loss": 6.9368, "mean_token_accuracy": 0.10729291215538979, "num_tokens": 4930046.0, "step": 2265 }, { "entropy": 6.9101183891296385, "epoch": 0.24292364492482207, "grad_norm": 1.078125, "learning_rate": 0.0004997907871656273, "loss": 6.9568, "mean_token_accuracy": 0.10801581889390946, "num_tokens": 4940609.0, "step": 2270 }, { "entropy": 7.002806997299194, "epoch": 0.243458719032586, "grad_norm": 1.0, "learning_rate": 0.0004997891355324791, "loss": 6.9658, "mean_token_accuracy": 0.10598139539361, "num_tokens": 4951339.0, "step": 2275 }, { "entropy": 6.983994722366333, "epoch": 0.24399379314034994, "grad_norm": 0.9921875, "learning_rate": 0.0004997874774085761, "loss": 6.878, "mean_token_accuracy": 0.10262224972248077, "num_tokens": 4961083.0, "step": 2280 }, { "entropy": 6.895718050003052, "epoch": 0.24452886724811387, "grad_norm": 1.0859375, "learning_rate": 0.0004997858127939662, "loss": 6.8908, "mean_token_accuracy": 0.10761211439967155, "num_tokens": 4971399.0, "step": 2285 }, { "entropy": 7.041612005233764, "epoch": 0.24506394135587778, "grad_norm": 0.99609375, "learning_rate": 0.0004997841416886976, "loss": 6.9715, "mean_token_accuracy": 0.1061974436044693, "num_tokens": 4982429.0, "step": 2290 }, { "entropy": 7.0298323154449465, "epoch": 0.2455990154636417, "grad_norm": 1.0234375, "learning_rate": 0.0004997824640928186, "loss": 7.0184, "mean_token_accuracy": 0.10754595324397087, "num_tokens": 4993706.0, "step": 2295 }, { "entropy": 6.988226366043091, "epoch": 0.24613408957140565, "grad_norm": 0.97265625, "learning_rate": 0.0004997807800063774, "loss": 6.9127, "mean_token_accuracy": 0.10858980864286423, "num_tokens": 5005411.0, "step": 2300 }, { "entropy": 7.023472309112549, "epoch": 0.24666916367916958, "grad_norm": 0.97265625, "learning_rate": 0.000499779089429423, "loss": 7.0413, "mean_token_accuracy": 0.10208934471011162, "num_tokens": 5016011.0, "step": 2305 }, { "entropy": 7.013689231872559, "epoch": 0.24720423778693348, "grad_norm": 0.91015625, "learning_rate": 0.0004997773923620037, "loss": 6.9954, "mean_token_accuracy": 0.10329191759228706, "num_tokens": 5027841.0, "step": 2310 }, { "entropy": 7.100406980514526, "epoch": 0.24773931189469742, "grad_norm": 0.95703125, "learning_rate": 0.0004997756888041689, "loss": 6.9853, "mean_token_accuracy": 0.09798330888152122, "num_tokens": 5038640.0, "step": 2315 }, { "entropy": 6.95166802406311, "epoch": 0.24827438600246135, "grad_norm": 1.0, "learning_rate": 0.0004997739787559677, "loss": 6.9356, "mean_token_accuracy": 0.10357877835631371, "num_tokens": 5050423.0, "step": 2320 }, { "entropy": 6.978884506225586, "epoch": 0.24880946011022526, "grad_norm": 1.140625, "learning_rate": 0.0004997722622174494, "loss": 6.954, "mean_token_accuracy": 0.10356095060706139, "num_tokens": 5060654.0, "step": 2325 }, { "entropy": 6.934212970733642, "epoch": 0.2493445342179892, "grad_norm": 1.015625, "learning_rate": 0.0004997705391886636, "loss": 6.8582, "mean_token_accuracy": 0.11322998628020287, "num_tokens": 5070165.0, "step": 2330 }, { "entropy": 6.913174200057983, "epoch": 0.24987960832575312, "grad_norm": 1.0, "learning_rate": 0.0004997688096696601, "loss": 6.8995, "mean_token_accuracy": 0.10103722065687179, "num_tokens": 5080937.0, "step": 2335 }, { "entropy": 6.911728572845459, "epoch": 0.25041468243351706, "grad_norm": 0.96484375, "learning_rate": 0.0004997670736604888, "loss": 6.8744, "mean_token_accuracy": 0.11288927420973778, "num_tokens": 5090955.0, "step": 2340 }, { "entropy": 7.074804210662842, "epoch": 0.250949756541281, "grad_norm": 0.96484375, "learning_rate": 0.0004997653311611998, "loss": 7.0112, "mean_token_accuracy": 0.09920887500047684, "num_tokens": 5102201.0, "step": 2345 }, { "entropy": 7.0164875984191895, "epoch": 0.25148483064904487, "grad_norm": 1.0390625, "learning_rate": 0.0004997635821718435, "loss": 6.9312, "mean_token_accuracy": 0.11026841551065444, "num_tokens": 5112235.0, "step": 2350 }, { "entropy": 6.8925614833831785, "epoch": 0.2520199047568088, "grad_norm": 1.40625, "learning_rate": 0.0004997618266924704, "loss": 6.8219, "mean_token_accuracy": 0.10299434512853622, "num_tokens": 5122360.0, "step": 2355 }, { "entropy": 7.002241230010986, "epoch": 0.25255497886457273, "grad_norm": 1.015625, "learning_rate": 0.000499760064723131, "loss": 6.9801, "mean_token_accuracy": 0.1024145670235157, "num_tokens": 5133084.0, "step": 2360 }, { "entropy": 6.938703870773315, "epoch": 0.25309005297233667, "grad_norm": 0.98046875, "learning_rate": 0.0004997582962638764, "loss": 6.9133, "mean_token_accuracy": 0.09837969020009041, "num_tokens": 5144495.0, "step": 2365 }, { "entropy": 7.031873512268066, "epoch": 0.2536251270801006, "grad_norm": 1.0, "learning_rate": 0.0004997565213147575, "loss": 6.9238, "mean_token_accuracy": 0.10646962001919746, "num_tokens": 5154824.0, "step": 2370 }, { "entropy": 6.939056253433227, "epoch": 0.25416020118786453, "grad_norm": 1.03125, "learning_rate": 0.0004997547398758257, "loss": 6.9111, "mean_token_accuracy": 0.10193499475717545, "num_tokens": 5165061.0, "step": 2375 }, { "entropy": 6.981441783905029, "epoch": 0.25469527529562846, "grad_norm": 1.0, "learning_rate": 0.0004997529519471323, "loss": 6.8679, "mean_token_accuracy": 0.11417916044592857, "num_tokens": 5174964.0, "step": 2380 }, { "entropy": 6.884857940673828, "epoch": 0.25523034940339234, "grad_norm": 1.0859375, "learning_rate": 0.0004997511575287291, "loss": 6.9267, "mean_token_accuracy": 0.10812475010752678, "num_tokens": 5185458.0, "step": 2385 }, { "entropy": 6.991512250900269, "epoch": 0.2557654235111563, "grad_norm": 1.03125, "learning_rate": 0.0004997493566206677, "loss": 6.9025, "mean_token_accuracy": 0.10954718366265297, "num_tokens": 5196193.0, "step": 2390 }, { "entropy": 6.966927862167358, "epoch": 0.2563004976189202, "grad_norm": 0.94140625, "learning_rate": 0.0004997475492230003, "loss": 7.0198, "mean_token_accuracy": 0.09881971776485443, "num_tokens": 5208541.0, "step": 2395 }, { "entropy": 6.989241456985473, "epoch": 0.25683557172668414, "grad_norm": 1.0234375, "learning_rate": 0.000499745735335779, "loss": 6.8501, "mean_token_accuracy": 0.10620964914560319, "num_tokens": 5218567.0, "step": 2400 }, { "entropy": 6.943647241592407, "epoch": 0.2573706458344481, "grad_norm": 0.97265625, "learning_rate": 0.0004997439149590561, "loss": 6.9666, "mean_token_accuracy": 0.10247603580355644, "num_tokens": 5228293.0, "step": 2405 }, { "entropy": 6.982013940811157, "epoch": 0.257905719942212, "grad_norm": 1.09375, "learning_rate": 0.0004997420880928843, "loss": 6.913, "mean_token_accuracy": 0.10574470162391662, "num_tokens": 5238880.0, "step": 2410 }, { "entropy": 6.9576988697052, "epoch": 0.25844079404997594, "grad_norm": 0.98046875, "learning_rate": 0.0004997402547373162, "loss": 6.9947, "mean_token_accuracy": 0.10212295204401016, "num_tokens": 5250104.0, "step": 2415 }, { "entropy": 7.100748538970947, "epoch": 0.2589758681577399, "grad_norm": 0.94921875, "learning_rate": 0.0004997384148924049, "loss": 7.0243, "mean_token_accuracy": 0.10289878994226456, "num_tokens": 5260355.0, "step": 2420 }, { "entropy": 6.962227201461792, "epoch": 0.25951094226550375, "grad_norm": 1.0078125, "learning_rate": 0.0004997365685582035, "loss": 6.9296, "mean_token_accuracy": 0.10283196046948433, "num_tokens": 5272117.0, "step": 2425 }, { "entropy": 6.9883177280426025, "epoch": 0.2600460163732677, "grad_norm": 0.890625, "learning_rate": 0.0004997347157347651, "loss": 7.0307, "mean_token_accuracy": 0.10037739872932434, "num_tokens": 5284583.0, "step": 2430 }, { "entropy": 7.049625587463379, "epoch": 0.2605810904810316, "grad_norm": 0.93359375, "learning_rate": 0.0004997328564221435, "loss": 6.8241, "mean_token_accuracy": 0.12059795558452606, "num_tokens": 5295846.0, "step": 2435 }, { "entropy": 6.871410655975342, "epoch": 0.26111616458879555, "grad_norm": 0.91796875, "learning_rate": 0.0004997309906203922, "loss": 6.9662, "mean_token_accuracy": 0.10526571422815323, "num_tokens": 5307802.0, "step": 2440 }, { "entropy": 7.033421468734741, "epoch": 0.2616512386965595, "grad_norm": 1.046875, "learning_rate": 0.0004997291183295652, "loss": 6.8913, "mean_token_accuracy": 0.10737156346440316, "num_tokens": 5318263.0, "step": 2445 }, { "entropy": 6.998748159408569, "epoch": 0.2621863128043234, "grad_norm": 0.98046875, "learning_rate": 0.0004997272395497164, "loss": 6.9388, "mean_token_accuracy": 0.10455406904220581, "num_tokens": 5328555.0, "step": 2450 }, { "entropy": 6.912611675262451, "epoch": 0.26272138691208735, "grad_norm": 0.96484375, "learning_rate": 0.0004997253542809002, "loss": 6.9152, "mean_token_accuracy": 0.10682450905442238, "num_tokens": 5339954.0, "step": 2455 }, { "entropy": 7.079062366485596, "epoch": 0.26325646101985123, "grad_norm": 0.984375, "learning_rate": 0.0004997234625231709, "loss": 6.9637, "mean_token_accuracy": 0.10808332860469819, "num_tokens": 5350919.0, "step": 2460 }, { "entropy": 6.93997278213501, "epoch": 0.26379153512761516, "grad_norm": 0.91015625, "learning_rate": 0.0004997215642765832, "loss": 6.925, "mean_token_accuracy": 0.10664721727371215, "num_tokens": 5361844.0, "step": 2465 }, { "entropy": 6.987752532958984, "epoch": 0.2643266092353791, "grad_norm": 0.95703125, "learning_rate": 0.000499719659541192, "loss": 6.9562, "mean_token_accuracy": 0.10334968268871307, "num_tokens": 5372026.0, "step": 2470 }, { "entropy": 6.954167985916138, "epoch": 0.26486168334314303, "grad_norm": 0.890625, "learning_rate": 0.0004997177483170521, "loss": 6.9927, "mean_token_accuracy": 0.10936494544148445, "num_tokens": 5382965.0, "step": 2475 }, { "entropy": 7.007135391235352, "epoch": 0.26539675745090696, "grad_norm": 1.0390625, "learning_rate": 0.0004997158306042188, "loss": 6.9458, "mean_token_accuracy": 0.10711643844842911, "num_tokens": 5393738.0, "step": 2480 }, { "entropy": 6.897781848907471, "epoch": 0.2659318315586709, "grad_norm": 1.0625, "learning_rate": 0.0004997139064027476, "loss": 6.8237, "mean_token_accuracy": 0.1119477018713951, "num_tokens": 5404059.0, "step": 2485 }, { "entropy": 6.912676382064819, "epoch": 0.26646690566643483, "grad_norm": 1.046875, "learning_rate": 0.0004997119757126938, "loss": 6.855, "mean_token_accuracy": 0.10871710032224655, "num_tokens": 5414152.0, "step": 2490 }, { "entropy": 7.022440433502197, "epoch": 0.2670019797741987, "grad_norm": 1.015625, "learning_rate": 0.0004997100385341133, "loss": 7.0235, "mean_token_accuracy": 0.10726772770285606, "num_tokens": 5425227.0, "step": 2495 }, { "entropy": 7.004488468170166, "epoch": 0.26753705388196264, "grad_norm": 0.98828125, "learning_rate": 0.0004997080948670621, "loss": 6.8663, "mean_token_accuracy": 0.11122208759188652, "num_tokens": 5435716.0, "step": 2500 }, { "entropy": 6.936031723022461, "epoch": 0.26807212798972657, "grad_norm": 0.9609375, "learning_rate": 0.0004997061447115962, "loss": 6.9347, "mean_token_accuracy": 0.10375397354364395, "num_tokens": 5446519.0, "step": 2505 }, { "entropy": 6.975105237960816, "epoch": 0.2686072020974905, "grad_norm": 1.0078125, "learning_rate": 0.0004997041880677719, "loss": 6.925, "mean_token_accuracy": 0.10548185482621193, "num_tokens": 5457496.0, "step": 2510 }, { "entropy": 6.880755996704101, "epoch": 0.26914227620525444, "grad_norm": 1.1171875, "learning_rate": 0.0004997022249356457, "loss": 6.823, "mean_token_accuracy": 0.11008255481719971, "num_tokens": 5469059.0, "step": 2515 }, { "entropy": 6.923517560958862, "epoch": 0.26967735031301837, "grad_norm": 1.3203125, "learning_rate": 0.0004997002553152745, "loss": 6.9138, "mean_token_accuracy": 0.10938023030757904, "num_tokens": 5480324.0, "step": 2520 }, { "entropy": 6.9742035388946535, "epoch": 0.2702124244207823, "grad_norm": 0.98828125, "learning_rate": 0.0004996982792067148, "loss": 6.9339, "mean_token_accuracy": 0.09864719212055206, "num_tokens": 5491513.0, "step": 2525 }, { "entropy": 6.8970160484313965, "epoch": 0.2707474985285462, "grad_norm": 0.95703125, "learning_rate": 0.000499696296610024, "loss": 6.8394, "mean_token_accuracy": 0.1051232136785984, "num_tokens": 5502414.0, "step": 2530 }, { "entropy": 6.9252660274505615, "epoch": 0.2712825726363101, "grad_norm": 0.94140625, "learning_rate": 0.0004996943075252592, "loss": 6.9715, "mean_token_accuracy": 0.1062911570072174, "num_tokens": 5512962.0, "step": 2535 }, { "entropy": 6.977799654006958, "epoch": 0.27181764674407405, "grad_norm": 0.9609375, "learning_rate": 0.0004996923119524777, "loss": 6.8355, "mean_token_accuracy": 0.10766077339649201, "num_tokens": 5524648.0, "step": 2540 }, { "entropy": 6.855292940139771, "epoch": 0.272352720851838, "grad_norm": 1.0078125, "learning_rate": 0.0004996903098917375, "loss": 6.9214, "mean_token_accuracy": 0.0998130515217781, "num_tokens": 5536158.0, "step": 2545 }, { "entropy": 6.939780187606812, "epoch": 0.2728877949596019, "grad_norm": 1.0078125, "learning_rate": 0.000499688301343096, "loss": 6.8405, "mean_token_accuracy": 0.10747457072138786, "num_tokens": 5547374.0, "step": 2550 }, { "entropy": 7.020946025848389, "epoch": 0.27342286906736585, "grad_norm": 1.0, "learning_rate": 0.0004996862863066114, "loss": 6.9137, "mean_token_accuracy": 0.10850636437535285, "num_tokens": 5559212.0, "step": 2555 }, { "entropy": 6.907329320907593, "epoch": 0.2739579431751298, "grad_norm": 1.078125, "learning_rate": 0.0004996842647823419, "loss": 6.8823, "mean_token_accuracy": 0.10653341263532638, "num_tokens": 5569302.0, "step": 2560 }, { "entropy": 6.910869598388672, "epoch": 0.27449301728289366, "grad_norm": 1.140625, "learning_rate": 0.0004996822367703458, "loss": 6.8905, "mean_token_accuracy": 0.10348111093044281, "num_tokens": 5581688.0, "step": 2565 }, { "entropy": 6.955097198486328, "epoch": 0.2750280913906576, "grad_norm": 1.1328125, "learning_rate": 0.0004996802022706817, "loss": 6.8211, "mean_token_accuracy": 0.10833865478634834, "num_tokens": 5591376.0, "step": 2570 }, { "entropy": 6.861729669570923, "epoch": 0.2755631654984215, "grad_norm": 1.046875, "learning_rate": 0.0004996781612834083, "loss": 6.8798, "mean_token_accuracy": 0.10732169449329376, "num_tokens": 5601510.0, "step": 2575 }, { "entropy": 7.005447006225586, "epoch": 0.27609823960618546, "grad_norm": 1.1484375, "learning_rate": 0.0004996761138085846, "loss": 6.9316, "mean_token_accuracy": 0.1021797627210617, "num_tokens": 5611436.0, "step": 2580 }, { "entropy": 6.92574257850647, "epoch": 0.2766333137139494, "grad_norm": 1.21875, "learning_rate": 0.0004996740598462697, "loss": 6.9341, "mean_token_accuracy": 0.10267650112509727, "num_tokens": 5620470.0, "step": 2585 }, { "entropy": 6.860880899429321, "epoch": 0.2771683878217133, "grad_norm": 1.0234375, "learning_rate": 0.0004996719993965229, "loss": 6.8297, "mean_token_accuracy": 0.10769467577338218, "num_tokens": 5630740.0, "step": 2590 }, { "entropy": 6.8753687858581545, "epoch": 0.27770346192947726, "grad_norm": 1.0546875, "learning_rate": 0.0004996699324594036, "loss": 6.8303, "mean_token_accuracy": 0.11734023317694664, "num_tokens": 5641138.0, "step": 2595 }, { "entropy": 6.985844898223877, "epoch": 0.27823853603724114, "grad_norm": 0.9921875, "learning_rate": 0.0004996678590349717, "loss": 6.974, "mean_token_accuracy": 0.1085183672606945, "num_tokens": 5652474.0, "step": 2600 }, { "entropy": 6.9662446022033695, "epoch": 0.27877361014500507, "grad_norm": 1.0390625, "learning_rate": 0.0004996657791232868, "loss": 6.8709, "mean_token_accuracy": 0.11153203919529915, "num_tokens": 5663178.0, "step": 2605 }, { "entropy": 6.891348218917846, "epoch": 0.279308684252769, "grad_norm": 1.1171875, "learning_rate": 0.0004996636927244092, "loss": 6.8963, "mean_token_accuracy": 0.10582477301359176, "num_tokens": 5673565.0, "step": 2610 }, { "entropy": 7.040777587890625, "epoch": 0.27984375836053293, "grad_norm": 1.1171875, "learning_rate": 0.000499661599838399, "loss": 6.9389, "mean_token_accuracy": 0.10204790085554123, "num_tokens": 5684651.0, "step": 2615 }, { "entropy": 6.929867219924927, "epoch": 0.28037883246829687, "grad_norm": 1.0078125, "learning_rate": 0.0004996595004653167, "loss": 6.8204, "mean_token_accuracy": 0.10971119105815888, "num_tokens": 5696081.0, "step": 2620 }, { "entropy": 6.925084161758423, "epoch": 0.2809139065760608, "grad_norm": 0.9921875, "learning_rate": 0.0004996573946052229, "loss": 6.855, "mean_token_accuracy": 0.10883698239922523, "num_tokens": 5706830.0, "step": 2625 }, { "entropy": 6.910267782211304, "epoch": 0.28144898068382473, "grad_norm": 1.1328125, "learning_rate": 0.0004996552822581783, "loss": 6.8815, "mean_token_accuracy": 0.11361035332083702, "num_tokens": 5717261.0, "step": 2630 }, { "entropy": 6.91580810546875, "epoch": 0.2819840547915886, "grad_norm": 1.1640625, "learning_rate": 0.000499653163424244, "loss": 6.8481, "mean_token_accuracy": 0.10841184929013252, "num_tokens": 5727280.0, "step": 2635 }, { "entropy": 6.938942956924438, "epoch": 0.28251912889935255, "grad_norm": 0.97265625, "learning_rate": 0.0004996510381034814, "loss": 6.9083, "mean_token_accuracy": 0.10522805228829384, "num_tokens": 5737485.0, "step": 2640 }, { "entropy": 6.926429605484008, "epoch": 0.2830542030071165, "grad_norm": 0.9921875, "learning_rate": 0.0004996489062959515, "loss": 6.8735, "mean_token_accuracy": 0.10467999801039696, "num_tokens": 5747683.0, "step": 2645 }, { "entropy": 6.867719650268555, "epoch": 0.2835892771148804, "grad_norm": 1.046875, "learning_rate": 0.0004996467680017159, "loss": 6.9325, "mean_token_accuracy": 0.10280923023819924, "num_tokens": 5758148.0, "step": 2650 }, { "entropy": 6.917259216308594, "epoch": 0.28412435122264434, "grad_norm": 0.96484375, "learning_rate": 0.0004996446232208365, "loss": 6.8627, "mean_token_accuracy": 0.11170612499117852, "num_tokens": 5769109.0, "step": 2655 }, { "entropy": 6.9372947216033936, "epoch": 0.2846594253304083, "grad_norm": 1.03125, "learning_rate": 0.0004996424719533753, "loss": 6.8939, "mean_token_accuracy": 0.1052110217511654, "num_tokens": 5780344.0, "step": 2660 }, { "entropy": 6.913125228881836, "epoch": 0.2851944994381722, "grad_norm": 1.0859375, "learning_rate": 0.0004996403141993941, "loss": 6.6962, "mean_token_accuracy": 0.11824454516172409, "num_tokens": 5790167.0, "step": 2665 }, { "entropy": 6.92453293800354, "epoch": 0.2857295735459361, "grad_norm": 1.0625, "learning_rate": 0.0004996381499589555, "loss": 6.8624, "mean_token_accuracy": 0.10613423809409142, "num_tokens": 5800076.0, "step": 2670 }, { "entropy": 6.944131517410279, "epoch": 0.2862646476537, "grad_norm": 0.98828125, "learning_rate": 0.0004996359792321219, "loss": 6.8113, "mean_token_accuracy": 0.11141969487071038, "num_tokens": 5810547.0, "step": 2675 }, { "entropy": 6.8161341667175295, "epoch": 0.28679972176146395, "grad_norm": 1.0625, "learning_rate": 0.000499633802018956, "loss": 6.8478, "mean_token_accuracy": 0.1100471280515194, "num_tokens": 5821210.0, "step": 2680 }, { "entropy": 6.917617702484131, "epoch": 0.2873347958692279, "grad_norm": 1.0078125, "learning_rate": 0.0004996316183195204, "loss": 6.8869, "mean_token_accuracy": 0.10786092206835747, "num_tokens": 5832361.0, "step": 2685 }, { "entropy": 6.962878274917602, "epoch": 0.2878698699769918, "grad_norm": 1.03125, "learning_rate": 0.0004996294281338786, "loss": 6.8717, "mean_token_accuracy": 0.10681624412536621, "num_tokens": 5843242.0, "step": 2690 }, { "entropy": 6.976676988601684, "epoch": 0.28840494408475575, "grad_norm": 0.9453125, "learning_rate": 0.0004996272314620936, "loss": 6.9215, "mean_token_accuracy": 0.10194345191121101, "num_tokens": 5855163.0, "step": 2695 }, { "entropy": 6.837163925170898, "epoch": 0.2889400181925197, "grad_norm": 0.97265625, "learning_rate": 0.0004996250283042288, "loss": 6.8839, "mean_token_accuracy": 0.11228486746549607, "num_tokens": 5866908.0, "step": 2700 }, { "entropy": 6.974035596847534, "epoch": 0.28947509230028357, "grad_norm": 1.0546875, "learning_rate": 0.000499622818660348, "loss": 6.9045, "mean_token_accuracy": 0.10939288139343262, "num_tokens": 5877342.0, "step": 2705 }, { "entropy": 6.942460250854492, "epoch": 0.2900101664080475, "grad_norm": 1.078125, "learning_rate": 0.0004996206025305147, "loss": 6.8573, "mean_token_accuracy": 0.10582418739795685, "num_tokens": 5887960.0, "step": 2710 }, { "entropy": 6.87635645866394, "epoch": 0.29054524051581143, "grad_norm": 1.0390625, "learning_rate": 0.0004996183799147932, "loss": 6.8397, "mean_token_accuracy": 0.1095063179731369, "num_tokens": 5899887.0, "step": 2715 }, { "entropy": 6.917806816101074, "epoch": 0.29108031462357536, "grad_norm": 1.0390625, "learning_rate": 0.0004996161508132475, "loss": 6.8583, "mean_token_accuracy": 0.10231703668832778, "num_tokens": 5911022.0, "step": 2720 }, { "entropy": 7.016377210617065, "epoch": 0.2916153887313393, "grad_norm": 0.99609375, "learning_rate": 0.000499613915225942, "loss": 6.9222, "mean_token_accuracy": 0.11102863773703575, "num_tokens": 5922780.0, "step": 2725 }, { "entropy": 6.881858253479004, "epoch": 0.29215046283910323, "grad_norm": 1.0546875, "learning_rate": 0.0004996116731529412, "loss": 6.9251, "mean_token_accuracy": 0.10592872574925423, "num_tokens": 5934112.0, "step": 2730 }, { "entropy": 6.8940752983093265, "epoch": 0.29268553694686716, "grad_norm": 1.0546875, "learning_rate": 0.00049960942459431, "loss": 6.8866, "mean_token_accuracy": 0.1067856416106224, "num_tokens": 5944386.0, "step": 2735 }, { "entropy": 6.870763492584229, "epoch": 0.29322061105463104, "grad_norm": 1.03125, "learning_rate": 0.0004996071695501132, "loss": 6.813, "mean_token_accuracy": 0.10948670953512192, "num_tokens": 5955552.0, "step": 2740 }, { "entropy": 6.921037864685059, "epoch": 0.293755685162395, "grad_norm": 1.0, "learning_rate": 0.0004996049080204159, "loss": 6.8137, "mean_token_accuracy": 0.1098986655473709, "num_tokens": 5966790.0, "step": 2745 }, { "entropy": 6.925626182556153, "epoch": 0.2942907592701589, "grad_norm": 1.0625, "learning_rate": 0.0004996026400052835, "loss": 6.8214, "mean_token_accuracy": 0.10917853116989136, "num_tokens": 5977704.0, "step": 2750 }, { "entropy": 6.853207015991211, "epoch": 0.29482583337792284, "grad_norm": 0.953125, "learning_rate": 0.0004996003655047814, "loss": 6.8364, "mean_token_accuracy": 0.11162171512842178, "num_tokens": 5989221.0, "step": 2755 }, { "entropy": 6.919997644424439, "epoch": 0.2953609074856868, "grad_norm": 0.89453125, "learning_rate": 0.0004995980845189753, "loss": 6.871, "mean_token_accuracy": 0.10931915193796157, "num_tokens": 6000906.0, "step": 2760 }, { "entropy": 6.931192445755005, "epoch": 0.2958959815934507, "grad_norm": 1.015625, "learning_rate": 0.0004995957970479312, "loss": 6.8945, "mean_token_accuracy": 0.10708941668272018, "num_tokens": 6012039.0, "step": 2765 }, { "entropy": 6.8547321319580075, "epoch": 0.29643105570121464, "grad_norm": 0.93359375, "learning_rate": 0.0004995935030917148, "loss": 6.776, "mean_token_accuracy": 0.11066783592104912, "num_tokens": 6024383.0, "step": 2770 }, { "entropy": 6.994161558151245, "epoch": 0.2969661298089785, "grad_norm": 1.0859375, "learning_rate": 0.0004995912026503926, "loss": 6.8508, "mean_token_accuracy": 0.10267031714320182, "num_tokens": 6034904.0, "step": 2775 }, { "entropy": 6.838885879516601, "epoch": 0.29750120391674245, "grad_norm": 1.0234375, "learning_rate": 0.000499588895724031, "loss": 6.8488, "mean_token_accuracy": 0.10749915912747383, "num_tokens": 6044449.0, "step": 2780 }, { "entropy": 6.962449741363526, "epoch": 0.2980362780245064, "grad_norm": 1.109375, "learning_rate": 0.0004995865823126968, "loss": 6.8765, "mean_token_accuracy": 0.10825972631573677, "num_tokens": 6054465.0, "step": 2785 }, { "entropy": 6.8947694301605225, "epoch": 0.2985713521322703, "grad_norm": 1.0859375, "learning_rate": 0.0004995842624164564, "loss": 6.8962, "mean_token_accuracy": 0.10824007838964463, "num_tokens": 6065539.0, "step": 2790 }, { "entropy": 6.909287405014038, "epoch": 0.29910642624003425, "grad_norm": 1.0859375, "learning_rate": 0.000499581936035377, "loss": 6.8459, "mean_token_accuracy": 0.10840294510126114, "num_tokens": 6076135.0, "step": 2795 }, { "entropy": 6.903677034378052, "epoch": 0.2996415003477982, "grad_norm": 1.0546875, "learning_rate": 0.0004995796031695257, "loss": 6.8641, "mean_token_accuracy": 0.10931005999445915, "num_tokens": 6086604.0, "step": 2800 }, { "entropy": 6.90281114578247, "epoch": 0.3001765744555621, "grad_norm": 1.125, "learning_rate": 0.00049957726381897, "loss": 6.8781, "mean_token_accuracy": 0.10950748696923256, "num_tokens": 6095672.0, "step": 2805 }, { "entropy": 6.90290675163269, "epoch": 0.300711648563326, "grad_norm": 1.0, "learning_rate": 0.0004995749179837773, "loss": 6.7498, "mean_token_accuracy": 0.11466853022575378, "num_tokens": 6105652.0, "step": 2810 }, { "entropy": 6.826155042648315, "epoch": 0.30124672267108993, "grad_norm": 0.99609375, "learning_rate": 0.0004995725656640155, "loss": 6.7856, "mean_token_accuracy": 0.11099454537034034, "num_tokens": 6116930.0, "step": 2815 }, { "entropy": 6.844819593429565, "epoch": 0.30178179677885386, "grad_norm": 1.03125, "learning_rate": 0.0004995702068597524, "loss": 6.7894, "mean_token_accuracy": 0.11423054486513137, "num_tokens": 6126659.0, "step": 2820 }, { "entropy": 6.890478515625, "epoch": 0.3023168708866178, "grad_norm": 1.015625, "learning_rate": 0.0004995678415710561, "loss": 6.8288, "mean_token_accuracy": 0.11060848459601402, "num_tokens": 6137227.0, "step": 2825 }, { "entropy": 6.962517929077149, "epoch": 0.3028519449943817, "grad_norm": 0.98046875, "learning_rate": 0.000499565469797995, "loss": 6.8821, "mean_token_accuracy": 0.10931277051568031, "num_tokens": 6147800.0, "step": 2830 }, { "entropy": 6.822924327850342, "epoch": 0.30338701910214566, "grad_norm": 1.0, "learning_rate": 0.0004995630915406374, "loss": 6.7326, "mean_token_accuracy": 0.12161283493041992, "num_tokens": 6157671.0, "step": 2835 }, { "entropy": 6.918770694732666, "epoch": 0.3039220932099096, "grad_norm": 1.0390625, "learning_rate": 0.0004995607067990521, "loss": 6.8698, "mean_token_accuracy": 0.10645673274993897, "num_tokens": 6168651.0, "step": 2840 }, { "entropy": 6.873465251922608, "epoch": 0.30445716731767347, "grad_norm": 1.453125, "learning_rate": 0.000499558315573308, "loss": 6.8487, "mean_token_accuracy": 0.1086043007671833, "num_tokens": 6179925.0, "step": 2845 }, { "entropy": 6.818239831924439, "epoch": 0.3049922414254374, "grad_norm": 1.234375, "learning_rate": 0.0004995559178634741, "loss": 6.8438, "mean_token_accuracy": 0.10887812077999115, "num_tokens": 6190541.0, "step": 2850 }, { "entropy": 7.041949510574341, "epoch": 0.30552731553320134, "grad_norm": 1.0546875, "learning_rate": 0.0004995535136696196, "loss": 6.8866, "mean_token_accuracy": 0.09955592602491378, "num_tokens": 6201491.0, "step": 2855 }, { "entropy": 6.8139080047607425, "epoch": 0.30606238964096527, "grad_norm": 1.0078125, "learning_rate": 0.000499551102991814, "loss": 6.6991, "mean_token_accuracy": 0.11249880269169807, "num_tokens": 6212443.0, "step": 2860 }, { "entropy": 6.817849111557007, "epoch": 0.3065974637487292, "grad_norm": 1.1328125, "learning_rate": 0.0004995486858301268, "loss": 6.8981, "mean_token_accuracy": 0.1030767761170864, "num_tokens": 6222623.0, "step": 2865 }, { "entropy": 6.925403165817261, "epoch": 0.30713253785649314, "grad_norm": 0.9609375, "learning_rate": 0.0004995462621846279, "loss": 6.7852, "mean_token_accuracy": 0.10933116525411606, "num_tokens": 6233712.0, "step": 2870 }, { "entropy": 6.854152202606201, "epoch": 0.30766761196425707, "grad_norm": 1.1171875, "learning_rate": 0.0004995438320553871, "loss": 6.8534, "mean_token_accuracy": 0.10412434935569763, "num_tokens": 6244254.0, "step": 2875 }, { "entropy": 6.823256492614746, "epoch": 0.30820268607202095, "grad_norm": 1.2265625, "learning_rate": 0.0004995413954424748, "loss": 6.7504, "mean_token_accuracy": 0.116096231341362, "num_tokens": 6254202.0, "step": 2880 }, { "entropy": 6.877709770202637, "epoch": 0.3087377601797849, "grad_norm": 1.140625, "learning_rate": 0.0004995389523459612, "loss": 6.8231, "mean_token_accuracy": 0.10538254305720329, "num_tokens": 6264496.0, "step": 2885 }, { "entropy": 6.839356851577759, "epoch": 0.3092728342875488, "grad_norm": 1.078125, "learning_rate": 0.000499536502765917, "loss": 6.828, "mean_token_accuracy": 0.1125398851931095, "num_tokens": 6275835.0, "step": 2890 }, { "entropy": 6.893553924560547, "epoch": 0.30980790839531275, "grad_norm": 1.2421875, "learning_rate": 0.0004995340467024128, "loss": 6.7842, "mean_token_accuracy": 0.10834744572639465, "num_tokens": 6286805.0, "step": 2895 }, { "entropy": 6.906386661529541, "epoch": 0.3103429825030767, "grad_norm": 0.984375, "learning_rate": 0.0004995315841555195, "loss": 6.7916, "mean_token_accuracy": 0.10366136953234673, "num_tokens": 6298444.0, "step": 2900 }, { "entropy": 6.783759641647339, "epoch": 0.3108780566108406, "grad_norm": 1.1015625, "learning_rate": 0.0004995291151253083, "loss": 6.7348, "mean_token_accuracy": 0.11380124613642692, "num_tokens": 6308259.0, "step": 2905 }, { "entropy": 6.846135902404785, "epoch": 0.31141313071860455, "grad_norm": 1.0234375, "learning_rate": 0.0004995266396118505, "loss": 6.8013, "mean_token_accuracy": 0.10161566883325576, "num_tokens": 6320058.0, "step": 2910 }, { "entropy": 6.900366973876953, "epoch": 0.3119482048263684, "grad_norm": 0.9140625, "learning_rate": 0.0004995241576152174, "loss": 6.7723, "mean_token_accuracy": 0.10676236972212791, "num_tokens": 6331203.0, "step": 2915 }, { "entropy": 6.897499227523804, "epoch": 0.31248327893413236, "grad_norm": 1.078125, "learning_rate": 0.000499521669135481, "loss": 6.8882, "mean_token_accuracy": 0.10588050186634064, "num_tokens": 6342027.0, "step": 2920 }, { "entropy": 6.894981956481933, "epoch": 0.3130183530418963, "grad_norm": 1.015625, "learning_rate": 0.0004995191741727128, "loss": 6.7873, "mean_token_accuracy": 0.10809844583272935, "num_tokens": 6352580.0, "step": 2925 }, { "entropy": 6.887385463714599, "epoch": 0.3135534271496602, "grad_norm": 0.94140625, "learning_rate": 0.000499516672726985, "loss": 6.8106, "mean_token_accuracy": 0.11217835023999215, "num_tokens": 6363997.0, "step": 2930 }, { "entropy": 6.83791708946228, "epoch": 0.31408850125742416, "grad_norm": 0.98046875, "learning_rate": 0.0004995141647983699, "loss": 6.8464, "mean_token_accuracy": 0.11019290536642075, "num_tokens": 6375284.0, "step": 2935 }, { "entropy": 6.8710222244262695, "epoch": 0.3146235753651881, "grad_norm": 0.984375, "learning_rate": 0.0004995116503869398, "loss": 6.7437, "mean_token_accuracy": 0.11758178621530532, "num_tokens": 6386698.0, "step": 2940 }, { "entropy": 6.864429473876953, "epoch": 0.315158649472952, "grad_norm": 1.3203125, "learning_rate": 0.0004995091294927673, "loss": 6.818, "mean_token_accuracy": 0.10886727124452591, "num_tokens": 6397237.0, "step": 2945 }, { "entropy": 6.973788785934448, "epoch": 0.3156937235807159, "grad_norm": 1.0, "learning_rate": 0.0004995066021159253, "loss": 6.9364, "mean_token_accuracy": 0.10483678579330444, "num_tokens": 6408266.0, "step": 2950 }, { "entropy": 6.842577266693115, "epoch": 0.31622879768847983, "grad_norm": 1.0546875, "learning_rate": 0.0004995040682564867, "loss": 6.8199, "mean_token_accuracy": 0.11405593305826187, "num_tokens": 6419563.0, "step": 2955 }, { "entropy": 6.8359404563903805, "epoch": 0.31676387179624377, "grad_norm": 1.0078125, "learning_rate": 0.0004995015279145247, "loss": 6.7863, "mean_token_accuracy": 0.11180907115340233, "num_tokens": 6430220.0, "step": 2960 }, { "entropy": 6.857833385467529, "epoch": 0.3172989459040077, "grad_norm": 1.1015625, "learning_rate": 0.0004994989810901126, "loss": 6.7961, "mean_token_accuracy": 0.10685641467571258, "num_tokens": 6440157.0, "step": 2965 }, { "entropy": 6.856301593780517, "epoch": 0.31783402001177163, "grad_norm": 1.1484375, "learning_rate": 0.0004994964277833239, "loss": 6.8463, "mean_token_accuracy": 0.11110184714198112, "num_tokens": 6449511.0, "step": 2970 }, { "entropy": 6.923713493347168, "epoch": 0.31836909411953557, "grad_norm": 0.9765625, "learning_rate": 0.0004994938679942324, "loss": 6.8365, "mean_token_accuracy": 0.10282818749547004, "num_tokens": 6460608.0, "step": 2975 }, { "entropy": 6.919619989395142, "epoch": 0.3189041682272995, "grad_norm": 1.046875, "learning_rate": 0.0004994913017229121, "loss": 6.8372, "mean_token_accuracy": 0.1131968080997467, "num_tokens": 6472737.0, "step": 2980 }, { "entropy": 6.817192554473877, "epoch": 0.31943924233506343, "grad_norm": 1.0703125, "learning_rate": 0.0004994887289694371, "loss": 6.7184, "mean_token_accuracy": 0.11385754495859146, "num_tokens": 6482993.0, "step": 2985 }, { "entropy": 6.960534572601318, "epoch": 0.3199743164428273, "grad_norm": 1.078125, "learning_rate": 0.0004994861497338814, "loss": 6.9207, "mean_token_accuracy": 0.11038238108158112, "num_tokens": 6494530.0, "step": 2990 }, { "entropy": 6.894915056228638, "epoch": 0.32050939055059124, "grad_norm": 1.0703125, "learning_rate": 0.0004994835640163198, "loss": 6.7626, "mean_token_accuracy": 0.10633266866207122, "num_tokens": 6504691.0, "step": 2995 }, { "entropy": 6.885722494125366, "epoch": 0.3210444646583552, "grad_norm": 1.0859375, "learning_rate": 0.0004994809718168267, "loss": 6.7865, "mean_token_accuracy": 0.10957603380084038, "num_tokens": 6514924.0, "step": 3000 }, { "epoch": 0.3210444646583552, "eval_entropy": 6.6982880289021205, "eval_loss": 6.9056596755981445, "eval_mean_token_accuracy": 0.11213191206946045, "eval_num_tokens": 6514924.0, "eval_runtime": 22.6381, "eval_samples_per_second": 1311.022, "eval_steps_per_second": 163.883, "step": 3000 }, { "entropy": 6.774571943283081, "epoch": 0.3215795387661191, "grad_norm": 1.0703125, "learning_rate": 0.0004994783731354771, "loss": 6.7524, "mean_token_accuracy": 0.11166785731911659, "num_tokens": 6526097.0, "step": 3005 }, { "entropy": 6.929418516159058, "epoch": 0.32211461287388304, "grad_norm": 1.0625, "learning_rate": 0.0004994757679723461, "loss": 6.8149, "mean_token_accuracy": 0.10639956593513489, "num_tokens": 6536384.0, "step": 3010 }, { "entropy": 6.919300746917725, "epoch": 0.322649686981647, "grad_norm": 1.0546875, "learning_rate": 0.0004994731563275088, "loss": 6.8694, "mean_token_accuracy": 0.1046457588672638, "num_tokens": 6547161.0, "step": 3015 }, { "entropy": 6.785147857666016, "epoch": 0.3231847610894109, "grad_norm": 1.046875, "learning_rate": 0.0004994705382010406, "loss": 6.7936, "mean_token_accuracy": 0.10720081478357316, "num_tokens": 6556751.0, "step": 3020 }, { "entropy": 6.861992263793946, "epoch": 0.3237198351971748, "grad_norm": 1.109375, "learning_rate": 0.0004994679135930174, "loss": 6.8486, "mean_token_accuracy": 0.1134506493806839, "num_tokens": 6567655.0, "step": 3025 }, { "entropy": 6.987712669372558, "epoch": 0.3242549093049387, "grad_norm": 1.1484375, "learning_rate": 0.0004994652825035144, "loss": 6.8797, "mean_token_accuracy": 0.10770419910550118, "num_tokens": 6579127.0, "step": 3030 }, { "entropy": 6.9072469711303714, "epoch": 0.32478998341270265, "grad_norm": 1.265625, "learning_rate": 0.0004994626449326081, "loss": 6.8376, "mean_token_accuracy": 0.11200311556458473, "num_tokens": 6590779.0, "step": 3035 }, { "entropy": 6.858027362823487, "epoch": 0.3253250575204666, "grad_norm": 1.09375, "learning_rate": 0.0004994600008803745, "loss": 6.7456, "mean_token_accuracy": 0.11969574466347695, "num_tokens": 6600849.0, "step": 3040 }, { "entropy": 6.831806564331055, "epoch": 0.3258601316282305, "grad_norm": 1.09375, "learning_rate": 0.0004994573503468899, "loss": 6.7547, "mean_token_accuracy": 0.11736322343349456, "num_tokens": 6610633.0, "step": 3045 }, { "entropy": 6.787566423416138, "epoch": 0.32639520573599445, "grad_norm": 0.953125, "learning_rate": 0.0004994546933322308, "loss": 6.7953, "mean_token_accuracy": 0.10811478719115257, "num_tokens": 6621327.0, "step": 3050 }, { "entropy": 6.93750228881836, "epoch": 0.3269302798437584, "grad_norm": 0.984375, "learning_rate": 0.000499452029836474, "loss": 6.7415, "mean_token_accuracy": 0.11278096809983254, "num_tokens": 6632267.0, "step": 3055 }, { "entropy": 6.810693454742432, "epoch": 0.32746535395152226, "grad_norm": 1.1796875, "learning_rate": 0.0004994493598596963, "loss": 6.7705, "mean_token_accuracy": 0.10761533975601197, "num_tokens": 6642714.0, "step": 3060 }, { "entropy": 6.849345254898071, "epoch": 0.3280004280592862, "grad_norm": 1.078125, "learning_rate": 0.0004994466834019749, "loss": 6.7758, "mean_token_accuracy": 0.11640546843409538, "num_tokens": 6652353.0, "step": 3065 }, { "entropy": 6.842514944076538, "epoch": 0.32853550216705013, "grad_norm": 1.0859375, "learning_rate": 0.0004994440004633871, "loss": 6.7517, "mean_token_accuracy": 0.11130421757698059, "num_tokens": 6663133.0, "step": 3070 }, { "entropy": 6.801913261413574, "epoch": 0.32907057627481406, "grad_norm": 1.1953125, "learning_rate": 0.0004994413110440103, "loss": 6.7354, "mean_token_accuracy": 0.11714180111885071, "num_tokens": 6673984.0, "step": 3075 }, { "entropy": 6.8637457370758055, "epoch": 0.329605650382578, "grad_norm": 0.875, "learning_rate": 0.0004994386151439222, "loss": 6.8076, "mean_token_accuracy": 0.1080280676484108, "num_tokens": 6686171.0, "step": 3080 }, { "entropy": 6.933955192565918, "epoch": 0.33014072449034193, "grad_norm": 1.109375, "learning_rate": 0.0004994359127632006, "loss": 6.8475, "mean_token_accuracy": 0.10514529719948769, "num_tokens": 6696609.0, "step": 3085 }, { "entropy": 6.89633002281189, "epoch": 0.33067579859810586, "grad_norm": 1.1875, "learning_rate": 0.0004994332039019235, "loss": 6.7854, "mean_token_accuracy": 0.11049062609672547, "num_tokens": 6706188.0, "step": 3090 }, { "entropy": 6.708978939056396, "epoch": 0.33121087270586974, "grad_norm": 1.125, "learning_rate": 0.0004994304885601694, "loss": 6.7667, "mean_token_accuracy": 0.11125922203063965, "num_tokens": 6716276.0, "step": 3095 }, { "entropy": 6.774325132369995, "epoch": 0.3317459468136337, "grad_norm": 1.2890625, "learning_rate": 0.0004994277667380162, "loss": 6.737, "mean_token_accuracy": 0.1192335270345211, "num_tokens": 6727176.0, "step": 3100 }, { "entropy": 6.887723302841186, "epoch": 0.3322810209213976, "grad_norm": 1.1171875, "learning_rate": 0.0004994250384355429, "loss": 6.8119, "mean_token_accuracy": 0.11386096626520156, "num_tokens": 6737768.0, "step": 3105 }, { "entropy": 6.840688323974609, "epoch": 0.33281609502916154, "grad_norm": 6.46875, "learning_rate": 0.0004994223036528282, "loss": 6.7618, "mean_token_accuracy": 0.11079908534884453, "num_tokens": 6747962.0, "step": 3110 }, { "entropy": 6.8406102657318115, "epoch": 0.3333511691369255, "grad_norm": 1.1171875, "learning_rate": 0.000499419562389951, "loss": 6.7548, "mean_token_accuracy": 0.1147709958255291, "num_tokens": 6758400.0, "step": 3115 }, { "entropy": 6.851141119003296, "epoch": 0.3338862432446894, "grad_norm": 1.0390625, "learning_rate": 0.0004994168146469904, "loss": 6.7693, "mean_token_accuracy": 0.11088330820202827, "num_tokens": 6768855.0, "step": 3120 }, { "entropy": 6.863172101974487, "epoch": 0.33442131735245334, "grad_norm": 1.0234375, "learning_rate": 0.0004994140604240259, "loss": 6.7514, "mean_token_accuracy": 0.1078583225607872, "num_tokens": 6778656.0, "step": 3125 }, { "entropy": 6.882100915908813, "epoch": 0.3349563914602172, "grad_norm": 0.98046875, "learning_rate": 0.0004994112997211369, "loss": 6.8182, "mean_token_accuracy": 0.11499066054821014, "num_tokens": 6789960.0, "step": 3130 }, { "entropy": 6.730247640609742, "epoch": 0.33549146556798115, "grad_norm": 1.1875, "learning_rate": 0.0004994085325384031, "loss": 6.8076, "mean_token_accuracy": 0.10851202681660652, "num_tokens": 6800188.0, "step": 3135 }, { "entropy": 6.906764650344849, "epoch": 0.3360265396757451, "grad_norm": 1.0546875, "learning_rate": 0.0004994057588759045, "loss": 6.7393, "mean_token_accuracy": 0.11358117088675498, "num_tokens": 6811032.0, "step": 3140 }, { "entropy": 6.824139022827149, "epoch": 0.336561613783509, "grad_norm": 1.0625, "learning_rate": 0.0004994029787337212, "loss": 6.7666, "mean_token_accuracy": 0.10829171538352966, "num_tokens": 6823060.0, "step": 3145 }, { "entropy": 6.8112482070922855, "epoch": 0.33709668789127295, "grad_norm": 1.0703125, "learning_rate": 0.0004994001921119333, "loss": 6.8496, "mean_token_accuracy": 0.10913093164563178, "num_tokens": 6833559.0, "step": 3150 }, { "entropy": 6.894295167922974, "epoch": 0.3376317619990369, "grad_norm": 1.1171875, "learning_rate": 0.0004993973990106215, "loss": 6.7974, "mean_token_accuracy": 0.11234046593308449, "num_tokens": 6843657.0, "step": 3155 }, { "entropy": 6.814738702774048, "epoch": 0.3381668361068008, "grad_norm": 1.1171875, "learning_rate": 0.0004993945994298662, "loss": 6.7267, "mean_token_accuracy": 0.10636094883084297, "num_tokens": 6853615.0, "step": 3160 }, { "entropy": 6.858942174911499, "epoch": 0.3387019102145647, "grad_norm": 1.03125, "learning_rate": 0.0004993917933697484, "loss": 6.8354, "mean_token_accuracy": 0.10942788496613502, "num_tokens": 6865256.0, "step": 3165 }, { "entropy": 7.015973472595215, "epoch": 0.3392369843223286, "grad_norm": 1.1171875, "learning_rate": 0.0004993889808303493, "loss": 6.8711, "mean_token_accuracy": 0.11036419197916984, "num_tokens": 6875358.0, "step": 3170 }, { "entropy": 6.757581901550293, "epoch": 0.33977205843009256, "grad_norm": 1.015625, "learning_rate": 0.0004993861618117498, "loss": 6.7711, "mean_token_accuracy": 0.1102716788649559, "num_tokens": 6886584.0, "step": 3175 }, { "entropy": 6.8233020305633545, "epoch": 0.3403071325378565, "grad_norm": 1.0546875, "learning_rate": 0.0004993833363140314, "loss": 6.7109, "mean_token_accuracy": 0.11896613985300064, "num_tokens": 6896958.0, "step": 3180 }, { "entropy": 6.830180215835571, "epoch": 0.3408422066456204, "grad_norm": 1.03125, "learning_rate": 0.0004993805043372756, "loss": 6.775, "mean_token_accuracy": 0.1163598895072937, "num_tokens": 6907944.0, "step": 3185 }, { "entropy": 6.831008625030518, "epoch": 0.34137728075338436, "grad_norm": 1.0078125, "learning_rate": 0.0004993776658815644, "loss": 6.8739, "mean_token_accuracy": 0.1049034409224987, "num_tokens": 6919486.0, "step": 3190 }, { "entropy": 6.957132577896118, "epoch": 0.3419123548611483, "grad_norm": 1.2578125, "learning_rate": 0.0004993748209469796, "loss": 6.8414, "mean_token_accuracy": 0.11248302012681961, "num_tokens": 6930650.0, "step": 3195 }, { "entropy": 6.833132362365722, "epoch": 0.34244742896891217, "grad_norm": 1.015625, "learning_rate": 0.0004993719695336033, "loss": 6.7926, "mean_token_accuracy": 0.11160960346460343, "num_tokens": 6941519.0, "step": 3200 }, { "entropy": 6.775629329681396, "epoch": 0.3429825030766761, "grad_norm": 1.5078125, "learning_rate": 0.0004993691116415179, "loss": 6.8265, "mean_token_accuracy": 0.10980288833379745, "num_tokens": 6952952.0, "step": 3205 }, { "entropy": 6.945135641098022, "epoch": 0.34351757718444004, "grad_norm": 1.0078125, "learning_rate": 0.000499366247270806, "loss": 6.7907, "mean_token_accuracy": 0.11398276537656785, "num_tokens": 6962867.0, "step": 3210 }, { "entropy": 6.850128173828125, "epoch": 0.34405265129220397, "grad_norm": 1.0546875, "learning_rate": 0.0004993633764215502, "loss": 6.7128, "mean_token_accuracy": 0.1149346224963665, "num_tokens": 6973434.0, "step": 3215 }, { "entropy": 6.805971765518189, "epoch": 0.3445877253999679, "grad_norm": 1.125, "learning_rate": 0.0004993604990938336, "loss": 6.7242, "mean_token_accuracy": 0.12372536882758141, "num_tokens": 6984161.0, "step": 3220 }, { "entropy": 6.831466388702393, "epoch": 0.34512279950773184, "grad_norm": 1.078125, "learning_rate": 0.0004993576152877389, "loss": 6.7023, "mean_token_accuracy": 0.11155548840761184, "num_tokens": 6994700.0, "step": 3225 }, { "entropy": 6.859937858581543, "epoch": 0.34565787361549577, "grad_norm": 1.0859375, "learning_rate": 0.0004993547250033496, "loss": 6.8702, "mean_token_accuracy": 0.10222596898674965, "num_tokens": 7006497.0, "step": 3230 }, { "entropy": 6.907996559143067, "epoch": 0.34619294772325965, "grad_norm": 1.0703125, "learning_rate": 0.0004993518282407493, "loss": 6.7762, "mean_token_accuracy": 0.11640164703130722, "num_tokens": 7016415.0, "step": 3235 }, { "entropy": 6.780554246902466, "epoch": 0.3467280218310236, "grad_norm": 1.2109375, "learning_rate": 0.0004993489250000213, "loss": 6.7293, "mean_token_accuracy": 0.11351820677518845, "num_tokens": 7026610.0, "step": 3240 }, { "entropy": 6.797022676467895, "epoch": 0.3472630959387875, "grad_norm": 1.0390625, "learning_rate": 0.0004993460152812497, "loss": 6.7409, "mean_token_accuracy": 0.11043249741196633, "num_tokens": 7038236.0, "step": 3245 }, { "entropy": 6.871045017242432, "epoch": 0.34779817004655145, "grad_norm": 1.140625, "learning_rate": 0.0004993430990845184, "loss": 6.7892, "mean_token_accuracy": 0.12099697217345237, "num_tokens": 7049438.0, "step": 3250 }, { "entropy": 6.795158195495605, "epoch": 0.3483332441543154, "grad_norm": 1.0859375, "learning_rate": 0.0004993401764099118, "loss": 6.75, "mean_token_accuracy": 0.10678878873586654, "num_tokens": 7061001.0, "step": 3255 }, { "entropy": 6.869133567810058, "epoch": 0.3488683182620793, "grad_norm": 1.09375, "learning_rate": 0.0004993372472575139, "loss": 6.7464, "mean_token_accuracy": 0.11511967554688454, "num_tokens": 7071328.0, "step": 3260 }, { "entropy": 6.9016501903533936, "epoch": 0.34940339236984325, "grad_norm": 1.140625, "learning_rate": 0.0004993343116274096, "loss": 6.93, "mean_token_accuracy": 0.10523641705513001, "num_tokens": 7082597.0, "step": 3265 }, { "entropy": 6.860869073867798, "epoch": 0.3499384664776071, "grad_norm": 1.0390625, "learning_rate": 0.0004993313695196836, "loss": 6.759, "mean_token_accuracy": 0.116279286891222, "num_tokens": 7093463.0, "step": 3270 }, { "entropy": 6.816839218139648, "epoch": 0.35047354058537106, "grad_norm": 0.984375, "learning_rate": 0.0004993284209344208, "loss": 6.8225, "mean_token_accuracy": 0.11397869065403939, "num_tokens": 7104350.0, "step": 3275 }, { "entropy": 6.929663181304932, "epoch": 0.351008614693135, "grad_norm": 1.2265625, "learning_rate": 0.0004993254658717065, "loss": 6.78, "mean_token_accuracy": 0.11524501666426659, "num_tokens": 7114851.0, "step": 3280 }, { "entropy": 6.865924549102783, "epoch": 0.3515436888008989, "grad_norm": 1.078125, "learning_rate": 0.0004993225043316257, "loss": 6.8189, "mean_token_accuracy": 0.10788183063268661, "num_tokens": 7126440.0, "step": 3285 }, { "entropy": 6.94174747467041, "epoch": 0.35207876290866286, "grad_norm": 1.125, "learning_rate": 0.0004993195363142643, "loss": 6.8435, "mean_token_accuracy": 0.10635844394564628, "num_tokens": 7137884.0, "step": 3290 }, { "entropy": 6.8471081256866455, "epoch": 0.3526138370164268, "grad_norm": 1.2265625, "learning_rate": 0.0004993165618197076, "loss": 6.8169, "mean_token_accuracy": 0.10543133914470673, "num_tokens": 7147930.0, "step": 3295 }, { "entropy": 6.814928293228149, "epoch": 0.3531489111241907, "grad_norm": 1.0078125, "learning_rate": 0.0004993135808480418, "loss": 6.6758, "mean_token_accuracy": 0.12192264795303345, "num_tokens": 7159200.0, "step": 3300 }, { "entropy": 6.856072282791137, "epoch": 0.3536839852319546, "grad_norm": 1.0625, "learning_rate": 0.0004993105933993529, "loss": 6.7738, "mean_token_accuracy": 0.11219395026564598, "num_tokens": 7169601.0, "step": 3305 }, { "entropy": 6.731938648223877, "epoch": 0.35421905933971853, "grad_norm": 1.0546875, "learning_rate": 0.0004993075994737271, "loss": 6.7014, "mean_token_accuracy": 0.12335732132196427, "num_tokens": 7180465.0, "step": 3310 }, { "entropy": 6.827739572525024, "epoch": 0.35475413344748247, "grad_norm": 1.0625, "learning_rate": 0.0004993045990712508, "loss": 6.7214, "mean_token_accuracy": 0.1124566912651062, "num_tokens": 7190603.0, "step": 3315 }, { "entropy": 6.744693279266357, "epoch": 0.3552892075552464, "grad_norm": 1.015625, "learning_rate": 0.0004993015921920109, "loss": 6.6822, "mean_token_accuracy": 0.1178012415766716, "num_tokens": 7201017.0, "step": 3320 }, { "entropy": 6.700474643707276, "epoch": 0.35582428166301033, "grad_norm": 1.109375, "learning_rate": 0.000499298578836094, "loss": 6.6851, "mean_token_accuracy": 0.11364478841423989, "num_tokens": 7210908.0, "step": 3325 }, { "entropy": 6.913705682754516, "epoch": 0.35635935577077427, "grad_norm": 1.078125, "learning_rate": 0.000499295559003587, "loss": 6.7313, "mean_token_accuracy": 0.11469347327947617, "num_tokens": 7221306.0, "step": 3330 }, { "entropy": 6.857224035263061, "epoch": 0.3568944298785382, "grad_norm": 0.984375, "learning_rate": 0.0004992925326945774, "loss": 6.8446, "mean_token_accuracy": 0.11008940190076828, "num_tokens": 7233076.0, "step": 3335 }, { "entropy": 6.836943006515503, "epoch": 0.3574295039863021, "grad_norm": 1.1875, "learning_rate": 0.0004992894999091524, "loss": 6.833, "mean_token_accuracy": 0.11023118868470191, "num_tokens": 7244703.0, "step": 3340 }, { "entropy": 6.865760707855225, "epoch": 0.357964578094066, "grad_norm": 1.0546875, "learning_rate": 0.0004992864606473996, "loss": 6.8127, "mean_token_accuracy": 0.10562887638807297, "num_tokens": 7255438.0, "step": 3345 }, { "entropy": 6.873836708068848, "epoch": 0.35849965220182994, "grad_norm": 1.1171875, "learning_rate": 0.0004992834149094069, "loss": 6.7746, "mean_token_accuracy": 0.10823791846632957, "num_tokens": 7265720.0, "step": 3350 }, { "entropy": 6.854056453704834, "epoch": 0.3590347263095939, "grad_norm": 1.0625, "learning_rate": 0.0004992803626952619, "loss": 6.8105, "mean_token_accuracy": 0.10965728536248207, "num_tokens": 7277791.0, "step": 3355 }, { "entropy": 6.743177652359009, "epoch": 0.3595698004173578, "grad_norm": 1.0625, "learning_rate": 0.000499277304005053, "loss": 6.6904, "mean_token_accuracy": 0.11896344646811485, "num_tokens": 7288521.0, "step": 3360 }, { "entropy": 6.8449372291564945, "epoch": 0.36010487452512174, "grad_norm": 1.03125, "learning_rate": 0.0004992742388388686, "loss": 6.8681, "mean_token_accuracy": 0.10312251970171929, "num_tokens": 7299298.0, "step": 3365 }, { "entropy": 6.848871850967408, "epoch": 0.3606399486328857, "grad_norm": 1.0390625, "learning_rate": 0.0004992711671967968, "loss": 6.6907, "mean_token_accuracy": 0.11500442028045654, "num_tokens": 7310271.0, "step": 3370 }, { "entropy": 6.832868242263794, "epoch": 0.36117502274064955, "grad_norm": 1.046875, "learning_rate": 0.0004992680890789268, "loss": 6.7535, "mean_token_accuracy": 0.11115506291389465, "num_tokens": 7321112.0, "step": 3375 }, { "entropy": 6.744096136093139, "epoch": 0.3617100968484135, "grad_norm": 1.125, "learning_rate": 0.0004992650044853471, "loss": 6.7111, "mean_token_accuracy": 0.11423057690262794, "num_tokens": 7331976.0, "step": 3380 }, { "entropy": 6.881365203857422, "epoch": 0.3622451709561774, "grad_norm": 1.15625, "learning_rate": 0.000499261913416147, "loss": 6.8157, "mean_token_accuracy": 0.11083743125200271, "num_tokens": 7342800.0, "step": 3385 }, { "entropy": 6.820743465423584, "epoch": 0.36278024506394135, "grad_norm": 0.98046875, "learning_rate": 0.0004992588158714157, "loss": 6.6508, "mean_token_accuracy": 0.11105694174766541, "num_tokens": 7354213.0, "step": 3390 }, { "entropy": 6.789371490478516, "epoch": 0.3633153191717053, "grad_norm": 1.1328125, "learning_rate": 0.0004992557118512424, "loss": 6.7069, "mean_token_accuracy": 0.11869031190872192, "num_tokens": 7363250.0, "step": 3395 }, { "entropy": 6.7624798774719235, "epoch": 0.3638503932794692, "grad_norm": 1.078125, "learning_rate": 0.0004992526013557171, "loss": 6.7605, "mean_token_accuracy": 0.11203641667962075, "num_tokens": 7374185.0, "step": 3400 }, { "entropy": 6.752663087844849, "epoch": 0.36438546738723315, "grad_norm": 1.0703125, "learning_rate": 0.0004992494843849294, "loss": 6.7287, "mean_token_accuracy": 0.10924962237477302, "num_tokens": 7384579.0, "step": 3405 }, { "entropy": 6.896695327758789, "epoch": 0.36492054149499703, "grad_norm": 1.1171875, "learning_rate": 0.0004992463609389694, "loss": 6.7422, "mean_token_accuracy": 0.10970545783638955, "num_tokens": 7395277.0, "step": 3410 }, { "entropy": 6.726968002319336, "epoch": 0.36545561560276096, "grad_norm": 1.0078125, "learning_rate": 0.0004992432310179272, "loss": 6.7332, "mean_token_accuracy": 0.1160312682390213, "num_tokens": 7406688.0, "step": 3415 }, { "entropy": 6.766181993484497, "epoch": 0.3659906897105249, "grad_norm": 0.99609375, "learning_rate": 0.0004992400946218932, "loss": 6.795, "mean_token_accuracy": 0.11444359049201011, "num_tokens": 7417378.0, "step": 3420 }, { "entropy": 6.967504692077637, "epoch": 0.36652576381828883, "grad_norm": 1.046875, "learning_rate": 0.0004992369517509581, "loss": 6.8179, "mean_token_accuracy": 0.1145808644592762, "num_tokens": 7427675.0, "step": 3425 }, { "entropy": 6.834393882751465, "epoch": 0.36706083792605276, "grad_norm": 1.0625, "learning_rate": 0.0004992338024052123, "loss": 6.8405, "mean_token_accuracy": 0.10944146141409875, "num_tokens": 7438083.0, "step": 3430 }, { "entropy": 6.772138452529907, "epoch": 0.3675959120338167, "grad_norm": 1.0859375, "learning_rate": 0.0004992306465847473, "loss": 6.6866, "mean_token_accuracy": 0.11544951871037483, "num_tokens": 7449051.0, "step": 3435 }, { "entropy": 6.803123044967651, "epoch": 0.36813098614158063, "grad_norm": 1.03125, "learning_rate": 0.0004992274842896536, "loss": 6.7313, "mean_token_accuracy": 0.11575418040156364, "num_tokens": 7459074.0, "step": 3440 }, { "entropy": 6.810998582839966, "epoch": 0.3686660602493445, "grad_norm": 1.0625, "learning_rate": 0.0004992243155200229, "loss": 6.7908, "mean_token_accuracy": 0.11545799896121026, "num_tokens": 7470472.0, "step": 3445 }, { "entropy": 6.810088348388672, "epoch": 0.36920113435710844, "grad_norm": 1.0, "learning_rate": 0.0004992211402759466, "loss": 6.7589, "mean_token_accuracy": 0.11591348797082901, "num_tokens": 7481477.0, "step": 3450 }, { "entropy": 6.811910390853882, "epoch": 0.3697362084648724, "grad_norm": 1.0390625, "learning_rate": 0.0004992179585575164, "loss": 6.7166, "mean_token_accuracy": 0.11710453182458877, "num_tokens": 7491906.0, "step": 3455 }, { "entropy": 6.801189374923706, "epoch": 0.3702712825726363, "grad_norm": 1.1328125, "learning_rate": 0.000499214770364824, "loss": 6.6567, "mean_token_accuracy": 0.10969180539250374, "num_tokens": 7502447.0, "step": 3460 }, { "entropy": 6.731618452072143, "epoch": 0.37080635668040024, "grad_norm": 1.1328125, "learning_rate": 0.0004992115756979617, "loss": 6.6488, "mean_token_accuracy": 0.12150704562664032, "num_tokens": 7513505.0, "step": 3465 }, { "entropy": 6.763904094696045, "epoch": 0.3713414307881642, "grad_norm": 1.0390625, "learning_rate": 0.0004992083745570218, "loss": 6.6731, "mean_token_accuracy": 0.11672577038407325, "num_tokens": 7524884.0, "step": 3470 }, { "entropy": 6.764589834213257, "epoch": 0.3718765048959281, "grad_norm": 1.078125, "learning_rate": 0.0004992051669420964, "loss": 6.7534, "mean_token_accuracy": 0.11659367606043816, "num_tokens": 7535942.0, "step": 3475 }, { "entropy": 6.77218713760376, "epoch": 0.372411579003692, "grad_norm": 1.0859375, "learning_rate": 0.0004992019528532785, "loss": 6.7354, "mean_token_accuracy": 0.12092937007546425, "num_tokens": 7545506.0, "step": 3480 }, { "entropy": 6.874322080612183, "epoch": 0.3729466531114559, "grad_norm": 1.25, "learning_rate": 0.0004991987322906605, "loss": 6.801, "mean_token_accuracy": 0.10959522724151612, "num_tokens": 7555328.0, "step": 3485 }, { "entropy": 6.811362361907959, "epoch": 0.37348172721921985, "grad_norm": 1.1640625, "learning_rate": 0.0004991955052543357, "loss": 6.6899, "mean_token_accuracy": 0.1134427696466446, "num_tokens": 7565762.0, "step": 3490 }, { "entropy": 6.830954933166504, "epoch": 0.3740168013269838, "grad_norm": 1.09375, "learning_rate": 0.0004991922717443972, "loss": 6.7216, "mean_token_accuracy": 0.12056689336895943, "num_tokens": 7575884.0, "step": 3495 }, { "entropy": 6.742701625823974, "epoch": 0.3745518754347477, "grad_norm": 1.046875, "learning_rate": 0.0004991890317609384, "loss": 6.7499, "mean_token_accuracy": 0.11369063630700112, "num_tokens": 7586100.0, "step": 3500 }, { "entropy": 6.859546327590943, "epoch": 0.37508694954251165, "grad_norm": 1.171875, "learning_rate": 0.0004991857853040528, "loss": 6.7591, "mean_token_accuracy": 0.11486376821994781, "num_tokens": 7597137.0, "step": 3505 }, { "entropy": 6.82744083404541, "epoch": 0.3756220236502756, "grad_norm": 1.0703125, "learning_rate": 0.0004991825323738341, "loss": 6.7932, "mean_token_accuracy": 0.11721144542098046, "num_tokens": 7607640.0, "step": 3510 }, { "entropy": 6.840407514572144, "epoch": 0.3761570977580395, "grad_norm": 1.1953125, "learning_rate": 0.0004991792729703763, "loss": 6.851, "mean_token_accuracy": 0.1160910353064537, "num_tokens": 7618319.0, "step": 3515 }, { "entropy": 6.877895498275757, "epoch": 0.3766921718658034, "grad_norm": 1.046875, "learning_rate": 0.0004991760070937734, "loss": 6.7208, "mean_token_accuracy": 0.11491079404950141, "num_tokens": 7628350.0, "step": 3520 }, { "entropy": 6.842350673675537, "epoch": 0.3772272459735673, "grad_norm": 1.203125, "learning_rate": 0.0004991727347441199, "loss": 6.7361, "mean_token_accuracy": 0.11011843830347061, "num_tokens": 7637857.0, "step": 3525 }, { "entropy": 6.858046007156372, "epoch": 0.37776232008133126, "grad_norm": 1.125, "learning_rate": 0.0004991694559215102, "loss": 6.7602, "mean_token_accuracy": 0.11095951348543168, "num_tokens": 7648242.0, "step": 3530 }, { "entropy": 6.830993270874023, "epoch": 0.3782973941890952, "grad_norm": 0.9453125, "learning_rate": 0.000499166170626039, "loss": 6.7743, "mean_token_accuracy": 0.10925297141075134, "num_tokens": 7660565.0, "step": 3535 }, { "entropy": 6.797787475585937, "epoch": 0.3788324682968591, "grad_norm": 1.21875, "learning_rate": 0.000499162878857801, "loss": 6.7711, "mean_token_accuracy": 0.1141252376139164, "num_tokens": 7671600.0, "step": 3540 }, { "entropy": 6.854355716705323, "epoch": 0.37936754240462306, "grad_norm": 1.03125, "learning_rate": 0.0004991595806168915, "loss": 6.7761, "mean_token_accuracy": 0.10867656469345092, "num_tokens": 7682453.0, "step": 3545 }, { "entropy": 6.801757192611694, "epoch": 0.379902616512387, "grad_norm": 1.0, "learning_rate": 0.0004991562759034055, "loss": 6.7221, "mean_token_accuracy": 0.11367509812116623, "num_tokens": 7693490.0, "step": 3550 }, { "entropy": 6.828986072540284, "epoch": 0.38043769062015087, "grad_norm": 1.0859375, "learning_rate": 0.0004991529647174386, "loss": 6.6761, "mean_token_accuracy": 0.1118717484176159, "num_tokens": 7703478.0, "step": 3555 }, { "entropy": 6.7392528533935545, "epoch": 0.3809727647279148, "grad_norm": 1.0859375, "learning_rate": 0.0004991496470590864, "loss": 6.7761, "mean_token_accuracy": 0.1103611208498478, "num_tokens": 7714647.0, "step": 3560 }, { "entropy": 6.863647413253784, "epoch": 0.38150783883567874, "grad_norm": 1.1015625, "learning_rate": 0.0004991463229284445, "loss": 6.7173, "mean_token_accuracy": 0.11717814281582832, "num_tokens": 7725528.0, "step": 3565 }, { "entropy": 6.771598768234253, "epoch": 0.38204291294344267, "grad_norm": 1.109375, "learning_rate": 0.0004991429923256091, "loss": 6.7756, "mean_token_accuracy": 0.11080185323953629, "num_tokens": 7737708.0, "step": 3570 }, { "entropy": 6.878248071670532, "epoch": 0.3825779870512066, "grad_norm": 1.015625, "learning_rate": 0.0004991396552506762, "loss": 6.764, "mean_token_accuracy": 0.11186526715755463, "num_tokens": 7749093.0, "step": 3575 }, { "entropy": 6.7422984600067135, "epoch": 0.38311306115897054, "grad_norm": 1.0546875, "learning_rate": 0.0004991363117037423, "loss": 6.7004, "mean_token_accuracy": 0.11901898533105851, "num_tokens": 7760024.0, "step": 3580 }, { "entropy": 6.767995119094849, "epoch": 0.38364813526673447, "grad_norm": 1.03125, "learning_rate": 0.0004991329616849039, "loss": 6.7284, "mean_token_accuracy": 0.11957356333732605, "num_tokens": 7770801.0, "step": 3585 }, { "entropy": 6.866620016098023, "epoch": 0.38418320937449835, "grad_norm": 1.046875, "learning_rate": 0.0004991296051942578, "loss": 6.7847, "mean_token_accuracy": 0.1116973415017128, "num_tokens": 7782257.0, "step": 3590 }, { "entropy": 6.763524389266967, "epoch": 0.3847182834822623, "grad_norm": 1.015625, "learning_rate": 0.0004991262422319008, "loss": 6.7091, "mean_token_accuracy": 0.11752377822995186, "num_tokens": 7793016.0, "step": 3595 }, { "entropy": 6.7549824714660645, "epoch": 0.3852533575900262, "grad_norm": 1.25, "learning_rate": 0.00049912287279793, "loss": 6.6492, "mean_token_accuracy": 0.1228921391069889, "num_tokens": 7802207.0, "step": 3600 }, { "entropy": 6.812817192077636, "epoch": 0.38578843169779015, "grad_norm": 1.171875, "learning_rate": 0.0004991194968924429, "loss": 6.7834, "mean_token_accuracy": 0.11178419142961502, "num_tokens": 7813487.0, "step": 3605 }, { "entropy": 6.858286571502686, "epoch": 0.3863235058055541, "grad_norm": 1.109375, "learning_rate": 0.0004991161145155367, "loss": 6.7563, "mean_token_accuracy": 0.11035445258021355, "num_tokens": 7824587.0, "step": 3610 }, { "entropy": 6.882280063629151, "epoch": 0.386858579913318, "grad_norm": 1.0625, "learning_rate": 0.0004991127256673091, "loss": 6.7368, "mean_token_accuracy": 0.11012360826134682, "num_tokens": 7836240.0, "step": 3615 }, { "entropy": 6.753285121917725, "epoch": 0.38739365402108195, "grad_norm": 1.15625, "learning_rate": 0.0004991093303478582, "loss": 6.6861, "mean_token_accuracy": 0.11604151576757431, "num_tokens": 7847014.0, "step": 3620 }, { "entropy": 6.788820505142212, "epoch": 0.3879287281288458, "grad_norm": 1.046875, "learning_rate": 0.0004991059285572818, "loss": 6.807, "mean_token_accuracy": 0.11351005062460899, "num_tokens": 7857899.0, "step": 3625 }, { "entropy": 6.857131767272949, "epoch": 0.38846380223660976, "grad_norm": 1.0234375, "learning_rate": 0.0004991025202956781, "loss": 6.6902, "mean_token_accuracy": 0.11639388576149941, "num_tokens": 7868987.0, "step": 3630 }, { "entropy": 6.850029611587525, "epoch": 0.3889988763443737, "grad_norm": 1.1875, "learning_rate": 0.0004990991055631457, "loss": 6.81, "mean_token_accuracy": 0.11189388036727906, "num_tokens": 7879547.0, "step": 3635 }, { "entropy": 6.762338304519654, "epoch": 0.3895339504521376, "grad_norm": 1.0625, "learning_rate": 0.0004990956843597832, "loss": 6.6763, "mean_token_accuracy": 0.1170013889670372, "num_tokens": 7889824.0, "step": 3640 }, { "entropy": 6.673375177383423, "epoch": 0.39006902455990156, "grad_norm": 1.1015625, "learning_rate": 0.0004990922566856892, "loss": 6.669, "mean_token_accuracy": 0.11331403329968452, "num_tokens": 7901156.0, "step": 3645 }, { "entropy": 6.770735454559326, "epoch": 0.3906040986676655, "grad_norm": 1.296875, "learning_rate": 0.0004990888225409629, "loss": 6.7076, "mean_token_accuracy": 0.11252901628613472, "num_tokens": 7911695.0, "step": 3650 }, { "entropy": 6.755655097961426, "epoch": 0.3911391727754294, "grad_norm": 0.984375, "learning_rate": 0.0004990853819257033, "loss": 6.7026, "mean_token_accuracy": 0.11720905601978301, "num_tokens": 7923559.0, "step": 3655 }, { "entropy": 6.84619779586792, "epoch": 0.3916742468831933, "grad_norm": 1.09375, "learning_rate": 0.0004990819348400097, "loss": 6.7214, "mean_token_accuracy": 0.11208191886544228, "num_tokens": 7935792.0, "step": 3660 }, { "entropy": 6.793423795700074, "epoch": 0.39220932099095723, "grad_norm": 1.359375, "learning_rate": 0.0004990784812839818, "loss": 6.7092, "mean_token_accuracy": 0.1186470128595829, "num_tokens": 7946987.0, "step": 3665 }, { "entropy": 6.699849939346313, "epoch": 0.39274439509872117, "grad_norm": 1.125, "learning_rate": 0.0004990750212577192, "loss": 6.6369, "mean_token_accuracy": 0.12066235840320587, "num_tokens": 7957160.0, "step": 3670 }, { "entropy": 6.781460571289062, "epoch": 0.3932794692064851, "grad_norm": 1.09375, "learning_rate": 0.0004990715547613219, "loss": 6.7333, "mean_token_accuracy": 0.10956480428576469, "num_tokens": 7968833.0, "step": 3675 }, { "entropy": 6.873096227645874, "epoch": 0.39381454331424903, "grad_norm": 0.9921875, "learning_rate": 0.0004990680817948898, "loss": 6.7822, "mean_token_accuracy": 0.10927629321813584, "num_tokens": 7980661.0, "step": 3680 }, { "entropy": 6.861059999465942, "epoch": 0.39434961742201297, "grad_norm": 1.1171875, "learning_rate": 0.0004990646023585234, "loss": 6.7065, "mean_token_accuracy": 0.11303527727723121, "num_tokens": 7992677.0, "step": 3685 }, { "entropy": 6.700655746459961, "epoch": 0.3948846915297769, "grad_norm": 1.125, "learning_rate": 0.0004990611164523231, "loss": 6.6919, "mean_token_accuracy": 0.1178669311106205, "num_tokens": 8002796.0, "step": 3690 }, { "entropy": 6.6995728492736815, "epoch": 0.3954197656375408, "grad_norm": 1.171875, "learning_rate": 0.0004990576240763896, "loss": 6.7181, "mean_token_accuracy": 0.11917829737067223, "num_tokens": 8012779.0, "step": 3695 }, { "entropy": 6.79206166267395, "epoch": 0.3959548397453047, "grad_norm": 1.015625, "learning_rate": 0.0004990541252308237, "loss": 6.6986, "mean_token_accuracy": 0.11830845102667809, "num_tokens": 8023442.0, "step": 3700 }, { "entropy": 6.777542209625244, "epoch": 0.39648991385306864, "grad_norm": 1.109375, "learning_rate": 0.0004990506199157263, "loss": 6.7844, "mean_token_accuracy": 0.11193263530731201, "num_tokens": 8035163.0, "step": 3705 }, { "entropy": 6.826216363906861, "epoch": 0.3970249879608326, "grad_norm": 1.1484375, "learning_rate": 0.0004990471081311988, "loss": 6.7221, "mean_token_accuracy": 0.11202551424503326, "num_tokens": 8045330.0, "step": 3710 }, { "entropy": 6.826126527786255, "epoch": 0.3975600620685965, "grad_norm": 0.9921875, "learning_rate": 0.0004990435898773426, "loss": 6.7341, "mean_token_accuracy": 0.11674164608120918, "num_tokens": 8056154.0, "step": 3715 }, { "entropy": 6.795881938934326, "epoch": 0.39809513617636044, "grad_norm": 1.015625, "learning_rate": 0.0004990400651542592, "loss": 6.6916, "mean_token_accuracy": 0.1208396390080452, "num_tokens": 8066101.0, "step": 3720 }, { "entropy": 6.82635269165039, "epoch": 0.3986302102841244, "grad_norm": 1.09375, "learning_rate": 0.0004990365339620504, "loss": 6.778, "mean_token_accuracy": 0.11029551848769188, "num_tokens": 8077249.0, "step": 3725 }, { "entropy": 6.791606903076172, "epoch": 0.39916528439188825, "grad_norm": 1.2734375, "learning_rate": 0.000499032996300818, "loss": 6.7108, "mean_token_accuracy": 0.11683286353945732, "num_tokens": 8088532.0, "step": 3730 }, { "entropy": 6.7761242389678955, "epoch": 0.3997003584996522, "grad_norm": 1.265625, "learning_rate": 0.0004990294521706645, "loss": 6.7513, "mean_token_accuracy": 0.11043450236320496, "num_tokens": 8099541.0, "step": 3735 }, { "entropy": 6.778212356567383, "epoch": 0.4002354326074161, "grad_norm": 1.0, "learning_rate": 0.000499025901571692, "loss": 6.7925, "mean_token_accuracy": 0.11460375785827637, "num_tokens": 8110532.0, "step": 3740 }, { "entropy": 6.860037422180175, "epoch": 0.40077050671518005, "grad_norm": 1.265625, "learning_rate": 0.0004990223445040031, "loss": 6.7246, "mean_token_accuracy": 0.12051974311470985, "num_tokens": 8120991.0, "step": 3745 }, { "entropy": 6.796218538284302, "epoch": 0.401305580822944, "grad_norm": 1.0390625, "learning_rate": 0.0004990187809677004, "loss": 6.6332, "mean_token_accuracy": 0.11498752385377883, "num_tokens": 8130737.0, "step": 3750 }, { "entropy": 6.687275981903076, "epoch": 0.4018406549307079, "grad_norm": 1.3203125, "learning_rate": 0.0004990152109628869, "loss": 6.6614, "mean_token_accuracy": 0.11621819585561752, "num_tokens": 8142315.0, "step": 3755 }, { "entropy": 6.747700786590576, "epoch": 0.40237572903847185, "grad_norm": 1.2734375, "learning_rate": 0.0004990116344896657, "loss": 6.7604, "mean_token_accuracy": 0.10932756140828133, "num_tokens": 8153618.0, "step": 3760 }, { "entropy": 6.786961269378662, "epoch": 0.40291080314623573, "grad_norm": 1.109375, "learning_rate": 0.00049900805154814, "loss": 6.6973, "mean_token_accuracy": 0.11853857338428497, "num_tokens": 8164304.0, "step": 3765 }, { "entropy": 6.784421157836914, "epoch": 0.40344587725399966, "grad_norm": 1.1328125, "learning_rate": 0.0004990044621384134, "loss": 6.694, "mean_token_accuracy": 0.11464422270655632, "num_tokens": 8175289.0, "step": 3770 }, { "entropy": 6.834812927246094, "epoch": 0.4039809513617636, "grad_norm": 1.125, "learning_rate": 0.0004990008662605893, "loss": 6.7375, "mean_token_accuracy": 0.11080463156104088, "num_tokens": 8186274.0, "step": 3775 }, { "entropy": 6.850270223617554, "epoch": 0.40451602546952753, "grad_norm": 1.1640625, "learning_rate": 0.0004989972639147717, "loss": 6.6819, "mean_token_accuracy": 0.11826486811041832, "num_tokens": 8196380.0, "step": 3780 }, { "entropy": 6.745476388931275, "epoch": 0.40505109957729146, "grad_norm": 1.15625, "learning_rate": 0.0004989936551010646, "loss": 6.7327, "mean_token_accuracy": 0.11468399837613105, "num_tokens": 8207204.0, "step": 3785 }, { "entropy": 6.715826034545898, "epoch": 0.4055861736850554, "grad_norm": 1.1796875, "learning_rate": 0.0004989900398195722, "loss": 6.6512, "mean_token_accuracy": 0.11534782201051712, "num_tokens": 8217745.0, "step": 3790 }, { "entropy": 6.774829626083374, "epoch": 0.40612124779281933, "grad_norm": 1.140625, "learning_rate": 0.0004989864180703988, "loss": 6.6424, "mean_token_accuracy": 0.11919590383768082, "num_tokens": 8228171.0, "step": 3795 }, { "entropy": 6.758113431930542, "epoch": 0.4066563219005832, "grad_norm": 1.2421875, "learning_rate": 0.0004989827898536491, "loss": 6.6973, "mean_token_accuracy": 0.11042807400226592, "num_tokens": 8239220.0, "step": 3800 }, { "entropy": 6.832132291793823, "epoch": 0.40719139600834714, "grad_norm": 1.1640625, "learning_rate": 0.0004989791551694279, "loss": 6.7518, "mean_token_accuracy": 0.109524205327034, "num_tokens": 8250363.0, "step": 3805 }, { "entropy": 6.776221656799317, "epoch": 0.4077264701161111, "grad_norm": 1.1171875, "learning_rate": 0.0004989755140178398, "loss": 6.7123, "mean_token_accuracy": 0.11326616704463958, "num_tokens": 8261207.0, "step": 3810 }, { "entropy": 6.741102790832519, "epoch": 0.408261544223875, "grad_norm": 1.109375, "learning_rate": 0.0004989718663989905, "loss": 6.6174, "mean_token_accuracy": 0.11389720663428307, "num_tokens": 8272343.0, "step": 3815 }, { "entropy": 6.711847400665283, "epoch": 0.40879661833163894, "grad_norm": 1.0625, "learning_rate": 0.0004989682123129849, "loss": 6.6662, "mean_token_accuracy": 0.11849249228835106, "num_tokens": 8282677.0, "step": 3820 }, { "entropy": 6.69567084312439, "epoch": 0.40933169243940287, "grad_norm": 1.03125, "learning_rate": 0.0004989645517599286, "loss": 6.6745, "mean_token_accuracy": 0.11427896246314048, "num_tokens": 8292753.0, "step": 3825 }, { "entropy": 6.774503755569458, "epoch": 0.4098667665471668, "grad_norm": 1.046875, "learning_rate": 0.0004989608847399275, "loss": 6.6625, "mean_token_accuracy": 0.11602176800370216, "num_tokens": 8302747.0, "step": 3830 }, { "entropy": 6.774828100204468, "epoch": 0.4104018406549307, "grad_norm": 1.0703125, "learning_rate": 0.0004989572112530871, "loss": 6.7446, "mean_token_accuracy": 0.10802446901798249, "num_tokens": 8314766.0, "step": 3835 }, { "entropy": 6.862928152084351, "epoch": 0.4109369147626946, "grad_norm": 1.0625, "learning_rate": 0.0004989535312995139, "loss": 6.7682, "mean_token_accuracy": 0.11004860624670983, "num_tokens": 8325791.0, "step": 3840 }, { "entropy": 6.746032285690307, "epoch": 0.41147198887045855, "grad_norm": 1.1328125, "learning_rate": 0.0004989498448793139, "loss": 6.6939, "mean_token_accuracy": 0.11601744443178177, "num_tokens": 8335809.0, "step": 3845 }, { "entropy": 6.742163610458374, "epoch": 0.4120070629782225, "grad_norm": 1.0546875, "learning_rate": 0.0004989461519925935, "loss": 6.6923, "mean_token_accuracy": 0.11100121140480042, "num_tokens": 8347505.0, "step": 3850 }, { "entropy": 6.8387268543243405, "epoch": 0.4125421370859864, "grad_norm": 1.0625, "learning_rate": 0.0004989424526394596, "loss": 6.7162, "mean_token_accuracy": 0.1083609253168106, "num_tokens": 8358363.0, "step": 3855 }, { "entropy": 6.726605081558228, "epoch": 0.41307721119375035, "grad_norm": 1.1015625, "learning_rate": 0.0004989387468200187, "loss": 6.7182, "mean_token_accuracy": 0.1165882483124733, "num_tokens": 8369076.0, "step": 3860 }, { "entropy": 6.849684762954712, "epoch": 0.4136122853015143, "grad_norm": 1.109375, "learning_rate": 0.000498935034534378, "loss": 6.7567, "mean_token_accuracy": 0.11488589569926262, "num_tokens": 8380071.0, "step": 3865 }, { "entropy": 6.779253625869751, "epoch": 0.41414735940927816, "grad_norm": 1.0703125, "learning_rate": 0.0004989313157826446, "loss": 6.7043, "mean_token_accuracy": 0.11365948691964149, "num_tokens": 8390574.0, "step": 3870 }, { "entropy": 6.762129831314087, "epoch": 0.4146824335170421, "grad_norm": 1.0859375, "learning_rate": 0.000498927590564926, "loss": 6.7016, "mean_token_accuracy": 0.11860018000006675, "num_tokens": 8401154.0, "step": 3875 }, { "entropy": 6.805259132385254, "epoch": 0.415217507624806, "grad_norm": 1.0546875, "learning_rate": 0.0004989238588813296, "loss": 6.7816, "mean_token_accuracy": 0.10864789858460426, "num_tokens": 8412113.0, "step": 3880 }, { "entropy": 6.893309640884399, "epoch": 0.41575258173256996, "grad_norm": 1.203125, "learning_rate": 0.0004989201207319634, "loss": 6.7582, "mean_token_accuracy": 0.11186528205871582, "num_tokens": 8422734.0, "step": 3885 }, { "entropy": 6.758945322036743, "epoch": 0.4162876558403339, "grad_norm": 1.125, "learning_rate": 0.0004989163761169351, "loss": 6.6912, "mean_token_accuracy": 0.11084168404340744, "num_tokens": 8433647.0, "step": 3890 }, { "entropy": 6.744187116622925, "epoch": 0.4168227299480978, "grad_norm": 1.203125, "learning_rate": 0.0004989126250363529, "loss": 6.7234, "mean_token_accuracy": 0.11423909962177277, "num_tokens": 8444726.0, "step": 3895 }, { "entropy": 6.83604621887207, "epoch": 0.41735780405586176, "grad_norm": 1.09375, "learning_rate": 0.0004989088674903251, "loss": 6.7264, "mean_token_accuracy": 0.11136697009205818, "num_tokens": 8455351.0, "step": 3900 }, { "entropy": 6.788657855987549, "epoch": 0.41789287816362564, "grad_norm": 1.0703125, "learning_rate": 0.0004989051034789602, "loss": 6.7073, "mean_token_accuracy": 0.11919761151075363, "num_tokens": 8466423.0, "step": 3905 }, { "entropy": 6.769079303741455, "epoch": 0.41842795227138957, "grad_norm": 1.28125, "learning_rate": 0.000498901333002367, "loss": 6.6522, "mean_token_accuracy": 0.11701465100049972, "num_tokens": 8475841.0, "step": 3910 }, { "entropy": 6.814233303070068, "epoch": 0.4189630263791535, "grad_norm": 1.03125, "learning_rate": 0.0004988975560606541, "loss": 6.762, "mean_token_accuracy": 0.11229455918073654, "num_tokens": 8487656.0, "step": 3915 }, { "entropy": 6.776022148132324, "epoch": 0.41949810048691744, "grad_norm": 1.1640625, "learning_rate": 0.0004988937726539308, "loss": 6.7744, "mean_token_accuracy": 0.10670395717024803, "num_tokens": 8497959.0, "step": 3920 }, { "entropy": 6.763610315322876, "epoch": 0.42003317459468137, "grad_norm": 1.078125, "learning_rate": 0.0004988899827823062, "loss": 6.6751, "mean_token_accuracy": 0.11493971273303032, "num_tokens": 8508228.0, "step": 3925 }, { "entropy": 6.782846927642822, "epoch": 0.4205682487024453, "grad_norm": 1.171875, "learning_rate": 0.00049888618644589, "loss": 6.7229, "mean_token_accuracy": 0.11063806042075157, "num_tokens": 8518999.0, "step": 3930 }, { "entropy": 6.691450452804565, "epoch": 0.42110332281020924, "grad_norm": 1.2265625, "learning_rate": 0.0004988823836447916, "loss": 6.7519, "mean_token_accuracy": 0.11179999187588692, "num_tokens": 8529583.0, "step": 3935 }, { "entropy": 6.894530963897705, "epoch": 0.4216383969179731, "grad_norm": 1.4609375, "learning_rate": 0.0004988785743791207, "loss": 6.8223, "mean_token_accuracy": 0.10763506144285202, "num_tokens": 8540069.0, "step": 3940 }, { "entropy": 6.875021266937256, "epoch": 0.42217347102573705, "grad_norm": 1.1953125, "learning_rate": 0.0004988747586489876, "loss": 6.7009, "mean_token_accuracy": 0.11498932242393493, "num_tokens": 8550441.0, "step": 3945 }, { "entropy": 6.709805822372436, "epoch": 0.422708545133501, "grad_norm": 1.0546875, "learning_rate": 0.000498870936454502, "loss": 6.6653, "mean_token_accuracy": 0.11834602132439613, "num_tokens": 8560257.0, "step": 3950 }, { "entropy": 6.828940343856812, "epoch": 0.4232436192412649, "grad_norm": 1.078125, "learning_rate": 0.0004988671077957749, "loss": 6.7485, "mean_token_accuracy": 0.1175241857767105, "num_tokens": 8570991.0, "step": 3955 }, { "entropy": 6.891437435150147, "epoch": 0.42377869334902885, "grad_norm": 1.609375, "learning_rate": 0.0004988632726729164, "loss": 6.8051, "mean_token_accuracy": 0.10697821751236916, "num_tokens": 8583668.0, "step": 3960 }, { "entropy": 6.802229166030884, "epoch": 0.4243137674567928, "grad_norm": 1.109375, "learning_rate": 0.0004988594310860374, "loss": 6.7184, "mean_token_accuracy": 0.1156295083463192, "num_tokens": 8593727.0, "step": 3965 }, { "entropy": 6.714612770080566, "epoch": 0.4248488415645567, "grad_norm": 1.0625, "learning_rate": 0.0004988555830352485, "loss": 6.7209, "mean_token_accuracy": 0.11398242264986039, "num_tokens": 8605470.0, "step": 3970 }, { "entropy": 6.7963508605957035, "epoch": 0.4253839156723206, "grad_norm": 1.0234375, "learning_rate": 0.0004988517285206614, "loss": 6.6687, "mean_token_accuracy": 0.11099848076701165, "num_tokens": 8617176.0, "step": 3975 }, { "entropy": 6.803634119033814, "epoch": 0.4259189897800845, "grad_norm": 1.0703125, "learning_rate": 0.0004988478675423871, "loss": 6.7558, "mean_token_accuracy": 0.11225240230560303, "num_tokens": 8627756.0, "step": 3980 }, { "entropy": 6.793984985351562, "epoch": 0.42645406388784846, "grad_norm": 1.234375, "learning_rate": 0.0004988440001005369, "loss": 6.6853, "mean_token_accuracy": 0.11842627823352814, "num_tokens": 8637766.0, "step": 3985 }, { "entropy": 6.800572538375855, "epoch": 0.4269891379956124, "grad_norm": 1.1640625, "learning_rate": 0.0004988401261952227, "loss": 6.7096, "mean_token_accuracy": 0.11486690863966942, "num_tokens": 8648562.0, "step": 3990 }, { "entropy": 6.808977746963501, "epoch": 0.4275242121033763, "grad_norm": 1.1875, "learning_rate": 0.0004988362458265565, "loss": 6.7412, "mean_token_accuracy": 0.10799469202756881, "num_tokens": 8658393.0, "step": 3995 }, { "entropy": 6.730482482910157, "epoch": 0.42805928621114026, "grad_norm": 1.125, "learning_rate": 0.0004988323589946499, "loss": 6.6543, "mean_token_accuracy": 0.1162540040910244, "num_tokens": 8668365.0, "step": 4000 }, { "entropy": 6.777298212051392, "epoch": 0.4285943603189042, "grad_norm": 1.1953125, "learning_rate": 0.0004988284656996156, "loss": 6.7009, "mean_token_accuracy": 0.1099359154701233, "num_tokens": 8679228.0, "step": 4005 }, { "entropy": 6.780287981033325, "epoch": 0.42912943442666807, "grad_norm": 1.234375, "learning_rate": 0.0004988245659415656, "loss": 6.5866, "mean_token_accuracy": 0.12446512654423714, "num_tokens": 8688940.0, "step": 4010 }, { "entropy": 6.810698747634888, "epoch": 0.429664508534432, "grad_norm": 1.1796875, "learning_rate": 0.0004988206597206129, "loss": 6.7438, "mean_token_accuracy": 0.10872282534837723, "num_tokens": 8699923.0, "step": 4015 }, { "entropy": 6.720220708847046, "epoch": 0.43019958264219593, "grad_norm": 1.0546875, "learning_rate": 0.00049881674703687, "loss": 6.58, "mean_token_accuracy": 0.12176239043474198, "num_tokens": 8710445.0, "step": 4020 }, { "entropy": 6.721858978271484, "epoch": 0.43073465674995987, "grad_norm": 1.3046875, "learning_rate": 0.0004988128278904499, "loss": 6.7083, "mean_token_accuracy": 0.11447286382317542, "num_tokens": 8720686.0, "step": 4025 }, { "entropy": 6.834508752822876, "epoch": 0.4312697308577238, "grad_norm": 1.140625, "learning_rate": 0.000498808902281466, "loss": 6.7282, "mean_token_accuracy": 0.11510429829359055, "num_tokens": 8732122.0, "step": 4030 }, { "entropy": 6.744071006774902, "epoch": 0.43180480496548773, "grad_norm": 1.125, "learning_rate": 0.0004988049702100315, "loss": 6.6825, "mean_token_accuracy": 0.1182553879916668, "num_tokens": 8744122.0, "step": 4035 }, { "entropy": 6.787398195266723, "epoch": 0.43233987907325166, "grad_norm": 0.984375, "learning_rate": 0.0004988010316762598, "loss": 6.6911, "mean_token_accuracy": 0.115293999761343, "num_tokens": 8754758.0, "step": 4040 }, { "entropy": 6.7287671089172365, "epoch": 0.4328749531810156, "grad_norm": 1.1953125, "learning_rate": 0.0004987970866802649, "loss": 6.7121, "mean_token_accuracy": 0.10785665214061738, "num_tokens": 8766577.0, "step": 4045 }, { "entropy": 6.773381233215332, "epoch": 0.4334100272887795, "grad_norm": 1.1171875, "learning_rate": 0.0004987931352221605, "loss": 6.7083, "mean_token_accuracy": 0.11141579747200012, "num_tokens": 8777698.0, "step": 4050 }, { "entropy": 6.788628673553466, "epoch": 0.4339451013965434, "grad_norm": 1.0546875, "learning_rate": 0.0004987891773020606, "loss": 6.7231, "mean_token_accuracy": 0.11151274070143699, "num_tokens": 8788637.0, "step": 4055 }, { "entropy": 6.799765920639038, "epoch": 0.43448017550430734, "grad_norm": 1.265625, "learning_rate": 0.0004987852129200799, "loss": 6.7009, "mean_token_accuracy": 0.11956919953227044, "num_tokens": 8799709.0, "step": 4060 }, { "entropy": 6.795716381072998, "epoch": 0.4350152496120713, "grad_norm": 1.171875, "learning_rate": 0.0004987812420763326, "loss": 6.6905, "mean_token_accuracy": 0.11553208827972412, "num_tokens": 8810469.0, "step": 4065 }, { "entropy": 6.7736915111541744, "epoch": 0.4355503237198352, "grad_norm": 1.171875, "learning_rate": 0.0004987772647709333, "loss": 6.6708, "mean_token_accuracy": 0.1123408019542694, "num_tokens": 8821142.0, "step": 4070 }, { "entropy": 6.70412278175354, "epoch": 0.43608539782759914, "grad_norm": 1.1796875, "learning_rate": 0.000498773281003997, "loss": 6.6226, "mean_token_accuracy": 0.12270026281476021, "num_tokens": 8832951.0, "step": 4075 }, { "entropy": 6.725498294830322, "epoch": 0.4366204719353631, "grad_norm": 1.3203125, "learning_rate": 0.0004987692907756385, "loss": 6.7344, "mean_token_accuracy": 0.10939609631896019, "num_tokens": 8843579.0, "step": 4080 }, { "entropy": 6.6969774723052975, "epoch": 0.43715554604312695, "grad_norm": 1.125, "learning_rate": 0.0004987652940859733, "loss": 6.6606, "mean_token_accuracy": 0.10758041813969613, "num_tokens": 8854612.0, "step": 4085 }, { "entropy": 6.766866064071655, "epoch": 0.4376906201508909, "grad_norm": 1.0390625, "learning_rate": 0.0004987612909351167, "loss": 6.6101, "mean_token_accuracy": 0.12067801505327225, "num_tokens": 8865584.0, "step": 4090 }, { "entropy": 6.688352346420288, "epoch": 0.4382256942586548, "grad_norm": 1.109375, "learning_rate": 0.0004987572813231842, "loss": 6.66, "mean_token_accuracy": 0.12287814989686012, "num_tokens": 8876662.0, "step": 4095 }, { "entropy": 6.756010103225708, "epoch": 0.43876076836641875, "grad_norm": 1.09375, "learning_rate": 0.0004987532652502917, "loss": 6.6831, "mean_token_accuracy": 0.11270663142204285, "num_tokens": 8887249.0, "step": 4100 }, { "entropy": 6.713475131988526, "epoch": 0.4392958424741827, "grad_norm": 1.2109375, "learning_rate": 0.0004987492427165551, "loss": 6.531, "mean_token_accuracy": 0.1301178902387619, "num_tokens": 8898635.0, "step": 4105 }, { "entropy": 6.678007888793945, "epoch": 0.4398309165819466, "grad_norm": 1.09375, "learning_rate": 0.0004987452137220906, "loss": 6.6895, "mean_token_accuracy": 0.11399767398834229, "num_tokens": 8908794.0, "step": 4110 }, { "entropy": 6.847482490539551, "epoch": 0.44036599068971055, "grad_norm": 1.171875, "learning_rate": 0.0004987411782670144, "loss": 6.7013, "mean_token_accuracy": 0.10850507244467736, "num_tokens": 8919015.0, "step": 4115 }, { "entropy": 6.8152250289917, "epoch": 0.44090106479747443, "grad_norm": 1.140625, "learning_rate": 0.0004987371363514431, "loss": 6.7349, "mean_token_accuracy": 0.10842297747731208, "num_tokens": 8929028.0, "step": 4120 }, { "entropy": 6.664592504501343, "epoch": 0.44143613890523836, "grad_norm": 1.125, "learning_rate": 0.0004987330879754933, "loss": 6.6382, "mean_token_accuracy": 0.11036456525325775, "num_tokens": 8939789.0, "step": 4125 }, { "entropy": 6.707959175109863, "epoch": 0.4419712130130023, "grad_norm": 1.015625, "learning_rate": 0.0004987290331392823, "loss": 6.6225, "mean_token_accuracy": 0.11801224276423454, "num_tokens": 8950657.0, "step": 4130 }, { "entropy": 6.828504610061645, "epoch": 0.44250628712076623, "grad_norm": 1.0546875, "learning_rate": 0.0004987249718429269, "loss": 6.7236, "mean_token_accuracy": 0.11803532913327217, "num_tokens": 8960744.0, "step": 4135 }, { "entropy": 6.705205869674683, "epoch": 0.44304136122853016, "grad_norm": 1.09375, "learning_rate": 0.0004987209040865441, "loss": 6.5768, "mean_token_accuracy": 0.12112260162830353, "num_tokens": 8972411.0, "step": 4140 }, { "entropy": 6.801696109771728, "epoch": 0.4435764353362941, "grad_norm": 1.2265625, "learning_rate": 0.0004987168298702519, "loss": 6.7465, "mean_token_accuracy": 0.11419489085674286, "num_tokens": 8982818.0, "step": 4145 }, { "entropy": 6.745963048934937, "epoch": 0.44411150944405803, "grad_norm": 1.234375, "learning_rate": 0.0004987127491941675, "loss": 6.6657, "mean_token_accuracy": 0.1177960142493248, "num_tokens": 8993227.0, "step": 4150 }, { "entropy": 6.669366073608399, "epoch": 0.4446465835518219, "grad_norm": 1.25, "learning_rate": 0.0004987086620584091, "loss": 6.6037, "mean_token_accuracy": 0.11799841225147248, "num_tokens": 9003796.0, "step": 4155 }, { "entropy": 6.772842884063721, "epoch": 0.44518165765958584, "grad_norm": 1.421875, "learning_rate": 0.0004987045684630944, "loss": 6.6369, "mean_token_accuracy": 0.12047947198152542, "num_tokens": 9014931.0, "step": 4160 }, { "entropy": 6.774410676956177, "epoch": 0.44571673176734977, "grad_norm": 1.15625, "learning_rate": 0.0004987004684083417, "loss": 6.6984, "mean_token_accuracy": 0.1164324201643467, "num_tokens": 9025312.0, "step": 4165 }, { "entropy": 6.7285847663879395, "epoch": 0.4462518058751137, "grad_norm": 1.1015625, "learning_rate": 0.0004986963618942694, "loss": 6.6642, "mean_token_accuracy": 0.12318786159157753, "num_tokens": 9035563.0, "step": 4170 }, { "entropy": 6.795755052566529, "epoch": 0.44678687998287764, "grad_norm": 1.2578125, "learning_rate": 0.0004986922489209961, "loss": 6.7039, "mean_token_accuracy": 0.1175026074051857, "num_tokens": 9046065.0, "step": 4175 }, { "entropy": 6.751359653472901, "epoch": 0.44732195409064157, "grad_norm": 1.0625, "learning_rate": 0.0004986881294886406, "loss": 6.6057, "mean_token_accuracy": 0.1231963075697422, "num_tokens": 9056696.0, "step": 4180 }, { "entropy": 6.676720142364502, "epoch": 0.4478570281984055, "grad_norm": 1.171875, "learning_rate": 0.0004986840035973218, "loss": 6.6808, "mean_token_accuracy": 0.11223538517951966, "num_tokens": 9067035.0, "step": 4185 }, { "entropy": 6.6606361865997314, "epoch": 0.4483921023061694, "grad_norm": 1.140625, "learning_rate": 0.0004986798712471588, "loss": 6.6574, "mean_token_accuracy": 0.11127996742725373, "num_tokens": 9078253.0, "step": 4190 }, { "entropy": 6.8346106052398685, "epoch": 0.4489271764139333, "grad_norm": 1.296875, "learning_rate": 0.0004986757324382709, "loss": 6.7174, "mean_token_accuracy": 0.10800155103206635, "num_tokens": 9088184.0, "step": 4195 }, { "entropy": 6.7804230690002445, "epoch": 0.44946225052169725, "grad_norm": 1.1953125, "learning_rate": 0.0004986715871707777, "loss": 6.7777, "mean_token_accuracy": 0.1087512344121933, "num_tokens": 9099321.0, "step": 4200 }, { "entropy": 6.843128871917725, "epoch": 0.4499973246294612, "grad_norm": 1.140625, "learning_rate": 0.0004986674354447988, "loss": 6.8009, "mean_token_accuracy": 0.11305928155779839, "num_tokens": 9111410.0, "step": 4205 }, { "entropy": 6.831840133666992, "epoch": 0.4505323987372251, "grad_norm": 1.1796875, "learning_rate": 0.0004986632772604543, "loss": 6.6256, "mean_token_accuracy": 0.11788237541913986, "num_tokens": 9121932.0, "step": 4210 }, { "entropy": 6.651640558242798, "epoch": 0.45106747284498905, "grad_norm": 1.6640625, "learning_rate": 0.0004986591126178639, "loss": 6.7181, "mean_token_accuracy": 0.1195308357477188, "num_tokens": 9132686.0, "step": 4215 }, { "entropy": 6.678121089935303, "epoch": 0.451602546952753, "grad_norm": 1.4375, "learning_rate": 0.0004986549415171482, "loss": 6.6445, "mean_token_accuracy": 0.11687054708600045, "num_tokens": 9143582.0, "step": 4220 }, { "entropy": 6.877950763702392, "epoch": 0.45213762106051686, "grad_norm": 1.09375, "learning_rate": 0.0004986507639584274, "loss": 6.7232, "mean_token_accuracy": 0.11007717251777649, "num_tokens": 9156173.0, "step": 4225 }, { "entropy": 6.7473616123199465, "epoch": 0.4526726951682808, "grad_norm": 1.2265625, "learning_rate": 0.0004986465799418223, "loss": 6.7062, "mean_token_accuracy": 0.11616904065012931, "num_tokens": 9166882.0, "step": 4230 }, { "entropy": 6.726114082336426, "epoch": 0.4532077692760447, "grad_norm": 1.28125, "learning_rate": 0.0004986423894674534, "loss": 6.7034, "mean_token_accuracy": 0.11051197499036788, "num_tokens": 9177525.0, "step": 4235 }, { "entropy": 6.824288320541382, "epoch": 0.45374284338380866, "grad_norm": 1.21875, "learning_rate": 0.0004986381925354422, "loss": 6.6713, "mean_token_accuracy": 0.11391364932060241, "num_tokens": 9188586.0, "step": 4240 }, { "entropy": 6.741261911392212, "epoch": 0.4542779174915726, "grad_norm": 1.328125, "learning_rate": 0.0004986339891459094, "loss": 6.5797, "mean_token_accuracy": 0.11786932200193405, "num_tokens": 9199920.0, "step": 4245 }, { "entropy": 6.590327644348145, "epoch": 0.4548129915993365, "grad_norm": 1.21875, "learning_rate": 0.0004986297792989768, "loss": 6.583, "mean_token_accuracy": 0.12098821178078652, "num_tokens": 9210923.0, "step": 4250 }, { "entropy": 6.832316637039185, "epoch": 0.45534806570710046, "grad_norm": 1.2421875, "learning_rate": 0.0004986255629947655, "loss": 6.7539, "mean_token_accuracy": 0.10964171513915062, "num_tokens": 9221459.0, "step": 4255 }, { "entropy": 6.773038291931153, "epoch": 0.45588313981486434, "grad_norm": 1.1953125, "learning_rate": 0.0004986213402333978, "loss": 6.6935, "mean_token_accuracy": 0.11024248600006104, "num_tokens": 9231768.0, "step": 4260 }, { "entropy": 6.713382816314697, "epoch": 0.45641821392262827, "grad_norm": 1.09375, "learning_rate": 0.0004986171110149951, "loss": 6.6848, "mean_token_accuracy": 0.11179919168353081, "num_tokens": 9242230.0, "step": 4265 }, { "entropy": 6.807206058502198, "epoch": 0.4569532880303922, "grad_norm": 1.0859375, "learning_rate": 0.0004986128753396798, "loss": 6.5794, "mean_token_accuracy": 0.1219303086400032, "num_tokens": 9252485.0, "step": 4270 }, { "entropy": 6.657087945938111, "epoch": 0.45748836213815613, "grad_norm": 1.3125, "learning_rate": 0.0004986086332075742, "loss": 6.6527, "mean_token_accuracy": 0.12027468383312226, "num_tokens": 9263014.0, "step": 4275 }, { "entropy": 6.737786865234375, "epoch": 0.45802343624592007, "grad_norm": 1.3046875, "learning_rate": 0.0004986043846188006, "loss": 6.6932, "mean_token_accuracy": 0.12059752494096757, "num_tokens": 9273777.0, "step": 4280 }, { "entropy": 6.658463954925537, "epoch": 0.458558510353684, "grad_norm": 1.3203125, "learning_rate": 0.000498600129573482, "loss": 6.6266, "mean_token_accuracy": 0.11395588889718056, "num_tokens": 9284738.0, "step": 4285 }, { "entropy": 6.793663120269775, "epoch": 0.45909358446144793, "grad_norm": 1.125, "learning_rate": 0.000498595868071741, "loss": 6.6807, "mean_token_accuracy": 0.11528572961688041, "num_tokens": 9295921.0, "step": 4290 }, { "entropy": 6.744870233535766, "epoch": 0.4596286585692118, "grad_norm": 1.2421875, "learning_rate": 0.0004985916001137006, "loss": 6.6609, "mean_token_accuracy": 0.11062274277210235, "num_tokens": 9306568.0, "step": 4295 }, { "entropy": 6.757999467849731, "epoch": 0.46016373267697575, "grad_norm": 1.1875, "learning_rate": 0.0004985873256994843, "loss": 6.6262, "mean_token_accuracy": 0.11653959006071091, "num_tokens": 9316468.0, "step": 4300 }, { "entropy": 6.737951755523682, "epoch": 0.4606988067847397, "grad_norm": 1.21875, "learning_rate": 0.0004985830448292154, "loss": 6.7008, "mean_token_accuracy": 0.1143273763358593, "num_tokens": 9328185.0, "step": 4305 }, { "entropy": 6.743026876449585, "epoch": 0.4612338808925036, "grad_norm": 1.234375, "learning_rate": 0.0004985787575030175, "loss": 6.6547, "mean_token_accuracy": 0.11528828516602516, "num_tokens": 9338591.0, "step": 4310 }, { "entropy": 6.768393468856812, "epoch": 0.46176895500026754, "grad_norm": 1.078125, "learning_rate": 0.0004985744637210144, "loss": 6.6761, "mean_token_accuracy": 0.11174369007349014, "num_tokens": 9349286.0, "step": 4315 }, { "entropy": 6.783293533325195, "epoch": 0.4623040291080315, "grad_norm": 1.375, "learning_rate": 0.00049857016348333, "loss": 6.658, "mean_token_accuracy": 0.11993650272488594, "num_tokens": 9359752.0, "step": 4320 }, { "entropy": 6.78243350982666, "epoch": 0.4628391032157954, "grad_norm": 1.1953125, "learning_rate": 0.0004985658567900886, "loss": 6.7129, "mean_token_accuracy": 0.1122040569782257, "num_tokens": 9371823.0, "step": 4325 }, { "entropy": 6.643386602401733, "epoch": 0.4633741773235593, "grad_norm": 1.0703125, "learning_rate": 0.0004985615436414145, "loss": 6.5839, "mean_token_accuracy": 0.11392313092947007, "num_tokens": 9383127.0, "step": 4330 }, { "entropy": 6.734666919708252, "epoch": 0.4639092514313232, "grad_norm": 1.1875, "learning_rate": 0.0004985572240374321, "loss": 6.6771, "mean_token_accuracy": 0.11793937757611275, "num_tokens": 9394296.0, "step": 4335 }, { "entropy": 6.754271030426025, "epoch": 0.46444432553908715, "grad_norm": 1.1640625, "learning_rate": 0.0004985528979782665, "loss": 6.6688, "mean_token_accuracy": 0.11072949096560478, "num_tokens": 9405988.0, "step": 4340 }, { "entropy": 6.822707033157348, "epoch": 0.4649793996468511, "grad_norm": 1.1015625, "learning_rate": 0.0004985485654640423, "loss": 6.6693, "mean_token_accuracy": 0.1139429748058319, "num_tokens": 9417479.0, "step": 4345 }, { "entropy": 6.696816492080688, "epoch": 0.465514473754615, "grad_norm": 1.375, "learning_rate": 0.0004985442264948847, "loss": 6.6197, "mean_token_accuracy": 0.11986967846751213, "num_tokens": 9428050.0, "step": 4350 }, { "entropy": 6.653148794174195, "epoch": 0.46604954786237895, "grad_norm": 1.1484375, "learning_rate": 0.0004985398810709189, "loss": 6.5722, "mean_token_accuracy": 0.12251258864998818, "num_tokens": 9438229.0, "step": 4355 }, { "entropy": 6.654054975509643, "epoch": 0.4665846219701429, "grad_norm": 1.171875, "learning_rate": 0.0004985355291922704, "loss": 6.6493, "mean_token_accuracy": 0.11258513107895851, "num_tokens": 9449611.0, "step": 4360 }, { "entropy": 6.709498739242553, "epoch": 0.46711969607790677, "grad_norm": 1.515625, "learning_rate": 0.000498531170859065, "loss": 6.614, "mean_token_accuracy": 0.11630048006772994, "num_tokens": 9460234.0, "step": 4365 }, { "entropy": 6.828418874740601, "epoch": 0.4676547701856707, "grad_norm": 1.625, "learning_rate": 0.0004985268060714285, "loss": 6.7023, "mean_token_accuracy": 0.1152671605348587, "num_tokens": 9472136.0, "step": 4370 }, { "entropy": 6.6818465232849125, "epoch": 0.46818984429343463, "grad_norm": 1.3515625, "learning_rate": 0.0004985224348294868, "loss": 6.6403, "mean_token_accuracy": 0.12047104090452194, "num_tokens": 9482602.0, "step": 4375 }, { "entropy": 6.785189914703369, "epoch": 0.46872491840119856, "grad_norm": 1.28125, "learning_rate": 0.0004985180571333663, "loss": 6.6442, "mean_token_accuracy": 0.11965756639838218, "num_tokens": 9493782.0, "step": 4380 }, { "entropy": 6.763046312332153, "epoch": 0.4692599925089625, "grad_norm": 1.5078125, "learning_rate": 0.0004985136729831932, "loss": 6.6249, "mean_token_accuracy": 0.11808878481388092, "num_tokens": 9504389.0, "step": 4385 }, { "entropy": 6.648394393920898, "epoch": 0.46979506661672643, "grad_norm": 1.5390625, "learning_rate": 0.0004985092823790942, "loss": 6.7447, "mean_token_accuracy": 0.1183752790093422, "num_tokens": 9515166.0, "step": 4390 }, { "entropy": 6.747145318984986, "epoch": 0.47033014072449036, "grad_norm": 1.140625, "learning_rate": 0.0004985048853211961, "loss": 6.6434, "mean_token_accuracy": 0.116434495896101, "num_tokens": 9525566.0, "step": 4395 }, { "entropy": 6.7929564952850345, "epoch": 0.47086521483225424, "grad_norm": 1.21875, "learning_rate": 0.000498500481809626, "loss": 6.5549, "mean_token_accuracy": 0.1208685427904129, "num_tokens": 9536021.0, "step": 4400 }, { "entropy": 6.649615907669068, "epoch": 0.4714002889400182, "grad_norm": 1.3984375, "learning_rate": 0.0004984960718445107, "loss": 6.6641, "mean_token_accuracy": 0.11327528953552246, "num_tokens": 9546827.0, "step": 4405 }, { "entropy": 6.756602811813354, "epoch": 0.4719353630477821, "grad_norm": 1.28125, "learning_rate": 0.0004984916554259778, "loss": 6.7758, "mean_token_accuracy": 0.10899243578314781, "num_tokens": 9558104.0, "step": 4410 }, { "entropy": 6.866197681427002, "epoch": 0.47247043715554604, "grad_norm": 1.1796875, "learning_rate": 0.0004984872325541547, "loss": 6.668, "mean_token_accuracy": 0.11704885140061379, "num_tokens": 9568487.0, "step": 4415 }, { "entropy": 6.716640186309815, "epoch": 0.47300551126331, "grad_norm": 1.3125, "learning_rate": 0.0004984828032291692, "loss": 6.6107, "mean_token_accuracy": 0.12084364518523216, "num_tokens": 9579509.0, "step": 4420 }, { "entropy": 6.742200565338135, "epoch": 0.4735405853710739, "grad_norm": 1.96875, "learning_rate": 0.0004984783674511492, "loss": 6.64, "mean_token_accuracy": 0.1198382891714573, "num_tokens": 9589931.0, "step": 4425 }, { "entropy": 6.761376428604126, "epoch": 0.47407565947883784, "grad_norm": 1.328125, "learning_rate": 0.0004984739252202227, "loss": 6.6733, "mean_token_accuracy": 0.11940053328871728, "num_tokens": 9599764.0, "step": 4430 }, { "entropy": 6.7573480129241945, "epoch": 0.4746107335866017, "grad_norm": 1.2578125, "learning_rate": 0.000498469476536518, "loss": 6.6472, "mean_token_accuracy": 0.1184098556637764, "num_tokens": 9611145.0, "step": 4435 }, { "entropy": 6.6948751449584964, "epoch": 0.47514580769436565, "grad_norm": 1.4453125, "learning_rate": 0.0004984650214001636, "loss": 6.6436, "mean_token_accuracy": 0.12355822175741196, "num_tokens": 9621441.0, "step": 4440 }, { "entropy": 6.741222667694092, "epoch": 0.4756808818021296, "grad_norm": 1.59375, "learning_rate": 0.0004984605598112881, "loss": 6.6857, "mean_token_accuracy": 0.12146021127700805, "num_tokens": 9631874.0, "step": 4445 }, { "entropy": 6.717041254043579, "epoch": 0.4762159559098935, "grad_norm": 1.1484375, "learning_rate": 0.0004984560917700204, "loss": 6.6614, "mean_token_accuracy": 0.11106858849525451, "num_tokens": 9643006.0, "step": 4450 }, { "entropy": 6.698492193222046, "epoch": 0.47675103001765745, "grad_norm": 1.328125, "learning_rate": 0.0004984516172764894, "loss": 6.5533, "mean_token_accuracy": 0.12116582468152046, "num_tokens": 9653897.0, "step": 4455 }, { "entropy": 6.691738748550415, "epoch": 0.4772861041254214, "grad_norm": 1.2734375, "learning_rate": 0.0004984471363308243, "loss": 6.6263, "mean_token_accuracy": 0.1176533468067646, "num_tokens": 9664460.0, "step": 4460 }, { "entropy": 6.711106204986573, "epoch": 0.4778211782331853, "grad_norm": 1.1015625, "learning_rate": 0.0004984426489331546, "loss": 6.6385, "mean_token_accuracy": 0.12148366495966911, "num_tokens": 9674534.0, "step": 4465 }, { "entropy": 6.8625555515289305, "epoch": 0.4783562523409492, "grad_norm": 1.2109375, "learning_rate": 0.0004984381550836097, "loss": 6.732, "mean_token_accuracy": 0.11358912587165833, "num_tokens": 9684828.0, "step": 4470 }, { "entropy": 6.851891565322876, "epoch": 0.47889132644871313, "grad_norm": 1.6015625, "learning_rate": 0.0004984336547823196, "loss": 6.6838, "mean_token_accuracy": 0.11679960638284684, "num_tokens": 9694536.0, "step": 4475 }, { "entropy": 6.712016582489014, "epoch": 0.47942640055647706, "grad_norm": 1.0703125, "learning_rate": 0.000498429148029414, "loss": 6.5548, "mean_token_accuracy": 0.12640432715415956, "num_tokens": 9705715.0, "step": 4480 }, { "entropy": 6.654127883911133, "epoch": 0.479961474664241, "grad_norm": 1.125, "learning_rate": 0.0004984246348250233, "loss": 6.6293, "mean_token_accuracy": 0.12291777729988099, "num_tokens": 9717505.0, "step": 4485 }, { "entropy": 6.698559045791626, "epoch": 0.4804965487720049, "grad_norm": 1.15625, "learning_rate": 0.0004984201151692775, "loss": 6.5005, "mean_token_accuracy": 0.11582913845777512, "num_tokens": 9727910.0, "step": 4490 }, { "entropy": 6.681623268127441, "epoch": 0.48103162287976886, "grad_norm": 1.2578125, "learning_rate": 0.0004984155890623074, "loss": 6.6164, "mean_token_accuracy": 0.12003767117857933, "num_tokens": 9738528.0, "step": 4495 }, { "entropy": 6.688356590270996, "epoch": 0.4815666969875328, "grad_norm": 1.1484375, "learning_rate": 0.0004984110565042435, "loss": 6.6433, "mean_token_accuracy": 0.11511807218194008, "num_tokens": 9749744.0, "step": 4500 }, { "entropy": 6.787782335281372, "epoch": 0.48210177109529667, "grad_norm": 1.1796875, "learning_rate": 0.0004984065174952168, "loss": 6.6415, "mean_token_accuracy": 0.11788514703512191, "num_tokens": 9759968.0, "step": 4505 }, { "entropy": 6.7138995170593265, "epoch": 0.4826368452030606, "grad_norm": 1.3046875, "learning_rate": 0.0004984019720353582, "loss": 6.6483, "mean_token_accuracy": 0.11984834149479866, "num_tokens": 9769791.0, "step": 4510 }, { "entropy": 6.669849443435669, "epoch": 0.48317191931082454, "grad_norm": 1.1953125, "learning_rate": 0.0004983974201247991, "loss": 6.6168, "mean_token_accuracy": 0.12382967993617058, "num_tokens": 9780369.0, "step": 4515 }, { "entropy": 6.718169641494751, "epoch": 0.48370699341858847, "grad_norm": 1.0703125, "learning_rate": 0.0004983928617636709, "loss": 6.6649, "mean_token_accuracy": 0.11595848128199578, "num_tokens": 9791125.0, "step": 4520 }, { "entropy": 6.822065162658691, "epoch": 0.4842420675263524, "grad_norm": 1.296875, "learning_rate": 0.0004983882969521052, "loss": 6.6623, "mean_token_accuracy": 0.11691764071583748, "num_tokens": 9801697.0, "step": 4525 }, { "entropy": 6.784085750579834, "epoch": 0.48477714163411634, "grad_norm": 1.046875, "learning_rate": 0.0004983837256902338, "loss": 6.7085, "mean_token_accuracy": 0.1206382617354393, "num_tokens": 9812171.0, "step": 4530 }, { "entropy": 6.700609016418457, "epoch": 0.48531221574188027, "grad_norm": 1.1171875, "learning_rate": 0.0004983791479781887, "loss": 6.5452, "mean_token_accuracy": 0.12644470036029815, "num_tokens": 9821596.0, "step": 4535 }, { "entropy": 6.76994104385376, "epoch": 0.48584728984964415, "grad_norm": 1.296875, "learning_rate": 0.0004983745638161021, "loss": 6.6662, "mean_token_accuracy": 0.10886719152331352, "num_tokens": 9831634.0, "step": 4540 }, { "entropy": 6.702042055130005, "epoch": 0.4863823639574081, "grad_norm": 1.4296875, "learning_rate": 0.0004983699732041064, "loss": 6.6297, "mean_token_accuracy": 0.12174258530139923, "num_tokens": 9841662.0, "step": 4545 }, { "entropy": 6.773559427261352, "epoch": 0.486917438065172, "grad_norm": 1.109375, "learning_rate": 0.000498365376142334, "loss": 6.618, "mean_token_accuracy": 0.11437310129404069, "num_tokens": 9853797.0, "step": 4550 }, { "entropy": 6.712430953979492, "epoch": 0.48745251217293595, "grad_norm": 1.1484375, "learning_rate": 0.0004983607726309179, "loss": 6.6691, "mean_token_accuracy": 0.1182169571518898, "num_tokens": 9865245.0, "step": 4555 }, { "entropy": 6.814268589019775, "epoch": 0.4879875862806999, "grad_norm": 1.234375, "learning_rate": 0.0004983561626699908, "loss": 6.7454, "mean_token_accuracy": 0.10475116744637489, "num_tokens": 9876207.0, "step": 4560 }, { "entropy": 6.760530710220337, "epoch": 0.4885226603884638, "grad_norm": 1.234375, "learning_rate": 0.0004983515462596859, "loss": 6.5712, "mean_token_accuracy": 0.12076753973960877, "num_tokens": 9887210.0, "step": 4565 }, { "entropy": 6.743468475341797, "epoch": 0.48905773449622775, "grad_norm": 1.2578125, "learning_rate": 0.0004983469234001365, "loss": 6.746, "mean_token_accuracy": 0.11424284428358078, "num_tokens": 9899607.0, "step": 4570 }, { "entropy": 6.662120580673218, "epoch": 0.4895928086039917, "grad_norm": 1.3515625, "learning_rate": 0.000498342294091476, "loss": 6.5284, "mean_token_accuracy": 0.1255207620561123, "num_tokens": 9909910.0, "step": 4575 }, { "entropy": 6.648574686050415, "epoch": 0.49012788271175556, "grad_norm": 1.25, "learning_rate": 0.0004983376583338382, "loss": 6.6563, "mean_token_accuracy": 0.11490331664681434, "num_tokens": 9922137.0, "step": 4580 }, { "entropy": 6.735975837707519, "epoch": 0.4906629568195195, "grad_norm": 1.1953125, "learning_rate": 0.0004983330161273569, "loss": 6.6451, "mean_token_accuracy": 0.11815119236707687, "num_tokens": 9932514.0, "step": 4585 }, { "entropy": 6.717578268051147, "epoch": 0.4911980309272834, "grad_norm": 1.5390625, "learning_rate": 0.0004983283674721662, "loss": 6.6847, "mean_token_accuracy": 0.11441330313682556, "num_tokens": 9943054.0, "step": 4590 }, { "entropy": 6.8306371688842775, "epoch": 0.49173310503504736, "grad_norm": 1.1796875, "learning_rate": 0.0004983237123684002, "loss": 6.6517, "mean_token_accuracy": 0.11424371600151062, "num_tokens": 9953791.0, "step": 4595 }, { "entropy": 6.725871992111206, "epoch": 0.4922681791428113, "grad_norm": 1.234375, "learning_rate": 0.0004983190508161934, "loss": 6.6071, "mean_token_accuracy": 0.1176756463944912, "num_tokens": 9964782.0, "step": 4600 }, { "entropy": 6.776705169677735, "epoch": 0.4928032532505752, "grad_norm": 1.6953125, "learning_rate": 0.0004983143828156804, "loss": 6.6759, "mean_token_accuracy": 0.1201729841530323, "num_tokens": 9975843.0, "step": 4605 }, { "entropy": 6.766890525817871, "epoch": 0.49333832735833916, "grad_norm": 1.5859375, "learning_rate": 0.0004983097083669959, "loss": 6.6515, "mean_token_accuracy": 0.12076375931501389, "num_tokens": 9987060.0, "step": 4610 }, { "entropy": 6.729199981689453, "epoch": 0.49387340146610303, "grad_norm": 1.296875, "learning_rate": 0.0004983050274702751, "loss": 6.6204, "mean_token_accuracy": 0.11678859367966651, "num_tokens": 9997380.0, "step": 4615 }, { "entropy": 6.704911518096924, "epoch": 0.49440847557386697, "grad_norm": 1.1171875, "learning_rate": 0.0004983003401256529, "loss": 6.6666, "mean_token_accuracy": 0.11961752027273179, "num_tokens": 10007955.0, "step": 4620 }, { "entropy": 6.858521175384522, "epoch": 0.4949435496816309, "grad_norm": 1.390625, "learning_rate": 0.0004982956463332647, "loss": 6.7414, "mean_token_accuracy": 0.11539428681135178, "num_tokens": 10017645.0, "step": 4625 }, { "entropy": 6.7818702220916744, "epoch": 0.49547862378939483, "grad_norm": 2.328125, "learning_rate": 0.0004982909460932463, "loss": 6.6603, "mean_token_accuracy": 0.11978099420666695, "num_tokens": 10027619.0, "step": 4630 }, { "entropy": 6.654353475570678, "epoch": 0.49601369789715877, "grad_norm": 1.15625, "learning_rate": 0.000498286239405733, "loss": 6.5454, "mean_token_accuracy": 0.12450932785868644, "num_tokens": 10037551.0, "step": 4635 }, { "entropy": 6.672497034072876, "epoch": 0.4965487720049227, "grad_norm": 1.1171875, "learning_rate": 0.000498281526270861, "loss": 6.5851, "mean_token_accuracy": 0.13364579305052757, "num_tokens": 10047771.0, "step": 4640 }, { "entropy": 6.803449487686157, "epoch": 0.49708384611268663, "grad_norm": 1.203125, "learning_rate": 0.0004982768066887663, "loss": 6.7076, "mean_token_accuracy": 0.112837415933609, "num_tokens": 10058771.0, "step": 4645 }, { "entropy": 6.723805093765259, "epoch": 0.4976189202204505, "grad_norm": 1.2109375, "learning_rate": 0.0004982720806595851, "loss": 6.5841, "mean_token_accuracy": 0.12232825830578804, "num_tokens": 10070318.0, "step": 4650 }, { "entropy": 6.68502402305603, "epoch": 0.49815399432821444, "grad_norm": 1.1171875, "learning_rate": 0.0004982673481834541, "loss": 6.614, "mean_token_accuracy": 0.11796658039093018, "num_tokens": 10081810.0, "step": 4655 }, { "entropy": 6.6698534965515135, "epoch": 0.4986890684359784, "grad_norm": 1.1953125, "learning_rate": 0.0004982626092605097, "loss": 6.6297, "mean_token_accuracy": 0.11533761844038963, "num_tokens": 10091724.0, "step": 4660 }, { "entropy": 6.763433408737183, "epoch": 0.4992241425437423, "grad_norm": 1.3359375, "learning_rate": 0.0004982578638908888, "loss": 6.6159, "mean_token_accuracy": 0.11898914724588394, "num_tokens": 10102510.0, "step": 4665 }, { "entropy": 6.755692815780639, "epoch": 0.49975921665150624, "grad_norm": 1.2734375, "learning_rate": 0.0004982531120747286, "loss": 6.6781, "mean_token_accuracy": 0.11363844275474548, "num_tokens": 10112636.0, "step": 4670 }, { "entropy": 6.679724454879761, "epoch": 0.5002942907592701, "grad_norm": 1.546875, "learning_rate": 0.000498248353812166, "loss": 6.684, "mean_token_accuracy": 0.11922202631831169, "num_tokens": 10123562.0, "step": 4675 }, { "entropy": 6.720367956161499, "epoch": 0.5008293648670341, "grad_norm": 1.234375, "learning_rate": 0.0004982435891033387, "loss": 6.6344, "mean_token_accuracy": 0.11208936050534249, "num_tokens": 10134731.0, "step": 4680 }, { "entropy": 6.773916530609131, "epoch": 0.501364438974798, "grad_norm": 1.2265625, "learning_rate": 0.000498238817948384, "loss": 6.6307, "mean_token_accuracy": 0.11377799212932586, "num_tokens": 10145232.0, "step": 4685 }, { "entropy": 6.715243864059448, "epoch": 0.501899513082562, "grad_norm": 1.3671875, "learning_rate": 0.0004982340403474398, "loss": 6.601, "mean_token_accuracy": 0.11478810831904411, "num_tokens": 10155857.0, "step": 4690 }, { "entropy": 6.7384484767913815, "epoch": 0.5024345871903259, "grad_norm": 1.1796875, "learning_rate": 0.0004982292563006441, "loss": 6.6107, "mean_token_accuracy": 0.12016694247722626, "num_tokens": 10166145.0, "step": 4695 }, { "entropy": 6.8165631771087645, "epoch": 0.5029696612980897, "grad_norm": 1.2421875, "learning_rate": 0.000498224465808135, "loss": 6.7341, "mean_token_accuracy": 0.10747307166457176, "num_tokens": 10177086.0, "step": 4700 }, { "entropy": 6.807919645309449, "epoch": 0.5035047354058537, "grad_norm": 1.6015625, "learning_rate": 0.0004982196688700509, "loss": 6.6168, "mean_token_accuracy": 0.11652338951826095, "num_tokens": 10187120.0, "step": 4705 }, { "entropy": 6.746653747558594, "epoch": 0.5040398095136176, "grad_norm": 1.3359375, "learning_rate": 0.0004982148654865302, "loss": 6.6816, "mean_token_accuracy": 0.1173696868121624, "num_tokens": 10197784.0, "step": 4710 }, { "entropy": 6.769271898269653, "epoch": 0.5045748836213816, "grad_norm": 1.1875, "learning_rate": 0.0004982100556577115, "loss": 6.5533, "mean_token_accuracy": 0.12568439543247223, "num_tokens": 10209373.0, "step": 4715 }, { "entropy": 6.758709573745728, "epoch": 0.5051099577291455, "grad_norm": 1.328125, "learning_rate": 0.0004982052393837338, "loss": 6.669, "mean_token_accuracy": 0.11871311962604522, "num_tokens": 10220316.0, "step": 4720 }, { "entropy": 6.6824239730834964, "epoch": 0.5056450318369095, "grad_norm": 1.2265625, "learning_rate": 0.0004982004166647363, "loss": 6.5571, "mean_token_accuracy": 0.12401916012167931, "num_tokens": 10230478.0, "step": 4725 }, { "entropy": 6.623062801361084, "epoch": 0.5061801059446733, "grad_norm": 1.1796875, "learning_rate": 0.0004981955875008582, "loss": 6.6518, "mean_token_accuracy": 0.11519326344132423, "num_tokens": 10240641.0, "step": 4730 }, { "entropy": 6.744868040084839, "epoch": 0.5067151800524372, "grad_norm": 1.2578125, "learning_rate": 0.0004981907518922387, "loss": 6.6428, "mean_token_accuracy": 0.12281770035624504, "num_tokens": 10250676.0, "step": 4735 }, { "entropy": 6.859378337860107, "epoch": 0.5072502541602012, "grad_norm": 1.9765625, "learning_rate": 0.0004981859098390177, "loss": 6.7032, "mean_token_accuracy": 0.11514592617750168, "num_tokens": 10262016.0, "step": 4740 }, { "entropy": 6.7457503318786625, "epoch": 0.5077853282679651, "grad_norm": 1.3046875, "learning_rate": 0.0004981810613413348, "loss": 6.6448, "mean_token_accuracy": 0.12012371569871902, "num_tokens": 10271985.0, "step": 4745 }, { "entropy": 6.745742273330689, "epoch": 0.5083204023757291, "grad_norm": 1.2734375, "learning_rate": 0.0004981762063993302, "loss": 6.6133, "mean_token_accuracy": 0.12136726751923561, "num_tokens": 10282156.0, "step": 4750 }, { "entropy": 6.716922092437744, "epoch": 0.5088554764834929, "grad_norm": 1.34375, "learning_rate": 0.000498171345013144, "loss": 6.611, "mean_token_accuracy": 0.11782191470265388, "num_tokens": 10292576.0, "step": 4755 }, { "entropy": 6.661800575256348, "epoch": 0.5093905505912569, "grad_norm": 1.6640625, "learning_rate": 0.0004981664771829165, "loss": 6.6254, "mean_token_accuracy": 0.1142365463078022, "num_tokens": 10303648.0, "step": 4760 }, { "entropy": 6.715044784545898, "epoch": 0.5099256246990208, "grad_norm": 1.2734375, "learning_rate": 0.0004981616029087884, "loss": 6.5102, "mean_token_accuracy": 0.12722289934754372, "num_tokens": 10314275.0, "step": 4765 }, { "entropy": 6.675028467178345, "epoch": 0.5104606988067847, "grad_norm": 1.3515625, "learning_rate": 0.0004981567221909004, "loss": 6.6398, "mean_token_accuracy": 0.11122743040323257, "num_tokens": 10325386.0, "step": 4770 }, { "entropy": 6.712424802780151, "epoch": 0.5109957729145487, "grad_norm": 1.8828125, "learning_rate": 0.0004981518350293935, "loss": 6.6132, "mean_token_accuracy": 0.11537306159734725, "num_tokens": 10335041.0, "step": 4775 }, { "entropy": 6.743242788314819, "epoch": 0.5115308470223126, "grad_norm": 1.6796875, "learning_rate": 0.0004981469414244086, "loss": 6.5693, "mean_token_accuracy": 0.12268173769116401, "num_tokens": 10345746.0, "step": 4780 }, { "entropy": 6.624886989593506, "epoch": 0.5120659211300765, "grad_norm": 1.25, "learning_rate": 0.000498142041376087, "loss": 6.6945, "mean_token_accuracy": 0.11829338818788529, "num_tokens": 10356995.0, "step": 4785 }, { "entropy": 6.7250689506530765, "epoch": 0.5126009952378404, "grad_norm": 1.359375, "learning_rate": 0.0004981371348845705, "loss": 6.5939, "mean_token_accuracy": 0.1246476911008358, "num_tokens": 10368445.0, "step": 4790 }, { "entropy": 6.810773944854736, "epoch": 0.5131360693456044, "grad_norm": 1.1875, "learning_rate": 0.0004981322219500006, "loss": 6.5364, "mean_token_accuracy": 0.1264880530536175, "num_tokens": 10378256.0, "step": 4795 }, { "entropy": 6.698590278625488, "epoch": 0.5136711434533683, "grad_norm": 1.328125, "learning_rate": 0.000498127302572519, "loss": 6.6306, "mean_token_accuracy": 0.11948861032724381, "num_tokens": 10388698.0, "step": 4800 }, { "entropy": 6.626500415802002, "epoch": 0.5142062175611322, "grad_norm": 1.3203125, "learning_rate": 0.0004981223767522679, "loss": 6.6314, "mean_token_accuracy": 0.12543342038989067, "num_tokens": 10399975.0, "step": 4805 }, { "entropy": 6.73018741607666, "epoch": 0.5147412916688962, "grad_norm": 1.234375, "learning_rate": 0.0004981174444893896, "loss": 6.632, "mean_token_accuracy": 0.11657147109508514, "num_tokens": 10410480.0, "step": 4810 }, { "entropy": 6.754246234893799, "epoch": 0.51527636577666, "grad_norm": 1.484375, "learning_rate": 0.0004981125057840264, "loss": 6.5903, "mean_token_accuracy": 0.12315746694803238, "num_tokens": 10421023.0, "step": 4815 }, { "entropy": 6.691860723495483, "epoch": 0.515811439884424, "grad_norm": 1.34375, "learning_rate": 0.000498107560636321, "loss": 6.6376, "mean_token_accuracy": 0.11937036588788033, "num_tokens": 10431152.0, "step": 4820 }, { "entropy": 6.669547367095947, "epoch": 0.5163465139921879, "grad_norm": 1.375, "learning_rate": 0.0004981026090464161, "loss": 6.5395, "mean_token_accuracy": 0.11537841185927392, "num_tokens": 10441986.0, "step": 4825 }, { "entropy": 6.76296591758728, "epoch": 0.5168815880999519, "grad_norm": 1.515625, "learning_rate": 0.0004980976510144548, "loss": 6.6294, "mean_token_accuracy": 0.11330693066120148, "num_tokens": 10452932.0, "step": 4830 }, { "entropy": 6.730077743530273, "epoch": 0.5174166622077158, "grad_norm": 1.1875, "learning_rate": 0.0004980926865405801, "loss": 6.7059, "mean_token_accuracy": 0.1165323257446289, "num_tokens": 10463411.0, "step": 4835 }, { "entropy": 6.755215454101562, "epoch": 0.5179517363154797, "grad_norm": 1.3203125, "learning_rate": 0.0004980877156249354, "loss": 6.5955, "mean_token_accuracy": 0.12119976133108139, "num_tokens": 10474820.0, "step": 4840 }, { "entropy": 6.693712377548218, "epoch": 0.5184868104232436, "grad_norm": 1.3671875, "learning_rate": 0.0004980827382676643, "loss": 6.5956, "mean_token_accuracy": 0.12424970418214798, "num_tokens": 10485701.0, "step": 4845 }, { "entropy": 6.697637557983398, "epoch": 0.5190218845310075, "grad_norm": 1.375, "learning_rate": 0.0004980777544689105, "loss": 6.5925, "mean_token_accuracy": 0.12146328687667847, "num_tokens": 10495825.0, "step": 4850 }, { "entropy": 6.6988880157470705, "epoch": 0.5195569586387715, "grad_norm": 1.265625, "learning_rate": 0.0004980727642288178, "loss": 6.5759, "mean_token_accuracy": 0.12025154009461403, "num_tokens": 10505847.0, "step": 4855 }, { "entropy": 6.712225770950317, "epoch": 0.5200920327465354, "grad_norm": 1.359375, "learning_rate": 0.0004980677675475305, "loss": 6.6367, "mean_token_accuracy": 0.11677327230572701, "num_tokens": 10516596.0, "step": 4860 }, { "entropy": 6.733681726455688, "epoch": 0.5206271068542994, "grad_norm": 1.3203125, "learning_rate": 0.0004980627644251926, "loss": 6.5497, "mean_token_accuracy": 0.1293226294219494, "num_tokens": 10528175.0, "step": 4865 }, { "entropy": 6.651979970932007, "epoch": 0.5211621809620632, "grad_norm": 1.3203125, "learning_rate": 0.0004980577548619489, "loss": 6.6329, "mean_token_accuracy": 0.11742270663380623, "num_tokens": 10540076.0, "step": 4870 }, { "entropy": 6.686881160736084, "epoch": 0.5216972550698272, "grad_norm": 1.25, "learning_rate": 0.0004980527388579437, "loss": 6.6555, "mean_token_accuracy": 0.11610461995005608, "num_tokens": 10552025.0, "step": 4875 }, { "entropy": 6.746124219894409, "epoch": 0.5222323291775911, "grad_norm": 1.1875, "learning_rate": 0.0004980477164133221, "loss": 6.6528, "mean_token_accuracy": 0.11348175257444382, "num_tokens": 10562535.0, "step": 4880 }, { "entropy": 6.723954057693481, "epoch": 0.522767403285355, "grad_norm": 1.2421875, "learning_rate": 0.000498042687528229, "loss": 6.574, "mean_token_accuracy": 0.12090551033616066, "num_tokens": 10572989.0, "step": 4885 }, { "entropy": 6.658336591720581, "epoch": 0.523302477393119, "grad_norm": 1.234375, "learning_rate": 0.0004980376522028098, "loss": 6.6058, "mean_token_accuracy": 0.12160259932279587, "num_tokens": 10583033.0, "step": 4890 }, { "entropy": 6.734746789932251, "epoch": 0.5238375515008828, "grad_norm": 1.6015625, "learning_rate": 0.0004980326104372095, "loss": 6.6853, "mean_token_accuracy": 0.11474591270089149, "num_tokens": 10595205.0, "step": 4895 }, { "entropy": 6.786480188369751, "epoch": 0.5243726256086468, "grad_norm": 1.4609375, "learning_rate": 0.000498027562231574, "loss": 6.5392, "mean_token_accuracy": 0.12003358751535416, "num_tokens": 10605244.0, "step": 4900 }, { "entropy": 6.718193483352661, "epoch": 0.5249076997164107, "grad_norm": 1.21875, "learning_rate": 0.000498022507586049, "loss": 6.6214, "mean_token_accuracy": 0.11722708195447921, "num_tokens": 10615817.0, "step": 4905 }, { "entropy": 6.725398159027099, "epoch": 0.5254427738241747, "grad_norm": 1.2265625, "learning_rate": 0.0004980174465007804, "loss": 6.6366, "mean_token_accuracy": 0.11559919267892838, "num_tokens": 10627160.0, "step": 4910 }, { "entropy": 6.766883087158203, "epoch": 0.5259778479319386, "grad_norm": 1.390625, "learning_rate": 0.0004980123789759145, "loss": 6.631, "mean_token_accuracy": 0.12066573053598403, "num_tokens": 10637552.0, "step": 4915 }, { "entropy": 6.666731262207032, "epoch": 0.5265129220397025, "grad_norm": 1.7734375, "learning_rate": 0.0004980073050115973, "loss": 6.6807, "mean_token_accuracy": 0.11911093890666961, "num_tokens": 10648773.0, "step": 4920 }, { "entropy": 6.761361503601075, "epoch": 0.5270479961474664, "grad_norm": 1.40625, "learning_rate": 0.0004980022246079755, "loss": 6.6387, "mean_token_accuracy": 0.1175591915845871, "num_tokens": 10659537.0, "step": 4925 }, { "entropy": 6.820301675796509, "epoch": 0.5275830702552303, "grad_norm": 1.234375, "learning_rate": 0.000497997137765196, "loss": 6.6932, "mean_token_accuracy": 0.11372315660119056, "num_tokens": 10671390.0, "step": 4930 }, { "entropy": 6.718183946609497, "epoch": 0.5281181443629943, "grad_norm": 1.609375, "learning_rate": 0.0004979920444834054, "loss": 6.5349, "mean_token_accuracy": 0.12883347496390343, "num_tokens": 10682389.0, "step": 4935 }, { "entropy": 6.594164085388184, "epoch": 0.5286532184707582, "grad_norm": 1.296875, "learning_rate": 0.0004979869447627508, "loss": 6.606, "mean_token_accuracy": 0.12021337449550629, "num_tokens": 10692400.0, "step": 4940 }, { "entropy": 6.691273975372314, "epoch": 0.5291882925785222, "grad_norm": 1.2734375, "learning_rate": 0.0004979818386033795, "loss": 6.526, "mean_token_accuracy": 0.12336401715874672, "num_tokens": 10702396.0, "step": 4945 }, { "entropy": 6.723889923095703, "epoch": 0.5297233666862861, "grad_norm": 1.7265625, "learning_rate": 0.000497976726005439, "loss": 6.6549, "mean_token_accuracy": 0.11776790469884872, "num_tokens": 10712863.0, "step": 4950 }, { "entropy": 6.707800340652466, "epoch": 0.5302584407940499, "grad_norm": 1.2109375, "learning_rate": 0.0004979716069690768, "loss": 6.6556, "mean_token_accuracy": 0.11826993152499199, "num_tokens": 10724234.0, "step": 4955 }, { "entropy": 6.8028627872467045, "epoch": 0.5307935149018139, "grad_norm": 2.09375, "learning_rate": 0.0004979664814944409, "loss": 6.6898, "mean_token_accuracy": 0.11730713248252869, "num_tokens": 10734405.0, "step": 4960 }, { "entropy": 6.796906423568726, "epoch": 0.5313285890095778, "grad_norm": 1.40625, "learning_rate": 0.0004979613495816791, "loss": 6.6269, "mean_token_accuracy": 0.11673597991466522, "num_tokens": 10744573.0, "step": 4965 }, { "entropy": 6.81073899269104, "epoch": 0.5318636631173418, "grad_norm": 1.6171875, "learning_rate": 0.0004979562112309397, "loss": 6.6701, "mean_token_accuracy": 0.12054512575268746, "num_tokens": 10755555.0, "step": 4970 }, { "entropy": 6.69157977104187, "epoch": 0.5323987372251057, "grad_norm": 1.1640625, "learning_rate": 0.000497951066442371, "loss": 6.6797, "mean_token_accuracy": 0.11503533869981766, "num_tokens": 10766493.0, "step": 4975 }, { "entropy": 6.757311391830444, "epoch": 0.5329338113328697, "grad_norm": 1.3984375, "learning_rate": 0.0004979459152161215, "loss": 6.6385, "mean_token_accuracy": 0.11236128360033035, "num_tokens": 10776735.0, "step": 4980 }, { "entropy": 6.700515174865723, "epoch": 0.5334688854406335, "grad_norm": 1.2578125, "learning_rate": 0.0004979407575523402, "loss": 6.6145, "mean_token_accuracy": 0.12050373330712319, "num_tokens": 10787500.0, "step": 4985 }, { "entropy": 6.703393936157227, "epoch": 0.5340039595483974, "grad_norm": 1.609375, "learning_rate": 0.0004979355934511757, "loss": 6.6344, "mean_token_accuracy": 0.12052067667245865, "num_tokens": 10798002.0, "step": 4990 }, { "entropy": 6.75645604133606, "epoch": 0.5345390336561614, "grad_norm": 1.375, "learning_rate": 0.0004979304229127773, "loss": 6.6112, "mean_token_accuracy": 0.11992594972252846, "num_tokens": 10808982.0, "step": 4995 }, { "entropy": 6.736630868911743, "epoch": 0.5350741077639253, "grad_norm": 1.2421875, "learning_rate": 0.0004979252459372944, "loss": 6.5706, "mean_token_accuracy": 0.11807732656598091, "num_tokens": 10821619.0, "step": 5000 }, { "entropy": 6.699893808364868, "epoch": 0.5356091818716893, "grad_norm": 1.390625, "learning_rate": 0.0004979200625248761, "loss": 6.5904, "mean_token_accuracy": 0.12047486156225204, "num_tokens": 10832344.0, "step": 5005 }, { "entropy": 6.670212745666504, "epoch": 0.5361442559794531, "grad_norm": 1.4296875, "learning_rate": 0.0004979148726756725, "loss": 6.5571, "mean_token_accuracy": 0.11860336735844612, "num_tokens": 10843149.0, "step": 5010 }, { "entropy": 6.675074863433838, "epoch": 0.5366793300872171, "grad_norm": 1.6171875, "learning_rate": 0.0004979096763898333, "loss": 6.5998, "mean_token_accuracy": 0.12452303320169449, "num_tokens": 10854590.0, "step": 5015 }, { "entropy": 6.791008424758911, "epoch": 0.537214404194981, "grad_norm": 1.78125, "learning_rate": 0.0004979044736675084, "loss": 6.5671, "mean_token_accuracy": 0.11767032742500305, "num_tokens": 10865500.0, "step": 5020 }, { "entropy": 6.680721569061279, "epoch": 0.5377494783027449, "grad_norm": 1.9375, "learning_rate": 0.0004978992645088483, "loss": 6.6021, "mean_token_accuracy": 0.12172115072607995, "num_tokens": 10876866.0, "step": 5025 }, { "entropy": 6.5734340190887455, "epoch": 0.5382845524105089, "grad_norm": 1.265625, "learning_rate": 0.000497894048914003, "loss": 6.5612, "mean_token_accuracy": 0.11841940134763718, "num_tokens": 10888627.0, "step": 5030 }, { "entropy": 6.746210193634033, "epoch": 0.5388196265182728, "grad_norm": 1.9921875, "learning_rate": 0.0004978888268831236, "loss": 6.6696, "mean_token_accuracy": 0.11132773160934448, "num_tokens": 10900992.0, "step": 5035 }, { "entropy": 6.842794561386109, "epoch": 0.5393547006260367, "grad_norm": 1.40625, "learning_rate": 0.0004978835984163606, "loss": 6.7276, "mean_token_accuracy": 0.10932021215558052, "num_tokens": 10912323.0, "step": 5040 }, { "entropy": 6.800081539154053, "epoch": 0.5398897747338006, "grad_norm": 1.5078125, "learning_rate": 0.0004978783635138649, "loss": 6.6771, "mean_token_accuracy": 0.11647720038890838, "num_tokens": 10923991.0, "step": 5045 }, { "entropy": 6.639073657989502, "epoch": 0.5404248488415646, "grad_norm": 1.34375, "learning_rate": 0.0004978731221757878, "loss": 6.5041, "mean_token_accuracy": 0.12417407482862472, "num_tokens": 10934081.0, "step": 5050 }, { "entropy": 6.727223587036133, "epoch": 0.5409599229493285, "grad_norm": 1.5546875, "learning_rate": 0.0004978678744022808, "loss": 6.6006, "mean_token_accuracy": 0.117810919880867, "num_tokens": 10944729.0, "step": 5055 }, { "entropy": 6.709056615829468, "epoch": 0.5414949970570924, "grad_norm": 1.296875, "learning_rate": 0.000497862620193495, "loss": 6.6635, "mean_token_accuracy": 0.11320299580693245, "num_tokens": 10955708.0, "step": 5060 }, { "entropy": 6.72125997543335, "epoch": 0.5420300711648564, "grad_norm": 1.40625, "learning_rate": 0.0004978573595495826, "loss": 6.6002, "mean_token_accuracy": 0.11878297626972198, "num_tokens": 10966427.0, "step": 5065 }, { "entropy": 6.740125894546509, "epoch": 0.5425651452726202, "grad_norm": 1.9140625, "learning_rate": 0.000497852092470695, "loss": 6.6485, "mean_token_accuracy": 0.11773342937231064, "num_tokens": 10977741.0, "step": 5070 }, { "entropy": 6.7118854999542235, "epoch": 0.5431002193803842, "grad_norm": 1.5390625, "learning_rate": 0.0004978468189569847, "loss": 6.5956, "mean_token_accuracy": 0.12482826039195061, "num_tokens": 10989127.0, "step": 5075 }, { "entropy": 6.6592412948608395, "epoch": 0.5436352934881481, "grad_norm": 1.9140625, "learning_rate": 0.0004978415390086038, "loss": 6.6217, "mean_token_accuracy": 0.11322500184178352, "num_tokens": 10999791.0, "step": 5080 }, { "entropy": 6.783138751983643, "epoch": 0.5441703675959121, "grad_norm": 1.3515625, "learning_rate": 0.0004978362526257047, "loss": 6.6783, "mean_token_accuracy": 0.11360784098505974, "num_tokens": 11010045.0, "step": 5085 }, { "entropy": 6.735276794433593, "epoch": 0.544705441703676, "grad_norm": 1.515625, "learning_rate": 0.0004978309598084403, "loss": 6.6067, "mean_token_accuracy": 0.11822862327098846, "num_tokens": 11020729.0, "step": 5090 }, { "entropy": 6.708194351196289, "epoch": 0.5452405158114398, "grad_norm": 1.40625, "learning_rate": 0.0004978256605569631, "loss": 6.6289, "mean_token_accuracy": 0.1177783451974392, "num_tokens": 11030641.0, "step": 5095 }, { "entropy": 6.784500598907471, "epoch": 0.5457755899192038, "grad_norm": 1.3515625, "learning_rate": 0.0004978203548714262, "loss": 6.6366, "mean_token_accuracy": 0.12379909828305244, "num_tokens": 11041533.0, "step": 5100 }, { "entropy": 6.726690483093262, "epoch": 0.5463106640269677, "grad_norm": 1.265625, "learning_rate": 0.000497815042751983, "loss": 6.58, "mean_token_accuracy": 0.11729968935251237, "num_tokens": 11052170.0, "step": 5105 }, { "entropy": 6.652199029922485, "epoch": 0.5468457381347317, "grad_norm": 1.2421875, "learning_rate": 0.0004978097241987868, "loss": 6.5646, "mean_token_accuracy": 0.1203967772424221, "num_tokens": 11062872.0, "step": 5110 }, { "entropy": 6.719713973999023, "epoch": 0.5473808122424956, "grad_norm": 1.390625, "learning_rate": 0.000497804399211991, "loss": 6.6657, "mean_token_accuracy": 0.11651256605982781, "num_tokens": 11074199.0, "step": 5115 }, { "entropy": 6.7464769840240475, "epoch": 0.5479158863502596, "grad_norm": 1.3046875, "learning_rate": 0.0004977990677917495, "loss": 6.6129, "mean_token_accuracy": 0.11894905865192414, "num_tokens": 11083881.0, "step": 5120 }, { "entropy": 6.6402746677398685, "epoch": 0.5484509604580234, "grad_norm": 1.328125, "learning_rate": 0.0004977937299382162, "loss": 6.6584, "mean_token_accuracy": 0.1151296466588974, "num_tokens": 11094374.0, "step": 5125 }, { "entropy": 6.679858827590943, "epoch": 0.5489860345657873, "grad_norm": 3.578125, "learning_rate": 0.0004977883856515453, "loss": 6.4958, "mean_token_accuracy": 0.1267719380557537, "num_tokens": 11105174.0, "step": 5130 }, { "entropy": 6.751749181747437, "epoch": 0.5495211086735513, "grad_norm": 1.3984375, "learning_rate": 0.000497783034931891, "loss": 6.656, "mean_token_accuracy": 0.11584192886948586, "num_tokens": 11117223.0, "step": 5135 }, { "entropy": 6.7202818393707275, "epoch": 0.5500561827813152, "grad_norm": 1.5234375, "learning_rate": 0.000497777677779408, "loss": 6.579, "mean_token_accuracy": 0.12366545721888542, "num_tokens": 11127240.0, "step": 5140 }, { "entropy": 6.676993894577026, "epoch": 0.5505912568890792, "grad_norm": 1.3828125, "learning_rate": 0.0004977723141942509, "loss": 6.5678, "mean_token_accuracy": 0.1281234510242939, "num_tokens": 11137287.0, "step": 5145 }, { "entropy": 6.7371532917022705, "epoch": 0.551126330996843, "grad_norm": 1.2578125, "learning_rate": 0.0004977669441765743, "loss": 6.7007, "mean_token_accuracy": 0.11768926754593849, "num_tokens": 11148988.0, "step": 5150 }, { "entropy": 6.705612564086914, "epoch": 0.551661405104607, "grad_norm": 1.2734375, "learning_rate": 0.0004977615677265336, "loss": 6.6389, "mean_token_accuracy": 0.12069165110588073, "num_tokens": 11159874.0, "step": 5155 }, { "entropy": 6.73426923751831, "epoch": 0.5521964792123709, "grad_norm": 1.671875, "learning_rate": 0.000497756184844284, "loss": 6.6121, "mean_token_accuracy": 0.12401502057909966, "num_tokens": 11170703.0, "step": 5160 }, { "entropy": 6.744797801971435, "epoch": 0.5527315533201348, "grad_norm": 1.21875, "learning_rate": 0.0004977507955299809, "loss": 6.5001, "mean_token_accuracy": 0.1257123127579689, "num_tokens": 11182230.0, "step": 5165 }, { "entropy": 6.698776006698608, "epoch": 0.5532666274278988, "grad_norm": 1.4140625, "learning_rate": 0.0004977453997837797, "loss": 6.5677, "mean_token_accuracy": 0.10981405228376388, "num_tokens": 11192897.0, "step": 5170 }, { "entropy": 6.682893180847168, "epoch": 0.5538017015356627, "grad_norm": 1.2578125, "learning_rate": 0.0004977399976058366, "loss": 6.6521, "mean_token_accuracy": 0.11399049237370491, "num_tokens": 11203942.0, "step": 5175 }, { "entropy": 6.743161678314209, "epoch": 0.5543367756434266, "grad_norm": 1.203125, "learning_rate": 0.0004977345889963072, "loss": 6.7014, "mean_token_accuracy": 0.11261942982673645, "num_tokens": 11214361.0, "step": 5180 }, { "entropy": 6.6744081497192385, "epoch": 0.5548718497511905, "grad_norm": 1.2890625, "learning_rate": 0.0004977291739553479, "loss": 6.5902, "mean_token_accuracy": 0.12366337925195695, "num_tokens": 11225928.0, "step": 5185 }, { "entropy": 6.682669401168823, "epoch": 0.5554069238589545, "grad_norm": 1.03125, "learning_rate": 0.0004977237524831149, "loss": 6.5444, "mean_token_accuracy": 0.11170822679996491, "num_tokens": 11236660.0, "step": 5190 }, { "entropy": 6.714070177078247, "epoch": 0.5559419979667184, "grad_norm": 1.2734375, "learning_rate": 0.0004977183245797649, "loss": 6.5723, "mean_token_accuracy": 0.1271256498992443, "num_tokens": 11247272.0, "step": 5195 }, { "entropy": 6.77830867767334, "epoch": 0.5564770720744823, "grad_norm": 1.2734375, "learning_rate": 0.0004977128902454547, "loss": 6.6722, "mean_token_accuracy": 0.11327713802456855, "num_tokens": 11258472.0, "step": 5200 }, { "entropy": 6.7154069423675535, "epoch": 0.5570121461822463, "grad_norm": 1.3046875, "learning_rate": 0.0004977074494803409, "loss": 6.5841, "mean_token_accuracy": 0.1255582146346569, "num_tokens": 11268344.0, "step": 5205 }, { "entropy": 6.722737216949463, "epoch": 0.5575472202900101, "grad_norm": 1.2734375, "learning_rate": 0.0004977020022845809, "loss": 6.6762, "mean_token_accuracy": 0.11227439492940902, "num_tokens": 11279931.0, "step": 5210 }, { "entropy": 6.80668683052063, "epoch": 0.5580822943977741, "grad_norm": 1.3125, "learning_rate": 0.0004976965486583318, "loss": 6.6255, "mean_token_accuracy": 0.11421727836132049, "num_tokens": 11290595.0, "step": 5215 }, { "entropy": 6.7050305843353275, "epoch": 0.558617368505538, "grad_norm": 1.6015625, "learning_rate": 0.0004976910886017513, "loss": 6.6411, "mean_token_accuracy": 0.12072176486253738, "num_tokens": 11300774.0, "step": 5220 }, { "entropy": 6.6693981170654295, "epoch": 0.559152442613302, "grad_norm": 1.75, "learning_rate": 0.0004976856221149969, "loss": 6.5309, "mean_token_accuracy": 0.12517891749739646, "num_tokens": 11310288.0, "step": 5225 }, { "entropy": 6.700547170639038, "epoch": 0.5596875167210659, "grad_norm": 1.1484375, "learning_rate": 0.0004976801491982263, "loss": 6.6109, "mean_token_accuracy": 0.11751497983932495, "num_tokens": 11321599.0, "step": 5230 }, { "entropy": 6.786514472961426, "epoch": 0.5602225908288297, "grad_norm": 1.3828125, "learning_rate": 0.0004976746698515977, "loss": 6.6606, "mean_token_accuracy": 0.11887592300772667, "num_tokens": 11331383.0, "step": 5235 }, { "entropy": 6.712525081634522, "epoch": 0.5607576649365937, "grad_norm": 1.2421875, "learning_rate": 0.0004976691840752694, "loss": 6.6195, "mean_token_accuracy": 0.11564537510275841, "num_tokens": 11342085.0, "step": 5240 }, { "entropy": 6.718255138397216, "epoch": 0.5612927390443576, "grad_norm": 1.171875, "learning_rate": 0.0004976636918693996, "loss": 6.6574, "mean_token_accuracy": 0.11577147841453553, "num_tokens": 11354061.0, "step": 5245 }, { "entropy": 6.779119157791138, "epoch": 0.5618278131521216, "grad_norm": 1.3125, "learning_rate": 0.0004976581932341471, "loss": 6.6136, "mean_token_accuracy": 0.12151364013552665, "num_tokens": 11364448.0, "step": 5250 }, { "entropy": 6.769805908203125, "epoch": 0.5623628872598855, "grad_norm": 1.3046875, "learning_rate": 0.0004976526881696706, "loss": 6.5791, "mean_token_accuracy": 0.12037570253014565, "num_tokens": 11374838.0, "step": 5255 }, { "entropy": 6.629622316360473, "epoch": 0.5628979613676495, "grad_norm": 1.25, "learning_rate": 0.0004976471766761288, "loss": 6.6105, "mean_token_accuracy": 0.12379851192235947, "num_tokens": 11385310.0, "step": 5260 }, { "entropy": 6.691438817977906, "epoch": 0.5634330354754133, "grad_norm": 1.6328125, "learning_rate": 0.0004976416587536812, "loss": 6.6142, "mean_token_accuracy": 0.11430059969425202, "num_tokens": 11396590.0, "step": 5265 }, { "entropy": 6.742701053619385, "epoch": 0.5639681095831772, "grad_norm": 1.1875, "learning_rate": 0.0004976361344024871, "loss": 6.5707, "mean_token_accuracy": 0.12226603850722313, "num_tokens": 11407218.0, "step": 5270 }, { "entropy": 6.652452564239502, "epoch": 0.5645031836909412, "grad_norm": 1.5078125, "learning_rate": 0.0004976306036227056, "loss": 6.5931, "mean_token_accuracy": 0.11696631386876107, "num_tokens": 11417716.0, "step": 5275 }, { "entropy": 6.721119165420532, "epoch": 0.5650382577987051, "grad_norm": 1.3515625, "learning_rate": 0.000497625066414497, "loss": 6.6823, "mean_token_accuracy": 0.11784773990511895, "num_tokens": 11428295.0, "step": 5280 }, { "entropy": 6.797392892837524, "epoch": 0.5655733319064691, "grad_norm": 1.21875, "learning_rate": 0.0004976195227780207, "loss": 6.6173, "mean_token_accuracy": 0.11284109130501747, "num_tokens": 11439044.0, "step": 5285 }, { "entropy": 6.779853343963623, "epoch": 0.566108406014233, "grad_norm": 1.3515625, "learning_rate": 0.0004976139727134371, "loss": 6.5497, "mean_token_accuracy": 0.11817987859249116, "num_tokens": 11450029.0, "step": 5290 }, { "entropy": 6.715458774566651, "epoch": 0.566643480121997, "grad_norm": 1.21875, "learning_rate": 0.0004976084162209062, "loss": 6.7264, "mean_token_accuracy": 0.10616886764764785, "num_tokens": 11461190.0, "step": 5295 }, { "entropy": 6.745611715316772, "epoch": 0.5671785542297608, "grad_norm": 1.2421875, "learning_rate": 0.0004976028533005886, "loss": 6.5772, "mean_token_accuracy": 0.11882699206471443, "num_tokens": 11472143.0, "step": 5300 }, { "entropy": 6.771622133255005, "epoch": 0.5677136283375247, "grad_norm": 1.4765625, "learning_rate": 0.0004975972839526449, "loss": 6.7163, "mean_token_accuracy": 0.1069483369588852, "num_tokens": 11483745.0, "step": 5305 }, { "entropy": 6.7719972133636475, "epoch": 0.5682487024452887, "grad_norm": 1.265625, "learning_rate": 0.0004975917081772358, "loss": 6.5791, "mean_token_accuracy": 0.1188987985253334, "num_tokens": 11495695.0, "step": 5310 }, { "entropy": 6.718594884872436, "epoch": 0.5687837765530526, "grad_norm": 1.4140625, "learning_rate": 0.0004975861259745225, "loss": 6.6224, "mean_token_accuracy": 0.11705151796340943, "num_tokens": 11505576.0, "step": 5315 }, { "entropy": 6.661882305145264, "epoch": 0.5693188506608166, "grad_norm": 1.34375, "learning_rate": 0.0004975805373446662, "loss": 6.479, "mean_token_accuracy": 0.12648551389575005, "num_tokens": 11516614.0, "step": 5320 }, { "entropy": 6.7097954750061035, "epoch": 0.5698539247685804, "grad_norm": 1.359375, "learning_rate": 0.000497574942287828, "loss": 6.6111, "mean_token_accuracy": 0.11843594536185265, "num_tokens": 11528032.0, "step": 5325 }, { "entropy": 6.664940547943115, "epoch": 0.5703889988763444, "grad_norm": 1.609375, "learning_rate": 0.0004975693408041697, "loss": 6.6154, "mean_token_accuracy": 0.11421292722225189, "num_tokens": 11538822.0, "step": 5330 }, { "entropy": 6.699612236022949, "epoch": 0.5709240729841083, "grad_norm": 1.34375, "learning_rate": 0.0004975637328938529, "loss": 6.6399, "mean_token_accuracy": 0.11097949370741844, "num_tokens": 11548895.0, "step": 5335 }, { "entropy": 6.714142751693726, "epoch": 0.5714591470918722, "grad_norm": 1.328125, "learning_rate": 0.0004975581185570398, "loss": 6.5215, "mean_token_accuracy": 0.11886597573757171, "num_tokens": 11559613.0, "step": 5340 }, { "entropy": 6.713043832778931, "epoch": 0.5719942211996362, "grad_norm": 1.1640625, "learning_rate": 0.0004975524977938921, "loss": 6.5537, "mean_token_accuracy": 0.12163764908909798, "num_tokens": 11571092.0, "step": 5345 }, { "entropy": 6.692736101150513, "epoch": 0.5725292953074, "grad_norm": 1.4296875, "learning_rate": 0.0004975468706045722, "loss": 6.6814, "mean_token_accuracy": 0.11672013476490975, "num_tokens": 11581448.0, "step": 5350 }, { "entropy": 6.728510904312134, "epoch": 0.573064369415164, "grad_norm": 1.4375, "learning_rate": 0.0004975412369892429, "loss": 6.58, "mean_token_accuracy": 0.12553823739290237, "num_tokens": 11592273.0, "step": 5355 }, { "entropy": 6.757077264785766, "epoch": 0.5735994435229279, "grad_norm": 1.25, "learning_rate": 0.0004975355969480665, "loss": 6.5555, "mean_token_accuracy": 0.125929856300354, "num_tokens": 11602759.0, "step": 5360 }, { "entropy": 6.640834856033325, "epoch": 0.5741345176306919, "grad_norm": 1.3359375, "learning_rate": 0.0004975299504812061, "loss": 6.608, "mean_token_accuracy": 0.11442179679870605, "num_tokens": 11613977.0, "step": 5365 }, { "entropy": 6.71792254447937, "epoch": 0.5746695917384558, "grad_norm": 1.2734375, "learning_rate": 0.0004975242975888246, "loss": 6.636, "mean_token_accuracy": 0.12084050849080086, "num_tokens": 11625425.0, "step": 5370 }, { "entropy": 6.744046688079834, "epoch": 0.5752046658462197, "grad_norm": 1.3671875, "learning_rate": 0.0004975186382710854, "loss": 6.6071, "mean_token_accuracy": 0.11423679888248443, "num_tokens": 11636530.0, "step": 5375 }, { "entropy": 6.741583633422851, "epoch": 0.5757397399539836, "grad_norm": 1.3125, "learning_rate": 0.0004975129725281516, "loss": 6.5856, "mean_token_accuracy": 0.12342779189348221, "num_tokens": 11646516.0, "step": 5380 }, { "entropy": 6.701775741577149, "epoch": 0.5762748140617475, "grad_norm": 1.2890625, "learning_rate": 0.0004975073003601871, "loss": 6.5849, "mean_token_accuracy": 0.11874212771654129, "num_tokens": 11657424.0, "step": 5385 }, { "entropy": 6.704905319213867, "epoch": 0.5768098881695115, "grad_norm": 1.3125, "learning_rate": 0.0004975016217673556, "loss": 6.599, "mean_token_accuracy": 0.12148372679948807, "num_tokens": 11669447.0, "step": 5390 }, { "entropy": 6.697764110565186, "epoch": 0.5773449622772754, "grad_norm": 1.4140625, "learning_rate": 0.000497495936749821, "loss": 6.5675, "mean_token_accuracy": 0.12611041441559792, "num_tokens": 11679612.0, "step": 5395 }, { "entropy": 6.683344936370849, "epoch": 0.5778800363850394, "grad_norm": 1.3046875, "learning_rate": 0.0004974902453077474, "loss": 6.5514, "mean_token_accuracy": 0.1218061052262783, "num_tokens": 11689527.0, "step": 5400 }, { "entropy": 6.765136861801148, "epoch": 0.5784151104928033, "grad_norm": 1.3671875, "learning_rate": 0.0004974845474412993, "loss": 6.5856, "mean_token_accuracy": 0.12035764157772064, "num_tokens": 11700452.0, "step": 5405 }, { "entropy": 6.700014257431031, "epoch": 0.5789501846005671, "grad_norm": 1.625, "learning_rate": 0.0004974788431506412, "loss": 6.5971, "mean_token_accuracy": 0.1191385418176651, "num_tokens": 11710902.0, "step": 5410 }, { "entropy": 6.735801887512207, "epoch": 0.5794852587083311, "grad_norm": 1.484375, "learning_rate": 0.0004974731324359378, "loss": 6.6328, "mean_token_accuracy": 0.10948319584131241, "num_tokens": 11721901.0, "step": 5415 }, { "entropy": 6.765271472930908, "epoch": 0.580020332816095, "grad_norm": 1.2421875, "learning_rate": 0.0004974674152973538, "loss": 6.6146, "mean_token_accuracy": 0.11682233065366746, "num_tokens": 11733622.0, "step": 5420 }, { "entropy": 6.789870738983154, "epoch": 0.580555406923859, "grad_norm": 1.3359375, "learning_rate": 0.0004974616917350545, "loss": 6.6101, "mean_token_accuracy": 0.11982190161943436, "num_tokens": 11745116.0, "step": 5425 }, { "entropy": 6.661038208007812, "epoch": 0.5810904810316229, "grad_norm": 1.28125, "learning_rate": 0.0004974559617492052, "loss": 6.5446, "mean_token_accuracy": 0.12379105761647224, "num_tokens": 11756203.0, "step": 5430 }, { "entropy": 6.719126272201538, "epoch": 0.5816255551393869, "grad_norm": 1.375, "learning_rate": 0.0004974502253399712, "loss": 6.6041, "mean_token_accuracy": 0.12229030430316926, "num_tokens": 11766797.0, "step": 5435 }, { "entropy": 6.752104377746582, "epoch": 0.5821606292471507, "grad_norm": 1.3359375, "learning_rate": 0.0004974444825075182, "loss": 6.6896, "mean_token_accuracy": 0.11470270082354546, "num_tokens": 11778110.0, "step": 5440 }, { "entropy": 6.6274865627288815, "epoch": 0.5826957033549146, "grad_norm": 1.59375, "learning_rate": 0.000497438733252012, "loss": 6.551, "mean_token_accuracy": 0.12010784074664116, "num_tokens": 11788396.0, "step": 5445 }, { "entropy": 6.7564613819122314, "epoch": 0.5832307774626786, "grad_norm": 2.53125, "learning_rate": 0.0004974329775736188, "loss": 6.6412, "mean_token_accuracy": 0.1130734585225582, "num_tokens": 11798691.0, "step": 5450 }, { "entropy": 6.8176110744476315, "epoch": 0.5837658515704425, "grad_norm": 1.421875, "learning_rate": 0.0004974272154725044, "loss": 6.6809, "mean_token_accuracy": 0.1145077645778656, "num_tokens": 11808965.0, "step": 5455 }, { "entropy": 6.655050134658813, "epoch": 0.5843009256782065, "grad_norm": 1.3359375, "learning_rate": 0.0004974214469488355, "loss": 6.5144, "mean_token_accuracy": 0.12288807928562165, "num_tokens": 11819932.0, "step": 5460 }, { "entropy": 6.678020906448364, "epoch": 0.5848359997859703, "grad_norm": 1.5078125, "learning_rate": 0.0004974156720027786, "loss": 6.6115, "mean_token_accuracy": 0.11556534245610237, "num_tokens": 11831332.0, "step": 5465 }, { "entropy": 6.728974628448486, "epoch": 0.5853710738937343, "grad_norm": 1.53125, "learning_rate": 0.0004974098906345004, "loss": 6.5811, "mean_token_accuracy": 0.11275865510106087, "num_tokens": 11840947.0, "step": 5470 }, { "entropy": 6.7000159740448, "epoch": 0.5859061480014982, "grad_norm": 1.3046875, "learning_rate": 0.0004974041028441679, "loss": 6.5377, "mean_token_accuracy": 0.11802567318081855, "num_tokens": 11851640.0, "step": 5475 }, { "entropy": 6.733285045623779, "epoch": 0.5864412221092621, "grad_norm": 1.375, "learning_rate": 0.0004973983086319481, "loss": 6.6649, "mean_token_accuracy": 0.11307286396622658, "num_tokens": 11863608.0, "step": 5480 }, { "entropy": 6.722926664352417, "epoch": 0.5869762962170261, "grad_norm": 1.125, "learning_rate": 0.0004973925079980085, "loss": 6.5586, "mean_token_accuracy": 0.11841953471302986, "num_tokens": 11874707.0, "step": 5485 }, { "entropy": 6.687315177917481, "epoch": 0.58751137032479, "grad_norm": 1.59375, "learning_rate": 0.0004973867009425164, "loss": 6.659, "mean_token_accuracy": 0.11953919008374214, "num_tokens": 11885118.0, "step": 5490 }, { "entropy": 6.783655786514283, "epoch": 0.5880464444325539, "grad_norm": 1.2578125, "learning_rate": 0.0004973808874656396, "loss": 6.6231, "mean_token_accuracy": 0.11821292191743851, "num_tokens": 11895859.0, "step": 5495 }, { "entropy": 6.7643838882446286, "epoch": 0.5885815185403178, "grad_norm": 1.28125, "learning_rate": 0.0004973750675675458, "loss": 6.64, "mean_token_accuracy": 0.11871552392840386, "num_tokens": 11907019.0, "step": 5500 }, { "entropy": 6.729001569747925, "epoch": 0.5891165926480818, "grad_norm": 1.125, "learning_rate": 0.0004973692412484034, "loss": 6.5712, "mean_token_accuracy": 0.1146469995379448, "num_tokens": 11918257.0, "step": 5505 }, { "entropy": 6.721626091003418, "epoch": 0.5896516667558457, "grad_norm": 1.6015625, "learning_rate": 0.0004973634085083802, "loss": 6.5975, "mean_token_accuracy": 0.12574032694101334, "num_tokens": 11929003.0, "step": 5510 }, { "entropy": 6.757476425170898, "epoch": 0.5901867408636096, "grad_norm": 1.1640625, "learning_rate": 0.000497357569347645, "loss": 6.7213, "mean_token_accuracy": 0.11348426267504692, "num_tokens": 11939786.0, "step": 5515 }, { "entropy": 6.751842021942139, "epoch": 0.5907218149713735, "grad_norm": 1.1640625, "learning_rate": 0.0004973517237663661, "loss": 6.6311, "mean_token_accuracy": 0.11161758229136468, "num_tokens": 11951042.0, "step": 5520 }, { "entropy": 6.710853910446167, "epoch": 0.5912568890791374, "grad_norm": 1.953125, "learning_rate": 0.0004973458717647124, "loss": 6.5283, "mean_token_accuracy": 0.12709658294916154, "num_tokens": 11961982.0, "step": 5525 }, { "entropy": 6.703456449508667, "epoch": 0.5917919631869014, "grad_norm": 1.2890625, "learning_rate": 0.000497340013342853, "loss": 6.5923, "mean_token_accuracy": 0.12106578648090363, "num_tokens": 11972078.0, "step": 5530 }, { "entropy": 6.719264888763428, "epoch": 0.5923270372946653, "grad_norm": 1.609375, "learning_rate": 0.000497334148500957, "loss": 6.6446, "mean_token_accuracy": 0.11806860640645027, "num_tokens": 11984037.0, "step": 5535 }, { "entropy": 6.7681842803955075, "epoch": 0.5928621114024293, "grad_norm": 1.2890625, "learning_rate": 0.0004973282772391936, "loss": 6.5852, "mean_token_accuracy": 0.11801839917898178, "num_tokens": 11993688.0, "step": 5540 }, { "entropy": 6.667469120025634, "epoch": 0.5933971855101932, "grad_norm": 1.328125, "learning_rate": 0.0004973223995577324, "loss": 6.5477, "mean_token_accuracy": 0.11981470957398414, "num_tokens": 12003759.0, "step": 5545 }, { "entropy": 6.715129756927491, "epoch": 0.593932259617957, "grad_norm": 1.3125, "learning_rate": 0.0004973165154567432, "loss": 6.5858, "mean_token_accuracy": 0.1203451156616211, "num_tokens": 12015030.0, "step": 5550 }, { "entropy": 6.72750506401062, "epoch": 0.594467333725721, "grad_norm": 1.140625, "learning_rate": 0.0004973106249363959, "loss": 6.6509, "mean_token_accuracy": 0.11390956789255142, "num_tokens": 12026181.0, "step": 5555 }, { "entropy": 6.618847751617432, "epoch": 0.5950024078334849, "grad_norm": 1.28125, "learning_rate": 0.0004973047279968606, "loss": 6.4185, "mean_token_accuracy": 0.13287391439080237, "num_tokens": 12037336.0, "step": 5560 }, { "entropy": 6.65236268043518, "epoch": 0.5955374819412489, "grad_norm": 1.234375, "learning_rate": 0.0004972988246383074, "loss": 6.4918, "mean_token_accuracy": 0.12340264916419982, "num_tokens": 12048425.0, "step": 5565 }, { "entropy": 6.557363128662109, "epoch": 0.5960725560490128, "grad_norm": 1.65625, "learning_rate": 0.0004972929148609068, "loss": 6.4594, "mean_token_accuracy": 0.13635959550738336, "num_tokens": 12059814.0, "step": 5570 }, { "entropy": 6.68271279335022, "epoch": 0.5966076301567768, "grad_norm": 1.59375, "learning_rate": 0.0004972869986648296, "loss": 6.54, "mean_token_accuracy": 0.12527887672185897, "num_tokens": 12069377.0, "step": 5575 }, { "entropy": 6.707939195632934, "epoch": 0.5971427042645406, "grad_norm": 1.2890625, "learning_rate": 0.0004972810760502467, "loss": 6.666, "mean_token_accuracy": 0.11514274403452873, "num_tokens": 12080277.0, "step": 5580 }, { "entropy": 6.727867317199707, "epoch": 0.5976777783723045, "grad_norm": 1.21875, "learning_rate": 0.0004972751470173287, "loss": 6.5453, "mean_token_accuracy": 0.12022876664996147, "num_tokens": 12091375.0, "step": 5585 }, { "entropy": 6.676542520523071, "epoch": 0.5982128524800685, "grad_norm": 1.203125, "learning_rate": 0.0004972692115662473, "loss": 6.5893, "mean_token_accuracy": 0.11981748417019844, "num_tokens": 12103110.0, "step": 5590 }, { "entropy": 6.751420688629151, "epoch": 0.5987479265878324, "grad_norm": 1.7421875, "learning_rate": 0.0004972632696971735, "loss": 6.6451, "mean_token_accuracy": 0.11599904671311378, "num_tokens": 12112454.0, "step": 5595 }, { "entropy": 6.6340423107147215, "epoch": 0.5992830006955964, "grad_norm": 1.28125, "learning_rate": 0.0004972573214102791, "loss": 6.5246, "mean_token_accuracy": 0.11687616854906083, "num_tokens": 12125140.0, "step": 5600 }, { "entropy": 6.698513317108154, "epoch": 0.5998180748033602, "grad_norm": 1.8046875, "learning_rate": 0.0004972513667057358, "loss": 6.5691, "mean_token_accuracy": 0.12039392963051795, "num_tokens": 12136061.0, "step": 5605 }, { "entropy": 6.791307878494263, "epoch": 0.6003531489111242, "grad_norm": 1.171875, "learning_rate": 0.0004972454055837155, "loss": 6.6003, "mean_token_accuracy": 0.12150818780064583, "num_tokens": 12146654.0, "step": 5610 }, { "entropy": 6.723158931732177, "epoch": 0.6008882230188881, "grad_norm": 1.390625, "learning_rate": 0.0004972394380443903, "loss": 6.5878, "mean_token_accuracy": 0.11757106855511665, "num_tokens": 12157881.0, "step": 5615 }, { "entropy": 6.675697088241577, "epoch": 0.601423297126652, "grad_norm": 1.671875, "learning_rate": 0.0004972334640879325, "loss": 6.6085, "mean_token_accuracy": 0.11922492906451225, "num_tokens": 12168534.0, "step": 5620 }, { "entropy": 6.661304664611817, "epoch": 0.601958371234416, "grad_norm": 1.2421875, "learning_rate": 0.0004972274837145147, "loss": 6.5432, "mean_token_accuracy": 0.11988529115915299, "num_tokens": 12178773.0, "step": 5625 }, { "entropy": 6.739487743377685, "epoch": 0.6024934453421799, "grad_norm": 1.1875, "learning_rate": 0.0004972214969243096, "loss": 6.5808, "mean_token_accuracy": 0.11824664920568466, "num_tokens": 12188819.0, "step": 5630 }, { "entropy": 6.660564947128296, "epoch": 0.6030285194499438, "grad_norm": 1.2265625, "learning_rate": 0.00049721550371749, "loss": 6.5607, "mean_token_accuracy": 0.12463830485939979, "num_tokens": 12199198.0, "step": 5635 }, { "entropy": 6.6687784671783445, "epoch": 0.6035635935577077, "grad_norm": 1.1015625, "learning_rate": 0.0004972095040942289, "loss": 6.5644, "mean_token_accuracy": 0.1162213332951069, "num_tokens": 12210765.0, "step": 5640 }, { "entropy": 6.709344291687012, "epoch": 0.6040986676654717, "grad_norm": 1.71875, "learning_rate": 0.0004972034980546996, "loss": 6.6061, "mean_token_accuracy": 0.11544334441423416, "num_tokens": 12221067.0, "step": 5645 }, { "entropy": 6.653585481643677, "epoch": 0.6046337417732356, "grad_norm": 1.1875, "learning_rate": 0.0004971974855990755, "loss": 6.6023, "mean_token_accuracy": 0.11971136629581451, "num_tokens": 12232994.0, "step": 5650 }, { "entropy": 6.738733911514283, "epoch": 0.6051688158809995, "grad_norm": 1.4140625, "learning_rate": 0.0004971914667275302, "loss": 6.5538, "mean_token_accuracy": 0.12072688415646553, "num_tokens": 12243327.0, "step": 5655 }, { "entropy": 6.6140237808227536, "epoch": 0.6057038899887635, "grad_norm": 1.21875, "learning_rate": 0.0004971854414402377, "loss": 6.4752, "mean_token_accuracy": 0.12842355743050576, "num_tokens": 12254249.0, "step": 5660 }, { "entropy": 6.662600469589234, "epoch": 0.6062389640965273, "grad_norm": 1.296875, "learning_rate": 0.0004971794097373716, "loss": 6.5208, "mean_token_accuracy": 0.12328208535909653, "num_tokens": 12264487.0, "step": 5665 }, { "entropy": 6.569520473480225, "epoch": 0.6067740382042913, "grad_norm": 1.375, "learning_rate": 0.0004971733716191063, "loss": 6.5189, "mean_token_accuracy": 0.1292000360786915, "num_tokens": 12274801.0, "step": 5670 }, { "entropy": 6.636984205245971, "epoch": 0.6073091123120552, "grad_norm": 1.4375, "learning_rate": 0.0004971673270856162, "loss": 6.4777, "mean_token_accuracy": 0.11988460049033164, "num_tokens": 12284647.0, "step": 5675 }, { "entropy": 6.658068609237671, "epoch": 0.6078441864198192, "grad_norm": 1.2578125, "learning_rate": 0.0004971612761370756, "loss": 6.6033, "mean_token_accuracy": 0.11951280906796455, "num_tokens": 12295215.0, "step": 5680 }, { "entropy": 6.673429822921753, "epoch": 0.6083792605275831, "grad_norm": 1.4609375, "learning_rate": 0.0004971552187736596, "loss": 6.516, "mean_token_accuracy": 0.12064156159758568, "num_tokens": 12305324.0, "step": 5685 }, { "entropy": 6.668921661376953, "epoch": 0.6089143346353469, "grad_norm": 1.4375, "learning_rate": 0.0004971491549955427, "loss": 6.5372, "mean_token_accuracy": 0.12246538251638413, "num_tokens": 12316399.0, "step": 5690 }, { "entropy": 6.6165331363677975, "epoch": 0.6094494087431109, "grad_norm": 1.2265625, "learning_rate": 0.0004971430848029002, "loss": 6.5219, "mean_token_accuracy": 0.12773501947522165, "num_tokens": 12328033.0, "step": 5695 }, { "entropy": 6.681158256530762, "epoch": 0.6099844828508748, "grad_norm": 1.3984375, "learning_rate": 0.0004971370081959073, "loss": 6.5622, "mean_token_accuracy": 0.12176148667931556, "num_tokens": 12338962.0, "step": 5700 }, { "entropy": 6.697946166992187, "epoch": 0.6105195569586388, "grad_norm": 1.6328125, "learning_rate": 0.0004971309251747396, "loss": 6.5526, "mean_token_accuracy": 0.11940340176224709, "num_tokens": 12350216.0, "step": 5705 }, { "entropy": 6.745215272903442, "epoch": 0.6110546310664027, "grad_norm": 1.171875, "learning_rate": 0.0004971248357395726, "loss": 6.5806, "mean_token_accuracy": 0.11893382146954537, "num_tokens": 12361277.0, "step": 5710 }, { "entropy": 6.580714225769043, "epoch": 0.6115897051741667, "grad_norm": 1.4765625, "learning_rate": 0.0004971187398905821, "loss": 6.4858, "mean_token_accuracy": 0.12100339159369469, "num_tokens": 12373308.0, "step": 5715 }, { "entropy": 6.731028461456299, "epoch": 0.6121247792819305, "grad_norm": 1.3203125, "learning_rate": 0.0004971126376279443, "loss": 6.7259, "mean_token_accuracy": 0.11148046106100082, "num_tokens": 12383943.0, "step": 5720 }, { "entropy": 6.721910047531128, "epoch": 0.6126598533896944, "grad_norm": 1.3125, "learning_rate": 0.0004971065289518354, "loss": 6.482, "mean_token_accuracy": 0.12279203087091446, "num_tokens": 12394575.0, "step": 5725 }, { "entropy": 6.715807628631592, "epoch": 0.6131949274974584, "grad_norm": 1.265625, "learning_rate": 0.0004971004138624315, "loss": 6.5895, "mean_token_accuracy": 0.11779340729117393, "num_tokens": 12405536.0, "step": 5730 }, { "entropy": 6.606629800796509, "epoch": 0.6137300016052223, "grad_norm": 1.7109375, "learning_rate": 0.0004970942923599094, "loss": 6.4743, "mean_token_accuracy": 0.12641754895448684, "num_tokens": 12416148.0, "step": 5735 }, { "entropy": 6.612427473068237, "epoch": 0.6142650757129863, "grad_norm": 1.3828125, "learning_rate": 0.0004970881644444459, "loss": 6.48, "mean_token_accuracy": 0.12701191157102584, "num_tokens": 12426182.0, "step": 5740 }, { "entropy": 6.647663402557373, "epoch": 0.6148001498207502, "grad_norm": 1.1796875, "learning_rate": 0.0004970820301162178, "loss": 6.6625, "mean_token_accuracy": 0.11574866473674775, "num_tokens": 12437548.0, "step": 5745 }, { "entropy": 6.737516117095947, "epoch": 0.6153352239285141, "grad_norm": 1.7890625, "learning_rate": 0.0004970758893754022, "loss": 6.5979, "mean_token_accuracy": 0.11561758294701577, "num_tokens": 12449720.0, "step": 5750 }, { "entropy": 6.817887496948242, "epoch": 0.615870298036278, "grad_norm": 1.140625, "learning_rate": 0.0004970697422221767, "loss": 6.574, "mean_token_accuracy": 0.1215938724577427, "num_tokens": 12460666.0, "step": 5755 }, { "entropy": 6.7063861846923825, "epoch": 0.6164053721440419, "grad_norm": 1.3125, "learning_rate": 0.0004970635886567185, "loss": 6.5911, "mean_token_accuracy": 0.12281558737158775, "num_tokens": 12471472.0, "step": 5760 }, { "entropy": 6.611774969100952, "epoch": 0.6169404462518059, "grad_norm": 2.953125, "learning_rate": 0.0004970574286792054, "loss": 6.5681, "mean_token_accuracy": 0.11770694702863693, "num_tokens": 12482127.0, "step": 5765 }, { "entropy": 6.611656904220581, "epoch": 0.6174755203595698, "grad_norm": 1.34375, "learning_rate": 0.0004970512622898152, "loss": 6.5767, "mean_token_accuracy": 0.12225481644272804, "num_tokens": 12493680.0, "step": 5770 }, { "entropy": 6.65736231803894, "epoch": 0.6180105944673338, "grad_norm": 1.2734375, "learning_rate": 0.000497045089488726, "loss": 6.523, "mean_token_accuracy": 0.12167870178818703, "num_tokens": 12505838.0, "step": 5775 }, { "entropy": 6.704753160476685, "epoch": 0.6185456685750976, "grad_norm": 1.5078125, "learning_rate": 0.0004970389102761161, "loss": 6.5102, "mean_token_accuracy": 0.12942416369915008, "num_tokens": 12516334.0, "step": 5780 }, { "entropy": 6.661266231536866, "epoch": 0.6190807426828616, "grad_norm": 1.3984375, "learning_rate": 0.0004970327246521638, "loss": 6.5879, "mean_token_accuracy": 0.12000072821974754, "num_tokens": 12526440.0, "step": 5785 }, { "entropy": 6.680879926681518, "epoch": 0.6196158167906255, "grad_norm": 1.359375, "learning_rate": 0.0004970265326170478, "loss": 6.5266, "mean_token_accuracy": 0.11807752102613449, "num_tokens": 12538127.0, "step": 5790 }, { "entropy": 6.722283792495728, "epoch": 0.6201508908983894, "grad_norm": 1.34375, "learning_rate": 0.0004970203341709469, "loss": 6.5914, "mean_token_accuracy": 0.12216417640447616, "num_tokens": 12548459.0, "step": 5795 }, { "entropy": 6.58387131690979, "epoch": 0.6206859650061534, "grad_norm": 1.28125, "learning_rate": 0.00049701412931404, "loss": 6.5481, "mean_token_accuracy": 0.12659149914979934, "num_tokens": 12558989.0, "step": 5800 }, { "entropy": 6.62721471786499, "epoch": 0.6212210391139172, "grad_norm": 1.2109375, "learning_rate": 0.0004970079180465064, "loss": 6.4916, "mean_token_accuracy": 0.1283690959215164, "num_tokens": 12569449.0, "step": 5805 }, { "entropy": 6.644355916976929, "epoch": 0.6217561132216812, "grad_norm": 1.296875, "learning_rate": 0.0004970017003685253, "loss": 6.5297, "mean_token_accuracy": 0.12029706984758377, "num_tokens": 12580733.0, "step": 5810 }, { "entropy": 6.65497670173645, "epoch": 0.6222911873294451, "grad_norm": 1.3203125, "learning_rate": 0.0004969954762802763, "loss": 6.5326, "mean_token_accuracy": 0.11786738261580468, "num_tokens": 12590869.0, "step": 5815 }, { "entropy": 6.706523609161377, "epoch": 0.6228262614372091, "grad_norm": 1.40625, "learning_rate": 0.000496989245781939, "loss": 6.6305, "mean_token_accuracy": 0.11878098174929619, "num_tokens": 12602109.0, "step": 5820 }, { "entropy": 6.690067100524902, "epoch": 0.623361335544973, "grad_norm": 1.2578125, "learning_rate": 0.0004969830088736937, "loss": 6.5463, "mean_token_accuracy": 0.11708159074187278, "num_tokens": 12612234.0, "step": 5825 }, { "entropy": 6.761075687408447, "epoch": 0.6238964096527368, "grad_norm": 1.3125, "learning_rate": 0.00049697676555572, "loss": 6.6967, "mean_token_accuracy": 0.11268940791487694, "num_tokens": 12623252.0, "step": 5830 }, { "entropy": 6.709875154495239, "epoch": 0.6244314837605008, "grad_norm": 1.25, "learning_rate": 0.0004969705158281985, "loss": 6.4508, "mean_token_accuracy": 0.12307255640625954, "num_tokens": 12632796.0, "step": 5835 }, { "entropy": 6.652636289596558, "epoch": 0.6249665578682647, "grad_norm": 1.65625, "learning_rate": 0.0004969642596913095, "loss": 6.5512, "mean_token_accuracy": 0.11847778558731079, "num_tokens": 12643278.0, "step": 5840 }, { "entropy": 6.670278692245484, "epoch": 0.6255016319760287, "grad_norm": 5.25, "learning_rate": 0.0004969579971452337, "loss": 6.6218, "mean_token_accuracy": 0.12104167938232421, "num_tokens": 12654446.0, "step": 5845 }, { "entropy": 6.704672002792359, "epoch": 0.6260367060837926, "grad_norm": 1.4296875, "learning_rate": 0.0004969517281901519, "loss": 6.5988, "mean_token_accuracy": 0.12173526436090469, "num_tokens": 12664281.0, "step": 5850 }, { "entropy": 6.726960182189941, "epoch": 0.6265717801915566, "grad_norm": 1.671875, "learning_rate": 0.0004969454528262451, "loss": 6.5829, "mean_token_accuracy": 0.11787922754883766, "num_tokens": 12675252.0, "step": 5855 }, { "entropy": 6.665972471237183, "epoch": 0.6271068542993204, "grad_norm": 1.9765625, "learning_rate": 0.0004969391710536946, "loss": 6.5794, "mean_token_accuracy": 0.1184937097132206, "num_tokens": 12685764.0, "step": 5860 }, { "entropy": 6.591383934020996, "epoch": 0.6276419284070843, "grad_norm": 1.6328125, "learning_rate": 0.0004969328828726817, "loss": 6.4757, "mean_token_accuracy": 0.12730447500944136, "num_tokens": 12696974.0, "step": 5865 }, { "entropy": 6.757170295715332, "epoch": 0.6281770025148483, "grad_norm": 1.453125, "learning_rate": 0.0004969265882833879, "loss": 6.6372, "mean_token_accuracy": 0.11200533658266068, "num_tokens": 12708217.0, "step": 5870 }, { "entropy": 6.707298660278321, "epoch": 0.6287120766226122, "grad_norm": 1.6953125, "learning_rate": 0.0004969202872859952, "loss": 6.516, "mean_token_accuracy": 0.12099341303110123, "num_tokens": 12717840.0, "step": 5875 }, { "entropy": 6.622361516952514, "epoch": 0.6292471507303762, "grad_norm": 1.3828125, "learning_rate": 0.0004969139798806854, "loss": 6.6088, "mean_token_accuracy": 0.11309082061052322, "num_tokens": 12728390.0, "step": 5880 }, { "entropy": 6.653683233261108, "epoch": 0.6297822248381401, "grad_norm": 1.2734375, "learning_rate": 0.0004969076660676405, "loss": 6.6113, "mean_token_accuracy": 0.11578750982880592, "num_tokens": 12738650.0, "step": 5885 }, { "entropy": 6.735027837753296, "epoch": 0.630317298945904, "grad_norm": 1.484375, "learning_rate": 0.000496901345847043, "loss": 6.5966, "mean_token_accuracy": 0.11822382658720017, "num_tokens": 12748989.0, "step": 5890 }, { "entropy": 6.689414024353027, "epoch": 0.6308523730536679, "grad_norm": 1.2578125, "learning_rate": 0.0004968950192190752, "loss": 6.559, "mean_token_accuracy": 0.12090246379375458, "num_tokens": 12761132.0, "step": 5895 }, { "entropy": 6.6849761486053465, "epoch": 0.6313874471614318, "grad_norm": 1.25, "learning_rate": 0.00049688868618392, "loss": 6.5651, "mean_token_accuracy": 0.1228780284523964, "num_tokens": 12771478.0, "step": 5900 }, { "entropy": 6.716721773147583, "epoch": 0.6319225212691958, "grad_norm": 1.2109375, "learning_rate": 0.0004968823467417602, "loss": 6.6244, "mean_token_accuracy": 0.1174764983355999, "num_tokens": 12782096.0, "step": 5905 }, { "entropy": 6.716968536376953, "epoch": 0.6324575953769597, "grad_norm": 1.171875, "learning_rate": 0.0004968760008927788, "loss": 6.5262, "mean_token_accuracy": 0.12529518380761145, "num_tokens": 12792467.0, "step": 5910 }, { "entropy": 6.6767195701599125, "epoch": 0.6329926694847237, "grad_norm": 1.25, "learning_rate": 0.000496869648637159, "loss": 6.5373, "mean_token_accuracy": 0.12640023306012155, "num_tokens": 12803248.0, "step": 5915 }, { "entropy": 6.697324562072754, "epoch": 0.6335277435924875, "grad_norm": 1.3125, "learning_rate": 0.0004968632899750844, "loss": 6.5591, "mean_token_accuracy": 0.12147547379136085, "num_tokens": 12813701.0, "step": 5920 }, { "entropy": 6.800759792327881, "epoch": 0.6340628177002515, "grad_norm": 1.4453125, "learning_rate": 0.0004968569249067383, "loss": 6.6272, "mean_token_accuracy": 0.11679861545562745, "num_tokens": 12824945.0, "step": 5925 }, { "entropy": 6.671930313110352, "epoch": 0.6345978918080154, "grad_norm": 1.09375, "learning_rate": 0.0004968505534323047, "loss": 6.5786, "mean_token_accuracy": 0.1162982702255249, "num_tokens": 12836699.0, "step": 5930 }, { "entropy": 6.6336596488952635, "epoch": 0.6351329659157794, "grad_norm": 1.28125, "learning_rate": 0.0004968441755519677, "loss": 6.5291, "mean_token_accuracy": 0.11951676458120346, "num_tokens": 12846905.0, "step": 5935 }, { "entropy": 6.7043437480926515, "epoch": 0.6356680400235433, "grad_norm": 1.375, "learning_rate": 0.0004968377912659112, "loss": 6.5001, "mean_token_accuracy": 0.12340181395411491, "num_tokens": 12856919.0, "step": 5940 }, { "entropy": 6.60842661857605, "epoch": 0.6362031141313071, "grad_norm": 1.7109375, "learning_rate": 0.0004968314005743196, "loss": 6.4565, "mean_token_accuracy": 0.12368626967072487, "num_tokens": 12867863.0, "step": 5945 }, { "entropy": 6.611450290679931, "epoch": 0.6367381882390711, "grad_norm": 1.1796875, "learning_rate": 0.0004968250034773776, "loss": 6.5429, "mean_token_accuracy": 0.12223007977008819, "num_tokens": 12877877.0, "step": 5950 }, { "entropy": 6.737860918045044, "epoch": 0.637273262346835, "grad_norm": 1.59375, "learning_rate": 0.0004968185999752697, "loss": 6.6383, "mean_token_accuracy": 0.11434445828199387, "num_tokens": 12887954.0, "step": 5955 }, { "entropy": 6.707271003723145, "epoch": 0.637808336454599, "grad_norm": 1.1875, "learning_rate": 0.0004968121900681809, "loss": 6.5511, "mean_token_accuracy": 0.12070679739117622, "num_tokens": 12897744.0, "step": 5960 }, { "entropy": 6.68266224861145, "epoch": 0.6383434105623629, "grad_norm": 1.640625, "learning_rate": 0.0004968057737562964, "loss": 6.617, "mean_token_accuracy": 0.12236501500010491, "num_tokens": 12909193.0, "step": 5965 }, { "entropy": 6.663351440429688, "epoch": 0.6388784846701269, "grad_norm": 1.3125, "learning_rate": 0.0004967993510398012, "loss": 6.4973, "mean_token_accuracy": 0.12318923175334931, "num_tokens": 12919879.0, "step": 5970 }, { "entropy": 6.623578882217407, "epoch": 0.6394135587778907, "grad_norm": 1.2734375, "learning_rate": 0.0004967929219188809, "loss": 6.5387, "mean_token_accuracy": 0.12540650963783265, "num_tokens": 12930297.0, "step": 5975 }, { "entropy": 6.649103832244873, "epoch": 0.6399486328856546, "grad_norm": 1.375, "learning_rate": 0.0004967864863937212, "loss": 6.5329, "mean_token_accuracy": 0.12860941588878633, "num_tokens": 12940467.0, "step": 5980 }, { "entropy": 6.6491728782653805, "epoch": 0.6404837069934186, "grad_norm": 1.4296875, "learning_rate": 0.0004967800444645079, "loss": 6.5204, "mean_token_accuracy": 0.11868370845913886, "num_tokens": 12950417.0, "step": 5985 }, { "entropy": 6.636889123916626, "epoch": 0.6410187811011825, "grad_norm": 1.4765625, "learning_rate": 0.0004967735961314269, "loss": 6.4761, "mean_token_accuracy": 0.122308399528265, "num_tokens": 12960957.0, "step": 5990 }, { "entropy": 6.666227865219116, "epoch": 0.6415538552089465, "grad_norm": 1.125, "learning_rate": 0.0004967671413946646, "loss": 6.575, "mean_token_accuracy": 0.12026591822504998, "num_tokens": 12971194.0, "step": 5995 }, { "entropy": 6.6303346157073975, "epoch": 0.6420889293167104, "grad_norm": 1.5390625, "learning_rate": 0.0004967606802544071, "loss": 6.5736, "mean_token_accuracy": 0.11933250203728676, "num_tokens": 12982479.0, "step": 6000 }, { "epoch": 0.6420889293167104, "eval_entropy": 6.587495564643263, "eval_loss": 6.633632183074951, "eval_mean_token_accuracy": 0.123240454485414, "eval_num_tokens": 12982479.0, "eval_runtime": 22.6134, "eval_samples_per_second": 1312.45, "eval_steps_per_second": 164.062, "step": 6000 }, { "entropy": 6.708343410491944, "epoch": 0.6426240034244743, "grad_norm": 1.2578125, "learning_rate": 0.0004967542127108412, "loss": 6.6257, "mean_token_accuracy": 0.1161632239818573, "num_tokens": 12994119.0, "step": 6005 }, { "entropy": 6.693649530410767, "epoch": 0.6431590775322382, "grad_norm": 1.140625, "learning_rate": 0.0004967477387641537, "loss": 6.5309, "mean_token_accuracy": 0.1253574460744858, "num_tokens": 13005437.0, "step": 6010 }, { "entropy": 6.6332213401794435, "epoch": 0.6436941516400021, "grad_norm": 1.65625, "learning_rate": 0.0004967412584145312, "loss": 6.555, "mean_token_accuracy": 0.12132607325911522, "num_tokens": 13017278.0, "step": 6015 }, { "entropy": 6.6542360305786135, "epoch": 0.6442292257477661, "grad_norm": 1.21875, "learning_rate": 0.0004967347716621611, "loss": 6.5282, "mean_token_accuracy": 0.12165799587965012, "num_tokens": 13028010.0, "step": 6020 }, { "entropy": 6.629656457901001, "epoch": 0.64476429985553, "grad_norm": 1.1484375, "learning_rate": 0.0004967282785072306, "loss": 6.5233, "mean_token_accuracy": 0.12609869465231896, "num_tokens": 13038740.0, "step": 6025 }, { "entropy": 6.6070208072662355, "epoch": 0.645299373963294, "grad_norm": 1.203125, "learning_rate": 0.0004967217789499272, "loss": 6.543, "mean_token_accuracy": 0.12261505052447319, "num_tokens": 13049921.0, "step": 6030 }, { "entropy": 6.6102134704589846, "epoch": 0.6458344480710578, "grad_norm": 1.5, "learning_rate": 0.0004967152729904386, "loss": 6.4664, "mean_token_accuracy": 0.12932628467679025, "num_tokens": 13060907.0, "step": 6035 }, { "entropy": 6.6852294445037845, "epoch": 0.6463695221788218, "grad_norm": 1.1875, "learning_rate": 0.0004967087606289527, "loss": 6.501, "mean_token_accuracy": 0.12574908435344695, "num_tokens": 13071720.0, "step": 6040 }, { "entropy": 6.666558074951172, "epoch": 0.6469045962865857, "grad_norm": 1.203125, "learning_rate": 0.0004967022418656575, "loss": 6.5475, "mean_token_accuracy": 0.12468422725796699, "num_tokens": 13082474.0, "step": 6045 }, { "entropy": 6.596642351150512, "epoch": 0.6474396703943496, "grad_norm": 1.359375, "learning_rate": 0.0004966957167007412, "loss": 6.468, "mean_token_accuracy": 0.12356942817568779, "num_tokens": 13092777.0, "step": 6050 }, { "entropy": 6.594368410110474, "epoch": 0.6479747445021136, "grad_norm": 1.328125, "learning_rate": 0.0004966891851343922, "loss": 6.4676, "mean_token_accuracy": 0.12478138655424117, "num_tokens": 13104019.0, "step": 6055 }, { "entropy": 6.70648775100708, "epoch": 0.6485098186098774, "grad_norm": 1.15625, "learning_rate": 0.0004966826471667992, "loss": 6.4973, "mean_token_accuracy": 0.12690474689006806, "num_tokens": 13115741.0, "step": 6060 }, { "entropy": 6.651901435852051, "epoch": 0.6490448927176414, "grad_norm": 1.21875, "learning_rate": 0.0004966761027981509, "loss": 6.5075, "mean_token_accuracy": 0.12609103322029114, "num_tokens": 13126838.0, "step": 6065 }, { "entropy": 6.642081689834595, "epoch": 0.6495799668254053, "grad_norm": 1.1875, "learning_rate": 0.0004966695520286362, "loss": 6.6086, "mean_token_accuracy": 0.11905003264546395, "num_tokens": 13137485.0, "step": 6070 }, { "entropy": 6.6793499946594235, "epoch": 0.6501150409331693, "grad_norm": 1.2265625, "learning_rate": 0.0004966629948584444, "loss": 6.4684, "mean_token_accuracy": 0.1274704895913601, "num_tokens": 13147631.0, "step": 6075 }, { "entropy": 6.597648620605469, "epoch": 0.6506501150409332, "grad_norm": 1.46875, "learning_rate": 0.0004966564312877647, "loss": 6.5373, "mean_token_accuracy": 0.1260016866028309, "num_tokens": 13158468.0, "step": 6080 }, { "entropy": 6.723154020309448, "epoch": 0.651185189148697, "grad_norm": 3.109375, "learning_rate": 0.0004966498613167868, "loss": 6.5746, "mean_token_accuracy": 0.11794209703803063, "num_tokens": 13169263.0, "step": 6085 }, { "entropy": 6.676345491409302, "epoch": 0.651720263256461, "grad_norm": 1.375, "learning_rate": 0.0004966432849457002, "loss": 6.4874, "mean_token_accuracy": 0.13016888946294786, "num_tokens": 13178647.0, "step": 6090 }, { "entropy": 6.582516241073608, "epoch": 0.6522553373642249, "grad_norm": 1.1796875, "learning_rate": 0.000496636702174695, "loss": 6.4788, "mean_token_accuracy": 0.12643413320183755, "num_tokens": 13189883.0, "step": 6095 }, { "entropy": 6.648423719406128, "epoch": 0.6527904114719889, "grad_norm": 1.25, "learning_rate": 0.0004966301130039611, "loss": 6.6022, "mean_token_accuracy": 0.12256921008229256, "num_tokens": 13200920.0, "step": 6100 }, { "entropy": 6.701182746887207, "epoch": 0.6533254855797528, "grad_norm": 2.796875, "learning_rate": 0.0004966235174336889, "loss": 6.5918, "mean_token_accuracy": 0.11332411095499992, "num_tokens": 13211765.0, "step": 6105 }, { "entropy": 6.659097290039062, "epoch": 0.6538605596875168, "grad_norm": 1.390625, "learning_rate": 0.0004966169154640687, "loss": 6.5191, "mean_token_accuracy": 0.1247679390013218, "num_tokens": 13221768.0, "step": 6110 }, { "entropy": 6.609342384338379, "epoch": 0.6543956337952807, "grad_norm": 1.21875, "learning_rate": 0.0004966103070952912, "loss": 6.5209, "mean_token_accuracy": 0.12406276315450668, "num_tokens": 13233545.0, "step": 6115 }, { "entropy": 6.693496465682983, "epoch": 0.6549307079030445, "grad_norm": 1.2109375, "learning_rate": 0.0004966036923275472, "loss": 6.5591, "mean_token_accuracy": 0.13287978991866112, "num_tokens": 13245018.0, "step": 6120 }, { "entropy": 6.604655790328979, "epoch": 0.6554657820108085, "grad_norm": 1.7578125, "learning_rate": 0.0004965970711610278, "loss": 6.4761, "mean_token_accuracy": 0.12369921505451202, "num_tokens": 13255772.0, "step": 6125 }, { "entropy": 6.611993074417114, "epoch": 0.6560008561185724, "grad_norm": 1.6796875, "learning_rate": 0.0004965904435959241, "loss": 6.5591, "mean_token_accuracy": 0.11679132431745529, "num_tokens": 13267271.0, "step": 6130 }, { "entropy": 6.685591697692871, "epoch": 0.6565359302263364, "grad_norm": 1.5625, "learning_rate": 0.0004965838096324274, "loss": 6.558, "mean_token_accuracy": 0.12077526301145554, "num_tokens": 13278467.0, "step": 6135 }, { "entropy": 6.647955656051636, "epoch": 0.6570710043341003, "grad_norm": 1.296875, "learning_rate": 0.0004965771692707294, "loss": 6.625, "mean_token_accuracy": 0.11517797484993934, "num_tokens": 13288522.0, "step": 6140 }, { "entropy": 6.735994911193847, "epoch": 0.6576060784418643, "grad_norm": 1.65625, "learning_rate": 0.0004965705225110218, "loss": 6.5958, "mean_token_accuracy": 0.1102604016661644, "num_tokens": 13299355.0, "step": 6145 }, { "entropy": 6.69739933013916, "epoch": 0.6581411525496281, "grad_norm": 1.2578125, "learning_rate": 0.0004965638693534964, "loss": 6.5269, "mean_token_accuracy": 0.12430242151021957, "num_tokens": 13310334.0, "step": 6150 }, { "entropy": 6.717443895339966, "epoch": 0.658676226657392, "grad_norm": 1.59375, "learning_rate": 0.0004965572097983455, "loss": 6.5918, "mean_token_accuracy": 0.11856616660952568, "num_tokens": 13320917.0, "step": 6155 }, { "entropy": 6.674542045593261, "epoch": 0.659211300765156, "grad_norm": 1.078125, "learning_rate": 0.0004965505438457613, "loss": 6.4852, "mean_token_accuracy": 0.12417368888854981, "num_tokens": 13331707.0, "step": 6160 }, { "entropy": 6.640851926803589, "epoch": 0.6597463748729199, "grad_norm": 1.2109375, "learning_rate": 0.0004965438714959363, "loss": 6.629, "mean_token_accuracy": 0.11581350415945053, "num_tokens": 13341784.0, "step": 6165 }, { "entropy": 6.735370779037476, "epoch": 0.6602814489806839, "grad_norm": 1.4921875, "learning_rate": 0.000496537192749063, "loss": 6.5809, "mean_token_accuracy": 0.11734402552247047, "num_tokens": 13351633.0, "step": 6170 }, { "entropy": 6.681562995910644, "epoch": 0.6608165230884477, "grad_norm": 1.2421875, "learning_rate": 0.0004965305076053345, "loss": 6.4794, "mean_token_accuracy": 0.12656131833791734, "num_tokens": 13362444.0, "step": 6175 }, { "entropy": 6.592486047744751, "epoch": 0.6613515971962117, "grad_norm": 1.3984375, "learning_rate": 0.0004965238160649437, "loss": 6.6139, "mean_token_accuracy": 0.11791914477944374, "num_tokens": 13374322.0, "step": 6180 }, { "entropy": 6.651375102996826, "epoch": 0.6618866713039756, "grad_norm": 1.390625, "learning_rate": 0.0004965171181280838, "loss": 6.5627, "mean_token_accuracy": 0.11961539909243583, "num_tokens": 13384188.0, "step": 6185 }, { "entropy": 6.709027862548828, "epoch": 0.6624217454117395, "grad_norm": 1.2265625, "learning_rate": 0.0004965104137949483, "loss": 6.5697, "mean_token_accuracy": 0.11759102568030358, "num_tokens": 13395648.0, "step": 6190 }, { "entropy": 6.718053483963013, "epoch": 0.6629568195195035, "grad_norm": 1.28125, "learning_rate": 0.0004965037030657308, "loss": 6.594, "mean_token_accuracy": 0.12067084982991219, "num_tokens": 13406769.0, "step": 6195 }, { "entropy": 6.728432607650757, "epoch": 0.6634918936272673, "grad_norm": 1.5078125, "learning_rate": 0.0004964969859406248, "loss": 6.563, "mean_token_accuracy": 0.11147924661636352, "num_tokens": 13417509.0, "step": 6200 }, { "entropy": 6.6613959789276125, "epoch": 0.6640269677350313, "grad_norm": 2.703125, "learning_rate": 0.0004964902624198246, "loss": 6.4816, "mean_token_accuracy": 0.11563964560627937, "num_tokens": 13429441.0, "step": 6205 }, { "entropy": 6.6188640117645265, "epoch": 0.6645620418427952, "grad_norm": 1.375, "learning_rate": 0.0004964835325035243, "loss": 6.511, "mean_token_accuracy": 0.12196975350379943, "num_tokens": 13439332.0, "step": 6210 }, { "entropy": 6.617918682098389, "epoch": 0.6650971159505592, "grad_norm": 1.3046875, "learning_rate": 0.0004964767961919179, "loss": 6.4908, "mean_token_accuracy": 0.12061900198459626, "num_tokens": 13449400.0, "step": 6215 }, { "entropy": 6.680626916885376, "epoch": 0.6656321900583231, "grad_norm": 1.2734375, "learning_rate": 0.0004964700534852003, "loss": 6.5983, "mean_token_accuracy": 0.11767825335264206, "num_tokens": 13460134.0, "step": 6220 }, { "entropy": 6.686565780639649, "epoch": 0.666167264166087, "grad_norm": 1.390625, "learning_rate": 0.0004964633043835658, "loss": 6.5323, "mean_token_accuracy": 0.12875395640730858, "num_tokens": 13469954.0, "step": 6225 }, { "entropy": 6.679265308380127, "epoch": 0.666702338273851, "grad_norm": 1.5703125, "learning_rate": 0.0004964565488872097, "loss": 6.5229, "mean_token_accuracy": 0.12348946034908295, "num_tokens": 13479866.0, "step": 6230 }, { "entropy": 6.563807821273803, "epoch": 0.6672374123816148, "grad_norm": 1.3125, "learning_rate": 0.0004964497869963268, "loss": 6.478, "mean_token_accuracy": 0.12527237683534623, "num_tokens": 13490088.0, "step": 6235 }, { "entropy": 6.656466770172119, "epoch": 0.6677724864893788, "grad_norm": 1.3125, "learning_rate": 0.0004964430187111125, "loss": 6.5728, "mean_token_accuracy": 0.12173057049512863, "num_tokens": 13500898.0, "step": 6240 }, { "entropy": 6.687621164321899, "epoch": 0.6683075605971427, "grad_norm": 1.109375, "learning_rate": 0.0004964362440317621, "loss": 6.5927, "mean_token_accuracy": 0.1209525316953659, "num_tokens": 13511537.0, "step": 6245 }, { "entropy": 6.633641624450684, "epoch": 0.6688426347049067, "grad_norm": 1.2109375, "learning_rate": 0.0004964294629584712, "loss": 6.5303, "mean_token_accuracy": 0.12212182357907295, "num_tokens": 13522916.0, "step": 6250 }, { "entropy": 6.683465242385864, "epoch": 0.6693777088126706, "grad_norm": 1.2890625, "learning_rate": 0.0004964226754914357, "loss": 6.4758, "mean_token_accuracy": 0.12490794360637665, "num_tokens": 13533817.0, "step": 6255 }, { "entropy": 6.711468744277954, "epoch": 0.6699127829204344, "grad_norm": 1.625, "learning_rate": 0.0004964158816308517, "loss": 6.5852, "mean_token_accuracy": 0.11734790429472923, "num_tokens": 13543723.0, "step": 6260 }, { "entropy": 6.586713552474976, "epoch": 0.6704478570281984, "grad_norm": 1.4453125, "learning_rate": 0.0004964090813769151, "loss": 6.434, "mean_token_accuracy": 0.1227193221449852, "num_tokens": 13555269.0, "step": 6265 }, { "entropy": 6.64307050704956, "epoch": 0.6709829311359623, "grad_norm": 1.328125, "learning_rate": 0.0004964022747298224, "loss": 6.6139, "mean_token_accuracy": 0.11729198768734932, "num_tokens": 13567465.0, "step": 6270 }, { "entropy": 6.752734518051147, "epoch": 0.6715180052437263, "grad_norm": 1.4296875, "learning_rate": 0.0004963954616897701, "loss": 6.5446, "mean_token_accuracy": 0.11841646209359169, "num_tokens": 13578637.0, "step": 6275 }, { "entropy": 6.68422417640686, "epoch": 0.6720530793514902, "grad_norm": 1.5078125, "learning_rate": 0.000496388642256955, "loss": 6.5505, "mean_token_accuracy": 0.12172395139932632, "num_tokens": 13589074.0, "step": 6280 }, { "entropy": 6.646722793579102, "epoch": 0.6725881534592542, "grad_norm": 1.1640625, "learning_rate": 0.000496381816431574, "loss": 6.514, "mean_token_accuracy": 0.12342069149017335, "num_tokens": 13599624.0, "step": 6285 }, { "entropy": 6.719354677200317, "epoch": 0.673123227567018, "grad_norm": 1.2734375, "learning_rate": 0.0004963749842138241, "loss": 6.5363, "mean_token_accuracy": 0.12487530261278153, "num_tokens": 13610293.0, "step": 6290 }, { "entropy": 6.675761699676514, "epoch": 0.6736583016747819, "grad_norm": 1.9453125, "learning_rate": 0.0004963681456039027, "loss": 6.5611, "mean_token_accuracy": 0.11623863652348518, "num_tokens": 13621641.0, "step": 6295 }, { "entropy": 6.602420663833618, "epoch": 0.6741933757825459, "grad_norm": 1.2890625, "learning_rate": 0.0004963613006020072, "loss": 6.5252, "mean_token_accuracy": 0.1208052784204483, "num_tokens": 13632083.0, "step": 6300 }, { "entropy": 6.604093360900879, "epoch": 0.6747284498903098, "grad_norm": 1.5546875, "learning_rate": 0.0004963544492083352, "loss": 6.41, "mean_token_accuracy": 0.13683966994285585, "num_tokens": 13644084.0, "step": 6305 }, { "entropy": 6.6350510597229, "epoch": 0.6752635239980738, "grad_norm": 1.6328125, "learning_rate": 0.0004963475914230845, "loss": 6.5449, "mean_token_accuracy": 0.11910239085555077, "num_tokens": 13656231.0, "step": 6310 }, { "entropy": 6.699683904647827, "epoch": 0.6757985981058376, "grad_norm": 2.140625, "learning_rate": 0.0004963407272464533, "loss": 6.5952, "mean_token_accuracy": 0.11810294091701508, "num_tokens": 13667334.0, "step": 6315 }, { "entropy": 6.724069118499756, "epoch": 0.6763336722136016, "grad_norm": 1.40625, "learning_rate": 0.0004963338566786398, "loss": 6.5828, "mean_token_accuracy": 0.12107535973191261, "num_tokens": 13678615.0, "step": 6320 }, { "entropy": 6.693145990371704, "epoch": 0.6768687463213655, "grad_norm": 1.578125, "learning_rate": 0.0004963269797198422, "loss": 6.5874, "mean_token_accuracy": 0.12346574515104294, "num_tokens": 13689890.0, "step": 6325 }, { "entropy": 6.558933973312378, "epoch": 0.6774038204291294, "grad_norm": 1.6328125, "learning_rate": 0.0004963200963702592, "loss": 6.4168, "mean_token_accuracy": 0.13032166957855223, "num_tokens": 13699120.0, "step": 6330 }, { "entropy": 6.581582736968994, "epoch": 0.6779388945368934, "grad_norm": 1.25, "learning_rate": 0.0004963132066300894, "loss": 6.5395, "mean_token_accuracy": 0.11724406257271766, "num_tokens": 13710016.0, "step": 6335 }, { "entropy": 6.6938841342926025, "epoch": 0.6784739686446573, "grad_norm": 1.5546875, "learning_rate": 0.0004963063104995319, "loss": 6.6391, "mean_token_accuracy": 0.11238991096615791, "num_tokens": 13721576.0, "step": 6340 }, { "entropy": 6.745585584640503, "epoch": 0.6790090427524212, "grad_norm": 1.453125, "learning_rate": 0.0004962994079787859, "loss": 6.591, "mean_token_accuracy": 0.12299842238426209, "num_tokens": 13732568.0, "step": 6345 }, { "entropy": 6.657323408126831, "epoch": 0.6795441168601851, "grad_norm": 1.4296875, "learning_rate": 0.0004962924990680504, "loss": 6.4794, "mean_token_accuracy": 0.12324386537075042, "num_tokens": 13742569.0, "step": 6350 }, { "entropy": 6.627435684204102, "epoch": 0.6800791909679491, "grad_norm": 1.453125, "learning_rate": 0.0004962855837675252, "loss": 6.6034, "mean_token_accuracy": 0.11716282293200493, "num_tokens": 13752689.0, "step": 6355 }, { "entropy": 6.6892821311950685, "epoch": 0.680614265075713, "grad_norm": 1.453125, "learning_rate": 0.0004962786620774099, "loss": 6.5905, "mean_token_accuracy": 0.11979246288537979, "num_tokens": 13763709.0, "step": 6360 }, { "entropy": 6.705752182006836, "epoch": 0.6811493391834769, "grad_norm": 1.6796875, "learning_rate": 0.0004962717339979043, "loss": 6.4891, "mean_token_accuracy": 0.1252245396375656, "num_tokens": 13773726.0, "step": 6365 }, { "entropy": 6.608482742309571, "epoch": 0.6816844132912409, "grad_norm": 1.328125, "learning_rate": 0.0004962647995292084, "loss": 6.5296, "mean_token_accuracy": 0.12159904614090919, "num_tokens": 13785435.0, "step": 6370 }, { "entropy": 6.640556859970093, "epoch": 0.6822194873990047, "grad_norm": 1.71875, "learning_rate": 0.0004962578586715226, "loss": 6.52, "mean_token_accuracy": 0.11594315767288207, "num_tokens": 13797104.0, "step": 6375 }, { "entropy": 6.7496202945709225, "epoch": 0.6827545615067687, "grad_norm": 1.3515625, "learning_rate": 0.0004962509114250471, "loss": 6.6121, "mean_token_accuracy": 0.11787962764501572, "num_tokens": 13807756.0, "step": 6380 }, { "entropy": 6.491614484786988, "epoch": 0.6832896356145326, "grad_norm": 1.453125, "learning_rate": 0.0004962439577899828, "loss": 6.314, "mean_token_accuracy": 0.13807514384388925, "num_tokens": 13818490.0, "step": 6385 }, { "entropy": 6.646625661849976, "epoch": 0.6838247097222966, "grad_norm": 1.28125, "learning_rate": 0.0004962369977665301, "loss": 6.5814, "mean_token_accuracy": 0.11426923871040344, "num_tokens": 13829465.0, "step": 6390 }, { "entropy": 6.783056354522705, "epoch": 0.6843597838300605, "grad_norm": 1.171875, "learning_rate": 0.0004962300313548903, "loss": 6.5539, "mean_token_accuracy": 0.12248866409063339, "num_tokens": 13840863.0, "step": 6395 }, { "entropy": 6.695218420028686, "epoch": 0.6848948579378243, "grad_norm": 1.2265625, "learning_rate": 0.0004962230585552645, "loss": 6.549, "mean_token_accuracy": 0.12046386897563935, "num_tokens": 13851711.0, "step": 6400 }, { "entropy": 6.581887054443359, "epoch": 0.6854299320455883, "grad_norm": 1.6953125, "learning_rate": 0.0004962160793678539, "loss": 6.5789, "mean_token_accuracy": 0.11757319420576096, "num_tokens": 13864576.0, "step": 6405 }, { "entropy": 6.6630912780761715, "epoch": 0.6859650061533522, "grad_norm": 1.3359375, "learning_rate": 0.00049620909379286, "loss": 6.4883, "mean_token_accuracy": 0.12629830315709115, "num_tokens": 13875150.0, "step": 6410 }, { "entropy": 6.683273983001709, "epoch": 0.6865000802611162, "grad_norm": 2.546875, "learning_rate": 0.0004962021018304847, "loss": 6.5422, "mean_token_accuracy": 0.12137580290436745, "num_tokens": 13886070.0, "step": 6415 }, { "entropy": 6.600133419036865, "epoch": 0.6870351543688801, "grad_norm": 1.078125, "learning_rate": 0.0004961951034809298, "loss": 6.4596, "mean_token_accuracy": 0.11954843401908874, "num_tokens": 13897898.0, "step": 6420 }, { "entropy": 6.743383502960205, "epoch": 0.6875702284766441, "grad_norm": 1.2578125, "learning_rate": 0.0004961880987443974, "loss": 6.5996, "mean_token_accuracy": 0.1191033512353897, "num_tokens": 13909578.0, "step": 6425 }, { "entropy": 6.5636146068573, "epoch": 0.6881053025844079, "grad_norm": 1.46875, "learning_rate": 0.0004961810876210897, "loss": 6.4561, "mean_token_accuracy": 0.12540539875626563, "num_tokens": 13920537.0, "step": 6430 }, { "entropy": 6.548890447616577, "epoch": 0.6886403766921718, "grad_norm": 1.2734375, "learning_rate": 0.0004961740701112091, "loss": 6.5134, "mean_token_accuracy": 0.12369008883833885, "num_tokens": 13931015.0, "step": 6435 }, { "entropy": 6.668211126327515, "epoch": 0.6891754507999358, "grad_norm": 1.2109375, "learning_rate": 0.0004961670462149583, "loss": 6.5521, "mean_token_accuracy": 0.12055359557271003, "num_tokens": 13942691.0, "step": 6440 }, { "entropy": 6.767236375808716, "epoch": 0.6897105249076997, "grad_norm": 1.21875, "learning_rate": 0.0004961600159325403, "loss": 6.637, "mean_token_accuracy": 0.10908434465527535, "num_tokens": 13953945.0, "step": 6445 }, { "entropy": 6.751330995559693, "epoch": 0.6902455990154637, "grad_norm": 1.328125, "learning_rate": 0.0004961529792641577, "loss": 6.6236, "mean_token_accuracy": 0.1173236459493637, "num_tokens": 13965658.0, "step": 6450 }, { "entropy": 6.731899356842041, "epoch": 0.6907806731232276, "grad_norm": 1.2578125, "learning_rate": 0.0004961459362100141, "loss": 6.5992, "mean_token_accuracy": 0.12082590013742447, "num_tokens": 13976184.0, "step": 6455 }, { "entropy": 6.6650745391845705, "epoch": 0.6913157472309915, "grad_norm": 1.1953125, "learning_rate": 0.0004961388867703125, "loss": 6.5114, "mean_token_accuracy": 0.11692757606506347, "num_tokens": 13986243.0, "step": 6460 }, { "entropy": 6.65087571144104, "epoch": 0.6918508213387554, "grad_norm": 1.109375, "learning_rate": 0.0004961318309452566, "loss": 6.507, "mean_token_accuracy": 0.12220369726419449, "num_tokens": 13995904.0, "step": 6465 }, { "entropy": 6.659942245483398, "epoch": 0.6923858954465193, "grad_norm": 1.3359375, "learning_rate": 0.0004961247687350504, "loss": 6.5498, "mean_token_accuracy": 0.12576377019286156, "num_tokens": 14006711.0, "step": 6470 }, { "entropy": 6.628136539459229, "epoch": 0.6929209695542833, "grad_norm": 1.2890625, "learning_rate": 0.0004961177001398974, "loss": 6.527, "mean_token_accuracy": 0.12062407061457633, "num_tokens": 14018177.0, "step": 6475 }, { "entropy": 6.665041160583496, "epoch": 0.6934560436620472, "grad_norm": 1.40625, "learning_rate": 0.0004961106251600018, "loss": 6.4884, "mean_token_accuracy": 0.11637992933392524, "num_tokens": 14028725.0, "step": 6480 }, { "entropy": 6.6288951396942135, "epoch": 0.6939911177698111, "grad_norm": 1.2578125, "learning_rate": 0.0004961035437955681, "loss": 6.5271, "mean_token_accuracy": 0.13461530953645706, "num_tokens": 14040448.0, "step": 6485 }, { "entropy": 6.62433614730835, "epoch": 0.694526191877575, "grad_norm": 1.2109375, "learning_rate": 0.0004960964560468005, "loss": 6.5734, "mean_token_accuracy": 0.11507597416639329, "num_tokens": 14051731.0, "step": 6490 }, { "entropy": 6.7240547180175785, "epoch": 0.695061265985339, "grad_norm": 1.1953125, "learning_rate": 0.0004960893619139039, "loss": 6.5658, "mean_token_accuracy": 0.11801211908459663, "num_tokens": 14062330.0, "step": 6495 }, { "entropy": 6.683112001419067, "epoch": 0.6955963400931029, "grad_norm": 1.1640625, "learning_rate": 0.0004960822613970831, "loss": 6.4486, "mean_token_accuracy": 0.12386781573295594, "num_tokens": 14073991.0, "step": 6500 }, { "entropy": 6.640247869491577, "epoch": 0.6961314142008668, "grad_norm": 1.421875, "learning_rate": 0.0004960751544965431, "loss": 6.5076, "mean_token_accuracy": 0.12210935950279236, "num_tokens": 14085132.0, "step": 6505 }, { "entropy": 6.592376041412353, "epoch": 0.6966664883086308, "grad_norm": 1.3515625, "learning_rate": 0.0004960680412124889, "loss": 6.4499, "mean_token_accuracy": 0.12720930054783822, "num_tokens": 14095371.0, "step": 6510 }, { "entropy": 6.5528076171875, "epoch": 0.6972015624163946, "grad_norm": 1.7421875, "learning_rate": 0.0004960609215451261, "loss": 6.5341, "mean_token_accuracy": 0.12374990880489349, "num_tokens": 14106117.0, "step": 6515 }, { "entropy": 6.649059104919433, "epoch": 0.6977366365241586, "grad_norm": 1.2734375, "learning_rate": 0.0004960537954946604, "loss": 6.5267, "mean_token_accuracy": 0.12003685981035232, "num_tokens": 14117112.0, "step": 6520 }, { "entropy": 6.596162796020508, "epoch": 0.6982717106319225, "grad_norm": 1.3046875, "learning_rate": 0.0004960466630612974, "loss": 6.4541, "mean_token_accuracy": 0.13205637782812119, "num_tokens": 14128037.0, "step": 6525 }, { "entropy": 6.556289529800415, "epoch": 0.6988067847396865, "grad_norm": 1.2734375, "learning_rate": 0.0004960395242452429, "loss": 6.4584, "mean_token_accuracy": 0.12506138905882835, "num_tokens": 14140183.0, "step": 6530 }, { "entropy": 6.6649885177612305, "epoch": 0.6993418588474504, "grad_norm": 1.4921875, "learning_rate": 0.0004960323790467033, "loss": 6.5995, "mean_token_accuracy": 0.12367913722991944, "num_tokens": 14151635.0, "step": 6535 }, { "entropy": 6.737906551361084, "epoch": 0.6998769329552142, "grad_norm": 1.28125, "learning_rate": 0.0004960252274658849, "loss": 6.5577, "mean_token_accuracy": 0.12105544358491897, "num_tokens": 14162660.0, "step": 6540 }, { "entropy": 6.671280765533448, "epoch": 0.7004120070629782, "grad_norm": 1.3828125, "learning_rate": 0.0004960180695029939, "loss": 6.5407, "mean_token_accuracy": 0.12037990167737007, "num_tokens": 14173496.0, "step": 6545 }, { "entropy": 6.617800331115722, "epoch": 0.7009470811707421, "grad_norm": 1.34375, "learning_rate": 0.0004960109051582374, "loss": 6.4934, "mean_token_accuracy": 0.11847614273428916, "num_tokens": 14185479.0, "step": 6550 }, { "entropy": 6.60119400024414, "epoch": 0.7014821552785061, "grad_norm": 1.3046875, "learning_rate": 0.0004960037344318221, "loss": 6.4507, "mean_token_accuracy": 0.12120893523097039, "num_tokens": 14197441.0, "step": 6555 }, { "entropy": 6.566002035140992, "epoch": 0.70201722938627, "grad_norm": 1.2890625, "learning_rate": 0.0004959965573239548, "loss": 6.4247, "mean_token_accuracy": 0.12884053736925125, "num_tokens": 14207832.0, "step": 6560 }, { "entropy": 6.55321888923645, "epoch": 0.702552303494034, "grad_norm": 1.3203125, "learning_rate": 0.0004959893738348432, "loss": 6.4945, "mean_token_accuracy": 0.12767787277698517, "num_tokens": 14217976.0, "step": 6565 }, { "entropy": 6.674604034423828, "epoch": 0.7030873776017978, "grad_norm": 1.421875, "learning_rate": 0.0004959821839646943, "loss": 6.4431, "mean_token_accuracy": 0.12329324334859848, "num_tokens": 14227557.0, "step": 6570 }, { "entropy": 6.662657594680786, "epoch": 0.7036224517095617, "grad_norm": 1.28125, "learning_rate": 0.000495974987713716, "loss": 6.571, "mean_token_accuracy": 0.11384310796856881, "num_tokens": 14238912.0, "step": 6575 }, { "entropy": 6.638991737365723, "epoch": 0.7041575258173257, "grad_norm": 1.25, "learning_rate": 0.0004959677850821159, "loss": 6.5012, "mean_token_accuracy": 0.12319194078445435, "num_tokens": 14249968.0, "step": 6580 }, { "entropy": 6.620342445373535, "epoch": 0.7046925999250896, "grad_norm": 1.265625, "learning_rate": 0.0004959605760701021, "loss": 6.5569, "mean_token_accuracy": 0.12182011604309081, "num_tokens": 14260809.0, "step": 6585 }, { "entropy": 6.663771057128907, "epoch": 0.7052276740328536, "grad_norm": 1.5, "learning_rate": 0.0004959533606778827, "loss": 6.527, "mean_token_accuracy": 0.1212913878262043, "num_tokens": 14271971.0, "step": 6590 }, { "entropy": 6.70226559638977, "epoch": 0.7057627481406175, "grad_norm": 1.265625, "learning_rate": 0.0004959461389056661, "loss": 6.5913, "mean_token_accuracy": 0.12781344801187516, "num_tokens": 14283550.0, "step": 6595 }, { "entropy": 6.566189193725586, "epoch": 0.7062978222483814, "grad_norm": 1.25, "learning_rate": 0.0004959389107536608, "loss": 6.4158, "mean_token_accuracy": 0.12276504635810852, "num_tokens": 14293769.0, "step": 6600 }, { "entropy": 6.642466735839844, "epoch": 0.7068328963561453, "grad_norm": 1.3203125, "learning_rate": 0.0004959316762220754, "loss": 6.5368, "mean_token_accuracy": 0.11977979466319084, "num_tokens": 14304668.0, "step": 6605 }, { "entropy": 6.650493144989014, "epoch": 0.7073679704639092, "grad_norm": 1.234375, "learning_rate": 0.000495924435311119, "loss": 6.5975, "mean_token_accuracy": 0.11864884719252586, "num_tokens": 14315912.0, "step": 6610 }, { "entropy": 6.61599588394165, "epoch": 0.7079030445716732, "grad_norm": 1.1875, "learning_rate": 0.0004959171880210005, "loss": 6.5415, "mean_token_accuracy": 0.1240161381661892, "num_tokens": 14327386.0, "step": 6615 }, { "entropy": 6.61832332611084, "epoch": 0.7084381186794371, "grad_norm": 1.1640625, "learning_rate": 0.0004959099343519294, "loss": 6.5297, "mean_token_accuracy": 0.11902955025434495, "num_tokens": 14338629.0, "step": 6620 }, { "entropy": 6.745673322677613, "epoch": 0.7089731927872011, "grad_norm": 1.171875, "learning_rate": 0.0004959026743041148, "loss": 6.5523, "mean_token_accuracy": 0.12611126601696016, "num_tokens": 14349195.0, "step": 6625 }, { "entropy": 6.707384347915649, "epoch": 0.7095082668949649, "grad_norm": 1.4375, "learning_rate": 0.0004958954078777665, "loss": 6.5804, "mean_token_accuracy": 0.11705741733312607, "num_tokens": 14359449.0, "step": 6630 }, { "entropy": 6.607598972320557, "epoch": 0.7100433410027289, "grad_norm": 1.3828125, "learning_rate": 0.0004958881350730944, "loss": 6.4914, "mean_token_accuracy": 0.12530679404735565, "num_tokens": 14369904.0, "step": 6635 }, { "entropy": 6.640906763076782, "epoch": 0.7105784151104928, "grad_norm": 1.4453125, "learning_rate": 0.0004958808558903085, "loss": 6.502, "mean_token_accuracy": 0.12301137670874596, "num_tokens": 14382635.0, "step": 6640 }, { "entropy": 6.597404193878174, "epoch": 0.7111134892182567, "grad_norm": 1.4140625, "learning_rate": 0.0004958735703296189, "loss": 6.4504, "mean_token_accuracy": 0.12635595500469207, "num_tokens": 14393238.0, "step": 6645 }, { "entropy": 6.605778455734253, "epoch": 0.7116485633260207, "grad_norm": 1.25, "learning_rate": 0.000495866278391236, "loss": 6.4988, "mean_token_accuracy": 0.12151379361748696, "num_tokens": 14403734.0, "step": 6650 }, { "entropy": 6.662947177886963, "epoch": 0.7121836374337845, "grad_norm": 1.6640625, "learning_rate": 0.0004958589800753703, "loss": 6.493, "mean_token_accuracy": 0.12501125037670135, "num_tokens": 14414201.0, "step": 6655 }, { "entropy": 6.639647436141968, "epoch": 0.7127187115415485, "grad_norm": 1.21875, "learning_rate": 0.0004958516753822326, "loss": 6.5273, "mean_token_accuracy": 0.12744878232479095, "num_tokens": 14425153.0, "step": 6660 }, { "entropy": 6.599532556533814, "epoch": 0.7132537856493124, "grad_norm": 1.453125, "learning_rate": 0.0004958443643120338, "loss": 6.5016, "mean_token_accuracy": 0.12863869071006775, "num_tokens": 14435942.0, "step": 6665 }, { "entropy": 6.614558696746826, "epoch": 0.7137888597570764, "grad_norm": 1.4453125, "learning_rate": 0.000495837046864985, "loss": 6.4763, "mean_token_accuracy": 0.12335674315690995, "num_tokens": 14446371.0, "step": 6670 }, { "entropy": 6.617805099487304, "epoch": 0.7143239338648403, "grad_norm": 1.421875, "learning_rate": 0.0004958297230412976, "loss": 6.4252, "mean_token_accuracy": 0.127166984975338, "num_tokens": 14456598.0, "step": 6675 }, { "entropy": 6.555561685562134, "epoch": 0.7148590079726042, "grad_norm": 2.703125, "learning_rate": 0.0004958223928411829, "loss": 6.5309, "mean_token_accuracy": 0.1143219605088234, "num_tokens": 14466775.0, "step": 6680 }, { "entropy": 6.574054431915283, "epoch": 0.7153940820803681, "grad_norm": 1.375, "learning_rate": 0.0004958150562648526, "loss": 6.4665, "mean_token_accuracy": 0.12366539910435677, "num_tokens": 14476876.0, "step": 6685 }, { "entropy": 6.590529203414917, "epoch": 0.715929156188132, "grad_norm": 1.3984375, "learning_rate": 0.0004958077133125187, "loss": 6.4797, "mean_token_accuracy": 0.12587342411279678, "num_tokens": 14487698.0, "step": 6690 }, { "entropy": 6.692271709442139, "epoch": 0.716464230295896, "grad_norm": 1.640625, "learning_rate": 0.000495800363984393, "loss": 6.4987, "mean_token_accuracy": 0.12271760776638985, "num_tokens": 14498572.0, "step": 6695 }, { "entropy": 6.623218107223511, "epoch": 0.7169993044036599, "grad_norm": 1.3515625, "learning_rate": 0.0004957930082806878, "loss": 6.5438, "mean_token_accuracy": 0.12247662395238876, "num_tokens": 14509673.0, "step": 6700 }, { "entropy": 6.70994553565979, "epoch": 0.7175343785114239, "grad_norm": 1.515625, "learning_rate": 0.0004957856462016155, "loss": 6.6279, "mean_token_accuracy": 0.1105528324842453, "num_tokens": 14519974.0, "step": 6705 }, { "entropy": 6.691906595230103, "epoch": 0.7180694526191878, "grad_norm": 2.21875, "learning_rate": 0.0004957782777473888, "loss": 6.5373, "mean_token_accuracy": 0.11652741655707359, "num_tokens": 14531194.0, "step": 6710 }, { "entropy": 6.606967735290527, "epoch": 0.7186045267269516, "grad_norm": 1.75, "learning_rate": 0.0004957709029182203, "loss": 6.4862, "mean_token_accuracy": 0.12221086099743843, "num_tokens": 14542393.0, "step": 6715 }, { "entropy": 6.582061862945556, "epoch": 0.7191396008347156, "grad_norm": 1.375, "learning_rate": 0.0004957635217143231, "loss": 6.4944, "mean_token_accuracy": 0.13097272515296937, "num_tokens": 14552934.0, "step": 6720 }, { "entropy": 6.62083740234375, "epoch": 0.7196746749424795, "grad_norm": 1.3984375, "learning_rate": 0.00049575613413591, "loss": 6.4978, "mean_token_accuracy": 0.120374695956707, "num_tokens": 14563643.0, "step": 6725 }, { "entropy": 6.601111316680909, "epoch": 0.7202097490502435, "grad_norm": 1.296875, "learning_rate": 0.0004957487401831947, "loss": 6.445, "mean_token_accuracy": 0.12362169623374938, "num_tokens": 14574422.0, "step": 6730 }, { "entropy": 6.584991502761841, "epoch": 0.7207448231580074, "grad_norm": 1.140625, "learning_rate": 0.0004957413398563906, "loss": 6.4292, "mean_token_accuracy": 0.11930982172489166, "num_tokens": 14585002.0, "step": 6735 }, { "entropy": 6.625512647628784, "epoch": 0.7212798972657714, "grad_norm": 1.6875, "learning_rate": 0.0004957339331557113, "loss": 6.4612, "mean_token_accuracy": 0.1259589172899723, "num_tokens": 14595172.0, "step": 6740 }, { "entropy": 6.599657821655273, "epoch": 0.7218149713735352, "grad_norm": 1.2421875, "learning_rate": 0.0004957265200813706, "loss": 6.5742, "mean_token_accuracy": 0.11676609218120575, "num_tokens": 14606316.0, "step": 6745 }, { "entropy": 6.696068477630615, "epoch": 0.7223500454812991, "grad_norm": 1.609375, "learning_rate": 0.0004957191006335827, "loss": 6.4903, "mean_token_accuracy": 0.12656715735793114, "num_tokens": 14616394.0, "step": 6750 }, { "entropy": 6.555004119873047, "epoch": 0.7228851195890631, "grad_norm": 1.5, "learning_rate": 0.0004957116748125618, "loss": 6.4925, "mean_token_accuracy": 0.11967325806617737, "num_tokens": 14627474.0, "step": 6755 }, { "entropy": 6.575228595733643, "epoch": 0.723420193696827, "grad_norm": 1.28125, "learning_rate": 0.0004957042426185223, "loss": 6.4314, "mean_token_accuracy": 0.13004304990172386, "num_tokens": 14638343.0, "step": 6760 }, { "entropy": 6.614687061309814, "epoch": 0.723955267804591, "grad_norm": 1.328125, "learning_rate": 0.0004956968040516789, "loss": 6.4941, "mean_token_accuracy": 0.12631681188941002, "num_tokens": 14649115.0, "step": 6765 }, { "entropy": 6.607396507263184, "epoch": 0.7244903419123548, "grad_norm": 1.1328125, "learning_rate": 0.0004956893591122461, "loss": 6.5614, "mean_token_accuracy": 0.1266578659415245, "num_tokens": 14659714.0, "step": 6770 }, { "entropy": 6.730130004882812, "epoch": 0.7250254160201188, "grad_norm": 1.2578125, "learning_rate": 0.0004956819078004392, "loss": 6.5943, "mean_token_accuracy": 0.1168831467628479, "num_tokens": 14670481.0, "step": 6775 }, { "entropy": 6.612733459472656, "epoch": 0.7255604901278827, "grad_norm": 1.515625, "learning_rate": 0.0004956744501164732, "loss": 6.4208, "mean_token_accuracy": 0.12815224677324294, "num_tokens": 14680816.0, "step": 6780 }, { "entropy": 6.573790550231934, "epoch": 0.7260955642356466, "grad_norm": 1.1796875, "learning_rate": 0.0004956669860605634, "loss": 6.5177, "mean_token_accuracy": 0.12638939991593362, "num_tokens": 14692723.0, "step": 6785 }, { "entropy": 6.630371952056885, "epoch": 0.7266306383434106, "grad_norm": 1.3125, "learning_rate": 0.0004956595156329254, "loss": 6.5369, "mean_token_accuracy": 0.12008581012487411, "num_tokens": 14703824.0, "step": 6790 }, { "entropy": 6.706773328781128, "epoch": 0.7271657124511745, "grad_norm": 1.28125, "learning_rate": 0.000495652038833775, "loss": 6.5182, "mean_token_accuracy": 0.12735376432538031, "num_tokens": 14715934.0, "step": 6795 }, { "entropy": 6.598440217971802, "epoch": 0.7277007865589384, "grad_norm": 1.328125, "learning_rate": 0.0004956445556633279, "loss": 6.5177, "mean_token_accuracy": 0.12028545215725898, "num_tokens": 14725617.0, "step": 6800 }, { "entropy": 6.634641218185425, "epoch": 0.7282358606667023, "grad_norm": 1.328125, "learning_rate": 0.0004956370661218003, "loss": 6.4967, "mean_token_accuracy": 0.12309338971972465, "num_tokens": 14736430.0, "step": 6805 }, { "entropy": 6.666610288619995, "epoch": 0.7287709347744663, "grad_norm": 1.4375, "learning_rate": 0.0004956295702094084, "loss": 6.5171, "mean_token_accuracy": 0.12309236079454422, "num_tokens": 14746740.0, "step": 6810 }, { "entropy": 6.582339763641357, "epoch": 0.7293060088822302, "grad_norm": 1.5625, "learning_rate": 0.0004956220679263687, "loss": 6.4535, "mean_token_accuracy": 0.12928269281983376, "num_tokens": 14756884.0, "step": 6815 }, { "entropy": 6.589403057098389, "epoch": 0.7298410829899941, "grad_norm": 1.2734375, "learning_rate": 0.0004956145592728976, "loss": 6.4581, "mean_token_accuracy": 0.1312728136777878, "num_tokens": 14766974.0, "step": 6820 }, { "entropy": 6.623006343841553, "epoch": 0.730376157097758, "grad_norm": 1.359375, "learning_rate": 0.0004956070442492123, "loss": 6.6176, "mean_token_accuracy": 0.11667682155966759, "num_tokens": 14778449.0, "step": 6825 }, { "entropy": 6.7070536613464355, "epoch": 0.7309112312055219, "grad_norm": 1.3671875, "learning_rate": 0.0004955995228555296, "loss": 6.5422, "mean_token_accuracy": 0.1225484624505043, "num_tokens": 14788989.0, "step": 6830 }, { "entropy": 6.628703689575195, "epoch": 0.7314463053132859, "grad_norm": 1.2890625, "learning_rate": 0.0004955919950920666, "loss": 6.5023, "mean_token_accuracy": 0.12728202119469642, "num_tokens": 14798454.0, "step": 6835 }, { "entropy": 6.660853433609009, "epoch": 0.7319813794210498, "grad_norm": 1.515625, "learning_rate": 0.0004955844609590408, "loss": 6.4467, "mean_token_accuracy": 0.12790426537394523, "num_tokens": 14808920.0, "step": 6840 }, { "entropy": 6.635347509384156, "epoch": 0.7325164535288138, "grad_norm": 1.1875, "learning_rate": 0.0004955769204566696, "loss": 6.4426, "mean_token_accuracy": 0.1228242613375187, "num_tokens": 14819250.0, "step": 6845 }, { "entropy": 6.662122344970703, "epoch": 0.7330515276365777, "grad_norm": 1.5078125, "learning_rate": 0.0004955693735851709, "loss": 6.5277, "mean_token_accuracy": 0.12443855032324791, "num_tokens": 14829789.0, "step": 6850 }, { "entropy": 6.562832450866699, "epoch": 0.7335866017443415, "grad_norm": 1.5625, "learning_rate": 0.0004955618203447625, "loss": 6.5037, "mean_token_accuracy": 0.1241986483335495, "num_tokens": 14840527.0, "step": 6855 }, { "entropy": 6.608736944198609, "epoch": 0.7341216758521055, "grad_norm": 1.46875, "learning_rate": 0.0004955542607356625, "loss": 6.5588, "mean_token_accuracy": 0.12313508540391922, "num_tokens": 14850922.0, "step": 6860 }, { "entropy": 6.655763769149781, "epoch": 0.7346567499598694, "grad_norm": 1.9609375, "learning_rate": 0.0004955466947580893, "loss": 6.5061, "mean_token_accuracy": 0.12578540593385695, "num_tokens": 14862226.0, "step": 6865 }, { "entropy": 6.597611951828003, "epoch": 0.7351918240676334, "grad_norm": 1.5859375, "learning_rate": 0.0004955391224122611, "loss": 6.4097, "mean_token_accuracy": 0.1363422118127346, "num_tokens": 14872461.0, "step": 6870 }, { "entropy": 6.608497571945191, "epoch": 0.7357268981753973, "grad_norm": 1.4765625, "learning_rate": 0.000495531543698397, "loss": 6.5258, "mean_token_accuracy": 0.12411358803510666, "num_tokens": 14883088.0, "step": 6875 }, { "entropy": 6.693577766418457, "epoch": 0.7362619722831613, "grad_norm": 1.234375, "learning_rate": 0.0004955239586167153, "loss": 6.5405, "mean_token_accuracy": 0.12336590811610222, "num_tokens": 14894055.0, "step": 6880 }, { "entropy": 6.6278046607971195, "epoch": 0.7367970463909251, "grad_norm": 1.5703125, "learning_rate": 0.0004955163671674354, "loss": 6.5092, "mean_token_accuracy": 0.1199507437646389, "num_tokens": 14904760.0, "step": 6885 }, { "entropy": 6.727400636672973, "epoch": 0.737332120498689, "grad_norm": 2.65625, "learning_rate": 0.0004955087693507764, "loss": 6.6256, "mean_token_accuracy": 0.11664849147200584, "num_tokens": 14915983.0, "step": 6890 }, { "entropy": 6.65953311920166, "epoch": 0.737867194606453, "grad_norm": 1.5078125, "learning_rate": 0.0004955011651669577, "loss": 6.5148, "mean_token_accuracy": 0.11811737567186356, "num_tokens": 14925959.0, "step": 6895 }, { "entropy": 6.5658063888549805, "epoch": 0.7384022687142169, "grad_norm": 1.21875, "learning_rate": 0.0004954935546161988, "loss": 6.4756, "mean_token_accuracy": 0.12480072304606438, "num_tokens": 14936138.0, "step": 6900 }, { "entropy": 6.680220413208008, "epoch": 0.7389373428219809, "grad_norm": 1.234375, "learning_rate": 0.0004954859376987195, "loss": 6.5023, "mean_token_accuracy": 0.1277581550180912, "num_tokens": 14946979.0, "step": 6905 }, { "entropy": 6.584284877777099, "epoch": 0.7394724169297447, "grad_norm": 1.3359375, "learning_rate": 0.0004954783144147397, "loss": 6.5679, "mean_token_accuracy": 0.12042608857154846, "num_tokens": 14958324.0, "step": 6910 }, { "entropy": 6.737890386581421, "epoch": 0.7400074910375087, "grad_norm": 1.234375, "learning_rate": 0.0004954706847644796, "loss": 6.5574, "mean_token_accuracy": 0.11832675114274024, "num_tokens": 14969048.0, "step": 6915 }, { "entropy": 6.710620450973511, "epoch": 0.7405425651452726, "grad_norm": 1.265625, "learning_rate": 0.0004954630487481594, "loss": 6.5496, "mean_token_accuracy": 0.12008848264813424, "num_tokens": 14979825.0, "step": 6920 }, { "entropy": 6.595880651473999, "epoch": 0.7410776392530365, "grad_norm": 1.3671875, "learning_rate": 0.0004954554063659998, "loss": 6.481, "mean_token_accuracy": 0.12603807896375657, "num_tokens": 14990138.0, "step": 6925 }, { "entropy": 6.596027612686157, "epoch": 0.7416127133608005, "grad_norm": 1.4453125, "learning_rate": 0.0004954477576182212, "loss": 6.4498, "mean_token_accuracy": 0.1261916309595108, "num_tokens": 15002276.0, "step": 6930 }, { "entropy": 6.646682214736939, "epoch": 0.7421477874685644, "grad_norm": 1.3828125, "learning_rate": 0.0004954401025050445, "loss": 6.5709, "mean_token_accuracy": 0.12357406765222549, "num_tokens": 15013622.0, "step": 6935 }, { "entropy": 6.676917219161988, "epoch": 0.7426828615763283, "grad_norm": 1.3203125, "learning_rate": 0.0004954324410266909, "loss": 6.531, "mean_token_accuracy": 0.12281017452478409, "num_tokens": 15024067.0, "step": 6940 }, { "entropy": 6.628924036026001, "epoch": 0.7432179356840922, "grad_norm": 1.359375, "learning_rate": 0.0004954247731833815, "loss": 6.4168, "mean_token_accuracy": 0.13402525782585145, "num_tokens": 15033646.0, "step": 6945 }, { "entropy": 6.559259271621704, "epoch": 0.7437530097918562, "grad_norm": 1.2734375, "learning_rate": 0.0004954170989753377, "loss": 6.4686, "mean_token_accuracy": 0.12331727594137191, "num_tokens": 15044655.0, "step": 6950 }, { "entropy": 6.714093255996704, "epoch": 0.7442880838996201, "grad_norm": 1.6328125, "learning_rate": 0.0004954094184027813, "loss": 6.5556, "mean_token_accuracy": 0.11801010146737098, "num_tokens": 15055492.0, "step": 6955 }, { "entropy": 6.666389083862304, "epoch": 0.744823158007384, "grad_norm": 1.3046875, "learning_rate": 0.0004954017314659339, "loss": 6.53, "mean_token_accuracy": 0.1155826836824417, "num_tokens": 15066472.0, "step": 6960 }, { "entropy": 6.671958112716675, "epoch": 0.745358232115148, "grad_norm": 1.328125, "learning_rate": 0.0004953940381650174, "loss": 6.5027, "mean_token_accuracy": 0.12497956231236458, "num_tokens": 15076851.0, "step": 6965 }, { "entropy": 6.544204425811768, "epoch": 0.7458933062229118, "grad_norm": 1.4453125, "learning_rate": 0.0004953863385002541, "loss": 6.4337, "mean_token_accuracy": 0.12553054392337798, "num_tokens": 15086997.0, "step": 6970 }, { "entropy": 6.669872713088989, "epoch": 0.7464283803306758, "grad_norm": 1.3359375, "learning_rate": 0.0004953786324718661, "loss": 6.5781, "mean_token_accuracy": 0.1174256332218647, "num_tokens": 15098625.0, "step": 6975 }, { "entropy": 6.628860807418823, "epoch": 0.7469634544384397, "grad_norm": 1.2890625, "learning_rate": 0.0004953709200800761, "loss": 6.3992, "mean_token_accuracy": 0.1296637736260891, "num_tokens": 15108265.0, "step": 6980 }, { "entropy": 6.58307580947876, "epoch": 0.7474985285462037, "grad_norm": 1.4453125, "learning_rate": 0.0004953632013251068, "loss": 6.4934, "mean_token_accuracy": 0.12321807146072387, "num_tokens": 15118794.0, "step": 6985 }, { "entropy": 6.648694610595703, "epoch": 0.7480336026539676, "grad_norm": 1.5859375, "learning_rate": 0.0004953554762071811, "loss": 6.5249, "mean_token_accuracy": 0.12125022262334824, "num_tokens": 15130084.0, "step": 6990 }, { "entropy": 6.664281702041626, "epoch": 0.7485686767617316, "grad_norm": 1.515625, "learning_rate": 0.0004953477447265218, "loss": 6.5118, "mean_token_accuracy": 0.11916638761758805, "num_tokens": 15142193.0, "step": 6995 }, { "entropy": 6.637905645370483, "epoch": 0.7491037508694954, "grad_norm": 1.546875, "learning_rate": 0.0004953400068833524, "loss": 6.6153, "mean_token_accuracy": 0.12101433128118515, "num_tokens": 15152817.0, "step": 7000 }, { "entropy": 6.557371330261231, "epoch": 0.7496388249772593, "grad_norm": 1.3203125, "learning_rate": 0.0004953322626778964, "loss": 6.317, "mean_token_accuracy": 0.13028131946921348, "num_tokens": 15162352.0, "step": 7005 }, { "entropy": 6.673658227920532, "epoch": 0.7501738990850233, "grad_norm": 1.421875, "learning_rate": 0.0004953245121103771, "loss": 6.4892, "mean_token_accuracy": 0.12943382561206818, "num_tokens": 15173091.0, "step": 7010 }, { "entropy": 6.693431568145752, "epoch": 0.7507089731927872, "grad_norm": 1.4765625, "learning_rate": 0.0004953167551810185, "loss": 6.6457, "mean_token_accuracy": 0.11348064690828323, "num_tokens": 15184422.0, "step": 7015 }, { "entropy": 6.567291927337647, "epoch": 0.7512440473005512, "grad_norm": 1.4609375, "learning_rate": 0.0004953089918900447, "loss": 6.3901, "mean_token_accuracy": 0.13483602181077003, "num_tokens": 15194765.0, "step": 7020 }, { "entropy": 6.645245218276978, "epoch": 0.751779121408315, "grad_norm": 1.5546875, "learning_rate": 0.0004953012222376795, "loss": 6.5368, "mean_token_accuracy": 0.11706858575344085, "num_tokens": 15206007.0, "step": 7025 }, { "entropy": 6.627328014373779, "epoch": 0.752314195516079, "grad_norm": 1.4609375, "learning_rate": 0.0004952934462241476, "loss": 6.489, "mean_token_accuracy": 0.12645872682332993, "num_tokens": 15216634.0, "step": 7030 }, { "entropy": 6.62941837310791, "epoch": 0.7528492696238429, "grad_norm": 1.109375, "learning_rate": 0.0004952856638496734, "loss": 6.5516, "mean_token_accuracy": 0.1180113211274147, "num_tokens": 15226931.0, "step": 7035 }, { "entropy": 6.64382848739624, "epoch": 0.7533843437316068, "grad_norm": 1.5, "learning_rate": 0.0004952778751144817, "loss": 6.5267, "mean_token_accuracy": 0.12257011234760284, "num_tokens": 15239034.0, "step": 7040 }, { "entropy": 6.664216995239258, "epoch": 0.7539194178393708, "grad_norm": 1.390625, "learning_rate": 0.0004952700800187971, "loss": 6.5176, "mean_token_accuracy": 0.12180257961153984, "num_tokens": 15250088.0, "step": 7045 }, { "entropy": 6.677762746810913, "epoch": 0.7544544919471347, "grad_norm": 1.5, "learning_rate": 0.000495262278562845, "loss": 6.4659, "mean_token_accuracy": 0.12146370336413384, "num_tokens": 15261150.0, "step": 7050 }, { "entropy": 6.664985132217407, "epoch": 0.7549895660548986, "grad_norm": 1.28125, "learning_rate": 0.0004952544707468506, "loss": 6.5414, "mean_token_accuracy": 0.12395042702555656, "num_tokens": 15270865.0, "step": 7055 }, { "entropy": 6.677373027801513, "epoch": 0.7555246401626625, "grad_norm": 1.40625, "learning_rate": 0.0004952466565710391, "loss": 6.5552, "mean_token_accuracy": 0.118691186606884, "num_tokens": 15282809.0, "step": 7060 }, { "entropy": 6.694124698638916, "epoch": 0.7560597142704265, "grad_norm": 1.3046875, "learning_rate": 0.0004952388360356366, "loss": 6.5083, "mean_token_accuracy": 0.12859989702701569, "num_tokens": 15293166.0, "step": 7065 }, { "entropy": 6.616050100326538, "epoch": 0.7565947883781904, "grad_norm": 1.5, "learning_rate": 0.0004952310091408685, "loss": 6.4966, "mean_token_accuracy": 0.12518092021346092, "num_tokens": 15302985.0, "step": 7070 }, { "entropy": 6.651115751266479, "epoch": 0.7571298624859543, "grad_norm": 1.59375, "learning_rate": 0.0004952231758869611, "loss": 6.5415, "mean_token_accuracy": 0.1267145797610283, "num_tokens": 15314737.0, "step": 7075 }, { "entropy": 6.614376068115234, "epoch": 0.7576649365937183, "grad_norm": 1.2421875, "learning_rate": 0.0004952153362741403, "loss": 6.464, "mean_token_accuracy": 0.13092187345027922, "num_tokens": 15325441.0, "step": 7080 }, { "entropy": 6.599036788940429, "epoch": 0.7582000107014821, "grad_norm": 1.2265625, "learning_rate": 0.0004952074903026327, "loss": 6.3991, "mean_token_accuracy": 0.12750762775540353, "num_tokens": 15334939.0, "step": 7085 }, { "entropy": 6.595050287246704, "epoch": 0.7587350848092461, "grad_norm": 1.21875, "learning_rate": 0.0004951996379726647, "loss": 6.5734, "mean_token_accuracy": 0.12048307284712792, "num_tokens": 15345655.0, "step": 7090 }, { "entropy": 6.538129758834839, "epoch": 0.75927015891701, "grad_norm": 1.4375, "learning_rate": 0.0004951917792844631, "loss": 6.3968, "mean_token_accuracy": 0.13058631792664527, "num_tokens": 15356035.0, "step": 7095 }, { "entropy": 6.659978437423706, "epoch": 0.759805233024774, "grad_norm": 1.1875, "learning_rate": 0.0004951839142382548, "loss": 6.5094, "mean_token_accuracy": 0.12489819005131722, "num_tokens": 15368509.0, "step": 7100 }, { "entropy": 6.615253734588623, "epoch": 0.7603403071325379, "grad_norm": 1.171875, "learning_rate": 0.000495176042834267, "loss": 6.4777, "mean_token_accuracy": 0.1264044873416424, "num_tokens": 15379662.0, "step": 7105 }, { "entropy": 6.601353359222412, "epoch": 0.7608753812403017, "grad_norm": 1.4609375, "learning_rate": 0.0004951681650727268, "loss": 6.4844, "mean_token_accuracy": 0.11898941099643708, "num_tokens": 15389698.0, "step": 7110 }, { "entropy": 6.746938896179199, "epoch": 0.7614104553480657, "grad_norm": 1.203125, "learning_rate": 0.0004951602809538619, "loss": 6.5772, "mean_token_accuracy": 0.11864528879523277, "num_tokens": 15400724.0, "step": 7115 }, { "entropy": 6.733620023727417, "epoch": 0.7619455294558296, "grad_norm": 1.25, "learning_rate": 0.0004951523904778997, "loss": 6.5659, "mean_token_accuracy": 0.11942593604326249, "num_tokens": 15410732.0, "step": 7120 }, { "entropy": 6.618440341949463, "epoch": 0.7624806035635936, "grad_norm": 1.421875, "learning_rate": 0.0004951444936450682, "loss": 6.4671, "mean_token_accuracy": 0.13049914836883544, "num_tokens": 15420185.0, "step": 7125 }, { "entropy": 6.591977787017822, "epoch": 0.7630156776713575, "grad_norm": 1.515625, "learning_rate": 0.0004951365904555954, "loss": 6.4038, "mean_token_accuracy": 0.1246684692800045, "num_tokens": 15431904.0, "step": 7130 }, { "entropy": 6.575604772567749, "epoch": 0.7635507517791215, "grad_norm": 1.2890625, "learning_rate": 0.0004951286809097094, "loss": 6.5303, "mean_token_accuracy": 0.11952223181724549, "num_tokens": 15442650.0, "step": 7135 }, { "entropy": 6.564087724685669, "epoch": 0.7640858258868853, "grad_norm": 1.484375, "learning_rate": 0.0004951207650076388, "loss": 6.5026, "mean_token_accuracy": 0.12019338682293892, "num_tokens": 15454273.0, "step": 7140 }, { "entropy": 6.638538455963134, "epoch": 0.7646208999946492, "grad_norm": 1.2890625, "learning_rate": 0.000495112842749612, "loss": 6.4855, "mean_token_accuracy": 0.1241270050406456, "num_tokens": 15465751.0, "step": 7145 }, { "entropy": 6.656053924560547, "epoch": 0.7651559741024132, "grad_norm": 1.359375, "learning_rate": 0.0004951049141358578, "loss": 6.5927, "mean_token_accuracy": 0.11400035619735718, "num_tokens": 15475340.0, "step": 7150 }, { "entropy": 6.713410806655884, "epoch": 0.7656910482101771, "grad_norm": 1.265625, "learning_rate": 0.0004950969791666051, "loss": 6.5507, "mean_token_accuracy": 0.1195062555372715, "num_tokens": 15486246.0, "step": 7155 }, { "entropy": 6.696958923339844, "epoch": 0.7662261223179411, "grad_norm": 1.390625, "learning_rate": 0.0004950890378420831, "loss": 6.5556, "mean_token_accuracy": 0.12101633250713348, "num_tokens": 15497331.0, "step": 7160 }, { "entropy": 6.624008226394653, "epoch": 0.766761196425705, "grad_norm": 1.1328125, "learning_rate": 0.000495081090162521, "loss": 6.496, "mean_token_accuracy": 0.1252144269645214, "num_tokens": 15508036.0, "step": 7165 }, { "entropy": 6.651372194290161, "epoch": 0.7672962705334689, "grad_norm": 1.3984375, "learning_rate": 0.0004950731361281483, "loss": 6.4892, "mean_token_accuracy": 0.12409828379750251, "num_tokens": 15518381.0, "step": 7170 }, { "entropy": 6.648929023742676, "epoch": 0.7678313446412328, "grad_norm": 1.296875, "learning_rate": 0.0004950651757391948, "loss": 6.4927, "mean_token_accuracy": 0.12453809827566147, "num_tokens": 15528939.0, "step": 7175 }, { "entropy": 6.691262435913086, "epoch": 0.7683664187489967, "grad_norm": 1.25, "learning_rate": 0.0004950572089958904, "loss": 6.4844, "mean_token_accuracy": 0.11920621544122696, "num_tokens": 15539718.0, "step": 7180 }, { "entropy": 6.671784210205078, "epoch": 0.7689014928567607, "grad_norm": 1.375, "learning_rate": 0.0004950492358984648, "loss": 6.6442, "mean_token_accuracy": 0.11607598587870598, "num_tokens": 15550970.0, "step": 7185 }, { "entropy": 6.673526191711426, "epoch": 0.7694365669645246, "grad_norm": 1.296875, "learning_rate": 0.0004950412564471486, "loss": 6.4146, "mean_token_accuracy": 0.1274817906320095, "num_tokens": 15560490.0, "step": 7190 }, { "entropy": 6.616913270950318, "epoch": 0.7699716410722885, "grad_norm": 1.390625, "learning_rate": 0.000495033270642172, "loss": 6.4266, "mean_token_accuracy": 0.1294262781739235, "num_tokens": 15570188.0, "step": 7195 }, { "entropy": 6.589165592193604, "epoch": 0.7705067151800524, "grad_norm": 1.296875, "learning_rate": 0.0004950252784837655, "loss": 6.4459, "mean_token_accuracy": 0.12019804939627647, "num_tokens": 15581446.0, "step": 7200 }, { "entropy": 6.63636999130249, "epoch": 0.7710417892878164, "grad_norm": 1.8125, "learning_rate": 0.0004950172799721601, "loss": 6.5597, "mean_token_accuracy": 0.12001867443323136, "num_tokens": 15594362.0, "step": 7205 }, { "entropy": 6.646881103515625, "epoch": 0.7715768633955803, "grad_norm": 1.5390625, "learning_rate": 0.0004950092751075866, "loss": 6.4336, "mean_token_accuracy": 0.13300900235772134, "num_tokens": 15605531.0, "step": 7210 }, { "entropy": 6.632643985748291, "epoch": 0.7721119375033442, "grad_norm": 1.65625, "learning_rate": 0.0004950012638902763, "loss": 6.4747, "mean_token_accuracy": 0.12664539813995362, "num_tokens": 15614962.0, "step": 7215 }, { "entropy": 6.527265357971191, "epoch": 0.7726470116111082, "grad_norm": 2.078125, "learning_rate": 0.0004949932463204603, "loss": 6.5196, "mean_token_accuracy": 0.12367821410298348, "num_tokens": 15625475.0, "step": 7220 }, { "entropy": 6.600604248046875, "epoch": 0.773182085718872, "grad_norm": 1.1953125, "learning_rate": 0.0004949852223983703, "loss": 6.5051, "mean_token_accuracy": 0.11932418122887611, "num_tokens": 15637359.0, "step": 7225 }, { "entropy": 6.792949867248535, "epoch": 0.773717159826636, "grad_norm": 1.5078125, "learning_rate": 0.0004949771921242379, "loss": 6.5462, "mean_token_accuracy": 0.117109165340662, "num_tokens": 15648368.0, "step": 7230 }, { "entropy": 6.6926452159881595, "epoch": 0.7742522339343999, "grad_norm": 1.34375, "learning_rate": 0.0004949691554982951, "loss": 6.4385, "mean_token_accuracy": 0.13027268201112746, "num_tokens": 15659295.0, "step": 7235 }, { "entropy": 6.543884658813477, "epoch": 0.7747873080421639, "grad_norm": 1.5859375, "learning_rate": 0.0004949611125207737, "loss": 6.4051, "mean_token_accuracy": 0.12192230448126792, "num_tokens": 15669975.0, "step": 7240 }, { "entropy": 6.570065546035766, "epoch": 0.7753223821499278, "grad_norm": 1.5390625, "learning_rate": 0.000494953063191906, "loss": 6.4946, "mean_token_accuracy": 0.11872415691614151, "num_tokens": 15680343.0, "step": 7245 }, { "entropy": 6.683220624923706, "epoch": 0.7758574562576916, "grad_norm": 1.34375, "learning_rate": 0.0004949450075119247, "loss": 6.5525, "mean_token_accuracy": 0.12026704177260399, "num_tokens": 15692246.0, "step": 7250 }, { "entropy": 6.6822953701019285, "epoch": 0.7763925303654556, "grad_norm": 1.140625, "learning_rate": 0.0004949369454810621, "loss": 6.5062, "mean_token_accuracy": 0.12393845468759537, "num_tokens": 15704262.0, "step": 7255 }, { "entropy": 6.547556638717651, "epoch": 0.7769276044732195, "grad_norm": 1.5234375, "learning_rate": 0.0004949288770995512, "loss": 6.4991, "mean_token_accuracy": 0.12381231859326362, "num_tokens": 15715078.0, "step": 7260 }, { "entropy": 6.660402727127075, "epoch": 0.7774626785809835, "grad_norm": 1.3125, "learning_rate": 0.0004949208023676249, "loss": 6.5459, "mean_token_accuracy": 0.1232883907854557, "num_tokens": 15726503.0, "step": 7265 }, { "entropy": 6.587308025360107, "epoch": 0.7779977526887474, "grad_norm": 2.140625, "learning_rate": 0.0004949127212855161, "loss": 6.4327, "mean_token_accuracy": 0.12670731246471406, "num_tokens": 15738854.0, "step": 7270 }, { "entropy": 6.611951589584351, "epoch": 0.7785328267965114, "grad_norm": 1.5859375, "learning_rate": 0.0004949046338534587, "loss": 6.5893, "mean_token_accuracy": 0.12085817605257035, "num_tokens": 15750836.0, "step": 7275 }, { "entropy": 6.783895874023438, "epoch": 0.7790679009042752, "grad_norm": 1.4765625, "learning_rate": 0.0004948965400716857, "loss": 6.5934, "mean_token_accuracy": 0.12155032604932785, "num_tokens": 15762355.0, "step": 7280 }, { "entropy": 6.6959075927734375, "epoch": 0.7796029750120391, "grad_norm": 1.3828125, "learning_rate": 0.000494888439940431, "loss": 6.5948, "mean_token_accuracy": 0.12169316858053207, "num_tokens": 15772952.0, "step": 7285 }, { "entropy": 6.562328147888183, "epoch": 0.7801380491198031, "grad_norm": 1.5703125, "learning_rate": 0.0004948803334599286, "loss": 6.4051, "mean_token_accuracy": 0.13314662128686905, "num_tokens": 15782997.0, "step": 7290 }, { "entropy": 6.598123836517334, "epoch": 0.780673123227567, "grad_norm": 1.6875, "learning_rate": 0.0004948722206304123, "loss": 6.5065, "mean_token_accuracy": 0.12343615815043449, "num_tokens": 15794060.0, "step": 7295 }, { "entropy": 6.707820177078247, "epoch": 0.781208197335331, "grad_norm": 1.1953125, "learning_rate": 0.0004948641014521167, "loss": 6.5704, "mean_token_accuracy": 0.12031665593385696, "num_tokens": 15804149.0, "step": 7300 }, { "entropy": 6.668608617782593, "epoch": 0.7817432714430949, "grad_norm": 1.40625, "learning_rate": 0.000494855975925276, "loss": 6.496, "mean_token_accuracy": 0.12902145832777023, "num_tokens": 15814643.0, "step": 7305 }, { "entropy": 6.645229959487915, "epoch": 0.7822783455508588, "grad_norm": 1.4921875, "learning_rate": 0.0004948478440501249, "loss": 6.4438, "mean_token_accuracy": 0.1254532441496849, "num_tokens": 15824640.0, "step": 7310 }, { "entropy": 6.553537178039551, "epoch": 0.7828134196586227, "grad_norm": 1.40625, "learning_rate": 0.0004948397058268982, "loss": 6.4806, "mean_token_accuracy": 0.12377227991819381, "num_tokens": 15836160.0, "step": 7315 }, { "entropy": 6.6396448612213135, "epoch": 0.7833484937663866, "grad_norm": 1.453125, "learning_rate": 0.0004948315612558308, "loss": 6.5149, "mean_token_accuracy": 0.12054053619503975, "num_tokens": 15846886.0, "step": 7320 }, { "entropy": 6.6480477809906, "epoch": 0.7838835678741506, "grad_norm": 1.5859375, "learning_rate": 0.000494823410337158, "loss": 6.4443, "mean_token_accuracy": 0.13052470311522485, "num_tokens": 15857309.0, "step": 7325 }, { "entropy": 6.601436614990234, "epoch": 0.7844186419819145, "grad_norm": 1.5546875, "learning_rate": 0.0004948152530711153, "loss": 6.5795, "mean_token_accuracy": 0.12191757187247276, "num_tokens": 15869620.0, "step": 7330 }, { "entropy": 6.614558506011963, "epoch": 0.7849537160896785, "grad_norm": 1.359375, "learning_rate": 0.0004948070894579378, "loss": 6.4211, "mean_token_accuracy": 0.129998816549778, "num_tokens": 15880915.0, "step": 7335 }, { "entropy": 6.605517482757568, "epoch": 0.7854887901974423, "grad_norm": 1.296875, "learning_rate": 0.0004947989194978616, "loss": 6.495, "mean_token_accuracy": 0.1268579512834549, "num_tokens": 15891150.0, "step": 7340 }, { "entropy": 6.656474876403808, "epoch": 0.7860238643052063, "grad_norm": 1.2265625, "learning_rate": 0.0004947907431911225, "loss": 6.4923, "mean_token_accuracy": 0.12626128271222115, "num_tokens": 15902526.0, "step": 7345 }, { "entropy": 6.591264724731445, "epoch": 0.7865589384129702, "grad_norm": 1.53125, "learning_rate": 0.0004947825605379566, "loss": 6.4372, "mean_token_accuracy": 0.12627596408128738, "num_tokens": 15913425.0, "step": 7350 }, { "entropy": 6.613666772842407, "epoch": 0.7870940125207341, "grad_norm": 1.3125, "learning_rate": 0.0004947743715386, "loss": 6.4193, "mean_token_accuracy": 0.12343008667230607, "num_tokens": 15924324.0, "step": 7355 }, { "entropy": 6.57948784828186, "epoch": 0.7876290866284981, "grad_norm": 1.6640625, "learning_rate": 0.0004947661761932894, "loss": 6.4727, "mean_token_accuracy": 0.12277128249406814, "num_tokens": 15935533.0, "step": 7360 }, { "entropy": 6.5657641887664795, "epoch": 0.7881641607362619, "grad_norm": 1.3203125, "learning_rate": 0.0004947579745022613, "loss": 6.4295, "mean_token_accuracy": 0.12148091346025466, "num_tokens": 15947007.0, "step": 7365 }, { "entropy": 6.581766366958618, "epoch": 0.7886992348440259, "grad_norm": 1.421875, "learning_rate": 0.0004947497664657527, "loss": 6.4862, "mean_token_accuracy": 0.12112942487001419, "num_tokens": 15957405.0, "step": 7370 }, { "entropy": 6.61507477760315, "epoch": 0.7892343089517898, "grad_norm": 1.296875, "learning_rate": 0.0004947415520840003, "loss": 6.4761, "mean_token_accuracy": 0.12532250955700874, "num_tokens": 15969895.0, "step": 7375 }, { "entropy": 6.637605905532837, "epoch": 0.7897693830595538, "grad_norm": 1.4921875, "learning_rate": 0.0004947333313572416, "loss": 6.3931, "mean_token_accuracy": 0.13630961254239082, "num_tokens": 15979854.0, "step": 7380 }, { "entropy": 6.567370319366455, "epoch": 0.7903044571673177, "grad_norm": 1.390625, "learning_rate": 0.0004947251042857137, "loss": 6.3963, "mean_token_accuracy": 0.13095270618796348, "num_tokens": 15991341.0, "step": 7385 }, { "entropy": 6.531961727142334, "epoch": 0.7908395312750816, "grad_norm": 1.640625, "learning_rate": 0.0004947168708696544, "loss": 6.4554, "mean_token_accuracy": 0.12993446215987206, "num_tokens": 16001944.0, "step": 7390 }, { "entropy": 6.560093545913697, "epoch": 0.7913746053828455, "grad_norm": 1.2734375, "learning_rate": 0.0004947086311093013, "loss": 6.4423, "mean_token_accuracy": 0.1281399607658386, "num_tokens": 16011771.0, "step": 7395 }, { "entropy": 6.687586164474487, "epoch": 0.7919096794906094, "grad_norm": 1.3046875, "learning_rate": 0.0004947003850048924, "loss": 6.6005, "mean_token_accuracy": 0.11408599764108658, "num_tokens": 16023901.0, "step": 7400 }, { "entropy": 6.740469646453858, "epoch": 0.7924447535983734, "grad_norm": 1.4296875, "learning_rate": 0.0004946921325566656, "loss": 6.5191, "mean_token_accuracy": 0.1196585789322853, "num_tokens": 16035014.0, "step": 7405 }, { "entropy": 6.650988531112671, "epoch": 0.7929798277061373, "grad_norm": 1.2109375, "learning_rate": 0.0004946838737648595, "loss": 6.5891, "mean_token_accuracy": 0.11678230240941048, "num_tokens": 16046927.0, "step": 7410 }, { "entropy": 6.613309526443482, "epoch": 0.7935149018139013, "grad_norm": 1.296875, "learning_rate": 0.0004946756086297124, "loss": 6.4909, "mean_token_accuracy": 0.12795686945319176, "num_tokens": 16057341.0, "step": 7415 }, { "entropy": 6.654987621307373, "epoch": 0.7940499759216652, "grad_norm": 1.5078125, "learning_rate": 0.0004946673371514628, "loss": 6.4782, "mean_token_accuracy": 0.12236208170652389, "num_tokens": 16068408.0, "step": 7420 }, { "entropy": 6.5727095127105715, "epoch": 0.794585050029429, "grad_norm": 1.6875, "learning_rate": 0.0004946590593303499, "loss": 6.4494, "mean_token_accuracy": 0.1296915277838707, "num_tokens": 16078693.0, "step": 7425 }, { "entropy": 6.60039119720459, "epoch": 0.795120124137193, "grad_norm": 1.3203125, "learning_rate": 0.0004946507751666124, "loss": 6.4975, "mean_token_accuracy": 0.1274369865655899, "num_tokens": 16089127.0, "step": 7430 }, { "entropy": 6.586338949203491, "epoch": 0.7956551982449569, "grad_norm": 1.5078125, "learning_rate": 0.0004946424846604897, "loss": 6.4071, "mean_token_accuracy": 0.13582724407315255, "num_tokens": 16099726.0, "step": 7435 }, { "entropy": 6.615121269226075, "epoch": 0.7961902723527209, "grad_norm": 1.234375, "learning_rate": 0.0004946341878122212, "loss": 6.4573, "mean_token_accuracy": 0.12698574587702752, "num_tokens": 16111017.0, "step": 7440 }, { "entropy": 6.624665117263794, "epoch": 0.7967253464604848, "grad_norm": 1.484375, "learning_rate": 0.0004946258846220462, "loss": 6.5288, "mean_token_accuracy": 0.12629680335521698, "num_tokens": 16121406.0, "step": 7445 }, { "entropy": 6.636161994934082, "epoch": 0.7972604205682488, "grad_norm": 1.875, "learning_rate": 0.0004946175750902049, "loss": 6.4516, "mean_token_accuracy": 0.12538782581686975, "num_tokens": 16131587.0, "step": 7450 }, { "entropy": 6.5716126441955565, "epoch": 0.7977954946760126, "grad_norm": 2.0625, "learning_rate": 0.0004946092592169368, "loss": 6.4116, "mean_token_accuracy": 0.12958415150642394, "num_tokens": 16142578.0, "step": 7455 }, { "entropy": 6.619257640838623, "epoch": 0.7983305687837765, "grad_norm": 1.4921875, "learning_rate": 0.0004946009370024822, "loss": 6.426, "mean_token_accuracy": 0.1310078866779804, "num_tokens": 16153501.0, "step": 7460 }, { "entropy": 6.572661924362182, "epoch": 0.7988656428915405, "grad_norm": 1.890625, "learning_rate": 0.0004945926084470814, "loss": 6.5052, "mean_token_accuracy": 0.12284256890416145, "num_tokens": 16164273.0, "step": 7465 }, { "entropy": 6.610775899887085, "epoch": 0.7994007169993044, "grad_norm": 1.3046875, "learning_rate": 0.0004945842735509749, "loss": 6.4856, "mean_token_accuracy": 0.12552264481782913, "num_tokens": 16175071.0, "step": 7470 }, { "entropy": 6.680575323104859, "epoch": 0.7999357911070684, "grad_norm": 1.2421875, "learning_rate": 0.0004945759323144034, "loss": 6.5288, "mean_token_accuracy": 0.11573776230216026, "num_tokens": 16185404.0, "step": 7475 }, { "entropy": 6.629665231704712, "epoch": 0.8004708652148322, "grad_norm": 1.4609375, "learning_rate": 0.0004945675847376077, "loss": 6.5139, "mean_token_accuracy": 0.12014818266034126, "num_tokens": 16196881.0, "step": 7480 }, { "entropy": 6.639012718200684, "epoch": 0.8010059393225962, "grad_norm": 1.2734375, "learning_rate": 0.0004945592308208288, "loss": 6.5439, "mean_token_accuracy": 0.12018415406346321, "num_tokens": 16207534.0, "step": 7485 }, { "entropy": 6.646149730682373, "epoch": 0.8015410134303601, "grad_norm": 1.1875, "learning_rate": 0.000494550870564308, "loss": 6.4188, "mean_token_accuracy": 0.13105716928839684, "num_tokens": 16217371.0, "step": 7490 }, { "entropy": 6.6225439548492435, "epoch": 0.802076087538124, "grad_norm": 1.484375, "learning_rate": 0.0004945425039682866, "loss": 6.467, "mean_token_accuracy": 0.1279752753674984, "num_tokens": 16227898.0, "step": 7495 }, { "entropy": 6.564583015441895, "epoch": 0.802611161645888, "grad_norm": 1.4921875, "learning_rate": 0.0004945341310330064, "loss": 6.4619, "mean_token_accuracy": 0.1270508736371994, "num_tokens": 16238966.0, "step": 7500 }, { "entropy": 6.590152359008789, "epoch": 0.8031462357536518, "grad_norm": 1.7890625, "learning_rate": 0.0004945257517587089, "loss": 6.4931, "mean_token_accuracy": 0.12701256275177003, "num_tokens": 16250129.0, "step": 7505 }, { "entropy": 6.5930369853973385, "epoch": 0.8036813098614158, "grad_norm": 1.2421875, "learning_rate": 0.0004945173661456361, "loss": 6.5149, "mean_token_accuracy": 0.12291709631681443, "num_tokens": 16260877.0, "step": 7510 }, { "entropy": 6.699715852737427, "epoch": 0.8042163839691797, "grad_norm": 1.1640625, "learning_rate": 0.0004945089741940303, "loss": 6.472, "mean_token_accuracy": 0.12913578376173973, "num_tokens": 16270548.0, "step": 7515 }, { "entropy": 6.676292562484742, "epoch": 0.8047514580769437, "grad_norm": 1.2734375, "learning_rate": 0.0004945005759041338, "loss": 6.497, "mean_token_accuracy": 0.12249005734920501, "num_tokens": 16281014.0, "step": 7520 }, { "entropy": 6.624485683441162, "epoch": 0.8052865321847076, "grad_norm": 1.2421875, "learning_rate": 0.0004944921712761889, "loss": 6.5405, "mean_token_accuracy": 0.12573966085910798, "num_tokens": 16291653.0, "step": 7525 }, { "entropy": 6.5947753429412845, "epoch": 0.8058216062924715, "grad_norm": 1.28125, "learning_rate": 0.0004944837603104383, "loss": 6.3863, "mean_token_accuracy": 0.13147774934768677, "num_tokens": 16301703.0, "step": 7530 }, { "entropy": 6.560491371154785, "epoch": 0.8063566804002354, "grad_norm": 1.4453125, "learning_rate": 0.0004944753430071252, "loss": 6.4576, "mean_token_accuracy": 0.12715979367494584, "num_tokens": 16312252.0, "step": 7535 }, { "entropy": 6.584918880462647, "epoch": 0.8068917545079993, "grad_norm": 1.375, "learning_rate": 0.0004944669193664923, "loss": 6.4331, "mean_token_accuracy": 0.12487595155835152, "num_tokens": 16324073.0, "step": 7540 }, { "entropy": 6.6717156887054445, "epoch": 0.8074268286157633, "grad_norm": 1.25, "learning_rate": 0.0004944584893887829, "loss": 6.4445, "mean_token_accuracy": 0.12484904229640961, "num_tokens": 16334637.0, "step": 7545 }, { "entropy": 6.605461120605469, "epoch": 0.8079619027235272, "grad_norm": 1.34375, "learning_rate": 0.0004944500530742404, "loss": 6.5743, "mean_token_accuracy": 0.11794036030769348, "num_tokens": 16345581.0, "step": 7550 }, { "entropy": 6.6252374172210695, "epoch": 0.8084969768312912, "grad_norm": 1.453125, "learning_rate": 0.0004944416104231086, "loss": 6.5663, "mean_token_accuracy": 0.1216730572283268, "num_tokens": 16356995.0, "step": 7555 }, { "entropy": 6.688077592849732, "epoch": 0.8090320509390551, "grad_norm": 1.3046875, "learning_rate": 0.0004944331614356311, "loss": 6.5093, "mean_token_accuracy": 0.11890427842736244, "num_tokens": 16368841.0, "step": 7560 }, { "entropy": 6.692157506942749, "epoch": 0.8095671250468189, "grad_norm": 1.2578125, "learning_rate": 0.0004944247061120519, "loss": 6.4279, "mean_token_accuracy": 0.12462588772177696, "num_tokens": 16379295.0, "step": 7565 }, { "entropy": 6.576985025405884, "epoch": 0.8101021991545829, "grad_norm": 1.6953125, "learning_rate": 0.0004944162444526151, "loss": 6.4721, "mean_token_accuracy": 0.13099455311894417, "num_tokens": 16389512.0, "step": 7570 }, { "entropy": 6.476492547988892, "epoch": 0.8106372732623468, "grad_norm": 1.1796875, "learning_rate": 0.0004944077764575651, "loss": 6.3894, "mean_token_accuracy": 0.13501969650387763, "num_tokens": 16400720.0, "step": 7575 }, { "entropy": 6.580502033233643, "epoch": 0.8111723473701108, "grad_norm": 1.7890625, "learning_rate": 0.0004943993021271463, "loss": 6.4658, "mean_token_accuracy": 0.12537092193961144, "num_tokens": 16411278.0, "step": 7580 }, { "entropy": 6.67013144493103, "epoch": 0.8117074214778747, "grad_norm": 1.28125, "learning_rate": 0.0004943908214616035, "loss": 6.5088, "mean_token_accuracy": 0.12090714648365974, "num_tokens": 16421665.0, "step": 7585 }, { "entropy": 6.671138763427734, "epoch": 0.8122424955856387, "grad_norm": 1.25, "learning_rate": 0.0004943823344611818, "loss": 6.5485, "mean_token_accuracy": 0.11637551337480545, "num_tokens": 16432943.0, "step": 7590 }, { "entropy": 6.666892385482788, "epoch": 0.8127775696934025, "grad_norm": 1.421875, "learning_rate": 0.0004943738411261258, "loss": 6.451, "mean_token_accuracy": 0.12569426372647285, "num_tokens": 16444506.0, "step": 7595 }, { "entropy": 6.5838854789733885, "epoch": 0.8133126438011664, "grad_norm": 2.578125, "learning_rate": 0.0004943653414566809, "loss": 6.4841, "mean_token_accuracy": 0.12255563437938691, "num_tokens": 16455403.0, "step": 7600 }, { "entropy": 6.685585021972656, "epoch": 0.8138477179089304, "grad_norm": 1.7421875, "learning_rate": 0.0004943568354530927, "loss": 6.5825, "mean_token_accuracy": 0.11601466611027718, "num_tokens": 16465616.0, "step": 7605 }, { "entropy": 6.6593701362609865, "epoch": 0.8143827920166943, "grad_norm": 1.2890625, "learning_rate": 0.0004943483231156068, "loss": 6.5438, "mean_token_accuracy": 0.12109178379178047, "num_tokens": 16476850.0, "step": 7610 }, { "entropy": 6.668148422241211, "epoch": 0.8149178661244583, "grad_norm": 1.21875, "learning_rate": 0.0004943398044444687, "loss": 6.4975, "mean_token_accuracy": 0.1246594287455082, "num_tokens": 16489118.0, "step": 7615 }, { "entropy": 6.676653909683227, "epoch": 0.8154529402322221, "grad_norm": 1.3984375, "learning_rate": 0.0004943312794399246, "loss": 6.4363, "mean_token_accuracy": 0.12908004522323607, "num_tokens": 16499336.0, "step": 7620 }, { "entropy": 6.601690435409546, "epoch": 0.8159880143399861, "grad_norm": 1.875, "learning_rate": 0.0004943227481022207, "loss": 6.5219, "mean_token_accuracy": 0.11842733025550842, "num_tokens": 16510158.0, "step": 7625 }, { "entropy": 6.564496660232544, "epoch": 0.81652308844775, "grad_norm": 1.453125, "learning_rate": 0.0004943142104316033, "loss": 6.4621, "mean_token_accuracy": 0.12559000104665757, "num_tokens": 16521080.0, "step": 7630 }, { "entropy": 6.656149530410767, "epoch": 0.8170581625555139, "grad_norm": 1.296875, "learning_rate": 0.0004943056664283189, "loss": 6.4704, "mean_token_accuracy": 0.12910144105553628, "num_tokens": 16531072.0, "step": 7635 }, { "entropy": 6.6499816417694095, "epoch": 0.8175932366632779, "grad_norm": 1.359375, "learning_rate": 0.000494297116092614, "loss": 6.5586, "mean_token_accuracy": 0.11900619938969612, "num_tokens": 16542588.0, "step": 7640 }, { "entropy": 6.663675832748413, "epoch": 0.8181283107710418, "grad_norm": 1.609375, "learning_rate": 0.0004942885594247359, "loss": 6.4237, "mean_token_accuracy": 0.12086946368217469, "num_tokens": 16553466.0, "step": 7645 }, { "entropy": 6.618226099014282, "epoch": 0.8186633848788057, "grad_norm": 1.40625, "learning_rate": 0.0004942799964249314, "loss": 6.4553, "mean_token_accuracy": 0.1253214955329895, "num_tokens": 16564084.0, "step": 7650 }, { "entropy": 6.56568751335144, "epoch": 0.8191984589865696, "grad_norm": 1.3828125, "learning_rate": 0.0004942714270934479, "loss": 6.4666, "mean_token_accuracy": 0.13621146976947784, "num_tokens": 16575665.0, "step": 7655 }, { "entropy": 6.610156917572022, "epoch": 0.8197335330943336, "grad_norm": 1.2734375, "learning_rate": 0.0004942628514305326, "loss": 6.4752, "mean_token_accuracy": 0.12168620154261589, "num_tokens": 16586518.0, "step": 7660 }, { "entropy": 6.63839054107666, "epoch": 0.8202686072020975, "grad_norm": 1.2734375, "learning_rate": 0.0004942542694364333, "loss": 6.4753, "mean_token_accuracy": 0.12710672691464425, "num_tokens": 16597345.0, "step": 7665 }, { "entropy": 6.6390495777130125, "epoch": 0.8208036813098614, "grad_norm": 1.9609375, "learning_rate": 0.0004942456811113978, "loss": 6.4888, "mean_token_accuracy": 0.12848000451922417, "num_tokens": 16609586.0, "step": 7670 }, { "entropy": 6.635290050506592, "epoch": 0.8213387554176254, "grad_norm": 1.3125, "learning_rate": 0.0004942370864556741, "loss": 6.3679, "mean_token_accuracy": 0.13500959426164627, "num_tokens": 16620165.0, "step": 7675 }, { "entropy": 6.571346569061279, "epoch": 0.8218738295253892, "grad_norm": 1.640625, "learning_rate": 0.0004942284854695104, "loss": 6.4753, "mean_token_accuracy": 0.12547776997089385, "num_tokens": 16631200.0, "step": 7680 }, { "entropy": 6.609015321731567, "epoch": 0.8224089036331532, "grad_norm": 1.3125, "learning_rate": 0.0004942198781531549, "loss": 6.5048, "mean_token_accuracy": 0.1238760806620121, "num_tokens": 16642553.0, "step": 7685 }, { "entropy": 6.665633964538574, "epoch": 0.8229439777409171, "grad_norm": 1.2265625, "learning_rate": 0.0004942112645068561, "loss": 6.5156, "mean_token_accuracy": 0.12217526063323021, "num_tokens": 16653431.0, "step": 7690 }, { "entropy": 6.571784734725952, "epoch": 0.8234790518486811, "grad_norm": 1.2265625, "learning_rate": 0.000494202644530863, "loss": 6.4593, "mean_token_accuracy": 0.12343985810875893, "num_tokens": 16664880.0, "step": 7695 }, { "entropy": 6.5380603790283205, "epoch": 0.824014125956445, "grad_norm": 1.4921875, "learning_rate": 0.0004941940182254244, "loss": 6.4767, "mean_token_accuracy": 0.12872528284788132, "num_tokens": 16676224.0, "step": 7700 }, { "entropy": 6.582237911224365, "epoch": 0.8245492000642088, "grad_norm": 1.4296875, "learning_rate": 0.0004941853855907892, "loss": 6.5396, "mean_token_accuracy": 0.12095732614398003, "num_tokens": 16687732.0, "step": 7705 }, { "entropy": 6.682282161712647, "epoch": 0.8250842741719728, "grad_norm": 1.3671875, "learning_rate": 0.0004941767466272068, "loss": 6.4688, "mean_token_accuracy": 0.129934361577034, "num_tokens": 16698257.0, "step": 7710 }, { "entropy": 6.666169214248657, "epoch": 0.8256193482797367, "grad_norm": 1.1796875, "learning_rate": 0.0004941681013349267, "loss": 6.4383, "mean_token_accuracy": 0.12359966635704041, "num_tokens": 16708860.0, "step": 7715 }, { "entropy": 6.602855110168457, "epoch": 0.8261544223875007, "grad_norm": 1.34375, "learning_rate": 0.0004941594497141985, "loss": 6.438, "mean_token_accuracy": 0.12608251199126244, "num_tokens": 16719987.0, "step": 7720 }, { "entropy": 6.643445825576782, "epoch": 0.8266894964952646, "grad_norm": 1.4609375, "learning_rate": 0.0004941507917652718, "loss": 6.5341, "mean_token_accuracy": 0.11999792009592056, "num_tokens": 16730861.0, "step": 7725 }, { "entropy": 6.553995418548584, "epoch": 0.8272245706030286, "grad_norm": 1.5546875, "learning_rate": 0.0004941421274883969, "loss": 6.383, "mean_token_accuracy": 0.13347533941268921, "num_tokens": 16740968.0, "step": 7730 }, { "entropy": 6.578843641281128, "epoch": 0.8277596447107924, "grad_norm": 1.234375, "learning_rate": 0.000494133456883824, "loss": 6.4878, "mean_token_accuracy": 0.12768243104219437, "num_tokens": 16750700.0, "step": 7735 }, { "entropy": 6.617146635055542, "epoch": 0.8282947188185563, "grad_norm": 1.4609375, "learning_rate": 0.0004941247799518031, "loss": 6.476, "mean_token_accuracy": 0.12326866835355758, "num_tokens": 16760719.0, "step": 7740 }, { "entropy": 6.594090604782105, "epoch": 0.8288297929263203, "grad_norm": 1.234375, "learning_rate": 0.0004941160966925851, "loss": 6.3544, "mean_token_accuracy": 0.1272714115679264, "num_tokens": 16771331.0, "step": 7745 }, { "entropy": 6.494041490554809, "epoch": 0.8293648670340842, "grad_norm": 1.2734375, "learning_rate": 0.0004941074071064205, "loss": 6.4433, "mean_token_accuracy": 0.12712007239460946, "num_tokens": 16781306.0, "step": 7750 }, { "entropy": 6.638606166839599, "epoch": 0.8298999411418482, "grad_norm": 1.4921875, "learning_rate": 0.0004940987111935605, "loss": 6.4686, "mean_token_accuracy": 0.12214233577251435, "num_tokens": 16793013.0, "step": 7755 }, { "entropy": 6.612168407440185, "epoch": 0.830435015249612, "grad_norm": 1.2109375, "learning_rate": 0.0004940900089542558, "loss": 6.4737, "mean_token_accuracy": 0.12796134501695633, "num_tokens": 16803987.0, "step": 7760 }, { "entropy": 6.5910180568695065, "epoch": 0.830970089357376, "grad_norm": 1.2734375, "learning_rate": 0.000494081300388758, "loss": 6.4697, "mean_token_accuracy": 0.11712961420416831, "num_tokens": 16815031.0, "step": 7765 }, { "entropy": 6.678561735153198, "epoch": 0.8315051634651399, "grad_norm": 1.265625, "learning_rate": 0.0004940725854973184, "loss": 6.5281, "mean_token_accuracy": 0.12335440516471863, "num_tokens": 16826313.0, "step": 7770 }, { "entropy": 6.646420955657959, "epoch": 0.8320402375729038, "grad_norm": 1.2109375, "learning_rate": 0.0004940638642801886, "loss": 6.5086, "mean_token_accuracy": 0.12422936633229256, "num_tokens": 16838470.0, "step": 7775 }, { "entropy": 6.546121120452881, "epoch": 0.8325753116806678, "grad_norm": 1.5078125, "learning_rate": 0.0004940551367376205, "loss": 6.4028, "mean_token_accuracy": 0.12903384640812873, "num_tokens": 16849266.0, "step": 7780 }, { "entropy": 6.566736698150635, "epoch": 0.8331103857884317, "grad_norm": 1.28125, "learning_rate": 0.0004940464028698662, "loss": 6.5309, "mean_token_accuracy": 0.12425655499100685, "num_tokens": 16860720.0, "step": 7785 }, { "entropy": 6.63223614692688, "epoch": 0.8336454598961957, "grad_norm": 1.34375, "learning_rate": 0.0004940376626771779, "loss": 6.4921, "mean_token_accuracy": 0.12509471029043198, "num_tokens": 16872004.0, "step": 7790 }, { "entropy": 6.648682880401611, "epoch": 0.8341805340039595, "grad_norm": 1.9453125, "learning_rate": 0.0004940289161598076, "loss": 6.5292, "mean_token_accuracy": 0.1173703834414482, "num_tokens": 16882898.0, "step": 7795 }, { "entropy": 6.628533267974854, "epoch": 0.8347156081117235, "grad_norm": 1.515625, "learning_rate": 0.0004940201633180084, "loss": 6.4511, "mean_token_accuracy": 0.11566249057650566, "num_tokens": 16894331.0, "step": 7800 }, { "entropy": 6.6906242847442625, "epoch": 0.8352506822194874, "grad_norm": 1.1953125, "learning_rate": 0.0004940114041520326, "loss": 6.5387, "mean_token_accuracy": 0.1246345192193985, "num_tokens": 16903656.0, "step": 7805 }, { "entropy": 6.581471395492554, "epoch": 0.8357857563272513, "grad_norm": 1.1953125, "learning_rate": 0.0004940026386621333, "loss": 6.5019, "mean_token_accuracy": 0.12531133443117143, "num_tokens": 16915878.0, "step": 7810 }, { "entropy": 6.6755578994750975, "epoch": 0.8363208304350153, "grad_norm": 1.4453125, "learning_rate": 0.0004939938668485636, "loss": 6.5432, "mean_token_accuracy": 0.1215199887752533, "num_tokens": 16926577.0, "step": 7815 }, { "entropy": 6.565039253234863, "epoch": 0.8368559045427791, "grad_norm": 1.3359375, "learning_rate": 0.0004939850887115768, "loss": 6.4234, "mean_token_accuracy": 0.1319645993411541, "num_tokens": 16938012.0, "step": 7820 }, { "entropy": 6.569745969772339, "epoch": 0.8373909786505431, "grad_norm": 1.3828125, "learning_rate": 0.0004939763042514263, "loss": 6.4132, "mean_token_accuracy": 0.12320912629365921, "num_tokens": 16949007.0, "step": 7825 }, { "entropy": 6.491839742660522, "epoch": 0.837926052758307, "grad_norm": 1.2578125, "learning_rate": 0.0004939675134683658, "loss": 6.3726, "mean_token_accuracy": 0.13265551403164863, "num_tokens": 16959425.0, "step": 7830 }, { "entropy": 6.643397045135498, "epoch": 0.838461126866071, "grad_norm": 1.4765625, "learning_rate": 0.0004939587163626491, "loss": 6.4972, "mean_token_accuracy": 0.11856562122702599, "num_tokens": 16970002.0, "step": 7835 }, { "entropy": 6.622504758834839, "epoch": 0.8389962009738349, "grad_norm": 1.8359375, "learning_rate": 0.0004939499129345302, "loss": 6.5261, "mean_token_accuracy": 0.12169675678014755, "num_tokens": 16980739.0, "step": 7840 }, { "entropy": 6.638087224960327, "epoch": 0.8395312750815987, "grad_norm": 1.78125, "learning_rate": 0.0004939411031842633, "loss": 6.4766, "mean_token_accuracy": 0.1255985088646412, "num_tokens": 16991643.0, "step": 7845 }, { "entropy": 6.454816770553589, "epoch": 0.8400663491893627, "grad_norm": 1.5390625, "learning_rate": 0.000493932287112103, "loss": 6.3395, "mean_token_accuracy": 0.1409579671919346, "num_tokens": 17001975.0, "step": 7850 }, { "entropy": 6.637519359588623, "epoch": 0.8406014232971266, "grad_norm": 1.34375, "learning_rate": 0.0004939234647183035, "loss": 6.4786, "mean_token_accuracy": 0.12199027836322784, "num_tokens": 17012658.0, "step": 7855 }, { "entropy": 6.653904962539673, "epoch": 0.8411364974048906, "grad_norm": 1.3359375, "learning_rate": 0.0004939146360031197, "loss": 6.4875, "mean_token_accuracy": 0.12131756246089935, "num_tokens": 17023196.0, "step": 7860 }, { "entropy": 6.606409931182862, "epoch": 0.8416715715126545, "grad_norm": 1.4140625, "learning_rate": 0.0004939058009668067, "loss": 6.5086, "mean_token_accuracy": 0.12194685339927673, "num_tokens": 17034589.0, "step": 7865 }, { "entropy": 6.642972040176391, "epoch": 0.8422066456204185, "grad_norm": 2.25, "learning_rate": 0.0004938969596096194, "loss": 6.4733, "mean_token_accuracy": 0.12159970998764039, "num_tokens": 17046139.0, "step": 7870 }, { "entropy": 6.589673328399658, "epoch": 0.8427417197281823, "grad_norm": 1.375, "learning_rate": 0.000493888111931813, "loss": 6.4945, "mean_token_accuracy": 0.12014141380786895, "num_tokens": 17056926.0, "step": 7875 }, { "entropy": 6.539459180831909, "epoch": 0.8432767938359462, "grad_norm": 3.125, "learning_rate": 0.0004938792579336433, "loss": 6.4375, "mean_token_accuracy": 0.12531604021787643, "num_tokens": 17067339.0, "step": 7880 }, { "entropy": 6.603718090057373, "epoch": 0.8438118679437102, "grad_norm": 2.140625, "learning_rate": 0.0004938703976153657, "loss": 6.4518, "mean_token_accuracy": 0.1254698507487774, "num_tokens": 17078037.0, "step": 7885 }, { "entropy": 6.632722282409668, "epoch": 0.8443469420514741, "grad_norm": 1.2890625, "learning_rate": 0.0004938615309772362, "loss": 6.4862, "mean_token_accuracy": 0.11615241914987565, "num_tokens": 17089069.0, "step": 7890 }, { "entropy": 6.616069984436035, "epoch": 0.8448820161592381, "grad_norm": 1.2578125, "learning_rate": 0.0004938526580195107, "loss": 6.4657, "mean_token_accuracy": 0.12840015292167664, "num_tokens": 17100006.0, "step": 7895 }, { "entropy": 6.608232641220093, "epoch": 0.845417090267002, "grad_norm": 1.34375, "learning_rate": 0.0004938437787424454, "loss": 6.501, "mean_token_accuracy": 0.12470883950591087, "num_tokens": 17111896.0, "step": 7900 }, { "entropy": 6.601596450805664, "epoch": 0.845952164374766, "grad_norm": 1.9609375, "learning_rate": 0.0004938348931462969, "loss": 6.5061, "mean_token_accuracy": 0.1278610810637474, "num_tokens": 17123202.0, "step": 7905 }, { "entropy": 6.600058317184448, "epoch": 0.8464872384825298, "grad_norm": 1.4375, "learning_rate": 0.0004938260012313215, "loss": 6.4451, "mean_token_accuracy": 0.12930461540818214, "num_tokens": 17134013.0, "step": 7910 }, { "entropy": 6.536851596832276, "epoch": 0.8470223125902937, "grad_norm": 1.890625, "learning_rate": 0.0004938171029977761, "loss": 6.4564, "mean_token_accuracy": 0.12916264310479164, "num_tokens": 17144041.0, "step": 7915 }, { "entropy": 6.553992843627929, "epoch": 0.8475573866980577, "grad_norm": 1.4375, "learning_rate": 0.0004938081984459176, "loss": 6.4397, "mean_token_accuracy": 0.12721440196037292, "num_tokens": 17155334.0, "step": 7920 }, { "entropy": 6.6116251945495605, "epoch": 0.8480924608058216, "grad_norm": 1.6171875, "learning_rate": 0.000493799287576003, "loss": 6.3996, "mean_token_accuracy": 0.12881384789943695, "num_tokens": 17166243.0, "step": 7925 }, { "entropy": 6.599978303909301, "epoch": 0.8486275349135856, "grad_norm": 1.421875, "learning_rate": 0.0004937903703882898, "loss": 6.4664, "mean_token_accuracy": 0.12380218654870986, "num_tokens": 17177709.0, "step": 7930 }, { "entropy": 6.550316333770752, "epoch": 0.8491626090213494, "grad_norm": 1.28125, "learning_rate": 0.0004937814468830353, "loss": 6.4306, "mean_token_accuracy": 0.12615659311413766, "num_tokens": 17188275.0, "step": 7935 }, { "entropy": 6.639209222793579, "epoch": 0.8496976831291134, "grad_norm": 1.2890625, "learning_rate": 0.0004937725170604975, "loss": 6.5549, "mean_token_accuracy": 0.12421398386359214, "num_tokens": 17199527.0, "step": 7940 }, { "entropy": 6.658242416381836, "epoch": 0.8502327572368773, "grad_norm": 1.4453125, "learning_rate": 0.0004937635809209339, "loss": 6.4738, "mean_token_accuracy": 0.12579896971583365, "num_tokens": 17209500.0, "step": 7945 }, { "entropy": 6.567161989212036, "epoch": 0.8507678313446412, "grad_norm": 1.828125, "learning_rate": 0.0004937546384646027, "loss": 6.4189, "mean_token_accuracy": 0.1228828877210617, "num_tokens": 17219589.0, "step": 7950 }, { "entropy": 6.668274545669556, "epoch": 0.8513029054524052, "grad_norm": 1.8125, "learning_rate": 0.0004937456896917619, "loss": 6.4642, "mean_token_accuracy": 0.1268440864980221, "num_tokens": 17230508.0, "step": 7955 }, { "entropy": 6.628099966049194, "epoch": 0.851837979560169, "grad_norm": 1.328125, "learning_rate": 0.0004937367346026702, "loss": 6.4648, "mean_token_accuracy": 0.12629646956920623, "num_tokens": 17240886.0, "step": 7960 }, { "entropy": 6.5766232967376705, "epoch": 0.852373053667933, "grad_norm": 1.5078125, "learning_rate": 0.0004937277731975858, "loss": 6.4924, "mean_token_accuracy": 0.12928350567817687, "num_tokens": 17252247.0, "step": 7965 }, { "entropy": 6.573000049591064, "epoch": 0.8529081277756969, "grad_norm": 1.71875, "learning_rate": 0.0004937188054767679, "loss": 6.4584, "mean_token_accuracy": 0.12772766575217248, "num_tokens": 17262845.0, "step": 7970 }, { "entropy": 6.6421280860900875, "epoch": 0.8534432018834609, "grad_norm": 1.578125, "learning_rate": 0.0004937098314404751, "loss": 6.4562, "mean_token_accuracy": 0.12444490268826484, "num_tokens": 17274247.0, "step": 7975 }, { "entropy": 6.644790935516357, "epoch": 0.8539782759912248, "grad_norm": 1.40625, "learning_rate": 0.0004937008510889668, "loss": 6.4871, "mean_token_accuracy": 0.12767765745520593, "num_tokens": 17285471.0, "step": 7980 }, { "entropy": 6.589143466949463, "epoch": 0.8545133500989887, "grad_norm": 1.4453125, "learning_rate": 0.0004936918644225021, "loss": 6.5025, "mean_token_accuracy": 0.12948852255940438, "num_tokens": 17296243.0, "step": 7985 }, { "entropy": 6.579883146286011, "epoch": 0.8550484242067526, "grad_norm": 1.3828125, "learning_rate": 0.0004936828714413405, "loss": 6.4633, "mean_token_accuracy": 0.12740985825657844, "num_tokens": 17307301.0, "step": 7990 }, { "entropy": 6.545937824249267, "epoch": 0.8555834983145165, "grad_norm": 1.5078125, "learning_rate": 0.0004936738721457417, "loss": 6.3969, "mean_token_accuracy": 0.13528102710843087, "num_tokens": 17318550.0, "step": 7995 }, { "entropy": 6.5888251781463625, "epoch": 0.8561185724222805, "grad_norm": 1.4609375, "learning_rate": 0.0004936648665359657, "loss": 6.4592, "mean_token_accuracy": 0.12461457923054695, "num_tokens": 17328577.0, "step": 8000 }, { "entropy": 6.586920166015625, "epoch": 0.8566536465300444, "grad_norm": 1.3984375, "learning_rate": 0.0004936558546122723, "loss": 6.5184, "mean_token_accuracy": 0.12257596775889397, "num_tokens": 17341013.0, "step": 8005 }, { "entropy": 6.589303112030029, "epoch": 0.8571887206378084, "grad_norm": 1.453125, "learning_rate": 0.0004936468363749217, "loss": 6.4655, "mean_token_accuracy": 0.12056496143341064, "num_tokens": 17351956.0, "step": 8010 }, { "entropy": 6.6829746723175045, "epoch": 0.8577237947455723, "grad_norm": 1.3515625, "learning_rate": 0.0004936378118241746, "loss": 6.4386, "mean_token_accuracy": 0.117622260004282, "num_tokens": 17363465.0, "step": 8015 }, { "entropy": 6.584981489181518, "epoch": 0.8582588688533361, "grad_norm": 1.28125, "learning_rate": 0.0004936287809602913, "loss": 6.4964, "mean_token_accuracy": 0.1258731223642826, "num_tokens": 17374458.0, "step": 8020 }, { "entropy": 6.558772945404053, "epoch": 0.8587939429611001, "grad_norm": 1.546875, "learning_rate": 0.0004936197437835329, "loss": 6.4979, "mean_token_accuracy": 0.12399565950036048, "num_tokens": 17385492.0, "step": 8025 }, { "entropy": 6.684000682830811, "epoch": 0.859329017068864, "grad_norm": 1.28125, "learning_rate": 0.0004936107002941599, "loss": 6.446, "mean_token_accuracy": 0.1296046145260334, "num_tokens": 17395640.0, "step": 8030 }, { "entropy": 6.621039772033692, "epoch": 0.859864091176628, "grad_norm": 1.296875, "learning_rate": 0.0004936016504924337, "loss": 6.4657, "mean_token_accuracy": 0.12447260543704033, "num_tokens": 17405211.0, "step": 8035 }, { "entropy": 6.572212600708008, "epoch": 0.8603991652843919, "grad_norm": 1.578125, "learning_rate": 0.0004935925943786155, "loss": 6.4385, "mean_token_accuracy": 0.12494494318962097, "num_tokens": 17415421.0, "step": 8040 }, { "entropy": 6.5851781368255615, "epoch": 0.8609342393921559, "grad_norm": 1.3203125, "learning_rate": 0.0004935835319529669, "loss": 6.4882, "mean_token_accuracy": 0.12248977199196816, "num_tokens": 17426040.0, "step": 8045 }, { "entropy": 6.55501275062561, "epoch": 0.8614693134999197, "grad_norm": 1.34375, "learning_rate": 0.0004935744632157496, "loss": 6.4693, "mean_token_accuracy": 0.12371492311358452, "num_tokens": 17436305.0, "step": 8050 }, { "entropy": 6.602463960647583, "epoch": 0.8620043876076836, "grad_norm": 1.3515625, "learning_rate": 0.0004935653881672253, "loss": 6.5244, "mean_token_accuracy": 0.12265571355819702, "num_tokens": 17446786.0, "step": 8055 }, { "entropy": 6.612880706787109, "epoch": 0.8625394617154476, "grad_norm": 1.578125, "learning_rate": 0.0004935563068076561, "loss": 6.422, "mean_token_accuracy": 0.1300605744123459, "num_tokens": 17456613.0, "step": 8060 }, { "entropy": 6.542842960357666, "epoch": 0.8630745358232115, "grad_norm": 1.46875, "learning_rate": 0.0004935472191373044, "loss": 6.3675, "mean_token_accuracy": 0.12812848910689353, "num_tokens": 17467281.0, "step": 8065 }, { "entropy": 6.56179370880127, "epoch": 0.8636096099309755, "grad_norm": 1.40625, "learning_rate": 0.0004935381251564324, "loss": 6.4896, "mean_token_accuracy": 0.12458937540650368, "num_tokens": 17478271.0, "step": 8070 }, { "entropy": 6.59501895904541, "epoch": 0.8641446840387393, "grad_norm": 1.8671875, "learning_rate": 0.0004935290248653027, "loss": 6.4665, "mean_token_accuracy": 0.12613890841603279, "num_tokens": 17489519.0, "step": 8075 }, { "entropy": 6.614124202728272, "epoch": 0.8646797581465033, "grad_norm": 1.25, "learning_rate": 0.0004935199182641781, "loss": 6.4417, "mean_token_accuracy": 0.12557547613978387, "num_tokens": 17500076.0, "step": 8080 }, { "entropy": 6.614273643493652, "epoch": 0.8652148322542672, "grad_norm": 1.53125, "learning_rate": 0.0004935108053533216, "loss": 6.4453, "mean_token_accuracy": 0.12125986739993096, "num_tokens": 17509898.0, "step": 8085 }, { "entropy": 6.550960397720337, "epoch": 0.8657499063620312, "grad_norm": 1.609375, "learning_rate": 0.0004935016861329964, "loss": 6.406, "mean_token_accuracy": 0.1296715520322323, "num_tokens": 17519890.0, "step": 8090 }, { "entropy": 6.530986309051514, "epoch": 0.8662849804697951, "grad_norm": 1.2734375, "learning_rate": 0.0004934925606034656, "loss": 6.4381, "mean_token_accuracy": 0.12463523522019386, "num_tokens": 17530927.0, "step": 8095 }, { "entropy": 6.6647419929504395, "epoch": 0.866820054577559, "grad_norm": 1.484375, "learning_rate": 0.0004934834287649928, "loss": 6.5129, "mean_token_accuracy": 0.12179197296500206, "num_tokens": 17541174.0, "step": 8100 }, { "entropy": 6.6586121082305905, "epoch": 0.8673551286853229, "grad_norm": 2.21875, "learning_rate": 0.0004934742906178417, "loss": 6.4765, "mean_token_accuracy": 0.11956845298409462, "num_tokens": 17552460.0, "step": 8105 }, { "entropy": 6.6295825958251955, "epoch": 0.8678902027930868, "grad_norm": 1.5, "learning_rate": 0.0004934651461622762, "loss": 6.483, "mean_token_accuracy": 0.12741912975907327, "num_tokens": 17563908.0, "step": 8110 }, { "entropy": 6.586279296875, "epoch": 0.8684252769008508, "grad_norm": 1.1953125, "learning_rate": 0.0004934559953985603, "loss": 6.4953, "mean_token_accuracy": 0.1282585471868515, "num_tokens": 17574314.0, "step": 8115 }, { "entropy": 6.640317058563232, "epoch": 0.8689603510086147, "grad_norm": 1.3671875, "learning_rate": 0.0004934468383269582, "loss": 6.4568, "mean_token_accuracy": 0.12750404104590415, "num_tokens": 17583719.0, "step": 8120 }, { "entropy": 6.520741510391235, "epoch": 0.8694954251163787, "grad_norm": 1.5390625, "learning_rate": 0.0004934376749477344, "loss": 6.4474, "mean_token_accuracy": 0.1261451207101345, "num_tokens": 17594522.0, "step": 8125 }, { "entropy": 6.550720930099487, "epoch": 0.8700304992241426, "grad_norm": 1.5703125, "learning_rate": 0.0004934285052611533, "loss": 6.384, "mean_token_accuracy": 0.13392736613750458, "num_tokens": 17604632.0, "step": 8130 }, { "entropy": 6.7096068382263185, "epoch": 0.8705655733319064, "grad_norm": 2.53125, "learning_rate": 0.00049341932926748, "loss": 6.5216, "mean_token_accuracy": 0.12129078730940819, "num_tokens": 17615459.0, "step": 8135 }, { "entropy": 6.650518894195557, "epoch": 0.8711006474396704, "grad_norm": 1.359375, "learning_rate": 0.0004934101469669791, "loss": 6.4636, "mean_token_accuracy": 0.1257311299443245, "num_tokens": 17625800.0, "step": 8140 }, { "entropy": 6.517386484146118, "epoch": 0.8716357215474343, "grad_norm": 1.4296875, "learning_rate": 0.0004934009583599159, "loss": 6.3112, "mean_token_accuracy": 0.13819433227181435, "num_tokens": 17637264.0, "step": 8145 }, { "entropy": 6.515216493606568, "epoch": 0.8721707956551983, "grad_norm": 1.421875, "learning_rate": 0.0004933917634465558, "loss": 6.3499, "mean_token_accuracy": 0.12682703286409377, "num_tokens": 17648256.0, "step": 8150 }, { "entropy": 6.564549684524536, "epoch": 0.8727058697629622, "grad_norm": 1.625, "learning_rate": 0.0004933825622271642, "loss": 6.4983, "mean_token_accuracy": 0.12459777966141701, "num_tokens": 17659096.0, "step": 8155 }, { "entropy": 6.629525566101075, "epoch": 0.8732409438707261, "grad_norm": 1.2578125, "learning_rate": 0.0004933733547020069, "loss": 6.4714, "mean_token_accuracy": 0.12370945960283279, "num_tokens": 17669808.0, "step": 8160 }, { "entropy": 6.615776252746582, "epoch": 0.87377601797849, "grad_norm": 1.4609375, "learning_rate": 0.0004933641408713495, "loss": 6.4171, "mean_token_accuracy": 0.12331488877534866, "num_tokens": 17680375.0, "step": 8165 }, { "entropy": 6.513298511505127, "epoch": 0.8743110920862539, "grad_norm": 1.4921875, "learning_rate": 0.0004933549207354582, "loss": 6.3829, "mean_token_accuracy": 0.13013615384697913, "num_tokens": 17690780.0, "step": 8170 }, { "entropy": 6.601052331924438, "epoch": 0.8748461661940179, "grad_norm": 2.125, "learning_rate": 0.0004933456942945994, "loss": 6.483, "mean_token_accuracy": 0.12874177172780038, "num_tokens": 17702170.0, "step": 8175 }, { "entropy": 6.5550049304962155, "epoch": 0.8753812403017818, "grad_norm": 1.9609375, "learning_rate": 0.0004933364615490393, "loss": 6.4206, "mean_token_accuracy": 0.12599021792411805, "num_tokens": 17712631.0, "step": 8180 }, { "entropy": 6.611193418502808, "epoch": 0.8759163144095458, "grad_norm": 1.4375, "learning_rate": 0.0004933272224990445, "loss": 6.5003, "mean_token_accuracy": 0.12176733165979385, "num_tokens": 17723692.0, "step": 8185 }, { "entropy": 6.6318916320800785, "epoch": 0.8764513885173096, "grad_norm": 1.5234375, "learning_rate": 0.0004933179771448819, "loss": 6.4129, "mean_token_accuracy": 0.13463898748159409, "num_tokens": 17735264.0, "step": 8190 }, { "entropy": 6.5342247009277346, "epoch": 0.8769864626250736, "grad_norm": 1.3984375, "learning_rate": 0.0004933087254868183, "loss": 6.3354, "mean_token_accuracy": 0.1375872351229191, "num_tokens": 17747060.0, "step": 8195 }, { "entropy": 6.510075902938842, "epoch": 0.8775215367328375, "grad_norm": 1.6484375, "learning_rate": 0.000493299467525121, "loss": 6.4422, "mean_token_accuracy": 0.12407493069767953, "num_tokens": 17758159.0, "step": 8200 }, { "entropy": 6.57683801651001, "epoch": 0.8780566108406014, "grad_norm": 1.265625, "learning_rate": 0.0004932902032600573, "loss": 6.4594, "mean_token_accuracy": 0.12217129170894622, "num_tokens": 17768444.0, "step": 8205 }, { "entropy": 6.646522092819214, "epoch": 0.8785916849483654, "grad_norm": 1.4296875, "learning_rate": 0.0004932809326918945, "loss": 6.3517, "mean_token_accuracy": 0.1339459776878357, "num_tokens": 17779303.0, "step": 8210 }, { "entropy": 6.622037935256958, "epoch": 0.8791267590561292, "grad_norm": 1.265625, "learning_rate": 0.0004932716558209005, "loss": 6.5405, "mean_token_accuracy": 0.11944242864847184, "num_tokens": 17789853.0, "step": 8215 }, { "entropy": 6.602828121185302, "epoch": 0.8796618331638932, "grad_norm": 1.6953125, "learning_rate": 0.0004932623726473432, "loss": 6.3894, "mean_token_accuracy": 0.1371438518166542, "num_tokens": 17799232.0, "step": 8220 }, { "entropy": 6.487914800643921, "epoch": 0.8801969072716571, "grad_norm": 1.640625, "learning_rate": 0.0004932530831714904, "loss": 6.4097, "mean_token_accuracy": 0.12824408933520318, "num_tokens": 17808870.0, "step": 8225 }, { "entropy": 6.5319726943969725, "epoch": 0.8807319813794211, "grad_norm": 1.3046875, "learning_rate": 0.0004932437873936107, "loss": 6.4906, "mean_token_accuracy": 0.11963605657219886, "num_tokens": 17819394.0, "step": 8230 }, { "entropy": 6.662888050079346, "epoch": 0.881267055487185, "grad_norm": 1.484375, "learning_rate": 0.0004932344853139721, "loss": 6.4679, "mean_token_accuracy": 0.12477930113673211, "num_tokens": 17830220.0, "step": 8235 }, { "entropy": 6.598001623153687, "epoch": 0.8818021295949489, "grad_norm": 1.5234375, "learning_rate": 0.0004932251769328436, "loss": 6.4034, "mean_token_accuracy": 0.1247767224907875, "num_tokens": 17841971.0, "step": 8240 }, { "entropy": 6.5990701675415036, "epoch": 0.8823372037027128, "grad_norm": 1.359375, "learning_rate": 0.0004932158622504937, "loss": 6.4173, "mean_token_accuracy": 0.12920651137828826, "num_tokens": 17851890.0, "step": 8245 }, { "entropy": 6.519874525070191, "epoch": 0.8828722778104767, "grad_norm": 1.421875, "learning_rate": 0.0004932065412671915, "loss": 6.4123, "mean_token_accuracy": 0.13252334222197532, "num_tokens": 17862855.0, "step": 8250 }, { "entropy": 6.629786729812622, "epoch": 0.8834073519182407, "grad_norm": 1.4921875, "learning_rate": 0.0004931972139832058, "loss": 6.4243, "mean_token_accuracy": 0.12248511165380478, "num_tokens": 17873550.0, "step": 8255 }, { "entropy": 6.638599252700805, "epoch": 0.8839424260260046, "grad_norm": 2.46875, "learning_rate": 0.0004931878803988066, "loss": 6.4432, "mean_token_accuracy": 0.13054898232221604, "num_tokens": 17884067.0, "step": 8260 }, { "entropy": 6.601341295242309, "epoch": 0.8844775001337686, "grad_norm": 1.5234375, "learning_rate": 0.0004931785405142627, "loss": 6.4715, "mean_token_accuracy": 0.12773810103535652, "num_tokens": 17894587.0, "step": 8265 }, { "entropy": 6.557901048660279, "epoch": 0.8850125742415325, "grad_norm": 1.375, "learning_rate": 0.0004931691943298443, "loss": 6.4536, "mean_token_accuracy": 0.12345588281750679, "num_tokens": 17905297.0, "step": 8270 }, { "entropy": 6.472777080535889, "epoch": 0.8855476483492963, "grad_norm": 1.3046875, "learning_rate": 0.000493159841845821, "loss": 6.3637, "mean_token_accuracy": 0.12871376648545266, "num_tokens": 17916225.0, "step": 8275 }, { "entropy": 6.641252183914185, "epoch": 0.8860827224570603, "grad_norm": 2.890625, "learning_rate": 0.0004931504830624629, "loss": 6.4114, "mean_token_accuracy": 0.12872292771935462, "num_tokens": 17925795.0, "step": 8280 }, { "entropy": 6.560930967330933, "epoch": 0.8866177965648242, "grad_norm": 1.2734375, "learning_rate": 0.0004931411179800403, "loss": 6.4212, "mean_token_accuracy": 0.12332068607211114, "num_tokens": 17936134.0, "step": 8285 }, { "entropy": 6.576021671295166, "epoch": 0.8871528706725882, "grad_norm": 1.7734375, "learning_rate": 0.0004931317465988235, "loss": 6.4877, "mean_token_accuracy": 0.12288779988884926, "num_tokens": 17946393.0, "step": 8290 }, { "entropy": 6.620288515090943, "epoch": 0.8876879447803521, "grad_norm": 1.5546875, "learning_rate": 0.0004931223689190832, "loss": 6.4979, "mean_token_accuracy": 0.12131898999214172, "num_tokens": 17957527.0, "step": 8295 }, { "entropy": 6.60401668548584, "epoch": 0.8882230188881161, "grad_norm": 1.390625, "learning_rate": 0.0004931129849410903, "loss": 6.5001, "mean_token_accuracy": 0.12653226852416993, "num_tokens": 17968390.0, "step": 8300 }, { "entropy": 6.624185705184937, "epoch": 0.8887580929958799, "grad_norm": 1.484375, "learning_rate": 0.0004931035946651154, "loss": 6.424, "mean_token_accuracy": 0.13672848865389825, "num_tokens": 17978667.0, "step": 8305 }, { "entropy": 6.649472332000732, "epoch": 0.8892931671036438, "grad_norm": 1.734375, "learning_rate": 0.0004930941980914299, "loss": 6.484, "mean_token_accuracy": 0.12073868960142135, "num_tokens": 17989008.0, "step": 8310 }, { "entropy": 6.55554428100586, "epoch": 0.8898282412114078, "grad_norm": 1.6796875, "learning_rate": 0.0004930847952203052, "loss": 6.4167, "mean_token_accuracy": 0.11992595419287681, "num_tokens": 18000199.0, "step": 8315 }, { "entropy": 6.6081115245819095, "epoch": 0.8903633153191717, "grad_norm": 2.21875, "learning_rate": 0.0004930753860520126, "loss": 6.3714, "mean_token_accuracy": 0.12737504318356513, "num_tokens": 18010941.0, "step": 8320 }, { "entropy": 6.636107873916626, "epoch": 0.8908983894269357, "grad_norm": 1.3828125, "learning_rate": 0.0004930659705868237, "loss": 6.4755, "mean_token_accuracy": 0.12668566182255744, "num_tokens": 18021519.0, "step": 8325 }, { "entropy": 6.576786231994629, "epoch": 0.8914334635346995, "grad_norm": 2.296875, "learning_rate": 0.0004930565488250108, "loss": 6.4282, "mean_token_accuracy": 0.12401631250977516, "num_tokens": 18032773.0, "step": 8330 }, { "entropy": 6.560948514938355, "epoch": 0.8919685376424635, "grad_norm": 1.625, "learning_rate": 0.0004930471207668456, "loss": 6.3931, "mean_token_accuracy": 0.1288905918598175, "num_tokens": 18043250.0, "step": 8335 }, { "entropy": 6.577342367172241, "epoch": 0.8925036117502274, "grad_norm": 1.4453125, "learning_rate": 0.0004930376864126005, "loss": 6.4045, "mean_token_accuracy": 0.13135718554258347, "num_tokens": 18055165.0, "step": 8340 }, { "entropy": 6.533294534683227, "epoch": 0.8930386858579913, "grad_norm": 1.375, "learning_rate": 0.0004930282457625476, "loss": 6.3655, "mean_token_accuracy": 0.1319275178015232, "num_tokens": 18065296.0, "step": 8345 }, { "entropy": 6.483318853378296, "epoch": 0.8935737599657553, "grad_norm": 1.734375, "learning_rate": 0.00049301879881696, "loss": 6.3713, "mean_token_accuracy": 0.12717922553420066, "num_tokens": 18075536.0, "step": 8350 }, { "entropy": 6.523620080947876, "epoch": 0.8941088340735192, "grad_norm": 1.4296875, "learning_rate": 0.0004930093455761101, "loss": 6.4792, "mean_token_accuracy": 0.1299550086259842, "num_tokens": 18086253.0, "step": 8355 }, { "entropy": 6.625021934509277, "epoch": 0.8946439081812831, "grad_norm": 2.15625, "learning_rate": 0.000492999886040271, "loss": 6.4867, "mean_token_accuracy": 0.12763941064476966, "num_tokens": 18097335.0, "step": 8360 }, { "entropy": 6.678513479232788, "epoch": 0.895178982289047, "grad_norm": 1.53125, "learning_rate": 0.0004929904202097159, "loss": 6.4165, "mean_token_accuracy": 0.1255946137011051, "num_tokens": 18107293.0, "step": 8365 }, { "entropy": 6.574617719650268, "epoch": 0.895714056396811, "grad_norm": 2.0, "learning_rate": 0.0004929809480847179, "loss": 6.529, "mean_token_accuracy": 0.11832507178187371, "num_tokens": 18117705.0, "step": 8370 }, { "entropy": 6.6313234806060795, "epoch": 0.8962491305045749, "grad_norm": 2.015625, "learning_rate": 0.0004929714696655507, "loss": 6.4331, "mean_token_accuracy": 0.12140770703554153, "num_tokens": 18129003.0, "step": 8375 }, { "entropy": 6.6004438400268555, "epoch": 0.8967842046123388, "grad_norm": 1.6796875, "learning_rate": 0.000492961984952488, "loss": 6.3848, "mean_token_accuracy": 0.1367577515542507, "num_tokens": 18140843.0, "step": 8380 }, { "entropy": 6.557983160018921, "epoch": 0.8973192787201028, "grad_norm": 1.375, "learning_rate": 0.0004929524939458037, "loss": 6.4735, "mean_token_accuracy": 0.12216648012399674, "num_tokens": 18151476.0, "step": 8385 }, { "entropy": 6.597401762008667, "epoch": 0.8978543528278666, "grad_norm": 1.75, "learning_rate": 0.0004929429966457716, "loss": 6.4974, "mean_token_accuracy": 0.11995471492409707, "num_tokens": 18161304.0, "step": 8390 }, { "entropy": 6.655696821212769, "epoch": 0.8983894269356306, "grad_norm": 1.3671875, "learning_rate": 0.0004929334930526662, "loss": 6.4287, "mean_token_accuracy": 0.13061922267079354, "num_tokens": 18173696.0, "step": 8395 }, { "entropy": 6.572501087188721, "epoch": 0.8989245010433945, "grad_norm": 1.9609375, "learning_rate": 0.0004929239831667617, "loss": 6.4387, "mean_token_accuracy": 0.12057856544852256, "num_tokens": 18186024.0, "step": 8400 }, { "entropy": 6.567807579040528, "epoch": 0.8994595751511585, "grad_norm": 1.328125, "learning_rate": 0.0004929144669883329, "loss": 6.4628, "mean_token_accuracy": 0.13044245541095734, "num_tokens": 18196976.0, "step": 8405 }, { "entropy": 6.587893533706665, "epoch": 0.8999946492589224, "grad_norm": 1.8984375, "learning_rate": 0.0004929049445176545, "loss": 6.4553, "mean_token_accuracy": 0.12222403511404992, "num_tokens": 18208086.0, "step": 8410 }, { "entropy": 6.598808670043946, "epoch": 0.9005297233666862, "grad_norm": 1.4609375, "learning_rate": 0.0004928954157550013, "loss": 6.4026, "mean_token_accuracy": 0.1364985041320324, "num_tokens": 18218468.0, "step": 8415 }, { "entropy": 6.641229772567749, "epoch": 0.9010647974744502, "grad_norm": 1.640625, "learning_rate": 0.0004928858807006488, "loss": 6.511, "mean_token_accuracy": 0.12634748592972755, "num_tokens": 18230489.0, "step": 8420 }, { "entropy": 6.616871500015259, "epoch": 0.9015998715822141, "grad_norm": 1.5625, "learning_rate": 0.0004928763393548721, "loss": 6.4344, "mean_token_accuracy": 0.12947860807180406, "num_tokens": 18239968.0, "step": 8425 }, { "entropy": 6.5853495597839355, "epoch": 0.9021349456899781, "grad_norm": 1.7734375, "learning_rate": 0.0004928667917179465, "loss": 6.4898, "mean_token_accuracy": 0.12196068912744522, "num_tokens": 18250902.0, "step": 8430 }, { "entropy": 6.663750267028808, "epoch": 0.902670019797742, "grad_norm": 1.453125, "learning_rate": 0.0004928572377901481, "loss": 6.4837, "mean_token_accuracy": 0.12794666811823846, "num_tokens": 18262094.0, "step": 8435 }, { "entropy": 6.584063005447388, "epoch": 0.903205093905506, "grad_norm": 1.4296875, "learning_rate": 0.0004928476775717524, "loss": 6.4512, "mean_token_accuracy": 0.12302127629518508, "num_tokens": 18272765.0, "step": 8440 }, { "entropy": 6.568285655975342, "epoch": 0.9037401680132698, "grad_norm": 1.6796875, "learning_rate": 0.0004928381110630358, "loss": 6.3773, "mean_token_accuracy": 0.13741017803549765, "num_tokens": 18284570.0, "step": 8445 }, { "entropy": 6.740869760513306, "epoch": 0.9042752421210337, "grad_norm": 1.65625, "learning_rate": 0.0004928285382642742, "loss": 6.4835, "mean_token_accuracy": 0.1234114944934845, "num_tokens": 18295170.0, "step": 8450 }, { "entropy": 6.594295454025269, "epoch": 0.9048103162287977, "grad_norm": 1.4140625, "learning_rate": 0.0004928189591757443, "loss": 6.4201, "mean_token_accuracy": 0.122423455119133, "num_tokens": 18306388.0, "step": 8455 }, { "entropy": 6.5661896705627445, "epoch": 0.9053453903365616, "grad_norm": 1.359375, "learning_rate": 0.0004928093737977225, "loss": 6.429, "mean_token_accuracy": 0.13050043657422067, "num_tokens": 18316363.0, "step": 8460 }, { "entropy": 6.4683513164520265, "epoch": 0.9058804644443256, "grad_norm": 8.5625, "learning_rate": 0.0004927997821304856, "loss": 6.3861, "mean_token_accuracy": 0.12661736011505126, "num_tokens": 18327397.0, "step": 8465 }, { "entropy": 6.5845592498779295, "epoch": 0.9064155385520895, "grad_norm": 1.890625, "learning_rate": 0.0004927901841743107, "loss": 6.4818, "mean_token_accuracy": 0.12432613149285317, "num_tokens": 18338909.0, "step": 8470 }, { "entropy": 6.639092874526978, "epoch": 0.9069506126598534, "grad_norm": 1.703125, "learning_rate": 0.0004927805799294747, "loss": 6.4568, "mean_token_accuracy": 0.12108288407325744, "num_tokens": 18350110.0, "step": 8475 }, { "entropy": 6.679194068908691, "epoch": 0.9074856867676173, "grad_norm": 2.515625, "learning_rate": 0.0004927709693962551, "loss": 6.5177, "mean_token_accuracy": 0.11563151106238365, "num_tokens": 18361590.0, "step": 8480 }, { "entropy": 6.59504246711731, "epoch": 0.9080207608753812, "grad_norm": 1.9453125, "learning_rate": 0.0004927613525749295, "loss": 6.4634, "mean_token_accuracy": 0.12366845831274986, "num_tokens": 18372602.0, "step": 8485 }, { "entropy": 6.630734634399414, "epoch": 0.9085558349831452, "grad_norm": 1.4609375, "learning_rate": 0.0004927517294657753, "loss": 6.499, "mean_token_accuracy": 0.12221666947007179, "num_tokens": 18384653.0, "step": 8490 }, { "entropy": 6.684356164932251, "epoch": 0.9090909090909091, "grad_norm": 1.8828125, "learning_rate": 0.0004927421000690705, "loss": 6.4559, "mean_token_accuracy": 0.12245200499892235, "num_tokens": 18395379.0, "step": 8495 }, { "entropy": 6.63131685256958, "epoch": 0.909625983198673, "grad_norm": 1.7890625, "learning_rate": 0.0004927324643850933, "loss": 6.4256, "mean_token_accuracy": 0.12843620777130127, "num_tokens": 18405915.0, "step": 8500 }, { "entropy": 6.438924121856689, "epoch": 0.9101610573064369, "grad_norm": 1.6484375, "learning_rate": 0.0004927228224141217, "loss": 6.3293, "mean_token_accuracy": 0.14597983360290528, "num_tokens": 18416656.0, "step": 8505 }, { "entropy": 6.542063999176025, "epoch": 0.9106961314142009, "grad_norm": 2.5, "learning_rate": 0.0004927131741564342, "loss": 6.4477, "mean_token_accuracy": 0.12013882920145988, "num_tokens": 18427141.0, "step": 8510 }, { "entropy": 6.607851362228393, "epoch": 0.9112312055219648, "grad_norm": 1.734375, "learning_rate": 0.0004927035196123094, "loss": 6.4915, "mean_token_accuracy": 0.12988717779517173, "num_tokens": 18437135.0, "step": 8515 }, { "entropy": 6.685029554367065, "epoch": 0.9117662796297287, "grad_norm": 1.4453125, "learning_rate": 0.000492693858782026, "loss": 6.5639, "mean_token_accuracy": 0.11965355947613716, "num_tokens": 18448567.0, "step": 8520 }, { "entropy": 6.679243803024292, "epoch": 0.9123013537374927, "grad_norm": 1.5546875, "learning_rate": 0.000492684191665863, "loss": 6.511, "mean_token_accuracy": 0.11756190657615662, "num_tokens": 18459385.0, "step": 8525 }, { "entropy": 6.561179542541504, "epoch": 0.9128364278452565, "grad_norm": 1.421875, "learning_rate": 0.0004926745182640996, "loss": 6.4677, "mean_token_accuracy": 0.1285193495452404, "num_tokens": 18471376.0, "step": 8530 }, { "entropy": 6.649504232406616, "epoch": 0.9133715019530205, "grad_norm": 1.7890625, "learning_rate": 0.0004926648385770152, "loss": 6.5335, "mean_token_accuracy": 0.11931721493601799, "num_tokens": 18481950.0, "step": 8535 }, { "entropy": 6.654511833190918, "epoch": 0.9139065760607844, "grad_norm": 1.4375, "learning_rate": 0.0004926551526048891, "loss": 6.4524, "mean_token_accuracy": 0.12727693393826484, "num_tokens": 18492436.0, "step": 8540 }, { "entropy": 6.575570774078369, "epoch": 0.9144416501685484, "grad_norm": 2.390625, "learning_rate": 0.0004926454603480009, "loss": 6.2964, "mean_token_accuracy": 0.12638833299279212, "num_tokens": 18504279.0, "step": 8545 }, { "entropy": 6.573821878433227, "epoch": 0.9149767242763123, "grad_norm": 3.546875, "learning_rate": 0.0004926357618066307, "loss": 6.4443, "mean_token_accuracy": 0.12484021857380867, "num_tokens": 18515262.0, "step": 8550 }, { "entropy": 6.63035249710083, "epoch": 0.9155117983840761, "grad_norm": 1.6484375, "learning_rate": 0.0004926260569810586, "loss": 6.4951, "mean_token_accuracy": 0.12227512821555138, "num_tokens": 18525176.0, "step": 8555 }, { "entropy": 6.5566153049469, "epoch": 0.9160468724918401, "grad_norm": 1.59375, "learning_rate": 0.0004926163458715645, "loss": 6.4617, "mean_token_accuracy": 0.12596529051661493, "num_tokens": 18536674.0, "step": 8560 }, { "entropy": 6.5605353832244875, "epoch": 0.916581946599604, "grad_norm": 4.03125, "learning_rate": 0.0004926066284784292, "loss": 6.4496, "mean_token_accuracy": 0.12597779259085656, "num_tokens": 18547398.0, "step": 8565 }, { "entropy": 6.563134813308716, "epoch": 0.917117020707368, "grad_norm": 1.7578125, "learning_rate": 0.0004925969048019329, "loss": 6.4943, "mean_token_accuracy": 0.12652412205934524, "num_tokens": 18558838.0, "step": 8570 }, { "entropy": 6.629328727722168, "epoch": 0.9176520948151319, "grad_norm": 2.265625, "learning_rate": 0.0004925871748423566, "loss": 6.4395, "mean_token_accuracy": 0.1258179649710655, "num_tokens": 18569881.0, "step": 8575 }, { "entropy": 6.6013552188873295, "epoch": 0.9181871689228959, "grad_norm": 1.6640625, "learning_rate": 0.0004925774385999812, "loss": 6.3501, "mean_token_accuracy": 0.13269954398274422, "num_tokens": 18579556.0, "step": 8580 }, { "entropy": 6.4663420677185055, "epoch": 0.9187222430306597, "grad_norm": 1.71875, "learning_rate": 0.0004925676960750878, "loss": 6.3516, "mean_token_accuracy": 0.1361738361418247, "num_tokens": 18590580.0, "step": 8585 }, { "entropy": 6.634561157226562, "epoch": 0.9192573171384236, "grad_norm": 1.71875, "learning_rate": 0.0004925579472679578, "loss": 6.4828, "mean_token_accuracy": 0.1265283964574337, "num_tokens": 18600813.0, "step": 8590 }, { "entropy": 6.598533678054809, "epoch": 0.9197923912461876, "grad_norm": 1.484375, "learning_rate": 0.0004925481921788726, "loss": 6.391, "mean_token_accuracy": 0.1304919548332691, "num_tokens": 18610807.0, "step": 8595 }, { "entropy": 6.510357618331909, "epoch": 0.9203274653539515, "grad_norm": 1.515625, "learning_rate": 0.000492538430808114, "loss": 6.3577, "mean_token_accuracy": 0.12540487572550774, "num_tokens": 18622108.0, "step": 8600 }, { "entropy": 6.557230615615845, "epoch": 0.9208625394617155, "grad_norm": 1.4140625, "learning_rate": 0.0004925286631559636, "loss": 6.5401, "mean_token_accuracy": 0.12565935403108597, "num_tokens": 18633098.0, "step": 8605 }, { "entropy": 6.648445987701416, "epoch": 0.9213976135694794, "grad_norm": 1.5859375, "learning_rate": 0.0004925188892227038, "loss": 6.4225, "mean_token_accuracy": 0.12731703594326974, "num_tokens": 18643603.0, "step": 8610 }, { "entropy": 6.638711643218994, "epoch": 0.9219326876772433, "grad_norm": 2.15625, "learning_rate": 0.0004925091090086166, "loss": 6.4527, "mean_token_accuracy": 0.1319430947303772, "num_tokens": 18654354.0, "step": 8615 }, { "entropy": 6.621751213073731, "epoch": 0.9224677617850072, "grad_norm": 1.6171875, "learning_rate": 0.0004924993225139845, "loss": 6.5275, "mean_token_accuracy": 0.12473874017596245, "num_tokens": 18665349.0, "step": 8620 }, { "entropy": 6.635911178588867, "epoch": 0.9230028358927711, "grad_norm": 1.53125, "learning_rate": 0.0004924895297390899, "loss": 6.4661, "mean_token_accuracy": 0.1247866302728653, "num_tokens": 18676575.0, "step": 8625 }, { "entropy": 6.631935882568359, "epoch": 0.9235379100005351, "grad_norm": 1.4296875, "learning_rate": 0.0004924797306842157, "loss": 6.4019, "mean_token_accuracy": 0.13183975219726562, "num_tokens": 18686501.0, "step": 8630 }, { "entropy": 6.582294940948486, "epoch": 0.924072984108299, "grad_norm": 2.140625, "learning_rate": 0.0004924699253496449, "loss": 6.474, "mean_token_accuracy": 0.1282108373939991, "num_tokens": 18697246.0, "step": 8635 }, { "entropy": 6.533542108535767, "epoch": 0.924608058216063, "grad_norm": 1.921875, "learning_rate": 0.0004924601137356605, "loss": 6.3935, "mean_token_accuracy": 0.1339188501238823, "num_tokens": 18708177.0, "step": 8640 }, { "entropy": 6.60825548171997, "epoch": 0.9251431323238268, "grad_norm": 1.546875, "learning_rate": 0.000492450295842546, "loss": 6.458, "mean_token_accuracy": 0.12657491490244865, "num_tokens": 18719334.0, "step": 8645 }, { "entropy": 6.618236446380616, "epoch": 0.9256782064315908, "grad_norm": 1.6171875, "learning_rate": 0.0004924404716705847, "loss": 6.4091, "mean_token_accuracy": 0.13286964371800422, "num_tokens": 18729174.0, "step": 8650 }, { "entropy": 6.537341594696045, "epoch": 0.9262132805393547, "grad_norm": 1.703125, "learning_rate": 0.0004924306412200603, "loss": 6.517, "mean_token_accuracy": 0.122911486774683, "num_tokens": 18740277.0, "step": 8655 }, { "entropy": 6.627772474288941, "epoch": 0.9267483546471186, "grad_norm": 1.46875, "learning_rate": 0.0004924208044912567, "loss": 6.4767, "mean_token_accuracy": 0.12486343458294868, "num_tokens": 18751864.0, "step": 8660 }, { "entropy": 6.609443330764771, "epoch": 0.9272834287548826, "grad_norm": 2.828125, "learning_rate": 0.0004924109614844579, "loss": 6.3891, "mean_token_accuracy": 0.1359869807958603, "num_tokens": 18762786.0, "step": 8665 }, { "entropy": 6.555660629272461, "epoch": 0.9278185028626464, "grad_norm": 1.7890625, "learning_rate": 0.0004924011121999482, "loss": 6.4339, "mean_token_accuracy": 0.13116455525159837, "num_tokens": 18772913.0, "step": 8670 }, { "entropy": 6.5695160865783695, "epoch": 0.9283535769704104, "grad_norm": 1.5390625, "learning_rate": 0.0004923912566380118, "loss": 6.4058, "mean_token_accuracy": 0.12949569448828696, "num_tokens": 18784204.0, "step": 8675 }, { "entropy": 6.5018853664398195, "epoch": 0.9288886510781743, "grad_norm": 1.59375, "learning_rate": 0.0004923813947989336, "loss": 6.4945, "mean_token_accuracy": 0.12146714031696319, "num_tokens": 18795425.0, "step": 8680 }, { "entropy": 6.64973201751709, "epoch": 0.9294237251859383, "grad_norm": 1.796875, "learning_rate": 0.0004923715266829981, "loss": 6.4345, "mean_token_accuracy": 0.1265689440071583, "num_tokens": 18806850.0, "step": 8685 }, { "entropy": 6.641017436981201, "epoch": 0.9299587992937022, "grad_norm": 1.3671875, "learning_rate": 0.0004923616522904903, "loss": 6.3843, "mean_token_accuracy": 0.1314132884144783, "num_tokens": 18817272.0, "step": 8690 }, { "entropy": 6.597755098342896, "epoch": 0.930493873401466, "grad_norm": 1.7734375, "learning_rate": 0.0004923517716216953, "loss": 6.5085, "mean_token_accuracy": 0.12215960323810578, "num_tokens": 18827075.0, "step": 8695 }, { "entropy": 6.62264838218689, "epoch": 0.93102894750923, "grad_norm": 3.390625, "learning_rate": 0.0004923418846768985, "loss": 6.4421, "mean_token_accuracy": 0.12476111203432083, "num_tokens": 18837635.0, "step": 8700 }, { "entropy": 6.642798328399659, "epoch": 0.9315640216169939, "grad_norm": 1.5546875, "learning_rate": 0.0004923319914563852, "loss": 6.4275, "mean_token_accuracy": 0.13177590519189836, "num_tokens": 18848559.0, "step": 8705 }, { "entropy": 6.670168113708496, "epoch": 0.9320990957247579, "grad_norm": 1.8828125, "learning_rate": 0.0004923220919604413, "loss": 6.4681, "mean_token_accuracy": 0.1240908034145832, "num_tokens": 18859327.0, "step": 8710 }, { "entropy": 6.591074991226196, "epoch": 0.9326341698325218, "grad_norm": 1.5859375, "learning_rate": 0.0004923121861893525, "loss": 6.4075, "mean_token_accuracy": 0.1274246610701084, "num_tokens": 18869403.0, "step": 8715 }, { "entropy": 6.583342885971069, "epoch": 0.9331692439402858, "grad_norm": 1.7421875, "learning_rate": 0.0004923022741434049, "loss": 6.4379, "mean_token_accuracy": 0.12099683731794357, "num_tokens": 18879890.0, "step": 8720 }, { "entropy": 6.615302467346192, "epoch": 0.9337043180480497, "grad_norm": 1.9375, "learning_rate": 0.0004922923558228846, "loss": 6.4721, "mean_token_accuracy": 0.12057366967201233, "num_tokens": 18890361.0, "step": 8725 }, { "entropy": 6.579403305053711, "epoch": 0.9342393921558135, "grad_norm": 2.171875, "learning_rate": 0.0004922824312280781, "loss": 6.3868, "mean_token_accuracy": 0.13047217801213265, "num_tokens": 18902344.0, "step": 8730 }, { "entropy": 6.569160079956054, "epoch": 0.9347744662635775, "grad_norm": 1.890625, "learning_rate": 0.000492272500359272, "loss": 6.3847, "mean_token_accuracy": 0.13155013620853423, "num_tokens": 18911364.0, "step": 8735 }, { "entropy": 6.588317584991455, "epoch": 0.9353095403713414, "grad_norm": 1.7265625, "learning_rate": 0.0004922625632167529, "loss": 6.488, "mean_token_accuracy": 0.11757436320185662, "num_tokens": 18922254.0, "step": 8740 }, { "entropy": 6.664959383010864, "epoch": 0.9358446144791054, "grad_norm": 1.40625, "learning_rate": 0.0004922526198008078, "loss": 6.4452, "mean_token_accuracy": 0.1260450467467308, "num_tokens": 18932943.0, "step": 8745 }, { "entropy": 6.618773317337036, "epoch": 0.9363796885868693, "grad_norm": 1.578125, "learning_rate": 0.0004922426701117239, "loss": 6.5241, "mean_token_accuracy": 0.12151310667395591, "num_tokens": 18943523.0, "step": 8750 }, { "entropy": 6.609319257736206, "epoch": 0.9369147626946333, "grad_norm": 1.4296875, "learning_rate": 0.0004922327141497884, "loss": 6.508, "mean_token_accuracy": 0.1161932684481144, "num_tokens": 18955220.0, "step": 8755 }, { "entropy": 6.675847339630127, "epoch": 0.9374498368023971, "grad_norm": 1.5390625, "learning_rate": 0.0004922227519152888, "loss": 6.5421, "mean_token_accuracy": 0.12342641204595566, "num_tokens": 18966714.0, "step": 8760 }, { "entropy": 6.56199951171875, "epoch": 0.937984910910161, "grad_norm": 1.8203125, "learning_rate": 0.0004922127834085128, "loss": 6.3913, "mean_token_accuracy": 0.12646044045686722, "num_tokens": 18977998.0, "step": 8765 }, { "entropy": 6.567882633209228, "epoch": 0.938519985017925, "grad_norm": 1.9609375, "learning_rate": 0.0004922028086297481, "loss": 6.3818, "mean_token_accuracy": 0.127099596709013, "num_tokens": 18990210.0, "step": 8770 }, { "entropy": 6.6765382289886475, "epoch": 0.9390550591256889, "grad_norm": 1.5078125, "learning_rate": 0.0004921928275792828, "loss": 6.4995, "mean_token_accuracy": 0.12616633251309395, "num_tokens": 19000529.0, "step": 8775 }, { "entropy": 6.628943872451782, "epoch": 0.9395901332334529, "grad_norm": 2.6875, "learning_rate": 0.0004921828402574052, "loss": 6.4251, "mean_token_accuracy": 0.13188672289252282, "num_tokens": 19011386.0, "step": 8780 }, { "entropy": 6.550263404846191, "epoch": 0.9401252073412167, "grad_norm": 1.6640625, "learning_rate": 0.0004921728466644037, "loss": 6.4043, "mean_token_accuracy": 0.12869123220443726, "num_tokens": 19022196.0, "step": 8785 }, { "entropy": 6.533733606338501, "epoch": 0.9406602814489807, "grad_norm": 1.5625, "learning_rate": 0.0004921628468005666, "loss": 6.4358, "mean_token_accuracy": 0.13189285323023797, "num_tokens": 19033221.0, "step": 8790 }, { "entropy": 6.611112642288208, "epoch": 0.9411953555567446, "grad_norm": 1.4765625, "learning_rate": 0.000492152840666183, "loss": 6.4878, "mean_token_accuracy": 0.12585045173764228, "num_tokens": 19044953.0, "step": 8795 }, { "entropy": 6.711111831665039, "epoch": 0.9417304296645085, "grad_norm": 1.515625, "learning_rate": 0.0004921428282615415, "loss": 6.5018, "mean_token_accuracy": 0.12096112072467805, "num_tokens": 19055512.0, "step": 8800 }, { "entropy": 6.635407400131226, "epoch": 0.9422655037722725, "grad_norm": 1.5859375, "learning_rate": 0.0004921328095869313, "loss": 6.5027, "mean_token_accuracy": 0.1203993707895279, "num_tokens": 19065659.0, "step": 8805 }, { "entropy": 6.658339595794677, "epoch": 0.9428005778800364, "grad_norm": 1.8125, "learning_rate": 0.0004921227846426418, "loss": 6.433, "mean_token_accuracy": 0.1371263563632965, "num_tokens": 19076955.0, "step": 8810 }, { "entropy": 6.572042465209961, "epoch": 0.9433356519878003, "grad_norm": 1.625, "learning_rate": 0.0004921127534289624, "loss": 6.5106, "mean_token_accuracy": 0.11860493347048759, "num_tokens": 19088305.0, "step": 8815 }, { "entropy": 6.568140172958374, "epoch": 0.9438707260955642, "grad_norm": 1.65625, "learning_rate": 0.0004921027159461829, "loss": 6.5098, "mean_token_accuracy": 0.12441008612513542, "num_tokens": 19098046.0, "step": 8820 }, { "entropy": 6.6841308116912845, "epoch": 0.9444058002033282, "grad_norm": 1.75, "learning_rate": 0.0004920926721945927, "loss": 6.4226, "mean_token_accuracy": 0.12864333316683768, "num_tokens": 19109019.0, "step": 8825 }, { "entropy": 6.662001609802246, "epoch": 0.9449408743110921, "grad_norm": 1.484375, "learning_rate": 0.0004920826221744823, "loss": 6.4228, "mean_token_accuracy": 0.12871572971343995, "num_tokens": 19119624.0, "step": 8830 }, { "entropy": 6.636339902877808, "epoch": 0.945475948418856, "grad_norm": 1.4453125, "learning_rate": 0.0004920725658861417, "loss": 6.4741, "mean_token_accuracy": 0.12303901016712189, "num_tokens": 19130577.0, "step": 8835 }, { "entropy": 6.589366340637207, "epoch": 0.94601102252662, "grad_norm": 1.4140625, "learning_rate": 0.0004920625033298611, "loss": 6.3814, "mean_token_accuracy": 0.12903112173080444, "num_tokens": 19140254.0, "step": 8840 }, { "entropy": 6.569903993606568, "epoch": 0.9465460966343838, "grad_norm": 1.6015625, "learning_rate": 0.0004920524345059314, "loss": 6.4247, "mean_token_accuracy": 0.12659077122807502, "num_tokens": 19151357.0, "step": 8845 }, { "entropy": 6.6806480884552, "epoch": 0.9470811707421478, "grad_norm": 1.3515625, "learning_rate": 0.0004920423594146431, "loss": 6.4208, "mean_token_accuracy": 0.13126432448625563, "num_tokens": 19162069.0, "step": 8850 }, { "entropy": 6.546973991394043, "epoch": 0.9476162448499117, "grad_norm": 1.484375, "learning_rate": 0.0004920322780562872, "loss": 6.3129, "mean_token_accuracy": 0.13278165608644485, "num_tokens": 19172515.0, "step": 8855 }, { "entropy": 6.469416666030884, "epoch": 0.9481513189576757, "grad_norm": 1.3125, "learning_rate": 0.0004920221904311546, "loss": 6.3304, "mean_token_accuracy": 0.1281422682106495, "num_tokens": 19182450.0, "step": 8860 }, { "entropy": 6.6383439064025875, "epoch": 0.9486863930654396, "grad_norm": 1.53125, "learning_rate": 0.0004920120965395369, "loss": 6.5292, "mean_token_accuracy": 0.12080127596855164, "num_tokens": 19193833.0, "step": 8865 }, { "entropy": 6.678140926361084, "epoch": 0.9492214671732034, "grad_norm": 2.640625, "learning_rate": 0.0004920019963817253, "loss": 6.4762, "mean_token_accuracy": 0.1225566104054451, "num_tokens": 19204970.0, "step": 8870 }, { "entropy": 6.609140682220459, "epoch": 0.9497565412809674, "grad_norm": 1.7265625, "learning_rate": 0.0004919918899580117, "loss": 6.4331, "mean_token_accuracy": 0.1269660323858261, "num_tokens": 19215795.0, "step": 8875 }, { "entropy": 6.611617612838745, "epoch": 0.9502916153887313, "grad_norm": 1.8671875, "learning_rate": 0.0004919817772686876, "loss": 6.4649, "mean_token_accuracy": 0.11650814116001129, "num_tokens": 19226375.0, "step": 8880 }, { "entropy": 6.680630016326904, "epoch": 0.9508266894964953, "grad_norm": 1.8515625, "learning_rate": 0.0004919716583140453, "loss": 6.468, "mean_token_accuracy": 0.13823570236563681, "num_tokens": 19236066.0, "step": 8885 }, { "entropy": 6.529271268844605, "epoch": 0.9513617636042592, "grad_norm": 2.203125, "learning_rate": 0.0004919615330943769, "loss": 6.3353, "mean_token_accuracy": 0.1377024307847023, "num_tokens": 19246757.0, "step": 8890 }, { "entropy": 6.614864778518677, "epoch": 0.9518968377120232, "grad_norm": 1.4921875, "learning_rate": 0.0004919514016099746, "loss": 6.5, "mean_token_accuracy": 0.12600353509187698, "num_tokens": 19257875.0, "step": 8895 }, { "entropy": 6.6503785133361815, "epoch": 0.952431911819787, "grad_norm": 1.5, "learning_rate": 0.000491941263861131, "loss": 6.4781, "mean_token_accuracy": 0.125810706615448, "num_tokens": 19270236.0, "step": 8900 }, { "entropy": 6.588436317443848, "epoch": 0.9529669859275509, "grad_norm": 2.609375, "learning_rate": 0.000491931119848139, "loss": 6.4612, "mean_token_accuracy": 0.12382268756628037, "num_tokens": 19280877.0, "step": 8905 }, { "entropy": 6.525938892364502, "epoch": 0.9535020600353149, "grad_norm": 2.0, "learning_rate": 0.0004919209695712915, "loss": 6.3569, "mean_token_accuracy": 0.13123888075351714, "num_tokens": 19292852.0, "step": 8910 }, { "entropy": 6.636586141586304, "epoch": 0.9540371341430788, "grad_norm": 7.90625, "learning_rate": 0.0004919108130308814, "loss": 6.5481, "mean_token_accuracy": 0.11724269837141037, "num_tokens": 19305516.0, "step": 8915 }, { "entropy": 6.625235986709595, "epoch": 0.9545722082508428, "grad_norm": 1.4609375, "learning_rate": 0.0004919006502272019, "loss": 6.3795, "mean_token_accuracy": 0.13500440642237663, "num_tokens": 19315436.0, "step": 8920 }, { "entropy": 6.508727741241455, "epoch": 0.9551072823586066, "grad_norm": 1.453125, "learning_rate": 0.0004918904811605468, "loss": 6.4376, "mean_token_accuracy": 0.1264245629310608, "num_tokens": 19325393.0, "step": 8925 }, { "entropy": 6.5293982982635494, "epoch": 0.9556423564663706, "grad_norm": 1.71875, "learning_rate": 0.0004918803058312094, "loss": 6.4306, "mean_token_accuracy": 0.12973214834928512, "num_tokens": 19336722.0, "step": 8930 }, { "entropy": 6.7406854152679445, "epoch": 0.9561774305741345, "grad_norm": 1.796875, "learning_rate": 0.0004918701242394837, "loss": 6.5851, "mean_token_accuracy": 0.11917414888739586, "num_tokens": 19348406.0, "step": 8935 }, { "entropy": 6.599468946456909, "epoch": 0.9567125046818984, "grad_norm": 1.609375, "learning_rate": 0.0004918599363856637, "loss": 6.3923, "mean_token_accuracy": 0.1359890453517437, "num_tokens": 19359714.0, "step": 8940 }, { "entropy": 6.630413579940796, "epoch": 0.9572475787896624, "grad_norm": 1.765625, "learning_rate": 0.0004918497422700434, "loss": 6.4143, "mean_token_accuracy": 0.12925480753183366, "num_tokens": 19370833.0, "step": 8945 }, { "entropy": 6.610364055633545, "epoch": 0.9577826528974263, "grad_norm": 1.5078125, "learning_rate": 0.0004918395418929174, "loss": 6.4944, "mean_token_accuracy": 0.12302698343992233, "num_tokens": 19382098.0, "step": 8950 }, { "entropy": 6.624408388137818, "epoch": 0.9583177270051902, "grad_norm": 2.015625, "learning_rate": 0.00049182933525458, "loss": 6.4757, "mean_token_accuracy": 0.12349115982651711, "num_tokens": 19393595.0, "step": 8955 }, { "entropy": 6.640421295166016, "epoch": 0.9588528011129541, "grad_norm": 1.625, "learning_rate": 0.000491819122355326, "loss": 6.4125, "mean_token_accuracy": 0.13156883418560028, "num_tokens": 19405296.0, "step": 8960 }, { "entropy": 6.634973096847534, "epoch": 0.9593878752207181, "grad_norm": 1.4609375, "learning_rate": 0.0004918089031954503, "loss": 6.4472, "mean_token_accuracy": 0.12182890325784683, "num_tokens": 19415693.0, "step": 8965 }, { "entropy": 6.580959510803223, "epoch": 0.959922949328482, "grad_norm": 1.78125, "learning_rate": 0.000491798677775248, "loss": 6.4961, "mean_token_accuracy": 0.12708681151270868, "num_tokens": 19426140.0, "step": 8970 }, { "entropy": 6.693287134170532, "epoch": 0.9604580234362459, "grad_norm": 1.578125, "learning_rate": 0.0004917884460950144, "loss": 6.5297, "mean_token_accuracy": 0.1222914569079876, "num_tokens": 19437543.0, "step": 8975 }, { "entropy": 6.634545707702637, "epoch": 0.9609930975440099, "grad_norm": 1.390625, "learning_rate": 0.000491778208155045, "loss": 6.4384, "mean_token_accuracy": 0.1252037465572357, "num_tokens": 19447788.0, "step": 8980 }, { "entropy": 6.65233883857727, "epoch": 0.9615281716517737, "grad_norm": 1.796875, "learning_rate": 0.0004917679639556351, "loss": 6.4577, "mean_token_accuracy": 0.12330029979348182, "num_tokens": 19457587.0, "step": 8985 }, { "entropy": 6.6310333728790285, "epoch": 0.9620632457595377, "grad_norm": 1.8515625, "learning_rate": 0.0004917577134970808, "loss": 6.3826, "mean_token_accuracy": 0.1255684621632099, "num_tokens": 19467422.0, "step": 8990 }, { "entropy": 6.586491394042969, "epoch": 0.9625983198673016, "grad_norm": 1.609375, "learning_rate": 0.0004917474567796778, "loss": 6.4322, "mean_token_accuracy": 0.12582321763038634, "num_tokens": 19479037.0, "step": 8995 }, { "entropy": 6.5694173812866214, "epoch": 0.9631333939750656, "grad_norm": 1.5546875, "learning_rate": 0.0004917371938037226, "loss": 6.3603, "mean_token_accuracy": 0.1418306939303875, "num_tokens": 19489639.0, "step": 9000 }, { "epoch": 0.9631333939750656, "eval_entropy": 6.45046752675203, "eval_loss": 6.510419845581055, "eval_mean_token_accuracy": 0.12865163465319177, "eval_num_tokens": 19489639.0, "eval_runtime": 22.7134, "eval_samples_per_second": 1306.673, "eval_steps_per_second": 163.34, "step": 9000 }, { "entropy": 6.621413230895996, "epoch": 0.9636684680828295, "grad_norm": 1.5390625, "learning_rate": 0.0004917269245695114, "loss": 6.4786, "mean_token_accuracy": 0.12253487184643745, "num_tokens": 19500592.0, "step": 9005 }, { "entropy": 6.647409582138062, "epoch": 0.9642035421905933, "grad_norm": 1.6796875, "learning_rate": 0.0004917166490773406, "loss": 6.4926, "mean_token_accuracy": 0.12586249634623528, "num_tokens": 19510818.0, "step": 9010 }, { "entropy": 6.684140062332153, "epoch": 0.9647386162983573, "grad_norm": 1.6875, "learning_rate": 0.0004917063673275071, "loss": 6.5165, "mean_token_accuracy": 0.12470211908221245, "num_tokens": 19521283.0, "step": 9015 }, { "entropy": 6.619394111633301, "epoch": 0.9652736904061212, "grad_norm": 1.4765625, "learning_rate": 0.0004916960793203077, "loss": 6.3639, "mean_token_accuracy": 0.12334120795130729, "num_tokens": 19531799.0, "step": 9020 }, { "entropy": 6.572729444503784, "epoch": 0.9658087645138852, "grad_norm": 1.953125, "learning_rate": 0.0004916857850560394, "loss": 6.3481, "mean_token_accuracy": 0.13819931223988532, "num_tokens": 19542377.0, "step": 9025 }, { "entropy": 6.545560359954834, "epoch": 0.9663438386216491, "grad_norm": 1.953125, "learning_rate": 0.0004916754845349996, "loss": 6.3602, "mean_token_accuracy": 0.12935152798891067, "num_tokens": 19552654.0, "step": 9030 }, { "entropy": 6.592235040664673, "epoch": 0.9668789127294131, "grad_norm": 1.6796875, "learning_rate": 0.0004916651777574856, "loss": 6.4228, "mean_token_accuracy": 0.126383750885725, "num_tokens": 19563439.0, "step": 9035 }, { "entropy": 6.6113365650177, "epoch": 0.9674139868371769, "grad_norm": 2.140625, "learning_rate": 0.000491654864723795, "loss": 6.4451, "mean_token_accuracy": 0.12931786999106407, "num_tokens": 19574264.0, "step": 9040 }, { "entropy": 6.457882881164551, "epoch": 0.9679490609449408, "grad_norm": 1.9296875, "learning_rate": 0.0004916445454342256, "loss": 6.3121, "mean_token_accuracy": 0.14026236683130264, "num_tokens": 19585293.0, "step": 9045 }, { "entropy": 6.6120201587677006, "epoch": 0.9684841350527048, "grad_norm": 1.84375, "learning_rate": 0.0004916342198890754, "loss": 6.3589, "mean_token_accuracy": 0.1260765090584755, "num_tokens": 19594384.0, "step": 9050 }, { "entropy": 6.587450313568115, "epoch": 0.9690192091604687, "grad_norm": 1.765625, "learning_rate": 0.0004916238880886426, "loss": 6.4658, "mean_token_accuracy": 0.12822272032499313, "num_tokens": 19605144.0, "step": 9055 }, { "entropy": 6.570050573348999, "epoch": 0.9695542832682327, "grad_norm": 1.5234375, "learning_rate": 0.0004916135500332255, "loss": 6.3632, "mean_token_accuracy": 0.13149576559662818, "num_tokens": 19615885.0, "step": 9060 }, { "entropy": 6.556726026535034, "epoch": 0.9700893573759966, "grad_norm": 1.3203125, "learning_rate": 0.0004916032057231225, "loss": 6.3891, "mean_token_accuracy": 0.12656096294522284, "num_tokens": 19625749.0, "step": 9065 }, { "entropy": 6.5713582038879395, "epoch": 0.9706244314837605, "grad_norm": 1.5703125, "learning_rate": 0.0004915928551586324, "loss": 6.4627, "mean_token_accuracy": 0.11975899636745453, "num_tokens": 19638285.0, "step": 9070 }, { "entropy": 6.670734453201294, "epoch": 0.9711595055915244, "grad_norm": 2.171875, "learning_rate": 0.0004915824983400541, "loss": 6.5043, "mean_token_accuracy": 0.12083764597773552, "num_tokens": 19649697.0, "step": 9075 }, { "entropy": 6.689089012145996, "epoch": 0.9716945796992883, "grad_norm": 1.6640625, "learning_rate": 0.0004915721352676864, "loss": 6.4909, "mean_token_accuracy": 0.12309880778193474, "num_tokens": 19659668.0, "step": 9080 }, { "entropy": 6.5748748779296875, "epoch": 0.9722296538070523, "grad_norm": 1.4296875, "learning_rate": 0.0004915617659418289, "loss": 6.3587, "mean_token_accuracy": 0.12820305898785592, "num_tokens": 19670301.0, "step": 9085 }, { "entropy": 6.569716072082519, "epoch": 0.9727647279148162, "grad_norm": 1.765625, "learning_rate": 0.0004915513903627807, "loss": 6.4086, "mean_token_accuracy": 0.12332535162568092, "num_tokens": 19680926.0, "step": 9090 }, { "entropy": 6.497462606430053, "epoch": 0.9732998020225802, "grad_norm": 1.515625, "learning_rate": 0.0004915410085308417, "loss": 6.3911, "mean_token_accuracy": 0.13348619192838668, "num_tokens": 19691467.0, "step": 9095 }, { "entropy": 6.5884847164154055, "epoch": 0.973834876130344, "grad_norm": 1.875, "learning_rate": 0.0004915306204463115, "loss": 6.3966, "mean_token_accuracy": 0.12888719141483307, "num_tokens": 19701139.0, "step": 9100 }, { "entropy": 6.624570894241333, "epoch": 0.974369950238108, "grad_norm": 1.890625, "learning_rate": 0.00049152022610949, "loss": 6.4026, "mean_token_accuracy": 0.11958568394184113, "num_tokens": 19710628.0, "step": 9105 }, { "entropy": 6.628446578979492, "epoch": 0.9749050243458719, "grad_norm": 1.3359375, "learning_rate": 0.0004915098255206773, "loss": 6.4187, "mean_token_accuracy": 0.12999779507517814, "num_tokens": 19721824.0, "step": 9110 }, { "entropy": 6.6438335418701175, "epoch": 0.9754400984536358, "grad_norm": 1.5078125, "learning_rate": 0.000491499418680174, "loss": 6.436, "mean_token_accuracy": 0.12116050198674203, "num_tokens": 19732557.0, "step": 9115 }, { "entropy": 6.596571922302246, "epoch": 0.9759751725613998, "grad_norm": 1.328125, "learning_rate": 0.0004914890055882804, "loss": 6.4275, "mean_token_accuracy": 0.11970045194029807, "num_tokens": 19743436.0, "step": 9120 }, { "entropy": 6.541895818710327, "epoch": 0.9765102466691636, "grad_norm": 1.7109375, "learning_rate": 0.000491478586245297, "loss": 6.3416, "mean_token_accuracy": 0.13265810012817383, "num_tokens": 19755305.0, "step": 9125 }, { "entropy": 6.5737539768219, "epoch": 0.9770453207769276, "grad_norm": 3.484375, "learning_rate": 0.000491468160651525, "loss": 6.3464, "mean_token_accuracy": 0.13324624821543693, "num_tokens": 19766223.0, "step": 9130 }, { "entropy": 6.501796293258667, "epoch": 0.9775803948846915, "grad_norm": 1.484375, "learning_rate": 0.0004914577288072652, "loss": 6.4192, "mean_token_accuracy": 0.12503207176923753, "num_tokens": 19777268.0, "step": 9135 }, { "entropy": 6.616298341751099, "epoch": 0.9781154689924555, "grad_norm": 1.8828125, "learning_rate": 0.0004914472907128189, "loss": 6.5185, "mean_token_accuracy": 0.12278926596045495, "num_tokens": 19787875.0, "step": 9140 }, { "entropy": 6.621466541290284, "epoch": 0.9786505431002194, "grad_norm": 1.8046875, "learning_rate": 0.0004914368463684876, "loss": 6.4216, "mean_token_accuracy": 0.12677970305085182, "num_tokens": 19798919.0, "step": 9145 }, { "entropy": 6.5782746315002445, "epoch": 0.9791856172079834, "grad_norm": 1.796875, "learning_rate": 0.0004914263957745726, "loss": 6.4, "mean_token_accuracy": 0.13413854390382768, "num_tokens": 19809320.0, "step": 9150 }, { "entropy": 6.655309772491455, "epoch": 0.9797206913157472, "grad_norm": 1.9921875, "learning_rate": 0.0004914159389313759, "loss": 6.4725, "mean_token_accuracy": 0.12751644253730773, "num_tokens": 19819511.0, "step": 9155 }, { "entropy": 6.6865781307220455, "epoch": 0.9802557654235111, "grad_norm": 1.4296875, "learning_rate": 0.0004914054758391994, "loss": 6.503, "mean_token_accuracy": 0.11886487379670144, "num_tokens": 19830381.0, "step": 9160 }, { "entropy": 6.536502122879028, "epoch": 0.9807908395312751, "grad_norm": 1.515625, "learning_rate": 0.0004913950064983452, "loss": 6.3499, "mean_token_accuracy": 0.1259816624224186, "num_tokens": 19840806.0, "step": 9165 }, { "entropy": 6.508013916015625, "epoch": 0.981325913639039, "grad_norm": 1.3671875, "learning_rate": 0.0004913845309091156, "loss": 6.353, "mean_token_accuracy": 0.1387888766825199, "num_tokens": 19851095.0, "step": 9170 }, { "entropy": 6.542148590087891, "epoch": 0.981860987746803, "grad_norm": 1.390625, "learning_rate": 0.0004913740490718131, "loss": 6.3035, "mean_token_accuracy": 0.13859621435403824, "num_tokens": 19860235.0, "step": 9175 }, { "entropy": 6.554223346710205, "epoch": 0.9823960618545668, "grad_norm": 1.5078125, "learning_rate": 0.0004913635609867403, "loss": 6.4296, "mean_token_accuracy": 0.12288685292005538, "num_tokens": 19872264.0, "step": 9180 }, { "entropy": 6.637903070449829, "epoch": 0.9829311359623308, "grad_norm": 1.5625, "learning_rate": 0.0004913530666542001, "loss": 6.5237, "mean_token_accuracy": 0.12131133228540421, "num_tokens": 19883628.0, "step": 9185 }, { "entropy": 6.589421558380127, "epoch": 0.9834662100700947, "grad_norm": 1.3046875, "learning_rate": 0.0004913425660744955, "loss": 6.391, "mean_token_accuracy": 0.12491015046834945, "num_tokens": 19894624.0, "step": 9190 }, { "entropy": 6.6095788955688475, "epoch": 0.9840012841778586, "grad_norm": 1.3125, "learning_rate": 0.0004913320592479297, "loss": 6.407, "mean_token_accuracy": 0.12497465535998345, "num_tokens": 19904882.0, "step": 9195 }, { "entropy": 6.5338897705078125, "epoch": 0.9845363582856226, "grad_norm": 1.734375, "learning_rate": 0.0004913215461748061, "loss": 6.345, "mean_token_accuracy": 0.1354656219482422, "num_tokens": 19915344.0, "step": 9200 }, { "entropy": 6.583229351043701, "epoch": 0.9850714323933865, "grad_norm": 1.4296875, "learning_rate": 0.0004913110268554282, "loss": 6.4896, "mean_token_accuracy": 0.11940996870398521, "num_tokens": 19927527.0, "step": 9205 }, { "entropy": 6.597001934051514, "epoch": 0.9856065065011504, "grad_norm": 1.5, "learning_rate": 0.0004913005012900998, "loss": 6.4305, "mean_token_accuracy": 0.12389865592122078, "num_tokens": 19938893.0, "step": 9210 }, { "entropy": 6.603095245361328, "epoch": 0.9861415806089143, "grad_norm": 2.375, "learning_rate": 0.0004912899694791248, "loss": 6.4011, "mean_token_accuracy": 0.13044048398733138, "num_tokens": 19949297.0, "step": 9215 }, { "entropy": 6.545996809005738, "epoch": 0.9866766547166783, "grad_norm": 2.328125, "learning_rate": 0.0004912794314228074, "loss": 6.3656, "mean_token_accuracy": 0.12906254455447197, "num_tokens": 19959194.0, "step": 9220 }, { "entropy": 6.5977085590362545, "epoch": 0.9872117288244422, "grad_norm": 1.3984375, "learning_rate": 0.0004912688871214518, "loss": 6.4299, "mean_token_accuracy": 0.1233506016433239, "num_tokens": 19969896.0, "step": 9225 }, { "entropy": 6.582791805267334, "epoch": 0.9877468029322061, "grad_norm": 1.4609375, "learning_rate": 0.0004912583365753625, "loss": 6.4002, "mean_token_accuracy": 0.13166438192129135, "num_tokens": 19981505.0, "step": 9230 }, { "entropy": 6.570750141143799, "epoch": 0.9882818770399701, "grad_norm": 1.4140625, "learning_rate": 0.0004912477797848441, "loss": 6.3744, "mean_token_accuracy": 0.12995605915784836, "num_tokens": 19992770.0, "step": 9235 }, { "entropy": 6.570767831802368, "epoch": 0.9888169511477339, "grad_norm": 2.015625, "learning_rate": 0.0004912372167502014, "loss": 6.3774, "mean_token_accuracy": 0.13007648289203644, "num_tokens": 20003572.0, "step": 9240 }, { "entropy": 6.511661434173584, "epoch": 0.9893520252554979, "grad_norm": 1.75, "learning_rate": 0.0004912266474717394, "loss": 6.414, "mean_token_accuracy": 0.13034561201930045, "num_tokens": 20014500.0, "step": 9245 }, { "entropy": 6.571699094772339, "epoch": 0.9898870993632618, "grad_norm": 3.78125, "learning_rate": 0.0004912160719497635, "loss": 6.4233, "mean_token_accuracy": 0.12786453440785409, "num_tokens": 20025745.0, "step": 9250 }, { "entropy": 6.561632347106934, "epoch": 0.9904221734710258, "grad_norm": 1.7734375, "learning_rate": 0.0004912054901845788, "loss": 6.2986, "mean_token_accuracy": 0.1291518561542034, "num_tokens": 20036346.0, "step": 9255 }, { "entropy": 6.533315896987915, "epoch": 0.9909572475787897, "grad_norm": 2.671875, "learning_rate": 0.000491194902176491, "loss": 6.4616, "mean_token_accuracy": 0.12814752161502838, "num_tokens": 20048162.0, "step": 9260 }, { "entropy": 6.559889030456543, "epoch": 0.9914923216865535, "grad_norm": 1.8359375, "learning_rate": 0.0004911843079258057, "loss": 6.5379, "mean_token_accuracy": 0.11548658013343811, "num_tokens": 20058947.0, "step": 9265 }, { "entropy": 6.702791309356689, "epoch": 0.9920273957943175, "grad_norm": 1.40625, "learning_rate": 0.0004911737074328289, "loss": 6.4577, "mean_token_accuracy": 0.12429900467395782, "num_tokens": 20069282.0, "step": 9270 }, { "entropy": 6.621148729324341, "epoch": 0.9925624699020814, "grad_norm": 1.75, "learning_rate": 0.0004911631006978667, "loss": 6.4334, "mean_token_accuracy": 0.1263555720448494, "num_tokens": 20078347.0, "step": 9275 }, { "entropy": 6.581938457489014, "epoch": 0.9930975440098454, "grad_norm": 1.8125, "learning_rate": 0.0004911524877212254, "loss": 6.4294, "mean_token_accuracy": 0.12386744022369385, "num_tokens": 20089129.0, "step": 9280 }, { "entropy": 6.5865562915802, "epoch": 0.9936326181176093, "grad_norm": 1.7109375, "learning_rate": 0.0004911418685032114, "loss": 6.4354, "mean_token_accuracy": 0.12295543402433395, "num_tokens": 20101008.0, "step": 9285 }, { "entropy": 6.520455312728882, "epoch": 0.9941676922253733, "grad_norm": 1.8125, "learning_rate": 0.0004911312430441312, "loss": 6.4523, "mean_token_accuracy": 0.12910244837403298, "num_tokens": 20112272.0, "step": 9290 }, { "entropy": 6.548386669158935, "epoch": 0.9947027663331371, "grad_norm": 1.9453125, "learning_rate": 0.0004911206113442918, "loss": 6.3361, "mean_token_accuracy": 0.1382080502808094, "num_tokens": 20122814.0, "step": 9295 }, { "entropy": 6.514030599594117, "epoch": 0.995237840440901, "grad_norm": 2.046875, "learning_rate": 0.0004911099734040001, "loss": 6.3017, "mean_token_accuracy": 0.13078407868742942, "num_tokens": 20133169.0, "step": 9300 }, { "entropy": 6.61966381072998, "epoch": 0.995772914548665, "grad_norm": 2.59375, "learning_rate": 0.0004910993292235634, "loss": 6.4622, "mean_token_accuracy": 0.1179257057607174, "num_tokens": 20144355.0, "step": 9305 }, { "entropy": 6.63772873878479, "epoch": 0.9963079886564289, "grad_norm": 1.4765625, "learning_rate": 0.0004910886788032887, "loss": 6.4394, "mean_token_accuracy": 0.12375867813825607, "num_tokens": 20154486.0, "step": 9310 }, { "entropy": 6.580125761032105, "epoch": 0.9968430627641929, "grad_norm": 1.3671875, "learning_rate": 0.0004910780221434839, "loss": 6.4081, "mean_token_accuracy": 0.1301169626414776, "num_tokens": 20166359.0, "step": 9315 }, { "entropy": 6.582270002365112, "epoch": 0.9973781368719568, "grad_norm": 1.4765625, "learning_rate": 0.0004910673592444566, "loss": 6.4117, "mean_token_accuracy": 0.1259844958782196, "num_tokens": 20176469.0, "step": 9320 }, { "entropy": 6.605635404586792, "epoch": 0.9979132109797207, "grad_norm": 1.5546875, "learning_rate": 0.0004910566901065147, "loss": 6.4425, "mean_token_accuracy": 0.129373699426651, "num_tokens": 20188334.0, "step": 9325 }, { "entropy": 6.553080797195435, "epoch": 0.9984482850874846, "grad_norm": 2.1875, "learning_rate": 0.0004910460147299661, "loss": 6.3445, "mean_token_accuracy": 0.13515611216425896, "num_tokens": 20198594.0, "step": 9330 }, { "entropy": 6.559202575683594, "epoch": 0.9989833591952485, "grad_norm": 1.53125, "learning_rate": 0.0004910353331151193, "loss": 6.4468, "mean_token_accuracy": 0.12875296920537949, "num_tokens": 20209456.0, "step": 9335 }, { "entropy": 6.580421400070191, "epoch": 0.9995184333030125, "grad_norm": 1.4765625, "learning_rate": 0.0004910246452622825, "loss": 6.4296, "mean_token_accuracy": 0.13052132055163385, "num_tokens": 20219835.0, "step": 9340 }, { "entropy": 6.6216433842976885, "epoch": 1.0, "grad_norm": 3.6875, "learning_rate": 0.0004910139511717646, "loss": 6.4613, "mean_token_accuracy": 0.1245041439930598, "num_tokens": 20228258.0, "step": 9345 }, { "entropy": 6.589415073394775, "epoch": 1.0005350741077639, "grad_norm": 1.4765625, "learning_rate": 0.0004910032508438739, "loss": 6.3329, "mean_token_accuracy": 0.12991154193878174, "num_tokens": 20238875.0, "step": 9350 }, { "entropy": 6.589252042770386, "epoch": 1.0010701482155278, "grad_norm": 1.3671875, "learning_rate": 0.00049099254427892, "loss": 6.3593, "mean_token_accuracy": 0.12358415201306343, "num_tokens": 20249750.0, "step": 9355 }, { "entropy": 6.6447954177856445, "epoch": 1.0016052223232919, "grad_norm": 1.5625, "learning_rate": 0.0004909818314772116, "loss": 6.3993, "mean_token_accuracy": 0.12229088544845582, "num_tokens": 20259772.0, "step": 9360 }, { "entropy": 6.541646099090576, "epoch": 1.0021402964310557, "grad_norm": 1.5, "learning_rate": 0.0004909711124390582, "loss": 6.304, "mean_token_accuracy": 0.13751042485237122, "num_tokens": 20270230.0, "step": 9365 }, { "entropy": 6.444565153121948, "epoch": 1.0026753705388196, "grad_norm": 1.4765625, "learning_rate": 0.0004909603871647692, "loss": 6.1597, "mean_token_accuracy": 0.1495958887040615, "num_tokens": 20280317.0, "step": 9370 }, { "entropy": 6.489602088928223, "epoch": 1.0032104446465835, "grad_norm": 1.421875, "learning_rate": 0.0004909496556546544, "loss": 6.2537, "mean_token_accuracy": 0.13361010998487471, "num_tokens": 20291147.0, "step": 9375 }, { "entropy": 6.506109571456909, "epoch": 1.0037455187543476, "grad_norm": 1.7109375, "learning_rate": 0.0004909389179090238, "loss": 6.3279, "mean_token_accuracy": 0.13419800773262977, "num_tokens": 20301095.0, "step": 9380 }, { "entropy": 6.544373941421509, "epoch": 1.0042805928621115, "grad_norm": 2.46875, "learning_rate": 0.0004909281739281871, "loss": 6.327, "mean_token_accuracy": 0.13655227348208426, "num_tokens": 20311216.0, "step": 9385 }, { "entropy": 6.626815271377564, "epoch": 1.0048156669698753, "grad_norm": 1.7109375, "learning_rate": 0.0004909174237124548, "loss": 6.3962, "mean_token_accuracy": 0.1186282604932785, "num_tokens": 20321719.0, "step": 9390 }, { "entropy": 6.612100839614868, "epoch": 1.0053507410776392, "grad_norm": 1.6484375, "learning_rate": 0.0004909066672621372, "loss": 6.3819, "mean_token_accuracy": 0.1340535432100296, "num_tokens": 20331997.0, "step": 9395 }, { "entropy": 6.547275447845459, "epoch": 1.005885815185403, "grad_norm": 1.609375, "learning_rate": 0.0004908959045775449, "loss": 6.4149, "mean_token_accuracy": 0.126530484855175, "num_tokens": 20342973.0, "step": 9400 }, { "entropy": 6.510686302185059, "epoch": 1.0064208892931672, "grad_norm": 1.4453125, "learning_rate": 0.0004908851356589887, "loss": 6.3041, "mean_token_accuracy": 0.13099054470658303, "num_tokens": 20352652.0, "step": 9405 }, { "entropy": 6.583318471908569, "epoch": 1.006955963400931, "grad_norm": 1.421875, "learning_rate": 0.0004908743605067796, "loss": 6.3757, "mean_token_accuracy": 0.13030261918902397, "num_tokens": 20364577.0, "step": 9410 }, { "entropy": 6.587148284912109, "epoch": 1.007491037508695, "grad_norm": 1.6015625, "learning_rate": 0.0004908635791212287, "loss": 6.4133, "mean_token_accuracy": 0.1268289640545845, "num_tokens": 20375451.0, "step": 9415 }, { "entropy": 6.597857093811035, "epoch": 1.0080261116164588, "grad_norm": 1.9609375, "learning_rate": 0.0004908527915026472, "loss": 6.3258, "mean_token_accuracy": 0.1297917626798153, "num_tokens": 20385174.0, "step": 9420 }, { "entropy": 6.577202701568604, "epoch": 1.0085611857242227, "grad_norm": 1.6796875, "learning_rate": 0.0004908419976513467, "loss": 6.2784, "mean_token_accuracy": 0.13403301909565926, "num_tokens": 20395710.0, "step": 9425 }, { "entropy": 6.479523420333862, "epoch": 1.0090962598319868, "grad_norm": 1.484375, "learning_rate": 0.0004908311975676388, "loss": 6.2838, "mean_token_accuracy": 0.1319771207869053, "num_tokens": 20406572.0, "step": 9430 }, { "entropy": 6.497412395477295, "epoch": 1.0096313339397507, "grad_norm": 1.59375, "learning_rate": 0.0004908203912518355, "loss": 6.2668, "mean_token_accuracy": 0.14010654836893083, "num_tokens": 20417786.0, "step": 9435 }, { "entropy": 6.63450174331665, "epoch": 1.0101664080475146, "grad_norm": 2.1875, "learning_rate": 0.0004908095787042487, "loss": 6.3222, "mean_token_accuracy": 0.12953511774539947, "num_tokens": 20427680.0, "step": 9440 }, { "entropy": 6.517748641967773, "epoch": 1.0107014821552784, "grad_norm": 1.4921875, "learning_rate": 0.0004907987599251907, "loss": 6.3061, "mean_token_accuracy": 0.1292630322277546, "num_tokens": 20438640.0, "step": 9445 }, { "entropy": 6.547880840301514, "epoch": 1.0112365562630425, "grad_norm": 2.171875, "learning_rate": 0.0004907879349149737, "loss": 6.3195, "mean_token_accuracy": 0.1381923846900463, "num_tokens": 20449939.0, "step": 9450 }, { "entropy": 6.499249458312988, "epoch": 1.0117716303708064, "grad_norm": 2.15625, "learning_rate": 0.0004907771036739105, "loss": 6.2544, "mean_token_accuracy": 0.1351288966834545, "num_tokens": 20460845.0, "step": 9455 }, { "entropy": 6.507327079772949, "epoch": 1.0123067044785703, "grad_norm": 1.4140625, "learning_rate": 0.0004907662662023137, "loss": 6.3992, "mean_token_accuracy": 0.1253681182861328, "num_tokens": 20472407.0, "step": 9460 }, { "entropy": 6.543278932571411, "epoch": 1.0128417785863342, "grad_norm": 2.484375, "learning_rate": 0.0004907554225004962, "loss": 6.3928, "mean_token_accuracy": 0.12943721190094948, "num_tokens": 20483192.0, "step": 9465 }, { "entropy": 6.645859479904175, "epoch": 1.013376852694098, "grad_norm": 4.03125, "learning_rate": 0.0004907445725687714, "loss": 6.4457, "mean_token_accuracy": 0.12626103758811952, "num_tokens": 20493498.0, "step": 9470 }, { "entropy": 6.599184513092041, "epoch": 1.0139119268018622, "grad_norm": 1.8984375, "learning_rate": 0.0004907337164074523, "loss": 6.3523, "mean_token_accuracy": 0.13376811072230338, "num_tokens": 20503781.0, "step": 9475 }, { "entropy": 6.534925746917724, "epoch": 1.014447000909626, "grad_norm": 1.625, "learning_rate": 0.0004907228540168523, "loss": 6.4217, "mean_token_accuracy": 0.1251296542584896, "num_tokens": 20515142.0, "step": 9480 }, { "entropy": 6.585486030578613, "epoch": 1.01498207501739, "grad_norm": 1.609375, "learning_rate": 0.0004907119853972854, "loss": 6.3807, "mean_token_accuracy": 0.12869108244776725, "num_tokens": 20527568.0, "step": 9485 }, { "entropy": 6.50612735748291, "epoch": 1.0155171491251538, "grad_norm": 1.796875, "learning_rate": 0.0004907011105490651, "loss": 6.2661, "mean_token_accuracy": 0.1366148717701435, "num_tokens": 20538198.0, "step": 9490 }, { "entropy": 6.540985012054444, "epoch": 1.0160522232329177, "grad_norm": 1.3828125, "learning_rate": 0.0004906902294725056, "loss": 6.2605, "mean_token_accuracy": 0.13617482855916024, "num_tokens": 20549355.0, "step": 9495 }, { "entropy": 6.516599655151367, "epoch": 1.0165872973406818, "grad_norm": 1.53125, "learning_rate": 0.000490679342167921, "loss": 6.391, "mean_token_accuracy": 0.12939720898866652, "num_tokens": 20558984.0, "step": 9500 }, { "entropy": 6.594373750686645, "epoch": 1.0171223714484456, "grad_norm": 2.140625, "learning_rate": 0.0004906684486356258, "loss": 6.4106, "mean_token_accuracy": 0.12316248491406441, "num_tokens": 20570143.0, "step": 9505 }, { "entropy": 6.620317459106445, "epoch": 1.0176574455562095, "grad_norm": 1.421875, "learning_rate": 0.0004906575488759343, "loss": 6.386, "mean_token_accuracy": 0.12629298642277717, "num_tokens": 20580973.0, "step": 9510 }, { "entropy": 6.574526023864746, "epoch": 1.0181925196639734, "grad_norm": 1.359375, "learning_rate": 0.0004906466428891616, "loss": 6.3549, "mean_token_accuracy": 0.1243422269821167, "num_tokens": 20591473.0, "step": 9515 }, { "entropy": 6.545525693893433, "epoch": 1.0187275937717375, "grad_norm": 1.640625, "learning_rate": 0.0004906357306756222, "loss": 6.3223, "mean_token_accuracy": 0.1300820916891098, "num_tokens": 20602347.0, "step": 9520 }, { "entropy": 6.587276935577393, "epoch": 1.0192626678795014, "grad_norm": 1.5859375, "learning_rate": 0.0004906248122356315, "loss": 6.3774, "mean_token_accuracy": 0.13239624947309495, "num_tokens": 20613168.0, "step": 9525 }, { "entropy": 6.53687310218811, "epoch": 1.0197977419872652, "grad_norm": 13.375, "learning_rate": 0.0004906138875695045, "loss": 6.2746, "mean_token_accuracy": 0.13048959001898766, "num_tokens": 20623523.0, "step": 9530 }, { "entropy": 6.475817775726318, "epoch": 1.0203328160950291, "grad_norm": 1.4765625, "learning_rate": 0.0004906029566775569, "loss": 6.3045, "mean_token_accuracy": 0.13328663110733033, "num_tokens": 20634085.0, "step": 9535 }, { "entropy": 6.563428783416748, "epoch": 1.020867890202793, "grad_norm": 1.4453125, "learning_rate": 0.0004905920195601042, "loss": 6.3953, "mean_token_accuracy": 0.128290406614542, "num_tokens": 20644747.0, "step": 9540 }, { "entropy": 6.546395969390869, "epoch": 1.021402964310557, "grad_norm": 2.15625, "learning_rate": 0.0004905810762174622, "loss": 6.301, "mean_token_accuracy": 0.12163680791854858, "num_tokens": 20655704.0, "step": 9545 }, { "entropy": 6.570021915435791, "epoch": 1.021938038418321, "grad_norm": 1.4375, "learning_rate": 0.0004905701266499469, "loss": 6.3183, "mean_token_accuracy": 0.13585362434387208, "num_tokens": 20665844.0, "step": 9550 }, { "entropy": 6.592724752426148, "epoch": 1.0224731125260849, "grad_norm": 1.5859375, "learning_rate": 0.0004905591708578746, "loss": 6.4285, "mean_token_accuracy": 0.12019759565591812, "num_tokens": 20676921.0, "step": 9555 }, { "entropy": 6.617676448822022, "epoch": 1.0230081866338487, "grad_norm": 2.09375, "learning_rate": 0.0004905482088415615, "loss": 6.3741, "mean_token_accuracy": 0.12580151185393335, "num_tokens": 20688476.0, "step": 9560 }, { "entropy": 6.616480588912964, "epoch": 1.0235432607416126, "grad_norm": 2.03125, "learning_rate": 0.0004905372406013241, "loss": 6.3717, "mean_token_accuracy": 0.1287165805697441, "num_tokens": 20698588.0, "step": 9565 }, { "entropy": 6.528187704086304, "epoch": 1.0240783348493767, "grad_norm": 2.40625, "learning_rate": 0.0004905262661374792, "loss": 6.3716, "mean_token_accuracy": 0.13266078233718873, "num_tokens": 20709181.0, "step": 9570 }, { "entropy": 6.4876031398773195, "epoch": 1.0246134089571406, "grad_norm": 1.5703125, "learning_rate": 0.0004905152854503436, "loss": 6.2812, "mean_token_accuracy": 0.13735133409500122, "num_tokens": 20719724.0, "step": 9575 }, { "entropy": 6.579593276977539, "epoch": 1.0251484830649045, "grad_norm": 1.625, "learning_rate": 0.0004905042985402345, "loss": 6.3951, "mean_token_accuracy": 0.12752212211489677, "num_tokens": 20730548.0, "step": 9580 }, { "entropy": 6.5738812446594235, "epoch": 1.0256835571726683, "grad_norm": 1.4765625, "learning_rate": 0.000490493305407469, "loss": 6.3659, "mean_token_accuracy": 0.12526717260479928, "num_tokens": 20742124.0, "step": 9585 }, { "entropy": 6.638371753692627, "epoch": 1.0262186312804324, "grad_norm": 1.7265625, "learning_rate": 0.0004904823060523646, "loss": 6.4466, "mean_token_accuracy": 0.12435985058546066, "num_tokens": 20753313.0, "step": 9590 }, { "entropy": 6.6241978168487545, "epoch": 1.0267537053881963, "grad_norm": 1.46875, "learning_rate": 0.0004904713004752389, "loss": 6.3906, "mean_token_accuracy": 0.1303039439022541, "num_tokens": 20763539.0, "step": 9595 }, { "entropy": 6.558483028411866, "epoch": 1.0272887794959602, "grad_norm": 1.7109375, "learning_rate": 0.0004904602886764097, "loss": 6.4966, "mean_token_accuracy": 0.1237233228981495, "num_tokens": 20775849.0, "step": 9600 }, { "entropy": 6.523603439331055, "epoch": 1.027823853603724, "grad_norm": 1.375, "learning_rate": 0.0004904492706561948, "loss": 6.3649, "mean_token_accuracy": 0.12396602630615235, "num_tokens": 20787460.0, "step": 9605 }, { "entropy": 6.61628360748291, "epoch": 1.028358927711488, "grad_norm": 1.3671875, "learning_rate": 0.0004904382464149127, "loss": 6.2844, "mean_token_accuracy": 0.13349589630961417, "num_tokens": 20798478.0, "step": 9610 }, { "entropy": 6.609794998168946, "epoch": 1.028894001819252, "grad_norm": 1.6015625, "learning_rate": 0.0004904272159528814, "loss": 6.3822, "mean_token_accuracy": 0.12963185608386993, "num_tokens": 20809730.0, "step": 9615 }, { "entropy": 6.557106971740723, "epoch": 1.029429075927016, "grad_norm": 1.515625, "learning_rate": 0.0004904161792704195, "loss": 6.3541, "mean_token_accuracy": 0.13708847612142563, "num_tokens": 20821438.0, "step": 9620 }, { "entropy": 6.5635278701782225, "epoch": 1.0299641500347798, "grad_norm": 1.359375, "learning_rate": 0.0004904051363678457, "loss": 6.3385, "mean_token_accuracy": 0.12266776263713837, "num_tokens": 20832328.0, "step": 9625 }, { "entropy": 6.50533971786499, "epoch": 1.0304992241425437, "grad_norm": 1.3984375, "learning_rate": 0.0004903940872454789, "loss": 6.3222, "mean_token_accuracy": 0.1316038779914379, "num_tokens": 20843956.0, "step": 9630 }, { "entropy": 6.623028230667114, "epoch": 1.0310342982503076, "grad_norm": 2.578125, "learning_rate": 0.0004903830319036381, "loss": 6.3571, "mean_token_accuracy": 0.13210696056485177, "num_tokens": 20854578.0, "step": 9635 }, { "entropy": 6.519392490386963, "epoch": 1.0315693723580717, "grad_norm": 1.6640625, "learning_rate": 0.0004903719703426425, "loss": 6.2925, "mean_token_accuracy": 0.1291162833571434, "num_tokens": 20865190.0, "step": 9640 }, { "entropy": 6.5408073425292965, "epoch": 1.0321044464658355, "grad_norm": 1.4140625, "learning_rate": 0.0004903609025628115, "loss": 6.3185, "mean_token_accuracy": 0.12836557105183602, "num_tokens": 20875733.0, "step": 9645 }, { "entropy": 6.474796438217163, "epoch": 1.0326395205735994, "grad_norm": 1.59375, "learning_rate": 0.0004903498285644647, "loss": 6.3463, "mean_token_accuracy": 0.1265176258981228, "num_tokens": 20886900.0, "step": 9650 }, { "entropy": 6.55428729057312, "epoch": 1.0331745946813633, "grad_norm": 1.7421875, "learning_rate": 0.0004903387483479219, "loss": 6.393, "mean_token_accuracy": 0.12576237097382545, "num_tokens": 20898125.0, "step": 9655 }, { "entropy": 6.662082672119141, "epoch": 1.0337096687891274, "grad_norm": 1.4375, "learning_rate": 0.0004903276619135029, "loss": 6.4162, "mean_token_accuracy": 0.1248619869351387, "num_tokens": 20909788.0, "step": 9660 }, { "entropy": 6.666777038574219, "epoch": 1.0342447428968913, "grad_norm": 1.7578125, "learning_rate": 0.000490316569261528, "loss": 6.3944, "mean_token_accuracy": 0.12725045755505562, "num_tokens": 20921853.0, "step": 9665 }, { "entropy": 6.609588003158569, "epoch": 1.0347798170046552, "grad_norm": 1.359375, "learning_rate": 0.0004903054703923175, "loss": 6.3839, "mean_token_accuracy": 0.12214237824082375, "num_tokens": 20932574.0, "step": 9670 }, { "entropy": 6.505526494979859, "epoch": 1.035314891112419, "grad_norm": 1.3984375, "learning_rate": 0.0004902943653061916, "loss": 6.363, "mean_token_accuracy": 0.12515838891267778, "num_tokens": 20943458.0, "step": 9675 }, { "entropy": 6.551134777069092, "epoch": 1.035849965220183, "grad_norm": 1.421875, "learning_rate": 0.0004902832540034712, "loss": 6.3033, "mean_token_accuracy": 0.13630713000893593, "num_tokens": 20953213.0, "step": 9680 }, { "entropy": 6.527917861938477, "epoch": 1.036385039327947, "grad_norm": 1.25, "learning_rate": 0.0004902721364844773, "loss": 6.3385, "mean_token_accuracy": 0.12731200829148293, "num_tokens": 20963885.0, "step": 9685 }, { "entropy": 6.504400396347046, "epoch": 1.0369201134357109, "grad_norm": 1.734375, "learning_rate": 0.0004902610127495305, "loss": 6.3594, "mean_token_accuracy": 0.1349087744951248, "num_tokens": 20975529.0, "step": 9690 }, { "entropy": 6.549321889877319, "epoch": 1.0374551875434748, "grad_norm": 1.3125, "learning_rate": 0.0004902498827989523, "loss": 6.3136, "mean_token_accuracy": 0.13757401034235955, "num_tokens": 20985279.0, "step": 9695 }, { "entropy": 6.609812068939209, "epoch": 1.0379902616512386, "grad_norm": 1.1640625, "learning_rate": 0.0004902387466330639, "loss": 6.3633, "mean_token_accuracy": 0.13019999638199806, "num_tokens": 20995818.0, "step": 9700 }, { "entropy": 6.4939371109008786, "epoch": 1.0385253357590025, "grad_norm": 1.3203125, "learning_rate": 0.000490227604252187, "loss": 6.2606, "mean_token_accuracy": 0.13090986832976342, "num_tokens": 21006786.0, "step": 9705 }, { "entropy": 6.515184926986694, "epoch": 1.0390604098667666, "grad_norm": 1.453125, "learning_rate": 0.0004902164556566433, "loss": 6.328, "mean_token_accuracy": 0.13896063342690468, "num_tokens": 21017441.0, "step": 9710 }, { "entropy": 6.437628364562988, "epoch": 1.0395954839745305, "grad_norm": 1.296875, "learning_rate": 0.0004902053008467546, "loss": 6.2063, "mean_token_accuracy": 0.13861987590789795, "num_tokens": 21027812.0, "step": 9715 }, { "entropy": 6.534468650817871, "epoch": 1.0401305580822944, "grad_norm": 1.8359375, "learning_rate": 0.0004901941398228431, "loss": 6.3941, "mean_token_accuracy": 0.13089548125863076, "num_tokens": 21038960.0, "step": 9720 }, { "entropy": 6.597829294204712, "epoch": 1.0406656321900583, "grad_norm": 1.3984375, "learning_rate": 0.0004901829725852311, "loss": 6.3574, "mean_token_accuracy": 0.13462072163820266, "num_tokens": 21050467.0, "step": 9725 }, { "entropy": 6.52369499206543, "epoch": 1.0412007062978224, "grad_norm": 1.3046875, "learning_rate": 0.000490171799134241, "loss": 6.2819, "mean_token_accuracy": 0.12630092725157738, "num_tokens": 21061208.0, "step": 9730 }, { "entropy": 6.523263645172119, "epoch": 1.0417357804055862, "grad_norm": 1.78125, "learning_rate": 0.0004901606194701954, "loss": 6.3792, "mean_token_accuracy": 0.13332309275865556, "num_tokens": 21072872.0, "step": 9735 }, { "entropy": 6.555621576309204, "epoch": 1.04227085451335, "grad_norm": 1.40625, "learning_rate": 0.0004901494335934172, "loss": 6.3524, "mean_token_accuracy": 0.13275277987122536, "num_tokens": 21084878.0, "step": 9740 }, { "entropy": 6.6262726306915285, "epoch": 1.042805928621114, "grad_norm": 1.765625, "learning_rate": 0.0004901382415042293, "loss": 6.3732, "mean_token_accuracy": 0.12680527493357657, "num_tokens": 21095289.0, "step": 9745 }, { "entropy": 6.616176795959473, "epoch": 1.0433410027288779, "grad_norm": 1.640625, "learning_rate": 0.0004901270432029549, "loss": 6.3371, "mean_token_accuracy": 0.1305427983403206, "num_tokens": 21106077.0, "step": 9750 }, { "entropy": 6.423315238952637, "epoch": 1.043876076836642, "grad_norm": 1.34375, "learning_rate": 0.0004901158386899174, "loss": 6.2562, "mean_token_accuracy": 0.13529875352978707, "num_tokens": 21116548.0, "step": 9755 }, { "entropy": 6.516621541976929, "epoch": 1.0444111509444058, "grad_norm": 1.5078125, "learning_rate": 0.0004901046279654402, "loss": 6.2808, "mean_token_accuracy": 0.13983293026685714, "num_tokens": 21126163.0, "step": 9760 }, { "entropy": 6.61842679977417, "epoch": 1.0449462250521697, "grad_norm": 1.546875, "learning_rate": 0.0004900934110298471, "loss": 6.385, "mean_token_accuracy": 0.12512520104646682, "num_tokens": 21136830.0, "step": 9765 }, { "entropy": 6.571760177612305, "epoch": 1.0454812991599336, "grad_norm": 1.5859375, "learning_rate": 0.0004900821878834621, "loss": 6.3308, "mean_token_accuracy": 0.1342024587094784, "num_tokens": 21146793.0, "step": 9770 }, { "entropy": 6.573628664016724, "epoch": 1.0460163732676975, "grad_norm": 1.4375, "learning_rate": 0.000490070958526609, "loss": 6.3792, "mean_token_accuracy": 0.13071634098887444, "num_tokens": 21156799.0, "step": 9775 }, { "entropy": 6.540488243103027, "epoch": 1.0465514473754616, "grad_norm": 1.4453125, "learning_rate": 0.0004900597229596124, "loss": 6.3793, "mean_token_accuracy": 0.12690124064683914, "num_tokens": 21167757.0, "step": 9780 }, { "entropy": 6.6183329105377195, "epoch": 1.0470865214832255, "grad_norm": 2.046875, "learning_rate": 0.0004900484811827963, "loss": 6.3829, "mean_token_accuracy": 0.12883857786655425, "num_tokens": 21178832.0, "step": 9785 }, { "entropy": 6.58182463645935, "epoch": 1.0476215955909893, "grad_norm": 1.3203125, "learning_rate": 0.0004900372331964856, "loss": 6.2876, "mean_token_accuracy": 0.13159751370549203, "num_tokens": 21189637.0, "step": 9790 }, { "entropy": 6.507457113265991, "epoch": 1.0481566696987532, "grad_norm": 1.6484375, "learning_rate": 0.000490025979001005, "loss": 6.321, "mean_token_accuracy": 0.13030252754688262, "num_tokens": 21200194.0, "step": 9795 }, { "entropy": 6.490743494033813, "epoch": 1.0486917438065173, "grad_norm": 2.484375, "learning_rate": 0.0004900147185966795, "loss": 6.2775, "mean_token_accuracy": 0.13105009645223617, "num_tokens": 21211405.0, "step": 9800 }, { "entropy": 6.59748592376709, "epoch": 1.0492268179142812, "grad_norm": 2.15625, "learning_rate": 0.0004900034519838342, "loss": 6.3228, "mean_token_accuracy": 0.12743570655584335, "num_tokens": 21222722.0, "step": 9805 }, { "entropy": 6.541789150238037, "epoch": 1.049761892022045, "grad_norm": 1.734375, "learning_rate": 0.0004899921791627945, "loss": 6.2748, "mean_token_accuracy": 0.13372819796204566, "num_tokens": 21233510.0, "step": 9810 }, { "entropy": 6.541411399841309, "epoch": 1.050296966129809, "grad_norm": 2.4375, "learning_rate": 0.0004899809001338857, "loss": 6.4169, "mean_token_accuracy": 0.12047207728028297, "num_tokens": 21243235.0, "step": 9815 }, { "entropy": 6.536032104492188, "epoch": 1.0508320402375728, "grad_norm": 1.453125, "learning_rate": 0.0004899696148974338, "loss": 6.3156, "mean_token_accuracy": 0.13035102561116219, "num_tokens": 21254680.0, "step": 9820 }, { "entropy": 6.51158652305603, "epoch": 1.051367114345337, "grad_norm": 1.8046875, "learning_rate": 0.0004899583234537644, "loss": 6.3057, "mean_token_accuracy": 0.13114088550209999, "num_tokens": 21265116.0, "step": 9825 }, { "entropy": 6.5533318519592285, "epoch": 1.0519021884531008, "grad_norm": 1.5078125, "learning_rate": 0.0004899470258032034, "loss": 6.3005, "mean_token_accuracy": 0.13146693632006645, "num_tokens": 21277066.0, "step": 9830 }, { "entropy": 6.582359695434571, "epoch": 1.0524372625608647, "grad_norm": 1.6484375, "learning_rate": 0.0004899357219460775, "loss": 6.3492, "mean_token_accuracy": 0.13322116136550904, "num_tokens": 21287332.0, "step": 9835 }, { "entropy": 6.456721401214599, "epoch": 1.0529723366686286, "grad_norm": 1.609375, "learning_rate": 0.0004899244118827128, "loss": 6.3403, "mean_token_accuracy": 0.13221352621912957, "num_tokens": 21298377.0, "step": 9840 }, { "entropy": 6.571355152130127, "epoch": 1.0535074107763924, "grad_norm": 1.4375, "learning_rate": 0.0004899130956134358, "loss": 6.3453, "mean_token_accuracy": 0.13347491770982742, "num_tokens": 21309966.0, "step": 9845 }, { "entropy": 6.511975812911987, "epoch": 1.0540424848841565, "grad_norm": 1.3984375, "learning_rate": 0.0004899017731385735, "loss": 6.2418, "mean_token_accuracy": 0.13985393643379213, "num_tokens": 21320399.0, "step": 9850 }, { "entropy": 6.545067501068115, "epoch": 1.0545775589919204, "grad_norm": 1.421875, "learning_rate": 0.0004898904444584527, "loss": 6.3461, "mean_token_accuracy": 0.1301308900117874, "num_tokens": 21331716.0, "step": 9855 }, { "entropy": 6.575881576538086, "epoch": 1.0551126330996843, "grad_norm": 1.546875, "learning_rate": 0.0004898791095734004, "loss": 6.3749, "mean_token_accuracy": 0.12489353939890861, "num_tokens": 21341664.0, "step": 9860 }, { "entropy": 6.569723415374756, "epoch": 1.0556477072074482, "grad_norm": 1.8515625, "learning_rate": 0.000489867768483744, "loss": 6.338, "mean_token_accuracy": 0.12841244488954545, "num_tokens": 21352220.0, "step": 9865 }, { "entropy": 6.63442759513855, "epoch": 1.0561827813152123, "grad_norm": 1.9921875, "learning_rate": 0.0004898564211898111, "loss": 6.4478, "mean_token_accuracy": 0.12361843287944793, "num_tokens": 21363947.0, "step": 9870 }, { "entropy": 6.601479339599609, "epoch": 1.0567178554229761, "grad_norm": 2.140625, "learning_rate": 0.0004898450676919291, "loss": 6.3254, "mean_token_accuracy": 0.13290739953517913, "num_tokens": 21374011.0, "step": 9875 }, { "entropy": 6.56652512550354, "epoch": 1.05725292953074, "grad_norm": 1.640625, "learning_rate": 0.000489833707990426, "loss": 6.3864, "mean_token_accuracy": 0.1321233369410038, "num_tokens": 21384232.0, "step": 9880 }, { "entropy": 6.523163557052612, "epoch": 1.057788003638504, "grad_norm": 1.8671875, "learning_rate": 0.0004898223420856298, "loss": 6.3445, "mean_token_accuracy": 0.12886636033654214, "num_tokens": 21395928.0, "step": 9885 }, { "entropy": 6.558263635635376, "epoch": 1.0583230777462678, "grad_norm": 1.484375, "learning_rate": 0.0004898109699778686, "loss": 6.3513, "mean_token_accuracy": 0.1277891717851162, "num_tokens": 21406391.0, "step": 9890 }, { "entropy": 6.548861646652222, "epoch": 1.0588581518540319, "grad_norm": 1.5234375, "learning_rate": 0.000489799591667471, "loss": 6.398, "mean_token_accuracy": 0.1259136602282524, "num_tokens": 21417859.0, "step": 9895 }, { "entropy": 6.499192619323731, "epoch": 1.0593932259617957, "grad_norm": 1.8125, "learning_rate": 0.0004897882071547651, "loss": 6.2456, "mean_token_accuracy": 0.13391533121466637, "num_tokens": 21428284.0, "step": 9900 }, { "entropy": 6.542983675003052, "epoch": 1.0599283000695596, "grad_norm": 1.515625, "learning_rate": 0.0004897768164400801, "loss": 6.3857, "mean_token_accuracy": 0.12659377828240395, "num_tokens": 21439610.0, "step": 9905 }, { "entropy": 6.6037352085113525, "epoch": 1.0604633741773235, "grad_norm": 1.328125, "learning_rate": 0.0004897654195237446, "loss": 6.4036, "mean_token_accuracy": 0.1266575463116169, "num_tokens": 21449319.0, "step": 9910 }, { "entropy": 6.607220649719238, "epoch": 1.0609984482850874, "grad_norm": 2.078125, "learning_rate": 0.0004897540164060879, "loss": 6.3995, "mean_token_accuracy": 0.13648231849074363, "num_tokens": 21459851.0, "step": 9915 }, { "entropy": 6.528581809997559, "epoch": 1.0615335223928515, "grad_norm": 1.6953125, "learning_rate": 0.0004897426070874392, "loss": 6.3445, "mean_token_accuracy": 0.13578662425279617, "num_tokens": 21469717.0, "step": 9920 }, { "entropy": 6.5819432735443115, "epoch": 1.0620685965006154, "grad_norm": 1.578125, "learning_rate": 0.0004897311915681278, "loss": 6.4526, "mean_token_accuracy": 0.12497929334640503, "num_tokens": 21480815.0, "step": 9925 }, { "entropy": 6.634674501419068, "epoch": 1.0626036706083792, "grad_norm": 1.7578125, "learning_rate": 0.0004897197698484834, "loss": 6.3432, "mean_token_accuracy": 0.129038904607296, "num_tokens": 21492000.0, "step": 9930 }, { "entropy": 6.515308094024658, "epoch": 1.0631387447161431, "grad_norm": 1.53125, "learning_rate": 0.0004897083419288358, "loss": 6.329, "mean_token_accuracy": 0.12596094235777855, "num_tokens": 21502006.0, "step": 9935 }, { "entropy": 6.500771331787109, "epoch": 1.0636738188239072, "grad_norm": 1.5703125, "learning_rate": 0.000489696907809515, "loss": 6.362, "mean_token_accuracy": 0.13541009426116943, "num_tokens": 21513066.0, "step": 9940 }, { "entropy": 6.547796964645386, "epoch": 1.064208892931671, "grad_norm": 1.84375, "learning_rate": 0.0004896854674908512, "loss": 6.3618, "mean_token_accuracy": 0.1268548533320427, "num_tokens": 21524853.0, "step": 9945 }, { "entropy": 6.571991872787476, "epoch": 1.064743967039435, "grad_norm": 1.6640625, "learning_rate": 0.0004896740209731746, "loss": 6.2734, "mean_token_accuracy": 0.13072544783353807, "num_tokens": 21536497.0, "step": 9950 }, { "entropy": 6.4796923160552975, "epoch": 1.0652790411471988, "grad_norm": 1.625, "learning_rate": 0.0004896625682568159, "loss": 6.298, "mean_token_accuracy": 0.13346593901515008, "num_tokens": 21546213.0, "step": 9955 }, { "entropy": 6.449840402603149, "epoch": 1.0658141152549627, "grad_norm": 1.578125, "learning_rate": 0.0004896511093421057, "loss": 6.2963, "mean_token_accuracy": 0.13981223478913307, "num_tokens": 21556990.0, "step": 9960 }, { "entropy": 6.532204484939575, "epoch": 1.0663491893627268, "grad_norm": 1.6953125, "learning_rate": 0.0004896396442293749, "loss": 6.3005, "mean_token_accuracy": 0.1295848861336708, "num_tokens": 21567567.0, "step": 9965 }, { "entropy": 6.556431913375855, "epoch": 1.0668842634704907, "grad_norm": 1.40625, "learning_rate": 0.0004896281729189544, "loss": 6.3226, "mean_token_accuracy": 0.1309622846543789, "num_tokens": 21577457.0, "step": 9970 }, { "entropy": 6.5115550518035885, "epoch": 1.0674193375782546, "grad_norm": 1.46875, "learning_rate": 0.0004896166954111758, "loss": 6.3167, "mean_token_accuracy": 0.13812632784247397, "num_tokens": 21588173.0, "step": 9975 }, { "entropy": 6.543576431274414, "epoch": 1.0679544116860185, "grad_norm": 1.5703125, "learning_rate": 0.00048960521170637, "loss": 6.3571, "mean_token_accuracy": 0.12762073799967766, "num_tokens": 21599154.0, "step": 9980 }, { "entropy": 6.546718549728394, "epoch": 1.0684894857937826, "grad_norm": 1.5078125, "learning_rate": 0.0004895937218048692, "loss": 6.4033, "mean_token_accuracy": 0.12653964534401893, "num_tokens": 21610134.0, "step": 9985 }, { "entropy": 6.515305852890014, "epoch": 1.0690245599015464, "grad_norm": 1.4296875, "learning_rate": 0.0004895822257070046, "loss": 6.2694, "mean_token_accuracy": 0.131786098331213, "num_tokens": 21619989.0, "step": 9990 }, { "entropy": 6.557422780990601, "epoch": 1.0695596340093103, "grad_norm": 1.796875, "learning_rate": 0.0004895707234131084, "loss": 6.3205, "mean_token_accuracy": 0.1355228066444397, "num_tokens": 21632707.0, "step": 9995 }, { "entropy": 6.578034830093384, "epoch": 1.0700947081170742, "grad_norm": 1.4921875, "learning_rate": 0.0004895592149235128, "loss": 6.2954, "mean_token_accuracy": 0.1315545454621315, "num_tokens": 21643001.0, "step": 10000 }, { "entropy": 6.560757112503052, "epoch": 1.070629782224838, "grad_norm": 1.375, "learning_rate": 0.00048954770023855, "loss": 6.366, "mean_token_accuracy": 0.12268463671207427, "num_tokens": 21653425.0, "step": 10005 }, { "entropy": 6.578395557403565, "epoch": 1.0711648563326022, "grad_norm": 1.4140625, "learning_rate": 0.0004895361793585525, "loss": 6.3953, "mean_token_accuracy": 0.1271112874150276, "num_tokens": 21664212.0, "step": 10010 }, { "entropy": 6.552493667602539, "epoch": 1.071699930440366, "grad_norm": 1.8046875, "learning_rate": 0.0004895246522838529, "loss": 6.382, "mean_token_accuracy": 0.12997190952301024, "num_tokens": 21675564.0, "step": 10015 }, { "entropy": 6.538548183441162, "epoch": 1.07223500454813, "grad_norm": 1.5078125, "learning_rate": 0.0004895131190147842, "loss": 6.3603, "mean_token_accuracy": 0.13544045239686966, "num_tokens": 21686225.0, "step": 10020 }, { "entropy": 6.533993816375732, "epoch": 1.0727700786558938, "grad_norm": 1.828125, "learning_rate": 0.0004895015795516793, "loss": 6.287, "mean_token_accuracy": 0.13008347228169442, "num_tokens": 21697479.0, "step": 10025 }, { "entropy": 6.575708866119385, "epoch": 1.0733051527636577, "grad_norm": 1.96875, "learning_rate": 0.0004894900338948714, "loss": 6.3983, "mean_token_accuracy": 0.12802261039614676, "num_tokens": 21708496.0, "step": 10030 }, { "entropy": 6.565115308761596, "epoch": 1.0738402268714218, "grad_norm": 1.6171875, "learning_rate": 0.0004894784820446939, "loss": 6.2653, "mean_token_accuracy": 0.1375642567873001, "num_tokens": 21718290.0, "step": 10035 }, { "entropy": 6.503127574920654, "epoch": 1.0743753009791857, "grad_norm": 2.015625, "learning_rate": 0.0004894669240014804, "loss": 6.2699, "mean_token_accuracy": 0.13177290111780166, "num_tokens": 21729185.0, "step": 10040 }, { "entropy": 6.518919229507446, "epoch": 1.0749103750869495, "grad_norm": 1.6484375, "learning_rate": 0.0004894553597655646, "loss": 6.3631, "mean_token_accuracy": 0.12472319975495338, "num_tokens": 21740787.0, "step": 10045 }, { "entropy": 6.650041389465332, "epoch": 1.0754454491947134, "grad_norm": 1.7265625, "learning_rate": 0.0004894437893372804, "loss": 6.4041, "mean_token_accuracy": 0.12599473372101783, "num_tokens": 21751804.0, "step": 10050 }, { "entropy": 6.662219142913818, "epoch": 1.0759805233024773, "grad_norm": 1.7890625, "learning_rate": 0.000489432212716962, "loss": 6.3336, "mean_token_accuracy": 0.12913210690021515, "num_tokens": 21762730.0, "step": 10055 }, { "entropy": 6.495162582397461, "epoch": 1.0765155974102414, "grad_norm": 1.921875, "learning_rate": 0.0004894206299049436, "loss": 6.3602, "mean_token_accuracy": 0.12958017587661744, "num_tokens": 21773470.0, "step": 10060 }, { "entropy": 6.566137409210205, "epoch": 1.0770506715180053, "grad_norm": 1.5390625, "learning_rate": 0.0004894090409015595, "loss": 6.3447, "mean_token_accuracy": 0.12679021656513215, "num_tokens": 21783385.0, "step": 10065 }, { "entropy": 6.519651746749878, "epoch": 1.0775857456257691, "grad_norm": 1.8125, "learning_rate": 0.0004893974457071445, "loss": 6.3623, "mean_token_accuracy": 0.1318201705813408, "num_tokens": 21794857.0, "step": 10070 }, { "entropy": 6.582787752151489, "epoch": 1.078120819733533, "grad_norm": 1.4609375, "learning_rate": 0.0004893858443220335, "loss": 6.3485, "mean_token_accuracy": 0.12606494948267938, "num_tokens": 21804296.0, "step": 10075 }, { "entropy": 6.57329306602478, "epoch": 1.0786558938412971, "grad_norm": 1.5234375, "learning_rate": 0.0004893742367465613, "loss": 6.36, "mean_token_accuracy": 0.12605967298150061, "num_tokens": 21815899.0, "step": 10080 }, { "entropy": 6.566723203659057, "epoch": 1.079190967949061, "grad_norm": 1.609375, "learning_rate": 0.0004893626229810631, "loss": 6.3356, "mean_token_accuracy": 0.1350504457950592, "num_tokens": 21825964.0, "step": 10085 }, { "entropy": 6.5852015018463135, "epoch": 1.0797260420568249, "grad_norm": 1.4921875, "learning_rate": 0.0004893510030258743, "loss": 6.4213, "mean_token_accuracy": 0.12873302549123763, "num_tokens": 21836656.0, "step": 10090 }, { "entropy": 6.59387173652649, "epoch": 1.0802611161645888, "grad_norm": 1.8515625, "learning_rate": 0.0004893393768813305, "loss": 6.421, "mean_token_accuracy": 0.12757074385881423, "num_tokens": 21847658.0, "step": 10095 }, { "entropy": 6.651180601119995, "epoch": 1.0807961902723526, "grad_norm": 1.4453125, "learning_rate": 0.0004893277445477673, "loss": 6.3916, "mean_token_accuracy": 0.12199634462594985, "num_tokens": 21858338.0, "step": 10100 }, { "entropy": 6.55932469367981, "epoch": 1.0813312643801167, "grad_norm": 1.703125, "learning_rate": 0.0004893161060255206, "loss": 6.2639, "mean_token_accuracy": 0.13296918123960494, "num_tokens": 21870656.0, "step": 10105 }, { "entropy": 6.572396087646484, "epoch": 1.0818663384878806, "grad_norm": 1.78125, "learning_rate": 0.0004893044613149263, "loss": 6.3623, "mean_token_accuracy": 0.13754768669605255, "num_tokens": 21881806.0, "step": 10110 }, { "entropy": 6.48524956703186, "epoch": 1.0824014125956445, "grad_norm": 1.515625, "learning_rate": 0.0004892928104163209, "loss": 6.2774, "mean_token_accuracy": 0.13149532154202462, "num_tokens": 21892277.0, "step": 10115 }, { "entropy": 6.491385459899902, "epoch": 1.0829364867034084, "grad_norm": 1.6875, "learning_rate": 0.0004892811533300407, "loss": 6.2985, "mean_token_accuracy": 0.13023179545998573, "num_tokens": 21903509.0, "step": 10120 }, { "entropy": 6.581822729110717, "epoch": 1.0834715608111725, "grad_norm": 4.3125, "learning_rate": 0.0004892694900564223, "loss": 6.406, "mean_token_accuracy": 0.12440016642212867, "num_tokens": 21914308.0, "step": 10125 }, { "entropy": 6.546678495407105, "epoch": 1.0840066349189363, "grad_norm": 2.890625, "learning_rate": 0.0004892578205958025, "loss": 6.2881, "mean_token_accuracy": 0.14137799441814422, "num_tokens": 21924302.0, "step": 10130 }, { "entropy": 6.530106067657471, "epoch": 1.0845417090267002, "grad_norm": 1.734375, "learning_rate": 0.0004892461449485182, "loss": 6.3636, "mean_token_accuracy": 0.12199231162667275, "num_tokens": 21935066.0, "step": 10135 }, { "entropy": 6.544826984405518, "epoch": 1.085076783134464, "grad_norm": 1.3984375, "learning_rate": 0.0004892344631149066, "loss": 6.2529, "mean_token_accuracy": 0.1391059972345829, "num_tokens": 21945798.0, "step": 10140 }, { "entropy": 6.537466096878052, "epoch": 1.085611857242228, "grad_norm": 2.796875, "learning_rate": 0.000489222775095305, "loss": 6.3677, "mean_token_accuracy": 0.12511541321873665, "num_tokens": 21955667.0, "step": 10145 }, { "entropy": 6.5176506519317625, "epoch": 1.086146931349992, "grad_norm": 1.828125, "learning_rate": 0.0004892110808900509, "loss": 6.3526, "mean_token_accuracy": 0.12824971377849578, "num_tokens": 21966107.0, "step": 10150 }, { "entropy": 6.5623456001281735, "epoch": 1.086682005457756, "grad_norm": 1.8359375, "learning_rate": 0.0004891993804994818, "loss": 6.3372, "mean_token_accuracy": 0.13260870128870011, "num_tokens": 21976408.0, "step": 10155 }, { "entropy": 6.648627758026123, "epoch": 1.0872170795655198, "grad_norm": 2.125, "learning_rate": 0.0004891876739239358, "loss": 6.3238, "mean_token_accuracy": 0.13422903493046762, "num_tokens": 21986481.0, "step": 10160 }, { "entropy": 6.541556930541992, "epoch": 1.0877521536732837, "grad_norm": 1.6953125, "learning_rate": 0.0004891759611637508, "loss": 6.3798, "mean_token_accuracy": 0.1273925334215164, "num_tokens": 21997554.0, "step": 10165 }, { "entropy": 6.594119644165039, "epoch": 1.0882872277810476, "grad_norm": 1.6328125, "learning_rate": 0.000489164242219265, "loss": 6.4354, "mean_token_accuracy": 0.12317250669002533, "num_tokens": 22009048.0, "step": 10170 }, { "entropy": 6.651549434661865, "epoch": 1.0888223018888117, "grad_norm": 2.265625, "learning_rate": 0.0004891525170908169, "loss": 6.4482, "mean_token_accuracy": 0.1263985179364681, "num_tokens": 22020625.0, "step": 10175 }, { "entropy": 6.634617900848388, "epoch": 1.0893573759965756, "grad_norm": 1.765625, "learning_rate": 0.0004891407857787448, "loss": 6.3263, "mean_token_accuracy": 0.12857749983668326, "num_tokens": 22032298.0, "step": 10180 }, { "entropy": 6.534213542938232, "epoch": 1.0898924501043394, "grad_norm": 1.7109375, "learning_rate": 0.0004891290482833876, "loss": 6.3292, "mean_token_accuracy": 0.13334605246782302, "num_tokens": 22043693.0, "step": 10185 }, { "entropy": 6.520200777053833, "epoch": 1.0904275242121033, "grad_norm": 1.7421875, "learning_rate": 0.0004891173046050844, "loss": 6.3682, "mean_token_accuracy": 0.1346238724887371, "num_tokens": 22054373.0, "step": 10190 }, { "entropy": 6.534080505371094, "epoch": 1.0909625983198672, "grad_norm": 2.46875, "learning_rate": 0.000489105554744174, "loss": 6.3373, "mean_token_accuracy": 0.1305387571454048, "num_tokens": 22065039.0, "step": 10195 }, { "entropy": 6.6202747344970705, "epoch": 1.0914976724276313, "grad_norm": 1.859375, "learning_rate": 0.0004890937987009958, "loss": 6.3725, "mean_token_accuracy": 0.1298222564160824, "num_tokens": 22077003.0, "step": 10200 }, { "entropy": 6.60672516822815, "epoch": 1.0920327465353952, "grad_norm": 2.1875, "learning_rate": 0.0004890820364758892, "loss": 6.3539, "mean_token_accuracy": 0.1274056114256382, "num_tokens": 22088558.0, "step": 10205 }, { "entropy": 6.552365064620972, "epoch": 1.092567820643159, "grad_norm": 1.6484375, "learning_rate": 0.000489070268069194, "loss": 6.3246, "mean_token_accuracy": 0.13213638737797737, "num_tokens": 22097777.0, "step": 10210 }, { "entropy": 6.541152143478394, "epoch": 1.093102894750923, "grad_norm": 1.7890625, "learning_rate": 0.0004890584934812498, "loss": 6.2634, "mean_token_accuracy": 0.1303601458668709, "num_tokens": 22107803.0, "step": 10215 }, { "entropy": 6.498277282714843, "epoch": 1.093637968858687, "grad_norm": 1.5, "learning_rate": 0.0004890467127123967, "loss": 6.2813, "mean_token_accuracy": 0.13142024949193, "num_tokens": 22117965.0, "step": 10220 }, { "entropy": 6.5624823570251465, "epoch": 1.094173042966451, "grad_norm": 2.0, "learning_rate": 0.0004890349257629749, "loss": 6.3365, "mean_token_accuracy": 0.13246248736977578, "num_tokens": 22127759.0, "step": 10225 }, { "entropy": 6.550729131698608, "epoch": 1.0947081170742148, "grad_norm": 1.828125, "learning_rate": 0.0004890231326333246, "loss": 6.3437, "mean_token_accuracy": 0.1269809238612652, "num_tokens": 22138477.0, "step": 10230 }, { "entropy": 6.5772411823272705, "epoch": 1.0952431911819787, "grad_norm": 1.6015625, "learning_rate": 0.0004890113333237865, "loss": 6.3513, "mean_token_accuracy": 0.12684160023927687, "num_tokens": 22149568.0, "step": 10235 }, { "entropy": 6.5642256259918215, "epoch": 1.0957782652897425, "grad_norm": 2.328125, "learning_rate": 0.0004889995278347012, "loss": 6.3269, "mean_token_accuracy": 0.13090576231479645, "num_tokens": 22159949.0, "step": 10240 }, { "entropy": 6.539562940597534, "epoch": 1.0963133393975066, "grad_norm": 1.7265625, "learning_rate": 0.0004889877161664096, "loss": 6.3634, "mean_token_accuracy": 0.12523729503154754, "num_tokens": 22170115.0, "step": 10245 }, { "entropy": 6.588288640975952, "epoch": 1.0968484135052705, "grad_norm": 1.71875, "learning_rate": 0.0004889758983192528, "loss": 6.3573, "mean_token_accuracy": 0.13425422385334967, "num_tokens": 22181323.0, "step": 10250 }, { "entropy": 6.555928516387939, "epoch": 1.0973834876130344, "grad_norm": 1.6875, "learning_rate": 0.0004889640742935719, "loss": 6.2993, "mean_token_accuracy": 0.12734182626008989, "num_tokens": 22192078.0, "step": 10255 }, { "entropy": 6.603155136108398, "epoch": 1.0979185617207983, "grad_norm": 1.6015625, "learning_rate": 0.0004889522440897085, "loss": 6.3842, "mean_token_accuracy": 0.13014934435486794, "num_tokens": 22203211.0, "step": 10260 }, { "entropy": 6.523215007781983, "epoch": 1.0984536358285624, "grad_norm": 1.5, "learning_rate": 0.0004889404077080041, "loss": 6.3009, "mean_token_accuracy": 0.1271577313542366, "num_tokens": 22213487.0, "step": 10265 }, { "entropy": 6.6091859340667725, "epoch": 1.0989887099363262, "grad_norm": 1.6484375, "learning_rate": 0.0004889285651488005, "loss": 6.348, "mean_token_accuracy": 0.1246352657675743, "num_tokens": 22223717.0, "step": 10270 }, { "entropy": 6.56798095703125, "epoch": 1.0995237840440901, "grad_norm": 1.515625, "learning_rate": 0.0004889167164124396, "loss": 6.3425, "mean_token_accuracy": 0.13307574465870858, "num_tokens": 22235141.0, "step": 10275 }, { "entropy": 6.584205436706543, "epoch": 1.100058858151854, "grad_norm": 1.6171875, "learning_rate": 0.0004889048614992636, "loss": 6.4057, "mean_token_accuracy": 0.11987434178590775, "num_tokens": 22246601.0, "step": 10280 }, { "entropy": 6.577657842636109, "epoch": 1.1005939322596179, "grad_norm": 1.9453125, "learning_rate": 0.0004888930004096148, "loss": 6.3329, "mean_token_accuracy": 0.12910846546292304, "num_tokens": 22257206.0, "step": 10285 }, { "entropy": 6.545556259155274, "epoch": 1.101129006367382, "grad_norm": 1.8671875, "learning_rate": 0.0004888811331438356, "loss": 6.4003, "mean_token_accuracy": 0.1228591412305832, "num_tokens": 22267799.0, "step": 10290 }, { "entropy": 6.606423711776733, "epoch": 1.1016640804751459, "grad_norm": 1.46875, "learning_rate": 0.0004888692597022689, "loss": 6.4521, "mean_token_accuracy": 0.12880235388875008, "num_tokens": 22279368.0, "step": 10295 }, { "entropy": 6.553431987762451, "epoch": 1.1021991545829097, "grad_norm": 1.6640625, "learning_rate": 0.0004888573800852572, "loss": 6.1937, "mean_token_accuracy": 0.13669133111834525, "num_tokens": 22289998.0, "step": 10300 }, { "entropy": 6.504615068435669, "epoch": 1.1027342286906736, "grad_norm": 1.421875, "learning_rate": 0.0004888454942931438, "loss": 6.3197, "mean_token_accuracy": 0.1390775963664055, "num_tokens": 22300058.0, "step": 10305 }, { "entropy": 6.565959692001343, "epoch": 1.1032693027984375, "grad_norm": 1.8125, "learning_rate": 0.0004888336023262718, "loss": 6.4207, "mean_token_accuracy": 0.124299506098032, "num_tokens": 22310962.0, "step": 10310 }, { "entropy": 6.608157634735107, "epoch": 1.1038043769062016, "grad_norm": 1.6484375, "learning_rate": 0.0004888217041849846, "loss": 6.3051, "mean_token_accuracy": 0.1316367991268635, "num_tokens": 22321526.0, "step": 10315 }, { "entropy": 6.573012971878052, "epoch": 1.1043394510139655, "grad_norm": 2.265625, "learning_rate": 0.0004888097998696256, "loss": 6.3992, "mean_token_accuracy": 0.12790393680334092, "num_tokens": 22332558.0, "step": 10320 }, { "entropy": 6.550169897079468, "epoch": 1.1048745251217293, "grad_norm": 1.5, "learning_rate": 0.0004887978893805387, "loss": 6.3352, "mean_token_accuracy": 0.13281012028455735, "num_tokens": 22342392.0, "step": 10325 }, { "entropy": 6.571234178543091, "epoch": 1.1054095992294932, "grad_norm": 1.7265625, "learning_rate": 0.0004887859727180679, "loss": 6.3905, "mean_token_accuracy": 0.12326234579086304, "num_tokens": 22353089.0, "step": 10330 }, { "entropy": 6.522563552856445, "epoch": 1.105944673337257, "grad_norm": 1.7421875, "learning_rate": 0.0004887740498825572, "loss": 6.3072, "mean_token_accuracy": 0.13173036724328996, "num_tokens": 22364314.0, "step": 10335 }, { "entropy": 6.497900485992432, "epoch": 1.1064797474450212, "grad_norm": 1.71875, "learning_rate": 0.0004887621208743507, "loss": 6.3202, "mean_token_accuracy": 0.12728115022182465, "num_tokens": 22374985.0, "step": 10340 }, { "entropy": 6.526889419555664, "epoch": 1.107014821552785, "grad_norm": 2.0625, "learning_rate": 0.0004887501856937932, "loss": 6.2334, "mean_token_accuracy": 0.13864122256636618, "num_tokens": 22385618.0, "step": 10345 }, { "entropy": 6.631136274337768, "epoch": 1.107549895660549, "grad_norm": 1.59375, "learning_rate": 0.000488738244341229, "loss": 6.3459, "mean_token_accuracy": 0.14008405432105064, "num_tokens": 22395871.0, "step": 10350 }, { "entropy": 6.570936012268066, "epoch": 1.1080849697683128, "grad_norm": 1.4609375, "learning_rate": 0.000488726296817003, "loss": 6.3666, "mean_token_accuracy": 0.13187873214483262, "num_tokens": 22406707.0, "step": 10355 }, { "entropy": 6.53339991569519, "epoch": 1.108620043876077, "grad_norm": 1.6328125, "learning_rate": 0.0004887143431214602, "loss": 6.3797, "mean_token_accuracy": 0.12708743512630463, "num_tokens": 22417543.0, "step": 10360 }, { "entropy": 6.502883052825927, "epoch": 1.1091551179838408, "grad_norm": 3.03125, "learning_rate": 0.0004887023832549459, "loss": 6.3206, "mean_token_accuracy": 0.13298214301466943, "num_tokens": 22428283.0, "step": 10365 }, { "entropy": 6.499336004257202, "epoch": 1.1096901920916047, "grad_norm": 1.875, "learning_rate": 0.0004886904172178052, "loss": 6.2922, "mean_token_accuracy": 0.13327440321445466, "num_tokens": 22439860.0, "step": 10370 }, { "entropy": 6.63573694229126, "epoch": 1.1102252661993686, "grad_norm": 1.4609375, "learning_rate": 0.0004886784450103838, "loss": 6.3627, "mean_token_accuracy": 0.13110646083950997, "num_tokens": 22451250.0, "step": 10375 }, { "entropy": 6.561157751083374, "epoch": 1.1107603403071324, "grad_norm": 1.484375, "learning_rate": 0.0004886664666330273, "loss": 6.293, "mean_token_accuracy": 0.12992360070347786, "num_tokens": 22461112.0, "step": 10380 }, { "entropy": 6.530084323883057, "epoch": 1.1112954144148965, "grad_norm": 1.4921875, "learning_rate": 0.0004886544820860816, "loss": 6.3298, "mean_token_accuracy": 0.13429150208830834, "num_tokens": 22471368.0, "step": 10385 }, { "entropy": 6.522792387008667, "epoch": 1.1118304885226604, "grad_norm": 3.171875, "learning_rate": 0.0004886424913698927, "loss": 6.3256, "mean_token_accuracy": 0.1302389308810234, "num_tokens": 22482011.0, "step": 10390 }, { "entropy": 6.528932523727417, "epoch": 1.1123655626304243, "grad_norm": 1.8984375, "learning_rate": 0.0004886304944848069, "loss": 6.2828, "mean_token_accuracy": 0.13808312863111497, "num_tokens": 22493648.0, "step": 10395 }, { "entropy": 6.57400918006897, "epoch": 1.1129006367381882, "grad_norm": 1.6953125, "learning_rate": 0.0004886184914311706, "loss": 6.4129, "mean_token_accuracy": 0.12496653497219086, "num_tokens": 22505577.0, "step": 10400 }, { "entropy": 6.564892768859863, "epoch": 1.1134357108459523, "grad_norm": 1.9453125, "learning_rate": 0.0004886064822093305, "loss": 6.3716, "mean_token_accuracy": 0.12236398756504059, "num_tokens": 22515546.0, "step": 10405 }, { "entropy": 6.527905750274658, "epoch": 1.1139707849537162, "grad_norm": 1.5859375, "learning_rate": 0.0004885944668196332, "loss": 6.2631, "mean_token_accuracy": 0.13738187327980994, "num_tokens": 22526710.0, "step": 10410 }, { "entropy": 6.569247817993164, "epoch": 1.11450585906148, "grad_norm": 1.765625, "learning_rate": 0.0004885824452624254, "loss": 6.3707, "mean_token_accuracy": 0.12691551223397254, "num_tokens": 22537809.0, "step": 10415 }, { "entropy": 6.581798887252807, "epoch": 1.115040933169244, "grad_norm": 1.7265625, "learning_rate": 0.0004885704175380548, "loss": 6.3638, "mean_token_accuracy": 0.1270926281809807, "num_tokens": 22549301.0, "step": 10420 }, { "entropy": 6.6548303127288815, "epoch": 1.1155760072770078, "grad_norm": 1.421875, "learning_rate": 0.0004885583836468683, "loss": 6.2725, "mean_token_accuracy": 0.13279347419738768, "num_tokens": 22560483.0, "step": 10425 }, { "entropy": 6.529315996170044, "epoch": 1.1161110813847719, "grad_norm": 1.578125, "learning_rate": 0.0004885463435892136, "loss": 6.3644, "mean_token_accuracy": 0.12554011717438698, "num_tokens": 22570524.0, "step": 10430 }, { "entropy": 6.552693557739258, "epoch": 1.1166461554925358, "grad_norm": 1.4453125, "learning_rate": 0.000488534297365438, "loss": 6.3706, "mean_token_accuracy": 0.1273189067840576, "num_tokens": 22581120.0, "step": 10435 }, { "entropy": 6.6206999778747555, "epoch": 1.1171812296002996, "grad_norm": 2.703125, "learning_rate": 0.0004885222449758899, "loss": 6.3588, "mean_token_accuracy": 0.12862497866153716, "num_tokens": 22592658.0, "step": 10440 }, { "entropy": 6.5843626976013185, "epoch": 1.1177163037080635, "grad_norm": 2.15625, "learning_rate": 0.0004885101864209167, "loss": 6.3188, "mean_token_accuracy": 0.13105077669024467, "num_tokens": 22603497.0, "step": 10445 }, { "entropy": 6.508558559417724, "epoch": 1.1182513778158274, "grad_norm": 1.59375, "learning_rate": 0.000488498121700867, "loss": 6.2562, "mean_token_accuracy": 0.13314962089061738, "num_tokens": 22612916.0, "step": 10450 }, { "entropy": 6.510771703720093, "epoch": 1.1187864519235915, "grad_norm": 1.78125, "learning_rate": 0.0004884860508160891, "loss": 6.3776, "mean_token_accuracy": 0.12925844565033912, "num_tokens": 22625345.0, "step": 10455 }, { "entropy": 6.510384511947632, "epoch": 1.1193215260313554, "grad_norm": 1.4453125, "learning_rate": 0.0004884739737669314, "loss": 6.2801, "mean_token_accuracy": 0.1355935327708721, "num_tokens": 22637000.0, "step": 10460 }, { "entropy": 6.549340534210205, "epoch": 1.1198566001391193, "grad_norm": 1.609375, "learning_rate": 0.0004884618905537427, "loss": 6.2781, "mean_token_accuracy": 0.1341861017048359, "num_tokens": 22647025.0, "step": 10465 }, { "entropy": 6.493887281417846, "epoch": 1.1203916742468831, "grad_norm": 1.5546875, "learning_rate": 0.0004884498011768719, "loss": 6.2679, "mean_token_accuracy": 0.137028082460165, "num_tokens": 22657253.0, "step": 10470 }, { "entropy": 6.463266134262085, "epoch": 1.120926748354647, "grad_norm": 1.578125, "learning_rate": 0.000488437705636668, "loss": 6.3042, "mean_token_accuracy": 0.131851152330637, "num_tokens": 22668432.0, "step": 10475 }, { "entropy": 6.525684833526611, "epoch": 1.121461822462411, "grad_norm": 1.734375, "learning_rate": 0.0004884256039334805, "loss": 6.3575, "mean_token_accuracy": 0.12723028883337975, "num_tokens": 22678538.0, "step": 10480 }, { "entropy": 6.573268985748291, "epoch": 1.121996896570175, "grad_norm": 1.4765625, "learning_rate": 0.0004884134960676586, "loss": 6.3296, "mean_token_accuracy": 0.12801336348056794, "num_tokens": 22688994.0, "step": 10485 }, { "entropy": 6.627550745010376, "epoch": 1.1225319706779389, "grad_norm": 1.4375, "learning_rate": 0.000488401382039552, "loss": 6.3599, "mean_token_accuracy": 0.13166107088327408, "num_tokens": 22699584.0, "step": 10490 }, { "entropy": 6.498450517654419, "epoch": 1.1230670447857027, "grad_norm": 1.5, "learning_rate": 0.0004883892618495104, "loss": 6.2662, "mean_token_accuracy": 0.1293816864490509, "num_tokens": 22710093.0, "step": 10495 }, { "entropy": 6.543735408782959, "epoch": 1.1236021188934668, "grad_norm": 1.671875, "learning_rate": 0.000488377135497884, "loss": 6.3419, "mean_token_accuracy": 0.1305043265223503, "num_tokens": 22720533.0, "step": 10500 }, { "entropy": 6.546299886703491, "epoch": 1.1241371930012307, "grad_norm": 1.7734375, "learning_rate": 0.0004883650029850226, "loss": 6.2551, "mean_token_accuracy": 0.1354456789791584, "num_tokens": 22731010.0, "step": 10505 }, { "entropy": 6.520023155212402, "epoch": 1.1246722671089946, "grad_norm": 1.375, "learning_rate": 0.0004883528643112769, "loss": 6.3359, "mean_token_accuracy": 0.1299326941370964, "num_tokens": 22743045.0, "step": 10510 }, { "entropy": 6.5189900398254395, "epoch": 1.1252073412167585, "grad_norm": 1.59375, "learning_rate": 0.0004883407194769972, "loss": 6.3302, "mean_token_accuracy": 0.13178498074412345, "num_tokens": 22753746.0, "step": 10515 }, { "entropy": 6.565853261947632, "epoch": 1.1257424153245223, "grad_norm": 1.5625, "learning_rate": 0.0004883285684825342, "loss": 6.3514, "mean_token_accuracy": 0.13648682385683059, "num_tokens": 22765264.0, "step": 10520 }, { "entropy": 6.57284836769104, "epoch": 1.1262774894322864, "grad_norm": 1.4296875, "learning_rate": 0.0004883164113282386, "loss": 6.3513, "mean_token_accuracy": 0.13097459301352501, "num_tokens": 22775727.0, "step": 10525 }, { "entropy": 6.56453914642334, "epoch": 1.1268125635400503, "grad_norm": 1.2890625, "learning_rate": 0.0004883042480144618, "loss": 6.3346, "mean_token_accuracy": 0.1291578531265259, "num_tokens": 22787228.0, "step": 10530 }, { "entropy": 6.653687572479248, "epoch": 1.1273476376478142, "grad_norm": 1.8046875, "learning_rate": 0.0004882920785415547, "loss": 6.3944, "mean_token_accuracy": 0.12908954098820685, "num_tokens": 22797467.0, "step": 10535 }, { "entropy": 6.573576211929321, "epoch": 1.127882711755578, "grad_norm": 1.7109375, "learning_rate": 0.0004882799029098689, "loss": 6.3486, "mean_token_accuracy": 0.12570706456899644, "num_tokens": 22808281.0, "step": 10540 }, { "entropy": 6.537278699874878, "epoch": 1.1284177858633422, "grad_norm": 1.8515625, "learning_rate": 0.00048826772111975583, "loss": 6.4105, "mean_token_accuracy": 0.1296780101954937, "num_tokens": 22819387.0, "step": 10545 }, { "entropy": 6.540688848495483, "epoch": 1.128952859971106, "grad_norm": 1.84375, "learning_rate": 0.00048825553317156717, "loss": 6.3638, "mean_token_accuracy": 0.12886037230491637, "num_tokens": 22829649.0, "step": 10550 }, { "entropy": 6.494860124588013, "epoch": 1.12948793407887, "grad_norm": 1.421875, "learning_rate": 0.0004882433390656551, "loss": 6.3573, "mean_token_accuracy": 0.13145121783018113, "num_tokens": 22840667.0, "step": 10555 }, { "entropy": 6.538703346252442, "epoch": 1.1300230081866338, "grad_norm": 1.75, "learning_rate": 0.0004882311388023715, "loss": 6.3134, "mean_token_accuracy": 0.13190669789910317, "num_tokens": 22852461.0, "step": 10560 }, { "entropy": 6.632486295700073, "epoch": 1.1305580822943977, "grad_norm": 1.5390625, "learning_rate": 0.0004882189323820688, "loss": 6.377, "mean_token_accuracy": 0.1251945301890373, "num_tokens": 22862781.0, "step": 10565 }, { "entropy": 6.648410177230835, "epoch": 1.1310931564021618, "grad_norm": 1.796875, "learning_rate": 0.00048820671980509935, "loss": 6.4086, "mean_token_accuracy": 0.12716651260852813, "num_tokens": 22873393.0, "step": 10570 }, { "entropy": 6.624794340133667, "epoch": 1.1316282305099257, "grad_norm": 1.7578125, "learning_rate": 0.00048819450107181583, "loss": 6.3687, "mean_token_accuracy": 0.1276544764637947, "num_tokens": 22883931.0, "step": 10575 }, { "entropy": 6.597856330871582, "epoch": 1.1321633046176895, "grad_norm": 3.03125, "learning_rate": 0.0004881822761825711, "loss": 6.3167, "mean_token_accuracy": 0.12900567129254342, "num_tokens": 22894829.0, "step": 10580 }, { "entropy": 6.510784578323364, "epoch": 1.1326983787254534, "grad_norm": 1.5703125, "learning_rate": 0.000488170045137718, "loss": 6.3531, "mean_token_accuracy": 0.12778317630290986, "num_tokens": 22906059.0, "step": 10585 }, { "entropy": 6.541378164291382, "epoch": 1.1332334528332173, "grad_norm": 1.671875, "learning_rate": 0.0004881578079376099, "loss": 6.3363, "mean_token_accuracy": 0.12626659497618675, "num_tokens": 22917834.0, "step": 10590 }, { "entropy": 6.579113960266113, "epoch": 1.1337685269409814, "grad_norm": 1.359375, "learning_rate": 0.00048814556458259996, "loss": 6.2577, "mean_token_accuracy": 0.14158050939440728, "num_tokens": 22929157.0, "step": 10595 }, { "entropy": 6.6599236011505125, "epoch": 1.1343036010487453, "grad_norm": 1.5703125, "learning_rate": 0.0004881333150730419, "loss": 6.3759, "mean_token_accuracy": 0.13018642514944076, "num_tokens": 22939396.0, "step": 10600 }, { "entropy": 6.537628221511841, "epoch": 1.1348386751565092, "grad_norm": 1.46875, "learning_rate": 0.00048812105940928917, "loss": 6.3538, "mean_token_accuracy": 0.12922895923256875, "num_tokens": 22950253.0, "step": 10605 }, { "entropy": 6.5369837284088135, "epoch": 1.135373749264273, "grad_norm": 1.59375, "learning_rate": 0.00048810879759169593, "loss": 6.3596, "mean_token_accuracy": 0.1285732626914978, "num_tokens": 22960417.0, "step": 10610 }, { "entropy": 6.495455932617188, "epoch": 1.135908823372037, "grad_norm": 4.34375, "learning_rate": 0.000488096529620616, "loss": 6.3557, "mean_token_accuracy": 0.1290543757379055, "num_tokens": 22971763.0, "step": 10615 }, { "entropy": 6.603179931640625, "epoch": 1.136443897479801, "grad_norm": 1.6953125, "learning_rate": 0.00048808425549640383, "loss": 6.3622, "mean_token_accuracy": 0.1303618311882019, "num_tokens": 22981571.0, "step": 10620 }, { "entropy": 6.563053131103516, "epoch": 1.136978971587565, "grad_norm": 1.609375, "learning_rate": 0.00048807197521941366, "loss": 6.3112, "mean_token_accuracy": 0.1328694626688957, "num_tokens": 22991644.0, "step": 10625 }, { "entropy": 6.505655574798584, "epoch": 1.1375140456953288, "grad_norm": 1.6015625, "learning_rate": 0.0004880596887900002, "loss": 6.2685, "mean_token_accuracy": 0.13284799605607986, "num_tokens": 23001557.0, "step": 10630 }, { "entropy": 6.5576403617858885, "epoch": 1.1380491198030926, "grad_norm": 1.6875, "learning_rate": 0.00048804739620851806, "loss": 6.3618, "mean_token_accuracy": 0.12697471380233766, "num_tokens": 23012715.0, "step": 10635 }, { "entropy": 6.530397510528564, "epoch": 1.1385841939108567, "grad_norm": 1.5234375, "learning_rate": 0.00048803509747532235, "loss": 6.3562, "mean_token_accuracy": 0.12833357527852057, "num_tokens": 23023016.0, "step": 10640 }, { "entropy": 6.556599807739258, "epoch": 1.1391192680186206, "grad_norm": 1.671875, "learning_rate": 0.0004880227925907682, "loss": 6.3606, "mean_token_accuracy": 0.1297280579805374, "num_tokens": 23033511.0, "step": 10645 }, { "entropy": 6.620222473144532, "epoch": 1.1396543421263845, "grad_norm": 1.9140625, "learning_rate": 0.0004880104815552108, "loss": 6.3615, "mean_token_accuracy": 0.13871046230196954, "num_tokens": 23045149.0, "step": 10650 }, { "entropy": 6.542651987075805, "epoch": 1.1401894162341484, "grad_norm": 2.703125, "learning_rate": 0.0004879981643690056, "loss": 6.3111, "mean_token_accuracy": 0.1345951810479164, "num_tokens": 23054489.0, "step": 10655 }, { "entropy": 6.546128368377685, "epoch": 1.1407244903419125, "grad_norm": 1.6484375, "learning_rate": 0.00048798584103250847, "loss": 6.4496, "mean_token_accuracy": 0.12695099115371705, "num_tokens": 23064725.0, "step": 10660 }, { "entropy": 6.49794864654541, "epoch": 1.1412595644496764, "grad_norm": 2.15625, "learning_rate": 0.000487973511546075, "loss": 6.4074, "mean_token_accuracy": 0.12610558271408082, "num_tokens": 23076473.0, "step": 10665 }, { "entropy": 6.61476240158081, "epoch": 1.1417946385574402, "grad_norm": 1.71875, "learning_rate": 0.0004879611759100614, "loss": 6.325, "mean_token_accuracy": 0.13806122466921805, "num_tokens": 23087449.0, "step": 10670 }, { "entropy": 6.619863605499267, "epoch": 1.1423297126652041, "grad_norm": 1.7421875, "learning_rate": 0.0004879488341248237, "loss": 6.2824, "mean_token_accuracy": 0.1350557804107666, "num_tokens": 23098284.0, "step": 10675 }, { "entropy": 6.49966254234314, "epoch": 1.142864786772968, "grad_norm": 2.421875, "learning_rate": 0.00048793648619071834, "loss": 6.3136, "mean_token_accuracy": 0.13502648174762727, "num_tokens": 23108545.0, "step": 10680 }, { "entropy": 6.558721446990967, "epoch": 1.143399860880732, "grad_norm": 2.203125, "learning_rate": 0.0004879241321081019, "loss": 6.2808, "mean_token_accuracy": 0.13182588443160057, "num_tokens": 23118568.0, "step": 10685 }, { "entropy": 6.612079620361328, "epoch": 1.143934934988496, "grad_norm": 7.46875, "learning_rate": 0.00048791177187733104, "loss": 6.3619, "mean_token_accuracy": 0.12453131675720215, "num_tokens": 23129189.0, "step": 10690 }, { "entropy": 6.61033616065979, "epoch": 1.1444700090962598, "grad_norm": 1.8203125, "learning_rate": 0.0004878994054987627, "loss": 6.3874, "mean_token_accuracy": 0.12639420479536057, "num_tokens": 23140238.0, "step": 10695 }, { "entropy": 6.52753849029541, "epoch": 1.1450050832040237, "grad_norm": 1.484375, "learning_rate": 0.0004878870329727539, "loss": 6.2835, "mean_token_accuracy": 0.1355196289718151, "num_tokens": 23149567.0, "step": 10700 }, { "entropy": 6.512339735031128, "epoch": 1.1455401573117876, "grad_norm": 1.7578125, "learning_rate": 0.000487874654299662, "loss": 6.2582, "mean_token_accuracy": 0.1337184876203537, "num_tokens": 23159208.0, "step": 10705 }, { "entropy": 6.466184949874878, "epoch": 1.1460752314195517, "grad_norm": 1.6875, "learning_rate": 0.00048786226947984435, "loss": 6.3111, "mean_token_accuracy": 0.13029128834605216, "num_tokens": 23169092.0, "step": 10710 }, { "entropy": 6.5020448684692385, "epoch": 1.1466103055273156, "grad_norm": 1.4453125, "learning_rate": 0.0004878498785136586, "loss": 6.3365, "mean_token_accuracy": 0.13344621732831002, "num_tokens": 23180385.0, "step": 10715 }, { "entropy": 6.58619179725647, "epoch": 1.1471453796350795, "grad_norm": 1.5859375, "learning_rate": 0.00048783748140146245, "loss": 6.3305, "mean_token_accuracy": 0.12785167694091798, "num_tokens": 23191180.0, "step": 10720 }, { "entropy": 6.571190071105957, "epoch": 1.1476804537428433, "grad_norm": 1.65625, "learning_rate": 0.000487825078143614, "loss": 6.3069, "mean_token_accuracy": 0.13744020015001296, "num_tokens": 23200920.0, "step": 10725 }, { "entropy": 6.519334125518799, "epoch": 1.1482155278506072, "grad_norm": 1.40625, "learning_rate": 0.0004878126687404713, "loss": 6.332, "mean_token_accuracy": 0.1358323097229004, "num_tokens": 23211140.0, "step": 10730 }, { "entropy": 6.552707242965698, "epoch": 1.1487506019583713, "grad_norm": 1.5390625, "learning_rate": 0.0004878002531923927, "loss": 6.3699, "mean_token_accuracy": 0.12355867698788643, "num_tokens": 23222039.0, "step": 10735 }, { "entropy": 6.627868509292602, "epoch": 1.1492856760661352, "grad_norm": 1.734375, "learning_rate": 0.00048778783149973674, "loss": 6.3982, "mean_token_accuracy": 0.12598269581794738, "num_tokens": 23232502.0, "step": 10740 }, { "entropy": 6.597220039367675, "epoch": 1.149820750173899, "grad_norm": 1.7734375, "learning_rate": 0.00048777540366286195, "loss": 6.3189, "mean_token_accuracy": 0.13383150175213815, "num_tokens": 23243172.0, "step": 10745 }, { "entropy": 6.588002014160156, "epoch": 1.150355824281663, "grad_norm": 1.6015625, "learning_rate": 0.0004877629696821273, "loss": 6.3769, "mean_token_accuracy": 0.12852920964360237, "num_tokens": 23254558.0, "step": 10750 }, { "entropy": 6.596088075637818, "epoch": 1.1508908983894268, "grad_norm": 1.78125, "learning_rate": 0.00048775052955789185, "loss": 6.4108, "mean_token_accuracy": 0.12670576050877572, "num_tokens": 23266283.0, "step": 10755 }, { "entropy": 6.510305166244507, "epoch": 1.151425972497191, "grad_norm": 1.2734375, "learning_rate": 0.0004877380832905147, "loss": 6.2731, "mean_token_accuracy": 0.13248199224472046, "num_tokens": 23277823.0, "step": 10760 }, { "entropy": 6.5186646461486815, "epoch": 1.1519610466049548, "grad_norm": 2.171875, "learning_rate": 0.00048772563088035533, "loss": 6.2662, "mean_token_accuracy": 0.13238389566540718, "num_tokens": 23288159.0, "step": 10765 }, { "entropy": 6.4919130325317385, "epoch": 1.1524961207127187, "grad_norm": 1.671875, "learning_rate": 0.0004877131723277732, "loss": 6.2853, "mean_token_accuracy": 0.13082748800516128, "num_tokens": 23299379.0, "step": 10770 }, { "entropy": 6.533123350143432, "epoch": 1.1530311948204826, "grad_norm": 1.4296875, "learning_rate": 0.0004877007076331282, "loss": 6.3287, "mean_token_accuracy": 0.12611317709088327, "num_tokens": 23310572.0, "step": 10775 }, { "entropy": 6.587215518951416, "epoch": 1.1535662689282467, "grad_norm": 1.8046875, "learning_rate": 0.0004876882367967801, "loss": 6.334, "mean_token_accuracy": 0.13565945401787757, "num_tokens": 23320782.0, "step": 10780 }, { "entropy": 6.552771425247192, "epoch": 1.1541013430360105, "grad_norm": 1.421875, "learning_rate": 0.00048767575981908907, "loss": 6.3898, "mean_token_accuracy": 0.1259394496679306, "num_tokens": 23331427.0, "step": 10785 }, { "entropy": 6.604757595062256, "epoch": 1.1546364171437744, "grad_norm": 2.375, "learning_rate": 0.00048766327670041534, "loss": 6.488, "mean_token_accuracy": 0.12195928543806075, "num_tokens": 23344250.0, "step": 10790 }, { "entropy": 6.604654550552368, "epoch": 1.1551714912515383, "grad_norm": 1.34375, "learning_rate": 0.0004876507874411194, "loss": 6.3477, "mean_token_accuracy": 0.13034091219305993, "num_tokens": 23354404.0, "step": 10795 }, { "entropy": 6.561950302124023, "epoch": 1.1557065653593024, "grad_norm": 2.0, "learning_rate": 0.00048763829204156187, "loss": 6.3585, "mean_token_accuracy": 0.1264335334300995, "num_tokens": 23364634.0, "step": 10800 }, { "entropy": 6.492505645751953, "epoch": 1.1562416394670663, "grad_norm": 1.7421875, "learning_rate": 0.00048762579050210344, "loss": 6.2262, "mean_token_accuracy": 0.1356184884905815, "num_tokens": 23375816.0, "step": 10805 }, { "entropy": 6.603830242156983, "epoch": 1.1567767135748301, "grad_norm": 2.015625, "learning_rate": 0.00048761328282310534, "loss": 6.3615, "mean_token_accuracy": 0.13077081739902496, "num_tokens": 23386583.0, "step": 10810 }, { "entropy": 6.525880002975464, "epoch": 1.157311787682594, "grad_norm": 1.46875, "learning_rate": 0.00048760076900492846, "loss": 6.2919, "mean_token_accuracy": 0.13986414223909377, "num_tokens": 23396826.0, "step": 10815 }, { "entropy": 6.552999544143677, "epoch": 1.157846861790358, "grad_norm": 1.4296875, "learning_rate": 0.0004875882490479343, "loss": 6.3826, "mean_token_accuracy": 0.13021600022912025, "num_tokens": 23408661.0, "step": 10820 }, { "entropy": 6.541066122055054, "epoch": 1.158381935898122, "grad_norm": 1.3203125, "learning_rate": 0.00048757572295248425, "loss": 6.2981, "mean_token_accuracy": 0.13274050131440163, "num_tokens": 23419308.0, "step": 10825 }, { "entropy": 6.486504793167114, "epoch": 1.1589170100058859, "grad_norm": 2.375, "learning_rate": 0.0004875631907189402, "loss": 6.3, "mean_token_accuracy": 0.13612111359834672, "num_tokens": 23430043.0, "step": 10830 }, { "entropy": 6.4684511661529545, "epoch": 1.1594520841136498, "grad_norm": 1.515625, "learning_rate": 0.0004875506523476638, "loss": 6.2307, "mean_token_accuracy": 0.13488834574818612, "num_tokens": 23441246.0, "step": 10835 }, { "entropy": 6.606773376464844, "epoch": 1.1599871582214136, "grad_norm": 1.8046875, "learning_rate": 0.00048753810783901716, "loss": 6.3619, "mean_token_accuracy": 0.12804771736264228, "num_tokens": 23452250.0, "step": 10840 }, { "entropy": 6.583228635787964, "epoch": 1.1605222323291775, "grad_norm": 1.578125, "learning_rate": 0.00048752555719336257, "loss": 6.3506, "mean_token_accuracy": 0.1309939667582512, "num_tokens": 23464174.0, "step": 10845 }, { "entropy": 6.51217737197876, "epoch": 1.1610573064369416, "grad_norm": 1.703125, "learning_rate": 0.0004875130004110623, "loss": 6.2202, "mean_token_accuracy": 0.13723542168736458, "num_tokens": 23475159.0, "step": 10850 }, { "entropy": 6.514151525497437, "epoch": 1.1615923805447055, "grad_norm": 1.703125, "learning_rate": 0.00048750043749247907, "loss": 6.2808, "mean_token_accuracy": 0.13446007221937178, "num_tokens": 23486210.0, "step": 10855 }, { "entropy": 6.514532136917114, "epoch": 1.1621274546524694, "grad_norm": 1.6015625, "learning_rate": 0.0004874878684379756, "loss": 6.411, "mean_token_accuracy": 0.12789803966879845, "num_tokens": 23497122.0, "step": 10860 }, { "entropy": 6.4596717834472654, "epoch": 1.1626625287602332, "grad_norm": 1.75, "learning_rate": 0.0004874752932479148, "loss": 6.232, "mean_token_accuracy": 0.13754346147179602, "num_tokens": 23507765.0, "step": 10865 }, { "entropy": 6.545322704315185, "epoch": 1.1631976028679971, "grad_norm": 1.6796875, "learning_rate": 0.00048746271192265974, "loss": 6.3203, "mean_token_accuracy": 0.1301468774676323, "num_tokens": 23517686.0, "step": 10870 }, { "entropy": 6.523095512390137, "epoch": 1.1637326769757612, "grad_norm": 2.8125, "learning_rate": 0.0004874501244625737, "loss": 6.3118, "mean_token_accuracy": 0.1309164471924305, "num_tokens": 23528325.0, "step": 10875 }, { "entropy": 6.566447162628174, "epoch": 1.164267751083525, "grad_norm": 1.6640625, "learning_rate": 0.0004874375308680202, "loss": 6.3726, "mean_token_accuracy": 0.13206291794776917, "num_tokens": 23540006.0, "step": 10880 }, { "entropy": 6.632190322875976, "epoch": 1.164802825191289, "grad_norm": 1.5, "learning_rate": 0.00048742493113936274, "loss": 6.2925, "mean_token_accuracy": 0.12856976315379143, "num_tokens": 23550419.0, "step": 10885 }, { "entropy": 6.595448780059814, "epoch": 1.1653378992990528, "grad_norm": 3.859375, "learning_rate": 0.0004874123252769653, "loss": 6.409, "mean_token_accuracy": 0.12579906359314919, "num_tokens": 23561227.0, "step": 10890 }, { "entropy": 6.535502672195435, "epoch": 1.1658729734068167, "grad_norm": 1.9296875, "learning_rate": 0.00048739971328119194, "loss": 6.3248, "mean_token_accuracy": 0.12940651550889015, "num_tokens": 23571357.0, "step": 10895 }, { "entropy": 6.5147114276885985, "epoch": 1.1664080475145808, "grad_norm": 1.5234375, "learning_rate": 0.0004873870951524066, "loss": 6.3553, "mean_token_accuracy": 0.132980278134346, "num_tokens": 23581875.0, "step": 10900 }, { "entropy": 6.559042978286743, "epoch": 1.1669431216223447, "grad_norm": 1.734375, "learning_rate": 0.00048737447089097373, "loss": 6.4243, "mean_token_accuracy": 0.1240346796810627, "num_tokens": 23594251.0, "step": 10905 }, { "entropy": 6.577066469192505, "epoch": 1.1674781957301086, "grad_norm": 1.4921875, "learning_rate": 0.0004873618404972579, "loss": 6.3471, "mean_token_accuracy": 0.12563381120562553, "num_tokens": 23605159.0, "step": 10910 }, { "entropy": 6.621804046630859, "epoch": 1.1680132698378725, "grad_norm": 1.5546875, "learning_rate": 0.00048734920397162376, "loss": 6.3113, "mean_token_accuracy": 0.13350120931863785, "num_tokens": 23615737.0, "step": 10915 }, { "entropy": 6.506545734405518, "epoch": 1.1685483439456366, "grad_norm": 1.5, "learning_rate": 0.0004873365613144361, "loss": 6.3252, "mean_token_accuracy": 0.12694838345050813, "num_tokens": 23626207.0, "step": 10920 }, { "entropy": 6.5473815441131595, "epoch": 1.1690834180534004, "grad_norm": 1.265625, "learning_rate": 0.0004873239125260602, "loss": 6.365, "mean_token_accuracy": 0.12902920097112655, "num_tokens": 23637900.0, "step": 10925 }, { "entropy": 6.621821451187134, "epoch": 1.1696184921611643, "grad_norm": 1.1484375, "learning_rate": 0.00048731125760686106, "loss": 6.2485, "mean_token_accuracy": 0.13506797328591347, "num_tokens": 23647867.0, "step": 10930 }, { "entropy": 6.5687356948852536, "epoch": 1.1701535662689282, "grad_norm": 1.3125, "learning_rate": 0.00048729859655720424, "loss": 6.315, "mean_token_accuracy": 0.12940352633595467, "num_tokens": 23658055.0, "step": 10935 }, { "entropy": 6.455961608886719, "epoch": 1.1706886403766923, "grad_norm": 1.6015625, "learning_rate": 0.0004872859293774553, "loss": 6.3139, "mean_token_accuracy": 0.13185800462961197, "num_tokens": 23669458.0, "step": 10940 }, { "entropy": 6.526072645187378, "epoch": 1.1712237144844562, "grad_norm": 2.0625, "learning_rate": 0.00048727325606797995, "loss": 6.3277, "mean_token_accuracy": 0.1271936185657978, "num_tokens": 23679702.0, "step": 10945 }, { "entropy": 6.563662910461426, "epoch": 1.17175878859222, "grad_norm": 1.7109375, "learning_rate": 0.0004872605766291441, "loss": 6.3193, "mean_token_accuracy": 0.13145660236477852, "num_tokens": 23690844.0, "step": 10950 }, { "entropy": 6.457307958602906, "epoch": 1.172293862699984, "grad_norm": 1.3125, "learning_rate": 0.000487247891061314, "loss": 6.2989, "mean_token_accuracy": 0.1314682736992836, "num_tokens": 23701484.0, "step": 10955 }, { "entropy": 6.5671031951904295, "epoch": 1.1728289368077478, "grad_norm": 1.4296875, "learning_rate": 0.0004872351993648559, "loss": 6.3407, "mean_token_accuracy": 0.13159382194280625, "num_tokens": 23711452.0, "step": 10960 }, { "entropy": 6.516592884063721, "epoch": 1.173364010915512, "grad_norm": 2.5, "learning_rate": 0.00048722250154013613, "loss": 6.3172, "mean_token_accuracy": 0.12494777664542198, "num_tokens": 23723514.0, "step": 10965 }, { "entropy": 6.534799480438233, "epoch": 1.1738990850232758, "grad_norm": 1.2578125, "learning_rate": 0.0004872097975875216, "loss": 6.3526, "mean_token_accuracy": 0.13144171759486198, "num_tokens": 23733722.0, "step": 10970 }, { "entropy": 6.602074098587036, "epoch": 1.1744341591310397, "grad_norm": 1.421875, "learning_rate": 0.0004871970875073789, "loss": 6.3286, "mean_token_accuracy": 0.1271186165511608, "num_tokens": 23743403.0, "step": 10975 }, { "entropy": 6.524165916442871, "epoch": 1.1749692332388035, "grad_norm": 1.71875, "learning_rate": 0.0004871843713000751, "loss": 6.31, "mean_token_accuracy": 0.13159505203366278, "num_tokens": 23754558.0, "step": 10980 }, { "entropy": 6.523883056640625, "epoch": 1.1755043073465674, "grad_norm": 1.375, "learning_rate": 0.00048717164896597737, "loss": 6.3631, "mean_token_accuracy": 0.130098707228899, "num_tokens": 23766346.0, "step": 10985 }, { "entropy": 6.574266242980957, "epoch": 1.1760393814543315, "grad_norm": 1.34375, "learning_rate": 0.0004871589205054532, "loss": 6.3338, "mean_token_accuracy": 0.13770927786827086, "num_tokens": 23776851.0, "step": 10990 }, { "entropy": 6.6048688888549805, "epoch": 1.1765744555620954, "grad_norm": 1.7109375, "learning_rate": 0.00048714618591886997, "loss": 6.387, "mean_token_accuracy": 0.1288090780377388, "num_tokens": 23787350.0, "step": 10995 }, { "entropy": 6.472964715957642, "epoch": 1.1771095296698593, "grad_norm": 1.765625, "learning_rate": 0.0004871334452065954, "loss": 6.2534, "mean_token_accuracy": 0.13515733554959297, "num_tokens": 23797738.0, "step": 11000 }, { "entropy": 6.5069136142730715, "epoch": 1.1776446037776231, "grad_norm": 2.0625, "learning_rate": 0.0004871206983689974, "loss": 6.2645, "mean_token_accuracy": 0.1382341854274273, "num_tokens": 23809516.0, "step": 11005 }, { "entropy": 6.545322513580322, "epoch": 1.178179677885387, "grad_norm": 1.75, "learning_rate": 0.000487107945406444, "loss": 6.3351, "mean_token_accuracy": 0.13261336386203765, "num_tokens": 23819850.0, "step": 11010 }, { "entropy": 6.545321655273438, "epoch": 1.1787147519931511, "grad_norm": 1.4453125, "learning_rate": 0.0004870951863193036, "loss": 6.3102, "mean_token_accuracy": 0.13330233544111253, "num_tokens": 23829891.0, "step": 11015 }, { "entropy": 6.491222715377807, "epoch": 1.179249826100915, "grad_norm": 1.3359375, "learning_rate": 0.0004870824211079444, "loss": 6.281, "mean_token_accuracy": 0.13427258878946305, "num_tokens": 23840816.0, "step": 11020 }, { "entropy": 6.571009492874145, "epoch": 1.1797849002086789, "grad_norm": 1.3828125, "learning_rate": 0.00048706964977273515, "loss": 6.3737, "mean_token_accuracy": 0.12626400142908095, "num_tokens": 23852595.0, "step": 11025 }, { "entropy": 6.543050241470337, "epoch": 1.1803199743164428, "grad_norm": 1.5078125, "learning_rate": 0.00048705687231404455, "loss": 6.37, "mean_token_accuracy": 0.12795960977673532, "num_tokens": 23863048.0, "step": 11030 }, { "entropy": 6.558866834640503, "epoch": 1.1808550484242066, "grad_norm": 2.234375, "learning_rate": 0.00048704408873224156, "loss": 6.3253, "mean_token_accuracy": 0.1322480097413063, "num_tokens": 23873499.0, "step": 11035 }, { "entropy": 6.527097129821778, "epoch": 1.1813901225319707, "grad_norm": 3.0, "learning_rate": 0.00048703129902769526, "loss": 6.2707, "mean_token_accuracy": 0.13709414824843408, "num_tokens": 23885129.0, "step": 11040 }, { "entropy": 6.608933782577514, "epoch": 1.1819251966397346, "grad_norm": 1.765625, "learning_rate": 0.0004870185032007751, "loss": 6.3691, "mean_token_accuracy": 0.12893082946538925, "num_tokens": 23895538.0, "step": 11045 }, { "entropy": 6.558342838287354, "epoch": 1.1824602707474985, "grad_norm": 1.8671875, "learning_rate": 0.0004870057012518504, "loss": 6.3903, "mean_token_accuracy": 0.12423129379749298, "num_tokens": 23907341.0, "step": 11050 }, { "entropy": 6.485474681854248, "epoch": 1.1829953448552624, "grad_norm": 1.78125, "learning_rate": 0.00048699289318129087, "loss": 6.2447, "mean_token_accuracy": 0.13878285884857178, "num_tokens": 23918501.0, "step": 11055 }, { "entropy": 6.59085054397583, "epoch": 1.1835304189630265, "grad_norm": 1.6875, "learning_rate": 0.0004869800789894663, "loss": 6.3249, "mean_token_accuracy": 0.13167556896805763, "num_tokens": 23929204.0, "step": 11060 }, { "entropy": 6.554622602462769, "epoch": 1.1840654930707903, "grad_norm": 1.5625, "learning_rate": 0.0004869672586767468, "loss": 6.3536, "mean_token_accuracy": 0.1355223499238491, "num_tokens": 23939855.0, "step": 11065 }, { "entropy": 6.566775178909301, "epoch": 1.1846005671785542, "grad_norm": 1.6484375, "learning_rate": 0.0004869544322435024, "loss": 6.2844, "mean_token_accuracy": 0.1322241321206093, "num_tokens": 23949871.0, "step": 11070 }, { "entropy": 6.572175312042236, "epoch": 1.185135641286318, "grad_norm": 1.6171875, "learning_rate": 0.0004869415996901036, "loss": 6.3977, "mean_token_accuracy": 0.12741668447852134, "num_tokens": 23961650.0, "step": 11075 }, { "entropy": 6.581905651092529, "epoch": 1.1856707153940822, "grad_norm": 1.671875, "learning_rate": 0.0004869287610169209, "loss": 6.4011, "mean_token_accuracy": 0.12726534977555276, "num_tokens": 23973103.0, "step": 11080 }, { "entropy": 6.532610130310059, "epoch": 1.186205789501846, "grad_norm": 1.59375, "learning_rate": 0.000486915916224325, "loss": 6.3323, "mean_token_accuracy": 0.1320612519979477, "num_tokens": 23982972.0, "step": 11085 }, { "entropy": 6.477892637252808, "epoch": 1.18674086360961, "grad_norm": 1.3671875, "learning_rate": 0.0004869030653126868, "loss": 6.2096, "mean_token_accuracy": 0.13647703006863593, "num_tokens": 23993044.0, "step": 11090 }, { "entropy": 6.5596959590911865, "epoch": 1.1872759377173738, "grad_norm": 1.8046875, "learning_rate": 0.0004868902082823774, "loss": 6.28, "mean_token_accuracy": 0.13060884401202202, "num_tokens": 24003871.0, "step": 11095 }, { "entropy": 6.564113616943359, "epoch": 1.1878110118251377, "grad_norm": 1.484375, "learning_rate": 0.0004868773451337679, "loss": 6.3291, "mean_token_accuracy": 0.12881432026624678, "num_tokens": 24014613.0, "step": 11100 }, { "entropy": 6.534707164764404, "epoch": 1.1883460859329018, "grad_norm": 1.6953125, "learning_rate": 0.00048686447586722995, "loss": 6.3303, "mean_token_accuracy": 0.13396827429533004, "num_tokens": 24024172.0, "step": 11105 }, { "entropy": 6.56379804611206, "epoch": 1.1888811600406657, "grad_norm": 1.4765625, "learning_rate": 0.00048685160048313506, "loss": 6.4746, "mean_token_accuracy": 0.12522574216127397, "num_tokens": 24035301.0, "step": 11110 }, { "entropy": 6.6384741306304935, "epoch": 1.1894162341484296, "grad_norm": 1.671875, "learning_rate": 0.00048683871898185486, "loss": 6.3156, "mean_token_accuracy": 0.1386343792080879, "num_tokens": 24045661.0, "step": 11115 }, { "entropy": 6.530051803588867, "epoch": 1.1899513082561934, "grad_norm": 1.5390625, "learning_rate": 0.00048682583136376145, "loss": 6.3107, "mean_token_accuracy": 0.12972315177321433, "num_tokens": 24057027.0, "step": 11120 }, { "entropy": 6.561061763763428, "epoch": 1.1904863823639573, "grad_norm": 1.6875, "learning_rate": 0.0004868129376292269, "loss": 6.4262, "mean_token_accuracy": 0.12427093610167503, "num_tokens": 24068322.0, "step": 11125 }, { "entropy": 6.577089643478393, "epoch": 1.1910214564717214, "grad_norm": 1.8125, "learning_rate": 0.00048680003777862356, "loss": 6.262, "mean_token_accuracy": 0.13514962196350097, "num_tokens": 24078506.0, "step": 11130 }, { "entropy": 6.5337562084198, "epoch": 1.1915565305794853, "grad_norm": 1.546875, "learning_rate": 0.00048678713181232394, "loss": 6.3015, "mean_token_accuracy": 0.13127023577690125, "num_tokens": 24090296.0, "step": 11135 }, { "entropy": 6.478974437713623, "epoch": 1.1920916046872492, "grad_norm": 1.8203125, "learning_rate": 0.00048677421973070063, "loss": 6.3149, "mean_token_accuracy": 0.12612876519560814, "num_tokens": 24101478.0, "step": 11140 }, { "entropy": 6.569290971755981, "epoch": 1.192626678795013, "grad_norm": 1.8515625, "learning_rate": 0.00048676130153412644, "loss": 6.3506, "mean_token_accuracy": 0.13295480459928513, "num_tokens": 24112552.0, "step": 11145 }, { "entropy": 6.528984689712525, "epoch": 1.193161752902777, "grad_norm": 1.4375, "learning_rate": 0.0004867483772229745, "loss": 6.2342, "mean_token_accuracy": 0.13378995954990386, "num_tokens": 24124210.0, "step": 11150 }, { "entropy": 6.576374435424805, "epoch": 1.193696827010541, "grad_norm": 1.625, "learning_rate": 0.0004867354467976178, "loss": 6.3129, "mean_token_accuracy": 0.1304231107234955, "num_tokens": 24133525.0, "step": 11155 }, { "entropy": 6.539589309692383, "epoch": 1.194231901118305, "grad_norm": 2.765625, "learning_rate": 0.00048672251025842994, "loss": 6.3677, "mean_token_accuracy": 0.1295190930366516, "num_tokens": 24145400.0, "step": 11160 }, { "entropy": 6.521314668655395, "epoch": 1.1947669752260688, "grad_norm": 1.6484375, "learning_rate": 0.0004867095676057843, "loss": 6.3647, "mean_token_accuracy": 0.12734123542904854, "num_tokens": 24155596.0, "step": 11165 }, { "entropy": 6.597847414016724, "epoch": 1.1953020493338327, "grad_norm": 1.5625, "learning_rate": 0.00048669661884005467, "loss": 6.3607, "mean_token_accuracy": 0.12178555279970169, "num_tokens": 24166683.0, "step": 11170 }, { "entropy": 6.577947998046875, "epoch": 1.1958371234415965, "grad_norm": 1.765625, "learning_rate": 0.00048668366396161503, "loss": 6.3108, "mean_token_accuracy": 0.13432841673493384, "num_tokens": 24177649.0, "step": 11175 }, { "entropy": 6.522364282608033, "epoch": 1.1963721975493606, "grad_norm": 1.859375, "learning_rate": 0.0004866707029708392, "loss": 6.3413, "mean_token_accuracy": 0.137134151160717, "num_tokens": 24188522.0, "step": 11180 }, { "entropy": 6.529253196716309, "epoch": 1.1969072716571245, "grad_norm": 1.3515625, "learning_rate": 0.0004866577358681015, "loss": 6.3037, "mean_token_accuracy": 0.12979593575000764, "num_tokens": 24199285.0, "step": 11185 }, { "entropy": 6.514498519897461, "epoch": 1.1974423457648884, "grad_norm": 1.5859375, "learning_rate": 0.0004866447626537765, "loss": 6.2671, "mean_token_accuracy": 0.12873406931757927, "num_tokens": 24210929.0, "step": 11190 }, { "entropy": 6.5354969024658205, "epoch": 1.1979774198726523, "grad_norm": 3.5, "learning_rate": 0.0004866317833282387, "loss": 6.3273, "mean_token_accuracy": 0.13138288259506226, "num_tokens": 24221394.0, "step": 11195 }, { "entropy": 6.541649389266968, "epoch": 1.1985124939804164, "grad_norm": 1.6796875, "learning_rate": 0.00048661879789186295, "loss": 6.2726, "mean_token_accuracy": 0.13947225138545036, "num_tokens": 24230297.0, "step": 11200 }, { "entropy": 6.477359199523926, "epoch": 1.1990475680881802, "grad_norm": 2.171875, "learning_rate": 0.00048660580634502415, "loss": 6.4373, "mean_token_accuracy": 0.1276162840425968, "num_tokens": 24241505.0, "step": 11205 }, { "entropy": 6.58246431350708, "epoch": 1.1995826421959441, "grad_norm": 1.46875, "learning_rate": 0.00048659280868809744, "loss": 6.2864, "mean_token_accuracy": 0.13593244180083275, "num_tokens": 24252638.0, "step": 11210 }, { "entropy": 6.544987678527832, "epoch": 1.200117716303708, "grad_norm": 1.7890625, "learning_rate": 0.000486579804921458, "loss": 6.3322, "mean_token_accuracy": 0.13251487016677857, "num_tokens": 24263156.0, "step": 11215 }, { "entropy": 6.491865015029907, "epoch": 1.200652790411472, "grad_norm": 1.9140625, "learning_rate": 0.00048656679504548145, "loss": 6.2094, "mean_token_accuracy": 0.14105861783027648, "num_tokens": 24274384.0, "step": 11220 }, { "entropy": 6.590060424804688, "epoch": 1.201187864519236, "grad_norm": 1.6953125, "learning_rate": 0.0004865537790605435, "loss": 6.4135, "mean_token_accuracy": 0.1250110797584057, "num_tokens": 24285159.0, "step": 11225 }, { "entropy": 6.5946595668792725, "epoch": 1.2017229386269999, "grad_norm": 2.0, "learning_rate": 0.0004865407569670198, "loss": 6.3782, "mean_token_accuracy": 0.12558842301368714, "num_tokens": 24296202.0, "step": 11230 }, { "entropy": 6.573181533813477, "epoch": 1.2022580127347637, "grad_norm": 1.3203125, "learning_rate": 0.0004865277287652866, "loss": 6.3131, "mean_token_accuracy": 0.13199632614850998, "num_tokens": 24306691.0, "step": 11235 }, { "entropy": 6.529475450515747, "epoch": 1.2027930868425276, "grad_norm": 2.59375, "learning_rate": 0.0004865146944557199, "loss": 6.3309, "mean_token_accuracy": 0.13316164761781693, "num_tokens": 24317499.0, "step": 11240 }, { "entropy": 6.524376726150512, "epoch": 1.2033281609502917, "grad_norm": 1.5078125, "learning_rate": 0.0004865016540386961, "loss": 6.3271, "mean_token_accuracy": 0.12565939500927925, "num_tokens": 24328096.0, "step": 11245 }, { "entropy": 6.5775762557983395, "epoch": 1.2038632350580556, "grad_norm": 1.578125, "learning_rate": 0.00048648860751459173, "loss": 6.3148, "mean_token_accuracy": 0.12669195979833603, "num_tokens": 24338188.0, "step": 11250 }, { "entropy": 6.611456346511841, "epoch": 1.2043983091658195, "grad_norm": 1.6015625, "learning_rate": 0.00048647555488378355, "loss": 6.3508, "mean_token_accuracy": 0.1369207866489887, "num_tokens": 24348578.0, "step": 11255 }, { "entropy": 6.4663220882415775, "epoch": 1.2049333832735833, "grad_norm": 1.3984375, "learning_rate": 0.0004864624961466485, "loss": 6.316, "mean_token_accuracy": 0.13434598073363305, "num_tokens": 24358807.0, "step": 11260 }, { "entropy": 6.532084560394287, "epoch": 1.2054684573813472, "grad_norm": 1.953125, "learning_rate": 0.0004864494313035635, "loss": 6.3274, "mean_token_accuracy": 0.12798592671751977, "num_tokens": 24369074.0, "step": 11265 }, { "entropy": 6.560862922668457, "epoch": 1.2060035314891113, "grad_norm": 2.359375, "learning_rate": 0.000486436360354906, "loss": 6.2862, "mean_token_accuracy": 0.13494868949055672, "num_tokens": 24380655.0, "step": 11270 }, { "entropy": 6.523475408554077, "epoch": 1.2065386055968752, "grad_norm": 1.59375, "learning_rate": 0.00048642328330105323, "loss": 6.298, "mean_token_accuracy": 0.1289362497627735, "num_tokens": 24391701.0, "step": 11275 }, { "entropy": 6.4451531887054445, "epoch": 1.207073679704639, "grad_norm": 2.640625, "learning_rate": 0.00048641020014238286, "loss": 6.3675, "mean_token_accuracy": 0.1261564612388611, "num_tokens": 24403690.0, "step": 11280 }, { "entropy": 6.575537538528442, "epoch": 1.207608753812403, "grad_norm": 1.8125, "learning_rate": 0.0004863971108792727, "loss": 6.3536, "mean_token_accuracy": 0.13011251464486123, "num_tokens": 24414670.0, "step": 11285 }, { "entropy": 6.56957893371582, "epoch": 1.2081438279201668, "grad_norm": 1.625, "learning_rate": 0.00048638401551210063, "loss": 6.392, "mean_token_accuracy": 0.12319833263754845, "num_tokens": 24425237.0, "step": 11290 }, { "entropy": 6.624338102340698, "epoch": 1.208678902027931, "grad_norm": 1.6015625, "learning_rate": 0.00048637091404124484, "loss": 6.3556, "mean_token_accuracy": 0.12925269529223443, "num_tokens": 24437142.0, "step": 11295 }, { "entropy": 6.535131216049194, "epoch": 1.2092139761356948, "grad_norm": 1.5390625, "learning_rate": 0.0004863578064670837, "loss": 6.2612, "mean_token_accuracy": 0.13685486912727357, "num_tokens": 24448819.0, "step": 11300 }, { "entropy": 6.461548089981079, "epoch": 1.2097490502434587, "grad_norm": 1.7890625, "learning_rate": 0.00048634469278999545, "loss": 6.2061, "mean_token_accuracy": 0.13641059249639512, "num_tokens": 24459392.0, "step": 11305 }, { "entropy": 6.54414005279541, "epoch": 1.2102841243512226, "grad_norm": 1.609375, "learning_rate": 0.00048633157301035895, "loss": 6.3116, "mean_token_accuracy": 0.13257984444499016, "num_tokens": 24470298.0, "step": 11310 }, { "entropy": 6.531377696990967, "epoch": 1.2108191984589864, "grad_norm": 1.484375, "learning_rate": 0.000486318447128553, "loss": 6.2782, "mean_token_accuracy": 0.13613951429724694, "num_tokens": 24480477.0, "step": 11315 }, { "entropy": 6.52601203918457, "epoch": 1.2113542725667505, "grad_norm": 1.5078125, "learning_rate": 0.0004863053151449566, "loss": 6.3621, "mean_token_accuracy": 0.12074363008141517, "num_tokens": 24491890.0, "step": 11320 }, { "entropy": 6.586244249343872, "epoch": 1.2118893466745144, "grad_norm": 1.5546875, "learning_rate": 0.00048629217705994883, "loss": 6.3083, "mean_token_accuracy": 0.13098841160535812, "num_tokens": 24502583.0, "step": 11325 }, { "entropy": 6.6022148609161375, "epoch": 1.2124244207822783, "grad_norm": 1.7265625, "learning_rate": 0.0004862790328739091, "loss": 6.4024, "mean_token_accuracy": 0.12709670886397362, "num_tokens": 24514491.0, "step": 11330 }, { "entropy": 6.534934377670288, "epoch": 1.2129594948900422, "grad_norm": 1.6796875, "learning_rate": 0.00048626588258721717, "loss": 6.2358, "mean_token_accuracy": 0.1416369266808033, "num_tokens": 24524788.0, "step": 11335 }, { "entropy": 6.484699773788452, "epoch": 1.2134945689978063, "grad_norm": 2.09375, "learning_rate": 0.0004862527262002524, "loss": 6.2805, "mean_token_accuracy": 0.1266206443309784, "num_tokens": 24535699.0, "step": 11340 }, { "entropy": 6.476378440856934, "epoch": 1.2140296431055702, "grad_norm": 1.4609375, "learning_rate": 0.00048623956371339494, "loss": 6.2961, "mean_token_accuracy": 0.13135870769619942, "num_tokens": 24547339.0, "step": 11345 }, { "entropy": 6.561729049682617, "epoch": 1.214564717213334, "grad_norm": 1.8984375, "learning_rate": 0.00048622639512702477, "loss": 6.4041, "mean_token_accuracy": 0.12762944996356965, "num_tokens": 24558778.0, "step": 11350 }, { "entropy": 6.593435049057007, "epoch": 1.215099791321098, "grad_norm": 1.4375, "learning_rate": 0.00048621322044152207, "loss": 6.315, "mean_token_accuracy": 0.13191851750016212, "num_tokens": 24569032.0, "step": 11355 }, { "entropy": 6.583175373077393, "epoch": 1.215634865428862, "grad_norm": 1.6328125, "learning_rate": 0.00048620003965726727, "loss": 6.3928, "mean_token_accuracy": 0.11859198734164238, "num_tokens": 24581356.0, "step": 11360 }, { "entropy": 6.534153842926026, "epoch": 1.2161699395366259, "grad_norm": 1.6171875, "learning_rate": 0.00048618685277464116, "loss": 6.2689, "mean_token_accuracy": 0.13176984637975692, "num_tokens": 24591809.0, "step": 11365 }, { "entropy": 6.411161661148071, "epoch": 1.2167050136443898, "grad_norm": 2.390625, "learning_rate": 0.00048617365979402417, "loss": 6.2104, "mean_token_accuracy": 0.13641507998108865, "num_tokens": 24603492.0, "step": 11370 }, { "entropy": 6.517438983917236, "epoch": 1.2172400877521536, "grad_norm": 1.7109375, "learning_rate": 0.0004861604607157975, "loss": 6.3692, "mean_token_accuracy": 0.1288558103144169, "num_tokens": 24614837.0, "step": 11375 }, { "entropy": 6.6012519836425785, "epoch": 1.2177751618599175, "grad_norm": 1.5390625, "learning_rate": 0.0004861472555403423, "loss": 6.3529, "mean_token_accuracy": 0.13232268989086152, "num_tokens": 24624714.0, "step": 11380 }, { "entropy": 6.557205009460449, "epoch": 1.2183102359676816, "grad_norm": 1.7109375, "learning_rate": 0.00048613404426803964, "loss": 6.4042, "mean_token_accuracy": 0.12305559441447259, "num_tokens": 24635758.0, "step": 11385 }, { "entropy": 6.575355005264282, "epoch": 1.2188453100754455, "grad_norm": 2.453125, "learning_rate": 0.00048612082689927116, "loss": 6.3542, "mean_token_accuracy": 0.13127371445298194, "num_tokens": 24645362.0, "step": 11390 }, { "entropy": 6.561426973342895, "epoch": 1.2193803841832094, "grad_norm": 1.6640625, "learning_rate": 0.0004861076034344185, "loss": 6.3679, "mean_token_accuracy": 0.12842421904206275, "num_tokens": 24656898.0, "step": 11395 }, { "entropy": 6.53923807144165, "epoch": 1.2199154582909733, "grad_norm": 1.6171875, "learning_rate": 0.0004860943738738634, "loss": 6.3062, "mean_token_accuracy": 0.13347529992461205, "num_tokens": 24668191.0, "step": 11400 }, { "entropy": 6.624059057235717, "epoch": 1.2204505323987371, "grad_norm": 2.4375, "learning_rate": 0.00048608113821798786, "loss": 6.3169, "mean_token_accuracy": 0.13543845787644387, "num_tokens": 24678034.0, "step": 11405 }, { "entropy": 6.529640436172485, "epoch": 1.2209856065065012, "grad_norm": 1.4921875, "learning_rate": 0.0004860678964671743, "loss": 6.3722, "mean_token_accuracy": 0.1315036676824093, "num_tokens": 24689062.0, "step": 11410 }, { "entropy": 6.508565950393677, "epoch": 1.221520680614265, "grad_norm": 1.640625, "learning_rate": 0.00048605464862180474, "loss": 6.3402, "mean_token_accuracy": 0.1287380076944828, "num_tokens": 24699787.0, "step": 11415 }, { "entropy": 6.607008266448974, "epoch": 1.222055754722029, "grad_norm": 1.578125, "learning_rate": 0.0004860413946822619, "loss": 6.2744, "mean_token_accuracy": 0.13421041816473006, "num_tokens": 24711233.0, "step": 11420 }, { "entropy": 6.556663608551025, "epoch": 1.2225908288297929, "grad_norm": 1.609375, "learning_rate": 0.0004860281346489284, "loss": 6.3119, "mean_token_accuracy": 0.12159497067332267, "num_tokens": 24722414.0, "step": 11425 }, { "entropy": 6.543051385879517, "epoch": 1.2231259029375567, "grad_norm": 1.6171875, "learning_rate": 0.0004860148685221873, "loss": 6.3464, "mean_token_accuracy": 0.12858733609318734, "num_tokens": 24733093.0, "step": 11430 }, { "entropy": 6.498806571960449, "epoch": 1.2236609770453208, "grad_norm": 2.453125, "learning_rate": 0.00048600159630242135, "loss": 6.292, "mean_token_accuracy": 0.1355809085071087, "num_tokens": 24743195.0, "step": 11435 }, { "entropy": 6.597199249267578, "epoch": 1.2241960511530847, "grad_norm": 1.5078125, "learning_rate": 0.00048598831799001406, "loss": 6.3037, "mean_token_accuracy": 0.13153010681271554, "num_tokens": 24753680.0, "step": 11440 }, { "entropy": 6.554786682128906, "epoch": 1.2247311252608486, "grad_norm": 1.4296875, "learning_rate": 0.0004859750335853488, "loss": 6.281, "mean_token_accuracy": 0.13536786139011384, "num_tokens": 24764135.0, "step": 11445 }, { "entropy": 6.403936672210693, "epoch": 1.2252661993686125, "grad_norm": 1.640625, "learning_rate": 0.000485961743088809, "loss": 6.2461, "mean_token_accuracy": 0.14579313546419143, "num_tokens": 24775740.0, "step": 11450 }, { "entropy": 6.5270256996154785, "epoch": 1.2258012734763766, "grad_norm": 1.4921875, "learning_rate": 0.0004859484465007784, "loss": 6.3673, "mean_token_accuracy": 0.12632556781172752, "num_tokens": 24786169.0, "step": 11455 }, { "entropy": 6.585242223739624, "epoch": 1.2263363475841405, "grad_norm": 1.90625, "learning_rate": 0.00048593514382164123, "loss": 6.2608, "mean_token_accuracy": 0.1336404174566269, "num_tokens": 24796218.0, "step": 11460 }, { "entropy": 6.583890581130982, "epoch": 1.2268714216919043, "grad_norm": 1.546875, "learning_rate": 0.0004859218350517814, "loss": 6.3979, "mean_token_accuracy": 0.12642351686954498, "num_tokens": 24806957.0, "step": 11465 }, { "entropy": 6.583371877670288, "epoch": 1.2274064957996682, "grad_norm": 1.6015625, "learning_rate": 0.0004859085201915831, "loss": 6.3354, "mean_token_accuracy": 0.13102125078439714, "num_tokens": 24818761.0, "step": 11470 }, { "entropy": 6.531420612335205, "epoch": 1.227941569907432, "grad_norm": 1.4609375, "learning_rate": 0.0004858951992414311, "loss": 6.2512, "mean_token_accuracy": 0.14173662960529326, "num_tokens": 24829163.0, "step": 11475 }, { "entropy": 6.497774124145508, "epoch": 1.2284766440151962, "grad_norm": 1.5859375, "learning_rate": 0.0004858818722017097, "loss": 6.2629, "mean_token_accuracy": 0.13168734014034272, "num_tokens": 24839334.0, "step": 11480 }, { "entropy": 6.438531589508057, "epoch": 1.22901171812296, "grad_norm": 2.71875, "learning_rate": 0.00048586853907280395, "loss": 6.2939, "mean_token_accuracy": 0.13705965429544448, "num_tokens": 24850312.0, "step": 11485 }, { "entropy": 6.46503438949585, "epoch": 1.229546792230724, "grad_norm": 1.5703125, "learning_rate": 0.0004858551998550987, "loss": 6.2499, "mean_token_accuracy": 0.13945921510457993, "num_tokens": 24861835.0, "step": 11490 }, { "entropy": 6.5869134902954105, "epoch": 1.2300818663384878, "grad_norm": 1.6640625, "learning_rate": 0.00048584185454897925, "loss": 6.3371, "mean_token_accuracy": 0.13292859718203545, "num_tokens": 24872489.0, "step": 11495 }, { "entropy": 6.543988800048828, "epoch": 1.230616940446252, "grad_norm": 1.5859375, "learning_rate": 0.0004858285031548309, "loss": 6.3299, "mean_token_accuracy": 0.1338948406279087, "num_tokens": 24882553.0, "step": 11500 }, { "entropy": 6.562069129943848, "epoch": 1.2311520145540158, "grad_norm": 2.015625, "learning_rate": 0.0004858151456730391, "loss": 6.3451, "mean_token_accuracy": 0.13700807690620423, "num_tokens": 24894386.0, "step": 11505 }, { "entropy": 6.503233861923218, "epoch": 1.2316870886617797, "grad_norm": 1.390625, "learning_rate": 0.00048580178210398954, "loss": 6.3286, "mean_token_accuracy": 0.1292463280260563, "num_tokens": 24905049.0, "step": 11510 }, { "entropy": 6.498210716247558, "epoch": 1.2322221627695435, "grad_norm": 1.9921875, "learning_rate": 0.00048578841244806823, "loss": 6.2857, "mean_token_accuracy": 0.13507410660386085, "num_tokens": 24914831.0, "step": 11515 }, { "entropy": 6.542500925064087, "epoch": 1.2327572368773074, "grad_norm": 1.5234375, "learning_rate": 0.00048577503670566116, "loss": 6.3522, "mean_token_accuracy": 0.1338055945932865, "num_tokens": 24925668.0, "step": 11520 }, { "entropy": 6.526769018173217, "epoch": 1.2332923109850715, "grad_norm": 2.03125, "learning_rate": 0.00048576165487715443, "loss": 6.3151, "mean_token_accuracy": 0.12994013503193855, "num_tokens": 24935983.0, "step": 11525 }, { "entropy": 6.503340578079223, "epoch": 1.2338273850928354, "grad_norm": 1.828125, "learning_rate": 0.00048574826696293455, "loss": 6.286, "mean_token_accuracy": 0.13225105702877044, "num_tokens": 24946673.0, "step": 11530 }, { "entropy": 6.51578311920166, "epoch": 1.2343624592005993, "grad_norm": 1.625, "learning_rate": 0.00048573487296338814, "loss": 6.2233, "mean_token_accuracy": 0.1413614720106125, "num_tokens": 24957075.0, "step": 11535 }, { "entropy": 6.567255687713623, "epoch": 1.2348975333083632, "grad_norm": 1.8203125, "learning_rate": 0.00048572147287890183, "loss": 6.3765, "mean_token_accuracy": 0.12877800017595292, "num_tokens": 24967261.0, "step": 11540 }, { "entropy": 6.520781135559082, "epoch": 1.235432607416127, "grad_norm": 1.9921875, "learning_rate": 0.00048570806670986263, "loss": 6.3025, "mean_token_accuracy": 0.13159753754734993, "num_tokens": 24978097.0, "step": 11545 }, { "entropy": 6.535343837738037, "epoch": 1.2359676815238911, "grad_norm": 3.15625, "learning_rate": 0.00048569465445665754, "loss": 6.3216, "mean_token_accuracy": 0.13654093891382219, "num_tokens": 24987932.0, "step": 11550 }, { "entropy": 6.523883533477783, "epoch": 1.236502755631655, "grad_norm": 1.4921875, "learning_rate": 0.00048568123611967396, "loss": 6.3169, "mean_token_accuracy": 0.1302984580397606, "num_tokens": 24998919.0, "step": 11555 }, { "entropy": 6.539691972732544, "epoch": 1.237037829739419, "grad_norm": 1.46875, "learning_rate": 0.0004856678116992993, "loss": 6.2757, "mean_token_accuracy": 0.13371165171265603, "num_tokens": 25010545.0, "step": 11560 }, { "entropy": 6.553024625778198, "epoch": 1.2375729038471828, "grad_norm": 1.6640625, "learning_rate": 0.0004856543811959212, "loss": 6.2565, "mean_token_accuracy": 0.1440042093396187, "num_tokens": 25021133.0, "step": 11565 }, { "entropy": 6.498435544967651, "epoch": 1.2381079779549466, "grad_norm": 1.71875, "learning_rate": 0.0004856409446099274, "loss": 6.2983, "mean_token_accuracy": 0.1292448416352272, "num_tokens": 25031838.0, "step": 11570 }, { "entropy": 6.48333420753479, "epoch": 1.2386430520627107, "grad_norm": 1.2578125, "learning_rate": 0.00048562750194170595, "loss": 6.3169, "mean_token_accuracy": 0.1293560743331909, "num_tokens": 25042737.0, "step": 11575 }, { "entropy": 6.554791212081909, "epoch": 1.2391781261704746, "grad_norm": 1.78125, "learning_rate": 0.000485614053191645, "loss": 6.4063, "mean_token_accuracy": 0.13055189922451974, "num_tokens": 25054442.0, "step": 11580 }, { "entropy": 6.489489889144897, "epoch": 1.2397132002782385, "grad_norm": 1.4375, "learning_rate": 0.0004856005983601328, "loss": 6.1367, "mean_token_accuracy": 0.1456099934875965, "num_tokens": 25065509.0, "step": 11585 }, { "entropy": 6.5698034286499025, "epoch": 1.2402482743860024, "grad_norm": 1.765625, "learning_rate": 0.00048558713744755794, "loss": 6.3897, "mean_token_accuracy": 0.12442174926400185, "num_tokens": 25077306.0, "step": 11590 }, { "entropy": 6.521883249282837, "epoch": 1.2407833484937665, "grad_norm": 1.859375, "learning_rate": 0.0004855736704543091, "loss": 6.3081, "mean_token_accuracy": 0.13450614660978316, "num_tokens": 25088230.0, "step": 11595 }, { "entropy": 6.6110950946807865, "epoch": 1.2413184226015304, "grad_norm": 1.5546875, "learning_rate": 0.0004855601973807751, "loss": 6.4096, "mean_token_accuracy": 0.12289422452449798, "num_tokens": 25099658.0, "step": 11600 }, { "entropy": 6.573994112014771, "epoch": 1.2418534967092942, "grad_norm": 1.46875, "learning_rate": 0.00048554671822734495, "loss": 6.3072, "mean_token_accuracy": 0.13023086190223693, "num_tokens": 25110512.0, "step": 11605 }, { "entropy": 6.5347192764282225, "epoch": 1.2423885708170581, "grad_norm": 1.953125, "learning_rate": 0.00048553323299440807, "loss": 6.3089, "mean_token_accuracy": 0.13401264771819116, "num_tokens": 25120193.0, "step": 11610 }, { "entropy": 6.528376770019531, "epoch": 1.242923644924822, "grad_norm": 1.6328125, "learning_rate": 0.00048551974168235346, "loss": 6.321, "mean_token_accuracy": 0.12739662155508996, "num_tokens": 25131752.0, "step": 11615 }, { "entropy": 6.599687719345093, "epoch": 1.243458719032586, "grad_norm": 1.5703125, "learning_rate": 0.000485506244291571, "loss": 6.3224, "mean_token_accuracy": 0.13200697377324105, "num_tokens": 25141541.0, "step": 11620 }, { "entropy": 6.466404867172241, "epoch": 1.24399379314035, "grad_norm": 1.703125, "learning_rate": 0.0004854927408224503, "loss": 6.3133, "mean_token_accuracy": 0.1312132328748703, "num_tokens": 25152219.0, "step": 11625 }, { "entropy": 6.591228199005127, "epoch": 1.2445288672481138, "grad_norm": 1.3671875, "learning_rate": 0.00048547923127538126, "loss": 6.335, "mean_token_accuracy": 0.12918494567275046, "num_tokens": 25163030.0, "step": 11630 }, { "entropy": 6.499180746078491, "epoch": 1.2450639413558777, "grad_norm": 1.6171875, "learning_rate": 0.00048546571565075396, "loss": 6.2216, "mean_token_accuracy": 0.13481747061014177, "num_tokens": 25174637.0, "step": 11635 }, { "entropy": 6.426168441772461, "epoch": 1.2455990154636418, "grad_norm": 1.5390625, "learning_rate": 0.0004854521939489587, "loss": 6.2036, "mean_token_accuracy": 0.14389699101448059, "num_tokens": 25185067.0, "step": 11640 }, { "entropy": 6.467606449127198, "epoch": 1.2461340895714057, "grad_norm": 1.3359375, "learning_rate": 0.00048543866617038604, "loss": 6.2433, "mean_token_accuracy": 0.13719036281108857, "num_tokens": 25195046.0, "step": 11645 }, { "entropy": 6.517219161987304, "epoch": 1.2466691636791696, "grad_norm": 1.4453125, "learning_rate": 0.00048542513231542635, "loss": 6.3435, "mean_token_accuracy": 0.12623920813202857, "num_tokens": 25206265.0, "step": 11650 }, { "entropy": 6.581112813949585, "epoch": 1.2472042377869335, "grad_norm": 1.3515625, "learning_rate": 0.0004854115923844705, "loss": 6.3332, "mean_token_accuracy": 0.1283203311264515, "num_tokens": 25217690.0, "step": 11655 }, { "entropy": 6.549913930892944, "epoch": 1.2477393118946973, "grad_norm": 1.6953125, "learning_rate": 0.0004853980463779096, "loss": 6.3369, "mean_token_accuracy": 0.12955136895179747, "num_tokens": 25228229.0, "step": 11660 }, { "entropy": 6.473557043075561, "epoch": 1.2482743860024614, "grad_norm": 1.8046875, "learning_rate": 0.0004853844942961346, "loss": 6.2698, "mean_token_accuracy": 0.13080960735678673, "num_tokens": 25240073.0, "step": 11665 }, { "entropy": 6.530133438110352, "epoch": 1.2488094601102253, "grad_norm": 1.3671875, "learning_rate": 0.000485370936139537, "loss": 6.3283, "mean_token_accuracy": 0.1356102332472801, "num_tokens": 25251915.0, "step": 11670 }, { "entropy": 6.512946271896363, "epoch": 1.2493445342179892, "grad_norm": 1.4375, "learning_rate": 0.000485357371908508, "loss": 6.2963, "mean_token_accuracy": 0.1290469728410244, "num_tokens": 25262932.0, "step": 11675 }, { "entropy": 6.533622694015503, "epoch": 1.249879608325753, "grad_norm": 1.703125, "learning_rate": 0.0004853438016034396, "loss": 6.3622, "mean_token_accuracy": 0.12990323528647424, "num_tokens": 25274693.0, "step": 11680 }, { "entropy": 6.59214186668396, "epoch": 1.250414682433517, "grad_norm": 1.3828125, "learning_rate": 0.00048533022522472344, "loss": 6.2521, "mean_token_accuracy": 0.13764603063464165, "num_tokens": 25285359.0, "step": 11685 }, { "entropy": 6.497456979751587, "epoch": 1.250949756541281, "grad_norm": 1.703125, "learning_rate": 0.00048531664277275154, "loss": 6.284, "mean_token_accuracy": 0.12981810346245765, "num_tokens": 25296730.0, "step": 11690 }, { "entropy": 6.502764129638672, "epoch": 1.251484830649045, "grad_norm": 1.8984375, "learning_rate": 0.0004853030542479162, "loss": 6.3198, "mean_token_accuracy": 0.1384017750620842, "num_tokens": 25306422.0, "step": 11695 }, { "entropy": 6.5642656803131105, "epoch": 1.2520199047568088, "grad_norm": 1.9140625, "learning_rate": 0.0004852894596506096, "loss": 6.3438, "mean_token_accuracy": 0.1314690053462982, "num_tokens": 25317980.0, "step": 11700 }, { "entropy": 6.534403991699219, "epoch": 1.2525549788645727, "grad_norm": 1.921875, "learning_rate": 0.0004852758589812245, "loss": 6.3699, "mean_token_accuracy": 0.13768871873617172, "num_tokens": 25329905.0, "step": 11705 }, { "entropy": 6.602970790863037, "epoch": 1.2530900529723366, "grad_norm": 1.59375, "learning_rate": 0.00048526225224015355, "loss": 6.3306, "mean_token_accuracy": 0.12489748820662498, "num_tokens": 25340759.0, "step": 11710 }, { "entropy": 6.553256988525391, "epoch": 1.2536251270801007, "grad_norm": 1.5703125, "learning_rate": 0.0004852486394277896, "loss": 6.3526, "mean_token_accuracy": 0.12719984650611876, "num_tokens": 25351124.0, "step": 11715 }, { "entropy": 6.591535377502441, "epoch": 1.2541602011878645, "grad_norm": 2.0, "learning_rate": 0.00048523502054452565, "loss": 6.2829, "mean_token_accuracy": 0.1319223664700985, "num_tokens": 25361337.0, "step": 11720 }, { "entropy": 6.585754776000977, "epoch": 1.2546952752956284, "grad_norm": 1.7109375, "learning_rate": 0.00048522139559075507, "loss": 6.3222, "mean_token_accuracy": 0.13189950287342073, "num_tokens": 25371893.0, "step": 11725 }, { "entropy": 6.456956672668457, "epoch": 1.2552303494033923, "grad_norm": 1.6328125, "learning_rate": 0.0004852077645668712, "loss": 6.206, "mean_token_accuracy": 0.14131250604987144, "num_tokens": 25383365.0, "step": 11730 }, { "entropy": 6.5274192810058596, "epoch": 1.2557654235111562, "grad_norm": 1.7109375, "learning_rate": 0.0004851941274732678, "loss": 6.3123, "mean_token_accuracy": 0.13500531166791915, "num_tokens": 25393211.0, "step": 11735 }, { "entropy": 6.4369782447814945, "epoch": 1.2563004976189203, "grad_norm": 1.4609375, "learning_rate": 0.0004851804843103384, "loss": 6.1746, "mean_token_accuracy": 0.13275761157274246, "num_tokens": 25404828.0, "step": 11740 }, { "entropy": 6.571536111831665, "epoch": 1.2568355717266841, "grad_norm": 1.71875, "learning_rate": 0.00048516683507847705, "loss": 6.3314, "mean_token_accuracy": 0.13917914777994156, "num_tokens": 25416016.0, "step": 11745 }, { "entropy": 6.576375675201416, "epoch": 1.257370645834448, "grad_norm": 1.6171875, "learning_rate": 0.0004851531797780779, "loss": 6.2882, "mean_token_accuracy": 0.13366828113794327, "num_tokens": 25426173.0, "step": 11750 }, { "entropy": 6.525392293930054, "epoch": 1.2579057199422121, "grad_norm": 1.6953125, "learning_rate": 0.0004851395184095352, "loss": 6.246, "mean_token_accuracy": 0.138031068444252, "num_tokens": 25437507.0, "step": 11755 }, { "entropy": 6.542758798599243, "epoch": 1.258440794049976, "grad_norm": 1.609375, "learning_rate": 0.0004851258509732434, "loss": 6.3298, "mean_token_accuracy": 0.1226758360862732, "num_tokens": 25448201.0, "step": 11760 }, { "entropy": 6.596157741546631, "epoch": 1.2589758681577399, "grad_norm": 3.265625, "learning_rate": 0.00048511217746959723, "loss": 6.3493, "mean_token_accuracy": 0.13061847537755966, "num_tokens": 25458640.0, "step": 11765 }, { "entropy": 6.558047437667847, "epoch": 1.2595109422655038, "grad_norm": 1.4609375, "learning_rate": 0.00048509849789899146, "loss": 6.3383, "mean_token_accuracy": 0.137232506275177, "num_tokens": 25469474.0, "step": 11770 }, { "entropy": 6.561356449127198, "epoch": 1.2600460163732676, "grad_norm": 1.484375, "learning_rate": 0.000485084812261821, "loss": 6.4076, "mean_token_accuracy": 0.12736963108181953, "num_tokens": 25479565.0, "step": 11775 }, { "entropy": 6.5499156475067135, "epoch": 1.2605810904810317, "grad_norm": 1.46875, "learning_rate": 0.0004850711205584812, "loss": 6.2692, "mean_token_accuracy": 0.1392711654305458, "num_tokens": 25490142.0, "step": 11780 }, { "entropy": 6.516708469390869, "epoch": 1.2611161645887956, "grad_norm": 1.5703125, "learning_rate": 0.00048505742278936726, "loss": 6.3754, "mean_token_accuracy": 0.13398413434624673, "num_tokens": 25500824.0, "step": 11785 }, { "entropy": 6.591862440109253, "epoch": 1.2616512386965595, "grad_norm": 1.5390625, "learning_rate": 0.00048504371895487474, "loss": 6.3129, "mean_token_accuracy": 0.13289703279733658, "num_tokens": 25511251.0, "step": 11790 }, { "entropy": 6.547235202789307, "epoch": 1.2621863128043234, "grad_norm": 1.84375, "learning_rate": 0.00048503000905539945, "loss": 6.2989, "mean_token_accuracy": 0.12680892273783684, "num_tokens": 25521368.0, "step": 11795 }, { "entropy": 6.541527271270752, "epoch": 1.2627213869120872, "grad_norm": 1.4453125, "learning_rate": 0.00048501629309133707, "loss": 6.3076, "mean_token_accuracy": 0.12748572900891303, "num_tokens": 25532486.0, "step": 11800 }, { "entropy": 6.5395254611969, "epoch": 1.2632564610198513, "grad_norm": 1.484375, "learning_rate": 0.0004850025710630838, "loss": 6.3163, "mean_token_accuracy": 0.13559018895030023, "num_tokens": 25542867.0, "step": 11805 }, { "entropy": 6.500273132324219, "epoch": 1.2637915351276152, "grad_norm": 1.671875, "learning_rate": 0.00048498884297103575, "loss": 6.2761, "mean_token_accuracy": 0.1332220569252968, "num_tokens": 25553564.0, "step": 11810 }, { "entropy": 6.533845472335815, "epoch": 1.264326609235379, "grad_norm": 1.3125, "learning_rate": 0.0004849751088155894, "loss": 6.2803, "mean_token_accuracy": 0.13092882707715034, "num_tokens": 25564017.0, "step": 11815 }, { "entropy": 6.506636095046997, "epoch": 1.264861683343143, "grad_norm": 1.2265625, "learning_rate": 0.0004849613685971413, "loss": 6.2117, "mean_token_accuracy": 0.13756049647927285, "num_tokens": 25575125.0, "step": 11820 }, { "entropy": 6.572484350204467, "epoch": 1.2653967574509069, "grad_norm": 2.78125, "learning_rate": 0.0004849476223160882, "loss": 6.3677, "mean_token_accuracy": 0.12898685410618782, "num_tokens": 25586405.0, "step": 11825 }, { "entropy": 6.514791965484619, "epoch": 1.265931831558671, "grad_norm": 1.6875, "learning_rate": 0.0004849338699728269, "loss": 6.3329, "mean_token_accuracy": 0.12814901471138002, "num_tokens": 25597494.0, "step": 11830 }, { "entropy": 6.529297876358032, "epoch": 1.2664669056664348, "grad_norm": 1.6484375, "learning_rate": 0.00048492011156775467, "loss": 6.2773, "mean_token_accuracy": 0.13860967606306077, "num_tokens": 25608425.0, "step": 11835 }, { "entropy": 6.5342460632324215, "epoch": 1.2670019797741987, "grad_norm": 1.78125, "learning_rate": 0.0004849063471012688, "loss": 6.2997, "mean_token_accuracy": 0.1266927093267441, "num_tokens": 25619411.0, "step": 11840 }, { "entropy": 6.566569089889526, "epoch": 1.2675370538819626, "grad_norm": 1.3515625, "learning_rate": 0.0004848925765737665, "loss": 6.3383, "mean_token_accuracy": 0.12526525929570198, "num_tokens": 25630477.0, "step": 11845 }, { "entropy": 6.587625980377197, "epoch": 1.2680721279897265, "grad_norm": 1.34375, "learning_rate": 0.00048487879998564565, "loss": 6.2614, "mean_token_accuracy": 0.1306361250579357, "num_tokens": 25640129.0, "step": 11850 }, { "entropy": 6.512728309631347, "epoch": 1.2686072020974906, "grad_norm": 1.4921875, "learning_rate": 0.00048486501733730386, "loss": 6.3371, "mean_token_accuracy": 0.132972913980484, "num_tokens": 25650592.0, "step": 11855 }, { "entropy": 6.506902265548706, "epoch": 1.2691422762052544, "grad_norm": 1.3828125, "learning_rate": 0.00048485122862913934, "loss": 6.2482, "mean_token_accuracy": 0.1407736212015152, "num_tokens": 25660408.0, "step": 11860 }, { "entropy": 6.493857097625733, "epoch": 1.2696773503130183, "grad_norm": 1.609375, "learning_rate": 0.00048483743386154994, "loss": 6.3532, "mean_token_accuracy": 0.13489907830953599, "num_tokens": 25671563.0, "step": 11865 }, { "entropy": 6.558619737625122, "epoch": 1.2702124244207824, "grad_norm": 1.5390625, "learning_rate": 0.00048482363303493415, "loss": 6.2846, "mean_token_accuracy": 0.13159688413143159, "num_tokens": 25682474.0, "step": 11870 }, { "entropy": 6.642208576202393, "epoch": 1.270747498528546, "grad_norm": 1.3046875, "learning_rate": 0.0004848098261496905, "loss": 6.299, "mean_token_accuracy": 0.12964960634708406, "num_tokens": 25692594.0, "step": 11875 }, { "entropy": 6.392217111587525, "epoch": 1.2712825726363102, "grad_norm": 1.46875, "learning_rate": 0.0004847960132062175, "loss": 6.1265, "mean_token_accuracy": 0.1474221259355545, "num_tokens": 25703724.0, "step": 11880 }, { "entropy": 6.513773727416992, "epoch": 1.271817646744074, "grad_norm": 1.6015625, "learning_rate": 0.0004847821942049142, "loss": 6.4354, "mean_token_accuracy": 0.11740069463849068, "num_tokens": 25714911.0, "step": 11885 }, { "entropy": 6.638753223419189, "epoch": 1.272352720851838, "grad_norm": 1.8828125, "learning_rate": 0.00048476836914617945, "loss": 6.3143, "mean_token_accuracy": 0.13183923736214637, "num_tokens": 25725098.0, "step": 11890 }, { "entropy": 6.572930812835693, "epoch": 1.272887794959602, "grad_norm": 1.7890625, "learning_rate": 0.00048475453803041254, "loss": 6.2628, "mean_token_accuracy": 0.12592896148562432, "num_tokens": 25735099.0, "step": 11895 }, { "entropy": 6.4913472652435305, "epoch": 1.273422869067366, "grad_norm": 1.8125, "learning_rate": 0.0004847407008580128, "loss": 6.2883, "mean_token_accuracy": 0.13161098584532738, "num_tokens": 25746852.0, "step": 11900 }, { "entropy": 6.512494039535523, "epoch": 1.2739579431751298, "grad_norm": 1.609375, "learning_rate": 0.00048472685762937983, "loss": 6.3398, "mean_token_accuracy": 0.13382739797234536, "num_tokens": 25758579.0, "step": 11905 }, { "entropy": 6.512800168991089, "epoch": 1.2744930172828937, "grad_norm": 1.515625, "learning_rate": 0.00048471300834491325, "loss": 6.3187, "mean_token_accuracy": 0.13117347955703734, "num_tokens": 25769965.0, "step": 11910 }, { "entropy": 6.554977321624756, "epoch": 1.2750280913906575, "grad_norm": 1.5625, "learning_rate": 0.0004846991530050132, "loss": 6.3298, "mean_token_accuracy": 0.1322600245475769, "num_tokens": 25780264.0, "step": 11915 }, { "entropy": 6.54880313873291, "epoch": 1.2755631654984216, "grad_norm": 1.8125, "learning_rate": 0.0004846852916100794, "loss": 6.2496, "mean_token_accuracy": 0.13358540534973146, "num_tokens": 25791228.0, "step": 11920 }, { "entropy": 6.540342521667481, "epoch": 1.2760982396061855, "grad_norm": 1.765625, "learning_rate": 0.0004846714241605123, "loss": 6.2482, "mean_token_accuracy": 0.1332520917057991, "num_tokens": 25802428.0, "step": 11925 }, { "entropy": 6.563567304611206, "epoch": 1.2766333137139494, "grad_norm": 1.4140625, "learning_rate": 0.00048465755065671233, "loss": 6.3134, "mean_token_accuracy": 0.1317474439740181, "num_tokens": 25814220.0, "step": 11930 }, { "entropy": 6.554912805557251, "epoch": 1.2771683878217133, "grad_norm": 2.390625, "learning_rate": 0.00048464367109908005, "loss": 6.3203, "mean_token_accuracy": 0.12791907414793968, "num_tokens": 25824382.0, "step": 11935 }, { "entropy": 6.450937795639038, "epoch": 1.2777034619294771, "grad_norm": 1.421875, "learning_rate": 0.0004846297854880162, "loss": 6.2752, "mean_token_accuracy": 0.1334068424999714, "num_tokens": 25834896.0, "step": 11940 }, { "entropy": 6.576845788955689, "epoch": 1.2782385360372412, "grad_norm": 1.71875, "learning_rate": 0.00048461589382392176, "loss": 6.3812, "mean_token_accuracy": 0.12662025466561316, "num_tokens": 25847300.0, "step": 11945 }, { "entropy": 6.584928846359253, "epoch": 1.2787736101450051, "grad_norm": 1.3671875, "learning_rate": 0.0004846019961071978, "loss": 6.3156, "mean_token_accuracy": 0.13572727739810944, "num_tokens": 25858599.0, "step": 11950 }, { "entropy": 6.483222579956054, "epoch": 1.279308684252769, "grad_norm": 1.78125, "learning_rate": 0.0004845880923382457, "loss": 6.275, "mean_token_accuracy": 0.13509821593761445, "num_tokens": 25869135.0, "step": 11955 }, { "entropy": 6.516763973236084, "epoch": 1.2798437583605329, "grad_norm": 1.59375, "learning_rate": 0.00048457418251746695, "loss": 6.2639, "mean_token_accuracy": 0.13429969400167466, "num_tokens": 25879234.0, "step": 11960 }, { "entropy": 6.5868120193481445, "epoch": 1.2803788324682968, "grad_norm": 1.734375, "learning_rate": 0.0004845602666452629, "loss": 6.3051, "mean_token_accuracy": 0.13416241556406022, "num_tokens": 25888230.0, "step": 11965 }, { "entropy": 6.562831401824951, "epoch": 1.2809139065760609, "grad_norm": 1.84375, "learning_rate": 0.0004845463447220358, "loss": 6.3312, "mean_token_accuracy": 0.14075978919863702, "num_tokens": 25899429.0, "step": 11970 }, { "entropy": 6.486060523986817, "epoch": 1.2814489806838247, "grad_norm": 2.015625, "learning_rate": 0.0004845324167481874, "loss": 6.2135, "mean_token_accuracy": 0.14120842665433883, "num_tokens": 25911042.0, "step": 11975 }, { "entropy": 6.555566024780274, "epoch": 1.2819840547915886, "grad_norm": 1.59375, "learning_rate": 0.0004845184827241199, "loss": 6.2712, "mean_token_accuracy": 0.13459475412964822, "num_tokens": 25921466.0, "step": 11980 }, { "entropy": 6.56078405380249, "epoch": 1.2825191288993525, "grad_norm": 1.453125, "learning_rate": 0.0004845045426502357, "loss": 6.3848, "mean_token_accuracy": 0.1237009696662426, "num_tokens": 25931059.0, "step": 11985 }, { "entropy": 6.523500299453735, "epoch": 1.2830542030071164, "grad_norm": 1.671875, "learning_rate": 0.00048449059652693724, "loss": 6.2997, "mean_token_accuracy": 0.1334775298833847, "num_tokens": 25941669.0, "step": 11990 }, { "entropy": 6.488269805908203, "epoch": 1.2835892771148805, "grad_norm": 1.4296875, "learning_rate": 0.0004844766443546272, "loss": 6.3041, "mean_token_accuracy": 0.13760485649108886, "num_tokens": 25952066.0, "step": 11995 }, { "entropy": 6.551593017578125, "epoch": 1.2841243512226443, "grad_norm": 1.984375, "learning_rate": 0.0004844626861337085, "loss": 6.2276, "mean_token_accuracy": 0.1375007748603821, "num_tokens": 25962388.0, "step": 12000 }, { "epoch": 1.2841243512226443, "eval_entropy": 6.386375296148007, "eval_loss": 6.437783241271973, "eval_mean_token_accuracy": 0.13334858964907753, "eval_num_tokens": 25962388.0, "eval_runtime": 22.5367, "eval_samples_per_second": 1316.92, "eval_steps_per_second": 164.621, "step": 12000 }, { "entropy": 6.476883220672607, "epoch": 1.2846594253304082, "grad_norm": 1.4296875, "learning_rate": 0.0004844487218645843, "loss": 6.2774, "mean_token_accuracy": 0.13293329626321793, "num_tokens": 25973865.0, "step": 12005 }, { "entropy": 6.5142007827758786, "epoch": 1.2851944994381723, "grad_norm": 1.46875, "learning_rate": 0.0004844347515476575, "loss": 6.2843, "mean_token_accuracy": 0.13389490097761153, "num_tokens": 25985113.0, "step": 12010 }, { "entropy": 6.539774703979492, "epoch": 1.285729573545936, "grad_norm": 1.5078125, "learning_rate": 0.00048442077518333175, "loss": 6.1853, "mean_token_accuracy": 0.1449642926454544, "num_tokens": 25995980.0, "step": 12015 }, { "entropy": 6.491984510421753, "epoch": 1.2862646476537, "grad_norm": 1.53125, "learning_rate": 0.00048440679277201063, "loss": 6.2924, "mean_token_accuracy": 0.13728865012526512, "num_tokens": 26006362.0, "step": 12020 }, { "entropy": 6.5380847454071045, "epoch": 1.286799721761464, "grad_norm": 1.4609375, "learning_rate": 0.00048439280431409774, "loss": 6.3672, "mean_token_accuracy": 0.13121474161744118, "num_tokens": 26016623.0, "step": 12025 }, { "entropy": 6.455700159072876, "epoch": 1.2873347958692278, "grad_norm": 1.5390625, "learning_rate": 0.00048437880980999694, "loss": 6.1831, "mean_token_accuracy": 0.13906619623303412, "num_tokens": 26027202.0, "step": 12030 }, { "entropy": 6.473853254318238, "epoch": 1.287869869976992, "grad_norm": 1.4609375, "learning_rate": 0.0004843648092601125, "loss": 6.2931, "mean_token_accuracy": 0.12801167741417885, "num_tokens": 26037330.0, "step": 12035 }, { "entropy": 6.525657653808594, "epoch": 1.2884049440847558, "grad_norm": 1.3671875, "learning_rate": 0.0004843508026648487, "loss": 6.2985, "mean_token_accuracy": 0.13337891325354576, "num_tokens": 26047661.0, "step": 12040 }, { "entropy": 6.634007549285888, "epoch": 1.2889400181925197, "grad_norm": 1.671875, "learning_rate": 0.0004843367900246098, "loss": 6.3625, "mean_token_accuracy": 0.12507258877158164, "num_tokens": 26058582.0, "step": 12045 }, { "entropy": 6.537368679046631, "epoch": 1.2894750923002836, "grad_norm": 1.3203125, "learning_rate": 0.00048432277133980055, "loss": 6.3396, "mean_token_accuracy": 0.12189410924911499, "num_tokens": 26069117.0, "step": 12050 }, { "entropy": 6.537881183624267, "epoch": 1.2900101664080474, "grad_norm": 1.5703125, "learning_rate": 0.00048430874661082565, "loss": 6.3088, "mean_token_accuracy": 0.12988518327474594, "num_tokens": 26079327.0, "step": 12055 }, { "entropy": 6.580955171585083, "epoch": 1.2905452405158115, "grad_norm": 1.8359375, "learning_rate": 0.00048429471583809016, "loss": 6.3018, "mean_token_accuracy": 0.13474506214261056, "num_tokens": 26090709.0, "step": 12060 }, { "entropy": 6.6343930721282955, "epoch": 1.2910803146235754, "grad_norm": 1.7421875, "learning_rate": 0.0004842806790219991, "loss": 6.3157, "mean_token_accuracy": 0.12702692076563835, "num_tokens": 26101570.0, "step": 12065 }, { "entropy": 6.503259086608887, "epoch": 1.2916153887313393, "grad_norm": 2.375, "learning_rate": 0.00048426663616295783, "loss": 6.2787, "mean_token_accuracy": 0.13804319500923157, "num_tokens": 26112827.0, "step": 12070 }, { "entropy": 6.492285490036011, "epoch": 1.2921504628391032, "grad_norm": 1.4140625, "learning_rate": 0.00048425258726137187, "loss": 6.352, "mean_token_accuracy": 0.1263483129441738, "num_tokens": 26124141.0, "step": 12075 }, { "entropy": 6.516628980636597, "epoch": 1.292685536946867, "grad_norm": 1.875, "learning_rate": 0.00048423853231764684, "loss": 6.2953, "mean_token_accuracy": 0.13210719525814058, "num_tokens": 26135372.0, "step": 12080 }, { "entropy": 6.52798318862915, "epoch": 1.2932206110546312, "grad_norm": 1.6875, "learning_rate": 0.00048422447133218867, "loss": 6.2557, "mean_token_accuracy": 0.13133319541811944, "num_tokens": 26145933.0, "step": 12085 }, { "entropy": 6.561259794235229, "epoch": 1.293755685162395, "grad_norm": 2.0, "learning_rate": 0.00048421040430540323, "loss": 6.3508, "mean_token_accuracy": 0.12620900720357894, "num_tokens": 26155948.0, "step": 12090 }, { "entropy": 6.478076982498169, "epoch": 1.294290759270159, "grad_norm": 1.6015625, "learning_rate": 0.0004841963312376967, "loss": 6.2383, "mean_token_accuracy": 0.1421545147895813, "num_tokens": 26166410.0, "step": 12095 }, { "entropy": 6.462507247924805, "epoch": 1.2948258333779228, "grad_norm": 1.6484375, "learning_rate": 0.00048418225212947566, "loss": 6.2768, "mean_token_accuracy": 0.13346440643072127, "num_tokens": 26177334.0, "step": 12100 }, { "entropy": 6.6124979019165036, "epoch": 1.2953609074856867, "grad_norm": 1.4140625, "learning_rate": 0.0004841681669811464, "loss": 6.3405, "mean_token_accuracy": 0.12650283202528953, "num_tokens": 26187987.0, "step": 12105 }, { "entropy": 6.576649856567383, "epoch": 1.2958959815934508, "grad_norm": 1.453125, "learning_rate": 0.0004841540757931157, "loss": 6.2985, "mean_token_accuracy": 0.12536120936274528, "num_tokens": 26198600.0, "step": 12110 }, { "entropy": 6.487023544311524, "epoch": 1.2964310557012146, "grad_norm": 1.96875, "learning_rate": 0.0004841399785657904, "loss": 6.3233, "mean_token_accuracy": 0.12932894751429558, "num_tokens": 26210977.0, "step": 12115 }, { "entropy": 6.540788698196411, "epoch": 1.2969661298089785, "grad_norm": 1.359375, "learning_rate": 0.00048412587529957774, "loss": 6.2888, "mean_token_accuracy": 0.1334947131574154, "num_tokens": 26220813.0, "step": 12120 }, { "entropy": 6.564545059204102, "epoch": 1.2975012039167424, "grad_norm": 1.6875, "learning_rate": 0.0004841117659948848, "loss": 6.3286, "mean_token_accuracy": 0.13227230161428452, "num_tokens": 26232042.0, "step": 12125 }, { "entropy": 6.589853429794312, "epoch": 1.2980362780245063, "grad_norm": 1.4921875, "learning_rate": 0.00048409765065211884, "loss": 6.3254, "mean_token_accuracy": 0.13484857305884362, "num_tokens": 26242968.0, "step": 12130 }, { "entropy": 6.575265645980835, "epoch": 1.2985713521322704, "grad_norm": 1.5546875, "learning_rate": 0.00048408352927168774, "loss": 6.3165, "mean_token_accuracy": 0.13241580054163932, "num_tokens": 26252751.0, "step": 12135 }, { "entropy": 6.520197963714599, "epoch": 1.2991064262400343, "grad_norm": 1.5703125, "learning_rate": 0.0004840694018539991, "loss": 6.3804, "mean_token_accuracy": 0.12634991630911827, "num_tokens": 26263270.0, "step": 12140 }, { "entropy": 6.5590331077575685, "epoch": 1.2996415003477981, "grad_norm": 1.703125, "learning_rate": 0.00048405526839946086, "loss": 6.397, "mean_token_accuracy": 0.1273276686668396, "num_tokens": 26274279.0, "step": 12145 }, { "entropy": 6.57621922492981, "epoch": 1.3001765744555622, "grad_norm": 1.9765625, "learning_rate": 0.00048404112890848105, "loss": 6.3838, "mean_token_accuracy": 0.13533301502466202, "num_tokens": 26286020.0, "step": 12150 }, { "entropy": 6.560911464691162, "epoch": 1.3007116485633259, "grad_norm": 1.765625, "learning_rate": 0.00048402698338146803, "loss": 6.3097, "mean_token_accuracy": 0.13460245206952096, "num_tokens": 26296798.0, "step": 12155 }, { "entropy": 6.485049200057984, "epoch": 1.30124672267109, "grad_norm": 1.53125, "learning_rate": 0.0004840128318188303, "loss": 6.2734, "mean_token_accuracy": 0.1385771855711937, "num_tokens": 26306952.0, "step": 12160 }, { "entropy": 6.646480941772461, "epoch": 1.3017817967788539, "grad_norm": 1.90625, "learning_rate": 0.00048399867422097644, "loss": 6.3605, "mean_token_accuracy": 0.13204823806881905, "num_tokens": 26317686.0, "step": 12165 }, { "entropy": 6.595529508590698, "epoch": 1.3023168708866177, "grad_norm": 1.8671875, "learning_rate": 0.00048398451058831514, "loss": 6.3449, "mean_token_accuracy": 0.13236458525061606, "num_tokens": 26327997.0, "step": 12170 }, { "entropy": 6.483434581756592, "epoch": 1.3028519449943818, "grad_norm": 1.6015625, "learning_rate": 0.00048397034092125554, "loss": 6.3319, "mean_token_accuracy": 0.13000286892056465, "num_tokens": 26340227.0, "step": 12175 }, { "entropy": 6.63649435043335, "epoch": 1.3033870191021457, "grad_norm": 1.90625, "learning_rate": 0.00048395616522020667, "loss": 6.4409, "mean_token_accuracy": 0.1249793030321598, "num_tokens": 26350549.0, "step": 12180 }, { "entropy": 6.5887518405914305, "epoch": 1.3039220932099096, "grad_norm": 1.6796875, "learning_rate": 0.0004839419834855779, "loss": 6.3454, "mean_token_accuracy": 0.13172085583209991, "num_tokens": 26361822.0, "step": 12185 }, { "entropy": 6.4851236820220945, "epoch": 1.3044571673176735, "grad_norm": 1.96875, "learning_rate": 0.0004839277957177787, "loss": 6.3407, "mean_token_accuracy": 0.13301774114370346, "num_tokens": 26372720.0, "step": 12190 }, { "entropy": 6.454987621307373, "epoch": 1.3049922414254373, "grad_norm": 1.484375, "learning_rate": 0.0004839136019172188, "loss": 6.3111, "mean_token_accuracy": 0.1354654051363468, "num_tokens": 26383092.0, "step": 12195 }, { "entropy": 6.499829721450806, "epoch": 1.3055273155332014, "grad_norm": 1.734375, "learning_rate": 0.000483899402084308, "loss": 6.2549, "mean_token_accuracy": 0.14037376120686532, "num_tokens": 26395188.0, "step": 12200 }, { "entropy": 6.556978702545166, "epoch": 1.3060623896409653, "grad_norm": 1.5703125, "learning_rate": 0.0004838851962194563, "loss": 6.3664, "mean_token_accuracy": 0.13069112375378608, "num_tokens": 26406338.0, "step": 12205 }, { "entropy": 6.521770095825195, "epoch": 1.3065974637487292, "grad_norm": 2.703125, "learning_rate": 0.0004838709843230739, "loss": 6.3097, "mean_token_accuracy": 0.1294810354709625, "num_tokens": 26416983.0, "step": 12210 }, { "entropy": 6.528356266021729, "epoch": 1.307132537856493, "grad_norm": 1.375, "learning_rate": 0.0004838567663955712, "loss": 6.2598, "mean_token_accuracy": 0.13848564326763152, "num_tokens": 26426966.0, "step": 12215 }, { "entropy": 6.528638315200806, "epoch": 1.307667611964257, "grad_norm": 1.6953125, "learning_rate": 0.0004838425424373587, "loss": 6.2521, "mean_token_accuracy": 0.1309279464185238, "num_tokens": 26437711.0, "step": 12220 }, { "entropy": 6.545057106018066, "epoch": 1.308202686072021, "grad_norm": 1.625, "learning_rate": 0.0004838283124488472, "loss": 6.384, "mean_token_accuracy": 0.13038895800709724, "num_tokens": 26448657.0, "step": 12225 }, { "entropy": 6.607879734039306, "epoch": 1.308737760179785, "grad_norm": 3.71875, "learning_rate": 0.00048381407643044737, "loss": 6.2599, "mean_token_accuracy": 0.13647112473845482, "num_tokens": 26459363.0, "step": 12230 }, { "entropy": 6.498840999603272, "epoch": 1.3092728342875488, "grad_norm": 1.53125, "learning_rate": 0.0004837998343825705, "loss": 6.2933, "mean_token_accuracy": 0.1369725577533245, "num_tokens": 26470149.0, "step": 12235 }, { "entropy": 6.4808508396148685, "epoch": 1.3098079083953127, "grad_norm": 1.40625, "learning_rate": 0.00048378558630562783, "loss": 6.2569, "mean_token_accuracy": 0.13962852880358695, "num_tokens": 26480424.0, "step": 12240 }, { "entropy": 6.498993587493897, "epoch": 1.3103429825030766, "grad_norm": 6.0625, "learning_rate": 0.0004837713322000306, "loss": 6.2919, "mean_token_accuracy": 0.12992604449391365, "num_tokens": 26490312.0, "step": 12245 }, { "entropy": 6.48661847114563, "epoch": 1.3108780566108407, "grad_norm": 1.515625, "learning_rate": 0.0004837570720661905, "loss": 6.2831, "mean_token_accuracy": 0.14373423680663108, "num_tokens": 26501119.0, "step": 12250 }, { "entropy": 6.580825424194336, "epoch": 1.3114131307186045, "grad_norm": 1.78125, "learning_rate": 0.00048374280590451934, "loss": 6.3406, "mean_token_accuracy": 0.13384997844696045, "num_tokens": 26512438.0, "step": 12255 }, { "entropy": 6.5407239437103275, "epoch": 1.3119482048263684, "grad_norm": 1.5625, "learning_rate": 0.00048372853371542895, "loss": 6.2969, "mean_token_accuracy": 0.12450519725680351, "num_tokens": 26523930.0, "step": 12260 }, { "entropy": 6.56227297782898, "epoch": 1.3124832789341323, "grad_norm": 2.359375, "learning_rate": 0.0004837142554993315, "loss": 6.3908, "mean_token_accuracy": 0.13300466015934945, "num_tokens": 26534937.0, "step": 12265 }, { "entropy": 6.476114416122437, "epoch": 1.3130183530418962, "grad_norm": 1.703125, "learning_rate": 0.0004836999712566392, "loss": 6.1802, "mean_token_accuracy": 0.13274189084768295, "num_tokens": 26544555.0, "step": 12270 }, { "entropy": 6.5541692733764645, "epoch": 1.3135534271496603, "grad_norm": 1.5546875, "learning_rate": 0.00048368568098776463, "loss": 6.3383, "mean_token_accuracy": 0.1406101442873478, "num_tokens": 26556144.0, "step": 12275 }, { "entropy": 6.571285533905029, "epoch": 1.3140885012574242, "grad_norm": 1.75, "learning_rate": 0.0004836713846931203, "loss": 6.381, "mean_token_accuracy": 0.1273029126226902, "num_tokens": 26567350.0, "step": 12280 }, { "entropy": 6.56294436454773, "epoch": 1.314623575365188, "grad_norm": 2.53125, "learning_rate": 0.00048365708237311904, "loss": 6.2877, "mean_token_accuracy": 0.13095688074827194, "num_tokens": 26579486.0, "step": 12285 }, { "entropy": 6.5144415378570555, "epoch": 1.3151586494729521, "grad_norm": 1.625, "learning_rate": 0.0004836427740281739, "loss": 6.304, "mean_token_accuracy": 0.13191987350583076, "num_tokens": 26589665.0, "step": 12290 }, { "entropy": 6.529788827896118, "epoch": 1.3156937235807158, "grad_norm": 1.140625, "learning_rate": 0.00048362845965869793, "loss": 6.2901, "mean_token_accuracy": 0.13123327121138573, "num_tokens": 26600187.0, "step": 12295 }, { "entropy": 6.502836656570435, "epoch": 1.31622879768848, "grad_norm": 1.9140625, "learning_rate": 0.0004836141392651046, "loss": 6.2571, "mean_token_accuracy": 0.1337031193077564, "num_tokens": 26612155.0, "step": 12300 }, { "entropy": 6.548255729675293, "epoch": 1.3167638717962438, "grad_norm": 1.9609375, "learning_rate": 0.00048359981284780727, "loss": 6.2977, "mean_token_accuracy": 0.12883710488677025, "num_tokens": 26623077.0, "step": 12305 }, { "entropy": 6.491298675537109, "epoch": 1.3172989459040076, "grad_norm": 1.640625, "learning_rate": 0.0004835854804072196, "loss": 6.2275, "mean_token_accuracy": 0.13802778869867324, "num_tokens": 26632979.0, "step": 12310 }, { "entropy": 6.495585870742798, "epoch": 1.3178340200117717, "grad_norm": 1.6796875, "learning_rate": 0.00048357114194375555, "loss": 6.3398, "mean_token_accuracy": 0.1271979182958603, "num_tokens": 26644377.0, "step": 12315 }, { "entropy": 6.573164081573486, "epoch": 1.3183690941195356, "grad_norm": 1.5390625, "learning_rate": 0.000483556797457829, "loss": 6.3333, "mean_token_accuracy": 0.12611328884959222, "num_tokens": 26655538.0, "step": 12320 }, { "entropy": 6.536789274215698, "epoch": 1.3189041682272995, "grad_norm": 2.59375, "learning_rate": 0.00048354244694985435, "loss": 6.3011, "mean_token_accuracy": 0.12973858788609505, "num_tokens": 26668011.0, "step": 12325 }, { "entropy": 6.486205053329468, "epoch": 1.3194392423350634, "grad_norm": 1.5234375, "learning_rate": 0.0004835280904202457, "loss": 6.3147, "mean_token_accuracy": 0.13040204644203185, "num_tokens": 26678996.0, "step": 12330 }, { "entropy": 6.5596967220306395, "epoch": 1.3199743164428273, "grad_norm": 1.8046875, "learning_rate": 0.0004835137278694178, "loss": 6.266, "mean_token_accuracy": 0.13785816729068756, "num_tokens": 26689041.0, "step": 12335 }, { "entropy": 6.5753649234771725, "epoch": 1.3205093905505914, "grad_norm": 3.46875, "learning_rate": 0.0004834993592977854, "loss": 6.2708, "mean_token_accuracy": 0.13826132118701934, "num_tokens": 26699459.0, "step": 12340 }, { "entropy": 6.549886798858642, "epoch": 1.3210444646583552, "grad_norm": 1.78125, "learning_rate": 0.0004834849847057632, "loss": 6.3928, "mean_token_accuracy": 0.12919416651129723, "num_tokens": 26711663.0, "step": 12345 }, { "entropy": 6.558913803100586, "epoch": 1.321579538766119, "grad_norm": 1.390625, "learning_rate": 0.00048347060409376644, "loss": 6.3523, "mean_token_accuracy": 0.123536217212677, "num_tokens": 26722960.0, "step": 12350 }, { "entropy": 6.54972996711731, "epoch": 1.322114612873883, "grad_norm": 1.5625, "learning_rate": 0.00048345621746221024, "loss": 6.2683, "mean_token_accuracy": 0.13708956986665727, "num_tokens": 26733274.0, "step": 12355 }, { "entropy": 6.5588398456573485, "epoch": 1.3226496869816469, "grad_norm": 1.5390625, "learning_rate": 0.00048344182481151003, "loss": 6.3194, "mean_token_accuracy": 0.12774837762117386, "num_tokens": 26743906.0, "step": 12360 }, { "entropy": 6.462081623077393, "epoch": 1.323184761089411, "grad_norm": 1.4140625, "learning_rate": 0.00048342742614208145, "loss": 6.3161, "mean_token_accuracy": 0.12888485714793205, "num_tokens": 26755093.0, "step": 12365 }, { "entropy": 6.510008096694946, "epoch": 1.3237198351971748, "grad_norm": 3.9375, "learning_rate": 0.0004834130214543402, "loss": 6.2934, "mean_token_accuracy": 0.133803091943264, "num_tokens": 26765614.0, "step": 12370 }, { "entropy": 6.513565587997436, "epoch": 1.3242549093049387, "grad_norm": 1.5625, "learning_rate": 0.00048339861074870227, "loss": 6.3033, "mean_token_accuracy": 0.1330991990864277, "num_tokens": 26778078.0, "step": 12375 }, { "entropy": 6.604484891891479, "epoch": 1.3247899834127026, "grad_norm": 1.8828125, "learning_rate": 0.00048338419402558375, "loss": 6.3154, "mean_token_accuracy": 0.13245146498084068, "num_tokens": 26788707.0, "step": 12380 }, { "entropy": 6.58511905670166, "epoch": 1.3253250575204665, "grad_norm": 1.6328125, "learning_rate": 0.0004833697712854009, "loss": 6.2722, "mean_token_accuracy": 0.13194304704666138, "num_tokens": 26798650.0, "step": 12385 }, { "entropy": 6.517331314086914, "epoch": 1.3258601316282306, "grad_norm": 1.9140625, "learning_rate": 0.00048335534252857016, "loss": 6.3233, "mean_token_accuracy": 0.13552766814827918, "num_tokens": 26809822.0, "step": 12390 }, { "entropy": 6.5462925910949705, "epoch": 1.3263952057359945, "grad_norm": 1.3359375, "learning_rate": 0.0004833409077555082, "loss": 6.3009, "mean_token_accuracy": 0.12845633625984193, "num_tokens": 26821061.0, "step": 12395 }, { "entropy": 6.6133284091949465, "epoch": 1.3269302798437583, "grad_norm": 1.4453125, "learning_rate": 0.00048332646696663177, "loss": 6.3462, "mean_token_accuracy": 0.12829353287816048, "num_tokens": 26832020.0, "step": 12400 }, { "entropy": 6.596477937698364, "epoch": 1.3274653539515222, "grad_norm": 1.6484375, "learning_rate": 0.0004833120201623579, "loss": 6.3353, "mean_token_accuracy": 0.128353201597929, "num_tokens": 26844287.0, "step": 12405 }, { "entropy": 6.412652969360352, "epoch": 1.328000428059286, "grad_norm": 1.8359375, "learning_rate": 0.00048329756734310375, "loss": 6.1728, "mean_token_accuracy": 0.14178198873996734, "num_tokens": 26855790.0, "step": 12410 }, { "entropy": 6.452540540695191, "epoch": 1.3285355021670502, "grad_norm": 1.5859375, "learning_rate": 0.00048328310850928656, "loss": 6.3216, "mean_token_accuracy": 0.134925177693367, "num_tokens": 26867391.0, "step": 12415 }, { "entropy": 6.551491546630859, "epoch": 1.329070576274814, "grad_norm": 1.3515625, "learning_rate": 0.00048326864366132397, "loss": 6.3253, "mean_token_accuracy": 0.13360649049282075, "num_tokens": 26879173.0, "step": 12420 }, { "entropy": 6.559604692459106, "epoch": 1.329605650382578, "grad_norm": 1.859375, "learning_rate": 0.0004832541727996335, "loss": 6.2344, "mean_token_accuracy": 0.13868265673518182, "num_tokens": 26889839.0, "step": 12425 }, { "entropy": 6.486599254608154, "epoch": 1.330140724490342, "grad_norm": 1.3046875, "learning_rate": 0.000483239695924633, "loss": 6.2991, "mean_token_accuracy": 0.13732991963624955, "num_tokens": 26900217.0, "step": 12430 }, { "entropy": 6.532090044021606, "epoch": 1.330675798598106, "grad_norm": 1.71875, "learning_rate": 0.00048322521303674064, "loss": 6.2994, "mean_token_accuracy": 0.13312758281826972, "num_tokens": 26911366.0, "step": 12435 }, { "entropy": 6.597012996673584, "epoch": 1.3312108727058698, "grad_norm": 1.375, "learning_rate": 0.00048321072413637454, "loss": 6.3401, "mean_token_accuracy": 0.12487093731760979, "num_tokens": 26922135.0, "step": 12440 }, { "entropy": 6.551101970672607, "epoch": 1.3317459468136337, "grad_norm": 1.4453125, "learning_rate": 0.0004831962292239529, "loss": 6.2774, "mean_token_accuracy": 0.13313136473298073, "num_tokens": 26932502.0, "step": 12445 }, { "entropy": 6.499680852890014, "epoch": 1.3322810209213976, "grad_norm": 1.75, "learning_rate": 0.00048318172829989447, "loss": 6.3364, "mean_token_accuracy": 0.13847661167383193, "num_tokens": 26944607.0, "step": 12450 }, { "entropy": 6.529852628707886, "epoch": 1.3328160950291617, "grad_norm": 1.4375, "learning_rate": 0.0004831672213646179, "loss": 6.3356, "mean_token_accuracy": 0.1344766914844513, "num_tokens": 26955205.0, "step": 12455 }, { "entropy": 6.512268972396851, "epoch": 1.3333511691369255, "grad_norm": 1.703125, "learning_rate": 0.0004831527084185421, "loss": 6.2131, "mean_token_accuracy": 0.1448250100016594, "num_tokens": 26965558.0, "step": 12460 }, { "entropy": 6.497064542770386, "epoch": 1.3338862432446894, "grad_norm": 2.84375, "learning_rate": 0.000483138189462086, "loss": 6.288, "mean_token_accuracy": 0.13134488835930824, "num_tokens": 26976176.0, "step": 12465 }, { "entropy": 6.550390195846558, "epoch": 1.3344213173524533, "grad_norm": 1.6328125, "learning_rate": 0.00048312366449566895, "loss": 6.35, "mean_token_accuracy": 0.13253561332821845, "num_tokens": 26987099.0, "step": 12470 }, { "entropy": 6.521877908706665, "epoch": 1.3349563914602172, "grad_norm": 1.5546875, "learning_rate": 0.0004831091335197104, "loss": 6.2946, "mean_token_accuracy": 0.13181954994797707, "num_tokens": 26998122.0, "step": 12475 }, { "entropy": 6.4629723072052006, "epoch": 1.3354914655679813, "grad_norm": 1.4609375, "learning_rate": 0.0004830945965346298, "loss": 6.248, "mean_token_accuracy": 0.1338569551706314, "num_tokens": 27009427.0, "step": 12480 }, { "entropy": 6.5822224617004395, "epoch": 1.3360265396757451, "grad_norm": 1.609375, "learning_rate": 0.000483080053540847, "loss": 6.4041, "mean_token_accuracy": 0.12383663654327393, "num_tokens": 27020701.0, "step": 12485 }, { "entropy": 6.582948064804077, "epoch": 1.336561613783509, "grad_norm": 1.5, "learning_rate": 0.0004830655045387818, "loss": 6.3641, "mean_token_accuracy": 0.1241733305156231, "num_tokens": 27033215.0, "step": 12490 }, { "entropy": 6.554017066955566, "epoch": 1.337096687891273, "grad_norm": 1.640625, "learning_rate": 0.00048305094952885453, "loss": 6.3226, "mean_token_accuracy": 0.12772757932543755, "num_tokens": 27043846.0, "step": 12495 }, { "entropy": 6.511205577850342, "epoch": 1.3376317619990368, "grad_norm": 1.59375, "learning_rate": 0.0004830363885114853, "loss": 6.305, "mean_token_accuracy": 0.13151946440339088, "num_tokens": 27054783.0, "step": 12500 }, { "entropy": 6.494199800491333, "epoch": 1.3381668361068009, "grad_norm": 1.578125, "learning_rate": 0.0004830218214870946, "loss": 6.3327, "mean_token_accuracy": 0.1325196735560894, "num_tokens": 27066051.0, "step": 12505 }, { "entropy": 6.558785486221313, "epoch": 1.3387019102145647, "grad_norm": 1.5546875, "learning_rate": 0.0004830072484561029, "loss": 6.3293, "mean_token_accuracy": 0.13402727320790292, "num_tokens": 27078210.0, "step": 12510 }, { "entropy": 6.569102621078491, "epoch": 1.3392369843223286, "grad_norm": 2.03125, "learning_rate": 0.0004829926694189312, "loss": 6.3505, "mean_token_accuracy": 0.12516780570149422, "num_tokens": 27089693.0, "step": 12515 }, { "entropy": 6.528443145751953, "epoch": 1.3397720584300925, "grad_norm": 1.3359375, "learning_rate": 0.0004829780843760005, "loss": 6.3341, "mean_token_accuracy": 0.1275798462331295, "num_tokens": 27099856.0, "step": 12520 }, { "entropy": 6.54946722984314, "epoch": 1.3403071325378564, "grad_norm": 1.984375, "learning_rate": 0.0004829634933277317, "loss": 6.3404, "mean_token_accuracy": 0.1284944772720337, "num_tokens": 27110218.0, "step": 12525 }, { "entropy": 6.52546067237854, "epoch": 1.3408422066456205, "grad_norm": 1.6796875, "learning_rate": 0.00048294889627454636, "loss": 6.2923, "mean_token_accuracy": 0.13666339591145515, "num_tokens": 27120911.0, "step": 12530 }, { "entropy": 6.4948999881744385, "epoch": 1.3413772807533844, "grad_norm": 1.5859375, "learning_rate": 0.00048293429321686585, "loss": 6.2744, "mean_token_accuracy": 0.13520927503705024, "num_tokens": 27130964.0, "step": 12535 }, { "entropy": 6.506992530822754, "epoch": 1.3419123548611482, "grad_norm": 1.859375, "learning_rate": 0.00048291968415511174, "loss": 6.3012, "mean_token_accuracy": 0.1324952982366085, "num_tokens": 27141641.0, "step": 12540 }, { "entropy": 6.544699478149414, "epoch": 1.3424474289689121, "grad_norm": 1.6640625, "learning_rate": 0.00048290506908970607, "loss": 6.3666, "mean_token_accuracy": 0.12738464027643204, "num_tokens": 27152591.0, "step": 12545 }, { "entropy": 6.571207761764526, "epoch": 1.342982503076676, "grad_norm": 1.609375, "learning_rate": 0.0004828904480210707, "loss": 6.4297, "mean_token_accuracy": 0.12691449224948884, "num_tokens": 27163839.0, "step": 12550 }, { "entropy": 6.624313831329346, "epoch": 1.34351757718444, "grad_norm": 1.3046875, "learning_rate": 0.0004828758209496278, "loss": 6.2954, "mean_token_accuracy": 0.13590908646583558, "num_tokens": 27174480.0, "step": 12555 }, { "entropy": 6.500087404251099, "epoch": 1.344052651292204, "grad_norm": 1.890625, "learning_rate": 0.00048286118787579983, "loss": 6.2617, "mean_token_accuracy": 0.13080087080597877, "num_tokens": 27184546.0, "step": 12560 }, { "entropy": 6.451597452163696, "epoch": 1.3445877253999678, "grad_norm": 1.4296875, "learning_rate": 0.00048284654880000933, "loss": 6.1771, "mean_token_accuracy": 0.13953398764133454, "num_tokens": 27195093.0, "step": 12565 }, { "entropy": 6.476680326461792, "epoch": 1.345122799507732, "grad_norm": 1.515625, "learning_rate": 0.00048283190372267886, "loss": 6.3436, "mean_token_accuracy": 0.1333930142223835, "num_tokens": 27206416.0, "step": 12570 }, { "entropy": 6.5952800750732425, "epoch": 1.3456578736154958, "grad_norm": 1.6328125, "learning_rate": 0.0004828172526442314, "loss": 6.2663, "mean_token_accuracy": 0.12958376929163934, "num_tokens": 27215533.0, "step": 12575 }, { "entropy": 6.5549458980560305, "epoch": 1.3461929477232597, "grad_norm": 1.7265625, "learning_rate": 0.00048280259556509, "loss": 6.313, "mean_token_accuracy": 0.13110331296920777, "num_tokens": 27225985.0, "step": 12580 }, { "entropy": 6.515612268447876, "epoch": 1.3467280218310236, "grad_norm": 1.5703125, "learning_rate": 0.0004827879324856778, "loss": 6.2924, "mean_token_accuracy": 0.13066375404596328, "num_tokens": 27235967.0, "step": 12585 }, { "entropy": 6.529239511489868, "epoch": 1.3472630959387875, "grad_norm": 1.453125, "learning_rate": 0.00048277326340641835, "loss": 6.2427, "mean_token_accuracy": 0.1346130132675171, "num_tokens": 27246854.0, "step": 12590 }, { "entropy": 6.448957109451294, "epoch": 1.3477981700465516, "grad_norm": 1.3359375, "learning_rate": 0.000482758588327735, "loss": 6.3627, "mean_token_accuracy": 0.13244736939668655, "num_tokens": 27256640.0, "step": 12595 }, { "entropy": 6.524251413345337, "epoch": 1.3483332441543154, "grad_norm": 1.6953125, "learning_rate": 0.0004827439072500516, "loss": 6.3206, "mean_token_accuracy": 0.12838973328471184, "num_tokens": 27266907.0, "step": 12600 }, { "entropy": 6.599645519256592, "epoch": 1.3488683182620793, "grad_norm": 1.765625, "learning_rate": 0.00048272922017379217, "loss": 6.2754, "mean_token_accuracy": 0.13354076966643333, "num_tokens": 27277089.0, "step": 12605 }, { "entropy": 6.567108678817749, "epoch": 1.3494033923698432, "grad_norm": 2.171875, "learning_rate": 0.0004827145270993807, "loss": 6.2757, "mean_token_accuracy": 0.13490659818053247, "num_tokens": 27286781.0, "step": 12610 }, { "entropy": 6.525397729873657, "epoch": 1.349938466477607, "grad_norm": 1.40625, "learning_rate": 0.0004826998280272414, "loss": 6.302, "mean_token_accuracy": 0.13888752982020378, "num_tokens": 27298011.0, "step": 12615 }, { "entropy": 6.501267433166504, "epoch": 1.3504735405853712, "grad_norm": 1.90625, "learning_rate": 0.00048268512295779873, "loss": 6.3354, "mean_token_accuracy": 0.1331058345735073, "num_tokens": 27309052.0, "step": 12620 }, { "entropy": 6.4906703472137455, "epoch": 1.351008614693135, "grad_norm": 1.53125, "learning_rate": 0.0004826704118914773, "loss": 6.2625, "mean_token_accuracy": 0.1372261181473732, "num_tokens": 27319945.0, "step": 12625 }, { "entropy": 6.496233177185059, "epoch": 1.351543688800899, "grad_norm": 1.6953125, "learning_rate": 0.000482655694828702, "loss": 6.2829, "mean_token_accuracy": 0.14131269082427025, "num_tokens": 27330543.0, "step": 12630 }, { "entropy": 6.551932334899902, "epoch": 1.3520787629086628, "grad_norm": 1.921875, "learning_rate": 0.0004826409717698976, "loss": 6.3359, "mean_token_accuracy": 0.1282445326447487, "num_tokens": 27341957.0, "step": 12635 }, { "entropy": 6.498799562454224, "epoch": 1.3526138370164267, "grad_norm": 1.7109375, "learning_rate": 0.00048262624271548936, "loss": 6.2612, "mean_token_accuracy": 0.1311979576945305, "num_tokens": 27351506.0, "step": 12640 }, { "entropy": 6.543243360519409, "epoch": 1.3531489111241908, "grad_norm": 1.65625, "learning_rate": 0.00048261150766590257, "loss": 6.2408, "mean_token_accuracy": 0.1310368560254574, "num_tokens": 27362208.0, "step": 12645 }, { "entropy": 6.580874872207642, "epoch": 1.3536839852319547, "grad_norm": 1.515625, "learning_rate": 0.00048259676662156263, "loss": 6.279, "mean_token_accuracy": 0.13347921073436736, "num_tokens": 27372890.0, "step": 12650 }, { "entropy": 6.492420673370361, "epoch": 1.3542190593397185, "grad_norm": 1.609375, "learning_rate": 0.0004825820195828952, "loss": 6.2253, "mean_token_accuracy": 0.14195676296949386, "num_tokens": 27382879.0, "step": 12655 }, { "entropy": 6.432550573348999, "epoch": 1.3547541334474824, "grad_norm": 1.5546875, "learning_rate": 0.0004825672665503262, "loss": 6.2608, "mean_token_accuracy": 0.13371035531163217, "num_tokens": 27393878.0, "step": 12660 }, { "entropy": 6.532358169555664, "epoch": 1.3552892075552463, "grad_norm": 1.859375, "learning_rate": 0.0004825525075242815, "loss": 6.3512, "mean_token_accuracy": 0.12923340126872063, "num_tokens": 27404928.0, "step": 12665 }, { "entropy": 6.567361783981323, "epoch": 1.3558242816630104, "grad_norm": 1.65625, "learning_rate": 0.0004825377425051873, "loss": 6.2717, "mean_token_accuracy": 0.13399578258395195, "num_tokens": 27417473.0, "step": 12670 }, { "entropy": 6.553698968887329, "epoch": 1.3563593557707743, "grad_norm": 1.9140625, "learning_rate": 0.00048252297149346997, "loss": 6.358, "mean_token_accuracy": 0.12742808535695077, "num_tokens": 27428378.0, "step": 12675 }, { "entropy": 6.461050653457642, "epoch": 1.3568944298785381, "grad_norm": 2.9375, "learning_rate": 0.00048250819448955595, "loss": 6.2968, "mean_token_accuracy": 0.13851417005062103, "num_tokens": 27438815.0, "step": 12680 }, { "entropy": 6.620155000686646, "epoch": 1.357429503986302, "grad_norm": 2.015625, "learning_rate": 0.000482493411493872, "loss": 6.335, "mean_token_accuracy": 0.13085796013474466, "num_tokens": 27449295.0, "step": 12685 }, { "entropy": 6.530794715881347, "epoch": 1.357964578094066, "grad_norm": 2.359375, "learning_rate": 0.000482478622506845, "loss": 6.2229, "mean_token_accuracy": 0.13837912008166314, "num_tokens": 27459357.0, "step": 12690 }, { "entropy": 6.514059400558471, "epoch": 1.35849965220183, "grad_norm": 1.3671875, "learning_rate": 0.0004824638275289019, "loss": 6.2617, "mean_token_accuracy": 0.13738563656806946, "num_tokens": 27469405.0, "step": 12695 }, { "entropy": 6.534468078613282, "epoch": 1.3590347263095939, "grad_norm": 2.03125, "learning_rate": 0.0004824490265604699, "loss": 6.2681, "mean_token_accuracy": 0.1373660996556282, "num_tokens": 27478818.0, "step": 12700 }, { "entropy": 6.556286001205445, "epoch": 1.3595698004173578, "grad_norm": 1.71875, "learning_rate": 0.0004824342196019764, "loss": 6.227, "mean_token_accuracy": 0.13968622982501983, "num_tokens": 27488631.0, "step": 12705 }, { "entropy": 6.528377485275269, "epoch": 1.3601048745251219, "grad_norm": 1.9921875, "learning_rate": 0.00048241940665384904, "loss": 6.3075, "mean_token_accuracy": 0.13143832832574845, "num_tokens": 27500895.0, "step": 12710 }, { "entropy": 6.492169332504273, "epoch": 1.3606399486328857, "grad_norm": 1.5703125, "learning_rate": 0.0004824045877165154, "loss": 6.3509, "mean_token_accuracy": 0.12758940383791922, "num_tokens": 27512578.0, "step": 12715 }, { "entropy": 6.511027574539185, "epoch": 1.3611750227406496, "grad_norm": 2.34375, "learning_rate": 0.00048238976279040344, "loss": 6.2984, "mean_token_accuracy": 0.1308564618229866, "num_tokens": 27523448.0, "step": 12720 }, { "entropy": 6.53885703086853, "epoch": 1.3617100968484135, "grad_norm": 1.578125, "learning_rate": 0.0004823749318759413, "loss": 6.3572, "mean_token_accuracy": 0.1290444739162922, "num_tokens": 27534919.0, "step": 12725 }, { "entropy": 6.464112186431885, "epoch": 1.3622451709561774, "grad_norm": 1.796875, "learning_rate": 0.000482360094973557, "loss": 6.1838, "mean_token_accuracy": 0.13654556199908258, "num_tokens": 27545603.0, "step": 12730 }, { "entropy": 6.567755889892578, "epoch": 1.3627802450639415, "grad_norm": 1.546875, "learning_rate": 0.0004823452520836792, "loss": 6.32, "mean_token_accuracy": 0.13071177452802657, "num_tokens": 27556868.0, "step": 12735 }, { "entropy": 6.62355055809021, "epoch": 1.3633153191717053, "grad_norm": 1.78125, "learning_rate": 0.00048233040320673634, "loss": 6.4213, "mean_token_accuracy": 0.12471303418278694, "num_tokens": 27567200.0, "step": 12740 }, { "entropy": 6.48751277923584, "epoch": 1.3638503932794692, "grad_norm": 1.7578125, "learning_rate": 0.00048231554834315716, "loss": 6.2449, "mean_token_accuracy": 0.13486199751496314, "num_tokens": 27577759.0, "step": 12745 }, { "entropy": 6.522989892959595, "epoch": 1.364385467387233, "grad_norm": 1.453125, "learning_rate": 0.0004823006874933708, "loss": 6.372, "mean_token_accuracy": 0.12554556503891945, "num_tokens": 27588935.0, "step": 12750 }, { "entropy": 6.5447916984558105, "epoch": 1.364920541494997, "grad_norm": 1.6640625, "learning_rate": 0.0004822858206578061, "loss": 6.2705, "mean_token_accuracy": 0.12772670835256578, "num_tokens": 27600306.0, "step": 12755 }, { "entropy": 6.590607786178589, "epoch": 1.365455615602761, "grad_norm": 1.4296875, "learning_rate": 0.00048227094783689244, "loss": 6.3372, "mean_token_accuracy": 0.1335367240011692, "num_tokens": 27612322.0, "step": 12760 }, { "entropy": 6.557591819763184, "epoch": 1.365990689710525, "grad_norm": 1.6015625, "learning_rate": 0.0004822560690310594, "loss": 6.3052, "mean_token_accuracy": 0.1375129908323288, "num_tokens": 27623812.0, "step": 12765 }, { "entropy": 6.446960735321045, "epoch": 1.3665257638182888, "grad_norm": 1.6875, "learning_rate": 0.00048224118424073644, "loss": 6.1799, "mean_token_accuracy": 0.13489142134785653, "num_tokens": 27633848.0, "step": 12770 }, { "entropy": 6.483105087280274, "epoch": 1.3670608379260527, "grad_norm": 1.5078125, "learning_rate": 0.00048222629346635336, "loss": 6.2864, "mean_token_accuracy": 0.1376944363117218, "num_tokens": 27644641.0, "step": 12775 }, { "entropy": 6.522060775756836, "epoch": 1.3675959120338166, "grad_norm": 2.015625, "learning_rate": 0.00048221139670834025, "loss": 6.2826, "mean_token_accuracy": 0.135152880102396, "num_tokens": 27655552.0, "step": 12780 }, { "entropy": 6.499984788894653, "epoch": 1.3681309861415807, "grad_norm": 1.2734375, "learning_rate": 0.0004821964939671272, "loss": 6.2781, "mean_token_accuracy": 0.14179115146398544, "num_tokens": 27666396.0, "step": 12785 }, { "entropy": 6.579394149780273, "epoch": 1.3686660602493446, "grad_norm": 1.71875, "learning_rate": 0.0004821815852431444, "loss": 6.2375, "mean_token_accuracy": 0.1391332305967808, "num_tokens": 27676522.0, "step": 12790 }, { "entropy": 6.472452926635742, "epoch": 1.3692011343571084, "grad_norm": 2.390625, "learning_rate": 0.00048216667053682243, "loss": 6.2405, "mean_token_accuracy": 0.13712335973978043, "num_tokens": 27687088.0, "step": 12795 }, { "entropy": 6.498577833175659, "epoch": 1.3697362084648723, "grad_norm": 1.8515625, "learning_rate": 0.00048215174984859207, "loss": 6.2769, "mean_token_accuracy": 0.13670048490166664, "num_tokens": 27697587.0, "step": 12800 }, { "entropy": 6.483075046539307, "epoch": 1.3702712825726362, "grad_norm": 1.5546875, "learning_rate": 0.000482136823178884, "loss": 6.1907, "mean_token_accuracy": 0.13942957371473313, "num_tokens": 27708345.0, "step": 12805 }, { "entropy": 6.571651983261108, "epoch": 1.3708063566804003, "grad_norm": 1.6796875, "learning_rate": 0.0004821218905281292, "loss": 6.3944, "mean_token_accuracy": 0.12706556767225266, "num_tokens": 27719592.0, "step": 12810 }, { "entropy": 6.53343505859375, "epoch": 1.3713414307881642, "grad_norm": 1.671875, "learning_rate": 0.000482106951896759, "loss": 6.2827, "mean_token_accuracy": 0.13870616182684897, "num_tokens": 27730071.0, "step": 12815 }, { "entropy": 6.509290456771851, "epoch": 1.371876504895928, "grad_norm": 1.515625, "learning_rate": 0.00048209200728520466, "loss": 6.3139, "mean_token_accuracy": 0.13058488443493843, "num_tokens": 27740514.0, "step": 12820 }, { "entropy": 6.605209112167358, "epoch": 1.372411579003692, "grad_norm": 1.5859375, "learning_rate": 0.00048207705669389765, "loss": 6.3317, "mean_token_accuracy": 0.13331700637936592, "num_tokens": 27752088.0, "step": 12825 }, { "entropy": 6.623941564559937, "epoch": 1.3729466531114558, "grad_norm": 1.6953125, "learning_rate": 0.00048206210012326976, "loss": 6.3406, "mean_token_accuracy": 0.12817930206656455, "num_tokens": 27763401.0, "step": 12830 }, { "entropy": 6.548435020446777, "epoch": 1.37348172721922, "grad_norm": 1.75, "learning_rate": 0.00048204713757375283, "loss": 6.2789, "mean_token_accuracy": 0.13656549155712128, "num_tokens": 27773665.0, "step": 12835 }, { "entropy": 6.5042959690094, "epoch": 1.3740168013269838, "grad_norm": 1.7421875, "learning_rate": 0.0004820321690457789, "loss": 6.2961, "mean_token_accuracy": 0.1364237405359745, "num_tokens": 27785474.0, "step": 12840 }, { "entropy": 6.532441282272339, "epoch": 1.3745518754347477, "grad_norm": 1.4375, "learning_rate": 0.00048201719453978023, "loss": 6.3145, "mean_token_accuracy": 0.13314425200223923, "num_tokens": 27796520.0, "step": 12845 }, { "entropy": 6.591953563690185, "epoch": 1.3750869495425118, "grad_norm": 1.90625, "learning_rate": 0.0004820022140561891, "loss": 6.381, "mean_token_accuracy": 0.12598699182271958, "num_tokens": 27807559.0, "step": 12850 }, { "entropy": 6.571205520629883, "epoch": 1.3756220236502756, "grad_norm": 1.890625, "learning_rate": 0.0004819872275954381, "loss": 6.332, "mean_token_accuracy": 0.1316391684114933, "num_tokens": 27818208.0, "step": 12855 }, { "entropy": 6.507162141799927, "epoch": 1.3761570977580395, "grad_norm": 1.640625, "learning_rate": 0.00048197223515796, "loss": 6.23, "mean_token_accuracy": 0.13968217819929124, "num_tokens": 27828238.0, "step": 12860 }, { "entropy": 6.523963165283203, "epoch": 1.3766921718658034, "grad_norm": 1.3515625, "learning_rate": 0.0004819572367441877, "loss": 6.309, "mean_token_accuracy": 0.14231058806180955, "num_tokens": 27837885.0, "step": 12865 }, { "entropy": 6.457921075820923, "epoch": 1.3772272459735673, "grad_norm": 1.46875, "learning_rate": 0.0004819422323545543, "loss": 6.2082, "mean_token_accuracy": 0.14155658707022667, "num_tokens": 27847425.0, "step": 12870 }, { "entropy": 6.413833951950073, "epoch": 1.3777623200813314, "grad_norm": 1.3984375, "learning_rate": 0.000481927221989493, "loss": 6.2816, "mean_token_accuracy": 0.13291521817445756, "num_tokens": 27859606.0, "step": 12875 }, { "entropy": 6.5869935035705565, "epoch": 1.3782973941890952, "grad_norm": 1.6015625, "learning_rate": 0.0004819122056494373, "loss": 6.3398, "mean_token_accuracy": 0.13277041912078857, "num_tokens": 27871651.0, "step": 12880 }, { "entropy": 6.59212965965271, "epoch": 1.3788324682968591, "grad_norm": 1.71875, "learning_rate": 0.00048189718333482064, "loss": 6.2782, "mean_token_accuracy": 0.13503665924072267, "num_tokens": 27883138.0, "step": 12885 }, { "entropy": 6.614982795715332, "epoch": 1.379367542404623, "grad_norm": 1.5, "learning_rate": 0.000481882155046077, "loss": 6.3242, "mean_token_accuracy": 0.13419492915272713, "num_tokens": 27893597.0, "step": 12890 }, { "entropy": 6.516837644577026, "epoch": 1.3799026165123869, "grad_norm": 1.78125, "learning_rate": 0.00048186712078364006, "loss": 6.2529, "mean_token_accuracy": 0.13822920396924018, "num_tokens": 27904249.0, "step": 12895 }, { "entropy": 6.477723407745361, "epoch": 1.380437690620151, "grad_norm": 1.5625, "learning_rate": 0.00048185208054794414, "loss": 6.2921, "mean_token_accuracy": 0.1323131412267685, "num_tokens": 27914713.0, "step": 12900 }, { "entropy": 6.482716989517212, "epoch": 1.3809727647279149, "grad_norm": 1.5390625, "learning_rate": 0.0004818370343394235, "loss": 6.3059, "mean_token_accuracy": 0.14247043877840043, "num_tokens": 27926257.0, "step": 12905 }, { "entropy": 6.544012641906738, "epoch": 1.3815078388356787, "grad_norm": 1.78125, "learning_rate": 0.0004818219821585125, "loss": 6.29, "mean_token_accuracy": 0.13584071174263954, "num_tokens": 27936839.0, "step": 12910 }, { "entropy": 6.61454963684082, "epoch": 1.3820429129434426, "grad_norm": 1.6484375, "learning_rate": 0.00048180692400564586, "loss": 6.3864, "mean_token_accuracy": 0.1286683276295662, "num_tokens": 27946318.0, "step": 12915 }, { "entropy": 6.628933334350586, "epoch": 1.3825779870512065, "grad_norm": 1.5859375, "learning_rate": 0.00048179185988125834, "loss": 6.3766, "mean_token_accuracy": 0.13161879852414132, "num_tokens": 27956990.0, "step": 12920 }, { "entropy": 6.619915962219238, "epoch": 1.3831130611589706, "grad_norm": 1.546875, "learning_rate": 0.000481776789785785, "loss": 6.3103, "mean_token_accuracy": 0.12722400948405266, "num_tokens": 27968187.0, "step": 12925 }, { "entropy": 6.575854349136352, "epoch": 1.3836481352667345, "grad_norm": 1.71875, "learning_rate": 0.00048176171371966083, "loss": 6.3604, "mean_token_accuracy": 0.13226662948727608, "num_tokens": 27978337.0, "step": 12930 }, { "entropy": 6.500992679595948, "epoch": 1.3841832093744983, "grad_norm": 2.609375, "learning_rate": 0.0004817466316833212, "loss": 6.332, "mean_token_accuracy": 0.1280041068792343, "num_tokens": 27988681.0, "step": 12935 }, { "entropy": 6.48139591217041, "epoch": 1.3847182834822622, "grad_norm": 2.125, "learning_rate": 0.0004817315436772017, "loss": 6.2111, "mean_token_accuracy": 0.14233975857496262, "num_tokens": 27999233.0, "step": 12940 }, { "entropy": 6.597472620010376, "epoch": 1.385253357590026, "grad_norm": 1.6015625, "learning_rate": 0.0004817164497017379, "loss": 6.3476, "mean_token_accuracy": 0.13093181997537612, "num_tokens": 28010242.0, "step": 12945 }, { "entropy": 6.530687379837036, "epoch": 1.3857884316977902, "grad_norm": 2.125, "learning_rate": 0.0004817013497573656, "loss": 6.3145, "mean_token_accuracy": 0.13088319599628448, "num_tokens": 28020424.0, "step": 12950 }, { "entropy": 6.562989664077759, "epoch": 1.386323505805554, "grad_norm": 1.671875, "learning_rate": 0.000481686243844521, "loss": 6.2929, "mean_token_accuracy": 0.12782736048102378, "num_tokens": 28030287.0, "step": 12955 }, { "entropy": 6.579535293579101, "epoch": 1.386858579913318, "grad_norm": 1.578125, "learning_rate": 0.00048167113196364, "loss": 6.2645, "mean_token_accuracy": 0.13902048543095588, "num_tokens": 28039997.0, "step": 12960 }, { "entropy": 6.541631889343262, "epoch": 1.387393654021082, "grad_norm": 1.796875, "learning_rate": 0.0004816560141151593, "loss": 6.2911, "mean_token_accuracy": 0.12617392912507058, "num_tokens": 28051381.0, "step": 12965 }, { "entropy": 6.521060180664063, "epoch": 1.3879287281288457, "grad_norm": 1.9765625, "learning_rate": 0.0004816408902995151, "loss": 6.2566, "mean_token_accuracy": 0.13256800323724746, "num_tokens": 28063603.0, "step": 12970 }, { "entropy": 6.4855201721191404, "epoch": 1.3884638022366098, "grad_norm": 1.875, "learning_rate": 0.0004816257605171442, "loss": 6.2444, "mean_token_accuracy": 0.13902541249990463, "num_tokens": 28073942.0, "step": 12975 }, { "entropy": 6.497772598266602, "epoch": 1.3889988763443737, "grad_norm": 1.46875, "learning_rate": 0.00048161062476848363, "loss": 6.2825, "mean_token_accuracy": 0.13788814544677735, "num_tokens": 28083837.0, "step": 12980 }, { "entropy": 6.4824666500091555, "epoch": 1.3895339504521376, "grad_norm": 1.734375, "learning_rate": 0.0004815954830539702, "loss": 6.2279, "mean_token_accuracy": 0.13570400699973106, "num_tokens": 28094150.0, "step": 12985 }, { "entropy": 6.518013954162598, "epoch": 1.3900690245599017, "grad_norm": 1.34375, "learning_rate": 0.00048158033537404126, "loss": 6.2673, "mean_token_accuracy": 0.1387584075331688, "num_tokens": 28106345.0, "step": 12990 }, { "entropy": 6.5225001811981205, "epoch": 1.3906040986676655, "grad_norm": 1.546875, "learning_rate": 0.00048156518172913417, "loss": 6.229, "mean_token_accuracy": 0.13286010921001434, "num_tokens": 28116858.0, "step": 12995 }, { "entropy": 6.501324033737182, "epoch": 1.3911391727754294, "grad_norm": 4.0625, "learning_rate": 0.0004815500221196865, "loss": 6.3845, "mean_token_accuracy": 0.12992180436849593, "num_tokens": 28128390.0, "step": 13000 }, { "entropy": 6.47907657623291, "epoch": 1.3916742468831933, "grad_norm": 1.6015625, "learning_rate": 0.00048153485654613587, "loss": 6.224, "mean_token_accuracy": 0.13855567947030067, "num_tokens": 28139421.0, "step": 13005 }, { "entropy": 6.533262300491333, "epoch": 1.3922093209909572, "grad_norm": 1.3203125, "learning_rate": 0.00048151968500892043, "loss": 6.3213, "mean_token_accuracy": 0.13610239028930665, "num_tokens": 28151076.0, "step": 13010 }, { "entropy": 6.589778709411621, "epoch": 1.3927443950987213, "grad_norm": 1.8515625, "learning_rate": 0.00048150450750847795, "loss": 6.425, "mean_token_accuracy": 0.12930934131145477, "num_tokens": 28162079.0, "step": 13015 }, { "entropy": 6.53804030418396, "epoch": 1.3932794692064852, "grad_norm": 1.8046875, "learning_rate": 0.000481489324045247, "loss": 6.3428, "mean_token_accuracy": 0.13030591681599618, "num_tokens": 28174442.0, "step": 13020 }, { "entropy": 6.552037954330444, "epoch": 1.393814543314249, "grad_norm": 1.7109375, "learning_rate": 0.00048147413461966564, "loss": 6.2198, "mean_token_accuracy": 0.1378868341445923, "num_tokens": 28184643.0, "step": 13025 }, { "entropy": 6.455650091171265, "epoch": 1.394349617422013, "grad_norm": 1.7109375, "learning_rate": 0.00048145893923217276, "loss": 6.248, "mean_token_accuracy": 0.1368380829691887, "num_tokens": 28194021.0, "step": 13030 }, { "entropy": 6.57091875076294, "epoch": 1.3948846915297768, "grad_norm": 2.25, "learning_rate": 0.0004814437378832071, "loss": 6.3144, "mean_token_accuracy": 0.12892460078001022, "num_tokens": 28204750.0, "step": 13035 }, { "entropy": 6.6161461353302, "epoch": 1.3954197656375409, "grad_norm": 3.296875, "learning_rate": 0.0004814285305732074, "loss": 6.3714, "mean_token_accuracy": 0.1290208302438259, "num_tokens": 28216499.0, "step": 13040 }, { "entropy": 6.584888553619384, "epoch": 1.3959548397453048, "grad_norm": 1.484375, "learning_rate": 0.00048141331730261293, "loss": 6.3087, "mean_token_accuracy": 0.1345869742333889, "num_tokens": 28226573.0, "step": 13045 }, { "entropy": 6.55465612411499, "epoch": 1.3964899138530686, "grad_norm": 1.4296875, "learning_rate": 0.000481398098071863, "loss": 6.2448, "mean_token_accuracy": 0.14011548906564714, "num_tokens": 28236688.0, "step": 13050 }, { "entropy": 6.517119026184082, "epoch": 1.3970249879608325, "grad_norm": 1.5625, "learning_rate": 0.00048138287288139686, "loss": 6.3374, "mean_token_accuracy": 0.13438064157962798, "num_tokens": 28247477.0, "step": 13055 }, { "entropy": 6.4921595573425295, "epoch": 1.3975600620685964, "grad_norm": 1.703125, "learning_rate": 0.0004813676417316543, "loss": 6.3186, "mean_token_accuracy": 0.13378834277391433, "num_tokens": 28258286.0, "step": 13060 }, { "entropy": 6.6379228115081785, "epoch": 1.3980951361763605, "grad_norm": 2.296875, "learning_rate": 0.0004813524046230751, "loss": 6.4498, "mean_token_accuracy": 0.12076324447989464, "num_tokens": 28268587.0, "step": 13065 }, { "entropy": 6.696167945861816, "epoch": 1.3986302102841244, "grad_norm": 1.46875, "learning_rate": 0.00048133716155609926, "loss": 6.3418, "mean_token_accuracy": 0.1276852436363697, "num_tokens": 28279352.0, "step": 13070 }, { "entropy": 6.568699979782105, "epoch": 1.3991652843918883, "grad_norm": 2.34375, "learning_rate": 0.0004813219125311668, "loss": 6.2537, "mean_token_accuracy": 0.13418687954545022, "num_tokens": 28290114.0, "step": 13075 }, { "entropy": 6.516354560852051, "epoch": 1.3997003584996521, "grad_norm": 1.3671875, "learning_rate": 0.00048130665754871814, "loss": 6.3526, "mean_token_accuracy": 0.12834639623761177, "num_tokens": 28301845.0, "step": 13080 }, { "entropy": 6.586096525192261, "epoch": 1.400235432607416, "grad_norm": 1.359375, "learning_rate": 0.00048129139660919374, "loss": 6.3262, "mean_token_accuracy": 0.1293413132429123, "num_tokens": 28313162.0, "step": 13085 }, { "entropy": 6.549271535873413, "epoch": 1.40077050671518, "grad_norm": 1.4765625, "learning_rate": 0.00048127612971303425, "loss": 6.2714, "mean_token_accuracy": 0.1319861926138401, "num_tokens": 28323888.0, "step": 13090 }, { "entropy": 6.5844615459442135, "epoch": 1.401305580822944, "grad_norm": 1.4140625, "learning_rate": 0.0004812608568606805, "loss": 6.3159, "mean_token_accuracy": 0.1313139483332634, "num_tokens": 28333735.0, "step": 13095 }, { "entropy": 6.566430997848511, "epoch": 1.4018406549307079, "grad_norm": 1.5859375, "learning_rate": 0.0004812455780525735, "loss": 6.3089, "mean_token_accuracy": 0.13157719522714614, "num_tokens": 28343947.0, "step": 13100 }, { "entropy": 6.550437593460083, "epoch": 1.402375729038472, "grad_norm": 1.890625, "learning_rate": 0.0004812302932891544, "loss": 6.3743, "mean_token_accuracy": 0.1243227556347847, "num_tokens": 28354635.0, "step": 13105 }, { "entropy": 6.563779306411743, "epoch": 1.4029108031462356, "grad_norm": 1.7109375, "learning_rate": 0.0004812150025708646, "loss": 6.2903, "mean_token_accuracy": 0.13009085580706597, "num_tokens": 28365392.0, "step": 13110 }, { "entropy": 6.57616081237793, "epoch": 1.4034458772539997, "grad_norm": 1.5078125, "learning_rate": 0.00048119970589814557, "loss": 6.3027, "mean_token_accuracy": 0.12210134267807007, "num_tokens": 28376527.0, "step": 13115 }, { "entropy": 6.541454315185547, "epoch": 1.4039809513617636, "grad_norm": 1.546875, "learning_rate": 0.0004811844032714389, "loss": 6.3129, "mean_token_accuracy": 0.13677758798003198, "num_tokens": 28387178.0, "step": 13120 }, { "entropy": 6.539116430282593, "epoch": 1.4045160254695275, "grad_norm": 1.921875, "learning_rate": 0.00048116909469118663, "loss": 6.1941, "mean_token_accuracy": 0.13399127945303918, "num_tokens": 28397578.0, "step": 13125 }, { "entropy": 6.506171226501465, "epoch": 1.4050510995772916, "grad_norm": 1.4453125, "learning_rate": 0.0004811537801578308, "loss": 6.3397, "mean_token_accuracy": 0.1259517602622509, "num_tokens": 28408933.0, "step": 13130 }, { "entropy": 6.503382349014283, "epoch": 1.4055861736850555, "grad_norm": 2.109375, "learning_rate": 0.00048113845967181346, "loss": 6.3245, "mean_token_accuracy": 0.12405535578727722, "num_tokens": 28421906.0, "step": 13135 }, { "entropy": 6.5776450634002686, "epoch": 1.4061212477928193, "grad_norm": 1.9375, "learning_rate": 0.000481123133233577, "loss": 6.2604, "mean_token_accuracy": 0.1332197055220604, "num_tokens": 28432677.0, "step": 13140 }, { "entropy": 6.573045492172241, "epoch": 1.4066563219005832, "grad_norm": 2.09375, "learning_rate": 0.00048110780084356414, "loss": 6.3598, "mean_token_accuracy": 0.13100109472870827, "num_tokens": 28443795.0, "step": 13145 }, { "entropy": 6.55504298210144, "epoch": 1.407191396008347, "grad_norm": 2.09375, "learning_rate": 0.0004810924625022174, "loss": 6.3319, "mean_token_accuracy": 0.13072033673524858, "num_tokens": 28455727.0, "step": 13150 }, { "entropy": 6.61231427192688, "epoch": 1.4077264701161112, "grad_norm": 1.9765625, "learning_rate": 0.0004810771182099799, "loss": 6.3518, "mean_token_accuracy": 0.12492276728153229, "num_tokens": 28467554.0, "step": 13155 }, { "entropy": 6.603960275650024, "epoch": 1.408261544223875, "grad_norm": 1.6171875, "learning_rate": 0.0004810617679672945, "loss": 6.3649, "mean_token_accuracy": 0.13161554783582688, "num_tokens": 28479268.0, "step": 13160 }, { "entropy": 6.55245041847229, "epoch": 1.408796618331639, "grad_norm": 4.375, "learning_rate": 0.00048104641177460443, "loss": 6.3518, "mean_token_accuracy": 0.12731072753667833, "num_tokens": 28489887.0, "step": 13165 }, { "entropy": 6.468415307998657, "epoch": 1.4093316924394028, "grad_norm": 1.8671875, "learning_rate": 0.0004810310496323533, "loss": 6.248, "mean_token_accuracy": 0.1380733884871006, "num_tokens": 28500736.0, "step": 13170 }, { "entropy": 6.470671081542969, "epoch": 1.4098667665471667, "grad_norm": 2.578125, "learning_rate": 0.00048101568154098446, "loss": 6.2256, "mean_token_accuracy": 0.13929775431752206, "num_tokens": 28511458.0, "step": 13175 }, { "entropy": 6.591119432449341, "epoch": 1.4104018406549308, "grad_norm": 2.109375, "learning_rate": 0.00048100030750094185, "loss": 6.3399, "mean_token_accuracy": 0.12569592297077178, "num_tokens": 28522354.0, "step": 13180 }, { "entropy": 6.534553337097168, "epoch": 1.4109369147626947, "grad_norm": 3.109375, "learning_rate": 0.0004809849275126693, "loss": 6.1849, "mean_token_accuracy": 0.1420965887606144, "num_tokens": 28533061.0, "step": 13185 }, { "entropy": 6.543464422225952, "epoch": 1.4114719888704585, "grad_norm": 1.828125, "learning_rate": 0.00048096954157661085, "loss": 6.3327, "mean_token_accuracy": 0.13191912025213243, "num_tokens": 28544230.0, "step": 13190 }, { "entropy": 6.528650999069214, "epoch": 1.4120070629782224, "grad_norm": 1.6953125, "learning_rate": 0.00048095414969321086, "loss": 6.3278, "mean_token_accuracy": 0.13371477872133256, "num_tokens": 28555461.0, "step": 13195 }, { "entropy": 6.5493683338165285, "epoch": 1.4125421370859863, "grad_norm": 1.8515625, "learning_rate": 0.00048093875186291376, "loss": 6.2443, "mean_token_accuracy": 0.13574814945459365, "num_tokens": 28565992.0, "step": 13200 }, { "entropy": 6.565684080123901, "epoch": 1.4130772111937504, "grad_norm": 1.859375, "learning_rate": 0.00048092334808616413, "loss": 6.2524, "mean_token_accuracy": 0.1374378241598606, "num_tokens": 28575802.0, "step": 13205 }, { "entropy": 6.535583209991455, "epoch": 1.4136122853015143, "grad_norm": 3.59375, "learning_rate": 0.0004809079383634067, "loss": 6.2492, "mean_token_accuracy": 0.1376635640859604, "num_tokens": 28586982.0, "step": 13210 }, { "entropy": 6.541072654724121, "epoch": 1.4141473594092782, "grad_norm": 2.390625, "learning_rate": 0.00048089252269508656, "loss": 6.3374, "mean_token_accuracy": 0.13196105509996414, "num_tokens": 28598267.0, "step": 13215 }, { "entropy": 6.574584054946899, "epoch": 1.414682433517042, "grad_norm": 2.125, "learning_rate": 0.00048087710108164874, "loss": 6.3057, "mean_token_accuracy": 0.1319591633975506, "num_tokens": 28608213.0, "step": 13220 }, { "entropy": 6.5331920146942135, "epoch": 1.415217507624806, "grad_norm": 1.796875, "learning_rate": 0.0004808616735235385, "loss": 6.2819, "mean_token_accuracy": 0.12543027997016906, "num_tokens": 28619674.0, "step": 13225 }, { "entropy": 6.551663255691528, "epoch": 1.41575258173257, "grad_norm": 2.953125, "learning_rate": 0.0004808462400212014, "loss": 6.2191, "mean_token_accuracy": 0.1338550068438053, "num_tokens": 28630824.0, "step": 13230 }, { "entropy": 6.50926718711853, "epoch": 1.416287655840334, "grad_norm": 1.84375, "learning_rate": 0.00048083080057508313, "loss": 6.3517, "mean_token_accuracy": 0.13014202639460565, "num_tokens": 28642270.0, "step": 13235 }, { "entropy": 6.521674776077271, "epoch": 1.4168227299480978, "grad_norm": 1.921875, "learning_rate": 0.00048081535518562933, "loss": 6.3362, "mean_token_accuracy": 0.12918935641646384, "num_tokens": 28653649.0, "step": 13240 }, { "entropy": 6.502331113815307, "epoch": 1.4173578040558619, "grad_norm": 1.9375, "learning_rate": 0.000480799903853286, "loss": 6.2151, "mean_token_accuracy": 0.13268271312117577, "num_tokens": 28664044.0, "step": 13245 }, { "entropy": 6.542404127120972, "epoch": 1.4178928781636255, "grad_norm": 4.46875, "learning_rate": 0.0004807844465784995, "loss": 6.2942, "mean_token_accuracy": 0.1345588520169258, "num_tokens": 28675394.0, "step": 13250 }, { "entropy": 6.529404735565185, "epoch": 1.4184279522713896, "grad_norm": 2.203125, "learning_rate": 0.00048076898336171596, "loss": 6.2856, "mean_token_accuracy": 0.14060317277908324, "num_tokens": 28686292.0, "step": 13255 }, { "entropy": 6.55095157623291, "epoch": 1.4189630263791535, "grad_norm": 1.5390625, "learning_rate": 0.00048075351420338196, "loss": 6.304, "mean_token_accuracy": 0.1346028797328472, "num_tokens": 28696928.0, "step": 13260 }, { "entropy": 6.495355653762817, "epoch": 1.4194981004869174, "grad_norm": 1.890625, "learning_rate": 0.0004807380391039441, "loss": 6.323, "mean_token_accuracy": 0.1321026124060154, "num_tokens": 28707986.0, "step": 13265 }, { "entropy": 6.614403247833252, "epoch": 1.4200331745946815, "grad_norm": 1.609375, "learning_rate": 0.00048072255806384936, "loss": 6.3291, "mean_token_accuracy": 0.1340144731104374, "num_tokens": 28719296.0, "step": 13270 }, { "entropy": 6.521930789947509, "epoch": 1.4205682487024454, "grad_norm": 1.6015625, "learning_rate": 0.0004807070710835447, "loss": 6.1843, "mean_token_accuracy": 0.13900391533970832, "num_tokens": 28729523.0, "step": 13275 }, { "entropy": 6.557798910140991, "epoch": 1.4211033228102092, "grad_norm": 1.9296875, "learning_rate": 0.0004806915781634771, "loss": 6.3166, "mean_token_accuracy": 0.1333258867263794, "num_tokens": 28739026.0, "step": 13280 }, { "entropy": 6.586025190353394, "epoch": 1.4216383969179731, "grad_norm": 1.703125, "learning_rate": 0.0004806760793040942, "loss": 6.399, "mean_token_accuracy": 0.12926854342222213, "num_tokens": 28749513.0, "step": 13285 }, { "entropy": 6.60874834060669, "epoch": 1.422173471025737, "grad_norm": 1.96875, "learning_rate": 0.00048066057450584334, "loss": 6.3034, "mean_token_accuracy": 0.1329214371740818, "num_tokens": 28760722.0, "step": 13290 }, { "entropy": 6.559692621231079, "epoch": 1.422708545133501, "grad_norm": 1.8828125, "learning_rate": 0.0004806450637691723, "loss": 6.2465, "mean_token_accuracy": 0.14297338128089904, "num_tokens": 28771235.0, "step": 13295 }, { "entropy": 6.531833028793335, "epoch": 1.423243619241265, "grad_norm": 1.53125, "learning_rate": 0.00048062954709452907, "loss": 6.2552, "mean_token_accuracy": 0.13588109463453293, "num_tokens": 28782642.0, "step": 13300 }, { "entropy": 6.541342067718506, "epoch": 1.4237786933490288, "grad_norm": 1.5546875, "learning_rate": 0.0004806140244823615, "loss": 6.2651, "mean_token_accuracy": 0.13098229318857194, "num_tokens": 28793628.0, "step": 13305 }, { "entropy": 6.587154912948608, "epoch": 1.4243137674567927, "grad_norm": 1.8203125, "learning_rate": 0.00048059849593311776, "loss": 6.3307, "mean_token_accuracy": 0.13464922532439233, "num_tokens": 28804034.0, "step": 13310 }, { "entropy": 6.551678323745728, "epoch": 1.4248488415645566, "grad_norm": 1.7734375, "learning_rate": 0.0004805829614472464, "loss": 6.2776, "mean_token_accuracy": 0.13238443210721015, "num_tokens": 28814679.0, "step": 13315 }, { "entropy": 6.510989809036255, "epoch": 1.4253839156723207, "grad_norm": 2.109375, "learning_rate": 0.00048056742102519593, "loss": 6.2973, "mean_token_accuracy": 0.12994106039404868, "num_tokens": 28825130.0, "step": 13320 }, { "entropy": 6.543405151367187, "epoch": 1.4259189897800846, "grad_norm": 1.6015625, "learning_rate": 0.00048055187466741506, "loss": 6.3261, "mean_token_accuracy": 0.12828193083405495, "num_tokens": 28835500.0, "step": 13325 }, { "entropy": 6.533200263977051, "epoch": 1.4264540638878485, "grad_norm": 1.390625, "learning_rate": 0.0004805363223743527, "loss": 6.2586, "mean_token_accuracy": 0.13435445576906205, "num_tokens": 28845794.0, "step": 13330 }, { "entropy": 6.59534273147583, "epoch": 1.4269891379956123, "grad_norm": 1.9921875, "learning_rate": 0.0004805207641464579, "loss": 6.2819, "mean_token_accuracy": 0.13006314858794213, "num_tokens": 28856326.0, "step": 13335 }, { "entropy": 6.506957912445069, "epoch": 1.4275242121033762, "grad_norm": 1.4921875, "learning_rate": 0.0004805051999841799, "loss": 6.2806, "mean_token_accuracy": 0.13344307169318198, "num_tokens": 28867592.0, "step": 13340 }, { "entropy": 6.606613874435425, "epoch": 1.4280592862111403, "grad_norm": 1.8828125, "learning_rate": 0.0004804896298879682, "loss": 6.4169, "mean_token_accuracy": 0.12649569064378738, "num_tokens": 28880352.0, "step": 13345 }, { "entropy": 6.59653148651123, "epoch": 1.4285943603189042, "grad_norm": 1.7578125, "learning_rate": 0.0004804740538582723, "loss": 6.2943, "mean_token_accuracy": 0.1322682738304138, "num_tokens": 28892012.0, "step": 13350 }, { "entropy": 6.579413747787475, "epoch": 1.429129434426668, "grad_norm": 1.65625, "learning_rate": 0.0004804584718955419, "loss": 6.2216, "mean_token_accuracy": 0.13726244121789932, "num_tokens": 28902247.0, "step": 13355 }, { "entropy": 6.508374929428101, "epoch": 1.429664508534432, "grad_norm": 1.90625, "learning_rate": 0.000480442884000227, "loss": 6.3598, "mean_token_accuracy": 0.13232571333646775, "num_tokens": 28913222.0, "step": 13360 }, { "entropy": 6.51956524848938, "epoch": 1.4301995826421958, "grad_norm": 1.609375, "learning_rate": 0.0004804272901727778, "loss": 6.2675, "mean_token_accuracy": 0.1339123398065567, "num_tokens": 28924038.0, "step": 13365 }, { "entropy": 6.582114124298096, "epoch": 1.43073465674996, "grad_norm": 1.421875, "learning_rate": 0.00048041169041364437, "loss": 6.3048, "mean_token_accuracy": 0.13865149021148682, "num_tokens": 28934448.0, "step": 13370 }, { "entropy": 6.542791557312012, "epoch": 1.4312697308577238, "grad_norm": 1.5546875, "learning_rate": 0.00048039608472327724, "loss": 6.2752, "mean_token_accuracy": 0.13437252789735793, "num_tokens": 28945175.0, "step": 13375 }, { "entropy": 6.499612092971802, "epoch": 1.4318048049654877, "grad_norm": 1.3828125, "learning_rate": 0.00048038047310212706, "loss": 6.2301, "mean_token_accuracy": 0.13937258571386338, "num_tokens": 28955116.0, "step": 13380 }, { "entropy": 6.548843431472778, "epoch": 1.4323398790732518, "grad_norm": 1.84375, "learning_rate": 0.00048036485555064454, "loss": 6.3369, "mean_token_accuracy": 0.13031953051686287, "num_tokens": 28966999.0, "step": 13385 }, { "entropy": 6.54577784538269, "epoch": 1.4328749531810157, "grad_norm": 1.9140625, "learning_rate": 0.00048034923206928065, "loss": 6.3134, "mean_token_accuracy": 0.12904799953103066, "num_tokens": 28977388.0, "step": 13390 }, { "entropy": 6.539524078369141, "epoch": 1.4334100272887795, "grad_norm": 1.6640625, "learning_rate": 0.00048033360265848664, "loss": 6.2086, "mean_token_accuracy": 0.13839732706546784, "num_tokens": 28987792.0, "step": 13395 }, { "entropy": 6.613337612152099, "epoch": 1.4339451013965434, "grad_norm": 2.25, "learning_rate": 0.00048031796731871364, "loss": 6.3435, "mean_token_accuracy": 0.13307096138596536, "num_tokens": 28998319.0, "step": 13400 }, { "entropy": 6.5337625503540036, "epoch": 1.4344801755043073, "grad_norm": 1.359375, "learning_rate": 0.00048030232605041323, "loss": 6.318, "mean_token_accuracy": 0.13027154058218002, "num_tokens": 29007942.0, "step": 13405 }, { "entropy": 6.594687223434448, "epoch": 1.4350152496120714, "grad_norm": 1.4296875, "learning_rate": 0.0004802866788540369, "loss": 6.3017, "mean_token_accuracy": 0.13362317085266112, "num_tokens": 29018217.0, "step": 13410 }, { "entropy": 6.587049055099487, "epoch": 1.4355503237198353, "grad_norm": 1.71875, "learning_rate": 0.0004802710257300367, "loss": 6.3129, "mean_token_accuracy": 0.131132273375988, "num_tokens": 29028472.0, "step": 13415 }, { "entropy": 6.5456602573394775, "epoch": 1.4360853978275991, "grad_norm": 1.7109375, "learning_rate": 0.0004802553666788644, "loss": 6.2708, "mean_token_accuracy": 0.13706605061888694, "num_tokens": 29040553.0, "step": 13420 }, { "entropy": 6.571896696090699, "epoch": 1.436620471935363, "grad_norm": 1.7109375, "learning_rate": 0.00048023970170097226, "loss": 6.3087, "mean_token_accuracy": 0.13039797320961952, "num_tokens": 29050142.0, "step": 13425 }, { "entropy": 6.510137319564819, "epoch": 1.437155546043127, "grad_norm": 1.7265625, "learning_rate": 0.00048022403079681254, "loss": 6.2515, "mean_token_accuracy": 0.12999855652451514, "num_tokens": 29061762.0, "step": 13430 }, { "entropy": 6.549421262741089, "epoch": 1.437690620150891, "grad_norm": 2.71875, "learning_rate": 0.00048020835396683775, "loss": 6.3199, "mean_token_accuracy": 0.1308118633925915, "num_tokens": 29072095.0, "step": 13435 }, { "entropy": 6.60357551574707, "epoch": 1.4382256942586549, "grad_norm": 2.890625, "learning_rate": 0.00048019267121150066, "loss": 6.3243, "mean_token_accuracy": 0.13163482919335365, "num_tokens": 29082561.0, "step": 13440 }, { "entropy": 6.5486468315124515, "epoch": 1.4387607683664188, "grad_norm": 1.6796875, "learning_rate": 0.00048017698253125397, "loss": 6.2671, "mean_token_accuracy": 0.13364253789186478, "num_tokens": 29093813.0, "step": 13445 }, { "entropy": 6.52044939994812, "epoch": 1.4392958424741826, "grad_norm": 1.46875, "learning_rate": 0.0004801612879265507, "loss": 6.2736, "mean_token_accuracy": 0.1357661746442318, "num_tokens": 29104064.0, "step": 13450 }, { "entropy": 6.494532108306885, "epoch": 1.4398309165819465, "grad_norm": 1.890625, "learning_rate": 0.0004801455873978442, "loss": 6.3013, "mean_token_accuracy": 0.12913288176059723, "num_tokens": 29115086.0, "step": 13455 }, { "entropy": 6.536068773269653, "epoch": 1.4403659906897106, "grad_norm": 1.8671875, "learning_rate": 0.0004801298809455876, "loss": 6.2578, "mean_token_accuracy": 0.14133179932832718, "num_tokens": 29125536.0, "step": 13460 }, { "entropy": 6.583189058303833, "epoch": 1.4409010647974745, "grad_norm": 1.5234375, "learning_rate": 0.0004801141685702345, "loss": 6.3452, "mean_token_accuracy": 0.13120611384510994, "num_tokens": 29137007.0, "step": 13465 }, { "entropy": 6.567616033554077, "epoch": 1.4414361389052384, "grad_norm": 1.6171875, "learning_rate": 0.00048009845027223864, "loss": 6.3332, "mean_token_accuracy": 0.12379435449838638, "num_tokens": 29147072.0, "step": 13470 }, { "entropy": 6.576822185516358, "epoch": 1.4419712130130022, "grad_norm": 1.578125, "learning_rate": 0.00048008272605205377, "loss": 6.2946, "mean_token_accuracy": 0.13404594883322715, "num_tokens": 29157803.0, "step": 13475 }, { "entropy": 6.559188413619995, "epoch": 1.4425062871207661, "grad_norm": 1.3671875, "learning_rate": 0.00048006699591013417, "loss": 6.2698, "mean_token_accuracy": 0.13357484936714173, "num_tokens": 29168173.0, "step": 13480 }, { "entropy": 6.614182090759277, "epoch": 1.4430413612285302, "grad_norm": 2.171875, "learning_rate": 0.0004800512598469337, "loss": 6.3512, "mean_token_accuracy": 0.1211496539413929, "num_tokens": 29179377.0, "step": 13485 }, { "entropy": 6.5842859745025635, "epoch": 1.443576435336294, "grad_norm": 1.765625, "learning_rate": 0.000480035517862907, "loss": 6.3174, "mean_token_accuracy": 0.13456696942448615, "num_tokens": 29190909.0, "step": 13490 }, { "entropy": 6.492300939559937, "epoch": 1.444111509444058, "grad_norm": 1.671875, "learning_rate": 0.00048001976995850856, "loss": 6.2312, "mean_token_accuracy": 0.13400312289595603, "num_tokens": 29200977.0, "step": 13495 }, { "entropy": 6.5454717636108395, "epoch": 1.4446465835518219, "grad_norm": 1.78125, "learning_rate": 0.00048000401613419296, "loss": 6.2857, "mean_token_accuracy": 0.12763061225414277, "num_tokens": 29210702.0, "step": 13500 }, { "entropy": 6.604302883148193, "epoch": 1.4451816576595857, "grad_norm": 1.7578125, "learning_rate": 0.00047998825639041534, "loss": 6.371, "mean_token_accuracy": 0.12395200505852699, "num_tokens": 29221338.0, "step": 13505 }, { "entropy": 6.613165950775146, "epoch": 1.4457167317673498, "grad_norm": 1.9296875, "learning_rate": 0.0004799724907276306, "loss": 6.2309, "mean_token_accuracy": 0.1429674044251442, "num_tokens": 29232091.0, "step": 13510 }, { "entropy": 6.482897043228149, "epoch": 1.4462518058751137, "grad_norm": 1.4375, "learning_rate": 0.0004799567191462939, "loss": 6.2302, "mean_token_accuracy": 0.13581477701663972, "num_tokens": 29241903.0, "step": 13515 }, { "entropy": 6.5058026790618895, "epoch": 1.4467868799828776, "grad_norm": 1.578125, "learning_rate": 0.00047994094164686074, "loss": 6.3454, "mean_token_accuracy": 0.13214331939816476, "num_tokens": 29253414.0, "step": 13520 }, { "entropy": 6.605631923675537, "epoch": 1.4473219540906417, "grad_norm": 1.5390625, "learning_rate": 0.0004799251582297868, "loss": 6.2308, "mean_token_accuracy": 0.14136453941464425, "num_tokens": 29264066.0, "step": 13525 }, { "entropy": 6.567365121841431, "epoch": 1.4478570281984056, "grad_norm": 1.6875, "learning_rate": 0.00047990936889552767, "loss": 6.2819, "mean_token_accuracy": 0.13597942665219306, "num_tokens": 29274915.0, "step": 13530 }, { "entropy": 6.507847166061401, "epoch": 1.4483921023061694, "grad_norm": 1.9453125, "learning_rate": 0.0004798935736445392, "loss": 6.2805, "mean_token_accuracy": 0.12975036427378656, "num_tokens": 29287345.0, "step": 13535 }, { "entropy": 6.491131067276001, "epoch": 1.4489271764139333, "grad_norm": 2.015625, "learning_rate": 0.0004798777724772777, "loss": 6.2513, "mean_token_accuracy": 0.14119713753461838, "num_tokens": 29297432.0, "step": 13540 }, { "entropy": 6.509729433059692, "epoch": 1.4494622505216972, "grad_norm": 1.7265625, "learning_rate": 0.00047986196539419936, "loss": 6.1922, "mean_token_accuracy": 0.14158949628472328, "num_tokens": 29307534.0, "step": 13545 }, { "entropy": 6.549173402786255, "epoch": 1.4499973246294613, "grad_norm": 2.015625, "learning_rate": 0.0004798461523957604, "loss": 6.261, "mean_token_accuracy": 0.1374451108276844, "num_tokens": 29319412.0, "step": 13550 }, { "entropy": 6.498152875900269, "epoch": 1.4505323987372252, "grad_norm": 1.7109375, "learning_rate": 0.00047983033348241767, "loss": 6.2279, "mean_token_accuracy": 0.14251604452729225, "num_tokens": 29330477.0, "step": 13555 }, { "entropy": 6.484377861022949, "epoch": 1.451067472844989, "grad_norm": 1.5546875, "learning_rate": 0.0004798145086546278, "loss": 6.2648, "mean_token_accuracy": 0.13428061753511428, "num_tokens": 29341481.0, "step": 13560 }, { "entropy": 6.485887670516968, "epoch": 1.451602546952753, "grad_norm": 1.875, "learning_rate": 0.0004797986779128478, "loss": 6.2452, "mean_token_accuracy": 0.13639950677752494, "num_tokens": 29353273.0, "step": 13565 }, { "entropy": 6.57791223526001, "epoch": 1.4521376210605168, "grad_norm": 2.34375, "learning_rate": 0.0004797828412575348, "loss": 6.2914, "mean_token_accuracy": 0.1361882768571377, "num_tokens": 29364108.0, "step": 13570 }, { "entropy": 6.495282173156738, "epoch": 1.452672695168281, "grad_norm": 1.71875, "learning_rate": 0.00047976699868914594, "loss": 6.2636, "mean_token_accuracy": 0.13775565326213837, "num_tokens": 29375272.0, "step": 13575 }, { "entropy": 6.505160570144653, "epoch": 1.4532077692760448, "grad_norm": 1.671875, "learning_rate": 0.0004797511502081388, "loss": 6.2756, "mean_token_accuracy": 0.1332462415099144, "num_tokens": 29385749.0, "step": 13580 }, { "entropy": 6.517300844192505, "epoch": 1.4537428433838087, "grad_norm": 2.59375, "learning_rate": 0.000479735295814971, "loss": 6.2187, "mean_token_accuracy": 0.13782110810279846, "num_tokens": 29396430.0, "step": 13585 }, { "entropy": 6.536860084533691, "epoch": 1.4542779174915725, "grad_norm": 1.84375, "learning_rate": 0.00047971943551010035, "loss": 6.2744, "mean_token_accuracy": 0.1307387612760067, "num_tokens": 29407020.0, "step": 13590 }, { "entropy": 6.546886920928955, "epoch": 1.4548129915993364, "grad_norm": 1.3515625, "learning_rate": 0.00047970356929398467, "loss": 6.2929, "mean_token_accuracy": 0.13745293468236924, "num_tokens": 29418428.0, "step": 13595 }, { "entropy": 6.565701627731324, "epoch": 1.4553480657071005, "grad_norm": 2.125, "learning_rate": 0.0004796876971670822, "loss": 6.3544, "mean_token_accuracy": 0.13378758504986762, "num_tokens": 29430611.0, "step": 13600 }, { "entropy": 6.5439074516296385, "epoch": 1.4558831398148644, "grad_norm": 1.40625, "learning_rate": 0.0004796718191298512, "loss": 6.2849, "mean_token_accuracy": 0.1257310539484024, "num_tokens": 29441545.0, "step": 13605 }, { "entropy": 6.5851068019866945, "epoch": 1.4564182139226283, "grad_norm": 1.6640625, "learning_rate": 0.0004796559351827503, "loss": 6.3695, "mean_token_accuracy": 0.12765171527862548, "num_tokens": 29452529.0, "step": 13610 }, { "entropy": 6.539608526229858, "epoch": 1.4569532880303921, "grad_norm": 2.015625, "learning_rate": 0.000479640045326238, "loss": 6.2582, "mean_token_accuracy": 0.1369820587337017, "num_tokens": 29463860.0, "step": 13615 }, { "entropy": 6.653084325790405, "epoch": 1.457488362138156, "grad_norm": 2.234375, "learning_rate": 0.0004796241495607731, "loss": 6.3325, "mean_token_accuracy": 0.1349804438650608, "num_tokens": 29475004.0, "step": 13620 }, { "entropy": 6.55041766166687, "epoch": 1.4580234362459201, "grad_norm": 1.8984375, "learning_rate": 0.0004796082478868146, "loss": 6.404, "mean_token_accuracy": 0.12528412342071532, "num_tokens": 29485921.0, "step": 13625 }, { "entropy": 6.542591524124146, "epoch": 1.458558510353684, "grad_norm": 1.546875, "learning_rate": 0.00047959234030482185, "loss": 6.2517, "mean_token_accuracy": 0.14472676813602448, "num_tokens": 29495729.0, "step": 13630 }, { "entropy": 6.577525520324707, "epoch": 1.4590935844614479, "grad_norm": 1.546875, "learning_rate": 0.0004795764268152538, "loss": 6.3172, "mean_token_accuracy": 0.12774155661463737, "num_tokens": 29506051.0, "step": 13635 }, { "entropy": 6.524970769882202, "epoch": 1.4596286585692118, "grad_norm": 1.4140625, "learning_rate": 0.0004795605074185704, "loss": 6.2786, "mean_token_accuracy": 0.13325700610876084, "num_tokens": 29516234.0, "step": 13640 }, { "entropy": 6.549506521224975, "epoch": 1.4601637326769756, "grad_norm": 1.828125, "learning_rate": 0.00047954458211523095, "loss": 6.2701, "mean_token_accuracy": 0.1349295660853386, "num_tokens": 29527649.0, "step": 13645 }, { "entropy": 6.586029481887818, "epoch": 1.4606988067847397, "grad_norm": 2.3125, "learning_rate": 0.00047952865090569545, "loss": 6.3473, "mean_token_accuracy": 0.12580158188939095, "num_tokens": 29539150.0, "step": 13650 }, { "entropy": 6.520464706420898, "epoch": 1.4612338808925036, "grad_norm": 1.3359375, "learning_rate": 0.00047951271379042393, "loss": 6.2065, "mean_token_accuracy": 0.13591403812170028, "num_tokens": 29550058.0, "step": 13655 }, { "entropy": 6.423491668701172, "epoch": 1.4617689550002675, "grad_norm": 1.546875, "learning_rate": 0.0004794967707698765, "loss": 6.2296, "mean_token_accuracy": 0.1430532529950142, "num_tokens": 29560377.0, "step": 13660 }, { "entropy": 6.435001087188721, "epoch": 1.4623040291080316, "grad_norm": 1.421875, "learning_rate": 0.0004794808218445136, "loss": 6.164, "mean_token_accuracy": 0.14599157869815826, "num_tokens": 29571378.0, "step": 13665 }, { "entropy": 6.5370715141296385, "epoch": 1.4628391032157955, "grad_norm": 2.125, "learning_rate": 0.00047946486701479576, "loss": 6.3144, "mean_token_accuracy": 0.13308701068162918, "num_tokens": 29582187.0, "step": 13670 }, { "entropy": 6.541687440872193, "epoch": 1.4633741773235593, "grad_norm": 1.734375, "learning_rate": 0.0004794489062811835, "loss": 6.2925, "mean_token_accuracy": 0.12842457219958306, "num_tokens": 29592982.0, "step": 13675 }, { "entropy": 6.587422132492065, "epoch": 1.4639092514313232, "grad_norm": 2.09375, "learning_rate": 0.0004794329396441378, "loss": 6.2746, "mean_token_accuracy": 0.13194804191589354, "num_tokens": 29603639.0, "step": 13680 }, { "entropy": 6.5431897163391115, "epoch": 1.464444325539087, "grad_norm": 1.78125, "learning_rate": 0.00047941696710411975, "loss": 6.2195, "mean_token_accuracy": 0.14435758888721467, "num_tokens": 29615103.0, "step": 13685 }, { "entropy": 6.532386589050293, "epoch": 1.4649793996468512, "grad_norm": 1.8203125, "learning_rate": 0.0004794009886615904, "loss": 6.2905, "mean_token_accuracy": 0.13263922408223153, "num_tokens": 29626184.0, "step": 13690 }, { "entropy": 6.555911445617676, "epoch": 1.465514473754615, "grad_norm": 1.6171875, "learning_rate": 0.00047938500431701135, "loss": 6.2819, "mean_token_accuracy": 0.14328787550330163, "num_tokens": 29637615.0, "step": 13695 }, { "entropy": 6.551273775100708, "epoch": 1.466049547862379, "grad_norm": 2.046875, "learning_rate": 0.000479369014070844, "loss": 6.3061, "mean_token_accuracy": 0.13311365023255348, "num_tokens": 29648648.0, "step": 13700 }, { "entropy": 6.516896438598633, "epoch": 1.4665846219701428, "grad_norm": 1.640625, "learning_rate": 0.00047935301792355003, "loss": 6.2647, "mean_token_accuracy": 0.13810425996780396, "num_tokens": 29660542.0, "step": 13705 }, { "entropy": 6.551743841171264, "epoch": 1.4671196960779067, "grad_norm": 1.4375, "learning_rate": 0.0004793370158755914, "loss": 6.3163, "mean_token_accuracy": 0.13373398035764694, "num_tokens": 29670342.0, "step": 13710 }, { "entropy": 6.513361167907715, "epoch": 1.4676547701856708, "grad_norm": 1.765625, "learning_rate": 0.00047932100792743014, "loss": 6.2694, "mean_token_accuracy": 0.13930255994200708, "num_tokens": 29681191.0, "step": 13715 }, { "entropy": 6.534385299682617, "epoch": 1.4681898442934347, "grad_norm": 1.6171875, "learning_rate": 0.00047930499407952855, "loss": 6.2056, "mean_token_accuracy": 0.14330771416425706, "num_tokens": 29691299.0, "step": 13720 }, { "entropy": 6.518677663803101, "epoch": 1.4687249184011986, "grad_norm": 2.453125, "learning_rate": 0.00047928897433234893, "loss": 6.2598, "mean_token_accuracy": 0.1339192159473896, "num_tokens": 29702125.0, "step": 13725 }, { "entropy": 6.5021195888519285, "epoch": 1.4692599925089624, "grad_norm": 2.0625, "learning_rate": 0.0004792729486863539, "loss": 6.2881, "mean_token_accuracy": 0.1327348917722702, "num_tokens": 29712679.0, "step": 13730 }, { "entropy": 6.5093645572662355, "epoch": 1.4697950666167263, "grad_norm": 1.453125, "learning_rate": 0.0004792569171420061, "loss": 6.2286, "mean_token_accuracy": 0.13891081213951112, "num_tokens": 29723833.0, "step": 13735 }, { "entropy": 6.586244106292725, "epoch": 1.4703301407244904, "grad_norm": 2.046875, "learning_rate": 0.0004792408796997687, "loss": 6.3336, "mean_token_accuracy": 0.13556601256132125, "num_tokens": 29734646.0, "step": 13740 }, { "entropy": 6.5740937232971195, "epoch": 1.4708652148322543, "grad_norm": 1.640625, "learning_rate": 0.0004792248363601044, "loss": 6.2924, "mean_token_accuracy": 0.1350928321480751, "num_tokens": 29745129.0, "step": 13745 }, { "entropy": 6.5654994487762455, "epoch": 1.4714002889400182, "grad_norm": 1.4921875, "learning_rate": 0.0004792087871234767, "loss": 6.2918, "mean_token_accuracy": 0.12818465679883956, "num_tokens": 29756308.0, "step": 13750 }, { "entropy": 6.4984032154083256, "epoch": 1.471935363047782, "grad_norm": 2.296875, "learning_rate": 0.000479192731990349, "loss": 6.2943, "mean_token_accuracy": 0.13055193796753883, "num_tokens": 29767835.0, "step": 13755 }, { "entropy": 6.546389532089234, "epoch": 1.472470437155546, "grad_norm": 1.65625, "learning_rate": 0.0004791766709611849, "loss": 6.3208, "mean_token_accuracy": 0.13507338240742683, "num_tokens": 29778776.0, "step": 13760 }, { "entropy": 6.670673084259033, "epoch": 1.47300551126331, "grad_norm": 1.53125, "learning_rate": 0.000479160604036448, "loss": 6.3501, "mean_token_accuracy": 0.12552779018878937, "num_tokens": 29788800.0, "step": 13765 }, { "entropy": 6.547731256484985, "epoch": 1.473540585371074, "grad_norm": 1.4921875, "learning_rate": 0.0004791445312166025, "loss": 6.2572, "mean_token_accuracy": 0.14021070525050164, "num_tokens": 29799375.0, "step": 13770 }, { "entropy": 6.555331897735596, "epoch": 1.4740756594788378, "grad_norm": 1.3515625, "learning_rate": 0.0004791284525021122, "loss": 6.3837, "mean_token_accuracy": 0.124832434207201, "num_tokens": 29811267.0, "step": 13775 }, { "entropy": 6.5536736965179445, "epoch": 1.4746107335866017, "grad_norm": 1.625, "learning_rate": 0.0004791123678934416, "loss": 6.3248, "mean_token_accuracy": 0.13412302434444429, "num_tokens": 29821616.0, "step": 13780 }, { "entropy": 6.535737466812134, "epoch": 1.4751458076943655, "grad_norm": 1.6953125, "learning_rate": 0.0004790962773910551, "loss": 6.2842, "mean_token_accuracy": 0.13453632444143296, "num_tokens": 29832233.0, "step": 13785 }, { "entropy": 6.596752595901489, "epoch": 1.4756808818021296, "grad_norm": 1.65625, "learning_rate": 0.00047908018099541717, "loss": 6.2757, "mean_token_accuracy": 0.13443198055028915, "num_tokens": 29843465.0, "step": 13790 }, { "entropy": 6.515512847900391, "epoch": 1.4762159559098935, "grad_norm": 1.296875, "learning_rate": 0.0004790640787069927, "loss": 6.1577, "mean_token_accuracy": 0.1415461152791977, "num_tokens": 29854123.0, "step": 13795 }, { "entropy": 6.578099298477173, "epoch": 1.4767510300176574, "grad_norm": 2.671875, "learning_rate": 0.0004790479705262467, "loss": 6.3739, "mean_token_accuracy": 0.12471452876925468, "num_tokens": 29864831.0, "step": 13800 }, { "entropy": 6.5273661613464355, "epoch": 1.4772861041254215, "grad_norm": 1.546875, "learning_rate": 0.0004790318564536441, "loss": 6.2325, "mean_token_accuracy": 0.1310821369290352, "num_tokens": 29876273.0, "step": 13805 }, { "entropy": 6.530851984024048, "epoch": 1.4778211782331854, "grad_norm": 1.7578125, "learning_rate": 0.00047901573648965047, "loss": 6.2287, "mean_token_accuracy": 0.1352597825229168, "num_tokens": 29886560.0, "step": 13810 }, { "entropy": 6.513718509674073, "epoch": 1.4783562523409493, "grad_norm": 1.6953125, "learning_rate": 0.000478999610634731, "loss": 6.2266, "mean_token_accuracy": 0.13684219866991043, "num_tokens": 29896916.0, "step": 13815 }, { "entropy": 6.504454469680786, "epoch": 1.4788913264487131, "grad_norm": 1.53125, "learning_rate": 0.0004789834788893515, "loss": 6.3091, "mean_token_accuracy": 0.1282836228609085, "num_tokens": 29907288.0, "step": 13820 }, { "entropy": 6.495414209365845, "epoch": 1.479426400556477, "grad_norm": 1.53125, "learning_rate": 0.0004789673412539777, "loss": 6.2345, "mean_token_accuracy": 0.13465062901377678, "num_tokens": 29918194.0, "step": 13825 }, { "entropy": 6.546362638473511, "epoch": 1.479961474664241, "grad_norm": 1.390625, "learning_rate": 0.00047895119772907566, "loss": 6.2754, "mean_token_accuracy": 0.13627072498202325, "num_tokens": 29928521.0, "step": 13830 }, { "entropy": 6.507249212265014, "epoch": 1.480496548772005, "grad_norm": 2.25, "learning_rate": 0.0004789350483151113, "loss": 6.2223, "mean_token_accuracy": 0.1304092951118946, "num_tokens": 29938885.0, "step": 13835 }, { "entropy": 6.5725428581237795, "epoch": 1.4810316228797689, "grad_norm": 1.8046875, "learning_rate": 0.0004789188930125512, "loss": 6.3045, "mean_token_accuracy": 0.14193991646170617, "num_tokens": 29948921.0, "step": 13840 }, { "entropy": 6.509477281570435, "epoch": 1.4815666969875327, "grad_norm": 1.6640625, "learning_rate": 0.0004789027318218616, "loss": 6.206, "mean_token_accuracy": 0.1386758007109165, "num_tokens": 29959633.0, "step": 13845 }, { "entropy": 6.521372222900391, "epoch": 1.4821017710952966, "grad_norm": 1.6953125, "learning_rate": 0.0004788865647435093, "loss": 6.2541, "mean_token_accuracy": 0.12845197916030884, "num_tokens": 29970639.0, "step": 13850 }, { "entropy": 6.569345569610595, "epoch": 1.4826368452030607, "grad_norm": 1.578125, "learning_rate": 0.0004788703917779612, "loss": 6.3545, "mean_token_accuracy": 0.13183851465582846, "num_tokens": 29981752.0, "step": 13855 }, { "entropy": 6.550051879882813, "epoch": 1.4831719193108246, "grad_norm": 1.8125, "learning_rate": 0.0004788542129256841, "loss": 6.1886, "mean_token_accuracy": 0.13968370780348777, "num_tokens": 29991037.0, "step": 13860 }, { "entropy": 6.495801591873169, "epoch": 1.4837069934185885, "grad_norm": 1.515625, "learning_rate": 0.00047883802818714526, "loss": 6.3029, "mean_token_accuracy": 0.12434751689434051, "num_tokens": 30001980.0, "step": 13865 }, { "entropy": 6.548546266555786, "epoch": 1.4842420675263523, "grad_norm": 1.78125, "learning_rate": 0.000478821837562812, "loss": 6.3013, "mean_token_accuracy": 0.1336070977151394, "num_tokens": 30013377.0, "step": 13870 }, { "entropy": 6.556598281860351, "epoch": 1.4847771416341162, "grad_norm": 1.6171875, "learning_rate": 0.0004788056410531518, "loss": 6.3398, "mean_token_accuracy": 0.1366582117974758, "num_tokens": 30023909.0, "step": 13875 }, { "entropy": 6.483535861968994, "epoch": 1.4853122157418803, "grad_norm": 1.4765625, "learning_rate": 0.0004787894386586324, "loss": 6.2288, "mean_token_accuracy": 0.13616093918681144, "num_tokens": 30034069.0, "step": 13880 }, { "entropy": 6.478453683853149, "epoch": 1.4858472898496442, "grad_norm": 1.421875, "learning_rate": 0.00047877323037972153, "loss": 6.2289, "mean_token_accuracy": 0.14070839509367944, "num_tokens": 30043940.0, "step": 13885 }, { "entropy": 6.490971994400025, "epoch": 1.486382363957408, "grad_norm": 3.296875, "learning_rate": 0.0004787570162168874, "loss": 6.2126, "mean_token_accuracy": 0.13903133794665337, "num_tokens": 30054985.0, "step": 13890 }, { "entropy": 6.538230991363525, "epoch": 1.486917438065172, "grad_norm": 2.125, "learning_rate": 0.00047874079617059783, "loss": 6.2364, "mean_token_accuracy": 0.13630077689886094, "num_tokens": 30065675.0, "step": 13895 }, { "entropy": 6.529196262359619, "epoch": 1.4874525121729358, "grad_norm": 2.9375, "learning_rate": 0.0004787245702413216, "loss": 6.2044, "mean_token_accuracy": 0.13694037944078447, "num_tokens": 30075305.0, "step": 13900 }, { "entropy": 6.554997396469116, "epoch": 1.4879875862807, "grad_norm": 1.9453125, "learning_rate": 0.00047870833842952697, "loss": 6.3097, "mean_token_accuracy": 0.1343739703297615, "num_tokens": 30087309.0, "step": 13905 }, { "entropy": 6.530051851272583, "epoch": 1.4885226603884638, "grad_norm": 1.8125, "learning_rate": 0.0004786921007356827, "loss": 6.2222, "mean_token_accuracy": 0.13209329545497894, "num_tokens": 30097262.0, "step": 13910 }, { "entropy": 6.552338790893555, "epoch": 1.4890577344962277, "grad_norm": 1.6484375, "learning_rate": 0.00047867585716025767, "loss": 6.3252, "mean_token_accuracy": 0.13659584522247314, "num_tokens": 30107067.0, "step": 13915 }, { "entropy": 6.586587572097779, "epoch": 1.4895928086039918, "grad_norm": 2.3125, "learning_rate": 0.0004786596077037209, "loss": 6.3192, "mean_token_accuracy": 0.13181559294462203, "num_tokens": 30117115.0, "step": 13920 }, { "entropy": 6.603874158859253, "epoch": 1.4901278827117554, "grad_norm": 1.6328125, "learning_rate": 0.00047864335236654144, "loss": 6.265, "mean_token_accuracy": 0.13400094211101532, "num_tokens": 30127202.0, "step": 13925 }, { "entropy": 6.465754890441895, "epoch": 1.4906629568195195, "grad_norm": 1.421875, "learning_rate": 0.0004786270911491889, "loss": 6.2487, "mean_token_accuracy": 0.1353141985833645, "num_tokens": 30138608.0, "step": 13930 }, { "entropy": 6.546110582351685, "epoch": 1.4911980309272834, "grad_norm": 1.859375, "learning_rate": 0.0004786108240521327, "loss": 6.3064, "mean_token_accuracy": 0.137214232981205, "num_tokens": 30148500.0, "step": 13935 }, { "entropy": 6.447632646560669, "epoch": 1.4917331050350473, "grad_norm": 1.578125, "learning_rate": 0.00047859455107584256, "loss": 6.2103, "mean_token_accuracy": 0.13803261518478394, "num_tokens": 30159062.0, "step": 13940 }, { "entropy": 6.514106750488281, "epoch": 1.4922681791428114, "grad_norm": 2.3125, "learning_rate": 0.00047857827222078835, "loss": 6.2742, "mean_token_accuracy": 0.1323826126754284, "num_tokens": 30170468.0, "step": 13945 }, { "entropy": 6.460741758346558, "epoch": 1.4928032532505753, "grad_norm": 1.8671875, "learning_rate": 0.0004785619874874402, "loss": 6.1446, "mean_token_accuracy": 0.14026360735297203, "num_tokens": 30180944.0, "step": 13950 }, { "entropy": 6.476769304275512, "epoch": 1.4933383273583392, "grad_norm": 1.640625, "learning_rate": 0.0004785456968762682, "loss": 6.1668, "mean_token_accuracy": 0.14123549163341523, "num_tokens": 30191614.0, "step": 13955 }, { "entropy": 6.498686170578003, "epoch": 1.493873401466103, "grad_norm": 1.6328125, "learning_rate": 0.00047852940038774276, "loss": 6.2076, "mean_token_accuracy": 0.13988643661141395, "num_tokens": 30202035.0, "step": 13960 }, { "entropy": 6.434373903274536, "epoch": 1.494408475573867, "grad_norm": 1.96875, "learning_rate": 0.00047851309802233457, "loss": 6.2865, "mean_token_accuracy": 0.13843541741371154, "num_tokens": 30213205.0, "step": 13965 }, { "entropy": 6.578490686416626, "epoch": 1.494943549681631, "grad_norm": 1.9453125, "learning_rate": 0.0004784967897805143, "loss": 6.2942, "mean_token_accuracy": 0.13502900078892707, "num_tokens": 30223971.0, "step": 13970 }, { "entropy": 6.575396299362183, "epoch": 1.495478623789395, "grad_norm": 1.4609375, "learning_rate": 0.0004784804756627528, "loss": 6.2904, "mean_token_accuracy": 0.1325635604560375, "num_tokens": 30235346.0, "step": 13975 }, { "entropy": 6.551068210601807, "epoch": 1.4960136978971588, "grad_norm": 1.5625, "learning_rate": 0.00047846415566952106, "loss": 6.2403, "mean_token_accuracy": 0.13519833534955977, "num_tokens": 30246033.0, "step": 13980 }, { "entropy": 6.463932752609253, "epoch": 1.4965487720049226, "grad_norm": 1.75, "learning_rate": 0.00047844782980129057, "loss": 6.2976, "mean_token_accuracy": 0.13278683871030808, "num_tokens": 30258208.0, "step": 13985 }, { "entropy": 6.499045562744141, "epoch": 1.4970838461126865, "grad_norm": 2.328125, "learning_rate": 0.00047843149805853254, "loss": 6.3017, "mean_token_accuracy": 0.13239005208015442, "num_tokens": 30268824.0, "step": 13990 }, { "entropy": 6.578220367431641, "epoch": 1.4976189202204506, "grad_norm": 2.0, "learning_rate": 0.0004784151604417185, "loss": 6.3454, "mean_token_accuracy": 0.12390814051032066, "num_tokens": 30280078.0, "step": 13995 }, { "entropy": 6.530854082107544, "epoch": 1.4981539943282145, "grad_norm": 1.671875, "learning_rate": 0.00047839881695132034, "loss": 6.2298, "mean_token_accuracy": 0.142520771920681, "num_tokens": 30290939.0, "step": 14000 }, { "entropy": 6.495736074447632, "epoch": 1.4986890684359784, "grad_norm": 1.7265625, "learning_rate": 0.00047838246758780996, "loss": 6.2733, "mean_token_accuracy": 0.13784620389342309, "num_tokens": 30301198.0, "step": 14005 }, { "entropy": 6.5063807487487795, "epoch": 1.4992241425437423, "grad_norm": 2.546875, "learning_rate": 0.0004783661123516593, "loss": 6.2377, "mean_token_accuracy": 0.13562998846173285, "num_tokens": 30312021.0, "step": 14010 }, { "entropy": 6.539398670196533, "epoch": 1.4997592166515061, "grad_norm": 1.75, "learning_rate": 0.0004783497512433408, "loss": 6.2485, "mean_token_accuracy": 0.13483910784125328, "num_tokens": 30323335.0, "step": 14015 }, { "entropy": 6.546143436431885, "epoch": 1.5002942907592702, "grad_norm": 2.15625, "learning_rate": 0.0004783333842633268, "loss": 6.2819, "mean_token_accuracy": 0.14089713245630264, "num_tokens": 30334389.0, "step": 14020 }, { "entropy": 6.457803583145141, "epoch": 1.500829364867034, "grad_norm": 1.921875, "learning_rate": 0.00047831701141208994, "loss": 6.233, "mean_token_accuracy": 0.13121172934770584, "num_tokens": 30345407.0, "step": 14025 }, { "entropy": 6.502495861053466, "epoch": 1.501364438974798, "grad_norm": 1.59375, "learning_rate": 0.00047830063269010286, "loss": 6.2574, "mean_token_accuracy": 0.1314643941819668, "num_tokens": 30356718.0, "step": 14030 }, { "entropy": 6.511676168441772, "epoch": 1.501899513082562, "grad_norm": 1.625, "learning_rate": 0.00047828424809783865, "loss": 6.2161, "mean_token_accuracy": 0.13534914702177048, "num_tokens": 30367617.0, "step": 14035 }, { "entropy": 6.525033664703369, "epoch": 1.5024345871903257, "grad_norm": 1.5625, "learning_rate": 0.0004782678576357703, "loss": 6.2518, "mean_token_accuracy": 0.1353394605219364, "num_tokens": 30377923.0, "step": 14040 }, { "entropy": 6.498504686355591, "epoch": 1.5029696612980898, "grad_norm": 2.4375, "learning_rate": 0.0004782514613043711, "loss": 6.2498, "mean_token_accuracy": 0.13915505409240722, "num_tokens": 30388719.0, "step": 14045 }, { "entropy": 6.5068888664245605, "epoch": 1.5035047354058537, "grad_norm": 2.4375, "learning_rate": 0.00047823505910411465, "loss": 6.1937, "mean_token_accuracy": 0.1380567654967308, "num_tokens": 30400191.0, "step": 14050 }, { "entropy": 6.531849670410156, "epoch": 1.5040398095136176, "grad_norm": 1.5546875, "learning_rate": 0.00047821865103547437, "loss": 6.2835, "mean_token_accuracy": 0.1362235277891159, "num_tokens": 30410267.0, "step": 14055 }, { "entropy": 6.547566223144531, "epoch": 1.5045748836213817, "grad_norm": 2.0625, "learning_rate": 0.000478202237098924, "loss": 6.2937, "mean_token_accuracy": 0.131100395321846, "num_tokens": 30420852.0, "step": 14060 }, { "entropy": 6.565202426910401, "epoch": 1.5051099577291454, "grad_norm": 2.421875, "learning_rate": 0.0004781858172949376, "loss": 6.3362, "mean_token_accuracy": 0.1344304248690605, "num_tokens": 30432214.0, "step": 14065 }, { "entropy": 6.567050838470459, "epoch": 1.5056450318369095, "grad_norm": 1.984375, "learning_rate": 0.0004781693916239894, "loss": 6.3408, "mean_token_accuracy": 0.12420830205082893, "num_tokens": 30443919.0, "step": 14070 }, { "entropy": 6.571396207809448, "epoch": 1.5061801059446733, "grad_norm": 2.734375, "learning_rate": 0.00047815296008655347, "loss": 6.3968, "mean_token_accuracy": 0.1250197820365429, "num_tokens": 30453930.0, "step": 14075 }, { "entropy": 6.539173603057861, "epoch": 1.5067151800524372, "grad_norm": 2.46875, "learning_rate": 0.00047813652268310436, "loss": 6.2897, "mean_token_accuracy": 0.12643647491931914, "num_tokens": 30464612.0, "step": 14080 }, { "entropy": 6.526119232177734, "epoch": 1.5072502541602013, "grad_norm": 1.8359375, "learning_rate": 0.00047812007941411673, "loss": 6.241, "mean_token_accuracy": 0.13565285205841066, "num_tokens": 30474819.0, "step": 14085 }, { "entropy": 6.497172927856445, "epoch": 1.507785328267965, "grad_norm": 1.5234375, "learning_rate": 0.00047810363028006535, "loss": 6.224, "mean_token_accuracy": 0.14370110183954238, "num_tokens": 30485481.0, "step": 14090 }, { "entropy": 6.500015735626221, "epoch": 1.508320402375729, "grad_norm": 1.671875, "learning_rate": 0.0004780871752814252, "loss": 6.2542, "mean_token_accuracy": 0.1386760003864765, "num_tokens": 30496321.0, "step": 14095 }, { "entropy": 6.493804264068603, "epoch": 1.508855476483493, "grad_norm": 1.6640625, "learning_rate": 0.0004780707144186714, "loss": 6.3542, "mean_token_accuracy": 0.13237425908446313, "num_tokens": 30507578.0, "step": 14100 }, { "entropy": 6.619511842727661, "epoch": 1.5093905505912568, "grad_norm": 1.5078125, "learning_rate": 0.00047805424769227923, "loss": 6.2831, "mean_token_accuracy": 0.13486289009451866, "num_tokens": 30518328.0, "step": 14105 }, { "entropy": 6.507578802108765, "epoch": 1.509925624699021, "grad_norm": 7.46875, "learning_rate": 0.00047803777510272425, "loss": 6.2604, "mean_token_accuracy": 0.1352337084710598, "num_tokens": 30528555.0, "step": 14110 }, { "entropy": 6.45980315208435, "epoch": 1.5104606988067846, "grad_norm": 1.515625, "learning_rate": 0.000478021296650482, "loss": 6.1892, "mean_token_accuracy": 0.13908951058983804, "num_tokens": 30540217.0, "step": 14115 }, { "entropy": 6.581186199188233, "epoch": 1.5109957729145487, "grad_norm": 1.6875, "learning_rate": 0.0004780048123360283, "loss": 6.3195, "mean_token_accuracy": 0.13534327372908592, "num_tokens": 30550937.0, "step": 14120 }, { "entropy": 6.610339212417602, "epoch": 1.5115308470223126, "grad_norm": 1.59375, "learning_rate": 0.00047798832215983916, "loss": 6.2955, "mean_token_accuracy": 0.13681161478161813, "num_tokens": 30562248.0, "step": 14125 }, { "entropy": 6.576951932907105, "epoch": 1.5120659211300764, "grad_norm": 2.203125, "learning_rate": 0.0004779718261223908, "loss": 6.3061, "mean_token_accuracy": 0.13611859753727912, "num_tokens": 30573362.0, "step": 14130 }, { "entropy": 6.5235360622406, "epoch": 1.5126009952378405, "grad_norm": 1.4140625, "learning_rate": 0.00047795532422415947, "loss": 6.2861, "mean_token_accuracy": 0.13528222739696502, "num_tokens": 30584052.0, "step": 14135 }, { "entropy": 6.521787309646607, "epoch": 1.5131360693456044, "grad_norm": 1.6328125, "learning_rate": 0.0004779388164656217, "loss": 6.3147, "mean_token_accuracy": 0.12935080379247665, "num_tokens": 30594630.0, "step": 14140 }, { "entropy": 6.546995544433594, "epoch": 1.5136711434533683, "grad_norm": 2.4375, "learning_rate": 0.00047792230284725415, "loss": 6.2667, "mean_token_accuracy": 0.13568148985505105, "num_tokens": 30605625.0, "step": 14145 }, { "entropy": 6.531518650054932, "epoch": 1.5142062175611322, "grad_norm": 1.765625, "learning_rate": 0.00047790578336953356, "loss": 6.2531, "mean_token_accuracy": 0.13517610654234885, "num_tokens": 30616520.0, "step": 14150 }, { "entropy": 6.540752983093261, "epoch": 1.514741291668896, "grad_norm": 1.921875, "learning_rate": 0.000477889258032937, "loss": 6.2306, "mean_token_accuracy": 0.14312789514660834, "num_tokens": 30627372.0, "step": 14155 }, { "entropy": 6.500818586349487, "epoch": 1.5152763657766601, "grad_norm": 1.5703125, "learning_rate": 0.00047787272683794157, "loss": 6.2189, "mean_token_accuracy": 0.14515245854854583, "num_tokens": 30636974.0, "step": 14160 }, { "entropy": 6.509118890762329, "epoch": 1.515811439884424, "grad_norm": 1.6796875, "learning_rate": 0.0004778561897850247, "loss": 6.2895, "mean_token_accuracy": 0.13736924827098845, "num_tokens": 30648202.0, "step": 14165 }, { "entropy": 6.517179250717163, "epoch": 1.516346513992188, "grad_norm": 1.90625, "learning_rate": 0.00047783964687466384, "loss": 6.2843, "mean_token_accuracy": 0.1314311482012272, "num_tokens": 30657981.0, "step": 14170 }, { "entropy": 6.537102222442627, "epoch": 1.516881588099952, "grad_norm": 1.65625, "learning_rate": 0.00047782309810733676, "loss": 6.2882, "mean_token_accuracy": 0.12622129172086716, "num_tokens": 30668496.0, "step": 14175 }, { "entropy": 6.487250185012817, "epoch": 1.5174166622077156, "grad_norm": 3.515625, "learning_rate": 0.00047780654348352115, "loss": 6.1805, "mean_token_accuracy": 0.1400587297976017, "num_tokens": 30678868.0, "step": 14180 }, { "entropy": 6.53211088180542, "epoch": 1.5179517363154797, "grad_norm": 1.7421875, "learning_rate": 0.00047778998300369516, "loss": 6.3361, "mean_token_accuracy": 0.1377688691020012, "num_tokens": 30690066.0, "step": 14185 }, { "entropy": 6.4703638553619385, "epoch": 1.5184868104232436, "grad_norm": 3.359375, "learning_rate": 0.0004777734166683368, "loss": 6.1984, "mean_token_accuracy": 0.14053755551576613, "num_tokens": 30700624.0, "step": 14190 }, { "entropy": 6.486501932144165, "epoch": 1.5190218845310075, "grad_norm": 1.5546875, "learning_rate": 0.00047775684447792457, "loss": 6.2265, "mean_token_accuracy": 0.13751474767923355, "num_tokens": 30711183.0, "step": 14195 }, { "entropy": 6.509814453125, "epoch": 1.5195569586387716, "grad_norm": 1.5078125, "learning_rate": 0.000477740266432937, "loss": 6.2449, "mean_token_accuracy": 0.14190192744135857, "num_tokens": 30721446.0, "step": 14200 }, { "entropy": 6.549847173690796, "epoch": 1.5200920327465353, "grad_norm": 2.5625, "learning_rate": 0.00047772368253385267, "loss": 6.2907, "mean_token_accuracy": 0.12940879687666892, "num_tokens": 30731901.0, "step": 14205 }, { "entropy": 6.535141515731811, "epoch": 1.5206271068542994, "grad_norm": 1.6171875, "learning_rate": 0.0004777070927811505, "loss": 6.2551, "mean_token_accuracy": 0.13085372596979142, "num_tokens": 30741701.0, "step": 14210 }, { "entropy": 6.526335382461548, "epoch": 1.5211621809620632, "grad_norm": 2.015625, "learning_rate": 0.00047769049717530956, "loss": 6.2713, "mean_token_accuracy": 0.13423371836543083, "num_tokens": 30751594.0, "step": 14215 }, { "entropy": 6.504735708236694, "epoch": 1.5216972550698271, "grad_norm": 1.6875, "learning_rate": 0.00047767389571680896, "loss": 6.3522, "mean_token_accuracy": 0.126288815587759, "num_tokens": 30764418.0, "step": 14220 }, { "entropy": 6.558633089065552, "epoch": 1.5222323291775912, "grad_norm": 1.484375, "learning_rate": 0.0004776572884061281, "loss": 6.27, "mean_token_accuracy": 0.13761670440435408, "num_tokens": 30773976.0, "step": 14225 }, { "entropy": 6.582456445693969, "epoch": 1.5227674032853549, "grad_norm": 1.640625, "learning_rate": 0.0004776406752437465, "loss": 6.294, "mean_token_accuracy": 0.13682678043842317, "num_tokens": 30784210.0, "step": 14230 }, { "entropy": 6.518918085098266, "epoch": 1.523302477393119, "grad_norm": 1.8359375, "learning_rate": 0.0004776240562301438, "loss": 6.3403, "mean_token_accuracy": 0.12842216491699218, "num_tokens": 30794322.0, "step": 14235 }, { "entropy": 6.564871597290039, "epoch": 1.5238375515008828, "grad_norm": 1.703125, "learning_rate": 0.0004776074313658001, "loss": 6.2875, "mean_token_accuracy": 0.14118874147534372, "num_tokens": 30805264.0, "step": 14240 }, { "entropy": 6.4882111072540285, "epoch": 1.5243726256086467, "grad_norm": 1.625, "learning_rate": 0.0004775908006511952, "loss": 6.2633, "mean_token_accuracy": 0.1359029680490494, "num_tokens": 30815909.0, "step": 14245 }, { "entropy": 6.599324750900268, "epoch": 1.5249076997164108, "grad_norm": 1.6328125, "learning_rate": 0.0004775741640868095, "loss": 6.2546, "mean_token_accuracy": 0.13517858684062958, "num_tokens": 30826867.0, "step": 14250 }, { "entropy": 6.58244743347168, "epoch": 1.5254427738241747, "grad_norm": 1.4375, "learning_rate": 0.00047755752167312314, "loss": 6.2282, "mean_token_accuracy": 0.13037005066871643, "num_tokens": 30837696.0, "step": 14255 }, { "entropy": 6.473442888259887, "epoch": 1.5259778479319386, "grad_norm": 1.84375, "learning_rate": 0.0004775408734106169, "loss": 6.2567, "mean_token_accuracy": 0.13493726029992104, "num_tokens": 30848155.0, "step": 14260 }, { "entropy": 6.436830806732178, "epoch": 1.5265129220397025, "grad_norm": 1.5625, "learning_rate": 0.00047752421929977143, "loss": 6.1409, "mean_token_accuracy": 0.14483771175146104, "num_tokens": 30857804.0, "step": 14265 }, { "entropy": 6.536058521270752, "epoch": 1.5270479961474663, "grad_norm": 1.4453125, "learning_rate": 0.0004775075593410675, "loss": 6.2746, "mean_token_accuracy": 0.13746241480112076, "num_tokens": 30867290.0, "step": 14270 }, { "entropy": 6.5432713508605955, "epoch": 1.5275830702552304, "grad_norm": 1.265625, "learning_rate": 0.00047749089353498625, "loss": 6.3467, "mean_token_accuracy": 0.13378921225667, "num_tokens": 30877634.0, "step": 14275 }, { "entropy": 6.527502536773682, "epoch": 1.5281181443629943, "grad_norm": 1.609375, "learning_rate": 0.000477474221882009, "loss": 6.3047, "mean_token_accuracy": 0.13290925249457358, "num_tokens": 30889176.0, "step": 14280 }, { "entropy": 6.57243766784668, "epoch": 1.5286532184707582, "grad_norm": 1.84375, "learning_rate": 0.0004774575443826169, "loss": 6.2157, "mean_token_accuracy": 0.13979230374097823, "num_tokens": 30899516.0, "step": 14285 }, { "entropy": 6.54964919090271, "epoch": 1.5291882925785223, "grad_norm": 1.8359375, "learning_rate": 0.0004774408610372918, "loss": 6.3118, "mean_token_accuracy": 0.13416342735290526, "num_tokens": 30910155.0, "step": 14290 }, { "entropy": 6.551747894287109, "epoch": 1.529723366686286, "grad_norm": 1.7421875, "learning_rate": 0.0004774241718465152, "loss": 6.3294, "mean_token_accuracy": 0.1300183728337288, "num_tokens": 30921486.0, "step": 14295 }, { "entropy": 6.567112255096435, "epoch": 1.53025844079405, "grad_norm": 3.484375, "learning_rate": 0.0004774074768107691, "loss": 6.2681, "mean_token_accuracy": 0.13543465435504914, "num_tokens": 30932361.0, "step": 14300 }, { "entropy": 6.5201342582702635, "epoch": 1.530793514901814, "grad_norm": 1.625, "learning_rate": 0.00047739077593053554, "loss": 6.2528, "mean_token_accuracy": 0.13535121381282805, "num_tokens": 30943033.0, "step": 14305 }, { "entropy": 6.5211255073547365, "epoch": 1.5313285890095778, "grad_norm": 2.078125, "learning_rate": 0.00047737406920629675, "loss": 6.2404, "mean_token_accuracy": 0.13891438469290734, "num_tokens": 30953094.0, "step": 14310 }, { "entropy": 6.535080623626709, "epoch": 1.531863663117342, "grad_norm": 1.9765625, "learning_rate": 0.00047735735663853514, "loss": 6.2691, "mean_token_accuracy": 0.13467931300401687, "num_tokens": 30964604.0, "step": 14315 }, { "entropy": 6.569497537612915, "epoch": 1.5323987372251056, "grad_norm": 1.828125, "learning_rate": 0.0004773406382277334, "loss": 6.3294, "mean_token_accuracy": 0.13067164942622184, "num_tokens": 30975681.0, "step": 14320 }, { "entropy": 6.575937509536743, "epoch": 1.5329338113328697, "grad_norm": 1.75, "learning_rate": 0.0004773239139743741, "loss": 6.2984, "mean_token_accuracy": 0.12989215925335884, "num_tokens": 30986319.0, "step": 14325 }, { "entropy": 6.52880539894104, "epoch": 1.5334688854406335, "grad_norm": 1.359375, "learning_rate": 0.0004773071838789402, "loss": 6.2534, "mean_token_accuracy": 0.13588482588529588, "num_tokens": 30997077.0, "step": 14330 }, { "entropy": 6.48135142326355, "epoch": 1.5340039595483974, "grad_norm": 1.59375, "learning_rate": 0.0004772904479419148, "loss": 6.1722, "mean_token_accuracy": 0.13954296559095383, "num_tokens": 31007485.0, "step": 14335 }, { "entropy": 6.50969672203064, "epoch": 1.5345390336561615, "grad_norm": 1.734375, "learning_rate": 0.0004772737061637811, "loss": 6.2747, "mean_token_accuracy": 0.14038911312818528, "num_tokens": 31017827.0, "step": 14340 }, { "entropy": 6.547337579727173, "epoch": 1.5350741077639252, "grad_norm": 1.875, "learning_rate": 0.00047725695854502267, "loss": 6.2938, "mean_token_accuracy": 0.1367683343589306, "num_tokens": 31028167.0, "step": 14345 }, { "entropy": 6.506247043609619, "epoch": 1.5356091818716893, "grad_norm": 2.109375, "learning_rate": 0.00047724020508612287, "loss": 6.2354, "mean_token_accuracy": 0.13793734312057496, "num_tokens": 31038941.0, "step": 14350 }, { "entropy": 6.509874773025513, "epoch": 1.5361442559794531, "grad_norm": 1.796875, "learning_rate": 0.00047722344578756564, "loss": 6.2597, "mean_token_accuracy": 0.13013634383678435, "num_tokens": 31049949.0, "step": 14355 }, { "entropy": 6.57332935333252, "epoch": 1.536679330087217, "grad_norm": 1.40625, "learning_rate": 0.00047720668064983476, "loss": 6.2486, "mean_token_accuracy": 0.13523405343294143, "num_tokens": 31059299.0, "step": 14360 }, { "entropy": 6.518624258041382, "epoch": 1.5372144041949811, "grad_norm": 1.6953125, "learning_rate": 0.0004771899096734145, "loss": 6.3483, "mean_token_accuracy": 0.12761058509349824, "num_tokens": 31070508.0, "step": 14365 }, { "entropy": 6.454201030731201, "epoch": 1.5377494783027448, "grad_norm": 1.640625, "learning_rate": 0.00047717313285878886, "loss": 6.24, "mean_token_accuracy": 0.13824471086263657, "num_tokens": 31082354.0, "step": 14370 }, { "entropy": 6.685629796981812, "epoch": 1.5382845524105089, "grad_norm": 1.421875, "learning_rate": 0.00047715635020644247, "loss": 6.3821, "mean_token_accuracy": 0.1280341513454914, "num_tokens": 31093496.0, "step": 14375 }, { "entropy": 6.581520366668701, "epoch": 1.5388196265182728, "grad_norm": 1.96875, "learning_rate": 0.00047713956171685994, "loss": 6.2291, "mean_token_accuracy": 0.13955939933657646, "num_tokens": 31104289.0, "step": 14380 }, { "entropy": 6.408662891387939, "epoch": 1.5393547006260366, "grad_norm": 1.578125, "learning_rate": 0.000477122767390526, "loss": 6.1777, "mean_token_accuracy": 0.1459297515451908, "num_tokens": 31114998.0, "step": 14385 }, { "entropy": 6.475273132324219, "epoch": 1.5398897747338007, "grad_norm": 1.5625, "learning_rate": 0.00047710596722792543, "loss": 6.2817, "mean_token_accuracy": 0.13103958070278168, "num_tokens": 31127393.0, "step": 14390 }, { "entropy": 6.476905965805054, "epoch": 1.5404248488415646, "grad_norm": 2.125, "learning_rate": 0.0004770891612295435, "loss": 6.1077, "mean_token_accuracy": 0.15151217132806777, "num_tokens": 31137484.0, "step": 14395 }, { "entropy": 6.524506330490112, "epoch": 1.5409599229493285, "grad_norm": 1.515625, "learning_rate": 0.0004770723493958654, "loss": 6.3205, "mean_token_accuracy": 0.13329991921782494, "num_tokens": 31147863.0, "step": 14400 }, { "entropy": 6.464319705963135, "epoch": 1.5414949970570924, "grad_norm": 1.484375, "learning_rate": 0.0004770555317273767, "loss": 6.2025, "mean_token_accuracy": 0.13622017651796342, "num_tokens": 31159018.0, "step": 14405 }, { "entropy": 6.558589506149292, "epoch": 1.5420300711648562, "grad_norm": 1.90625, "learning_rate": 0.00047703870822456287, "loss": 6.2174, "mean_token_accuracy": 0.13448593094944955, "num_tokens": 31170673.0, "step": 14410 }, { "entropy": 6.438023281097412, "epoch": 1.5425651452726203, "grad_norm": 1.8125, "learning_rate": 0.0004770218788879097, "loss": 6.0972, "mean_token_accuracy": 0.14730842560529708, "num_tokens": 31181165.0, "step": 14415 }, { "entropy": 6.370760583877564, "epoch": 1.5431002193803842, "grad_norm": 1.703125, "learning_rate": 0.0004770050437179033, "loss": 6.2412, "mean_token_accuracy": 0.13814024552702903, "num_tokens": 31192976.0, "step": 14420 }, { "entropy": 6.539438915252686, "epoch": 1.543635293488148, "grad_norm": 1.5078125, "learning_rate": 0.0004769882027150295, "loss": 6.3375, "mean_token_accuracy": 0.13710992708802222, "num_tokens": 31203979.0, "step": 14425 }, { "entropy": 6.561808919906616, "epoch": 1.5441703675959122, "grad_norm": 1.7265625, "learning_rate": 0.00047697135587977473, "loss": 6.2099, "mean_token_accuracy": 0.14149817302823067, "num_tokens": 31214972.0, "step": 14430 }, { "entropy": 6.556917285919189, "epoch": 1.5447054417036759, "grad_norm": 1.4765625, "learning_rate": 0.00047695450321262546, "loss": 6.3216, "mean_token_accuracy": 0.13588785231113434, "num_tokens": 31224726.0, "step": 14435 }, { "entropy": 6.527967166900635, "epoch": 1.54524051581144, "grad_norm": 2.21875, "learning_rate": 0.0004769376447140683, "loss": 6.2022, "mean_token_accuracy": 0.13984608128666878, "num_tokens": 31235761.0, "step": 14440 }, { "entropy": 6.522278881072998, "epoch": 1.5457755899192038, "grad_norm": 2.25, "learning_rate": 0.00047692078038459015, "loss": 6.3109, "mean_token_accuracy": 0.14084505960345267, "num_tokens": 31246221.0, "step": 14445 }, { "entropy": 6.535905742645264, "epoch": 1.5463106640269677, "grad_norm": 1.5234375, "learning_rate": 0.0004769039102246777, "loss": 6.2541, "mean_token_accuracy": 0.12931643798947334, "num_tokens": 31257364.0, "step": 14450 }, { "entropy": 6.5485001564025875, "epoch": 1.5468457381347318, "grad_norm": 1.765625, "learning_rate": 0.00047688703423481827, "loss": 6.2703, "mean_token_accuracy": 0.13121291548013686, "num_tokens": 31268343.0, "step": 14455 }, { "entropy": 6.530178070068359, "epoch": 1.5473808122424955, "grad_norm": 1.421875, "learning_rate": 0.00047687015241549896, "loss": 6.3008, "mean_token_accuracy": 0.13335917592048646, "num_tokens": 31278335.0, "step": 14460 }, { "entropy": 6.505687570571899, "epoch": 1.5479158863502596, "grad_norm": 1.4140625, "learning_rate": 0.0004768532647672075, "loss": 6.2148, "mean_token_accuracy": 0.12822186350822448, "num_tokens": 31288537.0, "step": 14465 }, { "entropy": 6.440744066238404, "epoch": 1.5484509604580234, "grad_norm": 1.2734375, "learning_rate": 0.0004768363712904314, "loss": 6.2354, "mean_token_accuracy": 0.14038474783301352, "num_tokens": 31299353.0, "step": 14470 }, { "entropy": 6.5596130847930905, "epoch": 1.5489860345657873, "grad_norm": 1.96875, "learning_rate": 0.0004768194719856584, "loss": 6.2527, "mean_token_accuracy": 0.1316815972328186, "num_tokens": 31309655.0, "step": 14475 }, { "entropy": 6.525741004943848, "epoch": 1.5495211086735514, "grad_norm": 1.4375, "learning_rate": 0.0004768025668533765, "loss": 6.315, "mean_token_accuracy": 0.13498535379767418, "num_tokens": 31321008.0, "step": 14480 }, { "entropy": 6.472729158401489, "epoch": 1.550056182781315, "grad_norm": 1.453125, "learning_rate": 0.00047678565589407383, "loss": 6.185, "mean_token_accuracy": 0.1401698887348175, "num_tokens": 31331978.0, "step": 14485 }, { "entropy": 6.510477113723755, "epoch": 1.5505912568890792, "grad_norm": 1.3671875, "learning_rate": 0.0004767687391082387, "loss": 6.2444, "mean_token_accuracy": 0.1391635164618492, "num_tokens": 31341703.0, "step": 14490 }, { "entropy": 6.5434596061706545, "epoch": 1.551126330996843, "grad_norm": 1.3359375, "learning_rate": 0.00047675181649635965, "loss": 6.2757, "mean_token_accuracy": 0.13907155245542527, "num_tokens": 31352787.0, "step": 14495 }, { "entropy": 6.4846821308135985, "epoch": 1.551661405104607, "grad_norm": 1.6328125, "learning_rate": 0.00047673488805892515, "loss": 6.2654, "mean_token_accuracy": 0.13517796471714974, "num_tokens": 31363702.0, "step": 14500 }, { "entropy": 6.530848407745362, "epoch": 1.552196479212371, "grad_norm": 1.34375, "learning_rate": 0.00047671795379642415, "loss": 6.2377, "mean_token_accuracy": 0.12709226831793785, "num_tokens": 31374719.0, "step": 14505 }, { "entropy": 6.620404386520386, "epoch": 1.5527315533201347, "grad_norm": 2.875, "learning_rate": 0.0004767010137093456, "loss": 6.3672, "mean_token_accuracy": 0.12480267137289047, "num_tokens": 31386289.0, "step": 14510 }, { "entropy": 6.537449836730957, "epoch": 1.5532666274278988, "grad_norm": 1.46875, "learning_rate": 0.00047668406779817864, "loss": 6.1873, "mean_token_accuracy": 0.14198817759752275, "num_tokens": 31397103.0, "step": 14515 }, { "entropy": 6.51537299156189, "epoch": 1.5538017015356627, "grad_norm": 1.4609375, "learning_rate": 0.0004766671160634125, "loss": 6.2841, "mean_token_accuracy": 0.13656345903873443, "num_tokens": 31408715.0, "step": 14520 }, { "entropy": 6.582148265838623, "epoch": 1.5543367756434265, "grad_norm": 1.7265625, "learning_rate": 0.0004766501585055367, "loss": 6.3024, "mean_token_accuracy": 0.1285000301897526, "num_tokens": 31420365.0, "step": 14525 }, { "entropy": 6.546790933609008, "epoch": 1.5548718497511906, "grad_norm": 2.25, "learning_rate": 0.000476633195125041, "loss": 6.2135, "mean_token_accuracy": 0.13490134105086327, "num_tokens": 31431635.0, "step": 14530 }, { "entropy": 6.520722341537476, "epoch": 1.5554069238589545, "grad_norm": 1.40625, "learning_rate": 0.00047661622592241507, "loss": 6.2576, "mean_token_accuracy": 0.13644103407859803, "num_tokens": 31442513.0, "step": 14535 }, { "entropy": 6.521498155593872, "epoch": 1.5559419979667184, "grad_norm": 1.3125, "learning_rate": 0.0004765992508981489, "loss": 6.2933, "mean_token_accuracy": 0.1281339019536972, "num_tokens": 31453726.0, "step": 14540 }, { "entropy": 6.541304016113282, "epoch": 1.5564770720744823, "grad_norm": 1.3671875, "learning_rate": 0.0004765822700527328, "loss": 6.2009, "mean_token_accuracy": 0.1394302561879158, "num_tokens": 31463980.0, "step": 14545 }, { "entropy": 6.500122165679931, "epoch": 1.5570121461822461, "grad_norm": 2.046875, "learning_rate": 0.0004765652833866569, "loss": 6.3489, "mean_token_accuracy": 0.12963479459285737, "num_tokens": 31474615.0, "step": 14550 }, { "entropy": 6.462019920349121, "epoch": 1.5575472202900102, "grad_norm": 1.7109375, "learning_rate": 0.0004765482909004118, "loss": 6.2117, "mean_token_accuracy": 0.14140638411045076, "num_tokens": 31485283.0, "step": 14555 }, { "entropy": 6.535767030715943, "epoch": 1.5580822943977741, "grad_norm": 1.46875, "learning_rate": 0.0004765312925944881, "loss": 6.2584, "mean_token_accuracy": 0.13080894574522972, "num_tokens": 31496997.0, "step": 14560 }, { "entropy": 6.6297478675842285, "epoch": 1.558617368505538, "grad_norm": 2.84375, "learning_rate": 0.00047651428846937673, "loss": 6.276, "mean_token_accuracy": 0.1357246607542038, "num_tokens": 31507585.0, "step": 14565 }, { "entropy": 6.511379718780518, "epoch": 1.559152442613302, "grad_norm": 1.7109375, "learning_rate": 0.00047649727852556854, "loss": 6.1847, "mean_token_accuracy": 0.13770078867673874, "num_tokens": 31517078.0, "step": 14570 }, { "entropy": 6.370854806900025, "epoch": 1.5596875167210658, "grad_norm": 3.296875, "learning_rate": 0.0004764802627635547, "loss": 6.1966, "mean_token_accuracy": 0.14397168532013893, "num_tokens": 31528576.0, "step": 14575 }, { "entropy": 6.582043838500977, "epoch": 1.5602225908288299, "grad_norm": 1.4609375, "learning_rate": 0.0004764632411838266, "loss": 6.2935, "mean_token_accuracy": 0.12686383947730065, "num_tokens": 31540095.0, "step": 14580 }, { "entropy": 6.544200801849366, "epoch": 1.5607576649365937, "grad_norm": 2.03125, "learning_rate": 0.00047644621378687573, "loss": 6.2075, "mean_token_accuracy": 0.13072769418358804, "num_tokens": 31550980.0, "step": 14585 }, { "entropy": 6.3452962875366214, "epoch": 1.5612927390443576, "grad_norm": 3.0625, "learning_rate": 0.00047642918057319377, "loss": 6.0208, "mean_token_accuracy": 0.15695239156484603, "num_tokens": 31561842.0, "step": 14590 }, { "entropy": 6.525337028503418, "epoch": 1.5618278131521217, "grad_norm": 2.640625, "learning_rate": 0.0004764121415432725, "loss": 6.3623, "mean_token_accuracy": 0.12762523368000983, "num_tokens": 31572798.0, "step": 14595 }, { "entropy": 6.54258165359497, "epoch": 1.5623628872598854, "grad_norm": 1.75, "learning_rate": 0.0004763950966976039, "loss": 6.3345, "mean_token_accuracy": 0.13119860887527465, "num_tokens": 31584774.0, "step": 14600 }, { "entropy": 6.536434745788574, "epoch": 1.5628979613676495, "grad_norm": 1.3828125, "learning_rate": 0.0004763780460366803, "loss": 6.2323, "mean_token_accuracy": 0.13397064805030823, "num_tokens": 31596197.0, "step": 14605 }, { "entropy": 6.550236940383911, "epoch": 1.5634330354754133, "grad_norm": 2.4375, "learning_rate": 0.0004763609895609939, "loss": 6.2697, "mean_token_accuracy": 0.13484611362218857, "num_tokens": 31607455.0, "step": 14610 }, { "entropy": 6.561938524246216, "epoch": 1.5639681095831772, "grad_norm": 1.6484375, "learning_rate": 0.00047634392727103714, "loss": 6.3114, "mean_token_accuracy": 0.13227349519729614, "num_tokens": 31618995.0, "step": 14615 }, { "entropy": 6.468525743484497, "epoch": 1.5645031836909413, "grad_norm": 1.328125, "learning_rate": 0.0004763268591673028, "loss": 6.1841, "mean_token_accuracy": 0.13631799519062043, "num_tokens": 31629984.0, "step": 14620 }, { "entropy": 6.492383766174316, "epoch": 1.565038257798705, "grad_norm": 1.703125, "learning_rate": 0.0004763097852502837, "loss": 6.1968, "mean_token_accuracy": 0.13692545443773269, "num_tokens": 31641362.0, "step": 14625 }, { "entropy": 6.5297730445861815, "epoch": 1.565573331906469, "grad_norm": 2.625, "learning_rate": 0.00047629270552047284, "loss": 6.3723, "mean_token_accuracy": 0.12706034481525422, "num_tokens": 31652650.0, "step": 14630 }, { "entropy": 6.5213886260986325, "epoch": 1.566108406014233, "grad_norm": 2.453125, "learning_rate": 0.00047627561997836337, "loss": 6.2875, "mean_token_accuracy": 0.12873518839478493, "num_tokens": 31664201.0, "step": 14635 }, { "entropy": 6.579891300201416, "epoch": 1.5666434801219968, "grad_norm": 1.578125, "learning_rate": 0.0004762585286244487, "loss": 6.2509, "mean_token_accuracy": 0.13287581130862236, "num_tokens": 31674480.0, "step": 14640 }, { "entropy": 6.5407298564910885, "epoch": 1.567178554229761, "grad_norm": 1.421875, "learning_rate": 0.00047624143145922227, "loss": 6.2555, "mean_token_accuracy": 0.1364641495049, "num_tokens": 31685377.0, "step": 14645 }, { "entropy": 6.54713773727417, "epoch": 1.5677136283375246, "grad_norm": 1.5703125, "learning_rate": 0.00047622432848317775, "loss": 6.2556, "mean_token_accuracy": 0.13927348628640174, "num_tokens": 31695199.0, "step": 14650 }, { "entropy": 6.462022686004639, "epoch": 1.5682487024452887, "grad_norm": 1.6328125, "learning_rate": 0.0004762072196968091, "loss": 6.268, "mean_token_accuracy": 0.13694618120789528, "num_tokens": 31705528.0, "step": 14655 }, { "entropy": 6.4519548416137695, "epoch": 1.5687837765530526, "grad_norm": 1.859375, "learning_rate": 0.0004761901051006102, "loss": 6.2195, "mean_token_accuracy": 0.14057985618710517, "num_tokens": 31718156.0, "step": 14660 }, { "entropy": 6.518571949005127, "epoch": 1.5693188506608164, "grad_norm": 2.28125, "learning_rate": 0.00047617298469507534, "loss": 6.2554, "mean_token_accuracy": 0.1364244446158409, "num_tokens": 31729783.0, "step": 14665 }, { "entropy": 6.5569658279418945, "epoch": 1.5698539247685805, "grad_norm": 1.75, "learning_rate": 0.0004761558584806988, "loss": 6.2264, "mean_token_accuracy": 0.1388966977596283, "num_tokens": 31740796.0, "step": 14670 }, { "entropy": 6.588993740081787, "epoch": 1.5703889988763444, "grad_norm": 1.921875, "learning_rate": 0.0004761387264579751, "loss": 6.3151, "mean_token_accuracy": 0.13168300688266754, "num_tokens": 31750559.0, "step": 14675 }, { "entropy": 6.521017694473267, "epoch": 1.5709240729841083, "grad_norm": 1.5546875, "learning_rate": 0.0004761215886273989, "loss": 6.1991, "mean_token_accuracy": 0.13765431344509124, "num_tokens": 31761559.0, "step": 14680 }, { "entropy": 6.494146347045898, "epoch": 1.5714591470918722, "grad_norm": 1.5390625, "learning_rate": 0.00047610444498946507, "loss": 6.2014, "mean_token_accuracy": 0.13926137760281562, "num_tokens": 31771677.0, "step": 14685 }, { "entropy": 6.539397382736206, "epoch": 1.571994221199636, "grad_norm": 1.4765625, "learning_rate": 0.0004760872955446688, "loss": 6.3242, "mean_token_accuracy": 0.12628690302371978, "num_tokens": 31783028.0, "step": 14690 }, { "entropy": 6.554657936096191, "epoch": 1.5725292953074002, "grad_norm": 2.203125, "learning_rate": 0.00047607014029350504, "loss": 6.2933, "mean_token_accuracy": 0.13701235502958298, "num_tokens": 31793110.0, "step": 14695 }, { "entropy": 6.496626329421997, "epoch": 1.573064369415164, "grad_norm": 1.8828125, "learning_rate": 0.00047605297923646923, "loss": 6.2598, "mean_token_accuracy": 0.13291990309953688, "num_tokens": 31804193.0, "step": 14700 }, { "entropy": 6.518072462081909, "epoch": 1.573599443522928, "grad_norm": 2.03125, "learning_rate": 0.00047603581237405684, "loss": 6.2548, "mean_token_accuracy": 0.13917799517512322, "num_tokens": 31815752.0, "step": 14705 }, { "entropy": 6.575625705718994, "epoch": 1.574134517630692, "grad_norm": 1.65625, "learning_rate": 0.00047601863970676367, "loss": 6.3434, "mean_token_accuracy": 0.1280118577182293, "num_tokens": 31825936.0, "step": 14710 }, { "entropy": 6.54962010383606, "epoch": 1.5746695917384557, "grad_norm": 1.859375, "learning_rate": 0.00047600146123508554, "loss": 6.2271, "mean_token_accuracy": 0.13201195001602173, "num_tokens": 31836601.0, "step": 14715 }, { "entropy": 6.3876525402069095, "epoch": 1.5752046658462198, "grad_norm": 2.40625, "learning_rate": 0.00047598427695951846, "loss": 6.0703, "mean_token_accuracy": 0.14671236798167228, "num_tokens": 31846476.0, "step": 14720 }, { "entropy": 6.38327260017395, "epoch": 1.5757397399539836, "grad_norm": 1.6015625, "learning_rate": 0.00047596708688055857, "loss": 6.0755, "mean_token_accuracy": 0.1459612712264061, "num_tokens": 31856151.0, "step": 14725 }, { "entropy": 6.544833850860596, "epoch": 1.5762748140617475, "grad_norm": 1.5859375, "learning_rate": 0.0004759498909987023, "loss": 6.3136, "mean_token_accuracy": 0.1280362620949745, "num_tokens": 31867419.0, "step": 14730 }, { "entropy": 6.5832963466644285, "epoch": 1.5768098881695116, "grad_norm": 1.5234375, "learning_rate": 0.0004759326893144462, "loss": 6.3235, "mean_token_accuracy": 0.13490021526813506, "num_tokens": 31878036.0, "step": 14735 }, { "entropy": 6.542579221725464, "epoch": 1.5773449622772753, "grad_norm": 1.8046875, "learning_rate": 0.000475915481828287, "loss": 6.2622, "mean_token_accuracy": 0.13082825392484665, "num_tokens": 31887919.0, "step": 14740 }, { "entropy": 6.434671688079834, "epoch": 1.5778800363850394, "grad_norm": 1.390625, "learning_rate": 0.00047589826854072133, "loss": 6.2629, "mean_token_accuracy": 0.13572418168187142, "num_tokens": 31898962.0, "step": 14745 }, { "entropy": 6.579334545135498, "epoch": 1.5784151104928033, "grad_norm": 1.75, "learning_rate": 0.00047588104945224654, "loss": 6.3589, "mean_token_accuracy": 0.13001709431409836, "num_tokens": 31911027.0, "step": 14750 }, { "entropy": 6.5912518978118895, "epoch": 1.5789501846005671, "grad_norm": 1.546875, "learning_rate": 0.0004758638245633595, "loss": 6.278, "mean_token_accuracy": 0.13635631650686264, "num_tokens": 31921226.0, "step": 14755 }, { "entropy": 6.496388244628906, "epoch": 1.5794852587083312, "grad_norm": 1.75, "learning_rate": 0.0004758465938745579, "loss": 6.2114, "mean_token_accuracy": 0.13777147978544235, "num_tokens": 31932848.0, "step": 14760 }, { "entropy": 6.460186386108399, "epoch": 1.5800203328160949, "grad_norm": 1.3828125, "learning_rate": 0.00047582935738633915, "loss": 6.1486, "mean_token_accuracy": 0.13729973658919334, "num_tokens": 31943757.0, "step": 14765 }, { "entropy": 6.520174598693847, "epoch": 1.580555406923859, "grad_norm": 1.7890625, "learning_rate": 0.0004758121150992009, "loss": 6.3122, "mean_token_accuracy": 0.12971630915999413, "num_tokens": 31954391.0, "step": 14770 }, { "entropy": 6.51693320274353, "epoch": 1.5810904810316229, "grad_norm": 2.0625, "learning_rate": 0.00047579486701364093, "loss": 6.3043, "mean_token_accuracy": 0.13650548011064528, "num_tokens": 31964497.0, "step": 14775 }, { "entropy": 6.5695905685424805, "epoch": 1.5816255551393867, "grad_norm": 1.875, "learning_rate": 0.0004757776131301575, "loss": 6.2831, "mean_token_accuracy": 0.130709208548069, "num_tokens": 31974466.0, "step": 14780 }, { "entropy": 6.557105636596679, "epoch": 1.5821606292471508, "grad_norm": 1.796875, "learning_rate": 0.0004757603534492487, "loss": 6.3066, "mean_token_accuracy": 0.13409281075000762, "num_tokens": 31985890.0, "step": 14785 }, { "entropy": 6.504603242874145, "epoch": 1.5826957033549145, "grad_norm": 2.890625, "learning_rate": 0.0004757430879714128, "loss": 6.4018, "mean_token_accuracy": 0.13219767883419992, "num_tokens": 31996865.0, "step": 14790 }, { "entropy": 6.460845565795898, "epoch": 1.5832307774626786, "grad_norm": 1.953125, "learning_rate": 0.0004757258166971485, "loss": 6.1455, "mean_token_accuracy": 0.1445557326078415, "num_tokens": 32008121.0, "step": 14795 }, { "entropy": 6.570254182815551, "epoch": 1.5837658515704425, "grad_norm": 2.234375, "learning_rate": 0.0004757085396269545, "loss": 6.3516, "mean_token_accuracy": 0.1301535189151764, "num_tokens": 32020552.0, "step": 14800 }, { "entropy": 6.561383485794067, "epoch": 1.5843009256782064, "grad_norm": 2.40625, "learning_rate": 0.00047569125676132963, "loss": 6.3061, "mean_token_accuracy": 0.13402550369501115, "num_tokens": 32032361.0, "step": 14805 }, { "entropy": 6.55854434967041, "epoch": 1.5848359997859705, "grad_norm": 1.3359375, "learning_rate": 0.00047567396810077286, "loss": 6.2886, "mean_token_accuracy": 0.12737912312150002, "num_tokens": 32043233.0, "step": 14810 }, { "entropy": 6.552183437347412, "epoch": 1.5853710738937343, "grad_norm": 1.703125, "learning_rate": 0.00047565667364578344, "loss": 6.253, "mean_token_accuracy": 0.14003728479146957, "num_tokens": 32054273.0, "step": 14815 }, { "entropy": 6.523531103134156, "epoch": 1.5859061480014982, "grad_norm": 2.03125, "learning_rate": 0.0004756393733968608, "loss": 6.2287, "mean_token_accuracy": 0.14313824102282524, "num_tokens": 32064200.0, "step": 14820 }, { "entropy": 6.451785039901734, "epoch": 1.586441222109262, "grad_norm": 1.4609375, "learning_rate": 0.0004756220673545045, "loss": 6.217, "mean_token_accuracy": 0.14075903221964836, "num_tokens": 32074823.0, "step": 14825 }, { "entropy": 6.533991765975952, "epoch": 1.586976296217026, "grad_norm": 2.421875, "learning_rate": 0.00047560475551921416, "loss": 6.3073, "mean_token_accuracy": 0.13615889325737954, "num_tokens": 32085333.0, "step": 14830 }, { "entropy": 6.625106430053711, "epoch": 1.58751137032479, "grad_norm": 1.3203125, "learning_rate": 0.0004755874378914897, "loss": 6.2903, "mean_token_accuracy": 0.13102672025561332, "num_tokens": 32095827.0, "step": 14835 }, { "entropy": 6.524811744689941, "epoch": 1.588046444432554, "grad_norm": 1.796875, "learning_rate": 0.0004755701144718311, "loss": 6.2861, "mean_token_accuracy": 0.13742618560791015, "num_tokens": 32106949.0, "step": 14840 }, { "entropy": 6.501339530944824, "epoch": 1.5885815185403178, "grad_norm": 2.15625, "learning_rate": 0.00047555278526073867, "loss": 6.2225, "mean_token_accuracy": 0.14211768209934234, "num_tokens": 32118269.0, "step": 14845 }, { "entropy": 6.4988819599151615, "epoch": 1.589116592648082, "grad_norm": 1.6328125, "learning_rate": 0.0004755354502587127, "loss": 6.2626, "mean_token_accuracy": 0.13281174525618553, "num_tokens": 32128406.0, "step": 14850 }, { "entropy": 6.5138648509979244, "epoch": 1.5896516667558456, "grad_norm": 1.7890625, "learning_rate": 0.00047551810946625385, "loss": 6.2798, "mean_token_accuracy": 0.1371403641998768, "num_tokens": 32140112.0, "step": 14855 }, { "entropy": 6.533293962478638, "epoch": 1.5901867408636097, "grad_norm": 1.90625, "learning_rate": 0.00047550076288386276, "loss": 6.2083, "mean_token_accuracy": 0.14420999884605407, "num_tokens": 32150010.0, "step": 14860 }, { "entropy": 6.5140081405639645, "epoch": 1.5907218149713735, "grad_norm": 1.921875, "learning_rate": 0.0004754834105120403, "loss": 6.3212, "mean_token_accuracy": 0.12911390140652657, "num_tokens": 32160694.0, "step": 14865 }, { "entropy": 6.499224996566772, "epoch": 1.5912568890791374, "grad_norm": 1.640625, "learning_rate": 0.00047546605235128755, "loss": 6.3156, "mean_token_accuracy": 0.1340811789035797, "num_tokens": 32171947.0, "step": 14870 }, { "entropy": 6.5859424591064455, "epoch": 1.5917919631869015, "grad_norm": 1.9453125, "learning_rate": 0.0004754486884021057, "loss": 6.3007, "mean_token_accuracy": 0.13230689167976378, "num_tokens": 32182849.0, "step": 14875 }, { "entropy": 6.548197221755982, "epoch": 1.5923270372946652, "grad_norm": 1.8125, "learning_rate": 0.0004754313186649961, "loss": 6.2999, "mean_token_accuracy": 0.13477448523044586, "num_tokens": 32192871.0, "step": 14880 }, { "entropy": 6.562755441665649, "epoch": 1.5928621114024293, "grad_norm": 2.125, "learning_rate": 0.00047541394314046037, "loss": 6.3227, "mean_token_accuracy": 0.1299983151257038, "num_tokens": 32203289.0, "step": 14885 }, { "entropy": 6.5510444164276125, "epoch": 1.5933971855101932, "grad_norm": 1.53125, "learning_rate": 0.0004753965618290002, "loss": 6.2676, "mean_token_accuracy": 0.13420026302337645, "num_tokens": 32213238.0, "step": 14890 }, { "entropy": 6.424655485153198, "epoch": 1.593932259617957, "grad_norm": 1.640625, "learning_rate": 0.0004753791747311175, "loss": 6.1858, "mean_token_accuracy": 0.13797398135066033, "num_tokens": 32223384.0, "step": 14895 }, { "entropy": 6.520129299163818, "epoch": 1.5944673337257211, "grad_norm": 1.78125, "learning_rate": 0.00047536178184731426, "loss": 6.2804, "mean_token_accuracy": 0.13506588339805603, "num_tokens": 32235358.0, "step": 14900 }, { "entropy": 6.643621444702148, "epoch": 1.5950024078334848, "grad_norm": 1.59375, "learning_rate": 0.0004753443831780927, "loss": 6.3203, "mean_token_accuracy": 0.12936478480696678, "num_tokens": 32246459.0, "step": 14905 }, { "entropy": 6.506386947631836, "epoch": 1.595537481941249, "grad_norm": 1.7578125, "learning_rate": 0.0004753269787239552, "loss": 6.2174, "mean_token_accuracy": 0.13538266569375992, "num_tokens": 32257798.0, "step": 14910 }, { "entropy": 6.502975988388061, "epoch": 1.5960725560490128, "grad_norm": 1.6328125, "learning_rate": 0.00047530956848540435, "loss": 6.2543, "mean_token_accuracy": 0.1334786370396614, "num_tokens": 32268118.0, "step": 14915 }, { "entropy": 6.445563507080078, "epoch": 1.5966076301567766, "grad_norm": 1.5859375, "learning_rate": 0.0004752921524629429, "loss": 6.186, "mean_token_accuracy": 0.13638549968600272, "num_tokens": 32279676.0, "step": 14920 }, { "entropy": 6.503003644943237, "epoch": 1.5971427042645407, "grad_norm": 1.53125, "learning_rate": 0.0004752747306570737, "loss": 6.2293, "mean_token_accuracy": 0.13795944750308992, "num_tokens": 32290613.0, "step": 14925 }, { "entropy": 6.5680375576019285, "epoch": 1.5976777783723044, "grad_norm": 1.4921875, "learning_rate": 0.00047525730306829977, "loss": 6.2521, "mean_token_accuracy": 0.13554463014006615, "num_tokens": 32300873.0, "step": 14930 }, { "entropy": 6.557008171081543, "epoch": 1.5982128524800685, "grad_norm": 4.53125, "learning_rate": 0.0004752398696971244, "loss": 6.2657, "mean_token_accuracy": 0.13355937376618385, "num_tokens": 32312326.0, "step": 14935 }, { "entropy": 6.5607640743255615, "epoch": 1.5987479265878324, "grad_norm": 2.0, "learning_rate": 0.00047522243054405085, "loss": 6.2513, "mean_token_accuracy": 0.12972980067133905, "num_tokens": 32324322.0, "step": 14940 }, { "entropy": 6.560641956329346, "epoch": 1.5992830006955963, "grad_norm": 1.65625, "learning_rate": 0.0004752049856095828, "loss": 6.2231, "mean_token_accuracy": 0.13305347710847854, "num_tokens": 32334397.0, "step": 14945 }, { "entropy": 6.470574998855591, "epoch": 1.5998180748033604, "grad_norm": 1.765625, "learning_rate": 0.00047518753489422393, "loss": 6.2252, "mean_token_accuracy": 0.1374221198260784, "num_tokens": 32345131.0, "step": 14950 }, { "entropy": 6.4330222606658936, "epoch": 1.6003531489111242, "grad_norm": 1.375, "learning_rate": 0.00047517007839847816, "loss": 6.2059, "mean_token_accuracy": 0.13534148335456847, "num_tokens": 32355520.0, "step": 14955 }, { "entropy": 6.536291217803955, "epoch": 1.6008882230188881, "grad_norm": 1.3125, "learning_rate": 0.0004751526161228494, "loss": 6.2917, "mean_token_accuracy": 0.14231665730476378, "num_tokens": 32366695.0, "step": 14960 }, { "entropy": 6.454723787307739, "epoch": 1.601423297126652, "grad_norm": 1.59375, "learning_rate": 0.000475135148067842, "loss": 6.2309, "mean_token_accuracy": 0.13280131667852402, "num_tokens": 32377467.0, "step": 14965 }, { "entropy": 6.581510353088379, "epoch": 1.6019583712344159, "grad_norm": 2.4375, "learning_rate": 0.00047511767423396033, "loss": 6.2621, "mean_token_accuracy": 0.1360831081867218, "num_tokens": 32388021.0, "step": 14970 }, { "entropy": 6.5882233619689945, "epoch": 1.60249344534218, "grad_norm": 1.3984375, "learning_rate": 0.000475100194621709, "loss": 6.2323, "mean_token_accuracy": 0.14279873743653299, "num_tokens": 32398105.0, "step": 14975 }, { "entropy": 6.526843452453614, "epoch": 1.6030285194499438, "grad_norm": 1.828125, "learning_rate": 0.0004750827092315926, "loss": 6.3458, "mean_token_accuracy": 0.13159868866205215, "num_tokens": 32409876.0, "step": 14980 }, { "entropy": 6.51892728805542, "epoch": 1.6035635935577077, "grad_norm": 1.828125, "learning_rate": 0.00047506521806411613, "loss": 6.2424, "mean_token_accuracy": 0.14545759409666062, "num_tokens": 32420283.0, "step": 14985 }, { "entropy": 6.54042501449585, "epoch": 1.6040986676654718, "grad_norm": 1.4921875, "learning_rate": 0.00047504772111978463, "loss": 6.3343, "mean_token_accuracy": 0.12750672101974486, "num_tokens": 32431164.0, "step": 14990 }, { "entropy": 6.5425420761108395, "epoch": 1.6046337417732355, "grad_norm": 2.203125, "learning_rate": 0.0004750302183991032, "loss": 6.2426, "mean_token_accuracy": 0.132595930993557, "num_tokens": 32442253.0, "step": 14995 }, { "entropy": 6.50988450050354, "epoch": 1.6051688158809996, "grad_norm": 1.71875, "learning_rate": 0.0004750127099025774, "loss": 6.338, "mean_token_accuracy": 0.1360313430428505, "num_tokens": 32452800.0, "step": 15000 }, { "epoch": 1.6051688158809996, "eval_entropy": 6.419160812048899, "eval_loss": 6.373970031738281, "eval_mean_token_accuracy": 0.13763191947648226, "eval_num_tokens": 32452800.0, "eval_runtime": 22.5526, "eval_samples_per_second": 1315.992, "eval_steps_per_second": 164.505, "step": 15000 }, { "entropy": 6.596367835998535, "epoch": 1.6057038899887635, "grad_norm": 1.3359375, "learning_rate": 0.0004749951956307126, "loss": 6.2873, "mean_token_accuracy": 0.1296849727630615, "num_tokens": 32462890.0, "step": 15005 }, { "entropy": 6.485629034042359, "epoch": 1.6062389640965273, "grad_norm": 2.453125, "learning_rate": 0.0004749776755840148, "loss": 6.2551, "mean_token_accuracy": 0.14182380735874175, "num_tokens": 32473422.0, "step": 15010 }, { "entropy": 6.500695705413818, "epoch": 1.6067740382042914, "grad_norm": 2.3125, "learning_rate": 0.00047496014976298957, "loss": 6.2867, "mean_token_accuracy": 0.13322071507573127, "num_tokens": 32483980.0, "step": 15015 }, { "entropy": 6.603447580337525, "epoch": 1.607309112312055, "grad_norm": 1.734375, "learning_rate": 0.0004749426181681432, "loss": 6.3083, "mean_token_accuracy": 0.13130330070853233, "num_tokens": 32494905.0, "step": 15020 }, { "entropy": 6.614582967758179, "epoch": 1.6078441864198192, "grad_norm": 2.65625, "learning_rate": 0.00047492508079998173, "loss": 6.3397, "mean_token_accuracy": 0.12839462533593177, "num_tokens": 32505799.0, "step": 15025 }, { "entropy": 6.563151884078979, "epoch": 1.608379260527583, "grad_norm": 1.4765625, "learning_rate": 0.0004749075376590117, "loss": 6.3072, "mean_token_accuracy": 0.12912078201770782, "num_tokens": 32516328.0, "step": 15030 }, { "entropy": 6.532871294021606, "epoch": 1.608914334635347, "grad_norm": 1.5625, "learning_rate": 0.0004748899887457396, "loss": 6.2823, "mean_token_accuracy": 0.13482635021209716, "num_tokens": 32526335.0, "step": 15035 }, { "entropy": 6.4955644607543945, "epoch": 1.609449408743111, "grad_norm": 1.515625, "learning_rate": 0.00047487243406067227, "loss": 6.2544, "mean_token_accuracy": 0.1365067608654499, "num_tokens": 32536896.0, "step": 15040 }, { "entropy": 6.512849569320679, "epoch": 1.6099844828508747, "grad_norm": 1.859375, "learning_rate": 0.0004748548736043164, "loss": 6.1869, "mean_token_accuracy": 0.1340150237083435, "num_tokens": 32547604.0, "step": 15045 }, { "entropy": 6.575725650787353, "epoch": 1.6105195569586388, "grad_norm": 1.5859375, "learning_rate": 0.00047483730737717914, "loss": 6.299, "mean_token_accuracy": 0.12914739921689034, "num_tokens": 32558539.0, "step": 15050 }, { "entropy": 6.5589573860168455, "epoch": 1.6110546310664027, "grad_norm": 2.46875, "learning_rate": 0.0004748197353797677, "loss": 6.3663, "mean_token_accuracy": 0.12705627977848052, "num_tokens": 32569787.0, "step": 15055 }, { "entropy": 6.542858552932739, "epoch": 1.6115897051741666, "grad_norm": 1.7890625, "learning_rate": 0.0004748021576125895, "loss": 6.3022, "mean_token_accuracy": 0.13655368536710738, "num_tokens": 32580146.0, "step": 15060 }, { "entropy": 6.52427453994751, "epoch": 1.6121247792819307, "grad_norm": 1.7421875, "learning_rate": 0.0004747845740761521, "loss": 6.2485, "mean_token_accuracy": 0.13791619762778282, "num_tokens": 32591243.0, "step": 15065 }, { "entropy": 6.557205581665039, "epoch": 1.6126598533896943, "grad_norm": 1.4140625, "learning_rate": 0.0004747669847709631, "loss": 6.3058, "mean_token_accuracy": 0.13091632947325707, "num_tokens": 32602424.0, "step": 15070 }, { "entropy": 6.61011905670166, "epoch": 1.6131949274974584, "grad_norm": 2.140625, "learning_rate": 0.0004747493896975306, "loss": 6.3701, "mean_token_accuracy": 0.12900158390402794, "num_tokens": 32613703.0, "step": 15075 }, { "entropy": 6.564071750640869, "epoch": 1.6137300016052223, "grad_norm": 1.7578125, "learning_rate": 0.0004747317888563625, "loss": 6.3133, "mean_token_accuracy": 0.1308335021138191, "num_tokens": 32624371.0, "step": 15080 }, { "entropy": 6.55357985496521, "epoch": 1.6142650757129862, "grad_norm": 2.140625, "learning_rate": 0.00047471418224796704, "loss": 6.2554, "mean_token_accuracy": 0.13879068642854692, "num_tokens": 32634039.0, "step": 15085 }, { "entropy": 6.536784744262695, "epoch": 1.6148001498207503, "grad_norm": 1.75, "learning_rate": 0.0004746965698728526, "loss": 6.2549, "mean_token_accuracy": 0.1380273535847664, "num_tokens": 32644644.0, "step": 15090 }, { "entropy": 6.567042064666748, "epoch": 1.6153352239285141, "grad_norm": 1.8046875, "learning_rate": 0.00047467895173152787, "loss": 6.3026, "mean_token_accuracy": 0.13522871881723403, "num_tokens": 32655961.0, "step": 15095 }, { "entropy": 6.488573694229126, "epoch": 1.615870298036278, "grad_norm": 1.53125, "learning_rate": 0.00047466132782450146, "loss": 6.1815, "mean_token_accuracy": 0.14545413851737976, "num_tokens": 32665506.0, "step": 15100 }, { "entropy": 6.465070581436157, "epoch": 1.616405372144042, "grad_norm": 1.4375, "learning_rate": 0.00047464369815228215, "loss": 6.2209, "mean_token_accuracy": 0.13768779933452607, "num_tokens": 32676278.0, "step": 15105 }, { "entropy": 6.525582218170166, "epoch": 1.6169404462518058, "grad_norm": 1.40625, "learning_rate": 0.0004746260627153792, "loss": 6.2163, "mean_token_accuracy": 0.13862458914518355, "num_tokens": 32686835.0, "step": 15110 }, { "entropy": 6.599107980728149, "epoch": 1.6174755203595699, "grad_norm": 1.7734375, "learning_rate": 0.00047460842151430166, "loss": 6.3484, "mean_token_accuracy": 0.1358664244413376, "num_tokens": 32696856.0, "step": 15115 }, { "entropy": 6.569884347915649, "epoch": 1.6180105944673338, "grad_norm": 1.796875, "learning_rate": 0.00047459077454955914, "loss": 6.2876, "mean_token_accuracy": 0.13096022456884385, "num_tokens": 32707514.0, "step": 15120 }, { "entropy": 6.548951768875122, "epoch": 1.6185456685750976, "grad_norm": 1.5390625, "learning_rate": 0.00047457312182166094, "loss": 6.3643, "mean_token_accuracy": 0.12981587499380112, "num_tokens": 32718934.0, "step": 15125 }, { "entropy": 6.544709396362305, "epoch": 1.6190807426828617, "grad_norm": 1.5, "learning_rate": 0.0004745554633311169, "loss": 6.2519, "mean_token_accuracy": 0.13406705260276794, "num_tokens": 32729249.0, "step": 15130 }, { "entropy": 6.551851797103882, "epoch": 1.6196158167906254, "grad_norm": 2.046875, "learning_rate": 0.00047453779907843686, "loss": 6.3175, "mean_token_accuracy": 0.12954918518662453, "num_tokens": 32739948.0, "step": 15135 }, { "entropy": 6.527648115158081, "epoch": 1.6201508908983895, "grad_norm": 1.5390625, "learning_rate": 0.00047452012906413105, "loss": 6.3137, "mean_token_accuracy": 0.13055140003561974, "num_tokens": 32751482.0, "step": 15140 }, { "entropy": 6.499547004699707, "epoch": 1.6206859650061534, "grad_norm": 1.40625, "learning_rate": 0.00047450245328870943, "loss": 6.1504, "mean_token_accuracy": 0.14658984839916228, "num_tokens": 32761260.0, "step": 15145 }, { "entropy": 6.502904844284058, "epoch": 1.6212210391139172, "grad_norm": 1.7109375, "learning_rate": 0.00047448477175268255, "loss": 6.2691, "mean_token_accuracy": 0.13591463193297387, "num_tokens": 32772684.0, "step": 15150 }, { "entropy": 6.370807075500489, "epoch": 1.6217561132216813, "grad_norm": 1.296875, "learning_rate": 0.00047446708445656095, "loss": 6.0788, "mean_token_accuracy": 0.15149276256561278, "num_tokens": 32784022.0, "step": 15155 }, { "entropy": 6.514007139205932, "epoch": 1.622291187329445, "grad_norm": 1.390625, "learning_rate": 0.0004744493914008552, "loss": 6.2129, "mean_token_accuracy": 0.13973695337772368, "num_tokens": 32794104.0, "step": 15160 }, { "entropy": 6.574914264678955, "epoch": 1.622826261437209, "grad_norm": 1.375, "learning_rate": 0.0004744316925860764, "loss": 6.1906, "mean_token_accuracy": 0.14187313616275787, "num_tokens": 32804038.0, "step": 15165 }, { "entropy": 6.470356845855713, "epoch": 1.623361335544973, "grad_norm": 1.6328125, "learning_rate": 0.0004744139880127355, "loss": 6.2865, "mean_token_accuracy": 0.13450952768325805, "num_tokens": 32815620.0, "step": 15170 }, { "entropy": 6.478771495819092, "epoch": 1.6238964096527368, "grad_norm": 1.453125, "learning_rate": 0.00047439627768134366, "loss": 6.1972, "mean_token_accuracy": 0.14077696353197097, "num_tokens": 32826353.0, "step": 15175 }, { "entropy": 6.505884885787964, "epoch": 1.624431483760501, "grad_norm": 1.578125, "learning_rate": 0.0004743785615924124, "loss": 6.3058, "mean_token_accuracy": 0.13557258620858192, "num_tokens": 32836582.0, "step": 15180 }, { "entropy": 6.511706876754761, "epoch": 1.6249665578682646, "grad_norm": 1.4296875, "learning_rate": 0.0004743608397464531, "loss": 6.2568, "mean_token_accuracy": 0.13595101088285447, "num_tokens": 32848073.0, "step": 15185 }, { "entropy": 6.5341103076934814, "epoch": 1.6255016319760287, "grad_norm": 1.375, "learning_rate": 0.00047434311214397765, "loss": 6.2956, "mean_token_accuracy": 0.1354230597615242, "num_tokens": 32857839.0, "step": 15190 }, { "entropy": 6.495816612243653, "epoch": 1.6260367060837926, "grad_norm": 1.8984375, "learning_rate": 0.00047432537878549786, "loss": 6.2163, "mean_token_accuracy": 0.1448695421218872, "num_tokens": 32868087.0, "step": 15195 }, { "entropy": 6.557143068313598, "epoch": 1.6265717801915565, "grad_norm": 1.3203125, "learning_rate": 0.00047430763967152564, "loss": 6.2898, "mean_token_accuracy": 0.13106158301234244, "num_tokens": 32880622.0, "step": 15200 }, { "entropy": 6.61873950958252, "epoch": 1.6271068542993206, "grad_norm": 1.53125, "learning_rate": 0.00047428989480257337, "loss": 6.2719, "mean_token_accuracy": 0.1311236575245857, "num_tokens": 32891405.0, "step": 15205 }, { "entropy": 6.528134870529175, "epoch": 1.6276419284070842, "grad_norm": 1.71875, "learning_rate": 0.0004742721441791535, "loss": 6.2148, "mean_token_accuracy": 0.1388081818819046, "num_tokens": 32900487.0, "step": 15210 }, { "entropy": 6.432776355743409, "epoch": 1.6281770025148483, "grad_norm": 1.4609375, "learning_rate": 0.0004742543878017784, "loss": 6.1764, "mean_token_accuracy": 0.14578463062644004, "num_tokens": 32912139.0, "step": 15215 }, { "entropy": 6.506275987625122, "epoch": 1.6287120766226122, "grad_norm": 1.4453125, "learning_rate": 0.00047423662567096085, "loss": 6.2642, "mean_token_accuracy": 0.1333197571337223, "num_tokens": 32922972.0, "step": 15220 }, { "entropy": 6.512710762023926, "epoch": 1.629247150730376, "grad_norm": 1.3984375, "learning_rate": 0.00047421885778721376, "loss": 6.206, "mean_token_accuracy": 0.14148302972316742, "num_tokens": 32932609.0, "step": 15225 }, { "entropy": 6.473397874832154, "epoch": 1.6297822248381402, "grad_norm": 1.3828125, "learning_rate": 0.00047420108415105006, "loss": 6.2051, "mean_token_accuracy": 0.1474070742726326, "num_tokens": 32942706.0, "step": 15230 }, { "entropy": 6.515003728866577, "epoch": 1.630317298945904, "grad_norm": 1.75, "learning_rate": 0.00047418330476298317, "loss": 6.2367, "mean_token_accuracy": 0.13718311563134195, "num_tokens": 32952240.0, "step": 15235 }, { "entropy": 6.555767250061035, "epoch": 1.630852373053668, "grad_norm": 2.890625, "learning_rate": 0.0004741655196235262, "loss": 6.2868, "mean_token_accuracy": 0.1296004444360733, "num_tokens": 32963249.0, "step": 15240 }, { "entropy": 6.544875812530518, "epoch": 1.6313874471614318, "grad_norm": 1.5625, "learning_rate": 0.00047414772873319294, "loss": 6.2732, "mean_token_accuracy": 0.14131317362189294, "num_tokens": 32974004.0, "step": 15245 }, { "entropy": 6.5474451065063475, "epoch": 1.6319225212691957, "grad_norm": 1.546875, "learning_rate": 0.000474129932092497, "loss": 6.2414, "mean_token_accuracy": 0.13400815799832344, "num_tokens": 32985236.0, "step": 15250 }, { "entropy": 6.577800703048706, "epoch": 1.6324575953769598, "grad_norm": 1.5, "learning_rate": 0.0004741121297019522, "loss": 6.3035, "mean_token_accuracy": 0.13068798258900644, "num_tokens": 32995155.0, "step": 15255 }, { "entropy": 6.53216872215271, "epoch": 1.6329926694847237, "grad_norm": 1.734375, "learning_rate": 0.00047409432156207264, "loss": 6.284, "mean_token_accuracy": 0.1431720234453678, "num_tokens": 33007562.0, "step": 15260 }, { "entropy": 6.5164182662963865, "epoch": 1.6335277435924875, "grad_norm": 1.5078125, "learning_rate": 0.00047407650767337256, "loss": 6.2507, "mean_token_accuracy": 0.132377927005291, "num_tokens": 33018653.0, "step": 15265 }, { "entropy": 6.605610656738281, "epoch": 1.6340628177002516, "grad_norm": 1.640625, "learning_rate": 0.0004740586880363663, "loss": 6.3493, "mean_token_accuracy": 0.12530876249074935, "num_tokens": 33029470.0, "step": 15270 }, { "entropy": 6.5277331352233885, "epoch": 1.6345978918080153, "grad_norm": 1.5546875, "learning_rate": 0.00047404086265156835, "loss": 6.2094, "mean_token_accuracy": 0.14064295142889022, "num_tokens": 33039597.0, "step": 15275 }, { "entropy": 6.5205522060394285, "epoch": 1.6351329659157794, "grad_norm": 1.5625, "learning_rate": 0.0004740230315194935, "loss": 6.2391, "mean_token_accuracy": 0.1316556826233864, "num_tokens": 33050984.0, "step": 15280 }, { "entropy": 6.524631404876709, "epoch": 1.6356680400235433, "grad_norm": 1.5078125, "learning_rate": 0.00047400519464065656, "loss": 6.3191, "mean_token_accuracy": 0.1310469351708889, "num_tokens": 33062250.0, "step": 15285 }, { "entropy": 6.543263912200928, "epoch": 1.6362031141313071, "grad_norm": 1.5078125, "learning_rate": 0.0004739873520155726, "loss": 6.3471, "mean_token_accuracy": 0.1317575253546238, "num_tokens": 33072129.0, "step": 15290 }, { "entropy": 6.553985691070556, "epoch": 1.6367381882390712, "grad_norm": 1.3984375, "learning_rate": 0.0004739695036447568, "loss": 6.1859, "mean_token_accuracy": 0.1361164018511772, "num_tokens": 33082475.0, "step": 15295 }, { "entropy": 6.4877923965454105, "epoch": 1.637273262346835, "grad_norm": 1.515625, "learning_rate": 0.00047395164952872455, "loss": 6.2363, "mean_token_accuracy": 0.14455458000302315, "num_tokens": 33093791.0, "step": 15300 }, { "entropy": 6.51265869140625, "epoch": 1.637808336454599, "grad_norm": 1.234375, "learning_rate": 0.0004739337896679914, "loss": 6.2184, "mean_token_accuracy": 0.14008307158946992, "num_tokens": 33104231.0, "step": 15305 }, { "entropy": 6.52463812828064, "epoch": 1.6383434105623629, "grad_norm": 1.625, "learning_rate": 0.00047391592406307296, "loss": 6.2248, "mean_token_accuracy": 0.13311854079365731, "num_tokens": 33115118.0, "step": 15310 }, { "entropy": 6.545754528045654, "epoch": 1.6388784846701268, "grad_norm": 1.625, "learning_rate": 0.0004738980527144852, "loss": 6.2086, "mean_token_accuracy": 0.143442365527153, "num_tokens": 33126154.0, "step": 15315 }, { "entropy": 6.524981355667114, "epoch": 1.6394135587778909, "grad_norm": 1.5625, "learning_rate": 0.0004738801756227441, "loss": 6.2837, "mean_token_accuracy": 0.1365656517446041, "num_tokens": 33137342.0, "step": 15320 }, { "entropy": 6.469981956481933, "epoch": 1.6399486328856545, "grad_norm": 1.46875, "learning_rate": 0.00047386229278836595, "loss": 6.2488, "mean_token_accuracy": 0.14113932177424432, "num_tokens": 33147661.0, "step": 15325 }, { "entropy": 6.564016675949096, "epoch": 1.6404837069934186, "grad_norm": 2.0625, "learning_rate": 0.00047384440421186695, "loss": 6.2958, "mean_token_accuracy": 0.13328296020627023, "num_tokens": 33157106.0, "step": 15330 }, { "entropy": 6.559274578094483, "epoch": 1.6410187811011825, "grad_norm": 1.3515625, "learning_rate": 0.0004738265098937638, "loss": 6.299, "mean_token_accuracy": 0.13367382884025575, "num_tokens": 33169451.0, "step": 15335 }, { "entropy": 6.596626472473145, "epoch": 1.6415538552089464, "grad_norm": 1.3671875, "learning_rate": 0.000473808609834573, "loss": 6.2857, "mean_token_accuracy": 0.1338217854499817, "num_tokens": 33180799.0, "step": 15340 }, { "entropy": 6.581587791442871, "epoch": 1.6420889293167105, "grad_norm": 1.46875, "learning_rate": 0.00047379070403481165, "loss": 6.3633, "mean_token_accuracy": 0.12887900546193123, "num_tokens": 33191948.0, "step": 15345 }, { "entropy": 6.529717302322387, "epoch": 1.6426240034244743, "grad_norm": 1.34375, "learning_rate": 0.00047377279249499656, "loss": 6.2631, "mean_token_accuracy": 0.1293257676064968, "num_tokens": 33203536.0, "step": 15350 }, { "entropy": 6.542965984344482, "epoch": 1.6431590775322382, "grad_norm": 1.2734375, "learning_rate": 0.0004737548752156451, "loss": 6.2603, "mean_token_accuracy": 0.13613931387662886, "num_tokens": 33214526.0, "step": 15355 }, { "entropy": 6.493067502975464, "epoch": 1.643694151640002, "grad_norm": 2.96875, "learning_rate": 0.0004737369521972745, "loss": 6.2245, "mean_token_accuracy": 0.13954372256994246, "num_tokens": 33226560.0, "step": 15360 }, { "entropy": 6.482340002059937, "epoch": 1.644229225747766, "grad_norm": 1.5234375, "learning_rate": 0.00047371902344040234, "loss": 6.2566, "mean_token_accuracy": 0.13352166935801507, "num_tokens": 33237441.0, "step": 15365 }, { "entropy": 6.506029081344605, "epoch": 1.64476429985553, "grad_norm": 1.4609375, "learning_rate": 0.00047370108894554633, "loss": 6.2135, "mean_token_accuracy": 0.13105529099702834, "num_tokens": 33248229.0, "step": 15370 }, { "entropy": 6.478899192810059, "epoch": 1.645299373963294, "grad_norm": 1.9765625, "learning_rate": 0.0004736831487132243, "loss": 6.1587, "mean_token_accuracy": 0.1475966066122055, "num_tokens": 33258992.0, "step": 15375 }, { "entropy": 6.500133895874024, "epoch": 1.6458344480710578, "grad_norm": 1.421875, "learning_rate": 0.0004736652027439542, "loss": 6.1869, "mean_token_accuracy": 0.13673374876379968, "num_tokens": 33269583.0, "step": 15380 }, { "entropy": 6.548278188705444, "epoch": 1.646369522178822, "grad_norm": 1.5390625, "learning_rate": 0.00047364725103825437, "loss": 6.3114, "mean_token_accuracy": 0.13247542828321457, "num_tokens": 33280236.0, "step": 15385 }, { "entropy": 6.523178243637085, "epoch": 1.6469045962865856, "grad_norm": 1.234375, "learning_rate": 0.000473629293596643, "loss": 6.2145, "mean_token_accuracy": 0.1371418498456478, "num_tokens": 33291327.0, "step": 15390 }, { "entropy": 6.583948993682862, "epoch": 1.6474396703943497, "grad_norm": 1.3125, "learning_rate": 0.00047361133041963873, "loss": 6.3138, "mean_token_accuracy": 0.13246541023254393, "num_tokens": 33302125.0, "step": 15395 }, { "entropy": 6.507024955749512, "epoch": 1.6479747445021136, "grad_norm": 1.703125, "learning_rate": 0.0004735933615077602, "loss": 6.2456, "mean_token_accuracy": 0.13589197397232056, "num_tokens": 33312576.0, "step": 15400 }, { "entropy": 6.500837564468384, "epoch": 1.6485098186098774, "grad_norm": 1.4453125, "learning_rate": 0.00047357538686152627, "loss": 6.2317, "mean_token_accuracy": 0.1352829158306122, "num_tokens": 33322821.0, "step": 15405 }, { "entropy": 6.553674840927124, "epoch": 1.6490448927176415, "grad_norm": 1.5390625, "learning_rate": 0.00047355740648145596, "loss": 6.2807, "mean_token_accuracy": 0.13334212675690651, "num_tokens": 33333951.0, "step": 15410 }, { "entropy": 6.602206516265869, "epoch": 1.6495799668254052, "grad_norm": 1.421875, "learning_rate": 0.0004735394203680684, "loss": 6.2326, "mean_token_accuracy": 0.13933424800634384, "num_tokens": 33344739.0, "step": 15415 }, { "entropy": 6.525042295455933, "epoch": 1.6501150409331693, "grad_norm": 1.5078125, "learning_rate": 0.00047352142852188304, "loss": 6.1946, "mean_token_accuracy": 0.14079620391130448, "num_tokens": 33354956.0, "step": 15420 }, { "entropy": 6.363925170898438, "epoch": 1.6506501150409332, "grad_norm": 1.4765625, "learning_rate": 0.0004735034309434193, "loss": 6.1806, "mean_token_accuracy": 0.14333223477005957, "num_tokens": 33364809.0, "step": 15425 }, { "entropy": 6.555759572982788, "epoch": 1.651185189148697, "grad_norm": 1.359375, "learning_rate": 0.0004734854276331968, "loss": 6.2706, "mean_token_accuracy": 0.14230604097247124, "num_tokens": 33375324.0, "step": 15430 }, { "entropy": 6.5867352962493895, "epoch": 1.6517202632564612, "grad_norm": 1.390625, "learning_rate": 0.00047346741859173564, "loss": 6.342, "mean_token_accuracy": 0.132570631057024, "num_tokens": 33385963.0, "step": 15435 }, { "entropy": 6.571739339828492, "epoch": 1.6522553373642248, "grad_norm": 1.3203125, "learning_rate": 0.0004734494038195555, "loss": 6.3377, "mean_token_accuracy": 0.13507345393300058, "num_tokens": 33395927.0, "step": 15440 }, { "entropy": 6.549274349212647, "epoch": 1.652790411471989, "grad_norm": 1.7890625, "learning_rate": 0.0004734313833171768, "loss": 6.2415, "mean_token_accuracy": 0.13801701590418816, "num_tokens": 33406294.0, "step": 15445 }, { "entropy": 6.4921557903289795, "epoch": 1.6533254855797528, "grad_norm": 1.5234375, "learning_rate": 0.0004734133570851198, "loss": 6.1939, "mean_token_accuracy": 0.14175853729248047, "num_tokens": 33416995.0, "step": 15450 }, { "entropy": 6.4246721267700195, "epoch": 1.6538605596875167, "grad_norm": 1.40625, "learning_rate": 0.0004733953251239049, "loss": 6.1603, "mean_token_accuracy": 0.13845812678337097, "num_tokens": 33428087.0, "step": 15455 }, { "entropy": 6.5247784614562985, "epoch": 1.6543956337952808, "grad_norm": 1.4609375, "learning_rate": 0.0004733772874340529, "loss": 6.3487, "mean_token_accuracy": 0.1310659483075142, "num_tokens": 33439151.0, "step": 15460 }, { "entropy": 6.54686393737793, "epoch": 1.6549307079030444, "grad_norm": 1.625, "learning_rate": 0.0004733592440160846, "loss": 6.2464, "mean_token_accuracy": 0.1391957312822342, "num_tokens": 33449257.0, "step": 15465 }, { "entropy": 6.527724838256836, "epoch": 1.6554657820108085, "grad_norm": 1.640625, "learning_rate": 0.00047334119487052104, "loss": 6.2044, "mean_token_accuracy": 0.13526543900370597, "num_tokens": 33460472.0, "step": 15470 }, { "entropy": 6.489955234527588, "epoch": 1.6560008561185724, "grad_norm": 1.3359375, "learning_rate": 0.00047332313999788334, "loss": 6.2157, "mean_token_accuracy": 0.13044157400727271, "num_tokens": 33470193.0, "step": 15475 }, { "entropy": 6.404095649719238, "epoch": 1.6565359302263363, "grad_norm": 1.3984375, "learning_rate": 0.00047330507939869284, "loss": 6.1541, "mean_token_accuracy": 0.13785995692014694, "num_tokens": 33481098.0, "step": 15480 }, { "entropy": 6.56090350151062, "epoch": 1.6570710043341004, "grad_norm": 2.109375, "learning_rate": 0.000473287013073471, "loss": 6.2291, "mean_token_accuracy": 0.13516671136021613, "num_tokens": 33492514.0, "step": 15485 }, { "entropy": 6.55650486946106, "epoch": 1.6576060784418643, "grad_norm": 1.3359375, "learning_rate": 0.0004732689410227396, "loss": 6.2223, "mean_token_accuracy": 0.13520386070013046, "num_tokens": 33504254.0, "step": 15490 }, { "entropy": 6.490405035018921, "epoch": 1.6581411525496281, "grad_norm": 2.78125, "learning_rate": 0.0004732508632470203, "loss": 6.2386, "mean_token_accuracy": 0.13007647171616554, "num_tokens": 33515101.0, "step": 15495 }, { "entropy": 6.487555599212646, "epoch": 1.658676226657392, "grad_norm": 2.3125, "learning_rate": 0.0004732327797468352, "loss": 6.2507, "mean_token_accuracy": 0.137110199034214, "num_tokens": 33525052.0, "step": 15500 }, { "entropy": 6.578079605102539, "epoch": 1.6592113007651559, "grad_norm": 1.4140625, "learning_rate": 0.0004732146905227065, "loss": 6.384, "mean_token_accuracy": 0.12686768770217896, "num_tokens": 33536841.0, "step": 15505 }, { "entropy": 6.614656734466553, "epoch": 1.65974637487292, "grad_norm": 1.3671875, "learning_rate": 0.0004731965955751564, "loss": 6.2692, "mean_token_accuracy": 0.13630660995841026, "num_tokens": 33547292.0, "step": 15510 }, { "entropy": 6.525318765640259, "epoch": 1.6602814489806839, "grad_norm": 1.2734375, "learning_rate": 0.0004731784949047075, "loss": 6.2056, "mean_token_accuracy": 0.13373274132609367, "num_tokens": 33557674.0, "step": 15515 }, { "entropy": 6.527735948562622, "epoch": 1.6608165230884477, "grad_norm": 1.453125, "learning_rate": 0.0004731603885118824, "loss": 6.2942, "mean_token_accuracy": 0.1279158003628254, "num_tokens": 33568396.0, "step": 15520 }, { "entropy": 6.577741956710815, "epoch": 1.6613515971962118, "grad_norm": 1.3359375, "learning_rate": 0.0004731422763972039, "loss": 6.3323, "mean_token_accuracy": 0.1327934257686138, "num_tokens": 33579688.0, "step": 15525 }, { "entropy": 6.578317785263062, "epoch": 1.6618866713039755, "grad_norm": 1.6875, "learning_rate": 0.00047312415856119505, "loss": 6.354, "mean_token_accuracy": 0.131970302015543, "num_tokens": 33591550.0, "step": 15530 }, { "entropy": 6.561192989349365, "epoch": 1.6624217454117396, "grad_norm": 1.65625, "learning_rate": 0.00047310603500437895, "loss": 6.274, "mean_token_accuracy": 0.1381398282945156, "num_tokens": 33600792.0, "step": 15535 }, { "entropy": 6.4599748134613035, "epoch": 1.6629568195195035, "grad_norm": 1.296875, "learning_rate": 0.00047308790572727895, "loss": 6.2253, "mean_token_accuracy": 0.13727160319685935, "num_tokens": 33611873.0, "step": 15540 }, { "entropy": 6.529527378082276, "epoch": 1.6634918936272673, "grad_norm": 1.2421875, "learning_rate": 0.0004730697707304184, "loss": 6.2658, "mean_token_accuracy": 0.13597349151968957, "num_tokens": 33622960.0, "step": 15545 }, { "entropy": 6.592627620697021, "epoch": 1.6640269677350314, "grad_norm": 1.5859375, "learning_rate": 0.0004730516300143211, "loss": 6.3493, "mean_token_accuracy": 0.13005867078900338, "num_tokens": 33635391.0, "step": 15550 }, { "entropy": 6.593164157867432, "epoch": 1.664562041842795, "grad_norm": 1.6171875, "learning_rate": 0.0004730334835795109, "loss": 6.2714, "mean_token_accuracy": 0.13071415051817895, "num_tokens": 33647942.0, "step": 15555 }, { "entropy": 6.55129189491272, "epoch": 1.6650971159505592, "grad_norm": 2.09375, "learning_rate": 0.0004730153314265116, "loss": 6.233, "mean_token_accuracy": 0.13420569971203805, "num_tokens": 33658425.0, "step": 15560 }, { "entropy": 6.494670486450195, "epoch": 1.665632190058323, "grad_norm": 1.375, "learning_rate": 0.0004729971735558475, "loss": 6.2166, "mean_token_accuracy": 0.1414251834154129, "num_tokens": 33669645.0, "step": 15565 }, { "entropy": 6.555915451049804, "epoch": 1.666167264166087, "grad_norm": 1.3984375, "learning_rate": 0.0004729790099680428, "loss": 6.2997, "mean_token_accuracy": 0.1325235716998577, "num_tokens": 33680415.0, "step": 15570 }, { "entropy": 6.485175704956054, "epoch": 1.666702338273851, "grad_norm": 1.28125, "learning_rate": 0.000472960840663622, "loss": 6.3214, "mean_token_accuracy": 0.13352945372462272, "num_tokens": 33691425.0, "step": 15575 }, { "entropy": 6.568507814407349, "epoch": 1.6672374123816147, "grad_norm": 1.6328125, "learning_rate": 0.0004729426656431097, "loss": 6.2727, "mean_token_accuracy": 0.1349485158920288, "num_tokens": 33703845.0, "step": 15580 }, { "entropy": 6.600763368606567, "epoch": 1.6677724864893788, "grad_norm": 1.8125, "learning_rate": 0.0004729244849070308, "loss": 6.2306, "mean_token_accuracy": 0.1353510484099388, "num_tokens": 33714737.0, "step": 15585 }, { "entropy": 6.468076753616333, "epoch": 1.6683075605971427, "grad_norm": 1.296875, "learning_rate": 0.00047290629845591026, "loss": 6.1949, "mean_token_accuracy": 0.1312122106552124, "num_tokens": 33725042.0, "step": 15590 }, { "entropy": 6.511102628707886, "epoch": 1.6688426347049066, "grad_norm": 1.796875, "learning_rate": 0.000472888106290273, "loss": 6.2562, "mean_token_accuracy": 0.13453252837061883, "num_tokens": 33736306.0, "step": 15595 }, { "entropy": 6.615510892868042, "epoch": 1.6693777088126707, "grad_norm": 1.6796875, "learning_rate": 0.00047286990841064467, "loss": 6.313, "mean_token_accuracy": 0.12460464984178543, "num_tokens": 33747327.0, "step": 15600 }, { "entropy": 6.528128290176392, "epoch": 1.6699127829204343, "grad_norm": 1.921875, "learning_rate": 0.0004728517048175504, "loss": 6.2383, "mean_token_accuracy": 0.1368679001927376, "num_tokens": 33757723.0, "step": 15605 }, { "entropy": 6.407970523834228, "epoch": 1.6704478570281984, "grad_norm": 1.625, "learning_rate": 0.000472833495511516, "loss": 6.2012, "mean_token_accuracy": 0.13751262351870536, "num_tokens": 33769958.0, "step": 15610 }, { "entropy": 6.484128856658936, "epoch": 1.6709829311359623, "grad_norm": 1.484375, "learning_rate": 0.00047281528049306727, "loss": 6.2399, "mean_token_accuracy": 0.1377895474433899, "num_tokens": 33780107.0, "step": 15615 }, { "entropy": 6.513759183883667, "epoch": 1.6715180052437262, "grad_norm": 1.65625, "learning_rate": 0.0004727970597627301, "loss": 6.2594, "mean_token_accuracy": 0.1330281265079975, "num_tokens": 33791023.0, "step": 15620 }, { "entropy": 6.469873380661011, "epoch": 1.6720530793514903, "grad_norm": 1.6796875, "learning_rate": 0.0004727788333210305, "loss": 6.2527, "mean_token_accuracy": 0.1425516687333584, "num_tokens": 33801195.0, "step": 15625 }, { "entropy": 6.515677213668823, "epoch": 1.6725881534592542, "grad_norm": 1.6171875, "learning_rate": 0.000472760601168495, "loss": 6.227, "mean_token_accuracy": 0.14181752800941466, "num_tokens": 33812957.0, "step": 15630 }, { "entropy": 6.5297685146331785, "epoch": 1.673123227567018, "grad_norm": 1.84375, "learning_rate": 0.00047274236330564995, "loss": 6.2826, "mean_token_accuracy": 0.13435860499739646, "num_tokens": 33823874.0, "step": 15635 }, { "entropy": 6.525163459777832, "epoch": 1.673658301674782, "grad_norm": 1.5078125, "learning_rate": 0.0004727241197330219, "loss": 6.2398, "mean_token_accuracy": 0.13939717635512353, "num_tokens": 33834284.0, "step": 15640 }, { "entropy": 6.56245265007019, "epoch": 1.6741933757825458, "grad_norm": 1.609375, "learning_rate": 0.0004727058704511376, "loss": 6.2872, "mean_token_accuracy": 0.13500021770596504, "num_tokens": 33845544.0, "step": 15645 }, { "entropy": 6.579645442962646, "epoch": 1.67472844989031, "grad_norm": 1.4921875, "learning_rate": 0.0004726876154605242, "loss": 6.2602, "mean_token_accuracy": 0.1337307557463646, "num_tokens": 33855420.0, "step": 15650 }, { "entropy": 6.535953426361084, "epoch": 1.6752635239980738, "grad_norm": 1.765625, "learning_rate": 0.0004726693547617086, "loss": 6.1453, "mean_token_accuracy": 0.14049242064356804, "num_tokens": 33864904.0, "step": 15655 }, { "entropy": 6.4508716583251955, "epoch": 1.6757985981058376, "grad_norm": 1.484375, "learning_rate": 0.00047265108835521825, "loss": 6.2107, "mean_token_accuracy": 0.13712649717926978, "num_tokens": 33875139.0, "step": 15660 }, { "entropy": 6.452628326416016, "epoch": 1.6763336722136017, "grad_norm": 1.453125, "learning_rate": 0.0004726328162415804, "loss": 6.2418, "mean_token_accuracy": 0.14112431481480597, "num_tokens": 33886401.0, "step": 15665 }, { "entropy": 6.5320008277893065, "epoch": 1.6768687463213654, "grad_norm": 1.609375, "learning_rate": 0.00047261453842132277, "loss": 6.2702, "mean_token_accuracy": 0.1391934409737587, "num_tokens": 33896382.0, "step": 15670 }, { "entropy": 6.561520433425903, "epoch": 1.6774038204291295, "grad_norm": 1.53125, "learning_rate": 0.00047259625489497317, "loss": 6.2252, "mean_token_accuracy": 0.13969543278217317, "num_tokens": 33906403.0, "step": 15675 }, { "entropy": 6.435149383544922, "epoch": 1.6779388945368934, "grad_norm": 1.4765625, "learning_rate": 0.00047257796566305946, "loss": 6.1337, "mean_token_accuracy": 0.13980668783187866, "num_tokens": 33916992.0, "step": 15680 }, { "entropy": 6.529124116897583, "epoch": 1.6784739686446573, "grad_norm": 1.3046875, "learning_rate": 0.0004725596707261097, "loss": 6.2586, "mean_token_accuracy": 0.13304452002048492, "num_tokens": 33927599.0, "step": 15685 }, { "entropy": 6.55642671585083, "epoch": 1.6790090427524214, "grad_norm": 1.6875, "learning_rate": 0.0004725413700846522, "loss": 6.3501, "mean_token_accuracy": 0.1294899970293045, "num_tokens": 33938957.0, "step": 15690 }, { "entropy": 6.5513214588165285, "epoch": 1.679544116860185, "grad_norm": 1.640625, "learning_rate": 0.00047252306373921543, "loss": 6.2424, "mean_token_accuracy": 0.13886384218931197, "num_tokens": 33950169.0, "step": 15695 }, { "entropy": 6.535861158370972, "epoch": 1.680079190967949, "grad_norm": 2.015625, "learning_rate": 0.00047250475169032804, "loss": 6.2468, "mean_token_accuracy": 0.13359253630042076, "num_tokens": 33960800.0, "step": 15700 }, { "entropy": 6.4771155834198, "epoch": 1.680614265075713, "grad_norm": 1.2890625, "learning_rate": 0.0004724864339385185, "loss": 6.3202, "mean_token_accuracy": 0.1288799077272415, "num_tokens": 33973060.0, "step": 15705 }, { "entropy": 6.5491858959198, "epoch": 1.6811493391834769, "grad_norm": 1.3515625, "learning_rate": 0.0004724681104843161, "loss": 6.336, "mean_token_accuracy": 0.13036111146211624, "num_tokens": 33983185.0, "step": 15710 }, { "entropy": 6.601888990402221, "epoch": 1.681684413291241, "grad_norm": 1.4765625, "learning_rate": 0.0004724497813282497, "loss": 6.2704, "mean_token_accuracy": 0.13604292944073676, "num_tokens": 33993373.0, "step": 15715 }, { "entropy": 6.476183605194092, "epoch": 1.6822194873990046, "grad_norm": 1.453125, "learning_rate": 0.0004724314464708486, "loss": 6.1732, "mean_token_accuracy": 0.1464055560529232, "num_tokens": 34005793.0, "step": 15720 }, { "entropy": 6.529676342010498, "epoch": 1.6827545615067687, "grad_norm": 1.4375, "learning_rate": 0.0004724131059126423, "loss": 6.3317, "mean_token_accuracy": 0.1304813355207443, "num_tokens": 34016415.0, "step": 15725 }, { "entropy": 6.5095258235931395, "epoch": 1.6832896356145326, "grad_norm": 1.8125, "learning_rate": 0.00047239475965416016, "loss": 6.1945, "mean_token_accuracy": 0.13945785760879517, "num_tokens": 34026859.0, "step": 15730 }, { "entropy": 6.513905572891235, "epoch": 1.6838247097222965, "grad_norm": 2.53125, "learning_rate": 0.00047237640769593224, "loss": 6.1091, "mean_token_accuracy": 0.15040467530488968, "num_tokens": 34037942.0, "step": 15735 }, { "entropy": 6.506213903427124, "epoch": 1.6843597838300606, "grad_norm": 1.421875, "learning_rate": 0.0004723580500384882, "loss": 6.2223, "mean_token_accuracy": 0.13819267526268958, "num_tokens": 34048659.0, "step": 15740 }, { "entropy": 6.464280605316162, "epoch": 1.6848948579378242, "grad_norm": 2.046875, "learning_rate": 0.00047233968668235817, "loss": 6.1974, "mean_token_accuracy": 0.1391046404838562, "num_tokens": 34059961.0, "step": 15745 }, { "entropy": 6.515230655670166, "epoch": 1.6854299320455883, "grad_norm": 1.7578125, "learning_rate": 0.00047232131762807244, "loss": 6.2493, "mean_token_accuracy": 0.1414615035057068, "num_tokens": 34069978.0, "step": 15750 }, { "entropy": 6.545376348495483, "epoch": 1.6859650061533522, "grad_norm": 1.71875, "learning_rate": 0.0004723029428761614, "loss": 6.2716, "mean_token_accuracy": 0.1336756817996502, "num_tokens": 34080301.0, "step": 15755 }, { "entropy": 6.458175468444824, "epoch": 1.686500080261116, "grad_norm": 2.96875, "learning_rate": 0.00047228456242715564, "loss": 6.2515, "mean_token_accuracy": 0.1380471520125866, "num_tokens": 34092376.0, "step": 15760 }, { "entropy": 6.509817409515381, "epoch": 1.6870351543688802, "grad_norm": 1.5859375, "learning_rate": 0.0004722661762815858, "loss": 6.209, "mean_token_accuracy": 0.14321028292179108, "num_tokens": 34102761.0, "step": 15765 }, { "entropy": 6.539234590530396, "epoch": 1.687570228476644, "grad_norm": 2.203125, "learning_rate": 0.0004722477844399829, "loss": 6.2238, "mean_token_accuracy": 0.1323903277516365, "num_tokens": 34113370.0, "step": 15770 }, { "entropy": 6.537856483459473, "epoch": 1.688105302584408, "grad_norm": 1.5, "learning_rate": 0.0004722293869028779, "loss": 6.2491, "mean_token_accuracy": 0.14107812196016312, "num_tokens": 34125038.0, "step": 15775 }, { "entropy": 6.542143440246582, "epoch": 1.6886403766921718, "grad_norm": 1.625, "learning_rate": 0.0004722109836708021, "loss": 6.2806, "mean_token_accuracy": 0.1316600888967514, "num_tokens": 34135595.0, "step": 15780 }, { "entropy": 6.539742279052734, "epoch": 1.6891754507999357, "grad_norm": 1.9453125, "learning_rate": 0.00047219257474428685, "loss": 6.2637, "mean_token_accuracy": 0.1312544487416744, "num_tokens": 34146755.0, "step": 15785 }, { "entropy": 6.484871435165405, "epoch": 1.6897105249076998, "grad_norm": 1.28125, "learning_rate": 0.00047217416012386367, "loss": 6.1226, "mean_token_accuracy": 0.14985355362296104, "num_tokens": 34158465.0, "step": 15790 }, { "entropy": 6.510846424102783, "epoch": 1.6902455990154637, "grad_norm": 1.359375, "learning_rate": 0.0004721557398100644, "loss": 6.2226, "mean_token_accuracy": 0.13456518054008484, "num_tokens": 34170007.0, "step": 15795 }, { "entropy": 6.538952875137329, "epoch": 1.6907806731232276, "grad_norm": 1.578125, "learning_rate": 0.00047213731380342077, "loss": 6.304, "mean_token_accuracy": 0.1294082783162594, "num_tokens": 34181595.0, "step": 15800 }, { "entropy": 6.546925115585327, "epoch": 1.6913157472309917, "grad_norm": 1.453125, "learning_rate": 0.000472118882104465, "loss": 6.2689, "mean_token_accuracy": 0.13665975481271744, "num_tokens": 34191791.0, "step": 15805 }, { "entropy": 6.549110746383667, "epoch": 1.6918508213387553, "grad_norm": 1.6171875, "learning_rate": 0.00047210044471372915, "loss": 6.1673, "mean_token_accuracy": 0.13872140422463416, "num_tokens": 34202636.0, "step": 15810 }, { "entropy": 6.570005178451538, "epoch": 1.6923858954465194, "grad_norm": 1.546875, "learning_rate": 0.0004720820016317456, "loss": 6.3077, "mean_token_accuracy": 0.13125923350453378, "num_tokens": 34213333.0, "step": 15815 }, { "entropy": 6.547509574890137, "epoch": 1.6929209695542833, "grad_norm": 1.3671875, "learning_rate": 0.000472063552859047, "loss": 6.2655, "mean_token_accuracy": 0.1336832843720913, "num_tokens": 34223679.0, "step": 15820 }, { "entropy": 6.515771150588989, "epoch": 1.6934560436620472, "grad_norm": 1.4921875, "learning_rate": 0.00047204509839616604, "loss": 6.3751, "mean_token_accuracy": 0.12890572771430014, "num_tokens": 34234528.0, "step": 15825 }, { "entropy": 6.502412509918213, "epoch": 1.6939911177698113, "grad_norm": 1.2109375, "learning_rate": 0.0004720266382436355, "loss": 6.1929, "mean_token_accuracy": 0.13582652881741525, "num_tokens": 34246203.0, "step": 15830 }, { "entropy": 6.513867616653442, "epoch": 1.694526191877575, "grad_norm": 2.234375, "learning_rate": 0.00047200817240198846, "loss": 6.1978, "mean_token_accuracy": 0.13635388165712356, "num_tokens": 34257231.0, "step": 15835 }, { "entropy": 6.518395709991455, "epoch": 1.695061265985339, "grad_norm": 1.625, "learning_rate": 0.00047198970087175817, "loss": 6.2256, "mean_token_accuracy": 0.13498940616846083, "num_tokens": 34268900.0, "step": 15840 }, { "entropy": 6.494491291046143, "epoch": 1.695596340093103, "grad_norm": 1.4140625, "learning_rate": 0.0004719712236534779, "loss": 6.2955, "mean_token_accuracy": 0.12909621819853784, "num_tokens": 34279343.0, "step": 15845 }, { "entropy": 6.494324111938477, "epoch": 1.6961314142008668, "grad_norm": 1.4453125, "learning_rate": 0.0004719527407476812, "loss": 6.2459, "mean_token_accuracy": 0.1420057773590088, "num_tokens": 34291952.0, "step": 15850 }, { "entropy": 6.555724811553955, "epoch": 1.6966664883086309, "grad_norm": 1.5, "learning_rate": 0.00047193425215490186, "loss": 6.266, "mean_token_accuracy": 0.1280573323369026, "num_tokens": 34302516.0, "step": 15855 }, { "entropy": 6.5335493087768555, "epoch": 1.6972015624163945, "grad_norm": 1.625, "learning_rate": 0.00047191575787567373, "loss": 6.1908, "mean_token_accuracy": 0.1397932641208172, "num_tokens": 34313094.0, "step": 15860 }, { "entropy": 6.547899580001831, "epoch": 1.6977366365241586, "grad_norm": 1.3125, "learning_rate": 0.0004718972579105306, "loss": 6.3164, "mean_token_accuracy": 0.13232587426900863, "num_tokens": 34324803.0, "step": 15865 }, { "entropy": 6.49736008644104, "epoch": 1.6982717106319225, "grad_norm": 1.40625, "learning_rate": 0.0004718787522600069, "loss": 6.279, "mean_token_accuracy": 0.12415364533662795, "num_tokens": 34336386.0, "step": 15870 }, { "entropy": 6.550452852249146, "epoch": 1.6988067847396864, "grad_norm": 1.40625, "learning_rate": 0.0004718602409246369, "loss": 6.2936, "mean_token_accuracy": 0.12681039273738862, "num_tokens": 34347085.0, "step": 15875 }, { "entropy": 6.48975772857666, "epoch": 1.6993418588474505, "grad_norm": 1.5625, "learning_rate": 0.00047184172390495505, "loss": 6.2184, "mean_token_accuracy": 0.1400773286819458, "num_tokens": 34358146.0, "step": 15880 }, { "entropy": 6.538142299652099, "epoch": 1.6998769329552141, "grad_norm": 1.5859375, "learning_rate": 0.0004718232012014961, "loss": 6.2662, "mean_token_accuracy": 0.1347523719072342, "num_tokens": 34370403.0, "step": 15885 }, { "entropy": 6.582979202270508, "epoch": 1.7004120070629782, "grad_norm": 1.9765625, "learning_rate": 0.00047180467281479496, "loss": 6.2494, "mean_token_accuracy": 0.1374131441116333, "num_tokens": 34381130.0, "step": 15890 }, { "entropy": 6.479326438903809, "epoch": 1.7009470811707421, "grad_norm": 1.4609375, "learning_rate": 0.0004717861387453865, "loss": 6.2961, "mean_token_accuracy": 0.13613806441426277, "num_tokens": 34391610.0, "step": 15895 }, { "entropy": 6.517370939254761, "epoch": 1.701482155278506, "grad_norm": 1.3671875, "learning_rate": 0.0004717675989938059, "loss": 6.2606, "mean_token_accuracy": 0.13521123230457305, "num_tokens": 34402262.0, "step": 15900 }, { "entropy": 6.533929634094238, "epoch": 1.70201722938627, "grad_norm": 1.4453125, "learning_rate": 0.00047174905356058857, "loss": 6.2611, "mean_token_accuracy": 0.13481214940547942, "num_tokens": 34412707.0, "step": 15905 }, { "entropy": 6.501676940917969, "epoch": 1.702552303494034, "grad_norm": 2.109375, "learning_rate": 0.00047173050244626993, "loss": 6.1814, "mean_token_accuracy": 0.14371191561222077, "num_tokens": 34423203.0, "step": 15910 }, { "entropy": 6.498485040664673, "epoch": 1.7030873776017978, "grad_norm": 1.40625, "learning_rate": 0.0004717119456513857, "loss": 6.278, "mean_token_accuracy": 0.13548828661441803, "num_tokens": 34433279.0, "step": 15915 }, { "entropy": 6.535174369812012, "epoch": 1.7036224517095617, "grad_norm": 1.875, "learning_rate": 0.00047169338317647164, "loss": 6.3336, "mean_token_accuracy": 0.13515316545963288, "num_tokens": 34444601.0, "step": 15920 }, { "entropy": 6.563399600982666, "epoch": 1.7041575258173256, "grad_norm": 1.6015625, "learning_rate": 0.00047167481502206383, "loss": 6.2541, "mean_token_accuracy": 0.13447251841425895, "num_tokens": 34455103.0, "step": 15925 }, { "entropy": 6.5051501274108885, "epoch": 1.7046925999250897, "grad_norm": 1.3671875, "learning_rate": 0.00047165624118869834, "loss": 6.2859, "mean_token_accuracy": 0.1337140329182148, "num_tokens": 34465835.0, "step": 15930 }, { "entropy": 6.628179454803467, "epoch": 1.7052276740328536, "grad_norm": 1.7578125, "learning_rate": 0.0004716376616769115, "loss": 6.319, "mean_token_accuracy": 0.13249458372592926, "num_tokens": 34476602.0, "step": 15935 }, { "entropy": 6.5752206325531, "epoch": 1.7057627481406175, "grad_norm": 1.3828125, "learning_rate": 0.0004716190764872399, "loss": 6.2112, "mean_token_accuracy": 0.13616498783230782, "num_tokens": 34488026.0, "step": 15940 }, { "entropy": 6.512110948562622, "epoch": 1.7062978222483816, "grad_norm": 1.40625, "learning_rate": 0.00047160048562022006, "loss": 6.2999, "mean_token_accuracy": 0.1379050388932228, "num_tokens": 34497837.0, "step": 15945 }, { "entropy": 6.486044931411743, "epoch": 1.7068328963561452, "grad_norm": 1.359375, "learning_rate": 0.0004715818890763888, "loss": 6.2503, "mean_token_accuracy": 0.13753306791186332, "num_tokens": 34507727.0, "step": 15950 }, { "entropy": 6.549686336517334, "epoch": 1.7073679704639093, "grad_norm": 1.6484375, "learning_rate": 0.00047156328685628307, "loss": 6.2464, "mean_token_accuracy": 0.1331082597374916, "num_tokens": 34518595.0, "step": 15955 }, { "entropy": 6.456800651550293, "epoch": 1.7079030445716732, "grad_norm": 2.28125, "learning_rate": 0.0004715446789604401, "loss": 6.1895, "mean_token_accuracy": 0.1428788721561432, "num_tokens": 34529415.0, "step": 15960 }, { "entropy": 6.492120552062988, "epoch": 1.708438118679437, "grad_norm": 1.6328125, "learning_rate": 0.0004715260653893972, "loss": 6.2195, "mean_token_accuracy": 0.14320783391594888, "num_tokens": 34539593.0, "step": 15965 }, { "entropy": 6.537639427185058, "epoch": 1.7089731927872012, "grad_norm": 2.34375, "learning_rate": 0.0004715074461436917, "loss": 6.239, "mean_token_accuracy": 0.13498525097966194, "num_tokens": 34549441.0, "step": 15970 }, { "entropy": 6.523940563201904, "epoch": 1.7095082668949648, "grad_norm": 1.5, "learning_rate": 0.00047148882122386126, "loss": 6.186, "mean_token_accuracy": 0.14013878330588342, "num_tokens": 34560211.0, "step": 15975 }, { "entropy": 6.5388068675994875, "epoch": 1.710043341002729, "grad_norm": 2.0, "learning_rate": 0.00047147019063044387, "loss": 6.2895, "mean_token_accuracy": 0.1317762777209282, "num_tokens": 34570479.0, "step": 15980 }, { "entropy": 6.541228723526001, "epoch": 1.7105784151104928, "grad_norm": 1.515625, "learning_rate": 0.00047145155436397726, "loss": 6.2735, "mean_token_accuracy": 0.13681796863675116, "num_tokens": 34581382.0, "step": 15985 }, { "entropy": 6.5268425941467285, "epoch": 1.7111134892182567, "grad_norm": 1.4453125, "learning_rate": 0.0004714329124249996, "loss": 6.206, "mean_token_accuracy": 0.14237518087029458, "num_tokens": 34592131.0, "step": 15990 }, { "entropy": 6.565146017074585, "epoch": 1.7116485633260208, "grad_norm": 2.109375, "learning_rate": 0.0004714142648140492, "loss": 6.3051, "mean_token_accuracy": 0.13531598448753357, "num_tokens": 34604407.0, "step": 15995 }, { "entropy": 6.500683689117432, "epoch": 1.7121836374337844, "grad_norm": 4.875, "learning_rate": 0.0004713956115316645, "loss": 6.1684, "mean_token_accuracy": 0.1376279339194298, "num_tokens": 34614842.0, "step": 16000 }, { "entropy": 6.39294056892395, "epoch": 1.7127187115415485, "grad_norm": 1.4453125, "learning_rate": 0.0004713769525783841, "loss": 6.1313, "mean_token_accuracy": 0.14383530020713806, "num_tokens": 34625991.0, "step": 16005 }, { "entropy": 6.4572838306427, "epoch": 1.7132537856493124, "grad_norm": 1.4453125, "learning_rate": 0.0004713582879547469, "loss": 6.2946, "mean_token_accuracy": 0.13821927458047867, "num_tokens": 34637317.0, "step": 16010 }, { "entropy": 6.557463788986206, "epoch": 1.7137888597570763, "grad_norm": 1.671875, "learning_rate": 0.0004713396176612916, "loss": 6.2749, "mean_token_accuracy": 0.13008446544408797, "num_tokens": 34648282.0, "step": 16015 }, { "entropy": 6.550800371170044, "epoch": 1.7143239338648404, "grad_norm": 1.46875, "learning_rate": 0.0004713209416985575, "loss": 6.2374, "mean_token_accuracy": 0.13565487340092658, "num_tokens": 34658638.0, "step": 16020 }, { "entropy": 6.4996785640716555, "epoch": 1.714859007972604, "grad_norm": 1.3828125, "learning_rate": 0.00047130226006708375, "loss": 6.2597, "mean_token_accuracy": 0.1346914291381836, "num_tokens": 34669308.0, "step": 16025 }, { "entropy": 6.495907831192016, "epoch": 1.7153940820803681, "grad_norm": 1.5859375, "learning_rate": 0.00047128357276740986, "loss": 6.2504, "mean_token_accuracy": 0.13608802780508994, "num_tokens": 34679513.0, "step": 16030 }, { "entropy": 6.542607116699219, "epoch": 1.715929156188132, "grad_norm": 1.8203125, "learning_rate": 0.0004712648798000754, "loss": 6.2512, "mean_token_accuracy": 0.1372469075024128, "num_tokens": 34690736.0, "step": 16035 }, { "entropy": 6.527480745315552, "epoch": 1.716464230295896, "grad_norm": 1.3671875, "learning_rate": 0.00047124618116562003, "loss": 6.2315, "mean_token_accuracy": 0.13630061373114585, "num_tokens": 34701272.0, "step": 16040 }, { "entropy": 6.434833574295044, "epoch": 1.71699930440366, "grad_norm": 1.78125, "learning_rate": 0.0004712274768645839, "loss": 6.1692, "mean_token_accuracy": 0.14119511395692824, "num_tokens": 34712486.0, "step": 16045 }, { "entropy": 6.547205400466919, "epoch": 1.7175343785114239, "grad_norm": 1.3046875, "learning_rate": 0.00047120876689750685, "loss": 6.2375, "mean_token_accuracy": 0.1389646753668785, "num_tokens": 34721979.0, "step": 16050 }, { "entropy": 6.502142906188965, "epoch": 1.7180694526191878, "grad_norm": 1.7578125, "learning_rate": 0.0004711900512649292, "loss": 6.2311, "mean_token_accuracy": 0.13534836918115617, "num_tokens": 34733496.0, "step": 16055 }, { "entropy": 6.52419753074646, "epoch": 1.7186045267269516, "grad_norm": 1.484375, "learning_rate": 0.0004711713299673914, "loss": 6.2565, "mean_token_accuracy": 0.13493360206484795, "num_tokens": 34744223.0, "step": 16060 }, { "entropy": 6.485661029815674, "epoch": 1.7191396008347155, "grad_norm": 1.671875, "learning_rate": 0.00047115260300543407, "loss": 6.2972, "mean_token_accuracy": 0.1354266181588173, "num_tokens": 34754931.0, "step": 16065 }, { "entropy": 6.456936025619507, "epoch": 1.7196746749424796, "grad_norm": 1.796875, "learning_rate": 0.0004711338703795978, "loss": 6.1516, "mean_token_accuracy": 0.14075466692447663, "num_tokens": 34766285.0, "step": 16070 }, { "entropy": 6.499564981460571, "epoch": 1.7202097490502435, "grad_norm": 2.390625, "learning_rate": 0.0004711151320904237, "loss": 6.231, "mean_token_accuracy": 0.14091445803642272, "num_tokens": 34776979.0, "step": 16075 }, { "entropy": 6.55362229347229, "epoch": 1.7207448231580074, "grad_norm": 1.3046875, "learning_rate": 0.0004710963881384527, "loss": 6.3168, "mean_token_accuracy": 0.13049443140625955, "num_tokens": 34787466.0, "step": 16080 }, { "entropy": 6.589805269241333, "epoch": 1.7212798972657715, "grad_norm": 1.71875, "learning_rate": 0.000471077638524226, "loss": 6.2395, "mean_token_accuracy": 0.1367537833750248, "num_tokens": 34797664.0, "step": 16085 }, { "entropy": 6.486291074752808, "epoch": 1.7218149713735351, "grad_norm": 1.6640625, "learning_rate": 0.00047105888324828506, "loss": 6.2177, "mean_token_accuracy": 0.14723237380385398, "num_tokens": 34809082.0, "step": 16090 }, { "entropy": 6.523463010787964, "epoch": 1.7223500454812992, "grad_norm": 1.53125, "learning_rate": 0.00047104012231117143, "loss": 6.2371, "mean_token_accuracy": 0.1389696106314659, "num_tokens": 34820223.0, "step": 16095 }, { "entropy": 6.435459613800049, "epoch": 1.722885119589063, "grad_norm": 1.34375, "learning_rate": 0.00047102135571342683, "loss": 6.1566, "mean_token_accuracy": 0.1369843900203705, "num_tokens": 34830428.0, "step": 16100 }, { "entropy": 6.462934303283691, "epoch": 1.723420193696827, "grad_norm": 1.4140625, "learning_rate": 0.00047100258345559307, "loss": 6.2712, "mean_token_accuracy": 0.1307723380625248, "num_tokens": 34842787.0, "step": 16105 }, { "entropy": 6.507791662216187, "epoch": 1.723955267804591, "grad_norm": 1.3125, "learning_rate": 0.0004709838055382123, "loss": 6.2059, "mean_token_accuracy": 0.13265354037284852, "num_tokens": 34854323.0, "step": 16110 }, { "entropy": 6.4878136157989506, "epoch": 1.7244903419123547, "grad_norm": 1.3203125, "learning_rate": 0.0004709650219618266, "loss": 6.1923, "mean_token_accuracy": 0.13792682066559792, "num_tokens": 34865279.0, "step": 16115 }, { "entropy": 6.48901333808899, "epoch": 1.7250254160201188, "grad_norm": 1.90625, "learning_rate": 0.0004709462327269785, "loss": 6.2201, "mean_token_accuracy": 0.13436542078852654, "num_tokens": 34875951.0, "step": 16120 }, { "entropy": 6.490832757949829, "epoch": 1.7255604901278827, "grad_norm": 1.453125, "learning_rate": 0.0004709274378342105, "loss": 6.2368, "mean_token_accuracy": 0.1372871771454811, "num_tokens": 34885815.0, "step": 16125 }, { "entropy": 6.560395050048828, "epoch": 1.7260955642356466, "grad_norm": 1.4453125, "learning_rate": 0.00047090863728406517, "loss": 6.2759, "mean_token_accuracy": 0.13472879230976104, "num_tokens": 34897158.0, "step": 16130 }, { "entropy": 6.59221568107605, "epoch": 1.7266306383434107, "grad_norm": 1.4296875, "learning_rate": 0.0004708898310770856, "loss": 6.2824, "mean_token_accuracy": 0.1327106237411499, "num_tokens": 34907815.0, "step": 16135 }, { "entropy": 6.531020069122315, "epoch": 1.7271657124511743, "grad_norm": 1.3671875, "learning_rate": 0.0004708710192138146, "loss": 6.237, "mean_token_accuracy": 0.1372152455151081, "num_tokens": 34918820.0, "step": 16140 }, { "entropy": 6.56586446762085, "epoch": 1.7277007865589384, "grad_norm": 2.03125, "learning_rate": 0.0004708522016947954, "loss": 6.3121, "mean_token_accuracy": 0.13564084842801094, "num_tokens": 34929998.0, "step": 16145 }, { "entropy": 6.4926958084106445, "epoch": 1.7282358606667023, "grad_norm": 1.3828125, "learning_rate": 0.0004708333785205715, "loss": 6.2174, "mean_token_accuracy": 0.14865463376045226, "num_tokens": 34940989.0, "step": 16150 }, { "entropy": 6.5131425857543945, "epoch": 1.7287709347744662, "grad_norm": 2.328125, "learning_rate": 0.0004708145496916862, "loss": 6.2268, "mean_token_accuracy": 0.13459616228938104, "num_tokens": 34952433.0, "step": 16155 }, { "entropy": 6.573882055282593, "epoch": 1.7293060088822303, "grad_norm": 1.84375, "learning_rate": 0.00047079571520868344, "loss": 6.2891, "mean_token_accuracy": 0.1309241198003292, "num_tokens": 34963074.0, "step": 16160 }, { "entropy": 6.493603801727295, "epoch": 1.729841082989994, "grad_norm": 1.4765625, "learning_rate": 0.00047077687507210674, "loss": 6.2163, "mean_token_accuracy": 0.1405037112534046, "num_tokens": 34974315.0, "step": 16165 }, { "entropy": 6.457288455963135, "epoch": 1.730376157097758, "grad_norm": 1.5234375, "learning_rate": 0.0004707580292825004, "loss": 6.1575, "mean_token_accuracy": 0.15218150988221169, "num_tokens": 34985059.0, "step": 16170 }, { "entropy": 6.480514097213745, "epoch": 1.730911231205522, "grad_norm": 1.7734375, "learning_rate": 0.0004707391778404085, "loss": 6.3326, "mean_token_accuracy": 0.12655592635273932, "num_tokens": 34996156.0, "step": 16175 }, { "entropy": 6.564816570281982, "epoch": 1.7314463053132858, "grad_norm": 1.8515625, "learning_rate": 0.0004707203207463752, "loss": 6.2518, "mean_token_accuracy": 0.13536330088973045, "num_tokens": 35007410.0, "step": 16180 }, { "entropy": 6.5748625755310055, "epoch": 1.73198137942105, "grad_norm": 1.546875, "learning_rate": 0.0004707014580009453, "loss": 6.2302, "mean_token_accuracy": 0.14098969027400016, "num_tokens": 35018492.0, "step": 16185 }, { "entropy": 6.557524681091309, "epoch": 1.7325164535288138, "grad_norm": 1.6796875, "learning_rate": 0.0004706825896046632, "loss": 6.2829, "mean_token_accuracy": 0.1356653481721878, "num_tokens": 35029923.0, "step": 16190 }, { "entropy": 6.505240440368652, "epoch": 1.7330515276365777, "grad_norm": 1.5, "learning_rate": 0.00047066371555807386, "loss": 6.2046, "mean_token_accuracy": 0.13501440957188607, "num_tokens": 35040370.0, "step": 16195 }, { "entropy": 6.526643562316894, "epoch": 1.7335866017443415, "grad_norm": 1.6015625, "learning_rate": 0.0004706448358617222, "loss": 6.2823, "mean_token_accuracy": 0.1304975025355816, "num_tokens": 35051414.0, "step": 16200 }, { "entropy": 6.581493234634399, "epoch": 1.7341216758521054, "grad_norm": 1.34375, "learning_rate": 0.00047062595051615343, "loss": 6.2024, "mean_token_accuracy": 0.14306259751319886, "num_tokens": 35061015.0, "step": 16205 }, { "entropy": 6.513972759246826, "epoch": 1.7346567499598695, "grad_norm": 1.796875, "learning_rate": 0.0004706070595219128, "loss": 6.2947, "mean_token_accuracy": 0.1341689184308052, "num_tokens": 35071757.0, "step": 16210 }, { "entropy": 6.516111135482788, "epoch": 1.7351918240676334, "grad_norm": 2.0, "learning_rate": 0.00047058816287954587, "loss": 6.2696, "mean_token_accuracy": 0.13728854209184646, "num_tokens": 35082912.0, "step": 16215 }, { "entropy": 6.561192560195923, "epoch": 1.7357268981753973, "grad_norm": 1.640625, "learning_rate": 0.00047056926058959813, "loss": 6.2331, "mean_token_accuracy": 0.1454016536474228, "num_tokens": 35094103.0, "step": 16220 }, { "entropy": 6.521594715118408, "epoch": 1.7362619722831614, "grad_norm": 2.34375, "learning_rate": 0.0004705503526526155, "loss": 6.1875, "mean_token_accuracy": 0.13738676756620408, "num_tokens": 35105960.0, "step": 16225 }, { "entropy": 6.445529317855835, "epoch": 1.736797046390925, "grad_norm": 1.515625, "learning_rate": 0.00047053143906914405, "loss": 6.208, "mean_token_accuracy": 0.14483401402831078, "num_tokens": 35116482.0, "step": 16230 }, { "entropy": 6.52421383857727, "epoch": 1.7373321204986891, "grad_norm": 2.375, "learning_rate": 0.00047051251983972966, "loss": 6.2693, "mean_token_accuracy": 0.1380905956029892, "num_tokens": 35127976.0, "step": 16235 }, { "entropy": 6.5142865657806395, "epoch": 1.737867194606453, "grad_norm": 1.59375, "learning_rate": 0.0004704935949649187, "loss": 6.2711, "mean_token_accuracy": 0.13424955755472184, "num_tokens": 35137712.0, "step": 16240 }, { "entropy": 6.436436986923217, "epoch": 1.7384022687142169, "grad_norm": 2.953125, "learning_rate": 0.0004704746644452577, "loss": 6.176, "mean_token_accuracy": 0.13780921846628189, "num_tokens": 35148524.0, "step": 16245 }, { "entropy": 6.491331481933594, "epoch": 1.738937342821981, "grad_norm": 1.3671875, "learning_rate": 0.00047045572828129323, "loss": 6.2687, "mean_token_accuracy": 0.13721957728266715, "num_tokens": 35159080.0, "step": 16250 }, { "entropy": 6.366399574279785, "epoch": 1.7394724169297446, "grad_norm": 1.21875, "learning_rate": 0.000470436786473572, "loss": 6.1653, "mean_token_accuracy": 0.13959982618689537, "num_tokens": 35169993.0, "step": 16255 }, { "entropy": 6.465382099151611, "epoch": 1.7400074910375087, "grad_norm": 1.578125, "learning_rate": 0.0004704178390226411, "loss": 6.2004, "mean_token_accuracy": 0.13708374574780463, "num_tokens": 35181413.0, "step": 16260 }, { "entropy": 6.476068544387817, "epoch": 1.7405425651452726, "grad_norm": 1.515625, "learning_rate": 0.00047039888592904753, "loss": 6.198, "mean_token_accuracy": 0.14310968890786172, "num_tokens": 35191600.0, "step": 16265 }, { "entropy": 6.515720224380493, "epoch": 1.7410776392530365, "grad_norm": 1.46875, "learning_rate": 0.00047037992719333864, "loss": 6.2098, "mean_token_accuracy": 0.13760415241122245, "num_tokens": 35202535.0, "step": 16270 }, { "entropy": 6.517277812957763, "epoch": 1.7416127133608006, "grad_norm": 1.40625, "learning_rate": 0.00047036096281606176, "loss": 6.2256, "mean_token_accuracy": 0.130896158516407, "num_tokens": 35214798.0, "step": 16275 }, { "entropy": 6.5141020774841305, "epoch": 1.7421477874685642, "grad_norm": 1.5859375, "learning_rate": 0.00047034199279776456, "loss": 6.1867, "mean_token_accuracy": 0.1439959242939949, "num_tokens": 35224870.0, "step": 16280 }, { "entropy": 6.490610218048095, "epoch": 1.7426828615763283, "grad_norm": 2.734375, "learning_rate": 0.0004703230171389948, "loss": 6.2043, "mean_token_accuracy": 0.1389573745429516, "num_tokens": 35235408.0, "step": 16285 }, { "entropy": 6.441397047042846, "epoch": 1.7432179356840922, "grad_norm": 1.703125, "learning_rate": 0.00047030403584030024, "loss": 6.2315, "mean_token_accuracy": 0.14157229885458947, "num_tokens": 35246310.0, "step": 16290 }, { "entropy": 6.481639003753662, "epoch": 1.743753009791856, "grad_norm": 1.5, "learning_rate": 0.0004702850489022292, "loss": 6.2518, "mean_token_accuracy": 0.13529093638062478, "num_tokens": 35257027.0, "step": 16295 }, { "entropy": 6.591700649261474, "epoch": 1.7442880838996202, "grad_norm": 1.5, "learning_rate": 0.00047026605632532976, "loss": 6.2193, "mean_token_accuracy": 0.13825585916638375, "num_tokens": 35267397.0, "step": 16300 }, { "entropy": 6.4336450576782225, "epoch": 1.7448231580073839, "grad_norm": 1.3515625, "learning_rate": 0.00047024705811015045, "loss": 6.163, "mean_token_accuracy": 0.14259003922343255, "num_tokens": 35278775.0, "step": 16305 }, { "entropy": 6.446195077896118, "epoch": 1.745358232115148, "grad_norm": 1.8046875, "learning_rate": 0.0004702280542572397, "loss": 6.1124, "mean_token_accuracy": 0.14629908427596092, "num_tokens": 35288818.0, "step": 16310 }, { "entropy": 6.5565478801727295, "epoch": 1.7458933062229118, "grad_norm": 1.640625, "learning_rate": 0.0004702090447671464, "loss": 6.317, "mean_token_accuracy": 0.1260501079261303, "num_tokens": 35299385.0, "step": 16315 }, { "entropy": 6.503725910186768, "epoch": 1.7464283803306757, "grad_norm": 1.59375, "learning_rate": 0.0004701900296404193, "loss": 6.176, "mean_token_accuracy": 0.14620715752243996, "num_tokens": 35310626.0, "step": 16320 }, { "entropy": 6.545715284347534, "epoch": 1.7469634544384398, "grad_norm": 1.390625, "learning_rate": 0.0004701710088776075, "loss": 6.2858, "mean_token_accuracy": 0.13202030956745148, "num_tokens": 35321615.0, "step": 16325 }, { "entropy": 6.573356199264526, "epoch": 1.7474985285462037, "grad_norm": 1.640625, "learning_rate": 0.00047015198247926025, "loss": 6.2808, "mean_token_accuracy": 0.13973275944590569, "num_tokens": 35332012.0, "step": 16330 }, { "entropy": 6.562140321731567, "epoch": 1.7480336026539676, "grad_norm": 1.4140625, "learning_rate": 0.000470132950445927, "loss": 6.3014, "mean_token_accuracy": 0.12587928250432015, "num_tokens": 35342153.0, "step": 16335 }, { "entropy": 6.530314254760742, "epoch": 1.7485686767617317, "grad_norm": 1.40625, "learning_rate": 0.0004701139127781571, "loss": 6.2257, "mean_token_accuracy": 0.13639529570937156, "num_tokens": 35352858.0, "step": 16340 }, { "entropy": 6.514222860336304, "epoch": 1.7491037508694953, "grad_norm": 1.4921875, "learning_rate": 0.0004700948694765005, "loss": 6.1479, "mean_token_accuracy": 0.14512947499752044, "num_tokens": 35363489.0, "step": 16345 }, { "entropy": 6.55261082649231, "epoch": 1.7496388249772594, "grad_norm": 1.6796875, "learning_rate": 0.0004700758205415069, "loss": 6.3504, "mean_token_accuracy": 0.13262177556753157, "num_tokens": 35375816.0, "step": 16350 }, { "entropy": 6.506987237930298, "epoch": 1.7501738990850233, "grad_norm": 2.859375, "learning_rate": 0.00047005676597372645, "loss": 6.2305, "mean_token_accuracy": 0.13197326436638832, "num_tokens": 35386708.0, "step": 16355 }, { "entropy": 6.4838512420654295, "epoch": 1.7507089731927872, "grad_norm": 2.03125, "learning_rate": 0.00047003770577370925, "loss": 6.2964, "mean_token_accuracy": 0.13025422096252443, "num_tokens": 35397734.0, "step": 16360 }, { "entropy": 6.612907648086548, "epoch": 1.7512440473005513, "grad_norm": 1.6484375, "learning_rate": 0.00047001863994200574, "loss": 6.243, "mean_token_accuracy": 0.13965339437127114, "num_tokens": 35408870.0, "step": 16365 }, { "entropy": 6.496535873413086, "epoch": 1.751779121408315, "grad_norm": 1.6875, "learning_rate": 0.0004699995684791664, "loss": 6.1831, "mean_token_accuracy": 0.1359889529645443, "num_tokens": 35419498.0, "step": 16370 }, { "entropy": 6.436664390563965, "epoch": 1.752314195516079, "grad_norm": 1.71875, "learning_rate": 0.00046998049138574177, "loss": 6.1926, "mean_token_accuracy": 0.14066151529550552, "num_tokens": 35430690.0, "step": 16375 }, { "entropy": 6.455047512054444, "epoch": 1.752849269623843, "grad_norm": 1.7734375, "learning_rate": 0.000469961408662283, "loss": 6.1547, "mean_token_accuracy": 0.14213127717375756, "num_tokens": 35441007.0, "step": 16380 }, { "entropy": 6.447874355316162, "epoch": 1.7533843437316068, "grad_norm": 1.671875, "learning_rate": 0.000469942320309341, "loss": 6.2236, "mean_token_accuracy": 0.14288512840867043, "num_tokens": 35453202.0, "step": 16385 }, { "entropy": 6.465952157974243, "epoch": 1.7539194178393709, "grad_norm": 1.4375, "learning_rate": 0.00046992322632746677, "loss": 6.227, "mean_token_accuracy": 0.14558738470077515, "num_tokens": 35463303.0, "step": 16390 }, { "entropy": 6.510498428344727, "epoch": 1.7544544919471345, "grad_norm": 1.9375, "learning_rate": 0.00046990412671721186, "loss": 6.222, "mean_token_accuracy": 0.14194708690047264, "num_tokens": 35474104.0, "step": 16395 }, { "entropy": 6.53613052368164, "epoch": 1.7549895660548986, "grad_norm": 1.9921875, "learning_rate": 0.0004698850214791276, "loss": 6.2567, "mean_token_accuracy": 0.1344727098941803, "num_tokens": 35486412.0, "step": 16400 }, { "entropy": 6.533957195281983, "epoch": 1.7555246401626625, "grad_norm": 1.5234375, "learning_rate": 0.0004698659106137658, "loss": 6.2316, "mean_token_accuracy": 0.1366186335682869, "num_tokens": 35497505.0, "step": 16405 }, { "entropy": 6.578169441223144, "epoch": 1.7560597142704264, "grad_norm": 5.15625, "learning_rate": 0.0004698467941216782, "loss": 6.2773, "mean_token_accuracy": 0.13750482201576233, "num_tokens": 35508397.0, "step": 16410 }, { "entropy": 6.60500431060791, "epoch": 1.7565947883781905, "grad_norm": 1.6171875, "learning_rate": 0.00046982767200341675, "loss": 6.3211, "mean_token_accuracy": 0.13072726875543594, "num_tokens": 35520261.0, "step": 16415 }, { "entropy": 6.531397581100464, "epoch": 1.7571298624859542, "grad_norm": 1.3359375, "learning_rate": 0.00046980854425953365, "loss": 6.1989, "mean_token_accuracy": 0.13409352228045462, "num_tokens": 35531816.0, "step": 16420 }, { "entropy": 6.530423879623413, "epoch": 1.7576649365937183, "grad_norm": 1.4296875, "learning_rate": 0.0004697894108905813, "loss": 6.2825, "mean_token_accuracy": 0.13641773015260697, "num_tokens": 35542233.0, "step": 16425 }, { "entropy": 6.508632040023803, "epoch": 1.7582000107014821, "grad_norm": 1.5390625, "learning_rate": 0.00046977027189711197, "loss": 6.2112, "mean_token_accuracy": 0.1387732908129692, "num_tokens": 35552881.0, "step": 16430 }, { "entropy": 6.4908287048339846, "epoch": 1.758735084809246, "grad_norm": 1.5625, "learning_rate": 0.0004697511272796785, "loss": 6.1707, "mean_token_accuracy": 0.13812109753489493, "num_tokens": 35562392.0, "step": 16435 }, { "entropy": 6.495633935928344, "epoch": 1.75927015891701, "grad_norm": 2.453125, "learning_rate": 0.0004697319770388335, "loss": 6.2605, "mean_token_accuracy": 0.13243331611156464, "num_tokens": 35574587.0, "step": 16440 }, { "entropy": 6.49248194694519, "epoch": 1.759805233024774, "grad_norm": 1.515625, "learning_rate": 0.0004697128211751301, "loss": 6.1313, "mean_token_accuracy": 0.1406071349978447, "num_tokens": 35585178.0, "step": 16445 }, { "entropy": 6.460205698013306, "epoch": 1.7603403071325379, "grad_norm": 1.5, "learning_rate": 0.0004696936596891213, "loss": 6.1919, "mean_token_accuracy": 0.13646092414855956, "num_tokens": 35595501.0, "step": 16450 }, { "entropy": 6.509033679962158, "epoch": 1.7608753812403017, "grad_norm": 3.703125, "learning_rate": 0.0004696744925813605, "loss": 6.2236, "mean_token_accuracy": 0.13326306268572807, "num_tokens": 35606794.0, "step": 16455 }, { "entropy": 6.5370752811431885, "epoch": 1.7614104553480656, "grad_norm": 1.546875, "learning_rate": 0.0004696553198524011, "loss": 6.2488, "mean_token_accuracy": 0.1357016831636429, "num_tokens": 35618732.0, "step": 16460 }, { "entropy": 6.498097991943359, "epoch": 1.7619455294558297, "grad_norm": 1.640625, "learning_rate": 0.0004696361415027966, "loss": 6.1716, "mean_token_accuracy": 0.1408173367381096, "num_tokens": 35629802.0, "step": 16465 }, { "entropy": 6.475509119033814, "epoch": 1.7624806035635936, "grad_norm": 1.328125, "learning_rate": 0.0004696169575331009, "loss": 6.2751, "mean_token_accuracy": 0.13238577544689178, "num_tokens": 35640826.0, "step": 16470 }, { "entropy": 6.536092138290405, "epoch": 1.7630156776713575, "grad_norm": 1.40625, "learning_rate": 0.000469597767943868, "loss": 6.2726, "mean_token_accuracy": 0.13249727264046668, "num_tokens": 35651613.0, "step": 16475 }, { "entropy": 6.469944190979004, "epoch": 1.7635507517791216, "grad_norm": 1.25, "learning_rate": 0.0004695785727356517, "loss": 6.1309, "mean_token_accuracy": 0.13989657014608384, "num_tokens": 35662334.0, "step": 16480 }, { "entropy": 6.536354923248291, "epoch": 1.7640858258868852, "grad_norm": 1.78125, "learning_rate": 0.0004695593719090066, "loss": 6.2903, "mean_token_accuracy": 0.13316132500767708, "num_tokens": 35673466.0, "step": 16485 }, { "entropy": 6.53029580116272, "epoch": 1.7646208999946493, "grad_norm": 2.421875, "learning_rate": 0.0004695401654644869, "loss": 6.2372, "mean_token_accuracy": 0.13935657143592833, "num_tokens": 35684708.0, "step": 16490 }, { "entropy": 6.461583137512207, "epoch": 1.7651559741024132, "grad_norm": 1.3984375, "learning_rate": 0.00046952095340264727, "loss": 6.1001, "mean_token_accuracy": 0.14150693714618684, "num_tokens": 35694888.0, "step": 16495 }, { "entropy": 6.519178009033203, "epoch": 1.765691048210177, "grad_norm": 1.3515625, "learning_rate": 0.00046950173572404255, "loss": 6.1638, "mean_token_accuracy": 0.13781533762812614, "num_tokens": 35704844.0, "step": 16500 }, { "entropy": 6.50765905380249, "epoch": 1.7662261223179412, "grad_norm": 2.265625, "learning_rate": 0.0004694825124292275, "loss": 6.2534, "mean_token_accuracy": 0.13843735828995704, "num_tokens": 35715468.0, "step": 16505 }, { "entropy": 6.509899616241455, "epoch": 1.7667611964257048, "grad_norm": 1.5078125, "learning_rate": 0.0004694632835187572, "loss": 6.3115, "mean_token_accuracy": 0.13584157973527908, "num_tokens": 35725542.0, "step": 16510 }, { "entropy": 6.535692405700684, "epoch": 1.767296270533469, "grad_norm": 1.40625, "learning_rate": 0.00046944404899318685, "loss": 6.1905, "mean_token_accuracy": 0.1380226269364357, "num_tokens": 35737032.0, "step": 16515 }, { "entropy": 6.53953366279602, "epoch": 1.7678313446412328, "grad_norm": 1.71875, "learning_rate": 0.000469424808853072, "loss": 6.2085, "mean_token_accuracy": 0.1371114008128643, "num_tokens": 35747742.0, "step": 16520 }, { "entropy": 6.465522813796997, "epoch": 1.7683664187489967, "grad_norm": 1.4765625, "learning_rate": 0.0004694055630989681, "loss": 6.1814, "mean_token_accuracy": 0.13816195577383042, "num_tokens": 35757795.0, "step": 16525 }, { "entropy": 6.460051870346069, "epoch": 1.7689014928567608, "grad_norm": 1.796875, "learning_rate": 0.0004693863117314308, "loss": 6.1784, "mean_token_accuracy": 0.1464919239282608, "num_tokens": 35767962.0, "step": 16530 }, { "entropy": 6.489283609390259, "epoch": 1.7694365669645244, "grad_norm": 1.4609375, "learning_rate": 0.0004693670547510161, "loss": 6.2793, "mean_token_accuracy": 0.13113914132118226, "num_tokens": 35778564.0, "step": 16535 }, { "entropy": 6.5667181491851805, "epoch": 1.7699716410722885, "grad_norm": 1.65625, "learning_rate": 0.00046934779215828006, "loss": 6.2191, "mean_token_accuracy": 0.14195646718144417, "num_tokens": 35788417.0, "step": 16540 }, { "entropy": 6.496956443786621, "epoch": 1.7705067151800524, "grad_norm": 1.4375, "learning_rate": 0.0004693285239537788, "loss": 6.2486, "mean_token_accuracy": 0.13466702327132224, "num_tokens": 35799724.0, "step": 16545 }, { "entropy": 6.557682847976684, "epoch": 1.7710417892878163, "grad_norm": 1.5, "learning_rate": 0.00046930925013806873, "loss": 6.1728, "mean_token_accuracy": 0.1405516743659973, "num_tokens": 35810306.0, "step": 16550 }, { "entropy": 6.579492568969727, "epoch": 1.7715768633955804, "grad_norm": 1.34375, "learning_rate": 0.0004692899707117064, "loss": 6.2244, "mean_token_accuracy": 0.13569827675819396, "num_tokens": 35821103.0, "step": 16555 }, { "entropy": 6.487555932998657, "epoch": 1.772111937503344, "grad_norm": 1.2890625, "learning_rate": 0.0004692706856752484, "loss": 6.2226, "mean_token_accuracy": 0.14339053258299828, "num_tokens": 35832271.0, "step": 16560 }, { "entropy": 6.505621671676636, "epoch": 1.7726470116111082, "grad_norm": 1.40625, "learning_rate": 0.00046925139502925167, "loss": 6.2647, "mean_token_accuracy": 0.13330883160233498, "num_tokens": 35843875.0, "step": 16565 }, { "entropy": 6.5568187713623045, "epoch": 1.773182085718872, "grad_norm": 1.859375, "learning_rate": 0.0004692320987742732, "loss": 6.2508, "mean_token_accuracy": 0.13371218591928483, "num_tokens": 35854085.0, "step": 16570 }, { "entropy": 6.614805221557617, "epoch": 1.773717159826636, "grad_norm": 1.6875, "learning_rate": 0.0004692127969108702, "loss": 6.2952, "mean_token_accuracy": 0.13505346402525903, "num_tokens": 35864777.0, "step": 16575 }, { "entropy": 6.561323356628418, "epoch": 1.7742522339344, "grad_norm": 1.3125, "learning_rate": 0.0004691934894396, "loss": 6.3012, "mean_token_accuracy": 0.13224760219454765, "num_tokens": 35876822.0, "step": 16580 }, { "entropy": 6.579904937744141, "epoch": 1.774787308042164, "grad_norm": 1.6875, "learning_rate": 0.00046917417636102, "loss": 6.1893, "mean_token_accuracy": 0.14425080120563508, "num_tokens": 35886997.0, "step": 16585 }, { "entropy": 6.514540147781372, "epoch": 1.7753223821499278, "grad_norm": 2.15625, "learning_rate": 0.000469154857675688, "loss": 6.2636, "mean_token_accuracy": 0.13917053490877151, "num_tokens": 35897871.0, "step": 16590 }, { "entropy": 6.437257766723633, "epoch": 1.7758574562576916, "grad_norm": 1.625, "learning_rate": 0.0004691355333841617, "loss": 6.2309, "mean_token_accuracy": 0.14573031067848205, "num_tokens": 35908791.0, "step": 16595 }, { "entropy": 6.539524126052856, "epoch": 1.7763925303654555, "grad_norm": 1.7421875, "learning_rate": 0.0004691162034869993, "loss": 6.2875, "mean_token_accuracy": 0.13325378373265268, "num_tokens": 35919436.0, "step": 16600 }, { "entropy": 6.599057722091675, "epoch": 1.7769276044732196, "grad_norm": 1.6484375, "learning_rate": 0.0004690968679847586, "loss": 6.1754, "mean_token_accuracy": 0.14074254035949707, "num_tokens": 35929851.0, "step": 16605 }, { "entropy": 6.528794050216675, "epoch": 1.7774626785809835, "grad_norm": 1.8828125, "learning_rate": 0.0004690775268779983, "loss": 6.2067, "mean_token_accuracy": 0.13964374586939812, "num_tokens": 35940271.0, "step": 16610 }, { "entropy": 6.45616717338562, "epoch": 1.7779977526887474, "grad_norm": 1.65625, "learning_rate": 0.0004690581801672765, "loss": 6.3054, "mean_token_accuracy": 0.12977162078022958, "num_tokens": 35951460.0, "step": 16615 }, { "entropy": 6.472211790084839, "epoch": 1.7785328267965115, "grad_norm": 1.59375, "learning_rate": 0.00046903882785315215, "loss": 6.1867, "mean_token_accuracy": 0.13858510851860045, "num_tokens": 35961530.0, "step": 16620 }, { "entropy": 6.500081157684326, "epoch": 1.7790679009042751, "grad_norm": 1.7890625, "learning_rate": 0.0004690194699361839, "loss": 6.1584, "mean_token_accuracy": 0.15004311949014665, "num_tokens": 35971085.0, "step": 16625 }, { "entropy": 6.478543996810913, "epoch": 1.7796029750120392, "grad_norm": 1.8828125, "learning_rate": 0.00046900010641693073, "loss": 6.2366, "mean_token_accuracy": 0.1306772880256176, "num_tokens": 35981393.0, "step": 16630 }, { "entropy": 6.47922649383545, "epoch": 1.7801380491198031, "grad_norm": 2.046875, "learning_rate": 0.0004689807372959517, "loss": 6.1911, "mean_token_accuracy": 0.13808380663394929, "num_tokens": 35992847.0, "step": 16635 }, { "entropy": 6.471188974380493, "epoch": 1.780673123227567, "grad_norm": 1.59375, "learning_rate": 0.00046896136257380615, "loss": 6.225, "mean_token_accuracy": 0.1351441413164139, "num_tokens": 36002991.0, "step": 16640 }, { "entropy": 6.500436925888062, "epoch": 1.781208197335331, "grad_norm": 1.7109375, "learning_rate": 0.00046894198225105356, "loss": 6.257, "mean_token_accuracy": 0.1417154736816883, "num_tokens": 36015140.0, "step": 16645 }, { "entropy": 6.471897602081299, "epoch": 1.7817432714430947, "grad_norm": 1.8515625, "learning_rate": 0.0004689225963282534, "loss": 6.1423, "mean_token_accuracy": 0.1382371798157692, "num_tokens": 36026014.0, "step": 16650 }, { "entropy": 6.607560014724731, "epoch": 1.7822783455508588, "grad_norm": 1.6875, "learning_rate": 0.0004689032048059656, "loss": 6.2989, "mean_token_accuracy": 0.13198384642601013, "num_tokens": 36035926.0, "step": 16655 }, { "entropy": 6.506697368621826, "epoch": 1.7828134196586227, "grad_norm": 1.625, "learning_rate": 0.00046888380768475, "loss": 6.2169, "mean_token_accuracy": 0.14066673815250397, "num_tokens": 36046406.0, "step": 16660 }, { "entropy": 6.467809438705444, "epoch": 1.7833484937663866, "grad_norm": 2.296875, "learning_rate": 0.0004688644049651667, "loss": 6.1642, "mean_token_accuracy": 0.14082129970192908, "num_tokens": 36056440.0, "step": 16665 }, { "entropy": 6.491926813125611, "epoch": 1.7838835678741507, "grad_norm": 1.453125, "learning_rate": 0.00046884499664777586, "loss": 6.2515, "mean_token_accuracy": 0.13191643580794335, "num_tokens": 36067244.0, "step": 16670 }, { "entropy": 6.499668931961059, "epoch": 1.7844186419819144, "grad_norm": 3.328125, "learning_rate": 0.0004688255827331381, "loss": 6.1558, "mean_token_accuracy": 0.14353570342063904, "num_tokens": 36078110.0, "step": 16675 }, { "entropy": 6.489797687530517, "epoch": 1.7849537160896785, "grad_norm": 1.453125, "learning_rate": 0.0004688061632218137, "loss": 6.2545, "mean_token_accuracy": 0.13878354877233506, "num_tokens": 36088805.0, "step": 16680 }, { "entropy": 6.5043909549713135, "epoch": 1.7854887901974423, "grad_norm": 2.5, "learning_rate": 0.00046878673811436375, "loss": 6.2106, "mean_token_accuracy": 0.14111408069729806, "num_tokens": 36098619.0, "step": 16685 }, { "entropy": 6.577878761291504, "epoch": 1.7860238643052062, "grad_norm": 2.046875, "learning_rate": 0.0004687673074113489, "loss": 6.2761, "mean_token_accuracy": 0.13543611243367196, "num_tokens": 36110604.0, "step": 16690 }, { "entropy": 6.630790567398071, "epoch": 1.7865589384129703, "grad_norm": 1.640625, "learning_rate": 0.0004687478711133303, "loss": 6.276, "mean_token_accuracy": 0.13638934642076492, "num_tokens": 36121669.0, "step": 16695 }, { "entropy": 6.3852990627288815, "epoch": 1.787094012520734, "grad_norm": 1.7109375, "learning_rate": 0.0004687284292208691, "loss": 6.055, "mean_token_accuracy": 0.15399005711078645, "num_tokens": 36132165.0, "step": 16700 }, { "entropy": 6.428806734085083, "epoch": 1.787629086628498, "grad_norm": 1.59375, "learning_rate": 0.00046870898173452676, "loss": 6.2031, "mean_token_accuracy": 0.140548275411129, "num_tokens": 36142830.0, "step": 16705 }, { "entropy": 6.477385234832764, "epoch": 1.788164160736262, "grad_norm": 2.34375, "learning_rate": 0.0004686895286548648, "loss": 6.1832, "mean_token_accuracy": 0.1369605541229248, "num_tokens": 36153812.0, "step": 16710 }, { "entropy": 6.511514568328858, "epoch": 1.7886992348440258, "grad_norm": 1.71875, "learning_rate": 0.00046867006998244494, "loss": 6.2327, "mean_token_accuracy": 0.1401585191488266, "num_tokens": 36163599.0, "step": 16715 }, { "entropy": 6.5018744468688965, "epoch": 1.78923430895179, "grad_norm": 1.6171875, "learning_rate": 0.00046865060571782896, "loss": 6.2433, "mean_token_accuracy": 0.13398018553853036, "num_tokens": 36173815.0, "step": 16720 }, { "entropy": 6.63695878982544, "epoch": 1.7897693830595538, "grad_norm": 1.765625, "learning_rate": 0.00046863113586157894, "loss": 6.3294, "mean_token_accuracy": 0.1324778087437153, "num_tokens": 36186131.0, "step": 16725 }, { "entropy": 6.553009986877441, "epoch": 1.7903044571673177, "grad_norm": 1.8046875, "learning_rate": 0.0004686116604142572, "loss": 6.1798, "mean_token_accuracy": 0.14324358105659485, "num_tokens": 36196084.0, "step": 16730 }, { "entropy": 6.467611074447632, "epoch": 1.7908395312750816, "grad_norm": 2.03125, "learning_rate": 0.0004685921793764259, "loss": 6.16, "mean_token_accuracy": 0.14632472023367882, "num_tokens": 36206948.0, "step": 16735 }, { "entropy": 6.550565099716186, "epoch": 1.7913746053828454, "grad_norm": 2.078125, "learning_rate": 0.0004685726927486476, "loss": 6.286, "mean_token_accuracy": 0.1330634005367756, "num_tokens": 36217202.0, "step": 16740 }, { "entropy": 6.596937656402588, "epoch": 1.7919096794906095, "grad_norm": 1.5703125, "learning_rate": 0.00046855320053148505, "loss": 6.3181, "mean_token_accuracy": 0.1310865469276905, "num_tokens": 36227914.0, "step": 16745 }, { "entropy": 6.573777103424073, "epoch": 1.7924447535983734, "grad_norm": 1.5546875, "learning_rate": 0.000468533702725501, "loss": 6.2627, "mean_token_accuracy": 0.13632940426468848, "num_tokens": 36239344.0, "step": 16750 }, { "entropy": 6.520642805099487, "epoch": 1.7929798277061373, "grad_norm": 1.5703125, "learning_rate": 0.00046851419933125843, "loss": 6.2837, "mean_token_accuracy": 0.13871801942586898, "num_tokens": 36250438.0, "step": 16755 }, { "entropy": 6.513595962524414, "epoch": 1.7935149018139014, "grad_norm": 1.6640625, "learning_rate": 0.0004684946903493206, "loss": 6.2462, "mean_token_accuracy": 0.13100792467594147, "num_tokens": 36260545.0, "step": 16760 }, { "entropy": 6.419894027709961, "epoch": 1.794049975921665, "grad_norm": 1.6015625, "learning_rate": 0.0004684751757802508, "loss": 6.1416, "mean_token_accuracy": 0.14160364121198654, "num_tokens": 36272577.0, "step": 16765 }, { "entropy": 6.516346645355225, "epoch": 1.7945850500294291, "grad_norm": 2.375, "learning_rate": 0.00046845565562461243, "loss": 6.1902, "mean_token_accuracy": 0.14187682345509528, "num_tokens": 36284161.0, "step": 16770 }, { "entropy": 6.527055025100708, "epoch": 1.795120124137193, "grad_norm": 1.5234375, "learning_rate": 0.00046843612988296926, "loss": 6.2087, "mean_token_accuracy": 0.13396796360611915, "num_tokens": 36294910.0, "step": 16775 }, { "entropy": 6.552798748016357, "epoch": 1.795655198244957, "grad_norm": 1.328125, "learning_rate": 0.0004684165985558849, "loss": 6.1797, "mean_token_accuracy": 0.13618710413575172, "num_tokens": 36305388.0, "step": 16780 }, { "entropy": 6.4872008800506595, "epoch": 1.796190272352721, "grad_norm": 1.765625, "learning_rate": 0.0004683970616439236, "loss": 6.2451, "mean_token_accuracy": 0.145309716463089, "num_tokens": 36316696.0, "step": 16785 }, { "entropy": 6.467041683197022, "epoch": 1.7967253464604847, "grad_norm": 1.6328125, "learning_rate": 0.0004683775191476492, "loss": 6.1561, "mean_token_accuracy": 0.14676120951771737, "num_tokens": 36327246.0, "step": 16790 }, { "entropy": 6.554820346832275, "epoch": 1.7972604205682488, "grad_norm": 1.9296875, "learning_rate": 0.0004683579710676262, "loss": 6.3159, "mean_token_accuracy": 0.1309548445045948, "num_tokens": 36338089.0, "step": 16795 }, { "entropy": 6.50324125289917, "epoch": 1.7977954946760126, "grad_norm": 1.609375, "learning_rate": 0.00046833841740441886, "loss": 6.2308, "mean_token_accuracy": 0.14037265926599501, "num_tokens": 36350285.0, "step": 16800 }, { "entropy": 6.577779293060303, "epoch": 1.7983305687837765, "grad_norm": 1.9140625, "learning_rate": 0.0004683188581585919, "loss": 6.2266, "mean_token_accuracy": 0.13420821651816367, "num_tokens": 36360431.0, "step": 16805 }, { "entropy": 6.581452989578247, "epoch": 1.7988656428915406, "grad_norm": 1.953125, "learning_rate": 0.0004682992933307101, "loss": 6.1858, "mean_token_accuracy": 0.14042315185070037, "num_tokens": 36371257.0, "step": 16810 }, { "entropy": 6.424906253814697, "epoch": 1.7994007169993043, "grad_norm": 1.3984375, "learning_rate": 0.00046827972292133835, "loss": 6.1612, "mean_token_accuracy": 0.14297413006424903, "num_tokens": 36382613.0, "step": 16815 }, { "entropy": 6.5323937892913815, "epoch": 1.7999357911070684, "grad_norm": 1.6328125, "learning_rate": 0.0004682601469310418, "loss": 6.2386, "mean_token_accuracy": 0.1366001270711422, "num_tokens": 36393799.0, "step": 16820 }, { "entropy": 6.505597305297852, "epoch": 1.8004708652148322, "grad_norm": 1.4765625, "learning_rate": 0.00046824056536038565, "loss": 6.2224, "mean_token_accuracy": 0.13767699897289276, "num_tokens": 36403914.0, "step": 16825 }, { "entropy": 6.4454141616821286, "epoch": 1.8010059393225961, "grad_norm": 1.6171875, "learning_rate": 0.0004682209782099353, "loss": 6.203, "mean_token_accuracy": 0.13994815796613694, "num_tokens": 36415022.0, "step": 16830 }, { "entropy": 6.492913055419922, "epoch": 1.8015410134303602, "grad_norm": 1.3828125, "learning_rate": 0.00046820138548025634, "loss": 6.1447, "mean_token_accuracy": 0.144903202354908, "num_tokens": 36426155.0, "step": 16835 }, { "entropy": 6.520499753952026, "epoch": 1.8020760875381239, "grad_norm": 1.453125, "learning_rate": 0.00046818178717191464, "loss": 6.2141, "mean_token_accuracy": 0.1381929524242878, "num_tokens": 36437345.0, "step": 16840 }, { "entropy": 6.520294523239135, "epoch": 1.802611161645888, "grad_norm": 1.53125, "learning_rate": 0.0004681621832854759, "loss": 6.2415, "mean_token_accuracy": 0.1451305240392685, "num_tokens": 36448634.0, "step": 16845 }, { "entropy": 6.482553720474243, "epoch": 1.8031462357536518, "grad_norm": 1.3046875, "learning_rate": 0.00046814257382150627, "loss": 6.2023, "mean_token_accuracy": 0.14824908673763276, "num_tokens": 36458870.0, "step": 16850 }, { "entropy": 6.526421070098877, "epoch": 1.8036813098614157, "grad_norm": 1.859375, "learning_rate": 0.00046812295878057193, "loss": 6.3182, "mean_token_accuracy": 0.1356567807495594, "num_tokens": 36469865.0, "step": 16855 }, { "entropy": 6.506421089172363, "epoch": 1.8042163839691798, "grad_norm": 1.8046875, "learning_rate": 0.0004681033381632393, "loss": 6.208, "mean_token_accuracy": 0.13496703803539276, "num_tokens": 36480502.0, "step": 16860 }, { "entropy": 6.568086290359497, "epoch": 1.8047514580769437, "grad_norm": 1.359375, "learning_rate": 0.0004680837119700749, "loss": 6.2178, "mean_token_accuracy": 0.13847601637244225, "num_tokens": 36492356.0, "step": 16865 }, { "entropy": 6.469596433639526, "epoch": 1.8052865321847076, "grad_norm": 1.4375, "learning_rate": 0.00046806408020164553, "loss": 6.2064, "mean_token_accuracy": 0.13677831664681434, "num_tokens": 36504659.0, "step": 16870 }, { "entropy": 6.4850420475006105, "epoch": 1.8058216062924715, "grad_norm": 1.421875, "learning_rate": 0.00046804444285851796, "loss": 6.1926, "mean_token_accuracy": 0.13537785932421684, "num_tokens": 36516042.0, "step": 16875 }, { "entropy": 6.583554267883301, "epoch": 1.8063566804002353, "grad_norm": 1.5078125, "learning_rate": 0.00046802479994125916, "loss": 6.3029, "mean_token_accuracy": 0.13417793661355973, "num_tokens": 36527417.0, "step": 16880 }, { "entropy": 6.517843437194824, "epoch": 1.8068917545079994, "grad_norm": 1.828125, "learning_rate": 0.0004680051514504364, "loss": 6.2097, "mean_token_accuracy": 0.1450719028711319, "num_tokens": 36538182.0, "step": 16885 }, { "entropy": 6.477873516082764, "epoch": 1.8074268286157633, "grad_norm": 1.390625, "learning_rate": 0.0004679854973866171, "loss": 6.2986, "mean_token_accuracy": 0.13775768205523492, "num_tokens": 36549835.0, "step": 16890 }, { "entropy": 6.45180606842041, "epoch": 1.8079619027235272, "grad_norm": 2.0625, "learning_rate": 0.00046796583775036857, "loss": 6.19, "mean_token_accuracy": 0.14810781925916672, "num_tokens": 36560238.0, "step": 16895 }, { "entropy": 6.533177089691162, "epoch": 1.8084969768312913, "grad_norm": 1.34375, "learning_rate": 0.00046794617254225865, "loss": 6.2267, "mean_token_accuracy": 0.14068657979369165, "num_tokens": 36571267.0, "step": 16900 }, { "entropy": 6.52840747833252, "epoch": 1.809032050939055, "grad_norm": 1.4453125, "learning_rate": 0.0004679265017628551, "loss": 6.2861, "mean_token_accuracy": 0.14016860574483872, "num_tokens": 36582174.0, "step": 16905 }, { "entropy": 6.566719913482666, "epoch": 1.809567125046819, "grad_norm": 1.328125, "learning_rate": 0.0004679068254127259, "loss": 6.2379, "mean_token_accuracy": 0.1399499513208866, "num_tokens": 36593054.0, "step": 16910 }, { "entropy": 6.543996334075928, "epoch": 1.810102199154583, "grad_norm": 1.53125, "learning_rate": 0.00046788714349243923, "loss": 6.2411, "mean_token_accuracy": 0.13865780755877494, "num_tokens": 36603962.0, "step": 16915 }, { "entropy": 6.538334846496582, "epoch": 1.8106372732623468, "grad_norm": 1.40625, "learning_rate": 0.0004678674560025634, "loss": 6.2346, "mean_token_accuracy": 0.13803598582744597, "num_tokens": 36616003.0, "step": 16920 }, { "entropy": 6.555250835418701, "epoch": 1.811172347370111, "grad_norm": 1.3984375, "learning_rate": 0.0004678477629436669, "loss": 6.3134, "mean_token_accuracy": 0.1259820744395256, "num_tokens": 36627189.0, "step": 16925 }, { "entropy": 6.563538408279419, "epoch": 1.8117074214778746, "grad_norm": 1.5, "learning_rate": 0.0004678280643163184, "loss": 6.3285, "mean_token_accuracy": 0.1305183358490467, "num_tokens": 36637756.0, "step": 16930 }, { "entropy": 6.52625207901001, "epoch": 1.8122424955856387, "grad_norm": 1.8359375, "learning_rate": 0.0004678083601210865, "loss": 6.2622, "mean_token_accuracy": 0.14015371575951577, "num_tokens": 36648946.0, "step": 16935 }, { "entropy": 6.581425952911377, "epoch": 1.8127775696934025, "grad_norm": 1.4296875, "learning_rate": 0.0004677886503585404, "loss": 6.2769, "mean_token_accuracy": 0.13917845040559768, "num_tokens": 36660184.0, "step": 16940 }, { "entropy": 6.549855661392212, "epoch": 1.8133126438011664, "grad_norm": 1.421875, "learning_rate": 0.00046776893502924904, "loss": 6.3284, "mean_token_accuracy": 0.13336536437273025, "num_tokens": 36671346.0, "step": 16945 }, { "entropy": 6.584742641448974, "epoch": 1.8138477179089305, "grad_norm": 1.390625, "learning_rate": 0.0004677492141337818, "loss": 6.2225, "mean_token_accuracy": 0.13786211013793945, "num_tokens": 36682917.0, "step": 16950 }, { "entropy": 6.547979497909546, "epoch": 1.8143827920166942, "grad_norm": 1.796875, "learning_rate": 0.0004677294876727081, "loss": 6.305, "mean_token_accuracy": 0.12805510684847832, "num_tokens": 36693577.0, "step": 16955 }, { "entropy": 6.611744832992554, "epoch": 1.8149178661244583, "grad_norm": 1.4296875, "learning_rate": 0.0004677097556465975, "loss": 6.249, "mean_token_accuracy": 0.13698212802410126, "num_tokens": 36704915.0, "step": 16960 }, { "entropy": 6.596394205093384, "epoch": 1.8154529402322221, "grad_norm": 1.65625, "learning_rate": 0.00046769001805601983, "loss": 6.3643, "mean_token_accuracy": 0.12665193229913713, "num_tokens": 36716086.0, "step": 16965 }, { "entropy": 6.468046569824219, "epoch": 1.815988014339986, "grad_norm": 1.40625, "learning_rate": 0.00046767027490154494, "loss": 6.1918, "mean_token_accuracy": 0.13091371804475785, "num_tokens": 36726110.0, "step": 16970 }, { "entropy": 6.549561405181885, "epoch": 1.8165230884477501, "grad_norm": 1.4375, "learning_rate": 0.00046765052618374296, "loss": 6.1771, "mean_token_accuracy": 0.1403437852859497, "num_tokens": 36735846.0, "step": 16975 }, { "entropy": 6.515966844558716, "epoch": 1.8170581625555138, "grad_norm": 1.828125, "learning_rate": 0.000467630771903184, "loss": 6.259, "mean_token_accuracy": 0.1386712908744812, "num_tokens": 36746851.0, "step": 16980 }, { "entropy": 6.525477933883667, "epoch": 1.8175932366632779, "grad_norm": 1.5078125, "learning_rate": 0.0004676110120604387, "loss": 6.2324, "mean_token_accuracy": 0.13791928589344024, "num_tokens": 36758032.0, "step": 16985 }, { "entropy": 6.572210121154785, "epoch": 1.8181283107710418, "grad_norm": 1.8515625, "learning_rate": 0.0004675912466560775, "loss": 6.2518, "mean_token_accuracy": 0.14123788774013518, "num_tokens": 36768939.0, "step": 16990 }, { "entropy": 6.577953958511353, "epoch": 1.8186633848788056, "grad_norm": 2.46875, "learning_rate": 0.00046757147569067106, "loss": 6.304, "mean_token_accuracy": 0.13176384195685387, "num_tokens": 36780338.0, "step": 16995 }, { "entropy": 6.507962799072265, "epoch": 1.8191984589865697, "grad_norm": 1.2109375, "learning_rate": 0.0004675516991647903, "loss": 6.1541, "mean_token_accuracy": 0.13604221120476723, "num_tokens": 36791384.0, "step": 17000 }, { "entropy": 6.4729632377624515, "epoch": 1.8197335330943336, "grad_norm": 1.2421875, "learning_rate": 0.00046753191707900636, "loss": 6.2134, "mean_token_accuracy": 0.1321197956800461, "num_tokens": 36802460.0, "step": 17005 }, { "entropy": 6.536910820007324, "epoch": 1.8202686072020975, "grad_norm": 1.640625, "learning_rate": 0.00046751212943389026, "loss": 6.2864, "mean_token_accuracy": 0.13371748030185698, "num_tokens": 36813599.0, "step": 17010 }, { "entropy": 6.563910818099975, "epoch": 1.8208036813098614, "grad_norm": 1.421875, "learning_rate": 0.0004674923362300135, "loss": 6.158, "mean_token_accuracy": 0.1385357163846493, "num_tokens": 36823100.0, "step": 17015 }, { "entropy": 6.547238874435425, "epoch": 1.8213387554176252, "grad_norm": 1.5390625, "learning_rate": 0.00046747253746794767, "loss": 6.304, "mean_token_accuracy": 0.13121092841029167, "num_tokens": 36834245.0, "step": 17020 }, { "entropy": 6.488923406600952, "epoch": 1.8218738295253893, "grad_norm": 1.3515625, "learning_rate": 0.00046745273314826425, "loss": 6.1663, "mean_token_accuracy": 0.1463228791952133, "num_tokens": 36844126.0, "step": 17025 }, { "entropy": 6.494448804855347, "epoch": 1.8224089036331532, "grad_norm": 1.4765625, "learning_rate": 0.0004674329232715353, "loss": 6.1542, "mean_token_accuracy": 0.14492320418357849, "num_tokens": 36855451.0, "step": 17030 }, { "entropy": 6.573440742492676, "epoch": 1.822943977740917, "grad_norm": 1.5390625, "learning_rate": 0.0004674131078383327, "loss": 6.2544, "mean_token_accuracy": 0.13452650755643844, "num_tokens": 36864994.0, "step": 17035 }, { "entropy": 6.537502956390381, "epoch": 1.8234790518486812, "grad_norm": 1.3515625, "learning_rate": 0.0004673932868492286, "loss": 6.1962, "mean_token_accuracy": 0.13883368894457818, "num_tokens": 36875131.0, "step": 17040 }, { "entropy": 6.553777265548706, "epoch": 1.8240141259564449, "grad_norm": 1.5, "learning_rate": 0.00046737346030479546, "loss": 6.2549, "mean_token_accuracy": 0.13633736670017244, "num_tokens": 36884789.0, "step": 17045 }, { "entropy": 6.493189573287964, "epoch": 1.824549200064209, "grad_norm": 1.3984375, "learning_rate": 0.00046735362820560564, "loss": 6.1517, "mean_token_accuracy": 0.13749801069498063, "num_tokens": 36895199.0, "step": 17050 }, { "entropy": 6.533320331573487, "epoch": 1.8250842741719728, "grad_norm": 1.2421875, "learning_rate": 0.0004673337905522318, "loss": 6.257, "mean_token_accuracy": 0.13339270278811455, "num_tokens": 36906495.0, "step": 17055 }, { "entropy": 6.4933160781860355, "epoch": 1.8256193482797367, "grad_norm": 1.625, "learning_rate": 0.00046731394734524686, "loss": 6.2217, "mean_token_accuracy": 0.13503750115633012, "num_tokens": 36916907.0, "step": 17060 }, { "entropy": 6.482892751693726, "epoch": 1.8261544223875008, "grad_norm": 1.7265625, "learning_rate": 0.00046729409858522363, "loss": 6.1848, "mean_token_accuracy": 0.13926137164235114, "num_tokens": 36927872.0, "step": 17065 }, { "entropy": 6.506586217880249, "epoch": 1.8266894964952645, "grad_norm": 2.8125, "learning_rate": 0.0004672742442727354, "loss": 6.2337, "mean_token_accuracy": 0.13534507304430007, "num_tokens": 36938575.0, "step": 17070 }, { "entropy": 6.421038293838501, "epoch": 1.8272245706030286, "grad_norm": 1.6328125, "learning_rate": 0.00046725438440835536, "loss": 6.1076, "mean_token_accuracy": 0.14953663647174836, "num_tokens": 36949179.0, "step": 17075 }, { "entropy": 6.481749391555786, "epoch": 1.8277596447107924, "grad_norm": 4.46875, "learning_rate": 0.000467234518992657, "loss": 6.1621, "mean_token_accuracy": 0.1452023506164551, "num_tokens": 36959164.0, "step": 17080 }, { "entropy": 6.567118787765503, "epoch": 1.8282947188185563, "grad_norm": 1.7109375, "learning_rate": 0.00046721464802621383, "loss": 6.3111, "mean_token_accuracy": 0.13393226340413095, "num_tokens": 36969091.0, "step": 17085 }, { "entropy": 6.562323141098022, "epoch": 1.8288297929263204, "grad_norm": 1.921875, "learning_rate": 0.00046719477150959984, "loss": 6.2461, "mean_token_accuracy": 0.13492230623960494, "num_tokens": 36980481.0, "step": 17090 }, { "entropy": 6.547414779663086, "epoch": 1.829364867034084, "grad_norm": 2.40625, "learning_rate": 0.00046717488944338873, "loss": 6.2198, "mean_token_accuracy": 0.13818060755729675, "num_tokens": 36991349.0, "step": 17095 }, { "entropy": 6.537697601318359, "epoch": 1.8298999411418482, "grad_norm": 1.7109375, "learning_rate": 0.00046715500182815473, "loss": 6.2997, "mean_token_accuracy": 0.13604205325245858, "num_tokens": 37002803.0, "step": 17100 }, { "entropy": 6.5742217063903805, "epoch": 1.830435015249612, "grad_norm": 1.296875, "learning_rate": 0.00046713510866447204, "loss": 6.2486, "mean_token_accuracy": 0.13930715918540953, "num_tokens": 37013578.0, "step": 17105 }, { "entropy": 6.480613660812378, "epoch": 1.830970089357376, "grad_norm": 2.3125, "learning_rate": 0.0004671152099529152, "loss": 6.1601, "mean_token_accuracy": 0.14176603630185128, "num_tokens": 37024012.0, "step": 17110 }, { "entropy": 6.431010293960571, "epoch": 1.83150516346514, "grad_norm": 1.625, "learning_rate": 0.00046709530569405855, "loss": 6.1546, "mean_token_accuracy": 0.1426972985267639, "num_tokens": 37034149.0, "step": 17115 }, { "entropy": 6.464472866058349, "epoch": 1.8320402375729037, "grad_norm": 1.671875, "learning_rate": 0.0004670753958884769, "loss": 6.1467, "mean_token_accuracy": 0.14506796300411223, "num_tokens": 37045669.0, "step": 17120 }, { "entropy": 6.518822431564331, "epoch": 1.8325753116806678, "grad_norm": 1.328125, "learning_rate": 0.00046705548053674524, "loss": 6.2426, "mean_token_accuracy": 0.13655512034893036, "num_tokens": 37056611.0, "step": 17125 }, { "entropy": 6.462148952484131, "epoch": 1.8331103857884317, "grad_norm": 1.5390625, "learning_rate": 0.00046703555963943855, "loss": 6.2124, "mean_token_accuracy": 0.13259709179401397, "num_tokens": 37067387.0, "step": 17130 }, { "entropy": 6.603019952774048, "epoch": 1.8336454598961955, "grad_norm": 2.171875, "learning_rate": 0.00046701563319713214, "loss": 6.3093, "mean_token_accuracy": 0.1327134758234024, "num_tokens": 37078151.0, "step": 17135 }, { "entropy": 6.576609134674072, "epoch": 1.8341805340039596, "grad_norm": 1.3984375, "learning_rate": 0.00046699570121040126, "loss": 6.2613, "mean_token_accuracy": 0.13562018275260926, "num_tokens": 37088219.0, "step": 17140 }, { "entropy": 6.467413425445557, "epoch": 1.8347156081117235, "grad_norm": 1.578125, "learning_rate": 0.0004669757636798215, "loss": 6.1373, "mean_token_accuracy": 0.14191140681505204, "num_tokens": 37098769.0, "step": 17145 }, { "entropy": 6.534985876083374, "epoch": 1.8352506822194874, "grad_norm": 1.4296875, "learning_rate": 0.0004669558206059684, "loss": 6.276, "mean_token_accuracy": 0.1294104613363743, "num_tokens": 37110716.0, "step": 17150 }, { "entropy": 6.538275527954101, "epoch": 1.8357857563272513, "grad_norm": 1.546875, "learning_rate": 0.0004669358719894181, "loss": 6.1879, "mean_token_accuracy": 0.13603334054350852, "num_tokens": 37122785.0, "step": 17155 }, { "entropy": 6.480508327484131, "epoch": 1.8363208304350152, "grad_norm": 2.15625, "learning_rate": 0.0004669159178307465, "loss": 6.1969, "mean_token_accuracy": 0.13679319992661476, "num_tokens": 37133308.0, "step": 17160 }, { "entropy": 6.407593870162964, "epoch": 1.8368559045427792, "grad_norm": 1.3828125, "learning_rate": 0.0004668959581305296, "loss": 6.1535, "mean_token_accuracy": 0.14222812801599502, "num_tokens": 37143916.0, "step": 17165 }, { "entropy": 6.46957540512085, "epoch": 1.8373909786505431, "grad_norm": 1.3984375, "learning_rate": 0.00046687599288934394, "loss": 6.1696, "mean_token_accuracy": 0.13823763206601142, "num_tokens": 37154335.0, "step": 17170 }, { "entropy": 6.529861164093018, "epoch": 1.837926052758307, "grad_norm": 2.046875, "learning_rate": 0.000466856022107766, "loss": 6.2338, "mean_token_accuracy": 0.1369415447115898, "num_tokens": 37164116.0, "step": 17175 }, { "entropy": 6.50433087348938, "epoch": 1.838461126866071, "grad_norm": 1.5390625, "learning_rate": 0.00046683604578637235, "loss": 6.2956, "mean_token_accuracy": 0.13340672180056573, "num_tokens": 37175407.0, "step": 17180 }, { "entropy": 6.446762371063232, "epoch": 1.8389962009738348, "grad_norm": 1.375, "learning_rate": 0.00046681606392573975, "loss": 6.1736, "mean_token_accuracy": 0.13607601448893547, "num_tokens": 37185339.0, "step": 17185 }, { "entropy": 6.572753381729126, "epoch": 1.8395312750815989, "grad_norm": 1.578125, "learning_rate": 0.0004667960765264454, "loss": 6.2672, "mean_token_accuracy": 0.1362226776778698, "num_tokens": 37195145.0, "step": 17190 }, { "entropy": 6.537802410125733, "epoch": 1.8400663491893627, "grad_norm": 2.109375, "learning_rate": 0.0004667760835890662, "loss": 6.2779, "mean_token_accuracy": 0.13509466499090195, "num_tokens": 37206454.0, "step": 17195 }, { "entropy": 6.481271600723266, "epoch": 1.8406014232971266, "grad_norm": 1.640625, "learning_rate": 0.00046675608511417957, "loss": 6.1878, "mean_token_accuracy": 0.14024367779493332, "num_tokens": 37216646.0, "step": 17200 }, { "entropy": 6.436294937133789, "epoch": 1.8411364974048907, "grad_norm": 1.65625, "learning_rate": 0.00046673608110236293, "loss": 6.1472, "mean_token_accuracy": 0.14751357436180115, "num_tokens": 37227368.0, "step": 17205 }, { "entropy": 6.5536376476287845, "epoch": 1.8416715715126544, "grad_norm": 1.5546875, "learning_rate": 0.0004667160715541939, "loss": 6.2645, "mean_token_accuracy": 0.13471471667289733, "num_tokens": 37238150.0, "step": 17210 }, { "entropy": 6.509008359909058, "epoch": 1.8422066456204185, "grad_norm": 1.6640625, "learning_rate": 0.00046669605647025014, "loss": 6.2161, "mean_token_accuracy": 0.13703424036502837, "num_tokens": 37249534.0, "step": 17215 }, { "entropy": 6.5630042552948, "epoch": 1.8427417197281823, "grad_norm": 1.3046875, "learning_rate": 0.0004666760358511098, "loss": 6.2997, "mean_token_accuracy": 0.1386088714003563, "num_tokens": 37260633.0, "step": 17220 }, { "entropy": 6.573452997207641, "epoch": 1.8432767938359462, "grad_norm": 1.484375, "learning_rate": 0.00046665600969735086, "loss": 6.2714, "mean_token_accuracy": 0.13207167088985444, "num_tokens": 37271978.0, "step": 17225 }, { "entropy": 6.4870954036712645, "epoch": 1.8438118679437103, "grad_norm": 2.0625, "learning_rate": 0.0004666359780095515, "loss": 6.1157, "mean_token_accuracy": 0.14051857218146324, "num_tokens": 37284130.0, "step": 17230 }, { "entropy": 6.54051194190979, "epoch": 1.844346942051474, "grad_norm": 1.46875, "learning_rate": 0.0004666159407882902, "loss": 6.2914, "mean_token_accuracy": 0.1303947575390339, "num_tokens": 37295648.0, "step": 17235 }, { "entropy": 6.5121325016021725, "epoch": 1.844882016159238, "grad_norm": 1.5234375, "learning_rate": 0.0004665958980341456, "loss": 6.258, "mean_token_accuracy": 0.13691130727529527, "num_tokens": 37306715.0, "step": 17240 }, { "entropy": 6.534123659133911, "epoch": 1.845417090267002, "grad_norm": 1.65625, "learning_rate": 0.00046657584974769636, "loss": 6.2708, "mean_token_accuracy": 0.13898625373840331, "num_tokens": 37317605.0, "step": 17245 }, { "entropy": 6.527424573898315, "epoch": 1.8459521643747658, "grad_norm": 1.53125, "learning_rate": 0.0004665557959295213, "loss": 6.1895, "mean_token_accuracy": 0.14265326410531998, "num_tokens": 37328898.0, "step": 17250 }, { "entropy": 6.477344179153443, "epoch": 1.84648723848253, "grad_norm": 1.375, "learning_rate": 0.00046653573658019963, "loss": 6.1724, "mean_token_accuracy": 0.1402975931763649, "num_tokens": 37340108.0, "step": 17255 }, { "entropy": 6.543744611740112, "epoch": 1.8470223125902936, "grad_norm": 1.3359375, "learning_rate": 0.00046651567170031053, "loss": 6.2914, "mean_token_accuracy": 0.13802868351340294, "num_tokens": 37351773.0, "step": 17260 }, { "entropy": 6.494388151168823, "epoch": 1.8475573866980577, "grad_norm": 1.6328125, "learning_rate": 0.0004664956012904332, "loss": 6.215, "mean_token_accuracy": 0.13731587156653405, "num_tokens": 37362748.0, "step": 17265 }, { "entropy": 6.510460567474365, "epoch": 1.8480924608058216, "grad_norm": 1.5703125, "learning_rate": 0.0004664755253511474, "loss": 6.3006, "mean_token_accuracy": 0.13541723787784576, "num_tokens": 37373487.0, "step": 17270 }, { "entropy": 6.5544881343841555, "epoch": 1.8486275349135854, "grad_norm": 2.109375, "learning_rate": 0.0004664554438830326, "loss": 6.1428, "mean_token_accuracy": 0.13703005909919738, "num_tokens": 37383302.0, "step": 17275 }, { "entropy": 6.565484619140625, "epoch": 1.8491626090213495, "grad_norm": 1.9921875, "learning_rate": 0.0004664353568866689, "loss": 6.1759, "mean_token_accuracy": 0.13908227831125258, "num_tokens": 37393085.0, "step": 17280 }, { "entropy": 6.562853622436523, "epoch": 1.8496976831291134, "grad_norm": 1.4609375, "learning_rate": 0.000466415264362636, "loss": 6.2485, "mean_token_accuracy": 0.13739827275276184, "num_tokens": 37403774.0, "step": 17285 }, { "entropy": 6.544837522506714, "epoch": 1.8502327572368773, "grad_norm": 1.359375, "learning_rate": 0.00046639516631151435, "loss": 6.2261, "mean_token_accuracy": 0.14629105776548385, "num_tokens": 37414356.0, "step": 17290 }, { "entropy": 6.481632375717163, "epoch": 1.8507678313446412, "grad_norm": 2.359375, "learning_rate": 0.00046637506273388416, "loss": 6.2689, "mean_token_accuracy": 0.1359451398253441, "num_tokens": 37426381.0, "step": 17295 }, { "entropy": 6.522068500518799, "epoch": 1.851302905452405, "grad_norm": 1.765625, "learning_rate": 0.00046635495363032595, "loss": 6.2128, "mean_token_accuracy": 0.13729588389396669, "num_tokens": 37436259.0, "step": 17300 }, { "entropy": 6.532771444320678, "epoch": 1.8518379795601692, "grad_norm": 2.34375, "learning_rate": 0.00046633483900142026, "loss": 6.1925, "mean_token_accuracy": 0.1430345170199871, "num_tokens": 37447498.0, "step": 17305 }, { "entropy": 6.483018445968628, "epoch": 1.852373053667933, "grad_norm": 1.6484375, "learning_rate": 0.000466314718847748, "loss": 6.1869, "mean_token_accuracy": 0.14144012928009034, "num_tokens": 37457323.0, "step": 17310 }, { "entropy": 6.470933246612549, "epoch": 1.852908127775697, "grad_norm": 1.40625, "learning_rate": 0.0004662945931698901, "loss": 6.2246, "mean_token_accuracy": 0.1384797491133213, "num_tokens": 37468121.0, "step": 17315 }, { "entropy": 6.515081596374512, "epoch": 1.853443201883461, "grad_norm": 1.828125, "learning_rate": 0.00046627446196842784, "loss": 6.2497, "mean_token_accuracy": 0.1317722588777542, "num_tokens": 37479205.0, "step": 17320 }, { "entropy": 6.556810903549194, "epoch": 1.8539782759912247, "grad_norm": 1.546875, "learning_rate": 0.0004662543252439422, "loss": 6.3526, "mean_token_accuracy": 0.13010217621922493, "num_tokens": 37491015.0, "step": 17325 }, { "entropy": 6.579596424102784, "epoch": 1.8545133500989888, "grad_norm": 1.453125, "learning_rate": 0.00046623418299701494, "loss": 6.2675, "mean_token_accuracy": 0.13135558143258094, "num_tokens": 37503078.0, "step": 17330 }, { "entropy": 6.5604668140411375, "epoch": 1.8550484242067526, "grad_norm": 2.265625, "learning_rate": 0.0004662140352282274, "loss": 6.2443, "mean_token_accuracy": 0.1412036180496216, "num_tokens": 37514623.0, "step": 17335 }, { "entropy": 6.501449155807495, "epoch": 1.8555834983145165, "grad_norm": 1.9765625, "learning_rate": 0.00046619388193816155, "loss": 6.1845, "mean_token_accuracy": 0.13932041376829146, "num_tokens": 37525618.0, "step": 17340 }, { "entropy": 6.5468672752380375, "epoch": 1.8561185724222806, "grad_norm": 1.3359375, "learning_rate": 0.00046617372312739917, "loss": 6.2607, "mean_token_accuracy": 0.14140139073133468, "num_tokens": 37536023.0, "step": 17345 }, { "entropy": 6.581799411773682, "epoch": 1.8566536465300443, "grad_norm": 1.953125, "learning_rate": 0.0004661535587965224, "loss": 6.26, "mean_token_accuracy": 0.1331052377820015, "num_tokens": 37545886.0, "step": 17350 }, { "entropy": 6.489939403533936, "epoch": 1.8571887206378084, "grad_norm": 1.4921875, "learning_rate": 0.00046613338894611347, "loss": 6.1817, "mean_token_accuracy": 0.13516911789774894, "num_tokens": 37557587.0, "step": 17355 }, { "entropy": 6.430360794067383, "epoch": 1.8577237947455723, "grad_norm": 1.7265625, "learning_rate": 0.0004661132135767548, "loss": 6.1246, "mean_token_accuracy": 0.15580250471830367, "num_tokens": 37569379.0, "step": 17360 }, { "entropy": 6.574359893798828, "epoch": 1.8582588688533361, "grad_norm": 2.015625, "learning_rate": 0.000466093032689029, "loss": 6.2939, "mean_token_accuracy": 0.13142267763614654, "num_tokens": 37580478.0, "step": 17365 }, { "entropy": 6.483245992660523, "epoch": 1.8587939429611002, "grad_norm": 1.671875, "learning_rate": 0.0004660728462835187, "loss": 6.2211, "mean_token_accuracy": 0.14082368835806847, "num_tokens": 37591506.0, "step": 17370 }, { "entropy": 6.4595136642456055, "epoch": 1.8593290170688639, "grad_norm": 1.6171875, "learning_rate": 0.0004660526543608068, "loss": 6.0688, "mean_token_accuracy": 0.15273035317659378, "num_tokens": 37602074.0, "step": 17375 }, { "entropy": 6.5289915084838865, "epoch": 1.859864091176628, "grad_norm": 1.609375, "learning_rate": 0.0004660324569214763, "loss": 6.2628, "mean_token_accuracy": 0.1343717895448208, "num_tokens": 37612180.0, "step": 17380 }, { "entropy": 6.513068914413452, "epoch": 1.8603991652843919, "grad_norm": 1.5078125, "learning_rate": 0.0004660122539661106, "loss": 6.2351, "mean_token_accuracy": 0.14054446592926978, "num_tokens": 37622588.0, "step": 17385 }, { "entropy": 6.5763421058654785, "epoch": 1.8609342393921557, "grad_norm": 2.15625, "learning_rate": 0.0004659920454952928, "loss": 6.2204, "mean_token_accuracy": 0.14042455777525903, "num_tokens": 37634323.0, "step": 17390 }, { "entropy": 6.562207317352295, "epoch": 1.8614693134999198, "grad_norm": 1.8828125, "learning_rate": 0.0004659718315096065, "loss": 6.2767, "mean_token_accuracy": 0.13324531316757202, "num_tokens": 37645816.0, "step": 17395 }, { "entropy": 6.585940647125244, "epoch": 1.8620043876076835, "grad_norm": 1.7578125, "learning_rate": 0.00046595161200963545, "loss": 6.2841, "mean_token_accuracy": 0.13371996730566024, "num_tokens": 37656143.0, "step": 17400 }, { "entropy": 6.513905477523804, "epoch": 1.8625394617154476, "grad_norm": 2.578125, "learning_rate": 0.00046593138699596343, "loss": 6.1746, "mean_token_accuracy": 0.13611202463507652, "num_tokens": 37665959.0, "step": 17405 }, { "entropy": 6.486093330383301, "epoch": 1.8630745358232115, "grad_norm": 2.171875, "learning_rate": 0.00046591115646917443, "loss": 6.2345, "mean_token_accuracy": 0.13548298478126525, "num_tokens": 37677176.0, "step": 17410 }, { "entropy": 6.472007322311401, "epoch": 1.8636096099309754, "grad_norm": 2.109375, "learning_rate": 0.0004658909204298526, "loss": 6.2539, "mean_token_accuracy": 0.14066635966300964, "num_tokens": 37687740.0, "step": 17415 }, { "entropy": 6.482980394363404, "epoch": 1.8641446840387395, "grad_norm": 2.328125, "learning_rate": 0.0004658706788785823, "loss": 6.1911, "mean_token_accuracy": 0.14265646263957024, "num_tokens": 37698536.0, "step": 17420 }, { "entropy": 6.552716970443726, "epoch": 1.8646797581465033, "grad_norm": 1.75, "learning_rate": 0.00046585043181594793, "loss": 6.2199, "mean_token_accuracy": 0.14157683700323104, "num_tokens": 37708795.0, "step": 17425 }, { "entropy": 6.550864553451538, "epoch": 1.8652148322542672, "grad_norm": 1.640625, "learning_rate": 0.00046583017924253426, "loss": 6.2352, "mean_token_accuracy": 0.14017075598239898, "num_tokens": 37719136.0, "step": 17430 }, { "entropy": 6.603561115264893, "epoch": 1.8657499063620313, "grad_norm": 2.1875, "learning_rate": 0.0004658099211589259, "loss": 6.3101, "mean_token_accuracy": 0.13327914327383042, "num_tokens": 37730513.0, "step": 17435 }, { "entropy": 6.459116220474243, "epoch": 1.866284980469795, "grad_norm": 6.0625, "learning_rate": 0.00046578965756570787, "loss": 6.2347, "mean_token_accuracy": 0.13692908883094787, "num_tokens": 37741811.0, "step": 17440 }, { "entropy": 6.429191589355469, "epoch": 1.866820054577559, "grad_norm": 1.578125, "learning_rate": 0.00046576938846346527, "loss": 6.0706, "mean_token_accuracy": 0.14636265933513642, "num_tokens": 37752213.0, "step": 17445 }, { "entropy": 6.444896173477173, "epoch": 1.867355128685323, "grad_norm": 1.8359375, "learning_rate": 0.00046574911385278343, "loss": 6.0547, "mean_token_accuracy": 0.15159211903810502, "num_tokens": 37763253.0, "step": 17450 }, { "entropy": 6.566773557662964, "epoch": 1.8678902027930868, "grad_norm": 1.6015625, "learning_rate": 0.00046572883373424776, "loss": 6.2701, "mean_token_accuracy": 0.13228057101368904, "num_tokens": 37775087.0, "step": 17455 }, { "entropy": 6.56617431640625, "epoch": 1.868425276900851, "grad_norm": 2.21875, "learning_rate": 0.00046570854810844373, "loss": 6.2554, "mean_token_accuracy": 0.13026925027370453, "num_tokens": 37786119.0, "step": 17460 }, { "entropy": 6.5158192157745365, "epoch": 1.8689603510086146, "grad_norm": 3.1875, "learning_rate": 0.00046568825697595724, "loss": 6.2618, "mean_token_accuracy": 0.13482827097177505, "num_tokens": 37797482.0, "step": 17465 }, { "entropy": 6.523220825195312, "epoch": 1.8694954251163787, "grad_norm": 2.171875, "learning_rate": 0.0004656679603373741, "loss": 6.1945, "mean_token_accuracy": 0.13488890826702118, "num_tokens": 37808067.0, "step": 17470 }, { "entropy": 6.5920967102050785, "epoch": 1.8700304992241426, "grad_norm": 1.7265625, "learning_rate": 0.0004656476581932804, "loss": 6.3458, "mean_token_accuracy": 0.1309550918638706, "num_tokens": 37819762.0, "step": 17475 }, { "entropy": 6.509218740463257, "epoch": 1.8705655733319064, "grad_norm": 1.3125, "learning_rate": 0.0004656273505442624, "loss": 6.2132, "mean_token_accuracy": 0.14369545131921768, "num_tokens": 37829510.0, "step": 17480 }, { "entropy": 6.510902166366577, "epoch": 1.8711006474396705, "grad_norm": 2.015625, "learning_rate": 0.00046560703739090633, "loss": 6.283, "mean_token_accuracy": 0.1339593842625618, "num_tokens": 37839431.0, "step": 17485 }, { "entropy": 6.596603298187256, "epoch": 1.8716357215474342, "grad_norm": 1.5390625, "learning_rate": 0.00046558671873379886, "loss": 6.2963, "mean_token_accuracy": 0.1272880144417286, "num_tokens": 37850531.0, "step": 17490 }, { "entropy": 6.636654281616211, "epoch": 1.8721707956551983, "grad_norm": 1.515625, "learning_rate": 0.0004655663945735268, "loss": 6.3059, "mean_token_accuracy": 0.12858284413814544, "num_tokens": 37861964.0, "step": 17495 }, { "entropy": 6.4125974655151365, "epoch": 1.8727058697629622, "grad_norm": 1.5234375, "learning_rate": 0.0004655460649106768, "loss": 6.0291, "mean_token_accuracy": 0.15219689756631852, "num_tokens": 37873598.0, "step": 17500 }, { "entropy": 6.521950435638428, "epoch": 1.873240943870726, "grad_norm": 2.140625, "learning_rate": 0.00046552572974583597, "loss": 6.2854, "mean_token_accuracy": 0.13302481919527054, "num_tokens": 37884643.0, "step": 17505 }, { "entropy": 6.507148408889771, "epoch": 1.8737760179784901, "grad_norm": 1.96875, "learning_rate": 0.0004655053890795914, "loss": 6.2672, "mean_token_accuracy": 0.13397427871823311, "num_tokens": 37896566.0, "step": 17510 }, { "entropy": 6.59088625907898, "epoch": 1.8743110920862538, "grad_norm": 1.890625, "learning_rate": 0.00046548504291253054, "loss": 6.3087, "mean_token_accuracy": 0.13231249898672104, "num_tokens": 37907424.0, "step": 17515 }, { "entropy": 6.588667011260986, "epoch": 1.874846166194018, "grad_norm": 2.171875, "learning_rate": 0.0004654646912452408, "loss": 6.2393, "mean_token_accuracy": 0.14179185181856155, "num_tokens": 37917318.0, "step": 17520 }, { "entropy": 6.510469579696656, "epoch": 1.8753812403017818, "grad_norm": 2.015625, "learning_rate": 0.0004654443340783099, "loss": 6.2011, "mean_token_accuracy": 0.1401626721024513, "num_tokens": 37928521.0, "step": 17525 }, { "entropy": 6.499540185928344, "epoch": 1.8759163144095456, "grad_norm": 1.765625, "learning_rate": 0.00046542397141232554, "loss": 6.2778, "mean_token_accuracy": 0.1372986279428005, "num_tokens": 37939930.0, "step": 17530 }, { "entropy": 6.504684114456177, "epoch": 1.8764513885173097, "grad_norm": 1.6015625, "learning_rate": 0.0004654036032478759, "loss": 6.1869, "mean_token_accuracy": 0.14108899012207984, "num_tokens": 37949690.0, "step": 17535 }, { "entropy": 6.546181392669678, "epoch": 1.8769864626250736, "grad_norm": 1.9453125, "learning_rate": 0.00046538322958554885, "loss": 6.212, "mean_token_accuracy": 0.14192006289958953, "num_tokens": 37962162.0, "step": 17540 }, { "entropy": 6.594173574447632, "epoch": 1.8775215367328375, "grad_norm": 1.5078125, "learning_rate": 0.0004653628504259329, "loss": 6.2469, "mean_token_accuracy": 0.13679970055818558, "num_tokens": 37972707.0, "step": 17545 }, { "entropy": 6.458856296539307, "epoch": 1.8780566108406014, "grad_norm": 1.5078125, "learning_rate": 0.00046534246576961633, "loss": 6.1646, "mean_token_accuracy": 0.1458908274769783, "num_tokens": 37983101.0, "step": 17550 }, { "entropy": 6.422877454757691, "epoch": 1.8785916849483653, "grad_norm": 1.6953125, "learning_rate": 0.00046532207561718775, "loss": 6.139, "mean_token_accuracy": 0.14392440170049667, "num_tokens": 37994025.0, "step": 17555 }, { "entropy": 6.521886825561523, "epoch": 1.8791267590561294, "grad_norm": 1.4921875, "learning_rate": 0.00046530167996923613, "loss": 6.2433, "mean_token_accuracy": 0.13209235221147536, "num_tokens": 38004761.0, "step": 17560 }, { "entropy": 6.573818874359131, "epoch": 1.8796618331638932, "grad_norm": 1.6953125, "learning_rate": 0.0004652812788263501, "loss": 6.2461, "mean_token_accuracy": 0.13844591975212098, "num_tokens": 38015129.0, "step": 17565 }, { "entropy": 6.533925724029541, "epoch": 1.8801969072716571, "grad_norm": 1.453125, "learning_rate": 0.00046526087218911894, "loss": 6.2316, "mean_token_accuracy": 0.14329466223716736, "num_tokens": 38025501.0, "step": 17570 }, { "entropy": 6.5236128807067875, "epoch": 1.8807319813794212, "grad_norm": 1.6484375, "learning_rate": 0.00046524046005813185, "loss": 6.2105, "mean_token_accuracy": 0.13993176072835922, "num_tokens": 38034912.0, "step": 17575 }, { "entropy": 6.475555276870727, "epoch": 1.8812670554871849, "grad_norm": 1.28125, "learning_rate": 0.0004652200424339782, "loss": 6.1574, "mean_token_accuracy": 0.140637881308794, "num_tokens": 38045417.0, "step": 17580 }, { "entropy": 6.520765924453736, "epoch": 1.881802129594949, "grad_norm": 1.578125, "learning_rate": 0.0004651996193172475, "loss": 6.2945, "mean_token_accuracy": 0.1352642834186554, "num_tokens": 38057033.0, "step": 17585 }, { "entropy": 6.551823234558105, "epoch": 1.8823372037027128, "grad_norm": 1.40625, "learning_rate": 0.0004651791907085296, "loss": 6.2297, "mean_token_accuracy": 0.13857173919677734, "num_tokens": 38067804.0, "step": 17590 }, { "entropy": 6.541230058670044, "epoch": 1.8828722778104767, "grad_norm": 1.578125, "learning_rate": 0.0004651587566084143, "loss": 6.2188, "mean_token_accuracy": 0.1486022040247917, "num_tokens": 38079246.0, "step": 17595 }, { "entropy": 6.541295862197876, "epoch": 1.8834073519182408, "grad_norm": 1.609375, "learning_rate": 0.00046513831701749155, "loss": 6.3613, "mean_token_accuracy": 0.13094632104039192, "num_tokens": 38090628.0, "step": 17600 }, { "entropy": 6.515250587463379, "epoch": 1.8839424260260045, "grad_norm": 1.59375, "learning_rate": 0.00046511787193635165, "loss": 6.1465, "mean_token_accuracy": 0.14270028993487358, "num_tokens": 38100848.0, "step": 17605 }, { "entropy": 6.606397533416748, "epoch": 1.8844775001337686, "grad_norm": 1.375, "learning_rate": 0.00046509742136558493, "loss": 6.1929, "mean_token_accuracy": 0.1411973714828491, "num_tokens": 38110732.0, "step": 17610 }, { "entropy": 6.4958351135253904, "epoch": 1.8850125742415325, "grad_norm": 2.328125, "learning_rate": 0.00046507696530578185, "loss": 6.1807, "mean_token_accuracy": 0.14429498165845872, "num_tokens": 38121002.0, "step": 17615 }, { "entropy": 6.504161643981933, "epoch": 1.8855476483492963, "grad_norm": 1.4609375, "learning_rate": 0.0004650565037575331, "loss": 6.2381, "mean_token_accuracy": 0.1369054652750492, "num_tokens": 38132294.0, "step": 17620 }, { "entropy": 6.4798229217529295, "epoch": 1.8860827224570604, "grad_norm": 1.71875, "learning_rate": 0.00046503603672142955, "loss": 6.1406, "mean_token_accuracy": 0.1413409121334553, "num_tokens": 38142962.0, "step": 17625 }, { "entropy": 6.5535815238952635, "epoch": 1.886617796564824, "grad_norm": 1.6015625, "learning_rate": 0.0004650155641980621, "loss": 6.262, "mean_token_accuracy": 0.14034836292266845, "num_tokens": 38153737.0, "step": 17630 }, { "entropy": 6.567475128173828, "epoch": 1.8871528706725882, "grad_norm": 1.5703125, "learning_rate": 0.00046499508618802195, "loss": 6.2253, "mean_token_accuracy": 0.13480818271636963, "num_tokens": 38163897.0, "step": 17635 }, { "entropy": 6.487664747238159, "epoch": 1.887687944780352, "grad_norm": 1.671875, "learning_rate": 0.0004649746026919004, "loss": 6.1909, "mean_token_accuracy": 0.14665645807981492, "num_tokens": 38175123.0, "step": 17640 }, { "entropy": 6.484235763549805, "epoch": 1.888223018888116, "grad_norm": 1.9296875, "learning_rate": 0.00046495411371028886, "loss": 6.2169, "mean_token_accuracy": 0.14219552129507065, "num_tokens": 38186100.0, "step": 17645 }, { "entropy": 6.559158420562744, "epoch": 1.88875809299588, "grad_norm": 1.6953125, "learning_rate": 0.00046493361924377903, "loss": 6.2336, "mean_token_accuracy": 0.14047744050621985, "num_tokens": 38196385.0, "step": 17650 }, { "entropy": 6.4783586978912355, "epoch": 1.8892931671036437, "grad_norm": 1.5, "learning_rate": 0.0004649131192929626, "loss": 6.1755, "mean_token_accuracy": 0.13876958936452866, "num_tokens": 38207260.0, "step": 17655 }, { "entropy": 6.45147476196289, "epoch": 1.8898282412114078, "grad_norm": 1.6484375, "learning_rate": 0.0004648926138584315, "loss": 6.0844, "mean_token_accuracy": 0.14660956487059593, "num_tokens": 38217537.0, "step": 17660 }, { "entropy": 6.543872261047364, "epoch": 1.8903633153191717, "grad_norm": 2.375, "learning_rate": 0.00046487210294077794, "loss": 6.2185, "mean_token_accuracy": 0.13700347542762756, "num_tokens": 38228956.0, "step": 17665 }, { "entropy": 6.471927785873413, "epoch": 1.8908983894269356, "grad_norm": 1.4140625, "learning_rate": 0.00046485158654059405, "loss": 6.1452, "mean_token_accuracy": 0.14353640973567963, "num_tokens": 38240236.0, "step": 17670 }, { "entropy": 6.585081481933594, "epoch": 1.8914334635346997, "grad_norm": 1.421875, "learning_rate": 0.0004648310646584723, "loss": 6.278, "mean_token_accuracy": 0.13636186644434928, "num_tokens": 38251739.0, "step": 17675 }, { "entropy": 6.48091344833374, "epoch": 1.8919685376424635, "grad_norm": 2.421875, "learning_rate": 0.00046481053729500516, "loss": 6.2058, "mean_token_accuracy": 0.1312205635011196, "num_tokens": 38262090.0, "step": 17680 }, { "entropy": 6.503962993621826, "epoch": 1.8925036117502274, "grad_norm": 1.3984375, "learning_rate": 0.0004647900044507855, "loss": 6.221, "mean_token_accuracy": 0.1413418248295784, "num_tokens": 38272770.0, "step": 17685 }, { "entropy": 6.51068148612976, "epoch": 1.8930386858579913, "grad_norm": 1.5, "learning_rate": 0.0004647694661264061, "loss": 6.18, "mean_token_accuracy": 0.1368080921471119, "num_tokens": 38283449.0, "step": 17690 }, { "entropy": 6.534865188598633, "epoch": 1.8935737599657552, "grad_norm": 1.5703125, "learning_rate": 0.00046474892232246, "loss": 6.2303, "mean_token_accuracy": 0.13847722858190536, "num_tokens": 38293831.0, "step": 17695 }, { "entropy": 6.489880561828613, "epoch": 1.8941088340735193, "grad_norm": 2.25, "learning_rate": 0.00046472837303954053, "loss": 6.1643, "mean_token_accuracy": 0.13979624956846237, "num_tokens": 38304782.0, "step": 17700 }, { "entropy": 6.508448696136474, "epoch": 1.8946439081812831, "grad_norm": 2.609375, "learning_rate": 0.00046470781827824087, "loss": 6.2338, "mean_token_accuracy": 0.14288853406906127, "num_tokens": 38316547.0, "step": 17705 }, { "entropy": 6.580143833160401, "epoch": 1.895178982289047, "grad_norm": 1.5234375, "learning_rate": 0.00046468725803915464, "loss": 6.272, "mean_token_accuracy": 0.13468163907527925, "num_tokens": 38329488.0, "step": 17710 }, { "entropy": 6.461695432662964, "epoch": 1.8957140563968111, "grad_norm": 1.6015625, "learning_rate": 0.00046466669232287543, "loss": 6.0977, "mean_token_accuracy": 0.1440846249461174, "num_tokens": 38341290.0, "step": 17715 }, { "entropy": 6.52875862121582, "epoch": 1.8962491305045748, "grad_norm": 1.3828125, "learning_rate": 0.0004646461211299973, "loss": 6.2466, "mean_token_accuracy": 0.13937623724341391, "num_tokens": 38352445.0, "step": 17720 }, { "entropy": 6.528347730636597, "epoch": 1.8967842046123389, "grad_norm": 1.34375, "learning_rate": 0.0004646255444611139, "loss": 6.236, "mean_token_accuracy": 0.1415594771504402, "num_tokens": 38363825.0, "step": 17725 }, { "entropy": 6.49668550491333, "epoch": 1.8973192787201028, "grad_norm": 1.7734375, "learning_rate": 0.00046460496231681957, "loss": 6.31, "mean_token_accuracy": 0.13838377743959426, "num_tokens": 38375454.0, "step": 17730 }, { "entropy": 6.4484857559204105, "epoch": 1.8978543528278666, "grad_norm": 1.484375, "learning_rate": 0.00046458437469770866, "loss": 6.2497, "mean_token_accuracy": 0.1398676410317421, "num_tokens": 38385938.0, "step": 17735 }, { "entropy": 6.540100574493408, "epoch": 1.8983894269356307, "grad_norm": 1.625, "learning_rate": 0.00046456378160437555, "loss": 6.1708, "mean_token_accuracy": 0.14353546053171157, "num_tokens": 38396143.0, "step": 17740 }, { "entropy": 6.488660621643066, "epoch": 1.8989245010433944, "grad_norm": 1.7109375, "learning_rate": 0.0004645431830374149, "loss": 6.2618, "mean_token_accuracy": 0.12918649911880492, "num_tokens": 38407445.0, "step": 17745 }, { "entropy": 6.5336669921875, "epoch": 1.8994595751511585, "grad_norm": 1.40625, "learning_rate": 0.00046452257899742144, "loss": 6.2961, "mean_token_accuracy": 0.12962775230407714, "num_tokens": 38418438.0, "step": 17750 }, { "entropy": 6.467654991149902, "epoch": 1.8999946492589224, "grad_norm": 1.5234375, "learning_rate": 0.00046450196948499015, "loss": 6.143, "mean_token_accuracy": 0.13833793625235558, "num_tokens": 38428821.0, "step": 17755 }, { "entropy": 6.498792219161987, "epoch": 1.9005297233666862, "grad_norm": 1.4609375, "learning_rate": 0.0004644813545007161, "loss": 6.1544, "mean_token_accuracy": 0.13901732116937637, "num_tokens": 38439560.0, "step": 17760 }, { "entropy": 6.54771318435669, "epoch": 1.9010647974744503, "grad_norm": 1.5859375, "learning_rate": 0.0004644607340451946, "loss": 6.2406, "mean_token_accuracy": 0.1394535258412361, "num_tokens": 38449724.0, "step": 17765 }, { "entropy": 6.517421054840088, "epoch": 1.901599871582214, "grad_norm": 1.515625, "learning_rate": 0.00046444010811902105, "loss": 6.1717, "mean_token_accuracy": 0.14054683744907379, "num_tokens": 38459833.0, "step": 17770 }, { "entropy": 6.449574708938599, "epoch": 1.902134945689978, "grad_norm": 1.5859375, "learning_rate": 0.00046441947672279095, "loss": 6.1987, "mean_token_accuracy": 0.14699629992246627, "num_tokens": 38470682.0, "step": 17775 }, { "entropy": 6.484740591049194, "epoch": 1.902670019797742, "grad_norm": 1.75, "learning_rate": 0.0004643988398571001, "loss": 6.2184, "mean_token_accuracy": 0.13642918542027474, "num_tokens": 38481362.0, "step": 17780 }, { "entropy": 6.52804388999939, "epoch": 1.9032050939055059, "grad_norm": 1.2734375, "learning_rate": 0.0004643781975225444, "loss": 6.1884, "mean_token_accuracy": 0.14055032059550285, "num_tokens": 38492941.0, "step": 17785 }, { "entropy": 6.583075475692749, "epoch": 1.90374016801327, "grad_norm": 1.6796875, "learning_rate": 0.00046435754971971976, "loss": 6.2249, "mean_token_accuracy": 0.1341730184853077, "num_tokens": 38503823.0, "step": 17790 }, { "entropy": 6.473573112487793, "epoch": 1.9042752421210336, "grad_norm": 1.8125, "learning_rate": 0.00046433689644922256, "loss": 6.139, "mean_token_accuracy": 0.14910909831523894, "num_tokens": 38514482.0, "step": 17795 }, { "entropy": 6.472933340072632, "epoch": 1.9048103162287977, "grad_norm": 1.453125, "learning_rate": 0.00046431623771164897, "loss": 6.2275, "mean_token_accuracy": 0.13971884027123452, "num_tokens": 38525580.0, "step": 17800 }, { "entropy": 6.449027681350708, "epoch": 1.9053453903365616, "grad_norm": 1.53125, "learning_rate": 0.0004642955735075958, "loss": 6.2204, "mean_token_accuracy": 0.1396370619535446, "num_tokens": 38537025.0, "step": 17805 }, { "entropy": 6.487132024765015, "epoch": 1.9058804644443255, "grad_norm": 1.6796875, "learning_rate": 0.00046427490383765943, "loss": 6.2076, "mean_token_accuracy": 0.14065134525299072, "num_tokens": 38548974.0, "step": 17810 }, { "entropy": 6.4658825397491455, "epoch": 1.9064155385520896, "grad_norm": 1.375, "learning_rate": 0.0004642542287024368, "loss": 6.1266, "mean_token_accuracy": 0.14220650643110275, "num_tokens": 38559971.0, "step": 17815 }, { "entropy": 6.4972062587738035, "epoch": 1.9069506126598534, "grad_norm": 1.5859375, "learning_rate": 0.000464233548102525, "loss": 6.1885, "mean_token_accuracy": 0.13903797119855882, "num_tokens": 38570326.0, "step": 17820 }, { "entropy": 6.4395452499389645, "epoch": 1.9074856867676173, "grad_norm": 1.40625, "learning_rate": 0.000464212862038521, "loss": 6.2024, "mean_token_accuracy": 0.1364986389875412, "num_tokens": 38580799.0, "step": 17825 }, { "entropy": 6.44638843536377, "epoch": 1.9080207608753812, "grad_norm": 1.375, "learning_rate": 0.00046419217051102223, "loss": 6.2794, "mean_token_accuracy": 0.13144152835011483, "num_tokens": 38591136.0, "step": 17830 }, { "entropy": 6.521512222290039, "epoch": 1.908555834983145, "grad_norm": 1.4375, "learning_rate": 0.0004641714735206261, "loss": 6.184, "mean_token_accuracy": 0.14119268357753753, "num_tokens": 38602600.0, "step": 17835 }, { "entropy": 6.515765047073364, "epoch": 1.9090909090909092, "grad_norm": 1.328125, "learning_rate": 0.00046415077106793024, "loss": 6.1982, "mean_token_accuracy": 0.14135203510522842, "num_tokens": 38612641.0, "step": 17840 }, { "entropy": 6.525089740753174, "epoch": 1.909625983198673, "grad_norm": 1.5, "learning_rate": 0.0004641300631535325, "loss": 6.1835, "mean_token_accuracy": 0.14011745378375054, "num_tokens": 38622873.0, "step": 17845 }, { "entropy": 6.479873371124268, "epoch": 1.910161057306437, "grad_norm": 1.8515625, "learning_rate": 0.0004641093497780307, "loss": 6.2049, "mean_token_accuracy": 0.14634738862514496, "num_tokens": 38633523.0, "step": 17850 }, { "entropy": 6.488259887695312, "epoch": 1.910696131414201, "grad_norm": 2.578125, "learning_rate": 0.0004640886309420231, "loss": 6.235, "mean_token_accuracy": 0.1308392196893692, "num_tokens": 38645635.0, "step": 17855 }, { "entropy": 6.5185023784637455, "epoch": 1.9112312055219647, "grad_norm": 1.546875, "learning_rate": 0.0004640679066461078, "loss": 6.1824, "mean_token_accuracy": 0.1497434303164482, "num_tokens": 38656293.0, "step": 17860 }, { "entropy": 6.5067955493927006, "epoch": 1.9117662796297288, "grad_norm": 2.015625, "learning_rate": 0.0004640471768908832, "loss": 6.2991, "mean_token_accuracy": 0.13123812302947044, "num_tokens": 38667307.0, "step": 17865 }, { "entropy": 6.555864238739014, "epoch": 1.9123013537374927, "grad_norm": 1.4375, "learning_rate": 0.0004640264416769481, "loss": 6.1718, "mean_token_accuracy": 0.13502105697989464, "num_tokens": 38677775.0, "step": 17870 }, { "entropy": 6.471245193481446, "epoch": 1.9128364278452565, "grad_norm": 1.90625, "learning_rate": 0.00046400570100490086, "loss": 6.2694, "mean_token_accuracy": 0.13582777678966523, "num_tokens": 38688652.0, "step": 17875 }, { "entropy": 6.500534534454346, "epoch": 1.9133715019530206, "grad_norm": 2.734375, "learning_rate": 0.00046398495487534066, "loss": 6.2256, "mean_token_accuracy": 0.13551617562770843, "num_tokens": 38698694.0, "step": 17880 }, { "entropy": 6.506363296508789, "epoch": 1.9139065760607843, "grad_norm": 1.578125, "learning_rate": 0.0004639642032888664, "loss": 6.2449, "mean_token_accuracy": 0.136919304728508, "num_tokens": 38709864.0, "step": 17885 }, { "entropy": 6.50716872215271, "epoch": 1.9144416501685484, "grad_norm": 1.3984375, "learning_rate": 0.0004639434462460774, "loss": 6.2412, "mean_token_accuracy": 0.13497220128774642, "num_tokens": 38721034.0, "step": 17890 }, { "entropy": 6.568297719955444, "epoch": 1.9149767242763123, "grad_norm": 1.734375, "learning_rate": 0.00046392268374757285, "loss": 6.2328, "mean_token_accuracy": 0.13604136258363725, "num_tokens": 38731874.0, "step": 17895 }, { "entropy": 6.487967205047608, "epoch": 1.9155117983840761, "grad_norm": 1.484375, "learning_rate": 0.0004639019157939524, "loss": 6.1748, "mean_token_accuracy": 0.14495863467454911, "num_tokens": 38742447.0, "step": 17900 }, { "entropy": 6.484689235687256, "epoch": 1.9160468724918402, "grad_norm": 2.109375, "learning_rate": 0.0004638811423858157, "loss": 6.1054, "mean_token_accuracy": 0.13880375921726226, "num_tokens": 38754117.0, "step": 17905 }, { "entropy": 6.554324913024902, "epoch": 1.916581946599604, "grad_norm": 1.4140625, "learning_rate": 0.00046386036352376255, "loss": 6.2277, "mean_token_accuracy": 0.131800340116024, "num_tokens": 38765057.0, "step": 17910 }, { "entropy": 6.493456125259399, "epoch": 1.917117020707368, "grad_norm": 1.578125, "learning_rate": 0.00046383957920839285, "loss": 6.1745, "mean_token_accuracy": 0.14344696775078775, "num_tokens": 38775938.0, "step": 17915 }, { "entropy": 6.426898050308227, "epoch": 1.9176520948151319, "grad_norm": 1.7265625, "learning_rate": 0.00046381878944030697, "loss": 6.1086, "mean_token_accuracy": 0.1440959244966507, "num_tokens": 38787013.0, "step": 17920 }, { "entropy": 6.486614990234375, "epoch": 1.9181871689228958, "grad_norm": 3.40625, "learning_rate": 0.000463797994220105, "loss": 6.1635, "mean_token_accuracy": 0.14382546991109849, "num_tokens": 38798412.0, "step": 17925 }, { "entropy": 6.483612489700318, "epoch": 1.9187222430306599, "grad_norm": 1.5703125, "learning_rate": 0.00046377719354838756, "loss": 6.2512, "mean_token_accuracy": 0.13215523809194565, "num_tokens": 38809983.0, "step": 17930 }, { "entropy": 6.530688667297364, "epoch": 1.9192573171384235, "grad_norm": 1.7734375, "learning_rate": 0.00046375638742575506, "loss": 6.2353, "mean_token_accuracy": 0.1396634139120579, "num_tokens": 38820418.0, "step": 17935 }, { "entropy": 6.560414886474609, "epoch": 1.9197923912461876, "grad_norm": 2.03125, "learning_rate": 0.0004637355758528085, "loss": 6.2265, "mean_token_accuracy": 0.14094739705324172, "num_tokens": 38831482.0, "step": 17940 }, { "entropy": 6.572238254547119, "epoch": 1.9203274653539515, "grad_norm": 1.546875, "learning_rate": 0.0004637147588301486, "loss": 6.2519, "mean_token_accuracy": 0.13170821741223335, "num_tokens": 38842110.0, "step": 17945 }, { "entropy": 6.451564836502075, "epoch": 1.9208625394617154, "grad_norm": 1.71875, "learning_rate": 0.00046369393635837657, "loss": 6.1156, "mean_token_accuracy": 0.13936901614069938, "num_tokens": 38852861.0, "step": 17950 }, { "entropy": 6.468238449096679, "epoch": 1.9213976135694795, "grad_norm": 1.671875, "learning_rate": 0.00046367310843809374, "loss": 6.2604, "mean_token_accuracy": 0.13597493693232537, "num_tokens": 38864067.0, "step": 17955 }, { "entropy": 6.567491865158081, "epoch": 1.9219326876772433, "grad_norm": 1.5390625, "learning_rate": 0.00046365227506990137, "loss": 6.2192, "mean_token_accuracy": 0.1376200519502163, "num_tokens": 38875363.0, "step": 17960 }, { "entropy": 6.594467115402222, "epoch": 1.9224677617850072, "grad_norm": 1.4140625, "learning_rate": 0.0004636314362544011, "loss": 6.2283, "mean_token_accuracy": 0.1406591974198818, "num_tokens": 38886414.0, "step": 17965 }, { "entropy": 6.539594984054565, "epoch": 1.923002835892771, "grad_norm": 1.5703125, "learning_rate": 0.00046361059199219457, "loss": 6.297, "mean_token_accuracy": 0.13197313323616983, "num_tokens": 38897708.0, "step": 17970 }, { "entropy": 6.451222896575928, "epoch": 1.923537910000535, "grad_norm": 1.6171875, "learning_rate": 0.0004635897422838837, "loss": 6.1608, "mean_token_accuracy": 0.14442215859889984, "num_tokens": 38908683.0, "step": 17975 }, { "entropy": 6.420654535293579, "epoch": 1.924072984108299, "grad_norm": 1.6171875, "learning_rate": 0.00046356888713007055, "loss": 6.1313, "mean_token_accuracy": 0.14991554766893386, "num_tokens": 38919279.0, "step": 17980 }, { "entropy": 6.555045938491821, "epoch": 1.924608058216063, "grad_norm": 1.359375, "learning_rate": 0.00046354802653135723, "loss": 6.2259, "mean_token_accuracy": 0.1369065135717392, "num_tokens": 38929353.0, "step": 17985 }, { "entropy": 6.5306110858917235, "epoch": 1.9251431323238268, "grad_norm": 1.5625, "learning_rate": 0.0004635271604883462, "loss": 6.1951, "mean_token_accuracy": 0.14035843312740326, "num_tokens": 38939296.0, "step": 17990 }, { "entropy": 6.471765947341919, "epoch": 1.925678206431591, "grad_norm": 1.75, "learning_rate": 0.00046350628900163987, "loss": 6.2031, "mean_token_accuracy": 0.13961842954158782, "num_tokens": 38950149.0, "step": 17995 }, { "entropy": 6.5483925342559814, "epoch": 1.9262132805393546, "grad_norm": 1.5, "learning_rate": 0.000463485412071841, "loss": 6.2342, "mean_token_accuracy": 0.13433675169944764, "num_tokens": 38961052.0, "step": 18000 }, { "epoch": 1.9262132805393546, "eval_entropy": 6.365103536153418, "eval_loss": 6.311902046203613, "eval_mean_token_accuracy": 0.14091309935652785, "eval_num_tokens": 38961052.0, "eval_runtime": 22.5469, "eval_samples_per_second": 1316.325, "eval_steps_per_second": 164.546, "step": 18000 }, { "entropy": 6.537387180328369, "epoch": 1.9267483546471187, "grad_norm": 1.5078125, "learning_rate": 0.00046346452969955214, "loss": 6.2505, "mean_token_accuracy": 0.13952741846442224, "num_tokens": 38972344.0, "step": 18005 }, { "entropy": 6.534369659423828, "epoch": 1.9272834287548826, "grad_norm": 1.5, "learning_rate": 0.0004634436418853767, "loss": 6.197, "mean_token_accuracy": 0.13502275794744492, "num_tokens": 38982877.0, "step": 18010 }, { "entropy": 6.489065361022949, "epoch": 1.9278185028626464, "grad_norm": 1.5, "learning_rate": 0.00046342274862991745, "loss": 6.2001, "mean_token_accuracy": 0.13976141065359116, "num_tokens": 38994322.0, "step": 18015 }, { "entropy": 6.48278956413269, "epoch": 1.9283535769704105, "grad_norm": 1.765625, "learning_rate": 0.00046340184993377793, "loss": 6.1495, "mean_token_accuracy": 0.14276184588670732, "num_tokens": 39003447.0, "step": 18020 }, { "entropy": 6.493710613250732, "epoch": 1.9288886510781742, "grad_norm": 1.390625, "learning_rate": 0.00046338094579756136, "loss": 6.2228, "mean_token_accuracy": 0.13028390035033227, "num_tokens": 39013760.0, "step": 18025 }, { "entropy": 6.380214357376099, "epoch": 1.9294237251859383, "grad_norm": 1.453125, "learning_rate": 0.00046336003622187143, "loss": 6.0133, "mean_token_accuracy": 0.15164145305752755, "num_tokens": 39025559.0, "step": 18030 }, { "entropy": 6.507640695571899, "epoch": 1.9299587992937022, "grad_norm": 1.4765625, "learning_rate": 0.000463339121207312, "loss": 6.1936, "mean_token_accuracy": 0.1387665130198002, "num_tokens": 39036004.0, "step": 18035 }, { "entropy": 6.50057692527771, "epoch": 1.930493873401466, "grad_norm": 1.4375, "learning_rate": 0.0004633182007544868, "loss": 6.2379, "mean_token_accuracy": 0.1374046929180622, "num_tokens": 39047251.0, "step": 18040 }, { "entropy": 6.521696710586548, "epoch": 1.9310289475092302, "grad_norm": 1.515625, "learning_rate": 0.00046329727486400015, "loss": 6.267, "mean_token_accuracy": 0.13776894733309747, "num_tokens": 39057255.0, "step": 18045 }, { "entropy": 6.5461184024810795, "epoch": 1.9315640216169938, "grad_norm": 1.6953125, "learning_rate": 0.0004632763435364561, "loss": 6.2587, "mean_token_accuracy": 0.1345633938908577, "num_tokens": 39068186.0, "step": 18050 }, { "entropy": 6.460474252700806, "epoch": 1.932099095724758, "grad_norm": 1.703125, "learning_rate": 0.00046325540677245907, "loss": 6.1637, "mean_token_accuracy": 0.14090655818581582, "num_tokens": 39079173.0, "step": 18055 }, { "entropy": 6.509998750686646, "epoch": 1.9326341698325218, "grad_norm": 1.8828125, "learning_rate": 0.00046323446457261365, "loss": 6.241, "mean_token_accuracy": 0.13899825662374496, "num_tokens": 39089939.0, "step": 18060 }, { "entropy": 6.483740901947021, "epoch": 1.9331692439402857, "grad_norm": 1.5234375, "learning_rate": 0.0004632135169375245, "loss": 6.2411, "mean_token_accuracy": 0.1368535950779915, "num_tokens": 39100464.0, "step": 18065 }, { "entropy": 6.590921926498413, "epoch": 1.9337043180480498, "grad_norm": 1.3515625, "learning_rate": 0.0004631925638677965, "loss": 6.186, "mean_token_accuracy": 0.1361953742802143, "num_tokens": 39111161.0, "step": 18070 }, { "entropy": 6.5673949241638185, "epoch": 1.9342393921558134, "grad_norm": 1.625, "learning_rate": 0.00046317160536403463, "loss": 6.2036, "mean_token_accuracy": 0.14538534879684448, "num_tokens": 39122469.0, "step": 18075 }, { "entropy": 6.501009321212768, "epoch": 1.9347744662635775, "grad_norm": 1.3671875, "learning_rate": 0.00046315064142684416, "loss": 6.1719, "mean_token_accuracy": 0.1420877143740654, "num_tokens": 39131871.0, "step": 18080 }, { "entropy": 6.536379814147949, "epoch": 1.9353095403713414, "grad_norm": 1.3515625, "learning_rate": 0.0004631296720568304, "loss": 6.2211, "mean_token_accuracy": 0.13578182831406593, "num_tokens": 39143061.0, "step": 18085 }, { "entropy": 6.519476127624512, "epoch": 1.9358446144791053, "grad_norm": 1.515625, "learning_rate": 0.0004631086972545987, "loss": 6.2104, "mean_token_accuracy": 0.14594390690326692, "num_tokens": 39152452.0, "step": 18090 }, { "entropy": 6.481864023208618, "epoch": 1.9363796885868694, "grad_norm": 1.6953125, "learning_rate": 0.0004630877170207548, "loss": 6.168, "mean_token_accuracy": 0.14349544048309326, "num_tokens": 39163196.0, "step": 18095 }, { "entropy": 6.444577312469482, "epoch": 1.9369147626946333, "grad_norm": 1.4765625, "learning_rate": 0.0004630667313559045, "loss": 6.1546, "mean_token_accuracy": 0.13424062207341195, "num_tokens": 39173958.0, "step": 18100 }, { "entropy": 6.509752082824707, "epoch": 1.9374498368023971, "grad_norm": 1.4453125, "learning_rate": 0.00046304574026065376, "loss": 6.18, "mean_token_accuracy": 0.14818471521139145, "num_tokens": 39184483.0, "step": 18105 }, { "entropy": 6.464862442016601, "epoch": 1.937984910910161, "grad_norm": 1.3828125, "learning_rate": 0.0004630247437356087, "loss": 6.2379, "mean_token_accuracy": 0.13587528467178345, "num_tokens": 39196500.0, "step": 18110 }, { "entropy": 6.581671142578125, "epoch": 1.9385199850179249, "grad_norm": 1.3203125, "learning_rate": 0.00046300374178137566, "loss": 6.2811, "mean_token_accuracy": 0.13231036737561225, "num_tokens": 39207492.0, "step": 18115 }, { "entropy": 6.606667470932007, "epoch": 1.939055059125689, "grad_norm": 1.4375, "learning_rate": 0.0004629827343985609, "loss": 6.2132, "mean_token_accuracy": 0.1399967424571514, "num_tokens": 39218204.0, "step": 18120 }, { "entropy": 6.5478047847747805, "epoch": 1.9395901332334529, "grad_norm": 1.484375, "learning_rate": 0.00046296172158777116, "loss": 6.2639, "mean_token_accuracy": 0.13208532631397246, "num_tokens": 39229646.0, "step": 18125 }, { "entropy": 6.482489490509034, "epoch": 1.9401252073412167, "grad_norm": 1.5078125, "learning_rate": 0.0004629407033496131, "loss": 6.1818, "mean_token_accuracy": 0.1369784414768219, "num_tokens": 39240151.0, "step": 18130 }, { "entropy": 6.533039617538452, "epoch": 1.9406602814489808, "grad_norm": 1.421875, "learning_rate": 0.0004629196796846936, "loss": 6.2495, "mean_token_accuracy": 0.14209898710250854, "num_tokens": 39251571.0, "step": 18135 }, { "entropy": 6.579952049255371, "epoch": 1.9411953555567445, "grad_norm": 1.84375, "learning_rate": 0.00046289865059361983, "loss": 6.2067, "mean_token_accuracy": 0.13832592815160752, "num_tokens": 39262937.0, "step": 18140 }, { "entropy": 6.596141672134399, "epoch": 1.9417304296645086, "grad_norm": 1.6328125, "learning_rate": 0.00046287761607699887, "loss": 6.2854, "mean_token_accuracy": 0.1336644783616066, "num_tokens": 39274354.0, "step": 18145 }, { "entropy": 6.532996129989624, "epoch": 1.9422655037722725, "grad_norm": 1.4375, "learning_rate": 0.0004628565761354382, "loss": 6.1685, "mean_token_accuracy": 0.1417832262814045, "num_tokens": 39284314.0, "step": 18150 }, { "entropy": 6.474736070632934, "epoch": 1.9428005778800364, "grad_norm": 2.0625, "learning_rate": 0.00046283553076954527, "loss": 6.1918, "mean_token_accuracy": 0.13891778364777566, "num_tokens": 39295516.0, "step": 18155 }, { "entropy": 6.522478151321411, "epoch": 1.9433356519878004, "grad_norm": 1.1875, "learning_rate": 0.0004628144799799277, "loss": 6.2081, "mean_token_accuracy": 0.13308093473315238, "num_tokens": 39307221.0, "step": 18160 }, { "entropy": 6.490683937072754, "epoch": 1.943870726095564, "grad_norm": 1.65625, "learning_rate": 0.0004627934237671935, "loss": 6.2232, "mean_token_accuracy": 0.13667370676994323, "num_tokens": 39318448.0, "step": 18165 }, { "entropy": 6.452537965774536, "epoch": 1.9444058002033282, "grad_norm": 1.4453125, "learning_rate": 0.00046277236213195064, "loss": 6.134, "mean_token_accuracy": 0.14521567970514299, "num_tokens": 39329384.0, "step": 18170 }, { "entropy": 6.541502904891968, "epoch": 1.944940874311092, "grad_norm": 1.25, "learning_rate": 0.00046275129507480705, "loss": 6.2554, "mean_token_accuracy": 0.1390232525765896, "num_tokens": 39340342.0, "step": 18175 }, { "entropy": 6.410711622238159, "epoch": 1.945475948418856, "grad_norm": 1.4453125, "learning_rate": 0.0004627302225963713, "loss": 6.1136, "mean_token_accuracy": 0.14687473252415656, "num_tokens": 39350825.0, "step": 18180 }, { "entropy": 6.579923677444458, "epoch": 1.94601102252662, "grad_norm": 1.8984375, "learning_rate": 0.00046270914469725174, "loss": 6.2763, "mean_token_accuracy": 0.1316472865641117, "num_tokens": 39361986.0, "step": 18185 }, { "entropy": 6.550302743911743, "epoch": 1.9465460966343837, "grad_norm": 1.78125, "learning_rate": 0.00046268806137805704, "loss": 6.1579, "mean_token_accuracy": 0.13814951479434967, "num_tokens": 39372440.0, "step": 18190 }, { "entropy": 6.4940667152404785, "epoch": 1.9470811707421478, "grad_norm": 3.53125, "learning_rate": 0.0004626669726393958, "loss": 6.1892, "mean_token_accuracy": 0.15121543034911156, "num_tokens": 39383455.0, "step": 18195 }, { "entropy": 6.449176502227783, "epoch": 1.9476162448499117, "grad_norm": 1.546875, "learning_rate": 0.0004626458784818772, "loss": 6.2052, "mean_token_accuracy": 0.137010395526886, "num_tokens": 39393511.0, "step": 18200 }, { "entropy": 6.5185973167419435, "epoch": 1.9481513189576756, "grad_norm": 1.7109375, "learning_rate": 0.00046262477890611026, "loss": 6.1915, "mean_token_accuracy": 0.14350884780287743, "num_tokens": 39404049.0, "step": 18205 }, { "entropy": 6.524765062332153, "epoch": 1.9486863930654397, "grad_norm": 1.6953125, "learning_rate": 0.00046260367391270414, "loss": 6.2084, "mean_token_accuracy": 0.14273274093866348, "num_tokens": 39414771.0, "step": 18210 }, { "entropy": 6.455693674087525, "epoch": 1.9492214671732033, "grad_norm": 1.5859375, "learning_rate": 0.00046258256350226835, "loss": 6.1725, "mean_token_accuracy": 0.14329796582460402, "num_tokens": 39424869.0, "step": 18215 }, { "entropy": 6.48890872001648, "epoch": 1.9497565412809674, "grad_norm": 1.421875, "learning_rate": 0.0004625614476754123, "loss": 6.2549, "mean_token_accuracy": 0.1388202503323555, "num_tokens": 39435442.0, "step": 18220 }, { "entropy": 6.534210252761841, "epoch": 1.9502916153887313, "grad_norm": 2.109375, "learning_rate": 0.00046254032643274596, "loss": 6.19, "mean_token_accuracy": 0.14215890243649482, "num_tokens": 39446704.0, "step": 18225 }, { "entropy": 6.4775608539581295, "epoch": 1.9508266894964952, "grad_norm": 1.6953125, "learning_rate": 0.00046251919977487887, "loss": 6.2069, "mean_token_accuracy": 0.14251686334609986, "num_tokens": 39458079.0, "step": 18230 }, { "entropy": 6.534129285812378, "epoch": 1.9513617636042593, "grad_norm": 1.546875, "learning_rate": 0.00046249806770242135, "loss": 6.2009, "mean_token_accuracy": 0.14502133950591087, "num_tokens": 39469867.0, "step": 18235 }, { "entropy": 6.503177642822266, "epoch": 1.9518968377120232, "grad_norm": 1.4140625, "learning_rate": 0.0004624769302159834, "loss": 6.1893, "mean_token_accuracy": 0.13654508143663407, "num_tokens": 39481138.0, "step": 18240 }, { "entropy": 6.478667306900024, "epoch": 1.952431911819787, "grad_norm": 1.5546875, "learning_rate": 0.0004624557873161755, "loss": 6.1549, "mean_token_accuracy": 0.1422030508518219, "num_tokens": 39492066.0, "step": 18245 }, { "entropy": 6.619949913024902, "epoch": 1.952966985927551, "grad_norm": 1.3046875, "learning_rate": 0.0004624346390036081, "loss": 6.2338, "mean_token_accuracy": 0.1362333133816719, "num_tokens": 39502576.0, "step": 18250 }, { "entropy": 6.516488552093506, "epoch": 1.9535020600353148, "grad_norm": 1.3359375, "learning_rate": 0.0004624134852788918, "loss": 6.1736, "mean_token_accuracy": 0.1413075566291809, "num_tokens": 39513373.0, "step": 18255 }, { "entropy": 6.49299464225769, "epoch": 1.954037134143079, "grad_norm": 1.5078125, "learning_rate": 0.0004623923261426374, "loss": 6.2466, "mean_token_accuracy": 0.13643113598227502, "num_tokens": 39523970.0, "step": 18260 }, { "entropy": 6.487503910064698, "epoch": 1.9545722082508428, "grad_norm": 1.3828125, "learning_rate": 0.000462371161595456, "loss": 6.2189, "mean_token_accuracy": 0.14029355868697166, "num_tokens": 39533893.0, "step": 18265 }, { "entropy": 6.499411344528198, "epoch": 1.9551072823586066, "grad_norm": 1.6328125, "learning_rate": 0.0004623499916379586, "loss": 6.1877, "mean_token_accuracy": 0.13367502987384797, "num_tokens": 39544276.0, "step": 18270 }, { "entropy": 6.508891677856445, "epoch": 1.9556423564663707, "grad_norm": 2.484375, "learning_rate": 0.0004623288162707565, "loss": 6.1817, "mean_token_accuracy": 0.1446276016533375, "num_tokens": 39554443.0, "step": 18275 }, { "entropy": 6.481840372085571, "epoch": 1.9561774305741344, "grad_norm": 1.4296875, "learning_rate": 0.00046230763549446116, "loss": 6.1377, "mean_token_accuracy": 0.1417379431426525, "num_tokens": 39564508.0, "step": 18280 }, { "entropy": 6.506319046020508, "epoch": 1.9567125046818985, "grad_norm": 1.3515625, "learning_rate": 0.0004622864493096842, "loss": 6.2279, "mean_token_accuracy": 0.13477322906255723, "num_tokens": 39574757.0, "step": 18285 }, { "entropy": 6.530301570892334, "epoch": 1.9572475787896624, "grad_norm": 1.65625, "learning_rate": 0.00046226525771703733, "loss": 6.2871, "mean_token_accuracy": 0.1320313483476639, "num_tokens": 39585911.0, "step": 18290 }, { "entropy": 6.52979040145874, "epoch": 1.9577826528974263, "grad_norm": 1.453125, "learning_rate": 0.0004622440607171324, "loss": 6.1984, "mean_token_accuracy": 0.13540443405508995, "num_tokens": 39597443.0, "step": 18295 }, { "entropy": 6.5429998397827145, "epoch": 1.9583177270051904, "grad_norm": 1.3203125, "learning_rate": 0.00046222285831058155, "loss": 6.2385, "mean_token_accuracy": 0.13729900270700454, "num_tokens": 39608693.0, "step": 18300 }, { "entropy": 6.489964962005615, "epoch": 1.958852801112954, "grad_norm": 1.4921875, "learning_rate": 0.000462201650497997, "loss": 6.2462, "mean_token_accuracy": 0.13809031397104263, "num_tokens": 39620002.0, "step": 18305 }, { "entropy": 6.494258642196655, "epoch": 1.9593878752207181, "grad_norm": 1.453125, "learning_rate": 0.00046218043727999105, "loss": 6.212, "mean_token_accuracy": 0.14171760454773902, "num_tokens": 39629856.0, "step": 18310 }, { "entropy": 6.454374885559082, "epoch": 1.959922949328482, "grad_norm": 1.578125, "learning_rate": 0.00046215921865717637, "loss": 6.1583, "mean_token_accuracy": 0.1480446234345436, "num_tokens": 39640418.0, "step": 18315 }, { "entropy": 6.585394716262817, "epoch": 1.9604580234362459, "grad_norm": 2.59375, "learning_rate": 0.0004621379946301655, "loss": 6.2789, "mean_token_accuracy": 0.13282811343669892, "num_tokens": 39652871.0, "step": 18320 }, { "entropy": 6.538632917404175, "epoch": 1.96099309754401, "grad_norm": 1.5859375, "learning_rate": 0.0004621167651995713, "loss": 6.2056, "mean_token_accuracy": 0.13859786316752434, "num_tokens": 39663864.0, "step": 18325 }, { "entropy": 6.443591547012329, "epoch": 1.9615281716517736, "grad_norm": 1.3515625, "learning_rate": 0.0004620955303660068, "loss": 6.1861, "mean_token_accuracy": 0.14592609256505967, "num_tokens": 39675835.0, "step": 18330 }, { "entropy": 6.486690998077393, "epoch": 1.9620632457595377, "grad_norm": 2.046875, "learning_rate": 0.00046207429013008525, "loss": 6.223, "mean_token_accuracy": 0.13817154094576836, "num_tokens": 39686799.0, "step": 18335 }, { "entropy": 6.595781373977661, "epoch": 1.9625983198673016, "grad_norm": 2.078125, "learning_rate": 0.00046205304449241976, "loss": 6.1933, "mean_token_accuracy": 0.14235665500164033, "num_tokens": 39697564.0, "step": 18340 }, { "entropy": 6.546803331375122, "epoch": 1.9631333939750655, "grad_norm": 1.265625, "learning_rate": 0.0004620317934536239, "loss": 6.2155, "mean_token_accuracy": 0.13921477496623993, "num_tokens": 39708064.0, "step": 18345 }, { "entropy": 6.4622925281524655, "epoch": 1.9636684680828296, "grad_norm": 1.3203125, "learning_rate": 0.0004620105370143112, "loss": 6.0978, "mean_token_accuracy": 0.14588503614068032, "num_tokens": 39718076.0, "step": 18350 }, { "entropy": 6.4703590869903564, "epoch": 1.9642035421905932, "grad_norm": 1.25, "learning_rate": 0.0004619892751750957, "loss": 6.1888, "mean_token_accuracy": 0.1371205635368824, "num_tokens": 39729532.0, "step": 18355 }, { "entropy": 6.572897434234619, "epoch": 1.9647386162983573, "grad_norm": 1.4921875, "learning_rate": 0.00046196800793659116, "loss": 6.1947, "mean_token_accuracy": 0.13921429961919785, "num_tokens": 39740372.0, "step": 18360 }, { "entropy": 6.471987104415893, "epoch": 1.9652736904061212, "grad_norm": 1.3671875, "learning_rate": 0.0004619467352994115, "loss": 6.0726, "mean_token_accuracy": 0.1459924139082432, "num_tokens": 39751283.0, "step": 18365 }, { "entropy": 6.492894411087036, "epoch": 1.965808764513885, "grad_norm": 1.640625, "learning_rate": 0.0004619254572641712, "loss": 6.2841, "mean_token_accuracy": 0.1367352746427059, "num_tokens": 39763295.0, "step": 18370 }, { "entropy": 6.497032403945923, "epoch": 1.9663438386216492, "grad_norm": 1.375, "learning_rate": 0.00046190417383148465, "loss": 6.2029, "mean_token_accuracy": 0.13938141465187073, "num_tokens": 39773849.0, "step": 18375 }, { "entropy": 6.40442214012146, "epoch": 1.966878912729413, "grad_norm": 1.5234375, "learning_rate": 0.0004618828850019663, "loss": 6.0185, "mean_token_accuracy": 0.149911268055439, "num_tokens": 39784366.0, "step": 18380 }, { "entropy": 6.481572771072388, "epoch": 1.967413986837177, "grad_norm": 2.0, "learning_rate": 0.00046186159077623093, "loss": 6.1466, "mean_token_accuracy": 0.13839536607265474, "num_tokens": 39794226.0, "step": 18385 }, { "entropy": 6.461075973510742, "epoch": 1.9679490609449408, "grad_norm": 1.6484375, "learning_rate": 0.0004618402911548933, "loss": 6.1659, "mean_token_accuracy": 0.13925424218177795, "num_tokens": 39805557.0, "step": 18390 }, { "entropy": 6.508315753936768, "epoch": 1.9684841350527047, "grad_norm": 1.359375, "learning_rate": 0.0004618189861385686, "loss": 6.1437, "mean_token_accuracy": 0.14520555585622788, "num_tokens": 39816090.0, "step": 18395 }, { "entropy": 6.483796405792236, "epoch": 1.9690192091604688, "grad_norm": 1.6015625, "learning_rate": 0.0004617976757278719, "loss": 6.2453, "mean_token_accuracy": 0.13241346776485444, "num_tokens": 39826662.0, "step": 18400 }, { "entropy": 6.5719798564910885, "epoch": 1.9695542832682327, "grad_norm": 1.4609375, "learning_rate": 0.00046177635992341855, "loss": 6.2349, "mean_token_accuracy": 0.1341266453266144, "num_tokens": 39837805.0, "step": 18405 }, { "entropy": 6.577894020080566, "epoch": 1.9700893573759966, "grad_norm": 1.3203125, "learning_rate": 0.0004617550387258241, "loss": 6.2255, "mean_token_accuracy": 0.1321740508079529, "num_tokens": 39848052.0, "step": 18410 }, { "entropy": 6.544881772994995, "epoch": 1.9706244314837607, "grad_norm": 1.6484375, "learning_rate": 0.0004617337121357041, "loss": 6.2168, "mean_token_accuracy": 0.13785637766122819, "num_tokens": 39859448.0, "step": 18415 }, { "entropy": 6.523015117645263, "epoch": 1.9711595055915243, "grad_norm": 1.3984375, "learning_rate": 0.0004617123801536744, "loss": 6.1675, "mean_token_accuracy": 0.14234541207551957, "num_tokens": 39870053.0, "step": 18420 }, { "entropy": 6.52815432548523, "epoch": 1.9716945796992884, "grad_norm": 1.4609375, "learning_rate": 0.000461691042780351, "loss": 6.2812, "mean_token_accuracy": 0.1351883016526699, "num_tokens": 39881547.0, "step": 18425 }, { "entropy": 6.530121231079102, "epoch": 1.9722296538070523, "grad_norm": 1.8046875, "learning_rate": 0.00046166970001635, "loss": 6.2598, "mean_token_accuracy": 0.13887228742241858, "num_tokens": 39892974.0, "step": 18430 }, { "entropy": 6.54822850227356, "epoch": 1.9727647279148162, "grad_norm": 1.3515625, "learning_rate": 0.00046164835186228757, "loss": 6.2269, "mean_token_accuracy": 0.13992278203368186, "num_tokens": 39904210.0, "step": 18435 }, { "entropy": 6.473427581787109, "epoch": 1.9732998020225803, "grad_norm": 1.65625, "learning_rate": 0.00046162699831878026, "loss": 6.1996, "mean_token_accuracy": 0.13897218704223632, "num_tokens": 39915464.0, "step": 18440 }, { "entropy": 6.516928815841675, "epoch": 1.973834876130344, "grad_norm": 2.578125, "learning_rate": 0.0004616056393864446, "loss": 6.2168, "mean_token_accuracy": 0.13783070743083953, "num_tokens": 39927117.0, "step": 18445 }, { "entropy": 6.590982913970947, "epoch": 1.974369950238108, "grad_norm": 1.3046875, "learning_rate": 0.0004615842750658972, "loss": 6.2195, "mean_token_accuracy": 0.1418525017797947, "num_tokens": 39937363.0, "step": 18450 }, { "entropy": 6.485547065734863, "epoch": 1.974905024345872, "grad_norm": 1.4453125, "learning_rate": 0.0004615629053577552, "loss": 6.1033, "mean_token_accuracy": 0.14801151901483536, "num_tokens": 39948934.0, "step": 18455 }, { "entropy": 6.463800287246704, "epoch": 1.9754400984536358, "grad_norm": 1.1640625, "learning_rate": 0.0004615415302626355, "loss": 6.1452, "mean_token_accuracy": 0.14127560183405877, "num_tokens": 39959435.0, "step": 18460 }, { "entropy": 6.523458242416382, "epoch": 1.9759751725613999, "grad_norm": 1.3984375, "learning_rate": 0.00046152014978115535, "loss": 6.2302, "mean_token_accuracy": 0.13477562740445137, "num_tokens": 39969006.0, "step": 18465 }, { "entropy": 6.495766067504883, "epoch": 1.9765102466691635, "grad_norm": 1.421875, "learning_rate": 0.000461498763913932, "loss": 6.146, "mean_token_accuracy": 0.13650858923792838, "num_tokens": 39979264.0, "step": 18470 }, { "entropy": 6.57129921913147, "epoch": 1.9770453207769276, "grad_norm": 1.3046875, "learning_rate": 0.00046147737266158314, "loss": 6.3063, "mean_token_accuracy": 0.13355173617601396, "num_tokens": 39989791.0, "step": 18475 }, { "entropy": 6.5301202774047855, "epoch": 1.9775803948846915, "grad_norm": 1.359375, "learning_rate": 0.0004614559760247263, "loss": 6.1533, "mean_token_accuracy": 0.13895142823457718, "num_tokens": 39999591.0, "step": 18480 }, { "entropy": 6.482016563415527, "epoch": 1.9781154689924554, "grad_norm": 1.5234375, "learning_rate": 0.0004614345740039794, "loss": 6.3133, "mean_token_accuracy": 0.13693781420588494, "num_tokens": 40010811.0, "step": 18485 }, { "entropy": 6.539826583862305, "epoch": 1.9786505431002195, "grad_norm": 1.125, "learning_rate": 0.00046141316659996037, "loss": 6.2399, "mean_token_accuracy": 0.13596573919057847, "num_tokens": 40022190.0, "step": 18490 }, { "entropy": 6.58152756690979, "epoch": 1.9791856172079834, "grad_norm": 1.2890625, "learning_rate": 0.00046139175381328725, "loss": 6.2075, "mean_token_accuracy": 0.1355739116668701, "num_tokens": 40033905.0, "step": 18495 }, { "entropy": 6.540552377700806, "epoch": 1.9797206913157472, "grad_norm": 1.46875, "learning_rate": 0.0004613703356445786, "loss": 6.2615, "mean_token_accuracy": 0.1378948912024498, "num_tokens": 40044923.0, "step": 18500 }, { "entropy": 6.489380884170532, "epoch": 1.9802557654235111, "grad_norm": 1.140625, "learning_rate": 0.0004613489120944526, "loss": 6.1597, "mean_token_accuracy": 0.13925086632370948, "num_tokens": 40054988.0, "step": 18505 }, { "entropy": 6.544102430343628, "epoch": 1.980790839531275, "grad_norm": 1.15625, "learning_rate": 0.0004613274831635279, "loss": 6.2654, "mean_token_accuracy": 0.13340204507112502, "num_tokens": 40065565.0, "step": 18510 }, { "entropy": 6.505882740020752, "epoch": 1.981325913639039, "grad_norm": 1.7734375, "learning_rate": 0.00046130604885242333, "loss": 6.2434, "mean_token_accuracy": 0.13562422543764113, "num_tokens": 40076282.0, "step": 18515 }, { "entropy": 6.533380508422852, "epoch": 1.981860987746803, "grad_norm": 1.5546875, "learning_rate": 0.0004612846091617578, "loss": 6.1859, "mean_token_accuracy": 0.14382676631212235, "num_tokens": 40087546.0, "step": 18520 }, { "entropy": 6.54186487197876, "epoch": 1.9823960618545668, "grad_norm": 1.5, "learning_rate": 0.0004612631640921504, "loss": 6.2532, "mean_token_accuracy": 0.13900343030691148, "num_tokens": 40097937.0, "step": 18525 }, { "entropy": 6.532418060302734, "epoch": 1.982931135962331, "grad_norm": 1.40625, "learning_rate": 0.00046124171364422025, "loss": 6.1875, "mean_token_accuracy": 0.14462210536003112, "num_tokens": 40108639.0, "step": 18530 }, { "entropy": 6.446396064758301, "epoch": 1.9834662100700946, "grad_norm": 1.2109375, "learning_rate": 0.0004612202578185868, "loss": 6.2004, "mean_token_accuracy": 0.141569384932518, "num_tokens": 40119533.0, "step": 18535 }, { "entropy": 6.538776922225952, "epoch": 1.9840012841778587, "grad_norm": 1.5390625, "learning_rate": 0.0004611987966158695, "loss": 6.2132, "mean_token_accuracy": 0.1406353272497654, "num_tokens": 40131176.0, "step": 18540 }, { "entropy": 6.565519237518311, "epoch": 1.9845363582856226, "grad_norm": 1.375, "learning_rate": 0.00046117733003668825, "loss": 6.2267, "mean_token_accuracy": 0.1372864879667759, "num_tokens": 40143293.0, "step": 18545 }, { "entropy": 6.5465416431427, "epoch": 1.9850714323933865, "grad_norm": 1.671875, "learning_rate": 0.0004611558580816628, "loss": 6.1663, "mean_token_accuracy": 0.13630439192056656, "num_tokens": 40155312.0, "step": 18550 }, { "entropy": 6.527706098556519, "epoch": 1.9856065065011506, "grad_norm": 2.109375, "learning_rate": 0.000461134380751413, "loss": 6.2243, "mean_token_accuracy": 0.13936087787151336, "num_tokens": 40166261.0, "step": 18555 }, { "entropy": 6.438541650772095, "epoch": 1.9861415806089142, "grad_norm": 1.4140625, "learning_rate": 0.00046111289804655906, "loss": 6.1585, "mean_token_accuracy": 0.14726999700069426, "num_tokens": 40176641.0, "step": 18560 }, { "entropy": 6.49216136932373, "epoch": 1.9866766547166783, "grad_norm": 1.2890625, "learning_rate": 0.0004610914099677214, "loss": 6.2394, "mean_token_accuracy": 0.13794424757361412, "num_tokens": 40187784.0, "step": 18565 }, { "entropy": 6.482954502105713, "epoch": 1.9872117288244422, "grad_norm": 1.53125, "learning_rate": 0.0004610699165155204, "loss": 6.2356, "mean_token_accuracy": 0.13208975419402122, "num_tokens": 40198219.0, "step": 18570 }, { "entropy": 6.478134822845459, "epoch": 1.987746802932206, "grad_norm": 1.34375, "learning_rate": 0.00046104841769057677, "loss": 6.1835, "mean_token_accuracy": 0.1381744846701622, "num_tokens": 40208589.0, "step": 18575 }, { "entropy": 6.554107809066773, "epoch": 1.9882818770399702, "grad_norm": 1.4140625, "learning_rate": 0.0004610269134935112, "loss": 6.1706, "mean_token_accuracy": 0.1381148010492325, "num_tokens": 40219587.0, "step": 18580 }, { "entropy": 6.517787742614746, "epoch": 1.9888169511477338, "grad_norm": 1.4921875, "learning_rate": 0.0004610054039249446, "loss": 6.1878, "mean_token_accuracy": 0.13920636028051375, "num_tokens": 40230681.0, "step": 18585 }, { "entropy": 6.395852994918823, "epoch": 1.989352025255498, "grad_norm": 1.4921875, "learning_rate": 0.00046098388898549816, "loss": 6.1101, "mean_token_accuracy": 0.14935251027345658, "num_tokens": 40241356.0, "step": 18590 }, { "entropy": 6.527567195892334, "epoch": 1.9898870993632618, "grad_norm": 1.546875, "learning_rate": 0.00046096236867579306, "loss": 6.2086, "mean_token_accuracy": 0.1399472773075104, "num_tokens": 40251652.0, "step": 18595 }, { "entropy": 6.50946536064148, "epoch": 1.9904221734710257, "grad_norm": 1.3671875, "learning_rate": 0.00046094084299645065, "loss": 6.175, "mean_token_accuracy": 0.1382264256477356, "num_tokens": 40262819.0, "step": 18600 }, { "entropy": 6.514907598495483, "epoch": 1.9909572475787898, "grad_norm": 1.265625, "learning_rate": 0.00046091931194809253, "loss": 6.2721, "mean_token_accuracy": 0.12972357571125032, "num_tokens": 40274314.0, "step": 18605 }, { "entropy": 6.545491456985474, "epoch": 1.9914923216865534, "grad_norm": 1.4375, "learning_rate": 0.0004608977755313404, "loss": 6.2355, "mean_token_accuracy": 0.13660071194171905, "num_tokens": 40284733.0, "step": 18610 }, { "entropy": 6.5072033405303955, "epoch": 1.9920273957943175, "grad_norm": 1.265625, "learning_rate": 0.0004608762337468162, "loss": 6.1806, "mean_token_accuracy": 0.14152269139885904, "num_tokens": 40295484.0, "step": 18615 }, { "entropy": 6.4947264194488525, "epoch": 1.9925624699020814, "grad_norm": 1.3125, "learning_rate": 0.0004608546865951418, "loss": 6.1719, "mean_token_accuracy": 0.1392577826976776, "num_tokens": 40305470.0, "step": 18620 }, { "entropy": 6.535963344573974, "epoch": 1.9930975440098453, "grad_norm": 1.265625, "learning_rate": 0.00046083313407693945, "loss": 6.3028, "mean_token_accuracy": 0.13385921120643615, "num_tokens": 40316055.0, "step": 18625 }, { "entropy": 6.542084646224976, "epoch": 1.9936326181176094, "grad_norm": 1.4453125, "learning_rate": 0.0004608115761928315, "loss": 6.1854, "mean_token_accuracy": 0.13841846957802773, "num_tokens": 40326689.0, "step": 18630 }, { "entropy": 6.468710279464721, "epoch": 1.9941676922253733, "grad_norm": 1.5234375, "learning_rate": 0.00046079001294344036, "loss": 6.1954, "mean_token_accuracy": 0.13841242641210555, "num_tokens": 40338511.0, "step": 18635 }, { "entropy": 6.463043689727783, "epoch": 1.9947027663331371, "grad_norm": 1.3515625, "learning_rate": 0.0004607684443293887, "loss": 6.1925, "mean_token_accuracy": 0.1357182554900646, "num_tokens": 40350395.0, "step": 18640 }, { "entropy": 6.522072792053223, "epoch": 1.995237840440901, "grad_norm": 1.375, "learning_rate": 0.0004607468703512993, "loss": 6.1774, "mean_token_accuracy": 0.14726056009531022, "num_tokens": 40360166.0, "step": 18645 }, { "entropy": 6.487435245513916, "epoch": 1.995772914548665, "grad_norm": 1.2265625, "learning_rate": 0.00046072529100979514, "loss": 6.1994, "mean_token_accuracy": 0.13381341472268105, "num_tokens": 40370655.0, "step": 18650 }, { "entropy": 6.5325366973876955, "epoch": 1.996307988656429, "grad_norm": 1.125, "learning_rate": 0.0004607037063054993, "loss": 6.1682, "mean_token_accuracy": 0.14127666875720024, "num_tokens": 40381502.0, "step": 18655 }, { "entropy": 6.629591035842895, "epoch": 1.9968430627641929, "grad_norm": 1.296875, "learning_rate": 0.000460682116239035, "loss": 6.2635, "mean_token_accuracy": 0.133098354190588, "num_tokens": 40391815.0, "step": 18660 }, { "entropy": 6.489607810974121, "epoch": 1.9973781368719568, "grad_norm": 1.40625, "learning_rate": 0.00046066052081102576, "loss": 6.2393, "mean_token_accuracy": 0.1387154445052147, "num_tokens": 40403306.0, "step": 18665 }, { "entropy": 6.465019464492798, "epoch": 1.9979132109797209, "grad_norm": 1.3984375, "learning_rate": 0.00046063892002209505, "loss": 6.1506, "mean_token_accuracy": 0.14460196644067763, "num_tokens": 40414210.0, "step": 18670 }, { "entropy": 6.4084409236907955, "epoch": 1.9984482850874845, "grad_norm": 1.53125, "learning_rate": 0.0004606173138728666, "loss": 6.1339, "mean_token_accuracy": 0.15017177313566207, "num_tokens": 40424368.0, "step": 18675 }, { "entropy": 6.5114758014678955, "epoch": 1.9989833591952486, "grad_norm": 1.546875, "learning_rate": 0.0004605957023639643, "loss": 6.2301, "mean_token_accuracy": 0.13938649669289588, "num_tokens": 40436252.0, "step": 18680 }, { "entropy": 6.547441864013672, "epoch": 1.9995184333030125, "grad_norm": 1.3984375, "learning_rate": 0.00046057408549601223, "loss": 6.2263, "mean_token_accuracy": 0.14011163935065268, "num_tokens": 40447256.0, "step": 18685 }, { "entropy": 6.536722554100884, "epoch": 2.0, "grad_norm": 2.8125, "learning_rate": 0.0004605524632696344, "loss": 6.1625, "mean_token_accuracy": 0.14446689767969978, "num_tokens": 40456516.0, "step": 18690 }, { "entropy": 6.493961954116822, "epoch": 2.000535074107764, "grad_norm": 1.5859375, "learning_rate": 0.0004605308356854553, "loss": 6.123, "mean_token_accuracy": 0.14020592719316483, "num_tokens": 40467563.0, "step": 18695 }, { "entropy": 6.507263660430908, "epoch": 2.0010701482155278, "grad_norm": 1.3515625, "learning_rate": 0.0004605092027440994, "loss": 6.1657, "mean_token_accuracy": 0.1470101334154606, "num_tokens": 40478202.0, "step": 18700 }, { "entropy": 6.548767995834351, "epoch": 2.001605222323292, "grad_norm": 1.3671875, "learning_rate": 0.0004604875644461914, "loss": 6.1386, "mean_token_accuracy": 0.14174846112728118, "num_tokens": 40489677.0, "step": 18705 }, { "entropy": 6.478121328353882, "epoch": 2.0021402964310555, "grad_norm": 1.4453125, "learning_rate": 0.00046046592079235595, "loss": 6.1573, "mean_token_accuracy": 0.1418830409646034, "num_tokens": 40500694.0, "step": 18710 }, { "entropy": 6.4401421546936035, "epoch": 2.0026753705388196, "grad_norm": 1.5625, "learning_rate": 0.0004604442717832181, "loss": 6.1265, "mean_token_accuracy": 0.14176031202077866, "num_tokens": 40511539.0, "step": 18715 }, { "entropy": 6.450679159164428, "epoch": 2.0032104446465837, "grad_norm": 2.03125, "learning_rate": 0.000460422617419403, "loss": 6.1095, "mean_token_accuracy": 0.13956640735268594, "num_tokens": 40521906.0, "step": 18720 }, { "entropy": 6.537706279754639, "epoch": 2.0037455187543474, "grad_norm": 1.40625, "learning_rate": 0.00046040095770153594, "loss": 6.1543, "mean_token_accuracy": 0.13734177649021148, "num_tokens": 40531454.0, "step": 18725 }, { "entropy": 6.561151552200317, "epoch": 2.0042805928621115, "grad_norm": 1.421875, "learning_rate": 0.0004603792926302422, "loss": 6.1805, "mean_token_accuracy": 0.13300508707761766, "num_tokens": 40541497.0, "step": 18730 }, { "entropy": 6.520805358886719, "epoch": 2.004815666969875, "grad_norm": 1.3359375, "learning_rate": 0.0004603576222061475, "loss": 6.1818, "mean_token_accuracy": 0.13687062859535218, "num_tokens": 40552576.0, "step": 18735 }, { "entropy": 6.5069859504699705, "epoch": 2.005350741077639, "grad_norm": 1.5546875, "learning_rate": 0.0004603359464298774, "loss": 6.1513, "mean_token_accuracy": 0.14298826977610588, "num_tokens": 40562906.0, "step": 18740 }, { "entropy": 6.425133419036865, "epoch": 2.0058858151854033, "grad_norm": 1.390625, "learning_rate": 0.00046031426530205796, "loss": 6.0618, "mean_token_accuracy": 0.14545038118958473, "num_tokens": 40574510.0, "step": 18745 }, { "entropy": 6.397230625152588, "epoch": 2.006420889293167, "grad_norm": 1.34375, "learning_rate": 0.0004602925788233152, "loss": 6.1029, "mean_token_accuracy": 0.15217705965042114, "num_tokens": 40586170.0, "step": 18750 }, { "entropy": 6.505608367919922, "epoch": 2.006955963400931, "grad_norm": 1.4453125, "learning_rate": 0.00046027088699427516, "loss": 6.1433, "mean_token_accuracy": 0.13655173256993294, "num_tokens": 40597613.0, "step": 18755 }, { "entropy": 6.553638553619384, "epoch": 2.007491037508695, "grad_norm": 1.8984375, "learning_rate": 0.00046024918981556434, "loss": 6.18, "mean_token_accuracy": 0.14074890017509462, "num_tokens": 40608366.0, "step": 18760 }, { "entropy": 6.4714373588562015, "epoch": 2.008026111616459, "grad_norm": 1.5234375, "learning_rate": 0.0004602274872878092, "loss": 6.1155, "mean_token_accuracy": 0.14470703527331352, "num_tokens": 40618616.0, "step": 18765 }, { "entropy": 6.363052845001221, "epoch": 2.008561185724223, "grad_norm": 1.953125, "learning_rate": 0.00046020577941163635, "loss": 6.0195, "mean_token_accuracy": 0.14627309516072273, "num_tokens": 40628342.0, "step": 18770 }, { "entropy": 6.451393365859985, "epoch": 2.0090962598319866, "grad_norm": 1.34375, "learning_rate": 0.00046018406618767273, "loss": 6.0964, "mean_token_accuracy": 0.13995684161782265, "num_tokens": 40638644.0, "step": 18775 }, { "entropy": 6.468491172790527, "epoch": 2.0096313339397507, "grad_norm": 1.2109375, "learning_rate": 0.0004601623476165451, "loss": 6.0927, "mean_token_accuracy": 0.14497480690479278, "num_tokens": 40649945.0, "step": 18780 }, { "entropy": 6.54347071647644, "epoch": 2.010166408047515, "grad_norm": 1.296875, "learning_rate": 0.00046014062369888084, "loss": 6.2209, "mean_token_accuracy": 0.13651128634810447, "num_tokens": 40660896.0, "step": 18785 }, { "entropy": 6.5255241870880125, "epoch": 2.0107014821552784, "grad_norm": 1.46875, "learning_rate": 0.000460118894435307, "loss": 6.1937, "mean_token_accuracy": 0.13748193979263307, "num_tokens": 40672072.0, "step": 18790 }, { "entropy": 6.53931622505188, "epoch": 2.0112365562630425, "grad_norm": 1.421875, "learning_rate": 0.0004600971598264511, "loss": 6.2036, "mean_token_accuracy": 0.13760020434856415, "num_tokens": 40682622.0, "step": 18795 }, { "entropy": 6.446117830276489, "epoch": 2.011771630370806, "grad_norm": 1.4765625, "learning_rate": 0.0004600754198729407, "loss": 6.1048, "mean_token_accuracy": 0.1457574747502804, "num_tokens": 40693127.0, "step": 18800 }, { "entropy": 6.473992538452149, "epoch": 2.0123067044785703, "grad_norm": 1.2109375, "learning_rate": 0.00046005367457540366, "loss": 6.1559, "mean_token_accuracy": 0.13953919857740402, "num_tokens": 40705009.0, "step": 18805 }, { "entropy": 6.550481081008911, "epoch": 2.0128417785863344, "grad_norm": 1.3125, "learning_rate": 0.00046003192393446763, "loss": 6.168, "mean_token_accuracy": 0.14077396765351297, "num_tokens": 40716498.0, "step": 18810 }, { "entropy": 6.533742380142212, "epoch": 2.013376852694098, "grad_norm": 1.328125, "learning_rate": 0.0004600101679507609, "loss": 6.1398, "mean_token_accuracy": 0.1455170065164566, "num_tokens": 40727802.0, "step": 18815 }, { "entropy": 6.489166402816773, "epoch": 2.013911926801862, "grad_norm": 1.4296875, "learning_rate": 0.0004599884066249115, "loss": 6.1757, "mean_token_accuracy": 0.14338200241327287, "num_tokens": 40738866.0, "step": 18820 }, { "entropy": 6.498798942565918, "epoch": 2.014447000909626, "grad_norm": 1.3359375, "learning_rate": 0.0004599666399575479, "loss": 6.162, "mean_token_accuracy": 0.1386456497013569, "num_tokens": 40750214.0, "step": 18825 }, { "entropy": 6.508102321624756, "epoch": 2.01498207501739, "grad_norm": 1.4609375, "learning_rate": 0.0004599448679492986, "loss": 6.1412, "mean_token_accuracy": 0.14615290239453316, "num_tokens": 40759830.0, "step": 18830 }, { "entropy": 6.476041603088379, "epoch": 2.015517149125154, "grad_norm": 1.5390625, "learning_rate": 0.0004599230906007921, "loss": 6.1776, "mean_token_accuracy": 0.14038556143641473, "num_tokens": 40770007.0, "step": 18835 }, { "entropy": 6.50742359161377, "epoch": 2.0160522232329177, "grad_norm": 2.578125, "learning_rate": 0.0004599013079126575, "loss": 6.106, "mean_token_accuracy": 0.13792717307806016, "num_tokens": 40781495.0, "step": 18840 }, { "entropy": 6.555199909210205, "epoch": 2.0165872973406818, "grad_norm": 1.34375, "learning_rate": 0.0004598795198855235, "loss": 6.0916, "mean_token_accuracy": 0.14419957250356674, "num_tokens": 40792875.0, "step": 18845 }, { "entropy": 6.514164209365845, "epoch": 2.0171223714484454, "grad_norm": 1.4140625, "learning_rate": 0.0004598577265200193, "loss": 6.2186, "mean_token_accuracy": 0.13229865208268166, "num_tokens": 40804484.0, "step": 18850 }, { "entropy": 6.460537672042847, "epoch": 2.0176574455562095, "grad_norm": 1.859375, "learning_rate": 0.0004598359278167744, "loss": 6.1275, "mean_token_accuracy": 0.13799827843904494, "num_tokens": 40814692.0, "step": 18855 }, { "entropy": 6.4778059959411625, "epoch": 2.0181925196639736, "grad_norm": 1.46875, "learning_rate": 0.00045981412377641795, "loss": 6.0952, "mean_token_accuracy": 0.14357306510210038, "num_tokens": 40825443.0, "step": 18860 }, { "entropy": 6.522529554367066, "epoch": 2.0187275937717373, "grad_norm": 1.6015625, "learning_rate": 0.00045979231439957966, "loss": 6.1551, "mean_token_accuracy": 0.14059658572077752, "num_tokens": 40836699.0, "step": 18865 }, { "entropy": 6.514246606826783, "epoch": 2.0192626678795014, "grad_norm": 1.375, "learning_rate": 0.0004597704996868893, "loss": 6.1423, "mean_token_accuracy": 0.13985197693109513, "num_tokens": 40846736.0, "step": 18870 }, { "entropy": 6.526371955871582, "epoch": 2.019797741987265, "grad_norm": 1.5234375, "learning_rate": 0.0004597486796389766, "loss": 6.2235, "mean_token_accuracy": 0.1408810056746006, "num_tokens": 40858362.0, "step": 18875 }, { "entropy": 6.4865038871765135, "epoch": 2.020332816095029, "grad_norm": 1.4453125, "learning_rate": 0.00045972685425647186, "loss": 6.1446, "mean_token_accuracy": 0.14298768937587739, "num_tokens": 40869346.0, "step": 18880 }, { "entropy": 6.561742973327637, "epoch": 2.0208678902027932, "grad_norm": 1.3359375, "learning_rate": 0.0004597050235400051, "loss": 6.2191, "mean_token_accuracy": 0.1398242346942425, "num_tokens": 40880003.0, "step": 18885 }, { "entropy": 6.561382007598877, "epoch": 2.021402964310557, "grad_norm": 1.390625, "learning_rate": 0.00045968318749020675, "loss": 6.1449, "mean_token_accuracy": 0.14093911722302438, "num_tokens": 40891515.0, "step": 18890 }, { "entropy": 6.505699968338012, "epoch": 2.021938038418321, "grad_norm": 1.484375, "learning_rate": 0.0004596613461077073, "loss": 6.119, "mean_token_accuracy": 0.14346395581960678, "num_tokens": 40902024.0, "step": 18895 }, { "entropy": 6.468415212631226, "epoch": 2.022473112526085, "grad_norm": 1.5703125, "learning_rate": 0.00045963949939313754, "loss": 6.1127, "mean_token_accuracy": 0.14756014198064804, "num_tokens": 40912160.0, "step": 18900 }, { "entropy": 6.537594604492187, "epoch": 2.0230081866338487, "grad_norm": 1.2578125, "learning_rate": 0.000459617647347128, "loss": 6.1783, "mean_token_accuracy": 0.13268757611513138, "num_tokens": 40922516.0, "step": 18905 }, { "entropy": 6.5097065448760985, "epoch": 2.023543260741613, "grad_norm": 1.3984375, "learning_rate": 0.00045959578997031, "loss": 6.1772, "mean_token_accuracy": 0.136392692476511, "num_tokens": 40934148.0, "step": 18910 }, { "entropy": 6.559519243240357, "epoch": 2.0240783348493765, "grad_norm": 1.34375, "learning_rate": 0.00045957392726331443, "loss": 6.1026, "mean_token_accuracy": 0.14509733468294145, "num_tokens": 40944409.0, "step": 18915 }, { "entropy": 6.488625955581665, "epoch": 2.0246134089571406, "grad_norm": 1.828125, "learning_rate": 0.00045955205922677264, "loss": 6.1715, "mean_token_accuracy": 0.14190514534711837, "num_tokens": 40955133.0, "step": 18920 }, { "entropy": 6.518922281265259, "epoch": 2.0251484830649047, "grad_norm": 1.3671875, "learning_rate": 0.0004595301858613161, "loss": 6.2323, "mean_token_accuracy": 0.1429607316851616, "num_tokens": 40965508.0, "step": 18925 }, { "entropy": 6.571975135803223, "epoch": 2.0256835571726683, "grad_norm": 1.7265625, "learning_rate": 0.0004595083071675763, "loss": 6.2005, "mean_token_accuracy": 0.14501149132847785, "num_tokens": 40975931.0, "step": 18930 }, { "entropy": 6.506203508377075, "epoch": 2.0262186312804324, "grad_norm": 1.265625, "learning_rate": 0.00045948642314618514, "loss": 6.1573, "mean_token_accuracy": 0.14204735904932023, "num_tokens": 40985797.0, "step": 18935 }, { "entropy": 6.4477344989776615, "epoch": 2.026753705388196, "grad_norm": 1.359375, "learning_rate": 0.0004594645337977744, "loss": 6.1597, "mean_token_accuracy": 0.13660738468170167, "num_tokens": 40996501.0, "step": 18940 }, { "entropy": 6.477477931976319, "epoch": 2.02728877949596, "grad_norm": 1.5078125, "learning_rate": 0.0004594426391229762, "loss": 6.1236, "mean_token_accuracy": 0.1394515760242939, "num_tokens": 41005970.0, "step": 18945 }, { "entropy": 6.501707649230957, "epoch": 2.0278238536037243, "grad_norm": 1.703125, "learning_rate": 0.0004594207391224227, "loss": 6.1081, "mean_token_accuracy": 0.14223191663622856, "num_tokens": 41017208.0, "step": 18950 }, { "entropy": 6.586483001708984, "epoch": 2.028358927711488, "grad_norm": 1.59375, "learning_rate": 0.00045939883379674624, "loss": 6.2729, "mean_token_accuracy": 0.13285416290163993, "num_tokens": 41028435.0, "step": 18955 }, { "entropy": 6.510217237472534, "epoch": 2.028894001819252, "grad_norm": 1.53125, "learning_rate": 0.00045937692314657936, "loss": 6.1292, "mean_token_accuracy": 0.14351291060447693, "num_tokens": 41039256.0, "step": 18960 }, { "entropy": 6.439512014389038, "epoch": 2.0294290759270157, "grad_norm": 1.484375, "learning_rate": 0.0004593550071725548, "loss": 6.1381, "mean_token_accuracy": 0.1356598161160946, "num_tokens": 41050527.0, "step": 18965 }, { "entropy": 6.497146797180176, "epoch": 2.02996415003478, "grad_norm": 1.2734375, "learning_rate": 0.00045933308587530527, "loss": 6.1727, "mean_token_accuracy": 0.1396307997405529, "num_tokens": 41062259.0, "step": 18970 }, { "entropy": 6.493076324462891, "epoch": 2.030499224142544, "grad_norm": 1.4609375, "learning_rate": 0.0004593111592554638, "loss": 6.192, "mean_token_accuracy": 0.1417892321944237, "num_tokens": 41073011.0, "step": 18975 }, { "entropy": 6.4537712097167965, "epoch": 2.0310342982503076, "grad_norm": 1.4609375, "learning_rate": 0.0004592892273136635, "loss": 6.056, "mean_token_accuracy": 0.1453937515616417, "num_tokens": 41083482.0, "step": 18980 }, { "entropy": 6.476549673080444, "epoch": 2.0315693723580717, "grad_norm": 1.6484375, "learning_rate": 0.00045926729005053764, "loss": 6.1275, "mean_token_accuracy": 0.14689192473888396, "num_tokens": 41094028.0, "step": 18985 }, { "entropy": 6.480548477172851, "epoch": 2.0321044464658353, "grad_norm": 1.1328125, "learning_rate": 0.0004592453474667197, "loss": 6.11, "mean_token_accuracy": 0.14326013177633284, "num_tokens": 41106346.0, "step": 18990 }, { "entropy": 6.558454704284668, "epoch": 2.0326395205735994, "grad_norm": 1.328125, "learning_rate": 0.0004592233995628432, "loss": 6.0493, "mean_token_accuracy": 0.1450323536992073, "num_tokens": 41116130.0, "step": 18995 }, { "entropy": 6.436607503890992, "epoch": 2.0331745946813635, "grad_norm": 1.21875, "learning_rate": 0.000459201446339542, "loss": 6.0923, "mean_token_accuracy": 0.14622003808617592, "num_tokens": 41127103.0, "step": 19000 }, { "entropy": 6.416644954681397, "epoch": 2.033709668789127, "grad_norm": 1.2578125, "learning_rate": 0.0004591794877974499, "loss": 6.1282, "mean_token_accuracy": 0.13969530984759332, "num_tokens": 41138258.0, "step": 19005 }, { "entropy": 6.532529830932617, "epoch": 2.0342447428968913, "grad_norm": 1.4609375, "learning_rate": 0.00045915752393720094, "loss": 6.1633, "mean_token_accuracy": 0.1450706236064434, "num_tokens": 41148859.0, "step": 19010 }, { "entropy": 6.496345806121826, "epoch": 2.034779817004655, "grad_norm": 1.6875, "learning_rate": 0.00045913555475942937, "loss": 6.0614, "mean_token_accuracy": 0.1406131975352764, "num_tokens": 41158614.0, "step": 19015 }, { "entropy": 6.461399221420288, "epoch": 2.035314891112419, "grad_norm": 1.421875, "learning_rate": 0.0004591135802647695, "loss": 6.1302, "mean_token_accuracy": 0.1487656131386757, "num_tokens": 41170215.0, "step": 19020 }, { "entropy": 6.5223548412323, "epoch": 2.035849965220183, "grad_norm": 1.75, "learning_rate": 0.0004590916004538559, "loss": 6.1303, "mean_token_accuracy": 0.14125470146536828, "num_tokens": 41180784.0, "step": 19025 }, { "entropy": 6.528457736968994, "epoch": 2.036385039327947, "grad_norm": 1.5234375, "learning_rate": 0.00045906961532732316, "loss": 6.1562, "mean_token_accuracy": 0.1360959529876709, "num_tokens": 41191305.0, "step": 19030 }, { "entropy": 6.501538276672363, "epoch": 2.036920113435711, "grad_norm": 1.5859375, "learning_rate": 0.0004590476248858062, "loss": 6.1764, "mean_token_accuracy": 0.14044924229383468, "num_tokens": 41202388.0, "step": 19035 }, { "entropy": 6.460980367660523, "epoch": 2.037455187543475, "grad_norm": 1.7578125, "learning_rate": 0.0004590256291299399, "loss": 6.1173, "mean_token_accuracy": 0.14525325298309327, "num_tokens": 41212136.0, "step": 19040 }, { "entropy": 6.458244180679321, "epoch": 2.0379902616512386, "grad_norm": 1.9765625, "learning_rate": 0.00045900362806035945, "loss": 6.1674, "mean_token_accuracy": 0.1392577327787876, "num_tokens": 41223390.0, "step": 19045 }, { "entropy": 6.487509679794312, "epoch": 2.0385253357590027, "grad_norm": 1.6171875, "learning_rate": 0.00045898162167770006, "loss": 6.193, "mean_token_accuracy": 0.14385589063167573, "num_tokens": 41234775.0, "step": 19050 }, { "entropy": 6.516320753097534, "epoch": 2.0390604098667664, "grad_norm": 1.578125, "learning_rate": 0.0004589596099825973, "loss": 6.1062, "mean_token_accuracy": 0.1417277753353119, "num_tokens": 41245627.0, "step": 19055 }, { "entropy": 6.480148649215698, "epoch": 2.0395954839745305, "grad_norm": 2.171875, "learning_rate": 0.00045893759297568654, "loss": 6.1623, "mean_token_accuracy": 0.1406472384929657, "num_tokens": 41255441.0, "step": 19060 }, { "entropy": 6.369239854812622, "epoch": 2.0401305580822946, "grad_norm": 1.34375, "learning_rate": 0.0004589155706576036, "loss": 6.099, "mean_token_accuracy": 0.1408141165971756, "num_tokens": 41268686.0, "step": 19065 }, { "entropy": 6.583061981201172, "epoch": 2.0406656321900583, "grad_norm": 1.53125, "learning_rate": 0.00045889354302898445, "loss": 6.214, "mean_token_accuracy": 0.13442379906773566, "num_tokens": 41279384.0, "step": 19070 }, { "entropy": 6.608145332336425, "epoch": 2.0412007062978224, "grad_norm": 1.3515625, "learning_rate": 0.0004588715100904651, "loss": 6.1942, "mean_token_accuracy": 0.1354267381131649, "num_tokens": 41289923.0, "step": 19075 }, { "entropy": 6.458296060562134, "epoch": 2.041735780405586, "grad_norm": 1.71875, "learning_rate": 0.0004588494718426818, "loss": 6.1293, "mean_token_accuracy": 0.14421897679567336, "num_tokens": 41300486.0, "step": 19080 }, { "entropy": 6.401919412612915, "epoch": 2.04227085451335, "grad_norm": 1.578125, "learning_rate": 0.0004588274282862708, "loss": 6.1183, "mean_token_accuracy": 0.14360963180661201, "num_tokens": 41310507.0, "step": 19085 }, { "entropy": 6.4948516368865965, "epoch": 2.042805928621114, "grad_norm": 2.03125, "learning_rate": 0.00045880537942186855, "loss": 6.1519, "mean_token_accuracy": 0.1460525207221508, "num_tokens": 41321284.0, "step": 19090 }, { "entropy": 6.479793310165405, "epoch": 2.043341002728878, "grad_norm": 1.7265625, "learning_rate": 0.0004587833252501118, "loss": 6.0749, "mean_token_accuracy": 0.14869818538427354, "num_tokens": 41332037.0, "step": 19095 }, { "entropy": 6.436644220352173, "epoch": 2.043876076836642, "grad_norm": 1.421875, "learning_rate": 0.0004587612657716374, "loss": 6.1525, "mean_token_accuracy": 0.1404256284236908, "num_tokens": 41343480.0, "step": 19100 }, { "entropy": 6.514421033859253, "epoch": 2.0444111509444056, "grad_norm": 1.4140625, "learning_rate": 0.0004587392009870824, "loss": 6.1915, "mean_token_accuracy": 0.13664307445287704, "num_tokens": 41353656.0, "step": 19105 }, { "entropy": 6.488293075561524, "epoch": 2.0449462250521697, "grad_norm": 1.5, "learning_rate": 0.0004587171308970836, "loss": 6.1317, "mean_token_accuracy": 0.14327220767736434, "num_tokens": 41363640.0, "step": 19110 }, { "entropy": 6.492086029052734, "epoch": 2.045481299159934, "grad_norm": 1.3984375, "learning_rate": 0.00045869505550227857, "loss": 6.1687, "mean_token_accuracy": 0.13604222983121872, "num_tokens": 41374194.0, "step": 19115 }, { "entropy": 6.451062726974487, "epoch": 2.0460163732676975, "grad_norm": 1.3359375, "learning_rate": 0.0004586729748033046, "loss": 6.1238, "mean_token_accuracy": 0.14803083389997482, "num_tokens": 41384968.0, "step": 19120 }, { "entropy": 6.469352102279663, "epoch": 2.0465514473754616, "grad_norm": 2.34375, "learning_rate": 0.00045865088880079924, "loss": 6.0258, "mean_token_accuracy": 0.14876729846000672, "num_tokens": 41395117.0, "step": 19125 }, { "entropy": 6.5053938865661625, "epoch": 2.0470865214832252, "grad_norm": 1.2109375, "learning_rate": 0.0004586287974954004, "loss": 6.1412, "mean_token_accuracy": 0.14110405296087264, "num_tokens": 41406366.0, "step": 19130 }, { "entropy": 6.5320250511169435, "epoch": 2.0476215955909893, "grad_norm": 1.5390625, "learning_rate": 0.0004586067008877457, "loss": 6.1342, "mean_token_accuracy": 0.1459088757634163, "num_tokens": 41417388.0, "step": 19135 }, { "entropy": 6.4374086380004885, "epoch": 2.0481566696987534, "grad_norm": 1.453125, "learning_rate": 0.0004585845989784734, "loss": 6.0949, "mean_token_accuracy": 0.14255037009716034, "num_tokens": 41428085.0, "step": 19140 }, { "entropy": 6.516263008117676, "epoch": 2.048691743806517, "grad_norm": 1.2578125, "learning_rate": 0.00045856249176822155, "loss": 6.194, "mean_token_accuracy": 0.134604249894619, "num_tokens": 41439117.0, "step": 19145 }, { "entropy": 6.499457502365113, "epoch": 2.049226817914281, "grad_norm": 1.2265625, "learning_rate": 0.00045854037925762857, "loss": 6.1752, "mean_token_accuracy": 0.1368185169994831, "num_tokens": 41450042.0, "step": 19150 }, { "entropy": 6.46821665763855, "epoch": 2.049761892022045, "grad_norm": 1.4609375, "learning_rate": 0.00045851826144733296, "loss": 6.0794, "mean_token_accuracy": 0.15025001615285874, "num_tokens": 41460554.0, "step": 19155 }, { "entropy": 6.5151244640350345, "epoch": 2.050296966129809, "grad_norm": 1.7421875, "learning_rate": 0.00045849613833797326, "loss": 6.1735, "mean_token_accuracy": 0.14511755853891373, "num_tokens": 41471403.0, "step": 19160 }, { "entropy": 6.462577676773071, "epoch": 2.050832040237573, "grad_norm": 1.484375, "learning_rate": 0.00045847400993018835, "loss": 6.1478, "mean_token_accuracy": 0.13789881393313408, "num_tokens": 41482098.0, "step": 19165 }, { "entropy": 6.476891613006591, "epoch": 2.0513671143453367, "grad_norm": 1.671875, "learning_rate": 0.00045845187622461724, "loss": 6.14, "mean_token_accuracy": 0.14094822630286216, "num_tokens": 41493126.0, "step": 19170 }, { "entropy": 6.570120620727539, "epoch": 2.051902188453101, "grad_norm": 1.765625, "learning_rate": 0.000458429737221899, "loss": 6.2465, "mean_token_accuracy": 0.13628095909953117, "num_tokens": 41504242.0, "step": 19175 }, { "entropy": 6.4928771495819095, "epoch": 2.052437262560865, "grad_norm": 1.421875, "learning_rate": 0.0004584075929226728, "loss": 6.1236, "mean_token_accuracy": 0.14559295326471328, "num_tokens": 41515368.0, "step": 19180 }, { "entropy": 6.474678325653076, "epoch": 2.0529723366686286, "grad_norm": 1.5, "learning_rate": 0.0004583854433275782, "loss": 6.1557, "mean_token_accuracy": 0.1395520031452179, "num_tokens": 41525939.0, "step": 19185 }, { "entropy": 6.467396020889282, "epoch": 2.0535074107763926, "grad_norm": 1.6796875, "learning_rate": 0.00045836328843725465, "loss": 6.1785, "mean_token_accuracy": 0.14105122685432434, "num_tokens": 41536505.0, "step": 19190 }, { "entropy": 6.464931392669678, "epoch": 2.0540424848841563, "grad_norm": 1.296875, "learning_rate": 0.00045834112825234193, "loss": 6.1008, "mean_token_accuracy": 0.14669242650270461, "num_tokens": 41546293.0, "step": 19195 }, { "entropy": 6.471874475479126, "epoch": 2.0545775589919204, "grad_norm": 1.671875, "learning_rate": 0.00045831896277347985, "loss": 6.1223, "mean_token_accuracy": 0.14656351059675216, "num_tokens": 41556596.0, "step": 19200 }, { "entropy": 6.509445333480835, "epoch": 2.0551126330996845, "grad_norm": 1.296875, "learning_rate": 0.0004582967920013085, "loss": 6.1636, "mean_token_accuracy": 0.14745448306202888, "num_tokens": 41566732.0, "step": 19205 }, { "entropy": 6.532517051696777, "epoch": 2.055647707207448, "grad_norm": 1.3359375, "learning_rate": 0.00045827461593646806, "loss": 6.1857, "mean_token_accuracy": 0.13695996776223182, "num_tokens": 41577777.0, "step": 19210 }, { "entropy": 6.489979219436646, "epoch": 2.0561827813152123, "grad_norm": 1.5078125, "learning_rate": 0.0004582524345795989, "loss": 6.1474, "mean_token_accuracy": 0.14347779750823975, "num_tokens": 41587978.0, "step": 19215 }, { "entropy": 6.4816924095153805, "epoch": 2.056717855422976, "grad_norm": 1.3125, "learning_rate": 0.0004582302479313413, "loss": 6.1105, "mean_token_accuracy": 0.14375540167093276, "num_tokens": 41598977.0, "step": 19220 }, { "entropy": 6.502046680450439, "epoch": 2.05725292953074, "grad_norm": 1.515625, "learning_rate": 0.0004582080559923362, "loss": 6.154, "mean_token_accuracy": 0.13674740493297577, "num_tokens": 41609664.0, "step": 19225 }, { "entropy": 6.478590059280395, "epoch": 2.057788003638504, "grad_norm": 1.8828125, "learning_rate": 0.0004581858587632241, "loss": 6.1502, "mean_token_accuracy": 0.13895293027162553, "num_tokens": 41619427.0, "step": 19230 }, { "entropy": 6.472123718261718, "epoch": 2.0583230777462678, "grad_norm": 1.421875, "learning_rate": 0.0004581636562446461, "loss": 6.1411, "mean_token_accuracy": 0.1371616877615452, "num_tokens": 41629551.0, "step": 19235 }, { "entropy": 6.447014617919922, "epoch": 2.058858151854032, "grad_norm": 1.5859375, "learning_rate": 0.0004581414484372433, "loss": 6.1476, "mean_token_accuracy": 0.13804002851247787, "num_tokens": 41640183.0, "step": 19240 }, { "entropy": 6.43388876914978, "epoch": 2.0593932259617955, "grad_norm": 1.671875, "learning_rate": 0.0004581192353416569, "loss": 6.1404, "mean_token_accuracy": 0.14709998071193695, "num_tokens": 41651934.0, "step": 19245 }, { "entropy": 6.3898547172546385, "epoch": 2.0599283000695596, "grad_norm": 1.625, "learning_rate": 0.0004580970169585283, "loss": 6.0314, "mean_token_accuracy": 0.16168030798435212, "num_tokens": 41662418.0, "step": 19250 }, { "entropy": 6.408938789367676, "epoch": 2.0604633741773237, "grad_norm": 1.53125, "learning_rate": 0.00045807479328849906, "loss": 6.0462, "mean_token_accuracy": 0.14857290759682656, "num_tokens": 41673419.0, "step": 19255 }, { "entropy": 6.431122779846191, "epoch": 2.0609984482850874, "grad_norm": 1.3828125, "learning_rate": 0.00045805256433221087, "loss": 6.0671, "mean_token_accuracy": 0.1496027022600174, "num_tokens": 41684132.0, "step": 19260 }, { "entropy": 6.518172025680542, "epoch": 2.0615335223928515, "grad_norm": 1.4453125, "learning_rate": 0.0004580303300903056, "loss": 6.1558, "mean_token_accuracy": 0.1433491162955761, "num_tokens": 41695051.0, "step": 19265 }, { "entropy": 6.5380795955657955, "epoch": 2.062068596500615, "grad_norm": 2.203125, "learning_rate": 0.00045800809056342534, "loss": 6.1785, "mean_token_accuracy": 0.14187479242682458, "num_tokens": 41705986.0, "step": 19270 }, { "entropy": 6.489912509918213, "epoch": 2.0626036706083792, "grad_norm": 1.5625, "learning_rate": 0.00045798584575221213, "loss": 6.1659, "mean_token_accuracy": 0.13931995928287505, "num_tokens": 41717082.0, "step": 19275 }, { "entropy": 6.504186391830444, "epoch": 2.0631387447161433, "grad_norm": 1.7109375, "learning_rate": 0.0004579635956573084, "loss": 6.1781, "mean_token_accuracy": 0.1459621638059616, "num_tokens": 41728783.0, "step": 19280 }, { "entropy": 6.49009895324707, "epoch": 2.063673818823907, "grad_norm": 2.765625, "learning_rate": 0.00045794134027935646, "loss": 6.1654, "mean_token_accuracy": 0.14074748381972313, "num_tokens": 41740452.0, "step": 19285 }, { "entropy": 6.5198619842529295, "epoch": 2.064208892931671, "grad_norm": 1.4453125, "learning_rate": 0.0004579190796189991, "loss": 6.0982, "mean_token_accuracy": 0.1458289071917534, "num_tokens": 41750966.0, "step": 19290 }, { "entropy": 6.50558614730835, "epoch": 2.064743967039435, "grad_norm": 1.4140625, "learning_rate": 0.000457896813676879, "loss": 6.0919, "mean_token_accuracy": 0.144083159416914, "num_tokens": 41762174.0, "step": 19295 }, { "entropy": 6.455884265899658, "epoch": 2.065279041147199, "grad_norm": 1.3359375, "learning_rate": 0.00045787454245363907, "loss": 6.2008, "mean_token_accuracy": 0.13619274497032166, "num_tokens": 41773396.0, "step": 19300 }, { "entropy": 6.48363618850708, "epoch": 2.065814115254963, "grad_norm": 1.6015625, "learning_rate": 0.0004578522659499225, "loss": 6.1524, "mean_token_accuracy": 0.14194218069314957, "num_tokens": 41783833.0, "step": 19305 }, { "entropy": 6.466428661346436, "epoch": 2.0663491893627266, "grad_norm": 1.6015625, "learning_rate": 0.00045782998416637235, "loss": 6.1288, "mean_token_accuracy": 0.15198036134243012, "num_tokens": 41795363.0, "step": 19310 }, { "entropy": 6.538760805130005, "epoch": 2.0668842634704907, "grad_norm": 1.7578125, "learning_rate": 0.0004578076971036321, "loss": 6.1661, "mean_token_accuracy": 0.14131421819329262, "num_tokens": 41807575.0, "step": 19315 }, { "entropy": 6.3735511302948, "epoch": 2.067419337578255, "grad_norm": 1.4453125, "learning_rate": 0.0004577854047623454, "loss": 6.078, "mean_token_accuracy": 0.14580662548542023, "num_tokens": 41818496.0, "step": 19320 }, { "entropy": 6.499590063095093, "epoch": 2.0679544116860185, "grad_norm": 1.3203125, "learning_rate": 0.0004577631071431557, "loss": 6.1095, "mean_token_accuracy": 0.14684664011001586, "num_tokens": 41829106.0, "step": 19325 }, { "entropy": 6.45405125617981, "epoch": 2.0684894857937826, "grad_norm": 1.609375, "learning_rate": 0.00045774080424670704, "loss": 6.0955, "mean_token_accuracy": 0.14979782924056054, "num_tokens": 41838095.0, "step": 19330 }, { "entropy": 6.437284278869629, "epoch": 2.069024559901546, "grad_norm": 1.4609375, "learning_rate": 0.0004577184960736433, "loss": 6.1256, "mean_token_accuracy": 0.1353687562048435, "num_tokens": 41847980.0, "step": 19335 }, { "entropy": 6.553657579421997, "epoch": 2.0695596340093103, "grad_norm": 1.3359375, "learning_rate": 0.00045769618262460864, "loss": 6.1508, "mean_token_accuracy": 0.1402767464518547, "num_tokens": 41858625.0, "step": 19340 }, { "entropy": 6.507570505142212, "epoch": 2.0700947081170744, "grad_norm": 1.5703125, "learning_rate": 0.0004576738639002475, "loss": 6.1396, "mean_token_accuracy": 0.13780880868434905, "num_tokens": 41870939.0, "step": 19345 }, { "entropy": 6.5192183494567875, "epoch": 2.070629782224838, "grad_norm": 2.34375, "learning_rate": 0.0004576515399012041, "loss": 6.206, "mean_token_accuracy": 0.140149012953043, "num_tokens": 41882356.0, "step": 19350 }, { "entropy": 6.491689586639405, "epoch": 2.071164856332602, "grad_norm": 1.2890625, "learning_rate": 0.0004576292106281231, "loss": 6.1615, "mean_token_accuracy": 0.1387277662754059, "num_tokens": 41892306.0, "step": 19355 }, { "entropy": 6.512281131744385, "epoch": 2.071699930440366, "grad_norm": 1.625, "learning_rate": 0.00045760687608164933, "loss": 6.2056, "mean_token_accuracy": 0.13818393498659134, "num_tokens": 41902450.0, "step": 19360 }, { "entropy": 6.48457088470459, "epoch": 2.07223500454813, "grad_norm": 1.328125, "learning_rate": 0.0004575845362624278, "loss": 6.1249, "mean_token_accuracy": 0.1443415492773056, "num_tokens": 41913319.0, "step": 19365 }, { "entropy": 6.522418546676636, "epoch": 2.072770078655894, "grad_norm": 1.390625, "learning_rate": 0.00045756219117110337, "loss": 6.1643, "mean_token_accuracy": 0.14059045165777206, "num_tokens": 41923598.0, "step": 19370 }, { "entropy": 6.542702007293701, "epoch": 2.0733051527636577, "grad_norm": 1.4140625, "learning_rate": 0.00045753984080832127, "loss": 6.1426, "mean_token_accuracy": 0.1389916017651558, "num_tokens": 41934482.0, "step": 19375 }, { "entropy": 6.51252179145813, "epoch": 2.0738402268714218, "grad_norm": 1.5, "learning_rate": 0.000457517485174727, "loss": 6.1116, "mean_token_accuracy": 0.13963203877210617, "num_tokens": 41945994.0, "step": 19380 }, { "entropy": 6.4817948818206785, "epoch": 2.0743753009791854, "grad_norm": 1.3125, "learning_rate": 0.00045749512427096595, "loss": 6.1511, "mean_token_accuracy": 0.13679138645529748, "num_tokens": 41956564.0, "step": 19385 }, { "entropy": 6.440240144729614, "epoch": 2.0749103750869495, "grad_norm": 1.328125, "learning_rate": 0.00045747275809768386, "loss": 6.1358, "mean_token_accuracy": 0.14567358940839767, "num_tokens": 41966847.0, "step": 19390 }, { "entropy": 6.506151437759399, "epoch": 2.0754454491947136, "grad_norm": 1.2578125, "learning_rate": 0.0004574503866555265, "loss": 6.2249, "mean_token_accuracy": 0.1337882809340954, "num_tokens": 41977752.0, "step": 19395 }, { "entropy": 6.516854572296142, "epoch": 2.0759805233024773, "grad_norm": 1.21875, "learning_rate": 0.00045742800994513983, "loss": 6.1457, "mean_token_accuracy": 0.14443642646074295, "num_tokens": 41987837.0, "step": 19400 }, { "entropy": 6.52735481262207, "epoch": 2.0765155974102414, "grad_norm": 1.7421875, "learning_rate": 0.00045740562796717005, "loss": 6.152, "mean_token_accuracy": 0.13824782595038415, "num_tokens": 41997988.0, "step": 19405 }, { "entropy": 6.381102895736694, "epoch": 2.077050671518005, "grad_norm": 1.4765625, "learning_rate": 0.0004573832407222634, "loss": 6.0649, "mean_token_accuracy": 0.14729070663452148, "num_tokens": 42009643.0, "step": 19410 }, { "entropy": 6.475057315826416, "epoch": 2.077585745625769, "grad_norm": 1.3984375, "learning_rate": 0.0004573608482110663, "loss": 6.1287, "mean_token_accuracy": 0.13999679908156396, "num_tokens": 42019972.0, "step": 19415 }, { "entropy": 6.497097396850586, "epoch": 2.0781208197335332, "grad_norm": 1.2109375, "learning_rate": 0.00045733845043422535, "loss": 6.1293, "mean_token_accuracy": 0.14451572746038438, "num_tokens": 42030536.0, "step": 19420 }, { "entropy": 6.529263639450074, "epoch": 2.078655893841297, "grad_norm": 1.265625, "learning_rate": 0.0004573160473923872, "loss": 6.1129, "mean_token_accuracy": 0.1403690680861473, "num_tokens": 42041217.0, "step": 19425 }, { "entropy": 6.36537127494812, "epoch": 2.079190967949061, "grad_norm": 1.53125, "learning_rate": 0.0004572936390861988, "loss": 6.0204, "mean_token_accuracy": 0.14835600107908248, "num_tokens": 42051346.0, "step": 19430 }, { "entropy": 6.546513509750366, "epoch": 2.0797260420568247, "grad_norm": 1.59375, "learning_rate": 0.0004572712255163072, "loss": 6.2135, "mean_token_accuracy": 0.13938311040401458, "num_tokens": 42062718.0, "step": 19435 }, { "entropy": 6.524495077133179, "epoch": 2.0802611161645888, "grad_norm": 1.28125, "learning_rate": 0.0004572488066833596, "loss": 6.1332, "mean_token_accuracy": 0.1377783089876175, "num_tokens": 42073587.0, "step": 19440 }, { "entropy": 6.5476109981536865, "epoch": 2.080796190272353, "grad_norm": 1.3359375, "learning_rate": 0.00045722638258800335, "loss": 6.1524, "mean_token_accuracy": 0.14769052118062972, "num_tokens": 42083763.0, "step": 19445 }, { "entropy": 6.429262590408325, "epoch": 2.0813312643801165, "grad_norm": 1.4375, "learning_rate": 0.0004572039532308858, "loss": 6.0734, "mean_token_accuracy": 0.14719380512833596, "num_tokens": 42094062.0, "step": 19450 }, { "entropy": 6.463222217559815, "epoch": 2.0818663384878806, "grad_norm": 1.3671875, "learning_rate": 0.0004571815186126549, "loss": 6.16, "mean_token_accuracy": 0.13777271136641503, "num_tokens": 42106136.0, "step": 19455 }, { "entropy": 6.483076667785644, "epoch": 2.0824014125956447, "grad_norm": 1.7265625, "learning_rate": 0.00045715907873395805, "loss": 6.1578, "mean_token_accuracy": 0.13568266183137895, "num_tokens": 42116309.0, "step": 19460 }, { "entropy": 6.462263345718384, "epoch": 2.0829364867034084, "grad_norm": 1.3984375, "learning_rate": 0.0004571366335954435, "loss": 6.1484, "mean_token_accuracy": 0.14241429641842843, "num_tokens": 42127747.0, "step": 19465 }, { "entropy": 6.429238605499267, "epoch": 2.0834715608111725, "grad_norm": 1.515625, "learning_rate": 0.0004571141831977592, "loss": 6.0754, "mean_token_accuracy": 0.15075682997703552, "num_tokens": 42137992.0, "step": 19470 }, { "entropy": 6.457944917678833, "epoch": 2.084006634918936, "grad_norm": 1.4140625, "learning_rate": 0.0004570917275415535, "loss": 6.0855, "mean_token_accuracy": 0.14265020191669464, "num_tokens": 42148833.0, "step": 19475 }, { "entropy": 6.44670033454895, "epoch": 2.0845417090267, "grad_norm": 2.03125, "learning_rate": 0.0004570692666274747, "loss": 6.1596, "mean_token_accuracy": 0.14300988093018532, "num_tokens": 42159276.0, "step": 19480 }, { "entropy": 6.566137170791626, "epoch": 2.0850767831344643, "grad_norm": 1.8203125, "learning_rate": 0.0004570468004561715, "loss": 6.2044, "mean_token_accuracy": 0.14038451686501502, "num_tokens": 42171541.0, "step": 19485 }, { "entropy": 6.4842836380004885, "epoch": 2.085611857242228, "grad_norm": 1.421875, "learning_rate": 0.00045702432902829245, "loss": 6.1543, "mean_token_accuracy": 0.14726416394114494, "num_tokens": 42182888.0, "step": 19490 }, { "entropy": 6.458319664001465, "epoch": 2.086146931349992, "grad_norm": 1.4296875, "learning_rate": 0.0004570018523444865, "loss": 6.0786, "mean_token_accuracy": 0.152434304356575, "num_tokens": 42193405.0, "step": 19495 }, { "entropy": 6.482660341262817, "epoch": 2.0866820054577557, "grad_norm": 1.4296875, "learning_rate": 0.00045697937040540263, "loss": 6.0982, "mean_token_accuracy": 0.1448497325181961, "num_tokens": 42203355.0, "step": 19500 }, { "entropy": 6.451343965530396, "epoch": 2.08721707956552, "grad_norm": 1.390625, "learning_rate": 0.00045695688321169, "loss": 6.1103, "mean_token_accuracy": 0.13565196245908737, "num_tokens": 42213191.0, "step": 19505 }, { "entropy": 6.488658666610718, "epoch": 2.087752153673284, "grad_norm": 1.53125, "learning_rate": 0.00045693439076399797, "loss": 6.2014, "mean_token_accuracy": 0.13889316320419312, "num_tokens": 42223357.0, "step": 19510 }, { "entropy": 6.521796703338623, "epoch": 2.0882872277810476, "grad_norm": 1.484375, "learning_rate": 0.00045691189306297595, "loss": 6.1086, "mean_token_accuracy": 0.14505178332328797, "num_tokens": 42234917.0, "step": 19515 }, { "entropy": 6.564554977416992, "epoch": 2.0888223018888117, "grad_norm": 1.453125, "learning_rate": 0.00045688939010927353, "loss": 6.1679, "mean_token_accuracy": 0.1397237330675125, "num_tokens": 42245977.0, "step": 19520 }, { "entropy": 6.475429058074951, "epoch": 2.0893573759965753, "grad_norm": 1.5390625, "learning_rate": 0.0004568668819035406, "loss": 6.1243, "mean_token_accuracy": 0.1414799951016903, "num_tokens": 42257523.0, "step": 19525 }, { "entropy": 6.570040369033814, "epoch": 2.0898924501043394, "grad_norm": 1.6015625, "learning_rate": 0.00045684436844642694, "loss": 6.1557, "mean_token_accuracy": 0.14639808982610703, "num_tokens": 42267727.0, "step": 19530 }, { "entropy": 6.544137954711914, "epoch": 2.0904275242121035, "grad_norm": 1.7734375, "learning_rate": 0.0004568218497385828, "loss": 6.1275, "mean_token_accuracy": 0.1419399283826351, "num_tokens": 42278201.0, "step": 19535 }, { "entropy": 6.477737379074097, "epoch": 2.090962598319867, "grad_norm": 1.5390625, "learning_rate": 0.0004567993257806582, "loss": 6.2222, "mean_token_accuracy": 0.13735170289874077, "num_tokens": 42288695.0, "step": 19540 }, { "entropy": 6.477229118347168, "epoch": 2.0914976724276313, "grad_norm": 1.3828125, "learning_rate": 0.0004567767965733036, "loss": 6.2077, "mean_token_accuracy": 0.1436895728111267, "num_tokens": 42299418.0, "step": 19545 }, { "entropy": 6.500970315933228, "epoch": 2.092032746535395, "grad_norm": 1.5625, "learning_rate": 0.00045675426211716963, "loss": 6.0765, "mean_token_accuracy": 0.14467365369200708, "num_tokens": 42310901.0, "step": 19550 }, { "entropy": 6.553741312026977, "epoch": 2.092567820643159, "grad_norm": 1.296875, "learning_rate": 0.0004567317224129069, "loss": 6.0842, "mean_token_accuracy": 0.14897666946053506, "num_tokens": 42320055.0, "step": 19555 }, { "entropy": 6.481790685653687, "epoch": 2.093102894750923, "grad_norm": 1.359375, "learning_rate": 0.0004567091774611661, "loss": 6.2306, "mean_token_accuracy": 0.13946203663945198, "num_tokens": 42330393.0, "step": 19560 }, { "entropy": 6.40696496963501, "epoch": 2.093637968858687, "grad_norm": 1.515625, "learning_rate": 0.00045668662726259846, "loss": 6.1194, "mean_token_accuracy": 0.14474439173936843, "num_tokens": 42341384.0, "step": 19565 }, { "entropy": 6.495103406906128, "epoch": 2.094173042966451, "grad_norm": 1.5703125, "learning_rate": 0.00045666407181785496, "loss": 6.059, "mean_token_accuracy": 0.1518527738749981, "num_tokens": 42352351.0, "step": 19570 }, { "entropy": 6.419457292556762, "epoch": 2.094708117074215, "grad_norm": 1.8515625, "learning_rate": 0.0004566415111275869, "loss": 6.0675, "mean_token_accuracy": 0.14589630886912347, "num_tokens": 42363912.0, "step": 19575 }, { "entropy": 6.458062553405762, "epoch": 2.0952431911819787, "grad_norm": 1.5625, "learning_rate": 0.0004566189451924457, "loss": 6.144, "mean_token_accuracy": 0.14219927787780762, "num_tokens": 42374638.0, "step": 19580 }, { "entropy": 6.441175651550293, "epoch": 2.0957782652897428, "grad_norm": 1.359375, "learning_rate": 0.00045659637401308296, "loss": 6.0751, "mean_token_accuracy": 0.15543012022972108, "num_tokens": 42385976.0, "step": 19585 }, { "entropy": 6.469603681564331, "epoch": 2.0963133393975064, "grad_norm": 1.140625, "learning_rate": 0.0004565737975901505, "loss": 6.1399, "mean_token_accuracy": 0.13748691454529763, "num_tokens": 42395714.0, "step": 19590 }, { "entropy": 6.465291452407837, "epoch": 2.0968484135052705, "grad_norm": 1.375, "learning_rate": 0.0004565512159243001, "loss": 6.0442, "mean_token_accuracy": 0.1491420179605484, "num_tokens": 42406027.0, "step": 19595 }, { "entropy": 6.539014196395874, "epoch": 2.0973834876130346, "grad_norm": 1.5703125, "learning_rate": 0.0004565286290161839, "loss": 6.1953, "mean_token_accuracy": 0.1383569948375225, "num_tokens": 42417756.0, "step": 19600 }, { "entropy": 6.514355230331421, "epoch": 2.0979185617207983, "grad_norm": 1.6640625, "learning_rate": 0.00045650603686645403, "loss": 6.1937, "mean_token_accuracy": 0.13685153424739838, "num_tokens": 42429321.0, "step": 19605 }, { "entropy": 6.424641132354736, "epoch": 2.0984536358285624, "grad_norm": 1.2578125, "learning_rate": 0.00045648343947576284, "loss": 6.0116, "mean_token_accuracy": 0.15203089416027069, "num_tokens": 42440003.0, "step": 19610 }, { "entropy": 6.523432636260987, "epoch": 2.098988709936326, "grad_norm": 1.5, "learning_rate": 0.0004564608368447628, "loss": 6.1335, "mean_token_accuracy": 0.1436428375542164, "num_tokens": 42450743.0, "step": 19615 }, { "entropy": 6.451916790008545, "epoch": 2.09952378404409, "grad_norm": 1.953125, "learning_rate": 0.0004564382289741067, "loss": 6.1269, "mean_token_accuracy": 0.13660894110798835, "num_tokens": 42460885.0, "step": 19620 }, { "entropy": 6.415532541275025, "epoch": 2.1000588581518542, "grad_norm": 1.8984375, "learning_rate": 0.00045641561586444706, "loss": 6.1172, "mean_token_accuracy": 0.14363902807235718, "num_tokens": 42470854.0, "step": 19625 }, { "entropy": 6.425800848007202, "epoch": 2.100593932259618, "grad_norm": 1.7890625, "learning_rate": 0.00045639299751643714, "loss": 6.1878, "mean_token_accuracy": 0.13822885900735854, "num_tokens": 42482392.0, "step": 19630 }, { "entropy": 6.537102174758911, "epoch": 2.101129006367382, "grad_norm": 1.40625, "learning_rate": 0.00045637037393072996, "loss": 6.1574, "mean_token_accuracy": 0.1353036232292652, "num_tokens": 42494156.0, "step": 19635 }, { "entropy": 6.513655471801758, "epoch": 2.1016640804751456, "grad_norm": 1.3046875, "learning_rate": 0.0004563477451079786, "loss": 6.1477, "mean_token_accuracy": 0.1431437224149704, "num_tokens": 42505185.0, "step": 19640 }, { "entropy": 6.388147211074829, "epoch": 2.1021991545829097, "grad_norm": 1.390625, "learning_rate": 0.00045632511104883657, "loss": 6.0645, "mean_token_accuracy": 0.14328691661357879, "num_tokens": 42516415.0, "step": 19645 }, { "entropy": 6.4794971466064455, "epoch": 2.102734228690674, "grad_norm": 1.25, "learning_rate": 0.0004563024717539575, "loss": 6.1551, "mean_token_accuracy": 0.14822357147932053, "num_tokens": 42526945.0, "step": 19650 }, { "entropy": 6.578627300262451, "epoch": 2.1032693027984375, "grad_norm": 1.3046875, "learning_rate": 0.00045627982722399506, "loss": 6.2086, "mean_token_accuracy": 0.1379284031689167, "num_tokens": 42537629.0, "step": 19655 }, { "entropy": 6.435596323013305, "epoch": 2.1038043769062016, "grad_norm": 1.609375, "learning_rate": 0.00045625717745960306, "loss": 6.1465, "mean_token_accuracy": 0.1474095955491066, "num_tokens": 42547952.0, "step": 19660 }, { "entropy": 6.432778358459473, "epoch": 2.1043394510139652, "grad_norm": 1.4140625, "learning_rate": 0.00045623452246143547, "loss": 6.1244, "mean_token_accuracy": 0.1428218349814415, "num_tokens": 42559026.0, "step": 19665 }, { "entropy": 6.5374414920806885, "epoch": 2.1048745251217293, "grad_norm": 1.4765625, "learning_rate": 0.0004562118622301466, "loss": 6.1833, "mean_token_accuracy": 0.1409413531422615, "num_tokens": 42570046.0, "step": 19670 }, { "entropy": 6.548043823242187, "epoch": 2.1054095992294934, "grad_norm": 1.2265625, "learning_rate": 0.0004561891967663906, "loss": 6.1814, "mean_token_accuracy": 0.13744086623191834, "num_tokens": 42580440.0, "step": 19675 }, { "entropy": 6.514630222320557, "epoch": 2.105944673337257, "grad_norm": 1.3828125, "learning_rate": 0.00045616652607082203, "loss": 6.1228, "mean_token_accuracy": 0.13829393386840821, "num_tokens": 42591872.0, "step": 19680 }, { "entropy": 6.445277261734009, "epoch": 2.106479747445021, "grad_norm": 1.5703125, "learning_rate": 0.0004561438501440955, "loss": 6.043, "mean_token_accuracy": 0.13981586173176766, "num_tokens": 42602843.0, "step": 19685 }, { "entropy": 6.445372295379639, "epoch": 2.107014821552785, "grad_norm": 1.3984375, "learning_rate": 0.0004561211689868657, "loss": 6.1625, "mean_token_accuracy": 0.14785133600234984, "num_tokens": 42613476.0, "step": 19690 }, { "entropy": 6.4247962474823, "epoch": 2.107549895660549, "grad_norm": 1.546875, "learning_rate": 0.00045609848259978766, "loss": 6.0263, "mean_token_accuracy": 0.15796087831258773, "num_tokens": 42624059.0, "step": 19695 }, { "entropy": 6.483630037307739, "epoch": 2.108084969768313, "grad_norm": 1.3125, "learning_rate": 0.0004560757909835164, "loss": 6.1937, "mean_token_accuracy": 0.14062246009707452, "num_tokens": 42633980.0, "step": 19700 }, { "entropy": 6.498415565490722, "epoch": 2.1086200438760767, "grad_norm": 1.4453125, "learning_rate": 0.00045605309413870697, "loss": 6.1854, "mean_token_accuracy": 0.13881975784897804, "num_tokens": 42645504.0, "step": 19705 }, { "entropy": 6.537342214584351, "epoch": 2.109155117983841, "grad_norm": 1.3828125, "learning_rate": 0.0004560303920660151, "loss": 6.157, "mean_token_accuracy": 0.13537875711917877, "num_tokens": 42655403.0, "step": 19710 }, { "entropy": 6.579575824737549, "epoch": 2.1096901920916045, "grad_norm": 1.4375, "learning_rate": 0.00045600768476609596, "loss": 6.1938, "mean_token_accuracy": 0.14258636981248857, "num_tokens": 42666236.0, "step": 19715 }, { "entropy": 6.493932390213013, "epoch": 2.1102252661993686, "grad_norm": 1.6640625, "learning_rate": 0.00045598497223960533, "loss": 6.2648, "mean_token_accuracy": 0.13089609593153, "num_tokens": 42677365.0, "step": 19720 }, { "entropy": 6.489971113204956, "epoch": 2.1107603403071327, "grad_norm": 1.296875, "learning_rate": 0.00045596225448719913, "loss": 6.1204, "mean_token_accuracy": 0.1416928417980671, "num_tokens": 42688518.0, "step": 19725 }, { "entropy": 6.501855516433716, "epoch": 2.1112954144148963, "grad_norm": 2.15625, "learning_rate": 0.00045593953150953326, "loss": 6.1541, "mean_token_accuracy": 0.1406565338373184, "num_tokens": 42699877.0, "step": 19730 }, { "entropy": 6.451576900482178, "epoch": 2.1118304885226604, "grad_norm": 1.3984375, "learning_rate": 0.0004559168033072638, "loss": 6.1115, "mean_token_accuracy": 0.14994507431983947, "num_tokens": 42710191.0, "step": 19735 }, { "entropy": 6.479924058914184, "epoch": 2.1123655626304245, "grad_norm": 1.8984375, "learning_rate": 0.00045589406988104717, "loss": 6.2051, "mean_token_accuracy": 0.14160223454236984, "num_tokens": 42720874.0, "step": 19740 }, { "entropy": 6.5164580821990965, "epoch": 2.112900636738188, "grad_norm": 1.46875, "learning_rate": 0.0004558713312315396, "loss": 6.1598, "mean_token_accuracy": 0.14363001137971879, "num_tokens": 42731783.0, "step": 19745 }, { "entropy": 6.487932395935059, "epoch": 2.1134357108459523, "grad_norm": 1.46875, "learning_rate": 0.0004558485873593978, "loss": 6.1388, "mean_token_accuracy": 0.14117844849824907, "num_tokens": 42741602.0, "step": 19750 }, { "entropy": 6.53803071975708, "epoch": 2.113970784953716, "grad_norm": 1.4375, "learning_rate": 0.00045582583826527835, "loss": 6.1048, "mean_token_accuracy": 0.14546334072947503, "num_tokens": 42751249.0, "step": 19755 }, { "entropy": 6.469318437576294, "epoch": 2.11450585906148, "grad_norm": 1.359375, "learning_rate": 0.0004558030839498383, "loss": 6.1202, "mean_token_accuracy": 0.1475038781762123, "num_tokens": 42762083.0, "step": 19760 }, { "entropy": 6.468356037139893, "epoch": 2.115040933169244, "grad_norm": 1.40625, "learning_rate": 0.0004557803244137347, "loss": 5.9867, "mean_token_accuracy": 0.16054053381085395, "num_tokens": 42773443.0, "step": 19765 }, { "entropy": 6.450197792053222, "epoch": 2.115576007277008, "grad_norm": 1.3984375, "learning_rate": 0.0004557575596576245, "loss": 6.182, "mean_token_accuracy": 0.1410667136311531, "num_tokens": 42784126.0, "step": 19770 }, { "entropy": 6.411456775665283, "epoch": 2.116111081384772, "grad_norm": 1.4140625, "learning_rate": 0.00045573478968216526, "loss": 6.0743, "mean_token_accuracy": 0.1495702773332596, "num_tokens": 42795472.0, "step": 19775 }, { "entropy": 6.448283720016479, "epoch": 2.1166461554925355, "grad_norm": 1.359375, "learning_rate": 0.00045571201448801424, "loss": 6.1098, "mean_token_accuracy": 0.149944069981575, "num_tokens": 42805279.0, "step": 19780 }, { "entropy": 6.497313356399536, "epoch": 2.1171812296002996, "grad_norm": 1.8515625, "learning_rate": 0.0004556892340758293, "loss": 6.1671, "mean_token_accuracy": 0.14337343201041222, "num_tokens": 42815680.0, "step": 19785 }, { "entropy": 6.541849040985108, "epoch": 2.1177163037080637, "grad_norm": 1.65625, "learning_rate": 0.0004556664484462681, "loss": 6.2099, "mean_token_accuracy": 0.13567657470703126, "num_tokens": 42826724.0, "step": 19790 }, { "entropy": 6.561293220520019, "epoch": 2.1182513778158274, "grad_norm": 1.296875, "learning_rate": 0.00045564365759998856, "loss": 6.1381, "mean_token_accuracy": 0.13923074975609778, "num_tokens": 42837875.0, "step": 19795 }, { "entropy": 6.4971517562866214, "epoch": 2.1187864519235915, "grad_norm": 1.9921875, "learning_rate": 0.0004556208615376488, "loss": 6.1288, "mean_token_accuracy": 0.13982677981257438, "num_tokens": 42848714.0, "step": 19800 }, { "entropy": 6.450415515899659, "epoch": 2.119321526031355, "grad_norm": 1.28125, "learning_rate": 0.0004555980602599071, "loss": 6.2049, "mean_token_accuracy": 0.14171442985534669, "num_tokens": 42859764.0, "step": 19805 }, { "entropy": 6.411892223358154, "epoch": 2.1198566001391193, "grad_norm": 1.28125, "learning_rate": 0.0004555752537674217, "loss": 6.0488, "mean_token_accuracy": 0.1471356302499771, "num_tokens": 42870346.0, "step": 19810 }, { "entropy": 6.4905595779418945, "epoch": 2.1203916742468834, "grad_norm": 1.34375, "learning_rate": 0.0004555524420608513, "loss": 6.151, "mean_token_accuracy": 0.14037445932626724, "num_tokens": 42882706.0, "step": 19815 }, { "entropy": 6.459938287734985, "epoch": 2.120926748354647, "grad_norm": 1.2265625, "learning_rate": 0.00045552962514085443, "loss": 6.1399, "mean_token_accuracy": 0.14691274538636206, "num_tokens": 42893611.0, "step": 19820 }, { "entropy": 6.507153940200806, "epoch": 2.121461822462411, "grad_norm": 1.2734375, "learning_rate": 0.00045550680300809003, "loss": 6.0925, "mean_token_accuracy": 0.1446467638015747, "num_tokens": 42904034.0, "step": 19825 }, { "entropy": 6.4270158290863035, "epoch": 2.1219968965701748, "grad_norm": 1.34375, "learning_rate": 0.00045548397566321706, "loss": 6.1326, "mean_token_accuracy": 0.1386638194322586, "num_tokens": 42915530.0, "step": 19830 }, { "entropy": 6.4584770679473875, "epoch": 2.122531970677939, "grad_norm": 1.4140625, "learning_rate": 0.0004554611431068947, "loss": 6.1172, "mean_token_accuracy": 0.1420776851475239, "num_tokens": 42926696.0, "step": 19835 }, { "entropy": 6.492058563232422, "epoch": 2.123067044785703, "grad_norm": 1.3125, "learning_rate": 0.0004554383053397822, "loss": 6.1481, "mean_token_accuracy": 0.1484109416604042, "num_tokens": 42936985.0, "step": 19840 }, { "entropy": 6.484788322448731, "epoch": 2.1236021188934666, "grad_norm": 1.2109375, "learning_rate": 0.00045541546236253896, "loss": 6.1026, "mean_token_accuracy": 0.14406656697392464, "num_tokens": 42947996.0, "step": 19845 }, { "entropy": 6.438353872299194, "epoch": 2.1241371930012307, "grad_norm": 1.3515625, "learning_rate": 0.00045539261417582456, "loss": 6.0468, "mean_token_accuracy": 0.1453639894723892, "num_tokens": 42959669.0, "step": 19850 }, { "entropy": 6.403155374526977, "epoch": 2.124672267108995, "grad_norm": 1.40625, "learning_rate": 0.00045536976078029874, "loss": 6.015, "mean_token_accuracy": 0.1479623094201088, "num_tokens": 42969687.0, "step": 19855 }, { "entropy": 6.461460113525391, "epoch": 2.1252073412167585, "grad_norm": 1.3046875, "learning_rate": 0.0004553469021766215, "loss": 6.1957, "mean_token_accuracy": 0.13120304346084594, "num_tokens": 42980752.0, "step": 19860 }, { "entropy": 6.529850339889526, "epoch": 2.1257424153245226, "grad_norm": 1.53125, "learning_rate": 0.00045532403836545286, "loss": 6.2371, "mean_token_accuracy": 0.1411494120955467, "num_tokens": 42991949.0, "step": 19865 }, { "entropy": 6.461529397964478, "epoch": 2.1262774894322862, "grad_norm": 1.2734375, "learning_rate": 0.0004553011693474528, "loss": 6.0999, "mean_token_accuracy": 0.1494043216109276, "num_tokens": 43002689.0, "step": 19870 }, { "entropy": 6.485022020339966, "epoch": 2.1268125635400503, "grad_norm": 1.484375, "learning_rate": 0.0004552782951232819, "loss": 6.1641, "mean_token_accuracy": 0.14168797582387924, "num_tokens": 43012939.0, "step": 19875 }, { "entropy": 6.468227243423462, "epoch": 2.1273476376478144, "grad_norm": 1.671875, "learning_rate": 0.00045525541569360053, "loss": 6.1082, "mean_token_accuracy": 0.14344905391335488, "num_tokens": 43023887.0, "step": 19880 }, { "entropy": 6.423562860488891, "epoch": 2.127882711755578, "grad_norm": 1.3828125, "learning_rate": 0.0004552325310590694, "loss": 6.0478, "mean_token_accuracy": 0.1459365077316761, "num_tokens": 43034554.0, "step": 19885 }, { "entropy": 6.529317188262939, "epoch": 2.128417785863342, "grad_norm": 1.2578125, "learning_rate": 0.0004552096412203492, "loss": 6.1942, "mean_token_accuracy": 0.14376000091433525, "num_tokens": 43046322.0, "step": 19890 }, { "entropy": 6.50398736000061, "epoch": 2.128952859971106, "grad_norm": 1.578125, "learning_rate": 0.000455186746178101, "loss": 6.0681, "mean_token_accuracy": 0.14861174970865249, "num_tokens": 43055981.0, "step": 19895 }, { "entropy": 6.5121767044067385, "epoch": 2.12948793407887, "grad_norm": 1.3046875, "learning_rate": 0.00045516384593298584, "loss": 6.1534, "mean_token_accuracy": 0.13824398666620255, "num_tokens": 43067217.0, "step": 19900 }, { "entropy": 6.50492148399353, "epoch": 2.130023008186634, "grad_norm": 1.296875, "learning_rate": 0.00045514094048566486, "loss": 6.1485, "mean_token_accuracy": 0.1418042376637459, "num_tokens": 43078312.0, "step": 19905 }, { "entropy": 6.346564769744873, "epoch": 2.1305580822943977, "grad_norm": 1.5078125, "learning_rate": 0.00045511802983679955, "loss": 5.9708, "mean_token_accuracy": 0.15819320529699327, "num_tokens": 43090210.0, "step": 19910 }, { "entropy": 6.455585718154907, "epoch": 2.131093156402162, "grad_norm": 1.3984375, "learning_rate": 0.0004550951139870515, "loss": 6.0853, "mean_token_accuracy": 0.14370020031929015, "num_tokens": 43101282.0, "step": 19915 }, { "entropy": 6.4974658489227295, "epoch": 2.1316282305099254, "grad_norm": 1.328125, "learning_rate": 0.00045507219293708227, "loss": 6.2081, "mean_token_accuracy": 0.13790655955672265, "num_tokens": 43112856.0, "step": 19920 }, { "entropy": 6.454631757736206, "epoch": 2.1321633046176895, "grad_norm": 1.4375, "learning_rate": 0.00045504926668755384, "loss": 6.0685, "mean_token_accuracy": 0.15341846123337746, "num_tokens": 43123898.0, "step": 19925 }, { "entropy": 6.5012664794921875, "epoch": 2.1326983787254536, "grad_norm": 1.90625, "learning_rate": 0.0004550263352391281, "loss": 6.122, "mean_token_accuracy": 0.14729975908994675, "num_tokens": 43134651.0, "step": 19930 }, { "entropy": 6.511061096191407, "epoch": 2.1332334528332173, "grad_norm": 1.390625, "learning_rate": 0.0004550033985924672, "loss": 6.1586, "mean_token_accuracy": 0.14541507959365846, "num_tokens": 43145385.0, "step": 19935 }, { "entropy": 6.495218086242676, "epoch": 2.1337685269409814, "grad_norm": 1.4609375, "learning_rate": 0.0004549804567482335, "loss": 6.1447, "mean_token_accuracy": 0.1441176116466522, "num_tokens": 43157356.0, "step": 19940 }, { "entropy": 6.519485569000244, "epoch": 2.134303601048745, "grad_norm": 1.3984375, "learning_rate": 0.00045495750970708944, "loss": 6.1541, "mean_token_accuracy": 0.14577193707227706, "num_tokens": 43168289.0, "step": 19945 }, { "entropy": 6.421923637390137, "epoch": 2.134838675156509, "grad_norm": 1.3515625, "learning_rate": 0.00045493455746969746, "loss": 6.0807, "mean_token_accuracy": 0.14722421169281005, "num_tokens": 43177796.0, "step": 19950 }, { "entropy": 6.441613817214966, "epoch": 2.1353737492642733, "grad_norm": 1.2578125, "learning_rate": 0.0004549116000367205, "loss": 6.0906, "mean_token_accuracy": 0.1484612539410591, "num_tokens": 43188846.0, "step": 19955 }, { "entropy": 6.508660173416137, "epoch": 2.135908823372037, "grad_norm": 2.125, "learning_rate": 0.00045488863740882133, "loss": 6.188, "mean_token_accuracy": 0.1432749792933464, "num_tokens": 43199852.0, "step": 19960 }, { "entropy": 6.499727439880371, "epoch": 2.136443897479801, "grad_norm": 1.3046875, "learning_rate": 0.00045486566958666307, "loss": 6.0877, "mean_token_accuracy": 0.1441863916814327, "num_tokens": 43210591.0, "step": 19965 }, { "entropy": 6.491096925735474, "epoch": 2.136978971587565, "grad_norm": 1.2890625, "learning_rate": 0.00045484269657090887, "loss": 6.0798, "mean_token_accuracy": 0.14160085022449492, "num_tokens": 43221760.0, "step": 19970 }, { "entropy": 6.468918561935425, "epoch": 2.1375140456953288, "grad_norm": 1.1640625, "learning_rate": 0.00045481971836222205, "loss": 6.199, "mean_token_accuracy": 0.1341404989361763, "num_tokens": 43233693.0, "step": 19975 }, { "entropy": 6.487259244918823, "epoch": 2.138049119803093, "grad_norm": 1.203125, "learning_rate": 0.00045479673496126615, "loss": 6.155, "mean_token_accuracy": 0.14123794063925743, "num_tokens": 43244565.0, "step": 19980 }, { "entropy": 6.4275530815124515, "epoch": 2.1385841939108565, "grad_norm": 1.390625, "learning_rate": 0.00045477374636870485, "loss": 6.0779, "mean_token_accuracy": 0.1453502856194973, "num_tokens": 43254913.0, "step": 19985 }, { "entropy": 6.498678398132324, "epoch": 2.1391192680186206, "grad_norm": 1.2890625, "learning_rate": 0.00045475075258520175, "loss": 6.1316, "mean_token_accuracy": 0.14247939884662628, "num_tokens": 43265525.0, "step": 19990 }, { "entropy": 6.471640920639038, "epoch": 2.1396543421263843, "grad_norm": 3.109375, "learning_rate": 0.0004547277536114211, "loss": 6.2169, "mean_token_accuracy": 0.13235984146595, "num_tokens": 43276954.0, "step": 19995 }, { "entropy": 6.4997851848602295, "epoch": 2.1401894162341484, "grad_norm": 1.3203125, "learning_rate": 0.0004547047494480267, "loss": 6.1296, "mean_token_accuracy": 0.1417925976216793, "num_tokens": 43287491.0, "step": 20000 }, { "entropy": 6.481905317306518, "epoch": 2.1407244903419125, "grad_norm": 1.5, "learning_rate": 0.0004546817400956829, "loss": 6.1759, "mean_token_accuracy": 0.1345571480691433, "num_tokens": 43298341.0, "step": 20005 }, { "entropy": 6.405822467803955, "epoch": 2.141259564449676, "grad_norm": 1.5, "learning_rate": 0.00045465872555505417, "loss": 6.0836, "mean_token_accuracy": 0.15132260620594024, "num_tokens": 43309450.0, "step": 20010 }, { "entropy": 6.5346914768219, "epoch": 2.1417946385574402, "grad_norm": 1.3046875, "learning_rate": 0.000454635705826805, "loss": 6.133, "mean_token_accuracy": 0.1373695246875286, "num_tokens": 43320126.0, "step": 20015 }, { "entropy": 6.544931650161743, "epoch": 2.1423297126652043, "grad_norm": 1.484375, "learning_rate": 0.0004546126809116, "loss": 6.2096, "mean_token_accuracy": 0.13375122770667075, "num_tokens": 43331347.0, "step": 20020 }, { "entropy": 6.47828688621521, "epoch": 2.142864786772968, "grad_norm": 1.9609375, "learning_rate": 0.0004545896508101041, "loss": 6.1011, "mean_token_accuracy": 0.14316849485039712, "num_tokens": 43341351.0, "step": 20025 }, { "entropy": 6.532412767410278, "epoch": 2.143399860880732, "grad_norm": 1.484375, "learning_rate": 0.0004545666155229823, "loss": 6.1966, "mean_token_accuracy": 0.14234084039926528, "num_tokens": 43352471.0, "step": 20030 }, { "entropy": 6.519003868103027, "epoch": 2.1439349349884957, "grad_norm": 1.40625, "learning_rate": 0.00045454357505089965, "loss": 6.0795, "mean_token_accuracy": 0.14596754610538482, "num_tokens": 43363041.0, "step": 20035 }, { "entropy": 6.442016220092773, "epoch": 2.14447000909626, "grad_norm": 1.5078125, "learning_rate": 0.0004545205293945215, "loss": 6.0854, "mean_token_accuracy": 0.14105915054678916, "num_tokens": 43375034.0, "step": 20040 }, { "entropy": 6.487355136871338, "epoch": 2.145005083204024, "grad_norm": 1.8203125, "learning_rate": 0.0004544974785545134, "loss": 6.2379, "mean_token_accuracy": 0.13306314796209334, "num_tokens": 43386110.0, "step": 20045 }, { "entropy": 6.515271520614624, "epoch": 2.1455401573117876, "grad_norm": 1.234375, "learning_rate": 0.0004544744225315407, "loss": 6.12, "mean_token_accuracy": 0.14595941603183746, "num_tokens": 43396150.0, "step": 20050 }, { "entropy": 6.488174629211426, "epoch": 2.1460752314195517, "grad_norm": 1.640625, "learning_rate": 0.0004544513613262693, "loss": 6.1558, "mean_token_accuracy": 0.14052343890070915, "num_tokens": 43407237.0, "step": 20055 }, { "entropy": 6.469608306884766, "epoch": 2.1466103055273154, "grad_norm": 2.171875, "learning_rate": 0.0004544282949393652, "loss": 6.0608, "mean_token_accuracy": 0.14775441437959672, "num_tokens": 43417626.0, "step": 20060 }, { "entropy": 6.488646841049194, "epoch": 2.1471453796350795, "grad_norm": 1.828125, "learning_rate": 0.0004544052233714941, "loss": 6.1114, "mean_token_accuracy": 0.14532986730337144, "num_tokens": 43427368.0, "step": 20065 }, { "entropy": 6.430359697341919, "epoch": 2.1476804537428436, "grad_norm": 1.953125, "learning_rate": 0.00045438214662332245, "loss": 6.0955, "mean_token_accuracy": 0.1424453228712082, "num_tokens": 43438159.0, "step": 20070 }, { "entropy": 6.4834716796875, "epoch": 2.148215527850607, "grad_norm": 1.4921875, "learning_rate": 0.00045435906469551657, "loss": 6.1643, "mean_token_accuracy": 0.14322199895977974, "num_tokens": 43447403.0, "step": 20075 }, { "entropy": 6.49311900138855, "epoch": 2.1487506019583713, "grad_norm": 1.5859375, "learning_rate": 0.00045433597758874286, "loss": 6.0351, "mean_token_accuracy": 0.15143866688013077, "num_tokens": 43457713.0, "step": 20080 }, { "entropy": 6.494896507263183, "epoch": 2.149285676066135, "grad_norm": 2.84375, "learning_rate": 0.000454312885303668, "loss": 6.1651, "mean_token_accuracy": 0.1441124878823757, "num_tokens": 43468520.0, "step": 20085 }, { "entropy": 6.5642084121704105, "epoch": 2.149820750173899, "grad_norm": 1.6640625, "learning_rate": 0.00045428978784095873, "loss": 6.2057, "mean_token_accuracy": 0.13654238730669022, "num_tokens": 43480501.0, "step": 20090 }, { "entropy": 6.568170070648193, "epoch": 2.150355824281663, "grad_norm": 3.0, "learning_rate": 0.00045426668520128204, "loss": 6.1422, "mean_token_accuracy": 0.14247775599360465, "num_tokens": 43491297.0, "step": 20095 }, { "entropy": 6.522011947631836, "epoch": 2.150890898389427, "grad_norm": 1.2578125, "learning_rate": 0.0004542435773853051, "loss": 6.1619, "mean_token_accuracy": 0.14496304243803024, "num_tokens": 43501212.0, "step": 20100 }, { "entropy": 6.419024419784546, "epoch": 2.151425972497191, "grad_norm": 1.3984375, "learning_rate": 0.000454220464393695, "loss": 6.1826, "mean_token_accuracy": 0.13840727582573892, "num_tokens": 43511136.0, "step": 20105 }, { "entropy": 6.552536344528198, "epoch": 2.1519610466049546, "grad_norm": 1.3984375, "learning_rate": 0.0004541973462271192, "loss": 6.2204, "mean_token_accuracy": 0.1390797473490238, "num_tokens": 43522006.0, "step": 20110 }, { "entropy": 6.53021936416626, "epoch": 2.1524961207127187, "grad_norm": 1.5859375, "learning_rate": 0.0004541742228862451, "loss": 6.124, "mean_token_accuracy": 0.14211415946483613, "num_tokens": 43532746.0, "step": 20115 }, { "entropy": 6.430755567550659, "epoch": 2.1530311948204828, "grad_norm": 1.6640625, "learning_rate": 0.00045415109437174064, "loss": 6.1255, "mean_token_accuracy": 0.14374642074108124, "num_tokens": 43543707.0, "step": 20120 }, { "entropy": 6.490007734298706, "epoch": 2.1535662689282464, "grad_norm": 1.5, "learning_rate": 0.00045412796068427337, "loss": 6.1222, "mean_token_accuracy": 0.13703791201114654, "num_tokens": 43555029.0, "step": 20125 }, { "entropy": 6.537265777587891, "epoch": 2.1541013430360105, "grad_norm": 1.2265625, "learning_rate": 0.00045410482182451153, "loss": 6.1713, "mean_token_accuracy": 0.13964841812849044, "num_tokens": 43565639.0, "step": 20130 }, { "entropy": 6.462145185470581, "epoch": 2.1546364171437746, "grad_norm": 1.6015625, "learning_rate": 0.00045408167779312306, "loss": 6.0697, "mean_token_accuracy": 0.1506087988615036, "num_tokens": 43576333.0, "step": 20135 }, { "entropy": 6.521839714050293, "epoch": 2.1551714912515383, "grad_norm": 1.59375, "learning_rate": 0.00045405852859077626, "loss": 6.113, "mean_token_accuracy": 0.13899362310767174, "num_tokens": 43587012.0, "step": 20140 }, { "entropy": 6.470482683181762, "epoch": 2.1557065653593024, "grad_norm": 1.234375, "learning_rate": 0.00045403537421813975, "loss": 6.0721, "mean_token_accuracy": 0.14818194955587388, "num_tokens": 43597779.0, "step": 20145 }, { "entropy": 6.523967313766479, "epoch": 2.156241639467066, "grad_norm": 1.5078125, "learning_rate": 0.00045401221467588184, "loss": 6.1155, "mean_token_accuracy": 0.1424321189522743, "num_tokens": 43608631.0, "step": 20150 }, { "entropy": 6.515417098999023, "epoch": 2.15677671357483, "grad_norm": 1.59375, "learning_rate": 0.0004539890499646714, "loss": 6.0902, "mean_token_accuracy": 0.1509397327899933, "num_tokens": 43620254.0, "step": 20155 }, { "entropy": 6.435489892959595, "epoch": 2.1573117876825942, "grad_norm": 1.3515625, "learning_rate": 0.0004539658800851773, "loss": 6.0606, "mean_token_accuracy": 0.14455048590898514, "num_tokens": 43630986.0, "step": 20160 }, { "entropy": 6.40526442527771, "epoch": 2.157846861790358, "grad_norm": 1.3515625, "learning_rate": 0.0004539427050380686, "loss": 6.0707, "mean_token_accuracy": 0.13671587854623796, "num_tokens": 43641260.0, "step": 20165 }, { "entropy": 6.499885511398316, "epoch": 2.158381935898122, "grad_norm": 2.109375, "learning_rate": 0.00045391952482401444, "loss": 6.2201, "mean_token_accuracy": 0.14062789976596832, "num_tokens": 43652093.0, "step": 20170 }, { "entropy": 6.51837124824524, "epoch": 2.1589170100058857, "grad_norm": 1.46875, "learning_rate": 0.00045389633944368406, "loss": 6.1231, "mean_token_accuracy": 0.14618946686387063, "num_tokens": 43662799.0, "step": 20175 }, { "entropy": 6.461586856842041, "epoch": 2.1594520841136498, "grad_norm": 1.5390625, "learning_rate": 0.0004538731488977471, "loss": 6.0813, "mean_token_accuracy": 0.14218505173921586, "num_tokens": 43674198.0, "step": 20180 }, { "entropy": 6.459530305862427, "epoch": 2.159987158221414, "grad_norm": 1.3125, "learning_rate": 0.0004538499531868731, "loss": 6.135, "mean_token_accuracy": 0.14445096328854562, "num_tokens": 43684841.0, "step": 20185 }, { "entropy": 6.54753041267395, "epoch": 2.1605222323291775, "grad_norm": 1.3046875, "learning_rate": 0.00045382675231173174, "loss": 6.2075, "mean_token_accuracy": 0.1367589585483074, "num_tokens": 43695903.0, "step": 20190 }, { "entropy": 6.533148527145386, "epoch": 2.1610573064369416, "grad_norm": 1.4140625, "learning_rate": 0.0004538035462729931, "loss": 6.1088, "mean_token_accuracy": 0.14191216602921486, "num_tokens": 43706740.0, "step": 20195 }, { "entropy": 6.493363237380981, "epoch": 2.1615923805447053, "grad_norm": 1.671875, "learning_rate": 0.0004537803350713273, "loss": 6.0901, "mean_token_accuracy": 0.14305991306900978, "num_tokens": 43717124.0, "step": 20200 }, { "entropy": 6.43371696472168, "epoch": 2.1621274546524694, "grad_norm": 1.34375, "learning_rate": 0.0004537571187074043, "loss": 6.0843, "mean_token_accuracy": 0.14660966843366624, "num_tokens": 43727346.0, "step": 20205 }, { "entropy": 6.550573539733887, "epoch": 2.1626625287602335, "grad_norm": 1.484375, "learning_rate": 0.00045373389718189464, "loss": 6.2389, "mean_token_accuracy": 0.1285846747457981, "num_tokens": 43738297.0, "step": 20210 }, { "entropy": 6.51973147392273, "epoch": 2.163197602867997, "grad_norm": 1.65625, "learning_rate": 0.0004537106704954689, "loss": 6.1433, "mean_token_accuracy": 0.14054710939526557, "num_tokens": 43749543.0, "step": 20215 }, { "entropy": 6.507083559036255, "epoch": 2.163732676975761, "grad_norm": 1.6171875, "learning_rate": 0.00045368743864879755, "loss": 6.1228, "mean_token_accuracy": 0.14513924196362496, "num_tokens": 43760324.0, "step": 20220 }, { "entropy": 6.542077159881591, "epoch": 2.164267751083525, "grad_norm": 1.328125, "learning_rate": 0.00045366420164255156, "loss": 6.1701, "mean_token_accuracy": 0.13762131631374358, "num_tokens": 43770391.0, "step": 20225 }, { "entropy": 6.423087930679321, "epoch": 2.164802825191289, "grad_norm": 1.3359375, "learning_rate": 0.0004536409594774019, "loss": 6.0891, "mean_token_accuracy": 0.13530075773596764, "num_tokens": 43781516.0, "step": 20230 }, { "entropy": 6.377832555770874, "epoch": 2.165337899299053, "grad_norm": 1.2890625, "learning_rate": 0.00045361771215401953, "loss": 6.1231, "mean_token_accuracy": 0.14707974418997766, "num_tokens": 43794152.0, "step": 20235 }, { "entropy": 6.518850564956665, "epoch": 2.1658729734068167, "grad_norm": 1.6796875, "learning_rate": 0.00045359445967307595, "loss": 6.1344, "mean_token_accuracy": 0.14454821422696112, "num_tokens": 43805712.0, "step": 20240 }, { "entropy": 6.557677412033081, "epoch": 2.166408047514581, "grad_norm": 1.3046875, "learning_rate": 0.0004535712020352423, "loss": 6.1807, "mean_token_accuracy": 0.1400250017642975, "num_tokens": 43816985.0, "step": 20245 }, { "entropy": 6.487140893936157, "epoch": 2.166943121622345, "grad_norm": 1.5078125, "learning_rate": 0.0004535479392411904, "loss": 6.0772, "mean_token_accuracy": 0.14423147365450859, "num_tokens": 43828048.0, "step": 20250 }, { "entropy": 6.512788724899292, "epoch": 2.1674781957301086, "grad_norm": 1.421875, "learning_rate": 0.00045352467129159183, "loss": 6.126, "mean_token_accuracy": 0.1426374226808548, "num_tokens": 43838507.0, "step": 20255 }, { "entropy": 6.404138040542603, "epoch": 2.1680132698378727, "grad_norm": 1.375, "learning_rate": 0.00045350139818711846, "loss": 6.062, "mean_token_accuracy": 0.14408638179302216, "num_tokens": 43849328.0, "step": 20260 }, { "entropy": 6.454526615142822, "epoch": 2.1685483439456363, "grad_norm": 1.3671875, "learning_rate": 0.0004534781199284423, "loss": 6.127, "mean_token_accuracy": 0.14136345461010932, "num_tokens": 43860311.0, "step": 20265 }, { "entropy": 6.540534973144531, "epoch": 2.1690834180534004, "grad_norm": 1.8359375, "learning_rate": 0.0004534548365162354, "loss": 6.2035, "mean_token_accuracy": 0.14096086621284484, "num_tokens": 43871167.0, "step": 20270 }, { "entropy": 6.461973047256469, "epoch": 2.169618492161164, "grad_norm": 2.234375, "learning_rate": 0.00045343154795117024, "loss": 6.093, "mean_token_accuracy": 0.14626741260290146, "num_tokens": 43882332.0, "step": 20275 }, { "entropy": 6.528645181655884, "epoch": 2.170153566268928, "grad_norm": 1.3125, "learning_rate": 0.0004534082542339192, "loss": 6.0265, "mean_token_accuracy": 0.14352528899908065, "num_tokens": 43892971.0, "step": 20280 }, { "entropy": 6.464555978775024, "epoch": 2.1706886403766923, "grad_norm": 1.234375, "learning_rate": 0.00045338495536515497, "loss": 6.1306, "mean_token_accuracy": 0.14322419315576554, "num_tokens": 43904305.0, "step": 20285 }, { "entropy": 6.3747905731201175, "epoch": 2.171223714484456, "grad_norm": 1.1875, "learning_rate": 0.0004533616513455502, "loss": 6.0864, "mean_token_accuracy": 0.14520493596792222, "num_tokens": 43914431.0, "step": 20290 }, { "entropy": 6.445853567123413, "epoch": 2.17175878859222, "grad_norm": 1.421875, "learning_rate": 0.00045333834217577775, "loss": 6.1185, "mean_token_accuracy": 0.14553093761205674, "num_tokens": 43925350.0, "step": 20295 }, { "entropy": 6.422257614135742, "epoch": 2.172293862699984, "grad_norm": 1.703125, "learning_rate": 0.00045331502785651075, "loss": 6.1685, "mean_token_accuracy": 0.1409260854125023, "num_tokens": 43936194.0, "step": 20300 }, { "entropy": 6.531687641143799, "epoch": 2.172828936807748, "grad_norm": 1.375, "learning_rate": 0.0004532917083884224, "loss": 6.1372, "mean_token_accuracy": 0.1401752181351185, "num_tokens": 43946692.0, "step": 20305 }, { "entropy": 6.509691047668457, "epoch": 2.173364010915512, "grad_norm": 2.25, "learning_rate": 0.000453268383772186, "loss": 6.106, "mean_token_accuracy": 0.14296674653887748, "num_tokens": 43957493.0, "step": 20310 }, { "entropy": 6.503253221511841, "epoch": 2.1738990850232756, "grad_norm": 1.5, "learning_rate": 0.00045324505400847506, "loss": 6.1942, "mean_token_accuracy": 0.14070744961500167, "num_tokens": 43970203.0, "step": 20315 }, { "entropy": 6.489485073089599, "epoch": 2.1744341591310397, "grad_norm": 1.453125, "learning_rate": 0.00045322171909796327, "loss": 6.1093, "mean_token_accuracy": 0.1403039015829563, "num_tokens": 43980778.0, "step": 20320 }, { "entropy": 6.466435480117798, "epoch": 2.1749692332388038, "grad_norm": 1.3125, "learning_rate": 0.00045319837904132435, "loss": 6.1138, "mean_token_accuracy": 0.14622555673122406, "num_tokens": 43992239.0, "step": 20325 }, { "entropy": 6.502254819869995, "epoch": 2.1755043073465674, "grad_norm": 2.28125, "learning_rate": 0.0004531750338392323, "loss": 6.142, "mean_token_accuracy": 0.1422283098101616, "num_tokens": 44001882.0, "step": 20330 }, { "entropy": 6.442241382598877, "epoch": 2.1760393814543315, "grad_norm": 1.4453125, "learning_rate": 0.0004531516834923611, "loss": 6.1096, "mean_token_accuracy": 0.14044273942708968, "num_tokens": 44013192.0, "step": 20335 }, { "entropy": 6.558344841003418, "epoch": 2.176574455562095, "grad_norm": 1.4140625, "learning_rate": 0.0004531283280013852, "loss": 6.1723, "mean_token_accuracy": 0.13786421865224838, "num_tokens": 44023072.0, "step": 20340 }, { "entropy": 6.533612155914307, "epoch": 2.1771095296698593, "grad_norm": 1.2890625, "learning_rate": 0.00045310496736697875, "loss": 6.1623, "mean_token_accuracy": 0.13985364958643914, "num_tokens": 44034238.0, "step": 20345 }, { "entropy": 6.473046875, "epoch": 2.1776446037776234, "grad_norm": 1.4765625, "learning_rate": 0.00045308160158981646, "loss": 6.1339, "mean_token_accuracy": 0.14215909615159034, "num_tokens": 44044392.0, "step": 20350 }, { "entropy": 6.464304065704345, "epoch": 2.178179677885387, "grad_norm": 1.4296875, "learning_rate": 0.000453058230670573, "loss": 6.1651, "mean_token_accuracy": 0.14172023087739943, "num_tokens": 44056129.0, "step": 20355 }, { "entropy": 6.444278764724731, "epoch": 2.178714751993151, "grad_norm": 1.4140625, "learning_rate": 0.00045303485460992303, "loss": 6.108, "mean_token_accuracy": 0.15108377784490584, "num_tokens": 44067600.0, "step": 20360 }, { "entropy": 6.47888035774231, "epoch": 2.1792498261009148, "grad_norm": 1.2578125, "learning_rate": 0.00045301147340854177, "loss": 6.0012, "mean_token_accuracy": 0.1531740114092827, "num_tokens": 44077373.0, "step": 20365 }, { "entropy": 6.477386331558227, "epoch": 2.179784900208679, "grad_norm": 1.2265625, "learning_rate": 0.00045298808706710416, "loss": 6.2171, "mean_token_accuracy": 0.14295275062322615, "num_tokens": 44087422.0, "step": 20370 }, { "entropy": 6.520819902420044, "epoch": 2.180319974316443, "grad_norm": 1.3515625, "learning_rate": 0.00045296469558628555, "loss": 6.1703, "mean_token_accuracy": 0.14255437552928923, "num_tokens": 44098524.0, "step": 20375 }, { "entropy": 6.4786275863647464, "epoch": 2.1808550484242066, "grad_norm": 1.3046875, "learning_rate": 0.00045294129896676134, "loss": 6.073, "mean_token_accuracy": 0.15057651251554488, "num_tokens": 44108340.0, "step": 20380 }, { "entropy": 6.45948371887207, "epoch": 2.1813901225319707, "grad_norm": 1.390625, "learning_rate": 0.0004529178972092071, "loss": 6.1272, "mean_token_accuracy": 0.1359841264784336, "num_tokens": 44118985.0, "step": 20385 }, { "entropy": 6.517501878738403, "epoch": 2.1819251966397344, "grad_norm": 1.625, "learning_rate": 0.00045289449031429873, "loss": 6.1356, "mean_token_accuracy": 0.143955484777689, "num_tokens": 44129126.0, "step": 20390 }, { "entropy": 6.526478576660156, "epoch": 2.1824602707474985, "grad_norm": 1.2109375, "learning_rate": 0.00045287107828271184, "loss": 6.1595, "mean_token_accuracy": 0.14495654180645942, "num_tokens": 44139731.0, "step": 20395 }, { "entropy": 6.479117488861084, "epoch": 2.1829953448552626, "grad_norm": 1.3984375, "learning_rate": 0.0004528476611151226, "loss": 6.1024, "mean_token_accuracy": 0.14143309295177459, "num_tokens": 44149924.0, "step": 20400 }, { "entropy": 6.470751094818115, "epoch": 2.1835304189630262, "grad_norm": 1.640625, "learning_rate": 0.0004528242388122071, "loss": 6.1053, "mean_token_accuracy": 0.13908825367689132, "num_tokens": 44161155.0, "step": 20405 }, { "entropy": 6.491450452804566, "epoch": 2.1840654930707903, "grad_norm": 1.328125, "learning_rate": 0.0004528008113746417, "loss": 6.1656, "mean_token_accuracy": 0.14211047291755677, "num_tokens": 44171563.0, "step": 20410 }, { "entropy": 6.446858167648315, "epoch": 2.1846005671785544, "grad_norm": 1.390625, "learning_rate": 0.00045277737880310284, "loss": 6.0748, "mean_token_accuracy": 0.1416269823908806, "num_tokens": 44182719.0, "step": 20415 }, { "entropy": 6.42777271270752, "epoch": 2.185135641286318, "grad_norm": 1.5, "learning_rate": 0.00045275394109826715, "loss": 6.0576, "mean_token_accuracy": 0.14696394503116608, "num_tokens": 44192214.0, "step": 20420 }, { "entropy": 6.430699396133423, "epoch": 2.185670715394082, "grad_norm": 1.4453125, "learning_rate": 0.00045273049826081145, "loss": 6.1169, "mean_token_accuracy": 0.14169675558805467, "num_tokens": 44204074.0, "step": 20425 }, { "entropy": 6.55955171585083, "epoch": 2.186205789501846, "grad_norm": 1.2890625, "learning_rate": 0.0004527070502914125, "loss": 6.251, "mean_token_accuracy": 0.13508173003792762, "num_tokens": 44214402.0, "step": 20430 }, { "entropy": 6.564619398117065, "epoch": 2.18674086360961, "grad_norm": 1.359375, "learning_rate": 0.0004526835971907475, "loss": 6.1419, "mean_token_accuracy": 0.1409166358411312, "num_tokens": 44224479.0, "step": 20435 }, { "entropy": 6.47654242515564, "epoch": 2.187275937717374, "grad_norm": 1.9609375, "learning_rate": 0.00045266013895949356, "loss": 6.1461, "mean_token_accuracy": 0.141594035923481, "num_tokens": 44234069.0, "step": 20440 }, { "entropy": 6.449040937423706, "epoch": 2.1878110118251377, "grad_norm": 1.21875, "learning_rate": 0.0004526366755983281, "loss": 6.1501, "mean_token_accuracy": 0.13885367885231972, "num_tokens": 44244978.0, "step": 20445 }, { "entropy": 6.489460229873657, "epoch": 2.188346085932902, "grad_norm": 1.2265625, "learning_rate": 0.0004526132071079286, "loss": 6.1214, "mean_token_accuracy": 0.14799125045537947, "num_tokens": 44255657.0, "step": 20450 }, { "entropy": 6.473532009124756, "epoch": 2.1888811600406655, "grad_norm": 1.2421875, "learning_rate": 0.00045258973348897267, "loss": 6.0973, "mean_token_accuracy": 0.1426821157336235, "num_tokens": 44267370.0, "step": 20455 }, { "entropy": 6.413994073867798, "epoch": 2.1894162341484296, "grad_norm": 1.46875, "learning_rate": 0.0004525662547421382, "loss": 6.1232, "mean_token_accuracy": 0.14376394227147102, "num_tokens": 44277855.0, "step": 20460 }, { "entropy": 6.494499588012696, "epoch": 2.1899513082561937, "grad_norm": 1.3203125, "learning_rate": 0.000452542770868103, "loss": 6.0843, "mean_token_accuracy": 0.14557158648967744, "num_tokens": 44288233.0, "step": 20465 }, { "entropy": 6.45966534614563, "epoch": 2.1904863823639573, "grad_norm": 1.3046875, "learning_rate": 0.00045251928186754533, "loss": 6.142, "mean_token_accuracy": 0.15051595345139504, "num_tokens": 44298054.0, "step": 20470 }, { "entropy": 6.490744018554688, "epoch": 2.1910214564717214, "grad_norm": 1.59375, "learning_rate": 0.0004524957877411432, "loss": 6.1235, "mean_token_accuracy": 0.14246877953410148, "num_tokens": 44309435.0, "step": 20475 }, { "entropy": 6.545108270645142, "epoch": 2.191556530579485, "grad_norm": 1.5390625, "learning_rate": 0.0004524722884895753, "loss": 6.1941, "mean_token_accuracy": 0.14126525223255157, "num_tokens": 44320502.0, "step": 20480 }, { "entropy": 6.411724042892456, "epoch": 2.192091604687249, "grad_norm": 1.515625, "learning_rate": 0.00045244878411352, "loss": 6.0276, "mean_token_accuracy": 0.15645946338772773, "num_tokens": 44330911.0, "step": 20485 }, { "entropy": 6.504664468765259, "epoch": 2.1926266787950133, "grad_norm": 1.4140625, "learning_rate": 0.0004524252746136559, "loss": 6.1388, "mean_token_accuracy": 0.13888708055019378, "num_tokens": 44342159.0, "step": 20490 }, { "entropy": 6.480413436889648, "epoch": 2.193161752902777, "grad_norm": 1.3828125, "learning_rate": 0.00045240175999066194, "loss": 6.0836, "mean_token_accuracy": 0.14757447615265845, "num_tokens": 44352293.0, "step": 20495 }, { "entropy": 6.483118009567261, "epoch": 2.193696827010541, "grad_norm": 1.375, "learning_rate": 0.00045237824024521714, "loss": 6.2409, "mean_token_accuracy": 0.14210179299116135, "num_tokens": 44362321.0, "step": 20500 }, { "entropy": 6.492488813400269, "epoch": 2.1942319011183047, "grad_norm": 1.2421875, "learning_rate": 0.0004523547153780005, "loss": 6.1158, "mean_token_accuracy": 0.14138875603675843, "num_tokens": 44372682.0, "step": 20505 }, { "entropy": 6.498578691482544, "epoch": 2.194766975226069, "grad_norm": 1.640625, "learning_rate": 0.0004523311853896915, "loss": 6.1366, "mean_token_accuracy": 0.14599357843399047, "num_tokens": 44383482.0, "step": 20510 }, { "entropy": 6.35706672668457, "epoch": 2.195302049333833, "grad_norm": 2.6875, "learning_rate": 0.00045230765028096925, "loss": 5.953, "mean_token_accuracy": 0.16601943522691726, "num_tokens": 44395333.0, "step": 20515 }, { "entropy": 6.501402091979981, "epoch": 2.1958371234415965, "grad_norm": 1.5625, "learning_rate": 0.00045228411005251366, "loss": 6.2092, "mean_token_accuracy": 0.1356913849711418, "num_tokens": 44406210.0, "step": 20520 }, { "entropy": 6.562849664688111, "epoch": 2.1963721975493606, "grad_norm": 1.3203125, "learning_rate": 0.0004522605647050043, "loss": 6.1558, "mean_token_accuracy": 0.13747389018535613, "num_tokens": 44415834.0, "step": 20525 }, { "entropy": 6.608779859542847, "epoch": 2.1969072716571247, "grad_norm": 1.2734375, "learning_rate": 0.00045223701423912103, "loss": 6.2343, "mean_token_accuracy": 0.13901744186878204, "num_tokens": 44427902.0, "step": 20530 }, { "entropy": 6.484367179870605, "epoch": 2.1974423457648884, "grad_norm": 1.7578125, "learning_rate": 0.00045221345865554386, "loss": 6.0555, "mean_token_accuracy": 0.15032985359430312, "num_tokens": 44437406.0, "step": 20535 }, { "entropy": 6.450162410736084, "epoch": 2.1979774198726525, "grad_norm": 1.4296875, "learning_rate": 0.00045218989795495294, "loss": 6.0748, "mean_token_accuracy": 0.1465378113090992, "num_tokens": 44446889.0, "step": 20540 }, { "entropy": 6.4537286281585695, "epoch": 2.198512493980416, "grad_norm": 1.25, "learning_rate": 0.00045216633213802866, "loss": 6.1577, "mean_token_accuracy": 0.13990189880132675, "num_tokens": 44457132.0, "step": 20545 }, { "entropy": 6.475618886947632, "epoch": 2.1990475680881802, "grad_norm": 1.3515625, "learning_rate": 0.00045214276120545137, "loss": 6.1494, "mean_token_accuracy": 0.13710540011525155, "num_tokens": 44468006.0, "step": 20550 }, { "entropy": 6.533304738998413, "epoch": 2.199582642195944, "grad_norm": 4.25, "learning_rate": 0.0004521191851579019, "loss": 6.073, "mean_token_accuracy": 0.14562759175896645, "num_tokens": 44478650.0, "step": 20555 }, { "entropy": 6.467861270904541, "epoch": 2.200117716303708, "grad_norm": 1.46875, "learning_rate": 0.0004520956039960607, "loss": 6.1698, "mean_token_accuracy": 0.1399306148290634, "num_tokens": 44489842.0, "step": 20560 }, { "entropy": 6.47445764541626, "epoch": 2.200652790411472, "grad_norm": 1.3359375, "learning_rate": 0.00045207201772060887, "loss": 6.0808, "mean_token_accuracy": 0.1480284184217453, "num_tokens": 44500444.0, "step": 20565 }, { "entropy": 6.4193922996521, "epoch": 2.2011878645192358, "grad_norm": 1.3671875, "learning_rate": 0.0004520484263322274, "loss": 6.0527, "mean_token_accuracy": 0.14889391362667084, "num_tokens": 44510711.0, "step": 20570 }, { "entropy": 6.450742149353028, "epoch": 2.201722938627, "grad_norm": 1.2578125, "learning_rate": 0.0004520248298315975, "loss": 6.0965, "mean_token_accuracy": 0.1452381893992424, "num_tokens": 44522343.0, "step": 20575 }, { "entropy": 6.44204044342041, "epoch": 2.202258012734764, "grad_norm": 1.4375, "learning_rate": 0.00045200122821940057, "loss": 6.1594, "mean_token_accuracy": 0.14006644934415818, "num_tokens": 44533218.0, "step": 20580 }, { "entropy": 6.564455604553222, "epoch": 2.2027930868425276, "grad_norm": 1.3046875, "learning_rate": 0.00045197762149631795, "loss": 6.1796, "mean_token_accuracy": 0.14281179010868073, "num_tokens": 44543406.0, "step": 20585 }, { "entropy": 6.556970834732056, "epoch": 2.2033281609502917, "grad_norm": 1.34375, "learning_rate": 0.00045195400966303146, "loss": 6.1933, "mean_token_accuracy": 0.14433204755187035, "num_tokens": 44555329.0, "step": 20590 }, { "entropy": 6.536537981033325, "epoch": 2.2038632350580554, "grad_norm": 1.71875, "learning_rate": 0.0004519303927202228, "loss": 6.2119, "mean_token_accuracy": 0.14017735421657562, "num_tokens": 44565191.0, "step": 20595 }, { "entropy": 6.483732080459594, "epoch": 2.2043983091658195, "grad_norm": 1.421875, "learning_rate": 0.00045190677066857384, "loss": 6.0731, "mean_token_accuracy": 0.15376509577035904, "num_tokens": 44576374.0, "step": 20600 }, { "entropy": 6.444904947280884, "epoch": 2.2049333832735836, "grad_norm": 1.359375, "learning_rate": 0.0004518831435087668, "loss": 6.0705, "mean_token_accuracy": 0.1488921172916889, "num_tokens": 44586533.0, "step": 20605 }, { "entropy": 6.376462459564209, "epoch": 2.2054684573813472, "grad_norm": 1.2890625, "learning_rate": 0.0004518595112414838, "loss": 5.984, "mean_token_accuracy": 0.1550952360033989, "num_tokens": 44596753.0, "step": 20610 }, { "entropy": 6.551543855667115, "epoch": 2.2060035314891113, "grad_norm": 1.453125, "learning_rate": 0.0004518358738674073, "loss": 6.2167, "mean_token_accuracy": 0.13503544703125953, "num_tokens": 44607632.0, "step": 20615 }, { "entropy": 6.549866008758545, "epoch": 2.206538605596875, "grad_norm": 1.3359375, "learning_rate": 0.0004518122313872198, "loss": 6.14, "mean_token_accuracy": 0.13973730579018592, "num_tokens": 44618786.0, "step": 20620 }, { "entropy": 6.450780916213989, "epoch": 2.207073679704639, "grad_norm": 1.484375, "learning_rate": 0.00045178858380160396, "loss": 6.1131, "mean_token_accuracy": 0.14023820906877518, "num_tokens": 44628760.0, "step": 20625 }, { "entropy": 6.489461898803711, "epoch": 2.207608753812403, "grad_norm": 1.671875, "learning_rate": 0.0004517649311112426, "loss": 6.1759, "mean_token_accuracy": 0.14050846993923188, "num_tokens": 44641206.0, "step": 20630 }, { "entropy": 6.535753488540649, "epoch": 2.208143827920167, "grad_norm": 1.921875, "learning_rate": 0.0004517412733168187, "loss": 6.1087, "mean_token_accuracy": 0.14522838592529297, "num_tokens": 44651923.0, "step": 20635 }, { "entropy": 6.481085777282715, "epoch": 2.208678902027931, "grad_norm": 1.265625, "learning_rate": 0.00045171761041901533, "loss": 6.0931, "mean_token_accuracy": 0.1438140444457531, "num_tokens": 44662375.0, "step": 20640 }, { "entropy": 6.353289842605591, "epoch": 2.2092139761356946, "grad_norm": 1.6171875, "learning_rate": 0.0004516939424185158, "loss": 6.0426, "mean_token_accuracy": 0.15177821815013887, "num_tokens": 44673201.0, "step": 20645 }, { "entropy": 6.4304039001464846, "epoch": 2.2097490502434587, "grad_norm": 1.453125, "learning_rate": 0.0004516702693160035, "loss": 6.1092, "mean_token_accuracy": 0.1409784272313118, "num_tokens": 44684300.0, "step": 20650 }, { "entropy": 6.530240869522094, "epoch": 2.210284124351223, "grad_norm": 1.3671875, "learning_rate": 0.0004516465911121621, "loss": 6.1542, "mean_token_accuracy": 0.1425748884677887, "num_tokens": 44694603.0, "step": 20655 }, { "entropy": 6.508754730224609, "epoch": 2.2108191984589864, "grad_norm": 1.4375, "learning_rate": 0.0004516229078076751, "loss": 6.1331, "mean_token_accuracy": 0.1477656126022339, "num_tokens": 44704461.0, "step": 20660 }, { "entropy": 6.505958843231201, "epoch": 2.2113542725667505, "grad_norm": 1.34375, "learning_rate": 0.0004515992194032265, "loss": 6.1953, "mean_token_accuracy": 0.14030279144644736, "num_tokens": 44715784.0, "step": 20665 }, { "entropy": 6.4570409774780275, "epoch": 2.211889346674514, "grad_norm": 1.3203125, "learning_rate": 0.00045157552589950023, "loss": 6.0564, "mean_token_accuracy": 0.1499457612633705, "num_tokens": 44726025.0, "step": 20670 }, { "entropy": 6.408047342300415, "epoch": 2.2124244207822783, "grad_norm": 2.140625, "learning_rate": 0.0004515518272971805, "loss": 6.0459, "mean_token_accuracy": 0.1566786177456379, "num_tokens": 44736602.0, "step": 20675 }, { "entropy": 6.5007734298706055, "epoch": 2.2129594948900424, "grad_norm": 1.171875, "learning_rate": 0.0004515281235969515, "loss": 6.1917, "mean_token_accuracy": 0.13739494383335113, "num_tokens": 44746260.0, "step": 20680 }, { "entropy": 6.449839973449707, "epoch": 2.213494568997806, "grad_norm": 1.53125, "learning_rate": 0.0004515044147994978, "loss": 6.0885, "mean_token_accuracy": 0.1467547632753849, "num_tokens": 44756894.0, "step": 20685 }, { "entropy": 6.483930683135986, "epoch": 2.21402964310557, "grad_norm": 1.3125, "learning_rate": 0.0004514807009055039, "loss": 6.1661, "mean_token_accuracy": 0.1407784640789032, "num_tokens": 44768483.0, "step": 20690 }, { "entropy": 6.454762411117554, "epoch": 2.2145647172133343, "grad_norm": 1.78125, "learning_rate": 0.00045145698191565456, "loss": 6.0759, "mean_token_accuracy": 0.1482870250940323, "num_tokens": 44778843.0, "step": 20695 }, { "entropy": 6.458995056152344, "epoch": 2.215099791321098, "grad_norm": 1.6015625, "learning_rate": 0.00045143325783063466, "loss": 6.0455, "mean_token_accuracy": 0.14676833376288415, "num_tokens": 44788659.0, "step": 20700 }, { "entropy": 6.466281938552856, "epoch": 2.215634865428862, "grad_norm": 1.328125, "learning_rate": 0.0004514095286511293, "loss": 6.1412, "mean_token_accuracy": 0.14670583754777908, "num_tokens": 44799730.0, "step": 20705 }, { "entropy": 6.432733345031738, "epoch": 2.2161699395366257, "grad_norm": 1.375, "learning_rate": 0.0004513857943778235, "loss": 6.0962, "mean_token_accuracy": 0.1518693208694458, "num_tokens": 44811679.0, "step": 20710 }, { "entropy": 6.483310317993164, "epoch": 2.2167050136443898, "grad_norm": 1.171875, "learning_rate": 0.0004513620550114027, "loss": 6.1158, "mean_token_accuracy": 0.1437581568956375, "num_tokens": 44821996.0, "step": 20715 }, { "entropy": 6.5152074813842775, "epoch": 2.217240087752154, "grad_norm": 1.2265625, "learning_rate": 0.00045133831055255234, "loss": 6.1569, "mean_token_accuracy": 0.14024235755205156, "num_tokens": 44833713.0, "step": 20720 }, { "entropy": 6.488360595703125, "epoch": 2.2177751618599175, "grad_norm": 1.7109375, "learning_rate": 0.0004513145610019581, "loss": 6.1457, "mean_token_accuracy": 0.1454211637377739, "num_tokens": 44844751.0, "step": 20725 }, { "entropy": 6.4918300151824955, "epoch": 2.2183102359676816, "grad_norm": 1.265625, "learning_rate": 0.00045129080636030554, "loss": 6.2091, "mean_token_accuracy": 0.13638500720262528, "num_tokens": 44856089.0, "step": 20730 }, { "entropy": 6.480890226364136, "epoch": 2.2188453100754453, "grad_norm": 1.2421875, "learning_rate": 0.0004512670466282808, "loss": 6.1417, "mean_token_accuracy": 0.14371456801891327, "num_tokens": 44867313.0, "step": 20735 }, { "entropy": 6.519718313217163, "epoch": 2.2193803841832094, "grad_norm": 1.4609375, "learning_rate": 0.00045124328180656993, "loss": 6.1312, "mean_token_accuracy": 0.1397297464311123, "num_tokens": 44878430.0, "step": 20740 }, { "entropy": 6.489490127563476, "epoch": 2.2199154582909735, "grad_norm": 1.1875, "learning_rate": 0.00045121951189585897, "loss": 6.0613, "mean_token_accuracy": 0.14514275640249252, "num_tokens": 44888746.0, "step": 20745 }, { "entropy": 6.483740425109863, "epoch": 2.220450532398737, "grad_norm": 1.9140625, "learning_rate": 0.00045119573689683445, "loss": 6.1958, "mean_token_accuracy": 0.13851530104875565, "num_tokens": 44899412.0, "step": 20750 }, { "entropy": 6.474801683425904, "epoch": 2.2209856065065012, "grad_norm": 1.53125, "learning_rate": 0.00045117195681018273, "loss": 6.1286, "mean_token_accuracy": 0.14496598690748214, "num_tokens": 44910362.0, "step": 20755 }, { "entropy": 6.451879596710205, "epoch": 2.221520680614265, "grad_norm": 1.2265625, "learning_rate": 0.0004511481716365905, "loss": 6.0745, "mean_token_accuracy": 0.14089406579732894, "num_tokens": 44920552.0, "step": 20760 }, { "entropy": 6.464407587051392, "epoch": 2.222055754722029, "grad_norm": 1.8828125, "learning_rate": 0.0004511243813767446, "loss": 6.1087, "mean_token_accuracy": 0.13718210086226462, "num_tokens": 44932090.0, "step": 20765 }, { "entropy": 6.502533960342407, "epoch": 2.222590828829793, "grad_norm": 1.40625, "learning_rate": 0.000451100586031332, "loss": 6.1519, "mean_token_accuracy": 0.1424417018890381, "num_tokens": 44944122.0, "step": 20770 }, { "entropy": 6.524023962020874, "epoch": 2.2231259029375567, "grad_norm": 1.4140625, "learning_rate": 0.00045107678560103953, "loss": 6.1409, "mean_token_accuracy": 0.14315226897597313, "num_tokens": 44955104.0, "step": 20775 }, { "entropy": 6.473584270477295, "epoch": 2.223660977045321, "grad_norm": 1.4453125, "learning_rate": 0.00045105298008655485, "loss": 6.0998, "mean_token_accuracy": 0.14250846058130265, "num_tokens": 44965495.0, "step": 20780 }, { "entropy": 6.4412439346313475, "epoch": 2.2241960511530845, "grad_norm": 1.5859375, "learning_rate": 0.00045102916948856493, "loss": 6.1709, "mean_token_accuracy": 0.13755118027329444, "num_tokens": 44976627.0, "step": 20785 }, { "entropy": 6.515741062164307, "epoch": 2.2247311252608486, "grad_norm": 1.453125, "learning_rate": 0.0004510053538077576, "loss": 6.1913, "mean_token_accuracy": 0.13910733982920648, "num_tokens": 44987955.0, "step": 20790 }, { "entropy": 6.549260854721069, "epoch": 2.2252661993686127, "grad_norm": 1.5390625, "learning_rate": 0.0004509815330448203, "loss": 6.1411, "mean_token_accuracy": 0.14129999950528144, "num_tokens": 44998124.0, "step": 20795 }, { "entropy": 6.513506078720093, "epoch": 2.2258012734763764, "grad_norm": 1.3671875, "learning_rate": 0.000450957707200441, "loss": 6.162, "mean_token_accuracy": 0.13884468376636505, "num_tokens": 45007881.0, "step": 20800 }, { "entropy": 6.476696252822876, "epoch": 2.2263363475841405, "grad_norm": 1.2421875, "learning_rate": 0.0004509338762753076, "loss": 6.1042, "mean_token_accuracy": 0.15047593265771866, "num_tokens": 45018994.0, "step": 20805 }, { "entropy": 6.48284068107605, "epoch": 2.2268714216919046, "grad_norm": 1.296875, "learning_rate": 0.0004509100402701083, "loss": 6.1856, "mean_token_accuracy": 0.14077048227190972, "num_tokens": 45030109.0, "step": 20810 }, { "entropy": 6.394616651535034, "epoch": 2.227406495799668, "grad_norm": 1.5078125, "learning_rate": 0.00045088619918553136, "loss": 6.071, "mean_token_accuracy": 0.15419016480445863, "num_tokens": 45039872.0, "step": 20815 }, { "entropy": 6.5200457096099855, "epoch": 2.2279415699074323, "grad_norm": 1.4765625, "learning_rate": 0.0004508623530222651, "loss": 6.0711, "mean_token_accuracy": 0.15519756972789764, "num_tokens": 45049216.0, "step": 20820 }, { "entropy": 6.387506532669067, "epoch": 2.228476644015196, "grad_norm": 1.34375, "learning_rate": 0.00045083850178099805, "loss": 6.053, "mean_token_accuracy": 0.15361984074115753, "num_tokens": 45059191.0, "step": 20825 }, { "entropy": 6.400663280487061, "epoch": 2.22901171812296, "grad_norm": 1.3515625, "learning_rate": 0.000450814645462419, "loss": 6.067, "mean_token_accuracy": 0.14758966714143754, "num_tokens": 45069212.0, "step": 20830 }, { "entropy": 6.452826261520386, "epoch": 2.229546792230724, "grad_norm": 1.40625, "learning_rate": 0.00045079078406721676, "loss": 6.0877, "mean_token_accuracy": 0.14639023467898368, "num_tokens": 45080248.0, "step": 20835 }, { "entropy": 6.441942977905273, "epoch": 2.230081866338488, "grad_norm": 1.390625, "learning_rate": 0.00045076691759608035, "loss": 6.1001, "mean_token_accuracy": 0.14331901520490647, "num_tokens": 45091315.0, "step": 20840 }, { "entropy": 6.432116222381592, "epoch": 2.230616940446252, "grad_norm": 1.4609375, "learning_rate": 0.00045074304604969886, "loss": 6.1112, "mean_token_accuracy": 0.14278898015618324, "num_tokens": 45102674.0, "step": 20845 }, { "entropy": 6.445503377914429, "epoch": 2.2311520145540156, "grad_norm": 1.1640625, "learning_rate": 0.00045071916942876163, "loss": 6.1134, "mean_token_accuracy": 0.14575490057468415, "num_tokens": 45113171.0, "step": 20850 }, { "entropy": 6.473908710479736, "epoch": 2.2316870886617797, "grad_norm": 1.1953125, "learning_rate": 0.0004506952877339581, "loss": 6.09, "mean_token_accuracy": 0.1474693901836872, "num_tokens": 45122912.0, "step": 20855 }, { "entropy": 6.509590673446655, "epoch": 2.2322221627695438, "grad_norm": 1.3828125, "learning_rate": 0.0004506714009659778, "loss": 6.1443, "mean_token_accuracy": 0.14192293658852578, "num_tokens": 45133839.0, "step": 20860 }, { "entropy": 6.463809442520142, "epoch": 2.2327572368773074, "grad_norm": 1.21875, "learning_rate": 0.0004506475091255105, "loss": 6.0903, "mean_token_accuracy": 0.14849280714988708, "num_tokens": 45144914.0, "step": 20865 }, { "entropy": 6.458927726745605, "epoch": 2.2332923109850715, "grad_norm": 1.2421875, "learning_rate": 0.000450623612213246, "loss": 6.1172, "mean_token_accuracy": 0.14825727343559264, "num_tokens": 45155194.0, "step": 20870 }, { "entropy": 6.455564641952515, "epoch": 2.233827385092835, "grad_norm": 1.3359375, "learning_rate": 0.00045059971022987446, "loss": 6.2117, "mean_token_accuracy": 0.13915288597345352, "num_tokens": 45166771.0, "step": 20875 }, { "entropy": 6.472472715377807, "epoch": 2.2343624592005993, "grad_norm": 1.515625, "learning_rate": 0.00045057580317608585, "loss": 6.0733, "mean_token_accuracy": 0.14202259555459024, "num_tokens": 45177236.0, "step": 20880 }, { "entropy": 6.467026233673096, "epoch": 2.2348975333083634, "grad_norm": 1.1171875, "learning_rate": 0.00045055189105257064, "loss": 6.101, "mean_token_accuracy": 0.1369931496679783, "num_tokens": 45187382.0, "step": 20885 }, { "entropy": 6.4739213466644285, "epoch": 2.235432607416127, "grad_norm": 1.1171875, "learning_rate": 0.00045052797386001936, "loss": 6.135, "mean_token_accuracy": 0.14757725447416306, "num_tokens": 45197287.0, "step": 20890 }, { "entropy": 6.542567539215088, "epoch": 2.235967681523891, "grad_norm": 1.25, "learning_rate": 0.0004505040515991224, "loss": 6.1003, "mean_token_accuracy": 0.14881971925497056, "num_tokens": 45208737.0, "step": 20895 }, { "entropy": 6.474895811080932, "epoch": 2.236502755631655, "grad_norm": 1.296875, "learning_rate": 0.00045048012427057057, "loss": 6.2149, "mean_token_accuracy": 0.13522807210683824, "num_tokens": 45219586.0, "step": 20900 }, { "entropy": 6.533901405334473, "epoch": 2.237037829739419, "grad_norm": 1.171875, "learning_rate": 0.0004504561918750549, "loss": 6.1848, "mean_token_accuracy": 0.13439816907048224, "num_tokens": 45230730.0, "step": 20905 }, { "entropy": 6.512403869628907, "epoch": 2.237572903847183, "grad_norm": 1.25, "learning_rate": 0.0004504322544132663, "loss": 6.0176, "mean_token_accuracy": 0.156698514521122, "num_tokens": 45241330.0, "step": 20910 }, { "entropy": 6.397086954116821, "epoch": 2.2381079779549466, "grad_norm": 1.3828125, "learning_rate": 0.000450408311885896, "loss": 6.1369, "mean_token_accuracy": 0.14560230374336242, "num_tokens": 45251439.0, "step": 20915 }, { "entropy": 6.404899740219117, "epoch": 2.2386430520627107, "grad_norm": 1.6640625, "learning_rate": 0.00045038436429363537, "loss": 5.946, "mean_token_accuracy": 0.14653594940900802, "num_tokens": 45262078.0, "step": 20920 }, { "entropy": 6.538563394546509, "epoch": 2.2391781261704744, "grad_norm": 1.4296875, "learning_rate": 0.00045036041163717586, "loss": 6.1535, "mean_token_accuracy": 0.14452334865927696, "num_tokens": 45272466.0, "step": 20925 }, { "entropy": 6.489725923538208, "epoch": 2.2397132002782385, "grad_norm": 1.3359375, "learning_rate": 0.0004503364539172091, "loss": 6.063, "mean_token_accuracy": 0.14924193769693375, "num_tokens": 45281830.0, "step": 20930 }, { "entropy": 6.410014581680298, "epoch": 2.2402482743860026, "grad_norm": 1.2578125, "learning_rate": 0.0004503124911344268, "loss": 6.1334, "mean_token_accuracy": 0.1358873277902603, "num_tokens": 45293026.0, "step": 20935 }, { "entropy": 6.527070951461792, "epoch": 2.2407833484937663, "grad_norm": 1.3125, "learning_rate": 0.00045028852328952106, "loss": 6.1164, "mean_token_accuracy": 0.14645038545131683, "num_tokens": 45303532.0, "step": 20940 }, { "entropy": 6.393893194198609, "epoch": 2.2413184226015304, "grad_norm": 1.5234375, "learning_rate": 0.0004502645503831838, "loss": 5.9992, "mean_token_accuracy": 0.155904184281826, "num_tokens": 45314448.0, "step": 20945 }, { "entropy": 6.44235200881958, "epoch": 2.241853496709294, "grad_norm": 1.296875, "learning_rate": 0.00045024057241610727, "loss": 6.1283, "mean_token_accuracy": 0.13548970520496367, "num_tokens": 45323194.0, "step": 20950 }, { "entropy": 6.47519154548645, "epoch": 2.242388570817058, "grad_norm": 1.3359375, "learning_rate": 0.0004502165893889839, "loss": 6.0086, "mean_token_accuracy": 0.16086768731474876, "num_tokens": 45333464.0, "step": 20955 }, { "entropy": 6.43692307472229, "epoch": 2.242923644924822, "grad_norm": 1.265625, "learning_rate": 0.0004501926013025061, "loss": 6.1404, "mean_token_accuracy": 0.14124525263905524, "num_tokens": 45344364.0, "step": 20960 }, { "entropy": 6.488691997528076, "epoch": 2.243458719032586, "grad_norm": 1.1484375, "learning_rate": 0.00045016860815736646, "loss": 6.0773, "mean_token_accuracy": 0.1473349779844284, "num_tokens": 45355202.0, "step": 20965 }, { "entropy": 6.460700845718383, "epoch": 2.24399379314035, "grad_norm": 1.4375, "learning_rate": 0.0004501446099542579, "loss": 6.0183, "mean_token_accuracy": 0.1478226363658905, "num_tokens": 45365696.0, "step": 20970 }, { "entropy": 6.4001140117645265, "epoch": 2.244528867248114, "grad_norm": 1.3515625, "learning_rate": 0.0004501206066938734, "loss": 6.042, "mean_token_accuracy": 0.15158791840076447, "num_tokens": 45376609.0, "step": 20975 }, { "entropy": 6.508848190307617, "epoch": 2.2450639413558777, "grad_norm": 1.3125, "learning_rate": 0.00045009659837690606, "loss": 6.2067, "mean_token_accuracy": 0.1312944307923317, "num_tokens": 45386158.0, "step": 20980 }, { "entropy": 6.593734455108643, "epoch": 2.245599015463642, "grad_norm": 1.34375, "learning_rate": 0.000450072585004049, "loss": 6.1805, "mean_token_accuracy": 0.14177413135766984, "num_tokens": 45396824.0, "step": 20985 }, { "entropy": 6.512286615371704, "epoch": 2.2461340895714055, "grad_norm": 1.1484375, "learning_rate": 0.0004500485665759955, "loss": 6.1002, "mean_token_accuracy": 0.1438503846526146, "num_tokens": 45407219.0, "step": 20990 }, { "entropy": 6.457460355758667, "epoch": 2.2466691636791696, "grad_norm": 1.6328125, "learning_rate": 0.0004500245430934394, "loss": 6.1737, "mean_token_accuracy": 0.13699991330504419, "num_tokens": 45418572.0, "step": 20995 }, { "entropy": 6.435413551330567, "epoch": 2.2472042377869337, "grad_norm": 1.515625, "learning_rate": 0.00045000051455707413, "loss": 6.0558, "mean_token_accuracy": 0.14574682861566543, "num_tokens": 45429643.0, "step": 21000 }, { "epoch": 2.2472042377869337, "eval_entropy": 6.317055676889548, "eval_loss": 6.256918907165527, "eval_mean_token_accuracy": 0.1449485192102985, "eval_num_tokens": 45429643.0, "eval_runtime": 22.62, "eval_samples_per_second": 1312.069, "eval_steps_per_second": 164.014, "step": 21000 }, { "entropy": 6.494276714324951, "epoch": 2.2477393118946973, "grad_norm": 1.296875, "learning_rate": 0.0004499764809675937, "loss": 6.0739, "mean_token_accuracy": 0.14799585938453674, "num_tokens": 45440183.0, "step": 21005 }, { "entropy": 6.423533725738525, "epoch": 2.2482743860024614, "grad_norm": 1.21875, "learning_rate": 0.0004499524423256918, "loss": 6.1315, "mean_token_accuracy": 0.14049314931035042, "num_tokens": 45451252.0, "step": 21010 }, { "entropy": 6.446270084381103, "epoch": 2.248809460110225, "grad_norm": 1.2890625, "learning_rate": 0.00044992839863206284, "loss": 6.1529, "mean_token_accuracy": 0.14202596694231034, "num_tokens": 45462336.0, "step": 21015 }, { "entropy": 6.494549989700317, "epoch": 2.249344534217989, "grad_norm": 1.3515625, "learning_rate": 0.00044990434988740095, "loss": 6.1111, "mean_token_accuracy": 0.14548687189817427, "num_tokens": 45472526.0, "step": 21020 }, { "entropy": 6.534965944290161, "epoch": 2.2498796083257533, "grad_norm": 1.21875, "learning_rate": 0.0004498802960924005, "loss": 6.1623, "mean_token_accuracy": 0.1365474358201027, "num_tokens": 45483281.0, "step": 21025 }, { "entropy": 6.523278141021729, "epoch": 2.250414682433517, "grad_norm": 1.3984375, "learning_rate": 0.0004498562372477561, "loss": 6.0969, "mean_token_accuracy": 0.14712547808885573, "num_tokens": 45494258.0, "step": 21030 }, { "entropy": 6.462643814086914, "epoch": 2.250949756541281, "grad_norm": 3.140625, "learning_rate": 0.0004498321733541624, "loss": 6.1257, "mean_token_accuracy": 0.14377980679273605, "num_tokens": 45504233.0, "step": 21035 }, { "entropy": 6.43720498085022, "epoch": 2.2514848306490447, "grad_norm": 2.046875, "learning_rate": 0.00044980810441231424, "loss": 6.1091, "mean_token_accuracy": 0.14584841281175615, "num_tokens": 45513902.0, "step": 21040 }, { "entropy": 6.470683479309082, "epoch": 2.252019904756809, "grad_norm": 1.21875, "learning_rate": 0.0004497840304229066, "loss": 6.1432, "mean_token_accuracy": 0.14411644488573075, "num_tokens": 45524111.0, "step": 21045 }, { "entropy": 6.498909044265747, "epoch": 2.252554978864573, "grad_norm": 1.28125, "learning_rate": 0.00044975995138663466, "loss": 6.1165, "mean_token_accuracy": 0.14330133497714997, "num_tokens": 45534816.0, "step": 21050 }, { "entropy": 6.501578044891358, "epoch": 2.2530900529723366, "grad_norm": 1.3046875, "learning_rate": 0.00044973586730419373, "loss": 6.0939, "mean_token_accuracy": 0.15145739763975144, "num_tokens": 45546012.0, "step": 21055 }, { "entropy": 6.460418462753296, "epoch": 2.2536251270801007, "grad_norm": 1.4296875, "learning_rate": 0.0004497117781762792, "loss": 6.0878, "mean_token_accuracy": 0.14586476534605025, "num_tokens": 45555402.0, "step": 21060 }, { "entropy": 6.412470436096191, "epoch": 2.2541602011878643, "grad_norm": 1.46875, "learning_rate": 0.0004496876840035866, "loss": 6.1348, "mean_token_accuracy": 0.14630192518234253, "num_tokens": 45565537.0, "step": 21065 }, { "entropy": 6.4964922904968265, "epoch": 2.2546952752956284, "grad_norm": 1.359375, "learning_rate": 0.00044966358478681163, "loss": 6.1322, "mean_token_accuracy": 0.14896186143159867, "num_tokens": 45576449.0, "step": 21070 }, { "entropy": 6.588002252578735, "epoch": 2.2552303494033925, "grad_norm": 1.4296875, "learning_rate": 0.0004496394805266502, "loss": 6.1342, "mean_token_accuracy": 0.13857141211628915, "num_tokens": 45586477.0, "step": 21075 }, { "entropy": 6.426201105117798, "epoch": 2.255765423511156, "grad_norm": 1.296875, "learning_rate": 0.00044961537122379844, "loss": 6.1119, "mean_token_accuracy": 0.1415586143732071, "num_tokens": 45597279.0, "step": 21080 }, { "entropy": 6.510368394851684, "epoch": 2.2563004976189203, "grad_norm": 1.4140625, "learning_rate": 0.0004495912568789522, "loss": 6.1828, "mean_token_accuracy": 0.13857755735516547, "num_tokens": 45608216.0, "step": 21085 }, { "entropy": 6.460128498077393, "epoch": 2.2568355717266844, "grad_norm": 1.671875, "learning_rate": 0.00044956713749280805, "loss": 6.0675, "mean_token_accuracy": 0.14786242842674255, "num_tokens": 45620665.0, "step": 21090 }, { "entropy": 6.492896175384521, "epoch": 2.257370645834448, "grad_norm": 1.5, "learning_rate": 0.00044954301306606234, "loss": 6.1246, "mean_token_accuracy": 0.14504493921995162, "num_tokens": 45631635.0, "step": 21095 }, { "entropy": 6.3591552734375, "epoch": 2.257905719942212, "grad_norm": 1.34375, "learning_rate": 0.00044951888359941156, "loss": 6.0239, "mean_token_accuracy": 0.1540983110666275, "num_tokens": 45642507.0, "step": 21100 }, { "entropy": 6.44664888381958, "epoch": 2.2584407940499758, "grad_norm": 1.4296875, "learning_rate": 0.00044949474909355264, "loss": 6.1223, "mean_token_accuracy": 0.14081369936466218, "num_tokens": 45653123.0, "step": 21105 }, { "entropy": 6.526295232772827, "epoch": 2.25897586815774, "grad_norm": 1.59375, "learning_rate": 0.00044947060954918233, "loss": 6.0962, "mean_token_accuracy": 0.14571473002433777, "num_tokens": 45663228.0, "step": 21110 }, { "entropy": 6.507929992675781, "epoch": 2.2595109422655035, "grad_norm": 1.5078125, "learning_rate": 0.0004494464649669976, "loss": 6.1017, "mean_token_accuracy": 0.1444193385541439, "num_tokens": 45673389.0, "step": 21115 }, { "entropy": 6.452843856811524, "epoch": 2.2600460163732676, "grad_norm": 1.2109375, "learning_rate": 0.00044942231534769587, "loss": 6.0979, "mean_token_accuracy": 0.14502233862876893, "num_tokens": 45684803.0, "step": 21120 }, { "entropy": 6.4407342910766605, "epoch": 2.2605810904810317, "grad_norm": 1.421875, "learning_rate": 0.00044939816069197415, "loss": 6.1393, "mean_token_accuracy": 0.14629731476306915, "num_tokens": 45695164.0, "step": 21125 }, { "entropy": 6.530598545074463, "epoch": 2.2611161645887954, "grad_norm": 1.4296875, "learning_rate": 0.00044937400100053017, "loss": 6.168, "mean_token_accuracy": 0.14665451049804687, "num_tokens": 45706169.0, "step": 21130 }, { "entropy": 6.569778633117676, "epoch": 2.2616512386965595, "grad_norm": 1.34375, "learning_rate": 0.0004493498362740613, "loss": 6.225, "mean_token_accuracy": 0.13544171154499055, "num_tokens": 45717299.0, "step": 21135 }, { "entropy": 6.448068857192993, "epoch": 2.2621863128043236, "grad_norm": 1.4453125, "learning_rate": 0.00044932566651326546, "loss": 6.1028, "mean_token_accuracy": 0.14793309047818184, "num_tokens": 45728815.0, "step": 21140 }, { "entropy": 6.507202816009522, "epoch": 2.2627213869120872, "grad_norm": 1.2578125, "learning_rate": 0.0004493014917188405, "loss": 6.1588, "mean_token_accuracy": 0.13971466943621635, "num_tokens": 45740293.0, "step": 21145 }, { "entropy": 6.530271005630493, "epoch": 2.2632564610198513, "grad_norm": 1.4453125, "learning_rate": 0.00044927731189148447, "loss": 6.094, "mean_token_accuracy": 0.14648326188325883, "num_tokens": 45751243.0, "step": 21150 }, { "entropy": 6.39956750869751, "epoch": 2.263791535127615, "grad_norm": 1.0859375, "learning_rate": 0.00044925312703189546, "loss": 6.0779, "mean_token_accuracy": 0.1459802970290184, "num_tokens": 45762477.0, "step": 21155 }, { "entropy": 6.4832066059112545, "epoch": 2.264326609235379, "grad_norm": 1.7890625, "learning_rate": 0.000449228937140772, "loss": 6.1027, "mean_token_accuracy": 0.14622026681900024, "num_tokens": 45772929.0, "step": 21160 }, { "entropy": 6.514123630523682, "epoch": 2.264861683343143, "grad_norm": 1.1640625, "learning_rate": 0.00044920474221881243, "loss": 6.0967, "mean_token_accuracy": 0.14877657741308212, "num_tokens": 45782999.0, "step": 21165 }, { "entropy": 6.420357942581177, "epoch": 2.265396757450907, "grad_norm": 1.15625, "learning_rate": 0.00044918054226671545, "loss": 6.1001, "mean_token_accuracy": 0.15075411200523375, "num_tokens": 45793020.0, "step": 21170 }, { "entropy": 6.476064825057984, "epoch": 2.265931831558671, "grad_norm": 1.359375, "learning_rate": 0.00044915633728517975, "loss": 6.0645, "mean_token_accuracy": 0.15408962965011597, "num_tokens": 45803020.0, "step": 21175 }, { "entropy": 6.486395454406738, "epoch": 2.2664669056664346, "grad_norm": 1.234375, "learning_rate": 0.0004491321272749042, "loss": 6.1312, "mean_token_accuracy": 0.14978941082954406, "num_tokens": 45812700.0, "step": 21180 }, { "entropy": 6.529626274108887, "epoch": 2.2670019797741987, "grad_norm": 1.2734375, "learning_rate": 0.00044910791223658805, "loss": 6.1649, "mean_token_accuracy": 0.13963496387004853, "num_tokens": 45823097.0, "step": 21185 }, { "entropy": 6.494238567352295, "epoch": 2.267537053881963, "grad_norm": 4.03125, "learning_rate": 0.00044908369217093035, "loss": 6.0833, "mean_token_accuracy": 0.14395482316613198, "num_tokens": 45832935.0, "step": 21190 }, { "entropy": 6.492327690124512, "epoch": 2.2680721279897265, "grad_norm": 1.46875, "learning_rate": 0.00044905946707863057, "loss": 6.1948, "mean_token_accuracy": 0.13675348609685897, "num_tokens": 45844296.0, "step": 21195 }, { "entropy": 6.514334344863892, "epoch": 2.2686072020974906, "grad_norm": 1.7109375, "learning_rate": 0.0004490352369603881, "loss": 6.1275, "mean_token_accuracy": 0.14247518181800842, "num_tokens": 45854942.0, "step": 21200 }, { "entropy": 6.535731410980224, "epoch": 2.2691422762052547, "grad_norm": 1.2265625, "learning_rate": 0.00044901100181690256, "loss": 6.1779, "mean_token_accuracy": 0.14441046714782715, "num_tokens": 45866427.0, "step": 21205 }, { "entropy": 6.499472713470459, "epoch": 2.2696773503130183, "grad_norm": 1.2265625, "learning_rate": 0.00044898676164887387, "loss": 6.1453, "mean_token_accuracy": 0.14784806817770005, "num_tokens": 45877955.0, "step": 21210 }, { "entropy": 6.450230550765991, "epoch": 2.2702124244207824, "grad_norm": 1.3828125, "learning_rate": 0.00044896251645700185, "loss": 6.0154, "mean_token_accuracy": 0.15432262271642685, "num_tokens": 45888668.0, "step": 21215 }, { "entropy": 6.416332054138183, "epoch": 2.270747498528546, "grad_norm": 1.09375, "learning_rate": 0.0004489382662419866, "loss": 6.1028, "mean_token_accuracy": 0.1441604271531105, "num_tokens": 45898819.0, "step": 21220 }, { "entropy": 6.430312633514404, "epoch": 2.27128257263631, "grad_norm": 1.3671875, "learning_rate": 0.0004489140110045283, "loss": 6.1472, "mean_token_accuracy": 0.1442831501364708, "num_tokens": 45909390.0, "step": 21225 }, { "entropy": 6.480388879776001, "epoch": 2.271817646744074, "grad_norm": 1.1484375, "learning_rate": 0.0004488897507453275, "loss": 6.0749, "mean_token_accuracy": 0.14615595564246178, "num_tokens": 45919697.0, "step": 21230 }, { "entropy": 6.538076448440552, "epoch": 2.272352720851838, "grad_norm": 1.3359375, "learning_rate": 0.00044886548546508453, "loss": 6.168, "mean_token_accuracy": 0.1460796669125557, "num_tokens": 45929458.0, "step": 21235 }, { "entropy": 6.38146276473999, "epoch": 2.272887794959602, "grad_norm": 3.140625, "learning_rate": 0.0004488412151645001, "loss": 6.0441, "mean_token_accuracy": 0.14515896439552306, "num_tokens": 45939373.0, "step": 21240 }, { "entropy": 6.384886407852173, "epoch": 2.2734228690673657, "grad_norm": 1.5703125, "learning_rate": 0.00044881693984427504, "loss": 6.1016, "mean_token_accuracy": 0.14431605264544486, "num_tokens": 45949954.0, "step": 21245 }, { "entropy": 6.547086715698242, "epoch": 2.27395794317513, "grad_norm": 2.109375, "learning_rate": 0.0004487926595051102, "loss": 6.1483, "mean_token_accuracy": 0.1462262287735939, "num_tokens": 45960147.0, "step": 21250 }, { "entropy": 6.472574758529663, "epoch": 2.274493017282894, "grad_norm": 1.5234375, "learning_rate": 0.0004487683741477068, "loss": 6.0799, "mean_token_accuracy": 0.14728278070688247, "num_tokens": 45970718.0, "step": 21255 }, { "entropy": 6.425560331344604, "epoch": 2.2750280913906575, "grad_norm": 1.3828125, "learning_rate": 0.000448744083772766, "loss": 6.1151, "mean_token_accuracy": 0.1458531104028225, "num_tokens": 45981631.0, "step": 21260 }, { "entropy": 6.528663396835327, "epoch": 2.2755631654984216, "grad_norm": 1.5078125, "learning_rate": 0.00044871978838098917, "loss": 6.1722, "mean_token_accuracy": 0.13858664259314538, "num_tokens": 45992295.0, "step": 21265 }, { "entropy": 6.566414642333984, "epoch": 2.2760982396061853, "grad_norm": 1.265625, "learning_rate": 0.0004486954879730778, "loss": 6.143, "mean_token_accuracy": 0.1391966737806797, "num_tokens": 46002222.0, "step": 21270 }, { "entropy": 6.421219158172607, "epoch": 2.2766333137139494, "grad_norm": 1.3359375, "learning_rate": 0.0004486711825497337, "loss": 6.0149, "mean_token_accuracy": 0.1610435277223587, "num_tokens": 46012393.0, "step": 21275 }, { "entropy": 6.427218294143676, "epoch": 2.2771683878217135, "grad_norm": 1.140625, "learning_rate": 0.00044864687211165863, "loss": 6.0985, "mean_token_accuracy": 0.14419070109725, "num_tokens": 46022095.0, "step": 21280 }, { "entropy": 6.464762258529663, "epoch": 2.277703461929477, "grad_norm": 1.0703125, "learning_rate": 0.00044862255665955447, "loss": 6.1008, "mean_token_accuracy": 0.14105332791805267, "num_tokens": 46032973.0, "step": 21285 }, { "entropy": 6.492861986160278, "epoch": 2.2782385360372412, "grad_norm": 1.234375, "learning_rate": 0.0004485982361941234, "loss": 6.1009, "mean_token_accuracy": 0.1447777658700943, "num_tokens": 46043430.0, "step": 21290 }, { "entropy": 6.460416078567505, "epoch": 2.278773610145005, "grad_norm": 1.0859375, "learning_rate": 0.0004485739107160677, "loss": 6.0966, "mean_token_accuracy": 0.1445997916162014, "num_tokens": 46054580.0, "step": 21295 }, { "entropy": 6.481352138519287, "epoch": 2.279308684252769, "grad_norm": 1.203125, "learning_rate": 0.00044854958022608974, "loss": 6.1135, "mean_token_accuracy": 0.14967705085873603, "num_tokens": 46064898.0, "step": 21300 }, { "entropy": 6.406143474578857, "epoch": 2.279843758360533, "grad_norm": 2.171875, "learning_rate": 0.00044852524472489196, "loss": 6.0755, "mean_token_accuracy": 0.14774246960878373, "num_tokens": 46075985.0, "step": 21305 }, { "entropy": 6.512715768814087, "epoch": 2.2803788324682968, "grad_norm": 1.5078125, "learning_rate": 0.0004485009042131771, "loss": 6.1958, "mean_token_accuracy": 0.13976200819015502, "num_tokens": 46087544.0, "step": 21310 }, { "entropy": 6.571082544326782, "epoch": 2.280913906576061, "grad_norm": 1.296875, "learning_rate": 0.00044847655869164813, "loss": 6.1119, "mean_token_accuracy": 0.13850533664226533, "num_tokens": 46097613.0, "step": 21315 }, { "entropy": 6.423566579818726, "epoch": 2.281448980683825, "grad_norm": 1.296875, "learning_rate": 0.0004484522081610078, "loss": 6.0271, "mean_token_accuracy": 0.15793740898370742, "num_tokens": 46107728.0, "step": 21320 }, { "entropy": 6.400497674942017, "epoch": 2.2819840547915886, "grad_norm": 1.1484375, "learning_rate": 0.00044842785262195936, "loss": 6.0673, "mean_token_accuracy": 0.14456717669963837, "num_tokens": 46118309.0, "step": 21325 }, { "entropy": 6.467321157455444, "epoch": 2.2825191288993527, "grad_norm": 1.53125, "learning_rate": 0.00044840349207520604, "loss": 6.0903, "mean_token_accuracy": 0.1494164675474167, "num_tokens": 46128425.0, "step": 21330 }, { "entropy": 6.545786046981812, "epoch": 2.2830542030071164, "grad_norm": 1.4375, "learning_rate": 0.0004483791265214513, "loss": 6.2186, "mean_token_accuracy": 0.13865891844034195, "num_tokens": 46139506.0, "step": 21335 }, { "entropy": 6.482575273513794, "epoch": 2.2835892771148805, "grad_norm": 1.1484375, "learning_rate": 0.00044835475596139855, "loss": 6.1147, "mean_token_accuracy": 0.1408474177122116, "num_tokens": 46151226.0, "step": 21340 }, { "entropy": 6.514735078811645, "epoch": 2.284124351222644, "grad_norm": 1.71875, "learning_rate": 0.0004483303803957516, "loss": 6.1725, "mean_token_accuracy": 0.14154839813709258, "num_tokens": 46162749.0, "step": 21345 }, { "entropy": 6.514428520202637, "epoch": 2.2846594253304082, "grad_norm": 1.3671875, "learning_rate": 0.0004483059998252144, "loss": 6.1486, "mean_token_accuracy": 0.14344518333673478, "num_tokens": 46174802.0, "step": 21350 }, { "entropy": 6.512063503265381, "epoch": 2.2851944994381723, "grad_norm": 1.6015625, "learning_rate": 0.00044828161425049067, "loss": 6.1084, "mean_token_accuracy": 0.1469471648335457, "num_tokens": 46185579.0, "step": 21355 }, { "entropy": 6.490062093734741, "epoch": 2.285729573545936, "grad_norm": 1.3046875, "learning_rate": 0.00044825722367228477, "loss": 6.2184, "mean_token_accuracy": 0.1354774422943592, "num_tokens": 46196399.0, "step": 21360 }, { "entropy": 6.4843651294708256, "epoch": 2.2862646476537, "grad_norm": 1.1640625, "learning_rate": 0.00044823282809130084, "loss": 6.1173, "mean_token_accuracy": 0.1408316098153591, "num_tokens": 46206931.0, "step": 21365 }, { "entropy": 6.480353307723999, "epoch": 2.286799721761464, "grad_norm": 1.3046875, "learning_rate": 0.00044820842750824334, "loss": 6.123, "mean_token_accuracy": 0.14742770195007324, "num_tokens": 46217327.0, "step": 21370 }, { "entropy": 6.464926624298096, "epoch": 2.287334795869228, "grad_norm": 1.2109375, "learning_rate": 0.00044818402192381684, "loss": 6.1024, "mean_token_accuracy": 0.14369666427373887, "num_tokens": 46227981.0, "step": 21375 }, { "entropy": 6.46083517074585, "epoch": 2.287869869976992, "grad_norm": 1.34375, "learning_rate": 0.00044815961133872606, "loss": 6.1759, "mean_token_accuracy": 0.1374279096722603, "num_tokens": 46238500.0, "step": 21380 }, { "entropy": 6.423061943054199, "epoch": 2.2884049440847556, "grad_norm": 1.3359375, "learning_rate": 0.00044813519575367586, "loss": 6.0463, "mean_token_accuracy": 0.15272779762744904, "num_tokens": 46249530.0, "step": 21385 }, { "entropy": 6.463318729400635, "epoch": 2.2889400181925197, "grad_norm": 1.4140625, "learning_rate": 0.0004481107751693711, "loss": 6.0172, "mean_token_accuracy": 0.14625746756792068, "num_tokens": 46260272.0, "step": 21390 }, { "entropy": 6.405825805664063, "epoch": 2.2894750923002833, "grad_norm": 1.40625, "learning_rate": 0.0004480863495865171, "loss": 6.0766, "mean_token_accuracy": 0.14429645165801047, "num_tokens": 46271805.0, "step": 21395 }, { "entropy": 6.4480000019073485, "epoch": 2.2900101664080474, "grad_norm": 1.4453125, "learning_rate": 0.0004480619190058191, "loss": 6.1459, "mean_token_accuracy": 0.146460422873497, "num_tokens": 46282211.0, "step": 21400 }, { "entropy": 6.375118398666382, "epoch": 2.2905452405158115, "grad_norm": 1.328125, "learning_rate": 0.00044803748342798247, "loss": 6.038, "mean_token_accuracy": 0.14773557037115098, "num_tokens": 46292287.0, "step": 21405 }, { "entropy": 6.414663934707642, "epoch": 2.291080314623575, "grad_norm": 1.4140625, "learning_rate": 0.00044801304285371286, "loss": 6.1597, "mean_token_accuracy": 0.14005930796265603, "num_tokens": 46302978.0, "step": 21410 }, { "entropy": 6.48315954208374, "epoch": 2.2916153887313393, "grad_norm": 1.2578125, "learning_rate": 0.0004479885972837159, "loss": 6.136, "mean_token_accuracy": 0.1436718448996544, "num_tokens": 46313958.0, "step": 21415 }, { "entropy": 6.573699235916138, "epoch": 2.2921504628391034, "grad_norm": 1.359375, "learning_rate": 0.0004479641467186975, "loss": 6.1423, "mean_token_accuracy": 0.13935375362634658, "num_tokens": 46325262.0, "step": 21420 }, { "entropy": 6.473975706100464, "epoch": 2.292685536946867, "grad_norm": 1.125, "learning_rate": 0.00044793969115936375, "loss": 6.1566, "mean_token_accuracy": 0.14281628876924515, "num_tokens": 46336773.0, "step": 21425 }, { "entropy": 6.408493328094482, "epoch": 2.293220611054631, "grad_norm": 1.328125, "learning_rate": 0.0004479152306064207, "loss": 6.1091, "mean_token_accuracy": 0.1484253726899624, "num_tokens": 46346616.0, "step": 21430 }, { "entropy": 6.433761548995972, "epoch": 2.293755685162395, "grad_norm": 1.2734375, "learning_rate": 0.0004478907650605745, "loss": 6.142, "mean_token_accuracy": 0.14191639199852943, "num_tokens": 46358564.0, "step": 21435 }, { "entropy": 6.500779056549073, "epoch": 2.294290759270159, "grad_norm": 1.2578125, "learning_rate": 0.00044786629452253196, "loss": 6.0045, "mean_token_accuracy": 0.1546463519334793, "num_tokens": 46369207.0, "step": 21440 }, { "entropy": 6.500661611557007, "epoch": 2.294825833377923, "grad_norm": 1.2890625, "learning_rate": 0.0004478418189929994, "loss": 6.1084, "mean_token_accuracy": 0.1481148973107338, "num_tokens": 46379382.0, "step": 21445 }, { "entropy": 6.394848299026489, "epoch": 2.2953609074856867, "grad_norm": 1.296875, "learning_rate": 0.00044781733847268357, "loss": 6.2088, "mean_token_accuracy": 0.13839469999074935, "num_tokens": 46390738.0, "step": 21450 }, { "entropy": 6.445329666137695, "epoch": 2.2958959815934508, "grad_norm": 1.15625, "learning_rate": 0.00044779285296229137, "loss": 6.0085, "mean_token_accuracy": 0.15295333862304689, "num_tokens": 46401740.0, "step": 21455 }, { "entropy": 6.529813671112061, "epoch": 2.2964310557012144, "grad_norm": 1.25, "learning_rate": 0.00044776836246252985, "loss": 6.0751, "mean_token_accuracy": 0.14564138129353524, "num_tokens": 46412009.0, "step": 21460 }, { "entropy": 6.511179065704345, "epoch": 2.2969661298089785, "grad_norm": 1.1640625, "learning_rate": 0.0004477438669741061, "loss": 6.1671, "mean_token_accuracy": 0.14272557497024535, "num_tokens": 46422550.0, "step": 21465 }, { "entropy": 6.48570294380188, "epoch": 2.2975012039167426, "grad_norm": 1.4140625, "learning_rate": 0.0004477193664977275, "loss": 6.1433, "mean_token_accuracy": 0.142554097622633, "num_tokens": 46432797.0, "step": 21470 }, { "entropy": 6.362465810775757, "epoch": 2.2980362780245063, "grad_norm": 1.3046875, "learning_rate": 0.0004476948610341015, "loss": 5.9686, "mean_token_accuracy": 0.15197512730956078, "num_tokens": 46444638.0, "step": 21475 }, { "entropy": 6.499190998077393, "epoch": 2.2985713521322704, "grad_norm": 1.2109375, "learning_rate": 0.00044767035058393564, "loss": 6.0627, "mean_token_accuracy": 0.14615911543369292, "num_tokens": 46455404.0, "step": 21480 }, { "entropy": 6.454323482513428, "epoch": 2.2991064262400345, "grad_norm": 1.2265625, "learning_rate": 0.00044764583514793766, "loss": 6.1519, "mean_token_accuracy": 0.14273363053798677, "num_tokens": 46466821.0, "step": 21485 }, { "entropy": 6.49699592590332, "epoch": 2.299641500347798, "grad_norm": 1.1796875, "learning_rate": 0.0004476213147268154, "loss": 6.1234, "mean_token_accuracy": 0.1443875789642334, "num_tokens": 46477222.0, "step": 21490 }, { "entropy": 6.466975498199463, "epoch": 2.3001765744555622, "grad_norm": 1.265625, "learning_rate": 0.00044759678932127693, "loss": 6.0676, "mean_token_accuracy": 0.1496296063065529, "num_tokens": 46488596.0, "step": 21495 }, { "entropy": 6.467964744567871, "epoch": 2.300711648563326, "grad_norm": 1.578125, "learning_rate": 0.00044757225893203047, "loss": 6.1381, "mean_token_accuracy": 0.13738736882805824, "num_tokens": 46499799.0, "step": 21500 }, { "entropy": 6.530542659759521, "epoch": 2.30124672267109, "grad_norm": 1.234375, "learning_rate": 0.0004475477235597843, "loss": 6.1504, "mean_token_accuracy": 0.1487916424870491, "num_tokens": 46511077.0, "step": 21505 }, { "entropy": 6.540336608886719, "epoch": 2.3017817967788536, "grad_norm": 1.921875, "learning_rate": 0.0004475231832052469, "loss": 6.1816, "mean_token_accuracy": 0.13712119460105895, "num_tokens": 46523517.0, "step": 21510 }, { "entropy": 6.44324221611023, "epoch": 2.3023168708866177, "grad_norm": 1.3046875, "learning_rate": 0.0004474986378691267, "loss": 6.0796, "mean_token_accuracy": 0.1514226734638214, "num_tokens": 46533198.0, "step": 21515 }, { "entropy": 6.458317995071411, "epoch": 2.302851944994382, "grad_norm": 1.515625, "learning_rate": 0.00044747408755213265, "loss": 6.1211, "mean_token_accuracy": 0.1400451898574829, "num_tokens": 46544659.0, "step": 21520 }, { "entropy": 6.464485597610474, "epoch": 2.3033870191021455, "grad_norm": 1.265625, "learning_rate": 0.00044744953225497354, "loss": 6.0885, "mean_token_accuracy": 0.13881469368934632, "num_tokens": 46555897.0, "step": 21525 }, { "entropy": 6.473492383956909, "epoch": 2.3039220932099096, "grad_norm": 1.1875, "learning_rate": 0.00044742497197835845, "loss": 6.0981, "mean_token_accuracy": 0.1433671548962593, "num_tokens": 46565695.0, "step": 21530 }, { "entropy": 6.486868143081665, "epoch": 2.3044571673176737, "grad_norm": 1.234375, "learning_rate": 0.0004474004067229965, "loss": 6.1661, "mean_token_accuracy": 0.13898584991693497, "num_tokens": 46576620.0, "step": 21535 }, { "entropy": 6.560863399505616, "epoch": 2.3049922414254373, "grad_norm": 1.359375, "learning_rate": 0.000447375836489597, "loss": 6.1999, "mean_token_accuracy": 0.13523969948291778, "num_tokens": 46588264.0, "step": 21540 }, { "entropy": 6.492392110824585, "epoch": 2.3055273155332014, "grad_norm": 1.5234375, "learning_rate": 0.00044735126127886944, "loss": 6.1139, "mean_token_accuracy": 0.1459447041153908, "num_tokens": 46600180.0, "step": 21545 }, { "entropy": 6.416586303710938, "epoch": 2.306062389640965, "grad_norm": 1.6953125, "learning_rate": 0.0004473266810915235, "loss": 6.1079, "mean_token_accuracy": 0.14974152147769929, "num_tokens": 46610391.0, "step": 21550 }, { "entropy": 6.444928407669067, "epoch": 2.306597463748729, "grad_norm": 2.265625, "learning_rate": 0.0004473020959282688, "loss": 6.1754, "mean_token_accuracy": 0.14088292866945268, "num_tokens": 46622955.0, "step": 21555 }, { "entropy": 6.541250991821289, "epoch": 2.3071325378564933, "grad_norm": 1.4140625, "learning_rate": 0.00044727750578981535, "loss": 6.1494, "mean_token_accuracy": 0.14749521464109422, "num_tokens": 46632361.0, "step": 21560 }, { "entropy": 6.483514499664307, "epoch": 2.307667611964257, "grad_norm": 2.34375, "learning_rate": 0.0004472529106768731, "loss": 6.0878, "mean_token_accuracy": 0.14300166070461273, "num_tokens": 46642693.0, "step": 21565 }, { "entropy": 6.432924032211304, "epoch": 2.308202686072021, "grad_norm": 1.34375, "learning_rate": 0.0004472283105901522, "loss": 6.0188, "mean_token_accuracy": 0.1453826680779457, "num_tokens": 46653251.0, "step": 21570 }, { "entropy": 6.4843464374542235, "epoch": 2.3087377601797847, "grad_norm": 1.34375, "learning_rate": 0.0004472037055303631, "loss": 6.1826, "mean_token_accuracy": 0.13390331342816353, "num_tokens": 46664751.0, "step": 21575 }, { "entropy": 6.408978414535523, "epoch": 2.309272834287549, "grad_norm": 1.3671875, "learning_rate": 0.0004471790954982162, "loss": 6.0845, "mean_token_accuracy": 0.13748776018619538, "num_tokens": 46676825.0, "step": 21580 }, { "entropy": 6.457317972183228, "epoch": 2.309807908395313, "grad_norm": 1.328125, "learning_rate": 0.0004471544804944221, "loss": 6.0559, "mean_token_accuracy": 0.15056889727711678, "num_tokens": 46687202.0, "step": 21585 }, { "entropy": 6.474427318572998, "epoch": 2.3103429825030766, "grad_norm": 1.234375, "learning_rate": 0.0004471298605196916, "loss": 6.1895, "mean_token_accuracy": 0.14413033798336983, "num_tokens": 46697687.0, "step": 21590 }, { "entropy": 6.399207735061646, "epoch": 2.3108780566108407, "grad_norm": 1.6875, "learning_rate": 0.00044710523557473544, "loss": 6.0625, "mean_token_accuracy": 0.14721462577581407, "num_tokens": 46709088.0, "step": 21595 }, { "entropy": 6.450528955459594, "epoch": 2.3114131307186048, "grad_norm": 1.3046875, "learning_rate": 0.00044708060566026487, "loss": 6.1467, "mean_token_accuracy": 0.1441744640469551, "num_tokens": 46721675.0, "step": 21600 }, { "entropy": 6.5083414077758786, "epoch": 2.3119482048263684, "grad_norm": 1.21875, "learning_rate": 0.000447055970776991, "loss": 6.146, "mean_token_accuracy": 0.14367825761437417, "num_tokens": 46731854.0, "step": 21605 }, { "entropy": 6.498157739639282, "epoch": 2.3124832789341325, "grad_norm": 1.203125, "learning_rate": 0.00044703133092562514, "loss": 6.1645, "mean_token_accuracy": 0.1401453897356987, "num_tokens": 46742815.0, "step": 21610 }, { "entropy": 6.444508695602417, "epoch": 2.313018353041896, "grad_norm": 1.65625, "learning_rate": 0.00044700668610687884, "loss": 6.1099, "mean_token_accuracy": 0.1517878845334053, "num_tokens": 46753012.0, "step": 21615 }, { "entropy": 6.400829458236695, "epoch": 2.3135534271496603, "grad_norm": 1.328125, "learning_rate": 0.00044698203632146353, "loss": 6.0944, "mean_token_accuracy": 0.14552355259656907, "num_tokens": 46763701.0, "step": 21620 }, { "entropy": 6.538299131393432, "epoch": 2.314088501257424, "grad_norm": 1.4921875, "learning_rate": 0.0004469573815700911, "loss": 6.1682, "mean_token_accuracy": 0.13725191131234168, "num_tokens": 46775407.0, "step": 21625 }, { "entropy": 6.443868112564087, "epoch": 2.314623575365188, "grad_norm": 1.5390625, "learning_rate": 0.00044693272185347357, "loss": 6.0412, "mean_token_accuracy": 0.1495553120970726, "num_tokens": 46786282.0, "step": 21630 }, { "entropy": 6.434365463256836, "epoch": 2.315158649472952, "grad_norm": 1.3046875, "learning_rate": 0.0004469080571723228, "loss": 6.137, "mean_token_accuracy": 0.14069043099880219, "num_tokens": 46796768.0, "step": 21635 }, { "entropy": 6.460161018371582, "epoch": 2.315693723580716, "grad_norm": 1.5546875, "learning_rate": 0.00044688338752735095, "loss": 6.0414, "mean_token_accuracy": 0.1459738865494728, "num_tokens": 46806538.0, "step": 21640 }, { "entropy": 6.436695194244384, "epoch": 2.31622879768848, "grad_norm": 1.453125, "learning_rate": 0.0004468587129192705, "loss": 6.0413, "mean_token_accuracy": 0.15677194446325302, "num_tokens": 46816692.0, "step": 21645 }, { "entropy": 6.412927484512329, "epoch": 2.316763871796244, "grad_norm": 1.765625, "learning_rate": 0.00044683403334879384, "loss": 6.1357, "mean_token_accuracy": 0.14876748770475387, "num_tokens": 46827551.0, "step": 21650 }, { "entropy": 6.446659421920776, "epoch": 2.3172989459040076, "grad_norm": 1.28125, "learning_rate": 0.0004468093488166337, "loss": 6.255, "mean_token_accuracy": 0.13067039772868155, "num_tokens": 46840168.0, "step": 21655 }, { "entropy": 6.497695875167847, "epoch": 2.3178340200117717, "grad_norm": 1.21875, "learning_rate": 0.00044678465932350273, "loss": 6.1072, "mean_token_accuracy": 0.1501982994377613, "num_tokens": 46851086.0, "step": 21660 }, { "entropy": 6.443648338317871, "epoch": 2.3183690941195354, "grad_norm": 1.296875, "learning_rate": 0.00044675996487011373, "loss": 6.0513, "mean_token_accuracy": 0.15467752665281295, "num_tokens": 46861830.0, "step": 21665 }, { "entropy": 6.460092782974243, "epoch": 2.3189041682272995, "grad_norm": 2.5, "learning_rate": 0.00044673526545718, "loss": 6.1229, "mean_token_accuracy": 0.15216980874538422, "num_tokens": 46871348.0, "step": 21670 }, { "entropy": 6.397512769699096, "epoch": 2.3194392423350636, "grad_norm": 1.2421875, "learning_rate": 0.0004467105610854146, "loss": 6.1126, "mean_token_accuracy": 0.1430137500166893, "num_tokens": 46882737.0, "step": 21675 }, { "entropy": 6.517483139038086, "epoch": 2.3199743164428273, "grad_norm": 1.25, "learning_rate": 0.00044668585175553085, "loss": 6.1837, "mean_token_accuracy": 0.13247976154088975, "num_tokens": 46893616.0, "step": 21680 }, { "entropy": 6.594755077362061, "epoch": 2.3205093905505914, "grad_norm": 1.40625, "learning_rate": 0.0004466611374682423, "loss": 6.1107, "mean_token_accuracy": 0.14227721691131592, "num_tokens": 46904546.0, "step": 21685 }, { "entropy": 6.500962781906128, "epoch": 2.321044464658355, "grad_norm": 1.171875, "learning_rate": 0.00044663641822426244, "loss": 6.0923, "mean_token_accuracy": 0.1464128315448761, "num_tokens": 46915513.0, "step": 21690 }, { "entropy": 6.531744813919067, "epoch": 2.321579538766119, "grad_norm": 1.21875, "learning_rate": 0.00044661169402430517, "loss": 6.1596, "mean_token_accuracy": 0.14340778365731238, "num_tokens": 46925535.0, "step": 21695 }, { "entropy": 6.402699422836304, "epoch": 2.322114612873883, "grad_norm": 1.7578125, "learning_rate": 0.00044658696486908443, "loss": 6.1367, "mean_token_accuracy": 0.14523040503263474, "num_tokens": 46936222.0, "step": 21700 }, { "entropy": 6.4080376625061035, "epoch": 2.322649686981647, "grad_norm": 1.59375, "learning_rate": 0.0004465622307593141, "loss": 6.0408, "mean_token_accuracy": 0.15628817230463027, "num_tokens": 46946855.0, "step": 21705 }, { "entropy": 6.500241661071778, "epoch": 2.323184761089411, "grad_norm": 1.2734375, "learning_rate": 0.00044653749169570845, "loss": 6.1138, "mean_token_accuracy": 0.1438905455172062, "num_tokens": 46958246.0, "step": 21710 }, { "entropy": 6.426049470901489, "epoch": 2.3237198351971746, "grad_norm": 1.4375, "learning_rate": 0.00044651274767898186, "loss": 6.1027, "mean_token_accuracy": 0.15005214810371398, "num_tokens": 46969237.0, "step": 21715 }, { "entropy": 6.497728538513184, "epoch": 2.3242549093049387, "grad_norm": 1.3046875, "learning_rate": 0.0004464879987098488, "loss": 6.181, "mean_token_accuracy": 0.145807583630085, "num_tokens": 46979897.0, "step": 21720 }, { "entropy": 6.512001848220825, "epoch": 2.324789983412703, "grad_norm": 1.375, "learning_rate": 0.0004464632447890238, "loss": 6.062, "mean_token_accuracy": 0.1542833387851715, "num_tokens": 46989833.0, "step": 21725 }, { "entropy": 6.40179762840271, "epoch": 2.3253250575204665, "grad_norm": 1.28125, "learning_rate": 0.00044643848591722183, "loss": 6.0673, "mean_token_accuracy": 0.15154348015785218, "num_tokens": 46999822.0, "step": 21730 }, { "entropy": 6.415911293029785, "epoch": 2.3258601316282306, "grad_norm": 1.2890625, "learning_rate": 0.00044641372209515764, "loss": 6.0766, "mean_token_accuracy": 0.15227730497717856, "num_tokens": 47010176.0, "step": 21735 }, { "entropy": 6.408161258697509, "epoch": 2.3263952057359942, "grad_norm": 1.53125, "learning_rate": 0.0004463889533235462, "loss": 6.0748, "mean_token_accuracy": 0.149746111035347, "num_tokens": 47020184.0, "step": 21740 }, { "entropy": 6.489200210571289, "epoch": 2.3269302798437583, "grad_norm": 1.3671875, "learning_rate": 0.00044636417960310294, "loss": 6.1908, "mean_token_accuracy": 0.14212247133255004, "num_tokens": 47032066.0, "step": 21745 }, { "entropy": 6.504646682739258, "epoch": 2.3274653539515224, "grad_norm": 1.4375, "learning_rate": 0.0004463394009345431, "loss": 6.1965, "mean_token_accuracy": 0.13769288137555122, "num_tokens": 47043571.0, "step": 21750 }, { "entropy": 6.5607038021087645, "epoch": 2.328000428059286, "grad_norm": 1.703125, "learning_rate": 0.00044631461731858195, "loss": 6.1135, "mean_token_accuracy": 0.14365242198109626, "num_tokens": 47053813.0, "step": 21755 }, { "entropy": 6.518549680709839, "epoch": 2.32853550216705, "grad_norm": 1.21875, "learning_rate": 0.00044628982875593546, "loss": 6.1367, "mean_token_accuracy": 0.14682541340589522, "num_tokens": 47063671.0, "step": 21760 }, { "entropy": 6.3841774463653564, "epoch": 2.3290705762748143, "grad_norm": 1.3671875, "learning_rate": 0.00044626503524731917, "loss": 6.0416, "mean_token_accuracy": 0.15007409751415252, "num_tokens": 47073537.0, "step": 21765 }, { "entropy": 6.404321336746216, "epoch": 2.329605650382578, "grad_norm": 1.2265625, "learning_rate": 0.0004462402367934491, "loss": 6.1116, "mean_token_accuracy": 0.14446128010749817, "num_tokens": 47084272.0, "step": 21770 }, { "entropy": 6.508105659484864, "epoch": 2.330140724490342, "grad_norm": 1.34375, "learning_rate": 0.0004462154333950412, "loss": 6.1615, "mean_token_accuracy": 0.13968442976474763, "num_tokens": 47095198.0, "step": 21775 }, { "entropy": 6.586350345611573, "epoch": 2.3306757985981057, "grad_norm": 1.3125, "learning_rate": 0.0004461906250528117, "loss": 6.1676, "mean_token_accuracy": 0.13975676000118256, "num_tokens": 47106540.0, "step": 21780 }, { "entropy": 6.496125936508179, "epoch": 2.33121087270587, "grad_norm": 1.328125, "learning_rate": 0.000446165811767477, "loss": 6.1602, "mean_token_accuracy": 0.15234325900673867, "num_tokens": 47117301.0, "step": 21785 }, { "entropy": 6.421975374221802, "epoch": 2.3317459468136335, "grad_norm": 1.40625, "learning_rate": 0.0004461409935397536, "loss": 6.1342, "mean_token_accuracy": 0.1442764952778816, "num_tokens": 47127058.0, "step": 21790 }, { "entropy": 6.451207876205444, "epoch": 2.3322810209213976, "grad_norm": 1.2265625, "learning_rate": 0.00044611617037035794, "loss": 6.0745, "mean_token_accuracy": 0.1451098144054413, "num_tokens": 47137182.0, "step": 21795 }, { "entropy": 6.502760410308838, "epoch": 2.3328160950291617, "grad_norm": 1.2109375, "learning_rate": 0.000446091342260007, "loss": 6.1407, "mean_token_accuracy": 0.1408575102686882, "num_tokens": 47148591.0, "step": 21800 }, { "entropy": 6.490858745574951, "epoch": 2.3333511691369253, "grad_norm": 1.2734375, "learning_rate": 0.00044606650920941753, "loss": 6.0911, "mean_token_accuracy": 0.14580915346741677, "num_tokens": 47159014.0, "step": 21805 }, { "entropy": 6.452058935165406, "epoch": 2.3338862432446894, "grad_norm": 1.2265625, "learning_rate": 0.0004460416712193067, "loss": 6.1142, "mean_token_accuracy": 0.14342996776103972, "num_tokens": 47168760.0, "step": 21810 }, { "entropy": 6.425150775909424, "epoch": 2.3344213173524535, "grad_norm": 1.5, "learning_rate": 0.0004460168282903916, "loss": 6.1476, "mean_token_accuracy": 0.146635565161705, "num_tokens": 47180902.0, "step": 21815 }, { "entropy": 6.415819263458252, "epoch": 2.334956391460217, "grad_norm": 1.25, "learning_rate": 0.00044599198042338963, "loss": 6.0088, "mean_token_accuracy": 0.15336752980947493, "num_tokens": 47190458.0, "step": 21820 }, { "entropy": 6.486897945404053, "epoch": 2.3354914655679813, "grad_norm": 2.015625, "learning_rate": 0.00044596712761901824, "loss": 6.1608, "mean_token_accuracy": 0.14041486904025077, "num_tokens": 47201099.0, "step": 21825 }, { "entropy": 6.4499674320220945, "epoch": 2.336026539675745, "grad_norm": 1.625, "learning_rate": 0.0004459422698779951, "loss": 6.0878, "mean_token_accuracy": 0.15117376744747163, "num_tokens": 47211284.0, "step": 21830 }, { "entropy": 6.471955585479736, "epoch": 2.336561613783509, "grad_norm": 1.578125, "learning_rate": 0.0004459174072010379, "loss": 6.1736, "mean_token_accuracy": 0.140228820592165, "num_tokens": 47222875.0, "step": 21835 }, { "entropy": 6.461224126815796, "epoch": 2.337096687891273, "grad_norm": 1.28125, "learning_rate": 0.0004458925395888646, "loss": 6.1497, "mean_token_accuracy": 0.13779575526714324, "num_tokens": 47234238.0, "step": 21840 }, { "entropy": 6.491030359268189, "epoch": 2.3376317619990368, "grad_norm": 1.28125, "learning_rate": 0.00044586766704219326, "loss": 6.1376, "mean_token_accuracy": 0.14399240165948868, "num_tokens": 47244634.0, "step": 21845 }, { "entropy": 6.505905437469482, "epoch": 2.338166836106801, "grad_norm": 1.21875, "learning_rate": 0.000445842789561742, "loss": 6.1541, "mean_token_accuracy": 0.1389889657497406, "num_tokens": 47256538.0, "step": 21850 }, { "entropy": 6.419703626632691, "epoch": 2.3387019102145645, "grad_norm": 1.2109375, "learning_rate": 0.0004458179071482292, "loss": 5.9842, "mean_token_accuracy": 0.15503145307302474, "num_tokens": 47266373.0, "step": 21855 }, { "entropy": 6.44592866897583, "epoch": 2.3392369843223286, "grad_norm": 1.2890625, "learning_rate": 0.00044579301980237333, "loss": 6.1622, "mean_token_accuracy": 0.1415998123586178, "num_tokens": 47276441.0, "step": 21860 }, { "entropy": 6.475642395019531, "epoch": 2.3397720584300927, "grad_norm": 1.2421875, "learning_rate": 0.0004457681275248931, "loss": 6.1401, "mean_token_accuracy": 0.14419428408145904, "num_tokens": 47287299.0, "step": 21865 }, { "entropy": 6.433586645126343, "epoch": 2.3403071325378564, "grad_norm": 1.3046875, "learning_rate": 0.00044574323031650715, "loss": 6.0095, "mean_token_accuracy": 0.1488127738237381, "num_tokens": 47298007.0, "step": 21870 }, { "entropy": 6.395630836486816, "epoch": 2.3408422066456205, "grad_norm": 1.34375, "learning_rate": 0.0004457183281779343, "loss": 5.99, "mean_token_accuracy": 0.15820934772491455, "num_tokens": 47309729.0, "step": 21875 }, { "entropy": 6.472767734527588, "epoch": 2.3413772807533846, "grad_norm": 1.3203125, "learning_rate": 0.00044569342110989385, "loss": 6.0856, "mean_token_accuracy": 0.14362915158271788, "num_tokens": 47319050.0, "step": 21880 }, { "entropy": 6.502427625656128, "epoch": 2.3419123548611482, "grad_norm": 1.28125, "learning_rate": 0.0004456685091131048, "loss": 6.2318, "mean_token_accuracy": 0.14244758933782578, "num_tokens": 47330365.0, "step": 21885 }, { "entropy": 6.565773963928223, "epoch": 2.3424474289689123, "grad_norm": 1.4453125, "learning_rate": 0.00044564359218828654, "loss": 6.1175, "mean_token_accuracy": 0.14507446810603142, "num_tokens": 47341225.0, "step": 21890 }, { "entropy": 6.466375350952148, "epoch": 2.342982503076676, "grad_norm": 1.3125, "learning_rate": 0.00044561867033615854, "loss": 6.0724, "mean_token_accuracy": 0.1484555646777153, "num_tokens": 47352996.0, "step": 21895 }, { "entropy": 6.36544280052185, "epoch": 2.34351757718444, "grad_norm": 1.46875, "learning_rate": 0.0004455937435574404, "loss": 6.029, "mean_token_accuracy": 0.14715228229761124, "num_tokens": 47363577.0, "step": 21900 }, { "entropy": 6.528714418411255, "epoch": 2.3440526512922037, "grad_norm": 1.3203125, "learning_rate": 0.00044556881185285185, "loss": 6.2399, "mean_token_accuracy": 0.1366798348724842, "num_tokens": 47374389.0, "step": 21905 }, { "entropy": 6.43365478515625, "epoch": 2.344587725399968, "grad_norm": 1.390625, "learning_rate": 0.00044554387522311286, "loss": 6.0577, "mean_token_accuracy": 0.14907207265496253, "num_tokens": 47385624.0, "step": 21910 }, { "entropy": 6.469548654556275, "epoch": 2.345122799507732, "grad_norm": 1.390625, "learning_rate": 0.0004455189336689435, "loss": 6.1419, "mean_token_accuracy": 0.14058734253048896, "num_tokens": 47396611.0, "step": 21915 }, { "entropy": 6.524194955825806, "epoch": 2.3456578736154956, "grad_norm": 1.515625, "learning_rate": 0.00044549398719106374, "loss": 6.1362, "mean_token_accuracy": 0.14465692192316054, "num_tokens": 47406693.0, "step": 21920 }, { "entropy": 6.439492654800415, "epoch": 2.3461929477232597, "grad_norm": 1.3046875, "learning_rate": 0.0004454690357901942, "loss": 6.0396, "mean_token_accuracy": 0.14539337754249573, "num_tokens": 47417528.0, "step": 21925 }, { "entropy": 6.4850907802581785, "epoch": 2.346728021831024, "grad_norm": 1.421875, "learning_rate": 0.0004454440794670552, "loss": 6.1811, "mean_token_accuracy": 0.14375433847308158, "num_tokens": 47430032.0, "step": 21930 }, { "entropy": 6.543843221664429, "epoch": 2.3472630959387875, "grad_norm": 4.3125, "learning_rate": 0.00044541911822236724, "loss": 6.1904, "mean_token_accuracy": 0.14003921672701836, "num_tokens": 47441002.0, "step": 21935 }, { "entropy": 6.503658056259155, "epoch": 2.3477981700465516, "grad_norm": 1.34375, "learning_rate": 0.0004453941520568513, "loss": 6.0523, "mean_token_accuracy": 0.15220372527837753, "num_tokens": 47451716.0, "step": 21940 }, { "entropy": 6.424562406539917, "epoch": 2.348333244154315, "grad_norm": 1.265625, "learning_rate": 0.0004453691809712281, "loss": 6.0924, "mean_token_accuracy": 0.14600750505924226, "num_tokens": 47463039.0, "step": 21945 }, { "entropy": 6.391051959991455, "epoch": 2.3488683182620793, "grad_norm": 1.515625, "learning_rate": 0.00044534420496621877, "loss": 6.0232, "mean_token_accuracy": 0.1518831267952919, "num_tokens": 47473836.0, "step": 21950 }, { "entropy": 6.487048387527466, "epoch": 2.3494033923698434, "grad_norm": 1.28125, "learning_rate": 0.00044531922404254445, "loss": 6.1117, "mean_token_accuracy": 0.14269979447126388, "num_tokens": 47485103.0, "step": 21955 }, { "entropy": 6.413436937332153, "epoch": 2.349938466477607, "grad_norm": 1.1484375, "learning_rate": 0.0004452942382009265, "loss": 6.039, "mean_token_accuracy": 0.15239893049001693, "num_tokens": 47495509.0, "step": 21960 }, { "entropy": 6.4652406692504885, "epoch": 2.350473540585371, "grad_norm": 1.265625, "learning_rate": 0.0004452692474420863, "loss": 6.0953, "mean_token_accuracy": 0.14660671055316926, "num_tokens": 47506062.0, "step": 21965 }, { "entropy": 6.419542264938355, "epoch": 2.351008614693135, "grad_norm": 1.1796875, "learning_rate": 0.0004452442517667455, "loss": 6.0466, "mean_token_accuracy": 0.1540869191288948, "num_tokens": 47515632.0, "step": 21970 }, { "entropy": 6.395643329620361, "epoch": 2.351543688800899, "grad_norm": 1.2578125, "learning_rate": 0.0004452192511756259, "loss": 6.0084, "mean_token_accuracy": 0.15169961005449295, "num_tokens": 47525412.0, "step": 21975 }, { "entropy": 6.454103708267212, "epoch": 2.352078762908663, "grad_norm": 1.4140625, "learning_rate": 0.00044519424566944935, "loss": 6.0791, "mean_token_accuracy": 0.14625447019934654, "num_tokens": 47536094.0, "step": 21980 }, { "entropy": 6.431142520904541, "epoch": 2.3526138370164267, "grad_norm": 1.171875, "learning_rate": 0.00044516923524893777, "loss": 6.036, "mean_token_accuracy": 0.14398616775870324, "num_tokens": 47546893.0, "step": 21985 }, { "entropy": 6.47427191734314, "epoch": 2.353148911124191, "grad_norm": 1.2421875, "learning_rate": 0.00044514421991481354, "loss": 6.0402, "mean_token_accuracy": 0.14828135967254638, "num_tokens": 47557117.0, "step": 21990 }, { "entropy": 6.466085052490234, "epoch": 2.3536839852319544, "grad_norm": 1.140625, "learning_rate": 0.00044511919966779885, "loss": 6.0536, "mean_token_accuracy": 0.14336677640676498, "num_tokens": 47567878.0, "step": 21995 }, { "entropy": 6.446047401428222, "epoch": 2.3542190593397185, "grad_norm": 1.2265625, "learning_rate": 0.00044509417450861615, "loss": 6.124, "mean_token_accuracy": 0.13893141895532607, "num_tokens": 47578185.0, "step": 22000 }, { "entropy": 6.540997695922852, "epoch": 2.3547541334474826, "grad_norm": 1.21875, "learning_rate": 0.0004450691444379881, "loss": 6.233, "mean_token_accuracy": 0.13426421955227852, "num_tokens": 47590042.0, "step": 22005 }, { "entropy": 6.527778577804566, "epoch": 2.3552892075552463, "grad_norm": 1.1953125, "learning_rate": 0.00044504410945663735, "loss": 6.1192, "mean_token_accuracy": 0.14576566070318223, "num_tokens": 47601225.0, "step": 22010 }, { "entropy": 6.457901096343994, "epoch": 2.3558242816630104, "grad_norm": 1.1640625, "learning_rate": 0.00044501906956528686, "loss": 6.1441, "mean_token_accuracy": 0.14177038371562958, "num_tokens": 47612596.0, "step": 22015 }, { "entropy": 6.5307739734649655, "epoch": 2.356359355770774, "grad_norm": 1.3125, "learning_rate": 0.0004449940247646596, "loss": 6.1724, "mean_token_accuracy": 0.1433061607182026, "num_tokens": 47623156.0, "step": 22020 }, { "entropy": 6.4633606433868405, "epoch": 2.356894429878538, "grad_norm": 1.171875, "learning_rate": 0.00044496897505547886, "loss": 6.0726, "mean_token_accuracy": 0.1438271701335907, "num_tokens": 47633743.0, "step": 22025 }, { "entropy": 6.459659194946289, "epoch": 2.3574295039863022, "grad_norm": 1.4609375, "learning_rate": 0.0004449439204384677, "loss": 6.1354, "mean_token_accuracy": 0.14252169132232667, "num_tokens": 47643914.0, "step": 22030 }, { "entropy": 6.487078237533569, "epoch": 2.357964578094066, "grad_norm": 1.34375, "learning_rate": 0.00044491886091434983, "loss": 6.1292, "mean_token_accuracy": 0.1452212765812874, "num_tokens": 47655187.0, "step": 22035 }, { "entropy": 6.503546190261841, "epoch": 2.35849965220183, "grad_norm": 1.375, "learning_rate": 0.0004448937964838487, "loss": 6.1202, "mean_token_accuracy": 0.1437824249267578, "num_tokens": 47667193.0, "step": 22040 }, { "entropy": 6.48775954246521, "epoch": 2.359034726309594, "grad_norm": 1.234375, "learning_rate": 0.0004448687271476881, "loss": 6.14, "mean_token_accuracy": 0.14331882148981095, "num_tokens": 47678116.0, "step": 22045 }, { "entropy": 6.495173025131225, "epoch": 2.3595698004173578, "grad_norm": 1.5078125, "learning_rate": 0.0004448436529065918, "loss": 6.1154, "mean_token_accuracy": 0.14533022344112395, "num_tokens": 47689883.0, "step": 22050 }, { "entropy": 6.4617774963378904, "epoch": 2.360104874525122, "grad_norm": 1.3046875, "learning_rate": 0.0004448185737612839, "loss": 6.1052, "mean_token_accuracy": 0.14905785024166107, "num_tokens": 47699939.0, "step": 22055 }, { "entropy": 6.398660135269165, "epoch": 2.3606399486328855, "grad_norm": 1.578125, "learning_rate": 0.00044479348971248863, "loss": 6.0644, "mean_token_accuracy": 0.15168716311454772, "num_tokens": 47710477.0, "step": 22060 }, { "entropy": 6.475105714797974, "epoch": 2.3611750227406496, "grad_norm": 1.453125, "learning_rate": 0.0004447684007609301, "loss": 6.1046, "mean_token_accuracy": 0.1445338323712349, "num_tokens": 47720548.0, "step": 22065 }, { "entropy": 6.490202283859253, "epoch": 2.3617100968484133, "grad_norm": 1.234375, "learning_rate": 0.00044474330690733293, "loss": 6.0994, "mean_token_accuracy": 0.13948655053973197, "num_tokens": 47732135.0, "step": 22070 }, { "entropy": 6.475314044952393, "epoch": 2.3622451709561774, "grad_norm": 1.2890625, "learning_rate": 0.0004447182081524216, "loss": 6.1018, "mean_token_accuracy": 0.14495120644569398, "num_tokens": 47742934.0, "step": 22075 }, { "entropy": 6.464633131027222, "epoch": 2.3627802450639415, "grad_norm": 1.4140625, "learning_rate": 0.00044469310449692085, "loss": 6.1053, "mean_token_accuracy": 0.14303620159626007, "num_tokens": 47754586.0, "step": 22080 }, { "entropy": 6.516017961502075, "epoch": 2.363315319171705, "grad_norm": 1.3828125, "learning_rate": 0.00044466799594155556, "loss": 6.1103, "mean_token_accuracy": 0.14106715619564056, "num_tokens": 47765564.0, "step": 22085 }, { "entropy": 6.422468996047973, "epoch": 2.363850393279469, "grad_norm": 1.234375, "learning_rate": 0.00044464288248705075, "loss": 6.0754, "mean_token_accuracy": 0.14668594747781755, "num_tokens": 47776191.0, "step": 22090 }, { "entropy": 6.520417404174805, "epoch": 2.3643854673872333, "grad_norm": 1.1796875, "learning_rate": 0.00044461776413413153, "loss": 6.1997, "mean_token_accuracy": 0.1369754120707512, "num_tokens": 47787193.0, "step": 22095 }, { "entropy": 6.5552184104919435, "epoch": 2.364920541494997, "grad_norm": 1.4140625, "learning_rate": 0.0004445926408835232, "loss": 6.1552, "mean_token_accuracy": 0.1368870861828327, "num_tokens": 47798576.0, "step": 22100 }, { "entropy": 6.376204156875611, "epoch": 2.365455615602761, "grad_norm": 1.734375, "learning_rate": 0.0004445675127359511, "loss": 6.0147, "mean_token_accuracy": 0.15470883771777152, "num_tokens": 47809519.0, "step": 22105 }, { "entropy": 6.43874716758728, "epoch": 2.3659906897105247, "grad_norm": 1.15625, "learning_rate": 0.000444542379692141, "loss": 6.0799, "mean_token_accuracy": 0.14309703782200814, "num_tokens": 47820618.0, "step": 22110 }, { "entropy": 6.512845277786255, "epoch": 2.366525763818289, "grad_norm": 1.390625, "learning_rate": 0.0004445172417528186, "loss": 6.1709, "mean_token_accuracy": 0.14340648651123047, "num_tokens": 47831756.0, "step": 22115 }, { "entropy": 6.501999855041504, "epoch": 2.367060837926053, "grad_norm": 1.34375, "learning_rate": 0.00044449209891870954, "loss": 6.1097, "mean_token_accuracy": 0.14158237874507903, "num_tokens": 47841974.0, "step": 22120 }, { "entropy": 6.406654500961304, "epoch": 2.3675959120338166, "grad_norm": 1.296875, "learning_rate": 0.00044446695119053993, "loss": 6.043, "mean_token_accuracy": 0.14741935357451438, "num_tokens": 47852194.0, "step": 22125 }, { "entropy": 6.502700996398926, "epoch": 2.3681309861415807, "grad_norm": 1.390625, "learning_rate": 0.000444441798569036, "loss": 6.1969, "mean_token_accuracy": 0.13913919031620026, "num_tokens": 47863921.0, "step": 22130 }, { "entropy": 6.600926637649536, "epoch": 2.3686660602493443, "grad_norm": 1.1328125, "learning_rate": 0.00044441664105492393, "loss": 6.2935, "mean_token_accuracy": 0.134506893157959, "num_tokens": 47875520.0, "step": 22135 }, { "entropy": 6.531594085693359, "epoch": 2.3692011343571084, "grad_norm": 1.1953125, "learning_rate": 0.0004443914786489301, "loss": 6.047, "mean_token_accuracy": 0.14973307251930237, "num_tokens": 47886047.0, "step": 22140 }, { "entropy": 6.3686503887176515, "epoch": 2.3697362084648725, "grad_norm": 1.265625, "learning_rate": 0.00044436631135178113, "loss": 6.0022, "mean_token_accuracy": 0.1579115778207779, "num_tokens": 47896449.0, "step": 22145 }, { "entropy": 6.516362524032592, "epoch": 2.370271282572636, "grad_norm": 1.7890625, "learning_rate": 0.00044434113916420377, "loss": 6.1666, "mean_token_accuracy": 0.14160350561141968, "num_tokens": 47908613.0, "step": 22150 }, { "entropy": 6.55473747253418, "epoch": 2.3708063566804003, "grad_norm": 1.3828125, "learning_rate": 0.00044431596208692475, "loss": 6.2008, "mean_token_accuracy": 0.13570541143417358, "num_tokens": 47919474.0, "step": 22155 }, { "entropy": 6.4521135807037355, "epoch": 2.3713414307881644, "grad_norm": 1.40625, "learning_rate": 0.0004442907801206712, "loss": 6.0861, "mean_token_accuracy": 0.14394913166761397, "num_tokens": 47930929.0, "step": 22160 }, { "entropy": 6.437365913391114, "epoch": 2.371876504895928, "grad_norm": 1.2890625, "learning_rate": 0.00044426559326617013, "loss": 6.0503, "mean_token_accuracy": 0.15559595823287964, "num_tokens": 47942050.0, "step": 22165 }, { "entropy": 6.528932189941406, "epoch": 2.372411579003692, "grad_norm": 2.171875, "learning_rate": 0.0004442404015241488, "loss": 6.1952, "mean_token_accuracy": 0.14278719425201417, "num_tokens": 47953162.0, "step": 22170 }, { "entropy": 6.536012268066406, "epoch": 2.372946653111456, "grad_norm": 1.2421875, "learning_rate": 0.00044421520489533467, "loss": 6.1213, "mean_token_accuracy": 0.1446191668510437, "num_tokens": 47963140.0, "step": 22175 }, { "entropy": 6.445658540725708, "epoch": 2.37348172721922, "grad_norm": 1.5703125, "learning_rate": 0.00044419000338045527, "loss": 6.1728, "mean_token_accuracy": 0.14523965716362, "num_tokens": 47975622.0, "step": 22180 }, { "entropy": 6.5038165092468265, "epoch": 2.3740168013269836, "grad_norm": 1.171875, "learning_rate": 0.0004441647969802383, "loss": 6.1218, "mean_token_accuracy": 0.13845564275979996, "num_tokens": 47986450.0, "step": 22185 }, { "entropy": 6.540388774871826, "epoch": 2.3745518754347477, "grad_norm": 1.8515625, "learning_rate": 0.0004441395856954117, "loss": 6.1951, "mean_token_accuracy": 0.1351679116487503, "num_tokens": 47997441.0, "step": 22190 }, { "entropy": 6.459717512130737, "epoch": 2.3750869495425118, "grad_norm": 1.7265625, "learning_rate": 0.00044411436952670325, "loss": 6.0997, "mean_token_accuracy": 0.13807225227355957, "num_tokens": 48008995.0, "step": 22195 }, { "entropy": 6.522867441177368, "epoch": 2.3756220236502754, "grad_norm": 1.265625, "learning_rate": 0.00044408914847484103, "loss": 6.1119, "mean_token_accuracy": 0.14891570806503296, "num_tokens": 48019975.0, "step": 22200 }, { "entropy": 6.538968658447265, "epoch": 2.3761570977580395, "grad_norm": 1.2734375, "learning_rate": 0.0004440639225405536, "loss": 6.102, "mean_token_accuracy": 0.14091890752315522, "num_tokens": 48031278.0, "step": 22205 }, { "entropy": 6.399729013442993, "epoch": 2.3766921718658036, "grad_norm": 1.703125, "learning_rate": 0.000444038691724569, "loss": 6.0947, "mean_token_accuracy": 0.14269933402538298, "num_tokens": 48042050.0, "step": 22210 }, { "entropy": 6.337248373031616, "epoch": 2.3772272459735673, "grad_norm": 1.3046875, "learning_rate": 0.00044401345602761605, "loss": 5.9873, "mean_token_accuracy": 0.15868725776672363, "num_tokens": 48052833.0, "step": 22215 }, { "entropy": 6.39757809638977, "epoch": 2.3777623200813314, "grad_norm": 1.3515625, "learning_rate": 0.00044398821545042327, "loss": 6.0721, "mean_token_accuracy": 0.14557988718152046, "num_tokens": 48063425.0, "step": 22220 }, { "entropy": 6.440204334259033, "epoch": 2.378297394189095, "grad_norm": 1.3125, "learning_rate": 0.00044396296999371946, "loss": 6.0718, "mean_token_accuracy": 0.14883712083101272, "num_tokens": 48074941.0, "step": 22225 }, { "entropy": 6.4019585132598875, "epoch": 2.378832468296859, "grad_norm": 2.421875, "learning_rate": 0.00044393771965823376, "loss": 5.9255, "mean_token_accuracy": 0.1523391529917717, "num_tokens": 48085224.0, "step": 22230 }, { "entropy": 6.446329784393311, "epoch": 2.3793675424046232, "grad_norm": 2.609375, "learning_rate": 0.000443912464444695, "loss": 6.109, "mean_token_accuracy": 0.1432347536087036, "num_tokens": 48096509.0, "step": 22235 }, { "entropy": 6.423505973815918, "epoch": 2.379902616512387, "grad_norm": 1.2578125, "learning_rate": 0.0004438872043538327, "loss": 6.0792, "mean_token_accuracy": 0.14209741950035096, "num_tokens": 48106839.0, "step": 22240 }, { "entropy": 6.512378549575805, "epoch": 2.380437690620151, "grad_norm": 1.140625, "learning_rate": 0.000443861939386376, "loss": 6.1543, "mean_token_accuracy": 0.1461554616689682, "num_tokens": 48118209.0, "step": 22245 }, { "entropy": 6.45034556388855, "epoch": 2.3809727647279146, "grad_norm": 1.8515625, "learning_rate": 0.0004438366695430546, "loss": 6.1287, "mean_token_accuracy": 0.14676560685038567, "num_tokens": 48128651.0, "step": 22250 }, { "entropy": 6.477226495742798, "epoch": 2.3815078388356787, "grad_norm": 1.5234375, "learning_rate": 0.00044381139482459805, "loss": 6.1392, "mean_token_accuracy": 0.14449237436056137, "num_tokens": 48139612.0, "step": 22255 }, { "entropy": 6.503661060333252, "epoch": 2.382042912943443, "grad_norm": 1.3828125, "learning_rate": 0.00044378611523173615, "loss": 6.0652, "mean_token_accuracy": 0.15411824882030487, "num_tokens": 48150557.0, "step": 22260 }, { "entropy": 6.4357953548431395, "epoch": 2.3825779870512065, "grad_norm": 1.4765625, "learning_rate": 0.0004437608307651989, "loss": 6.0124, "mean_token_accuracy": 0.1511611297726631, "num_tokens": 48160784.0, "step": 22265 }, { "entropy": 6.403134393692016, "epoch": 2.3831130611589706, "grad_norm": 1.875, "learning_rate": 0.0004437355414257165, "loss": 6.1072, "mean_token_accuracy": 0.14343835189938545, "num_tokens": 48171075.0, "step": 22270 }, { "entropy": 6.475181961059571, "epoch": 2.3836481352667347, "grad_norm": 1.2734375, "learning_rate": 0.00044371024721401894, "loss": 6.1473, "mean_token_accuracy": 0.13750439882278442, "num_tokens": 48182713.0, "step": 22275 }, { "entropy": 6.499227380752563, "epoch": 2.3841832093744983, "grad_norm": 1.4375, "learning_rate": 0.0004436849481308367, "loss": 6.0628, "mean_token_accuracy": 0.15116696134209634, "num_tokens": 48194198.0, "step": 22280 }, { "entropy": 6.431978607177735, "epoch": 2.3847182834822624, "grad_norm": 1.5078125, "learning_rate": 0.00044365964417690035, "loss": 6.0245, "mean_token_accuracy": 0.1466377079486847, "num_tokens": 48205650.0, "step": 22285 }, { "entropy": 6.378844785690307, "epoch": 2.385253357590026, "grad_norm": 1.328125, "learning_rate": 0.0004436343353529404, "loss": 6.0531, "mean_token_accuracy": 0.14801887273788453, "num_tokens": 48216335.0, "step": 22290 }, { "entropy": 6.4176350116729735, "epoch": 2.38578843169779, "grad_norm": 1.3359375, "learning_rate": 0.00044360902165968774, "loss": 6.0909, "mean_token_accuracy": 0.14309422820806503, "num_tokens": 48227206.0, "step": 22295 }, { "entropy": 6.446830129623413, "epoch": 2.386323505805554, "grad_norm": 1.4375, "learning_rate": 0.0004435837030978733, "loss": 6.1048, "mean_token_accuracy": 0.14635014533996582, "num_tokens": 48237948.0, "step": 22300 }, { "entropy": 6.4844279289245605, "epoch": 2.386858579913318, "grad_norm": 1.71875, "learning_rate": 0.0004435583796682281, "loss": 6.0919, "mean_token_accuracy": 0.1542416825890541, "num_tokens": 48250086.0, "step": 22305 }, { "entropy": 6.506739091873169, "epoch": 2.387393654021082, "grad_norm": 1.3203125, "learning_rate": 0.0004435330513714834, "loss": 6.0987, "mean_token_accuracy": 0.14743863493204118, "num_tokens": 48261004.0, "step": 22310 }, { "entropy": 6.426657199859619, "epoch": 2.3879287281288457, "grad_norm": 1.2734375, "learning_rate": 0.0004435077182083705, "loss": 6.1134, "mean_token_accuracy": 0.14860199987888337, "num_tokens": 48271314.0, "step": 22315 }, { "entropy": 6.372504711151123, "epoch": 2.38846380223661, "grad_norm": 1.3828125, "learning_rate": 0.00044348238017962095, "loss": 6.0414, "mean_token_accuracy": 0.14628194123506547, "num_tokens": 48281899.0, "step": 22320 }, { "entropy": 6.41559100151062, "epoch": 2.388998876344374, "grad_norm": 1.5859375, "learning_rate": 0.0004434570372859663, "loss": 6.1192, "mean_token_accuracy": 0.14575926586985588, "num_tokens": 48292925.0, "step": 22325 }, { "entropy": 6.5548206806182865, "epoch": 2.3895339504521376, "grad_norm": 1.2734375, "learning_rate": 0.0004434316895281384, "loss": 6.1432, "mean_token_accuracy": 0.14652915820479392, "num_tokens": 48303138.0, "step": 22330 }, { "entropy": 6.401421737670899, "epoch": 2.3900690245599017, "grad_norm": 1.265625, "learning_rate": 0.0004434063369068691, "loss": 5.9991, "mean_token_accuracy": 0.1548761323094368, "num_tokens": 48313586.0, "step": 22335 }, { "entropy": 6.36795334815979, "epoch": 2.3906040986676653, "grad_norm": 1.4609375, "learning_rate": 0.00044338097942289045, "loss": 6.0416, "mean_token_accuracy": 0.1530877858400345, "num_tokens": 48324756.0, "step": 22340 }, { "entropy": 6.460367870330811, "epoch": 2.3911391727754294, "grad_norm": 1.640625, "learning_rate": 0.0004433556170769348, "loss": 6.1284, "mean_token_accuracy": 0.13945283815264703, "num_tokens": 48336012.0, "step": 22345 }, { "entropy": 6.510640048980713, "epoch": 2.391674246883193, "grad_norm": 1.2890625, "learning_rate": 0.0004433302498697343, "loss": 6.2045, "mean_token_accuracy": 0.1377773813903332, "num_tokens": 48348923.0, "step": 22350 }, { "entropy": 6.460583829879761, "epoch": 2.392209320990957, "grad_norm": 1.296875, "learning_rate": 0.00044330487780202144, "loss": 6.0267, "mean_token_accuracy": 0.16482816487550736, "num_tokens": 48359708.0, "step": 22355 }, { "entropy": 6.432282495498657, "epoch": 2.3927443950987213, "grad_norm": 1.46875, "learning_rate": 0.00044327950087452895, "loss": 6.0895, "mean_token_accuracy": 0.1476660691201687, "num_tokens": 48370497.0, "step": 22360 }, { "entropy": 6.411420297622681, "epoch": 2.393279469206485, "grad_norm": 1.3359375, "learning_rate": 0.0004432541190879895, "loss": 6.1063, "mean_token_accuracy": 0.14257829636335373, "num_tokens": 48381020.0, "step": 22365 }, { "entropy": 6.464663314819336, "epoch": 2.393814543314249, "grad_norm": 1.3046875, "learning_rate": 0.00044322873244313603, "loss": 6.0616, "mean_token_accuracy": 0.14460955560207367, "num_tokens": 48391696.0, "step": 22370 }, { "entropy": 6.423829746246338, "epoch": 2.394349617422013, "grad_norm": 1.8046875, "learning_rate": 0.00044320334094070154, "loss": 6.079, "mean_token_accuracy": 0.1458517111837864, "num_tokens": 48402403.0, "step": 22375 }, { "entropy": 6.4090986251831055, "epoch": 2.394884691529777, "grad_norm": 1.3046875, "learning_rate": 0.0004431779445814192, "loss": 6.1186, "mean_token_accuracy": 0.15605130344629287, "num_tokens": 48413579.0, "step": 22380 }, { "entropy": 6.525593090057373, "epoch": 2.395419765637541, "grad_norm": 1.421875, "learning_rate": 0.00044315254336602236, "loss": 6.1482, "mean_token_accuracy": 0.14264504760503768, "num_tokens": 48423814.0, "step": 22385 }, { "entropy": 6.512730932235717, "epoch": 2.3959548397453045, "grad_norm": 1.6015625, "learning_rate": 0.00044312713729524443, "loss": 6.2252, "mean_token_accuracy": 0.14166969284415246, "num_tokens": 48433937.0, "step": 22390 }, { "entropy": 6.485862922668457, "epoch": 2.3964899138530686, "grad_norm": 1.625, "learning_rate": 0.00044310172636981905, "loss": 6.083, "mean_token_accuracy": 0.14675567895174027, "num_tokens": 48444397.0, "step": 22395 }, { "entropy": 6.440472602844238, "epoch": 2.3970249879608327, "grad_norm": 1.2265625, "learning_rate": 0.0004430763105904799, "loss": 5.9751, "mean_token_accuracy": 0.1553073525428772, "num_tokens": 48454566.0, "step": 22400 }, { "entropy": 6.387523937225342, "epoch": 2.3975600620685964, "grad_norm": 1.296875, "learning_rate": 0.000443050889957961, "loss": 6.0137, "mean_token_accuracy": 0.15581767559051513, "num_tokens": 48465129.0, "step": 22405 }, { "entropy": 6.420242977142334, "epoch": 2.3980951361763605, "grad_norm": 1.390625, "learning_rate": 0.00044302546447299625, "loss": 6.038, "mean_token_accuracy": 0.1484654039144516, "num_tokens": 48475793.0, "step": 22410 }, { "entropy": 6.4296462059021, "epoch": 2.398630210284124, "grad_norm": 1.3359375, "learning_rate": 0.0004430000341363198, "loss": 5.972, "mean_token_accuracy": 0.1621704176068306, "num_tokens": 48486543.0, "step": 22415 }, { "entropy": 6.501266527175903, "epoch": 2.3991652843918883, "grad_norm": 1.203125, "learning_rate": 0.0004429745989486659, "loss": 6.153, "mean_token_accuracy": 0.14941118508577347, "num_tokens": 48498426.0, "step": 22420 }, { "entropy": 6.448358678817749, "epoch": 2.3997003584996524, "grad_norm": 1.53125, "learning_rate": 0.0004429491589107691, "loss": 6.031, "mean_token_accuracy": 0.15213921815156936, "num_tokens": 48508763.0, "step": 22425 }, { "entropy": 6.467694616317749, "epoch": 2.400235432607416, "grad_norm": 1.3671875, "learning_rate": 0.0004429237140233639, "loss": 6.1481, "mean_token_accuracy": 0.14018561094999313, "num_tokens": 48519112.0, "step": 22430 }, { "entropy": 6.507307338714599, "epoch": 2.40077050671518, "grad_norm": 1.2890625, "learning_rate": 0.0004428982642871852, "loss": 6.0948, "mean_token_accuracy": 0.1463563159108162, "num_tokens": 48530341.0, "step": 22435 }, { "entropy": 6.39431791305542, "epoch": 2.401305580822944, "grad_norm": 1.265625, "learning_rate": 0.0004428728097029676, "loss": 6.0186, "mean_token_accuracy": 0.15091662108898163, "num_tokens": 48541962.0, "step": 22440 }, { "entropy": 6.493698930740356, "epoch": 2.401840654930708, "grad_norm": 2.4375, "learning_rate": 0.00044284735027144624, "loss": 6.189, "mean_token_accuracy": 0.1351309634745121, "num_tokens": 48554206.0, "step": 22445 }, { "entropy": 6.404330825805664, "epoch": 2.402375729038472, "grad_norm": 1.6171875, "learning_rate": 0.0004428218859933562, "loss": 6.0494, "mean_token_accuracy": 0.14448442980647086, "num_tokens": 48563919.0, "step": 22450 }, { "entropy": 6.418425273895264, "epoch": 2.4029108031462356, "grad_norm": 1.4296875, "learning_rate": 0.00044279641686943277, "loss": 6.1431, "mean_token_accuracy": 0.1504869654774666, "num_tokens": 48575388.0, "step": 22455 }, { "entropy": 6.531083965301514, "epoch": 2.4034458772539997, "grad_norm": 1.390625, "learning_rate": 0.00044277094290041144, "loss": 6.1076, "mean_token_accuracy": 0.1469431161880493, "num_tokens": 48587492.0, "step": 22460 }, { "entropy": 6.383284330368042, "epoch": 2.4039809513617634, "grad_norm": 1.3671875, "learning_rate": 0.00044274546408702763, "loss": 5.938, "mean_token_accuracy": 0.16313221529126168, "num_tokens": 48598757.0, "step": 22465 }, { "entropy": 6.471029472351074, "epoch": 2.4045160254695275, "grad_norm": 1.640625, "learning_rate": 0.00044271998043001723, "loss": 6.0924, "mean_token_accuracy": 0.1484705038368702, "num_tokens": 48609912.0, "step": 22470 }, { "entropy": 6.4948567867279055, "epoch": 2.4050510995772916, "grad_norm": 1.4296875, "learning_rate": 0.0004426944919301158, "loss": 6.2193, "mean_token_accuracy": 0.13821542486548424, "num_tokens": 48621614.0, "step": 22475 }, { "entropy": 6.445605039596558, "epoch": 2.4055861736850552, "grad_norm": 1.3203125, "learning_rate": 0.00044266899858805964, "loss": 6.0922, "mean_token_accuracy": 0.1508389189839363, "num_tokens": 48632539.0, "step": 22480 }, { "entropy": 6.57605390548706, "epoch": 2.4061212477928193, "grad_norm": 1.2890625, "learning_rate": 0.00044264350040458463, "loss": 6.2041, "mean_token_accuracy": 0.14077507331967354, "num_tokens": 48644157.0, "step": 22485 }, { "entropy": 6.52549180984497, "epoch": 2.4066563219005834, "grad_norm": 2.875, "learning_rate": 0.00044261799738042713, "loss": 6.1872, "mean_token_accuracy": 0.146114069968462, "num_tokens": 48654928.0, "step": 22490 }, { "entropy": 6.498835039138794, "epoch": 2.407191396008347, "grad_norm": 1.2421875, "learning_rate": 0.0004425924895163235, "loss": 6.1033, "mean_token_accuracy": 0.15451390743255616, "num_tokens": 48665183.0, "step": 22495 }, { "entropy": 6.45039701461792, "epoch": 2.407726470116111, "grad_norm": 1.25, "learning_rate": 0.00044256697681301034, "loss": 6.0378, "mean_token_accuracy": 0.1531726285815239, "num_tokens": 48675233.0, "step": 22500 }, { "entropy": 6.467570495605469, "epoch": 2.408261544223875, "grad_norm": 1.1640625, "learning_rate": 0.0004425414592712242, "loss": 6.1008, "mean_token_accuracy": 0.14776048362255095, "num_tokens": 48685881.0, "step": 22505 }, { "entropy": 6.476493644714355, "epoch": 2.408796618331639, "grad_norm": 1.1796875, "learning_rate": 0.00044251593689170196, "loss": 6.1672, "mean_token_accuracy": 0.13813733235001563, "num_tokens": 48696402.0, "step": 22510 }, { "entropy": 6.492434930801392, "epoch": 2.409331692439403, "grad_norm": 1.546875, "learning_rate": 0.00044249040967518063, "loss": 6.1586, "mean_token_accuracy": 0.14482902586460114, "num_tokens": 48708041.0, "step": 22515 }, { "entropy": 6.511981630325318, "epoch": 2.4098667665471667, "grad_norm": 1.3125, "learning_rate": 0.00044246487762239717, "loss": 6.0598, "mean_token_accuracy": 0.14756403118371964, "num_tokens": 48718836.0, "step": 22520 }, { "entropy": 6.456007957458496, "epoch": 2.410401840654931, "grad_norm": 1.4453125, "learning_rate": 0.000442439340734089, "loss": 6.0968, "mean_token_accuracy": 0.14885153025388717, "num_tokens": 48729115.0, "step": 22525 }, { "entropy": 6.4136334419250485, "epoch": 2.4109369147626944, "grad_norm": 1.28125, "learning_rate": 0.00044241379901099334, "loss": 6.0653, "mean_token_accuracy": 0.1515069618821144, "num_tokens": 48740037.0, "step": 22530 }, { "entropy": 6.437617921829224, "epoch": 2.4114719888704585, "grad_norm": 1.375, "learning_rate": 0.00044238825245384775, "loss": 6.1073, "mean_token_accuracy": 0.1455809637904167, "num_tokens": 48750894.0, "step": 22535 }, { "entropy": 6.481311511993408, "epoch": 2.4120070629782226, "grad_norm": 1.1640625, "learning_rate": 0.0004423627010633899, "loss": 6.0347, "mean_token_accuracy": 0.1552007332444191, "num_tokens": 48761566.0, "step": 22540 }, { "entropy": 6.306411981582642, "epoch": 2.4125421370859863, "grad_norm": 1.5, "learning_rate": 0.00044233714484035765, "loss": 5.9936, "mean_token_accuracy": 0.15204857736825944, "num_tokens": 48772971.0, "step": 22545 }, { "entropy": 6.364185476303101, "epoch": 2.4130772111937504, "grad_norm": 1.078125, "learning_rate": 0.00044231158378548873, "loss": 6.0876, "mean_token_accuracy": 0.14920533671975136, "num_tokens": 48784548.0, "step": 22550 }, { "entropy": 6.321473407745361, "epoch": 2.4136122853015145, "grad_norm": 1.2265625, "learning_rate": 0.0004422860178995215, "loss": 5.9247, "mean_token_accuracy": 0.15894851684570313, "num_tokens": 48795228.0, "step": 22555 }, { "entropy": 6.471438884735107, "epoch": 2.414147359409278, "grad_norm": 1.2890625, "learning_rate": 0.00044226044718319383, "loss": 6.038, "mean_token_accuracy": 0.14554901495575906, "num_tokens": 48806497.0, "step": 22560 }, { "entropy": 6.473359823226929, "epoch": 2.4146824335170423, "grad_norm": 1.25, "learning_rate": 0.0004422348716372444, "loss": 6.0903, "mean_token_accuracy": 0.14836304187774657, "num_tokens": 48816402.0, "step": 22565 }, { "entropy": 6.509381818771362, "epoch": 2.415217507624806, "grad_norm": 1.234375, "learning_rate": 0.0004422092912624115, "loss": 6.0256, "mean_token_accuracy": 0.14918296039104462, "num_tokens": 48826151.0, "step": 22570 }, { "entropy": 6.412098503112793, "epoch": 2.41575258173257, "grad_norm": 1.3203125, "learning_rate": 0.00044218370605943376, "loss": 6.1332, "mean_token_accuracy": 0.1476098269224167, "num_tokens": 48836458.0, "step": 22575 }, { "entropy": 6.420450353622437, "epoch": 2.4162876558403337, "grad_norm": 1.2890625, "learning_rate": 0.00044215811602905003, "loss": 6.1031, "mean_token_accuracy": 0.14455177783966064, "num_tokens": 48845863.0, "step": 22580 }, { "entropy": 6.479944658279419, "epoch": 2.4168227299480978, "grad_norm": 1.1875, "learning_rate": 0.00044213252117199914, "loss": 6.1113, "mean_token_accuracy": 0.14214532673358918, "num_tokens": 48856453.0, "step": 22585 }, { "entropy": 6.492744493484497, "epoch": 2.417357804055862, "grad_norm": 1.1484375, "learning_rate": 0.00044210692148902034, "loss": 6.0395, "mean_token_accuracy": 0.14207544103264808, "num_tokens": 48867013.0, "step": 22590 }, { "entropy": 6.453858852386475, "epoch": 2.4178928781636255, "grad_norm": 1.1796875, "learning_rate": 0.0004420813169808525, "loss": 6.0759, "mean_token_accuracy": 0.14191123098134995, "num_tokens": 48876455.0, "step": 22595 }, { "entropy": 6.422561597824097, "epoch": 2.4184279522713896, "grad_norm": 1.578125, "learning_rate": 0.0004420557076482352, "loss": 6.1413, "mean_token_accuracy": 0.14265096932649612, "num_tokens": 48888223.0, "step": 22600 }, { "entropy": 6.4624885559082035, "epoch": 2.4189630263791537, "grad_norm": 1.328125, "learning_rate": 0.00044203009349190784, "loss": 6.1068, "mean_token_accuracy": 0.14904020428657533, "num_tokens": 48899287.0, "step": 22605 }, { "entropy": 6.471385812759399, "epoch": 2.4194981004869174, "grad_norm": 1.2578125, "learning_rate": 0.0004420044745126099, "loss": 6.1289, "mean_token_accuracy": 0.1431280069053173, "num_tokens": 48910740.0, "step": 22610 }, { "entropy": 6.415463924407959, "epoch": 2.4200331745946815, "grad_norm": 1.21875, "learning_rate": 0.00044197885071108127, "loss": 5.9592, "mean_token_accuracy": 0.14546657726168633, "num_tokens": 48921925.0, "step": 22615 }, { "entropy": 6.477572059631347, "epoch": 2.420568248702445, "grad_norm": 1.921875, "learning_rate": 0.0004419532220880619, "loss": 6.2234, "mean_token_accuracy": 0.13765173256397248, "num_tokens": 48933164.0, "step": 22620 }, { "entropy": 6.4573770523071286, "epoch": 2.4211033228102092, "grad_norm": 1.2734375, "learning_rate": 0.00044192758864429157, "loss": 6.1553, "mean_token_accuracy": 0.14260666817426682, "num_tokens": 48943285.0, "step": 22625 }, { "entropy": 6.4639030456542965, "epoch": 2.421638396917973, "grad_norm": 1.2109375, "learning_rate": 0.0004419019503805106, "loss": 6.0791, "mean_token_accuracy": 0.13802081048488618, "num_tokens": 48952852.0, "step": 22630 }, { "entropy": 6.475673580169678, "epoch": 2.422173471025737, "grad_norm": 1.34375, "learning_rate": 0.00044187630729745924, "loss": 6.2021, "mean_token_accuracy": 0.1392153263092041, "num_tokens": 48964339.0, "step": 22635 }, { "entropy": 6.548929643630982, "epoch": 2.422708545133501, "grad_norm": 1.578125, "learning_rate": 0.00044185065939587805, "loss": 6.0928, "mean_token_accuracy": 0.14192020371556283, "num_tokens": 48974754.0, "step": 22640 }, { "entropy": 6.529342985153198, "epoch": 2.4232436192412647, "grad_norm": 1.34375, "learning_rate": 0.00044182500667650746, "loss": 6.1153, "mean_token_accuracy": 0.15106630325317383, "num_tokens": 48985596.0, "step": 22645 }, { "entropy": 6.482286691665649, "epoch": 2.423778693349029, "grad_norm": 1.203125, "learning_rate": 0.0004417993491400882, "loss": 6.1493, "mean_token_accuracy": 0.14724427387118338, "num_tokens": 48997400.0, "step": 22650 }, { "entropy": 6.464413404464722, "epoch": 2.424313767456793, "grad_norm": 1.3125, "learning_rate": 0.00044177368678736126, "loss": 6.0676, "mean_token_accuracy": 0.14810301959514618, "num_tokens": 49007525.0, "step": 22655 }, { "entropy": 6.40142855644226, "epoch": 2.4248488415645566, "grad_norm": 1.2578125, "learning_rate": 0.00044174801961906744, "loss": 6.0985, "mean_token_accuracy": 0.146372439712286, "num_tokens": 49018205.0, "step": 22660 }, { "entropy": 6.501100969314575, "epoch": 2.4253839156723207, "grad_norm": 1.2890625, "learning_rate": 0.00044172234763594805, "loss": 6.1516, "mean_token_accuracy": 0.13930772989988327, "num_tokens": 49028760.0, "step": 22665 }, { "entropy": 6.497635555267334, "epoch": 2.4259189897800844, "grad_norm": 1.2578125, "learning_rate": 0.0004416966708387443, "loss": 6.0781, "mean_token_accuracy": 0.14591245353221893, "num_tokens": 49040734.0, "step": 22670 }, { "entropy": 6.443426513671875, "epoch": 2.4264540638878485, "grad_norm": 1.2421875, "learning_rate": 0.00044167098922819764, "loss": 6.0777, "mean_token_accuracy": 0.1393363393843174, "num_tokens": 49051474.0, "step": 22675 }, { "entropy": 6.413713979721069, "epoch": 2.4269891379956126, "grad_norm": 1.2578125, "learning_rate": 0.00044164530280504954, "loss": 6.0633, "mean_token_accuracy": 0.15655675828456878, "num_tokens": 49061697.0, "step": 22680 }, { "entropy": 6.4234696388244625, "epoch": 2.427524212103376, "grad_norm": 2.40625, "learning_rate": 0.00044161961157004176, "loss": 6.0956, "mean_token_accuracy": 0.15082429945468903, "num_tokens": 49072124.0, "step": 22685 }, { "entropy": 6.489072465896607, "epoch": 2.4280592862111403, "grad_norm": 1.390625, "learning_rate": 0.000441593915523916, "loss": 6.0859, "mean_token_accuracy": 0.14353536069393158, "num_tokens": 49082653.0, "step": 22690 }, { "entropy": 6.54815263748169, "epoch": 2.428594360318904, "grad_norm": 1.1796875, "learning_rate": 0.00044156821466741447, "loss": 6.1918, "mean_token_accuracy": 0.1378464676439762, "num_tokens": 49092481.0, "step": 22695 }, { "entropy": 6.503483247756958, "epoch": 2.429129434426668, "grad_norm": 1.1875, "learning_rate": 0.0004415425090012792, "loss": 6.1721, "mean_token_accuracy": 0.13664378374814987, "num_tokens": 49103189.0, "step": 22700 }, { "entropy": 6.508397340774536, "epoch": 2.429664508534432, "grad_norm": 1.125, "learning_rate": 0.00044151679852625226, "loss": 6.1281, "mean_token_accuracy": 0.14309491217136383, "num_tokens": 49114071.0, "step": 22705 }, { "entropy": 6.520497989654541, "epoch": 2.430199582642196, "grad_norm": 1.2421875, "learning_rate": 0.0004414910832430762, "loss": 6.0855, "mean_token_accuracy": 0.14919390380382538, "num_tokens": 49125521.0, "step": 22710 }, { "entropy": 6.4971236228942875, "epoch": 2.43073465674996, "grad_norm": 1.34375, "learning_rate": 0.0004414653631524935, "loss": 6.0561, "mean_token_accuracy": 0.14214812368154525, "num_tokens": 49136162.0, "step": 22715 }, { "entropy": 6.510256052017212, "epoch": 2.431269730857724, "grad_norm": 1.2890625, "learning_rate": 0.0004414396382552468, "loss": 6.0938, "mean_token_accuracy": 0.1436297044157982, "num_tokens": 49146127.0, "step": 22720 }, { "entropy": 6.46959342956543, "epoch": 2.4318048049654877, "grad_norm": 1.234375, "learning_rate": 0.00044141390855207904, "loss": 6.0393, "mean_token_accuracy": 0.15364223942160607, "num_tokens": 49156619.0, "step": 22725 }, { "entropy": 6.415626573562622, "epoch": 2.4323398790732518, "grad_norm": 1.40625, "learning_rate": 0.00044138817404373295, "loss": 6.2045, "mean_token_accuracy": 0.13829587697982787, "num_tokens": 49168578.0, "step": 22730 }, { "entropy": 6.500268459320068, "epoch": 2.4328749531810154, "grad_norm": 1.3515625, "learning_rate": 0.0004413624347309517, "loss": 6.1626, "mean_token_accuracy": 0.14751689434051513, "num_tokens": 49178845.0, "step": 22735 }, { "entropy": 6.527559614181518, "epoch": 2.4334100272887795, "grad_norm": 1.2734375, "learning_rate": 0.00044133669061447855, "loss": 6.1337, "mean_token_accuracy": 0.14516956731677055, "num_tokens": 49189067.0, "step": 22740 }, { "entropy": 6.511234521865845, "epoch": 2.433945101396543, "grad_norm": 1.1484375, "learning_rate": 0.00044131094169505694, "loss": 6.1373, "mean_token_accuracy": 0.13915981277823447, "num_tokens": 49200368.0, "step": 22745 }, { "entropy": 6.445730495452881, "epoch": 2.4344801755043073, "grad_norm": 1.3125, "learning_rate": 0.00044128518797343014, "loss": 6.0812, "mean_token_accuracy": 0.146923066675663, "num_tokens": 49211630.0, "step": 22750 }, { "entropy": 6.510638475418091, "epoch": 2.4350152496120714, "grad_norm": 1.734375, "learning_rate": 0.000441259429450342, "loss": 6.155, "mean_token_accuracy": 0.14221021831035613, "num_tokens": 49223092.0, "step": 22755 }, { "entropy": 6.516750764846802, "epoch": 2.435550323719835, "grad_norm": 1.4375, "learning_rate": 0.00044123366612653617, "loss": 6.1043, "mean_token_accuracy": 0.14769039750099183, "num_tokens": 49233963.0, "step": 22760 }, { "entropy": 6.510983324050903, "epoch": 2.436085397827599, "grad_norm": 1.1484375, "learning_rate": 0.0004412078980027565, "loss": 6.1335, "mean_token_accuracy": 0.14667008966207504, "num_tokens": 49243834.0, "step": 22765 }, { "entropy": 6.3816369533538815, "epoch": 2.4366204719353632, "grad_norm": 1.2578125, "learning_rate": 0.0004411821250797472, "loss": 5.957, "mean_token_accuracy": 0.15285905301570893, "num_tokens": 49254274.0, "step": 22770 }, { "entropy": 6.4198259830474855, "epoch": 2.437155546043127, "grad_norm": 1.3671875, "learning_rate": 0.0004411563473582524, "loss": 6.0114, "mean_token_accuracy": 0.15313953161239624, "num_tokens": 49264734.0, "step": 22775 }, { "entropy": 6.45964789390564, "epoch": 2.437690620150891, "grad_norm": 1.34375, "learning_rate": 0.0004411305648390163, "loss": 6.0657, "mean_token_accuracy": 0.14700526148080825, "num_tokens": 49274708.0, "step": 22780 }, { "entropy": 6.428467702865601, "epoch": 2.4382256942586547, "grad_norm": 1.1171875, "learning_rate": 0.0004411047775227836, "loss": 6.095, "mean_token_accuracy": 0.14973544627428054, "num_tokens": 49286318.0, "step": 22785 }, { "entropy": 6.561038875579834, "epoch": 2.4387607683664188, "grad_norm": 1.25, "learning_rate": 0.00044107898541029885, "loss": 6.1423, "mean_token_accuracy": 0.14294078052043915, "num_tokens": 49296948.0, "step": 22790 }, { "entropy": 6.394412851333618, "epoch": 2.439295842474183, "grad_norm": 1.203125, "learning_rate": 0.0004410531885023066, "loss": 6.0065, "mean_token_accuracy": 0.1525759816169739, "num_tokens": 49307060.0, "step": 22795 }, { "entropy": 6.4518519878387455, "epoch": 2.4398309165819465, "grad_norm": 1.40625, "learning_rate": 0.00044102738679955195, "loss": 6.1154, "mean_token_accuracy": 0.1396223224699497, "num_tokens": 49318449.0, "step": 22800 }, { "entropy": 6.4768232822418215, "epoch": 2.4403659906897106, "grad_norm": 1.3359375, "learning_rate": 0.0004410015803027798, "loss": 6.1246, "mean_token_accuracy": 0.1476379208266735, "num_tokens": 49329567.0, "step": 22805 }, { "entropy": 6.531068229675293, "epoch": 2.4409010647974743, "grad_norm": 1.53125, "learning_rate": 0.00044097576901273535, "loss": 6.1324, "mean_token_accuracy": 0.1490224227309227, "num_tokens": 49340854.0, "step": 22810 }, { "entropy": 6.511512708663941, "epoch": 2.4414361389052384, "grad_norm": 1.3125, "learning_rate": 0.0004409499529301639, "loss": 6.1751, "mean_token_accuracy": 0.1371899165213108, "num_tokens": 49352749.0, "step": 22815 }, { "entropy": 6.520124387741089, "epoch": 2.4419712130130025, "grad_norm": 1.0703125, "learning_rate": 0.0004409241320558109, "loss": 6.1539, "mean_token_accuracy": 0.13934962078928947, "num_tokens": 49364703.0, "step": 22820 }, { "entropy": 6.421018981933594, "epoch": 2.442506287120766, "grad_norm": 1.3203125, "learning_rate": 0.00044089830639042183, "loss": 6.0204, "mean_token_accuracy": 0.14887553080916405, "num_tokens": 49375873.0, "step": 22825 }, { "entropy": 6.493728590011597, "epoch": 2.44304136122853, "grad_norm": 1.21875, "learning_rate": 0.00044087247593474255, "loss": 6.1574, "mean_token_accuracy": 0.14297319129109382, "num_tokens": 49386578.0, "step": 22830 }, { "entropy": 6.490143918991089, "epoch": 2.4435764353362943, "grad_norm": 1.234375, "learning_rate": 0.0004408466406895188, "loss": 6.1052, "mean_token_accuracy": 0.14254355281591416, "num_tokens": 49398394.0, "step": 22835 }, { "entropy": 6.415010547637939, "epoch": 2.444111509444058, "grad_norm": 1.328125, "learning_rate": 0.0004408208006554966, "loss": 6.0455, "mean_token_accuracy": 0.16062988042831422, "num_tokens": 49408758.0, "step": 22840 }, { "entropy": 6.434513521194458, "epoch": 2.444646583551822, "grad_norm": 1.1875, "learning_rate": 0.0004407949558334221, "loss": 6.0638, "mean_token_accuracy": 0.14622282311320306, "num_tokens": 49420447.0, "step": 22845 }, { "entropy": 6.488108825683594, "epoch": 2.4451816576595857, "grad_norm": 3.625, "learning_rate": 0.00044076910622404153, "loss": 6.1242, "mean_token_accuracy": 0.14922792315483094, "num_tokens": 49430246.0, "step": 22850 }, { "entropy": 6.4994512557983395, "epoch": 2.44571673176735, "grad_norm": 1.765625, "learning_rate": 0.00044074325182810135, "loss": 6.0817, "mean_token_accuracy": 0.14986441880464554, "num_tokens": 49441272.0, "step": 22855 }, { "entropy": 6.449289035797119, "epoch": 2.4462518058751135, "grad_norm": 1.328125, "learning_rate": 0.00044071739264634803, "loss": 6.1198, "mean_token_accuracy": 0.1379289485514164, "num_tokens": 49452778.0, "step": 22860 }, { "entropy": 6.479628276824951, "epoch": 2.4467868799828776, "grad_norm": 1.25, "learning_rate": 0.0004406915286795283, "loss": 6.0987, "mean_token_accuracy": 0.14443983361124993, "num_tokens": 49463594.0, "step": 22865 }, { "entropy": 6.479138946533203, "epoch": 2.4473219540906417, "grad_norm": 1.0859375, "learning_rate": 0.0004406656599283889, "loss": 6.1224, "mean_token_accuracy": 0.14434010833501815, "num_tokens": 49473649.0, "step": 22870 }, { "entropy": 6.4379212856292725, "epoch": 2.4478570281984053, "grad_norm": 1.203125, "learning_rate": 0.0004406397863936769, "loss": 6.0499, "mean_token_accuracy": 0.15006129294633866, "num_tokens": 49485112.0, "step": 22875 }, { "entropy": 6.478448152542114, "epoch": 2.4483921023061694, "grad_norm": 1.328125, "learning_rate": 0.0004406139080761394, "loss": 6.1658, "mean_token_accuracy": 0.14289058968424798, "num_tokens": 49495455.0, "step": 22880 }, { "entropy": 6.483002424240112, "epoch": 2.4489271764139335, "grad_norm": 1.265625, "learning_rate": 0.0004405880249765235, "loss": 6.0915, "mean_token_accuracy": 0.1443782240152359, "num_tokens": 49506495.0, "step": 22885 }, { "entropy": 6.48294768333435, "epoch": 2.449462250521697, "grad_norm": 1.15625, "learning_rate": 0.00044056213709557667, "loss": 6.1201, "mean_token_accuracy": 0.14086200296878815, "num_tokens": 49516384.0, "step": 22890 }, { "entropy": 6.451174259185791, "epoch": 2.4499973246294613, "grad_norm": 1.4140625, "learning_rate": 0.00044053624443404646, "loss": 6.0919, "mean_token_accuracy": 0.15161909013986588, "num_tokens": 49527972.0, "step": 22895 }, { "entropy": 6.448730897903443, "epoch": 2.450532398737225, "grad_norm": 1.390625, "learning_rate": 0.0004405103469926803, "loss": 6.0456, "mean_token_accuracy": 0.14860376343131065, "num_tokens": 49540643.0, "step": 22900 }, { "entropy": 6.39932770729065, "epoch": 2.451067472844989, "grad_norm": 1.1875, "learning_rate": 0.00044048444477222626, "loss": 6.0153, "mean_token_accuracy": 0.1538733258843422, "num_tokens": 49550968.0, "step": 22905 }, { "entropy": 6.416860103607178, "epoch": 2.451602546952753, "grad_norm": 1.453125, "learning_rate": 0.0004404585377734321, "loss": 6.0506, "mean_token_accuracy": 0.14601152762770653, "num_tokens": 49562381.0, "step": 22910 }, { "entropy": 6.406810569763183, "epoch": 2.452137621060517, "grad_norm": 1.2890625, "learning_rate": 0.0004404326259970459, "loss": 6.1291, "mean_token_accuracy": 0.1447313718497753, "num_tokens": 49573414.0, "step": 22915 }, { "entropy": 6.488003444671631, "epoch": 2.452672695168281, "grad_norm": 1.2890625, "learning_rate": 0.0004404067094438159, "loss": 6.1581, "mean_token_accuracy": 0.1477361500263214, "num_tokens": 49583772.0, "step": 22920 }, { "entropy": 6.478089761734009, "epoch": 2.4532077692760446, "grad_norm": 1.2578125, "learning_rate": 0.0004403807881144903, "loss": 6.1583, "mean_token_accuracy": 0.13924882858991622, "num_tokens": 49594751.0, "step": 22925 }, { "entropy": 6.426532173156739, "epoch": 2.4537428433838087, "grad_norm": 1.2265625, "learning_rate": 0.00044035486200981786, "loss": 6.049, "mean_token_accuracy": 0.14557305574417115, "num_tokens": 49605048.0, "step": 22930 }, { "entropy": 6.513061380386352, "epoch": 2.4542779174915728, "grad_norm": 1.328125, "learning_rate": 0.00044032893113054683, "loss": 6.1763, "mean_token_accuracy": 0.14277911186218262, "num_tokens": 49616582.0, "step": 22935 }, { "entropy": 6.532836675643921, "epoch": 2.4548129915993364, "grad_norm": 1.3984375, "learning_rate": 0.0004403029954774263, "loss": 6.1013, "mean_token_accuracy": 0.14294343516230584, "num_tokens": 49626974.0, "step": 22940 }, { "entropy": 6.45196304321289, "epoch": 2.4553480657071005, "grad_norm": 1.265625, "learning_rate": 0.0004402770550512049, "loss": 6.0745, "mean_token_accuracy": 0.14586984887719154, "num_tokens": 49637580.0, "step": 22945 }, { "entropy": 6.513627624511718, "epoch": 2.455883139814864, "grad_norm": 1.2265625, "learning_rate": 0.0004402511098526318, "loss": 6.1349, "mean_token_accuracy": 0.1434204913675785, "num_tokens": 49648543.0, "step": 22950 }, { "entropy": 6.502149057388306, "epoch": 2.4564182139226283, "grad_norm": 1.2265625, "learning_rate": 0.0004402251598824561, "loss": 6.1328, "mean_token_accuracy": 0.14280304610729216, "num_tokens": 49659057.0, "step": 22955 }, { "entropy": 6.410835123062133, "epoch": 2.4569532880303924, "grad_norm": 1.2890625, "learning_rate": 0.0004401992051414272, "loss": 6.0753, "mean_token_accuracy": 0.14516770616173744, "num_tokens": 49671226.0, "step": 22960 }, { "entropy": 6.475321960449219, "epoch": 2.457488362138156, "grad_norm": 1.3515625, "learning_rate": 0.00044017324563029435, "loss": 6.0858, "mean_token_accuracy": 0.14667897745966912, "num_tokens": 49682063.0, "step": 22965 }, { "entropy": 6.423736429214477, "epoch": 2.45802343624592, "grad_norm": 1.171875, "learning_rate": 0.0004401472813498074, "loss": 6.0617, "mean_token_accuracy": 0.14960189312696456, "num_tokens": 49693768.0, "step": 22970 }, { "entropy": 6.466357040405273, "epoch": 2.458558510353684, "grad_norm": 1.234375, "learning_rate": 0.00044012131230071575, "loss": 6.1195, "mean_token_accuracy": 0.1430794417858124, "num_tokens": 49703807.0, "step": 22975 }, { "entropy": 6.444790935516357, "epoch": 2.459093584461448, "grad_norm": 1.2421875, "learning_rate": 0.0004400953384837695, "loss": 6.0938, "mean_token_accuracy": 0.14478445202112197, "num_tokens": 49714945.0, "step": 22980 }, { "entropy": 6.459289789199829, "epoch": 2.459628658569212, "grad_norm": 1.1796875, "learning_rate": 0.0004400693598997185, "loss": 6.026, "mean_token_accuracy": 0.15960747748613358, "num_tokens": 49727267.0, "step": 22985 }, { "entropy": 6.408087491989136, "epoch": 2.4601637326769756, "grad_norm": 1.25, "learning_rate": 0.00044004337654931293, "loss": 6.0221, "mean_token_accuracy": 0.14450939372181892, "num_tokens": 49738370.0, "step": 22990 }, { "entropy": 6.4737691402435305, "epoch": 2.4606988067847397, "grad_norm": 1.2890625, "learning_rate": 0.00044001738843330306, "loss": 6.1205, "mean_token_accuracy": 0.14351325035095214, "num_tokens": 49750113.0, "step": 22995 }, { "entropy": 6.486575174331665, "epoch": 2.461233880892504, "grad_norm": 1.3125, "learning_rate": 0.00043999139555243936, "loss": 6.186, "mean_token_accuracy": 0.1371962085366249, "num_tokens": 49761163.0, "step": 23000 }, { "entropy": 6.512165069580078, "epoch": 2.4617689550002675, "grad_norm": 1.2421875, "learning_rate": 0.0004399653979074722, "loss": 6.1001, "mean_token_accuracy": 0.14443175718188286, "num_tokens": 49771185.0, "step": 23005 }, { "entropy": 6.474620771408081, "epoch": 2.4623040291080316, "grad_norm": 1.5, "learning_rate": 0.00043993939549915245, "loss": 6.0988, "mean_token_accuracy": 0.14699120223522186, "num_tokens": 49781202.0, "step": 23010 }, { "entropy": 6.435923099517822, "epoch": 2.4628391032157952, "grad_norm": 1.3125, "learning_rate": 0.00043991338832823074, "loss": 6.0809, "mean_token_accuracy": 0.14400503635406495, "num_tokens": 49790971.0, "step": 23015 }, { "entropy": 6.422207832336426, "epoch": 2.4633741773235593, "grad_norm": 1.21875, "learning_rate": 0.0004398873763954582, "loss": 6.0504, "mean_token_accuracy": 0.14769563227891921, "num_tokens": 49800942.0, "step": 23020 }, { "entropy": 6.405848407745362, "epoch": 2.463909251431323, "grad_norm": 1.0625, "learning_rate": 0.00043986135970158573, "loss": 6.034, "mean_token_accuracy": 0.1474476121366024, "num_tokens": 49812043.0, "step": 23025 }, { "entropy": 6.365705394744873, "epoch": 2.464444325539087, "grad_norm": 1.15625, "learning_rate": 0.00043983533824736476, "loss": 6.0348, "mean_token_accuracy": 0.15809634178876877, "num_tokens": 49823045.0, "step": 23030 }, { "entropy": 6.503657388687134, "epoch": 2.464979399646851, "grad_norm": 1.6875, "learning_rate": 0.0004398093120335465, "loss": 6.1443, "mean_token_accuracy": 0.14928590059280394, "num_tokens": 49833014.0, "step": 23035 }, { "entropy": 6.409166574478149, "epoch": 2.465514473754615, "grad_norm": 1.2890625, "learning_rate": 0.00043978328106088254, "loss": 6.0483, "mean_token_accuracy": 0.14776428788900375, "num_tokens": 49843171.0, "step": 23040 }, { "entropy": 6.3962408065795895, "epoch": 2.466049547862379, "grad_norm": 1.2578125, "learning_rate": 0.0004397572453301246, "loss": 5.9595, "mean_token_accuracy": 0.15220305025577546, "num_tokens": 49853772.0, "step": 23045 }, { "entropy": 6.457070207595825, "epoch": 2.466584621970143, "grad_norm": 1.140625, "learning_rate": 0.00043973120484202416, "loss": 6.1059, "mean_token_accuracy": 0.1467456340789795, "num_tokens": 49865379.0, "step": 23050 }, { "entropy": 6.455566263198852, "epoch": 2.4671196960779067, "grad_norm": 1.234375, "learning_rate": 0.00043970515959733343, "loss": 6.1403, "mean_token_accuracy": 0.14159029349684715, "num_tokens": 49876453.0, "step": 23055 }, { "entropy": 6.37555570602417, "epoch": 2.467654770185671, "grad_norm": 1.1328125, "learning_rate": 0.00043967910959680435, "loss": 6.0181, "mean_token_accuracy": 0.15629979074001313, "num_tokens": 49886675.0, "step": 23060 }, { "entropy": 6.398741769790649, "epoch": 2.4681898442934345, "grad_norm": 1.1328125, "learning_rate": 0.0004396530548411891, "loss": 5.9593, "mean_token_accuracy": 0.14982084035873414, "num_tokens": 49896946.0, "step": 23065 }, { "entropy": 6.462337923049927, "epoch": 2.4687249184011986, "grad_norm": 1.25, "learning_rate": 0.0004396269953312401, "loss": 6.1644, "mean_token_accuracy": 0.1378537319600582, "num_tokens": 49906989.0, "step": 23070 }, { "entropy": 6.367944669723511, "epoch": 2.4692599925089627, "grad_norm": 1.3828125, "learning_rate": 0.00043960093106770964, "loss": 5.9328, "mean_token_accuracy": 0.15191028118133545, "num_tokens": 49917861.0, "step": 23075 }, { "entropy": 6.400054168701172, "epoch": 2.4697950666167263, "grad_norm": 1.375, "learning_rate": 0.00043957486205135047, "loss": 6.1082, "mean_token_accuracy": 0.14867668226361275, "num_tokens": 49930529.0, "step": 23080 }, { "entropy": 6.440872430801392, "epoch": 2.4703301407244904, "grad_norm": 1.1875, "learning_rate": 0.0004395487882829153, "loss": 6.0491, "mean_token_accuracy": 0.14804016947746276, "num_tokens": 49943067.0, "step": 23085 }, { "entropy": 6.468083000183105, "epoch": 2.470865214832254, "grad_norm": 1.1953125, "learning_rate": 0.00043952270976315707, "loss": 6.0929, "mean_token_accuracy": 0.14439067244529724, "num_tokens": 49953648.0, "step": 23090 }, { "entropy": 6.509150695800781, "epoch": 2.471400288940018, "grad_norm": 1.171875, "learning_rate": 0.00043949662649282853, "loss": 6.1519, "mean_token_accuracy": 0.13846293613314628, "num_tokens": 49963571.0, "step": 23095 }, { "entropy": 6.4821052074432375, "epoch": 2.4719353630477823, "grad_norm": 1.1953125, "learning_rate": 0.00043947053847268313, "loss": 6.0943, "mean_token_accuracy": 0.15272858291864394, "num_tokens": 49974627.0, "step": 23100 }, { "entropy": 6.520781564712524, "epoch": 2.472470437155546, "grad_norm": 1.1875, "learning_rate": 0.000439444445703474, "loss": 6.1571, "mean_token_accuracy": 0.14583753868937493, "num_tokens": 49986659.0, "step": 23105 }, { "entropy": 6.452333688735962, "epoch": 2.47300551126331, "grad_norm": 1.2109375, "learning_rate": 0.00043941834818595464, "loss": 6.0701, "mean_token_accuracy": 0.150446055829525, "num_tokens": 49997099.0, "step": 23110 }, { "entropy": 6.421077680587769, "epoch": 2.473540585371074, "grad_norm": 1.4765625, "learning_rate": 0.00043939224592087864, "loss": 6.0976, "mean_token_accuracy": 0.14522971212863922, "num_tokens": 50008148.0, "step": 23115 }, { "entropy": 6.531986284255981, "epoch": 2.474075659478838, "grad_norm": 1.3046875, "learning_rate": 0.00043936613890899955, "loss": 6.181, "mean_token_accuracy": 0.1413787081837654, "num_tokens": 50019335.0, "step": 23120 }, { "entropy": 6.427493143081665, "epoch": 2.474610733586602, "grad_norm": 1.2890625, "learning_rate": 0.0004393400271510713, "loss": 6.0461, "mean_token_accuracy": 0.1487402305006981, "num_tokens": 50029513.0, "step": 23125 }, { "entropy": 6.495285224914551, "epoch": 2.4751458076943655, "grad_norm": 1.1953125, "learning_rate": 0.00043931391064784786, "loss": 6.1566, "mean_token_accuracy": 0.1396355152130127, "num_tokens": 50039353.0, "step": 23130 }, { "entropy": 6.460680055618286, "epoch": 2.4756808818021296, "grad_norm": 1.3828125, "learning_rate": 0.00043928778940008334, "loss": 6.1395, "mean_token_accuracy": 0.14789653718471527, "num_tokens": 50050260.0, "step": 23135 }, { "entropy": 6.38835916519165, "epoch": 2.4762159559098933, "grad_norm": 1.1015625, "learning_rate": 0.00043926166340853203, "loss": 5.9717, "mean_token_accuracy": 0.14648790806531906, "num_tokens": 50061384.0, "step": 23140 }, { "entropy": 6.468059730529785, "epoch": 2.4767510300176574, "grad_norm": 1.359375, "learning_rate": 0.0004392355326739483, "loss": 6.0317, "mean_token_accuracy": 0.15342689007520677, "num_tokens": 50071984.0, "step": 23145 }, { "entropy": 6.456266403198242, "epoch": 2.4772861041254215, "grad_norm": 1.3125, "learning_rate": 0.00043920939719708656, "loss": 6.0433, "mean_token_accuracy": 0.1549179270863533, "num_tokens": 50083225.0, "step": 23150 }, { "entropy": 6.434696054458618, "epoch": 2.477821178233185, "grad_norm": 1.359375, "learning_rate": 0.0004391832569787016, "loss": 6.0641, "mean_token_accuracy": 0.15381431430578232, "num_tokens": 50093240.0, "step": 23155 }, { "entropy": 6.423350858688354, "epoch": 2.4783562523409493, "grad_norm": 1.171875, "learning_rate": 0.0004391571120195481, "loss": 6.0996, "mean_token_accuracy": 0.14446234777569772, "num_tokens": 50103870.0, "step": 23160 }, { "entropy": 6.4318469047546385, "epoch": 2.4788913264487134, "grad_norm": 1.625, "learning_rate": 0.0004391309623203811, "loss": 6.1336, "mean_token_accuracy": 0.1447260245680809, "num_tokens": 50115231.0, "step": 23165 }, { "entropy": 6.458612775802612, "epoch": 2.479426400556477, "grad_norm": 1.171875, "learning_rate": 0.0004391048078819556, "loss": 6.0209, "mean_token_accuracy": 0.14789726138114928, "num_tokens": 50125592.0, "step": 23170 }, { "entropy": 6.370980739593506, "epoch": 2.479961474664241, "grad_norm": 1.2578125, "learning_rate": 0.0004390786487050269, "loss": 6.0174, "mean_token_accuracy": 0.1512372836470604, "num_tokens": 50136713.0, "step": 23175 }, { "entropy": 6.459298944473266, "epoch": 2.4804965487720048, "grad_norm": 1.6875, "learning_rate": 0.0004390524847903502, "loss": 6.1103, "mean_token_accuracy": 0.1442016489803791, "num_tokens": 50148645.0, "step": 23180 }, { "entropy": 6.510531091690064, "epoch": 2.481031622879769, "grad_norm": 2.203125, "learning_rate": 0.0004390263161386811, "loss": 6.0781, "mean_token_accuracy": 0.1441599190235138, "num_tokens": 50159973.0, "step": 23185 }, { "entropy": 6.476980257034302, "epoch": 2.481566696987533, "grad_norm": 1.515625, "learning_rate": 0.00043900014275077517, "loss": 6.092, "mean_token_accuracy": 0.14473516941070558, "num_tokens": 50170591.0, "step": 23190 }, { "entropy": 6.434345006942749, "epoch": 2.4821017710952966, "grad_norm": 1.2421875, "learning_rate": 0.00043897396462738817, "loss": 6.1105, "mean_token_accuracy": 0.15290300399065018, "num_tokens": 50182414.0, "step": 23195 }, { "entropy": 6.4994419574737545, "epoch": 2.4826368452030607, "grad_norm": 1.1640625, "learning_rate": 0.0004389477817692759, "loss": 6.1605, "mean_token_accuracy": 0.14065559729933738, "num_tokens": 50192567.0, "step": 23200 }, { "entropy": 6.5225043296813965, "epoch": 2.4831719193108244, "grad_norm": 1.4453125, "learning_rate": 0.0004389215941771946, "loss": 6.1259, "mean_token_accuracy": 0.14196338802576064, "num_tokens": 50203142.0, "step": 23205 }, { "entropy": 6.466710758209229, "epoch": 2.4837069934185885, "grad_norm": 1.2734375, "learning_rate": 0.00043889540185190024, "loss": 6.1292, "mean_token_accuracy": 0.13840990290045738, "num_tokens": 50214854.0, "step": 23210 }, { "entropy": 6.476119756698608, "epoch": 2.4842420675263526, "grad_norm": 1.53125, "learning_rate": 0.0004388692047941492, "loss": 6.0901, "mean_token_accuracy": 0.13987003415822982, "num_tokens": 50225999.0, "step": 23215 }, { "entropy": 6.5091104984283445, "epoch": 2.4847771416341162, "grad_norm": 1.2421875, "learning_rate": 0.0004388430030046978, "loss": 6.1559, "mean_token_accuracy": 0.14605989456176757, "num_tokens": 50236657.0, "step": 23220 }, { "entropy": 6.5166901588439945, "epoch": 2.4853122157418803, "grad_norm": 1.4921875, "learning_rate": 0.0004388167964843029, "loss": 6.0963, "mean_token_accuracy": 0.1424080826342106, "num_tokens": 50246457.0, "step": 23225 }, { "entropy": 6.46362681388855, "epoch": 2.485847289849644, "grad_norm": 1.21875, "learning_rate": 0.0004387905852337209, "loss": 6.1028, "mean_token_accuracy": 0.14413710832595825, "num_tokens": 50257020.0, "step": 23230 }, { "entropy": 6.472870254516602, "epoch": 2.486382363957408, "grad_norm": 1.2265625, "learning_rate": 0.00043876436925370873, "loss": 6.0063, "mean_token_accuracy": 0.15392645075917244, "num_tokens": 50267173.0, "step": 23235 }, { "entropy": 6.422497415542603, "epoch": 2.486917438065172, "grad_norm": 1.2578125, "learning_rate": 0.0004387381485450235, "loss": 6.1328, "mean_token_accuracy": 0.14750081449747085, "num_tokens": 50278352.0, "step": 23240 }, { "entropy": 6.47580041885376, "epoch": 2.487452512172936, "grad_norm": 3.0625, "learning_rate": 0.00043871192310842216, "loss": 6.19, "mean_token_accuracy": 0.13669595420360564, "num_tokens": 50290301.0, "step": 23245 }, { "entropy": 6.599526119232178, "epoch": 2.4879875862807, "grad_norm": 1.6171875, "learning_rate": 0.0004386856929446621, "loss": 6.1808, "mean_token_accuracy": 0.136481686681509, "num_tokens": 50301707.0, "step": 23250 }, { "entropy": 6.518272590637207, "epoch": 2.4885226603884636, "grad_norm": 1.3515625, "learning_rate": 0.0004386594580545006, "loss": 6.1136, "mean_token_accuracy": 0.14791110083460807, "num_tokens": 50313334.0, "step": 23255 }, { "entropy": 6.407838249206543, "epoch": 2.4890577344962277, "grad_norm": 1.265625, "learning_rate": 0.0004386332184386953, "loss": 6.1039, "mean_token_accuracy": 0.14902055412530898, "num_tokens": 50324228.0, "step": 23260 }, { "entropy": 6.375598478317261, "epoch": 2.489592808603992, "grad_norm": 1.34375, "learning_rate": 0.00043860697409800383, "loss": 5.9396, "mean_token_accuracy": 0.1506534829735756, "num_tokens": 50335001.0, "step": 23265 }, { "entropy": 6.4696540355682375, "epoch": 2.4901278827117554, "grad_norm": 1.21875, "learning_rate": 0.00043858072503318393, "loss": 6.1171, "mean_token_accuracy": 0.1484534554183483, "num_tokens": 50346415.0, "step": 23270 }, { "entropy": 6.425711917877197, "epoch": 2.4906629568195195, "grad_norm": 1.4921875, "learning_rate": 0.00043855447124499356, "loss": 6.1339, "mean_token_accuracy": 0.14480747878551484, "num_tokens": 50357625.0, "step": 23275 }, { "entropy": 6.439349508285522, "epoch": 2.4911980309272836, "grad_norm": 1.15625, "learning_rate": 0.00043852821273419087, "loss": 6.0058, "mean_token_accuracy": 0.1571085900068283, "num_tokens": 50367672.0, "step": 23280 }, { "entropy": 6.428450393676758, "epoch": 2.4917331050350473, "grad_norm": 1.21875, "learning_rate": 0.000438501949501534, "loss": 6.0518, "mean_token_accuracy": 0.1523447170853615, "num_tokens": 50378220.0, "step": 23285 }, { "entropy": 6.446330785751343, "epoch": 2.4922681791428114, "grad_norm": 1.2421875, "learning_rate": 0.00043847568154778134, "loss": 5.9806, "mean_token_accuracy": 0.15336769074201584, "num_tokens": 50389517.0, "step": 23290 }, { "entropy": 6.468391418457031, "epoch": 2.492803253250575, "grad_norm": 1.4296875, "learning_rate": 0.0004384494088736913, "loss": 6.0891, "mean_token_accuracy": 0.15114848762750627, "num_tokens": 50401155.0, "step": 23295 }, { "entropy": 6.445683765411377, "epoch": 2.493338327358339, "grad_norm": 1.71875, "learning_rate": 0.0004384231314800226, "loss": 6.0912, "mean_token_accuracy": 0.14842903316020967, "num_tokens": 50412609.0, "step": 23300 }, { "entropy": 6.494117212295532, "epoch": 2.493873401466103, "grad_norm": 1.2421875, "learning_rate": 0.0004383968493675339, "loss": 6.0813, "mean_token_accuracy": 0.14793714582920076, "num_tokens": 50422665.0, "step": 23305 }, { "entropy": 6.494427299499511, "epoch": 2.494408475573867, "grad_norm": 1.1953125, "learning_rate": 0.0004383705625369841, "loss": 6.1177, "mean_token_accuracy": 0.1393368974328041, "num_tokens": 50434012.0, "step": 23310 }, { "entropy": 6.470083379745484, "epoch": 2.494943549681631, "grad_norm": 1.1640625, "learning_rate": 0.0004383442709891323, "loss": 6.0936, "mean_token_accuracy": 0.14519904255867006, "num_tokens": 50444270.0, "step": 23315 }, { "entropy": 6.392035007476807, "epoch": 2.4954786237893947, "grad_norm": 1.2109375, "learning_rate": 0.00043831797472473763, "loss": 5.9609, "mean_token_accuracy": 0.15484258234500886, "num_tokens": 50455236.0, "step": 23320 }, { "entropy": 6.444661092758179, "epoch": 2.4960136978971588, "grad_norm": 1.390625, "learning_rate": 0.0004382916737445594, "loss": 6.111, "mean_token_accuracy": 0.1406653791666031, "num_tokens": 50466431.0, "step": 23325 }, { "entropy": 6.523527050018311, "epoch": 2.496548772004923, "grad_norm": 1.171875, "learning_rate": 0.000438265368049357, "loss": 6.1519, "mean_token_accuracy": 0.13907749727368354, "num_tokens": 50477211.0, "step": 23330 }, { "entropy": 6.5079161643981935, "epoch": 2.4970838461126865, "grad_norm": 1.2109375, "learning_rate": 0.00043823905763989003, "loss": 6.0752, "mean_token_accuracy": 0.14193671345710754, "num_tokens": 50488668.0, "step": 23335 }, { "entropy": 6.446755361557007, "epoch": 2.4976189202204506, "grad_norm": 1.234375, "learning_rate": 0.00043821274251691823, "loss": 6.0011, "mean_token_accuracy": 0.1504003033041954, "num_tokens": 50498031.0, "step": 23340 }, { "entropy": 6.340474939346313, "epoch": 2.4981539943282143, "grad_norm": 1.2421875, "learning_rate": 0.00043818642268120153, "loss": 6.0373, "mean_token_accuracy": 0.1462131343781948, "num_tokens": 50508567.0, "step": 23345 }, { "entropy": 6.437395620346069, "epoch": 2.4986890684359784, "grad_norm": 1.828125, "learning_rate": 0.00043816009813349964, "loss": 6.0353, "mean_token_accuracy": 0.15378950387239457, "num_tokens": 50519057.0, "step": 23350 }, { "entropy": 6.538073492050171, "epoch": 2.4992241425437425, "grad_norm": 1.4609375, "learning_rate": 0.000438133768874573, "loss": 6.1038, "mean_token_accuracy": 0.1484562948346138, "num_tokens": 50530572.0, "step": 23355 }, { "entropy": 6.47088360786438, "epoch": 2.499759216651506, "grad_norm": 1.375, "learning_rate": 0.00043810743490518155, "loss": 6.1063, "mean_token_accuracy": 0.1463600903749466, "num_tokens": 50541195.0, "step": 23360 }, { "entropy": 6.515494632720947, "epoch": 2.5002942907592702, "grad_norm": 1.0703125, "learning_rate": 0.00043808109622608596, "loss": 6.1946, "mean_token_accuracy": 0.13623849898576737, "num_tokens": 50552655.0, "step": 23365 }, { "entropy": 6.481916379928589, "epoch": 2.500829364867034, "grad_norm": 1.25, "learning_rate": 0.00043805475283804657, "loss": 6.1129, "mean_token_accuracy": 0.14265030547976493, "num_tokens": 50562848.0, "step": 23370 }, { "entropy": 6.439973831176758, "epoch": 2.501364438974798, "grad_norm": 1.328125, "learning_rate": 0.0004380284047418241, "loss": 6.0784, "mean_token_accuracy": 0.15172381699085236, "num_tokens": 50572690.0, "step": 23375 }, { "entropy": 6.383023691177368, "epoch": 2.501899513082562, "grad_norm": 1.3125, "learning_rate": 0.0004380020519381794, "loss": 6.0451, "mean_token_accuracy": 0.15252356231212616, "num_tokens": 50583826.0, "step": 23380 }, { "entropy": 6.334165954589844, "epoch": 2.5024345871903257, "grad_norm": 1.6484375, "learning_rate": 0.00043797569442787334, "loss": 6.004, "mean_token_accuracy": 0.15069624707102774, "num_tokens": 50595148.0, "step": 23385 }, { "entropy": 6.488463115692139, "epoch": 2.50296966129809, "grad_norm": 1.390625, "learning_rate": 0.000437949332211667, "loss": 6.1861, "mean_token_accuracy": 0.1439678907394409, "num_tokens": 50606568.0, "step": 23390 }, { "entropy": 6.571941328048706, "epoch": 2.503504735405854, "grad_norm": 1.1953125, "learning_rate": 0.00043792296529032156, "loss": 6.121, "mean_token_accuracy": 0.14040026888251306, "num_tokens": 50618144.0, "step": 23395 }, { "entropy": 6.55412974357605, "epoch": 2.5040398095136176, "grad_norm": 1.265625, "learning_rate": 0.0004378965936645984, "loss": 6.0622, "mean_token_accuracy": 0.1514056220650673, "num_tokens": 50629721.0, "step": 23400 }, { "entropy": 6.443898248672485, "epoch": 2.5045748836213817, "grad_norm": 1.203125, "learning_rate": 0.00043787021733525904, "loss": 6.1071, "mean_token_accuracy": 0.14666295945644378, "num_tokens": 50640482.0, "step": 23405 }, { "entropy": 6.477694988250732, "epoch": 2.5051099577291454, "grad_norm": 1.078125, "learning_rate": 0.000437843836303065, "loss": 6.1533, "mean_token_accuracy": 0.13883556723594664, "num_tokens": 50652261.0, "step": 23410 }, { "entropy": 6.452952766418457, "epoch": 2.5056450318369095, "grad_norm": 1.2265625, "learning_rate": 0.0004378174505687781, "loss": 5.9393, "mean_token_accuracy": 0.15319164842367172, "num_tokens": 50662397.0, "step": 23415 }, { "entropy": 6.410601568222046, "epoch": 2.506180105944673, "grad_norm": 1.21875, "learning_rate": 0.0004377910601331601, "loss": 6.0564, "mean_token_accuracy": 0.1474452570080757, "num_tokens": 50673494.0, "step": 23420 }, { "entropy": 6.360077285766602, "epoch": 2.506715180052437, "grad_norm": 1.3359375, "learning_rate": 0.0004377646649969733, "loss": 6.0001, "mean_token_accuracy": 0.15623431354761125, "num_tokens": 50683963.0, "step": 23425 }, { "entropy": 6.472473907470703, "epoch": 2.5072502541602013, "grad_norm": 1.28125, "learning_rate": 0.00043773826516097945, "loss": 6.0933, "mean_token_accuracy": 0.14767294973134995, "num_tokens": 50694449.0, "step": 23430 }, { "entropy": 6.5044702053070065, "epoch": 2.507785328267965, "grad_norm": 1.3984375, "learning_rate": 0.00043771186062594114, "loss": 6.0732, "mean_token_accuracy": 0.15112870782613755, "num_tokens": 50705877.0, "step": 23435 }, { "entropy": 6.459271717071533, "epoch": 2.508320402375729, "grad_norm": 1.3046875, "learning_rate": 0.00043768545139262076, "loss": 6.0958, "mean_token_accuracy": 0.14634856283664704, "num_tokens": 50716581.0, "step": 23440 }, { "entropy": 6.450234508514404, "epoch": 2.508855476483493, "grad_norm": 1.1640625, "learning_rate": 0.0004376590374617809, "loss": 6.0854, "mean_token_accuracy": 0.14191805496811866, "num_tokens": 50727948.0, "step": 23445 }, { "entropy": 6.343714380264283, "epoch": 2.509390550591257, "grad_norm": 1.1796875, "learning_rate": 0.00043763261883418396, "loss": 5.9523, "mean_token_accuracy": 0.1620820701122284, "num_tokens": 50739189.0, "step": 23450 }, { "entropy": 6.4272877216339115, "epoch": 2.509925624699021, "grad_norm": 1.4140625, "learning_rate": 0.0004376061955105932, "loss": 6.0518, "mean_token_accuracy": 0.15062596499919892, "num_tokens": 50749439.0, "step": 23455 }, { "entropy": 6.463335657119751, "epoch": 2.5104606988067846, "grad_norm": 1.09375, "learning_rate": 0.00043757976749177137, "loss": 6.1681, "mean_token_accuracy": 0.14523911774158477, "num_tokens": 50761463.0, "step": 23460 }, { "entropy": 6.491697835922241, "epoch": 2.5109957729145487, "grad_norm": 1.1328125, "learning_rate": 0.0004375533347784816, "loss": 6.1556, "mean_token_accuracy": 0.1446097180247307, "num_tokens": 50771359.0, "step": 23465 }, { "entropy": 6.476978874206543, "epoch": 2.5115308470223123, "grad_norm": 1.234375, "learning_rate": 0.00043752689737148705, "loss": 6.0688, "mean_token_accuracy": 0.14670259952545167, "num_tokens": 50781669.0, "step": 23470 }, { "entropy": 6.47306456565857, "epoch": 2.5120659211300764, "grad_norm": 1.6640625, "learning_rate": 0.00043750045527155126, "loss": 6.0484, "mean_token_accuracy": 0.1475702315568924, "num_tokens": 50792217.0, "step": 23475 }, { "entropy": 6.445755338668823, "epoch": 2.5126009952378405, "grad_norm": 1.3984375, "learning_rate": 0.0004374740084794376, "loss": 6.1165, "mean_token_accuracy": 0.14298529252409936, "num_tokens": 50805288.0, "step": 23480 }, { "entropy": 6.423535013198853, "epoch": 2.513136069345604, "grad_norm": 1.4296875, "learning_rate": 0.0004374475569959098, "loss": 6.0433, "mean_token_accuracy": 0.15176984742283822, "num_tokens": 50815563.0, "step": 23485 }, { "entropy": 6.444725227355957, "epoch": 2.5136711434533683, "grad_norm": 1.2890625, "learning_rate": 0.0004374211008217316, "loss": 6.0499, "mean_token_accuracy": 0.15303923562169075, "num_tokens": 50826108.0, "step": 23490 }, { "entropy": 6.406829595565796, "epoch": 2.5142062175611324, "grad_norm": 1.25, "learning_rate": 0.00043739463995766696, "loss": 6.0413, "mean_token_accuracy": 0.14996329694986343, "num_tokens": 50837180.0, "step": 23495 }, { "entropy": 6.415341234207153, "epoch": 2.514741291668896, "grad_norm": 1.140625, "learning_rate": 0.0004373681744044799, "loss": 6.0346, "mean_token_accuracy": 0.15418055057525634, "num_tokens": 50847430.0, "step": 23500 }, { "entropy": 6.484678506851196, "epoch": 2.51527636577666, "grad_norm": 1.171875, "learning_rate": 0.00043734170416293467, "loss": 6.0842, "mean_token_accuracy": 0.14977000206708907, "num_tokens": 50858100.0, "step": 23505 }, { "entropy": 6.495728826522827, "epoch": 2.5158114398844242, "grad_norm": 1.3203125, "learning_rate": 0.00043731522923379554, "loss": 6.1318, "mean_token_accuracy": 0.1433524288237095, "num_tokens": 50868549.0, "step": 23510 }, { "entropy": 6.487738037109375, "epoch": 2.516346513992188, "grad_norm": 1.3046875, "learning_rate": 0.0004372887496178269, "loss": 6.0835, "mean_token_accuracy": 0.14577526077628136, "num_tokens": 50879522.0, "step": 23515 }, { "entropy": 6.4393473148345945, "epoch": 2.516881588099952, "grad_norm": 1.2734375, "learning_rate": 0.0004372622653157935, "loss": 6.0958, "mean_token_accuracy": 0.1456751585006714, "num_tokens": 50891139.0, "step": 23520 }, { "entropy": 6.421893692016601, "epoch": 2.5174166622077156, "grad_norm": 1.0703125, "learning_rate": 0.0004372357763284599, "loss": 6.1118, "mean_token_accuracy": 0.14199379533529283, "num_tokens": 50901267.0, "step": 23525 }, { "entropy": 6.463366556167602, "epoch": 2.5179517363154797, "grad_norm": 1.7578125, "learning_rate": 0.0004372092826565911, "loss": 6.0079, "mean_token_accuracy": 0.1521808072924614, "num_tokens": 50912137.0, "step": 23530 }, { "entropy": 6.458667516708374, "epoch": 2.5184868104232434, "grad_norm": 1.171875, "learning_rate": 0.0004371827843009521, "loss": 6.1097, "mean_token_accuracy": 0.1470927283167839, "num_tokens": 50922724.0, "step": 23535 }, { "entropy": 6.46234164237976, "epoch": 2.5190218845310075, "grad_norm": 1.71875, "learning_rate": 0.00043715628126230795, "loss": 6.1108, "mean_token_accuracy": 0.14309716820716858, "num_tokens": 50934617.0, "step": 23540 }, { "entropy": 6.464339351654052, "epoch": 2.5195569586387716, "grad_norm": 1.421875, "learning_rate": 0.0004371297735414239, "loss": 6.1085, "mean_token_accuracy": 0.1441352665424347, "num_tokens": 50945179.0, "step": 23545 }, { "entropy": 6.462499189376831, "epoch": 2.5200920327465353, "grad_norm": 1.2265625, "learning_rate": 0.00043710326113906555, "loss": 6.1225, "mean_token_accuracy": 0.15157264620065689, "num_tokens": 50955383.0, "step": 23550 }, { "entropy": 6.5211022853851315, "epoch": 2.5206271068542994, "grad_norm": 1.6015625, "learning_rate": 0.0004370767440559983, "loss": 6.0422, "mean_token_accuracy": 0.151044125854969, "num_tokens": 50966107.0, "step": 23555 }, { "entropy": 6.396521520614624, "epoch": 2.5211621809620635, "grad_norm": 1.1640625, "learning_rate": 0.00043705022229298775, "loss": 5.9656, "mean_token_accuracy": 0.16853859797120094, "num_tokens": 50977042.0, "step": 23560 }, { "entropy": 6.415504598617554, "epoch": 2.521697255069827, "grad_norm": 1.2421875, "learning_rate": 0.0004370236958507998, "loss": 6.1356, "mean_token_accuracy": 0.14767294153571128, "num_tokens": 50986999.0, "step": 23565 }, { "entropy": 6.4797906398773195, "epoch": 2.522232329177591, "grad_norm": 1.2109375, "learning_rate": 0.0004369971647302005, "loss": 6.0679, "mean_token_accuracy": 0.1419106476008892, "num_tokens": 50997824.0, "step": 23570 }, { "entropy": 6.577082347869873, "epoch": 2.522767403285355, "grad_norm": 1.265625, "learning_rate": 0.0004369706289319558, "loss": 6.1442, "mean_token_accuracy": 0.14608432352542877, "num_tokens": 51009001.0, "step": 23575 }, { "entropy": 6.476378059387207, "epoch": 2.523302477393119, "grad_norm": 1.2109375, "learning_rate": 0.00043694408845683185, "loss": 6.053, "mean_token_accuracy": 0.152521114051342, "num_tokens": 51019222.0, "step": 23580 }, { "entropy": 6.480445861816406, "epoch": 2.5238375515008826, "grad_norm": 1.1640625, "learning_rate": 0.0004369175433055952, "loss": 6.0567, "mean_token_accuracy": 0.1476146787405014, "num_tokens": 51029473.0, "step": 23585 }, { "entropy": 6.471163082122803, "epoch": 2.5243726256086467, "grad_norm": 1.2890625, "learning_rate": 0.00043689099347901227, "loss": 6.0797, "mean_token_accuracy": 0.14782582521438598, "num_tokens": 51040667.0, "step": 23590 }, { "entropy": 6.379007577896118, "epoch": 2.524907699716411, "grad_norm": 1.3984375, "learning_rate": 0.00043686443897784954, "loss": 5.9761, "mean_token_accuracy": 0.15364776849746703, "num_tokens": 51050386.0, "step": 23595 }, { "entropy": 6.458848714828491, "epoch": 2.5254427738241745, "grad_norm": 1.265625, "learning_rate": 0.000436837879802874, "loss": 6.1155, "mean_token_accuracy": 0.14842621833086014, "num_tokens": 51060752.0, "step": 23600 }, { "entropy": 6.440014266967774, "epoch": 2.5259778479319386, "grad_norm": 1.09375, "learning_rate": 0.00043681131595485234, "loss": 6.0811, "mean_token_accuracy": 0.14779562056064605, "num_tokens": 51072467.0, "step": 23605 }, { "entropy": 6.544898653030396, "epoch": 2.5265129220397027, "grad_norm": 1.125, "learning_rate": 0.0004367847474345517, "loss": 6.1633, "mean_token_accuracy": 0.14447703212499619, "num_tokens": 51083404.0, "step": 23610 }, { "entropy": 6.453373813629151, "epoch": 2.5270479961474663, "grad_norm": 1.2578125, "learning_rate": 0.00043675817424273925, "loss": 6.072, "mean_token_accuracy": 0.15299114361405372, "num_tokens": 51094392.0, "step": 23615 }, { "entropy": 6.488115406036377, "epoch": 2.5275830702552304, "grad_norm": 1.1875, "learning_rate": 0.00043673159638018215, "loss": 6.0907, "mean_token_accuracy": 0.14106457233428954, "num_tokens": 51104706.0, "step": 23620 }, { "entropy": 6.490919971466065, "epoch": 2.5281181443629945, "grad_norm": 1.2265625, "learning_rate": 0.000436705013847648, "loss": 6.1459, "mean_token_accuracy": 0.14325982183218003, "num_tokens": 51114881.0, "step": 23625 }, { "entropy": 6.531571578979492, "epoch": 2.528653218470758, "grad_norm": 1.140625, "learning_rate": 0.0004366784266459043, "loss": 6.1454, "mean_token_accuracy": 0.14374287724494933, "num_tokens": 51125705.0, "step": 23630 }, { "entropy": 6.535162162780762, "epoch": 2.5291882925785223, "grad_norm": 1.1328125, "learning_rate": 0.00043665183477571874, "loss": 6.1194, "mean_token_accuracy": 0.1407308377325535, "num_tokens": 51136460.0, "step": 23635 }, { "entropy": 6.430759429931641, "epoch": 2.529723366686286, "grad_norm": 1.40625, "learning_rate": 0.0004366252382378592, "loss": 6.0795, "mean_token_accuracy": 0.1493188112974167, "num_tokens": 51146206.0, "step": 23640 }, { "entropy": 6.424686098098755, "epoch": 2.53025844079405, "grad_norm": 1.234375, "learning_rate": 0.0004365986370330935, "loss": 6.1766, "mean_token_accuracy": 0.1391225829720497, "num_tokens": 51156650.0, "step": 23645 }, { "entropy": 6.480143070220947, "epoch": 2.5307935149018137, "grad_norm": 1.25, "learning_rate": 0.00043657203116218994, "loss": 6.1492, "mean_token_accuracy": 0.14662258252501487, "num_tokens": 51168401.0, "step": 23650 }, { "entropy": 6.523509883880616, "epoch": 2.531328589009578, "grad_norm": 1.140625, "learning_rate": 0.00043654542062591674, "loss": 6.1006, "mean_token_accuracy": 0.1411995768547058, "num_tokens": 51178571.0, "step": 23655 }, { "entropy": 6.503192996978759, "epoch": 2.531863663117342, "grad_norm": 1.1171875, "learning_rate": 0.00043651880542504214, "loss": 6.1787, "mean_token_accuracy": 0.13608428239822387, "num_tokens": 51189143.0, "step": 23660 }, { "entropy": 6.448965835571289, "epoch": 2.5323987372251056, "grad_norm": 1.328125, "learning_rate": 0.00043649218556033475, "loss": 6.0954, "mean_token_accuracy": 0.14627905040979386, "num_tokens": 51200552.0, "step": 23665 }, { "entropy": 6.4708034038543705, "epoch": 2.5329338113328697, "grad_norm": 1.4140625, "learning_rate": 0.0004364655610325632, "loss": 6.1068, "mean_token_accuracy": 0.14722600281238557, "num_tokens": 51210493.0, "step": 23670 }, { "entropy": 6.445748710632325, "epoch": 2.5334688854406338, "grad_norm": 1.2109375, "learning_rate": 0.0004364389318424962, "loss": 6.0863, "mean_token_accuracy": 0.14877480193972586, "num_tokens": 51220535.0, "step": 23675 }, { "entropy": 6.439504957199096, "epoch": 2.5340039595483974, "grad_norm": 1.1640625, "learning_rate": 0.00043641229799090285, "loss": 6.1407, "mean_token_accuracy": 0.14188293144106864, "num_tokens": 51232078.0, "step": 23680 }, { "entropy": 6.4832312107086185, "epoch": 2.5345390336561615, "grad_norm": 1.265625, "learning_rate": 0.000436385659478552, "loss": 6.1395, "mean_token_accuracy": 0.15170127898454666, "num_tokens": 51242750.0, "step": 23685 }, { "entropy": 6.575940847396851, "epoch": 2.535074107763925, "grad_norm": 1.3203125, "learning_rate": 0.00043635901630621293, "loss": 6.1446, "mean_token_accuracy": 0.13975838497281073, "num_tokens": 51254295.0, "step": 23690 }, { "entropy": 6.483678245544434, "epoch": 2.5356091818716893, "grad_norm": 1.2421875, "learning_rate": 0.00043633236847465497, "loss": 6.1006, "mean_token_accuracy": 0.14603102207183838, "num_tokens": 51265060.0, "step": 23695 }, { "entropy": 6.381811571121216, "epoch": 2.536144255979453, "grad_norm": 1.5703125, "learning_rate": 0.0004363057159846475, "loss": 6.0016, "mean_token_accuracy": 0.14961035996675492, "num_tokens": 51275623.0, "step": 23700 }, { "entropy": 6.393724012374878, "epoch": 2.536679330087217, "grad_norm": 1.1640625, "learning_rate": 0.0004362790588369602, "loss": 6.0025, "mean_token_accuracy": 0.15411610305309295, "num_tokens": 51285830.0, "step": 23705 }, { "entropy": 6.456270313262939, "epoch": 2.537214404194981, "grad_norm": 1.6875, "learning_rate": 0.0004362523970323627, "loss": 6.1147, "mean_token_accuracy": 0.14590513259172438, "num_tokens": 51297047.0, "step": 23710 }, { "entropy": 6.435363292694092, "epoch": 2.5377494783027448, "grad_norm": 1.8046875, "learning_rate": 0.00043622573057162484, "loss": 6.0433, "mean_token_accuracy": 0.14598360732197763, "num_tokens": 51307254.0, "step": 23715 }, { "entropy": 6.454430150985718, "epoch": 2.538284552410509, "grad_norm": 1.265625, "learning_rate": 0.0004361990594555167, "loss": 6.1944, "mean_token_accuracy": 0.13499054610729216, "num_tokens": 51317796.0, "step": 23720 }, { "entropy": 6.507284021377563, "epoch": 2.538819626518273, "grad_norm": 1.3203125, "learning_rate": 0.00043617238368480845, "loss": 6.189, "mean_token_accuracy": 0.14208370372653006, "num_tokens": 51330172.0, "step": 23725 }, { "entropy": 6.527377986907959, "epoch": 2.5393547006260366, "grad_norm": 1.3515625, "learning_rate": 0.00043614570326027015, "loss": 6.0374, "mean_token_accuracy": 0.15405570715665817, "num_tokens": 51340844.0, "step": 23730 }, { "entropy": 6.481348705291748, "epoch": 2.5398897747338007, "grad_norm": 1.2421875, "learning_rate": 0.0004361190181826724, "loss": 6.0786, "mean_token_accuracy": 0.1491836801171303, "num_tokens": 51352078.0, "step": 23735 }, { "entropy": 6.4385000705719, "epoch": 2.540424848841565, "grad_norm": 1.1796875, "learning_rate": 0.00043609232845278565, "loss": 6.173, "mean_token_accuracy": 0.13707626909017562, "num_tokens": 51364121.0, "step": 23740 }, { "entropy": 6.486933803558349, "epoch": 2.5409599229493285, "grad_norm": 1.9140625, "learning_rate": 0.0004360656340713805, "loss": 6.1241, "mean_token_accuracy": 0.15508515536785125, "num_tokens": 51375046.0, "step": 23745 }, { "entropy": 6.453219890594482, "epoch": 2.541494997057092, "grad_norm": 1.2890625, "learning_rate": 0.0004360389350392278, "loss": 6.0315, "mean_token_accuracy": 0.14416414871811867, "num_tokens": 51386363.0, "step": 23750 }, { "entropy": 6.3984826564788815, "epoch": 2.5420300711648562, "grad_norm": 1.1484375, "learning_rate": 0.00043601223135709846, "loss": 5.9987, "mean_token_accuracy": 0.15675863921642302, "num_tokens": 51398036.0, "step": 23755 }, { "entropy": 6.425463771820068, "epoch": 2.5425651452726203, "grad_norm": 1.2265625, "learning_rate": 0.0004359855230257636, "loss": 6.0867, "mean_token_accuracy": 0.14525877088308334, "num_tokens": 51408769.0, "step": 23760 }, { "entropy": 6.457871580123902, "epoch": 2.543100219380384, "grad_norm": 1.4453125, "learning_rate": 0.00043595881004599444, "loss": 6.1112, "mean_token_accuracy": 0.14525377601385117, "num_tokens": 51420315.0, "step": 23765 }, { "entropy": 6.445687532424927, "epoch": 2.543635293488148, "grad_norm": 1.171875, "learning_rate": 0.00043593209241856216, "loss": 6.0705, "mean_token_accuracy": 0.15387475341558457, "num_tokens": 51432283.0, "step": 23770 }, { "entropy": 6.468622398376465, "epoch": 2.544170367595912, "grad_norm": 1.0859375, "learning_rate": 0.00043590537014423833, "loss": 6.0751, "mean_token_accuracy": 0.15372790396213531, "num_tokens": 51443151.0, "step": 23775 }, { "entropy": 6.330078363418579, "epoch": 2.544705441703676, "grad_norm": 1.3671875, "learning_rate": 0.0004358786432237946, "loss": 6.0093, "mean_token_accuracy": 0.14666105732321738, "num_tokens": 51453964.0, "step": 23780 }, { "entropy": 6.450662469863891, "epoch": 2.54524051581144, "grad_norm": 1.2578125, "learning_rate": 0.0004358519116580026, "loss": 6.0491, "mean_token_accuracy": 0.15346280187368394, "num_tokens": 51464236.0, "step": 23785 }, { "entropy": 6.363191318511963, "epoch": 2.545775589919204, "grad_norm": 1.21875, "learning_rate": 0.0004358251754476344, "loss": 6.0205, "mean_token_accuracy": 0.15527293980121612, "num_tokens": 51474388.0, "step": 23790 }, { "entropy": 6.410833835601807, "epoch": 2.5463106640269677, "grad_norm": 1.2265625, "learning_rate": 0.0004357984345934617, "loss": 6.0515, "mean_token_accuracy": 0.13957794830203057, "num_tokens": 51485209.0, "step": 23795 }, { "entropy": 6.441276693344117, "epoch": 2.546845738134732, "grad_norm": 1.1953125, "learning_rate": 0.0004357716890962568, "loss": 6.0114, "mean_token_accuracy": 0.15188122242689134, "num_tokens": 51495993.0, "step": 23800 }, { "entropy": 6.450775861740112, "epoch": 2.5473808122424955, "grad_norm": 1.1953125, "learning_rate": 0.000435744938956792, "loss": 6.0183, "mean_token_accuracy": 0.1522235870361328, "num_tokens": 51506282.0, "step": 23805 }, { "entropy": 6.4267974376678465, "epoch": 2.5479158863502596, "grad_norm": 1.2890625, "learning_rate": 0.00043571818417583976, "loss": 6.1498, "mean_token_accuracy": 0.1420055314898491, "num_tokens": 51517728.0, "step": 23810 }, { "entropy": 6.458556127548218, "epoch": 2.548450960458023, "grad_norm": 1.3046875, "learning_rate": 0.0004356914247541724, "loss": 6.0643, "mean_token_accuracy": 0.15005556344985962, "num_tokens": 51528769.0, "step": 23815 }, { "entropy": 6.454838466644287, "epoch": 2.5489860345657873, "grad_norm": 1.1171875, "learning_rate": 0.00043566466069256283, "loss": 6.0478, "mean_token_accuracy": 0.14791302084922792, "num_tokens": 51540148.0, "step": 23820 }, { "entropy": 6.476283884048462, "epoch": 2.5495211086735514, "grad_norm": 1.140625, "learning_rate": 0.0004356378919917837, "loss": 6.0436, "mean_token_accuracy": 0.1498100385069847, "num_tokens": 51550657.0, "step": 23825 }, { "entropy": 6.441194677352906, "epoch": 2.550056182781315, "grad_norm": 1.1484375, "learning_rate": 0.0004356111186526081, "loss": 6.0477, "mean_token_accuracy": 0.15196770578622817, "num_tokens": 51560399.0, "step": 23830 }, { "entropy": 6.414425039291382, "epoch": 2.550591256889079, "grad_norm": 1.171875, "learning_rate": 0.00043558434067580894, "loss": 6.1238, "mean_token_accuracy": 0.1447290763258934, "num_tokens": 51571463.0, "step": 23835 }, { "entropy": 6.480480623245239, "epoch": 2.5511263309968433, "grad_norm": 1.1875, "learning_rate": 0.00043555755806215946, "loss": 6.0227, "mean_token_accuracy": 0.15467719733715057, "num_tokens": 51583136.0, "step": 23840 }, { "entropy": 6.4993109703063965, "epoch": 2.551661405104607, "grad_norm": 1.171875, "learning_rate": 0.00043553077081243314, "loss": 6.1543, "mean_token_accuracy": 0.1417586736381054, "num_tokens": 51594397.0, "step": 23845 }, { "entropy": 6.486432266235352, "epoch": 2.552196479212371, "grad_norm": 1.296875, "learning_rate": 0.0004355039789274034, "loss": 6.1892, "mean_token_accuracy": 0.1408970907330513, "num_tokens": 51605788.0, "step": 23850 }, { "entropy": 6.497194528579712, "epoch": 2.5527315533201347, "grad_norm": 1.109375, "learning_rate": 0.0004354771824078437, "loss": 6.0751, "mean_token_accuracy": 0.14397743716835976, "num_tokens": 51615693.0, "step": 23855 }, { "entropy": 6.396121883392334, "epoch": 2.553266627427899, "grad_norm": 1.2109375, "learning_rate": 0.00043545038125452793, "loss": 5.9849, "mean_token_accuracy": 0.15312101393938066, "num_tokens": 51626607.0, "step": 23860 }, { "entropy": 6.424760103225708, "epoch": 2.5538017015356624, "grad_norm": 1.140625, "learning_rate": 0.00043542357546823003, "loss": 6.0803, "mean_token_accuracy": 0.1500844404101372, "num_tokens": 51636905.0, "step": 23865 }, { "entropy": 6.450059413909912, "epoch": 2.5543367756434265, "grad_norm": 1.1796875, "learning_rate": 0.00043539676504972393, "loss": 6.0673, "mean_token_accuracy": 0.1490839898586273, "num_tokens": 51648142.0, "step": 23870 }, { "entropy": 6.512945318222046, "epoch": 2.5548718497511906, "grad_norm": 2.03125, "learning_rate": 0.0004353699499997837, "loss": 6.0832, "mean_token_accuracy": 0.1372237868607044, "num_tokens": 51659583.0, "step": 23875 }, { "entropy": 6.450292873382568, "epoch": 2.5554069238589543, "grad_norm": 1.1484375, "learning_rate": 0.0004353431303191837, "loss": 6.1439, "mean_token_accuracy": 0.1443669892847538, "num_tokens": 51670582.0, "step": 23880 }, { "entropy": 6.533113813400268, "epoch": 2.5559419979667184, "grad_norm": 1.2265625, "learning_rate": 0.00043531630600869846, "loss": 6.1521, "mean_token_accuracy": 0.13966882973909378, "num_tokens": 51680773.0, "step": 23885 }, { "entropy": 6.502314758300781, "epoch": 2.5564770720744825, "grad_norm": 1.1796875, "learning_rate": 0.0004352894770691024, "loss": 6.1002, "mean_token_accuracy": 0.14475717693567275, "num_tokens": 51690680.0, "step": 23890 }, { "entropy": 6.467441606521606, "epoch": 2.557012146182246, "grad_norm": 1.1796875, "learning_rate": 0.0004352626435011701, "loss": 6.0826, "mean_token_accuracy": 0.14894639998674392, "num_tokens": 51700910.0, "step": 23895 }, { "entropy": 6.467555284500122, "epoch": 2.5575472202900102, "grad_norm": 1.2578125, "learning_rate": 0.00043523580530567654, "loss": 6.0889, "mean_token_accuracy": 0.14425421729683877, "num_tokens": 51712331.0, "step": 23900 }, { "entropy": 6.374993991851807, "epoch": 2.5580822943977743, "grad_norm": 1.3203125, "learning_rate": 0.0004352089624833966, "loss": 5.9926, "mean_token_accuracy": 0.1546017974615097, "num_tokens": 51722805.0, "step": 23905 }, { "entropy": 6.422532653808593, "epoch": 2.558617368505538, "grad_norm": 1.3203125, "learning_rate": 0.00043518211503510535, "loss": 6.0655, "mean_token_accuracy": 0.150536473095417, "num_tokens": 51733909.0, "step": 23910 }, { "entropy": 6.460271120071411, "epoch": 2.559152442613302, "grad_norm": 1.1875, "learning_rate": 0.00043515526296157813, "loss": 6.136, "mean_token_accuracy": 0.139005671441555, "num_tokens": 51745062.0, "step": 23915 }, { "entropy": 6.463294887542725, "epoch": 2.5596875167210658, "grad_norm": 1.2890625, "learning_rate": 0.0004351284062635901, "loss": 6.1421, "mean_token_accuracy": 0.14392079263925553, "num_tokens": 51756235.0, "step": 23920 }, { "entropy": 6.4998626708984375, "epoch": 2.56022259082883, "grad_norm": 1.203125, "learning_rate": 0.000435101544941917, "loss": 6.0806, "mean_token_accuracy": 0.14673112258315085, "num_tokens": 51765689.0, "step": 23925 }, { "entropy": 6.408583688735962, "epoch": 2.5607576649365935, "grad_norm": 1.234375, "learning_rate": 0.0004350746789973341, "loss": 5.9467, "mean_token_accuracy": 0.15023422092199326, "num_tokens": 51777090.0, "step": 23930 }, { "entropy": 6.4311888217926025, "epoch": 2.5612927390443576, "grad_norm": 1.5703125, "learning_rate": 0.0004350478084306174, "loss": 6.0981, "mean_token_accuracy": 0.14473380595445634, "num_tokens": 51787360.0, "step": 23935 }, { "entropy": 6.3969158172607425, "epoch": 2.5618278131521217, "grad_norm": 1.3359375, "learning_rate": 0.0004350209332425428, "loss": 6.0308, "mean_token_accuracy": 0.14888717755675315, "num_tokens": 51799075.0, "step": 23940 }, { "entropy": 6.376031541824341, "epoch": 2.5623628872598854, "grad_norm": 1.1171875, "learning_rate": 0.00043499405343388613, "loss": 5.9073, "mean_token_accuracy": 0.16880181729793547, "num_tokens": 51810024.0, "step": 23945 }, { "entropy": 6.454634141921997, "epoch": 2.5628979613676495, "grad_norm": 1.1953125, "learning_rate": 0.0004349671690054238, "loss": 6.0535, "mean_token_accuracy": 0.14208773672580718, "num_tokens": 51820710.0, "step": 23950 }, { "entropy": 6.4697834014892575, "epoch": 2.5634330354754136, "grad_norm": 1.3515625, "learning_rate": 0.00043494027995793176, "loss": 6.066, "mean_token_accuracy": 0.1473910927772522, "num_tokens": 51831451.0, "step": 23955 }, { "entropy": 6.313320589065552, "epoch": 2.5639681095831772, "grad_norm": 1.1015625, "learning_rate": 0.0004349133862921867, "loss": 5.9907, "mean_token_accuracy": 0.16042271703481675, "num_tokens": 51841483.0, "step": 23960 }, { "entropy": 6.412751722335815, "epoch": 2.5645031836909413, "grad_norm": 1.171875, "learning_rate": 0.00043488648800896516, "loss": 6.0534, "mean_token_accuracy": 0.15336196273565292, "num_tokens": 51852838.0, "step": 23965 }, { "entropy": 6.406958389282226, "epoch": 2.565038257798705, "grad_norm": 1.625, "learning_rate": 0.0004348595851090436, "loss": 6.0733, "mean_token_accuracy": 0.14980074018239975, "num_tokens": 51863851.0, "step": 23970 }, { "entropy": 6.432291507720947, "epoch": 2.565573331906469, "grad_norm": 1.40625, "learning_rate": 0.00043483267759319907, "loss": 6.0092, "mean_token_accuracy": 0.15225662142038346, "num_tokens": 51874380.0, "step": 23975 }, { "entropy": 6.49734263420105, "epoch": 2.5661084060142327, "grad_norm": 1.2578125, "learning_rate": 0.0004348057654622084, "loss": 6.0402, "mean_token_accuracy": 0.15027616024017335, "num_tokens": 51884594.0, "step": 23980 }, { "entropy": 6.482366228103638, "epoch": 2.566643480121997, "grad_norm": 1.25, "learning_rate": 0.0004347788487168487, "loss": 6.1759, "mean_token_accuracy": 0.13969626873731614, "num_tokens": 51897679.0, "step": 23985 }, { "entropy": 6.483441352844238, "epoch": 2.567178554229761, "grad_norm": 1.1640625, "learning_rate": 0.0004347519273578972, "loss": 6.2197, "mean_token_accuracy": 0.13812159448862077, "num_tokens": 51907501.0, "step": 23990 }, { "entropy": 6.465521383285522, "epoch": 2.5677136283375246, "grad_norm": 1.34375, "learning_rate": 0.00043472500138613124, "loss": 6.0649, "mean_token_accuracy": 0.14138805717229844, "num_tokens": 51917732.0, "step": 23995 }, { "entropy": 6.463391351699829, "epoch": 2.5682487024452887, "grad_norm": 1.6328125, "learning_rate": 0.0004346980708023284, "loss": 6.1502, "mean_token_accuracy": 0.1416984058916569, "num_tokens": 51929038.0, "step": 24000 }, { "epoch": 2.5682487024452887, "eval_entropy": 6.27463636732487, "eval_loss": 6.196377277374268, "eval_mean_token_accuracy": 0.149448194002577, "eval_num_tokens": 51929038.0, "eval_runtime": 22.6201, "eval_samples_per_second": 1312.061, "eval_steps_per_second": 164.013, "step": 24000 }, { "entropy": 6.516879844665527, "epoch": 2.568783776553053, "grad_norm": 1.1640625, "learning_rate": 0.0004346711356072661, "loss": 6.1753, "mean_token_accuracy": 0.14101736843585969, "num_tokens": 51939481.0, "step": 24005 }, { "entropy": 6.5593249797821045, "epoch": 2.5693188506608164, "grad_norm": 1.328125, "learning_rate": 0.0004346441958017222, "loss": 6.1351, "mean_token_accuracy": 0.1444205828011036, "num_tokens": 51951393.0, "step": 24010 }, { "entropy": 6.53387942314148, "epoch": 2.5698539247685805, "grad_norm": 1.25, "learning_rate": 0.0004346172513864746, "loss": 6.1676, "mean_token_accuracy": 0.14086406603455542, "num_tokens": 51962897.0, "step": 24015 }, { "entropy": 6.456385469436645, "epoch": 2.5703889988763446, "grad_norm": 1.1796875, "learning_rate": 0.00043459030236230137, "loss": 6.1026, "mean_token_accuracy": 0.14337882846593858, "num_tokens": 51974443.0, "step": 24020 }, { "entropy": 6.391973829269409, "epoch": 2.5709240729841083, "grad_norm": 1.2265625, "learning_rate": 0.0004345633487299805, "loss": 6.0971, "mean_token_accuracy": 0.14847104549407958, "num_tokens": 51985158.0, "step": 24025 }, { "entropy": 6.52832260131836, "epoch": 2.571459147091872, "grad_norm": 1.15625, "learning_rate": 0.00043453639049029035, "loss": 6.2, "mean_token_accuracy": 0.1380402758717537, "num_tokens": 51994956.0, "step": 24030 }, { "entropy": 6.5086275100708, "epoch": 2.571994221199636, "grad_norm": 1.2265625, "learning_rate": 0.00043450942764400937, "loss": 5.9695, "mean_token_accuracy": 0.15147302001714708, "num_tokens": 52004922.0, "step": 24035 }, { "entropy": 6.386508321762085, "epoch": 2.5725292953074, "grad_norm": 1.28125, "learning_rate": 0.0004344824601919161, "loss": 6.0324, "mean_token_accuracy": 0.15597374141216278, "num_tokens": 52014684.0, "step": 24040 }, { "entropy": 6.441916227340698, "epoch": 2.573064369415164, "grad_norm": 1.3515625, "learning_rate": 0.00043445548813478914, "loss": 6.0492, "mean_token_accuracy": 0.15587343275547028, "num_tokens": 52025283.0, "step": 24045 }, { "entropy": 6.532823181152343, "epoch": 2.573599443522928, "grad_norm": 1.2265625, "learning_rate": 0.0004344285114734074, "loss": 6.1403, "mean_token_accuracy": 0.1462143950164318, "num_tokens": 52036513.0, "step": 24050 }, { "entropy": 6.517218828201294, "epoch": 2.574134517630692, "grad_norm": 1.234375, "learning_rate": 0.00043440153020854987, "loss": 6.0316, "mean_token_accuracy": 0.15213731974363326, "num_tokens": 52047230.0, "step": 24055 }, { "entropy": 6.448276519775391, "epoch": 2.5746695917384557, "grad_norm": 1.703125, "learning_rate": 0.0004343745443409954, "loss": 6.0953, "mean_token_accuracy": 0.14763810187578202, "num_tokens": 52058889.0, "step": 24060 }, { "entropy": 6.425657510757446, "epoch": 2.5752046658462198, "grad_norm": 1.34375, "learning_rate": 0.00043434755387152354, "loss": 6.0247, "mean_token_accuracy": 0.14771818220615388, "num_tokens": 52068478.0, "step": 24065 }, { "entropy": 6.386288118362427, "epoch": 2.575739739953984, "grad_norm": 1.140625, "learning_rate": 0.0004343205588009133, "loss": 6.076, "mean_token_accuracy": 0.1480717495083809, "num_tokens": 52079756.0, "step": 24070 }, { "entropy": 6.497709560394287, "epoch": 2.5762748140617475, "grad_norm": 1.203125, "learning_rate": 0.00043429355912994437, "loss": 6.0728, "mean_token_accuracy": 0.14538149759173394, "num_tokens": 52090452.0, "step": 24075 }, { "entropy": 6.452464532852173, "epoch": 2.5768098881695116, "grad_norm": 1.46875, "learning_rate": 0.0004342665548593964, "loss": 5.9936, "mean_token_accuracy": 0.14874869138002395, "num_tokens": 52101134.0, "step": 24080 }, { "entropy": 6.4219461441040036, "epoch": 2.5773449622772753, "grad_norm": 1.21875, "learning_rate": 0.0004342395459900489, "loss": 6.0363, "mean_token_accuracy": 0.14652038589119912, "num_tokens": 52111529.0, "step": 24085 }, { "entropy": 6.355379915237426, "epoch": 2.5778800363850394, "grad_norm": 1.2890625, "learning_rate": 0.00043421253252268194, "loss": 6.0313, "mean_token_accuracy": 0.14850951135158538, "num_tokens": 52122779.0, "step": 24090 }, { "entropy": 6.447815465927124, "epoch": 2.578415110492803, "grad_norm": 1.25, "learning_rate": 0.0004341855144580754, "loss": 6.0336, "mean_token_accuracy": 0.1435435838997364, "num_tokens": 52134140.0, "step": 24095 }, { "entropy": 6.467025518417358, "epoch": 2.578950184600567, "grad_norm": 1.1796875, "learning_rate": 0.00043415849179700956, "loss": 6.0545, "mean_token_accuracy": 0.1435348868370056, "num_tokens": 52146033.0, "step": 24100 }, { "entropy": 6.370548820495605, "epoch": 2.5794852587083312, "grad_norm": 1.2578125, "learning_rate": 0.0004341314645402647, "loss": 6.0735, "mean_token_accuracy": 0.14471182450652123, "num_tokens": 52157516.0, "step": 24105 }, { "entropy": 6.415873670578003, "epoch": 2.580020332816095, "grad_norm": 1.78125, "learning_rate": 0.0004341044326886211, "loss": 6.0722, "mean_token_accuracy": 0.1526182025671005, "num_tokens": 52167523.0, "step": 24110 }, { "entropy": 6.395650959014892, "epoch": 2.580555406923859, "grad_norm": 1.2578125, "learning_rate": 0.0004340773962428593, "loss": 5.9952, "mean_token_accuracy": 0.15602321103215216, "num_tokens": 52178235.0, "step": 24115 }, { "entropy": 6.370280075073242, "epoch": 2.581090481031623, "grad_norm": 1.21875, "learning_rate": 0.00043405035520376013, "loss": 5.9663, "mean_token_accuracy": 0.1569521740078926, "num_tokens": 52188586.0, "step": 24120 }, { "entropy": 6.424892568588257, "epoch": 2.5816255551393867, "grad_norm": 1.140625, "learning_rate": 0.0004340233095721043, "loss": 6.0651, "mean_token_accuracy": 0.15124413520097732, "num_tokens": 52199081.0, "step": 24125 }, { "entropy": 6.458188056945801, "epoch": 2.582160629247151, "grad_norm": 1.203125, "learning_rate": 0.0004339962593486727, "loss": 6.1105, "mean_token_accuracy": 0.14388948678970337, "num_tokens": 52210324.0, "step": 24130 }, { "entropy": 6.4354267597198485, "epoch": 2.5826957033549145, "grad_norm": 1.171875, "learning_rate": 0.00043396920453424656, "loss": 6.0934, "mean_token_accuracy": 0.14596305638551713, "num_tokens": 52221973.0, "step": 24135 }, { "entropy": 6.415314340591431, "epoch": 2.5832307774626786, "grad_norm": 1.421875, "learning_rate": 0.00043394214512960683, "loss": 6.0225, "mean_token_accuracy": 0.1482434719800949, "num_tokens": 52232560.0, "step": 24140 }, { "entropy": 6.429066514968872, "epoch": 2.5837658515704423, "grad_norm": 1.1171875, "learning_rate": 0.0004339150811355351, "loss": 5.9687, "mean_token_accuracy": 0.15345148146152496, "num_tokens": 52243416.0, "step": 24145 }, { "entropy": 6.370793199539184, "epoch": 2.5843009256782064, "grad_norm": 1.328125, "learning_rate": 0.0004338880125528127, "loss": 6.0729, "mean_token_accuracy": 0.14965935051441193, "num_tokens": 52254213.0, "step": 24150 }, { "entropy": 6.346394824981689, "epoch": 2.5848359997859705, "grad_norm": 1.3125, "learning_rate": 0.00043386093938222126, "loss": 6.0275, "mean_token_accuracy": 0.14227450117468834, "num_tokens": 52265381.0, "step": 24155 }, { "entropy": 6.439273071289063, "epoch": 2.585371073893734, "grad_norm": 1.234375, "learning_rate": 0.0004338338616245425, "loss": 5.9808, "mean_token_accuracy": 0.15383731126785277, "num_tokens": 52276407.0, "step": 24160 }, { "entropy": 6.47182822227478, "epoch": 2.585906148001498, "grad_norm": 1.5546875, "learning_rate": 0.00043380677928055834, "loss": 6.0297, "mean_token_accuracy": 0.14760112687945365, "num_tokens": 52286484.0, "step": 24165 }, { "entropy": 6.447051572799682, "epoch": 2.5864412221092623, "grad_norm": 1.2265625, "learning_rate": 0.00043377969235105075, "loss": 6.0181, "mean_token_accuracy": 0.1589368149638176, "num_tokens": 52297674.0, "step": 24170 }, { "entropy": 6.466054677963257, "epoch": 2.586976296217026, "grad_norm": 1.3125, "learning_rate": 0.0004337526008368018, "loss": 6.2, "mean_token_accuracy": 0.13537324145436286, "num_tokens": 52309100.0, "step": 24175 }, { "entropy": 6.463847732543945, "epoch": 2.58751137032479, "grad_norm": 1.2265625, "learning_rate": 0.0004337255047385938, "loss": 6.1466, "mean_token_accuracy": 0.14427336156368256, "num_tokens": 52320002.0, "step": 24180 }, { "entropy": 6.506901597976684, "epoch": 2.588046444432554, "grad_norm": 1.25, "learning_rate": 0.00043369840405720923, "loss": 6.0284, "mean_token_accuracy": 0.1494366154074669, "num_tokens": 52330073.0, "step": 24185 }, { "entropy": 6.470348787307739, "epoch": 2.588581518540318, "grad_norm": 1.109375, "learning_rate": 0.00043367129879343054, "loss": 6.0647, "mean_token_accuracy": 0.1489595964550972, "num_tokens": 52340472.0, "step": 24190 }, { "entropy": 6.375665807723999, "epoch": 2.589116592648082, "grad_norm": 1.4765625, "learning_rate": 0.00043364418894804033, "loss": 6.0988, "mean_token_accuracy": 0.1446430616080761, "num_tokens": 52350654.0, "step": 24195 }, { "entropy": 6.377849435806274, "epoch": 2.5896516667558456, "grad_norm": 1.1484375, "learning_rate": 0.00043361707452182146, "loss": 6.023, "mean_token_accuracy": 0.1453050084412098, "num_tokens": 52361412.0, "step": 24200 }, { "entropy": 6.456816053390503, "epoch": 2.5901867408636097, "grad_norm": 1.203125, "learning_rate": 0.00043358995551555693, "loss": 6.0259, "mean_token_accuracy": 0.15469790548086165, "num_tokens": 52372030.0, "step": 24205 }, { "entropy": 6.451414012908936, "epoch": 2.5907218149713733, "grad_norm": 1.34375, "learning_rate": 0.00043356283193002966, "loss": 6.102, "mean_token_accuracy": 0.14788893163204192, "num_tokens": 52382965.0, "step": 24210 }, { "entropy": 6.400993394851684, "epoch": 2.5912568890791374, "grad_norm": 1.140625, "learning_rate": 0.0004335357037660229, "loss": 5.9864, "mean_token_accuracy": 0.16124625951051713, "num_tokens": 52393959.0, "step": 24215 }, { "entropy": 6.459224557876587, "epoch": 2.5917919631869015, "grad_norm": 1.1796875, "learning_rate": 0.00043350857102432, "loss": 6.1135, "mean_token_accuracy": 0.14438671991229057, "num_tokens": 52405142.0, "step": 24220 }, { "entropy": 6.456777429580688, "epoch": 2.592327037294665, "grad_norm": 1.2109375, "learning_rate": 0.0004334814337057043, "loss": 6.0892, "mean_token_accuracy": 0.14303739219903946, "num_tokens": 52415927.0, "step": 24225 }, { "entropy": 6.43075041770935, "epoch": 2.5928621114024293, "grad_norm": 1.21875, "learning_rate": 0.00043345429181095957, "loss": 6.0079, "mean_token_accuracy": 0.15044942498207092, "num_tokens": 52426475.0, "step": 24230 }, { "entropy": 6.418110799789429, "epoch": 2.5933971855101934, "grad_norm": 1.2109375, "learning_rate": 0.00043342714534086945, "loss": 6.0459, "mean_token_accuracy": 0.1518814221024513, "num_tokens": 52437239.0, "step": 24235 }, { "entropy": 6.429792833328247, "epoch": 2.593932259617957, "grad_norm": 1.1640625, "learning_rate": 0.0004333999942962177, "loss": 6.0682, "mean_token_accuracy": 0.14043737947940826, "num_tokens": 52447323.0, "step": 24240 }, { "entropy": 6.528575420379639, "epoch": 2.594467333725721, "grad_norm": 4.09375, "learning_rate": 0.00043337283867778836, "loss": 6.1452, "mean_token_accuracy": 0.14742616713047027, "num_tokens": 52458465.0, "step": 24245 }, { "entropy": 6.451436614990234, "epoch": 2.595002407833485, "grad_norm": 1.21875, "learning_rate": 0.00043334567848636563, "loss": 6.1069, "mean_token_accuracy": 0.14342329725623132, "num_tokens": 52468809.0, "step": 24250 }, { "entropy": 6.460465335845948, "epoch": 2.595537481941249, "grad_norm": 1.25, "learning_rate": 0.00043331851372273365, "loss": 6.1086, "mean_token_accuracy": 0.14166531935334206, "num_tokens": 52479456.0, "step": 24255 }, { "entropy": 6.434340095520019, "epoch": 2.5960725560490125, "grad_norm": 1.21875, "learning_rate": 0.00043329134438767683, "loss": 6.0314, "mean_token_accuracy": 0.14960811734199525, "num_tokens": 52490146.0, "step": 24260 }, { "entropy": 6.475519704818725, "epoch": 2.5966076301567766, "grad_norm": 1.1875, "learning_rate": 0.0004332641704819797, "loss": 6.1205, "mean_token_accuracy": 0.14168959707021714, "num_tokens": 52499875.0, "step": 24265 }, { "entropy": 6.394170427322388, "epoch": 2.5971427042645407, "grad_norm": 1.3515625, "learning_rate": 0.00043323699200642686, "loss": 5.9511, "mean_token_accuracy": 0.15287287384271622, "num_tokens": 52510297.0, "step": 24270 }, { "entropy": 6.294159889221191, "epoch": 2.5976777783723044, "grad_norm": 1.421875, "learning_rate": 0.0004332098089618031, "loss": 5.9371, "mean_token_accuracy": 0.15982006639242172, "num_tokens": 52523111.0, "step": 24275 }, { "entropy": 6.367207765579224, "epoch": 2.5982128524800685, "grad_norm": 1.25, "learning_rate": 0.00043318262134889334, "loss": 6.0509, "mean_token_accuracy": 0.15884466767311095, "num_tokens": 52534097.0, "step": 24280 }, { "entropy": 6.45570821762085, "epoch": 2.5987479265878326, "grad_norm": 1.1875, "learning_rate": 0.0004331554291684827, "loss": 6.0907, "mean_token_accuracy": 0.14977332353591918, "num_tokens": 52544985.0, "step": 24285 }, { "entropy": 6.50822811126709, "epoch": 2.5992830006955963, "grad_norm": 1.1796875, "learning_rate": 0.0004331282324213561, "loss": 6.0785, "mean_token_accuracy": 0.1470681443810463, "num_tokens": 52555772.0, "step": 24290 }, { "entropy": 6.394162940979004, "epoch": 2.5998180748033604, "grad_norm": 1.4375, "learning_rate": 0.0004331010311082992, "loss": 6.0741, "mean_token_accuracy": 0.1432741865515709, "num_tokens": 52566578.0, "step": 24295 }, { "entropy": 6.414872694015503, "epoch": 2.6003531489111245, "grad_norm": 1.453125, "learning_rate": 0.00043307382523009717, "loss": 6.1515, "mean_token_accuracy": 0.13928197622299193, "num_tokens": 52578551.0, "step": 24300 }, { "entropy": 6.473379039764405, "epoch": 2.600888223018888, "grad_norm": 1.390625, "learning_rate": 0.0004330466147875356, "loss": 6.0349, "mean_token_accuracy": 0.15189071148633956, "num_tokens": 52589225.0, "step": 24305 }, { "entropy": 6.449392700195313, "epoch": 2.6014232971266518, "grad_norm": 1.1328125, "learning_rate": 0.00043301939978140024, "loss": 6.0077, "mean_token_accuracy": 0.15292997807264327, "num_tokens": 52599572.0, "step": 24310 }, { "entropy": 6.5235514640808105, "epoch": 2.601958371234416, "grad_norm": 1.1796875, "learning_rate": 0.00043299218021247693, "loss": 6.0975, "mean_token_accuracy": 0.14887815117835998, "num_tokens": 52610562.0, "step": 24315 }, { "entropy": 6.455296993255615, "epoch": 2.60249344534218, "grad_norm": 1.3359375, "learning_rate": 0.0004329649560815517, "loss": 6.1538, "mean_token_accuracy": 0.14208897054195405, "num_tokens": 52621078.0, "step": 24320 }, { "entropy": 6.351390933990478, "epoch": 2.6030285194499436, "grad_norm": 1.0546875, "learning_rate": 0.0004329377273894104, "loss": 6.0507, "mean_token_accuracy": 0.15557428300380707, "num_tokens": 52632336.0, "step": 24325 }, { "entropy": 6.331639194488526, "epoch": 2.6035635935577077, "grad_norm": 1.1484375, "learning_rate": 0.0004329104941368396, "loss": 5.974, "mean_token_accuracy": 0.15507864207029343, "num_tokens": 52643701.0, "step": 24330 }, { "entropy": 6.33278169631958, "epoch": 2.604098667665472, "grad_norm": 1.3203125, "learning_rate": 0.0004328832563246254, "loss": 5.9967, "mean_token_accuracy": 0.16262860000133514, "num_tokens": 52654052.0, "step": 24335 }, { "entropy": 6.350516843795776, "epoch": 2.6046337417732355, "grad_norm": 1.2265625, "learning_rate": 0.00043285601395355426, "loss": 5.9468, "mean_token_accuracy": 0.1586562916636467, "num_tokens": 52665033.0, "step": 24340 }, { "entropy": 6.429211378097534, "epoch": 2.6051688158809996, "grad_norm": 1.4140625, "learning_rate": 0.00043282876702441296, "loss": 6.1019, "mean_token_accuracy": 0.14732210487127304, "num_tokens": 52674726.0, "step": 24345 }, { "entropy": 6.438467884063721, "epoch": 2.6057038899887637, "grad_norm": 1.1796875, "learning_rate": 0.00043280151553798824, "loss": 6.0956, "mean_token_accuracy": 0.15359852015972136, "num_tokens": 52687221.0, "step": 24350 }, { "entropy": 6.471713638305664, "epoch": 2.6062389640965273, "grad_norm": 1.859375, "learning_rate": 0.0004327742594950669, "loss": 6.1259, "mean_token_accuracy": 0.14772944822907447, "num_tokens": 52697902.0, "step": 24355 }, { "entropy": 6.433329105377197, "epoch": 2.6067740382042914, "grad_norm": 1.28125, "learning_rate": 0.000432746998896436, "loss": 6.0359, "mean_token_accuracy": 0.1486979454755783, "num_tokens": 52707845.0, "step": 24360 }, { "entropy": 6.360949325561523, "epoch": 2.607309112312055, "grad_norm": 1.140625, "learning_rate": 0.0004327197337428827, "loss": 5.9886, "mean_token_accuracy": 0.14805514216423035, "num_tokens": 52719254.0, "step": 24365 }, { "entropy": 6.387172746658325, "epoch": 2.607844186419819, "grad_norm": 1.1484375, "learning_rate": 0.0004326924640351942, "loss": 6.0702, "mean_token_accuracy": 0.14471611082553865, "num_tokens": 52729765.0, "step": 24370 }, { "entropy": 6.455325651168823, "epoch": 2.608379260527583, "grad_norm": 1.2421875, "learning_rate": 0.00043266518977415797, "loss": 6.0394, "mean_token_accuracy": 0.14488050118088722, "num_tokens": 52740997.0, "step": 24375 }, { "entropy": 6.523528909683227, "epoch": 2.608914334635347, "grad_norm": 1.40625, "learning_rate": 0.0004326379109605615, "loss": 6.2147, "mean_token_accuracy": 0.14074205458164216, "num_tokens": 52753107.0, "step": 24380 }, { "entropy": 6.374628067016602, "epoch": 2.609449408743111, "grad_norm": 1.15625, "learning_rate": 0.0004326106275951926, "loss": 5.9975, "mean_token_accuracy": 0.14371056407690047, "num_tokens": 52765453.0, "step": 24385 }, { "entropy": 6.430091094970703, "epoch": 2.6099844828508747, "grad_norm": 1.28125, "learning_rate": 0.0004325833396788389, "loss": 6.08, "mean_token_accuracy": 0.1492977872490883, "num_tokens": 52776145.0, "step": 24390 }, { "entropy": 6.46644344329834, "epoch": 2.610519556958639, "grad_norm": 1.140625, "learning_rate": 0.0004325560472122884, "loss": 6.0946, "mean_token_accuracy": 0.1439564608037472, "num_tokens": 52788404.0, "step": 24395 }, { "entropy": 6.458155012130737, "epoch": 2.611054631066403, "grad_norm": 1.328125, "learning_rate": 0.0004325287501963293, "loss": 6.1135, "mean_token_accuracy": 0.1481269381940365, "num_tokens": 52800481.0, "step": 24400 }, { "entropy": 6.479500007629395, "epoch": 2.6115897051741666, "grad_norm": 1.84375, "learning_rate": 0.0004325014486317495, "loss": 6.0824, "mean_token_accuracy": 0.14577948302030563, "num_tokens": 52811539.0, "step": 24405 }, { "entropy": 6.483169221878052, "epoch": 2.6121247792819307, "grad_norm": 1.3203125, "learning_rate": 0.0004324741425193376, "loss": 6.086, "mean_token_accuracy": 0.15455956906080245, "num_tokens": 52822330.0, "step": 24410 }, { "entropy": 6.435340213775635, "epoch": 2.6126598533896943, "grad_norm": 2.25, "learning_rate": 0.000432446831859882, "loss": 6.0467, "mean_token_accuracy": 0.14749523997306824, "num_tokens": 52832447.0, "step": 24415 }, { "entropy": 6.390778493881226, "epoch": 2.6131949274974584, "grad_norm": 1.203125, "learning_rate": 0.0004324195166541712, "loss": 6.0102, "mean_token_accuracy": 0.15169788151979446, "num_tokens": 52843089.0, "step": 24420 }, { "entropy": 6.512231492996216, "epoch": 2.613730001605222, "grad_norm": 1.25, "learning_rate": 0.000432392196902994, "loss": 6.1017, "mean_token_accuracy": 0.1472408302128315, "num_tokens": 52854235.0, "step": 24425 }, { "entropy": 6.487987804412842, "epoch": 2.614265075712986, "grad_norm": 1.515625, "learning_rate": 0.0004323648726071392, "loss": 6.135, "mean_token_accuracy": 0.14550320953130721, "num_tokens": 52864693.0, "step": 24430 }, { "entropy": 6.454853820800781, "epoch": 2.6148001498207503, "grad_norm": 1.3828125, "learning_rate": 0.00043233754376739583, "loss": 6.1386, "mean_token_accuracy": 0.13794720098376273, "num_tokens": 52876410.0, "step": 24435 }, { "entropy": 6.511990690231324, "epoch": 2.615335223928514, "grad_norm": 1.0859375, "learning_rate": 0.00043231021038455297, "loss": 6.0957, "mean_token_accuracy": 0.14732400625944136, "num_tokens": 52887416.0, "step": 24440 }, { "entropy": 6.457764339447022, "epoch": 2.615870298036278, "grad_norm": 1.3984375, "learning_rate": 0.00043228287245939995, "loss": 6.0688, "mean_token_accuracy": 0.14884536266326903, "num_tokens": 52899191.0, "step": 24445 }, { "entropy": 6.423716735839844, "epoch": 2.616405372144042, "grad_norm": 1.234375, "learning_rate": 0.000432255529992726, "loss": 6.1069, "mean_token_accuracy": 0.14540746733546256, "num_tokens": 52910479.0, "step": 24450 }, { "entropy": 6.5056352615356445, "epoch": 2.6169404462518058, "grad_norm": 1.3828125, "learning_rate": 0.00043222818298532074, "loss": 6.0127, "mean_token_accuracy": 0.14803672283887864, "num_tokens": 52921121.0, "step": 24455 }, { "entropy": 6.44695553779602, "epoch": 2.61747552035957, "grad_norm": 1.703125, "learning_rate": 0.00043220083143797385, "loss": 6.09, "mean_token_accuracy": 0.13852541148662567, "num_tokens": 52931604.0, "step": 24460 }, { "entropy": 6.373794031143189, "epoch": 2.618010594467334, "grad_norm": 1.171875, "learning_rate": 0.000432173475351475, "loss": 6.032, "mean_token_accuracy": 0.14527107030153275, "num_tokens": 52942200.0, "step": 24465 }, { "entropy": 6.4063183784484865, "epoch": 2.6185456685750976, "grad_norm": 1.4453125, "learning_rate": 0.0004321461147266141, "loss": 6.0824, "mean_token_accuracy": 0.14536070376634597, "num_tokens": 52954350.0, "step": 24470 }, { "entropy": 6.480186939239502, "epoch": 2.6190807426828617, "grad_norm": 1.890625, "learning_rate": 0.00043211874956418134, "loss": 6.0619, "mean_token_accuracy": 0.16361079066991807, "num_tokens": 52965683.0, "step": 24475 }, { "entropy": 6.446354913711548, "epoch": 2.6196158167906254, "grad_norm": 1.25, "learning_rate": 0.0004320913798649667, "loss": 6.055, "mean_token_accuracy": 0.1539105162024498, "num_tokens": 52975463.0, "step": 24480 }, { "entropy": 6.352461862564087, "epoch": 2.6201508908983895, "grad_norm": 1.328125, "learning_rate": 0.0004320640056297605, "loss": 6.0591, "mean_token_accuracy": 0.1458171598613262, "num_tokens": 52986115.0, "step": 24485 }, { "entropy": 6.436176395416259, "epoch": 2.620685965006153, "grad_norm": 1.203125, "learning_rate": 0.0004320366268593532, "loss": 6.0464, "mean_token_accuracy": 0.1481872394680977, "num_tokens": 52995770.0, "step": 24490 }, { "entropy": 6.432749843597412, "epoch": 2.6212210391139172, "grad_norm": 1.3828125, "learning_rate": 0.00043200924355453544, "loss": 6.0518, "mean_token_accuracy": 0.14631206393241883, "num_tokens": 53006490.0, "step": 24495 }, { "entropy": 6.402523422241211, "epoch": 2.6217561132216813, "grad_norm": 1.546875, "learning_rate": 0.0004319818557160978, "loss": 5.9427, "mean_token_accuracy": 0.156124509871006, "num_tokens": 53016129.0, "step": 24500 }, { "entropy": 6.429434156417846, "epoch": 2.622291187329445, "grad_norm": 1.328125, "learning_rate": 0.00043195446334483116, "loss": 6.0573, "mean_token_accuracy": 0.147378371655941, "num_tokens": 53026568.0, "step": 24505 }, { "entropy": 6.433309268951416, "epoch": 2.622826261437209, "grad_norm": 1.296875, "learning_rate": 0.00043192706644152646, "loss": 6.0144, "mean_token_accuracy": 0.15224088430404664, "num_tokens": 53036488.0, "step": 24510 }, { "entropy": 6.49397087097168, "epoch": 2.623361335544973, "grad_norm": 1.1171875, "learning_rate": 0.0004318996650069747, "loss": 6.097, "mean_token_accuracy": 0.14693214744329453, "num_tokens": 53047195.0, "step": 24515 }, { "entropy": 6.420006895065308, "epoch": 2.623896409652737, "grad_norm": 1.2421875, "learning_rate": 0.0004318722590419672, "loss": 6.1675, "mean_token_accuracy": 0.13790112733840942, "num_tokens": 53058602.0, "step": 24520 }, { "entropy": 6.481870889663696, "epoch": 2.624431483760501, "grad_norm": 1.125, "learning_rate": 0.0004318448485472953, "loss": 6.133, "mean_token_accuracy": 0.14528400152921678, "num_tokens": 53070822.0, "step": 24525 }, { "entropy": 6.453919887542725, "epoch": 2.6249665578682646, "grad_norm": 1.75, "learning_rate": 0.00043181743352375035, "loss": 6.0908, "mean_token_accuracy": 0.14658737927675247, "num_tokens": 53082166.0, "step": 24530 }, { "entropy": 6.479091215133667, "epoch": 2.6255016319760287, "grad_norm": 1.0625, "learning_rate": 0.000431790013972124, "loss": 6.2179, "mean_token_accuracy": 0.143229378759861, "num_tokens": 53093688.0, "step": 24535 }, { "entropy": 6.460739183425903, "epoch": 2.6260367060837924, "grad_norm": 2.03125, "learning_rate": 0.0004317625898932082, "loss": 6.0775, "mean_token_accuracy": 0.148956398665905, "num_tokens": 53104793.0, "step": 24540 }, { "entropy": 6.434842872619629, "epoch": 2.6265717801915565, "grad_norm": 1.2265625, "learning_rate": 0.0004317351612877946, "loss": 6.0752, "mean_token_accuracy": 0.14351183474063872, "num_tokens": 53115835.0, "step": 24545 }, { "entropy": 6.37038779258728, "epoch": 2.6271068542993206, "grad_norm": 1.2578125, "learning_rate": 0.0004317077281566751, "loss": 5.9577, "mean_token_accuracy": 0.15568140149116516, "num_tokens": 53127153.0, "step": 24550 }, { "entropy": 6.372911405563355, "epoch": 2.627641928407084, "grad_norm": 1.0703125, "learning_rate": 0.00043168029050064214, "loss": 5.9788, "mean_token_accuracy": 0.15299040228128433, "num_tokens": 53137323.0, "step": 24555 }, { "entropy": 6.4208156108856205, "epoch": 2.6281770025148483, "grad_norm": 1.296875, "learning_rate": 0.00043165284832048773, "loss": 6.1423, "mean_token_accuracy": 0.14667749255895615, "num_tokens": 53146858.0, "step": 24560 }, { "entropy": 6.425225877761841, "epoch": 2.6287120766226124, "grad_norm": 1.203125, "learning_rate": 0.00043162540161700434, "loss": 6.1084, "mean_token_accuracy": 0.14319248422980307, "num_tokens": 53157225.0, "step": 24565 }, { "entropy": 6.424941825866699, "epoch": 2.629247150730376, "grad_norm": 1.21875, "learning_rate": 0.00043159795039098453, "loss": 6.063, "mean_token_accuracy": 0.1474204957485199, "num_tokens": 53167571.0, "step": 24570 }, { "entropy": 6.397244167327881, "epoch": 2.62978222483814, "grad_norm": 1.359375, "learning_rate": 0.0004315704946432209, "loss": 6.0289, "mean_token_accuracy": 0.15182553678750993, "num_tokens": 53178562.0, "step": 24575 }, { "entropy": 6.476341485977173, "epoch": 2.6303172989459043, "grad_norm": 1.25, "learning_rate": 0.00043154303437450617, "loss": 6.1639, "mean_token_accuracy": 0.14258697107434273, "num_tokens": 53188833.0, "step": 24580 }, { "entropy": 6.474404048919678, "epoch": 2.630852373053668, "grad_norm": 1.421875, "learning_rate": 0.00043151556958563337, "loss": 6.0815, "mean_token_accuracy": 0.15322111696004867, "num_tokens": 53199596.0, "step": 24585 }, { "entropy": 6.47436900138855, "epoch": 2.6313874471614316, "grad_norm": 1.6640625, "learning_rate": 0.0004314881002773955, "loss": 6.0773, "mean_token_accuracy": 0.15083299130201339, "num_tokens": 53209942.0, "step": 24590 }, { "entropy": 6.477980422973633, "epoch": 2.6319225212691957, "grad_norm": 1.140625, "learning_rate": 0.0004314606264505857, "loss": 6.1533, "mean_token_accuracy": 0.14410494416952133, "num_tokens": 53221546.0, "step": 24595 }, { "entropy": 6.475403738021851, "epoch": 2.63245759537696, "grad_norm": 1.203125, "learning_rate": 0.0004314331481059973, "loss": 6.1029, "mean_token_accuracy": 0.1430260181427002, "num_tokens": 53232343.0, "step": 24600 }, { "entropy": 6.409321403503418, "epoch": 2.6329926694847234, "grad_norm": 1.4609375, "learning_rate": 0.0004314056652444237, "loss": 6.0974, "mean_token_accuracy": 0.15831847935914994, "num_tokens": 53242820.0, "step": 24605 }, { "entropy": 6.507085609436035, "epoch": 2.6335277435924875, "grad_norm": 1.1875, "learning_rate": 0.00043137817786665863, "loss": 6.0829, "mean_token_accuracy": 0.14766844362020493, "num_tokens": 53253503.0, "step": 24610 }, { "entropy": 6.508805513381958, "epoch": 2.6340628177002516, "grad_norm": 1.2578125, "learning_rate": 0.00043135068597349545, "loss": 6.0755, "mean_token_accuracy": 0.15044575780630112, "num_tokens": 53264160.0, "step": 24615 }, { "entropy": 6.446940660476685, "epoch": 2.6345978918080153, "grad_norm": 1.28125, "learning_rate": 0.0004313231895657283, "loss": 6.0796, "mean_token_accuracy": 0.1428944207727909, "num_tokens": 53275002.0, "step": 24620 }, { "entropy": 6.383434438705445, "epoch": 2.6351329659157794, "grad_norm": 1.3828125, "learning_rate": 0.00043129568864415103, "loss": 5.9665, "mean_token_accuracy": 0.1554861694574356, "num_tokens": 53284216.0, "step": 24625 }, { "entropy": 6.431263828277588, "epoch": 2.6356680400235435, "grad_norm": 1.4140625, "learning_rate": 0.00043126818320955766, "loss": 5.9968, "mean_token_accuracy": 0.1596357226371765, "num_tokens": 53294277.0, "step": 24630 }, { "entropy": 6.410352087020874, "epoch": 2.636203114131307, "grad_norm": 1.3359375, "learning_rate": 0.0004312406732627425, "loss": 6.0504, "mean_token_accuracy": 0.14713098406791686, "num_tokens": 53304448.0, "step": 24635 }, { "entropy": 6.383740377426148, "epoch": 2.6367381882390712, "grad_norm": 1.1796875, "learning_rate": 0.00043121315880449983, "loss": 6.0372, "mean_token_accuracy": 0.14834167659282685, "num_tokens": 53315765.0, "step": 24640 }, { "entropy": 6.347890996932984, "epoch": 2.637273262346835, "grad_norm": 1.203125, "learning_rate": 0.00043118563983562415, "loss": 5.9345, "mean_token_accuracy": 0.15982358157634735, "num_tokens": 53326529.0, "step": 24645 }, { "entropy": 6.367116641998291, "epoch": 2.637808336454599, "grad_norm": 1.203125, "learning_rate": 0.00043115811635691006, "loss": 5.9236, "mean_token_accuracy": 0.15975846648216246, "num_tokens": 53336132.0, "step": 24650 }, { "entropy": 6.383596181869507, "epoch": 2.6383434105623627, "grad_norm": 1.3125, "learning_rate": 0.0004311305883691524, "loss": 6.0711, "mean_token_accuracy": 0.15277714729309083, "num_tokens": 53347284.0, "step": 24655 }, { "entropy": 6.443270826339722, "epoch": 2.6388784846701268, "grad_norm": 1.2109375, "learning_rate": 0.0004311030558731458, "loss": 6.0925, "mean_token_accuracy": 0.15340566188097, "num_tokens": 53357872.0, "step": 24660 }, { "entropy": 6.484456729888916, "epoch": 2.639413558777891, "grad_norm": 1.15625, "learning_rate": 0.00043107551886968545, "loss": 6.0668, "mean_token_accuracy": 0.14664531275629997, "num_tokens": 53370311.0, "step": 24665 }, { "entropy": 6.413418436050415, "epoch": 2.6399486328856545, "grad_norm": 1.1875, "learning_rate": 0.00043104797735956643, "loss": 5.9271, "mean_token_accuracy": 0.16085440367460252, "num_tokens": 53380320.0, "step": 24670 }, { "entropy": 6.411125373840332, "epoch": 2.6404837069934186, "grad_norm": 1.1484375, "learning_rate": 0.000431020431343584, "loss": 6.2001, "mean_token_accuracy": 0.14206002801656722, "num_tokens": 53391311.0, "step": 24675 }, { "entropy": 6.404000473022461, "epoch": 2.6410187811011827, "grad_norm": 1.375, "learning_rate": 0.0004309928808225335, "loss": 6.1327, "mean_token_accuracy": 0.14414913654327394, "num_tokens": 53402367.0, "step": 24680 }, { "entropy": 6.441148138046264, "epoch": 2.6415538552089464, "grad_norm": 1.421875, "learning_rate": 0.0004309653257972105, "loss": 6.0703, "mean_token_accuracy": 0.14555063843727112, "num_tokens": 53414253.0, "step": 24685 }, { "entropy": 6.493502807617188, "epoch": 2.6420889293167105, "grad_norm": 1.1796875, "learning_rate": 0.00043093776626841075, "loss": 6.0843, "mean_token_accuracy": 0.15417672991752623, "num_tokens": 53425727.0, "step": 24690 }, { "entropy": 6.439263868331909, "epoch": 2.6426240034244746, "grad_norm": 1.28125, "learning_rate": 0.00043091020223692974, "loss": 6.0923, "mean_token_accuracy": 0.14718570187687874, "num_tokens": 53435402.0, "step": 24695 }, { "entropy": 6.365416574478149, "epoch": 2.643159077532238, "grad_norm": 1.2734375, "learning_rate": 0.00043088263370356364, "loss": 6.0115, "mean_token_accuracy": 0.1540623649954796, "num_tokens": 53447421.0, "step": 24700 }, { "entropy": 6.426650619506836, "epoch": 2.643694151640002, "grad_norm": 1.140625, "learning_rate": 0.0004308550606691084, "loss": 5.9416, "mean_token_accuracy": 0.1605531767010689, "num_tokens": 53458346.0, "step": 24705 }, { "entropy": 6.4874035835266115, "epoch": 2.644229225747766, "grad_norm": 1.296875, "learning_rate": 0.0004308274831343601, "loss": 6.0939, "mean_token_accuracy": 0.14778290167450905, "num_tokens": 53469638.0, "step": 24710 }, { "entropy": 6.464153385162353, "epoch": 2.64476429985553, "grad_norm": 1.25, "learning_rate": 0.00043079990110011525, "loss": 6.1184, "mean_token_accuracy": 0.1428764671087265, "num_tokens": 53480645.0, "step": 24715 }, { "entropy": 6.435031175613403, "epoch": 2.6452993739632937, "grad_norm": 1.4609375, "learning_rate": 0.00043077231456717006, "loss": 6.0378, "mean_token_accuracy": 0.14761828482151032, "num_tokens": 53491958.0, "step": 24720 }, { "entropy": 6.392915153503418, "epoch": 2.645834448071058, "grad_norm": 1.2734375, "learning_rate": 0.00043074472353632124, "loss": 6.0321, "mean_token_accuracy": 0.14870360642671585, "num_tokens": 53502183.0, "step": 24725 }, { "entropy": 6.404493141174316, "epoch": 2.646369522178822, "grad_norm": 1.5234375, "learning_rate": 0.0004307171280083653, "loss": 6.0169, "mean_token_accuracy": 0.15042298138141633, "num_tokens": 53513373.0, "step": 24730 }, { "entropy": 6.382497024536133, "epoch": 2.6469045962865856, "grad_norm": 1.109375, "learning_rate": 0.0004306895279840992, "loss": 5.9469, "mean_token_accuracy": 0.15482517778873445, "num_tokens": 53523668.0, "step": 24735 }, { "entropy": 6.4751592636108395, "epoch": 2.6474396703943497, "grad_norm": 1.2890625, "learning_rate": 0.0004306619234643199, "loss": 6.089, "mean_token_accuracy": 0.1475205034017563, "num_tokens": 53535642.0, "step": 24740 }, { "entropy": 6.268040752410888, "epoch": 2.647974744502114, "grad_norm": 1.7421875, "learning_rate": 0.00043063431444982447, "loss": 5.8382, "mean_token_accuracy": 0.16326033398509027, "num_tokens": 53546192.0, "step": 24745 }, { "entropy": 6.401771163940429, "epoch": 2.6485098186098774, "grad_norm": 1.65625, "learning_rate": 0.00043060670094141005, "loss": 6.0694, "mean_token_accuracy": 0.15051522105932236, "num_tokens": 53557375.0, "step": 24750 }, { "entropy": 6.510762023925781, "epoch": 2.6490448927176415, "grad_norm": 1.25, "learning_rate": 0.00043057908293987404, "loss": 6.1119, "mean_token_accuracy": 0.14500435888767244, "num_tokens": 53568434.0, "step": 24755 }, { "entropy": 6.46000919342041, "epoch": 2.649579966825405, "grad_norm": 1.21875, "learning_rate": 0.0004305514604460138, "loss": 6.0497, "mean_token_accuracy": 0.1520714595913887, "num_tokens": 53579095.0, "step": 24760 }, { "entropy": 6.420160961151123, "epoch": 2.6501150409331693, "grad_norm": 1.28125, "learning_rate": 0.000430523833460627, "loss": 6.0498, "mean_token_accuracy": 0.14869655817747116, "num_tokens": 53590082.0, "step": 24765 }, { "entropy": 6.45833101272583, "epoch": 2.650650115040933, "grad_norm": 1.203125, "learning_rate": 0.00043049620198451147, "loss": 6.1186, "mean_token_accuracy": 0.14549318552017212, "num_tokens": 53600421.0, "step": 24770 }, { "entropy": 6.349174451828003, "epoch": 2.651185189148697, "grad_norm": 1.2109375, "learning_rate": 0.00043046856601846483, "loss": 5.9833, "mean_token_accuracy": 0.16112893372774123, "num_tokens": 53610994.0, "step": 24775 }, { "entropy": 6.464407253265381, "epoch": 2.651720263256461, "grad_norm": 1.1796875, "learning_rate": 0.00043044092556328517, "loss": 6.0772, "mean_token_accuracy": 0.1479618787765503, "num_tokens": 53622205.0, "step": 24780 }, { "entropy": 6.405384492874146, "epoch": 2.652255337364225, "grad_norm": 1.1875, "learning_rate": 0.00043041328061977073, "loss": 6.0266, "mean_token_accuracy": 0.15121926069259645, "num_tokens": 53632440.0, "step": 24785 }, { "entropy": 6.376495122909546, "epoch": 2.652790411471989, "grad_norm": 1.21875, "learning_rate": 0.00043038563118871965, "loss": 6.0356, "mean_token_accuracy": 0.15253866016864776, "num_tokens": 53642443.0, "step": 24790 }, { "entropy": 6.528036117553711, "epoch": 2.653325485579753, "grad_norm": 1.34375, "learning_rate": 0.0004303579772709303, "loss": 6.208, "mean_token_accuracy": 0.1376488521695137, "num_tokens": 53653671.0, "step": 24795 }, { "entropy": 6.458281230926514, "epoch": 2.6538605596875167, "grad_norm": 1.28125, "learning_rate": 0.00043033031886720107, "loss": 5.9964, "mean_token_accuracy": 0.15538475215435027, "num_tokens": 53664874.0, "step": 24800 }, { "entropy": 6.434471368789673, "epoch": 2.6543956337952808, "grad_norm": 1.171875, "learning_rate": 0.0004303026559783309, "loss": 6.0817, "mean_token_accuracy": 0.14613264203071594, "num_tokens": 53675623.0, "step": 24805 }, { "entropy": 6.422491359710693, "epoch": 2.6549307079030444, "grad_norm": 1.078125, "learning_rate": 0.0004302749886051182, "loss": 6.0629, "mean_token_accuracy": 0.14470580369234085, "num_tokens": 53685754.0, "step": 24810 }, { "entropy": 6.373309707641601, "epoch": 2.6554657820108085, "grad_norm": 1.4140625, "learning_rate": 0.0004302473167483621, "loss": 5.9771, "mean_token_accuracy": 0.15031711682677268, "num_tokens": 53696925.0, "step": 24815 }, { "entropy": 6.441711902618408, "epoch": 2.656000856118572, "grad_norm": 1.2734375, "learning_rate": 0.00043021964040886154, "loss": 6.0229, "mean_token_accuracy": 0.15357198864221572, "num_tokens": 53708046.0, "step": 24820 }, { "entropy": 6.334389972686767, "epoch": 2.6565359302263363, "grad_norm": 1.15625, "learning_rate": 0.0004301919595874156, "loss": 5.9309, "mean_token_accuracy": 0.1596555545926094, "num_tokens": 53719179.0, "step": 24825 }, { "entropy": 6.404006052017212, "epoch": 2.6570710043341004, "grad_norm": 1.21875, "learning_rate": 0.0004301642742848237, "loss": 6.0886, "mean_token_accuracy": 0.1488211527466774, "num_tokens": 53731523.0, "step": 24830 }, { "entropy": 6.4574353218078615, "epoch": 2.657606078441864, "grad_norm": 1.203125, "learning_rate": 0.0004301365845018853, "loss": 6.1935, "mean_token_accuracy": 0.13889062777161598, "num_tokens": 53742072.0, "step": 24835 }, { "entropy": 6.485256576538086, "epoch": 2.658141152549628, "grad_norm": 1.09375, "learning_rate": 0.0004301088902393996, "loss": 6.1156, "mean_token_accuracy": 0.14621224775910377, "num_tokens": 53754695.0, "step": 24840 }, { "entropy": 6.4294593811035154, "epoch": 2.6586762266573922, "grad_norm": 1.25, "learning_rate": 0.0004300811914981666, "loss": 5.9841, "mean_token_accuracy": 0.1572926238179207, "num_tokens": 53764587.0, "step": 24845 }, { "entropy": 6.477381372451783, "epoch": 2.659211300765156, "grad_norm": 1.2265625, "learning_rate": 0.000430053488278986, "loss": 6.1563, "mean_token_accuracy": 0.1446160852909088, "num_tokens": 53775609.0, "step": 24850 }, { "entropy": 6.383706712722779, "epoch": 2.65974637487292, "grad_norm": 1.34375, "learning_rate": 0.00043002578058265776, "loss": 6.0544, "mean_token_accuracy": 0.14788891226053238, "num_tokens": 53786495.0, "step": 24855 }, { "entropy": 6.42982931137085, "epoch": 2.660281448980684, "grad_norm": 1.2421875, "learning_rate": 0.0004299980684099818, "loss": 6.0484, "mean_token_accuracy": 0.1474327877163887, "num_tokens": 53797058.0, "step": 24860 }, { "entropy": 6.492137670516968, "epoch": 2.6608165230884477, "grad_norm": 1.28125, "learning_rate": 0.00042997035176175834, "loss": 6.0938, "mean_token_accuracy": 0.14735824167728423, "num_tokens": 53808148.0, "step": 24865 }, { "entropy": 6.425716733932495, "epoch": 2.661351597196212, "grad_norm": 1.4453125, "learning_rate": 0.0004299426306387879, "loss": 5.9765, "mean_token_accuracy": 0.16062136590480805, "num_tokens": 53818375.0, "step": 24870 }, { "entropy": 6.464401626586914, "epoch": 2.6618866713039755, "grad_norm": 1.4375, "learning_rate": 0.0004299149050418707, "loss": 6.1371, "mean_token_accuracy": 0.14501127004623413, "num_tokens": 53831273.0, "step": 24875 }, { "entropy": 6.367207431793213, "epoch": 2.6624217454117396, "grad_norm": 1.5859375, "learning_rate": 0.00042988717497180733, "loss": 6.0212, "mean_token_accuracy": 0.1531870424747467, "num_tokens": 53842492.0, "step": 24880 }, { "entropy": 6.438853931427002, "epoch": 2.6629568195195032, "grad_norm": 1.140625, "learning_rate": 0.00042985944042939867, "loss": 6.0598, "mean_token_accuracy": 0.14983204305171965, "num_tokens": 53853017.0, "step": 24885 }, { "entropy": 6.498943614959717, "epoch": 2.6634918936272673, "grad_norm": 1.3515625, "learning_rate": 0.00042983170141544535, "loss": 6.148, "mean_token_accuracy": 0.1471282422542572, "num_tokens": 53863606.0, "step": 24890 }, { "entropy": 6.376990270614624, "epoch": 2.6640269677350314, "grad_norm": 1.2265625, "learning_rate": 0.0004298039579307484, "loss": 6.0794, "mean_token_accuracy": 0.15422668308019638, "num_tokens": 53874689.0, "step": 24895 }, { "entropy": 6.489285039901733, "epoch": 2.664562041842795, "grad_norm": 1.375, "learning_rate": 0.000429776209976109, "loss": 6.0263, "mean_token_accuracy": 0.15514324307441713, "num_tokens": 53885247.0, "step": 24900 }, { "entropy": 6.432543611526489, "epoch": 2.665097115950559, "grad_norm": 1.234375, "learning_rate": 0.0004297484575523282, "loss": 6.1179, "mean_token_accuracy": 0.14705170542001725, "num_tokens": 53896829.0, "step": 24905 }, { "entropy": 6.4299815654754635, "epoch": 2.6656321900583233, "grad_norm": 1.234375, "learning_rate": 0.00042972070066020745, "loss": 6.0019, "mean_token_accuracy": 0.15523212403059006, "num_tokens": 53907236.0, "step": 24910 }, { "entropy": 6.46129002571106, "epoch": 2.666167264166087, "grad_norm": 1.734375, "learning_rate": 0.0004296929393005482, "loss": 6.0806, "mean_token_accuracy": 0.147062748670578, "num_tokens": 53918420.0, "step": 24915 }, { "entropy": 6.35111141204834, "epoch": 2.666702338273851, "grad_norm": 1.1875, "learning_rate": 0.0004296651734741521, "loss": 6.0094, "mean_token_accuracy": 0.15533339977264404, "num_tokens": 53928949.0, "step": 24920 }, { "entropy": 6.429946231842041, "epoch": 2.6672374123816147, "grad_norm": 1.1640625, "learning_rate": 0.00042963740318182085, "loss": 6.0974, "mean_token_accuracy": 0.1437372788786888, "num_tokens": 53939332.0, "step": 24925 }, { "entropy": 6.449320459365845, "epoch": 2.667772486489379, "grad_norm": 1.3359375, "learning_rate": 0.0004296096284243563, "loss": 6.0527, "mean_token_accuracy": 0.14638348892331124, "num_tokens": 53950703.0, "step": 24930 }, { "entropy": 6.524592351913452, "epoch": 2.6683075605971425, "grad_norm": 1.25, "learning_rate": 0.0004295818492025605, "loss": 6.1493, "mean_token_accuracy": 0.14144029915332795, "num_tokens": 53964061.0, "step": 24935 }, { "entropy": 6.435032606124878, "epoch": 2.6688426347049066, "grad_norm": 1.0859375, "learning_rate": 0.0004295540655172355, "loss": 6.0897, "mean_token_accuracy": 0.15345773547887803, "num_tokens": 53974980.0, "step": 24940 }, { "entropy": 6.350369501113891, "epoch": 2.6693777088126707, "grad_norm": 1.2421875, "learning_rate": 0.0004295262773691835, "loss": 5.9858, "mean_token_accuracy": 0.15522173494100572, "num_tokens": 53985437.0, "step": 24945 }, { "entropy": 6.410931539535523, "epoch": 2.6699127829204343, "grad_norm": 1.25, "learning_rate": 0.00042949848475920706, "loss": 6.0425, "mean_token_accuracy": 0.14897070825099945, "num_tokens": 53996952.0, "step": 24950 }, { "entropy": 6.481980085372925, "epoch": 2.6704478570281984, "grad_norm": 1.453125, "learning_rate": 0.0004294706876881085, "loss": 6.0386, "mean_token_accuracy": 0.15164224207401275, "num_tokens": 54007727.0, "step": 24955 }, { "entropy": 6.351395225524902, "epoch": 2.6709829311359625, "grad_norm": 1.390625, "learning_rate": 0.00042944288615669055, "loss": 5.9179, "mean_token_accuracy": 0.16518451124429703, "num_tokens": 54018275.0, "step": 24960 }, { "entropy": 6.390604639053345, "epoch": 2.671518005243726, "grad_norm": 1.2578125, "learning_rate": 0.00042941508016575597, "loss": 6.161, "mean_token_accuracy": 0.14320803731679915, "num_tokens": 54030376.0, "step": 24965 }, { "entropy": 6.420176219940186, "epoch": 2.6720530793514903, "grad_norm": 1.1953125, "learning_rate": 0.0004293872697161077, "loss": 6.0428, "mean_token_accuracy": 0.14821335524320603, "num_tokens": 54041487.0, "step": 24970 }, { "entropy": 6.461021041870117, "epoch": 2.6725881534592544, "grad_norm": 1.2109375, "learning_rate": 0.00042935945480854866, "loss": 6.0036, "mean_token_accuracy": 0.1632443353533745, "num_tokens": 54051273.0, "step": 24975 }, { "entropy": 6.391329097747803, "epoch": 2.673123227567018, "grad_norm": 1.1015625, "learning_rate": 0.0004293316354438821, "loss": 5.9997, "mean_token_accuracy": 0.15727767050266267, "num_tokens": 54061910.0, "step": 24980 }, { "entropy": 6.446732759475708, "epoch": 2.6736583016747817, "grad_norm": 1.171875, "learning_rate": 0.0004293038116229112, "loss": 6.112, "mean_token_accuracy": 0.14669544547796248, "num_tokens": 54072980.0, "step": 24985 }, { "entropy": 6.392126369476318, "epoch": 2.674193375782546, "grad_norm": 1.1328125, "learning_rate": 0.0004292759833464394, "loss": 6.0229, "mean_token_accuracy": 0.1577082723379135, "num_tokens": 54083027.0, "step": 24990 }, { "entropy": 6.342571830749511, "epoch": 2.67472844989031, "grad_norm": 1.3359375, "learning_rate": 0.00042924815061527033, "loss": 5.9767, "mean_token_accuracy": 0.14960994720458984, "num_tokens": 54094068.0, "step": 24995 }, { "entropy": 6.419144201278686, "epoch": 2.6752635239980735, "grad_norm": 1.234375, "learning_rate": 0.0004292203134302076, "loss": 6.0451, "mean_token_accuracy": 0.15052372217178345, "num_tokens": 54104683.0, "step": 25000 }, { "entropy": 6.448585128784179, "epoch": 2.6757985981058376, "grad_norm": 1.1953125, "learning_rate": 0.000429192471792055, "loss": 6.0159, "mean_token_accuracy": 0.14589312821626663, "num_tokens": 54115357.0, "step": 25005 }, { "entropy": 6.480725955963135, "epoch": 2.6763336722136017, "grad_norm": 1.296875, "learning_rate": 0.0004291646257016163, "loss": 6.0545, "mean_token_accuracy": 0.14583337679505348, "num_tokens": 54126410.0, "step": 25010 }, { "entropy": 6.371913909912109, "epoch": 2.6768687463213654, "grad_norm": 1.9609375, "learning_rate": 0.00042913677515969586, "loss": 5.9888, "mean_token_accuracy": 0.15447857975959778, "num_tokens": 54137279.0, "step": 25015 }, { "entropy": 6.391150856018067, "epoch": 2.6774038204291295, "grad_norm": 1.265625, "learning_rate": 0.0004291089201670976, "loss": 6.0744, "mean_token_accuracy": 0.15128765851259232, "num_tokens": 54146521.0, "step": 25020 }, { "entropy": 6.489438486099243, "epoch": 2.6779388945368936, "grad_norm": 1.203125, "learning_rate": 0.00042908106072462595, "loss": 6.1079, "mean_token_accuracy": 0.1405947297811508, "num_tokens": 54157277.0, "step": 25025 }, { "entropy": 6.485062789916992, "epoch": 2.6784739686446573, "grad_norm": 1.2265625, "learning_rate": 0.0004290531968330853, "loss": 6.1441, "mean_token_accuracy": 0.1452994555234909, "num_tokens": 54168078.0, "step": 25030 }, { "entropy": 6.527255439758301, "epoch": 2.6790090427524214, "grad_norm": 1.125, "learning_rate": 0.0004290253284932803, "loss": 6.1064, "mean_token_accuracy": 0.1496105045080185, "num_tokens": 54178567.0, "step": 25035 }, { "entropy": 6.407850360870361, "epoch": 2.679544116860185, "grad_norm": 1.5078125, "learning_rate": 0.0004289974557060155, "loss": 6.0353, "mean_token_accuracy": 0.14675920233130454, "num_tokens": 54189485.0, "step": 25040 }, { "entropy": 6.511658954620361, "epoch": 2.680079190967949, "grad_norm": 1.53125, "learning_rate": 0.00042896957847209593, "loss": 6.1334, "mean_token_accuracy": 0.14646179378032684, "num_tokens": 54199351.0, "step": 25045 }, { "entropy": 6.459256601333618, "epoch": 2.6806142650757128, "grad_norm": 1.171875, "learning_rate": 0.0004289416967923264, "loss": 6.0697, "mean_token_accuracy": 0.14572961181402205, "num_tokens": 54209001.0, "step": 25050 }, { "entropy": 6.423435878753662, "epoch": 2.681149339183477, "grad_norm": 1.46875, "learning_rate": 0.00042891381066751186, "loss": 6.1207, "mean_token_accuracy": 0.14531078115105628, "num_tokens": 54219783.0, "step": 25055 }, { "entropy": 6.477549695968628, "epoch": 2.681684413291241, "grad_norm": 1.203125, "learning_rate": 0.00042888592009845776, "loss": 6.0796, "mean_token_accuracy": 0.1480795480310917, "num_tokens": 54231337.0, "step": 25060 }, { "entropy": 6.467353487014771, "epoch": 2.6822194873990046, "grad_norm": 1.28125, "learning_rate": 0.0004288580250859694, "loss": 6.081, "mean_token_accuracy": 0.15658991187810897, "num_tokens": 54241650.0, "step": 25065 }, { "entropy": 6.433385515213013, "epoch": 2.6827545615067687, "grad_norm": 1.140625, "learning_rate": 0.0004288301256308521, "loss": 6.0851, "mean_token_accuracy": 0.1416018508374691, "num_tokens": 54252223.0, "step": 25070 }, { "entropy": 6.455324649810791, "epoch": 2.683289635614533, "grad_norm": 1.1484375, "learning_rate": 0.00042880222173391155, "loss": 6.0149, "mean_token_accuracy": 0.15223479270935059, "num_tokens": 54262469.0, "step": 25075 }, { "entropy": 6.428207540512085, "epoch": 2.6838247097222965, "grad_norm": 1.1796875, "learning_rate": 0.0004287743133959535, "loss": 6.0514, "mean_token_accuracy": 0.14683943539857863, "num_tokens": 54272885.0, "step": 25080 }, { "entropy": 6.396878862380982, "epoch": 2.6843597838300606, "grad_norm": 1.40625, "learning_rate": 0.0004287464006177837, "loss": 6.0714, "mean_token_accuracy": 0.14735295325517656, "num_tokens": 54283327.0, "step": 25085 }, { "entropy": 6.414928197860718, "epoch": 2.6848948579378242, "grad_norm": 1.15625, "learning_rate": 0.0004287184834002082, "loss": 6.0123, "mean_token_accuracy": 0.15037444978952408, "num_tokens": 54294761.0, "step": 25090 }, { "entropy": 6.527772426605225, "epoch": 2.6854299320455883, "grad_norm": 1.390625, "learning_rate": 0.00042869056174403303, "loss": 6.0762, "mean_token_accuracy": 0.1509876862168312, "num_tokens": 54305205.0, "step": 25095 }, { "entropy": 6.475588035583496, "epoch": 2.685965006153352, "grad_norm": 1.203125, "learning_rate": 0.0004286626356500647, "loss": 6.0723, "mean_token_accuracy": 0.15058556497097014, "num_tokens": 54315902.0, "step": 25100 }, { "entropy": 6.434620761871338, "epoch": 2.686500080261116, "grad_norm": 1.109375, "learning_rate": 0.0004286347051191091, "loss": 6.0781, "mean_token_accuracy": 0.15154436528682708, "num_tokens": 54327345.0, "step": 25105 }, { "entropy": 6.479596376419067, "epoch": 2.68703515436888, "grad_norm": 1.3203125, "learning_rate": 0.0004286067701519731, "loss": 6.1267, "mean_token_accuracy": 0.14832493662834167, "num_tokens": 54337548.0, "step": 25110 }, { "entropy": 6.468802404403687, "epoch": 2.687570228476644, "grad_norm": 1.2421875, "learning_rate": 0.00042857883074946324, "loss": 6.1058, "mean_token_accuracy": 0.1414439335465431, "num_tokens": 54348384.0, "step": 25115 }, { "entropy": 6.47977991104126, "epoch": 2.688105302584408, "grad_norm": 1.453125, "learning_rate": 0.0004285508869123862, "loss": 6.0501, "mean_token_accuracy": 0.14674096405506135, "num_tokens": 54358245.0, "step": 25120 }, { "entropy": 6.33971757888794, "epoch": 2.688640376692172, "grad_norm": 1.2109375, "learning_rate": 0.00042852293864154885, "loss": 6.0126, "mean_token_accuracy": 0.14785065352916718, "num_tokens": 54370421.0, "step": 25125 }, { "entropy": 6.456410455703735, "epoch": 2.6891754507999357, "grad_norm": 1.1328125, "learning_rate": 0.00042849498593775827, "loss": 5.9901, "mean_token_accuracy": 0.15010035261511803, "num_tokens": 54381368.0, "step": 25130 }, { "entropy": 6.464001274108886, "epoch": 2.6897105249077, "grad_norm": 1.1953125, "learning_rate": 0.00042846702880182147, "loss": 6.0585, "mean_token_accuracy": 0.1457326479256153, "num_tokens": 54392226.0, "step": 25135 }, { "entropy": 6.420953226089478, "epoch": 2.690245599015464, "grad_norm": 1.2578125, "learning_rate": 0.0004284390672345458, "loss": 6.0621, "mean_token_accuracy": 0.14454921185970307, "num_tokens": 54402295.0, "step": 25140 }, { "entropy": 6.513278436660767, "epoch": 2.6907806731232276, "grad_norm": 1.34375, "learning_rate": 0.0004284111012367387, "loss": 6.1109, "mean_token_accuracy": 0.1444273203611374, "num_tokens": 54413808.0, "step": 25145 }, { "entropy": 6.480533790588379, "epoch": 2.6913157472309917, "grad_norm": 1.25, "learning_rate": 0.00042838313080920755, "loss": 6.0945, "mean_token_accuracy": 0.14802695363759993, "num_tokens": 54425048.0, "step": 25150 }, { "entropy": 6.487511825561524, "epoch": 2.6918508213387553, "grad_norm": 1.171875, "learning_rate": 0.00042835515595276, "loss": 6.1262, "mean_token_accuracy": 0.14218694269657134, "num_tokens": 54435908.0, "step": 25155 }, { "entropy": 6.376295328140259, "epoch": 2.6923858954465194, "grad_norm": 1.3359375, "learning_rate": 0.0004283271766682039, "loss": 6.0451, "mean_token_accuracy": 0.15328938513994217, "num_tokens": 54447594.0, "step": 25160 }, { "entropy": 6.357793855667114, "epoch": 2.692920969554283, "grad_norm": 1.1328125, "learning_rate": 0.0004282991929563471, "loss": 5.992, "mean_token_accuracy": 0.1499350219964981, "num_tokens": 54458918.0, "step": 25165 }, { "entropy": 6.3818987846374515, "epoch": 2.693456043662047, "grad_norm": 1.21875, "learning_rate": 0.0004282712048179977, "loss": 5.9895, "mean_token_accuracy": 0.15822725892066955, "num_tokens": 54469423.0, "step": 25170 }, { "entropy": 6.473826122283936, "epoch": 2.6939911177698113, "grad_norm": 1.4765625, "learning_rate": 0.0004282432122539638, "loss": 6.1386, "mean_token_accuracy": 0.14685898870229722, "num_tokens": 54481895.0, "step": 25175 }, { "entropy": 6.487961006164551, "epoch": 2.694526191877575, "grad_norm": 1.203125, "learning_rate": 0.00042821521526505363, "loss": 6.0315, "mean_token_accuracy": 0.1499170407652855, "num_tokens": 54492233.0, "step": 25180 }, { "entropy": 6.439240312576294, "epoch": 2.695061265985339, "grad_norm": 1.1796875, "learning_rate": 0.0004281872138520757, "loss": 6.0055, "mean_token_accuracy": 0.15573531836271287, "num_tokens": 54502366.0, "step": 25185 }, { "entropy": 6.343453073501587, "epoch": 2.695596340093103, "grad_norm": 1.328125, "learning_rate": 0.00042815920801583845, "loss": 6.0539, "mean_token_accuracy": 0.15038024187088012, "num_tokens": 54512565.0, "step": 25190 }, { "entropy": 6.405899429321289, "epoch": 2.6961314142008668, "grad_norm": 1.3046875, "learning_rate": 0.00042813119775715066, "loss": 6.0446, "mean_token_accuracy": 0.15058374032378197, "num_tokens": 54522999.0, "step": 25195 }, { "entropy": 6.421649551391601, "epoch": 2.696666488308631, "grad_norm": 1.328125, "learning_rate": 0.00042810318307682095, "loss": 6.0422, "mean_token_accuracy": 0.14846908748149873, "num_tokens": 54533776.0, "step": 25200 }, { "entropy": 6.406240320205688, "epoch": 2.6972015624163945, "grad_norm": 1.21875, "learning_rate": 0.00042807516397565845, "loss": 6.0495, "mean_token_accuracy": 0.14737222194671631, "num_tokens": 54544972.0, "step": 25205 }, { "entropy": 6.41619553565979, "epoch": 2.6977366365241586, "grad_norm": 1.359375, "learning_rate": 0.0004280471404544721, "loss": 6.0431, "mean_token_accuracy": 0.14818297401070596, "num_tokens": 54556034.0, "step": 25210 }, { "entropy": 6.489672470092773, "epoch": 2.6982717106319223, "grad_norm": 1.1875, "learning_rate": 0.00042801911251407095, "loss": 5.9894, "mean_token_accuracy": 0.15989175885915757, "num_tokens": 54566662.0, "step": 25215 }, { "entropy": 6.464313793182373, "epoch": 2.6988067847396864, "grad_norm": 1.40625, "learning_rate": 0.0004279910801552645, "loss": 6.0637, "mean_token_accuracy": 0.14871048629283906, "num_tokens": 54578889.0, "step": 25220 }, { "entropy": 6.447121953964233, "epoch": 2.6993418588474505, "grad_norm": 1.2734375, "learning_rate": 0.0004279630433788621, "loss": 6.126, "mean_token_accuracy": 0.1456712655723095, "num_tokens": 54590456.0, "step": 25225 }, { "entropy": 6.448766422271729, "epoch": 2.699876932955214, "grad_norm": 1.1015625, "learning_rate": 0.0004279350021856734, "loss": 6.107, "mean_token_accuracy": 0.14201193749904634, "num_tokens": 54602327.0, "step": 25230 }, { "entropy": 6.521866321563721, "epoch": 2.7004120070629782, "grad_norm": 1.140625, "learning_rate": 0.00042790695657650787, "loss": 6.0531, "mean_token_accuracy": 0.1502055585384369, "num_tokens": 54612999.0, "step": 25235 }, { "entropy": 6.422251272201538, "epoch": 2.7009470811707423, "grad_norm": 1.2265625, "learning_rate": 0.00042787890655217553, "loss": 6.0265, "mean_token_accuracy": 0.14514252096414565, "num_tokens": 54624332.0, "step": 25240 }, { "entropy": 6.35856351852417, "epoch": 2.701482155278506, "grad_norm": 1.4453125, "learning_rate": 0.00042785085211348624, "loss": 6.0085, "mean_token_accuracy": 0.15130027532577514, "num_tokens": 54635679.0, "step": 25245 }, { "entropy": 6.424386024475098, "epoch": 2.70201722938627, "grad_norm": 1.1953125, "learning_rate": 0.00042782279326125005, "loss": 6.0455, "mean_token_accuracy": 0.15152093768119812, "num_tokens": 54646344.0, "step": 25250 }, { "entropy": 6.485493278503418, "epoch": 2.702552303494034, "grad_norm": 2.09375, "learning_rate": 0.00042779472999627724, "loss": 6.0933, "mean_token_accuracy": 0.1456468641757965, "num_tokens": 54657395.0, "step": 25255 }, { "entropy": 6.409106349945068, "epoch": 2.703087377601798, "grad_norm": 1.140625, "learning_rate": 0.000427766662319378, "loss": 6.0469, "mean_token_accuracy": 0.14813070893287658, "num_tokens": 54668755.0, "step": 25260 }, { "entropy": 6.453620576858521, "epoch": 2.7036224517095615, "grad_norm": 1.09375, "learning_rate": 0.00042773859023136285, "loss": 6.0406, "mean_token_accuracy": 0.14971143901348113, "num_tokens": 54679170.0, "step": 25265 }, { "entropy": 6.405198049545288, "epoch": 2.7041575258173256, "grad_norm": 1.3828125, "learning_rate": 0.0004277105137330424, "loss": 6.0492, "mean_token_accuracy": 0.15056706219911575, "num_tokens": 54688728.0, "step": 25270 }, { "entropy": 6.376384544372558, "epoch": 2.7046925999250897, "grad_norm": 1.2109375, "learning_rate": 0.00042768243282522735, "loss": 6.0513, "mean_token_accuracy": 0.15315230637788774, "num_tokens": 54700236.0, "step": 25275 }, { "entropy": 6.428701400756836, "epoch": 2.7052276740328534, "grad_norm": 1.171875, "learning_rate": 0.00042765434750872847, "loss": 6.0021, "mean_token_accuracy": 0.15179484635591506, "num_tokens": 54710586.0, "step": 25280 }, { "entropy": 6.43684573173523, "epoch": 2.7057627481406175, "grad_norm": 1.203125, "learning_rate": 0.00042762625778435676, "loss": 6.0005, "mean_token_accuracy": 0.15380548536777497, "num_tokens": 54721159.0, "step": 25285 }, { "entropy": 6.433546876907348, "epoch": 2.7062978222483816, "grad_norm": 1.25, "learning_rate": 0.0004275981636529233, "loss": 6.0788, "mean_token_accuracy": 0.15126713663339614, "num_tokens": 54731593.0, "step": 25290 }, { "entropy": 6.4233095169067385, "epoch": 2.706832896356145, "grad_norm": 1.203125, "learning_rate": 0.0004275700651152393, "loss": 5.9808, "mean_token_accuracy": 0.15337316542863846, "num_tokens": 54742890.0, "step": 25295 }, { "entropy": 6.359569358825683, "epoch": 2.7073679704639093, "grad_norm": 1.2265625, "learning_rate": 0.00042754196217211616, "loss": 6.0666, "mean_token_accuracy": 0.15261325538158416, "num_tokens": 54753344.0, "step": 25300 }, { "entropy": 6.481750774383545, "epoch": 2.7079030445716734, "grad_norm": 1.34375, "learning_rate": 0.00042751385482436523, "loss": 6.1473, "mean_token_accuracy": 0.14214920699596406, "num_tokens": 54763157.0, "step": 25305 }, { "entropy": 6.480219459533691, "epoch": 2.708438118679437, "grad_norm": 1.2265625, "learning_rate": 0.00042748574307279824, "loss": 6.0168, "mean_token_accuracy": 0.14984458982944487, "num_tokens": 54772515.0, "step": 25310 }, { "entropy": 6.3885527610778805, "epoch": 2.708973192787201, "grad_norm": 1.1328125, "learning_rate": 0.0004274576269182268, "loss": 5.9956, "mean_token_accuracy": 0.14940545037388803, "num_tokens": 54783178.0, "step": 25315 }, { "entropy": 6.457936239242554, "epoch": 2.709508266894965, "grad_norm": 1.109375, "learning_rate": 0.0004274295063614629, "loss": 6.1259, "mean_token_accuracy": 0.14772203788161278, "num_tokens": 54794709.0, "step": 25320 }, { "entropy": 6.480543708801269, "epoch": 2.710043341002729, "grad_norm": 1.3046875, "learning_rate": 0.0004274013814033184, "loss": 6.0533, "mean_token_accuracy": 0.15019096583127975, "num_tokens": 54804821.0, "step": 25325 }, { "entropy": 6.459848165512085, "epoch": 2.7105784151104926, "grad_norm": 1.25, "learning_rate": 0.00042737325204460523, "loss": 6.1038, "mean_token_accuracy": 0.1405377745628357, "num_tokens": 54815291.0, "step": 25330 }, { "entropy": 6.268032884597778, "epoch": 2.7111134892182567, "grad_norm": 1.578125, "learning_rate": 0.000427345118286136, "loss": 5.8781, "mean_token_accuracy": 0.16145387887954712, "num_tokens": 54826891.0, "step": 25335 }, { "entropy": 6.441977500915527, "epoch": 2.7116485633260208, "grad_norm": 1.1328125, "learning_rate": 0.0004273169801287228, "loss": 6.0936, "mean_token_accuracy": 0.14884840250015258, "num_tokens": 54837545.0, "step": 25340 }, { "entropy": 6.501547765731812, "epoch": 2.7121836374337844, "grad_norm": 1.109375, "learning_rate": 0.00042728883757317825, "loss": 6.172, "mean_token_accuracy": 0.13928472399711608, "num_tokens": 54848028.0, "step": 25345 }, { "entropy": 6.47163143157959, "epoch": 2.7127187115415485, "grad_norm": 0.9921875, "learning_rate": 0.00042726069062031495, "loss": 6.1053, "mean_token_accuracy": 0.14257197231054305, "num_tokens": 54858679.0, "step": 25350 }, { "entropy": 6.447218370437622, "epoch": 2.7132537856493126, "grad_norm": 1.1640625, "learning_rate": 0.00042723253927094565, "loss": 5.988, "mean_token_accuracy": 0.15201518535614014, "num_tokens": 54870892.0, "step": 25355 }, { "entropy": 6.411854791641235, "epoch": 2.7137888597570763, "grad_norm": 1.09375, "learning_rate": 0.000427204383525883, "loss": 5.962, "mean_token_accuracy": 0.15155672430992126, "num_tokens": 54881131.0, "step": 25360 }, { "entropy": 6.389288377761841, "epoch": 2.7143239338648404, "grad_norm": 1.2421875, "learning_rate": 0.0004271762233859403, "loss": 6.0734, "mean_token_accuracy": 0.1513580046594143, "num_tokens": 54891532.0, "step": 25365 }, { "entropy": 6.3969708442687985, "epoch": 2.714859007972604, "grad_norm": 1.1640625, "learning_rate": 0.00042714805885193046, "loss": 6.0154, "mean_token_accuracy": 0.15483452528715133, "num_tokens": 54902945.0, "step": 25370 }, { "entropy": 6.416445636749268, "epoch": 2.715394082080368, "grad_norm": 1.1640625, "learning_rate": 0.00042711988992466684, "loss": 6.0609, "mean_token_accuracy": 0.1438060313463211, "num_tokens": 54913943.0, "step": 25375 }, { "entropy": 6.459086894989014, "epoch": 2.715929156188132, "grad_norm": 1.1484375, "learning_rate": 0.00042709171660496275, "loss": 6.1081, "mean_token_accuracy": 0.15137378722429276, "num_tokens": 54924241.0, "step": 25380 }, { "entropy": 6.42902946472168, "epoch": 2.716464230295896, "grad_norm": 1.4140625, "learning_rate": 0.0004270635388936317, "loss": 6.0353, "mean_token_accuracy": 0.15176012068986894, "num_tokens": 54934083.0, "step": 25385 }, { "entropy": 6.4336676597595215, "epoch": 2.71699930440366, "grad_norm": 1.1484375, "learning_rate": 0.00042703535679148734, "loss": 6.1263, "mean_token_accuracy": 0.14425669983029366, "num_tokens": 54944928.0, "step": 25390 }, { "entropy": 6.357444190979004, "epoch": 2.7175343785114237, "grad_norm": 1.21875, "learning_rate": 0.00042700717029934345, "loss": 5.909, "mean_token_accuracy": 0.15729526579380035, "num_tokens": 54955715.0, "step": 25395 }, { "entropy": 6.38131160736084, "epoch": 2.7180694526191878, "grad_norm": 1.2109375, "learning_rate": 0.0004269789794180139, "loss": 6.109, "mean_token_accuracy": 0.14945384711027146, "num_tokens": 54966149.0, "step": 25400 }, { "entropy": 6.423126935958862, "epoch": 2.718604526726952, "grad_norm": 1.5703125, "learning_rate": 0.00042695078414831263, "loss": 6.0813, "mean_token_accuracy": 0.14676564559340477, "num_tokens": 54976854.0, "step": 25405 }, { "entropy": 6.480395746231079, "epoch": 2.7191396008347155, "grad_norm": 1.359375, "learning_rate": 0.0004269225844910538, "loss": 6.0717, "mean_token_accuracy": 0.14946893900632857, "num_tokens": 54987377.0, "step": 25410 }, { "entropy": 6.4805260181427, "epoch": 2.7196746749424796, "grad_norm": 1.125, "learning_rate": 0.0004268943804470518, "loss": 6.104, "mean_token_accuracy": 0.14189084023237228, "num_tokens": 54999488.0, "step": 25415 }, { "entropy": 6.543209362030029, "epoch": 2.7202097490502437, "grad_norm": 1.78125, "learning_rate": 0.00042686617201712074, "loss": 6.1492, "mean_token_accuracy": 0.14102415665984153, "num_tokens": 55011517.0, "step": 25420 }, { "entropy": 6.5075311183929445, "epoch": 2.7207448231580074, "grad_norm": 1.2734375, "learning_rate": 0.0004268379592020754, "loss": 6.0883, "mean_token_accuracy": 0.14639490693807602, "num_tokens": 55022133.0, "step": 25425 }, { "entropy": 6.380606174468994, "epoch": 2.7212798972657715, "grad_norm": 1.34375, "learning_rate": 0.00042680974200273036, "loss": 6.0547, "mean_token_accuracy": 0.14934568852186203, "num_tokens": 55032684.0, "step": 25430 }, { "entropy": 6.466644954681397, "epoch": 2.721814971373535, "grad_norm": 1.296875, "learning_rate": 0.0004267815204199003, "loss": 6.1029, "mean_token_accuracy": 0.15035367980599404, "num_tokens": 55042943.0, "step": 25435 }, { "entropy": 6.43906717300415, "epoch": 2.722350045481299, "grad_norm": 1.1640625, "learning_rate": 0.0004267532944544002, "loss": 6.0926, "mean_token_accuracy": 0.1449126720428467, "num_tokens": 55053805.0, "step": 25440 }, { "entropy": 6.397273015975952, "epoch": 2.722885119589063, "grad_norm": 1.1796875, "learning_rate": 0.00042672506410704495, "loss": 6.066, "mean_token_accuracy": 0.14536254554986955, "num_tokens": 55066611.0, "step": 25445 }, { "entropy": 6.443541193008423, "epoch": 2.723420193696827, "grad_norm": 1.234375, "learning_rate": 0.0004266968293786499, "loss": 6.0803, "mean_token_accuracy": 0.14655536636710167, "num_tokens": 55077954.0, "step": 25450 }, { "entropy": 6.4696681022644045, "epoch": 2.723955267804591, "grad_norm": 1.4375, "learning_rate": 0.0004266685902700302, "loss": 6.1103, "mean_token_accuracy": 0.1491883784532547, "num_tokens": 55090296.0, "step": 25455 }, { "entropy": 6.531213331222534, "epoch": 2.7244903419123547, "grad_norm": 1.1640625, "learning_rate": 0.0004266403467820013, "loss": 6.0781, "mean_token_accuracy": 0.14442493617534638, "num_tokens": 55100664.0, "step": 25460 }, { "entropy": 6.411429309844971, "epoch": 2.725025416020119, "grad_norm": 1.53125, "learning_rate": 0.0004266120989153786, "loss": 5.9759, "mean_token_accuracy": 0.15167819559574128, "num_tokens": 55111094.0, "step": 25465 }, { "entropy": 6.498197746276856, "epoch": 2.725560490127883, "grad_norm": 1.1640625, "learning_rate": 0.00042658384667097787, "loss": 6.1053, "mean_token_accuracy": 0.14239726811647416, "num_tokens": 55121877.0, "step": 25470 }, { "entropy": 6.418594217300415, "epoch": 2.7260955642356466, "grad_norm": 1.203125, "learning_rate": 0.0004265555900496149, "loss": 5.9952, "mean_token_accuracy": 0.15120193213224412, "num_tokens": 55133087.0, "step": 25475 }, { "entropy": 6.427367448806763, "epoch": 2.7266306383434107, "grad_norm": 1.375, "learning_rate": 0.00042652732905210555, "loss": 6.0785, "mean_token_accuracy": 0.14529965370893477, "num_tokens": 55144257.0, "step": 25480 }, { "entropy": 6.439451503753662, "epoch": 2.7271657124511743, "grad_norm": 1.1796875, "learning_rate": 0.0004264990636792659, "loss": 5.9624, "mean_token_accuracy": 0.15734648704528809, "num_tokens": 55154389.0, "step": 25485 }, { "entropy": 6.373074102401733, "epoch": 2.7277007865589384, "grad_norm": 1.0234375, "learning_rate": 0.000426470793931912, "loss": 5.9688, "mean_token_accuracy": 0.1599299654364586, "num_tokens": 55165734.0, "step": 25490 }, { "entropy": 6.29597053527832, "epoch": 2.728235860666702, "grad_norm": 1.234375, "learning_rate": 0.0004264425198108603, "loss": 5.9525, "mean_token_accuracy": 0.15958747416734695, "num_tokens": 55176448.0, "step": 25495 }, { "entropy": 6.41937141418457, "epoch": 2.728770934774466, "grad_norm": 1.2734375, "learning_rate": 0.00042641424131692707, "loss": 6.0222, "mean_token_accuracy": 0.1583247035741806, "num_tokens": 55187515.0, "step": 25500 }, { "entropy": 6.470597219467163, "epoch": 2.7293060088822303, "grad_norm": 1.125, "learning_rate": 0.0004263859584509289, "loss": 6.1298, "mean_token_accuracy": 0.14412814304232596, "num_tokens": 55199236.0, "step": 25505 }, { "entropy": 6.454286384582519, "epoch": 2.729841082989994, "grad_norm": 1.3515625, "learning_rate": 0.0004263576712136825, "loss": 6.0669, "mean_token_accuracy": 0.15354201048612595, "num_tokens": 55210151.0, "step": 25510 }, { "entropy": 6.429635143280029, "epoch": 2.730376157097758, "grad_norm": 1.25, "learning_rate": 0.00042632937960600454, "loss": 6.051, "mean_token_accuracy": 0.1496674232184887, "num_tokens": 55221322.0, "step": 25515 }, { "entropy": 6.3394568920135494, "epoch": 2.730911231205522, "grad_norm": 1.2421875, "learning_rate": 0.00042630108362871205, "loss": 5.9745, "mean_token_accuracy": 0.16026728898286818, "num_tokens": 55231901.0, "step": 25520 }, { "entropy": 6.440993118286133, "epoch": 2.731446305313286, "grad_norm": 1.46875, "learning_rate": 0.00042627278328262203, "loss": 6.0114, "mean_token_accuracy": 0.155671626329422, "num_tokens": 55243154.0, "step": 25525 }, { "entropy": 6.435354852676392, "epoch": 2.73198137942105, "grad_norm": 1.2890625, "learning_rate": 0.00042624447856855164, "loss": 6.0087, "mean_token_accuracy": 0.15432586893439293, "num_tokens": 55253485.0, "step": 25530 }, { "entropy": 6.496493625640869, "epoch": 2.732516453528814, "grad_norm": 1.1640625, "learning_rate": 0.00042621616948731816, "loss": 6.1003, "mean_token_accuracy": 0.14419427067041396, "num_tokens": 55264936.0, "step": 25535 }, { "entropy": 6.424218559265137, "epoch": 2.7330515276365777, "grad_norm": 1.3125, "learning_rate": 0.0004261878560397391, "loss": 6.0627, "mean_token_accuracy": 0.15414737910032272, "num_tokens": 55276138.0, "step": 25540 }, { "entropy": 6.428554201126099, "epoch": 2.7335866017443413, "grad_norm": 1.046875, "learning_rate": 0.00042615953822663195, "loss": 6.1017, "mean_token_accuracy": 0.14704363346099852, "num_tokens": 55287398.0, "step": 25545 }, { "entropy": 6.517673301696777, "epoch": 2.7341216758521054, "grad_norm": 1.0546875, "learning_rate": 0.00042613121604881426, "loss": 6.1362, "mean_token_accuracy": 0.14067264199256896, "num_tokens": 55298806.0, "step": 25550 }, { "entropy": 6.450430774688721, "epoch": 2.7346567499598695, "grad_norm": 1.09375, "learning_rate": 0.0004261028895071041, "loss": 6.0311, "mean_token_accuracy": 0.15255129635334014, "num_tokens": 55309976.0, "step": 25555 }, { "entropy": 6.466075468063354, "epoch": 2.735191824067633, "grad_norm": 1.203125, "learning_rate": 0.00042607455860231916, "loss": 6.0872, "mean_token_accuracy": 0.14783285185694695, "num_tokens": 55320806.0, "step": 25560 }, { "entropy": 6.418241882324219, "epoch": 2.7357268981753973, "grad_norm": 1.3515625, "learning_rate": 0.0004260462233352775, "loss": 6.087, "mean_token_accuracy": 0.15122041404247283, "num_tokens": 55332153.0, "step": 25565 }, { "entropy": 6.439561128616333, "epoch": 2.7362619722831614, "grad_norm": 1.203125, "learning_rate": 0.00042601788370679746, "loss": 6.0793, "mean_token_accuracy": 0.14657056778669358, "num_tokens": 55343595.0, "step": 25570 }, { "entropy": 6.4276245594024655, "epoch": 2.736797046390925, "grad_norm": 1.1015625, "learning_rate": 0.00042598953971769723, "loss": 6.0656, "mean_token_accuracy": 0.14435483440756797, "num_tokens": 55353891.0, "step": 25575 }, { "entropy": 6.4939628601074215, "epoch": 2.737332120498689, "grad_norm": 1.203125, "learning_rate": 0.0004259611913687952, "loss": 6.0097, "mean_token_accuracy": 0.15009569823741914, "num_tokens": 55364743.0, "step": 25580 }, { "entropy": 6.52032790184021, "epoch": 2.7378671946064532, "grad_norm": 1.203125, "learning_rate": 0.00042593283866091, "loss": 6.1151, "mean_token_accuracy": 0.14124570339918135, "num_tokens": 55375122.0, "step": 25585 }, { "entropy": 6.426980447769165, "epoch": 2.738402268714217, "grad_norm": 1.125, "learning_rate": 0.00042590448159486035, "loss": 6.0697, "mean_token_accuracy": 0.1450087994337082, "num_tokens": 55387281.0, "step": 25590 }, { "entropy": 6.457336950302124, "epoch": 2.738937342821981, "grad_norm": 1.1640625, "learning_rate": 0.00042587612017146496, "loss": 6.0904, "mean_token_accuracy": 0.14195430800318717, "num_tokens": 55397859.0, "step": 25595 }, { "entropy": 6.44852499961853, "epoch": 2.7394724169297446, "grad_norm": 1.125, "learning_rate": 0.00042584775439154276, "loss": 5.9934, "mean_token_accuracy": 0.15435815900564193, "num_tokens": 55408169.0, "step": 25600 }, { "entropy": 6.361451578140259, "epoch": 2.7400074910375087, "grad_norm": 1.15625, "learning_rate": 0.0004258193842559129, "loss": 5.9877, "mean_token_accuracy": 0.14957543089985847, "num_tokens": 55419342.0, "step": 25605 }, { "entropy": 6.3249797344207765, "epoch": 2.7405425651452724, "grad_norm": 1.046875, "learning_rate": 0.0004257910097653945, "loss": 5.9535, "mean_token_accuracy": 0.15536751300096513, "num_tokens": 55430271.0, "step": 25610 }, { "entropy": 6.473565578460693, "epoch": 2.7410776392530365, "grad_norm": 1.15625, "learning_rate": 0.0004257626309208069, "loss": 6.021, "mean_token_accuracy": 0.14854575842618942, "num_tokens": 55441901.0, "step": 25615 }, { "entropy": 6.395791482925415, "epoch": 2.7416127133608006, "grad_norm": 1.1484375, "learning_rate": 0.0004257342477229695, "loss": 6.0534, "mean_token_accuracy": 0.15168683230876923, "num_tokens": 55451743.0, "step": 25620 }, { "entropy": 6.432854413986206, "epoch": 2.7421477874685642, "grad_norm": 1.46875, "learning_rate": 0.00042570586017270196, "loss": 6.0243, "mean_token_accuracy": 0.15006721764802933, "num_tokens": 55462805.0, "step": 25625 }, { "entropy": 6.389247465133667, "epoch": 2.7426828615763283, "grad_norm": 1.2421875, "learning_rate": 0.00042567746827082377, "loss": 6.1115, "mean_token_accuracy": 0.1479640744626522, "num_tokens": 55474277.0, "step": 25630 }, { "entropy": 6.4561385154724125, "epoch": 2.7432179356840924, "grad_norm": 1.15625, "learning_rate": 0.0004256490720181549, "loss": 6.0112, "mean_token_accuracy": 0.14657876044511794, "num_tokens": 55485257.0, "step": 25635 }, { "entropy": 6.33825159072876, "epoch": 2.743753009791856, "grad_norm": 1.140625, "learning_rate": 0.00042562067141551523, "loss": 5.9763, "mean_token_accuracy": 0.15036061704158782, "num_tokens": 55495835.0, "step": 25640 }, { "entropy": 6.489846181869507, "epoch": 2.74428808389962, "grad_norm": 1.0859375, "learning_rate": 0.00042559226646372486, "loss": 6.1796, "mean_token_accuracy": 0.14170274659991264, "num_tokens": 55506256.0, "step": 25645 }, { "entropy": 6.486428928375244, "epoch": 2.744823158007384, "grad_norm": 1.3125, "learning_rate": 0.000425563857163604, "loss": 6.0313, "mean_token_accuracy": 0.15948477312922477, "num_tokens": 55516821.0, "step": 25650 }, { "entropy": 6.4164635181427006, "epoch": 2.745358232115148, "grad_norm": 1.1796875, "learning_rate": 0.00042553544351597286, "loss": 6.0697, "mean_token_accuracy": 0.1425837606191635, "num_tokens": 55527153.0, "step": 25655 }, { "entropy": 6.470670938491821, "epoch": 2.7458933062229116, "grad_norm": 1.2265625, "learning_rate": 0.00042550702552165195, "loss": 6.1313, "mean_token_accuracy": 0.1411615192890167, "num_tokens": 55538219.0, "step": 25660 }, { "entropy": 6.536293363571167, "epoch": 2.7464283803306757, "grad_norm": 1.1015625, "learning_rate": 0.00042547860318146183, "loss": 6.0693, "mean_token_accuracy": 0.14561992436647414, "num_tokens": 55548733.0, "step": 25665 }, { "entropy": 6.4749914646148685, "epoch": 2.74696345443844, "grad_norm": 1.3046875, "learning_rate": 0.00042545017649622314, "loss": 6.0572, "mean_token_accuracy": 0.14953542426228522, "num_tokens": 55559746.0, "step": 25670 }, { "entropy": 6.376782751083374, "epoch": 2.7474985285462035, "grad_norm": 1.1484375, "learning_rate": 0.0004254217454667569, "loss": 6.0431, "mean_token_accuracy": 0.14929199293255807, "num_tokens": 55570322.0, "step": 25675 }, { "entropy": 6.30539608001709, "epoch": 2.7480336026539676, "grad_norm": 1.125, "learning_rate": 0.0004253933100938837, "loss": 5.9438, "mean_token_accuracy": 0.15574714094400405, "num_tokens": 55580715.0, "step": 25680 }, { "entropy": 6.477630615234375, "epoch": 2.7485686767617317, "grad_norm": 1.1328125, "learning_rate": 0.0004253648703784249, "loss": 6.0305, "mean_token_accuracy": 0.15008877217769623, "num_tokens": 55591685.0, "step": 25685 }, { "entropy": 6.437804937362671, "epoch": 2.7491037508694953, "grad_norm": 1.15625, "learning_rate": 0.0004253364263212016, "loss": 6.0174, "mean_token_accuracy": 0.14492260217666625, "num_tokens": 55602288.0, "step": 25690 }, { "entropy": 6.4257549285888675, "epoch": 2.7496388249772594, "grad_norm": 1.171875, "learning_rate": 0.0004253079779230352, "loss": 6.1284, "mean_token_accuracy": 0.14752286523580552, "num_tokens": 55613011.0, "step": 25695 }, { "entropy": 6.3855335235595705, "epoch": 2.7501738990850235, "grad_norm": 1.2734375, "learning_rate": 0.0004252795251847469, "loss": 6.0398, "mean_token_accuracy": 0.1493801310658455, "num_tokens": 55623630.0, "step": 25700 }, { "entropy": 6.370765733718872, "epoch": 2.750708973192787, "grad_norm": 1.0703125, "learning_rate": 0.00042525106810715845, "loss": 6.0016, "mean_token_accuracy": 0.1563740164041519, "num_tokens": 55634764.0, "step": 25705 }, { "entropy": 6.477820873260498, "epoch": 2.7512440473005513, "grad_norm": 1.1484375, "learning_rate": 0.00042522260669109157, "loss": 6.0499, "mean_token_accuracy": 0.15210364609956742, "num_tokens": 55645085.0, "step": 25710 }, { "entropy": 6.484300136566162, "epoch": 2.751779121408315, "grad_norm": 1.21875, "learning_rate": 0.000425194140937368, "loss": 6.1454, "mean_token_accuracy": 0.1394964836537838, "num_tokens": 55656249.0, "step": 25715 }, { "entropy": 6.4998280048370365, "epoch": 2.752314195516079, "grad_norm": 1.0859375, "learning_rate": 0.00042516567084680977, "loss": 6.0942, "mean_token_accuracy": 0.1518393263220787, "num_tokens": 55668138.0, "step": 25720 }, { "entropy": 6.4903425693511965, "epoch": 2.7528492696238427, "grad_norm": 1.234375, "learning_rate": 0.0004251371964202389, "loss": 6.04, "mean_token_accuracy": 0.15156002789735795, "num_tokens": 55678747.0, "step": 25725 }, { "entropy": 6.476528024673462, "epoch": 2.753384343731607, "grad_norm": 1.140625, "learning_rate": 0.0004251087176584775, "loss": 6.1326, "mean_token_accuracy": 0.1491600140929222, "num_tokens": 55690266.0, "step": 25730 }, { "entropy": 6.437159252166748, "epoch": 2.753919417839371, "grad_norm": 1.296875, "learning_rate": 0.00042508023456234805, "loss": 6.0236, "mean_token_accuracy": 0.1483944557607174, "num_tokens": 55700229.0, "step": 25735 }, { "entropy": 6.423054265975952, "epoch": 2.7544544919471345, "grad_norm": 1.15625, "learning_rate": 0.00042505174713267286, "loss": 6.074, "mean_token_accuracy": 0.14628783166408538, "num_tokens": 55711564.0, "step": 25740 }, { "entropy": 6.439503717422485, "epoch": 2.7549895660548986, "grad_norm": 1.1875, "learning_rate": 0.0004250232553702746, "loss": 6.0228, "mean_token_accuracy": 0.1559218168258667, "num_tokens": 55722618.0, "step": 25745 }, { "entropy": 6.37799711227417, "epoch": 2.7555246401626627, "grad_norm": 1.671875, "learning_rate": 0.0004249947592759759, "loss": 5.9969, "mean_token_accuracy": 0.15584196150302887, "num_tokens": 55732828.0, "step": 25750 }, { "entropy": 6.399539756774902, "epoch": 2.7560597142704264, "grad_norm": 1.1328125, "learning_rate": 0.0004249662588505996, "loss": 5.9774, "mean_token_accuracy": 0.1494250327348709, "num_tokens": 55742283.0, "step": 25755 }, { "entropy": 6.403476762771606, "epoch": 2.7565947883781905, "grad_norm": 1.203125, "learning_rate": 0.00042493775409496867, "loss": 6.0411, "mean_token_accuracy": 0.14976274520158767, "num_tokens": 55752883.0, "step": 25760 }, { "entropy": 6.4517827987670895, "epoch": 2.757129862485954, "grad_norm": 1.34375, "learning_rate": 0.0004249092450099062, "loss": 6.0568, "mean_token_accuracy": 0.15013401955366135, "num_tokens": 55762730.0, "step": 25765 }, { "entropy": 6.311103868484497, "epoch": 2.7576649365937183, "grad_norm": 1.1875, "learning_rate": 0.0004248807315962353, "loss": 5.9962, "mean_token_accuracy": 0.1520252913236618, "num_tokens": 55774068.0, "step": 25770 }, { "entropy": 6.432100439071656, "epoch": 2.758200010701482, "grad_norm": 1.1953125, "learning_rate": 0.0004248522138547793, "loss": 6.0689, "mean_token_accuracy": 0.1418062664568424, "num_tokens": 55784896.0, "step": 25775 }, { "entropy": 6.414865493774414, "epoch": 2.758735084809246, "grad_norm": 1.203125, "learning_rate": 0.0004248236917863617, "loss": 6.0244, "mean_token_accuracy": 0.15214278548955917, "num_tokens": 55796186.0, "step": 25780 }, { "entropy": 6.412644672393799, "epoch": 2.75927015891701, "grad_norm": 1.1796875, "learning_rate": 0.00042479516539180605, "loss": 5.9686, "mean_token_accuracy": 0.16199107319116593, "num_tokens": 55806439.0, "step": 25785 }, { "entropy": 6.414120721817016, "epoch": 2.7598052330247738, "grad_norm": 1.1484375, "learning_rate": 0.000424766634671936, "loss": 6.0677, "mean_token_accuracy": 0.14124292209744455, "num_tokens": 55817955.0, "step": 25790 }, { "entropy": 6.456507301330566, "epoch": 2.760340307132538, "grad_norm": 1.3203125, "learning_rate": 0.00042473809962757553, "loss": 6.0465, "mean_token_accuracy": 0.14716726094484328, "num_tokens": 55828876.0, "step": 25795 }, { "entropy": 6.43586106300354, "epoch": 2.760875381240302, "grad_norm": 1.34375, "learning_rate": 0.0004247095602595485, "loss": 6.0036, "mean_token_accuracy": 0.15277801603078842, "num_tokens": 55839721.0, "step": 25800 }, { "entropy": 6.371204137802124, "epoch": 2.7614104553480656, "grad_norm": 1.140625, "learning_rate": 0.0004246810165686788, "loss": 6.0606, "mean_token_accuracy": 0.15058609694242478, "num_tokens": 55850427.0, "step": 25805 }, { "entropy": 6.464559412002563, "epoch": 2.7619455294558297, "grad_norm": 1.1328125, "learning_rate": 0.00042465246855579093, "loss": 6.0862, "mean_token_accuracy": 0.14228805601596833, "num_tokens": 55860245.0, "step": 25810 }, { "entropy": 6.446472454071045, "epoch": 2.762480603563594, "grad_norm": 1.1484375, "learning_rate": 0.00042462391622170897, "loss": 6.0673, "mean_token_accuracy": 0.1508305251598358, "num_tokens": 55869957.0, "step": 25815 }, { "entropy": 6.4355621337890625, "epoch": 2.7630156776713575, "grad_norm": 1.1328125, "learning_rate": 0.0004245953595672575, "loss": 6.1454, "mean_token_accuracy": 0.1406472772359848, "num_tokens": 55881159.0, "step": 25820 }, { "entropy": 6.6007133483886715, "epoch": 2.7635507517791216, "grad_norm": 1.1171875, "learning_rate": 0.000424566798593261, "loss": 6.0691, "mean_token_accuracy": 0.14426540583372116, "num_tokens": 55891830.0, "step": 25825 }, { "entropy": 6.466911125183105, "epoch": 2.7640858258868852, "grad_norm": 1.0703125, "learning_rate": 0.00042453823330054427, "loss": 6.0762, "mean_token_accuracy": 0.14225400537252425, "num_tokens": 55901904.0, "step": 25830 }, { "entropy": 6.364355087280273, "epoch": 2.7646208999946493, "grad_norm": 1.09375, "learning_rate": 0.000424509663689932, "loss": 6.0011, "mean_token_accuracy": 0.14474194422364234, "num_tokens": 55913808.0, "step": 25835 }, { "entropy": 6.415271329879761, "epoch": 2.765155974102413, "grad_norm": 1.25, "learning_rate": 0.0004244810897622492, "loss": 6.0294, "mean_token_accuracy": 0.1504080578684807, "num_tokens": 55924997.0, "step": 25840 }, { "entropy": 6.5113883972167965, "epoch": 2.765691048210177, "grad_norm": 1.453125, "learning_rate": 0.000424452511518321, "loss": 6.1361, "mean_token_accuracy": 0.14324550479650497, "num_tokens": 55935623.0, "step": 25845 }, { "entropy": 6.443820476531982, "epoch": 2.766226122317941, "grad_norm": 1.1484375, "learning_rate": 0.0004244239289589724, "loss": 6.1019, "mean_token_accuracy": 0.1478296235203743, "num_tokens": 55946733.0, "step": 25850 }, { "entropy": 6.423967504501343, "epoch": 2.766761196425705, "grad_norm": 1.2421875, "learning_rate": 0.000424395342085029, "loss": 6.1155, "mean_token_accuracy": 0.14689281582832336, "num_tokens": 55956158.0, "step": 25855 }, { "entropy": 6.474572324752808, "epoch": 2.767296270533469, "grad_norm": 1.5, "learning_rate": 0.00042436675089731603, "loss": 5.9912, "mean_token_accuracy": 0.15330372601747513, "num_tokens": 55966442.0, "step": 25860 }, { "entropy": 6.466239404678345, "epoch": 2.767831344641233, "grad_norm": 1.25, "learning_rate": 0.0004243381553966591, "loss": 6.0806, "mean_token_accuracy": 0.14939797669649124, "num_tokens": 55977314.0, "step": 25865 }, { "entropy": 6.385185813903808, "epoch": 2.7683664187489967, "grad_norm": 1.21875, "learning_rate": 0.00042430955558388396, "loss": 5.9946, "mean_token_accuracy": 0.15223354548215867, "num_tokens": 55987457.0, "step": 25870 }, { "entropy": 6.423221492767334, "epoch": 2.768901492856761, "grad_norm": 1.1640625, "learning_rate": 0.00042428095145981634, "loss": 6.0159, "mean_token_accuracy": 0.1532500207424164, "num_tokens": 55998319.0, "step": 25875 }, { "entropy": 6.392953205108642, "epoch": 2.7694365669645244, "grad_norm": 1.125, "learning_rate": 0.00042425234302528224, "loss": 5.9394, "mean_token_accuracy": 0.15218333899974823, "num_tokens": 56008654.0, "step": 25880 }, { "entropy": 6.441227436065674, "epoch": 2.7699716410722885, "grad_norm": 1.4375, "learning_rate": 0.0004242237302811077, "loss": 6.125, "mean_token_accuracy": 0.14420871809124947, "num_tokens": 56019793.0, "step": 25885 }, { "entropy": 6.475605630874634, "epoch": 2.770506715180052, "grad_norm": 1.1015625, "learning_rate": 0.000424195113228119, "loss": 6.0743, "mean_token_accuracy": 0.1509287327528, "num_tokens": 56031051.0, "step": 25890 }, { "entropy": 6.492498683929443, "epoch": 2.7710417892878163, "grad_norm": 1.1640625, "learning_rate": 0.0004241664918671423, "loss": 6.1262, "mean_token_accuracy": 0.14654675051569938, "num_tokens": 56041210.0, "step": 25895 }, { "entropy": 6.396188879013062, "epoch": 2.7715768633955804, "grad_norm": 1.15625, "learning_rate": 0.000424137866199004, "loss": 6.0037, "mean_token_accuracy": 0.1532615229487419, "num_tokens": 56051601.0, "step": 25900 }, { "entropy": 6.413284063339233, "epoch": 2.772111937503344, "grad_norm": 1.2109375, "learning_rate": 0.0004241092362245309, "loss": 5.9618, "mean_token_accuracy": 0.15736669600009917, "num_tokens": 56062669.0, "step": 25905 }, { "entropy": 6.384915113449097, "epoch": 2.772647011611108, "grad_norm": 1.125, "learning_rate": 0.00042408060194454956, "loss": 6.1136, "mean_token_accuracy": 0.14913412779569626, "num_tokens": 56074414.0, "step": 25910 }, { "entropy": 6.438897609710693, "epoch": 2.7731820857188723, "grad_norm": 1.296875, "learning_rate": 0.00042405196335988676, "loss": 6.0541, "mean_token_accuracy": 0.14428338557481765, "num_tokens": 56085428.0, "step": 25915 }, { "entropy": 6.469063854217529, "epoch": 2.773717159826636, "grad_norm": 1.2265625, "learning_rate": 0.00042402332047136943, "loss": 6.0541, "mean_token_accuracy": 0.14452765062451361, "num_tokens": 56097403.0, "step": 25920 }, { "entropy": 6.37754077911377, "epoch": 2.7742522339344, "grad_norm": 1.28125, "learning_rate": 0.0004239946732798247, "loss": 5.9623, "mean_token_accuracy": 0.15868452787399293, "num_tokens": 56107781.0, "step": 25925 }, { "entropy": 6.314821100234985, "epoch": 2.774787308042164, "grad_norm": 1.09375, "learning_rate": 0.00042396602178607973, "loss": 5.9184, "mean_token_accuracy": 0.16537774503231048, "num_tokens": 56118698.0, "step": 25930 }, { "entropy": 6.4062371253967285, "epoch": 2.7753223821499278, "grad_norm": 1.21875, "learning_rate": 0.0004239373659909618, "loss": 6.0459, "mean_token_accuracy": 0.14684186428785323, "num_tokens": 56128397.0, "step": 25935 }, { "entropy": 6.397486543655395, "epoch": 2.7758574562576914, "grad_norm": 1.1328125, "learning_rate": 0.0004239087058952984, "loss": 6.0384, "mean_token_accuracy": 0.15191538780927658, "num_tokens": 56138798.0, "step": 25940 }, { "entropy": 6.455853891372681, "epoch": 2.7763925303654555, "grad_norm": 1.125, "learning_rate": 0.000423880041499917, "loss": 5.9794, "mean_token_accuracy": 0.16300947815179825, "num_tokens": 56149936.0, "step": 25945 }, { "entropy": 6.455181455612182, "epoch": 2.7769276044732196, "grad_norm": 1.1015625, "learning_rate": 0.0004238513728056453, "loss": 6.0519, "mean_token_accuracy": 0.14964846074581145, "num_tokens": 56161433.0, "step": 25950 }, { "entropy": 6.446481704711914, "epoch": 2.7774626785809833, "grad_norm": 1.1875, "learning_rate": 0.00042382269981331116, "loss": 6.0707, "mean_token_accuracy": 0.1433508016169071, "num_tokens": 56172312.0, "step": 25955 }, { "entropy": 6.373271846771241, "epoch": 2.7779977526887474, "grad_norm": 1.2265625, "learning_rate": 0.00042379402252374244, "loss": 5.9855, "mean_token_accuracy": 0.15436504632234574, "num_tokens": 56183887.0, "step": 25960 }, { "entropy": 6.403153800964356, "epoch": 2.7785328267965115, "grad_norm": 1.2265625, "learning_rate": 0.00042376534093776727, "loss": 6.0185, "mean_token_accuracy": 0.1564489260315895, "num_tokens": 56194172.0, "step": 25965 }, { "entropy": 6.458992290496826, "epoch": 2.779067900904275, "grad_norm": 1.1875, "learning_rate": 0.0004237366550562137, "loss": 6.1362, "mean_token_accuracy": 0.14420275539159774, "num_tokens": 56204569.0, "step": 25970 }, { "entropy": 6.441669607162476, "epoch": 2.7796029750120392, "grad_norm": 1.203125, "learning_rate": 0.00042370796487991013, "loss": 6.0166, "mean_token_accuracy": 0.15280842930078506, "num_tokens": 56215875.0, "step": 25975 }, { "entropy": 6.47059588432312, "epoch": 2.7801380491198033, "grad_norm": 1.3046875, "learning_rate": 0.00042367927040968514, "loss": 6.0711, "mean_token_accuracy": 0.13782498762011527, "num_tokens": 56227633.0, "step": 25980 }, { "entropy": 6.278856658935547, "epoch": 2.780673123227567, "grad_norm": 1.125, "learning_rate": 0.0004236505716463669, "loss": 5.9493, "mean_token_accuracy": 0.15624210983514786, "num_tokens": 56239420.0, "step": 25985 }, { "entropy": 6.404437065124512, "epoch": 2.781208197335331, "grad_norm": 1.3828125, "learning_rate": 0.0004236218685907844, "loss": 6.0016, "mean_token_accuracy": 0.1480076566338539, "num_tokens": 56250538.0, "step": 25990 }, { "entropy": 6.4202343940734865, "epoch": 2.7817432714430947, "grad_norm": 1.1640625, "learning_rate": 0.0004235931612437663, "loss": 6.0775, "mean_token_accuracy": 0.146730624884367, "num_tokens": 56261423.0, "step": 25995 }, { "entropy": 6.429287576675415, "epoch": 2.782278345550859, "grad_norm": 1.34375, "learning_rate": 0.0004235644496061416, "loss": 6.0922, "mean_token_accuracy": 0.14426886811852455, "num_tokens": 56272581.0, "step": 26000 }, { "entropy": 6.458887147903442, "epoch": 2.7828134196586225, "grad_norm": 1.265625, "learning_rate": 0.0004235357336787392, "loss": 6.0192, "mean_token_accuracy": 0.15403840988874434, "num_tokens": 56283703.0, "step": 26005 }, { "entropy": 6.521402978897095, "epoch": 2.7833484937663866, "grad_norm": 1.1484375, "learning_rate": 0.00042350701346238853, "loss": 6.1323, "mean_token_accuracy": 0.14179784655570984, "num_tokens": 56294657.0, "step": 26010 }, { "entropy": 6.421674919128418, "epoch": 2.7838835678741507, "grad_norm": 1.125, "learning_rate": 0.0004234782889579185, "loss": 5.9539, "mean_token_accuracy": 0.15186866819858552, "num_tokens": 56305555.0, "step": 26015 }, { "entropy": 6.426959609985351, "epoch": 2.7844186419819144, "grad_norm": 1.1953125, "learning_rate": 0.00042344956016615885, "loss": 6.1186, "mean_token_accuracy": 0.1473462998867035, "num_tokens": 56316716.0, "step": 26020 }, { "entropy": 6.432470464706421, "epoch": 2.7849537160896785, "grad_norm": 1.1640625, "learning_rate": 0.0004234208270879389, "loss": 5.9717, "mean_token_accuracy": 0.14987516403198242, "num_tokens": 56326582.0, "step": 26025 }, { "entropy": 6.447471284866333, "epoch": 2.7854887901974426, "grad_norm": 1.140625, "learning_rate": 0.00042339208972408865, "loss": 6.0601, "mean_token_accuracy": 0.15618169754743577, "num_tokens": 56336687.0, "step": 26030 }, { "entropy": 6.364188575744629, "epoch": 2.786023864305206, "grad_norm": 1.1640625, "learning_rate": 0.0004233633480754375, "loss": 5.888, "mean_token_accuracy": 0.1612467125058174, "num_tokens": 56347493.0, "step": 26035 }, { "entropy": 6.418560409545899, "epoch": 2.7865589384129703, "grad_norm": 1.1484375, "learning_rate": 0.00042333460214281557, "loss": 5.9948, "mean_token_accuracy": 0.14950570613145828, "num_tokens": 56359259.0, "step": 26040 }, { "entropy": 6.374906349182129, "epoch": 2.787094012520734, "grad_norm": 1.125, "learning_rate": 0.00042330585192705284, "loss": 6.0223, "mean_token_accuracy": 0.14752267599105834, "num_tokens": 56370502.0, "step": 26045 }, { "entropy": 6.369175243377685, "epoch": 2.787629086628498, "grad_norm": 1.1953125, "learning_rate": 0.00042327709742897944, "loss": 6.0563, "mean_token_accuracy": 0.14704466462135315, "num_tokens": 56381047.0, "step": 26050 }, { "entropy": 6.40776834487915, "epoch": 2.7881641607362617, "grad_norm": 1.34375, "learning_rate": 0.00042324833864942576, "loss": 5.9862, "mean_token_accuracy": 0.15330395549535752, "num_tokens": 56392304.0, "step": 26055 }, { "entropy": 6.401726818084716, "epoch": 2.788699234844026, "grad_norm": 1.125, "learning_rate": 0.0004232195755892221, "loss": 5.9611, "mean_token_accuracy": 0.16093580797314644, "num_tokens": 56402480.0, "step": 26060 }, { "entropy": 6.3833600044250485, "epoch": 2.78923430895179, "grad_norm": 1.1796875, "learning_rate": 0.00042319080824919895, "loss": 6.0712, "mean_token_accuracy": 0.1508347600698471, "num_tokens": 56413659.0, "step": 26065 }, { "entropy": 6.425733613967895, "epoch": 2.7897693830595536, "grad_norm": 1.3828125, "learning_rate": 0.0004231620366301871, "loss": 6.1187, "mean_token_accuracy": 0.14508638828992843, "num_tokens": 56425272.0, "step": 26070 }, { "entropy": 6.53260235786438, "epoch": 2.7903044571673177, "grad_norm": 1.390625, "learning_rate": 0.00042313326073301733, "loss": 6.0579, "mean_token_accuracy": 0.1503555953502655, "num_tokens": 56436696.0, "step": 26075 }, { "entropy": 6.477833318710327, "epoch": 2.7908395312750818, "grad_norm": 1.0703125, "learning_rate": 0.0004231044805585204, "loss": 6.0882, "mean_token_accuracy": 0.1436576709151268, "num_tokens": 56446666.0, "step": 26080 }, { "entropy": 6.39180269241333, "epoch": 2.7913746053828454, "grad_norm": 1.234375, "learning_rate": 0.0004230756961075274, "loss": 6.0336, "mean_token_accuracy": 0.1507587678730488, "num_tokens": 56457082.0, "step": 26085 }, { "entropy": 6.378720235824585, "epoch": 2.7919096794906095, "grad_norm": 1.0859375, "learning_rate": 0.00042304690738086944, "loss": 5.9799, "mean_token_accuracy": 0.1521870255470276, "num_tokens": 56468492.0, "step": 26090 }, { "entropy": 6.441785383224487, "epoch": 2.7924447535983736, "grad_norm": 1.3984375, "learning_rate": 0.0004230181143793779, "loss": 6.0551, "mean_token_accuracy": 0.1534495547413826, "num_tokens": 56479353.0, "step": 26095 }, { "entropy": 6.439150476455689, "epoch": 2.7929798277061373, "grad_norm": 1.640625, "learning_rate": 0.00042298931710388414, "loss": 6.0529, "mean_token_accuracy": 0.149759179353714, "num_tokens": 56490105.0, "step": 26100 }, { "entropy": 6.472236633300781, "epoch": 2.7935149018139014, "grad_norm": 1.078125, "learning_rate": 0.0004229605155552195, "loss": 6.0803, "mean_token_accuracy": 0.1475442484021187, "num_tokens": 56501528.0, "step": 26105 }, { "entropy": 6.48919186592102, "epoch": 2.794049975921665, "grad_norm": 1.1640625, "learning_rate": 0.00042293170973421593, "loss": 6.1348, "mean_token_accuracy": 0.14328303709626197, "num_tokens": 56512952.0, "step": 26110 }, { "entropy": 6.501806163787842, "epoch": 2.794585050029429, "grad_norm": 1.359375, "learning_rate": 0.00042290289964170495, "loss": 6.0421, "mean_token_accuracy": 0.15625403225421905, "num_tokens": 56523332.0, "step": 26115 }, { "entropy": 6.467695331573486, "epoch": 2.795120124137193, "grad_norm": 1.3828125, "learning_rate": 0.0004228740852785185, "loss": 6.0375, "mean_token_accuracy": 0.14998308569192886, "num_tokens": 56534777.0, "step": 26120 }, { "entropy": 6.3937599658966064, "epoch": 2.795655198244957, "grad_norm": 1.1328125, "learning_rate": 0.00042284526664548866, "loss": 6.0314, "mean_token_accuracy": 0.14366142079234123, "num_tokens": 56545706.0, "step": 26125 }, { "entropy": 6.370588779449463, "epoch": 2.796190272352721, "grad_norm": 1.0703125, "learning_rate": 0.00042281644374344754, "loss": 6.0222, "mean_token_accuracy": 0.14527872279286386, "num_tokens": 56557014.0, "step": 26130 }, { "entropy": 6.445417165756226, "epoch": 2.7967253464604847, "grad_norm": 1.1171875, "learning_rate": 0.00042278761657322736, "loss": 6.0783, "mean_token_accuracy": 0.15204058587551117, "num_tokens": 56569707.0, "step": 26135 }, { "entropy": 6.4742724895477295, "epoch": 2.7972604205682488, "grad_norm": 1.109375, "learning_rate": 0.0004227587851356605, "loss": 6.0055, "mean_token_accuracy": 0.15044934898614884, "num_tokens": 56579924.0, "step": 26140 }, { "entropy": 6.5041240692138675, "epoch": 2.797795494676013, "grad_norm": 1.3359375, "learning_rate": 0.0004227299494315795, "loss": 6.0828, "mean_token_accuracy": 0.14583077430725097, "num_tokens": 56590301.0, "step": 26145 }, { "entropy": 6.4372642040252686, "epoch": 2.7983305687837765, "grad_norm": 1.1953125, "learning_rate": 0.00042270110946181693, "loss": 6.0091, "mean_token_accuracy": 0.15271706730127335, "num_tokens": 56600717.0, "step": 26150 }, { "entropy": 6.463856840133667, "epoch": 2.7988656428915406, "grad_norm": 2.765625, "learning_rate": 0.00042267226522720556, "loss": 6.058, "mean_token_accuracy": 0.14681680351495743, "num_tokens": 56611547.0, "step": 26155 }, { "entropy": 6.413233518600464, "epoch": 2.7994007169993043, "grad_norm": 1.1796875, "learning_rate": 0.0004226434167285784, "loss": 5.9598, "mean_token_accuracy": 0.15135293006896972, "num_tokens": 56622542.0, "step": 26160 }, { "entropy": 6.419681024551392, "epoch": 2.7999357911070684, "grad_norm": 1.6875, "learning_rate": 0.0004226145639667683, "loss": 6.0396, "mean_token_accuracy": 0.15508953779935836, "num_tokens": 56633359.0, "step": 26165 }, { "entropy": 6.3672102928161625, "epoch": 2.800470865214832, "grad_norm": 1.3125, "learning_rate": 0.0004225857069426083, "loss": 5.9271, "mean_token_accuracy": 0.15799694061279296, "num_tokens": 56644101.0, "step": 26170 }, { "entropy": 6.458103942871094, "epoch": 2.801005939322596, "grad_norm": 1.1015625, "learning_rate": 0.00042255684565693183, "loss": 5.9774, "mean_token_accuracy": 0.14844557791948318, "num_tokens": 56654630.0, "step": 26175 }, { "entropy": 6.389373016357422, "epoch": 2.80154101343036, "grad_norm": 1.28125, "learning_rate": 0.0004225279801105722, "loss": 5.9996, "mean_token_accuracy": 0.1511190876364708, "num_tokens": 56665826.0, "step": 26180 }, { "entropy": 6.3908380508422855, "epoch": 2.802076087538124, "grad_norm": 1.1953125, "learning_rate": 0.0004224991103043628, "loss": 6.039, "mean_token_accuracy": 0.14940351694822313, "num_tokens": 56676431.0, "step": 26185 }, { "entropy": 6.459698343276978, "epoch": 2.802611161645888, "grad_norm": 1.15625, "learning_rate": 0.00042247023623913745, "loss": 6.0262, "mean_token_accuracy": 0.15339324325323106, "num_tokens": 56687297.0, "step": 26190 }, { "entropy": 6.367177200317383, "epoch": 2.803146235753652, "grad_norm": 1.2109375, "learning_rate": 0.0004224413579157296, "loss": 6.0634, "mean_token_accuracy": 0.15312274917960167, "num_tokens": 56698392.0, "step": 26195 }, { "entropy": 6.439164924621582, "epoch": 2.8036813098614157, "grad_norm": 1.1484375, "learning_rate": 0.0004224124753349733, "loss": 6.0922, "mean_token_accuracy": 0.1526595890522003, "num_tokens": 56710588.0, "step": 26200 }, { "entropy": 6.354989147186279, "epoch": 2.80421638396918, "grad_norm": 1.1875, "learning_rate": 0.0004223835884977025, "loss": 5.9161, "mean_token_accuracy": 0.1574145197868347, "num_tokens": 56723143.0, "step": 26205 }, { "entropy": 6.426775741577148, "epoch": 2.804751458076944, "grad_norm": 1.109375, "learning_rate": 0.0004223546974047513, "loss": 6.0191, "mean_token_accuracy": 0.15531293153762818, "num_tokens": 56734097.0, "step": 26210 }, { "entropy": 6.447193622589111, "epoch": 2.8052865321847076, "grad_norm": 1.1328125, "learning_rate": 0.0004223258020569539, "loss": 6.0724, "mean_token_accuracy": 0.14504825249314307, "num_tokens": 56745311.0, "step": 26215 }, { "entropy": 6.452460050582886, "epoch": 2.8058216062924712, "grad_norm": 2.859375, "learning_rate": 0.0004222969024551447, "loss": 6.1228, "mean_token_accuracy": 0.15037810504436494, "num_tokens": 56755495.0, "step": 26220 }, { "entropy": 6.4384236335754395, "epoch": 2.8063566804002353, "grad_norm": 1.140625, "learning_rate": 0.00042226799860015817, "loss": 5.9966, "mean_token_accuracy": 0.15909594893455506, "num_tokens": 56766107.0, "step": 26225 }, { "entropy": 6.411249256134033, "epoch": 2.8068917545079994, "grad_norm": 1.078125, "learning_rate": 0.0004222390904928288, "loss": 6.0002, "mean_token_accuracy": 0.15537684857845308, "num_tokens": 56776877.0, "step": 26230 }, { "entropy": 6.433188629150391, "epoch": 2.807426828615763, "grad_norm": 1.2265625, "learning_rate": 0.00042221017813399146, "loss": 6.0797, "mean_token_accuracy": 0.15274036228656768, "num_tokens": 56786439.0, "step": 26235 }, { "entropy": 6.394668245315552, "epoch": 2.807961902723527, "grad_norm": 1.1015625, "learning_rate": 0.0004221812615244809, "loss": 6.085, "mean_token_accuracy": 0.1435970276594162, "num_tokens": 56797433.0, "step": 26240 }, { "entropy": 6.5347984790802, "epoch": 2.8084969768312913, "grad_norm": 1.296875, "learning_rate": 0.00042215234066513203, "loss": 6.0985, "mean_token_accuracy": 0.14584537744522094, "num_tokens": 56808270.0, "step": 26245 }, { "entropy": 6.486695766448975, "epoch": 2.809032050939055, "grad_norm": 1.1328125, "learning_rate": 0.00042212341555678, "loss": 6.0464, "mean_token_accuracy": 0.14755429029464723, "num_tokens": 56818590.0, "step": 26250 }, { "entropy": 6.395121812820435, "epoch": 2.809567125046819, "grad_norm": 1.3203125, "learning_rate": 0.0004220944862002601, "loss": 6.0743, "mean_token_accuracy": 0.14349693208932876, "num_tokens": 56828799.0, "step": 26255 }, { "entropy": 6.4509632110595705, "epoch": 2.810102199154583, "grad_norm": 1.1953125, "learning_rate": 0.00042206555259640744, "loss": 6.0575, "mean_token_accuracy": 0.14447470605373383, "num_tokens": 56839409.0, "step": 26260 }, { "entropy": 6.3562744617462155, "epoch": 2.810637273262347, "grad_norm": 1.0859375, "learning_rate": 0.00042203661474605775, "loss": 5.9809, "mean_token_accuracy": 0.15901046395301818, "num_tokens": 56849650.0, "step": 26265 }, { "entropy": 6.404301595687866, "epoch": 2.811172347370111, "grad_norm": 1.2109375, "learning_rate": 0.0004220076726500464, "loss": 6.0662, "mean_token_accuracy": 0.14773694723844527, "num_tokens": 56860437.0, "step": 26270 }, { "entropy": 6.469612503051758, "epoch": 2.8117074214778746, "grad_norm": 1.1875, "learning_rate": 0.00042197872630920927, "loss": 6.05, "mean_token_accuracy": 0.15329967737197875, "num_tokens": 56870314.0, "step": 26275 }, { "entropy": 6.4698954105377195, "epoch": 2.8122424955856387, "grad_norm": 1.2578125, "learning_rate": 0.00042194977572438194, "loss": 6.0576, "mean_token_accuracy": 0.14935247749090194, "num_tokens": 56881675.0, "step": 26280 }, { "entropy": 6.467679023742676, "epoch": 2.8127775696934023, "grad_norm": 1.1171875, "learning_rate": 0.00042192082089640055, "loss": 6.1217, "mean_token_accuracy": 0.14070313572883605, "num_tokens": 56893148.0, "step": 26285 }, { "entropy": 6.469432544708252, "epoch": 2.8133126438011664, "grad_norm": 1.3984375, "learning_rate": 0.0004218918618261011, "loss": 5.9625, "mean_token_accuracy": 0.15965280681848526, "num_tokens": 56904008.0, "step": 26290 }, { "entropy": 6.425285863876343, "epoch": 2.8138477179089305, "grad_norm": 1.4453125, "learning_rate": 0.00042186289851431976, "loss": 6.0114, "mean_token_accuracy": 0.15042104423046113, "num_tokens": 56914731.0, "step": 26295 }, { "entropy": 6.453146648406983, "epoch": 2.814382792016694, "grad_norm": 1.5546875, "learning_rate": 0.00042183393096189285, "loss": 6.1492, "mean_token_accuracy": 0.14326153546571732, "num_tokens": 56926037.0, "step": 26300 }, { "entropy": 6.337903356552124, "epoch": 2.8149178661244583, "grad_norm": 1.3046875, "learning_rate": 0.00042180495916965686, "loss": 5.9398, "mean_token_accuracy": 0.16146292984485627, "num_tokens": 56936456.0, "step": 26305 }, { "entropy": 6.434628009796143, "epoch": 2.8154529402322224, "grad_norm": 1.1640625, "learning_rate": 0.0004217759831384483, "loss": 5.9886, "mean_token_accuracy": 0.15641989186406136, "num_tokens": 56947929.0, "step": 26310 }, { "entropy": 6.406024360656739, "epoch": 2.815988014339986, "grad_norm": 1.1875, "learning_rate": 0.00042174700286910376, "loss": 5.9904, "mean_token_accuracy": 0.1581709712743759, "num_tokens": 56958153.0, "step": 26315 }, { "entropy": 6.469569826126099, "epoch": 2.81652308844775, "grad_norm": 1.1640625, "learning_rate": 0.0004217180183624602, "loss": 6.0666, "mean_token_accuracy": 0.14834050983190536, "num_tokens": 56968609.0, "step": 26320 }, { "entropy": 6.478921031951904, "epoch": 2.817058162555514, "grad_norm": 1.1875, "learning_rate": 0.0004216890296193545, "loss": 6.0752, "mean_token_accuracy": 0.15596452951431275, "num_tokens": 56978434.0, "step": 26325 }, { "entropy": 6.400845956802368, "epoch": 2.817593236663278, "grad_norm": 1.2734375, "learning_rate": 0.0004216600366406236, "loss": 6.0152, "mean_token_accuracy": 0.15164154171943664, "num_tokens": 56988826.0, "step": 26330 }, { "entropy": 6.378601503372193, "epoch": 2.8181283107710415, "grad_norm": 1.1015625, "learning_rate": 0.00042163103942710487, "loss": 6.0524, "mean_token_accuracy": 0.14799215495586396, "num_tokens": 57000385.0, "step": 26335 }, { "entropy": 6.337564897537232, "epoch": 2.8186633848788056, "grad_norm": 1.7265625, "learning_rate": 0.0004216020379796354, "loss": 6.0074, "mean_token_accuracy": 0.16381412819027902, "num_tokens": 57012137.0, "step": 26340 }, { "entropy": 6.459012174606324, "epoch": 2.8191984589865697, "grad_norm": 1.3828125, "learning_rate": 0.00042157303229905277, "loss": 6.1013, "mean_token_accuracy": 0.1492543637752533, "num_tokens": 57022533.0, "step": 26345 }, { "entropy": 6.499421882629394, "epoch": 2.8197335330943334, "grad_norm": 1.1796875, "learning_rate": 0.00042154402238619434, "loss": 6.0785, "mean_token_accuracy": 0.14749213978648185, "num_tokens": 57034438.0, "step": 26350 }, { "entropy": 6.470699071884155, "epoch": 2.8202686072020975, "grad_norm": 2.265625, "learning_rate": 0.00042151500824189785, "loss": 6.0944, "mean_token_accuracy": 0.1473413124680519, "num_tokens": 57046343.0, "step": 26355 }, { "entropy": 6.453160429000855, "epoch": 2.8208036813098616, "grad_norm": 1.0, "learning_rate": 0.00042148598986700117, "loss": 6.0663, "mean_token_accuracy": 0.14620157182216645, "num_tokens": 57058269.0, "step": 26360 }, { "entropy": 6.411958503723144, "epoch": 2.8213387554176252, "grad_norm": 1.25, "learning_rate": 0.00042145696726234207, "loss": 6.019, "mean_token_accuracy": 0.15512288808822633, "num_tokens": 57069192.0, "step": 26365 }, { "entropy": 6.482750320434571, "epoch": 2.8218738295253893, "grad_norm": 1.21875, "learning_rate": 0.0004214279404287586, "loss": 6.0665, "mean_token_accuracy": 0.15206675976514816, "num_tokens": 57080021.0, "step": 26370 }, { "entropy": 6.400658655166626, "epoch": 2.8224089036331534, "grad_norm": 1.171875, "learning_rate": 0.0004213989093670889, "loss": 5.9775, "mean_token_accuracy": 0.15042894184589387, "num_tokens": 57090336.0, "step": 26375 }, { "entropy": 6.367533254623413, "epoch": 2.822943977740917, "grad_norm": 1.1171875, "learning_rate": 0.0004213698740781713, "loss": 6.0344, "mean_token_accuracy": 0.15316496342420577, "num_tokens": 57101942.0, "step": 26380 }, { "entropy": 6.409625911712647, "epoch": 2.823479051848681, "grad_norm": 1.1640625, "learning_rate": 0.0004213408345628442, "loss": 5.9928, "mean_token_accuracy": 0.15230459123849868, "num_tokens": 57112353.0, "step": 26385 }, { "entropy": 6.296683311462402, "epoch": 2.824014125956445, "grad_norm": 1.234375, "learning_rate": 0.000421311790821946, "loss": 5.8886, "mean_token_accuracy": 0.1791028618812561, "num_tokens": 57123796.0, "step": 26390 }, { "entropy": 6.427670907974243, "epoch": 2.824549200064209, "grad_norm": 1.375, "learning_rate": 0.00042128274285631545, "loss": 6.0366, "mean_token_accuracy": 0.1501665234565735, "num_tokens": 57134463.0, "step": 26395 }, { "entropy": 6.385494089126587, "epoch": 2.8250842741719726, "grad_norm": 1.171875, "learning_rate": 0.00042125369066679124, "loss": 5.9582, "mean_token_accuracy": 0.15315476357936858, "num_tokens": 57146964.0, "step": 26400 }, { "entropy": 6.468384552001953, "epoch": 2.8256193482797367, "grad_norm": 1.21875, "learning_rate": 0.00042122463425421224, "loss": 6.0392, "mean_token_accuracy": 0.14576466307044028, "num_tokens": 57157322.0, "step": 26405 }, { "entropy": 6.382465791702271, "epoch": 2.826154422387501, "grad_norm": 1.171875, "learning_rate": 0.0004211955736194175, "loss": 5.9468, "mean_token_accuracy": 0.15780599564313888, "num_tokens": 57168758.0, "step": 26410 }, { "entropy": 6.398380136489868, "epoch": 2.8266894964952645, "grad_norm": 1.140625, "learning_rate": 0.00042116650876324616, "loss": 6.001, "mean_token_accuracy": 0.15427615046501159, "num_tokens": 57180322.0, "step": 26415 }, { "entropy": 6.41349687576294, "epoch": 2.8272245706030286, "grad_norm": 1.1328125, "learning_rate": 0.0004211374396865373, "loss": 6.0272, "mean_token_accuracy": 0.14819267392158508, "num_tokens": 57190836.0, "step": 26420 }, { "entropy": 6.36381311416626, "epoch": 2.8277596447107927, "grad_norm": 1.109375, "learning_rate": 0.0004211083663901305, "loss": 6.0015, "mean_token_accuracy": 0.15367063581943513, "num_tokens": 57202439.0, "step": 26425 }, { "entropy": 6.490589761734009, "epoch": 2.8282947188185563, "grad_norm": 1.8125, "learning_rate": 0.0004210792888748651, "loss": 6.1876, "mean_token_accuracy": 0.13698135167360306, "num_tokens": 57213335.0, "step": 26430 }, { "entropy": 6.464270114898682, "epoch": 2.8288297929263204, "grad_norm": 1.1171875, "learning_rate": 0.00042105020714158076, "loss": 6.0557, "mean_token_accuracy": 0.14554350972175598, "num_tokens": 57223840.0, "step": 26435 }, { "entropy": 6.436989593505859, "epoch": 2.829364867034084, "grad_norm": 1.171875, "learning_rate": 0.00042102112119111725, "loss": 6.0581, "mean_token_accuracy": 0.14175086393952369, "num_tokens": 57234702.0, "step": 26440 }, { "entropy": 6.332023239135742, "epoch": 2.829899941141848, "grad_norm": 1.203125, "learning_rate": 0.0004209920310243144, "loss": 5.9782, "mean_token_accuracy": 0.15748982429504393, "num_tokens": 57247415.0, "step": 26445 }, { "entropy": 6.385210418701172, "epoch": 2.830435015249612, "grad_norm": 1.234375, "learning_rate": 0.0004209629366420121, "loss": 6.0091, "mean_token_accuracy": 0.15433283820748328, "num_tokens": 57257768.0, "step": 26450 }, { "entropy": 6.505837678909302, "epoch": 2.830970089357376, "grad_norm": 1.28125, "learning_rate": 0.0004209338380450506, "loss": 6.1948, "mean_token_accuracy": 0.14097389876842498, "num_tokens": 57268114.0, "step": 26455 }, { "entropy": 6.484896898269653, "epoch": 2.83150516346514, "grad_norm": 1.1015625, "learning_rate": 0.00042090473523426994, "loss": 6.0809, "mean_token_accuracy": 0.14675534069538115, "num_tokens": 57278680.0, "step": 26460 }, { "entropy": 6.498466634750367, "epoch": 2.8320402375729037, "grad_norm": 1.1953125, "learning_rate": 0.00042087562821051055, "loss": 6.109, "mean_token_accuracy": 0.14393219649791716, "num_tokens": 57289823.0, "step": 26465 }, { "entropy": 6.427369689941406, "epoch": 2.832575311680668, "grad_norm": 1.03125, "learning_rate": 0.00042084651697461297, "loss": 6.0216, "mean_token_accuracy": 0.14882372915744782, "num_tokens": 57300137.0, "step": 26470 }, { "entropy": 6.400393676757813, "epoch": 2.833110385788432, "grad_norm": 1.0390625, "learning_rate": 0.00042081740152741763, "loss": 5.9434, "mean_token_accuracy": 0.16098742187023163, "num_tokens": 57311160.0, "step": 26475 }, { "entropy": 6.400449657440186, "epoch": 2.8336454598961955, "grad_norm": 1.078125, "learning_rate": 0.0004207882818697654, "loss": 6.0423, "mean_token_accuracy": 0.1490056574344635, "num_tokens": 57322708.0, "step": 26480 }, { "entropy": 6.414525842666626, "epoch": 2.8341805340039596, "grad_norm": 1.125, "learning_rate": 0.000420759158002497, "loss": 5.9982, "mean_token_accuracy": 0.15236240327358247, "num_tokens": 57333788.0, "step": 26485 }, { "entropy": 6.450986528396607, "epoch": 2.8347156081117237, "grad_norm": 1.1328125, "learning_rate": 0.00042073002992645337, "loss": 6.0377, "mean_token_accuracy": 0.15622793436050414, "num_tokens": 57344806.0, "step": 26490 }, { "entropy": 6.469390726089477, "epoch": 2.8352506822194874, "grad_norm": 1.21875, "learning_rate": 0.0004207008976424756, "loss": 6.0986, "mean_token_accuracy": 0.14586670994758605, "num_tokens": 57355086.0, "step": 26495 }, { "entropy": 6.382518625259399, "epoch": 2.835785756327251, "grad_norm": 1.25, "learning_rate": 0.0004206717611514049, "loss": 5.9287, "mean_token_accuracy": 0.1586865097284317, "num_tokens": 57364837.0, "step": 26500 }, { "entropy": 6.403486156463623, "epoch": 2.836320830435015, "grad_norm": 1.1796875, "learning_rate": 0.0004206426204540825, "loss": 6.0535, "mean_token_accuracy": 0.1502322018146515, "num_tokens": 57376049.0, "step": 26505 }, { "entropy": 6.4489173412323, "epoch": 2.8368559045427792, "grad_norm": 1.2890625, "learning_rate": 0.00042061347555135, "loss": 6.0787, "mean_token_accuracy": 0.1436118006706238, "num_tokens": 57387829.0, "step": 26510 }, { "entropy": 6.458997583389282, "epoch": 2.837390978650543, "grad_norm": 1.25, "learning_rate": 0.0004205843264440488, "loss": 5.9971, "mean_token_accuracy": 0.15300317704677582, "num_tokens": 57397165.0, "step": 26515 }, { "entropy": 6.392493343353271, "epoch": 2.837926052758307, "grad_norm": 1.1328125, "learning_rate": 0.00042055517313302064, "loss": 6.0106, "mean_token_accuracy": 0.1520601987838745, "num_tokens": 57408602.0, "step": 26520 }, { "entropy": 6.389436435699463, "epoch": 2.838461126866071, "grad_norm": 1.1171875, "learning_rate": 0.0004205260156191073, "loss": 5.9609, "mean_token_accuracy": 0.15610310882329942, "num_tokens": 57419393.0, "step": 26525 }, { "entropy": 6.384090375900269, "epoch": 2.8389962009738348, "grad_norm": 1.109375, "learning_rate": 0.00042049685390315074, "loss": 6.0686, "mean_token_accuracy": 0.14963267594575883, "num_tokens": 57431238.0, "step": 26530 }, { "entropy": 6.448880290985107, "epoch": 2.839531275081599, "grad_norm": 1.5390625, "learning_rate": 0.00042046768798599293, "loss": 6.0094, "mean_token_accuracy": 0.1601277098059654, "num_tokens": 57442080.0, "step": 26535 }, { "entropy": 6.407636880874634, "epoch": 2.840066349189363, "grad_norm": 1.6875, "learning_rate": 0.0004204385178684761, "loss": 6.0283, "mean_token_accuracy": 0.15068115368485452, "num_tokens": 57452539.0, "step": 26540 }, { "entropy": 6.436146354675293, "epoch": 2.8406014232971266, "grad_norm": 1.1328125, "learning_rate": 0.00042040934355144245, "loss": 6.1496, "mean_token_accuracy": 0.14302660301327705, "num_tokens": 57464936.0, "step": 26545 }, { "entropy": 6.438657236099243, "epoch": 2.8411364974048907, "grad_norm": 2.421875, "learning_rate": 0.0004203801650357346, "loss": 6.028, "mean_token_accuracy": 0.15072648823261262, "num_tokens": 57477460.0, "step": 26550 }, { "entropy": 6.457589626312256, "epoch": 2.8416715715126544, "grad_norm": 1.2578125, "learning_rate": 0.0004203509823221947, "loss": 6.0556, "mean_token_accuracy": 0.1504028744995594, "num_tokens": 57487707.0, "step": 26555 }, { "entropy": 6.40608811378479, "epoch": 2.8422066456204185, "grad_norm": 1.203125, "learning_rate": 0.0004203217954116657, "loss": 6.0787, "mean_token_accuracy": 0.14950546324253083, "num_tokens": 57498107.0, "step": 26560 }, { "entropy": 6.437542152404785, "epoch": 2.842741719728182, "grad_norm": 1.15625, "learning_rate": 0.00042029260430499033, "loss": 5.9793, "mean_token_accuracy": 0.14859019666910173, "num_tokens": 57509035.0, "step": 26565 }, { "entropy": 6.410235452651977, "epoch": 2.8432767938359462, "grad_norm": 1.3359375, "learning_rate": 0.00042026340900301135, "loss": 6.081, "mean_token_accuracy": 0.1445617437362671, "num_tokens": 57521234.0, "step": 26570 }, { "entropy": 6.414348936080932, "epoch": 2.8438118679437103, "grad_norm": 2.53125, "learning_rate": 0.0004202342095065719, "loss": 5.9914, "mean_token_accuracy": 0.15504412353038788, "num_tokens": 57532294.0, "step": 26575 }, { "entropy": 6.470386123657226, "epoch": 2.844346942051474, "grad_norm": 1.28125, "learning_rate": 0.000420205005816515, "loss": 6.0167, "mean_token_accuracy": 0.15683928579092027, "num_tokens": 57542047.0, "step": 26580 }, { "entropy": 6.353037595748901, "epoch": 2.844882016159238, "grad_norm": 1.1796875, "learning_rate": 0.000420175797933684, "loss": 6.0224, "mean_token_accuracy": 0.15064765363931656, "num_tokens": 57553254.0, "step": 26585 }, { "entropy": 6.3797187328338625, "epoch": 2.845417090267002, "grad_norm": 1.1171875, "learning_rate": 0.00042014658585892223, "loss": 5.9715, "mean_token_accuracy": 0.16147678792476655, "num_tokens": 57564321.0, "step": 26590 }, { "entropy": 6.345517015457153, "epoch": 2.845952164374766, "grad_norm": 1.328125, "learning_rate": 0.00042011736959307323, "loss": 5.9342, "mean_token_accuracy": 0.15159724205732344, "num_tokens": 57575018.0, "step": 26595 }, { "entropy": 6.385954093933106, "epoch": 2.84648723848253, "grad_norm": 1.2734375, "learning_rate": 0.00042008814913698054, "loss": 6.0149, "mean_token_accuracy": 0.15120517313480378, "num_tokens": 57585698.0, "step": 26600 }, { "entropy": 6.409604167938232, "epoch": 2.8470223125902936, "grad_norm": 1.09375, "learning_rate": 0.0004200589244914879, "loss": 5.9872, "mean_token_accuracy": 0.15515661984682083, "num_tokens": 57595363.0, "step": 26605 }, { "entropy": 6.3503913402557375, "epoch": 2.8475573866980577, "grad_norm": 1.25, "learning_rate": 0.00042002969565743925, "loss": 5.996, "mean_token_accuracy": 0.16248847618699075, "num_tokens": 57605908.0, "step": 26610 }, { "entropy": 6.310200881958008, "epoch": 2.8480924608058213, "grad_norm": 1.09375, "learning_rate": 0.0004200004626356785, "loss": 5.9436, "mean_token_accuracy": 0.15958615243434907, "num_tokens": 57616172.0, "step": 26615 }, { "entropy": 6.408188056945801, "epoch": 2.8486275349135854, "grad_norm": 1.2265625, "learning_rate": 0.00041997122542704974, "loss": 5.9952, "mean_token_accuracy": 0.15232954770326615, "num_tokens": 57626770.0, "step": 26620 }, { "entropy": 6.360273742675782, "epoch": 2.8491626090213495, "grad_norm": 1.1328125, "learning_rate": 0.0004199419840323972, "loss": 5.9103, "mean_token_accuracy": 0.16150974929332734, "num_tokens": 57636576.0, "step": 26625 }, { "entropy": 6.303816223144532, "epoch": 2.849697683129113, "grad_norm": 1.296875, "learning_rate": 0.00041991273845256536, "loss": 5.9971, "mean_token_accuracy": 0.15867117643356324, "num_tokens": 57646431.0, "step": 26630 }, { "entropy": 6.354286861419678, "epoch": 2.8502327572368773, "grad_norm": 1.6015625, "learning_rate": 0.00041988348868839836, "loss": 5.9978, "mean_token_accuracy": 0.1539828896522522, "num_tokens": 57657412.0, "step": 26635 }, { "entropy": 6.45865387916565, "epoch": 2.8507678313446414, "grad_norm": 1.09375, "learning_rate": 0.0004198542347407412, "loss": 6.0298, "mean_token_accuracy": 0.15559379905462264, "num_tokens": 57667434.0, "step": 26640 }, { "entropy": 6.401463174819947, "epoch": 2.851302905452405, "grad_norm": 1.2109375, "learning_rate": 0.0004198249766104382, "loss": 6.0464, "mean_token_accuracy": 0.15440521091222764, "num_tokens": 57677640.0, "step": 26645 }, { "entropy": 6.408425569534302, "epoch": 2.851837979560169, "grad_norm": 1.171875, "learning_rate": 0.0004197957142983344, "loss": 6.0351, "mean_token_accuracy": 0.15036824494600295, "num_tokens": 57687909.0, "step": 26650 }, { "entropy": 6.488574838638305, "epoch": 2.8523730536679333, "grad_norm": 1.2578125, "learning_rate": 0.0004197664478052747, "loss": 6.1527, "mean_token_accuracy": 0.1438972160220146, "num_tokens": 57700374.0, "step": 26655 }, { "entropy": 6.481727600097656, "epoch": 2.852908127775697, "grad_norm": 1.1875, "learning_rate": 0.0004197371771321042, "loss": 6.0284, "mean_token_accuracy": 0.1529959946870804, "num_tokens": 57711577.0, "step": 26660 }, { "entropy": 6.341199541091919, "epoch": 2.853443201883461, "grad_norm": 1.1484375, "learning_rate": 0.00041970790227966804, "loss": 5.943, "mean_token_accuracy": 0.1603742554783821, "num_tokens": 57721259.0, "step": 26665 }, { "entropy": 6.35086989402771, "epoch": 2.8539782759912247, "grad_norm": 1.2578125, "learning_rate": 0.00041967862324881154, "loss": 6.0149, "mean_token_accuracy": 0.15057576596736907, "num_tokens": 57731499.0, "step": 26670 }, { "entropy": 6.474545526504516, "epoch": 2.8545133500989888, "grad_norm": 1.28125, "learning_rate": 0.0004196493400403801, "loss": 6.1071, "mean_token_accuracy": 0.14337437376379966, "num_tokens": 57742343.0, "step": 26675 }, { "entropy": 6.468021583557129, "epoch": 2.8550484242067524, "grad_norm": 1.296875, "learning_rate": 0.0004196200526552193, "loss": 6.0299, "mean_token_accuracy": 0.15668390989303588, "num_tokens": 57752942.0, "step": 26680 }, { "entropy": 6.479112720489502, "epoch": 2.8555834983145165, "grad_norm": 1.0703125, "learning_rate": 0.0004195907610941748, "loss": 6.0438, "mean_token_accuracy": 0.15321232080459596, "num_tokens": 57763623.0, "step": 26685 }, { "entropy": 6.334421682357788, "epoch": 2.8561185724222806, "grad_norm": 1.1640625, "learning_rate": 0.0004195614653580924, "loss": 6.0258, "mean_token_accuracy": 0.1475632146000862, "num_tokens": 57774538.0, "step": 26690 }, { "entropy": 6.361044788360596, "epoch": 2.8566536465300443, "grad_norm": 1.234375, "learning_rate": 0.00041953216544781796, "loss": 6.0153, "mean_token_accuracy": 0.15029519498348237, "num_tokens": 57785420.0, "step": 26695 }, { "entropy": 6.420391607284546, "epoch": 2.8571887206378084, "grad_norm": 1.1953125, "learning_rate": 0.00041950286136419756, "loss": 6.0163, "mean_token_accuracy": 0.14479026794433594, "num_tokens": 57796488.0, "step": 26700 }, { "entropy": 6.480253791809082, "epoch": 2.8577237947455725, "grad_norm": 1.171875, "learning_rate": 0.00041947355310807737, "loss": 6.0123, "mean_token_accuracy": 0.1494418740272522, "num_tokens": 57806391.0, "step": 26705 }, { "entropy": 6.378093719482422, "epoch": 2.858258868853336, "grad_norm": 1.546875, "learning_rate": 0.00041944424068030364, "loss": 6.0517, "mean_token_accuracy": 0.14750756174325944, "num_tokens": 57817410.0, "step": 26710 }, { "entropy": 6.43929352760315, "epoch": 2.8587939429611002, "grad_norm": 1.109375, "learning_rate": 0.00041941492408172277, "loss": 6.0654, "mean_token_accuracy": 0.14923201352357865, "num_tokens": 57828582.0, "step": 26715 }, { "entropy": 6.347782039642334, "epoch": 2.859329017068864, "grad_norm": 1.1953125, "learning_rate": 0.00041938560331318124, "loss": 5.9856, "mean_token_accuracy": 0.16159299165010452, "num_tokens": 57838962.0, "step": 26720 }, { "entropy": 6.4341823101043705, "epoch": 2.859864091176628, "grad_norm": 1.2734375, "learning_rate": 0.0004193562783755257, "loss": 6.0343, "mean_token_accuracy": 0.15648251697421073, "num_tokens": 57849335.0, "step": 26725 }, { "entropy": 6.452866268157959, "epoch": 2.8603991652843916, "grad_norm": 1.265625, "learning_rate": 0.0004193269492696029, "loss": 6.0243, "mean_token_accuracy": 0.15065740644931794, "num_tokens": 57860904.0, "step": 26730 }, { "entropy": 6.449029970169067, "epoch": 2.8609342393921557, "grad_norm": 1.171875, "learning_rate": 0.0004192976159962597, "loss": 6.0281, "mean_token_accuracy": 0.1481325715780258, "num_tokens": 57870861.0, "step": 26735 }, { "entropy": 6.354551792144775, "epoch": 2.86146931349992, "grad_norm": 1.078125, "learning_rate": 0.0004192682785563432, "loss": 6.05, "mean_token_accuracy": 0.14433916807174682, "num_tokens": 57881590.0, "step": 26740 }, { "entropy": 6.410019636154175, "epoch": 2.8620043876076835, "grad_norm": 1.0546875, "learning_rate": 0.0004192389369507004, "loss": 6.0123, "mean_token_accuracy": 0.15093303620815277, "num_tokens": 57892736.0, "step": 26745 }, { "entropy": 6.542281436920166, "epoch": 2.8625394617154476, "grad_norm": 1.0546875, "learning_rate": 0.0004192095911801785, "loss": 6.0954, "mean_token_accuracy": 0.1412319876253605, "num_tokens": 57904340.0, "step": 26750 }, { "entropy": 6.458233070373535, "epoch": 2.8630745358232117, "grad_norm": 1.09375, "learning_rate": 0.000419180241245625, "loss": 6.0322, "mean_token_accuracy": 0.15415556877851486, "num_tokens": 57916369.0, "step": 26755 }, { "entropy": 6.366694164276123, "epoch": 2.8636096099309754, "grad_norm": 1.109375, "learning_rate": 0.0004191508871478873, "loss": 6.093, "mean_token_accuracy": 0.14483662545681, "num_tokens": 57926867.0, "step": 26760 }, { "entropy": 6.406448221206665, "epoch": 2.8641446840387395, "grad_norm": 1.109375, "learning_rate": 0.00041912152888781283, "loss": 5.9696, "mean_token_accuracy": 0.1496852308511734, "num_tokens": 57938408.0, "step": 26765 }, { "entropy": 6.488473749160766, "epoch": 2.8646797581465036, "grad_norm": 1.140625, "learning_rate": 0.00041909216646624967, "loss": 5.9853, "mean_token_accuracy": 0.1590641990303993, "num_tokens": 57948821.0, "step": 26770 }, { "entropy": 6.411574125289917, "epoch": 2.865214832254267, "grad_norm": 0.99609375, "learning_rate": 0.0004190627998840453, "loss": 6.0908, "mean_token_accuracy": 0.15112300589680672, "num_tokens": 57959589.0, "step": 26775 }, { "entropy": 6.400305986404419, "epoch": 2.8657499063620313, "grad_norm": 1.1484375, "learning_rate": 0.0004190334291420479, "loss": 6.0213, "mean_token_accuracy": 0.14814646989107133, "num_tokens": 57970508.0, "step": 26780 }, { "entropy": 6.4455334663391115, "epoch": 2.866284980469795, "grad_norm": 1.1328125, "learning_rate": 0.0004190040542411055, "loss": 6.0105, "mean_token_accuracy": 0.15378978252410888, "num_tokens": 57980411.0, "step": 26785 }, { "entropy": 6.424951362609863, "epoch": 2.866820054577559, "grad_norm": 1.109375, "learning_rate": 0.00041897467518206614, "loss": 6.0366, "mean_token_accuracy": 0.1573548808693886, "num_tokens": 57991457.0, "step": 26790 }, { "entropy": 6.458602666854858, "epoch": 2.8673551286853227, "grad_norm": 1.140625, "learning_rate": 0.0004189452919657784, "loss": 6.1027, "mean_token_accuracy": 0.13983291909098625, "num_tokens": 58001860.0, "step": 26795 }, { "entropy": 6.472284555435181, "epoch": 2.867890202793087, "grad_norm": 1.1796875, "learning_rate": 0.00041891590459309055, "loss": 6.0901, "mean_token_accuracy": 0.14592931792140007, "num_tokens": 58011958.0, "step": 26800 }, { "entropy": 6.407073545455932, "epoch": 2.868425276900851, "grad_norm": 1.0859375, "learning_rate": 0.00041888651306485117, "loss": 5.9973, "mean_token_accuracy": 0.153120244294405, "num_tokens": 58022216.0, "step": 26805 }, { "entropy": 6.403811883926392, "epoch": 2.8689603510086146, "grad_norm": 1.1328125, "learning_rate": 0.00041885711738190895, "loss": 6.0164, "mean_token_accuracy": 0.15083375424146653, "num_tokens": 58032502.0, "step": 26810 }, { "entropy": 6.372001981735229, "epoch": 2.8694954251163787, "grad_norm": 1.2109375, "learning_rate": 0.0004188277175451126, "loss": 6.0532, "mean_token_accuracy": 0.1517692118883133, "num_tokens": 58043944.0, "step": 26815 }, { "entropy": 6.443247604370117, "epoch": 2.8700304992241428, "grad_norm": 1.140625, "learning_rate": 0.00041879831355531123, "loss": 6.1012, "mean_token_accuracy": 0.14562223106622696, "num_tokens": 58055857.0, "step": 26820 }, { "entropy": 6.3814051151275635, "epoch": 2.8705655733319064, "grad_norm": 1.4375, "learning_rate": 0.0004187689054133537, "loss": 6.0435, "mean_token_accuracy": 0.15365127250552177, "num_tokens": 58067070.0, "step": 26825 }, { "entropy": 6.332041263580322, "epoch": 2.8711006474396705, "grad_norm": 1.3125, "learning_rate": 0.0004187394931200893, "loss": 5.875, "mean_token_accuracy": 0.15968974828720092, "num_tokens": 58077922.0, "step": 26830 }, { "entropy": 6.412332010269165, "epoch": 2.871635721547434, "grad_norm": 1.1484375, "learning_rate": 0.0004187100766763671, "loss": 5.9943, "mean_token_accuracy": 0.15546340197324754, "num_tokens": 58089698.0, "step": 26835 }, { "entropy": 6.462100601196289, "epoch": 2.8721707956551983, "grad_norm": 1.15625, "learning_rate": 0.00041868065608303674, "loss": 5.9928, "mean_token_accuracy": 0.15846218764781952, "num_tokens": 58100640.0, "step": 26840 }, { "entropy": 6.404068088531494, "epoch": 2.872705869762962, "grad_norm": 1.2421875, "learning_rate": 0.0004186512313409476, "loss": 6.0764, "mean_token_accuracy": 0.1470884382724762, "num_tokens": 58112810.0, "step": 26845 }, { "entropy": 6.468878316879272, "epoch": 2.873240943870726, "grad_norm": 1.359375, "learning_rate": 0.0004186218024509493, "loss": 6.1026, "mean_token_accuracy": 0.14706760197877883, "num_tokens": 58123818.0, "step": 26850 }, { "entropy": 6.450071716308594, "epoch": 2.87377601797849, "grad_norm": 1.140625, "learning_rate": 0.00041859236941389175, "loss": 6.0636, "mean_token_accuracy": 0.14915749058127403, "num_tokens": 58134785.0, "step": 26855 }, { "entropy": 6.4456321716308596, "epoch": 2.874311092086254, "grad_norm": 1.390625, "learning_rate": 0.0004185629322306246, "loss": 6.0542, "mean_token_accuracy": 0.15013698488473892, "num_tokens": 58144987.0, "step": 26860 }, { "entropy": 6.416501665115357, "epoch": 2.874846166194018, "grad_norm": 1.1484375, "learning_rate": 0.00041853349090199805, "loss": 5.9887, "mean_token_accuracy": 0.15730877071619034, "num_tokens": 58155031.0, "step": 26865 }, { "entropy": 6.322882843017578, "epoch": 2.875381240301782, "grad_norm": 1.0625, "learning_rate": 0.000418504045428862, "loss": 5.9662, "mean_token_accuracy": 0.1569364346563816, "num_tokens": 58165216.0, "step": 26870 }, { "entropy": 6.395208215713501, "epoch": 2.8759163144095456, "grad_norm": 1.09375, "learning_rate": 0.0004184745958120669, "loss": 6.0418, "mean_token_accuracy": 0.15620874911546706, "num_tokens": 58176329.0, "step": 26875 }, { "entropy": 6.495823526382447, "epoch": 2.8764513885173097, "grad_norm": 1.15625, "learning_rate": 0.00041844514205246293, "loss": 6.0473, "mean_token_accuracy": 0.1500655770301819, "num_tokens": 58187058.0, "step": 26880 }, { "entropy": 6.457627201080323, "epoch": 2.876986462625074, "grad_norm": 1.2578125, "learning_rate": 0.0004184156841509007, "loss": 6.0258, "mean_token_accuracy": 0.15183956176042557, "num_tokens": 58196579.0, "step": 26885 }, { "entropy": 6.296269464492798, "epoch": 2.8775215367328375, "grad_norm": 1.1328125, "learning_rate": 0.00041838622210823076, "loss": 5.9652, "mean_token_accuracy": 0.15458275824785234, "num_tokens": 58206689.0, "step": 26890 }, { "entropy": 6.426440954208374, "epoch": 2.878056610840601, "grad_norm": 1.2421875, "learning_rate": 0.0004183567559253037, "loss": 6.0319, "mean_token_accuracy": 0.1525313824415207, "num_tokens": 58218093.0, "step": 26895 }, { "entropy": 6.464215850830078, "epoch": 2.8785916849483653, "grad_norm": 1.1953125, "learning_rate": 0.00041832728560297055, "loss": 6.0616, "mean_token_accuracy": 0.14989352375268936, "num_tokens": 58228587.0, "step": 26900 }, { "entropy": 6.3886962890625, "epoch": 2.8791267590561294, "grad_norm": 1.4140625, "learning_rate": 0.00041829781114208214, "loss": 5.9254, "mean_token_accuracy": 0.15750156939029694, "num_tokens": 58240500.0, "step": 26905 }, { "entropy": 6.350870990753174, "epoch": 2.879661833163893, "grad_norm": 1.125, "learning_rate": 0.00041826833254348956, "loss": 6.0106, "mean_token_accuracy": 0.14876446574926377, "num_tokens": 58252253.0, "step": 26910 }, { "entropy": 6.457035493850708, "epoch": 2.880196907271657, "grad_norm": 1.171875, "learning_rate": 0.00041823884980804406, "loss": 6.0888, "mean_token_accuracy": 0.1494783192873001, "num_tokens": 58263356.0, "step": 26915 }, { "entropy": 6.3225400924682615, "epoch": 2.880731981379421, "grad_norm": 1.203125, "learning_rate": 0.00041820936293659685, "loss": 5.8802, "mean_token_accuracy": 0.1557753175497055, "num_tokens": 58273270.0, "step": 26920 }, { "entropy": 6.409237098693848, "epoch": 2.881267055487185, "grad_norm": 1.09375, "learning_rate": 0.00041817987192999947, "loss": 6.0043, "mean_token_accuracy": 0.14683982580900193, "num_tokens": 58284669.0, "step": 26925 }, { "entropy": 6.453193140029907, "epoch": 2.881802129594949, "grad_norm": 1.4296875, "learning_rate": 0.00041815037678910334, "loss": 6.1108, "mean_token_accuracy": 0.15075706243515014, "num_tokens": 58294791.0, "step": 26930 }, { "entropy": 6.490873908996582, "epoch": 2.882337203702713, "grad_norm": 1.1328125, "learning_rate": 0.0004181208775147602, "loss": 6.0651, "mean_token_accuracy": 0.1498957723379135, "num_tokens": 58305789.0, "step": 26935 }, { "entropy": 6.452756404876709, "epoch": 2.8828722778104767, "grad_norm": 1.3828125, "learning_rate": 0.0004180913741078218, "loss": 6.0455, "mean_token_accuracy": 0.14747522994875908, "num_tokens": 58317547.0, "step": 26940 }, { "entropy": 6.401312923431396, "epoch": 2.883407351918241, "grad_norm": 1.109375, "learning_rate": 0.0004180618665691402, "loss": 5.9892, "mean_token_accuracy": 0.1527828760445118, "num_tokens": 58328408.0, "step": 26945 }, { "entropy": 6.290218782424927, "epoch": 2.8839424260260045, "grad_norm": 1.234375, "learning_rate": 0.0004180323548995672, "loss": 5.8855, "mean_token_accuracy": 0.17409270107746125, "num_tokens": 58339356.0, "step": 26950 }, { "entropy": 6.368633222579956, "epoch": 2.8844775001337686, "grad_norm": 1.5, "learning_rate": 0.00041800283909995505, "loss": 5.9322, "mean_token_accuracy": 0.1625841073691845, "num_tokens": 58349016.0, "step": 26955 }, { "entropy": 6.4525960922241214, "epoch": 2.8850125742415322, "grad_norm": 1.2109375, "learning_rate": 0.0004179733191711561, "loss": 6.1007, "mean_token_accuracy": 0.14001980572938919, "num_tokens": 58360188.0, "step": 26960 }, { "entropy": 6.518548202514649, "epoch": 2.8855476483492963, "grad_norm": 1.4296875, "learning_rate": 0.00041794379511402263, "loss": 6.0611, "mean_token_accuracy": 0.14841486513614655, "num_tokens": 58370733.0, "step": 26965 }, { "entropy": 6.398956918716431, "epoch": 2.8860827224570604, "grad_norm": 1.21875, "learning_rate": 0.0004179142669294071, "loss": 5.9988, "mean_token_accuracy": 0.1466510623693466, "num_tokens": 58382249.0, "step": 26970 }, { "entropy": 6.369844722747803, "epoch": 2.886617796564824, "grad_norm": 1.3671875, "learning_rate": 0.00041788473461816224, "loss": 5.9615, "mean_token_accuracy": 0.15576791763305664, "num_tokens": 58393598.0, "step": 26975 }, { "entropy": 6.414325380325318, "epoch": 2.887152870672588, "grad_norm": 1.1328125, "learning_rate": 0.00041785519818114073, "loss": 6.0366, "mean_token_accuracy": 0.14889776557683945, "num_tokens": 58403920.0, "step": 26980 }, { "entropy": 6.387530279159546, "epoch": 2.8876879447803523, "grad_norm": 1.140625, "learning_rate": 0.00041782565761919546, "loss": 6.0416, "mean_token_accuracy": 0.14682680740952492, "num_tokens": 58413691.0, "step": 26985 }, { "entropy": 6.472382116317749, "epoch": 2.888223018888116, "grad_norm": 1.171875, "learning_rate": 0.00041779611293317936, "loss": 6.0945, "mean_token_accuracy": 0.14470405876636505, "num_tokens": 58425995.0, "step": 26990 }, { "entropy": 6.456513118743897, "epoch": 2.88875809299588, "grad_norm": 1.1484375, "learning_rate": 0.0004177665641239456, "loss": 6.0216, "mean_token_accuracy": 0.14884288981556892, "num_tokens": 58435984.0, "step": 26995 }, { "entropy": 6.4106457233428955, "epoch": 2.8892931671036437, "grad_norm": 1.0546875, "learning_rate": 0.00041773701119234734, "loss": 6.0759, "mean_token_accuracy": 0.1486773058772087, "num_tokens": 58447630.0, "step": 27000 }, { "epoch": 2.8892931671036437, "eval_entropy": 6.218136414042059, "eval_loss": 6.141349792480469, "eval_mean_token_accuracy": 0.15345027208970885, "eval_num_tokens": 58447630.0, "eval_runtime": 22.5656, "eval_samples_per_second": 1315.232, "eval_steps_per_second": 164.41, "step": 27000 } ], "logging_steps": 5, "max_steps": 93440, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 8.5939567852032e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }