{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.9262132805393546, "eval_steps": 3000, "global_step": 18000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691989517211914, "epoch": 0.0005350741077639254, "grad_norm": 10.75, "learning_rate": 2e-06, "loss": 10.8201, "mean_token_accuracy": 0.0, "num_tokens": 10038.0, "step": 5 }, { "entropy": 10.69193468093872, "epoch": 0.0010701482155278507, "grad_norm": 11.9375, "learning_rate": 4.5e-06, "loss": 10.789, "mean_token_accuracy": 0.00010810811072587967, "num_tokens": 21916.0, "step": 10 }, { "entropy": 10.690756225585938, "epoch": 0.0016052223232917758, "grad_norm": 8.875, "learning_rate": 7e-06, "loss": 10.5855, "mean_token_accuracy": 0.029181174421682953, "num_tokens": 33434.0, "step": 15 }, { "entropy": 10.660381984710693, "epoch": 0.0021402964310557014, "grad_norm": 5.71875, "learning_rate": 9.5e-06, "loss": 10.3113, "mean_token_accuracy": 0.04592931531369686, "num_tokens": 44216.0, "step": 20 }, { "entropy": 10.51073760986328, "epoch": 0.0026753705388196263, "grad_norm": 3.71875, "learning_rate": 1.2e-05, "loss": 10.1036, "mean_token_accuracy": 0.04351861346513033, "num_tokens": 54874.0, "step": 25 }, { "entropy": 10.5190824508667, "epoch": 0.0032104446465835517, "grad_norm": 3.09375, "learning_rate": 1.4500000000000002e-05, "loss": 9.9872, "mean_token_accuracy": 0.041112912446260454, "num_tokens": 65085.0, "step": 30 }, { "entropy": 10.547387790679931, "epoch": 0.003745518754347477, "grad_norm": 2.859375, "learning_rate": 1.7000000000000003e-05, "loss": 9.904, "mean_token_accuracy": 0.04395376648753881, "num_tokens": 75601.0, "step": 35 }, { "entropy": 10.474061203002929, "epoch": 0.004280592862111403, "grad_norm": 2.515625, "learning_rate": 1.95e-05, "loss": 9.8879, "mean_token_accuracy": 0.04307105913758278, "num_tokens": 86193.0, "step": 40 }, { "entropy": 10.531705379486084, "epoch": 0.004815666969875327, "grad_norm": 2.40625, "learning_rate": 2.2e-05, "loss": 9.8417, "mean_token_accuracy": 0.043867765367031096, "num_tokens": 96957.0, "step": 45 }, { "entropy": 10.478270435333252, "epoch": 0.005350741077639253, "grad_norm": 2.171875, "learning_rate": 2.4500000000000003e-05, "loss": 9.8114, "mean_token_accuracy": 0.046108495071530343, "num_tokens": 108408.0, "step": 50 }, { "entropy": 10.473760986328125, "epoch": 0.005885815185403178, "grad_norm": 1.7578125, "learning_rate": 2.7e-05, "loss": 9.7686, "mean_token_accuracy": 0.05027508921921253, "num_tokens": 119273.0, "step": 55 }, { "entropy": 10.462549209594727, "epoch": 0.006420889293167103, "grad_norm": 1.921875, "learning_rate": 2.95e-05, "loss": 9.6954, "mean_token_accuracy": 0.05541543699800968, "num_tokens": 130817.0, "step": 60 }, { "entropy": 10.302016353607177, "epoch": 0.006955963400931029, "grad_norm": 1.8671875, "learning_rate": 3.2e-05, "loss": 9.6448, "mean_token_accuracy": 0.05586838573217392, "num_tokens": 142599.0, "step": 65 }, { "entropy": 10.404022407531738, "epoch": 0.007491037508694954, "grad_norm": 1.9609375, "learning_rate": 3.4500000000000005e-05, "loss": 9.5697, "mean_token_accuracy": 0.05663685463368893, "num_tokens": 153617.0, "step": 70 }, { "entropy": 10.37060546875, "epoch": 0.00802611161645888, "grad_norm": 1.6953125, "learning_rate": 3.7e-05, "loss": 9.5239, "mean_token_accuracy": 0.05575243458151817, "num_tokens": 165280.0, "step": 75 }, { "entropy": 10.341149616241456, "epoch": 0.008561185724222806, "grad_norm": 1.546875, "learning_rate": 3.95e-05, "loss": 9.4643, "mean_token_accuracy": 0.055300182476639745, "num_tokens": 176896.0, "step": 80 }, { "entropy": 10.367101669311523, "epoch": 0.00909625983198673, "grad_norm": 1.5859375, "learning_rate": 4.2000000000000004e-05, "loss": 9.4019, "mean_token_accuracy": 0.05629164129495621, "num_tokens": 188000.0, "step": 85 }, { "entropy": 10.27455005645752, "epoch": 0.009631333939750655, "grad_norm": 1.6953125, "learning_rate": 4.45e-05, "loss": 9.3493, "mean_token_accuracy": 0.057158011198043826, "num_tokens": 199360.0, "step": 90 }, { "entropy": 10.319551277160645, "epoch": 0.01016640804751458, "grad_norm": 1.5703125, "learning_rate": 4.7000000000000004e-05, "loss": 9.2957, "mean_token_accuracy": 0.052791529521346095, "num_tokens": 210214.0, "step": 95 }, { "entropy": 10.196423625946045, "epoch": 0.010701482155278505, "grad_norm": 1.5078125, "learning_rate": 4.9500000000000004e-05, "loss": 9.1506, "mean_token_accuracy": 0.06025413721799851, "num_tokens": 220567.0, "step": 100 }, { "entropy": 10.14912462234497, "epoch": 0.011236556263042432, "grad_norm": 1.578125, "learning_rate": 5.2e-05, "loss": 9.057, "mean_token_accuracy": 0.06051998771727085, "num_tokens": 230585.0, "step": 105 }, { "entropy": 10.099914455413819, "epoch": 0.011771630370806356, "grad_norm": 1.53125, "learning_rate": 5.45e-05, "loss": 8.9907, "mean_token_accuracy": 0.06339392885565757, "num_tokens": 241996.0, "step": 110 }, { "entropy": 10.083064746856689, "epoch": 0.012306704478570282, "grad_norm": 1.3671875, "learning_rate": 5.7e-05, "loss": 8.9558, "mean_token_accuracy": 0.05828723199665546, "num_tokens": 253348.0, "step": 115 }, { "entropy": 9.981218147277833, "epoch": 0.012841778586334207, "grad_norm": 1.421875, "learning_rate": 5.9499999999999996e-05, "loss": 8.8376, "mean_token_accuracy": 0.05671278983354568, "num_tokens": 264239.0, "step": 120 }, { "entropy": 9.828715324401855, "epoch": 0.013376852694098133, "grad_norm": 1.2578125, "learning_rate": 6.2e-05, "loss": 8.7502, "mean_token_accuracy": 0.056628919392824176, "num_tokens": 274522.0, "step": 125 }, { "entropy": 9.77067985534668, "epoch": 0.013911926801862057, "grad_norm": 1.34375, "learning_rate": 6.450000000000001e-05, "loss": 8.6474, "mean_token_accuracy": 0.06091504544019699, "num_tokens": 284492.0, "step": 130 }, { "entropy": 9.592880916595458, "epoch": 0.014447000909625984, "grad_norm": 1.40625, "learning_rate": 6.7e-05, "loss": 8.6035, "mean_token_accuracy": 0.05946716032922268, "num_tokens": 294796.0, "step": 135 }, { "entropy": 9.45958080291748, "epoch": 0.014982075017389908, "grad_norm": 1.0, "learning_rate": 6.950000000000001e-05, "loss": 8.574, "mean_token_accuracy": 0.05749143101274967, "num_tokens": 305252.0, "step": 140 }, { "entropy": 9.359578514099121, "epoch": 0.015517149125153834, "grad_norm": 1.0859375, "learning_rate": 7.2e-05, "loss": 8.4804, "mean_token_accuracy": 0.056437050178647044, "num_tokens": 315505.0, "step": 145 }, { "entropy": 9.158096408843994, "epoch": 0.01605222323291776, "grad_norm": 1.5, "learning_rate": 7.45e-05, "loss": 8.4819, "mean_token_accuracy": 0.05990221984684467, "num_tokens": 326997.0, "step": 150 }, { "entropy": 9.094014644622803, "epoch": 0.016587297340681685, "grad_norm": 1.109375, "learning_rate": 7.7e-05, "loss": 8.4165, "mean_token_accuracy": 0.05523004196584225, "num_tokens": 338089.0, "step": 155 }, { "entropy": 8.880174732208252, "epoch": 0.01712237144844561, "grad_norm": 1.234375, "learning_rate": 7.950000000000001e-05, "loss": 8.4077, "mean_token_accuracy": 0.05682347491383553, "num_tokens": 348536.0, "step": 160 }, { "entropy": 8.93060073852539, "epoch": 0.017657445556209534, "grad_norm": 0.9296875, "learning_rate": 8.2e-05, "loss": 8.4181, "mean_token_accuracy": 0.058796605467796324, "num_tokens": 359776.0, "step": 165 }, { "entropy": 8.809493732452392, "epoch": 0.01819251966397346, "grad_norm": 1.015625, "learning_rate": 8.450000000000001e-05, "loss": 8.3472, "mean_token_accuracy": 0.06165213547646999, "num_tokens": 370810.0, "step": 170 }, { "entropy": 8.747115898132325, "epoch": 0.018727593771737387, "grad_norm": 0.94140625, "learning_rate": 8.7e-05, "loss": 8.3511, "mean_token_accuracy": 0.05888295993208885, "num_tokens": 381788.0, "step": 175 }, { "entropy": 8.742884063720703, "epoch": 0.01926266787950131, "grad_norm": 1.0390625, "learning_rate": 8.95e-05, "loss": 8.3376, "mean_token_accuracy": 0.0602983683347702, "num_tokens": 391984.0, "step": 180 }, { "entropy": 8.610486602783203, "epoch": 0.019797741987265235, "grad_norm": 1.0, "learning_rate": 9.2e-05, "loss": 8.3311, "mean_token_accuracy": 0.058925900235772134, "num_tokens": 403430.0, "step": 185 }, { "entropy": 8.670144844055176, "epoch": 0.02033281609502916, "grad_norm": 1.0234375, "learning_rate": 9.45e-05, "loss": 8.318, "mean_token_accuracy": 0.05627542734146118, "num_tokens": 414467.0, "step": 190 }, { "entropy": 8.56268243789673, "epoch": 0.020867890202793088, "grad_norm": 0.921875, "learning_rate": 9.7e-05, "loss": 8.2838, "mean_token_accuracy": 0.06462269835174084, "num_tokens": 425752.0, "step": 195 }, { "entropy": 8.562543296813965, "epoch": 0.02140296431055701, "grad_norm": 0.94921875, "learning_rate": 9.95e-05, "loss": 8.2618, "mean_token_accuracy": 0.06471644267439843, "num_tokens": 435908.0, "step": 200 }, { "entropy": 8.58950891494751, "epoch": 0.021938038418320937, "grad_norm": 1.0390625, "learning_rate": 0.000102, "loss": 8.3051, "mean_token_accuracy": 0.05973440445959568, "num_tokens": 446424.0, "step": 205 }, { "entropy": 8.575794887542724, "epoch": 0.022473112526084863, "grad_norm": 1.03125, "learning_rate": 0.00010449999999999999, "loss": 8.2691, "mean_token_accuracy": 0.0648487914353609, "num_tokens": 456854.0, "step": 210 }, { "entropy": 8.506811428070069, "epoch": 0.02300818663384879, "grad_norm": 1.078125, "learning_rate": 0.000107, "loss": 8.2861, "mean_token_accuracy": 0.06673729792237282, "num_tokens": 467899.0, "step": 215 }, { "entropy": 8.497941493988037, "epoch": 0.023543260741612712, "grad_norm": 1.0078125, "learning_rate": 0.0001095, "loss": 8.2297, "mean_token_accuracy": 0.06340378113090991, "num_tokens": 478683.0, "step": 220 }, { "entropy": 8.574148082733155, "epoch": 0.02407833484937664, "grad_norm": 1.046875, "learning_rate": 0.000112, "loss": 8.2648, "mean_token_accuracy": 0.06170066706836223, "num_tokens": 488745.0, "step": 225 }, { "entropy": 8.4907470703125, "epoch": 0.024613408957140565, "grad_norm": 1.0703125, "learning_rate": 0.0001145, "loss": 8.3431, "mean_token_accuracy": 0.059930100291967395, "num_tokens": 499448.0, "step": 230 }, { "entropy": 8.599916458129883, "epoch": 0.02514848306490449, "grad_norm": 0.95703125, "learning_rate": 0.00011700000000000001, "loss": 8.27, "mean_token_accuracy": 0.0650645636022091, "num_tokens": 510148.0, "step": 235 }, { "entropy": 8.483675956726074, "epoch": 0.025683557172668414, "grad_norm": 1.0078125, "learning_rate": 0.00011949999999999999, "loss": 8.1965, "mean_token_accuracy": 0.06112907975912094, "num_tokens": 522093.0, "step": 240 }, { "entropy": 8.460341262817384, "epoch": 0.02621863128043234, "grad_norm": 1.015625, "learning_rate": 0.000122, "loss": 8.2277, "mean_token_accuracy": 0.06530554480850696, "num_tokens": 532598.0, "step": 245 }, { "entropy": 8.49462070465088, "epoch": 0.026753705388196266, "grad_norm": 1.171875, "learning_rate": 0.0001245, "loss": 8.1956, "mean_token_accuracy": 0.06578520573675632, "num_tokens": 542652.0, "step": 250 }, { "entropy": 8.460633659362793, "epoch": 0.027288779495960192, "grad_norm": 1.015625, "learning_rate": 0.000127, "loss": 8.2328, "mean_token_accuracy": 0.06693280301988125, "num_tokens": 552526.0, "step": 255 }, { "entropy": 8.399180793762207, "epoch": 0.027823853603724115, "grad_norm": 0.98046875, "learning_rate": 0.0001295, "loss": 8.2517, "mean_token_accuracy": 0.06344069167971611, "num_tokens": 563143.0, "step": 260 }, { "entropy": 8.48379201889038, "epoch": 0.02835892771148804, "grad_norm": 0.94921875, "learning_rate": 0.000132, "loss": 8.2149, "mean_token_accuracy": 0.06581672765314579, "num_tokens": 573814.0, "step": 265 }, { "entropy": 8.457896327972412, "epoch": 0.028894001819251967, "grad_norm": 0.890625, "learning_rate": 0.00013450000000000002, "loss": 8.1733, "mean_token_accuracy": 0.07218663729727268, "num_tokens": 585367.0, "step": 270 }, { "entropy": 8.507985496520996, "epoch": 0.02942907592701589, "grad_norm": 3.078125, "learning_rate": 0.00013700000000000002, "loss": 8.2318, "mean_token_accuracy": 0.06521918512880802, "num_tokens": 595902.0, "step": 275 }, { "entropy": 8.41034107208252, "epoch": 0.029964150034779816, "grad_norm": 1.4375, "learning_rate": 0.0001395, "loss": 8.138, "mean_token_accuracy": 0.0642226304858923, "num_tokens": 607178.0, "step": 280 }, { "entropy": 8.431483745574951, "epoch": 0.030499224142543743, "grad_norm": 0.94140625, "learning_rate": 0.00014199999999999998, "loss": 8.1309, "mean_token_accuracy": 0.06817701198160649, "num_tokens": 618604.0, "step": 285 }, { "entropy": 8.404507827758788, "epoch": 0.03103429825030767, "grad_norm": 0.9921875, "learning_rate": 0.0001445, "loss": 8.2, "mean_token_accuracy": 0.0719299040734768, "num_tokens": 628111.0, "step": 290 }, { "entropy": 8.490602397918702, "epoch": 0.03156937235807159, "grad_norm": 1.453125, "learning_rate": 0.000147, "loss": 8.2289, "mean_token_accuracy": 0.06933129876852036, "num_tokens": 639358.0, "step": 295 }, { "entropy": 8.35900354385376, "epoch": 0.03210444646583552, "grad_norm": 1.0078125, "learning_rate": 0.0001495, "loss": 8.0903, "mean_token_accuracy": 0.07086234539747238, "num_tokens": 649504.0, "step": 300 }, { "entropy": 8.400328350067138, "epoch": 0.032639520573599444, "grad_norm": 1.1171875, "learning_rate": 0.000152, "loss": 8.1111, "mean_token_accuracy": 0.0681851863861084, "num_tokens": 659924.0, "step": 305 }, { "entropy": 8.422282886505126, "epoch": 0.03317459468136337, "grad_norm": 1.328125, "learning_rate": 0.00015450000000000001, "loss": 8.15, "mean_token_accuracy": 0.06455899253487588, "num_tokens": 671120.0, "step": 310 }, { "entropy": 8.319589424133301, "epoch": 0.033709668789127296, "grad_norm": 1.0390625, "learning_rate": 0.000157, "loss": 8.1985, "mean_token_accuracy": 0.06430512070655822, "num_tokens": 681956.0, "step": 315 }, { "entropy": 8.48956241607666, "epoch": 0.03424474289689122, "grad_norm": 0.953125, "learning_rate": 0.0001595, "loss": 8.182, "mean_token_accuracy": 0.06503869034349918, "num_tokens": 693226.0, "step": 320 }, { "entropy": 8.33993911743164, "epoch": 0.03477981700465514, "grad_norm": 0.94140625, "learning_rate": 0.000162, "loss": 8.1812, "mean_token_accuracy": 0.07134119421243668, "num_tokens": 704691.0, "step": 325 }, { "entropy": 8.362220954895019, "epoch": 0.03531489111241907, "grad_norm": 0.94921875, "learning_rate": 0.00016450000000000001, "loss": 8.1304, "mean_token_accuracy": 0.062357674539089206, "num_tokens": 716000.0, "step": 330 }, { "entropy": 8.332426834106446, "epoch": 0.035849965220182994, "grad_norm": 0.9296875, "learning_rate": 0.00016700000000000002, "loss": 8.0529, "mean_token_accuracy": 0.06962560564279556, "num_tokens": 726723.0, "step": 335 }, { "entropy": 8.32654685974121, "epoch": 0.03638503932794692, "grad_norm": 1.0390625, "learning_rate": 0.00016950000000000003, "loss": 8.0646, "mean_token_accuracy": 0.07072275690734386, "num_tokens": 736740.0, "step": 340 }, { "entropy": 8.333600425720215, "epoch": 0.03692011343571085, "grad_norm": 1.859375, "learning_rate": 0.00017199999999999998, "loss": 8.1131, "mean_token_accuracy": 0.068069913610816, "num_tokens": 747567.0, "step": 345 }, { "entropy": 8.398985290527344, "epoch": 0.03745518754347477, "grad_norm": 1.03125, "learning_rate": 0.00017449999999999999, "loss": 8.0626, "mean_token_accuracy": 0.06914932392537594, "num_tokens": 757937.0, "step": 350 }, { "entropy": 8.163579368591309, "epoch": 0.0379902616512387, "grad_norm": 1.0234375, "learning_rate": 0.000177, "loss": 8.0955, "mean_token_accuracy": 0.07165054567158222, "num_tokens": 768003.0, "step": 355 }, { "entropy": 8.49596710205078, "epoch": 0.03852533575900262, "grad_norm": 0.9453125, "learning_rate": 0.0001795, "loss": 8.1288, "mean_token_accuracy": 0.06314317509531975, "num_tokens": 779098.0, "step": 360 }, { "entropy": 8.285042762756348, "epoch": 0.039060409866766545, "grad_norm": 1.1796875, "learning_rate": 0.000182, "loss": 8.099, "mean_token_accuracy": 0.06513171158730983, "num_tokens": 790002.0, "step": 365 }, { "entropy": 8.28923921585083, "epoch": 0.03959548397453047, "grad_norm": 1.0234375, "learning_rate": 0.0001845, "loss": 8.0887, "mean_token_accuracy": 0.06843880005180836, "num_tokens": 800444.0, "step": 370 }, { "entropy": 8.375462627410888, "epoch": 0.0401305580822944, "grad_norm": 1.0390625, "learning_rate": 0.000187, "loss": 8.0323, "mean_token_accuracy": 0.0713271751999855, "num_tokens": 810912.0, "step": 375 }, { "entropy": 8.272585010528564, "epoch": 0.04066563219005832, "grad_norm": 0.9375, "learning_rate": 0.0001895, "loss": 8.1198, "mean_token_accuracy": 0.0620170421898365, "num_tokens": 822809.0, "step": 380 }, { "entropy": 8.293894195556641, "epoch": 0.04120070629782225, "grad_norm": 1.0078125, "learning_rate": 0.000192, "loss": 8.0433, "mean_token_accuracy": 0.07052243873476982, "num_tokens": 833362.0, "step": 385 }, { "entropy": 8.276584053039551, "epoch": 0.041735780405586176, "grad_norm": 1.109375, "learning_rate": 0.0001945, "loss": 8.0465, "mean_token_accuracy": 0.07357921116054059, "num_tokens": 844239.0, "step": 390 }, { "entropy": 8.217984676361084, "epoch": 0.0422708545133501, "grad_norm": 1.0546875, "learning_rate": 0.00019700000000000002, "loss": 8.0493, "mean_token_accuracy": 0.06498224660754204, "num_tokens": 855178.0, "step": 395 }, { "entropy": 8.19730110168457, "epoch": 0.04280592862111402, "grad_norm": 1.15625, "learning_rate": 0.00019950000000000002, "loss": 8.0369, "mean_token_accuracy": 0.07206248976290226, "num_tokens": 866120.0, "step": 400 }, { "entropy": 8.337959480285644, "epoch": 0.04334100272887795, "grad_norm": 0.9453125, "learning_rate": 0.000202, "loss": 8.0361, "mean_token_accuracy": 0.07243039160966873, "num_tokens": 876569.0, "step": 405 }, { "entropy": 8.284227752685547, "epoch": 0.043876076836641874, "grad_norm": 0.9921875, "learning_rate": 0.00020449999999999998, "loss": 8.0951, "mean_token_accuracy": 0.06462065242230892, "num_tokens": 887580.0, "step": 410 }, { "entropy": 8.235477828979493, "epoch": 0.0444111509444058, "grad_norm": 1.046875, "learning_rate": 0.000207, "loss": 8.0165, "mean_token_accuracy": 0.0666106827557087, "num_tokens": 897922.0, "step": 415 }, { "entropy": 8.222909069061279, "epoch": 0.044946225052169726, "grad_norm": 1.0234375, "learning_rate": 0.0002095, "loss": 7.9827, "mean_token_accuracy": 0.07159848175942898, "num_tokens": 908522.0, "step": 420 }, { "entropy": 8.27180290222168, "epoch": 0.04548129915993365, "grad_norm": 1.078125, "learning_rate": 0.000212, "loss": 7.9946, "mean_token_accuracy": 0.06654324233531952, "num_tokens": 918253.0, "step": 425 }, { "entropy": 8.194285202026368, "epoch": 0.04601637326769758, "grad_norm": 0.91015625, "learning_rate": 0.0002145, "loss": 8.0034, "mean_token_accuracy": 0.07207662984728813, "num_tokens": 929150.0, "step": 430 }, { "entropy": 8.239371013641357, "epoch": 0.0465514473754615, "grad_norm": 0.94140625, "learning_rate": 0.00021700000000000002, "loss": 8.0511, "mean_token_accuracy": 0.07106035277247429, "num_tokens": 941041.0, "step": 435 }, { "entropy": 8.180944156646728, "epoch": 0.047086521483225424, "grad_norm": 1.59375, "learning_rate": 0.0002195, "loss": 7.9757, "mean_token_accuracy": 0.07760139927268028, "num_tokens": 952714.0, "step": 440 }, { "entropy": 8.150847339630127, "epoch": 0.04762159559098935, "grad_norm": 1.109375, "learning_rate": 0.000222, "loss": 8.0514, "mean_token_accuracy": 0.06907343231141568, "num_tokens": 964330.0, "step": 445 }, { "entropy": 8.246770858764648, "epoch": 0.04815666969875328, "grad_norm": 1.1796875, "learning_rate": 0.0002245, "loss": 7.9805, "mean_token_accuracy": 0.06862297914922237, "num_tokens": 975257.0, "step": 450 }, { "entropy": 8.260761165618897, "epoch": 0.0486917438065172, "grad_norm": 1.09375, "learning_rate": 0.00022700000000000002, "loss": 7.9876, "mean_token_accuracy": 0.07001541927456856, "num_tokens": 986335.0, "step": 455 }, { "entropy": 8.069970512390137, "epoch": 0.04922681791428113, "grad_norm": 0.859375, "learning_rate": 0.00022950000000000002, "loss": 7.8883, "mean_token_accuracy": 0.07471956759691238, "num_tokens": 997521.0, "step": 460 }, { "entropy": 8.172566795349121, "epoch": 0.049761892022045055, "grad_norm": 0.921875, "learning_rate": 0.00023200000000000003, "loss": 7.941, "mean_token_accuracy": 0.0669164728373289, "num_tokens": 1008383.0, "step": 465 }, { "entropy": 8.124609184265136, "epoch": 0.05029696612980898, "grad_norm": 1.09375, "learning_rate": 0.00023449999999999998, "loss": 7.998, "mean_token_accuracy": 0.06806416064500809, "num_tokens": 1020552.0, "step": 470 }, { "entropy": 8.196929836273194, "epoch": 0.0508320402375729, "grad_norm": 0.90625, "learning_rate": 0.000237, "loss": 7.9718, "mean_token_accuracy": 0.07053619101643563, "num_tokens": 1031127.0, "step": 475 }, { "entropy": 8.022743558883667, "epoch": 0.05136711434533683, "grad_norm": 0.890625, "learning_rate": 0.0002395, "loss": 7.8837, "mean_token_accuracy": 0.07386223524808884, "num_tokens": 1043209.0, "step": 480 }, { "entropy": 8.2311222076416, "epoch": 0.05190218845310075, "grad_norm": 0.96875, "learning_rate": 0.000242, "loss": 8.0182, "mean_token_accuracy": 0.06782832555472851, "num_tokens": 1054032.0, "step": 485 }, { "entropy": 8.030213356018066, "epoch": 0.05243726256086468, "grad_norm": 1.03125, "learning_rate": 0.0002445, "loss": 7.8628, "mean_token_accuracy": 0.07288614809513091, "num_tokens": 1064565.0, "step": 490 }, { "entropy": 8.178169107437133, "epoch": 0.052972336668628606, "grad_norm": 0.94140625, "learning_rate": 0.000247, "loss": 7.9975, "mean_token_accuracy": 0.0721826508641243, "num_tokens": 1076352.0, "step": 495 }, { "entropy": 8.112149047851563, "epoch": 0.05350741077639253, "grad_norm": 1.1484375, "learning_rate": 0.0002495, "loss": 7.9381, "mean_token_accuracy": 0.07542271986603737, "num_tokens": 1087697.0, "step": 500 }, { "entropy": 8.137825202941894, "epoch": 0.05404248488415646, "grad_norm": 0.99609375, "learning_rate": 0.000252, "loss": 7.876, "mean_token_accuracy": 0.07182962782680988, "num_tokens": 1098056.0, "step": 505 }, { "entropy": 8.017078876495361, "epoch": 0.054577558991920384, "grad_norm": 1.0, "learning_rate": 0.0002545, "loss": 7.8477, "mean_token_accuracy": 0.07691125422716141, "num_tokens": 1109219.0, "step": 510 }, { "entropy": 8.091530561447144, "epoch": 0.055112633099684304, "grad_norm": 0.94140625, "learning_rate": 0.000257, "loss": 7.9312, "mean_token_accuracy": 0.0700716007500887, "num_tokens": 1120248.0, "step": 515 }, { "entropy": 8.096777963638306, "epoch": 0.05564770720744823, "grad_norm": 1.1171875, "learning_rate": 0.0002595, "loss": 7.9366, "mean_token_accuracy": 0.07186660170555115, "num_tokens": 1131278.0, "step": 520 }, { "entropy": 8.089863491058349, "epoch": 0.056182781315212156, "grad_norm": 1.1875, "learning_rate": 0.000262, "loss": 7.9537, "mean_token_accuracy": 0.06224438659846783, "num_tokens": 1143147.0, "step": 525 }, { "entropy": 8.162030553817749, "epoch": 0.05671785542297608, "grad_norm": 0.89453125, "learning_rate": 0.00026450000000000003, "loss": 7.84, "mean_token_accuracy": 0.0739860113710165, "num_tokens": 1154316.0, "step": 530 }, { "entropy": 7.977855777740478, "epoch": 0.05725292953074001, "grad_norm": 1.0234375, "learning_rate": 0.00026700000000000004, "loss": 7.8967, "mean_token_accuracy": 0.06953345276415349, "num_tokens": 1164696.0, "step": 535 }, { "entropy": 8.048009157180786, "epoch": 0.057788003638503935, "grad_norm": 1.0, "learning_rate": 0.00026950000000000005, "loss": 7.8769, "mean_token_accuracy": 0.07776758968830108, "num_tokens": 1176129.0, "step": 540 }, { "entropy": 8.093161487579346, "epoch": 0.05832307774626786, "grad_norm": 1.0625, "learning_rate": 0.00027200000000000005, "loss": 7.8881, "mean_token_accuracy": 0.07334664314985276, "num_tokens": 1186499.0, "step": 545 }, { "entropy": 8.04116907119751, "epoch": 0.05885815185403178, "grad_norm": 0.98046875, "learning_rate": 0.0002745, "loss": 7.8557, "mean_token_accuracy": 0.07062512040138244, "num_tokens": 1196841.0, "step": 550 }, { "entropy": 8.01404366493225, "epoch": 0.059393225961795706, "grad_norm": 0.91796875, "learning_rate": 0.000277, "loss": 7.8108, "mean_token_accuracy": 0.07467551231384277, "num_tokens": 1207647.0, "step": 555 }, { "entropy": 7.952892255783081, "epoch": 0.05992830006955963, "grad_norm": 1.1015625, "learning_rate": 0.0002795, "loss": 7.801, "mean_token_accuracy": 0.07650438733398915, "num_tokens": 1217072.0, "step": 560 }, { "entropy": 8.061871433258057, "epoch": 0.06046337417732356, "grad_norm": 1.0859375, "learning_rate": 0.00028199999999999997, "loss": 7.9129, "mean_token_accuracy": 0.0698221705853939, "num_tokens": 1228564.0, "step": 565 }, { "entropy": 7.987078428268433, "epoch": 0.060998448285087485, "grad_norm": 0.99609375, "learning_rate": 0.0002845, "loss": 7.8458, "mean_token_accuracy": 0.07497354932129383, "num_tokens": 1238755.0, "step": 570 }, { "entropy": 7.964116954803467, "epoch": 0.06153352239285141, "grad_norm": 1.1484375, "learning_rate": 0.000287, "loss": 7.8004, "mean_token_accuracy": 0.0752273216843605, "num_tokens": 1248968.0, "step": 575 }, { "entropy": 7.962353372573853, "epoch": 0.06206859650061534, "grad_norm": 1.0, "learning_rate": 0.0002895, "loss": 7.7714, "mean_token_accuracy": 0.07172017395496369, "num_tokens": 1259256.0, "step": 580 }, { "entropy": 7.952462911605835, "epoch": 0.06260367060837926, "grad_norm": 1.0859375, "learning_rate": 0.000292, "loss": 7.8067, "mean_token_accuracy": 0.07487296611070633, "num_tokens": 1270469.0, "step": 585 }, { "entropy": 7.963806390762329, "epoch": 0.06313874471614318, "grad_norm": 1.0078125, "learning_rate": 0.0002945, "loss": 7.7694, "mean_token_accuracy": 0.07279012463986874, "num_tokens": 1280558.0, "step": 590 }, { "entropy": 7.986854600906372, "epoch": 0.06367381882390712, "grad_norm": 1.046875, "learning_rate": 0.000297, "loss": 7.8307, "mean_token_accuracy": 0.0718784749507904, "num_tokens": 1291372.0, "step": 595 }, { "entropy": 8.02498688697815, "epoch": 0.06420889293167104, "grad_norm": 0.9921875, "learning_rate": 0.0002995, "loss": 7.9061, "mean_token_accuracy": 0.0674042422324419, "num_tokens": 1302521.0, "step": 600 }, { "entropy": 7.8433699131011965, "epoch": 0.06474396703943497, "grad_norm": 1.109375, "learning_rate": 0.000302, "loss": 7.7274, "mean_token_accuracy": 0.07444682195782662, "num_tokens": 1313632.0, "step": 605 }, { "entropy": 8.005569124221802, "epoch": 0.06527904114719889, "grad_norm": 0.96484375, "learning_rate": 0.0003045, "loss": 7.8118, "mean_token_accuracy": 0.07571293860673904, "num_tokens": 1325247.0, "step": 610 }, { "entropy": 7.937390947341919, "epoch": 0.06581411525496281, "grad_norm": 0.9453125, "learning_rate": 0.000307, "loss": 7.8015, "mean_token_accuracy": 0.075490290671587, "num_tokens": 1336026.0, "step": 615 }, { "entropy": 7.93022665977478, "epoch": 0.06634918936272674, "grad_norm": 0.93359375, "learning_rate": 0.0003095, "loss": 7.7122, "mean_token_accuracy": 0.0769732192158699, "num_tokens": 1346920.0, "step": 620 }, { "entropy": 7.828203010559082, "epoch": 0.06688426347049066, "grad_norm": 1.21875, "learning_rate": 0.000312, "loss": 7.8585, "mean_token_accuracy": 0.0724661260843277, "num_tokens": 1359752.0, "step": 625 }, { "entropy": 8.050937986373901, "epoch": 0.06741933757825459, "grad_norm": 0.95703125, "learning_rate": 0.0003145, "loss": 7.8615, "mean_token_accuracy": 0.07357175201177597, "num_tokens": 1370874.0, "step": 630 }, { "entropy": 7.897751331329346, "epoch": 0.06795441168601851, "grad_norm": 0.9140625, "learning_rate": 0.000317, "loss": 7.7624, "mean_token_accuracy": 0.07756051793694496, "num_tokens": 1382316.0, "step": 635 }, { "entropy": 7.840310096740723, "epoch": 0.06848948579378245, "grad_norm": 1.0, "learning_rate": 0.0003195, "loss": 7.7878, "mean_token_accuracy": 0.07577594220638276, "num_tokens": 1394656.0, "step": 640 }, { "entropy": 7.928963756561279, "epoch": 0.06902455990154636, "grad_norm": 1.0, "learning_rate": 0.000322, "loss": 7.7522, "mean_token_accuracy": 0.07719769552350045, "num_tokens": 1405061.0, "step": 645 }, { "entropy": 7.838529491424561, "epoch": 0.06955963400931028, "grad_norm": 0.9140625, "learning_rate": 0.00032450000000000003, "loss": 7.7183, "mean_token_accuracy": 0.08189134374260902, "num_tokens": 1415573.0, "step": 650 }, { "entropy": 7.810403823852539, "epoch": 0.07009470811707422, "grad_norm": 1.015625, "learning_rate": 0.00032700000000000003, "loss": 7.7436, "mean_token_accuracy": 0.07435674965381622, "num_tokens": 1426103.0, "step": 655 }, { "entropy": 7.886046600341797, "epoch": 0.07062978222483814, "grad_norm": 1.6796875, "learning_rate": 0.00032950000000000004, "loss": 7.7599, "mean_token_accuracy": 0.07234186008572578, "num_tokens": 1437256.0, "step": 660 }, { "entropy": 7.909786796569824, "epoch": 0.07116485633260207, "grad_norm": 1.0859375, "learning_rate": 0.00033200000000000005, "loss": 7.7241, "mean_token_accuracy": 0.0786049198359251, "num_tokens": 1446975.0, "step": 665 }, { "entropy": 7.831602573394775, "epoch": 0.07169993044036599, "grad_norm": 0.99609375, "learning_rate": 0.00033450000000000005, "loss": 7.7425, "mean_token_accuracy": 0.07444198578596115, "num_tokens": 1457751.0, "step": 670 }, { "entropy": 7.829366731643677, "epoch": 0.07223500454812992, "grad_norm": 1.046875, "learning_rate": 0.000337, "loss": 7.7049, "mean_token_accuracy": 0.0754860796034336, "num_tokens": 1468186.0, "step": 675 }, { "entropy": 7.825147390365601, "epoch": 0.07277007865589384, "grad_norm": 0.83203125, "learning_rate": 0.0003395, "loss": 7.7508, "mean_token_accuracy": 0.07570655383169651, "num_tokens": 1479780.0, "step": 680 }, { "entropy": 7.8603636741638185, "epoch": 0.07330515276365776, "grad_norm": 0.94921875, "learning_rate": 0.000342, "loss": 7.6712, "mean_token_accuracy": 0.0832133986055851, "num_tokens": 1490565.0, "step": 685 }, { "entropy": 7.892835903167724, "epoch": 0.0738402268714217, "grad_norm": 0.96875, "learning_rate": 0.00034449999999999997, "loss": 7.7227, "mean_token_accuracy": 0.07809135504066944, "num_tokens": 1501552.0, "step": 690 }, { "entropy": 7.798111057281494, "epoch": 0.07437530097918561, "grad_norm": 0.9375, "learning_rate": 0.000347, "loss": 7.7035, "mean_token_accuracy": 0.07376831583678722, "num_tokens": 1513311.0, "step": 695 }, { "entropy": 7.795570516586304, "epoch": 0.07491037508694955, "grad_norm": 0.98046875, "learning_rate": 0.0003495, "loss": 7.7428, "mean_token_accuracy": 0.08057990670204163, "num_tokens": 1524142.0, "step": 700 }, { "entropy": 7.8165356636047365, "epoch": 0.07544544919471347, "grad_norm": 1.03125, "learning_rate": 0.000352, "loss": 7.7188, "mean_token_accuracy": 0.07599906846880913, "num_tokens": 1535571.0, "step": 705 }, { "entropy": 7.865922546386718, "epoch": 0.0759805233024774, "grad_norm": 0.89453125, "learning_rate": 0.0003545, "loss": 7.7225, "mean_token_accuracy": 0.07798022851347923, "num_tokens": 1546528.0, "step": 710 }, { "entropy": 7.727042579650879, "epoch": 0.07651559741024132, "grad_norm": 0.8828125, "learning_rate": 0.000357, "loss": 7.7386, "mean_token_accuracy": 0.07202219888567925, "num_tokens": 1557264.0, "step": 715 }, { "entropy": 7.867890882492065, "epoch": 0.07705067151800524, "grad_norm": 1.0625, "learning_rate": 0.0003595, "loss": 7.6785, "mean_token_accuracy": 0.08276100754737854, "num_tokens": 1566773.0, "step": 720 }, { "entropy": 7.699678039550781, "epoch": 0.07758574562576917, "grad_norm": 0.96875, "learning_rate": 0.000362, "loss": 7.6459, "mean_token_accuracy": 0.08662735894322396, "num_tokens": 1578173.0, "step": 725 }, { "entropy": 7.779191970825195, "epoch": 0.07812081973353309, "grad_norm": 0.98046875, "learning_rate": 0.0003645, "loss": 7.6221, "mean_token_accuracy": 0.08249625936150551, "num_tokens": 1588537.0, "step": 730 }, { "entropy": 7.7231770038604735, "epoch": 0.07865589384129702, "grad_norm": 0.98046875, "learning_rate": 0.000367, "loss": 7.6355, "mean_token_accuracy": 0.08746174871921539, "num_tokens": 1599159.0, "step": 735 }, { "entropy": 7.7618378639221195, "epoch": 0.07919096794906094, "grad_norm": 0.9921875, "learning_rate": 0.0003695, "loss": 7.6989, "mean_token_accuracy": 0.07925031632184983, "num_tokens": 1610378.0, "step": 740 }, { "entropy": 7.720492362976074, "epoch": 0.07972604205682488, "grad_norm": 1.1328125, "learning_rate": 0.000372, "loss": 7.705, "mean_token_accuracy": 0.07612368240952491, "num_tokens": 1621215.0, "step": 745 }, { "entropy": 7.786748743057251, "epoch": 0.0802611161645888, "grad_norm": 1.0625, "learning_rate": 0.0003745, "loss": 7.6622, "mean_token_accuracy": 0.0790612380951643, "num_tokens": 1631170.0, "step": 750 }, { "entropy": 7.78691840171814, "epoch": 0.08079619027235273, "grad_norm": 0.98828125, "learning_rate": 0.000377, "loss": 7.6574, "mean_token_accuracy": 0.07428538724780083, "num_tokens": 1641897.0, "step": 755 }, { "entropy": 7.766008996963501, "epoch": 0.08133126438011665, "grad_norm": 0.95703125, "learning_rate": 0.0003795, "loss": 7.7353, "mean_token_accuracy": 0.07569916620850563, "num_tokens": 1653592.0, "step": 760 }, { "entropy": 7.616559743881226, "epoch": 0.08186633848788057, "grad_norm": 0.9375, "learning_rate": 0.000382, "loss": 7.6528, "mean_token_accuracy": 0.07474047541618348, "num_tokens": 1665760.0, "step": 765 }, { "entropy": 7.830330228805542, "epoch": 0.0824014125956445, "grad_norm": 0.9609375, "learning_rate": 0.0003845, "loss": 7.6454, "mean_token_accuracy": 0.08570240736007691, "num_tokens": 1676211.0, "step": 770 }, { "entropy": 7.737586927413941, "epoch": 0.08293648670340842, "grad_norm": 1.0, "learning_rate": 0.00038700000000000003, "loss": 7.6666, "mean_token_accuracy": 0.0797475405037403, "num_tokens": 1686405.0, "step": 775 }, { "entropy": 7.75378794670105, "epoch": 0.08347156081117235, "grad_norm": 1.0546875, "learning_rate": 0.00038950000000000003, "loss": 7.6699, "mean_token_accuracy": 0.07950277514755726, "num_tokens": 1697340.0, "step": 780 }, { "entropy": 7.726286888122559, "epoch": 0.08400663491893627, "grad_norm": 1.046875, "learning_rate": 0.00039200000000000004, "loss": 7.5787, "mean_token_accuracy": 0.0861763522028923, "num_tokens": 1707250.0, "step": 785 }, { "entropy": 7.63549427986145, "epoch": 0.0845417090267002, "grad_norm": 1.0078125, "learning_rate": 0.00039450000000000005, "loss": 7.5653, "mean_token_accuracy": 0.0784637302160263, "num_tokens": 1718333.0, "step": 790 }, { "entropy": 7.709765481948852, "epoch": 0.08507678313446412, "grad_norm": 1.0625, "learning_rate": 0.00039700000000000005, "loss": 7.6627, "mean_token_accuracy": 0.07198781482875347, "num_tokens": 1730520.0, "step": 795 }, { "entropy": 7.7255151748657225, "epoch": 0.08561185724222804, "grad_norm": 1.0625, "learning_rate": 0.0003995, "loss": 7.7149, "mean_token_accuracy": 0.07679420076310635, "num_tokens": 1741898.0, "step": 800 }, { "entropy": 7.718593311309815, "epoch": 0.08614693134999198, "grad_norm": 1.09375, "learning_rate": 0.000402, "loss": 7.6508, "mean_token_accuracy": 0.08017718270421029, "num_tokens": 1751671.0, "step": 805 }, { "entropy": 7.577520227432251, "epoch": 0.0866820054577559, "grad_norm": 0.91015625, "learning_rate": 0.0004045, "loss": 7.6669, "mean_token_accuracy": 0.08265335634350776, "num_tokens": 1762076.0, "step": 810 }, { "entropy": 7.796188259124756, "epoch": 0.08721707956551983, "grad_norm": 0.98046875, "learning_rate": 0.00040699999999999997, "loss": 7.642, "mean_token_accuracy": 0.07752098590135574, "num_tokens": 1772666.0, "step": 815 }, { "entropy": 7.724516534805298, "epoch": 0.08775215367328375, "grad_norm": 0.94921875, "learning_rate": 0.0004095, "loss": 7.6572, "mean_token_accuracy": 0.08227546997368336, "num_tokens": 1783621.0, "step": 820 }, { "entropy": 7.700971364974976, "epoch": 0.08828722778104768, "grad_norm": 1.5234375, "learning_rate": 0.000412, "loss": 7.7147, "mean_token_accuracy": 0.07807004414498805, "num_tokens": 1794654.0, "step": 825 }, { "entropy": 7.651264762878418, "epoch": 0.0888223018888116, "grad_norm": 0.88671875, "learning_rate": 0.0004145, "loss": 7.6008, "mean_token_accuracy": 0.0848226711153984, "num_tokens": 1805853.0, "step": 830 }, { "entropy": 7.536796283721924, "epoch": 0.08935737599657552, "grad_norm": 0.9375, "learning_rate": 0.000417, "loss": 7.5896, "mean_token_accuracy": 0.0828265130519867, "num_tokens": 1817006.0, "step": 835 }, { "entropy": 7.733750724792481, "epoch": 0.08989245010433945, "grad_norm": 1.0, "learning_rate": 0.0004195, "loss": 7.583, "mean_token_accuracy": 0.07734453342854977, "num_tokens": 1827166.0, "step": 840 }, { "entropy": 7.7373639106750485, "epoch": 0.09042752421210337, "grad_norm": 1.140625, "learning_rate": 0.000422, "loss": 7.6809, "mean_token_accuracy": 0.07751412987709046, "num_tokens": 1837182.0, "step": 845 }, { "entropy": 7.567351484298706, "epoch": 0.0909625983198673, "grad_norm": 0.94140625, "learning_rate": 0.0004245, "loss": 7.6388, "mean_token_accuracy": 0.07895995602011681, "num_tokens": 1849034.0, "step": 850 }, { "entropy": 7.595164203643799, "epoch": 0.09149767242763122, "grad_norm": 0.98828125, "learning_rate": 0.000427, "loss": 7.5075, "mean_token_accuracy": 0.08833360373973846, "num_tokens": 1859033.0, "step": 855 }, { "entropy": 7.610419750213623, "epoch": 0.09203274653539516, "grad_norm": 0.9765625, "learning_rate": 0.0004295, "loss": 7.6121, "mean_token_accuracy": 0.08088177517056465, "num_tokens": 1870274.0, "step": 860 }, { "entropy": 7.5731220722198485, "epoch": 0.09256782064315908, "grad_norm": 1.265625, "learning_rate": 0.000432, "loss": 7.5611, "mean_token_accuracy": 0.08315053284168243, "num_tokens": 1881306.0, "step": 865 }, { "entropy": 7.561473751068116, "epoch": 0.093102894750923, "grad_norm": 1.0078125, "learning_rate": 0.0004345, "loss": 7.5356, "mean_token_accuracy": 0.08015808910131454, "num_tokens": 1892464.0, "step": 870 }, { "entropy": 7.661314296722412, "epoch": 0.09363796885868693, "grad_norm": 0.9609375, "learning_rate": 0.000437, "loss": 7.6219, "mean_token_accuracy": 0.07585933655500413, "num_tokens": 1903743.0, "step": 875 }, { "entropy": 7.607653522491455, "epoch": 0.09417304296645085, "grad_norm": 1.0, "learning_rate": 0.0004395, "loss": 7.5902, "mean_token_accuracy": 0.08468717783689499, "num_tokens": 1915253.0, "step": 880 }, { "entropy": 7.622669744491577, "epoch": 0.09470811707421478, "grad_norm": 1.2421875, "learning_rate": 0.000442, "loss": 7.5473, "mean_token_accuracy": 0.08187699615955353, "num_tokens": 1926113.0, "step": 885 }, { "entropy": 7.57468581199646, "epoch": 0.0952431911819787, "grad_norm": 0.98046875, "learning_rate": 0.0004445, "loss": 7.6456, "mean_token_accuracy": 0.08173620626330376, "num_tokens": 1937718.0, "step": 890 }, { "entropy": 7.625470066070557, "epoch": 0.09577826528974263, "grad_norm": 1.0234375, "learning_rate": 0.000447, "loss": 7.6334, "mean_token_accuracy": 0.0791581004858017, "num_tokens": 1948307.0, "step": 895 }, { "entropy": 7.575066232681275, "epoch": 0.09631333939750655, "grad_norm": 0.96484375, "learning_rate": 0.00044950000000000003, "loss": 7.4358, "mean_token_accuracy": 0.09009880647063255, "num_tokens": 1957861.0, "step": 900 }, { "entropy": 7.480437755584717, "epoch": 0.09684841350527049, "grad_norm": 0.92578125, "learning_rate": 0.00045200000000000004, "loss": 7.4911, "mean_token_accuracy": 0.08970233350992203, "num_tokens": 1967984.0, "step": 905 }, { "entropy": 7.55365891456604, "epoch": 0.0973834876130344, "grad_norm": 1.0, "learning_rate": 0.00045450000000000004, "loss": 7.4885, "mean_token_accuracy": 0.08413884043693542, "num_tokens": 1978608.0, "step": 910 }, { "entropy": 7.550483322143554, "epoch": 0.09791856172079832, "grad_norm": 0.98828125, "learning_rate": 0.00045700000000000005, "loss": 7.547, "mean_token_accuracy": 0.08248279690742492, "num_tokens": 1989355.0, "step": 915 }, { "entropy": 7.514042758941651, "epoch": 0.09845363582856226, "grad_norm": 0.96484375, "learning_rate": 0.00045950000000000006, "loss": 7.5303, "mean_token_accuracy": 0.08344742506742478, "num_tokens": 1999754.0, "step": 920 }, { "entropy": 7.540969705581665, "epoch": 0.09898870993632618, "grad_norm": 0.99609375, "learning_rate": 0.000462, "loss": 7.5232, "mean_token_accuracy": 0.0832397285848856, "num_tokens": 2010877.0, "step": 925 }, { "entropy": 7.635095930099487, "epoch": 0.09952378404409011, "grad_norm": 0.9140625, "learning_rate": 0.0004645, "loss": 7.6286, "mean_token_accuracy": 0.08003128916025162, "num_tokens": 2022301.0, "step": 930 }, { "entropy": 7.549521160125733, "epoch": 0.10005885815185403, "grad_norm": 0.99609375, "learning_rate": 0.000467, "loss": 7.5119, "mean_token_accuracy": 0.08251530304551125, "num_tokens": 2033537.0, "step": 935 }, { "entropy": 7.477602958679199, "epoch": 0.10059393225961796, "grad_norm": 1.0390625, "learning_rate": 0.0004695, "loss": 7.4502, "mean_token_accuracy": 0.0781034879386425, "num_tokens": 2044360.0, "step": 940 }, { "entropy": 7.583854675292969, "epoch": 0.10112900636738188, "grad_norm": 0.9296875, "learning_rate": 0.000472, "loss": 7.5601, "mean_token_accuracy": 0.08421726487576961, "num_tokens": 2055000.0, "step": 945 }, { "entropy": 7.492854499816895, "epoch": 0.1016640804751458, "grad_norm": 0.9609375, "learning_rate": 0.0004745, "loss": 7.5467, "mean_token_accuracy": 0.08681007251143455, "num_tokens": 2064807.0, "step": 950 }, { "entropy": 7.5536168098449705, "epoch": 0.10219915458290973, "grad_norm": 0.96484375, "learning_rate": 0.000477, "loss": 7.5102, "mean_token_accuracy": 0.08256960362195968, "num_tokens": 2075618.0, "step": 955 }, { "entropy": 7.505359792709351, "epoch": 0.10273422869067365, "grad_norm": 0.953125, "learning_rate": 0.0004795, "loss": 7.5116, "mean_token_accuracy": 0.08244576305150986, "num_tokens": 2086226.0, "step": 960 }, { "entropy": 7.541278457641601, "epoch": 0.10326930279843759, "grad_norm": 0.89453125, "learning_rate": 0.000482, "loss": 7.5116, "mean_token_accuracy": 0.08005514740943909, "num_tokens": 2097222.0, "step": 965 }, { "entropy": 7.481921100616455, "epoch": 0.1038043769062015, "grad_norm": 0.90625, "learning_rate": 0.0004845, "loss": 7.541, "mean_token_accuracy": 0.08661947920918464, "num_tokens": 2108919.0, "step": 970 }, { "entropy": 7.46715989112854, "epoch": 0.10433945101396544, "grad_norm": 0.96875, "learning_rate": 0.000487, "loss": 7.4939, "mean_token_accuracy": 0.08317564725875855, "num_tokens": 2120215.0, "step": 975 }, { "entropy": 7.5228071212768555, "epoch": 0.10487452512172936, "grad_norm": 1.015625, "learning_rate": 0.0004895, "loss": 7.5188, "mean_token_accuracy": 0.0818349651992321, "num_tokens": 2131503.0, "step": 980 }, { "entropy": 7.487857866287231, "epoch": 0.10540959922949328, "grad_norm": 0.96484375, "learning_rate": 0.000492, "loss": 7.4588, "mean_token_accuracy": 0.08936587274074555, "num_tokens": 2141551.0, "step": 985 }, { "entropy": 7.4559633255004885, "epoch": 0.10594467333725721, "grad_norm": 0.92578125, "learning_rate": 0.0004945, "loss": 7.4615, "mean_token_accuracy": 0.08929954171180725, "num_tokens": 2151821.0, "step": 990 }, { "entropy": 7.451591444015503, "epoch": 0.10647974744502113, "grad_norm": 1.03125, "learning_rate": 0.000497, "loss": 7.5065, "mean_token_accuracy": 0.08539062738418579, "num_tokens": 2162474.0, "step": 995 }, { "entropy": 7.53413724899292, "epoch": 0.10701482155278506, "grad_norm": 0.96875, "learning_rate": 0.0004995, "loss": 7.5602, "mean_token_accuracy": 0.08457510098814965, "num_tokens": 2173985.0, "step": 1000 }, { "entropy": 7.5422203063964846, "epoch": 0.10754989566054898, "grad_norm": 0.90625, "learning_rate": 0.0004999999979210101, "loss": 7.5944, "mean_token_accuracy": 0.07782966643571854, "num_tokens": 2186432.0, "step": 1005 }, { "entropy": 7.4759071350097654, "epoch": 0.10808496976831292, "grad_norm": 0.96484375, "learning_rate": 0.0004999999894751138, "loss": 7.4463, "mean_token_accuracy": 0.0834141232073307, "num_tokens": 2197085.0, "step": 1010 }, { "entropy": 7.424153137207031, "epoch": 0.10862004387607684, "grad_norm": 0.98828125, "learning_rate": 0.0004999999745323744, "loss": 7.4486, "mean_token_accuracy": 0.08975227214396, "num_tokens": 2207162.0, "step": 1015 }, { "entropy": 7.464861583709717, "epoch": 0.10915511798384077, "grad_norm": 0.9609375, "learning_rate": 0.0004999999530927923, "loss": 7.5469, "mean_token_accuracy": 0.07938519641757011, "num_tokens": 2218714.0, "step": 1020 }, { "entropy": 7.515410757064819, "epoch": 0.10969019209160469, "grad_norm": 0.96875, "learning_rate": 0.0004999999251563682, "loss": 7.4879, "mean_token_accuracy": 0.08599804565310479, "num_tokens": 2229711.0, "step": 1025 }, { "entropy": 7.45625114440918, "epoch": 0.11022526619936861, "grad_norm": 0.9140625, "learning_rate": 0.0004999998907231029, "loss": 7.4912, "mean_token_accuracy": 0.08116911202669144, "num_tokens": 2239885.0, "step": 1030 }, { "entropy": 7.481421899795532, "epoch": 0.11076034030713254, "grad_norm": 1.0, "learning_rate": 0.0004999998497929974, "loss": 7.4923, "mean_token_accuracy": 0.08827452957630158, "num_tokens": 2250221.0, "step": 1035 }, { "entropy": 7.4760716438293455, "epoch": 0.11129541441489646, "grad_norm": 0.91796875, "learning_rate": 0.0004999998023660527, "loss": 7.5526, "mean_token_accuracy": 0.07815601006150245, "num_tokens": 2261059.0, "step": 1040 }, { "entropy": 7.454020214080811, "epoch": 0.11183048852266039, "grad_norm": 0.8984375, "learning_rate": 0.0004999997484422705, "loss": 7.4273, "mean_token_accuracy": 0.08656688034534454, "num_tokens": 2271174.0, "step": 1045 }, { "entropy": 7.404057025909424, "epoch": 0.11236556263042431, "grad_norm": 1.0625, "learning_rate": 0.0004999996880216521, "loss": 7.5037, "mean_token_accuracy": 0.08764296993613244, "num_tokens": 2282431.0, "step": 1050 }, { "entropy": 7.506435585021973, "epoch": 0.11290063673818825, "grad_norm": 1.109375, "learning_rate": 0.0004999996211041994, "loss": 7.4922, "mean_token_accuracy": 0.08441931083798408, "num_tokens": 2292891.0, "step": 1055 }, { "entropy": 7.472446441650391, "epoch": 0.11343571084595216, "grad_norm": 0.97265625, "learning_rate": 0.0004999995476899141, "loss": 7.5049, "mean_token_accuracy": 0.08200813457369804, "num_tokens": 2303764.0, "step": 1060 }, { "entropy": 7.319696569442749, "epoch": 0.11397078495371608, "grad_norm": 1.0234375, "learning_rate": 0.0004999994677787987, "loss": 7.4002, "mean_token_accuracy": 0.09418007209897042, "num_tokens": 2314172.0, "step": 1065 }, { "entropy": 7.449784660339356, "epoch": 0.11450585906148002, "grad_norm": 1.046875, "learning_rate": 0.0004999993813708551, "loss": 7.3939, "mean_token_accuracy": 0.08950763419270516, "num_tokens": 2324848.0, "step": 1070 }, { "entropy": 7.320974636077881, "epoch": 0.11504093316924394, "grad_norm": 0.89453125, "learning_rate": 0.000499999288466086, "loss": 7.4332, "mean_token_accuracy": 0.08251803517341613, "num_tokens": 2336601.0, "step": 1075 }, { "entropy": 7.46982364654541, "epoch": 0.11557600727700787, "grad_norm": 0.95703125, "learning_rate": 0.0004999991890644941, "loss": 7.4167, "mean_token_accuracy": 0.0846226740628481, "num_tokens": 2347281.0, "step": 1080 }, { "entropy": 7.453939628601074, "epoch": 0.11611108138477179, "grad_norm": 1.0, "learning_rate": 0.0004999990831660822, "loss": 7.4224, "mean_token_accuracy": 0.0908889777958393, "num_tokens": 2358199.0, "step": 1085 }, { "entropy": 7.446761226654052, "epoch": 0.11664615549253572, "grad_norm": 1.0234375, "learning_rate": 0.0004999989707708534, "loss": 7.4877, "mean_token_accuracy": 0.08379835970699787, "num_tokens": 2369092.0, "step": 1090 }, { "entropy": 7.3978382587432865, "epoch": 0.11718122960029964, "grad_norm": 0.984375, "learning_rate": 0.0004999988518788111, "loss": 7.458, "mean_token_accuracy": 0.08341244608163834, "num_tokens": 2378849.0, "step": 1095 }, { "entropy": 7.428147649765014, "epoch": 0.11771630370806356, "grad_norm": 0.90234375, "learning_rate": 0.0004999987264899583, "loss": 7.4385, "mean_token_accuracy": 0.09159169495105743, "num_tokens": 2389587.0, "step": 1100 }, { "entropy": 7.492716360092163, "epoch": 0.1182513778158275, "grad_norm": 0.97265625, "learning_rate": 0.000499998594604299, "loss": 7.434, "mean_token_accuracy": 0.08649549037218093, "num_tokens": 2400442.0, "step": 1105 }, { "entropy": 7.284411334991455, "epoch": 0.11878645192359141, "grad_norm": 0.890625, "learning_rate": 0.000499998456221837, "loss": 7.4154, "mean_token_accuracy": 0.08677608072757721, "num_tokens": 2410771.0, "step": 1110 }, { "entropy": 7.476975584030152, "epoch": 0.11932152603135535, "grad_norm": 1.0, "learning_rate": 0.0004999983113425762, "loss": 7.4299, "mean_token_accuracy": 0.09064068272709846, "num_tokens": 2421112.0, "step": 1115 }, { "entropy": 7.400354480743408, "epoch": 0.11985660013911927, "grad_norm": 0.91796875, "learning_rate": 0.0004999981599665207, "loss": 7.4163, "mean_token_accuracy": 0.08564619868993759, "num_tokens": 2431891.0, "step": 1120 }, { "entropy": 7.315796279907227, "epoch": 0.1203916742468832, "grad_norm": 1.0078125, "learning_rate": 0.0004999980020936748, "loss": 7.3479, "mean_token_accuracy": 0.08722568973898888, "num_tokens": 2442987.0, "step": 1125 }, { "entropy": 7.354978418350219, "epoch": 0.12092674835464712, "grad_norm": 1.09375, "learning_rate": 0.0004999978377240434, "loss": 7.4002, "mean_token_accuracy": 0.08564592450857163, "num_tokens": 2452703.0, "step": 1130 }, { "entropy": 7.375062036514282, "epoch": 0.12146182246241104, "grad_norm": 0.984375, "learning_rate": 0.000499997666857631, "loss": 7.4598, "mean_token_accuracy": 0.08786297589540482, "num_tokens": 2462975.0, "step": 1135 }, { "entropy": 7.394401025772095, "epoch": 0.12199689657017497, "grad_norm": 0.8359375, "learning_rate": 0.0004999974894944426, "loss": 7.4003, "mean_token_accuracy": 0.08598766103386879, "num_tokens": 2473853.0, "step": 1140 }, { "entropy": 7.384897661209107, "epoch": 0.12253197067793889, "grad_norm": 0.90625, "learning_rate": 0.0004999973056344832, "loss": 7.3822, "mean_token_accuracy": 0.08470982015132904, "num_tokens": 2485633.0, "step": 1145 }, { "entropy": 7.337519359588623, "epoch": 0.12306704478570282, "grad_norm": 0.91796875, "learning_rate": 0.0004999971152777583, "loss": 7.3414, "mean_token_accuracy": 0.08668373227119446, "num_tokens": 2496922.0, "step": 1150 }, { "entropy": 7.443722057342529, "epoch": 0.12360211889346674, "grad_norm": 0.87109375, "learning_rate": 0.0004999969184242733, "loss": 7.4147, "mean_token_accuracy": 0.0896741084754467, "num_tokens": 2507890.0, "step": 1155 }, { "entropy": 7.319026279449463, "epoch": 0.12413719300123068, "grad_norm": 1.0390625, "learning_rate": 0.000499996715074034, "loss": 7.4076, "mean_token_accuracy": 0.09130077436566353, "num_tokens": 2519749.0, "step": 1160 }, { "entropy": 7.3418297290802, "epoch": 0.1246722671089946, "grad_norm": 0.97265625, "learning_rate": 0.0004999965052270461, "loss": 7.4121, "mean_token_accuracy": 0.09187431186437607, "num_tokens": 2530666.0, "step": 1165 }, { "entropy": 7.364394998550415, "epoch": 0.12520734121675853, "grad_norm": 0.89453125, "learning_rate": 0.0004999962888833157, "loss": 7.4155, "mean_token_accuracy": 0.08915347754955291, "num_tokens": 2541594.0, "step": 1170 }, { "entropy": 7.363469171524048, "epoch": 0.12574241532452243, "grad_norm": 0.9453125, "learning_rate": 0.0004999960660428491, "loss": 7.3946, "mean_token_accuracy": 0.0930194191634655, "num_tokens": 2552330.0, "step": 1175 }, { "entropy": 7.449467992782592, "epoch": 0.12627748943228637, "grad_norm": 0.87109375, "learning_rate": 0.0004999958367056526, "loss": 7.4494, "mean_token_accuracy": 0.08116971924901009, "num_tokens": 2564601.0, "step": 1180 }, { "entropy": 7.422946262359619, "epoch": 0.1268125635400503, "grad_norm": 0.9921875, "learning_rate": 0.000499995600871733, "loss": 7.4242, "mean_token_accuracy": 0.08717223256826401, "num_tokens": 2575539.0, "step": 1185 }, { "entropy": 7.284857511520386, "epoch": 0.12734763764781423, "grad_norm": 0.89453125, "learning_rate": 0.0004999953585410971, "loss": 7.3588, "mean_token_accuracy": 0.08616523109376431, "num_tokens": 2586635.0, "step": 1190 }, { "entropy": 7.405594778060913, "epoch": 0.12788271175557814, "grad_norm": 1.1171875, "learning_rate": 0.0004999951097137518, "loss": 7.388, "mean_token_accuracy": 0.08991223797202111, "num_tokens": 2596814.0, "step": 1195 }, { "entropy": 7.325789880752564, "epoch": 0.12841778586334207, "grad_norm": 0.86328125, "learning_rate": 0.0004999948543897044, "loss": 7.4089, "mean_token_accuracy": 0.08616380542516708, "num_tokens": 2608087.0, "step": 1200 }, { "entropy": 7.498183393478394, "epoch": 0.128952859971106, "grad_norm": 0.9609375, "learning_rate": 0.0004999945925689621, "loss": 7.41, "mean_token_accuracy": 0.08784973174333573, "num_tokens": 2619377.0, "step": 1205 }, { "entropy": 7.285972166061401, "epoch": 0.12948793407886994, "grad_norm": 1.0234375, "learning_rate": 0.0004999943242515325, "loss": 7.314, "mean_token_accuracy": 0.08880106881260871, "num_tokens": 2629089.0, "step": 1210 }, { "entropy": 7.320152521133423, "epoch": 0.13002300818663384, "grad_norm": 0.8828125, "learning_rate": 0.0004999940494374236, "loss": 7.3835, "mean_token_accuracy": 0.08867338374257087, "num_tokens": 2639743.0, "step": 1215 }, { "entropy": 7.45218596458435, "epoch": 0.13055808229439778, "grad_norm": 1.015625, "learning_rate": 0.000499993768126643, "loss": 7.4254, "mean_token_accuracy": 0.082533248513937, "num_tokens": 2650631.0, "step": 1220 }, { "entropy": 7.268480491638184, "epoch": 0.1310931564021617, "grad_norm": 0.96484375, "learning_rate": 0.000499993480319199, "loss": 7.3811, "mean_token_accuracy": 0.0892926201224327, "num_tokens": 2660197.0, "step": 1225 }, { "entropy": 7.394870710372925, "epoch": 0.13162823050992561, "grad_norm": 0.98828125, "learning_rate": 0.0004999931860150999, "loss": 7.3556, "mean_token_accuracy": 0.08826216235756874, "num_tokens": 2670162.0, "step": 1230 }, { "entropy": 7.390807247161865, "epoch": 0.13216330461768955, "grad_norm": 0.90234375, "learning_rate": 0.0004999928852143541, "loss": 7.3554, "mean_token_accuracy": 0.08857011944055557, "num_tokens": 2681233.0, "step": 1235 }, { "entropy": 7.200170421600342, "epoch": 0.13269837872545348, "grad_norm": 0.87109375, "learning_rate": 0.0004999925779169703, "loss": 7.3187, "mean_token_accuracy": 0.09283828288316727, "num_tokens": 2692145.0, "step": 1240 }, { "entropy": 7.413662004470825, "epoch": 0.13323345283321741, "grad_norm": 0.91015625, "learning_rate": 0.0004999922641229575, "loss": 7.3447, "mean_token_accuracy": 0.09158495515584945, "num_tokens": 2703192.0, "step": 1245 }, { "entropy": 7.324686527252197, "epoch": 0.13376852694098132, "grad_norm": 0.87890625, "learning_rate": 0.0004999919438323248, "loss": 7.3597, "mean_token_accuracy": 0.08890319019556045, "num_tokens": 2714804.0, "step": 1250 }, { "entropy": 7.333380794525146, "epoch": 0.13430360104874525, "grad_norm": 1.046875, "learning_rate": 0.0004999916170450812, "loss": 7.3259, "mean_token_accuracy": 0.09193522408604622, "num_tokens": 2724340.0, "step": 1255 }, { "entropy": 7.259483861923218, "epoch": 0.13483867515650919, "grad_norm": 0.91796875, "learning_rate": 0.0004999912837612364, "loss": 7.3341, "mean_token_accuracy": 0.09227988123893738, "num_tokens": 2735767.0, "step": 1260 }, { "entropy": 7.455391693115234, "epoch": 0.1353737492642731, "grad_norm": 0.91796875, "learning_rate": 0.0004999909439807997, "loss": 7.3851, "mean_token_accuracy": 0.08482631966471672, "num_tokens": 2747658.0, "step": 1265 }, { "entropy": 7.264850521087647, "epoch": 0.13590882337203702, "grad_norm": 1.015625, "learning_rate": 0.0004999905977037813, "loss": 7.2465, "mean_token_accuracy": 0.09336961582303047, "num_tokens": 2757901.0, "step": 1270 }, { "entropy": 7.284139823913574, "epoch": 0.13644389747980096, "grad_norm": 1.015625, "learning_rate": 0.0004999902449301909, "loss": 7.2989, "mean_token_accuracy": 0.0874991238117218, "num_tokens": 2768945.0, "step": 1275 }, { "entropy": 7.24199595451355, "epoch": 0.1369789715875649, "grad_norm": 0.80859375, "learning_rate": 0.0004999898856600387, "loss": 7.271, "mean_token_accuracy": 0.103138717263937, "num_tokens": 2780276.0, "step": 1280 }, { "entropy": 7.350469398498535, "epoch": 0.1375140456953288, "grad_norm": 0.9140625, "learning_rate": 0.0004999895198933354, "loss": 7.3416, "mean_token_accuracy": 0.09537098631262779, "num_tokens": 2791183.0, "step": 1285 }, { "entropy": 7.342680644989014, "epoch": 0.13804911980309273, "grad_norm": 0.94140625, "learning_rate": 0.0004999891476300911, "loss": 7.2607, "mean_token_accuracy": 0.08925738111138344, "num_tokens": 2801928.0, "step": 1290 }, { "entropy": 7.263091659545898, "epoch": 0.13858419391085666, "grad_norm": 0.890625, "learning_rate": 0.000499988768870317, "loss": 7.3525, "mean_token_accuracy": 0.08583549410104752, "num_tokens": 2813415.0, "step": 1295 }, { "entropy": 7.329908657073974, "epoch": 0.13911926801862057, "grad_norm": 0.98046875, "learning_rate": 0.0004999883836140236, "loss": 7.3533, "mean_token_accuracy": 0.08882890194654465, "num_tokens": 2825288.0, "step": 1300 }, { "entropy": 7.312420797348023, "epoch": 0.1396543421263845, "grad_norm": 0.96484375, "learning_rate": 0.0004999879918612224, "loss": 7.3068, "mean_token_accuracy": 0.09304987639188766, "num_tokens": 2836298.0, "step": 1305 }, { "entropy": 7.313601350784301, "epoch": 0.14018941623414843, "grad_norm": 1.03125, "learning_rate": 0.0004999875936119245, "loss": 7.2898, "mean_token_accuracy": 0.0945392332971096, "num_tokens": 2846367.0, "step": 1310 }, { "entropy": 7.240101766586304, "epoch": 0.14072449034191237, "grad_norm": 0.9921875, "learning_rate": 0.0004999871888661415, "loss": 7.3047, "mean_token_accuracy": 0.08923600688576698, "num_tokens": 2856832.0, "step": 1315 }, { "entropy": 7.309039974212647, "epoch": 0.14125956444967627, "grad_norm": 0.9140625, "learning_rate": 0.000499986777623885, "loss": 7.3245, "mean_token_accuracy": 0.08692366257309914, "num_tokens": 2867954.0, "step": 1320 }, { "entropy": 7.439533376693726, "epoch": 0.1417946385574402, "grad_norm": 0.9921875, "learning_rate": 0.0004999863598851669, "loss": 7.3611, "mean_token_accuracy": 0.09297569468617439, "num_tokens": 2878714.0, "step": 1325 }, { "entropy": 7.053972816467285, "epoch": 0.14232971266520414, "grad_norm": 1.3359375, "learning_rate": 0.0004999859356499992, "loss": 7.298, "mean_token_accuracy": 0.10052636489272118, "num_tokens": 2890697.0, "step": 1330 }, { "entropy": 7.382122421264649, "epoch": 0.14286478677296804, "grad_norm": 1.0078125, "learning_rate": 0.0004999855049183943, "loss": 7.3219, "mean_token_accuracy": 0.08626203685998916, "num_tokens": 2901468.0, "step": 1335 }, { "entropy": 7.25765290260315, "epoch": 0.14339986088073198, "grad_norm": 0.94140625, "learning_rate": 0.0004999850676903646, "loss": 7.2671, "mean_token_accuracy": 0.09408968985080719, "num_tokens": 2913466.0, "step": 1340 }, { "entropy": 7.231286239624024, "epoch": 0.1439349349884959, "grad_norm": 0.8984375, "learning_rate": 0.0004999846239659226, "loss": 7.2505, "mean_token_accuracy": 0.09706522151827812, "num_tokens": 2923638.0, "step": 1345 }, { "entropy": 7.269954109191895, "epoch": 0.14447000909625984, "grad_norm": 1.015625, "learning_rate": 0.0004999841737450812, "loss": 7.3357, "mean_token_accuracy": 0.09442631006240845, "num_tokens": 2934790.0, "step": 1350 }, { "entropy": 7.268723440170288, "epoch": 0.14500508320402375, "grad_norm": 1.0234375, "learning_rate": 0.0004999837170278535, "loss": 7.2757, "mean_token_accuracy": 0.08723422512412071, "num_tokens": 2946320.0, "step": 1355 }, { "entropy": 7.3566694259643555, "epoch": 0.14554015731178768, "grad_norm": 1.0546875, "learning_rate": 0.0004999832538142526, "loss": 7.2369, "mean_token_accuracy": 0.09091865047812461, "num_tokens": 2957077.0, "step": 1360 }, { "entropy": 7.177463865280151, "epoch": 0.14607523141955162, "grad_norm": 0.953125, "learning_rate": 0.0004999827841042917, "loss": 7.2678, "mean_token_accuracy": 0.08816000148653984, "num_tokens": 2967286.0, "step": 1365 }, { "entropy": 7.2939177513122555, "epoch": 0.14661030552731552, "grad_norm": 1.34375, "learning_rate": 0.0004999823078979846, "loss": 7.3057, "mean_token_accuracy": 0.09016561508178711, "num_tokens": 2979516.0, "step": 1370 }, { "entropy": 7.379639339447022, "epoch": 0.14714537963507945, "grad_norm": 0.96484375, "learning_rate": 0.0004999818251953449, "loss": 7.419, "mean_token_accuracy": 0.08294185698032379, "num_tokens": 2991594.0, "step": 1375 }, { "entropy": 7.246149206161499, "epoch": 0.1476804537428434, "grad_norm": 1.0234375, "learning_rate": 0.0004999813359963867, "loss": 7.2972, "mean_token_accuracy": 0.08775367885828018, "num_tokens": 3002487.0, "step": 1380 }, { "entropy": 7.372300243377685, "epoch": 0.14821552785060732, "grad_norm": 0.98828125, "learning_rate": 0.0004999808403011241, "loss": 7.3157, "mean_token_accuracy": 0.09396110102534294, "num_tokens": 3013197.0, "step": 1385 }, { "entropy": 7.142706060409546, "epoch": 0.14875060195837123, "grad_norm": 0.8984375, "learning_rate": 0.0004999803381095712, "loss": 7.3451, "mean_token_accuracy": 0.09063652530312538, "num_tokens": 3024512.0, "step": 1390 }, { "entropy": 7.415092658996582, "epoch": 0.14928567606613516, "grad_norm": 0.9296875, "learning_rate": 0.0004999798294217428, "loss": 7.3046, "mean_token_accuracy": 0.08789012357592582, "num_tokens": 3035621.0, "step": 1395 }, { "entropy": 7.229216432571411, "epoch": 0.1498207501738991, "grad_norm": 0.97265625, "learning_rate": 0.0004999793142376533, "loss": 7.2876, "mean_token_accuracy": 0.09253833740949631, "num_tokens": 3046492.0, "step": 1400 }, { "entropy": 7.263148021697998, "epoch": 0.150355824281663, "grad_norm": 0.90625, "learning_rate": 0.0004999787925573177, "loss": 7.3086, "mean_token_accuracy": 0.09204896241426468, "num_tokens": 3057715.0, "step": 1405 }, { "entropy": 7.3932922840118405, "epoch": 0.15089089838942693, "grad_norm": 0.9140625, "learning_rate": 0.0004999782643807513, "loss": 7.2654, "mean_token_accuracy": 0.09031828343868256, "num_tokens": 3068344.0, "step": 1410 }, { "entropy": 7.193799686431885, "epoch": 0.15142597249719086, "grad_norm": 0.8671875, "learning_rate": 0.0004999777297079689, "loss": 7.2547, "mean_token_accuracy": 0.09031877219676972, "num_tokens": 3079576.0, "step": 1415 }, { "entropy": 7.342895412445069, "epoch": 0.1519610466049548, "grad_norm": 0.98046875, "learning_rate": 0.0004999771885389863, "loss": 7.2153, "mean_token_accuracy": 0.09486196860671044, "num_tokens": 3090201.0, "step": 1420 }, { "entropy": 7.1453712463378904, "epoch": 0.1524961207127187, "grad_norm": 1.03125, "learning_rate": 0.0004999766408738189, "loss": 7.1936, "mean_token_accuracy": 0.10047192424535752, "num_tokens": 3099824.0, "step": 1425 }, { "entropy": 7.24136872291565, "epoch": 0.15303119482048264, "grad_norm": 0.90625, "learning_rate": 0.0004999760867124827, "loss": 7.2738, "mean_token_accuracy": 0.09082015976309776, "num_tokens": 3109948.0, "step": 1430 }, { "entropy": 7.299263906478882, "epoch": 0.15356626892824657, "grad_norm": 0.8984375, "learning_rate": 0.0004999755260549937, "loss": 7.2626, "mean_token_accuracy": 0.0974075585603714, "num_tokens": 3121492.0, "step": 1435 }, { "entropy": 7.21744818687439, "epoch": 0.15410134303601047, "grad_norm": 1.671875, "learning_rate": 0.0004999749589013677, "loss": 7.0545, "mean_token_accuracy": 0.10996845588088036, "num_tokens": 3131990.0, "step": 1440 }, { "entropy": 7.1235129833221436, "epoch": 0.1546364171437744, "grad_norm": 0.8828125, "learning_rate": 0.0004999743852516217, "loss": 7.2409, "mean_token_accuracy": 0.0921150028705597, "num_tokens": 3142567.0, "step": 1445 }, { "entropy": 7.32010293006897, "epoch": 0.15517149125153834, "grad_norm": 1.328125, "learning_rate": 0.0004999738051057717, "loss": 7.2522, "mean_token_accuracy": 0.09435679912567138, "num_tokens": 3153083.0, "step": 1450 }, { "entropy": 7.188344669342041, "epoch": 0.15570656535930227, "grad_norm": 0.984375, "learning_rate": 0.0004999732184638347, "loss": 7.2555, "mean_token_accuracy": 0.09004457890987397, "num_tokens": 3163985.0, "step": 1455 }, { "entropy": 7.262719058990479, "epoch": 0.15624163946706618, "grad_norm": 0.92578125, "learning_rate": 0.0004999726253258278, "loss": 7.2392, "mean_token_accuracy": 0.09183276668190957, "num_tokens": 3175259.0, "step": 1460 }, { "entropy": 7.254732751846314, "epoch": 0.1567767135748301, "grad_norm": 0.99609375, "learning_rate": 0.0004999720256917678, "loss": 7.206, "mean_token_accuracy": 0.0977108657360077, "num_tokens": 3185487.0, "step": 1465 }, { "entropy": 7.127510118484497, "epoch": 0.15731178768259405, "grad_norm": 0.94921875, "learning_rate": 0.0004999714195616723, "loss": 7.1831, "mean_token_accuracy": 0.09826227650046349, "num_tokens": 3196200.0, "step": 1470 }, { "entropy": 7.333015441894531, "epoch": 0.15784686179035795, "grad_norm": 0.96875, "learning_rate": 0.0004999708069355586, "loss": 7.3054, "mean_token_accuracy": 0.0843054249882698, "num_tokens": 3207675.0, "step": 1475 }, { "entropy": 7.17571177482605, "epoch": 0.15838193589812188, "grad_norm": 1.078125, "learning_rate": 0.0004999701878134445, "loss": 7.1815, "mean_token_accuracy": 0.09501941055059433, "num_tokens": 3218117.0, "step": 1480 }, { "entropy": 7.304254627227783, "epoch": 0.15891701000588582, "grad_norm": 0.94140625, "learning_rate": 0.0004999695621953477, "loss": 7.2505, "mean_token_accuracy": 0.10208047479391098, "num_tokens": 3229208.0, "step": 1485 }, { "entropy": 7.173984098434448, "epoch": 0.15945208411364975, "grad_norm": 0.96875, "learning_rate": 0.0004999689300812866, "loss": 7.1584, "mean_token_accuracy": 0.101242895424366, "num_tokens": 3239586.0, "step": 1490 }, { "entropy": 7.24401364326477, "epoch": 0.15998715822141366, "grad_norm": 0.8515625, "learning_rate": 0.0004999682914712791, "loss": 7.2254, "mean_token_accuracy": 0.09680869728326798, "num_tokens": 3250103.0, "step": 1495 }, { "entropy": 7.228427124023438, "epoch": 0.1605222323291776, "grad_norm": 0.91015625, "learning_rate": 0.0004999676463653439, "loss": 7.2027, "mean_token_accuracy": 0.10232653468847275, "num_tokens": 3261844.0, "step": 1500 }, { "entropy": 7.227877807617188, "epoch": 0.16105730643694152, "grad_norm": 1.09375, "learning_rate": 0.0004999669947634996, "loss": 7.1639, "mean_token_accuracy": 0.09760255515575408, "num_tokens": 3272073.0, "step": 1505 }, { "entropy": 7.178577184677124, "epoch": 0.16159238054470546, "grad_norm": 0.9609375, "learning_rate": 0.0004999663366657647, "loss": 7.1667, "mean_token_accuracy": 0.09620498046278954, "num_tokens": 3281725.0, "step": 1510 }, { "entropy": 7.214940547943115, "epoch": 0.16212745465246936, "grad_norm": 0.97265625, "learning_rate": 0.0004999656720721586, "loss": 7.3059, "mean_token_accuracy": 0.094396660476923, "num_tokens": 3292708.0, "step": 1515 }, { "entropy": 7.296448183059693, "epoch": 0.1626625287602333, "grad_norm": 0.98828125, "learning_rate": 0.0004999650009827004, "loss": 7.2773, "mean_token_accuracy": 0.09127842709422111, "num_tokens": 3303548.0, "step": 1520 }, { "entropy": 7.19203143119812, "epoch": 0.16319760286799723, "grad_norm": 0.921875, "learning_rate": 0.0004999643233974092, "loss": 7.1486, "mean_token_accuracy": 0.09975013583898544, "num_tokens": 3314261.0, "step": 1525 }, { "entropy": 7.1947274684906, "epoch": 0.16373267697576113, "grad_norm": 0.98046875, "learning_rate": 0.0004999636393163049, "loss": 7.1714, "mean_token_accuracy": 0.09445247575640678, "num_tokens": 3324833.0, "step": 1530 }, { "entropy": 7.053837537765503, "epoch": 0.16426775108352507, "grad_norm": 1.0703125, "learning_rate": 0.0004999629487394071, "loss": 7.0568, "mean_token_accuracy": 0.10237468853592872, "num_tokens": 3334790.0, "step": 1535 }, { "entropy": 7.266930866241455, "epoch": 0.164802825191289, "grad_norm": 1.1484375, "learning_rate": 0.0004999622516667358, "loss": 7.205, "mean_token_accuracy": 0.09691800698637962, "num_tokens": 3345115.0, "step": 1540 }, { "entropy": 7.133483982086181, "epoch": 0.16533789929905293, "grad_norm": 0.875, "learning_rate": 0.000499961548098311, "loss": 7.089, "mean_token_accuracy": 0.10441275909543038, "num_tokens": 3356187.0, "step": 1545 }, { "entropy": 7.117019701004028, "epoch": 0.16587297340681684, "grad_norm": 0.94921875, "learning_rate": 0.0004999608380341533, "loss": 7.1282, "mean_token_accuracy": 0.09887576475739479, "num_tokens": 3367218.0, "step": 1550 }, { "entropy": 7.160897636413575, "epoch": 0.16640804751458077, "grad_norm": 0.98046875, "learning_rate": 0.0004999601214742829, "loss": 7.27, "mean_token_accuracy": 0.08936030119657516, "num_tokens": 3377557.0, "step": 1555 }, { "entropy": 7.371627759933472, "epoch": 0.1669431216223447, "grad_norm": 0.96484375, "learning_rate": 0.0004999593984187206, "loss": 7.2482, "mean_token_accuracy": 0.09751093834638595, "num_tokens": 3387402.0, "step": 1560 }, { "entropy": 7.0916835308074955, "epoch": 0.1674781957301086, "grad_norm": 0.87890625, "learning_rate": 0.0004999586688674872, "loss": 7.1346, "mean_token_accuracy": 0.09648581743240356, "num_tokens": 3397924.0, "step": 1565 }, { "entropy": 7.216659879684448, "epoch": 0.16801326983787254, "grad_norm": 0.94921875, "learning_rate": 0.000499957932820604, "loss": 7.2118, "mean_token_accuracy": 0.08759412840008736, "num_tokens": 3408622.0, "step": 1570 }, { "entropy": 7.262946891784668, "epoch": 0.16854834394563648, "grad_norm": 0.98046875, "learning_rate": 0.000499957190278092, "loss": 7.1622, "mean_token_accuracy": 0.09248490408062934, "num_tokens": 3419692.0, "step": 1575 }, { "entropy": 7.098281383514404, "epoch": 0.1690834180534004, "grad_norm": 1.015625, "learning_rate": 0.0004999564412399728, "loss": 7.2154, "mean_token_accuracy": 0.09459864124655723, "num_tokens": 3430986.0, "step": 1580 }, { "entropy": 7.176830434799195, "epoch": 0.1696184921611643, "grad_norm": 1.0390625, "learning_rate": 0.000499955685706268, "loss": 7.1354, "mean_token_accuracy": 0.09504674524068832, "num_tokens": 3442211.0, "step": 1585 }, { "entropy": 7.03007402420044, "epoch": 0.17015356626892825, "grad_norm": 1.140625, "learning_rate": 0.0004999549236769993, "loss": 7.1229, "mean_token_accuracy": 0.10297105386853218, "num_tokens": 3453585.0, "step": 1590 }, { "entropy": 7.225273466110229, "epoch": 0.17068864037669218, "grad_norm": 1.0078125, "learning_rate": 0.0004999541551521888, "loss": 7.1695, "mean_token_accuracy": 0.0996770367026329, "num_tokens": 3464156.0, "step": 1595 }, { "entropy": 7.249066162109375, "epoch": 0.17122371448445609, "grad_norm": 1.0703125, "learning_rate": 0.0004999533801318587, "loss": 7.2238, "mean_token_accuracy": 0.08952004536986351, "num_tokens": 3474853.0, "step": 1600 }, { "entropy": 7.262774181365967, "epoch": 0.17175878859222002, "grad_norm": 1.03125, "learning_rate": 0.0004999525986160313, "loss": 7.194, "mean_token_accuracy": 0.10073793306946754, "num_tokens": 3486841.0, "step": 1605 }, { "entropy": 7.140778827667236, "epoch": 0.17229386269998395, "grad_norm": 0.9140625, "learning_rate": 0.0004999518106047293, "loss": 7.2169, "mean_token_accuracy": 0.09210691601037979, "num_tokens": 3498735.0, "step": 1610 }, { "entropy": 7.175544404983521, "epoch": 0.17282893680774788, "grad_norm": 0.87890625, "learning_rate": 0.0004999510160979754, "loss": 7.2352, "mean_token_accuracy": 0.10104434639215469, "num_tokens": 3508829.0, "step": 1615 }, { "entropy": 7.1884317874908445, "epoch": 0.1733640109155118, "grad_norm": 0.94921875, "learning_rate": 0.0004999502150957925, "loss": 7.141, "mean_token_accuracy": 0.09438429847359657, "num_tokens": 3519465.0, "step": 1620 }, { "entropy": 7.188577127456665, "epoch": 0.17389908502327572, "grad_norm": 0.93359375, "learning_rate": 0.0004999494075982037, "loss": 7.1086, "mean_token_accuracy": 0.10255491808056831, "num_tokens": 3530401.0, "step": 1625 }, { "entropy": 7.12376561164856, "epoch": 0.17443415913103966, "grad_norm": 0.98828125, "learning_rate": 0.0004999485936052324, "loss": 7.1856, "mean_token_accuracy": 0.09849482700228691, "num_tokens": 3541136.0, "step": 1630 }, { "entropy": 7.288824605941772, "epoch": 0.17496923323880356, "grad_norm": 0.95703125, "learning_rate": 0.000499947773116902, "loss": 7.1753, "mean_token_accuracy": 0.09568259268999099, "num_tokens": 3552525.0, "step": 1635 }, { "entropy": 7.090163278579712, "epoch": 0.1755043073465675, "grad_norm": 0.9140625, "learning_rate": 0.0004999469461332365, "loss": 7.1414, "mean_token_accuracy": 0.09975111782550812, "num_tokens": 3563028.0, "step": 1640 }, { "entropy": 7.199271249771118, "epoch": 0.17603938145433143, "grad_norm": 0.9453125, "learning_rate": 0.0004999461126542592, "loss": 7.0912, "mean_token_accuracy": 0.10047454982995987, "num_tokens": 3573354.0, "step": 1645 }, { "entropy": 6.979637813568115, "epoch": 0.17657445556209536, "grad_norm": 0.83984375, "learning_rate": 0.0004999452726799947, "loss": 7.0802, "mean_token_accuracy": 0.09618928134441376, "num_tokens": 3585576.0, "step": 1650 }, { "entropy": 7.297661590576172, "epoch": 0.17710952966985927, "grad_norm": 0.98828125, "learning_rate": 0.0004999444262104671, "loss": 7.2058, "mean_token_accuracy": 0.08774002119898797, "num_tokens": 3596478.0, "step": 1655 }, { "entropy": 7.110372161865234, "epoch": 0.1776446037776232, "grad_norm": 1.0390625, "learning_rate": 0.0004999435732457007, "loss": 7.153, "mean_token_accuracy": 0.09257297441363335, "num_tokens": 3608014.0, "step": 1660 }, { "entropy": 7.221296691894532, "epoch": 0.17817967788538713, "grad_norm": 0.9921875, "learning_rate": 0.0004999427137857203, "loss": 7.2102, "mean_token_accuracy": 0.09210594072937965, "num_tokens": 3620120.0, "step": 1665 }, { "entropy": 7.107110977172852, "epoch": 0.17871475199315104, "grad_norm": 0.953125, "learning_rate": 0.0004999418478305506, "loss": 7.1096, "mean_token_accuracy": 0.09546202942728996, "num_tokens": 3632578.0, "step": 1670 }, { "entropy": 7.156751394271851, "epoch": 0.17924982610091497, "grad_norm": 0.984375, "learning_rate": 0.0004999409753802167, "loss": 7.131, "mean_token_accuracy": 0.10362366437911988, "num_tokens": 3643245.0, "step": 1675 }, { "entropy": 7.167398452758789, "epoch": 0.1797849002086789, "grad_norm": 0.91015625, "learning_rate": 0.0004999400964347437, "loss": 7.1251, "mean_token_accuracy": 0.09799086153507233, "num_tokens": 3655832.0, "step": 1680 }, { "entropy": 7.151060581207275, "epoch": 0.18031997431644284, "grad_norm": 0.93359375, "learning_rate": 0.0004999392109941571, "loss": 7.1001, "mean_token_accuracy": 0.09830698594450951, "num_tokens": 3666566.0, "step": 1685 }, { "entropy": 7.172510385513306, "epoch": 0.18085504842420674, "grad_norm": 0.91796875, "learning_rate": 0.0004999383190584822, "loss": 7.1298, "mean_token_accuracy": 0.10040193051099777, "num_tokens": 3677572.0, "step": 1690 }, { "entropy": 7.112444877624512, "epoch": 0.18139012253197068, "grad_norm": 0.99609375, "learning_rate": 0.0004999374206277451, "loss": 7.0549, "mean_token_accuracy": 0.09736391827464104, "num_tokens": 3687116.0, "step": 1695 }, { "entropy": 7.057082557678223, "epoch": 0.1819251966397346, "grad_norm": 0.9140625, "learning_rate": 0.0004999365157019717, "loss": 7.1658, "mean_token_accuracy": 0.09722192957997322, "num_tokens": 3697961.0, "step": 1700 }, { "entropy": 7.233665180206299, "epoch": 0.18246027074749852, "grad_norm": 0.9765625, "learning_rate": 0.0004999356042811878, "loss": 7.0802, "mean_token_accuracy": 0.10210576206445694, "num_tokens": 3708834.0, "step": 1705 }, { "entropy": 7.087706089019775, "epoch": 0.18299534485526245, "grad_norm": 0.93359375, "learning_rate": 0.00049993468636542, "loss": 7.1472, "mean_token_accuracy": 0.09556594043970108, "num_tokens": 3719835.0, "step": 1710 }, { "entropy": 7.116140556335449, "epoch": 0.18353041896302638, "grad_norm": 1.03125, "learning_rate": 0.0004999337619546948, "loss": 7.0339, "mean_token_accuracy": 0.10466360598802567, "num_tokens": 3730408.0, "step": 1715 }, { "entropy": 7.085261631011963, "epoch": 0.18406549307079031, "grad_norm": 0.91015625, "learning_rate": 0.0004999328310490387, "loss": 7.1275, "mean_token_accuracy": 0.09871943295001984, "num_tokens": 3741257.0, "step": 1720 }, { "entropy": 7.190493202209472, "epoch": 0.18460056717855422, "grad_norm": 0.96875, "learning_rate": 0.0004999318936484789, "loss": 7.1175, "mean_token_accuracy": 0.10177163109183311, "num_tokens": 3752615.0, "step": 1725 }, { "entropy": 7.106344223022461, "epoch": 0.18513564128631815, "grad_norm": 0.93359375, "learning_rate": 0.0004999309497530422, "loss": 7.1395, "mean_token_accuracy": 0.09094236344099045, "num_tokens": 3763656.0, "step": 1730 }, { "entropy": 7.083023738861084, "epoch": 0.1856707153940821, "grad_norm": 0.91015625, "learning_rate": 0.0004999299993627558, "loss": 7.1148, "mean_token_accuracy": 0.10153383314609528, "num_tokens": 3775257.0, "step": 1735 }, { "entropy": 7.0514672756195065, "epoch": 0.186205789501846, "grad_norm": 0.94921875, "learning_rate": 0.0004999290424776475, "loss": 7.0758, "mean_token_accuracy": 0.1056319996714592, "num_tokens": 3786094.0, "step": 1740 }, { "entropy": 7.330498886108399, "epoch": 0.18674086360960993, "grad_norm": 1.015625, "learning_rate": 0.0004999280790977445, "loss": 7.1657, "mean_token_accuracy": 0.09170655235648155, "num_tokens": 3796672.0, "step": 1745 }, { "entropy": 7.131537580490113, "epoch": 0.18727593771737386, "grad_norm": 0.984375, "learning_rate": 0.000499927109223075, "loss": 7.1508, "mean_token_accuracy": 0.09670756980776787, "num_tokens": 3807910.0, "step": 1750 }, { "entropy": 7.103532934188843, "epoch": 0.1878110118251378, "grad_norm": 0.95703125, "learning_rate": 0.0004999261328536667, "loss": 7.1028, "mean_token_accuracy": 0.1024494618177414, "num_tokens": 3820792.0, "step": 1755 }, { "entropy": 7.02842001914978, "epoch": 0.1883460859329017, "grad_norm": 0.921875, "learning_rate": 0.0004999251499895479, "loss": 7.0234, "mean_token_accuracy": 0.1013932503759861, "num_tokens": 3831126.0, "step": 1760 }, { "entropy": 7.213843870162964, "epoch": 0.18888116004066563, "grad_norm": 0.9140625, "learning_rate": 0.0004999241606307471, "loss": 7.1353, "mean_token_accuracy": 0.10057510435581207, "num_tokens": 3841923.0, "step": 1765 }, { "entropy": 7.119020175933838, "epoch": 0.18941623414842956, "grad_norm": 1.0234375, "learning_rate": 0.0004999231647772927, "loss": 7.0491, "mean_token_accuracy": 0.10542590543627739, "num_tokens": 3852504.0, "step": 1770 }, { "entropy": 6.992453765869141, "epoch": 0.1899513082561935, "grad_norm": 0.96875, "learning_rate": 0.0004999221624292136, "loss": 7.0559, "mean_token_accuracy": 0.10485710874199868, "num_tokens": 3862761.0, "step": 1775 }, { "entropy": 7.134696340560913, "epoch": 0.1904863823639574, "grad_norm": 0.96875, "learning_rate": 0.0004999211535865385, "loss": 7.0556, "mean_token_accuracy": 0.09678238332271576, "num_tokens": 3873662.0, "step": 1780 }, { "entropy": 7.063473129272461, "epoch": 0.19102145647172133, "grad_norm": 0.95703125, "learning_rate": 0.0004999201382492969, "loss": 7.0088, "mean_token_accuracy": 0.10047155022621154, "num_tokens": 3884835.0, "step": 1785 }, { "entropy": 7.110291051864624, "epoch": 0.19155653057948527, "grad_norm": 1.0078125, "learning_rate": 0.0004999191164175178, "loss": 7.154, "mean_token_accuracy": 0.09878607764840126, "num_tokens": 3895073.0, "step": 1790 }, { "entropy": 7.209331798553467, "epoch": 0.19209160468724917, "grad_norm": 0.98828125, "learning_rate": 0.0004999180880912309, "loss": 7.1115, "mean_token_accuracy": 0.09884128645062447, "num_tokens": 3905440.0, "step": 1795 }, { "entropy": 7.072672271728516, "epoch": 0.1926266787950131, "grad_norm": 1.078125, "learning_rate": 0.0004999170532704657, "loss": 7.1145, "mean_token_accuracy": 0.0968818336725235, "num_tokens": 3917135.0, "step": 1800 }, { "entropy": 7.13597002029419, "epoch": 0.19316175290277704, "grad_norm": 0.84375, "learning_rate": 0.0004999160119552523, "loss": 7.117, "mean_token_accuracy": 0.10278327167034149, "num_tokens": 3928247.0, "step": 1805 }, { "entropy": 7.091355848312378, "epoch": 0.19369682701054097, "grad_norm": 0.9375, "learning_rate": 0.0004999149641456206, "loss": 7.1009, "mean_token_accuracy": 0.09872358813881874, "num_tokens": 3938609.0, "step": 1810 }, { "entropy": 7.21585783958435, "epoch": 0.19423190111830488, "grad_norm": 1.046875, "learning_rate": 0.000499913909841601, "loss": 7.0861, "mean_token_accuracy": 0.10127425193786621, "num_tokens": 3949221.0, "step": 1815 }, { "entropy": 7.009944200515747, "epoch": 0.1947669752260688, "grad_norm": 1.015625, "learning_rate": 0.0004999128490432238, "loss": 7.0484, "mean_token_accuracy": 0.09548230320215226, "num_tokens": 3959475.0, "step": 1820 }, { "entropy": 7.083078098297119, "epoch": 0.19530204933383274, "grad_norm": 1.046875, "learning_rate": 0.0004999117817505196, "loss": 7.0515, "mean_token_accuracy": 0.1084510900080204, "num_tokens": 3969638.0, "step": 1825 }, { "entropy": 7.053667259216309, "epoch": 0.19583712344159665, "grad_norm": 0.94140625, "learning_rate": 0.0004999107079635194, "loss": 7.1079, "mean_token_accuracy": 0.10137292668223381, "num_tokens": 3980543.0, "step": 1830 }, { "entropy": 7.355273485183716, "epoch": 0.19637219754936058, "grad_norm": 0.921875, "learning_rate": 0.000499909627682254, "loss": 7.162, "mean_token_accuracy": 0.08682658635079861, "num_tokens": 3993518.0, "step": 1835 }, { "entropy": 7.068727111816406, "epoch": 0.19690727165712452, "grad_norm": 1.046875, "learning_rate": 0.0004999085409067549, "loss": 7.1487, "mean_token_accuracy": 0.09789205938577653, "num_tokens": 4002940.0, "step": 1840 }, { "entropy": 7.013206481933594, "epoch": 0.19744234576488845, "grad_norm": 0.94921875, "learning_rate": 0.0004999074476370531, "loss": 7.0792, "mean_token_accuracy": 0.09683184549212456, "num_tokens": 4013982.0, "step": 1845 }, { "entropy": 7.100980806350708, "epoch": 0.19797741987265235, "grad_norm": 0.98828125, "learning_rate": 0.0004999063478731805, "loss": 7.0638, "mean_token_accuracy": 0.10558338239789009, "num_tokens": 4025607.0, "step": 1850 }, { "entropy": 7.0951310157775875, "epoch": 0.1985124939804163, "grad_norm": 0.9140625, "learning_rate": 0.0004999052416151687, "loss": 7.1104, "mean_token_accuracy": 0.10141080170869828, "num_tokens": 4037467.0, "step": 1855 }, { "entropy": 7.149590158462525, "epoch": 0.19904756808818022, "grad_norm": 0.890625, "learning_rate": 0.0004999041288630496, "loss": 7.1127, "mean_token_accuracy": 0.10126180425286294, "num_tokens": 4049146.0, "step": 1860 }, { "entropy": 7.181366395950318, "epoch": 0.19958264219594413, "grad_norm": 0.90234375, "learning_rate": 0.0004999030096168553, "loss": 7.1485, "mean_token_accuracy": 0.09781184569001197, "num_tokens": 4060500.0, "step": 1865 }, { "entropy": 7.157667875289917, "epoch": 0.20011771630370806, "grad_norm": 1.0234375, "learning_rate": 0.0004999018838766182, "loss": 7.0987, "mean_token_accuracy": 0.0985781691968441, "num_tokens": 4070553.0, "step": 1870 }, { "entropy": 7.14162769317627, "epoch": 0.200652790411472, "grad_norm": 0.98046875, "learning_rate": 0.000499900751642371, "loss": 7.0343, "mean_token_accuracy": 0.11338024884462357, "num_tokens": 4079653.0, "step": 1875 }, { "entropy": 7.015338134765625, "epoch": 0.20118786451923593, "grad_norm": 0.921875, "learning_rate": 0.0004998996129141461, "loss": 7.123, "mean_token_accuracy": 0.09923376441001892, "num_tokens": 4089912.0, "step": 1880 }, { "entropy": 7.212585592269898, "epoch": 0.20172293862699983, "grad_norm": 0.98828125, "learning_rate": 0.0004998984676919764, "loss": 7.0772, "mean_token_accuracy": 0.09714810699224471, "num_tokens": 4100577.0, "step": 1885 }, { "entropy": 7.073903751373291, "epoch": 0.20225801273476376, "grad_norm": 0.96484375, "learning_rate": 0.0004998973159758952, "loss": 7.1033, "mean_token_accuracy": 0.09901956990361213, "num_tokens": 4111752.0, "step": 1890 }, { "entropy": 7.06131501197815, "epoch": 0.2027930868425277, "grad_norm": 1.015625, "learning_rate": 0.0004998961577659355, "loss": 7.0616, "mean_token_accuracy": 0.10182834565639495, "num_tokens": 4122616.0, "step": 1895 }, { "entropy": 7.192514705657959, "epoch": 0.2033281609502916, "grad_norm": 0.90234375, "learning_rate": 0.0004998949930621309, "loss": 7.1547, "mean_token_accuracy": 0.10196215733885765, "num_tokens": 4134275.0, "step": 1900 }, { "entropy": 7.112344741821289, "epoch": 0.20386323505805554, "grad_norm": 1.046875, "learning_rate": 0.0004998938218645149, "loss": 7.0506, "mean_token_accuracy": 0.10170819535851479, "num_tokens": 4146412.0, "step": 1905 }, { "entropy": 7.029837560653687, "epoch": 0.20439830916581947, "grad_norm": 0.91796875, "learning_rate": 0.0004998926441731215, "loss": 7.0512, "mean_token_accuracy": 0.1002343863248825, "num_tokens": 4157592.0, "step": 1910 }, { "entropy": 7.06212477684021, "epoch": 0.2049333832735834, "grad_norm": 0.95703125, "learning_rate": 0.0004998914599879845, "loss": 7.0269, "mean_token_accuracy": 0.09835589304566383, "num_tokens": 4168637.0, "step": 1915 }, { "entropy": 7.0664630889892575, "epoch": 0.2054684573813473, "grad_norm": 0.96875, "learning_rate": 0.0004998902693091382, "loss": 7.0736, "mean_token_accuracy": 0.09925776198506356, "num_tokens": 4179951.0, "step": 1920 }, { "entropy": 7.0451087474823, "epoch": 0.20600353148911124, "grad_norm": 0.96875, "learning_rate": 0.0004998890721366171, "loss": 6.9616, "mean_token_accuracy": 0.10666931569576263, "num_tokens": 4189895.0, "step": 1925 }, { "entropy": 7.097507953643799, "epoch": 0.20653860559687517, "grad_norm": 1.0234375, "learning_rate": 0.0004998878684704556, "loss": 7.0214, "mean_token_accuracy": 0.10524726510047913, "num_tokens": 4199796.0, "step": 1930 }, { "entropy": 7.036600160598755, "epoch": 0.20707367970463908, "grad_norm": 1.0234375, "learning_rate": 0.0004998866583106884, "loss": 7.0461, "mean_token_accuracy": 0.09883956611156464, "num_tokens": 4210428.0, "step": 1935 }, { "entropy": 7.218980216979981, "epoch": 0.207608753812403, "grad_norm": 1.0078125, "learning_rate": 0.0004998854416573506, "loss": 7.1246, "mean_token_accuracy": 0.10078881680965424, "num_tokens": 4221515.0, "step": 1940 }, { "entropy": 7.1100975513458256, "epoch": 0.20814382792016695, "grad_norm": 1.0390625, "learning_rate": 0.0004998842185104772, "loss": 7.1387, "mean_token_accuracy": 0.09548087790608406, "num_tokens": 4232580.0, "step": 1945 }, { "entropy": 7.041958284378052, "epoch": 0.20867890202793088, "grad_norm": 0.96875, "learning_rate": 0.0004998829888701036, "loss": 7.0484, "mean_token_accuracy": 0.10664152652025223, "num_tokens": 4242871.0, "step": 1950 }, { "entropy": 7.147633504867554, "epoch": 0.20921397613569478, "grad_norm": 0.97265625, "learning_rate": 0.0004998817527362654, "loss": 7.0773, "mean_token_accuracy": 0.09752313494682312, "num_tokens": 4253419.0, "step": 1955 }, { "entropy": 7.032255792617798, "epoch": 0.20974905024345872, "grad_norm": 0.93359375, "learning_rate": 0.0004998805101089982, "loss": 7.0528, "mean_token_accuracy": 0.10345240533351899, "num_tokens": 4264327.0, "step": 1960 }, { "entropy": 7.170184564590454, "epoch": 0.21028412435122265, "grad_norm": 0.91796875, "learning_rate": 0.0004998792609883378, "loss": 7.0428, "mean_token_accuracy": 0.10343464836478233, "num_tokens": 4274568.0, "step": 1965 }, { "entropy": 7.056762933731079, "epoch": 0.21081919845898656, "grad_norm": 1.171875, "learning_rate": 0.0004998780053743203, "loss": 7.0324, "mean_token_accuracy": 0.10682544857263565, "num_tokens": 4284895.0, "step": 1970 }, { "entropy": 7.12225079536438, "epoch": 0.2113542725667505, "grad_norm": 0.953125, "learning_rate": 0.0004998767432669822, "loss": 7.0637, "mean_token_accuracy": 0.0994573712348938, "num_tokens": 4297258.0, "step": 1975 }, { "entropy": 7.026572132110596, "epoch": 0.21188934667451442, "grad_norm": 0.9921875, "learning_rate": 0.0004998754746663595, "loss": 6.9842, "mean_token_accuracy": 0.10585973560810089, "num_tokens": 4308307.0, "step": 1980 }, { "entropy": 7.050811910629273, "epoch": 0.21242442078227836, "grad_norm": 0.9296875, "learning_rate": 0.0004998741995724892, "loss": 7.0491, "mean_token_accuracy": 0.10263351649045944, "num_tokens": 4318801.0, "step": 1985 }, { "entropy": 7.070459413528442, "epoch": 0.21295949489004226, "grad_norm": 0.984375, "learning_rate": 0.0004998729179854079, "loss": 7.0252, "mean_token_accuracy": 0.10016985535621643, "num_tokens": 4329531.0, "step": 1990 }, { "entropy": 7.054882478713989, "epoch": 0.2134945689978062, "grad_norm": 0.91796875, "learning_rate": 0.0004998716299051527, "loss": 7.0253, "mean_token_accuracy": 0.10470812693238259, "num_tokens": 4341203.0, "step": 1995 }, { "entropy": 7.026881456375122, "epoch": 0.21402964310557013, "grad_norm": 0.98046875, "learning_rate": 0.0004998703353317609, "loss": 7.0788, "mean_token_accuracy": 0.0973646655678749, "num_tokens": 4352426.0, "step": 2000 }, { "entropy": 7.11639552116394, "epoch": 0.21456471721333403, "grad_norm": 0.94140625, "learning_rate": 0.0004998690342652697, "loss": 7.0103, "mean_token_accuracy": 0.10563170909881592, "num_tokens": 4363413.0, "step": 2005 }, { "entropy": 7.054438829421997, "epoch": 0.21509979132109797, "grad_norm": 0.890625, "learning_rate": 0.0004998677267057166, "loss": 6.951, "mean_token_accuracy": 0.10644056648015976, "num_tokens": 4373470.0, "step": 2010 }, { "entropy": 6.9533806324005125, "epoch": 0.2156348654288619, "grad_norm": 1.015625, "learning_rate": 0.0004998664126531397, "loss": 7.0164, "mean_token_accuracy": 0.10371329113841057, "num_tokens": 4384438.0, "step": 2015 }, { "entropy": 7.1470112800598145, "epoch": 0.21616993953662583, "grad_norm": 0.953125, "learning_rate": 0.0004998650921075766, "loss": 6.9978, "mean_token_accuracy": 0.10406329333782197, "num_tokens": 4395100.0, "step": 2020 }, { "entropy": 6.9813416481018065, "epoch": 0.21670501364438974, "grad_norm": 0.90234375, "learning_rate": 0.0004998637650690656, "loss": 7.1179, "mean_token_accuracy": 0.09519804865121842, "num_tokens": 4407131.0, "step": 2025 }, { "entropy": 7.10913496017456, "epoch": 0.21724008775215367, "grad_norm": 1.046875, "learning_rate": 0.000499862431537645, "loss": 6.9569, "mean_token_accuracy": 0.10057392492890357, "num_tokens": 4417701.0, "step": 2030 }, { "entropy": 6.981591272354126, "epoch": 0.2177751618599176, "grad_norm": 1.109375, "learning_rate": 0.0004998610915133533, "loss": 7.0173, "mean_token_accuracy": 0.10014636293053628, "num_tokens": 4429309.0, "step": 2035 }, { "entropy": 7.007551097869873, "epoch": 0.21831023596768154, "grad_norm": 0.9375, "learning_rate": 0.0004998597449962292, "loss": 7.0663, "mean_token_accuracy": 0.10122283399105073, "num_tokens": 4440850.0, "step": 2040 }, { "entropy": 7.092380857467651, "epoch": 0.21884531007544544, "grad_norm": 0.953125, "learning_rate": 0.0004998583919863115, "loss": 7.0501, "mean_token_accuracy": 0.09975898936390877, "num_tokens": 4451995.0, "step": 2045 }, { "entropy": 6.99484076499939, "epoch": 0.21938038418320938, "grad_norm": 1.046875, "learning_rate": 0.0004998570324836393, "loss": 6.959, "mean_token_accuracy": 0.10816834419965744, "num_tokens": 4461916.0, "step": 2050 }, { "entropy": 7.084143257141113, "epoch": 0.2199154582909733, "grad_norm": 1.0546875, "learning_rate": 0.000499855666488252, "loss": 7.0571, "mean_token_accuracy": 0.10147327557206154, "num_tokens": 4471603.0, "step": 2055 }, { "entropy": 7.105906391143799, "epoch": 0.22045053239873721, "grad_norm": 0.98046875, "learning_rate": 0.0004998542940001889, "loss": 7.083, "mean_token_accuracy": 0.10265670791268348, "num_tokens": 4483166.0, "step": 2060 }, { "entropy": 7.020576333999633, "epoch": 0.22098560650650115, "grad_norm": 1.0, "learning_rate": 0.0004998529150194895, "loss": 7.0022, "mean_token_accuracy": 0.09936799854040146, "num_tokens": 4493824.0, "step": 2065 }, { "entropy": 7.097088718414307, "epoch": 0.22152068061426508, "grad_norm": 0.953125, "learning_rate": 0.0004998515295461939, "loss": 6.9225, "mean_token_accuracy": 0.1188635177910328, "num_tokens": 4505674.0, "step": 2070 }, { "entropy": 6.968977689743042, "epoch": 0.22205575472202901, "grad_norm": 0.97265625, "learning_rate": 0.000499850137580342, "loss": 7.0049, "mean_token_accuracy": 0.10718596279621125, "num_tokens": 4516516.0, "step": 2075 }, { "entropy": 7.039025449752808, "epoch": 0.22259082882979292, "grad_norm": 1.0859375, "learning_rate": 0.0004998487391219739, "loss": 6.9963, "mean_token_accuracy": 0.09949744194746017, "num_tokens": 4527811.0, "step": 2080 }, { "entropy": 7.0311308860778805, "epoch": 0.22312590293755685, "grad_norm": 0.88671875, "learning_rate": 0.0004998473341711301, "loss": 6.9388, "mean_token_accuracy": 0.09995686337351799, "num_tokens": 4538988.0, "step": 2085 }, { "entropy": 7.018882703781128, "epoch": 0.22366097704532079, "grad_norm": 1.03125, "learning_rate": 0.0004998459227278512, "loss": 6.9733, "mean_token_accuracy": 0.1059156596660614, "num_tokens": 4550049.0, "step": 2090 }, { "entropy": 7.072498369216919, "epoch": 0.2241960511530847, "grad_norm": 1.0625, "learning_rate": 0.0004998445047921777, "loss": 7.0719, "mean_token_accuracy": 0.10480737760663032, "num_tokens": 4559784.0, "step": 2095 }, { "entropy": 7.031924390792847, "epoch": 0.22473112526084862, "grad_norm": 1.0625, "learning_rate": 0.0004998430803641509, "loss": 6.9337, "mean_token_accuracy": 0.10361162722110748, "num_tokens": 4569982.0, "step": 2100 }, { "entropy": 6.939174699783325, "epoch": 0.22526619936861256, "grad_norm": 0.93359375, "learning_rate": 0.0004998416494438118, "loss": 6.9534, "mean_token_accuracy": 0.10496753230690956, "num_tokens": 4581117.0, "step": 2105 }, { "entropy": 7.033869123458862, "epoch": 0.2258012734763765, "grad_norm": 1.109375, "learning_rate": 0.0004998402120312014, "loss": 7.0198, "mean_token_accuracy": 0.10706626474857331, "num_tokens": 4592012.0, "step": 2110 }, { "entropy": 7.034424209594727, "epoch": 0.2263363475841404, "grad_norm": 0.96875, "learning_rate": 0.0004998387681263616, "loss": 7.0581, "mean_token_accuracy": 0.10076023638248444, "num_tokens": 4602591.0, "step": 2115 }, { "entropy": 7.038776493072509, "epoch": 0.22687142169190433, "grad_norm": 1.015625, "learning_rate": 0.000499837317729334, "loss": 6.985, "mean_token_accuracy": 0.10343138575553894, "num_tokens": 4613418.0, "step": 2120 }, { "entropy": 6.944168281555176, "epoch": 0.22740649579966826, "grad_norm": 0.90625, "learning_rate": 0.0004998358608401603, "loss": 6.9051, "mean_token_accuracy": 0.11338085606694222, "num_tokens": 4625156.0, "step": 2125 }, { "entropy": 7.1117607116699215, "epoch": 0.22794156990743217, "grad_norm": 0.94140625, "learning_rate": 0.000499834397458883, "loss": 6.937, "mean_token_accuracy": 0.10821644887328148, "num_tokens": 4634523.0, "step": 2130 }, { "entropy": 6.958322238922119, "epoch": 0.2284766440151961, "grad_norm": 1.0, "learning_rate": 0.0004998329275855438, "loss": 6.929, "mean_token_accuracy": 0.11250298544764518, "num_tokens": 4646292.0, "step": 2135 }, { "entropy": 6.985101842880249, "epoch": 0.22901171812296003, "grad_norm": 0.984375, "learning_rate": 0.0004998314512201855, "loss": 6.9099, "mean_token_accuracy": 0.10238043665885925, "num_tokens": 4656417.0, "step": 2140 }, { "entropy": 6.924033832550049, "epoch": 0.22954679223072397, "grad_norm": 1.0703125, "learning_rate": 0.0004998299683628507, "loss": 6.9282, "mean_token_accuracy": 0.10534189045429229, "num_tokens": 4666933.0, "step": 2145 }, { "entropy": 7.059316158294678, "epoch": 0.23008186633848787, "grad_norm": 0.9765625, "learning_rate": 0.0004998284790135821, "loss": 7.1084, "mean_token_accuracy": 0.09782184064388275, "num_tokens": 4678482.0, "step": 2150 }, { "entropy": 7.053033971786499, "epoch": 0.2306169404462518, "grad_norm": 1.0703125, "learning_rate": 0.0004998269831724228, "loss": 6.9481, "mean_token_accuracy": 0.1064787782728672, "num_tokens": 4688454.0, "step": 2155 }, { "entropy": 6.9519795894622805, "epoch": 0.23115201455401574, "grad_norm": 1.0234375, "learning_rate": 0.0004998254808394159, "loss": 6.9839, "mean_token_accuracy": 0.1061179980635643, "num_tokens": 4699545.0, "step": 2160 }, { "entropy": 7.083680486679077, "epoch": 0.23168708866177964, "grad_norm": 0.85546875, "learning_rate": 0.0004998239720146048, "loss": 6.9986, "mean_token_accuracy": 0.10272667407989503, "num_tokens": 4711149.0, "step": 2165 }, { "entropy": 6.961511278152466, "epoch": 0.23222216276954358, "grad_norm": 0.9453125, "learning_rate": 0.0004998224566980332, "loss": 6.9935, "mean_token_accuracy": 0.10200226753950119, "num_tokens": 4722651.0, "step": 2170 }, { "entropy": 7.031105852127075, "epoch": 0.2327572368773075, "grad_norm": 1.046875, "learning_rate": 0.0004998209348897447, "loss": 6.9926, "mean_token_accuracy": 0.09458313658833503, "num_tokens": 4733883.0, "step": 2175 }, { "entropy": 7.135159015655518, "epoch": 0.23329231098507144, "grad_norm": 0.98046875, "learning_rate": 0.0004998194065897833, "loss": 6.955, "mean_token_accuracy": 0.10691621899604797, "num_tokens": 4744517.0, "step": 2180 }, { "entropy": 6.9776819229125975, "epoch": 0.23382738509283535, "grad_norm": 1.0390625, "learning_rate": 0.000499817871798193, "loss": 6.9804, "mean_token_accuracy": 0.11214952319860458, "num_tokens": 4755481.0, "step": 2185 }, { "entropy": 6.972070980072021, "epoch": 0.23436245920059928, "grad_norm": 1.1171875, "learning_rate": 0.0004998163305150185, "loss": 6.9039, "mean_token_accuracy": 0.11068079173564911, "num_tokens": 4765535.0, "step": 2190 }, { "entropy": 6.973287200927734, "epoch": 0.23489753330836322, "grad_norm": 0.98828125, "learning_rate": 0.0004998147827403038, "loss": 7.0273, "mean_token_accuracy": 0.10471541583538055, "num_tokens": 4777045.0, "step": 2195 }, { "entropy": 7.077732086181641, "epoch": 0.23543260741612712, "grad_norm": 0.9921875, "learning_rate": 0.000499813228474094, "loss": 6.9064, "mean_token_accuracy": 0.10825864002108573, "num_tokens": 4787958.0, "step": 2200 }, { "entropy": 6.917084503173828, "epoch": 0.23596768152389105, "grad_norm": 0.953125, "learning_rate": 0.0004998116677164338, "loss": 6.9445, "mean_token_accuracy": 0.10730226412415504, "num_tokens": 4798502.0, "step": 2205 }, { "entropy": 6.931448936462402, "epoch": 0.236502755631655, "grad_norm": 0.9921875, "learning_rate": 0.0004998101004673682, "loss": 6.9413, "mean_token_accuracy": 0.11088823229074478, "num_tokens": 4809179.0, "step": 2210 }, { "entropy": 7.135161733627319, "epoch": 0.23703782973941892, "grad_norm": 1.015625, "learning_rate": 0.0004998085267269426, "loss": 7.0215, "mean_token_accuracy": 0.09467339664697647, "num_tokens": 4819803.0, "step": 2215 }, { "entropy": 7.004361200332641, "epoch": 0.23757290384718283, "grad_norm": 0.96875, "learning_rate": 0.0004998069464952025, "loss": 6.9916, "mean_token_accuracy": 0.10000614672899247, "num_tokens": 4831226.0, "step": 2220 }, { "entropy": 7.049906778335571, "epoch": 0.23810797795494676, "grad_norm": 0.9453125, "learning_rate": 0.0004998053597721932, "loss": 7.0124, "mean_token_accuracy": 0.10538152158260346, "num_tokens": 4842168.0, "step": 2225 }, { "entropy": 7.019608783721924, "epoch": 0.2386430520627107, "grad_norm": 0.94140625, "learning_rate": 0.0004998037665579608, "loss": 6.9621, "mean_token_accuracy": 0.10858180820941925, "num_tokens": 4852655.0, "step": 2230 }, { "entropy": 6.915230321884155, "epoch": 0.2391781261704746, "grad_norm": 0.95703125, "learning_rate": 0.0004998021668525513, "loss": 6.8626, "mean_token_accuracy": 0.10984659045934678, "num_tokens": 4862164.0, "step": 2235 }, { "entropy": 7.046167945861816, "epoch": 0.23971320027823853, "grad_norm": 0.9609375, "learning_rate": 0.0004998005606560107, "loss": 6.9964, "mean_token_accuracy": 0.10990610420703888, "num_tokens": 4874233.0, "step": 2240 }, { "entropy": 6.992388391494751, "epoch": 0.24024827438600246, "grad_norm": 0.953125, "learning_rate": 0.0004997989479683856, "loss": 6.9876, "mean_token_accuracy": 0.1066631942987442, "num_tokens": 4885948.0, "step": 2245 }, { "entropy": 6.963246202468872, "epoch": 0.2407833484937664, "grad_norm": 0.90234375, "learning_rate": 0.0004997973287897224, "loss": 6.9667, "mean_token_accuracy": 0.10817388147115707, "num_tokens": 4897128.0, "step": 2250 }, { "entropy": 6.980781888961792, "epoch": 0.2413184226015303, "grad_norm": 0.98828125, "learning_rate": 0.0004997957031200681, "loss": 6.939, "mean_token_accuracy": 0.11121672838926315, "num_tokens": 4907699.0, "step": 2255 }, { "entropy": 6.887354183197021, "epoch": 0.24185349670929424, "grad_norm": 0.984375, "learning_rate": 0.0004997940709594692, "loss": 6.8796, "mean_token_accuracy": 0.10674800127744674, "num_tokens": 4918772.0, "step": 2260 }, { "entropy": 7.091795778274536, "epoch": 0.24238857081705817, "grad_norm": 1.078125, "learning_rate": 0.0004997924323079733, "loss": 6.9368, "mean_token_accuracy": 0.10729291215538979, "num_tokens": 4930046.0, "step": 2265 }, { "entropy": 6.9101183891296385, "epoch": 0.24292364492482207, "grad_norm": 1.078125, "learning_rate": 0.0004997907871656273, "loss": 6.9568, "mean_token_accuracy": 0.10801581889390946, "num_tokens": 4940609.0, "step": 2270 }, { "entropy": 7.002806997299194, "epoch": 0.243458719032586, "grad_norm": 1.0, "learning_rate": 0.0004997891355324791, "loss": 6.9658, "mean_token_accuracy": 0.10598139539361, "num_tokens": 4951339.0, "step": 2275 }, { "entropy": 6.983994722366333, "epoch": 0.24399379314034994, "grad_norm": 0.9921875, "learning_rate": 0.0004997874774085761, "loss": 6.878, "mean_token_accuracy": 0.10262224972248077, "num_tokens": 4961083.0, "step": 2280 }, { "entropy": 6.895718050003052, "epoch": 0.24452886724811387, "grad_norm": 1.0859375, "learning_rate": 0.0004997858127939662, "loss": 6.8908, "mean_token_accuracy": 0.10761211439967155, "num_tokens": 4971399.0, "step": 2285 }, { "entropy": 7.041612005233764, "epoch": 0.24506394135587778, "grad_norm": 0.99609375, "learning_rate": 0.0004997841416886976, "loss": 6.9715, "mean_token_accuracy": 0.1061974436044693, "num_tokens": 4982429.0, "step": 2290 }, { "entropy": 7.0298323154449465, "epoch": 0.2455990154636417, "grad_norm": 1.0234375, "learning_rate": 0.0004997824640928186, "loss": 7.0184, "mean_token_accuracy": 0.10754595324397087, "num_tokens": 4993706.0, "step": 2295 }, { "entropy": 6.988226366043091, "epoch": 0.24613408957140565, "grad_norm": 0.97265625, "learning_rate": 0.0004997807800063774, "loss": 6.9127, "mean_token_accuracy": 0.10858980864286423, "num_tokens": 5005411.0, "step": 2300 }, { "entropy": 7.023472309112549, "epoch": 0.24666916367916958, "grad_norm": 0.97265625, "learning_rate": 0.000499779089429423, "loss": 7.0413, "mean_token_accuracy": 0.10208934471011162, "num_tokens": 5016011.0, "step": 2305 }, { "entropy": 7.013689231872559, "epoch": 0.24720423778693348, "grad_norm": 0.91015625, "learning_rate": 0.0004997773923620037, "loss": 6.9954, "mean_token_accuracy": 0.10329191759228706, "num_tokens": 5027841.0, "step": 2310 }, { "entropy": 7.100406980514526, "epoch": 0.24773931189469742, "grad_norm": 0.95703125, "learning_rate": 0.0004997756888041689, "loss": 6.9853, "mean_token_accuracy": 0.09798330888152122, "num_tokens": 5038640.0, "step": 2315 }, { "entropy": 6.95166802406311, "epoch": 0.24827438600246135, "grad_norm": 1.0, "learning_rate": 0.0004997739787559677, "loss": 6.9356, "mean_token_accuracy": 0.10357877835631371, "num_tokens": 5050423.0, "step": 2320 }, { "entropy": 6.978884506225586, "epoch": 0.24880946011022526, "grad_norm": 1.140625, "learning_rate": 0.0004997722622174494, "loss": 6.954, "mean_token_accuracy": 0.10356095060706139, "num_tokens": 5060654.0, "step": 2325 }, { "entropy": 6.934212970733642, "epoch": 0.2493445342179892, "grad_norm": 1.015625, "learning_rate": 0.0004997705391886636, "loss": 6.8582, "mean_token_accuracy": 0.11322998628020287, "num_tokens": 5070165.0, "step": 2330 }, { "entropy": 6.913174200057983, "epoch": 0.24987960832575312, "grad_norm": 1.0, "learning_rate": 0.0004997688096696601, "loss": 6.8995, "mean_token_accuracy": 0.10103722065687179, "num_tokens": 5080937.0, "step": 2335 }, { "entropy": 6.911728572845459, "epoch": 0.25041468243351706, "grad_norm": 0.96484375, "learning_rate": 0.0004997670736604888, "loss": 6.8744, "mean_token_accuracy": 0.11288927420973778, "num_tokens": 5090955.0, "step": 2340 }, { "entropy": 7.074804210662842, "epoch": 0.250949756541281, "grad_norm": 0.96484375, "learning_rate": 0.0004997653311611998, "loss": 7.0112, "mean_token_accuracy": 0.09920887500047684, "num_tokens": 5102201.0, "step": 2345 }, { "entropy": 7.0164875984191895, "epoch": 0.25148483064904487, "grad_norm": 1.0390625, "learning_rate": 0.0004997635821718435, "loss": 6.9312, "mean_token_accuracy": 0.11026841551065444, "num_tokens": 5112235.0, "step": 2350 }, { "entropy": 6.8925614833831785, "epoch": 0.2520199047568088, "grad_norm": 1.40625, "learning_rate": 0.0004997618266924704, "loss": 6.8219, "mean_token_accuracy": 0.10299434512853622, "num_tokens": 5122360.0, "step": 2355 }, { "entropy": 7.002241230010986, "epoch": 0.25255497886457273, "grad_norm": 1.015625, "learning_rate": 0.000499760064723131, "loss": 6.9801, "mean_token_accuracy": 0.1024145670235157, "num_tokens": 5133084.0, "step": 2360 }, { "entropy": 6.938703870773315, "epoch": 0.25309005297233667, "grad_norm": 0.98046875, "learning_rate": 0.0004997582962638764, "loss": 6.9133, "mean_token_accuracy": 0.09837969020009041, "num_tokens": 5144495.0, "step": 2365 }, { "entropy": 7.031873512268066, "epoch": 0.2536251270801006, "grad_norm": 1.0, "learning_rate": 0.0004997565213147575, "loss": 6.9238, "mean_token_accuracy": 0.10646962001919746, "num_tokens": 5154824.0, "step": 2370 }, { "entropy": 6.939056253433227, "epoch": 0.25416020118786453, "grad_norm": 1.03125, "learning_rate": 0.0004997547398758257, "loss": 6.9111, "mean_token_accuracy": 0.10193499475717545, "num_tokens": 5165061.0, "step": 2375 }, { "entropy": 6.981441783905029, "epoch": 0.25469527529562846, "grad_norm": 1.0, "learning_rate": 0.0004997529519471323, "loss": 6.8679, "mean_token_accuracy": 0.11417916044592857, "num_tokens": 5174964.0, "step": 2380 }, { "entropy": 6.884857940673828, "epoch": 0.25523034940339234, "grad_norm": 1.0859375, "learning_rate": 0.0004997511575287291, "loss": 6.9267, "mean_token_accuracy": 0.10812475010752678, "num_tokens": 5185458.0, "step": 2385 }, { "entropy": 6.991512250900269, "epoch": 0.2557654235111563, "grad_norm": 1.03125, "learning_rate": 0.0004997493566206677, "loss": 6.9025, "mean_token_accuracy": 0.10954718366265297, "num_tokens": 5196193.0, "step": 2390 }, { "entropy": 6.966927862167358, "epoch": 0.2563004976189202, "grad_norm": 0.94140625, "learning_rate": 0.0004997475492230003, "loss": 7.0198, "mean_token_accuracy": 0.09881971776485443, "num_tokens": 5208541.0, "step": 2395 }, { "entropy": 6.989241456985473, "epoch": 0.25683557172668414, "grad_norm": 1.0234375, "learning_rate": 0.000499745735335779, "loss": 6.8501, "mean_token_accuracy": 0.10620964914560319, "num_tokens": 5218567.0, "step": 2400 }, { "entropy": 6.943647241592407, "epoch": 0.2573706458344481, "grad_norm": 0.97265625, "learning_rate": 0.0004997439149590561, "loss": 6.9666, "mean_token_accuracy": 0.10247603580355644, "num_tokens": 5228293.0, "step": 2405 }, { "entropy": 6.982013940811157, "epoch": 0.257905719942212, "grad_norm": 1.09375, "learning_rate": 0.0004997420880928843, "loss": 6.913, "mean_token_accuracy": 0.10574470162391662, "num_tokens": 5238880.0, "step": 2410 }, { "entropy": 6.9576988697052, "epoch": 0.25844079404997594, "grad_norm": 0.98046875, "learning_rate": 0.0004997402547373162, "loss": 6.9947, "mean_token_accuracy": 0.10212295204401016, "num_tokens": 5250104.0, "step": 2415 }, { "entropy": 7.100748538970947, "epoch": 0.2589758681577399, "grad_norm": 0.94921875, "learning_rate": 0.0004997384148924049, "loss": 7.0243, "mean_token_accuracy": 0.10289878994226456, "num_tokens": 5260355.0, "step": 2420 }, { "entropy": 6.962227201461792, "epoch": 0.25951094226550375, "grad_norm": 1.0078125, "learning_rate": 0.0004997365685582035, "loss": 6.9296, "mean_token_accuracy": 0.10283196046948433, "num_tokens": 5272117.0, "step": 2425 }, { "entropy": 6.9883177280426025, "epoch": 0.2600460163732677, "grad_norm": 0.890625, "learning_rate": 0.0004997347157347651, "loss": 7.0307, "mean_token_accuracy": 0.10037739872932434, "num_tokens": 5284583.0, "step": 2430 }, { "entropy": 7.049625587463379, "epoch": 0.2605810904810316, "grad_norm": 0.93359375, "learning_rate": 0.0004997328564221435, "loss": 6.8241, "mean_token_accuracy": 0.12059795558452606, "num_tokens": 5295846.0, "step": 2435 }, { "entropy": 6.871410655975342, "epoch": 0.26111616458879555, "grad_norm": 0.91796875, "learning_rate": 0.0004997309906203922, "loss": 6.9662, "mean_token_accuracy": 0.10526571422815323, "num_tokens": 5307802.0, "step": 2440 }, { "entropy": 7.033421468734741, "epoch": 0.2616512386965595, "grad_norm": 1.046875, "learning_rate": 0.0004997291183295652, "loss": 6.8913, "mean_token_accuracy": 0.10737156346440316, "num_tokens": 5318263.0, "step": 2445 }, { "entropy": 6.998748159408569, "epoch": 0.2621863128043234, "grad_norm": 0.98046875, "learning_rate": 0.0004997272395497164, "loss": 6.9388, "mean_token_accuracy": 0.10455406904220581, "num_tokens": 5328555.0, "step": 2450 }, { "entropy": 6.912611675262451, "epoch": 0.26272138691208735, "grad_norm": 0.96484375, "learning_rate": 0.0004997253542809002, "loss": 6.9152, "mean_token_accuracy": 0.10682450905442238, "num_tokens": 5339954.0, "step": 2455 }, { "entropy": 7.079062366485596, "epoch": 0.26325646101985123, "grad_norm": 0.984375, "learning_rate": 0.0004997234625231709, "loss": 6.9637, "mean_token_accuracy": 0.10808332860469819, "num_tokens": 5350919.0, "step": 2460 }, { "entropy": 6.93997278213501, "epoch": 0.26379153512761516, "grad_norm": 0.91015625, "learning_rate": 0.0004997215642765832, "loss": 6.925, "mean_token_accuracy": 0.10664721727371215, "num_tokens": 5361844.0, "step": 2465 }, { "entropy": 6.987752532958984, "epoch": 0.2643266092353791, "grad_norm": 0.95703125, "learning_rate": 0.000499719659541192, "loss": 6.9562, "mean_token_accuracy": 0.10334968268871307, "num_tokens": 5372026.0, "step": 2470 }, { "entropy": 6.954167985916138, "epoch": 0.26486168334314303, "grad_norm": 0.890625, "learning_rate": 0.0004997177483170521, "loss": 6.9927, "mean_token_accuracy": 0.10936494544148445, "num_tokens": 5382965.0, "step": 2475 }, { "entropy": 7.007135391235352, "epoch": 0.26539675745090696, "grad_norm": 1.0390625, "learning_rate": 0.0004997158306042188, "loss": 6.9458, "mean_token_accuracy": 0.10711643844842911, "num_tokens": 5393738.0, "step": 2480 }, { "entropy": 6.897781848907471, "epoch": 0.2659318315586709, "grad_norm": 1.0625, "learning_rate": 0.0004997139064027476, "loss": 6.8237, "mean_token_accuracy": 0.1119477018713951, "num_tokens": 5404059.0, "step": 2485 }, { "entropy": 6.912676382064819, "epoch": 0.26646690566643483, "grad_norm": 1.046875, "learning_rate": 0.0004997119757126938, "loss": 6.855, "mean_token_accuracy": 0.10871710032224655, "num_tokens": 5414152.0, "step": 2490 }, { "entropy": 7.022440433502197, "epoch": 0.2670019797741987, "grad_norm": 1.015625, "learning_rate": 0.0004997100385341133, "loss": 7.0235, "mean_token_accuracy": 0.10726772770285606, "num_tokens": 5425227.0, "step": 2495 }, { "entropy": 7.004488468170166, "epoch": 0.26753705388196264, "grad_norm": 0.98828125, "learning_rate": 0.0004997080948670621, "loss": 6.8663, "mean_token_accuracy": 0.11122208759188652, "num_tokens": 5435716.0, "step": 2500 }, { "entropy": 6.936031723022461, "epoch": 0.26807212798972657, "grad_norm": 0.9609375, "learning_rate": 0.0004997061447115962, "loss": 6.9347, "mean_token_accuracy": 0.10375397354364395, "num_tokens": 5446519.0, "step": 2505 }, { "entropy": 6.975105237960816, "epoch": 0.2686072020974905, "grad_norm": 1.0078125, "learning_rate": 0.0004997041880677719, "loss": 6.925, "mean_token_accuracy": 0.10548185482621193, "num_tokens": 5457496.0, "step": 2510 }, { "entropy": 6.880755996704101, "epoch": 0.26914227620525444, "grad_norm": 1.1171875, "learning_rate": 0.0004997022249356457, "loss": 6.823, "mean_token_accuracy": 0.11008255481719971, "num_tokens": 5469059.0, "step": 2515 }, { "entropy": 6.923517560958862, "epoch": 0.26967735031301837, "grad_norm": 1.3203125, "learning_rate": 0.0004997002553152745, "loss": 6.9138, "mean_token_accuracy": 0.10938023030757904, "num_tokens": 5480324.0, "step": 2520 }, { "entropy": 6.9742035388946535, "epoch": 0.2702124244207823, "grad_norm": 0.98828125, "learning_rate": 0.0004996982792067148, "loss": 6.9339, "mean_token_accuracy": 0.09864719212055206, "num_tokens": 5491513.0, "step": 2525 }, { "entropy": 6.8970160484313965, "epoch": 0.2707474985285462, "grad_norm": 0.95703125, "learning_rate": 0.000499696296610024, "loss": 6.8394, "mean_token_accuracy": 0.1051232136785984, "num_tokens": 5502414.0, "step": 2530 }, { "entropy": 6.9252660274505615, "epoch": 0.2712825726363101, "grad_norm": 0.94140625, "learning_rate": 0.0004996943075252592, "loss": 6.9715, "mean_token_accuracy": 0.1062911570072174, "num_tokens": 5512962.0, "step": 2535 }, { "entropy": 6.977799654006958, "epoch": 0.27181764674407405, "grad_norm": 0.9609375, "learning_rate": 0.0004996923119524777, "loss": 6.8355, "mean_token_accuracy": 0.10766077339649201, "num_tokens": 5524648.0, "step": 2540 }, { "entropy": 6.855292940139771, "epoch": 0.272352720851838, "grad_norm": 1.0078125, "learning_rate": 0.0004996903098917375, "loss": 6.9214, "mean_token_accuracy": 0.0998130515217781, "num_tokens": 5536158.0, "step": 2545 }, { "entropy": 6.939780187606812, "epoch": 0.2728877949596019, "grad_norm": 1.0078125, "learning_rate": 0.000499688301343096, "loss": 6.8405, "mean_token_accuracy": 0.10747457072138786, "num_tokens": 5547374.0, "step": 2550 }, { "entropy": 7.020946025848389, "epoch": 0.27342286906736585, "grad_norm": 1.0, "learning_rate": 0.0004996862863066114, "loss": 6.9137, "mean_token_accuracy": 0.10850636437535285, "num_tokens": 5559212.0, "step": 2555 }, { "entropy": 6.907329320907593, "epoch": 0.2739579431751298, "grad_norm": 1.078125, "learning_rate": 0.0004996842647823419, "loss": 6.8823, "mean_token_accuracy": 0.10653341263532638, "num_tokens": 5569302.0, "step": 2560 }, { "entropy": 6.910869598388672, "epoch": 0.27449301728289366, "grad_norm": 1.140625, "learning_rate": 0.0004996822367703458, "loss": 6.8905, "mean_token_accuracy": 0.10348111093044281, "num_tokens": 5581688.0, "step": 2565 }, { "entropy": 6.955097198486328, "epoch": 0.2750280913906576, "grad_norm": 1.1328125, "learning_rate": 0.0004996802022706817, "loss": 6.8211, "mean_token_accuracy": 0.10833865478634834, "num_tokens": 5591376.0, "step": 2570 }, { "entropy": 6.861729669570923, "epoch": 0.2755631654984215, "grad_norm": 1.046875, "learning_rate": 0.0004996781612834083, "loss": 6.8798, "mean_token_accuracy": 0.10732169449329376, "num_tokens": 5601510.0, "step": 2575 }, { "entropy": 7.005447006225586, "epoch": 0.27609823960618546, "grad_norm": 1.1484375, "learning_rate": 0.0004996761138085846, "loss": 6.9316, "mean_token_accuracy": 0.1021797627210617, "num_tokens": 5611436.0, "step": 2580 }, { "entropy": 6.92574257850647, "epoch": 0.2766333137139494, "grad_norm": 1.21875, "learning_rate": 0.0004996740598462697, "loss": 6.9341, "mean_token_accuracy": 0.10267650112509727, "num_tokens": 5620470.0, "step": 2585 }, { "entropy": 6.860880899429321, "epoch": 0.2771683878217133, "grad_norm": 1.0234375, "learning_rate": 0.0004996719993965229, "loss": 6.8297, "mean_token_accuracy": 0.10769467577338218, "num_tokens": 5630740.0, "step": 2590 }, { "entropy": 6.8753687858581545, "epoch": 0.27770346192947726, "grad_norm": 1.0546875, "learning_rate": 0.0004996699324594036, "loss": 6.8303, "mean_token_accuracy": 0.11734023317694664, "num_tokens": 5641138.0, "step": 2595 }, { "entropy": 6.985844898223877, "epoch": 0.27823853603724114, "grad_norm": 0.9921875, "learning_rate": 0.0004996678590349717, "loss": 6.974, "mean_token_accuracy": 0.1085183672606945, "num_tokens": 5652474.0, "step": 2600 }, { "entropy": 6.9662446022033695, "epoch": 0.27877361014500507, "grad_norm": 1.0390625, "learning_rate": 0.0004996657791232868, "loss": 6.8709, "mean_token_accuracy": 0.11153203919529915, "num_tokens": 5663178.0, "step": 2605 }, { "entropy": 6.891348218917846, "epoch": 0.279308684252769, "grad_norm": 1.1171875, "learning_rate": 0.0004996636927244092, "loss": 6.8963, "mean_token_accuracy": 0.10582477301359176, "num_tokens": 5673565.0, "step": 2610 }, { "entropy": 7.040777587890625, "epoch": 0.27984375836053293, "grad_norm": 1.1171875, "learning_rate": 0.000499661599838399, "loss": 6.9389, "mean_token_accuracy": 0.10204790085554123, "num_tokens": 5684651.0, "step": 2615 }, { "entropy": 6.929867219924927, "epoch": 0.28037883246829687, "grad_norm": 1.0078125, "learning_rate": 0.0004996595004653167, "loss": 6.8204, "mean_token_accuracy": 0.10971119105815888, "num_tokens": 5696081.0, "step": 2620 }, { "entropy": 6.925084161758423, "epoch": 0.2809139065760608, "grad_norm": 0.9921875, "learning_rate": 0.0004996573946052229, "loss": 6.855, "mean_token_accuracy": 0.10883698239922523, "num_tokens": 5706830.0, "step": 2625 }, { "entropy": 6.910267782211304, "epoch": 0.28144898068382473, "grad_norm": 1.1328125, "learning_rate": 0.0004996552822581783, "loss": 6.8815, "mean_token_accuracy": 0.11361035332083702, "num_tokens": 5717261.0, "step": 2630 }, { "entropy": 6.91580810546875, "epoch": 0.2819840547915886, "grad_norm": 1.1640625, "learning_rate": 0.000499653163424244, "loss": 6.8481, "mean_token_accuracy": 0.10841184929013252, "num_tokens": 5727280.0, "step": 2635 }, { "entropy": 6.938942956924438, "epoch": 0.28251912889935255, "grad_norm": 0.97265625, "learning_rate": 0.0004996510381034814, "loss": 6.9083, "mean_token_accuracy": 0.10522805228829384, "num_tokens": 5737485.0, "step": 2640 }, { "entropy": 6.926429605484008, "epoch": 0.2830542030071165, "grad_norm": 0.9921875, "learning_rate": 0.0004996489062959515, "loss": 6.8735, "mean_token_accuracy": 0.10467999801039696, "num_tokens": 5747683.0, "step": 2645 }, { "entropy": 6.867719650268555, "epoch": 0.2835892771148804, "grad_norm": 1.046875, "learning_rate": 0.0004996467680017159, "loss": 6.9325, "mean_token_accuracy": 0.10280923023819924, "num_tokens": 5758148.0, "step": 2650 }, { "entropy": 6.917259216308594, "epoch": 0.28412435122264434, "grad_norm": 0.96484375, "learning_rate": 0.0004996446232208365, "loss": 6.8627, "mean_token_accuracy": 0.11170612499117852, "num_tokens": 5769109.0, "step": 2655 }, { "entropy": 6.9372947216033936, "epoch": 0.2846594253304083, "grad_norm": 1.03125, "learning_rate": 0.0004996424719533753, "loss": 6.8939, "mean_token_accuracy": 0.1052110217511654, "num_tokens": 5780344.0, "step": 2660 }, { "entropy": 6.913125228881836, "epoch": 0.2851944994381722, "grad_norm": 1.0859375, "learning_rate": 0.0004996403141993941, "loss": 6.6962, "mean_token_accuracy": 0.11824454516172409, "num_tokens": 5790167.0, "step": 2665 }, { "entropy": 6.92453293800354, "epoch": 0.2857295735459361, "grad_norm": 1.0625, "learning_rate": 0.0004996381499589555, "loss": 6.8624, "mean_token_accuracy": 0.10613423809409142, "num_tokens": 5800076.0, "step": 2670 }, { "entropy": 6.944131517410279, "epoch": 0.2862646476537, "grad_norm": 0.98828125, "learning_rate": 0.0004996359792321219, "loss": 6.8113, "mean_token_accuracy": 0.11141969487071038, "num_tokens": 5810547.0, "step": 2675 }, { "entropy": 6.8161341667175295, "epoch": 0.28679972176146395, "grad_norm": 1.0625, "learning_rate": 0.000499633802018956, "loss": 6.8478, "mean_token_accuracy": 0.1100471280515194, "num_tokens": 5821210.0, "step": 2680 }, { "entropy": 6.917617702484131, "epoch": 0.2873347958692279, "grad_norm": 1.0078125, "learning_rate": 0.0004996316183195204, "loss": 6.8869, "mean_token_accuracy": 0.10786092206835747, "num_tokens": 5832361.0, "step": 2685 }, { "entropy": 6.962878274917602, "epoch": 0.2878698699769918, "grad_norm": 1.03125, "learning_rate": 0.0004996294281338786, "loss": 6.8717, "mean_token_accuracy": 0.10681624412536621, "num_tokens": 5843242.0, "step": 2690 }, { "entropy": 6.976676988601684, "epoch": 0.28840494408475575, "grad_norm": 0.9453125, "learning_rate": 0.0004996272314620936, "loss": 6.9215, "mean_token_accuracy": 0.10194345191121101, "num_tokens": 5855163.0, "step": 2695 }, { "entropy": 6.837163925170898, "epoch": 0.2889400181925197, "grad_norm": 0.97265625, "learning_rate": 0.0004996250283042288, "loss": 6.8839, "mean_token_accuracy": 0.11228486746549607, "num_tokens": 5866908.0, "step": 2700 }, { "entropy": 6.974035596847534, "epoch": 0.28947509230028357, "grad_norm": 1.0546875, "learning_rate": 0.000499622818660348, "loss": 6.9045, "mean_token_accuracy": 0.10939288139343262, "num_tokens": 5877342.0, "step": 2705 }, { "entropy": 6.942460250854492, "epoch": 0.2900101664080475, "grad_norm": 1.078125, "learning_rate": 0.0004996206025305147, "loss": 6.8573, "mean_token_accuracy": 0.10582418739795685, "num_tokens": 5887960.0, "step": 2710 }, { "entropy": 6.87635645866394, "epoch": 0.29054524051581143, "grad_norm": 1.0390625, "learning_rate": 0.0004996183799147932, "loss": 6.8397, "mean_token_accuracy": 0.1095063179731369, "num_tokens": 5899887.0, "step": 2715 }, { "entropy": 6.917806816101074, "epoch": 0.29108031462357536, "grad_norm": 1.0390625, "learning_rate": 0.0004996161508132475, "loss": 6.8583, "mean_token_accuracy": 0.10231703668832778, "num_tokens": 5911022.0, "step": 2720 }, { "entropy": 7.016377210617065, "epoch": 0.2916153887313393, "grad_norm": 0.99609375, "learning_rate": 0.000499613915225942, "loss": 6.9222, "mean_token_accuracy": 0.11102863773703575, "num_tokens": 5922780.0, "step": 2725 }, { "entropy": 6.881858253479004, "epoch": 0.29215046283910323, "grad_norm": 1.0546875, "learning_rate": 0.0004996116731529412, "loss": 6.9251, "mean_token_accuracy": 0.10592872574925423, "num_tokens": 5934112.0, "step": 2730 }, { "entropy": 6.8940752983093265, "epoch": 0.29268553694686716, "grad_norm": 1.0546875, "learning_rate": 0.00049960942459431, "loss": 6.8866, "mean_token_accuracy": 0.1067856416106224, "num_tokens": 5944386.0, "step": 2735 }, { "entropy": 6.870763492584229, "epoch": 0.29322061105463104, "grad_norm": 1.03125, "learning_rate": 0.0004996071695501132, "loss": 6.813, "mean_token_accuracy": 0.10948670953512192, "num_tokens": 5955552.0, "step": 2740 }, { "entropy": 6.921037864685059, "epoch": 0.293755685162395, "grad_norm": 1.0, "learning_rate": 0.0004996049080204159, "loss": 6.8137, "mean_token_accuracy": 0.1098986655473709, "num_tokens": 5966790.0, "step": 2745 }, { "entropy": 6.925626182556153, "epoch": 0.2942907592701589, "grad_norm": 1.0625, "learning_rate": 0.0004996026400052835, "loss": 6.8214, "mean_token_accuracy": 0.10917853116989136, "num_tokens": 5977704.0, "step": 2750 }, { "entropy": 6.853207015991211, "epoch": 0.29482583337792284, "grad_norm": 0.953125, "learning_rate": 0.0004996003655047814, "loss": 6.8364, "mean_token_accuracy": 0.11162171512842178, "num_tokens": 5989221.0, "step": 2755 }, { "entropy": 6.919997644424439, "epoch": 0.2953609074856868, "grad_norm": 0.89453125, "learning_rate": 0.0004995980845189753, "loss": 6.871, "mean_token_accuracy": 0.10931915193796157, "num_tokens": 6000906.0, "step": 2760 }, { "entropy": 6.931192445755005, "epoch": 0.2958959815934507, "grad_norm": 1.015625, "learning_rate": 0.0004995957970479312, "loss": 6.8945, "mean_token_accuracy": 0.10708941668272018, "num_tokens": 6012039.0, "step": 2765 }, { "entropy": 6.8547321319580075, "epoch": 0.29643105570121464, "grad_norm": 0.93359375, "learning_rate": 0.0004995935030917148, "loss": 6.776, "mean_token_accuracy": 0.11066783592104912, "num_tokens": 6024383.0, "step": 2770 }, { "entropy": 6.994161558151245, "epoch": 0.2969661298089785, "grad_norm": 1.0859375, "learning_rate": 0.0004995912026503926, "loss": 6.8508, "mean_token_accuracy": 0.10267031714320182, "num_tokens": 6034904.0, "step": 2775 }, { "entropy": 6.838885879516601, "epoch": 0.29750120391674245, "grad_norm": 1.0234375, "learning_rate": 0.000499588895724031, "loss": 6.8488, "mean_token_accuracy": 0.10749915912747383, "num_tokens": 6044449.0, "step": 2780 }, { "entropy": 6.962449741363526, "epoch": 0.2980362780245064, "grad_norm": 1.109375, "learning_rate": 0.0004995865823126968, "loss": 6.8765, "mean_token_accuracy": 0.10825972631573677, "num_tokens": 6054465.0, "step": 2785 }, { "entropy": 6.8947694301605225, "epoch": 0.2985713521322703, "grad_norm": 1.0859375, "learning_rate": 0.0004995842624164564, "loss": 6.8962, "mean_token_accuracy": 0.10824007838964463, "num_tokens": 6065539.0, "step": 2790 }, { "entropy": 6.909287405014038, "epoch": 0.29910642624003425, "grad_norm": 1.0859375, "learning_rate": 0.000499581936035377, "loss": 6.8459, "mean_token_accuracy": 0.10840294510126114, "num_tokens": 6076135.0, "step": 2795 }, { "entropy": 6.903677034378052, "epoch": 0.2996415003477982, "grad_norm": 1.0546875, "learning_rate": 0.0004995796031695257, "loss": 6.8641, "mean_token_accuracy": 0.10931005999445915, "num_tokens": 6086604.0, "step": 2800 }, { "entropy": 6.90281114578247, "epoch": 0.3001765744555621, "grad_norm": 1.125, "learning_rate": 0.00049957726381897, "loss": 6.8781, "mean_token_accuracy": 0.10950748696923256, "num_tokens": 6095672.0, "step": 2805 }, { "entropy": 6.90290675163269, "epoch": 0.300711648563326, "grad_norm": 1.0, "learning_rate": 0.0004995749179837773, "loss": 6.7498, "mean_token_accuracy": 0.11466853022575378, "num_tokens": 6105652.0, "step": 2810 }, { "entropy": 6.826155042648315, "epoch": 0.30124672267108993, "grad_norm": 0.99609375, "learning_rate": 0.0004995725656640155, "loss": 6.7856, "mean_token_accuracy": 0.11099454537034034, "num_tokens": 6116930.0, "step": 2815 }, { "entropy": 6.844819593429565, "epoch": 0.30178179677885386, "grad_norm": 1.03125, "learning_rate": 0.0004995702068597524, "loss": 6.7894, "mean_token_accuracy": 0.11423054486513137, "num_tokens": 6126659.0, "step": 2820 }, { "entropy": 6.890478515625, "epoch": 0.3023168708866178, "grad_norm": 1.015625, "learning_rate": 0.0004995678415710561, "loss": 6.8288, "mean_token_accuracy": 0.11060848459601402, "num_tokens": 6137227.0, "step": 2825 }, { "entropy": 6.962517929077149, "epoch": 0.3028519449943817, "grad_norm": 0.98046875, "learning_rate": 0.000499565469797995, "loss": 6.8821, "mean_token_accuracy": 0.10931277051568031, "num_tokens": 6147800.0, "step": 2830 }, { "entropy": 6.822924327850342, "epoch": 0.30338701910214566, "grad_norm": 1.0, "learning_rate": 0.0004995630915406374, "loss": 6.7326, "mean_token_accuracy": 0.12161283493041992, "num_tokens": 6157671.0, "step": 2835 }, { "entropy": 6.918770694732666, "epoch": 0.3039220932099096, "grad_norm": 1.0390625, "learning_rate": 0.0004995607067990521, "loss": 6.8698, "mean_token_accuracy": 0.10645673274993897, "num_tokens": 6168651.0, "step": 2840 }, { "entropy": 6.873465251922608, "epoch": 0.30445716731767347, "grad_norm": 1.453125, "learning_rate": 0.000499558315573308, "loss": 6.8487, "mean_token_accuracy": 0.1086043007671833, "num_tokens": 6179925.0, "step": 2845 }, { "entropy": 6.818239831924439, "epoch": 0.3049922414254374, "grad_norm": 1.234375, "learning_rate": 0.0004995559178634741, "loss": 6.8438, "mean_token_accuracy": 0.10887812077999115, "num_tokens": 6190541.0, "step": 2850 }, { "entropy": 7.041949510574341, "epoch": 0.30552731553320134, "grad_norm": 1.0546875, "learning_rate": 0.0004995535136696196, "loss": 6.8866, "mean_token_accuracy": 0.09955592602491378, "num_tokens": 6201491.0, "step": 2855 }, { "entropy": 6.8139080047607425, "epoch": 0.30606238964096527, "grad_norm": 1.0078125, "learning_rate": 0.000499551102991814, "loss": 6.6991, "mean_token_accuracy": 0.11249880269169807, "num_tokens": 6212443.0, "step": 2860 }, { "entropy": 6.817849111557007, "epoch": 0.3065974637487292, "grad_norm": 1.1328125, "learning_rate": 0.0004995486858301268, "loss": 6.8981, "mean_token_accuracy": 0.1030767761170864, "num_tokens": 6222623.0, "step": 2865 }, { "entropy": 6.925403165817261, "epoch": 0.30713253785649314, "grad_norm": 0.9609375, "learning_rate": 0.0004995462621846279, "loss": 6.7852, "mean_token_accuracy": 0.10933116525411606, "num_tokens": 6233712.0, "step": 2870 }, { "entropy": 6.854152202606201, "epoch": 0.30766761196425707, "grad_norm": 1.1171875, "learning_rate": 0.0004995438320553871, "loss": 6.8534, "mean_token_accuracy": 0.10412434935569763, "num_tokens": 6244254.0, "step": 2875 }, { "entropy": 6.823256492614746, "epoch": 0.30820268607202095, "grad_norm": 1.2265625, "learning_rate": 0.0004995413954424748, "loss": 6.7504, "mean_token_accuracy": 0.116096231341362, "num_tokens": 6254202.0, "step": 2880 }, { "entropy": 6.877709770202637, "epoch": 0.3087377601797849, "grad_norm": 1.140625, "learning_rate": 0.0004995389523459612, "loss": 6.8231, "mean_token_accuracy": 0.10538254305720329, "num_tokens": 6264496.0, "step": 2885 }, { "entropy": 6.839356851577759, "epoch": 0.3092728342875488, "grad_norm": 1.078125, "learning_rate": 0.000499536502765917, "loss": 6.828, "mean_token_accuracy": 0.1125398851931095, "num_tokens": 6275835.0, "step": 2890 }, { "entropy": 6.893553924560547, "epoch": 0.30980790839531275, "grad_norm": 1.2421875, "learning_rate": 0.0004995340467024128, "loss": 6.7842, "mean_token_accuracy": 0.10834744572639465, "num_tokens": 6286805.0, "step": 2895 }, { "entropy": 6.906386661529541, "epoch": 0.3103429825030767, "grad_norm": 0.984375, "learning_rate": 0.0004995315841555195, "loss": 6.7916, "mean_token_accuracy": 0.10366136953234673, "num_tokens": 6298444.0, "step": 2900 }, { "entropy": 6.783759641647339, "epoch": 0.3108780566108406, "grad_norm": 1.1015625, "learning_rate": 0.0004995291151253083, "loss": 6.7348, "mean_token_accuracy": 0.11380124613642692, "num_tokens": 6308259.0, "step": 2905 }, { "entropy": 6.846135902404785, "epoch": 0.31141313071860455, "grad_norm": 1.0234375, "learning_rate": 0.0004995266396118505, "loss": 6.8013, "mean_token_accuracy": 0.10161566883325576, "num_tokens": 6320058.0, "step": 2910 }, { "entropy": 6.900366973876953, "epoch": 0.3119482048263684, "grad_norm": 0.9140625, "learning_rate": 0.0004995241576152174, "loss": 6.7723, "mean_token_accuracy": 0.10676236972212791, "num_tokens": 6331203.0, "step": 2915 }, { "entropy": 6.897499227523804, "epoch": 0.31248327893413236, "grad_norm": 1.078125, "learning_rate": 0.000499521669135481, "loss": 6.8882, "mean_token_accuracy": 0.10588050186634064, "num_tokens": 6342027.0, "step": 2920 }, { "entropy": 6.894981956481933, "epoch": 0.3130183530418963, "grad_norm": 1.015625, "learning_rate": 0.0004995191741727128, "loss": 6.7873, "mean_token_accuracy": 0.10809844583272935, "num_tokens": 6352580.0, "step": 2925 }, { "entropy": 6.887385463714599, "epoch": 0.3135534271496602, "grad_norm": 0.94140625, "learning_rate": 0.000499516672726985, "loss": 6.8106, "mean_token_accuracy": 0.11217835023999215, "num_tokens": 6363997.0, "step": 2930 }, { "entropy": 6.83791708946228, "epoch": 0.31408850125742416, "grad_norm": 0.98046875, "learning_rate": 0.0004995141647983699, "loss": 6.8464, "mean_token_accuracy": 0.11019290536642075, "num_tokens": 6375284.0, "step": 2935 }, { "entropy": 6.8710222244262695, "epoch": 0.3146235753651881, "grad_norm": 0.984375, "learning_rate": 0.0004995116503869398, "loss": 6.7437, "mean_token_accuracy": 0.11758178621530532, "num_tokens": 6386698.0, "step": 2940 }, { "entropy": 6.864429473876953, "epoch": 0.315158649472952, "grad_norm": 1.3203125, "learning_rate": 0.0004995091294927673, "loss": 6.818, "mean_token_accuracy": 0.10886727124452591, "num_tokens": 6397237.0, "step": 2945 }, { "entropy": 6.973788785934448, "epoch": 0.3156937235807159, "grad_norm": 1.0, "learning_rate": 0.0004995066021159253, "loss": 6.9364, "mean_token_accuracy": 0.10483678579330444, "num_tokens": 6408266.0, "step": 2950 }, { "entropy": 6.842577266693115, "epoch": 0.31622879768847983, "grad_norm": 1.0546875, "learning_rate": 0.0004995040682564867, "loss": 6.8199, "mean_token_accuracy": 0.11405593305826187, "num_tokens": 6419563.0, "step": 2955 }, { "entropy": 6.8359404563903805, "epoch": 0.31676387179624377, "grad_norm": 1.0078125, "learning_rate": 0.0004995015279145247, "loss": 6.7863, "mean_token_accuracy": 0.11180907115340233, "num_tokens": 6430220.0, "step": 2960 }, { "entropy": 6.857833385467529, "epoch": 0.3172989459040077, "grad_norm": 1.1015625, "learning_rate": 0.0004994989810901126, "loss": 6.7961, "mean_token_accuracy": 0.10685641467571258, "num_tokens": 6440157.0, "step": 2965 }, { "entropy": 6.856301593780517, "epoch": 0.31783402001177163, "grad_norm": 1.1484375, "learning_rate": 0.0004994964277833239, "loss": 6.8463, "mean_token_accuracy": 0.11110184714198112, "num_tokens": 6449511.0, "step": 2970 }, { "entropy": 6.923713493347168, "epoch": 0.31836909411953557, "grad_norm": 0.9765625, "learning_rate": 0.0004994938679942324, "loss": 6.8365, "mean_token_accuracy": 0.10282818749547004, "num_tokens": 6460608.0, "step": 2975 }, { "entropy": 6.919619989395142, "epoch": 0.3189041682272995, "grad_norm": 1.046875, "learning_rate": 0.0004994913017229121, "loss": 6.8372, "mean_token_accuracy": 0.1131968080997467, "num_tokens": 6472737.0, "step": 2980 }, { "entropy": 6.817192554473877, "epoch": 0.31943924233506343, "grad_norm": 1.0703125, "learning_rate": 0.0004994887289694371, "loss": 6.7184, "mean_token_accuracy": 0.11385754495859146, "num_tokens": 6482993.0, "step": 2985 }, { "entropy": 6.960534572601318, "epoch": 0.3199743164428273, "grad_norm": 1.078125, "learning_rate": 0.0004994861497338814, "loss": 6.9207, "mean_token_accuracy": 0.11038238108158112, "num_tokens": 6494530.0, "step": 2990 }, { "entropy": 6.894915056228638, "epoch": 0.32050939055059124, "grad_norm": 1.0703125, "learning_rate": 0.0004994835640163198, "loss": 6.7626, "mean_token_accuracy": 0.10633266866207122, "num_tokens": 6504691.0, "step": 2995 }, { "entropy": 6.885722494125366, "epoch": 0.3210444646583552, "grad_norm": 1.0859375, "learning_rate": 0.0004994809718168267, "loss": 6.7865, "mean_token_accuracy": 0.10957603380084038, "num_tokens": 6514924.0, "step": 3000 }, { "epoch": 0.3210444646583552, "eval_entropy": 6.6982880289021205, "eval_loss": 6.9056596755981445, "eval_mean_token_accuracy": 0.11213191206946045, "eval_num_tokens": 6514924.0, "eval_runtime": 22.6381, "eval_samples_per_second": 1311.022, "eval_steps_per_second": 163.883, "step": 3000 }, { "entropy": 6.774571943283081, "epoch": 0.3215795387661191, "grad_norm": 1.0703125, "learning_rate": 0.0004994783731354771, "loss": 6.7524, "mean_token_accuracy": 0.11166785731911659, "num_tokens": 6526097.0, "step": 3005 }, { "entropy": 6.929418516159058, "epoch": 0.32211461287388304, "grad_norm": 1.0625, "learning_rate": 0.0004994757679723461, "loss": 6.8149, "mean_token_accuracy": 0.10639956593513489, "num_tokens": 6536384.0, "step": 3010 }, { "entropy": 6.919300746917725, "epoch": 0.322649686981647, "grad_norm": 1.0546875, "learning_rate": 0.0004994731563275088, "loss": 6.8694, "mean_token_accuracy": 0.1046457588672638, "num_tokens": 6547161.0, "step": 3015 }, { "entropy": 6.785147857666016, "epoch": 0.3231847610894109, "grad_norm": 1.046875, "learning_rate": 0.0004994705382010406, "loss": 6.7936, "mean_token_accuracy": 0.10720081478357316, "num_tokens": 6556751.0, "step": 3020 }, { "entropy": 6.861992263793946, "epoch": 0.3237198351971748, "grad_norm": 1.109375, "learning_rate": 0.0004994679135930174, "loss": 6.8486, "mean_token_accuracy": 0.1134506493806839, "num_tokens": 6567655.0, "step": 3025 }, { "entropy": 6.987712669372558, "epoch": 0.3242549093049387, "grad_norm": 1.1484375, "learning_rate": 0.0004994652825035144, "loss": 6.8797, "mean_token_accuracy": 0.10770419910550118, "num_tokens": 6579127.0, "step": 3030 }, { "entropy": 6.9072469711303714, "epoch": 0.32478998341270265, "grad_norm": 1.265625, "learning_rate": 0.0004994626449326081, "loss": 6.8376, "mean_token_accuracy": 0.11200311556458473, "num_tokens": 6590779.0, "step": 3035 }, { "entropy": 6.858027362823487, "epoch": 0.3253250575204666, "grad_norm": 1.09375, "learning_rate": 0.0004994600008803745, "loss": 6.7456, "mean_token_accuracy": 0.11969574466347695, "num_tokens": 6600849.0, "step": 3040 }, { "entropy": 6.831806564331055, "epoch": 0.3258601316282305, "grad_norm": 1.09375, "learning_rate": 0.0004994573503468899, "loss": 6.7547, "mean_token_accuracy": 0.11736322343349456, "num_tokens": 6610633.0, "step": 3045 }, { "entropy": 6.787566423416138, "epoch": 0.32639520573599445, "grad_norm": 0.953125, "learning_rate": 0.0004994546933322308, "loss": 6.7953, "mean_token_accuracy": 0.10811478719115257, "num_tokens": 6621327.0, "step": 3050 }, { "entropy": 6.93750228881836, "epoch": 0.3269302798437584, "grad_norm": 0.984375, "learning_rate": 0.000499452029836474, "loss": 6.7415, "mean_token_accuracy": 0.11278096809983254, "num_tokens": 6632267.0, "step": 3055 }, { "entropy": 6.810693454742432, "epoch": 0.32746535395152226, "grad_norm": 1.1796875, "learning_rate": 0.0004994493598596963, "loss": 6.7705, "mean_token_accuracy": 0.10761533975601197, "num_tokens": 6642714.0, "step": 3060 }, { "entropy": 6.849345254898071, "epoch": 0.3280004280592862, "grad_norm": 1.078125, "learning_rate": 0.0004994466834019749, "loss": 6.7758, "mean_token_accuracy": 0.11640546843409538, "num_tokens": 6652353.0, "step": 3065 }, { "entropy": 6.842514944076538, "epoch": 0.32853550216705013, "grad_norm": 1.0859375, "learning_rate": 0.0004994440004633871, "loss": 6.7517, "mean_token_accuracy": 0.11130421757698059, "num_tokens": 6663133.0, "step": 3070 }, { "entropy": 6.801913261413574, "epoch": 0.32907057627481406, "grad_norm": 1.1953125, "learning_rate": 0.0004994413110440103, "loss": 6.7354, "mean_token_accuracy": 0.11714180111885071, "num_tokens": 6673984.0, "step": 3075 }, { "entropy": 6.8637457370758055, "epoch": 0.329605650382578, "grad_norm": 0.875, "learning_rate": 0.0004994386151439222, "loss": 6.8076, "mean_token_accuracy": 0.1080280676484108, "num_tokens": 6686171.0, "step": 3080 }, { "entropy": 6.933955192565918, "epoch": 0.33014072449034193, "grad_norm": 1.109375, "learning_rate": 0.0004994359127632006, "loss": 6.8475, "mean_token_accuracy": 0.10514529719948769, "num_tokens": 6696609.0, "step": 3085 }, { "entropy": 6.89633002281189, "epoch": 0.33067579859810586, "grad_norm": 1.1875, "learning_rate": 0.0004994332039019235, "loss": 6.7854, "mean_token_accuracy": 0.11049062609672547, "num_tokens": 6706188.0, "step": 3090 }, { "entropy": 6.708978939056396, "epoch": 0.33121087270586974, "grad_norm": 1.125, "learning_rate": 0.0004994304885601694, "loss": 6.7667, "mean_token_accuracy": 0.11125922203063965, "num_tokens": 6716276.0, "step": 3095 }, { "entropy": 6.774325132369995, "epoch": 0.3317459468136337, "grad_norm": 1.2890625, "learning_rate": 0.0004994277667380162, "loss": 6.737, "mean_token_accuracy": 0.1192335270345211, "num_tokens": 6727176.0, "step": 3100 }, { "entropy": 6.887723302841186, "epoch": 0.3322810209213976, "grad_norm": 1.1171875, "learning_rate": 0.0004994250384355429, "loss": 6.8119, "mean_token_accuracy": 0.11386096626520156, "num_tokens": 6737768.0, "step": 3105 }, { "entropy": 6.840688323974609, "epoch": 0.33281609502916154, "grad_norm": 6.46875, "learning_rate": 0.0004994223036528282, "loss": 6.7618, "mean_token_accuracy": 0.11079908534884453, "num_tokens": 6747962.0, "step": 3110 }, { "entropy": 6.8406102657318115, "epoch": 0.3333511691369255, "grad_norm": 1.1171875, "learning_rate": 0.000499419562389951, "loss": 6.7548, "mean_token_accuracy": 0.1147709958255291, "num_tokens": 6758400.0, "step": 3115 }, { "entropy": 6.851141119003296, "epoch": 0.3338862432446894, "grad_norm": 1.0390625, "learning_rate": 0.0004994168146469904, "loss": 6.7693, "mean_token_accuracy": 0.11088330820202827, "num_tokens": 6768855.0, "step": 3120 }, { "entropy": 6.863172101974487, "epoch": 0.33442131735245334, "grad_norm": 1.0234375, "learning_rate": 0.0004994140604240259, "loss": 6.7514, "mean_token_accuracy": 0.1078583225607872, "num_tokens": 6778656.0, "step": 3125 }, { "entropy": 6.882100915908813, "epoch": 0.3349563914602172, "grad_norm": 0.98046875, "learning_rate": 0.0004994112997211369, "loss": 6.8182, "mean_token_accuracy": 0.11499066054821014, "num_tokens": 6789960.0, "step": 3130 }, { "entropy": 6.730247640609742, "epoch": 0.33549146556798115, "grad_norm": 1.1875, "learning_rate": 0.0004994085325384031, "loss": 6.8076, "mean_token_accuracy": 0.10851202681660652, "num_tokens": 6800188.0, "step": 3135 }, { "entropy": 6.906764650344849, "epoch": 0.3360265396757451, "grad_norm": 1.0546875, "learning_rate": 0.0004994057588759045, "loss": 6.7393, "mean_token_accuracy": 0.11358117088675498, "num_tokens": 6811032.0, "step": 3140 }, { "entropy": 6.824139022827149, "epoch": 0.336561613783509, "grad_norm": 1.0625, "learning_rate": 0.0004994029787337212, "loss": 6.7666, "mean_token_accuracy": 0.10829171538352966, "num_tokens": 6823060.0, "step": 3145 }, { "entropy": 6.8112482070922855, "epoch": 0.33709668789127295, "grad_norm": 1.0703125, "learning_rate": 0.0004994001921119333, "loss": 6.8496, "mean_token_accuracy": 0.10913093164563178, "num_tokens": 6833559.0, "step": 3150 }, { "entropy": 6.894295167922974, "epoch": 0.3376317619990369, "grad_norm": 1.1171875, "learning_rate": 0.0004993973990106215, "loss": 6.7974, "mean_token_accuracy": 0.11234046593308449, "num_tokens": 6843657.0, "step": 3155 }, { "entropy": 6.814738702774048, "epoch": 0.3381668361068008, "grad_norm": 1.1171875, "learning_rate": 0.0004993945994298662, "loss": 6.7267, "mean_token_accuracy": 0.10636094883084297, "num_tokens": 6853615.0, "step": 3160 }, { "entropy": 6.858942174911499, "epoch": 0.3387019102145647, "grad_norm": 1.03125, "learning_rate": 0.0004993917933697484, "loss": 6.8354, "mean_token_accuracy": 0.10942788496613502, "num_tokens": 6865256.0, "step": 3165 }, { "entropy": 7.015973472595215, "epoch": 0.3392369843223286, "grad_norm": 1.1171875, "learning_rate": 0.0004993889808303493, "loss": 6.8711, "mean_token_accuracy": 0.11036419197916984, "num_tokens": 6875358.0, "step": 3170 }, { "entropy": 6.757581901550293, "epoch": 0.33977205843009256, "grad_norm": 1.015625, "learning_rate": 0.0004993861618117498, "loss": 6.7711, "mean_token_accuracy": 0.1102716788649559, "num_tokens": 6886584.0, "step": 3175 }, { "entropy": 6.8233020305633545, "epoch": 0.3403071325378565, "grad_norm": 1.0546875, "learning_rate": 0.0004993833363140314, "loss": 6.7109, "mean_token_accuracy": 0.11896613985300064, "num_tokens": 6896958.0, "step": 3180 }, { "entropy": 6.830180215835571, "epoch": 0.3408422066456204, "grad_norm": 1.03125, "learning_rate": 0.0004993805043372756, "loss": 6.775, "mean_token_accuracy": 0.1163598895072937, "num_tokens": 6907944.0, "step": 3185 }, { "entropy": 6.831008625030518, "epoch": 0.34137728075338436, "grad_norm": 1.0078125, "learning_rate": 0.0004993776658815644, "loss": 6.8739, "mean_token_accuracy": 0.1049034409224987, "num_tokens": 6919486.0, "step": 3190 }, { "entropy": 6.957132577896118, "epoch": 0.3419123548611483, "grad_norm": 1.2578125, "learning_rate": 0.0004993748209469796, "loss": 6.8414, "mean_token_accuracy": 0.11248302012681961, "num_tokens": 6930650.0, "step": 3195 }, { "entropy": 6.833132362365722, "epoch": 0.34244742896891217, "grad_norm": 1.015625, "learning_rate": 0.0004993719695336033, "loss": 6.7926, "mean_token_accuracy": 0.11160960346460343, "num_tokens": 6941519.0, "step": 3200 }, { "entropy": 6.775629329681396, "epoch": 0.3429825030766761, "grad_norm": 1.5078125, "learning_rate": 0.0004993691116415179, "loss": 6.8265, "mean_token_accuracy": 0.10980288833379745, "num_tokens": 6952952.0, "step": 3205 }, { "entropy": 6.945135641098022, "epoch": 0.34351757718444004, "grad_norm": 1.0078125, "learning_rate": 0.000499366247270806, "loss": 6.7907, "mean_token_accuracy": 0.11398276537656785, "num_tokens": 6962867.0, "step": 3210 }, { "entropy": 6.850128173828125, "epoch": 0.34405265129220397, "grad_norm": 1.0546875, "learning_rate": 0.0004993633764215502, "loss": 6.7128, "mean_token_accuracy": 0.1149346224963665, "num_tokens": 6973434.0, "step": 3215 }, { "entropy": 6.805971765518189, "epoch": 0.3445877253999679, "grad_norm": 1.125, "learning_rate": 0.0004993604990938336, "loss": 6.7242, "mean_token_accuracy": 0.12372536882758141, "num_tokens": 6984161.0, "step": 3220 }, { "entropy": 6.831466388702393, "epoch": 0.34512279950773184, "grad_norm": 1.078125, "learning_rate": 0.0004993576152877389, "loss": 6.7023, "mean_token_accuracy": 0.11155548840761184, "num_tokens": 6994700.0, "step": 3225 }, { "entropy": 6.859937858581543, "epoch": 0.34565787361549577, "grad_norm": 1.0859375, "learning_rate": 0.0004993547250033496, "loss": 6.8702, "mean_token_accuracy": 0.10222596898674965, "num_tokens": 7006497.0, "step": 3230 }, { "entropy": 6.907996559143067, "epoch": 0.34619294772325965, "grad_norm": 1.0703125, "learning_rate": 0.0004993518282407493, "loss": 6.7762, "mean_token_accuracy": 0.11640164703130722, "num_tokens": 7016415.0, "step": 3235 }, { "entropy": 6.780554246902466, "epoch": 0.3467280218310236, "grad_norm": 1.2109375, "learning_rate": 0.0004993489250000213, "loss": 6.7293, "mean_token_accuracy": 0.11351820677518845, "num_tokens": 7026610.0, "step": 3240 }, { "entropy": 6.797022676467895, "epoch": 0.3472630959387875, "grad_norm": 1.0390625, "learning_rate": 0.0004993460152812497, "loss": 6.7409, "mean_token_accuracy": 0.11043249741196633, "num_tokens": 7038236.0, "step": 3245 }, { "entropy": 6.871045017242432, "epoch": 0.34779817004655145, "grad_norm": 1.140625, "learning_rate": 0.0004993430990845184, "loss": 6.7892, "mean_token_accuracy": 0.12099697217345237, "num_tokens": 7049438.0, "step": 3250 }, { "entropy": 6.795158195495605, "epoch": 0.3483332441543154, "grad_norm": 1.0859375, "learning_rate": 0.0004993401764099118, "loss": 6.75, "mean_token_accuracy": 0.10678878873586654, "num_tokens": 7061001.0, "step": 3255 }, { "entropy": 6.869133567810058, "epoch": 0.3488683182620793, "grad_norm": 1.09375, "learning_rate": 0.0004993372472575139, "loss": 6.7464, "mean_token_accuracy": 0.11511967554688454, "num_tokens": 7071328.0, "step": 3260 }, { "entropy": 6.9016501903533936, "epoch": 0.34940339236984325, "grad_norm": 1.140625, "learning_rate": 0.0004993343116274096, "loss": 6.93, "mean_token_accuracy": 0.10523641705513001, "num_tokens": 7082597.0, "step": 3265 }, { "entropy": 6.860869073867798, "epoch": 0.3499384664776071, "grad_norm": 1.0390625, "learning_rate": 0.0004993313695196836, "loss": 6.759, "mean_token_accuracy": 0.116279286891222, "num_tokens": 7093463.0, "step": 3270 }, { "entropy": 6.816839218139648, "epoch": 0.35047354058537106, "grad_norm": 0.984375, "learning_rate": 0.0004993284209344208, "loss": 6.8225, "mean_token_accuracy": 0.11397869065403939, "num_tokens": 7104350.0, "step": 3275 }, { "entropy": 6.929663181304932, "epoch": 0.351008614693135, "grad_norm": 1.2265625, "learning_rate": 0.0004993254658717065, "loss": 6.78, "mean_token_accuracy": 0.11524501666426659, "num_tokens": 7114851.0, "step": 3280 }, { "entropy": 6.865924549102783, "epoch": 0.3515436888008989, "grad_norm": 1.078125, "learning_rate": 0.0004993225043316257, "loss": 6.8189, "mean_token_accuracy": 0.10788183063268661, "num_tokens": 7126440.0, "step": 3285 }, { "entropy": 6.94174747467041, "epoch": 0.35207876290866286, "grad_norm": 1.125, "learning_rate": 0.0004993195363142643, "loss": 6.8435, "mean_token_accuracy": 0.10635844394564628, "num_tokens": 7137884.0, "step": 3290 }, { "entropy": 6.8471081256866455, "epoch": 0.3526138370164268, "grad_norm": 1.2265625, "learning_rate": 0.0004993165618197076, "loss": 6.8169, "mean_token_accuracy": 0.10543133914470673, "num_tokens": 7147930.0, "step": 3295 }, { "entropy": 6.814928293228149, "epoch": 0.3531489111241907, "grad_norm": 1.0078125, "learning_rate": 0.0004993135808480418, "loss": 6.6758, "mean_token_accuracy": 0.12192264795303345, "num_tokens": 7159200.0, "step": 3300 }, { "entropy": 6.856072282791137, "epoch": 0.3536839852319546, "grad_norm": 1.0625, "learning_rate": 0.0004993105933993529, "loss": 6.7738, "mean_token_accuracy": 0.11219395026564598, "num_tokens": 7169601.0, "step": 3305 }, { "entropy": 6.731938648223877, "epoch": 0.35421905933971853, "grad_norm": 1.0546875, "learning_rate": 0.0004993075994737271, "loss": 6.7014, "mean_token_accuracy": 0.12335732132196427, "num_tokens": 7180465.0, "step": 3310 }, { "entropy": 6.827739572525024, "epoch": 0.35475413344748247, "grad_norm": 1.0625, "learning_rate": 0.0004993045990712508, "loss": 6.7214, "mean_token_accuracy": 0.1124566912651062, "num_tokens": 7190603.0, "step": 3315 }, { "entropy": 6.744693279266357, "epoch": 0.3552892075552464, "grad_norm": 1.015625, "learning_rate": 0.0004993015921920109, "loss": 6.6822, "mean_token_accuracy": 0.1178012415766716, "num_tokens": 7201017.0, "step": 3320 }, { "entropy": 6.700474643707276, "epoch": 0.35582428166301033, "grad_norm": 1.109375, "learning_rate": 0.000499298578836094, "loss": 6.6851, "mean_token_accuracy": 0.11364478841423989, "num_tokens": 7210908.0, "step": 3325 }, { "entropy": 6.913705682754516, "epoch": 0.35635935577077427, "grad_norm": 1.078125, "learning_rate": 0.000499295559003587, "loss": 6.7313, "mean_token_accuracy": 0.11469347327947617, "num_tokens": 7221306.0, "step": 3330 }, { "entropy": 6.857224035263061, "epoch": 0.3568944298785382, "grad_norm": 0.984375, "learning_rate": 0.0004992925326945774, "loss": 6.8446, "mean_token_accuracy": 0.11008940190076828, "num_tokens": 7233076.0, "step": 3335 }, { "entropy": 6.836943006515503, "epoch": 0.3574295039863021, "grad_norm": 1.1875, "learning_rate": 0.0004992894999091524, "loss": 6.833, "mean_token_accuracy": 0.11023118868470191, "num_tokens": 7244703.0, "step": 3340 }, { "entropy": 6.865760707855225, "epoch": 0.357964578094066, "grad_norm": 1.0546875, "learning_rate": 0.0004992864606473996, "loss": 6.8127, "mean_token_accuracy": 0.10562887638807297, "num_tokens": 7255438.0, "step": 3345 }, { "entropy": 6.873836708068848, "epoch": 0.35849965220182994, "grad_norm": 1.1171875, "learning_rate": 0.0004992834149094069, "loss": 6.7746, "mean_token_accuracy": 0.10823791846632957, "num_tokens": 7265720.0, "step": 3350 }, { "entropy": 6.854056453704834, "epoch": 0.3590347263095939, "grad_norm": 1.0625, "learning_rate": 0.0004992803626952619, "loss": 6.8105, "mean_token_accuracy": 0.10965728536248207, "num_tokens": 7277791.0, "step": 3355 }, { "entropy": 6.743177652359009, "epoch": 0.3595698004173578, "grad_norm": 1.0625, "learning_rate": 0.000499277304005053, "loss": 6.6904, "mean_token_accuracy": 0.11896344646811485, "num_tokens": 7288521.0, "step": 3360 }, { "entropy": 6.8449372291564945, "epoch": 0.36010487452512174, "grad_norm": 1.03125, "learning_rate": 0.0004992742388388686, "loss": 6.8681, "mean_token_accuracy": 0.10312251970171929, "num_tokens": 7299298.0, "step": 3365 }, { "entropy": 6.848871850967408, "epoch": 0.3606399486328857, "grad_norm": 1.0390625, "learning_rate": 0.0004992711671967968, "loss": 6.6907, "mean_token_accuracy": 0.11500442028045654, "num_tokens": 7310271.0, "step": 3370 }, { "entropy": 6.832868242263794, "epoch": 0.36117502274064955, "grad_norm": 1.046875, "learning_rate": 0.0004992680890789268, "loss": 6.7535, "mean_token_accuracy": 0.11115506291389465, "num_tokens": 7321112.0, "step": 3375 }, { "entropy": 6.744096136093139, "epoch": 0.3617100968484135, "grad_norm": 1.125, "learning_rate": 0.0004992650044853471, "loss": 6.7111, "mean_token_accuracy": 0.11423057690262794, "num_tokens": 7331976.0, "step": 3380 }, { "entropy": 6.881365203857422, "epoch": 0.3622451709561774, "grad_norm": 1.15625, "learning_rate": 0.000499261913416147, "loss": 6.8157, "mean_token_accuracy": 0.11083743125200271, "num_tokens": 7342800.0, "step": 3385 }, { "entropy": 6.820743465423584, "epoch": 0.36278024506394135, "grad_norm": 0.98046875, "learning_rate": 0.0004992588158714157, "loss": 6.6508, "mean_token_accuracy": 0.11105694174766541, "num_tokens": 7354213.0, "step": 3390 }, { "entropy": 6.789371490478516, "epoch": 0.3633153191717053, "grad_norm": 1.1328125, "learning_rate": 0.0004992557118512424, "loss": 6.7069, "mean_token_accuracy": 0.11869031190872192, "num_tokens": 7363250.0, "step": 3395 }, { "entropy": 6.7624798774719235, "epoch": 0.3638503932794692, "grad_norm": 1.078125, "learning_rate": 0.0004992526013557171, "loss": 6.7605, "mean_token_accuracy": 0.11203641667962075, "num_tokens": 7374185.0, "step": 3400 }, { "entropy": 6.752663087844849, "epoch": 0.36438546738723315, "grad_norm": 1.0703125, "learning_rate": 0.0004992494843849294, "loss": 6.7287, "mean_token_accuracy": 0.10924962237477302, "num_tokens": 7384579.0, "step": 3405 }, { "entropy": 6.896695327758789, "epoch": 0.36492054149499703, "grad_norm": 1.1171875, "learning_rate": 0.0004992463609389694, "loss": 6.7422, "mean_token_accuracy": 0.10970545783638955, "num_tokens": 7395277.0, "step": 3410 }, { "entropy": 6.726968002319336, "epoch": 0.36545561560276096, "grad_norm": 1.0078125, "learning_rate": 0.0004992432310179272, "loss": 6.7332, "mean_token_accuracy": 0.1160312682390213, "num_tokens": 7406688.0, "step": 3415 }, { "entropy": 6.766181993484497, "epoch": 0.3659906897105249, "grad_norm": 0.99609375, "learning_rate": 0.0004992400946218932, "loss": 6.795, "mean_token_accuracy": 0.11444359049201011, "num_tokens": 7417378.0, "step": 3420 }, { "entropy": 6.967504692077637, "epoch": 0.36652576381828883, "grad_norm": 1.046875, "learning_rate": 0.0004992369517509581, "loss": 6.8179, "mean_token_accuracy": 0.1145808644592762, "num_tokens": 7427675.0, "step": 3425 }, { "entropy": 6.834393882751465, "epoch": 0.36706083792605276, "grad_norm": 1.0625, "learning_rate": 0.0004992338024052123, "loss": 6.8405, "mean_token_accuracy": 0.10944146141409875, "num_tokens": 7438083.0, "step": 3430 }, { "entropy": 6.772138452529907, "epoch": 0.3675959120338167, "grad_norm": 1.0859375, "learning_rate": 0.0004992306465847473, "loss": 6.6866, "mean_token_accuracy": 0.11544951871037483, "num_tokens": 7449051.0, "step": 3435 }, { "entropy": 6.803123044967651, "epoch": 0.36813098614158063, "grad_norm": 1.03125, "learning_rate": 0.0004992274842896536, "loss": 6.7313, "mean_token_accuracy": 0.11575418040156364, "num_tokens": 7459074.0, "step": 3440 }, { "entropy": 6.810998582839966, "epoch": 0.3686660602493445, "grad_norm": 1.0625, "learning_rate": 0.0004992243155200229, "loss": 6.7908, "mean_token_accuracy": 0.11545799896121026, "num_tokens": 7470472.0, "step": 3445 }, { "entropy": 6.810088348388672, "epoch": 0.36920113435710844, "grad_norm": 1.0, "learning_rate": 0.0004992211402759466, "loss": 6.7589, "mean_token_accuracy": 0.11591348797082901, "num_tokens": 7481477.0, "step": 3450 }, { "entropy": 6.811910390853882, "epoch": 0.3697362084648724, "grad_norm": 1.0390625, "learning_rate": 0.0004992179585575164, "loss": 6.7166, "mean_token_accuracy": 0.11710453182458877, "num_tokens": 7491906.0, "step": 3455 }, { "entropy": 6.801189374923706, "epoch": 0.3702712825726363, "grad_norm": 1.1328125, "learning_rate": 0.000499214770364824, "loss": 6.6567, "mean_token_accuracy": 0.10969180539250374, "num_tokens": 7502447.0, "step": 3460 }, { "entropy": 6.731618452072143, "epoch": 0.37080635668040024, "grad_norm": 1.1328125, "learning_rate": 0.0004992115756979617, "loss": 6.6488, "mean_token_accuracy": 0.12150704562664032, "num_tokens": 7513505.0, "step": 3465 }, { "entropy": 6.763904094696045, "epoch": 0.3713414307881642, "grad_norm": 1.0390625, "learning_rate": 0.0004992083745570218, "loss": 6.6731, "mean_token_accuracy": 0.11672577038407325, "num_tokens": 7524884.0, "step": 3470 }, { "entropy": 6.764589834213257, "epoch": 0.3718765048959281, "grad_norm": 1.078125, "learning_rate": 0.0004992051669420964, "loss": 6.7534, "mean_token_accuracy": 0.11659367606043816, "num_tokens": 7535942.0, "step": 3475 }, { "entropy": 6.77218713760376, "epoch": 0.372411579003692, "grad_norm": 1.0859375, "learning_rate": 0.0004992019528532785, "loss": 6.7354, "mean_token_accuracy": 0.12092937007546425, "num_tokens": 7545506.0, "step": 3480 }, { "entropy": 6.874322080612183, "epoch": 0.3729466531114559, "grad_norm": 1.25, "learning_rate": 0.0004991987322906605, "loss": 6.801, "mean_token_accuracy": 0.10959522724151612, "num_tokens": 7555328.0, "step": 3485 }, { "entropy": 6.811362361907959, "epoch": 0.37348172721921985, "grad_norm": 1.1640625, "learning_rate": 0.0004991955052543357, "loss": 6.6899, "mean_token_accuracy": 0.1134427696466446, "num_tokens": 7565762.0, "step": 3490 }, { "entropy": 6.830954933166504, "epoch": 0.3740168013269838, "grad_norm": 1.09375, "learning_rate": 0.0004991922717443972, "loss": 6.7216, "mean_token_accuracy": 0.12056689336895943, "num_tokens": 7575884.0, "step": 3495 }, { "entropy": 6.742701625823974, "epoch": 0.3745518754347477, "grad_norm": 1.046875, "learning_rate": 0.0004991890317609384, "loss": 6.7499, "mean_token_accuracy": 0.11369063630700112, "num_tokens": 7586100.0, "step": 3500 }, { "entropy": 6.859546327590943, "epoch": 0.37508694954251165, "grad_norm": 1.171875, "learning_rate": 0.0004991857853040528, "loss": 6.7591, "mean_token_accuracy": 0.11486376821994781, "num_tokens": 7597137.0, "step": 3505 }, { "entropy": 6.82744083404541, "epoch": 0.3756220236502756, "grad_norm": 1.0703125, "learning_rate": 0.0004991825323738341, "loss": 6.7932, "mean_token_accuracy": 0.11721144542098046, "num_tokens": 7607640.0, "step": 3510 }, { "entropy": 6.840407514572144, "epoch": 0.3761570977580395, "grad_norm": 1.1953125, "learning_rate": 0.0004991792729703763, "loss": 6.851, "mean_token_accuracy": 0.1160910353064537, "num_tokens": 7618319.0, "step": 3515 }, { "entropy": 6.877895498275757, "epoch": 0.3766921718658034, "grad_norm": 1.046875, "learning_rate": 0.0004991760070937734, "loss": 6.7208, "mean_token_accuracy": 0.11491079404950141, "num_tokens": 7628350.0, "step": 3520 }, { "entropy": 6.842350673675537, "epoch": 0.3772272459735673, "grad_norm": 1.203125, "learning_rate": 0.0004991727347441199, "loss": 6.7361, "mean_token_accuracy": 0.11011843830347061, "num_tokens": 7637857.0, "step": 3525 }, { "entropy": 6.858046007156372, "epoch": 0.37776232008133126, "grad_norm": 1.125, "learning_rate": 0.0004991694559215102, "loss": 6.7602, "mean_token_accuracy": 0.11095951348543168, "num_tokens": 7648242.0, "step": 3530 }, { "entropy": 6.830993270874023, "epoch": 0.3782973941890952, "grad_norm": 0.9453125, "learning_rate": 0.000499166170626039, "loss": 6.7743, "mean_token_accuracy": 0.10925297141075134, "num_tokens": 7660565.0, "step": 3535 }, { "entropy": 6.797787475585937, "epoch": 0.3788324682968591, "grad_norm": 1.21875, "learning_rate": 0.000499162878857801, "loss": 6.7711, "mean_token_accuracy": 0.1141252376139164, "num_tokens": 7671600.0, "step": 3540 }, { "entropy": 6.854355716705323, "epoch": 0.37936754240462306, "grad_norm": 1.03125, "learning_rate": 0.0004991595806168915, "loss": 6.7761, "mean_token_accuracy": 0.10867656469345092, "num_tokens": 7682453.0, "step": 3545 }, { "entropy": 6.801757192611694, "epoch": 0.379902616512387, "grad_norm": 1.0, "learning_rate": 0.0004991562759034055, "loss": 6.7221, "mean_token_accuracy": 0.11367509812116623, "num_tokens": 7693490.0, "step": 3550 }, { "entropy": 6.828986072540284, "epoch": 0.38043769062015087, "grad_norm": 1.0859375, "learning_rate": 0.0004991529647174386, "loss": 6.6761, "mean_token_accuracy": 0.1118717484176159, "num_tokens": 7703478.0, "step": 3555 }, { "entropy": 6.7392528533935545, "epoch": 0.3809727647279148, "grad_norm": 1.0859375, "learning_rate": 0.0004991496470590864, "loss": 6.7761, "mean_token_accuracy": 0.1103611208498478, "num_tokens": 7714647.0, "step": 3560 }, { "entropy": 6.863647413253784, "epoch": 0.38150783883567874, "grad_norm": 1.1015625, "learning_rate": 0.0004991463229284445, "loss": 6.7173, "mean_token_accuracy": 0.11717814281582832, "num_tokens": 7725528.0, "step": 3565 }, { "entropy": 6.771598768234253, "epoch": 0.38204291294344267, "grad_norm": 1.109375, "learning_rate": 0.0004991429923256091, "loss": 6.7756, "mean_token_accuracy": 0.11080185323953629, "num_tokens": 7737708.0, "step": 3570 }, { "entropy": 6.878248071670532, "epoch": 0.3825779870512066, "grad_norm": 1.015625, "learning_rate": 0.0004991396552506762, "loss": 6.764, "mean_token_accuracy": 0.11186526715755463, "num_tokens": 7749093.0, "step": 3575 }, { "entropy": 6.7422984600067135, "epoch": 0.38311306115897054, "grad_norm": 1.0546875, "learning_rate": 0.0004991363117037423, "loss": 6.7004, "mean_token_accuracy": 0.11901898533105851, "num_tokens": 7760024.0, "step": 3580 }, { "entropy": 6.767995119094849, "epoch": 0.38364813526673447, "grad_norm": 1.03125, "learning_rate": 0.0004991329616849039, "loss": 6.7284, "mean_token_accuracy": 0.11957356333732605, "num_tokens": 7770801.0, "step": 3585 }, { "entropy": 6.866620016098023, "epoch": 0.38418320937449835, "grad_norm": 1.046875, "learning_rate": 0.0004991296051942578, "loss": 6.7847, "mean_token_accuracy": 0.1116973415017128, "num_tokens": 7782257.0, "step": 3590 }, { "entropy": 6.763524389266967, "epoch": 0.3847182834822623, "grad_norm": 1.015625, "learning_rate": 0.0004991262422319008, "loss": 6.7091, "mean_token_accuracy": 0.11752377822995186, "num_tokens": 7793016.0, "step": 3595 }, { "entropy": 6.7549824714660645, "epoch": 0.3852533575900262, "grad_norm": 1.25, "learning_rate": 0.00049912287279793, "loss": 6.6492, "mean_token_accuracy": 0.1228921391069889, "num_tokens": 7802207.0, "step": 3600 }, { "entropy": 6.812817192077636, "epoch": 0.38578843169779015, "grad_norm": 1.171875, "learning_rate": 0.0004991194968924429, "loss": 6.7834, "mean_token_accuracy": 0.11178419142961502, "num_tokens": 7813487.0, "step": 3605 }, { "entropy": 6.858286571502686, "epoch": 0.3863235058055541, "grad_norm": 1.109375, "learning_rate": 0.0004991161145155367, "loss": 6.7563, "mean_token_accuracy": 0.11035445258021355, "num_tokens": 7824587.0, "step": 3610 }, { "entropy": 6.882280063629151, "epoch": 0.386858579913318, "grad_norm": 1.0625, "learning_rate": 0.0004991127256673091, "loss": 6.7368, "mean_token_accuracy": 0.11012360826134682, "num_tokens": 7836240.0, "step": 3615 }, { "entropy": 6.753285121917725, "epoch": 0.38739365402108195, "grad_norm": 1.15625, "learning_rate": 0.0004991093303478582, "loss": 6.6861, "mean_token_accuracy": 0.11604151576757431, "num_tokens": 7847014.0, "step": 3620 }, { "entropy": 6.788820505142212, "epoch": 0.3879287281288458, "grad_norm": 1.046875, "learning_rate": 0.0004991059285572818, "loss": 6.807, "mean_token_accuracy": 0.11351005062460899, "num_tokens": 7857899.0, "step": 3625 }, { "entropy": 6.857131767272949, "epoch": 0.38846380223660976, "grad_norm": 1.0234375, "learning_rate": 0.0004991025202956781, "loss": 6.6902, "mean_token_accuracy": 0.11639388576149941, "num_tokens": 7868987.0, "step": 3630 }, { "entropy": 6.850029611587525, "epoch": 0.3889988763443737, "grad_norm": 1.1875, "learning_rate": 0.0004990991055631457, "loss": 6.81, "mean_token_accuracy": 0.11189388036727906, "num_tokens": 7879547.0, "step": 3635 }, { "entropy": 6.762338304519654, "epoch": 0.3895339504521376, "grad_norm": 1.0625, "learning_rate": 0.0004990956843597832, "loss": 6.6763, "mean_token_accuracy": 0.1170013889670372, "num_tokens": 7889824.0, "step": 3640 }, { "entropy": 6.673375177383423, "epoch": 0.39006902455990156, "grad_norm": 1.1015625, "learning_rate": 0.0004990922566856892, "loss": 6.669, "mean_token_accuracy": 0.11331403329968452, "num_tokens": 7901156.0, "step": 3645 }, { "entropy": 6.770735454559326, "epoch": 0.3906040986676655, "grad_norm": 1.296875, "learning_rate": 0.0004990888225409629, "loss": 6.7076, "mean_token_accuracy": 0.11252901628613472, "num_tokens": 7911695.0, "step": 3650 }, { "entropy": 6.755655097961426, "epoch": 0.3911391727754294, "grad_norm": 0.984375, "learning_rate": 0.0004990853819257033, "loss": 6.7026, "mean_token_accuracy": 0.11720905601978301, "num_tokens": 7923559.0, "step": 3655 }, { "entropy": 6.84619779586792, "epoch": 0.3916742468831933, "grad_norm": 1.09375, "learning_rate": 0.0004990819348400097, "loss": 6.7214, "mean_token_accuracy": 0.11208191886544228, "num_tokens": 7935792.0, "step": 3660 }, { "entropy": 6.793423795700074, "epoch": 0.39220932099095723, "grad_norm": 1.359375, "learning_rate": 0.0004990784812839818, "loss": 6.7092, "mean_token_accuracy": 0.1186470128595829, "num_tokens": 7946987.0, "step": 3665 }, { "entropy": 6.699849939346313, "epoch": 0.39274439509872117, "grad_norm": 1.125, "learning_rate": 0.0004990750212577192, "loss": 6.6369, "mean_token_accuracy": 0.12066235840320587, "num_tokens": 7957160.0, "step": 3670 }, { "entropy": 6.781460571289062, "epoch": 0.3932794692064851, "grad_norm": 1.09375, "learning_rate": 0.0004990715547613219, "loss": 6.7333, "mean_token_accuracy": 0.10956480428576469, "num_tokens": 7968833.0, "step": 3675 }, { "entropy": 6.873096227645874, "epoch": 0.39381454331424903, "grad_norm": 0.9921875, "learning_rate": 0.0004990680817948898, "loss": 6.7822, "mean_token_accuracy": 0.10927629321813584, "num_tokens": 7980661.0, "step": 3680 }, { "entropy": 6.861059999465942, "epoch": 0.39434961742201297, "grad_norm": 1.1171875, "learning_rate": 0.0004990646023585234, "loss": 6.7065, "mean_token_accuracy": 0.11303527727723121, "num_tokens": 7992677.0, "step": 3685 }, { "entropy": 6.700655746459961, "epoch": 0.3948846915297769, "grad_norm": 1.125, "learning_rate": 0.0004990611164523231, "loss": 6.6919, "mean_token_accuracy": 0.1178669311106205, "num_tokens": 8002796.0, "step": 3690 }, { "entropy": 6.6995728492736815, "epoch": 0.3954197656375408, "grad_norm": 1.171875, "learning_rate": 0.0004990576240763896, "loss": 6.7181, "mean_token_accuracy": 0.11917829737067223, "num_tokens": 8012779.0, "step": 3695 }, { "entropy": 6.79206166267395, "epoch": 0.3959548397453047, "grad_norm": 1.015625, "learning_rate": 0.0004990541252308237, "loss": 6.6986, "mean_token_accuracy": 0.11830845102667809, "num_tokens": 8023442.0, "step": 3700 }, { "entropy": 6.777542209625244, "epoch": 0.39648991385306864, "grad_norm": 1.109375, "learning_rate": 0.0004990506199157263, "loss": 6.7844, "mean_token_accuracy": 0.11193263530731201, "num_tokens": 8035163.0, "step": 3705 }, { "entropy": 6.826216363906861, "epoch": 0.3970249879608326, "grad_norm": 1.1484375, "learning_rate": 0.0004990471081311988, "loss": 6.7221, "mean_token_accuracy": 0.11202551424503326, "num_tokens": 8045330.0, "step": 3710 }, { "entropy": 6.826126527786255, "epoch": 0.3975600620685965, "grad_norm": 0.9921875, "learning_rate": 0.0004990435898773426, "loss": 6.7341, "mean_token_accuracy": 0.11674164608120918, "num_tokens": 8056154.0, "step": 3715 }, { "entropy": 6.795881938934326, "epoch": 0.39809513617636044, "grad_norm": 1.015625, "learning_rate": 0.0004990400651542592, "loss": 6.6916, "mean_token_accuracy": 0.1208396390080452, "num_tokens": 8066101.0, "step": 3720 }, { "entropy": 6.82635269165039, "epoch": 0.3986302102841244, "grad_norm": 1.09375, "learning_rate": 0.0004990365339620504, "loss": 6.778, "mean_token_accuracy": 0.11029551848769188, "num_tokens": 8077249.0, "step": 3725 }, { "entropy": 6.791606903076172, "epoch": 0.39916528439188825, "grad_norm": 1.2734375, "learning_rate": 0.000499032996300818, "loss": 6.7108, "mean_token_accuracy": 0.11683286353945732, "num_tokens": 8088532.0, "step": 3730 }, { "entropy": 6.7761242389678955, "epoch": 0.3997003584996522, "grad_norm": 1.265625, "learning_rate": 0.0004990294521706645, "loss": 6.7513, "mean_token_accuracy": 0.11043450236320496, "num_tokens": 8099541.0, "step": 3735 }, { "entropy": 6.778212356567383, "epoch": 0.4002354326074161, "grad_norm": 1.0, "learning_rate": 0.000499025901571692, "loss": 6.7925, "mean_token_accuracy": 0.11460375785827637, "num_tokens": 8110532.0, "step": 3740 }, { "entropy": 6.860037422180175, "epoch": 0.40077050671518005, "grad_norm": 1.265625, "learning_rate": 0.0004990223445040031, "loss": 6.7246, "mean_token_accuracy": 0.12051974311470985, "num_tokens": 8120991.0, "step": 3745 }, { "entropy": 6.796218538284302, "epoch": 0.401305580822944, "grad_norm": 1.0390625, "learning_rate": 0.0004990187809677004, "loss": 6.6332, "mean_token_accuracy": 0.11498752385377883, "num_tokens": 8130737.0, "step": 3750 }, { "entropy": 6.687275981903076, "epoch": 0.4018406549307079, "grad_norm": 1.3203125, "learning_rate": 0.0004990152109628869, "loss": 6.6614, "mean_token_accuracy": 0.11621819585561752, "num_tokens": 8142315.0, "step": 3755 }, { "entropy": 6.747700786590576, "epoch": 0.40237572903847185, "grad_norm": 1.2734375, "learning_rate": 0.0004990116344896657, "loss": 6.7604, "mean_token_accuracy": 0.10932756140828133, "num_tokens": 8153618.0, "step": 3760 }, { "entropy": 6.786961269378662, "epoch": 0.40291080314623573, "grad_norm": 1.109375, "learning_rate": 0.00049900805154814, "loss": 6.6973, "mean_token_accuracy": 0.11853857338428497, "num_tokens": 8164304.0, "step": 3765 }, { "entropy": 6.784421157836914, "epoch": 0.40344587725399966, "grad_norm": 1.1328125, "learning_rate": 0.0004990044621384134, "loss": 6.694, "mean_token_accuracy": 0.11464422270655632, "num_tokens": 8175289.0, "step": 3770 }, { "entropy": 6.834812927246094, "epoch": 0.4039809513617636, "grad_norm": 1.125, "learning_rate": 0.0004990008662605893, "loss": 6.7375, "mean_token_accuracy": 0.11080463156104088, "num_tokens": 8186274.0, "step": 3775 }, { "entropy": 6.850270223617554, "epoch": 0.40451602546952753, "grad_norm": 1.1640625, "learning_rate": 0.0004989972639147717, "loss": 6.6819, "mean_token_accuracy": 0.11826486811041832, "num_tokens": 8196380.0, "step": 3780 }, { "entropy": 6.745476388931275, "epoch": 0.40505109957729146, "grad_norm": 1.15625, "learning_rate": 0.0004989936551010646, "loss": 6.7327, "mean_token_accuracy": 0.11468399837613105, "num_tokens": 8207204.0, "step": 3785 }, { "entropy": 6.715826034545898, "epoch": 0.4055861736850554, "grad_norm": 1.1796875, "learning_rate": 0.0004989900398195722, "loss": 6.6512, "mean_token_accuracy": 0.11534782201051712, "num_tokens": 8217745.0, "step": 3790 }, { "entropy": 6.774829626083374, "epoch": 0.40612124779281933, "grad_norm": 1.140625, "learning_rate": 0.0004989864180703988, "loss": 6.6424, "mean_token_accuracy": 0.11919590383768082, "num_tokens": 8228171.0, "step": 3795 }, { "entropy": 6.758113431930542, "epoch": 0.4066563219005832, "grad_norm": 1.2421875, "learning_rate": 0.0004989827898536491, "loss": 6.6973, "mean_token_accuracy": 0.11042807400226592, "num_tokens": 8239220.0, "step": 3800 }, { "entropy": 6.832132291793823, "epoch": 0.40719139600834714, "grad_norm": 1.1640625, "learning_rate": 0.0004989791551694279, "loss": 6.7518, "mean_token_accuracy": 0.109524205327034, "num_tokens": 8250363.0, "step": 3805 }, { "entropy": 6.776221656799317, "epoch": 0.4077264701161111, "grad_norm": 1.1171875, "learning_rate": 0.0004989755140178398, "loss": 6.7123, "mean_token_accuracy": 0.11326616704463958, "num_tokens": 8261207.0, "step": 3810 }, { "entropy": 6.741102790832519, "epoch": 0.408261544223875, "grad_norm": 1.109375, "learning_rate": 0.0004989718663989905, "loss": 6.6174, "mean_token_accuracy": 0.11389720663428307, "num_tokens": 8272343.0, "step": 3815 }, { "entropy": 6.711847400665283, "epoch": 0.40879661833163894, "grad_norm": 1.0625, "learning_rate": 0.0004989682123129849, "loss": 6.6662, "mean_token_accuracy": 0.11849249228835106, "num_tokens": 8282677.0, "step": 3820 }, { "entropy": 6.69567084312439, "epoch": 0.40933169243940287, "grad_norm": 1.03125, "learning_rate": 0.0004989645517599286, "loss": 6.6745, "mean_token_accuracy": 0.11427896246314048, "num_tokens": 8292753.0, "step": 3825 }, { "entropy": 6.774503755569458, "epoch": 0.4098667665471668, "grad_norm": 1.046875, "learning_rate": 0.0004989608847399275, "loss": 6.6625, "mean_token_accuracy": 0.11602176800370216, "num_tokens": 8302747.0, "step": 3830 }, { "entropy": 6.774828100204468, "epoch": 0.4104018406549307, "grad_norm": 1.0703125, "learning_rate": 0.0004989572112530871, "loss": 6.7446, "mean_token_accuracy": 0.10802446901798249, "num_tokens": 8314766.0, "step": 3835 }, { "entropy": 6.862928152084351, "epoch": 0.4109369147626946, "grad_norm": 1.0625, "learning_rate": 0.0004989535312995139, "loss": 6.7682, "mean_token_accuracy": 0.11004860624670983, "num_tokens": 8325791.0, "step": 3840 }, { "entropy": 6.746032285690307, "epoch": 0.41147198887045855, "grad_norm": 1.1328125, "learning_rate": 0.0004989498448793139, "loss": 6.6939, "mean_token_accuracy": 0.11601744443178177, "num_tokens": 8335809.0, "step": 3845 }, { "entropy": 6.742163610458374, "epoch": 0.4120070629782225, "grad_norm": 1.0546875, "learning_rate": 0.0004989461519925935, "loss": 6.6923, "mean_token_accuracy": 0.11100121140480042, "num_tokens": 8347505.0, "step": 3850 }, { "entropy": 6.8387268543243405, "epoch": 0.4125421370859864, "grad_norm": 1.0625, "learning_rate": 0.0004989424526394596, "loss": 6.7162, "mean_token_accuracy": 0.1083609253168106, "num_tokens": 8358363.0, "step": 3855 }, { "entropy": 6.726605081558228, "epoch": 0.41307721119375035, "grad_norm": 1.1015625, "learning_rate": 0.0004989387468200187, "loss": 6.7182, "mean_token_accuracy": 0.1165882483124733, "num_tokens": 8369076.0, "step": 3860 }, { "entropy": 6.849684762954712, "epoch": 0.4136122853015143, "grad_norm": 1.109375, "learning_rate": 0.000498935034534378, "loss": 6.7567, "mean_token_accuracy": 0.11488589569926262, "num_tokens": 8380071.0, "step": 3865 }, { "entropy": 6.779253625869751, "epoch": 0.41414735940927816, "grad_norm": 1.0703125, "learning_rate": 0.0004989313157826446, "loss": 6.7043, "mean_token_accuracy": 0.11365948691964149, "num_tokens": 8390574.0, "step": 3870 }, { "entropy": 6.762129831314087, "epoch": 0.4146824335170421, "grad_norm": 1.0859375, "learning_rate": 0.000498927590564926, "loss": 6.7016, "mean_token_accuracy": 0.11860018000006675, "num_tokens": 8401154.0, "step": 3875 }, { "entropy": 6.805259132385254, "epoch": 0.415217507624806, "grad_norm": 1.0546875, "learning_rate": 0.0004989238588813296, "loss": 6.7816, "mean_token_accuracy": 0.10864789858460426, "num_tokens": 8412113.0, "step": 3880 }, { "entropy": 6.893309640884399, "epoch": 0.41575258173256996, "grad_norm": 1.203125, "learning_rate": 0.0004989201207319634, "loss": 6.7582, "mean_token_accuracy": 0.11186528205871582, "num_tokens": 8422734.0, "step": 3885 }, { "entropy": 6.758945322036743, "epoch": 0.4162876558403339, "grad_norm": 1.125, "learning_rate": 0.0004989163761169351, "loss": 6.6912, "mean_token_accuracy": 0.11084168404340744, "num_tokens": 8433647.0, "step": 3890 }, { "entropy": 6.744187116622925, "epoch": 0.4168227299480978, "grad_norm": 1.203125, "learning_rate": 0.0004989126250363529, "loss": 6.7234, "mean_token_accuracy": 0.11423909962177277, "num_tokens": 8444726.0, "step": 3895 }, { "entropy": 6.83604621887207, "epoch": 0.41735780405586176, "grad_norm": 1.09375, "learning_rate": 0.0004989088674903251, "loss": 6.7264, "mean_token_accuracy": 0.11136697009205818, "num_tokens": 8455351.0, "step": 3900 }, { "entropy": 6.788657855987549, "epoch": 0.41789287816362564, "grad_norm": 1.0703125, "learning_rate": 0.0004989051034789602, "loss": 6.7073, "mean_token_accuracy": 0.11919761151075363, "num_tokens": 8466423.0, "step": 3905 }, { "entropy": 6.769079303741455, "epoch": 0.41842795227138957, "grad_norm": 1.28125, "learning_rate": 0.000498901333002367, "loss": 6.6522, "mean_token_accuracy": 0.11701465100049972, "num_tokens": 8475841.0, "step": 3910 }, { "entropy": 6.814233303070068, "epoch": 0.4189630263791535, "grad_norm": 1.03125, "learning_rate": 0.0004988975560606541, "loss": 6.762, "mean_token_accuracy": 0.11229455918073654, "num_tokens": 8487656.0, "step": 3915 }, { "entropy": 6.776022148132324, "epoch": 0.41949810048691744, "grad_norm": 1.1640625, "learning_rate": 0.0004988937726539308, "loss": 6.7744, "mean_token_accuracy": 0.10670395717024803, "num_tokens": 8497959.0, "step": 3920 }, { "entropy": 6.763610315322876, "epoch": 0.42003317459468137, "grad_norm": 1.078125, "learning_rate": 0.0004988899827823062, "loss": 6.6751, "mean_token_accuracy": 0.11493971273303032, "num_tokens": 8508228.0, "step": 3925 }, { "entropy": 6.782846927642822, "epoch": 0.4205682487024453, "grad_norm": 1.171875, "learning_rate": 0.00049888618644589, "loss": 6.7229, "mean_token_accuracy": 0.11063806042075157, "num_tokens": 8518999.0, "step": 3930 }, { "entropy": 6.691450452804565, "epoch": 0.42110332281020924, "grad_norm": 1.2265625, "learning_rate": 0.0004988823836447916, "loss": 6.7519, "mean_token_accuracy": 0.11179999187588692, "num_tokens": 8529583.0, "step": 3935 }, { "entropy": 6.894530963897705, "epoch": 0.4216383969179731, "grad_norm": 1.4609375, "learning_rate": 0.0004988785743791207, "loss": 6.8223, "mean_token_accuracy": 0.10763506144285202, "num_tokens": 8540069.0, "step": 3940 }, { "entropy": 6.875021266937256, "epoch": 0.42217347102573705, "grad_norm": 1.1953125, "learning_rate": 0.0004988747586489876, "loss": 6.7009, "mean_token_accuracy": 0.11498932242393493, "num_tokens": 8550441.0, "step": 3945 }, { "entropy": 6.709805822372436, "epoch": 0.422708545133501, "grad_norm": 1.0546875, "learning_rate": 0.000498870936454502, "loss": 6.6653, "mean_token_accuracy": 0.11834602132439613, "num_tokens": 8560257.0, "step": 3950 }, { "entropy": 6.828940343856812, "epoch": 0.4232436192412649, "grad_norm": 1.078125, "learning_rate": 0.0004988671077957749, "loss": 6.7485, "mean_token_accuracy": 0.1175241857767105, "num_tokens": 8570991.0, "step": 3955 }, { "entropy": 6.891437435150147, "epoch": 0.42377869334902885, "grad_norm": 1.609375, "learning_rate": 0.0004988632726729164, "loss": 6.8051, "mean_token_accuracy": 0.10697821751236916, "num_tokens": 8583668.0, "step": 3960 }, { "entropy": 6.802229166030884, "epoch": 0.4243137674567928, "grad_norm": 1.109375, "learning_rate": 0.0004988594310860374, "loss": 6.7184, "mean_token_accuracy": 0.1156295083463192, "num_tokens": 8593727.0, "step": 3965 }, { "entropy": 6.714612770080566, "epoch": 0.4248488415645567, "grad_norm": 1.0625, "learning_rate": 0.0004988555830352485, "loss": 6.7209, "mean_token_accuracy": 0.11398242264986039, "num_tokens": 8605470.0, "step": 3970 }, { "entropy": 6.7963508605957035, "epoch": 0.4253839156723206, "grad_norm": 1.0234375, "learning_rate": 0.0004988517285206614, "loss": 6.6687, "mean_token_accuracy": 0.11099848076701165, "num_tokens": 8617176.0, "step": 3975 }, { "entropy": 6.803634119033814, "epoch": 0.4259189897800845, "grad_norm": 1.0703125, "learning_rate": 0.0004988478675423871, "loss": 6.7558, "mean_token_accuracy": 0.11225240230560303, "num_tokens": 8627756.0, "step": 3980 }, { "entropy": 6.793984985351562, "epoch": 0.42645406388784846, "grad_norm": 1.234375, "learning_rate": 0.0004988440001005369, "loss": 6.6853, "mean_token_accuracy": 0.11842627823352814, "num_tokens": 8637766.0, "step": 3985 }, { "entropy": 6.800572538375855, "epoch": 0.4269891379956124, "grad_norm": 1.1640625, "learning_rate": 0.0004988401261952227, "loss": 6.7096, "mean_token_accuracy": 0.11486690863966942, "num_tokens": 8648562.0, "step": 3990 }, { "entropy": 6.808977746963501, "epoch": 0.4275242121033763, "grad_norm": 1.1875, "learning_rate": 0.0004988362458265565, "loss": 6.7412, "mean_token_accuracy": 0.10799469202756881, "num_tokens": 8658393.0, "step": 3995 }, { "entropy": 6.730482482910157, "epoch": 0.42805928621114026, "grad_norm": 1.125, "learning_rate": 0.0004988323589946499, "loss": 6.6543, "mean_token_accuracy": 0.1162540040910244, "num_tokens": 8668365.0, "step": 4000 }, { "entropy": 6.777298212051392, "epoch": 0.4285943603189042, "grad_norm": 1.1953125, "learning_rate": 0.0004988284656996156, "loss": 6.7009, "mean_token_accuracy": 0.1099359154701233, "num_tokens": 8679228.0, "step": 4005 }, { "entropy": 6.780287981033325, "epoch": 0.42912943442666807, "grad_norm": 1.234375, "learning_rate": 0.0004988245659415656, "loss": 6.5866, "mean_token_accuracy": 0.12446512654423714, "num_tokens": 8688940.0, "step": 4010 }, { "entropy": 6.810698747634888, "epoch": 0.429664508534432, "grad_norm": 1.1796875, "learning_rate": 0.0004988206597206129, "loss": 6.7438, "mean_token_accuracy": 0.10872282534837723, "num_tokens": 8699923.0, "step": 4015 }, { "entropy": 6.720220708847046, "epoch": 0.43019958264219593, "grad_norm": 1.0546875, "learning_rate": 0.00049881674703687, "loss": 6.58, "mean_token_accuracy": 0.12176239043474198, "num_tokens": 8710445.0, "step": 4020 }, { "entropy": 6.721858978271484, "epoch": 0.43073465674995987, "grad_norm": 1.3046875, "learning_rate": 0.0004988128278904499, "loss": 6.7083, "mean_token_accuracy": 0.11447286382317542, "num_tokens": 8720686.0, "step": 4025 }, { "entropy": 6.834508752822876, "epoch": 0.4312697308577238, "grad_norm": 1.140625, "learning_rate": 0.000498808902281466, "loss": 6.7282, "mean_token_accuracy": 0.11510429829359055, "num_tokens": 8732122.0, "step": 4030 }, { "entropy": 6.744071006774902, "epoch": 0.43180480496548773, "grad_norm": 1.125, "learning_rate": 0.0004988049702100315, "loss": 6.6825, "mean_token_accuracy": 0.1182553879916668, "num_tokens": 8744122.0, "step": 4035 }, { "entropy": 6.787398195266723, "epoch": 0.43233987907325166, "grad_norm": 0.984375, "learning_rate": 0.0004988010316762598, "loss": 6.6911, "mean_token_accuracy": 0.115293999761343, "num_tokens": 8754758.0, "step": 4040 }, { "entropy": 6.7287671089172365, "epoch": 0.4328749531810156, "grad_norm": 1.1953125, "learning_rate": 0.0004987970866802649, "loss": 6.7121, "mean_token_accuracy": 0.10785665214061738, "num_tokens": 8766577.0, "step": 4045 }, { "entropy": 6.773381233215332, "epoch": 0.4334100272887795, "grad_norm": 1.1171875, "learning_rate": 0.0004987931352221605, "loss": 6.7083, "mean_token_accuracy": 0.11141579747200012, "num_tokens": 8777698.0, "step": 4050 }, { "entropy": 6.788628673553466, "epoch": 0.4339451013965434, "grad_norm": 1.0546875, "learning_rate": 0.0004987891773020606, "loss": 6.7231, "mean_token_accuracy": 0.11151274070143699, "num_tokens": 8788637.0, "step": 4055 }, { "entropy": 6.799765920639038, "epoch": 0.43448017550430734, "grad_norm": 1.265625, "learning_rate": 0.0004987852129200799, "loss": 6.7009, "mean_token_accuracy": 0.11956919953227044, "num_tokens": 8799709.0, "step": 4060 }, { "entropy": 6.795716381072998, "epoch": 0.4350152496120713, "grad_norm": 1.171875, "learning_rate": 0.0004987812420763326, "loss": 6.6905, "mean_token_accuracy": 0.11553208827972412, "num_tokens": 8810469.0, "step": 4065 }, { "entropy": 6.7736915111541744, "epoch": 0.4355503237198352, "grad_norm": 1.171875, "learning_rate": 0.0004987772647709333, "loss": 6.6708, "mean_token_accuracy": 0.1123408019542694, "num_tokens": 8821142.0, "step": 4070 }, { "entropy": 6.70412278175354, "epoch": 0.43608539782759914, "grad_norm": 1.1796875, "learning_rate": 0.000498773281003997, "loss": 6.6226, "mean_token_accuracy": 0.12270026281476021, "num_tokens": 8832951.0, "step": 4075 }, { "entropy": 6.725498294830322, "epoch": 0.4366204719353631, "grad_norm": 1.3203125, "learning_rate": 0.0004987692907756385, "loss": 6.7344, "mean_token_accuracy": 0.10939609631896019, "num_tokens": 8843579.0, "step": 4080 }, { "entropy": 6.6969774723052975, "epoch": 0.43715554604312695, "grad_norm": 1.125, "learning_rate": 0.0004987652940859733, "loss": 6.6606, "mean_token_accuracy": 0.10758041813969613, "num_tokens": 8854612.0, "step": 4085 }, { "entropy": 6.766866064071655, "epoch": 0.4376906201508909, "grad_norm": 1.0390625, "learning_rate": 0.0004987612909351167, "loss": 6.6101, "mean_token_accuracy": 0.12067801505327225, "num_tokens": 8865584.0, "step": 4090 }, { "entropy": 6.688352346420288, "epoch": 0.4382256942586548, "grad_norm": 1.109375, "learning_rate": 0.0004987572813231842, "loss": 6.66, "mean_token_accuracy": 0.12287814989686012, "num_tokens": 8876662.0, "step": 4095 }, { "entropy": 6.756010103225708, "epoch": 0.43876076836641875, "grad_norm": 1.09375, "learning_rate": 0.0004987532652502917, "loss": 6.6831, "mean_token_accuracy": 0.11270663142204285, "num_tokens": 8887249.0, "step": 4100 }, { "entropy": 6.713475131988526, "epoch": 0.4392958424741827, "grad_norm": 1.2109375, "learning_rate": 0.0004987492427165551, "loss": 6.531, "mean_token_accuracy": 0.1301178902387619, "num_tokens": 8898635.0, "step": 4105 }, { "entropy": 6.678007888793945, "epoch": 0.4398309165819466, "grad_norm": 1.09375, "learning_rate": 0.0004987452137220906, "loss": 6.6895, "mean_token_accuracy": 0.11399767398834229, "num_tokens": 8908794.0, "step": 4110 }, { "entropy": 6.847482490539551, "epoch": 0.44036599068971055, "grad_norm": 1.171875, "learning_rate": 0.0004987411782670144, "loss": 6.7013, "mean_token_accuracy": 0.10850507244467736, "num_tokens": 8919015.0, "step": 4115 }, { "entropy": 6.8152250289917, "epoch": 0.44090106479747443, "grad_norm": 1.140625, "learning_rate": 0.0004987371363514431, "loss": 6.7349, "mean_token_accuracy": 0.10842297747731208, "num_tokens": 8929028.0, "step": 4120 }, { "entropy": 6.664592504501343, "epoch": 0.44143613890523836, "grad_norm": 1.125, "learning_rate": 0.0004987330879754933, "loss": 6.6382, "mean_token_accuracy": 0.11036456525325775, "num_tokens": 8939789.0, "step": 4125 }, { "entropy": 6.707959175109863, "epoch": 0.4419712130130023, "grad_norm": 1.015625, "learning_rate": 0.0004987290331392823, "loss": 6.6225, "mean_token_accuracy": 0.11801224276423454, "num_tokens": 8950657.0, "step": 4130 }, { "entropy": 6.828504610061645, "epoch": 0.44250628712076623, "grad_norm": 1.0546875, "learning_rate": 0.0004987249718429269, "loss": 6.7236, "mean_token_accuracy": 0.11803532913327217, "num_tokens": 8960744.0, "step": 4135 }, { "entropy": 6.705205869674683, "epoch": 0.44304136122853016, "grad_norm": 1.09375, "learning_rate": 0.0004987209040865441, "loss": 6.5768, "mean_token_accuracy": 0.12112260162830353, "num_tokens": 8972411.0, "step": 4140 }, { "entropy": 6.801696109771728, "epoch": 0.4435764353362941, "grad_norm": 1.2265625, "learning_rate": 0.0004987168298702519, "loss": 6.7465, "mean_token_accuracy": 0.11419489085674286, "num_tokens": 8982818.0, "step": 4145 }, { "entropy": 6.745963048934937, "epoch": 0.44411150944405803, "grad_norm": 1.234375, "learning_rate": 0.0004987127491941675, "loss": 6.6657, "mean_token_accuracy": 0.1177960142493248, "num_tokens": 8993227.0, "step": 4150 }, { "entropy": 6.669366073608399, "epoch": 0.4446465835518219, "grad_norm": 1.25, "learning_rate": 0.0004987086620584091, "loss": 6.6037, "mean_token_accuracy": 0.11799841225147248, "num_tokens": 9003796.0, "step": 4155 }, { "entropy": 6.772842884063721, "epoch": 0.44518165765958584, "grad_norm": 1.421875, "learning_rate": 0.0004987045684630944, "loss": 6.6369, "mean_token_accuracy": 0.12047947198152542, "num_tokens": 9014931.0, "step": 4160 }, { "entropy": 6.774410676956177, "epoch": 0.44571673176734977, "grad_norm": 1.15625, "learning_rate": 0.0004987004684083417, "loss": 6.6984, "mean_token_accuracy": 0.1164324201643467, "num_tokens": 9025312.0, "step": 4165 }, { "entropy": 6.7285847663879395, "epoch": 0.4462518058751137, "grad_norm": 1.1015625, "learning_rate": 0.0004986963618942694, "loss": 6.6642, "mean_token_accuracy": 0.12318786159157753, "num_tokens": 9035563.0, "step": 4170 }, { "entropy": 6.795755052566529, "epoch": 0.44678687998287764, "grad_norm": 1.2578125, "learning_rate": 0.0004986922489209961, "loss": 6.7039, "mean_token_accuracy": 0.1175026074051857, "num_tokens": 9046065.0, "step": 4175 }, { "entropy": 6.751359653472901, "epoch": 0.44732195409064157, "grad_norm": 1.0625, "learning_rate": 0.0004986881294886406, "loss": 6.6057, "mean_token_accuracy": 0.1231963075697422, "num_tokens": 9056696.0, "step": 4180 }, { "entropy": 6.676720142364502, "epoch": 0.4478570281984055, "grad_norm": 1.171875, "learning_rate": 0.0004986840035973218, "loss": 6.6808, "mean_token_accuracy": 0.11223538517951966, "num_tokens": 9067035.0, "step": 4185 }, { "entropy": 6.6606361865997314, "epoch": 0.4483921023061694, "grad_norm": 1.140625, "learning_rate": 0.0004986798712471588, "loss": 6.6574, "mean_token_accuracy": 0.11127996742725373, "num_tokens": 9078253.0, "step": 4190 }, { "entropy": 6.8346106052398685, "epoch": 0.4489271764139333, "grad_norm": 1.296875, "learning_rate": 0.0004986757324382709, "loss": 6.7174, "mean_token_accuracy": 0.10800155103206635, "num_tokens": 9088184.0, "step": 4195 }, { "entropy": 6.7804230690002445, "epoch": 0.44946225052169725, "grad_norm": 1.1953125, "learning_rate": 0.0004986715871707777, "loss": 6.7777, "mean_token_accuracy": 0.1087512344121933, "num_tokens": 9099321.0, "step": 4200 }, { "entropy": 6.843128871917725, "epoch": 0.4499973246294612, "grad_norm": 1.140625, "learning_rate": 0.0004986674354447988, "loss": 6.8009, "mean_token_accuracy": 0.11305928155779839, "num_tokens": 9111410.0, "step": 4205 }, { "entropy": 6.831840133666992, "epoch": 0.4505323987372251, "grad_norm": 1.1796875, "learning_rate": 0.0004986632772604543, "loss": 6.6256, "mean_token_accuracy": 0.11788237541913986, "num_tokens": 9121932.0, "step": 4210 }, { "entropy": 6.651640558242798, "epoch": 0.45106747284498905, "grad_norm": 1.6640625, "learning_rate": 0.0004986591126178639, "loss": 6.7181, "mean_token_accuracy": 0.1195308357477188, "num_tokens": 9132686.0, "step": 4215 }, { "entropy": 6.678121089935303, "epoch": 0.451602546952753, "grad_norm": 1.4375, "learning_rate": 0.0004986549415171482, "loss": 6.6445, "mean_token_accuracy": 0.11687054708600045, "num_tokens": 9143582.0, "step": 4220 }, { "entropy": 6.877950763702392, "epoch": 0.45213762106051686, "grad_norm": 1.09375, "learning_rate": 0.0004986507639584274, "loss": 6.7232, "mean_token_accuracy": 0.11007717251777649, "num_tokens": 9156173.0, "step": 4225 }, { "entropy": 6.7473616123199465, "epoch": 0.4526726951682808, "grad_norm": 1.2265625, "learning_rate": 0.0004986465799418223, "loss": 6.7062, "mean_token_accuracy": 0.11616904065012931, "num_tokens": 9166882.0, "step": 4230 }, { "entropy": 6.726114082336426, "epoch": 0.4532077692760447, "grad_norm": 1.28125, "learning_rate": 0.0004986423894674534, "loss": 6.7034, "mean_token_accuracy": 0.11051197499036788, "num_tokens": 9177525.0, "step": 4235 }, { "entropy": 6.824288320541382, "epoch": 0.45374284338380866, "grad_norm": 1.21875, "learning_rate": 0.0004986381925354422, "loss": 6.6713, "mean_token_accuracy": 0.11391364932060241, "num_tokens": 9188586.0, "step": 4240 }, { "entropy": 6.741261911392212, "epoch": 0.4542779174915726, "grad_norm": 1.328125, "learning_rate": 0.0004986339891459094, "loss": 6.5797, "mean_token_accuracy": 0.11786932200193405, "num_tokens": 9199920.0, "step": 4245 }, { "entropy": 6.590327644348145, "epoch": 0.4548129915993365, "grad_norm": 1.21875, "learning_rate": 0.0004986297792989768, "loss": 6.583, "mean_token_accuracy": 0.12098821178078652, "num_tokens": 9210923.0, "step": 4250 }, { "entropy": 6.832316637039185, "epoch": 0.45534806570710046, "grad_norm": 1.2421875, "learning_rate": 0.0004986255629947655, "loss": 6.7539, "mean_token_accuracy": 0.10964171513915062, "num_tokens": 9221459.0, "step": 4255 }, { "entropy": 6.773038291931153, "epoch": 0.45588313981486434, "grad_norm": 1.1953125, "learning_rate": 0.0004986213402333978, "loss": 6.6935, "mean_token_accuracy": 0.11024248600006104, "num_tokens": 9231768.0, "step": 4260 }, { "entropy": 6.713382816314697, "epoch": 0.45641821392262827, "grad_norm": 1.09375, "learning_rate": 0.0004986171110149951, "loss": 6.6848, "mean_token_accuracy": 0.11179919168353081, "num_tokens": 9242230.0, "step": 4265 }, { "entropy": 6.807206058502198, "epoch": 0.4569532880303922, "grad_norm": 1.0859375, "learning_rate": 0.0004986128753396798, "loss": 6.5794, "mean_token_accuracy": 0.1219303086400032, "num_tokens": 9252485.0, "step": 4270 }, { "entropy": 6.657087945938111, "epoch": 0.45748836213815613, "grad_norm": 1.3125, "learning_rate": 0.0004986086332075742, "loss": 6.6527, "mean_token_accuracy": 0.12027468383312226, "num_tokens": 9263014.0, "step": 4275 }, { "entropy": 6.737786865234375, "epoch": 0.45802343624592007, "grad_norm": 1.3046875, "learning_rate": 0.0004986043846188006, "loss": 6.6932, "mean_token_accuracy": 0.12059752494096757, "num_tokens": 9273777.0, "step": 4280 }, { "entropy": 6.658463954925537, "epoch": 0.458558510353684, "grad_norm": 1.3203125, "learning_rate": 0.000498600129573482, "loss": 6.6266, "mean_token_accuracy": 0.11395588889718056, "num_tokens": 9284738.0, "step": 4285 }, { "entropy": 6.793663120269775, "epoch": 0.45909358446144793, "grad_norm": 1.125, "learning_rate": 0.000498595868071741, "loss": 6.6807, "mean_token_accuracy": 0.11528572961688041, "num_tokens": 9295921.0, "step": 4290 }, { "entropy": 6.744870233535766, "epoch": 0.4596286585692118, "grad_norm": 1.2421875, "learning_rate": 0.0004985916001137006, "loss": 6.6609, "mean_token_accuracy": 0.11062274277210235, "num_tokens": 9306568.0, "step": 4295 }, { "entropy": 6.757999467849731, "epoch": 0.46016373267697575, "grad_norm": 1.1875, "learning_rate": 0.0004985873256994843, "loss": 6.6262, "mean_token_accuracy": 0.11653959006071091, "num_tokens": 9316468.0, "step": 4300 }, { "entropy": 6.737951755523682, "epoch": 0.4606988067847397, "grad_norm": 1.21875, "learning_rate": 0.0004985830448292154, "loss": 6.7008, "mean_token_accuracy": 0.1143273763358593, "num_tokens": 9328185.0, "step": 4305 }, { "entropy": 6.743026876449585, "epoch": 0.4612338808925036, "grad_norm": 1.234375, "learning_rate": 0.0004985787575030175, "loss": 6.6547, "mean_token_accuracy": 0.11528828516602516, "num_tokens": 9338591.0, "step": 4310 }, { "entropy": 6.768393468856812, "epoch": 0.46176895500026754, "grad_norm": 1.078125, "learning_rate": 0.0004985744637210144, "loss": 6.6761, "mean_token_accuracy": 0.11174369007349014, "num_tokens": 9349286.0, "step": 4315 }, { "entropy": 6.783293533325195, "epoch": 0.4623040291080315, "grad_norm": 1.375, "learning_rate": 0.00049857016348333, "loss": 6.658, "mean_token_accuracy": 0.11993650272488594, "num_tokens": 9359752.0, "step": 4320 }, { "entropy": 6.78243350982666, "epoch": 0.4628391032157954, "grad_norm": 1.1953125, "learning_rate": 0.0004985658567900886, "loss": 6.7129, "mean_token_accuracy": 0.1122040569782257, "num_tokens": 9371823.0, "step": 4325 }, { "entropy": 6.643386602401733, "epoch": 0.4633741773235593, "grad_norm": 1.0703125, "learning_rate": 0.0004985615436414145, "loss": 6.5839, "mean_token_accuracy": 0.11392313092947007, "num_tokens": 9383127.0, "step": 4330 }, { "entropy": 6.734666919708252, "epoch": 0.4639092514313232, "grad_norm": 1.1875, "learning_rate": 0.0004985572240374321, "loss": 6.6771, "mean_token_accuracy": 0.11793937757611275, "num_tokens": 9394296.0, "step": 4335 }, { "entropy": 6.754271030426025, "epoch": 0.46444432553908715, "grad_norm": 1.1640625, "learning_rate": 0.0004985528979782665, "loss": 6.6688, "mean_token_accuracy": 0.11072949096560478, "num_tokens": 9405988.0, "step": 4340 }, { "entropy": 6.822707033157348, "epoch": 0.4649793996468511, "grad_norm": 1.1015625, "learning_rate": 0.0004985485654640423, "loss": 6.6693, "mean_token_accuracy": 0.1139429748058319, "num_tokens": 9417479.0, "step": 4345 }, { "entropy": 6.696816492080688, "epoch": 0.465514473754615, "grad_norm": 1.375, "learning_rate": 0.0004985442264948847, "loss": 6.6197, "mean_token_accuracy": 0.11986967846751213, "num_tokens": 9428050.0, "step": 4350 }, { "entropy": 6.653148794174195, "epoch": 0.46604954786237895, "grad_norm": 1.1484375, "learning_rate": 0.0004985398810709189, "loss": 6.5722, "mean_token_accuracy": 0.12251258864998818, "num_tokens": 9438229.0, "step": 4355 }, { "entropy": 6.654054975509643, "epoch": 0.4665846219701429, "grad_norm": 1.171875, "learning_rate": 0.0004985355291922704, "loss": 6.6493, "mean_token_accuracy": 0.11258513107895851, "num_tokens": 9449611.0, "step": 4360 }, { "entropy": 6.709498739242553, "epoch": 0.46711969607790677, "grad_norm": 1.515625, "learning_rate": 0.000498531170859065, "loss": 6.614, "mean_token_accuracy": 0.11630048006772994, "num_tokens": 9460234.0, "step": 4365 }, { "entropy": 6.828418874740601, "epoch": 0.4676547701856707, "grad_norm": 1.625, "learning_rate": 0.0004985268060714285, "loss": 6.7023, "mean_token_accuracy": 0.1152671605348587, "num_tokens": 9472136.0, "step": 4370 }, { "entropy": 6.6818465232849125, "epoch": 0.46818984429343463, "grad_norm": 1.3515625, "learning_rate": 0.0004985224348294868, "loss": 6.6403, "mean_token_accuracy": 0.12047104090452194, "num_tokens": 9482602.0, "step": 4375 }, { "entropy": 6.785189914703369, "epoch": 0.46872491840119856, "grad_norm": 1.28125, "learning_rate": 0.0004985180571333663, "loss": 6.6442, "mean_token_accuracy": 0.11965756639838218, "num_tokens": 9493782.0, "step": 4380 }, { "entropy": 6.763046312332153, "epoch": 0.4692599925089625, "grad_norm": 1.5078125, "learning_rate": 0.0004985136729831932, "loss": 6.6249, "mean_token_accuracy": 0.11808878481388092, "num_tokens": 9504389.0, "step": 4385 }, { "entropy": 6.648394393920898, "epoch": 0.46979506661672643, "grad_norm": 1.5390625, "learning_rate": 0.0004985092823790942, "loss": 6.7447, "mean_token_accuracy": 0.1183752790093422, "num_tokens": 9515166.0, "step": 4390 }, { "entropy": 6.747145318984986, "epoch": 0.47033014072449036, "grad_norm": 1.140625, "learning_rate": 0.0004985048853211961, "loss": 6.6434, "mean_token_accuracy": 0.116434495896101, "num_tokens": 9525566.0, "step": 4395 }, { "entropy": 6.7929564952850345, "epoch": 0.47086521483225424, "grad_norm": 1.21875, "learning_rate": 0.000498500481809626, "loss": 6.5549, "mean_token_accuracy": 0.1208685427904129, "num_tokens": 9536021.0, "step": 4400 }, { "entropy": 6.649615907669068, "epoch": 0.4714002889400182, "grad_norm": 1.3984375, "learning_rate": 0.0004984960718445107, "loss": 6.6641, "mean_token_accuracy": 0.11327528953552246, "num_tokens": 9546827.0, "step": 4405 }, { "entropy": 6.756602811813354, "epoch": 0.4719353630477821, "grad_norm": 1.28125, "learning_rate": 0.0004984916554259778, "loss": 6.7758, "mean_token_accuracy": 0.10899243578314781, "num_tokens": 9558104.0, "step": 4410 }, { "entropy": 6.866197681427002, "epoch": 0.47247043715554604, "grad_norm": 1.1796875, "learning_rate": 0.0004984872325541547, "loss": 6.668, "mean_token_accuracy": 0.11704885140061379, "num_tokens": 9568487.0, "step": 4415 }, { "entropy": 6.716640186309815, "epoch": 0.47300551126331, "grad_norm": 1.3125, "learning_rate": 0.0004984828032291692, "loss": 6.6107, "mean_token_accuracy": 0.12084364518523216, "num_tokens": 9579509.0, "step": 4420 }, { "entropy": 6.742200565338135, "epoch": 0.4735405853710739, "grad_norm": 1.96875, "learning_rate": 0.0004984783674511492, "loss": 6.64, "mean_token_accuracy": 0.1198382891714573, "num_tokens": 9589931.0, "step": 4425 }, { "entropy": 6.761376428604126, "epoch": 0.47407565947883784, "grad_norm": 1.328125, "learning_rate": 0.0004984739252202227, "loss": 6.6733, "mean_token_accuracy": 0.11940053328871728, "num_tokens": 9599764.0, "step": 4430 }, { "entropy": 6.7573480129241945, "epoch": 0.4746107335866017, "grad_norm": 1.2578125, "learning_rate": 0.000498469476536518, "loss": 6.6472, "mean_token_accuracy": 0.1184098556637764, "num_tokens": 9611145.0, "step": 4435 }, { "entropy": 6.6948751449584964, "epoch": 0.47514580769436565, "grad_norm": 1.4453125, "learning_rate": 0.0004984650214001636, "loss": 6.6436, "mean_token_accuracy": 0.12355822175741196, "num_tokens": 9621441.0, "step": 4440 }, { "entropy": 6.741222667694092, "epoch": 0.4756808818021296, "grad_norm": 1.59375, "learning_rate": 0.0004984605598112881, "loss": 6.6857, "mean_token_accuracy": 0.12146021127700805, "num_tokens": 9631874.0, "step": 4445 }, { "entropy": 6.717041254043579, "epoch": 0.4762159559098935, "grad_norm": 1.1484375, "learning_rate": 0.0004984560917700204, "loss": 6.6614, "mean_token_accuracy": 0.11106858849525451, "num_tokens": 9643006.0, "step": 4450 }, { "entropy": 6.698492193222046, "epoch": 0.47675103001765745, "grad_norm": 1.328125, "learning_rate": 0.0004984516172764894, "loss": 6.5533, "mean_token_accuracy": 0.12116582468152046, "num_tokens": 9653897.0, "step": 4455 }, { "entropy": 6.691738748550415, "epoch": 0.4772861041254214, "grad_norm": 1.2734375, "learning_rate": 0.0004984471363308243, "loss": 6.6263, "mean_token_accuracy": 0.1176533468067646, "num_tokens": 9664460.0, "step": 4460 }, { "entropy": 6.711106204986573, "epoch": 0.4778211782331853, "grad_norm": 1.1015625, "learning_rate": 0.0004984426489331546, "loss": 6.6385, "mean_token_accuracy": 0.12148366495966911, "num_tokens": 9674534.0, "step": 4465 }, { "entropy": 6.8625555515289305, "epoch": 0.4783562523409492, "grad_norm": 1.2109375, "learning_rate": 0.0004984381550836097, "loss": 6.732, "mean_token_accuracy": 0.11358912587165833, "num_tokens": 9684828.0, "step": 4470 }, { "entropy": 6.851891565322876, "epoch": 0.47889132644871313, "grad_norm": 1.6015625, "learning_rate": 0.0004984336547823196, "loss": 6.6838, "mean_token_accuracy": 0.11679960638284684, "num_tokens": 9694536.0, "step": 4475 }, { "entropy": 6.712016582489014, "epoch": 0.47942640055647706, "grad_norm": 1.0703125, "learning_rate": 0.000498429148029414, "loss": 6.5548, "mean_token_accuracy": 0.12640432715415956, "num_tokens": 9705715.0, "step": 4480 }, { "entropy": 6.654127883911133, "epoch": 0.479961474664241, "grad_norm": 1.125, "learning_rate": 0.0004984246348250233, "loss": 6.6293, "mean_token_accuracy": 0.12291777729988099, "num_tokens": 9717505.0, "step": 4485 }, { "entropy": 6.698559045791626, "epoch": 0.4804965487720049, "grad_norm": 1.15625, "learning_rate": 0.0004984201151692775, "loss": 6.5005, "mean_token_accuracy": 0.11582913845777512, "num_tokens": 9727910.0, "step": 4490 }, { "entropy": 6.681623268127441, "epoch": 0.48103162287976886, "grad_norm": 1.2578125, "learning_rate": 0.0004984155890623074, "loss": 6.6164, "mean_token_accuracy": 0.12003767117857933, "num_tokens": 9738528.0, "step": 4495 }, { "entropy": 6.688356590270996, "epoch": 0.4815666969875328, "grad_norm": 1.1484375, "learning_rate": 0.0004984110565042435, "loss": 6.6433, "mean_token_accuracy": 0.11511807218194008, "num_tokens": 9749744.0, "step": 4500 }, { "entropy": 6.787782335281372, "epoch": 0.48210177109529667, "grad_norm": 1.1796875, "learning_rate": 0.0004984065174952168, "loss": 6.6415, "mean_token_accuracy": 0.11788514703512191, "num_tokens": 9759968.0, "step": 4505 }, { "entropy": 6.7138995170593265, "epoch": 0.4826368452030606, "grad_norm": 1.3046875, "learning_rate": 0.0004984019720353582, "loss": 6.6483, "mean_token_accuracy": 0.11984834149479866, "num_tokens": 9769791.0, "step": 4510 }, { "entropy": 6.669849443435669, "epoch": 0.48317191931082454, "grad_norm": 1.1953125, "learning_rate": 0.0004983974201247991, "loss": 6.6168, "mean_token_accuracy": 0.12382967993617058, "num_tokens": 9780369.0, "step": 4515 }, { "entropy": 6.718169641494751, "epoch": 0.48370699341858847, "grad_norm": 1.0703125, "learning_rate": 0.0004983928617636709, "loss": 6.6649, "mean_token_accuracy": 0.11595848128199578, "num_tokens": 9791125.0, "step": 4520 }, { "entropy": 6.822065162658691, "epoch": 0.4842420675263524, "grad_norm": 1.296875, "learning_rate": 0.0004983882969521052, "loss": 6.6623, "mean_token_accuracy": 0.11691764071583748, "num_tokens": 9801697.0, "step": 4525 }, { "entropy": 6.784085750579834, "epoch": 0.48477714163411634, "grad_norm": 1.046875, "learning_rate": 0.0004983837256902338, "loss": 6.7085, "mean_token_accuracy": 0.1206382617354393, "num_tokens": 9812171.0, "step": 4530 }, { "entropy": 6.700609016418457, "epoch": 0.48531221574188027, "grad_norm": 1.1171875, "learning_rate": 0.0004983791479781887, "loss": 6.5452, "mean_token_accuracy": 0.12644470036029815, "num_tokens": 9821596.0, "step": 4535 }, { "entropy": 6.76994104385376, "epoch": 0.48584728984964415, "grad_norm": 1.296875, "learning_rate": 0.0004983745638161021, "loss": 6.6662, "mean_token_accuracy": 0.10886719152331352, "num_tokens": 9831634.0, "step": 4540 }, { "entropy": 6.702042055130005, "epoch": 0.4863823639574081, "grad_norm": 1.4296875, "learning_rate": 0.0004983699732041064, "loss": 6.6297, "mean_token_accuracy": 0.12174258530139923, "num_tokens": 9841662.0, "step": 4545 }, { "entropy": 6.773559427261352, "epoch": 0.486917438065172, "grad_norm": 1.109375, "learning_rate": 0.000498365376142334, "loss": 6.618, "mean_token_accuracy": 0.11437310129404069, "num_tokens": 9853797.0, "step": 4550 }, { "entropy": 6.712430953979492, "epoch": 0.48745251217293595, "grad_norm": 1.1484375, "learning_rate": 0.0004983607726309179, "loss": 6.6691, "mean_token_accuracy": 0.1182169571518898, "num_tokens": 9865245.0, "step": 4555 }, { "entropy": 6.814268589019775, "epoch": 0.4879875862806999, "grad_norm": 1.234375, "learning_rate": 0.0004983561626699908, "loss": 6.7454, "mean_token_accuracy": 0.10475116744637489, "num_tokens": 9876207.0, "step": 4560 }, { "entropy": 6.760530710220337, "epoch": 0.4885226603884638, "grad_norm": 1.234375, "learning_rate": 0.0004983515462596859, "loss": 6.5712, "mean_token_accuracy": 0.12076753973960877, "num_tokens": 9887210.0, "step": 4565 }, { "entropy": 6.743468475341797, "epoch": 0.48905773449622775, "grad_norm": 1.2578125, "learning_rate": 0.0004983469234001365, "loss": 6.746, "mean_token_accuracy": 0.11424284428358078, "num_tokens": 9899607.0, "step": 4570 }, { "entropy": 6.662120580673218, "epoch": 0.4895928086039917, "grad_norm": 1.3515625, "learning_rate": 0.000498342294091476, "loss": 6.5284, "mean_token_accuracy": 0.1255207620561123, "num_tokens": 9909910.0, "step": 4575 }, { "entropy": 6.648574686050415, "epoch": 0.49012788271175556, "grad_norm": 1.25, "learning_rate": 0.0004983376583338382, "loss": 6.6563, "mean_token_accuracy": 0.11490331664681434, "num_tokens": 9922137.0, "step": 4580 }, { "entropy": 6.735975837707519, "epoch": 0.4906629568195195, "grad_norm": 1.1953125, "learning_rate": 0.0004983330161273569, "loss": 6.6451, "mean_token_accuracy": 0.11815119236707687, "num_tokens": 9932514.0, "step": 4585 }, { "entropy": 6.717578268051147, "epoch": 0.4911980309272834, "grad_norm": 1.5390625, "learning_rate": 0.0004983283674721662, "loss": 6.6847, "mean_token_accuracy": 0.11441330313682556, "num_tokens": 9943054.0, "step": 4590 }, { "entropy": 6.8306371688842775, "epoch": 0.49173310503504736, "grad_norm": 1.1796875, "learning_rate": 0.0004983237123684002, "loss": 6.6517, "mean_token_accuracy": 0.11424371600151062, "num_tokens": 9953791.0, "step": 4595 }, { "entropy": 6.725871992111206, "epoch": 0.4922681791428113, "grad_norm": 1.234375, "learning_rate": 0.0004983190508161934, "loss": 6.6071, "mean_token_accuracy": 0.1176756463944912, "num_tokens": 9964782.0, "step": 4600 }, { "entropy": 6.776705169677735, "epoch": 0.4928032532505752, "grad_norm": 1.6953125, "learning_rate": 0.0004983143828156804, "loss": 6.6759, "mean_token_accuracy": 0.1201729841530323, "num_tokens": 9975843.0, "step": 4605 }, { "entropy": 6.766890525817871, "epoch": 0.49333832735833916, "grad_norm": 1.5859375, "learning_rate": 0.0004983097083669959, "loss": 6.6515, "mean_token_accuracy": 0.12076375931501389, "num_tokens": 9987060.0, "step": 4610 }, { "entropy": 6.729199981689453, "epoch": 0.49387340146610303, "grad_norm": 1.296875, "learning_rate": 0.0004983050274702751, "loss": 6.6204, "mean_token_accuracy": 0.11678859367966651, "num_tokens": 9997380.0, "step": 4615 }, { "entropy": 6.704911518096924, "epoch": 0.49440847557386697, "grad_norm": 1.1171875, "learning_rate": 0.0004983003401256529, "loss": 6.6666, "mean_token_accuracy": 0.11961752027273179, "num_tokens": 10007955.0, "step": 4620 }, { "entropy": 6.858521175384522, "epoch": 0.4949435496816309, "grad_norm": 1.390625, "learning_rate": 0.0004982956463332647, "loss": 6.7414, "mean_token_accuracy": 0.11539428681135178, "num_tokens": 10017645.0, "step": 4625 }, { "entropy": 6.7818702220916744, "epoch": 0.49547862378939483, "grad_norm": 2.328125, "learning_rate": 0.0004982909460932463, "loss": 6.6603, "mean_token_accuracy": 0.11978099420666695, "num_tokens": 10027619.0, "step": 4630 }, { "entropy": 6.654353475570678, "epoch": 0.49601369789715877, "grad_norm": 1.15625, "learning_rate": 0.000498286239405733, "loss": 6.5454, "mean_token_accuracy": 0.12450932785868644, "num_tokens": 10037551.0, "step": 4635 }, { "entropy": 6.672497034072876, "epoch": 0.4965487720049227, "grad_norm": 1.1171875, "learning_rate": 0.000498281526270861, "loss": 6.5851, "mean_token_accuracy": 0.13364579305052757, "num_tokens": 10047771.0, "step": 4640 }, { "entropy": 6.803449487686157, "epoch": 0.49708384611268663, "grad_norm": 1.203125, "learning_rate": 0.0004982768066887663, "loss": 6.7076, "mean_token_accuracy": 0.112837415933609, "num_tokens": 10058771.0, "step": 4645 }, { "entropy": 6.723805093765259, "epoch": 0.4976189202204505, "grad_norm": 1.2109375, "learning_rate": 0.0004982720806595851, "loss": 6.5841, "mean_token_accuracy": 0.12232825830578804, "num_tokens": 10070318.0, "step": 4650 }, { "entropy": 6.68502402305603, "epoch": 0.49815399432821444, "grad_norm": 1.1171875, "learning_rate": 0.0004982673481834541, "loss": 6.614, "mean_token_accuracy": 0.11796658039093018, "num_tokens": 10081810.0, "step": 4655 }, { "entropy": 6.6698534965515135, "epoch": 0.4986890684359784, "grad_norm": 1.1953125, "learning_rate": 0.0004982626092605097, "loss": 6.6297, "mean_token_accuracy": 0.11533761844038963, "num_tokens": 10091724.0, "step": 4660 }, { "entropy": 6.763433408737183, "epoch": 0.4992241425437423, "grad_norm": 1.3359375, "learning_rate": 0.0004982578638908888, "loss": 6.6159, "mean_token_accuracy": 0.11898914724588394, "num_tokens": 10102510.0, "step": 4665 }, { "entropy": 6.755692815780639, "epoch": 0.49975921665150624, "grad_norm": 1.2734375, "learning_rate": 0.0004982531120747286, "loss": 6.6781, "mean_token_accuracy": 0.11363844275474548, "num_tokens": 10112636.0, "step": 4670 }, { "entropy": 6.679724454879761, "epoch": 0.5002942907592701, "grad_norm": 1.546875, "learning_rate": 0.000498248353812166, "loss": 6.684, "mean_token_accuracy": 0.11922202631831169, "num_tokens": 10123562.0, "step": 4675 }, { "entropy": 6.720367956161499, "epoch": 0.5008293648670341, "grad_norm": 1.234375, "learning_rate": 0.0004982435891033387, "loss": 6.6344, "mean_token_accuracy": 0.11208936050534249, "num_tokens": 10134731.0, "step": 4680 }, { "entropy": 6.773916530609131, "epoch": 0.501364438974798, "grad_norm": 1.2265625, "learning_rate": 0.000498238817948384, "loss": 6.6307, "mean_token_accuracy": 0.11377799212932586, "num_tokens": 10145232.0, "step": 4685 }, { "entropy": 6.715243864059448, "epoch": 0.501899513082562, "grad_norm": 1.3671875, "learning_rate": 0.0004982340403474398, "loss": 6.601, "mean_token_accuracy": 0.11478810831904411, "num_tokens": 10155857.0, "step": 4690 }, { "entropy": 6.7384484767913815, "epoch": 0.5024345871903259, "grad_norm": 1.1796875, "learning_rate": 0.0004982292563006441, "loss": 6.6107, "mean_token_accuracy": 0.12016694247722626, "num_tokens": 10166145.0, "step": 4695 }, { "entropy": 6.8165631771087645, "epoch": 0.5029696612980897, "grad_norm": 1.2421875, "learning_rate": 0.000498224465808135, "loss": 6.7341, "mean_token_accuracy": 0.10747307166457176, "num_tokens": 10177086.0, "step": 4700 }, { "entropy": 6.807919645309449, "epoch": 0.5035047354058537, "grad_norm": 1.6015625, "learning_rate": 0.0004982196688700509, "loss": 6.6168, "mean_token_accuracy": 0.11652338951826095, "num_tokens": 10187120.0, "step": 4705 }, { "entropy": 6.746653747558594, "epoch": 0.5040398095136176, "grad_norm": 1.3359375, "learning_rate": 0.0004982148654865302, "loss": 6.6816, "mean_token_accuracy": 0.1173696868121624, "num_tokens": 10197784.0, "step": 4710 }, { "entropy": 6.769271898269653, "epoch": 0.5045748836213816, "grad_norm": 1.1875, "learning_rate": 0.0004982100556577115, "loss": 6.5533, "mean_token_accuracy": 0.12568439543247223, "num_tokens": 10209373.0, "step": 4715 }, { "entropy": 6.758709573745728, "epoch": 0.5051099577291455, "grad_norm": 1.328125, "learning_rate": 0.0004982052393837338, "loss": 6.669, "mean_token_accuracy": 0.11871311962604522, "num_tokens": 10220316.0, "step": 4720 }, { "entropy": 6.6824239730834964, "epoch": 0.5056450318369095, "grad_norm": 1.2265625, "learning_rate": 0.0004982004166647363, "loss": 6.5571, "mean_token_accuracy": 0.12401916012167931, "num_tokens": 10230478.0, "step": 4725 }, { "entropy": 6.623062801361084, "epoch": 0.5061801059446733, "grad_norm": 1.1796875, "learning_rate": 0.0004981955875008582, "loss": 6.6518, "mean_token_accuracy": 0.11519326344132423, "num_tokens": 10240641.0, "step": 4730 }, { "entropy": 6.744868040084839, "epoch": 0.5067151800524372, "grad_norm": 1.2578125, "learning_rate": 0.0004981907518922387, "loss": 6.6428, "mean_token_accuracy": 0.12281770035624504, "num_tokens": 10250676.0, "step": 4735 }, { "entropy": 6.859378337860107, "epoch": 0.5072502541602012, "grad_norm": 1.9765625, "learning_rate": 0.0004981859098390177, "loss": 6.7032, "mean_token_accuracy": 0.11514592617750168, "num_tokens": 10262016.0, "step": 4740 }, { "entropy": 6.7457503318786625, "epoch": 0.5077853282679651, "grad_norm": 1.3046875, "learning_rate": 0.0004981810613413348, "loss": 6.6448, "mean_token_accuracy": 0.12012371569871902, "num_tokens": 10271985.0, "step": 4745 }, { "entropy": 6.745742273330689, "epoch": 0.5083204023757291, "grad_norm": 1.2734375, "learning_rate": 0.0004981762063993302, "loss": 6.6133, "mean_token_accuracy": 0.12136726751923561, "num_tokens": 10282156.0, "step": 4750 }, { "entropy": 6.716922092437744, "epoch": 0.5088554764834929, "grad_norm": 1.34375, "learning_rate": 0.000498171345013144, "loss": 6.611, "mean_token_accuracy": 0.11782191470265388, "num_tokens": 10292576.0, "step": 4755 }, { "entropy": 6.661800575256348, "epoch": 0.5093905505912569, "grad_norm": 1.6640625, "learning_rate": 0.0004981664771829165, "loss": 6.6254, "mean_token_accuracy": 0.1142365463078022, "num_tokens": 10303648.0, "step": 4760 }, { "entropy": 6.715044784545898, "epoch": 0.5099256246990208, "grad_norm": 1.2734375, "learning_rate": 0.0004981616029087884, "loss": 6.5102, "mean_token_accuracy": 0.12722289934754372, "num_tokens": 10314275.0, "step": 4765 }, { "entropy": 6.675028467178345, "epoch": 0.5104606988067847, "grad_norm": 1.3515625, "learning_rate": 0.0004981567221909004, "loss": 6.6398, "mean_token_accuracy": 0.11122743040323257, "num_tokens": 10325386.0, "step": 4770 }, { "entropy": 6.712424802780151, "epoch": 0.5109957729145487, "grad_norm": 1.8828125, "learning_rate": 0.0004981518350293935, "loss": 6.6132, "mean_token_accuracy": 0.11537306159734725, "num_tokens": 10335041.0, "step": 4775 }, { "entropy": 6.743242788314819, "epoch": 0.5115308470223126, "grad_norm": 1.6796875, "learning_rate": 0.0004981469414244086, "loss": 6.5693, "mean_token_accuracy": 0.12268173769116401, "num_tokens": 10345746.0, "step": 4780 }, { "entropy": 6.624886989593506, "epoch": 0.5120659211300765, "grad_norm": 1.25, "learning_rate": 0.000498142041376087, "loss": 6.6945, "mean_token_accuracy": 0.11829338818788529, "num_tokens": 10356995.0, "step": 4785 }, { "entropy": 6.7250689506530765, "epoch": 0.5126009952378404, "grad_norm": 1.359375, "learning_rate": 0.0004981371348845705, "loss": 6.5939, "mean_token_accuracy": 0.1246476911008358, "num_tokens": 10368445.0, "step": 4790 }, { "entropy": 6.810773944854736, "epoch": 0.5131360693456044, "grad_norm": 1.1875, "learning_rate": 0.0004981322219500006, "loss": 6.5364, "mean_token_accuracy": 0.1264880530536175, "num_tokens": 10378256.0, "step": 4795 }, { "entropy": 6.698590278625488, "epoch": 0.5136711434533683, "grad_norm": 1.328125, "learning_rate": 0.000498127302572519, "loss": 6.6306, "mean_token_accuracy": 0.11948861032724381, "num_tokens": 10388698.0, "step": 4800 }, { "entropy": 6.626500415802002, "epoch": 0.5142062175611322, "grad_norm": 1.3203125, "learning_rate": 0.0004981223767522679, "loss": 6.6314, "mean_token_accuracy": 0.12543342038989067, "num_tokens": 10399975.0, "step": 4805 }, { "entropy": 6.73018741607666, "epoch": 0.5147412916688962, "grad_norm": 1.234375, "learning_rate": 0.0004981174444893896, "loss": 6.632, "mean_token_accuracy": 0.11657147109508514, "num_tokens": 10410480.0, "step": 4810 }, { "entropy": 6.754246234893799, "epoch": 0.51527636577666, "grad_norm": 1.484375, "learning_rate": 0.0004981125057840264, "loss": 6.5903, "mean_token_accuracy": 0.12315746694803238, "num_tokens": 10421023.0, "step": 4815 }, { "entropy": 6.691860723495483, "epoch": 0.515811439884424, "grad_norm": 1.34375, "learning_rate": 0.000498107560636321, "loss": 6.6376, "mean_token_accuracy": 0.11937036588788033, "num_tokens": 10431152.0, "step": 4820 }, { "entropy": 6.669547367095947, "epoch": 0.5163465139921879, "grad_norm": 1.375, "learning_rate": 0.0004981026090464161, "loss": 6.5395, "mean_token_accuracy": 0.11537841185927392, "num_tokens": 10441986.0, "step": 4825 }, { "entropy": 6.76296591758728, "epoch": 0.5168815880999519, "grad_norm": 1.515625, "learning_rate": 0.0004980976510144548, "loss": 6.6294, "mean_token_accuracy": 0.11330693066120148, "num_tokens": 10452932.0, "step": 4830 }, { "entropy": 6.730077743530273, "epoch": 0.5174166622077158, "grad_norm": 1.1875, "learning_rate": 0.0004980926865405801, "loss": 6.7059, "mean_token_accuracy": 0.1165323257446289, "num_tokens": 10463411.0, "step": 4835 }, { "entropy": 6.755215454101562, "epoch": 0.5179517363154797, "grad_norm": 1.3203125, "learning_rate": 0.0004980877156249354, "loss": 6.5955, "mean_token_accuracy": 0.12119976133108139, "num_tokens": 10474820.0, "step": 4840 }, { "entropy": 6.693712377548218, "epoch": 0.5184868104232436, "grad_norm": 1.3671875, "learning_rate": 0.0004980827382676643, "loss": 6.5956, "mean_token_accuracy": 0.12424970418214798, "num_tokens": 10485701.0, "step": 4845 }, { "entropy": 6.697637557983398, "epoch": 0.5190218845310075, "grad_norm": 1.375, "learning_rate": 0.0004980777544689105, "loss": 6.5925, "mean_token_accuracy": 0.12146328687667847, "num_tokens": 10495825.0, "step": 4850 }, { "entropy": 6.6988880157470705, "epoch": 0.5195569586387715, "grad_norm": 1.265625, "learning_rate": 0.0004980727642288178, "loss": 6.5759, "mean_token_accuracy": 0.12025154009461403, "num_tokens": 10505847.0, "step": 4855 }, { "entropy": 6.712225770950317, "epoch": 0.5200920327465354, "grad_norm": 1.359375, "learning_rate": 0.0004980677675475305, "loss": 6.6367, "mean_token_accuracy": 0.11677327230572701, "num_tokens": 10516596.0, "step": 4860 }, { "entropy": 6.733681726455688, "epoch": 0.5206271068542994, "grad_norm": 1.3203125, "learning_rate": 0.0004980627644251926, "loss": 6.5497, "mean_token_accuracy": 0.1293226294219494, "num_tokens": 10528175.0, "step": 4865 }, { "entropy": 6.651979970932007, "epoch": 0.5211621809620632, "grad_norm": 1.3203125, "learning_rate": 0.0004980577548619489, "loss": 6.6329, "mean_token_accuracy": 0.11742270663380623, "num_tokens": 10540076.0, "step": 4870 }, { "entropy": 6.686881160736084, "epoch": 0.5216972550698272, "grad_norm": 1.25, "learning_rate": 0.0004980527388579437, "loss": 6.6555, "mean_token_accuracy": 0.11610461995005608, "num_tokens": 10552025.0, "step": 4875 }, { "entropy": 6.746124219894409, "epoch": 0.5222323291775911, "grad_norm": 1.1875, "learning_rate": 0.0004980477164133221, "loss": 6.6528, "mean_token_accuracy": 0.11348175257444382, "num_tokens": 10562535.0, "step": 4880 }, { "entropy": 6.723954057693481, "epoch": 0.522767403285355, "grad_norm": 1.2421875, "learning_rate": 0.000498042687528229, "loss": 6.574, "mean_token_accuracy": 0.12090551033616066, "num_tokens": 10572989.0, "step": 4885 }, { "entropy": 6.658336591720581, "epoch": 0.523302477393119, "grad_norm": 1.234375, "learning_rate": 0.0004980376522028098, "loss": 6.6058, "mean_token_accuracy": 0.12160259932279587, "num_tokens": 10583033.0, "step": 4890 }, { "entropy": 6.734746789932251, "epoch": 0.5238375515008828, "grad_norm": 1.6015625, "learning_rate": 0.0004980326104372095, "loss": 6.6853, "mean_token_accuracy": 0.11474591270089149, "num_tokens": 10595205.0, "step": 4895 }, { "entropy": 6.786480188369751, "epoch": 0.5243726256086468, "grad_norm": 1.4609375, "learning_rate": 0.000498027562231574, "loss": 6.5392, "mean_token_accuracy": 0.12003358751535416, "num_tokens": 10605244.0, "step": 4900 }, { "entropy": 6.718193483352661, "epoch": 0.5249076997164107, "grad_norm": 1.21875, "learning_rate": 0.000498022507586049, "loss": 6.6214, "mean_token_accuracy": 0.11722708195447921, "num_tokens": 10615817.0, "step": 4905 }, { "entropy": 6.725398159027099, "epoch": 0.5254427738241747, "grad_norm": 1.2265625, "learning_rate": 0.0004980174465007804, "loss": 6.6366, "mean_token_accuracy": 0.11559919267892838, "num_tokens": 10627160.0, "step": 4910 }, { "entropy": 6.766883087158203, "epoch": 0.5259778479319386, "grad_norm": 1.390625, "learning_rate": 0.0004980123789759145, "loss": 6.631, "mean_token_accuracy": 0.12066573053598403, "num_tokens": 10637552.0, "step": 4915 }, { "entropy": 6.666731262207032, "epoch": 0.5265129220397025, "grad_norm": 1.7734375, "learning_rate": 0.0004980073050115973, "loss": 6.6807, "mean_token_accuracy": 0.11911093890666961, "num_tokens": 10648773.0, "step": 4920 }, { "entropy": 6.761361503601075, "epoch": 0.5270479961474664, "grad_norm": 1.40625, "learning_rate": 0.0004980022246079755, "loss": 6.6387, "mean_token_accuracy": 0.1175591915845871, "num_tokens": 10659537.0, "step": 4925 }, { "entropy": 6.820301675796509, "epoch": 0.5275830702552303, "grad_norm": 1.234375, "learning_rate": 0.000497997137765196, "loss": 6.6932, "mean_token_accuracy": 0.11372315660119056, "num_tokens": 10671390.0, "step": 4930 }, { "entropy": 6.718183946609497, "epoch": 0.5281181443629943, "grad_norm": 1.609375, "learning_rate": 0.0004979920444834054, "loss": 6.5349, "mean_token_accuracy": 0.12883347496390343, "num_tokens": 10682389.0, "step": 4935 }, { "entropy": 6.594164085388184, "epoch": 0.5286532184707582, "grad_norm": 1.296875, "learning_rate": 0.0004979869447627508, "loss": 6.606, "mean_token_accuracy": 0.12021337449550629, "num_tokens": 10692400.0, "step": 4940 }, { "entropy": 6.691273975372314, "epoch": 0.5291882925785222, "grad_norm": 1.2734375, "learning_rate": 0.0004979818386033795, "loss": 6.526, "mean_token_accuracy": 0.12336401715874672, "num_tokens": 10702396.0, "step": 4945 }, { "entropy": 6.723889923095703, "epoch": 0.5297233666862861, "grad_norm": 1.7265625, "learning_rate": 0.000497976726005439, "loss": 6.6549, "mean_token_accuracy": 0.11776790469884872, "num_tokens": 10712863.0, "step": 4950 }, { "entropy": 6.707800340652466, "epoch": 0.5302584407940499, "grad_norm": 1.2109375, "learning_rate": 0.0004979716069690768, "loss": 6.6556, "mean_token_accuracy": 0.11826993152499199, "num_tokens": 10724234.0, "step": 4955 }, { "entropy": 6.8028627872467045, "epoch": 0.5307935149018139, "grad_norm": 2.09375, "learning_rate": 0.0004979664814944409, "loss": 6.6898, "mean_token_accuracy": 0.11730713248252869, "num_tokens": 10734405.0, "step": 4960 }, { "entropy": 6.796906423568726, "epoch": 0.5313285890095778, "grad_norm": 1.40625, "learning_rate": 0.0004979613495816791, "loss": 6.6269, "mean_token_accuracy": 0.11673597991466522, "num_tokens": 10744573.0, "step": 4965 }, { "entropy": 6.81073899269104, "epoch": 0.5318636631173418, "grad_norm": 1.6171875, "learning_rate": 0.0004979562112309397, "loss": 6.6701, "mean_token_accuracy": 0.12054512575268746, "num_tokens": 10755555.0, "step": 4970 }, { "entropy": 6.69157977104187, "epoch": 0.5323987372251057, "grad_norm": 1.1640625, "learning_rate": 0.000497951066442371, "loss": 6.6797, "mean_token_accuracy": 0.11503533869981766, "num_tokens": 10766493.0, "step": 4975 }, { "entropy": 6.757311391830444, "epoch": 0.5329338113328697, "grad_norm": 1.3984375, "learning_rate": 0.0004979459152161215, "loss": 6.6385, "mean_token_accuracy": 0.11236128360033035, "num_tokens": 10776735.0, "step": 4980 }, { "entropy": 6.700515174865723, "epoch": 0.5334688854406335, "grad_norm": 1.2578125, "learning_rate": 0.0004979407575523402, "loss": 6.6145, "mean_token_accuracy": 0.12050373330712319, "num_tokens": 10787500.0, "step": 4985 }, { "entropy": 6.703393936157227, "epoch": 0.5340039595483974, "grad_norm": 1.609375, "learning_rate": 0.0004979355934511757, "loss": 6.6344, "mean_token_accuracy": 0.12052067667245865, "num_tokens": 10798002.0, "step": 4990 }, { "entropy": 6.75645604133606, "epoch": 0.5345390336561614, "grad_norm": 1.375, "learning_rate": 0.0004979304229127773, "loss": 6.6112, "mean_token_accuracy": 0.11992594972252846, "num_tokens": 10808982.0, "step": 4995 }, { "entropy": 6.736630868911743, "epoch": 0.5350741077639253, "grad_norm": 1.2421875, "learning_rate": 0.0004979252459372944, "loss": 6.5706, "mean_token_accuracy": 0.11807732656598091, "num_tokens": 10821619.0, "step": 5000 }, { "entropy": 6.699893808364868, "epoch": 0.5356091818716893, "grad_norm": 1.390625, "learning_rate": 0.0004979200625248761, "loss": 6.5904, "mean_token_accuracy": 0.12047486156225204, "num_tokens": 10832344.0, "step": 5005 }, { "entropy": 6.670212745666504, "epoch": 0.5361442559794531, "grad_norm": 1.4296875, "learning_rate": 0.0004979148726756725, "loss": 6.5571, "mean_token_accuracy": 0.11860336735844612, "num_tokens": 10843149.0, "step": 5010 }, { "entropy": 6.675074863433838, "epoch": 0.5366793300872171, "grad_norm": 1.6171875, "learning_rate": 0.0004979096763898333, "loss": 6.5998, "mean_token_accuracy": 0.12452303320169449, "num_tokens": 10854590.0, "step": 5015 }, { "entropy": 6.791008424758911, "epoch": 0.537214404194981, "grad_norm": 1.78125, "learning_rate": 0.0004979044736675084, "loss": 6.5671, "mean_token_accuracy": 0.11767032742500305, "num_tokens": 10865500.0, "step": 5020 }, { "entropy": 6.680721569061279, "epoch": 0.5377494783027449, "grad_norm": 1.9375, "learning_rate": 0.0004978992645088483, "loss": 6.6021, "mean_token_accuracy": 0.12172115072607995, "num_tokens": 10876866.0, "step": 5025 }, { "entropy": 6.5734340190887455, "epoch": 0.5382845524105089, "grad_norm": 1.265625, "learning_rate": 0.000497894048914003, "loss": 6.5612, "mean_token_accuracy": 0.11841940134763718, "num_tokens": 10888627.0, "step": 5030 }, { "entropy": 6.746210193634033, "epoch": 0.5388196265182728, "grad_norm": 1.9921875, "learning_rate": 0.0004978888268831236, "loss": 6.6696, "mean_token_accuracy": 0.11132773160934448, "num_tokens": 10900992.0, "step": 5035 }, { "entropy": 6.842794561386109, "epoch": 0.5393547006260367, "grad_norm": 1.40625, "learning_rate": 0.0004978835984163606, "loss": 6.7276, "mean_token_accuracy": 0.10932021215558052, "num_tokens": 10912323.0, "step": 5040 }, { "entropy": 6.800081539154053, "epoch": 0.5398897747338006, "grad_norm": 1.5078125, "learning_rate": 0.0004978783635138649, "loss": 6.6771, "mean_token_accuracy": 0.11647720038890838, "num_tokens": 10923991.0, "step": 5045 }, { "entropy": 6.639073657989502, "epoch": 0.5404248488415646, "grad_norm": 1.34375, "learning_rate": 0.0004978731221757878, "loss": 6.5041, "mean_token_accuracy": 0.12417407482862472, "num_tokens": 10934081.0, "step": 5050 }, { "entropy": 6.727223587036133, "epoch": 0.5409599229493285, "grad_norm": 1.5546875, "learning_rate": 0.0004978678744022808, "loss": 6.6006, "mean_token_accuracy": 0.117810919880867, "num_tokens": 10944729.0, "step": 5055 }, { "entropy": 6.709056615829468, "epoch": 0.5414949970570924, "grad_norm": 1.296875, "learning_rate": 0.000497862620193495, "loss": 6.6635, "mean_token_accuracy": 0.11320299580693245, "num_tokens": 10955708.0, "step": 5060 }, { "entropy": 6.72125997543335, "epoch": 0.5420300711648564, "grad_norm": 1.40625, "learning_rate": 0.0004978573595495826, "loss": 6.6002, "mean_token_accuracy": 0.11878297626972198, "num_tokens": 10966427.0, "step": 5065 }, { "entropy": 6.740125894546509, "epoch": 0.5425651452726202, "grad_norm": 1.9140625, "learning_rate": 0.000497852092470695, "loss": 6.6485, "mean_token_accuracy": 0.11773342937231064, "num_tokens": 10977741.0, "step": 5070 }, { "entropy": 6.7118854999542235, "epoch": 0.5431002193803842, "grad_norm": 1.5390625, "learning_rate": 0.0004978468189569847, "loss": 6.5956, "mean_token_accuracy": 0.12482826039195061, "num_tokens": 10989127.0, "step": 5075 }, { "entropy": 6.6592412948608395, "epoch": 0.5436352934881481, "grad_norm": 1.9140625, "learning_rate": 0.0004978415390086038, "loss": 6.6217, "mean_token_accuracy": 0.11322500184178352, "num_tokens": 10999791.0, "step": 5080 }, { "entropy": 6.783138751983643, "epoch": 0.5441703675959121, "grad_norm": 1.3515625, "learning_rate": 0.0004978362526257047, "loss": 6.6783, "mean_token_accuracy": 0.11360784098505974, "num_tokens": 11010045.0, "step": 5085 }, { "entropy": 6.735276794433593, "epoch": 0.544705441703676, "grad_norm": 1.515625, "learning_rate": 0.0004978309598084403, "loss": 6.6067, "mean_token_accuracy": 0.11822862327098846, "num_tokens": 11020729.0, "step": 5090 }, { "entropy": 6.708194351196289, "epoch": 0.5452405158114398, "grad_norm": 1.40625, "learning_rate": 0.0004978256605569631, "loss": 6.6289, "mean_token_accuracy": 0.1177783451974392, "num_tokens": 11030641.0, "step": 5095 }, { "entropy": 6.784500598907471, "epoch": 0.5457755899192038, "grad_norm": 1.3515625, "learning_rate": 0.0004978203548714262, "loss": 6.6366, "mean_token_accuracy": 0.12379909828305244, "num_tokens": 11041533.0, "step": 5100 }, { "entropy": 6.726690483093262, "epoch": 0.5463106640269677, "grad_norm": 1.265625, "learning_rate": 0.000497815042751983, "loss": 6.58, "mean_token_accuracy": 0.11729968935251237, "num_tokens": 11052170.0, "step": 5105 }, { "entropy": 6.652199029922485, "epoch": 0.5468457381347317, "grad_norm": 1.2421875, "learning_rate": 0.0004978097241987868, "loss": 6.5646, "mean_token_accuracy": 0.1203967772424221, "num_tokens": 11062872.0, "step": 5110 }, { "entropy": 6.719713973999023, "epoch": 0.5473808122424956, "grad_norm": 1.390625, "learning_rate": 0.000497804399211991, "loss": 6.6657, "mean_token_accuracy": 0.11651256605982781, "num_tokens": 11074199.0, "step": 5115 }, { "entropy": 6.7464769840240475, "epoch": 0.5479158863502596, "grad_norm": 1.3046875, "learning_rate": 0.0004977990677917495, "loss": 6.6129, "mean_token_accuracy": 0.11894905865192414, "num_tokens": 11083881.0, "step": 5120 }, { "entropy": 6.6402746677398685, "epoch": 0.5484509604580234, "grad_norm": 1.328125, "learning_rate": 0.0004977937299382162, "loss": 6.6584, "mean_token_accuracy": 0.1151296466588974, "num_tokens": 11094374.0, "step": 5125 }, { "entropy": 6.679858827590943, "epoch": 0.5489860345657873, "grad_norm": 3.578125, "learning_rate": 0.0004977883856515453, "loss": 6.4958, "mean_token_accuracy": 0.1267719380557537, "num_tokens": 11105174.0, "step": 5130 }, { "entropy": 6.751749181747437, "epoch": 0.5495211086735513, "grad_norm": 1.3984375, "learning_rate": 0.000497783034931891, "loss": 6.656, "mean_token_accuracy": 0.11584192886948586, "num_tokens": 11117223.0, "step": 5135 }, { "entropy": 6.7202818393707275, "epoch": 0.5500561827813152, "grad_norm": 1.5234375, "learning_rate": 0.000497777677779408, "loss": 6.579, "mean_token_accuracy": 0.12366545721888542, "num_tokens": 11127240.0, "step": 5140 }, { "entropy": 6.676993894577026, "epoch": 0.5505912568890792, "grad_norm": 1.3828125, "learning_rate": 0.0004977723141942509, "loss": 6.5678, "mean_token_accuracy": 0.1281234510242939, "num_tokens": 11137287.0, "step": 5145 }, { "entropy": 6.7371532917022705, "epoch": 0.551126330996843, "grad_norm": 1.2578125, "learning_rate": 0.0004977669441765743, "loss": 6.7007, "mean_token_accuracy": 0.11768926754593849, "num_tokens": 11148988.0, "step": 5150 }, { "entropy": 6.705612564086914, "epoch": 0.551661405104607, "grad_norm": 1.2734375, "learning_rate": 0.0004977615677265336, "loss": 6.6389, "mean_token_accuracy": 0.12069165110588073, "num_tokens": 11159874.0, "step": 5155 }, { "entropy": 6.73426923751831, "epoch": 0.5521964792123709, "grad_norm": 1.671875, "learning_rate": 0.000497756184844284, "loss": 6.6121, "mean_token_accuracy": 0.12401502057909966, "num_tokens": 11170703.0, "step": 5160 }, { "entropy": 6.744797801971435, "epoch": 0.5527315533201348, "grad_norm": 1.21875, "learning_rate": 0.0004977507955299809, "loss": 6.5001, "mean_token_accuracy": 0.1257123127579689, "num_tokens": 11182230.0, "step": 5165 }, { "entropy": 6.698776006698608, "epoch": 0.5532666274278988, "grad_norm": 1.4140625, "learning_rate": 0.0004977453997837797, "loss": 6.5677, "mean_token_accuracy": 0.10981405228376388, "num_tokens": 11192897.0, "step": 5170 }, { "entropy": 6.682893180847168, "epoch": 0.5538017015356627, "grad_norm": 1.2578125, "learning_rate": 0.0004977399976058366, "loss": 6.6521, "mean_token_accuracy": 0.11399049237370491, "num_tokens": 11203942.0, "step": 5175 }, { "entropy": 6.743161678314209, "epoch": 0.5543367756434266, "grad_norm": 1.203125, "learning_rate": 0.0004977345889963072, "loss": 6.7014, "mean_token_accuracy": 0.11261942982673645, "num_tokens": 11214361.0, "step": 5180 }, { "entropy": 6.6744081497192385, "epoch": 0.5548718497511905, "grad_norm": 1.2890625, "learning_rate": 0.0004977291739553479, "loss": 6.5902, "mean_token_accuracy": 0.12366337925195695, "num_tokens": 11225928.0, "step": 5185 }, { "entropy": 6.682669401168823, "epoch": 0.5554069238589545, "grad_norm": 1.03125, "learning_rate": 0.0004977237524831149, "loss": 6.5444, "mean_token_accuracy": 0.11170822679996491, "num_tokens": 11236660.0, "step": 5190 }, { "entropy": 6.714070177078247, "epoch": 0.5559419979667184, "grad_norm": 1.2734375, "learning_rate": 0.0004977183245797649, "loss": 6.5723, "mean_token_accuracy": 0.1271256498992443, "num_tokens": 11247272.0, "step": 5195 }, { "entropy": 6.77830867767334, "epoch": 0.5564770720744823, "grad_norm": 1.2734375, "learning_rate": 0.0004977128902454547, "loss": 6.6722, "mean_token_accuracy": 0.11327713802456855, "num_tokens": 11258472.0, "step": 5200 }, { "entropy": 6.7154069423675535, "epoch": 0.5570121461822463, "grad_norm": 1.3046875, "learning_rate": 0.0004977074494803409, "loss": 6.5841, "mean_token_accuracy": 0.1255582146346569, "num_tokens": 11268344.0, "step": 5205 }, { "entropy": 6.722737216949463, "epoch": 0.5575472202900101, "grad_norm": 1.2734375, "learning_rate": 0.0004977020022845809, "loss": 6.6762, "mean_token_accuracy": 0.11227439492940902, "num_tokens": 11279931.0, "step": 5210 }, { "entropy": 6.80668683052063, "epoch": 0.5580822943977741, "grad_norm": 1.3125, "learning_rate": 0.0004976965486583318, "loss": 6.6255, "mean_token_accuracy": 0.11421727836132049, "num_tokens": 11290595.0, "step": 5215 }, { "entropy": 6.7050305843353275, "epoch": 0.558617368505538, "grad_norm": 1.6015625, "learning_rate": 0.0004976910886017513, "loss": 6.6411, "mean_token_accuracy": 0.12072176486253738, "num_tokens": 11300774.0, "step": 5220 }, { "entropy": 6.6693981170654295, "epoch": 0.559152442613302, "grad_norm": 1.75, "learning_rate": 0.0004976856221149969, "loss": 6.5309, "mean_token_accuracy": 0.12517891749739646, "num_tokens": 11310288.0, "step": 5225 }, { "entropy": 6.700547170639038, "epoch": 0.5596875167210659, "grad_norm": 1.1484375, "learning_rate": 0.0004976801491982263, "loss": 6.6109, "mean_token_accuracy": 0.11751497983932495, "num_tokens": 11321599.0, "step": 5230 }, { "entropy": 6.786514472961426, "epoch": 0.5602225908288297, "grad_norm": 1.3828125, "learning_rate": 0.0004976746698515977, "loss": 6.6606, "mean_token_accuracy": 0.11887592300772667, "num_tokens": 11331383.0, "step": 5235 }, { "entropy": 6.712525081634522, "epoch": 0.5607576649365937, "grad_norm": 1.2421875, "learning_rate": 0.0004976691840752694, "loss": 6.6195, "mean_token_accuracy": 0.11564537510275841, "num_tokens": 11342085.0, "step": 5240 }, { "entropy": 6.718255138397216, "epoch": 0.5612927390443576, "grad_norm": 1.171875, "learning_rate": 0.0004976636918693996, "loss": 6.6574, "mean_token_accuracy": 0.11577147841453553, "num_tokens": 11354061.0, "step": 5245 }, { "entropy": 6.779119157791138, "epoch": 0.5618278131521216, "grad_norm": 1.3125, "learning_rate": 0.0004976581932341471, "loss": 6.6136, "mean_token_accuracy": 0.12151364013552665, "num_tokens": 11364448.0, "step": 5250 }, { "entropy": 6.769805908203125, "epoch": 0.5623628872598855, "grad_norm": 1.3046875, "learning_rate": 0.0004976526881696706, "loss": 6.5791, "mean_token_accuracy": 0.12037570253014565, "num_tokens": 11374838.0, "step": 5255 }, { "entropy": 6.629622316360473, "epoch": 0.5628979613676495, "grad_norm": 1.25, "learning_rate": 0.0004976471766761288, "loss": 6.6105, "mean_token_accuracy": 0.12379851192235947, "num_tokens": 11385310.0, "step": 5260 }, { "entropy": 6.691438817977906, "epoch": 0.5634330354754133, "grad_norm": 1.6328125, "learning_rate": 0.0004976416587536812, "loss": 6.6142, "mean_token_accuracy": 0.11430059969425202, "num_tokens": 11396590.0, "step": 5265 }, { "entropy": 6.742701053619385, "epoch": 0.5639681095831772, "grad_norm": 1.1875, "learning_rate": 0.0004976361344024871, "loss": 6.5707, "mean_token_accuracy": 0.12226603850722313, "num_tokens": 11407218.0, "step": 5270 }, { "entropy": 6.652452564239502, "epoch": 0.5645031836909412, "grad_norm": 1.5078125, "learning_rate": 0.0004976306036227056, "loss": 6.5931, "mean_token_accuracy": 0.11696631386876107, "num_tokens": 11417716.0, "step": 5275 }, { "entropy": 6.721119165420532, "epoch": 0.5650382577987051, "grad_norm": 1.3515625, "learning_rate": 0.000497625066414497, "loss": 6.6823, "mean_token_accuracy": 0.11784773990511895, "num_tokens": 11428295.0, "step": 5280 }, { "entropy": 6.797392892837524, "epoch": 0.5655733319064691, "grad_norm": 1.21875, "learning_rate": 0.0004976195227780207, "loss": 6.6173, "mean_token_accuracy": 0.11284109130501747, "num_tokens": 11439044.0, "step": 5285 }, { "entropy": 6.779853343963623, "epoch": 0.566108406014233, "grad_norm": 1.3515625, "learning_rate": 0.0004976139727134371, "loss": 6.5497, "mean_token_accuracy": 0.11817987859249116, "num_tokens": 11450029.0, "step": 5290 }, { "entropy": 6.715458774566651, "epoch": 0.566643480121997, "grad_norm": 1.21875, "learning_rate": 0.0004976084162209062, "loss": 6.7264, "mean_token_accuracy": 0.10616886764764785, "num_tokens": 11461190.0, "step": 5295 }, { "entropy": 6.745611715316772, "epoch": 0.5671785542297608, "grad_norm": 1.2421875, "learning_rate": 0.0004976028533005886, "loss": 6.5772, "mean_token_accuracy": 0.11882699206471443, "num_tokens": 11472143.0, "step": 5300 }, { "entropy": 6.771622133255005, "epoch": 0.5677136283375247, "grad_norm": 1.4765625, "learning_rate": 0.0004975972839526449, "loss": 6.7163, "mean_token_accuracy": 0.1069483369588852, "num_tokens": 11483745.0, "step": 5305 }, { "entropy": 6.7719972133636475, "epoch": 0.5682487024452887, "grad_norm": 1.265625, "learning_rate": 0.0004975917081772358, "loss": 6.5791, "mean_token_accuracy": 0.1188987985253334, "num_tokens": 11495695.0, "step": 5310 }, { "entropy": 6.718594884872436, "epoch": 0.5687837765530526, "grad_norm": 1.4140625, "learning_rate": 0.0004975861259745225, "loss": 6.6224, "mean_token_accuracy": 0.11705151796340943, "num_tokens": 11505576.0, "step": 5315 }, { "entropy": 6.661882305145264, "epoch": 0.5693188506608166, "grad_norm": 1.34375, "learning_rate": 0.0004975805373446662, "loss": 6.479, "mean_token_accuracy": 0.12648551389575005, "num_tokens": 11516614.0, "step": 5320 }, { "entropy": 6.7097954750061035, "epoch": 0.5698539247685804, "grad_norm": 1.359375, "learning_rate": 0.000497574942287828, "loss": 6.6111, "mean_token_accuracy": 0.11843594536185265, "num_tokens": 11528032.0, "step": 5325 }, { "entropy": 6.664940547943115, "epoch": 0.5703889988763444, "grad_norm": 1.609375, "learning_rate": 0.0004975693408041697, "loss": 6.6154, "mean_token_accuracy": 0.11421292722225189, "num_tokens": 11538822.0, "step": 5330 }, { "entropy": 6.699612236022949, "epoch": 0.5709240729841083, "grad_norm": 1.34375, "learning_rate": 0.0004975637328938529, "loss": 6.6399, "mean_token_accuracy": 0.11097949370741844, "num_tokens": 11548895.0, "step": 5335 }, { "entropy": 6.714142751693726, "epoch": 0.5714591470918722, "grad_norm": 1.328125, "learning_rate": 0.0004975581185570398, "loss": 6.5215, "mean_token_accuracy": 0.11886597573757171, "num_tokens": 11559613.0, "step": 5340 }, { "entropy": 6.713043832778931, "epoch": 0.5719942211996362, "grad_norm": 1.1640625, "learning_rate": 0.0004975524977938921, "loss": 6.5537, "mean_token_accuracy": 0.12163764908909798, "num_tokens": 11571092.0, "step": 5345 }, { "entropy": 6.692736101150513, "epoch": 0.5725292953074, "grad_norm": 1.4296875, "learning_rate": 0.0004975468706045722, "loss": 6.6814, "mean_token_accuracy": 0.11672013476490975, "num_tokens": 11581448.0, "step": 5350 }, { "entropy": 6.728510904312134, "epoch": 0.573064369415164, "grad_norm": 1.4375, "learning_rate": 0.0004975412369892429, "loss": 6.58, "mean_token_accuracy": 0.12553823739290237, "num_tokens": 11592273.0, "step": 5355 }, { "entropy": 6.757077264785766, "epoch": 0.5735994435229279, "grad_norm": 1.25, "learning_rate": 0.0004975355969480665, "loss": 6.5555, "mean_token_accuracy": 0.125929856300354, "num_tokens": 11602759.0, "step": 5360 }, { "entropy": 6.640834856033325, "epoch": 0.5741345176306919, "grad_norm": 1.3359375, "learning_rate": 0.0004975299504812061, "loss": 6.608, "mean_token_accuracy": 0.11442179679870605, "num_tokens": 11613977.0, "step": 5365 }, { "entropy": 6.71792254447937, "epoch": 0.5746695917384558, "grad_norm": 1.2734375, "learning_rate": 0.0004975242975888246, "loss": 6.636, "mean_token_accuracy": 0.12084050849080086, "num_tokens": 11625425.0, "step": 5370 }, { "entropy": 6.744046688079834, "epoch": 0.5752046658462197, "grad_norm": 1.3671875, "learning_rate": 0.0004975186382710854, "loss": 6.6071, "mean_token_accuracy": 0.11423679888248443, "num_tokens": 11636530.0, "step": 5375 }, { "entropy": 6.741583633422851, "epoch": 0.5757397399539836, "grad_norm": 1.3125, "learning_rate": 0.0004975129725281516, "loss": 6.5856, "mean_token_accuracy": 0.12342779189348221, "num_tokens": 11646516.0, "step": 5380 }, { "entropy": 6.701775741577149, "epoch": 0.5762748140617475, "grad_norm": 1.2890625, "learning_rate": 0.0004975073003601871, "loss": 6.5849, "mean_token_accuracy": 0.11874212771654129, "num_tokens": 11657424.0, "step": 5385 }, { "entropy": 6.704905319213867, "epoch": 0.5768098881695115, "grad_norm": 1.3125, "learning_rate": 0.0004975016217673556, "loss": 6.599, "mean_token_accuracy": 0.12148372679948807, "num_tokens": 11669447.0, "step": 5390 }, { "entropy": 6.697764110565186, "epoch": 0.5773449622772754, "grad_norm": 1.4140625, "learning_rate": 0.000497495936749821, "loss": 6.5675, "mean_token_accuracy": 0.12611041441559792, "num_tokens": 11679612.0, "step": 5395 }, { "entropy": 6.683344936370849, "epoch": 0.5778800363850394, "grad_norm": 1.3046875, "learning_rate": 0.0004974902453077474, "loss": 6.5514, "mean_token_accuracy": 0.1218061052262783, "num_tokens": 11689527.0, "step": 5400 }, { "entropy": 6.765136861801148, "epoch": 0.5784151104928033, "grad_norm": 1.3671875, "learning_rate": 0.0004974845474412993, "loss": 6.5856, "mean_token_accuracy": 0.12035764157772064, "num_tokens": 11700452.0, "step": 5405 }, { "entropy": 6.700014257431031, "epoch": 0.5789501846005671, "grad_norm": 1.625, "learning_rate": 0.0004974788431506412, "loss": 6.5971, "mean_token_accuracy": 0.1191385418176651, "num_tokens": 11710902.0, "step": 5410 }, { "entropy": 6.735801887512207, "epoch": 0.5794852587083311, "grad_norm": 1.484375, "learning_rate": 0.0004974731324359378, "loss": 6.6328, "mean_token_accuracy": 0.10948319584131241, "num_tokens": 11721901.0, "step": 5415 }, { "entropy": 6.765271472930908, "epoch": 0.580020332816095, "grad_norm": 1.2421875, "learning_rate": 0.0004974674152973538, "loss": 6.6146, "mean_token_accuracy": 0.11682233065366746, "num_tokens": 11733622.0, "step": 5420 }, { "entropy": 6.789870738983154, "epoch": 0.580555406923859, "grad_norm": 1.3359375, "learning_rate": 0.0004974616917350545, "loss": 6.6101, "mean_token_accuracy": 0.11982190161943436, "num_tokens": 11745116.0, "step": 5425 }, { "entropy": 6.661038208007812, "epoch": 0.5810904810316229, "grad_norm": 1.28125, "learning_rate": 0.0004974559617492052, "loss": 6.5446, "mean_token_accuracy": 0.12379105761647224, "num_tokens": 11756203.0, "step": 5430 }, { "entropy": 6.719126272201538, "epoch": 0.5816255551393869, "grad_norm": 1.375, "learning_rate": 0.0004974502253399712, "loss": 6.6041, "mean_token_accuracy": 0.12229030430316926, "num_tokens": 11766797.0, "step": 5435 }, { "entropy": 6.752104377746582, "epoch": 0.5821606292471507, "grad_norm": 1.3359375, "learning_rate": 0.0004974444825075182, "loss": 6.6896, "mean_token_accuracy": 0.11470270082354546, "num_tokens": 11778110.0, "step": 5440 }, { "entropy": 6.6274865627288815, "epoch": 0.5826957033549146, "grad_norm": 1.59375, "learning_rate": 0.000497438733252012, "loss": 6.551, "mean_token_accuracy": 0.12010784074664116, "num_tokens": 11788396.0, "step": 5445 }, { "entropy": 6.7564613819122314, "epoch": 0.5832307774626786, "grad_norm": 2.53125, "learning_rate": 0.0004974329775736188, "loss": 6.6412, "mean_token_accuracy": 0.1130734585225582, "num_tokens": 11798691.0, "step": 5450 }, { "entropy": 6.8176110744476315, "epoch": 0.5837658515704425, "grad_norm": 1.421875, "learning_rate": 0.0004974272154725044, "loss": 6.6809, "mean_token_accuracy": 0.1145077645778656, "num_tokens": 11808965.0, "step": 5455 }, { "entropy": 6.655050134658813, "epoch": 0.5843009256782065, "grad_norm": 1.3359375, "learning_rate": 0.0004974214469488355, "loss": 6.5144, "mean_token_accuracy": 0.12288807928562165, "num_tokens": 11819932.0, "step": 5460 }, { "entropy": 6.678020906448364, "epoch": 0.5848359997859703, "grad_norm": 1.5078125, "learning_rate": 0.0004974156720027786, "loss": 6.6115, "mean_token_accuracy": 0.11556534245610237, "num_tokens": 11831332.0, "step": 5465 }, { "entropy": 6.728974628448486, "epoch": 0.5853710738937343, "grad_norm": 1.53125, "learning_rate": 0.0004974098906345004, "loss": 6.5811, "mean_token_accuracy": 0.11275865510106087, "num_tokens": 11840947.0, "step": 5470 }, { "entropy": 6.7000159740448, "epoch": 0.5859061480014982, "grad_norm": 1.3046875, "learning_rate": 0.0004974041028441679, "loss": 6.5377, "mean_token_accuracy": 0.11802567318081855, "num_tokens": 11851640.0, "step": 5475 }, { "entropy": 6.733285045623779, "epoch": 0.5864412221092621, "grad_norm": 1.375, "learning_rate": 0.0004973983086319481, "loss": 6.6649, "mean_token_accuracy": 0.11307286396622658, "num_tokens": 11863608.0, "step": 5480 }, { "entropy": 6.722926664352417, "epoch": 0.5869762962170261, "grad_norm": 1.125, "learning_rate": 0.0004973925079980085, "loss": 6.5586, "mean_token_accuracy": 0.11841953471302986, "num_tokens": 11874707.0, "step": 5485 }, { "entropy": 6.687315177917481, "epoch": 0.58751137032479, "grad_norm": 1.59375, "learning_rate": 0.0004973867009425164, "loss": 6.659, "mean_token_accuracy": 0.11953919008374214, "num_tokens": 11885118.0, "step": 5490 }, { "entropy": 6.783655786514283, "epoch": 0.5880464444325539, "grad_norm": 1.2578125, "learning_rate": 0.0004973808874656396, "loss": 6.6231, "mean_token_accuracy": 0.11821292191743851, "num_tokens": 11895859.0, "step": 5495 }, { "entropy": 6.7643838882446286, "epoch": 0.5885815185403178, "grad_norm": 1.28125, "learning_rate": 0.0004973750675675458, "loss": 6.64, "mean_token_accuracy": 0.11871552392840386, "num_tokens": 11907019.0, "step": 5500 }, { "entropy": 6.729001569747925, "epoch": 0.5891165926480818, "grad_norm": 1.125, "learning_rate": 0.0004973692412484034, "loss": 6.5712, "mean_token_accuracy": 0.1146469995379448, "num_tokens": 11918257.0, "step": 5505 }, { "entropy": 6.721626091003418, "epoch": 0.5896516667558457, "grad_norm": 1.6015625, "learning_rate": 0.0004973634085083802, "loss": 6.5975, "mean_token_accuracy": 0.12574032694101334, "num_tokens": 11929003.0, "step": 5510 }, { "entropy": 6.757476425170898, "epoch": 0.5901867408636096, "grad_norm": 1.1640625, "learning_rate": 0.000497357569347645, "loss": 6.7213, "mean_token_accuracy": 0.11348426267504692, "num_tokens": 11939786.0, "step": 5515 }, { "entropy": 6.751842021942139, "epoch": 0.5907218149713735, "grad_norm": 1.1640625, "learning_rate": 0.0004973517237663661, "loss": 6.6311, "mean_token_accuracy": 0.11161758229136468, "num_tokens": 11951042.0, "step": 5520 }, { "entropy": 6.710853910446167, "epoch": 0.5912568890791374, "grad_norm": 1.953125, "learning_rate": 0.0004973458717647124, "loss": 6.5283, "mean_token_accuracy": 0.12709658294916154, "num_tokens": 11961982.0, "step": 5525 }, { "entropy": 6.703456449508667, "epoch": 0.5917919631869014, "grad_norm": 1.2890625, "learning_rate": 0.000497340013342853, "loss": 6.5923, "mean_token_accuracy": 0.12106578648090363, "num_tokens": 11972078.0, "step": 5530 }, { "entropy": 6.719264888763428, "epoch": 0.5923270372946653, "grad_norm": 1.609375, "learning_rate": 0.000497334148500957, "loss": 6.6446, "mean_token_accuracy": 0.11806860640645027, "num_tokens": 11984037.0, "step": 5535 }, { "entropy": 6.7681842803955075, "epoch": 0.5928621114024293, "grad_norm": 1.2890625, "learning_rate": 0.0004973282772391936, "loss": 6.5852, "mean_token_accuracy": 0.11801839917898178, "num_tokens": 11993688.0, "step": 5540 }, { "entropy": 6.667469120025634, "epoch": 0.5933971855101932, "grad_norm": 1.328125, "learning_rate": 0.0004973223995577324, "loss": 6.5477, "mean_token_accuracy": 0.11981470957398414, "num_tokens": 12003759.0, "step": 5545 }, { "entropy": 6.715129756927491, "epoch": 0.593932259617957, "grad_norm": 1.3125, "learning_rate": 0.0004973165154567432, "loss": 6.5858, "mean_token_accuracy": 0.1203451156616211, "num_tokens": 12015030.0, "step": 5550 }, { "entropy": 6.72750506401062, "epoch": 0.594467333725721, "grad_norm": 1.140625, "learning_rate": 0.0004973106249363959, "loss": 6.6509, "mean_token_accuracy": 0.11390956789255142, "num_tokens": 12026181.0, "step": 5555 }, { "entropy": 6.618847751617432, "epoch": 0.5950024078334849, "grad_norm": 1.28125, "learning_rate": 0.0004973047279968606, "loss": 6.4185, "mean_token_accuracy": 0.13287391439080237, "num_tokens": 12037336.0, "step": 5560 }, { "entropy": 6.65236268043518, "epoch": 0.5955374819412489, "grad_norm": 1.234375, "learning_rate": 0.0004972988246383074, "loss": 6.4918, "mean_token_accuracy": 0.12340264916419982, "num_tokens": 12048425.0, "step": 5565 }, { "entropy": 6.557363128662109, "epoch": 0.5960725560490128, "grad_norm": 1.65625, "learning_rate": 0.0004972929148609068, "loss": 6.4594, "mean_token_accuracy": 0.13635959550738336, "num_tokens": 12059814.0, "step": 5570 }, { "entropy": 6.68271279335022, "epoch": 0.5966076301567768, "grad_norm": 1.59375, "learning_rate": 0.0004972869986648296, "loss": 6.54, "mean_token_accuracy": 0.12527887672185897, "num_tokens": 12069377.0, "step": 5575 }, { "entropy": 6.707939195632934, "epoch": 0.5971427042645406, "grad_norm": 1.2890625, "learning_rate": 0.0004972810760502467, "loss": 6.666, "mean_token_accuracy": 0.11514274403452873, "num_tokens": 12080277.0, "step": 5580 }, { "entropy": 6.727867317199707, "epoch": 0.5976777783723045, "grad_norm": 1.21875, "learning_rate": 0.0004972751470173287, "loss": 6.5453, "mean_token_accuracy": 0.12022876664996147, "num_tokens": 12091375.0, "step": 5585 }, { "entropy": 6.676542520523071, "epoch": 0.5982128524800685, "grad_norm": 1.203125, "learning_rate": 0.0004972692115662473, "loss": 6.5893, "mean_token_accuracy": 0.11981748417019844, "num_tokens": 12103110.0, "step": 5590 }, { "entropy": 6.751420688629151, "epoch": 0.5987479265878324, "grad_norm": 1.7421875, "learning_rate": 0.0004972632696971735, "loss": 6.6451, "mean_token_accuracy": 0.11599904671311378, "num_tokens": 12112454.0, "step": 5595 }, { "entropy": 6.6340423107147215, "epoch": 0.5992830006955964, "grad_norm": 1.28125, "learning_rate": 0.0004972573214102791, "loss": 6.5246, "mean_token_accuracy": 0.11687616854906083, "num_tokens": 12125140.0, "step": 5600 }, { "entropy": 6.698513317108154, "epoch": 0.5998180748033602, "grad_norm": 1.8046875, "learning_rate": 0.0004972513667057358, "loss": 6.5691, "mean_token_accuracy": 0.12039392963051795, "num_tokens": 12136061.0, "step": 5605 }, { "entropy": 6.791307878494263, "epoch": 0.6003531489111242, "grad_norm": 1.171875, "learning_rate": 0.0004972454055837155, "loss": 6.6003, "mean_token_accuracy": 0.12150818780064583, "num_tokens": 12146654.0, "step": 5610 }, { "entropy": 6.723158931732177, "epoch": 0.6008882230188881, "grad_norm": 1.390625, "learning_rate": 0.0004972394380443903, "loss": 6.5878, "mean_token_accuracy": 0.11757106855511665, "num_tokens": 12157881.0, "step": 5615 }, { "entropy": 6.675697088241577, "epoch": 0.601423297126652, "grad_norm": 1.671875, "learning_rate": 0.0004972334640879325, "loss": 6.6085, "mean_token_accuracy": 0.11922492906451225, "num_tokens": 12168534.0, "step": 5620 }, { "entropy": 6.661304664611817, "epoch": 0.601958371234416, "grad_norm": 1.2421875, "learning_rate": 0.0004972274837145147, "loss": 6.5432, "mean_token_accuracy": 0.11988529115915299, "num_tokens": 12178773.0, "step": 5625 }, { "entropy": 6.739487743377685, "epoch": 0.6024934453421799, "grad_norm": 1.1875, "learning_rate": 0.0004972214969243096, "loss": 6.5808, "mean_token_accuracy": 0.11824664920568466, "num_tokens": 12188819.0, "step": 5630 }, { "entropy": 6.660564947128296, "epoch": 0.6030285194499438, "grad_norm": 1.2265625, "learning_rate": 0.00049721550371749, "loss": 6.5607, "mean_token_accuracy": 0.12463830485939979, "num_tokens": 12199198.0, "step": 5635 }, { "entropy": 6.6687784671783445, "epoch": 0.6035635935577077, "grad_norm": 1.1015625, "learning_rate": 0.0004972095040942289, "loss": 6.5644, "mean_token_accuracy": 0.1162213332951069, "num_tokens": 12210765.0, "step": 5640 }, { "entropy": 6.709344291687012, "epoch": 0.6040986676654717, "grad_norm": 1.71875, "learning_rate": 0.0004972034980546996, "loss": 6.6061, "mean_token_accuracy": 0.11544334441423416, "num_tokens": 12221067.0, "step": 5645 }, { "entropy": 6.653585481643677, "epoch": 0.6046337417732356, "grad_norm": 1.1875, "learning_rate": 0.0004971974855990755, "loss": 6.6023, "mean_token_accuracy": 0.11971136629581451, "num_tokens": 12232994.0, "step": 5650 }, { "entropy": 6.738733911514283, "epoch": 0.6051688158809995, "grad_norm": 1.4140625, "learning_rate": 0.0004971914667275302, "loss": 6.5538, "mean_token_accuracy": 0.12072688415646553, "num_tokens": 12243327.0, "step": 5655 }, { "entropy": 6.6140237808227536, "epoch": 0.6057038899887635, "grad_norm": 1.21875, "learning_rate": 0.0004971854414402377, "loss": 6.4752, "mean_token_accuracy": 0.12842355743050576, "num_tokens": 12254249.0, "step": 5660 }, { "entropy": 6.662600469589234, "epoch": 0.6062389640965273, "grad_norm": 1.296875, "learning_rate": 0.0004971794097373716, "loss": 6.5208, "mean_token_accuracy": 0.12328208535909653, "num_tokens": 12264487.0, "step": 5665 }, { "entropy": 6.569520473480225, "epoch": 0.6067740382042913, "grad_norm": 1.375, "learning_rate": 0.0004971733716191063, "loss": 6.5189, "mean_token_accuracy": 0.1292000360786915, "num_tokens": 12274801.0, "step": 5670 }, { "entropy": 6.636984205245971, "epoch": 0.6073091123120552, "grad_norm": 1.4375, "learning_rate": 0.0004971673270856162, "loss": 6.4777, "mean_token_accuracy": 0.11988460049033164, "num_tokens": 12284647.0, "step": 5675 }, { "entropy": 6.658068609237671, "epoch": 0.6078441864198192, "grad_norm": 1.2578125, "learning_rate": 0.0004971612761370756, "loss": 6.6033, "mean_token_accuracy": 0.11951280906796455, "num_tokens": 12295215.0, "step": 5680 }, { "entropy": 6.673429822921753, "epoch": 0.6083792605275831, "grad_norm": 1.4609375, "learning_rate": 0.0004971552187736596, "loss": 6.516, "mean_token_accuracy": 0.12064156159758568, "num_tokens": 12305324.0, "step": 5685 }, { "entropy": 6.668921661376953, "epoch": 0.6089143346353469, "grad_norm": 1.4375, "learning_rate": 0.0004971491549955427, "loss": 6.5372, "mean_token_accuracy": 0.12246538251638413, "num_tokens": 12316399.0, "step": 5690 }, { "entropy": 6.6165331363677975, "epoch": 0.6094494087431109, "grad_norm": 1.2265625, "learning_rate": 0.0004971430848029002, "loss": 6.5219, "mean_token_accuracy": 0.12773501947522165, "num_tokens": 12328033.0, "step": 5695 }, { "entropy": 6.681158256530762, "epoch": 0.6099844828508748, "grad_norm": 1.3984375, "learning_rate": 0.0004971370081959073, "loss": 6.5622, "mean_token_accuracy": 0.12176148667931556, "num_tokens": 12338962.0, "step": 5700 }, { "entropy": 6.697946166992187, "epoch": 0.6105195569586388, "grad_norm": 1.6328125, "learning_rate": 0.0004971309251747396, "loss": 6.5526, "mean_token_accuracy": 0.11940340176224709, "num_tokens": 12350216.0, "step": 5705 }, { "entropy": 6.745215272903442, "epoch": 0.6110546310664027, "grad_norm": 1.171875, "learning_rate": 0.0004971248357395726, "loss": 6.5806, "mean_token_accuracy": 0.11893382146954537, "num_tokens": 12361277.0, "step": 5710 }, { "entropy": 6.580714225769043, "epoch": 0.6115897051741667, "grad_norm": 1.4765625, "learning_rate": 0.0004971187398905821, "loss": 6.4858, "mean_token_accuracy": 0.12100339159369469, "num_tokens": 12373308.0, "step": 5715 }, { "entropy": 6.731028461456299, "epoch": 0.6121247792819305, "grad_norm": 1.3203125, "learning_rate": 0.0004971126376279443, "loss": 6.7259, "mean_token_accuracy": 0.11148046106100082, "num_tokens": 12383943.0, "step": 5720 }, { "entropy": 6.721910047531128, "epoch": 0.6126598533896944, "grad_norm": 1.3125, "learning_rate": 0.0004971065289518354, "loss": 6.482, "mean_token_accuracy": 0.12279203087091446, "num_tokens": 12394575.0, "step": 5725 }, { "entropy": 6.715807628631592, "epoch": 0.6131949274974584, "grad_norm": 1.265625, "learning_rate": 0.0004971004138624315, "loss": 6.5895, "mean_token_accuracy": 0.11779340729117393, "num_tokens": 12405536.0, "step": 5730 }, { "entropy": 6.606629800796509, "epoch": 0.6137300016052223, "grad_norm": 1.7109375, "learning_rate": 0.0004970942923599094, "loss": 6.4743, "mean_token_accuracy": 0.12641754895448684, "num_tokens": 12416148.0, "step": 5735 }, { "entropy": 6.612427473068237, "epoch": 0.6142650757129863, "grad_norm": 1.3828125, "learning_rate": 0.0004970881644444459, "loss": 6.48, "mean_token_accuracy": 0.12701191157102584, "num_tokens": 12426182.0, "step": 5740 }, { "entropy": 6.647663402557373, "epoch": 0.6148001498207502, "grad_norm": 1.1796875, "learning_rate": 0.0004970820301162178, "loss": 6.6625, "mean_token_accuracy": 0.11574866473674775, "num_tokens": 12437548.0, "step": 5745 }, { "entropy": 6.737516117095947, "epoch": 0.6153352239285141, "grad_norm": 1.7890625, "learning_rate": 0.0004970758893754022, "loss": 6.5979, "mean_token_accuracy": 0.11561758294701577, "num_tokens": 12449720.0, "step": 5750 }, { "entropy": 6.817887496948242, "epoch": 0.615870298036278, "grad_norm": 1.140625, "learning_rate": 0.0004970697422221767, "loss": 6.574, "mean_token_accuracy": 0.1215938724577427, "num_tokens": 12460666.0, "step": 5755 }, { "entropy": 6.7063861846923825, "epoch": 0.6164053721440419, "grad_norm": 1.3125, "learning_rate": 0.0004970635886567185, "loss": 6.5911, "mean_token_accuracy": 0.12281558737158775, "num_tokens": 12471472.0, "step": 5760 }, { "entropy": 6.611774969100952, "epoch": 0.6169404462518059, "grad_norm": 2.953125, "learning_rate": 0.0004970574286792054, "loss": 6.5681, "mean_token_accuracy": 0.11770694702863693, "num_tokens": 12482127.0, "step": 5765 }, { "entropy": 6.611656904220581, "epoch": 0.6174755203595698, "grad_norm": 1.34375, "learning_rate": 0.0004970512622898152, "loss": 6.5767, "mean_token_accuracy": 0.12225481644272804, "num_tokens": 12493680.0, "step": 5770 }, { "entropy": 6.65736231803894, "epoch": 0.6180105944673338, "grad_norm": 1.2734375, "learning_rate": 0.000497045089488726, "loss": 6.523, "mean_token_accuracy": 0.12167870178818703, "num_tokens": 12505838.0, "step": 5775 }, { "entropy": 6.704753160476685, "epoch": 0.6185456685750976, "grad_norm": 1.5078125, "learning_rate": 0.0004970389102761161, "loss": 6.5102, "mean_token_accuracy": 0.12942416369915008, "num_tokens": 12516334.0, "step": 5780 }, { "entropy": 6.661266231536866, "epoch": 0.6190807426828616, "grad_norm": 1.3984375, "learning_rate": 0.0004970327246521638, "loss": 6.5879, "mean_token_accuracy": 0.12000072821974754, "num_tokens": 12526440.0, "step": 5785 }, { "entropy": 6.680879926681518, "epoch": 0.6196158167906255, "grad_norm": 1.359375, "learning_rate": 0.0004970265326170478, "loss": 6.5266, "mean_token_accuracy": 0.11807752102613449, "num_tokens": 12538127.0, "step": 5790 }, { "entropy": 6.722283792495728, "epoch": 0.6201508908983894, "grad_norm": 1.34375, "learning_rate": 0.0004970203341709469, "loss": 6.5914, "mean_token_accuracy": 0.12216417640447616, "num_tokens": 12548459.0, "step": 5795 }, { "entropy": 6.58387131690979, "epoch": 0.6206859650061534, "grad_norm": 1.28125, "learning_rate": 0.00049701412931404, "loss": 6.5481, "mean_token_accuracy": 0.12659149914979934, "num_tokens": 12558989.0, "step": 5800 }, { "entropy": 6.62721471786499, "epoch": 0.6212210391139172, "grad_norm": 1.2109375, "learning_rate": 0.0004970079180465064, "loss": 6.4916, "mean_token_accuracy": 0.1283690959215164, "num_tokens": 12569449.0, "step": 5805 }, { "entropy": 6.644355916976929, "epoch": 0.6217561132216812, "grad_norm": 1.296875, "learning_rate": 0.0004970017003685253, "loss": 6.5297, "mean_token_accuracy": 0.12029706984758377, "num_tokens": 12580733.0, "step": 5810 }, { "entropy": 6.65497670173645, "epoch": 0.6222911873294451, "grad_norm": 1.3203125, "learning_rate": 0.0004969954762802763, "loss": 6.5326, "mean_token_accuracy": 0.11786738261580468, "num_tokens": 12590869.0, "step": 5815 }, { "entropy": 6.706523609161377, "epoch": 0.6228262614372091, "grad_norm": 1.40625, "learning_rate": 0.000496989245781939, "loss": 6.6305, "mean_token_accuracy": 0.11878098174929619, "num_tokens": 12602109.0, "step": 5820 }, { "entropy": 6.690067100524902, "epoch": 0.623361335544973, "grad_norm": 1.2578125, "learning_rate": 0.0004969830088736937, "loss": 6.5463, "mean_token_accuracy": 0.11708159074187278, "num_tokens": 12612234.0, "step": 5825 }, { "entropy": 6.761075687408447, "epoch": 0.6238964096527368, "grad_norm": 1.3125, "learning_rate": 0.00049697676555572, "loss": 6.6967, "mean_token_accuracy": 0.11268940791487694, "num_tokens": 12623252.0, "step": 5830 }, { "entropy": 6.709875154495239, "epoch": 0.6244314837605008, "grad_norm": 1.25, "learning_rate": 0.0004969705158281985, "loss": 6.4508, "mean_token_accuracy": 0.12307255640625954, "num_tokens": 12632796.0, "step": 5835 }, { "entropy": 6.652636289596558, "epoch": 0.6249665578682647, "grad_norm": 1.65625, "learning_rate": 0.0004969642596913095, "loss": 6.5512, "mean_token_accuracy": 0.11847778558731079, "num_tokens": 12643278.0, "step": 5840 }, { "entropy": 6.670278692245484, "epoch": 0.6255016319760287, "grad_norm": 5.25, "learning_rate": 0.0004969579971452337, "loss": 6.6218, "mean_token_accuracy": 0.12104167938232421, "num_tokens": 12654446.0, "step": 5845 }, { "entropy": 6.704672002792359, "epoch": 0.6260367060837926, "grad_norm": 1.4296875, "learning_rate": 0.0004969517281901519, "loss": 6.5988, "mean_token_accuracy": 0.12173526436090469, "num_tokens": 12664281.0, "step": 5850 }, { "entropy": 6.726960182189941, "epoch": 0.6265717801915566, "grad_norm": 1.671875, "learning_rate": 0.0004969454528262451, "loss": 6.5829, "mean_token_accuracy": 0.11787922754883766, "num_tokens": 12675252.0, "step": 5855 }, { "entropy": 6.665972471237183, "epoch": 0.6271068542993204, "grad_norm": 1.9765625, "learning_rate": 0.0004969391710536946, "loss": 6.5794, "mean_token_accuracy": 0.1184937097132206, "num_tokens": 12685764.0, "step": 5860 }, { "entropy": 6.591383934020996, "epoch": 0.6276419284070843, "grad_norm": 1.6328125, "learning_rate": 0.0004969328828726817, "loss": 6.4757, "mean_token_accuracy": 0.12730447500944136, "num_tokens": 12696974.0, "step": 5865 }, { "entropy": 6.757170295715332, "epoch": 0.6281770025148483, "grad_norm": 1.453125, "learning_rate": 0.0004969265882833879, "loss": 6.6372, "mean_token_accuracy": 0.11200533658266068, "num_tokens": 12708217.0, "step": 5870 }, { "entropy": 6.707298660278321, "epoch": 0.6287120766226122, "grad_norm": 1.6953125, "learning_rate": 0.0004969202872859952, "loss": 6.516, "mean_token_accuracy": 0.12099341303110123, "num_tokens": 12717840.0, "step": 5875 }, { "entropy": 6.622361516952514, "epoch": 0.6292471507303762, "grad_norm": 1.3828125, "learning_rate": 0.0004969139798806854, "loss": 6.6088, "mean_token_accuracy": 0.11309082061052322, "num_tokens": 12728390.0, "step": 5880 }, { "entropy": 6.653683233261108, "epoch": 0.6297822248381401, "grad_norm": 1.2734375, "learning_rate": 0.0004969076660676405, "loss": 6.6113, "mean_token_accuracy": 0.11578750982880592, "num_tokens": 12738650.0, "step": 5885 }, { "entropy": 6.735027837753296, "epoch": 0.630317298945904, "grad_norm": 1.484375, "learning_rate": 0.000496901345847043, "loss": 6.5966, "mean_token_accuracy": 0.11822382658720017, "num_tokens": 12748989.0, "step": 5890 }, { "entropy": 6.689414024353027, "epoch": 0.6308523730536679, "grad_norm": 1.2578125, "learning_rate": 0.0004968950192190752, "loss": 6.559, "mean_token_accuracy": 0.12090246379375458, "num_tokens": 12761132.0, "step": 5895 }, { "entropy": 6.6849761486053465, "epoch": 0.6313874471614318, "grad_norm": 1.25, "learning_rate": 0.00049688868618392, "loss": 6.5651, "mean_token_accuracy": 0.1228780284523964, "num_tokens": 12771478.0, "step": 5900 }, { "entropy": 6.716721773147583, "epoch": 0.6319225212691958, "grad_norm": 1.2109375, "learning_rate": 0.0004968823467417602, "loss": 6.6244, "mean_token_accuracy": 0.1174764983355999, "num_tokens": 12782096.0, "step": 5905 }, { "entropy": 6.716968536376953, "epoch": 0.6324575953769597, "grad_norm": 1.171875, "learning_rate": 0.0004968760008927788, "loss": 6.5262, "mean_token_accuracy": 0.12529518380761145, "num_tokens": 12792467.0, "step": 5910 }, { "entropy": 6.6767195701599125, "epoch": 0.6329926694847237, "grad_norm": 1.25, "learning_rate": 0.000496869648637159, "loss": 6.5373, "mean_token_accuracy": 0.12640023306012155, "num_tokens": 12803248.0, "step": 5915 }, { "entropy": 6.697324562072754, "epoch": 0.6335277435924875, "grad_norm": 1.3125, "learning_rate": 0.0004968632899750844, "loss": 6.5591, "mean_token_accuracy": 0.12147547379136085, "num_tokens": 12813701.0, "step": 5920 }, { "entropy": 6.800759792327881, "epoch": 0.6340628177002515, "grad_norm": 1.4453125, "learning_rate": 0.0004968569249067383, "loss": 6.6272, "mean_token_accuracy": 0.11679861545562745, "num_tokens": 12824945.0, "step": 5925 }, { "entropy": 6.671930313110352, "epoch": 0.6345978918080154, "grad_norm": 1.09375, "learning_rate": 0.0004968505534323047, "loss": 6.5786, "mean_token_accuracy": 0.1162982702255249, "num_tokens": 12836699.0, "step": 5930 }, { "entropy": 6.6336596488952635, "epoch": 0.6351329659157794, "grad_norm": 1.28125, "learning_rate": 0.0004968441755519677, "loss": 6.5291, "mean_token_accuracy": 0.11951676458120346, "num_tokens": 12846905.0, "step": 5935 }, { "entropy": 6.7043437480926515, "epoch": 0.6356680400235433, "grad_norm": 1.375, "learning_rate": 0.0004968377912659112, "loss": 6.5001, "mean_token_accuracy": 0.12340181395411491, "num_tokens": 12856919.0, "step": 5940 }, { "entropy": 6.60842661857605, "epoch": 0.6362031141313071, "grad_norm": 1.7109375, "learning_rate": 0.0004968314005743196, "loss": 6.4565, "mean_token_accuracy": 0.12368626967072487, "num_tokens": 12867863.0, "step": 5945 }, { "entropy": 6.611450290679931, "epoch": 0.6367381882390711, "grad_norm": 1.1796875, "learning_rate": 0.0004968250034773776, "loss": 6.5429, "mean_token_accuracy": 0.12223007977008819, "num_tokens": 12877877.0, "step": 5950 }, { "entropy": 6.737860918045044, "epoch": 0.637273262346835, "grad_norm": 1.59375, "learning_rate": 0.0004968185999752697, "loss": 6.6383, "mean_token_accuracy": 0.11434445828199387, "num_tokens": 12887954.0, "step": 5955 }, { "entropy": 6.707271003723145, "epoch": 0.637808336454599, "grad_norm": 1.1875, "learning_rate": 0.0004968121900681809, "loss": 6.5511, "mean_token_accuracy": 0.12070679739117622, "num_tokens": 12897744.0, "step": 5960 }, { "entropy": 6.68266224861145, "epoch": 0.6383434105623629, "grad_norm": 1.640625, "learning_rate": 0.0004968057737562964, "loss": 6.617, "mean_token_accuracy": 0.12236501500010491, "num_tokens": 12909193.0, "step": 5965 }, { "entropy": 6.663351440429688, "epoch": 0.6388784846701269, "grad_norm": 1.3125, "learning_rate": 0.0004967993510398012, "loss": 6.4973, "mean_token_accuracy": 0.12318923175334931, "num_tokens": 12919879.0, "step": 5970 }, { "entropy": 6.623578882217407, "epoch": 0.6394135587778907, "grad_norm": 1.2734375, "learning_rate": 0.0004967929219188809, "loss": 6.5387, "mean_token_accuracy": 0.12540650963783265, "num_tokens": 12930297.0, "step": 5975 }, { "entropy": 6.649103832244873, "epoch": 0.6399486328856546, "grad_norm": 1.375, "learning_rate": 0.0004967864863937212, "loss": 6.5329, "mean_token_accuracy": 0.12860941588878633, "num_tokens": 12940467.0, "step": 5980 }, { "entropy": 6.6491728782653805, "epoch": 0.6404837069934186, "grad_norm": 1.4296875, "learning_rate": 0.0004967800444645079, "loss": 6.5204, "mean_token_accuracy": 0.11868370845913886, "num_tokens": 12950417.0, "step": 5985 }, { "entropy": 6.636889123916626, "epoch": 0.6410187811011825, "grad_norm": 1.4765625, "learning_rate": 0.0004967735961314269, "loss": 6.4761, "mean_token_accuracy": 0.122308399528265, "num_tokens": 12960957.0, "step": 5990 }, { "entropy": 6.666227865219116, "epoch": 0.6415538552089465, "grad_norm": 1.125, "learning_rate": 0.0004967671413946646, "loss": 6.575, "mean_token_accuracy": 0.12026591822504998, "num_tokens": 12971194.0, "step": 5995 }, { "entropy": 6.6303346157073975, "epoch": 0.6420889293167104, "grad_norm": 1.5390625, "learning_rate": 0.0004967606802544071, "loss": 6.5736, "mean_token_accuracy": 0.11933250203728676, "num_tokens": 12982479.0, "step": 6000 }, { "epoch": 0.6420889293167104, "eval_entropy": 6.587495564643263, "eval_loss": 6.633632183074951, "eval_mean_token_accuracy": 0.123240454485414, "eval_num_tokens": 12982479.0, "eval_runtime": 22.6134, "eval_samples_per_second": 1312.45, "eval_steps_per_second": 164.062, "step": 6000 }, { "entropy": 6.708343410491944, "epoch": 0.6426240034244743, "grad_norm": 1.2578125, "learning_rate": 0.0004967542127108412, "loss": 6.6257, "mean_token_accuracy": 0.1161632239818573, "num_tokens": 12994119.0, "step": 6005 }, { "entropy": 6.693649530410767, "epoch": 0.6431590775322382, "grad_norm": 1.140625, "learning_rate": 0.0004967477387641537, "loss": 6.5309, "mean_token_accuracy": 0.1253574460744858, "num_tokens": 13005437.0, "step": 6010 }, { "entropy": 6.6332213401794435, "epoch": 0.6436941516400021, "grad_norm": 1.65625, "learning_rate": 0.0004967412584145312, "loss": 6.555, "mean_token_accuracy": 0.12132607325911522, "num_tokens": 13017278.0, "step": 6015 }, { "entropy": 6.6542360305786135, "epoch": 0.6442292257477661, "grad_norm": 1.21875, "learning_rate": 0.0004967347716621611, "loss": 6.5282, "mean_token_accuracy": 0.12165799587965012, "num_tokens": 13028010.0, "step": 6020 }, { "entropy": 6.629656457901001, "epoch": 0.64476429985553, "grad_norm": 1.1484375, "learning_rate": 0.0004967282785072306, "loss": 6.5233, "mean_token_accuracy": 0.12609869465231896, "num_tokens": 13038740.0, "step": 6025 }, { "entropy": 6.6070208072662355, "epoch": 0.645299373963294, "grad_norm": 1.203125, "learning_rate": 0.0004967217789499272, "loss": 6.543, "mean_token_accuracy": 0.12261505052447319, "num_tokens": 13049921.0, "step": 6030 }, { "entropy": 6.6102134704589846, "epoch": 0.6458344480710578, "grad_norm": 1.5, "learning_rate": 0.0004967152729904386, "loss": 6.4664, "mean_token_accuracy": 0.12932628467679025, "num_tokens": 13060907.0, "step": 6035 }, { "entropy": 6.6852294445037845, "epoch": 0.6463695221788218, "grad_norm": 1.1875, "learning_rate": 0.0004967087606289527, "loss": 6.501, "mean_token_accuracy": 0.12574908435344695, "num_tokens": 13071720.0, "step": 6040 }, { "entropy": 6.666558074951172, "epoch": 0.6469045962865857, "grad_norm": 1.203125, "learning_rate": 0.0004967022418656575, "loss": 6.5475, "mean_token_accuracy": 0.12468422725796699, "num_tokens": 13082474.0, "step": 6045 }, { "entropy": 6.596642351150512, "epoch": 0.6474396703943496, "grad_norm": 1.359375, "learning_rate": 0.0004966957167007412, "loss": 6.468, "mean_token_accuracy": 0.12356942817568779, "num_tokens": 13092777.0, "step": 6050 }, { "entropy": 6.594368410110474, "epoch": 0.6479747445021136, "grad_norm": 1.328125, "learning_rate": 0.0004966891851343922, "loss": 6.4676, "mean_token_accuracy": 0.12478138655424117, "num_tokens": 13104019.0, "step": 6055 }, { "entropy": 6.70648775100708, "epoch": 0.6485098186098774, "grad_norm": 1.15625, "learning_rate": 0.0004966826471667992, "loss": 6.4973, "mean_token_accuracy": 0.12690474689006806, "num_tokens": 13115741.0, "step": 6060 }, { "entropy": 6.651901435852051, "epoch": 0.6490448927176414, "grad_norm": 1.21875, "learning_rate": 0.0004966761027981509, "loss": 6.5075, "mean_token_accuracy": 0.12609103322029114, "num_tokens": 13126838.0, "step": 6065 }, { "entropy": 6.642081689834595, "epoch": 0.6495799668254053, "grad_norm": 1.1875, "learning_rate": 0.0004966695520286362, "loss": 6.6086, "mean_token_accuracy": 0.11905003264546395, "num_tokens": 13137485.0, "step": 6070 }, { "entropy": 6.6793499946594235, "epoch": 0.6501150409331693, "grad_norm": 1.2265625, "learning_rate": 0.0004966629948584444, "loss": 6.4684, "mean_token_accuracy": 0.1274704895913601, "num_tokens": 13147631.0, "step": 6075 }, { "entropy": 6.597648620605469, "epoch": 0.6506501150409332, "grad_norm": 1.46875, "learning_rate": 0.0004966564312877647, "loss": 6.5373, "mean_token_accuracy": 0.1260016866028309, "num_tokens": 13158468.0, "step": 6080 }, { "entropy": 6.723154020309448, "epoch": 0.651185189148697, "grad_norm": 3.109375, "learning_rate": 0.0004966498613167868, "loss": 6.5746, "mean_token_accuracy": 0.11794209703803063, "num_tokens": 13169263.0, "step": 6085 }, { "entropy": 6.676345491409302, "epoch": 0.651720263256461, "grad_norm": 1.375, "learning_rate": 0.0004966432849457002, "loss": 6.4874, "mean_token_accuracy": 0.13016888946294786, "num_tokens": 13178647.0, "step": 6090 }, { "entropy": 6.582516241073608, "epoch": 0.6522553373642249, "grad_norm": 1.1796875, "learning_rate": 0.000496636702174695, "loss": 6.4788, "mean_token_accuracy": 0.12643413320183755, "num_tokens": 13189883.0, "step": 6095 }, { "entropy": 6.648423719406128, "epoch": 0.6527904114719889, "grad_norm": 1.25, "learning_rate": 0.0004966301130039611, "loss": 6.6022, "mean_token_accuracy": 0.12256921008229256, "num_tokens": 13200920.0, "step": 6100 }, { "entropy": 6.701182746887207, "epoch": 0.6533254855797528, "grad_norm": 2.796875, "learning_rate": 0.0004966235174336889, "loss": 6.5918, "mean_token_accuracy": 0.11332411095499992, "num_tokens": 13211765.0, "step": 6105 }, { "entropy": 6.659097290039062, "epoch": 0.6538605596875168, "grad_norm": 1.390625, "learning_rate": 0.0004966169154640687, "loss": 6.5191, "mean_token_accuracy": 0.1247679390013218, "num_tokens": 13221768.0, "step": 6110 }, { "entropy": 6.609342384338379, "epoch": 0.6543956337952807, "grad_norm": 1.21875, "learning_rate": 0.0004966103070952912, "loss": 6.5209, "mean_token_accuracy": 0.12406276315450668, "num_tokens": 13233545.0, "step": 6115 }, { "entropy": 6.693496465682983, "epoch": 0.6549307079030445, "grad_norm": 1.2109375, "learning_rate": 0.0004966036923275472, "loss": 6.5591, "mean_token_accuracy": 0.13287978991866112, "num_tokens": 13245018.0, "step": 6120 }, { "entropy": 6.604655790328979, "epoch": 0.6554657820108085, "grad_norm": 1.7578125, "learning_rate": 0.0004965970711610278, "loss": 6.4761, "mean_token_accuracy": 0.12369921505451202, "num_tokens": 13255772.0, "step": 6125 }, { "entropy": 6.611993074417114, "epoch": 0.6560008561185724, "grad_norm": 1.6796875, "learning_rate": 0.0004965904435959241, "loss": 6.5591, "mean_token_accuracy": 0.11679132431745529, "num_tokens": 13267271.0, "step": 6130 }, { "entropy": 6.685591697692871, "epoch": 0.6565359302263364, "grad_norm": 1.5625, "learning_rate": 0.0004965838096324274, "loss": 6.558, "mean_token_accuracy": 0.12077526301145554, "num_tokens": 13278467.0, "step": 6135 }, { "entropy": 6.647955656051636, "epoch": 0.6570710043341003, "grad_norm": 1.296875, "learning_rate": 0.0004965771692707294, "loss": 6.625, "mean_token_accuracy": 0.11517797484993934, "num_tokens": 13288522.0, "step": 6140 }, { "entropy": 6.735994911193847, "epoch": 0.6576060784418643, "grad_norm": 1.65625, "learning_rate": 0.0004965705225110218, "loss": 6.5958, "mean_token_accuracy": 0.1102604016661644, "num_tokens": 13299355.0, "step": 6145 }, { "entropy": 6.69739933013916, "epoch": 0.6581411525496281, "grad_norm": 1.2578125, "learning_rate": 0.0004965638693534964, "loss": 6.5269, "mean_token_accuracy": 0.12430242151021957, "num_tokens": 13310334.0, "step": 6150 }, { "entropy": 6.717443895339966, "epoch": 0.658676226657392, "grad_norm": 1.59375, "learning_rate": 0.0004965572097983455, "loss": 6.5918, "mean_token_accuracy": 0.11856616660952568, "num_tokens": 13320917.0, "step": 6155 }, { "entropy": 6.674542045593261, "epoch": 0.659211300765156, "grad_norm": 1.078125, "learning_rate": 0.0004965505438457613, "loss": 6.4852, "mean_token_accuracy": 0.12417368888854981, "num_tokens": 13331707.0, "step": 6160 }, { "entropy": 6.640851926803589, "epoch": 0.6597463748729199, "grad_norm": 1.2109375, "learning_rate": 0.0004965438714959363, "loss": 6.629, "mean_token_accuracy": 0.11581350415945053, "num_tokens": 13341784.0, "step": 6165 }, { "entropy": 6.735370779037476, "epoch": 0.6602814489806839, "grad_norm": 1.4921875, "learning_rate": 0.000496537192749063, "loss": 6.5809, "mean_token_accuracy": 0.11734402552247047, "num_tokens": 13351633.0, "step": 6170 }, { "entropy": 6.681562995910644, "epoch": 0.6608165230884477, "grad_norm": 1.2421875, "learning_rate": 0.0004965305076053345, "loss": 6.4794, "mean_token_accuracy": 0.12656131833791734, "num_tokens": 13362444.0, "step": 6175 }, { "entropy": 6.592486047744751, "epoch": 0.6613515971962117, "grad_norm": 1.3984375, "learning_rate": 0.0004965238160649437, "loss": 6.6139, "mean_token_accuracy": 0.11791914477944374, "num_tokens": 13374322.0, "step": 6180 }, { "entropy": 6.651375102996826, "epoch": 0.6618866713039756, "grad_norm": 1.390625, "learning_rate": 0.0004965171181280838, "loss": 6.5627, "mean_token_accuracy": 0.11961539909243583, "num_tokens": 13384188.0, "step": 6185 }, { "entropy": 6.709027862548828, "epoch": 0.6624217454117395, "grad_norm": 1.2265625, "learning_rate": 0.0004965104137949483, "loss": 6.5697, "mean_token_accuracy": 0.11759102568030358, "num_tokens": 13395648.0, "step": 6190 }, { "entropy": 6.718053483963013, "epoch": 0.6629568195195035, "grad_norm": 1.28125, "learning_rate": 0.0004965037030657308, "loss": 6.594, "mean_token_accuracy": 0.12067084982991219, "num_tokens": 13406769.0, "step": 6195 }, { "entropy": 6.728432607650757, "epoch": 0.6634918936272673, "grad_norm": 1.5078125, "learning_rate": 0.0004964969859406248, "loss": 6.563, "mean_token_accuracy": 0.11147924661636352, "num_tokens": 13417509.0, "step": 6200 }, { "entropy": 6.6613959789276125, "epoch": 0.6640269677350313, "grad_norm": 2.703125, "learning_rate": 0.0004964902624198246, "loss": 6.4816, "mean_token_accuracy": 0.11563964560627937, "num_tokens": 13429441.0, "step": 6205 }, { "entropy": 6.6188640117645265, "epoch": 0.6645620418427952, "grad_norm": 1.375, "learning_rate": 0.0004964835325035243, "loss": 6.511, "mean_token_accuracy": 0.12196975350379943, "num_tokens": 13439332.0, "step": 6210 }, { "entropy": 6.617918682098389, "epoch": 0.6650971159505592, "grad_norm": 1.3046875, "learning_rate": 0.0004964767961919179, "loss": 6.4908, "mean_token_accuracy": 0.12061900198459626, "num_tokens": 13449400.0, "step": 6215 }, { "entropy": 6.680626916885376, "epoch": 0.6656321900583231, "grad_norm": 1.2734375, "learning_rate": 0.0004964700534852003, "loss": 6.5983, "mean_token_accuracy": 0.11767825335264206, "num_tokens": 13460134.0, "step": 6220 }, { "entropy": 6.686565780639649, "epoch": 0.666167264166087, "grad_norm": 1.390625, "learning_rate": 0.0004964633043835658, "loss": 6.5323, "mean_token_accuracy": 0.12875395640730858, "num_tokens": 13469954.0, "step": 6225 }, { "entropy": 6.679265308380127, "epoch": 0.666702338273851, "grad_norm": 1.5703125, "learning_rate": 0.0004964565488872097, "loss": 6.5229, "mean_token_accuracy": 0.12348946034908295, "num_tokens": 13479866.0, "step": 6230 }, { "entropy": 6.563807821273803, "epoch": 0.6672374123816148, "grad_norm": 1.3125, "learning_rate": 0.0004964497869963268, "loss": 6.478, "mean_token_accuracy": 0.12527237683534623, "num_tokens": 13490088.0, "step": 6235 }, { "entropy": 6.656466770172119, "epoch": 0.6677724864893788, "grad_norm": 1.3125, "learning_rate": 0.0004964430187111125, "loss": 6.5728, "mean_token_accuracy": 0.12173057049512863, "num_tokens": 13500898.0, "step": 6240 }, { "entropy": 6.687621164321899, "epoch": 0.6683075605971427, "grad_norm": 1.109375, "learning_rate": 0.0004964362440317621, "loss": 6.5927, "mean_token_accuracy": 0.1209525316953659, "num_tokens": 13511537.0, "step": 6245 }, { "entropy": 6.633641624450684, "epoch": 0.6688426347049067, "grad_norm": 1.2109375, "learning_rate": 0.0004964294629584712, "loss": 6.5303, "mean_token_accuracy": 0.12212182357907295, "num_tokens": 13522916.0, "step": 6250 }, { "entropy": 6.683465242385864, "epoch": 0.6693777088126706, "grad_norm": 1.2890625, "learning_rate": 0.0004964226754914357, "loss": 6.4758, "mean_token_accuracy": 0.12490794360637665, "num_tokens": 13533817.0, "step": 6255 }, { "entropy": 6.711468744277954, "epoch": 0.6699127829204344, "grad_norm": 1.625, "learning_rate": 0.0004964158816308517, "loss": 6.5852, "mean_token_accuracy": 0.11734790429472923, "num_tokens": 13543723.0, "step": 6260 }, { "entropy": 6.586713552474976, "epoch": 0.6704478570281984, "grad_norm": 1.4453125, "learning_rate": 0.0004964090813769151, "loss": 6.434, "mean_token_accuracy": 0.1227193221449852, "num_tokens": 13555269.0, "step": 6265 }, { "entropy": 6.64307050704956, "epoch": 0.6709829311359623, "grad_norm": 1.328125, "learning_rate": 0.0004964022747298224, "loss": 6.6139, "mean_token_accuracy": 0.11729198768734932, "num_tokens": 13567465.0, "step": 6270 }, { "entropy": 6.752734518051147, "epoch": 0.6715180052437263, "grad_norm": 1.4296875, "learning_rate": 0.0004963954616897701, "loss": 6.5446, "mean_token_accuracy": 0.11841646209359169, "num_tokens": 13578637.0, "step": 6275 }, { "entropy": 6.68422417640686, "epoch": 0.6720530793514902, "grad_norm": 1.5078125, "learning_rate": 0.000496388642256955, "loss": 6.5505, "mean_token_accuracy": 0.12172395139932632, "num_tokens": 13589074.0, "step": 6280 }, { "entropy": 6.646722793579102, "epoch": 0.6725881534592542, "grad_norm": 1.1640625, "learning_rate": 0.000496381816431574, "loss": 6.514, "mean_token_accuracy": 0.12342069149017335, "num_tokens": 13599624.0, "step": 6285 }, { "entropy": 6.719354677200317, "epoch": 0.673123227567018, "grad_norm": 1.2734375, "learning_rate": 0.0004963749842138241, "loss": 6.5363, "mean_token_accuracy": 0.12487530261278153, "num_tokens": 13610293.0, "step": 6290 }, { "entropy": 6.675761699676514, "epoch": 0.6736583016747819, "grad_norm": 1.9453125, "learning_rate": 0.0004963681456039027, "loss": 6.5611, "mean_token_accuracy": 0.11623863652348518, "num_tokens": 13621641.0, "step": 6295 }, { "entropy": 6.602420663833618, "epoch": 0.6741933757825459, "grad_norm": 1.2890625, "learning_rate": 0.0004963613006020072, "loss": 6.5252, "mean_token_accuracy": 0.1208052784204483, "num_tokens": 13632083.0, "step": 6300 }, { "entropy": 6.604093360900879, "epoch": 0.6747284498903098, "grad_norm": 1.5546875, "learning_rate": 0.0004963544492083352, "loss": 6.41, "mean_token_accuracy": 0.13683966994285585, "num_tokens": 13644084.0, "step": 6305 }, { "entropy": 6.6350510597229, "epoch": 0.6752635239980738, "grad_norm": 1.6328125, "learning_rate": 0.0004963475914230845, "loss": 6.5449, "mean_token_accuracy": 0.11910239085555077, "num_tokens": 13656231.0, "step": 6310 }, { "entropy": 6.699683904647827, "epoch": 0.6757985981058376, "grad_norm": 2.140625, "learning_rate": 0.0004963407272464533, "loss": 6.5952, "mean_token_accuracy": 0.11810294091701508, "num_tokens": 13667334.0, "step": 6315 }, { "entropy": 6.724069118499756, "epoch": 0.6763336722136016, "grad_norm": 1.40625, "learning_rate": 0.0004963338566786398, "loss": 6.5828, "mean_token_accuracy": 0.12107535973191261, "num_tokens": 13678615.0, "step": 6320 }, { "entropy": 6.693145990371704, "epoch": 0.6768687463213655, "grad_norm": 1.578125, "learning_rate": 0.0004963269797198422, "loss": 6.5874, "mean_token_accuracy": 0.12346574515104294, "num_tokens": 13689890.0, "step": 6325 }, { "entropy": 6.558933973312378, "epoch": 0.6774038204291294, "grad_norm": 1.6328125, "learning_rate": 0.0004963200963702592, "loss": 6.4168, "mean_token_accuracy": 0.13032166957855223, "num_tokens": 13699120.0, "step": 6330 }, { "entropy": 6.581582736968994, "epoch": 0.6779388945368934, "grad_norm": 1.25, "learning_rate": 0.0004963132066300894, "loss": 6.5395, "mean_token_accuracy": 0.11724406257271766, "num_tokens": 13710016.0, "step": 6335 }, { "entropy": 6.6938841342926025, "epoch": 0.6784739686446573, "grad_norm": 1.5546875, "learning_rate": 0.0004963063104995319, "loss": 6.6391, "mean_token_accuracy": 0.11238991096615791, "num_tokens": 13721576.0, "step": 6340 }, { "entropy": 6.745585584640503, "epoch": 0.6790090427524212, "grad_norm": 1.453125, "learning_rate": 0.0004962994079787859, "loss": 6.591, "mean_token_accuracy": 0.12299842238426209, "num_tokens": 13732568.0, "step": 6345 }, { "entropy": 6.657323408126831, "epoch": 0.6795441168601851, "grad_norm": 1.4296875, "learning_rate": 0.0004962924990680504, "loss": 6.4794, "mean_token_accuracy": 0.12324386537075042, "num_tokens": 13742569.0, "step": 6350 }, { "entropy": 6.627435684204102, "epoch": 0.6800791909679491, "grad_norm": 1.453125, "learning_rate": 0.0004962855837675252, "loss": 6.6034, "mean_token_accuracy": 0.11716282293200493, "num_tokens": 13752689.0, "step": 6355 }, { "entropy": 6.6892821311950685, "epoch": 0.680614265075713, "grad_norm": 1.453125, "learning_rate": 0.0004962786620774099, "loss": 6.5905, "mean_token_accuracy": 0.11979246288537979, "num_tokens": 13763709.0, "step": 6360 }, { "entropy": 6.705752182006836, "epoch": 0.6811493391834769, "grad_norm": 1.6796875, "learning_rate": 0.0004962717339979043, "loss": 6.4891, "mean_token_accuracy": 0.1252245396375656, "num_tokens": 13773726.0, "step": 6365 }, { "entropy": 6.608482742309571, "epoch": 0.6816844132912409, "grad_norm": 1.328125, "learning_rate": 0.0004962647995292084, "loss": 6.5296, "mean_token_accuracy": 0.12159904614090919, "num_tokens": 13785435.0, "step": 6370 }, { "entropy": 6.640556859970093, "epoch": 0.6822194873990047, "grad_norm": 1.71875, "learning_rate": 0.0004962578586715226, "loss": 6.52, "mean_token_accuracy": 0.11594315767288207, "num_tokens": 13797104.0, "step": 6375 }, { "entropy": 6.7496202945709225, "epoch": 0.6827545615067687, "grad_norm": 1.3515625, "learning_rate": 0.0004962509114250471, "loss": 6.6121, "mean_token_accuracy": 0.11787962764501572, "num_tokens": 13807756.0, "step": 6380 }, { "entropy": 6.491614484786988, "epoch": 0.6832896356145326, "grad_norm": 1.453125, "learning_rate": 0.0004962439577899828, "loss": 6.314, "mean_token_accuracy": 0.13807514384388925, "num_tokens": 13818490.0, "step": 6385 }, { "entropy": 6.646625661849976, "epoch": 0.6838247097222966, "grad_norm": 1.28125, "learning_rate": 0.0004962369977665301, "loss": 6.5814, "mean_token_accuracy": 0.11426923871040344, "num_tokens": 13829465.0, "step": 6390 }, { "entropy": 6.783056354522705, "epoch": 0.6843597838300605, "grad_norm": 1.171875, "learning_rate": 0.0004962300313548903, "loss": 6.5539, "mean_token_accuracy": 0.12248866409063339, "num_tokens": 13840863.0, "step": 6395 }, { "entropy": 6.695218420028686, "epoch": 0.6848948579378243, "grad_norm": 1.2265625, "learning_rate": 0.0004962230585552645, "loss": 6.549, "mean_token_accuracy": 0.12046386897563935, "num_tokens": 13851711.0, "step": 6400 }, { "entropy": 6.581887054443359, "epoch": 0.6854299320455883, "grad_norm": 1.6953125, "learning_rate": 0.0004962160793678539, "loss": 6.5789, "mean_token_accuracy": 0.11757319420576096, "num_tokens": 13864576.0, "step": 6405 }, { "entropy": 6.6630912780761715, "epoch": 0.6859650061533522, "grad_norm": 1.3359375, "learning_rate": 0.00049620909379286, "loss": 6.4883, "mean_token_accuracy": 0.12629830315709115, "num_tokens": 13875150.0, "step": 6410 }, { "entropy": 6.683273983001709, "epoch": 0.6865000802611162, "grad_norm": 2.546875, "learning_rate": 0.0004962021018304847, "loss": 6.5422, "mean_token_accuracy": 0.12137580290436745, "num_tokens": 13886070.0, "step": 6415 }, { "entropy": 6.600133419036865, "epoch": 0.6870351543688801, "grad_norm": 1.078125, "learning_rate": 0.0004961951034809298, "loss": 6.4596, "mean_token_accuracy": 0.11954843401908874, "num_tokens": 13897898.0, "step": 6420 }, { "entropy": 6.743383502960205, "epoch": 0.6875702284766441, "grad_norm": 1.2578125, "learning_rate": 0.0004961880987443974, "loss": 6.5996, "mean_token_accuracy": 0.1191033512353897, "num_tokens": 13909578.0, "step": 6425 }, { "entropy": 6.5636146068573, "epoch": 0.6881053025844079, "grad_norm": 1.46875, "learning_rate": 0.0004961810876210897, "loss": 6.4561, "mean_token_accuracy": 0.12540539875626563, "num_tokens": 13920537.0, "step": 6430 }, { "entropy": 6.548890447616577, "epoch": 0.6886403766921718, "grad_norm": 1.2734375, "learning_rate": 0.0004961740701112091, "loss": 6.5134, "mean_token_accuracy": 0.12369008883833885, "num_tokens": 13931015.0, "step": 6435 }, { "entropy": 6.668211126327515, "epoch": 0.6891754507999358, "grad_norm": 1.2109375, "learning_rate": 0.0004961670462149583, "loss": 6.5521, "mean_token_accuracy": 0.12055359557271003, "num_tokens": 13942691.0, "step": 6440 }, { "entropy": 6.767236375808716, "epoch": 0.6897105249076997, "grad_norm": 1.21875, "learning_rate": 0.0004961600159325403, "loss": 6.637, "mean_token_accuracy": 0.10908434465527535, "num_tokens": 13953945.0, "step": 6445 }, { "entropy": 6.751330995559693, "epoch": 0.6902455990154637, "grad_norm": 1.328125, "learning_rate": 0.0004961529792641577, "loss": 6.6236, "mean_token_accuracy": 0.1173236459493637, "num_tokens": 13965658.0, "step": 6450 }, { "entropy": 6.731899356842041, "epoch": 0.6907806731232276, "grad_norm": 1.2578125, "learning_rate": 0.0004961459362100141, "loss": 6.5992, "mean_token_accuracy": 0.12082590013742447, "num_tokens": 13976184.0, "step": 6455 }, { "entropy": 6.6650745391845705, "epoch": 0.6913157472309915, "grad_norm": 1.1953125, "learning_rate": 0.0004961388867703125, "loss": 6.5114, "mean_token_accuracy": 0.11692757606506347, "num_tokens": 13986243.0, "step": 6460 }, { "entropy": 6.65087571144104, "epoch": 0.6918508213387554, "grad_norm": 1.109375, "learning_rate": 0.0004961318309452566, "loss": 6.507, "mean_token_accuracy": 0.12220369726419449, "num_tokens": 13995904.0, "step": 6465 }, { "entropy": 6.659942245483398, "epoch": 0.6923858954465193, "grad_norm": 1.3359375, "learning_rate": 0.0004961247687350504, "loss": 6.5498, "mean_token_accuracy": 0.12576377019286156, "num_tokens": 14006711.0, "step": 6470 }, { "entropy": 6.628136539459229, "epoch": 0.6929209695542833, "grad_norm": 1.2890625, "learning_rate": 0.0004961177001398974, "loss": 6.527, "mean_token_accuracy": 0.12062407061457633, "num_tokens": 14018177.0, "step": 6475 }, { "entropy": 6.665041160583496, "epoch": 0.6934560436620472, "grad_norm": 1.40625, "learning_rate": 0.0004961106251600018, "loss": 6.4884, "mean_token_accuracy": 0.11637992933392524, "num_tokens": 14028725.0, "step": 6480 }, { "entropy": 6.6288951396942135, "epoch": 0.6939911177698111, "grad_norm": 1.2578125, "learning_rate": 0.0004961035437955681, "loss": 6.5271, "mean_token_accuracy": 0.13461530953645706, "num_tokens": 14040448.0, "step": 6485 }, { "entropy": 6.62433614730835, "epoch": 0.694526191877575, "grad_norm": 1.2109375, "learning_rate": 0.0004960964560468005, "loss": 6.5734, "mean_token_accuracy": 0.11507597416639329, "num_tokens": 14051731.0, "step": 6490 }, { "entropy": 6.7240547180175785, "epoch": 0.695061265985339, "grad_norm": 1.1953125, "learning_rate": 0.0004960893619139039, "loss": 6.5658, "mean_token_accuracy": 0.11801211908459663, "num_tokens": 14062330.0, "step": 6495 }, { "entropy": 6.683112001419067, "epoch": 0.6955963400931029, "grad_norm": 1.1640625, "learning_rate": 0.0004960822613970831, "loss": 6.4486, "mean_token_accuracy": 0.12386781573295594, "num_tokens": 14073991.0, "step": 6500 }, { "entropy": 6.640247869491577, "epoch": 0.6961314142008668, "grad_norm": 1.421875, "learning_rate": 0.0004960751544965431, "loss": 6.5076, "mean_token_accuracy": 0.12210935950279236, "num_tokens": 14085132.0, "step": 6505 }, { "entropy": 6.592376041412353, "epoch": 0.6966664883086308, "grad_norm": 1.3515625, "learning_rate": 0.0004960680412124889, "loss": 6.4499, "mean_token_accuracy": 0.12720930054783822, "num_tokens": 14095371.0, "step": 6510 }, { "entropy": 6.5528076171875, "epoch": 0.6972015624163946, "grad_norm": 1.7421875, "learning_rate": 0.0004960609215451261, "loss": 6.5341, "mean_token_accuracy": 0.12374990880489349, "num_tokens": 14106117.0, "step": 6515 }, { "entropy": 6.649059104919433, "epoch": 0.6977366365241586, "grad_norm": 1.2734375, "learning_rate": 0.0004960537954946604, "loss": 6.5267, "mean_token_accuracy": 0.12003685981035232, "num_tokens": 14117112.0, "step": 6520 }, { "entropy": 6.596162796020508, "epoch": 0.6982717106319225, "grad_norm": 1.3046875, "learning_rate": 0.0004960466630612974, "loss": 6.4541, "mean_token_accuracy": 0.13205637782812119, "num_tokens": 14128037.0, "step": 6525 }, { "entropy": 6.556289529800415, "epoch": 0.6988067847396865, "grad_norm": 1.2734375, "learning_rate": 0.0004960395242452429, "loss": 6.4584, "mean_token_accuracy": 0.12506138905882835, "num_tokens": 14140183.0, "step": 6530 }, { "entropy": 6.6649885177612305, "epoch": 0.6993418588474504, "grad_norm": 1.4921875, "learning_rate": 0.0004960323790467033, "loss": 6.5995, "mean_token_accuracy": 0.12367913722991944, "num_tokens": 14151635.0, "step": 6535 }, { "entropy": 6.737906551361084, "epoch": 0.6998769329552142, "grad_norm": 1.28125, "learning_rate": 0.0004960252274658849, "loss": 6.5577, "mean_token_accuracy": 0.12105544358491897, "num_tokens": 14162660.0, "step": 6540 }, { "entropy": 6.671280765533448, "epoch": 0.7004120070629782, "grad_norm": 1.3828125, "learning_rate": 0.0004960180695029939, "loss": 6.5407, "mean_token_accuracy": 0.12037990167737007, "num_tokens": 14173496.0, "step": 6545 }, { "entropy": 6.617800331115722, "epoch": 0.7009470811707421, "grad_norm": 1.34375, "learning_rate": 0.0004960109051582374, "loss": 6.4934, "mean_token_accuracy": 0.11847614273428916, "num_tokens": 14185479.0, "step": 6550 }, { "entropy": 6.60119400024414, "epoch": 0.7014821552785061, "grad_norm": 1.3046875, "learning_rate": 0.0004960037344318221, "loss": 6.4507, "mean_token_accuracy": 0.12120893523097039, "num_tokens": 14197441.0, "step": 6555 }, { "entropy": 6.566002035140992, "epoch": 0.70201722938627, "grad_norm": 1.2890625, "learning_rate": 0.0004959965573239548, "loss": 6.4247, "mean_token_accuracy": 0.12884053736925125, "num_tokens": 14207832.0, "step": 6560 }, { "entropy": 6.55321888923645, "epoch": 0.702552303494034, "grad_norm": 1.3203125, "learning_rate": 0.0004959893738348432, "loss": 6.4945, "mean_token_accuracy": 0.12767787277698517, "num_tokens": 14217976.0, "step": 6565 }, { "entropy": 6.674604034423828, "epoch": 0.7030873776017978, "grad_norm": 1.421875, "learning_rate": 0.0004959821839646943, "loss": 6.4431, "mean_token_accuracy": 0.12329324334859848, "num_tokens": 14227557.0, "step": 6570 }, { "entropy": 6.662657594680786, "epoch": 0.7036224517095617, "grad_norm": 1.28125, "learning_rate": 0.000495974987713716, "loss": 6.571, "mean_token_accuracy": 0.11384310796856881, "num_tokens": 14238912.0, "step": 6575 }, { "entropy": 6.638991737365723, "epoch": 0.7041575258173257, "grad_norm": 1.25, "learning_rate": 0.0004959677850821159, "loss": 6.5012, "mean_token_accuracy": 0.12319194078445435, "num_tokens": 14249968.0, "step": 6580 }, { "entropy": 6.620342445373535, "epoch": 0.7046925999250896, "grad_norm": 1.265625, "learning_rate": 0.0004959605760701021, "loss": 6.5569, "mean_token_accuracy": 0.12182011604309081, "num_tokens": 14260809.0, "step": 6585 }, { "entropy": 6.663771057128907, "epoch": 0.7052276740328536, "grad_norm": 1.5, "learning_rate": 0.0004959533606778827, "loss": 6.527, "mean_token_accuracy": 0.1212913878262043, "num_tokens": 14271971.0, "step": 6590 }, { "entropy": 6.70226559638977, "epoch": 0.7057627481406175, "grad_norm": 1.265625, "learning_rate": 0.0004959461389056661, "loss": 6.5913, "mean_token_accuracy": 0.12781344801187516, "num_tokens": 14283550.0, "step": 6595 }, { "entropy": 6.566189193725586, "epoch": 0.7062978222483814, "grad_norm": 1.25, "learning_rate": 0.0004959389107536608, "loss": 6.4158, "mean_token_accuracy": 0.12276504635810852, "num_tokens": 14293769.0, "step": 6600 }, { "entropy": 6.642466735839844, "epoch": 0.7068328963561453, "grad_norm": 1.3203125, "learning_rate": 0.0004959316762220754, "loss": 6.5368, "mean_token_accuracy": 0.11977979466319084, "num_tokens": 14304668.0, "step": 6605 }, { "entropy": 6.650493144989014, "epoch": 0.7073679704639092, "grad_norm": 1.234375, "learning_rate": 0.000495924435311119, "loss": 6.5975, "mean_token_accuracy": 0.11864884719252586, "num_tokens": 14315912.0, "step": 6610 }, { "entropy": 6.61599588394165, "epoch": 0.7079030445716732, "grad_norm": 1.1875, "learning_rate": 0.0004959171880210005, "loss": 6.5415, "mean_token_accuracy": 0.1240161381661892, "num_tokens": 14327386.0, "step": 6615 }, { "entropy": 6.61832332611084, "epoch": 0.7084381186794371, "grad_norm": 1.1640625, "learning_rate": 0.0004959099343519294, "loss": 6.5297, "mean_token_accuracy": 0.11902955025434495, "num_tokens": 14338629.0, "step": 6620 }, { "entropy": 6.745673322677613, "epoch": 0.7089731927872011, "grad_norm": 1.171875, "learning_rate": 0.0004959026743041148, "loss": 6.5523, "mean_token_accuracy": 0.12611126601696016, "num_tokens": 14349195.0, "step": 6625 }, { "entropy": 6.707384347915649, "epoch": 0.7095082668949649, "grad_norm": 1.4375, "learning_rate": 0.0004958954078777665, "loss": 6.5804, "mean_token_accuracy": 0.11705741733312607, "num_tokens": 14359449.0, "step": 6630 }, { "entropy": 6.607598972320557, "epoch": 0.7100433410027289, "grad_norm": 1.3828125, "learning_rate": 0.0004958881350730944, "loss": 6.4914, "mean_token_accuracy": 0.12530679404735565, "num_tokens": 14369904.0, "step": 6635 }, { "entropy": 6.640906763076782, "epoch": 0.7105784151104928, "grad_norm": 1.4453125, "learning_rate": 0.0004958808558903085, "loss": 6.502, "mean_token_accuracy": 0.12301137670874596, "num_tokens": 14382635.0, "step": 6640 }, { "entropy": 6.597404193878174, "epoch": 0.7111134892182567, "grad_norm": 1.4140625, "learning_rate": 0.0004958735703296189, "loss": 6.4504, "mean_token_accuracy": 0.12635595500469207, "num_tokens": 14393238.0, "step": 6645 }, { "entropy": 6.605778455734253, "epoch": 0.7116485633260207, "grad_norm": 1.25, "learning_rate": 0.000495866278391236, "loss": 6.4988, "mean_token_accuracy": 0.12151379361748696, "num_tokens": 14403734.0, "step": 6650 }, { "entropy": 6.662947177886963, "epoch": 0.7121836374337845, "grad_norm": 1.6640625, "learning_rate": 0.0004958589800753703, "loss": 6.493, "mean_token_accuracy": 0.12501125037670135, "num_tokens": 14414201.0, "step": 6655 }, { "entropy": 6.639647436141968, "epoch": 0.7127187115415485, "grad_norm": 1.21875, "learning_rate": 0.0004958516753822326, "loss": 6.5273, "mean_token_accuracy": 0.12744878232479095, "num_tokens": 14425153.0, "step": 6660 }, { "entropy": 6.599532556533814, "epoch": 0.7132537856493124, "grad_norm": 1.453125, "learning_rate": 0.0004958443643120338, "loss": 6.5016, "mean_token_accuracy": 0.12863869071006775, "num_tokens": 14435942.0, "step": 6665 }, { "entropy": 6.614558696746826, "epoch": 0.7137888597570764, "grad_norm": 1.4453125, "learning_rate": 0.000495837046864985, "loss": 6.4763, "mean_token_accuracy": 0.12335674315690995, "num_tokens": 14446371.0, "step": 6670 }, { "entropy": 6.617805099487304, "epoch": 0.7143239338648403, "grad_norm": 1.421875, "learning_rate": 0.0004958297230412976, "loss": 6.4252, "mean_token_accuracy": 0.127166984975338, "num_tokens": 14456598.0, "step": 6675 }, { "entropy": 6.555561685562134, "epoch": 0.7148590079726042, "grad_norm": 2.703125, "learning_rate": 0.0004958223928411829, "loss": 6.5309, "mean_token_accuracy": 0.1143219605088234, "num_tokens": 14466775.0, "step": 6680 }, { "entropy": 6.574054431915283, "epoch": 0.7153940820803681, "grad_norm": 1.375, "learning_rate": 0.0004958150562648526, "loss": 6.4665, "mean_token_accuracy": 0.12366539910435677, "num_tokens": 14476876.0, "step": 6685 }, { "entropy": 6.590529203414917, "epoch": 0.715929156188132, "grad_norm": 1.3984375, "learning_rate": 0.0004958077133125187, "loss": 6.4797, "mean_token_accuracy": 0.12587342411279678, "num_tokens": 14487698.0, "step": 6690 }, { "entropy": 6.692271709442139, "epoch": 0.716464230295896, "grad_norm": 1.640625, "learning_rate": 0.000495800363984393, "loss": 6.4987, "mean_token_accuracy": 0.12271760776638985, "num_tokens": 14498572.0, "step": 6695 }, { "entropy": 6.623218107223511, "epoch": 0.7169993044036599, "grad_norm": 1.3515625, "learning_rate": 0.0004957930082806878, "loss": 6.5438, "mean_token_accuracy": 0.12247662395238876, "num_tokens": 14509673.0, "step": 6700 }, { "entropy": 6.70994553565979, "epoch": 0.7175343785114239, "grad_norm": 1.515625, "learning_rate": 0.0004957856462016155, "loss": 6.6279, "mean_token_accuracy": 0.1105528324842453, "num_tokens": 14519974.0, "step": 6705 }, { "entropy": 6.691906595230103, "epoch": 0.7180694526191878, "grad_norm": 2.21875, "learning_rate": 0.0004957782777473888, "loss": 6.5373, "mean_token_accuracy": 0.11652741655707359, "num_tokens": 14531194.0, "step": 6710 }, { "entropy": 6.606967735290527, "epoch": 0.7186045267269516, "grad_norm": 1.75, "learning_rate": 0.0004957709029182203, "loss": 6.4862, "mean_token_accuracy": 0.12221086099743843, "num_tokens": 14542393.0, "step": 6715 }, { "entropy": 6.582061862945556, "epoch": 0.7191396008347156, "grad_norm": 1.375, "learning_rate": 0.0004957635217143231, "loss": 6.4944, "mean_token_accuracy": 0.13097272515296937, "num_tokens": 14552934.0, "step": 6720 }, { "entropy": 6.62083740234375, "epoch": 0.7196746749424795, "grad_norm": 1.3984375, "learning_rate": 0.00049575613413591, "loss": 6.4978, "mean_token_accuracy": 0.120374695956707, "num_tokens": 14563643.0, "step": 6725 }, { "entropy": 6.601111316680909, "epoch": 0.7202097490502435, "grad_norm": 1.296875, "learning_rate": 0.0004957487401831947, "loss": 6.445, "mean_token_accuracy": 0.12362169623374938, "num_tokens": 14574422.0, "step": 6730 }, { "entropy": 6.584991502761841, "epoch": 0.7207448231580074, "grad_norm": 1.140625, "learning_rate": 0.0004957413398563906, "loss": 6.4292, "mean_token_accuracy": 0.11930982172489166, "num_tokens": 14585002.0, "step": 6735 }, { "entropy": 6.625512647628784, "epoch": 0.7212798972657714, "grad_norm": 1.6875, "learning_rate": 0.0004957339331557113, "loss": 6.4612, "mean_token_accuracy": 0.1259589172899723, "num_tokens": 14595172.0, "step": 6740 }, { "entropy": 6.599657821655273, "epoch": 0.7218149713735352, "grad_norm": 1.2421875, "learning_rate": 0.0004957265200813706, "loss": 6.5742, "mean_token_accuracy": 0.11676609218120575, "num_tokens": 14606316.0, "step": 6745 }, { "entropy": 6.696068477630615, "epoch": 0.7223500454812991, "grad_norm": 1.609375, "learning_rate": 0.0004957191006335827, "loss": 6.4903, "mean_token_accuracy": 0.12656715735793114, "num_tokens": 14616394.0, "step": 6750 }, { "entropy": 6.555004119873047, "epoch": 0.7228851195890631, "grad_norm": 1.5, "learning_rate": 0.0004957116748125618, "loss": 6.4925, "mean_token_accuracy": 0.11967325806617737, "num_tokens": 14627474.0, "step": 6755 }, { "entropy": 6.575228595733643, "epoch": 0.723420193696827, "grad_norm": 1.28125, "learning_rate": 0.0004957042426185223, "loss": 6.4314, "mean_token_accuracy": 0.13004304990172386, "num_tokens": 14638343.0, "step": 6760 }, { "entropy": 6.614687061309814, "epoch": 0.723955267804591, "grad_norm": 1.328125, "learning_rate": 0.0004956968040516789, "loss": 6.4941, "mean_token_accuracy": 0.12631681188941002, "num_tokens": 14649115.0, "step": 6765 }, { "entropy": 6.607396507263184, "epoch": 0.7244903419123548, "grad_norm": 1.1328125, "learning_rate": 0.0004956893591122461, "loss": 6.5614, "mean_token_accuracy": 0.1266578659415245, "num_tokens": 14659714.0, "step": 6770 }, { "entropy": 6.730130004882812, "epoch": 0.7250254160201188, "grad_norm": 1.2578125, "learning_rate": 0.0004956819078004392, "loss": 6.5943, "mean_token_accuracy": 0.1168831467628479, "num_tokens": 14670481.0, "step": 6775 }, { "entropy": 6.612733459472656, "epoch": 0.7255604901278827, "grad_norm": 1.515625, "learning_rate": 0.0004956744501164732, "loss": 6.4208, "mean_token_accuracy": 0.12815224677324294, "num_tokens": 14680816.0, "step": 6780 }, { "entropy": 6.573790550231934, "epoch": 0.7260955642356466, "grad_norm": 1.1796875, "learning_rate": 0.0004956669860605634, "loss": 6.5177, "mean_token_accuracy": 0.12638939991593362, "num_tokens": 14692723.0, "step": 6785 }, { "entropy": 6.630371952056885, "epoch": 0.7266306383434106, "grad_norm": 1.3125, "learning_rate": 0.0004956595156329254, "loss": 6.5369, "mean_token_accuracy": 0.12008581012487411, "num_tokens": 14703824.0, "step": 6790 }, { "entropy": 6.706773328781128, "epoch": 0.7271657124511745, "grad_norm": 1.28125, "learning_rate": 0.000495652038833775, "loss": 6.5182, "mean_token_accuracy": 0.12735376432538031, "num_tokens": 14715934.0, "step": 6795 }, { "entropy": 6.598440217971802, "epoch": 0.7277007865589384, "grad_norm": 1.328125, "learning_rate": 0.0004956445556633279, "loss": 6.5177, "mean_token_accuracy": 0.12028545215725898, "num_tokens": 14725617.0, "step": 6800 }, { "entropy": 6.634641218185425, "epoch": 0.7282358606667023, "grad_norm": 1.328125, "learning_rate": 0.0004956370661218003, "loss": 6.4967, "mean_token_accuracy": 0.12309338971972465, "num_tokens": 14736430.0, "step": 6805 }, { "entropy": 6.666610288619995, "epoch": 0.7287709347744663, "grad_norm": 1.4375, "learning_rate": 0.0004956295702094084, "loss": 6.5171, "mean_token_accuracy": 0.12309236079454422, "num_tokens": 14746740.0, "step": 6810 }, { "entropy": 6.582339763641357, "epoch": 0.7293060088822302, "grad_norm": 1.5625, "learning_rate": 0.0004956220679263687, "loss": 6.4535, "mean_token_accuracy": 0.12928269281983376, "num_tokens": 14756884.0, "step": 6815 }, { "entropy": 6.589403057098389, "epoch": 0.7298410829899941, "grad_norm": 1.2734375, "learning_rate": 0.0004956145592728976, "loss": 6.4581, "mean_token_accuracy": 0.1312728136777878, "num_tokens": 14766974.0, "step": 6820 }, { "entropy": 6.623006343841553, "epoch": 0.730376157097758, "grad_norm": 1.359375, "learning_rate": 0.0004956070442492123, "loss": 6.6176, "mean_token_accuracy": 0.11667682155966759, "num_tokens": 14778449.0, "step": 6825 }, { "entropy": 6.7070536613464355, "epoch": 0.7309112312055219, "grad_norm": 1.3671875, "learning_rate": 0.0004955995228555296, "loss": 6.5422, "mean_token_accuracy": 0.1225484624505043, "num_tokens": 14788989.0, "step": 6830 }, { "entropy": 6.628703689575195, "epoch": 0.7314463053132859, "grad_norm": 1.2890625, "learning_rate": 0.0004955919950920666, "loss": 6.5023, "mean_token_accuracy": 0.12728202119469642, "num_tokens": 14798454.0, "step": 6835 }, { "entropy": 6.660853433609009, "epoch": 0.7319813794210498, "grad_norm": 1.515625, "learning_rate": 0.0004955844609590408, "loss": 6.4467, "mean_token_accuracy": 0.12790426537394523, "num_tokens": 14808920.0, "step": 6840 }, { "entropy": 6.635347509384156, "epoch": 0.7325164535288138, "grad_norm": 1.1875, "learning_rate": 0.0004955769204566696, "loss": 6.4426, "mean_token_accuracy": 0.1228242613375187, "num_tokens": 14819250.0, "step": 6845 }, { "entropy": 6.662122344970703, "epoch": 0.7330515276365777, "grad_norm": 1.5078125, "learning_rate": 0.0004955693735851709, "loss": 6.5277, "mean_token_accuracy": 0.12443855032324791, "num_tokens": 14829789.0, "step": 6850 }, { "entropy": 6.562832450866699, "epoch": 0.7335866017443415, "grad_norm": 1.5625, "learning_rate": 0.0004955618203447625, "loss": 6.5037, "mean_token_accuracy": 0.1241986483335495, "num_tokens": 14840527.0, "step": 6855 }, { "entropy": 6.608736944198609, "epoch": 0.7341216758521055, "grad_norm": 1.46875, "learning_rate": 0.0004955542607356625, "loss": 6.5588, "mean_token_accuracy": 0.12313508540391922, "num_tokens": 14850922.0, "step": 6860 }, { "entropy": 6.655763769149781, "epoch": 0.7346567499598694, "grad_norm": 1.9609375, "learning_rate": 0.0004955466947580893, "loss": 6.5061, "mean_token_accuracy": 0.12578540593385695, "num_tokens": 14862226.0, "step": 6865 }, { "entropy": 6.597611951828003, "epoch": 0.7351918240676334, "grad_norm": 1.5859375, "learning_rate": 0.0004955391224122611, "loss": 6.4097, "mean_token_accuracy": 0.1363422118127346, "num_tokens": 14872461.0, "step": 6870 }, { "entropy": 6.608497571945191, "epoch": 0.7357268981753973, "grad_norm": 1.4765625, "learning_rate": 0.000495531543698397, "loss": 6.5258, "mean_token_accuracy": 0.12411358803510666, "num_tokens": 14883088.0, "step": 6875 }, { "entropy": 6.693577766418457, "epoch": 0.7362619722831613, "grad_norm": 1.234375, "learning_rate": 0.0004955239586167153, "loss": 6.5405, "mean_token_accuracy": 0.12336590811610222, "num_tokens": 14894055.0, "step": 6880 }, { "entropy": 6.6278046607971195, "epoch": 0.7367970463909251, "grad_norm": 1.5703125, "learning_rate": 0.0004955163671674354, "loss": 6.5092, "mean_token_accuracy": 0.1199507437646389, "num_tokens": 14904760.0, "step": 6885 }, { "entropy": 6.727400636672973, "epoch": 0.737332120498689, "grad_norm": 2.65625, "learning_rate": 0.0004955087693507764, "loss": 6.6256, "mean_token_accuracy": 0.11664849147200584, "num_tokens": 14915983.0, "step": 6890 }, { "entropy": 6.65953311920166, "epoch": 0.737867194606453, "grad_norm": 1.5078125, "learning_rate": 0.0004955011651669577, "loss": 6.5148, "mean_token_accuracy": 0.11811737567186356, "num_tokens": 14925959.0, "step": 6895 }, { "entropy": 6.5658063888549805, "epoch": 0.7384022687142169, "grad_norm": 1.21875, "learning_rate": 0.0004954935546161988, "loss": 6.4756, "mean_token_accuracy": 0.12480072304606438, "num_tokens": 14936138.0, "step": 6900 }, { "entropy": 6.680220413208008, "epoch": 0.7389373428219809, "grad_norm": 1.234375, "learning_rate": 0.0004954859376987195, "loss": 6.5023, "mean_token_accuracy": 0.1277581550180912, "num_tokens": 14946979.0, "step": 6905 }, { "entropy": 6.584284877777099, "epoch": 0.7394724169297447, "grad_norm": 1.3359375, "learning_rate": 0.0004954783144147397, "loss": 6.5679, "mean_token_accuracy": 0.12042608857154846, "num_tokens": 14958324.0, "step": 6910 }, { "entropy": 6.737890386581421, "epoch": 0.7400074910375087, "grad_norm": 1.234375, "learning_rate": 0.0004954706847644796, "loss": 6.5574, "mean_token_accuracy": 0.11832675114274024, "num_tokens": 14969048.0, "step": 6915 }, { "entropy": 6.710620450973511, "epoch": 0.7405425651452726, "grad_norm": 1.265625, "learning_rate": 0.0004954630487481594, "loss": 6.5496, "mean_token_accuracy": 0.12008848264813424, "num_tokens": 14979825.0, "step": 6920 }, { "entropy": 6.595880651473999, "epoch": 0.7410776392530365, "grad_norm": 1.3671875, "learning_rate": 0.0004954554063659998, "loss": 6.481, "mean_token_accuracy": 0.12603807896375657, "num_tokens": 14990138.0, "step": 6925 }, { "entropy": 6.596027612686157, "epoch": 0.7416127133608005, "grad_norm": 1.4453125, "learning_rate": 0.0004954477576182212, "loss": 6.4498, "mean_token_accuracy": 0.1261916309595108, "num_tokens": 15002276.0, "step": 6930 }, { "entropy": 6.646682214736939, "epoch": 0.7421477874685644, "grad_norm": 1.3828125, "learning_rate": 0.0004954401025050445, "loss": 6.5709, "mean_token_accuracy": 0.12357406765222549, "num_tokens": 15013622.0, "step": 6935 }, { "entropy": 6.676917219161988, "epoch": 0.7426828615763283, "grad_norm": 1.3203125, "learning_rate": 0.0004954324410266909, "loss": 6.531, "mean_token_accuracy": 0.12281017452478409, "num_tokens": 15024067.0, "step": 6940 }, { "entropy": 6.628924036026001, "epoch": 0.7432179356840922, "grad_norm": 1.359375, "learning_rate": 0.0004954247731833815, "loss": 6.4168, "mean_token_accuracy": 0.13402525782585145, "num_tokens": 15033646.0, "step": 6945 }, { "entropy": 6.559259271621704, "epoch": 0.7437530097918562, "grad_norm": 1.2734375, "learning_rate": 0.0004954170989753377, "loss": 6.4686, "mean_token_accuracy": 0.12331727594137191, "num_tokens": 15044655.0, "step": 6950 }, { "entropy": 6.714093255996704, "epoch": 0.7442880838996201, "grad_norm": 1.6328125, "learning_rate": 0.0004954094184027813, "loss": 6.5556, "mean_token_accuracy": 0.11801010146737098, "num_tokens": 15055492.0, "step": 6955 }, { "entropy": 6.666389083862304, "epoch": 0.744823158007384, "grad_norm": 1.3046875, "learning_rate": 0.0004954017314659339, "loss": 6.53, "mean_token_accuracy": 0.1155826836824417, "num_tokens": 15066472.0, "step": 6960 }, { "entropy": 6.671958112716675, "epoch": 0.745358232115148, "grad_norm": 1.328125, "learning_rate": 0.0004953940381650174, "loss": 6.5027, "mean_token_accuracy": 0.12497956231236458, "num_tokens": 15076851.0, "step": 6965 }, { "entropy": 6.544204425811768, "epoch": 0.7458933062229118, "grad_norm": 1.4453125, "learning_rate": 0.0004953863385002541, "loss": 6.4337, "mean_token_accuracy": 0.12553054392337798, "num_tokens": 15086997.0, "step": 6970 }, { "entropy": 6.669872713088989, "epoch": 0.7464283803306758, "grad_norm": 1.3359375, "learning_rate": 0.0004953786324718661, "loss": 6.5781, "mean_token_accuracy": 0.1174256332218647, "num_tokens": 15098625.0, "step": 6975 }, { "entropy": 6.628860807418823, "epoch": 0.7469634544384397, "grad_norm": 1.2890625, "learning_rate": 0.0004953709200800761, "loss": 6.3992, "mean_token_accuracy": 0.1296637736260891, "num_tokens": 15108265.0, "step": 6980 }, { "entropy": 6.58307580947876, "epoch": 0.7474985285462037, "grad_norm": 1.4453125, "learning_rate": 0.0004953632013251068, "loss": 6.4934, "mean_token_accuracy": 0.12321807146072387, "num_tokens": 15118794.0, "step": 6985 }, { "entropy": 6.648694610595703, "epoch": 0.7480336026539676, "grad_norm": 1.5859375, "learning_rate": 0.0004953554762071811, "loss": 6.5249, "mean_token_accuracy": 0.12125022262334824, "num_tokens": 15130084.0, "step": 6990 }, { "entropy": 6.664281702041626, "epoch": 0.7485686767617316, "grad_norm": 1.515625, "learning_rate": 0.0004953477447265218, "loss": 6.5118, "mean_token_accuracy": 0.11916638761758805, "num_tokens": 15142193.0, "step": 6995 }, { "entropy": 6.637905645370483, "epoch": 0.7491037508694954, "grad_norm": 1.546875, "learning_rate": 0.0004953400068833524, "loss": 6.6153, "mean_token_accuracy": 0.12101433128118515, "num_tokens": 15152817.0, "step": 7000 }, { "entropy": 6.557371330261231, "epoch": 0.7496388249772593, "grad_norm": 1.3203125, "learning_rate": 0.0004953322626778964, "loss": 6.317, "mean_token_accuracy": 0.13028131946921348, "num_tokens": 15162352.0, "step": 7005 }, { "entropy": 6.673658227920532, "epoch": 0.7501738990850233, "grad_norm": 1.421875, "learning_rate": 0.0004953245121103771, "loss": 6.4892, "mean_token_accuracy": 0.12943382561206818, "num_tokens": 15173091.0, "step": 7010 }, { "entropy": 6.693431568145752, "epoch": 0.7507089731927872, "grad_norm": 1.4765625, "learning_rate": 0.0004953167551810185, "loss": 6.6457, "mean_token_accuracy": 0.11348064690828323, "num_tokens": 15184422.0, "step": 7015 }, { "entropy": 6.567291927337647, "epoch": 0.7512440473005512, "grad_norm": 1.4609375, "learning_rate": 0.0004953089918900447, "loss": 6.3901, "mean_token_accuracy": 0.13483602181077003, "num_tokens": 15194765.0, "step": 7020 }, { "entropy": 6.645245218276978, "epoch": 0.751779121408315, "grad_norm": 1.5546875, "learning_rate": 0.0004953012222376795, "loss": 6.5368, "mean_token_accuracy": 0.11706858575344085, "num_tokens": 15206007.0, "step": 7025 }, { "entropy": 6.627328014373779, "epoch": 0.752314195516079, "grad_norm": 1.4609375, "learning_rate": 0.0004952934462241476, "loss": 6.489, "mean_token_accuracy": 0.12645872682332993, "num_tokens": 15216634.0, "step": 7030 }, { "entropy": 6.62941837310791, "epoch": 0.7528492696238429, "grad_norm": 1.109375, "learning_rate": 0.0004952856638496734, "loss": 6.5516, "mean_token_accuracy": 0.1180113211274147, "num_tokens": 15226931.0, "step": 7035 }, { "entropy": 6.64382848739624, "epoch": 0.7533843437316068, "grad_norm": 1.5, "learning_rate": 0.0004952778751144817, "loss": 6.5267, "mean_token_accuracy": 0.12257011234760284, "num_tokens": 15239034.0, "step": 7040 }, { "entropy": 6.664216995239258, "epoch": 0.7539194178393708, "grad_norm": 1.390625, "learning_rate": 0.0004952700800187971, "loss": 6.5176, "mean_token_accuracy": 0.12180257961153984, "num_tokens": 15250088.0, "step": 7045 }, { "entropy": 6.677762746810913, "epoch": 0.7544544919471347, "grad_norm": 1.5, "learning_rate": 0.000495262278562845, "loss": 6.4659, "mean_token_accuracy": 0.12146370336413384, "num_tokens": 15261150.0, "step": 7050 }, { "entropy": 6.664985132217407, "epoch": 0.7549895660548986, "grad_norm": 1.28125, "learning_rate": 0.0004952544707468506, "loss": 6.5414, "mean_token_accuracy": 0.12395042702555656, "num_tokens": 15270865.0, "step": 7055 }, { "entropy": 6.677373027801513, "epoch": 0.7555246401626625, "grad_norm": 1.40625, "learning_rate": 0.0004952466565710391, "loss": 6.5552, "mean_token_accuracy": 0.118691186606884, "num_tokens": 15282809.0, "step": 7060 }, { "entropy": 6.694124698638916, "epoch": 0.7560597142704265, "grad_norm": 1.3046875, "learning_rate": 0.0004952388360356366, "loss": 6.5083, "mean_token_accuracy": 0.12859989702701569, "num_tokens": 15293166.0, "step": 7065 }, { "entropy": 6.616050100326538, "epoch": 0.7565947883781904, "grad_norm": 1.5, "learning_rate": 0.0004952310091408685, "loss": 6.4966, "mean_token_accuracy": 0.12518092021346092, "num_tokens": 15302985.0, "step": 7070 }, { "entropy": 6.651115751266479, "epoch": 0.7571298624859543, "grad_norm": 1.59375, "learning_rate": 0.0004952231758869611, "loss": 6.5415, "mean_token_accuracy": 0.1267145797610283, "num_tokens": 15314737.0, "step": 7075 }, { "entropy": 6.614376068115234, "epoch": 0.7576649365937183, "grad_norm": 1.2421875, "learning_rate": 0.0004952153362741403, "loss": 6.464, "mean_token_accuracy": 0.13092187345027922, "num_tokens": 15325441.0, "step": 7080 }, { "entropy": 6.599036788940429, "epoch": 0.7582000107014821, "grad_norm": 1.2265625, "learning_rate": 0.0004952074903026327, "loss": 6.3991, "mean_token_accuracy": 0.12750762775540353, "num_tokens": 15334939.0, "step": 7085 }, { "entropy": 6.595050287246704, "epoch": 0.7587350848092461, "grad_norm": 1.21875, "learning_rate": 0.0004951996379726647, "loss": 6.5734, "mean_token_accuracy": 0.12048307284712792, "num_tokens": 15345655.0, "step": 7090 }, { "entropy": 6.538129758834839, "epoch": 0.75927015891701, "grad_norm": 1.4375, "learning_rate": 0.0004951917792844631, "loss": 6.3968, "mean_token_accuracy": 0.13058631792664527, "num_tokens": 15356035.0, "step": 7095 }, { "entropy": 6.659978437423706, "epoch": 0.759805233024774, "grad_norm": 1.1875, "learning_rate": 0.0004951839142382548, "loss": 6.5094, "mean_token_accuracy": 0.12489819005131722, "num_tokens": 15368509.0, "step": 7100 }, { "entropy": 6.615253734588623, "epoch": 0.7603403071325379, "grad_norm": 1.171875, "learning_rate": 0.000495176042834267, "loss": 6.4777, "mean_token_accuracy": 0.1264044873416424, "num_tokens": 15379662.0, "step": 7105 }, { "entropy": 6.601353359222412, "epoch": 0.7608753812403017, "grad_norm": 1.4609375, "learning_rate": 0.0004951681650727268, "loss": 6.4844, "mean_token_accuracy": 0.11898941099643708, "num_tokens": 15389698.0, "step": 7110 }, { "entropy": 6.746938896179199, "epoch": 0.7614104553480657, "grad_norm": 1.203125, "learning_rate": 0.0004951602809538619, "loss": 6.5772, "mean_token_accuracy": 0.11864528879523277, "num_tokens": 15400724.0, "step": 7115 }, { "entropy": 6.733620023727417, "epoch": 0.7619455294558296, "grad_norm": 1.25, "learning_rate": 0.0004951523904778997, "loss": 6.5659, "mean_token_accuracy": 0.11942593604326249, "num_tokens": 15410732.0, "step": 7120 }, { "entropy": 6.618440341949463, "epoch": 0.7624806035635936, "grad_norm": 1.421875, "learning_rate": 0.0004951444936450682, "loss": 6.4671, "mean_token_accuracy": 0.13049914836883544, "num_tokens": 15420185.0, "step": 7125 }, { "entropy": 6.591977787017822, "epoch": 0.7630156776713575, "grad_norm": 1.515625, "learning_rate": 0.0004951365904555954, "loss": 6.4038, "mean_token_accuracy": 0.1246684692800045, "num_tokens": 15431904.0, "step": 7130 }, { "entropy": 6.575604772567749, "epoch": 0.7635507517791215, "grad_norm": 1.2890625, "learning_rate": 0.0004951286809097094, "loss": 6.5303, "mean_token_accuracy": 0.11952223181724549, "num_tokens": 15442650.0, "step": 7135 }, { "entropy": 6.564087724685669, "epoch": 0.7640858258868853, "grad_norm": 1.484375, "learning_rate": 0.0004951207650076388, "loss": 6.5026, "mean_token_accuracy": 0.12019338682293892, "num_tokens": 15454273.0, "step": 7140 }, { "entropy": 6.638538455963134, "epoch": 0.7646208999946492, "grad_norm": 1.2890625, "learning_rate": 0.000495112842749612, "loss": 6.4855, "mean_token_accuracy": 0.1241270050406456, "num_tokens": 15465751.0, "step": 7145 }, { "entropy": 6.656053924560547, "epoch": 0.7651559741024132, "grad_norm": 1.359375, "learning_rate": 0.0004951049141358578, "loss": 6.5927, "mean_token_accuracy": 0.11400035619735718, "num_tokens": 15475340.0, "step": 7150 }, { "entropy": 6.713410806655884, "epoch": 0.7656910482101771, "grad_norm": 1.265625, "learning_rate": 0.0004950969791666051, "loss": 6.5507, "mean_token_accuracy": 0.1195062555372715, "num_tokens": 15486246.0, "step": 7155 }, { "entropy": 6.696958923339844, "epoch": 0.7662261223179411, "grad_norm": 1.390625, "learning_rate": 0.0004950890378420831, "loss": 6.5556, "mean_token_accuracy": 0.12101633250713348, "num_tokens": 15497331.0, "step": 7160 }, { "entropy": 6.624008226394653, "epoch": 0.766761196425705, "grad_norm": 1.1328125, "learning_rate": 0.000495081090162521, "loss": 6.496, "mean_token_accuracy": 0.1252144269645214, "num_tokens": 15508036.0, "step": 7165 }, { "entropy": 6.651372194290161, "epoch": 0.7672962705334689, "grad_norm": 1.3984375, "learning_rate": 0.0004950731361281483, "loss": 6.4892, "mean_token_accuracy": 0.12409828379750251, "num_tokens": 15518381.0, "step": 7170 }, { "entropy": 6.648929023742676, "epoch": 0.7678313446412328, "grad_norm": 1.296875, "learning_rate": 0.0004950651757391948, "loss": 6.4927, "mean_token_accuracy": 0.12453809827566147, "num_tokens": 15528939.0, "step": 7175 }, { "entropy": 6.691262435913086, "epoch": 0.7683664187489967, "grad_norm": 1.25, "learning_rate": 0.0004950572089958904, "loss": 6.4844, "mean_token_accuracy": 0.11920621544122696, "num_tokens": 15539718.0, "step": 7180 }, { "entropy": 6.671784210205078, "epoch": 0.7689014928567607, "grad_norm": 1.375, "learning_rate": 0.0004950492358984648, "loss": 6.6442, "mean_token_accuracy": 0.11607598587870598, "num_tokens": 15550970.0, "step": 7185 }, { "entropy": 6.673526191711426, "epoch": 0.7694365669645246, "grad_norm": 1.296875, "learning_rate": 0.0004950412564471486, "loss": 6.4146, "mean_token_accuracy": 0.1274817906320095, "num_tokens": 15560490.0, "step": 7190 }, { "entropy": 6.616913270950318, "epoch": 0.7699716410722885, "grad_norm": 1.390625, "learning_rate": 0.000495033270642172, "loss": 6.4266, "mean_token_accuracy": 0.1294262781739235, "num_tokens": 15570188.0, "step": 7195 }, { "entropy": 6.589165592193604, "epoch": 0.7705067151800524, "grad_norm": 1.296875, "learning_rate": 0.0004950252784837655, "loss": 6.4459, "mean_token_accuracy": 0.12019804939627647, "num_tokens": 15581446.0, "step": 7200 }, { "entropy": 6.63636999130249, "epoch": 0.7710417892878164, "grad_norm": 1.8125, "learning_rate": 0.0004950172799721601, "loss": 6.5597, "mean_token_accuracy": 0.12001867443323136, "num_tokens": 15594362.0, "step": 7205 }, { "entropy": 6.646881103515625, "epoch": 0.7715768633955803, "grad_norm": 1.5390625, "learning_rate": 0.0004950092751075866, "loss": 6.4336, "mean_token_accuracy": 0.13300900235772134, "num_tokens": 15605531.0, "step": 7210 }, { "entropy": 6.632643985748291, "epoch": 0.7721119375033442, "grad_norm": 1.65625, "learning_rate": 0.0004950012638902763, "loss": 6.4747, "mean_token_accuracy": 0.12664539813995362, "num_tokens": 15614962.0, "step": 7215 }, { "entropy": 6.527265357971191, "epoch": 0.7726470116111082, "grad_norm": 2.078125, "learning_rate": 0.0004949932463204603, "loss": 6.5196, "mean_token_accuracy": 0.12367821410298348, "num_tokens": 15625475.0, "step": 7220 }, { "entropy": 6.600604248046875, "epoch": 0.773182085718872, "grad_norm": 1.1953125, "learning_rate": 0.0004949852223983703, "loss": 6.5051, "mean_token_accuracy": 0.11932418122887611, "num_tokens": 15637359.0, "step": 7225 }, { "entropy": 6.792949867248535, "epoch": 0.773717159826636, "grad_norm": 1.5078125, "learning_rate": 0.0004949771921242379, "loss": 6.5462, "mean_token_accuracy": 0.117109165340662, "num_tokens": 15648368.0, "step": 7230 }, { "entropy": 6.6926452159881595, "epoch": 0.7742522339343999, "grad_norm": 1.34375, "learning_rate": 0.0004949691554982951, "loss": 6.4385, "mean_token_accuracy": 0.13027268201112746, "num_tokens": 15659295.0, "step": 7235 }, { "entropy": 6.543884658813477, "epoch": 0.7747873080421639, "grad_norm": 1.5859375, "learning_rate": 0.0004949611125207737, "loss": 6.4051, "mean_token_accuracy": 0.12192230448126792, "num_tokens": 15669975.0, "step": 7240 }, { "entropy": 6.570065546035766, "epoch": 0.7753223821499278, "grad_norm": 1.5390625, "learning_rate": 0.000494953063191906, "loss": 6.4946, "mean_token_accuracy": 0.11872415691614151, "num_tokens": 15680343.0, "step": 7245 }, { "entropy": 6.683220624923706, "epoch": 0.7758574562576916, "grad_norm": 1.34375, "learning_rate": 0.0004949450075119247, "loss": 6.5525, "mean_token_accuracy": 0.12026704177260399, "num_tokens": 15692246.0, "step": 7250 }, { "entropy": 6.6822953701019285, "epoch": 0.7763925303654556, "grad_norm": 1.140625, "learning_rate": 0.0004949369454810621, "loss": 6.5062, "mean_token_accuracy": 0.12393845468759537, "num_tokens": 15704262.0, "step": 7255 }, { "entropy": 6.547556638717651, "epoch": 0.7769276044732195, "grad_norm": 1.5234375, "learning_rate": 0.0004949288770995512, "loss": 6.4991, "mean_token_accuracy": 0.12381231859326362, "num_tokens": 15715078.0, "step": 7260 }, { "entropy": 6.660402727127075, "epoch": 0.7774626785809835, "grad_norm": 1.3125, "learning_rate": 0.0004949208023676249, "loss": 6.5459, "mean_token_accuracy": 0.1232883907854557, "num_tokens": 15726503.0, "step": 7265 }, { "entropy": 6.587308025360107, "epoch": 0.7779977526887474, "grad_norm": 2.140625, "learning_rate": 0.0004949127212855161, "loss": 6.4327, "mean_token_accuracy": 0.12670731246471406, "num_tokens": 15738854.0, "step": 7270 }, { "entropy": 6.611951589584351, "epoch": 0.7785328267965114, "grad_norm": 1.5859375, "learning_rate": 0.0004949046338534587, "loss": 6.5893, "mean_token_accuracy": 0.12085817605257035, "num_tokens": 15750836.0, "step": 7275 }, { "entropy": 6.783895874023438, "epoch": 0.7790679009042752, "grad_norm": 1.4765625, "learning_rate": 0.0004948965400716857, "loss": 6.5934, "mean_token_accuracy": 0.12155032604932785, "num_tokens": 15762355.0, "step": 7280 }, { "entropy": 6.6959075927734375, "epoch": 0.7796029750120391, "grad_norm": 1.3828125, "learning_rate": 0.000494888439940431, "loss": 6.5948, "mean_token_accuracy": 0.12169316858053207, "num_tokens": 15772952.0, "step": 7285 }, { "entropy": 6.562328147888183, "epoch": 0.7801380491198031, "grad_norm": 1.5703125, "learning_rate": 0.0004948803334599286, "loss": 6.4051, "mean_token_accuracy": 0.13314662128686905, "num_tokens": 15782997.0, "step": 7290 }, { "entropy": 6.598123836517334, "epoch": 0.780673123227567, "grad_norm": 1.6875, "learning_rate": 0.0004948722206304123, "loss": 6.5065, "mean_token_accuracy": 0.12343615815043449, "num_tokens": 15794060.0, "step": 7295 }, { "entropy": 6.707820177078247, "epoch": 0.781208197335331, "grad_norm": 1.1953125, "learning_rate": 0.0004948641014521167, "loss": 6.5704, "mean_token_accuracy": 0.12031665593385696, "num_tokens": 15804149.0, "step": 7300 }, { "entropy": 6.668608617782593, "epoch": 0.7817432714430949, "grad_norm": 1.40625, "learning_rate": 0.000494855975925276, "loss": 6.496, "mean_token_accuracy": 0.12902145832777023, "num_tokens": 15814643.0, "step": 7305 }, { "entropy": 6.645229959487915, "epoch": 0.7822783455508588, "grad_norm": 1.4921875, "learning_rate": 0.0004948478440501249, "loss": 6.4438, "mean_token_accuracy": 0.1254532441496849, "num_tokens": 15824640.0, "step": 7310 }, { "entropy": 6.553537178039551, "epoch": 0.7828134196586227, "grad_norm": 1.40625, "learning_rate": 0.0004948397058268982, "loss": 6.4806, "mean_token_accuracy": 0.12377227991819381, "num_tokens": 15836160.0, "step": 7315 }, { "entropy": 6.6396448612213135, "epoch": 0.7833484937663866, "grad_norm": 1.453125, "learning_rate": 0.0004948315612558308, "loss": 6.5149, "mean_token_accuracy": 0.12054053619503975, "num_tokens": 15846886.0, "step": 7320 }, { "entropy": 6.6480477809906, "epoch": 0.7838835678741506, "grad_norm": 1.5859375, "learning_rate": 0.000494823410337158, "loss": 6.4443, "mean_token_accuracy": 0.13052470311522485, "num_tokens": 15857309.0, "step": 7325 }, { "entropy": 6.601436614990234, "epoch": 0.7844186419819145, "grad_norm": 1.5546875, "learning_rate": 0.0004948152530711153, "loss": 6.5795, "mean_token_accuracy": 0.12191757187247276, "num_tokens": 15869620.0, "step": 7330 }, { "entropy": 6.614558506011963, "epoch": 0.7849537160896785, "grad_norm": 1.359375, "learning_rate": 0.0004948070894579378, "loss": 6.4211, "mean_token_accuracy": 0.129998816549778, "num_tokens": 15880915.0, "step": 7335 }, { "entropy": 6.605517482757568, "epoch": 0.7854887901974423, "grad_norm": 1.296875, "learning_rate": 0.0004947989194978616, "loss": 6.495, "mean_token_accuracy": 0.1268579512834549, "num_tokens": 15891150.0, "step": 7340 }, { "entropy": 6.656474876403808, "epoch": 0.7860238643052063, "grad_norm": 1.2265625, "learning_rate": 0.0004947907431911225, "loss": 6.4923, "mean_token_accuracy": 0.12626128271222115, "num_tokens": 15902526.0, "step": 7345 }, { "entropy": 6.591264724731445, "epoch": 0.7865589384129702, "grad_norm": 1.53125, "learning_rate": 0.0004947825605379566, "loss": 6.4372, "mean_token_accuracy": 0.12627596408128738, "num_tokens": 15913425.0, "step": 7350 }, { "entropy": 6.613666772842407, "epoch": 0.7870940125207341, "grad_norm": 1.3125, "learning_rate": 0.0004947743715386, "loss": 6.4193, "mean_token_accuracy": 0.12343008667230607, "num_tokens": 15924324.0, "step": 7355 }, { "entropy": 6.57948784828186, "epoch": 0.7876290866284981, "grad_norm": 1.6640625, "learning_rate": 0.0004947661761932894, "loss": 6.4727, "mean_token_accuracy": 0.12277128249406814, "num_tokens": 15935533.0, "step": 7360 }, { "entropy": 6.5657641887664795, "epoch": 0.7881641607362619, "grad_norm": 1.3203125, "learning_rate": 0.0004947579745022613, "loss": 6.4295, "mean_token_accuracy": 0.12148091346025466, "num_tokens": 15947007.0, "step": 7365 }, { "entropy": 6.581766366958618, "epoch": 0.7886992348440259, "grad_norm": 1.421875, "learning_rate": 0.0004947497664657527, "loss": 6.4862, "mean_token_accuracy": 0.12112942487001419, "num_tokens": 15957405.0, "step": 7370 }, { "entropy": 6.61507477760315, "epoch": 0.7892343089517898, "grad_norm": 1.296875, "learning_rate": 0.0004947415520840003, "loss": 6.4761, "mean_token_accuracy": 0.12532250955700874, "num_tokens": 15969895.0, "step": 7375 }, { "entropy": 6.637605905532837, "epoch": 0.7897693830595538, "grad_norm": 1.4921875, "learning_rate": 0.0004947333313572416, "loss": 6.3931, "mean_token_accuracy": 0.13630961254239082, "num_tokens": 15979854.0, "step": 7380 }, { "entropy": 6.567370319366455, "epoch": 0.7903044571673177, "grad_norm": 1.390625, "learning_rate": 0.0004947251042857137, "loss": 6.3963, "mean_token_accuracy": 0.13095270618796348, "num_tokens": 15991341.0, "step": 7385 }, { "entropy": 6.531961727142334, "epoch": 0.7908395312750816, "grad_norm": 1.640625, "learning_rate": 0.0004947168708696544, "loss": 6.4554, "mean_token_accuracy": 0.12993446215987206, "num_tokens": 16001944.0, "step": 7390 }, { "entropy": 6.560093545913697, "epoch": 0.7913746053828455, "grad_norm": 1.2734375, "learning_rate": 0.0004947086311093013, "loss": 6.4423, "mean_token_accuracy": 0.1281399607658386, "num_tokens": 16011771.0, "step": 7395 }, { "entropy": 6.687586164474487, "epoch": 0.7919096794906094, "grad_norm": 1.3046875, "learning_rate": 0.0004947003850048924, "loss": 6.6005, "mean_token_accuracy": 0.11408599764108658, "num_tokens": 16023901.0, "step": 7400 }, { "entropy": 6.740469646453858, "epoch": 0.7924447535983734, "grad_norm": 1.4296875, "learning_rate": 0.0004946921325566656, "loss": 6.5191, "mean_token_accuracy": 0.1196585789322853, "num_tokens": 16035014.0, "step": 7405 }, { "entropy": 6.650988531112671, "epoch": 0.7929798277061373, "grad_norm": 1.2109375, "learning_rate": 0.0004946838737648595, "loss": 6.5891, "mean_token_accuracy": 0.11678230240941048, "num_tokens": 16046927.0, "step": 7410 }, { "entropy": 6.613309526443482, "epoch": 0.7935149018139013, "grad_norm": 1.296875, "learning_rate": 0.0004946756086297124, "loss": 6.4909, "mean_token_accuracy": 0.12795686945319176, "num_tokens": 16057341.0, "step": 7415 }, { "entropy": 6.654987621307373, "epoch": 0.7940499759216652, "grad_norm": 1.5078125, "learning_rate": 0.0004946673371514628, "loss": 6.4782, "mean_token_accuracy": 0.12236208170652389, "num_tokens": 16068408.0, "step": 7420 }, { "entropy": 6.5727095127105715, "epoch": 0.794585050029429, "grad_norm": 1.6875, "learning_rate": 0.0004946590593303499, "loss": 6.4494, "mean_token_accuracy": 0.1296915277838707, "num_tokens": 16078693.0, "step": 7425 }, { "entropy": 6.60039119720459, "epoch": 0.795120124137193, "grad_norm": 1.3203125, "learning_rate": 0.0004946507751666124, "loss": 6.4975, "mean_token_accuracy": 0.1274369865655899, "num_tokens": 16089127.0, "step": 7430 }, { "entropy": 6.586338949203491, "epoch": 0.7956551982449569, "grad_norm": 1.5078125, "learning_rate": 0.0004946424846604897, "loss": 6.4071, "mean_token_accuracy": 0.13582724407315255, "num_tokens": 16099726.0, "step": 7435 }, { "entropy": 6.615121269226075, "epoch": 0.7961902723527209, "grad_norm": 1.234375, "learning_rate": 0.0004946341878122212, "loss": 6.4573, "mean_token_accuracy": 0.12698574587702752, "num_tokens": 16111017.0, "step": 7440 }, { "entropy": 6.624665117263794, "epoch": 0.7967253464604848, "grad_norm": 1.484375, "learning_rate": 0.0004946258846220462, "loss": 6.5288, "mean_token_accuracy": 0.12629680335521698, "num_tokens": 16121406.0, "step": 7445 }, { "entropy": 6.636161994934082, "epoch": 0.7972604205682488, "grad_norm": 1.875, "learning_rate": 0.0004946175750902049, "loss": 6.4516, "mean_token_accuracy": 0.12538782581686975, "num_tokens": 16131587.0, "step": 7450 }, { "entropy": 6.5716126441955565, "epoch": 0.7977954946760126, "grad_norm": 2.0625, "learning_rate": 0.0004946092592169368, "loss": 6.4116, "mean_token_accuracy": 0.12958415150642394, "num_tokens": 16142578.0, "step": 7455 }, { "entropy": 6.619257640838623, "epoch": 0.7983305687837765, "grad_norm": 1.4921875, "learning_rate": 0.0004946009370024822, "loss": 6.426, "mean_token_accuracy": 0.1310078866779804, "num_tokens": 16153501.0, "step": 7460 }, { "entropy": 6.572661924362182, "epoch": 0.7988656428915405, "grad_norm": 1.890625, "learning_rate": 0.0004945926084470814, "loss": 6.5052, "mean_token_accuracy": 0.12284256890416145, "num_tokens": 16164273.0, "step": 7465 }, { "entropy": 6.610775899887085, "epoch": 0.7994007169993044, "grad_norm": 1.3046875, "learning_rate": 0.0004945842735509749, "loss": 6.4856, "mean_token_accuracy": 0.12552264481782913, "num_tokens": 16175071.0, "step": 7470 }, { "entropy": 6.680575323104859, "epoch": 0.7999357911070684, "grad_norm": 1.2421875, "learning_rate": 0.0004945759323144034, "loss": 6.5288, "mean_token_accuracy": 0.11573776230216026, "num_tokens": 16185404.0, "step": 7475 }, { "entropy": 6.629665231704712, "epoch": 0.8004708652148322, "grad_norm": 1.4609375, "learning_rate": 0.0004945675847376077, "loss": 6.5139, "mean_token_accuracy": 0.12014818266034126, "num_tokens": 16196881.0, "step": 7480 }, { "entropy": 6.639012718200684, "epoch": 0.8010059393225962, "grad_norm": 1.2734375, "learning_rate": 0.0004945592308208288, "loss": 6.5439, "mean_token_accuracy": 0.12018415406346321, "num_tokens": 16207534.0, "step": 7485 }, { "entropy": 6.646149730682373, "epoch": 0.8015410134303601, "grad_norm": 1.1875, "learning_rate": 0.000494550870564308, "loss": 6.4188, "mean_token_accuracy": 0.13105716928839684, "num_tokens": 16217371.0, "step": 7490 }, { "entropy": 6.6225439548492435, "epoch": 0.802076087538124, "grad_norm": 1.484375, "learning_rate": 0.0004945425039682866, "loss": 6.467, "mean_token_accuracy": 0.1279752753674984, "num_tokens": 16227898.0, "step": 7495 }, { "entropy": 6.564583015441895, "epoch": 0.802611161645888, "grad_norm": 1.4921875, "learning_rate": 0.0004945341310330064, "loss": 6.4619, "mean_token_accuracy": 0.1270508736371994, "num_tokens": 16238966.0, "step": 7500 }, { "entropy": 6.590152359008789, "epoch": 0.8031462357536518, "grad_norm": 1.7890625, "learning_rate": 0.0004945257517587089, "loss": 6.4931, "mean_token_accuracy": 0.12701256275177003, "num_tokens": 16250129.0, "step": 7505 }, { "entropy": 6.5930369853973385, "epoch": 0.8036813098614158, "grad_norm": 1.2421875, "learning_rate": 0.0004945173661456361, "loss": 6.5149, "mean_token_accuracy": 0.12291709631681443, "num_tokens": 16260877.0, "step": 7510 }, { "entropy": 6.699715852737427, "epoch": 0.8042163839691797, "grad_norm": 1.1640625, "learning_rate": 0.0004945089741940303, "loss": 6.472, "mean_token_accuracy": 0.12913578376173973, "num_tokens": 16270548.0, "step": 7515 }, { "entropy": 6.676292562484742, "epoch": 0.8047514580769437, "grad_norm": 1.2734375, "learning_rate": 0.0004945005759041338, "loss": 6.497, "mean_token_accuracy": 0.12249005734920501, "num_tokens": 16281014.0, "step": 7520 }, { "entropy": 6.624485683441162, "epoch": 0.8052865321847076, "grad_norm": 1.2421875, "learning_rate": 0.0004944921712761889, "loss": 6.5405, "mean_token_accuracy": 0.12573966085910798, "num_tokens": 16291653.0, "step": 7525 }, { "entropy": 6.5947753429412845, "epoch": 0.8058216062924715, "grad_norm": 1.28125, "learning_rate": 0.0004944837603104383, "loss": 6.3863, "mean_token_accuracy": 0.13147774934768677, "num_tokens": 16301703.0, "step": 7530 }, { "entropy": 6.560491371154785, "epoch": 0.8063566804002354, "grad_norm": 1.4453125, "learning_rate": 0.0004944753430071252, "loss": 6.4576, "mean_token_accuracy": 0.12715979367494584, "num_tokens": 16312252.0, "step": 7535 }, { "entropy": 6.584918880462647, "epoch": 0.8068917545079993, "grad_norm": 1.375, "learning_rate": 0.0004944669193664923, "loss": 6.4331, "mean_token_accuracy": 0.12487595155835152, "num_tokens": 16324073.0, "step": 7540 }, { "entropy": 6.6717156887054445, "epoch": 0.8074268286157633, "grad_norm": 1.25, "learning_rate": 0.0004944584893887829, "loss": 6.4445, "mean_token_accuracy": 0.12484904229640961, "num_tokens": 16334637.0, "step": 7545 }, { "entropy": 6.605461120605469, "epoch": 0.8079619027235272, "grad_norm": 1.34375, "learning_rate": 0.0004944500530742404, "loss": 6.5743, "mean_token_accuracy": 0.11794036030769348, "num_tokens": 16345581.0, "step": 7550 }, { "entropy": 6.6252374172210695, "epoch": 0.8084969768312912, "grad_norm": 1.453125, "learning_rate": 0.0004944416104231086, "loss": 6.5663, "mean_token_accuracy": 0.1216730572283268, "num_tokens": 16356995.0, "step": 7555 }, { "entropy": 6.688077592849732, "epoch": 0.8090320509390551, "grad_norm": 1.3046875, "learning_rate": 0.0004944331614356311, "loss": 6.5093, "mean_token_accuracy": 0.11890427842736244, "num_tokens": 16368841.0, "step": 7560 }, { "entropy": 6.692157506942749, "epoch": 0.8095671250468189, "grad_norm": 1.2578125, "learning_rate": 0.0004944247061120519, "loss": 6.4279, "mean_token_accuracy": 0.12462588772177696, "num_tokens": 16379295.0, "step": 7565 }, { "entropy": 6.576985025405884, "epoch": 0.8101021991545829, "grad_norm": 1.6953125, "learning_rate": 0.0004944162444526151, "loss": 6.4721, "mean_token_accuracy": 0.13099455311894417, "num_tokens": 16389512.0, "step": 7570 }, { "entropy": 6.476492547988892, "epoch": 0.8106372732623468, "grad_norm": 1.1796875, "learning_rate": 0.0004944077764575651, "loss": 6.3894, "mean_token_accuracy": 0.13501969650387763, "num_tokens": 16400720.0, "step": 7575 }, { "entropy": 6.580502033233643, "epoch": 0.8111723473701108, "grad_norm": 1.7890625, "learning_rate": 0.0004943993021271463, "loss": 6.4658, "mean_token_accuracy": 0.12537092193961144, "num_tokens": 16411278.0, "step": 7580 }, { "entropy": 6.67013144493103, "epoch": 0.8117074214778747, "grad_norm": 1.28125, "learning_rate": 0.0004943908214616035, "loss": 6.5088, "mean_token_accuracy": 0.12090714648365974, "num_tokens": 16421665.0, "step": 7585 }, { "entropy": 6.671138763427734, "epoch": 0.8122424955856387, "grad_norm": 1.25, "learning_rate": 0.0004943823344611818, "loss": 6.5485, "mean_token_accuracy": 0.11637551337480545, "num_tokens": 16432943.0, "step": 7590 }, { "entropy": 6.666892385482788, "epoch": 0.8127775696934025, "grad_norm": 1.421875, "learning_rate": 0.0004943738411261258, "loss": 6.451, "mean_token_accuracy": 0.12569426372647285, "num_tokens": 16444506.0, "step": 7595 }, { "entropy": 6.5838854789733885, "epoch": 0.8133126438011664, "grad_norm": 2.578125, "learning_rate": 0.0004943653414566809, "loss": 6.4841, "mean_token_accuracy": 0.12255563437938691, "num_tokens": 16455403.0, "step": 7600 }, { "entropy": 6.685585021972656, "epoch": 0.8138477179089304, "grad_norm": 1.7421875, "learning_rate": 0.0004943568354530927, "loss": 6.5825, "mean_token_accuracy": 0.11601466611027718, "num_tokens": 16465616.0, "step": 7605 }, { "entropy": 6.6593701362609865, "epoch": 0.8143827920166943, "grad_norm": 1.2890625, "learning_rate": 0.0004943483231156068, "loss": 6.5438, "mean_token_accuracy": 0.12109178379178047, "num_tokens": 16476850.0, "step": 7610 }, { "entropy": 6.668148422241211, "epoch": 0.8149178661244583, "grad_norm": 1.21875, "learning_rate": 0.0004943398044444687, "loss": 6.4975, "mean_token_accuracy": 0.1246594287455082, "num_tokens": 16489118.0, "step": 7615 }, { "entropy": 6.676653909683227, "epoch": 0.8154529402322221, "grad_norm": 1.3984375, "learning_rate": 0.0004943312794399246, "loss": 6.4363, "mean_token_accuracy": 0.12908004522323607, "num_tokens": 16499336.0, "step": 7620 }, { "entropy": 6.601690435409546, "epoch": 0.8159880143399861, "grad_norm": 1.875, "learning_rate": 0.0004943227481022207, "loss": 6.5219, "mean_token_accuracy": 0.11842733025550842, "num_tokens": 16510158.0, "step": 7625 }, { "entropy": 6.564496660232544, "epoch": 0.81652308844775, "grad_norm": 1.453125, "learning_rate": 0.0004943142104316033, "loss": 6.4621, "mean_token_accuracy": 0.12559000104665757, "num_tokens": 16521080.0, "step": 7630 }, { "entropy": 6.656149530410767, "epoch": 0.8170581625555139, "grad_norm": 1.296875, "learning_rate": 0.0004943056664283189, "loss": 6.4704, "mean_token_accuracy": 0.12910144105553628, "num_tokens": 16531072.0, "step": 7635 }, { "entropy": 6.6499816417694095, "epoch": 0.8175932366632779, "grad_norm": 1.359375, "learning_rate": 0.000494297116092614, "loss": 6.5586, "mean_token_accuracy": 0.11900619938969612, "num_tokens": 16542588.0, "step": 7640 }, { "entropy": 6.663675832748413, "epoch": 0.8181283107710418, "grad_norm": 1.609375, "learning_rate": 0.0004942885594247359, "loss": 6.4237, "mean_token_accuracy": 0.12086946368217469, "num_tokens": 16553466.0, "step": 7645 }, { "entropy": 6.618226099014282, "epoch": 0.8186633848788057, "grad_norm": 1.40625, "learning_rate": 0.0004942799964249314, "loss": 6.4553, "mean_token_accuracy": 0.1253214955329895, "num_tokens": 16564084.0, "step": 7650 }, { "entropy": 6.56568751335144, "epoch": 0.8191984589865696, "grad_norm": 1.3828125, "learning_rate": 0.0004942714270934479, "loss": 6.4666, "mean_token_accuracy": 0.13621146976947784, "num_tokens": 16575665.0, "step": 7655 }, { "entropy": 6.610156917572022, "epoch": 0.8197335330943336, "grad_norm": 1.2734375, "learning_rate": 0.0004942628514305326, "loss": 6.4752, "mean_token_accuracy": 0.12168620154261589, "num_tokens": 16586518.0, "step": 7660 }, { "entropy": 6.63839054107666, "epoch": 0.8202686072020975, "grad_norm": 1.2734375, "learning_rate": 0.0004942542694364333, "loss": 6.4753, "mean_token_accuracy": 0.12710672691464425, "num_tokens": 16597345.0, "step": 7665 }, { "entropy": 6.6390495777130125, "epoch": 0.8208036813098614, "grad_norm": 1.9609375, "learning_rate": 0.0004942456811113978, "loss": 6.4888, "mean_token_accuracy": 0.12848000451922417, "num_tokens": 16609586.0, "step": 7670 }, { "entropy": 6.635290050506592, "epoch": 0.8213387554176254, "grad_norm": 1.3125, "learning_rate": 0.0004942370864556741, "loss": 6.3679, "mean_token_accuracy": 0.13500959426164627, "num_tokens": 16620165.0, "step": 7675 }, { "entropy": 6.571346569061279, "epoch": 0.8218738295253892, "grad_norm": 1.640625, "learning_rate": 0.0004942284854695104, "loss": 6.4753, "mean_token_accuracy": 0.12547776997089385, "num_tokens": 16631200.0, "step": 7680 }, { "entropy": 6.609015321731567, "epoch": 0.8224089036331532, "grad_norm": 1.3125, "learning_rate": 0.0004942198781531549, "loss": 6.5048, "mean_token_accuracy": 0.1238760806620121, "num_tokens": 16642553.0, "step": 7685 }, { "entropy": 6.665633964538574, "epoch": 0.8229439777409171, "grad_norm": 1.2265625, "learning_rate": 0.0004942112645068561, "loss": 6.5156, "mean_token_accuracy": 0.12217526063323021, "num_tokens": 16653431.0, "step": 7690 }, { "entropy": 6.571784734725952, "epoch": 0.8234790518486811, "grad_norm": 1.2265625, "learning_rate": 0.000494202644530863, "loss": 6.4593, "mean_token_accuracy": 0.12343985810875893, "num_tokens": 16664880.0, "step": 7695 }, { "entropy": 6.5380603790283205, "epoch": 0.824014125956445, "grad_norm": 1.4921875, "learning_rate": 0.0004941940182254244, "loss": 6.4767, "mean_token_accuracy": 0.12872528284788132, "num_tokens": 16676224.0, "step": 7700 }, { "entropy": 6.582237911224365, "epoch": 0.8245492000642088, "grad_norm": 1.4296875, "learning_rate": 0.0004941853855907892, "loss": 6.5396, "mean_token_accuracy": 0.12095732614398003, "num_tokens": 16687732.0, "step": 7705 }, { "entropy": 6.682282161712647, "epoch": 0.8250842741719728, "grad_norm": 1.3671875, "learning_rate": 0.0004941767466272068, "loss": 6.4688, "mean_token_accuracy": 0.129934361577034, "num_tokens": 16698257.0, "step": 7710 }, { "entropy": 6.666169214248657, "epoch": 0.8256193482797367, "grad_norm": 1.1796875, "learning_rate": 0.0004941681013349267, "loss": 6.4383, "mean_token_accuracy": 0.12359966635704041, "num_tokens": 16708860.0, "step": 7715 }, { "entropy": 6.602855110168457, "epoch": 0.8261544223875007, "grad_norm": 1.34375, "learning_rate": 0.0004941594497141985, "loss": 6.438, "mean_token_accuracy": 0.12608251199126244, "num_tokens": 16719987.0, "step": 7720 }, { "entropy": 6.643445825576782, "epoch": 0.8266894964952646, "grad_norm": 1.4609375, "learning_rate": 0.0004941507917652718, "loss": 6.5341, "mean_token_accuracy": 0.11999792009592056, "num_tokens": 16730861.0, "step": 7725 }, { "entropy": 6.553995418548584, "epoch": 0.8272245706030286, "grad_norm": 1.5546875, "learning_rate": 0.0004941421274883969, "loss": 6.383, "mean_token_accuracy": 0.13347533941268921, "num_tokens": 16740968.0, "step": 7730 }, { "entropy": 6.578843641281128, "epoch": 0.8277596447107924, "grad_norm": 1.234375, "learning_rate": 0.000494133456883824, "loss": 6.4878, "mean_token_accuracy": 0.12768243104219437, "num_tokens": 16750700.0, "step": 7735 }, { "entropy": 6.617146635055542, "epoch": 0.8282947188185563, "grad_norm": 1.4609375, "learning_rate": 0.0004941247799518031, "loss": 6.476, "mean_token_accuracy": 0.12326866835355758, "num_tokens": 16760719.0, "step": 7740 }, { "entropy": 6.594090604782105, "epoch": 0.8288297929263203, "grad_norm": 1.234375, "learning_rate": 0.0004941160966925851, "loss": 6.3544, "mean_token_accuracy": 0.1272714115679264, "num_tokens": 16771331.0, "step": 7745 }, { "entropy": 6.494041490554809, "epoch": 0.8293648670340842, "grad_norm": 1.2734375, "learning_rate": 0.0004941074071064205, "loss": 6.4433, "mean_token_accuracy": 0.12712007239460946, "num_tokens": 16781306.0, "step": 7750 }, { "entropy": 6.638606166839599, "epoch": 0.8298999411418482, "grad_norm": 1.4921875, "learning_rate": 0.0004940987111935605, "loss": 6.4686, "mean_token_accuracy": 0.12214233577251435, "num_tokens": 16793013.0, "step": 7755 }, { "entropy": 6.612168407440185, "epoch": 0.830435015249612, "grad_norm": 1.2109375, "learning_rate": 0.0004940900089542558, "loss": 6.4737, "mean_token_accuracy": 0.12796134501695633, "num_tokens": 16803987.0, "step": 7760 }, { "entropy": 6.5910180568695065, "epoch": 0.830970089357376, "grad_norm": 1.2734375, "learning_rate": 0.000494081300388758, "loss": 6.4697, "mean_token_accuracy": 0.11712961420416831, "num_tokens": 16815031.0, "step": 7765 }, { "entropy": 6.678561735153198, "epoch": 0.8315051634651399, "grad_norm": 1.265625, "learning_rate": 0.0004940725854973184, "loss": 6.5281, "mean_token_accuracy": 0.12335440516471863, "num_tokens": 16826313.0, "step": 7770 }, { "entropy": 6.646420955657959, "epoch": 0.8320402375729038, "grad_norm": 1.2109375, "learning_rate": 0.0004940638642801886, "loss": 6.5086, "mean_token_accuracy": 0.12422936633229256, "num_tokens": 16838470.0, "step": 7775 }, { "entropy": 6.546121120452881, "epoch": 0.8325753116806678, "grad_norm": 1.5078125, "learning_rate": 0.0004940551367376205, "loss": 6.4028, "mean_token_accuracy": 0.12903384640812873, "num_tokens": 16849266.0, "step": 7780 }, { "entropy": 6.566736698150635, "epoch": 0.8331103857884317, "grad_norm": 1.28125, "learning_rate": 0.0004940464028698662, "loss": 6.5309, "mean_token_accuracy": 0.12425655499100685, "num_tokens": 16860720.0, "step": 7785 }, { "entropy": 6.63223614692688, "epoch": 0.8336454598961957, "grad_norm": 1.34375, "learning_rate": 0.0004940376626771779, "loss": 6.4921, "mean_token_accuracy": 0.12509471029043198, "num_tokens": 16872004.0, "step": 7790 }, { "entropy": 6.648682880401611, "epoch": 0.8341805340039595, "grad_norm": 1.9453125, "learning_rate": 0.0004940289161598076, "loss": 6.5292, "mean_token_accuracy": 0.1173703834414482, "num_tokens": 16882898.0, "step": 7795 }, { "entropy": 6.628533267974854, "epoch": 0.8347156081117235, "grad_norm": 1.515625, "learning_rate": 0.0004940201633180084, "loss": 6.4511, "mean_token_accuracy": 0.11566249057650566, "num_tokens": 16894331.0, "step": 7800 }, { "entropy": 6.6906242847442625, "epoch": 0.8352506822194874, "grad_norm": 1.1953125, "learning_rate": 0.0004940114041520326, "loss": 6.5387, "mean_token_accuracy": 0.1246345192193985, "num_tokens": 16903656.0, "step": 7805 }, { "entropy": 6.581471395492554, "epoch": 0.8357857563272513, "grad_norm": 1.1953125, "learning_rate": 0.0004940026386621333, "loss": 6.5019, "mean_token_accuracy": 0.12531133443117143, "num_tokens": 16915878.0, "step": 7810 }, { "entropy": 6.6755578994750975, "epoch": 0.8363208304350153, "grad_norm": 1.4453125, "learning_rate": 0.0004939938668485636, "loss": 6.5432, "mean_token_accuracy": 0.1215199887752533, "num_tokens": 16926577.0, "step": 7815 }, { "entropy": 6.565039253234863, "epoch": 0.8368559045427791, "grad_norm": 1.3359375, "learning_rate": 0.0004939850887115768, "loss": 6.4234, "mean_token_accuracy": 0.1319645993411541, "num_tokens": 16938012.0, "step": 7820 }, { "entropy": 6.569745969772339, "epoch": 0.8373909786505431, "grad_norm": 1.3828125, "learning_rate": 0.0004939763042514263, "loss": 6.4132, "mean_token_accuracy": 0.12320912629365921, "num_tokens": 16949007.0, "step": 7825 }, { "entropy": 6.491839742660522, "epoch": 0.837926052758307, "grad_norm": 1.2578125, "learning_rate": 0.0004939675134683658, "loss": 6.3726, "mean_token_accuracy": 0.13265551403164863, "num_tokens": 16959425.0, "step": 7830 }, { "entropy": 6.643397045135498, "epoch": 0.838461126866071, "grad_norm": 1.4765625, "learning_rate": 0.0004939587163626491, "loss": 6.4972, "mean_token_accuracy": 0.11856562122702599, "num_tokens": 16970002.0, "step": 7835 }, { "entropy": 6.622504758834839, "epoch": 0.8389962009738349, "grad_norm": 1.8359375, "learning_rate": 0.0004939499129345302, "loss": 6.5261, "mean_token_accuracy": 0.12169675678014755, "num_tokens": 16980739.0, "step": 7840 }, { "entropy": 6.638087224960327, "epoch": 0.8395312750815987, "grad_norm": 1.78125, "learning_rate": 0.0004939411031842633, "loss": 6.4766, "mean_token_accuracy": 0.1255985088646412, "num_tokens": 16991643.0, "step": 7845 }, { "entropy": 6.454816770553589, "epoch": 0.8400663491893627, "grad_norm": 1.5390625, "learning_rate": 0.000493932287112103, "loss": 6.3395, "mean_token_accuracy": 0.1409579671919346, "num_tokens": 17001975.0, "step": 7850 }, { "entropy": 6.637519359588623, "epoch": 0.8406014232971266, "grad_norm": 1.34375, "learning_rate": 0.0004939234647183035, "loss": 6.4786, "mean_token_accuracy": 0.12199027836322784, "num_tokens": 17012658.0, "step": 7855 }, { "entropy": 6.653904962539673, "epoch": 0.8411364974048906, "grad_norm": 1.3359375, "learning_rate": 0.0004939146360031197, "loss": 6.4875, "mean_token_accuracy": 0.12131756246089935, "num_tokens": 17023196.0, "step": 7860 }, { "entropy": 6.606409931182862, "epoch": 0.8416715715126545, "grad_norm": 1.4140625, "learning_rate": 0.0004939058009668067, "loss": 6.5086, "mean_token_accuracy": 0.12194685339927673, "num_tokens": 17034589.0, "step": 7865 }, { "entropy": 6.642972040176391, "epoch": 0.8422066456204185, "grad_norm": 2.25, "learning_rate": 0.0004938969596096194, "loss": 6.4733, "mean_token_accuracy": 0.12159970998764039, "num_tokens": 17046139.0, "step": 7870 }, { "entropy": 6.589673328399658, "epoch": 0.8427417197281823, "grad_norm": 1.375, "learning_rate": 0.000493888111931813, "loss": 6.4945, "mean_token_accuracy": 0.12014141380786895, "num_tokens": 17056926.0, "step": 7875 }, { "entropy": 6.539459180831909, "epoch": 0.8432767938359462, "grad_norm": 3.125, "learning_rate": 0.0004938792579336433, "loss": 6.4375, "mean_token_accuracy": 0.12531604021787643, "num_tokens": 17067339.0, "step": 7880 }, { "entropy": 6.603718090057373, "epoch": 0.8438118679437102, "grad_norm": 2.140625, "learning_rate": 0.0004938703976153657, "loss": 6.4518, "mean_token_accuracy": 0.1254698507487774, "num_tokens": 17078037.0, "step": 7885 }, { "entropy": 6.632722282409668, "epoch": 0.8443469420514741, "grad_norm": 1.2890625, "learning_rate": 0.0004938615309772362, "loss": 6.4862, "mean_token_accuracy": 0.11615241914987565, "num_tokens": 17089069.0, "step": 7890 }, { "entropy": 6.616069984436035, "epoch": 0.8448820161592381, "grad_norm": 1.2578125, "learning_rate": 0.0004938526580195107, "loss": 6.4657, "mean_token_accuracy": 0.12840015292167664, "num_tokens": 17100006.0, "step": 7895 }, { "entropy": 6.608232641220093, "epoch": 0.845417090267002, "grad_norm": 1.34375, "learning_rate": 0.0004938437787424454, "loss": 6.501, "mean_token_accuracy": 0.12470883950591087, "num_tokens": 17111896.0, "step": 7900 }, { "entropy": 6.601596450805664, "epoch": 0.845952164374766, "grad_norm": 1.9609375, "learning_rate": 0.0004938348931462969, "loss": 6.5061, "mean_token_accuracy": 0.1278610810637474, "num_tokens": 17123202.0, "step": 7905 }, { "entropy": 6.600058317184448, "epoch": 0.8464872384825298, "grad_norm": 1.4375, "learning_rate": 0.0004938260012313215, "loss": 6.4451, "mean_token_accuracy": 0.12930461540818214, "num_tokens": 17134013.0, "step": 7910 }, { "entropy": 6.536851596832276, "epoch": 0.8470223125902937, "grad_norm": 1.890625, "learning_rate": 0.0004938171029977761, "loss": 6.4564, "mean_token_accuracy": 0.12916264310479164, "num_tokens": 17144041.0, "step": 7915 }, { "entropy": 6.553992843627929, "epoch": 0.8475573866980577, "grad_norm": 1.4375, "learning_rate": 0.0004938081984459176, "loss": 6.4397, "mean_token_accuracy": 0.12721440196037292, "num_tokens": 17155334.0, "step": 7920 }, { "entropy": 6.6116251945495605, "epoch": 0.8480924608058216, "grad_norm": 1.6171875, "learning_rate": 0.000493799287576003, "loss": 6.3996, "mean_token_accuracy": 0.12881384789943695, "num_tokens": 17166243.0, "step": 7925 }, { "entropy": 6.599978303909301, "epoch": 0.8486275349135856, "grad_norm": 1.421875, "learning_rate": 0.0004937903703882898, "loss": 6.4664, "mean_token_accuracy": 0.12380218654870986, "num_tokens": 17177709.0, "step": 7930 }, { "entropy": 6.550316333770752, "epoch": 0.8491626090213494, "grad_norm": 1.28125, "learning_rate": 0.0004937814468830353, "loss": 6.4306, "mean_token_accuracy": 0.12615659311413766, "num_tokens": 17188275.0, "step": 7935 }, { "entropy": 6.639209222793579, "epoch": 0.8496976831291134, "grad_norm": 1.2890625, "learning_rate": 0.0004937725170604975, "loss": 6.5549, "mean_token_accuracy": 0.12421398386359214, "num_tokens": 17199527.0, "step": 7940 }, { "entropy": 6.658242416381836, "epoch": 0.8502327572368773, "grad_norm": 1.4453125, "learning_rate": 0.0004937635809209339, "loss": 6.4738, "mean_token_accuracy": 0.12579896971583365, "num_tokens": 17209500.0, "step": 7945 }, { "entropy": 6.567161989212036, "epoch": 0.8507678313446412, "grad_norm": 1.828125, "learning_rate": 0.0004937546384646027, "loss": 6.4189, "mean_token_accuracy": 0.1228828877210617, "num_tokens": 17219589.0, "step": 7950 }, { "entropy": 6.668274545669556, "epoch": 0.8513029054524052, "grad_norm": 1.8125, "learning_rate": 0.0004937456896917619, "loss": 6.4642, "mean_token_accuracy": 0.1268440864980221, "num_tokens": 17230508.0, "step": 7955 }, { "entropy": 6.628099966049194, "epoch": 0.851837979560169, "grad_norm": 1.328125, "learning_rate": 0.0004937367346026702, "loss": 6.4648, "mean_token_accuracy": 0.12629646956920623, "num_tokens": 17240886.0, "step": 7960 }, { "entropy": 6.5766232967376705, "epoch": 0.852373053667933, "grad_norm": 1.5078125, "learning_rate": 0.0004937277731975858, "loss": 6.4924, "mean_token_accuracy": 0.12928350567817687, "num_tokens": 17252247.0, "step": 7965 }, { "entropy": 6.573000049591064, "epoch": 0.8529081277756969, "grad_norm": 1.71875, "learning_rate": 0.0004937188054767679, "loss": 6.4584, "mean_token_accuracy": 0.12772766575217248, "num_tokens": 17262845.0, "step": 7970 }, { "entropy": 6.6421280860900875, "epoch": 0.8534432018834609, "grad_norm": 1.578125, "learning_rate": 0.0004937098314404751, "loss": 6.4562, "mean_token_accuracy": 0.12444490268826484, "num_tokens": 17274247.0, "step": 7975 }, { "entropy": 6.644790935516357, "epoch": 0.8539782759912248, "grad_norm": 1.40625, "learning_rate": 0.0004937008510889668, "loss": 6.4871, "mean_token_accuracy": 0.12767765745520593, "num_tokens": 17285471.0, "step": 7980 }, { "entropy": 6.589143466949463, "epoch": 0.8545133500989887, "grad_norm": 1.4453125, "learning_rate": 0.0004936918644225021, "loss": 6.5025, "mean_token_accuracy": 0.12948852255940438, "num_tokens": 17296243.0, "step": 7985 }, { "entropy": 6.579883146286011, "epoch": 0.8550484242067526, "grad_norm": 1.3828125, "learning_rate": 0.0004936828714413405, "loss": 6.4633, "mean_token_accuracy": 0.12740985825657844, "num_tokens": 17307301.0, "step": 7990 }, { "entropy": 6.545937824249267, "epoch": 0.8555834983145165, "grad_norm": 1.5078125, "learning_rate": 0.0004936738721457417, "loss": 6.3969, "mean_token_accuracy": 0.13528102710843087, "num_tokens": 17318550.0, "step": 7995 }, { "entropy": 6.5888251781463625, "epoch": 0.8561185724222805, "grad_norm": 1.4609375, "learning_rate": 0.0004936648665359657, "loss": 6.4592, "mean_token_accuracy": 0.12461457923054695, "num_tokens": 17328577.0, "step": 8000 }, { "entropy": 6.586920166015625, "epoch": 0.8566536465300444, "grad_norm": 1.3984375, "learning_rate": 0.0004936558546122723, "loss": 6.5184, "mean_token_accuracy": 0.12257596775889397, "num_tokens": 17341013.0, "step": 8005 }, { "entropy": 6.589303112030029, "epoch": 0.8571887206378084, "grad_norm": 1.453125, "learning_rate": 0.0004936468363749217, "loss": 6.4655, "mean_token_accuracy": 0.12056496143341064, "num_tokens": 17351956.0, "step": 8010 }, { "entropy": 6.6829746723175045, "epoch": 0.8577237947455723, "grad_norm": 1.3515625, "learning_rate": 0.0004936378118241746, "loss": 6.4386, "mean_token_accuracy": 0.117622260004282, "num_tokens": 17363465.0, "step": 8015 }, { "entropy": 6.584981489181518, "epoch": 0.8582588688533361, "grad_norm": 1.28125, "learning_rate": 0.0004936287809602913, "loss": 6.4964, "mean_token_accuracy": 0.1258731223642826, "num_tokens": 17374458.0, "step": 8020 }, { "entropy": 6.558772945404053, "epoch": 0.8587939429611001, "grad_norm": 1.546875, "learning_rate": 0.0004936197437835329, "loss": 6.4979, "mean_token_accuracy": 0.12399565950036048, "num_tokens": 17385492.0, "step": 8025 }, { "entropy": 6.684000682830811, "epoch": 0.859329017068864, "grad_norm": 1.28125, "learning_rate": 0.0004936107002941599, "loss": 6.446, "mean_token_accuracy": 0.1296046145260334, "num_tokens": 17395640.0, "step": 8030 }, { "entropy": 6.621039772033692, "epoch": 0.859864091176628, "grad_norm": 1.296875, "learning_rate": 0.0004936016504924337, "loss": 6.4657, "mean_token_accuracy": 0.12447260543704033, "num_tokens": 17405211.0, "step": 8035 }, { "entropy": 6.572212600708008, "epoch": 0.8603991652843919, "grad_norm": 1.578125, "learning_rate": 0.0004935925943786155, "loss": 6.4385, "mean_token_accuracy": 0.12494494318962097, "num_tokens": 17415421.0, "step": 8040 }, { "entropy": 6.5851781368255615, "epoch": 0.8609342393921559, "grad_norm": 1.3203125, "learning_rate": 0.0004935835319529669, "loss": 6.4882, "mean_token_accuracy": 0.12248977199196816, "num_tokens": 17426040.0, "step": 8045 }, { "entropy": 6.55501275062561, "epoch": 0.8614693134999197, "grad_norm": 1.34375, "learning_rate": 0.0004935744632157496, "loss": 6.4693, "mean_token_accuracy": 0.12371492311358452, "num_tokens": 17436305.0, "step": 8050 }, { "entropy": 6.602463960647583, "epoch": 0.8620043876076836, "grad_norm": 1.3515625, "learning_rate": 0.0004935653881672253, "loss": 6.5244, "mean_token_accuracy": 0.12265571355819702, "num_tokens": 17446786.0, "step": 8055 }, { "entropy": 6.612880706787109, "epoch": 0.8625394617154476, "grad_norm": 1.578125, "learning_rate": 0.0004935563068076561, "loss": 6.422, "mean_token_accuracy": 0.1300605744123459, "num_tokens": 17456613.0, "step": 8060 }, { "entropy": 6.542842960357666, "epoch": 0.8630745358232115, "grad_norm": 1.46875, "learning_rate": 0.0004935472191373044, "loss": 6.3675, "mean_token_accuracy": 0.12812848910689353, "num_tokens": 17467281.0, "step": 8065 }, { "entropy": 6.56179370880127, "epoch": 0.8636096099309755, "grad_norm": 1.40625, "learning_rate": 0.0004935381251564324, "loss": 6.4896, "mean_token_accuracy": 0.12458937540650368, "num_tokens": 17478271.0, "step": 8070 }, { "entropy": 6.59501895904541, "epoch": 0.8641446840387393, "grad_norm": 1.8671875, "learning_rate": 0.0004935290248653027, "loss": 6.4665, "mean_token_accuracy": 0.12613890841603279, "num_tokens": 17489519.0, "step": 8075 }, { "entropy": 6.614124202728272, "epoch": 0.8646797581465033, "grad_norm": 1.25, "learning_rate": 0.0004935199182641781, "loss": 6.4417, "mean_token_accuracy": 0.12557547613978387, "num_tokens": 17500076.0, "step": 8080 }, { "entropy": 6.614273643493652, "epoch": 0.8652148322542672, "grad_norm": 1.53125, "learning_rate": 0.0004935108053533216, "loss": 6.4453, "mean_token_accuracy": 0.12125986739993096, "num_tokens": 17509898.0, "step": 8085 }, { "entropy": 6.550960397720337, "epoch": 0.8657499063620312, "grad_norm": 1.609375, "learning_rate": 0.0004935016861329964, "loss": 6.406, "mean_token_accuracy": 0.1296715520322323, "num_tokens": 17519890.0, "step": 8090 }, { "entropy": 6.530986309051514, "epoch": 0.8662849804697951, "grad_norm": 1.2734375, "learning_rate": 0.0004934925606034656, "loss": 6.4381, "mean_token_accuracy": 0.12463523522019386, "num_tokens": 17530927.0, "step": 8095 }, { "entropy": 6.6647419929504395, "epoch": 0.866820054577559, "grad_norm": 1.484375, "learning_rate": 0.0004934834287649928, "loss": 6.5129, "mean_token_accuracy": 0.12179197296500206, "num_tokens": 17541174.0, "step": 8100 }, { "entropy": 6.6586121082305905, "epoch": 0.8673551286853229, "grad_norm": 2.21875, "learning_rate": 0.0004934742906178417, "loss": 6.4765, "mean_token_accuracy": 0.11956845298409462, "num_tokens": 17552460.0, "step": 8105 }, { "entropy": 6.6295825958251955, "epoch": 0.8678902027930868, "grad_norm": 1.5, "learning_rate": 0.0004934651461622762, "loss": 6.483, "mean_token_accuracy": 0.12741912975907327, "num_tokens": 17563908.0, "step": 8110 }, { "entropy": 6.586279296875, "epoch": 0.8684252769008508, "grad_norm": 1.1953125, "learning_rate": 0.0004934559953985603, "loss": 6.4953, "mean_token_accuracy": 0.1282585471868515, "num_tokens": 17574314.0, "step": 8115 }, { "entropy": 6.640317058563232, "epoch": 0.8689603510086147, "grad_norm": 1.3671875, "learning_rate": 0.0004934468383269582, "loss": 6.4568, "mean_token_accuracy": 0.12750404104590415, "num_tokens": 17583719.0, "step": 8120 }, { "entropy": 6.520741510391235, "epoch": 0.8694954251163787, "grad_norm": 1.5390625, "learning_rate": 0.0004934376749477344, "loss": 6.4474, "mean_token_accuracy": 0.1261451207101345, "num_tokens": 17594522.0, "step": 8125 }, { "entropy": 6.550720930099487, "epoch": 0.8700304992241426, "grad_norm": 1.5703125, "learning_rate": 0.0004934285052611533, "loss": 6.384, "mean_token_accuracy": 0.13392736613750458, "num_tokens": 17604632.0, "step": 8130 }, { "entropy": 6.7096068382263185, "epoch": 0.8705655733319064, "grad_norm": 2.53125, "learning_rate": 0.00049341932926748, "loss": 6.5216, "mean_token_accuracy": 0.12129078730940819, "num_tokens": 17615459.0, "step": 8135 }, { "entropy": 6.650518894195557, "epoch": 0.8711006474396704, "grad_norm": 1.359375, "learning_rate": 0.0004934101469669791, "loss": 6.4636, "mean_token_accuracy": 0.1257311299443245, "num_tokens": 17625800.0, "step": 8140 }, { "entropy": 6.517386484146118, "epoch": 0.8716357215474343, "grad_norm": 1.4296875, "learning_rate": 0.0004934009583599159, "loss": 6.3112, "mean_token_accuracy": 0.13819433227181435, "num_tokens": 17637264.0, "step": 8145 }, { "entropy": 6.515216493606568, "epoch": 0.8721707956551983, "grad_norm": 1.421875, "learning_rate": 0.0004933917634465558, "loss": 6.3499, "mean_token_accuracy": 0.12682703286409377, "num_tokens": 17648256.0, "step": 8150 }, { "entropy": 6.564549684524536, "epoch": 0.8727058697629622, "grad_norm": 1.625, "learning_rate": 0.0004933825622271642, "loss": 6.4983, "mean_token_accuracy": 0.12459777966141701, "num_tokens": 17659096.0, "step": 8155 }, { "entropy": 6.629525566101075, "epoch": 0.8732409438707261, "grad_norm": 1.2578125, "learning_rate": 0.0004933733547020069, "loss": 6.4714, "mean_token_accuracy": 0.12370945960283279, "num_tokens": 17669808.0, "step": 8160 }, { "entropy": 6.615776252746582, "epoch": 0.87377601797849, "grad_norm": 1.4609375, "learning_rate": 0.0004933641408713495, "loss": 6.4171, "mean_token_accuracy": 0.12331488877534866, "num_tokens": 17680375.0, "step": 8165 }, { "entropy": 6.513298511505127, "epoch": 0.8743110920862539, "grad_norm": 1.4921875, "learning_rate": 0.0004933549207354582, "loss": 6.3829, "mean_token_accuracy": 0.13013615384697913, "num_tokens": 17690780.0, "step": 8170 }, { "entropy": 6.601052331924438, "epoch": 0.8748461661940179, "grad_norm": 2.125, "learning_rate": 0.0004933456942945994, "loss": 6.483, "mean_token_accuracy": 0.12874177172780038, "num_tokens": 17702170.0, "step": 8175 }, { "entropy": 6.5550049304962155, "epoch": 0.8753812403017818, "grad_norm": 1.9609375, "learning_rate": 0.0004933364615490393, "loss": 6.4206, "mean_token_accuracy": 0.12599021792411805, "num_tokens": 17712631.0, "step": 8180 }, { "entropy": 6.611193418502808, "epoch": 0.8759163144095458, "grad_norm": 1.4375, "learning_rate": 0.0004933272224990445, "loss": 6.5003, "mean_token_accuracy": 0.12176733165979385, "num_tokens": 17723692.0, "step": 8185 }, { "entropy": 6.6318916320800785, "epoch": 0.8764513885173096, "grad_norm": 1.5234375, "learning_rate": 0.0004933179771448819, "loss": 6.4129, "mean_token_accuracy": 0.13463898748159409, "num_tokens": 17735264.0, "step": 8190 }, { "entropy": 6.5342247009277346, "epoch": 0.8769864626250736, "grad_norm": 1.3984375, "learning_rate": 0.0004933087254868183, "loss": 6.3354, "mean_token_accuracy": 0.1375872351229191, "num_tokens": 17747060.0, "step": 8195 }, { "entropy": 6.510075902938842, "epoch": 0.8775215367328375, "grad_norm": 1.6484375, "learning_rate": 0.000493299467525121, "loss": 6.4422, "mean_token_accuracy": 0.12407493069767953, "num_tokens": 17758159.0, "step": 8200 }, { "entropy": 6.57683801651001, "epoch": 0.8780566108406014, "grad_norm": 1.265625, "learning_rate": 0.0004932902032600573, "loss": 6.4594, "mean_token_accuracy": 0.12217129170894622, "num_tokens": 17768444.0, "step": 8205 }, { "entropy": 6.646522092819214, "epoch": 0.8785916849483654, "grad_norm": 1.4296875, "learning_rate": 0.0004932809326918945, "loss": 6.3517, "mean_token_accuracy": 0.1339459776878357, "num_tokens": 17779303.0, "step": 8210 }, { "entropy": 6.622037935256958, "epoch": 0.8791267590561292, "grad_norm": 1.265625, "learning_rate": 0.0004932716558209005, "loss": 6.5405, "mean_token_accuracy": 0.11944242864847184, "num_tokens": 17789853.0, "step": 8215 }, { "entropy": 6.602828121185302, "epoch": 0.8796618331638932, "grad_norm": 1.6953125, "learning_rate": 0.0004932623726473432, "loss": 6.3894, "mean_token_accuracy": 0.1371438518166542, "num_tokens": 17799232.0, "step": 8220 }, { "entropy": 6.487914800643921, "epoch": 0.8801969072716571, "grad_norm": 1.640625, "learning_rate": 0.0004932530831714904, "loss": 6.4097, "mean_token_accuracy": 0.12824408933520318, "num_tokens": 17808870.0, "step": 8225 }, { "entropy": 6.5319726943969725, "epoch": 0.8807319813794211, "grad_norm": 1.3046875, "learning_rate": 0.0004932437873936107, "loss": 6.4906, "mean_token_accuracy": 0.11963605657219886, "num_tokens": 17819394.0, "step": 8230 }, { "entropy": 6.662888050079346, "epoch": 0.881267055487185, "grad_norm": 1.484375, "learning_rate": 0.0004932344853139721, "loss": 6.4679, "mean_token_accuracy": 0.12477930113673211, "num_tokens": 17830220.0, "step": 8235 }, { "entropy": 6.598001623153687, "epoch": 0.8818021295949489, "grad_norm": 1.5234375, "learning_rate": 0.0004932251769328436, "loss": 6.4034, "mean_token_accuracy": 0.1247767224907875, "num_tokens": 17841971.0, "step": 8240 }, { "entropy": 6.5990701675415036, "epoch": 0.8823372037027128, "grad_norm": 1.359375, "learning_rate": 0.0004932158622504937, "loss": 6.4173, "mean_token_accuracy": 0.12920651137828826, "num_tokens": 17851890.0, "step": 8245 }, { "entropy": 6.519874525070191, "epoch": 0.8828722778104767, "grad_norm": 1.421875, "learning_rate": 0.0004932065412671915, "loss": 6.4123, "mean_token_accuracy": 0.13252334222197532, "num_tokens": 17862855.0, "step": 8250 }, { "entropy": 6.629786729812622, "epoch": 0.8834073519182407, "grad_norm": 1.4921875, "learning_rate": 0.0004931972139832058, "loss": 6.4243, "mean_token_accuracy": 0.12248511165380478, "num_tokens": 17873550.0, "step": 8255 }, { "entropy": 6.638599252700805, "epoch": 0.8839424260260046, "grad_norm": 2.46875, "learning_rate": 0.0004931878803988066, "loss": 6.4432, "mean_token_accuracy": 0.13054898232221604, "num_tokens": 17884067.0, "step": 8260 }, { "entropy": 6.601341295242309, "epoch": 0.8844775001337686, "grad_norm": 1.5234375, "learning_rate": 0.0004931785405142627, "loss": 6.4715, "mean_token_accuracy": 0.12773810103535652, "num_tokens": 17894587.0, "step": 8265 }, { "entropy": 6.557901048660279, "epoch": 0.8850125742415325, "grad_norm": 1.375, "learning_rate": 0.0004931691943298443, "loss": 6.4536, "mean_token_accuracy": 0.12345588281750679, "num_tokens": 17905297.0, "step": 8270 }, { "entropy": 6.472777080535889, "epoch": 0.8855476483492963, "grad_norm": 1.3046875, "learning_rate": 0.000493159841845821, "loss": 6.3637, "mean_token_accuracy": 0.12871376648545266, "num_tokens": 17916225.0, "step": 8275 }, { "entropy": 6.641252183914185, "epoch": 0.8860827224570603, "grad_norm": 2.890625, "learning_rate": 0.0004931504830624629, "loss": 6.4114, "mean_token_accuracy": 0.12872292771935462, "num_tokens": 17925795.0, "step": 8280 }, { "entropy": 6.560930967330933, "epoch": 0.8866177965648242, "grad_norm": 1.2734375, "learning_rate": 0.0004931411179800403, "loss": 6.4212, "mean_token_accuracy": 0.12332068607211114, "num_tokens": 17936134.0, "step": 8285 }, { "entropy": 6.576021671295166, "epoch": 0.8871528706725882, "grad_norm": 1.7734375, "learning_rate": 0.0004931317465988235, "loss": 6.4877, "mean_token_accuracy": 0.12288779988884926, "num_tokens": 17946393.0, "step": 8290 }, { "entropy": 6.620288515090943, "epoch": 0.8876879447803521, "grad_norm": 1.5546875, "learning_rate": 0.0004931223689190832, "loss": 6.4979, "mean_token_accuracy": 0.12131898999214172, "num_tokens": 17957527.0, "step": 8295 }, { "entropy": 6.60401668548584, "epoch": 0.8882230188881161, "grad_norm": 1.390625, "learning_rate": 0.0004931129849410903, "loss": 6.5001, "mean_token_accuracy": 0.12653226852416993, "num_tokens": 17968390.0, "step": 8300 }, { "entropy": 6.624185705184937, "epoch": 0.8887580929958799, "grad_norm": 1.484375, "learning_rate": 0.0004931035946651154, "loss": 6.424, "mean_token_accuracy": 0.13672848865389825, "num_tokens": 17978667.0, "step": 8305 }, { "entropy": 6.649472332000732, "epoch": 0.8892931671036438, "grad_norm": 1.734375, "learning_rate": 0.0004930941980914299, "loss": 6.484, "mean_token_accuracy": 0.12073868960142135, "num_tokens": 17989008.0, "step": 8310 }, { "entropy": 6.55554428100586, "epoch": 0.8898282412114078, "grad_norm": 1.6796875, "learning_rate": 0.0004930847952203052, "loss": 6.4167, "mean_token_accuracy": 0.11992595419287681, "num_tokens": 18000199.0, "step": 8315 }, { "entropy": 6.6081115245819095, "epoch": 0.8903633153191717, "grad_norm": 2.21875, "learning_rate": 0.0004930753860520126, "loss": 6.3714, "mean_token_accuracy": 0.12737504318356513, "num_tokens": 18010941.0, "step": 8320 }, { "entropy": 6.636107873916626, "epoch": 0.8908983894269357, "grad_norm": 1.3828125, "learning_rate": 0.0004930659705868237, "loss": 6.4755, "mean_token_accuracy": 0.12668566182255744, "num_tokens": 18021519.0, "step": 8325 }, { "entropy": 6.576786231994629, "epoch": 0.8914334635346995, "grad_norm": 2.296875, "learning_rate": 0.0004930565488250108, "loss": 6.4282, "mean_token_accuracy": 0.12401631250977516, "num_tokens": 18032773.0, "step": 8330 }, { "entropy": 6.560948514938355, "epoch": 0.8919685376424635, "grad_norm": 1.625, "learning_rate": 0.0004930471207668456, "loss": 6.3931, "mean_token_accuracy": 0.1288905918598175, "num_tokens": 18043250.0, "step": 8335 }, { "entropy": 6.577342367172241, "epoch": 0.8925036117502274, "grad_norm": 1.4453125, "learning_rate": 0.0004930376864126005, "loss": 6.4045, "mean_token_accuracy": 0.13135718554258347, "num_tokens": 18055165.0, "step": 8340 }, { "entropy": 6.533294534683227, "epoch": 0.8930386858579913, "grad_norm": 1.375, "learning_rate": 0.0004930282457625476, "loss": 6.3655, "mean_token_accuracy": 0.1319275178015232, "num_tokens": 18065296.0, "step": 8345 }, { "entropy": 6.483318853378296, "epoch": 0.8935737599657553, "grad_norm": 1.734375, "learning_rate": 0.00049301879881696, "loss": 6.3713, "mean_token_accuracy": 0.12717922553420066, "num_tokens": 18075536.0, "step": 8350 }, { "entropy": 6.523620080947876, "epoch": 0.8941088340735192, "grad_norm": 1.4296875, "learning_rate": 0.0004930093455761101, "loss": 6.4792, "mean_token_accuracy": 0.1299550086259842, "num_tokens": 18086253.0, "step": 8355 }, { "entropy": 6.625021934509277, "epoch": 0.8946439081812831, "grad_norm": 2.15625, "learning_rate": 0.000492999886040271, "loss": 6.4867, "mean_token_accuracy": 0.12763941064476966, "num_tokens": 18097335.0, "step": 8360 }, { "entropy": 6.678513479232788, "epoch": 0.895178982289047, "grad_norm": 1.53125, "learning_rate": 0.0004929904202097159, "loss": 6.4165, "mean_token_accuracy": 0.1255946137011051, "num_tokens": 18107293.0, "step": 8365 }, { "entropy": 6.574617719650268, "epoch": 0.895714056396811, "grad_norm": 2.0, "learning_rate": 0.0004929809480847179, "loss": 6.529, "mean_token_accuracy": 0.11832507178187371, "num_tokens": 18117705.0, "step": 8370 }, { "entropy": 6.6313234806060795, "epoch": 0.8962491305045749, "grad_norm": 2.015625, "learning_rate": 0.0004929714696655507, "loss": 6.4331, "mean_token_accuracy": 0.12140770703554153, "num_tokens": 18129003.0, "step": 8375 }, { "entropy": 6.6004438400268555, "epoch": 0.8967842046123388, "grad_norm": 1.6796875, "learning_rate": 0.000492961984952488, "loss": 6.3848, "mean_token_accuracy": 0.1367577515542507, "num_tokens": 18140843.0, "step": 8380 }, { "entropy": 6.557983160018921, "epoch": 0.8973192787201028, "grad_norm": 1.375, "learning_rate": 0.0004929524939458037, "loss": 6.4735, "mean_token_accuracy": 0.12216648012399674, "num_tokens": 18151476.0, "step": 8385 }, { "entropy": 6.597401762008667, "epoch": 0.8978543528278666, "grad_norm": 1.75, "learning_rate": 0.0004929429966457716, "loss": 6.4974, "mean_token_accuracy": 0.11995471492409707, "num_tokens": 18161304.0, "step": 8390 }, { "entropy": 6.655696821212769, "epoch": 0.8983894269356306, "grad_norm": 1.3671875, "learning_rate": 0.0004929334930526662, "loss": 6.4287, "mean_token_accuracy": 0.13061922267079354, "num_tokens": 18173696.0, "step": 8395 }, { "entropy": 6.572501087188721, "epoch": 0.8989245010433945, "grad_norm": 1.9609375, "learning_rate": 0.0004929239831667617, "loss": 6.4387, "mean_token_accuracy": 0.12057856544852256, "num_tokens": 18186024.0, "step": 8400 }, { "entropy": 6.567807579040528, "epoch": 0.8994595751511585, "grad_norm": 1.328125, "learning_rate": 0.0004929144669883329, "loss": 6.4628, "mean_token_accuracy": 0.13044245541095734, "num_tokens": 18196976.0, "step": 8405 }, { "entropy": 6.587893533706665, "epoch": 0.8999946492589224, "grad_norm": 1.8984375, "learning_rate": 0.0004929049445176545, "loss": 6.4553, "mean_token_accuracy": 0.12222403511404992, "num_tokens": 18208086.0, "step": 8410 }, { "entropy": 6.598808670043946, "epoch": 0.9005297233666862, "grad_norm": 1.4609375, "learning_rate": 0.0004928954157550013, "loss": 6.4026, "mean_token_accuracy": 0.1364985041320324, "num_tokens": 18218468.0, "step": 8415 }, { "entropy": 6.641229772567749, "epoch": 0.9010647974744502, "grad_norm": 1.640625, "learning_rate": 0.0004928858807006488, "loss": 6.511, "mean_token_accuracy": 0.12634748592972755, "num_tokens": 18230489.0, "step": 8420 }, { "entropy": 6.616871500015259, "epoch": 0.9015998715822141, "grad_norm": 1.5625, "learning_rate": 0.0004928763393548721, "loss": 6.4344, "mean_token_accuracy": 0.12947860807180406, "num_tokens": 18239968.0, "step": 8425 }, { "entropy": 6.5853495597839355, "epoch": 0.9021349456899781, "grad_norm": 1.7734375, "learning_rate": 0.0004928667917179465, "loss": 6.4898, "mean_token_accuracy": 0.12196068912744522, "num_tokens": 18250902.0, "step": 8430 }, { "entropy": 6.663750267028808, "epoch": 0.902670019797742, "grad_norm": 1.453125, "learning_rate": 0.0004928572377901481, "loss": 6.4837, "mean_token_accuracy": 0.12794666811823846, "num_tokens": 18262094.0, "step": 8435 }, { "entropy": 6.584063005447388, "epoch": 0.903205093905506, "grad_norm": 1.4296875, "learning_rate": 0.0004928476775717524, "loss": 6.4512, "mean_token_accuracy": 0.12302127629518508, "num_tokens": 18272765.0, "step": 8440 }, { "entropy": 6.568285655975342, "epoch": 0.9037401680132698, "grad_norm": 1.6796875, "learning_rate": 0.0004928381110630358, "loss": 6.3773, "mean_token_accuracy": 0.13741017803549765, "num_tokens": 18284570.0, "step": 8445 }, { "entropy": 6.740869760513306, "epoch": 0.9042752421210337, "grad_norm": 1.65625, "learning_rate": 0.0004928285382642742, "loss": 6.4835, "mean_token_accuracy": 0.1234114944934845, "num_tokens": 18295170.0, "step": 8450 }, { "entropy": 6.594295454025269, "epoch": 0.9048103162287977, "grad_norm": 1.4140625, "learning_rate": 0.0004928189591757443, "loss": 6.4201, "mean_token_accuracy": 0.122423455119133, "num_tokens": 18306388.0, "step": 8455 }, { "entropy": 6.5661896705627445, "epoch": 0.9053453903365616, "grad_norm": 1.359375, "learning_rate": 0.0004928093737977225, "loss": 6.429, "mean_token_accuracy": 0.13050043657422067, "num_tokens": 18316363.0, "step": 8460 }, { "entropy": 6.4683513164520265, "epoch": 0.9058804644443256, "grad_norm": 8.5625, "learning_rate": 0.0004927997821304856, "loss": 6.3861, "mean_token_accuracy": 0.12661736011505126, "num_tokens": 18327397.0, "step": 8465 }, { "entropy": 6.5845592498779295, "epoch": 0.9064155385520895, "grad_norm": 1.890625, "learning_rate": 0.0004927901841743107, "loss": 6.4818, "mean_token_accuracy": 0.12432613149285317, "num_tokens": 18338909.0, "step": 8470 }, { "entropy": 6.639092874526978, "epoch": 0.9069506126598534, "grad_norm": 1.703125, "learning_rate": 0.0004927805799294747, "loss": 6.4568, "mean_token_accuracy": 0.12108288407325744, "num_tokens": 18350110.0, "step": 8475 }, { "entropy": 6.679194068908691, "epoch": 0.9074856867676173, "grad_norm": 2.515625, "learning_rate": 0.0004927709693962551, "loss": 6.5177, "mean_token_accuracy": 0.11563151106238365, "num_tokens": 18361590.0, "step": 8480 }, { "entropy": 6.59504246711731, "epoch": 0.9080207608753812, "grad_norm": 1.9453125, "learning_rate": 0.0004927613525749295, "loss": 6.4634, "mean_token_accuracy": 0.12366845831274986, "num_tokens": 18372602.0, "step": 8485 }, { "entropy": 6.630734634399414, "epoch": 0.9085558349831452, "grad_norm": 1.4609375, "learning_rate": 0.0004927517294657753, "loss": 6.499, "mean_token_accuracy": 0.12221666947007179, "num_tokens": 18384653.0, "step": 8490 }, { "entropy": 6.684356164932251, "epoch": 0.9090909090909091, "grad_norm": 1.8828125, "learning_rate": 0.0004927421000690705, "loss": 6.4559, "mean_token_accuracy": 0.12245200499892235, "num_tokens": 18395379.0, "step": 8495 }, { "entropy": 6.63131685256958, "epoch": 0.909625983198673, "grad_norm": 1.7890625, "learning_rate": 0.0004927324643850933, "loss": 6.4256, "mean_token_accuracy": 0.12843620777130127, "num_tokens": 18405915.0, "step": 8500 }, { "entropy": 6.438924121856689, "epoch": 0.9101610573064369, "grad_norm": 1.6484375, "learning_rate": 0.0004927228224141217, "loss": 6.3293, "mean_token_accuracy": 0.14597983360290528, "num_tokens": 18416656.0, "step": 8505 }, { "entropy": 6.542063999176025, "epoch": 0.9106961314142009, "grad_norm": 2.5, "learning_rate": 0.0004927131741564342, "loss": 6.4477, "mean_token_accuracy": 0.12013882920145988, "num_tokens": 18427141.0, "step": 8510 }, { "entropy": 6.607851362228393, "epoch": 0.9112312055219648, "grad_norm": 1.734375, "learning_rate": 0.0004927035196123094, "loss": 6.4915, "mean_token_accuracy": 0.12988717779517173, "num_tokens": 18437135.0, "step": 8515 }, { "entropy": 6.685029554367065, "epoch": 0.9117662796297287, "grad_norm": 1.4453125, "learning_rate": 0.000492693858782026, "loss": 6.5639, "mean_token_accuracy": 0.11965355947613716, "num_tokens": 18448567.0, "step": 8520 }, { "entropy": 6.679243803024292, "epoch": 0.9123013537374927, "grad_norm": 1.5546875, "learning_rate": 0.000492684191665863, "loss": 6.511, "mean_token_accuracy": 0.11756190657615662, "num_tokens": 18459385.0, "step": 8525 }, { "entropy": 6.561179542541504, "epoch": 0.9128364278452565, "grad_norm": 1.421875, "learning_rate": 0.0004926745182640996, "loss": 6.4677, "mean_token_accuracy": 0.1285193495452404, "num_tokens": 18471376.0, "step": 8530 }, { "entropy": 6.649504232406616, "epoch": 0.9133715019530205, "grad_norm": 1.7890625, "learning_rate": 0.0004926648385770152, "loss": 6.5335, "mean_token_accuracy": 0.11931721493601799, "num_tokens": 18481950.0, "step": 8535 }, { "entropy": 6.654511833190918, "epoch": 0.9139065760607844, "grad_norm": 1.4375, "learning_rate": 0.0004926551526048891, "loss": 6.4524, "mean_token_accuracy": 0.12727693393826484, "num_tokens": 18492436.0, "step": 8540 }, { "entropy": 6.575570774078369, "epoch": 0.9144416501685484, "grad_norm": 2.390625, "learning_rate": 0.0004926454603480009, "loss": 6.2964, "mean_token_accuracy": 0.12638833299279212, "num_tokens": 18504279.0, "step": 8545 }, { "entropy": 6.573821878433227, "epoch": 0.9149767242763123, "grad_norm": 3.546875, "learning_rate": 0.0004926357618066307, "loss": 6.4443, "mean_token_accuracy": 0.12484021857380867, "num_tokens": 18515262.0, "step": 8550 }, { "entropy": 6.63035249710083, "epoch": 0.9155117983840761, "grad_norm": 1.6484375, "learning_rate": 0.0004926260569810586, "loss": 6.4951, "mean_token_accuracy": 0.12227512821555138, "num_tokens": 18525176.0, "step": 8555 }, { "entropy": 6.5566153049469, "epoch": 0.9160468724918401, "grad_norm": 1.59375, "learning_rate": 0.0004926163458715645, "loss": 6.4617, "mean_token_accuracy": 0.12596529051661493, "num_tokens": 18536674.0, "step": 8560 }, { "entropy": 6.5605353832244875, "epoch": 0.916581946599604, "grad_norm": 4.03125, "learning_rate": 0.0004926066284784292, "loss": 6.4496, "mean_token_accuracy": 0.12597779259085656, "num_tokens": 18547398.0, "step": 8565 }, { "entropy": 6.563134813308716, "epoch": 0.917117020707368, "grad_norm": 1.7578125, "learning_rate": 0.0004925969048019329, "loss": 6.4943, "mean_token_accuracy": 0.12652412205934524, "num_tokens": 18558838.0, "step": 8570 }, { "entropy": 6.629328727722168, "epoch": 0.9176520948151319, "grad_norm": 2.265625, "learning_rate": 0.0004925871748423566, "loss": 6.4395, "mean_token_accuracy": 0.1258179649710655, "num_tokens": 18569881.0, "step": 8575 }, { "entropy": 6.6013552188873295, "epoch": 0.9181871689228959, "grad_norm": 1.6640625, "learning_rate": 0.0004925774385999812, "loss": 6.3501, "mean_token_accuracy": 0.13269954398274422, "num_tokens": 18579556.0, "step": 8580 }, { "entropy": 6.4663420677185055, "epoch": 0.9187222430306597, "grad_norm": 1.71875, "learning_rate": 0.0004925676960750878, "loss": 6.3516, "mean_token_accuracy": 0.1361738361418247, "num_tokens": 18590580.0, "step": 8585 }, { "entropy": 6.634561157226562, "epoch": 0.9192573171384236, "grad_norm": 1.71875, "learning_rate": 0.0004925579472679578, "loss": 6.4828, "mean_token_accuracy": 0.1265283964574337, "num_tokens": 18600813.0, "step": 8590 }, { "entropy": 6.598533678054809, "epoch": 0.9197923912461876, "grad_norm": 1.484375, "learning_rate": 0.0004925481921788726, "loss": 6.391, "mean_token_accuracy": 0.1304919548332691, "num_tokens": 18610807.0, "step": 8595 }, { "entropy": 6.510357618331909, "epoch": 0.9203274653539515, "grad_norm": 1.515625, "learning_rate": 0.000492538430808114, "loss": 6.3577, "mean_token_accuracy": 0.12540487572550774, "num_tokens": 18622108.0, "step": 8600 }, { "entropy": 6.557230615615845, "epoch": 0.9208625394617155, "grad_norm": 1.4140625, "learning_rate": 0.0004925286631559636, "loss": 6.5401, "mean_token_accuracy": 0.12565935403108597, "num_tokens": 18633098.0, "step": 8605 }, { "entropy": 6.648445987701416, "epoch": 0.9213976135694794, "grad_norm": 1.5859375, "learning_rate": 0.0004925188892227038, "loss": 6.4225, "mean_token_accuracy": 0.12731703594326974, "num_tokens": 18643603.0, "step": 8610 }, { "entropy": 6.638711643218994, "epoch": 0.9219326876772433, "grad_norm": 2.15625, "learning_rate": 0.0004925091090086166, "loss": 6.4527, "mean_token_accuracy": 0.1319430947303772, "num_tokens": 18654354.0, "step": 8615 }, { "entropy": 6.621751213073731, "epoch": 0.9224677617850072, "grad_norm": 1.6171875, "learning_rate": 0.0004924993225139845, "loss": 6.5275, "mean_token_accuracy": 0.12473874017596245, "num_tokens": 18665349.0, "step": 8620 }, { "entropy": 6.635911178588867, "epoch": 0.9230028358927711, "grad_norm": 1.53125, "learning_rate": 0.0004924895297390899, "loss": 6.4661, "mean_token_accuracy": 0.1247866302728653, "num_tokens": 18676575.0, "step": 8625 }, { "entropy": 6.631935882568359, "epoch": 0.9235379100005351, "grad_norm": 1.4296875, "learning_rate": 0.0004924797306842157, "loss": 6.4019, "mean_token_accuracy": 0.13183975219726562, "num_tokens": 18686501.0, "step": 8630 }, { "entropy": 6.582294940948486, "epoch": 0.924072984108299, "grad_norm": 2.140625, "learning_rate": 0.0004924699253496449, "loss": 6.474, "mean_token_accuracy": 0.1282108373939991, "num_tokens": 18697246.0, "step": 8635 }, { "entropy": 6.533542108535767, "epoch": 0.924608058216063, "grad_norm": 1.921875, "learning_rate": 0.0004924601137356605, "loss": 6.3935, "mean_token_accuracy": 0.1339188501238823, "num_tokens": 18708177.0, "step": 8640 }, { "entropy": 6.60825548171997, "epoch": 0.9251431323238268, "grad_norm": 1.546875, "learning_rate": 0.000492450295842546, "loss": 6.458, "mean_token_accuracy": 0.12657491490244865, "num_tokens": 18719334.0, "step": 8645 }, { "entropy": 6.618236446380616, "epoch": 0.9256782064315908, "grad_norm": 1.6171875, "learning_rate": 0.0004924404716705847, "loss": 6.4091, "mean_token_accuracy": 0.13286964371800422, "num_tokens": 18729174.0, "step": 8650 }, { "entropy": 6.537341594696045, "epoch": 0.9262132805393547, "grad_norm": 1.703125, "learning_rate": 0.0004924306412200603, "loss": 6.517, "mean_token_accuracy": 0.122911486774683, "num_tokens": 18740277.0, "step": 8655 }, { "entropy": 6.627772474288941, "epoch": 0.9267483546471186, "grad_norm": 1.46875, "learning_rate": 0.0004924208044912567, "loss": 6.4767, "mean_token_accuracy": 0.12486343458294868, "num_tokens": 18751864.0, "step": 8660 }, { "entropy": 6.609443330764771, "epoch": 0.9272834287548826, "grad_norm": 2.828125, "learning_rate": 0.0004924109614844579, "loss": 6.3891, "mean_token_accuracy": 0.1359869807958603, "num_tokens": 18762786.0, "step": 8665 }, { "entropy": 6.555660629272461, "epoch": 0.9278185028626464, "grad_norm": 1.7890625, "learning_rate": 0.0004924011121999482, "loss": 6.4339, "mean_token_accuracy": 0.13116455525159837, "num_tokens": 18772913.0, "step": 8670 }, { "entropy": 6.5695160865783695, "epoch": 0.9283535769704104, "grad_norm": 1.5390625, "learning_rate": 0.0004923912566380118, "loss": 6.4058, "mean_token_accuracy": 0.12949569448828696, "num_tokens": 18784204.0, "step": 8675 }, { "entropy": 6.5018853664398195, "epoch": 0.9288886510781743, "grad_norm": 1.59375, "learning_rate": 0.0004923813947989336, "loss": 6.4945, "mean_token_accuracy": 0.12146714031696319, "num_tokens": 18795425.0, "step": 8680 }, { "entropy": 6.64973201751709, "epoch": 0.9294237251859383, "grad_norm": 1.796875, "learning_rate": 0.0004923715266829981, "loss": 6.4345, "mean_token_accuracy": 0.1265689440071583, "num_tokens": 18806850.0, "step": 8685 }, { "entropy": 6.641017436981201, "epoch": 0.9299587992937022, "grad_norm": 1.3671875, "learning_rate": 0.0004923616522904903, "loss": 6.3843, "mean_token_accuracy": 0.1314132884144783, "num_tokens": 18817272.0, "step": 8690 }, { "entropy": 6.597755098342896, "epoch": 0.930493873401466, "grad_norm": 1.7734375, "learning_rate": 0.0004923517716216953, "loss": 6.5085, "mean_token_accuracy": 0.12215960323810578, "num_tokens": 18827075.0, "step": 8695 }, { "entropy": 6.62264838218689, "epoch": 0.93102894750923, "grad_norm": 3.390625, "learning_rate": 0.0004923418846768985, "loss": 6.4421, "mean_token_accuracy": 0.12476111203432083, "num_tokens": 18837635.0, "step": 8700 }, { "entropy": 6.642798328399659, "epoch": 0.9315640216169939, "grad_norm": 1.5546875, "learning_rate": 0.0004923319914563852, "loss": 6.4275, "mean_token_accuracy": 0.13177590519189836, "num_tokens": 18848559.0, "step": 8705 }, { "entropy": 6.670168113708496, "epoch": 0.9320990957247579, "grad_norm": 1.8828125, "learning_rate": 0.0004923220919604413, "loss": 6.4681, "mean_token_accuracy": 0.1240908034145832, "num_tokens": 18859327.0, "step": 8710 }, { "entropy": 6.591074991226196, "epoch": 0.9326341698325218, "grad_norm": 1.5859375, "learning_rate": 0.0004923121861893525, "loss": 6.4075, "mean_token_accuracy": 0.1274246610701084, "num_tokens": 18869403.0, "step": 8715 }, { "entropy": 6.583342885971069, "epoch": 0.9331692439402858, "grad_norm": 1.7421875, "learning_rate": 0.0004923022741434049, "loss": 6.4379, "mean_token_accuracy": 0.12099683731794357, "num_tokens": 18879890.0, "step": 8720 }, { "entropy": 6.615302467346192, "epoch": 0.9337043180480497, "grad_norm": 1.9375, "learning_rate": 0.0004922923558228846, "loss": 6.4721, "mean_token_accuracy": 0.12057366967201233, "num_tokens": 18890361.0, "step": 8725 }, { "entropy": 6.579403305053711, "epoch": 0.9342393921558135, "grad_norm": 2.171875, "learning_rate": 0.0004922824312280781, "loss": 6.3868, "mean_token_accuracy": 0.13047217801213265, "num_tokens": 18902344.0, "step": 8730 }, { "entropy": 6.569160079956054, "epoch": 0.9347744662635775, "grad_norm": 1.890625, "learning_rate": 0.000492272500359272, "loss": 6.3847, "mean_token_accuracy": 0.13155013620853423, "num_tokens": 18911364.0, "step": 8735 }, { "entropy": 6.588317584991455, "epoch": 0.9353095403713414, "grad_norm": 1.7265625, "learning_rate": 0.0004922625632167529, "loss": 6.488, "mean_token_accuracy": 0.11757436320185662, "num_tokens": 18922254.0, "step": 8740 }, { "entropy": 6.664959383010864, "epoch": 0.9358446144791054, "grad_norm": 1.40625, "learning_rate": 0.0004922526198008078, "loss": 6.4452, "mean_token_accuracy": 0.1260450467467308, "num_tokens": 18932943.0, "step": 8745 }, { "entropy": 6.618773317337036, "epoch": 0.9363796885868693, "grad_norm": 1.578125, "learning_rate": 0.0004922426701117239, "loss": 6.5241, "mean_token_accuracy": 0.12151310667395591, "num_tokens": 18943523.0, "step": 8750 }, { "entropy": 6.609319257736206, "epoch": 0.9369147626946333, "grad_norm": 1.4296875, "learning_rate": 0.0004922327141497884, "loss": 6.508, "mean_token_accuracy": 0.1161932684481144, "num_tokens": 18955220.0, "step": 8755 }, { "entropy": 6.675847339630127, "epoch": 0.9374498368023971, "grad_norm": 1.5390625, "learning_rate": 0.0004922227519152888, "loss": 6.5421, "mean_token_accuracy": 0.12342641204595566, "num_tokens": 18966714.0, "step": 8760 }, { "entropy": 6.56199951171875, "epoch": 0.937984910910161, "grad_norm": 1.8203125, "learning_rate": 0.0004922127834085128, "loss": 6.3913, "mean_token_accuracy": 0.12646044045686722, "num_tokens": 18977998.0, "step": 8765 }, { "entropy": 6.567882633209228, "epoch": 0.938519985017925, "grad_norm": 1.9609375, "learning_rate": 0.0004922028086297481, "loss": 6.3818, "mean_token_accuracy": 0.127099596709013, "num_tokens": 18990210.0, "step": 8770 }, { "entropy": 6.6765382289886475, "epoch": 0.9390550591256889, "grad_norm": 1.5078125, "learning_rate": 0.0004921928275792828, "loss": 6.4995, "mean_token_accuracy": 0.12616633251309395, "num_tokens": 19000529.0, "step": 8775 }, { "entropy": 6.628943872451782, "epoch": 0.9395901332334529, "grad_norm": 2.6875, "learning_rate": 0.0004921828402574052, "loss": 6.4251, "mean_token_accuracy": 0.13188672289252282, "num_tokens": 19011386.0, "step": 8780 }, { "entropy": 6.550263404846191, "epoch": 0.9401252073412167, "grad_norm": 1.6640625, "learning_rate": 0.0004921728466644037, "loss": 6.4043, "mean_token_accuracy": 0.12869123220443726, "num_tokens": 19022196.0, "step": 8785 }, { "entropy": 6.533733606338501, "epoch": 0.9406602814489807, "grad_norm": 1.5625, "learning_rate": 0.0004921628468005666, "loss": 6.4358, "mean_token_accuracy": 0.13189285323023797, "num_tokens": 19033221.0, "step": 8790 }, { "entropy": 6.611112642288208, "epoch": 0.9411953555567446, "grad_norm": 1.4765625, "learning_rate": 0.000492152840666183, "loss": 6.4878, "mean_token_accuracy": 0.12585045173764228, "num_tokens": 19044953.0, "step": 8795 }, { "entropy": 6.711111831665039, "epoch": 0.9417304296645085, "grad_norm": 1.515625, "learning_rate": 0.0004921428282615415, "loss": 6.5018, "mean_token_accuracy": 0.12096112072467805, "num_tokens": 19055512.0, "step": 8800 }, { "entropy": 6.635407400131226, "epoch": 0.9422655037722725, "grad_norm": 1.5859375, "learning_rate": 0.0004921328095869313, "loss": 6.5027, "mean_token_accuracy": 0.1203993707895279, "num_tokens": 19065659.0, "step": 8805 }, { "entropy": 6.658339595794677, "epoch": 0.9428005778800364, "grad_norm": 1.8125, "learning_rate": 0.0004921227846426418, "loss": 6.433, "mean_token_accuracy": 0.1371263563632965, "num_tokens": 19076955.0, "step": 8810 }, { "entropy": 6.572042465209961, "epoch": 0.9433356519878003, "grad_norm": 1.625, "learning_rate": 0.0004921127534289624, "loss": 6.5106, "mean_token_accuracy": 0.11860493347048759, "num_tokens": 19088305.0, "step": 8815 }, { "entropy": 6.568140172958374, "epoch": 0.9438707260955642, "grad_norm": 1.65625, "learning_rate": 0.0004921027159461829, "loss": 6.5098, "mean_token_accuracy": 0.12441008612513542, "num_tokens": 19098046.0, "step": 8820 }, { "entropy": 6.6841308116912845, "epoch": 0.9444058002033282, "grad_norm": 1.75, "learning_rate": 0.0004920926721945927, "loss": 6.4226, "mean_token_accuracy": 0.12864333316683768, "num_tokens": 19109019.0, "step": 8825 }, { "entropy": 6.662001609802246, "epoch": 0.9449408743110921, "grad_norm": 1.484375, "learning_rate": 0.0004920826221744823, "loss": 6.4228, "mean_token_accuracy": 0.12871572971343995, "num_tokens": 19119624.0, "step": 8830 }, { "entropy": 6.636339902877808, "epoch": 0.945475948418856, "grad_norm": 1.4453125, "learning_rate": 0.0004920725658861417, "loss": 6.4741, "mean_token_accuracy": 0.12303901016712189, "num_tokens": 19130577.0, "step": 8835 }, { "entropy": 6.589366340637207, "epoch": 0.94601102252662, "grad_norm": 1.4140625, "learning_rate": 0.0004920625033298611, "loss": 6.3814, "mean_token_accuracy": 0.12903112173080444, "num_tokens": 19140254.0, "step": 8840 }, { "entropy": 6.569903993606568, "epoch": 0.9465460966343838, "grad_norm": 1.6015625, "learning_rate": 0.0004920524345059314, "loss": 6.4247, "mean_token_accuracy": 0.12659077122807502, "num_tokens": 19151357.0, "step": 8845 }, { "entropy": 6.6806480884552, "epoch": 0.9470811707421478, "grad_norm": 1.3515625, "learning_rate": 0.0004920423594146431, "loss": 6.4208, "mean_token_accuracy": 0.13126432448625563, "num_tokens": 19162069.0, "step": 8850 }, { "entropy": 6.546973991394043, "epoch": 0.9476162448499117, "grad_norm": 1.484375, "learning_rate": 0.0004920322780562872, "loss": 6.3129, "mean_token_accuracy": 0.13278165608644485, "num_tokens": 19172515.0, "step": 8855 }, { "entropy": 6.469416666030884, "epoch": 0.9481513189576757, "grad_norm": 1.3125, "learning_rate": 0.0004920221904311546, "loss": 6.3304, "mean_token_accuracy": 0.1281422682106495, "num_tokens": 19182450.0, "step": 8860 }, { "entropy": 6.6383439064025875, "epoch": 0.9486863930654396, "grad_norm": 1.53125, "learning_rate": 0.0004920120965395369, "loss": 6.5292, "mean_token_accuracy": 0.12080127596855164, "num_tokens": 19193833.0, "step": 8865 }, { "entropy": 6.678140926361084, "epoch": 0.9492214671732034, "grad_norm": 2.640625, "learning_rate": 0.0004920019963817253, "loss": 6.4762, "mean_token_accuracy": 0.1225566104054451, "num_tokens": 19204970.0, "step": 8870 }, { "entropy": 6.609140682220459, "epoch": 0.9497565412809674, "grad_norm": 1.7265625, "learning_rate": 0.0004919918899580117, "loss": 6.4331, "mean_token_accuracy": 0.1269660323858261, "num_tokens": 19215795.0, "step": 8875 }, { "entropy": 6.611617612838745, "epoch": 0.9502916153887313, "grad_norm": 1.8671875, "learning_rate": 0.0004919817772686876, "loss": 6.4649, "mean_token_accuracy": 0.11650814116001129, "num_tokens": 19226375.0, "step": 8880 }, { "entropy": 6.680630016326904, "epoch": 0.9508266894964953, "grad_norm": 1.8515625, "learning_rate": 0.0004919716583140453, "loss": 6.468, "mean_token_accuracy": 0.13823570236563681, "num_tokens": 19236066.0, "step": 8885 }, { "entropy": 6.529271268844605, "epoch": 0.9513617636042592, "grad_norm": 2.203125, "learning_rate": 0.0004919615330943769, "loss": 6.3353, "mean_token_accuracy": 0.1377024307847023, "num_tokens": 19246757.0, "step": 8890 }, { "entropy": 6.614864778518677, "epoch": 0.9518968377120232, "grad_norm": 1.4921875, "learning_rate": 0.0004919514016099746, "loss": 6.5, "mean_token_accuracy": 0.12600353509187698, "num_tokens": 19257875.0, "step": 8895 }, { "entropy": 6.6503785133361815, "epoch": 0.952431911819787, "grad_norm": 1.5, "learning_rate": 0.000491941263861131, "loss": 6.4781, "mean_token_accuracy": 0.125810706615448, "num_tokens": 19270236.0, "step": 8900 }, { "entropy": 6.588436317443848, "epoch": 0.9529669859275509, "grad_norm": 2.609375, "learning_rate": 0.000491931119848139, "loss": 6.4612, "mean_token_accuracy": 0.12382268756628037, "num_tokens": 19280877.0, "step": 8905 }, { "entropy": 6.525938892364502, "epoch": 0.9535020600353149, "grad_norm": 2.0, "learning_rate": 0.0004919209695712915, "loss": 6.3569, "mean_token_accuracy": 0.13123888075351714, "num_tokens": 19292852.0, "step": 8910 }, { "entropy": 6.636586141586304, "epoch": 0.9540371341430788, "grad_norm": 7.90625, "learning_rate": 0.0004919108130308814, "loss": 6.5481, "mean_token_accuracy": 0.11724269837141037, "num_tokens": 19305516.0, "step": 8915 }, { "entropy": 6.625235986709595, "epoch": 0.9545722082508428, "grad_norm": 1.4609375, "learning_rate": 0.0004919006502272019, "loss": 6.3795, "mean_token_accuracy": 0.13500440642237663, "num_tokens": 19315436.0, "step": 8920 }, { "entropy": 6.508727741241455, "epoch": 0.9551072823586066, "grad_norm": 1.453125, "learning_rate": 0.0004918904811605468, "loss": 6.4376, "mean_token_accuracy": 0.1264245629310608, "num_tokens": 19325393.0, "step": 8925 }, { "entropy": 6.5293982982635494, "epoch": 0.9556423564663706, "grad_norm": 1.71875, "learning_rate": 0.0004918803058312094, "loss": 6.4306, "mean_token_accuracy": 0.12973214834928512, "num_tokens": 19336722.0, "step": 8930 }, { "entropy": 6.7406854152679445, "epoch": 0.9561774305741345, "grad_norm": 1.796875, "learning_rate": 0.0004918701242394837, "loss": 6.5851, "mean_token_accuracy": 0.11917414888739586, "num_tokens": 19348406.0, "step": 8935 }, { "entropy": 6.599468946456909, "epoch": 0.9567125046818984, "grad_norm": 1.609375, "learning_rate": 0.0004918599363856637, "loss": 6.3923, "mean_token_accuracy": 0.1359890453517437, "num_tokens": 19359714.0, "step": 8940 }, { "entropy": 6.630413579940796, "epoch": 0.9572475787896624, "grad_norm": 1.765625, "learning_rate": 0.0004918497422700434, "loss": 6.4143, "mean_token_accuracy": 0.12925480753183366, "num_tokens": 19370833.0, "step": 8945 }, { "entropy": 6.610364055633545, "epoch": 0.9577826528974263, "grad_norm": 1.5078125, "learning_rate": 0.0004918395418929174, "loss": 6.4944, "mean_token_accuracy": 0.12302698343992233, "num_tokens": 19382098.0, "step": 8950 }, { "entropy": 6.624408388137818, "epoch": 0.9583177270051902, "grad_norm": 2.015625, "learning_rate": 0.00049182933525458, "loss": 6.4757, "mean_token_accuracy": 0.12349115982651711, "num_tokens": 19393595.0, "step": 8955 }, { "entropy": 6.640421295166016, "epoch": 0.9588528011129541, "grad_norm": 1.625, "learning_rate": 0.000491819122355326, "loss": 6.4125, "mean_token_accuracy": 0.13156883418560028, "num_tokens": 19405296.0, "step": 8960 }, { "entropy": 6.634973096847534, "epoch": 0.9593878752207181, "grad_norm": 1.4609375, "learning_rate": 0.0004918089031954503, "loss": 6.4472, "mean_token_accuracy": 0.12182890325784683, "num_tokens": 19415693.0, "step": 8965 }, { "entropy": 6.580959510803223, "epoch": 0.959922949328482, "grad_norm": 1.78125, "learning_rate": 0.000491798677775248, "loss": 6.4961, "mean_token_accuracy": 0.12708681151270868, "num_tokens": 19426140.0, "step": 8970 }, { "entropy": 6.693287134170532, "epoch": 0.9604580234362459, "grad_norm": 1.578125, "learning_rate": 0.0004917884460950144, "loss": 6.5297, "mean_token_accuracy": 0.1222914569079876, "num_tokens": 19437543.0, "step": 8975 }, { "entropy": 6.634545707702637, "epoch": 0.9609930975440099, "grad_norm": 1.390625, "learning_rate": 0.000491778208155045, "loss": 6.4384, "mean_token_accuracy": 0.1252037465572357, "num_tokens": 19447788.0, "step": 8980 }, { "entropy": 6.65233883857727, "epoch": 0.9615281716517737, "grad_norm": 1.796875, "learning_rate": 0.0004917679639556351, "loss": 6.4577, "mean_token_accuracy": 0.12330029979348182, "num_tokens": 19457587.0, "step": 8985 }, { "entropy": 6.6310333728790285, "epoch": 0.9620632457595377, "grad_norm": 1.8515625, "learning_rate": 0.0004917577134970808, "loss": 6.3826, "mean_token_accuracy": 0.1255684621632099, "num_tokens": 19467422.0, "step": 8990 }, { "entropy": 6.586491394042969, "epoch": 0.9625983198673016, "grad_norm": 1.609375, "learning_rate": 0.0004917474567796778, "loss": 6.4322, "mean_token_accuracy": 0.12582321763038634, "num_tokens": 19479037.0, "step": 8995 }, { "entropy": 6.5694173812866214, "epoch": 0.9631333939750656, "grad_norm": 1.5546875, "learning_rate": 0.0004917371938037226, "loss": 6.3603, "mean_token_accuracy": 0.1418306939303875, "num_tokens": 19489639.0, "step": 9000 }, { "epoch": 0.9631333939750656, "eval_entropy": 6.45046752675203, "eval_loss": 6.510419845581055, "eval_mean_token_accuracy": 0.12865163465319177, "eval_num_tokens": 19489639.0, "eval_runtime": 22.7134, "eval_samples_per_second": 1306.673, "eval_steps_per_second": 163.34, "step": 9000 }, { "entropy": 6.621413230895996, "epoch": 0.9636684680828295, "grad_norm": 1.5390625, "learning_rate": 0.0004917269245695114, "loss": 6.4786, "mean_token_accuracy": 0.12253487184643745, "num_tokens": 19500592.0, "step": 9005 }, { "entropy": 6.647409582138062, "epoch": 0.9642035421905933, "grad_norm": 1.6796875, "learning_rate": 0.0004917166490773406, "loss": 6.4926, "mean_token_accuracy": 0.12586249634623528, "num_tokens": 19510818.0, "step": 9010 }, { "entropy": 6.684140062332153, "epoch": 0.9647386162983573, "grad_norm": 1.6875, "learning_rate": 0.0004917063673275071, "loss": 6.5165, "mean_token_accuracy": 0.12470211908221245, "num_tokens": 19521283.0, "step": 9015 }, { "entropy": 6.619394111633301, "epoch": 0.9652736904061212, "grad_norm": 1.4765625, "learning_rate": 0.0004916960793203077, "loss": 6.3639, "mean_token_accuracy": 0.12334120795130729, "num_tokens": 19531799.0, "step": 9020 }, { "entropy": 6.572729444503784, "epoch": 0.9658087645138852, "grad_norm": 1.953125, "learning_rate": 0.0004916857850560394, "loss": 6.3481, "mean_token_accuracy": 0.13819931223988532, "num_tokens": 19542377.0, "step": 9025 }, { "entropy": 6.545560359954834, "epoch": 0.9663438386216491, "grad_norm": 1.953125, "learning_rate": 0.0004916754845349996, "loss": 6.3602, "mean_token_accuracy": 0.12935152798891067, "num_tokens": 19552654.0, "step": 9030 }, { "entropy": 6.592235040664673, "epoch": 0.9668789127294131, "grad_norm": 1.6796875, "learning_rate": 0.0004916651777574856, "loss": 6.4228, "mean_token_accuracy": 0.126383750885725, "num_tokens": 19563439.0, "step": 9035 }, { "entropy": 6.6113365650177, "epoch": 0.9674139868371769, "grad_norm": 2.140625, "learning_rate": 0.000491654864723795, "loss": 6.4451, "mean_token_accuracy": 0.12931786999106407, "num_tokens": 19574264.0, "step": 9040 }, { "entropy": 6.457882881164551, "epoch": 0.9679490609449408, "grad_norm": 1.9296875, "learning_rate": 0.0004916445454342256, "loss": 6.3121, "mean_token_accuracy": 0.14026236683130264, "num_tokens": 19585293.0, "step": 9045 }, { "entropy": 6.6120201587677006, "epoch": 0.9684841350527048, "grad_norm": 1.84375, "learning_rate": 0.0004916342198890754, "loss": 6.3589, "mean_token_accuracy": 0.1260765090584755, "num_tokens": 19594384.0, "step": 9050 }, { "entropy": 6.587450313568115, "epoch": 0.9690192091604687, "grad_norm": 1.765625, "learning_rate": 0.0004916238880886426, "loss": 6.4658, "mean_token_accuracy": 0.12822272032499313, "num_tokens": 19605144.0, "step": 9055 }, { "entropy": 6.570050573348999, "epoch": 0.9695542832682327, "grad_norm": 1.5234375, "learning_rate": 0.0004916135500332255, "loss": 6.3632, "mean_token_accuracy": 0.13149576559662818, "num_tokens": 19615885.0, "step": 9060 }, { "entropy": 6.556726026535034, "epoch": 0.9700893573759966, "grad_norm": 1.3203125, "learning_rate": 0.0004916032057231225, "loss": 6.3891, "mean_token_accuracy": 0.12656096294522284, "num_tokens": 19625749.0, "step": 9065 }, { "entropy": 6.5713582038879395, "epoch": 0.9706244314837605, "grad_norm": 1.5703125, "learning_rate": 0.0004915928551586324, "loss": 6.4627, "mean_token_accuracy": 0.11975899636745453, "num_tokens": 19638285.0, "step": 9070 }, { "entropy": 6.670734453201294, "epoch": 0.9711595055915244, "grad_norm": 2.171875, "learning_rate": 0.0004915824983400541, "loss": 6.5043, "mean_token_accuracy": 0.12083764597773552, "num_tokens": 19649697.0, "step": 9075 }, { "entropy": 6.689089012145996, "epoch": 0.9716945796992883, "grad_norm": 1.6640625, "learning_rate": 0.0004915721352676864, "loss": 6.4909, "mean_token_accuracy": 0.12309880778193474, "num_tokens": 19659668.0, "step": 9080 }, { "entropy": 6.5748748779296875, "epoch": 0.9722296538070523, "grad_norm": 1.4296875, "learning_rate": 0.0004915617659418289, "loss": 6.3587, "mean_token_accuracy": 0.12820305898785592, "num_tokens": 19670301.0, "step": 9085 }, { "entropy": 6.569716072082519, "epoch": 0.9727647279148162, "grad_norm": 1.765625, "learning_rate": 0.0004915513903627807, "loss": 6.4086, "mean_token_accuracy": 0.12332535162568092, "num_tokens": 19680926.0, "step": 9090 }, { "entropy": 6.497462606430053, "epoch": 0.9732998020225802, "grad_norm": 1.515625, "learning_rate": 0.0004915410085308417, "loss": 6.3911, "mean_token_accuracy": 0.13348619192838668, "num_tokens": 19691467.0, "step": 9095 }, { "entropy": 6.5884847164154055, "epoch": 0.973834876130344, "grad_norm": 1.875, "learning_rate": 0.0004915306204463115, "loss": 6.3966, "mean_token_accuracy": 0.12888719141483307, "num_tokens": 19701139.0, "step": 9100 }, { "entropy": 6.624570894241333, "epoch": 0.974369950238108, "grad_norm": 1.890625, "learning_rate": 0.00049152022610949, "loss": 6.4026, "mean_token_accuracy": 0.11958568394184113, "num_tokens": 19710628.0, "step": 9105 }, { "entropy": 6.628446578979492, "epoch": 0.9749050243458719, "grad_norm": 1.3359375, "learning_rate": 0.0004915098255206773, "loss": 6.4187, "mean_token_accuracy": 0.12999779507517814, "num_tokens": 19721824.0, "step": 9110 }, { "entropy": 6.6438335418701175, "epoch": 0.9754400984536358, "grad_norm": 1.5078125, "learning_rate": 0.000491499418680174, "loss": 6.436, "mean_token_accuracy": 0.12116050198674203, "num_tokens": 19732557.0, "step": 9115 }, { "entropy": 6.596571922302246, "epoch": 0.9759751725613998, "grad_norm": 1.328125, "learning_rate": 0.0004914890055882804, "loss": 6.4275, "mean_token_accuracy": 0.11970045194029807, "num_tokens": 19743436.0, "step": 9120 }, { "entropy": 6.541895818710327, "epoch": 0.9765102466691636, "grad_norm": 1.7109375, "learning_rate": 0.000491478586245297, "loss": 6.3416, "mean_token_accuracy": 0.13265810012817383, "num_tokens": 19755305.0, "step": 9125 }, { "entropy": 6.5737539768219, "epoch": 0.9770453207769276, "grad_norm": 3.484375, "learning_rate": 0.000491468160651525, "loss": 6.3464, "mean_token_accuracy": 0.13324624821543693, "num_tokens": 19766223.0, "step": 9130 }, { "entropy": 6.501796293258667, "epoch": 0.9775803948846915, "grad_norm": 1.484375, "learning_rate": 0.0004914577288072652, "loss": 6.4192, "mean_token_accuracy": 0.12503207176923753, "num_tokens": 19777268.0, "step": 9135 }, { "entropy": 6.616298341751099, "epoch": 0.9781154689924555, "grad_norm": 1.8828125, "learning_rate": 0.0004914472907128189, "loss": 6.5185, "mean_token_accuracy": 0.12278926596045495, "num_tokens": 19787875.0, "step": 9140 }, { "entropy": 6.621466541290284, "epoch": 0.9786505431002194, "grad_norm": 1.8046875, "learning_rate": 0.0004914368463684876, "loss": 6.4216, "mean_token_accuracy": 0.12677970305085182, "num_tokens": 19798919.0, "step": 9145 }, { "entropy": 6.5782746315002445, "epoch": 0.9791856172079834, "grad_norm": 1.796875, "learning_rate": 0.0004914263957745726, "loss": 6.4, "mean_token_accuracy": 0.13413854390382768, "num_tokens": 19809320.0, "step": 9150 }, { "entropy": 6.655309772491455, "epoch": 0.9797206913157472, "grad_norm": 1.9921875, "learning_rate": 0.0004914159389313759, "loss": 6.4725, "mean_token_accuracy": 0.12751644253730773, "num_tokens": 19819511.0, "step": 9155 }, { "entropy": 6.6865781307220455, "epoch": 0.9802557654235111, "grad_norm": 1.4296875, "learning_rate": 0.0004914054758391994, "loss": 6.503, "mean_token_accuracy": 0.11886487379670144, "num_tokens": 19830381.0, "step": 9160 }, { "entropy": 6.536502122879028, "epoch": 0.9807908395312751, "grad_norm": 1.515625, "learning_rate": 0.0004913950064983452, "loss": 6.3499, "mean_token_accuracy": 0.1259816624224186, "num_tokens": 19840806.0, "step": 9165 }, { "entropy": 6.508013916015625, "epoch": 0.981325913639039, "grad_norm": 1.3671875, "learning_rate": 0.0004913845309091156, "loss": 6.353, "mean_token_accuracy": 0.1387888766825199, "num_tokens": 19851095.0, "step": 9170 }, { "entropy": 6.542148590087891, "epoch": 0.981860987746803, "grad_norm": 1.390625, "learning_rate": 0.0004913740490718131, "loss": 6.3035, "mean_token_accuracy": 0.13859621435403824, "num_tokens": 19860235.0, "step": 9175 }, { "entropy": 6.554223346710205, "epoch": 0.9823960618545668, "grad_norm": 1.5078125, "learning_rate": 0.0004913635609867403, "loss": 6.4296, "mean_token_accuracy": 0.12288685292005538, "num_tokens": 19872264.0, "step": 9180 }, { "entropy": 6.637903070449829, "epoch": 0.9829311359623308, "grad_norm": 1.5625, "learning_rate": 0.0004913530666542001, "loss": 6.5237, "mean_token_accuracy": 0.12131133228540421, "num_tokens": 19883628.0, "step": 9185 }, { "entropy": 6.589421558380127, "epoch": 0.9834662100700947, "grad_norm": 1.3046875, "learning_rate": 0.0004913425660744955, "loss": 6.391, "mean_token_accuracy": 0.12491015046834945, "num_tokens": 19894624.0, "step": 9190 }, { "entropy": 6.6095788955688475, "epoch": 0.9840012841778586, "grad_norm": 1.3125, "learning_rate": 0.0004913320592479297, "loss": 6.407, "mean_token_accuracy": 0.12497465535998345, "num_tokens": 19904882.0, "step": 9195 }, { "entropy": 6.5338897705078125, "epoch": 0.9845363582856226, "grad_norm": 1.734375, "learning_rate": 0.0004913215461748061, "loss": 6.345, "mean_token_accuracy": 0.1354656219482422, "num_tokens": 19915344.0, "step": 9200 }, { "entropy": 6.583229351043701, "epoch": 0.9850714323933865, "grad_norm": 1.4296875, "learning_rate": 0.0004913110268554282, "loss": 6.4896, "mean_token_accuracy": 0.11940996870398521, "num_tokens": 19927527.0, "step": 9205 }, { "entropy": 6.597001934051514, "epoch": 0.9856065065011504, "grad_norm": 1.5, "learning_rate": 0.0004913005012900998, "loss": 6.4305, "mean_token_accuracy": 0.12389865592122078, "num_tokens": 19938893.0, "step": 9210 }, { "entropy": 6.603095245361328, "epoch": 0.9861415806089143, "grad_norm": 2.375, "learning_rate": 0.0004912899694791248, "loss": 6.4011, "mean_token_accuracy": 0.13044048398733138, "num_tokens": 19949297.0, "step": 9215 }, { "entropy": 6.545996809005738, "epoch": 0.9866766547166783, "grad_norm": 2.328125, "learning_rate": 0.0004912794314228074, "loss": 6.3656, "mean_token_accuracy": 0.12906254455447197, "num_tokens": 19959194.0, "step": 9220 }, { "entropy": 6.5977085590362545, "epoch": 0.9872117288244422, "grad_norm": 1.3984375, "learning_rate": 0.0004912688871214518, "loss": 6.4299, "mean_token_accuracy": 0.1233506016433239, "num_tokens": 19969896.0, "step": 9225 }, { "entropy": 6.582791805267334, "epoch": 0.9877468029322061, "grad_norm": 1.4609375, "learning_rate": 0.0004912583365753625, "loss": 6.4002, "mean_token_accuracy": 0.13166438192129135, "num_tokens": 19981505.0, "step": 9230 }, { "entropy": 6.570750141143799, "epoch": 0.9882818770399701, "grad_norm": 1.4140625, "learning_rate": 0.0004912477797848441, "loss": 6.3744, "mean_token_accuracy": 0.12995605915784836, "num_tokens": 19992770.0, "step": 9235 }, { "entropy": 6.570767831802368, "epoch": 0.9888169511477339, "grad_norm": 2.015625, "learning_rate": 0.0004912372167502014, "loss": 6.3774, "mean_token_accuracy": 0.13007648289203644, "num_tokens": 20003572.0, "step": 9240 }, { "entropy": 6.511661434173584, "epoch": 0.9893520252554979, "grad_norm": 1.75, "learning_rate": 0.0004912266474717394, "loss": 6.414, "mean_token_accuracy": 0.13034561201930045, "num_tokens": 20014500.0, "step": 9245 }, { "entropy": 6.571699094772339, "epoch": 0.9898870993632618, "grad_norm": 3.78125, "learning_rate": 0.0004912160719497635, "loss": 6.4233, "mean_token_accuracy": 0.12786453440785409, "num_tokens": 20025745.0, "step": 9250 }, { "entropy": 6.561632347106934, "epoch": 0.9904221734710258, "grad_norm": 1.7734375, "learning_rate": 0.0004912054901845788, "loss": 6.2986, "mean_token_accuracy": 0.1291518561542034, "num_tokens": 20036346.0, "step": 9255 }, { "entropy": 6.533315896987915, "epoch": 0.9909572475787897, "grad_norm": 2.671875, "learning_rate": 0.000491194902176491, "loss": 6.4616, "mean_token_accuracy": 0.12814752161502838, "num_tokens": 20048162.0, "step": 9260 }, { "entropy": 6.559889030456543, "epoch": 0.9914923216865535, "grad_norm": 1.8359375, "learning_rate": 0.0004911843079258057, "loss": 6.5379, "mean_token_accuracy": 0.11548658013343811, "num_tokens": 20058947.0, "step": 9265 }, { "entropy": 6.702791309356689, "epoch": 0.9920273957943175, "grad_norm": 1.40625, "learning_rate": 0.0004911737074328289, "loss": 6.4577, "mean_token_accuracy": 0.12429900467395782, "num_tokens": 20069282.0, "step": 9270 }, { "entropy": 6.621148729324341, "epoch": 0.9925624699020814, "grad_norm": 1.75, "learning_rate": 0.0004911631006978667, "loss": 6.4334, "mean_token_accuracy": 0.1263555720448494, "num_tokens": 20078347.0, "step": 9275 }, { "entropy": 6.581938457489014, "epoch": 0.9930975440098454, "grad_norm": 1.8125, "learning_rate": 0.0004911524877212254, "loss": 6.4294, "mean_token_accuracy": 0.12386744022369385, "num_tokens": 20089129.0, "step": 9280 }, { "entropy": 6.5865562915802, "epoch": 0.9936326181176093, "grad_norm": 1.7109375, "learning_rate": 0.0004911418685032114, "loss": 6.4354, "mean_token_accuracy": 0.12295543402433395, "num_tokens": 20101008.0, "step": 9285 }, { "entropy": 6.520455312728882, "epoch": 0.9941676922253733, "grad_norm": 1.8125, "learning_rate": 0.0004911312430441312, "loss": 6.4523, "mean_token_accuracy": 0.12910244837403298, "num_tokens": 20112272.0, "step": 9290 }, { "entropy": 6.548386669158935, "epoch": 0.9947027663331371, "grad_norm": 1.9453125, "learning_rate": 0.0004911206113442918, "loss": 6.3361, "mean_token_accuracy": 0.1382080502808094, "num_tokens": 20122814.0, "step": 9295 }, { "entropy": 6.514030599594117, "epoch": 0.995237840440901, "grad_norm": 2.046875, "learning_rate": 0.0004911099734040001, "loss": 6.3017, "mean_token_accuracy": 0.13078407868742942, "num_tokens": 20133169.0, "step": 9300 }, { "entropy": 6.61966381072998, "epoch": 0.995772914548665, "grad_norm": 2.59375, "learning_rate": 0.0004910993292235634, "loss": 6.4622, "mean_token_accuracy": 0.1179257057607174, "num_tokens": 20144355.0, "step": 9305 }, { "entropy": 6.63772873878479, "epoch": 0.9963079886564289, "grad_norm": 1.4765625, "learning_rate": 0.0004910886788032887, "loss": 6.4394, "mean_token_accuracy": 0.12375867813825607, "num_tokens": 20154486.0, "step": 9310 }, { "entropy": 6.580125761032105, "epoch": 0.9968430627641929, "grad_norm": 1.3671875, "learning_rate": 0.0004910780221434839, "loss": 6.4081, "mean_token_accuracy": 0.1301169626414776, "num_tokens": 20166359.0, "step": 9315 }, { "entropy": 6.582270002365112, "epoch": 0.9973781368719568, "grad_norm": 1.4765625, "learning_rate": 0.0004910673592444566, "loss": 6.4117, "mean_token_accuracy": 0.1259844958782196, "num_tokens": 20176469.0, "step": 9320 }, { "entropy": 6.605635404586792, "epoch": 0.9979132109797207, "grad_norm": 1.5546875, "learning_rate": 0.0004910566901065147, "loss": 6.4425, "mean_token_accuracy": 0.129373699426651, "num_tokens": 20188334.0, "step": 9325 }, { "entropy": 6.553080797195435, "epoch": 0.9984482850874846, "grad_norm": 2.1875, "learning_rate": 0.0004910460147299661, "loss": 6.3445, "mean_token_accuracy": 0.13515611216425896, "num_tokens": 20198594.0, "step": 9330 }, { "entropy": 6.559202575683594, "epoch": 0.9989833591952485, "grad_norm": 1.53125, "learning_rate": 0.0004910353331151193, "loss": 6.4468, "mean_token_accuracy": 0.12875296920537949, "num_tokens": 20209456.0, "step": 9335 }, { "entropy": 6.580421400070191, "epoch": 0.9995184333030125, "grad_norm": 1.4765625, "learning_rate": 0.0004910246452622825, "loss": 6.4296, "mean_token_accuracy": 0.13052132055163385, "num_tokens": 20219835.0, "step": 9340 }, { "entropy": 6.6216433842976885, "epoch": 1.0, "grad_norm": 3.6875, "learning_rate": 0.0004910139511717646, "loss": 6.4613, "mean_token_accuracy": 0.1245041439930598, "num_tokens": 20228258.0, "step": 9345 }, { "entropy": 6.589415073394775, "epoch": 1.0005350741077639, "grad_norm": 1.4765625, "learning_rate": 0.0004910032508438739, "loss": 6.3329, "mean_token_accuracy": 0.12991154193878174, "num_tokens": 20238875.0, "step": 9350 }, { "entropy": 6.589252042770386, "epoch": 1.0010701482155278, "grad_norm": 1.3671875, "learning_rate": 0.00049099254427892, "loss": 6.3593, "mean_token_accuracy": 0.12358415201306343, "num_tokens": 20249750.0, "step": 9355 }, { "entropy": 6.6447954177856445, "epoch": 1.0016052223232919, "grad_norm": 1.5625, "learning_rate": 0.0004909818314772116, "loss": 6.3993, "mean_token_accuracy": 0.12229088544845582, "num_tokens": 20259772.0, "step": 9360 }, { "entropy": 6.541646099090576, "epoch": 1.0021402964310557, "grad_norm": 1.5, "learning_rate": 0.0004909711124390582, "loss": 6.304, "mean_token_accuracy": 0.13751042485237122, "num_tokens": 20270230.0, "step": 9365 }, { "entropy": 6.444565153121948, "epoch": 1.0026753705388196, "grad_norm": 1.4765625, "learning_rate": 0.0004909603871647692, "loss": 6.1597, "mean_token_accuracy": 0.1495958887040615, "num_tokens": 20280317.0, "step": 9370 }, { "entropy": 6.489602088928223, "epoch": 1.0032104446465835, "grad_norm": 1.421875, "learning_rate": 0.0004909496556546544, "loss": 6.2537, "mean_token_accuracy": 0.13361010998487471, "num_tokens": 20291147.0, "step": 9375 }, { "entropy": 6.506109571456909, "epoch": 1.0037455187543476, "grad_norm": 1.7109375, "learning_rate": 0.0004909389179090238, "loss": 6.3279, "mean_token_accuracy": 0.13419800773262977, "num_tokens": 20301095.0, "step": 9380 }, { "entropy": 6.544373941421509, "epoch": 1.0042805928621115, "grad_norm": 2.46875, "learning_rate": 0.0004909281739281871, "loss": 6.327, "mean_token_accuracy": 0.13655227348208426, "num_tokens": 20311216.0, "step": 9385 }, { "entropy": 6.626815271377564, "epoch": 1.0048156669698753, "grad_norm": 1.7109375, "learning_rate": 0.0004909174237124548, "loss": 6.3962, "mean_token_accuracy": 0.1186282604932785, "num_tokens": 20321719.0, "step": 9390 }, { "entropy": 6.612100839614868, "epoch": 1.0053507410776392, "grad_norm": 1.6484375, "learning_rate": 0.0004909066672621372, "loss": 6.3819, "mean_token_accuracy": 0.1340535432100296, "num_tokens": 20331997.0, "step": 9395 }, { "entropy": 6.547275447845459, "epoch": 1.005885815185403, "grad_norm": 1.609375, "learning_rate": 0.0004908959045775449, "loss": 6.4149, "mean_token_accuracy": 0.126530484855175, "num_tokens": 20342973.0, "step": 9400 }, { "entropy": 6.510686302185059, "epoch": 1.0064208892931672, "grad_norm": 1.4453125, "learning_rate": 0.0004908851356589887, "loss": 6.3041, "mean_token_accuracy": 0.13099054470658303, "num_tokens": 20352652.0, "step": 9405 }, { "entropy": 6.583318471908569, "epoch": 1.006955963400931, "grad_norm": 1.421875, "learning_rate": 0.0004908743605067796, "loss": 6.3757, "mean_token_accuracy": 0.13030261918902397, "num_tokens": 20364577.0, "step": 9410 }, { "entropy": 6.587148284912109, "epoch": 1.007491037508695, "grad_norm": 1.6015625, "learning_rate": 0.0004908635791212287, "loss": 6.4133, "mean_token_accuracy": 0.1268289640545845, "num_tokens": 20375451.0, "step": 9415 }, { "entropy": 6.597857093811035, "epoch": 1.0080261116164588, "grad_norm": 1.9609375, "learning_rate": 0.0004908527915026472, "loss": 6.3258, "mean_token_accuracy": 0.1297917626798153, "num_tokens": 20385174.0, "step": 9420 }, { "entropy": 6.577202701568604, "epoch": 1.0085611857242227, "grad_norm": 1.6796875, "learning_rate": 0.0004908419976513467, "loss": 6.2784, "mean_token_accuracy": 0.13403301909565926, "num_tokens": 20395710.0, "step": 9425 }, { "entropy": 6.479523420333862, "epoch": 1.0090962598319868, "grad_norm": 1.484375, "learning_rate": 0.0004908311975676388, "loss": 6.2838, "mean_token_accuracy": 0.1319771207869053, "num_tokens": 20406572.0, "step": 9430 }, { "entropy": 6.497412395477295, "epoch": 1.0096313339397507, "grad_norm": 1.59375, "learning_rate": 0.0004908203912518355, "loss": 6.2668, "mean_token_accuracy": 0.14010654836893083, "num_tokens": 20417786.0, "step": 9435 }, { "entropy": 6.63450174331665, "epoch": 1.0101664080475146, "grad_norm": 2.1875, "learning_rate": 0.0004908095787042487, "loss": 6.3222, "mean_token_accuracy": 0.12953511774539947, "num_tokens": 20427680.0, "step": 9440 }, { "entropy": 6.517748641967773, "epoch": 1.0107014821552784, "grad_norm": 1.4921875, "learning_rate": 0.0004907987599251907, "loss": 6.3061, "mean_token_accuracy": 0.1292630322277546, "num_tokens": 20438640.0, "step": 9445 }, { "entropy": 6.547880840301514, "epoch": 1.0112365562630425, "grad_norm": 2.171875, "learning_rate": 0.0004907879349149737, "loss": 6.3195, "mean_token_accuracy": 0.1381923846900463, "num_tokens": 20449939.0, "step": 9450 }, { "entropy": 6.499249458312988, "epoch": 1.0117716303708064, "grad_norm": 2.15625, "learning_rate": 0.0004907771036739105, "loss": 6.2544, "mean_token_accuracy": 0.1351288966834545, "num_tokens": 20460845.0, "step": 9455 }, { "entropy": 6.507327079772949, "epoch": 1.0123067044785703, "grad_norm": 1.4140625, "learning_rate": 0.0004907662662023137, "loss": 6.3992, "mean_token_accuracy": 0.1253681182861328, "num_tokens": 20472407.0, "step": 9460 }, { "entropy": 6.543278932571411, "epoch": 1.0128417785863342, "grad_norm": 2.484375, "learning_rate": 0.0004907554225004962, "loss": 6.3928, "mean_token_accuracy": 0.12943721190094948, "num_tokens": 20483192.0, "step": 9465 }, { "entropy": 6.645859479904175, "epoch": 1.013376852694098, "grad_norm": 4.03125, "learning_rate": 0.0004907445725687714, "loss": 6.4457, "mean_token_accuracy": 0.12626103758811952, "num_tokens": 20493498.0, "step": 9470 }, { "entropy": 6.599184513092041, "epoch": 1.0139119268018622, "grad_norm": 1.8984375, "learning_rate": 0.0004907337164074523, "loss": 6.3523, "mean_token_accuracy": 0.13376811072230338, "num_tokens": 20503781.0, "step": 9475 }, { "entropy": 6.534925746917724, "epoch": 1.014447000909626, "grad_norm": 1.625, "learning_rate": 0.0004907228540168523, "loss": 6.4217, "mean_token_accuracy": 0.1251296542584896, "num_tokens": 20515142.0, "step": 9480 }, { "entropy": 6.585486030578613, "epoch": 1.01498207501739, "grad_norm": 1.609375, "learning_rate": 0.0004907119853972854, "loss": 6.3807, "mean_token_accuracy": 0.12869108244776725, "num_tokens": 20527568.0, "step": 9485 }, { "entropy": 6.50612735748291, "epoch": 1.0155171491251538, "grad_norm": 1.796875, "learning_rate": 0.0004907011105490651, "loss": 6.2661, "mean_token_accuracy": 0.1366148717701435, "num_tokens": 20538198.0, "step": 9490 }, { "entropy": 6.540985012054444, "epoch": 1.0160522232329177, "grad_norm": 1.3828125, "learning_rate": 0.0004906902294725056, "loss": 6.2605, "mean_token_accuracy": 0.13617482855916024, "num_tokens": 20549355.0, "step": 9495 }, { "entropy": 6.516599655151367, "epoch": 1.0165872973406818, "grad_norm": 1.53125, "learning_rate": 0.000490679342167921, "loss": 6.391, "mean_token_accuracy": 0.12939720898866652, "num_tokens": 20558984.0, "step": 9500 }, { "entropy": 6.594373750686645, "epoch": 1.0171223714484456, "grad_norm": 2.140625, "learning_rate": 0.0004906684486356258, "loss": 6.4106, "mean_token_accuracy": 0.12316248491406441, "num_tokens": 20570143.0, "step": 9505 }, { "entropy": 6.620317459106445, "epoch": 1.0176574455562095, "grad_norm": 1.421875, "learning_rate": 0.0004906575488759343, "loss": 6.386, "mean_token_accuracy": 0.12629298642277717, "num_tokens": 20580973.0, "step": 9510 }, { "entropy": 6.574526023864746, "epoch": 1.0181925196639734, "grad_norm": 1.359375, "learning_rate": 0.0004906466428891616, "loss": 6.3549, "mean_token_accuracy": 0.1243422269821167, "num_tokens": 20591473.0, "step": 9515 }, { "entropy": 6.545525693893433, "epoch": 1.0187275937717375, "grad_norm": 1.640625, "learning_rate": 0.0004906357306756222, "loss": 6.3223, "mean_token_accuracy": 0.1300820916891098, "num_tokens": 20602347.0, "step": 9520 }, { "entropy": 6.587276935577393, "epoch": 1.0192626678795014, "grad_norm": 1.5859375, "learning_rate": 0.0004906248122356315, "loss": 6.3774, "mean_token_accuracy": 0.13239624947309495, "num_tokens": 20613168.0, "step": 9525 }, { "entropy": 6.53687310218811, "epoch": 1.0197977419872652, "grad_norm": 13.375, "learning_rate": 0.0004906138875695045, "loss": 6.2746, "mean_token_accuracy": 0.13048959001898766, "num_tokens": 20623523.0, "step": 9530 }, { "entropy": 6.475817775726318, "epoch": 1.0203328160950291, "grad_norm": 1.4765625, "learning_rate": 0.0004906029566775569, "loss": 6.3045, "mean_token_accuracy": 0.13328663110733033, "num_tokens": 20634085.0, "step": 9535 }, { "entropy": 6.563428783416748, "epoch": 1.020867890202793, "grad_norm": 1.4453125, "learning_rate": 0.0004905920195601042, "loss": 6.3953, "mean_token_accuracy": 0.128290406614542, "num_tokens": 20644747.0, "step": 9540 }, { "entropy": 6.546395969390869, "epoch": 1.021402964310557, "grad_norm": 2.15625, "learning_rate": 0.0004905810762174622, "loss": 6.301, "mean_token_accuracy": 0.12163680791854858, "num_tokens": 20655704.0, "step": 9545 }, { "entropy": 6.570021915435791, "epoch": 1.021938038418321, "grad_norm": 1.4375, "learning_rate": 0.0004905701266499469, "loss": 6.3183, "mean_token_accuracy": 0.13585362434387208, "num_tokens": 20665844.0, "step": 9550 }, { "entropy": 6.592724752426148, "epoch": 1.0224731125260849, "grad_norm": 1.5859375, "learning_rate": 0.0004905591708578746, "loss": 6.4285, "mean_token_accuracy": 0.12019759565591812, "num_tokens": 20676921.0, "step": 9555 }, { "entropy": 6.617676448822022, "epoch": 1.0230081866338487, "grad_norm": 2.09375, "learning_rate": 0.0004905482088415615, "loss": 6.3741, "mean_token_accuracy": 0.12580151185393335, "num_tokens": 20688476.0, "step": 9560 }, { "entropy": 6.616480588912964, "epoch": 1.0235432607416126, "grad_norm": 2.03125, "learning_rate": 0.0004905372406013241, "loss": 6.3717, "mean_token_accuracy": 0.1287165805697441, "num_tokens": 20698588.0, "step": 9565 }, { "entropy": 6.528187704086304, "epoch": 1.0240783348493767, "grad_norm": 2.40625, "learning_rate": 0.0004905262661374792, "loss": 6.3716, "mean_token_accuracy": 0.13266078233718873, "num_tokens": 20709181.0, "step": 9570 }, { "entropy": 6.4876031398773195, "epoch": 1.0246134089571406, "grad_norm": 1.5703125, "learning_rate": 0.0004905152854503436, "loss": 6.2812, "mean_token_accuracy": 0.13735133409500122, "num_tokens": 20719724.0, "step": 9575 }, { "entropy": 6.579593276977539, "epoch": 1.0251484830649045, "grad_norm": 1.625, "learning_rate": 0.0004905042985402345, "loss": 6.3951, "mean_token_accuracy": 0.12752212211489677, "num_tokens": 20730548.0, "step": 9580 }, { "entropy": 6.5738812446594235, "epoch": 1.0256835571726683, "grad_norm": 1.4765625, "learning_rate": 0.000490493305407469, "loss": 6.3659, "mean_token_accuracy": 0.12526717260479928, "num_tokens": 20742124.0, "step": 9585 }, { "entropy": 6.638371753692627, "epoch": 1.0262186312804324, "grad_norm": 1.7265625, "learning_rate": 0.0004904823060523646, "loss": 6.4466, "mean_token_accuracy": 0.12435985058546066, "num_tokens": 20753313.0, "step": 9590 }, { "entropy": 6.6241978168487545, "epoch": 1.0267537053881963, "grad_norm": 1.46875, "learning_rate": 0.0004904713004752389, "loss": 6.3906, "mean_token_accuracy": 0.1303039439022541, "num_tokens": 20763539.0, "step": 9595 }, { "entropy": 6.558483028411866, "epoch": 1.0272887794959602, "grad_norm": 1.7109375, "learning_rate": 0.0004904602886764097, "loss": 6.4966, "mean_token_accuracy": 0.1237233228981495, "num_tokens": 20775849.0, "step": 9600 }, { "entropy": 6.523603439331055, "epoch": 1.027823853603724, "grad_norm": 1.375, "learning_rate": 0.0004904492706561948, "loss": 6.3649, "mean_token_accuracy": 0.12396602630615235, "num_tokens": 20787460.0, "step": 9605 }, { "entropy": 6.61628360748291, "epoch": 1.028358927711488, "grad_norm": 1.3671875, "learning_rate": 0.0004904382464149127, "loss": 6.2844, "mean_token_accuracy": 0.13349589630961417, "num_tokens": 20798478.0, "step": 9610 }, { "entropy": 6.609794998168946, "epoch": 1.028894001819252, "grad_norm": 1.6015625, "learning_rate": 0.0004904272159528814, "loss": 6.3822, "mean_token_accuracy": 0.12963185608386993, "num_tokens": 20809730.0, "step": 9615 }, { "entropy": 6.557106971740723, "epoch": 1.029429075927016, "grad_norm": 1.515625, "learning_rate": 0.0004904161792704195, "loss": 6.3541, "mean_token_accuracy": 0.13708847612142563, "num_tokens": 20821438.0, "step": 9620 }, { "entropy": 6.5635278701782225, "epoch": 1.0299641500347798, "grad_norm": 1.359375, "learning_rate": 0.0004904051363678457, "loss": 6.3385, "mean_token_accuracy": 0.12266776263713837, "num_tokens": 20832328.0, "step": 9625 }, { "entropy": 6.50533971786499, "epoch": 1.0304992241425437, "grad_norm": 1.3984375, "learning_rate": 0.0004903940872454789, "loss": 6.3222, "mean_token_accuracy": 0.1316038779914379, "num_tokens": 20843956.0, "step": 9630 }, { "entropy": 6.623028230667114, "epoch": 1.0310342982503076, "grad_norm": 2.578125, "learning_rate": 0.0004903830319036381, "loss": 6.3571, "mean_token_accuracy": 0.13210696056485177, "num_tokens": 20854578.0, "step": 9635 }, { "entropy": 6.519392490386963, "epoch": 1.0315693723580717, "grad_norm": 1.6640625, "learning_rate": 0.0004903719703426425, "loss": 6.2925, "mean_token_accuracy": 0.1291162833571434, "num_tokens": 20865190.0, "step": 9640 }, { "entropy": 6.5408073425292965, "epoch": 1.0321044464658355, "grad_norm": 1.4140625, "learning_rate": 0.0004903609025628115, "loss": 6.3185, "mean_token_accuracy": 0.12836557105183602, "num_tokens": 20875733.0, "step": 9645 }, { "entropy": 6.474796438217163, "epoch": 1.0326395205735994, "grad_norm": 1.59375, "learning_rate": 0.0004903498285644647, "loss": 6.3463, "mean_token_accuracy": 0.1265176258981228, "num_tokens": 20886900.0, "step": 9650 }, { "entropy": 6.55428729057312, "epoch": 1.0331745946813633, "grad_norm": 1.7421875, "learning_rate": 0.0004903387483479219, "loss": 6.393, "mean_token_accuracy": 0.12576237097382545, "num_tokens": 20898125.0, "step": 9655 }, { "entropy": 6.662082672119141, "epoch": 1.0337096687891274, "grad_norm": 1.4375, "learning_rate": 0.0004903276619135029, "loss": 6.4162, "mean_token_accuracy": 0.1248619869351387, "num_tokens": 20909788.0, "step": 9660 }, { "entropy": 6.666777038574219, "epoch": 1.0342447428968913, "grad_norm": 1.7578125, "learning_rate": 0.000490316569261528, "loss": 6.3944, "mean_token_accuracy": 0.12725045755505562, "num_tokens": 20921853.0, "step": 9665 }, { "entropy": 6.609588003158569, "epoch": 1.0347798170046552, "grad_norm": 1.359375, "learning_rate": 0.0004903054703923175, "loss": 6.3839, "mean_token_accuracy": 0.12214237824082375, "num_tokens": 20932574.0, "step": 9670 }, { "entropy": 6.505526494979859, "epoch": 1.035314891112419, "grad_norm": 1.3984375, "learning_rate": 0.0004902943653061916, "loss": 6.363, "mean_token_accuracy": 0.12515838891267778, "num_tokens": 20943458.0, "step": 9675 }, { "entropy": 6.551134777069092, "epoch": 1.035849965220183, "grad_norm": 1.421875, "learning_rate": 0.0004902832540034712, "loss": 6.3033, "mean_token_accuracy": 0.13630713000893593, "num_tokens": 20953213.0, "step": 9680 }, { "entropy": 6.527917861938477, "epoch": 1.036385039327947, "grad_norm": 1.25, "learning_rate": 0.0004902721364844773, "loss": 6.3385, "mean_token_accuracy": 0.12731200829148293, "num_tokens": 20963885.0, "step": 9685 }, { "entropy": 6.504400396347046, "epoch": 1.0369201134357109, "grad_norm": 1.734375, "learning_rate": 0.0004902610127495305, "loss": 6.3594, "mean_token_accuracy": 0.1349087744951248, "num_tokens": 20975529.0, "step": 9690 }, { "entropy": 6.549321889877319, "epoch": 1.0374551875434748, "grad_norm": 1.3125, "learning_rate": 0.0004902498827989523, "loss": 6.3136, "mean_token_accuracy": 0.13757401034235955, "num_tokens": 20985279.0, "step": 9695 }, { "entropy": 6.609812068939209, "epoch": 1.0379902616512386, "grad_norm": 1.1640625, "learning_rate": 0.0004902387466330639, "loss": 6.3633, "mean_token_accuracy": 0.13019999638199806, "num_tokens": 20995818.0, "step": 9700 }, { "entropy": 6.4939371109008786, "epoch": 1.0385253357590025, "grad_norm": 1.3203125, "learning_rate": 0.000490227604252187, "loss": 6.2606, "mean_token_accuracy": 0.13090986832976342, "num_tokens": 21006786.0, "step": 9705 }, { "entropy": 6.515184926986694, "epoch": 1.0390604098667666, "grad_norm": 1.453125, "learning_rate": 0.0004902164556566433, "loss": 6.328, "mean_token_accuracy": 0.13896063342690468, "num_tokens": 21017441.0, "step": 9710 }, { "entropy": 6.437628364562988, "epoch": 1.0395954839745305, "grad_norm": 1.296875, "learning_rate": 0.0004902053008467546, "loss": 6.2063, "mean_token_accuracy": 0.13861987590789795, "num_tokens": 21027812.0, "step": 9715 }, { "entropy": 6.534468650817871, "epoch": 1.0401305580822944, "grad_norm": 1.8359375, "learning_rate": 0.0004901941398228431, "loss": 6.3941, "mean_token_accuracy": 0.13089548125863076, "num_tokens": 21038960.0, "step": 9720 }, { "entropy": 6.597829294204712, "epoch": 1.0406656321900583, "grad_norm": 1.3984375, "learning_rate": 0.0004901829725852311, "loss": 6.3574, "mean_token_accuracy": 0.13462072163820266, "num_tokens": 21050467.0, "step": 9725 }, { "entropy": 6.52369499206543, "epoch": 1.0412007062978224, "grad_norm": 1.3046875, "learning_rate": 0.000490171799134241, "loss": 6.2819, "mean_token_accuracy": 0.12630092725157738, "num_tokens": 21061208.0, "step": 9730 }, { "entropy": 6.523263645172119, "epoch": 1.0417357804055862, "grad_norm": 1.78125, "learning_rate": 0.0004901606194701954, "loss": 6.3792, "mean_token_accuracy": 0.13332309275865556, "num_tokens": 21072872.0, "step": 9735 }, { "entropy": 6.555621576309204, "epoch": 1.04227085451335, "grad_norm": 1.40625, "learning_rate": 0.0004901494335934172, "loss": 6.3524, "mean_token_accuracy": 0.13275277987122536, "num_tokens": 21084878.0, "step": 9740 }, { "entropy": 6.6262726306915285, "epoch": 1.042805928621114, "grad_norm": 1.765625, "learning_rate": 0.0004901382415042293, "loss": 6.3732, "mean_token_accuracy": 0.12680527493357657, "num_tokens": 21095289.0, "step": 9745 }, { "entropy": 6.616176795959473, "epoch": 1.0433410027288779, "grad_norm": 1.640625, "learning_rate": 0.0004901270432029549, "loss": 6.3371, "mean_token_accuracy": 0.1305427983403206, "num_tokens": 21106077.0, "step": 9750 }, { "entropy": 6.423315238952637, "epoch": 1.043876076836642, "grad_norm": 1.34375, "learning_rate": 0.0004901158386899174, "loss": 6.2562, "mean_token_accuracy": 0.13529875352978707, "num_tokens": 21116548.0, "step": 9755 }, { "entropy": 6.516621541976929, "epoch": 1.0444111509444058, "grad_norm": 1.5078125, "learning_rate": 0.0004901046279654402, "loss": 6.2808, "mean_token_accuracy": 0.13983293026685714, "num_tokens": 21126163.0, "step": 9760 }, { "entropy": 6.61842679977417, "epoch": 1.0449462250521697, "grad_norm": 1.546875, "learning_rate": 0.0004900934110298471, "loss": 6.385, "mean_token_accuracy": 0.12512520104646682, "num_tokens": 21136830.0, "step": 9765 }, { "entropy": 6.571760177612305, "epoch": 1.0454812991599336, "grad_norm": 1.5859375, "learning_rate": 0.0004900821878834621, "loss": 6.3308, "mean_token_accuracy": 0.1342024587094784, "num_tokens": 21146793.0, "step": 9770 }, { "entropy": 6.573628664016724, "epoch": 1.0460163732676975, "grad_norm": 1.4375, "learning_rate": 0.000490070958526609, "loss": 6.3792, "mean_token_accuracy": 0.13071634098887444, "num_tokens": 21156799.0, "step": 9775 }, { "entropy": 6.540488243103027, "epoch": 1.0465514473754616, "grad_norm": 1.4453125, "learning_rate": 0.0004900597229596124, "loss": 6.3793, "mean_token_accuracy": 0.12690124064683914, "num_tokens": 21167757.0, "step": 9780 }, { "entropy": 6.6183329105377195, "epoch": 1.0470865214832255, "grad_norm": 2.046875, "learning_rate": 0.0004900484811827963, "loss": 6.3829, "mean_token_accuracy": 0.12883857786655425, "num_tokens": 21178832.0, "step": 9785 }, { "entropy": 6.58182463645935, "epoch": 1.0476215955909893, "grad_norm": 1.3203125, "learning_rate": 0.0004900372331964856, "loss": 6.2876, "mean_token_accuracy": 0.13159751370549203, "num_tokens": 21189637.0, "step": 9790 }, { "entropy": 6.507457113265991, "epoch": 1.0481566696987532, "grad_norm": 1.6484375, "learning_rate": 0.000490025979001005, "loss": 6.321, "mean_token_accuracy": 0.13030252754688262, "num_tokens": 21200194.0, "step": 9795 }, { "entropy": 6.490743494033813, "epoch": 1.0486917438065173, "grad_norm": 2.484375, "learning_rate": 0.0004900147185966795, "loss": 6.2775, "mean_token_accuracy": 0.13105009645223617, "num_tokens": 21211405.0, "step": 9800 }, { "entropy": 6.59748592376709, "epoch": 1.0492268179142812, "grad_norm": 2.15625, "learning_rate": 0.0004900034519838342, "loss": 6.3228, "mean_token_accuracy": 0.12743570655584335, "num_tokens": 21222722.0, "step": 9805 }, { "entropy": 6.541789150238037, "epoch": 1.049761892022045, "grad_norm": 1.734375, "learning_rate": 0.0004899921791627945, "loss": 6.2748, "mean_token_accuracy": 0.13372819796204566, "num_tokens": 21233510.0, "step": 9810 }, { "entropy": 6.541411399841309, "epoch": 1.050296966129809, "grad_norm": 2.4375, "learning_rate": 0.0004899809001338857, "loss": 6.4169, "mean_token_accuracy": 0.12047207728028297, "num_tokens": 21243235.0, "step": 9815 }, { "entropy": 6.536032104492188, "epoch": 1.0508320402375728, "grad_norm": 1.453125, "learning_rate": 0.0004899696148974338, "loss": 6.3156, "mean_token_accuracy": 0.13035102561116219, "num_tokens": 21254680.0, "step": 9820 }, { "entropy": 6.51158652305603, "epoch": 1.051367114345337, "grad_norm": 1.8046875, "learning_rate": 0.0004899583234537644, "loss": 6.3057, "mean_token_accuracy": 0.13114088550209999, "num_tokens": 21265116.0, "step": 9825 }, { "entropy": 6.5533318519592285, "epoch": 1.0519021884531008, "grad_norm": 1.5078125, "learning_rate": 0.0004899470258032034, "loss": 6.3005, "mean_token_accuracy": 0.13146693632006645, "num_tokens": 21277066.0, "step": 9830 }, { "entropy": 6.582359695434571, "epoch": 1.0524372625608647, "grad_norm": 1.6484375, "learning_rate": 0.0004899357219460775, "loss": 6.3492, "mean_token_accuracy": 0.13322116136550904, "num_tokens": 21287332.0, "step": 9835 }, { "entropy": 6.456721401214599, "epoch": 1.0529723366686286, "grad_norm": 1.609375, "learning_rate": 0.0004899244118827128, "loss": 6.3403, "mean_token_accuracy": 0.13221352621912957, "num_tokens": 21298377.0, "step": 9840 }, { "entropy": 6.571355152130127, "epoch": 1.0535074107763924, "grad_norm": 1.4375, "learning_rate": 0.0004899130956134358, "loss": 6.3453, "mean_token_accuracy": 0.13347491770982742, "num_tokens": 21309966.0, "step": 9845 }, { "entropy": 6.511975812911987, "epoch": 1.0540424848841565, "grad_norm": 1.3984375, "learning_rate": 0.0004899017731385735, "loss": 6.2418, "mean_token_accuracy": 0.13985393643379213, "num_tokens": 21320399.0, "step": 9850 }, { "entropy": 6.545067501068115, "epoch": 1.0545775589919204, "grad_norm": 1.421875, "learning_rate": 0.0004898904444584527, "loss": 6.3461, "mean_token_accuracy": 0.1301308900117874, "num_tokens": 21331716.0, "step": 9855 }, { "entropy": 6.575881576538086, "epoch": 1.0551126330996843, "grad_norm": 1.546875, "learning_rate": 0.0004898791095734004, "loss": 6.3749, "mean_token_accuracy": 0.12489353939890861, "num_tokens": 21341664.0, "step": 9860 }, { "entropy": 6.569723415374756, "epoch": 1.0556477072074482, "grad_norm": 1.8515625, "learning_rate": 0.000489867768483744, "loss": 6.338, "mean_token_accuracy": 0.12841244488954545, "num_tokens": 21352220.0, "step": 9865 }, { "entropy": 6.63442759513855, "epoch": 1.0561827813152123, "grad_norm": 1.9921875, "learning_rate": 0.0004898564211898111, "loss": 6.4478, "mean_token_accuracy": 0.12361843287944793, "num_tokens": 21363947.0, "step": 9870 }, { "entropy": 6.601479339599609, "epoch": 1.0567178554229761, "grad_norm": 2.140625, "learning_rate": 0.0004898450676919291, "loss": 6.3254, "mean_token_accuracy": 0.13290739953517913, "num_tokens": 21374011.0, "step": 9875 }, { "entropy": 6.56652512550354, "epoch": 1.05725292953074, "grad_norm": 1.640625, "learning_rate": 0.000489833707990426, "loss": 6.3864, "mean_token_accuracy": 0.1321233369410038, "num_tokens": 21384232.0, "step": 9880 }, { "entropy": 6.523163557052612, "epoch": 1.057788003638504, "grad_norm": 1.8671875, "learning_rate": 0.0004898223420856298, "loss": 6.3445, "mean_token_accuracy": 0.12886636033654214, "num_tokens": 21395928.0, "step": 9885 }, { "entropy": 6.558263635635376, "epoch": 1.0583230777462678, "grad_norm": 1.484375, "learning_rate": 0.0004898109699778686, "loss": 6.3513, "mean_token_accuracy": 0.1277891717851162, "num_tokens": 21406391.0, "step": 9890 }, { "entropy": 6.548861646652222, "epoch": 1.0588581518540319, "grad_norm": 1.5234375, "learning_rate": 0.000489799591667471, "loss": 6.398, "mean_token_accuracy": 0.1259136602282524, "num_tokens": 21417859.0, "step": 9895 }, { "entropy": 6.499192619323731, "epoch": 1.0593932259617957, "grad_norm": 1.8125, "learning_rate": 0.0004897882071547651, "loss": 6.2456, "mean_token_accuracy": 0.13391533121466637, "num_tokens": 21428284.0, "step": 9900 }, { "entropy": 6.542983675003052, "epoch": 1.0599283000695596, "grad_norm": 1.515625, "learning_rate": 0.0004897768164400801, "loss": 6.3857, "mean_token_accuracy": 0.12659377828240395, "num_tokens": 21439610.0, "step": 9905 }, { "entropy": 6.6037352085113525, "epoch": 1.0604633741773235, "grad_norm": 1.328125, "learning_rate": 0.0004897654195237446, "loss": 6.4036, "mean_token_accuracy": 0.1266575463116169, "num_tokens": 21449319.0, "step": 9910 }, { "entropy": 6.607220649719238, "epoch": 1.0609984482850874, "grad_norm": 2.078125, "learning_rate": 0.0004897540164060879, "loss": 6.3995, "mean_token_accuracy": 0.13648231849074363, "num_tokens": 21459851.0, "step": 9915 }, { "entropy": 6.528581809997559, "epoch": 1.0615335223928515, "grad_norm": 1.6953125, "learning_rate": 0.0004897426070874392, "loss": 6.3445, "mean_token_accuracy": 0.13578662425279617, "num_tokens": 21469717.0, "step": 9920 }, { "entropy": 6.5819432735443115, "epoch": 1.0620685965006154, "grad_norm": 1.578125, "learning_rate": 0.0004897311915681278, "loss": 6.4526, "mean_token_accuracy": 0.12497929334640503, "num_tokens": 21480815.0, "step": 9925 }, { "entropy": 6.634674501419068, "epoch": 1.0626036706083792, "grad_norm": 1.7578125, "learning_rate": 0.0004897197698484834, "loss": 6.3432, "mean_token_accuracy": 0.129038904607296, "num_tokens": 21492000.0, "step": 9930 }, { "entropy": 6.515308094024658, "epoch": 1.0631387447161431, "grad_norm": 1.53125, "learning_rate": 0.0004897083419288358, "loss": 6.329, "mean_token_accuracy": 0.12596094235777855, "num_tokens": 21502006.0, "step": 9935 }, { "entropy": 6.500771331787109, "epoch": 1.0636738188239072, "grad_norm": 1.5703125, "learning_rate": 0.000489696907809515, "loss": 6.362, "mean_token_accuracy": 0.13541009426116943, "num_tokens": 21513066.0, "step": 9940 }, { "entropy": 6.547796964645386, "epoch": 1.064208892931671, "grad_norm": 1.84375, "learning_rate": 0.0004896854674908512, "loss": 6.3618, "mean_token_accuracy": 0.1268548533320427, "num_tokens": 21524853.0, "step": 9945 }, { "entropy": 6.571991872787476, "epoch": 1.064743967039435, "grad_norm": 1.6640625, "learning_rate": 0.0004896740209731746, "loss": 6.2734, "mean_token_accuracy": 0.13072544783353807, "num_tokens": 21536497.0, "step": 9950 }, { "entropy": 6.4796923160552975, "epoch": 1.0652790411471988, "grad_norm": 1.625, "learning_rate": 0.0004896625682568159, "loss": 6.298, "mean_token_accuracy": 0.13346593901515008, "num_tokens": 21546213.0, "step": 9955 }, { "entropy": 6.449840402603149, "epoch": 1.0658141152549627, "grad_norm": 1.578125, "learning_rate": 0.0004896511093421057, "loss": 6.2963, "mean_token_accuracy": 0.13981223478913307, "num_tokens": 21556990.0, "step": 9960 }, { "entropy": 6.532204484939575, "epoch": 1.0663491893627268, "grad_norm": 1.6953125, "learning_rate": 0.0004896396442293749, "loss": 6.3005, "mean_token_accuracy": 0.1295848861336708, "num_tokens": 21567567.0, "step": 9965 }, { "entropy": 6.556431913375855, "epoch": 1.0668842634704907, "grad_norm": 1.40625, "learning_rate": 0.0004896281729189544, "loss": 6.3226, "mean_token_accuracy": 0.1309622846543789, "num_tokens": 21577457.0, "step": 9970 }, { "entropy": 6.5115550518035885, "epoch": 1.0674193375782546, "grad_norm": 1.46875, "learning_rate": 0.0004896166954111758, "loss": 6.3167, "mean_token_accuracy": 0.13812632784247397, "num_tokens": 21588173.0, "step": 9975 }, { "entropy": 6.543576431274414, "epoch": 1.0679544116860185, "grad_norm": 1.5703125, "learning_rate": 0.00048960521170637, "loss": 6.3571, "mean_token_accuracy": 0.12762073799967766, "num_tokens": 21599154.0, "step": 9980 }, { "entropy": 6.546718549728394, "epoch": 1.0684894857937826, "grad_norm": 1.5078125, "learning_rate": 0.0004895937218048692, "loss": 6.4033, "mean_token_accuracy": 0.12653964534401893, "num_tokens": 21610134.0, "step": 9985 }, { "entropy": 6.515305852890014, "epoch": 1.0690245599015464, "grad_norm": 1.4296875, "learning_rate": 0.0004895822257070046, "loss": 6.2694, "mean_token_accuracy": 0.131786098331213, "num_tokens": 21619989.0, "step": 9990 }, { "entropy": 6.557422780990601, "epoch": 1.0695596340093103, "grad_norm": 1.796875, "learning_rate": 0.0004895707234131084, "loss": 6.3205, "mean_token_accuracy": 0.1355228066444397, "num_tokens": 21632707.0, "step": 9995 }, { "entropy": 6.578034830093384, "epoch": 1.0700947081170742, "grad_norm": 1.4921875, "learning_rate": 0.0004895592149235128, "loss": 6.2954, "mean_token_accuracy": 0.1315545454621315, "num_tokens": 21643001.0, "step": 10000 }, { "entropy": 6.560757112503052, "epoch": 1.070629782224838, "grad_norm": 1.375, "learning_rate": 0.00048954770023855, "loss": 6.366, "mean_token_accuracy": 0.12268463671207427, "num_tokens": 21653425.0, "step": 10005 }, { "entropy": 6.578395557403565, "epoch": 1.0711648563326022, "grad_norm": 1.4140625, "learning_rate": 0.0004895361793585525, "loss": 6.3953, "mean_token_accuracy": 0.1271112874150276, "num_tokens": 21664212.0, "step": 10010 }, { "entropy": 6.552493667602539, "epoch": 1.071699930440366, "grad_norm": 1.8046875, "learning_rate": 0.0004895246522838529, "loss": 6.382, "mean_token_accuracy": 0.12997190952301024, "num_tokens": 21675564.0, "step": 10015 }, { "entropy": 6.538548183441162, "epoch": 1.07223500454813, "grad_norm": 1.5078125, "learning_rate": 0.0004895131190147842, "loss": 6.3603, "mean_token_accuracy": 0.13544045239686966, "num_tokens": 21686225.0, "step": 10020 }, { "entropy": 6.533993816375732, "epoch": 1.0727700786558938, "grad_norm": 1.828125, "learning_rate": 0.0004895015795516793, "loss": 6.287, "mean_token_accuracy": 0.13008347228169442, "num_tokens": 21697479.0, "step": 10025 }, { "entropy": 6.575708866119385, "epoch": 1.0733051527636577, "grad_norm": 1.96875, "learning_rate": 0.0004894900338948714, "loss": 6.3983, "mean_token_accuracy": 0.12802261039614676, "num_tokens": 21708496.0, "step": 10030 }, { "entropy": 6.565115308761596, "epoch": 1.0738402268714218, "grad_norm": 1.6171875, "learning_rate": 0.0004894784820446939, "loss": 6.2653, "mean_token_accuracy": 0.1375642567873001, "num_tokens": 21718290.0, "step": 10035 }, { "entropy": 6.503127574920654, "epoch": 1.0743753009791857, "grad_norm": 2.015625, "learning_rate": 0.0004894669240014804, "loss": 6.2699, "mean_token_accuracy": 0.13177290111780166, "num_tokens": 21729185.0, "step": 10040 }, { "entropy": 6.518919229507446, "epoch": 1.0749103750869495, "grad_norm": 1.6484375, "learning_rate": 0.0004894553597655646, "loss": 6.3631, "mean_token_accuracy": 0.12472319975495338, "num_tokens": 21740787.0, "step": 10045 }, { "entropy": 6.650041389465332, "epoch": 1.0754454491947134, "grad_norm": 1.7265625, "learning_rate": 0.0004894437893372804, "loss": 6.4041, "mean_token_accuracy": 0.12599473372101783, "num_tokens": 21751804.0, "step": 10050 }, { "entropy": 6.662219142913818, "epoch": 1.0759805233024773, "grad_norm": 1.7890625, "learning_rate": 0.000489432212716962, "loss": 6.3336, "mean_token_accuracy": 0.12913210690021515, "num_tokens": 21762730.0, "step": 10055 }, { "entropy": 6.495162582397461, "epoch": 1.0765155974102414, "grad_norm": 1.921875, "learning_rate": 0.0004894206299049436, "loss": 6.3602, "mean_token_accuracy": 0.12958017587661744, "num_tokens": 21773470.0, "step": 10060 }, { "entropy": 6.566137409210205, "epoch": 1.0770506715180053, "grad_norm": 1.5390625, "learning_rate": 0.0004894090409015595, "loss": 6.3447, "mean_token_accuracy": 0.12679021656513215, "num_tokens": 21783385.0, "step": 10065 }, { "entropy": 6.519651746749878, "epoch": 1.0775857456257691, "grad_norm": 1.8125, "learning_rate": 0.0004893974457071445, "loss": 6.3623, "mean_token_accuracy": 0.1318201705813408, "num_tokens": 21794857.0, "step": 10070 }, { "entropy": 6.582787752151489, "epoch": 1.078120819733533, "grad_norm": 1.4609375, "learning_rate": 0.0004893858443220335, "loss": 6.3485, "mean_token_accuracy": 0.12606494948267938, "num_tokens": 21804296.0, "step": 10075 }, { "entropy": 6.57329306602478, "epoch": 1.0786558938412971, "grad_norm": 1.5234375, "learning_rate": 0.0004893742367465613, "loss": 6.36, "mean_token_accuracy": 0.12605967298150061, "num_tokens": 21815899.0, "step": 10080 }, { "entropy": 6.566723203659057, "epoch": 1.079190967949061, "grad_norm": 1.609375, "learning_rate": 0.0004893626229810631, "loss": 6.3356, "mean_token_accuracy": 0.1350504457950592, "num_tokens": 21825964.0, "step": 10085 }, { "entropy": 6.5852015018463135, "epoch": 1.0797260420568249, "grad_norm": 1.4921875, "learning_rate": 0.0004893510030258743, "loss": 6.4213, "mean_token_accuracy": 0.12873302549123763, "num_tokens": 21836656.0, "step": 10090 }, { "entropy": 6.59387173652649, "epoch": 1.0802611161645888, "grad_norm": 1.8515625, "learning_rate": 0.0004893393768813305, "loss": 6.421, "mean_token_accuracy": 0.12757074385881423, "num_tokens": 21847658.0, "step": 10095 }, { "entropy": 6.651180601119995, "epoch": 1.0807961902723526, "grad_norm": 1.4453125, "learning_rate": 0.0004893277445477673, "loss": 6.3916, "mean_token_accuracy": 0.12199634462594985, "num_tokens": 21858338.0, "step": 10100 }, { "entropy": 6.55932469367981, "epoch": 1.0813312643801167, "grad_norm": 1.703125, "learning_rate": 0.0004893161060255206, "loss": 6.2639, "mean_token_accuracy": 0.13296918123960494, "num_tokens": 21870656.0, "step": 10105 }, { "entropy": 6.572396087646484, "epoch": 1.0818663384878806, "grad_norm": 1.78125, "learning_rate": 0.0004893044613149263, "loss": 6.3623, "mean_token_accuracy": 0.13754768669605255, "num_tokens": 21881806.0, "step": 10110 }, { "entropy": 6.48524956703186, "epoch": 1.0824014125956445, "grad_norm": 1.515625, "learning_rate": 0.0004892928104163209, "loss": 6.2774, "mean_token_accuracy": 0.13149532154202462, "num_tokens": 21892277.0, "step": 10115 }, { "entropy": 6.491385459899902, "epoch": 1.0829364867034084, "grad_norm": 1.6875, "learning_rate": 0.0004892811533300407, "loss": 6.2985, "mean_token_accuracy": 0.13023179545998573, "num_tokens": 21903509.0, "step": 10120 }, { "entropy": 6.581822729110717, "epoch": 1.0834715608111725, "grad_norm": 4.3125, "learning_rate": 0.0004892694900564223, "loss": 6.406, "mean_token_accuracy": 0.12440016642212867, "num_tokens": 21914308.0, "step": 10125 }, { "entropy": 6.546678495407105, "epoch": 1.0840066349189363, "grad_norm": 2.890625, "learning_rate": 0.0004892578205958025, "loss": 6.2881, "mean_token_accuracy": 0.14137799441814422, "num_tokens": 21924302.0, "step": 10130 }, { "entropy": 6.530106067657471, "epoch": 1.0845417090267002, "grad_norm": 1.734375, "learning_rate": 0.0004892461449485182, "loss": 6.3636, "mean_token_accuracy": 0.12199231162667275, "num_tokens": 21935066.0, "step": 10135 }, { "entropy": 6.544826984405518, "epoch": 1.085076783134464, "grad_norm": 1.3984375, "learning_rate": 0.0004892344631149066, "loss": 6.2529, "mean_token_accuracy": 0.1391059972345829, "num_tokens": 21945798.0, "step": 10140 }, { "entropy": 6.537466096878052, "epoch": 1.085611857242228, "grad_norm": 2.796875, "learning_rate": 0.000489222775095305, "loss": 6.3677, "mean_token_accuracy": 0.12511541321873665, "num_tokens": 21955667.0, "step": 10145 }, { "entropy": 6.5176506519317625, "epoch": 1.086146931349992, "grad_norm": 1.828125, "learning_rate": 0.0004892110808900509, "loss": 6.3526, "mean_token_accuracy": 0.12824971377849578, "num_tokens": 21966107.0, "step": 10150 }, { "entropy": 6.5623456001281735, "epoch": 1.086682005457756, "grad_norm": 1.8359375, "learning_rate": 0.0004891993804994818, "loss": 6.3372, "mean_token_accuracy": 0.13260870128870011, "num_tokens": 21976408.0, "step": 10155 }, { "entropy": 6.648627758026123, "epoch": 1.0872170795655198, "grad_norm": 2.125, "learning_rate": 0.0004891876739239358, "loss": 6.3238, "mean_token_accuracy": 0.13422903493046762, "num_tokens": 21986481.0, "step": 10160 }, { "entropy": 6.541556930541992, "epoch": 1.0877521536732837, "grad_norm": 1.6953125, "learning_rate": 0.0004891759611637508, "loss": 6.3798, "mean_token_accuracy": 0.1273925334215164, "num_tokens": 21997554.0, "step": 10165 }, { "entropy": 6.594119644165039, "epoch": 1.0882872277810476, "grad_norm": 1.6328125, "learning_rate": 0.000489164242219265, "loss": 6.4354, "mean_token_accuracy": 0.12317250669002533, "num_tokens": 22009048.0, "step": 10170 }, { "entropy": 6.651549434661865, "epoch": 1.0888223018888117, "grad_norm": 2.265625, "learning_rate": 0.0004891525170908169, "loss": 6.4482, "mean_token_accuracy": 0.1263985179364681, "num_tokens": 22020625.0, "step": 10175 }, { "entropy": 6.634617900848388, "epoch": 1.0893573759965756, "grad_norm": 1.765625, "learning_rate": 0.0004891407857787448, "loss": 6.3263, "mean_token_accuracy": 0.12857749983668326, "num_tokens": 22032298.0, "step": 10180 }, { "entropy": 6.534213542938232, "epoch": 1.0898924501043394, "grad_norm": 1.7109375, "learning_rate": 0.0004891290482833876, "loss": 6.3292, "mean_token_accuracy": 0.13334605246782302, "num_tokens": 22043693.0, "step": 10185 }, { "entropy": 6.520200777053833, "epoch": 1.0904275242121033, "grad_norm": 1.7421875, "learning_rate": 0.0004891173046050844, "loss": 6.3682, "mean_token_accuracy": 0.1346238724887371, "num_tokens": 22054373.0, "step": 10190 }, { "entropy": 6.534080505371094, "epoch": 1.0909625983198672, "grad_norm": 2.46875, "learning_rate": 0.000489105554744174, "loss": 6.3373, "mean_token_accuracy": 0.1305387571454048, "num_tokens": 22065039.0, "step": 10195 }, { "entropy": 6.6202747344970705, "epoch": 1.0914976724276313, "grad_norm": 1.859375, "learning_rate": 0.0004890937987009958, "loss": 6.3725, "mean_token_accuracy": 0.1298222564160824, "num_tokens": 22077003.0, "step": 10200 }, { "entropy": 6.60672516822815, "epoch": 1.0920327465353952, "grad_norm": 2.1875, "learning_rate": 0.0004890820364758892, "loss": 6.3539, "mean_token_accuracy": 0.1274056114256382, "num_tokens": 22088558.0, "step": 10205 }, { "entropy": 6.552365064620972, "epoch": 1.092567820643159, "grad_norm": 1.6484375, "learning_rate": 0.000489070268069194, "loss": 6.3246, "mean_token_accuracy": 0.13213638737797737, "num_tokens": 22097777.0, "step": 10210 }, { "entropy": 6.541152143478394, "epoch": 1.093102894750923, "grad_norm": 1.7890625, "learning_rate": 0.0004890584934812498, "loss": 6.2634, "mean_token_accuracy": 0.1303601458668709, "num_tokens": 22107803.0, "step": 10215 }, { "entropy": 6.498277282714843, "epoch": 1.093637968858687, "grad_norm": 1.5, "learning_rate": 0.0004890467127123967, "loss": 6.2813, "mean_token_accuracy": 0.13142024949193, "num_tokens": 22117965.0, "step": 10220 }, { "entropy": 6.5624823570251465, "epoch": 1.094173042966451, "grad_norm": 2.0, "learning_rate": 0.0004890349257629749, "loss": 6.3365, "mean_token_accuracy": 0.13246248736977578, "num_tokens": 22127759.0, "step": 10225 }, { "entropy": 6.550729131698608, "epoch": 1.0947081170742148, "grad_norm": 1.828125, "learning_rate": 0.0004890231326333246, "loss": 6.3437, "mean_token_accuracy": 0.1269809238612652, "num_tokens": 22138477.0, "step": 10230 }, { "entropy": 6.5772411823272705, "epoch": 1.0952431911819787, "grad_norm": 1.6015625, "learning_rate": 0.0004890113333237865, "loss": 6.3513, "mean_token_accuracy": 0.12684160023927687, "num_tokens": 22149568.0, "step": 10235 }, { "entropy": 6.5642256259918215, "epoch": 1.0957782652897425, "grad_norm": 2.328125, "learning_rate": 0.0004889995278347012, "loss": 6.3269, "mean_token_accuracy": 0.13090576231479645, "num_tokens": 22159949.0, "step": 10240 }, { "entropy": 6.539562940597534, "epoch": 1.0963133393975066, "grad_norm": 1.7265625, "learning_rate": 0.0004889877161664096, "loss": 6.3634, "mean_token_accuracy": 0.12523729503154754, "num_tokens": 22170115.0, "step": 10245 }, { "entropy": 6.588288640975952, "epoch": 1.0968484135052705, "grad_norm": 1.71875, "learning_rate": 0.0004889758983192528, "loss": 6.3573, "mean_token_accuracy": 0.13425422385334967, "num_tokens": 22181323.0, "step": 10250 }, { "entropy": 6.555928516387939, "epoch": 1.0973834876130344, "grad_norm": 1.6875, "learning_rate": 0.0004889640742935719, "loss": 6.2993, "mean_token_accuracy": 0.12734182626008989, "num_tokens": 22192078.0, "step": 10255 }, { "entropy": 6.603155136108398, "epoch": 1.0979185617207983, "grad_norm": 1.6015625, "learning_rate": 0.0004889522440897085, "loss": 6.3842, "mean_token_accuracy": 0.13014934435486794, "num_tokens": 22203211.0, "step": 10260 }, { "entropy": 6.523215007781983, "epoch": 1.0984536358285624, "grad_norm": 1.5, "learning_rate": 0.0004889404077080041, "loss": 6.3009, "mean_token_accuracy": 0.1271577313542366, "num_tokens": 22213487.0, "step": 10265 }, { "entropy": 6.6091859340667725, "epoch": 1.0989887099363262, "grad_norm": 1.6484375, "learning_rate": 0.0004889285651488005, "loss": 6.348, "mean_token_accuracy": 0.1246352657675743, "num_tokens": 22223717.0, "step": 10270 }, { "entropy": 6.56798095703125, "epoch": 1.0995237840440901, "grad_norm": 1.515625, "learning_rate": 0.0004889167164124396, "loss": 6.3425, "mean_token_accuracy": 0.13307574465870858, "num_tokens": 22235141.0, "step": 10275 }, { "entropy": 6.584205436706543, "epoch": 1.100058858151854, "grad_norm": 1.6171875, "learning_rate": 0.0004889048614992636, "loss": 6.4057, "mean_token_accuracy": 0.11987434178590775, "num_tokens": 22246601.0, "step": 10280 }, { "entropy": 6.577657842636109, "epoch": 1.1005939322596179, "grad_norm": 1.9453125, "learning_rate": 0.0004888930004096148, "loss": 6.3329, "mean_token_accuracy": 0.12910846546292304, "num_tokens": 22257206.0, "step": 10285 }, { "entropy": 6.545556259155274, "epoch": 1.101129006367382, "grad_norm": 1.8671875, "learning_rate": 0.0004888811331438356, "loss": 6.4003, "mean_token_accuracy": 0.1228591412305832, "num_tokens": 22267799.0, "step": 10290 }, { "entropy": 6.606423711776733, "epoch": 1.1016640804751459, "grad_norm": 1.46875, "learning_rate": 0.0004888692597022689, "loss": 6.4521, "mean_token_accuracy": 0.12880235388875008, "num_tokens": 22279368.0, "step": 10295 }, { "entropy": 6.553431987762451, "epoch": 1.1021991545829097, "grad_norm": 1.6640625, "learning_rate": 0.0004888573800852572, "loss": 6.1937, "mean_token_accuracy": 0.13669133111834525, "num_tokens": 22289998.0, "step": 10300 }, { "entropy": 6.504615068435669, "epoch": 1.1027342286906736, "grad_norm": 1.421875, "learning_rate": 0.0004888454942931438, "loss": 6.3197, "mean_token_accuracy": 0.1390775963664055, "num_tokens": 22300058.0, "step": 10305 }, { "entropy": 6.565959692001343, "epoch": 1.1032693027984375, "grad_norm": 1.8125, "learning_rate": 0.0004888336023262718, "loss": 6.4207, "mean_token_accuracy": 0.124299506098032, "num_tokens": 22310962.0, "step": 10310 }, { "entropy": 6.608157634735107, "epoch": 1.1038043769062016, "grad_norm": 1.6484375, "learning_rate": 0.0004888217041849846, "loss": 6.3051, "mean_token_accuracy": 0.1316367991268635, "num_tokens": 22321526.0, "step": 10315 }, { "entropy": 6.573012971878052, "epoch": 1.1043394510139655, "grad_norm": 2.265625, "learning_rate": 0.0004888097998696256, "loss": 6.3992, "mean_token_accuracy": 0.12790393680334092, "num_tokens": 22332558.0, "step": 10320 }, { "entropy": 6.550169897079468, "epoch": 1.1048745251217293, "grad_norm": 1.5, "learning_rate": 0.0004887978893805387, "loss": 6.3352, "mean_token_accuracy": 0.13281012028455735, "num_tokens": 22342392.0, "step": 10325 }, { "entropy": 6.571234178543091, "epoch": 1.1054095992294932, "grad_norm": 1.7265625, "learning_rate": 0.0004887859727180679, "loss": 6.3905, "mean_token_accuracy": 0.12326234579086304, "num_tokens": 22353089.0, "step": 10330 }, { "entropy": 6.522563552856445, "epoch": 1.105944673337257, "grad_norm": 1.7421875, "learning_rate": 0.0004887740498825572, "loss": 6.3072, "mean_token_accuracy": 0.13173036724328996, "num_tokens": 22364314.0, "step": 10335 }, { "entropy": 6.497900485992432, "epoch": 1.1064797474450212, "grad_norm": 1.71875, "learning_rate": 0.0004887621208743507, "loss": 6.3202, "mean_token_accuracy": 0.12728115022182465, "num_tokens": 22374985.0, "step": 10340 }, { "entropy": 6.526889419555664, "epoch": 1.107014821552785, "grad_norm": 2.0625, "learning_rate": 0.0004887501856937932, "loss": 6.2334, "mean_token_accuracy": 0.13864122256636618, "num_tokens": 22385618.0, "step": 10345 }, { "entropy": 6.631136274337768, "epoch": 1.107549895660549, "grad_norm": 1.59375, "learning_rate": 0.000488738244341229, "loss": 6.3459, "mean_token_accuracy": 0.14008405432105064, "num_tokens": 22395871.0, "step": 10350 }, { "entropy": 6.570936012268066, "epoch": 1.1080849697683128, "grad_norm": 1.4609375, "learning_rate": 0.000488726296817003, "loss": 6.3666, "mean_token_accuracy": 0.13187873214483262, "num_tokens": 22406707.0, "step": 10355 }, { "entropy": 6.53339991569519, "epoch": 1.108620043876077, "grad_norm": 1.6328125, "learning_rate": 0.0004887143431214602, "loss": 6.3797, "mean_token_accuracy": 0.12708743512630463, "num_tokens": 22417543.0, "step": 10360 }, { "entropy": 6.502883052825927, "epoch": 1.1091551179838408, "grad_norm": 3.03125, "learning_rate": 0.0004887023832549459, "loss": 6.3206, "mean_token_accuracy": 0.13298214301466943, "num_tokens": 22428283.0, "step": 10365 }, { "entropy": 6.499336004257202, "epoch": 1.1096901920916047, "grad_norm": 1.875, "learning_rate": 0.0004886904172178052, "loss": 6.2922, "mean_token_accuracy": 0.13327440321445466, "num_tokens": 22439860.0, "step": 10370 }, { "entropy": 6.63573694229126, "epoch": 1.1102252661993686, "grad_norm": 1.4609375, "learning_rate": 0.0004886784450103838, "loss": 6.3627, "mean_token_accuracy": 0.13110646083950997, "num_tokens": 22451250.0, "step": 10375 }, { "entropy": 6.561157751083374, "epoch": 1.1107603403071324, "grad_norm": 1.484375, "learning_rate": 0.0004886664666330273, "loss": 6.293, "mean_token_accuracy": 0.12992360070347786, "num_tokens": 22461112.0, "step": 10380 }, { "entropy": 6.530084323883057, "epoch": 1.1112954144148965, "grad_norm": 1.4921875, "learning_rate": 0.0004886544820860816, "loss": 6.3298, "mean_token_accuracy": 0.13429150208830834, "num_tokens": 22471368.0, "step": 10385 }, { "entropy": 6.522792387008667, "epoch": 1.1118304885226604, "grad_norm": 3.171875, "learning_rate": 0.0004886424913698927, "loss": 6.3256, "mean_token_accuracy": 0.1302389308810234, "num_tokens": 22482011.0, "step": 10390 }, { "entropy": 6.528932523727417, "epoch": 1.1123655626304243, "grad_norm": 1.8984375, "learning_rate": 0.0004886304944848069, "loss": 6.2828, "mean_token_accuracy": 0.13808312863111497, "num_tokens": 22493648.0, "step": 10395 }, { "entropy": 6.57400918006897, "epoch": 1.1129006367381882, "grad_norm": 1.6953125, "learning_rate": 0.0004886184914311706, "loss": 6.4129, "mean_token_accuracy": 0.12496653497219086, "num_tokens": 22505577.0, "step": 10400 }, { "entropy": 6.564892768859863, "epoch": 1.1134357108459523, "grad_norm": 1.9453125, "learning_rate": 0.0004886064822093305, "loss": 6.3716, "mean_token_accuracy": 0.12236398756504059, "num_tokens": 22515546.0, "step": 10405 }, { "entropy": 6.527905750274658, "epoch": 1.1139707849537162, "grad_norm": 1.5859375, "learning_rate": 0.0004885944668196332, "loss": 6.2631, "mean_token_accuracy": 0.13738187327980994, "num_tokens": 22526710.0, "step": 10410 }, { "entropy": 6.569247817993164, "epoch": 1.11450585906148, "grad_norm": 1.765625, "learning_rate": 0.0004885824452624254, "loss": 6.3707, "mean_token_accuracy": 0.12691551223397254, "num_tokens": 22537809.0, "step": 10415 }, { "entropy": 6.581798887252807, "epoch": 1.115040933169244, "grad_norm": 1.7265625, "learning_rate": 0.0004885704175380548, "loss": 6.3638, "mean_token_accuracy": 0.1270926281809807, "num_tokens": 22549301.0, "step": 10420 }, { "entropy": 6.6548303127288815, "epoch": 1.1155760072770078, "grad_norm": 1.421875, "learning_rate": 0.0004885583836468683, "loss": 6.2725, "mean_token_accuracy": 0.13279347419738768, "num_tokens": 22560483.0, "step": 10425 }, { "entropy": 6.529315996170044, "epoch": 1.1161110813847719, "grad_norm": 1.578125, "learning_rate": 0.0004885463435892136, "loss": 6.3644, "mean_token_accuracy": 0.12554011717438698, "num_tokens": 22570524.0, "step": 10430 }, { "entropy": 6.552693557739258, "epoch": 1.1166461554925358, "grad_norm": 1.4453125, "learning_rate": 0.000488534297365438, "loss": 6.3706, "mean_token_accuracy": 0.1273189067840576, "num_tokens": 22581120.0, "step": 10435 }, { "entropy": 6.6206999778747555, "epoch": 1.1171812296002996, "grad_norm": 2.703125, "learning_rate": 0.0004885222449758899, "loss": 6.3588, "mean_token_accuracy": 0.12862497866153716, "num_tokens": 22592658.0, "step": 10440 }, { "entropy": 6.5843626976013185, "epoch": 1.1177163037080635, "grad_norm": 2.15625, "learning_rate": 0.0004885101864209167, "loss": 6.3188, "mean_token_accuracy": 0.13105077669024467, "num_tokens": 22603497.0, "step": 10445 }, { "entropy": 6.508558559417724, "epoch": 1.1182513778158274, "grad_norm": 1.59375, "learning_rate": 0.000488498121700867, "loss": 6.2562, "mean_token_accuracy": 0.13314962089061738, "num_tokens": 22612916.0, "step": 10450 }, { "entropy": 6.510771703720093, "epoch": 1.1187864519235915, "grad_norm": 1.78125, "learning_rate": 0.0004884860508160891, "loss": 6.3776, "mean_token_accuracy": 0.12925844565033912, "num_tokens": 22625345.0, "step": 10455 }, { "entropy": 6.510384511947632, "epoch": 1.1193215260313554, "grad_norm": 1.4453125, "learning_rate": 0.0004884739737669314, "loss": 6.2801, "mean_token_accuracy": 0.1355935327708721, "num_tokens": 22637000.0, "step": 10460 }, { "entropy": 6.549340534210205, "epoch": 1.1198566001391193, "grad_norm": 1.609375, "learning_rate": 0.0004884618905537427, "loss": 6.2781, "mean_token_accuracy": 0.1341861017048359, "num_tokens": 22647025.0, "step": 10465 }, { "entropy": 6.493887281417846, "epoch": 1.1203916742468831, "grad_norm": 1.5546875, "learning_rate": 0.0004884498011768719, "loss": 6.2679, "mean_token_accuracy": 0.137028082460165, "num_tokens": 22657253.0, "step": 10470 }, { "entropy": 6.463266134262085, "epoch": 1.120926748354647, "grad_norm": 1.578125, "learning_rate": 0.000488437705636668, "loss": 6.3042, "mean_token_accuracy": 0.131851152330637, "num_tokens": 22668432.0, "step": 10475 }, { "entropy": 6.525684833526611, "epoch": 1.121461822462411, "grad_norm": 1.734375, "learning_rate": 0.0004884256039334805, "loss": 6.3575, "mean_token_accuracy": 0.12723028883337975, "num_tokens": 22678538.0, "step": 10480 }, { "entropy": 6.573268985748291, "epoch": 1.121996896570175, "grad_norm": 1.4765625, "learning_rate": 0.0004884134960676586, "loss": 6.3296, "mean_token_accuracy": 0.12801336348056794, "num_tokens": 22688994.0, "step": 10485 }, { "entropy": 6.627550745010376, "epoch": 1.1225319706779389, "grad_norm": 1.4375, "learning_rate": 0.000488401382039552, "loss": 6.3599, "mean_token_accuracy": 0.13166107088327408, "num_tokens": 22699584.0, "step": 10490 }, { "entropy": 6.498450517654419, "epoch": 1.1230670447857027, "grad_norm": 1.5, "learning_rate": 0.0004883892618495104, "loss": 6.2662, "mean_token_accuracy": 0.1293816864490509, "num_tokens": 22710093.0, "step": 10495 }, { "entropy": 6.543735408782959, "epoch": 1.1236021188934668, "grad_norm": 1.671875, "learning_rate": 0.000488377135497884, "loss": 6.3419, "mean_token_accuracy": 0.1305043265223503, "num_tokens": 22720533.0, "step": 10500 }, { "entropy": 6.546299886703491, "epoch": 1.1241371930012307, "grad_norm": 1.7734375, "learning_rate": 0.0004883650029850226, "loss": 6.2551, "mean_token_accuracy": 0.1354456789791584, "num_tokens": 22731010.0, "step": 10505 }, { "entropy": 6.520023155212402, "epoch": 1.1246722671089946, "grad_norm": 1.375, "learning_rate": 0.0004883528643112769, "loss": 6.3359, "mean_token_accuracy": 0.1299326941370964, "num_tokens": 22743045.0, "step": 10510 }, { "entropy": 6.5189900398254395, "epoch": 1.1252073412167585, "grad_norm": 1.59375, "learning_rate": 0.0004883407194769972, "loss": 6.3302, "mean_token_accuracy": 0.13178498074412345, "num_tokens": 22753746.0, "step": 10515 }, { "entropy": 6.565853261947632, "epoch": 1.1257424153245223, "grad_norm": 1.5625, "learning_rate": 0.0004883285684825342, "loss": 6.3514, "mean_token_accuracy": 0.13648682385683059, "num_tokens": 22765264.0, "step": 10520 }, { "entropy": 6.57284836769104, "epoch": 1.1262774894322864, "grad_norm": 1.4296875, "learning_rate": 0.0004883164113282386, "loss": 6.3513, "mean_token_accuracy": 0.13097459301352501, "num_tokens": 22775727.0, "step": 10525 }, { "entropy": 6.56453914642334, "epoch": 1.1268125635400503, "grad_norm": 1.2890625, "learning_rate": 0.0004883042480144618, "loss": 6.3346, "mean_token_accuracy": 0.1291578531265259, "num_tokens": 22787228.0, "step": 10530 }, { "entropy": 6.653687572479248, "epoch": 1.1273476376478142, "grad_norm": 1.8046875, "learning_rate": 0.0004882920785415547, "loss": 6.3944, "mean_token_accuracy": 0.12908954098820685, "num_tokens": 22797467.0, "step": 10535 }, { "entropy": 6.573576211929321, "epoch": 1.127882711755578, "grad_norm": 1.7109375, "learning_rate": 0.0004882799029098689, "loss": 6.3486, "mean_token_accuracy": 0.12570706456899644, "num_tokens": 22808281.0, "step": 10540 }, { "entropy": 6.537278699874878, "epoch": 1.1284177858633422, "grad_norm": 1.8515625, "learning_rate": 0.00048826772111975583, "loss": 6.4105, "mean_token_accuracy": 0.1296780101954937, "num_tokens": 22819387.0, "step": 10545 }, { "entropy": 6.540688848495483, "epoch": 1.128952859971106, "grad_norm": 1.84375, "learning_rate": 0.00048825553317156717, "loss": 6.3638, "mean_token_accuracy": 0.12886037230491637, "num_tokens": 22829649.0, "step": 10550 }, { "entropy": 6.494860124588013, "epoch": 1.12948793407887, "grad_norm": 1.421875, "learning_rate": 0.0004882433390656551, "loss": 6.3573, "mean_token_accuracy": 0.13145121783018113, "num_tokens": 22840667.0, "step": 10555 }, { "entropy": 6.538703346252442, "epoch": 1.1300230081866338, "grad_norm": 1.75, "learning_rate": 0.0004882311388023715, "loss": 6.3134, "mean_token_accuracy": 0.13190669789910317, "num_tokens": 22852461.0, "step": 10560 }, { "entropy": 6.632486295700073, "epoch": 1.1305580822943977, "grad_norm": 1.5390625, "learning_rate": 0.0004882189323820688, "loss": 6.377, "mean_token_accuracy": 0.1251945301890373, "num_tokens": 22862781.0, "step": 10565 }, { "entropy": 6.648410177230835, "epoch": 1.1310931564021618, "grad_norm": 1.796875, "learning_rate": 0.00048820671980509935, "loss": 6.4086, "mean_token_accuracy": 0.12716651260852813, "num_tokens": 22873393.0, "step": 10570 }, { "entropy": 6.624794340133667, "epoch": 1.1316282305099257, "grad_norm": 1.7578125, "learning_rate": 0.00048819450107181583, "loss": 6.3687, "mean_token_accuracy": 0.1276544764637947, "num_tokens": 22883931.0, "step": 10575 }, { "entropy": 6.597856330871582, "epoch": 1.1321633046176895, "grad_norm": 3.03125, "learning_rate": 0.0004881822761825711, "loss": 6.3167, "mean_token_accuracy": 0.12900567129254342, "num_tokens": 22894829.0, "step": 10580 }, { "entropy": 6.510784578323364, "epoch": 1.1326983787254534, "grad_norm": 1.5703125, "learning_rate": 0.000488170045137718, "loss": 6.3531, "mean_token_accuracy": 0.12778317630290986, "num_tokens": 22906059.0, "step": 10585 }, { "entropy": 6.541378164291382, "epoch": 1.1332334528332173, "grad_norm": 1.671875, "learning_rate": 0.0004881578079376099, "loss": 6.3363, "mean_token_accuracy": 0.12626659497618675, "num_tokens": 22917834.0, "step": 10590 }, { "entropy": 6.579113960266113, "epoch": 1.1337685269409814, "grad_norm": 1.359375, "learning_rate": 0.00048814556458259996, "loss": 6.2577, "mean_token_accuracy": 0.14158050939440728, "num_tokens": 22929157.0, "step": 10595 }, { "entropy": 6.6599236011505125, "epoch": 1.1343036010487453, "grad_norm": 1.5703125, "learning_rate": 0.0004881333150730419, "loss": 6.3759, "mean_token_accuracy": 0.13018642514944076, "num_tokens": 22939396.0, "step": 10600 }, { "entropy": 6.537628221511841, "epoch": 1.1348386751565092, "grad_norm": 1.46875, "learning_rate": 0.00048812105940928917, "loss": 6.3538, "mean_token_accuracy": 0.12922895923256875, "num_tokens": 22950253.0, "step": 10605 }, { "entropy": 6.5369837284088135, "epoch": 1.135373749264273, "grad_norm": 1.59375, "learning_rate": 0.00048810879759169593, "loss": 6.3596, "mean_token_accuracy": 0.1285732626914978, "num_tokens": 22960417.0, "step": 10610 }, { "entropy": 6.495455932617188, "epoch": 1.135908823372037, "grad_norm": 4.34375, "learning_rate": 0.000488096529620616, "loss": 6.3557, "mean_token_accuracy": 0.1290543757379055, "num_tokens": 22971763.0, "step": 10615 }, { "entropy": 6.603179931640625, "epoch": 1.136443897479801, "grad_norm": 1.6953125, "learning_rate": 0.00048808425549640383, "loss": 6.3622, "mean_token_accuracy": 0.1303618311882019, "num_tokens": 22981571.0, "step": 10620 }, { "entropy": 6.563053131103516, "epoch": 1.136978971587565, "grad_norm": 1.609375, "learning_rate": 0.00048807197521941366, "loss": 6.3112, "mean_token_accuracy": 0.1328694626688957, "num_tokens": 22991644.0, "step": 10625 }, { "entropy": 6.505655574798584, "epoch": 1.1375140456953288, "grad_norm": 1.6015625, "learning_rate": 0.0004880596887900002, "loss": 6.2685, "mean_token_accuracy": 0.13284799605607986, "num_tokens": 23001557.0, "step": 10630 }, { "entropy": 6.5576403617858885, "epoch": 1.1380491198030926, "grad_norm": 1.6875, "learning_rate": 0.00048804739620851806, "loss": 6.3618, "mean_token_accuracy": 0.12697471380233766, "num_tokens": 23012715.0, "step": 10635 }, { "entropy": 6.530397510528564, "epoch": 1.1385841939108567, "grad_norm": 1.5234375, "learning_rate": 0.00048803509747532235, "loss": 6.3562, "mean_token_accuracy": 0.12833357527852057, "num_tokens": 23023016.0, "step": 10640 }, { "entropy": 6.556599807739258, "epoch": 1.1391192680186206, "grad_norm": 1.671875, "learning_rate": 0.0004880227925907682, "loss": 6.3606, "mean_token_accuracy": 0.1297280579805374, "num_tokens": 23033511.0, "step": 10645 }, { "entropy": 6.620222473144532, "epoch": 1.1396543421263845, "grad_norm": 1.9140625, "learning_rate": 0.0004880104815552108, "loss": 6.3615, "mean_token_accuracy": 0.13871046230196954, "num_tokens": 23045149.0, "step": 10650 }, { "entropy": 6.542651987075805, "epoch": 1.1401894162341484, "grad_norm": 2.703125, "learning_rate": 0.0004879981643690056, "loss": 6.3111, "mean_token_accuracy": 0.1345951810479164, "num_tokens": 23054489.0, "step": 10655 }, { "entropy": 6.546128368377685, "epoch": 1.1407244903419125, "grad_norm": 1.6484375, "learning_rate": 0.00048798584103250847, "loss": 6.4496, "mean_token_accuracy": 0.12695099115371705, "num_tokens": 23064725.0, "step": 10660 }, { "entropy": 6.49794864654541, "epoch": 1.1412595644496764, "grad_norm": 2.15625, "learning_rate": 0.000487973511546075, "loss": 6.4074, "mean_token_accuracy": 0.12610558271408082, "num_tokens": 23076473.0, "step": 10665 }, { "entropy": 6.61476240158081, "epoch": 1.1417946385574402, "grad_norm": 1.71875, "learning_rate": 0.0004879611759100614, "loss": 6.325, "mean_token_accuracy": 0.13806122466921805, "num_tokens": 23087449.0, "step": 10670 }, { "entropy": 6.619863605499267, "epoch": 1.1423297126652041, "grad_norm": 1.7421875, "learning_rate": 0.0004879488341248237, "loss": 6.2824, "mean_token_accuracy": 0.1350557804107666, "num_tokens": 23098284.0, "step": 10675 }, { "entropy": 6.49966254234314, "epoch": 1.142864786772968, "grad_norm": 2.421875, "learning_rate": 0.00048793648619071834, "loss": 6.3136, "mean_token_accuracy": 0.13502648174762727, "num_tokens": 23108545.0, "step": 10680 }, { "entropy": 6.558721446990967, "epoch": 1.143399860880732, "grad_norm": 2.203125, "learning_rate": 0.0004879241321081019, "loss": 6.2808, "mean_token_accuracy": 0.13182588443160057, "num_tokens": 23118568.0, "step": 10685 }, { "entropy": 6.612079620361328, "epoch": 1.143934934988496, "grad_norm": 7.46875, "learning_rate": 0.00048791177187733104, "loss": 6.3619, "mean_token_accuracy": 0.12453131675720215, "num_tokens": 23129189.0, "step": 10690 }, { "entropy": 6.61033616065979, "epoch": 1.1444700090962598, "grad_norm": 1.8203125, "learning_rate": 0.0004878994054987627, "loss": 6.3874, "mean_token_accuracy": 0.12639420479536057, "num_tokens": 23140238.0, "step": 10695 }, { "entropy": 6.52753849029541, "epoch": 1.1450050832040237, "grad_norm": 1.484375, "learning_rate": 0.0004878870329727539, "loss": 6.2835, "mean_token_accuracy": 0.1355196289718151, "num_tokens": 23149567.0, "step": 10700 }, { "entropy": 6.512339735031128, "epoch": 1.1455401573117876, "grad_norm": 1.7578125, "learning_rate": 0.000487874654299662, "loss": 6.2582, "mean_token_accuracy": 0.1337184876203537, "num_tokens": 23159208.0, "step": 10705 }, { "entropy": 6.466184949874878, "epoch": 1.1460752314195517, "grad_norm": 1.6875, "learning_rate": 0.00048786226947984435, "loss": 6.3111, "mean_token_accuracy": 0.13029128834605216, "num_tokens": 23169092.0, "step": 10710 }, { "entropy": 6.5020448684692385, "epoch": 1.1466103055273156, "grad_norm": 1.4453125, "learning_rate": 0.0004878498785136586, "loss": 6.3365, "mean_token_accuracy": 0.13344621732831002, "num_tokens": 23180385.0, "step": 10715 }, { "entropy": 6.58619179725647, "epoch": 1.1471453796350795, "grad_norm": 1.5859375, "learning_rate": 0.00048783748140146245, "loss": 6.3305, "mean_token_accuracy": 0.12785167694091798, "num_tokens": 23191180.0, "step": 10720 }, { "entropy": 6.571190071105957, "epoch": 1.1476804537428433, "grad_norm": 1.65625, "learning_rate": 0.000487825078143614, "loss": 6.3069, "mean_token_accuracy": 0.13744020015001296, "num_tokens": 23200920.0, "step": 10725 }, { "entropy": 6.519334125518799, "epoch": 1.1482155278506072, "grad_norm": 1.40625, "learning_rate": 0.0004878126687404713, "loss": 6.332, "mean_token_accuracy": 0.1358323097229004, "num_tokens": 23211140.0, "step": 10730 }, { "entropy": 6.552707242965698, "epoch": 1.1487506019583713, "grad_norm": 1.5390625, "learning_rate": 0.0004878002531923927, "loss": 6.3699, "mean_token_accuracy": 0.12355867698788643, "num_tokens": 23222039.0, "step": 10735 }, { "entropy": 6.627868509292602, "epoch": 1.1492856760661352, "grad_norm": 1.734375, "learning_rate": 0.00048778783149973674, "loss": 6.3982, "mean_token_accuracy": 0.12598269581794738, "num_tokens": 23232502.0, "step": 10740 }, { "entropy": 6.597220039367675, "epoch": 1.149820750173899, "grad_norm": 1.7734375, "learning_rate": 0.00048777540366286195, "loss": 6.3189, "mean_token_accuracy": 0.13383150175213815, "num_tokens": 23243172.0, "step": 10745 }, { "entropy": 6.588002014160156, "epoch": 1.150355824281663, "grad_norm": 1.6015625, "learning_rate": 0.0004877629696821273, "loss": 6.3769, "mean_token_accuracy": 0.12852920964360237, "num_tokens": 23254558.0, "step": 10750 }, { "entropy": 6.596088075637818, "epoch": 1.1508908983894268, "grad_norm": 1.78125, "learning_rate": 0.00048775052955789185, "loss": 6.4108, "mean_token_accuracy": 0.12670576050877572, "num_tokens": 23266283.0, "step": 10755 }, { "entropy": 6.510305166244507, "epoch": 1.151425972497191, "grad_norm": 1.2734375, "learning_rate": 0.0004877380832905147, "loss": 6.2731, "mean_token_accuracy": 0.13248199224472046, "num_tokens": 23277823.0, "step": 10760 }, { "entropy": 6.5186646461486815, "epoch": 1.1519610466049548, "grad_norm": 2.171875, "learning_rate": 0.00048772563088035533, "loss": 6.2662, "mean_token_accuracy": 0.13238389566540718, "num_tokens": 23288159.0, "step": 10765 }, { "entropy": 6.4919130325317385, "epoch": 1.1524961207127187, "grad_norm": 1.671875, "learning_rate": 0.0004877131723277732, "loss": 6.2853, "mean_token_accuracy": 0.13082748800516128, "num_tokens": 23299379.0, "step": 10770 }, { "entropy": 6.533123350143432, "epoch": 1.1530311948204826, "grad_norm": 1.4296875, "learning_rate": 0.0004877007076331282, "loss": 6.3287, "mean_token_accuracy": 0.12611317709088327, "num_tokens": 23310572.0, "step": 10775 }, { "entropy": 6.587215518951416, "epoch": 1.1535662689282467, "grad_norm": 1.8046875, "learning_rate": 0.0004876882367967801, "loss": 6.334, "mean_token_accuracy": 0.13565945401787757, "num_tokens": 23320782.0, "step": 10780 }, { "entropy": 6.552771425247192, "epoch": 1.1541013430360105, "grad_norm": 1.421875, "learning_rate": 0.00048767575981908907, "loss": 6.3898, "mean_token_accuracy": 0.1259394496679306, "num_tokens": 23331427.0, "step": 10785 }, { "entropy": 6.604757595062256, "epoch": 1.1546364171437744, "grad_norm": 2.375, "learning_rate": 0.00048766327670041534, "loss": 6.488, "mean_token_accuracy": 0.12195928543806075, "num_tokens": 23344250.0, "step": 10790 }, { "entropy": 6.604654550552368, "epoch": 1.1551714912515383, "grad_norm": 1.34375, "learning_rate": 0.0004876507874411194, "loss": 6.3477, "mean_token_accuracy": 0.13034091219305993, "num_tokens": 23354404.0, "step": 10795 }, { "entropy": 6.561950302124023, "epoch": 1.1557065653593024, "grad_norm": 2.0, "learning_rate": 0.00048763829204156187, "loss": 6.3585, "mean_token_accuracy": 0.1264335334300995, "num_tokens": 23364634.0, "step": 10800 }, { "entropy": 6.492505645751953, "epoch": 1.1562416394670663, "grad_norm": 1.7421875, "learning_rate": 0.00048762579050210344, "loss": 6.2262, "mean_token_accuracy": 0.1356184884905815, "num_tokens": 23375816.0, "step": 10805 }, { "entropy": 6.603830242156983, "epoch": 1.1567767135748301, "grad_norm": 2.015625, "learning_rate": 0.00048761328282310534, "loss": 6.3615, "mean_token_accuracy": 0.13077081739902496, "num_tokens": 23386583.0, "step": 10810 }, { "entropy": 6.525880002975464, "epoch": 1.157311787682594, "grad_norm": 1.46875, "learning_rate": 0.00048760076900492846, "loss": 6.2919, "mean_token_accuracy": 0.13986414223909377, "num_tokens": 23396826.0, "step": 10815 }, { "entropy": 6.552999544143677, "epoch": 1.157846861790358, "grad_norm": 1.4296875, "learning_rate": 0.0004875882490479343, "loss": 6.3826, "mean_token_accuracy": 0.13021600022912025, "num_tokens": 23408661.0, "step": 10820 }, { "entropy": 6.541066122055054, "epoch": 1.158381935898122, "grad_norm": 1.3203125, "learning_rate": 0.00048757572295248425, "loss": 6.2981, "mean_token_accuracy": 0.13274050131440163, "num_tokens": 23419308.0, "step": 10825 }, { "entropy": 6.486504793167114, "epoch": 1.1589170100058859, "grad_norm": 2.375, "learning_rate": 0.0004875631907189402, "loss": 6.3, "mean_token_accuracy": 0.13612111359834672, "num_tokens": 23430043.0, "step": 10830 }, { "entropy": 6.4684511661529545, "epoch": 1.1594520841136498, "grad_norm": 1.515625, "learning_rate": 0.0004875506523476638, "loss": 6.2307, "mean_token_accuracy": 0.13488834574818612, "num_tokens": 23441246.0, "step": 10835 }, { "entropy": 6.606773376464844, "epoch": 1.1599871582214136, "grad_norm": 1.8046875, "learning_rate": 0.00048753810783901716, "loss": 6.3619, "mean_token_accuracy": 0.12804771736264228, "num_tokens": 23452250.0, "step": 10840 }, { "entropy": 6.583228635787964, "epoch": 1.1605222323291775, "grad_norm": 1.578125, "learning_rate": 0.00048752555719336257, "loss": 6.3506, "mean_token_accuracy": 0.1309939667582512, "num_tokens": 23464174.0, "step": 10845 }, { "entropy": 6.51217737197876, "epoch": 1.1610573064369416, "grad_norm": 1.703125, "learning_rate": 0.0004875130004110623, "loss": 6.2202, "mean_token_accuracy": 0.13723542168736458, "num_tokens": 23475159.0, "step": 10850 }, { "entropy": 6.514151525497437, "epoch": 1.1615923805447055, "grad_norm": 1.703125, "learning_rate": 0.00048750043749247907, "loss": 6.2808, "mean_token_accuracy": 0.13446007221937178, "num_tokens": 23486210.0, "step": 10855 }, { "entropy": 6.514532136917114, "epoch": 1.1621274546524694, "grad_norm": 1.6015625, "learning_rate": 0.0004874878684379756, "loss": 6.411, "mean_token_accuracy": 0.12789803966879845, "num_tokens": 23497122.0, "step": 10860 }, { "entropy": 6.4596717834472654, "epoch": 1.1626625287602332, "grad_norm": 1.75, "learning_rate": 0.0004874752932479148, "loss": 6.232, "mean_token_accuracy": 0.13754346147179602, "num_tokens": 23507765.0, "step": 10865 }, { "entropy": 6.545322704315185, "epoch": 1.1631976028679971, "grad_norm": 1.6796875, "learning_rate": 0.00048746271192265974, "loss": 6.3203, "mean_token_accuracy": 0.1301468774676323, "num_tokens": 23517686.0, "step": 10870 }, { "entropy": 6.523095512390137, "epoch": 1.1637326769757612, "grad_norm": 2.8125, "learning_rate": 0.0004874501244625737, "loss": 6.3118, "mean_token_accuracy": 0.1309164471924305, "num_tokens": 23528325.0, "step": 10875 }, { "entropy": 6.566447162628174, "epoch": 1.164267751083525, "grad_norm": 1.6640625, "learning_rate": 0.0004874375308680202, "loss": 6.3726, "mean_token_accuracy": 0.13206291794776917, "num_tokens": 23540006.0, "step": 10880 }, { "entropy": 6.632190322875976, "epoch": 1.164802825191289, "grad_norm": 1.5, "learning_rate": 0.00048742493113936274, "loss": 6.2925, "mean_token_accuracy": 0.12856976315379143, "num_tokens": 23550419.0, "step": 10885 }, { "entropy": 6.595448780059814, "epoch": 1.1653378992990528, "grad_norm": 3.859375, "learning_rate": 0.0004874123252769653, "loss": 6.409, "mean_token_accuracy": 0.12579906359314919, "num_tokens": 23561227.0, "step": 10890 }, { "entropy": 6.535502672195435, "epoch": 1.1658729734068167, "grad_norm": 1.9296875, "learning_rate": 0.00048739971328119194, "loss": 6.3248, "mean_token_accuracy": 0.12940651550889015, "num_tokens": 23571357.0, "step": 10895 }, { "entropy": 6.5147114276885985, "epoch": 1.1664080475145808, "grad_norm": 1.5234375, "learning_rate": 0.0004873870951524066, "loss": 6.3553, "mean_token_accuracy": 0.132980278134346, "num_tokens": 23581875.0, "step": 10900 }, { "entropy": 6.559042978286743, "epoch": 1.1669431216223447, "grad_norm": 1.734375, "learning_rate": 0.00048737447089097373, "loss": 6.4243, "mean_token_accuracy": 0.1240346796810627, "num_tokens": 23594251.0, "step": 10905 }, { "entropy": 6.577066469192505, "epoch": 1.1674781957301086, "grad_norm": 1.4921875, "learning_rate": 0.0004873618404972579, "loss": 6.3471, "mean_token_accuracy": 0.12563381120562553, "num_tokens": 23605159.0, "step": 10910 }, { "entropy": 6.621804046630859, "epoch": 1.1680132698378725, "grad_norm": 1.5546875, "learning_rate": 0.00048734920397162376, "loss": 6.3113, "mean_token_accuracy": 0.13350120931863785, "num_tokens": 23615737.0, "step": 10915 }, { "entropy": 6.506545734405518, "epoch": 1.1685483439456366, "grad_norm": 1.5, "learning_rate": 0.0004873365613144361, "loss": 6.3252, "mean_token_accuracy": 0.12694838345050813, "num_tokens": 23626207.0, "step": 10920 }, { "entropy": 6.5473815441131595, "epoch": 1.1690834180534004, "grad_norm": 1.265625, "learning_rate": 0.0004873239125260602, "loss": 6.365, "mean_token_accuracy": 0.12902920097112655, "num_tokens": 23637900.0, "step": 10925 }, { "entropy": 6.621821451187134, "epoch": 1.1696184921611643, "grad_norm": 1.1484375, "learning_rate": 0.00048731125760686106, "loss": 6.2485, "mean_token_accuracy": 0.13506797328591347, "num_tokens": 23647867.0, "step": 10930 }, { "entropy": 6.5687356948852536, "epoch": 1.1701535662689282, "grad_norm": 1.3125, "learning_rate": 0.00048729859655720424, "loss": 6.315, "mean_token_accuracy": 0.12940352633595467, "num_tokens": 23658055.0, "step": 10935 }, { "entropy": 6.455961608886719, "epoch": 1.1706886403766923, "grad_norm": 1.6015625, "learning_rate": 0.0004872859293774553, "loss": 6.3139, "mean_token_accuracy": 0.13185800462961197, "num_tokens": 23669458.0, "step": 10940 }, { "entropy": 6.526072645187378, "epoch": 1.1712237144844562, "grad_norm": 2.0625, "learning_rate": 0.00048727325606797995, "loss": 6.3277, "mean_token_accuracy": 0.1271936185657978, "num_tokens": 23679702.0, "step": 10945 }, { "entropy": 6.563662910461426, "epoch": 1.17175878859222, "grad_norm": 1.7109375, "learning_rate": 0.0004872605766291441, "loss": 6.3193, "mean_token_accuracy": 0.13145660236477852, "num_tokens": 23690844.0, "step": 10950 }, { "entropy": 6.457307958602906, "epoch": 1.172293862699984, "grad_norm": 1.3125, "learning_rate": 0.000487247891061314, "loss": 6.2989, "mean_token_accuracy": 0.1314682736992836, "num_tokens": 23701484.0, "step": 10955 }, { "entropy": 6.5671031951904295, "epoch": 1.1728289368077478, "grad_norm": 1.4296875, "learning_rate": 0.0004872351993648559, "loss": 6.3407, "mean_token_accuracy": 0.13159382194280625, "num_tokens": 23711452.0, "step": 10960 }, { "entropy": 6.516592884063721, "epoch": 1.173364010915512, "grad_norm": 2.5, "learning_rate": 0.00048722250154013613, "loss": 6.3172, "mean_token_accuracy": 0.12494777664542198, "num_tokens": 23723514.0, "step": 10965 }, { "entropy": 6.534799480438233, "epoch": 1.1738990850232758, "grad_norm": 1.2578125, "learning_rate": 0.0004872097975875216, "loss": 6.3526, "mean_token_accuracy": 0.13144171759486198, "num_tokens": 23733722.0, "step": 10970 }, { "entropy": 6.602074098587036, "epoch": 1.1744341591310397, "grad_norm": 1.421875, "learning_rate": 0.0004871970875073789, "loss": 6.3286, "mean_token_accuracy": 0.1271186165511608, "num_tokens": 23743403.0, "step": 10975 }, { "entropy": 6.524165916442871, "epoch": 1.1749692332388035, "grad_norm": 1.71875, "learning_rate": 0.0004871843713000751, "loss": 6.31, "mean_token_accuracy": 0.13159505203366278, "num_tokens": 23754558.0, "step": 10980 }, { "entropy": 6.523883056640625, "epoch": 1.1755043073465674, "grad_norm": 1.375, "learning_rate": 0.00048717164896597737, "loss": 6.3631, "mean_token_accuracy": 0.130098707228899, "num_tokens": 23766346.0, "step": 10985 }, { "entropy": 6.574266242980957, "epoch": 1.1760393814543315, "grad_norm": 1.34375, "learning_rate": 0.0004871589205054532, "loss": 6.3338, "mean_token_accuracy": 0.13770927786827086, "num_tokens": 23776851.0, "step": 10990 }, { "entropy": 6.6048688888549805, "epoch": 1.1765744555620954, "grad_norm": 1.7109375, "learning_rate": 0.00048714618591886997, "loss": 6.387, "mean_token_accuracy": 0.1288090780377388, "num_tokens": 23787350.0, "step": 10995 }, { "entropy": 6.472964715957642, "epoch": 1.1771095296698593, "grad_norm": 1.765625, "learning_rate": 0.0004871334452065954, "loss": 6.2534, "mean_token_accuracy": 0.13515733554959297, "num_tokens": 23797738.0, "step": 11000 }, { "entropy": 6.5069136142730715, "epoch": 1.1776446037776231, "grad_norm": 2.0625, "learning_rate": 0.0004871206983689974, "loss": 6.2645, "mean_token_accuracy": 0.1382341854274273, "num_tokens": 23809516.0, "step": 11005 }, { "entropy": 6.545322513580322, "epoch": 1.178179677885387, "grad_norm": 1.75, "learning_rate": 0.000487107945406444, "loss": 6.3351, "mean_token_accuracy": 0.13261336386203765, "num_tokens": 23819850.0, "step": 11010 }, { "entropy": 6.545321655273438, "epoch": 1.1787147519931511, "grad_norm": 1.4453125, "learning_rate": 0.0004870951863193036, "loss": 6.3102, "mean_token_accuracy": 0.13330233544111253, "num_tokens": 23829891.0, "step": 11015 }, { "entropy": 6.491222715377807, "epoch": 1.179249826100915, "grad_norm": 1.3359375, "learning_rate": 0.0004870824211079444, "loss": 6.281, "mean_token_accuracy": 0.13427258878946305, "num_tokens": 23840816.0, "step": 11020 }, { "entropy": 6.571009492874145, "epoch": 1.1797849002086789, "grad_norm": 1.3828125, "learning_rate": 0.00048706964977273515, "loss": 6.3737, "mean_token_accuracy": 0.12626400142908095, "num_tokens": 23852595.0, "step": 11025 }, { "entropy": 6.543050241470337, "epoch": 1.1803199743164428, "grad_norm": 1.5078125, "learning_rate": 0.00048705687231404455, "loss": 6.37, "mean_token_accuracy": 0.12795960977673532, "num_tokens": 23863048.0, "step": 11030 }, { "entropy": 6.558866834640503, "epoch": 1.1808550484242066, "grad_norm": 2.234375, "learning_rate": 0.00048704408873224156, "loss": 6.3253, "mean_token_accuracy": 0.1322480097413063, "num_tokens": 23873499.0, "step": 11035 }, { "entropy": 6.527097129821778, "epoch": 1.1813901225319707, "grad_norm": 3.0, "learning_rate": 0.00048703129902769526, "loss": 6.2707, "mean_token_accuracy": 0.13709414824843408, "num_tokens": 23885129.0, "step": 11040 }, { "entropy": 6.608933782577514, "epoch": 1.1819251966397346, "grad_norm": 1.765625, "learning_rate": 0.0004870185032007751, "loss": 6.3691, "mean_token_accuracy": 0.12893082946538925, "num_tokens": 23895538.0, "step": 11045 }, { "entropy": 6.558342838287354, "epoch": 1.1824602707474985, "grad_norm": 1.8671875, "learning_rate": 0.0004870057012518504, "loss": 6.3903, "mean_token_accuracy": 0.12423129379749298, "num_tokens": 23907341.0, "step": 11050 }, { "entropy": 6.485474681854248, "epoch": 1.1829953448552624, "grad_norm": 1.78125, "learning_rate": 0.00048699289318129087, "loss": 6.2447, "mean_token_accuracy": 0.13878285884857178, "num_tokens": 23918501.0, "step": 11055 }, { "entropy": 6.59085054397583, "epoch": 1.1835304189630265, "grad_norm": 1.6875, "learning_rate": 0.0004869800789894663, "loss": 6.3249, "mean_token_accuracy": 0.13167556896805763, "num_tokens": 23929204.0, "step": 11060 }, { "entropy": 6.554622602462769, "epoch": 1.1840654930707903, "grad_norm": 1.5625, "learning_rate": 0.0004869672586767468, "loss": 6.3536, "mean_token_accuracy": 0.1355223499238491, "num_tokens": 23939855.0, "step": 11065 }, { "entropy": 6.566775178909301, "epoch": 1.1846005671785542, "grad_norm": 1.6484375, "learning_rate": 0.0004869544322435024, "loss": 6.2844, "mean_token_accuracy": 0.1322241321206093, "num_tokens": 23949871.0, "step": 11070 }, { "entropy": 6.572175312042236, "epoch": 1.185135641286318, "grad_norm": 1.6171875, "learning_rate": 0.0004869415996901036, "loss": 6.3977, "mean_token_accuracy": 0.12741668447852134, "num_tokens": 23961650.0, "step": 11075 }, { "entropy": 6.581905651092529, "epoch": 1.1856707153940822, "grad_norm": 1.671875, "learning_rate": 0.0004869287610169209, "loss": 6.4011, "mean_token_accuracy": 0.12726534977555276, "num_tokens": 23973103.0, "step": 11080 }, { "entropy": 6.532610130310059, "epoch": 1.186205789501846, "grad_norm": 1.59375, "learning_rate": 0.000486915916224325, "loss": 6.3323, "mean_token_accuracy": 0.1320612519979477, "num_tokens": 23982972.0, "step": 11085 }, { "entropy": 6.477892637252808, "epoch": 1.18674086360961, "grad_norm": 1.3671875, "learning_rate": 0.0004869030653126868, "loss": 6.2096, "mean_token_accuracy": 0.13647703006863593, "num_tokens": 23993044.0, "step": 11090 }, { "entropy": 6.5596959590911865, "epoch": 1.1872759377173738, "grad_norm": 1.8046875, "learning_rate": 0.0004868902082823774, "loss": 6.28, "mean_token_accuracy": 0.13060884401202202, "num_tokens": 24003871.0, "step": 11095 }, { "entropy": 6.564113616943359, "epoch": 1.1878110118251377, "grad_norm": 1.484375, "learning_rate": 0.0004868773451337679, "loss": 6.3291, "mean_token_accuracy": 0.12881432026624678, "num_tokens": 24014613.0, "step": 11100 }, { "entropy": 6.534707164764404, "epoch": 1.1883460859329018, "grad_norm": 1.6953125, "learning_rate": 0.00048686447586722995, "loss": 6.3303, "mean_token_accuracy": 0.13396827429533004, "num_tokens": 24024172.0, "step": 11105 }, { "entropy": 6.56379804611206, "epoch": 1.1888811600406657, "grad_norm": 1.4765625, "learning_rate": 0.00048685160048313506, "loss": 6.4746, "mean_token_accuracy": 0.12522574216127397, "num_tokens": 24035301.0, "step": 11110 }, { "entropy": 6.6384741306304935, "epoch": 1.1894162341484296, "grad_norm": 1.671875, "learning_rate": 0.00048683871898185486, "loss": 6.3156, "mean_token_accuracy": 0.1386343792080879, "num_tokens": 24045661.0, "step": 11115 }, { "entropy": 6.530051803588867, "epoch": 1.1899513082561934, "grad_norm": 1.5390625, "learning_rate": 0.00048682583136376145, "loss": 6.3107, "mean_token_accuracy": 0.12972315177321433, "num_tokens": 24057027.0, "step": 11120 }, { "entropy": 6.561061763763428, "epoch": 1.1904863823639573, "grad_norm": 1.6875, "learning_rate": 0.0004868129376292269, "loss": 6.4262, "mean_token_accuracy": 0.12427093610167503, "num_tokens": 24068322.0, "step": 11125 }, { "entropy": 6.577089643478393, "epoch": 1.1910214564717214, "grad_norm": 1.8125, "learning_rate": 0.00048680003777862356, "loss": 6.262, "mean_token_accuracy": 0.13514962196350097, "num_tokens": 24078506.0, "step": 11130 }, { "entropy": 6.5337562084198, "epoch": 1.1915565305794853, "grad_norm": 1.546875, "learning_rate": 0.00048678713181232394, "loss": 6.3015, "mean_token_accuracy": 0.13127023577690125, "num_tokens": 24090296.0, "step": 11135 }, { "entropy": 6.478974437713623, "epoch": 1.1920916046872492, "grad_norm": 1.8203125, "learning_rate": 0.00048677421973070063, "loss": 6.3149, "mean_token_accuracy": 0.12612876519560814, "num_tokens": 24101478.0, "step": 11140 }, { "entropy": 6.569290971755981, "epoch": 1.192626678795013, "grad_norm": 1.8515625, "learning_rate": 0.00048676130153412644, "loss": 6.3506, "mean_token_accuracy": 0.13295480459928513, "num_tokens": 24112552.0, "step": 11145 }, { "entropy": 6.528984689712525, "epoch": 1.193161752902777, "grad_norm": 1.4375, "learning_rate": 0.0004867483772229745, "loss": 6.2342, "mean_token_accuracy": 0.13378995954990386, "num_tokens": 24124210.0, "step": 11150 }, { "entropy": 6.576374435424805, "epoch": 1.193696827010541, "grad_norm": 1.625, "learning_rate": 0.0004867354467976178, "loss": 6.3129, "mean_token_accuracy": 0.1304231107234955, "num_tokens": 24133525.0, "step": 11155 }, { "entropy": 6.539589309692383, "epoch": 1.194231901118305, "grad_norm": 2.765625, "learning_rate": 0.00048672251025842994, "loss": 6.3677, "mean_token_accuracy": 0.1295190930366516, "num_tokens": 24145400.0, "step": 11160 }, { "entropy": 6.521314668655395, "epoch": 1.1947669752260688, "grad_norm": 1.6484375, "learning_rate": 0.0004867095676057843, "loss": 6.3647, "mean_token_accuracy": 0.12734123542904854, "num_tokens": 24155596.0, "step": 11165 }, { "entropy": 6.597847414016724, "epoch": 1.1953020493338327, "grad_norm": 1.5625, "learning_rate": 0.00048669661884005467, "loss": 6.3607, "mean_token_accuracy": 0.12178555279970169, "num_tokens": 24166683.0, "step": 11170 }, { "entropy": 6.577947998046875, "epoch": 1.1958371234415965, "grad_norm": 1.765625, "learning_rate": 0.00048668366396161503, "loss": 6.3108, "mean_token_accuracy": 0.13432841673493384, "num_tokens": 24177649.0, "step": 11175 }, { "entropy": 6.522364282608033, "epoch": 1.1963721975493606, "grad_norm": 1.859375, "learning_rate": 0.0004866707029708392, "loss": 6.3413, "mean_token_accuracy": 0.137134151160717, "num_tokens": 24188522.0, "step": 11180 }, { "entropy": 6.529253196716309, "epoch": 1.1969072716571245, "grad_norm": 1.3515625, "learning_rate": 0.0004866577358681015, "loss": 6.3037, "mean_token_accuracy": 0.12979593575000764, "num_tokens": 24199285.0, "step": 11185 }, { "entropy": 6.514498519897461, "epoch": 1.1974423457648884, "grad_norm": 1.5859375, "learning_rate": 0.0004866447626537765, "loss": 6.2671, "mean_token_accuracy": 0.12873406931757927, "num_tokens": 24210929.0, "step": 11190 }, { "entropy": 6.5354969024658205, "epoch": 1.1979774198726523, "grad_norm": 3.5, "learning_rate": 0.0004866317833282387, "loss": 6.3273, "mean_token_accuracy": 0.13138288259506226, "num_tokens": 24221394.0, "step": 11195 }, { "entropy": 6.541649389266968, "epoch": 1.1985124939804164, "grad_norm": 1.6796875, "learning_rate": 0.00048661879789186295, "loss": 6.2726, "mean_token_accuracy": 0.13947225138545036, "num_tokens": 24230297.0, "step": 11200 }, { "entropy": 6.477359199523926, "epoch": 1.1990475680881802, "grad_norm": 2.171875, "learning_rate": 0.00048660580634502415, "loss": 6.4373, "mean_token_accuracy": 0.1276162840425968, "num_tokens": 24241505.0, "step": 11205 }, { "entropy": 6.58246431350708, "epoch": 1.1995826421959441, "grad_norm": 1.46875, "learning_rate": 0.00048659280868809744, "loss": 6.2864, "mean_token_accuracy": 0.13593244180083275, "num_tokens": 24252638.0, "step": 11210 }, { "entropy": 6.544987678527832, "epoch": 1.200117716303708, "grad_norm": 1.7890625, "learning_rate": 0.000486579804921458, "loss": 6.3322, "mean_token_accuracy": 0.13251487016677857, "num_tokens": 24263156.0, "step": 11215 }, { "entropy": 6.491865015029907, "epoch": 1.200652790411472, "grad_norm": 1.9140625, "learning_rate": 0.00048656679504548145, "loss": 6.2094, "mean_token_accuracy": 0.14105861783027648, "num_tokens": 24274384.0, "step": 11220 }, { "entropy": 6.590060424804688, "epoch": 1.201187864519236, "grad_norm": 1.6953125, "learning_rate": 0.0004865537790605435, "loss": 6.4135, "mean_token_accuracy": 0.1250110797584057, "num_tokens": 24285159.0, "step": 11225 }, { "entropy": 6.5946595668792725, "epoch": 1.2017229386269999, "grad_norm": 2.0, "learning_rate": 0.0004865407569670198, "loss": 6.3782, "mean_token_accuracy": 0.12558842301368714, "num_tokens": 24296202.0, "step": 11230 }, { "entropy": 6.573181533813477, "epoch": 1.2022580127347637, "grad_norm": 1.3203125, "learning_rate": 0.0004865277287652866, "loss": 6.3131, "mean_token_accuracy": 0.13199632614850998, "num_tokens": 24306691.0, "step": 11235 }, { "entropy": 6.529475450515747, "epoch": 1.2027930868425276, "grad_norm": 2.59375, "learning_rate": 0.0004865146944557199, "loss": 6.3309, "mean_token_accuracy": 0.13316164761781693, "num_tokens": 24317499.0, "step": 11240 }, { "entropy": 6.524376726150512, "epoch": 1.2033281609502917, "grad_norm": 1.5078125, "learning_rate": 0.0004865016540386961, "loss": 6.3271, "mean_token_accuracy": 0.12565939500927925, "num_tokens": 24328096.0, "step": 11245 }, { "entropy": 6.5775762557983395, "epoch": 1.2038632350580556, "grad_norm": 1.578125, "learning_rate": 0.00048648860751459173, "loss": 6.3148, "mean_token_accuracy": 0.12669195979833603, "num_tokens": 24338188.0, "step": 11250 }, { "entropy": 6.611456346511841, "epoch": 1.2043983091658195, "grad_norm": 1.6015625, "learning_rate": 0.00048647555488378355, "loss": 6.3508, "mean_token_accuracy": 0.1369207866489887, "num_tokens": 24348578.0, "step": 11255 }, { "entropy": 6.4663220882415775, "epoch": 1.2049333832735833, "grad_norm": 1.3984375, "learning_rate": 0.0004864624961466485, "loss": 6.316, "mean_token_accuracy": 0.13434598073363305, "num_tokens": 24358807.0, "step": 11260 }, { "entropy": 6.532084560394287, "epoch": 1.2054684573813472, "grad_norm": 1.953125, "learning_rate": 0.0004864494313035635, "loss": 6.3274, "mean_token_accuracy": 0.12798592671751977, "num_tokens": 24369074.0, "step": 11265 }, { "entropy": 6.560862922668457, "epoch": 1.2060035314891113, "grad_norm": 2.359375, "learning_rate": 0.000486436360354906, "loss": 6.2862, "mean_token_accuracy": 0.13494868949055672, "num_tokens": 24380655.0, "step": 11270 }, { "entropy": 6.523475408554077, "epoch": 1.2065386055968752, "grad_norm": 1.59375, "learning_rate": 0.00048642328330105323, "loss": 6.298, "mean_token_accuracy": 0.1289362497627735, "num_tokens": 24391701.0, "step": 11275 }, { "entropy": 6.4451531887054445, "epoch": 1.207073679704639, "grad_norm": 2.640625, "learning_rate": 0.00048641020014238286, "loss": 6.3675, "mean_token_accuracy": 0.1261564612388611, "num_tokens": 24403690.0, "step": 11280 }, { "entropy": 6.575537538528442, "epoch": 1.207608753812403, "grad_norm": 1.8125, "learning_rate": 0.0004863971108792727, "loss": 6.3536, "mean_token_accuracy": 0.13011251464486123, "num_tokens": 24414670.0, "step": 11285 }, { "entropy": 6.56957893371582, "epoch": 1.2081438279201668, "grad_norm": 1.625, "learning_rate": 0.00048638401551210063, "loss": 6.392, "mean_token_accuracy": 0.12319833263754845, "num_tokens": 24425237.0, "step": 11290 }, { "entropy": 6.624338102340698, "epoch": 1.208678902027931, "grad_norm": 1.6015625, "learning_rate": 0.00048637091404124484, "loss": 6.3556, "mean_token_accuracy": 0.12925269529223443, "num_tokens": 24437142.0, "step": 11295 }, { "entropy": 6.535131216049194, "epoch": 1.2092139761356948, "grad_norm": 1.5390625, "learning_rate": 0.0004863578064670837, "loss": 6.2612, "mean_token_accuracy": 0.13685486912727357, "num_tokens": 24448819.0, "step": 11300 }, { "entropy": 6.461548089981079, "epoch": 1.2097490502434587, "grad_norm": 1.7890625, "learning_rate": 0.00048634469278999545, "loss": 6.2061, "mean_token_accuracy": 0.13641059249639512, "num_tokens": 24459392.0, "step": 11305 }, { "entropy": 6.54414005279541, "epoch": 1.2102841243512226, "grad_norm": 1.609375, "learning_rate": 0.00048633157301035895, "loss": 6.3116, "mean_token_accuracy": 0.13257984444499016, "num_tokens": 24470298.0, "step": 11310 }, { "entropy": 6.531377696990967, "epoch": 1.2108191984589864, "grad_norm": 1.484375, "learning_rate": 0.000486318447128553, "loss": 6.2782, "mean_token_accuracy": 0.13613951429724694, "num_tokens": 24480477.0, "step": 11315 }, { "entropy": 6.52601203918457, "epoch": 1.2113542725667505, "grad_norm": 1.5078125, "learning_rate": 0.0004863053151449566, "loss": 6.3621, "mean_token_accuracy": 0.12074363008141517, "num_tokens": 24491890.0, "step": 11320 }, { "entropy": 6.586244249343872, "epoch": 1.2118893466745144, "grad_norm": 1.5546875, "learning_rate": 0.00048629217705994883, "loss": 6.3083, "mean_token_accuracy": 0.13098841160535812, "num_tokens": 24502583.0, "step": 11325 }, { "entropy": 6.6022148609161375, "epoch": 1.2124244207822783, "grad_norm": 1.7265625, "learning_rate": 0.0004862790328739091, "loss": 6.4024, "mean_token_accuracy": 0.12709670886397362, "num_tokens": 24514491.0, "step": 11330 }, { "entropy": 6.534934377670288, "epoch": 1.2129594948900422, "grad_norm": 1.6796875, "learning_rate": 0.00048626588258721717, "loss": 6.2358, "mean_token_accuracy": 0.1416369266808033, "num_tokens": 24524788.0, "step": 11335 }, { "entropy": 6.484699773788452, "epoch": 1.2134945689978063, "grad_norm": 2.09375, "learning_rate": 0.0004862527262002524, "loss": 6.2805, "mean_token_accuracy": 0.1266206443309784, "num_tokens": 24535699.0, "step": 11340 }, { "entropy": 6.476378440856934, "epoch": 1.2140296431055702, "grad_norm": 1.4609375, "learning_rate": 0.00048623956371339494, "loss": 6.2961, "mean_token_accuracy": 0.13135870769619942, "num_tokens": 24547339.0, "step": 11345 }, { "entropy": 6.561729049682617, "epoch": 1.214564717213334, "grad_norm": 1.8984375, "learning_rate": 0.00048622639512702477, "loss": 6.4041, "mean_token_accuracy": 0.12762944996356965, "num_tokens": 24558778.0, "step": 11350 }, { "entropy": 6.593435049057007, "epoch": 1.215099791321098, "grad_norm": 1.4375, "learning_rate": 0.00048621322044152207, "loss": 6.315, "mean_token_accuracy": 0.13191851750016212, "num_tokens": 24569032.0, "step": 11355 }, { "entropy": 6.583175373077393, "epoch": 1.215634865428862, "grad_norm": 1.6328125, "learning_rate": 0.00048620003965726727, "loss": 6.3928, "mean_token_accuracy": 0.11859198734164238, "num_tokens": 24581356.0, "step": 11360 }, { "entropy": 6.534153842926026, "epoch": 1.2161699395366259, "grad_norm": 1.6171875, "learning_rate": 0.00048618685277464116, "loss": 6.2689, "mean_token_accuracy": 0.13176984637975692, "num_tokens": 24591809.0, "step": 11365 }, { "entropy": 6.411161661148071, "epoch": 1.2167050136443898, "grad_norm": 2.390625, "learning_rate": 0.00048617365979402417, "loss": 6.2104, "mean_token_accuracy": 0.13641507998108865, "num_tokens": 24603492.0, "step": 11370 }, { "entropy": 6.517438983917236, "epoch": 1.2172400877521536, "grad_norm": 1.7109375, "learning_rate": 0.0004861604607157975, "loss": 6.3692, "mean_token_accuracy": 0.1288558103144169, "num_tokens": 24614837.0, "step": 11375 }, { "entropy": 6.6012519836425785, "epoch": 1.2177751618599175, "grad_norm": 1.5390625, "learning_rate": 0.0004861472555403423, "loss": 6.3529, "mean_token_accuracy": 0.13232268989086152, "num_tokens": 24624714.0, "step": 11380 }, { "entropy": 6.557205009460449, "epoch": 1.2183102359676816, "grad_norm": 1.7109375, "learning_rate": 0.00048613404426803964, "loss": 6.4042, "mean_token_accuracy": 0.12305559441447259, "num_tokens": 24635758.0, "step": 11385 }, { "entropy": 6.575355005264282, "epoch": 1.2188453100754455, "grad_norm": 2.453125, "learning_rate": 0.00048612082689927116, "loss": 6.3542, "mean_token_accuracy": 0.13127371445298194, "num_tokens": 24645362.0, "step": 11390 }, { "entropy": 6.561426973342895, "epoch": 1.2193803841832094, "grad_norm": 1.6640625, "learning_rate": 0.0004861076034344185, "loss": 6.3679, "mean_token_accuracy": 0.12842421904206275, "num_tokens": 24656898.0, "step": 11395 }, { "entropy": 6.53923807144165, "epoch": 1.2199154582909733, "grad_norm": 1.6171875, "learning_rate": 0.0004860943738738634, "loss": 6.3062, "mean_token_accuracy": 0.13347529992461205, "num_tokens": 24668191.0, "step": 11400 }, { "entropy": 6.624059057235717, "epoch": 1.2204505323987371, "grad_norm": 2.4375, "learning_rate": 0.00048608113821798786, "loss": 6.3169, "mean_token_accuracy": 0.13543845787644387, "num_tokens": 24678034.0, "step": 11405 }, { "entropy": 6.529640436172485, "epoch": 1.2209856065065012, "grad_norm": 1.4921875, "learning_rate": 0.0004860678964671743, "loss": 6.3722, "mean_token_accuracy": 0.1315036676824093, "num_tokens": 24689062.0, "step": 11410 }, { "entropy": 6.508565950393677, "epoch": 1.221520680614265, "grad_norm": 1.640625, "learning_rate": 0.00048605464862180474, "loss": 6.3402, "mean_token_accuracy": 0.1287380076944828, "num_tokens": 24699787.0, "step": 11415 }, { "entropy": 6.607008266448974, "epoch": 1.222055754722029, "grad_norm": 1.578125, "learning_rate": 0.0004860413946822619, "loss": 6.2744, "mean_token_accuracy": 0.13421041816473006, "num_tokens": 24711233.0, "step": 11420 }, { "entropy": 6.556663608551025, "epoch": 1.2225908288297929, "grad_norm": 1.609375, "learning_rate": 0.0004860281346489284, "loss": 6.3119, "mean_token_accuracy": 0.12159497067332267, "num_tokens": 24722414.0, "step": 11425 }, { "entropy": 6.543051385879517, "epoch": 1.2231259029375567, "grad_norm": 1.6171875, "learning_rate": 0.0004860148685221873, "loss": 6.3464, "mean_token_accuracy": 0.12858733609318734, "num_tokens": 24733093.0, "step": 11430 }, { "entropy": 6.498806571960449, "epoch": 1.2236609770453208, "grad_norm": 2.453125, "learning_rate": 0.00048600159630242135, "loss": 6.292, "mean_token_accuracy": 0.1355809085071087, "num_tokens": 24743195.0, "step": 11435 }, { "entropy": 6.597199249267578, "epoch": 1.2241960511530847, "grad_norm": 1.5078125, "learning_rate": 0.00048598831799001406, "loss": 6.3037, "mean_token_accuracy": 0.13153010681271554, "num_tokens": 24753680.0, "step": 11440 }, { "entropy": 6.554786682128906, "epoch": 1.2247311252608486, "grad_norm": 1.4296875, "learning_rate": 0.0004859750335853488, "loss": 6.281, "mean_token_accuracy": 0.13536786139011384, "num_tokens": 24764135.0, "step": 11445 }, { "entropy": 6.403936672210693, "epoch": 1.2252661993686125, "grad_norm": 1.640625, "learning_rate": 0.000485961743088809, "loss": 6.2461, "mean_token_accuracy": 0.14579313546419143, "num_tokens": 24775740.0, "step": 11450 }, { "entropy": 6.5270256996154785, "epoch": 1.2258012734763766, "grad_norm": 1.4921875, "learning_rate": 0.0004859484465007784, "loss": 6.3673, "mean_token_accuracy": 0.12632556781172752, "num_tokens": 24786169.0, "step": 11455 }, { "entropy": 6.585242223739624, "epoch": 1.2263363475841405, "grad_norm": 1.90625, "learning_rate": 0.00048593514382164123, "loss": 6.2608, "mean_token_accuracy": 0.1336404174566269, "num_tokens": 24796218.0, "step": 11460 }, { "entropy": 6.583890581130982, "epoch": 1.2268714216919043, "grad_norm": 1.546875, "learning_rate": 0.0004859218350517814, "loss": 6.3979, "mean_token_accuracy": 0.12642351686954498, "num_tokens": 24806957.0, "step": 11465 }, { "entropy": 6.583371877670288, "epoch": 1.2274064957996682, "grad_norm": 1.6015625, "learning_rate": 0.0004859085201915831, "loss": 6.3354, "mean_token_accuracy": 0.13102125078439714, "num_tokens": 24818761.0, "step": 11470 }, { "entropy": 6.531420612335205, "epoch": 1.227941569907432, "grad_norm": 1.4609375, "learning_rate": 0.0004858951992414311, "loss": 6.2512, "mean_token_accuracy": 0.14173662960529326, "num_tokens": 24829163.0, "step": 11475 }, { "entropy": 6.497774124145508, "epoch": 1.2284766440151962, "grad_norm": 1.5859375, "learning_rate": 0.0004858818722017097, "loss": 6.2629, "mean_token_accuracy": 0.13168734014034272, "num_tokens": 24839334.0, "step": 11480 }, { "entropy": 6.438531589508057, "epoch": 1.22901171812296, "grad_norm": 2.71875, "learning_rate": 0.00048586853907280395, "loss": 6.2939, "mean_token_accuracy": 0.13705965429544448, "num_tokens": 24850312.0, "step": 11485 }, { "entropy": 6.46503438949585, "epoch": 1.229546792230724, "grad_norm": 1.5703125, "learning_rate": 0.0004858551998550987, "loss": 6.2499, "mean_token_accuracy": 0.13945921510457993, "num_tokens": 24861835.0, "step": 11490 }, { "entropy": 6.5869134902954105, "epoch": 1.2300818663384878, "grad_norm": 1.6640625, "learning_rate": 0.00048584185454897925, "loss": 6.3371, "mean_token_accuracy": 0.13292859718203545, "num_tokens": 24872489.0, "step": 11495 }, { "entropy": 6.543988800048828, "epoch": 1.230616940446252, "grad_norm": 1.5859375, "learning_rate": 0.0004858285031548309, "loss": 6.3299, "mean_token_accuracy": 0.1338948406279087, "num_tokens": 24882553.0, "step": 11500 }, { "entropy": 6.562069129943848, "epoch": 1.2311520145540158, "grad_norm": 2.015625, "learning_rate": 0.0004858151456730391, "loss": 6.3451, "mean_token_accuracy": 0.13700807690620423, "num_tokens": 24894386.0, "step": 11505 }, { "entropy": 6.503233861923218, "epoch": 1.2316870886617797, "grad_norm": 1.390625, "learning_rate": 0.00048580178210398954, "loss": 6.3286, "mean_token_accuracy": 0.1292463280260563, "num_tokens": 24905049.0, "step": 11510 }, { "entropy": 6.498210716247558, "epoch": 1.2322221627695435, "grad_norm": 1.9921875, "learning_rate": 0.00048578841244806823, "loss": 6.2857, "mean_token_accuracy": 0.13507410660386085, "num_tokens": 24914831.0, "step": 11515 }, { "entropy": 6.542500925064087, "epoch": 1.2327572368773074, "grad_norm": 1.5234375, "learning_rate": 0.00048577503670566116, "loss": 6.3522, "mean_token_accuracy": 0.1338055945932865, "num_tokens": 24925668.0, "step": 11520 }, { "entropy": 6.526769018173217, "epoch": 1.2332923109850715, "grad_norm": 2.03125, "learning_rate": 0.00048576165487715443, "loss": 6.3151, "mean_token_accuracy": 0.12994013503193855, "num_tokens": 24935983.0, "step": 11525 }, { "entropy": 6.503340578079223, "epoch": 1.2338273850928354, "grad_norm": 1.828125, "learning_rate": 0.00048574826696293455, "loss": 6.286, "mean_token_accuracy": 0.13225105702877044, "num_tokens": 24946673.0, "step": 11530 }, { "entropy": 6.51578311920166, "epoch": 1.2343624592005993, "grad_norm": 1.625, "learning_rate": 0.00048573487296338814, "loss": 6.2233, "mean_token_accuracy": 0.1413614720106125, "num_tokens": 24957075.0, "step": 11535 }, { "entropy": 6.567255687713623, "epoch": 1.2348975333083632, "grad_norm": 1.8203125, "learning_rate": 0.00048572147287890183, "loss": 6.3765, "mean_token_accuracy": 0.12877800017595292, "num_tokens": 24967261.0, "step": 11540 }, { "entropy": 6.520781135559082, "epoch": 1.235432607416127, "grad_norm": 1.9921875, "learning_rate": 0.00048570806670986263, "loss": 6.3025, "mean_token_accuracy": 0.13159753754734993, "num_tokens": 24978097.0, "step": 11545 }, { "entropy": 6.535343837738037, "epoch": 1.2359676815238911, "grad_norm": 3.15625, "learning_rate": 0.00048569465445665754, "loss": 6.3216, "mean_token_accuracy": 0.13654093891382219, "num_tokens": 24987932.0, "step": 11550 }, { "entropy": 6.523883533477783, "epoch": 1.236502755631655, "grad_norm": 1.4921875, "learning_rate": 0.00048568123611967396, "loss": 6.3169, "mean_token_accuracy": 0.1302984580397606, "num_tokens": 24998919.0, "step": 11555 }, { "entropy": 6.539691972732544, "epoch": 1.237037829739419, "grad_norm": 1.46875, "learning_rate": 0.0004856678116992993, "loss": 6.2757, "mean_token_accuracy": 0.13371165171265603, "num_tokens": 25010545.0, "step": 11560 }, { "entropy": 6.553024625778198, "epoch": 1.2375729038471828, "grad_norm": 1.6640625, "learning_rate": 0.0004856543811959212, "loss": 6.2565, "mean_token_accuracy": 0.1440042093396187, "num_tokens": 25021133.0, "step": 11565 }, { "entropy": 6.498435544967651, "epoch": 1.2381079779549466, "grad_norm": 1.71875, "learning_rate": 0.0004856409446099274, "loss": 6.2983, "mean_token_accuracy": 0.1292448416352272, "num_tokens": 25031838.0, "step": 11570 }, { "entropy": 6.48333420753479, "epoch": 1.2386430520627107, "grad_norm": 1.2578125, "learning_rate": 0.00048562750194170595, "loss": 6.3169, "mean_token_accuracy": 0.1293560743331909, "num_tokens": 25042737.0, "step": 11575 }, { "entropy": 6.554791212081909, "epoch": 1.2391781261704746, "grad_norm": 1.78125, "learning_rate": 0.000485614053191645, "loss": 6.4063, "mean_token_accuracy": 0.13055189922451974, "num_tokens": 25054442.0, "step": 11580 }, { "entropy": 6.489489889144897, "epoch": 1.2397132002782385, "grad_norm": 1.4375, "learning_rate": 0.0004856005983601328, "loss": 6.1367, "mean_token_accuracy": 0.1456099934875965, "num_tokens": 25065509.0, "step": 11585 }, { "entropy": 6.5698034286499025, "epoch": 1.2402482743860024, "grad_norm": 1.765625, "learning_rate": 0.00048558713744755794, "loss": 6.3897, "mean_token_accuracy": 0.12442174926400185, "num_tokens": 25077306.0, "step": 11590 }, { "entropy": 6.521883249282837, "epoch": 1.2407833484937665, "grad_norm": 1.859375, "learning_rate": 0.0004855736704543091, "loss": 6.3081, "mean_token_accuracy": 0.13450614660978316, "num_tokens": 25088230.0, "step": 11595 }, { "entropy": 6.6110950946807865, "epoch": 1.2413184226015304, "grad_norm": 1.5546875, "learning_rate": 0.0004855601973807751, "loss": 6.4096, "mean_token_accuracy": 0.12289422452449798, "num_tokens": 25099658.0, "step": 11600 }, { "entropy": 6.573994112014771, "epoch": 1.2418534967092942, "grad_norm": 1.46875, "learning_rate": 0.00048554671822734495, "loss": 6.3072, "mean_token_accuracy": 0.13023086190223693, "num_tokens": 25110512.0, "step": 11605 }, { "entropy": 6.5347192764282225, "epoch": 1.2423885708170581, "grad_norm": 1.953125, "learning_rate": 0.00048553323299440807, "loss": 6.3089, "mean_token_accuracy": 0.13401264771819116, "num_tokens": 25120193.0, "step": 11610 }, { "entropy": 6.528376770019531, "epoch": 1.242923644924822, "grad_norm": 1.6328125, "learning_rate": 0.00048551974168235346, "loss": 6.321, "mean_token_accuracy": 0.12739662155508996, "num_tokens": 25131752.0, "step": 11615 }, { "entropy": 6.599687719345093, "epoch": 1.243458719032586, "grad_norm": 1.5703125, "learning_rate": 0.000485506244291571, "loss": 6.3224, "mean_token_accuracy": 0.13200697377324105, "num_tokens": 25141541.0, "step": 11620 }, { "entropy": 6.466404867172241, "epoch": 1.24399379314035, "grad_norm": 1.703125, "learning_rate": 0.0004854927408224503, "loss": 6.3133, "mean_token_accuracy": 0.1312132328748703, "num_tokens": 25152219.0, "step": 11625 }, { "entropy": 6.591228199005127, "epoch": 1.2445288672481138, "grad_norm": 1.3671875, "learning_rate": 0.00048547923127538126, "loss": 6.335, "mean_token_accuracy": 0.12918494567275046, "num_tokens": 25163030.0, "step": 11630 }, { "entropy": 6.499180746078491, "epoch": 1.2450639413558777, "grad_norm": 1.6171875, "learning_rate": 0.00048546571565075396, "loss": 6.2216, "mean_token_accuracy": 0.13481747061014177, "num_tokens": 25174637.0, "step": 11635 }, { "entropy": 6.426168441772461, "epoch": 1.2455990154636418, "grad_norm": 1.5390625, "learning_rate": 0.0004854521939489587, "loss": 6.2036, "mean_token_accuracy": 0.14389699101448059, "num_tokens": 25185067.0, "step": 11640 }, { "entropy": 6.467606449127198, "epoch": 1.2461340895714057, "grad_norm": 1.3359375, "learning_rate": 0.00048543866617038604, "loss": 6.2433, "mean_token_accuracy": 0.13719036281108857, "num_tokens": 25195046.0, "step": 11645 }, { "entropy": 6.517219161987304, "epoch": 1.2466691636791696, "grad_norm": 1.4453125, "learning_rate": 0.00048542513231542635, "loss": 6.3435, "mean_token_accuracy": 0.12623920813202857, "num_tokens": 25206265.0, "step": 11650 }, { "entropy": 6.581112813949585, "epoch": 1.2472042377869335, "grad_norm": 1.3515625, "learning_rate": 0.0004854115923844705, "loss": 6.3332, "mean_token_accuracy": 0.1283203311264515, "num_tokens": 25217690.0, "step": 11655 }, { "entropy": 6.549913930892944, "epoch": 1.2477393118946973, "grad_norm": 1.6953125, "learning_rate": 0.0004853980463779096, "loss": 6.3369, "mean_token_accuracy": 0.12955136895179747, "num_tokens": 25228229.0, "step": 11660 }, { "entropy": 6.473557043075561, "epoch": 1.2482743860024614, "grad_norm": 1.8046875, "learning_rate": 0.0004853844942961346, "loss": 6.2698, "mean_token_accuracy": 0.13080960735678673, "num_tokens": 25240073.0, "step": 11665 }, { "entropy": 6.530133438110352, "epoch": 1.2488094601102253, "grad_norm": 1.3671875, "learning_rate": 0.000485370936139537, "loss": 6.3283, "mean_token_accuracy": 0.1356102332472801, "num_tokens": 25251915.0, "step": 11670 }, { "entropy": 6.512946271896363, "epoch": 1.2493445342179892, "grad_norm": 1.4375, "learning_rate": 0.000485357371908508, "loss": 6.2963, "mean_token_accuracy": 0.1290469728410244, "num_tokens": 25262932.0, "step": 11675 }, { "entropy": 6.533622694015503, "epoch": 1.249879608325753, "grad_norm": 1.703125, "learning_rate": 0.0004853438016034396, "loss": 6.3622, "mean_token_accuracy": 0.12990323528647424, "num_tokens": 25274693.0, "step": 11680 }, { "entropy": 6.59214186668396, "epoch": 1.250414682433517, "grad_norm": 1.3828125, "learning_rate": 0.00048533022522472344, "loss": 6.2521, "mean_token_accuracy": 0.13764603063464165, "num_tokens": 25285359.0, "step": 11685 }, { "entropy": 6.497456979751587, "epoch": 1.250949756541281, "grad_norm": 1.703125, "learning_rate": 0.00048531664277275154, "loss": 6.284, "mean_token_accuracy": 0.12981810346245765, "num_tokens": 25296730.0, "step": 11690 }, { "entropy": 6.502764129638672, "epoch": 1.251484830649045, "grad_norm": 1.8984375, "learning_rate": 0.0004853030542479162, "loss": 6.3198, "mean_token_accuracy": 0.1384017750620842, "num_tokens": 25306422.0, "step": 11695 }, { "entropy": 6.5642656803131105, "epoch": 1.2520199047568088, "grad_norm": 1.9140625, "learning_rate": 0.0004852894596506096, "loss": 6.3438, "mean_token_accuracy": 0.1314690053462982, "num_tokens": 25317980.0, "step": 11700 }, { "entropy": 6.534403991699219, "epoch": 1.2525549788645727, "grad_norm": 1.921875, "learning_rate": 0.0004852758589812245, "loss": 6.3699, "mean_token_accuracy": 0.13768871873617172, "num_tokens": 25329905.0, "step": 11705 }, { "entropy": 6.602970790863037, "epoch": 1.2530900529723366, "grad_norm": 1.59375, "learning_rate": 0.00048526225224015355, "loss": 6.3306, "mean_token_accuracy": 0.12489748820662498, "num_tokens": 25340759.0, "step": 11710 }, { "entropy": 6.553256988525391, "epoch": 1.2536251270801007, "grad_norm": 1.5703125, "learning_rate": 0.0004852486394277896, "loss": 6.3526, "mean_token_accuracy": 0.12719984650611876, "num_tokens": 25351124.0, "step": 11715 }, { "entropy": 6.591535377502441, "epoch": 1.2541602011878645, "grad_norm": 2.0, "learning_rate": 0.00048523502054452565, "loss": 6.2829, "mean_token_accuracy": 0.1319223664700985, "num_tokens": 25361337.0, "step": 11720 }, { "entropy": 6.585754776000977, "epoch": 1.2546952752956284, "grad_norm": 1.7109375, "learning_rate": 0.00048522139559075507, "loss": 6.3222, "mean_token_accuracy": 0.13189950287342073, "num_tokens": 25371893.0, "step": 11725 }, { "entropy": 6.456956672668457, "epoch": 1.2552303494033923, "grad_norm": 1.6328125, "learning_rate": 0.0004852077645668712, "loss": 6.206, "mean_token_accuracy": 0.14131250604987144, "num_tokens": 25383365.0, "step": 11730 }, { "entropy": 6.5274192810058596, "epoch": 1.2557654235111562, "grad_norm": 1.7109375, "learning_rate": 0.0004851941274732678, "loss": 6.3123, "mean_token_accuracy": 0.13500531166791915, "num_tokens": 25393211.0, "step": 11735 }, { "entropy": 6.4369782447814945, "epoch": 1.2563004976189203, "grad_norm": 1.4609375, "learning_rate": 0.0004851804843103384, "loss": 6.1746, "mean_token_accuracy": 0.13275761157274246, "num_tokens": 25404828.0, "step": 11740 }, { "entropy": 6.571536111831665, "epoch": 1.2568355717266841, "grad_norm": 1.71875, "learning_rate": 0.00048516683507847705, "loss": 6.3314, "mean_token_accuracy": 0.13917914777994156, "num_tokens": 25416016.0, "step": 11745 }, { "entropy": 6.576375675201416, "epoch": 1.257370645834448, "grad_norm": 1.6171875, "learning_rate": 0.0004851531797780779, "loss": 6.2882, "mean_token_accuracy": 0.13366828113794327, "num_tokens": 25426173.0, "step": 11750 }, { "entropy": 6.525392293930054, "epoch": 1.2579057199422121, "grad_norm": 1.6953125, "learning_rate": 0.0004851395184095352, "loss": 6.246, "mean_token_accuracy": 0.138031068444252, "num_tokens": 25437507.0, "step": 11755 }, { "entropy": 6.542758798599243, "epoch": 1.258440794049976, "grad_norm": 1.609375, "learning_rate": 0.0004851258509732434, "loss": 6.3298, "mean_token_accuracy": 0.1226758360862732, "num_tokens": 25448201.0, "step": 11760 }, { "entropy": 6.596157741546631, "epoch": 1.2589758681577399, "grad_norm": 3.265625, "learning_rate": 0.00048511217746959723, "loss": 6.3493, "mean_token_accuracy": 0.13061847537755966, "num_tokens": 25458640.0, "step": 11765 }, { "entropy": 6.558047437667847, "epoch": 1.2595109422655038, "grad_norm": 1.4609375, "learning_rate": 0.00048509849789899146, "loss": 6.3383, "mean_token_accuracy": 0.137232506275177, "num_tokens": 25469474.0, "step": 11770 }, { "entropy": 6.561356449127198, "epoch": 1.2600460163732676, "grad_norm": 1.484375, "learning_rate": 0.000485084812261821, "loss": 6.4076, "mean_token_accuracy": 0.12736963108181953, "num_tokens": 25479565.0, "step": 11775 }, { "entropy": 6.5499156475067135, "epoch": 1.2605810904810317, "grad_norm": 1.46875, "learning_rate": 0.0004850711205584812, "loss": 6.2692, "mean_token_accuracy": 0.1392711654305458, "num_tokens": 25490142.0, "step": 11780 }, { "entropy": 6.516708469390869, "epoch": 1.2611161645887956, "grad_norm": 1.5703125, "learning_rate": 0.00048505742278936726, "loss": 6.3754, "mean_token_accuracy": 0.13398413434624673, "num_tokens": 25500824.0, "step": 11785 }, { "entropy": 6.591862440109253, "epoch": 1.2616512386965595, "grad_norm": 1.5390625, "learning_rate": 0.00048504371895487474, "loss": 6.3129, "mean_token_accuracy": 0.13289703279733658, "num_tokens": 25511251.0, "step": 11790 }, { "entropy": 6.547235202789307, "epoch": 1.2621863128043234, "grad_norm": 1.84375, "learning_rate": 0.00048503000905539945, "loss": 6.2989, "mean_token_accuracy": 0.12680892273783684, "num_tokens": 25521368.0, "step": 11795 }, { "entropy": 6.541527271270752, "epoch": 1.2627213869120872, "grad_norm": 1.4453125, "learning_rate": 0.00048501629309133707, "loss": 6.3076, "mean_token_accuracy": 0.12748572900891303, "num_tokens": 25532486.0, "step": 11800 }, { "entropy": 6.5395254611969, "epoch": 1.2632564610198513, "grad_norm": 1.484375, "learning_rate": 0.0004850025710630838, "loss": 6.3163, "mean_token_accuracy": 0.13559018895030023, "num_tokens": 25542867.0, "step": 11805 }, { "entropy": 6.500273132324219, "epoch": 1.2637915351276152, "grad_norm": 1.671875, "learning_rate": 0.00048498884297103575, "loss": 6.2761, "mean_token_accuracy": 0.1332220569252968, "num_tokens": 25553564.0, "step": 11810 }, { "entropy": 6.533845472335815, "epoch": 1.264326609235379, "grad_norm": 1.3125, "learning_rate": 0.0004849751088155894, "loss": 6.2803, "mean_token_accuracy": 0.13092882707715034, "num_tokens": 25564017.0, "step": 11815 }, { "entropy": 6.506636095046997, "epoch": 1.264861683343143, "grad_norm": 1.2265625, "learning_rate": 0.0004849613685971413, "loss": 6.2117, "mean_token_accuracy": 0.13756049647927285, "num_tokens": 25575125.0, "step": 11820 }, { "entropy": 6.572484350204467, "epoch": 1.2653967574509069, "grad_norm": 2.78125, "learning_rate": 0.0004849476223160882, "loss": 6.3677, "mean_token_accuracy": 0.12898685410618782, "num_tokens": 25586405.0, "step": 11825 }, { "entropy": 6.514791965484619, "epoch": 1.265931831558671, "grad_norm": 1.6875, "learning_rate": 0.0004849338699728269, "loss": 6.3329, "mean_token_accuracy": 0.12814901471138002, "num_tokens": 25597494.0, "step": 11830 }, { "entropy": 6.529297876358032, "epoch": 1.2664669056664348, "grad_norm": 1.6484375, "learning_rate": 0.00048492011156775467, "loss": 6.2773, "mean_token_accuracy": 0.13860967606306077, "num_tokens": 25608425.0, "step": 11835 }, { "entropy": 6.5342460632324215, "epoch": 1.2670019797741987, "grad_norm": 1.78125, "learning_rate": 0.0004849063471012688, "loss": 6.2997, "mean_token_accuracy": 0.1266927093267441, "num_tokens": 25619411.0, "step": 11840 }, { "entropy": 6.566569089889526, "epoch": 1.2675370538819626, "grad_norm": 1.3515625, "learning_rate": 0.0004848925765737665, "loss": 6.3383, "mean_token_accuracy": 0.12526525929570198, "num_tokens": 25630477.0, "step": 11845 }, { "entropy": 6.587625980377197, "epoch": 1.2680721279897265, "grad_norm": 1.34375, "learning_rate": 0.00048487879998564565, "loss": 6.2614, "mean_token_accuracy": 0.1306361250579357, "num_tokens": 25640129.0, "step": 11850 }, { "entropy": 6.512728309631347, "epoch": 1.2686072020974906, "grad_norm": 1.4921875, "learning_rate": 0.00048486501733730386, "loss": 6.3371, "mean_token_accuracy": 0.132972913980484, "num_tokens": 25650592.0, "step": 11855 }, { "entropy": 6.506902265548706, "epoch": 1.2691422762052544, "grad_norm": 1.3828125, "learning_rate": 0.00048485122862913934, "loss": 6.2482, "mean_token_accuracy": 0.1407736212015152, "num_tokens": 25660408.0, "step": 11860 }, { "entropy": 6.493857097625733, "epoch": 1.2696773503130183, "grad_norm": 1.609375, "learning_rate": 0.00048483743386154994, "loss": 6.3532, "mean_token_accuracy": 0.13489907830953599, "num_tokens": 25671563.0, "step": 11865 }, { "entropy": 6.558619737625122, "epoch": 1.2702124244207824, "grad_norm": 1.5390625, "learning_rate": 0.00048482363303493415, "loss": 6.2846, "mean_token_accuracy": 0.13159688413143159, "num_tokens": 25682474.0, "step": 11870 }, { "entropy": 6.642208576202393, "epoch": 1.270747498528546, "grad_norm": 1.3046875, "learning_rate": 0.0004848098261496905, "loss": 6.299, "mean_token_accuracy": 0.12964960634708406, "num_tokens": 25692594.0, "step": 11875 }, { "entropy": 6.392217111587525, "epoch": 1.2712825726363102, "grad_norm": 1.46875, "learning_rate": 0.0004847960132062175, "loss": 6.1265, "mean_token_accuracy": 0.1474221259355545, "num_tokens": 25703724.0, "step": 11880 }, { "entropy": 6.513773727416992, "epoch": 1.271817646744074, "grad_norm": 1.6015625, "learning_rate": 0.0004847821942049142, "loss": 6.4354, "mean_token_accuracy": 0.11740069463849068, "num_tokens": 25714911.0, "step": 11885 }, { "entropy": 6.638753223419189, "epoch": 1.272352720851838, "grad_norm": 1.8828125, "learning_rate": 0.00048476836914617945, "loss": 6.3143, "mean_token_accuracy": 0.13183923736214637, "num_tokens": 25725098.0, "step": 11890 }, { "entropy": 6.572930812835693, "epoch": 1.272887794959602, "grad_norm": 1.7890625, "learning_rate": 0.00048475453803041254, "loss": 6.2628, "mean_token_accuracy": 0.12592896148562432, "num_tokens": 25735099.0, "step": 11895 }, { "entropy": 6.4913472652435305, "epoch": 1.273422869067366, "grad_norm": 1.8125, "learning_rate": 0.0004847407008580128, "loss": 6.2883, "mean_token_accuracy": 0.13161098584532738, "num_tokens": 25746852.0, "step": 11900 }, { "entropy": 6.512494039535523, "epoch": 1.2739579431751298, "grad_norm": 1.609375, "learning_rate": 0.00048472685762937983, "loss": 6.3398, "mean_token_accuracy": 0.13382739797234536, "num_tokens": 25758579.0, "step": 11905 }, { "entropy": 6.512800168991089, "epoch": 1.2744930172828937, "grad_norm": 1.515625, "learning_rate": 0.00048471300834491325, "loss": 6.3187, "mean_token_accuracy": 0.13117347955703734, "num_tokens": 25769965.0, "step": 11910 }, { "entropy": 6.554977321624756, "epoch": 1.2750280913906575, "grad_norm": 1.5625, "learning_rate": 0.0004846991530050132, "loss": 6.3298, "mean_token_accuracy": 0.1322600245475769, "num_tokens": 25780264.0, "step": 11915 }, { "entropy": 6.54880313873291, "epoch": 1.2755631654984216, "grad_norm": 1.8125, "learning_rate": 0.0004846852916100794, "loss": 6.2496, "mean_token_accuracy": 0.13358540534973146, "num_tokens": 25791228.0, "step": 11920 }, { "entropy": 6.540342521667481, "epoch": 1.2760982396061855, "grad_norm": 1.765625, "learning_rate": 0.0004846714241605123, "loss": 6.2482, "mean_token_accuracy": 0.1332520917057991, "num_tokens": 25802428.0, "step": 11925 }, { "entropy": 6.563567304611206, "epoch": 1.2766333137139494, "grad_norm": 1.4140625, "learning_rate": 0.00048465755065671233, "loss": 6.3134, "mean_token_accuracy": 0.1317474439740181, "num_tokens": 25814220.0, "step": 11930 }, { "entropy": 6.554912805557251, "epoch": 1.2771683878217133, "grad_norm": 2.390625, "learning_rate": 0.00048464367109908005, "loss": 6.3203, "mean_token_accuracy": 0.12791907414793968, "num_tokens": 25824382.0, "step": 11935 }, { "entropy": 6.450937795639038, "epoch": 1.2777034619294771, "grad_norm": 1.421875, "learning_rate": 0.0004846297854880162, "loss": 6.2752, "mean_token_accuracy": 0.1334068424999714, "num_tokens": 25834896.0, "step": 11940 }, { "entropy": 6.576845788955689, "epoch": 1.2782385360372412, "grad_norm": 1.71875, "learning_rate": 0.00048461589382392176, "loss": 6.3812, "mean_token_accuracy": 0.12662025466561316, "num_tokens": 25847300.0, "step": 11945 }, { "entropy": 6.584928846359253, "epoch": 1.2787736101450051, "grad_norm": 1.3671875, "learning_rate": 0.0004846019961071978, "loss": 6.3156, "mean_token_accuracy": 0.13572727739810944, "num_tokens": 25858599.0, "step": 11950 }, { "entropy": 6.483222579956054, "epoch": 1.279308684252769, "grad_norm": 1.78125, "learning_rate": 0.0004845880923382457, "loss": 6.275, "mean_token_accuracy": 0.13509821593761445, "num_tokens": 25869135.0, "step": 11955 }, { "entropy": 6.516763973236084, "epoch": 1.2798437583605329, "grad_norm": 1.59375, "learning_rate": 0.00048457418251746695, "loss": 6.2639, "mean_token_accuracy": 0.13429969400167466, "num_tokens": 25879234.0, "step": 11960 }, { "entropy": 6.5868120193481445, "epoch": 1.2803788324682968, "grad_norm": 1.734375, "learning_rate": 0.0004845602666452629, "loss": 6.3051, "mean_token_accuracy": 0.13416241556406022, "num_tokens": 25888230.0, "step": 11965 }, { "entropy": 6.562831401824951, "epoch": 1.2809139065760609, "grad_norm": 1.84375, "learning_rate": 0.0004845463447220358, "loss": 6.3312, "mean_token_accuracy": 0.14075978919863702, "num_tokens": 25899429.0, "step": 11970 }, { "entropy": 6.486060523986817, "epoch": 1.2814489806838247, "grad_norm": 2.015625, "learning_rate": 0.0004845324167481874, "loss": 6.2135, "mean_token_accuracy": 0.14120842665433883, "num_tokens": 25911042.0, "step": 11975 }, { "entropy": 6.555566024780274, "epoch": 1.2819840547915886, "grad_norm": 1.59375, "learning_rate": 0.0004845184827241199, "loss": 6.2712, "mean_token_accuracy": 0.13459475412964822, "num_tokens": 25921466.0, "step": 11980 }, { "entropy": 6.56078405380249, "epoch": 1.2825191288993525, "grad_norm": 1.453125, "learning_rate": 0.0004845045426502357, "loss": 6.3848, "mean_token_accuracy": 0.1237009696662426, "num_tokens": 25931059.0, "step": 11985 }, { "entropy": 6.523500299453735, "epoch": 1.2830542030071164, "grad_norm": 1.671875, "learning_rate": 0.00048449059652693724, "loss": 6.2997, "mean_token_accuracy": 0.1334775298833847, "num_tokens": 25941669.0, "step": 11990 }, { "entropy": 6.488269805908203, "epoch": 1.2835892771148805, "grad_norm": 1.4296875, "learning_rate": 0.0004844766443546272, "loss": 6.3041, "mean_token_accuracy": 0.13760485649108886, "num_tokens": 25952066.0, "step": 11995 }, { "entropy": 6.551593017578125, "epoch": 1.2841243512226443, "grad_norm": 1.984375, "learning_rate": 0.0004844626861337085, "loss": 6.2276, "mean_token_accuracy": 0.1375007748603821, "num_tokens": 25962388.0, "step": 12000 }, { "epoch": 1.2841243512226443, "eval_entropy": 6.386375296148007, "eval_loss": 6.437783241271973, "eval_mean_token_accuracy": 0.13334858964907753, "eval_num_tokens": 25962388.0, "eval_runtime": 22.5367, "eval_samples_per_second": 1316.92, "eval_steps_per_second": 164.621, "step": 12000 }, { "entropy": 6.476883220672607, "epoch": 1.2846594253304082, "grad_norm": 1.4296875, "learning_rate": 0.0004844487218645843, "loss": 6.2774, "mean_token_accuracy": 0.13293329626321793, "num_tokens": 25973865.0, "step": 12005 }, { "entropy": 6.5142007827758786, "epoch": 1.2851944994381723, "grad_norm": 1.46875, "learning_rate": 0.0004844347515476575, "loss": 6.2843, "mean_token_accuracy": 0.13389490097761153, "num_tokens": 25985113.0, "step": 12010 }, { "entropy": 6.539774703979492, "epoch": 1.285729573545936, "grad_norm": 1.5078125, "learning_rate": 0.00048442077518333175, "loss": 6.1853, "mean_token_accuracy": 0.1449642926454544, "num_tokens": 25995980.0, "step": 12015 }, { "entropy": 6.491984510421753, "epoch": 1.2862646476537, "grad_norm": 1.53125, "learning_rate": 0.00048440679277201063, "loss": 6.2924, "mean_token_accuracy": 0.13728865012526512, "num_tokens": 26006362.0, "step": 12020 }, { "entropy": 6.5380847454071045, "epoch": 1.286799721761464, "grad_norm": 1.4609375, "learning_rate": 0.00048439280431409774, "loss": 6.3672, "mean_token_accuracy": 0.13121474161744118, "num_tokens": 26016623.0, "step": 12025 }, { "entropy": 6.455700159072876, "epoch": 1.2873347958692278, "grad_norm": 1.5390625, "learning_rate": 0.00048437880980999694, "loss": 6.1831, "mean_token_accuracy": 0.13906619623303412, "num_tokens": 26027202.0, "step": 12030 }, { "entropy": 6.473853254318238, "epoch": 1.287869869976992, "grad_norm": 1.4609375, "learning_rate": 0.0004843648092601125, "loss": 6.2931, "mean_token_accuracy": 0.12801167741417885, "num_tokens": 26037330.0, "step": 12035 }, { "entropy": 6.525657653808594, "epoch": 1.2884049440847558, "grad_norm": 1.3671875, "learning_rate": 0.0004843508026648487, "loss": 6.2985, "mean_token_accuracy": 0.13337891325354576, "num_tokens": 26047661.0, "step": 12040 }, { "entropy": 6.634007549285888, "epoch": 1.2889400181925197, "grad_norm": 1.671875, "learning_rate": 0.0004843367900246098, "loss": 6.3625, "mean_token_accuracy": 0.12507258877158164, "num_tokens": 26058582.0, "step": 12045 }, { "entropy": 6.537368679046631, "epoch": 1.2894750923002836, "grad_norm": 1.3203125, "learning_rate": 0.00048432277133980055, "loss": 6.3396, "mean_token_accuracy": 0.12189410924911499, "num_tokens": 26069117.0, "step": 12050 }, { "entropy": 6.537881183624267, "epoch": 1.2900101664080474, "grad_norm": 1.5703125, "learning_rate": 0.00048430874661082565, "loss": 6.3088, "mean_token_accuracy": 0.12988518327474594, "num_tokens": 26079327.0, "step": 12055 }, { "entropy": 6.580955171585083, "epoch": 1.2905452405158115, "grad_norm": 1.8359375, "learning_rate": 0.00048429471583809016, "loss": 6.3018, "mean_token_accuracy": 0.13474506214261056, "num_tokens": 26090709.0, "step": 12060 }, { "entropy": 6.6343930721282955, "epoch": 1.2910803146235754, "grad_norm": 1.7421875, "learning_rate": 0.0004842806790219991, "loss": 6.3157, "mean_token_accuracy": 0.12702692076563835, "num_tokens": 26101570.0, "step": 12065 }, { "entropy": 6.503259086608887, "epoch": 1.2916153887313393, "grad_norm": 2.375, "learning_rate": 0.00048426663616295783, "loss": 6.2787, "mean_token_accuracy": 0.13804319500923157, "num_tokens": 26112827.0, "step": 12070 }, { "entropy": 6.492285490036011, "epoch": 1.2921504628391032, "grad_norm": 1.4140625, "learning_rate": 0.00048425258726137187, "loss": 6.352, "mean_token_accuracy": 0.1263483129441738, "num_tokens": 26124141.0, "step": 12075 }, { "entropy": 6.516628980636597, "epoch": 1.292685536946867, "grad_norm": 1.875, "learning_rate": 0.00048423853231764684, "loss": 6.2953, "mean_token_accuracy": 0.13210719525814058, "num_tokens": 26135372.0, "step": 12080 }, { "entropy": 6.52798318862915, "epoch": 1.2932206110546312, "grad_norm": 1.6875, "learning_rate": 0.00048422447133218867, "loss": 6.2557, "mean_token_accuracy": 0.13133319541811944, "num_tokens": 26145933.0, "step": 12085 }, { "entropy": 6.561259794235229, "epoch": 1.293755685162395, "grad_norm": 2.0, "learning_rate": 0.00048421040430540323, "loss": 6.3508, "mean_token_accuracy": 0.12620900720357894, "num_tokens": 26155948.0, "step": 12090 }, { "entropy": 6.478076982498169, "epoch": 1.294290759270159, "grad_norm": 1.6015625, "learning_rate": 0.0004841963312376967, "loss": 6.2383, "mean_token_accuracy": 0.1421545147895813, "num_tokens": 26166410.0, "step": 12095 }, { "entropy": 6.462507247924805, "epoch": 1.2948258333779228, "grad_norm": 1.6484375, "learning_rate": 0.00048418225212947566, "loss": 6.2768, "mean_token_accuracy": 0.13346440643072127, "num_tokens": 26177334.0, "step": 12100 }, { "entropy": 6.6124979019165036, "epoch": 1.2953609074856867, "grad_norm": 1.4140625, "learning_rate": 0.0004841681669811464, "loss": 6.3405, "mean_token_accuracy": 0.12650283202528953, "num_tokens": 26187987.0, "step": 12105 }, { "entropy": 6.576649856567383, "epoch": 1.2958959815934508, "grad_norm": 1.453125, "learning_rate": 0.0004841540757931157, "loss": 6.2985, "mean_token_accuracy": 0.12536120936274528, "num_tokens": 26198600.0, "step": 12110 }, { "entropy": 6.487023544311524, "epoch": 1.2964310557012146, "grad_norm": 1.96875, "learning_rate": 0.0004841399785657904, "loss": 6.3233, "mean_token_accuracy": 0.12932894751429558, "num_tokens": 26210977.0, "step": 12115 }, { "entropy": 6.540788698196411, "epoch": 1.2969661298089785, "grad_norm": 1.359375, "learning_rate": 0.00048412587529957774, "loss": 6.2888, "mean_token_accuracy": 0.1334947131574154, "num_tokens": 26220813.0, "step": 12120 }, { "entropy": 6.564545059204102, "epoch": 1.2975012039167424, "grad_norm": 1.6875, "learning_rate": 0.0004841117659948848, "loss": 6.3286, "mean_token_accuracy": 0.13227230161428452, "num_tokens": 26232042.0, "step": 12125 }, { "entropy": 6.589853429794312, "epoch": 1.2980362780245063, "grad_norm": 1.4921875, "learning_rate": 0.00048409765065211884, "loss": 6.3254, "mean_token_accuracy": 0.13484857305884362, "num_tokens": 26242968.0, "step": 12130 }, { "entropy": 6.575265645980835, "epoch": 1.2985713521322704, "grad_norm": 1.5546875, "learning_rate": 0.00048408352927168774, "loss": 6.3165, "mean_token_accuracy": 0.13241580054163932, "num_tokens": 26252751.0, "step": 12135 }, { "entropy": 6.520197963714599, "epoch": 1.2991064262400343, "grad_norm": 1.5703125, "learning_rate": 0.0004840694018539991, "loss": 6.3804, "mean_token_accuracy": 0.12634991630911827, "num_tokens": 26263270.0, "step": 12140 }, { "entropy": 6.5590331077575685, "epoch": 1.2996415003477981, "grad_norm": 1.703125, "learning_rate": 0.00048405526839946086, "loss": 6.397, "mean_token_accuracy": 0.1273276686668396, "num_tokens": 26274279.0, "step": 12145 }, { "entropy": 6.57621922492981, "epoch": 1.3001765744555622, "grad_norm": 1.9765625, "learning_rate": 0.00048404112890848105, "loss": 6.3838, "mean_token_accuracy": 0.13533301502466202, "num_tokens": 26286020.0, "step": 12150 }, { "entropy": 6.560911464691162, "epoch": 1.3007116485633259, "grad_norm": 1.765625, "learning_rate": 0.00048402698338146803, "loss": 6.3097, "mean_token_accuracy": 0.13460245206952096, "num_tokens": 26296798.0, "step": 12155 }, { "entropy": 6.485049200057984, "epoch": 1.30124672267109, "grad_norm": 1.53125, "learning_rate": 0.0004840128318188303, "loss": 6.2734, "mean_token_accuracy": 0.1385771855711937, "num_tokens": 26306952.0, "step": 12160 }, { "entropy": 6.646480941772461, "epoch": 1.3017817967788539, "grad_norm": 1.90625, "learning_rate": 0.00048399867422097644, "loss": 6.3605, "mean_token_accuracy": 0.13204823806881905, "num_tokens": 26317686.0, "step": 12165 }, { "entropy": 6.595529508590698, "epoch": 1.3023168708866177, "grad_norm": 1.8671875, "learning_rate": 0.00048398451058831514, "loss": 6.3449, "mean_token_accuracy": 0.13236458525061606, "num_tokens": 26327997.0, "step": 12170 }, { "entropy": 6.483434581756592, "epoch": 1.3028519449943818, "grad_norm": 1.6015625, "learning_rate": 0.00048397034092125554, "loss": 6.3319, "mean_token_accuracy": 0.13000286892056465, "num_tokens": 26340227.0, "step": 12175 }, { "entropy": 6.63649435043335, "epoch": 1.3033870191021457, "grad_norm": 1.90625, "learning_rate": 0.00048395616522020667, "loss": 6.4409, "mean_token_accuracy": 0.1249793030321598, "num_tokens": 26350549.0, "step": 12180 }, { "entropy": 6.5887518405914305, "epoch": 1.3039220932099096, "grad_norm": 1.6796875, "learning_rate": 0.0004839419834855779, "loss": 6.3454, "mean_token_accuracy": 0.13172085583209991, "num_tokens": 26361822.0, "step": 12185 }, { "entropy": 6.4851236820220945, "epoch": 1.3044571673176735, "grad_norm": 1.96875, "learning_rate": 0.0004839277957177787, "loss": 6.3407, "mean_token_accuracy": 0.13301774114370346, "num_tokens": 26372720.0, "step": 12190 }, { "entropy": 6.454987621307373, "epoch": 1.3049922414254373, "grad_norm": 1.484375, "learning_rate": 0.0004839136019172188, "loss": 6.3111, "mean_token_accuracy": 0.1354654051363468, "num_tokens": 26383092.0, "step": 12195 }, { "entropy": 6.499829721450806, "epoch": 1.3055273155332014, "grad_norm": 1.734375, "learning_rate": 0.000483899402084308, "loss": 6.2549, "mean_token_accuracy": 0.14037376120686532, "num_tokens": 26395188.0, "step": 12200 }, { "entropy": 6.556978702545166, "epoch": 1.3060623896409653, "grad_norm": 1.5703125, "learning_rate": 0.0004838851962194563, "loss": 6.3664, "mean_token_accuracy": 0.13069112375378608, "num_tokens": 26406338.0, "step": 12205 }, { "entropy": 6.521770095825195, "epoch": 1.3065974637487292, "grad_norm": 2.703125, "learning_rate": 0.0004838709843230739, "loss": 6.3097, "mean_token_accuracy": 0.1294810354709625, "num_tokens": 26416983.0, "step": 12210 }, { "entropy": 6.528356266021729, "epoch": 1.307132537856493, "grad_norm": 1.375, "learning_rate": 0.0004838567663955712, "loss": 6.2598, "mean_token_accuracy": 0.13848564326763152, "num_tokens": 26426966.0, "step": 12215 }, { "entropy": 6.528638315200806, "epoch": 1.307667611964257, "grad_norm": 1.6953125, "learning_rate": 0.0004838425424373587, "loss": 6.2521, "mean_token_accuracy": 0.1309279464185238, "num_tokens": 26437711.0, "step": 12220 }, { "entropy": 6.545057106018066, "epoch": 1.308202686072021, "grad_norm": 1.625, "learning_rate": 0.0004838283124488472, "loss": 6.384, "mean_token_accuracy": 0.13038895800709724, "num_tokens": 26448657.0, "step": 12225 }, { "entropy": 6.607879734039306, "epoch": 1.308737760179785, "grad_norm": 3.71875, "learning_rate": 0.00048381407643044737, "loss": 6.2599, "mean_token_accuracy": 0.13647112473845482, "num_tokens": 26459363.0, "step": 12230 }, { "entropy": 6.498840999603272, "epoch": 1.3092728342875488, "grad_norm": 1.53125, "learning_rate": 0.0004837998343825705, "loss": 6.2933, "mean_token_accuracy": 0.1369725577533245, "num_tokens": 26470149.0, "step": 12235 }, { "entropy": 6.4808508396148685, "epoch": 1.3098079083953127, "grad_norm": 1.40625, "learning_rate": 0.00048378558630562783, "loss": 6.2569, "mean_token_accuracy": 0.13962852880358695, "num_tokens": 26480424.0, "step": 12240 }, { "entropy": 6.498993587493897, "epoch": 1.3103429825030766, "grad_norm": 6.0625, "learning_rate": 0.0004837713322000306, "loss": 6.2919, "mean_token_accuracy": 0.12992604449391365, "num_tokens": 26490312.0, "step": 12245 }, { "entropy": 6.48661847114563, "epoch": 1.3108780566108407, "grad_norm": 1.515625, "learning_rate": 0.0004837570720661905, "loss": 6.2831, "mean_token_accuracy": 0.14373423680663108, "num_tokens": 26501119.0, "step": 12250 }, { "entropy": 6.580825424194336, "epoch": 1.3114131307186045, "grad_norm": 1.78125, "learning_rate": 0.00048374280590451934, "loss": 6.3406, "mean_token_accuracy": 0.13384997844696045, "num_tokens": 26512438.0, "step": 12255 }, { "entropy": 6.5407239437103275, "epoch": 1.3119482048263684, "grad_norm": 1.5625, "learning_rate": 0.00048372853371542895, "loss": 6.2969, "mean_token_accuracy": 0.12450519725680351, "num_tokens": 26523930.0, "step": 12260 }, { "entropy": 6.56227297782898, "epoch": 1.3124832789341323, "grad_norm": 2.359375, "learning_rate": 0.0004837142554993315, "loss": 6.3908, "mean_token_accuracy": 0.13300466015934945, "num_tokens": 26534937.0, "step": 12265 }, { "entropy": 6.476114416122437, "epoch": 1.3130183530418962, "grad_norm": 1.703125, "learning_rate": 0.0004836999712566392, "loss": 6.1802, "mean_token_accuracy": 0.13274189084768295, "num_tokens": 26544555.0, "step": 12270 }, { "entropy": 6.5541692733764645, "epoch": 1.3135534271496603, "grad_norm": 1.5546875, "learning_rate": 0.00048368568098776463, "loss": 6.3383, "mean_token_accuracy": 0.1406101442873478, "num_tokens": 26556144.0, "step": 12275 }, { "entropy": 6.571285533905029, "epoch": 1.3140885012574242, "grad_norm": 1.75, "learning_rate": 0.0004836713846931203, "loss": 6.381, "mean_token_accuracy": 0.1273029126226902, "num_tokens": 26567350.0, "step": 12280 }, { "entropy": 6.56294436454773, "epoch": 1.314623575365188, "grad_norm": 2.53125, "learning_rate": 0.00048365708237311904, "loss": 6.2877, "mean_token_accuracy": 0.13095688074827194, "num_tokens": 26579486.0, "step": 12285 }, { "entropy": 6.5144415378570555, "epoch": 1.3151586494729521, "grad_norm": 1.625, "learning_rate": 0.0004836427740281739, "loss": 6.304, "mean_token_accuracy": 0.13191987350583076, "num_tokens": 26589665.0, "step": 12290 }, { "entropy": 6.529788827896118, "epoch": 1.3156937235807158, "grad_norm": 1.140625, "learning_rate": 0.00048362845965869793, "loss": 6.2901, "mean_token_accuracy": 0.13123327121138573, "num_tokens": 26600187.0, "step": 12295 }, { "entropy": 6.502836656570435, "epoch": 1.31622879768848, "grad_norm": 1.9140625, "learning_rate": 0.0004836141392651046, "loss": 6.2571, "mean_token_accuracy": 0.1337031193077564, "num_tokens": 26612155.0, "step": 12300 }, { "entropy": 6.548255729675293, "epoch": 1.3167638717962438, "grad_norm": 1.9609375, "learning_rate": 0.00048359981284780727, "loss": 6.2977, "mean_token_accuracy": 0.12883710488677025, "num_tokens": 26623077.0, "step": 12305 }, { "entropy": 6.491298675537109, "epoch": 1.3172989459040076, "grad_norm": 1.640625, "learning_rate": 0.0004835854804072196, "loss": 6.2275, "mean_token_accuracy": 0.13802778869867324, "num_tokens": 26632979.0, "step": 12310 }, { "entropy": 6.495585870742798, "epoch": 1.3178340200117717, "grad_norm": 1.6796875, "learning_rate": 0.00048357114194375555, "loss": 6.3398, "mean_token_accuracy": 0.1271979182958603, "num_tokens": 26644377.0, "step": 12315 }, { "entropy": 6.573164081573486, "epoch": 1.3183690941195356, "grad_norm": 1.5390625, "learning_rate": 0.000483556797457829, "loss": 6.3333, "mean_token_accuracy": 0.12611328884959222, "num_tokens": 26655538.0, "step": 12320 }, { "entropy": 6.536789274215698, "epoch": 1.3189041682272995, "grad_norm": 2.59375, "learning_rate": 0.00048354244694985435, "loss": 6.3011, "mean_token_accuracy": 0.12973858788609505, "num_tokens": 26668011.0, "step": 12325 }, { "entropy": 6.486205053329468, "epoch": 1.3194392423350634, "grad_norm": 1.5234375, "learning_rate": 0.0004835280904202457, "loss": 6.3147, "mean_token_accuracy": 0.13040204644203185, "num_tokens": 26678996.0, "step": 12330 }, { "entropy": 6.5596967220306395, "epoch": 1.3199743164428273, "grad_norm": 1.8046875, "learning_rate": 0.0004835137278694178, "loss": 6.266, "mean_token_accuracy": 0.13785816729068756, "num_tokens": 26689041.0, "step": 12335 }, { "entropy": 6.5753649234771725, "epoch": 1.3205093905505914, "grad_norm": 3.46875, "learning_rate": 0.0004834993592977854, "loss": 6.2708, "mean_token_accuracy": 0.13826132118701934, "num_tokens": 26699459.0, "step": 12340 }, { "entropy": 6.549886798858642, "epoch": 1.3210444646583552, "grad_norm": 1.78125, "learning_rate": 0.0004834849847057632, "loss": 6.3928, "mean_token_accuracy": 0.12919416651129723, "num_tokens": 26711663.0, "step": 12345 }, { "entropy": 6.558913803100586, "epoch": 1.321579538766119, "grad_norm": 1.390625, "learning_rate": 0.00048347060409376644, "loss": 6.3523, "mean_token_accuracy": 0.123536217212677, "num_tokens": 26722960.0, "step": 12350 }, { "entropy": 6.54972996711731, "epoch": 1.322114612873883, "grad_norm": 1.5625, "learning_rate": 0.00048345621746221024, "loss": 6.2683, "mean_token_accuracy": 0.13708956986665727, "num_tokens": 26733274.0, "step": 12355 }, { "entropy": 6.5588398456573485, "epoch": 1.3226496869816469, "grad_norm": 1.5390625, "learning_rate": 0.00048344182481151003, "loss": 6.3194, "mean_token_accuracy": 0.12774837762117386, "num_tokens": 26743906.0, "step": 12360 }, { "entropy": 6.462081623077393, "epoch": 1.323184761089411, "grad_norm": 1.4140625, "learning_rate": 0.00048342742614208145, "loss": 6.3161, "mean_token_accuracy": 0.12888485714793205, "num_tokens": 26755093.0, "step": 12365 }, { "entropy": 6.510008096694946, "epoch": 1.3237198351971748, "grad_norm": 3.9375, "learning_rate": 0.0004834130214543402, "loss": 6.2934, "mean_token_accuracy": 0.133803091943264, "num_tokens": 26765614.0, "step": 12370 }, { "entropy": 6.513565587997436, "epoch": 1.3242549093049387, "grad_norm": 1.5625, "learning_rate": 0.00048339861074870227, "loss": 6.3033, "mean_token_accuracy": 0.1330991990864277, "num_tokens": 26778078.0, "step": 12375 }, { "entropy": 6.604484891891479, "epoch": 1.3247899834127026, "grad_norm": 1.8828125, "learning_rate": 0.00048338419402558375, "loss": 6.3154, "mean_token_accuracy": 0.13245146498084068, "num_tokens": 26788707.0, "step": 12380 }, { "entropy": 6.58511905670166, "epoch": 1.3253250575204665, "grad_norm": 1.6328125, "learning_rate": 0.0004833697712854009, "loss": 6.2722, "mean_token_accuracy": 0.13194304704666138, "num_tokens": 26798650.0, "step": 12385 }, { "entropy": 6.517331314086914, "epoch": 1.3258601316282306, "grad_norm": 1.9140625, "learning_rate": 0.00048335534252857016, "loss": 6.3233, "mean_token_accuracy": 0.13552766814827918, "num_tokens": 26809822.0, "step": 12390 }, { "entropy": 6.5462925910949705, "epoch": 1.3263952057359945, "grad_norm": 1.3359375, "learning_rate": 0.0004833409077555082, "loss": 6.3009, "mean_token_accuracy": 0.12845633625984193, "num_tokens": 26821061.0, "step": 12395 }, { "entropy": 6.6133284091949465, "epoch": 1.3269302798437583, "grad_norm": 1.4453125, "learning_rate": 0.00048332646696663177, "loss": 6.3462, "mean_token_accuracy": 0.12829353287816048, "num_tokens": 26832020.0, "step": 12400 }, { "entropy": 6.596477937698364, "epoch": 1.3274653539515222, "grad_norm": 1.6484375, "learning_rate": 0.0004833120201623579, "loss": 6.3353, "mean_token_accuracy": 0.128353201597929, "num_tokens": 26844287.0, "step": 12405 }, { "entropy": 6.412652969360352, "epoch": 1.328000428059286, "grad_norm": 1.8359375, "learning_rate": 0.00048329756734310375, "loss": 6.1728, "mean_token_accuracy": 0.14178198873996734, "num_tokens": 26855790.0, "step": 12410 }, { "entropy": 6.452540540695191, "epoch": 1.3285355021670502, "grad_norm": 1.5859375, "learning_rate": 0.00048328310850928656, "loss": 6.3216, "mean_token_accuracy": 0.134925177693367, "num_tokens": 26867391.0, "step": 12415 }, { "entropy": 6.551491546630859, "epoch": 1.329070576274814, "grad_norm": 1.3515625, "learning_rate": 0.00048326864366132397, "loss": 6.3253, "mean_token_accuracy": 0.13360649049282075, "num_tokens": 26879173.0, "step": 12420 }, { "entropy": 6.559604692459106, "epoch": 1.329605650382578, "grad_norm": 1.859375, "learning_rate": 0.0004832541727996335, "loss": 6.2344, "mean_token_accuracy": 0.13868265673518182, "num_tokens": 26889839.0, "step": 12425 }, { "entropy": 6.486599254608154, "epoch": 1.330140724490342, "grad_norm": 1.3046875, "learning_rate": 0.000483239695924633, "loss": 6.2991, "mean_token_accuracy": 0.13732991963624955, "num_tokens": 26900217.0, "step": 12430 }, { "entropy": 6.532090044021606, "epoch": 1.330675798598106, "grad_norm": 1.71875, "learning_rate": 0.00048322521303674064, "loss": 6.2994, "mean_token_accuracy": 0.13312758281826972, "num_tokens": 26911366.0, "step": 12435 }, { "entropy": 6.597012996673584, "epoch": 1.3312108727058698, "grad_norm": 1.375, "learning_rate": 0.00048321072413637454, "loss": 6.3401, "mean_token_accuracy": 0.12487093731760979, "num_tokens": 26922135.0, "step": 12440 }, { "entropy": 6.551101970672607, "epoch": 1.3317459468136337, "grad_norm": 1.4453125, "learning_rate": 0.0004831962292239529, "loss": 6.2774, "mean_token_accuracy": 0.13313136473298073, "num_tokens": 26932502.0, "step": 12445 }, { "entropy": 6.499680852890014, "epoch": 1.3322810209213976, "grad_norm": 1.75, "learning_rate": 0.00048318172829989447, "loss": 6.3364, "mean_token_accuracy": 0.13847661167383193, "num_tokens": 26944607.0, "step": 12450 }, { "entropy": 6.529852628707886, "epoch": 1.3328160950291617, "grad_norm": 1.4375, "learning_rate": 0.0004831672213646179, "loss": 6.3356, "mean_token_accuracy": 0.1344766914844513, "num_tokens": 26955205.0, "step": 12455 }, { "entropy": 6.512268972396851, "epoch": 1.3333511691369255, "grad_norm": 1.703125, "learning_rate": 0.0004831527084185421, "loss": 6.2131, "mean_token_accuracy": 0.1448250100016594, "num_tokens": 26965558.0, "step": 12460 }, { "entropy": 6.497064542770386, "epoch": 1.3338862432446894, "grad_norm": 2.84375, "learning_rate": 0.000483138189462086, "loss": 6.288, "mean_token_accuracy": 0.13134488835930824, "num_tokens": 26976176.0, "step": 12465 }, { "entropy": 6.550390195846558, "epoch": 1.3344213173524533, "grad_norm": 1.6328125, "learning_rate": 0.00048312366449566895, "loss": 6.35, "mean_token_accuracy": 0.13253561332821845, "num_tokens": 26987099.0, "step": 12470 }, { "entropy": 6.521877908706665, "epoch": 1.3349563914602172, "grad_norm": 1.5546875, "learning_rate": 0.0004831091335197104, "loss": 6.2946, "mean_token_accuracy": 0.13181954994797707, "num_tokens": 26998122.0, "step": 12475 }, { "entropy": 6.4629723072052006, "epoch": 1.3354914655679813, "grad_norm": 1.4609375, "learning_rate": 0.0004830945965346298, "loss": 6.248, "mean_token_accuracy": 0.1338569551706314, "num_tokens": 27009427.0, "step": 12480 }, { "entropy": 6.5822224617004395, "epoch": 1.3360265396757451, "grad_norm": 1.609375, "learning_rate": 0.000483080053540847, "loss": 6.4041, "mean_token_accuracy": 0.12383663654327393, "num_tokens": 27020701.0, "step": 12485 }, { "entropy": 6.582948064804077, "epoch": 1.336561613783509, "grad_norm": 1.5, "learning_rate": 0.0004830655045387818, "loss": 6.3641, "mean_token_accuracy": 0.1241733305156231, "num_tokens": 27033215.0, "step": 12490 }, { "entropy": 6.554017066955566, "epoch": 1.337096687891273, "grad_norm": 1.640625, "learning_rate": 0.00048305094952885453, "loss": 6.3226, "mean_token_accuracy": 0.12772757932543755, "num_tokens": 27043846.0, "step": 12495 }, { "entropy": 6.511205577850342, "epoch": 1.3376317619990368, "grad_norm": 1.59375, "learning_rate": 0.0004830363885114853, "loss": 6.305, "mean_token_accuracy": 0.13151946440339088, "num_tokens": 27054783.0, "step": 12500 }, { "entropy": 6.494199800491333, "epoch": 1.3381668361068009, "grad_norm": 1.578125, "learning_rate": 0.0004830218214870946, "loss": 6.3327, "mean_token_accuracy": 0.1325196735560894, "num_tokens": 27066051.0, "step": 12505 }, { "entropy": 6.558785486221313, "epoch": 1.3387019102145647, "grad_norm": 1.5546875, "learning_rate": 0.0004830072484561029, "loss": 6.3293, "mean_token_accuracy": 0.13402727320790292, "num_tokens": 27078210.0, "step": 12510 }, { "entropy": 6.569102621078491, "epoch": 1.3392369843223286, "grad_norm": 2.03125, "learning_rate": 0.0004829926694189312, "loss": 6.3505, "mean_token_accuracy": 0.12516780570149422, "num_tokens": 27089693.0, "step": 12515 }, { "entropy": 6.528443145751953, "epoch": 1.3397720584300925, "grad_norm": 1.3359375, "learning_rate": 0.0004829780843760005, "loss": 6.3341, "mean_token_accuracy": 0.1275798462331295, "num_tokens": 27099856.0, "step": 12520 }, { "entropy": 6.54946722984314, "epoch": 1.3403071325378564, "grad_norm": 1.984375, "learning_rate": 0.0004829634933277317, "loss": 6.3404, "mean_token_accuracy": 0.1284944772720337, "num_tokens": 27110218.0, "step": 12525 }, { "entropy": 6.52546067237854, "epoch": 1.3408422066456205, "grad_norm": 1.6796875, "learning_rate": 0.00048294889627454636, "loss": 6.2923, "mean_token_accuracy": 0.13666339591145515, "num_tokens": 27120911.0, "step": 12530 }, { "entropy": 6.4948999881744385, "epoch": 1.3413772807533844, "grad_norm": 1.5859375, "learning_rate": 0.00048293429321686585, "loss": 6.2744, "mean_token_accuracy": 0.13520927503705024, "num_tokens": 27130964.0, "step": 12535 }, { "entropy": 6.506992530822754, "epoch": 1.3419123548611482, "grad_norm": 1.859375, "learning_rate": 0.00048291968415511174, "loss": 6.3012, "mean_token_accuracy": 0.1324952982366085, "num_tokens": 27141641.0, "step": 12540 }, { "entropy": 6.544699478149414, "epoch": 1.3424474289689121, "grad_norm": 1.6640625, "learning_rate": 0.00048290506908970607, "loss": 6.3666, "mean_token_accuracy": 0.12738464027643204, "num_tokens": 27152591.0, "step": 12545 }, { "entropy": 6.571207761764526, "epoch": 1.342982503076676, "grad_norm": 1.609375, "learning_rate": 0.0004828904480210707, "loss": 6.4297, "mean_token_accuracy": 0.12691449224948884, "num_tokens": 27163839.0, "step": 12550 }, { "entropy": 6.624313831329346, "epoch": 1.34351757718444, "grad_norm": 1.3046875, "learning_rate": 0.0004828758209496278, "loss": 6.2954, "mean_token_accuracy": 0.13590908646583558, "num_tokens": 27174480.0, "step": 12555 }, { "entropy": 6.500087404251099, "epoch": 1.344052651292204, "grad_norm": 1.890625, "learning_rate": 0.00048286118787579983, "loss": 6.2617, "mean_token_accuracy": 0.13080087080597877, "num_tokens": 27184546.0, "step": 12560 }, { "entropy": 6.451597452163696, "epoch": 1.3445877253999678, "grad_norm": 1.4296875, "learning_rate": 0.00048284654880000933, "loss": 6.1771, "mean_token_accuracy": 0.13953398764133454, "num_tokens": 27195093.0, "step": 12565 }, { "entropy": 6.476680326461792, "epoch": 1.345122799507732, "grad_norm": 1.515625, "learning_rate": 0.00048283190372267886, "loss": 6.3436, "mean_token_accuracy": 0.1333930142223835, "num_tokens": 27206416.0, "step": 12570 }, { "entropy": 6.5952800750732425, "epoch": 1.3456578736154958, "grad_norm": 1.6328125, "learning_rate": 0.0004828172526442314, "loss": 6.2663, "mean_token_accuracy": 0.12958376929163934, "num_tokens": 27215533.0, "step": 12575 }, { "entropy": 6.5549458980560305, "epoch": 1.3461929477232597, "grad_norm": 1.7265625, "learning_rate": 0.00048280259556509, "loss": 6.313, "mean_token_accuracy": 0.13110331296920777, "num_tokens": 27225985.0, "step": 12580 }, { "entropy": 6.515612268447876, "epoch": 1.3467280218310236, "grad_norm": 1.5703125, "learning_rate": 0.0004827879324856778, "loss": 6.2924, "mean_token_accuracy": 0.13066375404596328, "num_tokens": 27235967.0, "step": 12585 }, { "entropy": 6.529239511489868, "epoch": 1.3472630959387875, "grad_norm": 1.453125, "learning_rate": 0.00048277326340641835, "loss": 6.2427, "mean_token_accuracy": 0.1346130132675171, "num_tokens": 27246854.0, "step": 12590 }, { "entropy": 6.448957109451294, "epoch": 1.3477981700465516, "grad_norm": 1.3359375, "learning_rate": 0.000482758588327735, "loss": 6.3627, "mean_token_accuracy": 0.13244736939668655, "num_tokens": 27256640.0, "step": 12595 }, { "entropy": 6.524251413345337, "epoch": 1.3483332441543154, "grad_norm": 1.6953125, "learning_rate": 0.0004827439072500516, "loss": 6.3206, "mean_token_accuracy": 0.12838973328471184, "num_tokens": 27266907.0, "step": 12600 }, { "entropy": 6.599645519256592, "epoch": 1.3488683182620793, "grad_norm": 1.765625, "learning_rate": 0.00048272922017379217, "loss": 6.2754, "mean_token_accuracy": 0.13354076966643333, "num_tokens": 27277089.0, "step": 12605 }, { "entropy": 6.567108678817749, "epoch": 1.3494033923698432, "grad_norm": 2.171875, "learning_rate": 0.0004827145270993807, "loss": 6.2757, "mean_token_accuracy": 0.13490659818053247, "num_tokens": 27286781.0, "step": 12610 }, { "entropy": 6.525397729873657, "epoch": 1.349938466477607, "grad_norm": 1.40625, "learning_rate": 0.0004826998280272414, "loss": 6.302, "mean_token_accuracy": 0.13888752982020378, "num_tokens": 27298011.0, "step": 12615 }, { "entropy": 6.501267433166504, "epoch": 1.3504735405853712, "grad_norm": 1.90625, "learning_rate": 0.00048268512295779873, "loss": 6.3354, "mean_token_accuracy": 0.1331058345735073, "num_tokens": 27309052.0, "step": 12620 }, { "entropy": 6.4906703472137455, "epoch": 1.351008614693135, "grad_norm": 1.53125, "learning_rate": 0.0004826704118914773, "loss": 6.2625, "mean_token_accuracy": 0.1372261181473732, "num_tokens": 27319945.0, "step": 12625 }, { "entropy": 6.496233177185059, "epoch": 1.351543688800899, "grad_norm": 1.6953125, "learning_rate": 0.000482655694828702, "loss": 6.2829, "mean_token_accuracy": 0.14131269082427025, "num_tokens": 27330543.0, "step": 12630 }, { "entropy": 6.551932334899902, "epoch": 1.3520787629086628, "grad_norm": 1.921875, "learning_rate": 0.0004826409717698976, "loss": 6.3359, "mean_token_accuracy": 0.1282445326447487, "num_tokens": 27341957.0, "step": 12635 }, { "entropy": 6.498799562454224, "epoch": 1.3526138370164267, "grad_norm": 1.7109375, "learning_rate": 0.00048262624271548936, "loss": 6.2612, "mean_token_accuracy": 0.1311979576945305, "num_tokens": 27351506.0, "step": 12640 }, { "entropy": 6.543243360519409, "epoch": 1.3531489111241908, "grad_norm": 1.65625, "learning_rate": 0.00048261150766590257, "loss": 6.2408, "mean_token_accuracy": 0.1310368560254574, "num_tokens": 27362208.0, "step": 12645 }, { "entropy": 6.580874872207642, "epoch": 1.3536839852319547, "grad_norm": 1.515625, "learning_rate": 0.00048259676662156263, "loss": 6.279, "mean_token_accuracy": 0.13347921073436736, "num_tokens": 27372890.0, "step": 12650 }, { "entropy": 6.492420673370361, "epoch": 1.3542190593397185, "grad_norm": 1.609375, "learning_rate": 0.0004825820195828952, "loss": 6.2253, "mean_token_accuracy": 0.14195676296949386, "num_tokens": 27382879.0, "step": 12655 }, { "entropy": 6.432550573348999, "epoch": 1.3547541334474824, "grad_norm": 1.5546875, "learning_rate": 0.0004825672665503262, "loss": 6.2608, "mean_token_accuracy": 0.13371035531163217, "num_tokens": 27393878.0, "step": 12660 }, { "entropy": 6.532358169555664, "epoch": 1.3552892075552463, "grad_norm": 1.859375, "learning_rate": 0.0004825525075242815, "loss": 6.3512, "mean_token_accuracy": 0.12923340126872063, "num_tokens": 27404928.0, "step": 12665 }, { "entropy": 6.567361783981323, "epoch": 1.3558242816630104, "grad_norm": 1.65625, "learning_rate": 0.0004825377425051873, "loss": 6.2717, "mean_token_accuracy": 0.13399578258395195, "num_tokens": 27417473.0, "step": 12670 }, { "entropy": 6.553698968887329, "epoch": 1.3563593557707743, "grad_norm": 1.9140625, "learning_rate": 0.00048252297149346997, "loss": 6.358, "mean_token_accuracy": 0.12742808535695077, "num_tokens": 27428378.0, "step": 12675 }, { "entropy": 6.461050653457642, "epoch": 1.3568944298785381, "grad_norm": 2.9375, "learning_rate": 0.00048250819448955595, "loss": 6.2968, "mean_token_accuracy": 0.13851417005062103, "num_tokens": 27438815.0, "step": 12680 }, { "entropy": 6.620155000686646, "epoch": 1.357429503986302, "grad_norm": 2.015625, "learning_rate": 0.000482493411493872, "loss": 6.335, "mean_token_accuracy": 0.13085796013474466, "num_tokens": 27449295.0, "step": 12685 }, { "entropy": 6.530794715881347, "epoch": 1.357964578094066, "grad_norm": 2.359375, "learning_rate": 0.000482478622506845, "loss": 6.2229, "mean_token_accuracy": 0.13837912008166314, "num_tokens": 27459357.0, "step": 12690 }, { "entropy": 6.514059400558471, "epoch": 1.35849965220183, "grad_norm": 1.3671875, "learning_rate": 0.0004824638275289019, "loss": 6.2617, "mean_token_accuracy": 0.13738563656806946, "num_tokens": 27469405.0, "step": 12695 }, { "entropy": 6.534468078613282, "epoch": 1.3590347263095939, "grad_norm": 2.03125, "learning_rate": 0.0004824490265604699, "loss": 6.2681, "mean_token_accuracy": 0.1373660996556282, "num_tokens": 27478818.0, "step": 12700 }, { "entropy": 6.556286001205445, "epoch": 1.3595698004173578, "grad_norm": 1.71875, "learning_rate": 0.0004824342196019764, "loss": 6.227, "mean_token_accuracy": 0.13968622982501983, "num_tokens": 27488631.0, "step": 12705 }, { "entropy": 6.528377485275269, "epoch": 1.3601048745251219, "grad_norm": 1.9921875, "learning_rate": 0.00048241940665384904, "loss": 6.3075, "mean_token_accuracy": 0.13143832832574845, "num_tokens": 27500895.0, "step": 12710 }, { "entropy": 6.492169332504273, "epoch": 1.3606399486328857, "grad_norm": 1.5703125, "learning_rate": 0.0004824045877165154, "loss": 6.3509, "mean_token_accuracy": 0.12758940383791922, "num_tokens": 27512578.0, "step": 12715 }, { "entropy": 6.511027574539185, "epoch": 1.3611750227406496, "grad_norm": 2.34375, "learning_rate": 0.00048238976279040344, "loss": 6.2984, "mean_token_accuracy": 0.1308564618229866, "num_tokens": 27523448.0, "step": 12720 }, { "entropy": 6.53885703086853, "epoch": 1.3617100968484135, "grad_norm": 1.578125, "learning_rate": 0.0004823749318759413, "loss": 6.3572, "mean_token_accuracy": 0.1290444739162922, "num_tokens": 27534919.0, "step": 12725 }, { "entropy": 6.464112186431885, "epoch": 1.3622451709561774, "grad_norm": 1.796875, "learning_rate": 0.000482360094973557, "loss": 6.1838, "mean_token_accuracy": 0.13654556199908258, "num_tokens": 27545603.0, "step": 12730 }, { "entropy": 6.567755889892578, "epoch": 1.3627802450639415, "grad_norm": 1.546875, "learning_rate": 0.0004823452520836792, "loss": 6.32, "mean_token_accuracy": 0.13071177452802657, "num_tokens": 27556868.0, "step": 12735 }, { "entropy": 6.62355055809021, "epoch": 1.3633153191717053, "grad_norm": 1.78125, "learning_rate": 0.00048233040320673634, "loss": 6.4213, "mean_token_accuracy": 0.12471303418278694, "num_tokens": 27567200.0, "step": 12740 }, { "entropy": 6.48751277923584, "epoch": 1.3638503932794692, "grad_norm": 1.7578125, "learning_rate": 0.00048231554834315716, "loss": 6.2449, "mean_token_accuracy": 0.13486199751496314, "num_tokens": 27577759.0, "step": 12745 }, { "entropy": 6.522989892959595, "epoch": 1.364385467387233, "grad_norm": 1.453125, "learning_rate": 0.0004823006874933708, "loss": 6.372, "mean_token_accuracy": 0.12554556503891945, "num_tokens": 27588935.0, "step": 12750 }, { "entropy": 6.5447916984558105, "epoch": 1.364920541494997, "grad_norm": 1.6640625, "learning_rate": 0.0004822858206578061, "loss": 6.2705, "mean_token_accuracy": 0.12772670835256578, "num_tokens": 27600306.0, "step": 12755 }, { "entropy": 6.590607786178589, "epoch": 1.365455615602761, "grad_norm": 1.4296875, "learning_rate": 0.00048227094783689244, "loss": 6.3372, "mean_token_accuracy": 0.1335367240011692, "num_tokens": 27612322.0, "step": 12760 }, { "entropy": 6.557591819763184, "epoch": 1.365990689710525, "grad_norm": 1.6015625, "learning_rate": 0.0004822560690310594, "loss": 6.3052, "mean_token_accuracy": 0.1375129908323288, "num_tokens": 27623812.0, "step": 12765 }, { "entropy": 6.446960735321045, "epoch": 1.3665257638182888, "grad_norm": 1.6875, "learning_rate": 0.00048224118424073644, "loss": 6.1799, "mean_token_accuracy": 0.13489142134785653, "num_tokens": 27633848.0, "step": 12770 }, { "entropy": 6.483105087280274, "epoch": 1.3670608379260527, "grad_norm": 1.5078125, "learning_rate": 0.00048222629346635336, "loss": 6.2864, "mean_token_accuracy": 0.1376944363117218, "num_tokens": 27644641.0, "step": 12775 }, { "entropy": 6.522060775756836, "epoch": 1.3675959120338166, "grad_norm": 2.015625, "learning_rate": 0.00048221139670834025, "loss": 6.2826, "mean_token_accuracy": 0.135152880102396, "num_tokens": 27655552.0, "step": 12780 }, { "entropy": 6.499984788894653, "epoch": 1.3681309861415807, "grad_norm": 1.2734375, "learning_rate": 0.0004821964939671272, "loss": 6.2781, "mean_token_accuracy": 0.14179115146398544, "num_tokens": 27666396.0, "step": 12785 }, { "entropy": 6.579394149780273, "epoch": 1.3686660602493446, "grad_norm": 1.71875, "learning_rate": 0.0004821815852431444, "loss": 6.2375, "mean_token_accuracy": 0.1391332305967808, "num_tokens": 27676522.0, "step": 12790 }, { "entropy": 6.472452926635742, "epoch": 1.3692011343571084, "grad_norm": 2.390625, "learning_rate": 0.00048216667053682243, "loss": 6.2405, "mean_token_accuracy": 0.13712335973978043, "num_tokens": 27687088.0, "step": 12795 }, { "entropy": 6.498577833175659, "epoch": 1.3697362084648723, "grad_norm": 1.8515625, "learning_rate": 0.00048215174984859207, "loss": 6.2769, "mean_token_accuracy": 0.13670048490166664, "num_tokens": 27697587.0, "step": 12800 }, { "entropy": 6.483075046539307, "epoch": 1.3702712825726362, "grad_norm": 1.5546875, "learning_rate": 0.000482136823178884, "loss": 6.1907, "mean_token_accuracy": 0.13942957371473313, "num_tokens": 27708345.0, "step": 12805 }, { "entropy": 6.571651983261108, "epoch": 1.3708063566804003, "grad_norm": 1.6796875, "learning_rate": 0.0004821218905281292, "loss": 6.3944, "mean_token_accuracy": 0.12706556767225266, "num_tokens": 27719592.0, "step": 12810 }, { "entropy": 6.53343505859375, "epoch": 1.3713414307881642, "grad_norm": 1.671875, "learning_rate": 0.000482106951896759, "loss": 6.2827, "mean_token_accuracy": 0.13870616182684897, "num_tokens": 27730071.0, "step": 12815 }, { "entropy": 6.509290456771851, "epoch": 1.371876504895928, "grad_norm": 1.515625, "learning_rate": 0.00048209200728520466, "loss": 6.3139, "mean_token_accuracy": 0.13058488443493843, "num_tokens": 27740514.0, "step": 12820 }, { "entropy": 6.605209112167358, "epoch": 1.372411579003692, "grad_norm": 1.5859375, "learning_rate": 0.00048207705669389765, "loss": 6.3317, "mean_token_accuracy": 0.13331700637936592, "num_tokens": 27752088.0, "step": 12825 }, { "entropy": 6.623941564559937, "epoch": 1.3729466531114558, "grad_norm": 1.6953125, "learning_rate": 0.00048206210012326976, "loss": 6.3406, "mean_token_accuracy": 0.12817930206656455, "num_tokens": 27763401.0, "step": 12830 }, { "entropy": 6.548435020446777, "epoch": 1.37348172721922, "grad_norm": 1.75, "learning_rate": 0.00048204713757375283, "loss": 6.2789, "mean_token_accuracy": 0.13656549155712128, "num_tokens": 27773665.0, "step": 12835 }, { "entropy": 6.5042959690094, "epoch": 1.3740168013269838, "grad_norm": 1.7421875, "learning_rate": 0.0004820321690457789, "loss": 6.2961, "mean_token_accuracy": 0.1364237405359745, "num_tokens": 27785474.0, "step": 12840 }, { "entropy": 6.532441282272339, "epoch": 1.3745518754347477, "grad_norm": 1.4375, "learning_rate": 0.00048201719453978023, "loss": 6.3145, "mean_token_accuracy": 0.13314425200223923, "num_tokens": 27796520.0, "step": 12845 }, { "entropy": 6.591953563690185, "epoch": 1.3750869495425118, "grad_norm": 1.90625, "learning_rate": 0.0004820022140561891, "loss": 6.381, "mean_token_accuracy": 0.12598699182271958, "num_tokens": 27807559.0, "step": 12850 }, { "entropy": 6.571205520629883, "epoch": 1.3756220236502756, "grad_norm": 1.890625, "learning_rate": 0.0004819872275954381, "loss": 6.332, "mean_token_accuracy": 0.1316391684114933, "num_tokens": 27818208.0, "step": 12855 }, { "entropy": 6.507162141799927, "epoch": 1.3761570977580395, "grad_norm": 1.640625, "learning_rate": 0.00048197223515796, "loss": 6.23, "mean_token_accuracy": 0.13968217819929124, "num_tokens": 27828238.0, "step": 12860 }, { "entropy": 6.523963165283203, "epoch": 1.3766921718658034, "grad_norm": 1.3515625, "learning_rate": 0.0004819572367441877, "loss": 6.309, "mean_token_accuracy": 0.14231058806180955, "num_tokens": 27837885.0, "step": 12865 }, { "entropy": 6.457921075820923, "epoch": 1.3772272459735673, "grad_norm": 1.46875, "learning_rate": 0.0004819422323545543, "loss": 6.2082, "mean_token_accuracy": 0.14155658707022667, "num_tokens": 27847425.0, "step": 12870 }, { "entropy": 6.413833951950073, "epoch": 1.3777623200813314, "grad_norm": 1.3984375, "learning_rate": 0.000481927221989493, "loss": 6.2816, "mean_token_accuracy": 0.13291521817445756, "num_tokens": 27859606.0, "step": 12875 }, { "entropy": 6.5869935035705565, "epoch": 1.3782973941890952, "grad_norm": 1.6015625, "learning_rate": 0.0004819122056494373, "loss": 6.3398, "mean_token_accuracy": 0.13277041912078857, "num_tokens": 27871651.0, "step": 12880 }, { "entropy": 6.59212965965271, "epoch": 1.3788324682968591, "grad_norm": 1.71875, "learning_rate": 0.00048189718333482064, "loss": 6.2782, "mean_token_accuracy": 0.13503665924072267, "num_tokens": 27883138.0, "step": 12885 }, { "entropy": 6.614982795715332, "epoch": 1.379367542404623, "grad_norm": 1.5, "learning_rate": 0.000481882155046077, "loss": 6.3242, "mean_token_accuracy": 0.13419492915272713, "num_tokens": 27893597.0, "step": 12890 }, { "entropy": 6.516837644577026, "epoch": 1.3799026165123869, "grad_norm": 1.78125, "learning_rate": 0.00048186712078364006, "loss": 6.2529, "mean_token_accuracy": 0.13822920396924018, "num_tokens": 27904249.0, "step": 12895 }, { "entropy": 6.477723407745361, "epoch": 1.380437690620151, "grad_norm": 1.5625, "learning_rate": 0.00048185208054794414, "loss": 6.2921, "mean_token_accuracy": 0.1323131412267685, "num_tokens": 27914713.0, "step": 12900 }, { "entropy": 6.482716989517212, "epoch": 1.3809727647279149, "grad_norm": 1.5390625, "learning_rate": 0.0004818370343394235, "loss": 6.3059, "mean_token_accuracy": 0.14247043877840043, "num_tokens": 27926257.0, "step": 12905 }, { "entropy": 6.544012641906738, "epoch": 1.3815078388356787, "grad_norm": 1.78125, "learning_rate": 0.0004818219821585125, "loss": 6.29, "mean_token_accuracy": 0.13584071174263954, "num_tokens": 27936839.0, "step": 12910 }, { "entropy": 6.61454963684082, "epoch": 1.3820429129434426, "grad_norm": 1.6484375, "learning_rate": 0.00048180692400564586, "loss": 6.3864, "mean_token_accuracy": 0.1286683276295662, "num_tokens": 27946318.0, "step": 12915 }, { "entropy": 6.628933334350586, "epoch": 1.3825779870512065, "grad_norm": 1.5859375, "learning_rate": 0.00048179185988125834, "loss": 6.3766, "mean_token_accuracy": 0.13161879852414132, "num_tokens": 27956990.0, "step": 12920 }, { "entropy": 6.619915962219238, "epoch": 1.3831130611589706, "grad_norm": 1.546875, "learning_rate": 0.000481776789785785, "loss": 6.3103, "mean_token_accuracy": 0.12722400948405266, "num_tokens": 27968187.0, "step": 12925 }, { "entropy": 6.575854349136352, "epoch": 1.3836481352667345, "grad_norm": 1.71875, "learning_rate": 0.00048176171371966083, "loss": 6.3604, "mean_token_accuracy": 0.13226662948727608, "num_tokens": 27978337.0, "step": 12930 }, { "entropy": 6.500992679595948, "epoch": 1.3841832093744983, "grad_norm": 2.609375, "learning_rate": 0.0004817466316833212, "loss": 6.332, "mean_token_accuracy": 0.1280041068792343, "num_tokens": 27988681.0, "step": 12935 }, { "entropy": 6.48139591217041, "epoch": 1.3847182834822622, "grad_norm": 2.125, "learning_rate": 0.0004817315436772017, "loss": 6.2111, "mean_token_accuracy": 0.14233975857496262, "num_tokens": 27999233.0, "step": 12940 }, { "entropy": 6.597472620010376, "epoch": 1.385253357590026, "grad_norm": 1.6015625, "learning_rate": 0.0004817164497017379, "loss": 6.3476, "mean_token_accuracy": 0.13093181997537612, "num_tokens": 28010242.0, "step": 12945 }, { "entropy": 6.530687379837036, "epoch": 1.3857884316977902, "grad_norm": 2.125, "learning_rate": 0.0004817013497573656, "loss": 6.3145, "mean_token_accuracy": 0.13088319599628448, "num_tokens": 28020424.0, "step": 12950 }, { "entropy": 6.562989664077759, "epoch": 1.386323505805554, "grad_norm": 1.671875, "learning_rate": 0.000481686243844521, "loss": 6.2929, "mean_token_accuracy": 0.12782736048102378, "num_tokens": 28030287.0, "step": 12955 }, { "entropy": 6.579535293579101, "epoch": 1.386858579913318, "grad_norm": 1.578125, "learning_rate": 0.00048167113196364, "loss": 6.2645, "mean_token_accuracy": 0.13902048543095588, "num_tokens": 28039997.0, "step": 12960 }, { "entropy": 6.541631889343262, "epoch": 1.387393654021082, "grad_norm": 1.796875, "learning_rate": 0.0004816560141151593, "loss": 6.2911, "mean_token_accuracy": 0.12617392912507058, "num_tokens": 28051381.0, "step": 12965 }, { "entropy": 6.521060180664063, "epoch": 1.3879287281288457, "grad_norm": 1.9765625, "learning_rate": 0.0004816408902995151, "loss": 6.2566, "mean_token_accuracy": 0.13256800323724746, "num_tokens": 28063603.0, "step": 12970 }, { "entropy": 6.4855201721191404, "epoch": 1.3884638022366098, "grad_norm": 1.875, "learning_rate": 0.0004816257605171442, "loss": 6.2444, "mean_token_accuracy": 0.13902541249990463, "num_tokens": 28073942.0, "step": 12975 }, { "entropy": 6.497772598266602, "epoch": 1.3889988763443737, "grad_norm": 1.46875, "learning_rate": 0.00048161062476848363, "loss": 6.2825, "mean_token_accuracy": 0.13788814544677735, "num_tokens": 28083837.0, "step": 12980 }, { "entropy": 6.4824666500091555, "epoch": 1.3895339504521376, "grad_norm": 1.734375, "learning_rate": 0.0004815954830539702, "loss": 6.2279, "mean_token_accuracy": 0.13570400699973106, "num_tokens": 28094150.0, "step": 12985 }, { "entropy": 6.518013954162598, "epoch": 1.3900690245599017, "grad_norm": 1.34375, "learning_rate": 0.00048158033537404126, "loss": 6.2673, "mean_token_accuracy": 0.1387584075331688, "num_tokens": 28106345.0, "step": 12990 }, { "entropy": 6.5225001811981205, "epoch": 1.3906040986676655, "grad_norm": 1.546875, "learning_rate": 0.00048156518172913417, "loss": 6.229, "mean_token_accuracy": 0.13286010921001434, "num_tokens": 28116858.0, "step": 12995 }, { "entropy": 6.501324033737182, "epoch": 1.3911391727754294, "grad_norm": 4.0625, "learning_rate": 0.0004815500221196865, "loss": 6.3845, "mean_token_accuracy": 0.12992180436849593, "num_tokens": 28128390.0, "step": 13000 }, { "entropy": 6.47907657623291, "epoch": 1.3916742468831933, "grad_norm": 1.6015625, "learning_rate": 0.00048153485654613587, "loss": 6.224, "mean_token_accuracy": 0.13855567947030067, "num_tokens": 28139421.0, "step": 13005 }, { "entropy": 6.533262300491333, "epoch": 1.3922093209909572, "grad_norm": 1.3203125, "learning_rate": 0.00048151968500892043, "loss": 6.3213, "mean_token_accuracy": 0.13610239028930665, "num_tokens": 28151076.0, "step": 13010 }, { "entropy": 6.589778709411621, "epoch": 1.3927443950987213, "grad_norm": 1.8515625, "learning_rate": 0.00048150450750847795, "loss": 6.425, "mean_token_accuracy": 0.12930934131145477, "num_tokens": 28162079.0, "step": 13015 }, { "entropy": 6.53804030418396, "epoch": 1.3932794692064852, "grad_norm": 1.8046875, "learning_rate": 0.000481489324045247, "loss": 6.3428, "mean_token_accuracy": 0.13030591681599618, "num_tokens": 28174442.0, "step": 13020 }, { "entropy": 6.552037954330444, "epoch": 1.393814543314249, "grad_norm": 1.7109375, "learning_rate": 0.00048147413461966564, "loss": 6.2198, "mean_token_accuracy": 0.1378868341445923, "num_tokens": 28184643.0, "step": 13025 }, { "entropy": 6.455650091171265, "epoch": 1.394349617422013, "grad_norm": 1.7109375, "learning_rate": 0.00048145893923217276, "loss": 6.248, "mean_token_accuracy": 0.1368380829691887, "num_tokens": 28194021.0, "step": 13030 }, { "entropy": 6.57091875076294, "epoch": 1.3948846915297768, "grad_norm": 2.25, "learning_rate": 0.0004814437378832071, "loss": 6.3144, "mean_token_accuracy": 0.12892460078001022, "num_tokens": 28204750.0, "step": 13035 }, { "entropy": 6.6161461353302, "epoch": 1.3954197656375409, "grad_norm": 3.296875, "learning_rate": 0.0004814285305732074, "loss": 6.3714, "mean_token_accuracy": 0.1290208302438259, "num_tokens": 28216499.0, "step": 13040 }, { "entropy": 6.584888553619384, "epoch": 1.3959548397453048, "grad_norm": 1.484375, "learning_rate": 0.00048141331730261293, "loss": 6.3087, "mean_token_accuracy": 0.1345869742333889, "num_tokens": 28226573.0, "step": 13045 }, { "entropy": 6.55465612411499, "epoch": 1.3964899138530686, "grad_norm": 1.4296875, "learning_rate": 0.000481398098071863, "loss": 6.2448, "mean_token_accuracy": 0.14011548906564714, "num_tokens": 28236688.0, "step": 13050 }, { "entropy": 6.517119026184082, "epoch": 1.3970249879608325, "grad_norm": 1.5625, "learning_rate": 0.00048138287288139686, "loss": 6.3374, "mean_token_accuracy": 0.13438064157962798, "num_tokens": 28247477.0, "step": 13055 }, { "entropy": 6.4921595573425295, "epoch": 1.3975600620685964, "grad_norm": 1.703125, "learning_rate": 0.0004813676417316543, "loss": 6.3186, "mean_token_accuracy": 0.13378834277391433, "num_tokens": 28258286.0, "step": 13060 }, { "entropy": 6.6379228115081785, "epoch": 1.3980951361763605, "grad_norm": 2.296875, "learning_rate": 0.0004813524046230751, "loss": 6.4498, "mean_token_accuracy": 0.12076324447989464, "num_tokens": 28268587.0, "step": 13065 }, { "entropy": 6.696167945861816, "epoch": 1.3986302102841244, "grad_norm": 1.46875, "learning_rate": 0.00048133716155609926, "loss": 6.3418, "mean_token_accuracy": 0.1276852436363697, "num_tokens": 28279352.0, "step": 13070 }, { "entropy": 6.568699979782105, "epoch": 1.3991652843918883, "grad_norm": 2.34375, "learning_rate": 0.0004813219125311668, "loss": 6.2537, "mean_token_accuracy": 0.13418687954545022, "num_tokens": 28290114.0, "step": 13075 }, { "entropy": 6.516354560852051, "epoch": 1.3997003584996521, "grad_norm": 1.3671875, "learning_rate": 0.00048130665754871814, "loss": 6.3526, "mean_token_accuracy": 0.12834639623761177, "num_tokens": 28301845.0, "step": 13080 }, { "entropy": 6.586096525192261, "epoch": 1.400235432607416, "grad_norm": 1.359375, "learning_rate": 0.00048129139660919374, "loss": 6.3262, "mean_token_accuracy": 0.1293413132429123, "num_tokens": 28313162.0, "step": 13085 }, { "entropy": 6.549271535873413, "epoch": 1.40077050671518, "grad_norm": 1.4765625, "learning_rate": 0.00048127612971303425, "loss": 6.2714, "mean_token_accuracy": 0.1319861926138401, "num_tokens": 28323888.0, "step": 13090 }, { "entropy": 6.5844615459442135, "epoch": 1.401305580822944, "grad_norm": 1.4140625, "learning_rate": 0.0004812608568606805, "loss": 6.3159, "mean_token_accuracy": 0.1313139483332634, "num_tokens": 28333735.0, "step": 13095 }, { "entropy": 6.566430997848511, "epoch": 1.4018406549307079, "grad_norm": 1.5859375, "learning_rate": 0.0004812455780525735, "loss": 6.3089, "mean_token_accuracy": 0.13157719522714614, "num_tokens": 28343947.0, "step": 13100 }, { "entropy": 6.550437593460083, "epoch": 1.402375729038472, "grad_norm": 1.890625, "learning_rate": 0.0004812302932891544, "loss": 6.3743, "mean_token_accuracy": 0.1243227556347847, "num_tokens": 28354635.0, "step": 13105 }, { "entropy": 6.563779306411743, "epoch": 1.4029108031462356, "grad_norm": 1.7109375, "learning_rate": 0.0004812150025708646, "loss": 6.2903, "mean_token_accuracy": 0.13009085580706597, "num_tokens": 28365392.0, "step": 13110 }, { "entropy": 6.57616081237793, "epoch": 1.4034458772539997, "grad_norm": 1.5078125, "learning_rate": 0.00048119970589814557, "loss": 6.3027, "mean_token_accuracy": 0.12210134267807007, "num_tokens": 28376527.0, "step": 13115 }, { "entropy": 6.541454315185547, "epoch": 1.4039809513617636, "grad_norm": 1.546875, "learning_rate": 0.0004811844032714389, "loss": 6.3129, "mean_token_accuracy": 0.13677758798003198, "num_tokens": 28387178.0, "step": 13120 }, { "entropy": 6.539116430282593, "epoch": 1.4045160254695275, "grad_norm": 1.921875, "learning_rate": 0.00048116909469118663, "loss": 6.1941, "mean_token_accuracy": 0.13399127945303918, "num_tokens": 28397578.0, "step": 13125 }, { "entropy": 6.506171226501465, "epoch": 1.4050510995772916, "grad_norm": 1.4453125, "learning_rate": 0.0004811537801578308, "loss": 6.3397, "mean_token_accuracy": 0.1259517602622509, "num_tokens": 28408933.0, "step": 13130 }, { "entropy": 6.503382349014283, "epoch": 1.4055861736850555, "grad_norm": 2.109375, "learning_rate": 0.00048113845967181346, "loss": 6.3245, "mean_token_accuracy": 0.12405535578727722, "num_tokens": 28421906.0, "step": 13135 }, { "entropy": 6.5776450634002686, "epoch": 1.4061212477928193, "grad_norm": 1.9375, "learning_rate": 0.000481123133233577, "loss": 6.2604, "mean_token_accuracy": 0.1332197055220604, "num_tokens": 28432677.0, "step": 13140 }, { "entropy": 6.573045492172241, "epoch": 1.4066563219005832, "grad_norm": 2.09375, "learning_rate": 0.00048110780084356414, "loss": 6.3598, "mean_token_accuracy": 0.13100109472870827, "num_tokens": 28443795.0, "step": 13145 }, { "entropy": 6.55504298210144, "epoch": 1.407191396008347, "grad_norm": 2.09375, "learning_rate": 0.0004810924625022174, "loss": 6.3319, "mean_token_accuracy": 0.13072033673524858, "num_tokens": 28455727.0, "step": 13150 }, { "entropy": 6.61231427192688, "epoch": 1.4077264701161112, "grad_norm": 1.9765625, "learning_rate": 0.0004810771182099799, "loss": 6.3518, "mean_token_accuracy": 0.12492276728153229, "num_tokens": 28467554.0, "step": 13155 }, { "entropy": 6.603960275650024, "epoch": 1.408261544223875, "grad_norm": 1.6171875, "learning_rate": 0.0004810617679672945, "loss": 6.3649, "mean_token_accuracy": 0.13161554783582688, "num_tokens": 28479268.0, "step": 13160 }, { "entropy": 6.55245041847229, "epoch": 1.408796618331639, "grad_norm": 4.375, "learning_rate": 0.00048104641177460443, "loss": 6.3518, "mean_token_accuracy": 0.12731072753667833, "num_tokens": 28489887.0, "step": 13165 }, { "entropy": 6.468415307998657, "epoch": 1.4093316924394028, "grad_norm": 1.8671875, "learning_rate": 0.0004810310496323533, "loss": 6.248, "mean_token_accuracy": 0.1380733884871006, "num_tokens": 28500736.0, "step": 13170 }, { "entropy": 6.470671081542969, "epoch": 1.4098667665471667, "grad_norm": 2.578125, "learning_rate": 0.00048101568154098446, "loss": 6.2256, "mean_token_accuracy": 0.13929775431752206, "num_tokens": 28511458.0, "step": 13175 }, { "entropy": 6.591119432449341, "epoch": 1.4104018406549308, "grad_norm": 2.109375, "learning_rate": 0.00048100030750094185, "loss": 6.3399, "mean_token_accuracy": 0.12569592297077178, "num_tokens": 28522354.0, "step": 13180 }, { "entropy": 6.534553337097168, "epoch": 1.4109369147626947, "grad_norm": 3.109375, "learning_rate": 0.0004809849275126693, "loss": 6.1849, "mean_token_accuracy": 0.1420965887606144, "num_tokens": 28533061.0, "step": 13185 }, { "entropy": 6.543464422225952, "epoch": 1.4114719888704585, "grad_norm": 1.828125, "learning_rate": 0.00048096954157661085, "loss": 6.3327, "mean_token_accuracy": 0.13191912025213243, "num_tokens": 28544230.0, "step": 13190 }, { "entropy": 6.528650999069214, "epoch": 1.4120070629782224, "grad_norm": 1.6953125, "learning_rate": 0.00048095414969321086, "loss": 6.3278, "mean_token_accuracy": 0.13371477872133256, "num_tokens": 28555461.0, "step": 13195 }, { "entropy": 6.5493683338165285, "epoch": 1.4125421370859863, "grad_norm": 1.8515625, "learning_rate": 0.00048093875186291376, "loss": 6.2443, "mean_token_accuracy": 0.13574814945459365, "num_tokens": 28565992.0, "step": 13200 }, { "entropy": 6.565684080123901, "epoch": 1.4130772111937504, "grad_norm": 1.859375, "learning_rate": 0.00048092334808616413, "loss": 6.2524, "mean_token_accuracy": 0.1374378241598606, "num_tokens": 28575802.0, "step": 13205 }, { "entropy": 6.535583209991455, "epoch": 1.4136122853015143, "grad_norm": 3.59375, "learning_rate": 0.0004809079383634067, "loss": 6.2492, "mean_token_accuracy": 0.1376635640859604, "num_tokens": 28586982.0, "step": 13210 }, { "entropy": 6.541072654724121, "epoch": 1.4141473594092782, "grad_norm": 2.390625, "learning_rate": 0.00048089252269508656, "loss": 6.3374, "mean_token_accuracy": 0.13196105509996414, "num_tokens": 28598267.0, "step": 13215 }, { "entropy": 6.574584054946899, "epoch": 1.414682433517042, "grad_norm": 2.125, "learning_rate": 0.00048087710108164874, "loss": 6.3057, "mean_token_accuracy": 0.1319591633975506, "num_tokens": 28608213.0, "step": 13220 }, { "entropy": 6.5331920146942135, "epoch": 1.415217507624806, "grad_norm": 1.796875, "learning_rate": 0.0004808616735235385, "loss": 6.2819, "mean_token_accuracy": 0.12543027997016906, "num_tokens": 28619674.0, "step": 13225 }, { "entropy": 6.551663255691528, "epoch": 1.41575258173257, "grad_norm": 2.953125, "learning_rate": 0.0004808462400212014, "loss": 6.2191, "mean_token_accuracy": 0.1338550068438053, "num_tokens": 28630824.0, "step": 13230 }, { "entropy": 6.50926718711853, "epoch": 1.416287655840334, "grad_norm": 1.84375, "learning_rate": 0.00048083080057508313, "loss": 6.3517, "mean_token_accuracy": 0.13014202639460565, "num_tokens": 28642270.0, "step": 13235 }, { "entropy": 6.521674776077271, "epoch": 1.4168227299480978, "grad_norm": 1.921875, "learning_rate": 0.00048081535518562933, "loss": 6.3362, "mean_token_accuracy": 0.12918935641646384, "num_tokens": 28653649.0, "step": 13240 }, { "entropy": 6.502331113815307, "epoch": 1.4173578040558619, "grad_norm": 1.9375, "learning_rate": 0.000480799903853286, "loss": 6.2151, "mean_token_accuracy": 0.13268271312117577, "num_tokens": 28664044.0, "step": 13245 }, { "entropy": 6.542404127120972, "epoch": 1.4178928781636255, "grad_norm": 4.46875, "learning_rate": 0.0004807844465784995, "loss": 6.2942, "mean_token_accuracy": 0.1345588520169258, "num_tokens": 28675394.0, "step": 13250 }, { "entropy": 6.529404735565185, "epoch": 1.4184279522713896, "grad_norm": 2.203125, "learning_rate": 0.00048076898336171596, "loss": 6.2856, "mean_token_accuracy": 0.14060317277908324, "num_tokens": 28686292.0, "step": 13255 }, { "entropy": 6.55095157623291, "epoch": 1.4189630263791535, "grad_norm": 1.5390625, "learning_rate": 0.00048075351420338196, "loss": 6.304, "mean_token_accuracy": 0.1346028797328472, "num_tokens": 28696928.0, "step": 13260 }, { "entropy": 6.495355653762817, "epoch": 1.4194981004869174, "grad_norm": 1.890625, "learning_rate": 0.0004807380391039441, "loss": 6.323, "mean_token_accuracy": 0.1321026124060154, "num_tokens": 28707986.0, "step": 13265 }, { "entropy": 6.614403247833252, "epoch": 1.4200331745946815, "grad_norm": 1.609375, "learning_rate": 0.00048072255806384936, "loss": 6.3291, "mean_token_accuracy": 0.1340144731104374, "num_tokens": 28719296.0, "step": 13270 }, { "entropy": 6.521930789947509, "epoch": 1.4205682487024454, "grad_norm": 1.6015625, "learning_rate": 0.0004807070710835447, "loss": 6.1843, "mean_token_accuracy": 0.13900391533970832, "num_tokens": 28729523.0, "step": 13275 }, { "entropy": 6.557798910140991, "epoch": 1.4211033228102092, "grad_norm": 1.9296875, "learning_rate": 0.0004806915781634771, "loss": 6.3166, "mean_token_accuracy": 0.1333258867263794, "num_tokens": 28739026.0, "step": 13280 }, { "entropy": 6.586025190353394, "epoch": 1.4216383969179731, "grad_norm": 1.703125, "learning_rate": 0.0004806760793040942, "loss": 6.399, "mean_token_accuracy": 0.12926854342222213, "num_tokens": 28749513.0, "step": 13285 }, { "entropy": 6.60874834060669, "epoch": 1.422173471025737, "grad_norm": 1.96875, "learning_rate": 0.00048066057450584334, "loss": 6.3034, "mean_token_accuracy": 0.1329214371740818, "num_tokens": 28760722.0, "step": 13290 }, { "entropy": 6.559692621231079, "epoch": 1.422708545133501, "grad_norm": 1.8828125, "learning_rate": 0.0004806450637691723, "loss": 6.2465, "mean_token_accuracy": 0.14297338128089904, "num_tokens": 28771235.0, "step": 13295 }, { "entropy": 6.531833028793335, "epoch": 1.423243619241265, "grad_norm": 1.53125, "learning_rate": 0.00048062954709452907, "loss": 6.2552, "mean_token_accuracy": 0.13588109463453293, "num_tokens": 28782642.0, "step": 13300 }, { "entropy": 6.541342067718506, "epoch": 1.4237786933490288, "grad_norm": 1.5546875, "learning_rate": 0.0004806140244823615, "loss": 6.2651, "mean_token_accuracy": 0.13098229318857194, "num_tokens": 28793628.0, "step": 13305 }, { "entropy": 6.587154912948608, "epoch": 1.4243137674567927, "grad_norm": 1.8203125, "learning_rate": 0.00048059849593311776, "loss": 6.3307, "mean_token_accuracy": 0.13464922532439233, "num_tokens": 28804034.0, "step": 13310 }, { "entropy": 6.551678323745728, "epoch": 1.4248488415645566, "grad_norm": 1.7734375, "learning_rate": 0.0004805829614472464, "loss": 6.2776, "mean_token_accuracy": 0.13238443210721015, "num_tokens": 28814679.0, "step": 13315 }, { "entropy": 6.510989809036255, "epoch": 1.4253839156723207, "grad_norm": 2.109375, "learning_rate": 0.00048056742102519593, "loss": 6.2973, "mean_token_accuracy": 0.12994106039404868, "num_tokens": 28825130.0, "step": 13320 }, { "entropy": 6.543405151367187, "epoch": 1.4259189897800846, "grad_norm": 1.6015625, "learning_rate": 0.00048055187466741506, "loss": 6.3261, "mean_token_accuracy": 0.12828193083405495, "num_tokens": 28835500.0, "step": 13325 }, { "entropy": 6.533200263977051, "epoch": 1.4264540638878485, "grad_norm": 1.390625, "learning_rate": 0.0004805363223743527, "loss": 6.2586, "mean_token_accuracy": 0.13435445576906205, "num_tokens": 28845794.0, "step": 13330 }, { "entropy": 6.59534273147583, "epoch": 1.4269891379956123, "grad_norm": 1.9921875, "learning_rate": 0.0004805207641464579, "loss": 6.2819, "mean_token_accuracy": 0.13006314858794213, "num_tokens": 28856326.0, "step": 13335 }, { "entropy": 6.506957912445069, "epoch": 1.4275242121033762, "grad_norm": 1.4921875, "learning_rate": 0.0004805051999841799, "loss": 6.2806, "mean_token_accuracy": 0.13344307169318198, "num_tokens": 28867592.0, "step": 13340 }, { "entropy": 6.606613874435425, "epoch": 1.4280592862111403, "grad_norm": 1.8828125, "learning_rate": 0.0004804896298879682, "loss": 6.4169, "mean_token_accuracy": 0.12649569064378738, "num_tokens": 28880352.0, "step": 13345 }, { "entropy": 6.59653148651123, "epoch": 1.4285943603189042, "grad_norm": 1.7578125, "learning_rate": 0.0004804740538582723, "loss": 6.2943, "mean_token_accuracy": 0.1322682738304138, "num_tokens": 28892012.0, "step": 13350 }, { "entropy": 6.579413747787475, "epoch": 1.429129434426668, "grad_norm": 1.65625, "learning_rate": 0.0004804584718955419, "loss": 6.2216, "mean_token_accuracy": 0.13726244121789932, "num_tokens": 28902247.0, "step": 13355 }, { "entropy": 6.508374929428101, "epoch": 1.429664508534432, "grad_norm": 1.90625, "learning_rate": 0.000480442884000227, "loss": 6.3598, "mean_token_accuracy": 0.13232571333646775, "num_tokens": 28913222.0, "step": 13360 }, { "entropy": 6.51956524848938, "epoch": 1.4301995826421958, "grad_norm": 1.609375, "learning_rate": 0.0004804272901727778, "loss": 6.2675, "mean_token_accuracy": 0.1339123398065567, "num_tokens": 28924038.0, "step": 13365 }, { "entropy": 6.582114124298096, "epoch": 1.43073465674996, "grad_norm": 1.421875, "learning_rate": 0.00048041169041364437, "loss": 6.3048, "mean_token_accuracy": 0.13865149021148682, "num_tokens": 28934448.0, "step": 13370 }, { "entropy": 6.542791557312012, "epoch": 1.4312697308577238, "grad_norm": 1.5546875, "learning_rate": 0.00048039608472327724, "loss": 6.2752, "mean_token_accuracy": 0.13437252789735793, "num_tokens": 28945175.0, "step": 13375 }, { "entropy": 6.499612092971802, "epoch": 1.4318048049654877, "grad_norm": 1.3828125, "learning_rate": 0.00048038047310212706, "loss": 6.2301, "mean_token_accuracy": 0.13937258571386338, "num_tokens": 28955116.0, "step": 13380 }, { "entropy": 6.548843431472778, "epoch": 1.4323398790732518, "grad_norm": 1.84375, "learning_rate": 0.00048036485555064454, "loss": 6.3369, "mean_token_accuracy": 0.13031953051686287, "num_tokens": 28966999.0, "step": 13385 }, { "entropy": 6.54577784538269, "epoch": 1.4328749531810157, "grad_norm": 1.9140625, "learning_rate": 0.00048034923206928065, "loss": 6.3134, "mean_token_accuracy": 0.12904799953103066, "num_tokens": 28977388.0, "step": 13390 }, { "entropy": 6.539524078369141, "epoch": 1.4334100272887795, "grad_norm": 1.6640625, "learning_rate": 0.00048033360265848664, "loss": 6.2086, "mean_token_accuracy": 0.13839732706546784, "num_tokens": 28987792.0, "step": 13395 }, { "entropy": 6.613337612152099, "epoch": 1.4339451013965434, "grad_norm": 2.25, "learning_rate": 0.00048031796731871364, "loss": 6.3435, "mean_token_accuracy": 0.13307096138596536, "num_tokens": 28998319.0, "step": 13400 }, { "entropy": 6.5337625503540036, "epoch": 1.4344801755043073, "grad_norm": 1.359375, "learning_rate": 0.00048030232605041323, "loss": 6.318, "mean_token_accuracy": 0.13027154058218002, "num_tokens": 29007942.0, "step": 13405 }, { "entropy": 6.594687223434448, "epoch": 1.4350152496120714, "grad_norm": 1.4296875, "learning_rate": 0.0004802866788540369, "loss": 6.3017, "mean_token_accuracy": 0.13362317085266112, "num_tokens": 29018217.0, "step": 13410 }, { "entropy": 6.587049055099487, "epoch": 1.4355503237198353, "grad_norm": 1.71875, "learning_rate": 0.0004802710257300367, "loss": 6.3129, "mean_token_accuracy": 0.131132273375988, "num_tokens": 29028472.0, "step": 13415 }, { "entropy": 6.5456602573394775, "epoch": 1.4360853978275991, "grad_norm": 1.7109375, "learning_rate": 0.0004802553666788644, "loss": 6.2708, "mean_token_accuracy": 0.13706605061888694, "num_tokens": 29040553.0, "step": 13420 }, { "entropy": 6.571896696090699, "epoch": 1.436620471935363, "grad_norm": 1.7109375, "learning_rate": 0.00048023970170097226, "loss": 6.3087, "mean_token_accuracy": 0.13039797320961952, "num_tokens": 29050142.0, "step": 13425 }, { "entropy": 6.510137319564819, "epoch": 1.437155546043127, "grad_norm": 1.7265625, "learning_rate": 0.00048022403079681254, "loss": 6.2515, "mean_token_accuracy": 0.12999855652451514, "num_tokens": 29061762.0, "step": 13430 }, { "entropy": 6.549421262741089, "epoch": 1.437690620150891, "grad_norm": 2.71875, "learning_rate": 0.00048020835396683775, "loss": 6.3199, "mean_token_accuracy": 0.1308118633925915, "num_tokens": 29072095.0, "step": 13435 }, { "entropy": 6.60357551574707, "epoch": 1.4382256942586549, "grad_norm": 2.890625, "learning_rate": 0.00048019267121150066, "loss": 6.3243, "mean_token_accuracy": 0.13163482919335365, "num_tokens": 29082561.0, "step": 13440 }, { "entropy": 6.5486468315124515, "epoch": 1.4387607683664188, "grad_norm": 1.6796875, "learning_rate": 0.00048017698253125397, "loss": 6.2671, "mean_token_accuracy": 0.13364253789186478, "num_tokens": 29093813.0, "step": 13445 }, { "entropy": 6.52044939994812, "epoch": 1.4392958424741826, "grad_norm": 1.46875, "learning_rate": 0.0004801612879265507, "loss": 6.2736, "mean_token_accuracy": 0.1357661746442318, "num_tokens": 29104064.0, "step": 13450 }, { "entropy": 6.494532108306885, "epoch": 1.4398309165819465, "grad_norm": 1.890625, "learning_rate": 0.0004801455873978442, "loss": 6.3013, "mean_token_accuracy": 0.12913288176059723, "num_tokens": 29115086.0, "step": 13455 }, { "entropy": 6.536068773269653, "epoch": 1.4403659906897106, "grad_norm": 1.8671875, "learning_rate": 0.0004801298809455876, "loss": 6.2578, "mean_token_accuracy": 0.14133179932832718, "num_tokens": 29125536.0, "step": 13460 }, { "entropy": 6.583189058303833, "epoch": 1.4409010647974745, "grad_norm": 1.5234375, "learning_rate": 0.0004801141685702345, "loss": 6.3452, "mean_token_accuracy": 0.13120611384510994, "num_tokens": 29137007.0, "step": 13465 }, { "entropy": 6.567616033554077, "epoch": 1.4414361389052384, "grad_norm": 1.6171875, "learning_rate": 0.00048009845027223864, "loss": 6.3332, "mean_token_accuracy": 0.12379435449838638, "num_tokens": 29147072.0, "step": 13470 }, { "entropy": 6.576822185516358, "epoch": 1.4419712130130022, "grad_norm": 1.578125, "learning_rate": 0.00048008272605205377, "loss": 6.2946, "mean_token_accuracy": 0.13404594883322715, "num_tokens": 29157803.0, "step": 13475 }, { "entropy": 6.559188413619995, "epoch": 1.4425062871207661, "grad_norm": 1.3671875, "learning_rate": 0.00048006699591013417, "loss": 6.2698, "mean_token_accuracy": 0.13357484936714173, "num_tokens": 29168173.0, "step": 13480 }, { "entropy": 6.614182090759277, "epoch": 1.4430413612285302, "grad_norm": 2.171875, "learning_rate": 0.0004800512598469337, "loss": 6.3512, "mean_token_accuracy": 0.1211496539413929, "num_tokens": 29179377.0, "step": 13485 }, { "entropy": 6.5842859745025635, "epoch": 1.443576435336294, "grad_norm": 1.765625, "learning_rate": 0.000480035517862907, "loss": 6.3174, "mean_token_accuracy": 0.13456696942448615, "num_tokens": 29190909.0, "step": 13490 }, { "entropy": 6.492300939559937, "epoch": 1.444111509444058, "grad_norm": 1.671875, "learning_rate": 0.00048001976995850856, "loss": 6.2312, "mean_token_accuracy": 0.13400312289595603, "num_tokens": 29200977.0, "step": 13495 }, { "entropy": 6.5454717636108395, "epoch": 1.4446465835518219, "grad_norm": 1.78125, "learning_rate": 0.00048000401613419296, "loss": 6.2857, "mean_token_accuracy": 0.12763061225414277, "num_tokens": 29210702.0, "step": 13500 }, { "entropy": 6.604302883148193, "epoch": 1.4451816576595857, "grad_norm": 1.7578125, "learning_rate": 0.00047998825639041534, "loss": 6.371, "mean_token_accuracy": 0.12395200505852699, "num_tokens": 29221338.0, "step": 13505 }, { "entropy": 6.613165950775146, "epoch": 1.4457167317673498, "grad_norm": 1.9296875, "learning_rate": 0.0004799724907276306, "loss": 6.2309, "mean_token_accuracy": 0.1429674044251442, "num_tokens": 29232091.0, "step": 13510 }, { "entropy": 6.482897043228149, "epoch": 1.4462518058751137, "grad_norm": 1.4375, "learning_rate": 0.0004799567191462939, "loss": 6.2302, "mean_token_accuracy": 0.13581477701663972, "num_tokens": 29241903.0, "step": 13515 }, { "entropy": 6.5058026790618895, "epoch": 1.4467868799828776, "grad_norm": 1.578125, "learning_rate": 0.00047994094164686074, "loss": 6.3454, "mean_token_accuracy": 0.13214331939816476, "num_tokens": 29253414.0, "step": 13520 }, { "entropy": 6.605631923675537, "epoch": 1.4473219540906417, "grad_norm": 1.5390625, "learning_rate": 0.0004799251582297868, "loss": 6.2308, "mean_token_accuracy": 0.14136453941464425, "num_tokens": 29264066.0, "step": 13525 }, { "entropy": 6.567365121841431, "epoch": 1.4478570281984056, "grad_norm": 1.6875, "learning_rate": 0.00047990936889552767, "loss": 6.2819, "mean_token_accuracy": 0.13597942665219306, "num_tokens": 29274915.0, "step": 13530 }, { "entropy": 6.507847166061401, "epoch": 1.4483921023061694, "grad_norm": 1.9453125, "learning_rate": 0.0004798935736445392, "loss": 6.2805, "mean_token_accuracy": 0.12975036427378656, "num_tokens": 29287345.0, "step": 13535 }, { "entropy": 6.491131067276001, "epoch": 1.4489271764139333, "grad_norm": 2.015625, "learning_rate": 0.0004798777724772777, "loss": 6.2513, "mean_token_accuracy": 0.14119713753461838, "num_tokens": 29297432.0, "step": 13540 }, { "entropy": 6.509729433059692, "epoch": 1.4494622505216972, "grad_norm": 1.7265625, "learning_rate": 0.00047986196539419936, "loss": 6.1922, "mean_token_accuracy": 0.14158949628472328, "num_tokens": 29307534.0, "step": 13545 }, { "entropy": 6.549173402786255, "epoch": 1.4499973246294613, "grad_norm": 2.015625, "learning_rate": 0.0004798461523957604, "loss": 6.261, "mean_token_accuracy": 0.1374451108276844, "num_tokens": 29319412.0, "step": 13550 }, { "entropy": 6.498152875900269, "epoch": 1.4505323987372252, "grad_norm": 1.7109375, "learning_rate": 0.00047983033348241767, "loss": 6.2279, "mean_token_accuracy": 0.14251604452729225, "num_tokens": 29330477.0, "step": 13555 }, { "entropy": 6.484377861022949, "epoch": 1.451067472844989, "grad_norm": 1.5546875, "learning_rate": 0.0004798145086546278, "loss": 6.2648, "mean_token_accuracy": 0.13428061753511428, "num_tokens": 29341481.0, "step": 13560 }, { "entropy": 6.485887670516968, "epoch": 1.451602546952753, "grad_norm": 1.875, "learning_rate": 0.0004797986779128478, "loss": 6.2452, "mean_token_accuracy": 0.13639950677752494, "num_tokens": 29353273.0, "step": 13565 }, { "entropy": 6.57791223526001, "epoch": 1.4521376210605168, "grad_norm": 2.34375, "learning_rate": 0.0004797828412575348, "loss": 6.2914, "mean_token_accuracy": 0.1361882768571377, "num_tokens": 29364108.0, "step": 13570 }, { "entropy": 6.495282173156738, "epoch": 1.452672695168281, "grad_norm": 1.71875, "learning_rate": 0.00047976699868914594, "loss": 6.2636, "mean_token_accuracy": 0.13775565326213837, "num_tokens": 29375272.0, "step": 13575 }, { "entropy": 6.505160570144653, "epoch": 1.4532077692760448, "grad_norm": 1.671875, "learning_rate": 0.0004797511502081388, "loss": 6.2756, "mean_token_accuracy": 0.1332462415099144, "num_tokens": 29385749.0, "step": 13580 }, { "entropy": 6.517300844192505, "epoch": 1.4537428433838087, "grad_norm": 2.59375, "learning_rate": 0.000479735295814971, "loss": 6.2187, "mean_token_accuracy": 0.13782110810279846, "num_tokens": 29396430.0, "step": 13585 }, { "entropy": 6.536860084533691, "epoch": 1.4542779174915725, "grad_norm": 1.84375, "learning_rate": 0.00047971943551010035, "loss": 6.2744, "mean_token_accuracy": 0.1307387612760067, "num_tokens": 29407020.0, "step": 13590 }, { "entropy": 6.546886920928955, "epoch": 1.4548129915993364, "grad_norm": 1.3515625, "learning_rate": 0.00047970356929398467, "loss": 6.2929, "mean_token_accuracy": 0.13745293468236924, "num_tokens": 29418428.0, "step": 13595 }, { "entropy": 6.565701627731324, "epoch": 1.4553480657071005, "grad_norm": 2.125, "learning_rate": 0.0004796876971670822, "loss": 6.3544, "mean_token_accuracy": 0.13378758504986762, "num_tokens": 29430611.0, "step": 13600 }, { "entropy": 6.5439074516296385, "epoch": 1.4558831398148644, "grad_norm": 1.40625, "learning_rate": 0.0004796718191298512, "loss": 6.2849, "mean_token_accuracy": 0.1257310539484024, "num_tokens": 29441545.0, "step": 13605 }, { "entropy": 6.5851068019866945, "epoch": 1.4564182139226283, "grad_norm": 1.6640625, "learning_rate": 0.0004796559351827503, "loss": 6.3695, "mean_token_accuracy": 0.12765171527862548, "num_tokens": 29452529.0, "step": 13610 }, { "entropy": 6.539608526229858, "epoch": 1.4569532880303921, "grad_norm": 2.015625, "learning_rate": 0.000479640045326238, "loss": 6.2582, "mean_token_accuracy": 0.1369820587337017, "num_tokens": 29463860.0, "step": 13615 }, { "entropy": 6.653084325790405, "epoch": 1.457488362138156, "grad_norm": 2.234375, "learning_rate": 0.0004796241495607731, "loss": 6.3325, "mean_token_accuracy": 0.1349804438650608, "num_tokens": 29475004.0, "step": 13620 }, { "entropy": 6.55041766166687, "epoch": 1.4580234362459201, "grad_norm": 1.8984375, "learning_rate": 0.0004796082478868146, "loss": 6.404, "mean_token_accuracy": 0.12528412342071532, "num_tokens": 29485921.0, "step": 13625 }, { "entropy": 6.542591524124146, "epoch": 1.458558510353684, "grad_norm": 1.546875, "learning_rate": 0.00047959234030482185, "loss": 6.2517, "mean_token_accuracy": 0.14472676813602448, "num_tokens": 29495729.0, "step": 13630 }, { "entropy": 6.577525520324707, "epoch": 1.4590935844614479, "grad_norm": 1.546875, "learning_rate": 0.0004795764268152538, "loss": 6.3172, "mean_token_accuracy": 0.12774155661463737, "num_tokens": 29506051.0, "step": 13635 }, { "entropy": 6.524970769882202, "epoch": 1.4596286585692118, "grad_norm": 1.4140625, "learning_rate": 0.0004795605074185704, "loss": 6.2786, "mean_token_accuracy": 0.13325700610876084, "num_tokens": 29516234.0, "step": 13640 }, { "entropy": 6.549506521224975, "epoch": 1.4601637326769756, "grad_norm": 1.828125, "learning_rate": 0.00047954458211523095, "loss": 6.2701, "mean_token_accuracy": 0.1349295660853386, "num_tokens": 29527649.0, "step": 13645 }, { "entropy": 6.586029481887818, "epoch": 1.4606988067847397, "grad_norm": 2.3125, "learning_rate": 0.00047952865090569545, "loss": 6.3473, "mean_token_accuracy": 0.12580158188939095, "num_tokens": 29539150.0, "step": 13650 }, { "entropy": 6.520464706420898, "epoch": 1.4612338808925036, "grad_norm": 1.3359375, "learning_rate": 0.00047951271379042393, "loss": 6.2065, "mean_token_accuracy": 0.13591403812170028, "num_tokens": 29550058.0, "step": 13655 }, { "entropy": 6.423491668701172, "epoch": 1.4617689550002675, "grad_norm": 1.546875, "learning_rate": 0.0004794967707698765, "loss": 6.2296, "mean_token_accuracy": 0.1430532529950142, "num_tokens": 29560377.0, "step": 13660 }, { "entropy": 6.435001087188721, "epoch": 1.4623040291080316, "grad_norm": 1.421875, "learning_rate": 0.0004794808218445136, "loss": 6.164, "mean_token_accuracy": 0.14599157869815826, "num_tokens": 29571378.0, "step": 13665 }, { "entropy": 6.5370715141296385, "epoch": 1.4628391032157955, "grad_norm": 2.125, "learning_rate": 0.00047946486701479576, "loss": 6.3144, "mean_token_accuracy": 0.13308701068162918, "num_tokens": 29582187.0, "step": 13670 }, { "entropy": 6.541687440872193, "epoch": 1.4633741773235593, "grad_norm": 1.734375, "learning_rate": 0.0004794489062811835, "loss": 6.2925, "mean_token_accuracy": 0.12842457219958306, "num_tokens": 29592982.0, "step": 13675 }, { "entropy": 6.587422132492065, "epoch": 1.4639092514313232, "grad_norm": 2.09375, "learning_rate": 0.0004794329396441378, "loss": 6.2746, "mean_token_accuracy": 0.13194804191589354, "num_tokens": 29603639.0, "step": 13680 }, { "entropy": 6.5431897163391115, "epoch": 1.464444325539087, "grad_norm": 1.78125, "learning_rate": 0.00047941696710411975, "loss": 6.2195, "mean_token_accuracy": 0.14435758888721467, "num_tokens": 29615103.0, "step": 13685 }, { "entropy": 6.532386589050293, "epoch": 1.4649793996468512, "grad_norm": 1.8203125, "learning_rate": 0.0004794009886615904, "loss": 6.2905, "mean_token_accuracy": 0.13263922408223153, "num_tokens": 29626184.0, "step": 13690 }, { "entropy": 6.555911445617676, "epoch": 1.465514473754615, "grad_norm": 1.6171875, "learning_rate": 0.00047938500431701135, "loss": 6.2819, "mean_token_accuracy": 0.14328787550330163, "num_tokens": 29637615.0, "step": 13695 }, { "entropy": 6.551273775100708, "epoch": 1.466049547862379, "grad_norm": 2.046875, "learning_rate": 0.000479369014070844, "loss": 6.3061, "mean_token_accuracy": 0.13311365023255348, "num_tokens": 29648648.0, "step": 13700 }, { "entropy": 6.516896438598633, "epoch": 1.4665846219701428, "grad_norm": 1.640625, "learning_rate": 0.00047935301792355003, "loss": 6.2647, "mean_token_accuracy": 0.13810425996780396, "num_tokens": 29660542.0, "step": 13705 }, { "entropy": 6.551743841171264, "epoch": 1.4671196960779067, "grad_norm": 1.4375, "learning_rate": 0.0004793370158755914, "loss": 6.3163, "mean_token_accuracy": 0.13373398035764694, "num_tokens": 29670342.0, "step": 13710 }, { "entropy": 6.513361167907715, "epoch": 1.4676547701856708, "grad_norm": 1.765625, "learning_rate": 0.00047932100792743014, "loss": 6.2694, "mean_token_accuracy": 0.13930255994200708, "num_tokens": 29681191.0, "step": 13715 }, { "entropy": 6.534385299682617, "epoch": 1.4681898442934347, "grad_norm": 1.6171875, "learning_rate": 0.00047930499407952855, "loss": 6.2056, "mean_token_accuracy": 0.14330771416425706, "num_tokens": 29691299.0, "step": 13720 }, { "entropy": 6.518677663803101, "epoch": 1.4687249184011986, "grad_norm": 2.453125, "learning_rate": 0.00047928897433234893, "loss": 6.2598, "mean_token_accuracy": 0.1339192159473896, "num_tokens": 29702125.0, "step": 13725 }, { "entropy": 6.5021195888519285, "epoch": 1.4692599925089624, "grad_norm": 2.0625, "learning_rate": 0.0004792729486863539, "loss": 6.2881, "mean_token_accuracy": 0.1327348917722702, "num_tokens": 29712679.0, "step": 13730 }, { "entropy": 6.5093645572662355, "epoch": 1.4697950666167263, "grad_norm": 1.453125, "learning_rate": 0.0004792569171420061, "loss": 6.2286, "mean_token_accuracy": 0.13891081213951112, "num_tokens": 29723833.0, "step": 13735 }, { "entropy": 6.586244106292725, "epoch": 1.4703301407244904, "grad_norm": 2.046875, "learning_rate": 0.0004792408796997687, "loss": 6.3336, "mean_token_accuracy": 0.13556601256132125, "num_tokens": 29734646.0, "step": 13740 }, { "entropy": 6.5740937232971195, "epoch": 1.4708652148322543, "grad_norm": 1.640625, "learning_rate": 0.0004792248363601044, "loss": 6.2924, "mean_token_accuracy": 0.1350928321480751, "num_tokens": 29745129.0, "step": 13745 }, { "entropy": 6.5654994487762455, "epoch": 1.4714002889400182, "grad_norm": 1.4921875, "learning_rate": 0.0004792087871234767, "loss": 6.2918, "mean_token_accuracy": 0.12818465679883956, "num_tokens": 29756308.0, "step": 13750 }, { "entropy": 6.4984032154083256, "epoch": 1.471935363047782, "grad_norm": 2.296875, "learning_rate": 0.000479192731990349, "loss": 6.2943, "mean_token_accuracy": 0.13055193796753883, "num_tokens": 29767835.0, "step": 13755 }, { "entropy": 6.546389532089234, "epoch": 1.472470437155546, "grad_norm": 1.65625, "learning_rate": 0.0004791766709611849, "loss": 6.3208, "mean_token_accuracy": 0.13507338240742683, "num_tokens": 29778776.0, "step": 13760 }, { "entropy": 6.670673084259033, "epoch": 1.47300551126331, "grad_norm": 1.53125, "learning_rate": 0.000479160604036448, "loss": 6.3501, "mean_token_accuracy": 0.12552779018878937, "num_tokens": 29788800.0, "step": 13765 }, { "entropy": 6.547731256484985, "epoch": 1.473540585371074, "grad_norm": 1.4921875, "learning_rate": 0.0004791445312166025, "loss": 6.2572, "mean_token_accuracy": 0.14021070525050164, "num_tokens": 29799375.0, "step": 13770 }, { "entropy": 6.555331897735596, "epoch": 1.4740756594788378, "grad_norm": 1.3515625, "learning_rate": 0.0004791284525021122, "loss": 6.3837, "mean_token_accuracy": 0.124832434207201, "num_tokens": 29811267.0, "step": 13775 }, { "entropy": 6.5536736965179445, "epoch": 1.4746107335866017, "grad_norm": 1.625, "learning_rate": 0.0004791123678934416, "loss": 6.3248, "mean_token_accuracy": 0.13412302434444429, "num_tokens": 29821616.0, "step": 13780 }, { "entropy": 6.535737466812134, "epoch": 1.4751458076943655, "grad_norm": 1.6953125, "learning_rate": 0.0004790962773910551, "loss": 6.2842, "mean_token_accuracy": 0.13453632444143296, "num_tokens": 29832233.0, "step": 13785 }, { "entropy": 6.596752595901489, "epoch": 1.4756808818021296, "grad_norm": 1.65625, "learning_rate": 0.00047908018099541717, "loss": 6.2757, "mean_token_accuracy": 0.13443198055028915, "num_tokens": 29843465.0, "step": 13790 }, { "entropy": 6.515512847900391, "epoch": 1.4762159559098935, "grad_norm": 1.296875, "learning_rate": 0.0004790640787069927, "loss": 6.1577, "mean_token_accuracy": 0.1415461152791977, "num_tokens": 29854123.0, "step": 13795 }, { "entropy": 6.578099298477173, "epoch": 1.4767510300176574, "grad_norm": 2.671875, "learning_rate": 0.0004790479705262467, "loss": 6.3739, "mean_token_accuracy": 0.12471452876925468, "num_tokens": 29864831.0, "step": 13800 }, { "entropy": 6.5273661613464355, "epoch": 1.4772861041254215, "grad_norm": 1.546875, "learning_rate": 0.0004790318564536441, "loss": 6.2325, "mean_token_accuracy": 0.1310821369290352, "num_tokens": 29876273.0, "step": 13805 }, { "entropy": 6.530851984024048, "epoch": 1.4778211782331854, "grad_norm": 1.7578125, "learning_rate": 0.00047901573648965047, "loss": 6.2287, "mean_token_accuracy": 0.1352597825229168, "num_tokens": 29886560.0, "step": 13810 }, { "entropy": 6.513718509674073, "epoch": 1.4783562523409493, "grad_norm": 1.6953125, "learning_rate": 0.000478999610634731, "loss": 6.2266, "mean_token_accuracy": 0.13684219866991043, "num_tokens": 29896916.0, "step": 13815 }, { "entropy": 6.504454469680786, "epoch": 1.4788913264487131, "grad_norm": 1.53125, "learning_rate": 0.0004789834788893515, "loss": 6.3091, "mean_token_accuracy": 0.1282836228609085, "num_tokens": 29907288.0, "step": 13820 }, { "entropy": 6.495414209365845, "epoch": 1.479426400556477, "grad_norm": 1.53125, "learning_rate": 0.0004789673412539777, "loss": 6.2345, "mean_token_accuracy": 0.13465062901377678, "num_tokens": 29918194.0, "step": 13825 }, { "entropy": 6.546362638473511, "epoch": 1.479961474664241, "grad_norm": 1.390625, "learning_rate": 0.00047895119772907566, "loss": 6.2754, "mean_token_accuracy": 0.13627072498202325, "num_tokens": 29928521.0, "step": 13830 }, { "entropy": 6.507249212265014, "epoch": 1.480496548772005, "grad_norm": 2.25, "learning_rate": 0.0004789350483151113, "loss": 6.2223, "mean_token_accuracy": 0.1304092951118946, "num_tokens": 29938885.0, "step": 13835 }, { "entropy": 6.5725428581237795, "epoch": 1.4810316228797689, "grad_norm": 1.8046875, "learning_rate": 0.0004789188930125512, "loss": 6.3045, "mean_token_accuracy": 0.14193991646170617, "num_tokens": 29948921.0, "step": 13840 }, { "entropy": 6.509477281570435, "epoch": 1.4815666969875327, "grad_norm": 1.6640625, "learning_rate": 0.0004789027318218616, "loss": 6.206, "mean_token_accuracy": 0.1386758007109165, "num_tokens": 29959633.0, "step": 13845 }, { "entropy": 6.521372222900391, "epoch": 1.4821017710952966, "grad_norm": 1.6953125, "learning_rate": 0.0004788865647435093, "loss": 6.2541, "mean_token_accuracy": 0.12845197916030884, "num_tokens": 29970639.0, "step": 13850 }, { "entropy": 6.569345569610595, "epoch": 1.4826368452030607, "grad_norm": 1.578125, "learning_rate": 0.0004788703917779612, "loss": 6.3545, "mean_token_accuracy": 0.13183851465582846, "num_tokens": 29981752.0, "step": 13855 }, { "entropy": 6.550051879882813, "epoch": 1.4831719193108246, "grad_norm": 1.8125, "learning_rate": 0.0004788542129256841, "loss": 6.1886, "mean_token_accuracy": 0.13968370780348777, "num_tokens": 29991037.0, "step": 13860 }, { "entropy": 6.495801591873169, "epoch": 1.4837069934185885, "grad_norm": 1.515625, "learning_rate": 0.00047883802818714526, "loss": 6.3029, "mean_token_accuracy": 0.12434751689434051, "num_tokens": 30001980.0, "step": 13865 }, { "entropy": 6.548546266555786, "epoch": 1.4842420675263523, "grad_norm": 1.78125, "learning_rate": 0.000478821837562812, "loss": 6.3013, "mean_token_accuracy": 0.1336070977151394, "num_tokens": 30013377.0, "step": 13870 }, { "entropy": 6.556598281860351, "epoch": 1.4847771416341162, "grad_norm": 1.6171875, "learning_rate": 0.0004788056410531518, "loss": 6.3398, "mean_token_accuracy": 0.1366582117974758, "num_tokens": 30023909.0, "step": 13875 }, { "entropy": 6.483535861968994, "epoch": 1.4853122157418803, "grad_norm": 1.4765625, "learning_rate": 0.0004787894386586324, "loss": 6.2288, "mean_token_accuracy": 0.13616093918681144, "num_tokens": 30034069.0, "step": 13880 }, { "entropy": 6.478453683853149, "epoch": 1.4858472898496442, "grad_norm": 1.421875, "learning_rate": 0.00047877323037972153, "loss": 6.2289, "mean_token_accuracy": 0.14070839509367944, "num_tokens": 30043940.0, "step": 13885 }, { "entropy": 6.490971994400025, "epoch": 1.486382363957408, "grad_norm": 3.296875, "learning_rate": 0.0004787570162168874, "loss": 6.2126, "mean_token_accuracy": 0.13903133794665337, "num_tokens": 30054985.0, "step": 13890 }, { "entropy": 6.538230991363525, "epoch": 1.486917438065172, "grad_norm": 2.125, "learning_rate": 0.00047874079617059783, "loss": 6.2364, "mean_token_accuracy": 0.13630077689886094, "num_tokens": 30065675.0, "step": 13895 }, { "entropy": 6.529196262359619, "epoch": 1.4874525121729358, "grad_norm": 2.9375, "learning_rate": 0.0004787245702413216, "loss": 6.2044, "mean_token_accuracy": 0.13694037944078447, "num_tokens": 30075305.0, "step": 13900 }, { "entropy": 6.554997396469116, "epoch": 1.4879875862807, "grad_norm": 1.9453125, "learning_rate": 0.00047870833842952697, "loss": 6.3097, "mean_token_accuracy": 0.1343739703297615, "num_tokens": 30087309.0, "step": 13905 }, { "entropy": 6.530051851272583, "epoch": 1.4885226603884638, "grad_norm": 1.8125, "learning_rate": 0.0004786921007356827, "loss": 6.2222, "mean_token_accuracy": 0.13209329545497894, "num_tokens": 30097262.0, "step": 13910 }, { "entropy": 6.552338790893555, "epoch": 1.4890577344962277, "grad_norm": 1.6484375, "learning_rate": 0.00047867585716025767, "loss": 6.3252, "mean_token_accuracy": 0.13659584522247314, "num_tokens": 30107067.0, "step": 13915 }, { "entropy": 6.586587572097779, "epoch": 1.4895928086039918, "grad_norm": 2.3125, "learning_rate": 0.0004786596077037209, "loss": 6.3192, "mean_token_accuracy": 0.13181559294462203, "num_tokens": 30117115.0, "step": 13920 }, { "entropy": 6.603874158859253, "epoch": 1.4901278827117554, "grad_norm": 1.6328125, "learning_rate": 0.00047864335236654144, "loss": 6.265, "mean_token_accuracy": 0.13400094211101532, "num_tokens": 30127202.0, "step": 13925 }, { "entropy": 6.465754890441895, "epoch": 1.4906629568195195, "grad_norm": 1.421875, "learning_rate": 0.0004786270911491889, "loss": 6.2487, "mean_token_accuracy": 0.1353141985833645, "num_tokens": 30138608.0, "step": 13930 }, { "entropy": 6.546110582351685, "epoch": 1.4911980309272834, "grad_norm": 1.859375, "learning_rate": 0.0004786108240521327, "loss": 6.3064, "mean_token_accuracy": 0.137214232981205, "num_tokens": 30148500.0, "step": 13935 }, { "entropy": 6.447632646560669, "epoch": 1.4917331050350473, "grad_norm": 1.578125, "learning_rate": 0.00047859455107584256, "loss": 6.2103, "mean_token_accuracy": 0.13803261518478394, "num_tokens": 30159062.0, "step": 13940 }, { "entropy": 6.514106750488281, "epoch": 1.4922681791428114, "grad_norm": 2.3125, "learning_rate": 0.00047857827222078835, "loss": 6.2742, "mean_token_accuracy": 0.1323826126754284, "num_tokens": 30170468.0, "step": 13945 }, { "entropy": 6.460741758346558, "epoch": 1.4928032532505753, "grad_norm": 1.8671875, "learning_rate": 0.0004785619874874402, "loss": 6.1446, "mean_token_accuracy": 0.14026360735297203, "num_tokens": 30180944.0, "step": 13950 }, { "entropy": 6.476769304275512, "epoch": 1.4933383273583392, "grad_norm": 1.640625, "learning_rate": 0.0004785456968762682, "loss": 6.1668, "mean_token_accuracy": 0.14123549163341523, "num_tokens": 30191614.0, "step": 13955 }, { "entropy": 6.498686170578003, "epoch": 1.493873401466103, "grad_norm": 1.6328125, "learning_rate": 0.00047852940038774276, "loss": 6.2076, "mean_token_accuracy": 0.13988643661141395, "num_tokens": 30202035.0, "step": 13960 }, { "entropy": 6.434373903274536, "epoch": 1.494408475573867, "grad_norm": 1.96875, "learning_rate": 0.00047851309802233457, "loss": 6.2865, "mean_token_accuracy": 0.13843541741371154, "num_tokens": 30213205.0, "step": 13965 }, { "entropy": 6.578490686416626, "epoch": 1.494943549681631, "grad_norm": 1.9453125, "learning_rate": 0.0004784967897805143, "loss": 6.2942, "mean_token_accuracy": 0.13502900078892707, "num_tokens": 30223971.0, "step": 13970 }, { "entropy": 6.575396299362183, "epoch": 1.495478623789395, "grad_norm": 1.4609375, "learning_rate": 0.0004784804756627528, "loss": 6.2904, "mean_token_accuracy": 0.1325635604560375, "num_tokens": 30235346.0, "step": 13975 }, { "entropy": 6.551068210601807, "epoch": 1.4960136978971588, "grad_norm": 1.5625, "learning_rate": 0.00047846415566952106, "loss": 6.2403, "mean_token_accuracy": 0.13519833534955977, "num_tokens": 30246033.0, "step": 13980 }, { "entropy": 6.463932752609253, "epoch": 1.4965487720049226, "grad_norm": 1.75, "learning_rate": 0.00047844782980129057, "loss": 6.2976, "mean_token_accuracy": 0.13278683871030808, "num_tokens": 30258208.0, "step": 13985 }, { "entropy": 6.499045562744141, "epoch": 1.4970838461126865, "grad_norm": 2.328125, "learning_rate": 0.00047843149805853254, "loss": 6.3017, "mean_token_accuracy": 0.13239005208015442, "num_tokens": 30268824.0, "step": 13990 }, { "entropy": 6.578220367431641, "epoch": 1.4976189202204506, "grad_norm": 2.0, "learning_rate": 0.0004784151604417185, "loss": 6.3454, "mean_token_accuracy": 0.12390814051032066, "num_tokens": 30280078.0, "step": 13995 }, { "entropy": 6.530854082107544, "epoch": 1.4981539943282145, "grad_norm": 1.671875, "learning_rate": 0.00047839881695132034, "loss": 6.2298, "mean_token_accuracy": 0.142520771920681, "num_tokens": 30290939.0, "step": 14000 }, { "entropy": 6.495736074447632, "epoch": 1.4986890684359784, "grad_norm": 1.7265625, "learning_rate": 0.00047838246758780996, "loss": 6.2733, "mean_token_accuracy": 0.13784620389342309, "num_tokens": 30301198.0, "step": 14005 }, { "entropy": 6.5063807487487795, "epoch": 1.4992241425437423, "grad_norm": 2.546875, "learning_rate": 0.0004783661123516593, "loss": 6.2377, "mean_token_accuracy": 0.13562998846173285, "num_tokens": 30312021.0, "step": 14010 }, { "entropy": 6.539398670196533, "epoch": 1.4997592166515061, "grad_norm": 1.75, "learning_rate": 0.0004783497512433408, "loss": 6.2485, "mean_token_accuracy": 0.13483910784125328, "num_tokens": 30323335.0, "step": 14015 }, { "entropy": 6.546143436431885, "epoch": 1.5002942907592702, "grad_norm": 2.15625, "learning_rate": 0.0004783333842633268, "loss": 6.2819, "mean_token_accuracy": 0.14089713245630264, "num_tokens": 30334389.0, "step": 14020 }, { "entropy": 6.457803583145141, "epoch": 1.500829364867034, "grad_norm": 1.921875, "learning_rate": 0.00047831701141208994, "loss": 6.233, "mean_token_accuracy": 0.13121172934770584, "num_tokens": 30345407.0, "step": 14025 }, { "entropy": 6.502495861053466, "epoch": 1.501364438974798, "grad_norm": 1.59375, "learning_rate": 0.00047830063269010286, "loss": 6.2574, "mean_token_accuracy": 0.1314643941819668, "num_tokens": 30356718.0, "step": 14030 }, { "entropy": 6.511676168441772, "epoch": 1.501899513082562, "grad_norm": 1.625, "learning_rate": 0.00047828424809783865, "loss": 6.2161, "mean_token_accuracy": 0.13534914702177048, "num_tokens": 30367617.0, "step": 14035 }, { "entropy": 6.525033664703369, "epoch": 1.5024345871903257, "grad_norm": 1.5625, "learning_rate": 0.0004782678576357703, "loss": 6.2518, "mean_token_accuracy": 0.1353394605219364, "num_tokens": 30377923.0, "step": 14040 }, { "entropy": 6.498504686355591, "epoch": 1.5029696612980898, "grad_norm": 2.4375, "learning_rate": 0.0004782514613043711, "loss": 6.2498, "mean_token_accuracy": 0.13915505409240722, "num_tokens": 30388719.0, "step": 14045 }, { "entropy": 6.5068888664245605, "epoch": 1.5035047354058537, "grad_norm": 2.4375, "learning_rate": 0.00047823505910411465, "loss": 6.1937, "mean_token_accuracy": 0.1380567654967308, "num_tokens": 30400191.0, "step": 14050 }, { "entropy": 6.531849670410156, "epoch": 1.5040398095136176, "grad_norm": 1.5546875, "learning_rate": 0.00047821865103547437, "loss": 6.2835, "mean_token_accuracy": 0.1362235277891159, "num_tokens": 30410267.0, "step": 14055 }, { "entropy": 6.547566223144531, "epoch": 1.5045748836213817, "grad_norm": 2.0625, "learning_rate": 0.000478202237098924, "loss": 6.2937, "mean_token_accuracy": 0.131100395321846, "num_tokens": 30420852.0, "step": 14060 }, { "entropy": 6.565202426910401, "epoch": 1.5051099577291454, "grad_norm": 2.421875, "learning_rate": 0.0004781858172949376, "loss": 6.3362, "mean_token_accuracy": 0.1344304248690605, "num_tokens": 30432214.0, "step": 14065 }, { "entropy": 6.567050838470459, "epoch": 1.5056450318369095, "grad_norm": 1.984375, "learning_rate": 0.0004781693916239894, "loss": 6.3408, "mean_token_accuracy": 0.12420830205082893, "num_tokens": 30443919.0, "step": 14070 }, { "entropy": 6.571396207809448, "epoch": 1.5061801059446733, "grad_norm": 2.734375, "learning_rate": 0.00047815296008655347, "loss": 6.3968, "mean_token_accuracy": 0.1250197820365429, "num_tokens": 30453930.0, "step": 14075 }, { "entropy": 6.539173603057861, "epoch": 1.5067151800524372, "grad_norm": 2.46875, "learning_rate": 0.00047813652268310436, "loss": 6.2897, "mean_token_accuracy": 0.12643647491931914, "num_tokens": 30464612.0, "step": 14080 }, { "entropy": 6.526119232177734, "epoch": 1.5072502541602013, "grad_norm": 1.8359375, "learning_rate": 0.00047812007941411673, "loss": 6.241, "mean_token_accuracy": 0.13565285205841066, "num_tokens": 30474819.0, "step": 14085 }, { "entropy": 6.497172927856445, "epoch": 1.507785328267965, "grad_norm": 1.5234375, "learning_rate": 0.00047810363028006535, "loss": 6.224, "mean_token_accuracy": 0.14370110183954238, "num_tokens": 30485481.0, "step": 14090 }, { "entropy": 6.500015735626221, "epoch": 1.508320402375729, "grad_norm": 1.671875, "learning_rate": 0.0004780871752814252, "loss": 6.2542, "mean_token_accuracy": 0.1386760003864765, "num_tokens": 30496321.0, "step": 14095 }, { "entropy": 6.493804264068603, "epoch": 1.508855476483493, "grad_norm": 1.6640625, "learning_rate": 0.0004780707144186714, "loss": 6.3542, "mean_token_accuracy": 0.13237425908446313, "num_tokens": 30507578.0, "step": 14100 }, { "entropy": 6.619511842727661, "epoch": 1.5093905505912568, "grad_norm": 1.5078125, "learning_rate": 0.00047805424769227923, "loss": 6.2831, "mean_token_accuracy": 0.13486289009451866, "num_tokens": 30518328.0, "step": 14105 }, { "entropy": 6.507578802108765, "epoch": 1.509925624699021, "grad_norm": 7.46875, "learning_rate": 0.00047803777510272425, "loss": 6.2604, "mean_token_accuracy": 0.1352337084710598, "num_tokens": 30528555.0, "step": 14110 }, { "entropy": 6.45980315208435, "epoch": 1.5104606988067846, "grad_norm": 1.515625, "learning_rate": 0.000478021296650482, "loss": 6.1892, "mean_token_accuracy": 0.13908951058983804, "num_tokens": 30540217.0, "step": 14115 }, { "entropy": 6.581186199188233, "epoch": 1.5109957729145487, "grad_norm": 1.6875, "learning_rate": 0.0004780048123360283, "loss": 6.3195, "mean_token_accuracy": 0.13534327372908592, "num_tokens": 30550937.0, "step": 14120 }, { "entropy": 6.610339212417602, "epoch": 1.5115308470223126, "grad_norm": 1.59375, "learning_rate": 0.00047798832215983916, "loss": 6.2955, "mean_token_accuracy": 0.13681161478161813, "num_tokens": 30562248.0, "step": 14125 }, { "entropy": 6.576951932907105, "epoch": 1.5120659211300764, "grad_norm": 2.203125, "learning_rate": 0.0004779718261223908, "loss": 6.3061, "mean_token_accuracy": 0.13611859753727912, "num_tokens": 30573362.0, "step": 14130 }, { "entropy": 6.5235360622406, "epoch": 1.5126009952378405, "grad_norm": 1.4140625, "learning_rate": 0.00047795532422415947, "loss": 6.2861, "mean_token_accuracy": 0.13528222739696502, "num_tokens": 30584052.0, "step": 14135 }, { "entropy": 6.521787309646607, "epoch": 1.5131360693456044, "grad_norm": 1.6328125, "learning_rate": 0.0004779388164656217, "loss": 6.3147, "mean_token_accuracy": 0.12935080379247665, "num_tokens": 30594630.0, "step": 14140 }, { "entropy": 6.546995544433594, "epoch": 1.5136711434533683, "grad_norm": 2.4375, "learning_rate": 0.00047792230284725415, "loss": 6.2667, "mean_token_accuracy": 0.13568148985505105, "num_tokens": 30605625.0, "step": 14145 }, { "entropy": 6.531518650054932, "epoch": 1.5142062175611322, "grad_norm": 1.765625, "learning_rate": 0.00047790578336953356, "loss": 6.2531, "mean_token_accuracy": 0.13517610654234885, "num_tokens": 30616520.0, "step": 14150 }, { "entropy": 6.540752983093261, "epoch": 1.514741291668896, "grad_norm": 1.921875, "learning_rate": 0.000477889258032937, "loss": 6.2306, "mean_token_accuracy": 0.14312789514660834, "num_tokens": 30627372.0, "step": 14155 }, { "entropy": 6.500818586349487, "epoch": 1.5152763657766601, "grad_norm": 1.5703125, "learning_rate": 0.00047787272683794157, "loss": 6.2189, "mean_token_accuracy": 0.14515245854854583, "num_tokens": 30636974.0, "step": 14160 }, { "entropy": 6.509118890762329, "epoch": 1.515811439884424, "grad_norm": 1.6796875, "learning_rate": 0.0004778561897850247, "loss": 6.2895, "mean_token_accuracy": 0.13736924827098845, "num_tokens": 30648202.0, "step": 14165 }, { "entropy": 6.517179250717163, "epoch": 1.516346513992188, "grad_norm": 1.90625, "learning_rate": 0.00047783964687466384, "loss": 6.2843, "mean_token_accuracy": 0.1314311482012272, "num_tokens": 30657981.0, "step": 14170 }, { "entropy": 6.537102222442627, "epoch": 1.516881588099952, "grad_norm": 1.65625, "learning_rate": 0.00047782309810733676, "loss": 6.2882, "mean_token_accuracy": 0.12622129172086716, "num_tokens": 30668496.0, "step": 14175 }, { "entropy": 6.487250185012817, "epoch": 1.5174166622077156, "grad_norm": 3.515625, "learning_rate": 0.00047780654348352115, "loss": 6.1805, "mean_token_accuracy": 0.1400587297976017, "num_tokens": 30678868.0, "step": 14180 }, { "entropy": 6.53211088180542, "epoch": 1.5179517363154797, "grad_norm": 1.7421875, "learning_rate": 0.00047778998300369516, "loss": 6.3361, "mean_token_accuracy": 0.1377688691020012, "num_tokens": 30690066.0, "step": 14185 }, { "entropy": 6.4703638553619385, "epoch": 1.5184868104232436, "grad_norm": 3.359375, "learning_rate": 0.0004777734166683368, "loss": 6.1984, "mean_token_accuracy": 0.14053755551576613, "num_tokens": 30700624.0, "step": 14190 }, { "entropy": 6.486501932144165, "epoch": 1.5190218845310075, "grad_norm": 1.5546875, "learning_rate": 0.00047775684447792457, "loss": 6.2265, "mean_token_accuracy": 0.13751474767923355, "num_tokens": 30711183.0, "step": 14195 }, { "entropy": 6.509814453125, "epoch": 1.5195569586387716, "grad_norm": 1.5078125, "learning_rate": 0.000477740266432937, "loss": 6.2449, "mean_token_accuracy": 0.14190192744135857, "num_tokens": 30721446.0, "step": 14200 }, { "entropy": 6.549847173690796, "epoch": 1.5200920327465353, "grad_norm": 2.5625, "learning_rate": 0.00047772368253385267, "loss": 6.2907, "mean_token_accuracy": 0.12940879687666892, "num_tokens": 30731901.0, "step": 14205 }, { "entropy": 6.535141515731811, "epoch": 1.5206271068542994, "grad_norm": 1.6171875, "learning_rate": 0.0004777070927811505, "loss": 6.2551, "mean_token_accuracy": 0.13085372596979142, "num_tokens": 30741701.0, "step": 14210 }, { "entropy": 6.526335382461548, "epoch": 1.5211621809620632, "grad_norm": 2.015625, "learning_rate": 0.00047769049717530956, "loss": 6.2713, "mean_token_accuracy": 0.13423371836543083, "num_tokens": 30751594.0, "step": 14215 }, { "entropy": 6.504735708236694, "epoch": 1.5216972550698271, "grad_norm": 1.6875, "learning_rate": 0.00047767389571680896, "loss": 6.3522, "mean_token_accuracy": 0.126288815587759, "num_tokens": 30764418.0, "step": 14220 }, { "entropy": 6.558633089065552, "epoch": 1.5222323291775912, "grad_norm": 1.484375, "learning_rate": 0.0004776572884061281, "loss": 6.27, "mean_token_accuracy": 0.13761670440435408, "num_tokens": 30773976.0, "step": 14225 }, { "entropy": 6.582456445693969, "epoch": 1.5227674032853549, "grad_norm": 1.640625, "learning_rate": 0.0004776406752437465, "loss": 6.294, "mean_token_accuracy": 0.13682678043842317, "num_tokens": 30784210.0, "step": 14230 }, { "entropy": 6.518918085098266, "epoch": 1.523302477393119, "grad_norm": 1.8359375, "learning_rate": 0.0004776240562301438, "loss": 6.3403, "mean_token_accuracy": 0.12842216491699218, "num_tokens": 30794322.0, "step": 14235 }, { "entropy": 6.564871597290039, "epoch": 1.5238375515008828, "grad_norm": 1.703125, "learning_rate": 0.0004776074313658001, "loss": 6.2875, "mean_token_accuracy": 0.14118874147534372, "num_tokens": 30805264.0, "step": 14240 }, { "entropy": 6.4882111072540285, "epoch": 1.5243726256086467, "grad_norm": 1.625, "learning_rate": 0.0004775908006511952, "loss": 6.2633, "mean_token_accuracy": 0.1359029680490494, "num_tokens": 30815909.0, "step": 14245 }, { "entropy": 6.599324750900268, "epoch": 1.5249076997164108, "grad_norm": 1.6328125, "learning_rate": 0.0004775741640868095, "loss": 6.2546, "mean_token_accuracy": 0.13517858684062958, "num_tokens": 30826867.0, "step": 14250 }, { "entropy": 6.58244743347168, "epoch": 1.5254427738241747, "grad_norm": 1.4375, "learning_rate": 0.00047755752167312314, "loss": 6.2282, "mean_token_accuracy": 0.13037005066871643, "num_tokens": 30837696.0, "step": 14255 }, { "entropy": 6.473442888259887, "epoch": 1.5259778479319386, "grad_norm": 1.84375, "learning_rate": 0.0004775408734106169, "loss": 6.2567, "mean_token_accuracy": 0.13493726029992104, "num_tokens": 30848155.0, "step": 14260 }, { "entropy": 6.436830806732178, "epoch": 1.5265129220397025, "grad_norm": 1.5625, "learning_rate": 0.00047752421929977143, "loss": 6.1409, "mean_token_accuracy": 0.14483771175146104, "num_tokens": 30857804.0, "step": 14265 }, { "entropy": 6.536058521270752, "epoch": 1.5270479961474663, "grad_norm": 1.4453125, "learning_rate": 0.0004775075593410675, "loss": 6.2746, "mean_token_accuracy": 0.13746241480112076, "num_tokens": 30867290.0, "step": 14270 }, { "entropy": 6.5432713508605955, "epoch": 1.5275830702552304, "grad_norm": 1.265625, "learning_rate": 0.00047749089353498625, "loss": 6.3467, "mean_token_accuracy": 0.13378921225667, "num_tokens": 30877634.0, "step": 14275 }, { "entropy": 6.527502536773682, "epoch": 1.5281181443629943, "grad_norm": 1.609375, "learning_rate": 0.000477474221882009, "loss": 6.3047, "mean_token_accuracy": 0.13290925249457358, "num_tokens": 30889176.0, "step": 14280 }, { "entropy": 6.57243766784668, "epoch": 1.5286532184707582, "grad_norm": 1.84375, "learning_rate": 0.0004774575443826169, "loss": 6.2157, "mean_token_accuracy": 0.13979230374097823, "num_tokens": 30899516.0, "step": 14285 }, { "entropy": 6.54964919090271, "epoch": 1.5291882925785223, "grad_norm": 1.8359375, "learning_rate": 0.0004774408610372918, "loss": 6.3118, "mean_token_accuracy": 0.13416342735290526, "num_tokens": 30910155.0, "step": 14290 }, { "entropy": 6.551747894287109, "epoch": 1.529723366686286, "grad_norm": 1.7421875, "learning_rate": 0.0004774241718465152, "loss": 6.3294, "mean_token_accuracy": 0.1300183728337288, "num_tokens": 30921486.0, "step": 14295 }, { "entropy": 6.567112255096435, "epoch": 1.53025844079405, "grad_norm": 3.484375, "learning_rate": 0.0004774074768107691, "loss": 6.2681, "mean_token_accuracy": 0.13543465435504914, "num_tokens": 30932361.0, "step": 14300 }, { "entropy": 6.5201342582702635, "epoch": 1.530793514901814, "grad_norm": 1.625, "learning_rate": 0.00047739077593053554, "loss": 6.2528, "mean_token_accuracy": 0.13535121381282805, "num_tokens": 30943033.0, "step": 14305 }, { "entropy": 6.5211255073547365, "epoch": 1.5313285890095778, "grad_norm": 2.078125, "learning_rate": 0.00047737406920629675, "loss": 6.2404, "mean_token_accuracy": 0.13891438469290734, "num_tokens": 30953094.0, "step": 14310 }, { "entropy": 6.535080623626709, "epoch": 1.531863663117342, "grad_norm": 1.9765625, "learning_rate": 0.00047735735663853514, "loss": 6.2691, "mean_token_accuracy": 0.13467931300401687, "num_tokens": 30964604.0, "step": 14315 }, { "entropy": 6.569497537612915, "epoch": 1.5323987372251056, "grad_norm": 1.828125, "learning_rate": 0.0004773406382277334, "loss": 6.3294, "mean_token_accuracy": 0.13067164942622184, "num_tokens": 30975681.0, "step": 14320 }, { "entropy": 6.575937509536743, "epoch": 1.5329338113328697, "grad_norm": 1.75, "learning_rate": 0.0004773239139743741, "loss": 6.2984, "mean_token_accuracy": 0.12989215925335884, "num_tokens": 30986319.0, "step": 14325 }, { "entropy": 6.52880539894104, "epoch": 1.5334688854406335, "grad_norm": 1.359375, "learning_rate": 0.0004773071838789402, "loss": 6.2534, "mean_token_accuracy": 0.13588482588529588, "num_tokens": 30997077.0, "step": 14330 }, { "entropy": 6.48135142326355, "epoch": 1.5340039595483974, "grad_norm": 1.59375, "learning_rate": 0.0004772904479419148, "loss": 6.1722, "mean_token_accuracy": 0.13954296559095383, "num_tokens": 31007485.0, "step": 14335 }, { "entropy": 6.50969672203064, "epoch": 1.5345390336561615, "grad_norm": 1.734375, "learning_rate": 0.0004772737061637811, "loss": 6.2747, "mean_token_accuracy": 0.14038911312818528, "num_tokens": 31017827.0, "step": 14340 }, { "entropy": 6.547337579727173, "epoch": 1.5350741077639252, "grad_norm": 1.875, "learning_rate": 0.00047725695854502267, "loss": 6.2938, "mean_token_accuracy": 0.1367683343589306, "num_tokens": 31028167.0, "step": 14345 }, { "entropy": 6.506247043609619, "epoch": 1.5356091818716893, "grad_norm": 2.109375, "learning_rate": 0.00047724020508612287, "loss": 6.2354, "mean_token_accuracy": 0.13793734312057496, "num_tokens": 31038941.0, "step": 14350 }, { "entropy": 6.509874773025513, "epoch": 1.5361442559794531, "grad_norm": 1.796875, "learning_rate": 0.00047722344578756564, "loss": 6.2597, "mean_token_accuracy": 0.13013634383678435, "num_tokens": 31049949.0, "step": 14355 }, { "entropy": 6.57332935333252, "epoch": 1.536679330087217, "grad_norm": 1.40625, "learning_rate": 0.00047720668064983476, "loss": 6.2486, "mean_token_accuracy": 0.13523405343294143, "num_tokens": 31059299.0, "step": 14360 }, { "entropy": 6.518624258041382, "epoch": 1.5372144041949811, "grad_norm": 1.6953125, "learning_rate": 0.0004771899096734145, "loss": 6.3483, "mean_token_accuracy": 0.12761058509349824, "num_tokens": 31070508.0, "step": 14365 }, { "entropy": 6.454201030731201, "epoch": 1.5377494783027448, "grad_norm": 1.640625, "learning_rate": 0.00047717313285878886, "loss": 6.24, "mean_token_accuracy": 0.13824471086263657, "num_tokens": 31082354.0, "step": 14370 }, { "entropy": 6.685629796981812, "epoch": 1.5382845524105089, "grad_norm": 1.421875, "learning_rate": 0.00047715635020644247, "loss": 6.3821, "mean_token_accuracy": 0.1280341513454914, "num_tokens": 31093496.0, "step": 14375 }, { "entropy": 6.581520366668701, "epoch": 1.5388196265182728, "grad_norm": 1.96875, "learning_rate": 0.00047713956171685994, "loss": 6.2291, "mean_token_accuracy": 0.13955939933657646, "num_tokens": 31104289.0, "step": 14380 }, { "entropy": 6.408662891387939, "epoch": 1.5393547006260366, "grad_norm": 1.578125, "learning_rate": 0.000477122767390526, "loss": 6.1777, "mean_token_accuracy": 0.1459297515451908, "num_tokens": 31114998.0, "step": 14385 }, { "entropy": 6.475273132324219, "epoch": 1.5398897747338007, "grad_norm": 1.5625, "learning_rate": 0.00047710596722792543, "loss": 6.2817, "mean_token_accuracy": 0.13103958070278168, "num_tokens": 31127393.0, "step": 14390 }, { "entropy": 6.476905965805054, "epoch": 1.5404248488415646, "grad_norm": 2.125, "learning_rate": 0.0004770891612295435, "loss": 6.1077, "mean_token_accuracy": 0.15151217132806777, "num_tokens": 31137484.0, "step": 14395 }, { "entropy": 6.524506330490112, "epoch": 1.5409599229493285, "grad_norm": 1.515625, "learning_rate": 0.0004770723493958654, "loss": 6.3205, "mean_token_accuracy": 0.13329991921782494, "num_tokens": 31147863.0, "step": 14400 }, { "entropy": 6.464319705963135, "epoch": 1.5414949970570924, "grad_norm": 1.484375, "learning_rate": 0.0004770555317273767, "loss": 6.2025, "mean_token_accuracy": 0.13622017651796342, "num_tokens": 31159018.0, "step": 14405 }, { "entropy": 6.558589506149292, "epoch": 1.5420300711648562, "grad_norm": 1.90625, "learning_rate": 0.00047703870822456287, "loss": 6.2174, "mean_token_accuracy": 0.13448593094944955, "num_tokens": 31170673.0, "step": 14410 }, { "entropy": 6.438023281097412, "epoch": 1.5425651452726203, "grad_norm": 1.8125, "learning_rate": 0.0004770218788879097, "loss": 6.0972, "mean_token_accuracy": 0.14730842560529708, "num_tokens": 31181165.0, "step": 14415 }, { "entropy": 6.370760583877564, "epoch": 1.5431002193803842, "grad_norm": 1.703125, "learning_rate": 0.0004770050437179033, "loss": 6.2412, "mean_token_accuracy": 0.13814024552702903, "num_tokens": 31192976.0, "step": 14420 }, { "entropy": 6.539438915252686, "epoch": 1.543635293488148, "grad_norm": 1.5078125, "learning_rate": 0.0004769882027150295, "loss": 6.3375, "mean_token_accuracy": 0.13710992708802222, "num_tokens": 31203979.0, "step": 14425 }, { "entropy": 6.561808919906616, "epoch": 1.5441703675959122, "grad_norm": 1.7265625, "learning_rate": 0.00047697135587977473, "loss": 6.2099, "mean_token_accuracy": 0.14149817302823067, "num_tokens": 31214972.0, "step": 14430 }, { "entropy": 6.556917285919189, "epoch": 1.5447054417036759, "grad_norm": 1.4765625, "learning_rate": 0.00047695450321262546, "loss": 6.3216, "mean_token_accuracy": 0.13588785231113434, "num_tokens": 31224726.0, "step": 14435 }, { "entropy": 6.527967166900635, "epoch": 1.54524051581144, "grad_norm": 2.21875, "learning_rate": 0.0004769376447140683, "loss": 6.2022, "mean_token_accuracy": 0.13984608128666878, "num_tokens": 31235761.0, "step": 14440 }, { "entropy": 6.522278881072998, "epoch": 1.5457755899192038, "grad_norm": 2.25, "learning_rate": 0.00047692078038459015, "loss": 6.3109, "mean_token_accuracy": 0.14084505960345267, "num_tokens": 31246221.0, "step": 14445 }, { "entropy": 6.535905742645264, "epoch": 1.5463106640269677, "grad_norm": 1.5234375, "learning_rate": 0.0004769039102246777, "loss": 6.2541, "mean_token_accuracy": 0.12931643798947334, "num_tokens": 31257364.0, "step": 14450 }, { "entropy": 6.5485001564025875, "epoch": 1.5468457381347318, "grad_norm": 1.765625, "learning_rate": 0.00047688703423481827, "loss": 6.2703, "mean_token_accuracy": 0.13121291548013686, "num_tokens": 31268343.0, "step": 14455 }, { "entropy": 6.530178070068359, "epoch": 1.5473808122424955, "grad_norm": 1.421875, "learning_rate": 0.00047687015241549896, "loss": 6.3008, "mean_token_accuracy": 0.13335917592048646, "num_tokens": 31278335.0, "step": 14460 }, { "entropy": 6.505687570571899, "epoch": 1.5479158863502596, "grad_norm": 1.4140625, "learning_rate": 0.0004768532647672075, "loss": 6.2148, "mean_token_accuracy": 0.12822186350822448, "num_tokens": 31288537.0, "step": 14465 }, { "entropy": 6.440744066238404, "epoch": 1.5484509604580234, "grad_norm": 1.2734375, "learning_rate": 0.0004768363712904314, "loss": 6.2354, "mean_token_accuracy": 0.14038474783301352, "num_tokens": 31299353.0, "step": 14470 }, { "entropy": 6.5596130847930905, "epoch": 1.5489860345657873, "grad_norm": 1.96875, "learning_rate": 0.0004768194719856584, "loss": 6.2527, "mean_token_accuracy": 0.1316815972328186, "num_tokens": 31309655.0, "step": 14475 }, { "entropy": 6.525741004943848, "epoch": 1.5495211086735514, "grad_norm": 1.4375, "learning_rate": 0.0004768025668533765, "loss": 6.315, "mean_token_accuracy": 0.13498535379767418, "num_tokens": 31321008.0, "step": 14480 }, { "entropy": 6.472729158401489, "epoch": 1.550056182781315, "grad_norm": 1.453125, "learning_rate": 0.00047678565589407383, "loss": 6.185, "mean_token_accuracy": 0.1401698887348175, "num_tokens": 31331978.0, "step": 14485 }, { "entropy": 6.510477113723755, "epoch": 1.5505912568890792, "grad_norm": 1.3671875, "learning_rate": 0.0004767687391082387, "loss": 6.2444, "mean_token_accuracy": 0.1391635164618492, "num_tokens": 31341703.0, "step": 14490 }, { "entropy": 6.5434596061706545, "epoch": 1.551126330996843, "grad_norm": 1.3359375, "learning_rate": 0.00047675181649635965, "loss": 6.2757, "mean_token_accuracy": 0.13907155245542527, "num_tokens": 31352787.0, "step": 14495 }, { "entropy": 6.4846821308135985, "epoch": 1.551661405104607, "grad_norm": 1.6328125, "learning_rate": 0.00047673488805892515, "loss": 6.2654, "mean_token_accuracy": 0.13517796471714974, "num_tokens": 31363702.0, "step": 14500 }, { "entropy": 6.530848407745362, "epoch": 1.552196479212371, "grad_norm": 1.34375, "learning_rate": 0.00047671795379642415, "loss": 6.2377, "mean_token_accuracy": 0.12709226831793785, "num_tokens": 31374719.0, "step": 14505 }, { "entropy": 6.620404386520386, "epoch": 1.5527315533201347, "grad_norm": 2.875, "learning_rate": 0.0004767010137093456, "loss": 6.3672, "mean_token_accuracy": 0.12480267137289047, "num_tokens": 31386289.0, "step": 14510 }, { "entropy": 6.537449836730957, "epoch": 1.5532666274278988, "grad_norm": 1.46875, "learning_rate": 0.00047668406779817864, "loss": 6.1873, "mean_token_accuracy": 0.14198817759752275, "num_tokens": 31397103.0, "step": 14515 }, { "entropy": 6.51537299156189, "epoch": 1.5538017015356627, "grad_norm": 1.4609375, "learning_rate": 0.0004766671160634125, "loss": 6.2841, "mean_token_accuracy": 0.13656345903873443, "num_tokens": 31408715.0, "step": 14520 }, { "entropy": 6.582148265838623, "epoch": 1.5543367756434265, "grad_norm": 1.7265625, "learning_rate": 0.0004766501585055367, "loss": 6.3024, "mean_token_accuracy": 0.1285000301897526, "num_tokens": 31420365.0, "step": 14525 }, { "entropy": 6.546790933609008, "epoch": 1.5548718497511906, "grad_norm": 2.25, "learning_rate": 0.000476633195125041, "loss": 6.2135, "mean_token_accuracy": 0.13490134105086327, "num_tokens": 31431635.0, "step": 14530 }, { "entropy": 6.520722341537476, "epoch": 1.5554069238589545, "grad_norm": 1.40625, "learning_rate": 0.00047661622592241507, "loss": 6.2576, "mean_token_accuracy": 0.13644103407859803, "num_tokens": 31442513.0, "step": 14535 }, { "entropy": 6.521498155593872, "epoch": 1.5559419979667184, "grad_norm": 1.3125, "learning_rate": 0.0004765992508981489, "loss": 6.2933, "mean_token_accuracy": 0.1281339019536972, "num_tokens": 31453726.0, "step": 14540 }, { "entropy": 6.541304016113282, "epoch": 1.5564770720744823, "grad_norm": 1.3671875, "learning_rate": 0.0004765822700527328, "loss": 6.2009, "mean_token_accuracy": 0.1394302561879158, "num_tokens": 31463980.0, "step": 14545 }, { "entropy": 6.500122165679931, "epoch": 1.5570121461822461, "grad_norm": 2.046875, "learning_rate": 0.0004765652833866569, "loss": 6.3489, "mean_token_accuracy": 0.12963479459285737, "num_tokens": 31474615.0, "step": 14550 }, { "entropy": 6.462019920349121, "epoch": 1.5575472202900102, "grad_norm": 1.7109375, "learning_rate": 0.0004765482909004118, "loss": 6.2117, "mean_token_accuracy": 0.14140638411045076, "num_tokens": 31485283.0, "step": 14555 }, { "entropy": 6.535767030715943, "epoch": 1.5580822943977741, "grad_norm": 1.46875, "learning_rate": 0.0004765312925944881, "loss": 6.2584, "mean_token_accuracy": 0.13080894574522972, "num_tokens": 31496997.0, "step": 14560 }, { "entropy": 6.6297478675842285, "epoch": 1.558617368505538, "grad_norm": 2.84375, "learning_rate": 0.00047651428846937673, "loss": 6.276, "mean_token_accuracy": 0.1357246607542038, "num_tokens": 31507585.0, "step": 14565 }, { "entropy": 6.511379718780518, "epoch": 1.559152442613302, "grad_norm": 1.7109375, "learning_rate": 0.00047649727852556854, "loss": 6.1847, "mean_token_accuracy": 0.13770078867673874, "num_tokens": 31517078.0, "step": 14570 }, { "entropy": 6.370854806900025, "epoch": 1.5596875167210658, "grad_norm": 3.296875, "learning_rate": 0.0004764802627635547, "loss": 6.1966, "mean_token_accuracy": 0.14397168532013893, "num_tokens": 31528576.0, "step": 14575 }, { "entropy": 6.582043838500977, "epoch": 1.5602225908288299, "grad_norm": 1.4609375, "learning_rate": 0.0004764632411838266, "loss": 6.2935, "mean_token_accuracy": 0.12686383947730065, "num_tokens": 31540095.0, "step": 14580 }, { "entropy": 6.544200801849366, "epoch": 1.5607576649365937, "grad_norm": 2.03125, "learning_rate": 0.00047644621378687573, "loss": 6.2075, "mean_token_accuracy": 0.13072769418358804, "num_tokens": 31550980.0, "step": 14585 }, { "entropy": 6.3452962875366214, "epoch": 1.5612927390443576, "grad_norm": 3.0625, "learning_rate": 0.00047642918057319377, "loss": 6.0208, "mean_token_accuracy": 0.15695239156484603, "num_tokens": 31561842.0, "step": 14590 }, { "entropy": 6.525337028503418, "epoch": 1.5618278131521217, "grad_norm": 2.640625, "learning_rate": 0.0004764121415432725, "loss": 6.3623, "mean_token_accuracy": 0.12762523368000983, "num_tokens": 31572798.0, "step": 14595 }, { "entropy": 6.54258165359497, "epoch": 1.5623628872598854, "grad_norm": 1.75, "learning_rate": 0.0004763950966976039, "loss": 6.3345, "mean_token_accuracy": 0.13119860887527465, "num_tokens": 31584774.0, "step": 14600 }, { "entropy": 6.536434745788574, "epoch": 1.5628979613676495, "grad_norm": 1.3828125, "learning_rate": 0.0004763780460366803, "loss": 6.2323, "mean_token_accuracy": 0.13397064805030823, "num_tokens": 31596197.0, "step": 14605 }, { "entropy": 6.550236940383911, "epoch": 1.5634330354754133, "grad_norm": 2.4375, "learning_rate": 0.0004763609895609939, "loss": 6.2697, "mean_token_accuracy": 0.13484611362218857, "num_tokens": 31607455.0, "step": 14610 }, { "entropy": 6.561938524246216, "epoch": 1.5639681095831772, "grad_norm": 1.6484375, "learning_rate": 0.00047634392727103714, "loss": 6.3114, "mean_token_accuracy": 0.13227349519729614, "num_tokens": 31618995.0, "step": 14615 }, { "entropy": 6.468525743484497, "epoch": 1.5645031836909413, "grad_norm": 1.328125, "learning_rate": 0.0004763268591673028, "loss": 6.1841, "mean_token_accuracy": 0.13631799519062043, "num_tokens": 31629984.0, "step": 14620 }, { "entropy": 6.492383766174316, "epoch": 1.565038257798705, "grad_norm": 1.703125, "learning_rate": 0.0004763097852502837, "loss": 6.1968, "mean_token_accuracy": 0.13692545443773269, "num_tokens": 31641362.0, "step": 14625 }, { "entropy": 6.5297730445861815, "epoch": 1.565573331906469, "grad_norm": 2.625, "learning_rate": 0.00047629270552047284, "loss": 6.3723, "mean_token_accuracy": 0.12706034481525422, "num_tokens": 31652650.0, "step": 14630 }, { "entropy": 6.5213886260986325, "epoch": 1.566108406014233, "grad_norm": 2.453125, "learning_rate": 0.00047627561997836337, "loss": 6.2875, "mean_token_accuracy": 0.12873518839478493, "num_tokens": 31664201.0, "step": 14635 }, { "entropy": 6.579891300201416, "epoch": 1.5666434801219968, "grad_norm": 1.578125, "learning_rate": 0.0004762585286244487, "loss": 6.2509, "mean_token_accuracy": 0.13287581130862236, "num_tokens": 31674480.0, "step": 14640 }, { "entropy": 6.5407298564910885, "epoch": 1.567178554229761, "grad_norm": 1.421875, "learning_rate": 0.00047624143145922227, "loss": 6.2555, "mean_token_accuracy": 0.1364641495049, "num_tokens": 31685377.0, "step": 14645 }, { "entropy": 6.54713773727417, "epoch": 1.5677136283375246, "grad_norm": 1.5703125, "learning_rate": 0.00047622432848317775, "loss": 6.2556, "mean_token_accuracy": 0.13927348628640174, "num_tokens": 31695199.0, "step": 14650 }, { "entropy": 6.462022686004639, "epoch": 1.5682487024452887, "grad_norm": 1.6328125, "learning_rate": 0.0004762072196968091, "loss": 6.268, "mean_token_accuracy": 0.13694618120789528, "num_tokens": 31705528.0, "step": 14655 }, { "entropy": 6.4519548416137695, "epoch": 1.5687837765530526, "grad_norm": 1.859375, "learning_rate": 0.0004761901051006102, "loss": 6.2195, "mean_token_accuracy": 0.14057985618710517, "num_tokens": 31718156.0, "step": 14660 }, { "entropy": 6.518571949005127, "epoch": 1.5693188506608164, "grad_norm": 2.28125, "learning_rate": 0.00047617298469507534, "loss": 6.2554, "mean_token_accuracy": 0.1364244446158409, "num_tokens": 31729783.0, "step": 14665 }, { "entropy": 6.5569658279418945, "epoch": 1.5698539247685805, "grad_norm": 1.75, "learning_rate": 0.0004761558584806988, "loss": 6.2264, "mean_token_accuracy": 0.1388966977596283, "num_tokens": 31740796.0, "step": 14670 }, { "entropy": 6.588993740081787, "epoch": 1.5703889988763444, "grad_norm": 1.921875, "learning_rate": 0.0004761387264579751, "loss": 6.3151, "mean_token_accuracy": 0.13168300688266754, "num_tokens": 31750559.0, "step": 14675 }, { "entropy": 6.521017694473267, "epoch": 1.5709240729841083, "grad_norm": 1.5546875, "learning_rate": 0.0004761215886273989, "loss": 6.1991, "mean_token_accuracy": 0.13765431344509124, "num_tokens": 31761559.0, "step": 14680 }, { "entropy": 6.494146347045898, "epoch": 1.5714591470918722, "grad_norm": 1.5390625, "learning_rate": 0.00047610444498946507, "loss": 6.2014, "mean_token_accuracy": 0.13926137760281562, "num_tokens": 31771677.0, "step": 14685 }, { "entropy": 6.539397382736206, "epoch": 1.571994221199636, "grad_norm": 1.4765625, "learning_rate": 0.0004760872955446688, "loss": 6.3242, "mean_token_accuracy": 0.12628690302371978, "num_tokens": 31783028.0, "step": 14690 }, { "entropy": 6.554657936096191, "epoch": 1.5725292953074002, "grad_norm": 2.203125, "learning_rate": 0.00047607014029350504, "loss": 6.2933, "mean_token_accuracy": 0.13701235502958298, "num_tokens": 31793110.0, "step": 14695 }, { "entropy": 6.496626329421997, "epoch": 1.573064369415164, "grad_norm": 1.8828125, "learning_rate": 0.00047605297923646923, "loss": 6.2598, "mean_token_accuracy": 0.13291990309953688, "num_tokens": 31804193.0, "step": 14700 }, { "entropy": 6.518072462081909, "epoch": 1.573599443522928, "grad_norm": 2.03125, "learning_rate": 0.00047603581237405684, "loss": 6.2548, "mean_token_accuracy": 0.13917799517512322, "num_tokens": 31815752.0, "step": 14705 }, { "entropy": 6.575625705718994, "epoch": 1.574134517630692, "grad_norm": 1.65625, "learning_rate": 0.00047601863970676367, "loss": 6.3434, "mean_token_accuracy": 0.1280118577182293, "num_tokens": 31825936.0, "step": 14710 }, { "entropy": 6.54962010383606, "epoch": 1.5746695917384557, "grad_norm": 1.859375, "learning_rate": 0.00047600146123508554, "loss": 6.2271, "mean_token_accuracy": 0.13201195001602173, "num_tokens": 31836601.0, "step": 14715 }, { "entropy": 6.3876525402069095, "epoch": 1.5752046658462198, "grad_norm": 2.40625, "learning_rate": 0.00047598427695951846, "loss": 6.0703, "mean_token_accuracy": 0.14671236798167228, "num_tokens": 31846476.0, "step": 14720 }, { "entropy": 6.38327260017395, "epoch": 1.5757397399539836, "grad_norm": 1.6015625, "learning_rate": 0.00047596708688055857, "loss": 6.0755, "mean_token_accuracy": 0.1459612712264061, "num_tokens": 31856151.0, "step": 14725 }, { "entropy": 6.544833850860596, "epoch": 1.5762748140617475, "grad_norm": 1.5859375, "learning_rate": 0.0004759498909987023, "loss": 6.3136, "mean_token_accuracy": 0.1280362620949745, "num_tokens": 31867419.0, "step": 14730 }, { "entropy": 6.5832963466644285, "epoch": 1.5768098881695116, "grad_norm": 1.5234375, "learning_rate": 0.0004759326893144462, "loss": 6.3235, "mean_token_accuracy": 0.13490021526813506, "num_tokens": 31878036.0, "step": 14735 }, { "entropy": 6.542579221725464, "epoch": 1.5773449622772753, "grad_norm": 1.8046875, "learning_rate": 0.000475915481828287, "loss": 6.2622, "mean_token_accuracy": 0.13082825392484665, "num_tokens": 31887919.0, "step": 14740 }, { "entropy": 6.434671688079834, "epoch": 1.5778800363850394, "grad_norm": 1.390625, "learning_rate": 0.00047589826854072133, "loss": 6.2629, "mean_token_accuracy": 0.13572418168187142, "num_tokens": 31898962.0, "step": 14745 }, { "entropy": 6.579334545135498, "epoch": 1.5784151104928033, "grad_norm": 1.75, "learning_rate": 0.00047588104945224654, "loss": 6.3589, "mean_token_accuracy": 0.13001709431409836, "num_tokens": 31911027.0, "step": 14750 }, { "entropy": 6.5912518978118895, "epoch": 1.5789501846005671, "grad_norm": 1.546875, "learning_rate": 0.0004758638245633595, "loss": 6.278, "mean_token_accuracy": 0.13635631650686264, "num_tokens": 31921226.0, "step": 14755 }, { "entropy": 6.496388244628906, "epoch": 1.5794852587083312, "grad_norm": 1.75, "learning_rate": 0.0004758465938745579, "loss": 6.2114, "mean_token_accuracy": 0.13777147978544235, "num_tokens": 31932848.0, "step": 14760 }, { "entropy": 6.460186386108399, "epoch": 1.5800203328160949, "grad_norm": 1.3828125, "learning_rate": 0.00047582935738633915, "loss": 6.1486, "mean_token_accuracy": 0.13729973658919334, "num_tokens": 31943757.0, "step": 14765 }, { "entropy": 6.520174598693847, "epoch": 1.580555406923859, "grad_norm": 1.7890625, "learning_rate": 0.0004758121150992009, "loss": 6.3122, "mean_token_accuracy": 0.12971630915999413, "num_tokens": 31954391.0, "step": 14770 }, { "entropy": 6.51693320274353, "epoch": 1.5810904810316229, "grad_norm": 2.0625, "learning_rate": 0.00047579486701364093, "loss": 6.3043, "mean_token_accuracy": 0.13650548011064528, "num_tokens": 31964497.0, "step": 14775 }, { "entropy": 6.5695905685424805, "epoch": 1.5816255551393867, "grad_norm": 1.875, "learning_rate": 0.0004757776131301575, "loss": 6.2831, "mean_token_accuracy": 0.130709208548069, "num_tokens": 31974466.0, "step": 14780 }, { "entropy": 6.557105636596679, "epoch": 1.5821606292471508, "grad_norm": 1.796875, "learning_rate": 0.0004757603534492487, "loss": 6.3066, "mean_token_accuracy": 0.13409281075000762, "num_tokens": 31985890.0, "step": 14785 }, { "entropy": 6.504603242874145, "epoch": 1.5826957033549145, "grad_norm": 2.890625, "learning_rate": 0.0004757430879714128, "loss": 6.4018, "mean_token_accuracy": 0.13219767883419992, "num_tokens": 31996865.0, "step": 14790 }, { "entropy": 6.460845565795898, "epoch": 1.5832307774626786, "grad_norm": 1.953125, "learning_rate": 0.0004757258166971485, "loss": 6.1455, "mean_token_accuracy": 0.1445557326078415, "num_tokens": 32008121.0, "step": 14795 }, { "entropy": 6.570254182815551, "epoch": 1.5837658515704425, "grad_norm": 2.234375, "learning_rate": 0.0004757085396269545, "loss": 6.3516, "mean_token_accuracy": 0.1301535189151764, "num_tokens": 32020552.0, "step": 14800 }, { "entropy": 6.561383485794067, "epoch": 1.5843009256782064, "grad_norm": 2.40625, "learning_rate": 0.00047569125676132963, "loss": 6.3061, "mean_token_accuracy": 0.13402550369501115, "num_tokens": 32032361.0, "step": 14805 }, { "entropy": 6.55854434967041, "epoch": 1.5848359997859705, "grad_norm": 1.3359375, "learning_rate": 0.00047567396810077286, "loss": 6.2886, "mean_token_accuracy": 0.12737912312150002, "num_tokens": 32043233.0, "step": 14810 }, { "entropy": 6.552183437347412, "epoch": 1.5853710738937343, "grad_norm": 1.703125, "learning_rate": 0.00047565667364578344, "loss": 6.253, "mean_token_accuracy": 0.14003728479146957, "num_tokens": 32054273.0, "step": 14815 }, { "entropy": 6.523531103134156, "epoch": 1.5859061480014982, "grad_norm": 2.03125, "learning_rate": 0.0004756393733968608, "loss": 6.2287, "mean_token_accuracy": 0.14313824102282524, "num_tokens": 32064200.0, "step": 14820 }, { "entropy": 6.451785039901734, "epoch": 1.586441222109262, "grad_norm": 1.4609375, "learning_rate": 0.0004756220673545045, "loss": 6.217, "mean_token_accuracy": 0.14075903221964836, "num_tokens": 32074823.0, "step": 14825 }, { "entropy": 6.533991765975952, "epoch": 1.586976296217026, "grad_norm": 2.421875, "learning_rate": 0.00047560475551921416, "loss": 6.3073, "mean_token_accuracy": 0.13615889325737954, "num_tokens": 32085333.0, "step": 14830 }, { "entropy": 6.625106430053711, "epoch": 1.58751137032479, "grad_norm": 1.3203125, "learning_rate": 0.0004755874378914897, "loss": 6.2903, "mean_token_accuracy": 0.13102672025561332, "num_tokens": 32095827.0, "step": 14835 }, { "entropy": 6.524811744689941, "epoch": 1.588046444432554, "grad_norm": 1.796875, "learning_rate": 0.0004755701144718311, "loss": 6.2861, "mean_token_accuracy": 0.13742618560791015, "num_tokens": 32106949.0, "step": 14840 }, { "entropy": 6.501339530944824, "epoch": 1.5885815185403178, "grad_norm": 2.15625, "learning_rate": 0.00047555278526073867, "loss": 6.2225, "mean_token_accuracy": 0.14211768209934234, "num_tokens": 32118269.0, "step": 14845 }, { "entropy": 6.4988819599151615, "epoch": 1.589116592648082, "grad_norm": 1.6328125, "learning_rate": 0.0004755354502587127, "loss": 6.2626, "mean_token_accuracy": 0.13281174525618553, "num_tokens": 32128406.0, "step": 14850 }, { "entropy": 6.5138648509979244, "epoch": 1.5896516667558456, "grad_norm": 1.7890625, "learning_rate": 0.00047551810946625385, "loss": 6.2798, "mean_token_accuracy": 0.1371403641998768, "num_tokens": 32140112.0, "step": 14855 }, { "entropy": 6.533293962478638, "epoch": 1.5901867408636097, "grad_norm": 1.90625, "learning_rate": 0.00047550076288386276, "loss": 6.2083, "mean_token_accuracy": 0.14420999884605407, "num_tokens": 32150010.0, "step": 14860 }, { "entropy": 6.5140081405639645, "epoch": 1.5907218149713735, "grad_norm": 1.921875, "learning_rate": 0.0004754834105120403, "loss": 6.3212, "mean_token_accuracy": 0.12911390140652657, "num_tokens": 32160694.0, "step": 14865 }, { "entropy": 6.499224996566772, "epoch": 1.5912568890791374, "grad_norm": 1.640625, "learning_rate": 0.00047546605235128755, "loss": 6.3156, "mean_token_accuracy": 0.1340811789035797, "num_tokens": 32171947.0, "step": 14870 }, { "entropy": 6.5859424591064455, "epoch": 1.5917919631869015, "grad_norm": 1.9453125, "learning_rate": 0.0004754486884021057, "loss": 6.3007, "mean_token_accuracy": 0.13230689167976378, "num_tokens": 32182849.0, "step": 14875 }, { "entropy": 6.548197221755982, "epoch": 1.5923270372946652, "grad_norm": 1.8125, "learning_rate": 0.0004754313186649961, "loss": 6.2999, "mean_token_accuracy": 0.13477448523044586, "num_tokens": 32192871.0, "step": 14880 }, { "entropy": 6.562755441665649, "epoch": 1.5928621114024293, "grad_norm": 2.125, "learning_rate": 0.00047541394314046037, "loss": 6.3227, "mean_token_accuracy": 0.1299983151257038, "num_tokens": 32203289.0, "step": 14885 }, { "entropy": 6.5510444164276125, "epoch": 1.5933971855101932, "grad_norm": 1.53125, "learning_rate": 0.0004753965618290002, "loss": 6.2676, "mean_token_accuracy": 0.13420026302337645, "num_tokens": 32213238.0, "step": 14890 }, { "entropy": 6.424655485153198, "epoch": 1.593932259617957, "grad_norm": 1.640625, "learning_rate": 0.0004753791747311175, "loss": 6.1858, "mean_token_accuracy": 0.13797398135066033, "num_tokens": 32223384.0, "step": 14895 }, { "entropy": 6.520129299163818, "epoch": 1.5944673337257211, "grad_norm": 1.78125, "learning_rate": 0.00047536178184731426, "loss": 6.2804, "mean_token_accuracy": 0.13506588339805603, "num_tokens": 32235358.0, "step": 14900 }, { "entropy": 6.643621444702148, "epoch": 1.5950024078334848, "grad_norm": 1.59375, "learning_rate": 0.0004753443831780927, "loss": 6.3203, "mean_token_accuracy": 0.12936478480696678, "num_tokens": 32246459.0, "step": 14905 }, { "entropy": 6.506386947631836, "epoch": 1.595537481941249, "grad_norm": 1.7578125, "learning_rate": 0.0004753269787239552, "loss": 6.2174, "mean_token_accuracy": 0.13538266569375992, "num_tokens": 32257798.0, "step": 14910 }, { "entropy": 6.502975988388061, "epoch": 1.5960725560490128, "grad_norm": 1.6328125, "learning_rate": 0.00047530956848540435, "loss": 6.2543, "mean_token_accuracy": 0.1334786370396614, "num_tokens": 32268118.0, "step": 14915 }, { "entropy": 6.445563507080078, "epoch": 1.5966076301567766, "grad_norm": 1.5859375, "learning_rate": 0.0004752921524629429, "loss": 6.186, "mean_token_accuracy": 0.13638549968600272, "num_tokens": 32279676.0, "step": 14920 }, { "entropy": 6.503003644943237, "epoch": 1.5971427042645407, "grad_norm": 1.53125, "learning_rate": 0.0004752747306570737, "loss": 6.2293, "mean_token_accuracy": 0.13795944750308992, "num_tokens": 32290613.0, "step": 14925 }, { "entropy": 6.5680375576019285, "epoch": 1.5976777783723044, "grad_norm": 1.4921875, "learning_rate": 0.00047525730306829977, "loss": 6.2521, "mean_token_accuracy": 0.13554463014006615, "num_tokens": 32300873.0, "step": 14930 }, { "entropy": 6.557008171081543, "epoch": 1.5982128524800685, "grad_norm": 4.53125, "learning_rate": 0.0004752398696971244, "loss": 6.2657, "mean_token_accuracy": 0.13355937376618385, "num_tokens": 32312326.0, "step": 14935 }, { "entropy": 6.5607640743255615, "epoch": 1.5987479265878324, "grad_norm": 2.0, "learning_rate": 0.00047522243054405085, "loss": 6.2513, "mean_token_accuracy": 0.12972980067133905, "num_tokens": 32324322.0, "step": 14940 }, { "entropy": 6.560641956329346, "epoch": 1.5992830006955963, "grad_norm": 1.65625, "learning_rate": 0.0004752049856095828, "loss": 6.2231, "mean_token_accuracy": 0.13305347710847854, "num_tokens": 32334397.0, "step": 14945 }, { "entropy": 6.470574998855591, "epoch": 1.5998180748033604, "grad_norm": 1.765625, "learning_rate": 0.00047518753489422393, "loss": 6.2252, "mean_token_accuracy": 0.1374221198260784, "num_tokens": 32345131.0, "step": 14950 }, { "entropy": 6.4330222606658936, "epoch": 1.6003531489111242, "grad_norm": 1.375, "learning_rate": 0.00047517007839847816, "loss": 6.2059, "mean_token_accuracy": 0.13534148335456847, "num_tokens": 32355520.0, "step": 14955 }, { "entropy": 6.536291217803955, "epoch": 1.6008882230188881, "grad_norm": 1.3125, "learning_rate": 0.0004751526161228494, "loss": 6.2917, "mean_token_accuracy": 0.14231665730476378, "num_tokens": 32366695.0, "step": 14960 }, { "entropy": 6.454723787307739, "epoch": 1.601423297126652, "grad_norm": 1.59375, "learning_rate": 0.000475135148067842, "loss": 6.2309, "mean_token_accuracy": 0.13280131667852402, "num_tokens": 32377467.0, "step": 14965 }, { "entropy": 6.581510353088379, "epoch": 1.6019583712344159, "grad_norm": 2.4375, "learning_rate": 0.00047511767423396033, "loss": 6.2621, "mean_token_accuracy": 0.1360831081867218, "num_tokens": 32388021.0, "step": 14970 }, { "entropy": 6.5882233619689945, "epoch": 1.60249344534218, "grad_norm": 1.3984375, "learning_rate": 0.000475100194621709, "loss": 6.2323, "mean_token_accuracy": 0.14279873743653299, "num_tokens": 32398105.0, "step": 14975 }, { "entropy": 6.526843452453614, "epoch": 1.6030285194499438, "grad_norm": 1.828125, "learning_rate": 0.0004750827092315926, "loss": 6.3458, "mean_token_accuracy": 0.13159868866205215, "num_tokens": 32409876.0, "step": 14980 }, { "entropy": 6.51892728805542, "epoch": 1.6035635935577077, "grad_norm": 1.828125, "learning_rate": 0.00047506521806411613, "loss": 6.2424, "mean_token_accuracy": 0.14545759409666062, "num_tokens": 32420283.0, "step": 14985 }, { "entropy": 6.54042501449585, "epoch": 1.6040986676654718, "grad_norm": 1.4921875, "learning_rate": 0.00047504772111978463, "loss": 6.3343, "mean_token_accuracy": 0.12750672101974486, "num_tokens": 32431164.0, "step": 14990 }, { "entropy": 6.5425420761108395, "epoch": 1.6046337417732355, "grad_norm": 2.203125, "learning_rate": 0.0004750302183991032, "loss": 6.2426, "mean_token_accuracy": 0.132595930993557, "num_tokens": 32442253.0, "step": 14995 }, { "entropy": 6.50988450050354, "epoch": 1.6051688158809996, "grad_norm": 1.71875, "learning_rate": 0.0004750127099025774, "loss": 6.338, "mean_token_accuracy": 0.1360313430428505, "num_tokens": 32452800.0, "step": 15000 }, { "epoch": 1.6051688158809996, "eval_entropy": 6.419160812048899, "eval_loss": 6.373970031738281, "eval_mean_token_accuracy": 0.13763191947648226, "eval_num_tokens": 32452800.0, "eval_runtime": 22.5526, "eval_samples_per_second": 1315.992, "eval_steps_per_second": 164.505, "step": 15000 }, { "entropy": 6.596367835998535, "epoch": 1.6057038899887635, "grad_norm": 1.3359375, "learning_rate": 0.0004749951956307126, "loss": 6.2873, "mean_token_accuracy": 0.1296849727630615, "num_tokens": 32462890.0, "step": 15005 }, { "entropy": 6.485629034042359, "epoch": 1.6062389640965273, "grad_norm": 2.453125, "learning_rate": 0.0004749776755840148, "loss": 6.2551, "mean_token_accuracy": 0.14182380735874175, "num_tokens": 32473422.0, "step": 15010 }, { "entropy": 6.500695705413818, "epoch": 1.6067740382042914, "grad_norm": 2.3125, "learning_rate": 0.00047496014976298957, "loss": 6.2867, "mean_token_accuracy": 0.13322071507573127, "num_tokens": 32483980.0, "step": 15015 }, { "entropy": 6.603447580337525, "epoch": 1.607309112312055, "grad_norm": 1.734375, "learning_rate": 0.0004749426181681432, "loss": 6.3083, "mean_token_accuracy": 0.13130330070853233, "num_tokens": 32494905.0, "step": 15020 }, { "entropy": 6.614582967758179, "epoch": 1.6078441864198192, "grad_norm": 2.65625, "learning_rate": 0.00047492508079998173, "loss": 6.3397, "mean_token_accuracy": 0.12839462533593177, "num_tokens": 32505799.0, "step": 15025 }, { "entropy": 6.563151884078979, "epoch": 1.608379260527583, "grad_norm": 1.4765625, "learning_rate": 0.0004749075376590117, "loss": 6.3072, "mean_token_accuracy": 0.12912078201770782, "num_tokens": 32516328.0, "step": 15030 }, { "entropy": 6.532871294021606, "epoch": 1.608914334635347, "grad_norm": 1.5625, "learning_rate": 0.0004748899887457396, "loss": 6.2823, "mean_token_accuracy": 0.13482635021209716, "num_tokens": 32526335.0, "step": 15035 }, { "entropy": 6.4955644607543945, "epoch": 1.609449408743111, "grad_norm": 1.515625, "learning_rate": 0.00047487243406067227, "loss": 6.2544, "mean_token_accuracy": 0.1365067608654499, "num_tokens": 32536896.0, "step": 15040 }, { "entropy": 6.512849569320679, "epoch": 1.6099844828508747, "grad_norm": 1.859375, "learning_rate": 0.0004748548736043164, "loss": 6.1869, "mean_token_accuracy": 0.1340150237083435, "num_tokens": 32547604.0, "step": 15045 }, { "entropy": 6.575725650787353, "epoch": 1.6105195569586388, "grad_norm": 1.5859375, "learning_rate": 0.00047483730737717914, "loss": 6.299, "mean_token_accuracy": 0.12914739921689034, "num_tokens": 32558539.0, "step": 15050 }, { "entropy": 6.5589573860168455, "epoch": 1.6110546310664027, "grad_norm": 2.46875, "learning_rate": 0.0004748197353797677, "loss": 6.3663, "mean_token_accuracy": 0.12705627977848052, "num_tokens": 32569787.0, "step": 15055 }, { "entropy": 6.542858552932739, "epoch": 1.6115897051741666, "grad_norm": 1.7890625, "learning_rate": 0.0004748021576125895, "loss": 6.3022, "mean_token_accuracy": 0.13655368536710738, "num_tokens": 32580146.0, "step": 15060 }, { "entropy": 6.52427453994751, "epoch": 1.6121247792819307, "grad_norm": 1.7421875, "learning_rate": 0.0004747845740761521, "loss": 6.2485, "mean_token_accuracy": 0.13791619762778282, "num_tokens": 32591243.0, "step": 15065 }, { "entropy": 6.557205581665039, "epoch": 1.6126598533896943, "grad_norm": 1.4140625, "learning_rate": 0.0004747669847709631, "loss": 6.3058, "mean_token_accuracy": 0.13091632947325707, "num_tokens": 32602424.0, "step": 15070 }, { "entropy": 6.61011905670166, "epoch": 1.6131949274974584, "grad_norm": 2.140625, "learning_rate": 0.0004747493896975306, "loss": 6.3701, "mean_token_accuracy": 0.12900158390402794, "num_tokens": 32613703.0, "step": 15075 }, { "entropy": 6.564071750640869, "epoch": 1.6137300016052223, "grad_norm": 1.7578125, "learning_rate": 0.0004747317888563625, "loss": 6.3133, "mean_token_accuracy": 0.1308335021138191, "num_tokens": 32624371.0, "step": 15080 }, { "entropy": 6.55357985496521, "epoch": 1.6142650757129862, "grad_norm": 2.140625, "learning_rate": 0.00047471418224796704, "loss": 6.2554, "mean_token_accuracy": 0.13879068642854692, "num_tokens": 32634039.0, "step": 15085 }, { "entropy": 6.536784744262695, "epoch": 1.6148001498207503, "grad_norm": 1.75, "learning_rate": 0.0004746965698728526, "loss": 6.2549, "mean_token_accuracy": 0.1380273535847664, "num_tokens": 32644644.0, "step": 15090 }, { "entropy": 6.567042064666748, "epoch": 1.6153352239285141, "grad_norm": 1.8046875, "learning_rate": 0.00047467895173152787, "loss": 6.3026, "mean_token_accuracy": 0.13522871881723403, "num_tokens": 32655961.0, "step": 15095 }, { "entropy": 6.488573694229126, "epoch": 1.615870298036278, "grad_norm": 1.53125, "learning_rate": 0.00047466132782450146, "loss": 6.1815, "mean_token_accuracy": 0.14545413851737976, "num_tokens": 32665506.0, "step": 15100 }, { "entropy": 6.465070581436157, "epoch": 1.616405372144042, "grad_norm": 1.4375, "learning_rate": 0.00047464369815228215, "loss": 6.2209, "mean_token_accuracy": 0.13768779933452607, "num_tokens": 32676278.0, "step": 15105 }, { "entropy": 6.525582218170166, "epoch": 1.6169404462518058, "grad_norm": 1.40625, "learning_rate": 0.0004746260627153792, "loss": 6.2163, "mean_token_accuracy": 0.13862458914518355, "num_tokens": 32686835.0, "step": 15110 }, { "entropy": 6.599107980728149, "epoch": 1.6174755203595699, "grad_norm": 1.7734375, "learning_rate": 0.00047460842151430166, "loss": 6.3484, "mean_token_accuracy": 0.1358664244413376, "num_tokens": 32696856.0, "step": 15115 }, { "entropy": 6.569884347915649, "epoch": 1.6180105944673338, "grad_norm": 1.796875, "learning_rate": 0.00047459077454955914, "loss": 6.2876, "mean_token_accuracy": 0.13096022456884385, "num_tokens": 32707514.0, "step": 15120 }, { "entropy": 6.548951768875122, "epoch": 1.6185456685750976, "grad_norm": 1.5390625, "learning_rate": 0.00047457312182166094, "loss": 6.3643, "mean_token_accuracy": 0.12981587499380112, "num_tokens": 32718934.0, "step": 15125 }, { "entropy": 6.544709396362305, "epoch": 1.6190807426828617, "grad_norm": 1.5, "learning_rate": 0.0004745554633311169, "loss": 6.2519, "mean_token_accuracy": 0.13406705260276794, "num_tokens": 32729249.0, "step": 15130 }, { "entropy": 6.551851797103882, "epoch": 1.6196158167906254, "grad_norm": 2.046875, "learning_rate": 0.00047453779907843686, "loss": 6.3175, "mean_token_accuracy": 0.12954918518662453, "num_tokens": 32739948.0, "step": 15135 }, { "entropy": 6.527648115158081, "epoch": 1.6201508908983895, "grad_norm": 1.5390625, "learning_rate": 0.00047452012906413105, "loss": 6.3137, "mean_token_accuracy": 0.13055140003561974, "num_tokens": 32751482.0, "step": 15140 }, { "entropy": 6.499547004699707, "epoch": 1.6206859650061534, "grad_norm": 1.40625, "learning_rate": 0.00047450245328870943, "loss": 6.1504, "mean_token_accuracy": 0.14658984839916228, "num_tokens": 32761260.0, "step": 15145 }, { "entropy": 6.502904844284058, "epoch": 1.6212210391139172, "grad_norm": 1.7109375, "learning_rate": 0.00047448477175268255, "loss": 6.2691, "mean_token_accuracy": 0.13591463193297387, "num_tokens": 32772684.0, "step": 15150 }, { "entropy": 6.370807075500489, "epoch": 1.6217561132216813, "grad_norm": 1.296875, "learning_rate": 0.00047446708445656095, "loss": 6.0788, "mean_token_accuracy": 0.15149276256561278, "num_tokens": 32784022.0, "step": 15155 }, { "entropy": 6.514007139205932, "epoch": 1.622291187329445, "grad_norm": 1.390625, "learning_rate": 0.0004744493914008552, "loss": 6.2129, "mean_token_accuracy": 0.13973695337772368, "num_tokens": 32794104.0, "step": 15160 }, { "entropy": 6.574914264678955, "epoch": 1.622826261437209, "grad_norm": 1.375, "learning_rate": 0.0004744316925860764, "loss": 6.1906, "mean_token_accuracy": 0.14187313616275787, "num_tokens": 32804038.0, "step": 15165 }, { "entropy": 6.470356845855713, "epoch": 1.623361335544973, "grad_norm": 1.6328125, "learning_rate": 0.0004744139880127355, "loss": 6.2865, "mean_token_accuracy": 0.13450952768325805, "num_tokens": 32815620.0, "step": 15170 }, { "entropy": 6.478771495819092, "epoch": 1.6238964096527368, "grad_norm": 1.453125, "learning_rate": 0.00047439627768134366, "loss": 6.1972, "mean_token_accuracy": 0.14077696353197097, "num_tokens": 32826353.0, "step": 15175 }, { "entropy": 6.505884885787964, "epoch": 1.624431483760501, "grad_norm": 1.578125, "learning_rate": 0.0004743785615924124, "loss": 6.3058, "mean_token_accuracy": 0.13557258620858192, "num_tokens": 32836582.0, "step": 15180 }, { "entropy": 6.511706876754761, "epoch": 1.6249665578682646, "grad_norm": 1.4296875, "learning_rate": 0.0004743608397464531, "loss": 6.2568, "mean_token_accuracy": 0.13595101088285447, "num_tokens": 32848073.0, "step": 15185 }, { "entropy": 6.5341103076934814, "epoch": 1.6255016319760287, "grad_norm": 1.375, "learning_rate": 0.00047434311214397765, "loss": 6.2956, "mean_token_accuracy": 0.1354230597615242, "num_tokens": 32857839.0, "step": 15190 }, { "entropy": 6.495816612243653, "epoch": 1.6260367060837926, "grad_norm": 1.8984375, "learning_rate": 0.00047432537878549786, "loss": 6.2163, "mean_token_accuracy": 0.1448695421218872, "num_tokens": 32868087.0, "step": 15195 }, { "entropy": 6.557143068313598, "epoch": 1.6265717801915565, "grad_norm": 1.3203125, "learning_rate": 0.00047430763967152564, "loss": 6.2898, "mean_token_accuracy": 0.13106158301234244, "num_tokens": 32880622.0, "step": 15200 }, { "entropy": 6.61873950958252, "epoch": 1.6271068542993206, "grad_norm": 1.53125, "learning_rate": 0.00047428989480257337, "loss": 6.2719, "mean_token_accuracy": 0.1311236575245857, "num_tokens": 32891405.0, "step": 15205 }, { "entropy": 6.528134870529175, "epoch": 1.6276419284070842, "grad_norm": 1.71875, "learning_rate": 0.0004742721441791535, "loss": 6.2148, "mean_token_accuracy": 0.1388081818819046, "num_tokens": 32900487.0, "step": 15210 }, { "entropy": 6.432776355743409, "epoch": 1.6281770025148483, "grad_norm": 1.4609375, "learning_rate": 0.0004742543878017784, "loss": 6.1764, "mean_token_accuracy": 0.14578463062644004, "num_tokens": 32912139.0, "step": 15215 }, { "entropy": 6.506275987625122, "epoch": 1.6287120766226122, "grad_norm": 1.4453125, "learning_rate": 0.00047423662567096085, "loss": 6.2642, "mean_token_accuracy": 0.1333197571337223, "num_tokens": 32922972.0, "step": 15220 }, { "entropy": 6.512710762023926, "epoch": 1.629247150730376, "grad_norm": 1.3984375, "learning_rate": 0.00047421885778721376, "loss": 6.206, "mean_token_accuracy": 0.14148302972316742, "num_tokens": 32932609.0, "step": 15225 }, { "entropy": 6.473397874832154, "epoch": 1.6297822248381402, "grad_norm": 1.3828125, "learning_rate": 0.00047420108415105006, "loss": 6.2051, "mean_token_accuracy": 0.1474070742726326, "num_tokens": 32942706.0, "step": 15230 }, { "entropy": 6.515003728866577, "epoch": 1.630317298945904, "grad_norm": 1.75, "learning_rate": 0.00047418330476298317, "loss": 6.2367, "mean_token_accuracy": 0.13718311563134195, "num_tokens": 32952240.0, "step": 15235 }, { "entropy": 6.555767250061035, "epoch": 1.630852373053668, "grad_norm": 2.890625, "learning_rate": 0.0004741655196235262, "loss": 6.2868, "mean_token_accuracy": 0.1296004444360733, "num_tokens": 32963249.0, "step": 15240 }, { "entropy": 6.544875812530518, "epoch": 1.6313874471614318, "grad_norm": 1.5625, "learning_rate": 0.00047414772873319294, "loss": 6.2732, "mean_token_accuracy": 0.14131317362189294, "num_tokens": 32974004.0, "step": 15245 }, { "entropy": 6.5474451065063475, "epoch": 1.6319225212691957, "grad_norm": 1.546875, "learning_rate": 0.000474129932092497, "loss": 6.2414, "mean_token_accuracy": 0.13400815799832344, "num_tokens": 32985236.0, "step": 15250 }, { "entropy": 6.577800703048706, "epoch": 1.6324575953769598, "grad_norm": 1.5, "learning_rate": 0.0004741121297019522, "loss": 6.3035, "mean_token_accuracy": 0.13068798258900644, "num_tokens": 32995155.0, "step": 15255 }, { "entropy": 6.53216872215271, "epoch": 1.6329926694847237, "grad_norm": 1.734375, "learning_rate": 0.00047409432156207264, "loss": 6.284, "mean_token_accuracy": 0.1431720234453678, "num_tokens": 33007562.0, "step": 15260 }, { "entropy": 6.5164182662963865, "epoch": 1.6335277435924875, "grad_norm": 1.5078125, "learning_rate": 0.00047407650767337256, "loss": 6.2507, "mean_token_accuracy": 0.132377927005291, "num_tokens": 33018653.0, "step": 15265 }, { "entropy": 6.605610656738281, "epoch": 1.6340628177002516, "grad_norm": 1.640625, "learning_rate": 0.0004740586880363663, "loss": 6.3493, "mean_token_accuracy": 0.12530876249074935, "num_tokens": 33029470.0, "step": 15270 }, { "entropy": 6.5277331352233885, "epoch": 1.6345978918080153, "grad_norm": 1.5546875, "learning_rate": 0.00047404086265156835, "loss": 6.2094, "mean_token_accuracy": 0.14064295142889022, "num_tokens": 33039597.0, "step": 15275 }, { "entropy": 6.5205522060394285, "epoch": 1.6351329659157794, "grad_norm": 1.5625, "learning_rate": 0.0004740230315194935, "loss": 6.2391, "mean_token_accuracy": 0.1316556826233864, "num_tokens": 33050984.0, "step": 15280 }, { "entropy": 6.524631404876709, "epoch": 1.6356680400235433, "grad_norm": 1.5078125, "learning_rate": 0.00047400519464065656, "loss": 6.3191, "mean_token_accuracy": 0.1310469351708889, "num_tokens": 33062250.0, "step": 15285 }, { "entropy": 6.543263912200928, "epoch": 1.6362031141313071, "grad_norm": 1.5078125, "learning_rate": 0.0004739873520155726, "loss": 6.3471, "mean_token_accuracy": 0.1317575253546238, "num_tokens": 33072129.0, "step": 15290 }, { "entropy": 6.553985691070556, "epoch": 1.6367381882390712, "grad_norm": 1.3984375, "learning_rate": 0.0004739695036447568, "loss": 6.1859, "mean_token_accuracy": 0.1361164018511772, "num_tokens": 33082475.0, "step": 15295 }, { "entropy": 6.4877923965454105, "epoch": 1.637273262346835, "grad_norm": 1.515625, "learning_rate": 0.00047395164952872455, "loss": 6.2363, "mean_token_accuracy": 0.14455458000302315, "num_tokens": 33093791.0, "step": 15300 }, { "entropy": 6.51265869140625, "epoch": 1.637808336454599, "grad_norm": 1.234375, "learning_rate": 0.0004739337896679914, "loss": 6.2184, "mean_token_accuracy": 0.14008307158946992, "num_tokens": 33104231.0, "step": 15305 }, { "entropy": 6.52463812828064, "epoch": 1.6383434105623629, "grad_norm": 1.625, "learning_rate": 0.00047391592406307296, "loss": 6.2248, "mean_token_accuracy": 0.13311854079365731, "num_tokens": 33115118.0, "step": 15310 }, { "entropy": 6.545754528045654, "epoch": 1.6388784846701268, "grad_norm": 1.625, "learning_rate": 0.0004738980527144852, "loss": 6.2086, "mean_token_accuracy": 0.143442365527153, "num_tokens": 33126154.0, "step": 15315 }, { "entropy": 6.524981355667114, "epoch": 1.6394135587778909, "grad_norm": 1.5625, "learning_rate": 0.0004738801756227441, "loss": 6.2837, "mean_token_accuracy": 0.1365656517446041, "num_tokens": 33137342.0, "step": 15320 }, { "entropy": 6.469981956481933, "epoch": 1.6399486328856545, "grad_norm": 1.46875, "learning_rate": 0.00047386229278836595, "loss": 6.2488, "mean_token_accuracy": 0.14113932177424432, "num_tokens": 33147661.0, "step": 15325 }, { "entropy": 6.564016675949096, "epoch": 1.6404837069934186, "grad_norm": 2.0625, "learning_rate": 0.00047384440421186695, "loss": 6.2958, "mean_token_accuracy": 0.13328296020627023, "num_tokens": 33157106.0, "step": 15330 }, { "entropy": 6.559274578094483, "epoch": 1.6410187811011825, "grad_norm": 1.3515625, "learning_rate": 0.0004738265098937638, "loss": 6.299, "mean_token_accuracy": 0.13367382884025575, "num_tokens": 33169451.0, "step": 15335 }, { "entropy": 6.596626472473145, "epoch": 1.6415538552089464, "grad_norm": 1.3671875, "learning_rate": 0.000473808609834573, "loss": 6.2857, "mean_token_accuracy": 0.1338217854499817, "num_tokens": 33180799.0, "step": 15340 }, { "entropy": 6.581587791442871, "epoch": 1.6420889293167105, "grad_norm": 1.46875, "learning_rate": 0.00047379070403481165, "loss": 6.3633, "mean_token_accuracy": 0.12887900546193123, "num_tokens": 33191948.0, "step": 15345 }, { "entropy": 6.529717302322387, "epoch": 1.6426240034244743, "grad_norm": 1.34375, "learning_rate": 0.00047377279249499656, "loss": 6.2631, "mean_token_accuracy": 0.1293257676064968, "num_tokens": 33203536.0, "step": 15350 }, { "entropy": 6.542965984344482, "epoch": 1.6431590775322382, "grad_norm": 1.2734375, "learning_rate": 0.0004737548752156451, "loss": 6.2603, "mean_token_accuracy": 0.13613931387662886, "num_tokens": 33214526.0, "step": 15355 }, { "entropy": 6.493067502975464, "epoch": 1.643694151640002, "grad_norm": 2.96875, "learning_rate": 0.0004737369521972745, "loss": 6.2245, "mean_token_accuracy": 0.13954372256994246, "num_tokens": 33226560.0, "step": 15360 }, { "entropy": 6.482340002059937, "epoch": 1.644229225747766, "grad_norm": 1.5234375, "learning_rate": 0.00047371902344040234, "loss": 6.2566, "mean_token_accuracy": 0.13352166935801507, "num_tokens": 33237441.0, "step": 15365 }, { "entropy": 6.506029081344605, "epoch": 1.64476429985553, "grad_norm": 1.4609375, "learning_rate": 0.00047370108894554633, "loss": 6.2135, "mean_token_accuracy": 0.13105529099702834, "num_tokens": 33248229.0, "step": 15370 }, { "entropy": 6.478899192810059, "epoch": 1.645299373963294, "grad_norm": 1.9765625, "learning_rate": 0.0004736831487132243, "loss": 6.1587, "mean_token_accuracy": 0.1475966066122055, "num_tokens": 33258992.0, "step": 15375 }, { "entropy": 6.500133895874024, "epoch": 1.6458344480710578, "grad_norm": 1.421875, "learning_rate": 0.0004736652027439542, "loss": 6.1869, "mean_token_accuracy": 0.13673374876379968, "num_tokens": 33269583.0, "step": 15380 }, { "entropy": 6.548278188705444, "epoch": 1.646369522178822, "grad_norm": 1.5390625, "learning_rate": 0.00047364725103825437, "loss": 6.3114, "mean_token_accuracy": 0.13247542828321457, "num_tokens": 33280236.0, "step": 15385 }, { "entropy": 6.523178243637085, "epoch": 1.6469045962865856, "grad_norm": 1.234375, "learning_rate": 0.000473629293596643, "loss": 6.2145, "mean_token_accuracy": 0.1371418498456478, "num_tokens": 33291327.0, "step": 15390 }, { "entropy": 6.583948993682862, "epoch": 1.6474396703943497, "grad_norm": 1.3125, "learning_rate": 0.00047361133041963873, "loss": 6.3138, "mean_token_accuracy": 0.13246541023254393, "num_tokens": 33302125.0, "step": 15395 }, { "entropy": 6.507024955749512, "epoch": 1.6479747445021136, "grad_norm": 1.703125, "learning_rate": 0.0004735933615077602, "loss": 6.2456, "mean_token_accuracy": 0.13589197397232056, "num_tokens": 33312576.0, "step": 15400 }, { "entropy": 6.500837564468384, "epoch": 1.6485098186098774, "grad_norm": 1.4453125, "learning_rate": 0.00047357538686152627, "loss": 6.2317, "mean_token_accuracy": 0.1352829158306122, "num_tokens": 33322821.0, "step": 15405 }, { "entropy": 6.553674840927124, "epoch": 1.6490448927176415, "grad_norm": 1.5390625, "learning_rate": 0.00047355740648145596, "loss": 6.2807, "mean_token_accuracy": 0.13334212675690651, "num_tokens": 33333951.0, "step": 15410 }, { "entropy": 6.602206516265869, "epoch": 1.6495799668254052, "grad_norm": 1.421875, "learning_rate": 0.0004735394203680684, "loss": 6.2326, "mean_token_accuracy": 0.13933424800634384, "num_tokens": 33344739.0, "step": 15415 }, { "entropy": 6.525042295455933, "epoch": 1.6501150409331693, "grad_norm": 1.5078125, "learning_rate": 0.00047352142852188304, "loss": 6.1946, "mean_token_accuracy": 0.14079620391130448, "num_tokens": 33354956.0, "step": 15420 }, { "entropy": 6.363925170898438, "epoch": 1.6506501150409332, "grad_norm": 1.4765625, "learning_rate": 0.0004735034309434193, "loss": 6.1806, "mean_token_accuracy": 0.14333223477005957, "num_tokens": 33364809.0, "step": 15425 }, { "entropy": 6.555759572982788, "epoch": 1.651185189148697, "grad_norm": 1.359375, "learning_rate": 0.0004734854276331968, "loss": 6.2706, "mean_token_accuracy": 0.14230604097247124, "num_tokens": 33375324.0, "step": 15430 }, { "entropy": 6.5867352962493895, "epoch": 1.6517202632564612, "grad_norm": 1.390625, "learning_rate": 0.00047346741859173564, "loss": 6.342, "mean_token_accuracy": 0.132570631057024, "num_tokens": 33385963.0, "step": 15435 }, { "entropy": 6.571739339828492, "epoch": 1.6522553373642248, "grad_norm": 1.3203125, "learning_rate": 0.0004734494038195555, "loss": 6.3377, "mean_token_accuracy": 0.13507345393300058, "num_tokens": 33395927.0, "step": 15440 }, { "entropy": 6.549274349212647, "epoch": 1.652790411471989, "grad_norm": 1.7890625, "learning_rate": 0.0004734313833171768, "loss": 6.2415, "mean_token_accuracy": 0.13801701590418816, "num_tokens": 33406294.0, "step": 15445 }, { "entropy": 6.4921557903289795, "epoch": 1.6533254855797528, "grad_norm": 1.5234375, "learning_rate": 0.0004734133570851198, "loss": 6.1939, "mean_token_accuracy": 0.14175853729248047, "num_tokens": 33416995.0, "step": 15450 }, { "entropy": 6.4246721267700195, "epoch": 1.6538605596875167, "grad_norm": 1.40625, "learning_rate": 0.0004733953251239049, "loss": 6.1603, "mean_token_accuracy": 0.13845812678337097, "num_tokens": 33428087.0, "step": 15455 }, { "entropy": 6.5247784614562985, "epoch": 1.6543956337952808, "grad_norm": 1.4609375, "learning_rate": 0.0004733772874340529, "loss": 6.3487, "mean_token_accuracy": 0.1310659483075142, "num_tokens": 33439151.0, "step": 15460 }, { "entropy": 6.54686393737793, "epoch": 1.6549307079030444, "grad_norm": 1.625, "learning_rate": 0.0004733592440160846, "loss": 6.2464, "mean_token_accuracy": 0.1391957312822342, "num_tokens": 33449257.0, "step": 15465 }, { "entropy": 6.527724838256836, "epoch": 1.6554657820108085, "grad_norm": 1.640625, "learning_rate": 0.00047334119487052104, "loss": 6.2044, "mean_token_accuracy": 0.13526543900370597, "num_tokens": 33460472.0, "step": 15470 }, { "entropy": 6.489955234527588, "epoch": 1.6560008561185724, "grad_norm": 1.3359375, "learning_rate": 0.00047332313999788334, "loss": 6.2157, "mean_token_accuracy": 0.13044157400727271, "num_tokens": 33470193.0, "step": 15475 }, { "entropy": 6.404095649719238, "epoch": 1.6565359302263363, "grad_norm": 1.3984375, "learning_rate": 0.00047330507939869284, "loss": 6.1541, "mean_token_accuracy": 0.13785995692014694, "num_tokens": 33481098.0, "step": 15480 }, { "entropy": 6.56090350151062, "epoch": 1.6570710043341004, "grad_norm": 2.109375, "learning_rate": 0.000473287013073471, "loss": 6.2291, "mean_token_accuracy": 0.13516671136021613, "num_tokens": 33492514.0, "step": 15485 }, { "entropy": 6.55650486946106, "epoch": 1.6576060784418643, "grad_norm": 1.3359375, "learning_rate": 0.0004732689410227396, "loss": 6.2223, "mean_token_accuracy": 0.13520386070013046, "num_tokens": 33504254.0, "step": 15490 }, { "entropy": 6.490405035018921, "epoch": 1.6581411525496281, "grad_norm": 2.78125, "learning_rate": 0.0004732508632470203, "loss": 6.2386, "mean_token_accuracy": 0.13007647171616554, "num_tokens": 33515101.0, "step": 15495 }, { "entropy": 6.487555599212646, "epoch": 1.658676226657392, "grad_norm": 2.3125, "learning_rate": 0.0004732327797468352, "loss": 6.2507, "mean_token_accuracy": 0.137110199034214, "num_tokens": 33525052.0, "step": 15500 }, { "entropy": 6.578079605102539, "epoch": 1.6592113007651559, "grad_norm": 1.4140625, "learning_rate": 0.0004732146905227065, "loss": 6.384, "mean_token_accuracy": 0.12686768770217896, "num_tokens": 33536841.0, "step": 15505 }, { "entropy": 6.614656734466553, "epoch": 1.65974637487292, "grad_norm": 1.3671875, "learning_rate": 0.0004731965955751564, "loss": 6.2692, "mean_token_accuracy": 0.13630660995841026, "num_tokens": 33547292.0, "step": 15510 }, { "entropy": 6.525318765640259, "epoch": 1.6602814489806839, "grad_norm": 1.2734375, "learning_rate": 0.0004731784949047075, "loss": 6.2056, "mean_token_accuracy": 0.13373274132609367, "num_tokens": 33557674.0, "step": 15515 }, { "entropy": 6.527735948562622, "epoch": 1.6608165230884477, "grad_norm": 1.453125, "learning_rate": 0.0004731603885118824, "loss": 6.2942, "mean_token_accuracy": 0.1279158003628254, "num_tokens": 33568396.0, "step": 15520 }, { "entropy": 6.577741956710815, "epoch": 1.6613515971962118, "grad_norm": 1.3359375, "learning_rate": 0.0004731422763972039, "loss": 6.3323, "mean_token_accuracy": 0.1327934257686138, "num_tokens": 33579688.0, "step": 15525 }, { "entropy": 6.578317785263062, "epoch": 1.6618866713039755, "grad_norm": 1.6875, "learning_rate": 0.00047312415856119505, "loss": 6.354, "mean_token_accuracy": 0.131970302015543, "num_tokens": 33591550.0, "step": 15530 }, { "entropy": 6.561192989349365, "epoch": 1.6624217454117396, "grad_norm": 1.65625, "learning_rate": 0.00047310603500437895, "loss": 6.274, "mean_token_accuracy": 0.1381398282945156, "num_tokens": 33600792.0, "step": 15535 }, { "entropy": 6.4599748134613035, "epoch": 1.6629568195195035, "grad_norm": 1.296875, "learning_rate": 0.00047308790572727895, "loss": 6.2253, "mean_token_accuracy": 0.13727160319685935, "num_tokens": 33611873.0, "step": 15540 }, { "entropy": 6.529527378082276, "epoch": 1.6634918936272673, "grad_norm": 1.2421875, "learning_rate": 0.0004730697707304184, "loss": 6.2658, "mean_token_accuracy": 0.13597349151968957, "num_tokens": 33622960.0, "step": 15545 }, { "entropy": 6.592627620697021, "epoch": 1.6640269677350314, "grad_norm": 1.5859375, "learning_rate": 0.0004730516300143211, "loss": 6.3493, "mean_token_accuracy": 0.13005867078900338, "num_tokens": 33635391.0, "step": 15550 }, { "entropy": 6.593164157867432, "epoch": 1.664562041842795, "grad_norm": 1.6171875, "learning_rate": 0.0004730334835795109, "loss": 6.2714, "mean_token_accuracy": 0.13071415051817895, "num_tokens": 33647942.0, "step": 15555 }, { "entropy": 6.55129189491272, "epoch": 1.6650971159505592, "grad_norm": 2.09375, "learning_rate": 0.0004730153314265116, "loss": 6.233, "mean_token_accuracy": 0.13420569971203805, "num_tokens": 33658425.0, "step": 15560 }, { "entropy": 6.494670486450195, "epoch": 1.665632190058323, "grad_norm": 1.375, "learning_rate": 0.0004729971735558475, "loss": 6.2166, "mean_token_accuracy": 0.1414251834154129, "num_tokens": 33669645.0, "step": 15565 }, { "entropy": 6.555915451049804, "epoch": 1.666167264166087, "grad_norm": 1.3984375, "learning_rate": 0.0004729790099680428, "loss": 6.2997, "mean_token_accuracy": 0.1325235716998577, "num_tokens": 33680415.0, "step": 15570 }, { "entropy": 6.485175704956054, "epoch": 1.666702338273851, "grad_norm": 1.28125, "learning_rate": 0.000472960840663622, "loss": 6.3214, "mean_token_accuracy": 0.13352945372462272, "num_tokens": 33691425.0, "step": 15575 }, { "entropy": 6.568507814407349, "epoch": 1.6672374123816147, "grad_norm": 1.6328125, "learning_rate": 0.0004729426656431097, "loss": 6.2727, "mean_token_accuracy": 0.1349485158920288, "num_tokens": 33703845.0, "step": 15580 }, { "entropy": 6.600763368606567, "epoch": 1.6677724864893788, "grad_norm": 1.8125, "learning_rate": 0.0004729244849070308, "loss": 6.2306, "mean_token_accuracy": 0.1353510484099388, "num_tokens": 33714737.0, "step": 15585 }, { "entropy": 6.468076753616333, "epoch": 1.6683075605971427, "grad_norm": 1.296875, "learning_rate": 0.00047290629845591026, "loss": 6.1949, "mean_token_accuracy": 0.1312122106552124, "num_tokens": 33725042.0, "step": 15590 }, { "entropy": 6.511102628707886, "epoch": 1.6688426347049066, "grad_norm": 1.796875, "learning_rate": 0.000472888106290273, "loss": 6.2562, "mean_token_accuracy": 0.13453252837061883, "num_tokens": 33736306.0, "step": 15595 }, { "entropy": 6.615510892868042, "epoch": 1.6693777088126707, "grad_norm": 1.6796875, "learning_rate": 0.00047286990841064467, "loss": 6.313, "mean_token_accuracy": 0.12460464984178543, "num_tokens": 33747327.0, "step": 15600 }, { "entropy": 6.528128290176392, "epoch": 1.6699127829204343, "grad_norm": 1.921875, "learning_rate": 0.0004728517048175504, "loss": 6.2383, "mean_token_accuracy": 0.1368679001927376, "num_tokens": 33757723.0, "step": 15605 }, { "entropy": 6.407970523834228, "epoch": 1.6704478570281984, "grad_norm": 1.625, "learning_rate": 0.000472833495511516, "loss": 6.2012, "mean_token_accuracy": 0.13751262351870536, "num_tokens": 33769958.0, "step": 15610 }, { "entropy": 6.484128856658936, "epoch": 1.6709829311359623, "grad_norm": 1.484375, "learning_rate": 0.00047281528049306727, "loss": 6.2399, "mean_token_accuracy": 0.1377895474433899, "num_tokens": 33780107.0, "step": 15615 }, { "entropy": 6.513759183883667, "epoch": 1.6715180052437262, "grad_norm": 1.65625, "learning_rate": 0.0004727970597627301, "loss": 6.2594, "mean_token_accuracy": 0.1330281265079975, "num_tokens": 33791023.0, "step": 15620 }, { "entropy": 6.469873380661011, "epoch": 1.6720530793514903, "grad_norm": 1.6796875, "learning_rate": 0.0004727788333210305, "loss": 6.2527, "mean_token_accuracy": 0.1425516687333584, "num_tokens": 33801195.0, "step": 15625 }, { "entropy": 6.515677213668823, "epoch": 1.6725881534592542, "grad_norm": 1.6171875, "learning_rate": 0.000472760601168495, "loss": 6.227, "mean_token_accuracy": 0.14181752800941466, "num_tokens": 33812957.0, "step": 15630 }, { "entropy": 6.5297685146331785, "epoch": 1.673123227567018, "grad_norm": 1.84375, "learning_rate": 0.00047274236330564995, "loss": 6.2826, "mean_token_accuracy": 0.13435860499739646, "num_tokens": 33823874.0, "step": 15635 }, { "entropy": 6.525163459777832, "epoch": 1.673658301674782, "grad_norm": 1.5078125, "learning_rate": 0.0004727241197330219, "loss": 6.2398, "mean_token_accuracy": 0.13939717635512353, "num_tokens": 33834284.0, "step": 15640 }, { "entropy": 6.56245265007019, "epoch": 1.6741933757825458, "grad_norm": 1.609375, "learning_rate": 0.0004727058704511376, "loss": 6.2872, "mean_token_accuracy": 0.13500021770596504, "num_tokens": 33845544.0, "step": 15645 }, { "entropy": 6.579645442962646, "epoch": 1.67472844989031, "grad_norm": 1.4921875, "learning_rate": 0.0004726876154605242, "loss": 6.2602, "mean_token_accuracy": 0.1337307557463646, "num_tokens": 33855420.0, "step": 15650 }, { "entropy": 6.535953426361084, "epoch": 1.6752635239980738, "grad_norm": 1.765625, "learning_rate": 0.0004726693547617086, "loss": 6.1453, "mean_token_accuracy": 0.14049242064356804, "num_tokens": 33864904.0, "step": 15655 }, { "entropy": 6.4508716583251955, "epoch": 1.6757985981058376, "grad_norm": 1.484375, "learning_rate": 0.00047265108835521825, "loss": 6.2107, "mean_token_accuracy": 0.13712649717926978, "num_tokens": 33875139.0, "step": 15660 }, { "entropy": 6.452628326416016, "epoch": 1.6763336722136017, "grad_norm": 1.453125, "learning_rate": 0.0004726328162415804, "loss": 6.2418, "mean_token_accuracy": 0.14112431481480597, "num_tokens": 33886401.0, "step": 15665 }, { "entropy": 6.5320008277893065, "epoch": 1.6768687463213654, "grad_norm": 1.609375, "learning_rate": 0.00047261453842132277, "loss": 6.2702, "mean_token_accuracy": 0.1391934409737587, "num_tokens": 33896382.0, "step": 15670 }, { "entropy": 6.561520433425903, "epoch": 1.6774038204291295, "grad_norm": 1.53125, "learning_rate": 0.00047259625489497317, "loss": 6.2252, "mean_token_accuracy": 0.13969543278217317, "num_tokens": 33906403.0, "step": 15675 }, { "entropy": 6.435149383544922, "epoch": 1.6779388945368934, "grad_norm": 1.4765625, "learning_rate": 0.00047257796566305946, "loss": 6.1337, "mean_token_accuracy": 0.13980668783187866, "num_tokens": 33916992.0, "step": 15680 }, { "entropy": 6.529124116897583, "epoch": 1.6784739686446573, "grad_norm": 1.3046875, "learning_rate": 0.0004725596707261097, "loss": 6.2586, "mean_token_accuracy": 0.13304452002048492, "num_tokens": 33927599.0, "step": 15685 }, { "entropy": 6.55642671585083, "epoch": 1.6790090427524214, "grad_norm": 1.6875, "learning_rate": 0.0004725413700846522, "loss": 6.3501, "mean_token_accuracy": 0.1294899970293045, "num_tokens": 33938957.0, "step": 15690 }, { "entropy": 6.5513214588165285, "epoch": 1.679544116860185, "grad_norm": 1.640625, "learning_rate": 0.00047252306373921543, "loss": 6.2424, "mean_token_accuracy": 0.13886384218931197, "num_tokens": 33950169.0, "step": 15695 }, { "entropy": 6.535861158370972, "epoch": 1.680079190967949, "grad_norm": 2.015625, "learning_rate": 0.00047250475169032804, "loss": 6.2468, "mean_token_accuracy": 0.13359253630042076, "num_tokens": 33960800.0, "step": 15700 }, { "entropy": 6.4771155834198, "epoch": 1.680614265075713, "grad_norm": 1.2890625, "learning_rate": 0.0004724864339385185, "loss": 6.3202, "mean_token_accuracy": 0.1288799077272415, "num_tokens": 33973060.0, "step": 15705 }, { "entropy": 6.5491858959198, "epoch": 1.6811493391834769, "grad_norm": 1.3515625, "learning_rate": 0.0004724681104843161, "loss": 6.336, "mean_token_accuracy": 0.13036111146211624, "num_tokens": 33983185.0, "step": 15710 }, { "entropy": 6.601888990402221, "epoch": 1.681684413291241, "grad_norm": 1.4765625, "learning_rate": 0.0004724497813282497, "loss": 6.2704, "mean_token_accuracy": 0.13604292944073676, "num_tokens": 33993373.0, "step": 15715 }, { "entropy": 6.476183605194092, "epoch": 1.6822194873990046, "grad_norm": 1.453125, "learning_rate": 0.0004724314464708486, "loss": 6.1732, "mean_token_accuracy": 0.1464055560529232, "num_tokens": 34005793.0, "step": 15720 }, { "entropy": 6.529676342010498, "epoch": 1.6827545615067687, "grad_norm": 1.4375, "learning_rate": 0.0004724131059126423, "loss": 6.3317, "mean_token_accuracy": 0.1304813355207443, "num_tokens": 34016415.0, "step": 15725 }, { "entropy": 6.5095258235931395, "epoch": 1.6832896356145326, "grad_norm": 1.8125, "learning_rate": 0.00047239475965416016, "loss": 6.1945, "mean_token_accuracy": 0.13945785760879517, "num_tokens": 34026859.0, "step": 15730 }, { "entropy": 6.513905572891235, "epoch": 1.6838247097222965, "grad_norm": 2.53125, "learning_rate": 0.00047237640769593224, "loss": 6.1091, "mean_token_accuracy": 0.15040467530488968, "num_tokens": 34037942.0, "step": 15735 }, { "entropy": 6.506213903427124, "epoch": 1.6843597838300606, "grad_norm": 1.421875, "learning_rate": 0.0004723580500384882, "loss": 6.2223, "mean_token_accuracy": 0.13819267526268958, "num_tokens": 34048659.0, "step": 15740 }, { "entropy": 6.464280605316162, "epoch": 1.6848948579378242, "grad_norm": 2.046875, "learning_rate": 0.00047233968668235817, "loss": 6.1974, "mean_token_accuracy": 0.1391046404838562, "num_tokens": 34059961.0, "step": 15745 }, { "entropy": 6.515230655670166, "epoch": 1.6854299320455883, "grad_norm": 1.7578125, "learning_rate": 0.00047232131762807244, "loss": 6.2493, "mean_token_accuracy": 0.1414615035057068, "num_tokens": 34069978.0, "step": 15750 }, { "entropy": 6.545376348495483, "epoch": 1.6859650061533522, "grad_norm": 1.71875, "learning_rate": 0.0004723029428761614, "loss": 6.2716, "mean_token_accuracy": 0.1336756817996502, "num_tokens": 34080301.0, "step": 15755 }, { "entropy": 6.458175468444824, "epoch": 1.686500080261116, "grad_norm": 2.96875, "learning_rate": 0.00047228456242715564, "loss": 6.2515, "mean_token_accuracy": 0.1380471520125866, "num_tokens": 34092376.0, "step": 15760 }, { "entropy": 6.509817409515381, "epoch": 1.6870351543688802, "grad_norm": 1.5859375, "learning_rate": 0.0004722661762815858, "loss": 6.209, "mean_token_accuracy": 0.14321028292179108, "num_tokens": 34102761.0, "step": 15765 }, { "entropy": 6.539234590530396, "epoch": 1.687570228476644, "grad_norm": 2.203125, "learning_rate": 0.0004722477844399829, "loss": 6.2238, "mean_token_accuracy": 0.1323903277516365, "num_tokens": 34113370.0, "step": 15770 }, { "entropy": 6.537856483459473, "epoch": 1.688105302584408, "grad_norm": 1.5, "learning_rate": 0.0004722293869028779, "loss": 6.2491, "mean_token_accuracy": 0.14107812196016312, "num_tokens": 34125038.0, "step": 15775 }, { "entropy": 6.542143440246582, "epoch": 1.6886403766921718, "grad_norm": 1.625, "learning_rate": 0.0004722109836708021, "loss": 6.2806, "mean_token_accuracy": 0.1316600888967514, "num_tokens": 34135595.0, "step": 15780 }, { "entropy": 6.539742279052734, "epoch": 1.6891754507999357, "grad_norm": 1.9453125, "learning_rate": 0.00047219257474428685, "loss": 6.2637, "mean_token_accuracy": 0.1312544487416744, "num_tokens": 34146755.0, "step": 15785 }, { "entropy": 6.484871435165405, "epoch": 1.6897105249076998, "grad_norm": 1.28125, "learning_rate": 0.00047217416012386367, "loss": 6.1226, "mean_token_accuracy": 0.14985355362296104, "num_tokens": 34158465.0, "step": 15790 }, { "entropy": 6.510846424102783, "epoch": 1.6902455990154637, "grad_norm": 1.359375, "learning_rate": 0.0004721557398100644, "loss": 6.2226, "mean_token_accuracy": 0.13456518054008484, "num_tokens": 34170007.0, "step": 15795 }, { "entropy": 6.538952875137329, "epoch": 1.6907806731232276, "grad_norm": 1.578125, "learning_rate": 0.00047213731380342077, "loss": 6.304, "mean_token_accuracy": 0.1294082783162594, "num_tokens": 34181595.0, "step": 15800 }, { "entropy": 6.546925115585327, "epoch": 1.6913157472309917, "grad_norm": 1.453125, "learning_rate": 0.000472118882104465, "loss": 6.2689, "mean_token_accuracy": 0.13665975481271744, "num_tokens": 34191791.0, "step": 15805 }, { "entropy": 6.549110746383667, "epoch": 1.6918508213387553, "grad_norm": 1.6171875, "learning_rate": 0.00047210044471372915, "loss": 6.1673, "mean_token_accuracy": 0.13872140422463416, "num_tokens": 34202636.0, "step": 15810 }, { "entropy": 6.570005178451538, "epoch": 1.6923858954465194, "grad_norm": 1.546875, "learning_rate": 0.0004720820016317456, "loss": 6.3077, "mean_token_accuracy": 0.13125923350453378, "num_tokens": 34213333.0, "step": 15815 }, { "entropy": 6.547509574890137, "epoch": 1.6929209695542833, "grad_norm": 1.3671875, "learning_rate": 0.000472063552859047, "loss": 6.2655, "mean_token_accuracy": 0.1336832843720913, "num_tokens": 34223679.0, "step": 15820 }, { "entropy": 6.515771150588989, "epoch": 1.6934560436620472, "grad_norm": 1.4921875, "learning_rate": 0.00047204509839616604, "loss": 6.3751, "mean_token_accuracy": 0.12890572771430014, "num_tokens": 34234528.0, "step": 15825 }, { "entropy": 6.502412509918213, "epoch": 1.6939911177698113, "grad_norm": 1.2109375, "learning_rate": 0.0004720266382436355, "loss": 6.1929, "mean_token_accuracy": 0.13582652881741525, "num_tokens": 34246203.0, "step": 15830 }, { "entropy": 6.513867616653442, "epoch": 1.694526191877575, "grad_norm": 2.234375, "learning_rate": 0.00047200817240198846, "loss": 6.1978, "mean_token_accuracy": 0.13635388165712356, "num_tokens": 34257231.0, "step": 15835 }, { "entropy": 6.518395709991455, "epoch": 1.695061265985339, "grad_norm": 1.625, "learning_rate": 0.00047198970087175817, "loss": 6.2256, "mean_token_accuracy": 0.13498940616846083, "num_tokens": 34268900.0, "step": 15840 }, { "entropy": 6.494491291046143, "epoch": 1.695596340093103, "grad_norm": 1.4140625, "learning_rate": 0.0004719712236534779, "loss": 6.2955, "mean_token_accuracy": 0.12909621819853784, "num_tokens": 34279343.0, "step": 15845 }, { "entropy": 6.494324111938477, "epoch": 1.6961314142008668, "grad_norm": 1.4453125, "learning_rate": 0.0004719527407476812, "loss": 6.2459, "mean_token_accuracy": 0.1420057773590088, "num_tokens": 34291952.0, "step": 15850 }, { "entropy": 6.555724811553955, "epoch": 1.6966664883086309, "grad_norm": 1.5, "learning_rate": 0.00047193425215490186, "loss": 6.266, "mean_token_accuracy": 0.1280573323369026, "num_tokens": 34302516.0, "step": 15855 }, { "entropy": 6.5335493087768555, "epoch": 1.6972015624163945, "grad_norm": 1.625, "learning_rate": 0.00047191575787567373, "loss": 6.1908, "mean_token_accuracy": 0.1397932641208172, "num_tokens": 34313094.0, "step": 15860 }, { "entropy": 6.547899580001831, "epoch": 1.6977366365241586, "grad_norm": 1.3125, "learning_rate": 0.0004718972579105306, "loss": 6.3164, "mean_token_accuracy": 0.13232587426900863, "num_tokens": 34324803.0, "step": 15865 }, { "entropy": 6.49736008644104, "epoch": 1.6982717106319225, "grad_norm": 1.40625, "learning_rate": 0.0004718787522600069, "loss": 6.279, "mean_token_accuracy": 0.12415364533662795, "num_tokens": 34336386.0, "step": 15870 }, { "entropy": 6.550452852249146, "epoch": 1.6988067847396864, "grad_norm": 1.40625, "learning_rate": 0.0004718602409246369, "loss": 6.2936, "mean_token_accuracy": 0.12681039273738862, "num_tokens": 34347085.0, "step": 15875 }, { "entropy": 6.48975772857666, "epoch": 1.6993418588474505, "grad_norm": 1.5625, "learning_rate": 0.00047184172390495505, "loss": 6.2184, "mean_token_accuracy": 0.1400773286819458, "num_tokens": 34358146.0, "step": 15880 }, { "entropy": 6.538142299652099, "epoch": 1.6998769329552141, "grad_norm": 1.5859375, "learning_rate": 0.0004718232012014961, "loss": 6.2662, "mean_token_accuracy": 0.1347523719072342, "num_tokens": 34370403.0, "step": 15885 }, { "entropy": 6.582979202270508, "epoch": 1.7004120070629782, "grad_norm": 1.9765625, "learning_rate": 0.00047180467281479496, "loss": 6.2494, "mean_token_accuracy": 0.1374131441116333, "num_tokens": 34381130.0, "step": 15890 }, { "entropy": 6.479326438903809, "epoch": 1.7009470811707421, "grad_norm": 1.4609375, "learning_rate": 0.0004717861387453865, "loss": 6.2961, "mean_token_accuracy": 0.13613806441426277, "num_tokens": 34391610.0, "step": 15895 }, { "entropy": 6.517370939254761, "epoch": 1.701482155278506, "grad_norm": 1.3671875, "learning_rate": 0.0004717675989938059, "loss": 6.2606, "mean_token_accuracy": 0.13521123230457305, "num_tokens": 34402262.0, "step": 15900 }, { "entropy": 6.533929634094238, "epoch": 1.70201722938627, "grad_norm": 1.4453125, "learning_rate": 0.00047174905356058857, "loss": 6.2611, "mean_token_accuracy": 0.13481214940547942, "num_tokens": 34412707.0, "step": 15905 }, { "entropy": 6.501676940917969, "epoch": 1.702552303494034, "grad_norm": 2.109375, "learning_rate": 0.00047173050244626993, "loss": 6.1814, "mean_token_accuracy": 0.14371191561222077, "num_tokens": 34423203.0, "step": 15910 }, { "entropy": 6.498485040664673, "epoch": 1.7030873776017978, "grad_norm": 1.40625, "learning_rate": 0.0004717119456513857, "loss": 6.278, "mean_token_accuracy": 0.13548828661441803, "num_tokens": 34433279.0, "step": 15915 }, { "entropy": 6.535174369812012, "epoch": 1.7036224517095617, "grad_norm": 1.875, "learning_rate": 0.00047169338317647164, "loss": 6.3336, "mean_token_accuracy": 0.13515316545963288, "num_tokens": 34444601.0, "step": 15920 }, { "entropy": 6.563399600982666, "epoch": 1.7041575258173256, "grad_norm": 1.6015625, "learning_rate": 0.00047167481502206383, "loss": 6.2541, "mean_token_accuracy": 0.13447251841425895, "num_tokens": 34455103.0, "step": 15925 }, { "entropy": 6.5051501274108885, "epoch": 1.7046925999250897, "grad_norm": 1.3671875, "learning_rate": 0.00047165624118869834, "loss": 6.2859, "mean_token_accuracy": 0.1337140329182148, "num_tokens": 34465835.0, "step": 15930 }, { "entropy": 6.628179454803467, "epoch": 1.7052276740328536, "grad_norm": 1.7578125, "learning_rate": 0.0004716376616769115, "loss": 6.319, "mean_token_accuracy": 0.13249458372592926, "num_tokens": 34476602.0, "step": 15935 }, { "entropy": 6.5752206325531, "epoch": 1.7057627481406175, "grad_norm": 1.3828125, "learning_rate": 0.0004716190764872399, "loss": 6.2112, "mean_token_accuracy": 0.13616498783230782, "num_tokens": 34488026.0, "step": 15940 }, { "entropy": 6.512110948562622, "epoch": 1.7062978222483816, "grad_norm": 1.40625, "learning_rate": 0.00047160048562022006, "loss": 6.2999, "mean_token_accuracy": 0.1379050388932228, "num_tokens": 34497837.0, "step": 15945 }, { "entropy": 6.486044931411743, "epoch": 1.7068328963561452, "grad_norm": 1.359375, "learning_rate": 0.0004715818890763888, "loss": 6.2503, "mean_token_accuracy": 0.13753306791186332, "num_tokens": 34507727.0, "step": 15950 }, { "entropy": 6.549686336517334, "epoch": 1.7073679704639093, "grad_norm": 1.6484375, "learning_rate": 0.00047156328685628307, "loss": 6.2464, "mean_token_accuracy": 0.1331082597374916, "num_tokens": 34518595.0, "step": 15955 }, { "entropy": 6.456800651550293, "epoch": 1.7079030445716732, "grad_norm": 2.28125, "learning_rate": 0.0004715446789604401, "loss": 6.1895, "mean_token_accuracy": 0.1428788721561432, "num_tokens": 34529415.0, "step": 15960 }, { "entropy": 6.492120552062988, "epoch": 1.708438118679437, "grad_norm": 1.6328125, "learning_rate": 0.0004715260653893972, "loss": 6.2195, "mean_token_accuracy": 0.14320783391594888, "num_tokens": 34539593.0, "step": 15965 }, { "entropy": 6.537639427185058, "epoch": 1.7089731927872012, "grad_norm": 2.34375, "learning_rate": 0.0004715074461436917, "loss": 6.239, "mean_token_accuracy": 0.13498525097966194, "num_tokens": 34549441.0, "step": 15970 }, { "entropy": 6.523940563201904, "epoch": 1.7095082668949648, "grad_norm": 1.5, "learning_rate": 0.00047148882122386126, "loss": 6.186, "mean_token_accuracy": 0.14013878330588342, "num_tokens": 34560211.0, "step": 15975 }, { "entropy": 6.5388068675994875, "epoch": 1.710043341002729, "grad_norm": 2.0, "learning_rate": 0.00047147019063044387, "loss": 6.2895, "mean_token_accuracy": 0.1317762777209282, "num_tokens": 34570479.0, "step": 15980 }, { "entropy": 6.541228723526001, "epoch": 1.7105784151104928, "grad_norm": 1.515625, "learning_rate": 0.00047145155436397726, "loss": 6.2735, "mean_token_accuracy": 0.13681796863675116, "num_tokens": 34581382.0, "step": 15985 }, { "entropy": 6.5268425941467285, "epoch": 1.7111134892182567, "grad_norm": 1.4453125, "learning_rate": 0.0004714329124249996, "loss": 6.206, "mean_token_accuracy": 0.14237518087029458, "num_tokens": 34592131.0, "step": 15990 }, { "entropy": 6.565146017074585, "epoch": 1.7116485633260208, "grad_norm": 2.109375, "learning_rate": 0.0004714142648140492, "loss": 6.3051, "mean_token_accuracy": 0.13531598448753357, "num_tokens": 34604407.0, "step": 15995 }, { "entropy": 6.500683689117432, "epoch": 1.7121836374337844, "grad_norm": 4.875, "learning_rate": 0.0004713956115316645, "loss": 6.1684, "mean_token_accuracy": 0.1376279339194298, "num_tokens": 34614842.0, "step": 16000 }, { "entropy": 6.39294056892395, "epoch": 1.7127187115415485, "grad_norm": 1.4453125, "learning_rate": 0.0004713769525783841, "loss": 6.1313, "mean_token_accuracy": 0.14383530020713806, "num_tokens": 34625991.0, "step": 16005 }, { "entropy": 6.4572838306427, "epoch": 1.7132537856493124, "grad_norm": 1.4453125, "learning_rate": 0.0004713582879547469, "loss": 6.2946, "mean_token_accuracy": 0.13821927458047867, "num_tokens": 34637317.0, "step": 16010 }, { "entropy": 6.557463788986206, "epoch": 1.7137888597570763, "grad_norm": 1.671875, "learning_rate": 0.0004713396176612916, "loss": 6.2749, "mean_token_accuracy": 0.13008446544408797, "num_tokens": 34648282.0, "step": 16015 }, { "entropy": 6.550800371170044, "epoch": 1.7143239338648404, "grad_norm": 1.46875, "learning_rate": 0.0004713209416985575, "loss": 6.2374, "mean_token_accuracy": 0.13565487340092658, "num_tokens": 34658638.0, "step": 16020 }, { "entropy": 6.4996785640716555, "epoch": 1.714859007972604, "grad_norm": 1.3828125, "learning_rate": 0.00047130226006708375, "loss": 6.2597, "mean_token_accuracy": 0.1346914291381836, "num_tokens": 34669308.0, "step": 16025 }, { "entropy": 6.495907831192016, "epoch": 1.7153940820803681, "grad_norm": 1.5859375, "learning_rate": 0.00047128357276740986, "loss": 6.2504, "mean_token_accuracy": 0.13608802780508994, "num_tokens": 34679513.0, "step": 16030 }, { "entropy": 6.542607116699219, "epoch": 1.715929156188132, "grad_norm": 1.8203125, "learning_rate": 0.0004712648798000754, "loss": 6.2512, "mean_token_accuracy": 0.1372469075024128, "num_tokens": 34690736.0, "step": 16035 }, { "entropy": 6.527480745315552, "epoch": 1.716464230295896, "grad_norm": 1.3671875, "learning_rate": 0.00047124618116562003, "loss": 6.2315, "mean_token_accuracy": 0.13630061373114585, "num_tokens": 34701272.0, "step": 16040 }, { "entropy": 6.434833574295044, "epoch": 1.71699930440366, "grad_norm": 1.78125, "learning_rate": 0.0004712274768645839, "loss": 6.1692, "mean_token_accuracy": 0.14119511395692824, "num_tokens": 34712486.0, "step": 16045 }, { "entropy": 6.547205400466919, "epoch": 1.7175343785114239, "grad_norm": 1.3046875, "learning_rate": 0.00047120876689750685, "loss": 6.2375, "mean_token_accuracy": 0.1389646753668785, "num_tokens": 34721979.0, "step": 16050 }, { "entropy": 6.502142906188965, "epoch": 1.7180694526191878, "grad_norm": 1.7578125, "learning_rate": 0.0004711900512649292, "loss": 6.2311, "mean_token_accuracy": 0.13534836918115617, "num_tokens": 34733496.0, "step": 16055 }, { "entropy": 6.52419753074646, "epoch": 1.7186045267269516, "grad_norm": 1.484375, "learning_rate": 0.0004711713299673914, "loss": 6.2565, "mean_token_accuracy": 0.13493360206484795, "num_tokens": 34744223.0, "step": 16060 }, { "entropy": 6.485661029815674, "epoch": 1.7191396008347155, "grad_norm": 1.671875, "learning_rate": 0.00047115260300543407, "loss": 6.2972, "mean_token_accuracy": 0.1354266181588173, "num_tokens": 34754931.0, "step": 16065 }, { "entropy": 6.456936025619507, "epoch": 1.7196746749424796, "grad_norm": 1.796875, "learning_rate": 0.0004711338703795978, "loss": 6.1516, "mean_token_accuracy": 0.14075466692447663, "num_tokens": 34766285.0, "step": 16070 }, { "entropy": 6.499564981460571, "epoch": 1.7202097490502435, "grad_norm": 2.390625, "learning_rate": 0.0004711151320904237, "loss": 6.231, "mean_token_accuracy": 0.14091445803642272, "num_tokens": 34776979.0, "step": 16075 }, { "entropy": 6.55362229347229, "epoch": 1.7207448231580074, "grad_norm": 1.3046875, "learning_rate": 0.0004710963881384527, "loss": 6.3168, "mean_token_accuracy": 0.13049443140625955, "num_tokens": 34787466.0, "step": 16080 }, { "entropy": 6.589805269241333, "epoch": 1.7212798972657715, "grad_norm": 1.71875, "learning_rate": 0.000471077638524226, "loss": 6.2395, "mean_token_accuracy": 0.1367537833750248, "num_tokens": 34797664.0, "step": 16085 }, { "entropy": 6.486291074752808, "epoch": 1.7218149713735351, "grad_norm": 1.6640625, "learning_rate": 0.00047105888324828506, "loss": 6.2177, "mean_token_accuracy": 0.14723237380385398, "num_tokens": 34809082.0, "step": 16090 }, { "entropy": 6.523463010787964, "epoch": 1.7223500454812992, "grad_norm": 1.53125, "learning_rate": 0.00047104012231117143, "loss": 6.2371, "mean_token_accuracy": 0.1389696106314659, "num_tokens": 34820223.0, "step": 16095 }, { "entropy": 6.435459613800049, "epoch": 1.722885119589063, "grad_norm": 1.34375, "learning_rate": 0.00047102135571342683, "loss": 6.1566, "mean_token_accuracy": 0.1369843900203705, "num_tokens": 34830428.0, "step": 16100 }, { "entropy": 6.462934303283691, "epoch": 1.723420193696827, "grad_norm": 1.4140625, "learning_rate": 0.00047100258345559307, "loss": 6.2712, "mean_token_accuracy": 0.1307723380625248, "num_tokens": 34842787.0, "step": 16105 }, { "entropy": 6.507791662216187, "epoch": 1.723955267804591, "grad_norm": 1.3125, "learning_rate": 0.0004709838055382123, "loss": 6.2059, "mean_token_accuracy": 0.13265354037284852, "num_tokens": 34854323.0, "step": 16110 }, { "entropy": 6.4878136157989506, "epoch": 1.7244903419123547, "grad_norm": 1.3203125, "learning_rate": 0.0004709650219618266, "loss": 6.1923, "mean_token_accuracy": 0.13792682066559792, "num_tokens": 34865279.0, "step": 16115 }, { "entropy": 6.48901333808899, "epoch": 1.7250254160201188, "grad_norm": 1.90625, "learning_rate": 0.0004709462327269785, "loss": 6.2201, "mean_token_accuracy": 0.13436542078852654, "num_tokens": 34875951.0, "step": 16120 }, { "entropy": 6.490832757949829, "epoch": 1.7255604901278827, "grad_norm": 1.453125, "learning_rate": 0.0004709274378342105, "loss": 6.2368, "mean_token_accuracy": 0.1372871771454811, "num_tokens": 34885815.0, "step": 16125 }, { "entropy": 6.560395050048828, "epoch": 1.7260955642356466, "grad_norm": 1.4453125, "learning_rate": 0.00047090863728406517, "loss": 6.2759, "mean_token_accuracy": 0.13472879230976104, "num_tokens": 34897158.0, "step": 16130 }, { "entropy": 6.59221568107605, "epoch": 1.7266306383434107, "grad_norm": 1.4296875, "learning_rate": 0.0004708898310770856, "loss": 6.2824, "mean_token_accuracy": 0.1327106237411499, "num_tokens": 34907815.0, "step": 16135 }, { "entropy": 6.531020069122315, "epoch": 1.7271657124511743, "grad_norm": 1.3671875, "learning_rate": 0.0004708710192138146, "loss": 6.237, "mean_token_accuracy": 0.1372152455151081, "num_tokens": 34918820.0, "step": 16140 }, { "entropy": 6.56586446762085, "epoch": 1.7277007865589384, "grad_norm": 2.03125, "learning_rate": 0.0004708522016947954, "loss": 6.3121, "mean_token_accuracy": 0.13564084842801094, "num_tokens": 34929998.0, "step": 16145 }, { "entropy": 6.4926958084106445, "epoch": 1.7282358606667023, "grad_norm": 1.3828125, "learning_rate": 0.0004708333785205715, "loss": 6.2174, "mean_token_accuracy": 0.14865463376045226, "num_tokens": 34940989.0, "step": 16150 }, { "entropy": 6.5131425857543945, "epoch": 1.7287709347744662, "grad_norm": 2.328125, "learning_rate": 0.0004708145496916862, "loss": 6.2268, "mean_token_accuracy": 0.13459616228938104, "num_tokens": 34952433.0, "step": 16155 }, { "entropy": 6.573882055282593, "epoch": 1.7293060088822303, "grad_norm": 1.84375, "learning_rate": 0.00047079571520868344, "loss": 6.2891, "mean_token_accuracy": 0.1309241198003292, "num_tokens": 34963074.0, "step": 16160 }, { "entropy": 6.493603801727295, "epoch": 1.729841082989994, "grad_norm": 1.4765625, "learning_rate": 0.00047077687507210674, "loss": 6.2163, "mean_token_accuracy": 0.1405037112534046, "num_tokens": 34974315.0, "step": 16165 }, { "entropy": 6.457288455963135, "epoch": 1.730376157097758, "grad_norm": 1.5234375, "learning_rate": 0.0004707580292825004, "loss": 6.1575, "mean_token_accuracy": 0.15218150988221169, "num_tokens": 34985059.0, "step": 16170 }, { "entropy": 6.480514097213745, "epoch": 1.730911231205522, "grad_norm": 1.7734375, "learning_rate": 0.0004707391778404085, "loss": 6.3326, "mean_token_accuracy": 0.12655592635273932, "num_tokens": 34996156.0, "step": 16175 }, { "entropy": 6.564816570281982, "epoch": 1.7314463053132858, "grad_norm": 1.8515625, "learning_rate": 0.0004707203207463752, "loss": 6.2518, "mean_token_accuracy": 0.13536330088973045, "num_tokens": 35007410.0, "step": 16180 }, { "entropy": 6.5748625755310055, "epoch": 1.73198137942105, "grad_norm": 1.546875, "learning_rate": 0.0004707014580009453, "loss": 6.2302, "mean_token_accuracy": 0.14098969027400016, "num_tokens": 35018492.0, "step": 16185 }, { "entropy": 6.557524681091309, "epoch": 1.7325164535288138, "grad_norm": 1.6796875, "learning_rate": 0.0004706825896046632, "loss": 6.2829, "mean_token_accuracy": 0.1356653481721878, "num_tokens": 35029923.0, "step": 16190 }, { "entropy": 6.505240440368652, "epoch": 1.7330515276365777, "grad_norm": 1.5, "learning_rate": 0.00047066371555807386, "loss": 6.2046, "mean_token_accuracy": 0.13501440957188607, "num_tokens": 35040370.0, "step": 16195 }, { "entropy": 6.526643562316894, "epoch": 1.7335866017443415, "grad_norm": 1.6015625, "learning_rate": 0.0004706448358617222, "loss": 6.2823, "mean_token_accuracy": 0.1304975025355816, "num_tokens": 35051414.0, "step": 16200 }, { "entropy": 6.581493234634399, "epoch": 1.7341216758521054, "grad_norm": 1.34375, "learning_rate": 0.00047062595051615343, "loss": 6.2024, "mean_token_accuracy": 0.14306259751319886, "num_tokens": 35061015.0, "step": 16205 }, { "entropy": 6.513972759246826, "epoch": 1.7346567499598695, "grad_norm": 1.796875, "learning_rate": 0.0004706070595219128, "loss": 6.2947, "mean_token_accuracy": 0.1341689184308052, "num_tokens": 35071757.0, "step": 16210 }, { "entropy": 6.516111135482788, "epoch": 1.7351918240676334, "grad_norm": 2.0, "learning_rate": 0.00047058816287954587, "loss": 6.2696, "mean_token_accuracy": 0.13728854209184646, "num_tokens": 35082912.0, "step": 16215 }, { "entropy": 6.561192560195923, "epoch": 1.7357268981753973, "grad_norm": 1.640625, "learning_rate": 0.00047056926058959813, "loss": 6.2331, "mean_token_accuracy": 0.1454016536474228, "num_tokens": 35094103.0, "step": 16220 }, { "entropy": 6.521594715118408, "epoch": 1.7362619722831614, "grad_norm": 2.34375, "learning_rate": 0.0004705503526526155, "loss": 6.1875, "mean_token_accuracy": 0.13738676756620408, "num_tokens": 35105960.0, "step": 16225 }, { "entropy": 6.445529317855835, "epoch": 1.736797046390925, "grad_norm": 1.515625, "learning_rate": 0.00047053143906914405, "loss": 6.208, "mean_token_accuracy": 0.14483401402831078, "num_tokens": 35116482.0, "step": 16230 }, { "entropy": 6.52421383857727, "epoch": 1.7373321204986891, "grad_norm": 2.375, "learning_rate": 0.00047051251983972966, "loss": 6.2693, "mean_token_accuracy": 0.1380905956029892, "num_tokens": 35127976.0, "step": 16235 }, { "entropy": 6.5142865657806395, "epoch": 1.737867194606453, "grad_norm": 1.59375, "learning_rate": 0.0004704935949649187, "loss": 6.2711, "mean_token_accuracy": 0.13424955755472184, "num_tokens": 35137712.0, "step": 16240 }, { "entropy": 6.436436986923217, "epoch": 1.7384022687142169, "grad_norm": 2.953125, "learning_rate": 0.0004704746644452577, "loss": 6.176, "mean_token_accuracy": 0.13780921846628189, "num_tokens": 35148524.0, "step": 16245 }, { "entropy": 6.491331481933594, "epoch": 1.738937342821981, "grad_norm": 1.3671875, "learning_rate": 0.00047045572828129323, "loss": 6.2687, "mean_token_accuracy": 0.13721957728266715, "num_tokens": 35159080.0, "step": 16250 }, { "entropy": 6.366399574279785, "epoch": 1.7394724169297446, "grad_norm": 1.21875, "learning_rate": 0.000470436786473572, "loss": 6.1653, "mean_token_accuracy": 0.13959982618689537, "num_tokens": 35169993.0, "step": 16255 }, { "entropy": 6.465382099151611, "epoch": 1.7400074910375087, "grad_norm": 1.578125, "learning_rate": 0.0004704178390226411, "loss": 6.2004, "mean_token_accuracy": 0.13708374574780463, "num_tokens": 35181413.0, "step": 16260 }, { "entropy": 6.476068544387817, "epoch": 1.7405425651452726, "grad_norm": 1.515625, "learning_rate": 0.00047039888592904753, "loss": 6.198, "mean_token_accuracy": 0.14310968890786172, "num_tokens": 35191600.0, "step": 16265 }, { "entropy": 6.515720224380493, "epoch": 1.7410776392530365, "grad_norm": 1.46875, "learning_rate": 0.00047037992719333864, "loss": 6.2098, "mean_token_accuracy": 0.13760415241122245, "num_tokens": 35202535.0, "step": 16270 }, { "entropy": 6.517277812957763, "epoch": 1.7416127133608006, "grad_norm": 1.40625, "learning_rate": 0.00047036096281606176, "loss": 6.2256, "mean_token_accuracy": 0.130896158516407, "num_tokens": 35214798.0, "step": 16275 }, { "entropy": 6.5141020774841305, "epoch": 1.7421477874685642, "grad_norm": 1.5859375, "learning_rate": 0.00047034199279776456, "loss": 6.1867, "mean_token_accuracy": 0.1439959242939949, "num_tokens": 35224870.0, "step": 16280 }, { "entropy": 6.490610218048095, "epoch": 1.7426828615763283, "grad_norm": 2.734375, "learning_rate": 0.0004703230171389948, "loss": 6.2043, "mean_token_accuracy": 0.1389573745429516, "num_tokens": 35235408.0, "step": 16285 }, { "entropy": 6.441397047042846, "epoch": 1.7432179356840922, "grad_norm": 1.703125, "learning_rate": 0.00047030403584030024, "loss": 6.2315, "mean_token_accuracy": 0.14157229885458947, "num_tokens": 35246310.0, "step": 16290 }, { "entropy": 6.481639003753662, "epoch": 1.743753009791856, "grad_norm": 1.5, "learning_rate": 0.0004702850489022292, "loss": 6.2518, "mean_token_accuracy": 0.13529093638062478, "num_tokens": 35257027.0, "step": 16295 }, { "entropy": 6.591700649261474, "epoch": 1.7442880838996202, "grad_norm": 1.5, "learning_rate": 0.00047026605632532976, "loss": 6.2193, "mean_token_accuracy": 0.13825585916638375, "num_tokens": 35267397.0, "step": 16300 }, { "entropy": 6.4336450576782225, "epoch": 1.7448231580073839, "grad_norm": 1.3515625, "learning_rate": 0.00047024705811015045, "loss": 6.163, "mean_token_accuracy": 0.14259003922343255, "num_tokens": 35278775.0, "step": 16305 }, { "entropy": 6.446195077896118, "epoch": 1.745358232115148, "grad_norm": 1.8046875, "learning_rate": 0.0004702280542572397, "loss": 6.1124, "mean_token_accuracy": 0.14629908427596092, "num_tokens": 35288818.0, "step": 16310 }, { "entropy": 6.5565478801727295, "epoch": 1.7458933062229118, "grad_norm": 1.640625, "learning_rate": 0.0004702090447671464, "loss": 6.317, "mean_token_accuracy": 0.1260501079261303, "num_tokens": 35299385.0, "step": 16315 }, { "entropy": 6.503725910186768, "epoch": 1.7464283803306757, "grad_norm": 1.59375, "learning_rate": 0.0004701900296404193, "loss": 6.176, "mean_token_accuracy": 0.14620715752243996, "num_tokens": 35310626.0, "step": 16320 }, { "entropy": 6.545715284347534, "epoch": 1.7469634544384398, "grad_norm": 1.390625, "learning_rate": 0.0004701710088776075, "loss": 6.2858, "mean_token_accuracy": 0.13202030956745148, "num_tokens": 35321615.0, "step": 16325 }, { "entropy": 6.573356199264526, "epoch": 1.7474985285462037, "grad_norm": 1.640625, "learning_rate": 0.00047015198247926025, "loss": 6.2808, "mean_token_accuracy": 0.13973275944590569, "num_tokens": 35332012.0, "step": 16330 }, { "entropy": 6.562140321731567, "epoch": 1.7480336026539676, "grad_norm": 1.4140625, "learning_rate": 0.000470132950445927, "loss": 6.3014, "mean_token_accuracy": 0.12587928250432015, "num_tokens": 35342153.0, "step": 16335 }, { "entropy": 6.530314254760742, "epoch": 1.7485686767617317, "grad_norm": 1.40625, "learning_rate": 0.0004701139127781571, "loss": 6.2257, "mean_token_accuracy": 0.13639529570937156, "num_tokens": 35352858.0, "step": 16340 }, { "entropy": 6.514222860336304, "epoch": 1.7491037508694953, "grad_norm": 1.4921875, "learning_rate": 0.0004700948694765005, "loss": 6.1479, "mean_token_accuracy": 0.14512947499752044, "num_tokens": 35363489.0, "step": 16345 }, { "entropy": 6.55261082649231, "epoch": 1.7496388249772594, "grad_norm": 1.6796875, "learning_rate": 0.0004700758205415069, "loss": 6.3504, "mean_token_accuracy": 0.13262177556753157, "num_tokens": 35375816.0, "step": 16350 }, { "entropy": 6.506987237930298, "epoch": 1.7501738990850233, "grad_norm": 2.859375, "learning_rate": 0.00047005676597372645, "loss": 6.2305, "mean_token_accuracy": 0.13197326436638832, "num_tokens": 35386708.0, "step": 16355 }, { "entropy": 6.4838512420654295, "epoch": 1.7507089731927872, "grad_norm": 2.03125, "learning_rate": 0.00047003770577370925, "loss": 6.2964, "mean_token_accuracy": 0.13025422096252443, "num_tokens": 35397734.0, "step": 16360 }, { "entropy": 6.612907648086548, "epoch": 1.7512440473005513, "grad_norm": 1.6484375, "learning_rate": 0.00047001863994200574, "loss": 6.243, "mean_token_accuracy": 0.13965339437127114, "num_tokens": 35408870.0, "step": 16365 }, { "entropy": 6.496535873413086, "epoch": 1.751779121408315, "grad_norm": 1.6875, "learning_rate": 0.0004699995684791664, "loss": 6.1831, "mean_token_accuracy": 0.1359889529645443, "num_tokens": 35419498.0, "step": 16370 }, { "entropy": 6.436664390563965, "epoch": 1.752314195516079, "grad_norm": 1.71875, "learning_rate": 0.00046998049138574177, "loss": 6.1926, "mean_token_accuracy": 0.14066151529550552, "num_tokens": 35430690.0, "step": 16375 }, { "entropy": 6.455047512054444, "epoch": 1.752849269623843, "grad_norm": 1.7734375, "learning_rate": 0.000469961408662283, "loss": 6.1547, "mean_token_accuracy": 0.14213127717375756, "num_tokens": 35441007.0, "step": 16380 }, { "entropy": 6.447874355316162, "epoch": 1.7533843437316068, "grad_norm": 1.671875, "learning_rate": 0.000469942320309341, "loss": 6.2236, "mean_token_accuracy": 0.14288512840867043, "num_tokens": 35453202.0, "step": 16385 }, { "entropy": 6.465952157974243, "epoch": 1.7539194178393709, "grad_norm": 1.4375, "learning_rate": 0.00046992322632746677, "loss": 6.227, "mean_token_accuracy": 0.14558738470077515, "num_tokens": 35463303.0, "step": 16390 }, { "entropy": 6.510498428344727, "epoch": 1.7544544919471345, "grad_norm": 1.9375, "learning_rate": 0.00046990412671721186, "loss": 6.222, "mean_token_accuracy": 0.14194708690047264, "num_tokens": 35474104.0, "step": 16395 }, { "entropy": 6.53613052368164, "epoch": 1.7549895660548986, "grad_norm": 1.9921875, "learning_rate": 0.0004698850214791276, "loss": 6.2567, "mean_token_accuracy": 0.1344727098941803, "num_tokens": 35486412.0, "step": 16400 }, { "entropy": 6.533957195281983, "epoch": 1.7555246401626625, "grad_norm": 1.5234375, "learning_rate": 0.0004698659106137658, "loss": 6.2316, "mean_token_accuracy": 0.1366186335682869, "num_tokens": 35497505.0, "step": 16405 }, { "entropy": 6.578169441223144, "epoch": 1.7560597142704264, "grad_norm": 5.15625, "learning_rate": 0.0004698467941216782, "loss": 6.2773, "mean_token_accuracy": 0.13750482201576233, "num_tokens": 35508397.0, "step": 16410 }, { "entropy": 6.60500431060791, "epoch": 1.7565947883781905, "grad_norm": 1.6171875, "learning_rate": 0.00046982767200341675, "loss": 6.3211, "mean_token_accuracy": 0.13072726875543594, "num_tokens": 35520261.0, "step": 16415 }, { "entropy": 6.531397581100464, "epoch": 1.7571298624859542, "grad_norm": 1.3359375, "learning_rate": 0.00046980854425953365, "loss": 6.1989, "mean_token_accuracy": 0.13409352228045462, "num_tokens": 35531816.0, "step": 16420 }, { "entropy": 6.530423879623413, "epoch": 1.7576649365937183, "grad_norm": 1.4296875, "learning_rate": 0.0004697894108905813, "loss": 6.2825, "mean_token_accuracy": 0.13641773015260697, "num_tokens": 35542233.0, "step": 16425 }, { "entropy": 6.508632040023803, "epoch": 1.7582000107014821, "grad_norm": 1.5390625, "learning_rate": 0.00046977027189711197, "loss": 6.2112, "mean_token_accuracy": 0.1387732908129692, "num_tokens": 35552881.0, "step": 16430 }, { "entropy": 6.4908287048339846, "epoch": 1.758735084809246, "grad_norm": 1.5625, "learning_rate": 0.0004697511272796785, "loss": 6.1707, "mean_token_accuracy": 0.13812109753489493, "num_tokens": 35562392.0, "step": 16435 }, { "entropy": 6.495633935928344, "epoch": 1.75927015891701, "grad_norm": 2.453125, "learning_rate": 0.0004697319770388335, "loss": 6.2605, "mean_token_accuracy": 0.13243331611156464, "num_tokens": 35574587.0, "step": 16440 }, { "entropy": 6.49248194694519, "epoch": 1.759805233024774, "grad_norm": 1.515625, "learning_rate": 0.0004697128211751301, "loss": 6.1313, "mean_token_accuracy": 0.1406071349978447, "num_tokens": 35585178.0, "step": 16445 }, { "entropy": 6.460205698013306, "epoch": 1.7603403071325379, "grad_norm": 1.5, "learning_rate": 0.0004696936596891213, "loss": 6.1919, "mean_token_accuracy": 0.13646092414855956, "num_tokens": 35595501.0, "step": 16450 }, { "entropy": 6.509033679962158, "epoch": 1.7608753812403017, "grad_norm": 3.703125, "learning_rate": 0.0004696744925813605, "loss": 6.2236, "mean_token_accuracy": 0.13326306268572807, "num_tokens": 35606794.0, "step": 16455 }, { "entropy": 6.5370752811431885, "epoch": 1.7614104553480656, "grad_norm": 1.546875, "learning_rate": 0.0004696553198524011, "loss": 6.2488, "mean_token_accuracy": 0.1357016831636429, "num_tokens": 35618732.0, "step": 16460 }, { "entropy": 6.498097991943359, "epoch": 1.7619455294558297, "grad_norm": 1.640625, "learning_rate": 0.0004696361415027966, "loss": 6.1716, "mean_token_accuracy": 0.1408173367381096, "num_tokens": 35629802.0, "step": 16465 }, { "entropy": 6.475509119033814, "epoch": 1.7624806035635936, "grad_norm": 1.328125, "learning_rate": 0.0004696169575331009, "loss": 6.2751, "mean_token_accuracy": 0.13238577544689178, "num_tokens": 35640826.0, "step": 16470 }, { "entropy": 6.536092138290405, "epoch": 1.7630156776713575, "grad_norm": 1.40625, "learning_rate": 0.000469597767943868, "loss": 6.2726, "mean_token_accuracy": 0.13249727264046668, "num_tokens": 35651613.0, "step": 16475 }, { "entropy": 6.469944190979004, "epoch": 1.7635507517791216, "grad_norm": 1.25, "learning_rate": 0.0004695785727356517, "loss": 6.1309, "mean_token_accuracy": 0.13989657014608384, "num_tokens": 35662334.0, "step": 16480 }, { "entropy": 6.536354923248291, "epoch": 1.7640858258868852, "grad_norm": 1.78125, "learning_rate": 0.0004695593719090066, "loss": 6.2903, "mean_token_accuracy": 0.13316132500767708, "num_tokens": 35673466.0, "step": 16485 }, { "entropy": 6.53029580116272, "epoch": 1.7646208999946493, "grad_norm": 2.421875, "learning_rate": 0.0004695401654644869, "loss": 6.2372, "mean_token_accuracy": 0.13935657143592833, "num_tokens": 35684708.0, "step": 16490 }, { "entropy": 6.461583137512207, "epoch": 1.7651559741024132, "grad_norm": 1.3984375, "learning_rate": 0.00046952095340264727, "loss": 6.1001, "mean_token_accuracy": 0.14150693714618684, "num_tokens": 35694888.0, "step": 16495 }, { "entropy": 6.519178009033203, "epoch": 1.765691048210177, "grad_norm": 1.3515625, "learning_rate": 0.00046950173572404255, "loss": 6.1638, "mean_token_accuracy": 0.13781533762812614, "num_tokens": 35704844.0, "step": 16500 }, { "entropy": 6.50765905380249, "epoch": 1.7662261223179412, "grad_norm": 2.265625, "learning_rate": 0.0004694825124292275, "loss": 6.2534, "mean_token_accuracy": 0.13843735828995704, "num_tokens": 35715468.0, "step": 16505 }, { "entropy": 6.509899616241455, "epoch": 1.7667611964257048, "grad_norm": 1.5078125, "learning_rate": 0.0004694632835187572, "loss": 6.3115, "mean_token_accuracy": 0.13584157973527908, "num_tokens": 35725542.0, "step": 16510 }, { "entropy": 6.535692405700684, "epoch": 1.767296270533469, "grad_norm": 1.40625, "learning_rate": 0.00046944404899318685, "loss": 6.1905, "mean_token_accuracy": 0.1380226269364357, "num_tokens": 35737032.0, "step": 16515 }, { "entropy": 6.53953366279602, "epoch": 1.7678313446412328, "grad_norm": 1.71875, "learning_rate": 0.000469424808853072, "loss": 6.2085, "mean_token_accuracy": 0.1371114008128643, "num_tokens": 35747742.0, "step": 16520 }, { "entropy": 6.465522813796997, "epoch": 1.7683664187489967, "grad_norm": 1.4765625, "learning_rate": 0.0004694055630989681, "loss": 6.1814, "mean_token_accuracy": 0.13816195577383042, "num_tokens": 35757795.0, "step": 16525 }, { "entropy": 6.460051870346069, "epoch": 1.7689014928567608, "grad_norm": 1.796875, "learning_rate": 0.0004693863117314308, "loss": 6.1784, "mean_token_accuracy": 0.1464919239282608, "num_tokens": 35767962.0, "step": 16530 }, { "entropy": 6.489283609390259, "epoch": 1.7694365669645244, "grad_norm": 1.4609375, "learning_rate": 0.0004693670547510161, "loss": 6.2793, "mean_token_accuracy": 0.13113914132118226, "num_tokens": 35778564.0, "step": 16535 }, { "entropy": 6.5667181491851805, "epoch": 1.7699716410722885, "grad_norm": 1.65625, "learning_rate": 0.00046934779215828006, "loss": 6.2191, "mean_token_accuracy": 0.14195646718144417, "num_tokens": 35788417.0, "step": 16540 }, { "entropy": 6.496956443786621, "epoch": 1.7705067151800524, "grad_norm": 1.4375, "learning_rate": 0.0004693285239537788, "loss": 6.2486, "mean_token_accuracy": 0.13466702327132224, "num_tokens": 35799724.0, "step": 16545 }, { "entropy": 6.557682847976684, "epoch": 1.7710417892878163, "grad_norm": 1.5, "learning_rate": 0.00046930925013806873, "loss": 6.1728, "mean_token_accuracy": 0.1405516743659973, "num_tokens": 35810306.0, "step": 16550 }, { "entropy": 6.579492568969727, "epoch": 1.7715768633955804, "grad_norm": 1.34375, "learning_rate": 0.0004692899707117064, "loss": 6.2244, "mean_token_accuracy": 0.13569827675819396, "num_tokens": 35821103.0, "step": 16555 }, { "entropy": 6.487555932998657, "epoch": 1.772111937503344, "grad_norm": 1.2890625, "learning_rate": 0.0004692706856752484, "loss": 6.2226, "mean_token_accuracy": 0.14339053258299828, "num_tokens": 35832271.0, "step": 16560 }, { "entropy": 6.505621671676636, "epoch": 1.7726470116111082, "grad_norm": 1.40625, "learning_rate": 0.00046925139502925167, "loss": 6.2647, "mean_token_accuracy": 0.13330883160233498, "num_tokens": 35843875.0, "step": 16565 }, { "entropy": 6.5568187713623045, "epoch": 1.773182085718872, "grad_norm": 1.859375, "learning_rate": 0.0004692320987742732, "loss": 6.2508, "mean_token_accuracy": 0.13371218591928483, "num_tokens": 35854085.0, "step": 16570 }, { "entropy": 6.614805221557617, "epoch": 1.773717159826636, "grad_norm": 1.6875, "learning_rate": 0.0004692127969108702, "loss": 6.2952, "mean_token_accuracy": 0.13505346402525903, "num_tokens": 35864777.0, "step": 16575 }, { "entropy": 6.561323356628418, "epoch": 1.7742522339344, "grad_norm": 1.3125, "learning_rate": 0.0004691934894396, "loss": 6.3012, "mean_token_accuracy": 0.13224760219454765, "num_tokens": 35876822.0, "step": 16580 }, { "entropy": 6.579904937744141, "epoch": 1.774787308042164, "grad_norm": 1.6875, "learning_rate": 0.00046917417636102, "loss": 6.1893, "mean_token_accuracy": 0.14425080120563508, "num_tokens": 35886997.0, "step": 16585 }, { "entropy": 6.514540147781372, "epoch": 1.7753223821499278, "grad_norm": 2.15625, "learning_rate": 0.000469154857675688, "loss": 6.2636, "mean_token_accuracy": 0.13917053490877151, "num_tokens": 35897871.0, "step": 16590 }, { "entropy": 6.437257766723633, "epoch": 1.7758574562576916, "grad_norm": 1.625, "learning_rate": 0.0004691355333841617, "loss": 6.2309, "mean_token_accuracy": 0.14573031067848205, "num_tokens": 35908791.0, "step": 16595 }, { "entropy": 6.539524126052856, "epoch": 1.7763925303654555, "grad_norm": 1.7421875, "learning_rate": 0.0004691162034869993, "loss": 6.2875, "mean_token_accuracy": 0.13325378373265268, "num_tokens": 35919436.0, "step": 16600 }, { "entropy": 6.599057722091675, "epoch": 1.7769276044732196, "grad_norm": 1.6484375, "learning_rate": 0.0004690968679847586, "loss": 6.1754, "mean_token_accuracy": 0.14074254035949707, "num_tokens": 35929851.0, "step": 16605 }, { "entropy": 6.528794050216675, "epoch": 1.7774626785809835, "grad_norm": 1.8828125, "learning_rate": 0.0004690775268779983, "loss": 6.2067, "mean_token_accuracy": 0.13964374586939812, "num_tokens": 35940271.0, "step": 16610 }, { "entropy": 6.45616717338562, "epoch": 1.7779977526887474, "grad_norm": 1.65625, "learning_rate": 0.0004690581801672765, "loss": 6.3054, "mean_token_accuracy": 0.12977162078022958, "num_tokens": 35951460.0, "step": 16615 }, { "entropy": 6.472211790084839, "epoch": 1.7785328267965115, "grad_norm": 1.59375, "learning_rate": 0.00046903882785315215, "loss": 6.1867, "mean_token_accuracy": 0.13858510851860045, "num_tokens": 35961530.0, "step": 16620 }, { "entropy": 6.500081157684326, "epoch": 1.7790679009042751, "grad_norm": 1.7890625, "learning_rate": 0.0004690194699361839, "loss": 6.1584, "mean_token_accuracy": 0.15004311949014665, "num_tokens": 35971085.0, "step": 16625 }, { "entropy": 6.478543996810913, "epoch": 1.7796029750120392, "grad_norm": 1.8828125, "learning_rate": 0.00046900010641693073, "loss": 6.2366, "mean_token_accuracy": 0.1306772880256176, "num_tokens": 35981393.0, "step": 16630 }, { "entropy": 6.47922649383545, "epoch": 1.7801380491198031, "grad_norm": 2.046875, "learning_rate": 0.0004689807372959517, "loss": 6.1911, "mean_token_accuracy": 0.13808380663394929, "num_tokens": 35992847.0, "step": 16635 }, { "entropy": 6.471188974380493, "epoch": 1.780673123227567, "grad_norm": 1.59375, "learning_rate": 0.00046896136257380615, "loss": 6.225, "mean_token_accuracy": 0.1351441413164139, "num_tokens": 36002991.0, "step": 16640 }, { "entropy": 6.500436925888062, "epoch": 1.781208197335331, "grad_norm": 1.7109375, "learning_rate": 0.00046894198225105356, "loss": 6.257, "mean_token_accuracy": 0.1417154736816883, "num_tokens": 36015140.0, "step": 16645 }, { "entropy": 6.471897602081299, "epoch": 1.7817432714430947, "grad_norm": 1.8515625, "learning_rate": 0.0004689225963282534, "loss": 6.1423, "mean_token_accuracy": 0.1382371798157692, "num_tokens": 36026014.0, "step": 16650 }, { "entropy": 6.607560014724731, "epoch": 1.7822783455508588, "grad_norm": 1.6875, "learning_rate": 0.0004689032048059656, "loss": 6.2989, "mean_token_accuracy": 0.13198384642601013, "num_tokens": 36035926.0, "step": 16655 }, { "entropy": 6.506697368621826, "epoch": 1.7828134196586227, "grad_norm": 1.625, "learning_rate": 0.00046888380768475, "loss": 6.2169, "mean_token_accuracy": 0.14066673815250397, "num_tokens": 36046406.0, "step": 16660 }, { "entropy": 6.467809438705444, "epoch": 1.7833484937663866, "grad_norm": 2.296875, "learning_rate": 0.0004688644049651667, "loss": 6.1642, "mean_token_accuracy": 0.14082129970192908, "num_tokens": 36056440.0, "step": 16665 }, { "entropy": 6.491926813125611, "epoch": 1.7838835678741507, "grad_norm": 1.453125, "learning_rate": 0.00046884499664777586, "loss": 6.2515, "mean_token_accuracy": 0.13191643580794335, "num_tokens": 36067244.0, "step": 16670 }, { "entropy": 6.499668931961059, "epoch": 1.7844186419819144, "grad_norm": 3.328125, "learning_rate": 0.0004688255827331381, "loss": 6.1558, "mean_token_accuracy": 0.14353570342063904, "num_tokens": 36078110.0, "step": 16675 }, { "entropy": 6.489797687530517, "epoch": 1.7849537160896785, "grad_norm": 1.453125, "learning_rate": 0.0004688061632218137, "loss": 6.2545, "mean_token_accuracy": 0.13878354877233506, "num_tokens": 36088805.0, "step": 16680 }, { "entropy": 6.5043909549713135, "epoch": 1.7854887901974423, "grad_norm": 2.5, "learning_rate": 0.00046878673811436375, "loss": 6.2106, "mean_token_accuracy": 0.14111408069729806, "num_tokens": 36098619.0, "step": 16685 }, { "entropy": 6.577878761291504, "epoch": 1.7860238643052062, "grad_norm": 2.046875, "learning_rate": 0.0004687673074113489, "loss": 6.2761, "mean_token_accuracy": 0.13543611243367196, "num_tokens": 36110604.0, "step": 16690 }, { "entropy": 6.630790567398071, "epoch": 1.7865589384129703, "grad_norm": 1.640625, "learning_rate": 0.0004687478711133303, "loss": 6.276, "mean_token_accuracy": 0.13638934642076492, "num_tokens": 36121669.0, "step": 16695 }, { "entropy": 6.3852990627288815, "epoch": 1.787094012520734, "grad_norm": 1.7109375, "learning_rate": 0.0004687284292208691, "loss": 6.055, "mean_token_accuracy": 0.15399005711078645, "num_tokens": 36132165.0, "step": 16700 }, { "entropy": 6.428806734085083, "epoch": 1.787629086628498, "grad_norm": 1.59375, "learning_rate": 0.00046870898173452676, "loss": 6.2031, "mean_token_accuracy": 0.140548275411129, "num_tokens": 36142830.0, "step": 16705 }, { "entropy": 6.477385234832764, "epoch": 1.788164160736262, "grad_norm": 2.34375, "learning_rate": 0.0004686895286548648, "loss": 6.1832, "mean_token_accuracy": 0.1369605541229248, "num_tokens": 36153812.0, "step": 16710 }, { "entropy": 6.511514568328858, "epoch": 1.7886992348440258, "grad_norm": 1.71875, "learning_rate": 0.00046867006998244494, "loss": 6.2327, "mean_token_accuracy": 0.1401585191488266, "num_tokens": 36163599.0, "step": 16715 }, { "entropy": 6.5018744468688965, "epoch": 1.78923430895179, "grad_norm": 1.6171875, "learning_rate": 0.00046865060571782896, "loss": 6.2433, "mean_token_accuracy": 0.13398018553853036, "num_tokens": 36173815.0, "step": 16720 }, { "entropy": 6.63695878982544, "epoch": 1.7897693830595538, "grad_norm": 1.765625, "learning_rate": 0.00046863113586157894, "loss": 6.3294, "mean_token_accuracy": 0.1324778087437153, "num_tokens": 36186131.0, "step": 16725 }, { "entropy": 6.553009986877441, "epoch": 1.7903044571673177, "grad_norm": 1.8046875, "learning_rate": 0.0004686116604142572, "loss": 6.1798, "mean_token_accuracy": 0.14324358105659485, "num_tokens": 36196084.0, "step": 16730 }, { "entropy": 6.467611074447632, "epoch": 1.7908395312750816, "grad_norm": 2.03125, "learning_rate": 0.0004685921793764259, "loss": 6.16, "mean_token_accuracy": 0.14632472023367882, "num_tokens": 36206948.0, "step": 16735 }, { "entropy": 6.550565099716186, "epoch": 1.7913746053828454, "grad_norm": 2.078125, "learning_rate": 0.0004685726927486476, "loss": 6.286, "mean_token_accuracy": 0.1330634005367756, "num_tokens": 36217202.0, "step": 16740 }, { "entropy": 6.596937656402588, "epoch": 1.7919096794906095, "grad_norm": 1.5703125, "learning_rate": 0.00046855320053148505, "loss": 6.3181, "mean_token_accuracy": 0.1310865469276905, "num_tokens": 36227914.0, "step": 16745 }, { "entropy": 6.573777103424073, "epoch": 1.7924447535983734, "grad_norm": 1.5546875, "learning_rate": 0.000468533702725501, "loss": 6.2627, "mean_token_accuracy": 0.13632940426468848, "num_tokens": 36239344.0, "step": 16750 }, { "entropy": 6.520642805099487, "epoch": 1.7929798277061373, "grad_norm": 1.5703125, "learning_rate": 0.00046851419933125843, "loss": 6.2837, "mean_token_accuracy": 0.13871801942586898, "num_tokens": 36250438.0, "step": 16755 }, { "entropy": 6.513595962524414, "epoch": 1.7935149018139014, "grad_norm": 1.6640625, "learning_rate": 0.0004684946903493206, "loss": 6.2462, "mean_token_accuracy": 0.13100792467594147, "num_tokens": 36260545.0, "step": 16760 }, { "entropy": 6.419894027709961, "epoch": 1.794049975921665, "grad_norm": 1.6015625, "learning_rate": 0.0004684751757802508, "loss": 6.1416, "mean_token_accuracy": 0.14160364121198654, "num_tokens": 36272577.0, "step": 16765 }, { "entropy": 6.516346645355225, "epoch": 1.7945850500294291, "grad_norm": 2.375, "learning_rate": 0.00046845565562461243, "loss": 6.1902, "mean_token_accuracy": 0.14187682345509528, "num_tokens": 36284161.0, "step": 16770 }, { "entropy": 6.527055025100708, "epoch": 1.795120124137193, "grad_norm": 1.5234375, "learning_rate": 0.00046843612988296926, "loss": 6.2087, "mean_token_accuracy": 0.13396796360611915, "num_tokens": 36294910.0, "step": 16775 }, { "entropy": 6.552798748016357, "epoch": 1.795655198244957, "grad_norm": 1.328125, "learning_rate": 0.0004684165985558849, "loss": 6.1797, "mean_token_accuracy": 0.13618710413575172, "num_tokens": 36305388.0, "step": 16780 }, { "entropy": 6.4872008800506595, "epoch": 1.796190272352721, "grad_norm": 1.765625, "learning_rate": 0.0004683970616439236, "loss": 6.2451, "mean_token_accuracy": 0.145309716463089, "num_tokens": 36316696.0, "step": 16785 }, { "entropy": 6.467041683197022, "epoch": 1.7967253464604847, "grad_norm": 1.6328125, "learning_rate": 0.0004683775191476492, "loss": 6.1561, "mean_token_accuracy": 0.14676120951771737, "num_tokens": 36327246.0, "step": 16790 }, { "entropy": 6.554820346832275, "epoch": 1.7972604205682488, "grad_norm": 1.9296875, "learning_rate": 0.0004683579710676262, "loss": 6.3159, "mean_token_accuracy": 0.1309548445045948, "num_tokens": 36338089.0, "step": 16795 }, { "entropy": 6.50324125289917, "epoch": 1.7977954946760126, "grad_norm": 1.609375, "learning_rate": 0.00046833841740441886, "loss": 6.2308, "mean_token_accuracy": 0.14037265926599501, "num_tokens": 36350285.0, "step": 16800 }, { "entropy": 6.577779293060303, "epoch": 1.7983305687837765, "grad_norm": 1.9140625, "learning_rate": 0.0004683188581585919, "loss": 6.2266, "mean_token_accuracy": 0.13420821651816367, "num_tokens": 36360431.0, "step": 16805 }, { "entropy": 6.581452989578247, "epoch": 1.7988656428915406, "grad_norm": 1.953125, "learning_rate": 0.0004682992933307101, "loss": 6.1858, "mean_token_accuracy": 0.14042315185070037, "num_tokens": 36371257.0, "step": 16810 }, { "entropy": 6.424906253814697, "epoch": 1.7994007169993043, "grad_norm": 1.3984375, "learning_rate": 0.00046827972292133835, "loss": 6.1612, "mean_token_accuracy": 0.14297413006424903, "num_tokens": 36382613.0, "step": 16815 }, { "entropy": 6.5323937892913815, "epoch": 1.7999357911070684, "grad_norm": 1.6328125, "learning_rate": 0.0004682601469310418, "loss": 6.2386, "mean_token_accuracy": 0.1366001270711422, "num_tokens": 36393799.0, "step": 16820 }, { "entropy": 6.505597305297852, "epoch": 1.8004708652148322, "grad_norm": 1.4765625, "learning_rate": 0.00046824056536038565, "loss": 6.2224, "mean_token_accuracy": 0.13767699897289276, "num_tokens": 36403914.0, "step": 16825 }, { "entropy": 6.4454141616821286, "epoch": 1.8010059393225961, "grad_norm": 1.6171875, "learning_rate": 0.0004682209782099353, "loss": 6.203, "mean_token_accuracy": 0.13994815796613694, "num_tokens": 36415022.0, "step": 16830 }, { "entropy": 6.492913055419922, "epoch": 1.8015410134303602, "grad_norm": 1.3828125, "learning_rate": 0.00046820138548025634, "loss": 6.1447, "mean_token_accuracy": 0.144903202354908, "num_tokens": 36426155.0, "step": 16835 }, { "entropy": 6.520499753952026, "epoch": 1.8020760875381239, "grad_norm": 1.453125, "learning_rate": 0.00046818178717191464, "loss": 6.2141, "mean_token_accuracy": 0.1381929524242878, "num_tokens": 36437345.0, "step": 16840 }, { "entropy": 6.520294523239135, "epoch": 1.802611161645888, "grad_norm": 1.53125, "learning_rate": 0.0004681621832854759, "loss": 6.2415, "mean_token_accuracy": 0.1451305240392685, "num_tokens": 36448634.0, "step": 16845 }, { "entropy": 6.482553720474243, "epoch": 1.8031462357536518, "grad_norm": 1.3046875, "learning_rate": 0.00046814257382150627, "loss": 6.2023, "mean_token_accuracy": 0.14824908673763276, "num_tokens": 36458870.0, "step": 16850 }, { "entropy": 6.526421070098877, "epoch": 1.8036813098614157, "grad_norm": 1.859375, "learning_rate": 0.00046812295878057193, "loss": 6.3182, "mean_token_accuracy": 0.1356567807495594, "num_tokens": 36469865.0, "step": 16855 }, { "entropy": 6.506421089172363, "epoch": 1.8042163839691798, "grad_norm": 1.8046875, "learning_rate": 0.0004681033381632393, "loss": 6.208, "mean_token_accuracy": 0.13496703803539276, "num_tokens": 36480502.0, "step": 16860 }, { "entropy": 6.568086290359497, "epoch": 1.8047514580769437, "grad_norm": 1.359375, "learning_rate": 0.0004680837119700749, "loss": 6.2178, "mean_token_accuracy": 0.13847601637244225, "num_tokens": 36492356.0, "step": 16865 }, { "entropy": 6.469596433639526, "epoch": 1.8052865321847076, "grad_norm": 1.4375, "learning_rate": 0.00046806408020164553, "loss": 6.2064, "mean_token_accuracy": 0.13677831664681434, "num_tokens": 36504659.0, "step": 16870 }, { "entropy": 6.4850420475006105, "epoch": 1.8058216062924715, "grad_norm": 1.421875, "learning_rate": 0.00046804444285851796, "loss": 6.1926, "mean_token_accuracy": 0.13537785932421684, "num_tokens": 36516042.0, "step": 16875 }, { "entropy": 6.583554267883301, "epoch": 1.8063566804002353, "grad_norm": 1.5078125, "learning_rate": 0.00046802479994125916, "loss": 6.3029, "mean_token_accuracy": 0.13417793661355973, "num_tokens": 36527417.0, "step": 16880 }, { "entropy": 6.517843437194824, "epoch": 1.8068917545079994, "grad_norm": 1.828125, "learning_rate": 0.0004680051514504364, "loss": 6.2097, "mean_token_accuracy": 0.1450719028711319, "num_tokens": 36538182.0, "step": 16885 }, { "entropy": 6.477873516082764, "epoch": 1.8074268286157633, "grad_norm": 1.390625, "learning_rate": 0.0004679854973866171, "loss": 6.2986, "mean_token_accuracy": 0.13775768205523492, "num_tokens": 36549835.0, "step": 16890 }, { "entropy": 6.45180606842041, "epoch": 1.8079619027235272, "grad_norm": 2.0625, "learning_rate": 0.00046796583775036857, "loss": 6.19, "mean_token_accuracy": 0.14810781925916672, "num_tokens": 36560238.0, "step": 16895 }, { "entropy": 6.533177089691162, "epoch": 1.8084969768312913, "grad_norm": 1.34375, "learning_rate": 0.00046794617254225865, "loss": 6.2267, "mean_token_accuracy": 0.14068657979369165, "num_tokens": 36571267.0, "step": 16900 }, { "entropy": 6.52840747833252, "epoch": 1.809032050939055, "grad_norm": 1.4453125, "learning_rate": 0.0004679265017628551, "loss": 6.2861, "mean_token_accuracy": 0.14016860574483872, "num_tokens": 36582174.0, "step": 16905 }, { "entropy": 6.566719913482666, "epoch": 1.809567125046819, "grad_norm": 1.328125, "learning_rate": 0.0004679068254127259, "loss": 6.2379, "mean_token_accuracy": 0.1399499513208866, "num_tokens": 36593054.0, "step": 16910 }, { "entropy": 6.543996334075928, "epoch": 1.810102199154583, "grad_norm": 1.53125, "learning_rate": 0.00046788714349243923, "loss": 6.2411, "mean_token_accuracy": 0.13865780755877494, "num_tokens": 36603962.0, "step": 16915 }, { "entropy": 6.538334846496582, "epoch": 1.8106372732623468, "grad_norm": 1.40625, "learning_rate": 0.0004678674560025634, "loss": 6.2346, "mean_token_accuracy": 0.13803598582744597, "num_tokens": 36616003.0, "step": 16920 }, { "entropy": 6.555250835418701, "epoch": 1.811172347370111, "grad_norm": 1.3984375, "learning_rate": 0.0004678477629436669, "loss": 6.3134, "mean_token_accuracy": 0.1259820744395256, "num_tokens": 36627189.0, "step": 16925 }, { "entropy": 6.563538408279419, "epoch": 1.8117074214778746, "grad_norm": 1.5, "learning_rate": 0.0004678280643163184, "loss": 6.3285, "mean_token_accuracy": 0.1305183358490467, "num_tokens": 36637756.0, "step": 16930 }, { "entropy": 6.52625207901001, "epoch": 1.8122424955856387, "grad_norm": 1.8359375, "learning_rate": 0.0004678083601210865, "loss": 6.2622, "mean_token_accuracy": 0.14015371575951577, "num_tokens": 36648946.0, "step": 16935 }, { "entropy": 6.581425952911377, "epoch": 1.8127775696934025, "grad_norm": 1.4296875, "learning_rate": 0.0004677886503585404, "loss": 6.2769, "mean_token_accuracy": 0.13917845040559768, "num_tokens": 36660184.0, "step": 16940 }, { "entropy": 6.549855661392212, "epoch": 1.8133126438011664, "grad_norm": 1.421875, "learning_rate": 0.00046776893502924904, "loss": 6.3284, "mean_token_accuracy": 0.13336536437273025, "num_tokens": 36671346.0, "step": 16945 }, { "entropy": 6.584742641448974, "epoch": 1.8138477179089305, "grad_norm": 1.390625, "learning_rate": 0.0004677492141337818, "loss": 6.2225, "mean_token_accuracy": 0.13786211013793945, "num_tokens": 36682917.0, "step": 16950 }, { "entropy": 6.547979497909546, "epoch": 1.8143827920166942, "grad_norm": 1.796875, "learning_rate": 0.0004677294876727081, "loss": 6.305, "mean_token_accuracy": 0.12805510684847832, "num_tokens": 36693577.0, "step": 16955 }, { "entropy": 6.611744832992554, "epoch": 1.8149178661244583, "grad_norm": 1.4296875, "learning_rate": 0.0004677097556465975, "loss": 6.249, "mean_token_accuracy": 0.13698212802410126, "num_tokens": 36704915.0, "step": 16960 }, { "entropy": 6.596394205093384, "epoch": 1.8154529402322221, "grad_norm": 1.65625, "learning_rate": 0.00046769001805601983, "loss": 6.3643, "mean_token_accuracy": 0.12665193229913713, "num_tokens": 36716086.0, "step": 16965 }, { "entropy": 6.468046569824219, "epoch": 1.815988014339986, "grad_norm": 1.40625, "learning_rate": 0.00046767027490154494, "loss": 6.1918, "mean_token_accuracy": 0.13091371804475785, "num_tokens": 36726110.0, "step": 16970 }, { "entropy": 6.549561405181885, "epoch": 1.8165230884477501, "grad_norm": 1.4375, "learning_rate": 0.00046765052618374296, "loss": 6.1771, "mean_token_accuracy": 0.1403437852859497, "num_tokens": 36735846.0, "step": 16975 }, { "entropy": 6.515966844558716, "epoch": 1.8170581625555138, "grad_norm": 1.828125, "learning_rate": 0.000467630771903184, "loss": 6.259, "mean_token_accuracy": 0.1386712908744812, "num_tokens": 36746851.0, "step": 16980 }, { "entropy": 6.525477933883667, "epoch": 1.8175932366632779, "grad_norm": 1.5078125, "learning_rate": 0.0004676110120604387, "loss": 6.2324, "mean_token_accuracy": 0.13791928589344024, "num_tokens": 36758032.0, "step": 16985 }, { "entropy": 6.572210121154785, "epoch": 1.8181283107710418, "grad_norm": 1.8515625, "learning_rate": 0.0004675912466560775, "loss": 6.2518, "mean_token_accuracy": 0.14123788774013518, "num_tokens": 36768939.0, "step": 16990 }, { "entropy": 6.577953958511353, "epoch": 1.8186633848788056, "grad_norm": 2.46875, "learning_rate": 0.00046757147569067106, "loss": 6.304, "mean_token_accuracy": 0.13176384195685387, "num_tokens": 36780338.0, "step": 16995 }, { "entropy": 6.507962799072265, "epoch": 1.8191984589865697, "grad_norm": 1.2109375, "learning_rate": 0.0004675516991647903, "loss": 6.1541, "mean_token_accuracy": 0.13604221120476723, "num_tokens": 36791384.0, "step": 17000 }, { "entropy": 6.4729632377624515, "epoch": 1.8197335330943336, "grad_norm": 1.2421875, "learning_rate": 0.00046753191707900636, "loss": 6.2134, "mean_token_accuracy": 0.1321197956800461, "num_tokens": 36802460.0, "step": 17005 }, { "entropy": 6.536910820007324, "epoch": 1.8202686072020975, "grad_norm": 1.640625, "learning_rate": 0.00046751212943389026, "loss": 6.2864, "mean_token_accuracy": 0.13371748030185698, "num_tokens": 36813599.0, "step": 17010 }, { "entropy": 6.563910818099975, "epoch": 1.8208036813098614, "grad_norm": 1.421875, "learning_rate": 0.0004674923362300135, "loss": 6.158, "mean_token_accuracy": 0.1385357163846493, "num_tokens": 36823100.0, "step": 17015 }, { "entropy": 6.547238874435425, "epoch": 1.8213387554176252, "grad_norm": 1.5390625, "learning_rate": 0.00046747253746794767, "loss": 6.304, "mean_token_accuracy": 0.13121092841029167, "num_tokens": 36834245.0, "step": 17020 }, { "entropy": 6.488923406600952, "epoch": 1.8218738295253893, "grad_norm": 1.3515625, "learning_rate": 0.00046745273314826425, "loss": 6.1663, "mean_token_accuracy": 0.1463228791952133, "num_tokens": 36844126.0, "step": 17025 }, { "entropy": 6.494448804855347, "epoch": 1.8224089036331532, "grad_norm": 1.4765625, "learning_rate": 0.0004674329232715353, "loss": 6.1542, "mean_token_accuracy": 0.14492320418357849, "num_tokens": 36855451.0, "step": 17030 }, { "entropy": 6.573440742492676, "epoch": 1.822943977740917, "grad_norm": 1.5390625, "learning_rate": 0.0004674131078383327, "loss": 6.2544, "mean_token_accuracy": 0.13452650755643844, "num_tokens": 36864994.0, "step": 17035 }, { "entropy": 6.537502956390381, "epoch": 1.8234790518486812, "grad_norm": 1.3515625, "learning_rate": 0.0004673932868492286, "loss": 6.1962, "mean_token_accuracy": 0.13883368894457818, "num_tokens": 36875131.0, "step": 17040 }, { "entropy": 6.553777265548706, "epoch": 1.8240141259564449, "grad_norm": 1.5, "learning_rate": 0.00046737346030479546, "loss": 6.2549, "mean_token_accuracy": 0.13633736670017244, "num_tokens": 36884789.0, "step": 17045 }, { "entropy": 6.493189573287964, "epoch": 1.824549200064209, "grad_norm": 1.3984375, "learning_rate": 0.00046735362820560564, "loss": 6.1517, "mean_token_accuracy": 0.13749801069498063, "num_tokens": 36895199.0, "step": 17050 }, { "entropy": 6.533320331573487, "epoch": 1.8250842741719728, "grad_norm": 1.2421875, "learning_rate": 0.0004673337905522318, "loss": 6.257, "mean_token_accuracy": 0.13339270278811455, "num_tokens": 36906495.0, "step": 17055 }, { "entropy": 6.4933160781860355, "epoch": 1.8256193482797367, "grad_norm": 1.625, "learning_rate": 0.00046731394734524686, "loss": 6.2217, "mean_token_accuracy": 0.13503750115633012, "num_tokens": 36916907.0, "step": 17060 }, { "entropy": 6.482892751693726, "epoch": 1.8261544223875008, "grad_norm": 1.7265625, "learning_rate": 0.00046729409858522363, "loss": 6.1848, "mean_token_accuracy": 0.13926137164235114, "num_tokens": 36927872.0, "step": 17065 }, { "entropy": 6.506586217880249, "epoch": 1.8266894964952645, "grad_norm": 2.8125, "learning_rate": 0.0004672742442727354, "loss": 6.2337, "mean_token_accuracy": 0.13534507304430007, "num_tokens": 36938575.0, "step": 17070 }, { "entropy": 6.421038293838501, "epoch": 1.8272245706030286, "grad_norm": 1.6328125, "learning_rate": 0.00046725438440835536, "loss": 6.1076, "mean_token_accuracy": 0.14953663647174836, "num_tokens": 36949179.0, "step": 17075 }, { "entropy": 6.481749391555786, "epoch": 1.8277596447107924, "grad_norm": 4.46875, "learning_rate": 0.000467234518992657, "loss": 6.1621, "mean_token_accuracy": 0.1452023506164551, "num_tokens": 36959164.0, "step": 17080 }, { "entropy": 6.567118787765503, "epoch": 1.8282947188185563, "grad_norm": 1.7109375, "learning_rate": 0.00046721464802621383, "loss": 6.3111, "mean_token_accuracy": 0.13393226340413095, "num_tokens": 36969091.0, "step": 17085 }, { "entropy": 6.562323141098022, "epoch": 1.8288297929263204, "grad_norm": 1.921875, "learning_rate": 0.00046719477150959984, "loss": 6.2461, "mean_token_accuracy": 0.13492230623960494, "num_tokens": 36980481.0, "step": 17090 }, { "entropy": 6.547414779663086, "epoch": 1.829364867034084, "grad_norm": 2.40625, "learning_rate": 0.00046717488944338873, "loss": 6.2198, "mean_token_accuracy": 0.13818060755729675, "num_tokens": 36991349.0, "step": 17095 }, { "entropy": 6.537697601318359, "epoch": 1.8298999411418482, "grad_norm": 1.7109375, "learning_rate": 0.00046715500182815473, "loss": 6.2997, "mean_token_accuracy": 0.13604205325245858, "num_tokens": 37002803.0, "step": 17100 }, { "entropy": 6.5742217063903805, "epoch": 1.830435015249612, "grad_norm": 1.296875, "learning_rate": 0.00046713510866447204, "loss": 6.2486, "mean_token_accuracy": 0.13930715918540953, "num_tokens": 37013578.0, "step": 17105 }, { "entropy": 6.480613660812378, "epoch": 1.830970089357376, "grad_norm": 2.3125, "learning_rate": 0.0004671152099529152, "loss": 6.1601, "mean_token_accuracy": 0.14176603630185128, "num_tokens": 37024012.0, "step": 17110 }, { "entropy": 6.431010293960571, "epoch": 1.83150516346514, "grad_norm": 1.625, "learning_rate": 0.00046709530569405855, "loss": 6.1546, "mean_token_accuracy": 0.1426972985267639, "num_tokens": 37034149.0, "step": 17115 }, { "entropy": 6.464472866058349, "epoch": 1.8320402375729037, "grad_norm": 1.671875, "learning_rate": 0.0004670753958884769, "loss": 6.1467, "mean_token_accuracy": 0.14506796300411223, "num_tokens": 37045669.0, "step": 17120 }, { "entropy": 6.518822431564331, "epoch": 1.8325753116806678, "grad_norm": 1.328125, "learning_rate": 0.00046705548053674524, "loss": 6.2426, "mean_token_accuracy": 0.13655512034893036, "num_tokens": 37056611.0, "step": 17125 }, { "entropy": 6.462148952484131, "epoch": 1.8331103857884317, "grad_norm": 1.5390625, "learning_rate": 0.00046703555963943855, "loss": 6.2124, "mean_token_accuracy": 0.13259709179401397, "num_tokens": 37067387.0, "step": 17130 }, { "entropy": 6.603019952774048, "epoch": 1.8336454598961955, "grad_norm": 2.171875, "learning_rate": 0.00046701563319713214, "loss": 6.3093, "mean_token_accuracy": 0.1327134758234024, "num_tokens": 37078151.0, "step": 17135 }, { "entropy": 6.576609134674072, "epoch": 1.8341805340039596, "grad_norm": 1.3984375, "learning_rate": 0.00046699570121040126, "loss": 6.2613, "mean_token_accuracy": 0.13562018275260926, "num_tokens": 37088219.0, "step": 17140 }, { "entropy": 6.467413425445557, "epoch": 1.8347156081117235, "grad_norm": 1.578125, "learning_rate": 0.0004669757636798215, "loss": 6.1373, "mean_token_accuracy": 0.14191140681505204, "num_tokens": 37098769.0, "step": 17145 }, { "entropy": 6.534985876083374, "epoch": 1.8352506822194874, "grad_norm": 1.4296875, "learning_rate": 0.0004669558206059684, "loss": 6.276, "mean_token_accuracy": 0.1294104613363743, "num_tokens": 37110716.0, "step": 17150 }, { "entropy": 6.538275527954101, "epoch": 1.8357857563272513, "grad_norm": 1.546875, "learning_rate": 0.0004669358719894181, "loss": 6.1879, "mean_token_accuracy": 0.13603334054350852, "num_tokens": 37122785.0, "step": 17155 }, { "entropy": 6.480508327484131, "epoch": 1.8363208304350152, "grad_norm": 2.15625, "learning_rate": 0.0004669159178307465, "loss": 6.1969, "mean_token_accuracy": 0.13679319992661476, "num_tokens": 37133308.0, "step": 17160 }, { "entropy": 6.407593870162964, "epoch": 1.8368559045427792, "grad_norm": 1.3828125, "learning_rate": 0.0004668959581305296, "loss": 6.1535, "mean_token_accuracy": 0.14222812801599502, "num_tokens": 37143916.0, "step": 17165 }, { "entropy": 6.46957540512085, "epoch": 1.8373909786505431, "grad_norm": 1.3984375, "learning_rate": 0.00046687599288934394, "loss": 6.1696, "mean_token_accuracy": 0.13823763206601142, "num_tokens": 37154335.0, "step": 17170 }, { "entropy": 6.529861164093018, "epoch": 1.837926052758307, "grad_norm": 2.046875, "learning_rate": 0.000466856022107766, "loss": 6.2338, "mean_token_accuracy": 0.1369415447115898, "num_tokens": 37164116.0, "step": 17175 }, { "entropy": 6.50433087348938, "epoch": 1.838461126866071, "grad_norm": 1.5390625, "learning_rate": 0.00046683604578637235, "loss": 6.2956, "mean_token_accuracy": 0.13340672180056573, "num_tokens": 37175407.0, "step": 17180 }, { "entropy": 6.446762371063232, "epoch": 1.8389962009738348, "grad_norm": 1.375, "learning_rate": 0.00046681606392573975, "loss": 6.1736, "mean_token_accuracy": 0.13607601448893547, "num_tokens": 37185339.0, "step": 17185 }, { "entropy": 6.572753381729126, "epoch": 1.8395312750815989, "grad_norm": 1.578125, "learning_rate": 0.0004667960765264454, "loss": 6.2672, "mean_token_accuracy": 0.1362226776778698, "num_tokens": 37195145.0, "step": 17190 }, { "entropy": 6.537802410125733, "epoch": 1.8400663491893627, "grad_norm": 2.109375, "learning_rate": 0.0004667760835890662, "loss": 6.2779, "mean_token_accuracy": 0.13509466499090195, "num_tokens": 37206454.0, "step": 17195 }, { "entropy": 6.481271600723266, "epoch": 1.8406014232971266, "grad_norm": 1.640625, "learning_rate": 0.00046675608511417957, "loss": 6.1878, "mean_token_accuracy": 0.14024367779493332, "num_tokens": 37216646.0, "step": 17200 }, { "entropy": 6.436294937133789, "epoch": 1.8411364974048907, "grad_norm": 1.65625, "learning_rate": 0.00046673608110236293, "loss": 6.1472, "mean_token_accuracy": 0.14751357436180115, "num_tokens": 37227368.0, "step": 17205 }, { "entropy": 6.5536376476287845, "epoch": 1.8416715715126544, "grad_norm": 1.5546875, "learning_rate": 0.0004667160715541939, "loss": 6.2645, "mean_token_accuracy": 0.13471471667289733, "num_tokens": 37238150.0, "step": 17210 }, { "entropy": 6.509008359909058, "epoch": 1.8422066456204185, "grad_norm": 1.6640625, "learning_rate": 0.00046669605647025014, "loss": 6.2161, "mean_token_accuracy": 0.13703424036502837, "num_tokens": 37249534.0, "step": 17215 }, { "entropy": 6.5630042552948, "epoch": 1.8427417197281823, "grad_norm": 1.3046875, "learning_rate": 0.0004666760358511098, "loss": 6.2997, "mean_token_accuracy": 0.1386088714003563, "num_tokens": 37260633.0, "step": 17220 }, { "entropy": 6.573452997207641, "epoch": 1.8432767938359462, "grad_norm": 1.484375, "learning_rate": 0.00046665600969735086, "loss": 6.2714, "mean_token_accuracy": 0.13207167088985444, "num_tokens": 37271978.0, "step": 17225 }, { "entropy": 6.4870954036712645, "epoch": 1.8438118679437103, "grad_norm": 2.0625, "learning_rate": 0.0004666359780095515, "loss": 6.1157, "mean_token_accuracy": 0.14051857218146324, "num_tokens": 37284130.0, "step": 17230 }, { "entropy": 6.54051194190979, "epoch": 1.844346942051474, "grad_norm": 1.46875, "learning_rate": 0.0004666159407882902, "loss": 6.2914, "mean_token_accuracy": 0.1303947575390339, "num_tokens": 37295648.0, "step": 17235 }, { "entropy": 6.5121325016021725, "epoch": 1.844882016159238, "grad_norm": 1.5234375, "learning_rate": 0.0004665958980341456, "loss": 6.258, "mean_token_accuracy": 0.13691130727529527, "num_tokens": 37306715.0, "step": 17240 }, { "entropy": 6.534123659133911, "epoch": 1.845417090267002, "grad_norm": 1.65625, "learning_rate": 0.00046657584974769636, "loss": 6.2708, "mean_token_accuracy": 0.13898625373840331, "num_tokens": 37317605.0, "step": 17245 }, { "entropy": 6.527424573898315, "epoch": 1.8459521643747658, "grad_norm": 1.53125, "learning_rate": 0.0004665557959295213, "loss": 6.1895, "mean_token_accuracy": 0.14265326410531998, "num_tokens": 37328898.0, "step": 17250 }, { "entropy": 6.477344179153443, "epoch": 1.84648723848253, "grad_norm": 1.375, "learning_rate": 0.00046653573658019963, "loss": 6.1724, "mean_token_accuracy": 0.1402975931763649, "num_tokens": 37340108.0, "step": 17255 }, { "entropy": 6.543744611740112, "epoch": 1.8470223125902936, "grad_norm": 1.3359375, "learning_rate": 0.00046651567170031053, "loss": 6.2914, "mean_token_accuracy": 0.13802868351340294, "num_tokens": 37351773.0, "step": 17260 }, { "entropy": 6.494388151168823, "epoch": 1.8475573866980577, "grad_norm": 1.6328125, "learning_rate": 0.0004664956012904332, "loss": 6.215, "mean_token_accuracy": 0.13731587156653405, "num_tokens": 37362748.0, "step": 17265 }, { "entropy": 6.510460567474365, "epoch": 1.8480924608058216, "grad_norm": 1.5703125, "learning_rate": 0.0004664755253511474, "loss": 6.3006, "mean_token_accuracy": 0.13541723787784576, "num_tokens": 37373487.0, "step": 17270 }, { "entropy": 6.5544881343841555, "epoch": 1.8486275349135854, "grad_norm": 2.109375, "learning_rate": 0.0004664554438830326, "loss": 6.1428, "mean_token_accuracy": 0.13703005909919738, "num_tokens": 37383302.0, "step": 17275 }, { "entropy": 6.565484619140625, "epoch": 1.8491626090213495, "grad_norm": 1.9921875, "learning_rate": 0.0004664353568866689, "loss": 6.1759, "mean_token_accuracy": 0.13908227831125258, "num_tokens": 37393085.0, "step": 17280 }, { "entropy": 6.562853622436523, "epoch": 1.8496976831291134, "grad_norm": 1.4609375, "learning_rate": 0.000466415264362636, "loss": 6.2485, "mean_token_accuracy": 0.13739827275276184, "num_tokens": 37403774.0, "step": 17285 }, { "entropy": 6.544837522506714, "epoch": 1.8502327572368773, "grad_norm": 1.359375, "learning_rate": 0.00046639516631151435, "loss": 6.2261, "mean_token_accuracy": 0.14629105776548385, "num_tokens": 37414356.0, "step": 17290 }, { "entropy": 6.481632375717163, "epoch": 1.8507678313446412, "grad_norm": 2.359375, "learning_rate": 0.00046637506273388416, "loss": 6.2689, "mean_token_accuracy": 0.1359451398253441, "num_tokens": 37426381.0, "step": 17295 }, { "entropy": 6.522068500518799, "epoch": 1.851302905452405, "grad_norm": 1.765625, "learning_rate": 0.00046635495363032595, "loss": 6.2128, "mean_token_accuracy": 0.13729588389396669, "num_tokens": 37436259.0, "step": 17300 }, { "entropy": 6.532771444320678, "epoch": 1.8518379795601692, "grad_norm": 2.34375, "learning_rate": 0.00046633483900142026, "loss": 6.1925, "mean_token_accuracy": 0.1430345170199871, "num_tokens": 37447498.0, "step": 17305 }, { "entropy": 6.483018445968628, "epoch": 1.852373053667933, "grad_norm": 1.6484375, "learning_rate": 0.000466314718847748, "loss": 6.1869, "mean_token_accuracy": 0.14144012928009034, "num_tokens": 37457323.0, "step": 17310 }, { "entropy": 6.470933246612549, "epoch": 1.852908127775697, "grad_norm": 1.40625, "learning_rate": 0.0004662945931698901, "loss": 6.2246, "mean_token_accuracy": 0.1384797491133213, "num_tokens": 37468121.0, "step": 17315 }, { "entropy": 6.515081596374512, "epoch": 1.853443201883461, "grad_norm": 1.828125, "learning_rate": 0.00046627446196842784, "loss": 6.2497, "mean_token_accuracy": 0.1317722588777542, "num_tokens": 37479205.0, "step": 17320 }, { "entropy": 6.556810903549194, "epoch": 1.8539782759912247, "grad_norm": 1.546875, "learning_rate": 0.0004662543252439422, "loss": 6.3526, "mean_token_accuracy": 0.13010217621922493, "num_tokens": 37491015.0, "step": 17325 }, { "entropy": 6.579596424102784, "epoch": 1.8545133500989888, "grad_norm": 1.453125, "learning_rate": 0.00046623418299701494, "loss": 6.2675, "mean_token_accuracy": 0.13135558143258094, "num_tokens": 37503078.0, "step": 17330 }, { "entropy": 6.5604668140411375, "epoch": 1.8550484242067526, "grad_norm": 2.265625, "learning_rate": 0.0004662140352282274, "loss": 6.2443, "mean_token_accuracy": 0.1412036180496216, "num_tokens": 37514623.0, "step": 17335 }, { "entropy": 6.501449155807495, "epoch": 1.8555834983145165, "grad_norm": 1.9765625, "learning_rate": 0.00046619388193816155, "loss": 6.1845, "mean_token_accuracy": 0.13932041376829146, "num_tokens": 37525618.0, "step": 17340 }, { "entropy": 6.5468672752380375, "epoch": 1.8561185724222806, "grad_norm": 1.3359375, "learning_rate": 0.00046617372312739917, "loss": 6.2607, "mean_token_accuracy": 0.14140139073133468, "num_tokens": 37536023.0, "step": 17345 }, { "entropy": 6.581799411773682, "epoch": 1.8566536465300443, "grad_norm": 1.953125, "learning_rate": 0.0004661535587965224, "loss": 6.26, "mean_token_accuracy": 0.1331052377820015, "num_tokens": 37545886.0, "step": 17350 }, { "entropy": 6.489939403533936, "epoch": 1.8571887206378084, "grad_norm": 1.4921875, "learning_rate": 0.00046613338894611347, "loss": 6.1817, "mean_token_accuracy": 0.13516911789774894, "num_tokens": 37557587.0, "step": 17355 }, { "entropy": 6.430360794067383, "epoch": 1.8577237947455723, "grad_norm": 1.7265625, "learning_rate": 0.0004661132135767548, "loss": 6.1246, "mean_token_accuracy": 0.15580250471830367, "num_tokens": 37569379.0, "step": 17360 }, { "entropy": 6.574359893798828, "epoch": 1.8582588688533361, "grad_norm": 2.015625, "learning_rate": 0.000466093032689029, "loss": 6.2939, "mean_token_accuracy": 0.13142267763614654, "num_tokens": 37580478.0, "step": 17365 }, { "entropy": 6.483245992660523, "epoch": 1.8587939429611002, "grad_norm": 1.671875, "learning_rate": 0.0004660728462835187, "loss": 6.2211, "mean_token_accuracy": 0.14082368835806847, "num_tokens": 37591506.0, "step": 17370 }, { "entropy": 6.4595136642456055, "epoch": 1.8593290170688639, "grad_norm": 1.6171875, "learning_rate": 0.0004660526543608068, "loss": 6.0688, "mean_token_accuracy": 0.15273035317659378, "num_tokens": 37602074.0, "step": 17375 }, { "entropy": 6.5289915084838865, "epoch": 1.859864091176628, "grad_norm": 1.609375, "learning_rate": 0.0004660324569214763, "loss": 6.2628, "mean_token_accuracy": 0.1343717895448208, "num_tokens": 37612180.0, "step": 17380 }, { "entropy": 6.513068914413452, "epoch": 1.8603991652843919, "grad_norm": 1.5078125, "learning_rate": 0.0004660122539661106, "loss": 6.2351, "mean_token_accuracy": 0.14054446592926978, "num_tokens": 37622588.0, "step": 17385 }, { "entropy": 6.5763421058654785, "epoch": 1.8609342393921557, "grad_norm": 2.15625, "learning_rate": 0.0004659920454952928, "loss": 6.2204, "mean_token_accuracy": 0.14042455777525903, "num_tokens": 37634323.0, "step": 17390 }, { "entropy": 6.562207317352295, "epoch": 1.8614693134999198, "grad_norm": 1.8828125, "learning_rate": 0.0004659718315096065, "loss": 6.2767, "mean_token_accuracy": 0.13324531316757202, "num_tokens": 37645816.0, "step": 17395 }, { "entropy": 6.585940647125244, "epoch": 1.8620043876076835, "grad_norm": 1.7578125, "learning_rate": 0.00046595161200963545, "loss": 6.2841, "mean_token_accuracy": 0.13371996730566024, "num_tokens": 37656143.0, "step": 17400 }, { "entropy": 6.513905477523804, "epoch": 1.8625394617154476, "grad_norm": 2.578125, "learning_rate": 0.00046593138699596343, "loss": 6.1746, "mean_token_accuracy": 0.13611202463507652, "num_tokens": 37665959.0, "step": 17405 }, { "entropy": 6.486093330383301, "epoch": 1.8630745358232115, "grad_norm": 2.171875, "learning_rate": 0.00046591115646917443, "loss": 6.2345, "mean_token_accuracy": 0.13548298478126525, "num_tokens": 37677176.0, "step": 17410 }, { "entropy": 6.472007322311401, "epoch": 1.8636096099309754, "grad_norm": 2.109375, "learning_rate": 0.0004658909204298526, "loss": 6.2539, "mean_token_accuracy": 0.14066635966300964, "num_tokens": 37687740.0, "step": 17415 }, { "entropy": 6.482980394363404, "epoch": 1.8641446840387395, "grad_norm": 2.328125, "learning_rate": 0.0004658706788785823, "loss": 6.1911, "mean_token_accuracy": 0.14265646263957024, "num_tokens": 37698536.0, "step": 17420 }, { "entropy": 6.552716970443726, "epoch": 1.8646797581465033, "grad_norm": 1.75, "learning_rate": 0.00046585043181594793, "loss": 6.2199, "mean_token_accuracy": 0.14157683700323104, "num_tokens": 37708795.0, "step": 17425 }, { "entropy": 6.550864553451538, "epoch": 1.8652148322542672, "grad_norm": 1.640625, "learning_rate": 0.00046583017924253426, "loss": 6.2352, "mean_token_accuracy": 0.14017075598239898, "num_tokens": 37719136.0, "step": 17430 }, { "entropy": 6.603561115264893, "epoch": 1.8657499063620313, "grad_norm": 2.1875, "learning_rate": 0.0004658099211589259, "loss": 6.3101, "mean_token_accuracy": 0.13327914327383042, "num_tokens": 37730513.0, "step": 17435 }, { "entropy": 6.459116220474243, "epoch": 1.866284980469795, "grad_norm": 6.0625, "learning_rate": 0.00046578965756570787, "loss": 6.2347, "mean_token_accuracy": 0.13692908883094787, "num_tokens": 37741811.0, "step": 17440 }, { "entropy": 6.429191589355469, "epoch": 1.866820054577559, "grad_norm": 1.578125, "learning_rate": 0.00046576938846346527, "loss": 6.0706, "mean_token_accuracy": 0.14636265933513642, "num_tokens": 37752213.0, "step": 17445 }, { "entropy": 6.444896173477173, "epoch": 1.867355128685323, "grad_norm": 1.8359375, "learning_rate": 0.00046574911385278343, "loss": 6.0547, "mean_token_accuracy": 0.15159211903810502, "num_tokens": 37763253.0, "step": 17450 }, { "entropy": 6.566773557662964, "epoch": 1.8678902027930868, "grad_norm": 1.6015625, "learning_rate": 0.00046572883373424776, "loss": 6.2701, "mean_token_accuracy": 0.13228057101368904, "num_tokens": 37775087.0, "step": 17455 }, { "entropy": 6.56617431640625, "epoch": 1.868425276900851, "grad_norm": 2.21875, "learning_rate": 0.00046570854810844373, "loss": 6.2554, "mean_token_accuracy": 0.13026925027370453, "num_tokens": 37786119.0, "step": 17460 }, { "entropy": 6.5158192157745365, "epoch": 1.8689603510086146, "grad_norm": 3.1875, "learning_rate": 0.00046568825697595724, "loss": 6.2618, "mean_token_accuracy": 0.13482827097177505, "num_tokens": 37797482.0, "step": 17465 }, { "entropy": 6.523220825195312, "epoch": 1.8694954251163787, "grad_norm": 2.171875, "learning_rate": 0.0004656679603373741, "loss": 6.1945, "mean_token_accuracy": 0.13488890826702118, "num_tokens": 37808067.0, "step": 17470 }, { "entropy": 6.5920967102050785, "epoch": 1.8700304992241426, "grad_norm": 1.7265625, "learning_rate": 0.0004656476581932804, "loss": 6.3458, "mean_token_accuracy": 0.1309550918638706, "num_tokens": 37819762.0, "step": 17475 }, { "entropy": 6.509218740463257, "epoch": 1.8705655733319064, "grad_norm": 1.3125, "learning_rate": 0.0004656273505442624, "loss": 6.2132, "mean_token_accuracy": 0.14369545131921768, "num_tokens": 37829510.0, "step": 17480 }, { "entropy": 6.510902166366577, "epoch": 1.8711006474396705, "grad_norm": 2.015625, "learning_rate": 0.00046560703739090633, "loss": 6.283, "mean_token_accuracy": 0.1339593842625618, "num_tokens": 37839431.0, "step": 17485 }, { "entropy": 6.596603298187256, "epoch": 1.8716357215474342, "grad_norm": 1.5390625, "learning_rate": 0.00046558671873379886, "loss": 6.2963, "mean_token_accuracy": 0.1272880144417286, "num_tokens": 37850531.0, "step": 17490 }, { "entropy": 6.636654281616211, "epoch": 1.8721707956551983, "grad_norm": 1.515625, "learning_rate": 0.0004655663945735268, "loss": 6.3059, "mean_token_accuracy": 0.12858284413814544, "num_tokens": 37861964.0, "step": 17495 }, { "entropy": 6.4125974655151365, "epoch": 1.8727058697629622, "grad_norm": 1.5234375, "learning_rate": 0.0004655460649106768, "loss": 6.0291, "mean_token_accuracy": 0.15219689756631852, "num_tokens": 37873598.0, "step": 17500 }, { "entropy": 6.521950435638428, "epoch": 1.873240943870726, "grad_norm": 2.140625, "learning_rate": 0.00046552572974583597, "loss": 6.2854, "mean_token_accuracy": 0.13302481919527054, "num_tokens": 37884643.0, "step": 17505 }, { "entropy": 6.507148408889771, "epoch": 1.8737760179784901, "grad_norm": 1.96875, "learning_rate": 0.0004655053890795914, "loss": 6.2672, "mean_token_accuracy": 0.13397427871823311, "num_tokens": 37896566.0, "step": 17510 }, { "entropy": 6.59088625907898, "epoch": 1.8743110920862538, "grad_norm": 1.890625, "learning_rate": 0.00046548504291253054, "loss": 6.3087, "mean_token_accuracy": 0.13231249898672104, "num_tokens": 37907424.0, "step": 17515 }, { "entropy": 6.588667011260986, "epoch": 1.874846166194018, "grad_norm": 2.171875, "learning_rate": 0.0004654646912452408, "loss": 6.2393, "mean_token_accuracy": 0.14179185181856155, "num_tokens": 37917318.0, "step": 17520 }, { "entropy": 6.510469579696656, "epoch": 1.8753812403017818, "grad_norm": 2.015625, "learning_rate": 0.0004654443340783099, "loss": 6.2011, "mean_token_accuracy": 0.1401626721024513, "num_tokens": 37928521.0, "step": 17525 }, { "entropy": 6.499540185928344, "epoch": 1.8759163144095456, "grad_norm": 1.765625, "learning_rate": 0.00046542397141232554, "loss": 6.2778, "mean_token_accuracy": 0.1372986279428005, "num_tokens": 37939930.0, "step": 17530 }, { "entropy": 6.504684114456177, "epoch": 1.8764513885173097, "grad_norm": 1.6015625, "learning_rate": 0.0004654036032478759, "loss": 6.1869, "mean_token_accuracy": 0.14108899012207984, "num_tokens": 37949690.0, "step": 17535 }, { "entropy": 6.546181392669678, "epoch": 1.8769864626250736, "grad_norm": 1.9453125, "learning_rate": 0.00046538322958554885, "loss": 6.212, "mean_token_accuracy": 0.14192006289958953, "num_tokens": 37962162.0, "step": 17540 }, { "entropy": 6.594173574447632, "epoch": 1.8775215367328375, "grad_norm": 1.5078125, "learning_rate": 0.0004653628504259329, "loss": 6.2469, "mean_token_accuracy": 0.13679970055818558, "num_tokens": 37972707.0, "step": 17545 }, { "entropy": 6.458856296539307, "epoch": 1.8780566108406014, "grad_norm": 1.5078125, "learning_rate": 0.00046534246576961633, "loss": 6.1646, "mean_token_accuracy": 0.1458908274769783, "num_tokens": 37983101.0, "step": 17550 }, { "entropy": 6.422877454757691, "epoch": 1.8785916849483653, "grad_norm": 1.6953125, "learning_rate": 0.00046532207561718775, "loss": 6.139, "mean_token_accuracy": 0.14392440170049667, "num_tokens": 37994025.0, "step": 17555 }, { "entropy": 6.521886825561523, "epoch": 1.8791267590561294, "grad_norm": 1.4921875, "learning_rate": 0.00046530167996923613, "loss": 6.2433, "mean_token_accuracy": 0.13209235221147536, "num_tokens": 38004761.0, "step": 17560 }, { "entropy": 6.573818874359131, "epoch": 1.8796618331638932, "grad_norm": 1.6953125, "learning_rate": 0.0004652812788263501, "loss": 6.2461, "mean_token_accuracy": 0.13844591975212098, "num_tokens": 38015129.0, "step": 17565 }, { "entropy": 6.533925724029541, "epoch": 1.8801969072716571, "grad_norm": 1.453125, "learning_rate": 0.00046526087218911894, "loss": 6.2316, "mean_token_accuracy": 0.14329466223716736, "num_tokens": 38025501.0, "step": 17570 }, { "entropy": 6.5236128807067875, "epoch": 1.8807319813794212, "grad_norm": 1.6484375, "learning_rate": 0.00046524046005813185, "loss": 6.2105, "mean_token_accuracy": 0.13993176072835922, "num_tokens": 38034912.0, "step": 17575 }, { "entropy": 6.475555276870727, "epoch": 1.8812670554871849, "grad_norm": 1.28125, "learning_rate": 0.0004652200424339782, "loss": 6.1574, "mean_token_accuracy": 0.140637881308794, "num_tokens": 38045417.0, "step": 17580 }, { "entropy": 6.520765924453736, "epoch": 1.881802129594949, "grad_norm": 1.578125, "learning_rate": 0.0004651996193172475, "loss": 6.2945, "mean_token_accuracy": 0.1352642834186554, "num_tokens": 38057033.0, "step": 17585 }, { "entropy": 6.551823234558105, "epoch": 1.8823372037027128, "grad_norm": 1.40625, "learning_rate": 0.0004651791907085296, "loss": 6.2297, "mean_token_accuracy": 0.13857173919677734, "num_tokens": 38067804.0, "step": 17590 }, { "entropy": 6.541230058670044, "epoch": 1.8828722778104767, "grad_norm": 1.578125, "learning_rate": 0.0004651587566084143, "loss": 6.2188, "mean_token_accuracy": 0.1486022040247917, "num_tokens": 38079246.0, "step": 17595 }, { "entropy": 6.541295862197876, "epoch": 1.8834073519182408, "grad_norm": 1.609375, "learning_rate": 0.00046513831701749155, "loss": 6.3613, "mean_token_accuracy": 0.13094632104039192, "num_tokens": 38090628.0, "step": 17600 }, { "entropy": 6.515250587463379, "epoch": 1.8839424260260045, "grad_norm": 1.59375, "learning_rate": 0.00046511787193635165, "loss": 6.1465, "mean_token_accuracy": 0.14270028993487358, "num_tokens": 38100848.0, "step": 17605 }, { "entropy": 6.606397533416748, "epoch": 1.8844775001337686, "grad_norm": 1.375, "learning_rate": 0.00046509742136558493, "loss": 6.1929, "mean_token_accuracy": 0.1411973714828491, "num_tokens": 38110732.0, "step": 17610 }, { "entropy": 6.4958351135253904, "epoch": 1.8850125742415325, "grad_norm": 2.328125, "learning_rate": 0.00046507696530578185, "loss": 6.1807, "mean_token_accuracy": 0.14429498165845872, "num_tokens": 38121002.0, "step": 17615 }, { "entropy": 6.504161643981933, "epoch": 1.8855476483492963, "grad_norm": 1.4609375, "learning_rate": 0.0004650565037575331, "loss": 6.2381, "mean_token_accuracy": 0.1369054652750492, "num_tokens": 38132294.0, "step": 17620 }, { "entropy": 6.4798229217529295, "epoch": 1.8860827224570604, "grad_norm": 1.71875, "learning_rate": 0.00046503603672142955, "loss": 6.1406, "mean_token_accuracy": 0.1413409121334553, "num_tokens": 38142962.0, "step": 17625 }, { "entropy": 6.5535815238952635, "epoch": 1.886617796564824, "grad_norm": 1.6015625, "learning_rate": 0.0004650155641980621, "loss": 6.262, "mean_token_accuracy": 0.14034836292266845, "num_tokens": 38153737.0, "step": 17630 }, { "entropy": 6.567475128173828, "epoch": 1.8871528706725882, "grad_norm": 1.5703125, "learning_rate": 0.00046499508618802195, "loss": 6.2253, "mean_token_accuracy": 0.13480818271636963, "num_tokens": 38163897.0, "step": 17635 }, { "entropy": 6.487664747238159, "epoch": 1.887687944780352, "grad_norm": 1.671875, "learning_rate": 0.0004649746026919004, "loss": 6.1909, "mean_token_accuracy": 0.14665645807981492, "num_tokens": 38175123.0, "step": 17640 }, { "entropy": 6.484235763549805, "epoch": 1.888223018888116, "grad_norm": 1.9296875, "learning_rate": 0.00046495411371028886, "loss": 6.2169, "mean_token_accuracy": 0.14219552129507065, "num_tokens": 38186100.0, "step": 17645 }, { "entropy": 6.559158420562744, "epoch": 1.88875809299588, "grad_norm": 1.6953125, "learning_rate": 0.00046493361924377903, "loss": 6.2336, "mean_token_accuracy": 0.14047744050621985, "num_tokens": 38196385.0, "step": 17650 }, { "entropy": 6.4783586978912355, "epoch": 1.8892931671036437, "grad_norm": 1.5, "learning_rate": 0.0004649131192929626, "loss": 6.1755, "mean_token_accuracy": 0.13876958936452866, "num_tokens": 38207260.0, "step": 17655 }, { "entropy": 6.45147476196289, "epoch": 1.8898282412114078, "grad_norm": 1.6484375, "learning_rate": 0.0004648926138584315, "loss": 6.0844, "mean_token_accuracy": 0.14660956487059593, "num_tokens": 38217537.0, "step": 17660 }, { "entropy": 6.543872261047364, "epoch": 1.8903633153191717, "grad_norm": 2.375, "learning_rate": 0.00046487210294077794, "loss": 6.2185, "mean_token_accuracy": 0.13700347542762756, "num_tokens": 38228956.0, "step": 17665 }, { "entropy": 6.471927785873413, "epoch": 1.8908983894269356, "grad_norm": 1.4140625, "learning_rate": 0.00046485158654059405, "loss": 6.1452, "mean_token_accuracy": 0.14353640973567963, "num_tokens": 38240236.0, "step": 17670 }, { "entropy": 6.585081481933594, "epoch": 1.8914334635346997, "grad_norm": 1.421875, "learning_rate": 0.0004648310646584723, "loss": 6.278, "mean_token_accuracy": 0.13636186644434928, "num_tokens": 38251739.0, "step": 17675 }, { "entropy": 6.48091344833374, "epoch": 1.8919685376424635, "grad_norm": 2.421875, "learning_rate": 0.00046481053729500516, "loss": 6.2058, "mean_token_accuracy": 0.1312205635011196, "num_tokens": 38262090.0, "step": 17680 }, { "entropy": 6.503962993621826, "epoch": 1.8925036117502274, "grad_norm": 1.3984375, "learning_rate": 0.0004647900044507855, "loss": 6.221, "mean_token_accuracy": 0.1413418248295784, "num_tokens": 38272770.0, "step": 17685 }, { "entropy": 6.51068148612976, "epoch": 1.8930386858579913, "grad_norm": 1.5, "learning_rate": 0.0004647694661264061, "loss": 6.18, "mean_token_accuracy": 0.1368080921471119, "num_tokens": 38283449.0, "step": 17690 }, { "entropy": 6.534865188598633, "epoch": 1.8935737599657552, "grad_norm": 1.5703125, "learning_rate": 0.00046474892232246, "loss": 6.2303, "mean_token_accuracy": 0.13847722858190536, "num_tokens": 38293831.0, "step": 17695 }, { "entropy": 6.489880561828613, "epoch": 1.8941088340735193, "grad_norm": 2.25, "learning_rate": 0.00046472837303954053, "loss": 6.1643, "mean_token_accuracy": 0.13979624956846237, "num_tokens": 38304782.0, "step": 17700 }, { "entropy": 6.508448696136474, "epoch": 1.8946439081812831, "grad_norm": 2.609375, "learning_rate": 0.00046470781827824087, "loss": 6.2338, "mean_token_accuracy": 0.14288853406906127, "num_tokens": 38316547.0, "step": 17705 }, { "entropy": 6.580143833160401, "epoch": 1.895178982289047, "grad_norm": 1.5234375, "learning_rate": 0.00046468725803915464, "loss": 6.272, "mean_token_accuracy": 0.13468163907527925, "num_tokens": 38329488.0, "step": 17710 }, { "entropy": 6.461695432662964, "epoch": 1.8957140563968111, "grad_norm": 1.6015625, "learning_rate": 0.00046466669232287543, "loss": 6.0977, "mean_token_accuracy": 0.1440846249461174, "num_tokens": 38341290.0, "step": 17715 }, { "entropy": 6.52875862121582, "epoch": 1.8962491305045748, "grad_norm": 1.3828125, "learning_rate": 0.0004646461211299973, "loss": 6.2466, "mean_token_accuracy": 0.13937623724341391, "num_tokens": 38352445.0, "step": 17720 }, { "entropy": 6.528347730636597, "epoch": 1.8967842046123389, "grad_norm": 1.34375, "learning_rate": 0.0004646255444611139, "loss": 6.236, "mean_token_accuracy": 0.1415594771504402, "num_tokens": 38363825.0, "step": 17725 }, { "entropy": 6.49668550491333, "epoch": 1.8973192787201028, "grad_norm": 1.7734375, "learning_rate": 0.00046460496231681957, "loss": 6.31, "mean_token_accuracy": 0.13838377743959426, "num_tokens": 38375454.0, "step": 17730 }, { "entropy": 6.4484857559204105, "epoch": 1.8978543528278666, "grad_norm": 1.484375, "learning_rate": 0.00046458437469770866, "loss": 6.2497, "mean_token_accuracy": 0.1398676410317421, "num_tokens": 38385938.0, "step": 17735 }, { "entropy": 6.540100574493408, "epoch": 1.8983894269356307, "grad_norm": 1.625, "learning_rate": 0.00046456378160437555, "loss": 6.1708, "mean_token_accuracy": 0.14353546053171157, "num_tokens": 38396143.0, "step": 17740 }, { "entropy": 6.488660621643066, "epoch": 1.8989245010433944, "grad_norm": 1.7109375, "learning_rate": 0.0004645431830374149, "loss": 6.2618, "mean_token_accuracy": 0.12918649911880492, "num_tokens": 38407445.0, "step": 17745 }, { "entropy": 6.5336669921875, "epoch": 1.8994595751511585, "grad_norm": 1.40625, "learning_rate": 0.00046452257899742144, "loss": 6.2961, "mean_token_accuracy": 0.12962775230407714, "num_tokens": 38418438.0, "step": 17750 }, { "entropy": 6.467654991149902, "epoch": 1.8999946492589224, "grad_norm": 1.5234375, "learning_rate": 0.00046450196948499015, "loss": 6.143, "mean_token_accuracy": 0.13833793625235558, "num_tokens": 38428821.0, "step": 17755 }, { "entropy": 6.498792219161987, "epoch": 1.9005297233666862, "grad_norm": 1.4609375, "learning_rate": 0.0004644813545007161, "loss": 6.1544, "mean_token_accuracy": 0.13901732116937637, "num_tokens": 38439560.0, "step": 17760 }, { "entropy": 6.54771318435669, "epoch": 1.9010647974744503, "grad_norm": 1.5859375, "learning_rate": 0.0004644607340451946, "loss": 6.2406, "mean_token_accuracy": 0.1394535258412361, "num_tokens": 38449724.0, "step": 17765 }, { "entropy": 6.517421054840088, "epoch": 1.901599871582214, "grad_norm": 1.515625, "learning_rate": 0.00046444010811902105, "loss": 6.1717, "mean_token_accuracy": 0.14054683744907379, "num_tokens": 38459833.0, "step": 17770 }, { "entropy": 6.449574708938599, "epoch": 1.902134945689978, "grad_norm": 1.5859375, "learning_rate": 0.00046441947672279095, "loss": 6.1987, "mean_token_accuracy": 0.14699629992246627, "num_tokens": 38470682.0, "step": 17775 }, { "entropy": 6.484740591049194, "epoch": 1.902670019797742, "grad_norm": 1.75, "learning_rate": 0.0004643988398571001, "loss": 6.2184, "mean_token_accuracy": 0.13642918542027474, "num_tokens": 38481362.0, "step": 17780 }, { "entropy": 6.52804388999939, "epoch": 1.9032050939055059, "grad_norm": 1.2734375, "learning_rate": 0.0004643781975225444, "loss": 6.1884, "mean_token_accuracy": 0.14055032059550285, "num_tokens": 38492941.0, "step": 17785 }, { "entropy": 6.583075475692749, "epoch": 1.90374016801327, "grad_norm": 1.6796875, "learning_rate": 0.00046435754971971976, "loss": 6.2249, "mean_token_accuracy": 0.1341730184853077, "num_tokens": 38503823.0, "step": 17790 }, { "entropy": 6.473573112487793, "epoch": 1.9042752421210336, "grad_norm": 1.8125, "learning_rate": 0.00046433689644922256, "loss": 6.139, "mean_token_accuracy": 0.14910909831523894, "num_tokens": 38514482.0, "step": 17795 }, { "entropy": 6.472933340072632, "epoch": 1.9048103162287977, "grad_norm": 1.453125, "learning_rate": 0.00046431623771164897, "loss": 6.2275, "mean_token_accuracy": 0.13971884027123452, "num_tokens": 38525580.0, "step": 17800 }, { "entropy": 6.449027681350708, "epoch": 1.9053453903365616, "grad_norm": 1.53125, "learning_rate": 0.0004642955735075958, "loss": 6.2204, "mean_token_accuracy": 0.1396370619535446, "num_tokens": 38537025.0, "step": 17805 }, { "entropy": 6.487132024765015, "epoch": 1.9058804644443255, "grad_norm": 1.6796875, "learning_rate": 0.00046427490383765943, "loss": 6.2076, "mean_token_accuracy": 0.14065134525299072, "num_tokens": 38548974.0, "step": 17810 }, { "entropy": 6.4658825397491455, "epoch": 1.9064155385520896, "grad_norm": 1.375, "learning_rate": 0.0004642542287024368, "loss": 6.1266, "mean_token_accuracy": 0.14220650643110275, "num_tokens": 38559971.0, "step": 17815 }, { "entropy": 6.4972062587738035, "epoch": 1.9069506126598534, "grad_norm": 1.5859375, "learning_rate": 0.000464233548102525, "loss": 6.1885, "mean_token_accuracy": 0.13903797119855882, "num_tokens": 38570326.0, "step": 17820 }, { "entropy": 6.4395452499389645, "epoch": 1.9074856867676173, "grad_norm": 1.40625, "learning_rate": 0.000464212862038521, "loss": 6.2024, "mean_token_accuracy": 0.1364986389875412, "num_tokens": 38580799.0, "step": 17825 }, { "entropy": 6.44638843536377, "epoch": 1.9080207608753812, "grad_norm": 1.375, "learning_rate": 0.00046419217051102223, "loss": 6.2794, "mean_token_accuracy": 0.13144152835011483, "num_tokens": 38591136.0, "step": 17830 }, { "entropy": 6.521512222290039, "epoch": 1.908555834983145, "grad_norm": 1.4375, "learning_rate": 0.0004641714735206261, "loss": 6.184, "mean_token_accuracy": 0.14119268357753753, "num_tokens": 38602600.0, "step": 17835 }, { "entropy": 6.515765047073364, "epoch": 1.9090909090909092, "grad_norm": 1.328125, "learning_rate": 0.00046415077106793024, "loss": 6.1982, "mean_token_accuracy": 0.14135203510522842, "num_tokens": 38612641.0, "step": 17840 }, { "entropy": 6.525089740753174, "epoch": 1.909625983198673, "grad_norm": 1.5, "learning_rate": 0.0004641300631535325, "loss": 6.1835, "mean_token_accuracy": 0.14011745378375054, "num_tokens": 38622873.0, "step": 17845 }, { "entropy": 6.479873371124268, "epoch": 1.910161057306437, "grad_norm": 1.8515625, "learning_rate": 0.0004641093497780307, "loss": 6.2049, "mean_token_accuracy": 0.14634738862514496, "num_tokens": 38633523.0, "step": 17850 }, { "entropy": 6.488259887695312, "epoch": 1.910696131414201, "grad_norm": 2.578125, "learning_rate": 0.0004640886309420231, "loss": 6.235, "mean_token_accuracy": 0.1308392196893692, "num_tokens": 38645635.0, "step": 17855 }, { "entropy": 6.5185023784637455, "epoch": 1.9112312055219647, "grad_norm": 1.546875, "learning_rate": 0.0004640679066461078, "loss": 6.1824, "mean_token_accuracy": 0.1497434303164482, "num_tokens": 38656293.0, "step": 17860 }, { "entropy": 6.5067955493927006, "epoch": 1.9117662796297288, "grad_norm": 2.015625, "learning_rate": 0.0004640471768908832, "loss": 6.2991, "mean_token_accuracy": 0.13123812302947044, "num_tokens": 38667307.0, "step": 17865 }, { "entropy": 6.555864238739014, "epoch": 1.9123013537374927, "grad_norm": 1.4375, "learning_rate": 0.0004640264416769481, "loss": 6.1718, "mean_token_accuracy": 0.13502105697989464, "num_tokens": 38677775.0, "step": 17870 }, { "entropy": 6.471245193481446, "epoch": 1.9128364278452565, "grad_norm": 1.90625, "learning_rate": 0.00046400570100490086, "loss": 6.2694, "mean_token_accuracy": 0.13582777678966523, "num_tokens": 38688652.0, "step": 17875 }, { "entropy": 6.500534534454346, "epoch": 1.9133715019530206, "grad_norm": 2.734375, "learning_rate": 0.00046398495487534066, "loss": 6.2256, "mean_token_accuracy": 0.13551617562770843, "num_tokens": 38698694.0, "step": 17880 }, { "entropy": 6.506363296508789, "epoch": 1.9139065760607843, "grad_norm": 1.578125, "learning_rate": 0.0004639642032888664, "loss": 6.2449, "mean_token_accuracy": 0.136919304728508, "num_tokens": 38709864.0, "step": 17885 }, { "entropy": 6.50716872215271, "epoch": 1.9144416501685484, "grad_norm": 1.3984375, "learning_rate": 0.0004639434462460774, "loss": 6.2412, "mean_token_accuracy": 0.13497220128774642, "num_tokens": 38721034.0, "step": 17890 }, { "entropy": 6.568297719955444, "epoch": 1.9149767242763123, "grad_norm": 1.734375, "learning_rate": 0.00046392268374757285, "loss": 6.2328, "mean_token_accuracy": 0.13604136258363725, "num_tokens": 38731874.0, "step": 17895 }, { "entropy": 6.487967205047608, "epoch": 1.9155117983840761, "grad_norm": 1.484375, "learning_rate": 0.0004639019157939524, "loss": 6.1748, "mean_token_accuracy": 0.14495863467454911, "num_tokens": 38742447.0, "step": 17900 }, { "entropy": 6.484689235687256, "epoch": 1.9160468724918402, "grad_norm": 2.109375, "learning_rate": 0.0004638811423858157, "loss": 6.1054, "mean_token_accuracy": 0.13880375921726226, "num_tokens": 38754117.0, "step": 17905 }, { "entropy": 6.554324913024902, "epoch": 1.916581946599604, "grad_norm": 1.4140625, "learning_rate": 0.00046386036352376255, "loss": 6.2277, "mean_token_accuracy": 0.131800340116024, "num_tokens": 38765057.0, "step": 17910 }, { "entropy": 6.493456125259399, "epoch": 1.917117020707368, "grad_norm": 1.578125, "learning_rate": 0.00046383957920839285, "loss": 6.1745, "mean_token_accuracy": 0.14344696775078775, "num_tokens": 38775938.0, "step": 17915 }, { "entropy": 6.426898050308227, "epoch": 1.9176520948151319, "grad_norm": 1.7265625, "learning_rate": 0.00046381878944030697, "loss": 6.1086, "mean_token_accuracy": 0.1440959244966507, "num_tokens": 38787013.0, "step": 17920 }, { "entropy": 6.486614990234375, "epoch": 1.9181871689228958, "grad_norm": 3.40625, "learning_rate": 0.000463797994220105, "loss": 6.1635, "mean_token_accuracy": 0.14382546991109849, "num_tokens": 38798412.0, "step": 17925 }, { "entropy": 6.483612489700318, "epoch": 1.9187222430306599, "grad_norm": 1.5703125, "learning_rate": 0.00046377719354838756, "loss": 6.2512, "mean_token_accuracy": 0.13215523809194565, "num_tokens": 38809983.0, "step": 17930 }, { "entropy": 6.530688667297364, "epoch": 1.9192573171384235, "grad_norm": 1.7734375, "learning_rate": 0.00046375638742575506, "loss": 6.2353, "mean_token_accuracy": 0.1396634139120579, "num_tokens": 38820418.0, "step": 17935 }, { "entropy": 6.560414886474609, "epoch": 1.9197923912461876, "grad_norm": 2.03125, "learning_rate": 0.0004637355758528085, "loss": 6.2265, "mean_token_accuracy": 0.14094739705324172, "num_tokens": 38831482.0, "step": 17940 }, { "entropy": 6.572238254547119, "epoch": 1.9203274653539515, "grad_norm": 1.546875, "learning_rate": 0.0004637147588301486, "loss": 6.2519, "mean_token_accuracy": 0.13170821741223335, "num_tokens": 38842110.0, "step": 17945 }, { "entropy": 6.451564836502075, "epoch": 1.9208625394617154, "grad_norm": 1.71875, "learning_rate": 0.00046369393635837657, "loss": 6.1156, "mean_token_accuracy": 0.13936901614069938, "num_tokens": 38852861.0, "step": 17950 }, { "entropy": 6.468238449096679, "epoch": 1.9213976135694795, "grad_norm": 1.671875, "learning_rate": 0.00046367310843809374, "loss": 6.2604, "mean_token_accuracy": 0.13597493693232537, "num_tokens": 38864067.0, "step": 17955 }, { "entropy": 6.567491865158081, "epoch": 1.9219326876772433, "grad_norm": 1.5390625, "learning_rate": 0.00046365227506990137, "loss": 6.2192, "mean_token_accuracy": 0.1376200519502163, "num_tokens": 38875363.0, "step": 17960 }, { "entropy": 6.594467115402222, "epoch": 1.9224677617850072, "grad_norm": 1.4140625, "learning_rate": 0.0004636314362544011, "loss": 6.2283, "mean_token_accuracy": 0.1406591974198818, "num_tokens": 38886414.0, "step": 17965 }, { "entropy": 6.539594984054565, "epoch": 1.923002835892771, "grad_norm": 1.5703125, "learning_rate": 0.00046361059199219457, "loss": 6.297, "mean_token_accuracy": 0.13197313323616983, "num_tokens": 38897708.0, "step": 17970 }, { "entropy": 6.451222896575928, "epoch": 1.923537910000535, "grad_norm": 1.6171875, "learning_rate": 0.0004635897422838837, "loss": 6.1608, "mean_token_accuracy": 0.14442215859889984, "num_tokens": 38908683.0, "step": 17975 }, { "entropy": 6.420654535293579, "epoch": 1.924072984108299, "grad_norm": 1.6171875, "learning_rate": 0.00046356888713007055, "loss": 6.1313, "mean_token_accuracy": 0.14991554766893386, "num_tokens": 38919279.0, "step": 17980 }, { "entropy": 6.555045938491821, "epoch": 1.924608058216063, "grad_norm": 1.359375, "learning_rate": 0.00046354802653135723, "loss": 6.2259, "mean_token_accuracy": 0.1369065135717392, "num_tokens": 38929353.0, "step": 17985 }, { "entropy": 6.5306110858917235, "epoch": 1.9251431323238268, "grad_norm": 1.5625, "learning_rate": 0.0004635271604883462, "loss": 6.1951, "mean_token_accuracy": 0.14035843312740326, "num_tokens": 38939296.0, "step": 17990 }, { "entropy": 6.471765947341919, "epoch": 1.925678206431591, "grad_norm": 1.75, "learning_rate": 0.00046350628900163987, "loss": 6.2031, "mean_token_accuracy": 0.13961842954158782, "num_tokens": 38950149.0, "step": 17995 }, { "entropy": 6.5483925342559814, "epoch": 1.9262132805393546, "grad_norm": 1.5, "learning_rate": 0.000463485412071841, "loss": 6.2342, "mean_token_accuracy": 0.13433675169944764, "num_tokens": 38961052.0, "step": 18000 }, { "epoch": 1.9262132805393546, "eval_entropy": 6.365103536153418, "eval_loss": 6.311902046203613, "eval_mean_token_accuracy": 0.14091309935652785, "eval_num_tokens": 38961052.0, "eval_runtime": 22.5469, "eval_samples_per_second": 1316.325, "eval_steps_per_second": 164.546, "step": 18000 } ], "logging_steps": 5, "max_steps": 93440, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 5.7313897393536e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }