{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 4.1733640109155115, "eval_steps": 3000, "global_step": 39000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691989517211914, "epoch": 0.0005350741077639254, "grad_norm": 10.75, "learning_rate": 2e-06, "loss": 10.8201, "mean_token_accuracy": 0.0, "num_tokens": 10038.0, "step": 5 }, { "entropy": 10.69193468093872, "epoch": 0.0010701482155278507, "grad_norm": 11.9375, "learning_rate": 4.5e-06, "loss": 10.789, "mean_token_accuracy": 0.00010810811072587967, "num_tokens": 21916.0, "step": 10 }, { "entropy": 10.690756225585938, "epoch": 0.0016052223232917758, "grad_norm": 8.875, "learning_rate": 7e-06, "loss": 10.5855, "mean_token_accuracy": 0.029181174421682953, "num_tokens": 33434.0, "step": 15 }, { "entropy": 10.660381984710693, "epoch": 0.0021402964310557014, "grad_norm": 5.71875, "learning_rate": 9.5e-06, "loss": 10.3113, "mean_token_accuracy": 0.04592931531369686, "num_tokens": 44216.0, "step": 20 }, { "entropy": 10.51073760986328, "epoch": 0.0026753705388196263, "grad_norm": 3.71875, "learning_rate": 1.2e-05, "loss": 10.1036, "mean_token_accuracy": 0.04351861346513033, "num_tokens": 54874.0, "step": 25 }, { "entropy": 10.5190824508667, "epoch": 0.0032104446465835517, "grad_norm": 3.09375, "learning_rate": 1.4500000000000002e-05, "loss": 9.9872, "mean_token_accuracy": 0.041112912446260454, "num_tokens": 65085.0, "step": 30 }, { "entropy": 10.547387790679931, "epoch": 0.003745518754347477, "grad_norm": 2.859375, "learning_rate": 1.7000000000000003e-05, "loss": 9.904, "mean_token_accuracy": 0.04395376648753881, "num_tokens": 75601.0, "step": 35 }, { "entropy": 10.474061203002929, "epoch": 0.004280592862111403, "grad_norm": 2.515625, "learning_rate": 1.95e-05, "loss": 9.8879, "mean_token_accuracy": 0.04307105913758278, "num_tokens": 86193.0, "step": 40 }, { "entropy": 10.531705379486084, "epoch": 0.004815666969875327, "grad_norm": 2.40625, "learning_rate": 2.2e-05, "loss": 9.8417, "mean_token_accuracy": 0.043867765367031096, "num_tokens": 96957.0, "step": 45 }, { "entropy": 10.478270435333252, "epoch": 0.005350741077639253, "grad_norm": 2.171875, "learning_rate": 2.4500000000000003e-05, "loss": 9.8114, "mean_token_accuracy": 0.046108495071530343, "num_tokens": 108408.0, "step": 50 }, { "entropy": 10.473760986328125, "epoch": 0.005885815185403178, "grad_norm": 1.7578125, "learning_rate": 2.7e-05, "loss": 9.7686, "mean_token_accuracy": 0.05027508921921253, "num_tokens": 119273.0, "step": 55 }, { "entropy": 10.462549209594727, "epoch": 0.006420889293167103, "grad_norm": 1.921875, "learning_rate": 2.95e-05, "loss": 9.6954, "mean_token_accuracy": 0.05541543699800968, "num_tokens": 130817.0, "step": 60 }, { "entropy": 10.302016353607177, "epoch": 0.006955963400931029, "grad_norm": 1.8671875, "learning_rate": 3.2e-05, "loss": 9.6448, "mean_token_accuracy": 0.05586838573217392, "num_tokens": 142599.0, "step": 65 }, { "entropy": 10.404022407531738, "epoch": 0.007491037508694954, "grad_norm": 1.9609375, "learning_rate": 3.4500000000000005e-05, "loss": 9.5697, "mean_token_accuracy": 0.05663685463368893, "num_tokens": 153617.0, "step": 70 }, { "entropy": 10.37060546875, "epoch": 0.00802611161645888, "grad_norm": 1.6953125, "learning_rate": 3.7e-05, "loss": 9.5239, "mean_token_accuracy": 0.05575243458151817, "num_tokens": 165280.0, "step": 75 }, { "entropy": 10.341149616241456, "epoch": 0.008561185724222806, "grad_norm": 1.546875, "learning_rate": 3.95e-05, "loss": 9.4643, "mean_token_accuracy": 0.055300182476639745, "num_tokens": 176896.0, "step": 80 }, { "entropy": 10.367101669311523, "epoch": 0.00909625983198673, "grad_norm": 1.5859375, "learning_rate": 4.2000000000000004e-05, "loss": 9.4019, "mean_token_accuracy": 0.05629164129495621, "num_tokens": 188000.0, "step": 85 }, { "entropy": 10.27455005645752, "epoch": 0.009631333939750655, "grad_norm": 1.6953125, "learning_rate": 4.45e-05, "loss": 9.3493, "mean_token_accuracy": 0.057158011198043826, "num_tokens": 199360.0, "step": 90 }, { "entropy": 10.319551277160645, "epoch": 0.01016640804751458, "grad_norm": 1.5703125, "learning_rate": 4.7000000000000004e-05, "loss": 9.2957, "mean_token_accuracy": 0.052791529521346095, "num_tokens": 210214.0, "step": 95 }, { "entropy": 10.196423625946045, "epoch": 0.010701482155278505, "grad_norm": 1.5078125, "learning_rate": 4.9500000000000004e-05, "loss": 9.1506, "mean_token_accuracy": 0.06025413721799851, "num_tokens": 220567.0, "step": 100 }, { "entropy": 10.14912462234497, "epoch": 0.011236556263042432, "grad_norm": 1.578125, "learning_rate": 5.2e-05, "loss": 9.057, "mean_token_accuracy": 0.06051998771727085, "num_tokens": 230585.0, "step": 105 }, { "entropy": 10.099914455413819, "epoch": 0.011771630370806356, "grad_norm": 1.53125, "learning_rate": 5.45e-05, "loss": 8.9907, "mean_token_accuracy": 0.06339392885565757, "num_tokens": 241996.0, "step": 110 }, { "entropy": 10.083064746856689, "epoch": 0.012306704478570282, "grad_norm": 1.3671875, "learning_rate": 5.7e-05, "loss": 8.9558, "mean_token_accuracy": 0.05828723199665546, "num_tokens": 253348.0, "step": 115 }, { "entropy": 9.981218147277833, "epoch": 0.012841778586334207, "grad_norm": 1.421875, "learning_rate": 5.9499999999999996e-05, "loss": 8.8376, "mean_token_accuracy": 0.05671278983354568, "num_tokens": 264239.0, "step": 120 }, { "entropy": 9.828715324401855, "epoch": 0.013376852694098133, "grad_norm": 1.2578125, "learning_rate": 6.2e-05, "loss": 8.7502, "mean_token_accuracy": 0.056628919392824176, "num_tokens": 274522.0, "step": 125 }, { "entropy": 9.77067985534668, "epoch": 0.013911926801862057, "grad_norm": 1.34375, "learning_rate": 6.450000000000001e-05, "loss": 8.6474, "mean_token_accuracy": 0.06091504544019699, "num_tokens": 284492.0, "step": 130 }, { "entropy": 9.592880916595458, "epoch": 0.014447000909625984, "grad_norm": 1.40625, "learning_rate": 6.7e-05, "loss": 8.6035, "mean_token_accuracy": 0.05946716032922268, "num_tokens": 294796.0, "step": 135 }, { "entropy": 9.45958080291748, "epoch": 0.014982075017389908, "grad_norm": 1.0, "learning_rate": 6.950000000000001e-05, "loss": 8.574, "mean_token_accuracy": 0.05749143101274967, "num_tokens": 305252.0, "step": 140 }, { "entropy": 9.359578514099121, "epoch": 0.015517149125153834, "grad_norm": 1.0859375, "learning_rate": 7.2e-05, "loss": 8.4804, "mean_token_accuracy": 0.056437050178647044, "num_tokens": 315505.0, "step": 145 }, { "entropy": 9.158096408843994, "epoch": 0.01605222323291776, "grad_norm": 1.5, "learning_rate": 7.45e-05, "loss": 8.4819, "mean_token_accuracy": 0.05990221984684467, "num_tokens": 326997.0, "step": 150 }, { "entropy": 9.094014644622803, "epoch": 0.016587297340681685, "grad_norm": 1.109375, "learning_rate": 7.7e-05, "loss": 8.4165, "mean_token_accuracy": 0.05523004196584225, "num_tokens": 338089.0, "step": 155 }, { "entropy": 8.880174732208252, "epoch": 0.01712237144844561, "grad_norm": 1.234375, "learning_rate": 7.950000000000001e-05, "loss": 8.4077, "mean_token_accuracy": 0.05682347491383553, "num_tokens": 348536.0, "step": 160 }, { "entropy": 8.93060073852539, "epoch": 0.017657445556209534, "grad_norm": 0.9296875, "learning_rate": 8.2e-05, "loss": 8.4181, "mean_token_accuracy": 0.058796605467796324, "num_tokens": 359776.0, "step": 165 }, { "entropy": 8.809493732452392, "epoch": 0.01819251966397346, "grad_norm": 1.015625, "learning_rate": 8.450000000000001e-05, "loss": 8.3472, "mean_token_accuracy": 0.06165213547646999, "num_tokens": 370810.0, "step": 170 }, { "entropy": 8.747115898132325, "epoch": 0.018727593771737387, "grad_norm": 0.94140625, "learning_rate": 8.7e-05, "loss": 8.3511, "mean_token_accuracy": 0.05888295993208885, "num_tokens": 381788.0, "step": 175 }, { "entropy": 8.742884063720703, "epoch": 0.01926266787950131, "grad_norm": 1.0390625, "learning_rate": 8.95e-05, "loss": 8.3376, "mean_token_accuracy": 0.0602983683347702, "num_tokens": 391984.0, "step": 180 }, { "entropy": 8.610486602783203, "epoch": 0.019797741987265235, "grad_norm": 1.0, "learning_rate": 9.2e-05, "loss": 8.3311, "mean_token_accuracy": 0.058925900235772134, "num_tokens": 403430.0, "step": 185 }, { "entropy": 8.670144844055176, "epoch": 0.02033281609502916, "grad_norm": 1.0234375, "learning_rate": 9.45e-05, "loss": 8.318, "mean_token_accuracy": 0.05627542734146118, "num_tokens": 414467.0, "step": 190 }, { "entropy": 8.56268243789673, "epoch": 0.020867890202793088, "grad_norm": 0.921875, "learning_rate": 9.7e-05, "loss": 8.2838, "mean_token_accuracy": 0.06462269835174084, "num_tokens": 425752.0, "step": 195 }, { "entropy": 8.562543296813965, "epoch": 0.02140296431055701, "grad_norm": 0.94921875, "learning_rate": 9.95e-05, "loss": 8.2618, "mean_token_accuracy": 0.06471644267439843, "num_tokens": 435908.0, "step": 200 }, { "entropy": 8.58950891494751, "epoch": 0.021938038418320937, "grad_norm": 1.0390625, "learning_rate": 0.000102, "loss": 8.3051, "mean_token_accuracy": 0.05973440445959568, "num_tokens": 446424.0, "step": 205 }, { "entropy": 8.575794887542724, "epoch": 0.022473112526084863, "grad_norm": 1.03125, "learning_rate": 0.00010449999999999999, "loss": 8.2691, "mean_token_accuracy": 0.0648487914353609, "num_tokens": 456854.0, "step": 210 }, { "entropy": 8.506811428070069, "epoch": 0.02300818663384879, "grad_norm": 1.078125, "learning_rate": 0.000107, "loss": 8.2861, "mean_token_accuracy": 0.06673729792237282, "num_tokens": 467899.0, "step": 215 }, { "entropy": 8.497941493988037, "epoch": 0.023543260741612712, "grad_norm": 1.0078125, "learning_rate": 0.0001095, "loss": 8.2297, "mean_token_accuracy": 0.06340378113090991, "num_tokens": 478683.0, "step": 220 }, { "entropy": 8.574148082733155, "epoch": 0.02407833484937664, "grad_norm": 1.046875, "learning_rate": 0.000112, "loss": 8.2648, "mean_token_accuracy": 0.06170066706836223, "num_tokens": 488745.0, "step": 225 }, { "entropy": 8.4907470703125, "epoch": 0.024613408957140565, "grad_norm": 1.0703125, "learning_rate": 0.0001145, "loss": 8.3431, "mean_token_accuracy": 0.059930100291967395, "num_tokens": 499448.0, "step": 230 }, { "entropy": 8.599916458129883, "epoch": 0.02514848306490449, "grad_norm": 0.95703125, "learning_rate": 0.00011700000000000001, "loss": 8.27, "mean_token_accuracy": 0.0650645636022091, "num_tokens": 510148.0, "step": 235 }, { "entropy": 8.483675956726074, "epoch": 0.025683557172668414, "grad_norm": 1.0078125, "learning_rate": 0.00011949999999999999, "loss": 8.1965, "mean_token_accuracy": 0.06112907975912094, "num_tokens": 522093.0, "step": 240 }, { "entropy": 8.460341262817384, "epoch": 0.02621863128043234, "grad_norm": 1.015625, "learning_rate": 0.000122, "loss": 8.2277, "mean_token_accuracy": 0.06530554480850696, "num_tokens": 532598.0, "step": 245 }, { "entropy": 8.49462070465088, "epoch": 0.026753705388196266, "grad_norm": 1.171875, "learning_rate": 0.0001245, "loss": 8.1956, "mean_token_accuracy": 0.06578520573675632, "num_tokens": 542652.0, "step": 250 }, { "entropy": 8.460633659362793, "epoch": 0.027288779495960192, "grad_norm": 1.015625, "learning_rate": 0.000127, "loss": 8.2328, "mean_token_accuracy": 0.06693280301988125, "num_tokens": 552526.0, "step": 255 }, { "entropy": 8.399180793762207, "epoch": 0.027823853603724115, "grad_norm": 0.98046875, "learning_rate": 0.0001295, "loss": 8.2517, "mean_token_accuracy": 0.06344069167971611, "num_tokens": 563143.0, "step": 260 }, { "entropy": 8.48379201889038, "epoch": 0.02835892771148804, "grad_norm": 0.94921875, "learning_rate": 0.000132, "loss": 8.2149, "mean_token_accuracy": 0.06581672765314579, "num_tokens": 573814.0, "step": 265 }, { "entropy": 8.457896327972412, "epoch": 0.028894001819251967, "grad_norm": 0.890625, "learning_rate": 0.00013450000000000002, "loss": 8.1733, "mean_token_accuracy": 0.07218663729727268, "num_tokens": 585367.0, "step": 270 }, { "entropy": 8.507985496520996, "epoch": 0.02942907592701589, "grad_norm": 3.078125, "learning_rate": 0.00013700000000000002, "loss": 8.2318, "mean_token_accuracy": 0.06521918512880802, "num_tokens": 595902.0, "step": 275 }, { "entropy": 8.41034107208252, "epoch": 0.029964150034779816, "grad_norm": 1.4375, "learning_rate": 0.0001395, "loss": 8.138, "mean_token_accuracy": 0.0642226304858923, "num_tokens": 607178.0, "step": 280 }, { "entropy": 8.431483745574951, "epoch": 0.030499224142543743, "grad_norm": 0.94140625, "learning_rate": 0.00014199999999999998, "loss": 8.1309, "mean_token_accuracy": 0.06817701198160649, "num_tokens": 618604.0, "step": 285 }, { "entropy": 8.404507827758788, "epoch": 0.03103429825030767, "grad_norm": 0.9921875, "learning_rate": 0.0001445, "loss": 8.2, "mean_token_accuracy": 0.0719299040734768, "num_tokens": 628111.0, "step": 290 }, { "entropy": 8.490602397918702, "epoch": 0.03156937235807159, "grad_norm": 1.453125, "learning_rate": 0.000147, "loss": 8.2289, "mean_token_accuracy": 0.06933129876852036, "num_tokens": 639358.0, "step": 295 }, { "entropy": 8.35900354385376, "epoch": 0.03210444646583552, "grad_norm": 1.0078125, "learning_rate": 0.0001495, "loss": 8.0903, "mean_token_accuracy": 0.07086234539747238, "num_tokens": 649504.0, "step": 300 }, { "entropy": 8.400328350067138, "epoch": 0.032639520573599444, "grad_norm": 1.1171875, "learning_rate": 0.000152, "loss": 8.1111, "mean_token_accuracy": 0.0681851863861084, "num_tokens": 659924.0, "step": 305 }, { "entropy": 8.422282886505126, "epoch": 0.03317459468136337, "grad_norm": 1.328125, "learning_rate": 0.00015450000000000001, "loss": 8.15, "mean_token_accuracy": 0.06455899253487588, "num_tokens": 671120.0, "step": 310 }, { "entropy": 8.319589424133301, "epoch": 0.033709668789127296, "grad_norm": 1.0390625, "learning_rate": 0.000157, "loss": 8.1985, "mean_token_accuracy": 0.06430512070655822, "num_tokens": 681956.0, "step": 315 }, { "entropy": 8.48956241607666, "epoch": 0.03424474289689122, "grad_norm": 0.953125, "learning_rate": 0.0001595, "loss": 8.182, "mean_token_accuracy": 0.06503869034349918, "num_tokens": 693226.0, "step": 320 }, { "entropy": 8.33993911743164, "epoch": 0.03477981700465514, "grad_norm": 0.94140625, "learning_rate": 0.000162, "loss": 8.1812, "mean_token_accuracy": 0.07134119421243668, "num_tokens": 704691.0, "step": 325 }, { "entropy": 8.362220954895019, "epoch": 0.03531489111241907, "grad_norm": 0.94921875, "learning_rate": 0.00016450000000000001, "loss": 8.1304, "mean_token_accuracy": 0.062357674539089206, "num_tokens": 716000.0, "step": 330 }, { "entropy": 8.332426834106446, "epoch": 0.035849965220182994, "grad_norm": 0.9296875, "learning_rate": 0.00016700000000000002, "loss": 8.0529, "mean_token_accuracy": 0.06962560564279556, "num_tokens": 726723.0, "step": 335 }, { "entropy": 8.32654685974121, "epoch": 0.03638503932794692, "grad_norm": 1.0390625, "learning_rate": 0.00016950000000000003, "loss": 8.0646, "mean_token_accuracy": 0.07072275690734386, "num_tokens": 736740.0, "step": 340 }, { "entropy": 8.333600425720215, "epoch": 0.03692011343571085, "grad_norm": 1.859375, "learning_rate": 0.00017199999999999998, "loss": 8.1131, "mean_token_accuracy": 0.068069913610816, "num_tokens": 747567.0, "step": 345 }, { "entropy": 8.398985290527344, "epoch": 0.03745518754347477, "grad_norm": 1.03125, "learning_rate": 0.00017449999999999999, "loss": 8.0626, "mean_token_accuracy": 0.06914932392537594, "num_tokens": 757937.0, "step": 350 }, { "entropy": 8.163579368591309, "epoch": 0.0379902616512387, "grad_norm": 1.0234375, "learning_rate": 0.000177, "loss": 8.0955, "mean_token_accuracy": 0.07165054567158222, "num_tokens": 768003.0, "step": 355 }, { "entropy": 8.49596710205078, "epoch": 0.03852533575900262, "grad_norm": 0.9453125, "learning_rate": 0.0001795, "loss": 8.1288, "mean_token_accuracy": 0.06314317509531975, "num_tokens": 779098.0, "step": 360 }, { "entropy": 8.285042762756348, "epoch": 0.039060409866766545, "grad_norm": 1.1796875, "learning_rate": 0.000182, "loss": 8.099, "mean_token_accuracy": 0.06513171158730983, "num_tokens": 790002.0, "step": 365 }, { "entropy": 8.28923921585083, "epoch": 0.03959548397453047, "grad_norm": 1.0234375, "learning_rate": 0.0001845, "loss": 8.0887, "mean_token_accuracy": 0.06843880005180836, "num_tokens": 800444.0, "step": 370 }, { "entropy": 8.375462627410888, "epoch": 0.0401305580822944, "grad_norm": 1.0390625, "learning_rate": 0.000187, "loss": 8.0323, "mean_token_accuracy": 0.0713271751999855, "num_tokens": 810912.0, "step": 375 }, { "entropy": 8.272585010528564, "epoch": 0.04066563219005832, "grad_norm": 0.9375, "learning_rate": 0.0001895, "loss": 8.1198, "mean_token_accuracy": 0.0620170421898365, "num_tokens": 822809.0, "step": 380 }, { "entropy": 8.293894195556641, "epoch": 0.04120070629782225, "grad_norm": 1.0078125, "learning_rate": 0.000192, "loss": 8.0433, "mean_token_accuracy": 0.07052243873476982, "num_tokens": 833362.0, "step": 385 }, { "entropy": 8.276584053039551, "epoch": 0.041735780405586176, "grad_norm": 1.109375, "learning_rate": 0.0001945, "loss": 8.0465, "mean_token_accuracy": 0.07357921116054059, "num_tokens": 844239.0, "step": 390 }, { "entropy": 8.217984676361084, "epoch": 0.0422708545133501, "grad_norm": 1.0546875, "learning_rate": 0.00019700000000000002, "loss": 8.0493, "mean_token_accuracy": 0.06498224660754204, "num_tokens": 855178.0, "step": 395 }, { "entropy": 8.19730110168457, "epoch": 0.04280592862111402, "grad_norm": 1.15625, "learning_rate": 0.00019950000000000002, "loss": 8.0369, "mean_token_accuracy": 0.07206248976290226, "num_tokens": 866120.0, "step": 400 }, { "entropy": 8.337959480285644, "epoch": 0.04334100272887795, "grad_norm": 0.9453125, "learning_rate": 0.000202, "loss": 8.0361, "mean_token_accuracy": 0.07243039160966873, "num_tokens": 876569.0, "step": 405 }, { "entropy": 8.284227752685547, "epoch": 0.043876076836641874, "grad_norm": 0.9921875, "learning_rate": 0.00020449999999999998, "loss": 8.0951, "mean_token_accuracy": 0.06462065242230892, "num_tokens": 887580.0, "step": 410 }, { "entropy": 8.235477828979493, "epoch": 0.0444111509444058, "grad_norm": 1.046875, "learning_rate": 0.000207, "loss": 8.0165, "mean_token_accuracy": 0.0666106827557087, "num_tokens": 897922.0, "step": 415 }, { "entropy": 8.222909069061279, "epoch": 0.044946225052169726, "grad_norm": 1.0234375, "learning_rate": 0.0002095, "loss": 7.9827, "mean_token_accuracy": 0.07159848175942898, "num_tokens": 908522.0, "step": 420 }, { "entropy": 8.27180290222168, "epoch": 0.04548129915993365, "grad_norm": 1.078125, "learning_rate": 0.000212, "loss": 7.9946, "mean_token_accuracy": 0.06654324233531952, "num_tokens": 918253.0, "step": 425 }, { "entropy": 8.194285202026368, "epoch": 0.04601637326769758, "grad_norm": 0.91015625, "learning_rate": 0.0002145, "loss": 8.0034, "mean_token_accuracy": 0.07207662984728813, "num_tokens": 929150.0, "step": 430 }, { "entropy": 8.239371013641357, "epoch": 0.0465514473754615, "grad_norm": 0.94140625, "learning_rate": 0.00021700000000000002, "loss": 8.0511, "mean_token_accuracy": 0.07106035277247429, "num_tokens": 941041.0, "step": 435 }, { "entropy": 8.180944156646728, "epoch": 0.047086521483225424, "grad_norm": 1.59375, "learning_rate": 0.0002195, "loss": 7.9757, "mean_token_accuracy": 0.07760139927268028, "num_tokens": 952714.0, "step": 440 }, { "entropy": 8.150847339630127, "epoch": 0.04762159559098935, "grad_norm": 1.109375, "learning_rate": 0.000222, "loss": 8.0514, "mean_token_accuracy": 0.06907343231141568, "num_tokens": 964330.0, "step": 445 }, { "entropy": 8.246770858764648, "epoch": 0.04815666969875328, "grad_norm": 1.1796875, "learning_rate": 0.0002245, "loss": 7.9805, "mean_token_accuracy": 0.06862297914922237, "num_tokens": 975257.0, "step": 450 }, { "entropy": 8.260761165618897, "epoch": 0.0486917438065172, "grad_norm": 1.09375, "learning_rate": 0.00022700000000000002, "loss": 7.9876, "mean_token_accuracy": 0.07001541927456856, "num_tokens": 986335.0, "step": 455 }, { "entropy": 8.069970512390137, "epoch": 0.04922681791428113, "grad_norm": 0.859375, "learning_rate": 0.00022950000000000002, "loss": 7.8883, "mean_token_accuracy": 0.07471956759691238, "num_tokens": 997521.0, "step": 460 }, { "entropy": 8.172566795349121, "epoch": 0.049761892022045055, "grad_norm": 0.921875, "learning_rate": 0.00023200000000000003, "loss": 7.941, "mean_token_accuracy": 0.0669164728373289, "num_tokens": 1008383.0, "step": 465 }, { "entropy": 8.124609184265136, "epoch": 0.05029696612980898, "grad_norm": 1.09375, "learning_rate": 0.00023449999999999998, "loss": 7.998, "mean_token_accuracy": 0.06806416064500809, "num_tokens": 1020552.0, "step": 470 }, { "entropy": 8.196929836273194, "epoch": 0.0508320402375729, "grad_norm": 0.90625, "learning_rate": 0.000237, "loss": 7.9718, "mean_token_accuracy": 0.07053619101643563, "num_tokens": 1031127.0, "step": 475 }, { "entropy": 8.022743558883667, "epoch": 0.05136711434533683, "grad_norm": 0.890625, "learning_rate": 0.0002395, "loss": 7.8837, "mean_token_accuracy": 0.07386223524808884, "num_tokens": 1043209.0, "step": 480 }, { "entropy": 8.2311222076416, "epoch": 0.05190218845310075, "grad_norm": 0.96875, "learning_rate": 0.000242, "loss": 8.0182, "mean_token_accuracy": 0.06782832555472851, "num_tokens": 1054032.0, "step": 485 }, { "entropy": 8.030213356018066, "epoch": 0.05243726256086468, "grad_norm": 1.03125, "learning_rate": 0.0002445, "loss": 7.8628, "mean_token_accuracy": 0.07288614809513091, "num_tokens": 1064565.0, "step": 490 }, { "entropy": 8.178169107437133, "epoch": 0.052972336668628606, "grad_norm": 0.94140625, "learning_rate": 0.000247, "loss": 7.9975, "mean_token_accuracy": 0.0721826508641243, "num_tokens": 1076352.0, "step": 495 }, { "entropy": 8.112149047851563, "epoch": 0.05350741077639253, "grad_norm": 1.1484375, "learning_rate": 0.0002495, "loss": 7.9381, "mean_token_accuracy": 0.07542271986603737, "num_tokens": 1087697.0, "step": 500 }, { "entropy": 8.137825202941894, "epoch": 0.05404248488415646, "grad_norm": 0.99609375, "learning_rate": 0.000252, "loss": 7.876, "mean_token_accuracy": 0.07182962782680988, "num_tokens": 1098056.0, "step": 505 }, { "entropy": 8.017078876495361, "epoch": 0.054577558991920384, "grad_norm": 1.0, "learning_rate": 0.0002545, "loss": 7.8477, "mean_token_accuracy": 0.07691125422716141, "num_tokens": 1109219.0, "step": 510 }, { "entropy": 8.091530561447144, "epoch": 0.055112633099684304, "grad_norm": 0.94140625, "learning_rate": 0.000257, "loss": 7.9312, "mean_token_accuracy": 0.0700716007500887, "num_tokens": 1120248.0, "step": 515 }, { "entropy": 8.096777963638306, "epoch": 0.05564770720744823, "grad_norm": 1.1171875, "learning_rate": 0.0002595, "loss": 7.9366, "mean_token_accuracy": 0.07186660170555115, "num_tokens": 1131278.0, "step": 520 }, { "entropy": 8.089863491058349, "epoch": 0.056182781315212156, "grad_norm": 1.1875, "learning_rate": 0.000262, "loss": 7.9537, "mean_token_accuracy": 0.06224438659846783, "num_tokens": 1143147.0, "step": 525 }, { "entropy": 8.162030553817749, "epoch": 0.05671785542297608, "grad_norm": 0.89453125, "learning_rate": 0.00026450000000000003, "loss": 7.84, "mean_token_accuracy": 0.0739860113710165, "num_tokens": 1154316.0, "step": 530 }, { "entropy": 7.977855777740478, "epoch": 0.05725292953074001, "grad_norm": 1.0234375, "learning_rate": 0.00026700000000000004, "loss": 7.8967, "mean_token_accuracy": 0.06953345276415349, "num_tokens": 1164696.0, "step": 535 }, { "entropy": 8.048009157180786, "epoch": 0.057788003638503935, "grad_norm": 1.0, "learning_rate": 0.00026950000000000005, "loss": 7.8769, "mean_token_accuracy": 0.07776758968830108, "num_tokens": 1176129.0, "step": 540 }, { "entropy": 8.093161487579346, "epoch": 0.05832307774626786, "grad_norm": 1.0625, "learning_rate": 0.00027200000000000005, "loss": 7.8881, "mean_token_accuracy": 0.07334664314985276, "num_tokens": 1186499.0, "step": 545 }, { "entropy": 8.04116907119751, "epoch": 0.05885815185403178, "grad_norm": 0.98046875, "learning_rate": 0.0002745, "loss": 7.8557, "mean_token_accuracy": 0.07062512040138244, "num_tokens": 1196841.0, "step": 550 }, { "entropy": 8.01404366493225, "epoch": 0.059393225961795706, "grad_norm": 0.91796875, "learning_rate": 0.000277, "loss": 7.8108, "mean_token_accuracy": 0.07467551231384277, "num_tokens": 1207647.0, "step": 555 }, { "entropy": 7.952892255783081, "epoch": 0.05992830006955963, "grad_norm": 1.1015625, "learning_rate": 0.0002795, "loss": 7.801, "mean_token_accuracy": 0.07650438733398915, "num_tokens": 1217072.0, "step": 560 }, { "entropy": 8.061871433258057, "epoch": 0.06046337417732356, "grad_norm": 1.0859375, "learning_rate": 0.00028199999999999997, "loss": 7.9129, "mean_token_accuracy": 0.0698221705853939, "num_tokens": 1228564.0, "step": 565 }, { "entropy": 7.987078428268433, "epoch": 0.060998448285087485, "grad_norm": 0.99609375, "learning_rate": 0.0002845, "loss": 7.8458, "mean_token_accuracy": 0.07497354932129383, "num_tokens": 1238755.0, "step": 570 }, { "entropy": 7.964116954803467, "epoch": 0.06153352239285141, "grad_norm": 1.1484375, "learning_rate": 0.000287, "loss": 7.8004, "mean_token_accuracy": 0.0752273216843605, "num_tokens": 1248968.0, "step": 575 }, { "entropy": 7.962353372573853, "epoch": 0.06206859650061534, "grad_norm": 1.0, "learning_rate": 0.0002895, "loss": 7.7714, "mean_token_accuracy": 0.07172017395496369, "num_tokens": 1259256.0, "step": 580 }, { "entropy": 7.952462911605835, "epoch": 0.06260367060837926, "grad_norm": 1.0859375, "learning_rate": 0.000292, "loss": 7.8067, "mean_token_accuracy": 0.07487296611070633, "num_tokens": 1270469.0, "step": 585 }, { "entropy": 7.963806390762329, "epoch": 0.06313874471614318, "grad_norm": 1.0078125, "learning_rate": 0.0002945, "loss": 7.7694, "mean_token_accuracy": 0.07279012463986874, "num_tokens": 1280558.0, "step": 590 }, { "entropy": 7.986854600906372, "epoch": 0.06367381882390712, "grad_norm": 1.046875, "learning_rate": 0.000297, "loss": 7.8307, "mean_token_accuracy": 0.0718784749507904, "num_tokens": 1291372.0, "step": 595 }, { "entropy": 8.02498688697815, "epoch": 0.06420889293167104, "grad_norm": 0.9921875, "learning_rate": 0.0002995, "loss": 7.9061, "mean_token_accuracy": 0.0674042422324419, "num_tokens": 1302521.0, "step": 600 }, { "entropy": 7.8433699131011965, "epoch": 0.06474396703943497, "grad_norm": 1.109375, "learning_rate": 0.000302, "loss": 7.7274, "mean_token_accuracy": 0.07444682195782662, "num_tokens": 1313632.0, "step": 605 }, { "entropy": 8.005569124221802, "epoch": 0.06527904114719889, "grad_norm": 0.96484375, "learning_rate": 0.0003045, "loss": 7.8118, "mean_token_accuracy": 0.07571293860673904, "num_tokens": 1325247.0, "step": 610 }, { "entropy": 7.937390947341919, "epoch": 0.06581411525496281, "grad_norm": 0.9453125, "learning_rate": 0.000307, "loss": 7.8015, "mean_token_accuracy": 0.075490290671587, "num_tokens": 1336026.0, "step": 615 }, { "entropy": 7.93022665977478, "epoch": 0.06634918936272674, "grad_norm": 0.93359375, "learning_rate": 0.0003095, "loss": 7.7122, "mean_token_accuracy": 0.0769732192158699, "num_tokens": 1346920.0, "step": 620 }, { "entropy": 7.828203010559082, "epoch": 0.06688426347049066, "grad_norm": 1.21875, "learning_rate": 0.000312, "loss": 7.8585, "mean_token_accuracy": 0.0724661260843277, "num_tokens": 1359752.0, "step": 625 }, { "entropy": 8.050937986373901, "epoch": 0.06741933757825459, "grad_norm": 0.95703125, "learning_rate": 0.0003145, "loss": 7.8615, "mean_token_accuracy": 0.07357175201177597, "num_tokens": 1370874.0, "step": 630 }, { "entropy": 7.897751331329346, "epoch": 0.06795441168601851, "grad_norm": 0.9140625, "learning_rate": 0.000317, "loss": 7.7624, "mean_token_accuracy": 0.07756051793694496, "num_tokens": 1382316.0, "step": 635 }, { "entropy": 7.840310096740723, "epoch": 0.06848948579378245, "grad_norm": 1.0, "learning_rate": 0.0003195, "loss": 7.7878, "mean_token_accuracy": 0.07577594220638276, "num_tokens": 1394656.0, "step": 640 }, { "entropy": 7.928963756561279, "epoch": 0.06902455990154636, "grad_norm": 1.0, "learning_rate": 0.000322, "loss": 7.7522, "mean_token_accuracy": 0.07719769552350045, "num_tokens": 1405061.0, "step": 645 }, { "entropy": 7.838529491424561, "epoch": 0.06955963400931028, "grad_norm": 0.9140625, "learning_rate": 0.00032450000000000003, "loss": 7.7183, "mean_token_accuracy": 0.08189134374260902, "num_tokens": 1415573.0, "step": 650 }, { "entropy": 7.810403823852539, "epoch": 0.07009470811707422, "grad_norm": 1.015625, "learning_rate": 0.00032700000000000003, "loss": 7.7436, "mean_token_accuracy": 0.07435674965381622, "num_tokens": 1426103.0, "step": 655 }, { "entropy": 7.886046600341797, "epoch": 0.07062978222483814, "grad_norm": 1.6796875, "learning_rate": 0.00032950000000000004, "loss": 7.7599, "mean_token_accuracy": 0.07234186008572578, "num_tokens": 1437256.0, "step": 660 }, { "entropy": 7.909786796569824, "epoch": 0.07116485633260207, "grad_norm": 1.0859375, "learning_rate": 0.00033200000000000005, "loss": 7.7241, "mean_token_accuracy": 0.0786049198359251, "num_tokens": 1446975.0, "step": 665 }, { "entropy": 7.831602573394775, "epoch": 0.07169993044036599, "grad_norm": 0.99609375, "learning_rate": 0.00033450000000000005, "loss": 7.7425, "mean_token_accuracy": 0.07444198578596115, "num_tokens": 1457751.0, "step": 670 }, { "entropy": 7.829366731643677, "epoch": 0.07223500454812992, "grad_norm": 1.046875, "learning_rate": 0.000337, "loss": 7.7049, "mean_token_accuracy": 0.0754860796034336, "num_tokens": 1468186.0, "step": 675 }, { "entropy": 7.825147390365601, "epoch": 0.07277007865589384, "grad_norm": 0.83203125, "learning_rate": 0.0003395, "loss": 7.7508, "mean_token_accuracy": 0.07570655383169651, "num_tokens": 1479780.0, "step": 680 }, { "entropy": 7.8603636741638185, "epoch": 0.07330515276365776, "grad_norm": 0.94921875, "learning_rate": 0.000342, "loss": 7.6712, "mean_token_accuracy": 0.0832133986055851, "num_tokens": 1490565.0, "step": 685 }, { "entropy": 7.892835903167724, "epoch": 0.0738402268714217, "grad_norm": 0.96875, "learning_rate": 0.00034449999999999997, "loss": 7.7227, "mean_token_accuracy": 0.07809135504066944, "num_tokens": 1501552.0, "step": 690 }, { "entropy": 7.798111057281494, "epoch": 0.07437530097918561, "grad_norm": 0.9375, "learning_rate": 0.000347, "loss": 7.7035, "mean_token_accuracy": 0.07376831583678722, "num_tokens": 1513311.0, "step": 695 }, { "entropy": 7.795570516586304, "epoch": 0.07491037508694955, "grad_norm": 0.98046875, "learning_rate": 0.0003495, "loss": 7.7428, "mean_token_accuracy": 0.08057990670204163, "num_tokens": 1524142.0, "step": 700 }, { "entropy": 7.8165356636047365, "epoch": 0.07544544919471347, "grad_norm": 1.03125, "learning_rate": 0.000352, "loss": 7.7188, "mean_token_accuracy": 0.07599906846880913, "num_tokens": 1535571.0, "step": 705 }, { "entropy": 7.865922546386718, "epoch": 0.0759805233024774, "grad_norm": 0.89453125, "learning_rate": 0.0003545, "loss": 7.7225, "mean_token_accuracy": 0.07798022851347923, "num_tokens": 1546528.0, "step": 710 }, { "entropy": 7.727042579650879, "epoch": 0.07651559741024132, "grad_norm": 0.8828125, "learning_rate": 0.000357, "loss": 7.7386, "mean_token_accuracy": 0.07202219888567925, "num_tokens": 1557264.0, "step": 715 }, { "entropy": 7.867890882492065, "epoch": 0.07705067151800524, "grad_norm": 1.0625, "learning_rate": 0.0003595, "loss": 7.6785, "mean_token_accuracy": 0.08276100754737854, "num_tokens": 1566773.0, "step": 720 }, { "entropy": 7.699678039550781, "epoch": 0.07758574562576917, "grad_norm": 0.96875, "learning_rate": 0.000362, "loss": 7.6459, "mean_token_accuracy": 0.08662735894322396, "num_tokens": 1578173.0, "step": 725 }, { "entropy": 7.779191970825195, "epoch": 0.07812081973353309, "grad_norm": 0.98046875, "learning_rate": 0.0003645, "loss": 7.6221, "mean_token_accuracy": 0.08249625936150551, "num_tokens": 1588537.0, "step": 730 }, { "entropy": 7.7231770038604735, "epoch": 0.07865589384129702, "grad_norm": 0.98046875, "learning_rate": 0.000367, "loss": 7.6355, "mean_token_accuracy": 0.08746174871921539, "num_tokens": 1599159.0, "step": 735 }, { "entropy": 7.7618378639221195, "epoch": 0.07919096794906094, "grad_norm": 0.9921875, "learning_rate": 0.0003695, "loss": 7.6989, "mean_token_accuracy": 0.07925031632184983, "num_tokens": 1610378.0, "step": 740 }, { "entropy": 7.720492362976074, "epoch": 0.07972604205682488, "grad_norm": 1.1328125, "learning_rate": 0.000372, "loss": 7.705, "mean_token_accuracy": 0.07612368240952491, "num_tokens": 1621215.0, "step": 745 }, { "entropy": 7.786748743057251, "epoch": 0.0802611161645888, "grad_norm": 1.0625, "learning_rate": 0.0003745, "loss": 7.6622, "mean_token_accuracy": 0.0790612380951643, "num_tokens": 1631170.0, "step": 750 }, { "entropy": 7.78691840171814, "epoch": 0.08079619027235273, "grad_norm": 0.98828125, "learning_rate": 0.000377, "loss": 7.6574, "mean_token_accuracy": 0.07428538724780083, "num_tokens": 1641897.0, "step": 755 }, { "entropy": 7.766008996963501, "epoch": 0.08133126438011665, "grad_norm": 0.95703125, "learning_rate": 0.0003795, "loss": 7.7353, "mean_token_accuracy": 0.07569916620850563, "num_tokens": 1653592.0, "step": 760 }, { "entropy": 7.616559743881226, "epoch": 0.08186633848788057, "grad_norm": 0.9375, "learning_rate": 0.000382, "loss": 7.6528, "mean_token_accuracy": 0.07474047541618348, "num_tokens": 1665760.0, "step": 765 }, { "entropy": 7.830330228805542, "epoch": 0.0824014125956445, "grad_norm": 0.9609375, "learning_rate": 0.0003845, "loss": 7.6454, "mean_token_accuracy": 0.08570240736007691, "num_tokens": 1676211.0, "step": 770 }, { "entropy": 7.737586927413941, "epoch": 0.08293648670340842, "grad_norm": 1.0, "learning_rate": 0.00038700000000000003, "loss": 7.6666, "mean_token_accuracy": 0.0797475405037403, "num_tokens": 1686405.0, "step": 775 }, { "entropy": 7.75378794670105, "epoch": 0.08347156081117235, "grad_norm": 1.0546875, "learning_rate": 0.00038950000000000003, "loss": 7.6699, "mean_token_accuracy": 0.07950277514755726, "num_tokens": 1697340.0, "step": 780 }, { "entropy": 7.726286888122559, "epoch": 0.08400663491893627, "grad_norm": 1.046875, "learning_rate": 0.00039200000000000004, "loss": 7.5787, "mean_token_accuracy": 0.0861763522028923, "num_tokens": 1707250.0, "step": 785 }, { "entropy": 7.63549427986145, "epoch": 0.0845417090267002, "grad_norm": 1.0078125, "learning_rate": 0.00039450000000000005, "loss": 7.5653, "mean_token_accuracy": 0.0784637302160263, "num_tokens": 1718333.0, "step": 790 }, { "entropy": 7.709765481948852, "epoch": 0.08507678313446412, "grad_norm": 1.0625, "learning_rate": 0.00039700000000000005, "loss": 7.6627, "mean_token_accuracy": 0.07198781482875347, "num_tokens": 1730520.0, "step": 795 }, { "entropy": 7.7255151748657225, "epoch": 0.08561185724222804, "grad_norm": 1.0625, "learning_rate": 0.0003995, "loss": 7.7149, "mean_token_accuracy": 0.07679420076310635, "num_tokens": 1741898.0, "step": 800 }, { "entropy": 7.718593311309815, "epoch": 0.08614693134999198, "grad_norm": 1.09375, "learning_rate": 0.000402, "loss": 7.6508, "mean_token_accuracy": 0.08017718270421029, "num_tokens": 1751671.0, "step": 805 }, { "entropy": 7.577520227432251, "epoch": 0.0866820054577559, "grad_norm": 0.91015625, "learning_rate": 0.0004045, "loss": 7.6669, "mean_token_accuracy": 0.08265335634350776, "num_tokens": 1762076.0, "step": 810 }, { "entropy": 7.796188259124756, "epoch": 0.08721707956551983, "grad_norm": 0.98046875, "learning_rate": 0.00040699999999999997, "loss": 7.642, "mean_token_accuracy": 0.07752098590135574, "num_tokens": 1772666.0, "step": 815 }, { "entropy": 7.724516534805298, "epoch": 0.08775215367328375, "grad_norm": 0.94921875, "learning_rate": 0.0004095, "loss": 7.6572, "mean_token_accuracy": 0.08227546997368336, "num_tokens": 1783621.0, "step": 820 }, { "entropy": 7.700971364974976, "epoch": 0.08828722778104768, "grad_norm": 1.5234375, "learning_rate": 0.000412, "loss": 7.7147, "mean_token_accuracy": 0.07807004414498805, "num_tokens": 1794654.0, "step": 825 }, { "entropy": 7.651264762878418, "epoch": 0.0888223018888116, "grad_norm": 0.88671875, "learning_rate": 0.0004145, "loss": 7.6008, "mean_token_accuracy": 0.0848226711153984, "num_tokens": 1805853.0, "step": 830 }, { "entropy": 7.536796283721924, "epoch": 0.08935737599657552, "grad_norm": 0.9375, "learning_rate": 0.000417, "loss": 7.5896, "mean_token_accuracy": 0.0828265130519867, "num_tokens": 1817006.0, "step": 835 }, { "entropy": 7.733750724792481, "epoch": 0.08989245010433945, "grad_norm": 1.0, "learning_rate": 0.0004195, "loss": 7.583, "mean_token_accuracy": 0.07734453342854977, "num_tokens": 1827166.0, "step": 840 }, { "entropy": 7.7373639106750485, "epoch": 0.09042752421210337, "grad_norm": 1.140625, "learning_rate": 0.000422, "loss": 7.6809, "mean_token_accuracy": 0.07751412987709046, "num_tokens": 1837182.0, "step": 845 }, { "entropy": 7.567351484298706, "epoch": 0.0909625983198673, "grad_norm": 0.94140625, "learning_rate": 0.0004245, "loss": 7.6388, "mean_token_accuracy": 0.07895995602011681, "num_tokens": 1849034.0, "step": 850 }, { "entropy": 7.595164203643799, "epoch": 0.09149767242763122, "grad_norm": 0.98828125, "learning_rate": 0.000427, "loss": 7.5075, "mean_token_accuracy": 0.08833360373973846, "num_tokens": 1859033.0, "step": 855 }, { "entropy": 7.610419750213623, "epoch": 0.09203274653539516, "grad_norm": 0.9765625, "learning_rate": 0.0004295, "loss": 7.6121, "mean_token_accuracy": 0.08088177517056465, "num_tokens": 1870274.0, "step": 860 }, { "entropy": 7.5731220722198485, "epoch": 0.09256782064315908, "grad_norm": 1.265625, "learning_rate": 0.000432, "loss": 7.5611, "mean_token_accuracy": 0.08315053284168243, "num_tokens": 1881306.0, "step": 865 }, { "entropy": 7.561473751068116, "epoch": 0.093102894750923, "grad_norm": 1.0078125, "learning_rate": 0.0004345, "loss": 7.5356, "mean_token_accuracy": 0.08015808910131454, "num_tokens": 1892464.0, "step": 870 }, { "entropy": 7.661314296722412, "epoch": 0.09363796885868693, "grad_norm": 0.9609375, "learning_rate": 0.000437, "loss": 7.6219, "mean_token_accuracy": 0.07585933655500413, "num_tokens": 1903743.0, "step": 875 }, { "entropy": 7.607653522491455, "epoch": 0.09417304296645085, "grad_norm": 1.0, "learning_rate": 0.0004395, "loss": 7.5902, "mean_token_accuracy": 0.08468717783689499, "num_tokens": 1915253.0, "step": 880 }, { "entropy": 7.622669744491577, "epoch": 0.09470811707421478, "grad_norm": 1.2421875, "learning_rate": 0.000442, "loss": 7.5473, "mean_token_accuracy": 0.08187699615955353, "num_tokens": 1926113.0, "step": 885 }, { "entropy": 7.57468581199646, "epoch": 0.0952431911819787, "grad_norm": 0.98046875, "learning_rate": 0.0004445, "loss": 7.6456, "mean_token_accuracy": 0.08173620626330376, "num_tokens": 1937718.0, "step": 890 }, { "entropy": 7.625470066070557, "epoch": 0.09577826528974263, "grad_norm": 1.0234375, "learning_rate": 0.000447, "loss": 7.6334, "mean_token_accuracy": 0.0791581004858017, "num_tokens": 1948307.0, "step": 895 }, { "entropy": 7.575066232681275, "epoch": 0.09631333939750655, "grad_norm": 0.96484375, "learning_rate": 0.00044950000000000003, "loss": 7.4358, "mean_token_accuracy": 0.09009880647063255, "num_tokens": 1957861.0, "step": 900 }, { "entropy": 7.480437755584717, "epoch": 0.09684841350527049, "grad_norm": 0.92578125, "learning_rate": 0.00045200000000000004, "loss": 7.4911, "mean_token_accuracy": 0.08970233350992203, "num_tokens": 1967984.0, "step": 905 }, { "entropy": 7.55365891456604, "epoch": 0.0973834876130344, "grad_norm": 1.0, "learning_rate": 0.00045450000000000004, "loss": 7.4885, "mean_token_accuracy": 0.08413884043693542, "num_tokens": 1978608.0, "step": 910 }, { "entropy": 7.550483322143554, "epoch": 0.09791856172079832, "grad_norm": 0.98828125, "learning_rate": 0.00045700000000000005, "loss": 7.547, "mean_token_accuracy": 0.08248279690742492, "num_tokens": 1989355.0, "step": 915 }, { "entropy": 7.514042758941651, "epoch": 0.09845363582856226, "grad_norm": 0.96484375, "learning_rate": 0.00045950000000000006, "loss": 7.5303, "mean_token_accuracy": 0.08344742506742478, "num_tokens": 1999754.0, "step": 920 }, { "entropy": 7.540969705581665, "epoch": 0.09898870993632618, "grad_norm": 0.99609375, "learning_rate": 0.000462, "loss": 7.5232, "mean_token_accuracy": 0.0832397285848856, "num_tokens": 2010877.0, "step": 925 }, { "entropy": 7.635095930099487, "epoch": 0.09952378404409011, "grad_norm": 0.9140625, "learning_rate": 0.0004645, "loss": 7.6286, "mean_token_accuracy": 0.08003128916025162, "num_tokens": 2022301.0, "step": 930 }, { "entropy": 7.549521160125733, "epoch": 0.10005885815185403, "grad_norm": 0.99609375, "learning_rate": 0.000467, "loss": 7.5119, "mean_token_accuracy": 0.08251530304551125, "num_tokens": 2033537.0, "step": 935 }, { "entropy": 7.477602958679199, "epoch": 0.10059393225961796, "grad_norm": 1.0390625, "learning_rate": 0.0004695, "loss": 7.4502, "mean_token_accuracy": 0.0781034879386425, "num_tokens": 2044360.0, "step": 940 }, { "entropy": 7.583854675292969, "epoch": 0.10112900636738188, "grad_norm": 0.9296875, "learning_rate": 0.000472, "loss": 7.5601, "mean_token_accuracy": 0.08421726487576961, "num_tokens": 2055000.0, "step": 945 }, { "entropy": 7.492854499816895, "epoch": 0.1016640804751458, "grad_norm": 0.9609375, "learning_rate": 0.0004745, "loss": 7.5467, "mean_token_accuracy": 0.08681007251143455, "num_tokens": 2064807.0, "step": 950 }, { "entropy": 7.5536168098449705, "epoch": 0.10219915458290973, "grad_norm": 0.96484375, "learning_rate": 0.000477, "loss": 7.5102, "mean_token_accuracy": 0.08256960362195968, "num_tokens": 2075618.0, "step": 955 }, { "entropy": 7.505359792709351, "epoch": 0.10273422869067365, "grad_norm": 0.953125, "learning_rate": 0.0004795, "loss": 7.5116, "mean_token_accuracy": 0.08244576305150986, "num_tokens": 2086226.0, "step": 960 }, { "entropy": 7.541278457641601, "epoch": 0.10326930279843759, "grad_norm": 0.89453125, "learning_rate": 0.000482, "loss": 7.5116, "mean_token_accuracy": 0.08005514740943909, "num_tokens": 2097222.0, "step": 965 }, { "entropy": 7.481921100616455, "epoch": 0.1038043769062015, "grad_norm": 0.90625, "learning_rate": 0.0004845, "loss": 7.541, "mean_token_accuracy": 0.08661947920918464, "num_tokens": 2108919.0, "step": 970 }, { "entropy": 7.46715989112854, "epoch": 0.10433945101396544, "grad_norm": 0.96875, "learning_rate": 0.000487, "loss": 7.4939, "mean_token_accuracy": 0.08317564725875855, "num_tokens": 2120215.0, "step": 975 }, { "entropy": 7.5228071212768555, "epoch": 0.10487452512172936, "grad_norm": 1.015625, "learning_rate": 0.0004895, "loss": 7.5188, "mean_token_accuracy": 0.0818349651992321, "num_tokens": 2131503.0, "step": 980 }, { "entropy": 7.487857866287231, "epoch": 0.10540959922949328, "grad_norm": 0.96484375, "learning_rate": 0.000492, "loss": 7.4588, "mean_token_accuracy": 0.08936587274074555, "num_tokens": 2141551.0, "step": 985 }, { "entropy": 7.4559633255004885, "epoch": 0.10594467333725721, "grad_norm": 0.92578125, "learning_rate": 0.0004945, "loss": 7.4615, "mean_token_accuracy": 0.08929954171180725, "num_tokens": 2151821.0, "step": 990 }, { "entropy": 7.451591444015503, "epoch": 0.10647974744502113, "grad_norm": 1.03125, "learning_rate": 0.000497, "loss": 7.5065, "mean_token_accuracy": 0.08539062738418579, "num_tokens": 2162474.0, "step": 995 }, { "entropy": 7.53413724899292, "epoch": 0.10701482155278506, "grad_norm": 0.96875, "learning_rate": 0.0004995, "loss": 7.5602, "mean_token_accuracy": 0.08457510098814965, "num_tokens": 2173985.0, "step": 1000 }, { "entropy": 7.5422203063964846, "epoch": 0.10754989566054898, "grad_norm": 0.90625, "learning_rate": 0.0004999999979210101, "loss": 7.5944, "mean_token_accuracy": 0.07782966643571854, "num_tokens": 2186432.0, "step": 1005 }, { "entropy": 7.4759071350097654, "epoch": 0.10808496976831292, "grad_norm": 0.96484375, "learning_rate": 0.0004999999894751138, "loss": 7.4463, "mean_token_accuracy": 0.0834141232073307, "num_tokens": 2197085.0, "step": 1010 }, { "entropy": 7.424153137207031, "epoch": 0.10862004387607684, "grad_norm": 0.98828125, "learning_rate": 0.0004999999745323744, "loss": 7.4486, "mean_token_accuracy": 0.08975227214396, "num_tokens": 2207162.0, "step": 1015 }, { "entropy": 7.464861583709717, "epoch": 0.10915511798384077, "grad_norm": 0.9609375, "learning_rate": 0.0004999999530927923, "loss": 7.5469, "mean_token_accuracy": 0.07938519641757011, "num_tokens": 2218714.0, "step": 1020 }, { "entropy": 7.515410757064819, "epoch": 0.10969019209160469, "grad_norm": 0.96875, "learning_rate": 0.0004999999251563682, "loss": 7.4879, "mean_token_accuracy": 0.08599804565310479, "num_tokens": 2229711.0, "step": 1025 }, { "entropy": 7.45625114440918, "epoch": 0.11022526619936861, "grad_norm": 0.9140625, "learning_rate": 0.0004999998907231029, "loss": 7.4912, "mean_token_accuracy": 0.08116911202669144, "num_tokens": 2239885.0, "step": 1030 }, { "entropy": 7.481421899795532, "epoch": 0.11076034030713254, "grad_norm": 1.0, "learning_rate": 0.0004999998497929974, "loss": 7.4923, "mean_token_accuracy": 0.08827452957630158, "num_tokens": 2250221.0, "step": 1035 }, { "entropy": 7.4760716438293455, "epoch": 0.11129541441489646, "grad_norm": 0.91796875, "learning_rate": 0.0004999998023660527, "loss": 7.5526, "mean_token_accuracy": 0.07815601006150245, "num_tokens": 2261059.0, "step": 1040 }, { "entropy": 7.454020214080811, "epoch": 0.11183048852266039, "grad_norm": 0.8984375, "learning_rate": 0.0004999997484422705, "loss": 7.4273, "mean_token_accuracy": 0.08656688034534454, "num_tokens": 2271174.0, "step": 1045 }, { "entropy": 7.404057025909424, "epoch": 0.11236556263042431, "grad_norm": 1.0625, "learning_rate": 0.0004999996880216521, "loss": 7.5037, "mean_token_accuracy": 0.08764296993613244, "num_tokens": 2282431.0, "step": 1050 }, { "entropy": 7.506435585021973, "epoch": 0.11290063673818825, "grad_norm": 1.109375, "learning_rate": 0.0004999996211041994, "loss": 7.4922, "mean_token_accuracy": 0.08441931083798408, "num_tokens": 2292891.0, "step": 1055 }, { "entropy": 7.472446441650391, "epoch": 0.11343571084595216, "grad_norm": 0.97265625, "learning_rate": 0.0004999995476899141, "loss": 7.5049, "mean_token_accuracy": 0.08200813457369804, "num_tokens": 2303764.0, "step": 1060 }, { "entropy": 7.319696569442749, "epoch": 0.11397078495371608, "grad_norm": 1.0234375, "learning_rate": 0.0004999994677787987, "loss": 7.4002, "mean_token_accuracy": 0.09418007209897042, "num_tokens": 2314172.0, "step": 1065 }, { "entropy": 7.449784660339356, "epoch": 0.11450585906148002, "grad_norm": 1.046875, "learning_rate": 0.0004999993813708551, "loss": 7.3939, "mean_token_accuracy": 0.08950763419270516, "num_tokens": 2324848.0, "step": 1070 }, { "entropy": 7.320974636077881, "epoch": 0.11504093316924394, "grad_norm": 0.89453125, "learning_rate": 0.000499999288466086, "loss": 7.4332, "mean_token_accuracy": 0.08251803517341613, "num_tokens": 2336601.0, "step": 1075 }, { "entropy": 7.46982364654541, "epoch": 0.11557600727700787, "grad_norm": 0.95703125, "learning_rate": 0.0004999991890644941, "loss": 7.4167, "mean_token_accuracy": 0.0846226740628481, "num_tokens": 2347281.0, "step": 1080 }, { "entropy": 7.453939628601074, "epoch": 0.11611108138477179, "grad_norm": 1.0, "learning_rate": 0.0004999990831660822, "loss": 7.4224, "mean_token_accuracy": 0.0908889777958393, "num_tokens": 2358199.0, "step": 1085 }, { "entropy": 7.446761226654052, "epoch": 0.11664615549253572, "grad_norm": 1.0234375, "learning_rate": 0.0004999989707708534, "loss": 7.4877, "mean_token_accuracy": 0.08379835970699787, "num_tokens": 2369092.0, "step": 1090 }, { "entropy": 7.3978382587432865, "epoch": 0.11718122960029964, "grad_norm": 0.984375, "learning_rate": 0.0004999988518788111, "loss": 7.458, "mean_token_accuracy": 0.08341244608163834, "num_tokens": 2378849.0, "step": 1095 }, { "entropy": 7.428147649765014, "epoch": 0.11771630370806356, "grad_norm": 0.90234375, "learning_rate": 0.0004999987264899583, "loss": 7.4385, "mean_token_accuracy": 0.09159169495105743, "num_tokens": 2389587.0, "step": 1100 }, { "entropy": 7.492716360092163, "epoch": 0.1182513778158275, "grad_norm": 0.97265625, "learning_rate": 0.000499998594604299, "loss": 7.434, "mean_token_accuracy": 0.08649549037218093, "num_tokens": 2400442.0, "step": 1105 }, { "entropy": 7.284411334991455, "epoch": 0.11878645192359141, "grad_norm": 0.890625, "learning_rate": 0.000499998456221837, "loss": 7.4154, "mean_token_accuracy": 0.08677608072757721, "num_tokens": 2410771.0, "step": 1110 }, { "entropy": 7.476975584030152, "epoch": 0.11932152603135535, "grad_norm": 1.0, "learning_rate": 0.0004999983113425762, "loss": 7.4299, "mean_token_accuracy": 0.09064068272709846, "num_tokens": 2421112.0, "step": 1115 }, { "entropy": 7.400354480743408, "epoch": 0.11985660013911927, "grad_norm": 0.91796875, "learning_rate": 0.0004999981599665207, "loss": 7.4163, "mean_token_accuracy": 0.08564619868993759, "num_tokens": 2431891.0, "step": 1120 }, { "entropy": 7.315796279907227, "epoch": 0.1203916742468832, "grad_norm": 1.0078125, "learning_rate": 0.0004999980020936748, "loss": 7.3479, "mean_token_accuracy": 0.08722568973898888, "num_tokens": 2442987.0, "step": 1125 }, { "entropy": 7.354978418350219, "epoch": 0.12092674835464712, "grad_norm": 1.09375, "learning_rate": 0.0004999978377240434, "loss": 7.4002, "mean_token_accuracy": 0.08564592450857163, "num_tokens": 2452703.0, "step": 1130 }, { "entropy": 7.375062036514282, "epoch": 0.12146182246241104, "grad_norm": 0.984375, "learning_rate": 0.000499997666857631, "loss": 7.4598, "mean_token_accuracy": 0.08786297589540482, "num_tokens": 2462975.0, "step": 1135 }, { "entropy": 7.394401025772095, "epoch": 0.12199689657017497, "grad_norm": 0.8359375, "learning_rate": 0.0004999974894944426, "loss": 7.4003, "mean_token_accuracy": 0.08598766103386879, "num_tokens": 2473853.0, "step": 1140 }, { "entropy": 7.384897661209107, "epoch": 0.12253197067793889, "grad_norm": 0.90625, "learning_rate": 0.0004999973056344832, "loss": 7.3822, "mean_token_accuracy": 0.08470982015132904, "num_tokens": 2485633.0, "step": 1145 }, { "entropy": 7.337519359588623, "epoch": 0.12306704478570282, "grad_norm": 0.91796875, "learning_rate": 0.0004999971152777583, "loss": 7.3414, "mean_token_accuracy": 0.08668373227119446, "num_tokens": 2496922.0, "step": 1150 }, { "entropy": 7.443722057342529, "epoch": 0.12360211889346674, "grad_norm": 0.87109375, "learning_rate": 0.0004999969184242733, "loss": 7.4147, "mean_token_accuracy": 0.0896741084754467, "num_tokens": 2507890.0, "step": 1155 }, { "entropy": 7.319026279449463, "epoch": 0.12413719300123068, "grad_norm": 1.0390625, "learning_rate": 0.000499996715074034, "loss": 7.4076, "mean_token_accuracy": 0.09130077436566353, "num_tokens": 2519749.0, "step": 1160 }, { "entropy": 7.3418297290802, "epoch": 0.1246722671089946, "grad_norm": 0.97265625, "learning_rate": 0.0004999965052270461, "loss": 7.4121, "mean_token_accuracy": 0.09187431186437607, "num_tokens": 2530666.0, "step": 1165 }, { "entropy": 7.364394998550415, "epoch": 0.12520734121675853, "grad_norm": 0.89453125, "learning_rate": 0.0004999962888833157, "loss": 7.4155, "mean_token_accuracy": 0.08915347754955291, "num_tokens": 2541594.0, "step": 1170 }, { "entropy": 7.363469171524048, "epoch": 0.12574241532452243, "grad_norm": 0.9453125, "learning_rate": 0.0004999960660428491, "loss": 7.3946, "mean_token_accuracy": 0.0930194191634655, "num_tokens": 2552330.0, "step": 1175 }, { "entropy": 7.449467992782592, "epoch": 0.12627748943228637, "grad_norm": 0.87109375, "learning_rate": 0.0004999958367056526, "loss": 7.4494, "mean_token_accuracy": 0.08116971924901009, "num_tokens": 2564601.0, "step": 1180 }, { "entropy": 7.422946262359619, "epoch": 0.1268125635400503, "grad_norm": 0.9921875, "learning_rate": 0.000499995600871733, "loss": 7.4242, "mean_token_accuracy": 0.08717223256826401, "num_tokens": 2575539.0, "step": 1185 }, { "entropy": 7.284857511520386, "epoch": 0.12734763764781423, "grad_norm": 0.89453125, "learning_rate": 0.0004999953585410971, "loss": 7.3588, "mean_token_accuracy": 0.08616523109376431, "num_tokens": 2586635.0, "step": 1190 }, { "entropy": 7.405594778060913, "epoch": 0.12788271175557814, "grad_norm": 1.1171875, "learning_rate": 0.0004999951097137518, "loss": 7.388, "mean_token_accuracy": 0.08991223797202111, "num_tokens": 2596814.0, "step": 1195 }, { "entropy": 7.325789880752564, "epoch": 0.12841778586334207, "grad_norm": 0.86328125, "learning_rate": 0.0004999948543897044, "loss": 7.4089, "mean_token_accuracy": 0.08616380542516708, "num_tokens": 2608087.0, "step": 1200 }, { "entropy": 7.498183393478394, "epoch": 0.128952859971106, "grad_norm": 0.9609375, "learning_rate": 0.0004999945925689621, "loss": 7.41, "mean_token_accuracy": 0.08784973174333573, "num_tokens": 2619377.0, "step": 1205 }, { "entropy": 7.285972166061401, "epoch": 0.12948793407886994, "grad_norm": 1.0234375, "learning_rate": 0.0004999943242515325, "loss": 7.314, "mean_token_accuracy": 0.08880106881260871, "num_tokens": 2629089.0, "step": 1210 }, { "entropy": 7.320152521133423, "epoch": 0.13002300818663384, "grad_norm": 0.8828125, "learning_rate": 0.0004999940494374236, "loss": 7.3835, "mean_token_accuracy": 0.08867338374257087, "num_tokens": 2639743.0, "step": 1215 }, { "entropy": 7.45218596458435, "epoch": 0.13055808229439778, "grad_norm": 1.015625, "learning_rate": 0.000499993768126643, "loss": 7.4254, "mean_token_accuracy": 0.082533248513937, "num_tokens": 2650631.0, "step": 1220 }, { "entropy": 7.268480491638184, "epoch": 0.1310931564021617, "grad_norm": 0.96484375, "learning_rate": 0.000499993480319199, "loss": 7.3811, "mean_token_accuracy": 0.0892926201224327, "num_tokens": 2660197.0, "step": 1225 }, { "entropy": 7.394870710372925, "epoch": 0.13162823050992561, "grad_norm": 0.98828125, "learning_rate": 0.0004999931860150999, "loss": 7.3556, "mean_token_accuracy": 0.08826216235756874, "num_tokens": 2670162.0, "step": 1230 }, { "entropy": 7.390807247161865, "epoch": 0.13216330461768955, "grad_norm": 0.90234375, "learning_rate": 0.0004999928852143541, "loss": 7.3554, "mean_token_accuracy": 0.08857011944055557, "num_tokens": 2681233.0, "step": 1235 }, { "entropy": 7.200170421600342, "epoch": 0.13269837872545348, "grad_norm": 0.87109375, "learning_rate": 0.0004999925779169703, "loss": 7.3187, "mean_token_accuracy": 0.09283828288316727, "num_tokens": 2692145.0, "step": 1240 }, { "entropy": 7.413662004470825, "epoch": 0.13323345283321741, "grad_norm": 0.91015625, "learning_rate": 0.0004999922641229575, "loss": 7.3447, "mean_token_accuracy": 0.09158495515584945, "num_tokens": 2703192.0, "step": 1245 }, { "entropy": 7.324686527252197, "epoch": 0.13376852694098132, "grad_norm": 0.87890625, "learning_rate": 0.0004999919438323248, "loss": 7.3597, "mean_token_accuracy": 0.08890319019556045, "num_tokens": 2714804.0, "step": 1250 }, { "entropy": 7.333380794525146, "epoch": 0.13430360104874525, "grad_norm": 1.046875, "learning_rate": 0.0004999916170450812, "loss": 7.3259, "mean_token_accuracy": 0.09193522408604622, "num_tokens": 2724340.0, "step": 1255 }, { "entropy": 7.259483861923218, "epoch": 0.13483867515650919, "grad_norm": 0.91796875, "learning_rate": 0.0004999912837612364, "loss": 7.3341, "mean_token_accuracy": 0.09227988123893738, "num_tokens": 2735767.0, "step": 1260 }, { "entropy": 7.455391693115234, "epoch": 0.1353737492642731, "grad_norm": 0.91796875, "learning_rate": 0.0004999909439807997, "loss": 7.3851, "mean_token_accuracy": 0.08482631966471672, "num_tokens": 2747658.0, "step": 1265 }, { "entropy": 7.264850521087647, "epoch": 0.13590882337203702, "grad_norm": 1.015625, "learning_rate": 0.0004999905977037813, "loss": 7.2465, "mean_token_accuracy": 0.09336961582303047, "num_tokens": 2757901.0, "step": 1270 }, { "entropy": 7.284139823913574, "epoch": 0.13644389747980096, "grad_norm": 1.015625, "learning_rate": 0.0004999902449301909, "loss": 7.2989, "mean_token_accuracy": 0.0874991238117218, "num_tokens": 2768945.0, "step": 1275 }, { "entropy": 7.24199595451355, "epoch": 0.1369789715875649, "grad_norm": 0.80859375, "learning_rate": 0.0004999898856600387, "loss": 7.271, "mean_token_accuracy": 0.103138717263937, "num_tokens": 2780276.0, "step": 1280 }, { "entropy": 7.350469398498535, "epoch": 0.1375140456953288, "grad_norm": 0.9140625, "learning_rate": 0.0004999895198933354, "loss": 7.3416, "mean_token_accuracy": 0.09537098631262779, "num_tokens": 2791183.0, "step": 1285 }, { "entropy": 7.342680644989014, "epoch": 0.13804911980309273, "grad_norm": 0.94140625, "learning_rate": 0.0004999891476300911, "loss": 7.2607, "mean_token_accuracy": 0.08925738111138344, "num_tokens": 2801928.0, "step": 1290 }, { "entropy": 7.263091659545898, "epoch": 0.13858419391085666, "grad_norm": 0.890625, "learning_rate": 0.000499988768870317, "loss": 7.3525, "mean_token_accuracy": 0.08583549410104752, "num_tokens": 2813415.0, "step": 1295 }, { "entropy": 7.329908657073974, "epoch": 0.13911926801862057, "grad_norm": 0.98046875, "learning_rate": 0.0004999883836140236, "loss": 7.3533, "mean_token_accuracy": 0.08882890194654465, "num_tokens": 2825288.0, "step": 1300 }, { "entropy": 7.312420797348023, "epoch": 0.1396543421263845, "grad_norm": 0.96484375, "learning_rate": 0.0004999879918612224, "loss": 7.3068, "mean_token_accuracy": 0.09304987639188766, "num_tokens": 2836298.0, "step": 1305 }, { "entropy": 7.313601350784301, "epoch": 0.14018941623414843, "grad_norm": 1.03125, "learning_rate": 0.0004999875936119245, "loss": 7.2898, "mean_token_accuracy": 0.0945392332971096, "num_tokens": 2846367.0, "step": 1310 }, { "entropy": 7.240101766586304, "epoch": 0.14072449034191237, "grad_norm": 0.9921875, "learning_rate": 0.0004999871888661415, "loss": 7.3047, "mean_token_accuracy": 0.08923600688576698, "num_tokens": 2856832.0, "step": 1315 }, { "entropy": 7.309039974212647, "epoch": 0.14125956444967627, "grad_norm": 0.9140625, "learning_rate": 0.000499986777623885, "loss": 7.3245, "mean_token_accuracy": 0.08692366257309914, "num_tokens": 2867954.0, "step": 1320 }, { "entropy": 7.439533376693726, "epoch": 0.1417946385574402, "grad_norm": 0.9921875, "learning_rate": 0.0004999863598851669, "loss": 7.3611, "mean_token_accuracy": 0.09297569468617439, "num_tokens": 2878714.0, "step": 1325 }, { "entropy": 7.053972816467285, "epoch": 0.14232971266520414, "grad_norm": 1.3359375, "learning_rate": 0.0004999859356499992, "loss": 7.298, "mean_token_accuracy": 0.10052636489272118, "num_tokens": 2890697.0, "step": 1330 }, { "entropy": 7.382122421264649, "epoch": 0.14286478677296804, "grad_norm": 1.0078125, "learning_rate": 0.0004999855049183943, "loss": 7.3219, "mean_token_accuracy": 0.08626203685998916, "num_tokens": 2901468.0, "step": 1335 }, { "entropy": 7.25765290260315, "epoch": 0.14339986088073198, "grad_norm": 0.94140625, "learning_rate": 0.0004999850676903646, "loss": 7.2671, "mean_token_accuracy": 0.09408968985080719, "num_tokens": 2913466.0, "step": 1340 }, { "entropy": 7.231286239624024, "epoch": 0.1439349349884959, "grad_norm": 0.8984375, "learning_rate": 0.0004999846239659226, "loss": 7.2505, "mean_token_accuracy": 0.09706522151827812, "num_tokens": 2923638.0, "step": 1345 }, { "entropy": 7.269954109191895, "epoch": 0.14447000909625984, "grad_norm": 1.015625, "learning_rate": 0.0004999841737450812, "loss": 7.3357, "mean_token_accuracy": 0.09442631006240845, "num_tokens": 2934790.0, "step": 1350 }, { "entropy": 7.268723440170288, "epoch": 0.14500508320402375, "grad_norm": 1.0234375, "learning_rate": 0.0004999837170278535, "loss": 7.2757, "mean_token_accuracy": 0.08723422512412071, "num_tokens": 2946320.0, "step": 1355 }, { "entropy": 7.3566694259643555, "epoch": 0.14554015731178768, "grad_norm": 1.0546875, "learning_rate": 0.0004999832538142526, "loss": 7.2369, "mean_token_accuracy": 0.09091865047812461, "num_tokens": 2957077.0, "step": 1360 }, { "entropy": 7.177463865280151, "epoch": 0.14607523141955162, "grad_norm": 0.953125, "learning_rate": 0.0004999827841042917, "loss": 7.2678, "mean_token_accuracy": 0.08816000148653984, "num_tokens": 2967286.0, "step": 1365 }, { "entropy": 7.2939177513122555, "epoch": 0.14661030552731552, "grad_norm": 1.34375, "learning_rate": 0.0004999823078979846, "loss": 7.3057, "mean_token_accuracy": 0.09016561508178711, "num_tokens": 2979516.0, "step": 1370 }, { "entropy": 7.379639339447022, "epoch": 0.14714537963507945, "grad_norm": 0.96484375, "learning_rate": 0.0004999818251953449, "loss": 7.419, "mean_token_accuracy": 0.08294185698032379, "num_tokens": 2991594.0, "step": 1375 }, { "entropy": 7.246149206161499, "epoch": 0.1476804537428434, "grad_norm": 1.0234375, "learning_rate": 0.0004999813359963867, "loss": 7.2972, "mean_token_accuracy": 0.08775367885828018, "num_tokens": 3002487.0, "step": 1380 }, { "entropy": 7.372300243377685, "epoch": 0.14821552785060732, "grad_norm": 0.98828125, "learning_rate": 0.0004999808403011241, "loss": 7.3157, "mean_token_accuracy": 0.09396110102534294, "num_tokens": 3013197.0, "step": 1385 }, { "entropy": 7.142706060409546, "epoch": 0.14875060195837123, "grad_norm": 0.8984375, "learning_rate": 0.0004999803381095712, "loss": 7.3451, "mean_token_accuracy": 0.09063652530312538, "num_tokens": 3024512.0, "step": 1390 }, { "entropy": 7.415092658996582, "epoch": 0.14928567606613516, "grad_norm": 0.9296875, "learning_rate": 0.0004999798294217428, "loss": 7.3046, "mean_token_accuracy": 0.08789012357592582, "num_tokens": 3035621.0, "step": 1395 }, { "entropy": 7.229216432571411, "epoch": 0.1498207501738991, "grad_norm": 0.97265625, "learning_rate": 0.0004999793142376533, "loss": 7.2876, "mean_token_accuracy": 0.09253833740949631, "num_tokens": 3046492.0, "step": 1400 }, { "entropy": 7.263148021697998, "epoch": 0.150355824281663, "grad_norm": 0.90625, "learning_rate": 0.0004999787925573177, "loss": 7.3086, "mean_token_accuracy": 0.09204896241426468, "num_tokens": 3057715.0, "step": 1405 }, { "entropy": 7.3932922840118405, "epoch": 0.15089089838942693, "grad_norm": 0.9140625, "learning_rate": 0.0004999782643807513, "loss": 7.2654, "mean_token_accuracy": 0.09031828343868256, "num_tokens": 3068344.0, "step": 1410 }, { "entropy": 7.193799686431885, "epoch": 0.15142597249719086, "grad_norm": 0.8671875, "learning_rate": 0.0004999777297079689, "loss": 7.2547, "mean_token_accuracy": 0.09031877219676972, "num_tokens": 3079576.0, "step": 1415 }, { "entropy": 7.342895412445069, "epoch": 0.1519610466049548, "grad_norm": 0.98046875, "learning_rate": 0.0004999771885389863, "loss": 7.2153, "mean_token_accuracy": 0.09486196860671044, "num_tokens": 3090201.0, "step": 1420 }, { "entropy": 7.1453712463378904, "epoch": 0.1524961207127187, "grad_norm": 1.03125, "learning_rate": 0.0004999766408738189, "loss": 7.1936, "mean_token_accuracy": 0.10047192424535752, "num_tokens": 3099824.0, "step": 1425 }, { "entropy": 7.24136872291565, "epoch": 0.15303119482048264, "grad_norm": 0.90625, "learning_rate": 0.0004999760867124827, "loss": 7.2738, "mean_token_accuracy": 0.09082015976309776, "num_tokens": 3109948.0, "step": 1430 }, { "entropy": 7.299263906478882, "epoch": 0.15356626892824657, "grad_norm": 0.8984375, "learning_rate": 0.0004999755260549937, "loss": 7.2626, "mean_token_accuracy": 0.0974075585603714, "num_tokens": 3121492.0, "step": 1435 }, { "entropy": 7.21744818687439, "epoch": 0.15410134303601047, "grad_norm": 1.671875, "learning_rate": 0.0004999749589013677, "loss": 7.0545, "mean_token_accuracy": 0.10996845588088036, "num_tokens": 3131990.0, "step": 1440 }, { "entropy": 7.1235129833221436, "epoch": 0.1546364171437744, "grad_norm": 0.8828125, "learning_rate": 0.0004999743852516217, "loss": 7.2409, "mean_token_accuracy": 0.0921150028705597, "num_tokens": 3142567.0, "step": 1445 }, { "entropy": 7.32010293006897, "epoch": 0.15517149125153834, "grad_norm": 1.328125, "learning_rate": 0.0004999738051057717, "loss": 7.2522, "mean_token_accuracy": 0.09435679912567138, "num_tokens": 3153083.0, "step": 1450 }, { "entropy": 7.188344669342041, "epoch": 0.15570656535930227, "grad_norm": 0.984375, "learning_rate": 0.0004999732184638347, "loss": 7.2555, "mean_token_accuracy": 0.09004457890987397, "num_tokens": 3163985.0, "step": 1455 }, { "entropy": 7.262719058990479, "epoch": 0.15624163946706618, "grad_norm": 0.92578125, "learning_rate": 0.0004999726253258278, "loss": 7.2392, "mean_token_accuracy": 0.09183276668190957, "num_tokens": 3175259.0, "step": 1460 }, { "entropy": 7.254732751846314, "epoch": 0.1567767135748301, "grad_norm": 0.99609375, "learning_rate": 0.0004999720256917678, "loss": 7.206, "mean_token_accuracy": 0.0977108657360077, "num_tokens": 3185487.0, "step": 1465 }, { "entropy": 7.127510118484497, "epoch": 0.15731178768259405, "grad_norm": 0.94921875, "learning_rate": 0.0004999714195616723, "loss": 7.1831, "mean_token_accuracy": 0.09826227650046349, "num_tokens": 3196200.0, "step": 1470 }, { "entropy": 7.333015441894531, "epoch": 0.15784686179035795, "grad_norm": 0.96875, "learning_rate": 0.0004999708069355586, "loss": 7.3054, "mean_token_accuracy": 0.0843054249882698, "num_tokens": 3207675.0, "step": 1475 }, { "entropy": 7.17571177482605, "epoch": 0.15838193589812188, "grad_norm": 1.078125, "learning_rate": 0.0004999701878134445, "loss": 7.1815, "mean_token_accuracy": 0.09501941055059433, "num_tokens": 3218117.0, "step": 1480 }, { "entropy": 7.304254627227783, "epoch": 0.15891701000588582, "grad_norm": 0.94140625, "learning_rate": 0.0004999695621953477, "loss": 7.2505, "mean_token_accuracy": 0.10208047479391098, "num_tokens": 3229208.0, "step": 1485 }, { "entropy": 7.173984098434448, "epoch": 0.15945208411364975, "grad_norm": 0.96875, "learning_rate": 0.0004999689300812866, "loss": 7.1584, "mean_token_accuracy": 0.101242895424366, "num_tokens": 3239586.0, "step": 1490 }, { "entropy": 7.24401364326477, "epoch": 0.15998715822141366, "grad_norm": 0.8515625, "learning_rate": 0.0004999682914712791, "loss": 7.2254, "mean_token_accuracy": 0.09680869728326798, "num_tokens": 3250103.0, "step": 1495 }, { "entropy": 7.228427124023438, "epoch": 0.1605222323291776, "grad_norm": 0.91015625, "learning_rate": 0.0004999676463653439, "loss": 7.2027, "mean_token_accuracy": 0.10232653468847275, "num_tokens": 3261844.0, "step": 1500 }, { "entropy": 7.227877807617188, "epoch": 0.16105730643694152, "grad_norm": 1.09375, "learning_rate": 0.0004999669947634996, "loss": 7.1639, "mean_token_accuracy": 0.09760255515575408, "num_tokens": 3272073.0, "step": 1505 }, { "entropy": 7.178577184677124, "epoch": 0.16159238054470546, "grad_norm": 0.9609375, "learning_rate": 0.0004999663366657647, "loss": 7.1667, "mean_token_accuracy": 0.09620498046278954, "num_tokens": 3281725.0, "step": 1510 }, { "entropy": 7.214940547943115, "epoch": 0.16212745465246936, "grad_norm": 0.97265625, "learning_rate": 0.0004999656720721586, "loss": 7.3059, "mean_token_accuracy": 0.094396660476923, "num_tokens": 3292708.0, "step": 1515 }, { "entropy": 7.296448183059693, "epoch": 0.1626625287602333, "grad_norm": 0.98828125, "learning_rate": 0.0004999650009827004, "loss": 7.2773, "mean_token_accuracy": 0.09127842709422111, "num_tokens": 3303548.0, "step": 1520 }, { "entropy": 7.19203143119812, "epoch": 0.16319760286799723, "grad_norm": 0.921875, "learning_rate": 0.0004999643233974092, "loss": 7.1486, "mean_token_accuracy": 0.09975013583898544, "num_tokens": 3314261.0, "step": 1525 }, { "entropy": 7.1947274684906, "epoch": 0.16373267697576113, "grad_norm": 0.98046875, "learning_rate": 0.0004999636393163049, "loss": 7.1714, "mean_token_accuracy": 0.09445247575640678, "num_tokens": 3324833.0, "step": 1530 }, { "entropy": 7.053837537765503, "epoch": 0.16426775108352507, "grad_norm": 1.0703125, "learning_rate": 0.0004999629487394071, "loss": 7.0568, "mean_token_accuracy": 0.10237468853592872, "num_tokens": 3334790.0, "step": 1535 }, { "entropy": 7.266930866241455, "epoch": 0.164802825191289, "grad_norm": 1.1484375, "learning_rate": 0.0004999622516667358, "loss": 7.205, "mean_token_accuracy": 0.09691800698637962, "num_tokens": 3345115.0, "step": 1540 }, { "entropy": 7.133483982086181, "epoch": 0.16533789929905293, "grad_norm": 0.875, "learning_rate": 0.000499961548098311, "loss": 7.089, "mean_token_accuracy": 0.10441275909543038, "num_tokens": 3356187.0, "step": 1545 }, { "entropy": 7.117019701004028, "epoch": 0.16587297340681684, "grad_norm": 0.94921875, "learning_rate": 0.0004999608380341533, "loss": 7.1282, "mean_token_accuracy": 0.09887576475739479, "num_tokens": 3367218.0, "step": 1550 }, { "entropy": 7.160897636413575, "epoch": 0.16640804751458077, "grad_norm": 0.98046875, "learning_rate": 0.0004999601214742829, "loss": 7.27, "mean_token_accuracy": 0.08936030119657516, "num_tokens": 3377557.0, "step": 1555 }, { "entropy": 7.371627759933472, "epoch": 0.1669431216223447, "grad_norm": 0.96484375, "learning_rate": 0.0004999593984187206, "loss": 7.2482, "mean_token_accuracy": 0.09751093834638595, "num_tokens": 3387402.0, "step": 1560 }, { "entropy": 7.0916835308074955, "epoch": 0.1674781957301086, "grad_norm": 0.87890625, "learning_rate": 0.0004999586688674872, "loss": 7.1346, "mean_token_accuracy": 0.09648581743240356, "num_tokens": 3397924.0, "step": 1565 }, { "entropy": 7.216659879684448, "epoch": 0.16801326983787254, "grad_norm": 0.94921875, "learning_rate": 0.000499957932820604, "loss": 7.2118, "mean_token_accuracy": 0.08759412840008736, "num_tokens": 3408622.0, "step": 1570 }, { "entropy": 7.262946891784668, "epoch": 0.16854834394563648, "grad_norm": 0.98046875, "learning_rate": 0.000499957190278092, "loss": 7.1622, "mean_token_accuracy": 0.09248490408062934, "num_tokens": 3419692.0, "step": 1575 }, { "entropy": 7.098281383514404, "epoch": 0.1690834180534004, "grad_norm": 1.015625, "learning_rate": 0.0004999564412399728, "loss": 7.2154, "mean_token_accuracy": 0.09459864124655723, "num_tokens": 3430986.0, "step": 1580 }, { "entropy": 7.176830434799195, "epoch": 0.1696184921611643, "grad_norm": 1.0390625, "learning_rate": 0.000499955685706268, "loss": 7.1354, "mean_token_accuracy": 0.09504674524068832, "num_tokens": 3442211.0, "step": 1585 }, { "entropy": 7.03007402420044, "epoch": 0.17015356626892825, "grad_norm": 1.140625, "learning_rate": 0.0004999549236769993, "loss": 7.1229, "mean_token_accuracy": 0.10297105386853218, "num_tokens": 3453585.0, "step": 1590 }, { "entropy": 7.225273466110229, "epoch": 0.17068864037669218, "grad_norm": 1.0078125, "learning_rate": 0.0004999541551521888, "loss": 7.1695, "mean_token_accuracy": 0.0996770367026329, "num_tokens": 3464156.0, "step": 1595 }, { "entropy": 7.249066162109375, "epoch": 0.17122371448445609, "grad_norm": 1.0703125, "learning_rate": 0.0004999533801318587, "loss": 7.2238, "mean_token_accuracy": 0.08952004536986351, "num_tokens": 3474853.0, "step": 1600 }, { "entropy": 7.262774181365967, "epoch": 0.17175878859222002, "grad_norm": 1.03125, "learning_rate": 0.0004999525986160313, "loss": 7.194, "mean_token_accuracy": 0.10073793306946754, "num_tokens": 3486841.0, "step": 1605 }, { "entropy": 7.140778827667236, "epoch": 0.17229386269998395, "grad_norm": 0.9140625, "learning_rate": 0.0004999518106047293, "loss": 7.2169, "mean_token_accuracy": 0.09210691601037979, "num_tokens": 3498735.0, "step": 1610 }, { "entropy": 7.175544404983521, "epoch": 0.17282893680774788, "grad_norm": 0.87890625, "learning_rate": 0.0004999510160979754, "loss": 7.2352, "mean_token_accuracy": 0.10104434639215469, "num_tokens": 3508829.0, "step": 1615 }, { "entropy": 7.1884317874908445, "epoch": 0.1733640109155118, "grad_norm": 0.94921875, "learning_rate": 0.0004999502150957925, "loss": 7.141, "mean_token_accuracy": 0.09438429847359657, "num_tokens": 3519465.0, "step": 1620 }, { "entropy": 7.188577127456665, "epoch": 0.17389908502327572, "grad_norm": 0.93359375, "learning_rate": 0.0004999494075982037, "loss": 7.1086, "mean_token_accuracy": 0.10255491808056831, "num_tokens": 3530401.0, "step": 1625 }, { "entropy": 7.12376561164856, "epoch": 0.17443415913103966, "grad_norm": 0.98828125, "learning_rate": 0.0004999485936052324, "loss": 7.1856, "mean_token_accuracy": 0.09849482700228691, "num_tokens": 3541136.0, "step": 1630 }, { "entropy": 7.288824605941772, "epoch": 0.17496923323880356, "grad_norm": 0.95703125, "learning_rate": 0.000499947773116902, "loss": 7.1753, "mean_token_accuracy": 0.09568259268999099, "num_tokens": 3552525.0, "step": 1635 }, { "entropy": 7.090163278579712, "epoch": 0.1755043073465675, "grad_norm": 0.9140625, "learning_rate": 0.0004999469461332365, "loss": 7.1414, "mean_token_accuracy": 0.09975111782550812, "num_tokens": 3563028.0, "step": 1640 }, { "entropy": 7.199271249771118, "epoch": 0.17603938145433143, "grad_norm": 0.9453125, "learning_rate": 0.0004999461126542592, "loss": 7.0912, "mean_token_accuracy": 0.10047454982995987, "num_tokens": 3573354.0, "step": 1645 }, { "entropy": 6.979637813568115, "epoch": 0.17657445556209536, "grad_norm": 0.83984375, "learning_rate": 0.0004999452726799947, "loss": 7.0802, "mean_token_accuracy": 0.09618928134441376, "num_tokens": 3585576.0, "step": 1650 }, { "entropy": 7.297661590576172, "epoch": 0.17710952966985927, "grad_norm": 0.98828125, "learning_rate": 0.0004999444262104671, "loss": 7.2058, "mean_token_accuracy": 0.08774002119898797, "num_tokens": 3596478.0, "step": 1655 }, { "entropy": 7.110372161865234, "epoch": 0.1776446037776232, "grad_norm": 1.0390625, "learning_rate": 0.0004999435732457007, "loss": 7.153, "mean_token_accuracy": 0.09257297441363335, "num_tokens": 3608014.0, "step": 1660 }, { "entropy": 7.221296691894532, "epoch": 0.17817967788538713, "grad_norm": 0.9921875, "learning_rate": 0.0004999427137857203, "loss": 7.2102, "mean_token_accuracy": 0.09210594072937965, "num_tokens": 3620120.0, "step": 1665 }, { "entropy": 7.107110977172852, "epoch": 0.17871475199315104, "grad_norm": 0.953125, "learning_rate": 0.0004999418478305506, "loss": 7.1096, "mean_token_accuracy": 0.09546202942728996, "num_tokens": 3632578.0, "step": 1670 }, { "entropy": 7.156751394271851, "epoch": 0.17924982610091497, "grad_norm": 0.984375, "learning_rate": 0.0004999409753802167, "loss": 7.131, "mean_token_accuracy": 0.10362366437911988, "num_tokens": 3643245.0, "step": 1675 }, { "entropy": 7.167398452758789, "epoch": 0.1797849002086789, "grad_norm": 0.91015625, "learning_rate": 0.0004999400964347437, "loss": 7.1251, "mean_token_accuracy": 0.09799086153507233, "num_tokens": 3655832.0, "step": 1680 }, { "entropy": 7.151060581207275, "epoch": 0.18031997431644284, "grad_norm": 0.93359375, "learning_rate": 0.0004999392109941571, "loss": 7.1001, "mean_token_accuracy": 0.09830698594450951, "num_tokens": 3666566.0, "step": 1685 }, { "entropy": 7.172510385513306, "epoch": 0.18085504842420674, "grad_norm": 0.91796875, "learning_rate": 0.0004999383190584822, "loss": 7.1298, "mean_token_accuracy": 0.10040193051099777, "num_tokens": 3677572.0, "step": 1690 }, { "entropy": 7.112444877624512, "epoch": 0.18139012253197068, "grad_norm": 0.99609375, "learning_rate": 0.0004999374206277451, "loss": 7.0549, "mean_token_accuracy": 0.09736391827464104, "num_tokens": 3687116.0, "step": 1695 }, { "entropy": 7.057082557678223, "epoch": 0.1819251966397346, "grad_norm": 0.9140625, "learning_rate": 0.0004999365157019717, "loss": 7.1658, "mean_token_accuracy": 0.09722192957997322, "num_tokens": 3697961.0, "step": 1700 }, { "entropy": 7.233665180206299, "epoch": 0.18246027074749852, "grad_norm": 0.9765625, "learning_rate": 0.0004999356042811878, "loss": 7.0802, "mean_token_accuracy": 0.10210576206445694, "num_tokens": 3708834.0, "step": 1705 }, { "entropy": 7.087706089019775, "epoch": 0.18299534485526245, "grad_norm": 0.93359375, "learning_rate": 0.00049993468636542, "loss": 7.1472, "mean_token_accuracy": 0.09556594043970108, "num_tokens": 3719835.0, "step": 1710 }, { "entropy": 7.116140556335449, "epoch": 0.18353041896302638, "grad_norm": 1.03125, "learning_rate": 0.0004999337619546948, "loss": 7.0339, "mean_token_accuracy": 0.10466360598802567, "num_tokens": 3730408.0, "step": 1715 }, { "entropy": 7.085261631011963, "epoch": 0.18406549307079031, "grad_norm": 0.91015625, "learning_rate": 0.0004999328310490387, "loss": 7.1275, "mean_token_accuracy": 0.09871943295001984, "num_tokens": 3741257.0, "step": 1720 }, { "entropy": 7.190493202209472, "epoch": 0.18460056717855422, "grad_norm": 0.96875, "learning_rate": 0.0004999318936484789, "loss": 7.1175, "mean_token_accuracy": 0.10177163109183311, "num_tokens": 3752615.0, "step": 1725 }, { "entropy": 7.106344223022461, "epoch": 0.18513564128631815, "grad_norm": 0.93359375, "learning_rate": 0.0004999309497530422, "loss": 7.1395, "mean_token_accuracy": 0.09094236344099045, "num_tokens": 3763656.0, "step": 1730 }, { "entropy": 7.083023738861084, "epoch": 0.1856707153940821, "grad_norm": 0.91015625, "learning_rate": 0.0004999299993627558, "loss": 7.1148, "mean_token_accuracy": 0.10153383314609528, "num_tokens": 3775257.0, "step": 1735 }, { "entropy": 7.0514672756195065, "epoch": 0.186205789501846, "grad_norm": 0.94921875, "learning_rate": 0.0004999290424776475, "loss": 7.0758, "mean_token_accuracy": 0.1056319996714592, "num_tokens": 3786094.0, "step": 1740 }, { "entropy": 7.330498886108399, "epoch": 0.18674086360960993, "grad_norm": 1.015625, "learning_rate": 0.0004999280790977445, "loss": 7.1657, "mean_token_accuracy": 0.09170655235648155, "num_tokens": 3796672.0, "step": 1745 }, { "entropy": 7.131537580490113, "epoch": 0.18727593771737386, "grad_norm": 0.984375, "learning_rate": 0.000499927109223075, "loss": 7.1508, "mean_token_accuracy": 0.09670756980776787, "num_tokens": 3807910.0, "step": 1750 }, { "entropy": 7.103532934188843, "epoch": 0.1878110118251378, "grad_norm": 0.95703125, "learning_rate": 0.0004999261328536667, "loss": 7.1028, "mean_token_accuracy": 0.1024494618177414, "num_tokens": 3820792.0, "step": 1755 }, { "entropy": 7.02842001914978, "epoch": 0.1883460859329017, "grad_norm": 0.921875, "learning_rate": 0.0004999251499895479, "loss": 7.0234, "mean_token_accuracy": 0.1013932503759861, "num_tokens": 3831126.0, "step": 1760 }, { "entropy": 7.213843870162964, "epoch": 0.18888116004066563, "grad_norm": 0.9140625, "learning_rate": 0.0004999241606307471, "loss": 7.1353, "mean_token_accuracy": 0.10057510435581207, "num_tokens": 3841923.0, "step": 1765 }, { "entropy": 7.119020175933838, "epoch": 0.18941623414842956, "grad_norm": 1.0234375, "learning_rate": 0.0004999231647772927, "loss": 7.0491, "mean_token_accuracy": 0.10542590543627739, "num_tokens": 3852504.0, "step": 1770 }, { "entropy": 6.992453765869141, "epoch": 0.1899513082561935, "grad_norm": 0.96875, "learning_rate": 0.0004999221624292136, "loss": 7.0559, "mean_token_accuracy": 0.10485710874199868, "num_tokens": 3862761.0, "step": 1775 }, { "entropy": 7.134696340560913, "epoch": 0.1904863823639574, "grad_norm": 0.96875, "learning_rate": 0.0004999211535865385, "loss": 7.0556, "mean_token_accuracy": 0.09678238332271576, "num_tokens": 3873662.0, "step": 1780 }, { "entropy": 7.063473129272461, "epoch": 0.19102145647172133, "grad_norm": 0.95703125, "learning_rate": 0.0004999201382492969, "loss": 7.0088, "mean_token_accuracy": 0.10047155022621154, "num_tokens": 3884835.0, "step": 1785 }, { "entropy": 7.110291051864624, "epoch": 0.19155653057948527, "grad_norm": 1.0078125, "learning_rate": 0.0004999191164175178, "loss": 7.154, "mean_token_accuracy": 0.09878607764840126, "num_tokens": 3895073.0, "step": 1790 }, { "entropy": 7.209331798553467, "epoch": 0.19209160468724917, "grad_norm": 0.98828125, "learning_rate": 0.0004999180880912309, "loss": 7.1115, "mean_token_accuracy": 0.09884128645062447, "num_tokens": 3905440.0, "step": 1795 }, { "entropy": 7.072672271728516, "epoch": 0.1926266787950131, "grad_norm": 1.078125, "learning_rate": 0.0004999170532704657, "loss": 7.1145, "mean_token_accuracy": 0.0968818336725235, "num_tokens": 3917135.0, "step": 1800 }, { "entropy": 7.13597002029419, "epoch": 0.19316175290277704, "grad_norm": 0.84375, "learning_rate": 0.0004999160119552523, "loss": 7.117, "mean_token_accuracy": 0.10278327167034149, "num_tokens": 3928247.0, "step": 1805 }, { "entropy": 7.091355848312378, "epoch": 0.19369682701054097, "grad_norm": 0.9375, "learning_rate": 0.0004999149641456206, "loss": 7.1009, "mean_token_accuracy": 0.09872358813881874, "num_tokens": 3938609.0, "step": 1810 }, { "entropy": 7.21585783958435, "epoch": 0.19423190111830488, "grad_norm": 1.046875, "learning_rate": 0.000499913909841601, "loss": 7.0861, "mean_token_accuracy": 0.10127425193786621, "num_tokens": 3949221.0, "step": 1815 }, { "entropy": 7.009944200515747, "epoch": 0.1947669752260688, "grad_norm": 1.015625, "learning_rate": 0.0004999128490432238, "loss": 7.0484, "mean_token_accuracy": 0.09548230320215226, "num_tokens": 3959475.0, "step": 1820 }, { "entropy": 7.083078098297119, "epoch": 0.19530204933383274, "grad_norm": 1.046875, "learning_rate": 0.0004999117817505196, "loss": 7.0515, "mean_token_accuracy": 0.1084510900080204, "num_tokens": 3969638.0, "step": 1825 }, { "entropy": 7.053667259216309, "epoch": 0.19583712344159665, "grad_norm": 0.94140625, "learning_rate": 0.0004999107079635194, "loss": 7.1079, "mean_token_accuracy": 0.10137292668223381, "num_tokens": 3980543.0, "step": 1830 }, { "entropy": 7.355273485183716, "epoch": 0.19637219754936058, "grad_norm": 0.921875, "learning_rate": 0.000499909627682254, "loss": 7.162, "mean_token_accuracy": 0.08682658635079861, "num_tokens": 3993518.0, "step": 1835 }, { "entropy": 7.068727111816406, "epoch": 0.19690727165712452, "grad_norm": 1.046875, "learning_rate": 0.0004999085409067549, "loss": 7.1487, "mean_token_accuracy": 0.09789205938577653, "num_tokens": 4002940.0, "step": 1840 }, { "entropy": 7.013206481933594, "epoch": 0.19744234576488845, "grad_norm": 0.94921875, "learning_rate": 0.0004999074476370531, "loss": 7.0792, "mean_token_accuracy": 0.09683184549212456, "num_tokens": 4013982.0, "step": 1845 }, { "entropy": 7.100980806350708, "epoch": 0.19797741987265235, "grad_norm": 0.98828125, "learning_rate": 0.0004999063478731805, "loss": 7.0638, "mean_token_accuracy": 0.10558338239789009, "num_tokens": 4025607.0, "step": 1850 }, { "entropy": 7.0951310157775875, "epoch": 0.1985124939804163, "grad_norm": 0.9140625, "learning_rate": 0.0004999052416151687, "loss": 7.1104, "mean_token_accuracy": 0.10141080170869828, "num_tokens": 4037467.0, "step": 1855 }, { "entropy": 7.149590158462525, "epoch": 0.19904756808818022, "grad_norm": 0.890625, "learning_rate": 0.0004999041288630496, "loss": 7.1127, "mean_token_accuracy": 0.10126180425286294, "num_tokens": 4049146.0, "step": 1860 }, { "entropy": 7.181366395950318, "epoch": 0.19958264219594413, "grad_norm": 0.90234375, "learning_rate": 0.0004999030096168553, "loss": 7.1485, "mean_token_accuracy": 0.09781184569001197, "num_tokens": 4060500.0, "step": 1865 }, { "entropy": 7.157667875289917, "epoch": 0.20011771630370806, "grad_norm": 1.0234375, "learning_rate": 0.0004999018838766182, "loss": 7.0987, "mean_token_accuracy": 0.0985781691968441, "num_tokens": 4070553.0, "step": 1870 }, { "entropy": 7.14162769317627, "epoch": 0.200652790411472, "grad_norm": 0.98046875, "learning_rate": 0.000499900751642371, "loss": 7.0343, "mean_token_accuracy": 0.11338024884462357, "num_tokens": 4079653.0, "step": 1875 }, { "entropy": 7.015338134765625, "epoch": 0.20118786451923593, "grad_norm": 0.921875, "learning_rate": 0.0004998996129141461, "loss": 7.123, "mean_token_accuracy": 0.09923376441001892, "num_tokens": 4089912.0, "step": 1880 }, { "entropy": 7.212585592269898, "epoch": 0.20172293862699983, "grad_norm": 0.98828125, "learning_rate": 0.0004998984676919764, "loss": 7.0772, "mean_token_accuracy": 0.09714810699224471, "num_tokens": 4100577.0, "step": 1885 }, { "entropy": 7.073903751373291, "epoch": 0.20225801273476376, "grad_norm": 0.96484375, "learning_rate": 0.0004998973159758952, "loss": 7.1033, "mean_token_accuracy": 0.09901956990361213, "num_tokens": 4111752.0, "step": 1890 }, { "entropy": 7.06131501197815, "epoch": 0.2027930868425277, "grad_norm": 1.015625, "learning_rate": 0.0004998961577659355, "loss": 7.0616, "mean_token_accuracy": 0.10182834565639495, "num_tokens": 4122616.0, "step": 1895 }, { "entropy": 7.192514705657959, "epoch": 0.2033281609502916, "grad_norm": 0.90234375, "learning_rate": 0.0004998949930621309, "loss": 7.1547, "mean_token_accuracy": 0.10196215733885765, "num_tokens": 4134275.0, "step": 1900 }, { "entropy": 7.112344741821289, "epoch": 0.20386323505805554, "grad_norm": 1.046875, "learning_rate": 0.0004998938218645149, "loss": 7.0506, "mean_token_accuracy": 0.10170819535851479, "num_tokens": 4146412.0, "step": 1905 }, { "entropy": 7.029837560653687, "epoch": 0.20439830916581947, "grad_norm": 0.91796875, "learning_rate": 0.0004998926441731215, "loss": 7.0512, "mean_token_accuracy": 0.1002343863248825, "num_tokens": 4157592.0, "step": 1910 }, { "entropy": 7.06212477684021, "epoch": 0.2049333832735834, "grad_norm": 0.95703125, "learning_rate": 0.0004998914599879845, "loss": 7.0269, "mean_token_accuracy": 0.09835589304566383, "num_tokens": 4168637.0, "step": 1915 }, { "entropy": 7.0664630889892575, "epoch": 0.2054684573813473, "grad_norm": 0.96875, "learning_rate": 0.0004998902693091382, "loss": 7.0736, "mean_token_accuracy": 0.09925776198506356, "num_tokens": 4179951.0, "step": 1920 }, { "entropy": 7.0451087474823, "epoch": 0.20600353148911124, "grad_norm": 0.96875, "learning_rate": 0.0004998890721366171, "loss": 6.9616, "mean_token_accuracy": 0.10666931569576263, "num_tokens": 4189895.0, "step": 1925 }, { "entropy": 7.097507953643799, "epoch": 0.20653860559687517, "grad_norm": 1.0234375, "learning_rate": 0.0004998878684704556, "loss": 7.0214, "mean_token_accuracy": 0.10524726510047913, "num_tokens": 4199796.0, "step": 1930 }, { "entropy": 7.036600160598755, "epoch": 0.20707367970463908, "grad_norm": 1.0234375, "learning_rate": 0.0004998866583106884, "loss": 7.0461, "mean_token_accuracy": 0.09883956611156464, "num_tokens": 4210428.0, "step": 1935 }, { "entropy": 7.218980216979981, "epoch": 0.207608753812403, "grad_norm": 1.0078125, "learning_rate": 0.0004998854416573506, "loss": 7.1246, "mean_token_accuracy": 0.10078881680965424, "num_tokens": 4221515.0, "step": 1940 }, { "entropy": 7.1100975513458256, "epoch": 0.20814382792016695, "grad_norm": 1.0390625, "learning_rate": 0.0004998842185104772, "loss": 7.1387, "mean_token_accuracy": 0.09548087790608406, "num_tokens": 4232580.0, "step": 1945 }, { "entropy": 7.041958284378052, "epoch": 0.20867890202793088, "grad_norm": 0.96875, "learning_rate": 0.0004998829888701036, "loss": 7.0484, "mean_token_accuracy": 0.10664152652025223, "num_tokens": 4242871.0, "step": 1950 }, { "entropy": 7.147633504867554, "epoch": 0.20921397613569478, "grad_norm": 0.97265625, "learning_rate": 0.0004998817527362654, "loss": 7.0773, "mean_token_accuracy": 0.09752313494682312, "num_tokens": 4253419.0, "step": 1955 }, { "entropy": 7.032255792617798, "epoch": 0.20974905024345872, "grad_norm": 0.93359375, "learning_rate": 0.0004998805101089982, "loss": 7.0528, "mean_token_accuracy": 0.10345240533351899, "num_tokens": 4264327.0, "step": 1960 }, { "entropy": 7.170184564590454, "epoch": 0.21028412435122265, "grad_norm": 0.91796875, "learning_rate": 0.0004998792609883378, "loss": 7.0428, "mean_token_accuracy": 0.10343464836478233, "num_tokens": 4274568.0, "step": 1965 }, { "entropy": 7.056762933731079, "epoch": 0.21081919845898656, "grad_norm": 1.171875, "learning_rate": 0.0004998780053743203, "loss": 7.0324, "mean_token_accuracy": 0.10682544857263565, "num_tokens": 4284895.0, "step": 1970 }, { "entropy": 7.12225079536438, "epoch": 0.2113542725667505, "grad_norm": 0.953125, "learning_rate": 0.0004998767432669822, "loss": 7.0637, "mean_token_accuracy": 0.0994573712348938, "num_tokens": 4297258.0, "step": 1975 }, { "entropy": 7.026572132110596, "epoch": 0.21188934667451442, "grad_norm": 0.9921875, "learning_rate": 0.0004998754746663595, "loss": 6.9842, "mean_token_accuracy": 0.10585973560810089, "num_tokens": 4308307.0, "step": 1980 }, { "entropy": 7.050811910629273, "epoch": 0.21242442078227836, "grad_norm": 0.9296875, "learning_rate": 0.0004998741995724892, "loss": 7.0491, "mean_token_accuracy": 0.10263351649045944, "num_tokens": 4318801.0, "step": 1985 }, { "entropy": 7.070459413528442, "epoch": 0.21295949489004226, "grad_norm": 0.984375, "learning_rate": 0.0004998729179854079, "loss": 7.0252, "mean_token_accuracy": 0.10016985535621643, "num_tokens": 4329531.0, "step": 1990 }, { "entropy": 7.054882478713989, "epoch": 0.2134945689978062, "grad_norm": 0.91796875, "learning_rate": 0.0004998716299051527, "loss": 7.0253, "mean_token_accuracy": 0.10470812693238259, "num_tokens": 4341203.0, "step": 1995 }, { "entropy": 7.026881456375122, "epoch": 0.21402964310557013, "grad_norm": 0.98046875, "learning_rate": 0.0004998703353317609, "loss": 7.0788, "mean_token_accuracy": 0.0973646655678749, "num_tokens": 4352426.0, "step": 2000 }, { "entropy": 7.11639552116394, "epoch": 0.21456471721333403, "grad_norm": 0.94140625, "learning_rate": 0.0004998690342652697, "loss": 7.0103, "mean_token_accuracy": 0.10563170909881592, "num_tokens": 4363413.0, "step": 2005 }, { "entropy": 7.054438829421997, "epoch": 0.21509979132109797, "grad_norm": 0.890625, "learning_rate": 0.0004998677267057166, "loss": 6.951, "mean_token_accuracy": 0.10644056648015976, "num_tokens": 4373470.0, "step": 2010 }, { "entropy": 6.9533806324005125, "epoch": 0.2156348654288619, "grad_norm": 1.015625, "learning_rate": 0.0004998664126531397, "loss": 7.0164, "mean_token_accuracy": 0.10371329113841057, "num_tokens": 4384438.0, "step": 2015 }, { "entropy": 7.1470112800598145, "epoch": 0.21616993953662583, "grad_norm": 0.953125, "learning_rate": 0.0004998650921075766, "loss": 6.9978, "mean_token_accuracy": 0.10406329333782197, "num_tokens": 4395100.0, "step": 2020 }, { "entropy": 6.9813416481018065, "epoch": 0.21670501364438974, "grad_norm": 0.90234375, "learning_rate": 0.0004998637650690656, "loss": 7.1179, "mean_token_accuracy": 0.09519804865121842, "num_tokens": 4407131.0, "step": 2025 }, { "entropy": 7.10913496017456, "epoch": 0.21724008775215367, "grad_norm": 1.046875, "learning_rate": 0.000499862431537645, "loss": 6.9569, "mean_token_accuracy": 0.10057392492890357, "num_tokens": 4417701.0, "step": 2030 }, { "entropy": 6.981591272354126, "epoch": 0.2177751618599176, "grad_norm": 1.109375, "learning_rate": 0.0004998610915133533, "loss": 7.0173, "mean_token_accuracy": 0.10014636293053628, "num_tokens": 4429309.0, "step": 2035 }, { "entropy": 7.007551097869873, "epoch": 0.21831023596768154, "grad_norm": 0.9375, "learning_rate": 0.0004998597449962292, "loss": 7.0663, "mean_token_accuracy": 0.10122283399105073, "num_tokens": 4440850.0, "step": 2040 }, { "entropy": 7.092380857467651, "epoch": 0.21884531007544544, "grad_norm": 0.953125, "learning_rate": 0.0004998583919863115, "loss": 7.0501, "mean_token_accuracy": 0.09975898936390877, "num_tokens": 4451995.0, "step": 2045 }, { "entropy": 6.99484076499939, "epoch": 0.21938038418320938, "grad_norm": 1.046875, "learning_rate": 0.0004998570324836393, "loss": 6.959, "mean_token_accuracy": 0.10816834419965744, "num_tokens": 4461916.0, "step": 2050 }, { "entropy": 7.084143257141113, "epoch": 0.2199154582909733, "grad_norm": 1.0546875, "learning_rate": 0.000499855666488252, "loss": 7.0571, "mean_token_accuracy": 0.10147327557206154, "num_tokens": 4471603.0, "step": 2055 }, { "entropy": 7.105906391143799, "epoch": 0.22045053239873721, "grad_norm": 0.98046875, "learning_rate": 0.0004998542940001889, "loss": 7.083, "mean_token_accuracy": 0.10265670791268348, "num_tokens": 4483166.0, "step": 2060 }, { "entropy": 7.020576333999633, "epoch": 0.22098560650650115, "grad_norm": 1.0, "learning_rate": 0.0004998529150194895, "loss": 7.0022, "mean_token_accuracy": 0.09936799854040146, "num_tokens": 4493824.0, "step": 2065 }, { "entropy": 7.097088718414307, "epoch": 0.22152068061426508, "grad_norm": 0.953125, "learning_rate": 0.0004998515295461939, "loss": 6.9225, "mean_token_accuracy": 0.1188635177910328, "num_tokens": 4505674.0, "step": 2070 }, { "entropy": 6.968977689743042, "epoch": 0.22205575472202901, "grad_norm": 0.97265625, "learning_rate": 0.000499850137580342, "loss": 7.0049, "mean_token_accuracy": 0.10718596279621125, "num_tokens": 4516516.0, "step": 2075 }, { "entropy": 7.039025449752808, "epoch": 0.22259082882979292, "grad_norm": 1.0859375, "learning_rate": 0.0004998487391219739, "loss": 6.9963, "mean_token_accuracy": 0.09949744194746017, "num_tokens": 4527811.0, "step": 2080 }, { "entropy": 7.0311308860778805, "epoch": 0.22312590293755685, "grad_norm": 0.88671875, "learning_rate": 0.0004998473341711301, "loss": 6.9388, "mean_token_accuracy": 0.09995686337351799, "num_tokens": 4538988.0, "step": 2085 }, { "entropy": 7.018882703781128, "epoch": 0.22366097704532079, "grad_norm": 1.03125, "learning_rate": 0.0004998459227278512, "loss": 6.9733, "mean_token_accuracy": 0.1059156596660614, "num_tokens": 4550049.0, "step": 2090 }, { "entropy": 7.072498369216919, "epoch": 0.2241960511530847, "grad_norm": 1.0625, "learning_rate": 0.0004998445047921777, "loss": 7.0719, "mean_token_accuracy": 0.10480737760663032, "num_tokens": 4559784.0, "step": 2095 }, { "entropy": 7.031924390792847, "epoch": 0.22473112526084862, "grad_norm": 1.0625, "learning_rate": 0.0004998430803641509, "loss": 6.9337, "mean_token_accuracy": 0.10361162722110748, "num_tokens": 4569982.0, "step": 2100 }, { "entropy": 6.939174699783325, "epoch": 0.22526619936861256, "grad_norm": 0.93359375, "learning_rate": 0.0004998416494438118, "loss": 6.9534, "mean_token_accuracy": 0.10496753230690956, "num_tokens": 4581117.0, "step": 2105 }, { "entropy": 7.033869123458862, "epoch": 0.2258012734763765, "grad_norm": 1.109375, "learning_rate": 0.0004998402120312014, "loss": 7.0198, "mean_token_accuracy": 0.10706626474857331, "num_tokens": 4592012.0, "step": 2110 }, { "entropy": 7.034424209594727, "epoch": 0.2263363475841404, "grad_norm": 0.96875, "learning_rate": 0.0004998387681263616, "loss": 7.0581, "mean_token_accuracy": 0.10076023638248444, "num_tokens": 4602591.0, "step": 2115 }, { "entropy": 7.038776493072509, "epoch": 0.22687142169190433, "grad_norm": 1.015625, "learning_rate": 0.000499837317729334, "loss": 6.985, "mean_token_accuracy": 0.10343138575553894, "num_tokens": 4613418.0, "step": 2120 }, { "entropy": 6.944168281555176, "epoch": 0.22740649579966826, "grad_norm": 0.90625, "learning_rate": 0.0004998358608401603, "loss": 6.9051, "mean_token_accuracy": 0.11338085606694222, "num_tokens": 4625156.0, "step": 2125 }, { "entropy": 7.1117607116699215, "epoch": 0.22794156990743217, "grad_norm": 0.94140625, "learning_rate": 0.000499834397458883, "loss": 6.937, "mean_token_accuracy": 0.10821644887328148, "num_tokens": 4634523.0, "step": 2130 }, { "entropy": 6.958322238922119, "epoch": 0.2284766440151961, "grad_norm": 1.0, "learning_rate": 0.0004998329275855438, "loss": 6.929, "mean_token_accuracy": 0.11250298544764518, "num_tokens": 4646292.0, "step": 2135 }, { "entropy": 6.985101842880249, "epoch": 0.22901171812296003, "grad_norm": 0.984375, "learning_rate": 0.0004998314512201855, "loss": 6.9099, "mean_token_accuracy": 0.10238043665885925, "num_tokens": 4656417.0, "step": 2140 }, { "entropy": 6.924033832550049, "epoch": 0.22954679223072397, "grad_norm": 1.0703125, "learning_rate": 0.0004998299683628507, "loss": 6.9282, "mean_token_accuracy": 0.10534189045429229, "num_tokens": 4666933.0, "step": 2145 }, { "entropy": 7.059316158294678, "epoch": 0.23008186633848787, "grad_norm": 0.9765625, "learning_rate": 0.0004998284790135821, "loss": 7.1084, "mean_token_accuracy": 0.09782184064388275, "num_tokens": 4678482.0, "step": 2150 }, { "entropy": 7.053033971786499, "epoch": 0.2306169404462518, "grad_norm": 1.0703125, "learning_rate": 0.0004998269831724228, "loss": 6.9481, "mean_token_accuracy": 0.1064787782728672, "num_tokens": 4688454.0, "step": 2155 }, { "entropy": 6.9519795894622805, "epoch": 0.23115201455401574, "grad_norm": 1.0234375, "learning_rate": 0.0004998254808394159, "loss": 6.9839, "mean_token_accuracy": 0.1061179980635643, "num_tokens": 4699545.0, "step": 2160 }, { "entropy": 7.083680486679077, "epoch": 0.23168708866177964, "grad_norm": 0.85546875, "learning_rate": 0.0004998239720146048, "loss": 6.9986, "mean_token_accuracy": 0.10272667407989503, "num_tokens": 4711149.0, "step": 2165 }, { "entropy": 6.961511278152466, "epoch": 0.23222216276954358, "grad_norm": 0.9453125, "learning_rate": 0.0004998224566980332, "loss": 6.9935, "mean_token_accuracy": 0.10200226753950119, "num_tokens": 4722651.0, "step": 2170 }, { "entropy": 7.031105852127075, "epoch": 0.2327572368773075, "grad_norm": 1.046875, "learning_rate": 0.0004998209348897447, "loss": 6.9926, "mean_token_accuracy": 0.09458313658833503, "num_tokens": 4733883.0, "step": 2175 }, { "entropy": 7.135159015655518, "epoch": 0.23329231098507144, "grad_norm": 0.98046875, "learning_rate": 0.0004998194065897833, "loss": 6.955, "mean_token_accuracy": 0.10691621899604797, "num_tokens": 4744517.0, "step": 2180 }, { "entropy": 6.9776819229125975, "epoch": 0.23382738509283535, "grad_norm": 1.0390625, "learning_rate": 0.000499817871798193, "loss": 6.9804, "mean_token_accuracy": 0.11214952319860458, "num_tokens": 4755481.0, "step": 2185 }, { "entropy": 6.972070980072021, "epoch": 0.23436245920059928, "grad_norm": 1.1171875, "learning_rate": 0.0004998163305150185, "loss": 6.9039, "mean_token_accuracy": 0.11068079173564911, "num_tokens": 4765535.0, "step": 2190 }, { "entropy": 6.973287200927734, "epoch": 0.23489753330836322, "grad_norm": 0.98828125, "learning_rate": 0.0004998147827403038, "loss": 7.0273, "mean_token_accuracy": 0.10471541583538055, "num_tokens": 4777045.0, "step": 2195 }, { "entropy": 7.077732086181641, "epoch": 0.23543260741612712, "grad_norm": 0.9921875, "learning_rate": 0.000499813228474094, "loss": 6.9064, "mean_token_accuracy": 0.10825864002108573, "num_tokens": 4787958.0, "step": 2200 }, { "entropy": 6.917084503173828, "epoch": 0.23596768152389105, "grad_norm": 0.953125, "learning_rate": 0.0004998116677164338, "loss": 6.9445, "mean_token_accuracy": 0.10730226412415504, "num_tokens": 4798502.0, "step": 2205 }, { "entropy": 6.931448936462402, "epoch": 0.236502755631655, "grad_norm": 0.9921875, "learning_rate": 0.0004998101004673682, "loss": 6.9413, "mean_token_accuracy": 0.11088823229074478, "num_tokens": 4809179.0, "step": 2210 }, { "entropy": 7.135161733627319, "epoch": 0.23703782973941892, "grad_norm": 1.015625, "learning_rate": 0.0004998085267269426, "loss": 7.0215, "mean_token_accuracy": 0.09467339664697647, "num_tokens": 4819803.0, "step": 2215 }, { "entropy": 7.004361200332641, "epoch": 0.23757290384718283, "grad_norm": 0.96875, "learning_rate": 0.0004998069464952025, "loss": 6.9916, "mean_token_accuracy": 0.10000614672899247, "num_tokens": 4831226.0, "step": 2220 }, { "entropy": 7.049906778335571, "epoch": 0.23810797795494676, "grad_norm": 0.9453125, "learning_rate": 0.0004998053597721932, "loss": 7.0124, "mean_token_accuracy": 0.10538152158260346, "num_tokens": 4842168.0, "step": 2225 }, { "entropy": 7.019608783721924, "epoch": 0.2386430520627107, "grad_norm": 0.94140625, "learning_rate": 0.0004998037665579608, "loss": 6.9621, "mean_token_accuracy": 0.10858180820941925, "num_tokens": 4852655.0, "step": 2230 }, { "entropy": 6.915230321884155, "epoch": 0.2391781261704746, "grad_norm": 0.95703125, "learning_rate": 0.0004998021668525513, "loss": 6.8626, "mean_token_accuracy": 0.10984659045934678, "num_tokens": 4862164.0, "step": 2235 }, { "entropy": 7.046167945861816, "epoch": 0.23971320027823853, "grad_norm": 0.9609375, "learning_rate": 0.0004998005606560107, "loss": 6.9964, "mean_token_accuracy": 0.10990610420703888, "num_tokens": 4874233.0, "step": 2240 }, { "entropy": 6.992388391494751, "epoch": 0.24024827438600246, "grad_norm": 0.953125, "learning_rate": 0.0004997989479683856, "loss": 6.9876, "mean_token_accuracy": 0.1066631942987442, "num_tokens": 4885948.0, "step": 2245 }, { "entropy": 6.963246202468872, "epoch": 0.2407833484937664, "grad_norm": 0.90234375, "learning_rate": 0.0004997973287897224, "loss": 6.9667, "mean_token_accuracy": 0.10817388147115707, "num_tokens": 4897128.0, "step": 2250 }, { "entropy": 6.980781888961792, "epoch": 0.2413184226015303, "grad_norm": 0.98828125, "learning_rate": 0.0004997957031200681, "loss": 6.939, "mean_token_accuracy": 0.11121672838926315, "num_tokens": 4907699.0, "step": 2255 }, { "entropy": 6.887354183197021, "epoch": 0.24185349670929424, "grad_norm": 0.984375, "learning_rate": 0.0004997940709594692, "loss": 6.8796, "mean_token_accuracy": 0.10674800127744674, "num_tokens": 4918772.0, "step": 2260 }, { "entropy": 7.091795778274536, "epoch": 0.24238857081705817, "grad_norm": 1.078125, "learning_rate": 0.0004997924323079733, "loss": 6.9368, "mean_token_accuracy": 0.10729291215538979, "num_tokens": 4930046.0, "step": 2265 }, { "entropy": 6.9101183891296385, "epoch": 0.24292364492482207, "grad_norm": 1.078125, "learning_rate": 0.0004997907871656273, "loss": 6.9568, "mean_token_accuracy": 0.10801581889390946, "num_tokens": 4940609.0, "step": 2270 }, { "entropy": 7.002806997299194, "epoch": 0.243458719032586, "grad_norm": 1.0, "learning_rate": 0.0004997891355324791, "loss": 6.9658, "mean_token_accuracy": 0.10598139539361, "num_tokens": 4951339.0, "step": 2275 }, { "entropy": 6.983994722366333, "epoch": 0.24399379314034994, "grad_norm": 0.9921875, "learning_rate": 0.0004997874774085761, "loss": 6.878, "mean_token_accuracy": 0.10262224972248077, "num_tokens": 4961083.0, "step": 2280 }, { "entropy": 6.895718050003052, "epoch": 0.24452886724811387, "grad_norm": 1.0859375, "learning_rate": 0.0004997858127939662, "loss": 6.8908, "mean_token_accuracy": 0.10761211439967155, "num_tokens": 4971399.0, "step": 2285 }, { "entropy": 7.041612005233764, "epoch": 0.24506394135587778, "grad_norm": 0.99609375, "learning_rate": 0.0004997841416886976, "loss": 6.9715, "mean_token_accuracy": 0.1061974436044693, "num_tokens": 4982429.0, "step": 2290 }, { "entropy": 7.0298323154449465, "epoch": 0.2455990154636417, "grad_norm": 1.0234375, "learning_rate": 0.0004997824640928186, "loss": 7.0184, "mean_token_accuracy": 0.10754595324397087, "num_tokens": 4993706.0, "step": 2295 }, { "entropy": 6.988226366043091, "epoch": 0.24613408957140565, "grad_norm": 0.97265625, "learning_rate": 0.0004997807800063774, "loss": 6.9127, "mean_token_accuracy": 0.10858980864286423, "num_tokens": 5005411.0, "step": 2300 }, { "entropy": 7.023472309112549, "epoch": 0.24666916367916958, "grad_norm": 0.97265625, "learning_rate": 0.000499779089429423, "loss": 7.0413, "mean_token_accuracy": 0.10208934471011162, "num_tokens": 5016011.0, "step": 2305 }, { "entropy": 7.013689231872559, "epoch": 0.24720423778693348, "grad_norm": 0.91015625, "learning_rate": 0.0004997773923620037, "loss": 6.9954, "mean_token_accuracy": 0.10329191759228706, "num_tokens": 5027841.0, "step": 2310 }, { "entropy": 7.100406980514526, "epoch": 0.24773931189469742, "grad_norm": 0.95703125, "learning_rate": 0.0004997756888041689, "loss": 6.9853, "mean_token_accuracy": 0.09798330888152122, "num_tokens": 5038640.0, "step": 2315 }, { "entropy": 6.95166802406311, "epoch": 0.24827438600246135, "grad_norm": 1.0, "learning_rate": 0.0004997739787559677, "loss": 6.9356, "mean_token_accuracy": 0.10357877835631371, "num_tokens": 5050423.0, "step": 2320 }, { "entropy": 6.978884506225586, "epoch": 0.24880946011022526, "grad_norm": 1.140625, "learning_rate": 0.0004997722622174494, "loss": 6.954, "mean_token_accuracy": 0.10356095060706139, "num_tokens": 5060654.0, "step": 2325 }, { "entropy": 6.934212970733642, "epoch": 0.2493445342179892, "grad_norm": 1.015625, "learning_rate": 0.0004997705391886636, "loss": 6.8582, "mean_token_accuracy": 0.11322998628020287, "num_tokens": 5070165.0, "step": 2330 }, { "entropy": 6.913174200057983, "epoch": 0.24987960832575312, "grad_norm": 1.0, "learning_rate": 0.0004997688096696601, "loss": 6.8995, "mean_token_accuracy": 0.10103722065687179, "num_tokens": 5080937.0, "step": 2335 }, { "entropy": 6.911728572845459, "epoch": 0.25041468243351706, "grad_norm": 0.96484375, "learning_rate": 0.0004997670736604888, "loss": 6.8744, "mean_token_accuracy": 0.11288927420973778, "num_tokens": 5090955.0, "step": 2340 }, { "entropy": 7.074804210662842, "epoch": 0.250949756541281, "grad_norm": 0.96484375, "learning_rate": 0.0004997653311611998, "loss": 7.0112, "mean_token_accuracy": 0.09920887500047684, "num_tokens": 5102201.0, "step": 2345 }, { "entropy": 7.0164875984191895, "epoch": 0.25148483064904487, "grad_norm": 1.0390625, "learning_rate": 0.0004997635821718435, "loss": 6.9312, "mean_token_accuracy": 0.11026841551065444, "num_tokens": 5112235.0, "step": 2350 }, { "entropy": 6.8925614833831785, "epoch": 0.2520199047568088, "grad_norm": 1.40625, "learning_rate": 0.0004997618266924704, "loss": 6.8219, "mean_token_accuracy": 0.10299434512853622, "num_tokens": 5122360.0, "step": 2355 }, { "entropy": 7.002241230010986, "epoch": 0.25255497886457273, "grad_norm": 1.015625, "learning_rate": 0.000499760064723131, "loss": 6.9801, "mean_token_accuracy": 0.1024145670235157, "num_tokens": 5133084.0, "step": 2360 }, { "entropy": 6.938703870773315, "epoch": 0.25309005297233667, "grad_norm": 0.98046875, "learning_rate": 0.0004997582962638764, "loss": 6.9133, "mean_token_accuracy": 0.09837969020009041, "num_tokens": 5144495.0, "step": 2365 }, { "entropy": 7.031873512268066, "epoch": 0.2536251270801006, "grad_norm": 1.0, "learning_rate": 0.0004997565213147575, "loss": 6.9238, "mean_token_accuracy": 0.10646962001919746, "num_tokens": 5154824.0, "step": 2370 }, { "entropy": 6.939056253433227, "epoch": 0.25416020118786453, "grad_norm": 1.03125, "learning_rate": 0.0004997547398758257, "loss": 6.9111, "mean_token_accuracy": 0.10193499475717545, "num_tokens": 5165061.0, "step": 2375 }, { "entropy": 6.981441783905029, "epoch": 0.25469527529562846, "grad_norm": 1.0, "learning_rate": 0.0004997529519471323, "loss": 6.8679, "mean_token_accuracy": 0.11417916044592857, "num_tokens": 5174964.0, "step": 2380 }, { "entropy": 6.884857940673828, "epoch": 0.25523034940339234, "grad_norm": 1.0859375, "learning_rate": 0.0004997511575287291, "loss": 6.9267, "mean_token_accuracy": 0.10812475010752678, "num_tokens": 5185458.0, "step": 2385 }, { "entropy": 6.991512250900269, "epoch": 0.2557654235111563, "grad_norm": 1.03125, "learning_rate": 0.0004997493566206677, "loss": 6.9025, "mean_token_accuracy": 0.10954718366265297, "num_tokens": 5196193.0, "step": 2390 }, { "entropy": 6.966927862167358, "epoch": 0.2563004976189202, "grad_norm": 0.94140625, "learning_rate": 0.0004997475492230003, "loss": 7.0198, "mean_token_accuracy": 0.09881971776485443, "num_tokens": 5208541.0, "step": 2395 }, { "entropy": 6.989241456985473, "epoch": 0.25683557172668414, "grad_norm": 1.0234375, "learning_rate": 0.000499745735335779, "loss": 6.8501, "mean_token_accuracy": 0.10620964914560319, "num_tokens": 5218567.0, "step": 2400 }, { "entropy": 6.943647241592407, "epoch": 0.2573706458344481, "grad_norm": 0.97265625, "learning_rate": 0.0004997439149590561, "loss": 6.9666, "mean_token_accuracy": 0.10247603580355644, "num_tokens": 5228293.0, "step": 2405 }, { "entropy": 6.982013940811157, "epoch": 0.257905719942212, "grad_norm": 1.09375, "learning_rate": 0.0004997420880928843, "loss": 6.913, "mean_token_accuracy": 0.10574470162391662, "num_tokens": 5238880.0, "step": 2410 }, { "entropy": 6.9576988697052, "epoch": 0.25844079404997594, "grad_norm": 0.98046875, "learning_rate": 0.0004997402547373162, "loss": 6.9947, "mean_token_accuracy": 0.10212295204401016, "num_tokens": 5250104.0, "step": 2415 }, { "entropy": 7.100748538970947, "epoch": 0.2589758681577399, "grad_norm": 0.94921875, "learning_rate": 0.0004997384148924049, "loss": 7.0243, "mean_token_accuracy": 0.10289878994226456, "num_tokens": 5260355.0, "step": 2420 }, { "entropy": 6.962227201461792, "epoch": 0.25951094226550375, "grad_norm": 1.0078125, "learning_rate": 0.0004997365685582035, "loss": 6.9296, "mean_token_accuracy": 0.10283196046948433, "num_tokens": 5272117.0, "step": 2425 }, { "entropy": 6.9883177280426025, "epoch": 0.2600460163732677, "grad_norm": 0.890625, "learning_rate": 0.0004997347157347651, "loss": 7.0307, "mean_token_accuracy": 0.10037739872932434, "num_tokens": 5284583.0, "step": 2430 }, { "entropy": 7.049625587463379, "epoch": 0.2605810904810316, "grad_norm": 0.93359375, "learning_rate": 0.0004997328564221435, "loss": 6.8241, "mean_token_accuracy": 0.12059795558452606, "num_tokens": 5295846.0, "step": 2435 }, { "entropy": 6.871410655975342, "epoch": 0.26111616458879555, "grad_norm": 0.91796875, "learning_rate": 0.0004997309906203922, "loss": 6.9662, "mean_token_accuracy": 0.10526571422815323, "num_tokens": 5307802.0, "step": 2440 }, { "entropy": 7.033421468734741, "epoch": 0.2616512386965595, "grad_norm": 1.046875, "learning_rate": 0.0004997291183295652, "loss": 6.8913, "mean_token_accuracy": 0.10737156346440316, "num_tokens": 5318263.0, "step": 2445 }, { "entropy": 6.998748159408569, "epoch": 0.2621863128043234, "grad_norm": 0.98046875, "learning_rate": 0.0004997272395497164, "loss": 6.9388, "mean_token_accuracy": 0.10455406904220581, "num_tokens": 5328555.0, "step": 2450 }, { "entropy": 6.912611675262451, "epoch": 0.26272138691208735, "grad_norm": 0.96484375, "learning_rate": 0.0004997253542809002, "loss": 6.9152, "mean_token_accuracy": 0.10682450905442238, "num_tokens": 5339954.0, "step": 2455 }, { "entropy": 7.079062366485596, "epoch": 0.26325646101985123, "grad_norm": 0.984375, "learning_rate": 0.0004997234625231709, "loss": 6.9637, "mean_token_accuracy": 0.10808332860469819, "num_tokens": 5350919.0, "step": 2460 }, { "entropy": 6.93997278213501, "epoch": 0.26379153512761516, "grad_norm": 0.91015625, "learning_rate": 0.0004997215642765832, "loss": 6.925, "mean_token_accuracy": 0.10664721727371215, "num_tokens": 5361844.0, "step": 2465 }, { "entropy": 6.987752532958984, "epoch": 0.2643266092353791, "grad_norm": 0.95703125, "learning_rate": 0.000499719659541192, "loss": 6.9562, "mean_token_accuracy": 0.10334968268871307, "num_tokens": 5372026.0, "step": 2470 }, { "entropy": 6.954167985916138, "epoch": 0.26486168334314303, "grad_norm": 0.890625, "learning_rate": 0.0004997177483170521, "loss": 6.9927, "mean_token_accuracy": 0.10936494544148445, "num_tokens": 5382965.0, "step": 2475 }, { "entropy": 7.007135391235352, "epoch": 0.26539675745090696, "grad_norm": 1.0390625, "learning_rate": 0.0004997158306042188, "loss": 6.9458, "mean_token_accuracy": 0.10711643844842911, "num_tokens": 5393738.0, "step": 2480 }, { "entropy": 6.897781848907471, "epoch": 0.2659318315586709, "grad_norm": 1.0625, "learning_rate": 0.0004997139064027476, "loss": 6.8237, "mean_token_accuracy": 0.1119477018713951, "num_tokens": 5404059.0, "step": 2485 }, { "entropy": 6.912676382064819, "epoch": 0.26646690566643483, "grad_norm": 1.046875, "learning_rate": 0.0004997119757126938, "loss": 6.855, "mean_token_accuracy": 0.10871710032224655, "num_tokens": 5414152.0, "step": 2490 }, { "entropy": 7.022440433502197, "epoch": 0.2670019797741987, "grad_norm": 1.015625, "learning_rate": 0.0004997100385341133, "loss": 7.0235, "mean_token_accuracy": 0.10726772770285606, "num_tokens": 5425227.0, "step": 2495 }, { "entropy": 7.004488468170166, "epoch": 0.26753705388196264, "grad_norm": 0.98828125, "learning_rate": 0.0004997080948670621, "loss": 6.8663, "mean_token_accuracy": 0.11122208759188652, "num_tokens": 5435716.0, "step": 2500 }, { "entropy": 6.936031723022461, "epoch": 0.26807212798972657, "grad_norm": 0.9609375, "learning_rate": 0.0004997061447115962, "loss": 6.9347, "mean_token_accuracy": 0.10375397354364395, "num_tokens": 5446519.0, "step": 2505 }, { "entropy": 6.975105237960816, "epoch": 0.2686072020974905, "grad_norm": 1.0078125, "learning_rate": 0.0004997041880677719, "loss": 6.925, "mean_token_accuracy": 0.10548185482621193, "num_tokens": 5457496.0, "step": 2510 }, { "entropy": 6.880755996704101, "epoch": 0.26914227620525444, "grad_norm": 1.1171875, "learning_rate": 0.0004997022249356457, "loss": 6.823, "mean_token_accuracy": 0.11008255481719971, "num_tokens": 5469059.0, "step": 2515 }, { "entropy": 6.923517560958862, "epoch": 0.26967735031301837, "grad_norm": 1.3203125, "learning_rate": 0.0004997002553152745, "loss": 6.9138, "mean_token_accuracy": 0.10938023030757904, "num_tokens": 5480324.0, "step": 2520 }, { "entropy": 6.9742035388946535, "epoch": 0.2702124244207823, "grad_norm": 0.98828125, "learning_rate": 0.0004996982792067148, "loss": 6.9339, "mean_token_accuracy": 0.09864719212055206, "num_tokens": 5491513.0, "step": 2525 }, { "entropy": 6.8970160484313965, "epoch": 0.2707474985285462, "grad_norm": 0.95703125, "learning_rate": 0.000499696296610024, "loss": 6.8394, "mean_token_accuracy": 0.1051232136785984, "num_tokens": 5502414.0, "step": 2530 }, { "entropy": 6.9252660274505615, "epoch": 0.2712825726363101, "grad_norm": 0.94140625, "learning_rate": 0.0004996943075252592, "loss": 6.9715, "mean_token_accuracy": 0.1062911570072174, "num_tokens": 5512962.0, "step": 2535 }, { "entropy": 6.977799654006958, "epoch": 0.27181764674407405, "grad_norm": 0.9609375, "learning_rate": 0.0004996923119524777, "loss": 6.8355, "mean_token_accuracy": 0.10766077339649201, "num_tokens": 5524648.0, "step": 2540 }, { "entropy": 6.855292940139771, "epoch": 0.272352720851838, "grad_norm": 1.0078125, "learning_rate": 0.0004996903098917375, "loss": 6.9214, "mean_token_accuracy": 0.0998130515217781, "num_tokens": 5536158.0, "step": 2545 }, { "entropy": 6.939780187606812, "epoch": 0.2728877949596019, "grad_norm": 1.0078125, "learning_rate": 0.000499688301343096, "loss": 6.8405, "mean_token_accuracy": 0.10747457072138786, "num_tokens": 5547374.0, "step": 2550 }, { "entropy": 7.020946025848389, "epoch": 0.27342286906736585, "grad_norm": 1.0, "learning_rate": 0.0004996862863066114, "loss": 6.9137, "mean_token_accuracy": 0.10850636437535285, "num_tokens": 5559212.0, "step": 2555 }, { "entropy": 6.907329320907593, "epoch": 0.2739579431751298, "grad_norm": 1.078125, "learning_rate": 0.0004996842647823419, "loss": 6.8823, "mean_token_accuracy": 0.10653341263532638, "num_tokens": 5569302.0, "step": 2560 }, { "entropy": 6.910869598388672, "epoch": 0.27449301728289366, "grad_norm": 1.140625, "learning_rate": 0.0004996822367703458, "loss": 6.8905, "mean_token_accuracy": 0.10348111093044281, "num_tokens": 5581688.0, "step": 2565 }, { "entropy": 6.955097198486328, "epoch": 0.2750280913906576, "grad_norm": 1.1328125, "learning_rate": 0.0004996802022706817, "loss": 6.8211, "mean_token_accuracy": 0.10833865478634834, "num_tokens": 5591376.0, "step": 2570 }, { "entropy": 6.861729669570923, "epoch": 0.2755631654984215, "grad_norm": 1.046875, "learning_rate": 0.0004996781612834083, "loss": 6.8798, "mean_token_accuracy": 0.10732169449329376, "num_tokens": 5601510.0, "step": 2575 }, { "entropy": 7.005447006225586, "epoch": 0.27609823960618546, "grad_norm": 1.1484375, "learning_rate": 0.0004996761138085846, "loss": 6.9316, "mean_token_accuracy": 0.1021797627210617, "num_tokens": 5611436.0, "step": 2580 }, { "entropy": 6.92574257850647, "epoch": 0.2766333137139494, "grad_norm": 1.21875, "learning_rate": 0.0004996740598462697, "loss": 6.9341, "mean_token_accuracy": 0.10267650112509727, "num_tokens": 5620470.0, "step": 2585 }, { "entropy": 6.860880899429321, "epoch": 0.2771683878217133, "grad_norm": 1.0234375, "learning_rate": 0.0004996719993965229, "loss": 6.8297, "mean_token_accuracy": 0.10769467577338218, "num_tokens": 5630740.0, "step": 2590 }, { "entropy": 6.8753687858581545, "epoch": 0.27770346192947726, "grad_norm": 1.0546875, "learning_rate": 0.0004996699324594036, "loss": 6.8303, "mean_token_accuracy": 0.11734023317694664, "num_tokens": 5641138.0, "step": 2595 }, { "entropy": 6.985844898223877, "epoch": 0.27823853603724114, "grad_norm": 0.9921875, "learning_rate": 0.0004996678590349717, "loss": 6.974, "mean_token_accuracy": 0.1085183672606945, "num_tokens": 5652474.0, "step": 2600 }, { "entropy": 6.9662446022033695, "epoch": 0.27877361014500507, "grad_norm": 1.0390625, "learning_rate": 0.0004996657791232868, "loss": 6.8709, "mean_token_accuracy": 0.11153203919529915, "num_tokens": 5663178.0, "step": 2605 }, { "entropy": 6.891348218917846, "epoch": 0.279308684252769, "grad_norm": 1.1171875, "learning_rate": 0.0004996636927244092, "loss": 6.8963, "mean_token_accuracy": 0.10582477301359176, "num_tokens": 5673565.0, "step": 2610 }, { "entropy": 7.040777587890625, "epoch": 0.27984375836053293, "grad_norm": 1.1171875, "learning_rate": 0.000499661599838399, "loss": 6.9389, "mean_token_accuracy": 0.10204790085554123, "num_tokens": 5684651.0, "step": 2615 }, { "entropy": 6.929867219924927, "epoch": 0.28037883246829687, "grad_norm": 1.0078125, "learning_rate": 0.0004996595004653167, "loss": 6.8204, "mean_token_accuracy": 0.10971119105815888, "num_tokens": 5696081.0, "step": 2620 }, { "entropy": 6.925084161758423, "epoch": 0.2809139065760608, "grad_norm": 0.9921875, "learning_rate": 0.0004996573946052229, "loss": 6.855, "mean_token_accuracy": 0.10883698239922523, "num_tokens": 5706830.0, "step": 2625 }, { "entropy": 6.910267782211304, "epoch": 0.28144898068382473, "grad_norm": 1.1328125, "learning_rate": 0.0004996552822581783, "loss": 6.8815, "mean_token_accuracy": 0.11361035332083702, "num_tokens": 5717261.0, "step": 2630 }, { "entropy": 6.91580810546875, "epoch": 0.2819840547915886, "grad_norm": 1.1640625, "learning_rate": 0.000499653163424244, "loss": 6.8481, "mean_token_accuracy": 0.10841184929013252, "num_tokens": 5727280.0, "step": 2635 }, { "entropy": 6.938942956924438, "epoch": 0.28251912889935255, "grad_norm": 0.97265625, "learning_rate": 0.0004996510381034814, "loss": 6.9083, "mean_token_accuracy": 0.10522805228829384, "num_tokens": 5737485.0, "step": 2640 }, { "entropy": 6.926429605484008, "epoch": 0.2830542030071165, "grad_norm": 0.9921875, "learning_rate": 0.0004996489062959515, "loss": 6.8735, "mean_token_accuracy": 0.10467999801039696, "num_tokens": 5747683.0, "step": 2645 }, { "entropy": 6.867719650268555, "epoch": 0.2835892771148804, "grad_norm": 1.046875, "learning_rate": 0.0004996467680017159, "loss": 6.9325, "mean_token_accuracy": 0.10280923023819924, "num_tokens": 5758148.0, "step": 2650 }, { "entropy": 6.917259216308594, "epoch": 0.28412435122264434, "grad_norm": 0.96484375, "learning_rate": 0.0004996446232208365, "loss": 6.8627, "mean_token_accuracy": 0.11170612499117852, "num_tokens": 5769109.0, "step": 2655 }, { "entropy": 6.9372947216033936, "epoch": 0.2846594253304083, "grad_norm": 1.03125, "learning_rate": 0.0004996424719533753, "loss": 6.8939, "mean_token_accuracy": 0.1052110217511654, "num_tokens": 5780344.0, "step": 2660 }, { "entropy": 6.913125228881836, "epoch": 0.2851944994381722, "grad_norm": 1.0859375, "learning_rate": 0.0004996403141993941, "loss": 6.6962, "mean_token_accuracy": 0.11824454516172409, "num_tokens": 5790167.0, "step": 2665 }, { "entropy": 6.92453293800354, "epoch": 0.2857295735459361, "grad_norm": 1.0625, "learning_rate": 0.0004996381499589555, "loss": 6.8624, "mean_token_accuracy": 0.10613423809409142, "num_tokens": 5800076.0, "step": 2670 }, { "entropy": 6.944131517410279, "epoch": 0.2862646476537, "grad_norm": 0.98828125, "learning_rate": 0.0004996359792321219, "loss": 6.8113, "mean_token_accuracy": 0.11141969487071038, "num_tokens": 5810547.0, "step": 2675 }, { "entropy": 6.8161341667175295, "epoch": 0.28679972176146395, "grad_norm": 1.0625, "learning_rate": 0.000499633802018956, "loss": 6.8478, "mean_token_accuracy": 0.1100471280515194, "num_tokens": 5821210.0, "step": 2680 }, { "entropy": 6.917617702484131, "epoch": 0.2873347958692279, "grad_norm": 1.0078125, "learning_rate": 0.0004996316183195204, "loss": 6.8869, "mean_token_accuracy": 0.10786092206835747, "num_tokens": 5832361.0, "step": 2685 }, { "entropy": 6.962878274917602, "epoch": 0.2878698699769918, "grad_norm": 1.03125, "learning_rate": 0.0004996294281338786, "loss": 6.8717, "mean_token_accuracy": 0.10681624412536621, "num_tokens": 5843242.0, "step": 2690 }, { "entropy": 6.976676988601684, "epoch": 0.28840494408475575, "grad_norm": 0.9453125, "learning_rate": 0.0004996272314620936, "loss": 6.9215, "mean_token_accuracy": 0.10194345191121101, "num_tokens": 5855163.0, "step": 2695 }, { "entropy": 6.837163925170898, "epoch": 0.2889400181925197, "grad_norm": 0.97265625, "learning_rate": 0.0004996250283042288, "loss": 6.8839, "mean_token_accuracy": 0.11228486746549607, "num_tokens": 5866908.0, "step": 2700 }, { "entropy": 6.974035596847534, "epoch": 0.28947509230028357, "grad_norm": 1.0546875, "learning_rate": 0.000499622818660348, "loss": 6.9045, "mean_token_accuracy": 0.10939288139343262, "num_tokens": 5877342.0, "step": 2705 }, { "entropy": 6.942460250854492, "epoch": 0.2900101664080475, "grad_norm": 1.078125, "learning_rate": 0.0004996206025305147, "loss": 6.8573, "mean_token_accuracy": 0.10582418739795685, "num_tokens": 5887960.0, "step": 2710 }, { "entropy": 6.87635645866394, "epoch": 0.29054524051581143, "grad_norm": 1.0390625, "learning_rate": 0.0004996183799147932, "loss": 6.8397, "mean_token_accuracy": 0.1095063179731369, "num_tokens": 5899887.0, "step": 2715 }, { "entropy": 6.917806816101074, "epoch": 0.29108031462357536, "grad_norm": 1.0390625, "learning_rate": 0.0004996161508132475, "loss": 6.8583, "mean_token_accuracy": 0.10231703668832778, "num_tokens": 5911022.0, "step": 2720 }, { "entropy": 7.016377210617065, "epoch": 0.2916153887313393, "grad_norm": 0.99609375, "learning_rate": 0.000499613915225942, "loss": 6.9222, "mean_token_accuracy": 0.11102863773703575, "num_tokens": 5922780.0, "step": 2725 }, { "entropy": 6.881858253479004, "epoch": 0.29215046283910323, "grad_norm": 1.0546875, "learning_rate": 0.0004996116731529412, "loss": 6.9251, "mean_token_accuracy": 0.10592872574925423, "num_tokens": 5934112.0, "step": 2730 }, { "entropy": 6.8940752983093265, "epoch": 0.29268553694686716, "grad_norm": 1.0546875, "learning_rate": 0.00049960942459431, "loss": 6.8866, "mean_token_accuracy": 0.1067856416106224, "num_tokens": 5944386.0, "step": 2735 }, { "entropy": 6.870763492584229, "epoch": 0.29322061105463104, "grad_norm": 1.03125, "learning_rate": 0.0004996071695501132, "loss": 6.813, "mean_token_accuracy": 0.10948670953512192, "num_tokens": 5955552.0, "step": 2740 }, { "entropy": 6.921037864685059, "epoch": 0.293755685162395, "grad_norm": 1.0, "learning_rate": 0.0004996049080204159, "loss": 6.8137, "mean_token_accuracy": 0.1098986655473709, "num_tokens": 5966790.0, "step": 2745 }, { "entropy": 6.925626182556153, "epoch": 0.2942907592701589, "grad_norm": 1.0625, "learning_rate": 0.0004996026400052835, "loss": 6.8214, "mean_token_accuracy": 0.10917853116989136, "num_tokens": 5977704.0, "step": 2750 }, { "entropy": 6.853207015991211, "epoch": 0.29482583337792284, "grad_norm": 0.953125, "learning_rate": 0.0004996003655047814, "loss": 6.8364, "mean_token_accuracy": 0.11162171512842178, "num_tokens": 5989221.0, "step": 2755 }, { "entropy": 6.919997644424439, "epoch": 0.2953609074856868, "grad_norm": 0.89453125, "learning_rate": 0.0004995980845189753, "loss": 6.871, "mean_token_accuracy": 0.10931915193796157, "num_tokens": 6000906.0, "step": 2760 }, { "entropy": 6.931192445755005, "epoch": 0.2958959815934507, "grad_norm": 1.015625, "learning_rate": 0.0004995957970479312, "loss": 6.8945, "mean_token_accuracy": 0.10708941668272018, "num_tokens": 6012039.0, "step": 2765 }, { "entropy": 6.8547321319580075, "epoch": 0.29643105570121464, "grad_norm": 0.93359375, "learning_rate": 0.0004995935030917148, "loss": 6.776, "mean_token_accuracy": 0.11066783592104912, "num_tokens": 6024383.0, "step": 2770 }, { "entropy": 6.994161558151245, "epoch": 0.2969661298089785, "grad_norm": 1.0859375, "learning_rate": 0.0004995912026503926, "loss": 6.8508, "mean_token_accuracy": 0.10267031714320182, "num_tokens": 6034904.0, "step": 2775 }, { "entropy": 6.838885879516601, "epoch": 0.29750120391674245, "grad_norm": 1.0234375, "learning_rate": 0.000499588895724031, "loss": 6.8488, "mean_token_accuracy": 0.10749915912747383, "num_tokens": 6044449.0, "step": 2780 }, { "entropy": 6.962449741363526, "epoch": 0.2980362780245064, "grad_norm": 1.109375, "learning_rate": 0.0004995865823126968, "loss": 6.8765, "mean_token_accuracy": 0.10825972631573677, "num_tokens": 6054465.0, "step": 2785 }, { "entropy": 6.8947694301605225, "epoch": 0.2985713521322703, "grad_norm": 1.0859375, "learning_rate": 0.0004995842624164564, "loss": 6.8962, "mean_token_accuracy": 0.10824007838964463, "num_tokens": 6065539.0, "step": 2790 }, { "entropy": 6.909287405014038, "epoch": 0.29910642624003425, "grad_norm": 1.0859375, "learning_rate": 0.000499581936035377, "loss": 6.8459, "mean_token_accuracy": 0.10840294510126114, "num_tokens": 6076135.0, "step": 2795 }, { "entropy": 6.903677034378052, "epoch": 0.2996415003477982, "grad_norm": 1.0546875, "learning_rate": 0.0004995796031695257, "loss": 6.8641, "mean_token_accuracy": 0.10931005999445915, "num_tokens": 6086604.0, "step": 2800 }, { "entropy": 6.90281114578247, "epoch": 0.3001765744555621, "grad_norm": 1.125, "learning_rate": 0.00049957726381897, "loss": 6.8781, "mean_token_accuracy": 0.10950748696923256, "num_tokens": 6095672.0, "step": 2805 }, { "entropy": 6.90290675163269, "epoch": 0.300711648563326, "grad_norm": 1.0, "learning_rate": 0.0004995749179837773, "loss": 6.7498, "mean_token_accuracy": 0.11466853022575378, "num_tokens": 6105652.0, "step": 2810 }, { "entropy": 6.826155042648315, "epoch": 0.30124672267108993, "grad_norm": 0.99609375, "learning_rate": 0.0004995725656640155, "loss": 6.7856, "mean_token_accuracy": 0.11099454537034034, "num_tokens": 6116930.0, "step": 2815 }, { "entropy": 6.844819593429565, "epoch": 0.30178179677885386, "grad_norm": 1.03125, "learning_rate": 0.0004995702068597524, "loss": 6.7894, "mean_token_accuracy": 0.11423054486513137, "num_tokens": 6126659.0, "step": 2820 }, { "entropy": 6.890478515625, "epoch": 0.3023168708866178, "grad_norm": 1.015625, "learning_rate": 0.0004995678415710561, "loss": 6.8288, "mean_token_accuracy": 0.11060848459601402, "num_tokens": 6137227.0, "step": 2825 }, { "entropy": 6.962517929077149, "epoch": 0.3028519449943817, "grad_norm": 0.98046875, "learning_rate": 0.000499565469797995, "loss": 6.8821, "mean_token_accuracy": 0.10931277051568031, "num_tokens": 6147800.0, "step": 2830 }, { "entropy": 6.822924327850342, "epoch": 0.30338701910214566, "grad_norm": 1.0, "learning_rate": 0.0004995630915406374, "loss": 6.7326, "mean_token_accuracy": 0.12161283493041992, "num_tokens": 6157671.0, "step": 2835 }, { "entropy": 6.918770694732666, "epoch": 0.3039220932099096, "grad_norm": 1.0390625, "learning_rate": 0.0004995607067990521, "loss": 6.8698, "mean_token_accuracy": 0.10645673274993897, "num_tokens": 6168651.0, "step": 2840 }, { "entropy": 6.873465251922608, "epoch": 0.30445716731767347, "grad_norm": 1.453125, "learning_rate": 0.000499558315573308, "loss": 6.8487, "mean_token_accuracy": 0.1086043007671833, "num_tokens": 6179925.0, "step": 2845 }, { "entropy": 6.818239831924439, "epoch": 0.3049922414254374, "grad_norm": 1.234375, "learning_rate": 0.0004995559178634741, "loss": 6.8438, "mean_token_accuracy": 0.10887812077999115, "num_tokens": 6190541.0, "step": 2850 }, { "entropy": 7.041949510574341, "epoch": 0.30552731553320134, "grad_norm": 1.0546875, "learning_rate": 0.0004995535136696196, "loss": 6.8866, "mean_token_accuracy": 0.09955592602491378, "num_tokens": 6201491.0, "step": 2855 }, { "entropy": 6.8139080047607425, "epoch": 0.30606238964096527, "grad_norm": 1.0078125, "learning_rate": 0.000499551102991814, "loss": 6.6991, "mean_token_accuracy": 0.11249880269169807, "num_tokens": 6212443.0, "step": 2860 }, { "entropy": 6.817849111557007, "epoch": 0.3065974637487292, "grad_norm": 1.1328125, "learning_rate": 0.0004995486858301268, "loss": 6.8981, "mean_token_accuracy": 0.1030767761170864, "num_tokens": 6222623.0, "step": 2865 }, { "entropy": 6.925403165817261, "epoch": 0.30713253785649314, "grad_norm": 0.9609375, "learning_rate": 0.0004995462621846279, "loss": 6.7852, "mean_token_accuracy": 0.10933116525411606, "num_tokens": 6233712.0, "step": 2870 }, { "entropy": 6.854152202606201, "epoch": 0.30766761196425707, "grad_norm": 1.1171875, "learning_rate": 0.0004995438320553871, "loss": 6.8534, "mean_token_accuracy": 0.10412434935569763, "num_tokens": 6244254.0, "step": 2875 }, { "entropy": 6.823256492614746, "epoch": 0.30820268607202095, "grad_norm": 1.2265625, "learning_rate": 0.0004995413954424748, "loss": 6.7504, "mean_token_accuracy": 0.116096231341362, "num_tokens": 6254202.0, "step": 2880 }, { "entropy": 6.877709770202637, "epoch": 0.3087377601797849, "grad_norm": 1.140625, "learning_rate": 0.0004995389523459612, "loss": 6.8231, "mean_token_accuracy": 0.10538254305720329, "num_tokens": 6264496.0, "step": 2885 }, { "entropy": 6.839356851577759, "epoch": 0.3092728342875488, "grad_norm": 1.078125, "learning_rate": 0.000499536502765917, "loss": 6.828, "mean_token_accuracy": 0.1125398851931095, "num_tokens": 6275835.0, "step": 2890 }, { "entropy": 6.893553924560547, "epoch": 0.30980790839531275, "grad_norm": 1.2421875, "learning_rate": 0.0004995340467024128, "loss": 6.7842, "mean_token_accuracy": 0.10834744572639465, "num_tokens": 6286805.0, "step": 2895 }, { "entropy": 6.906386661529541, "epoch": 0.3103429825030767, "grad_norm": 0.984375, "learning_rate": 0.0004995315841555195, "loss": 6.7916, "mean_token_accuracy": 0.10366136953234673, "num_tokens": 6298444.0, "step": 2900 }, { "entropy": 6.783759641647339, "epoch": 0.3108780566108406, "grad_norm": 1.1015625, "learning_rate": 0.0004995291151253083, "loss": 6.7348, "mean_token_accuracy": 0.11380124613642692, "num_tokens": 6308259.0, "step": 2905 }, { "entropy": 6.846135902404785, "epoch": 0.31141313071860455, "grad_norm": 1.0234375, "learning_rate": 0.0004995266396118505, "loss": 6.8013, "mean_token_accuracy": 0.10161566883325576, "num_tokens": 6320058.0, "step": 2910 }, { "entropy": 6.900366973876953, "epoch": 0.3119482048263684, "grad_norm": 0.9140625, "learning_rate": 0.0004995241576152174, "loss": 6.7723, "mean_token_accuracy": 0.10676236972212791, "num_tokens": 6331203.0, "step": 2915 }, { "entropy": 6.897499227523804, "epoch": 0.31248327893413236, "grad_norm": 1.078125, "learning_rate": 0.000499521669135481, "loss": 6.8882, "mean_token_accuracy": 0.10588050186634064, "num_tokens": 6342027.0, "step": 2920 }, { "entropy": 6.894981956481933, "epoch": 0.3130183530418963, "grad_norm": 1.015625, "learning_rate": 0.0004995191741727128, "loss": 6.7873, "mean_token_accuracy": 0.10809844583272935, "num_tokens": 6352580.0, "step": 2925 }, { "entropy": 6.887385463714599, "epoch": 0.3135534271496602, "grad_norm": 0.94140625, "learning_rate": 0.000499516672726985, "loss": 6.8106, "mean_token_accuracy": 0.11217835023999215, "num_tokens": 6363997.0, "step": 2930 }, { "entropy": 6.83791708946228, "epoch": 0.31408850125742416, "grad_norm": 0.98046875, "learning_rate": 0.0004995141647983699, "loss": 6.8464, "mean_token_accuracy": 0.11019290536642075, "num_tokens": 6375284.0, "step": 2935 }, { "entropy": 6.8710222244262695, "epoch": 0.3146235753651881, "grad_norm": 0.984375, "learning_rate": 0.0004995116503869398, "loss": 6.7437, "mean_token_accuracy": 0.11758178621530532, "num_tokens": 6386698.0, "step": 2940 }, { "entropy": 6.864429473876953, "epoch": 0.315158649472952, "grad_norm": 1.3203125, "learning_rate": 0.0004995091294927673, "loss": 6.818, "mean_token_accuracy": 0.10886727124452591, "num_tokens": 6397237.0, "step": 2945 }, { "entropy": 6.973788785934448, "epoch": 0.3156937235807159, "grad_norm": 1.0, "learning_rate": 0.0004995066021159253, "loss": 6.9364, "mean_token_accuracy": 0.10483678579330444, "num_tokens": 6408266.0, "step": 2950 }, { "entropy": 6.842577266693115, "epoch": 0.31622879768847983, "grad_norm": 1.0546875, "learning_rate": 0.0004995040682564867, "loss": 6.8199, "mean_token_accuracy": 0.11405593305826187, "num_tokens": 6419563.0, "step": 2955 }, { "entropy": 6.8359404563903805, "epoch": 0.31676387179624377, "grad_norm": 1.0078125, "learning_rate": 0.0004995015279145247, "loss": 6.7863, "mean_token_accuracy": 0.11180907115340233, "num_tokens": 6430220.0, "step": 2960 }, { "entropy": 6.857833385467529, "epoch": 0.3172989459040077, "grad_norm": 1.1015625, "learning_rate": 0.0004994989810901126, "loss": 6.7961, "mean_token_accuracy": 0.10685641467571258, "num_tokens": 6440157.0, "step": 2965 }, { "entropy": 6.856301593780517, "epoch": 0.31783402001177163, "grad_norm": 1.1484375, "learning_rate": 0.0004994964277833239, "loss": 6.8463, "mean_token_accuracy": 0.11110184714198112, "num_tokens": 6449511.0, "step": 2970 }, { "entropy": 6.923713493347168, "epoch": 0.31836909411953557, "grad_norm": 0.9765625, "learning_rate": 0.0004994938679942324, "loss": 6.8365, "mean_token_accuracy": 0.10282818749547004, "num_tokens": 6460608.0, "step": 2975 }, { "entropy": 6.919619989395142, "epoch": 0.3189041682272995, "grad_norm": 1.046875, "learning_rate": 0.0004994913017229121, "loss": 6.8372, "mean_token_accuracy": 0.1131968080997467, "num_tokens": 6472737.0, "step": 2980 }, { "entropy": 6.817192554473877, "epoch": 0.31943924233506343, "grad_norm": 1.0703125, "learning_rate": 0.0004994887289694371, "loss": 6.7184, "mean_token_accuracy": 0.11385754495859146, "num_tokens": 6482993.0, "step": 2985 }, { "entropy": 6.960534572601318, "epoch": 0.3199743164428273, "grad_norm": 1.078125, "learning_rate": 0.0004994861497338814, "loss": 6.9207, "mean_token_accuracy": 0.11038238108158112, "num_tokens": 6494530.0, "step": 2990 }, { "entropy": 6.894915056228638, "epoch": 0.32050939055059124, "grad_norm": 1.0703125, "learning_rate": 0.0004994835640163198, "loss": 6.7626, "mean_token_accuracy": 0.10633266866207122, "num_tokens": 6504691.0, "step": 2995 }, { "entropy": 6.885722494125366, "epoch": 0.3210444646583552, "grad_norm": 1.0859375, "learning_rate": 0.0004994809718168267, "loss": 6.7865, "mean_token_accuracy": 0.10957603380084038, "num_tokens": 6514924.0, "step": 3000 }, { "epoch": 0.3210444646583552, "eval_entropy": 6.6982880289021205, "eval_loss": 6.9056596755981445, "eval_mean_token_accuracy": 0.11213191206946045, "eval_num_tokens": 6514924.0, "eval_runtime": 22.6381, "eval_samples_per_second": 1311.022, "eval_steps_per_second": 163.883, "step": 3000 }, { "entropy": 6.774571943283081, "epoch": 0.3215795387661191, "grad_norm": 1.0703125, "learning_rate": 0.0004994783731354771, "loss": 6.7524, "mean_token_accuracy": 0.11166785731911659, "num_tokens": 6526097.0, "step": 3005 }, { "entropy": 6.929418516159058, "epoch": 0.32211461287388304, "grad_norm": 1.0625, "learning_rate": 0.0004994757679723461, "loss": 6.8149, "mean_token_accuracy": 0.10639956593513489, "num_tokens": 6536384.0, "step": 3010 }, { "entropy": 6.919300746917725, "epoch": 0.322649686981647, "grad_norm": 1.0546875, "learning_rate": 0.0004994731563275088, "loss": 6.8694, "mean_token_accuracy": 0.1046457588672638, "num_tokens": 6547161.0, "step": 3015 }, { "entropy": 6.785147857666016, "epoch": 0.3231847610894109, "grad_norm": 1.046875, "learning_rate": 0.0004994705382010406, "loss": 6.7936, "mean_token_accuracy": 0.10720081478357316, "num_tokens": 6556751.0, "step": 3020 }, { "entropy": 6.861992263793946, "epoch": 0.3237198351971748, "grad_norm": 1.109375, "learning_rate": 0.0004994679135930174, "loss": 6.8486, "mean_token_accuracy": 0.1134506493806839, "num_tokens": 6567655.0, "step": 3025 }, { "entropy": 6.987712669372558, "epoch": 0.3242549093049387, "grad_norm": 1.1484375, "learning_rate": 0.0004994652825035144, "loss": 6.8797, "mean_token_accuracy": 0.10770419910550118, "num_tokens": 6579127.0, "step": 3030 }, { "entropy": 6.9072469711303714, "epoch": 0.32478998341270265, "grad_norm": 1.265625, "learning_rate": 0.0004994626449326081, "loss": 6.8376, "mean_token_accuracy": 0.11200311556458473, "num_tokens": 6590779.0, "step": 3035 }, { "entropy": 6.858027362823487, "epoch": 0.3253250575204666, "grad_norm": 1.09375, "learning_rate": 0.0004994600008803745, "loss": 6.7456, "mean_token_accuracy": 0.11969574466347695, "num_tokens": 6600849.0, "step": 3040 }, { "entropy": 6.831806564331055, "epoch": 0.3258601316282305, "grad_norm": 1.09375, "learning_rate": 0.0004994573503468899, "loss": 6.7547, "mean_token_accuracy": 0.11736322343349456, "num_tokens": 6610633.0, "step": 3045 }, { "entropy": 6.787566423416138, "epoch": 0.32639520573599445, "grad_norm": 0.953125, "learning_rate": 0.0004994546933322308, "loss": 6.7953, "mean_token_accuracy": 0.10811478719115257, "num_tokens": 6621327.0, "step": 3050 }, { "entropy": 6.93750228881836, "epoch": 0.3269302798437584, "grad_norm": 0.984375, "learning_rate": 0.000499452029836474, "loss": 6.7415, "mean_token_accuracy": 0.11278096809983254, "num_tokens": 6632267.0, "step": 3055 }, { "entropy": 6.810693454742432, "epoch": 0.32746535395152226, "grad_norm": 1.1796875, "learning_rate": 0.0004994493598596963, "loss": 6.7705, "mean_token_accuracy": 0.10761533975601197, "num_tokens": 6642714.0, "step": 3060 }, { "entropy": 6.849345254898071, "epoch": 0.3280004280592862, "grad_norm": 1.078125, "learning_rate": 0.0004994466834019749, "loss": 6.7758, "mean_token_accuracy": 0.11640546843409538, "num_tokens": 6652353.0, "step": 3065 }, { "entropy": 6.842514944076538, "epoch": 0.32853550216705013, "grad_norm": 1.0859375, "learning_rate": 0.0004994440004633871, "loss": 6.7517, "mean_token_accuracy": 0.11130421757698059, "num_tokens": 6663133.0, "step": 3070 }, { "entropy": 6.801913261413574, "epoch": 0.32907057627481406, "grad_norm": 1.1953125, "learning_rate": 0.0004994413110440103, "loss": 6.7354, "mean_token_accuracy": 0.11714180111885071, "num_tokens": 6673984.0, "step": 3075 }, { "entropy": 6.8637457370758055, "epoch": 0.329605650382578, "grad_norm": 0.875, "learning_rate": 0.0004994386151439222, "loss": 6.8076, "mean_token_accuracy": 0.1080280676484108, "num_tokens": 6686171.0, "step": 3080 }, { "entropy": 6.933955192565918, "epoch": 0.33014072449034193, "grad_norm": 1.109375, "learning_rate": 0.0004994359127632006, "loss": 6.8475, "mean_token_accuracy": 0.10514529719948769, "num_tokens": 6696609.0, "step": 3085 }, { "entropy": 6.89633002281189, "epoch": 0.33067579859810586, "grad_norm": 1.1875, "learning_rate": 0.0004994332039019235, "loss": 6.7854, "mean_token_accuracy": 0.11049062609672547, "num_tokens": 6706188.0, "step": 3090 }, { "entropy": 6.708978939056396, "epoch": 0.33121087270586974, "grad_norm": 1.125, "learning_rate": 0.0004994304885601694, "loss": 6.7667, "mean_token_accuracy": 0.11125922203063965, "num_tokens": 6716276.0, "step": 3095 }, { "entropy": 6.774325132369995, "epoch": 0.3317459468136337, "grad_norm": 1.2890625, "learning_rate": 0.0004994277667380162, "loss": 6.737, "mean_token_accuracy": 0.1192335270345211, "num_tokens": 6727176.0, "step": 3100 }, { "entropy": 6.887723302841186, "epoch": 0.3322810209213976, "grad_norm": 1.1171875, "learning_rate": 0.0004994250384355429, "loss": 6.8119, "mean_token_accuracy": 0.11386096626520156, "num_tokens": 6737768.0, "step": 3105 }, { "entropy": 6.840688323974609, "epoch": 0.33281609502916154, "grad_norm": 6.46875, "learning_rate": 0.0004994223036528282, "loss": 6.7618, "mean_token_accuracy": 0.11079908534884453, "num_tokens": 6747962.0, "step": 3110 }, { "entropy": 6.8406102657318115, "epoch": 0.3333511691369255, "grad_norm": 1.1171875, "learning_rate": 0.000499419562389951, "loss": 6.7548, "mean_token_accuracy": 0.1147709958255291, "num_tokens": 6758400.0, "step": 3115 }, { "entropy": 6.851141119003296, "epoch": 0.3338862432446894, "grad_norm": 1.0390625, "learning_rate": 0.0004994168146469904, "loss": 6.7693, "mean_token_accuracy": 0.11088330820202827, "num_tokens": 6768855.0, "step": 3120 }, { "entropy": 6.863172101974487, "epoch": 0.33442131735245334, "grad_norm": 1.0234375, "learning_rate": 0.0004994140604240259, "loss": 6.7514, "mean_token_accuracy": 0.1078583225607872, "num_tokens": 6778656.0, "step": 3125 }, { "entropy": 6.882100915908813, "epoch": 0.3349563914602172, "grad_norm": 0.98046875, "learning_rate": 0.0004994112997211369, "loss": 6.8182, "mean_token_accuracy": 0.11499066054821014, "num_tokens": 6789960.0, "step": 3130 }, { "entropy": 6.730247640609742, "epoch": 0.33549146556798115, "grad_norm": 1.1875, "learning_rate": 0.0004994085325384031, "loss": 6.8076, "mean_token_accuracy": 0.10851202681660652, "num_tokens": 6800188.0, "step": 3135 }, { "entropy": 6.906764650344849, "epoch": 0.3360265396757451, "grad_norm": 1.0546875, "learning_rate": 0.0004994057588759045, "loss": 6.7393, "mean_token_accuracy": 0.11358117088675498, "num_tokens": 6811032.0, "step": 3140 }, { "entropy": 6.824139022827149, "epoch": 0.336561613783509, "grad_norm": 1.0625, "learning_rate": 0.0004994029787337212, "loss": 6.7666, "mean_token_accuracy": 0.10829171538352966, "num_tokens": 6823060.0, "step": 3145 }, { "entropy": 6.8112482070922855, "epoch": 0.33709668789127295, "grad_norm": 1.0703125, "learning_rate": 0.0004994001921119333, "loss": 6.8496, "mean_token_accuracy": 0.10913093164563178, "num_tokens": 6833559.0, "step": 3150 }, { "entropy": 6.894295167922974, "epoch": 0.3376317619990369, "grad_norm": 1.1171875, "learning_rate": 0.0004993973990106215, "loss": 6.7974, "mean_token_accuracy": 0.11234046593308449, "num_tokens": 6843657.0, "step": 3155 }, { "entropy": 6.814738702774048, "epoch": 0.3381668361068008, "grad_norm": 1.1171875, "learning_rate": 0.0004993945994298662, "loss": 6.7267, "mean_token_accuracy": 0.10636094883084297, "num_tokens": 6853615.0, "step": 3160 }, { "entropy": 6.858942174911499, "epoch": 0.3387019102145647, "grad_norm": 1.03125, "learning_rate": 0.0004993917933697484, "loss": 6.8354, "mean_token_accuracy": 0.10942788496613502, "num_tokens": 6865256.0, "step": 3165 }, { "entropy": 7.015973472595215, "epoch": 0.3392369843223286, "grad_norm": 1.1171875, "learning_rate": 0.0004993889808303493, "loss": 6.8711, "mean_token_accuracy": 0.11036419197916984, "num_tokens": 6875358.0, "step": 3170 }, { "entropy": 6.757581901550293, "epoch": 0.33977205843009256, "grad_norm": 1.015625, "learning_rate": 0.0004993861618117498, "loss": 6.7711, "mean_token_accuracy": 0.1102716788649559, "num_tokens": 6886584.0, "step": 3175 }, { "entropy": 6.8233020305633545, "epoch": 0.3403071325378565, "grad_norm": 1.0546875, "learning_rate": 0.0004993833363140314, "loss": 6.7109, "mean_token_accuracy": 0.11896613985300064, "num_tokens": 6896958.0, "step": 3180 }, { "entropy": 6.830180215835571, "epoch": 0.3408422066456204, "grad_norm": 1.03125, "learning_rate": 0.0004993805043372756, "loss": 6.775, "mean_token_accuracy": 0.1163598895072937, "num_tokens": 6907944.0, "step": 3185 }, { "entropy": 6.831008625030518, "epoch": 0.34137728075338436, "grad_norm": 1.0078125, "learning_rate": 0.0004993776658815644, "loss": 6.8739, "mean_token_accuracy": 0.1049034409224987, "num_tokens": 6919486.0, "step": 3190 }, { "entropy": 6.957132577896118, "epoch": 0.3419123548611483, "grad_norm": 1.2578125, "learning_rate": 0.0004993748209469796, "loss": 6.8414, "mean_token_accuracy": 0.11248302012681961, "num_tokens": 6930650.0, "step": 3195 }, { "entropy": 6.833132362365722, "epoch": 0.34244742896891217, "grad_norm": 1.015625, "learning_rate": 0.0004993719695336033, "loss": 6.7926, "mean_token_accuracy": 0.11160960346460343, "num_tokens": 6941519.0, "step": 3200 }, { "entropy": 6.775629329681396, "epoch": 0.3429825030766761, "grad_norm": 1.5078125, "learning_rate": 0.0004993691116415179, "loss": 6.8265, "mean_token_accuracy": 0.10980288833379745, "num_tokens": 6952952.0, "step": 3205 }, { "entropy": 6.945135641098022, "epoch": 0.34351757718444004, "grad_norm": 1.0078125, "learning_rate": 0.000499366247270806, "loss": 6.7907, "mean_token_accuracy": 0.11398276537656785, "num_tokens": 6962867.0, "step": 3210 }, { "entropy": 6.850128173828125, "epoch": 0.34405265129220397, "grad_norm": 1.0546875, "learning_rate": 0.0004993633764215502, "loss": 6.7128, "mean_token_accuracy": 0.1149346224963665, "num_tokens": 6973434.0, "step": 3215 }, { "entropy": 6.805971765518189, "epoch": 0.3445877253999679, "grad_norm": 1.125, "learning_rate": 0.0004993604990938336, "loss": 6.7242, "mean_token_accuracy": 0.12372536882758141, "num_tokens": 6984161.0, "step": 3220 }, { "entropy": 6.831466388702393, "epoch": 0.34512279950773184, "grad_norm": 1.078125, "learning_rate": 0.0004993576152877389, "loss": 6.7023, "mean_token_accuracy": 0.11155548840761184, "num_tokens": 6994700.0, "step": 3225 }, { "entropy": 6.859937858581543, "epoch": 0.34565787361549577, "grad_norm": 1.0859375, "learning_rate": 0.0004993547250033496, "loss": 6.8702, "mean_token_accuracy": 0.10222596898674965, "num_tokens": 7006497.0, "step": 3230 }, { "entropy": 6.907996559143067, "epoch": 0.34619294772325965, "grad_norm": 1.0703125, "learning_rate": 0.0004993518282407493, "loss": 6.7762, "mean_token_accuracy": 0.11640164703130722, "num_tokens": 7016415.0, "step": 3235 }, { "entropy": 6.780554246902466, "epoch": 0.3467280218310236, "grad_norm": 1.2109375, "learning_rate": 0.0004993489250000213, "loss": 6.7293, "mean_token_accuracy": 0.11351820677518845, "num_tokens": 7026610.0, "step": 3240 }, { "entropy": 6.797022676467895, "epoch": 0.3472630959387875, "grad_norm": 1.0390625, "learning_rate": 0.0004993460152812497, "loss": 6.7409, "mean_token_accuracy": 0.11043249741196633, "num_tokens": 7038236.0, "step": 3245 }, { "entropy": 6.871045017242432, "epoch": 0.34779817004655145, "grad_norm": 1.140625, "learning_rate": 0.0004993430990845184, "loss": 6.7892, "mean_token_accuracy": 0.12099697217345237, "num_tokens": 7049438.0, "step": 3250 }, { "entropy": 6.795158195495605, "epoch": 0.3483332441543154, "grad_norm": 1.0859375, "learning_rate": 0.0004993401764099118, "loss": 6.75, "mean_token_accuracy": 0.10678878873586654, "num_tokens": 7061001.0, "step": 3255 }, { "entropy": 6.869133567810058, "epoch": 0.3488683182620793, "grad_norm": 1.09375, "learning_rate": 0.0004993372472575139, "loss": 6.7464, "mean_token_accuracy": 0.11511967554688454, "num_tokens": 7071328.0, "step": 3260 }, { "entropy": 6.9016501903533936, "epoch": 0.34940339236984325, "grad_norm": 1.140625, "learning_rate": 0.0004993343116274096, "loss": 6.93, "mean_token_accuracy": 0.10523641705513001, "num_tokens": 7082597.0, "step": 3265 }, { "entropy": 6.860869073867798, "epoch": 0.3499384664776071, "grad_norm": 1.0390625, "learning_rate": 0.0004993313695196836, "loss": 6.759, "mean_token_accuracy": 0.116279286891222, "num_tokens": 7093463.0, "step": 3270 }, { "entropy": 6.816839218139648, "epoch": 0.35047354058537106, "grad_norm": 0.984375, "learning_rate": 0.0004993284209344208, "loss": 6.8225, "mean_token_accuracy": 0.11397869065403939, "num_tokens": 7104350.0, "step": 3275 }, { "entropy": 6.929663181304932, "epoch": 0.351008614693135, "grad_norm": 1.2265625, "learning_rate": 0.0004993254658717065, "loss": 6.78, "mean_token_accuracy": 0.11524501666426659, "num_tokens": 7114851.0, "step": 3280 }, { "entropy": 6.865924549102783, "epoch": 0.3515436888008989, "grad_norm": 1.078125, "learning_rate": 0.0004993225043316257, "loss": 6.8189, "mean_token_accuracy": 0.10788183063268661, "num_tokens": 7126440.0, "step": 3285 }, { "entropy": 6.94174747467041, "epoch": 0.35207876290866286, "grad_norm": 1.125, "learning_rate": 0.0004993195363142643, "loss": 6.8435, "mean_token_accuracy": 0.10635844394564628, "num_tokens": 7137884.0, "step": 3290 }, { "entropy": 6.8471081256866455, "epoch": 0.3526138370164268, "grad_norm": 1.2265625, "learning_rate": 0.0004993165618197076, "loss": 6.8169, "mean_token_accuracy": 0.10543133914470673, "num_tokens": 7147930.0, "step": 3295 }, { "entropy": 6.814928293228149, "epoch": 0.3531489111241907, "grad_norm": 1.0078125, "learning_rate": 0.0004993135808480418, "loss": 6.6758, "mean_token_accuracy": 0.12192264795303345, "num_tokens": 7159200.0, "step": 3300 }, { "entropy": 6.856072282791137, "epoch": 0.3536839852319546, "grad_norm": 1.0625, "learning_rate": 0.0004993105933993529, "loss": 6.7738, "mean_token_accuracy": 0.11219395026564598, "num_tokens": 7169601.0, "step": 3305 }, { "entropy": 6.731938648223877, "epoch": 0.35421905933971853, "grad_norm": 1.0546875, "learning_rate": 0.0004993075994737271, "loss": 6.7014, "mean_token_accuracy": 0.12335732132196427, "num_tokens": 7180465.0, "step": 3310 }, { "entropy": 6.827739572525024, "epoch": 0.35475413344748247, "grad_norm": 1.0625, "learning_rate": 0.0004993045990712508, "loss": 6.7214, "mean_token_accuracy": 0.1124566912651062, "num_tokens": 7190603.0, "step": 3315 }, { "entropy": 6.744693279266357, "epoch": 0.3552892075552464, "grad_norm": 1.015625, "learning_rate": 0.0004993015921920109, "loss": 6.6822, "mean_token_accuracy": 0.1178012415766716, "num_tokens": 7201017.0, "step": 3320 }, { "entropy": 6.700474643707276, "epoch": 0.35582428166301033, "grad_norm": 1.109375, "learning_rate": 0.000499298578836094, "loss": 6.6851, "mean_token_accuracy": 0.11364478841423989, "num_tokens": 7210908.0, "step": 3325 }, { "entropy": 6.913705682754516, "epoch": 0.35635935577077427, "grad_norm": 1.078125, "learning_rate": 0.000499295559003587, "loss": 6.7313, "mean_token_accuracy": 0.11469347327947617, "num_tokens": 7221306.0, "step": 3330 }, { "entropy": 6.857224035263061, "epoch": 0.3568944298785382, "grad_norm": 0.984375, "learning_rate": 0.0004992925326945774, "loss": 6.8446, "mean_token_accuracy": 0.11008940190076828, "num_tokens": 7233076.0, "step": 3335 }, { "entropy": 6.836943006515503, "epoch": 0.3574295039863021, "grad_norm": 1.1875, "learning_rate": 0.0004992894999091524, "loss": 6.833, "mean_token_accuracy": 0.11023118868470191, "num_tokens": 7244703.0, "step": 3340 }, { "entropy": 6.865760707855225, "epoch": 0.357964578094066, "grad_norm": 1.0546875, "learning_rate": 0.0004992864606473996, "loss": 6.8127, "mean_token_accuracy": 0.10562887638807297, "num_tokens": 7255438.0, "step": 3345 }, { "entropy": 6.873836708068848, "epoch": 0.35849965220182994, "grad_norm": 1.1171875, "learning_rate": 0.0004992834149094069, "loss": 6.7746, "mean_token_accuracy": 0.10823791846632957, "num_tokens": 7265720.0, "step": 3350 }, { "entropy": 6.854056453704834, "epoch": 0.3590347263095939, "grad_norm": 1.0625, "learning_rate": 0.0004992803626952619, "loss": 6.8105, "mean_token_accuracy": 0.10965728536248207, "num_tokens": 7277791.0, "step": 3355 }, { "entropy": 6.743177652359009, "epoch": 0.3595698004173578, "grad_norm": 1.0625, "learning_rate": 0.000499277304005053, "loss": 6.6904, "mean_token_accuracy": 0.11896344646811485, "num_tokens": 7288521.0, "step": 3360 }, { "entropy": 6.8449372291564945, "epoch": 0.36010487452512174, "grad_norm": 1.03125, "learning_rate": 0.0004992742388388686, "loss": 6.8681, "mean_token_accuracy": 0.10312251970171929, "num_tokens": 7299298.0, "step": 3365 }, { "entropy": 6.848871850967408, "epoch": 0.3606399486328857, "grad_norm": 1.0390625, "learning_rate": 0.0004992711671967968, "loss": 6.6907, "mean_token_accuracy": 0.11500442028045654, "num_tokens": 7310271.0, "step": 3370 }, { "entropy": 6.832868242263794, "epoch": 0.36117502274064955, "grad_norm": 1.046875, "learning_rate": 0.0004992680890789268, "loss": 6.7535, "mean_token_accuracy": 0.11115506291389465, "num_tokens": 7321112.0, "step": 3375 }, { "entropy": 6.744096136093139, "epoch": 0.3617100968484135, "grad_norm": 1.125, "learning_rate": 0.0004992650044853471, "loss": 6.7111, "mean_token_accuracy": 0.11423057690262794, "num_tokens": 7331976.0, "step": 3380 }, { "entropy": 6.881365203857422, "epoch": 0.3622451709561774, "grad_norm": 1.15625, "learning_rate": 0.000499261913416147, "loss": 6.8157, "mean_token_accuracy": 0.11083743125200271, "num_tokens": 7342800.0, "step": 3385 }, { "entropy": 6.820743465423584, "epoch": 0.36278024506394135, "grad_norm": 0.98046875, "learning_rate": 0.0004992588158714157, "loss": 6.6508, "mean_token_accuracy": 0.11105694174766541, "num_tokens": 7354213.0, "step": 3390 }, { "entropy": 6.789371490478516, "epoch": 0.3633153191717053, "grad_norm": 1.1328125, "learning_rate": 0.0004992557118512424, "loss": 6.7069, "mean_token_accuracy": 0.11869031190872192, "num_tokens": 7363250.0, "step": 3395 }, { "entropy": 6.7624798774719235, "epoch": 0.3638503932794692, "grad_norm": 1.078125, "learning_rate": 0.0004992526013557171, "loss": 6.7605, "mean_token_accuracy": 0.11203641667962075, "num_tokens": 7374185.0, "step": 3400 }, { "entropy": 6.752663087844849, "epoch": 0.36438546738723315, "grad_norm": 1.0703125, "learning_rate": 0.0004992494843849294, "loss": 6.7287, "mean_token_accuracy": 0.10924962237477302, "num_tokens": 7384579.0, "step": 3405 }, { "entropy": 6.896695327758789, "epoch": 0.36492054149499703, "grad_norm": 1.1171875, "learning_rate": 0.0004992463609389694, "loss": 6.7422, "mean_token_accuracy": 0.10970545783638955, "num_tokens": 7395277.0, "step": 3410 }, { "entropy": 6.726968002319336, "epoch": 0.36545561560276096, "grad_norm": 1.0078125, "learning_rate": 0.0004992432310179272, "loss": 6.7332, "mean_token_accuracy": 0.1160312682390213, "num_tokens": 7406688.0, "step": 3415 }, { "entropy": 6.766181993484497, "epoch": 0.3659906897105249, "grad_norm": 0.99609375, "learning_rate": 0.0004992400946218932, "loss": 6.795, "mean_token_accuracy": 0.11444359049201011, "num_tokens": 7417378.0, "step": 3420 }, { "entropy": 6.967504692077637, "epoch": 0.36652576381828883, "grad_norm": 1.046875, "learning_rate": 0.0004992369517509581, "loss": 6.8179, "mean_token_accuracy": 0.1145808644592762, "num_tokens": 7427675.0, "step": 3425 }, { "entropy": 6.834393882751465, "epoch": 0.36706083792605276, "grad_norm": 1.0625, "learning_rate": 0.0004992338024052123, "loss": 6.8405, "mean_token_accuracy": 0.10944146141409875, "num_tokens": 7438083.0, "step": 3430 }, { "entropy": 6.772138452529907, "epoch": 0.3675959120338167, "grad_norm": 1.0859375, "learning_rate": 0.0004992306465847473, "loss": 6.6866, "mean_token_accuracy": 0.11544951871037483, "num_tokens": 7449051.0, "step": 3435 }, { "entropy": 6.803123044967651, "epoch": 0.36813098614158063, "grad_norm": 1.03125, "learning_rate": 0.0004992274842896536, "loss": 6.7313, "mean_token_accuracy": 0.11575418040156364, "num_tokens": 7459074.0, "step": 3440 }, { "entropy": 6.810998582839966, "epoch": 0.3686660602493445, "grad_norm": 1.0625, "learning_rate": 0.0004992243155200229, "loss": 6.7908, "mean_token_accuracy": 0.11545799896121026, "num_tokens": 7470472.0, "step": 3445 }, { "entropy": 6.810088348388672, "epoch": 0.36920113435710844, "grad_norm": 1.0, "learning_rate": 0.0004992211402759466, "loss": 6.7589, "mean_token_accuracy": 0.11591348797082901, "num_tokens": 7481477.0, "step": 3450 }, { "entropy": 6.811910390853882, "epoch": 0.3697362084648724, "grad_norm": 1.0390625, "learning_rate": 0.0004992179585575164, "loss": 6.7166, "mean_token_accuracy": 0.11710453182458877, "num_tokens": 7491906.0, "step": 3455 }, { "entropy": 6.801189374923706, "epoch": 0.3702712825726363, "grad_norm": 1.1328125, "learning_rate": 0.000499214770364824, "loss": 6.6567, "mean_token_accuracy": 0.10969180539250374, "num_tokens": 7502447.0, "step": 3460 }, { "entropy": 6.731618452072143, "epoch": 0.37080635668040024, "grad_norm": 1.1328125, "learning_rate": 0.0004992115756979617, "loss": 6.6488, "mean_token_accuracy": 0.12150704562664032, "num_tokens": 7513505.0, "step": 3465 }, { "entropy": 6.763904094696045, "epoch": 0.3713414307881642, "grad_norm": 1.0390625, "learning_rate": 0.0004992083745570218, "loss": 6.6731, "mean_token_accuracy": 0.11672577038407325, "num_tokens": 7524884.0, "step": 3470 }, { "entropy": 6.764589834213257, "epoch": 0.3718765048959281, "grad_norm": 1.078125, "learning_rate": 0.0004992051669420964, "loss": 6.7534, "mean_token_accuracy": 0.11659367606043816, "num_tokens": 7535942.0, "step": 3475 }, { "entropy": 6.77218713760376, "epoch": 0.372411579003692, "grad_norm": 1.0859375, "learning_rate": 0.0004992019528532785, "loss": 6.7354, "mean_token_accuracy": 0.12092937007546425, "num_tokens": 7545506.0, "step": 3480 }, { "entropy": 6.874322080612183, "epoch": 0.3729466531114559, "grad_norm": 1.25, "learning_rate": 0.0004991987322906605, "loss": 6.801, "mean_token_accuracy": 0.10959522724151612, "num_tokens": 7555328.0, "step": 3485 }, { "entropy": 6.811362361907959, "epoch": 0.37348172721921985, "grad_norm": 1.1640625, "learning_rate": 0.0004991955052543357, "loss": 6.6899, "mean_token_accuracy": 0.1134427696466446, "num_tokens": 7565762.0, "step": 3490 }, { "entropy": 6.830954933166504, "epoch": 0.3740168013269838, "grad_norm": 1.09375, "learning_rate": 0.0004991922717443972, "loss": 6.7216, "mean_token_accuracy": 0.12056689336895943, "num_tokens": 7575884.0, "step": 3495 }, { "entropy": 6.742701625823974, "epoch": 0.3745518754347477, "grad_norm": 1.046875, "learning_rate": 0.0004991890317609384, "loss": 6.7499, "mean_token_accuracy": 0.11369063630700112, "num_tokens": 7586100.0, "step": 3500 }, { "entropy": 6.859546327590943, "epoch": 0.37508694954251165, "grad_norm": 1.171875, "learning_rate": 0.0004991857853040528, "loss": 6.7591, "mean_token_accuracy": 0.11486376821994781, "num_tokens": 7597137.0, "step": 3505 }, { "entropy": 6.82744083404541, "epoch": 0.3756220236502756, "grad_norm": 1.0703125, "learning_rate": 0.0004991825323738341, "loss": 6.7932, "mean_token_accuracy": 0.11721144542098046, "num_tokens": 7607640.0, "step": 3510 }, { "entropy": 6.840407514572144, "epoch": 0.3761570977580395, "grad_norm": 1.1953125, "learning_rate": 0.0004991792729703763, "loss": 6.851, "mean_token_accuracy": 0.1160910353064537, "num_tokens": 7618319.0, "step": 3515 }, { "entropy": 6.877895498275757, "epoch": 0.3766921718658034, "grad_norm": 1.046875, "learning_rate": 0.0004991760070937734, "loss": 6.7208, "mean_token_accuracy": 0.11491079404950141, "num_tokens": 7628350.0, "step": 3520 }, { "entropy": 6.842350673675537, "epoch": 0.3772272459735673, "grad_norm": 1.203125, "learning_rate": 0.0004991727347441199, "loss": 6.7361, "mean_token_accuracy": 0.11011843830347061, "num_tokens": 7637857.0, "step": 3525 }, { "entropy": 6.858046007156372, "epoch": 0.37776232008133126, "grad_norm": 1.125, "learning_rate": 0.0004991694559215102, "loss": 6.7602, "mean_token_accuracy": 0.11095951348543168, "num_tokens": 7648242.0, "step": 3530 }, { "entropy": 6.830993270874023, "epoch": 0.3782973941890952, "grad_norm": 0.9453125, "learning_rate": 0.000499166170626039, "loss": 6.7743, "mean_token_accuracy": 0.10925297141075134, "num_tokens": 7660565.0, "step": 3535 }, { "entropy": 6.797787475585937, "epoch": 0.3788324682968591, "grad_norm": 1.21875, "learning_rate": 0.000499162878857801, "loss": 6.7711, "mean_token_accuracy": 0.1141252376139164, "num_tokens": 7671600.0, "step": 3540 }, { "entropy": 6.854355716705323, "epoch": 0.37936754240462306, "grad_norm": 1.03125, "learning_rate": 0.0004991595806168915, "loss": 6.7761, "mean_token_accuracy": 0.10867656469345092, "num_tokens": 7682453.0, "step": 3545 }, { "entropy": 6.801757192611694, "epoch": 0.379902616512387, "grad_norm": 1.0, "learning_rate": 0.0004991562759034055, "loss": 6.7221, "mean_token_accuracy": 0.11367509812116623, "num_tokens": 7693490.0, "step": 3550 }, { "entropy": 6.828986072540284, "epoch": 0.38043769062015087, "grad_norm": 1.0859375, "learning_rate": 0.0004991529647174386, "loss": 6.6761, "mean_token_accuracy": 0.1118717484176159, "num_tokens": 7703478.0, "step": 3555 }, { "entropy": 6.7392528533935545, "epoch": 0.3809727647279148, "grad_norm": 1.0859375, "learning_rate": 0.0004991496470590864, "loss": 6.7761, "mean_token_accuracy": 0.1103611208498478, "num_tokens": 7714647.0, "step": 3560 }, { "entropy": 6.863647413253784, "epoch": 0.38150783883567874, "grad_norm": 1.1015625, "learning_rate": 0.0004991463229284445, "loss": 6.7173, "mean_token_accuracy": 0.11717814281582832, "num_tokens": 7725528.0, "step": 3565 }, { "entropy": 6.771598768234253, "epoch": 0.38204291294344267, "grad_norm": 1.109375, "learning_rate": 0.0004991429923256091, "loss": 6.7756, "mean_token_accuracy": 0.11080185323953629, "num_tokens": 7737708.0, "step": 3570 }, { "entropy": 6.878248071670532, "epoch": 0.3825779870512066, "grad_norm": 1.015625, "learning_rate": 0.0004991396552506762, "loss": 6.764, "mean_token_accuracy": 0.11186526715755463, "num_tokens": 7749093.0, "step": 3575 }, { "entropy": 6.7422984600067135, "epoch": 0.38311306115897054, "grad_norm": 1.0546875, "learning_rate": 0.0004991363117037423, "loss": 6.7004, "mean_token_accuracy": 0.11901898533105851, "num_tokens": 7760024.0, "step": 3580 }, { "entropy": 6.767995119094849, "epoch": 0.38364813526673447, "grad_norm": 1.03125, "learning_rate": 0.0004991329616849039, "loss": 6.7284, "mean_token_accuracy": 0.11957356333732605, "num_tokens": 7770801.0, "step": 3585 }, { "entropy": 6.866620016098023, "epoch": 0.38418320937449835, "grad_norm": 1.046875, "learning_rate": 0.0004991296051942578, "loss": 6.7847, "mean_token_accuracy": 0.1116973415017128, "num_tokens": 7782257.0, "step": 3590 }, { "entropy": 6.763524389266967, "epoch": 0.3847182834822623, "grad_norm": 1.015625, "learning_rate": 0.0004991262422319008, "loss": 6.7091, "mean_token_accuracy": 0.11752377822995186, "num_tokens": 7793016.0, "step": 3595 }, { "entropy": 6.7549824714660645, "epoch": 0.3852533575900262, "grad_norm": 1.25, "learning_rate": 0.00049912287279793, "loss": 6.6492, "mean_token_accuracy": 0.1228921391069889, "num_tokens": 7802207.0, "step": 3600 }, { "entropy": 6.812817192077636, "epoch": 0.38578843169779015, "grad_norm": 1.171875, "learning_rate": 0.0004991194968924429, "loss": 6.7834, "mean_token_accuracy": 0.11178419142961502, "num_tokens": 7813487.0, "step": 3605 }, { "entropy": 6.858286571502686, "epoch": 0.3863235058055541, "grad_norm": 1.109375, "learning_rate": 0.0004991161145155367, "loss": 6.7563, "mean_token_accuracy": 0.11035445258021355, "num_tokens": 7824587.0, "step": 3610 }, { "entropy": 6.882280063629151, "epoch": 0.386858579913318, "grad_norm": 1.0625, "learning_rate": 0.0004991127256673091, "loss": 6.7368, "mean_token_accuracy": 0.11012360826134682, "num_tokens": 7836240.0, "step": 3615 }, { "entropy": 6.753285121917725, "epoch": 0.38739365402108195, "grad_norm": 1.15625, "learning_rate": 0.0004991093303478582, "loss": 6.6861, "mean_token_accuracy": 0.11604151576757431, "num_tokens": 7847014.0, "step": 3620 }, { "entropy": 6.788820505142212, "epoch": 0.3879287281288458, "grad_norm": 1.046875, "learning_rate": 0.0004991059285572818, "loss": 6.807, "mean_token_accuracy": 0.11351005062460899, "num_tokens": 7857899.0, "step": 3625 }, { "entropy": 6.857131767272949, "epoch": 0.38846380223660976, "grad_norm": 1.0234375, "learning_rate": 0.0004991025202956781, "loss": 6.6902, "mean_token_accuracy": 0.11639388576149941, "num_tokens": 7868987.0, "step": 3630 }, { "entropy": 6.850029611587525, "epoch": 0.3889988763443737, "grad_norm": 1.1875, "learning_rate": 0.0004990991055631457, "loss": 6.81, "mean_token_accuracy": 0.11189388036727906, "num_tokens": 7879547.0, "step": 3635 }, { "entropy": 6.762338304519654, "epoch": 0.3895339504521376, "grad_norm": 1.0625, "learning_rate": 0.0004990956843597832, "loss": 6.6763, "mean_token_accuracy": 0.1170013889670372, "num_tokens": 7889824.0, "step": 3640 }, { "entropy": 6.673375177383423, "epoch": 0.39006902455990156, "grad_norm": 1.1015625, "learning_rate": 0.0004990922566856892, "loss": 6.669, "mean_token_accuracy": 0.11331403329968452, "num_tokens": 7901156.0, "step": 3645 }, { "entropy": 6.770735454559326, "epoch": 0.3906040986676655, "grad_norm": 1.296875, "learning_rate": 0.0004990888225409629, "loss": 6.7076, "mean_token_accuracy": 0.11252901628613472, "num_tokens": 7911695.0, "step": 3650 }, { "entropy": 6.755655097961426, "epoch": 0.3911391727754294, "grad_norm": 0.984375, "learning_rate": 0.0004990853819257033, "loss": 6.7026, "mean_token_accuracy": 0.11720905601978301, "num_tokens": 7923559.0, "step": 3655 }, { "entropy": 6.84619779586792, "epoch": 0.3916742468831933, "grad_norm": 1.09375, "learning_rate": 0.0004990819348400097, "loss": 6.7214, "mean_token_accuracy": 0.11208191886544228, "num_tokens": 7935792.0, "step": 3660 }, { "entropy": 6.793423795700074, "epoch": 0.39220932099095723, "grad_norm": 1.359375, "learning_rate": 0.0004990784812839818, "loss": 6.7092, "mean_token_accuracy": 0.1186470128595829, "num_tokens": 7946987.0, "step": 3665 }, { "entropy": 6.699849939346313, "epoch": 0.39274439509872117, "grad_norm": 1.125, "learning_rate": 0.0004990750212577192, "loss": 6.6369, "mean_token_accuracy": 0.12066235840320587, "num_tokens": 7957160.0, "step": 3670 }, { "entropy": 6.781460571289062, "epoch": 0.3932794692064851, "grad_norm": 1.09375, "learning_rate": 0.0004990715547613219, "loss": 6.7333, "mean_token_accuracy": 0.10956480428576469, "num_tokens": 7968833.0, "step": 3675 }, { "entropy": 6.873096227645874, "epoch": 0.39381454331424903, "grad_norm": 0.9921875, "learning_rate": 0.0004990680817948898, "loss": 6.7822, "mean_token_accuracy": 0.10927629321813584, "num_tokens": 7980661.0, "step": 3680 }, { "entropy": 6.861059999465942, "epoch": 0.39434961742201297, "grad_norm": 1.1171875, "learning_rate": 0.0004990646023585234, "loss": 6.7065, "mean_token_accuracy": 0.11303527727723121, "num_tokens": 7992677.0, "step": 3685 }, { "entropy": 6.700655746459961, "epoch": 0.3948846915297769, "grad_norm": 1.125, "learning_rate": 0.0004990611164523231, "loss": 6.6919, "mean_token_accuracy": 0.1178669311106205, "num_tokens": 8002796.0, "step": 3690 }, { "entropy": 6.6995728492736815, "epoch": 0.3954197656375408, "grad_norm": 1.171875, "learning_rate": 0.0004990576240763896, "loss": 6.7181, "mean_token_accuracy": 0.11917829737067223, "num_tokens": 8012779.0, "step": 3695 }, { "entropy": 6.79206166267395, "epoch": 0.3959548397453047, "grad_norm": 1.015625, "learning_rate": 0.0004990541252308237, "loss": 6.6986, "mean_token_accuracy": 0.11830845102667809, "num_tokens": 8023442.0, "step": 3700 }, { "entropy": 6.777542209625244, "epoch": 0.39648991385306864, "grad_norm": 1.109375, "learning_rate": 0.0004990506199157263, "loss": 6.7844, "mean_token_accuracy": 0.11193263530731201, "num_tokens": 8035163.0, "step": 3705 }, { "entropy": 6.826216363906861, "epoch": 0.3970249879608326, "grad_norm": 1.1484375, "learning_rate": 0.0004990471081311988, "loss": 6.7221, "mean_token_accuracy": 0.11202551424503326, "num_tokens": 8045330.0, "step": 3710 }, { "entropy": 6.826126527786255, "epoch": 0.3975600620685965, "grad_norm": 0.9921875, "learning_rate": 0.0004990435898773426, "loss": 6.7341, "mean_token_accuracy": 0.11674164608120918, "num_tokens": 8056154.0, "step": 3715 }, { "entropy": 6.795881938934326, "epoch": 0.39809513617636044, "grad_norm": 1.015625, "learning_rate": 0.0004990400651542592, "loss": 6.6916, "mean_token_accuracy": 0.1208396390080452, "num_tokens": 8066101.0, "step": 3720 }, { "entropy": 6.82635269165039, "epoch": 0.3986302102841244, "grad_norm": 1.09375, "learning_rate": 0.0004990365339620504, "loss": 6.778, "mean_token_accuracy": 0.11029551848769188, "num_tokens": 8077249.0, "step": 3725 }, { "entropy": 6.791606903076172, "epoch": 0.39916528439188825, "grad_norm": 1.2734375, "learning_rate": 0.000499032996300818, "loss": 6.7108, "mean_token_accuracy": 0.11683286353945732, "num_tokens": 8088532.0, "step": 3730 }, { "entropy": 6.7761242389678955, "epoch": 0.3997003584996522, "grad_norm": 1.265625, "learning_rate": 0.0004990294521706645, "loss": 6.7513, "mean_token_accuracy": 0.11043450236320496, "num_tokens": 8099541.0, "step": 3735 }, { "entropy": 6.778212356567383, "epoch": 0.4002354326074161, "grad_norm": 1.0, "learning_rate": 0.000499025901571692, "loss": 6.7925, "mean_token_accuracy": 0.11460375785827637, "num_tokens": 8110532.0, "step": 3740 }, { "entropy": 6.860037422180175, "epoch": 0.40077050671518005, "grad_norm": 1.265625, "learning_rate": 0.0004990223445040031, "loss": 6.7246, "mean_token_accuracy": 0.12051974311470985, "num_tokens": 8120991.0, "step": 3745 }, { "entropy": 6.796218538284302, "epoch": 0.401305580822944, "grad_norm": 1.0390625, "learning_rate": 0.0004990187809677004, "loss": 6.6332, "mean_token_accuracy": 0.11498752385377883, "num_tokens": 8130737.0, "step": 3750 }, { "entropy": 6.687275981903076, "epoch": 0.4018406549307079, "grad_norm": 1.3203125, "learning_rate": 0.0004990152109628869, "loss": 6.6614, "mean_token_accuracy": 0.11621819585561752, "num_tokens": 8142315.0, "step": 3755 }, { "entropy": 6.747700786590576, "epoch": 0.40237572903847185, "grad_norm": 1.2734375, "learning_rate": 0.0004990116344896657, "loss": 6.7604, "mean_token_accuracy": 0.10932756140828133, "num_tokens": 8153618.0, "step": 3760 }, { "entropy": 6.786961269378662, "epoch": 0.40291080314623573, "grad_norm": 1.109375, "learning_rate": 0.00049900805154814, "loss": 6.6973, "mean_token_accuracy": 0.11853857338428497, "num_tokens": 8164304.0, "step": 3765 }, { "entropy": 6.784421157836914, "epoch": 0.40344587725399966, "grad_norm": 1.1328125, "learning_rate": 0.0004990044621384134, "loss": 6.694, "mean_token_accuracy": 0.11464422270655632, "num_tokens": 8175289.0, "step": 3770 }, { "entropy": 6.834812927246094, "epoch": 0.4039809513617636, "grad_norm": 1.125, "learning_rate": 0.0004990008662605893, "loss": 6.7375, "mean_token_accuracy": 0.11080463156104088, "num_tokens": 8186274.0, "step": 3775 }, { "entropy": 6.850270223617554, "epoch": 0.40451602546952753, "grad_norm": 1.1640625, "learning_rate": 0.0004989972639147717, "loss": 6.6819, "mean_token_accuracy": 0.11826486811041832, "num_tokens": 8196380.0, "step": 3780 }, { "entropy": 6.745476388931275, "epoch": 0.40505109957729146, "grad_norm": 1.15625, "learning_rate": 0.0004989936551010646, "loss": 6.7327, "mean_token_accuracy": 0.11468399837613105, "num_tokens": 8207204.0, "step": 3785 }, { "entropy": 6.715826034545898, "epoch": 0.4055861736850554, "grad_norm": 1.1796875, "learning_rate": 0.0004989900398195722, "loss": 6.6512, "mean_token_accuracy": 0.11534782201051712, "num_tokens": 8217745.0, "step": 3790 }, { "entropy": 6.774829626083374, "epoch": 0.40612124779281933, "grad_norm": 1.140625, "learning_rate": 0.0004989864180703988, "loss": 6.6424, "mean_token_accuracy": 0.11919590383768082, "num_tokens": 8228171.0, "step": 3795 }, { "entropy": 6.758113431930542, "epoch": 0.4066563219005832, "grad_norm": 1.2421875, "learning_rate": 0.0004989827898536491, "loss": 6.6973, "mean_token_accuracy": 0.11042807400226592, "num_tokens": 8239220.0, "step": 3800 }, { "entropy": 6.832132291793823, "epoch": 0.40719139600834714, "grad_norm": 1.1640625, "learning_rate": 0.0004989791551694279, "loss": 6.7518, "mean_token_accuracy": 0.109524205327034, "num_tokens": 8250363.0, "step": 3805 }, { "entropy": 6.776221656799317, "epoch": 0.4077264701161111, "grad_norm": 1.1171875, "learning_rate": 0.0004989755140178398, "loss": 6.7123, "mean_token_accuracy": 0.11326616704463958, "num_tokens": 8261207.0, "step": 3810 }, { "entropy": 6.741102790832519, "epoch": 0.408261544223875, "grad_norm": 1.109375, "learning_rate": 0.0004989718663989905, "loss": 6.6174, "mean_token_accuracy": 0.11389720663428307, "num_tokens": 8272343.0, "step": 3815 }, { "entropy": 6.711847400665283, "epoch": 0.40879661833163894, "grad_norm": 1.0625, "learning_rate": 0.0004989682123129849, "loss": 6.6662, "mean_token_accuracy": 0.11849249228835106, "num_tokens": 8282677.0, "step": 3820 }, { "entropy": 6.69567084312439, "epoch": 0.40933169243940287, "grad_norm": 1.03125, "learning_rate": 0.0004989645517599286, "loss": 6.6745, "mean_token_accuracy": 0.11427896246314048, "num_tokens": 8292753.0, "step": 3825 }, { "entropy": 6.774503755569458, "epoch": 0.4098667665471668, "grad_norm": 1.046875, "learning_rate": 0.0004989608847399275, "loss": 6.6625, "mean_token_accuracy": 0.11602176800370216, "num_tokens": 8302747.0, "step": 3830 }, { "entropy": 6.774828100204468, "epoch": 0.4104018406549307, "grad_norm": 1.0703125, "learning_rate": 0.0004989572112530871, "loss": 6.7446, "mean_token_accuracy": 0.10802446901798249, "num_tokens": 8314766.0, "step": 3835 }, { "entropy": 6.862928152084351, "epoch": 0.4109369147626946, "grad_norm": 1.0625, "learning_rate": 0.0004989535312995139, "loss": 6.7682, "mean_token_accuracy": 0.11004860624670983, "num_tokens": 8325791.0, "step": 3840 }, { "entropy": 6.746032285690307, "epoch": 0.41147198887045855, "grad_norm": 1.1328125, "learning_rate": 0.0004989498448793139, "loss": 6.6939, "mean_token_accuracy": 0.11601744443178177, "num_tokens": 8335809.0, "step": 3845 }, { "entropy": 6.742163610458374, "epoch": 0.4120070629782225, "grad_norm": 1.0546875, "learning_rate": 0.0004989461519925935, "loss": 6.6923, "mean_token_accuracy": 0.11100121140480042, "num_tokens": 8347505.0, "step": 3850 }, { "entropy": 6.8387268543243405, "epoch": 0.4125421370859864, "grad_norm": 1.0625, "learning_rate": 0.0004989424526394596, "loss": 6.7162, "mean_token_accuracy": 0.1083609253168106, "num_tokens": 8358363.0, "step": 3855 }, { "entropy": 6.726605081558228, "epoch": 0.41307721119375035, "grad_norm": 1.1015625, "learning_rate": 0.0004989387468200187, "loss": 6.7182, "mean_token_accuracy": 0.1165882483124733, "num_tokens": 8369076.0, "step": 3860 }, { "entropy": 6.849684762954712, "epoch": 0.4136122853015143, "grad_norm": 1.109375, "learning_rate": 0.000498935034534378, "loss": 6.7567, "mean_token_accuracy": 0.11488589569926262, "num_tokens": 8380071.0, "step": 3865 }, { "entropy": 6.779253625869751, "epoch": 0.41414735940927816, "grad_norm": 1.0703125, "learning_rate": 0.0004989313157826446, "loss": 6.7043, "mean_token_accuracy": 0.11365948691964149, "num_tokens": 8390574.0, "step": 3870 }, { "entropy": 6.762129831314087, "epoch": 0.4146824335170421, "grad_norm": 1.0859375, "learning_rate": 0.000498927590564926, "loss": 6.7016, "mean_token_accuracy": 0.11860018000006675, "num_tokens": 8401154.0, "step": 3875 }, { "entropy": 6.805259132385254, "epoch": 0.415217507624806, "grad_norm": 1.0546875, "learning_rate": 0.0004989238588813296, "loss": 6.7816, "mean_token_accuracy": 0.10864789858460426, "num_tokens": 8412113.0, "step": 3880 }, { "entropy": 6.893309640884399, "epoch": 0.41575258173256996, "grad_norm": 1.203125, "learning_rate": 0.0004989201207319634, "loss": 6.7582, "mean_token_accuracy": 0.11186528205871582, "num_tokens": 8422734.0, "step": 3885 }, { "entropy": 6.758945322036743, "epoch": 0.4162876558403339, "grad_norm": 1.125, "learning_rate": 0.0004989163761169351, "loss": 6.6912, "mean_token_accuracy": 0.11084168404340744, "num_tokens": 8433647.0, "step": 3890 }, { "entropy": 6.744187116622925, "epoch": 0.4168227299480978, "grad_norm": 1.203125, "learning_rate": 0.0004989126250363529, "loss": 6.7234, "mean_token_accuracy": 0.11423909962177277, "num_tokens": 8444726.0, "step": 3895 }, { "entropy": 6.83604621887207, "epoch": 0.41735780405586176, "grad_norm": 1.09375, "learning_rate": 0.0004989088674903251, "loss": 6.7264, "mean_token_accuracy": 0.11136697009205818, "num_tokens": 8455351.0, "step": 3900 }, { "entropy": 6.788657855987549, "epoch": 0.41789287816362564, "grad_norm": 1.0703125, "learning_rate": 0.0004989051034789602, "loss": 6.7073, "mean_token_accuracy": 0.11919761151075363, "num_tokens": 8466423.0, "step": 3905 }, { "entropy": 6.769079303741455, "epoch": 0.41842795227138957, "grad_norm": 1.28125, "learning_rate": 0.000498901333002367, "loss": 6.6522, "mean_token_accuracy": 0.11701465100049972, "num_tokens": 8475841.0, "step": 3910 }, { "entropy": 6.814233303070068, "epoch": 0.4189630263791535, "grad_norm": 1.03125, "learning_rate": 0.0004988975560606541, "loss": 6.762, "mean_token_accuracy": 0.11229455918073654, "num_tokens": 8487656.0, "step": 3915 }, { "entropy": 6.776022148132324, "epoch": 0.41949810048691744, "grad_norm": 1.1640625, "learning_rate": 0.0004988937726539308, "loss": 6.7744, "mean_token_accuracy": 0.10670395717024803, "num_tokens": 8497959.0, "step": 3920 }, { "entropy": 6.763610315322876, "epoch": 0.42003317459468137, "grad_norm": 1.078125, "learning_rate": 0.0004988899827823062, "loss": 6.6751, "mean_token_accuracy": 0.11493971273303032, "num_tokens": 8508228.0, "step": 3925 }, { "entropy": 6.782846927642822, "epoch": 0.4205682487024453, "grad_norm": 1.171875, "learning_rate": 0.00049888618644589, "loss": 6.7229, "mean_token_accuracy": 0.11063806042075157, "num_tokens": 8518999.0, "step": 3930 }, { "entropy": 6.691450452804565, "epoch": 0.42110332281020924, "grad_norm": 1.2265625, "learning_rate": 0.0004988823836447916, "loss": 6.7519, "mean_token_accuracy": 0.11179999187588692, "num_tokens": 8529583.0, "step": 3935 }, { "entropy": 6.894530963897705, "epoch": 0.4216383969179731, "grad_norm": 1.4609375, "learning_rate": 0.0004988785743791207, "loss": 6.8223, "mean_token_accuracy": 0.10763506144285202, "num_tokens": 8540069.0, "step": 3940 }, { "entropy": 6.875021266937256, "epoch": 0.42217347102573705, "grad_norm": 1.1953125, "learning_rate": 0.0004988747586489876, "loss": 6.7009, "mean_token_accuracy": 0.11498932242393493, "num_tokens": 8550441.0, "step": 3945 }, { "entropy": 6.709805822372436, "epoch": 0.422708545133501, "grad_norm": 1.0546875, "learning_rate": 0.000498870936454502, "loss": 6.6653, "mean_token_accuracy": 0.11834602132439613, "num_tokens": 8560257.0, "step": 3950 }, { "entropy": 6.828940343856812, "epoch": 0.4232436192412649, "grad_norm": 1.078125, "learning_rate": 0.0004988671077957749, "loss": 6.7485, "mean_token_accuracy": 0.1175241857767105, "num_tokens": 8570991.0, "step": 3955 }, { "entropy": 6.891437435150147, "epoch": 0.42377869334902885, "grad_norm": 1.609375, "learning_rate": 0.0004988632726729164, "loss": 6.8051, "mean_token_accuracy": 0.10697821751236916, "num_tokens": 8583668.0, "step": 3960 }, { "entropy": 6.802229166030884, "epoch": 0.4243137674567928, "grad_norm": 1.109375, "learning_rate": 0.0004988594310860374, "loss": 6.7184, "mean_token_accuracy": 0.1156295083463192, "num_tokens": 8593727.0, "step": 3965 }, { "entropy": 6.714612770080566, "epoch": 0.4248488415645567, "grad_norm": 1.0625, "learning_rate": 0.0004988555830352485, "loss": 6.7209, "mean_token_accuracy": 0.11398242264986039, "num_tokens": 8605470.0, "step": 3970 }, { "entropy": 6.7963508605957035, "epoch": 0.4253839156723206, "grad_norm": 1.0234375, "learning_rate": 0.0004988517285206614, "loss": 6.6687, "mean_token_accuracy": 0.11099848076701165, "num_tokens": 8617176.0, "step": 3975 }, { "entropy": 6.803634119033814, "epoch": 0.4259189897800845, "grad_norm": 1.0703125, "learning_rate": 0.0004988478675423871, "loss": 6.7558, "mean_token_accuracy": 0.11225240230560303, "num_tokens": 8627756.0, "step": 3980 }, { "entropy": 6.793984985351562, "epoch": 0.42645406388784846, "grad_norm": 1.234375, "learning_rate": 0.0004988440001005369, "loss": 6.6853, "mean_token_accuracy": 0.11842627823352814, "num_tokens": 8637766.0, "step": 3985 }, { "entropy": 6.800572538375855, "epoch": 0.4269891379956124, "grad_norm": 1.1640625, "learning_rate": 0.0004988401261952227, "loss": 6.7096, "mean_token_accuracy": 0.11486690863966942, "num_tokens": 8648562.0, "step": 3990 }, { "entropy": 6.808977746963501, "epoch": 0.4275242121033763, "grad_norm": 1.1875, "learning_rate": 0.0004988362458265565, "loss": 6.7412, "mean_token_accuracy": 0.10799469202756881, "num_tokens": 8658393.0, "step": 3995 }, { "entropy": 6.730482482910157, "epoch": 0.42805928621114026, "grad_norm": 1.125, "learning_rate": 0.0004988323589946499, "loss": 6.6543, "mean_token_accuracy": 0.1162540040910244, "num_tokens": 8668365.0, "step": 4000 }, { "entropy": 6.777298212051392, "epoch": 0.4285943603189042, "grad_norm": 1.1953125, "learning_rate": 0.0004988284656996156, "loss": 6.7009, "mean_token_accuracy": 0.1099359154701233, "num_tokens": 8679228.0, "step": 4005 }, { "entropy": 6.780287981033325, "epoch": 0.42912943442666807, "grad_norm": 1.234375, "learning_rate": 0.0004988245659415656, "loss": 6.5866, "mean_token_accuracy": 0.12446512654423714, "num_tokens": 8688940.0, "step": 4010 }, { "entropy": 6.810698747634888, "epoch": 0.429664508534432, "grad_norm": 1.1796875, "learning_rate": 0.0004988206597206129, "loss": 6.7438, "mean_token_accuracy": 0.10872282534837723, "num_tokens": 8699923.0, "step": 4015 }, { "entropy": 6.720220708847046, "epoch": 0.43019958264219593, "grad_norm": 1.0546875, "learning_rate": 0.00049881674703687, "loss": 6.58, "mean_token_accuracy": 0.12176239043474198, "num_tokens": 8710445.0, "step": 4020 }, { "entropy": 6.721858978271484, "epoch": 0.43073465674995987, "grad_norm": 1.3046875, "learning_rate": 0.0004988128278904499, "loss": 6.7083, "mean_token_accuracy": 0.11447286382317542, "num_tokens": 8720686.0, "step": 4025 }, { "entropy": 6.834508752822876, "epoch": 0.4312697308577238, "grad_norm": 1.140625, "learning_rate": 0.000498808902281466, "loss": 6.7282, "mean_token_accuracy": 0.11510429829359055, "num_tokens": 8732122.0, "step": 4030 }, { "entropy": 6.744071006774902, "epoch": 0.43180480496548773, "grad_norm": 1.125, "learning_rate": 0.0004988049702100315, "loss": 6.6825, "mean_token_accuracy": 0.1182553879916668, "num_tokens": 8744122.0, "step": 4035 }, { "entropy": 6.787398195266723, "epoch": 0.43233987907325166, "grad_norm": 0.984375, "learning_rate": 0.0004988010316762598, "loss": 6.6911, "mean_token_accuracy": 0.115293999761343, "num_tokens": 8754758.0, "step": 4040 }, { "entropy": 6.7287671089172365, "epoch": 0.4328749531810156, "grad_norm": 1.1953125, "learning_rate": 0.0004987970866802649, "loss": 6.7121, "mean_token_accuracy": 0.10785665214061738, "num_tokens": 8766577.0, "step": 4045 }, { "entropy": 6.773381233215332, "epoch": 0.4334100272887795, "grad_norm": 1.1171875, "learning_rate": 0.0004987931352221605, "loss": 6.7083, "mean_token_accuracy": 0.11141579747200012, "num_tokens": 8777698.0, "step": 4050 }, { "entropy": 6.788628673553466, "epoch": 0.4339451013965434, "grad_norm": 1.0546875, "learning_rate": 0.0004987891773020606, "loss": 6.7231, "mean_token_accuracy": 0.11151274070143699, "num_tokens": 8788637.0, "step": 4055 }, { "entropy": 6.799765920639038, "epoch": 0.43448017550430734, "grad_norm": 1.265625, "learning_rate": 0.0004987852129200799, "loss": 6.7009, "mean_token_accuracy": 0.11956919953227044, "num_tokens": 8799709.0, "step": 4060 }, { "entropy": 6.795716381072998, "epoch": 0.4350152496120713, "grad_norm": 1.171875, "learning_rate": 0.0004987812420763326, "loss": 6.6905, "mean_token_accuracy": 0.11553208827972412, "num_tokens": 8810469.0, "step": 4065 }, { "entropy": 6.7736915111541744, "epoch": 0.4355503237198352, "grad_norm": 1.171875, "learning_rate": 0.0004987772647709333, "loss": 6.6708, "mean_token_accuracy": 0.1123408019542694, "num_tokens": 8821142.0, "step": 4070 }, { "entropy": 6.70412278175354, "epoch": 0.43608539782759914, "grad_norm": 1.1796875, "learning_rate": 0.000498773281003997, "loss": 6.6226, "mean_token_accuracy": 0.12270026281476021, "num_tokens": 8832951.0, "step": 4075 }, { "entropy": 6.725498294830322, "epoch": 0.4366204719353631, "grad_norm": 1.3203125, "learning_rate": 0.0004987692907756385, "loss": 6.7344, "mean_token_accuracy": 0.10939609631896019, "num_tokens": 8843579.0, "step": 4080 }, { "entropy": 6.6969774723052975, "epoch": 0.43715554604312695, "grad_norm": 1.125, "learning_rate": 0.0004987652940859733, "loss": 6.6606, "mean_token_accuracy": 0.10758041813969613, "num_tokens": 8854612.0, "step": 4085 }, { "entropy": 6.766866064071655, "epoch": 0.4376906201508909, "grad_norm": 1.0390625, "learning_rate": 0.0004987612909351167, "loss": 6.6101, "mean_token_accuracy": 0.12067801505327225, "num_tokens": 8865584.0, "step": 4090 }, { "entropy": 6.688352346420288, "epoch": 0.4382256942586548, "grad_norm": 1.109375, "learning_rate": 0.0004987572813231842, "loss": 6.66, "mean_token_accuracy": 0.12287814989686012, "num_tokens": 8876662.0, "step": 4095 }, { "entropy": 6.756010103225708, "epoch": 0.43876076836641875, "grad_norm": 1.09375, "learning_rate": 0.0004987532652502917, "loss": 6.6831, "mean_token_accuracy": 0.11270663142204285, "num_tokens": 8887249.0, "step": 4100 }, { "entropy": 6.713475131988526, "epoch": 0.4392958424741827, "grad_norm": 1.2109375, "learning_rate": 0.0004987492427165551, "loss": 6.531, "mean_token_accuracy": 0.1301178902387619, "num_tokens": 8898635.0, "step": 4105 }, { "entropy": 6.678007888793945, "epoch": 0.4398309165819466, "grad_norm": 1.09375, "learning_rate": 0.0004987452137220906, "loss": 6.6895, "mean_token_accuracy": 0.11399767398834229, "num_tokens": 8908794.0, "step": 4110 }, { "entropy": 6.847482490539551, "epoch": 0.44036599068971055, "grad_norm": 1.171875, "learning_rate": 0.0004987411782670144, "loss": 6.7013, "mean_token_accuracy": 0.10850507244467736, "num_tokens": 8919015.0, "step": 4115 }, { "entropy": 6.8152250289917, "epoch": 0.44090106479747443, "grad_norm": 1.140625, "learning_rate": 0.0004987371363514431, "loss": 6.7349, "mean_token_accuracy": 0.10842297747731208, "num_tokens": 8929028.0, "step": 4120 }, { "entropy": 6.664592504501343, "epoch": 0.44143613890523836, "grad_norm": 1.125, "learning_rate": 0.0004987330879754933, "loss": 6.6382, "mean_token_accuracy": 0.11036456525325775, "num_tokens": 8939789.0, "step": 4125 }, { "entropy": 6.707959175109863, "epoch": 0.4419712130130023, "grad_norm": 1.015625, "learning_rate": 0.0004987290331392823, "loss": 6.6225, "mean_token_accuracy": 0.11801224276423454, "num_tokens": 8950657.0, "step": 4130 }, { "entropy": 6.828504610061645, "epoch": 0.44250628712076623, "grad_norm": 1.0546875, "learning_rate": 0.0004987249718429269, "loss": 6.7236, "mean_token_accuracy": 0.11803532913327217, "num_tokens": 8960744.0, "step": 4135 }, { "entropy": 6.705205869674683, "epoch": 0.44304136122853016, "grad_norm": 1.09375, "learning_rate": 0.0004987209040865441, "loss": 6.5768, "mean_token_accuracy": 0.12112260162830353, "num_tokens": 8972411.0, "step": 4140 }, { "entropy": 6.801696109771728, "epoch": 0.4435764353362941, "grad_norm": 1.2265625, "learning_rate": 0.0004987168298702519, "loss": 6.7465, "mean_token_accuracy": 0.11419489085674286, "num_tokens": 8982818.0, "step": 4145 }, { "entropy": 6.745963048934937, "epoch": 0.44411150944405803, "grad_norm": 1.234375, "learning_rate": 0.0004987127491941675, "loss": 6.6657, "mean_token_accuracy": 0.1177960142493248, "num_tokens": 8993227.0, "step": 4150 }, { "entropy": 6.669366073608399, "epoch": 0.4446465835518219, "grad_norm": 1.25, "learning_rate": 0.0004987086620584091, "loss": 6.6037, "mean_token_accuracy": 0.11799841225147248, "num_tokens": 9003796.0, "step": 4155 }, { "entropy": 6.772842884063721, "epoch": 0.44518165765958584, "grad_norm": 1.421875, "learning_rate": 0.0004987045684630944, "loss": 6.6369, "mean_token_accuracy": 0.12047947198152542, "num_tokens": 9014931.0, "step": 4160 }, { "entropy": 6.774410676956177, "epoch": 0.44571673176734977, "grad_norm": 1.15625, "learning_rate": 0.0004987004684083417, "loss": 6.6984, "mean_token_accuracy": 0.1164324201643467, "num_tokens": 9025312.0, "step": 4165 }, { "entropy": 6.7285847663879395, "epoch": 0.4462518058751137, "grad_norm": 1.1015625, "learning_rate": 0.0004986963618942694, "loss": 6.6642, "mean_token_accuracy": 0.12318786159157753, "num_tokens": 9035563.0, "step": 4170 }, { "entropy": 6.795755052566529, "epoch": 0.44678687998287764, "grad_norm": 1.2578125, "learning_rate": 0.0004986922489209961, "loss": 6.7039, "mean_token_accuracy": 0.1175026074051857, "num_tokens": 9046065.0, "step": 4175 }, { "entropy": 6.751359653472901, "epoch": 0.44732195409064157, "grad_norm": 1.0625, "learning_rate": 0.0004986881294886406, "loss": 6.6057, "mean_token_accuracy": 0.1231963075697422, "num_tokens": 9056696.0, "step": 4180 }, { "entropy": 6.676720142364502, "epoch": 0.4478570281984055, "grad_norm": 1.171875, "learning_rate": 0.0004986840035973218, "loss": 6.6808, "mean_token_accuracy": 0.11223538517951966, "num_tokens": 9067035.0, "step": 4185 }, { "entropy": 6.6606361865997314, "epoch": 0.4483921023061694, "grad_norm": 1.140625, "learning_rate": 0.0004986798712471588, "loss": 6.6574, "mean_token_accuracy": 0.11127996742725373, "num_tokens": 9078253.0, "step": 4190 }, { "entropy": 6.8346106052398685, "epoch": 0.4489271764139333, "grad_norm": 1.296875, "learning_rate": 0.0004986757324382709, "loss": 6.7174, "mean_token_accuracy": 0.10800155103206635, "num_tokens": 9088184.0, "step": 4195 }, { "entropy": 6.7804230690002445, "epoch": 0.44946225052169725, "grad_norm": 1.1953125, "learning_rate": 0.0004986715871707777, "loss": 6.7777, "mean_token_accuracy": 0.1087512344121933, "num_tokens": 9099321.0, "step": 4200 }, { "entropy": 6.843128871917725, "epoch": 0.4499973246294612, "grad_norm": 1.140625, "learning_rate": 0.0004986674354447988, "loss": 6.8009, "mean_token_accuracy": 0.11305928155779839, "num_tokens": 9111410.0, "step": 4205 }, { "entropy": 6.831840133666992, "epoch": 0.4505323987372251, "grad_norm": 1.1796875, "learning_rate": 0.0004986632772604543, "loss": 6.6256, "mean_token_accuracy": 0.11788237541913986, "num_tokens": 9121932.0, "step": 4210 }, { "entropy": 6.651640558242798, "epoch": 0.45106747284498905, "grad_norm": 1.6640625, "learning_rate": 0.0004986591126178639, "loss": 6.7181, "mean_token_accuracy": 0.1195308357477188, "num_tokens": 9132686.0, "step": 4215 }, { "entropy": 6.678121089935303, "epoch": 0.451602546952753, "grad_norm": 1.4375, "learning_rate": 0.0004986549415171482, "loss": 6.6445, "mean_token_accuracy": 0.11687054708600045, "num_tokens": 9143582.0, "step": 4220 }, { "entropy": 6.877950763702392, "epoch": 0.45213762106051686, "grad_norm": 1.09375, "learning_rate": 0.0004986507639584274, "loss": 6.7232, "mean_token_accuracy": 0.11007717251777649, "num_tokens": 9156173.0, "step": 4225 }, { "entropy": 6.7473616123199465, "epoch": 0.4526726951682808, "grad_norm": 1.2265625, "learning_rate": 0.0004986465799418223, "loss": 6.7062, "mean_token_accuracy": 0.11616904065012931, "num_tokens": 9166882.0, "step": 4230 }, { "entropy": 6.726114082336426, "epoch": 0.4532077692760447, "grad_norm": 1.28125, "learning_rate": 0.0004986423894674534, "loss": 6.7034, "mean_token_accuracy": 0.11051197499036788, "num_tokens": 9177525.0, "step": 4235 }, { "entropy": 6.824288320541382, "epoch": 0.45374284338380866, "grad_norm": 1.21875, "learning_rate": 0.0004986381925354422, "loss": 6.6713, "mean_token_accuracy": 0.11391364932060241, "num_tokens": 9188586.0, "step": 4240 }, { "entropy": 6.741261911392212, "epoch": 0.4542779174915726, "grad_norm": 1.328125, "learning_rate": 0.0004986339891459094, "loss": 6.5797, "mean_token_accuracy": 0.11786932200193405, "num_tokens": 9199920.0, "step": 4245 }, { "entropy": 6.590327644348145, "epoch": 0.4548129915993365, "grad_norm": 1.21875, "learning_rate": 0.0004986297792989768, "loss": 6.583, "mean_token_accuracy": 0.12098821178078652, "num_tokens": 9210923.0, "step": 4250 }, { "entropy": 6.832316637039185, "epoch": 0.45534806570710046, "grad_norm": 1.2421875, "learning_rate": 0.0004986255629947655, "loss": 6.7539, "mean_token_accuracy": 0.10964171513915062, "num_tokens": 9221459.0, "step": 4255 }, { "entropy": 6.773038291931153, "epoch": 0.45588313981486434, "grad_norm": 1.1953125, "learning_rate": 0.0004986213402333978, "loss": 6.6935, "mean_token_accuracy": 0.11024248600006104, "num_tokens": 9231768.0, "step": 4260 }, { "entropy": 6.713382816314697, "epoch": 0.45641821392262827, "grad_norm": 1.09375, "learning_rate": 0.0004986171110149951, "loss": 6.6848, "mean_token_accuracy": 0.11179919168353081, "num_tokens": 9242230.0, "step": 4265 }, { "entropy": 6.807206058502198, "epoch": 0.4569532880303922, "grad_norm": 1.0859375, "learning_rate": 0.0004986128753396798, "loss": 6.5794, "mean_token_accuracy": 0.1219303086400032, "num_tokens": 9252485.0, "step": 4270 }, { "entropy": 6.657087945938111, "epoch": 0.45748836213815613, "grad_norm": 1.3125, "learning_rate": 0.0004986086332075742, "loss": 6.6527, "mean_token_accuracy": 0.12027468383312226, "num_tokens": 9263014.0, "step": 4275 }, { "entropy": 6.737786865234375, "epoch": 0.45802343624592007, "grad_norm": 1.3046875, "learning_rate": 0.0004986043846188006, "loss": 6.6932, "mean_token_accuracy": 0.12059752494096757, "num_tokens": 9273777.0, "step": 4280 }, { "entropy": 6.658463954925537, "epoch": 0.458558510353684, "grad_norm": 1.3203125, "learning_rate": 0.000498600129573482, "loss": 6.6266, "mean_token_accuracy": 0.11395588889718056, "num_tokens": 9284738.0, "step": 4285 }, { "entropy": 6.793663120269775, "epoch": 0.45909358446144793, "grad_norm": 1.125, "learning_rate": 0.000498595868071741, "loss": 6.6807, "mean_token_accuracy": 0.11528572961688041, "num_tokens": 9295921.0, "step": 4290 }, { "entropy": 6.744870233535766, "epoch": 0.4596286585692118, "grad_norm": 1.2421875, "learning_rate": 0.0004985916001137006, "loss": 6.6609, "mean_token_accuracy": 0.11062274277210235, "num_tokens": 9306568.0, "step": 4295 }, { "entropy": 6.757999467849731, "epoch": 0.46016373267697575, "grad_norm": 1.1875, "learning_rate": 0.0004985873256994843, "loss": 6.6262, "mean_token_accuracy": 0.11653959006071091, "num_tokens": 9316468.0, "step": 4300 }, { "entropy": 6.737951755523682, "epoch": 0.4606988067847397, "grad_norm": 1.21875, "learning_rate": 0.0004985830448292154, "loss": 6.7008, "mean_token_accuracy": 0.1143273763358593, "num_tokens": 9328185.0, "step": 4305 }, { "entropy": 6.743026876449585, "epoch": 0.4612338808925036, "grad_norm": 1.234375, "learning_rate": 0.0004985787575030175, "loss": 6.6547, "mean_token_accuracy": 0.11528828516602516, "num_tokens": 9338591.0, "step": 4310 }, { "entropy": 6.768393468856812, "epoch": 0.46176895500026754, "grad_norm": 1.078125, "learning_rate": 0.0004985744637210144, "loss": 6.6761, "mean_token_accuracy": 0.11174369007349014, "num_tokens": 9349286.0, "step": 4315 }, { "entropy": 6.783293533325195, "epoch": 0.4623040291080315, "grad_norm": 1.375, "learning_rate": 0.00049857016348333, "loss": 6.658, "mean_token_accuracy": 0.11993650272488594, "num_tokens": 9359752.0, "step": 4320 }, { "entropy": 6.78243350982666, "epoch": 0.4628391032157954, "grad_norm": 1.1953125, "learning_rate": 0.0004985658567900886, "loss": 6.7129, "mean_token_accuracy": 0.1122040569782257, "num_tokens": 9371823.0, "step": 4325 }, { "entropy": 6.643386602401733, "epoch": 0.4633741773235593, "grad_norm": 1.0703125, "learning_rate": 0.0004985615436414145, "loss": 6.5839, "mean_token_accuracy": 0.11392313092947007, "num_tokens": 9383127.0, "step": 4330 }, { "entropy": 6.734666919708252, "epoch": 0.4639092514313232, "grad_norm": 1.1875, "learning_rate": 0.0004985572240374321, "loss": 6.6771, "mean_token_accuracy": 0.11793937757611275, "num_tokens": 9394296.0, "step": 4335 }, { "entropy": 6.754271030426025, "epoch": 0.46444432553908715, "grad_norm": 1.1640625, "learning_rate": 0.0004985528979782665, "loss": 6.6688, "mean_token_accuracy": 0.11072949096560478, "num_tokens": 9405988.0, "step": 4340 }, { "entropy": 6.822707033157348, "epoch": 0.4649793996468511, "grad_norm": 1.1015625, "learning_rate": 0.0004985485654640423, "loss": 6.6693, "mean_token_accuracy": 0.1139429748058319, "num_tokens": 9417479.0, "step": 4345 }, { "entropy": 6.696816492080688, "epoch": 0.465514473754615, "grad_norm": 1.375, "learning_rate": 0.0004985442264948847, "loss": 6.6197, "mean_token_accuracy": 0.11986967846751213, "num_tokens": 9428050.0, "step": 4350 }, { "entropy": 6.653148794174195, "epoch": 0.46604954786237895, "grad_norm": 1.1484375, "learning_rate": 0.0004985398810709189, "loss": 6.5722, "mean_token_accuracy": 0.12251258864998818, "num_tokens": 9438229.0, "step": 4355 }, { "entropy": 6.654054975509643, "epoch": 0.4665846219701429, "grad_norm": 1.171875, "learning_rate": 0.0004985355291922704, "loss": 6.6493, "mean_token_accuracy": 0.11258513107895851, "num_tokens": 9449611.0, "step": 4360 }, { "entropy": 6.709498739242553, "epoch": 0.46711969607790677, "grad_norm": 1.515625, "learning_rate": 0.000498531170859065, "loss": 6.614, "mean_token_accuracy": 0.11630048006772994, "num_tokens": 9460234.0, "step": 4365 }, { "entropy": 6.828418874740601, "epoch": 0.4676547701856707, "grad_norm": 1.625, "learning_rate": 0.0004985268060714285, "loss": 6.7023, "mean_token_accuracy": 0.1152671605348587, "num_tokens": 9472136.0, "step": 4370 }, { "entropy": 6.6818465232849125, "epoch": 0.46818984429343463, "grad_norm": 1.3515625, "learning_rate": 0.0004985224348294868, "loss": 6.6403, "mean_token_accuracy": 0.12047104090452194, "num_tokens": 9482602.0, "step": 4375 }, { "entropy": 6.785189914703369, "epoch": 0.46872491840119856, "grad_norm": 1.28125, "learning_rate": 0.0004985180571333663, "loss": 6.6442, "mean_token_accuracy": 0.11965756639838218, "num_tokens": 9493782.0, "step": 4380 }, { "entropy": 6.763046312332153, "epoch": 0.4692599925089625, "grad_norm": 1.5078125, "learning_rate": 0.0004985136729831932, "loss": 6.6249, "mean_token_accuracy": 0.11808878481388092, "num_tokens": 9504389.0, "step": 4385 }, { "entropy": 6.648394393920898, "epoch": 0.46979506661672643, "grad_norm": 1.5390625, "learning_rate": 0.0004985092823790942, "loss": 6.7447, "mean_token_accuracy": 0.1183752790093422, "num_tokens": 9515166.0, "step": 4390 }, { "entropy": 6.747145318984986, "epoch": 0.47033014072449036, "grad_norm": 1.140625, "learning_rate": 0.0004985048853211961, "loss": 6.6434, "mean_token_accuracy": 0.116434495896101, "num_tokens": 9525566.0, "step": 4395 }, { "entropy": 6.7929564952850345, "epoch": 0.47086521483225424, "grad_norm": 1.21875, "learning_rate": 0.000498500481809626, "loss": 6.5549, "mean_token_accuracy": 0.1208685427904129, "num_tokens": 9536021.0, "step": 4400 }, { "entropy": 6.649615907669068, "epoch": 0.4714002889400182, "grad_norm": 1.3984375, "learning_rate": 0.0004984960718445107, "loss": 6.6641, "mean_token_accuracy": 0.11327528953552246, "num_tokens": 9546827.0, "step": 4405 }, { "entropy": 6.756602811813354, "epoch": 0.4719353630477821, "grad_norm": 1.28125, "learning_rate": 0.0004984916554259778, "loss": 6.7758, "mean_token_accuracy": 0.10899243578314781, "num_tokens": 9558104.0, "step": 4410 }, { "entropy": 6.866197681427002, "epoch": 0.47247043715554604, "grad_norm": 1.1796875, "learning_rate": 0.0004984872325541547, "loss": 6.668, "mean_token_accuracy": 0.11704885140061379, "num_tokens": 9568487.0, "step": 4415 }, { "entropy": 6.716640186309815, "epoch": 0.47300551126331, "grad_norm": 1.3125, "learning_rate": 0.0004984828032291692, "loss": 6.6107, "mean_token_accuracy": 0.12084364518523216, "num_tokens": 9579509.0, "step": 4420 }, { "entropy": 6.742200565338135, "epoch": 0.4735405853710739, "grad_norm": 1.96875, "learning_rate": 0.0004984783674511492, "loss": 6.64, "mean_token_accuracy": 0.1198382891714573, "num_tokens": 9589931.0, "step": 4425 }, { "entropy": 6.761376428604126, "epoch": 0.47407565947883784, "grad_norm": 1.328125, "learning_rate": 0.0004984739252202227, "loss": 6.6733, "mean_token_accuracy": 0.11940053328871728, "num_tokens": 9599764.0, "step": 4430 }, { "entropy": 6.7573480129241945, "epoch": 0.4746107335866017, "grad_norm": 1.2578125, "learning_rate": 0.000498469476536518, "loss": 6.6472, "mean_token_accuracy": 0.1184098556637764, "num_tokens": 9611145.0, "step": 4435 }, { "entropy": 6.6948751449584964, "epoch": 0.47514580769436565, "grad_norm": 1.4453125, "learning_rate": 0.0004984650214001636, "loss": 6.6436, "mean_token_accuracy": 0.12355822175741196, "num_tokens": 9621441.0, "step": 4440 }, { "entropy": 6.741222667694092, "epoch": 0.4756808818021296, "grad_norm": 1.59375, "learning_rate": 0.0004984605598112881, "loss": 6.6857, "mean_token_accuracy": 0.12146021127700805, "num_tokens": 9631874.0, "step": 4445 }, { "entropy": 6.717041254043579, "epoch": 0.4762159559098935, "grad_norm": 1.1484375, "learning_rate": 0.0004984560917700204, "loss": 6.6614, "mean_token_accuracy": 0.11106858849525451, "num_tokens": 9643006.0, "step": 4450 }, { "entropy": 6.698492193222046, "epoch": 0.47675103001765745, "grad_norm": 1.328125, "learning_rate": 0.0004984516172764894, "loss": 6.5533, "mean_token_accuracy": 0.12116582468152046, "num_tokens": 9653897.0, "step": 4455 }, { "entropy": 6.691738748550415, "epoch": 0.4772861041254214, "grad_norm": 1.2734375, "learning_rate": 0.0004984471363308243, "loss": 6.6263, "mean_token_accuracy": 0.1176533468067646, "num_tokens": 9664460.0, "step": 4460 }, { "entropy": 6.711106204986573, "epoch": 0.4778211782331853, "grad_norm": 1.1015625, "learning_rate": 0.0004984426489331546, "loss": 6.6385, "mean_token_accuracy": 0.12148366495966911, "num_tokens": 9674534.0, "step": 4465 }, { "entropy": 6.8625555515289305, "epoch": 0.4783562523409492, "grad_norm": 1.2109375, "learning_rate": 0.0004984381550836097, "loss": 6.732, "mean_token_accuracy": 0.11358912587165833, "num_tokens": 9684828.0, "step": 4470 }, { "entropy": 6.851891565322876, "epoch": 0.47889132644871313, "grad_norm": 1.6015625, "learning_rate": 0.0004984336547823196, "loss": 6.6838, "mean_token_accuracy": 0.11679960638284684, "num_tokens": 9694536.0, "step": 4475 }, { "entropy": 6.712016582489014, "epoch": 0.47942640055647706, "grad_norm": 1.0703125, "learning_rate": 0.000498429148029414, "loss": 6.5548, "mean_token_accuracy": 0.12640432715415956, "num_tokens": 9705715.0, "step": 4480 }, { "entropy": 6.654127883911133, "epoch": 0.479961474664241, "grad_norm": 1.125, "learning_rate": 0.0004984246348250233, "loss": 6.6293, "mean_token_accuracy": 0.12291777729988099, "num_tokens": 9717505.0, "step": 4485 }, { "entropy": 6.698559045791626, "epoch": 0.4804965487720049, "grad_norm": 1.15625, "learning_rate": 0.0004984201151692775, "loss": 6.5005, "mean_token_accuracy": 0.11582913845777512, "num_tokens": 9727910.0, "step": 4490 }, { "entropy": 6.681623268127441, "epoch": 0.48103162287976886, "grad_norm": 1.2578125, "learning_rate": 0.0004984155890623074, "loss": 6.6164, "mean_token_accuracy": 0.12003767117857933, "num_tokens": 9738528.0, "step": 4495 }, { "entropy": 6.688356590270996, "epoch": 0.4815666969875328, "grad_norm": 1.1484375, "learning_rate": 0.0004984110565042435, "loss": 6.6433, "mean_token_accuracy": 0.11511807218194008, "num_tokens": 9749744.0, "step": 4500 }, { "entropy": 6.787782335281372, "epoch": 0.48210177109529667, "grad_norm": 1.1796875, "learning_rate": 0.0004984065174952168, "loss": 6.6415, "mean_token_accuracy": 0.11788514703512191, "num_tokens": 9759968.0, "step": 4505 }, { "entropy": 6.7138995170593265, "epoch": 0.4826368452030606, "grad_norm": 1.3046875, "learning_rate": 0.0004984019720353582, "loss": 6.6483, "mean_token_accuracy": 0.11984834149479866, "num_tokens": 9769791.0, "step": 4510 }, { "entropy": 6.669849443435669, "epoch": 0.48317191931082454, "grad_norm": 1.1953125, "learning_rate": 0.0004983974201247991, "loss": 6.6168, "mean_token_accuracy": 0.12382967993617058, "num_tokens": 9780369.0, "step": 4515 }, { "entropy": 6.718169641494751, "epoch": 0.48370699341858847, "grad_norm": 1.0703125, "learning_rate": 0.0004983928617636709, "loss": 6.6649, "mean_token_accuracy": 0.11595848128199578, "num_tokens": 9791125.0, "step": 4520 }, { "entropy": 6.822065162658691, "epoch": 0.4842420675263524, "grad_norm": 1.296875, "learning_rate": 0.0004983882969521052, "loss": 6.6623, "mean_token_accuracy": 0.11691764071583748, "num_tokens": 9801697.0, "step": 4525 }, { "entropy": 6.784085750579834, "epoch": 0.48477714163411634, "grad_norm": 1.046875, "learning_rate": 0.0004983837256902338, "loss": 6.7085, "mean_token_accuracy": 0.1206382617354393, "num_tokens": 9812171.0, "step": 4530 }, { "entropy": 6.700609016418457, "epoch": 0.48531221574188027, "grad_norm": 1.1171875, "learning_rate": 0.0004983791479781887, "loss": 6.5452, "mean_token_accuracy": 0.12644470036029815, "num_tokens": 9821596.0, "step": 4535 }, { "entropy": 6.76994104385376, "epoch": 0.48584728984964415, "grad_norm": 1.296875, "learning_rate": 0.0004983745638161021, "loss": 6.6662, "mean_token_accuracy": 0.10886719152331352, "num_tokens": 9831634.0, "step": 4540 }, { "entropy": 6.702042055130005, "epoch": 0.4863823639574081, "grad_norm": 1.4296875, "learning_rate": 0.0004983699732041064, "loss": 6.6297, "mean_token_accuracy": 0.12174258530139923, "num_tokens": 9841662.0, "step": 4545 }, { "entropy": 6.773559427261352, "epoch": 0.486917438065172, "grad_norm": 1.109375, "learning_rate": 0.000498365376142334, "loss": 6.618, "mean_token_accuracy": 0.11437310129404069, "num_tokens": 9853797.0, "step": 4550 }, { "entropy": 6.712430953979492, "epoch": 0.48745251217293595, "grad_norm": 1.1484375, "learning_rate": 0.0004983607726309179, "loss": 6.6691, "mean_token_accuracy": 0.1182169571518898, "num_tokens": 9865245.0, "step": 4555 }, { "entropy": 6.814268589019775, "epoch": 0.4879875862806999, "grad_norm": 1.234375, "learning_rate": 0.0004983561626699908, "loss": 6.7454, "mean_token_accuracy": 0.10475116744637489, "num_tokens": 9876207.0, "step": 4560 }, { "entropy": 6.760530710220337, "epoch": 0.4885226603884638, "grad_norm": 1.234375, "learning_rate": 0.0004983515462596859, "loss": 6.5712, "mean_token_accuracy": 0.12076753973960877, "num_tokens": 9887210.0, "step": 4565 }, { "entropy": 6.743468475341797, "epoch": 0.48905773449622775, "grad_norm": 1.2578125, "learning_rate": 0.0004983469234001365, "loss": 6.746, "mean_token_accuracy": 0.11424284428358078, "num_tokens": 9899607.0, "step": 4570 }, { "entropy": 6.662120580673218, "epoch": 0.4895928086039917, "grad_norm": 1.3515625, "learning_rate": 0.000498342294091476, "loss": 6.5284, "mean_token_accuracy": 0.1255207620561123, "num_tokens": 9909910.0, "step": 4575 }, { "entropy": 6.648574686050415, "epoch": 0.49012788271175556, "grad_norm": 1.25, "learning_rate": 0.0004983376583338382, "loss": 6.6563, "mean_token_accuracy": 0.11490331664681434, "num_tokens": 9922137.0, "step": 4580 }, { "entropy": 6.735975837707519, "epoch": 0.4906629568195195, "grad_norm": 1.1953125, "learning_rate": 0.0004983330161273569, "loss": 6.6451, "mean_token_accuracy": 0.11815119236707687, "num_tokens": 9932514.0, "step": 4585 }, { "entropy": 6.717578268051147, "epoch": 0.4911980309272834, "grad_norm": 1.5390625, "learning_rate": 0.0004983283674721662, "loss": 6.6847, "mean_token_accuracy": 0.11441330313682556, "num_tokens": 9943054.0, "step": 4590 }, { "entropy": 6.8306371688842775, "epoch": 0.49173310503504736, "grad_norm": 1.1796875, "learning_rate": 0.0004983237123684002, "loss": 6.6517, "mean_token_accuracy": 0.11424371600151062, "num_tokens": 9953791.0, "step": 4595 }, { "entropy": 6.725871992111206, "epoch": 0.4922681791428113, "grad_norm": 1.234375, "learning_rate": 0.0004983190508161934, "loss": 6.6071, "mean_token_accuracy": 0.1176756463944912, "num_tokens": 9964782.0, "step": 4600 }, { "entropy": 6.776705169677735, "epoch": 0.4928032532505752, "grad_norm": 1.6953125, "learning_rate": 0.0004983143828156804, "loss": 6.6759, "mean_token_accuracy": 0.1201729841530323, "num_tokens": 9975843.0, "step": 4605 }, { "entropy": 6.766890525817871, "epoch": 0.49333832735833916, "grad_norm": 1.5859375, "learning_rate": 0.0004983097083669959, "loss": 6.6515, "mean_token_accuracy": 0.12076375931501389, "num_tokens": 9987060.0, "step": 4610 }, { "entropy": 6.729199981689453, "epoch": 0.49387340146610303, "grad_norm": 1.296875, "learning_rate": 0.0004983050274702751, "loss": 6.6204, "mean_token_accuracy": 0.11678859367966651, "num_tokens": 9997380.0, "step": 4615 }, { "entropy": 6.704911518096924, "epoch": 0.49440847557386697, "grad_norm": 1.1171875, "learning_rate": 0.0004983003401256529, "loss": 6.6666, "mean_token_accuracy": 0.11961752027273179, "num_tokens": 10007955.0, "step": 4620 }, { "entropy": 6.858521175384522, "epoch": 0.4949435496816309, "grad_norm": 1.390625, "learning_rate": 0.0004982956463332647, "loss": 6.7414, "mean_token_accuracy": 0.11539428681135178, "num_tokens": 10017645.0, "step": 4625 }, { "entropy": 6.7818702220916744, "epoch": 0.49547862378939483, "grad_norm": 2.328125, "learning_rate": 0.0004982909460932463, "loss": 6.6603, "mean_token_accuracy": 0.11978099420666695, "num_tokens": 10027619.0, "step": 4630 }, { "entropy": 6.654353475570678, "epoch": 0.49601369789715877, "grad_norm": 1.15625, "learning_rate": 0.000498286239405733, "loss": 6.5454, "mean_token_accuracy": 0.12450932785868644, "num_tokens": 10037551.0, "step": 4635 }, { "entropy": 6.672497034072876, "epoch": 0.4965487720049227, "grad_norm": 1.1171875, "learning_rate": 0.000498281526270861, "loss": 6.5851, "mean_token_accuracy": 0.13364579305052757, "num_tokens": 10047771.0, "step": 4640 }, { "entropy": 6.803449487686157, "epoch": 0.49708384611268663, "grad_norm": 1.203125, "learning_rate": 0.0004982768066887663, "loss": 6.7076, "mean_token_accuracy": 0.112837415933609, "num_tokens": 10058771.0, "step": 4645 }, { "entropy": 6.723805093765259, "epoch": 0.4976189202204505, "grad_norm": 1.2109375, "learning_rate": 0.0004982720806595851, "loss": 6.5841, "mean_token_accuracy": 0.12232825830578804, "num_tokens": 10070318.0, "step": 4650 }, { "entropy": 6.68502402305603, "epoch": 0.49815399432821444, "grad_norm": 1.1171875, "learning_rate": 0.0004982673481834541, "loss": 6.614, "mean_token_accuracy": 0.11796658039093018, "num_tokens": 10081810.0, "step": 4655 }, { "entropy": 6.6698534965515135, "epoch": 0.4986890684359784, "grad_norm": 1.1953125, "learning_rate": 0.0004982626092605097, "loss": 6.6297, "mean_token_accuracy": 0.11533761844038963, "num_tokens": 10091724.0, "step": 4660 }, { "entropy": 6.763433408737183, "epoch": 0.4992241425437423, "grad_norm": 1.3359375, "learning_rate": 0.0004982578638908888, "loss": 6.6159, "mean_token_accuracy": 0.11898914724588394, "num_tokens": 10102510.0, "step": 4665 }, { "entropy": 6.755692815780639, "epoch": 0.49975921665150624, "grad_norm": 1.2734375, "learning_rate": 0.0004982531120747286, "loss": 6.6781, "mean_token_accuracy": 0.11363844275474548, "num_tokens": 10112636.0, "step": 4670 }, { "entropy": 6.679724454879761, "epoch": 0.5002942907592701, "grad_norm": 1.546875, "learning_rate": 0.000498248353812166, "loss": 6.684, "mean_token_accuracy": 0.11922202631831169, "num_tokens": 10123562.0, "step": 4675 }, { "entropy": 6.720367956161499, "epoch": 0.5008293648670341, "grad_norm": 1.234375, "learning_rate": 0.0004982435891033387, "loss": 6.6344, "mean_token_accuracy": 0.11208936050534249, "num_tokens": 10134731.0, "step": 4680 }, { "entropy": 6.773916530609131, "epoch": 0.501364438974798, "grad_norm": 1.2265625, "learning_rate": 0.000498238817948384, "loss": 6.6307, "mean_token_accuracy": 0.11377799212932586, "num_tokens": 10145232.0, "step": 4685 }, { "entropy": 6.715243864059448, "epoch": 0.501899513082562, "grad_norm": 1.3671875, "learning_rate": 0.0004982340403474398, "loss": 6.601, "mean_token_accuracy": 0.11478810831904411, "num_tokens": 10155857.0, "step": 4690 }, { "entropy": 6.7384484767913815, "epoch": 0.5024345871903259, "grad_norm": 1.1796875, "learning_rate": 0.0004982292563006441, "loss": 6.6107, "mean_token_accuracy": 0.12016694247722626, "num_tokens": 10166145.0, "step": 4695 }, { "entropy": 6.8165631771087645, "epoch": 0.5029696612980897, "grad_norm": 1.2421875, "learning_rate": 0.000498224465808135, "loss": 6.7341, "mean_token_accuracy": 0.10747307166457176, "num_tokens": 10177086.0, "step": 4700 }, { "entropy": 6.807919645309449, "epoch": 0.5035047354058537, "grad_norm": 1.6015625, "learning_rate": 0.0004982196688700509, "loss": 6.6168, "mean_token_accuracy": 0.11652338951826095, "num_tokens": 10187120.0, "step": 4705 }, { "entropy": 6.746653747558594, "epoch": 0.5040398095136176, "grad_norm": 1.3359375, "learning_rate": 0.0004982148654865302, "loss": 6.6816, "mean_token_accuracy": 0.1173696868121624, "num_tokens": 10197784.0, "step": 4710 }, { "entropy": 6.769271898269653, "epoch": 0.5045748836213816, "grad_norm": 1.1875, "learning_rate": 0.0004982100556577115, "loss": 6.5533, "mean_token_accuracy": 0.12568439543247223, "num_tokens": 10209373.0, "step": 4715 }, { "entropy": 6.758709573745728, "epoch": 0.5051099577291455, "grad_norm": 1.328125, "learning_rate": 0.0004982052393837338, "loss": 6.669, "mean_token_accuracy": 0.11871311962604522, "num_tokens": 10220316.0, "step": 4720 }, { "entropy": 6.6824239730834964, "epoch": 0.5056450318369095, "grad_norm": 1.2265625, "learning_rate": 0.0004982004166647363, "loss": 6.5571, "mean_token_accuracy": 0.12401916012167931, "num_tokens": 10230478.0, "step": 4725 }, { "entropy": 6.623062801361084, "epoch": 0.5061801059446733, "grad_norm": 1.1796875, "learning_rate": 0.0004981955875008582, "loss": 6.6518, "mean_token_accuracy": 0.11519326344132423, "num_tokens": 10240641.0, "step": 4730 }, { "entropy": 6.744868040084839, "epoch": 0.5067151800524372, "grad_norm": 1.2578125, "learning_rate": 0.0004981907518922387, "loss": 6.6428, "mean_token_accuracy": 0.12281770035624504, "num_tokens": 10250676.0, "step": 4735 }, { "entropy": 6.859378337860107, "epoch": 0.5072502541602012, "grad_norm": 1.9765625, "learning_rate": 0.0004981859098390177, "loss": 6.7032, "mean_token_accuracy": 0.11514592617750168, "num_tokens": 10262016.0, "step": 4740 }, { "entropy": 6.7457503318786625, "epoch": 0.5077853282679651, "grad_norm": 1.3046875, "learning_rate": 0.0004981810613413348, "loss": 6.6448, "mean_token_accuracy": 0.12012371569871902, "num_tokens": 10271985.0, "step": 4745 }, { "entropy": 6.745742273330689, "epoch": 0.5083204023757291, "grad_norm": 1.2734375, "learning_rate": 0.0004981762063993302, "loss": 6.6133, "mean_token_accuracy": 0.12136726751923561, "num_tokens": 10282156.0, "step": 4750 }, { "entropy": 6.716922092437744, "epoch": 0.5088554764834929, "grad_norm": 1.34375, "learning_rate": 0.000498171345013144, "loss": 6.611, "mean_token_accuracy": 0.11782191470265388, "num_tokens": 10292576.0, "step": 4755 }, { "entropy": 6.661800575256348, "epoch": 0.5093905505912569, "grad_norm": 1.6640625, "learning_rate": 0.0004981664771829165, "loss": 6.6254, "mean_token_accuracy": 0.1142365463078022, "num_tokens": 10303648.0, "step": 4760 }, { "entropy": 6.715044784545898, "epoch": 0.5099256246990208, "grad_norm": 1.2734375, "learning_rate": 0.0004981616029087884, "loss": 6.5102, "mean_token_accuracy": 0.12722289934754372, "num_tokens": 10314275.0, "step": 4765 }, { "entropy": 6.675028467178345, "epoch": 0.5104606988067847, "grad_norm": 1.3515625, "learning_rate": 0.0004981567221909004, "loss": 6.6398, "mean_token_accuracy": 0.11122743040323257, "num_tokens": 10325386.0, "step": 4770 }, { "entropy": 6.712424802780151, "epoch": 0.5109957729145487, "grad_norm": 1.8828125, "learning_rate": 0.0004981518350293935, "loss": 6.6132, "mean_token_accuracy": 0.11537306159734725, "num_tokens": 10335041.0, "step": 4775 }, { "entropy": 6.743242788314819, "epoch": 0.5115308470223126, "grad_norm": 1.6796875, "learning_rate": 0.0004981469414244086, "loss": 6.5693, "mean_token_accuracy": 0.12268173769116401, "num_tokens": 10345746.0, "step": 4780 }, { "entropy": 6.624886989593506, "epoch": 0.5120659211300765, "grad_norm": 1.25, "learning_rate": 0.000498142041376087, "loss": 6.6945, "mean_token_accuracy": 0.11829338818788529, "num_tokens": 10356995.0, "step": 4785 }, { "entropy": 6.7250689506530765, "epoch": 0.5126009952378404, "grad_norm": 1.359375, "learning_rate": 0.0004981371348845705, "loss": 6.5939, "mean_token_accuracy": 0.1246476911008358, "num_tokens": 10368445.0, "step": 4790 }, { "entropy": 6.810773944854736, "epoch": 0.5131360693456044, "grad_norm": 1.1875, "learning_rate": 0.0004981322219500006, "loss": 6.5364, "mean_token_accuracy": 0.1264880530536175, "num_tokens": 10378256.0, "step": 4795 }, { "entropy": 6.698590278625488, "epoch": 0.5136711434533683, "grad_norm": 1.328125, "learning_rate": 0.000498127302572519, "loss": 6.6306, "mean_token_accuracy": 0.11948861032724381, "num_tokens": 10388698.0, "step": 4800 }, { "entropy": 6.626500415802002, "epoch": 0.5142062175611322, "grad_norm": 1.3203125, "learning_rate": 0.0004981223767522679, "loss": 6.6314, "mean_token_accuracy": 0.12543342038989067, "num_tokens": 10399975.0, "step": 4805 }, { "entropy": 6.73018741607666, "epoch": 0.5147412916688962, "grad_norm": 1.234375, "learning_rate": 0.0004981174444893896, "loss": 6.632, "mean_token_accuracy": 0.11657147109508514, "num_tokens": 10410480.0, "step": 4810 }, { "entropy": 6.754246234893799, "epoch": 0.51527636577666, "grad_norm": 1.484375, "learning_rate": 0.0004981125057840264, "loss": 6.5903, "mean_token_accuracy": 0.12315746694803238, "num_tokens": 10421023.0, "step": 4815 }, { "entropy": 6.691860723495483, "epoch": 0.515811439884424, "grad_norm": 1.34375, "learning_rate": 0.000498107560636321, "loss": 6.6376, "mean_token_accuracy": 0.11937036588788033, "num_tokens": 10431152.0, "step": 4820 }, { "entropy": 6.669547367095947, "epoch": 0.5163465139921879, "grad_norm": 1.375, "learning_rate": 0.0004981026090464161, "loss": 6.5395, "mean_token_accuracy": 0.11537841185927392, "num_tokens": 10441986.0, "step": 4825 }, { "entropy": 6.76296591758728, "epoch": 0.5168815880999519, "grad_norm": 1.515625, "learning_rate": 0.0004980976510144548, "loss": 6.6294, "mean_token_accuracy": 0.11330693066120148, "num_tokens": 10452932.0, "step": 4830 }, { "entropy": 6.730077743530273, "epoch": 0.5174166622077158, "grad_norm": 1.1875, "learning_rate": 0.0004980926865405801, "loss": 6.7059, "mean_token_accuracy": 0.1165323257446289, "num_tokens": 10463411.0, "step": 4835 }, { "entropy": 6.755215454101562, "epoch": 0.5179517363154797, "grad_norm": 1.3203125, "learning_rate": 0.0004980877156249354, "loss": 6.5955, "mean_token_accuracy": 0.12119976133108139, "num_tokens": 10474820.0, "step": 4840 }, { "entropy": 6.693712377548218, "epoch": 0.5184868104232436, "grad_norm": 1.3671875, "learning_rate": 0.0004980827382676643, "loss": 6.5956, "mean_token_accuracy": 0.12424970418214798, "num_tokens": 10485701.0, "step": 4845 }, { "entropy": 6.697637557983398, "epoch": 0.5190218845310075, "grad_norm": 1.375, "learning_rate": 0.0004980777544689105, "loss": 6.5925, "mean_token_accuracy": 0.12146328687667847, "num_tokens": 10495825.0, "step": 4850 }, { "entropy": 6.6988880157470705, "epoch": 0.5195569586387715, "grad_norm": 1.265625, "learning_rate": 0.0004980727642288178, "loss": 6.5759, "mean_token_accuracy": 0.12025154009461403, "num_tokens": 10505847.0, "step": 4855 }, { "entropy": 6.712225770950317, "epoch": 0.5200920327465354, "grad_norm": 1.359375, "learning_rate": 0.0004980677675475305, "loss": 6.6367, "mean_token_accuracy": 0.11677327230572701, "num_tokens": 10516596.0, "step": 4860 }, { "entropy": 6.733681726455688, "epoch": 0.5206271068542994, "grad_norm": 1.3203125, "learning_rate": 0.0004980627644251926, "loss": 6.5497, "mean_token_accuracy": 0.1293226294219494, "num_tokens": 10528175.0, "step": 4865 }, { "entropy": 6.651979970932007, "epoch": 0.5211621809620632, "grad_norm": 1.3203125, "learning_rate": 0.0004980577548619489, "loss": 6.6329, "mean_token_accuracy": 0.11742270663380623, "num_tokens": 10540076.0, "step": 4870 }, { "entropy": 6.686881160736084, "epoch": 0.5216972550698272, "grad_norm": 1.25, "learning_rate": 0.0004980527388579437, "loss": 6.6555, "mean_token_accuracy": 0.11610461995005608, "num_tokens": 10552025.0, "step": 4875 }, { "entropy": 6.746124219894409, "epoch": 0.5222323291775911, "grad_norm": 1.1875, "learning_rate": 0.0004980477164133221, "loss": 6.6528, "mean_token_accuracy": 0.11348175257444382, "num_tokens": 10562535.0, "step": 4880 }, { "entropy": 6.723954057693481, "epoch": 0.522767403285355, "grad_norm": 1.2421875, "learning_rate": 0.000498042687528229, "loss": 6.574, "mean_token_accuracy": 0.12090551033616066, "num_tokens": 10572989.0, "step": 4885 }, { "entropy": 6.658336591720581, "epoch": 0.523302477393119, "grad_norm": 1.234375, "learning_rate": 0.0004980376522028098, "loss": 6.6058, "mean_token_accuracy": 0.12160259932279587, "num_tokens": 10583033.0, "step": 4890 }, { "entropy": 6.734746789932251, "epoch": 0.5238375515008828, "grad_norm": 1.6015625, "learning_rate": 0.0004980326104372095, "loss": 6.6853, "mean_token_accuracy": 0.11474591270089149, "num_tokens": 10595205.0, "step": 4895 }, { "entropy": 6.786480188369751, "epoch": 0.5243726256086468, "grad_norm": 1.4609375, "learning_rate": 0.000498027562231574, "loss": 6.5392, "mean_token_accuracy": 0.12003358751535416, "num_tokens": 10605244.0, "step": 4900 }, { "entropy": 6.718193483352661, "epoch": 0.5249076997164107, "grad_norm": 1.21875, "learning_rate": 0.000498022507586049, "loss": 6.6214, "mean_token_accuracy": 0.11722708195447921, "num_tokens": 10615817.0, "step": 4905 }, { "entropy": 6.725398159027099, "epoch": 0.5254427738241747, "grad_norm": 1.2265625, "learning_rate": 0.0004980174465007804, "loss": 6.6366, "mean_token_accuracy": 0.11559919267892838, "num_tokens": 10627160.0, "step": 4910 }, { "entropy": 6.766883087158203, "epoch": 0.5259778479319386, "grad_norm": 1.390625, "learning_rate": 0.0004980123789759145, "loss": 6.631, "mean_token_accuracy": 0.12066573053598403, "num_tokens": 10637552.0, "step": 4915 }, { "entropy": 6.666731262207032, "epoch": 0.5265129220397025, "grad_norm": 1.7734375, "learning_rate": 0.0004980073050115973, "loss": 6.6807, "mean_token_accuracy": 0.11911093890666961, "num_tokens": 10648773.0, "step": 4920 }, { "entropy": 6.761361503601075, "epoch": 0.5270479961474664, "grad_norm": 1.40625, "learning_rate": 0.0004980022246079755, "loss": 6.6387, "mean_token_accuracy": 0.1175591915845871, "num_tokens": 10659537.0, "step": 4925 }, { "entropy": 6.820301675796509, "epoch": 0.5275830702552303, "grad_norm": 1.234375, "learning_rate": 0.000497997137765196, "loss": 6.6932, "mean_token_accuracy": 0.11372315660119056, "num_tokens": 10671390.0, "step": 4930 }, { "entropy": 6.718183946609497, "epoch": 0.5281181443629943, "grad_norm": 1.609375, "learning_rate": 0.0004979920444834054, "loss": 6.5349, "mean_token_accuracy": 0.12883347496390343, "num_tokens": 10682389.0, "step": 4935 }, { "entropy": 6.594164085388184, "epoch": 0.5286532184707582, "grad_norm": 1.296875, "learning_rate": 0.0004979869447627508, "loss": 6.606, "mean_token_accuracy": 0.12021337449550629, "num_tokens": 10692400.0, "step": 4940 }, { "entropy": 6.691273975372314, "epoch": 0.5291882925785222, "grad_norm": 1.2734375, "learning_rate": 0.0004979818386033795, "loss": 6.526, "mean_token_accuracy": 0.12336401715874672, "num_tokens": 10702396.0, "step": 4945 }, { "entropy": 6.723889923095703, "epoch": 0.5297233666862861, "grad_norm": 1.7265625, "learning_rate": 0.000497976726005439, "loss": 6.6549, "mean_token_accuracy": 0.11776790469884872, "num_tokens": 10712863.0, "step": 4950 }, { "entropy": 6.707800340652466, "epoch": 0.5302584407940499, "grad_norm": 1.2109375, "learning_rate": 0.0004979716069690768, "loss": 6.6556, "mean_token_accuracy": 0.11826993152499199, "num_tokens": 10724234.0, "step": 4955 }, { "entropy": 6.8028627872467045, "epoch": 0.5307935149018139, "grad_norm": 2.09375, "learning_rate": 0.0004979664814944409, "loss": 6.6898, "mean_token_accuracy": 0.11730713248252869, "num_tokens": 10734405.0, "step": 4960 }, { "entropy": 6.796906423568726, "epoch": 0.5313285890095778, "grad_norm": 1.40625, "learning_rate": 0.0004979613495816791, "loss": 6.6269, "mean_token_accuracy": 0.11673597991466522, "num_tokens": 10744573.0, "step": 4965 }, { "entropy": 6.81073899269104, "epoch": 0.5318636631173418, "grad_norm": 1.6171875, "learning_rate": 0.0004979562112309397, "loss": 6.6701, "mean_token_accuracy": 0.12054512575268746, "num_tokens": 10755555.0, "step": 4970 }, { "entropy": 6.69157977104187, "epoch": 0.5323987372251057, "grad_norm": 1.1640625, "learning_rate": 0.000497951066442371, "loss": 6.6797, "mean_token_accuracy": 0.11503533869981766, "num_tokens": 10766493.0, "step": 4975 }, { "entropy": 6.757311391830444, "epoch": 0.5329338113328697, "grad_norm": 1.3984375, "learning_rate": 0.0004979459152161215, "loss": 6.6385, "mean_token_accuracy": 0.11236128360033035, "num_tokens": 10776735.0, "step": 4980 }, { "entropy": 6.700515174865723, "epoch": 0.5334688854406335, "grad_norm": 1.2578125, "learning_rate": 0.0004979407575523402, "loss": 6.6145, "mean_token_accuracy": 0.12050373330712319, "num_tokens": 10787500.0, "step": 4985 }, { "entropy": 6.703393936157227, "epoch": 0.5340039595483974, "grad_norm": 1.609375, "learning_rate": 0.0004979355934511757, "loss": 6.6344, "mean_token_accuracy": 0.12052067667245865, "num_tokens": 10798002.0, "step": 4990 }, { "entropy": 6.75645604133606, "epoch": 0.5345390336561614, "grad_norm": 1.375, "learning_rate": 0.0004979304229127773, "loss": 6.6112, "mean_token_accuracy": 0.11992594972252846, "num_tokens": 10808982.0, "step": 4995 }, { "entropy": 6.736630868911743, "epoch": 0.5350741077639253, "grad_norm": 1.2421875, "learning_rate": 0.0004979252459372944, "loss": 6.5706, "mean_token_accuracy": 0.11807732656598091, "num_tokens": 10821619.0, "step": 5000 }, { "entropy": 6.699893808364868, "epoch": 0.5356091818716893, "grad_norm": 1.390625, "learning_rate": 0.0004979200625248761, "loss": 6.5904, "mean_token_accuracy": 0.12047486156225204, "num_tokens": 10832344.0, "step": 5005 }, { "entropy": 6.670212745666504, "epoch": 0.5361442559794531, "grad_norm": 1.4296875, "learning_rate": 0.0004979148726756725, "loss": 6.5571, "mean_token_accuracy": 0.11860336735844612, "num_tokens": 10843149.0, "step": 5010 }, { "entropy": 6.675074863433838, "epoch": 0.5366793300872171, "grad_norm": 1.6171875, "learning_rate": 0.0004979096763898333, "loss": 6.5998, "mean_token_accuracy": 0.12452303320169449, "num_tokens": 10854590.0, "step": 5015 }, { "entropy": 6.791008424758911, "epoch": 0.537214404194981, "grad_norm": 1.78125, "learning_rate": 0.0004979044736675084, "loss": 6.5671, "mean_token_accuracy": 0.11767032742500305, "num_tokens": 10865500.0, "step": 5020 }, { "entropy": 6.680721569061279, "epoch": 0.5377494783027449, "grad_norm": 1.9375, "learning_rate": 0.0004978992645088483, "loss": 6.6021, "mean_token_accuracy": 0.12172115072607995, "num_tokens": 10876866.0, "step": 5025 }, { "entropy": 6.5734340190887455, "epoch": 0.5382845524105089, "grad_norm": 1.265625, "learning_rate": 0.000497894048914003, "loss": 6.5612, "mean_token_accuracy": 0.11841940134763718, "num_tokens": 10888627.0, "step": 5030 }, { "entropy": 6.746210193634033, "epoch": 0.5388196265182728, "grad_norm": 1.9921875, "learning_rate": 0.0004978888268831236, "loss": 6.6696, "mean_token_accuracy": 0.11132773160934448, "num_tokens": 10900992.0, "step": 5035 }, { "entropy": 6.842794561386109, "epoch": 0.5393547006260367, "grad_norm": 1.40625, "learning_rate": 0.0004978835984163606, "loss": 6.7276, "mean_token_accuracy": 0.10932021215558052, "num_tokens": 10912323.0, "step": 5040 }, { "entropy": 6.800081539154053, "epoch": 0.5398897747338006, "grad_norm": 1.5078125, "learning_rate": 0.0004978783635138649, "loss": 6.6771, "mean_token_accuracy": 0.11647720038890838, "num_tokens": 10923991.0, "step": 5045 }, { "entropy": 6.639073657989502, "epoch": 0.5404248488415646, "grad_norm": 1.34375, "learning_rate": 0.0004978731221757878, "loss": 6.5041, "mean_token_accuracy": 0.12417407482862472, "num_tokens": 10934081.0, "step": 5050 }, { "entropy": 6.727223587036133, "epoch": 0.5409599229493285, "grad_norm": 1.5546875, "learning_rate": 0.0004978678744022808, "loss": 6.6006, "mean_token_accuracy": 0.117810919880867, "num_tokens": 10944729.0, "step": 5055 }, { "entropy": 6.709056615829468, "epoch": 0.5414949970570924, "grad_norm": 1.296875, "learning_rate": 0.000497862620193495, "loss": 6.6635, "mean_token_accuracy": 0.11320299580693245, "num_tokens": 10955708.0, "step": 5060 }, { "entropy": 6.72125997543335, "epoch": 0.5420300711648564, "grad_norm": 1.40625, "learning_rate": 0.0004978573595495826, "loss": 6.6002, "mean_token_accuracy": 0.11878297626972198, "num_tokens": 10966427.0, "step": 5065 }, { "entropy": 6.740125894546509, "epoch": 0.5425651452726202, "grad_norm": 1.9140625, "learning_rate": 0.000497852092470695, "loss": 6.6485, "mean_token_accuracy": 0.11773342937231064, "num_tokens": 10977741.0, "step": 5070 }, { "entropy": 6.7118854999542235, "epoch": 0.5431002193803842, "grad_norm": 1.5390625, "learning_rate": 0.0004978468189569847, "loss": 6.5956, "mean_token_accuracy": 0.12482826039195061, "num_tokens": 10989127.0, "step": 5075 }, { "entropy": 6.6592412948608395, "epoch": 0.5436352934881481, "grad_norm": 1.9140625, "learning_rate": 0.0004978415390086038, "loss": 6.6217, "mean_token_accuracy": 0.11322500184178352, "num_tokens": 10999791.0, "step": 5080 }, { "entropy": 6.783138751983643, "epoch": 0.5441703675959121, "grad_norm": 1.3515625, "learning_rate": 0.0004978362526257047, "loss": 6.6783, "mean_token_accuracy": 0.11360784098505974, "num_tokens": 11010045.0, "step": 5085 }, { "entropy": 6.735276794433593, "epoch": 0.544705441703676, "grad_norm": 1.515625, "learning_rate": 0.0004978309598084403, "loss": 6.6067, "mean_token_accuracy": 0.11822862327098846, "num_tokens": 11020729.0, "step": 5090 }, { "entropy": 6.708194351196289, "epoch": 0.5452405158114398, "grad_norm": 1.40625, "learning_rate": 0.0004978256605569631, "loss": 6.6289, "mean_token_accuracy": 0.1177783451974392, "num_tokens": 11030641.0, "step": 5095 }, { "entropy": 6.784500598907471, "epoch": 0.5457755899192038, "grad_norm": 1.3515625, "learning_rate": 0.0004978203548714262, "loss": 6.6366, "mean_token_accuracy": 0.12379909828305244, "num_tokens": 11041533.0, "step": 5100 }, { "entropy": 6.726690483093262, "epoch": 0.5463106640269677, "grad_norm": 1.265625, "learning_rate": 0.000497815042751983, "loss": 6.58, "mean_token_accuracy": 0.11729968935251237, "num_tokens": 11052170.0, "step": 5105 }, { "entropy": 6.652199029922485, "epoch": 0.5468457381347317, "grad_norm": 1.2421875, "learning_rate": 0.0004978097241987868, "loss": 6.5646, "mean_token_accuracy": 0.1203967772424221, "num_tokens": 11062872.0, "step": 5110 }, { "entropy": 6.719713973999023, "epoch": 0.5473808122424956, "grad_norm": 1.390625, "learning_rate": 0.000497804399211991, "loss": 6.6657, "mean_token_accuracy": 0.11651256605982781, "num_tokens": 11074199.0, "step": 5115 }, { "entropy": 6.7464769840240475, "epoch": 0.5479158863502596, "grad_norm": 1.3046875, "learning_rate": 0.0004977990677917495, "loss": 6.6129, "mean_token_accuracy": 0.11894905865192414, "num_tokens": 11083881.0, "step": 5120 }, { "entropy": 6.6402746677398685, "epoch": 0.5484509604580234, "grad_norm": 1.328125, "learning_rate": 0.0004977937299382162, "loss": 6.6584, "mean_token_accuracy": 0.1151296466588974, "num_tokens": 11094374.0, "step": 5125 }, { "entropy": 6.679858827590943, "epoch": 0.5489860345657873, "grad_norm": 3.578125, "learning_rate": 0.0004977883856515453, "loss": 6.4958, "mean_token_accuracy": 0.1267719380557537, "num_tokens": 11105174.0, "step": 5130 }, { "entropy": 6.751749181747437, "epoch": 0.5495211086735513, "grad_norm": 1.3984375, "learning_rate": 0.000497783034931891, "loss": 6.656, "mean_token_accuracy": 0.11584192886948586, "num_tokens": 11117223.0, "step": 5135 }, { "entropy": 6.7202818393707275, "epoch": 0.5500561827813152, "grad_norm": 1.5234375, "learning_rate": 0.000497777677779408, "loss": 6.579, "mean_token_accuracy": 0.12366545721888542, "num_tokens": 11127240.0, "step": 5140 }, { "entropy": 6.676993894577026, "epoch": 0.5505912568890792, "grad_norm": 1.3828125, "learning_rate": 0.0004977723141942509, "loss": 6.5678, "mean_token_accuracy": 0.1281234510242939, "num_tokens": 11137287.0, "step": 5145 }, { "entropy": 6.7371532917022705, "epoch": 0.551126330996843, "grad_norm": 1.2578125, "learning_rate": 0.0004977669441765743, "loss": 6.7007, "mean_token_accuracy": 0.11768926754593849, "num_tokens": 11148988.0, "step": 5150 }, { "entropy": 6.705612564086914, "epoch": 0.551661405104607, "grad_norm": 1.2734375, "learning_rate": 0.0004977615677265336, "loss": 6.6389, "mean_token_accuracy": 0.12069165110588073, "num_tokens": 11159874.0, "step": 5155 }, { "entropy": 6.73426923751831, "epoch": 0.5521964792123709, "grad_norm": 1.671875, "learning_rate": 0.000497756184844284, "loss": 6.6121, "mean_token_accuracy": 0.12401502057909966, "num_tokens": 11170703.0, "step": 5160 }, { "entropy": 6.744797801971435, "epoch": 0.5527315533201348, "grad_norm": 1.21875, "learning_rate": 0.0004977507955299809, "loss": 6.5001, "mean_token_accuracy": 0.1257123127579689, "num_tokens": 11182230.0, "step": 5165 }, { "entropy": 6.698776006698608, "epoch": 0.5532666274278988, "grad_norm": 1.4140625, "learning_rate": 0.0004977453997837797, "loss": 6.5677, "mean_token_accuracy": 0.10981405228376388, "num_tokens": 11192897.0, "step": 5170 }, { "entropy": 6.682893180847168, "epoch": 0.5538017015356627, "grad_norm": 1.2578125, "learning_rate": 0.0004977399976058366, "loss": 6.6521, "mean_token_accuracy": 0.11399049237370491, "num_tokens": 11203942.0, "step": 5175 }, { "entropy": 6.743161678314209, "epoch": 0.5543367756434266, "grad_norm": 1.203125, "learning_rate": 0.0004977345889963072, "loss": 6.7014, "mean_token_accuracy": 0.11261942982673645, "num_tokens": 11214361.0, "step": 5180 }, { "entropy": 6.6744081497192385, "epoch": 0.5548718497511905, "grad_norm": 1.2890625, "learning_rate": 0.0004977291739553479, "loss": 6.5902, "mean_token_accuracy": 0.12366337925195695, "num_tokens": 11225928.0, "step": 5185 }, { "entropy": 6.682669401168823, "epoch": 0.5554069238589545, "grad_norm": 1.03125, "learning_rate": 0.0004977237524831149, "loss": 6.5444, "mean_token_accuracy": 0.11170822679996491, "num_tokens": 11236660.0, "step": 5190 }, { "entropy": 6.714070177078247, "epoch": 0.5559419979667184, "grad_norm": 1.2734375, "learning_rate": 0.0004977183245797649, "loss": 6.5723, "mean_token_accuracy": 0.1271256498992443, "num_tokens": 11247272.0, "step": 5195 }, { "entropy": 6.77830867767334, "epoch": 0.5564770720744823, "grad_norm": 1.2734375, "learning_rate": 0.0004977128902454547, "loss": 6.6722, "mean_token_accuracy": 0.11327713802456855, "num_tokens": 11258472.0, "step": 5200 }, { "entropy": 6.7154069423675535, "epoch": 0.5570121461822463, "grad_norm": 1.3046875, "learning_rate": 0.0004977074494803409, "loss": 6.5841, "mean_token_accuracy": 0.1255582146346569, "num_tokens": 11268344.0, "step": 5205 }, { "entropy": 6.722737216949463, "epoch": 0.5575472202900101, "grad_norm": 1.2734375, "learning_rate": 0.0004977020022845809, "loss": 6.6762, "mean_token_accuracy": 0.11227439492940902, "num_tokens": 11279931.0, "step": 5210 }, { "entropy": 6.80668683052063, "epoch": 0.5580822943977741, "grad_norm": 1.3125, "learning_rate": 0.0004976965486583318, "loss": 6.6255, "mean_token_accuracy": 0.11421727836132049, "num_tokens": 11290595.0, "step": 5215 }, { "entropy": 6.7050305843353275, "epoch": 0.558617368505538, "grad_norm": 1.6015625, "learning_rate": 0.0004976910886017513, "loss": 6.6411, "mean_token_accuracy": 0.12072176486253738, "num_tokens": 11300774.0, "step": 5220 }, { "entropy": 6.6693981170654295, "epoch": 0.559152442613302, "grad_norm": 1.75, "learning_rate": 0.0004976856221149969, "loss": 6.5309, "mean_token_accuracy": 0.12517891749739646, "num_tokens": 11310288.0, "step": 5225 }, { "entropy": 6.700547170639038, "epoch": 0.5596875167210659, "grad_norm": 1.1484375, "learning_rate": 0.0004976801491982263, "loss": 6.6109, "mean_token_accuracy": 0.11751497983932495, "num_tokens": 11321599.0, "step": 5230 }, { "entropy": 6.786514472961426, "epoch": 0.5602225908288297, "grad_norm": 1.3828125, "learning_rate": 0.0004976746698515977, "loss": 6.6606, "mean_token_accuracy": 0.11887592300772667, "num_tokens": 11331383.0, "step": 5235 }, { "entropy": 6.712525081634522, "epoch": 0.5607576649365937, "grad_norm": 1.2421875, "learning_rate": 0.0004976691840752694, "loss": 6.6195, "mean_token_accuracy": 0.11564537510275841, "num_tokens": 11342085.0, "step": 5240 }, { "entropy": 6.718255138397216, "epoch": 0.5612927390443576, "grad_norm": 1.171875, "learning_rate": 0.0004976636918693996, "loss": 6.6574, "mean_token_accuracy": 0.11577147841453553, "num_tokens": 11354061.0, "step": 5245 }, { "entropy": 6.779119157791138, "epoch": 0.5618278131521216, "grad_norm": 1.3125, "learning_rate": 0.0004976581932341471, "loss": 6.6136, "mean_token_accuracy": 0.12151364013552665, "num_tokens": 11364448.0, "step": 5250 }, { "entropy": 6.769805908203125, "epoch": 0.5623628872598855, "grad_norm": 1.3046875, "learning_rate": 0.0004976526881696706, "loss": 6.5791, "mean_token_accuracy": 0.12037570253014565, "num_tokens": 11374838.0, "step": 5255 }, { "entropy": 6.629622316360473, "epoch": 0.5628979613676495, "grad_norm": 1.25, "learning_rate": 0.0004976471766761288, "loss": 6.6105, "mean_token_accuracy": 0.12379851192235947, "num_tokens": 11385310.0, "step": 5260 }, { "entropy": 6.691438817977906, "epoch": 0.5634330354754133, "grad_norm": 1.6328125, "learning_rate": 0.0004976416587536812, "loss": 6.6142, "mean_token_accuracy": 0.11430059969425202, "num_tokens": 11396590.0, "step": 5265 }, { "entropy": 6.742701053619385, "epoch": 0.5639681095831772, "grad_norm": 1.1875, "learning_rate": 0.0004976361344024871, "loss": 6.5707, "mean_token_accuracy": 0.12226603850722313, "num_tokens": 11407218.0, "step": 5270 }, { "entropy": 6.652452564239502, "epoch": 0.5645031836909412, "grad_norm": 1.5078125, "learning_rate": 0.0004976306036227056, "loss": 6.5931, "mean_token_accuracy": 0.11696631386876107, "num_tokens": 11417716.0, "step": 5275 }, { "entropy": 6.721119165420532, "epoch": 0.5650382577987051, "grad_norm": 1.3515625, "learning_rate": 0.000497625066414497, "loss": 6.6823, "mean_token_accuracy": 0.11784773990511895, "num_tokens": 11428295.0, "step": 5280 }, { "entropy": 6.797392892837524, "epoch": 0.5655733319064691, "grad_norm": 1.21875, "learning_rate": 0.0004976195227780207, "loss": 6.6173, "mean_token_accuracy": 0.11284109130501747, "num_tokens": 11439044.0, "step": 5285 }, { "entropy": 6.779853343963623, "epoch": 0.566108406014233, "grad_norm": 1.3515625, "learning_rate": 0.0004976139727134371, "loss": 6.5497, "mean_token_accuracy": 0.11817987859249116, "num_tokens": 11450029.0, "step": 5290 }, { "entropy": 6.715458774566651, "epoch": 0.566643480121997, "grad_norm": 1.21875, "learning_rate": 0.0004976084162209062, "loss": 6.7264, "mean_token_accuracy": 0.10616886764764785, "num_tokens": 11461190.0, "step": 5295 }, { "entropy": 6.745611715316772, "epoch": 0.5671785542297608, "grad_norm": 1.2421875, "learning_rate": 0.0004976028533005886, "loss": 6.5772, "mean_token_accuracy": 0.11882699206471443, "num_tokens": 11472143.0, "step": 5300 }, { "entropy": 6.771622133255005, "epoch": 0.5677136283375247, "grad_norm": 1.4765625, "learning_rate": 0.0004975972839526449, "loss": 6.7163, "mean_token_accuracy": 0.1069483369588852, "num_tokens": 11483745.0, "step": 5305 }, { "entropy": 6.7719972133636475, "epoch": 0.5682487024452887, "grad_norm": 1.265625, "learning_rate": 0.0004975917081772358, "loss": 6.5791, "mean_token_accuracy": 0.1188987985253334, "num_tokens": 11495695.0, "step": 5310 }, { "entropy": 6.718594884872436, "epoch": 0.5687837765530526, "grad_norm": 1.4140625, "learning_rate": 0.0004975861259745225, "loss": 6.6224, "mean_token_accuracy": 0.11705151796340943, "num_tokens": 11505576.0, "step": 5315 }, { "entropy": 6.661882305145264, "epoch": 0.5693188506608166, "grad_norm": 1.34375, "learning_rate": 0.0004975805373446662, "loss": 6.479, "mean_token_accuracy": 0.12648551389575005, "num_tokens": 11516614.0, "step": 5320 }, { "entropy": 6.7097954750061035, "epoch": 0.5698539247685804, "grad_norm": 1.359375, "learning_rate": 0.000497574942287828, "loss": 6.6111, "mean_token_accuracy": 0.11843594536185265, "num_tokens": 11528032.0, "step": 5325 }, { "entropy": 6.664940547943115, "epoch": 0.5703889988763444, "grad_norm": 1.609375, "learning_rate": 0.0004975693408041697, "loss": 6.6154, "mean_token_accuracy": 0.11421292722225189, "num_tokens": 11538822.0, "step": 5330 }, { "entropy": 6.699612236022949, "epoch": 0.5709240729841083, "grad_norm": 1.34375, "learning_rate": 0.0004975637328938529, "loss": 6.6399, "mean_token_accuracy": 0.11097949370741844, "num_tokens": 11548895.0, "step": 5335 }, { "entropy": 6.714142751693726, "epoch": 0.5714591470918722, "grad_norm": 1.328125, "learning_rate": 0.0004975581185570398, "loss": 6.5215, "mean_token_accuracy": 0.11886597573757171, "num_tokens": 11559613.0, "step": 5340 }, { "entropy": 6.713043832778931, "epoch": 0.5719942211996362, "grad_norm": 1.1640625, "learning_rate": 0.0004975524977938921, "loss": 6.5537, "mean_token_accuracy": 0.12163764908909798, "num_tokens": 11571092.0, "step": 5345 }, { "entropy": 6.692736101150513, "epoch": 0.5725292953074, "grad_norm": 1.4296875, "learning_rate": 0.0004975468706045722, "loss": 6.6814, "mean_token_accuracy": 0.11672013476490975, "num_tokens": 11581448.0, "step": 5350 }, { "entropy": 6.728510904312134, "epoch": 0.573064369415164, "grad_norm": 1.4375, "learning_rate": 0.0004975412369892429, "loss": 6.58, "mean_token_accuracy": 0.12553823739290237, "num_tokens": 11592273.0, "step": 5355 }, { "entropy": 6.757077264785766, "epoch": 0.5735994435229279, "grad_norm": 1.25, "learning_rate": 0.0004975355969480665, "loss": 6.5555, "mean_token_accuracy": 0.125929856300354, "num_tokens": 11602759.0, "step": 5360 }, { "entropy": 6.640834856033325, "epoch": 0.5741345176306919, "grad_norm": 1.3359375, "learning_rate": 0.0004975299504812061, "loss": 6.608, "mean_token_accuracy": 0.11442179679870605, "num_tokens": 11613977.0, "step": 5365 }, { "entropy": 6.71792254447937, "epoch": 0.5746695917384558, "grad_norm": 1.2734375, "learning_rate": 0.0004975242975888246, "loss": 6.636, "mean_token_accuracy": 0.12084050849080086, "num_tokens": 11625425.0, "step": 5370 }, { "entropy": 6.744046688079834, "epoch": 0.5752046658462197, "grad_norm": 1.3671875, "learning_rate": 0.0004975186382710854, "loss": 6.6071, "mean_token_accuracy": 0.11423679888248443, "num_tokens": 11636530.0, "step": 5375 }, { "entropy": 6.741583633422851, "epoch": 0.5757397399539836, "grad_norm": 1.3125, "learning_rate": 0.0004975129725281516, "loss": 6.5856, "mean_token_accuracy": 0.12342779189348221, "num_tokens": 11646516.0, "step": 5380 }, { "entropy": 6.701775741577149, "epoch": 0.5762748140617475, "grad_norm": 1.2890625, "learning_rate": 0.0004975073003601871, "loss": 6.5849, "mean_token_accuracy": 0.11874212771654129, "num_tokens": 11657424.0, "step": 5385 }, { "entropy": 6.704905319213867, "epoch": 0.5768098881695115, "grad_norm": 1.3125, "learning_rate": 0.0004975016217673556, "loss": 6.599, "mean_token_accuracy": 0.12148372679948807, "num_tokens": 11669447.0, "step": 5390 }, { "entropy": 6.697764110565186, "epoch": 0.5773449622772754, "grad_norm": 1.4140625, "learning_rate": 0.000497495936749821, "loss": 6.5675, "mean_token_accuracy": 0.12611041441559792, "num_tokens": 11679612.0, "step": 5395 }, { "entropy": 6.683344936370849, "epoch": 0.5778800363850394, "grad_norm": 1.3046875, "learning_rate": 0.0004974902453077474, "loss": 6.5514, "mean_token_accuracy": 0.1218061052262783, "num_tokens": 11689527.0, "step": 5400 }, { "entropy": 6.765136861801148, "epoch": 0.5784151104928033, "grad_norm": 1.3671875, "learning_rate": 0.0004974845474412993, "loss": 6.5856, "mean_token_accuracy": 0.12035764157772064, "num_tokens": 11700452.0, "step": 5405 }, { "entropy": 6.700014257431031, "epoch": 0.5789501846005671, "grad_norm": 1.625, "learning_rate": 0.0004974788431506412, "loss": 6.5971, "mean_token_accuracy": 0.1191385418176651, "num_tokens": 11710902.0, "step": 5410 }, { "entropy": 6.735801887512207, "epoch": 0.5794852587083311, "grad_norm": 1.484375, "learning_rate": 0.0004974731324359378, "loss": 6.6328, "mean_token_accuracy": 0.10948319584131241, "num_tokens": 11721901.0, "step": 5415 }, { "entropy": 6.765271472930908, "epoch": 0.580020332816095, "grad_norm": 1.2421875, "learning_rate": 0.0004974674152973538, "loss": 6.6146, "mean_token_accuracy": 0.11682233065366746, "num_tokens": 11733622.0, "step": 5420 }, { "entropy": 6.789870738983154, "epoch": 0.580555406923859, "grad_norm": 1.3359375, "learning_rate": 0.0004974616917350545, "loss": 6.6101, "mean_token_accuracy": 0.11982190161943436, "num_tokens": 11745116.0, "step": 5425 }, { "entropy": 6.661038208007812, "epoch": 0.5810904810316229, "grad_norm": 1.28125, "learning_rate": 0.0004974559617492052, "loss": 6.5446, "mean_token_accuracy": 0.12379105761647224, "num_tokens": 11756203.0, "step": 5430 }, { "entropy": 6.719126272201538, "epoch": 0.5816255551393869, "grad_norm": 1.375, "learning_rate": 0.0004974502253399712, "loss": 6.6041, "mean_token_accuracy": 0.12229030430316926, "num_tokens": 11766797.0, "step": 5435 }, { "entropy": 6.752104377746582, "epoch": 0.5821606292471507, "grad_norm": 1.3359375, "learning_rate": 0.0004974444825075182, "loss": 6.6896, "mean_token_accuracy": 0.11470270082354546, "num_tokens": 11778110.0, "step": 5440 }, { "entropy": 6.6274865627288815, "epoch": 0.5826957033549146, "grad_norm": 1.59375, "learning_rate": 0.000497438733252012, "loss": 6.551, "mean_token_accuracy": 0.12010784074664116, "num_tokens": 11788396.0, "step": 5445 }, { "entropy": 6.7564613819122314, "epoch": 0.5832307774626786, "grad_norm": 2.53125, "learning_rate": 0.0004974329775736188, "loss": 6.6412, "mean_token_accuracy": 0.1130734585225582, "num_tokens": 11798691.0, "step": 5450 }, { "entropy": 6.8176110744476315, "epoch": 0.5837658515704425, "grad_norm": 1.421875, "learning_rate": 0.0004974272154725044, "loss": 6.6809, "mean_token_accuracy": 0.1145077645778656, "num_tokens": 11808965.0, "step": 5455 }, { "entropy": 6.655050134658813, "epoch": 0.5843009256782065, "grad_norm": 1.3359375, "learning_rate": 0.0004974214469488355, "loss": 6.5144, "mean_token_accuracy": 0.12288807928562165, "num_tokens": 11819932.0, "step": 5460 }, { "entropy": 6.678020906448364, "epoch": 0.5848359997859703, "grad_norm": 1.5078125, "learning_rate": 0.0004974156720027786, "loss": 6.6115, "mean_token_accuracy": 0.11556534245610237, "num_tokens": 11831332.0, "step": 5465 }, { "entropy": 6.728974628448486, "epoch": 0.5853710738937343, "grad_norm": 1.53125, "learning_rate": 0.0004974098906345004, "loss": 6.5811, "mean_token_accuracy": 0.11275865510106087, "num_tokens": 11840947.0, "step": 5470 }, { "entropy": 6.7000159740448, "epoch": 0.5859061480014982, "grad_norm": 1.3046875, "learning_rate": 0.0004974041028441679, "loss": 6.5377, "mean_token_accuracy": 0.11802567318081855, "num_tokens": 11851640.0, "step": 5475 }, { "entropy": 6.733285045623779, "epoch": 0.5864412221092621, "grad_norm": 1.375, "learning_rate": 0.0004973983086319481, "loss": 6.6649, "mean_token_accuracy": 0.11307286396622658, "num_tokens": 11863608.0, "step": 5480 }, { "entropy": 6.722926664352417, "epoch": 0.5869762962170261, "grad_norm": 1.125, "learning_rate": 0.0004973925079980085, "loss": 6.5586, "mean_token_accuracy": 0.11841953471302986, "num_tokens": 11874707.0, "step": 5485 }, { "entropy": 6.687315177917481, "epoch": 0.58751137032479, "grad_norm": 1.59375, "learning_rate": 0.0004973867009425164, "loss": 6.659, "mean_token_accuracy": 0.11953919008374214, "num_tokens": 11885118.0, "step": 5490 }, { "entropy": 6.783655786514283, "epoch": 0.5880464444325539, "grad_norm": 1.2578125, "learning_rate": 0.0004973808874656396, "loss": 6.6231, "mean_token_accuracy": 0.11821292191743851, "num_tokens": 11895859.0, "step": 5495 }, { "entropy": 6.7643838882446286, "epoch": 0.5885815185403178, "grad_norm": 1.28125, "learning_rate": 0.0004973750675675458, "loss": 6.64, "mean_token_accuracy": 0.11871552392840386, "num_tokens": 11907019.0, "step": 5500 }, { "entropy": 6.729001569747925, "epoch": 0.5891165926480818, "grad_norm": 1.125, "learning_rate": 0.0004973692412484034, "loss": 6.5712, "mean_token_accuracy": 0.1146469995379448, "num_tokens": 11918257.0, "step": 5505 }, { "entropy": 6.721626091003418, "epoch": 0.5896516667558457, "grad_norm": 1.6015625, "learning_rate": 0.0004973634085083802, "loss": 6.5975, "mean_token_accuracy": 0.12574032694101334, "num_tokens": 11929003.0, "step": 5510 }, { "entropy": 6.757476425170898, "epoch": 0.5901867408636096, "grad_norm": 1.1640625, "learning_rate": 0.000497357569347645, "loss": 6.7213, "mean_token_accuracy": 0.11348426267504692, "num_tokens": 11939786.0, "step": 5515 }, { "entropy": 6.751842021942139, "epoch": 0.5907218149713735, "grad_norm": 1.1640625, "learning_rate": 0.0004973517237663661, "loss": 6.6311, "mean_token_accuracy": 0.11161758229136468, "num_tokens": 11951042.0, "step": 5520 }, { "entropy": 6.710853910446167, "epoch": 0.5912568890791374, "grad_norm": 1.953125, "learning_rate": 0.0004973458717647124, "loss": 6.5283, "mean_token_accuracy": 0.12709658294916154, "num_tokens": 11961982.0, "step": 5525 }, { "entropy": 6.703456449508667, "epoch": 0.5917919631869014, "grad_norm": 1.2890625, "learning_rate": 0.000497340013342853, "loss": 6.5923, "mean_token_accuracy": 0.12106578648090363, "num_tokens": 11972078.0, "step": 5530 }, { "entropy": 6.719264888763428, "epoch": 0.5923270372946653, "grad_norm": 1.609375, "learning_rate": 0.000497334148500957, "loss": 6.6446, "mean_token_accuracy": 0.11806860640645027, "num_tokens": 11984037.0, "step": 5535 }, { "entropy": 6.7681842803955075, "epoch": 0.5928621114024293, "grad_norm": 1.2890625, "learning_rate": 0.0004973282772391936, "loss": 6.5852, "mean_token_accuracy": 0.11801839917898178, "num_tokens": 11993688.0, "step": 5540 }, { "entropy": 6.667469120025634, "epoch": 0.5933971855101932, "grad_norm": 1.328125, "learning_rate": 0.0004973223995577324, "loss": 6.5477, "mean_token_accuracy": 0.11981470957398414, "num_tokens": 12003759.0, "step": 5545 }, { "entropy": 6.715129756927491, "epoch": 0.593932259617957, "grad_norm": 1.3125, "learning_rate": 0.0004973165154567432, "loss": 6.5858, "mean_token_accuracy": 0.1203451156616211, "num_tokens": 12015030.0, "step": 5550 }, { "entropy": 6.72750506401062, "epoch": 0.594467333725721, "grad_norm": 1.140625, "learning_rate": 0.0004973106249363959, "loss": 6.6509, "mean_token_accuracy": 0.11390956789255142, "num_tokens": 12026181.0, "step": 5555 }, { "entropy": 6.618847751617432, "epoch": 0.5950024078334849, "grad_norm": 1.28125, "learning_rate": 0.0004973047279968606, "loss": 6.4185, "mean_token_accuracy": 0.13287391439080237, "num_tokens": 12037336.0, "step": 5560 }, { "entropy": 6.65236268043518, "epoch": 0.5955374819412489, "grad_norm": 1.234375, "learning_rate": 0.0004972988246383074, "loss": 6.4918, "mean_token_accuracy": 0.12340264916419982, "num_tokens": 12048425.0, "step": 5565 }, { "entropy": 6.557363128662109, "epoch": 0.5960725560490128, "grad_norm": 1.65625, "learning_rate": 0.0004972929148609068, "loss": 6.4594, "mean_token_accuracy": 0.13635959550738336, "num_tokens": 12059814.0, "step": 5570 }, { "entropy": 6.68271279335022, "epoch": 0.5966076301567768, "grad_norm": 1.59375, "learning_rate": 0.0004972869986648296, "loss": 6.54, "mean_token_accuracy": 0.12527887672185897, "num_tokens": 12069377.0, "step": 5575 }, { "entropy": 6.707939195632934, "epoch": 0.5971427042645406, "grad_norm": 1.2890625, "learning_rate": 0.0004972810760502467, "loss": 6.666, "mean_token_accuracy": 0.11514274403452873, "num_tokens": 12080277.0, "step": 5580 }, { "entropy": 6.727867317199707, "epoch": 0.5976777783723045, "grad_norm": 1.21875, "learning_rate": 0.0004972751470173287, "loss": 6.5453, "mean_token_accuracy": 0.12022876664996147, "num_tokens": 12091375.0, "step": 5585 }, { "entropy": 6.676542520523071, "epoch": 0.5982128524800685, "grad_norm": 1.203125, "learning_rate": 0.0004972692115662473, "loss": 6.5893, "mean_token_accuracy": 0.11981748417019844, "num_tokens": 12103110.0, "step": 5590 }, { "entropy": 6.751420688629151, "epoch": 0.5987479265878324, "grad_norm": 1.7421875, "learning_rate": 0.0004972632696971735, "loss": 6.6451, "mean_token_accuracy": 0.11599904671311378, "num_tokens": 12112454.0, "step": 5595 }, { "entropy": 6.6340423107147215, "epoch": 0.5992830006955964, "grad_norm": 1.28125, "learning_rate": 0.0004972573214102791, "loss": 6.5246, "mean_token_accuracy": 0.11687616854906083, "num_tokens": 12125140.0, "step": 5600 }, { "entropy": 6.698513317108154, "epoch": 0.5998180748033602, "grad_norm": 1.8046875, "learning_rate": 0.0004972513667057358, "loss": 6.5691, "mean_token_accuracy": 0.12039392963051795, "num_tokens": 12136061.0, "step": 5605 }, { "entropy": 6.791307878494263, "epoch": 0.6003531489111242, "grad_norm": 1.171875, "learning_rate": 0.0004972454055837155, "loss": 6.6003, "mean_token_accuracy": 0.12150818780064583, "num_tokens": 12146654.0, "step": 5610 }, { "entropy": 6.723158931732177, "epoch": 0.6008882230188881, "grad_norm": 1.390625, "learning_rate": 0.0004972394380443903, "loss": 6.5878, "mean_token_accuracy": 0.11757106855511665, "num_tokens": 12157881.0, "step": 5615 }, { "entropy": 6.675697088241577, "epoch": 0.601423297126652, "grad_norm": 1.671875, "learning_rate": 0.0004972334640879325, "loss": 6.6085, "mean_token_accuracy": 0.11922492906451225, "num_tokens": 12168534.0, "step": 5620 }, { "entropy": 6.661304664611817, "epoch": 0.601958371234416, "grad_norm": 1.2421875, "learning_rate": 0.0004972274837145147, "loss": 6.5432, "mean_token_accuracy": 0.11988529115915299, "num_tokens": 12178773.0, "step": 5625 }, { "entropy": 6.739487743377685, "epoch": 0.6024934453421799, "grad_norm": 1.1875, "learning_rate": 0.0004972214969243096, "loss": 6.5808, "mean_token_accuracy": 0.11824664920568466, "num_tokens": 12188819.0, "step": 5630 }, { "entropy": 6.660564947128296, "epoch": 0.6030285194499438, "grad_norm": 1.2265625, "learning_rate": 0.00049721550371749, "loss": 6.5607, "mean_token_accuracy": 0.12463830485939979, "num_tokens": 12199198.0, "step": 5635 }, { "entropy": 6.6687784671783445, "epoch": 0.6035635935577077, "grad_norm": 1.1015625, "learning_rate": 0.0004972095040942289, "loss": 6.5644, "mean_token_accuracy": 0.1162213332951069, "num_tokens": 12210765.0, "step": 5640 }, { "entropy": 6.709344291687012, "epoch": 0.6040986676654717, "grad_norm": 1.71875, "learning_rate": 0.0004972034980546996, "loss": 6.6061, "mean_token_accuracy": 0.11544334441423416, "num_tokens": 12221067.0, "step": 5645 }, { "entropy": 6.653585481643677, "epoch": 0.6046337417732356, "grad_norm": 1.1875, "learning_rate": 0.0004971974855990755, "loss": 6.6023, "mean_token_accuracy": 0.11971136629581451, "num_tokens": 12232994.0, "step": 5650 }, { "entropy": 6.738733911514283, "epoch": 0.6051688158809995, "grad_norm": 1.4140625, "learning_rate": 0.0004971914667275302, "loss": 6.5538, "mean_token_accuracy": 0.12072688415646553, "num_tokens": 12243327.0, "step": 5655 }, { "entropy": 6.6140237808227536, "epoch": 0.6057038899887635, "grad_norm": 1.21875, "learning_rate": 0.0004971854414402377, "loss": 6.4752, "mean_token_accuracy": 0.12842355743050576, "num_tokens": 12254249.0, "step": 5660 }, { "entropy": 6.662600469589234, "epoch": 0.6062389640965273, "grad_norm": 1.296875, "learning_rate": 0.0004971794097373716, "loss": 6.5208, "mean_token_accuracy": 0.12328208535909653, "num_tokens": 12264487.0, "step": 5665 }, { "entropy": 6.569520473480225, "epoch": 0.6067740382042913, "grad_norm": 1.375, "learning_rate": 0.0004971733716191063, "loss": 6.5189, "mean_token_accuracy": 0.1292000360786915, "num_tokens": 12274801.0, "step": 5670 }, { "entropy": 6.636984205245971, "epoch": 0.6073091123120552, "grad_norm": 1.4375, "learning_rate": 0.0004971673270856162, "loss": 6.4777, "mean_token_accuracy": 0.11988460049033164, "num_tokens": 12284647.0, "step": 5675 }, { "entropy": 6.658068609237671, "epoch": 0.6078441864198192, "grad_norm": 1.2578125, "learning_rate": 0.0004971612761370756, "loss": 6.6033, "mean_token_accuracy": 0.11951280906796455, "num_tokens": 12295215.0, "step": 5680 }, { "entropy": 6.673429822921753, "epoch": 0.6083792605275831, "grad_norm": 1.4609375, "learning_rate": 0.0004971552187736596, "loss": 6.516, "mean_token_accuracy": 0.12064156159758568, "num_tokens": 12305324.0, "step": 5685 }, { "entropy": 6.668921661376953, "epoch": 0.6089143346353469, "grad_norm": 1.4375, "learning_rate": 0.0004971491549955427, "loss": 6.5372, "mean_token_accuracy": 0.12246538251638413, "num_tokens": 12316399.0, "step": 5690 }, { "entropy": 6.6165331363677975, "epoch": 0.6094494087431109, "grad_norm": 1.2265625, "learning_rate": 0.0004971430848029002, "loss": 6.5219, "mean_token_accuracy": 0.12773501947522165, "num_tokens": 12328033.0, "step": 5695 }, { "entropy": 6.681158256530762, "epoch": 0.6099844828508748, "grad_norm": 1.3984375, "learning_rate": 0.0004971370081959073, "loss": 6.5622, "mean_token_accuracy": 0.12176148667931556, "num_tokens": 12338962.0, "step": 5700 }, { "entropy": 6.697946166992187, "epoch": 0.6105195569586388, "grad_norm": 1.6328125, "learning_rate": 0.0004971309251747396, "loss": 6.5526, "mean_token_accuracy": 0.11940340176224709, "num_tokens": 12350216.0, "step": 5705 }, { "entropy": 6.745215272903442, "epoch": 0.6110546310664027, "grad_norm": 1.171875, "learning_rate": 0.0004971248357395726, "loss": 6.5806, "mean_token_accuracy": 0.11893382146954537, "num_tokens": 12361277.0, "step": 5710 }, { "entropy": 6.580714225769043, "epoch": 0.6115897051741667, "grad_norm": 1.4765625, "learning_rate": 0.0004971187398905821, "loss": 6.4858, "mean_token_accuracy": 0.12100339159369469, "num_tokens": 12373308.0, "step": 5715 }, { "entropy": 6.731028461456299, "epoch": 0.6121247792819305, "grad_norm": 1.3203125, "learning_rate": 0.0004971126376279443, "loss": 6.7259, "mean_token_accuracy": 0.11148046106100082, "num_tokens": 12383943.0, "step": 5720 }, { "entropy": 6.721910047531128, "epoch": 0.6126598533896944, "grad_norm": 1.3125, "learning_rate": 0.0004971065289518354, "loss": 6.482, "mean_token_accuracy": 0.12279203087091446, "num_tokens": 12394575.0, "step": 5725 }, { "entropy": 6.715807628631592, "epoch": 0.6131949274974584, "grad_norm": 1.265625, "learning_rate": 0.0004971004138624315, "loss": 6.5895, "mean_token_accuracy": 0.11779340729117393, "num_tokens": 12405536.0, "step": 5730 }, { "entropy": 6.606629800796509, "epoch": 0.6137300016052223, "grad_norm": 1.7109375, "learning_rate": 0.0004970942923599094, "loss": 6.4743, "mean_token_accuracy": 0.12641754895448684, "num_tokens": 12416148.0, "step": 5735 }, { "entropy": 6.612427473068237, "epoch": 0.6142650757129863, "grad_norm": 1.3828125, "learning_rate": 0.0004970881644444459, "loss": 6.48, "mean_token_accuracy": 0.12701191157102584, "num_tokens": 12426182.0, "step": 5740 }, { "entropy": 6.647663402557373, "epoch": 0.6148001498207502, "grad_norm": 1.1796875, "learning_rate": 0.0004970820301162178, "loss": 6.6625, "mean_token_accuracy": 0.11574866473674775, "num_tokens": 12437548.0, "step": 5745 }, { "entropy": 6.737516117095947, "epoch": 0.6153352239285141, "grad_norm": 1.7890625, "learning_rate": 0.0004970758893754022, "loss": 6.5979, "mean_token_accuracy": 0.11561758294701577, "num_tokens": 12449720.0, "step": 5750 }, { "entropy": 6.817887496948242, "epoch": 0.615870298036278, "grad_norm": 1.140625, "learning_rate": 0.0004970697422221767, "loss": 6.574, "mean_token_accuracy": 0.1215938724577427, "num_tokens": 12460666.0, "step": 5755 }, { "entropy": 6.7063861846923825, "epoch": 0.6164053721440419, "grad_norm": 1.3125, "learning_rate": 0.0004970635886567185, "loss": 6.5911, "mean_token_accuracy": 0.12281558737158775, "num_tokens": 12471472.0, "step": 5760 }, { "entropy": 6.611774969100952, "epoch": 0.6169404462518059, "grad_norm": 2.953125, "learning_rate": 0.0004970574286792054, "loss": 6.5681, "mean_token_accuracy": 0.11770694702863693, "num_tokens": 12482127.0, "step": 5765 }, { "entropy": 6.611656904220581, "epoch": 0.6174755203595698, "grad_norm": 1.34375, "learning_rate": 0.0004970512622898152, "loss": 6.5767, "mean_token_accuracy": 0.12225481644272804, "num_tokens": 12493680.0, "step": 5770 }, { "entropy": 6.65736231803894, "epoch": 0.6180105944673338, "grad_norm": 1.2734375, "learning_rate": 0.000497045089488726, "loss": 6.523, "mean_token_accuracy": 0.12167870178818703, "num_tokens": 12505838.0, "step": 5775 }, { "entropy": 6.704753160476685, "epoch": 0.6185456685750976, "grad_norm": 1.5078125, "learning_rate": 0.0004970389102761161, "loss": 6.5102, "mean_token_accuracy": 0.12942416369915008, "num_tokens": 12516334.0, "step": 5780 }, { "entropy": 6.661266231536866, "epoch": 0.6190807426828616, "grad_norm": 1.3984375, "learning_rate": 0.0004970327246521638, "loss": 6.5879, "mean_token_accuracy": 0.12000072821974754, "num_tokens": 12526440.0, "step": 5785 }, { "entropy": 6.680879926681518, "epoch": 0.6196158167906255, "grad_norm": 1.359375, "learning_rate": 0.0004970265326170478, "loss": 6.5266, "mean_token_accuracy": 0.11807752102613449, "num_tokens": 12538127.0, "step": 5790 }, { "entropy": 6.722283792495728, "epoch": 0.6201508908983894, "grad_norm": 1.34375, "learning_rate": 0.0004970203341709469, "loss": 6.5914, "mean_token_accuracy": 0.12216417640447616, "num_tokens": 12548459.0, "step": 5795 }, { "entropy": 6.58387131690979, "epoch": 0.6206859650061534, "grad_norm": 1.28125, "learning_rate": 0.00049701412931404, "loss": 6.5481, "mean_token_accuracy": 0.12659149914979934, "num_tokens": 12558989.0, "step": 5800 }, { "entropy": 6.62721471786499, "epoch": 0.6212210391139172, "grad_norm": 1.2109375, "learning_rate": 0.0004970079180465064, "loss": 6.4916, "mean_token_accuracy": 0.1283690959215164, "num_tokens": 12569449.0, "step": 5805 }, { "entropy": 6.644355916976929, "epoch": 0.6217561132216812, "grad_norm": 1.296875, "learning_rate": 0.0004970017003685253, "loss": 6.5297, "mean_token_accuracy": 0.12029706984758377, "num_tokens": 12580733.0, "step": 5810 }, { "entropy": 6.65497670173645, "epoch": 0.6222911873294451, "grad_norm": 1.3203125, "learning_rate": 0.0004969954762802763, "loss": 6.5326, "mean_token_accuracy": 0.11786738261580468, "num_tokens": 12590869.0, "step": 5815 }, { "entropy": 6.706523609161377, "epoch": 0.6228262614372091, "grad_norm": 1.40625, "learning_rate": 0.000496989245781939, "loss": 6.6305, "mean_token_accuracy": 0.11878098174929619, "num_tokens": 12602109.0, "step": 5820 }, { "entropy": 6.690067100524902, "epoch": 0.623361335544973, "grad_norm": 1.2578125, "learning_rate": 0.0004969830088736937, "loss": 6.5463, "mean_token_accuracy": 0.11708159074187278, "num_tokens": 12612234.0, "step": 5825 }, { "entropy": 6.761075687408447, "epoch": 0.6238964096527368, "grad_norm": 1.3125, "learning_rate": 0.00049697676555572, "loss": 6.6967, "mean_token_accuracy": 0.11268940791487694, "num_tokens": 12623252.0, "step": 5830 }, { "entropy": 6.709875154495239, "epoch": 0.6244314837605008, "grad_norm": 1.25, "learning_rate": 0.0004969705158281985, "loss": 6.4508, "mean_token_accuracy": 0.12307255640625954, "num_tokens": 12632796.0, "step": 5835 }, { "entropy": 6.652636289596558, "epoch": 0.6249665578682647, "grad_norm": 1.65625, "learning_rate": 0.0004969642596913095, "loss": 6.5512, "mean_token_accuracy": 0.11847778558731079, "num_tokens": 12643278.0, "step": 5840 }, { "entropy": 6.670278692245484, "epoch": 0.6255016319760287, "grad_norm": 5.25, "learning_rate": 0.0004969579971452337, "loss": 6.6218, "mean_token_accuracy": 0.12104167938232421, "num_tokens": 12654446.0, "step": 5845 }, { "entropy": 6.704672002792359, "epoch": 0.6260367060837926, "grad_norm": 1.4296875, "learning_rate": 0.0004969517281901519, "loss": 6.5988, "mean_token_accuracy": 0.12173526436090469, "num_tokens": 12664281.0, "step": 5850 }, { "entropy": 6.726960182189941, "epoch": 0.6265717801915566, "grad_norm": 1.671875, "learning_rate": 0.0004969454528262451, "loss": 6.5829, "mean_token_accuracy": 0.11787922754883766, "num_tokens": 12675252.0, "step": 5855 }, { "entropy": 6.665972471237183, "epoch": 0.6271068542993204, "grad_norm": 1.9765625, "learning_rate": 0.0004969391710536946, "loss": 6.5794, "mean_token_accuracy": 0.1184937097132206, "num_tokens": 12685764.0, "step": 5860 }, { "entropy": 6.591383934020996, "epoch": 0.6276419284070843, "grad_norm": 1.6328125, "learning_rate": 0.0004969328828726817, "loss": 6.4757, "mean_token_accuracy": 0.12730447500944136, "num_tokens": 12696974.0, "step": 5865 }, { "entropy": 6.757170295715332, "epoch": 0.6281770025148483, "grad_norm": 1.453125, "learning_rate": 0.0004969265882833879, "loss": 6.6372, "mean_token_accuracy": 0.11200533658266068, "num_tokens": 12708217.0, "step": 5870 }, { "entropy": 6.707298660278321, "epoch": 0.6287120766226122, "grad_norm": 1.6953125, "learning_rate": 0.0004969202872859952, "loss": 6.516, "mean_token_accuracy": 0.12099341303110123, "num_tokens": 12717840.0, "step": 5875 }, { "entropy": 6.622361516952514, "epoch": 0.6292471507303762, "grad_norm": 1.3828125, "learning_rate": 0.0004969139798806854, "loss": 6.6088, "mean_token_accuracy": 0.11309082061052322, "num_tokens": 12728390.0, "step": 5880 }, { "entropy": 6.653683233261108, "epoch": 0.6297822248381401, "grad_norm": 1.2734375, "learning_rate": 0.0004969076660676405, "loss": 6.6113, "mean_token_accuracy": 0.11578750982880592, "num_tokens": 12738650.0, "step": 5885 }, { "entropy": 6.735027837753296, "epoch": 0.630317298945904, "grad_norm": 1.484375, "learning_rate": 0.000496901345847043, "loss": 6.5966, "mean_token_accuracy": 0.11822382658720017, "num_tokens": 12748989.0, "step": 5890 }, { "entropy": 6.689414024353027, "epoch": 0.6308523730536679, "grad_norm": 1.2578125, "learning_rate": 0.0004968950192190752, "loss": 6.559, "mean_token_accuracy": 0.12090246379375458, "num_tokens": 12761132.0, "step": 5895 }, { "entropy": 6.6849761486053465, "epoch": 0.6313874471614318, "grad_norm": 1.25, "learning_rate": 0.00049688868618392, "loss": 6.5651, "mean_token_accuracy": 0.1228780284523964, "num_tokens": 12771478.0, "step": 5900 }, { "entropy": 6.716721773147583, "epoch": 0.6319225212691958, "grad_norm": 1.2109375, "learning_rate": 0.0004968823467417602, "loss": 6.6244, "mean_token_accuracy": 0.1174764983355999, "num_tokens": 12782096.0, "step": 5905 }, { "entropy": 6.716968536376953, "epoch": 0.6324575953769597, "grad_norm": 1.171875, "learning_rate": 0.0004968760008927788, "loss": 6.5262, "mean_token_accuracy": 0.12529518380761145, "num_tokens": 12792467.0, "step": 5910 }, { "entropy": 6.6767195701599125, "epoch": 0.6329926694847237, "grad_norm": 1.25, "learning_rate": 0.000496869648637159, "loss": 6.5373, "mean_token_accuracy": 0.12640023306012155, "num_tokens": 12803248.0, "step": 5915 }, { "entropy": 6.697324562072754, "epoch": 0.6335277435924875, "grad_norm": 1.3125, "learning_rate": 0.0004968632899750844, "loss": 6.5591, "mean_token_accuracy": 0.12147547379136085, "num_tokens": 12813701.0, "step": 5920 }, { "entropy": 6.800759792327881, "epoch": 0.6340628177002515, "grad_norm": 1.4453125, "learning_rate": 0.0004968569249067383, "loss": 6.6272, "mean_token_accuracy": 0.11679861545562745, "num_tokens": 12824945.0, "step": 5925 }, { "entropy": 6.671930313110352, "epoch": 0.6345978918080154, "grad_norm": 1.09375, "learning_rate": 0.0004968505534323047, "loss": 6.5786, "mean_token_accuracy": 0.1162982702255249, "num_tokens": 12836699.0, "step": 5930 }, { "entropy": 6.6336596488952635, "epoch": 0.6351329659157794, "grad_norm": 1.28125, "learning_rate": 0.0004968441755519677, "loss": 6.5291, "mean_token_accuracy": 0.11951676458120346, "num_tokens": 12846905.0, "step": 5935 }, { "entropy": 6.7043437480926515, "epoch": 0.6356680400235433, "grad_norm": 1.375, "learning_rate": 0.0004968377912659112, "loss": 6.5001, "mean_token_accuracy": 0.12340181395411491, "num_tokens": 12856919.0, "step": 5940 }, { "entropy": 6.60842661857605, "epoch": 0.6362031141313071, "grad_norm": 1.7109375, "learning_rate": 0.0004968314005743196, "loss": 6.4565, "mean_token_accuracy": 0.12368626967072487, "num_tokens": 12867863.0, "step": 5945 }, { "entropy": 6.611450290679931, "epoch": 0.6367381882390711, "grad_norm": 1.1796875, "learning_rate": 0.0004968250034773776, "loss": 6.5429, "mean_token_accuracy": 0.12223007977008819, "num_tokens": 12877877.0, "step": 5950 }, { "entropy": 6.737860918045044, "epoch": 0.637273262346835, "grad_norm": 1.59375, "learning_rate": 0.0004968185999752697, "loss": 6.6383, "mean_token_accuracy": 0.11434445828199387, "num_tokens": 12887954.0, "step": 5955 }, { "entropy": 6.707271003723145, "epoch": 0.637808336454599, "grad_norm": 1.1875, "learning_rate": 0.0004968121900681809, "loss": 6.5511, "mean_token_accuracy": 0.12070679739117622, "num_tokens": 12897744.0, "step": 5960 }, { "entropy": 6.68266224861145, "epoch": 0.6383434105623629, "grad_norm": 1.640625, "learning_rate": 0.0004968057737562964, "loss": 6.617, "mean_token_accuracy": 0.12236501500010491, "num_tokens": 12909193.0, "step": 5965 }, { "entropy": 6.663351440429688, "epoch": 0.6388784846701269, "grad_norm": 1.3125, "learning_rate": 0.0004967993510398012, "loss": 6.4973, "mean_token_accuracy": 0.12318923175334931, "num_tokens": 12919879.0, "step": 5970 }, { "entropy": 6.623578882217407, "epoch": 0.6394135587778907, "grad_norm": 1.2734375, "learning_rate": 0.0004967929219188809, "loss": 6.5387, "mean_token_accuracy": 0.12540650963783265, "num_tokens": 12930297.0, "step": 5975 }, { "entropy": 6.649103832244873, "epoch": 0.6399486328856546, "grad_norm": 1.375, "learning_rate": 0.0004967864863937212, "loss": 6.5329, "mean_token_accuracy": 0.12860941588878633, "num_tokens": 12940467.0, "step": 5980 }, { "entropy": 6.6491728782653805, "epoch": 0.6404837069934186, "grad_norm": 1.4296875, "learning_rate": 0.0004967800444645079, "loss": 6.5204, "mean_token_accuracy": 0.11868370845913886, "num_tokens": 12950417.0, "step": 5985 }, { "entropy": 6.636889123916626, "epoch": 0.6410187811011825, "grad_norm": 1.4765625, "learning_rate": 0.0004967735961314269, "loss": 6.4761, "mean_token_accuracy": 0.122308399528265, "num_tokens": 12960957.0, "step": 5990 }, { "entropy": 6.666227865219116, "epoch": 0.6415538552089465, "grad_norm": 1.125, "learning_rate": 0.0004967671413946646, "loss": 6.575, "mean_token_accuracy": 0.12026591822504998, "num_tokens": 12971194.0, "step": 5995 }, { "entropy": 6.6303346157073975, "epoch": 0.6420889293167104, "grad_norm": 1.5390625, "learning_rate": 0.0004967606802544071, "loss": 6.5736, "mean_token_accuracy": 0.11933250203728676, "num_tokens": 12982479.0, "step": 6000 }, { "epoch": 0.6420889293167104, "eval_entropy": 6.587495564643263, "eval_loss": 6.633632183074951, "eval_mean_token_accuracy": 0.123240454485414, "eval_num_tokens": 12982479.0, "eval_runtime": 22.6134, "eval_samples_per_second": 1312.45, "eval_steps_per_second": 164.062, "step": 6000 }, { "entropy": 6.708343410491944, "epoch": 0.6426240034244743, "grad_norm": 1.2578125, "learning_rate": 0.0004967542127108412, "loss": 6.6257, "mean_token_accuracy": 0.1161632239818573, "num_tokens": 12994119.0, "step": 6005 }, { "entropy": 6.693649530410767, "epoch": 0.6431590775322382, "grad_norm": 1.140625, "learning_rate": 0.0004967477387641537, "loss": 6.5309, "mean_token_accuracy": 0.1253574460744858, "num_tokens": 13005437.0, "step": 6010 }, { "entropy": 6.6332213401794435, "epoch": 0.6436941516400021, "grad_norm": 1.65625, "learning_rate": 0.0004967412584145312, "loss": 6.555, "mean_token_accuracy": 0.12132607325911522, "num_tokens": 13017278.0, "step": 6015 }, { "entropy": 6.6542360305786135, "epoch": 0.6442292257477661, "grad_norm": 1.21875, "learning_rate": 0.0004967347716621611, "loss": 6.5282, "mean_token_accuracy": 0.12165799587965012, "num_tokens": 13028010.0, "step": 6020 }, { "entropy": 6.629656457901001, "epoch": 0.64476429985553, "grad_norm": 1.1484375, "learning_rate": 0.0004967282785072306, "loss": 6.5233, "mean_token_accuracy": 0.12609869465231896, "num_tokens": 13038740.0, "step": 6025 }, { "entropy": 6.6070208072662355, "epoch": 0.645299373963294, "grad_norm": 1.203125, "learning_rate": 0.0004967217789499272, "loss": 6.543, "mean_token_accuracy": 0.12261505052447319, "num_tokens": 13049921.0, "step": 6030 }, { "entropy": 6.6102134704589846, "epoch": 0.6458344480710578, "grad_norm": 1.5, "learning_rate": 0.0004967152729904386, "loss": 6.4664, "mean_token_accuracy": 0.12932628467679025, "num_tokens": 13060907.0, "step": 6035 }, { "entropy": 6.6852294445037845, "epoch": 0.6463695221788218, "grad_norm": 1.1875, "learning_rate": 0.0004967087606289527, "loss": 6.501, "mean_token_accuracy": 0.12574908435344695, "num_tokens": 13071720.0, "step": 6040 }, { "entropy": 6.666558074951172, "epoch": 0.6469045962865857, "grad_norm": 1.203125, "learning_rate": 0.0004967022418656575, "loss": 6.5475, "mean_token_accuracy": 0.12468422725796699, "num_tokens": 13082474.0, "step": 6045 }, { "entropy": 6.596642351150512, "epoch": 0.6474396703943496, "grad_norm": 1.359375, "learning_rate": 0.0004966957167007412, "loss": 6.468, "mean_token_accuracy": 0.12356942817568779, "num_tokens": 13092777.0, "step": 6050 }, { "entropy": 6.594368410110474, "epoch": 0.6479747445021136, "grad_norm": 1.328125, "learning_rate": 0.0004966891851343922, "loss": 6.4676, "mean_token_accuracy": 0.12478138655424117, "num_tokens": 13104019.0, "step": 6055 }, { "entropy": 6.70648775100708, "epoch": 0.6485098186098774, "grad_norm": 1.15625, "learning_rate": 0.0004966826471667992, "loss": 6.4973, "mean_token_accuracy": 0.12690474689006806, "num_tokens": 13115741.0, "step": 6060 }, { "entropy": 6.651901435852051, "epoch": 0.6490448927176414, "grad_norm": 1.21875, "learning_rate": 0.0004966761027981509, "loss": 6.5075, "mean_token_accuracy": 0.12609103322029114, "num_tokens": 13126838.0, "step": 6065 }, { "entropy": 6.642081689834595, "epoch": 0.6495799668254053, "grad_norm": 1.1875, "learning_rate": 0.0004966695520286362, "loss": 6.6086, "mean_token_accuracy": 0.11905003264546395, "num_tokens": 13137485.0, "step": 6070 }, { "entropy": 6.6793499946594235, "epoch": 0.6501150409331693, "grad_norm": 1.2265625, "learning_rate": 0.0004966629948584444, "loss": 6.4684, "mean_token_accuracy": 0.1274704895913601, "num_tokens": 13147631.0, "step": 6075 }, { "entropy": 6.597648620605469, "epoch": 0.6506501150409332, "grad_norm": 1.46875, "learning_rate": 0.0004966564312877647, "loss": 6.5373, "mean_token_accuracy": 0.1260016866028309, "num_tokens": 13158468.0, "step": 6080 }, { "entropy": 6.723154020309448, "epoch": 0.651185189148697, "grad_norm": 3.109375, "learning_rate": 0.0004966498613167868, "loss": 6.5746, "mean_token_accuracy": 0.11794209703803063, "num_tokens": 13169263.0, "step": 6085 }, { "entropy": 6.676345491409302, "epoch": 0.651720263256461, "grad_norm": 1.375, "learning_rate": 0.0004966432849457002, "loss": 6.4874, "mean_token_accuracy": 0.13016888946294786, "num_tokens": 13178647.0, "step": 6090 }, { "entropy": 6.582516241073608, "epoch": 0.6522553373642249, "grad_norm": 1.1796875, "learning_rate": 0.000496636702174695, "loss": 6.4788, "mean_token_accuracy": 0.12643413320183755, "num_tokens": 13189883.0, "step": 6095 }, { "entropy": 6.648423719406128, "epoch": 0.6527904114719889, "grad_norm": 1.25, "learning_rate": 0.0004966301130039611, "loss": 6.6022, "mean_token_accuracy": 0.12256921008229256, "num_tokens": 13200920.0, "step": 6100 }, { "entropy": 6.701182746887207, "epoch": 0.6533254855797528, "grad_norm": 2.796875, "learning_rate": 0.0004966235174336889, "loss": 6.5918, "mean_token_accuracy": 0.11332411095499992, "num_tokens": 13211765.0, "step": 6105 }, { "entropy": 6.659097290039062, "epoch": 0.6538605596875168, "grad_norm": 1.390625, "learning_rate": 0.0004966169154640687, "loss": 6.5191, "mean_token_accuracy": 0.1247679390013218, "num_tokens": 13221768.0, "step": 6110 }, { "entropy": 6.609342384338379, "epoch": 0.6543956337952807, "grad_norm": 1.21875, "learning_rate": 0.0004966103070952912, "loss": 6.5209, "mean_token_accuracy": 0.12406276315450668, "num_tokens": 13233545.0, "step": 6115 }, { "entropy": 6.693496465682983, "epoch": 0.6549307079030445, "grad_norm": 1.2109375, "learning_rate": 0.0004966036923275472, "loss": 6.5591, "mean_token_accuracy": 0.13287978991866112, "num_tokens": 13245018.0, "step": 6120 }, { "entropy": 6.604655790328979, "epoch": 0.6554657820108085, "grad_norm": 1.7578125, "learning_rate": 0.0004965970711610278, "loss": 6.4761, "mean_token_accuracy": 0.12369921505451202, "num_tokens": 13255772.0, "step": 6125 }, { "entropy": 6.611993074417114, "epoch": 0.6560008561185724, "grad_norm": 1.6796875, "learning_rate": 0.0004965904435959241, "loss": 6.5591, "mean_token_accuracy": 0.11679132431745529, "num_tokens": 13267271.0, "step": 6130 }, { "entropy": 6.685591697692871, "epoch": 0.6565359302263364, "grad_norm": 1.5625, "learning_rate": 0.0004965838096324274, "loss": 6.558, "mean_token_accuracy": 0.12077526301145554, "num_tokens": 13278467.0, "step": 6135 }, { "entropy": 6.647955656051636, "epoch": 0.6570710043341003, "grad_norm": 1.296875, "learning_rate": 0.0004965771692707294, "loss": 6.625, "mean_token_accuracy": 0.11517797484993934, "num_tokens": 13288522.0, "step": 6140 }, { "entropy": 6.735994911193847, "epoch": 0.6576060784418643, "grad_norm": 1.65625, "learning_rate": 0.0004965705225110218, "loss": 6.5958, "mean_token_accuracy": 0.1102604016661644, "num_tokens": 13299355.0, "step": 6145 }, { "entropy": 6.69739933013916, "epoch": 0.6581411525496281, "grad_norm": 1.2578125, "learning_rate": 0.0004965638693534964, "loss": 6.5269, "mean_token_accuracy": 0.12430242151021957, "num_tokens": 13310334.0, "step": 6150 }, { "entropy": 6.717443895339966, "epoch": 0.658676226657392, "grad_norm": 1.59375, "learning_rate": 0.0004965572097983455, "loss": 6.5918, "mean_token_accuracy": 0.11856616660952568, "num_tokens": 13320917.0, "step": 6155 }, { "entropy": 6.674542045593261, "epoch": 0.659211300765156, "grad_norm": 1.078125, "learning_rate": 0.0004965505438457613, "loss": 6.4852, "mean_token_accuracy": 0.12417368888854981, "num_tokens": 13331707.0, "step": 6160 }, { "entropy": 6.640851926803589, "epoch": 0.6597463748729199, "grad_norm": 1.2109375, "learning_rate": 0.0004965438714959363, "loss": 6.629, "mean_token_accuracy": 0.11581350415945053, "num_tokens": 13341784.0, "step": 6165 }, { "entropy": 6.735370779037476, "epoch": 0.6602814489806839, "grad_norm": 1.4921875, "learning_rate": 0.000496537192749063, "loss": 6.5809, "mean_token_accuracy": 0.11734402552247047, "num_tokens": 13351633.0, "step": 6170 }, { "entropy": 6.681562995910644, "epoch": 0.6608165230884477, "grad_norm": 1.2421875, "learning_rate": 0.0004965305076053345, "loss": 6.4794, "mean_token_accuracy": 0.12656131833791734, "num_tokens": 13362444.0, "step": 6175 }, { "entropy": 6.592486047744751, "epoch": 0.6613515971962117, "grad_norm": 1.3984375, "learning_rate": 0.0004965238160649437, "loss": 6.6139, "mean_token_accuracy": 0.11791914477944374, "num_tokens": 13374322.0, "step": 6180 }, { "entropy": 6.651375102996826, "epoch": 0.6618866713039756, "grad_norm": 1.390625, "learning_rate": 0.0004965171181280838, "loss": 6.5627, "mean_token_accuracy": 0.11961539909243583, "num_tokens": 13384188.0, "step": 6185 }, { "entropy": 6.709027862548828, "epoch": 0.6624217454117395, "grad_norm": 1.2265625, "learning_rate": 0.0004965104137949483, "loss": 6.5697, "mean_token_accuracy": 0.11759102568030358, "num_tokens": 13395648.0, "step": 6190 }, { "entropy": 6.718053483963013, "epoch": 0.6629568195195035, "grad_norm": 1.28125, "learning_rate": 0.0004965037030657308, "loss": 6.594, "mean_token_accuracy": 0.12067084982991219, "num_tokens": 13406769.0, "step": 6195 }, { "entropy": 6.728432607650757, "epoch": 0.6634918936272673, "grad_norm": 1.5078125, "learning_rate": 0.0004964969859406248, "loss": 6.563, "mean_token_accuracy": 0.11147924661636352, "num_tokens": 13417509.0, "step": 6200 }, { "entropy": 6.6613959789276125, "epoch": 0.6640269677350313, "grad_norm": 2.703125, "learning_rate": 0.0004964902624198246, "loss": 6.4816, "mean_token_accuracy": 0.11563964560627937, "num_tokens": 13429441.0, "step": 6205 }, { "entropy": 6.6188640117645265, "epoch": 0.6645620418427952, "grad_norm": 1.375, "learning_rate": 0.0004964835325035243, "loss": 6.511, "mean_token_accuracy": 0.12196975350379943, "num_tokens": 13439332.0, "step": 6210 }, { "entropy": 6.617918682098389, "epoch": 0.6650971159505592, "grad_norm": 1.3046875, "learning_rate": 0.0004964767961919179, "loss": 6.4908, "mean_token_accuracy": 0.12061900198459626, "num_tokens": 13449400.0, "step": 6215 }, { "entropy": 6.680626916885376, "epoch": 0.6656321900583231, "grad_norm": 1.2734375, "learning_rate": 0.0004964700534852003, "loss": 6.5983, "mean_token_accuracy": 0.11767825335264206, "num_tokens": 13460134.0, "step": 6220 }, { "entropy": 6.686565780639649, "epoch": 0.666167264166087, "grad_norm": 1.390625, "learning_rate": 0.0004964633043835658, "loss": 6.5323, "mean_token_accuracy": 0.12875395640730858, "num_tokens": 13469954.0, "step": 6225 }, { "entropy": 6.679265308380127, "epoch": 0.666702338273851, "grad_norm": 1.5703125, "learning_rate": 0.0004964565488872097, "loss": 6.5229, "mean_token_accuracy": 0.12348946034908295, "num_tokens": 13479866.0, "step": 6230 }, { "entropy": 6.563807821273803, "epoch": 0.6672374123816148, "grad_norm": 1.3125, "learning_rate": 0.0004964497869963268, "loss": 6.478, "mean_token_accuracy": 0.12527237683534623, "num_tokens": 13490088.0, "step": 6235 }, { "entropy": 6.656466770172119, "epoch": 0.6677724864893788, "grad_norm": 1.3125, "learning_rate": 0.0004964430187111125, "loss": 6.5728, "mean_token_accuracy": 0.12173057049512863, "num_tokens": 13500898.0, "step": 6240 }, { "entropy": 6.687621164321899, "epoch": 0.6683075605971427, "grad_norm": 1.109375, "learning_rate": 0.0004964362440317621, "loss": 6.5927, "mean_token_accuracy": 0.1209525316953659, "num_tokens": 13511537.0, "step": 6245 }, { "entropy": 6.633641624450684, "epoch": 0.6688426347049067, "grad_norm": 1.2109375, "learning_rate": 0.0004964294629584712, "loss": 6.5303, "mean_token_accuracy": 0.12212182357907295, "num_tokens": 13522916.0, "step": 6250 }, { "entropy": 6.683465242385864, "epoch": 0.6693777088126706, "grad_norm": 1.2890625, "learning_rate": 0.0004964226754914357, "loss": 6.4758, "mean_token_accuracy": 0.12490794360637665, "num_tokens": 13533817.0, "step": 6255 }, { "entropy": 6.711468744277954, "epoch": 0.6699127829204344, "grad_norm": 1.625, "learning_rate": 0.0004964158816308517, "loss": 6.5852, "mean_token_accuracy": 0.11734790429472923, "num_tokens": 13543723.0, "step": 6260 }, { "entropy": 6.586713552474976, "epoch": 0.6704478570281984, "grad_norm": 1.4453125, "learning_rate": 0.0004964090813769151, "loss": 6.434, "mean_token_accuracy": 0.1227193221449852, "num_tokens": 13555269.0, "step": 6265 }, { "entropy": 6.64307050704956, "epoch": 0.6709829311359623, "grad_norm": 1.328125, "learning_rate": 0.0004964022747298224, "loss": 6.6139, "mean_token_accuracy": 0.11729198768734932, "num_tokens": 13567465.0, "step": 6270 }, { "entropy": 6.752734518051147, "epoch": 0.6715180052437263, "grad_norm": 1.4296875, "learning_rate": 0.0004963954616897701, "loss": 6.5446, "mean_token_accuracy": 0.11841646209359169, "num_tokens": 13578637.0, "step": 6275 }, { "entropy": 6.68422417640686, "epoch": 0.6720530793514902, "grad_norm": 1.5078125, "learning_rate": 0.000496388642256955, "loss": 6.5505, "mean_token_accuracy": 0.12172395139932632, "num_tokens": 13589074.0, "step": 6280 }, { "entropy": 6.646722793579102, "epoch": 0.6725881534592542, "grad_norm": 1.1640625, "learning_rate": 0.000496381816431574, "loss": 6.514, "mean_token_accuracy": 0.12342069149017335, "num_tokens": 13599624.0, "step": 6285 }, { "entropy": 6.719354677200317, "epoch": 0.673123227567018, "grad_norm": 1.2734375, "learning_rate": 0.0004963749842138241, "loss": 6.5363, "mean_token_accuracy": 0.12487530261278153, "num_tokens": 13610293.0, "step": 6290 }, { "entropy": 6.675761699676514, "epoch": 0.6736583016747819, "grad_norm": 1.9453125, "learning_rate": 0.0004963681456039027, "loss": 6.5611, "mean_token_accuracy": 0.11623863652348518, "num_tokens": 13621641.0, "step": 6295 }, { "entropy": 6.602420663833618, "epoch": 0.6741933757825459, "grad_norm": 1.2890625, "learning_rate": 0.0004963613006020072, "loss": 6.5252, "mean_token_accuracy": 0.1208052784204483, "num_tokens": 13632083.0, "step": 6300 }, { "entropy": 6.604093360900879, "epoch": 0.6747284498903098, "grad_norm": 1.5546875, "learning_rate": 0.0004963544492083352, "loss": 6.41, "mean_token_accuracy": 0.13683966994285585, "num_tokens": 13644084.0, "step": 6305 }, { "entropy": 6.6350510597229, "epoch": 0.6752635239980738, "grad_norm": 1.6328125, "learning_rate": 0.0004963475914230845, "loss": 6.5449, "mean_token_accuracy": 0.11910239085555077, "num_tokens": 13656231.0, "step": 6310 }, { "entropy": 6.699683904647827, "epoch": 0.6757985981058376, "grad_norm": 2.140625, "learning_rate": 0.0004963407272464533, "loss": 6.5952, "mean_token_accuracy": 0.11810294091701508, "num_tokens": 13667334.0, "step": 6315 }, { "entropy": 6.724069118499756, "epoch": 0.6763336722136016, "grad_norm": 1.40625, "learning_rate": 0.0004963338566786398, "loss": 6.5828, "mean_token_accuracy": 0.12107535973191261, "num_tokens": 13678615.0, "step": 6320 }, { "entropy": 6.693145990371704, "epoch": 0.6768687463213655, "grad_norm": 1.578125, "learning_rate": 0.0004963269797198422, "loss": 6.5874, "mean_token_accuracy": 0.12346574515104294, "num_tokens": 13689890.0, "step": 6325 }, { "entropy": 6.558933973312378, "epoch": 0.6774038204291294, "grad_norm": 1.6328125, "learning_rate": 0.0004963200963702592, "loss": 6.4168, "mean_token_accuracy": 0.13032166957855223, "num_tokens": 13699120.0, "step": 6330 }, { "entropy": 6.581582736968994, "epoch": 0.6779388945368934, "grad_norm": 1.25, "learning_rate": 0.0004963132066300894, "loss": 6.5395, "mean_token_accuracy": 0.11724406257271766, "num_tokens": 13710016.0, "step": 6335 }, { "entropy": 6.6938841342926025, "epoch": 0.6784739686446573, "grad_norm": 1.5546875, "learning_rate": 0.0004963063104995319, "loss": 6.6391, "mean_token_accuracy": 0.11238991096615791, "num_tokens": 13721576.0, "step": 6340 }, { "entropy": 6.745585584640503, "epoch": 0.6790090427524212, "grad_norm": 1.453125, "learning_rate": 0.0004962994079787859, "loss": 6.591, "mean_token_accuracy": 0.12299842238426209, "num_tokens": 13732568.0, "step": 6345 }, { "entropy": 6.657323408126831, "epoch": 0.6795441168601851, "grad_norm": 1.4296875, "learning_rate": 0.0004962924990680504, "loss": 6.4794, "mean_token_accuracy": 0.12324386537075042, "num_tokens": 13742569.0, "step": 6350 }, { "entropy": 6.627435684204102, "epoch": 0.6800791909679491, "grad_norm": 1.453125, "learning_rate": 0.0004962855837675252, "loss": 6.6034, "mean_token_accuracy": 0.11716282293200493, "num_tokens": 13752689.0, "step": 6355 }, { "entropy": 6.6892821311950685, "epoch": 0.680614265075713, "grad_norm": 1.453125, "learning_rate": 0.0004962786620774099, "loss": 6.5905, "mean_token_accuracy": 0.11979246288537979, "num_tokens": 13763709.0, "step": 6360 }, { "entropy": 6.705752182006836, "epoch": 0.6811493391834769, "grad_norm": 1.6796875, "learning_rate": 0.0004962717339979043, "loss": 6.4891, "mean_token_accuracy": 0.1252245396375656, "num_tokens": 13773726.0, "step": 6365 }, { "entropy": 6.608482742309571, "epoch": 0.6816844132912409, "grad_norm": 1.328125, "learning_rate": 0.0004962647995292084, "loss": 6.5296, "mean_token_accuracy": 0.12159904614090919, "num_tokens": 13785435.0, "step": 6370 }, { "entropy": 6.640556859970093, "epoch": 0.6822194873990047, "grad_norm": 1.71875, "learning_rate": 0.0004962578586715226, "loss": 6.52, "mean_token_accuracy": 0.11594315767288207, "num_tokens": 13797104.0, "step": 6375 }, { "entropy": 6.7496202945709225, "epoch": 0.6827545615067687, "grad_norm": 1.3515625, "learning_rate": 0.0004962509114250471, "loss": 6.6121, "mean_token_accuracy": 0.11787962764501572, "num_tokens": 13807756.0, "step": 6380 }, { "entropy": 6.491614484786988, "epoch": 0.6832896356145326, "grad_norm": 1.453125, "learning_rate": 0.0004962439577899828, "loss": 6.314, "mean_token_accuracy": 0.13807514384388925, "num_tokens": 13818490.0, "step": 6385 }, { "entropy": 6.646625661849976, "epoch": 0.6838247097222966, "grad_norm": 1.28125, "learning_rate": 0.0004962369977665301, "loss": 6.5814, "mean_token_accuracy": 0.11426923871040344, "num_tokens": 13829465.0, "step": 6390 }, { "entropy": 6.783056354522705, "epoch": 0.6843597838300605, "grad_norm": 1.171875, "learning_rate": 0.0004962300313548903, "loss": 6.5539, "mean_token_accuracy": 0.12248866409063339, "num_tokens": 13840863.0, "step": 6395 }, { "entropy": 6.695218420028686, "epoch": 0.6848948579378243, "grad_norm": 1.2265625, "learning_rate": 0.0004962230585552645, "loss": 6.549, "mean_token_accuracy": 0.12046386897563935, "num_tokens": 13851711.0, "step": 6400 }, { "entropy": 6.581887054443359, "epoch": 0.6854299320455883, "grad_norm": 1.6953125, "learning_rate": 0.0004962160793678539, "loss": 6.5789, "mean_token_accuracy": 0.11757319420576096, "num_tokens": 13864576.0, "step": 6405 }, { "entropy": 6.6630912780761715, "epoch": 0.6859650061533522, "grad_norm": 1.3359375, "learning_rate": 0.00049620909379286, "loss": 6.4883, "mean_token_accuracy": 0.12629830315709115, "num_tokens": 13875150.0, "step": 6410 }, { "entropy": 6.683273983001709, "epoch": 0.6865000802611162, "grad_norm": 2.546875, "learning_rate": 0.0004962021018304847, "loss": 6.5422, "mean_token_accuracy": 0.12137580290436745, "num_tokens": 13886070.0, "step": 6415 }, { "entropy": 6.600133419036865, "epoch": 0.6870351543688801, "grad_norm": 1.078125, "learning_rate": 0.0004961951034809298, "loss": 6.4596, "mean_token_accuracy": 0.11954843401908874, "num_tokens": 13897898.0, "step": 6420 }, { "entropy": 6.743383502960205, "epoch": 0.6875702284766441, "grad_norm": 1.2578125, "learning_rate": 0.0004961880987443974, "loss": 6.5996, "mean_token_accuracy": 0.1191033512353897, "num_tokens": 13909578.0, "step": 6425 }, { "entropy": 6.5636146068573, "epoch": 0.6881053025844079, "grad_norm": 1.46875, "learning_rate": 0.0004961810876210897, "loss": 6.4561, "mean_token_accuracy": 0.12540539875626563, "num_tokens": 13920537.0, "step": 6430 }, { "entropy": 6.548890447616577, "epoch": 0.6886403766921718, "grad_norm": 1.2734375, "learning_rate": 0.0004961740701112091, "loss": 6.5134, "mean_token_accuracy": 0.12369008883833885, "num_tokens": 13931015.0, "step": 6435 }, { "entropy": 6.668211126327515, "epoch": 0.6891754507999358, "grad_norm": 1.2109375, "learning_rate": 0.0004961670462149583, "loss": 6.5521, "mean_token_accuracy": 0.12055359557271003, "num_tokens": 13942691.0, "step": 6440 }, { "entropy": 6.767236375808716, "epoch": 0.6897105249076997, "grad_norm": 1.21875, "learning_rate": 0.0004961600159325403, "loss": 6.637, "mean_token_accuracy": 0.10908434465527535, "num_tokens": 13953945.0, "step": 6445 }, { "entropy": 6.751330995559693, "epoch": 0.6902455990154637, "grad_norm": 1.328125, "learning_rate": 0.0004961529792641577, "loss": 6.6236, "mean_token_accuracy": 0.1173236459493637, "num_tokens": 13965658.0, "step": 6450 }, { "entropy": 6.731899356842041, "epoch": 0.6907806731232276, "grad_norm": 1.2578125, "learning_rate": 0.0004961459362100141, "loss": 6.5992, "mean_token_accuracy": 0.12082590013742447, "num_tokens": 13976184.0, "step": 6455 }, { "entropy": 6.6650745391845705, "epoch": 0.6913157472309915, "grad_norm": 1.1953125, "learning_rate": 0.0004961388867703125, "loss": 6.5114, "mean_token_accuracy": 0.11692757606506347, "num_tokens": 13986243.0, "step": 6460 }, { "entropy": 6.65087571144104, "epoch": 0.6918508213387554, "grad_norm": 1.109375, "learning_rate": 0.0004961318309452566, "loss": 6.507, "mean_token_accuracy": 0.12220369726419449, "num_tokens": 13995904.0, "step": 6465 }, { "entropy": 6.659942245483398, "epoch": 0.6923858954465193, "grad_norm": 1.3359375, "learning_rate": 0.0004961247687350504, "loss": 6.5498, "mean_token_accuracy": 0.12576377019286156, "num_tokens": 14006711.0, "step": 6470 }, { "entropy": 6.628136539459229, "epoch": 0.6929209695542833, "grad_norm": 1.2890625, "learning_rate": 0.0004961177001398974, "loss": 6.527, "mean_token_accuracy": 0.12062407061457633, "num_tokens": 14018177.0, "step": 6475 }, { "entropy": 6.665041160583496, "epoch": 0.6934560436620472, "grad_norm": 1.40625, "learning_rate": 0.0004961106251600018, "loss": 6.4884, "mean_token_accuracy": 0.11637992933392524, "num_tokens": 14028725.0, "step": 6480 }, { "entropy": 6.6288951396942135, "epoch": 0.6939911177698111, "grad_norm": 1.2578125, "learning_rate": 0.0004961035437955681, "loss": 6.5271, "mean_token_accuracy": 0.13461530953645706, "num_tokens": 14040448.0, "step": 6485 }, { "entropy": 6.62433614730835, "epoch": 0.694526191877575, "grad_norm": 1.2109375, "learning_rate": 0.0004960964560468005, "loss": 6.5734, "mean_token_accuracy": 0.11507597416639329, "num_tokens": 14051731.0, "step": 6490 }, { "entropy": 6.7240547180175785, "epoch": 0.695061265985339, "grad_norm": 1.1953125, "learning_rate": 0.0004960893619139039, "loss": 6.5658, "mean_token_accuracy": 0.11801211908459663, "num_tokens": 14062330.0, "step": 6495 }, { "entropy": 6.683112001419067, "epoch": 0.6955963400931029, "grad_norm": 1.1640625, "learning_rate": 0.0004960822613970831, "loss": 6.4486, "mean_token_accuracy": 0.12386781573295594, "num_tokens": 14073991.0, "step": 6500 }, { "entropy": 6.640247869491577, "epoch": 0.6961314142008668, "grad_norm": 1.421875, "learning_rate": 0.0004960751544965431, "loss": 6.5076, "mean_token_accuracy": 0.12210935950279236, "num_tokens": 14085132.0, "step": 6505 }, { "entropy": 6.592376041412353, "epoch": 0.6966664883086308, "grad_norm": 1.3515625, "learning_rate": 0.0004960680412124889, "loss": 6.4499, "mean_token_accuracy": 0.12720930054783822, "num_tokens": 14095371.0, "step": 6510 }, { "entropy": 6.5528076171875, "epoch": 0.6972015624163946, "grad_norm": 1.7421875, "learning_rate": 0.0004960609215451261, "loss": 6.5341, "mean_token_accuracy": 0.12374990880489349, "num_tokens": 14106117.0, "step": 6515 }, { "entropy": 6.649059104919433, "epoch": 0.6977366365241586, "grad_norm": 1.2734375, "learning_rate": 0.0004960537954946604, "loss": 6.5267, "mean_token_accuracy": 0.12003685981035232, "num_tokens": 14117112.0, "step": 6520 }, { "entropy": 6.596162796020508, "epoch": 0.6982717106319225, "grad_norm": 1.3046875, "learning_rate": 0.0004960466630612974, "loss": 6.4541, "mean_token_accuracy": 0.13205637782812119, "num_tokens": 14128037.0, "step": 6525 }, { "entropy": 6.556289529800415, "epoch": 0.6988067847396865, "grad_norm": 1.2734375, "learning_rate": 0.0004960395242452429, "loss": 6.4584, "mean_token_accuracy": 0.12506138905882835, "num_tokens": 14140183.0, "step": 6530 }, { "entropy": 6.6649885177612305, "epoch": 0.6993418588474504, "grad_norm": 1.4921875, "learning_rate": 0.0004960323790467033, "loss": 6.5995, "mean_token_accuracy": 0.12367913722991944, "num_tokens": 14151635.0, "step": 6535 }, { "entropy": 6.737906551361084, "epoch": 0.6998769329552142, "grad_norm": 1.28125, "learning_rate": 0.0004960252274658849, "loss": 6.5577, "mean_token_accuracy": 0.12105544358491897, "num_tokens": 14162660.0, "step": 6540 }, { "entropy": 6.671280765533448, "epoch": 0.7004120070629782, "grad_norm": 1.3828125, "learning_rate": 0.0004960180695029939, "loss": 6.5407, "mean_token_accuracy": 0.12037990167737007, "num_tokens": 14173496.0, "step": 6545 }, { "entropy": 6.617800331115722, "epoch": 0.7009470811707421, "grad_norm": 1.34375, "learning_rate": 0.0004960109051582374, "loss": 6.4934, "mean_token_accuracy": 0.11847614273428916, "num_tokens": 14185479.0, "step": 6550 }, { "entropy": 6.60119400024414, "epoch": 0.7014821552785061, "grad_norm": 1.3046875, "learning_rate": 0.0004960037344318221, "loss": 6.4507, "mean_token_accuracy": 0.12120893523097039, "num_tokens": 14197441.0, "step": 6555 }, { "entropy": 6.566002035140992, "epoch": 0.70201722938627, "grad_norm": 1.2890625, "learning_rate": 0.0004959965573239548, "loss": 6.4247, "mean_token_accuracy": 0.12884053736925125, "num_tokens": 14207832.0, "step": 6560 }, { "entropy": 6.55321888923645, "epoch": 0.702552303494034, "grad_norm": 1.3203125, "learning_rate": 0.0004959893738348432, "loss": 6.4945, "mean_token_accuracy": 0.12767787277698517, "num_tokens": 14217976.0, "step": 6565 }, { "entropy": 6.674604034423828, "epoch": 0.7030873776017978, "grad_norm": 1.421875, "learning_rate": 0.0004959821839646943, "loss": 6.4431, "mean_token_accuracy": 0.12329324334859848, "num_tokens": 14227557.0, "step": 6570 }, { "entropy": 6.662657594680786, "epoch": 0.7036224517095617, "grad_norm": 1.28125, "learning_rate": 0.000495974987713716, "loss": 6.571, "mean_token_accuracy": 0.11384310796856881, "num_tokens": 14238912.0, "step": 6575 }, { "entropy": 6.638991737365723, "epoch": 0.7041575258173257, "grad_norm": 1.25, "learning_rate": 0.0004959677850821159, "loss": 6.5012, "mean_token_accuracy": 0.12319194078445435, "num_tokens": 14249968.0, "step": 6580 }, { "entropy": 6.620342445373535, "epoch": 0.7046925999250896, "grad_norm": 1.265625, "learning_rate": 0.0004959605760701021, "loss": 6.5569, "mean_token_accuracy": 0.12182011604309081, "num_tokens": 14260809.0, "step": 6585 }, { "entropy": 6.663771057128907, "epoch": 0.7052276740328536, "grad_norm": 1.5, "learning_rate": 0.0004959533606778827, "loss": 6.527, "mean_token_accuracy": 0.1212913878262043, "num_tokens": 14271971.0, "step": 6590 }, { "entropy": 6.70226559638977, "epoch": 0.7057627481406175, "grad_norm": 1.265625, "learning_rate": 0.0004959461389056661, "loss": 6.5913, "mean_token_accuracy": 0.12781344801187516, "num_tokens": 14283550.0, "step": 6595 }, { "entropy": 6.566189193725586, "epoch": 0.7062978222483814, "grad_norm": 1.25, "learning_rate": 0.0004959389107536608, "loss": 6.4158, "mean_token_accuracy": 0.12276504635810852, "num_tokens": 14293769.0, "step": 6600 }, { "entropy": 6.642466735839844, "epoch": 0.7068328963561453, "grad_norm": 1.3203125, "learning_rate": 0.0004959316762220754, "loss": 6.5368, "mean_token_accuracy": 0.11977979466319084, "num_tokens": 14304668.0, "step": 6605 }, { "entropy": 6.650493144989014, "epoch": 0.7073679704639092, "grad_norm": 1.234375, "learning_rate": 0.000495924435311119, "loss": 6.5975, "mean_token_accuracy": 0.11864884719252586, "num_tokens": 14315912.0, "step": 6610 }, { "entropy": 6.61599588394165, "epoch": 0.7079030445716732, "grad_norm": 1.1875, "learning_rate": 0.0004959171880210005, "loss": 6.5415, "mean_token_accuracy": 0.1240161381661892, "num_tokens": 14327386.0, "step": 6615 }, { "entropy": 6.61832332611084, "epoch": 0.7084381186794371, "grad_norm": 1.1640625, "learning_rate": 0.0004959099343519294, "loss": 6.5297, "mean_token_accuracy": 0.11902955025434495, "num_tokens": 14338629.0, "step": 6620 }, { "entropy": 6.745673322677613, "epoch": 0.7089731927872011, "grad_norm": 1.171875, "learning_rate": 0.0004959026743041148, "loss": 6.5523, "mean_token_accuracy": 0.12611126601696016, "num_tokens": 14349195.0, "step": 6625 }, { "entropy": 6.707384347915649, "epoch": 0.7095082668949649, "grad_norm": 1.4375, "learning_rate": 0.0004958954078777665, "loss": 6.5804, "mean_token_accuracy": 0.11705741733312607, "num_tokens": 14359449.0, "step": 6630 }, { "entropy": 6.607598972320557, "epoch": 0.7100433410027289, "grad_norm": 1.3828125, "learning_rate": 0.0004958881350730944, "loss": 6.4914, "mean_token_accuracy": 0.12530679404735565, "num_tokens": 14369904.0, "step": 6635 }, { "entropy": 6.640906763076782, "epoch": 0.7105784151104928, "grad_norm": 1.4453125, "learning_rate": 0.0004958808558903085, "loss": 6.502, "mean_token_accuracy": 0.12301137670874596, "num_tokens": 14382635.0, "step": 6640 }, { "entropy": 6.597404193878174, "epoch": 0.7111134892182567, "grad_norm": 1.4140625, "learning_rate": 0.0004958735703296189, "loss": 6.4504, "mean_token_accuracy": 0.12635595500469207, "num_tokens": 14393238.0, "step": 6645 }, { "entropy": 6.605778455734253, "epoch": 0.7116485633260207, "grad_norm": 1.25, "learning_rate": 0.000495866278391236, "loss": 6.4988, "mean_token_accuracy": 0.12151379361748696, "num_tokens": 14403734.0, "step": 6650 }, { "entropy": 6.662947177886963, "epoch": 0.7121836374337845, "grad_norm": 1.6640625, "learning_rate": 0.0004958589800753703, "loss": 6.493, "mean_token_accuracy": 0.12501125037670135, "num_tokens": 14414201.0, "step": 6655 }, { "entropy": 6.639647436141968, "epoch": 0.7127187115415485, "grad_norm": 1.21875, "learning_rate": 0.0004958516753822326, "loss": 6.5273, "mean_token_accuracy": 0.12744878232479095, "num_tokens": 14425153.0, "step": 6660 }, { "entropy": 6.599532556533814, "epoch": 0.7132537856493124, "grad_norm": 1.453125, "learning_rate": 0.0004958443643120338, "loss": 6.5016, "mean_token_accuracy": 0.12863869071006775, "num_tokens": 14435942.0, "step": 6665 }, { "entropy": 6.614558696746826, "epoch": 0.7137888597570764, "grad_norm": 1.4453125, "learning_rate": 0.000495837046864985, "loss": 6.4763, "mean_token_accuracy": 0.12335674315690995, "num_tokens": 14446371.0, "step": 6670 }, { "entropy": 6.617805099487304, "epoch": 0.7143239338648403, "grad_norm": 1.421875, "learning_rate": 0.0004958297230412976, "loss": 6.4252, "mean_token_accuracy": 0.127166984975338, "num_tokens": 14456598.0, "step": 6675 }, { "entropy": 6.555561685562134, "epoch": 0.7148590079726042, "grad_norm": 2.703125, "learning_rate": 0.0004958223928411829, "loss": 6.5309, "mean_token_accuracy": 0.1143219605088234, "num_tokens": 14466775.0, "step": 6680 }, { "entropy": 6.574054431915283, "epoch": 0.7153940820803681, "grad_norm": 1.375, "learning_rate": 0.0004958150562648526, "loss": 6.4665, "mean_token_accuracy": 0.12366539910435677, "num_tokens": 14476876.0, "step": 6685 }, { "entropy": 6.590529203414917, "epoch": 0.715929156188132, "grad_norm": 1.3984375, "learning_rate": 0.0004958077133125187, "loss": 6.4797, "mean_token_accuracy": 0.12587342411279678, "num_tokens": 14487698.0, "step": 6690 }, { "entropy": 6.692271709442139, "epoch": 0.716464230295896, "grad_norm": 1.640625, "learning_rate": 0.000495800363984393, "loss": 6.4987, "mean_token_accuracy": 0.12271760776638985, "num_tokens": 14498572.0, "step": 6695 }, { "entropy": 6.623218107223511, "epoch": 0.7169993044036599, "grad_norm": 1.3515625, "learning_rate": 0.0004957930082806878, "loss": 6.5438, "mean_token_accuracy": 0.12247662395238876, "num_tokens": 14509673.0, "step": 6700 }, { "entropy": 6.70994553565979, "epoch": 0.7175343785114239, "grad_norm": 1.515625, "learning_rate": 0.0004957856462016155, "loss": 6.6279, "mean_token_accuracy": 0.1105528324842453, "num_tokens": 14519974.0, "step": 6705 }, { "entropy": 6.691906595230103, "epoch": 0.7180694526191878, "grad_norm": 2.21875, "learning_rate": 0.0004957782777473888, "loss": 6.5373, "mean_token_accuracy": 0.11652741655707359, "num_tokens": 14531194.0, "step": 6710 }, { "entropy": 6.606967735290527, "epoch": 0.7186045267269516, "grad_norm": 1.75, "learning_rate": 0.0004957709029182203, "loss": 6.4862, "mean_token_accuracy": 0.12221086099743843, "num_tokens": 14542393.0, "step": 6715 }, { "entropy": 6.582061862945556, "epoch": 0.7191396008347156, "grad_norm": 1.375, "learning_rate": 0.0004957635217143231, "loss": 6.4944, "mean_token_accuracy": 0.13097272515296937, "num_tokens": 14552934.0, "step": 6720 }, { "entropy": 6.62083740234375, "epoch": 0.7196746749424795, "grad_norm": 1.3984375, "learning_rate": 0.00049575613413591, "loss": 6.4978, "mean_token_accuracy": 0.120374695956707, "num_tokens": 14563643.0, "step": 6725 }, { "entropy": 6.601111316680909, "epoch": 0.7202097490502435, "grad_norm": 1.296875, "learning_rate": 0.0004957487401831947, "loss": 6.445, "mean_token_accuracy": 0.12362169623374938, "num_tokens": 14574422.0, "step": 6730 }, { "entropy": 6.584991502761841, "epoch": 0.7207448231580074, "grad_norm": 1.140625, "learning_rate": 0.0004957413398563906, "loss": 6.4292, "mean_token_accuracy": 0.11930982172489166, "num_tokens": 14585002.0, "step": 6735 }, { "entropy": 6.625512647628784, "epoch": 0.7212798972657714, "grad_norm": 1.6875, "learning_rate": 0.0004957339331557113, "loss": 6.4612, "mean_token_accuracy": 0.1259589172899723, "num_tokens": 14595172.0, "step": 6740 }, { "entropy": 6.599657821655273, "epoch": 0.7218149713735352, "grad_norm": 1.2421875, "learning_rate": 0.0004957265200813706, "loss": 6.5742, "mean_token_accuracy": 0.11676609218120575, "num_tokens": 14606316.0, "step": 6745 }, { "entropy": 6.696068477630615, "epoch": 0.7223500454812991, "grad_norm": 1.609375, "learning_rate": 0.0004957191006335827, "loss": 6.4903, "mean_token_accuracy": 0.12656715735793114, "num_tokens": 14616394.0, "step": 6750 }, { "entropy": 6.555004119873047, "epoch": 0.7228851195890631, "grad_norm": 1.5, "learning_rate": 0.0004957116748125618, "loss": 6.4925, "mean_token_accuracy": 0.11967325806617737, "num_tokens": 14627474.0, "step": 6755 }, { "entropy": 6.575228595733643, "epoch": 0.723420193696827, "grad_norm": 1.28125, "learning_rate": 0.0004957042426185223, "loss": 6.4314, "mean_token_accuracy": 0.13004304990172386, "num_tokens": 14638343.0, "step": 6760 }, { "entropy": 6.614687061309814, "epoch": 0.723955267804591, "grad_norm": 1.328125, "learning_rate": 0.0004956968040516789, "loss": 6.4941, "mean_token_accuracy": 0.12631681188941002, "num_tokens": 14649115.0, "step": 6765 }, { "entropy": 6.607396507263184, "epoch": 0.7244903419123548, "grad_norm": 1.1328125, "learning_rate": 0.0004956893591122461, "loss": 6.5614, "mean_token_accuracy": 0.1266578659415245, "num_tokens": 14659714.0, "step": 6770 }, { "entropy": 6.730130004882812, "epoch": 0.7250254160201188, "grad_norm": 1.2578125, "learning_rate": 0.0004956819078004392, "loss": 6.5943, "mean_token_accuracy": 0.1168831467628479, "num_tokens": 14670481.0, "step": 6775 }, { "entropy": 6.612733459472656, "epoch": 0.7255604901278827, "grad_norm": 1.515625, "learning_rate": 0.0004956744501164732, "loss": 6.4208, "mean_token_accuracy": 0.12815224677324294, "num_tokens": 14680816.0, "step": 6780 }, { "entropy": 6.573790550231934, "epoch": 0.7260955642356466, "grad_norm": 1.1796875, "learning_rate": 0.0004956669860605634, "loss": 6.5177, "mean_token_accuracy": 0.12638939991593362, "num_tokens": 14692723.0, "step": 6785 }, { "entropy": 6.630371952056885, "epoch": 0.7266306383434106, "grad_norm": 1.3125, "learning_rate": 0.0004956595156329254, "loss": 6.5369, "mean_token_accuracy": 0.12008581012487411, "num_tokens": 14703824.0, "step": 6790 }, { "entropy": 6.706773328781128, "epoch": 0.7271657124511745, "grad_norm": 1.28125, "learning_rate": 0.000495652038833775, "loss": 6.5182, "mean_token_accuracy": 0.12735376432538031, "num_tokens": 14715934.0, "step": 6795 }, { "entropy": 6.598440217971802, "epoch": 0.7277007865589384, "grad_norm": 1.328125, "learning_rate": 0.0004956445556633279, "loss": 6.5177, "mean_token_accuracy": 0.12028545215725898, "num_tokens": 14725617.0, "step": 6800 }, { "entropy": 6.634641218185425, "epoch": 0.7282358606667023, "grad_norm": 1.328125, "learning_rate": 0.0004956370661218003, "loss": 6.4967, "mean_token_accuracy": 0.12309338971972465, "num_tokens": 14736430.0, "step": 6805 }, { "entropy": 6.666610288619995, "epoch": 0.7287709347744663, "grad_norm": 1.4375, "learning_rate": 0.0004956295702094084, "loss": 6.5171, "mean_token_accuracy": 0.12309236079454422, "num_tokens": 14746740.0, "step": 6810 }, { "entropy": 6.582339763641357, "epoch": 0.7293060088822302, "grad_norm": 1.5625, "learning_rate": 0.0004956220679263687, "loss": 6.4535, "mean_token_accuracy": 0.12928269281983376, "num_tokens": 14756884.0, "step": 6815 }, { "entropy": 6.589403057098389, "epoch": 0.7298410829899941, "grad_norm": 1.2734375, "learning_rate": 0.0004956145592728976, "loss": 6.4581, "mean_token_accuracy": 0.1312728136777878, "num_tokens": 14766974.0, "step": 6820 }, { "entropy": 6.623006343841553, "epoch": 0.730376157097758, "grad_norm": 1.359375, "learning_rate": 0.0004956070442492123, "loss": 6.6176, "mean_token_accuracy": 0.11667682155966759, "num_tokens": 14778449.0, "step": 6825 }, { "entropy": 6.7070536613464355, "epoch": 0.7309112312055219, "grad_norm": 1.3671875, "learning_rate": 0.0004955995228555296, "loss": 6.5422, "mean_token_accuracy": 0.1225484624505043, "num_tokens": 14788989.0, "step": 6830 }, { "entropy": 6.628703689575195, "epoch": 0.7314463053132859, "grad_norm": 1.2890625, "learning_rate": 0.0004955919950920666, "loss": 6.5023, "mean_token_accuracy": 0.12728202119469642, "num_tokens": 14798454.0, "step": 6835 }, { "entropy": 6.660853433609009, "epoch": 0.7319813794210498, "grad_norm": 1.515625, "learning_rate": 0.0004955844609590408, "loss": 6.4467, "mean_token_accuracy": 0.12790426537394523, "num_tokens": 14808920.0, "step": 6840 }, { "entropy": 6.635347509384156, "epoch": 0.7325164535288138, "grad_norm": 1.1875, "learning_rate": 0.0004955769204566696, "loss": 6.4426, "mean_token_accuracy": 0.1228242613375187, "num_tokens": 14819250.0, "step": 6845 }, { "entropy": 6.662122344970703, "epoch": 0.7330515276365777, "grad_norm": 1.5078125, "learning_rate": 0.0004955693735851709, "loss": 6.5277, "mean_token_accuracy": 0.12443855032324791, "num_tokens": 14829789.0, "step": 6850 }, { "entropy": 6.562832450866699, "epoch": 0.7335866017443415, "grad_norm": 1.5625, "learning_rate": 0.0004955618203447625, "loss": 6.5037, "mean_token_accuracy": 0.1241986483335495, "num_tokens": 14840527.0, "step": 6855 }, { "entropy": 6.608736944198609, "epoch": 0.7341216758521055, "grad_norm": 1.46875, "learning_rate": 0.0004955542607356625, "loss": 6.5588, "mean_token_accuracy": 0.12313508540391922, "num_tokens": 14850922.0, "step": 6860 }, { "entropy": 6.655763769149781, "epoch": 0.7346567499598694, "grad_norm": 1.9609375, "learning_rate": 0.0004955466947580893, "loss": 6.5061, "mean_token_accuracy": 0.12578540593385695, "num_tokens": 14862226.0, "step": 6865 }, { "entropy": 6.597611951828003, "epoch": 0.7351918240676334, "grad_norm": 1.5859375, "learning_rate": 0.0004955391224122611, "loss": 6.4097, "mean_token_accuracy": 0.1363422118127346, "num_tokens": 14872461.0, "step": 6870 }, { "entropy": 6.608497571945191, "epoch": 0.7357268981753973, "grad_norm": 1.4765625, "learning_rate": 0.000495531543698397, "loss": 6.5258, "mean_token_accuracy": 0.12411358803510666, "num_tokens": 14883088.0, "step": 6875 }, { "entropy": 6.693577766418457, "epoch": 0.7362619722831613, "grad_norm": 1.234375, "learning_rate": 0.0004955239586167153, "loss": 6.5405, "mean_token_accuracy": 0.12336590811610222, "num_tokens": 14894055.0, "step": 6880 }, { "entropy": 6.6278046607971195, "epoch": 0.7367970463909251, "grad_norm": 1.5703125, "learning_rate": 0.0004955163671674354, "loss": 6.5092, "mean_token_accuracy": 0.1199507437646389, "num_tokens": 14904760.0, "step": 6885 }, { "entropy": 6.727400636672973, "epoch": 0.737332120498689, "grad_norm": 2.65625, "learning_rate": 0.0004955087693507764, "loss": 6.6256, "mean_token_accuracy": 0.11664849147200584, "num_tokens": 14915983.0, "step": 6890 }, { "entropy": 6.65953311920166, "epoch": 0.737867194606453, "grad_norm": 1.5078125, "learning_rate": 0.0004955011651669577, "loss": 6.5148, "mean_token_accuracy": 0.11811737567186356, "num_tokens": 14925959.0, "step": 6895 }, { "entropy": 6.5658063888549805, "epoch": 0.7384022687142169, "grad_norm": 1.21875, "learning_rate": 0.0004954935546161988, "loss": 6.4756, "mean_token_accuracy": 0.12480072304606438, "num_tokens": 14936138.0, "step": 6900 }, { "entropy": 6.680220413208008, "epoch": 0.7389373428219809, "grad_norm": 1.234375, "learning_rate": 0.0004954859376987195, "loss": 6.5023, "mean_token_accuracy": 0.1277581550180912, "num_tokens": 14946979.0, "step": 6905 }, { "entropy": 6.584284877777099, "epoch": 0.7394724169297447, "grad_norm": 1.3359375, "learning_rate": 0.0004954783144147397, "loss": 6.5679, "mean_token_accuracy": 0.12042608857154846, "num_tokens": 14958324.0, "step": 6910 }, { "entropy": 6.737890386581421, "epoch": 0.7400074910375087, "grad_norm": 1.234375, "learning_rate": 0.0004954706847644796, "loss": 6.5574, "mean_token_accuracy": 0.11832675114274024, "num_tokens": 14969048.0, "step": 6915 }, { "entropy": 6.710620450973511, "epoch": 0.7405425651452726, "grad_norm": 1.265625, "learning_rate": 0.0004954630487481594, "loss": 6.5496, "mean_token_accuracy": 0.12008848264813424, "num_tokens": 14979825.0, "step": 6920 }, { "entropy": 6.595880651473999, "epoch": 0.7410776392530365, "grad_norm": 1.3671875, "learning_rate": 0.0004954554063659998, "loss": 6.481, "mean_token_accuracy": 0.12603807896375657, "num_tokens": 14990138.0, "step": 6925 }, { "entropy": 6.596027612686157, "epoch": 0.7416127133608005, "grad_norm": 1.4453125, "learning_rate": 0.0004954477576182212, "loss": 6.4498, "mean_token_accuracy": 0.1261916309595108, "num_tokens": 15002276.0, "step": 6930 }, { "entropy": 6.646682214736939, "epoch": 0.7421477874685644, "grad_norm": 1.3828125, "learning_rate": 0.0004954401025050445, "loss": 6.5709, "mean_token_accuracy": 0.12357406765222549, "num_tokens": 15013622.0, "step": 6935 }, { "entropy": 6.676917219161988, "epoch": 0.7426828615763283, "grad_norm": 1.3203125, "learning_rate": 0.0004954324410266909, "loss": 6.531, "mean_token_accuracy": 0.12281017452478409, "num_tokens": 15024067.0, "step": 6940 }, { "entropy": 6.628924036026001, "epoch": 0.7432179356840922, "grad_norm": 1.359375, "learning_rate": 0.0004954247731833815, "loss": 6.4168, "mean_token_accuracy": 0.13402525782585145, "num_tokens": 15033646.0, "step": 6945 }, { "entropy": 6.559259271621704, "epoch": 0.7437530097918562, "grad_norm": 1.2734375, "learning_rate": 0.0004954170989753377, "loss": 6.4686, "mean_token_accuracy": 0.12331727594137191, "num_tokens": 15044655.0, "step": 6950 }, { "entropy": 6.714093255996704, "epoch": 0.7442880838996201, "grad_norm": 1.6328125, "learning_rate": 0.0004954094184027813, "loss": 6.5556, "mean_token_accuracy": 0.11801010146737098, "num_tokens": 15055492.0, "step": 6955 }, { "entropy": 6.666389083862304, "epoch": 0.744823158007384, "grad_norm": 1.3046875, "learning_rate": 0.0004954017314659339, "loss": 6.53, "mean_token_accuracy": 0.1155826836824417, "num_tokens": 15066472.0, "step": 6960 }, { "entropy": 6.671958112716675, "epoch": 0.745358232115148, "grad_norm": 1.328125, "learning_rate": 0.0004953940381650174, "loss": 6.5027, "mean_token_accuracy": 0.12497956231236458, "num_tokens": 15076851.0, "step": 6965 }, { "entropy": 6.544204425811768, "epoch": 0.7458933062229118, "grad_norm": 1.4453125, "learning_rate": 0.0004953863385002541, "loss": 6.4337, "mean_token_accuracy": 0.12553054392337798, "num_tokens": 15086997.0, "step": 6970 }, { "entropy": 6.669872713088989, "epoch": 0.7464283803306758, "grad_norm": 1.3359375, "learning_rate": 0.0004953786324718661, "loss": 6.5781, "mean_token_accuracy": 0.1174256332218647, "num_tokens": 15098625.0, "step": 6975 }, { "entropy": 6.628860807418823, "epoch": 0.7469634544384397, "grad_norm": 1.2890625, "learning_rate": 0.0004953709200800761, "loss": 6.3992, "mean_token_accuracy": 0.1296637736260891, "num_tokens": 15108265.0, "step": 6980 }, { "entropy": 6.58307580947876, "epoch": 0.7474985285462037, "grad_norm": 1.4453125, "learning_rate": 0.0004953632013251068, "loss": 6.4934, "mean_token_accuracy": 0.12321807146072387, "num_tokens": 15118794.0, "step": 6985 }, { "entropy": 6.648694610595703, "epoch": 0.7480336026539676, "grad_norm": 1.5859375, "learning_rate": 0.0004953554762071811, "loss": 6.5249, "mean_token_accuracy": 0.12125022262334824, "num_tokens": 15130084.0, "step": 6990 }, { "entropy": 6.664281702041626, "epoch": 0.7485686767617316, "grad_norm": 1.515625, "learning_rate": 0.0004953477447265218, "loss": 6.5118, "mean_token_accuracy": 0.11916638761758805, "num_tokens": 15142193.0, "step": 6995 }, { "entropy": 6.637905645370483, "epoch": 0.7491037508694954, "grad_norm": 1.546875, "learning_rate": 0.0004953400068833524, "loss": 6.6153, "mean_token_accuracy": 0.12101433128118515, "num_tokens": 15152817.0, "step": 7000 }, { "entropy": 6.557371330261231, "epoch": 0.7496388249772593, "grad_norm": 1.3203125, "learning_rate": 0.0004953322626778964, "loss": 6.317, "mean_token_accuracy": 0.13028131946921348, "num_tokens": 15162352.0, "step": 7005 }, { "entropy": 6.673658227920532, "epoch": 0.7501738990850233, "grad_norm": 1.421875, "learning_rate": 0.0004953245121103771, "loss": 6.4892, "mean_token_accuracy": 0.12943382561206818, "num_tokens": 15173091.0, "step": 7010 }, { "entropy": 6.693431568145752, "epoch": 0.7507089731927872, "grad_norm": 1.4765625, "learning_rate": 0.0004953167551810185, "loss": 6.6457, "mean_token_accuracy": 0.11348064690828323, "num_tokens": 15184422.0, "step": 7015 }, { "entropy": 6.567291927337647, "epoch": 0.7512440473005512, "grad_norm": 1.4609375, "learning_rate": 0.0004953089918900447, "loss": 6.3901, "mean_token_accuracy": 0.13483602181077003, "num_tokens": 15194765.0, "step": 7020 }, { "entropy": 6.645245218276978, "epoch": 0.751779121408315, "grad_norm": 1.5546875, "learning_rate": 0.0004953012222376795, "loss": 6.5368, "mean_token_accuracy": 0.11706858575344085, "num_tokens": 15206007.0, "step": 7025 }, { "entropy": 6.627328014373779, "epoch": 0.752314195516079, "grad_norm": 1.4609375, "learning_rate": 0.0004952934462241476, "loss": 6.489, "mean_token_accuracy": 0.12645872682332993, "num_tokens": 15216634.0, "step": 7030 }, { "entropy": 6.62941837310791, "epoch": 0.7528492696238429, "grad_norm": 1.109375, "learning_rate": 0.0004952856638496734, "loss": 6.5516, "mean_token_accuracy": 0.1180113211274147, "num_tokens": 15226931.0, "step": 7035 }, { "entropy": 6.64382848739624, "epoch": 0.7533843437316068, "grad_norm": 1.5, "learning_rate": 0.0004952778751144817, "loss": 6.5267, "mean_token_accuracy": 0.12257011234760284, "num_tokens": 15239034.0, "step": 7040 }, { "entropy": 6.664216995239258, "epoch": 0.7539194178393708, "grad_norm": 1.390625, "learning_rate": 0.0004952700800187971, "loss": 6.5176, "mean_token_accuracy": 0.12180257961153984, "num_tokens": 15250088.0, "step": 7045 }, { "entropy": 6.677762746810913, "epoch": 0.7544544919471347, "grad_norm": 1.5, "learning_rate": 0.000495262278562845, "loss": 6.4659, "mean_token_accuracy": 0.12146370336413384, "num_tokens": 15261150.0, "step": 7050 }, { "entropy": 6.664985132217407, "epoch": 0.7549895660548986, "grad_norm": 1.28125, "learning_rate": 0.0004952544707468506, "loss": 6.5414, "mean_token_accuracy": 0.12395042702555656, "num_tokens": 15270865.0, "step": 7055 }, { "entropy": 6.677373027801513, "epoch": 0.7555246401626625, "grad_norm": 1.40625, "learning_rate": 0.0004952466565710391, "loss": 6.5552, "mean_token_accuracy": 0.118691186606884, "num_tokens": 15282809.0, "step": 7060 }, { "entropy": 6.694124698638916, "epoch": 0.7560597142704265, "grad_norm": 1.3046875, "learning_rate": 0.0004952388360356366, "loss": 6.5083, "mean_token_accuracy": 0.12859989702701569, "num_tokens": 15293166.0, "step": 7065 }, { "entropy": 6.616050100326538, "epoch": 0.7565947883781904, "grad_norm": 1.5, "learning_rate": 0.0004952310091408685, "loss": 6.4966, "mean_token_accuracy": 0.12518092021346092, "num_tokens": 15302985.0, "step": 7070 }, { "entropy": 6.651115751266479, "epoch": 0.7571298624859543, "grad_norm": 1.59375, "learning_rate": 0.0004952231758869611, "loss": 6.5415, "mean_token_accuracy": 0.1267145797610283, "num_tokens": 15314737.0, "step": 7075 }, { "entropy": 6.614376068115234, "epoch": 0.7576649365937183, "grad_norm": 1.2421875, "learning_rate": 0.0004952153362741403, "loss": 6.464, "mean_token_accuracy": 0.13092187345027922, "num_tokens": 15325441.0, "step": 7080 }, { "entropy": 6.599036788940429, "epoch": 0.7582000107014821, "grad_norm": 1.2265625, "learning_rate": 0.0004952074903026327, "loss": 6.3991, "mean_token_accuracy": 0.12750762775540353, "num_tokens": 15334939.0, "step": 7085 }, { "entropy": 6.595050287246704, "epoch": 0.7587350848092461, "grad_norm": 1.21875, "learning_rate": 0.0004951996379726647, "loss": 6.5734, "mean_token_accuracy": 0.12048307284712792, "num_tokens": 15345655.0, "step": 7090 }, { "entropy": 6.538129758834839, "epoch": 0.75927015891701, "grad_norm": 1.4375, "learning_rate": 0.0004951917792844631, "loss": 6.3968, "mean_token_accuracy": 0.13058631792664527, "num_tokens": 15356035.0, "step": 7095 }, { "entropy": 6.659978437423706, "epoch": 0.759805233024774, "grad_norm": 1.1875, "learning_rate": 0.0004951839142382548, "loss": 6.5094, "mean_token_accuracy": 0.12489819005131722, "num_tokens": 15368509.0, "step": 7100 }, { "entropy": 6.615253734588623, "epoch": 0.7603403071325379, "grad_norm": 1.171875, "learning_rate": 0.000495176042834267, "loss": 6.4777, "mean_token_accuracy": 0.1264044873416424, "num_tokens": 15379662.0, "step": 7105 }, { "entropy": 6.601353359222412, "epoch": 0.7608753812403017, "grad_norm": 1.4609375, "learning_rate": 0.0004951681650727268, "loss": 6.4844, "mean_token_accuracy": 0.11898941099643708, "num_tokens": 15389698.0, "step": 7110 }, { "entropy": 6.746938896179199, "epoch": 0.7614104553480657, "grad_norm": 1.203125, "learning_rate": 0.0004951602809538619, "loss": 6.5772, "mean_token_accuracy": 0.11864528879523277, "num_tokens": 15400724.0, "step": 7115 }, { "entropy": 6.733620023727417, "epoch": 0.7619455294558296, "grad_norm": 1.25, "learning_rate": 0.0004951523904778997, "loss": 6.5659, "mean_token_accuracy": 0.11942593604326249, "num_tokens": 15410732.0, "step": 7120 }, { "entropy": 6.618440341949463, "epoch": 0.7624806035635936, "grad_norm": 1.421875, "learning_rate": 0.0004951444936450682, "loss": 6.4671, "mean_token_accuracy": 0.13049914836883544, "num_tokens": 15420185.0, "step": 7125 }, { "entropy": 6.591977787017822, "epoch": 0.7630156776713575, "grad_norm": 1.515625, "learning_rate": 0.0004951365904555954, "loss": 6.4038, "mean_token_accuracy": 0.1246684692800045, "num_tokens": 15431904.0, "step": 7130 }, { "entropy": 6.575604772567749, "epoch": 0.7635507517791215, "grad_norm": 1.2890625, "learning_rate": 0.0004951286809097094, "loss": 6.5303, "mean_token_accuracy": 0.11952223181724549, "num_tokens": 15442650.0, "step": 7135 }, { "entropy": 6.564087724685669, "epoch": 0.7640858258868853, "grad_norm": 1.484375, "learning_rate": 0.0004951207650076388, "loss": 6.5026, "mean_token_accuracy": 0.12019338682293892, "num_tokens": 15454273.0, "step": 7140 }, { "entropy": 6.638538455963134, "epoch": 0.7646208999946492, "grad_norm": 1.2890625, "learning_rate": 0.000495112842749612, "loss": 6.4855, "mean_token_accuracy": 0.1241270050406456, "num_tokens": 15465751.0, "step": 7145 }, { "entropy": 6.656053924560547, "epoch": 0.7651559741024132, "grad_norm": 1.359375, "learning_rate": 0.0004951049141358578, "loss": 6.5927, "mean_token_accuracy": 0.11400035619735718, "num_tokens": 15475340.0, "step": 7150 }, { "entropy": 6.713410806655884, "epoch": 0.7656910482101771, "grad_norm": 1.265625, "learning_rate": 0.0004950969791666051, "loss": 6.5507, "mean_token_accuracy": 0.1195062555372715, "num_tokens": 15486246.0, "step": 7155 }, { "entropy": 6.696958923339844, "epoch": 0.7662261223179411, "grad_norm": 1.390625, "learning_rate": 0.0004950890378420831, "loss": 6.5556, "mean_token_accuracy": 0.12101633250713348, "num_tokens": 15497331.0, "step": 7160 }, { "entropy": 6.624008226394653, "epoch": 0.766761196425705, "grad_norm": 1.1328125, "learning_rate": 0.000495081090162521, "loss": 6.496, "mean_token_accuracy": 0.1252144269645214, "num_tokens": 15508036.0, "step": 7165 }, { "entropy": 6.651372194290161, "epoch": 0.7672962705334689, "grad_norm": 1.3984375, "learning_rate": 0.0004950731361281483, "loss": 6.4892, "mean_token_accuracy": 0.12409828379750251, "num_tokens": 15518381.0, "step": 7170 }, { "entropy": 6.648929023742676, "epoch": 0.7678313446412328, "grad_norm": 1.296875, "learning_rate": 0.0004950651757391948, "loss": 6.4927, "mean_token_accuracy": 0.12453809827566147, "num_tokens": 15528939.0, "step": 7175 }, { "entropy": 6.691262435913086, "epoch": 0.7683664187489967, "grad_norm": 1.25, "learning_rate": 0.0004950572089958904, "loss": 6.4844, "mean_token_accuracy": 0.11920621544122696, "num_tokens": 15539718.0, "step": 7180 }, { "entropy": 6.671784210205078, "epoch": 0.7689014928567607, "grad_norm": 1.375, "learning_rate": 0.0004950492358984648, "loss": 6.6442, "mean_token_accuracy": 0.11607598587870598, "num_tokens": 15550970.0, "step": 7185 }, { "entropy": 6.673526191711426, "epoch": 0.7694365669645246, "grad_norm": 1.296875, "learning_rate": 0.0004950412564471486, "loss": 6.4146, "mean_token_accuracy": 0.1274817906320095, "num_tokens": 15560490.0, "step": 7190 }, { "entropy": 6.616913270950318, "epoch": 0.7699716410722885, "grad_norm": 1.390625, "learning_rate": 0.000495033270642172, "loss": 6.4266, "mean_token_accuracy": 0.1294262781739235, "num_tokens": 15570188.0, "step": 7195 }, { "entropy": 6.589165592193604, "epoch": 0.7705067151800524, "grad_norm": 1.296875, "learning_rate": 0.0004950252784837655, "loss": 6.4459, "mean_token_accuracy": 0.12019804939627647, "num_tokens": 15581446.0, "step": 7200 }, { "entropy": 6.63636999130249, "epoch": 0.7710417892878164, "grad_norm": 1.8125, "learning_rate": 0.0004950172799721601, "loss": 6.5597, "mean_token_accuracy": 0.12001867443323136, "num_tokens": 15594362.0, "step": 7205 }, { "entropy": 6.646881103515625, "epoch": 0.7715768633955803, "grad_norm": 1.5390625, "learning_rate": 0.0004950092751075866, "loss": 6.4336, "mean_token_accuracy": 0.13300900235772134, "num_tokens": 15605531.0, "step": 7210 }, { "entropy": 6.632643985748291, "epoch": 0.7721119375033442, "grad_norm": 1.65625, "learning_rate": 0.0004950012638902763, "loss": 6.4747, "mean_token_accuracy": 0.12664539813995362, "num_tokens": 15614962.0, "step": 7215 }, { "entropy": 6.527265357971191, "epoch": 0.7726470116111082, "grad_norm": 2.078125, "learning_rate": 0.0004949932463204603, "loss": 6.5196, "mean_token_accuracy": 0.12367821410298348, "num_tokens": 15625475.0, "step": 7220 }, { "entropy": 6.600604248046875, "epoch": 0.773182085718872, "grad_norm": 1.1953125, "learning_rate": 0.0004949852223983703, "loss": 6.5051, "mean_token_accuracy": 0.11932418122887611, "num_tokens": 15637359.0, "step": 7225 }, { "entropy": 6.792949867248535, "epoch": 0.773717159826636, "grad_norm": 1.5078125, "learning_rate": 0.0004949771921242379, "loss": 6.5462, "mean_token_accuracy": 0.117109165340662, "num_tokens": 15648368.0, "step": 7230 }, { "entropy": 6.6926452159881595, "epoch": 0.7742522339343999, "grad_norm": 1.34375, "learning_rate": 0.0004949691554982951, "loss": 6.4385, "mean_token_accuracy": 0.13027268201112746, "num_tokens": 15659295.0, "step": 7235 }, { "entropy": 6.543884658813477, "epoch": 0.7747873080421639, "grad_norm": 1.5859375, "learning_rate": 0.0004949611125207737, "loss": 6.4051, "mean_token_accuracy": 0.12192230448126792, "num_tokens": 15669975.0, "step": 7240 }, { "entropy": 6.570065546035766, "epoch": 0.7753223821499278, "grad_norm": 1.5390625, "learning_rate": 0.000494953063191906, "loss": 6.4946, "mean_token_accuracy": 0.11872415691614151, "num_tokens": 15680343.0, "step": 7245 }, { "entropy": 6.683220624923706, "epoch": 0.7758574562576916, "grad_norm": 1.34375, "learning_rate": 0.0004949450075119247, "loss": 6.5525, "mean_token_accuracy": 0.12026704177260399, "num_tokens": 15692246.0, "step": 7250 }, { "entropy": 6.6822953701019285, "epoch": 0.7763925303654556, "grad_norm": 1.140625, "learning_rate": 0.0004949369454810621, "loss": 6.5062, "mean_token_accuracy": 0.12393845468759537, "num_tokens": 15704262.0, "step": 7255 }, { "entropy": 6.547556638717651, "epoch": 0.7769276044732195, "grad_norm": 1.5234375, "learning_rate": 0.0004949288770995512, "loss": 6.4991, "mean_token_accuracy": 0.12381231859326362, "num_tokens": 15715078.0, "step": 7260 }, { "entropy": 6.660402727127075, "epoch": 0.7774626785809835, "grad_norm": 1.3125, "learning_rate": 0.0004949208023676249, "loss": 6.5459, "mean_token_accuracy": 0.1232883907854557, "num_tokens": 15726503.0, "step": 7265 }, { "entropy": 6.587308025360107, "epoch": 0.7779977526887474, "grad_norm": 2.140625, "learning_rate": 0.0004949127212855161, "loss": 6.4327, "mean_token_accuracy": 0.12670731246471406, "num_tokens": 15738854.0, "step": 7270 }, { "entropy": 6.611951589584351, "epoch": 0.7785328267965114, "grad_norm": 1.5859375, "learning_rate": 0.0004949046338534587, "loss": 6.5893, "mean_token_accuracy": 0.12085817605257035, "num_tokens": 15750836.0, "step": 7275 }, { "entropy": 6.783895874023438, "epoch": 0.7790679009042752, "grad_norm": 1.4765625, "learning_rate": 0.0004948965400716857, "loss": 6.5934, "mean_token_accuracy": 0.12155032604932785, "num_tokens": 15762355.0, "step": 7280 }, { "entropy": 6.6959075927734375, "epoch": 0.7796029750120391, "grad_norm": 1.3828125, "learning_rate": 0.000494888439940431, "loss": 6.5948, "mean_token_accuracy": 0.12169316858053207, "num_tokens": 15772952.0, "step": 7285 }, { "entropy": 6.562328147888183, "epoch": 0.7801380491198031, "grad_norm": 1.5703125, "learning_rate": 0.0004948803334599286, "loss": 6.4051, "mean_token_accuracy": 0.13314662128686905, "num_tokens": 15782997.0, "step": 7290 }, { "entropy": 6.598123836517334, "epoch": 0.780673123227567, "grad_norm": 1.6875, "learning_rate": 0.0004948722206304123, "loss": 6.5065, "mean_token_accuracy": 0.12343615815043449, "num_tokens": 15794060.0, "step": 7295 }, { "entropy": 6.707820177078247, "epoch": 0.781208197335331, "grad_norm": 1.1953125, "learning_rate": 0.0004948641014521167, "loss": 6.5704, "mean_token_accuracy": 0.12031665593385696, "num_tokens": 15804149.0, "step": 7300 }, { "entropy": 6.668608617782593, "epoch": 0.7817432714430949, "grad_norm": 1.40625, "learning_rate": 0.000494855975925276, "loss": 6.496, "mean_token_accuracy": 0.12902145832777023, "num_tokens": 15814643.0, "step": 7305 }, { "entropy": 6.645229959487915, "epoch": 0.7822783455508588, "grad_norm": 1.4921875, "learning_rate": 0.0004948478440501249, "loss": 6.4438, "mean_token_accuracy": 0.1254532441496849, "num_tokens": 15824640.0, "step": 7310 }, { "entropy": 6.553537178039551, "epoch": 0.7828134196586227, "grad_norm": 1.40625, "learning_rate": 0.0004948397058268982, "loss": 6.4806, "mean_token_accuracy": 0.12377227991819381, "num_tokens": 15836160.0, "step": 7315 }, { "entropy": 6.6396448612213135, "epoch": 0.7833484937663866, "grad_norm": 1.453125, "learning_rate": 0.0004948315612558308, "loss": 6.5149, "mean_token_accuracy": 0.12054053619503975, "num_tokens": 15846886.0, "step": 7320 }, { "entropy": 6.6480477809906, "epoch": 0.7838835678741506, "grad_norm": 1.5859375, "learning_rate": 0.000494823410337158, "loss": 6.4443, "mean_token_accuracy": 0.13052470311522485, "num_tokens": 15857309.0, "step": 7325 }, { "entropy": 6.601436614990234, "epoch": 0.7844186419819145, "grad_norm": 1.5546875, "learning_rate": 0.0004948152530711153, "loss": 6.5795, "mean_token_accuracy": 0.12191757187247276, "num_tokens": 15869620.0, "step": 7330 }, { "entropy": 6.614558506011963, "epoch": 0.7849537160896785, "grad_norm": 1.359375, "learning_rate": 0.0004948070894579378, "loss": 6.4211, "mean_token_accuracy": 0.129998816549778, "num_tokens": 15880915.0, "step": 7335 }, { "entropy": 6.605517482757568, "epoch": 0.7854887901974423, "grad_norm": 1.296875, "learning_rate": 0.0004947989194978616, "loss": 6.495, "mean_token_accuracy": 0.1268579512834549, "num_tokens": 15891150.0, "step": 7340 }, { "entropy": 6.656474876403808, "epoch": 0.7860238643052063, "grad_norm": 1.2265625, "learning_rate": 0.0004947907431911225, "loss": 6.4923, "mean_token_accuracy": 0.12626128271222115, "num_tokens": 15902526.0, "step": 7345 }, { "entropy": 6.591264724731445, "epoch": 0.7865589384129702, "grad_norm": 1.53125, "learning_rate": 0.0004947825605379566, "loss": 6.4372, "mean_token_accuracy": 0.12627596408128738, "num_tokens": 15913425.0, "step": 7350 }, { "entropy": 6.613666772842407, "epoch": 0.7870940125207341, "grad_norm": 1.3125, "learning_rate": 0.0004947743715386, "loss": 6.4193, "mean_token_accuracy": 0.12343008667230607, "num_tokens": 15924324.0, "step": 7355 }, { "entropy": 6.57948784828186, "epoch": 0.7876290866284981, "grad_norm": 1.6640625, "learning_rate": 0.0004947661761932894, "loss": 6.4727, "mean_token_accuracy": 0.12277128249406814, "num_tokens": 15935533.0, "step": 7360 }, { "entropy": 6.5657641887664795, "epoch": 0.7881641607362619, "grad_norm": 1.3203125, "learning_rate": 0.0004947579745022613, "loss": 6.4295, "mean_token_accuracy": 0.12148091346025466, "num_tokens": 15947007.0, "step": 7365 }, { "entropy": 6.581766366958618, "epoch": 0.7886992348440259, "grad_norm": 1.421875, "learning_rate": 0.0004947497664657527, "loss": 6.4862, "mean_token_accuracy": 0.12112942487001419, "num_tokens": 15957405.0, "step": 7370 }, { "entropy": 6.61507477760315, "epoch": 0.7892343089517898, "grad_norm": 1.296875, "learning_rate": 0.0004947415520840003, "loss": 6.4761, "mean_token_accuracy": 0.12532250955700874, "num_tokens": 15969895.0, "step": 7375 }, { "entropy": 6.637605905532837, "epoch": 0.7897693830595538, "grad_norm": 1.4921875, "learning_rate": 0.0004947333313572416, "loss": 6.3931, "mean_token_accuracy": 0.13630961254239082, "num_tokens": 15979854.0, "step": 7380 }, { "entropy": 6.567370319366455, "epoch": 0.7903044571673177, "grad_norm": 1.390625, "learning_rate": 0.0004947251042857137, "loss": 6.3963, "mean_token_accuracy": 0.13095270618796348, "num_tokens": 15991341.0, "step": 7385 }, { "entropy": 6.531961727142334, "epoch": 0.7908395312750816, "grad_norm": 1.640625, "learning_rate": 0.0004947168708696544, "loss": 6.4554, "mean_token_accuracy": 0.12993446215987206, "num_tokens": 16001944.0, "step": 7390 }, { "entropy": 6.560093545913697, "epoch": 0.7913746053828455, "grad_norm": 1.2734375, "learning_rate": 0.0004947086311093013, "loss": 6.4423, "mean_token_accuracy": 0.1281399607658386, "num_tokens": 16011771.0, "step": 7395 }, { "entropy": 6.687586164474487, "epoch": 0.7919096794906094, "grad_norm": 1.3046875, "learning_rate": 0.0004947003850048924, "loss": 6.6005, "mean_token_accuracy": 0.11408599764108658, "num_tokens": 16023901.0, "step": 7400 }, { "entropy": 6.740469646453858, "epoch": 0.7924447535983734, "grad_norm": 1.4296875, "learning_rate": 0.0004946921325566656, "loss": 6.5191, "mean_token_accuracy": 0.1196585789322853, "num_tokens": 16035014.0, "step": 7405 }, { "entropy": 6.650988531112671, "epoch": 0.7929798277061373, "grad_norm": 1.2109375, "learning_rate": 0.0004946838737648595, "loss": 6.5891, "mean_token_accuracy": 0.11678230240941048, "num_tokens": 16046927.0, "step": 7410 }, { "entropy": 6.613309526443482, "epoch": 0.7935149018139013, "grad_norm": 1.296875, "learning_rate": 0.0004946756086297124, "loss": 6.4909, "mean_token_accuracy": 0.12795686945319176, "num_tokens": 16057341.0, "step": 7415 }, { "entropy": 6.654987621307373, "epoch": 0.7940499759216652, "grad_norm": 1.5078125, "learning_rate": 0.0004946673371514628, "loss": 6.4782, "mean_token_accuracy": 0.12236208170652389, "num_tokens": 16068408.0, "step": 7420 }, { "entropy": 6.5727095127105715, "epoch": 0.794585050029429, "grad_norm": 1.6875, "learning_rate": 0.0004946590593303499, "loss": 6.4494, "mean_token_accuracy": 0.1296915277838707, "num_tokens": 16078693.0, "step": 7425 }, { "entropy": 6.60039119720459, "epoch": 0.795120124137193, "grad_norm": 1.3203125, "learning_rate": 0.0004946507751666124, "loss": 6.4975, "mean_token_accuracy": 0.1274369865655899, "num_tokens": 16089127.0, "step": 7430 }, { "entropy": 6.586338949203491, "epoch": 0.7956551982449569, "grad_norm": 1.5078125, "learning_rate": 0.0004946424846604897, "loss": 6.4071, "mean_token_accuracy": 0.13582724407315255, "num_tokens": 16099726.0, "step": 7435 }, { "entropy": 6.615121269226075, "epoch": 0.7961902723527209, "grad_norm": 1.234375, "learning_rate": 0.0004946341878122212, "loss": 6.4573, "mean_token_accuracy": 0.12698574587702752, "num_tokens": 16111017.0, "step": 7440 }, { "entropy": 6.624665117263794, "epoch": 0.7967253464604848, "grad_norm": 1.484375, "learning_rate": 0.0004946258846220462, "loss": 6.5288, "mean_token_accuracy": 0.12629680335521698, "num_tokens": 16121406.0, "step": 7445 }, { "entropy": 6.636161994934082, "epoch": 0.7972604205682488, "grad_norm": 1.875, "learning_rate": 0.0004946175750902049, "loss": 6.4516, "mean_token_accuracy": 0.12538782581686975, "num_tokens": 16131587.0, "step": 7450 }, { "entropy": 6.5716126441955565, "epoch": 0.7977954946760126, "grad_norm": 2.0625, "learning_rate": 0.0004946092592169368, "loss": 6.4116, "mean_token_accuracy": 0.12958415150642394, "num_tokens": 16142578.0, "step": 7455 }, { "entropy": 6.619257640838623, "epoch": 0.7983305687837765, "grad_norm": 1.4921875, "learning_rate": 0.0004946009370024822, "loss": 6.426, "mean_token_accuracy": 0.1310078866779804, "num_tokens": 16153501.0, "step": 7460 }, { "entropy": 6.572661924362182, "epoch": 0.7988656428915405, "grad_norm": 1.890625, "learning_rate": 0.0004945926084470814, "loss": 6.5052, "mean_token_accuracy": 0.12284256890416145, "num_tokens": 16164273.0, "step": 7465 }, { "entropy": 6.610775899887085, "epoch": 0.7994007169993044, "grad_norm": 1.3046875, "learning_rate": 0.0004945842735509749, "loss": 6.4856, "mean_token_accuracy": 0.12552264481782913, "num_tokens": 16175071.0, "step": 7470 }, { "entropy": 6.680575323104859, "epoch": 0.7999357911070684, "grad_norm": 1.2421875, "learning_rate": 0.0004945759323144034, "loss": 6.5288, "mean_token_accuracy": 0.11573776230216026, "num_tokens": 16185404.0, "step": 7475 }, { "entropy": 6.629665231704712, "epoch": 0.8004708652148322, "grad_norm": 1.4609375, "learning_rate": 0.0004945675847376077, "loss": 6.5139, "mean_token_accuracy": 0.12014818266034126, "num_tokens": 16196881.0, "step": 7480 }, { "entropy": 6.639012718200684, "epoch": 0.8010059393225962, "grad_norm": 1.2734375, "learning_rate": 0.0004945592308208288, "loss": 6.5439, "mean_token_accuracy": 0.12018415406346321, "num_tokens": 16207534.0, "step": 7485 }, { "entropy": 6.646149730682373, "epoch": 0.8015410134303601, "grad_norm": 1.1875, "learning_rate": 0.000494550870564308, "loss": 6.4188, "mean_token_accuracy": 0.13105716928839684, "num_tokens": 16217371.0, "step": 7490 }, { "entropy": 6.6225439548492435, "epoch": 0.802076087538124, "grad_norm": 1.484375, "learning_rate": 0.0004945425039682866, "loss": 6.467, "mean_token_accuracy": 0.1279752753674984, "num_tokens": 16227898.0, "step": 7495 }, { "entropy": 6.564583015441895, "epoch": 0.802611161645888, "grad_norm": 1.4921875, "learning_rate": 0.0004945341310330064, "loss": 6.4619, "mean_token_accuracy": 0.1270508736371994, "num_tokens": 16238966.0, "step": 7500 }, { "entropy": 6.590152359008789, "epoch": 0.8031462357536518, "grad_norm": 1.7890625, "learning_rate": 0.0004945257517587089, "loss": 6.4931, "mean_token_accuracy": 0.12701256275177003, "num_tokens": 16250129.0, "step": 7505 }, { "entropy": 6.5930369853973385, "epoch": 0.8036813098614158, "grad_norm": 1.2421875, "learning_rate": 0.0004945173661456361, "loss": 6.5149, "mean_token_accuracy": 0.12291709631681443, "num_tokens": 16260877.0, "step": 7510 }, { "entropy": 6.699715852737427, "epoch": 0.8042163839691797, "grad_norm": 1.1640625, "learning_rate": 0.0004945089741940303, "loss": 6.472, "mean_token_accuracy": 0.12913578376173973, "num_tokens": 16270548.0, "step": 7515 }, { "entropy": 6.676292562484742, "epoch": 0.8047514580769437, "grad_norm": 1.2734375, "learning_rate": 0.0004945005759041338, "loss": 6.497, "mean_token_accuracy": 0.12249005734920501, "num_tokens": 16281014.0, "step": 7520 }, { "entropy": 6.624485683441162, "epoch": 0.8052865321847076, "grad_norm": 1.2421875, "learning_rate": 0.0004944921712761889, "loss": 6.5405, "mean_token_accuracy": 0.12573966085910798, "num_tokens": 16291653.0, "step": 7525 }, { "entropy": 6.5947753429412845, "epoch": 0.8058216062924715, "grad_norm": 1.28125, "learning_rate": 0.0004944837603104383, "loss": 6.3863, "mean_token_accuracy": 0.13147774934768677, "num_tokens": 16301703.0, "step": 7530 }, { "entropy": 6.560491371154785, "epoch": 0.8063566804002354, "grad_norm": 1.4453125, "learning_rate": 0.0004944753430071252, "loss": 6.4576, "mean_token_accuracy": 0.12715979367494584, "num_tokens": 16312252.0, "step": 7535 }, { "entropy": 6.584918880462647, "epoch": 0.8068917545079993, "grad_norm": 1.375, "learning_rate": 0.0004944669193664923, "loss": 6.4331, "mean_token_accuracy": 0.12487595155835152, "num_tokens": 16324073.0, "step": 7540 }, { "entropy": 6.6717156887054445, "epoch": 0.8074268286157633, "grad_norm": 1.25, "learning_rate": 0.0004944584893887829, "loss": 6.4445, "mean_token_accuracy": 0.12484904229640961, "num_tokens": 16334637.0, "step": 7545 }, { "entropy": 6.605461120605469, "epoch": 0.8079619027235272, "grad_norm": 1.34375, "learning_rate": 0.0004944500530742404, "loss": 6.5743, "mean_token_accuracy": 0.11794036030769348, "num_tokens": 16345581.0, "step": 7550 }, { "entropy": 6.6252374172210695, "epoch": 0.8084969768312912, "grad_norm": 1.453125, "learning_rate": 0.0004944416104231086, "loss": 6.5663, "mean_token_accuracy": 0.1216730572283268, "num_tokens": 16356995.0, "step": 7555 }, { "entropy": 6.688077592849732, "epoch": 0.8090320509390551, "grad_norm": 1.3046875, "learning_rate": 0.0004944331614356311, "loss": 6.5093, "mean_token_accuracy": 0.11890427842736244, "num_tokens": 16368841.0, "step": 7560 }, { "entropy": 6.692157506942749, "epoch": 0.8095671250468189, "grad_norm": 1.2578125, "learning_rate": 0.0004944247061120519, "loss": 6.4279, "mean_token_accuracy": 0.12462588772177696, "num_tokens": 16379295.0, "step": 7565 }, { "entropy": 6.576985025405884, "epoch": 0.8101021991545829, "grad_norm": 1.6953125, "learning_rate": 0.0004944162444526151, "loss": 6.4721, "mean_token_accuracy": 0.13099455311894417, "num_tokens": 16389512.0, "step": 7570 }, { "entropy": 6.476492547988892, "epoch": 0.8106372732623468, "grad_norm": 1.1796875, "learning_rate": 0.0004944077764575651, "loss": 6.3894, "mean_token_accuracy": 0.13501969650387763, "num_tokens": 16400720.0, "step": 7575 }, { "entropy": 6.580502033233643, "epoch": 0.8111723473701108, "grad_norm": 1.7890625, "learning_rate": 0.0004943993021271463, "loss": 6.4658, "mean_token_accuracy": 0.12537092193961144, "num_tokens": 16411278.0, "step": 7580 }, { "entropy": 6.67013144493103, "epoch": 0.8117074214778747, "grad_norm": 1.28125, "learning_rate": 0.0004943908214616035, "loss": 6.5088, "mean_token_accuracy": 0.12090714648365974, "num_tokens": 16421665.0, "step": 7585 }, { "entropy": 6.671138763427734, "epoch": 0.8122424955856387, "grad_norm": 1.25, "learning_rate": 0.0004943823344611818, "loss": 6.5485, "mean_token_accuracy": 0.11637551337480545, "num_tokens": 16432943.0, "step": 7590 }, { "entropy": 6.666892385482788, "epoch": 0.8127775696934025, "grad_norm": 1.421875, "learning_rate": 0.0004943738411261258, "loss": 6.451, "mean_token_accuracy": 0.12569426372647285, "num_tokens": 16444506.0, "step": 7595 }, { "entropy": 6.5838854789733885, "epoch": 0.8133126438011664, "grad_norm": 2.578125, "learning_rate": 0.0004943653414566809, "loss": 6.4841, "mean_token_accuracy": 0.12255563437938691, "num_tokens": 16455403.0, "step": 7600 }, { "entropy": 6.685585021972656, "epoch": 0.8138477179089304, "grad_norm": 1.7421875, "learning_rate": 0.0004943568354530927, "loss": 6.5825, "mean_token_accuracy": 0.11601466611027718, "num_tokens": 16465616.0, "step": 7605 }, { "entropy": 6.6593701362609865, "epoch": 0.8143827920166943, "grad_norm": 1.2890625, "learning_rate": 0.0004943483231156068, "loss": 6.5438, "mean_token_accuracy": 0.12109178379178047, "num_tokens": 16476850.0, "step": 7610 }, { "entropy": 6.668148422241211, "epoch": 0.8149178661244583, "grad_norm": 1.21875, "learning_rate": 0.0004943398044444687, "loss": 6.4975, "mean_token_accuracy": 0.1246594287455082, "num_tokens": 16489118.0, "step": 7615 }, { "entropy": 6.676653909683227, "epoch": 0.8154529402322221, "grad_norm": 1.3984375, "learning_rate": 0.0004943312794399246, "loss": 6.4363, "mean_token_accuracy": 0.12908004522323607, "num_tokens": 16499336.0, "step": 7620 }, { "entropy": 6.601690435409546, "epoch": 0.8159880143399861, "grad_norm": 1.875, "learning_rate": 0.0004943227481022207, "loss": 6.5219, "mean_token_accuracy": 0.11842733025550842, "num_tokens": 16510158.0, "step": 7625 }, { "entropy": 6.564496660232544, "epoch": 0.81652308844775, "grad_norm": 1.453125, "learning_rate": 0.0004943142104316033, "loss": 6.4621, "mean_token_accuracy": 0.12559000104665757, "num_tokens": 16521080.0, "step": 7630 }, { "entropy": 6.656149530410767, "epoch": 0.8170581625555139, "grad_norm": 1.296875, "learning_rate": 0.0004943056664283189, "loss": 6.4704, "mean_token_accuracy": 0.12910144105553628, "num_tokens": 16531072.0, "step": 7635 }, { "entropy": 6.6499816417694095, "epoch": 0.8175932366632779, "grad_norm": 1.359375, "learning_rate": 0.000494297116092614, "loss": 6.5586, "mean_token_accuracy": 0.11900619938969612, "num_tokens": 16542588.0, "step": 7640 }, { "entropy": 6.663675832748413, "epoch": 0.8181283107710418, "grad_norm": 1.609375, "learning_rate": 0.0004942885594247359, "loss": 6.4237, "mean_token_accuracy": 0.12086946368217469, "num_tokens": 16553466.0, "step": 7645 }, { "entropy": 6.618226099014282, "epoch": 0.8186633848788057, "grad_norm": 1.40625, "learning_rate": 0.0004942799964249314, "loss": 6.4553, "mean_token_accuracy": 0.1253214955329895, "num_tokens": 16564084.0, "step": 7650 }, { "entropy": 6.56568751335144, "epoch": 0.8191984589865696, "grad_norm": 1.3828125, "learning_rate": 0.0004942714270934479, "loss": 6.4666, "mean_token_accuracy": 0.13621146976947784, "num_tokens": 16575665.0, "step": 7655 }, { "entropy": 6.610156917572022, "epoch": 0.8197335330943336, "grad_norm": 1.2734375, "learning_rate": 0.0004942628514305326, "loss": 6.4752, "mean_token_accuracy": 0.12168620154261589, "num_tokens": 16586518.0, "step": 7660 }, { "entropy": 6.63839054107666, "epoch": 0.8202686072020975, "grad_norm": 1.2734375, "learning_rate": 0.0004942542694364333, "loss": 6.4753, "mean_token_accuracy": 0.12710672691464425, "num_tokens": 16597345.0, "step": 7665 }, { "entropy": 6.6390495777130125, "epoch": 0.8208036813098614, "grad_norm": 1.9609375, "learning_rate": 0.0004942456811113978, "loss": 6.4888, "mean_token_accuracy": 0.12848000451922417, "num_tokens": 16609586.0, "step": 7670 }, { "entropy": 6.635290050506592, "epoch": 0.8213387554176254, "grad_norm": 1.3125, "learning_rate": 0.0004942370864556741, "loss": 6.3679, "mean_token_accuracy": 0.13500959426164627, "num_tokens": 16620165.0, "step": 7675 }, { "entropy": 6.571346569061279, "epoch": 0.8218738295253892, "grad_norm": 1.640625, "learning_rate": 0.0004942284854695104, "loss": 6.4753, "mean_token_accuracy": 0.12547776997089385, "num_tokens": 16631200.0, "step": 7680 }, { "entropy": 6.609015321731567, "epoch": 0.8224089036331532, "grad_norm": 1.3125, "learning_rate": 0.0004942198781531549, "loss": 6.5048, "mean_token_accuracy": 0.1238760806620121, "num_tokens": 16642553.0, "step": 7685 }, { "entropy": 6.665633964538574, "epoch": 0.8229439777409171, "grad_norm": 1.2265625, "learning_rate": 0.0004942112645068561, "loss": 6.5156, "mean_token_accuracy": 0.12217526063323021, "num_tokens": 16653431.0, "step": 7690 }, { "entropy": 6.571784734725952, "epoch": 0.8234790518486811, "grad_norm": 1.2265625, "learning_rate": 0.000494202644530863, "loss": 6.4593, "mean_token_accuracy": 0.12343985810875893, "num_tokens": 16664880.0, "step": 7695 }, { "entropy": 6.5380603790283205, "epoch": 0.824014125956445, "grad_norm": 1.4921875, "learning_rate": 0.0004941940182254244, "loss": 6.4767, "mean_token_accuracy": 0.12872528284788132, "num_tokens": 16676224.0, "step": 7700 }, { "entropy": 6.582237911224365, "epoch": 0.8245492000642088, "grad_norm": 1.4296875, "learning_rate": 0.0004941853855907892, "loss": 6.5396, "mean_token_accuracy": 0.12095732614398003, "num_tokens": 16687732.0, "step": 7705 }, { "entropy": 6.682282161712647, "epoch": 0.8250842741719728, "grad_norm": 1.3671875, "learning_rate": 0.0004941767466272068, "loss": 6.4688, "mean_token_accuracy": 0.129934361577034, "num_tokens": 16698257.0, "step": 7710 }, { "entropy": 6.666169214248657, "epoch": 0.8256193482797367, "grad_norm": 1.1796875, "learning_rate": 0.0004941681013349267, "loss": 6.4383, "mean_token_accuracy": 0.12359966635704041, "num_tokens": 16708860.0, "step": 7715 }, { "entropy": 6.602855110168457, "epoch": 0.8261544223875007, "grad_norm": 1.34375, "learning_rate": 0.0004941594497141985, "loss": 6.438, "mean_token_accuracy": 0.12608251199126244, "num_tokens": 16719987.0, "step": 7720 }, { "entropy": 6.643445825576782, "epoch": 0.8266894964952646, "grad_norm": 1.4609375, "learning_rate": 0.0004941507917652718, "loss": 6.5341, "mean_token_accuracy": 0.11999792009592056, "num_tokens": 16730861.0, "step": 7725 }, { "entropy": 6.553995418548584, "epoch": 0.8272245706030286, "grad_norm": 1.5546875, "learning_rate": 0.0004941421274883969, "loss": 6.383, "mean_token_accuracy": 0.13347533941268921, "num_tokens": 16740968.0, "step": 7730 }, { "entropy": 6.578843641281128, "epoch": 0.8277596447107924, "grad_norm": 1.234375, "learning_rate": 0.000494133456883824, "loss": 6.4878, "mean_token_accuracy": 0.12768243104219437, "num_tokens": 16750700.0, "step": 7735 }, { "entropy": 6.617146635055542, "epoch": 0.8282947188185563, "grad_norm": 1.4609375, "learning_rate": 0.0004941247799518031, "loss": 6.476, "mean_token_accuracy": 0.12326866835355758, "num_tokens": 16760719.0, "step": 7740 }, { "entropy": 6.594090604782105, "epoch": 0.8288297929263203, "grad_norm": 1.234375, "learning_rate": 0.0004941160966925851, "loss": 6.3544, "mean_token_accuracy": 0.1272714115679264, "num_tokens": 16771331.0, "step": 7745 }, { "entropy": 6.494041490554809, "epoch": 0.8293648670340842, "grad_norm": 1.2734375, "learning_rate": 0.0004941074071064205, "loss": 6.4433, "mean_token_accuracy": 0.12712007239460946, "num_tokens": 16781306.0, "step": 7750 }, { "entropy": 6.638606166839599, "epoch": 0.8298999411418482, "grad_norm": 1.4921875, "learning_rate": 0.0004940987111935605, "loss": 6.4686, "mean_token_accuracy": 0.12214233577251435, "num_tokens": 16793013.0, "step": 7755 }, { "entropy": 6.612168407440185, "epoch": 0.830435015249612, "grad_norm": 1.2109375, "learning_rate": 0.0004940900089542558, "loss": 6.4737, "mean_token_accuracy": 0.12796134501695633, "num_tokens": 16803987.0, "step": 7760 }, { "entropy": 6.5910180568695065, "epoch": 0.830970089357376, "grad_norm": 1.2734375, "learning_rate": 0.000494081300388758, "loss": 6.4697, "mean_token_accuracy": 0.11712961420416831, "num_tokens": 16815031.0, "step": 7765 }, { "entropy": 6.678561735153198, "epoch": 0.8315051634651399, "grad_norm": 1.265625, "learning_rate": 0.0004940725854973184, "loss": 6.5281, "mean_token_accuracy": 0.12335440516471863, "num_tokens": 16826313.0, "step": 7770 }, { "entropy": 6.646420955657959, "epoch": 0.8320402375729038, "grad_norm": 1.2109375, "learning_rate": 0.0004940638642801886, "loss": 6.5086, "mean_token_accuracy": 0.12422936633229256, "num_tokens": 16838470.0, "step": 7775 }, { "entropy": 6.546121120452881, "epoch": 0.8325753116806678, "grad_norm": 1.5078125, "learning_rate": 0.0004940551367376205, "loss": 6.4028, "mean_token_accuracy": 0.12903384640812873, "num_tokens": 16849266.0, "step": 7780 }, { "entropy": 6.566736698150635, "epoch": 0.8331103857884317, "grad_norm": 1.28125, "learning_rate": 0.0004940464028698662, "loss": 6.5309, "mean_token_accuracy": 0.12425655499100685, "num_tokens": 16860720.0, "step": 7785 }, { "entropy": 6.63223614692688, "epoch": 0.8336454598961957, "grad_norm": 1.34375, "learning_rate": 0.0004940376626771779, "loss": 6.4921, "mean_token_accuracy": 0.12509471029043198, "num_tokens": 16872004.0, "step": 7790 }, { "entropy": 6.648682880401611, "epoch": 0.8341805340039595, "grad_norm": 1.9453125, "learning_rate": 0.0004940289161598076, "loss": 6.5292, "mean_token_accuracy": 0.1173703834414482, "num_tokens": 16882898.0, "step": 7795 }, { "entropy": 6.628533267974854, "epoch": 0.8347156081117235, "grad_norm": 1.515625, "learning_rate": 0.0004940201633180084, "loss": 6.4511, "mean_token_accuracy": 0.11566249057650566, "num_tokens": 16894331.0, "step": 7800 }, { "entropy": 6.6906242847442625, "epoch": 0.8352506822194874, "grad_norm": 1.1953125, "learning_rate": 0.0004940114041520326, "loss": 6.5387, "mean_token_accuracy": 0.1246345192193985, "num_tokens": 16903656.0, "step": 7805 }, { "entropy": 6.581471395492554, "epoch": 0.8357857563272513, "grad_norm": 1.1953125, "learning_rate": 0.0004940026386621333, "loss": 6.5019, "mean_token_accuracy": 0.12531133443117143, "num_tokens": 16915878.0, "step": 7810 }, { "entropy": 6.6755578994750975, "epoch": 0.8363208304350153, "grad_norm": 1.4453125, "learning_rate": 0.0004939938668485636, "loss": 6.5432, "mean_token_accuracy": 0.1215199887752533, "num_tokens": 16926577.0, "step": 7815 }, { "entropy": 6.565039253234863, "epoch": 0.8368559045427791, "grad_norm": 1.3359375, "learning_rate": 0.0004939850887115768, "loss": 6.4234, "mean_token_accuracy": 0.1319645993411541, "num_tokens": 16938012.0, "step": 7820 }, { "entropy": 6.569745969772339, "epoch": 0.8373909786505431, "grad_norm": 1.3828125, "learning_rate": 0.0004939763042514263, "loss": 6.4132, "mean_token_accuracy": 0.12320912629365921, "num_tokens": 16949007.0, "step": 7825 }, { "entropy": 6.491839742660522, "epoch": 0.837926052758307, "grad_norm": 1.2578125, "learning_rate": 0.0004939675134683658, "loss": 6.3726, "mean_token_accuracy": 0.13265551403164863, "num_tokens": 16959425.0, "step": 7830 }, { "entropy": 6.643397045135498, "epoch": 0.838461126866071, "grad_norm": 1.4765625, "learning_rate": 0.0004939587163626491, "loss": 6.4972, "mean_token_accuracy": 0.11856562122702599, "num_tokens": 16970002.0, "step": 7835 }, { "entropy": 6.622504758834839, "epoch": 0.8389962009738349, "grad_norm": 1.8359375, "learning_rate": 0.0004939499129345302, "loss": 6.5261, "mean_token_accuracy": 0.12169675678014755, "num_tokens": 16980739.0, "step": 7840 }, { "entropy": 6.638087224960327, "epoch": 0.8395312750815987, "grad_norm": 1.78125, "learning_rate": 0.0004939411031842633, "loss": 6.4766, "mean_token_accuracy": 0.1255985088646412, "num_tokens": 16991643.0, "step": 7845 }, { "entropy": 6.454816770553589, "epoch": 0.8400663491893627, "grad_norm": 1.5390625, "learning_rate": 0.000493932287112103, "loss": 6.3395, "mean_token_accuracy": 0.1409579671919346, "num_tokens": 17001975.0, "step": 7850 }, { "entropy": 6.637519359588623, "epoch": 0.8406014232971266, "grad_norm": 1.34375, "learning_rate": 0.0004939234647183035, "loss": 6.4786, "mean_token_accuracy": 0.12199027836322784, "num_tokens": 17012658.0, "step": 7855 }, { "entropy": 6.653904962539673, "epoch": 0.8411364974048906, "grad_norm": 1.3359375, "learning_rate": 0.0004939146360031197, "loss": 6.4875, "mean_token_accuracy": 0.12131756246089935, "num_tokens": 17023196.0, "step": 7860 }, { "entropy": 6.606409931182862, "epoch": 0.8416715715126545, "grad_norm": 1.4140625, "learning_rate": 0.0004939058009668067, "loss": 6.5086, "mean_token_accuracy": 0.12194685339927673, "num_tokens": 17034589.0, "step": 7865 }, { "entropy": 6.642972040176391, "epoch": 0.8422066456204185, "grad_norm": 2.25, "learning_rate": 0.0004938969596096194, "loss": 6.4733, "mean_token_accuracy": 0.12159970998764039, "num_tokens": 17046139.0, "step": 7870 }, { "entropy": 6.589673328399658, "epoch": 0.8427417197281823, "grad_norm": 1.375, "learning_rate": 0.000493888111931813, "loss": 6.4945, "mean_token_accuracy": 0.12014141380786895, "num_tokens": 17056926.0, "step": 7875 }, { "entropy": 6.539459180831909, "epoch": 0.8432767938359462, "grad_norm": 3.125, "learning_rate": 0.0004938792579336433, "loss": 6.4375, "mean_token_accuracy": 0.12531604021787643, "num_tokens": 17067339.0, "step": 7880 }, { "entropy": 6.603718090057373, "epoch": 0.8438118679437102, "grad_norm": 2.140625, "learning_rate": 0.0004938703976153657, "loss": 6.4518, "mean_token_accuracy": 0.1254698507487774, "num_tokens": 17078037.0, "step": 7885 }, { "entropy": 6.632722282409668, "epoch": 0.8443469420514741, "grad_norm": 1.2890625, "learning_rate": 0.0004938615309772362, "loss": 6.4862, "mean_token_accuracy": 0.11615241914987565, "num_tokens": 17089069.0, "step": 7890 }, { "entropy": 6.616069984436035, "epoch": 0.8448820161592381, "grad_norm": 1.2578125, "learning_rate": 0.0004938526580195107, "loss": 6.4657, "mean_token_accuracy": 0.12840015292167664, "num_tokens": 17100006.0, "step": 7895 }, { "entropy": 6.608232641220093, "epoch": 0.845417090267002, "grad_norm": 1.34375, "learning_rate": 0.0004938437787424454, "loss": 6.501, "mean_token_accuracy": 0.12470883950591087, "num_tokens": 17111896.0, "step": 7900 }, { "entropy": 6.601596450805664, "epoch": 0.845952164374766, "grad_norm": 1.9609375, "learning_rate": 0.0004938348931462969, "loss": 6.5061, "mean_token_accuracy": 0.1278610810637474, "num_tokens": 17123202.0, "step": 7905 }, { "entropy": 6.600058317184448, "epoch": 0.8464872384825298, "grad_norm": 1.4375, "learning_rate": 0.0004938260012313215, "loss": 6.4451, "mean_token_accuracy": 0.12930461540818214, "num_tokens": 17134013.0, "step": 7910 }, { "entropy": 6.536851596832276, "epoch": 0.8470223125902937, "grad_norm": 1.890625, "learning_rate": 0.0004938171029977761, "loss": 6.4564, "mean_token_accuracy": 0.12916264310479164, "num_tokens": 17144041.0, "step": 7915 }, { "entropy": 6.553992843627929, "epoch": 0.8475573866980577, "grad_norm": 1.4375, "learning_rate": 0.0004938081984459176, "loss": 6.4397, "mean_token_accuracy": 0.12721440196037292, "num_tokens": 17155334.0, "step": 7920 }, { "entropy": 6.6116251945495605, "epoch": 0.8480924608058216, "grad_norm": 1.6171875, "learning_rate": 0.000493799287576003, "loss": 6.3996, "mean_token_accuracy": 0.12881384789943695, "num_tokens": 17166243.0, "step": 7925 }, { "entropy": 6.599978303909301, "epoch": 0.8486275349135856, "grad_norm": 1.421875, "learning_rate": 0.0004937903703882898, "loss": 6.4664, "mean_token_accuracy": 0.12380218654870986, "num_tokens": 17177709.0, "step": 7930 }, { "entropy": 6.550316333770752, "epoch": 0.8491626090213494, "grad_norm": 1.28125, "learning_rate": 0.0004937814468830353, "loss": 6.4306, "mean_token_accuracy": 0.12615659311413766, "num_tokens": 17188275.0, "step": 7935 }, { "entropy": 6.639209222793579, "epoch": 0.8496976831291134, "grad_norm": 1.2890625, "learning_rate": 0.0004937725170604975, "loss": 6.5549, "mean_token_accuracy": 0.12421398386359214, "num_tokens": 17199527.0, "step": 7940 }, { "entropy": 6.658242416381836, "epoch": 0.8502327572368773, "grad_norm": 1.4453125, "learning_rate": 0.0004937635809209339, "loss": 6.4738, "mean_token_accuracy": 0.12579896971583365, "num_tokens": 17209500.0, "step": 7945 }, { "entropy": 6.567161989212036, "epoch": 0.8507678313446412, "grad_norm": 1.828125, "learning_rate": 0.0004937546384646027, "loss": 6.4189, "mean_token_accuracy": 0.1228828877210617, "num_tokens": 17219589.0, "step": 7950 }, { "entropy": 6.668274545669556, "epoch": 0.8513029054524052, "grad_norm": 1.8125, "learning_rate": 0.0004937456896917619, "loss": 6.4642, "mean_token_accuracy": 0.1268440864980221, "num_tokens": 17230508.0, "step": 7955 }, { "entropy": 6.628099966049194, "epoch": 0.851837979560169, "grad_norm": 1.328125, "learning_rate": 0.0004937367346026702, "loss": 6.4648, "mean_token_accuracy": 0.12629646956920623, "num_tokens": 17240886.0, "step": 7960 }, { "entropy": 6.5766232967376705, "epoch": 0.852373053667933, "grad_norm": 1.5078125, "learning_rate": 0.0004937277731975858, "loss": 6.4924, "mean_token_accuracy": 0.12928350567817687, "num_tokens": 17252247.0, "step": 7965 }, { "entropy": 6.573000049591064, "epoch": 0.8529081277756969, "grad_norm": 1.71875, "learning_rate": 0.0004937188054767679, "loss": 6.4584, "mean_token_accuracy": 0.12772766575217248, "num_tokens": 17262845.0, "step": 7970 }, { "entropy": 6.6421280860900875, "epoch": 0.8534432018834609, "grad_norm": 1.578125, "learning_rate": 0.0004937098314404751, "loss": 6.4562, "mean_token_accuracy": 0.12444490268826484, "num_tokens": 17274247.0, "step": 7975 }, { "entropy": 6.644790935516357, "epoch": 0.8539782759912248, "grad_norm": 1.40625, "learning_rate": 0.0004937008510889668, "loss": 6.4871, "mean_token_accuracy": 0.12767765745520593, "num_tokens": 17285471.0, "step": 7980 }, { "entropy": 6.589143466949463, "epoch": 0.8545133500989887, "grad_norm": 1.4453125, "learning_rate": 0.0004936918644225021, "loss": 6.5025, "mean_token_accuracy": 0.12948852255940438, "num_tokens": 17296243.0, "step": 7985 }, { "entropy": 6.579883146286011, "epoch": 0.8550484242067526, "grad_norm": 1.3828125, "learning_rate": 0.0004936828714413405, "loss": 6.4633, "mean_token_accuracy": 0.12740985825657844, "num_tokens": 17307301.0, "step": 7990 }, { "entropy": 6.545937824249267, "epoch": 0.8555834983145165, "grad_norm": 1.5078125, "learning_rate": 0.0004936738721457417, "loss": 6.3969, "mean_token_accuracy": 0.13528102710843087, "num_tokens": 17318550.0, "step": 7995 }, { "entropy": 6.5888251781463625, "epoch": 0.8561185724222805, "grad_norm": 1.4609375, "learning_rate": 0.0004936648665359657, "loss": 6.4592, "mean_token_accuracy": 0.12461457923054695, "num_tokens": 17328577.0, "step": 8000 }, { "entropy": 6.586920166015625, "epoch": 0.8566536465300444, "grad_norm": 1.3984375, "learning_rate": 0.0004936558546122723, "loss": 6.5184, "mean_token_accuracy": 0.12257596775889397, "num_tokens": 17341013.0, "step": 8005 }, { "entropy": 6.589303112030029, "epoch": 0.8571887206378084, "grad_norm": 1.453125, "learning_rate": 0.0004936468363749217, "loss": 6.4655, "mean_token_accuracy": 0.12056496143341064, "num_tokens": 17351956.0, "step": 8010 }, { "entropy": 6.6829746723175045, "epoch": 0.8577237947455723, "grad_norm": 1.3515625, "learning_rate": 0.0004936378118241746, "loss": 6.4386, "mean_token_accuracy": 0.117622260004282, "num_tokens": 17363465.0, "step": 8015 }, { "entropy": 6.584981489181518, "epoch": 0.8582588688533361, "grad_norm": 1.28125, "learning_rate": 0.0004936287809602913, "loss": 6.4964, "mean_token_accuracy": 0.1258731223642826, "num_tokens": 17374458.0, "step": 8020 }, { "entropy": 6.558772945404053, "epoch": 0.8587939429611001, "grad_norm": 1.546875, "learning_rate": 0.0004936197437835329, "loss": 6.4979, "mean_token_accuracy": 0.12399565950036048, "num_tokens": 17385492.0, "step": 8025 }, { "entropy": 6.684000682830811, "epoch": 0.859329017068864, "grad_norm": 1.28125, "learning_rate": 0.0004936107002941599, "loss": 6.446, "mean_token_accuracy": 0.1296046145260334, "num_tokens": 17395640.0, "step": 8030 }, { "entropy": 6.621039772033692, "epoch": 0.859864091176628, "grad_norm": 1.296875, "learning_rate": 0.0004936016504924337, "loss": 6.4657, "mean_token_accuracy": 0.12447260543704033, "num_tokens": 17405211.0, "step": 8035 }, { "entropy": 6.572212600708008, "epoch": 0.8603991652843919, "grad_norm": 1.578125, "learning_rate": 0.0004935925943786155, "loss": 6.4385, "mean_token_accuracy": 0.12494494318962097, "num_tokens": 17415421.0, "step": 8040 }, { "entropy": 6.5851781368255615, "epoch": 0.8609342393921559, "grad_norm": 1.3203125, "learning_rate": 0.0004935835319529669, "loss": 6.4882, "mean_token_accuracy": 0.12248977199196816, "num_tokens": 17426040.0, "step": 8045 }, { "entropy": 6.55501275062561, "epoch": 0.8614693134999197, "grad_norm": 1.34375, "learning_rate": 0.0004935744632157496, "loss": 6.4693, "mean_token_accuracy": 0.12371492311358452, "num_tokens": 17436305.0, "step": 8050 }, { "entropy": 6.602463960647583, "epoch": 0.8620043876076836, "grad_norm": 1.3515625, "learning_rate": 0.0004935653881672253, "loss": 6.5244, "mean_token_accuracy": 0.12265571355819702, "num_tokens": 17446786.0, "step": 8055 }, { "entropy": 6.612880706787109, "epoch": 0.8625394617154476, "grad_norm": 1.578125, "learning_rate": 0.0004935563068076561, "loss": 6.422, "mean_token_accuracy": 0.1300605744123459, "num_tokens": 17456613.0, "step": 8060 }, { "entropy": 6.542842960357666, "epoch": 0.8630745358232115, "grad_norm": 1.46875, "learning_rate": 0.0004935472191373044, "loss": 6.3675, "mean_token_accuracy": 0.12812848910689353, "num_tokens": 17467281.0, "step": 8065 }, { "entropy": 6.56179370880127, "epoch": 0.8636096099309755, "grad_norm": 1.40625, "learning_rate": 0.0004935381251564324, "loss": 6.4896, "mean_token_accuracy": 0.12458937540650368, "num_tokens": 17478271.0, "step": 8070 }, { "entropy": 6.59501895904541, "epoch": 0.8641446840387393, "grad_norm": 1.8671875, "learning_rate": 0.0004935290248653027, "loss": 6.4665, "mean_token_accuracy": 0.12613890841603279, "num_tokens": 17489519.0, "step": 8075 }, { "entropy": 6.614124202728272, "epoch": 0.8646797581465033, "grad_norm": 1.25, "learning_rate": 0.0004935199182641781, "loss": 6.4417, "mean_token_accuracy": 0.12557547613978387, "num_tokens": 17500076.0, "step": 8080 }, { "entropy": 6.614273643493652, "epoch": 0.8652148322542672, "grad_norm": 1.53125, "learning_rate": 0.0004935108053533216, "loss": 6.4453, "mean_token_accuracy": 0.12125986739993096, "num_tokens": 17509898.0, "step": 8085 }, { "entropy": 6.550960397720337, "epoch": 0.8657499063620312, "grad_norm": 1.609375, "learning_rate": 0.0004935016861329964, "loss": 6.406, "mean_token_accuracy": 0.1296715520322323, "num_tokens": 17519890.0, "step": 8090 }, { "entropy": 6.530986309051514, "epoch": 0.8662849804697951, "grad_norm": 1.2734375, "learning_rate": 0.0004934925606034656, "loss": 6.4381, "mean_token_accuracy": 0.12463523522019386, "num_tokens": 17530927.0, "step": 8095 }, { "entropy": 6.6647419929504395, "epoch": 0.866820054577559, "grad_norm": 1.484375, "learning_rate": 0.0004934834287649928, "loss": 6.5129, "mean_token_accuracy": 0.12179197296500206, "num_tokens": 17541174.0, "step": 8100 }, { "entropy": 6.6586121082305905, "epoch": 0.8673551286853229, "grad_norm": 2.21875, "learning_rate": 0.0004934742906178417, "loss": 6.4765, "mean_token_accuracy": 0.11956845298409462, "num_tokens": 17552460.0, "step": 8105 }, { "entropy": 6.6295825958251955, "epoch": 0.8678902027930868, "grad_norm": 1.5, "learning_rate": 0.0004934651461622762, "loss": 6.483, "mean_token_accuracy": 0.12741912975907327, "num_tokens": 17563908.0, "step": 8110 }, { "entropy": 6.586279296875, "epoch": 0.8684252769008508, "grad_norm": 1.1953125, "learning_rate": 0.0004934559953985603, "loss": 6.4953, "mean_token_accuracy": 0.1282585471868515, "num_tokens": 17574314.0, "step": 8115 }, { "entropy": 6.640317058563232, "epoch": 0.8689603510086147, "grad_norm": 1.3671875, "learning_rate": 0.0004934468383269582, "loss": 6.4568, "mean_token_accuracy": 0.12750404104590415, "num_tokens": 17583719.0, "step": 8120 }, { "entropy": 6.520741510391235, "epoch": 0.8694954251163787, "grad_norm": 1.5390625, "learning_rate": 0.0004934376749477344, "loss": 6.4474, "mean_token_accuracy": 0.1261451207101345, "num_tokens": 17594522.0, "step": 8125 }, { "entropy": 6.550720930099487, "epoch": 0.8700304992241426, "grad_norm": 1.5703125, "learning_rate": 0.0004934285052611533, "loss": 6.384, "mean_token_accuracy": 0.13392736613750458, "num_tokens": 17604632.0, "step": 8130 }, { "entropy": 6.7096068382263185, "epoch": 0.8705655733319064, "grad_norm": 2.53125, "learning_rate": 0.00049341932926748, "loss": 6.5216, "mean_token_accuracy": 0.12129078730940819, "num_tokens": 17615459.0, "step": 8135 }, { "entropy": 6.650518894195557, "epoch": 0.8711006474396704, "grad_norm": 1.359375, "learning_rate": 0.0004934101469669791, "loss": 6.4636, "mean_token_accuracy": 0.1257311299443245, "num_tokens": 17625800.0, "step": 8140 }, { "entropy": 6.517386484146118, "epoch": 0.8716357215474343, "grad_norm": 1.4296875, "learning_rate": 0.0004934009583599159, "loss": 6.3112, "mean_token_accuracy": 0.13819433227181435, "num_tokens": 17637264.0, "step": 8145 }, { "entropy": 6.515216493606568, "epoch": 0.8721707956551983, "grad_norm": 1.421875, "learning_rate": 0.0004933917634465558, "loss": 6.3499, "mean_token_accuracy": 0.12682703286409377, "num_tokens": 17648256.0, "step": 8150 }, { "entropy": 6.564549684524536, "epoch": 0.8727058697629622, "grad_norm": 1.625, "learning_rate": 0.0004933825622271642, "loss": 6.4983, "mean_token_accuracy": 0.12459777966141701, "num_tokens": 17659096.0, "step": 8155 }, { "entropy": 6.629525566101075, "epoch": 0.8732409438707261, "grad_norm": 1.2578125, "learning_rate": 0.0004933733547020069, "loss": 6.4714, "mean_token_accuracy": 0.12370945960283279, "num_tokens": 17669808.0, "step": 8160 }, { "entropy": 6.615776252746582, "epoch": 0.87377601797849, "grad_norm": 1.4609375, "learning_rate": 0.0004933641408713495, "loss": 6.4171, "mean_token_accuracy": 0.12331488877534866, "num_tokens": 17680375.0, "step": 8165 }, { "entropy": 6.513298511505127, "epoch": 0.8743110920862539, "grad_norm": 1.4921875, "learning_rate": 0.0004933549207354582, "loss": 6.3829, "mean_token_accuracy": 0.13013615384697913, "num_tokens": 17690780.0, "step": 8170 }, { "entropy": 6.601052331924438, "epoch": 0.8748461661940179, "grad_norm": 2.125, "learning_rate": 0.0004933456942945994, "loss": 6.483, "mean_token_accuracy": 0.12874177172780038, "num_tokens": 17702170.0, "step": 8175 }, { "entropy": 6.5550049304962155, "epoch": 0.8753812403017818, "grad_norm": 1.9609375, "learning_rate": 0.0004933364615490393, "loss": 6.4206, "mean_token_accuracy": 0.12599021792411805, "num_tokens": 17712631.0, "step": 8180 }, { "entropy": 6.611193418502808, "epoch": 0.8759163144095458, "grad_norm": 1.4375, "learning_rate": 0.0004933272224990445, "loss": 6.5003, "mean_token_accuracy": 0.12176733165979385, "num_tokens": 17723692.0, "step": 8185 }, { "entropy": 6.6318916320800785, "epoch": 0.8764513885173096, "grad_norm": 1.5234375, "learning_rate": 0.0004933179771448819, "loss": 6.4129, "mean_token_accuracy": 0.13463898748159409, "num_tokens": 17735264.0, "step": 8190 }, { "entropy": 6.5342247009277346, "epoch": 0.8769864626250736, "grad_norm": 1.3984375, "learning_rate": 0.0004933087254868183, "loss": 6.3354, "mean_token_accuracy": 0.1375872351229191, "num_tokens": 17747060.0, "step": 8195 }, { "entropy": 6.510075902938842, "epoch": 0.8775215367328375, "grad_norm": 1.6484375, "learning_rate": 0.000493299467525121, "loss": 6.4422, "mean_token_accuracy": 0.12407493069767953, "num_tokens": 17758159.0, "step": 8200 }, { "entropy": 6.57683801651001, "epoch": 0.8780566108406014, "grad_norm": 1.265625, "learning_rate": 0.0004932902032600573, "loss": 6.4594, "mean_token_accuracy": 0.12217129170894622, "num_tokens": 17768444.0, "step": 8205 }, { "entropy": 6.646522092819214, "epoch": 0.8785916849483654, "grad_norm": 1.4296875, "learning_rate": 0.0004932809326918945, "loss": 6.3517, "mean_token_accuracy": 0.1339459776878357, "num_tokens": 17779303.0, "step": 8210 }, { "entropy": 6.622037935256958, "epoch": 0.8791267590561292, "grad_norm": 1.265625, "learning_rate": 0.0004932716558209005, "loss": 6.5405, "mean_token_accuracy": 0.11944242864847184, "num_tokens": 17789853.0, "step": 8215 }, { "entropy": 6.602828121185302, "epoch": 0.8796618331638932, "grad_norm": 1.6953125, "learning_rate": 0.0004932623726473432, "loss": 6.3894, "mean_token_accuracy": 0.1371438518166542, "num_tokens": 17799232.0, "step": 8220 }, { "entropy": 6.487914800643921, "epoch": 0.8801969072716571, "grad_norm": 1.640625, "learning_rate": 0.0004932530831714904, "loss": 6.4097, "mean_token_accuracy": 0.12824408933520318, "num_tokens": 17808870.0, "step": 8225 }, { "entropy": 6.5319726943969725, "epoch": 0.8807319813794211, "grad_norm": 1.3046875, "learning_rate": 0.0004932437873936107, "loss": 6.4906, "mean_token_accuracy": 0.11963605657219886, "num_tokens": 17819394.0, "step": 8230 }, { "entropy": 6.662888050079346, "epoch": 0.881267055487185, "grad_norm": 1.484375, "learning_rate": 0.0004932344853139721, "loss": 6.4679, "mean_token_accuracy": 0.12477930113673211, "num_tokens": 17830220.0, "step": 8235 }, { "entropy": 6.598001623153687, "epoch": 0.8818021295949489, "grad_norm": 1.5234375, "learning_rate": 0.0004932251769328436, "loss": 6.4034, "mean_token_accuracy": 0.1247767224907875, "num_tokens": 17841971.0, "step": 8240 }, { "entropy": 6.5990701675415036, "epoch": 0.8823372037027128, "grad_norm": 1.359375, "learning_rate": 0.0004932158622504937, "loss": 6.4173, "mean_token_accuracy": 0.12920651137828826, "num_tokens": 17851890.0, "step": 8245 }, { "entropy": 6.519874525070191, "epoch": 0.8828722778104767, "grad_norm": 1.421875, "learning_rate": 0.0004932065412671915, "loss": 6.4123, "mean_token_accuracy": 0.13252334222197532, "num_tokens": 17862855.0, "step": 8250 }, { "entropy": 6.629786729812622, "epoch": 0.8834073519182407, "grad_norm": 1.4921875, "learning_rate": 0.0004931972139832058, "loss": 6.4243, "mean_token_accuracy": 0.12248511165380478, "num_tokens": 17873550.0, "step": 8255 }, { "entropy": 6.638599252700805, "epoch": 0.8839424260260046, "grad_norm": 2.46875, "learning_rate": 0.0004931878803988066, "loss": 6.4432, "mean_token_accuracy": 0.13054898232221604, "num_tokens": 17884067.0, "step": 8260 }, { "entropy": 6.601341295242309, "epoch": 0.8844775001337686, "grad_norm": 1.5234375, "learning_rate": 0.0004931785405142627, "loss": 6.4715, "mean_token_accuracy": 0.12773810103535652, "num_tokens": 17894587.0, "step": 8265 }, { "entropy": 6.557901048660279, "epoch": 0.8850125742415325, "grad_norm": 1.375, "learning_rate": 0.0004931691943298443, "loss": 6.4536, "mean_token_accuracy": 0.12345588281750679, "num_tokens": 17905297.0, "step": 8270 }, { "entropy": 6.472777080535889, "epoch": 0.8855476483492963, "grad_norm": 1.3046875, "learning_rate": 0.000493159841845821, "loss": 6.3637, "mean_token_accuracy": 0.12871376648545266, "num_tokens": 17916225.0, "step": 8275 }, { "entropy": 6.641252183914185, "epoch": 0.8860827224570603, "grad_norm": 2.890625, "learning_rate": 0.0004931504830624629, "loss": 6.4114, "mean_token_accuracy": 0.12872292771935462, "num_tokens": 17925795.0, "step": 8280 }, { "entropy": 6.560930967330933, "epoch": 0.8866177965648242, "grad_norm": 1.2734375, "learning_rate": 0.0004931411179800403, "loss": 6.4212, "mean_token_accuracy": 0.12332068607211114, "num_tokens": 17936134.0, "step": 8285 }, { "entropy": 6.576021671295166, "epoch": 0.8871528706725882, "grad_norm": 1.7734375, "learning_rate": 0.0004931317465988235, "loss": 6.4877, "mean_token_accuracy": 0.12288779988884926, "num_tokens": 17946393.0, "step": 8290 }, { "entropy": 6.620288515090943, "epoch": 0.8876879447803521, "grad_norm": 1.5546875, "learning_rate": 0.0004931223689190832, "loss": 6.4979, "mean_token_accuracy": 0.12131898999214172, "num_tokens": 17957527.0, "step": 8295 }, { "entropy": 6.60401668548584, "epoch": 0.8882230188881161, "grad_norm": 1.390625, "learning_rate": 0.0004931129849410903, "loss": 6.5001, "mean_token_accuracy": 0.12653226852416993, "num_tokens": 17968390.0, "step": 8300 }, { "entropy": 6.624185705184937, "epoch": 0.8887580929958799, "grad_norm": 1.484375, "learning_rate": 0.0004931035946651154, "loss": 6.424, "mean_token_accuracy": 0.13672848865389825, "num_tokens": 17978667.0, "step": 8305 }, { "entropy": 6.649472332000732, "epoch": 0.8892931671036438, "grad_norm": 1.734375, "learning_rate": 0.0004930941980914299, "loss": 6.484, "mean_token_accuracy": 0.12073868960142135, "num_tokens": 17989008.0, "step": 8310 }, { "entropy": 6.55554428100586, "epoch": 0.8898282412114078, "grad_norm": 1.6796875, "learning_rate": 0.0004930847952203052, "loss": 6.4167, "mean_token_accuracy": 0.11992595419287681, "num_tokens": 18000199.0, "step": 8315 }, { "entropy": 6.6081115245819095, "epoch": 0.8903633153191717, "grad_norm": 2.21875, "learning_rate": 0.0004930753860520126, "loss": 6.3714, "mean_token_accuracy": 0.12737504318356513, "num_tokens": 18010941.0, "step": 8320 }, { "entropy": 6.636107873916626, "epoch": 0.8908983894269357, "grad_norm": 1.3828125, "learning_rate": 0.0004930659705868237, "loss": 6.4755, "mean_token_accuracy": 0.12668566182255744, "num_tokens": 18021519.0, "step": 8325 }, { "entropy": 6.576786231994629, "epoch": 0.8914334635346995, "grad_norm": 2.296875, "learning_rate": 0.0004930565488250108, "loss": 6.4282, "mean_token_accuracy": 0.12401631250977516, "num_tokens": 18032773.0, "step": 8330 }, { "entropy": 6.560948514938355, "epoch": 0.8919685376424635, "grad_norm": 1.625, "learning_rate": 0.0004930471207668456, "loss": 6.3931, "mean_token_accuracy": 0.1288905918598175, "num_tokens": 18043250.0, "step": 8335 }, { "entropy": 6.577342367172241, "epoch": 0.8925036117502274, "grad_norm": 1.4453125, "learning_rate": 0.0004930376864126005, "loss": 6.4045, "mean_token_accuracy": 0.13135718554258347, "num_tokens": 18055165.0, "step": 8340 }, { "entropy": 6.533294534683227, "epoch": 0.8930386858579913, "grad_norm": 1.375, "learning_rate": 0.0004930282457625476, "loss": 6.3655, "mean_token_accuracy": 0.1319275178015232, "num_tokens": 18065296.0, "step": 8345 }, { "entropy": 6.483318853378296, "epoch": 0.8935737599657553, "grad_norm": 1.734375, "learning_rate": 0.00049301879881696, "loss": 6.3713, "mean_token_accuracy": 0.12717922553420066, "num_tokens": 18075536.0, "step": 8350 }, { "entropy": 6.523620080947876, "epoch": 0.8941088340735192, "grad_norm": 1.4296875, "learning_rate": 0.0004930093455761101, "loss": 6.4792, "mean_token_accuracy": 0.1299550086259842, "num_tokens": 18086253.0, "step": 8355 }, { "entropy": 6.625021934509277, "epoch": 0.8946439081812831, "grad_norm": 2.15625, "learning_rate": 0.000492999886040271, "loss": 6.4867, "mean_token_accuracy": 0.12763941064476966, "num_tokens": 18097335.0, "step": 8360 }, { "entropy": 6.678513479232788, "epoch": 0.895178982289047, "grad_norm": 1.53125, "learning_rate": 0.0004929904202097159, "loss": 6.4165, "mean_token_accuracy": 0.1255946137011051, "num_tokens": 18107293.0, "step": 8365 }, { "entropy": 6.574617719650268, "epoch": 0.895714056396811, "grad_norm": 2.0, "learning_rate": 0.0004929809480847179, "loss": 6.529, "mean_token_accuracy": 0.11832507178187371, "num_tokens": 18117705.0, "step": 8370 }, { "entropy": 6.6313234806060795, "epoch": 0.8962491305045749, "grad_norm": 2.015625, "learning_rate": 0.0004929714696655507, "loss": 6.4331, "mean_token_accuracy": 0.12140770703554153, "num_tokens": 18129003.0, "step": 8375 }, { "entropy": 6.6004438400268555, "epoch": 0.8967842046123388, "grad_norm": 1.6796875, "learning_rate": 0.000492961984952488, "loss": 6.3848, "mean_token_accuracy": 0.1367577515542507, "num_tokens": 18140843.0, "step": 8380 }, { "entropy": 6.557983160018921, "epoch": 0.8973192787201028, "grad_norm": 1.375, "learning_rate": 0.0004929524939458037, "loss": 6.4735, "mean_token_accuracy": 0.12216648012399674, "num_tokens": 18151476.0, "step": 8385 }, { "entropy": 6.597401762008667, "epoch": 0.8978543528278666, "grad_norm": 1.75, "learning_rate": 0.0004929429966457716, "loss": 6.4974, "mean_token_accuracy": 0.11995471492409707, "num_tokens": 18161304.0, "step": 8390 }, { "entropy": 6.655696821212769, "epoch": 0.8983894269356306, "grad_norm": 1.3671875, "learning_rate": 0.0004929334930526662, "loss": 6.4287, "mean_token_accuracy": 0.13061922267079354, "num_tokens": 18173696.0, "step": 8395 }, { "entropy": 6.572501087188721, "epoch": 0.8989245010433945, "grad_norm": 1.9609375, "learning_rate": 0.0004929239831667617, "loss": 6.4387, "mean_token_accuracy": 0.12057856544852256, "num_tokens": 18186024.0, "step": 8400 }, { "entropy": 6.567807579040528, "epoch": 0.8994595751511585, "grad_norm": 1.328125, "learning_rate": 0.0004929144669883329, "loss": 6.4628, "mean_token_accuracy": 0.13044245541095734, "num_tokens": 18196976.0, "step": 8405 }, { "entropy": 6.587893533706665, "epoch": 0.8999946492589224, "grad_norm": 1.8984375, "learning_rate": 0.0004929049445176545, "loss": 6.4553, "mean_token_accuracy": 0.12222403511404992, "num_tokens": 18208086.0, "step": 8410 }, { "entropy": 6.598808670043946, "epoch": 0.9005297233666862, "grad_norm": 1.4609375, "learning_rate": 0.0004928954157550013, "loss": 6.4026, "mean_token_accuracy": 0.1364985041320324, "num_tokens": 18218468.0, "step": 8415 }, { "entropy": 6.641229772567749, "epoch": 0.9010647974744502, "grad_norm": 1.640625, "learning_rate": 0.0004928858807006488, "loss": 6.511, "mean_token_accuracy": 0.12634748592972755, "num_tokens": 18230489.0, "step": 8420 }, { "entropy": 6.616871500015259, "epoch": 0.9015998715822141, "grad_norm": 1.5625, "learning_rate": 0.0004928763393548721, "loss": 6.4344, "mean_token_accuracy": 0.12947860807180406, "num_tokens": 18239968.0, "step": 8425 }, { "entropy": 6.5853495597839355, "epoch": 0.9021349456899781, "grad_norm": 1.7734375, "learning_rate": 0.0004928667917179465, "loss": 6.4898, "mean_token_accuracy": 0.12196068912744522, "num_tokens": 18250902.0, "step": 8430 }, { "entropy": 6.663750267028808, "epoch": 0.902670019797742, "grad_norm": 1.453125, "learning_rate": 0.0004928572377901481, "loss": 6.4837, "mean_token_accuracy": 0.12794666811823846, "num_tokens": 18262094.0, "step": 8435 }, { "entropy": 6.584063005447388, "epoch": 0.903205093905506, "grad_norm": 1.4296875, "learning_rate": 0.0004928476775717524, "loss": 6.4512, "mean_token_accuracy": 0.12302127629518508, "num_tokens": 18272765.0, "step": 8440 }, { "entropy": 6.568285655975342, "epoch": 0.9037401680132698, "grad_norm": 1.6796875, "learning_rate": 0.0004928381110630358, "loss": 6.3773, "mean_token_accuracy": 0.13741017803549765, "num_tokens": 18284570.0, "step": 8445 }, { "entropy": 6.740869760513306, "epoch": 0.9042752421210337, "grad_norm": 1.65625, "learning_rate": 0.0004928285382642742, "loss": 6.4835, "mean_token_accuracy": 0.1234114944934845, "num_tokens": 18295170.0, "step": 8450 }, { "entropy": 6.594295454025269, "epoch": 0.9048103162287977, "grad_norm": 1.4140625, "learning_rate": 0.0004928189591757443, "loss": 6.4201, "mean_token_accuracy": 0.122423455119133, "num_tokens": 18306388.0, "step": 8455 }, { "entropy": 6.5661896705627445, "epoch": 0.9053453903365616, "grad_norm": 1.359375, "learning_rate": 0.0004928093737977225, "loss": 6.429, "mean_token_accuracy": 0.13050043657422067, "num_tokens": 18316363.0, "step": 8460 }, { "entropy": 6.4683513164520265, "epoch": 0.9058804644443256, "grad_norm": 8.5625, "learning_rate": 0.0004927997821304856, "loss": 6.3861, "mean_token_accuracy": 0.12661736011505126, "num_tokens": 18327397.0, "step": 8465 }, { "entropy": 6.5845592498779295, "epoch": 0.9064155385520895, "grad_norm": 1.890625, "learning_rate": 0.0004927901841743107, "loss": 6.4818, "mean_token_accuracy": 0.12432613149285317, "num_tokens": 18338909.0, "step": 8470 }, { "entropy": 6.639092874526978, "epoch": 0.9069506126598534, "grad_norm": 1.703125, "learning_rate": 0.0004927805799294747, "loss": 6.4568, "mean_token_accuracy": 0.12108288407325744, "num_tokens": 18350110.0, "step": 8475 }, { "entropy": 6.679194068908691, "epoch": 0.9074856867676173, "grad_norm": 2.515625, "learning_rate": 0.0004927709693962551, "loss": 6.5177, "mean_token_accuracy": 0.11563151106238365, "num_tokens": 18361590.0, "step": 8480 }, { "entropy": 6.59504246711731, "epoch": 0.9080207608753812, "grad_norm": 1.9453125, "learning_rate": 0.0004927613525749295, "loss": 6.4634, "mean_token_accuracy": 0.12366845831274986, "num_tokens": 18372602.0, "step": 8485 }, { "entropy": 6.630734634399414, "epoch": 0.9085558349831452, "grad_norm": 1.4609375, "learning_rate": 0.0004927517294657753, "loss": 6.499, "mean_token_accuracy": 0.12221666947007179, "num_tokens": 18384653.0, "step": 8490 }, { "entropy": 6.684356164932251, "epoch": 0.9090909090909091, "grad_norm": 1.8828125, "learning_rate": 0.0004927421000690705, "loss": 6.4559, "mean_token_accuracy": 0.12245200499892235, "num_tokens": 18395379.0, "step": 8495 }, { "entropy": 6.63131685256958, "epoch": 0.909625983198673, "grad_norm": 1.7890625, "learning_rate": 0.0004927324643850933, "loss": 6.4256, "mean_token_accuracy": 0.12843620777130127, "num_tokens": 18405915.0, "step": 8500 }, { "entropy": 6.438924121856689, "epoch": 0.9101610573064369, "grad_norm": 1.6484375, "learning_rate": 0.0004927228224141217, "loss": 6.3293, "mean_token_accuracy": 0.14597983360290528, "num_tokens": 18416656.0, "step": 8505 }, { "entropy": 6.542063999176025, "epoch": 0.9106961314142009, "grad_norm": 2.5, "learning_rate": 0.0004927131741564342, "loss": 6.4477, "mean_token_accuracy": 0.12013882920145988, "num_tokens": 18427141.0, "step": 8510 }, { "entropy": 6.607851362228393, "epoch": 0.9112312055219648, "grad_norm": 1.734375, "learning_rate": 0.0004927035196123094, "loss": 6.4915, "mean_token_accuracy": 0.12988717779517173, "num_tokens": 18437135.0, "step": 8515 }, { "entropy": 6.685029554367065, "epoch": 0.9117662796297287, "grad_norm": 1.4453125, "learning_rate": 0.000492693858782026, "loss": 6.5639, "mean_token_accuracy": 0.11965355947613716, "num_tokens": 18448567.0, "step": 8520 }, { "entropy": 6.679243803024292, "epoch": 0.9123013537374927, "grad_norm": 1.5546875, "learning_rate": 0.000492684191665863, "loss": 6.511, "mean_token_accuracy": 0.11756190657615662, "num_tokens": 18459385.0, "step": 8525 }, { "entropy": 6.561179542541504, "epoch": 0.9128364278452565, "grad_norm": 1.421875, "learning_rate": 0.0004926745182640996, "loss": 6.4677, "mean_token_accuracy": 0.1285193495452404, "num_tokens": 18471376.0, "step": 8530 }, { "entropy": 6.649504232406616, "epoch": 0.9133715019530205, "grad_norm": 1.7890625, "learning_rate": 0.0004926648385770152, "loss": 6.5335, "mean_token_accuracy": 0.11931721493601799, "num_tokens": 18481950.0, "step": 8535 }, { "entropy": 6.654511833190918, "epoch": 0.9139065760607844, "grad_norm": 1.4375, "learning_rate": 0.0004926551526048891, "loss": 6.4524, "mean_token_accuracy": 0.12727693393826484, "num_tokens": 18492436.0, "step": 8540 }, { "entropy": 6.575570774078369, "epoch": 0.9144416501685484, "grad_norm": 2.390625, "learning_rate": 0.0004926454603480009, "loss": 6.2964, "mean_token_accuracy": 0.12638833299279212, "num_tokens": 18504279.0, "step": 8545 }, { "entropy": 6.573821878433227, "epoch": 0.9149767242763123, "grad_norm": 3.546875, "learning_rate": 0.0004926357618066307, "loss": 6.4443, "mean_token_accuracy": 0.12484021857380867, "num_tokens": 18515262.0, "step": 8550 }, { "entropy": 6.63035249710083, "epoch": 0.9155117983840761, "grad_norm": 1.6484375, "learning_rate": 0.0004926260569810586, "loss": 6.4951, "mean_token_accuracy": 0.12227512821555138, "num_tokens": 18525176.0, "step": 8555 }, { "entropy": 6.5566153049469, "epoch": 0.9160468724918401, "grad_norm": 1.59375, "learning_rate": 0.0004926163458715645, "loss": 6.4617, "mean_token_accuracy": 0.12596529051661493, "num_tokens": 18536674.0, "step": 8560 }, { "entropy": 6.5605353832244875, "epoch": 0.916581946599604, "grad_norm": 4.03125, "learning_rate": 0.0004926066284784292, "loss": 6.4496, "mean_token_accuracy": 0.12597779259085656, "num_tokens": 18547398.0, "step": 8565 }, { "entropy": 6.563134813308716, "epoch": 0.917117020707368, "grad_norm": 1.7578125, "learning_rate": 0.0004925969048019329, "loss": 6.4943, "mean_token_accuracy": 0.12652412205934524, "num_tokens": 18558838.0, "step": 8570 }, { "entropy": 6.629328727722168, "epoch": 0.9176520948151319, "grad_norm": 2.265625, "learning_rate": 0.0004925871748423566, "loss": 6.4395, "mean_token_accuracy": 0.1258179649710655, "num_tokens": 18569881.0, "step": 8575 }, { "entropy": 6.6013552188873295, "epoch": 0.9181871689228959, "grad_norm": 1.6640625, "learning_rate": 0.0004925774385999812, "loss": 6.3501, "mean_token_accuracy": 0.13269954398274422, "num_tokens": 18579556.0, "step": 8580 }, { "entropy": 6.4663420677185055, "epoch": 0.9187222430306597, "grad_norm": 1.71875, "learning_rate": 0.0004925676960750878, "loss": 6.3516, "mean_token_accuracy": 0.1361738361418247, "num_tokens": 18590580.0, "step": 8585 }, { "entropy": 6.634561157226562, "epoch": 0.9192573171384236, "grad_norm": 1.71875, "learning_rate": 0.0004925579472679578, "loss": 6.4828, "mean_token_accuracy": 0.1265283964574337, "num_tokens": 18600813.0, "step": 8590 }, { "entropy": 6.598533678054809, "epoch": 0.9197923912461876, "grad_norm": 1.484375, "learning_rate": 0.0004925481921788726, "loss": 6.391, "mean_token_accuracy": 0.1304919548332691, "num_tokens": 18610807.0, "step": 8595 }, { "entropy": 6.510357618331909, "epoch": 0.9203274653539515, "grad_norm": 1.515625, "learning_rate": 0.000492538430808114, "loss": 6.3577, "mean_token_accuracy": 0.12540487572550774, "num_tokens": 18622108.0, "step": 8600 }, { "entropy": 6.557230615615845, "epoch": 0.9208625394617155, "grad_norm": 1.4140625, "learning_rate": 0.0004925286631559636, "loss": 6.5401, "mean_token_accuracy": 0.12565935403108597, "num_tokens": 18633098.0, "step": 8605 }, { "entropy": 6.648445987701416, "epoch": 0.9213976135694794, "grad_norm": 1.5859375, "learning_rate": 0.0004925188892227038, "loss": 6.4225, "mean_token_accuracy": 0.12731703594326974, "num_tokens": 18643603.0, "step": 8610 }, { "entropy": 6.638711643218994, "epoch": 0.9219326876772433, "grad_norm": 2.15625, "learning_rate": 0.0004925091090086166, "loss": 6.4527, "mean_token_accuracy": 0.1319430947303772, "num_tokens": 18654354.0, "step": 8615 }, { "entropy": 6.621751213073731, "epoch": 0.9224677617850072, "grad_norm": 1.6171875, "learning_rate": 0.0004924993225139845, "loss": 6.5275, "mean_token_accuracy": 0.12473874017596245, "num_tokens": 18665349.0, "step": 8620 }, { "entropy": 6.635911178588867, "epoch": 0.9230028358927711, "grad_norm": 1.53125, "learning_rate": 0.0004924895297390899, "loss": 6.4661, "mean_token_accuracy": 0.1247866302728653, "num_tokens": 18676575.0, "step": 8625 }, { "entropy": 6.631935882568359, "epoch": 0.9235379100005351, "grad_norm": 1.4296875, "learning_rate": 0.0004924797306842157, "loss": 6.4019, "mean_token_accuracy": 0.13183975219726562, "num_tokens": 18686501.0, "step": 8630 }, { "entropy": 6.582294940948486, "epoch": 0.924072984108299, "grad_norm": 2.140625, "learning_rate": 0.0004924699253496449, "loss": 6.474, "mean_token_accuracy": 0.1282108373939991, "num_tokens": 18697246.0, "step": 8635 }, { "entropy": 6.533542108535767, "epoch": 0.924608058216063, "grad_norm": 1.921875, "learning_rate": 0.0004924601137356605, "loss": 6.3935, "mean_token_accuracy": 0.1339188501238823, "num_tokens": 18708177.0, "step": 8640 }, { "entropy": 6.60825548171997, "epoch": 0.9251431323238268, "grad_norm": 1.546875, "learning_rate": 0.000492450295842546, "loss": 6.458, "mean_token_accuracy": 0.12657491490244865, "num_tokens": 18719334.0, "step": 8645 }, { "entropy": 6.618236446380616, "epoch": 0.9256782064315908, "grad_norm": 1.6171875, "learning_rate": 0.0004924404716705847, "loss": 6.4091, "mean_token_accuracy": 0.13286964371800422, "num_tokens": 18729174.0, "step": 8650 }, { "entropy": 6.537341594696045, "epoch": 0.9262132805393547, "grad_norm": 1.703125, "learning_rate": 0.0004924306412200603, "loss": 6.517, "mean_token_accuracy": 0.122911486774683, "num_tokens": 18740277.0, "step": 8655 }, { "entropy": 6.627772474288941, "epoch": 0.9267483546471186, "grad_norm": 1.46875, "learning_rate": 0.0004924208044912567, "loss": 6.4767, "mean_token_accuracy": 0.12486343458294868, "num_tokens": 18751864.0, "step": 8660 }, { "entropy": 6.609443330764771, "epoch": 0.9272834287548826, "grad_norm": 2.828125, "learning_rate": 0.0004924109614844579, "loss": 6.3891, "mean_token_accuracy": 0.1359869807958603, "num_tokens": 18762786.0, "step": 8665 }, { "entropy": 6.555660629272461, "epoch": 0.9278185028626464, "grad_norm": 1.7890625, "learning_rate": 0.0004924011121999482, "loss": 6.4339, "mean_token_accuracy": 0.13116455525159837, "num_tokens": 18772913.0, "step": 8670 }, { "entropy": 6.5695160865783695, "epoch": 0.9283535769704104, "grad_norm": 1.5390625, "learning_rate": 0.0004923912566380118, "loss": 6.4058, "mean_token_accuracy": 0.12949569448828696, "num_tokens": 18784204.0, "step": 8675 }, { "entropy": 6.5018853664398195, "epoch": 0.9288886510781743, "grad_norm": 1.59375, "learning_rate": 0.0004923813947989336, "loss": 6.4945, "mean_token_accuracy": 0.12146714031696319, "num_tokens": 18795425.0, "step": 8680 }, { "entropy": 6.64973201751709, "epoch": 0.9294237251859383, "grad_norm": 1.796875, "learning_rate": 0.0004923715266829981, "loss": 6.4345, "mean_token_accuracy": 0.1265689440071583, "num_tokens": 18806850.0, "step": 8685 }, { "entropy": 6.641017436981201, "epoch": 0.9299587992937022, "grad_norm": 1.3671875, "learning_rate": 0.0004923616522904903, "loss": 6.3843, "mean_token_accuracy": 0.1314132884144783, "num_tokens": 18817272.0, "step": 8690 }, { "entropy": 6.597755098342896, "epoch": 0.930493873401466, "grad_norm": 1.7734375, "learning_rate": 0.0004923517716216953, "loss": 6.5085, "mean_token_accuracy": 0.12215960323810578, "num_tokens": 18827075.0, "step": 8695 }, { "entropy": 6.62264838218689, "epoch": 0.93102894750923, "grad_norm": 3.390625, "learning_rate": 0.0004923418846768985, "loss": 6.4421, "mean_token_accuracy": 0.12476111203432083, "num_tokens": 18837635.0, "step": 8700 }, { "entropy": 6.642798328399659, "epoch": 0.9315640216169939, "grad_norm": 1.5546875, "learning_rate": 0.0004923319914563852, "loss": 6.4275, "mean_token_accuracy": 0.13177590519189836, "num_tokens": 18848559.0, "step": 8705 }, { "entropy": 6.670168113708496, "epoch": 0.9320990957247579, "grad_norm": 1.8828125, "learning_rate": 0.0004923220919604413, "loss": 6.4681, "mean_token_accuracy": 0.1240908034145832, "num_tokens": 18859327.0, "step": 8710 }, { "entropy": 6.591074991226196, "epoch": 0.9326341698325218, "grad_norm": 1.5859375, "learning_rate": 0.0004923121861893525, "loss": 6.4075, "mean_token_accuracy": 0.1274246610701084, "num_tokens": 18869403.0, "step": 8715 }, { "entropy": 6.583342885971069, "epoch": 0.9331692439402858, "grad_norm": 1.7421875, "learning_rate": 0.0004923022741434049, "loss": 6.4379, "mean_token_accuracy": 0.12099683731794357, "num_tokens": 18879890.0, "step": 8720 }, { "entropy": 6.615302467346192, "epoch": 0.9337043180480497, "grad_norm": 1.9375, "learning_rate": 0.0004922923558228846, "loss": 6.4721, "mean_token_accuracy": 0.12057366967201233, "num_tokens": 18890361.0, "step": 8725 }, { "entropy": 6.579403305053711, "epoch": 0.9342393921558135, "grad_norm": 2.171875, "learning_rate": 0.0004922824312280781, "loss": 6.3868, "mean_token_accuracy": 0.13047217801213265, "num_tokens": 18902344.0, "step": 8730 }, { "entropy": 6.569160079956054, "epoch": 0.9347744662635775, "grad_norm": 1.890625, "learning_rate": 0.000492272500359272, "loss": 6.3847, "mean_token_accuracy": 0.13155013620853423, "num_tokens": 18911364.0, "step": 8735 }, { "entropy": 6.588317584991455, "epoch": 0.9353095403713414, "grad_norm": 1.7265625, "learning_rate": 0.0004922625632167529, "loss": 6.488, "mean_token_accuracy": 0.11757436320185662, "num_tokens": 18922254.0, "step": 8740 }, { "entropy": 6.664959383010864, "epoch": 0.9358446144791054, "grad_norm": 1.40625, "learning_rate": 0.0004922526198008078, "loss": 6.4452, "mean_token_accuracy": 0.1260450467467308, "num_tokens": 18932943.0, "step": 8745 }, { "entropy": 6.618773317337036, "epoch": 0.9363796885868693, "grad_norm": 1.578125, "learning_rate": 0.0004922426701117239, "loss": 6.5241, "mean_token_accuracy": 0.12151310667395591, "num_tokens": 18943523.0, "step": 8750 }, { "entropy": 6.609319257736206, "epoch": 0.9369147626946333, "grad_norm": 1.4296875, "learning_rate": 0.0004922327141497884, "loss": 6.508, "mean_token_accuracy": 0.1161932684481144, "num_tokens": 18955220.0, "step": 8755 }, { "entropy": 6.675847339630127, "epoch": 0.9374498368023971, "grad_norm": 1.5390625, "learning_rate": 0.0004922227519152888, "loss": 6.5421, "mean_token_accuracy": 0.12342641204595566, "num_tokens": 18966714.0, "step": 8760 }, { "entropy": 6.56199951171875, "epoch": 0.937984910910161, "grad_norm": 1.8203125, "learning_rate": 0.0004922127834085128, "loss": 6.3913, "mean_token_accuracy": 0.12646044045686722, "num_tokens": 18977998.0, "step": 8765 }, { "entropy": 6.567882633209228, "epoch": 0.938519985017925, "grad_norm": 1.9609375, "learning_rate": 0.0004922028086297481, "loss": 6.3818, "mean_token_accuracy": 0.127099596709013, "num_tokens": 18990210.0, "step": 8770 }, { "entropy": 6.6765382289886475, "epoch": 0.9390550591256889, "grad_norm": 1.5078125, "learning_rate": 0.0004921928275792828, "loss": 6.4995, "mean_token_accuracy": 0.12616633251309395, "num_tokens": 19000529.0, "step": 8775 }, { "entropy": 6.628943872451782, "epoch": 0.9395901332334529, "grad_norm": 2.6875, "learning_rate": 0.0004921828402574052, "loss": 6.4251, "mean_token_accuracy": 0.13188672289252282, "num_tokens": 19011386.0, "step": 8780 }, { "entropy": 6.550263404846191, "epoch": 0.9401252073412167, "grad_norm": 1.6640625, "learning_rate": 0.0004921728466644037, "loss": 6.4043, "mean_token_accuracy": 0.12869123220443726, "num_tokens": 19022196.0, "step": 8785 }, { "entropy": 6.533733606338501, "epoch": 0.9406602814489807, "grad_norm": 1.5625, "learning_rate": 0.0004921628468005666, "loss": 6.4358, "mean_token_accuracy": 0.13189285323023797, "num_tokens": 19033221.0, "step": 8790 }, { "entropy": 6.611112642288208, "epoch": 0.9411953555567446, "grad_norm": 1.4765625, "learning_rate": 0.000492152840666183, "loss": 6.4878, "mean_token_accuracy": 0.12585045173764228, "num_tokens": 19044953.0, "step": 8795 }, { "entropy": 6.711111831665039, "epoch": 0.9417304296645085, "grad_norm": 1.515625, "learning_rate": 0.0004921428282615415, "loss": 6.5018, "mean_token_accuracy": 0.12096112072467805, "num_tokens": 19055512.0, "step": 8800 }, { "entropy": 6.635407400131226, "epoch": 0.9422655037722725, "grad_norm": 1.5859375, "learning_rate": 0.0004921328095869313, "loss": 6.5027, "mean_token_accuracy": 0.1203993707895279, "num_tokens": 19065659.0, "step": 8805 }, { "entropy": 6.658339595794677, "epoch": 0.9428005778800364, "grad_norm": 1.8125, "learning_rate": 0.0004921227846426418, "loss": 6.433, "mean_token_accuracy": 0.1371263563632965, "num_tokens": 19076955.0, "step": 8810 }, { "entropy": 6.572042465209961, "epoch": 0.9433356519878003, "grad_norm": 1.625, "learning_rate": 0.0004921127534289624, "loss": 6.5106, "mean_token_accuracy": 0.11860493347048759, "num_tokens": 19088305.0, "step": 8815 }, { "entropy": 6.568140172958374, "epoch": 0.9438707260955642, "grad_norm": 1.65625, "learning_rate": 0.0004921027159461829, "loss": 6.5098, "mean_token_accuracy": 0.12441008612513542, "num_tokens": 19098046.0, "step": 8820 }, { "entropy": 6.6841308116912845, "epoch": 0.9444058002033282, "grad_norm": 1.75, "learning_rate": 0.0004920926721945927, "loss": 6.4226, "mean_token_accuracy": 0.12864333316683768, "num_tokens": 19109019.0, "step": 8825 }, { "entropy": 6.662001609802246, "epoch": 0.9449408743110921, "grad_norm": 1.484375, "learning_rate": 0.0004920826221744823, "loss": 6.4228, "mean_token_accuracy": 0.12871572971343995, "num_tokens": 19119624.0, "step": 8830 }, { "entropy": 6.636339902877808, "epoch": 0.945475948418856, "grad_norm": 1.4453125, "learning_rate": 0.0004920725658861417, "loss": 6.4741, "mean_token_accuracy": 0.12303901016712189, "num_tokens": 19130577.0, "step": 8835 }, { "entropy": 6.589366340637207, "epoch": 0.94601102252662, "grad_norm": 1.4140625, "learning_rate": 0.0004920625033298611, "loss": 6.3814, "mean_token_accuracy": 0.12903112173080444, "num_tokens": 19140254.0, "step": 8840 }, { "entropy": 6.569903993606568, "epoch": 0.9465460966343838, "grad_norm": 1.6015625, "learning_rate": 0.0004920524345059314, "loss": 6.4247, "mean_token_accuracy": 0.12659077122807502, "num_tokens": 19151357.0, "step": 8845 }, { "entropy": 6.6806480884552, "epoch": 0.9470811707421478, "grad_norm": 1.3515625, "learning_rate": 0.0004920423594146431, "loss": 6.4208, "mean_token_accuracy": 0.13126432448625563, "num_tokens": 19162069.0, "step": 8850 }, { "entropy": 6.546973991394043, "epoch": 0.9476162448499117, "grad_norm": 1.484375, "learning_rate": 0.0004920322780562872, "loss": 6.3129, "mean_token_accuracy": 0.13278165608644485, "num_tokens": 19172515.0, "step": 8855 }, { "entropy": 6.469416666030884, "epoch": 0.9481513189576757, "grad_norm": 1.3125, "learning_rate": 0.0004920221904311546, "loss": 6.3304, "mean_token_accuracy": 0.1281422682106495, "num_tokens": 19182450.0, "step": 8860 }, { "entropy": 6.6383439064025875, "epoch": 0.9486863930654396, "grad_norm": 1.53125, "learning_rate": 0.0004920120965395369, "loss": 6.5292, "mean_token_accuracy": 0.12080127596855164, "num_tokens": 19193833.0, "step": 8865 }, { "entropy": 6.678140926361084, "epoch": 0.9492214671732034, "grad_norm": 2.640625, "learning_rate": 0.0004920019963817253, "loss": 6.4762, "mean_token_accuracy": 0.1225566104054451, "num_tokens": 19204970.0, "step": 8870 }, { "entropy": 6.609140682220459, "epoch": 0.9497565412809674, "grad_norm": 1.7265625, "learning_rate": 0.0004919918899580117, "loss": 6.4331, "mean_token_accuracy": 0.1269660323858261, "num_tokens": 19215795.0, "step": 8875 }, { "entropy": 6.611617612838745, "epoch": 0.9502916153887313, "grad_norm": 1.8671875, "learning_rate": 0.0004919817772686876, "loss": 6.4649, "mean_token_accuracy": 0.11650814116001129, "num_tokens": 19226375.0, "step": 8880 }, { "entropy": 6.680630016326904, "epoch": 0.9508266894964953, "grad_norm": 1.8515625, "learning_rate": 0.0004919716583140453, "loss": 6.468, "mean_token_accuracy": 0.13823570236563681, "num_tokens": 19236066.0, "step": 8885 }, { "entropy": 6.529271268844605, "epoch": 0.9513617636042592, "grad_norm": 2.203125, "learning_rate": 0.0004919615330943769, "loss": 6.3353, "mean_token_accuracy": 0.1377024307847023, "num_tokens": 19246757.0, "step": 8890 }, { "entropy": 6.614864778518677, "epoch": 0.9518968377120232, "grad_norm": 1.4921875, "learning_rate": 0.0004919514016099746, "loss": 6.5, "mean_token_accuracy": 0.12600353509187698, "num_tokens": 19257875.0, "step": 8895 }, { "entropy": 6.6503785133361815, "epoch": 0.952431911819787, "grad_norm": 1.5, "learning_rate": 0.000491941263861131, "loss": 6.4781, "mean_token_accuracy": 0.125810706615448, "num_tokens": 19270236.0, "step": 8900 }, { "entropy": 6.588436317443848, "epoch": 0.9529669859275509, "grad_norm": 2.609375, "learning_rate": 0.000491931119848139, "loss": 6.4612, "mean_token_accuracy": 0.12382268756628037, "num_tokens": 19280877.0, "step": 8905 }, { "entropy": 6.525938892364502, "epoch": 0.9535020600353149, "grad_norm": 2.0, "learning_rate": 0.0004919209695712915, "loss": 6.3569, "mean_token_accuracy": 0.13123888075351714, "num_tokens": 19292852.0, "step": 8910 }, { "entropy": 6.636586141586304, "epoch": 0.9540371341430788, "grad_norm": 7.90625, "learning_rate": 0.0004919108130308814, "loss": 6.5481, "mean_token_accuracy": 0.11724269837141037, "num_tokens": 19305516.0, "step": 8915 }, { "entropy": 6.625235986709595, "epoch": 0.9545722082508428, "grad_norm": 1.4609375, "learning_rate": 0.0004919006502272019, "loss": 6.3795, "mean_token_accuracy": 0.13500440642237663, "num_tokens": 19315436.0, "step": 8920 }, { "entropy": 6.508727741241455, "epoch": 0.9551072823586066, "grad_norm": 1.453125, "learning_rate": 0.0004918904811605468, "loss": 6.4376, "mean_token_accuracy": 0.1264245629310608, "num_tokens": 19325393.0, "step": 8925 }, { "entropy": 6.5293982982635494, "epoch": 0.9556423564663706, "grad_norm": 1.71875, "learning_rate": 0.0004918803058312094, "loss": 6.4306, "mean_token_accuracy": 0.12973214834928512, "num_tokens": 19336722.0, "step": 8930 }, { "entropy": 6.7406854152679445, "epoch": 0.9561774305741345, "grad_norm": 1.796875, "learning_rate": 0.0004918701242394837, "loss": 6.5851, "mean_token_accuracy": 0.11917414888739586, "num_tokens": 19348406.0, "step": 8935 }, { "entropy": 6.599468946456909, "epoch": 0.9567125046818984, "grad_norm": 1.609375, "learning_rate": 0.0004918599363856637, "loss": 6.3923, "mean_token_accuracy": 0.1359890453517437, "num_tokens": 19359714.0, "step": 8940 }, { "entropy": 6.630413579940796, "epoch": 0.9572475787896624, "grad_norm": 1.765625, "learning_rate": 0.0004918497422700434, "loss": 6.4143, "mean_token_accuracy": 0.12925480753183366, "num_tokens": 19370833.0, "step": 8945 }, { "entropy": 6.610364055633545, "epoch": 0.9577826528974263, "grad_norm": 1.5078125, "learning_rate": 0.0004918395418929174, "loss": 6.4944, "mean_token_accuracy": 0.12302698343992233, "num_tokens": 19382098.0, "step": 8950 }, { "entropy": 6.624408388137818, "epoch": 0.9583177270051902, "grad_norm": 2.015625, "learning_rate": 0.00049182933525458, "loss": 6.4757, "mean_token_accuracy": 0.12349115982651711, "num_tokens": 19393595.0, "step": 8955 }, { "entropy": 6.640421295166016, "epoch": 0.9588528011129541, "grad_norm": 1.625, "learning_rate": 0.000491819122355326, "loss": 6.4125, "mean_token_accuracy": 0.13156883418560028, "num_tokens": 19405296.0, "step": 8960 }, { "entropy": 6.634973096847534, "epoch": 0.9593878752207181, "grad_norm": 1.4609375, "learning_rate": 0.0004918089031954503, "loss": 6.4472, "mean_token_accuracy": 0.12182890325784683, "num_tokens": 19415693.0, "step": 8965 }, { "entropy": 6.580959510803223, "epoch": 0.959922949328482, "grad_norm": 1.78125, "learning_rate": 0.000491798677775248, "loss": 6.4961, "mean_token_accuracy": 0.12708681151270868, "num_tokens": 19426140.0, "step": 8970 }, { "entropy": 6.693287134170532, "epoch": 0.9604580234362459, "grad_norm": 1.578125, "learning_rate": 0.0004917884460950144, "loss": 6.5297, "mean_token_accuracy": 0.1222914569079876, "num_tokens": 19437543.0, "step": 8975 }, { "entropy": 6.634545707702637, "epoch": 0.9609930975440099, "grad_norm": 1.390625, "learning_rate": 0.000491778208155045, "loss": 6.4384, "mean_token_accuracy": 0.1252037465572357, "num_tokens": 19447788.0, "step": 8980 }, { "entropy": 6.65233883857727, "epoch": 0.9615281716517737, "grad_norm": 1.796875, "learning_rate": 0.0004917679639556351, "loss": 6.4577, "mean_token_accuracy": 0.12330029979348182, "num_tokens": 19457587.0, "step": 8985 }, { "entropy": 6.6310333728790285, "epoch": 0.9620632457595377, "grad_norm": 1.8515625, "learning_rate": 0.0004917577134970808, "loss": 6.3826, "mean_token_accuracy": 0.1255684621632099, "num_tokens": 19467422.0, "step": 8990 }, { "entropy": 6.586491394042969, "epoch": 0.9625983198673016, "grad_norm": 1.609375, "learning_rate": 0.0004917474567796778, "loss": 6.4322, "mean_token_accuracy": 0.12582321763038634, "num_tokens": 19479037.0, "step": 8995 }, { "entropy": 6.5694173812866214, "epoch": 0.9631333939750656, "grad_norm": 1.5546875, "learning_rate": 0.0004917371938037226, "loss": 6.3603, "mean_token_accuracy": 0.1418306939303875, "num_tokens": 19489639.0, "step": 9000 }, { "epoch": 0.9631333939750656, "eval_entropy": 6.45046752675203, "eval_loss": 6.510419845581055, "eval_mean_token_accuracy": 0.12865163465319177, "eval_num_tokens": 19489639.0, "eval_runtime": 22.7134, "eval_samples_per_second": 1306.673, "eval_steps_per_second": 163.34, "step": 9000 }, { "entropy": 6.621413230895996, "epoch": 0.9636684680828295, "grad_norm": 1.5390625, "learning_rate": 0.0004917269245695114, "loss": 6.4786, "mean_token_accuracy": 0.12253487184643745, "num_tokens": 19500592.0, "step": 9005 }, { "entropy": 6.647409582138062, "epoch": 0.9642035421905933, "grad_norm": 1.6796875, "learning_rate": 0.0004917166490773406, "loss": 6.4926, "mean_token_accuracy": 0.12586249634623528, "num_tokens": 19510818.0, "step": 9010 }, { "entropy": 6.684140062332153, "epoch": 0.9647386162983573, "grad_norm": 1.6875, "learning_rate": 0.0004917063673275071, "loss": 6.5165, "mean_token_accuracy": 0.12470211908221245, "num_tokens": 19521283.0, "step": 9015 }, { "entropy": 6.619394111633301, "epoch": 0.9652736904061212, "grad_norm": 1.4765625, "learning_rate": 0.0004916960793203077, "loss": 6.3639, "mean_token_accuracy": 0.12334120795130729, "num_tokens": 19531799.0, "step": 9020 }, { "entropy": 6.572729444503784, "epoch": 0.9658087645138852, "grad_norm": 1.953125, "learning_rate": 0.0004916857850560394, "loss": 6.3481, "mean_token_accuracy": 0.13819931223988532, "num_tokens": 19542377.0, "step": 9025 }, { "entropy": 6.545560359954834, "epoch": 0.9663438386216491, "grad_norm": 1.953125, "learning_rate": 0.0004916754845349996, "loss": 6.3602, "mean_token_accuracy": 0.12935152798891067, "num_tokens": 19552654.0, "step": 9030 }, { "entropy": 6.592235040664673, "epoch": 0.9668789127294131, "grad_norm": 1.6796875, "learning_rate": 0.0004916651777574856, "loss": 6.4228, "mean_token_accuracy": 0.126383750885725, "num_tokens": 19563439.0, "step": 9035 }, { "entropy": 6.6113365650177, "epoch": 0.9674139868371769, "grad_norm": 2.140625, "learning_rate": 0.000491654864723795, "loss": 6.4451, "mean_token_accuracy": 0.12931786999106407, "num_tokens": 19574264.0, "step": 9040 }, { "entropy": 6.457882881164551, "epoch": 0.9679490609449408, "grad_norm": 1.9296875, "learning_rate": 0.0004916445454342256, "loss": 6.3121, "mean_token_accuracy": 0.14026236683130264, "num_tokens": 19585293.0, "step": 9045 }, { "entropy": 6.6120201587677006, "epoch": 0.9684841350527048, "grad_norm": 1.84375, "learning_rate": 0.0004916342198890754, "loss": 6.3589, "mean_token_accuracy": 0.1260765090584755, "num_tokens": 19594384.0, "step": 9050 }, { "entropy": 6.587450313568115, "epoch": 0.9690192091604687, "grad_norm": 1.765625, "learning_rate": 0.0004916238880886426, "loss": 6.4658, "mean_token_accuracy": 0.12822272032499313, "num_tokens": 19605144.0, "step": 9055 }, { "entropy": 6.570050573348999, "epoch": 0.9695542832682327, "grad_norm": 1.5234375, "learning_rate": 0.0004916135500332255, "loss": 6.3632, "mean_token_accuracy": 0.13149576559662818, "num_tokens": 19615885.0, "step": 9060 }, { "entropy": 6.556726026535034, "epoch": 0.9700893573759966, "grad_norm": 1.3203125, "learning_rate": 0.0004916032057231225, "loss": 6.3891, "mean_token_accuracy": 0.12656096294522284, "num_tokens": 19625749.0, "step": 9065 }, { "entropy": 6.5713582038879395, "epoch": 0.9706244314837605, "grad_norm": 1.5703125, "learning_rate": 0.0004915928551586324, "loss": 6.4627, "mean_token_accuracy": 0.11975899636745453, "num_tokens": 19638285.0, "step": 9070 }, { "entropy": 6.670734453201294, "epoch": 0.9711595055915244, "grad_norm": 2.171875, "learning_rate": 0.0004915824983400541, "loss": 6.5043, "mean_token_accuracy": 0.12083764597773552, "num_tokens": 19649697.0, "step": 9075 }, { "entropy": 6.689089012145996, "epoch": 0.9716945796992883, "grad_norm": 1.6640625, "learning_rate": 0.0004915721352676864, "loss": 6.4909, "mean_token_accuracy": 0.12309880778193474, "num_tokens": 19659668.0, "step": 9080 }, { "entropy": 6.5748748779296875, "epoch": 0.9722296538070523, "grad_norm": 1.4296875, "learning_rate": 0.0004915617659418289, "loss": 6.3587, "mean_token_accuracy": 0.12820305898785592, "num_tokens": 19670301.0, "step": 9085 }, { "entropy": 6.569716072082519, "epoch": 0.9727647279148162, "grad_norm": 1.765625, "learning_rate": 0.0004915513903627807, "loss": 6.4086, "mean_token_accuracy": 0.12332535162568092, "num_tokens": 19680926.0, "step": 9090 }, { "entropy": 6.497462606430053, "epoch": 0.9732998020225802, "grad_norm": 1.515625, "learning_rate": 0.0004915410085308417, "loss": 6.3911, "mean_token_accuracy": 0.13348619192838668, "num_tokens": 19691467.0, "step": 9095 }, { "entropy": 6.5884847164154055, "epoch": 0.973834876130344, "grad_norm": 1.875, "learning_rate": 0.0004915306204463115, "loss": 6.3966, "mean_token_accuracy": 0.12888719141483307, "num_tokens": 19701139.0, "step": 9100 }, { "entropy": 6.624570894241333, "epoch": 0.974369950238108, "grad_norm": 1.890625, "learning_rate": 0.00049152022610949, "loss": 6.4026, "mean_token_accuracy": 0.11958568394184113, "num_tokens": 19710628.0, "step": 9105 }, { "entropy": 6.628446578979492, "epoch": 0.9749050243458719, "grad_norm": 1.3359375, "learning_rate": 0.0004915098255206773, "loss": 6.4187, "mean_token_accuracy": 0.12999779507517814, "num_tokens": 19721824.0, "step": 9110 }, { "entropy": 6.6438335418701175, "epoch": 0.9754400984536358, "grad_norm": 1.5078125, "learning_rate": 0.000491499418680174, "loss": 6.436, "mean_token_accuracy": 0.12116050198674203, "num_tokens": 19732557.0, "step": 9115 }, { "entropy": 6.596571922302246, "epoch": 0.9759751725613998, "grad_norm": 1.328125, "learning_rate": 0.0004914890055882804, "loss": 6.4275, "mean_token_accuracy": 0.11970045194029807, "num_tokens": 19743436.0, "step": 9120 }, { "entropy": 6.541895818710327, "epoch": 0.9765102466691636, "grad_norm": 1.7109375, "learning_rate": 0.000491478586245297, "loss": 6.3416, "mean_token_accuracy": 0.13265810012817383, "num_tokens": 19755305.0, "step": 9125 }, { "entropy": 6.5737539768219, "epoch": 0.9770453207769276, "grad_norm": 3.484375, "learning_rate": 0.000491468160651525, "loss": 6.3464, "mean_token_accuracy": 0.13324624821543693, "num_tokens": 19766223.0, "step": 9130 }, { "entropy": 6.501796293258667, "epoch": 0.9775803948846915, "grad_norm": 1.484375, "learning_rate": 0.0004914577288072652, "loss": 6.4192, "mean_token_accuracy": 0.12503207176923753, "num_tokens": 19777268.0, "step": 9135 }, { "entropy": 6.616298341751099, "epoch": 0.9781154689924555, "grad_norm": 1.8828125, "learning_rate": 0.0004914472907128189, "loss": 6.5185, "mean_token_accuracy": 0.12278926596045495, "num_tokens": 19787875.0, "step": 9140 }, { "entropy": 6.621466541290284, "epoch": 0.9786505431002194, "grad_norm": 1.8046875, "learning_rate": 0.0004914368463684876, "loss": 6.4216, "mean_token_accuracy": 0.12677970305085182, "num_tokens": 19798919.0, "step": 9145 }, { "entropy": 6.5782746315002445, "epoch": 0.9791856172079834, "grad_norm": 1.796875, "learning_rate": 0.0004914263957745726, "loss": 6.4, "mean_token_accuracy": 0.13413854390382768, "num_tokens": 19809320.0, "step": 9150 }, { "entropy": 6.655309772491455, "epoch": 0.9797206913157472, "grad_norm": 1.9921875, "learning_rate": 0.0004914159389313759, "loss": 6.4725, "mean_token_accuracy": 0.12751644253730773, "num_tokens": 19819511.0, "step": 9155 }, { "entropy": 6.6865781307220455, "epoch": 0.9802557654235111, "grad_norm": 1.4296875, "learning_rate": 0.0004914054758391994, "loss": 6.503, "mean_token_accuracy": 0.11886487379670144, "num_tokens": 19830381.0, "step": 9160 }, { "entropy": 6.536502122879028, "epoch": 0.9807908395312751, "grad_norm": 1.515625, "learning_rate": 0.0004913950064983452, "loss": 6.3499, "mean_token_accuracy": 0.1259816624224186, "num_tokens": 19840806.0, "step": 9165 }, { "entropy": 6.508013916015625, "epoch": 0.981325913639039, "grad_norm": 1.3671875, "learning_rate": 0.0004913845309091156, "loss": 6.353, "mean_token_accuracy": 0.1387888766825199, "num_tokens": 19851095.0, "step": 9170 }, { "entropy": 6.542148590087891, "epoch": 0.981860987746803, "grad_norm": 1.390625, "learning_rate": 0.0004913740490718131, "loss": 6.3035, "mean_token_accuracy": 0.13859621435403824, "num_tokens": 19860235.0, "step": 9175 }, { "entropy": 6.554223346710205, "epoch": 0.9823960618545668, "grad_norm": 1.5078125, "learning_rate": 0.0004913635609867403, "loss": 6.4296, "mean_token_accuracy": 0.12288685292005538, "num_tokens": 19872264.0, "step": 9180 }, { "entropy": 6.637903070449829, "epoch": 0.9829311359623308, "grad_norm": 1.5625, "learning_rate": 0.0004913530666542001, "loss": 6.5237, "mean_token_accuracy": 0.12131133228540421, "num_tokens": 19883628.0, "step": 9185 }, { "entropy": 6.589421558380127, "epoch": 0.9834662100700947, "grad_norm": 1.3046875, "learning_rate": 0.0004913425660744955, "loss": 6.391, "mean_token_accuracy": 0.12491015046834945, "num_tokens": 19894624.0, "step": 9190 }, { "entropy": 6.6095788955688475, "epoch": 0.9840012841778586, "grad_norm": 1.3125, "learning_rate": 0.0004913320592479297, "loss": 6.407, "mean_token_accuracy": 0.12497465535998345, "num_tokens": 19904882.0, "step": 9195 }, { "entropy": 6.5338897705078125, "epoch": 0.9845363582856226, "grad_norm": 1.734375, "learning_rate": 0.0004913215461748061, "loss": 6.345, "mean_token_accuracy": 0.1354656219482422, "num_tokens": 19915344.0, "step": 9200 }, { "entropy": 6.583229351043701, "epoch": 0.9850714323933865, "grad_norm": 1.4296875, "learning_rate": 0.0004913110268554282, "loss": 6.4896, "mean_token_accuracy": 0.11940996870398521, "num_tokens": 19927527.0, "step": 9205 }, { "entropy": 6.597001934051514, "epoch": 0.9856065065011504, "grad_norm": 1.5, "learning_rate": 0.0004913005012900998, "loss": 6.4305, "mean_token_accuracy": 0.12389865592122078, "num_tokens": 19938893.0, "step": 9210 }, { "entropy": 6.603095245361328, "epoch": 0.9861415806089143, "grad_norm": 2.375, "learning_rate": 0.0004912899694791248, "loss": 6.4011, "mean_token_accuracy": 0.13044048398733138, "num_tokens": 19949297.0, "step": 9215 }, { "entropy": 6.545996809005738, "epoch": 0.9866766547166783, "grad_norm": 2.328125, "learning_rate": 0.0004912794314228074, "loss": 6.3656, "mean_token_accuracy": 0.12906254455447197, "num_tokens": 19959194.0, "step": 9220 }, { "entropy": 6.5977085590362545, "epoch": 0.9872117288244422, "grad_norm": 1.3984375, "learning_rate": 0.0004912688871214518, "loss": 6.4299, "mean_token_accuracy": 0.1233506016433239, "num_tokens": 19969896.0, "step": 9225 }, { "entropy": 6.582791805267334, "epoch": 0.9877468029322061, "grad_norm": 1.4609375, "learning_rate": 0.0004912583365753625, "loss": 6.4002, "mean_token_accuracy": 0.13166438192129135, "num_tokens": 19981505.0, "step": 9230 }, { "entropy": 6.570750141143799, "epoch": 0.9882818770399701, "grad_norm": 1.4140625, "learning_rate": 0.0004912477797848441, "loss": 6.3744, "mean_token_accuracy": 0.12995605915784836, "num_tokens": 19992770.0, "step": 9235 }, { "entropy": 6.570767831802368, "epoch": 0.9888169511477339, "grad_norm": 2.015625, "learning_rate": 0.0004912372167502014, "loss": 6.3774, "mean_token_accuracy": 0.13007648289203644, "num_tokens": 20003572.0, "step": 9240 }, { "entropy": 6.511661434173584, "epoch": 0.9893520252554979, "grad_norm": 1.75, "learning_rate": 0.0004912266474717394, "loss": 6.414, "mean_token_accuracy": 0.13034561201930045, "num_tokens": 20014500.0, "step": 9245 }, { "entropy": 6.571699094772339, "epoch": 0.9898870993632618, "grad_norm": 3.78125, "learning_rate": 0.0004912160719497635, "loss": 6.4233, "mean_token_accuracy": 0.12786453440785409, "num_tokens": 20025745.0, "step": 9250 }, { "entropy": 6.561632347106934, "epoch": 0.9904221734710258, "grad_norm": 1.7734375, "learning_rate": 0.0004912054901845788, "loss": 6.2986, "mean_token_accuracy": 0.1291518561542034, "num_tokens": 20036346.0, "step": 9255 }, { "entropy": 6.533315896987915, "epoch": 0.9909572475787897, "grad_norm": 2.671875, "learning_rate": 0.000491194902176491, "loss": 6.4616, "mean_token_accuracy": 0.12814752161502838, "num_tokens": 20048162.0, "step": 9260 }, { "entropy": 6.559889030456543, "epoch": 0.9914923216865535, "grad_norm": 1.8359375, "learning_rate": 0.0004911843079258057, "loss": 6.5379, "mean_token_accuracy": 0.11548658013343811, "num_tokens": 20058947.0, "step": 9265 }, { "entropy": 6.702791309356689, "epoch": 0.9920273957943175, "grad_norm": 1.40625, "learning_rate": 0.0004911737074328289, "loss": 6.4577, "mean_token_accuracy": 0.12429900467395782, "num_tokens": 20069282.0, "step": 9270 }, { "entropy": 6.621148729324341, "epoch": 0.9925624699020814, "grad_norm": 1.75, "learning_rate": 0.0004911631006978667, "loss": 6.4334, "mean_token_accuracy": 0.1263555720448494, "num_tokens": 20078347.0, "step": 9275 }, { "entropy": 6.581938457489014, "epoch": 0.9930975440098454, "grad_norm": 1.8125, "learning_rate": 0.0004911524877212254, "loss": 6.4294, "mean_token_accuracy": 0.12386744022369385, "num_tokens": 20089129.0, "step": 9280 }, { "entropy": 6.5865562915802, "epoch": 0.9936326181176093, "grad_norm": 1.7109375, "learning_rate": 0.0004911418685032114, "loss": 6.4354, "mean_token_accuracy": 0.12295543402433395, "num_tokens": 20101008.0, "step": 9285 }, { "entropy": 6.520455312728882, "epoch": 0.9941676922253733, "grad_norm": 1.8125, "learning_rate": 0.0004911312430441312, "loss": 6.4523, "mean_token_accuracy": 0.12910244837403298, "num_tokens": 20112272.0, "step": 9290 }, { "entropy": 6.548386669158935, "epoch": 0.9947027663331371, "grad_norm": 1.9453125, "learning_rate": 0.0004911206113442918, "loss": 6.3361, "mean_token_accuracy": 0.1382080502808094, "num_tokens": 20122814.0, "step": 9295 }, { "entropy": 6.514030599594117, "epoch": 0.995237840440901, "grad_norm": 2.046875, "learning_rate": 0.0004911099734040001, "loss": 6.3017, "mean_token_accuracy": 0.13078407868742942, "num_tokens": 20133169.0, "step": 9300 }, { "entropy": 6.61966381072998, "epoch": 0.995772914548665, "grad_norm": 2.59375, "learning_rate": 0.0004910993292235634, "loss": 6.4622, "mean_token_accuracy": 0.1179257057607174, "num_tokens": 20144355.0, "step": 9305 }, { "entropy": 6.63772873878479, "epoch": 0.9963079886564289, "grad_norm": 1.4765625, "learning_rate": 0.0004910886788032887, "loss": 6.4394, "mean_token_accuracy": 0.12375867813825607, "num_tokens": 20154486.0, "step": 9310 }, { "entropy": 6.580125761032105, "epoch": 0.9968430627641929, "grad_norm": 1.3671875, "learning_rate": 0.0004910780221434839, "loss": 6.4081, "mean_token_accuracy": 0.1301169626414776, "num_tokens": 20166359.0, "step": 9315 }, { "entropy": 6.582270002365112, "epoch": 0.9973781368719568, "grad_norm": 1.4765625, "learning_rate": 0.0004910673592444566, "loss": 6.4117, "mean_token_accuracy": 0.1259844958782196, "num_tokens": 20176469.0, "step": 9320 }, { "entropy": 6.605635404586792, "epoch": 0.9979132109797207, "grad_norm": 1.5546875, "learning_rate": 0.0004910566901065147, "loss": 6.4425, "mean_token_accuracy": 0.129373699426651, "num_tokens": 20188334.0, "step": 9325 }, { "entropy": 6.553080797195435, "epoch": 0.9984482850874846, "grad_norm": 2.1875, "learning_rate": 0.0004910460147299661, "loss": 6.3445, "mean_token_accuracy": 0.13515611216425896, "num_tokens": 20198594.0, "step": 9330 }, { "entropy": 6.559202575683594, "epoch": 0.9989833591952485, "grad_norm": 1.53125, "learning_rate": 0.0004910353331151193, "loss": 6.4468, "mean_token_accuracy": 0.12875296920537949, "num_tokens": 20209456.0, "step": 9335 }, { "entropy": 6.580421400070191, "epoch": 0.9995184333030125, "grad_norm": 1.4765625, "learning_rate": 0.0004910246452622825, "loss": 6.4296, "mean_token_accuracy": 0.13052132055163385, "num_tokens": 20219835.0, "step": 9340 }, { "entropy": 6.6216433842976885, "epoch": 1.0, "grad_norm": 3.6875, "learning_rate": 0.0004910139511717646, "loss": 6.4613, "mean_token_accuracy": 0.1245041439930598, "num_tokens": 20228258.0, "step": 9345 }, { "entropy": 6.589415073394775, "epoch": 1.0005350741077639, "grad_norm": 1.4765625, "learning_rate": 0.0004910032508438739, "loss": 6.3329, "mean_token_accuracy": 0.12991154193878174, "num_tokens": 20238875.0, "step": 9350 }, { "entropy": 6.589252042770386, "epoch": 1.0010701482155278, "grad_norm": 1.3671875, "learning_rate": 0.00049099254427892, "loss": 6.3593, "mean_token_accuracy": 0.12358415201306343, "num_tokens": 20249750.0, "step": 9355 }, { "entropy": 6.6447954177856445, "epoch": 1.0016052223232919, "grad_norm": 1.5625, "learning_rate": 0.0004909818314772116, "loss": 6.3993, "mean_token_accuracy": 0.12229088544845582, "num_tokens": 20259772.0, "step": 9360 }, { "entropy": 6.541646099090576, "epoch": 1.0021402964310557, "grad_norm": 1.5, "learning_rate": 0.0004909711124390582, "loss": 6.304, "mean_token_accuracy": 0.13751042485237122, "num_tokens": 20270230.0, "step": 9365 }, { "entropy": 6.444565153121948, "epoch": 1.0026753705388196, "grad_norm": 1.4765625, "learning_rate": 0.0004909603871647692, "loss": 6.1597, "mean_token_accuracy": 0.1495958887040615, "num_tokens": 20280317.0, "step": 9370 }, { "entropy": 6.489602088928223, "epoch": 1.0032104446465835, "grad_norm": 1.421875, "learning_rate": 0.0004909496556546544, "loss": 6.2537, "mean_token_accuracy": 0.13361010998487471, "num_tokens": 20291147.0, "step": 9375 }, { "entropy": 6.506109571456909, "epoch": 1.0037455187543476, "grad_norm": 1.7109375, "learning_rate": 0.0004909389179090238, "loss": 6.3279, "mean_token_accuracy": 0.13419800773262977, "num_tokens": 20301095.0, "step": 9380 }, { "entropy": 6.544373941421509, "epoch": 1.0042805928621115, "grad_norm": 2.46875, "learning_rate": 0.0004909281739281871, "loss": 6.327, "mean_token_accuracy": 0.13655227348208426, "num_tokens": 20311216.0, "step": 9385 }, { "entropy": 6.626815271377564, "epoch": 1.0048156669698753, "grad_norm": 1.7109375, "learning_rate": 0.0004909174237124548, "loss": 6.3962, "mean_token_accuracy": 0.1186282604932785, "num_tokens": 20321719.0, "step": 9390 }, { "entropy": 6.612100839614868, "epoch": 1.0053507410776392, "grad_norm": 1.6484375, "learning_rate": 0.0004909066672621372, "loss": 6.3819, "mean_token_accuracy": 0.1340535432100296, "num_tokens": 20331997.0, "step": 9395 }, { "entropy": 6.547275447845459, "epoch": 1.005885815185403, "grad_norm": 1.609375, "learning_rate": 0.0004908959045775449, "loss": 6.4149, "mean_token_accuracy": 0.126530484855175, "num_tokens": 20342973.0, "step": 9400 }, { "entropy": 6.510686302185059, "epoch": 1.0064208892931672, "grad_norm": 1.4453125, "learning_rate": 0.0004908851356589887, "loss": 6.3041, "mean_token_accuracy": 0.13099054470658303, "num_tokens": 20352652.0, "step": 9405 }, { "entropy": 6.583318471908569, "epoch": 1.006955963400931, "grad_norm": 1.421875, "learning_rate": 0.0004908743605067796, "loss": 6.3757, "mean_token_accuracy": 0.13030261918902397, "num_tokens": 20364577.0, "step": 9410 }, { "entropy": 6.587148284912109, "epoch": 1.007491037508695, "grad_norm": 1.6015625, "learning_rate": 0.0004908635791212287, "loss": 6.4133, "mean_token_accuracy": 0.1268289640545845, "num_tokens": 20375451.0, "step": 9415 }, { "entropy": 6.597857093811035, "epoch": 1.0080261116164588, "grad_norm": 1.9609375, "learning_rate": 0.0004908527915026472, "loss": 6.3258, "mean_token_accuracy": 0.1297917626798153, "num_tokens": 20385174.0, "step": 9420 }, { "entropy": 6.577202701568604, "epoch": 1.0085611857242227, "grad_norm": 1.6796875, "learning_rate": 0.0004908419976513467, "loss": 6.2784, "mean_token_accuracy": 0.13403301909565926, "num_tokens": 20395710.0, "step": 9425 }, { "entropy": 6.479523420333862, "epoch": 1.0090962598319868, "grad_norm": 1.484375, "learning_rate": 0.0004908311975676388, "loss": 6.2838, "mean_token_accuracy": 0.1319771207869053, "num_tokens": 20406572.0, "step": 9430 }, { "entropy": 6.497412395477295, "epoch": 1.0096313339397507, "grad_norm": 1.59375, "learning_rate": 0.0004908203912518355, "loss": 6.2668, "mean_token_accuracy": 0.14010654836893083, "num_tokens": 20417786.0, "step": 9435 }, { "entropy": 6.63450174331665, "epoch": 1.0101664080475146, "grad_norm": 2.1875, "learning_rate": 0.0004908095787042487, "loss": 6.3222, "mean_token_accuracy": 0.12953511774539947, "num_tokens": 20427680.0, "step": 9440 }, { "entropy": 6.517748641967773, "epoch": 1.0107014821552784, "grad_norm": 1.4921875, "learning_rate": 0.0004907987599251907, "loss": 6.3061, "mean_token_accuracy": 0.1292630322277546, "num_tokens": 20438640.0, "step": 9445 }, { "entropy": 6.547880840301514, "epoch": 1.0112365562630425, "grad_norm": 2.171875, "learning_rate": 0.0004907879349149737, "loss": 6.3195, "mean_token_accuracy": 0.1381923846900463, "num_tokens": 20449939.0, "step": 9450 }, { "entropy": 6.499249458312988, "epoch": 1.0117716303708064, "grad_norm": 2.15625, "learning_rate": 0.0004907771036739105, "loss": 6.2544, "mean_token_accuracy": 0.1351288966834545, "num_tokens": 20460845.0, "step": 9455 }, { "entropy": 6.507327079772949, "epoch": 1.0123067044785703, "grad_norm": 1.4140625, "learning_rate": 0.0004907662662023137, "loss": 6.3992, "mean_token_accuracy": 0.1253681182861328, "num_tokens": 20472407.0, "step": 9460 }, { "entropy": 6.543278932571411, "epoch": 1.0128417785863342, "grad_norm": 2.484375, "learning_rate": 0.0004907554225004962, "loss": 6.3928, "mean_token_accuracy": 0.12943721190094948, "num_tokens": 20483192.0, "step": 9465 }, { "entropy": 6.645859479904175, "epoch": 1.013376852694098, "grad_norm": 4.03125, "learning_rate": 0.0004907445725687714, "loss": 6.4457, "mean_token_accuracy": 0.12626103758811952, "num_tokens": 20493498.0, "step": 9470 }, { "entropy": 6.599184513092041, "epoch": 1.0139119268018622, "grad_norm": 1.8984375, "learning_rate": 0.0004907337164074523, "loss": 6.3523, "mean_token_accuracy": 0.13376811072230338, "num_tokens": 20503781.0, "step": 9475 }, { "entropy": 6.534925746917724, "epoch": 1.014447000909626, "grad_norm": 1.625, "learning_rate": 0.0004907228540168523, "loss": 6.4217, "mean_token_accuracy": 0.1251296542584896, "num_tokens": 20515142.0, "step": 9480 }, { "entropy": 6.585486030578613, "epoch": 1.01498207501739, "grad_norm": 1.609375, "learning_rate": 0.0004907119853972854, "loss": 6.3807, "mean_token_accuracy": 0.12869108244776725, "num_tokens": 20527568.0, "step": 9485 }, { "entropy": 6.50612735748291, "epoch": 1.0155171491251538, "grad_norm": 1.796875, "learning_rate": 0.0004907011105490651, "loss": 6.2661, "mean_token_accuracy": 0.1366148717701435, "num_tokens": 20538198.0, "step": 9490 }, { "entropy": 6.540985012054444, "epoch": 1.0160522232329177, "grad_norm": 1.3828125, "learning_rate": 0.0004906902294725056, "loss": 6.2605, "mean_token_accuracy": 0.13617482855916024, "num_tokens": 20549355.0, "step": 9495 }, { "entropy": 6.516599655151367, "epoch": 1.0165872973406818, "grad_norm": 1.53125, "learning_rate": 0.000490679342167921, "loss": 6.391, "mean_token_accuracy": 0.12939720898866652, "num_tokens": 20558984.0, "step": 9500 }, { "entropy": 6.594373750686645, "epoch": 1.0171223714484456, "grad_norm": 2.140625, "learning_rate": 0.0004906684486356258, "loss": 6.4106, "mean_token_accuracy": 0.12316248491406441, "num_tokens": 20570143.0, "step": 9505 }, { "entropy": 6.620317459106445, "epoch": 1.0176574455562095, "grad_norm": 1.421875, "learning_rate": 0.0004906575488759343, "loss": 6.386, "mean_token_accuracy": 0.12629298642277717, "num_tokens": 20580973.0, "step": 9510 }, { "entropy": 6.574526023864746, "epoch": 1.0181925196639734, "grad_norm": 1.359375, "learning_rate": 0.0004906466428891616, "loss": 6.3549, "mean_token_accuracy": 0.1243422269821167, "num_tokens": 20591473.0, "step": 9515 }, { "entropy": 6.545525693893433, "epoch": 1.0187275937717375, "grad_norm": 1.640625, "learning_rate": 0.0004906357306756222, "loss": 6.3223, "mean_token_accuracy": 0.1300820916891098, "num_tokens": 20602347.0, "step": 9520 }, { "entropy": 6.587276935577393, "epoch": 1.0192626678795014, "grad_norm": 1.5859375, "learning_rate": 0.0004906248122356315, "loss": 6.3774, "mean_token_accuracy": 0.13239624947309495, "num_tokens": 20613168.0, "step": 9525 }, { "entropy": 6.53687310218811, "epoch": 1.0197977419872652, "grad_norm": 13.375, "learning_rate": 0.0004906138875695045, "loss": 6.2746, "mean_token_accuracy": 0.13048959001898766, "num_tokens": 20623523.0, "step": 9530 }, { "entropy": 6.475817775726318, "epoch": 1.0203328160950291, "grad_norm": 1.4765625, "learning_rate": 0.0004906029566775569, "loss": 6.3045, "mean_token_accuracy": 0.13328663110733033, "num_tokens": 20634085.0, "step": 9535 }, { "entropy": 6.563428783416748, "epoch": 1.020867890202793, "grad_norm": 1.4453125, "learning_rate": 0.0004905920195601042, "loss": 6.3953, "mean_token_accuracy": 0.128290406614542, "num_tokens": 20644747.0, "step": 9540 }, { "entropy": 6.546395969390869, "epoch": 1.021402964310557, "grad_norm": 2.15625, "learning_rate": 0.0004905810762174622, "loss": 6.301, "mean_token_accuracy": 0.12163680791854858, "num_tokens": 20655704.0, "step": 9545 }, { "entropy": 6.570021915435791, "epoch": 1.021938038418321, "grad_norm": 1.4375, "learning_rate": 0.0004905701266499469, "loss": 6.3183, "mean_token_accuracy": 0.13585362434387208, "num_tokens": 20665844.0, "step": 9550 }, { "entropy": 6.592724752426148, "epoch": 1.0224731125260849, "grad_norm": 1.5859375, "learning_rate": 0.0004905591708578746, "loss": 6.4285, "mean_token_accuracy": 0.12019759565591812, "num_tokens": 20676921.0, "step": 9555 }, { "entropy": 6.617676448822022, "epoch": 1.0230081866338487, "grad_norm": 2.09375, "learning_rate": 0.0004905482088415615, "loss": 6.3741, "mean_token_accuracy": 0.12580151185393335, "num_tokens": 20688476.0, "step": 9560 }, { "entropy": 6.616480588912964, "epoch": 1.0235432607416126, "grad_norm": 2.03125, "learning_rate": 0.0004905372406013241, "loss": 6.3717, "mean_token_accuracy": 0.1287165805697441, "num_tokens": 20698588.0, "step": 9565 }, { "entropy": 6.528187704086304, "epoch": 1.0240783348493767, "grad_norm": 2.40625, "learning_rate": 0.0004905262661374792, "loss": 6.3716, "mean_token_accuracy": 0.13266078233718873, "num_tokens": 20709181.0, "step": 9570 }, { "entropy": 6.4876031398773195, "epoch": 1.0246134089571406, "grad_norm": 1.5703125, "learning_rate": 0.0004905152854503436, "loss": 6.2812, "mean_token_accuracy": 0.13735133409500122, "num_tokens": 20719724.0, "step": 9575 }, { "entropy": 6.579593276977539, "epoch": 1.0251484830649045, "grad_norm": 1.625, "learning_rate": 0.0004905042985402345, "loss": 6.3951, "mean_token_accuracy": 0.12752212211489677, "num_tokens": 20730548.0, "step": 9580 }, { "entropy": 6.5738812446594235, "epoch": 1.0256835571726683, "grad_norm": 1.4765625, "learning_rate": 0.000490493305407469, "loss": 6.3659, "mean_token_accuracy": 0.12526717260479928, "num_tokens": 20742124.0, "step": 9585 }, { "entropy": 6.638371753692627, "epoch": 1.0262186312804324, "grad_norm": 1.7265625, "learning_rate": 0.0004904823060523646, "loss": 6.4466, "mean_token_accuracy": 0.12435985058546066, "num_tokens": 20753313.0, "step": 9590 }, { "entropy": 6.6241978168487545, "epoch": 1.0267537053881963, "grad_norm": 1.46875, "learning_rate": 0.0004904713004752389, "loss": 6.3906, "mean_token_accuracy": 0.1303039439022541, "num_tokens": 20763539.0, "step": 9595 }, { "entropy": 6.558483028411866, "epoch": 1.0272887794959602, "grad_norm": 1.7109375, "learning_rate": 0.0004904602886764097, "loss": 6.4966, "mean_token_accuracy": 0.1237233228981495, "num_tokens": 20775849.0, "step": 9600 }, { "entropy": 6.523603439331055, "epoch": 1.027823853603724, "grad_norm": 1.375, "learning_rate": 0.0004904492706561948, "loss": 6.3649, "mean_token_accuracy": 0.12396602630615235, "num_tokens": 20787460.0, "step": 9605 }, { "entropy": 6.61628360748291, "epoch": 1.028358927711488, "grad_norm": 1.3671875, "learning_rate": 0.0004904382464149127, "loss": 6.2844, "mean_token_accuracy": 0.13349589630961417, "num_tokens": 20798478.0, "step": 9610 }, { "entropy": 6.609794998168946, "epoch": 1.028894001819252, "grad_norm": 1.6015625, "learning_rate": 0.0004904272159528814, "loss": 6.3822, "mean_token_accuracy": 0.12963185608386993, "num_tokens": 20809730.0, "step": 9615 }, { "entropy": 6.557106971740723, "epoch": 1.029429075927016, "grad_norm": 1.515625, "learning_rate": 0.0004904161792704195, "loss": 6.3541, "mean_token_accuracy": 0.13708847612142563, "num_tokens": 20821438.0, "step": 9620 }, { "entropy": 6.5635278701782225, "epoch": 1.0299641500347798, "grad_norm": 1.359375, "learning_rate": 0.0004904051363678457, "loss": 6.3385, "mean_token_accuracy": 0.12266776263713837, "num_tokens": 20832328.0, "step": 9625 }, { "entropy": 6.50533971786499, "epoch": 1.0304992241425437, "grad_norm": 1.3984375, "learning_rate": 0.0004903940872454789, "loss": 6.3222, "mean_token_accuracy": 0.1316038779914379, "num_tokens": 20843956.0, "step": 9630 }, { "entropy": 6.623028230667114, "epoch": 1.0310342982503076, "grad_norm": 2.578125, "learning_rate": 0.0004903830319036381, "loss": 6.3571, "mean_token_accuracy": 0.13210696056485177, "num_tokens": 20854578.0, "step": 9635 }, { "entropy": 6.519392490386963, "epoch": 1.0315693723580717, "grad_norm": 1.6640625, "learning_rate": 0.0004903719703426425, "loss": 6.2925, "mean_token_accuracy": 0.1291162833571434, "num_tokens": 20865190.0, "step": 9640 }, { "entropy": 6.5408073425292965, "epoch": 1.0321044464658355, "grad_norm": 1.4140625, "learning_rate": 0.0004903609025628115, "loss": 6.3185, "mean_token_accuracy": 0.12836557105183602, "num_tokens": 20875733.0, "step": 9645 }, { "entropy": 6.474796438217163, "epoch": 1.0326395205735994, "grad_norm": 1.59375, "learning_rate": 0.0004903498285644647, "loss": 6.3463, "mean_token_accuracy": 0.1265176258981228, "num_tokens": 20886900.0, "step": 9650 }, { "entropy": 6.55428729057312, "epoch": 1.0331745946813633, "grad_norm": 1.7421875, "learning_rate": 0.0004903387483479219, "loss": 6.393, "mean_token_accuracy": 0.12576237097382545, "num_tokens": 20898125.0, "step": 9655 }, { "entropy": 6.662082672119141, "epoch": 1.0337096687891274, "grad_norm": 1.4375, "learning_rate": 0.0004903276619135029, "loss": 6.4162, "mean_token_accuracy": 0.1248619869351387, "num_tokens": 20909788.0, "step": 9660 }, { "entropy": 6.666777038574219, "epoch": 1.0342447428968913, "grad_norm": 1.7578125, "learning_rate": 0.000490316569261528, "loss": 6.3944, "mean_token_accuracy": 0.12725045755505562, "num_tokens": 20921853.0, "step": 9665 }, { "entropy": 6.609588003158569, "epoch": 1.0347798170046552, "grad_norm": 1.359375, "learning_rate": 0.0004903054703923175, "loss": 6.3839, "mean_token_accuracy": 0.12214237824082375, "num_tokens": 20932574.0, "step": 9670 }, { "entropy": 6.505526494979859, "epoch": 1.035314891112419, "grad_norm": 1.3984375, "learning_rate": 0.0004902943653061916, "loss": 6.363, "mean_token_accuracy": 0.12515838891267778, "num_tokens": 20943458.0, "step": 9675 }, { "entropy": 6.551134777069092, "epoch": 1.035849965220183, "grad_norm": 1.421875, "learning_rate": 0.0004902832540034712, "loss": 6.3033, "mean_token_accuracy": 0.13630713000893593, "num_tokens": 20953213.0, "step": 9680 }, { "entropy": 6.527917861938477, "epoch": 1.036385039327947, "grad_norm": 1.25, "learning_rate": 0.0004902721364844773, "loss": 6.3385, "mean_token_accuracy": 0.12731200829148293, "num_tokens": 20963885.0, "step": 9685 }, { "entropy": 6.504400396347046, "epoch": 1.0369201134357109, "grad_norm": 1.734375, "learning_rate": 0.0004902610127495305, "loss": 6.3594, "mean_token_accuracy": 0.1349087744951248, "num_tokens": 20975529.0, "step": 9690 }, { "entropy": 6.549321889877319, "epoch": 1.0374551875434748, "grad_norm": 1.3125, "learning_rate": 0.0004902498827989523, "loss": 6.3136, "mean_token_accuracy": 0.13757401034235955, "num_tokens": 20985279.0, "step": 9695 }, { "entropy": 6.609812068939209, "epoch": 1.0379902616512386, "grad_norm": 1.1640625, "learning_rate": 0.0004902387466330639, "loss": 6.3633, "mean_token_accuracy": 0.13019999638199806, "num_tokens": 20995818.0, "step": 9700 }, { "entropy": 6.4939371109008786, "epoch": 1.0385253357590025, "grad_norm": 1.3203125, "learning_rate": 0.000490227604252187, "loss": 6.2606, "mean_token_accuracy": 0.13090986832976342, "num_tokens": 21006786.0, "step": 9705 }, { "entropy": 6.515184926986694, "epoch": 1.0390604098667666, "grad_norm": 1.453125, "learning_rate": 0.0004902164556566433, "loss": 6.328, "mean_token_accuracy": 0.13896063342690468, "num_tokens": 21017441.0, "step": 9710 }, { "entropy": 6.437628364562988, "epoch": 1.0395954839745305, "grad_norm": 1.296875, "learning_rate": 0.0004902053008467546, "loss": 6.2063, "mean_token_accuracy": 0.13861987590789795, "num_tokens": 21027812.0, "step": 9715 }, { "entropy": 6.534468650817871, "epoch": 1.0401305580822944, "grad_norm": 1.8359375, "learning_rate": 0.0004901941398228431, "loss": 6.3941, "mean_token_accuracy": 0.13089548125863076, "num_tokens": 21038960.0, "step": 9720 }, { "entropy": 6.597829294204712, "epoch": 1.0406656321900583, "grad_norm": 1.3984375, "learning_rate": 0.0004901829725852311, "loss": 6.3574, "mean_token_accuracy": 0.13462072163820266, "num_tokens": 21050467.0, "step": 9725 }, { "entropy": 6.52369499206543, "epoch": 1.0412007062978224, "grad_norm": 1.3046875, "learning_rate": 0.000490171799134241, "loss": 6.2819, "mean_token_accuracy": 0.12630092725157738, "num_tokens": 21061208.0, "step": 9730 }, { "entropy": 6.523263645172119, "epoch": 1.0417357804055862, "grad_norm": 1.78125, "learning_rate": 0.0004901606194701954, "loss": 6.3792, "mean_token_accuracy": 0.13332309275865556, "num_tokens": 21072872.0, "step": 9735 }, { "entropy": 6.555621576309204, "epoch": 1.04227085451335, "grad_norm": 1.40625, "learning_rate": 0.0004901494335934172, "loss": 6.3524, "mean_token_accuracy": 0.13275277987122536, "num_tokens": 21084878.0, "step": 9740 }, { "entropy": 6.6262726306915285, "epoch": 1.042805928621114, "grad_norm": 1.765625, "learning_rate": 0.0004901382415042293, "loss": 6.3732, "mean_token_accuracy": 0.12680527493357657, "num_tokens": 21095289.0, "step": 9745 }, { "entropy": 6.616176795959473, "epoch": 1.0433410027288779, "grad_norm": 1.640625, "learning_rate": 0.0004901270432029549, "loss": 6.3371, "mean_token_accuracy": 0.1305427983403206, "num_tokens": 21106077.0, "step": 9750 }, { "entropy": 6.423315238952637, "epoch": 1.043876076836642, "grad_norm": 1.34375, "learning_rate": 0.0004901158386899174, "loss": 6.2562, "mean_token_accuracy": 0.13529875352978707, "num_tokens": 21116548.0, "step": 9755 }, { "entropy": 6.516621541976929, "epoch": 1.0444111509444058, "grad_norm": 1.5078125, "learning_rate": 0.0004901046279654402, "loss": 6.2808, "mean_token_accuracy": 0.13983293026685714, "num_tokens": 21126163.0, "step": 9760 }, { "entropy": 6.61842679977417, "epoch": 1.0449462250521697, "grad_norm": 1.546875, "learning_rate": 0.0004900934110298471, "loss": 6.385, "mean_token_accuracy": 0.12512520104646682, "num_tokens": 21136830.0, "step": 9765 }, { "entropy": 6.571760177612305, "epoch": 1.0454812991599336, "grad_norm": 1.5859375, "learning_rate": 0.0004900821878834621, "loss": 6.3308, "mean_token_accuracy": 0.1342024587094784, "num_tokens": 21146793.0, "step": 9770 }, { "entropy": 6.573628664016724, "epoch": 1.0460163732676975, "grad_norm": 1.4375, "learning_rate": 0.000490070958526609, "loss": 6.3792, "mean_token_accuracy": 0.13071634098887444, "num_tokens": 21156799.0, "step": 9775 }, { "entropy": 6.540488243103027, "epoch": 1.0465514473754616, "grad_norm": 1.4453125, "learning_rate": 0.0004900597229596124, "loss": 6.3793, "mean_token_accuracy": 0.12690124064683914, "num_tokens": 21167757.0, "step": 9780 }, { "entropy": 6.6183329105377195, "epoch": 1.0470865214832255, "grad_norm": 2.046875, "learning_rate": 0.0004900484811827963, "loss": 6.3829, "mean_token_accuracy": 0.12883857786655425, "num_tokens": 21178832.0, "step": 9785 }, { "entropy": 6.58182463645935, "epoch": 1.0476215955909893, "grad_norm": 1.3203125, "learning_rate": 0.0004900372331964856, "loss": 6.2876, "mean_token_accuracy": 0.13159751370549203, "num_tokens": 21189637.0, "step": 9790 }, { "entropy": 6.507457113265991, "epoch": 1.0481566696987532, "grad_norm": 1.6484375, "learning_rate": 0.000490025979001005, "loss": 6.321, "mean_token_accuracy": 0.13030252754688262, "num_tokens": 21200194.0, "step": 9795 }, { "entropy": 6.490743494033813, "epoch": 1.0486917438065173, "grad_norm": 2.484375, "learning_rate": 0.0004900147185966795, "loss": 6.2775, "mean_token_accuracy": 0.13105009645223617, "num_tokens": 21211405.0, "step": 9800 }, { "entropy": 6.59748592376709, "epoch": 1.0492268179142812, "grad_norm": 2.15625, "learning_rate": 0.0004900034519838342, "loss": 6.3228, "mean_token_accuracy": 0.12743570655584335, "num_tokens": 21222722.0, "step": 9805 }, { "entropy": 6.541789150238037, "epoch": 1.049761892022045, "grad_norm": 1.734375, "learning_rate": 0.0004899921791627945, "loss": 6.2748, "mean_token_accuracy": 0.13372819796204566, "num_tokens": 21233510.0, "step": 9810 }, { "entropy": 6.541411399841309, "epoch": 1.050296966129809, "grad_norm": 2.4375, "learning_rate": 0.0004899809001338857, "loss": 6.4169, "mean_token_accuracy": 0.12047207728028297, "num_tokens": 21243235.0, "step": 9815 }, { "entropy": 6.536032104492188, "epoch": 1.0508320402375728, "grad_norm": 1.453125, "learning_rate": 0.0004899696148974338, "loss": 6.3156, "mean_token_accuracy": 0.13035102561116219, "num_tokens": 21254680.0, "step": 9820 }, { "entropy": 6.51158652305603, "epoch": 1.051367114345337, "grad_norm": 1.8046875, "learning_rate": 0.0004899583234537644, "loss": 6.3057, "mean_token_accuracy": 0.13114088550209999, "num_tokens": 21265116.0, "step": 9825 }, { "entropy": 6.5533318519592285, "epoch": 1.0519021884531008, "grad_norm": 1.5078125, "learning_rate": 0.0004899470258032034, "loss": 6.3005, "mean_token_accuracy": 0.13146693632006645, "num_tokens": 21277066.0, "step": 9830 }, { "entropy": 6.582359695434571, "epoch": 1.0524372625608647, "grad_norm": 1.6484375, "learning_rate": 0.0004899357219460775, "loss": 6.3492, "mean_token_accuracy": 0.13322116136550904, "num_tokens": 21287332.0, "step": 9835 }, { "entropy": 6.456721401214599, "epoch": 1.0529723366686286, "grad_norm": 1.609375, "learning_rate": 0.0004899244118827128, "loss": 6.3403, "mean_token_accuracy": 0.13221352621912957, "num_tokens": 21298377.0, "step": 9840 }, { "entropy": 6.571355152130127, "epoch": 1.0535074107763924, "grad_norm": 1.4375, "learning_rate": 0.0004899130956134358, "loss": 6.3453, "mean_token_accuracy": 0.13347491770982742, "num_tokens": 21309966.0, "step": 9845 }, { "entropy": 6.511975812911987, "epoch": 1.0540424848841565, "grad_norm": 1.3984375, "learning_rate": 0.0004899017731385735, "loss": 6.2418, "mean_token_accuracy": 0.13985393643379213, "num_tokens": 21320399.0, "step": 9850 }, { "entropy": 6.545067501068115, "epoch": 1.0545775589919204, "grad_norm": 1.421875, "learning_rate": 0.0004898904444584527, "loss": 6.3461, "mean_token_accuracy": 0.1301308900117874, "num_tokens": 21331716.0, "step": 9855 }, { "entropy": 6.575881576538086, "epoch": 1.0551126330996843, "grad_norm": 1.546875, "learning_rate": 0.0004898791095734004, "loss": 6.3749, "mean_token_accuracy": 0.12489353939890861, "num_tokens": 21341664.0, "step": 9860 }, { "entropy": 6.569723415374756, "epoch": 1.0556477072074482, "grad_norm": 1.8515625, "learning_rate": 0.000489867768483744, "loss": 6.338, "mean_token_accuracy": 0.12841244488954545, "num_tokens": 21352220.0, "step": 9865 }, { "entropy": 6.63442759513855, "epoch": 1.0561827813152123, "grad_norm": 1.9921875, "learning_rate": 0.0004898564211898111, "loss": 6.4478, "mean_token_accuracy": 0.12361843287944793, "num_tokens": 21363947.0, "step": 9870 }, { "entropy": 6.601479339599609, "epoch": 1.0567178554229761, "grad_norm": 2.140625, "learning_rate": 0.0004898450676919291, "loss": 6.3254, "mean_token_accuracy": 0.13290739953517913, "num_tokens": 21374011.0, "step": 9875 }, { "entropy": 6.56652512550354, "epoch": 1.05725292953074, "grad_norm": 1.640625, "learning_rate": 0.000489833707990426, "loss": 6.3864, "mean_token_accuracy": 0.1321233369410038, "num_tokens": 21384232.0, "step": 9880 }, { "entropy": 6.523163557052612, "epoch": 1.057788003638504, "grad_norm": 1.8671875, "learning_rate": 0.0004898223420856298, "loss": 6.3445, "mean_token_accuracy": 0.12886636033654214, "num_tokens": 21395928.0, "step": 9885 }, { "entropy": 6.558263635635376, "epoch": 1.0583230777462678, "grad_norm": 1.484375, "learning_rate": 0.0004898109699778686, "loss": 6.3513, "mean_token_accuracy": 0.1277891717851162, "num_tokens": 21406391.0, "step": 9890 }, { "entropy": 6.548861646652222, "epoch": 1.0588581518540319, "grad_norm": 1.5234375, "learning_rate": 0.000489799591667471, "loss": 6.398, "mean_token_accuracy": 0.1259136602282524, "num_tokens": 21417859.0, "step": 9895 }, { "entropy": 6.499192619323731, "epoch": 1.0593932259617957, "grad_norm": 1.8125, "learning_rate": 0.0004897882071547651, "loss": 6.2456, "mean_token_accuracy": 0.13391533121466637, "num_tokens": 21428284.0, "step": 9900 }, { "entropy": 6.542983675003052, "epoch": 1.0599283000695596, "grad_norm": 1.515625, "learning_rate": 0.0004897768164400801, "loss": 6.3857, "mean_token_accuracy": 0.12659377828240395, "num_tokens": 21439610.0, "step": 9905 }, { "entropy": 6.6037352085113525, "epoch": 1.0604633741773235, "grad_norm": 1.328125, "learning_rate": 0.0004897654195237446, "loss": 6.4036, "mean_token_accuracy": 0.1266575463116169, "num_tokens": 21449319.0, "step": 9910 }, { "entropy": 6.607220649719238, "epoch": 1.0609984482850874, "grad_norm": 2.078125, "learning_rate": 0.0004897540164060879, "loss": 6.3995, "mean_token_accuracy": 0.13648231849074363, "num_tokens": 21459851.0, "step": 9915 }, { "entropy": 6.528581809997559, "epoch": 1.0615335223928515, "grad_norm": 1.6953125, "learning_rate": 0.0004897426070874392, "loss": 6.3445, "mean_token_accuracy": 0.13578662425279617, "num_tokens": 21469717.0, "step": 9920 }, { "entropy": 6.5819432735443115, "epoch": 1.0620685965006154, "grad_norm": 1.578125, "learning_rate": 0.0004897311915681278, "loss": 6.4526, "mean_token_accuracy": 0.12497929334640503, "num_tokens": 21480815.0, "step": 9925 }, { "entropy": 6.634674501419068, "epoch": 1.0626036706083792, "grad_norm": 1.7578125, "learning_rate": 0.0004897197698484834, "loss": 6.3432, "mean_token_accuracy": 0.129038904607296, "num_tokens": 21492000.0, "step": 9930 }, { "entropy": 6.515308094024658, "epoch": 1.0631387447161431, "grad_norm": 1.53125, "learning_rate": 0.0004897083419288358, "loss": 6.329, "mean_token_accuracy": 0.12596094235777855, "num_tokens": 21502006.0, "step": 9935 }, { "entropy": 6.500771331787109, "epoch": 1.0636738188239072, "grad_norm": 1.5703125, "learning_rate": 0.000489696907809515, "loss": 6.362, "mean_token_accuracy": 0.13541009426116943, "num_tokens": 21513066.0, "step": 9940 }, { "entropy": 6.547796964645386, "epoch": 1.064208892931671, "grad_norm": 1.84375, "learning_rate": 0.0004896854674908512, "loss": 6.3618, "mean_token_accuracy": 0.1268548533320427, "num_tokens": 21524853.0, "step": 9945 }, { "entropy": 6.571991872787476, "epoch": 1.064743967039435, "grad_norm": 1.6640625, "learning_rate": 0.0004896740209731746, "loss": 6.2734, "mean_token_accuracy": 0.13072544783353807, "num_tokens": 21536497.0, "step": 9950 }, { "entropy": 6.4796923160552975, "epoch": 1.0652790411471988, "grad_norm": 1.625, "learning_rate": 0.0004896625682568159, "loss": 6.298, "mean_token_accuracy": 0.13346593901515008, "num_tokens": 21546213.0, "step": 9955 }, { "entropy": 6.449840402603149, "epoch": 1.0658141152549627, "grad_norm": 1.578125, "learning_rate": 0.0004896511093421057, "loss": 6.2963, "mean_token_accuracy": 0.13981223478913307, "num_tokens": 21556990.0, "step": 9960 }, { "entropy": 6.532204484939575, "epoch": 1.0663491893627268, "grad_norm": 1.6953125, "learning_rate": 0.0004896396442293749, "loss": 6.3005, "mean_token_accuracy": 0.1295848861336708, "num_tokens": 21567567.0, "step": 9965 }, { "entropy": 6.556431913375855, "epoch": 1.0668842634704907, "grad_norm": 1.40625, "learning_rate": 0.0004896281729189544, "loss": 6.3226, "mean_token_accuracy": 0.1309622846543789, "num_tokens": 21577457.0, "step": 9970 }, { "entropy": 6.5115550518035885, "epoch": 1.0674193375782546, "grad_norm": 1.46875, "learning_rate": 0.0004896166954111758, "loss": 6.3167, "mean_token_accuracy": 0.13812632784247397, "num_tokens": 21588173.0, "step": 9975 }, { "entropy": 6.543576431274414, "epoch": 1.0679544116860185, "grad_norm": 1.5703125, "learning_rate": 0.00048960521170637, "loss": 6.3571, "mean_token_accuracy": 0.12762073799967766, "num_tokens": 21599154.0, "step": 9980 }, { "entropy": 6.546718549728394, "epoch": 1.0684894857937826, "grad_norm": 1.5078125, "learning_rate": 0.0004895937218048692, "loss": 6.4033, "mean_token_accuracy": 0.12653964534401893, "num_tokens": 21610134.0, "step": 9985 }, { "entropy": 6.515305852890014, "epoch": 1.0690245599015464, "grad_norm": 1.4296875, "learning_rate": 0.0004895822257070046, "loss": 6.2694, "mean_token_accuracy": 0.131786098331213, "num_tokens": 21619989.0, "step": 9990 }, { "entropy": 6.557422780990601, "epoch": 1.0695596340093103, "grad_norm": 1.796875, "learning_rate": 0.0004895707234131084, "loss": 6.3205, "mean_token_accuracy": 0.1355228066444397, "num_tokens": 21632707.0, "step": 9995 }, { "entropy": 6.578034830093384, "epoch": 1.0700947081170742, "grad_norm": 1.4921875, "learning_rate": 0.0004895592149235128, "loss": 6.2954, "mean_token_accuracy": 0.1315545454621315, "num_tokens": 21643001.0, "step": 10000 }, { "entropy": 6.560757112503052, "epoch": 1.070629782224838, "grad_norm": 1.375, "learning_rate": 0.00048954770023855, "loss": 6.366, "mean_token_accuracy": 0.12268463671207427, "num_tokens": 21653425.0, "step": 10005 }, { "entropy": 6.578395557403565, "epoch": 1.0711648563326022, "grad_norm": 1.4140625, "learning_rate": 0.0004895361793585525, "loss": 6.3953, "mean_token_accuracy": 0.1271112874150276, "num_tokens": 21664212.0, "step": 10010 }, { "entropy": 6.552493667602539, "epoch": 1.071699930440366, "grad_norm": 1.8046875, "learning_rate": 0.0004895246522838529, "loss": 6.382, "mean_token_accuracy": 0.12997190952301024, "num_tokens": 21675564.0, "step": 10015 }, { "entropy": 6.538548183441162, "epoch": 1.07223500454813, "grad_norm": 1.5078125, "learning_rate": 0.0004895131190147842, "loss": 6.3603, "mean_token_accuracy": 0.13544045239686966, "num_tokens": 21686225.0, "step": 10020 }, { "entropy": 6.533993816375732, "epoch": 1.0727700786558938, "grad_norm": 1.828125, "learning_rate": 0.0004895015795516793, "loss": 6.287, "mean_token_accuracy": 0.13008347228169442, "num_tokens": 21697479.0, "step": 10025 }, { "entropy": 6.575708866119385, "epoch": 1.0733051527636577, "grad_norm": 1.96875, "learning_rate": 0.0004894900338948714, "loss": 6.3983, "mean_token_accuracy": 0.12802261039614676, "num_tokens": 21708496.0, "step": 10030 }, { "entropy": 6.565115308761596, "epoch": 1.0738402268714218, "grad_norm": 1.6171875, "learning_rate": 0.0004894784820446939, "loss": 6.2653, "mean_token_accuracy": 0.1375642567873001, "num_tokens": 21718290.0, "step": 10035 }, { "entropy": 6.503127574920654, "epoch": 1.0743753009791857, "grad_norm": 2.015625, "learning_rate": 0.0004894669240014804, "loss": 6.2699, "mean_token_accuracy": 0.13177290111780166, "num_tokens": 21729185.0, "step": 10040 }, { "entropy": 6.518919229507446, "epoch": 1.0749103750869495, "grad_norm": 1.6484375, "learning_rate": 0.0004894553597655646, "loss": 6.3631, "mean_token_accuracy": 0.12472319975495338, "num_tokens": 21740787.0, "step": 10045 }, { "entropy": 6.650041389465332, "epoch": 1.0754454491947134, "grad_norm": 1.7265625, "learning_rate": 0.0004894437893372804, "loss": 6.4041, "mean_token_accuracy": 0.12599473372101783, "num_tokens": 21751804.0, "step": 10050 }, { "entropy": 6.662219142913818, "epoch": 1.0759805233024773, "grad_norm": 1.7890625, "learning_rate": 0.000489432212716962, "loss": 6.3336, "mean_token_accuracy": 0.12913210690021515, "num_tokens": 21762730.0, "step": 10055 }, { "entropy": 6.495162582397461, "epoch": 1.0765155974102414, "grad_norm": 1.921875, "learning_rate": 0.0004894206299049436, "loss": 6.3602, "mean_token_accuracy": 0.12958017587661744, "num_tokens": 21773470.0, "step": 10060 }, { "entropy": 6.566137409210205, "epoch": 1.0770506715180053, "grad_norm": 1.5390625, "learning_rate": 0.0004894090409015595, "loss": 6.3447, "mean_token_accuracy": 0.12679021656513215, "num_tokens": 21783385.0, "step": 10065 }, { "entropy": 6.519651746749878, "epoch": 1.0775857456257691, "grad_norm": 1.8125, "learning_rate": 0.0004893974457071445, "loss": 6.3623, "mean_token_accuracy": 0.1318201705813408, "num_tokens": 21794857.0, "step": 10070 }, { "entropy": 6.582787752151489, "epoch": 1.078120819733533, "grad_norm": 1.4609375, "learning_rate": 0.0004893858443220335, "loss": 6.3485, "mean_token_accuracy": 0.12606494948267938, "num_tokens": 21804296.0, "step": 10075 }, { "entropy": 6.57329306602478, "epoch": 1.0786558938412971, "grad_norm": 1.5234375, "learning_rate": 0.0004893742367465613, "loss": 6.36, "mean_token_accuracy": 0.12605967298150061, "num_tokens": 21815899.0, "step": 10080 }, { "entropy": 6.566723203659057, "epoch": 1.079190967949061, "grad_norm": 1.609375, "learning_rate": 0.0004893626229810631, "loss": 6.3356, "mean_token_accuracy": 0.1350504457950592, "num_tokens": 21825964.0, "step": 10085 }, { "entropy": 6.5852015018463135, "epoch": 1.0797260420568249, "grad_norm": 1.4921875, "learning_rate": 0.0004893510030258743, "loss": 6.4213, "mean_token_accuracy": 0.12873302549123763, "num_tokens": 21836656.0, "step": 10090 }, { "entropy": 6.59387173652649, "epoch": 1.0802611161645888, "grad_norm": 1.8515625, "learning_rate": 0.0004893393768813305, "loss": 6.421, "mean_token_accuracy": 0.12757074385881423, "num_tokens": 21847658.0, "step": 10095 }, { "entropy": 6.651180601119995, "epoch": 1.0807961902723526, "grad_norm": 1.4453125, "learning_rate": 0.0004893277445477673, "loss": 6.3916, "mean_token_accuracy": 0.12199634462594985, "num_tokens": 21858338.0, "step": 10100 }, { "entropy": 6.55932469367981, "epoch": 1.0813312643801167, "grad_norm": 1.703125, "learning_rate": 0.0004893161060255206, "loss": 6.2639, "mean_token_accuracy": 0.13296918123960494, "num_tokens": 21870656.0, "step": 10105 }, { "entropy": 6.572396087646484, "epoch": 1.0818663384878806, "grad_norm": 1.78125, "learning_rate": 0.0004893044613149263, "loss": 6.3623, "mean_token_accuracy": 0.13754768669605255, "num_tokens": 21881806.0, "step": 10110 }, { "entropy": 6.48524956703186, "epoch": 1.0824014125956445, "grad_norm": 1.515625, "learning_rate": 0.0004892928104163209, "loss": 6.2774, "mean_token_accuracy": 0.13149532154202462, "num_tokens": 21892277.0, "step": 10115 }, { "entropy": 6.491385459899902, "epoch": 1.0829364867034084, "grad_norm": 1.6875, "learning_rate": 0.0004892811533300407, "loss": 6.2985, "mean_token_accuracy": 0.13023179545998573, "num_tokens": 21903509.0, "step": 10120 }, { "entropy": 6.581822729110717, "epoch": 1.0834715608111725, "grad_norm": 4.3125, "learning_rate": 0.0004892694900564223, "loss": 6.406, "mean_token_accuracy": 0.12440016642212867, "num_tokens": 21914308.0, "step": 10125 }, { "entropy": 6.546678495407105, "epoch": 1.0840066349189363, "grad_norm": 2.890625, "learning_rate": 0.0004892578205958025, "loss": 6.2881, "mean_token_accuracy": 0.14137799441814422, "num_tokens": 21924302.0, "step": 10130 }, { "entropy": 6.530106067657471, "epoch": 1.0845417090267002, "grad_norm": 1.734375, "learning_rate": 0.0004892461449485182, "loss": 6.3636, "mean_token_accuracy": 0.12199231162667275, "num_tokens": 21935066.0, "step": 10135 }, { "entropy": 6.544826984405518, "epoch": 1.085076783134464, "grad_norm": 1.3984375, "learning_rate": 0.0004892344631149066, "loss": 6.2529, "mean_token_accuracy": 0.1391059972345829, "num_tokens": 21945798.0, "step": 10140 }, { "entropy": 6.537466096878052, "epoch": 1.085611857242228, "grad_norm": 2.796875, "learning_rate": 0.000489222775095305, "loss": 6.3677, "mean_token_accuracy": 0.12511541321873665, "num_tokens": 21955667.0, "step": 10145 }, { "entropy": 6.5176506519317625, "epoch": 1.086146931349992, "grad_norm": 1.828125, "learning_rate": 0.0004892110808900509, "loss": 6.3526, "mean_token_accuracy": 0.12824971377849578, "num_tokens": 21966107.0, "step": 10150 }, { "entropy": 6.5623456001281735, "epoch": 1.086682005457756, "grad_norm": 1.8359375, "learning_rate": 0.0004891993804994818, "loss": 6.3372, "mean_token_accuracy": 0.13260870128870011, "num_tokens": 21976408.0, "step": 10155 }, { "entropy": 6.648627758026123, "epoch": 1.0872170795655198, "grad_norm": 2.125, "learning_rate": 0.0004891876739239358, "loss": 6.3238, "mean_token_accuracy": 0.13422903493046762, "num_tokens": 21986481.0, "step": 10160 }, { "entropy": 6.541556930541992, "epoch": 1.0877521536732837, "grad_norm": 1.6953125, "learning_rate": 0.0004891759611637508, "loss": 6.3798, "mean_token_accuracy": 0.1273925334215164, "num_tokens": 21997554.0, "step": 10165 }, { "entropy": 6.594119644165039, "epoch": 1.0882872277810476, "grad_norm": 1.6328125, "learning_rate": 0.000489164242219265, "loss": 6.4354, "mean_token_accuracy": 0.12317250669002533, "num_tokens": 22009048.0, "step": 10170 }, { "entropy": 6.651549434661865, "epoch": 1.0888223018888117, "grad_norm": 2.265625, "learning_rate": 0.0004891525170908169, "loss": 6.4482, "mean_token_accuracy": 0.1263985179364681, "num_tokens": 22020625.0, "step": 10175 }, { "entropy": 6.634617900848388, "epoch": 1.0893573759965756, "grad_norm": 1.765625, "learning_rate": 0.0004891407857787448, "loss": 6.3263, "mean_token_accuracy": 0.12857749983668326, "num_tokens": 22032298.0, "step": 10180 }, { "entropy": 6.534213542938232, "epoch": 1.0898924501043394, "grad_norm": 1.7109375, "learning_rate": 0.0004891290482833876, "loss": 6.3292, "mean_token_accuracy": 0.13334605246782302, "num_tokens": 22043693.0, "step": 10185 }, { "entropy": 6.520200777053833, "epoch": 1.0904275242121033, "grad_norm": 1.7421875, "learning_rate": 0.0004891173046050844, "loss": 6.3682, "mean_token_accuracy": 0.1346238724887371, "num_tokens": 22054373.0, "step": 10190 }, { "entropy": 6.534080505371094, "epoch": 1.0909625983198672, "grad_norm": 2.46875, "learning_rate": 0.000489105554744174, "loss": 6.3373, "mean_token_accuracy": 0.1305387571454048, "num_tokens": 22065039.0, "step": 10195 }, { "entropy": 6.6202747344970705, "epoch": 1.0914976724276313, "grad_norm": 1.859375, "learning_rate": 0.0004890937987009958, "loss": 6.3725, "mean_token_accuracy": 0.1298222564160824, "num_tokens": 22077003.0, "step": 10200 }, { "entropy": 6.60672516822815, "epoch": 1.0920327465353952, "grad_norm": 2.1875, "learning_rate": 0.0004890820364758892, "loss": 6.3539, "mean_token_accuracy": 0.1274056114256382, "num_tokens": 22088558.0, "step": 10205 }, { "entropy": 6.552365064620972, "epoch": 1.092567820643159, "grad_norm": 1.6484375, "learning_rate": 0.000489070268069194, "loss": 6.3246, "mean_token_accuracy": 0.13213638737797737, "num_tokens": 22097777.0, "step": 10210 }, { "entropy": 6.541152143478394, "epoch": 1.093102894750923, "grad_norm": 1.7890625, "learning_rate": 0.0004890584934812498, "loss": 6.2634, "mean_token_accuracy": 0.1303601458668709, "num_tokens": 22107803.0, "step": 10215 }, { "entropy": 6.498277282714843, "epoch": 1.093637968858687, "grad_norm": 1.5, "learning_rate": 0.0004890467127123967, "loss": 6.2813, "mean_token_accuracy": 0.13142024949193, "num_tokens": 22117965.0, "step": 10220 }, { "entropy": 6.5624823570251465, "epoch": 1.094173042966451, "grad_norm": 2.0, "learning_rate": 0.0004890349257629749, "loss": 6.3365, "mean_token_accuracy": 0.13246248736977578, "num_tokens": 22127759.0, "step": 10225 }, { "entropy": 6.550729131698608, "epoch": 1.0947081170742148, "grad_norm": 1.828125, "learning_rate": 0.0004890231326333246, "loss": 6.3437, "mean_token_accuracy": 0.1269809238612652, "num_tokens": 22138477.0, "step": 10230 }, { "entropy": 6.5772411823272705, "epoch": 1.0952431911819787, "grad_norm": 1.6015625, "learning_rate": 0.0004890113333237865, "loss": 6.3513, "mean_token_accuracy": 0.12684160023927687, "num_tokens": 22149568.0, "step": 10235 }, { "entropy": 6.5642256259918215, "epoch": 1.0957782652897425, "grad_norm": 2.328125, "learning_rate": 0.0004889995278347012, "loss": 6.3269, "mean_token_accuracy": 0.13090576231479645, "num_tokens": 22159949.0, "step": 10240 }, { "entropy": 6.539562940597534, "epoch": 1.0963133393975066, "grad_norm": 1.7265625, "learning_rate": 0.0004889877161664096, "loss": 6.3634, "mean_token_accuracy": 0.12523729503154754, "num_tokens": 22170115.0, "step": 10245 }, { "entropy": 6.588288640975952, "epoch": 1.0968484135052705, "grad_norm": 1.71875, "learning_rate": 0.0004889758983192528, "loss": 6.3573, "mean_token_accuracy": 0.13425422385334967, "num_tokens": 22181323.0, "step": 10250 }, { "entropy": 6.555928516387939, "epoch": 1.0973834876130344, "grad_norm": 1.6875, "learning_rate": 0.0004889640742935719, "loss": 6.2993, "mean_token_accuracy": 0.12734182626008989, "num_tokens": 22192078.0, "step": 10255 }, { "entropy": 6.603155136108398, "epoch": 1.0979185617207983, "grad_norm": 1.6015625, "learning_rate": 0.0004889522440897085, "loss": 6.3842, "mean_token_accuracy": 0.13014934435486794, "num_tokens": 22203211.0, "step": 10260 }, { "entropy": 6.523215007781983, "epoch": 1.0984536358285624, "grad_norm": 1.5, "learning_rate": 0.0004889404077080041, "loss": 6.3009, "mean_token_accuracy": 0.1271577313542366, "num_tokens": 22213487.0, "step": 10265 }, { "entropy": 6.6091859340667725, "epoch": 1.0989887099363262, "grad_norm": 1.6484375, "learning_rate": 0.0004889285651488005, "loss": 6.348, "mean_token_accuracy": 0.1246352657675743, "num_tokens": 22223717.0, "step": 10270 }, { "entropy": 6.56798095703125, "epoch": 1.0995237840440901, "grad_norm": 1.515625, "learning_rate": 0.0004889167164124396, "loss": 6.3425, "mean_token_accuracy": 0.13307574465870858, "num_tokens": 22235141.0, "step": 10275 }, { "entropy": 6.584205436706543, "epoch": 1.100058858151854, "grad_norm": 1.6171875, "learning_rate": 0.0004889048614992636, "loss": 6.4057, "mean_token_accuracy": 0.11987434178590775, "num_tokens": 22246601.0, "step": 10280 }, { "entropy": 6.577657842636109, "epoch": 1.1005939322596179, "grad_norm": 1.9453125, "learning_rate": 0.0004888930004096148, "loss": 6.3329, "mean_token_accuracy": 0.12910846546292304, "num_tokens": 22257206.0, "step": 10285 }, { "entropy": 6.545556259155274, "epoch": 1.101129006367382, "grad_norm": 1.8671875, "learning_rate": 0.0004888811331438356, "loss": 6.4003, "mean_token_accuracy": 0.1228591412305832, "num_tokens": 22267799.0, "step": 10290 }, { "entropy": 6.606423711776733, "epoch": 1.1016640804751459, "grad_norm": 1.46875, "learning_rate": 0.0004888692597022689, "loss": 6.4521, "mean_token_accuracy": 0.12880235388875008, "num_tokens": 22279368.0, "step": 10295 }, { "entropy": 6.553431987762451, "epoch": 1.1021991545829097, "grad_norm": 1.6640625, "learning_rate": 0.0004888573800852572, "loss": 6.1937, "mean_token_accuracy": 0.13669133111834525, "num_tokens": 22289998.0, "step": 10300 }, { "entropy": 6.504615068435669, "epoch": 1.1027342286906736, "grad_norm": 1.421875, "learning_rate": 0.0004888454942931438, "loss": 6.3197, "mean_token_accuracy": 0.1390775963664055, "num_tokens": 22300058.0, "step": 10305 }, { "entropy": 6.565959692001343, "epoch": 1.1032693027984375, "grad_norm": 1.8125, "learning_rate": 0.0004888336023262718, "loss": 6.4207, "mean_token_accuracy": 0.124299506098032, "num_tokens": 22310962.0, "step": 10310 }, { "entropy": 6.608157634735107, "epoch": 1.1038043769062016, "grad_norm": 1.6484375, "learning_rate": 0.0004888217041849846, "loss": 6.3051, "mean_token_accuracy": 0.1316367991268635, "num_tokens": 22321526.0, "step": 10315 }, { "entropy": 6.573012971878052, "epoch": 1.1043394510139655, "grad_norm": 2.265625, "learning_rate": 0.0004888097998696256, "loss": 6.3992, "mean_token_accuracy": 0.12790393680334092, "num_tokens": 22332558.0, "step": 10320 }, { "entropy": 6.550169897079468, "epoch": 1.1048745251217293, "grad_norm": 1.5, "learning_rate": 0.0004887978893805387, "loss": 6.3352, "mean_token_accuracy": 0.13281012028455735, "num_tokens": 22342392.0, "step": 10325 }, { "entropy": 6.571234178543091, "epoch": 1.1054095992294932, "grad_norm": 1.7265625, "learning_rate": 0.0004887859727180679, "loss": 6.3905, "mean_token_accuracy": 0.12326234579086304, "num_tokens": 22353089.0, "step": 10330 }, { "entropy": 6.522563552856445, "epoch": 1.105944673337257, "grad_norm": 1.7421875, "learning_rate": 0.0004887740498825572, "loss": 6.3072, "mean_token_accuracy": 0.13173036724328996, "num_tokens": 22364314.0, "step": 10335 }, { "entropy": 6.497900485992432, "epoch": 1.1064797474450212, "grad_norm": 1.71875, "learning_rate": 0.0004887621208743507, "loss": 6.3202, "mean_token_accuracy": 0.12728115022182465, "num_tokens": 22374985.0, "step": 10340 }, { "entropy": 6.526889419555664, "epoch": 1.107014821552785, "grad_norm": 2.0625, "learning_rate": 0.0004887501856937932, "loss": 6.2334, "mean_token_accuracy": 0.13864122256636618, "num_tokens": 22385618.0, "step": 10345 }, { "entropy": 6.631136274337768, "epoch": 1.107549895660549, "grad_norm": 1.59375, "learning_rate": 0.000488738244341229, "loss": 6.3459, "mean_token_accuracy": 0.14008405432105064, "num_tokens": 22395871.0, "step": 10350 }, { "entropy": 6.570936012268066, "epoch": 1.1080849697683128, "grad_norm": 1.4609375, "learning_rate": 0.000488726296817003, "loss": 6.3666, "mean_token_accuracy": 0.13187873214483262, "num_tokens": 22406707.0, "step": 10355 }, { "entropy": 6.53339991569519, "epoch": 1.108620043876077, "grad_norm": 1.6328125, "learning_rate": 0.0004887143431214602, "loss": 6.3797, "mean_token_accuracy": 0.12708743512630463, "num_tokens": 22417543.0, "step": 10360 }, { "entropy": 6.502883052825927, "epoch": 1.1091551179838408, "grad_norm": 3.03125, "learning_rate": 0.0004887023832549459, "loss": 6.3206, "mean_token_accuracy": 0.13298214301466943, "num_tokens": 22428283.0, "step": 10365 }, { "entropy": 6.499336004257202, "epoch": 1.1096901920916047, "grad_norm": 1.875, "learning_rate": 0.0004886904172178052, "loss": 6.2922, "mean_token_accuracy": 0.13327440321445466, "num_tokens": 22439860.0, "step": 10370 }, { "entropy": 6.63573694229126, "epoch": 1.1102252661993686, "grad_norm": 1.4609375, "learning_rate": 0.0004886784450103838, "loss": 6.3627, "mean_token_accuracy": 0.13110646083950997, "num_tokens": 22451250.0, "step": 10375 }, { "entropy": 6.561157751083374, "epoch": 1.1107603403071324, "grad_norm": 1.484375, "learning_rate": 0.0004886664666330273, "loss": 6.293, "mean_token_accuracy": 0.12992360070347786, "num_tokens": 22461112.0, "step": 10380 }, { "entropy": 6.530084323883057, "epoch": 1.1112954144148965, "grad_norm": 1.4921875, "learning_rate": 0.0004886544820860816, "loss": 6.3298, "mean_token_accuracy": 0.13429150208830834, "num_tokens": 22471368.0, "step": 10385 }, { "entropy": 6.522792387008667, "epoch": 1.1118304885226604, "grad_norm": 3.171875, "learning_rate": 0.0004886424913698927, "loss": 6.3256, "mean_token_accuracy": 0.1302389308810234, "num_tokens": 22482011.0, "step": 10390 }, { "entropy": 6.528932523727417, "epoch": 1.1123655626304243, "grad_norm": 1.8984375, "learning_rate": 0.0004886304944848069, "loss": 6.2828, "mean_token_accuracy": 0.13808312863111497, "num_tokens": 22493648.0, "step": 10395 }, { "entropy": 6.57400918006897, "epoch": 1.1129006367381882, "grad_norm": 1.6953125, "learning_rate": 0.0004886184914311706, "loss": 6.4129, "mean_token_accuracy": 0.12496653497219086, "num_tokens": 22505577.0, "step": 10400 }, { "entropy": 6.564892768859863, "epoch": 1.1134357108459523, "grad_norm": 1.9453125, "learning_rate": 0.0004886064822093305, "loss": 6.3716, "mean_token_accuracy": 0.12236398756504059, "num_tokens": 22515546.0, "step": 10405 }, { "entropy": 6.527905750274658, "epoch": 1.1139707849537162, "grad_norm": 1.5859375, "learning_rate": 0.0004885944668196332, "loss": 6.2631, "mean_token_accuracy": 0.13738187327980994, "num_tokens": 22526710.0, "step": 10410 }, { "entropy": 6.569247817993164, "epoch": 1.11450585906148, "grad_norm": 1.765625, "learning_rate": 0.0004885824452624254, "loss": 6.3707, "mean_token_accuracy": 0.12691551223397254, "num_tokens": 22537809.0, "step": 10415 }, { "entropy": 6.581798887252807, "epoch": 1.115040933169244, "grad_norm": 1.7265625, "learning_rate": 0.0004885704175380548, "loss": 6.3638, "mean_token_accuracy": 0.1270926281809807, "num_tokens": 22549301.0, "step": 10420 }, { "entropy": 6.6548303127288815, "epoch": 1.1155760072770078, "grad_norm": 1.421875, "learning_rate": 0.0004885583836468683, "loss": 6.2725, "mean_token_accuracy": 0.13279347419738768, "num_tokens": 22560483.0, "step": 10425 }, { "entropy": 6.529315996170044, "epoch": 1.1161110813847719, "grad_norm": 1.578125, "learning_rate": 0.0004885463435892136, "loss": 6.3644, "mean_token_accuracy": 0.12554011717438698, "num_tokens": 22570524.0, "step": 10430 }, { "entropy": 6.552693557739258, "epoch": 1.1166461554925358, "grad_norm": 1.4453125, "learning_rate": 0.000488534297365438, "loss": 6.3706, "mean_token_accuracy": 0.1273189067840576, "num_tokens": 22581120.0, "step": 10435 }, { "entropy": 6.6206999778747555, "epoch": 1.1171812296002996, "grad_norm": 2.703125, "learning_rate": 0.0004885222449758899, "loss": 6.3588, "mean_token_accuracy": 0.12862497866153716, "num_tokens": 22592658.0, "step": 10440 }, { "entropy": 6.5843626976013185, "epoch": 1.1177163037080635, "grad_norm": 2.15625, "learning_rate": 0.0004885101864209167, "loss": 6.3188, "mean_token_accuracy": 0.13105077669024467, "num_tokens": 22603497.0, "step": 10445 }, { "entropy": 6.508558559417724, "epoch": 1.1182513778158274, "grad_norm": 1.59375, "learning_rate": 0.000488498121700867, "loss": 6.2562, "mean_token_accuracy": 0.13314962089061738, "num_tokens": 22612916.0, "step": 10450 }, { "entropy": 6.510771703720093, "epoch": 1.1187864519235915, "grad_norm": 1.78125, "learning_rate": 0.0004884860508160891, "loss": 6.3776, "mean_token_accuracy": 0.12925844565033912, "num_tokens": 22625345.0, "step": 10455 }, { "entropy": 6.510384511947632, "epoch": 1.1193215260313554, "grad_norm": 1.4453125, "learning_rate": 0.0004884739737669314, "loss": 6.2801, "mean_token_accuracy": 0.1355935327708721, "num_tokens": 22637000.0, "step": 10460 }, { "entropy": 6.549340534210205, "epoch": 1.1198566001391193, "grad_norm": 1.609375, "learning_rate": 0.0004884618905537427, "loss": 6.2781, "mean_token_accuracy": 0.1341861017048359, "num_tokens": 22647025.0, "step": 10465 }, { "entropy": 6.493887281417846, "epoch": 1.1203916742468831, "grad_norm": 1.5546875, "learning_rate": 0.0004884498011768719, "loss": 6.2679, "mean_token_accuracy": 0.137028082460165, "num_tokens": 22657253.0, "step": 10470 }, { "entropy": 6.463266134262085, "epoch": 1.120926748354647, "grad_norm": 1.578125, "learning_rate": 0.000488437705636668, "loss": 6.3042, "mean_token_accuracy": 0.131851152330637, "num_tokens": 22668432.0, "step": 10475 }, { "entropy": 6.525684833526611, "epoch": 1.121461822462411, "grad_norm": 1.734375, "learning_rate": 0.0004884256039334805, "loss": 6.3575, "mean_token_accuracy": 0.12723028883337975, "num_tokens": 22678538.0, "step": 10480 }, { "entropy": 6.573268985748291, "epoch": 1.121996896570175, "grad_norm": 1.4765625, "learning_rate": 0.0004884134960676586, "loss": 6.3296, "mean_token_accuracy": 0.12801336348056794, "num_tokens": 22688994.0, "step": 10485 }, { "entropy": 6.627550745010376, "epoch": 1.1225319706779389, "grad_norm": 1.4375, "learning_rate": 0.000488401382039552, "loss": 6.3599, "mean_token_accuracy": 0.13166107088327408, "num_tokens": 22699584.0, "step": 10490 }, { "entropy": 6.498450517654419, "epoch": 1.1230670447857027, "grad_norm": 1.5, "learning_rate": 0.0004883892618495104, "loss": 6.2662, "mean_token_accuracy": 0.1293816864490509, "num_tokens": 22710093.0, "step": 10495 }, { "entropy": 6.543735408782959, "epoch": 1.1236021188934668, "grad_norm": 1.671875, "learning_rate": 0.000488377135497884, "loss": 6.3419, "mean_token_accuracy": 0.1305043265223503, "num_tokens": 22720533.0, "step": 10500 }, { "entropy": 6.546299886703491, "epoch": 1.1241371930012307, "grad_norm": 1.7734375, "learning_rate": 0.0004883650029850226, "loss": 6.2551, "mean_token_accuracy": 0.1354456789791584, "num_tokens": 22731010.0, "step": 10505 }, { "entropy": 6.520023155212402, "epoch": 1.1246722671089946, "grad_norm": 1.375, "learning_rate": 0.0004883528643112769, "loss": 6.3359, "mean_token_accuracy": 0.1299326941370964, "num_tokens": 22743045.0, "step": 10510 }, { "entropy": 6.5189900398254395, "epoch": 1.1252073412167585, "grad_norm": 1.59375, "learning_rate": 0.0004883407194769972, "loss": 6.3302, "mean_token_accuracy": 0.13178498074412345, "num_tokens": 22753746.0, "step": 10515 }, { "entropy": 6.565853261947632, "epoch": 1.1257424153245223, "grad_norm": 1.5625, "learning_rate": 0.0004883285684825342, "loss": 6.3514, "mean_token_accuracy": 0.13648682385683059, "num_tokens": 22765264.0, "step": 10520 }, { "entropy": 6.57284836769104, "epoch": 1.1262774894322864, "grad_norm": 1.4296875, "learning_rate": 0.0004883164113282386, "loss": 6.3513, "mean_token_accuracy": 0.13097459301352501, "num_tokens": 22775727.0, "step": 10525 }, { "entropy": 6.56453914642334, "epoch": 1.1268125635400503, "grad_norm": 1.2890625, "learning_rate": 0.0004883042480144618, "loss": 6.3346, "mean_token_accuracy": 0.1291578531265259, "num_tokens": 22787228.0, "step": 10530 }, { "entropy": 6.653687572479248, "epoch": 1.1273476376478142, "grad_norm": 1.8046875, "learning_rate": 0.0004882920785415547, "loss": 6.3944, "mean_token_accuracy": 0.12908954098820685, "num_tokens": 22797467.0, "step": 10535 }, { "entropy": 6.573576211929321, "epoch": 1.127882711755578, "grad_norm": 1.7109375, "learning_rate": 0.0004882799029098689, "loss": 6.3486, "mean_token_accuracy": 0.12570706456899644, "num_tokens": 22808281.0, "step": 10540 }, { "entropy": 6.537278699874878, "epoch": 1.1284177858633422, "grad_norm": 1.8515625, "learning_rate": 0.00048826772111975583, "loss": 6.4105, "mean_token_accuracy": 0.1296780101954937, "num_tokens": 22819387.0, "step": 10545 }, { "entropy": 6.540688848495483, "epoch": 1.128952859971106, "grad_norm": 1.84375, "learning_rate": 0.00048825553317156717, "loss": 6.3638, "mean_token_accuracy": 0.12886037230491637, "num_tokens": 22829649.0, "step": 10550 }, { "entropy": 6.494860124588013, "epoch": 1.12948793407887, "grad_norm": 1.421875, "learning_rate": 0.0004882433390656551, "loss": 6.3573, "mean_token_accuracy": 0.13145121783018113, "num_tokens": 22840667.0, "step": 10555 }, { "entropy": 6.538703346252442, "epoch": 1.1300230081866338, "grad_norm": 1.75, "learning_rate": 0.0004882311388023715, "loss": 6.3134, "mean_token_accuracy": 0.13190669789910317, "num_tokens": 22852461.0, "step": 10560 }, { "entropy": 6.632486295700073, "epoch": 1.1305580822943977, "grad_norm": 1.5390625, "learning_rate": 0.0004882189323820688, "loss": 6.377, "mean_token_accuracy": 0.1251945301890373, "num_tokens": 22862781.0, "step": 10565 }, { "entropy": 6.648410177230835, "epoch": 1.1310931564021618, "grad_norm": 1.796875, "learning_rate": 0.00048820671980509935, "loss": 6.4086, "mean_token_accuracy": 0.12716651260852813, "num_tokens": 22873393.0, "step": 10570 }, { "entropy": 6.624794340133667, "epoch": 1.1316282305099257, "grad_norm": 1.7578125, "learning_rate": 0.00048819450107181583, "loss": 6.3687, "mean_token_accuracy": 0.1276544764637947, "num_tokens": 22883931.0, "step": 10575 }, { "entropy": 6.597856330871582, "epoch": 1.1321633046176895, "grad_norm": 3.03125, "learning_rate": 0.0004881822761825711, "loss": 6.3167, "mean_token_accuracy": 0.12900567129254342, "num_tokens": 22894829.0, "step": 10580 }, { "entropy": 6.510784578323364, "epoch": 1.1326983787254534, "grad_norm": 1.5703125, "learning_rate": 0.000488170045137718, "loss": 6.3531, "mean_token_accuracy": 0.12778317630290986, "num_tokens": 22906059.0, "step": 10585 }, { "entropy": 6.541378164291382, "epoch": 1.1332334528332173, "grad_norm": 1.671875, "learning_rate": 0.0004881578079376099, "loss": 6.3363, "mean_token_accuracy": 0.12626659497618675, "num_tokens": 22917834.0, "step": 10590 }, { "entropy": 6.579113960266113, "epoch": 1.1337685269409814, "grad_norm": 1.359375, "learning_rate": 0.00048814556458259996, "loss": 6.2577, "mean_token_accuracy": 0.14158050939440728, "num_tokens": 22929157.0, "step": 10595 }, { "entropy": 6.6599236011505125, "epoch": 1.1343036010487453, "grad_norm": 1.5703125, "learning_rate": 0.0004881333150730419, "loss": 6.3759, "mean_token_accuracy": 0.13018642514944076, "num_tokens": 22939396.0, "step": 10600 }, { "entropy": 6.537628221511841, "epoch": 1.1348386751565092, "grad_norm": 1.46875, "learning_rate": 0.00048812105940928917, "loss": 6.3538, "mean_token_accuracy": 0.12922895923256875, "num_tokens": 22950253.0, "step": 10605 }, { "entropy": 6.5369837284088135, "epoch": 1.135373749264273, "grad_norm": 1.59375, "learning_rate": 0.00048810879759169593, "loss": 6.3596, "mean_token_accuracy": 0.1285732626914978, "num_tokens": 22960417.0, "step": 10610 }, { "entropy": 6.495455932617188, "epoch": 1.135908823372037, "grad_norm": 4.34375, "learning_rate": 0.000488096529620616, "loss": 6.3557, "mean_token_accuracy": 0.1290543757379055, "num_tokens": 22971763.0, "step": 10615 }, { "entropy": 6.603179931640625, "epoch": 1.136443897479801, "grad_norm": 1.6953125, "learning_rate": 0.00048808425549640383, "loss": 6.3622, "mean_token_accuracy": 0.1303618311882019, "num_tokens": 22981571.0, "step": 10620 }, { "entropy": 6.563053131103516, "epoch": 1.136978971587565, "grad_norm": 1.609375, "learning_rate": 0.00048807197521941366, "loss": 6.3112, "mean_token_accuracy": 0.1328694626688957, "num_tokens": 22991644.0, "step": 10625 }, { "entropy": 6.505655574798584, "epoch": 1.1375140456953288, "grad_norm": 1.6015625, "learning_rate": 0.0004880596887900002, "loss": 6.2685, "mean_token_accuracy": 0.13284799605607986, "num_tokens": 23001557.0, "step": 10630 }, { "entropy": 6.5576403617858885, "epoch": 1.1380491198030926, "grad_norm": 1.6875, "learning_rate": 0.00048804739620851806, "loss": 6.3618, "mean_token_accuracy": 0.12697471380233766, "num_tokens": 23012715.0, "step": 10635 }, { "entropy": 6.530397510528564, "epoch": 1.1385841939108567, "grad_norm": 1.5234375, "learning_rate": 0.00048803509747532235, "loss": 6.3562, "mean_token_accuracy": 0.12833357527852057, "num_tokens": 23023016.0, "step": 10640 }, { "entropy": 6.556599807739258, "epoch": 1.1391192680186206, "grad_norm": 1.671875, "learning_rate": 0.0004880227925907682, "loss": 6.3606, "mean_token_accuracy": 0.1297280579805374, "num_tokens": 23033511.0, "step": 10645 }, { "entropy": 6.620222473144532, "epoch": 1.1396543421263845, "grad_norm": 1.9140625, "learning_rate": 0.0004880104815552108, "loss": 6.3615, "mean_token_accuracy": 0.13871046230196954, "num_tokens": 23045149.0, "step": 10650 }, { "entropy": 6.542651987075805, "epoch": 1.1401894162341484, "grad_norm": 2.703125, "learning_rate": 0.0004879981643690056, "loss": 6.3111, "mean_token_accuracy": 0.1345951810479164, "num_tokens": 23054489.0, "step": 10655 }, { "entropy": 6.546128368377685, "epoch": 1.1407244903419125, "grad_norm": 1.6484375, "learning_rate": 0.00048798584103250847, "loss": 6.4496, "mean_token_accuracy": 0.12695099115371705, "num_tokens": 23064725.0, "step": 10660 }, { "entropy": 6.49794864654541, "epoch": 1.1412595644496764, "grad_norm": 2.15625, "learning_rate": 0.000487973511546075, "loss": 6.4074, "mean_token_accuracy": 0.12610558271408082, "num_tokens": 23076473.0, "step": 10665 }, { "entropy": 6.61476240158081, "epoch": 1.1417946385574402, "grad_norm": 1.71875, "learning_rate": 0.0004879611759100614, "loss": 6.325, "mean_token_accuracy": 0.13806122466921805, "num_tokens": 23087449.0, "step": 10670 }, { "entropy": 6.619863605499267, "epoch": 1.1423297126652041, "grad_norm": 1.7421875, "learning_rate": 0.0004879488341248237, "loss": 6.2824, "mean_token_accuracy": 0.1350557804107666, "num_tokens": 23098284.0, "step": 10675 }, { "entropy": 6.49966254234314, "epoch": 1.142864786772968, "grad_norm": 2.421875, "learning_rate": 0.00048793648619071834, "loss": 6.3136, "mean_token_accuracy": 0.13502648174762727, "num_tokens": 23108545.0, "step": 10680 }, { "entropy": 6.558721446990967, "epoch": 1.143399860880732, "grad_norm": 2.203125, "learning_rate": 0.0004879241321081019, "loss": 6.2808, "mean_token_accuracy": 0.13182588443160057, "num_tokens": 23118568.0, "step": 10685 }, { "entropy": 6.612079620361328, "epoch": 1.143934934988496, "grad_norm": 7.46875, "learning_rate": 0.00048791177187733104, "loss": 6.3619, "mean_token_accuracy": 0.12453131675720215, "num_tokens": 23129189.0, "step": 10690 }, { "entropy": 6.61033616065979, "epoch": 1.1444700090962598, "grad_norm": 1.8203125, "learning_rate": 0.0004878994054987627, "loss": 6.3874, "mean_token_accuracy": 0.12639420479536057, "num_tokens": 23140238.0, "step": 10695 }, { "entropy": 6.52753849029541, "epoch": 1.1450050832040237, "grad_norm": 1.484375, "learning_rate": 0.0004878870329727539, "loss": 6.2835, "mean_token_accuracy": 0.1355196289718151, "num_tokens": 23149567.0, "step": 10700 }, { "entropy": 6.512339735031128, "epoch": 1.1455401573117876, "grad_norm": 1.7578125, "learning_rate": 0.000487874654299662, "loss": 6.2582, "mean_token_accuracy": 0.1337184876203537, "num_tokens": 23159208.0, "step": 10705 }, { "entropy": 6.466184949874878, "epoch": 1.1460752314195517, "grad_norm": 1.6875, "learning_rate": 0.00048786226947984435, "loss": 6.3111, "mean_token_accuracy": 0.13029128834605216, "num_tokens": 23169092.0, "step": 10710 }, { "entropy": 6.5020448684692385, "epoch": 1.1466103055273156, "grad_norm": 1.4453125, "learning_rate": 0.0004878498785136586, "loss": 6.3365, "mean_token_accuracy": 0.13344621732831002, "num_tokens": 23180385.0, "step": 10715 }, { "entropy": 6.58619179725647, "epoch": 1.1471453796350795, "grad_norm": 1.5859375, "learning_rate": 0.00048783748140146245, "loss": 6.3305, "mean_token_accuracy": 0.12785167694091798, "num_tokens": 23191180.0, "step": 10720 }, { "entropy": 6.571190071105957, "epoch": 1.1476804537428433, "grad_norm": 1.65625, "learning_rate": 0.000487825078143614, "loss": 6.3069, "mean_token_accuracy": 0.13744020015001296, "num_tokens": 23200920.0, "step": 10725 }, { "entropy": 6.519334125518799, "epoch": 1.1482155278506072, "grad_norm": 1.40625, "learning_rate": 0.0004878126687404713, "loss": 6.332, "mean_token_accuracy": 0.1358323097229004, "num_tokens": 23211140.0, "step": 10730 }, { "entropy": 6.552707242965698, "epoch": 1.1487506019583713, "grad_norm": 1.5390625, "learning_rate": 0.0004878002531923927, "loss": 6.3699, "mean_token_accuracy": 0.12355867698788643, "num_tokens": 23222039.0, "step": 10735 }, { "entropy": 6.627868509292602, "epoch": 1.1492856760661352, "grad_norm": 1.734375, "learning_rate": 0.00048778783149973674, "loss": 6.3982, "mean_token_accuracy": 0.12598269581794738, "num_tokens": 23232502.0, "step": 10740 }, { "entropy": 6.597220039367675, "epoch": 1.149820750173899, "grad_norm": 1.7734375, "learning_rate": 0.00048777540366286195, "loss": 6.3189, "mean_token_accuracy": 0.13383150175213815, "num_tokens": 23243172.0, "step": 10745 }, { "entropy": 6.588002014160156, "epoch": 1.150355824281663, "grad_norm": 1.6015625, "learning_rate": 0.0004877629696821273, "loss": 6.3769, "mean_token_accuracy": 0.12852920964360237, "num_tokens": 23254558.0, "step": 10750 }, { "entropy": 6.596088075637818, "epoch": 1.1508908983894268, "grad_norm": 1.78125, "learning_rate": 0.00048775052955789185, "loss": 6.4108, "mean_token_accuracy": 0.12670576050877572, "num_tokens": 23266283.0, "step": 10755 }, { "entropy": 6.510305166244507, "epoch": 1.151425972497191, "grad_norm": 1.2734375, "learning_rate": 0.0004877380832905147, "loss": 6.2731, "mean_token_accuracy": 0.13248199224472046, "num_tokens": 23277823.0, "step": 10760 }, { "entropy": 6.5186646461486815, "epoch": 1.1519610466049548, "grad_norm": 2.171875, "learning_rate": 0.00048772563088035533, "loss": 6.2662, "mean_token_accuracy": 0.13238389566540718, "num_tokens": 23288159.0, "step": 10765 }, { "entropy": 6.4919130325317385, "epoch": 1.1524961207127187, "grad_norm": 1.671875, "learning_rate": 0.0004877131723277732, "loss": 6.2853, "mean_token_accuracy": 0.13082748800516128, "num_tokens": 23299379.0, "step": 10770 }, { "entropy": 6.533123350143432, "epoch": 1.1530311948204826, "grad_norm": 1.4296875, "learning_rate": 0.0004877007076331282, "loss": 6.3287, "mean_token_accuracy": 0.12611317709088327, "num_tokens": 23310572.0, "step": 10775 }, { "entropy": 6.587215518951416, "epoch": 1.1535662689282467, "grad_norm": 1.8046875, "learning_rate": 0.0004876882367967801, "loss": 6.334, "mean_token_accuracy": 0.13565945401787757, "num_tokens": 23320782.0, "step": 10780 }, { "entropy": 6.552771425247192, "epoch": 1.1541013430360105, "grad_norm": 1.421875, "learning_rate": 0.00048767575981908907, "loss": 6.3898, "mean_token_accuracy": 0.1259394496679306, "num_tokens": 23331427.0, "step": 10785 }, { "entropy": 6.604757595062256, "epoch": 1.1546364171437744, "grad_norm": 2.375, "learning_rate": 0.00048766327670041534, "loss": 6.488, "mean_token_accuracy": 0.12195928543806075, "num_tokens": 23344250.0, "step": 10790 }, { "entropy": 6.604654550552368, "epoch": 1.1551714912515383, "grad_norm": 1.34375, "learning_rate": 0.0004876507874411194, "loss": 6.3477, "mean_token_accuracy": 0.13034091219305993, "num_tokens": 23354404.0, "step": 10795 }, { "entropy": 6.561950302124023, "epoch": 1.1557065653593024, "grad_norm": 2.0, "learning_rate": 0.00048763829204156187, "loss": 6.3585, "mean_token_accuracy": 0.1264335334300995, "num_tokens": 23364634.0, "step": 10800 }, { "entropy": 6.492505645751953, "epoch": 1.1562416394670663, "grad_norm": 1.7421875, "learning_rate": 0.00048762579050210344, "loss": 6.2262, "mean_token_accuracy": 0.1356184884905815, "num_tokens": 23375816.0, "step": 10805 }, { "entropy": 6.603830242156983, "epoch": 1.1567767135748301, "grad_norm": 2.015625, "learning_rate": 0.00048761328282310534, "loss": 6.3615, "mean_token_accuracy": 0.13077081739902496, "num_tokens": 23386583.0, "step": 10810 }, { "entropy": 6.525880002975464, "epoch": 1.157311787682594, "grad_norm": 1.46875, "learning_rate": 0.00048760076900492846, "loss": 6.2919, "mean_token_accuracy": 0.13986414223909377, "num_tokens": 23396826.0, "step": 10815 }, { "entropy": 6.552999544143677, "epoch": 1.157846861790358, "grad_norm": 1.4296875, "learning_rate": 0.0004875882490479343, "loss": 6.3826, "mean_token_accuracy": 0.13021600022912025, "num_tokens": 23408661.0, "step": 10820 }, { "entropy": 6.541066122055054, "epoch": 1.158381935898122, "grad_norm": 1.3203125, "learning_rate": 0.00048757572295248425, "loss": 6.2981, "mean_token_accuracy": 0.13274050131440163, "num_tokens": 23419308.0, "step": 10825 }, { "entropy": 6.486504793167114, "epoch": 1.1589170100058859, "grad_norm": 2.375, "learning_rate": 0.0004875631907189402, "loss": 6.3, "mean_token_accuracy": 0.13612111359834672, "num_tokens": 23430043.0, "step": 10830 }, { "entropy": 6.4684511661529545, "epoch": 1.1594520841136498, "grad_norm": 1.515625, "learning_rate": 0.0004875506523476638, "loss": 6.2307, "mean_token_accuracy": 0.13488834574818612, "num_tokens": 23441246.0, "step": 10835 }, { "entropy": 6.606773376464844, "epoch": 1.1599871582214136, "grad_norm": 1.8046875, "learning_rate": 0.00048753810783901716, "loss": 6.3619, "mean_token_accuracy": 0.12804771736264228, "num_tokens": 23452250.0, "step": 10840 }, { "entropy": 6.583228635787964, "epoch": 1.1605222323291775, "grad_norm": 1.578125, "learning_rate": 0.00048752555719336257, "loss": 6.3506, "mean_token_accuracy": 0.1309939667582512, "num_tokens": 23464174.0, "step": 10845 }, { "entropy": 6.51217737197876, "epoch": 1.1610573064369416, "grad_norm": 1.703125, "learning_rate": 0.0004875130004110623, "loss": 6.2202, "mean_token_accuracy": 0.13723542168736458, "num_tokens": 23475159.0, "step": 10850 }, { "entropy": 6.514151525497437, "epoch": 1.1615923805447055, "grad_norm": 1.703125, "learning_rate": 0.00048750043749247907, "loss": 6.2808, "mean_token_accuracy": 0.13446007221937178, "num_tokens": 23486210.0, "step": 10855 }, { "entropy": 6.514532136917114, "epoch": 1.1621274546524694, "grad_norm": 1.6015625, "learning_rate": 0.0004874878684379756, "loss": 6.411, "mean_token_accuracy": 0.12789803966879845, "num_tokens": 23497122.0, "step": 10860 }, { "entropy": 6.4596717834472654, "epoch": 1.1626625287602332, "grad_norm": 1.75, "learning_rate": 0.0004874752932479148, "loss": 6.232, "mean_token_accuracy": 0.13754346147179602, "num_tokens": 23507765.0, "step": 10865 }, { "entropy": 6.545322704315185, "epoch": 1.1631976028679971, "grad_norm": 1.6796875, "learning_rate": 0.00048746271192265974, "loss": 6.3203, "mean_token_accuracy": 0.1301468774676323, "num_tokens": 23517686.0, "step": 10870 }, { "entropy": 6.523095512390137, "epoch": 1.1637326769757612, "grad_norm": 2.8125, "learning_rate": 0.0004874501244625737, "loss": 6.3118, "mean_token_accuracy": 0.1309164471924305, "num_tokens": 23528325.0, "step": 10875 }, { "entropy": 6.566447162628174, "epoch": 1.164267751083525, "grad_norm": 1.6640625, "learning_rate": 0.0004874375308680202, "loss": 6.3726, "mean_token_accuracy": 0.13206291794776917, "num_tokens": 23540006.0, "step": 10880 }, { "entropy": 6.632190322875976, "epoch": 1.164802825191289, "grad_norm": 1.5, "learning_rate": 0.00048742493113936274, "loss": 6.2925, "mean_token_accuracy": 0.12856976315379143, "num_tokens": 23550419.0, "step": 10885 }, { "entropy": 6.595448780059814, "epoch": 1.1653378992990528, "grad_norm": 3.859375, "learning_rate": 0.0004874123252769653, "loss": 6.409, "mean_token_accuracy": 0.12579906359314919, "num_tokens": 23561227.0, "step": 10890 }, { "entropy": 6.535502672195435, "epoch": 1.1658729734068167, "grad_norm": 1.9296875, "learning_rate": 0.00048739971328119194, "loss": 6.3248, "mean_token_accuracy": 0.12940651550889015, "num_tokens": 23571357.0, "step": 10895 }, { "entropy": 6.5147114276885985, "epoch": 1.1664080475145808, "grad_norm": 1.5234375, "learning_rate": 0.0004873870951524066, "loss": 6.3553, "mean_token_accuracy": 0.132980278134346, "num_tokens": 23581875.0, "step": 10900 }, { "entropy": 6.559042978286743, "epoch": 1.1669431216223447, "grad_norm": 1.734375, "learning_rate": 0.00048737447089097373, "loss": 6.4243, "mean_token_accuracy": 0.1240346796810627, "num_tokens": 23594251.0, "step": 10905 }, { "entropy": 6.577066469192505, "epoch": 1.1674781957301086, "grad_norm": 1.4921875, "learning_rate": 0.0004873618404972579, "loss": 6.3471, "mean_token_accuracy": 0.12563381120562553, "num_tokens": 23605159.0, "step": 10910 }, { "entropy": 6.621804046630859, "epoch": 1.1680132698378725, "grad_norm": 1.5546875, "learning_rate": 0.00048734920397162376, "loss": 6.3113, "mean_token_accuracy": 0.13350120931863785, "num_tokens": 23615737.0, "step": 10915 }, { "entropy": 6.506545734405518, "epoch": 1.1685483439456366, "grad_norm": 1.5, "learning_rate": 0.0004873365613144361, "loss": 6.3252, "mean_token_accuracy": 0.12694838345050813, "num_tokens": 23626207.0, "step": 10920 }, { "entropy": 6.5473815441131595, "epoch": 1.1690834180534004, "grad_norm": 1.265625, "learning_rate": 0.0004873239125260602, "loss": 6.365, "mean_token_accuracy": 0.12902920097112655, "num_tokens": 23637900.0, "step": 10925 }, { "entropy": 6.621821451187134, "epoch": 1.1696184921611643, "grad_norm": 1.1484375, "learning_rate": 0.00048731125760686106, "loss": 6.2485, "mean_token_accuracy": 0.13506797328591347, "num_tokens": 23647867.0, "step": 10930 }, { "entropy": 6.5687356948852536, "epoch": 1.1701535662689282, "grad_norm": 1.3125, "learning_rate": 0.00048729859655720424, "loss": 6.315, "mean_token_accuracy": 0.12940352633595467, "num_tokens": 23658055.0, "step": 10935 }, { "entropy": 6.455961608886719, "epoch": 1.1706886403766923, "grad_norm": 1.6015625, "learning_rate": 0.0004872859293774553, "loss": 6.3139, "mean_token_accuracy": 0.13185800462961197, "num_tokens": 23669458.0, "step": 10940 }, { "entropy": 6.526072645187378, "epoch": 1.1712237144844562, "grad_norm": 2.0625, "learning_rate": 0.00048727325606797995, "loss": 6.3277, "mean_token_accuracy": 0.1271936185657978, "num_tokens": 23679702.0, "step": 10945 }, { "entropy": 6.563662910461426, "epoch": 1.17175878859222, "grad_norm": 1.7109375, "learning_rate": 0.0004872605766291441, "loss": 6.3193, "mean_token_accuracy": 0.13145660236477852, "num_tokens": 23690844.0, "step": 10950 }, { "entropy": 6.457307958602906, "epoch": 1.172293862699984, "grad_norm": 1.3125, "learning_rate": 0.000487247891061314, "loss": 6.2989, "mean_token_accuracy": 0.1314682736992836, "num_tokens": 23701484.0, "step": 10955 }, { "entropy": 6.5671031951904295, "epoch": 1.1728289368077478, "grad_norm": 1.4296875, "learning_rate": 0.0004872351993648559, "loss": 6.3407, "mean_token_accuracy": 0.13159382194280625, "num_tokens": 23711452.0, "step": 10960 }, { "entropy": 6.516592884063721, "epoch": 1.173364010915512, "grad_norm": 2.5, "learning_rate": 0.00048722250154013613, "loss": 6.3172, "mean_token_accuracy": 0.12494777664542198, "num_tokens": 23723514.0, "step": 10965 }, { "entropy": 6.534799480438233, "epoch": 1.1738990850232758, "grad_norm": 1.2578125, "learning_rate": 0.0004872097975875216, "loss": 6.3526, "mean_token_accuracy": 0.13144171759486198, "num_tokens": 23733722.0, "step": 10970 }, { "entropy": 6.602074098587036, "epoch": 1.1744341591310397, "grad_norm": 1.421875, "learning_rate": 0.0004871970875073789, "loss": 6.3286, "mean_token_accuracy": 0.1271186165511608, "num_tokens": 23743403.0, "step": 10975 }, { "entropy": 6.524165916442871, "epoch": 1.1749692332388035, "grad_norm": 1.71875, "learning_rate": 0.0004871843713000751, "loss": 6.31, "mean_token_accuracy": 0.13159505203366278, "num_tokens": 23754558.0, "step": 10980 }, { "entropy": 6.523883056640625, "epoch": 1.1755043073465674, "grad_norm": 1.375, "learning_rate": 0.00048717164896597737, "loss": 6.3631, "mean_token_accuracy": 0.130098707228899, "num_tokens": 23766346.0, "step": 10985 }, { "entropy": 6.574266242980957, "epoch": 1.1760393814543315, "grad_norm": 1.34375, "learning_rate": 0.0004871589205054532, "loss": 6.3338, "mean_token_accuracy": 0.13770927786827086, "num_tokens": 23776851.0, "step": 10990 }, { "entropy": 6.6048688888549805, "epoch": 1.1765744555620954, "grad_norm": 1.7109375, "learning_rate": 0.00048714618591886997, "loss": 6.387, "mean_token_accuracy": 0.1288090780377388, "num_tokens": 23787350.0, "step": 10995 }, { "entropy": 6.472964715957642, "epoch": 1.1771095296698593, "grad_norm": 1.765625, "learning_rate": 0.0004871334452065954, "loss": 6.2534, "mean_token_accuracy": 0.13515733554959297, "num_tokens": 23797738.0, "step": 11000 }, { "entropy": 6.5069136142730715, "epoch": 1.1776446037776231, "grad_norm": 2.0625, "learning_rate": 0.0004871206983689974, "loss": 6.2645, "mean_token_accuracy": 0.1382341854274273, "num_tokens": 23809516.0, "step": 11005 }, { "entropy": 6.545322513580322, "epoch": 1.178179677885387, "grad_norm": 1.75, "learning_rate": 0.000487107945406444, "loss": 6.3351, "mean_token_accuracy": 0.13261336386203765, "num_tokens": 23819850.0, "step": 11010 }, { "entropy": 6.545321655273438, "epoch": 1.1787147519931511, "grad_norm": 1.4453125, "learning_rate": 0.0004870951863193036, "loss": 6.3102, "mean_token_accuracy": 0.13330233544111253, "num_tokens": 23829891.0, "step": 11015 }, { "entropy": 6.491222715377807, "epoch": 1.179249826100915, "grad_norm": 1.3359375, "learning_rate": 0.0004870824211079444, "loss": 6.281, "mean_token_accuracy": 0.13427258878946305, "num_tokens": 23840816.0, "step": 11020 }, { "entropy": 6.571009492874145, "epoch": 1.1797849002086789, "grad_norm": 1.3828125, "learning_rate": 0.00048706964977273515, "loss": 6.3737, "mean_token_accuracy": 0.12626400142908095, "num_tokens": 23852595.0, "step": 11025 }, { "entropy": 6.543050241470337, "epoch": 1.1803199743164428, "grad_norm": 1.5078125, "learning_rate": 0.00048705687231404455, "loss": 6.37, "mean_token_accuracy": 0.12795960977673532, "num_tokens": 23863048.0, "step": 11030 }, { "entropy": 6.558866834640503, "epoch": 1.1808550484242066, "grad_norm": 2.234375, "learning_rate": 0.00048704408873224156, "loss": 6.3253, "mean_token_accuracy": 0.1322480097413063, "num_tokens": 23873499.0, "step": 11035 }, { "entropy": 6.527097129821778, "epoch": 1.1813901225319707, "grad_norm": 3.0, "learning_rate": 0.00048703129902769526, "loss": 6.2707, "mean_token_accuracy": 0.13709414824843408, "num_tokens": 23885129.0, "step": 11040 }, { "entropy": 6.608933782577514, "epoch": 1.1819251966397346, "grad_norm": 1.765625, "learning_rate": 0.0004870185032007751, "loss": 6.3691, "mean_token_accuracy": 0.12893082946538925, "num_tokens": 23895538.0, "step": 11045 }, { "entropy": 6.558342838287354, "epoch": 1.1824602707474985, "grad_norm": 1.8671875, "learning_rate": 0.0004870057012518504, "loss": 6.3903, "mean_token_accuracy": 0.12423129379749298, "num_tokens": 23907341.0, "step": 11050 }, { "entropy": 6.485474681854248, "epoch": 1.1829953448552624, "grad_norm": 1.78125, "learning_rate": 0.00048699289318129087, "loss": 6.2447, "mean_token_accuracy": 0.13878285884857178, "num_tokens": 23918501.0, "step": 11055 }, { "entropy": 6.59085054397583, "epoch": 1.1835304189630265, "grad_norm": 1.6875, "learning_rate": 0.0004869800789894663, "loss": 6.3249, "mean_token_accuracy": 0.13167556896805763, "num_tokens": 23929204.0, "step": 11060 }, { "entropy": 6.554622602462769, "epoch": 1.1840654930707903, "grad_norm": 1.5625, "learning_rate": 0.0004869672586767468, "loss": 6.3536, "mean_token_accuracy": 0.1355223499238491, "num_tokens": 23939855.0, "step": 11065 }, { "entropy": 6.566775178909301, "epoch": 1.1846005671785542, "grad_norm": 1.6484375, "learning_rate": 0.0004869544322435024, "loss": 6.2844, "mean_token_accuracy": 0.1322241321206093, "num_tokens": 23949871.0, "step": 11070 }, { "entropy": 6.572175312042236, "epoch": 1.185135641286318, "grad_norm": 1.6171875, "learning_rate": 0.0004869415996901036, "loss": 6.3977, "mean_token_accuracy": 0.12741668447852134, "num_tokens": 23961650.0, "step": 11075 }, { "entropy": 6.581905651092529, "epoch": 1.1856707153940822, "grad_norm": 1.671875, "learning_rate": 0.0004869287610169209, "loss": 6.4011, "mean_token_accuracy": 0.12726534977555276, "num_tokens": 23973103.0, "step": 11080 }, { "entropy": 6.532610130310059, "epoch": 1.186205789501846, "grad_norm": 1.59375, "learning_rate": 0.000486915916224325, "loss": 6.3323, "mean_token_accuracy": 0.1320612519979477, "num_tokens": 23982972.0, "step": 11085 }, { "entropy": 6.477892637252808, "epoch": 1.18674086360961, "grad_norm": 1.3671875, "learning_rate": 0.0004869030653126868, "loss": 6.2096, "mean_token_accuracy": 0.13647703006863593, "num_tokens": 23993044.0, "step": 11090 }, { "entropy": 6.5596959590911865, "epoch": 1.1872759377173738, "grad_norm": 1.8046875, "learning_rate": 0.0004868902082823774, "loss": 6.28, "mean_token_accuracy": 0.13060884401202202, "num_tokens": 24003871.0, "step": 11095 }, { "entropy": 6.564113616943359, "epoch": 1.1878110118251377, "grad_norm": 1.484375, "learning_rate": 0.0004868773451337679, "loss": 6.3291, "mean_token_accuracy": 0.12881432026624678, "num_tokens": 24014613.0, "step": 11100 }, { "entropy": 6.534707164764404, "epoch": 1.1883460859329018, "grad_norm": 1.6953125, "learning_rate": 0.00048686447586722995, "loss": 6.3303, "mean_token_accuracy": 0.13396827429533004, "num_tokens": 24024172.0, "step": 11105 }, { "entropy": 6.56379804611206, "epoch": 1.1888811600406657, "grad_norm": 1.4765625, "learning_rate": 0.00048685160048313506, "loss": 6.4746, "mean_token_accuracy": 0.12522574216127397, "num_tokens": 24035301.0, "step": 11110 }, { "entropy": 6.6384741306304935, "epoch": 1.1894162341484296, "grad_norm": 1.671875, "learning_rate": 0.00048683871898185486, "loss": 6.3156, "mean_token_accuracy": 0.1386343792080879, "num_tokens": 24045661.0, "step": 11115 }, { "entropy": 6.530051803588867, "epoch": 1.1899513082561934, "grad_norm": 1.5390625, "learning_rate": 0.00048682583136376145, "loss": 6.3107, "mean_token_accuracy": 0.12972315177321433, "num_tokens": 24057027.0, "step": 11120 }, { "entropy": 6.561061763763428, "epoch": 1.1904863823639573, "grad_norm": 1.6875, "learning_rate": 0.0004868129376292269, "loss": 6.4262, "mean_token_accuracy": 0.12427093610167503, "num_tokens": 24068322.0, "step": 11125 }, { "entropy": 6.577089643478393, "epoch": 1.1910214564717214, "grad_norm": 1.8125, "learning_rate": 0.00048680003777862356, "loss": 6.262, "mean_token_accuracy": 0.13514962196350097, "num_tokens": 24078506.0, "step": 11130 }, { "entropy": 6.5337562084198, "epoch": 1.1915565305794853, "grad_norm": 1.546875, "learning_rate": 0.00048678713181232394, "loss": 6.3015, "mean_token_accuracy": 0.13127023577690125, "num_tokens": 24090296.0, "step": 11135 }, { "entropy": 6.478974437713623, "epoch": 1.1920916046872492, "grad_norm": 1.8203125, "learning_rate": 0.00048677421973070063, "loss": 6.3149, "mean_token_accuracy": 0.12612876519560814, "num_tokens": 24101478.0, "step": 11140 }, { "entropy": 6.569290971755981, "epoch": 1.192626678795013, "grad_norm": 1.8515625, "learning_rate": 0.00048676130153412644, "loss": 6.3506, "mean_token_accuracy": 0.13295480459928513, "num_tokens": 24112552.0, "step": 11145 }, { "entropy": 6.528984689712525, "epoch": 1.193161752902777, "grad_norm": 1.4375, "learning_rate": 0.0004867483772229745, "loss": 6.2342, "mean_token_accuracy": 0.13378995954990386, "num_tokens": 24124210.0, "step": 11150 }, { "entropy": 6.576374435424805, "epoch": 1.193696827010541, "grad_norm": 1.625, "learning_rate": 0.0004867354467976178, "loss": 6.3129, "mean_token_accuracy": 0.1304231107234955, "num_tokens": 24133525.0, "step": 11155 }, { "entropy": 6.539589309692383, "epoch": 1.194231901118305, "grad_norm": 2.765625, "learning_rate": 0.00048672251025842994, "loss": 6.3677, "mean_token_accuracy": 0.1295190930366516, "num_tokens": 24145400.0, "step": 11160 }, { "entropy": 6.521314668655395, "epoch": 1.1947669752260688, "grad_norm": 1.6484375, "learning_rate": 0.0004867095676057843, "loss": 6.3647, "mean_token_accuracy": 0.12734123542904854, "num_tokens": 24155596.0, "step": 11165 }, { "entropy": 6.597847414016724, "epoch": 1.1953020493338327, "grad_norm": 1.5625, "learning_rate": 0.00048669661884005467, "loss": 6.3607, "mean_token_accuracy": 0.12178555279970169, "num_tokens": 24166683.0, "step": 11170 }, { "entropy": 6.577947998046875, "epoch": 1.1958371234415965, "grad_norm": 1.765625, "learning_rate": 0.00048668366396161503, "loss": 6.3108, "mean_token_accuracy": 0.13432841673493384, "num_tokens": 24177649.0, "step": 11175 }, { "entropy": 6.522364282608033, "epoch": 1.1963721975493606, "grad_norm": 1.859375, "learning_rate": 0.0004866707029708392, "loss": 6.3413, "mean_token_accuracy": 0.137134151160717, "num_tokens": 24188522.0, "step": 11180 }, { "entropy": 6.529253196716309, "epoch": 1.1969072716571245, "grad_norm": 1.3515625, "learning_rate": 0.0004866577358681015, "loss": 6.3037, "mean_token_accuracy": 0.12979593575000764, "num_tokens": 24199285.0, "step": 11185 }, { "entropy": 6.514498519897461, "epoch": 1.1974423457648884, "grad_norm": 1.5859375, "learning_rate": 0.0004866447626537765, "loss": 6.2671, "mean_token_accuracy": 0.12873406931757927, "num_tokens": 24210929.0, "step": 11190 }, { "entropy": 6.5354969024658205, "epoch": 1.1979774198726523, "grad_norm": 3.5, "learning_rate": 0.0004866317833282387, "loss": 6.3273, "mean_token_accuracy": 0.13138288259506226, "num_tokens": 24221394.0, "step": 11195 }, { "entropy": 6.541649389266968, "epoch": 1.1985124939804164, "grad_norm": 1.6796875, "learning_rate": 0.00048661879789186295, "loss": 6.2726, "mean_token_accuracy": 0.13947225138545036, "num_tokens": 24230297.0, "step": 11200 }, { "entropy": 6.477359199523926, "epoch": 1.1990475680881802, "grad_norm": 2.171875, "learning_rate": 0.00048660580634502415, "loss": 6.4373, "mean_token_accuracy": 0.1276162840425968, "num_tokens": 24241505.0, "step": 11205 }, { "entropy": 6.58246431350708, "epoch": 1.1995826421959441, "grad_norm": 1.46875, "learning_rate": 0.00048659280868809744, "loss": 6.2864, "mean_token_accuracy": 0.13593244180083275, "num_tokens": 24252638.0, "step": 11210 }, { "entropy": 6.544987678527832, "epoch": 1.200117716303708, "grad_norm": 1.7890625, "learning_rate": 0.000486579804921458, "loss": 6.3322, "mean_token_accuracy": 0.13251487016677857, "num_tokens": 24263156.0, "step": 11215 }, { "entropy": 6.491865015029907, "epoch": 1.200652790411472, "grad_norm": 1.9140625, "learning_rate": 0.00048656679504548145, "loss": 6.2094, "mean_token_accuracy": 0.14105861783027648, "num_tokens": 24274384.0, "step": 11220 }, { "entropy": 6.590060424804688, "epoch": 1.201187864519236, "grad_norm": 1.6953125, "learning_rate": 0.0004865537790605435, "loss": 6.4135, "mean_token_accuracy": 0.1250110797584057, "num_tokens": 24285159.0, "step": 11225 }, { "entropy": 6.5946595668792725, "epoch": 1.2017229386269999, "grad_norm": 2.0, "learning_rate": 0.0004865407569670198, "loss": 6.3782, "mean_token_accuracy": 0.12558842301368714, "num_tokens": 24296202.0, "step": 11230 }, { "entropy": 6.573181533813477, "epoch": 1.2022580127347637, "grad_norm": 1.3203125, "learning_rate": 0.0004865277287652866, "loss": 6.3131, "mean_token_accuracy": 0.13199632614850998, "num_tokens": 24306691.0, "step": 11235 }, { "entropy": 6.529475450515747, "epoch": 1.2027930868425276, "grad_norm": 2.59375, "learning_rate": 0.0004865146944557199, "loss": 6.3309, "mean_token_accuracy": 0.13316164761781693, "num_tokens": 24317499.0, "step": 11240 }, { "entropy": 6.524376726150512, "epoch": 1.2033281609502917, "grad_norm": 1.5078125, "learning_rate": 0.0004865016540386961, "loss": 6.3271, "mean_token_accuracy": 0.12565939500927925, "num_tokens": 24328096.0, "step": 11245 }, { "entropy": 6.5775762557983395, "epoch": 1.2038632350580556, "grad_norm": 1.578125, "learning_rate": 0.00048648860751459173, "loss": 6.3148, "mean_token_accuracy": 0.12669195979833603, "num_tokens": 24338188.0, "step": 11250 }, { "entropy": 6.611456346511841, "epoch": 1.2043983091658195, "grad_norm": 1.6015625, "learning_rate": 0.00048647555488378355, "loss": 6.3508, "mean_token_accuracy": 0.1369207866489887, "num_tokens": 24348578.0, "step": 11255 }, { "entropy": 6.4663220882415775, "epoch": 1.2049333832735833, "grad_norm": 1.3984375, "learning_rate": 0.0004864624961466485, "loss": 6.316, "mean_token_accuracy": 0.13434598073363305, "num_tokens": 24358807.0, "step": 11260 }, { "entropy": 6.532084560394287, "epoch": 1.2054684573813472, "grad_norm": 1.953125, "learning_rate": 0.0004864494313035635, "loss": 6.3274, "mean_token_accuracy": 0.12798592671751977, "num_tokens": 24369074.0, "step": 11265 }, { "entropy": 6.560862922668457, "epoch": 1.2060035314891113, "grad_norm": 2.359375, "learning_rate": 0.000486436360354906, "loss": 6.2862, "mean_token_accuracy": 0.13494868949055672, "num_tokens": 24380655.0, "step": 11270 }, { "entropy": 6.523475408554077, "epoch": 1.2065386055968752, "grad_norm": 1.59375, "learning_rate": 0.00048642328330105323, "loss": 6.298, "mean_token_accuracy": 0.1289362497627735, "num_tokens": 24391701.0, "step": 11275 }, { "entropy": 6.4451531887054445, "epoch": 1.207073679704639, "grad_norm": 2.640625, "learning_rate": 0.00048641020014238286, "loss": 6.3675, "mean_token_accuracy": 0.1261564612388611, "num_tokens": 24403690.0, "step": 11280 }, { "entropy": 6.575537538528442, "epoch": 1.207608753812403, "grad_norm": 1.8125, "learning_rate": 0.0004863971108792727, "loss": 6.3536, "mean_token_accuracy": 0.13011251464486123, "num_tokens": 24414670.0, "step": 11285 }, { "entropy": 6.56957893371582, "epoch": 1.2081438279201668, "grad_norm": 1.625, "learning_rate": 0.00048638401551210063, "loss": 6.392, "mean_token_accuracy": 0.12319833263754845, "num_tokens": 24425237.0, "step": 11290 }, { "entropy": 6.624338102340698, "epoch": 1.208678902027931, "grad_norm": 1.6015625, "learning_rate": 0.00048637091404124484, "loss": 6.3556, "mean_token_accuracy": 0.12925269529223443, "num_tokens": 24437142.0, "step": 11295 }, { "entropy": 6.535131216049194, "epoch": 1.2092139761356948, "grad_norm": 1.5390625, "learning_rate": 0.0004863578064670837, "loss": 6.2612, "mean_token_accuracy": 0.13685486912727357, "num_tokens": 24448819.0, "step": 11300 }, { "entropy": 6.461548089981079, "epoch": 1.2097490502434587, "grad_norm": 1.7890625, "learning_rate": 0.00048634469278999545, "loss": 6.2061, "mean_token_accuracy": 0.13641059249639512, "num_tokens": 24459392.0, "step": 11305 }, { "entropy": 6.54414005279541, "epoch": 1.2102841243512226, "grad_norm": 1.609375, "learning_rate": 0.00048633157301035895, "loss": 6.3116, "mean_token_accuracy": 0.13257984444499016, "num_tokens": 24470298.0, "step": 11310 }, { "entropy": 6.531377696990967, "epoch": 1.2108191984589864, "grad_norm": 1.484375, "learning_rate": 0.000486318447128553, "loss": 6.2782, "mean_token_accuracy": 0.13613951429724694, "num_tokens": 24480477.0, "step": 11315 }, { "entropy": 6.52601203918457, "epoch": 1.2113542725667505, "grad_norm": 1.5078125, "learning_rate": 0.0004863053151449566, "loss": 6.3621, "mean_token_accuracy": 0.12074363008141517, "num_tokens": 24491890.0, "step": 11320 }, { "entropy": 6.586244249343872, "epoch": 1.2118893466745144, "grad_norm": 1.5546875, "learning_rate": 0.00048629217705994883, "loss": 6.3083, "mean_token_accuracy": 0.13098841160535812, "num_tokens": 24502583.0, "step": 11325 }, { "entropy": 6.6022148609161375, "epoch": 1.2124244207822783, "grad_norm": 1.7265625, "learning_rate": 0.0004862790328739091, "loss": 6.4024, "mean_token_accuracy": 0.12709670886397362, "num_tokens": 24514491.0, "step": 11330 }, { "entropy": 6.534934377670288, "epoch": 1.2129594948900422, "grad_norm": 1.6796875, "learning_rate": 0.00048626588258721717, "loss": 6.2358, "mean_token_accuracy": 0.1416369266808033, "num_tokens": 24524788.0, "step": 11335 }, { "entropy": 6.484699773788452, "epoch": 1.2134945689978063, "grad_norm": 2.09375, "learning_rate": 0.0004862527262002524, "loss": 6.2805, "mean_token_accuracy": 0.1266206443309784, "num_tokens": 24535699.0, "step": 11340 }, { "entropy": 6.476378440856934, "epoch": 1.2140296431055702, "grad_norm": 1.4609375, "learning_rate": 0.00048623956371339494, "loss": 6.2961, "mean_token_accuracy": 0.13135870769619942, "num_tokens": 24547339.0, "step": 11345 }, { "entropy": 6.561729049682617, "epoch": 1.214564717213334, "grad_norm": 1.8984375, "learning_rate": 0.00048622639512702477, "loss": 6.4041, "mean_token_accuracy": 0.12762944996356965, "num_tokens": 24558778.0, "step": 11350 }, { "entropy": 6.593435049057007, "epoch": 1.215099791321098, "grad_norm": 1.4375, "learning_rate": 0.00048621322044152207, "loss": 6.315, "mean_token_accuracy": 0.13191851750016212, "num_tokens": 24569032.0, "step": 11355 }, { "entropy": 6.583175373077393, "epoch": 1.215634865428862, "grad_norm": 1.6328125, "learning_rate": 0.00048620003965726727, "loss": 6.3928, "mean_token_accuracy": 0.11859198734164238, "num_tokens": 24581356.0, "step": 11360 }, { "entropy": 6.534153842926026, "epoch": 1.2161699395366259, "grad_norm": 1.6171875, "learning_rate": 0.00048618685277464116, "loss": 6.2689, "mean_token_accuracy": 0.13176984637975692, "num_tokens": 24591809.0, "step": 11365 }, { "entropy": 6.411161661148071, "epoch": 1.2167050136443898, "grad_norm": 2.390625, "learning_rate": 0.00048617365979402417, "loss": 6.2104, "mean_token_accuracy": 0.13641507998108865, "num_tokens": 24603492.0, "step": 11370 }, { "entropy": 6.517438983917236, "epoch": 1.2172400877521536, "grad_norm": 1.7109375, "learning_rate": 0.0004861604607157975, "loss": 6.3692, "mean_token_accuracy": 0.1288558103144169, "num_tokens": 24614837.0, "step": 11375 }, { "entropy": 6.6012519836425785, "epoch": 1.2177751618599175, "grad_norm": 1.5390625, "learning_rate": 0.0004861472555403423, "loss": 6.3529, "mean_token_accuracy": 0.13232268989086152, "num_tokens": 24624714.0, "step": 11380 }, { "entropy": 6.557205009460449, "epoch": 1.2183102359676816, "grad_norm": 1.7109375, "learning_rate": 0.00048613404426803964, "loss": 6.4042, "mean_token_accuracy": 0.12305559441447259, "num_tokens": 24635758.0, "step": 11385 }, { "entropy": 6.575355005264282, "epoch": 1.2188453100754455, "grad_norm": 2.453125, "learning_rate": 0.00048612082689927116, "loss": 6.3542, "mean_token_accuracy": 0.13127371445298194, "num_tokens": 24645362.0, "step": 11390 }, { "entropy": 6.561426973342895, "epoch": 1.2193803841832094, "grad_norm": 1.6640625, "learning_rate": 0.0004861076034344185, "loss": 6.3679, "mean_token_accuracy": 0.12842421904206275, "num_tokens": 24656898.0, "step": 11395 }, { "entropy": 6.53923807144165, "epoch": 1.2199154582909733, "grad_norm": 1.6171875, "learning_rate": 0.0004860943738738634, "loss": 6.3062, "mean_token_accuracy": 0.13347529992461205, "num_tokens": 24668191.0, "step": 11400 }, { "entropy": 6.624059057235717, "epoch": 1.2204505323987371, "grad_norm": 2.4375, "learning_rate": 0.00048608113821798786, "loss": 6.3169, "mean_token_accuracy": 0.13543845787644387, "num_tokens": 24678034.0, "step": 11405 }, { "entropy": 6.529640436172485, "epoch": 1.2209856065065012, "grad_norm": 1.4921875, "learning_rate": 0.0004860678964671743, "loss": 6.3722, "mean_token_accuracy": 0.1315036676824093, "num_tokens": 24689062.0, "step": 11410 }, { "entropy": 6.508565950393677, "epoch": 1.221520680614265, "grad_norm": 1.640625, "learning_rate": 0.00048605464862180474, "loss": 6.3402, "mean_token_accuracy": 0.1287380076944828, "num_tokens": 24699787.0, "step": 11415 }, { "entropy": 6.607008266448974, "epoch": 1.222055754722029, "grad_norm": 1.578125, "learning_rate": 0.0004860413946822619, "loss": 6.2744, "mean_token_accuracy": 0.13421041816473006, "num_tokens": 24711233.0, "step": 11420 }, { "entropy": 6.556663608551025, "epoch": 1.2225908288297929, "grad_norm": 1.609375, "learning_rate": 0.0004860281346489284, "loss": 6.3119, "mean_token_accuracy": 0.12159497067332267, "num_tokens": 24722414.0, "step": 11425 }, { "entropy": 6.543051385879517, "epoch": 1.2231259029375567, "grad_norm": 1.6171875, "learning_rate": 0.0004860148685221873, "loss": 6.3464, "mean_token_accuracy": 0.12858733609318734, "num_tokens": 24733093.0, "step": 11430 }, { "entropy": 6.498806571960449, "epoch": 1.2236609770453208, "grad_norm": 2.453125, "learning_rate": 0.00048600159630242135, "loss": 6.292, "mean_token_accuracy": 0.1355809085071087, "num_tokens": 24743195.0, "step": 11435 }, { "entropy": 6.597199249267578, "epoch": 1.2241960511530847, "grad_norm": 1.5078125, "learning_rate": 0.00048598831799001406, "loss": 6.3037, "mean_token_accuracy": 0.13153010681271554, "num_tokens": 24753680.0, "step": 11440 }, { "entropy": 6.554786682128906, "epoch": 1.2247311252608486, "grad_norm": 1.4296875, "learning_rate": 0.0004859750335853488, "loss": 6.281, "mean_token_accuracy": 0.13536786139011384, "num_tokens": 24764135.0, "step": 11445 }, { "entropy": 6.403936672210693, "epoch": 1.2252661993686125, "grad_norm": 1.640625, "learning_rate": 0.000485961743088809, "loss": 6.2461, "mean_token_accuracy": 0.14579313546419143, "num_tokens": 24775740.0, "step": 11450 }, { "entropy": 6.5270256996154785, "epoch": 1.2258012734763766, "grad_norm": 1.4921875, "learning_rate": 0.0004859484465007784, "loss": 6.3673, "mean_token_accuracy": 0.12632556781172752, "num_tokens": 24786169.0, "step": 11455 }, { "entropy": 6.585242223739624, "epoch": 1.2263363475841405, "grad_norm": 1.90625, "learning_rate": 0.00048593514382164123, "loss": 6.2608, "mean_token_accuracy": 0.1336404174566269, "num_tokens": 24796218.0, "step": 11460 }, { "entropy": 6.583890581130982, "epoch": 1.2268714216919043, "grad_norm": 1.546875, "learning_rate": 0.0004859218350517814, "loss": 6.3979, "mean_token_accuracy": 0.12642351686954498, "num_tokens": 24806957.0, "step": 11465 }, { "entropy": 6.583371877670288, "epoch": 1.2274064957996682, "grad_norm": 1.6015625, "learning_rate": 0.0004859085201915831, "loss": 6.3354, "mean_token_accuracy": 0.13102125078439714, "num_tokens": 24818761.0, "step": 11470 }, { "entropy": 6.531420612335205, "epoch": 1.227941569907432, "grad_norm": 1.4609375, "learning_rate": 0.0004858951992414311, "loss": 6.2512, "mean_token_accuracy": 0.14173662960529326, "num_tokens": 24829163.0, "step": 11475 }, { "entropy": 6.497774124145508, "epoch": 1.2284766440151962, "grad_norm": 1.5859375, "learning_rate": 0.0004858818722017097, "loss": 6.2629, "mean_token_accuracy": 0.13168734014034272, "num_tokens": 24839334.0, "step": 11480 }, { "entropy": 6.438531589508057, "epoch": 1.22901171812296, "grad_norm": 2.71875, "learning_rate": 0.00048586853907280395, "loss": 6.2939, "mean_token_accuracy": 0.13705965429544448, "num_tokens": 24850312.0, "step": 11485 }, { "entropy": 6.46503438949585, "epoch": 1.229546792230724, "grad_norm": 1.5703125, "learning_rate": 0.0004858551998550987, "loss": 6.2499, "mean_token_accuracy": 0.13945921510457993, "num_tokens": 24861835.0, "step": 11490 }, { "entropy": 6.5869134902954105, "epoch": 1.2300818663384878, "grad_norm": 1.6640625, "learning_rate": 0.00048584185454897925, "loss": 6.3371, "mean_token_accuracy": 0.13292859718203545, "num_tokens": 24872489.0, "step": 11495 }, { "entropy": 6.543988800048828, "epoch": 1.230616940446252, "grad_norm": 1.5859375, "learning_rate": 0.0004858285031548309, "loss": 6.3299, "mean_token_accuracy": 0.1338948406279087, "num_tokens": 24882553.0, "step": 11500 }, { "entropy": 6.562069129943848, "epoch": 1.2311520145540158, "grad_norm": 2.015625, "learning_rate": 0.0004858151456730391, "loss": 6.3451, "mean_token_accuracy": 0.13700807690620423, "num_tokens": 24894386.0, "step": 11505 }, { "entropy": 6.503233861923218, "epoch": 1.2316870886617797, "grad_norm": 1.390625, "learning_rate": 0.00048580178210398954, "loss": 6.3286, "mean_token_accuracy": 0.1292463280260563, "num_tokens": 24905049.0, "step": 11510 }, { "entropy": 6.498210716247558, "epoch": 1.2322221627695435, "grad_norm": 1.9921875, "learning_rate": 0.00048578841244806823, "loss": 6.2857, "mean_token_accuracy": 0.13507410660386085, "num_tokens": 24914831.0, "step": 11515 }, { "entropy": 6.542500925064087, "epoch": 1.2327572368773074, "grad_norm": 1.5234375, "learning_rate": 0.00048577503670566116, "loss": 6.3522, "mean_token_accuracy": 0.1338055945932865, "num_tokens": 24925668.0, "step": 11520 }, { "entropy": 6.526769018173217, "epoch": 1.2332923109850715, "grad_norm": 2.03125, "learning_rate": 0.00048576165487715443, "loss": 6.3151, "mean_token_accuracy": 0.12994013503193855, "num_tokens": 24935983.0, "step": 11525 }, { "entropy": 6.503340578079223, "epoch": 1.2338273850928354, "grad_norm": 1.828125, "learning_rate": 0.00048574826696293455, "loss": 6.286, "mean_token_accuracy": 0.13225105702877044, "num_tokens": 24946673.0, "step": 11530 }, { "entropy": 6.51578311920166, "epoch": 1.2343624592005993, "grad_norm": 1.625, "learning_rate": 0.00048573487296338814, "loss": 6.2233, "mean_token_accuracy": 0.1413614720106125, "num_tokens": 24957075.0, "step": 11535 }, { "entropy": 6.567255687713623, "epoch": 1.2348975333083632, "grad_norm": 1.8203125, "learning_rate": 0.00048572147287890183, "loss": 6.3765, "mean_token_accuracy": 0.12877800017595292, "num_tokens": 24967261.0, "step": 11540 }, { "entropy": 6.520781135559082, "epoch": 1.235432607416127, "grad_norm": 1.9921875, "learning_rate": 0.00048570806670986263, "loss": 6.3025, "mean_token_accuracy": 0.13159753754734993, "num_tokens": 24978097.0, "step": 11545 }, { "entropy": 6.535343837738037, "epoch": 1.2359676815238911, "grad_norm": 3.15625, "learning_rate": 0.00048569465445665754, "loss": 6.3216, "mean_token_accuracy": 0.13654093891382219, "num_tokens": 24987932.0, "step": 11550 }, { "entropy": 6.523883533477783, "epoch": 1.236502755631655, "grad_norm": 1.4921875, "learning_rate": 0.00048568123611967396, "loss": 6.3169, "mean_token_accuracy": 0.1302984580397606, "num_tokens": 24998919.0, "step": 11555 }, { "entropy": 6.539691972732544, "epoch": 1.237037829739419, "grad_norm": 1.46875, "learning_rate": 0.0004856678116992993, "loss": 6.2757, "mean_token_accuracy": 0.13371165171265603, "num_tokens": 25010545.0, "step": 11560 }, { "entropy": 6.553024625778198, "epoch": 1.2375729038471828, "grad_norm": 1.6640625, "learning_rate": 0.0004856543811959212, "loss": 6.2565, "mean_token_accuracy": 0.1440042093396187, "num_tokens": 25021133.0, "step": 11565 }, { "entropy": 6.498435544967651, "epoch": 1.2381079779549466, "grad_norm": 1.71875, "learning_rate": 0.0004856409446099274, "loss": 6.2983, "mean_token_accuracy": 0.1292448416352272, "num_tokens": 25031838.0, "step": 11570 }, { "entropy": 6.48333420753479, "epoch": 1.2386430520627107, "grad_norm": 1.2578125, "learning_rate": 0.00048562750194170595, "loss": 6.3169, "mean_token_accuracy": 0.1293560743331909, "num_tokens": 25042737.0, "step": 11575 }, { "entropy": 6.554791212081909, "epoch": 1.2391781261704746, "grad_norm": 1.78125, "learning_rate": 0.000485614053191645, "loss": 6.4063, "mean_token_accuracy": 0.13055189922451974, "num_tokens": 25054442.0, "step": 11580 }, { "entropy": 6.489489889144897, "epoch": 1.2397132002782385, "grad_norm": 1.4375, "learning_rate": 0.0004856005983601328, "loss": 6.1367, "mean_token_accuracy": 0.1456099934875965, "num_tokens": 25065509.0, "step": 11585 }, { "entropy": 6.5698034286499025, "epoch": 1.2402482743860024, "grad_norm": 1.765625, "learning_rate": 0.00048558713744755794, "loss": 6.3897, "mean_token_accuracy": 0.12442174926400185, "num_tokens": 25077306.0, "step": 11590 }, { "entropy": 6.521883249282837, "epoch": 1.2407833484937665, "grad_norm": 1.859375, "learning_rate": 0.0004855736704543091, "loss": 6.3081, "mean_token_accuracy": 0.13450614660978316, "num_tokens": 25088230.0, "step": 11595 }, { "entropy": 6.6110950946807865, "epoch": 1.2413184226015304, "grad_norm": 1.5546875, "learning_rate": 0.0004855601973807751, "loss": 6.4096, "mean_token_accuracy": 0.12289422452449798, "num_tokens": 25099658.0, "step": 11600 }, { "entropy": 6.573994112014771, "epoch": 1.2418534967092942, "grad_norm": 1.46875, "learning_rate": 0.00048554671822734495, "loss": 6.3072, "mean_token_accuracy": 0.13023086190223693, "num_tokens": 25110512.0, "step": 11605 }, { "entropy": 6.5347192764282225, "epoch": 1.2423885708170581, "grad_norm": 1.953125, "learning_rate": 0.00048553323299440807, "loss": 6.3089, "mean_token_accuracy": 0.13401264771819116, "num_tokens": 25120193.0, "step": 11610 }, { "entropy": 6.528376770019531, "epoch": 1.242923644924822, "grad_norm": 1.6328125, "learning_rate": 0.00048551974168235346, "loss": 6.321, "mean_token_accuracy": 0.12739662155508996, "num_tokens": 25131752.0, "step": 11615 }, { "entropy": 6.599687719345093, "epoch": 1.243458719032586, "grad_norm": 1.5703125, "learning_rate": 0.000485506244291571, "loss": 6.3224, "mean_token_accuracy": 0.13200697377324105, "num_tokens": 25141541.0, "step": 11620 }, { "entropy": 6.466404867172241, "epoch": 1.24399379314035, "grad_norm": 1.703125, "learning_rate": 0.0004854927408224503, "loss": 6.3133, "mean_token_accuracy": 0.1312132328748703, "num_tokens": 25152219.0, "step": 11625 }, { "entropy": 6.591228199005127, "epoch": 1.2445288672481138, "grad_norm": 1.3671875, "learning_rate": 0.00048547923127538126, "loss": 6.335, "mean_token_accuracy": 0.12918494567275046, "num_tokens": 25163030.0, "step": 11630 }, { "entropy": 6.499180746078491, "epoch": 1.2450639413558777, "grad_norm": 1.6171875, "learning_rate": 0.00048546571565075396, "loss": 6.2216, "mean_token_accuracy": 0.13481747061014177, "num_tokens": 25174637.0, "step": 11635 }, { "entropy": 6.426168441772461, "epoch": 1.2455990154636418, "grad_norm": 1.5390625, "learning_rate": 0.0004854521939489587, "loss": 6.2036, "mean_token_accuracy": 0.14389699101448059, "num_tokens": 25185067.0, "step": 11640 }, { "entropy": 6.467606449127198, "epoch": 1.2461340895714057, "grad_norm": 1.3359375, "learning_rate": 0.00048543866617038604, "loss": 6.2433, "mean_token_accuracy": 0.13719036281108857, "num_tokens": 25195046.0, "step": 11645 }, { "entropy": 6.517219161987304, "epoch": 1.2466691636791696, "grad_norm": 1.4453125, "learning_rate": 0.00048542513231542635, "loss": 6.3435, "mean_token_accuracy": 0.12623920813202857, "num_tokens": 25206265.0, "step": 11650 }, { "entropy": 6.581112813949585, "epoch": 1.2472042377869335, "grad_norm": 1.3515625, "learning_rate": 0.0004854115923844705, "loss": 6.3332, "mean_token_accuracy": 0.1283203311264515, "num_tokens": 25217690.0, "step": 11655 }, { "entropy": 6.549913930892944, "epoch": 1.2477393118946973, "grad_norm": 1.6953125, "learning_rate": 0.0004853980463779096, "loss": 6.3369, "mean_token_accuracy": 0.12955136895179747, "num_tokens": 25228229.0, "step": 11660 }, { "entropy": 6.473557043075561, "epoch": 1.2482743860024614, "grad_norm": 1.8046875, "learning_rate": 0.0004853844942961346, "loss": 6.2698, "mean_token_accuracy": 0.13080960735678673, "num_tokens": 25240073.0, "step": 11665 }, { "entropy": 6.530133438110352, "epoch": 1.2488094601102253, "grad_norm": 1.3671875, "learning_rate": 0.000485370936139537, "loss": 6.3283, "mean_token_accuracy": 0.1356102332472801, "num_tokens": 25251915.0, "step": 11670 }, { "entropy": 6.512946271896363, "epoch": 1.2493445342179892, "grad_norm": 1.4375, "learning_rate": 0.000485357371908508, "loss": 6.2963, "mean_token_accuracy": 0.1290469728410244, "num_tokens": 25262932.0, "step": 11675 }, { "entropy": 6.533622694015503, "epoch": 1.249879608325753, "grad_norm": 1.703125, "learning_rate": 0.0004853438016034396, "loss": 6.3622, "mean_token_accuracy": 0.12990323528647424, "num_tokens": 25274693.0, "step": 11680 }, { "entropy": 6.59214186668396, "epoch": 1.250414682433517, "grad_norm": 1.3828125, "learning_rate": 0.00048533022522472344, "loss": 6.2521, "mean_token_accuracy": 0.13764603063464165, "num_tokens": 25285359.0, "step": 11685 }, { "entropy": 6.497456979751587, "epoch": 1.250949756541281, "grad_norm": 1.703125, "learning_rate": 0.00048531664277275154, "loss": 6.284, "mean_token_accuracy": 0.12981810346245765, "num_tokens": 25296730.0, "step": 11690 }, { "entropy": 6.502764129638672, "epoch": 1.251484830649045, "grad_norm": 1.8984375, "learning_rate": 0.0004853030542479162, "loss": 6.3198, "mean_token_accuracy": 0.1384017750620842, "num_tokens": 25306422.0, "step": 11695 }, { "entropy": 6.5642656803131105, "epoch": 1.2520199047568088, "grad_norm": 1.9140625, "learning_rate": 0.0004852894596506096, "loss": 6.3438, "mean_token_accuracy": 0.1314690053462982, "num_tokens": 25317980.0, "step": 11700 }, { "entropy": 6.534403991699219, "epoch": 1.2525549788645727, "grad_norm": 1.921875, "learning_rate": 0.0004852758589812245, "loss": 6.3699, "mean_token_accuracy": 0.13768871873617172, "num_tokens": 25329905.0, "step": 11705 }, { "entropy": 6.602970790863037, "epoch": 1.2530900529723366, "grad_norm": 1.59375, "learning_rate": 0.00048526225224015355, "loss": 6.3306, "mean_token_accuracy": 0.12489748820662498, "num_tokens": 25340759.0, "step": 11710 }, { "entropy": 6.553256988525391, "epoch": 1.2536251270801007, "grad_norm": 1.5703125, "learning_rate": 0.0004852486394277896, "loss": 6.3526, "mean_token_accuracy": 0.12719984650611876, "num_tokens": 25351124.0, "step": 11715 }, { "entropy": 6.591535377502441, "epoch": 1.2541602011878645, "grad_norm": 2.0, "learning_rate": 0.00048523502054452565, "loss": 6.2829, "mean_token_accuracy": 0.1319223664700985, "num_tokens": 25361337.0, "step": 11720 }, { "entropy": 6.585754776000977, "epoch": 1.2546952752956284, "grad_norm": 1.7109375, "learning_rate": 0.00048522139559075507, "loss": 6.3222, "mean_token_accuracy": 0.13189950287342073, "num_tokens": 25371893.0, "step": 11725 }, { "entropy": 6.456956672668457, "epoch": 1.2552303494033923, "grad_norm": 1.6328125, "learning_rate": 0.0004852077645668712, "loss": 6.206, "mean_token_accuracy": 0.14131250604987144, "num_tokens": 25383365.0, "step": 11730 }, { "entropy": 6.5274192810058596, "epoch": 1.2557654235111562, "grad_norm": 1.7109375, "learning_rate": 0.0004851941274732678, "loss": 6.3123, "mean_token_accuracy": 0.13500531166791915, "num_tokens": 25393211.0, "step": 11735 }, { "entropy": 6.4369782447814945, "epoch": 1.2563004976189203, "grad_norm": 1.4609375, "learning_rate": 0.0004851804843103384, "loss": 6.1746, "mean_token_accuracy": 0.13275761157274246, "num_tokens": 25404828.0, "step": 11740 }, { "entropy": 6.571536111831665, "epoch": 1.2568355717266841, "grad_norm": 1.71875, "learning_rate": 0.00048516683507847705, "loss": 6.3314, "mean_token_accuracy": 0.13917914777994156, "num_tokens": 25416016.0, "step": 11745 }, { "entropy": 6.576375675201416, "epoch": 1.257370645834448, "grad_norm": 1.6171875, "learning_rate": 0.0004851531797780779, "loss": 6.2882, "mean_token_accuracy": 0.13366828113794327, "num_tokens": 25426173.0, "step": 11750 }, { "entropy": 6.525392293930054, "epoch": 1.2579057199422121, "grad_norm": 1.6953125, "learning_rate": 0.0004851395184095352, "loss": 6.246, "mean_token_accuracy": 0.138031068444252, "num_tokens": 25437507.0, "step": 11755 }, { "entropy": 6.542758798599243, "epoch": 1.258440794049976, "grad_norm": 1.609375, "learning_rate": 0.0004851258509732434, "loss": 6.3298, "mean_token_accuracy": 0.1226758360862732, "num_tokens": 25448201.0, "step": 11760 }, { "entropy": 6.596157741546631, "epoch": 1.2589758681577399, "grad_norm": 3.265625, "learning_rate": 0.00048511217746959723, "loss": 6.3493, "mean_token_accuracy": 0.13061847537755966, "num_tokens": 25458640.0, "step": 11765 }, { "entropy": 6.558047437667847, "epoch": 1.2595109422655038, "grad_norm": 1.4609375, "learning_rate": 0.00048509849789899146, "loss": 6.3383, "mean_token_accuracy": 0.137232506275177, "num_tokens": 25469474.0, "step": 11770 }, { "entropy": 6.561356449127198, "epoch": 1.2600460163732676, "grad_norm": 1.484375, "learning_rate": 0.000485084812261821, "loss": 6.4076, "mean_token_accuracy": 0.12736963108181953, "num_tokens": 25479565.0, "step": 11775 }, { "entropy": 6.5499156475067135, "epoch": 1.2605810904810317, "grad_norm": 1.46875, "learning_rate": 0.0004850711205584812, "loss": 6.2692, "mean_token_accuracy": 0.1392711654305458, "num_tokens": 25490142.0, "step": 11780 }, { "entropy": 6.516708469390869, "epoch": 1.2611161645887956, "grad_norm": 1.5703125, "learning_rate": 0.00048505742278936726, "loss": 6.3754, "mean_token_accuracy": 0.13398413434624673, "num_tokens": 25500824.0, "step": 11785 }, { "entropy": 6.591862440109253, "epoch": 1.2616512386965595, "grad_norm": 1.5390625, "learning_rate": 0.00048504371895487474, "loss": 6.3129, "mean_token_accuracy": 0.13289703279733658, "num_tokens": 25511251.0, "step": 11790 }, { "entropy": 6.547235202789307, "epoch": 1.2621863128043234, "grad_norm": 1.84375, "learning_rate": 0.00048503000905539945, "loss": 6.2989, "mean_token_accuracy": 0.12680892273783684, "num_tokens": 25521368.0, "step": 11795 }, { "entropy": 6.541527271270752, "epoch": 1.2627213869120872, "grad_norm": 1.4453125, "learning_rate": 0.00048501629309133707, "loss": 6.3076, "mean_token_accuracy": 0.12748572900891303, "num_tokens": 25532486.0, "step": 11800 }, { "entropy": 6.5395254611969, "epoch": 1.2632564610198513, "grad_norm": 1.484375, "learning_rate": 0.0004850025710630838, "loss": 6.3163, "mean_token_accuracy": 0.13559018895030023, "num_tokens": 25542867.0, "step": 11805 }, { "entropy": 6.500273132324219, "epoch": 1.2637915351276152, "grad_norm": 1.671875, "learning_rate": 0.00048498884297103575, "loss": 6.2761, "mean_token_accuracy": 0.1332220569252968, "num_tokens": 25553564.0, "step": 11810 }, { "entropy": 6.533845472335815, "epoch": 1.264326609235379, "grad_norm": 1.3125, "learning_rate": 0.0004849751088155894, "loss": 6.2803, "mean_token_accuracy": 0.13092882707715034, "num_tokens": 25564017.0, "step": 11815 }, { "entropy": 6.506636095046997, "epoch": 1.264861683343143, "grad_norm": 1.2265625, "learning_rate": 0.0004849613685971413, "loss": 6.2117, "mean_token_accuracy": 0.13756049647927285, "num_tokens": 25575125.0, "step": 11820 }, { "entropy": 6.572484350204467, "epoch": 1.2653967574509069, "grad_norm": 2.78125, "learning_rate": 0.0004849476223160882, "loss": 6.3677, "mean_token_accuracy": 0.12898685410618782, "num_tokens": 25586405.0, "step": 11825 }, { "entropy": 6.514791965484619, "epoch": 1.265931831558671, "grad_norm": 1.6875, "learning_rate": 0.0004849338699728269, "loss": 6.3329, "mean_token_accuracy": 0.12814901471138002, "num_tokens": 25597494.0, "step": 11830 }, { "entropy": 6.529297876358032, "epoch": 1.2664669056664348, "grad_norm": 1.6484375, "learning_rate": 0.00048492011156775467, "loss": 6.2773, "mean_token_accuracy": 0.13860967606306077, "num_tokens": 25608425.0, "step": 11835 }, { "entropy": 6.5342460632324215, "epoch": 1.2670019797741987, "grad_norm": 1.78125, "learning_rate": 0.0004849063471012688, "loss": 6.2997, "mean_token_accuracy": 0.1266927093267441, "num_tokens": 25619411.0, "step": 11840 }, { "entropy": 6.566569089889526, "epoch": 1.2675370538819626, "grad_norm": 1.3515625, "learning_rate": 0.0004848925765737665, "loss": 6.3383, "mean_token_accuracy": 0.12526525929570198, "num_tokens": 25630477.0, "step": 11845 }, { "entropy": 6.587625980377197, "epoch": 1.2680721279897265, "grad_norm": 1.34375, "learning_rate": 0.00048487879998564565, "loss": 6.2614, "mean_token_accuracy": 0.1306361250579357, "num_tokens": 25640129.0, "step": 11850 }, { "entropy": 6.512728309631347, "epoch": 1.2686072020974906, "grad_norm": 1.4921875, "learning_rate": 0.00048486501733730386, "loss": 6.3371, "mean_token_accuracy": 0.132972913980484, "num_tokens": 25650592.0, "step": 11855 }, { "entropy": 6.506902265548706, "epoch": 1.2691422762052544, "grad_norm": 1.3828125, "learning_rate": 0.00048485122862913934, "loss": 6.2482, "mean_token_accuracy": 0.1407736212015152, "num_tokens": 25660408.0, "step": 11860 }, { "entropy": 6.493857097625733, "epoch": 1.2696773503130183, "grad_norm": 1.609375, "learning_rate": 0.00048483743386154994, "loss": 6.3532, "mean_token_accuracy": 0.13489907830953599, "num_tokens": 25671563.0, "step": 11865 }, { "entropy": 6.558619737625122, "epoch": 1.2702124244207824, "grad_norm": 1.5390625, "learning_rate": 0.00048482363303493415, "loss": 6.2846, "mean_token_accuracy": 0.13159688413143159, "num_tokens": 25682474.0, "step": 11870 }, { "entropy": 6.642208576202393, "epoch": 1.270747498528546, "grad_norm": 1.3046875, "learning_rate": 0.0004848098261496905, "loss": 6.299, "mean_token_accuracy": 0.12964960634708406, "num_tokens": 25692594.0, "step": 11875 }, { "entropy": 6.392217111587525, "epoch": 1.2712825726363102, "grad_norm": 1.46875, "learning_rate": 0.0004847960132062175, "loss": 6.1265, "mean_token_accuracy": 0.1474221259355545, "num_tokens": 25703724.0, "step": 11880 }, { "entropy": 6.513773727416992, "epoch": 1.271817646744074, "grad_norm": 1.6015625, "learning_rate": 0.0004847821942049142, "loss": 6.4354, "mean_token_accuracy": 0.11740069463849068, "num_tokens": 25714911.0, "step": 11885 }, { "entropy": 6.638753223419189, "epoch": 1.272352720851838, "grad_norm": 1.8828125, "learning_rate": 0.00048476836914617945, "loss": 6.3143, "mean_token_accuracy": 0.13183923736214637, "num_tokens": 25725098.0, "step": 11890 }, { "entropy": 6.572930812835693, "epoch": 1.272887794959602, "grad_norm": 1.7890625, "learning_rate": 0.00048475453803041254, "loss": 6.2628, "mean_token_accuracy": 0.12592896148562432, "num_tokens": 25735099.0, "step": 11895 }, { "entropy": 6.4913472652435305, "epoch": 1.273422869067366, "grad_norm": 1.8125, "learning_rate": 0.0004847407008580128, "loss": 6.2883, "mean_token_accuracy": 0.13161098584532738, "num_tokens": 25746852.0, "step": 11900 }, { "entropy": 6.512494039535523, "epoch": 1.2739579431751298, "grad_norm": 1.609375, "learning_rate": 0.00048472685762937983, "loss": 6.3398, "mean_token_accuracy": 0.13382739797234536, "num_tokens": 25758579.0, "step": 11905 }, { "entropy": 6.512800168991089, "epoch": 1.2744930172828937, "grad_norm": 1.515625, "learning_rate": 0.00048471300834491325, "loss": 6.3187, "mean_token_accuracy": 0.13117347955703734, "num_tokens": 25769965.0, "step": 11910 }, { "entropy": 6.554977321624756, "epoch": 1.2750280913906575, "grad_norm": 1.5625, "learning_rate": 0.0004846991530050132, "loss": 6.3298, "mean_token_accuracy": 0.1322600245475769, "num_tokens": 25780264.0, "step": 11915 }, { "entropy": 6.54880313873291, "epoch": 1.2755631654984216, "grad_norm": 1.8125, "learning_rate": 0.0004846852916100794, "loss": 6.2496, "mean_token_accuracy": 0.13358540534973146, "num_tokens": 25791228.0, "step": 11920 }, { "entropy": 6.540342521667481, "epoch": 1.2760982396061855, "grad_norm": 1.765625, "learning_rate": 0.0004846714241605123, "loss": 6.2482, "mean_token_accuracy": 0.1332520917057991, "num_tokens": 25802428.0, "step": 11925 }, { "entropy": 6.563567304611206, "epoch": 1.2766333137139494, "grad_norm": 1.4140625, "learning_rate": 0.00048465755065671233, "loss": 6.3134, "mean_token_accuracy": 0.1317474439740181, "num_tokens": 25814220.0, "step": 11930 }, { "entropy": 6.554912805557251, "epoch": 1.2771683878217133, "grad_norm": 2.390625, "learning_rate": 0.00048464367109908005, "loss": 6.3203, "mean_token_accuracy": 0.12791907414793968, "num_tokens": 25824382.0, "step": 11935 }, { "entropy": 6.450937795639038, "epoch": 1.2777034619294771, "grad_norm": 1.421875, "learning_rate": 0.0004846297854880162, "loss": 6.2752, "mean_token_accuracy": 0.1334068424999714, "num_tokens": 25834896.0, "step": 11940 }, { "entropy": 6.576845788955689, "epoch": 1.2782385360372412, "grad_norm": 1.71875, "learning_rate": 0.00048461589382392176, "loss": 6.3812, "mean_token_accuracy": 0.12662025466561316, "num_tokens": 25847300.0, "step": 11945 }, { "entropy": 6.584928846359253, "epoch": 1.2787736101450051, "grad_norm": 1.3671875, "learning_rate": 0.0004846019961071978, "loss": 6.3156, "mean_token_accuracy": 0.13572727739810944, "num_tokens": 25858599.0, "step": 11950 }, { "entropy": 6.483222579956054, "epoch": 1.279308684252769, "grad_norm": 1.78125, "learning_rate": 0.0004845880923382457, "loss": 6.275, "mean_token_accuracy": 0.13509821593761445, "num_tokens": 25869135.0, "step": 11955 }, { "entropy": 6.516763973236084, "epoch": 1.2798437583605329, "grad_norm": 1.59375, "learning_rate": 0.00048457418251746695, "loss": 6.2639, "mean_token_accuracy": 0.13429969400167466, "num_tokens": 25879234.0, "step": 11960 }, { "entropy": 6.5868120193481445, "epoch": 1.2803788324682968, "grad_norm": 1.734375, "learning_rate": 0.0004845602666452629, "loss": 6.3051, "mean_token_accuracy": 0.13416241556406022, "num_tokens": 25888230.0, "step": 11965 }, { "entropy": 6.562831401824951, "epoch": 1.2809139065760609, "grad_norm": 1.84375, "learning_rate": 0.0004845463447220358, "loss": 6.3312, "mean_token_accuracy": 0.14075978919863702, "num_tokens": 25899429.0, "step": 11970 }, { "entropy": 6.486060523986817, "epoch": 1.2814489806838247, "grad_norm": 2.015625, "learning_rate": 0.0004845324167481874, "loss": 6.2135, "mean_token_accuracy": 0.14120842665433883, "num_tokens": 25911042.0, "step": 11975 }, { "entropy": 6.555566024780274, "epoch": 1.2819840547915886, "grad_norm": 1.59375, "learning_rate": 0.0004845184827241199, "loss": 6.2712, "mean_token_accuracy": 0.13459475412964822, "num_tokens": 25921466.0, "step": 11980 }, { "entropy": 6.56078405380249, "epoch": 1.2825191288993525, "grad_norm": 1.453125, "learning_rate": 0.0004845045426502357, "loss": 6.3848, "mean_token_accuracy": 0.1237009696662426, "num_tokens": 25931059.0, "step": 11985 }, { "entropy": 6.523500299453735, "epoch": 1.2830542030071164, "grad_norm": 1.671875, "learning_rate": 0.00048449059652693724, "loss": 6.2997, "mean_token_accuracy": 0.1334775298833847, "num_tokens": 25941669.0, "step": 11990 }, { "entropy": 6.488269805908203, "epoch": 1.2835892771148805, "grad_norm": 1.4296875, "learning_rate": 0.0004844766443546272, "loss": 6.3041, "mean_token_accuracy": 0.13760485649108886, "num_tokens": 25952066.0, "step": 11995 }, { "entropy": 6.551593017578125, "epoch": 1.2841243512226443, "grad_norm": 1.984375, "learning_rate": 0.0004844626861337085, "loss": 6.2276, "mean_token_accuracy": 0.1375007748603821, "num_tokens": 25962388.0, "step": 12000 }, { "epoch": 1.2841243512226443, "eval_entropy": 6.386375296148007, "eval_loss": 6.437783241271973, "eval_mean_token_accuracy": 0.13334858964907753, "eval_num_tokens": 25962388.0, "eval_runtime": 22.5367, "eval_samples_per_second": 1316.92, "eval_steps_per_second": 164.621, "step": 12000 }, { "entropy": 6.476883220672607, "epoch": 1.2846594253304082, "grad_norm": 1.4296875, "learning_rate": 0.0004844487218645843, "loss": 6.2774, "mean_token_accuracy": 0.13293329626321793, "num_tokens": 25973865.0, "step": 12005 }, { "entropy": 6.5142007827758786, "epoch": 1.2851944994381723, "grad_norm": 1.46875, "learning_rate": 0.0004844347515476575, "loss": 6.2843, "mean_token_accuracy": 0.13389490097761153, "num_tokens": 25985113.0, "step": 12010 }, { "entropy": 6.539774703979492, "epoch": 1.285729573545936, "grad_norm": 1.5078125, "learning_rate": 0.00048442077518333175, "loss": 6.1853, "mean_token_accuracy": 0.1449642926454544, "num_tokens": 25995980.0, "step": 12015 }, { "entropy": 6.491984510421753, "epoch": 1.2862646476537, "grad_norm": 1.53125, "learning_rate": 0.00048440679277201063, "loss": 6.2924, "mean_token_accuracy": 0.13728865012526512, "num_tokens": 26006362.0, "step": 12020 }, { "entropy": 6.5380847454071045, "epoch": 1.286799721761464, "grad_norm": 1.4609375, "learning_rate": 0.00048439280431409774, "loss": 6.3672, "mean_token_accuracy": 0.13121474161744118, "num_tokens": 26016623.0, "step": 12025 }, { "entropy": 6.455700159072876, "epoch": 1.2873347958692278, "grad_norm": 1.5390625, "learning_rate": 0.00048437880980999694, "loss": 6.1831, "mean_token_accuracy": 0.13906619623303412, "num_tokens": 26027202.0, "step": 12030 }, { "entropy": 6.473853254318238, "epoch": 1.287869869976992, "grad_norm": 1.4609375, "learning_rate": 0.0004843648092601125, "loss": 6.2931, "mean_token_accuracy": 0.12801167741417885, "num_tokens": 26037330.0, "step": 12035 }, { "entropy": 6.525657653808594, "epoch": 1.2884049440847558, "grad_norm": 1.3671875, "learning_rate": 0.0004843508026648487, "loss": 6.2985, "mean_token_accuracy": 0.13337891325354576, "num_tokens": 26047661.0, "step": 12040 }, { "entropy": 6.634007549285888, "epoch": 1.2889400181925197, "grad_norm": 1.671875, "learning_rate": 0.0004843367900246098, "loss": 6.3625, "mean_token_accuracy": 0.12507258877158164, "num_tokens": 26058582.0, "step": 12045 }, { "entropy": 6.537368679046631, "epoch": 1.2894750923002836, "grad_norm": 1.3203125, "learning_rate": 0.00048432277133980055, "loss": 6.3396, "mean_token_accuracy": 0.12189410924911499, "num_tokens": 26069117.0, "step": 12050 }, { "entropy": 6.537881183624267, "epoch": 1.2900101664080474, "grad_norm": 1.5703125, "learning_rate": 0.00048430874661082565, "loss": 6.3088, "mean_token_accuracy": 0.12988518327474594, "num_tokens": 26079327.0, "step": 12055 }, { "entropy": 6.580955171585083, "epoch": 1.2905452405158115, "grad_norm": 1.8359375, "learning_rate": 0.00048429471583809016, "loss": 6.3018, "mean_token_accuracy": 0.13474506214261056, "num_tokens": 26090709.0, "step": 12060 }, { "entropy": 6.6343930721282955, "epoch": 1.2910803146235754, "grad_norm": 1.7421875, "learning_rate": 0.0004842806790219991, "loss": 6.3157, "mean_token_accuracy": 0.12702692076563835, "num_tokens": 26101570.0, "step": 12065 }, { "entropy": 6.503259086608887, "epoch": 1.2916153887313393, "grad_norm": 2.375, "learning_rate": 0.00048426663616295783, "loss": 6.2787, "mean_token_accuracy": 0.13804319500923157, "num_tokens": 26112827.0, "step": 12070 }, { "entropy": 6.492285490036011, "epoch": 1.2921504628391032, "grad_norm": 1.4140625, "learning_rate": 0.00048425258726137187, "loss": 6.352, "mean_token_accuracy": 0.1263483129441738, "num_tokens": 26124141.0, "step": 12075 }, { "entropy": 6.516628980636597, "epoch": 1.292685536946867, "grad_norm": 1.875, "learning_rate": 0.00048423853231764684, "loss": 6.2953, "mean_token_accuracy": 0.13210719525814058, "num_tokens": 26135372.0, "step": 12080 }, { "entropy": 6.52798318862915, "epoch": 1.2932206110546312, "grad_norm": 1.6875, "learning_rate": 0.00048422447133218867, "loss": 6.2557, "mean_token_accuracy": 0.13133319541811944, "num_tokens": 26145933.0, "step": 12085 }, { "entropy": 6.561259794235229, "epoch": 1.293755685162395, "grad_norm": 2.0, "learning_rate": 0.00048421040430540323, "loss": 6.3508, "mean_token_accuracy": 0.12620900720357894, "num_tokens": 26155948.0, "step": 12090 }, { "entropy": 6.478076982498169, "epoch": 1.294290759270159, "grad_norm": 1.6015625, "learning_rate": 0.0004841963312376967, "loss": 6.2383, "mean_token_accuracy": 0.1421545147895813, "num_tokens": 26166410.0, "step": 12095 }, { "entropy": 6.462507247924805, "epoch": 1.2948258333779228, "grad_norm": 1.6484375, "learning_rate": 0.00048418225212947566, "loss": 6.2768, "mean_token_accuracy": 0.13346440643072127, "num_tokens": 26177334.0, "step": 12100 }, { "entropy": 6.6124979019165036, "epoch": 1.2953609074856867, "grad_norm": 1.4140625, "learning_rate": 0.0004841681669811464, "loss": 6.3405, "mean_token_accuracy": 0.12650283202528953, "num_tokens": 26187987.0, "step": 12105 }, { "entropy": 6.576649856567383, "epoch": 1.2958959815934508, "grad_norm": 1.453125, "learning_rate": 0.0004841540757931157, "loss": 6.2985, "mean_token_accuracy": 0.12536120936274528, "num_tokens": 26198600.0, "step": 12110 }, { "entropy": 6.487023544311524, "epoch": 1.2964310557012146, "grad_norm": 1.96875, "learning_rate": 0.0004841399785657904, "loss": 6.3233, "mean_token_accuracy": 0.12932894751429558, "num_tokens": 26210977.0, "step": 12115 }, { "entropy": 6.540788698196411, "epoch": 1.2969661298089785, "grad_norm": 1.359375, "learning_rate": 0.00048412587529957774, "loss": 6.2888, "mean_token_accuracy": 0.1334947131574154, "num_tokens": 26220813.0, "step": 12120 }, { "entropy": 6.564545059204102, "epoch": 1.2975012039167424, "grad_norm": 1.6875, "learning_rate": 0.0004841117659948848, "loss": 6.3286, "mean_token_accuracy": 0.13227230161428452, "num_tokens": 26232042.0, "step": 12125 }, { "entropy": 6.589853429794312, "epoch": 1.2980362780245063, "grad_norm": 1.4921875, "learning_rate": 0.00048409765065211884, "loss": 6.3254, "mean_token_accuracy": 0.13484857305884362, "num_tokens": 26242968.0, "step": 12130 }, { "entropy": 6.575265645980835, "epoch": 1.2985713521322704, "grad_norm": 1.5546875, "learning_rate": 0.00048408352927168774, "loss": 6.3165, "mean_token_accuracy": 0.13241580054163932, "num_tokens": 26252751.0, "step": 12135 }, { "entropy": 6.520197963714599, "epoch": 1.2991064262400343, "grad_norm": 1.5703125, "learning_rate": 0.0004840694018539991, "loss": 6.3804, "mean_token_accuracy": 0.12634991630911827, "num_tokens": 26263270.0, "step": 12140 }, { "entropy": 6.5590331077575685, "epoch": 1.2996415003477981, "grad_norm": 1.703125, "learning_rate": 0.00048405526839946086, "loss": 6.397, "mean_token_accuracy": 0.1273276686668396, "num_tokens": 26274279.0, "step": 12145 }, { "entropy": 6.57621922492981, "epoch": 1.3001765744555622, "grad_norm": 1.9765625, "learning_rate": 0.00048404112890848105, "loss": 6.3838, "mean_token_accuracy": 0.13533301502466202, "num_tokens": 26286020.0, "step": 12150 }, { "entropy": 6.560911464691162, "epoch": 1.3007116485633259, "grad_norm": 1.765625, "learning_rate": 0.00048402698338146803, "loss": 6.3097, "mean_token_accuracy": 0.13460245206952096, "num_tokens": 26296798.0, "step": 12155 }, { "entropy": 6.485049200057984, "epoch": 1.30124672267109, "grad_norm": 1.53125, "learning_rate": 0.0004840128318188303, "loss": 6.2734, "mean_token_accuracy": 0.1385771855711937, "num_tokens": 26306952.0, "step": 12160 }, { "entropy": 6.646480941772461, "epoch": 1.3017817967788539, "grad_norm": 1.90625, "learning_rate": 0.00048399867422097644, "loss": 6.3605, "mean_token_accuracy": 0.13204823806881905, "num_tokens": 26317686.0, "step": 12165 }, { "entropy": 6.595529508590698, "epoch": 1.3023168708866177, "grad_norm": 1.8671875, "learning_rate": 0.00048398451058831514, "loss": 6.3449, "mean_token_accuracy": 0.13236458525061606, "num_tokens": 26327997.0, "step": 12170 }, { "entropy": 6.483434581756592, "epoch": 1.3028519449943818, "grad_norm": 1.6015625, "learning_rate": 0.00048397034092125554, "loss": 6.3319, "mean_token_accuracy": 0.13000286892056465, "num_tokens": 26340227.0, "step": 12175 }, { "entropy": 6.63649435043335, "epoch": 1.3033870191021457, "grad_norm": 1.90625, "learning_rate": 0.00048395616522020667, "loss": 6.4409, "mean_token_accuracy": 0.1249793030321598, "num_tokens": 26350549.0, "step": 12180 }, { "entropy": 6.5887518405914305, "epoch": 1.3039220932099096, "grad_norm": 1.6796875, "learning_rate": 0.0004839419834855779, "loss": 6.3454, "mean_token_accuracy": 0.13172085583209991, "num_tokens": 26361822.0, "step": 12185 }, { "entropy": 6.4851236820220945, "epoch": 1.3044571673176735, "grad_norm": 1.96875, "learning_rate": 0.0004839277957177787, "loss": 6.3407, "mean_token_accuracy": 0.13301774114370346, "num_tokens": 26372720.0, "step": 12190 }, { "entropy": 6.454987621307373, "epoch": 1.3049922414254373, "grad_norm": 1.484375, "learning_rate": 0.0004839136019172188, "loss": 6.3111, "mean_token_accuracy": 0.1354654051363468, "num_tokens": 26383092.0, "step": 12195 }, { "entropy": 6.499829721450806, "epoch": 1.3055273155332014, "grad_norm": 1.734375, "learning_rate": 0.000483899402084308, "loss": 6.2549, "mean_token_accuracy": 0.14037376120686532, "num_tokens": 26395188.0, "step": 12200 }, { "entropy": 6.556978702545166, "epoch": 1.3060623896409653, "grad_norm": 1.5703125, "learning_rate": 0.0004838851962194563, "loss": 6.3664, "mean_token_accuracy": 0.13069112375378608, "num_tokens": 26406338.0, "step": 12205 }, { "entropy": 6.521770095825195, "epoch": 1.3065974637487292, "grad_norm": 2.703125, "learning_rate": 0.0004838709843230739, "loss": 6.3097, "mean_token_accuracy": 0.1294810354709625, "num_tokens": 26416983.0, "step": 12210 }, { "entropy": 6.528356266021729, "epoch": 1.307132537856493, "grad_norm": 1.375, "learning_rate": 0.0004838567663955712, "loss": 6.2598, "mean_token_accuracy": 0.13848564326763152, "num_tokens": 26426966.0, "step": 12215 }, { "entropy": 6.528638315200806, "epoch": 1.307667611964257, "grad_norm": 1.6953125, "learning_rate": 0.0004838425424373587, "loss": 6.2521, "mean_token_accuracy": 0.1309279464185238, "num_tokens": 26437711.0, "step": 12220 }, { "entropy": 6.545057106018066, "epoch": 1.308202686072021, "grad_norm": 1.625, "learning_rate": 0.0004838283124488472, "loss": 6.384, "mean_token_accuracy": 0.13038895800709724, "num_tokens": 26448657.0, "step": 12225 }, { "entropy": 6.607879734039306, "epoch": 1.308737760179785, "grad_norm": 3.71875, "learning_rate": 0.00048381407643044737, "loss": 6.2599, "mean_token_accuracy": 0.13647112473845482, "num_tokens": 26459363.0, "step": 12230 }, { "entropy": 6.498840999603272, "epoch": 1.3092728342875488, "grad_norm": 1.53125, "learning_rate": 0.0004837998343825705, "loss": 6.2933, "mean_token_accuracy": 0.1369725577533245, "num_tokens": 26470149.0, "step": 12235 }, { "entropy": 6.4808508396148685, "epoch": 1.3098079083953127, "grad_norm": 1.40625, "learning_rate": 0.00048378558630562783, "loss": 6.2569, "mean_token_accuracy": 0.13962852880358695, "num_tokens": 26480424.0, "step": 12240 }, { "entropy": 6.498993587493897, "epoch": 1.3103429825030766, "grad_norm": 6.0625, "learning_rate": 0.0004837713322000306, "loss": 6.2919, "mean_token_accuracy": 0.12992604449391365, "num_tokens": 26490312.0, "step": 12245 }, { "entropy": 6.48661847114563, "epoch": 1.3108780566108407, "grad_norm": 1.515625, "learning_rate": 0.0004837570720661905, "loss": 6.2831, "mean_token_accuracy": 0.14373423680663108, "num_tokens": 26501119.0, "step": 12250 }, { "entropy": 6.580825424194336, "epoch": 1.3114131307186045, "grad_norm": 1.78125, "learning_rate": 0.00048374280590451934, "loss": 6.3406, "mean_token_accuracy": 0.13384997844696045, "num_tokens": 26512438.0, "step": 12255 }, { "entropy": 6.5407239437103275, "epoch": 1.3119482048263684, "grad_norm": 1.5625, "learning_rate": 0.00048372853371542895, "loss": 6.2969, "mean_token_accuracy": 0.12450519725680351, "num_tokens": 26523930.0, "step": 12260 }, { "entropy": 6.56227297782898, "epoch": 1.3124832789341323, "grad_norm": 2.359375, "learning_rate": 0.0004837142554993315, "loss": 6.3908, "mean_token_accuracy": 0.13300466015934945, "num_tokens": 26534937.0, "step": 12265 }, { "entropy": 6.476114416122437, "epoch": 1.3130183530418962, "grad_norm": 1.703125, "learning_rate": 0.0004836999712566392, "loss": 6.1802, "mean_token_accuracy": 0.13274189084768295, "num_tokens": 26544555.0, "step": 12270 }, { "entropy": 6.5541692733764645, "epoch": 1.3135534271496603, "grad_norm": 1.5546875, "learning_rate": 0.00048368568098776463, "loss": 6.3383, "mean_token_accuracy": 0.1406101442873478, "num_tokens": 26556144.0, "step": 12275 }, { "entropy": 6.571285533905029, "epoch": 1.3140885012574242, "grad_norm": 1.75, "learning_rate": 0.0004836713846931203, "loss": 6.381, "mean_token_accuracy": 0.1273029126226902, "num_tokens": 26567350.0, "step": 12280 }, { "entropy": 6.56294436454773, "epoch": 1.314623575365188, "grad_norm": 2.53125, "learning_rate": 0.00048365708237311904, "loss": 6.2877, "mean_token_accuracy": 0.13095688074827194, "num_tokens": 26579486.0, "step": 12285 }, { "entropy": 6.5144415378570555, "epoch": 1.3151586494729521, "grad_norm": 1.625, "learning_rate": 0.0004836427740281739, "loss": 6.304, "mean_token_accuracy": 0.13191987350583076, "num_tokens": 26589665.0, "step": 12290 }, { "entropy": 6.529788827896118, "epoch": 1.3156937235807158, "grad_norm": 1.140625, "learning_rate": 0.00048362845965869793, "loss": 6.2901, "mean_token_accuracy": 0.13123327121138573, "num_tokens": 26600187.0, "step": 12295 }, { "entropy": 6.502836656570435, "epoch": 1.31622879768848, "grad_norm": 1.9140625, "learning_rate": 0.0004836141392651046, "loss": 6.2571, "mean_token_accuracy": 0.1337031193077564, "num_tokens": 26612155.0, "step": 12300 }, { "entropy": 6.548255729675293, "epoch": 1.3167638717962438, "grad_norm": 1.9609375, "learning_rate": 0.00048359981284780727, "loss": 6.2977, "mean_token_accuracy": 0.12883710488677025, "num_tokens": 26623077.0, "step": 12305 }, { "entropy": 6.491298675537109, "epoch": 1.3172989459040076, "grad_norm": 1.640625, "learning_rate": 0.0004835854804072196, "loss": 6.2275, "mean_token_accuracy": 0.13802778869867324, "num_tokens": 26632979.0, "step": 12310 }, { "entropy": 6.495585870742798, "epoch": 1.3178340200117717, "grad_norm": 1.6796875, "learning_rate": 0.00048357114194375555, "loss": 6.3398, "mean_token_accuracy": 0.1271979182958603, "num_tokens": 26644377.0, "step": 12315 }, { "entropy": 6.573164081573486, "epoch": 1.3183690941195356, "grad_norm": 1.5390625, "learning_rate": 0.000483556797457829, "loss": 6.3333, "mean_token_accuracy": 0.12611328884959222, "num_tokens": 26655538.0, "step": 12320 }, { "entropy": 6.536789274215698, "epoch": 1.3189041682272995, "grad_norm": 2.59375, "learning_rate": 0.00048354244694985435, "loss": 6.3011, "mean_token_accuracy": 0.12973858788609505, "num_tokens": 26668011.0, "step": 12325 }, { "entropy": 6.486205053329468, "epoch": 1.3194392423350634, "grad_norm": 1.5234375, "learning_rate": 0.0004835280904202457, "loss": 6.3147, "mean_token_accuracy": 0.13040204644203185, "num_tokens": 26678996.0, "step": 12330 }, { "entropy": 6.5596967220306395, "epoch": 1.3199743164428273, "grad_norm": 1.8046875, "learning_rate": 0.0004835137278694178, "loss": 6.266, "mean_token_accuracy": 0.13785816729068756, "num_tokens": 26689041.0, "step": 12335 }, { "entropy": 6.5753649234771725, "epoch": 1.3205093905505914, "grad_norm": 3.46875, "learning_rate": 0.0004834993592977854, "loss": 6.2708, "mean_token_accuracy": 0.13826132118701934, "num_tokens": 26699459.0, "step": 12340 }, { "entropy": 6.549886798858642, "epoch": 1.3210444646583552, "grad_norm": 1.78125, "learning_rate": 0.0004834849847057632, "loss": 6.3928, "mean_token_accuracy": 0.12919416651129723, "num_tokens": 26711663.0, "step": 12345 }, { "entropy": 6.558913803100586, "epoch": 1.321579538766119, "grad_norm": 1.390625, "learning_rate": 0.00048347060409376644, "loss": 6.3523, "mean_token_accuracy": 0.123536217212677, "num_tokens": 26722960.0, "step": 12350 }, { "entropy": 6.54972996711731, "epoch": 1.322114612873883, "grad_norm": 1.5625, "learning_rate": 0.00048345621746221024, "loss": 6.2683, "mean_token_accuracy": 0.13708956986665727, "num_tokens": 26733274.0, "step": 12355 }, { "entropy": 6.5588398456573485, "epoch": 1.3226496869816469, "grad_norm": 1.5390625, "learning_rate": 0.00048344182481151003, "loss": 6.3194, "mean_token_accuracy": 0.12774837762117386, "num_tokens": 26743906.0, "step": 12360 }, { "entropy": 6.462081623077393, "epoch": 1.323184761089411, "grad_norm": 1.4140625, "learning_rate": 0.00048342742614208145, "loss": 6.3161, "mean_token_accuracy": 0.12888485714793205, "num_tokens": 26755093.0, "step": 12365 }, { "entropy": 6.510008096694946, "epoch": 1.3237198351971748, "grad_norm": 3.9375, "learning_rate": 0.0004834130214543402, "loss": 6.2934, "mean_token_accuracy": 0.133803091943264, "num_tokens": 26765614.0, "step": 12370 }, { "entropy": 6.513565587997436, "epoch": 1.3242549093049387, "grad_norm": 1.5625, "learning_rate": 0.00048339861074870227, "loss": 6.3033, "mean_token_accuracy": 0.1330991990864277, "num_tokens": 26778078.0, "step": 12375 }, { "entropy": 6.604484891891479, "epoch": 1.3247899834127026, "grad_norm": 1.8828125, "learning_rate": 0.00048338419402558375, "loss": 6.3154, "mean_token_accuracy": 0.13245146498084068, "num_tokens": 26788707.0, "step": 12380 }, { "entropy": 6.58511905670166, "epoch": 1.3253250575204665, "grad_norm": 1.6328125, "learning_rate": 0.0004833697712854009, "loss": 6.2722, "mean_token_accuracy": 0.13194304704666138, "num_tokens": 26798650.0, "step": 12385 }, { "entropy": 6.517331314086914, "epoch": 1.3258601316282306, "grad_norm": 1.9140625, "learning_rate": 0.00048335534252857016, "loss": 6.3233, "mean_token_accuracy": 0.13552766814827918, "num_tokens": 26809822.0, "step": 12390 }, { "entropy": 6.5462925910949705, "epoch": 1.3263952057359945, "grad_norm": 1.3359375, "learning_rate": 0.0004833409077555082, "loss": 6.3009, "mean_token_accuracy": 0.12845633625984193, "num_tokens": 26821061.0, "step": 12395 }, { "entropy": 6.6133284091949465, "epoch": 1.3269302798437583, "grad_norm": 1.4453125, "learning_rate": 0.00048332646696663177, "loss": 6.3462, "mean_token_accuracy": 0.12829353287816048, "num_tokens": 26832020.0, "step": 12400 }, { "entropy": 6.596477937698364, "epoch": 1.3274653539515222, "grad_norm": 1.6484375, "learning_rate": 0.0004833120201623579, "loss": 6.3353, "mean_token_accuracy": 0.128353201597929, "num_tokens": 26844287.0, "step": 12405 }, { "entropy": 6.412652969360352, "epoch": 1.328000428059286, "grad_norm": 1.8359375, "learning_rate": 0.00048329756734310375, "loss": 6.1728, "mean_token_accuracy": 0.14178198873996734, "num_tokens": 26855790.0, "step": 12410 }, { "entropy": 6.452540540695191, "epoch": 1.3285355021670502, "grad_norm": 1.5859375, "learning_rate": 0.00048328310850928656, "loss": 6.3216, "mean_token_accuracy": 0.134925177693367, "num_tokens": 26867391.0, "step": 12415 }, { "entropy": 6.551491546630859, "epoch": 1.329070576274814, "grad_norm": 1.3515625, "learning_rate": 0.00048326864366132397, "loss": 6.3253, "mean_token_accuracy": 0.13360649049282075, "num_tokens": 26879173.0, "step": 12420 }, { "entropy": 6.559604692459106, "epoch": 1.329605650382578, "grad_norm": 1.859375, "learning_rate": 0.0004832541727996335, "loss": 6.2344, "mean_token_accuracy": 0.13868265673518182, "num_tokens": 26889839.0, "step": 12425 }, { "entropy": 6.486599254608154, "epoch": 1.330140724490342, "grad_norm": 1.3046875, "learning_rate": 0.000483239695924633, "loss": 6.2991, "mean_token_accuracy": 0.13732991963624955, "num_tokens": 26900217.0, "step": 12430 }, { "entropy": 6.532090044021606, "epoch": 1.330675798598106, "grad_norm": 1.71875, "learning_rate": 0.00048322521303674064, "loss": 6.2994, "mean_token_accuracy": 0.13312758281826972, "num_tokens": 26911366.0, "step": 12435 }, { "entropy": 6.597012996673584, "epoch": 1.3312108727058698, "grad_norm": 1.375, "learning_rate": 0.00048321072413637454, "loss": 6.3401, "mean_token_accuracy": 0.12487093731760979, "num_tokens": 26922135.0, "step": 12440 }, { "entropy": 6.551101970672607, "epoch": 1.3317459468136337, "grad_norm": 1.4453125, "learning_rate": 0.0004831962292239529, "loss": 6.2774, "mean_token_accuracy": 0.13313136473298073, "num_tokens": 26932502.0, "step": 12445 }, { "entropy": 6.499680852890014, "epoch": 1.3322810209213976, "grad_norm": 1.75, "learning_rate": 0.00048318172829989447, "loss": 6.3364, "mean_token_accuracy": 0.13847661167383193, "num_tokens": 26944607.0, "step": 12450 }, { "entropy": 6.529852628707886, "epoch": 1.3328160950291617, "grad_norm": 1.4375, "learning_rate": 0.0004831672213646179, "loss": 6.3356, "mean_token_accuracy": 0.1344766914844513, "num_tokens": 26955205.0, "step": 12455 }, { "entropy": 6.512268972396851, "epoch": 1.3333511691369255, "grad_norm": 1.703125, "learning_rate": 0.0004831527084185421, "loss": 6.2131, "mean_token_accuracy": 0.1448250100016594, "num_tokens": 26965558.0, "step": 12460 }, { "entropy": 6.497064542770386, "epoch": 1.3338862432446894, "grad_norm": 2.84375, "learning_rate": 0.000483138189462086, "loss": 6.288, "mean_token_accuracy": 0.13134488835930824, "num_tokens": 26976176.0, "step": 12465 }, { "entropy": 6.550390195846558, "epoch": 1.3344213173524533, "grad_norm": 1.6328125, "learning_rate": 0.00048312366449566895, "loss": 6.35, "mean_token_accuracy": 0.13253561332821845, "num_tokens": 26987099.0, "step": 12470 }, { "entropy": 6.521877908706665, "epoch": 1.3349563914602172, "grad_norm": 1.5546875, "learning_rate": 0.0004831091335197104, "loss": 6.2946, "mean_token_accuracy": 0.13181954994797707, "num_tokens": 26998122.0, "step": 12475 }, { "entropy": 6.4629723072052006, "epoch": 1.3354914655679813, "grad_norm": 1.4609375, "learning_rate": 0.0004830945965346298, "loss": 6.248, "mean_token_accuracy": 0.1338569551706314, "num_tokens": 27009427.0, "step": 12480 }, { "entropy": 6.5822224617004395, "epoch": 1.3360265396757451, "grad_norm": 1.609375, "learning_rate": 0.000483080053540847, "loss": 6.4041, "mean_token_accuracy": 0.12383663654327393, "num_tokens": 27020701.0, "step": 12485 }, { "entropy": 6.582948064804077, "epoch": 1.336561613783509, "grad_norm": 1.5, "learning_rate": 0.0004830655045387818, "loss": 6.3641, "mean_token_accuracy": 0.1241733305156231, "num_tokens": 27033215.0, "step": 12490 }, { "entropy": 6.554017066955566, "epoch": 1.337096687891273, "grad_norm": 1.640625, "learning_rate": 0.00048305094952885453, "loss": 6.3226, "mean_token_accuracy": 0.12772757932543755, "num_tokens": 27043846.0, "step": 12495 }, { "entropy": 6.511205577850342, "epoch": 1.3376317619990368, "grad_norm": 1.59375, "learning_rate": 0.0004830363885114853, "loss": 6.305, "mean_token_accuracy": 0.13151946440339088, "num_tokens": 27054783.0, "step": 12500 }, { "entropy": 6.494199800491333, "epoch": 1.3381668361068009, "grad_norm": 1.578125, "learning_rate": 0.0004830218214870946, "loss": 6.3327, "mean_token_accuracy": 0.1325196735560894, "num_tokens": 27066051.0, "step": 12505 }, { "entropy": 6.558785486221313, "epoch": 1.3387019102145647, "grad_norm": 1.5546875, "learning_rate": 0.0004830072484561029, "loss": 6.3293, "mean_token_accuracy": 0.13402727320790292, "num_tokens": 27078210.0, "step": 12510 }, { "entropy": 6.569102621078491, "epoch": 1.3392369843223286, "grad_norm": 2.03125, "learning_rate": 0.0004829926694189312, "loss": 6.3505, "mean_token_accuracy": 0.12516780570149422, "num_tokens": 27089693.0, "step": 12515 }, { "entropy": 6.528443145751953, "epoch": 1.3397720584300925, "grad_norm": 1.3359375, "learning_rate": 0.0004829780843760005, "loss": 6.3341, "mean_token_accuracy": 0.1275798462331295, "num_tokens": 27099856.0, "step": 12520 }, { "entropy": 6.54946722984314, "epoch": 1.3403071325378564, "grad_norm": 1.984375, "learning_rate": 0.0004829634933277317, "loss": 6.3404, "mean_token_accuracy": 0.1284944772720337, "num_tokens": 27110218.0, "step": 12525 }, { "entropy": 6.52546067237854, "epoch": 1.3408422066456205, "grad_norm": 1.6796875, "learning_rate": 0.00048294889627454636, "loss": 6.2923, "mean_token_accuracy": 0.13666339591145515, "num_tokens": 27120911.0, "step": 12530 }, { "entropy": 6.4948999881744385, "epoch": 1.3413772807533844, "grad_norm": 1.5859375, "learning_rate": 0.00048293429321686585, "loss": 6.2744, "mean_token_accuracy": 0.13520927503705024, "num_tokens": 27130964.0, "step": 12535 }, { "entropy": 6.506992530822754, "epoch": 1.3419123548611482, "grad_norm": 1.859375, "learning_rate": 0.00048291968415511174, "loss": 6.3012, "mean_token_accuracy": 0.1324952982366085, "num_tokens": 27141641.0, "step": 12540 }, { "entropy": 6.544699478149414, "epoch": 1.3424474289689121, "grad_norm": 1.6640625, "learning_rate": 0.00048290506908970607, "loss": 6.3666, "mean_token_accuracy": 0.12738464027643204, "num_tokens": 27152591.0, "step": 12545 }, { "entropy": 6.571207761764526, "epoch": 1.342982503076676, "grad_norm": 1.609375, "learning_rate": 0.0004828904480210707, "loss": 6.4297, "mean_token_accuracy": 0.12691449224948884, "num_tokens": 27163839.0, "step": 12550 }, { "entropy": 6.624313831329346, "epoch": 1.34351757718444, "grad_norm": 1.3046875, "learning_rate": 0.0004828758209496278, "loss": 6.2954, "mean_token_accuracy": 0.13590908646583558, "num_tokens": 27174480.0, "step": 12555 }, { "entropy": 6.500087404251099, "epoch": 1.344052651292204, "grad_norm": 1.890625, "learning_rate": 0.00048286118787579983, "loss": 6.2617, "mean_token_accuracy": 0.13080087080597877, "num_tokens": 27184546.0, "step": 12560 }, { "entropy": 6.451597452163696, "epoch": 1.3445877253999678, "grad_norm": 1.4296875, "learning_rate": 0.00048284654880000933, "loss": 6.1771, "mean_token_accuracy": 0.13953398764133454, "num_tokens": 27195093.0, "step": 12565 }, { "entropy": 6.476680326461792, "epoch": 1.345122799507732, "grad_norm": 1.515625, "learning_rate": 0.00048283190372267886, "loss": 6.3436, "mean_token_accuracy": 0.1333930142223835, "num_tokens": 27206416.0, "step": 12570 }, { "entropy": 6.5952800750732425, "epoch": 1.3456578736154958, "grad_norm": 1.6328125, "learning_rate": 0.0004828172526442314, "loss": 6.2663, "mean_token_accuracy": 0.12958376929163934, "num_tokens": 27215533.0, "step": 12575 }, { "entropy": 6.5549458980560305, "epoch": 1.3461929477232597, "grad_norm": 1.7265625, "learning_rate": 0.00048280259556509, "loss": 6.313, "mean_token_accuracy": 0.13110331296920777, "num_tokens": 27225985.0, "step": 12580 }, { "entropy": 6.515612268447876, "epoch": 1.3467280218310236, "grad_norm": 1.5703125, "learning_rate": 0.0004827879324856778, "loss": 6.2924, "mean_token_accuracy": 0.13066375404596328, "num_tokens": 27235967.0, "step": 12585 }, { "entropy": 6.529239511489868, "epoch": 1.3472630959387875, "grad_norm": 1.453125, "learning_rate": 0.00048277326340641835, "loss": 6.2427, "mean_token_accuracy": 0.1346130132675171, "num_tokens": 27246854.0, "step": 12590 }, { "entropy": 6.448957109451294, "epoch": 1.3477981700465516, "grad_norm": 1.3359375, "learning_rate": 0.000482758588327735, "loss": 6.3627, "mean_token_accuracy": 0.13244736939668655, "num_tokens": 27256640.0, "step": 12595 }, { "entropy": 6.524251413345337, "epoch": 1.3483332441543154, "grad_norm": 1.6953125, "learning_rate": 0.0004827439072500516, "loss": 6.3206, "mean_token_accuracy": 0.12838973328471184, "num_tokens": 27266907.0, "step": 12600 }, { "entropy": 6.599645519256592, "epoch": 1.3488683182620793, "grad_norm": 1.765625, "learning_rate": 0.00048272922017379217, "loss": 6.2754, "mean_token_accuracy": 0.13354076966643333, "num_tokens": 27277089.0, "step": 12605 }, { "entropy": 6.567108678817749, "epoch": 1.3494033923698432, "grad_norm": 2.171875, "learning_rate": 0.0004827145270993807, "loss": 6.2757, "mean_token_accuracy": 0.13490659818053247, "num_tokens": 27286781.0, "step": 12610 }, { "entropy": 6.525397729873657, "epoch": 1.349938466477607, "grad_norm": 1.40625, "learning_rate": 0.0004826998280272414, "loss": 6.302, "mean_token_accuracy": 0.13888752982020378, "num_tokens": 27298011.0, "step": 12615 }, { "entropy": 6.501267433166504, "epoch": 1.3504735405853712, "grad_norm": 1.90625, "learning_rate": 0.00048268512295779873, "loss": 6.3354, "mean_token_accuracy": 0.1331058345735073, "num_tokens": 27309052.0, "step": 12620 }, { "entropy": 6.4906703472137455, "epoch": 1.351008614693135, "grad_norm": 1.53125, "learning_rate": 0.0004826704118914773, "loss": 6.2625, "mean_token_accuracy": 0.1372261181473732, "num_tokens": 27319945.0, "step": 12625 }, { "entropy": 6.496233177185059, "epoch": 1.351543688800899, "grad_norm": 1.6953125, "learning_rate": 0.000482655694828702, "loss": 6.2829, "mean_token_accuracy": 0.14131269082427025, "num_tokens": 27330543.0, "step": 12630 }, { "entropy": 6.551932334899902, "epoch": 1.3520787629086628, "grad_norm": 1.921875, "learning_rate": 0.0004826409717698976, "loss": 6.3359, "mean_token_accuracy": 0.1282445326447487, "num_tokens": 27341957.0, "step": 12635 }, { "entropy": 6.498799562454224, "epoch": 1.3526138370164267, "grad_norm": 1.7109375, "learning_rate": 0.00048262624271548936, "loss": 6.2612, "mean_token_accuracy": 0.1311979576945305, "num_tokens": 27351506.0, "step": 12640 }, { "entropy": 6.543243360519409, "epoch": 1.3531489111241908, "grad_norm": 1.65625, "learning_rate": 0.00048261150766590257, "loss": 6.2408, "mean_token_accuracy": 0.1310368560254574, "num_tokens": 27362208.0, "step": 12645 }, { "entropy": 6.580874872207642, "epoch": 1.3536839852319547, "grad_norm": 1.515625, "learning_rate": 0.00048259676662156263, "loss": 6.279, "mean_token_accuracy": 0.13347921073436736, "num_tokens": 27372890.0, "step": 12650 }, { "entropy": 6.492420673370361, "epoch": 1.3542190593397185, "grad_norm": 1.609375, "learning_rate": 0.0004825820195828952, "loss": 6.2253, "mean_token_accuracy": 0.14195676296949386, "num_tokens": 27382879.0, "step": 12655 }, { "entropy": 6.432550573348999, "epoch": 1.3547541334474824, "grad_norm": 1.5546875, "learning_rate": 0.0004825672665503262, "loss": 6.2608, "mean_token_accuracy": 0.13371035531163217, "num_tokens": 27393878.0, "step": 12660 }, { "entropy": 6.532358169555664, "epoch": 1.3552892075552463, "grad_norm": 1.859375, "learning_rate": 0.0004825525075242815, "loss": 6.3512, "mean_token_accuracy": 0.12923340126872063, "num_tokens": 27404928.0, "step": 12665 }, { "entropy": 6.567361783981323, "epoch": 1.3558242816630104, "grad_norm": 1.65625, "learning_rate": 0.0004825377425051873, "loss": 6.2717, "mean_token_accuracy": 0.13399578258395195, "num_tokens": 27417473.0, "step": 12670 }, { "entropy": 6.553698968887329, "epoch": 1.3563593557707743, "grad_norm": 1.9140625, "learning_rate": 0.00048252297149346997, "loss": 6.358, "mean_token_accuracy": 0.12742808535695077, "num_tokens": 27428378.0, "step": 12675 }, { "entropy": 6.461050653457642, "epoch": 1.3568944298785381, "grad_norm": 2.9375, "learning_rate": 0.00048250819448955595, "loss": 6.2968, "mean_token_accuracy": 0.13851417005062103, "num_tokens": 27438815.0, "step": 12680 }, { "entropy": 6.620155000686646, "epoch": 1.357429503986302, "grad_norm": 2.015625, "learning_rate": 0.000482493411493872, "loss": 6.335, "mean_token_accuracy": 0.13085796013474466, "num_tokens": 27449295.0, "step": 12685 }, { "entropy": 6.530794715881347, "epoch": 1.357964578094066, "grad_norm": 2.359375, "learning_rate": 0.000482478622506845, "loss": 6.2229, "mean_token_accuracy": 0.13837912008166314, "num_tokens": 27459357.0, "step": 12690 }, { "entropy": 6.514059400558471, "epoch": 1.35849965220183, "grad_norm": 1.3671875, "learning_rate": 0.0004824638275289019, "loss": 6.2617, "mean_token_accuracy": 0.13738563656806946, "num_tokens": 27469405.0, "step": 12695 }, { "entropy": 6.534468078613282, "epoch": 1.3590347263095939, "grad_norm": 2.03125, "learning_rate": 0.0004824490265604699, "loss": 6.2681, "mean_token_accuracy": 0.1373660996556282, "num_tokens": 27478818.0, "step": 12700 }, { "entropy": 6.556286001205445, "epoch": 1.3595698004173578, "grad_norm": 1.71875, "learning_rate": 0.0004824342196019764, "loss": 6.227, "mean_token_accuracy": 0.13968622982501983, "num_tokens": 27488631.0, "step": 12705 }, { "entropy": 6.528377485275269, "epoch": 1.3601048745251219, "grad_norm": 1.9921875, "learning_rate": 0.00048241940665384904, "loss": 6.3075, "mean_token_accuracy": 0.13143832832574845, "num_tokens": 27500895.0, "step": 12710 }, { "entropy": 6.492169332504273, "epoch": 1.3606399486328857, "grad_norm": 1.5703125, "learning_rate": 0.0004824045877165154, "loss": 6.3509, "mean_token_accuracy": 0.12758940383791922, "num_tokens": 27512578.0, "step": 12715 }, { "entropy": 6.511027574539185, "epoch": 1.3611750227406496, "grad_norm": 2.34375, "learning_rate": 0.00048238976279040344, "loss": 6.2984, "mean_token_accuracy": 0.1308564618229866, "num_tokens": 27523448.0, "step": 12720 }, { "entropy": 6.53885703086853, "epoch": 1.3617100968484135, "grad_norm": 1.578125, "learning_rate": 0.0004823749318759413, "loss": 6.3572, "mean_token_accuracy": 0.1290444739162922, "num_tokens": 27534919.0, "step": 12725 }, { "entropy": 6.464112186431885, "epoch": 1.3622451709561774, "grad_norm": 1.796875, "learning_rate": 0.000482360094973557, "loss": 6.1838, "mean_token_accuracy": 0.13654556199908258, "num_tokens": 27545603.0, "step": 12730 }, { "entropy": 6.567755889892578, "epoch": 1.3627802450639415, "grad_norm": 1.546875, "learning_rate": 0.0004823452520836792, "loss": 6.32, "mean_token_accuracy": 0.13071177452802657, "num_tokens": 27556868.0, "step": 12735 }, { "entropy": 6.62355055809021, "epoch": 1.3633153191717053, "grad_norm": 1.78125, "learning_rate": 0.00048233040320673634, "loss": 6.4213, "mean_token_accuracy": 0.12471303418278694, "num_tokens": 27567200.0, "step": 12740 }, { "entropy": 6.48751277923584, "epoch": 1.3638503932794692, "grad_norm": 1.7578125, "learning_rate": 0.00048231554834315716, "loss": 6.2449, "mean_token_accuracy": 0.13486199751496314, "num_tokens": 27577759.0, "step": 12745 }, { "entropy": 6.522989892959595, "epoch": 1.364385467387233, "grad_norm": 1.453125, "learning_rate": 0.0004823006874933708, "loss": 6.372, "mean_token_accuracy": 0.12554556503891945, "num_tokens": 27588935.0, "step": 12750 }, { "entropy": 6.5447916984558105, "epoch": 1.364920541494997, "grad_norm": 1.6640625, "learning_rate": 0.0004822858206578061, "loss": 6.2705, "mean_token_accuracy": 0.12772670835256578, "num_tokens": 27600306.0, "step": 12755 }, { "entropy": 6.590607786178589, "epoch": 1.365455615602761, "grad_norm": 1.4296875, "learning_rate": 0.00048227094783689244, "loss": 6.3372, "mean_token_accuracy": 0.1335367240011692, "num_tokens": 27612322.0, "step": 12760 }, { "entropy": 6.557591819763184, "epoch": 1.365990689710525, "grad_norm": 1.6015625, "learning_rate": 0.0004822560690310594, "loss": 6.3052, "mean_token_accuracy": 0.1375129908323288, "num_tokens": 27623812.0, "step": 12765 }, { "entropy": 6.446960735321045, "epoch": 1.3665257638182888, "grad_norm": 1.6875, "learning_rate": 0.00048224118424073644, "loss": 6.1799, "mean_token_accuracy": 0.13489142134785653, "num_tokens": 27633848.0, "step": 12770 }, { "entropy": 6.483105087280274, "epoch": 1.3670608379260527, "grad_norm": 1.5078125, "learning_rate": 0.00048222629346635336, "loss": 6.2864, "mean_token_accuracy": 0.1376944363117218, "num_tokens": 27644641.0, "step": 12775 }, { "entropy": 6.522060775756836, "epoch": 1.3675959120338166, "grad_norm": 2.015625, "learning_rate": 0.00048221139670834025, "loss": 6.2826, "mean_token_accuracy": 0.135152880102396, "num_tokens": 27655552.0, "step": 12780 }, { "entropy": 6.499984788894653, "epoch": 1.3681309861415807, "grad_norm": 1.2734375, "learning_rate": 0.0004821964939671272, "loss": 6.2781, "mean_token_accuracy": 0.14179115146398544, "num_tokens": 27666396.0, "step": 12785 }, { "entropy": 6.579394149780273, "epoch": 1.3686660602493446, "grad_norm": 1.71875, "learning_rate": 0.0004821815852431444, "loss": 6.2375, "mean_token_accuracy": 0.1391332305967808, "num_tokens": 27676522.0, "step": 12790 }, { "entropy": 6.472452926635742, "epoch": 1.3692011343571084, "grad_norm": 2.390625, "learning_rate": 0.00048216667053682243, "loss": 6.2405, "mean_token_accuracy": 0.13712335973978043, "num_tokens": 27687088.0, "step": 12795 }, { "entropy": 6.498577833175659, "epoch": 1.3697362084648723, "grad_norm": 1.8515625, "learning_rate": 0.00048215174984859207, "loss": 6.2769, "mean_token_accuracy": 0.13670048490166664, "num_tokens": 27697587.0, "step": 12800 }, { "entropy": 6.483075046539307, "epoch": 1.3702712825726362, "grad_norm": 1.5546875, "learning_rate": 0.000482136823178884, "loss": 6.1907, "mean_token_accuracy": 0.13942957371473313, "num_tokens": 27708345.0, "step": 12805 }, { "entropy": 6.571651983261108, "epoch": 1.3708063566804003, "grad_norm": 1.6796875, "learning_rate": 0.0004821218905281292, "loss": 6.3944, "mean_token_accuracy": 0.12706556767225266, "num_tokens": 27719592.0, "step": 12810 }, { "entropy": 6.53343505859375, "epoch": 1.3713414307881642, "grad_norm": 1.671875, "learning_rate": 0.000482106951896759, "loss": 6.2827, "mean_token_accuracy": 0.13870616182684897, "num_tokens": 27730071.0, "step": 12815 }, { "entropy": 6.509290456771851, "epoch": 1.371876504895928, "grad_norm": 1.515625, "learning_rate": 0.00048209200728520466, "loss": 6.3139, "mean_token_accuracy": 0.13058488443493843, "num_tokens": 27740514.0, "step": 12820 }, { "entropy": 6.605209112167358, "epoch": 1.372411579003692, "grad_norm": 1.5859375, "learning_rate": 0.00048207705669389765, "loss": 6.3317, "mean_token_accuracy": 0.13331700637936592, "num_tokens": 27752088.0, "step": 12825 }, { "entropy": 6.623941564559937, "epoch": 1.3729466531114558, "grad_norm": 1.6953125, "learning_rate": 0.00048206210012326976, "loss": 6.3406, "mean_token_accuracy": 0.12817930206656455, "num_tokens": 27763401.0, "step": 12830 }, { "entropy": 6.548435020446777, "epoch": 1.37348172721922, "grad_norm": 1.75, "learning_rate": 0.00048204713757375283, "loss": 6.2789, "mean_token_accuracy": 0.13656549155712128, "num_tokens": 27773665.0, "step": 12835 }, { "entropy": 6.5042959690094, "epoch": 1.3740168013269838, "grad_norm": 1.7421875, "learning_rate": 0.0004820321690457789, "loss": 6.2961, "mean_token_accuracy": 0.1364237405359745, "num_tokens": 27785474.0, "step": 12840 }, { "entropy": 6.532441282272339, "epoch": 1.3745518754347477, "grad_norm": 1.4375, "learning_rate": 0.00048201719453978023, "loss": 6.3145, "mean_token_accuracy": 0.13314425200223923, "num_tokens": 27796520.0, "step": 12845 }, { "entropy": 6.591953563690185, "epoch": 1.3750869495425118, "grad_norm": 1.90625, "learning_rate": 0.0004820022140561891, "loss": 6.381, "mean_token_accuracy": 0.12598699182271958, "num_tokens": 27807559.0, "step": 12850 }, { "entropy": 6.571205520629883, "epoch": 1.3756220236502756, "grad_norm": 1.890625, "learning_rate": 0.0004819872275954381, "loss": 6.332, "mean_token_accuracy": 0.1316391684114933, "num_tokens": 27818208.0, "step": 12855 }, { "entropy": 6.507162141799927, "epoch": 1.3761570977580395, "grad_norm": 1.640625, "learning_rate": 0.00048197223515796, "loss": 6.23, "mean_token_accuracy": 0.13968217819929124, "num_tokens": 27828238.0, "step": 12860 }, { "entropy": 6.523963165283203, "epoch": 1.3766921718658034, "grad_norm": 1.3515625, "learning_rate": 0.0004819572367441877, "loss": 6.309, "mean_token_accuracy": 0.14231058806180955, "num_tokens": 27837885.0, "step": 12865 }, { "entropy": 6.457921075820923, "epoch": 1.3772272459735673, "grad_norm": 1.46875, "learning_rate": 0.0004819422323545543, "loss": 6.2082, "mean_token_accuracy": 0.14155658707022667, "num_tokens": 27847425.0, "step": 12870 }, { "entropy": 6.413833951950073, "epoch": 1.3777623200813314, "grad_norm": 1.3984375, "learning_rate": 0.000481927221989493, "loss": 6.2816, "mean_token_accuracy": 0.13291521817445756, "num_tokens": 27859606.0, "step": 12875 }, { "entropy": 6.5869935035705565, "epoch": 1.3782973941890952, "grad_norm": 1.6015625, "learning_rate": 0.0004819122056494373, "loss": 6.3398, "mean_token_accuracy": 0.13277041912078857, "num_tokens": 27871651.0, "step": 12880 }, { "entropy": 6.59212965965271, "epoch": 1.3788324682968591, "grad_norm": 1.71875, "learning_rate": 0.00048189718333482064, "loss": 6.2782, "mean_token_accuracy": 0.13503665924072267, "num_tokens": 27883138.0, "step": 12885 }, { "entropy": 6.614982795715332, "epoch": 1.379367542404623, "grad_norm": 1.5, "learning_rate": 0.000481882155046077, "loss": 6.3242, "mean_token_accuracy": 0.13419492915272713, "num_tokens": 27893597.0, "step": 12890 }, { "entropy": 6.516837644577026, "epoch": 1.3799026165123869, "grad_norm": 1.78125, "learning_rate": 0.00048186712078364006, "loss": 6.2529, "mean_token_accuracy": 0.13822920396924018, "num_tokens": 27904249.0, "step": 12895 }, { "entropy": 6.477723407745361, "epoch": 1.380437690620151, "grad_norm": 1.5625, "learning_rate": 0.00048185208054794414, "loss": 6.2921, "mean_token_accuracy": 0.1323131412267685, "num_tokens": 27914713.0, "step": 12900 }, { "entropy": 6.482716989517212, "epoch": 1.3809727647279149, "grad_norm": 1.5390625, "learning_rate": 0.0004818370343394235, "loss": 6.3059, "mean_token_accuracy": 0.14247043877840043, "num_tokens": 27926257.0, "step": 12905 }, { "entropy": 6.544012641906738, "epoch": 1.3815078388356787, "grad_norm": 1.78125, "learning_rate": 0.0004818219821585125, "loss": 6.29, "mean_token_accuracy": 0.13584071174263954, "num_tokens": 27936839.0, "step": 12910 }, { "entropy": 6.61454963684082, "epoch": 1.3820429129434426, "grad_norm": 1.6484375, "learning_rate": 0.00048180692400564586, "loss": 6.3864, "mean_token_accuracy": 0.1286683276295662, "num_tokens": 27946318.0, "step": 12915 }, { "entropy": 6.628933334350586, "epoch": 1.3825779870512065, "grad_norm": 1.5859375, "learning_rate": 0.00048179185988125834, "loss": 6.3766, "mean_token_accuracy": 0.13161879852414132, "num_tokens": 27956990.0, "step": 12920 }, { "entropy": 6.619915962219238, "epoch": 1.3831130611589706, "grad_norm": 1.546875, "learning_rate": 0.000481776789785785, "loss": 6.3103, "mean_token_accuracy": 0.12722400948405266, "num_tokens": 27968187.0, "step": 12925 }, { "entropy": 6.575854349136352, "epoch": 1.3836481352667345, "grad_norm": 1.71875, "learning_rate": 0.00048176171371966083, "loss": 6.3604, "mean_token_accuracy": 0.13226662948727608, "num_tokens": 27978337.0, "step": 12930 }, { "entropy": 6.500992679595948, "epoch": 1.3841832093744983, "grad_norm": 2.609375, "learning_rate": 0.0004817466316833212, "loss": 6.332, "mean_token_accuracy": 0.1280041068792343, "num_tokens": 27988681.0, "step": 12935 }, { "entropy": 6.48139591217041, "epoch": 1.3847182834822622, "grad_norm": 2.125, "learning_rate": 0.0004817315436772017, "loss": 6.2111, "mean_token_accuracy": 0.14233975857496262, "num_tokens": 27999233.0, "step": 12940 }, { "entropy": 6.597472620010376, "epoch": 1.385253357590026, "grad_norm": 1.6015625, "learning_rate": 0.0004817164497017379, "loss": 6.3476, "mean_token_accuracy": 0.13093181997537612, "num_tokens": 28010242.0, "step": 12945 }, { "entropy": 6.530687379837036, "epoch": 1.3857884316977902, "grad_norm": 2.125, "learning_rate": 0.0004817013497573656, "loss": 6.3145, "mean_token_accuracy": 0.13088319599628448, "num_tokens": 28020424.0, "step": 12950 }, { "entropy": 6.562989664077759, "epoch": 1.386323505805554, "grad_norm": 1.671875, "learning_rate": 0.000481686243844521, "loss": 6.2929, "mean_token_accuracy": 0.12782736048102378, "num_tokens": 28030287.0, "step": 12955 }, { "entropy": 6.579535293579101, "epoch": 1.386858579913318, "grad_norm": 1.578125, "learning_rate": 0.00048167113196364, "loss": 6.2645, "mean_token_accuracy": 0.13902048543095588, "num_tokens": 28039997.0, "step": 12960 }, { "entropy": 6.541631889343262, "epoch": 1.387393654021082, "grad_norm": 1.796875, "learning_rate": 0.0004816560141151593, "loss": 6.2911, "mean_token_accuracy": 0.12617392912507058, "num_tokens": 28051381.0, "step": 12965 }, { "entropy": 6.521060180664063, "epoch": 1.3879287281288457, "grad_norm": 1.9765625, "learning_rate": 0.0004816408902995151, "loss": 6.2566, "mean_token_accuracy": 0.13256800323724746, "num_tokens": 28063603.0, "step": 12970 }, { "entropy": 6.4855201721191404, "epoch": 1.3884638022366098, "grad_norm": 1.875, "learning_rate": 0.0004816257605171442, "loss": 6.2444, "mean_token_accuracy": 0.13902541249990463, "num_tokens": 28073942.0, "step": 12975 }, { "entropy": 6.497772598266602, "epoch": 1.3889988763443737, "grad_norm": 1.46875, "learning_rate": 0.00048161062476848363, "loss": 6.2825, "mean_token_accuracy": 0.13788814544677735, "num_tokens": 28083837.0, "step": 12980 }, { "entropy": 6.4824666500091555, "epoch": 1.3895339504521376, "grad_norm": 1.734375, "learning_rate": 0.0004815954830539702, "loss": 6.2279, "mean_token_accuracy": 0.13570400699973106, "num_tokens": 28094150.0, "step": 12985 }, { "entropy": 6.518013954162598, "epoch": 1.3900690245599017, "grad_norm": 1.34375, "learning_rate": 0.00048158033537404126, "loss": 6.2673, "mean_token_accuracy": 0.1387584075331688, "num_tokens": 28106345.0, "step": 12990 }, { "entropy": 6.5225001811981205, "epoch": 1.3906040986676655, "grad_norm": 1.546875, "learning_rate": 0.00048156518172913417, "loss": 6.229, "mean_token_accuracy": 0.13286010921001434, "num_tokens": 28116858.0, "step": 12995 }, { "entropy": 6.501324033737182, "epoch": 1.3911391727754294, "grad_norm": 4.0625, "learning_rate": 0.0004815500221196865, "loss": 6.3845, "mean_token_accuracy": 0.12992180436849593, "num_tokens": 28128390.0, "step": 13000 }, { "entropy": 6.47907657623291, "epoch": 1.3916742468831933, "grad_norm": 1.6015625, "learning_rate": 0.00048153485654613587, "loss": 6.224, "mean_token_accuracy": 0.13855567947030067, "num_tokens": 28139421.0, "step": 13005 }, { "entropy": 6.533262300491333, "epoch": 1.3922093209909572, "grad_norm": 1.3203125, "learning_rate": 0.00048151968500892043, "loss": 6.3213, "mean_token_accuracy": 0.13610239028930665, "num_tokens": 28151076.0, "step": 13010 }, { "entropy": 6.589778709411621, "epoch": 1.3927443950987213, "grad_norm": 1.8515625, "learning_rate": 0.00048150450750847795, "loss": 6.425, "mean_token_accuracy": 0.12930934131145477, "num_tokens": 28162079.0, "step": 13015 }, { "entropy": 6.53804030418396, "epoch": 1.3932794692064852, "grad_norm": 1.8046875, "learning_rate": 0.000481489324045247, "loss": 6.3428, "mean_token_accuracy": 0.13030591681599618, "num_tokens": 28174442.0, "step": 13020 }, { "entropy": 6.552037954330444, "epoch": 1.393814543314249, "grad_norm": 1.7109375, "learning_rate": 0.00048147413461966564, "loss": 6.2198, "mean_token_accuracy": 0.1378868341445923, "num_tokens": 28184643.0, "step": 13025 }, { "entropy": 6.455650091171265, "epoch": 1.394349617422013, "grad_norm": 1.7109375, "learning_rate": 0.00048145893923217276, "loss": 6.248, "mean_token_accuracy": 0.1368380829691887, "num_tokens": 28194021.0, "step": 13030 }, { "entropy": 6.57091875076294, "epoch": 1.3948846915297768, "grad_norm": 2.25, "learning_rate": 0.0004814437378832071, "loss": 6.3144, "mean_token_accuracy": 0.12892460078001022, "num_tokens": 28204750.0, "step": 13035 }, { "entropy": 6.6161461353302, "epoch": 1.3954197656375409, "grad_norm": 3.296875, "learning_rate": 0.0004814285305732074, "loss": 6.3714, "mean_token_accuracy": 0.1290208302438259, "num_tokens": 28216499.0, "step": 13040 }, { "entropy": 6.584888553619384, "epoch": 1.3959548397453048, "grad_norm": 1.484375, "learning_rate": 0.00048141331730261293, "loss": 6.3087, "mean_token_accuracy": 0.1345869742333889, "num_tokens": 28226573.0, "step": 13045 }, { "entropy": 6.55465612411499, "epoch": 1.3964899138530686, "grad_norm": 1.4296875, "learning_rate": 0.000481398098071863, "loss": 6.2448, "mean_token_accuracy": 0.14011548906564714, "num_tokens": 28236688.0, "step": 13050 }, { "entropy": 6.517119026184082, "epoch": 1.3970249879608325, "grad_norm": 1.5625, "learning_rate": 0.00048138287288139686, "loss": 6.3374, "mean_token_accuracy": 0.13438064157962798, "num_tokens": 28247477.0, "step": 13055 }, { "entropy": 6.4921595573425295, "epoch": 1.3975600620685964, "grad_norm": 1.703125, "learning_rate": 0.0004813676417316543, "loss": 6.3186, "mean_token_accuracy": 0.13378834277391433, "num_tokens": 28258286.0, "step": 13060 }, { "entropy": 6.6379228115081785, "epoch": 1.3980951361763605, "grad_norm": 2.296875, "learning_rate": 0.0004813524046230751, "loss": 6.4498, "mean_token_accuracy": 0.12076324447989464, "num_tokens": 28268587.0, "step": 13065 }, { "entropy": 6.696167945861816, "epoch": 1.3986302102841244, "grad_norm": 1.46875, "learning_rate": 0.00048133716155609926, "loss": 6.3418, "mean_token_accuracy": 0.1276852436363697, "num_tokens": 28279352.0, "step": 13070 }, { "entropy": 6.568699979782105, "epoch": 1.3991652843918883, "grad_norm": 2.34375, "learning_rate": 0.0004813219125311668, "loss": 6.2537, "mean_token_accuracy": 0.13418687954545022, "num_tokens": 28290114.0, "step": 13075 }, { "entropy": 6.516354560852051, "epoch": 1.3997003584996521, "grad_norm": 1.3671875, "learning_rate": 0.00048130665754871814, "loss": 6.3526, "mean_token_accuracy": 0.12834639623761177, "num_tokens": 28301845.0, "step": 13080 }, { "entropy": 6.586096525192261, "epoch": 1.400235432607416, "grad_norm": 1.359375, "learning_rate": 0.00048129139660919374, "loss": 6.3262, "mean_token_accuracy": 0.1293413132429123, "num_tokens": 28313162.0, "step": 13085 }, { "entropy": 6.549271535873413, "epoch": 1.40077050671518, "grad_norm": 1.4765625, "learning_rate": 0.00048127612971303425, "loss": 6.2714, "mean_token_accuracy": 0.1319861926138401, "num_tokens": 28323888.0, "step": 13090 }, { "entropy": 6.5844615459442135, "epoch": 1.401305580822944, "grad_norm": 1.4140625, "learning_rate": 0.0004812608568606805, "loss": 6.3159, "mean_token_accuracy": 0.1313139483332634, "num_tokens": 28333735.0, "step": 13095 }, { "entropy": 6.566430997848511, "epoch": 1.4018406549307079, "grad_norm": 1.5859375, "learning_rate": 0.0004812455780525735, "loss": 6.3089, "mean_token_accuracy": 0.13157719522714614, "num_tokens": 28343947.0, "step": 13100 }, { "entropy": 6.550437593460083, "epoch": 1.402375729038472, "grad_norm": 1.890625, "learning_rate": 0.0004812302932891544, "loss": 6.3743, "mean_token_accuracy": 0.1243227556347847, "num_tokens": 28354635.0, "step": 13105 }, { "entropy": 6.563779306411743, "epoch": 1.4029108031462356, "grad_norm": 1.7109375, "learning_rate": 0.0004812150025708646, "loss": 6.2903, "mean_token_accuracy": 0.13009085580706597, "num_tokens": 28365392.0, "step": 13110 }, { "entropy": 6.57616081237793, "epoch": 1.4034458772539997, "grad_norm": 1.5078125, "learning_rate": 0.00048119970589814557, "loss": 6.3027, "mean_token_accuracy": 0.12210134267807007, "num_tokens": 28376527.0, "step": 13115 }, { "entropy": 6.541454315185547, "epoch": 1.4039809513617636, "grad_norm": 1.546875, "learning_rate": 0.0004811844032714389, "loss": 6.3129, "mean_token_accuracy": 0.13677758798003198, "num_tokens": 28387178.0, "step": 13120 }, { "entropy": 6.539116430282593, "epoch": 1.4045160254695275, "grad_norm": 1.921875, "learning_rate": 0.00048116909469118663, "loss": 6.1941, "mean_token_accuracy": 0.13399127945303918, "num_tokens": 28397578.0, "step": 13125 }, { "entropy": 6.506171226501465, "epoch": 1.4050510995772916, "grad_norm": 1.4453125, "learning_rate": 0.0004811537801578308, "loss": 6.3397, "mean_token_accuracy": 0.1259517602622509, "num_tokens": 28408933.0, "step": 13130 }, { "entropy": 6.503382349014283, "epoch": 1.4055861736850555, "grad_norm": 2.109375, "learning_rate": 0.00048113845967181346, "loss": 6.3245, "mean_token_accuracy": 0.12405535578727722, "num_tokens": 28421906.0, "step": 13135 }, { "entropy": 6.5776450634002686, "epoch": 1.4061212477928193, "grad_norm": 1.9375, "learning_rate": 0.000481123133233577, "loss": 6.2604, "mean_token_accuracy": 0.1332197055220604, "num_tokens": 28432677.0, "step": 13140 }, { "entropy": 6.573045492172241, "epoch": 1.4066563219005832, "grad_norm": 2.09375, "learning_rate": 0.00048110780084356414, "loss": 6.3598, "mean_token_accuracy": 0.13100109472870827, "num_tokens": 28443795.0, "step": 13145 }, { "entropy": 6.55504298210144, "epoch": 1.407191396008347, "grad_norm": 2.09375, "learning_rate": 0.0004810924625022174, "loss": 6.3319, "mean_token_accuracy": 0.13072033673524858, "num_tokens": 28455727.0, "step": 13150 }, { "entropy": 6.61231427192688, "epoch": 1.4077264701161112, "grad_norm": 1.9765625, "learning_rate": 0.0004810771182099799, "loss": 6.3518, "mean_token_accuracy": 0.12492276728153229, "num_tokens": 28467554.0, "step": 13155 }, { "entropy": 6.603960275650024, "epoch": 1.408261544223875, "grad_norm": 1.6171875, "learning_rate": 0.0004810617679672945, "loss": 6.3649, "mean_token_accuracy": 0.13161554783582688, "num_tokens": 28479268.0, "step": 13160 }, { "entropy": 6.55245041847229, "epoch": 1.408796618331639, "grad_norm": 4.375, "learning_rate": 0.00048104641177460443, "loss": 6.3518, "mean_token_accuracy": 0.12731072753667833, "num_tokens": 28489887.0, "step": 13165 }, { "entropy": 6.468415307998657, "epoch": 1.4093316924394028, "grad_norm": 1.8671875, "learning_rate": 0.0004810310496323533, "loss": 6.248, "mean_token_accuracy": 0.1380733884871006, "num_tokens": 28500736.0, "step": 13170 }, { "entropy": 6.470671081542969, "epoch": 1.4098667665471667, "grad_norm": 2.578125, "learning_rate": 0.00048101568154098446, "loss": 6.2256, "mean_token_accuracy": 0.13929775431752206, "num_tokens": 28511458.0, "step": 13175 }, { "entropy": 6.591119432449341, "epoch": 1.4104018406549308, "grad_norm": 2.109375, "learning_rate": 0.00048100030750094185, "loss": 6.3399, "mean_token_accuracy": 0.12569592297077178, "num_tokens": 28522354.0, "step": 13180 }, { "entropy": 6.534553337097168, "epoch": 1.4109369147626947, "grad_norm": 3.109375, "learning_rate": 0.0004809849275126693, "loss": 6.1849, "mean_token_accuracy": 0.1420965887606144, "num_tokens": 28533061.0, "step": 13185 }, { "entropy": 6.543464422225952, "epoch": 1.4114719888704585, "grad_norm": 1.828125, "learning_rate": 0.00048096954157661085, "loss": 6.3327, "mean_token_accuracy": 0.13191912025213243, "num_tokens": 28544230.0, "step": 13190 }, { "entropy": 6.528650999069214, "epoch": 1.4120070629782224, "grad_norm": 1.6953125, "learning_rate": 0.00048095414969321086, "loss": 6.3278, "mean_token_accuracy": 0.13371477872133256, "num_tokens": 28555461.0, "step": 13195 }, { "entropy": 6.5493683338165285, "epoch": 1.4125421370859863, "grad_norm": 1.8515625, "learning_rate": 0.00048093875186291376, "loss": 6.2443, "mean_token_accuracy": 0.13574814945459365, "num_tokens": 28565992.0, "step": 13200 }, { "entropy": 6.565684080123901, "epoch": 1.4130772111937504, "grad_norm": 1.859375, "learning_rate": 0.00048092334808616413, "loss": 6.2524, "mean_token_accuracy": 0.1374378241598606, "num_tokens": 28575802.0, "step": 13205 }, { "entropy": 6.535583209991455, "epoch": 1.4136122853015143, "grad_norm": 3.59375, "learning_rate": 0.0004809079383634067, "loss": 6.2492, "mean_token_accuracy": 0.1376635640859604, "num_tokens": 28586982.0, "step": 13210 }, { "entropy": 6.541072654724121, "epoch": 1.4141473594092782, "grad_norm": 2.390625, "learning_rate": 0.00048089252269508656, "loss": 6.3374, "mean_token_accuracy": 0.13196105509996414, "num_tokens": 28598267.0, "step": 13215 }, { "entropy": 6.574584054946899, "epoch": 1.414682433517042, "grad_norm": 2.125, "learning_rate": 0.00048087710108164874, "loss": 6.3057, "mean_token_accuracy": 0.1319591633975506, "num_tokens": 28608213.0, "step": 13220 }, { "entropy": 6.5331920146942135, "epoch": 1.415217507624806, "grad_norm": 1.796875, "learning_rate": 0.0004808616735235385, "loss": 6.2819, "mean_token_accuracy": 0.12543027997016906, "num_tokens": 28619674.0, "step": 13225 }, { "entropy": 6.551663255691528, "epoch": 1.41575258173257, "grad_norm": 2.953125, "learning_rate": 0.0004808462400212014, "loss": 6.2191, "mean_token_accuracy": 0.1338550068438053, "num_tokens": 28630824.0, "step": 13230 }, { "entropy": 6.50926718711853, "epoch": 1.416287655840334, "grad_norm": 1.84375, "learning_rate": 0.00048083080057508313, "loss": 6.3517, "mean_token_accuracy": 0.13014202639460565, "num_tokens": 28642270.0, "step": 13235 }, { "entropy": 6.521674776077271, "epoch": 1.4168227299480978, "grad_norm": 1.921875, "learning_rate": 0.00048081535518562933, "loss": 6.3362, "mean_token_accuracy": 0.12918935641646384, "num_tokens": 28653649.0, "step": 13240 }, { "entropy": 6.502331113815307, "epoch": 1.4173578040558619, "grad_norm": 1.9375, "learning_rate": 0.000480799903853286, "loss": 6.2151, "mean_token_accuracy": 0.13268271312117577, "num_tokens": 28664044.0, "step": 13245 }, { "entropy": 6.542404127120972, "epoch": 1.4178928781636255, "grad_norm": 4.46875, "learning_rate": 0.0004807844465784995, "loss": 6.2942, "mean_token_accuracy": 0.1345588520169258, "num_tokens": 28675394.0, "step": 13250 }, { "entropy": 6.529404735565185, "epoch": 1.4184279522713896, "grad_norm": 2.203125, "learning_rate": 0.00048076898336171596, "loss": 6.2856, "mean_token_accuracy": 0.14060317277908324, "num_tokens": 28686292.0, "step": 13255 }, { "entropy": 6.55095157623291, "epoch": 1.4189630263791535, "grad_norm": 1.5390625, "learning_rate": 0.00048075351420338196, "loss": 6.304, "mean_token_accuracy": 0.1346028797328472, "num_tokens": 28696928.0, "step": 13260 }, { "entropy": 6.495355653762817, "epoch": 1.4194981004869174, "grad_norm": 1.890625, "learning_rate": 0.0004807380391039441, "loss": 6.323, "mean_token_accuracy": 0.1321026124060154, "num_tokens": 28707986.0, "step": 13265 }, { "entropy": 6.614403247833252, "epoch": 1.4200331745946815, "grad_norm": 1.609375, "learning_rate": 0.00048072255806384936, "loss": 6.3291, "mean_token_accuracy": 0.1340144731104374, "num_tokens": 28719296.0, "step": 13270 }, { "entropy": 6.521930789947509, "epoch": 1.4205682487024454, "grad_norm": 1.6015625, "learning_rate": 0.0004807070710835447, "loss": 6.1843, "mean_token_accuracy": 0.13900391533970832, "num_tokens": 28729523.0, "step": 13275 }, { "entropy": 6.557798910140991, "epoch": 1.4211033228102092, "grad_norm": 1.9296875, "learning_rate": 0.0004806915781634771, "loss": 6.3166, "mean_token_accuracy": 0.1333258867263794, "num_tokens": 28739026.0, "step": 13280 }, { "entropy": 6.586025190353394, "epoch": 1.4216383969179731, "grad_norm": 1.703125, "learning_rate": 0.0004806760793040942, "loss": 6.399, "mean_token_accuracy": 0.12926854342222213, "num_tokens": 28749513.0, "step": 13285 }, { "entropy": 6.60874834060669, "epoch": 1.422173471025737, "grad_norm": 1.96875, "learning_rate": 0.00048066057450584334, "loss": 6.3034, "mean_token_accuracy": 0.1329214371740818, "num_tokens": 28760722.0, "step": 13290 }, { "entropy": 6.559692621231079, "epoch": 1.422708545133501, "grad_norm": 1.8828125, "learning_rate": 0.0004806450637691723, "loss": 6.2465, "mean_token_accuracy": 0.14297338128089904, "num_tokens": 28771235.0, "step": 13295 }, { "entropy": 6.531833028793335, "epoch": 1.423243619241265, "grad_norm": 1.53125, "learning_rate": 0.00048062954709452907, "loss": 6.2552, "mean_token_accuracy": 0.13588109463453293, "num_tokens": 28782642.0, "step": 13300 }, { "entropy": 6.541342067718506, "epoch": 1.4237786933490288, "grad_norm": 1.5546875, "learning_rate": 0.0004806140244823615, "loss": 6.2651, "mean_token_accuracy": 0.13098229318857194, "num_tokens": 28793628.0, "step": 13305 }, { "entropy": 6.587154912948608, "epoch": 1.4243137674567927, "grad_norm": 1.8203125, "learning_rate": 0.00048059849593311776, "loss": 6.3307, "mean_token_accuracy": 0.13464922532439233, "num_tokens": 28804034.0, "step": 13310 }, { "entropy": 6.551678323745728, "epoch": 1.4248488415645566, "grad_norm": 1.7734375, "learning_rate": 0.0004805829614472464, "loss": 6.2776, "mean_token_accuracy": 0.13238443210721015, "num_tokens": 28814679.0, "step": 13315 }, { "entropy": 6.510989809036255, "epoch": 1.4253839156723207, "grad_norm": 2.109375, "learning_rate": 0.00048056742102519593, "loss": 6.2973, "mean_token_accuracy": 0.12994106039404868, "num_tokens": 28825130.0, "step": 13320 }, { "entropy": 6.543405151367187, "epoch": 1.4259189897800846, "grad_norm": 1.6015625, "learning_rate": 0.00048055187466741506, "loss": 6.3261, "mean_token_accuracy": 0.12828193083405495, "num_tokens": 28835500.0, "step": 13325 }, { "entropy": 6.533200263977051, "epoch": 1.4264540638878485, "grad_norm": 1.390625, "learning_rate": 0.0004805363223743527, "loss": 6.2586, "mean_token_accuracy": 0.13435445576906205, "num_tokens": 28845794.0, "step": 13330 }, { "entropy": 6.59534273147583, "epoch": 1.4269891379956123, "grad_norm": 1.9921875, "learning_rate": 0.0004805207641464579, "loss": 6.2819, "mean_token_accuracy": 0.13006314858794213, "num_tokens": 28856326.0, "step": 13335 }, { "entropy": 6.506957912445069, "epoch": 1.4275242121033762, "grad_norm": 1.4921875, "learning_rate": 0.0004805051999841799, "loss": 6.2806, "mean_token_accuracy": 0.13344307169318198, "num_tokens": 28867592.0, "step": 13340 }, { "entropy": 6.606613874435425, "epoch": 1.4280592862111403, "grad_norm": 1.8828125, "learning_rate": 0.0004804896298879682, "loss": 6.4169, "mean_token_accuracy": 0.12649569064378738, "num_tokens": 28880352.0, "step": 13345 }, { "entropy": 6.59653148651123, "epoch": 1.4285943603189042, "grad_norm": 1.7578125, "learning_rate": 0.0004804740538582723, "loss": 6.2943, "mean_token_accuracy": 0.1322682738304138, "num_tokens": 28892012.0, "step": 13350 }, { "entropy": 6.579413747787475, "epoch": 1.429129434426668, "grad_norm": 1.65625, "learning_rate": 0.0004804584718955419, "loss": 6.2216, "mean_token_accuracy": 0.13726244121789932, "num_tokens": 28902247.0, "step": 13355 }, { "entropy": 6.508374929428101, "epoch": 1.429664508534432, "grad_norm": 1.90625, "learning_rate": 0.000480442884000227, "loss": 6.3598, "mean_token_accuracy": 0.13232571333646775, "num_tokens": 28913222.0, "step": 13360 }, { "entropy": 6.51956524848938, "epoch": 1.4301995826421958, "grad_norm": 1.609375, "learning_rate": 0.0004804272901727778, "loss": 6.2675, "mean_token_accuracy": 0.1339123398065567, "num_tokens": 28924038.0, "step": 13365 }, { "entropy": 6.582114124298096, "epoch": 1.43073465674996, "grad_norm": 1.421875, "learning_rate": 0.00048041169041364437, "loss": 6.3048, "mean_token_accuracy": 0.13865149021148682, "num_tokens": 28934448.0, "step": 13370 }, { "entropy": 6.542791557312012, "epoch": 1.4312697308577238, "grad_norm": 1.5546875, "learning_rate": 0.00048039608472327724, "loss": 6.2752, "mean_token_accuracy": 0.13437252789735793, "num_tokens": 28945175.0, "step": 13375 }, { "entropy": 6.499612092971802, "epoch": 1.4318048049654877, "grad_norm": 1.3828125, "learning_rate": 0.00048038047310212706, "loss": 6.2301, "mean_token_accuracy": 0.13937258571386338, "num_tokens": 28955116.0, "step": 13380 }, { "entropy": 6.548843431472778, "epoch": 1.4323398790732518, "grad_norm": 1.84375, "learning_rate": 0.00048036485555064454, "loss": 6.3369, "mean_token_accuracy": 0.13031953051686287, "num_tokens": 28966999.0, "step": 13385 }, { "entropy": 6.54577784538269, "epoch": 1.4328749531810157, "grad_norm": 1.9140625, "learning_rate": 0.00048034923206928065, "loss": 6.3134, "mean_token_accuracy": 0.12904799953103066, "num_tokens": 28977388.0, "step": 13390 }, { "entropy": 6.539524078369141, "epoch": 1.4334100272887795, "grad_norm": 1.6640625, "learning_rate": 0.00048033360265848664, "loss": 6.2086, "mean_token_accuracy": 0.13839732706546784, "num_tokens": 28987792.0, "step": 13395 }, { "entropy": 6.613337612152099, "epoch": 1.4339451013965434, "grad_norm": 2.25, "learning_rate": 0.00048031796731871364, "loss": 6.3435, "mean_token_accuracy": 0.13307096138596536, "num_tokens": 28998319.0, "step": 13400 }, { "entropy": 6.5337625503540036, "epoch": 1.4344801755043073, "grad_norm": 1.359375, "learning_rate": 0.00048030232605041323, "loss": 6.318, "mean_token_accuracy": 0.13027154058218002, "num_tokens": 29007942.0, "step": 13405 }, { "entropy": 6.594687223434448, "epoch": 1.4350152496120714, "grad_norm": 1.4296875, "learning_rate": 0.0004802866788540369, "loss": 6.3017, "mean_token_accuracy": 0.13362317085266112, "num_tokens": 29018217.0, "step": 13410 }, { "entropy": 6.587049055099487, "epoch": 1.4355503237198353, "grad_norm": 1.71875, "learning_rate": 0.0004802710257300367, "loss": 6.3129, "mean_token_accuracy": 0.131132273375988, "num_tokens": 29028472.0, "step": 13415 }, { "entropy": 6.5456602573394775, "epoch": 1.4360853978275991, "grad_norm": 1.7109375, "learning_rate": 0.0004802553666788644, "loss": 6.2708, "mean_token_accuracy": 0.13706605061888694, "num_tokens": 29040553.0, "step": 13420 }, { "entropy": 6.571896696090699, "epoch": 1.436620471935363, "grad_norm": 1.7109375, "learning_rate": 0.00048023970170097226, "loss": 6.3087, "mean_token_accuracy": 0.13039797320961952, "num_tokens": 29050142.0, "step": 13425 }, { "entropy": 6.510137319564819, "epoch": 1.437155546043127, "grad_norm": 1.7265625, "learning_rate": 0.00048022403079681254, "loss": 6.2515, "mean_token_accuracy": 0.12999855652451514, "num_tokens": 29061762.0, "step": 13430 }, { "entropy": 6.549421262741089, "epoch": 1.437690620150891, "grad_norm": 2.71875, "learning_rate": 0.00048020835396683775, "loss": 6.3199, "mean_token_accuracy": 0.1308118633925915, "num_tokens": 29072095.0, "step": 13435 }, { "entropy": 6.60357551574707, "epoch": 1.4382256942586549, "grad_norm": 2.890625, "learning_rate": 0.00048019267121150066, "loss": 6.3243, "mean_token_accuracy": 0.13163482919335365, "num_tokens": 29082561.0, "step": 13440 }, { "entropy": 6.5486468315124515, "epoch": 1.4387607683664188, "grad_norm": 1.6796875, "learning_rate": 0.00048017698253125397, "loss": 6.2671, "mean_token_accuracy": 0.13364253789186478, "num_tokens": 29093813.0, "step": 13445 }, { "entropy": 6.52044939994812, "epoch": 1.4392958424741826, "grad_norm": 1.46875, "learning_rate": 0.0004801612879265507, "loss": 6.2736, "mean_token_accuracy": 0.1357661746442318, "num_tokens": 29104064.0, "step": 13450 }, { "entropy": 6.494532108306885, "epoch": 1.4398309165819465, "grad_norm": 1.890625, "learning_rate": 0.0004801455873978442, "loss": 6.3013, "mean_token_accuracy": 0.12913288176059723, "num_tokens": 29115086.0, "step": 13455 }, { "entropy": 6.536068773269653, "epoch": 1.4403659906897106, "grad_norm": 1.8671875, "learning_rate": 0.0004801298809455876, "loss": 6.2578, "mean_token_accuracy": 0.14133179932832718, "num_tokens": 29125536.0, "step": 13460 }, { "entropy": 6.583189058303833, "epoch": 1.4409010647974745, "grad_norm": 1.5234375, "learning_rate": 0.0004801141685702345, "loss": 6.3452, "mean_token_accuracy": 0.13120611384510994, "num_tokens": 29137007.0, "step": 13465 }, { "entropy": 6.567616033554077, "epoch": 1.4414361389052384, "grad_norm": 1.6171875, "learning_rate": 0.00048009845027223864, "loss": 6.3332, "mean_token_accuracy": 0.12379435449838638, "num_tokens": 29147072.0, "step": 13470 }, { "entropy": 6.576822185516358, "epoch": 1.4419712130130022, "grad_norm": 1.578125, "learning_rate": 0.00048008272605205377, "loss": 6.2946, "mean_token_accuracy": 0.13404594883322715, "num_tokens": 29157803.0, "step": 13475 }, { "entropy": 6.559188413619995, "epoch": 1.4425062871207661, "grad_norm": 1.3671875, "learning_rate": 0.00048006699591013417, "loss": 6.2698, "mean_token_accuracy": 0.13357484936714173, "num_tokens": 29168173.0, "step": 13480 }, { "entropy": 6.614182090759277, "epoch": 1.4430413612285302, "grad_norm": 2.171875, "learning_rate": 0.0004800512598469337, "loss": 6.3512, "mean_token_accuracy": 0.1211496539413929, "num_tokens": 29179377.0, "step": 13485 }, { "entropy": 6.5842859745025635, "epoch": 1.443576435336294, "grad_norm": 1.765625, "learning_rate": 0.000480035517862907, "loss": 6.3174, "mean_token_accuracy": 0.13456696942448615, "num_tokens": 29190909.0, "step": 13490 }, { "entropy": 6.492300939559937, "epoch": 1.444111509444058, "grad_norm": 1.671875, "learning_rate": 0.00048001976995850856, "loss": 6.2312, "mean_token_accuracy": 0.13400312289595603, "num_tokens": 29200977.0, "step": 13495 }, { "entropy": 6.5454717636108395, "epoch": 1.4446465835518219, "grad_norm": 1.78125, "learning_rate": 0.00048000401613419296, "loss": 6.2857, "mean_token_accuracy": 0.12763061225414277, "num_tokens": 29210702.0, "step": 13500 }, { "entropy": 6.604302883148193, "epoch": 1.4451816576595857, "grad_norm": 1.7578125, "learning_rate": 0.00047998825639041534, "loss": 6.371, "mean_token_accuracy": 0.12395200505852699, "num_tokens": 29221338.0, "step": 13505 }, { "entropy": 6.613165950775146, "epoch": 1.4457167317673498, "grad_norm": 1.9296875, "learning_rate": 0.0004799724907276306, "loss": 6.2309, "mean_token_accuracy": 0.1429674044251442, "num_tokens": 29232091.0, "step": 13510 }, { "entropy": 6.482897043228149, "epoch": 1.4462518058751137, "grad_norm": 1.4375, "learning_rate": 0.0004799567191462939, "loss": 6.2302, "mean_token_accuracy": 0.13581477701663972, "num_tokens": 29241903.0, "step": 13515 }, { "entropy": 6.5058026790618895, "epoch": 1.4467868799828776, "grad_norm": 1.578125, "learning_rate": 0.00047994094164686074, "loss": 6.3454, "mean_token_accuracy": 0.13214331939816476, "num_tokens": 29253414.0, "step": 13520 }, { "entropy": 6.605631923675537, "epoch": 1.4473219540906417, "grad_norm": 1.5390625, "learning_rate": 0.0004799251582297868, "loss": 6.2308, "mean_token_accuracy": 0.14136453941464425, "num_tokens": 29264066.0, "step": 13525 }, { "entropy": 6.567365121841431, "epoch": 1.4478570281984056, "grad_norm": 1.6875, "learning_rate": 0.00047990936889552767, "loss": 6.2819, "mean_token_accuracy": 0.13597942665219306, "num_tokens": 29274915.0, "step": 13530 }, { "entropy": 6.507847166061401, "epoch": 1.4483921023061694, "grad_norm": 1.9453125, "learning_rate": 0.0004798935736445392, "loss": 6.2805, "mean_token_accuracy": 0.12975036427378656, "num_tokens": 29287345.0, "step": 13535 }, { "entropy": 6.491131067276001, "epoch": 1.4489271764139333, "grad_norm": 2.015625, "learning_rate": 0.0004798777724772777, "loss": 6.2513, "mean_token_accuracy": 0.14119713753461838, "num_tokens": 29297432.0, "step": 13540 }, { "entropy": 6.509729433059692, "epoch": 1.4494622505216972, "grad_norm": 1.7265625, "learning_rate": 0.00047986196539419936, "loss": 6.1922, "mean_token_accuracy": 0.14158949628472328, "num_tokens": 29307534.0, "step": 13545 }, { "entropy": 6.549173402786255, "epoch": 1.4499973246294613, "grad_norm": 2.015625, "learning_rate": 0.0004798461523957604, "loss": 6.261, "mean_token_accuracy": 0.1374451108276844, "num_tokens": 29319412.0, "step": 13550 }, { "entropy": 6.498152875900269, "epoch": 1.4505323987372252, "grad_norm": 1.7109375, "learning_rate": 0.00047983033348241767, "loss": 6.2279, "mean_token_accuracy": 0.14251604452729225, "num_tokens": 29330477.0, "step": 13555 }, { "entropy": 6.484377861022949, "epoch": 1.451067472844989, "grad_norm": 1.5546875, "learning_rate": 0.0004798145086546278, "loss": 6.2648, "mean_token_accuracy": 0.13428061753511428, "num_tokens": 29341481.0, "step": 13560 }, { "entropy": 6.485887670516968, "epoch": 1.451602546952753, "grad_norm": 1.875, "learning_rate": 0.0004797986779128478, "loss": 6.2452, "mean_token_accuracy": 0.13639950677752494, "num_tokens": 29353273.0, "step": 13565 }, { "entropy": 6.57791223526001, "epoch": 1.4521376210605168, "grad_norm": 2.34375, "learning_rate": 0.0004797828412575348, "loss": 6.2914, "mean_token_accuracy": 0.1361882768571377, "num_tokens": 29364108.0, "step": 13570 }, { "entropy": 6.495282173156738, "epoch": 1.452672695168281, "grad_norm": 1.71875, "learning_rate": 0.00047976699868914594, "loss": 6.2636, "mean_token_accuracy": 0.13775565326213837, "num_tokens": 29375272.0, "step": 13575 }, { "entropy": 6.505160570144653, "epoch": 1.4532077692760448, "grad_norm": 1.671875, "learning_rate": 0.0004797511502081388, "loss": 6.2756, "mean_token_accuracy": 0.1332462415099144, "num_tokens": 29385749.0, "step": 13580 }, { "entropy": 6.517300844192505, "epoch": 1.4537428433838087, "grad_norm": 2.59375, "learning_rate": 0.000479735295814971, "loss": 6.2187, "mean_token_accuracy": 0.13782110810279846, "num_tokens": 29396430.0, "step": 13585 }, { "entropy": 6.536860084533691, "epoch": 1.4542779174915725, "grad_norm": 1.84375, "learning_rate": 0.00047971943551010035, "loss": 6.2744, "mean_token_accuracy": 0.1307387612760067, "num_tokens": 29407020.0, "step": 13590 }, { "entropy": 6.546886920928955, "epoch": 1.4548129915993364, "grad_norm": 1.3515625, "learning_rate": 0.00047970356929398467, "loss": 6.2929, "mean_token_accuracy": 0.13745293468236924, "num_tokens": 29418428.0, "step": 13595 }, { "entropy": 6.565701627731324, "epoch": 1.4553480657071005, "grad_norm": 2.125, "learning_rate": 0.0004796876971670822, "loss": 6.3544, "mean_token_accuracy": 0.13378758504986762, "num_tokens": 29430611.0, "step": 13600 }, { "entropy": 6.5439074516296385, "epoch": 1.4558831398148644, "grad_norm": 1.40625, "learning_rate": 0.0004796718191298512, "loss": 6.2849, "mean_token_accuracy": 0.1257310539484024, "num_tokens": 29441545.0, "step": 13605 }, { "entropy": 6.5851068019866945, "epoch": 1.4564182139226283, "grad_norm": 1.6640625, "learning_rate": 0.0004796559351827503, "loss": 6.3695, "mean_token_accuracy": 0.12765171527862548, "num_tokens": 29452529.0, "step": 13610 }, { "entropy": 6.539608526229858, "epoch": 1.4569532880303921, "grad_norm": 2.015625, "learning_rate": 0.000479640045326238, "loss": 6.2582, "mean_token_accuracy": 0.1369820587337017, "num_tokens": 29463860.0, "step": 13615 }, { "entropy": 6.653084325790405, "epoch": 1.457488362138156, "grad_norm": 2.234375, "learning_rate": 0.0004796241495607731, "loss": 6.3325, "mean_token_accuracy": 0.1349804438650608, "num_tokens": 29475004.0, "step": 13620 }, { "entropy": 6.55041766166687, "epoch": 1.4580234362459201, "grad_norm": 1.8984375, "learning_rate": 0.0004796082478868146, "loss": 6.404, "mean_token_accuracy": 0.12528412342071532, "num_tokens": 29485921.0, "step": 13625 }, { "entropy": 6.542591524124146, "epoch": 1.458558510353684, "grad_norm": 1.546875, "learning_rate": 0.00047959234030482185, "loss": 6.2517, "mean_token_accuracy": 0.14472676813602448, "num_tokens": 29495729.0, "step": 13630 }, { "entropy": 6.577525520324707, "epoch": 1.4590935844614479, "grad_norm": 1.546875, "learning_rate": 0.0004795764268152538, "loss": 6.3172, "mean_token_accuracy": 0.12774155661463737, "num_tokens": 29506051.0, "step": 13635 }, { "entropy": 6.524970769882202, "epoch": 1.4596286585692118, "grad_norm": 1.4140625, "learning_rate": 0.0004795605074185704, "loss": 6.2786, "mean_token_accuracy": 0.13325700610876084, "num_tokens": 29516234.0, "step": 13640 }, { "entropy": 6.549506521224975, "epoch": 1.4601637326769756, "grad_norm": 1.828125, "learning_rate": 0.00047954458211523095, "loss": 6.2701, "mean_token_accuracy": 0.1349295660853386, "num_tokens": 29527649.0, "step": 13645 }, { "entropy": 6.586029481887818, "epoch": 1.4606988067847397, "grad_norm": 2.3125, "learning_rate": 0.00047952865090569545, "loss": 6.3473, "mean_token_accuracy": 0.12580158188939095, "num_tokens": 29539150.0, "step": 13650 }, { "entropy": 6.520464706420898, "epoch": 1.4612338808925036, "grad_norm": 1.3359375, "learning_rate": 0.00047951271379042393, "loss": 6.2065, "mean_token_accuracy": 0.13591403812170028, "num_tokens": 29550058.0, "step": 13655 }, { "entropy": 6.423491668701172, "epoch": 1.4617689550002675, "grad_norm": 1.546875, "learning_rate": 0.0004794967707698765, "loss": 6.2296, "mean_token_accuracy": 0.1430532529950142, "num_tokens": 29560377.0, "step": 13660 }, { "entropy": 6.435001087188721, "epoch": 1.4623040291080316, "grad_norm": 1.421875, "learning_rate": 0.0004794808218445136, "loss": 6.164, "mean_token_accuracy": 0.14599157869815826, "num_tokens": 29571378.0, "step": 13665 }, { "entropy": 6.5370715141296385, "epoch": 1.4628391032157955, "grad_norm": 2.125, "learning_rate": 0.00047946486701479576, "loss": 6.3144, "mean_token_accuracy": 0.13308701068162918, "num_tokens": 29582187.0, "step": 13670 }, { "entropy": 6.541687440872193, "epoch": 1.4633741773235593, "grad_norm": 1.734375, "learning_rate": 0.0004794489062811835, "loss": 6.2925, "mean_token_accuracy": 0.12842457219958306, "num_tokens": 29592982.0, "step": 13675 }, { "entropy": 6.587422132492065, "epoch": 1.4639092514313232, "grad_norm": 2.09375, "learning_rate": 0.0004794329396441378, "loss": 6.2746, "mean_token_accuracy": 0.13194804191589354, "num_tokens": 29603639.0, "step": 13680 }, { "entropy": 6.5431897163391115, "epoch": 1.464444325539087, "grad_norm": 1.78125, "learning_rate": 0.00047941696710411975, "loss": 6.2195, "mean_token_accuracy": 0.14435758888721467, "num_tokens": 29615103.0, "step": 13685 }, { "entropy": 6.532386589050293, "epoch": 1.4649793996468512, "grad_norm": 1.8203125, "learning_rate": 0.0004794009886615904, "loss": 6.2905, "mean_token_accuracy": 0.13263922408223153, "num_tokens": 29626184.0, "step": 13690 }, { "entropy": 6.555911445617676, "epoch": 1.465514473754615, "grad_norm": 1.6171875, "learning_rate": 0.00047938500431701135, "loss": 6.2819, "mean_token_accuracy": 0.14328787550330163, "num_tokens": 29637615.0, "step": 13695 }, { "entropy": 6.551273775100708, "epoch": 1.466049547862379, "grad_norm": 2.046875, "learning_rate": 0.000479369014070844, "loss": 6.3061, "mean_token_accuracy": 0.13311365023255348, "num_tokens": 29648648.0, "step": 13700 }, { "entropy": 6.516896438598633, "epoch": 1.4665846219701428, "grad_norm": 1.640625, "learning_rate": 0.00047935301792355003, "loss": 6.2647, "mean_token_accuracy": 0.13810425996780396, "num_tokens": 29660542.0, "step": 13705 }, { "entropy": 6.551743841171264, "epoch": 1.4671196960779067, "grad_norm": 1.4375, "learning_rate": 0.0004793370158755914, "loss": 6.3163, "mean_token_accuracy": 0.13373398035764694, "num_tokens": 29670342.0, "step": 13710 }, { "entropy": 6.513361167907715, "epoch": 1.4676547701856708, "grad_norm": 1.765625, "learning_rate": 0.00047932100792743014, "loss": 6.2694, "mean_token_accuracy": 0.13930255994200708, "num_tokens": 29681191.0, "step": 13715 }, { "entropy": 6.534385299682617, "epoch": 1.4681898442934347, "grad_norm": 1.6171875, "learning_rate": 0.00047930499407952855, "loss": 6.2056, "mean_token_accuracy": 0.14330771416425706, "num_tokens": 29691299.0, "step": 13720 }, { "entropy": 6.518677663803101, "epoch": 1.4687249184011986, "grad_norm": 2.453125, "learning_rate": 0.00047928897433234893, "loss": 6.2598, "mean_token_accuracy": 0.1339192159473896, "num_tokens": 29702125.0, "step": 13725 }, { "entropy": 6.5021195888519285, "epoch": 1.4692599925089624, "grad_norm": 2.0625, "learning_rate": 0.0004792729486863539, "loss": 6.2881, "mean_token_accuracy": 0.1327348917722702, "num_tokens": 29712679.0, "step": 13730 }, { "entropy": 6.5093645572662355, "epoch": 1.4697950666167263, "grad_norm": 1.453125, "learning_rate": 0.0004792569171420061, "loss": 6.2286, "mean_token_accuracy": 0.13891081213951112, "num_tokens": 29723833.0, "step": 13735 }, { "entropy": 6.586244106292725, "epoch": 1.4703301407244904, "grad_norm": 2.046875, "learning_rate": 0.0004792408796997687, "loss": 6.3336, "mean_token_accuracy": 0.13556601256132125, "num_tokens": 29734646.0, "step": 13740 }, { "entropy": 6.5740937232971195, "epoch": 1.4708652148322543, "grad_norm": 1.640625, "learning_rate": 0.0004792248363601044, "loss": 6.2924, "mean_token_accuracy": 0.1350928321480751, "num_tokens": 29745129.0, "step": 13745 }, { "entropy": 6.5654994487762455, "epoch": 1.4714002889400182, "grad_norm": 1.4921875, "learning_rate": 0.0004792087871234767, "loss": 6.2918, "mean_token_accuracy": 0.12818465679883956, "num_tokens": 29756308.0, "step": 13750 }, { "entropy": 6.4984032154083256, "epoch": 1.471935363047782, "grad_norm": 2.296875, "learning_rate": 0.000479192731990349, "loss": 6.2943, "mean_token_accuracy": 0.13055193796753883, "num_tokens": 29767835.0, "step": 13755 }, { "entropy": 6.546389532089234, "epoch": 1.472470437155546, "grad_norm": 1.65625, "learning_rate": 0.0004791766709611849, "loss": 6.3208, "mean_token_accuracy": 0.13507338240742683, "num_tokens": 29778776.0, "step": 13760 }, { "entropy": 6.670673084259033, "epoch": 1.47300551126331, "grad_norm": 1.53125, "learning_rate": 0.000479160604036448, "loss": 6.3501, "mean_token_accuracy": 0.12552779018878937, "num_tokens": 29788800.0, "step": 13765 }, { "entropy": 6.547731256484985, "epoch": 1.473540585371074, "grad_norm": 1.4921875, "learning_rate": 0.0004791445312166025, "loss": 6.2572, "mean_token_accuracy": 0.14021070525050164, "num_tokens": 29799375.0, "step": 13770 }, { "entropy": 6.555331897735596, "epoch": 1.4740756594788378, "grad_norm": 1.3515625, "learning_rate": 0.0004791284525021122, "loss": 6.3837, "mean_token_accuracy": 0.124832434207201, "num_tokens": 29811267.0, "step": 13775 }, { "entropy": 6.5536736965179445, "epoch": 1.4746107335866017, "grad_norm": 1.625, "learning_rate": 0.0004791123678934416, "loss": 6.3248, "mean_token_accuracy": 0.13412302434444429, "num_tokens": 29821616.0, "step": 13780 }, { "entropy": 6.535737466812134, "epoch": 1.4751458076943655, "grad_norm": 1.6953125, "learning_rate": 0.0004790962773910551, "loss": 6.2842, "mean_token_accuracy": 0.13453632444143296, "num_tokens": 29832233.0, "step": 13785 }, { "entropy": 6.596752595901489, "epoch": 1.4756808818021296, "grad_norm": 1.65625, "learning_rate": 0.00047908018099541717, "loss": 6.2757, "mean_token_accuracy": 0.13443198055028915, "num_tokens": 29843465.0, "step": 13790 }, { "entropy": 6.515512847900391, "epoch": 1.4762159559098935, "grad_norm": 1.296875, "learning_rate": 0.0004790640787069927, "loss": 6.1577, "mean_token_accuracy": 0.1415461152791977, "num_tokens": 29854123.0, "step": 13795 }, { "entropy": 6.578099298477173, "epoch": 1.4767510300176574, "grad_norm": 2.671875, "learning_rate": 0.0004790479705262467, "loss": 6.3739, "mean_token_accuracy": 0.12471452876925468, "num_tokens": 29864831.0, "step": 13800 }, { "entropy": 6.5273661613464355, "epoch": 1.4772861041254215, "grad_norm": 1.546875, "learning_rate": 0.0004790318564536441, "loss": 6.2325, "mean_token_accuracy": 0.1310821369290352, "num_tokens": 29876273.0, "step": 13805 }, { "entropy": 6.530851984024048, "epoch": 1.4778211782331854, "grad_norm": 1.7578125, "learning_rate": 0.00047901573648965047, "loss": 6.2287, "mean_token_accuracy": 0.1352597825229168, "num_tokens": 29886560.0, "step": 13810 }, { "entropy": 6.513718509674073, "epoch": 1.4783562523409493, "grad_norm": 1.6953125, "learning_rate": 0.000478999610634731, "loss": 6.2266, "mean_token_accuracy": 0.13684219866991043, "num_tokens": 29896916.0, "step": 13815 }, { "entropy": 6.504454469680786, "epoch": 1.4788913264487131, "grad_norm": 1.53125, "learning_rate": 0.0004789834788893515, "loss": 6.3091, "mean_token_accuracy": 0.1282836228609085, "num_tokens": 29907288.0, "step": 13820 }, { "entropy": 6.495414209365845, "epoch": 1.479426400556477, "grad_norm": 1.53125, "learning_rate": 0.0004789673412539777, "loss": 6.2345, "mean_token_accuracy": 0.13465062901377678, "num_tokens": 29918194.0, "step": 13825 }, { "entropy": 6.546362638473511, "epoch": 1.479961474664241, "grad_norm": 1.390625, "learning_rate": 0.00047895119772907566, "loss": 6.2754, "mean_token_accuracy": 0.13627072498202325, "num_tokens": 29928521.0, "step": 13830 }, { "entropy": 6.507249212265014, "epoch": 1.480496548772005, "grad_norm": 2.25, "learning_rate": 0.0004789350483151113, "loss": 6.2223, "mean_token_accuracy": 0.1304092951118946, "num_tokens": 29938885.0, "step": 13835 }, { "entropy": 6.5725428581237795, "epoch": 1.4810316228797689, "grad_norm": 1.8046875, "learning_rate": 0.0004789188930125512, "loss": 6.3045, "mean_token_accuracy": 0.14193991646170617, "num_tokens": 29948921.0, "step": 13840 }, { "entropy": 6.509477281570435, "epoch": 1.4815666969875327, "grad_norm": 1.6640625, "learning_rate": 0.0004789027318218616, "loss": 6.206, "mean_token_accuracy": 0.1386758007109165, "num_tokens": 29959633.0, "step": 13845 }, { "entropy": 6.521372222900391, "epoch": 1.4821017710952966, "grad_norm": 1.6953125, "learning_rate": 0.0004788865647435093, "loss": 6.2541, "mean_token_accuracy": 0.12845197916030884, "num_tokens": 29970639.0, "step": 13850 }, { "entropy": 6.569345569610595, "epoch": 1.4826368452030607, "grad_norm": 1.578125, "learning_rate": 0.0004788703917779612, "loss": 6.3545, "mean_token_accuracy": 0.13183851465582846, "num_tokens": 29981752.0, "step": 13855 }, { "entropy": 6.550051879882813, "epoch": 1.4831719193108246, "grad_norm": 1.8125, "learning_rate": 0.0004788542129256841, "loss": 6.1886, "mean_token_accuracy": 0.13968370780348777, "num_tokens": 29991037.0, "step": 13860 }, { "entropy": 6.495801591873169, "epoch": 1.4837069934185885, "grad_norm": 1.515625, "learning_rate": 0.00047883802818714526, "loss": 6.3029, "mean_token_accuracy": 0.12434751689434051, "num_tokens": 30001980.0, "step": 13865 }, { "entropy": 6.548546266555786, "epoch": 1.4842420675263523, "grad_norm": 1.78125, "learning_rate": 0.000478821837562812, "loss": 6.3013, "mean_token_accuracy": 0.1336070977151394, "num_tokens": 30013377.0, "step": 13870 }, { "entropy": 6.556598281860351, "epoch": 1.4847771416341162, "grad_norm": 1.6171875, "learning_rate": 0.0004788056410531518, "loss": 6.3398, "mean_token_accuracy": 0.1366582117974758, "num_tokens": 30023909.0, "step": 13875 }, { "entropy": 6.483535861968994, "epoch": 1.4853122157418803, "grad_norm": 1.4765625, "learning_rate": 0.0004787894386586324, "loss": 6.2288, "mean_token_accuracy": 0.13616093918681144, "num_tokens": 30034069.0, "step": 13880 }, { "entropy": 6.478453683853149, "epoch": 1.4858472898496442, "grad_norm": 1.421875, "learning_rate": 0.00047877323037972153, "loss": 6.2289, "mean_token_accuracy": 0.14070839509367944, "num_tokens": 30043940.0, "step": 13885 }, { "entropy": 6.490971994400025, "epoch": 1.486382363957408, "grad_norm": 3.296875, "learning_rate": 0.0004787570162168874, "loss": 6.2126, "mean_token_accuracy": 0.13903133794665337, "num_tokens": 30054985.0, "step": 13890 }, { "entropy": 6.538230991363525, "epoch": 1.486917438065172, "grad_norm": 2.125, "learning_rate": 0.00047874079617059783, "loss": 6.2364, "mean_token_accuracy": 0.13630077689886094, "num_tokens": 30065675.0, "step": 13895 }, { "entropy": 6.529196262359619, "epoch": 1.4874525121729358, "grad_norm": 2.9375, "learning_rate": 0.0004787245702413216, "loss": 6.2044, "mean_token_accuracy": 0.13694037944078447, "num_tokens": 30075305.0, "step": 13900 }, { "entropy": 6.554997396469116, "epoch": 1.4879875862807, "grad_norm": 1.9453125, "learning_rate": 0.00047870833842952697, "loss": 6.3097, "mean_token_accuracy": 0.1343739703297615, "num_tokens": 30087309.0, "step": 13905 }, { "entropy": 6.530051851272583, "epoch": 1.4885226603884638, "grad_norm": 1.8125, "learning_rate": 0.0004786921007356827, "loss": 6.2222, "mean_token_accuracy": 0.13209329545497894, "num_tokens": 30097262.0, "step": 13910 }, { "entropy": 6.552338790893555, "epoch": 1.4890577344962277, "grad_norm": 1.6484375, "learning_rate": 0.00047867585716025767, "loss": 6.3252, "mean_token_accuracy": 0.13659584522247314, "num_tokens": 30107067.0, "step": 13915 }, { "entropy": 6.586587572097779, "epoch": 1.4895928086039918, "grad_norm": 2.3125, "learning_rate": 0.0004786596077037209, "loss": 6.3192, "mean_token_accuracy": 0.13181559294462203, "num_tokens": 30117115.0, "step": 13920 }, { "entropy": 6.603874158859253, "epoch": 1.4901278827117554, "grad_norm": 1.6328125, "learning_rate": 0.00047864335236654144, "loss": 6.265, "mean_token_accuracy": 0.13400094211101532, "num_tokens": 30127202.0, "step": 13925 }, { "entropy": 6.465754890441895, "epoch": 1.4906629568195195, "grad_norm": 1.421875, "learning_rate": 0.0004786270911491889, "loss": 6.2487, "mean_token_accuracy": 0.1353141985833645, "num_tokens": 30138608.0, "step": 13930 }, { "entropy": 6.546110582351685, "epoch": 1.4911980309272834, "grad_norm": 1.859375, "learning_rate": 0.0004786108240521327, "loss": 6.3064, "mean_token_accuracy": 0.137214232981205, "num_tokens": 30148500.0, "step": 13935 }, { "entropy": 6.447632646560669, "epoch": 1.4917331050350473, "grad_norm": 1.578125, "learning_rate": 0.00047859455107584256, "loss": 6.2103, "mean_token_accuracy": 0.13803261518478394, "num_tokens": 30159062.0, "step": 13940 }, { "entropy": 6.514106750488281, "epoch": 1.4922681791428114, "grad_norm": 2.3125, "learning_rate": 0.00047857827222078835, "loss": 6.2742, "mean_token_accuracy": 0.1323826126754284, "num_tokens": 30170468.0, "step": 13945 }, { "entropy": 6.460741758346558, "epoch": 1.4928032532505753, "grad_norm": 1.8671875, "learning_rate": 0.0004785619874874402, "loss": 6.1446, "mean_token_accuracy": 0.14026360735297203, "num_tokens": 30180944.0, "step": 13950 }, { "entropy": 6.476769304275512, "epoch": 1.4933383273583392, "grad_norm": 1.640625, "learning_rate": 0.0004785456968762682, "loss": 6.1668, "mean_token_accuracy": 0.14123549163341523, "num_tokens": 30191614.0, "step": 13955 }, { "entropy": 6.498686170578003, "epoch": 1.493873401466103, "grad_norm": 1.6328125, "learning_rate": 0.00047852940038774276, "loss": 6.2076, "mean_token_accuracy": 0.13988643661141395, "num_tokens": 30202035.0, "step": 13960 }, { "entropy": 6.434373903274536, "epoch": 1.494408475573867, "grad_norm": 1.96875, "learning_rate": 0.00047851309802233457, "loss": 6.2865, "mean_token_accuracy": 0.13843541741371154, "num_tokens": 30213205.0, "step": 13965 }, { "entropy": 6.578490686416626, "epoch": 1.494943549681631, "grad_norm": 1.9453125, "learning_rate": 0.0004784967897805143, "loss": 6.2942, "mean_token_accuracy": 0.13502900078892707, "num_tokens": 30223971.0, "step": 13970 }, { "entropy": 6.575396299362183, "epoch": 1.495478623789395, "grad_norm": 1.4609375, "learning_rate": 0.0004784804756627528, "loss": 6.2904, "mean_token_accuracy": 0.1325635604560375, "num_tokens": 30235346.0, "step": 13975 }, { "entropy": 6.551068210601807, "epoch": 1.4960136978971588, "grad_norm": 1.5625, "learning_rate": 0.00047846415566952106, "loss": 6.2403, "mean_token_accuracy": 0.13519833534955977, "num_tokens": 30246033.0, "step": 13980 }, { "entropy": 6.463932752609253, "epoch": 1.4965487720049226, "grad_norm": 1.75, "learning_rate": 0.00047844782980129057, "loss": 6.2976, "mean_token_accuracy": 0.13278683871030808, "num_tokens": 30258208.0, "step": 13985 }, { "entropy": 6.499045562744141, "epoch": 1.4970838461126865, "grad_norm": 2.328125, "learning_rate": 0.00047843149805853254, "loss": 6.3017, "mean_token_accuracy": 0.13239005208015442, "num_tokens": 30268824.0, "step": 13990 }, { "entropy": 6.578220367431641, "epoch": 1.4976189202204506, "grad_norm": 2.0, "learning_rate": 0.0004784151604417185, "loss": 6.3454, "mean_token_accuracy": 0.12390814051032066, "num_tokens": 30280078.0, "step": 13995 }, { "entropy": 6.530854082107544, "epoch": 1.4981539943282145, "grad_norm": 1.671875, "learning_rate": 0.00047839881695132034, "loss": 6.2298, "mean_token_accuracy": 0.142520771920681, "num_tokens": 30290939.0, "step": 14000 }, { "entropy": 6.495736074447632, "epoch": 1.4986890684359784, "grad_norm": 1.7265625, "learning_rate": 0.00047838246758780996, "loss": 6.2733, "mean_token_accuracy": 0.13784620389342309, "num_tokens": 30301198.0, "step": 14005 }, { "entropy": 6.5063807487487795, "epoch": 1.4992241425437423, "grad_norm": 2.546875, "learning_rate": 0.0004783661123516593, "loss": 6.2377, "mean_token_accuracy": 0.13562998846173285, "num_tokens": 30312021.0, "step": 14010 }, { "entropy": 6.539398670196533, "epoch": 1.4997592166515061, "grad_norm": 1.75, "learning_rate": 0.0004783497512433408, "loss": 6.2485, "mean_token_accuracy": 0.13483910784125328, "num_tokens": 30323335.0, "step": 14015 }, { "entropy": 6.546143436431885, "epoch": 1.5002942907592702, "grad_norm": 2.15625, "learning_rate": 0.0004783333842633268, "loss": 6.2819, "mean_token_accuracy": 0.14089713245630264, "num_tokens": 30334389.0, "step": 14020 }, { "entropy": 6.457803583145141, "epoch": 1.500829364867034, "grad_norm": 1.921875, "learning_rate": 0.00047831701141208994, "loss": 6.233, "mean_token_accuracy": 0.13121172934770584, "num_tokens": 30345407.0, "step": 14025 }, { "entropy": 6.502495861053466, "epoch": 1.501364438974798, "grad_norm": 1.59375, "learning_rate": 0.00047830063269010286, "loss": 6.2574, "mean_token_accuracy": 0.1314643941819668, "num_tokens": 30356718.0, "step": 14030 }, { "entropy": 6.511676168441772, "epoch": 1.501899513082562, "grad_norm": 1.625, "learning_rate": 0.00047828424809783865, "loss": 6.2161, "mean_token_accuracy": 0.13534914702177048, "num_tokens": 30367617.0, "step": 14035 }, { "entropy": 6.525033664703369, "epoch": 1.5024345871903257, "grad_norm": 1.5625, "learning_rate": 0.0004782678576357703, "loss": 6.2518, "mean_token_accuracy": 0.1353394605219364, "num_tokens": 30377923.0, "step": 14040 }, { "entropy": 6.498504686355591, "epoch": 1.5029696612980898, "grad_norm": 2.4375, "learning_rate": 0.0004782514613043711, "loss": 6.2498, "mean_token_accuracy": 0.13915505409240722, "num_tokens": 30388719.0, "step": 14045 }, { "entropy": 6.5068888664245605, "epoch": 1.5035047354058537, "grad_norm": 2.4375, "learning_rate": 0.00047823505910411465, "loss": 6.1937, "mean_token_accuracy": 0.1380567654967308, "num_tokens": 30400191.0, "step": 14050 }, { "entropy": 6.531849670410156, "epoch": 1.5040398095136176, "grad_norm": 1.5546875, "learning_rate": 0.00047821865103547437, "loss": 6.2835, "mean_token_accuracy": 0.1362235277891159, "num_tokens": 30410267.0, "step": 14055 }, { "entropy": 6.547566223144531, "epoch": 1.5045748836213817, "grad_norm": 2.0625, "learning_rate": 0.000478202237098924, "loss": 6.2937, "mean_token_accuracy": 0.131100395321846, "num_tokens": 30420852.0, "step": 14060 }, { "entropy": 6.565202426910401, "epoch": 1.5051099577291454, "grad_norm": 2.421875, "learning_rate": 0.0004781858172949376, "loss": 6.3362, "mean_token_accuracy": 0.1344304248690605, "num_tokens": 30432214.0, "step": 14065 }, { "entropy": 6.567050838470459, "epoch": 1.5056450318369095, "grad_norm": 1.984375, "learning_rate": 0.0004781693916239894, "loss": 6.3408, "mean_token_accuracy": 0.12420830205082893, "num_tokens": 30443919.0, "step": 14070 }, { "entropy": 6.571396207809448, "epoch": 1.5061801059446733, "grad_norm": 2.734375, "learning_rate": 0.00047815296008655347, "loss": 6.3968, "mean_token_accuracy": 0.1250197820365429, "num_tokens": 30453930.0, "step": 14075 }, { "entropy": 6.539173603057861, "epoch": 1.5067151800524372, "grad_norm": 2.46875, "learning_rate": 0.00047813652268310436, "loss": 6.2897, "mean_token_accuracy": 0.12643647491931914, "num_tokens": 30464612.0, "step": 14080 }, { "entropy": 6.526119232177734, "epoch": 1.5072502541602013, "grad_norm": 1.8359375, "learning_rate": 0.00047812007941411673, "loss": 6.241, "mean_token_accuracy": 0.13565285205841066, "num_tokens": 30474819.0, "step": 14085 }, { "entropy": 6.497172927856445, "epoch": 1.507785328267965, "grad_norm": 1.5234375, "learning_rate": 0.00047810363028006535, "loss": 6.224, "mean_token_accuracy": 0.14370110183954238, "num_tokens": 30485481.0, "step": 14090 }, { "entropy": 6.500015735626221, "epoch": 1.508320402375729, "grad_norm": 1.671875, "learning_rate": 0.0004780871752814252, "loss": 6.2542, "mean_token_accuracy": 0.1386760003864765, "num_tokens": 30496321.0, "step": 14095 }, { "entropy": 6.493804264068603, "epoch": 1.508855476483493, "grad_norm": 1.6640625, "learning_rate": 0.0004780707144186714, "loss": 6.3542, "mean_token_accuracy": 0.13237425908446313, "num_tokens": 30507578.0, "step": 14100 }, { "entropy": 6.619511842727661, "epoch": 1.5093905505912568, "grad_norm": 1.5078125, "learning_rate": 0.00047805424769227923, "loss": 6.2831, "mean_token_accuracy": 0.13486289009451866, "num_tokens": 30518328.0, "step": 14105 }, { "entropy": 6.507578802108765, "epoch": 1.509925624699021, "grad_norm": 7.46875, "learning_rate": 0.00047803777510272425, "loss": 6.2604, "mean_token_accuracy": 0.1352337084710598, "num_tokens": 30528555.0, "step": 14110 }, { "entropy": 6.45980315208435, "epoch": 1.5104606988067846, "grad_norm": 1.515625, "learning_rate": 0.000478021296650482, "loss": 6.1892, "mean_token_accuracy": 0.13908951058983804, "num_tokens": 30540217.0, "step": 14115 }, { "entropy": 6.581186199188233, "epoch": 1.5109957729145487, "grad_norm": 1.6875, "learning_rate": 0.0004780048123360283, "loss": 6.3195, "mean_token_accuracy": 0.13534327372908592, "num_tokens": 30550937.0, "step": 14120 }, { "entropy": 6.610339212417602, "epoch": 1.5115308470223126, "grad_norm": 1.59375, "learning_rate": 0.00047798832215983916, "loss": 6.2955, "mean_token_accuracy": 0.13681161478161813, "num_tokens": 30562248.0, "step": 14125 }, { "entropy": 6.576951932907105, "epoch": 1.5120659211300764, "grad_norm": 2.203125, "learning_rate": 0.0004779718261223908, "loss": 6.3061, "mean_token_accuracy": 0.13611859753727912, "num_tokens": 30573362.0, "step": 14130 }, { "entropy": 6.5235360622406, "epoch": 1.5126009952378405, "grad_norm": 1.4140625, "learning_rate": 0.00047795532422415947, "loss": 6.2861, "mean_token_accuracy": 0.13528222739696502, "num_tokens": 30584052.0, "step": 14135 }, { "entropy": 6.521787309646607, "epoch": 1.5131360693456044, "grad_norm": 1.6328125, "learning_rate": 0.0004779388164656217, "loss": 6.3147, "mean_token_accuracy": 0.12935080379247665, "num_tokens": 30594630.0, "step": 14140 }, { "entropy": 6.546995544433594, "epoch": 1.5136711434533683, "grad_norm": 2.4375, "learning_rate": 0.00047792230284725415, "loss": 6.2667, "mean_token_accuracy": 0.13568148985505105, "num_tokens": 30605625.0, "step": 14145 }, { "entropy": 6.531518650054932, "epoch": 1.5142062175611322, "grad_norm": 1.765625, "learning_rate": 0.00047790578336953356, "loss": 6.2531, "mean_token_accuracy": 0.13517610654234885, "num_tokens": 30616520.0, "step": 14150 }, { "entropy": 6.540752983093261, "epoch": 1.514741291668896, "grad_norm": 1.921875, "learning_rate": 0.000477889258032937, "loss": 6.2306, "mean_token_accuracy": 0.14312789514660834, "num_tokens": 30627372.0, "step": 14155 }, { "entropy": 6.500818586349487, "epoch": 1.5152763657766601, "grad_norm": 1.5703125, "learning_rate": 0.00047787272683794157, "loss": 6.2189, "mean_token_accuracy": 0.14515245854854583, "num_tokens": 30636974.0, "step": 14160 }, { "entropy": 6.509118890762329, "epoch": 1.515811439884424, "grad_norm": 1.6796875, "learning_rate": 0.0004778561897850247, "loss": 6.2895, "mean_token_accuracy": 0.13736924827098845, "num_tokens": 30648202.0, "step": 14165 }, { "entropy": 6.517179250717163, "epoch": 1.516346513992188, "grad_norm": 1.90625, "learning_rate": 0.00047783964687466384, "loss": 6.2843, "mean_token_accuracy": 0.1314311482012272, "num_tokens": 30657981.0, "step": 14170 }, { "entropy": 6.537102222442627, "epoch": 1.516881588099952, "grad_norm": 1.65625, "learning_rate": 0.00047782309810733676, "loss": 6.2882, "mean_token_accuracy": 0.12622129172086716, "num_tokens": 30668496.0, "step": 14175 }, { "entropy": 6.487250185012817, "epoch": 1.5174166622077156, "grad_norm": 3.515625, "learning_rate": 0.00047780654348352115, "loss": 6.1805, "mean_token_accuracy": 0.1400587297976017, "num_tokens": 30678868.0, "step": 14180 }, { "entropy": 6.53211088180542, "epoch": 1.5179517363154797, "grad_norm": 1.7421875, "learning_rate": 0.00047778998300369516, "loss": 6.3361, "mean_token_accuracy": 0.1377688691020012, "num_tokens": 30690066.0, "step": 14185 }, { "entropy": 6.4703638553619385, "epoch": 1.5184868104232436, "grad_norm": 3.359375, "learning_rate": 0.0004777734166683368, "loss": 6.1984, "mean_token_accuracy": 0.14053755551576613, "num_tokens": 30700624.0, "step": 14190 }, { "entropy": 6.486501932144165, "epoch": 1.5190218845310075, "grad_norm": 1.5546875, "learning_rate": 0.00047775684447792457, "loss": 6.2265, "mean_token_accuracy": 0.13751474767923355, "num_tokens": 30711183.0, "step": 14195 }, { "entropy": 6.509814453125, "epoch": 1.5195569586387716, "grad_norm": 1.5078125, "learning_rate": 0.000477740266432937, "loss": 6.2449, "mean_token_accuracy": 0.14190192744135857, "num_tokens": 30721446.0, "step": 14200 }, { "entropy": 6.549847173690796, "epoch": 1.5200920327465353, "grad_norm": 2.5625, "learning_rate": 0.00047772368253385267, "loss": 6.2907, "mean_token_accuracy": 0.12940879687666892, "num_tokens": 30731901.0, "step": 14205 }, { "entropy": 6.535141515731811, "epoch": 1.5206271068542994, "grad_norm": 1.6171875, "learning_rate": 0.0004777070927811505, "loss": 6.2551, "mean_token_accuracy": 0.13085372596979142, "num_tokens": 30741701.0, "step": 14210 }, { "entropy": 6.526335382461548, "epoch": 1.5211621809620632, "grad_norm": 2.015625, "learning_rate": 0.00047769049717530956, "loss": 6.2713, "mean_token_accuracy": 0.13423371836543083, "num_tokens": 30751594.0, "step": 14215 }, { "entropy": 6.504735708236694, "epoch": 1.5216972550698271, "grad_norm": 1.6875, "learning_rate": 0.00047767389571680896, "loss": 6.3522, "mean_token_accuracy": 0.126288815587759, "num_tokens": 30764418.0, "step": 14220 }, { "entropy": 6.558633089065552, "epoch": 1.5222323291775912, "grad_norm": 1.484375, "learning_rate": 0.0004776572884061281, "loss": 6.27, "mean_token_accuracy": 0.13761670440435408, "num_tokens": 30773976.0, "step": 14225 }, { "entropy": 6.582456445693969, "epoch": 1.5227674032853549, "grad_norm": 1.640625, "learning_rate": 0.0004776406752437465, "loss": 6.294, "mean_token_accuracy": 0.13682678043842317, "num_tokens": 30784210.0, "step": 14230 }, { "entropy": 6.518918085098266, "epoch": 1.523302477393119, "grad_norm": 1.8359375, "learning_rate": 0.0004776240562301438, "loss": 6.3403, "mean_token_accuracy": 0.12842216491699218, "num_tokens": 30794322.0, "step": 14235 }, { "entropy": 6.564871597290039, "epoch": 1.5238375515008828, "grad_norm": 1.703125, "learning_rate": 0.0004776074313658001, "loss": 6.2875, "mean_token_accuracy": 0.14118874147534372, "num_tokens": 30805264.0, "step": 14240 }, { "entropy": 6.4882111072540285, "epoch": 1.5243726256086467, "grad_norm": 1.625, "learning_rate": 0.0004775908006511952, "loss": 6.2633, "mean_token_accuracy": 0.1359029680490494, "num_tokens": 30815909.0, "step": 14245 }, { "entropy": 6.599324750900268, "epoch": 1.5249076997164108, "grad_norm": 1.6328125, "learning_rate": 0.0004775741640868095, "loss": 6.2546, "mean_token_accuracy": 0.13517858684062958, "num_tokens": 30826867.0, "step": 14250 }, { "entropy": 6.58244743347168, "epoch": 1.5254427738241747, "grad_norm": 1.4375, "learning_rate": 0.00047755752167312314, "loss": 6.2282, "mean_token_accuracy": 0.13037005066871643, "num_tokens": 30837696.0, "step": 14255 }, { "entropy": 6.473442888259887, "epoch": 1.5259778479319386, "grad_norm": 1.84375, "learning_rate": 0.0004775408734106169, "loss": 6.2567, "mean_token_accuracy": 0.13493726029992104, "num_tokens": 30848155.0, "step": 14260 }, { "entropy": 6.436830806732178, "epoch": 1.5265129220397025, "grad_norm": 1.5625, "learning_rate": 0.00047752421929977143, "loss": 6.1409, "mean_token_accuracy": 0.14483771175146104, "num_tokens": 30857804.0, "step": 14265 }, { "entropy": 6.536058521270752, "epoch": 1.5270479961474663, "grad_norm": 1.4453125, "learning_rate": 0.0004775075593410675, "loss": 6.2746, "mean_token_accuracy": 0.13746241480112076, "num_tokens": 30867290.0, "step": 14270 }, { "entropy": 6.5432713508605955, "epoch": 1.5275830702552304, "grad_norm": 1.265625, "learning_rate": 0.00047749089353498625, "loss": 6.3467, "mean_token_accuracy": 0.13378921225667, "num_tokens": 30877634.0, "step": 14275 }, { "entropy": 6.527502536773682, "epoch": 1.5281181443629943, "grad_norm": 1.609375, "learning_rate": 0.000477474221882009, "loss": 6.3047, "mean_token_accuracy": 0.13290925249457358, "num_tokens": 30889176.0, "step": 14280 }, { "entropy": 6.57243766784668, "epoch": 1.5286532184707582, "grad_norm": 1.84375, "learning_rate": 0.0004774575443826169, "loss": 6.2157, "mean_token_accuracy": 0.13979230374097823, "num_tokens": 30899516.0, "step": 14285 }, { "entropy": 6.54964919090271, "epoch": 1.5291882925785223, "grad_norm": 1.8359375, "learning_rate": 0.0004774408610372918, "loss": 6.3118, "mean_token_accuracy": 0.13416342735290526, "num_tokens": 30910155.0, "step": 14290 }, { "entropy": 6.551747894287109, "epoch": 1.529723366686286, "grad_norm": 1.7421875, "learning_rate": 0.0004774241718465152, "loss": 6.3294, "mean_token_accuracy": 0.1300183728337288, "num_tokens": 30921486.0, "step": 14295 }, { "entropy": 6.567112255096435, "epoch": 1.53025844079405, "grad_norm": 3.484375, "learning_rate": 0.0004774074768107691, "loss": 6.2681, "mean_token_accuracy": 0.13543465435504914, "num_tokens": 30932361.0, "step": 14300 }, { "entropy": 6.5201342582702635, "epoch": 1.530793514901814, "grad_norm": 1.625, "learning_rate": 0.00047739077593053554, "loss": 6.2528, "mean_token_accuracy": 0.13535121381282805, "num_tokens": 30943033.0, "step": 14305 }, { "entropy": 6.5211255073547365, "epoch": 1.5313285890095778, "grad_norm": 2.078125, "learning_rate": 0.00047737406920629675, "loss": 6.2404, "mean_token_accuracy": 0.13891438469290734, "num_tokens": 30953094.0, "step": 14310 }, { "entropy": 6.535080623626709, "epoch": 1.531863663117342, "grad_norm": 1.9765625, "learning_rate": 0.00047735735663853514, "loss": 6.2691, "mean_token_accuracy": 0.13467931300401687, "num_tokens": 30964604.0, "step": 14315 }, { "entropy": 6.569497537612915, "epoch": 1.5323987372251056, "grad_norm": 1.828125, "learning_rate": 0.0004773406382277334, "loss": 6.3294, "mean_token_accuracy": 0.13067164942622184, "num_tokens": 30975681.0, "step": 14320 }, { "entropy": 6.575937509536743, "epoch": 1.5329338113328697, "grad_norm": 1.75, "learning_rate": 0.0004773239139743741, "loss": 6.2984, "mean_token_accuracy": 0.12989215925335884, "num_tokens": 30986319.0, "step": 14325 }, { "entropy": 6.52880539894104, "epoch": 1.5334688854406335, "grad_norm": 1.359375, "learning_rate": 0.0004773071838789402, "loss": 6.2534, "mean_token_accuracy": 0.13588482588529588, "num_tokens": 30997077.0, "step": 14330 }, { "entropy": 6.48135142326355, "epoch": 1.5340039595483974, "grad_norm": 1.59375, "learning_rate": 0.0004772904479419148, "loss": 6.1722, "mean_token_accuracy": 0.13954296559095383, "num_tokens": 31007485.0, "step": 14335 }, { "entropy": 6.50969672203064, "epoch": 1.5345390336561615, "grad_norm": 1.734375, "learning_rate": 0.0004772737061637811, "loss": 6.2747, "mean_token_accuracy": 0.14038911312818528, "num_tokens": 31017827.0, "step": 14340 }, { "entropy": 6.547337579727173, "epoch": 1.5350741077639252, "grad_norm": 1.875, "learning_rate": 0.00047725695854502267, "loss": 6.2938, "mean_token_accuracy": 0.1367683343589306, "num_tokens": 31028167.0, "step": 14345 }, { "entropy": 6.506247043609619, "epoch": 1.5356091818716893, "grad_norm": 2.109375, "learning_rate": 0.00047724020508612287, "loss": 6.2354, "mean_token_accuracy": 0.13793734312057496, "num_tokens": 31038941.0, "step": 14350 }, { "entropy": 6.509874773025513, "epoch": 1.5361442559794531, "grad_norm": 1.796875, "learning_rate": 0.00047722344578756564, "loss": 6.2597, "mean_token_accuracy": 0.13013634383678435, "num_tokens": 31049949.0, "step": 14355 }, { "entropy": 6.57332935333252, "epoch": 1.536679330087217, "grad_norm": 1.40625, "learning_rate": 0.00047720668064983476, "loss": 6.2486, "mean_token_accuracy": 0.13523405343294143, "num_tokens": 31059299.0, "step": 14360 }, { "entropy": 6.518624258041382, "epoch": 1.5372144041949811, "grad_norm": 1.6953125, "learning_rate": 0.0004771899096734145, "loss": 6.3483, "mean_token_accuracy": 0.12761058509349824, "num_tokens": 31070508.0, "step": 14365 }, { "entropy": 6.454201030731201, "epoch": 1.5377494783027448, "grad_norm": 1.640625, "learning_rate": 0.00047717313285878886, "loss": 6.24, "mean_token_accuracy": 0.13824471086263657, "num_tokens": 31082354.0, "step": 14370 }, { "entropy": 6.685629796981812, "epoch": 1.5382845524105089, "grad_norm": 1.421875, "learning_rate": 0.00047715635020644247, "loss": 6.3821, "mean_token_accuracy": 0.1280341513454914, "num_tokens": 31093496.0, "step": 14375 }, { "entropy": 6.581520366668701, "epoch": 1.5388196265182728, "grad_norm": 1.96875, "learning_rate": 0.00047713956171685994, "loss": 6.2291, "mean_token_accuracy": 0.13955939933657646, "num_tokens": 31104289.0, "step": 14380 }, { "entropy": 6.408662891387939, "epoch": 1.5393547006260366, "grad_norm": 1.578125, "learning_rate": 0.000477122767390526, "loss": 6.1777, "mean_token_accuracy": 0.1459297515451908, "num_tokens": 31114998.0, "step": 14385 }, { "entropy": 6.475273132324219, "epoch": 1.5398897747338007, "grad_norm": 1.5625, "learning_rate": 0.00047710596722792543, "loss": 6.2817, "mean_token_accuracy": 0.13103958070278168, "num_tokens": 31127393.0, "step": 14390 }, { "entropy": 6.476905965805054, "epoch": 1.5404248488415646, "grad_norm": 2.125, "learning_rate": 0.0004770891612295435, "loss": 6.1077, "mean_token_accuracy": 0.15151217132806777, "num_tokens": 31137484.0, "step": 14395 }, { "entropy": 6.524506330490112, "epoch": 1.5409599229493285, "grad_norm": 1.515625, "learning_rate": 0.0004770723493958654, "loss": 6.3205, "mean_token_accuracy": 0.13329991921782494, "num_tokens": 31147863.0, "step": 14400 }, { "entropy": 6.464319705963135, "epoch": 1.5414949970570924, "grad_norm": 1.484375, "learning_rate": 0.0004770555317273767, "loss": 6.2025, "mean_token_accuracy": 0.13622017651796342, "num_tokens": 31159018.0, "step": 14405 }, { "entropy": 6.558589506149292, "epoch": 1.5420300711648562, "grad_norm": 1.90625, "learning_rate": 0.00047703870822456287, "loss": 6.2174, "mean_token_accuracy": 0.13448593094944955, "num_tokens": 31170673.0, "step": 14410 }, { "entropy": 6.438023281097412, "epoch": 1.5425651452726203, "grad_norm": 1.8125, "learning_rate": 0.0004770218788879097, "loss": 6.0972, "mean_token_accuracy": 0.14730842560529708, "num_tokens": 31181165.0, "step": 14415 }, { "entropy": 6.370760583877564, "epoch": 1.5431002193803842, "grad_norm": 1.703125, "learning_rate": 0.0004770050437179033, "loss": 6.2412, "mean_token_accuracy": 0.13814024552702903, "num_tokens": 31192976.0, "step": 14420 }, { "entropy": 6.539438915252686, "epoch": 1.543635293488148, "grad_norm": 1.5078125, "learning_rate": 0.0004769882027150295, "loss": 6.3375, "mean_token_accuracy": 0.13710992708802222, "num_tokens": 31203979.0, "step": 14425 }, { "entropy": 6.561808919906616, "epoch": 1.5441703675959122, "grad_norm": 1.7265625, "learning_rate": 0.00047697135587977473, "loss": 6.2099, "mean_token_accuracy": 0.14149817302823067, "num_tokens": 31214972.0, "step": 14430 }, { "entropy": 6.556917285919189, "epoch": 1.5447054417036759, "grad_norm": 1.4765625, "learning_rate": 0.00047695450321262546, "loss": 6.3216, "mean_token_accuracy": 0.13588785231113434, "num_tokens": 31224726.0, "step": 14435 }, { "entropy": 6.527967166900635, "epoch": 1.54524051581144, "grad_norm": 2.21875, "learning_rate": 0.0004769376447140683, "loss": 6.2022, "mean_token_accuracy": 0.13984608128666878, "num_tokens": 31235761.0, "step": 14440 }, { "entropy": 6.522278881072998, "epoch": 1.5457755899192038, "grad_norm": 2.25, "learning_rate": 0.00047692078038459015, "loss": 6.3109, "mean_token_accuracy": 0.14084505960345267, "num_tokens": 31246221.0, "step": 14445 }, { "entropy": 6.535905742645264, "epoch": 1.5463106640269677, "grad_norm": 1.5234375, "learning_rate": 0.0004769039102246777, "loss": 6.2541, "mean_token_accuracy": 0.12931643798947334, "num_tokens": 31257364.0, "step": 14450 }, { "entropy": 6.5485001564025875, "epoch": 1.5468457381347318, "grad_norm": 1.765625, "learning_rate": 0.00047688703423481827, "loss": 6.2703, "mean_token_accuracy": 0.13121291548013686, "num_tokens": 31268343.0, "step": 14455 }, { "entropy": 6.530178070068359, "epoch": 1.5473808122424955, "grad_norm": 1.421875, "learning_rate": 0.00047687015241549896, "loss": 6.3008, "mean_token_accuracy": 0.13335917592048646, "num_tokens": 31278335.0, "step": 14460 }, { "entropy": 6.505687570571899, "epoch": 1.5479158863502596, "grad_norm": 1.4140625, "learning_rate": 0.0004768532647672075, "loss": 6.2148, "mean_token_accuracy": 0.12822186350822448, "num_tokens": 31288537.0, "step": 14465 }, { "entropy": 6.440744066238404, "epoch": 1.5484509604580234, "grad_norm": 1.2734375, "learning_rate": 0.0004768363712904314, "loss": 6.2354, "mean_token_accuracy": 0.14038474783301352, "num_tokens": 31299353.0, "step": 14470 }, { "entropy": 6.5596130847930905, "epoch": 1.5489860345657873, "grad_norm": 1.96875, "learning_rate": 0.0004768194719856584, "loss": 6.2527, "mean_token_accuracy": 0.1316815972328186, "num_tokens": 31309655.0, "step": 14475 }, { "entropy": 6.525741004943848, "epoch": 1.5495211086735514, "grad_norm": 1.4375, "learning_rate": 0.0004768025668533765, "loss": 6.315, "mean_token_accuracy": 0.13498535379767418, "num_tokens": 31321008.0, "step": 14480 }, { "entropy": 6.472729158401489, "epoch": 1.550056182781315, "grad_norm": 1.453125, "learning_rate": 0.00047678565589407383, "loss": 6.185, "mean_token_accuracy": 0.1401698887348175, "num_tokens": 31331978.0, "step": 14485 }, { "entropy": 6.510477113723755, "epoch": 1.5505912568890792, "grad_norm": 1.3671875, "learning_rate": 0.0004767687391082387, "loss": 6.2444, "mean_token_accuracy": 0.1391635164618492, "num_tokens": 31341703.0, "step": 14490 }, { "entropy": 6.5434596061706545, "epoch": 1.551126330996843, "grad_norm": 1.3359375, "learning_rate": 0.00047675181649635965, "loss": 6.2757, "mean_token_accuracy": 0.13907155245542527, "num_tokens": 31352787.0, "step": 14495 }, { "entropy": 6.4846821308135985, "epoch": 1.551661405104607, "grad_norm": 1.6328125, "learning_rate": 0.00047673488805892515, "loss": 6.2654, "mean_token_accuracy": 0.13517796471714974, "num_tokens": 31363702.0, "step": 14500 }, { "entropy": 6.530848407745362, "epoch": 1.552196479212371, "grad_norm": 1.34375, "learning_rate": 0.00047671795379642415, "loss": 6.2377, "mean_token_accuracy": 0.12709226831793785, "num_tokens": 31374719.0, "step": 14505 }, { "entropy": 6.620404386520386, "epoch": 1.5527315533201347, "grad_norm": 2.875, "learning_rate": 0.0004767010137093456, "loss": 6.3672, "mean_token_accuracy": 0.12480267137289047, "num_tokens": 31386289.0, "step": 14510 }, { "entropy": 6.537449836730957, "epoch": 1.5532666274278988, "grad_norm": 1.46875, "learning_rate": 0.00047668406779817864, "loss": 6.1873, "mean_token_accuracy": 0.14198817759752275, "num_tokens": 31397103.0, "step": 14515 }, { "entropy": 6.51537299156189, "epoch": 1.5538017015356627, "grad_norm": 1.4609375, "learning_rate": 0.0004766671160634125, "loss": 6.2841, "mean_token_accuracy": 0.13656345903873443, "num_tokens": 31408715.0, "step": 14520 }, { "entropy": 6.582148265838623, "epoch": 1.5543367756434265, "grad_norm": 1.7265625, "learning_rate": 0.0004766501585055367, "loss": 6.3024, "mean_token_accuracy": 0.1285000301897526, "num_tokens": 31420365.0, "step": 14525 }, { "entropy": 6.546790933609008, "epoch": 1.5548718497511906, "grad_norm": 2.25, "learning_rate": 0.000476633195125041, "loss": 6.2135, "mean_token_accuracy": 0.13490134105086327, "num_tokens": 31431635.0, "step": 14530 }, { "entropy": 6.520722341537476, "epoch": 1.5554069238589545, "grad_norm": 1.40625, "learning_rate": 0.00047661622592241507, "loss": 6.2576, "mean_token_accuracy": 0.13644103407859803, "num_tokens": 31442513.0, "step": 14535 }, { "entropy": 6.521498155593872, "epoch": 1.5559419979667184, "grad_norm": 1.3125, "learning_rate": 0.0004765992508981489, "loss": 6.2933, "mean_token_accuracy": 0.1281339019536972, "num_tokens": 31453726.0, "step": 14540 }, { "entropy": 6.541304016113282, "epoch": 1.5564770720744823, "grad_norm": 1.3671875, "learning_rate": 0.0004765822700527328, "loss": 6.2009, "mean_token_accuracy": 0.1394302561879158, "num_tokens": 31463980.0, "step": 14545 }, { "entropy": 6.500122165679931, "epoch": 1.5570121461822461, "grad_norm": 2.046875, "learning_rate": 0.0004765652833866569, "loss": 6.3489, "mean_token_accuracy": 0.12963479459285737, "num_tokens": 31474615.0, "step": 14550 }, { "entropy": 6.462019920349121, "epoch": 1.5575472202900102, "grad_norm": 1.7109375, "learning_rate": 0.0004765482909004118, "loss": 6.2117, "mean_token_accuracy": 0.14140638411045076, "num_tokens": 31485283.0, "step": 14555 }, { "entropy": 6.535767030715943, "epoch": 1.5580822943977741, "grad_norm": 1.46875, "learning_rate": 0.0004765312925944881, "loss": 6.2584, "mean_token_accuracy": 0.13080894574522972, "num_tokens": 31496997.0, "step": 14560 }, { "entropy": 6.6297478675842285, "epoch": 1.558617368505538, "grad_norm": 2.84375, "learning_rate": 0.00047651428846937673, "loss": 6.276, "mean_token_accuracy": 0.1357246607542038, "num_tokens": 31507585.0, "step": 14565 }, { "entropy": 6.511379718780518, "epoch": 1.559152442613302, "grad_norm": 1.7109375, "learning_rate": 0.00047649727852556854, "loss": 6.1847, "mean_token_accuracy": 0.13770078867673874, "num_tokens": 31517078.0, "step": 14570 }, { "entropy": 6.370854806900025, "epoch": 1.5596875167210658, "grad_norm": 3.296875, "learning_rate": 0.0004764802627635547, "loss": 6.1966, "mean_token_accuracy": 0.14397168532013893, "num_tokens": 31528576.0, "step": 14575 }, { "entropy": 6.582043838500977, "epoch": 1.5602225908288299, "grad_norm": 1.4609375, "learning_rate": 0.0004764632411838266, "loss": 6.2935, "mean_token_accuracy": 0.12686383947730065, "num_tokens": 31540095.0, "step": 14580 }, { "entropy": 6.544200801849366, "epoch": 1.5607576649365937, "grad_norm": 2.03125, "learning_rate": 0.00047644621378687573, "loss": 6.2075, "mean_token_accuracy": 0.13072769418358804, "num_tokens": 31550980.0, "step": 14585 }, { "entropy": 6.3452962875366214, "epoch": 1.5612927390443576, "grad_norm": 3.0625, "learning_rate": 0.00047642918057319377, "loss": 6.0208, "mean_token_accuracy": 0.15695239156484603, "num_tokens": 31561842.0, "step": 14590 }, { "entropy": 6.525337028503418, "epoch": 1.5618278131521217, "grad_norm": 2.640625, "learning_rate": 0.0004764121415432725, "loss": 6.3623, "mean_token_accuracy": 0.12762523368000983, "num_tokens": 31572798.0, "step": 14595 }, { "entropy": 6.54258165359497, "epoch": 1.5623628872598854, "grad_norm": 1.75, "learning_rate": 0.0004763950966976039, "loss": 6.3345, "mean_token_accuracy": 0.13119860887527465, "num_tokens": 31584774.0, "step": 14600 }, { "entropy": 6.536434745788574, "epoch": 1.5628979613676495, "grad_norm": 1.3828125, "learning_rate": 0.0004763780460366803, "loss": 6.2323, "mean_token_accuracy": 0.13397064805030823, "num_tokens": 31596197.0, "step": 14605 }, { "entropy": 6.550236940383911, "epoch": 1.5634330354754133, "grad_norm": 2.4375, "learning_rate": 0.0004763609895609939, "loss": 6.2697, "mean_token_accuracy": 0.13484611362218857, "num_tokens": 31607455.0, "step": 14610 }, { "entropy": 6.561938524246216, "epoch": 1.5639681095831772, "grad_norm": 1.6484375, "learning_rate": 0.00047634392727103714, "loss": 6.3114, "mean_token_accuracy": 0.13227349519729614, "num_tokens": 31618995.0, "step": 14615 }, { "entropy": 6.468525743484497, "epoch": 1.5645031836909413, "grad_norm": 1.328125, "learning_rate": 0.0004763268591673028, "loss": 6.1841, "mean_token_accuracy": 0.13631799519062043, "num_tokens": 31629984.0, "step": 14620 }, { "entropy": 6.492383766174316, "epoch": 1.565038257798705, "grad_norm": 1.703125, "learning_rate": 0.0004763097852502837, "loss": 6.1968, "mean_token_accuracy": 0.13692545443773269, "num_tokens": 31641362.0, "step": 14625 }, { "entropy": 6.5297730445861815, "epoch": 1.565573331906469, "grad_norm": 2.625, "learning_rate": 0.00047629270552047284, "loss": 6.3723, "mean_token_accuracy": 0.12706034481525422, "num_tokens": 31652650.0, "step": 14630 }, { "entropy": 6.5213886260986325, "epoch": 1.566108406014233, "grad_norm": 2.453125, "learning_rate": 0.00047627561997836337, "loss": 6.2875, "mean_token_accuracy": 0.12873518839478493, "num_tokens": 31664201.0, "step": 14635 }, { "entropy": 6.579891300201416, "epoch": 1.5666434801219968, "grad_norm": 1.578125, "learning_rate": 0.0004762585286244487, "loss": 6.2509, "mean_token_accuracy": 0.13287581130862236, "num_tokens": 31674480.0, "step": 14640 }, { "entropy": 6.5407298564910885, "epoch": 1.567178554229761, "grad_norm": 1.421875, "learning_rate": 0.00047624143145922227, "loss": 6.2555, "mean_token_accuracy": 0.1364641495049, "num_tokens": 31685377.0, "step": 14645 }, { "entropy": 6.54713773727417, "epoch": 1.5677136283375246, "grad_norm": 1.5703125, "learning_rate": 0.00047622432848317775, "loss": 6.2556, "mean_token_accuracy": 0.13927348628640174, "num_tokens": 31695199.0, "step": 14650 }, { "entropy": 6.462022686004639, "epoch": 1.5682487024452887, "grad_norm": 1.6328125, "learning_rate": 0.0004762072196968091, "loss": 6.268, "mean_token_accuracy": 0.13694618120789528, "num_tokens": 31705528.0, "step": 14655 }, { "entropy": 6.4519548416137695, "epoch": 1.5687837765530526, "grad_norm": 1.859375, "learning_rate": 0.0004761901051006102, "loss": 6.2195, "mean_token_accuracy": 0.14057985618710517, "num_tokens": 31718156.0, "step": 14660 }, { "entropy": 6.518571949005127, "epoch": 1.5693188506608164, "grad_norm": 2.28125, "learning_rate": 0.00047617298469507534, "loss": 6.2554, "mean_token_accuracy": 0.1364244446158409, "num_tokens": 31729783.0, "step": 14665 }, { "entropy": 6.5569658279418945, "epoch": 1.5698539247685805, "grad_norm": 1.75, "learning_rate": 0.0004761558584806988, "loss": 6.2264, "mean_token_accuracy": 0.1388966977596283, "num_tokens": 31740796.0, "step": 14670 }, { "entropy": 6.588993740081787, "epoch": 1.5703889988763444, "grad_norm": 1.921875, "learning_rate": 0.0004761387264579751, "loss": 6.3151, "mean_token_accuracy": 0.13168300688266754, "num_tokens": 31750559.0, "step": 14675 }, { "entropy": 6.521017694473267, "epoch": 1.5709240729841083, "grad_norm": 1.5546875, "learning_rate": 0.0004761215886273989, "loss": 6.1991, "mean_token_accuracy": 0.13765431344509124, "num_tokens": 31761559.0, "step": 14680 }, { "entropy": 6.494146347045898, "epoch": 1.5714591470918722, "grad_norm": 1.5390625, "learning_rate": 0.00047610444498946507, "loss": 6.2014, "mean_token_accuracy": 0.13926137760281562, "num_tokens": 31771677.0, "step": 14685 }, { "entropy": 6.539397382736206, "epoch": 1.571994221199636, "grad_norm": 1.4765625, "learning_rate": 0.0004760872955446688, "loss": 6.3242, "mean_token_accuracy": 0.12628690302371978, "num_tokens": 31783028.0, "step": 14690 }, { "entropy": 6.554657936096191, "epoch": 1.5725292953074002, "grad_norm": 2.203125, "learning_rate": 0.00047607014029350504, "loss": 6.2933, "mean_token_accuracy": 0.13701235502958298, "num_tokens": 31793110.0, "step": 14695 }, { "entropy": 6.496626329421997, "epoch": 1.573064369415164, "grad_norm": 1.8828125, "learning_rate": 0.00047605297923646923, "loss": 6.2598, "mean_token_accuracy": 0.13291990309953688, "num_tokens": 31804193.0, "step": 14700 }, { "entropy": 6.518072462081909, "epoch": 1.573599443522928, "grad_norm": 2.03125, "learning_rate": 0.00047603581237405684, "loss": 6.2548, "mean_token_accuracy": 0.13917799517512322, "num_tokens": 31815752.0, "step": 14705 }, { "entropy": 6.575625705718994, "epoch": 1.574134517630692, "grad_norm": 1.65625, "learning_rate": 0.00047601863970676367, "loss": 6.3434, "mean_token_accuracy": 0.1280118577182293, "num_tokens": 31825936.0, "step": 14710 }, { "entropy": 6.54962010383606, "epoch": 1.5746695917384557, "grad_norm": 1.859375, "learning_rate": 0.00047600146123508554, "loss": 6.2271, "mean_token_accuracy": 0.13201195001602173, "num_tokens": 31836601.0, "step": 14715 }, { "entropy": 6.3876525402069095, "epoch": 1.5752046658462198, "grad_norm": 2.40625, "learning_rate": 0.00047598427695951846, "loss": 6.0703, "mean_token_accuracy": 0.14671236798167228, "num_tokens": 31846476.0, "step": 14720 }, { "entropy": 6.38327260017395, "epoch": 1.5757397399539836, "grad_norm": 1.6015625, "learning_rate": 0.00047596708688055857, "loss": 6.0755, "mean_token_accuracy": 0.1459612712264061, "num_tokens": 31856151.0, "step": 14725 }, { "entropy": 6.544833850860596, "epoch": 1.5762748140617475, "grad_norm": 1.5859375, "learning_rate": 0.0004759498909987023, "loss": 6.3136, "mean_token_accuracy": 0.1280362620949745, "num_tokens": 31867419.0, "step": 14730 }, { "entropy": 6.5832963466644285, "epoch": 1.5768098881695116, "grad_norm": 1.5234375, "learning_rate": 0.0004759326893144462, "loss": 6.3235, "mean_token_accuracy": 0.13490021526813506, "num_tokens": 31878036.0, "step": 14735 }, { "entropy": 6.542579221725464, "epoch": 1.5773449622772753, "grad_norm": 1.8046875, "learning_rate": 0.000475915481828287, "loss": 6.2622, "mean_token_accuracy": 0.13082825392484665, "num_tokens": 31887919.0, "step": 14740 }, { "entropy": 6.434671688079834, "epoch": 1.5778800363850394, "grad_norm": 1.390625, "learning_rate": 0.00047589826854072133, "loss": 6.2629, "mean_token_accuracy": 0.13572418168187142, "num_tokens": 31898962.0, "step": 14745 }, { "entropy": 6.579334545135498, "epoch": 1.5784151104928033, "grad_norm": 1.75, "learning_rate": 0.00047588104945224654, "loss": 6.3589, "mean_token_accuracy": 0.13001709431409836, "num_tokens": 31911027.0, "step": 14750 }, { "entropy": 6.5912518978118895, "epoch": 1.5789501846005671, "grad_norm": 1.546875, "learning_rate": 0.0004758638245633595, "loss": 6.278, "mean_token_accuracy": 0.13635631650686264, "num_tokens": 31921226.0, "step": 14755 }, { "entropy": 6.496388244628906, "epoch": 1.5794852587083312, "grad_norm": 1.75, "learning_rate": 0.0004758465938745579, "loss": 6.2114, "mean_token_accuracy": 0.13777147978544235, "num_tokens": 31932848.0, "step": 14760 }, { "entropy": 6.460186386108399, "epoch": 1.5800203328160949, "grad_norm": 1.3828125, "learning_rate": 0.00047582935738633915, "loss": 6.1486, "mean_token_accuracy": 0.13729973658919334, "num_tokens": 31943757.0, "step": 14765 }, { "entropy": 6.520174598693847, "epoch": 1.580555406923859, "grad_norm": 1.7890625, "learning_rate": 0.0004758121150992009, "loss": 6.3122, "mean_token_accuracy": 0.12971630915999413, "num_tokens": 31954391.0, "step": 14770 }, { "entropy": 6.51693320274353, "epoch": 1.5810904810316229, "grad_norm": 2.0625, "learning_rate": 0.00047579486701364093, "loss": 6.3043, "mean_token_accuracy": 0.13650548011064528, "num_tokens": 31964497.0, "step": 14775 }, { "entropy": 6.5695905685424805, "epoch": 1.5816255551393867, "grad_norm": 1.875, "learning_rate": 0.0004757776131301575, "loss": 6.2831, "mean_token_accuracy": 0.130709208548069, "num_tokens": 31974466.0, "step": 14780 }, { "entropy": 6.557105636596679, "epoch": 1.5821606292471508, "grad_norm": 1.796875, "learning_rate": 0.0004757603534492487, "loss": 6.3066, "mean_token_accuracy": 0.13409281075000762, "num_tokens": 31985890.0, "step": 14785 }, { "entropy": 6.504603242874145, "epoch": 1.5826957033549145, "grad_norm": 2.890625, "learning_rate": 0.0004757430879714128, "loss": 6.4018, "mean_token_accuracy": 0.13219767883419992, "num_tokens": 31996865.0, "step": 14790 }, { "entropy": 6.460845565795898, "epoch": 1.5832307774626786, "grad_norm": 1.953125, "learning_rate": 0.0004757258166971485, "loss": 6.1455, "mean_token_accuracy": 0.1445557326078415, "num_tokens": 32008121.0, "step": 14795 }, { "entropy": 6.570254182815551, "epoch": 1.5837658515704425, "grad_norm": 2.234375, "learning_rate": 0.0004757085396269545, "loss": 6.3516, "mean_token_accuracy": 0.1301535189151764, "num_tokens": 32020552.0, "step": 14800 }, { "entropy": 6.561383485794067, "epoch": 1.5843009256782064, "grad_norm": 2.40625, "learning_rate": 0.00047569125676132963, "loss": 6.3061, "mean_token_accuracy": 0.13402550369501115, "num_tokens": 32032361.0, "step": 14805 }, { "entropy": 6.55854434967041, "epoch": 1.5848359997859705, "grad_norm": 1.3359375, "learning_rate": 0.00047567396810077286, "loss": 6.2886, "mean_token_accuracy": 0.12737912312150002, "num_tokens": 32043233.0, "step": 14810 }, { "entropy": 6.552183437347412, "epoch": 1.5853710738937343, "grad_norm": 1.703125, "learning_rate": 0.00047565667364578344, "loss": 6.253, "mean_token_accuracy": 0.14003728479146957, "num_tokens": 32054273.0, "step": 14815 }, { "entropy": 6.523531103134156, "epoch": 1.5859061480014982, "grad_norm": 2.03125, "learning_rate": 0.0004756393733968608, "loss": 6.2287, "mean_token_accuracy": 0.14313824102282524, "num_tokens": 32064200.0, "step": 14820 }, { "entropy": 6.451785039901734, "epoch": 1.586441222109262, "grad_norm": 1.4609375, "learning_rate": 0.0004756220673545045, "loss": 6.217, "mean_token_accuracy": 0.14075903221964836, "num_tokens": 32074823.0, "step": 14825 }, { "entropy": 6.533991765975952, "epoch": 1.586976296217026, "grad_norm": 2.421875, "learning_rate": 0.00047560475551921416, "loss": 6.3073, "mean_token_accuracy": 0.13615889325737954, "num_tokens": 32085333.0, "step": 14830 }, { "entropy": 6.625106430053711, "epoch": 1.58751137032479, "grad_norm": 1.3203125, "learning_rate": 0.0004755874378914897, "loss": 6.2903, "mean_token_accuracy": 0.13102672025561332, "num_tokens": 32095827.0, "step": 14835 }, { "entropy": 6.524811744689941, "epoch": 1.588046444432554, "grad_norm": 1.796875, "learning_rate": 0.0004755701144718311, "loss": 6.2861, "mean_token_accuracy": 0.13742618560791015, "num_tokens": 32106949.0, "step": 14840 }, { "entropy": 6.501339530944824, "epoch": 1.5885815185403178, "grad_norm": 2.15625, "learning_rate": 0.00047555278526073867, "loss": 6.2225, "mean_token_accuracy": 0.14211768209934234, "num_tokens": 32118269.0, "step": 14845 }, { "entropy": 6.4988819599151615, "epoch": 1.589116592648082, "grad_norm": 1.6328125, "learning_rate": 0.0004755354502587127, "loss": 6.2626, "mean_token_accuracy": 0.13281174525618553, "num_tokens": 32128406.0, "step": 14850 }, { "entropy": 6.5138648509979244, "epoch": 1.5896516667558456, "grad_norm": 1.7890625, "learning_rate": 0.00047551810946625385, "loss": 6.2798, "mean_token_accuracy": 0.1371403641998768, "num_tokens": 32140112.0, "step": 14855 }, { "entropy": 6.533293962478638, "epoch": 1.5901867408636097, "grad_norm": 1.90625, "learning_rate": 0.00047550076288386276, "loss": 6.2083, "mean_token_accuracy": 0.14420999884605407, "num_tokens": 32150010.0, "step": 14860 }, { "entropy": 6.5140081405639645, "epoch": 1.5907218149713735, "grad_norm": 1.921875, "learning_rate": 0.0004754834105120403, "loss": 6.3212, "mean_token_accuracy": 0.12911390140652657, "num_tokens": 32160694.0, "step": 14865 }, { "entropy": 6.499224996566772, "epoch": 1.5912568890791374, "grad_norm": 1.640625, "learning_rate": 0.00047546605235128755, "loss": 6.3156, "mean_token_accuracy": 0.1340811789035797, "num_tokens": 32171947.0, "step": 14870 }, { "entropy": 6.5859424591064455, "epoch": 1.5917919631869015, "grad_norm": 1.9453125, "learning_rate": 0.0004754486884021057, "loss": 6.3007, "mean_token_accuracy": 0.13230689167976378, "num_tokens": 32182849.0, "step": 14875 }, { "entropy": 6.548197221755982, "epoch": 1.5923270372946652, "grad_norm": 1.8125, "learning_rate": 0.0004754313186649961, "loss": 6.2999, "mean_token_accuracy": 0.13477448523044586, "num_tokens": 32192871.0, "step": 14880 }, { "entropy": 6.562755441665649, "epoch": 1.5928621114024293, "grad_norm": 2.125, "learning_rate": 0.00047541394314046037, "loss": 6.3227, "mean_token_accuracy": 0.1299983151257038, "num_tokens": 32203289.0, "step": 14885 }, { "entropy": 6.5510444164276125, "epoch": 1.5933971855101932, "grad_norm": 1.53125, "learning_rate": 0.0004753965618290002, "loss": 6.2676, "mean_token_accuracy": 0.13420026302337645, "num_tokens": 32213238.0, "step": 14890 }, { "entropy": 6.424655485153198, "epoch": 1.593932259617957, "grad_norm": 1.640625, "learning_rate": 0.0004753791747311175, "loss": 6.1858, "mean_token_accuracy": 0.13797398135066033, "num_tokens": 32223384.0, "step": 14895 }, { "entropy": 6.520129299163818, "epoch": 1.5944673337257211, "grad_norm": 1.78125, "learning_rate": 0.00047536178184731426, "loss": 6.2804, "mean_token_accuracy": 0.13506588339805603, "num_tokens": 32235358.0, "step": 14900 }, { "entropy": 6.643621444702148, "epoch": 1.5950024078334848, "grad_norm": 1.59375, "learning_rate": 0.0004753443831780927, "loss": 6.3203, "mean_token_accuracy": 0.12936478480696678, "num_tokens": 32246459.0, "step": 14905 }, { "entropy": 6.506386947631836, "epoch": 1.595537481941249, "grad_norm": 1.7578125, "learning_rate": 0.0004753269787239552, "loss": 6.2174, "mean_token_accuracy": 0.13538266569375992, "num_tokens": 32257798.0, "step": 14910 }, { "entropy": 6.502975988388061, "epoch": 1.5960725560490128, "grad_norm": 1.6328125, "learning_rate": 0.00047530956848540435, "loss": 6.2543, "mean_token_accuracy": 0.1334786370396614, "num_tokens": 32268118.0, "step": 14915 }, { "entropy": 6.445563507080078, "epoch": 1.5966076301567766, "grad_norm": 1.5859375, "learning_rate": 0.0004752921524629429, "loss": 6.186, "mean_token_accuracy": 0.13638549968600272, "num_tokens": 32279676.0, "step": 14920 }, { "entropy": 6.503003644943237, "epoch": 1.5971427042645407, "grad_norm": 1.53125, "learning_rate": 0.0004752747306570737, "loss": 6.2293, "mean_token_accuracy": 0.13795944750308992, "num_tokens": 32290613.0, "step": 14925 }, { "entropy": 6.5680375576019285, "epoch": 1.5976777783723044, "grad_norm": 1.4921875, "learning_rate": 0.00047525730306829977, "loss": 6.2521, "mean_token_accuracy": 0.13554463014006615, "num_tokens": 32300873.0, "step": 14930 }, { "entropy": 6.557008171081543, "epoch": 1.5982128524800685, "grad_norm": 4.53125, "learning_rate": 0.0004752398696971244, "loss": 6.2657, "mean_token_accuracy": 0.13355937376618385, "num_tokens": 32312326.0, "step": 14935 }, { "entropy": 6.5607640743255615, "epoch": 1.5987479265878324, "grad_norm": 2.0, "learning_rate": 0.00047522243054405085, "loss": 6.2513, "mean_token_accuracy": 0.12972980067133905, "num_tokens": 32324322.0, "step": 14940 }, { "entropy": 6.560641956329346, "epoch": 1.5992830006955963, "grad_norm": 1.65625, "learning_rate": 0.0004752049856095828, "loss": 6.2231, "mean_token_accuracy": 0.13305347710847854, "num_tokens": 32334397.0, "step": 14945 }, { "entropy": 6.470574998855591, "epoch": 1.5998180748033604, "grad_norm": 1.765625, "learning_rate": 0.00047518753489422393, "loss": 6.2252, "mean_token_accuracy": 0.1374221198260784, "num_tokens": 32345131.0, "step": 14950 }, { "entropy": 6.4330222606658936, "epoch": 1.6003531489111242, "grad_norm": 1.375, "learning_rate": 0.00047517007839847816, "loss": 6.2059, "mean_token_accuracy": 0.13534148335456847, "num_tokens": 32355520.0, "step": 14955 }, { "entropy": 6.536291217803955, "epoch": 1.6008882230188881, "grad_norm": 1.3125, "learning_rate": 0.0004751526161228494, "loss": 6.2917, "mean_token_accuracy": 0.14231665730476378, "num_tokens": 32366695.0, "step": 14960 }, { "entropy": 6.454723787307739, "epoch": 1.601423297126652, "grad_norm": 1.59375, "learning_rate": 0.000475135148067842, "loss": 6.2309, "mean_token_accuracy": 0.13280131667852402, "num_tokens": 32377467.0, "step": 14965 }, { "entropy": 6.581510353088379, "epoch": 1.6019583712344159, "grad_norm": 2.4375, "learning_rate": 0.00047511767423396033, "loss": 6.2621, "mean_token_accuracy": 0.1360831081867218, "num_tokens": 32388021.0, "step": 14970 }, { "entropy": 6.5882233619689945, "epoch": 1.60249344534218, "grad_norm": 1.3984375, "learning_rate": 0.000475100194621709, "loss": 6.2323, "mean_token_accuracy": 0.14279873743653299, "num_tokens": 32398105.0, "step": 14975 }, { "entropy": 6.526843452453614, "epoch": 1.6030285194499438, "grad_norm": 1.828125, "learning_rate": 0.0004750827092315926, "loss": 6.3458, "mean_token_accuracy": 0.13159868866205215, "num_tokens": 32409876.0, "step": 14980 }, { "entropy": 6.51892728805542, "epoch": 1.6035635935577077, "grad_norm": 1.828125, "learning_rate": 0.00047506521806411613, "loss": 6.2424, "mean_token_accuracy": 0.14545759409666062, "num_tokens": 32420283.0, "step": 14985 }, { "entropy": 6.54042501449585, "epoch": 1.6040986676654718, "grad_norm": 1.4921875, "learning_rate": 0.00047504772111978463, "loss": 6.3343, "mean_token_accuracy": 0.12750672101974486, "num_tokens": 32431164.0, "step": 14990 }, { "entropy": 6.5425420761108395, "epoch": 1.6046337417732355, "grad_norm": 2.203125, "learning_rate": 0.0004750302183991032, "loss": 6.2426, "mean_token_accuracy": 0.132595930993557, "num_tokens": 32442253.0, "step": 14995 }, { "entropy": 6.50988450050354, "epoch": 1.6051688158809996, "grad_norm": 1.71875, "learning_rate": 0.0004750127099025774, "loss": 6.338, "mean_token_accuracy": 0.1360313430428505, "num_tokens": 32452800.0, "step": 15000 }, { "epoch": 1.6051688158809996, "eval_entropy": 6.419160812048899, "eval_loss": 6.373970031738281, "eval_mean_token_accuracy": 0.13763191947648226, "eval_num_tokens": 32452800.0, "eval_runtime": 22.5526, "eval_samples_per_second": 1315.992, "eval_steps_per_second": 164.505, "step": 15000 }, { "entropy": 6.596367835998535, "epoch": 1.6057038899887635, "grad_norm": 1.3359375, "learning_rate": 0.0004749951956307126, "loss": 6.2873, "mean_token_accuracy": 0.1296849727630615, "num_tokens": 32462890.0, "step": 15005 }, { "entropy": 6.485629034042359, "epoch": 1.6062389640965273, "grad_norm": 2.453125, "learning_rate": 0.0004749776755840148, "loss": 6.2551, "mean_token_accuracy": 0.14182380735874175, "num_tokens": 32473422.0, "step": 15010 }, { "entropy": 6.500695705413818, "epoch": 1.6067740382042914, "grad_norm": 2.3125, "learning_rate": 0.00047496014976298957, "loss": 6.2867, "mean_token_accuracy": 0.13322071507573127, "num_tokens": 32483980.0, "step": 15015 }, { "entropy": 6.603447580337525, "epoch": 1.607309112312055, "grad_norm": 1.734375, "learning_rate": 0.0004749426181681432, "loss": 6.3083, "mean_token_accuracy": 0.13130330070853233, "num_tokens": 32494905.0, "step": 15020 }, { "entropy": 6.614582967758179, "epoch": 1.6078441864198192, "grad_norm": 2.65625, "learning_rate": 0.00047492508079998173, "loss": 6.3397, "mean_token_accuracy": 0.12839462533593177, "num_tokens": 32505799.0, "step": 15025 }, { "entropy": 6.563151884078979, "epoch": 1.608379260527583, "grad_norm": 1.4765625, "learning_rate": 0.0004749075376590117, "loss": 6.3072, "mean_token_accuracy": 0.12912078201770782, "num_tokens": 32516328.0, "step": 15030 }, { "entropy": 6.532871294021606, "epoch": 1.608914334635347, "grad_norm": 1.5625, "learning_rate": 0.0004748899887457396, "loss": 6.2823, "mean_token_accuracy": 0.13482635021209716, "num_tokens": 32526335.0, "step": 15035 }, { "entropy": 6.4955644607543945, "epoch": 1.609449408743111, "grad_norm": 1.515625, "learning_rate": 0.00047487243406067227, "loss": 6.2544, "mean_token_accuracy": 0.1365067608654499, "num_tokens": 32536896.0, "step": 15040 }, { "entropy": 6.512849569320679, "epoch": 1.6099844828508747, "grad_norm": 1.859375, "learning_rate": 0.0004748548736043164, "loss": 6.1869, "mean_token_accuracy": 0.1340150237083435, "num_tokens": 32547604.0, "step": 15045 }, { "entropy": 6.575725650787353, "epoch": 1.6105195569586388, "grad_norm": 1.5859375, "learning_rate": 0.00047483730737717914, "loss": 6.299, "mean_token_accuracy": 0.12914739921689034, "num_tokens": 32558539.0, "step": 15050 }, { "entropy": 6.5589573860168455, "epoch": 1.6110546310664027, "grad_norm": 2.46875, "learning_rate": 0.0004748197353797677, "loss": 6.3663, "mean_token_accuracy": 0.12705627977848052, "num_tokens": 32569787.0, "step": 15055 }, { "entropy": 6.542858552932739, "epoch": 1.6115897051741666, "grad_norm": 1.7890625, "learning_rate": 0.0004748021576125895, "loss": 6.3022, "mean_token_accuracy": 0.13655368536710738, "num_tokens": 32580146.0, "step": 15060 }, { "entropy": 6.52427453994751, "epoch": 1.6121247792819307, "grad_norm": 1.7421875, "learning_rate": 0.0004747845740761521, "loss": 6.2485, "mean_token_accuracy": 0.13791619762778282, "num_tokens": 32591243.0, "step": 15065 }, { "entropy": 6.557205581665039, "epoch": 1.6126598533896943, "grad_norm": 1.4140625, "learning_rate": 0.0004747669847709631, "loss": 6.3058, "mean_token_accuracy": 0.13091632947325707, "num_tokens": 32602424.0, "step": 15070 }, { "entropy": 6.61011905670166, "epoch": 1.6131949274974584, "grad_norm": 2.140625, "learning_rate": 0.0004747493896975306, "loss": 6.3701, "mean_token_accuracy": 0.12900158390402794, "num_tokens": 32613703.0, "step": 15075 }, { "entropy": 6.564071750640869, "epoch": 1.6137300016052223, "grad_norm": 1.7578125, "learning_rate": 0.0004747317888563625, "loss": 6.3133, "mean_token_accuracy": 0.1308335021138191, "num_tokens": 32624371.0, "step": 15080 }, { "entropy": 6.55357985496521, "epoch": 1.6142650757129862, "grad_norm": 2.140625, "learning_rate": 0.00047471418224796704, "loss": 6.2554, "mean_token_accuracy": 0.13879068642854692, "num_tokens": 32634039.0, "step": 15085 }, { "entropy": 6.536784744262695, "epoch": 1.6148001498207503, "grad_norm": 1.75, "learning_rate": 0.0004746965698728526, "loss": 6.2549, "mean_token_accuracy": 0.1380273535847664, "num_tokens": 32644644.0, "step": 15090 }, { "entropy": 6.567042064666748, "epoch": 1.6153352239285141, "grad_norm": 1.8046875, "learning_rate": 0.00047467895173152787, "loss": 6.3026, "mean_token_accuracy": 0.13522871881723403, "num_tokens": 32655961.0, "step": 15095 }, { "entropy": 6.488573694229126, "epoch": 1.615870298036278, "grad_norm": 1.53125, "learning_rate": 0.00047466132782450146, "loss": 6.1815, "mean_token_accuracy": 0.14545413851737976, "num_tokens": 32665506.0, "step": 15100 }, { "entropy": 6.465070581436157, "epoch": 1.616405372144042, "grad_norm": 1.4375, "learning_rate": 0.00047464369815228215, "loss": 6.2209, "mean_token_accuracy": 0.13768779933452607, "num_tokens": 32676278.0, "step": 15105 }, { "entropy": 6.525582218170166, "epoch": 1.6169404462518058, "grad_norm": 1.40625, "learning_rate": 0.0004746260627153792, "loss": 6.2163, "mean_token_accuracy": 0.13862458914518355, "num_tokens": 32686835.0, "step": 15110 }, { "entropy": 6.599107980728149, "epoch": 1.6174755203595699, "grad_norm": 1.7734375, "learning_rate": 0.00047460842151430166, "loss": 6.3484, "mean_token_accuracy": 0.1358664244413376, "num_tokens": 32696856.0, "step": 15115 }, { "entropy": 6.569884347915649, "epoch": 1.6180105944673338, "grad_norm": 1.796875, "learning_rate": 0.00047459077454955914, "loss": 6.2876, "mean_token_accuracy": 0.13096022456884385, "num_tokens": 32707514.0, "step": 15120 }, { "entropy": 6.548951768875122, "epoch": 1.6185456685750976, "grad_norm": 1.5390625, "learning_rate": 0.00047457312182166094, "loss": 6.3643, "mean_token_accuracy": 0.12981587499380112, "num_tokens": 32718934.0, "step": 15125 }, { "entropy": 6.544709396362305, "epoch": 1.6190807426828617, "grad_norm": 1.5, "learning_rate": 0.0004745554633311169, "loss": 6.2519, "mean_token_accuracy": 0.13406705260276794, "num_tokens": 32729249.0, "step": 15130 }, { "entropy": 6.551851797103882, "epoch": 1.6196158167906254, "grad_norm": 2.046875, "learning_rate": 0.00047453779907843686, "loss": 6.3175, "mean_token_accuracy": 0.12954918518662453, "num_tokens": 32739948.0, "step": 15135 }, { "entropy": 6.527648115158081, "epoch": 1.6201508908983895, "grad_norm": 1.5390625, "learning_rate": 0.00047452012906413105, "loss": 6.3137, "mean_token_accuracy": 0.13055140003561974, "num_tokens": 32751482.0, "step": 15140 }, { "entropy": 6.499547004699707, "epoch": 1.6206859650061534, "grad_norm": 1.40625, "learning_rate": 0.00047450245328870943, "loss": 6.1504, "mean_token_accuracy": 0.14658984839916228, "num_tokens": 32761260.0, "step": 15145 }, { "entropy": 6.502904844284058, "epoch": 1.6212210391139172, "grad_norm": 1.7109375, "learning_rate": 0.00047448477175268255, "loss": 6.2691, "mean_token_accuracy": 0.13591463193297387, "num_tokens": 32772684.0, "step": 15150 }, { "entropy": 6.370807075500489, "epoch": 1.6217561132216813, "grad_norm": 1.296875, "learning_rate": 0.00047446708445656095, "loss": 6.0788, "mean_token_accuracy": 0.15149276256561278, "num_tokens": 32784022.0, "step": 15155 }, { "entropy": 6.514007139205932, "epoch": 1.622291187329445, "grad_norm": 1.390625, "learning_rate": 0.0004744493914008552, "loss": 6.2129, "mean_token_accuracy": 0.13973695337772368, "num_tokens": 32794104.0, "step": 15160 }, { "entropy": 6.574914264678955, "epoch": 1.622826261437209, "grad_norm": 1.375, "learning_rate": 0.0004744316925860764, "loss": 6.1906, "mean_token_accuracy": 0.14187313616275787, "num_tokens": 32804038.0, "step": 15165 }, { "entropy": 6.470356845855713, "epoch": 1.623361335544973, "grad_norm": 1.6328125, "learning_rate": 0.0004744139880127355, "loss": 6.2865, "mean_token_accuracy": 0.13450952768325805, "num_tokens": 32815620.0, "step": 15170 }, { "entropy": 6.478771495819092, "epoch": 1.6238964096527368, "grad_norm": 1.453125, "learning_rate": 0.00047439627768134366, "loss": 6.1972, "mean_token_accuracy": 0.14077696353197097, "num_tokens": 32826353.0, "step": 15175 }, { "entropy": 6.505884885787964, "epoch": 1.624431483760501, "grad_norm": 1.578125, "learning_rate": 0.0004743785615924124, "loss": 6.3058, "mean_token_accuracy": 0.13557258620858192, "num_tokens": 32836582.0, "step": 15180 }, { "entropy": 6.511706876754761, "epoch": 1.6249665578682646, "grad_norm": 1.4296875, "learning_rate": 0.0004743608397464531, "loss": 6.2568, "mean_token_accuracy": 0.13595101088285447, "num_tokens": 32848073.0, "step": 15185 }, { "entropy": 6.5341103076934814, "epoch": 1.6255016319760287, "grad_norm": 1.375, "learning_rate": 0.00047434311214397765, "loss": 6.2956, "mean_token_accuracy": 0.1354230597615242, "num_tokens": 32857839.0, "step": 15190 }, { "entropy": 6.495816612243653, "epoch": 1.6260367060837926, "grad_norm": 1.8984375, "learning_rate": 0.00047432537878549786, "loss": 6.2163, "mean_token_accuracy": 0.1448695421218872, "num_tokens": 32868087.0, "step": 15195 }, { "entropy": 6.557143068313598, "epoch": 1.6265717801915565, "grad_norm": 1.3203125, "learning_rate": 0.00047430763967152564, "loss": 6.2898, "mean_token_accuracy": 0.13106158301234244, "num_tokens": 32880622.0, "step": 15200 }, { "entropy": 6.61873950958252, "epoch": 1.6271068542993206, "grad_norm": 1.53125, "learning_rate": 0.00047428989480257337, "loss": 6.2719, "mean_token_accuracy": 0.1311236575245857, "num_tokens": 32891405.0, "step": 15205 }, { "entropy": 6.528134870529175, "epoch": 1.6276419284070842, "grad_norm": 1.71875, "learning_rate": 0.0004742721441791535, "loss": 6.2148, "mean_token_accuracy": 0.1388081818819046, "num_tokens": 32900487.0, "step": 15210 }, { "entropy": 6.432776355743409, "epoch": 1.6281770025148483, "grad_norm": 1.4609375, "learning_rate": 0.0004742543878017784, "loss": 6.1764, "mean_token_accuracy": 0.14578463062644004, "num_tokens": 32912139.0, "step": 15215 }, { "entropy": 6.506275987625122, "epoch": 1.6287120766226122, "grad_norm": 1.4453125, "learning_rate": 0.00047423662567096085, "loss": 6.2642, "mean_token_accuracy": 0.1333197571337223, "num_tokens": 32922972.0, "step": 15220 }, { "entropy": 6.512710762023926, "epoch": 1.629247150730376, "grad_norm": 1.3984375, "learning_rate": 0.00047421885778721376, "loss": 6.206, "mean_token_accuracy": 0.14148302972316742, "num_tokens": 32932609.0, "step": 15225 }, { "entropy": 6.473397874832154, "epoch": 1.6297822248381402, "grad_norm": 1.3828125, "learning_rate": 0.00047420108415105006, "loss": 6.2051, "mean_token_accuracy": 0.1474070742726326, "num_tokens": 32942706.0, "step": 15230 }, { "entropy": 6.515003728866577, "epoch": 1.630317298945904, "grad_norm": 1.75, "learning_rate": 0.00047418330476298317, "loss": 6.2367, "mean_token_accuracy": 0.13718311563134195, "num_tokens": 32952240.0, "step": 15235 }, { "entropy": 6.555767250061035, "epoch": 1.630852373053668, "grad_norm": 2.890625, "learning_rate": 0.0004741655196235262, "loss": 6.2868, "mean_token_accuracy": 0.1296004444360733, "num_tokens": 32963249.0, "step": 15240 }, { "entropy": 6.544875812530518, "epoch": 1.6313874471614318, "grad_norm": 1.5625, "learning_rate": 0.00047414772873319294, "loss": 6.2732, "mean_token_accuracy": 0.14131317362189294, "num_tokens": 32974004.0, "step": 15245 }, { "entropy": 6.5474451065063475, "epoch": 1.6319225212691957, "grad_norm": 1.546875, "learning_rate": 0.000474129932092497, "loss": 6.2414, "mean_token_accuracy": 0.13400815799832344, "num_tokens": 32985236.0, "step": 15250 }, { "entropy": 6.577800703048706, "epoch": 1.6324575953769598, "grad_norm": 1.5, "learning_rate": 0.0004741121297019522, "loss": 6.3035, "mean_token_accuracy": 0.13068798258900644, "num_tokens": 32995155.0, "step": 15255 }, { "entropy": 6.53216872215271, "epoch": 1.6329926694847237, "grad_norm": 1.734375, "learning_rate": 0.00047409432156207264, "loss": 6.284, "mean_token_accuracy": 0.1431720234453678, "num_tokens": 33007562.0, "step": 15260 }, { "entropy": 6.5164182662963865, "epoch": 1.6335277435924875, "grad_norm": 1.5078125, "learning_rate": 0.00047407650767337256, "loss": 6.2507, "mean_token_accuracy": 0.132377927005291, "num_tokens": 33018653.0, "step": 15265 }, { "entropy": 6.605610656738281, "epoch": 1.6340628177002516, "grad_norm": 1.640625, "learning_rate": 0.0004740586880363663, "loss": 6.3493, "mean_token_accuracy": 0.12530876249074935, "num_tokens": 33029470.0, "step": 15270 }, { "entropy": 6.5277331352233885, "epoch": 1.6345978918080153, "grad_norm": 1.5546875, "learning_rate": 0.00047404086265156835, "loss": 6.2094, "mean_token_accuracy": 0.14064295142889022, "num_tokens": 33039597.0, "step": 15275 }, { "entropy": 6.5205522060394285, "epoch": 1.6351329659157794, "grad_norm": 1.5625, "learning_rate": 0.0004740230315194935, "loss": 6.2391, "mean_token_accuracy": 0.1316556826233864, "num_tokens": 33050984.0, "step": 15280 }, { "entropy": 6.524631404876709, "epoch": 1.6356680400235433, "grad_norm": 1.5078125, "learning_rate": 0.00047400519464065656, "loss": 6.3191, "mean_token_accuracy": 0.1310469351708889, "num_tokens": 33062250.0, "step": 15285 }, { "entropy": 6.543263912200928, "epoch": 1.6362031141313071, "grad_norm": 1.5078125, "learning_rate": 0.0004739873520155726, "loss": 6.3471, "mean_token_accuracy": 0.1317575253546238, "num_tokens": 33072129.0, "step": 15290 }, { "entropy": 6.553985691070556, "epoch": 1.6367381882390712, "grad_norm": 1.3984375, "learning_rate": 0.0004739695036447568, "loss": 6.1859, "mean_token_accuracy": 0.1361164018511772, "num_tokens": 33082475.0, "step": 15295 }, { "entropy": 6.4877923965454105, "epoch": 1.637273262346835, "grad_norm": 1.515625, "learning_rate": 0.00047395164952872455, "loss": 6.2363, "mean_token_accuracy": 0.14455458000302315, "num_tokens": 33093791.0, "step": 15300 }, { "entropy": 6.51265869140625, "epoch": 1.637808336454599, "grad_norm": 1.234375, "learning_rate": 0.0004739337896679914, "loss": 6.2184, "mean_token_accuracy": 0.14008307158946992, "num_tokens": 33104231.0, "step": 15305 }, { "entropy": 6.52463812828064, "epoch": 1.6383434105623629, "grad_norm": 1.625, "learning_rate": 0.00047391592406307296, "loss": 6.2248, "mean_token_accuracy": 0.13311854079365731, "num_tokens": 33115118.0, "step": 15310 }, { "entropy": 6.545754528045654, "epoch": 1.6388784846701268, "grad_norm": 1.625, "learning_rate": 0.0004738980527144852, "loss": 6.2086, "mean_token_accuracy": 0.143442365527153, "num_tokens": 33126154.0, "step": 15315 }, { "entropy": 6.524981355667114, "epoch": 1.6394135587778909, "grad_norm": 1.5625, "learning_rate": 0.0004738801756227441, "loss": 6.2837, "mean_token_accuracy": 0.1365656517446041, "num_tokens": 33137342.0, "step": 15320 }, { "entropy": 6.469981956481933, "epoch": 1.6399486328856545, "grad_norm": 1.46875, "learning_rate": 0.00047386229278836595, "loss": 6.2488, "mean_token_accuracy": 0.14113932177424432, "num_tokens": 33147661.0, "step": 15325 }, { "entropy": 6.564016675949096, "epoch": 1.6404837069934186, "grad_norm": 2.0625, "learning_rate": 0.00047384440421186695, "loss": 6.2958, "mean_token_accuracy": 0.13328296020627023, "num_tokens": 33157106.0, "step": 15330 }, { "entropy": 6.559274578094483, "epoch": 1.6410187811011825, "grad_norm": 1.3515625, "learning_rate": 0.0004738265098937638, "loss": 6.299, "mean_token_accuracy": 0.13367382884025575, "num_tokens": 33169451.0, "step": 15335 }, { "entropy": 6.596626472473145, "epoch": 1.6415538552089464, "grad_norm": 1.3671875, "learning_rate": 0.000473808609834573, "loss": 6.2857, "mean_token_accuracy": 0.1338217854499817, "num_tokens": 33180799.0, "step": 15340 }, { "entropy": 6.581587791442871, "epoch": 1.6420889293167105, "grad_norm": 1.46875, "learning_rate": 0.00047379070403481165, "loss": 6.3633, "mean_token_accuracy": 0.12887900546193123, "num_tokens": 33191948.0, "step": 15345 }, { "entropy": 6.529717302322387, "epoch": 1.6426240034244743, "grad_norm": 1.34375, "learning_rate": 0.00047377279249499656, "loss": 6.2631, "mean_token_accuracy": 0.1293257676064968, "num_tokens": 33203536.0, "step": 15350 }, { "entropy": 6.542965984344482, "epoch": 1.6431590775322382, "grad_norm": 1.2734375, "learning_rate": 0.0004737548752156451, "loss": 6.2603, "mean_token_accuracy": 0.13613931387662886, "num_tokens": 33214526.0, "step": 15355 }, { "entropy": 6.493067502975464, "epoch": 1.643694151640002, "grad_norm": 2.96875, "learning_rate": 0.0004737369521972745, "loss": 6.2245, "mean_token_accuracy": 0.13954372256994246, "num_tokens": 33226560.0, "step": 15360 }, { "entropy": 6.482340002059937, "epoch": 1.644229225747766, "grad_norm": 1.5234375, "learning_rate": 0.00047371902344040234, "loss": 6.2566, "mean_token_accuracy": 0.13352166935801507, "num_tokens": 33237441.0, "step": 15365 }, { "entropy": 6.506029081344605, "epoch": 1.64476429985553, "grad_norm": 1.4609375, "learning_rate": 0.00047370108894554633, "loss": 6.2135, "mean_token_accuracy": 0.13105529099702834, "num_tokens": 33248229.0, "step": 15370 }, { "entropy": 6.478899192810059, "epoch": 1.645299373963294, "grad_norm": 1.9765625, "learning_rate": 0.0004736831487132243, "loss": 6.1587, "mean_token_accuracy": 0.1475966066122055, "num_tokens": 33258992.0, "step": 15375 }, { "entropy": 6.500133895874024, "epoch": 1.6458344480710578, "grad_norm": 1.421875, "learning_rate": 0.0004736652027439542, "loss": 6.1869, "mean_token_accuracy": 0.13673374876379968, "num_tokens": 33269583.0, "step": 15380 }, { "entropy": 6.548278188705444, "epoch": 1.646369522178822, "grad_norm": 1.5390625, "learning_rate": 0.00047364725103825437, "loss": 6.3114, "mean_token_accuracy": 0.13247542828321457, "num_tokens": 33280236.0, "step": 15385 }, { "entropy": 6.523178243637085, "epoch": 1.6469045962865856, "grad_norm": 1.234375, "learning_rate": 0.000473629293596643, "loss": 6.2145, "mean_token_accuracy": 0.1371418498456478, "num_tokens": 33291327.0, "step": 15390 }, { "entropy": 6.583948993682862, "epoch": 1.6474396703943497, "grad_norm": 1.3125, "learning_rate": 0.00047361133041963873, "loss": 6.3138, "mean_token_accuracy": 0.13246541023254393, "num_tokens": 33302125.0, "step": 15395 }, { "entropy": 6.507024955749512, "epoch": 1.6479747445021136, "grad_norm": 1.703125, "learning_rate": 0.0004735933615077602, "loss": 6.2456, "mean_token_accuracy": 0.13589197397232056, "num_tokens": 33312576.0, "step": 15400 }, { "entropy": 6.500837564468384, "epoch": 1.6485098186098774, "grad_norm": 1.4453125, "learning_rate": 0.00047357538686152627, "loss": 6.2317, "mean_token_accuracy": 0.1352829158306122, "num_tokens": 33322821.0, "step": 15405 }, { "entropy": 6.553674840927124, "epoch": 1.6490448927176415, "grad_norm": 1.5390625, "learning_rate": 0.00047355740648145596, "loss": 6.2807, "mean_token_accuracy": 0.13334212675690651, "num_tokens": 33333951.0, "step": 15410 }, { "entropy": 6.602206516265869, "epoch": 1.6495799668254052, "grad_norm": 1.421875, "learning_rate": 0.0004735394203680684, "loss": 6.2326, "mean_token_accuracy": 0.13933424800634384, "num_tokens": 33344739.0, "step": 15415 }, { "entropy": 6.525042295455933, "epoch": 1.6501150409331693, "grad_norm": 1.5078125, "learning_rate": 0.00047352142852188304, "loss": 6.1946, "mean_token_accuracy": 0.14079620391130448, "num_tokens": 33354956.0, "step": 15420 }, { "entropy": 6.363925170898438, "epoch": 1.6506501150409332, "grad_norm": 1.4765625, "learning_rate": 0.0004735034309434193, "loss": 6.1806, "mean_token_accuracy": 0.14333223477005957, "num_tokens": 33364809.0, "step": 15425 }, { "entropy": 6.555759572982788, "epoch": 1.651185189148697, "grad_norm": 1.359375, "learning_rate": 0.0004734854276331968, "loss": 6.2706, "mean_token_accuracy": 0.14230604097247124, "num_tokens": 33375324.0, "step": 15430 }, { "entropy": 6.5867352962493895, "epoch": 1.6517202632564612, "grad_norm": 1.390625, "learning_rate": 0.00047346741859173564, "loss": 6.342, "mean_token_accuracy": 0.132570631057024, "num_tokens": 33385963.0, "step": 15435 }, { "entropy": 6.571739339828492, "epoch": 1.6522553373642248, "grad_norm": 1.3203125, "learning_rate": 0.0004734494038195555, "loss": 6.3377, "mean_token_accuracy": 0.13507345393300058, "num_tokens": 33395927.0, "step": 15440 }, { "entropy": 6.549274349212647, "epoch": 1.652790411471989, "grad_norm": 1.7890625, "learning_rate": 0.0004734313833171768, "loss": 6.2415, "mean_token_accuracy": 0.13801701590418816, "num_tokens": 33406294.0, "step": 15445 }, { "entropy": 6.4921557903289795, "epoch": 1.6533254855797528, "grad_norm": 1.5234375, "learning_rate": 0.0004734133570851198, "loss": 6.1939, "mean_token_accuracy": 0.14175853729248047, "num_tokens": 33416995.0, "step": 15450 }, { "entropy": 6.4246721267700195, "epoch": 1.6538605596875167, "grad_norm": 1.40625, "learning_rate": 0.0004733953251239049, "loss": 6.1603, "mean_token_accuracy": 0.13845812678337097, "num_tokens": 33428087.0, "step": 15455 }, { "entropy": 6.5247784614562985, "epoch": 1.6543956337952808, "grad_norm": 1.4609375, "learning_rate": 0.0004733772874340529, "loss": 6.3487, "mean_token_accuracy": 0.1310659483075142, "num_tokens": 33439151.0, "step": 15460 }, { "entropy": 6.54686393737793, "epoch": 1.6549307079030444, "grad_norm": 1.625, "learning_rate": 0.0004733592440160846, "loss": 6.2464, "mean_token_accuracy": 0.1391957312822342, "num_tokens": 33449257.0, "step": 15465 }, { "entropy": 6.527724838256836, "epoch": 1.6554657820108085, "grad_norm": 1.640625, "learning_rate": 0.00047334119487052104, "loss": 6.2044, "mean_token_accuracy": 0.13526543900370597, "num_tokens": 33460472.0, "step": 15470 }, { "entropy": 6.489955234527588, "epoch": 1.6560008561185724, "grad_norm": 1.3359375, "learning_rate": 0.00047332313999788334, "loss": 6.2157, "mean_token_accuracy": 0.13044157400727271, "num_tokens": 33470193.0, "step": 15475 }, { "entropy": 6.404095649719238, "epoch": 1.6565359302263363, "grad_norm": 1.3984375, "learning_rate": 0.00047330507939869284, "loss": 6.1541, "mean_token_accuracy": 0.13785995692014694, "num_tokens": 33481098.0, "step": 15480 }, { "entropy": 6.56090350151062, "epoch": 1.6570710043341004, "grad_norm": 2.109375, "learning_rate": 0.000473287013073471, "loss": 6.2291, "mean_token_accuracy": 0.13516671136021613, "num_tokens": 33492514.0, "step": 15485 }, { "entropy": 6.55650486946106, "epoch": 1.6576060784418643, "grad_norm": 1.3359375, "learning_rate": 0.0004732689410227396, "loss": 6.2223, "mean_token_accuracy": 0.13520386070013046, "num_tokens": 33504254.0, "step": 15490 }, { "entropy": 6.490405035018921, "epoch": 1.6581411525496281, "grad_norm": 2.78125, "learning_rate": 0.0004732508632470203, "loss": 6.2386, "mean_token_accuracy": 0.13007647171616554, "num_tokens": 33515101.0, "step": 15495 }, { "entropy": 6.487555599212646, "epoch": 1.658676226657392, "grad_norm": 2.3125, "learning_rate": 0.0004732327797468352, "loss": 6.2507, "mean_token_accuracy": 0.137110199034214, "num_tokens": 33525052.0, "step": 15500 }, { "entropy": 6.578079605102539, "epoch": 1.6592113007651559, "grad_norm": 1.4140625, "learning_rate": 0.0004732146905227065, "loss": 6.384, "mean_token_accuracy": 0.12686768770217896, "num_tokens": 33536841.0, "step": 15505 }, { "entropy": 6.614656734466553, "epoch": 1.65974637487292, "grad_norm": 1.3671875, "learning_rate": 0.0004731965955751564, "loss": 6.2692, "mean_token_accuracy": 0.13630660995841026, "num_tokens": 33547292.0, "step": 15510 }, { "entropy": 6.525318765640259, "epoch": 1.6602814489806839, "grad_norm": 1.2734375, "learning_rate": 0.0004731784949047075, "loss": 6.2056, "mean_token_accuracy": 0.13373274132609367, "num_tokens": 33557674.0, "step": 15515 }, { "entropy": 6.527735948562622, "epoch": 1.6608165230884477, "grad_norm": 1.453125, "learning_rate": 0.0004731603885118824, "loss": 6.2942, "mean_token_accuracy": 0.1279158003628254, "num_tokens": 33568396.0, "step": 15520 }, { "entropy": 6.577741956710815, "epoch": 1.6613515971962118, "grad_norm": 1.3359375, "learning_rate": 0.0004731422763972039, "loss": 6.3323, "mean_token_accuracy": 0.1327934257686138, "num_tokens": 33579688.0, "step": 15525 }, { "entropy": 6.578317785263062, "epoch": 1.6618866713039755, "grad_norm": 1.6875, "learning_rate": 0.00047312415856119505, "loss": 6.354, "mean_token_accuracy": 0.131970302015543, "num_tokens": 33591550.0, "step": 15530 }, { "entropy": 6.561192989349365, "epoch": 1.6624217454117396, "grad_norm": 1.65625, "learning_rate": 0.00047310603500437895, "loss": 6.274, "mean_token_accuracy": 0.1381398282945156, "num_tokens": 33600792.0, "step": 15535 }, { "entropy": 6.4599748134613035, "epoch": 1.6629568195195035, "grad_norm": 1.296875, "learning_rate": 0.00047308790572727895, "loss": 6.2253, "mean_token_accuracy": 0.13727160319685935, "num_tokens": 33611873.0, "step": 15540 }, { "entropy": 6.529527378082276, "epoch": 1.6634918936272673, "grad_norm": 1.2421875, "learning_rate": 0.0004730697707304184, "loss": 6.2658, "mean_token_accuracy": 0.13597349151968957, "num_tokens": 33622960.0, "step": 15545 }, { "entropy": 6.592627620697021, "epoch": 1.6640269677350314, "grad_norm": 1.5859375, "learning_rate": 0.0004730516300143211, "loss": 6.3493, "mean_token_accuracy": 0.13005867078900338, "num_tokens": 33635391.0, "step": 15550 }, { "entropy": 6.593164157867432, "epoch": 1.664562041842795, "grad_norm": 1.6171875, "learning_rate": 0.0004730334835795109, "loss": 6.2714, "mean_token_accuracy": 0.13071415051817895, "num_tokens": 33647942.0, "step": 15555 }, { "entropy": 6.55129189491272, "epoch": 1.6650971159505592, "grad_norm": 2.09375, "learning_rate": 0.0004730153314265116, "loss": 6.233, "mean_token_accuracy": 0.13420569971203805, "num_tokens": 33658425.0, "step": 15560 }, { "entropy": 6.494670486450195, "epoch": 1.665632190058323, "grad_norm": 1.375, "learning_rate": 0.0004729971735558475, "loss": 6.2166, "mean_token_accuracy": 0.1414251834154129, "num_tokens": 33669645.0, "step": 15565 }, { "entropy": 6.555915451049804, "epoch": 1.666167264166087, "grad_norm": 1.3984375, "learning_rate": 0.0004729790099680428, "loss": 6.2997, "mean_token_accuracy": 0.1325235716998577, "num_tokens": 33680415.0, "step": 15570 }, { "entropy": 6.485175704956054, "epoch": 1.666702338273851, "grad_norm": 1.28125, "learning_rate": 0.000472960840663622, "loss": 6.3214, "mean_token_accuracy": 0.13352945372462272, "num_tokens": 33691425.0, "step": 15575 }, { "entropy": 6.568507814407349, "epoch": 1.6672374123816147, "grad_norm": 1.6328125, "learning_rate": 0.0004729426656431097, "loss": 6.2727, "mean_token_accuracy": 0.1349485158920288, "num_tokens": 33703845.0, "step": 15580 }, { "entropy": 6.600763368606567, "epoch": 1.6677724864893788, "grad_norm": 1.8125, "learning_rate": 0.0004729244849070308, "loss": 6.2306, "mean_token_accuracy": 0.1353510484099388, "num_tokens": 33714737.0, "step": 15585 }, { "entropy": 6.468076753616333, "epoch": 1.6683075605971427, "grad_norm": 1.296875, "learning_rate": 0.00047290629845591026, "loss": 6.1949, "mean_token_accuracy": 0.1312122106552124, "num_tokens": 33725042.0, "step": 15590 }, { "entropy": 6.511102628707886, "epoch": 1.6688426347049066, "grad_norm": 1.796875, "learning_rate": 0.000472888106290273, "loss": 6.2562, "mean_token_accuracy": 0.13453252837061883, "num_tokens": 33736306.0, "step": 15595 }, { "entropy": 6.615510892868042, "epoch": 1.6693777088126707, "grad_norm": 1.6796875, "learning_rate": 0.00047286990841064467, "loss": 6.313, "mean_token_accuracy": 0.12460464984178543, "num_tokens": 33747327.0, "step": 15600 }, { "entropy": 6.528128290176392, "epoch": 1.6699127829204343, "grad_norm": 1.921875, "learning_rate": 0.0004728517048175504, "loss": 6.2383, "mean_token_accuracy": 0.1368679001927376, "num_tokens": 33757723.0, "step": 15605 }, { "entropy": 6.407970523834228, "epoch": 1.6704478570281984, "grad_norm": 1.625, "learning_rate": 0.000472833495511516, "loss": 6.2012, "mean_token_accuracy": 0.13751262351870536, "num_tokens": 33769958.0, "step": 15610 }, { "entropy": 6.484128856658936, "epoch": 1.6709829311359623, "grad_norm": 1.484375, "learning_rate": 0.00047281528049306727, "loss": 6.2399, "mean_token_accuracy": 0.1377895474433899, "num_tokens": 33780107.0, "step": 15615 }, { "entropy": 6.513759183883667, "epoch": 1.6715180052437262, "grad_norm": 1.65625, "learning_rate": 0.0004727970597627301, "loss": 6.2594, "mean_token_accuracy": 0.1330281265079975, "num_tokens": 33791023.0, "step": 15620 }, { "entropy": 6.469873380661011, "epoch": 1.6720530793514903, "grad_norm": 1.6796875, "learning_rate": 0.0004727788333210305, "loss": 6.2527, "mean_token_accuracy": 0.1425516687333584, "num_tokens": 33801195.0, "step": 15625 }, { "entropy": 6.515677213668823, "epoch": 1.6725881534592542, "grad_norm": 1.6171875, "learning_rate": 0.000472760601168495, "loss": 6.227, "mean_token_accuracy": 0.14181752800941466, "num_tokens": 33812957.0, "step": 15630 }, { "entropy": 6.5297685146331785, "epoch": 1.673123227567018, "grad_norm": 1.84375, "learning_rate": 0.00047274236330564995, "loss": 6.2826, "mean_token_accuracy": 0.13435860499739646, "num_tokens": 33823874.0, "step": 15635 }, { "entropy": 6.525163459777832, "epoch": 1.673658301674782, "grad_norm": 1.5078125, "learning_rate": 0.0004727241197330219, "loss": 6.2398, "mean_token_accuracy": 0.13939717635512353, "num_tokens": 33834284.0, "step": 15640 }, { "entropy": 6.56245265007019, "epoch": 1.6741933757825458, "grad_norm": 1.609375, "learning_rate": 0.0004727058704511376, "loss": 6.2872, "mean_token_accuracy": 0.13500021770596504, "num_tokens": 33845544.0, "step": 15645 }, { "entropy": 6.579645442962646, "epoch": 1.67472844989031, "grad_norm": 1.4921875, "learning_rate": 0.0004726876154605242, "loss": 6.2602, "mean_token_accuracy": 0.1337307557463646, "num_tokens": 33855420.0, "step": 15650 }, { "entropy": 6.535953426361084, "epoch": 1.6752635239980738, "grad_norm": 1.765625, "learning_rate": 0.0004726693547617086, "loss": 6.1453, "mean_token_accuracy": 0.14049242064356804, "num_tokens": 33864904.0, "step": 15655 }, { "entropy": 6.4508716583251955, "epoch": 1.6757985981058376, "grad_norm": 1.484375, "learning_rate": 0.00047265108835521825, "loss": 6.2107, "mean_token_accuracy": 0.13712649717926978, "num_tokens": 33875139.0, "step": 15660 }, { "entropy": 6.452628326416016, "epoch": 1.6763336722136017, "grad_norm": 1.453125, "learning_rate": 0.0004726328162415804, "loss": 6.2418, "mean_token_accuracy": 0.14112431481480597, "num_tokens": 33886401.0, "step": 15665 }, { "entropy": 6.5320008277893065, "epoch": 1.6768687463213654, "grad_norm": 1.609375, "learning_rate": 0.00047261453842132277, "loss": 6.2702, "mean_token_accuracy": 0.1391934409737587, "num_tokens": 33896382.0, "step": 15670 }, { "entropy": 6.561520433425903, "epoch": 1.6774038204291295, "grad_norm": 1.53125, "learning_rate": 0.00047259625489497317, "loss": 6.2252, "mean_token_accuracy": 0.13969543278217317, "num_tokens": 33906403.0, "step": 15675 }, { "entropy": 6.435149383544922, "epoch": 1.6779388945368934, "grad_norm": 1.4765625, "learning_rate": 0.00047257796566305946, "loss": 6.1337, "mean_token_accuracy": 0.13980668783187866, "num_tokens": 33916992.0, "step": 15680 }, { "entropy": 6.529124116897583, "epoch": 1.6784739686446573, "grad_norm": 1.3046875, "learning_rate": 0.0004725596707261097, "loss": 6.2586, "mean_token_accuracy": 0.13304452002048492, "num_tokens": 33927599.0, "step": 15685 }, { "entropy": 6.55642671585083, "epoch": 1.6790090427524214, "grad_norm": 1.6875, "learning_rate": 0.0004725413700846522, "loss": 6.3501, "mean_token_accuracy": 0.1294899970293045, "num_tokens": 33938957.0, "step": 15690 }, { "entropy": 6.5513214588165285, "epoch": 1.679544116860185, "grad_norm": 1.640625, "learning_rate": 0.00047252306373921543, "loss": 6.2424, "mean_token_accuracy": 0.13886384218931197, "num_tokens": 33950169.0, "step": 15695 }, { "entropy": 6.535861158370972, "epoch": 1.680079190967949, "grad_norm": 2.015625, "learning_rate": 0.00047250475169032804, "loss": 6.2468, "mean_token_accuracy": 0.13359253630042076, "num_tokens": 33960800.0, "step": 15700 }, { "entropy": 6.4771155834198, "epoch": 1.680614265075713, "grad_norm": 1.2890625, "learning_rate": 0.0004724864339385185, "loss": 6.3202, "mean_token_accuracy": 0.1288799077272415, "num_tokens": 33973060.0, "step": 15705 }, { "entropy": 6.5491858959198, "epoch": 1.6811493391834769, "grad_norm": 1.3515625, "learning_rate": 0.0004724681104843161, "loss": 6.336, "mean_token_accuracy": 0.13036111146211624, "num_tokens": 33983185.0, "step": 15710 }, { "entropy": 6.601888990402221, "epoch": 1.681684413291241, "grad_norm": 1.4765625, "learning_rate": 0.0004724497813282497, "loss": 6.2704, "mean_token_accuracy": 0.13604292944073676, "num_tokens": 33993373.0, "step": 15715 }, { "entropy": 6.476183605194092, "epoch": 1.6822194873990046, "grad_norm": 1.453125, "learning_rate": 0.0004724314464708486, "loss": 6.1732, "mean_token_accuracy": 0.1464055560529232, "num_tokens": 34005793.0, "step": 15720 }, { "entropy": 6.529676342010498, "epoch": 1.6827545615067687, "grad_norm": 1.4375, "learning_rate": 0.0004724131059126423, "loss": 6.3317, "mean_token_accuracy": 0.1304813355207443, "num_tokens": 34016415.0, "step": 15725 }, { "entropy": 6.5095258235931395, "epoch": 1.6832896356145326, "grad_norm": 1.8125, "learning_rate": 0.00047239475965416016, "loss": 6.1945, "mean_token_accuracy": 0.13945785760879517, "num_tokens": 34026859.0, "step": 15730 }, { "entropy": 6.513905572891235, "epoch": 1.6838247097222965, "grad_norm": 2.53125, "learning_rate": 0.00047237640769593224, "loss": 6.1091, "mean_token_accuracy": 0.15040467530488968, "num_tokens": 34037942.0, "step": 15735 }, { "entropy": 6.506213903427124, "epoch": 1.6843597838300606, "grad_norm": 1.421875, "learning_rate": 0.0004723580500384882, "loss": 6.2223, "mean_token_accuracy": 0.13819267526268958, "num_tokens": 34048659.0, "step": 15740 }, { "entropy": 6.464280605316162, "epoch": 1.6848948579378242, "grad_norm": 2.046875, "learning_rate": 0.00047233968668235817, "loss": 6.1974, "mean_token_accuracy": 0.1391046404838562, "num_tokens": 34059961.0, "step": 15745 }, { "entropy": 6.515230655670166, "epoch": 1.6854299320455883, "grad_norm": 1.7578125, "learning_rate": 0.00047232131762807244, "loss": 6.2493, "mean_token_accuracy": 0.1414615035057068, "num_tokens": 34069978.0, "step": 15750 }, { "entropy": 6.545376348495483, "epoch": 1.6859650061533522, "grad_norm": 1.71875, "learning_rate": 0.0004723029428761614, "loss": 6.2716, "mean_token_accuracy": 0.1336756817996502, "num_tokens": 34080301.0, "step": 15755 }, { "entropy": 6.458175468444824, "epoch": 1.686500080261116, "grad_norm": 2.96875, "learning_rate": 0.00047228456242715564, "loss": 6.2515, "mean_token_accuracy": 0.1380471520125866, "num_tokens": 34092376.0, "step": 15760 }, { "entropy": 6.509817409515381, "epoch": 1.6870351543688802, "grad_norm": 1.5859375, "learning_rate": 0.0004722661762815858, "loss": 6.209, "mean_token_accuracy": 0.14321028292179108, "num_tokens": 34102761.0, "step": 15765 }, { "entropy": 6.539234590530396, "epoch": 1.687570228476644, "grad_norm": 2.203125, "learning_rate": 0.0004722477844399829, "loss": 6.2238, "mean_token_accuracy": 0.1323903277516365, "num_tokens": 34113370.0, "step": 15770 }, { "entropy": 6.537856483459473, "epoch": 1.688105302584408, "grad_norm": 1.5, "learning_rate": 0.0004722293869028779, "loss": 6.2491, "mean_token_accuracy": 0.14107812196016312, "num_tokens": 34125038.0, "step": 15775 }, { "entropy": 6.542143440246582, "epoch": 1.6886403766921718, "grad_norm": 1.625, "learning_rate": 0.0004722109836708021, "loss": 6.2806, "mean_token_accuracy": 0.1316600888967514, "num_tokens": 34135595.0, "step": 15780 }, { "entropy": 6.539742279052734, "epoch": 1.6891754507999357, "grad_norm": 1.9453125, "learning_rate": 0.00047219257474428685, "loss": 6.2637, "mean_token_accuracy": 0.1312544487416744, "num_tokens": 34146755.0, "step": 15785 }, { "entropy": 6.484871435165405, "epoch": 1.6897105249076998, "grad_norm": 1.28125, "learning_rate": 0.00047217416012386367, "loss": 6.1226, "mean_token_accuracy": 0.14985355362296104, "num_tokens": 34158465.0, "step": 15790 }, { "entropy": 6.510846424102783, "epoch": 1.6902455990154637, "grad_norm": 1.359375, "learning_rate": 0.0004721557398100644, "loss": 6.2226, "mean_token_accuracy": 0.13456518054008484, "num_tokens": 34170007.0, "step": 15795 }, { "entropy": 6.538952875137329, "epoch": 1.6907806731232276, "grad_norm": 1.578125, "learning_rate": 0.00047213731380342077, "loss": 6.304, "mean_token_accuracy": 0.1294082783162594, "num_tokens": 34181595.0, "step": 15800 }, { "entropy": 6.546925115585327, "epoch": 1.6913157472309917, "grad_norm": 1.453125, "learning_rate": 0.000472118882104465, "loss": 6.2689, "mean_token_accuracy": 0.13665975481271744, "num_tokens": 34191791.0, "step": 15805 }, { "entropy": 6.549110746383667, "epoch": 1.6918508213387553, "grad_norm": 1.6171875, "learning_rate": 0.00047210044471372915, "loss": 6.1673, "mean_token_accuracy": 0.13872140422463416, "num_tokens": 34202636.0, "step": 15810 }, { "entropy": 6.570005178451538, "epoch": 1.6923858954465194, "grad_norm": 1.546875, "learning_rate": 0.0004720820016317456, "loss": 6.3077, "mean_token_accuracy": 0.13125923350453378, "num_tokens": 34213333.0, "step": 15815 }, { "entropy": 6.547509574890137, "epoch": 1.6929209695542833, "grad_norm": 1.3671875, "learning_rate": 0.000472063552859047, "loss": 6.2655, "mean_token_accuracy": 0.1336832843720913, "num_tokens": 34223679.0, "step": 15820 }, { "entropy": 6.515771150588989, "epoch": 1.6934560436620472, "grad_norm": 1.4921875, "learning_rate": 0.00047204509839616604, "loss": 6.3751, "mean_token_accuracy": 0.12890572771430014, "num_tokens": 34234528.0, "step": 15825 }, { "entropy": 6.502412509918213, "epoch": 1.6939911177698113, "grad_norm": 1.2109375, "learning_rate": 0.0004720266382436355, "loss": 6.1929, "mean_token_accuracy": 0.13582652881741525, "num_tokens": 34246203.0, "step": 15830 }, { "entropy": 6.513867616653442, "epoch": 1.694526191877575, "grad_norm": 2.234375, "learning_rate": 0.00047200817240198846, "loss": 6.1978, "mean_token_accuracy": 0.13635388165712356, "num_tokens": 34257231.0, "step": 15835 }, { "entropy": 6.518395709991455, "epoch": 1.695061265985339, "grad_norm": 1.625, "learning_rate": 0.00047198970087175817, "loss": 6.2256, "mean_token_accuracy": 0.13498940616846083, "num_tokens": 34268900.0, "step": 15840 }, { "entropy": 6.494491291046143, "epoch": 1.695596340093103, "grad_norm": 1.4140625, "learning_rate": 0.0004719712236534779, "loss": 6.2955, "mean_token_accuracy": 0.12909621819853784, "num_tokens": 34279343.0, "step": 15845 }, { "entropy": 6.494324111938477, "epoch": 1.6961314142008668, "grad_norm": 1.4453125, "learning_rate": 0.0004719527407476812, "loss": 6.2459, "mean_token_accuracy": 0.1420057773590088, "num_tokens": 34291952.0, "step": 15850 }, { "entropy": 6.555724811553955, "epoch": 1.6966664883086309, "grad_norm": 1.5, "learning_rate": 0.00047193425215490186, "loss": 6.266, "mean_token_accuracy": 0.1280573323369026, "num_tokens": 34302516.0, "step": 15855 }, { "entropy": 6.5335493087768555, "epoch": 1.6972015624163945, "grad_norm": 1.625, "learning_rate": 0.00047191575787567373, "loss": 6.1908, "mean_token_accuracy": 0.1397932641208172, "num_tokens": 34313094.0, "step": 15860 }, { "entropy": 6.547899580001831, "epoch": 1.6977366365241586, "grad_norm": 1.3125, "learning_rate": 0.0004718972579105306, "loss": 6.3164, "mean_token_accuracy": 0.13232587426900863, "num_tokens": 34324803.0, "step": 15865 }, { "entropy": 6.49736008644104, "epoch": 1.6982717106319225, "grad_norm": 1.40625, "learning_rate": 0.0004718787522600069, "loss": 6.279, "mean_token_accuracy": 0.12415364533662795, "num_tokens": 34336386.0, "step": 15870 }, { "entropy": 6.550452852249146, "epoch": 1.6988067847396864, "grad_norm": 1.40625, "learning_rate": 0.0004718602409246369, "loss": 6.2936, "mean_token_accuracy": 0.12681039273738862, "num_tokens": 34347085.0, "step": 15875 }, { "entropy": 6.48975772857666, "epoch": 1.6993418588474505, "grad_norm": 1.5625, "learning_rate": 0.00047184172390495505, "loss": 6.2184, "mean_token_accuracy": 0.1400773286819458, "num_tokens": 34358146.0, "step": 15880 }, { "entropy": 6.538142299652099, "epoch": 1.6998769329552141, "grad_norm": 1.5859375, "learning_rate": 0.0004718232012014961, "loss": 6.2662, "mean_token_accuracy": 0.1347523719072342, "num_tokens": 34370403.0, "step": 15885 }, { "entropy": 6.582979202270508, "epoch": 1.7004120070629782, "grad_norm": 1.9765625, "learning_rate": 0.00047180467281479496, "loss": 6.2494, "mean_token_accuracy": 0.1374131441116333, "num_tokens": 34381130.0, "step": 15890 }, { "entropy": 6.479326438903809, "epoch": 1.7009470811707421, "grad_norm": 1.4609375, "learning_rate": 0.0004717861387453865, "loss": 6.2961, "mean_token_accuracy": 0.13613806441426277, "num_tokens": 34391610.0, "step": 15895 }, { "entropy": 6.517370939254761, "epoch": 1.701482155278506, "grad_norm": 1.3671875, "learning_rate": 0.0004717675989938059, "loss": 6.2606, "mean_token_accuracy": 0.13521123230457305, "num_tokens": 34402262.0, "step": 15900 }, { "entropy": 6.533929634094238, "epoch": 1.70201722938627, "grad_norm": 1.4453125, "learning_rate": 0.00047174905356058857, "loss": 6.2611, "mean_token_accuracy": 0.13481214940547942, "num_tokens": 34412707.0, "step": 15905 }, { "entropy": 6.501676940917969, "epoch": 1.702552303494034, "grad_norm": 2.109375, "learning_rate": 0.00047173050244626993, "loss": 6.1814, "mean_token_accuracy": 0.14371191561222077, "num_tokens": 34423203.0, "step": 15910 }, { "entropy": 6.498485040664673, "epoch": 1.7030873776017978, "grad_norm": 1.40625, "learning_rate": 0.0004717119456513857, "loss": 6.278, "mean_token_accuracy": 0.13548828661441803, "num_tokens": 34433279.0, "step": 15915 }, { "entropy": 6.535174369812012, "epoch": 1.7036224517095617, "grad_norm": 1.875, "learning_rate": 0.00047169338317647164, "loss": 6.3336, "mean_token_accuracy": 0.13515316545963288, "num_tokens": 34444601.0, "step": 15920 }, { "entropy": 6.563399600982666, "epoch": 1.7041575258173256, "grad_norm": 1.6015625, "learning_rate": 0.00047167481502206383, "loss": 6.2541, "mean_token_accuracy": 0.13447251841425895, "num_tokens": 34455103.0, "step": 15925 }, { "entropy": 6.5051501274108885, "epoch": 1.7046925999250897, "grad_norm": 1.3671875, "learning_rate": 0.00047165624118869834, "loss": 6.2859, "mean_token_accuracy": 0.1337140329182148, "num_tokens": 34465835.0, "step": 15930 }, { "entropy": 6.628179454803467, "epoch": 1.7052276740328536, "grad_norm": 1.7578125, "learning_rate": 0.0004716376616769115, "loss": 6.319, "mean_token_accuracy": 0.13249458372592926, "num_tokens": 34476602.0, "step": 15935 }, { "entropy": 6.5752206325531, "epoch": 1.7057627481406175, "grad_norm": 1.3828125, "learning_rate": 0.0004716190764872399, "loss": 6.2112, "mean_token_accuracy": 0.13616498783230782, "num_tokens": 34488026.0, "step": 15940 }, { "entropy": 6.512110948562622, "epoch": 1.7062978222483816, "grad_norm": 1.40625, "learning_rate": 0.00047160048562022006, "loss": 6.2999, "mean_token_accuracy": 0.1379050388932228, "num_tokens": 34497837.0, "step": 15945 }, { "entropy": 6.486044931411743, "epoch": 1.7068328963561452, "grad_norm": 1.359375, "learning_rate": 0.0004715818890763888, "loss": 6.2503, "mean_token_accuracy": 0.13753306791186332, "num_tokens": 34507727.0, "step": 15950 }, { "entropy": 6.549686336517334, "epoch": 1.7073679704639093, "grad_norm": 1.6484375, "learning_rate": 0.00047156328685628307, "loss": 6.2464, "mean_token_accuracy": 0.1331082597374916, "num_tokens": 34518595.0, "step": 15955 }, { "entropy": 6.456800651550293, "epoch": 1.7079030445716732, "grad_norm": 2.28125, "learning_rate": 0.0004715446789604401, "loss": 6.1895, "mean_token_accuracy": 0.1428788721561432, "num_tokens": 34529415.0, "step": 15960 }, { "entropy": 6.492120552062988, "epoch": 1.708438118679437, "grad_norm": 1.6328125, "learning_rate": 0.0004715260653893972, "loss": 6.2195, "mean_token_accuracy": 0.14320783391594888, "num_tokens": 34539593.0, "step": 15965 }, { "entropy": 6.537639427185058, "epoch": 1.7089731927872012, "grad_norm": 2.34375, "learning_rate": 0.0004715074461436917, "loss": 6.239, "mean_token_accuracy": 0.13498525097966194, "num_tokens": 34549441.0, "step": 15970 }, { "entropy": 6.523940563201904, "epoch": 1.7095082668949648, "grad_norm": 1.5, "learning_rate": 0.00047148882122386126, "loss": 6.186, "mean_token_accuracy": 0.14013878330588342, "num_tokens": 34560211.0, "step": 15975 }, { "entropy": 6.5388068675994875, "epoch": 1.710043341002729, "grad_norm": 2.0, "learning_rate": 0.00047147019063044387, "loss": 6.2895, "mean_token_accuracy": 0.1317762777209282, "num_tokens": 34570479.0, "step": 15980 }, { "entropy": 6.541228723526001, "epoch": 1.7105784151104928, "grad_norm": 1.515625, "learning_rate": 0.00047145155436397726, "loss": 6.2735, "mean_token_accuracy": 0.13681796863675116, "num_tokens": 34581382.0, "step": 15985 }, { "entropy": 6.5268425941467285, "epoch": 1.7111134892182567, "grad_norm": 1.4453125, "learning_rate": 0.0004714329124249996, "loss": 6.206, "mean_token_accuracy": 0.14237518087029458, "num_tokens": 34592131.0, "step": 15990 }, { "entropy": 6.565146017074585, "epoch": 1.7116485633260208, "grad_norm": 2.109375, "learning_rate": 0.0004714142648140492, "loss": 6.3051, "mean_token_accuracy": 0.13531598448753357, "num_tokens": 34604407.0, "step": 15995 }, { "entropy": 6.500683689117432, "epoch": 1.7121836374337844, "grad_norm": 4.875, "learning_rate": 0.0004713956115316645, "loss": 6.1684, "mean_token_accuracy": 0.1376279339194298, "num_tokens": 34614842.0, "step": 16000 }, { "entropy": 6.39294056892395, "epoch": 1.7127187115415485, "grad_norm": 1.4453125, "learning_rate": 0.0004713769525783841, "loss": 6.1313, "mean_token_accuracy": 0.14383530020713806, "num_tokens": 34625991.0, "step": 16005 }, { "entropy": 6.4572838306427, "epoch": 1.7132537856493124, "grad_norm": 1.4453125, "learning_rate": 0.0004713582879547469, "loss": 6.2946, "mean_token_accuracy": 0.13821927458047867, "num_tokens": 34637317.0, "step": 16010 }, { "entropy": 6.557463788986206, "epoch": 1.7137888597570763, "grad_norm": 1.671875, "learning_rate": 0.0004713396176612916, "loss": 6.2749, "mean_token_accuracy": 0.13008446544408797, "num_tokens": 34648282.0, "step": 16015 }, { "entropy": 6.550800371170044, "epoch": 1.7143239338648404, "grad_norm": 1.46875, "learning_rate": 0.0004713209416985575, "loss": 6.2374, "mean_token_accuracy": 0.13565487340092658, "num_tokens": 34658638.0, "step": 16020 }, { "entropy": 6.4996785640716555, "epoch": 1.714859007972604, "grad_norm": 1.3828125, "learning_rate": 0.00047130226006708375, "loss": 6.2597, "mean_token_accuracy": 0.1346914291381836, "num_tokens": 34669308.0, "step": 16025 }, { "entropy": 6.495907831192016, "epoch": 1.7153940820803681, "grad_norm": 1.5859375, "learning_rate": 0.00047128357276740986, "loss": 6.2504, "mean_token_accuracy": 0.13608802780508994, "num_tokens": 34679513.0, "step": 16030 }, { "entropy": 6.542607116699219, "epoch": 1.715929156188132, "grad_norm": 1.8203125, "learning_rate": 0.0004712648798000754, "loss": 6.2512, "mean_token_accuracy": 0.1372469075024128, "num_tokens": 34690736.0, "step": 16035 }, { "entropy": 6.527480745315552, "epoch": 1.716464230295896, "grad_norm": 1.3671875, "learning_rate": 0.00047124618116562003, "loss": 6.2315, "mean_token_accuracy": 0.13630061373114585, "num_tokens": 34701272.0, "step": 16040 }, { "entropy": 6.434833574295044, "epoch": 1.71699930440366, "grad_norm": 1.78125, "learning_rate": 0.0004712274768645839, "loss": 6.1692, "mean_token_accuracy": 0.14119511395692824, "num_tokens": 34712486.0, "step": 16045 }, { "entropy": 6.547205400466919, "epoch": 1.7175343785114239, "grad_norm": 1.3046875, "learning_rate": 0.00047120876689750685, "loss": 6.2375, "mean_token_accuracy": 0.1389646753668785, "num_tokens": 34721979.0, "step": 16050 }, { "entropy": 6.502142906188965, "epoch": 1.7180694526191878, "grad_norm": 1.7578125, "learning_rate": 0.0004711900512649292, "loss": 6.2311, "mean_token_accuracy": 0.13534836918115617, "num_tokens": 34733496.0, "step": 16055 }, { "entropy": 6.52419753074646, "epoch": 1.7186045267269516, "grad_norm": 1.484375, "learning_rate": 0.0004711713299673914, "loss": 6.2565, "mean_token_accuracy": 0.13493360206484795, "num_tokens": 34744223.0, "step": 16060 }, { "entropy": 6.485661029815674, "epoch": 1.7191396008347155, "grad_norm": 1.671875, "learning_rate": 0.00047115260300543407, "loss": 6.2972, "mean_token_accuracy": 0.1354266181588173, "num_tokens": 34754931.0, "step": 16065 }, { "entropy": 6.456936025619507, "epoch": 1.7196746749424796, "grad_norm": 1.796875, "learning_rate": 0.0004711338703795978, "loss": 6.1516, "mean_token_accuracy": 0.14075466692447663, "num_tokens": 34766285.0, "step": 16070 }, { "entropy": 6.499564981460571, "epoch": 1.7202097490502435, "grad_norm": 2.390625, "learning_rate": 0.0004711151320904237, "loss": 6.231, "mean_token_accuracy": 0.14091445803642272, "num_tokens": 34776979.0, "step": 16075 }, { "entropy": 6.55362229347229, "epoch": 1.7207448231580074, "grad_norm": 1.3046875, "learning_rate": 0.0004710963881384527, "loss": 6.3168, "mean_token_accuracy": 0.13049443140625955, "num_tokens": 34787466.0, "step": 16080 }, { "entropy": 6.589805269241333, "epoch": 1.7212798972657715, "grad_norm": 1.71875, "learning_rate": 0.000471077638524226, "loss": 6.2395, "mean_token_accuracy": 0.1367537833750248, "num_tokens": 34797664.0, "step": 16085 }, { "entropy": 6.486291074752808, "epoch": 1.7218149713735351, "grad_norm": 1.6640625, "learning_rate": 0.00047105888324828506, "loss": 6.2177, "mean_token_accuracy": 0.14723237380385398, "num_tokens": 34809082.0, "step": 16090 }, { "entropy": 6.523463010787964, "epoch": 1.7223500454812992, "grad_norm": 1.53125, "learning_rate": 0.00047104012231117143, "loss": 6.2371, "mean_token_accuracy": 0.1389696106314659, "num_tokens": 34820223.0, "step": 16095 }, { "entropy": 6.435459613800049, "epoch": 1.722885119589063, "grad_norm": 1.34375, "learning_rate": 0.00047102135571342683, "loss": 6.1566, "mean_token_accuracy": 0.1369843900203705, "num_tokens": 34830428.0, "step": 16100 }, { "entropy": 6.462934303283691, "epoch": 1.723420193696827, "grad_norm": 1.4140625, "learning_rate": 0.00047100258345559307, "loss": 6.2712, "mean_token_accuracy": 0.1307723380625248, "num_tokens": 34842787.0, "step": 16105 }, { "entropy": 6.507791662216187, "epoch": 1.723955267804591, "grad_norm": 1.3125, "learning_rate": 0.0004709838055382123, "loss": 6.2059, "mean_token_accuracy": 0.13265354037284852, "num_tokens": 34854323.0, "step": 16110 }, { "entropy": 6.4878136157989506, "epoch": 1.7244903419123547, "grad_norm": 1.3203125, "learning_rate": 0.0004709650219618266, "loss": 6.1923, "mean_token_accuracy": 0.13792682066559792, "num_tokens": 34865279.0, "step": 16115 }, { "entropy": 6.48901333808899, "epoch": 1.7250254160201188, "grad_norm": 1.90625, "learning_rate": 0.0004709462327269785, "loss": 6.2201, "mean_token_accuracy": 0.13436542078852654, "num_tokens": 34875951.0, "step": 16120 }, { "entropy": 6.490832757949829, "epoch": 1.7255604901278827, "grad_norm": 1.453125, "learning_rate": 0.0004709274378342105, "loss": 6.2368, "mean_token_accuracy": 0.1372871771454811, "num_tokens": 34885815.0, "step": 16125 }, { "entropy": 6.560395050048828, "epoch": 1.7260955642356466, "grad_norm": 1.4453125, "learning_rate": 0.00047090863728406517, "loss": 6.2759, "mean_token_accuracy": 0.13472879230976104, "num_tokens": 34897158.0, "step": 16130 }, { "entropy": 6.59221568107605, "epoch": 1.7266306383434107, "grad_norm": 1.4296875, "learning_rate": 0.0004708898310770856, "loss": 6.2824, "mean_token_accuracy": 0.1327106237411499, "num_tokens": 34907815.0, "step": 16135 }, { "entropy": 6.531020069122315, "epoch": 1.7271657124511743, "grad_norm": 1.3671875, "learning_rate": 0.0004708710192138146, "loss": 6.237, "mean_token_accuracy": 0.1372152455151081, "num_tokens": 34918820.0, "step": 16140 }, { "entropy": 6.56586446762085, "epoch": 1.7277007865589384, "grad_norm": 2.03125, "learning_rate": 0.0004708522016947954, "loss": 6.3121, "mean_token_accuracy": 0.13564084842801094, "num_tokens": 34929998.0, "step": 16145 }, { "entropy": 6.4926958084106445, "epoch": 1.7282358606667023, "grad_norm": 1.3828125, "learning_rate": 0.0004708333785205715, "loss": 6.2174, "mean_token_accuracy": 0.14865463376045226, "num_tokens": 34940989.0, "step": 16150 }, { "entropy": 6.5131425857543945, "epoch": 1.7287709347744662, "grad_norm": 2.328125, "learning_rate": 0.0004708145496916862, "loss": 6.2268, "mean_token_accuracy": 0.13459616228938104, "num_tokens": 34952433.0, "step": 16155 }, { "entropy": 6.573882055282593, "epoch": 1.7293060088822303, "grad_norm": 1.84375, "learning_rate": 0.00047079571520868344, "loss": 6.2891, "mean_token_accuracy": 0.1309241198003292, "num_tokens": 34963074.0, "step": 16160 }, { "entropy": 6.493603801727295, "epoch": 1.729841082989994, "grad_norm": 1.4765625, "learning_rate": 0.00047077687507210674, "loss": 6.2163, "mean_token_accuracy": 0.1405037112534046, "num_tokens": 34974315.0, "step": 16165 }, { "entropy": 6.457288455963135, "epoch": 1.730376157097758, "grad_norm": 1.5234375, "learning_rate": 0.0004707580292825004, "loss": 6.1575, "mean_token_accuracy": 0.15218150988221169, "num_tokens": 34985059.0, "step": 16170 }, { "entropy": 6.480514097213745, "epoch": 1.730911231205522, "grad_norm": 1.7734375, "learning_rate": 0.0004707391778404085, "loss": 6.3326, "mean_token_accuracy": 0.12655592635273932, "num_tokens": 34996156.0, "step": 16175 }, { "entropy": 6.564816570281982, "epoch": 1.7314463053132858, "grad_norm": 1.8515625, "learning_rate": 0.0004707203207463752, "loss": 6.2518, "mean_token_accuracy": 0.13536330088973045, "num_tokens": 35007410.0, "step": 16180 }, { "entropy": 6.5748625755310055, "epoch": 1.73198137942105, "grad_norm": 1.546875, "learning_rate": 0.0004707014580009453, "loss": 6.2302, "mean_token_accuracy": 0.14098969027400016, "num_tokens": 35018492.0, "step": 16185 }, { "entropy": 6.557524681091309, "epoch": 1.7325164535288138, "grad_norm": 1.6796875, "learning_rate": 0.0004706825896046632, "loss": 6.2829, "mean_token_accuracy": 0.1356653481721878, "num_tokens": 35029923.0, "step": 16190 }, { "entropy": 6.505240440368652, "epoch": 1.7330515276365777, "grad_norm": 1.5, "learning_rate": 0.00047066371555807386, "loss": 6.2046, "mean_token_accuracy": 0.13501440957188607, "num_tokens": 35040370.0, "step": 16195 }, { "entropy": 6.526643562316894, "epoch": 1.7335866017443415, "grad_norm": 1.6015625, "learning_rate": 0.0004706448358617222, "loss": 6.2823, "mean_token_accuracy": 0.1304975025355816, "num_tokens": 35051414.0, "step": 16200 }, { "entropy": 6.581493234634399, "epoch": 1.7341216758521054, "grad_norm": 1.34375, "learning_rate": 0.00047062595051615343, "loss": 6.2024, "mean_token_accuracy": 0.14306259751319886, "num_tokens": 35061015.0, "step": 16205 }, { "entropy": 6.513972759246826, "epoch": 1.7346567499598695, "grad_norm": 1.796875, "learning_rate": 0.0004706070595219128, "loss": 6.2947, "mean_token_accuracy": 0.1341689184308052, "num_tokens": 35071757.0, "step": 16210 }, { "entropy": 6.516111135482788, "epoch": 1.7351918240676334, "grad_norm": 2.0, "learning_rate": 0.00047058816287954587, "loss": 6.2696, "mean_token_accuracy": 0.13728854209184646, "num_tokens": 35082912.0, "step": 16215 }, { "entropy": 6.561192560195923, "epoch": 1.7357268981753973, "grad_norm": 1.640625, "learning_rate": 0.00047056926058959813, "loss": 6.2331, "mean_token_accuracy": 0.1454016536474228, "num_tokens": 35094103.0, "step": 16220 }, { "entropy": 6.521594715118408, "epoch": 1.7362619722831614, "grad_norm": 2.34375, "learning_rate": 0.0004705503526526155, "loss": 6.1875, "mean_token_accuracy": 0.13738676756620408, "num_tokens": 35105960.0, "step": 16225 }, { "entropy": 6.445529317855835, "epoch": 1.736797046390925, "grad_norm": 1.515625, "learning_rate": 0.00047053143906914405, "loss": 6.208, "mean_token_accuracy": 0.14483401402831078, "num_tokens": 35116482.0, "step": 16230 }, { "entropy": 6.52421383857727, "epoch": 1.7373321204986891, "grad_norm": 2.375, "learning_rate": 0.00047051251983972966, "loss": 6.2693, "mean_token_accuracy": 0.1380905956029892, "num_tokens": 35127976.0, "step": 16235 }, { "entropy": 6.5142865657806395, "epoch": 1.737867194606453, "grad_norm": 1.59375, "learning_rate": 0.0004704935949649187, "loss": 6.2711, "mean_token_accuracy": 0.13424955755472184, "num_tokens": 35137712.0, "step": 16240 }, { "entropy": 6.436436986923217, "epoch": 1.7384022687142169, "grad_norm": 2.953125, "learning_rate": 0.0004704746644452577, "loss": 6.176, "mean_token_accuracy": 0.13780921846628189, "num_tokens": 35148524.0, "step": 16245 }, { "entropy": 6.491331481933594, "epoch": 1.738937342821981, "grad_norm": 1.3671875, "learning_rate": 0.00047045572828129323, "loss": 6.2687, "mean_token_accuracy": 0.13721957728266715, "num_tokens": 35159080.0, "step": 16250 }, { "entropy": 6.366399574279785, "epoch": 1.7394724169297446, "grad_norm": 1.21875, "learning_rate": 0.000470436786473572, "loss": 6.1653, "mean_token_accuracy": 0.13959982618689537, "num_tokens": 35169993.0, "step": 16255 }, { "entropy": 6.465382099151611, "epoch": 1.7400074910375087, "grad_norm": 1.578125, "learning_rate": 0.0004704178390226411, "loss": 6.2004, "mean_token_accuracy": 0.13708374574780463, "num_tokens": 35181413.0, "step": 16260 }, { "entropy": 6.476068544387817, "epoch": 1.7405425651452726, "grad_norm": 1.515625, "learning_rate": 0.00047039888592904753, "loss": 6.198, "mean_token_accuracy": 0.14310968890786172, "num_tokens": 35191600.0, "step": 16265 }, { "entropy": 6.515720224380493, "epoch": 1.7410776392530365, "grad_norm": 1.46875, "learning_rate": 0.00047037992719333864, "loss": 6.2098, "mean_token_accuracy": 0.13760415241122245, "num_tokens": 35202535.0, "step": 16270 }, { "entropy": 6.517277812957763, "epoch": 1.7416127133608006, "grad_norm": 1.40625, "learning_rate": 0.00047036096281606176, "loss": 6.2256, "mean_token_accuracy": 0.130896158516407, "num_tokens": 35214798.0, "step": 16275 }, { "entropy": 6.5141020774841305, "epoch": 1.7421477874685642, "grad_norm": 1.5859375, "learning_rate": 0.00047034199279776456, "loss": 6.1867, "mean_token_accuracy": 0.1439959242939949, "num_tokens": 35224870.0, "step": 16280 }, { "entropy": 6.490610218048095, "epoch": 1.7426828615763283, "grad_norm": 2.734375, "learning_rate": 0.0004703230171389948, "loss": 6.2043, "mean_token_accuracy": 0.1389573745429516, "num_tokens": 35235408.0, "step": 16285 }, { "entropy": 6.441397047042846, "epoch": 1.7432179356840922, "grad_norm": 1.703125, "learning_rate": 0.00047030403584030024, "loss": 6.2315, "mean_token_accuracy": 0.14157229885458947, "num_tokens": 35246310.0, "step": 16290 }, { "entropy": 6.481639003753662, "epoch": 1.743753009791856, "grad_norm": 1.5, "learning_rate": 0.0004702850489022292, "loss": 6.2518, "mean_token_accuracy": 0.13529093638062478, "num_tokens": 35257027.0, "step": 16295 }, { "entropy": 6.591700649261474, "epoch": 1.7442880838996202, "grad_norm": 1.5, "learning_rate": 0.00047026605632532976, "loss": 6.2193, "mean_token_accuracy": 0.13825585916638375, "num_tokens": 35267397.0, "step": 16300 }, { "entropy": 6.4336450576782225, "epoch": 1.7448231580073839, "grad_norm": 1.3515625, "learning_rate": 0.00047024705811015045, "loss": 6.163, "mean_token_accuracy": 0.14259003922343255, "num_tokens": 35278775.0, "step": 16305 }, { "entropy": 6.446195077896118, "epoch": 1.745358232115148, "grad_norm": 1.8046875, "learning_rate": 0.0004702280542572397, "loss": 6.1124, "mean_token_accuracy": 0.14629908427596092, "num_tokens": 35288818.0, "step": 16310 }, { "entropy": 6.5565478801727295, "epoch": 1.7458933062229118, "grad_norm": 1.640625, "learning_rate": 0.0004702090447671464, "loss": 6.317, "mean_token_accuracy": 0.1260501079261303, "num_tokens": 35299385.0, "step": 16315 }, { "entropy": 6.503725910186768, "epoch": 1.7464283803306757, "grad_norm": 1.59375, "learning_rate": 0.0004701900296404193, "loss": 6.176, "mean_token_accuracy": 0.14620715752243996, "num_tokens": 35310626.0, "step": 16320 }, { "entropy": 6.545715284347534, "epoch": 1.7469634544384398, "grad_norm": 1.390625, "learning_rate": 0.0004701710088776075, "loss": 6.2858, "mean_token_accuracy": 0.13202030956745148, "num_tokens": 35321615.0, "step": 16325 }, { "entropy": 6.573356199264526, "epoch": 1.7474985285462037, "grad_norm": 1.640625, "learning_rate": 0.00047015198247926025, "loss": 6.2808, "mean_token_accuracy": 0.13973275944590569, "num_tokens": 35332012.0, "step": 16330 }, { "entropy": 6.562140321731567, "epoch": 1.7480336026539676, "grad_norm": 1.4140625, "learning_rate": 0.000470132950445927, "loss": 6.3014, "mean_token_accuracy": 0.12587928250432015, "num_tokens": 35342153.0, "step": 16335 }, { "entropy": 6.530314254760742, "epoch": 1.7485686767617317, "grad_norm": 1.40625, "learning_rate": 0.0004701139127781571, "loss": 6.2257, "mean_token_accuracy": 0.13639529570937156, "num_tokens": 35352858.0, "step": 16340 }, { "entropy": 6.514222860336304, "epoch": 1.7491037508694953, "grad_norm": 1.4921875, "learning_rate": 0.0004700948694765005, "loss": 6.1479, "mean_token_accuracy": 0.14512947499752044, "num_tokens": 35363489.0, "step": 16345 }, { "entropy": 6.55261082649231, "epoch": 1.7496388249772594, "grad_norm": 1.6796875, "learning_rate": 0.0004700758205415069, "loss": 6.3504, "mean_token_accuracy": 0.13262177556753157, "num_tokens": 35375816.0, "step": 16350 }, { "entropy": 6.506987237930298, "epoch": 1.7501738990850233, "grad_norm": 2.859375, "learning_rate": 0.00047005676597372645, "loss": 6.2305, "mean_token_accuracy": 0.13197326436638832, "num_tokens": 35386708.0, "step": 16355 }, { "entropy": 6.4838512420654295, "epoch": 1.7507089731927872, "grad_norm": 2.03125, "learning_rate": 0.00047003770577370925, "loss": 6.2964, "mean_token_accuracy": 0.13025422096252443, "num_tokens": 35397734.0, "step": 16360 }, { "entropy": 6.612907648086548, "epoch": 1.7512440473005513, "grad_norm": 1.6484375, "learning_rate": 0.00047001863994200574, "loss": 6.243, "mean_token_accuracy": 0.13965339437127114, "num_tokens": 35408870.0, "step": 16365 }, { "entropy": 6.496535873413086, "epoch": 1.751779121408315, "grad_norm": 1.6875, "learning_rate": 0.0004699995684791664, "loss": 6.1831, "mean_token_accuracy": 0.1359889529645443, "num_tokens": 35419498.0, "step": 16370 }, { "entropy": 6.436664390563965, "epoch": 1.752314195516079, "grad_norm": 1.71875, "learning_rate": 0.00046998049138574177, "loss": 6.1926, "mean_token_accuracy": 0.14066151529550552, "num_tokens": 35430690.0, "step": 16375 }, { "entropy": 6.455047512054444, "epoch": 1.752849269623843, "grad_norm": 1.7734375, "learning_rate": 0.000469961408662283, "loss": 6.1547, "mean_token_accuracy": 0.14213127717375756, "num_tokens": 35441007.0, "step": 16380 }, { "entropy": 6.447874355316162, "epoch": 1.7533843437316068, "grad_norm": 1.671875, "learning_rate": 0.000469942320309341, "loss": 6.2236, "mean_token_accuracy": 0.14288512840867043, "num_tokens": 35453202.0, "step": 16385 }, { "entropy": 6.465952157974243, "epoch": 1.7539194178393709, "grad_norm": 1.4375, "learning_rate": 0.00046992322632746677, "loss": 6.227, "mean_token_accuracy": 0.14558738470077515, "num_tokens": 35463303.0, "step": 16390 }, { "entropy": 6.510498428344727, "epoch": 1.7544544919471345, "grad_norm": 1.9375, "learning_rate": 0.00046990412671721186, "loss": 6.222, "mean_token_accuracy": 0.14194708690047264, "num_tokens": 35474104.0, "step": 16395 }, { "entropy": 6.53613052368164, "epoch": 1.7549895660548986, "grad_norm": 1.9921875, "learning_rate": 0.0004698850214791276, "loss": 6.2567, "mean_token_accuracy": 0.1344727098941803, "num_tokens": 35486412.0, "step": 16400 }, { "entropy": 6.533957195281983, "epoch": 1.7555246401626625, "grad_norm": 1.5234375, "learning_rate": 0.0004698659106137658, "loss": 6.2316, "mean_token_accuracy": 0.1366186335682869, "num_tokens": 35497505.0, "step": 16405 }, { "entropy": 6.578169441223144, "epoch": 1.7560597142704264, "grad_norm": 5.15625, "learning_rate": 0.0004698467941216782, "loss": 6.2773, "mean_token_accuracy": 0.13750482201576233, "num_tokens": 35508397.0, "step": 16410 }, { "entropy": 6.60500431060791, "epoch": 1.7565947883781905, "grad_norm": 1.6171875, "learning_rate": 0.00046982767200341675, "loss": 6.3211, "mean_token_accuracy": 0.13072726875543594, "num_tokens": 35520261.0, "step": 16415 }, { "entropy": 6.531397581100464, "epoch": 1.7571298624859542, "grad_norm": 1.3359375, "learning_rate": 0.00046980854425953365, "loss": 6.1989, "mean_token_accuracy": 0.13409352228045462, "num_tokens": 35531816.0, "step": 16420 }, { "entropy": 6.530423879623413, "epoch": 1.7576649365937183, "grad_norm": 1.4296875, "learning_rate": 0.0004697894108905813, "loss": 6.2825, "mean_token_accuracy": 0.13641773015260697, "num_tokens": 35542233.0, "step": 16425 }, { "entropy": 6.508632040023803, "epoch": 1.7582000107014821, "grad_norm": 1.5390625, "learning_rate": 0.00046977027189711197, "loss": 6.2112, "mean_token_accuracy": 0.1387732908129692, "num_tokens": 35552881.0, "step": 16430 }, { "entropy": 6.4908287048339846, "epoch": 1.758735084809246, "grad_norm": 1.5625, "learning_rate": 0.0004697511272796785, "loss": 6.1707, "mean_token_accuracy": 0.13812109753489493, "num_tokens": 35562392.0, "step": 16435 }, { "entropy": 6.495633935928344, "epoch": 1.75927015891701, "grad_norm": 2.453125, "learning_rate": 0.0004697319770388335, "loss": 6.2605, "mean_token_accuracy": 0.13243331611156464, "num_tokens": 35574587.0, "step": 16440 }, { "entropy": 6.49248194694519, "epoch": 1.759805233024774, "grad_norm": 1.515625, "learning_rate": 0.0004697128211751301, "loss": 6.1313, "mean_token_accuracy": 0.1406071349978447, "num_tokens": 35585178.0, "step": 16445 }, { "entropy": 6.460205698013306, "epoch": 1.7603403071325379, "grad_norm": 1.5, "learning_rate": 0.0004696936596891213, "loss": 6.1919, "mean_token_accuracy": 0.13646092414855956, "num_tokens": 35595501.0, "step": 16450 }, { "entropy": 6.509033679962158, "epoch": 1.7608753812403017, "grad_norm": 3.703125, "learning_rate": 0.0004696744925813605, "loss": 6.2236, "mean_token_accuracy": 0.13326306268572807, "num_tokens": 35606794.0, "step": 16455 }, { "entropy": 6.5370752811431885, "epoch": 1.7614104553480656, "grad_norm": 1.546875, "learning_rate": 0.0004696553198524011, "loss": 6.2488, "mean_token_accuracy": 0.1357016831636429, "num_tokens": 35618732.0, "step": 16460 }, { "entropy": 6.498097991943359, "epoch": 1.7619455294558297, "grad_norm": 1.640625, "learning_rate": 0.0004696361415027966, "loss": 6.1716, "mean_token_accuracy": 0.1408173367381096, "num_tokens": 35629802.0, "step": 16465 }, { "entropy": 6.475509119033814, "epoch": 1.7624806035635936, "grad_norm": 1.328125, "learning_rate": 0.0004696169575331009, "loss": 6.2751, "mean_token_accuracy": 0.13238577544689178, "num_tokens": 35640826.0, "step": 16470 }, { "entropy": 6.536092138290405, "epoch": 1.7630156776713575, "grad_norm": 1.40625, "learning_rate": 0.000469597767943868, "loss": 6.2726, "mean_token_accuracy": 0.13249727264046668, "num_tokens": 35651613.0, "step": 16475 }, { "entropy": 6.469944190979004, "epoch": 1.7635507517791216, "grad_norm": 1.25, "learning_rate": 0.0004695785727356517, "loss": 6.1309, "mean_token_accuracy": 0.13989657014608384, "num_tokens": 35662334.0, "step": 16480 }, { "entropy": 6.536354923248291, "epoch": 1.7640858258868852, "grad_norm": 1.78125, "learning_rate": 0.0004695593719090066, "loss": 6.2903, "mean_token_accuracy": 0.13316132500767708, "num_tokens": 35673466.0, "step": 16485 }, { "entropy": 6.53029580116272, "epoch": 1.7646208999946493, "grad_norm": 2.421875, "learning_rate": 0.0004695401654644869, "loss": 6.2372, "mean_token_accuracy": 0.13935657143592833, "num_tokens": 35684708.0, "step": 16490 }, { "entropy": 6.461583137512207, "epoch": 1.7651559741024132, "grad_norm": 1.3984375, "learning_rate": 0.00046952095340264727, "loss": 6.1001, "mean_token_accuracy": 0.14150693714618684, "num_tokens": 35694888.0, "step": 16495 }, { "entropy": 6.519178009033203, "epoch": 1.765691048210177, "grad_norm": 1.3515625, "learning_rate": 0.00046950173572404255, "loss": 6.1638, "mean_token_accuracy": 0.13781533762812614, "num_tokens": 35704844.0, "step": 16500 }, { "entropy": 6.50765905380249, "epoch": 1.7662261223179412, "grad_norm": 2.265625, "learning_rate": 0.0004694825124292275, "loss": 6.2534, "mean_token_accuracy": 0.13843735828995704, "num_tokens": 35715468.0, "step": 16505 }, { "entropy": 6.509899616241455, "epoch": 1.7667611964257048, "grad_norm": 1.5078125, "learning_rate": 0.0004694632835187572, "loss": 6.3115, "mean_token_accuracy": 0.13584157973527908, "num_tokens": 35725542.0, "step": 16510 }, { "entropy": 6.535692405700684, "epoch": 1.767296270533469, "grad_norm": 1.40625, "learning_rate": 0.00046944404899318685, "loss": 6.1905, "mean_token_accuracy": 0.1380226269364357, "num_tokens": 35737032.0, "step": 16515 }, { "entropy": 6.53953366279602, "epoch": 1.7678313446412328, "grad_norm": 1.71875, "learning_rate": 0.000469424808853072, "loss": 6.2085, "mean_token_accuracy": 0.1371114008128643, "num_tokens": 35747742.0, "step": 16520 }, { "entropy": 6.465522813796997, "epoch": 1.7683664187489967, "grad_norm": 1.4765625, "learning_rate": 0.0004694055630989681, "loss": 6.1814, "mean_token_accuracy": 0.13816195577383042, "num_tokens": 35757795.0, "step": 16525 }, { "entropy": 6.460051870346069, "epoch": 1.7689014928567608, "grad_norm": 1.796875, "learning_rate": 0.0004693863117314308, "loss": 6.1784, "mean_token_accuracy": 0.1464919239282608, "num_tokens": 35767962.0, "step": 16530 }, { "entropy": 6.489283609390259, "epoch": 1.7694365669645244, "grad_norm": 1.4609375, "learning_rate": 0.0004693670547510161, "loss": 6.2793, "mean_token_accuracy": 0.13113914132118226, "num_tokens": 35778564.0, "step": 16535 }, { "entropy": 6.5667181491851805, "epoch": 1.7699716410722885, "grad_norm": 1.65625, "learning_rate": 0.00046934779215828006, "loss": 6.2191, "mean_token_accuracy": 0.14195646718144417, "num_tokens": 35788417.0, "step": 16540 }, { "entropy": 6.496956443786621, "epoch": 1.7705067151800524, "grad_norm": 1.4375, "learning_rate": 0.0004693285239537788, "loss": 6.2486, "mean_token_accuracy": 0.13466702327132224, "num_tokens": 35799724.0, "step": 16545 }, { "entropy": 6.557682847976684, "epoch": 1.7710417892878163, "grad_norm": 1.5, "learning_rate": 0.00046930925013806873, "loss": 6.1728, "mean_token_accuracy": 0.1405516743659973, "num_tokens": 35810306.0, "step": 16550 }, { "entropy": 6.579492568969727, "epoch": 1.7715768633955804, "grad_norm": 1.34375, "learning_rate": 0.0004692899707117064, "loss": 6.2244, "mean_token_accuracy": 0.13569827675819396, "num_tokens": 35821103.0, "step": 16555 }, { "entropy": 6.487555932998657, "epoch": 1.772111937503344, "grad_norm": 1.2890625, "learning_rate": 0.0004692706856752484, "loss": 6.2226, "mean_token_accuracy": 0.14339053258299828, "num_tokens": 35832271.0, "step": 16560 }, { "entropy": 6.505621671676636, "epoch": 1.7726470116111082, "grad_norm": 1.40625, "learning_rate": 0.00046925139502925167, "loss": 6.2647, "mean_token_accuracy": 0.13330883160233498, "num_tokens": 35843875.0, "step": 16565 }, { "entropy": 6.5568187713623045, "epoch": 1.773182085718872, "grad_norm": 1.859375, "learning_rate": 0.0004692320987742732, "loss": 6.2508, "mean_token_accuracy": 0.13371218591928483, "num_tokens": 35854085.0, "step": 16570 }, { "entropy": 6.614805221557617, "epoch": 1.773717159826636, "grad_norm": 1.6875, "learning_rate": 0.0004692127969108702, "loss": 6.2952, "mean_token_accuracy": 0.13505346402525903, "num_tokens": 35864777.0, "step": 16575 }, { "entropy": 6.561323356628418, "epoch": 1.7742522339344, "grad_norm": 1.3125, "learning_rate": 0.0004691934894396, "loss": 6.3012, "mean_token_accuracy": 0.13224760219454765, "num_tokens": 35876822.0, "step": 16580 }, { "entropy": 6.579904937744141, "epoch": 1.774787308042164, "grad_norm": 1.6875, "learning_rate": 0.00046917417636102, "loss": 6.1893, "mean_token_accuracy": 0.14425080120563508, "num_tokens": 35886997.0, "step": 16585 }, { "entropy": 6.514540147781372, "epoch": 1.7753223821499278, "grad_norm": 2.15625, "learning_rate": 0.000469154857675688, "loss": 6.2636, "mean_token_accuracy": 0.13917053490877151, "num_tokens": 35897871.0, "step": 16590 }, { "entropy": 6.437257766723633, "epoch": 1.7758574562576916, "grad_norm": 1.625, "learning_rate": 0.0004691355333841617, "loss": 6.2309, "mean_token_accuracy": 0.14573031067848205, "num_tokens": 35908791.0, "step": 16595 }, { "entropy": 6.539524126052856, "epoch": 1.7763925303654555, "grad_norm": 1.7421875, "learning_rate": 0.0004691162034869993, "loss": 6.2875, "mean_token_accuracy": 0.13325378373265268, "num_tokens": 35919436.0, "step": 16600 }, { "entropy": 6.599057722091675, "epoch": 1.7769276044732196, "grad_norm": 1.6484375, "learning_rate": 0.0004690968679847586, "loss": 6.1754, "mean_token_accuracy": 0.14074254035949707, "num_tokens": 35929851.0, "step": 16605 }, { "entropy": 6.528794050216675, "epoch": 1.7774626785809835, "grad_norm": 1.8828125, "learning_rate": 0.0004690775268779983, "loss": 6.2067, "mean_token_accuracy": 0.13964374586939812, "num_tokens": 35940271.0, "step": 16610 }, { "entropy": 6.45616717338562, "epoch": 1.7779977526887474, "grad_norm": 1.65625, "learning_rate": 0.0004690581801672765, "loss": 6.3054, "mean_token_accuracy": 0.12977162078022958, "num_tokens": 35951460.0, "step": 16615 }, { "entropy": 6.472211790084839, "epoch": 1.7785328267965115, "grad_norm": 1.59375, "learning_rate": 0.00046903882785315215, "loss": 6.1867, "mean_token_accuracy": 0.13858510851860045, "num_tokens": 35961530.0, "step": 16620 }, { "entropy": 6.500081157684326, "epoch": 1.7790679009042751, "grad_norm": 1.7890625, "learning_rate": 0.0004690194699361839, "loss": 6.1584, "mean_token_accuracy": 0.15004311949014665, "num_tokens": 35971085.0, "step": 16625 }, { "entropy": 6.478543996810913, "epoch": 1.7796029750120392, "grad_norm": 1.8828125, "learning_rate": 0.00046900010641693073, "loss": 6.2366, "mean_token_accuracy": 0.1306772880256176, "num_tokens": 35981393.0, "step": 16630 }, { "entropy": 6.47922649383545, "epoch": 1.7801380491198031, "grad_norm": 2.046875, "learning_rate": 0.0004689807372959517, "loss": 6.1911, "mean_token_accuracy": 0.13808380663394929, "num_tokens": 35992847.0, "step": 16635 }, { "entropy": 6.471188974380493, "epoch": 1.780673123227567, "grad_norm": 1.59375, "learning_rate": 0.00046896136257380615, "loss": 6.225, "mean_token_accuracy": 0.1351441413164139, "num_tokens": 36002991.0, "step": 16640 }, { "entropy": 6.500436925888062, "epoch": 1.781208197335331, "grad_norm": 1.7109375, "learning_rate": 0.00046894198225105356, "loss": 6.257, "mean_token_accuracy": 0.1417154736816883, "num_tokens": 36015140.0, "step": 16645 }, { "entropy": 6.471897602081299, "epoch": 1.7817432714430947, "grad_norm": 1.8515625, "learning_rate": 0.0004689225963282534, "loss": 6.1423, "mean_token_accuracy": 0.1382371798157692, "num_tokens": 36026014.0, "step": 16650 }, { "entropy": 6.607560014724731, "epoch": 1.7822783455508588, "grad_norm": 1.6875, "learning_rate": 0.0004689032048059656, "loss": 6.2989, "mean_token_accuracy": 0.13198384642601013, "num_tokens": 36035926.0, "step": 16655 }, { "entropy": 6.506697368621826, "epoch": 1.7828134196586227, "grad_norm": 1.625, "learning_rate": 0.00046888380768475, "loss": 6.2169, "mean_token_accuracy": 0.14066673815250397, "num_tokens": 36046406.0, "step": 16660 }, { "entropy": 6.467809438705444, "epoch": 1.7833484937663866, "grad_norm": 2.296875, "learning_rate": 0.0004688644049651667, "loss": 6.1642, "mean_token_accuracy": 0.14082129970192908, "num_tokens": 36056440.0, "step": 16665 }, { "entropy": 6.491926813125611, "epoch": 1.7838835678741507, "grad_norm": 1.453125, "learning_rate": 0.00046884499664777586, "loss": 6.2515, "mean_token_accuracy": 0.13191643580794335, "num_tokens": 36067244.0, "step": 16670 }, { "entropy": 6.499668931961059, "epoch": 1.7844186419819144, "grad_norm": 3.328125, "learning_rate": 0.0004688255827331381, "loss": 6.1558, "mean_token_accuracy": 0.14353570342063904, "num_tokens": 36078110.0, "step": 16675 }, { "entropy": 6.489797687530517, "epoch": 1.7849537160896785, "grad_norm": 1.453125, "learning_rate": 0.0004688061632218137, "loss": 6.2545, "mean_token_accuracy": 0.13878354877233506, "num_tokens": 36088805.0, "step": 16680 }, { "entropy": 6.5043909549713135, "epoch": 1.7854887901974423, "grad_norm": 2.5, "learning_rate": 0.00046878673811436375, "loss": 6.2106, "mean_token_accuracy": 0.14111408069729806, "num_tokens": 36098619.0, "step": 16685 }, { "entropy": 6.577878761291504, "epoch": 1.7860238643052062, "grad_norm": 2.046875, "learning_rate": 0.0004687673074113489, "loss": 6.2761, "mean_token_accuracy": 0.13543611243367196, "num_tokens": 36110604.0, "step": 16690 }, { "entropy": 6.630790567398071, "epoch": 1.7865589384129703, "grad_norm": 1.640625, "learning_rate": 0.0004687478711133303, "loss": 6.276, "mean_token_accuracy": 0.13638934642076492, "num_tokens": 36121669.0, "step": 16695 }, { "entropy": 6.3852990627288815, "epoch": 1.787094012520734, "grad_norm": 1.7109375, "learning_rate": 0.0004687284292208691, "loss": 6.055, "mean_token_accuracy": 0.15399005711078645, "num_tokens": 36132165.0, "step": 16700 }, { "entropy": 6.428806734085083, "epoch": 1.787629086628498, "grad_norm": 1.59375, "learning_rate": 0.00046870898173452676, "loss": 6.2031, "mean_token_accuracy": 0.140548275411129, "num_tokens": 36142830.0, "step": 16705 }, { "entropy": 6.477385234832764, "epoch": 1.788164160736262, "grad_norm": 2.34375, "learning_rate": 0.0004686895286548648, "loss": 6.1832, "mean_token_accuracy": 0.1369605541229248, "num_tokens": 36153812.0, "step": 16710 }, { "entropy": 6.511514568328858, "epoch": 1.7886992348440258, "grad_norm": 1.71875, "learning_rate": 0.00046867006998244494, "loss": 6.2327, "mean_token_accuracy": 0.1401585191488266, "num_tokens": 36163599.0, "step": 16715 }, { "entropy": 6.5018744468688965, "epoch": 1.78923430895179, "grad_norm": 1.6171875, "learning_rate": 0.00046865060571782896, "loss": 6.2433, "mean_token_accuracy": 0.13398018553853036, "num_tokens": 36173815.0, "step": 16720 }, { "entropy": 6.63695878982544, "epoch": 1.7897693830595538, "grad_norm": 1.765625, "learning_rate": 0.00046863113586157894, "loss": 6.3294, "mean_token_accuracy": 0.1324778087437153, "num_tokens": 36186131.0, "step": 16725 }, { "entropy": 6.553009986877441, "epoch": 1.7903044571673177, "grad_norm": 1.8046875, "learning_rate": 0.0004686116604142572, "loss": 6.1798, "mean_token_accuracy": 0.14324358105659485, "num_tokens": 36196084.0, "step": 16730 }, { "entropy": 6.467611074447632, "epoch": 1.7908395312750816, "grad_norm": 2.03125, "learning_rate": 0.0004685921793764259, "loss": 6.16, "mean_token_accuracy": 0.14632472023367882, "num_tokens": 36206948.0, "step": 16735 }, { "entropy": 6.550565099716186, "epoch": 1.7913746053828454, "grad_norm": 2.078125, "learning_rate": 0.0004685726927486476, "loss": 6.286, "mean_token_accuracy": 0.1330634005367756, "num_tokens": 36217202.0, "step": 16740 }, { "entropy": 6.596937656402588, "epoch": 1.7919096794906095, "grad_norm": 1.5703125, "learning_rate": 0.00046855320053148505, "loss": 6.3181, "mean_token_accuracy": 0.1310865469276905, "num_tokens": 36227914.0, "step": 16745 }, { "entropy": 6.573777103424073, "epoch": 1.7924447535983734, "grad_norm": 1.5546875, "learning_rate": 0.000468533702725501, "loss": 6.2627, "mean_token_accuracy": 0.13632940426468848, "num_tokens": 36239344.0, "step": 16750 }, { "entropy": 6.520642805099487, "epoch": 1.7929798277061373, "grad_norm": 1.5703125, "learning_rate": 0.00046851419933125843, "loss": 6.2837, "mean_token_accuracy": 0.13871801942586898, "num_tokens": 36250438.0, "step": 16755 }, { "entropy": 6.513595962524414, "epoch": 1.7935149018139014, "grad_norm": 1.6640625, "learning_rate": 0.0004684946903493206, "loss": 6.2462, "mean_token_accuracy": 0.13100792467594147, "num_tokens": 36260545.0, "step": 16760 }, { "entropy": 6.419894027709961, "epoch": 1.794049975921665, "grad_norm": 1.6015625, "learning_rate": 0.0004684751757802508, "loss": 6.1416, "mean_token_accuracy": 0.14160364121198654, "num_tokens": 36272577.0, "step": 16765 }, { "entropy": 6.516346645355225, "epoch": 1.7945850500294291, "grad_norm": 2.375, "learning_rate": 0.00046845565562461243, "loss": 6.1902, "mean_token_accuracy": 0.14187682345509528, "num_tokens": 36284161.0, "step": 16770 }, { "entropy": 6.527055025100708, "epoch": 1.795120124137193, "grad_norm": 1.5234375, "learning_rate": 0.00046843612988296926, "loss": 6.2087, "mean_token_accuracy": 0.13396796360611915, "num_tokens": 36294910.0, "step": 16775 }, { "entropy": 6.552798748016357, "epoch": 1.795655198244957, "grad_norm": 1.328125, "learning_rate": 0.0004684165985558849, "loss": 6.1797, "mean_token_accuracy": 0.13618710413575172, "num_tokens": 36305388.0, "step": 16780 }, { "entropy": 6.4872008800506595, "epoch": 1.796190272352721, "grad_norm": 1.765625, "learning_rate": 0.0004683970616439236, "loss": 6.2451, "mean_token_accuracy": 0.145309716463089, "num_tokens": 36316696.0, "step": 16785 }, { "entropy": 6.467041683197022, "epoch": 1.7967253464604847, "grad_norm": 1.6328125, "learning_rate": 0.0004683775191476492, "loss": 6.1561, "mean_token_accuracy": 0.14676120951771737, "num_tokens": 36327246.0, "step": 16790 }, { "entropy": 6.554820346832275, "epoch": 1.7972604205682488, "grad_norm": 1.9296875, "learning_rate": 0.0004683579710676262, "loss": 6.3159, "mean_token_accuracy": 0.1309548445045948, "num_tokens": 36338089.0, "step": 16795 }, { "entropy": 6.50324125289917, "epoch": 1.7977954946760126, "grad_norm": 1.609375, "learning_rate": 0.00046833841740441886, "loss": 6.2308, "mean_token_accuracy": 0.14037265926599501, "num_tokens": 36350285.0, "step": 16800 }, { "entropy": 6.577779293060303, "epoch": 1.7983305687837765, "grad_norm": 1.9140625, "learning_rate": 0.0004683188581585919, "loss": 6.2266, "mean_token_accuracy": 0.13420821651816367, "num_tokens": 36360431.0, "step": 16805 }, { "entropy": 6.581452989578247, "epoch": 1.7988656428915406, "grad_norm": 1.953125, "learning_rate": 0.0004682992933307101, "loss": 6.1858, "mean_token_accuracy": 0.14042315185070037, "num_tokens": 36371257.0, "step": 16810 }, { "entropy": 6.424906253814697, "epoch": 1.7994007169993043, "grad_norm": 1.3984375, "learning_rate": 0.00046827972292133835, "loss": 6.1612, "mean_token_accuracy": 0.14297413006424903, "num_tokens": 36382613.0, "step": 16815 }, { "entropy": 6.5323937892913815, "epoch": 1.7999357911070684, "grad_norm": 1.6328125, "learning_rate": 0.0004682601469310418, "loss": 6.2386, "mean_token_accuracy": 0.1366001270711422, "num_tokens": 36393799.0, "step": 16820 }, { "entropy": 6.505597305297852, "epoch": 1.8004708652148322, "grad_norm": 1.4765625, "learning_rate": 0.00046824056536038565, "loss": 6.2224, "mean_token_accuracy": 0.13767699897289276, "num_tokens": 36403914.0, "step": 16825 }, { "entropy": 6.4454141616821286, "epoch": 1.8010059393225961, "grad_norm": 1.6171875, "learning_rate": 0.0004682209782099353, "loss": 6.203, "mean_token_accuracy": 0.13994815796613694, "num_tokens": 36415022.0, "step": 16830 }, { "entropy": 6.492913055419922, "epoch": 1.8015410134303602, "grad_norm": 1.3828125, "learning_rate": 0.00046820138548025634, "loss": 6.1447, "mean_token_accuracy": 0.144903202354908, "num_tokens": 36426155.0, "step": 16835 }, { "entropy": 6.520499753952026, "epoch": 1.8020760875381239, "grad_norm": 1.453125, "learning_rate": 0.00046818178717191464, "loss": 6.2141, "mean_token_accuracy": 0.1381929524242878, "num_tokens": 36437345.0, "step": 16840 }, { "entropy": 6.520294523239135, "epoch": 1.802611161645888, "grad_norm": 1.53125, "learning_rate": 0.0004681621832854759, "loss": 6.2415, "mean_token_accuracy": 0.1451305240392685, "num_tokens": 36448634.0, "step": 16845 }, { "entropy": 6.482553720474243, "epoch": 1.8031462357536518, "grad_norm": 1.3046875, "learning_rate": 0.00046814257382150627, "loss": 6.2023, "mean_token_accuracy": 0.14824908673763276, "num_tokens": 36458870.0, "step": 16850 }, { "entropy": 6.526421070098877, "epoch": 1.8036813098614157, "grad_norm": 1.859375, "learning_rate": 0.00046812295878057193, "loss": 6.3182, "mean_token_accuracy": 0.1356567807495594, "num_tokens": 36469865.0, "step": 16855 }, { "entropy": 6.506421089172363, "epoch": 1.8042163839691798, "grad_norm": 1.8046875, "learning_rate": 0.0004681033381632393, "loss": 6.208, "mean_token_accuracy": 0.13496703803539276, "num_tokens": 36480502.0, "step": 16860 }, { "entropy": 6.568086290359497, "epoch": 1.8047514580769437, "grad_norm": 1.359375, "learning_rate": 0.0004680837119700749, "loss": 6.2178, "mean_token_accuracy": 0.13847601637244225, "num_tokens": 36492356.0, "step": 16865 }, { "entropy": 6.469596433639526, "epoch": 1.8052865321847076, "grad_norm": 1.4375, "learning_rate": 0.00046806408020164553, "loss": 6.2064, "mean_token_accuracy": 0.13677831664681434, "num_tokens": 36504659.0, "step": 16870 }, { "entropy": 6.4850420475006105, "epoch": 1.8058216062924715, "grad_norm": 1.421875, "learning_rate": 0.00046804444285851796, "loss": 6.1926, "mean_token_accuracy": 0.13537785932421684, "num_tokens": 36516042.0, "step": 16875 }, { "entropy": 6.583554267883301, "epoch": 1.8063566804002353, "grad_norm": 1.5078125, "learning_rate": 0.00046802479994125916, "loss": 6.3029, "mean_token_accuracy": 0.13417793661355973, "num_tokens": 36527417.0, "step": 16880 }, { "entropy": 6.517843437194824, "epoch": 1.8068917545079994, "grad_norm": 1.828125, "learning_rate": 0.0004680051514504364, "loss": 6.2097, "mean_token_accuracy": 0.1450719028711319, "num_tokens": 36538182.0, "step": 16885 }, { "entropy": 6.477873516082764, "epoch": 1.8074268286157633, "grad_norm": 1.390625, "learning_rate": 0.0004679854973866171, "loss": 6.2986, "mean_token_accuracy": 0.13775768205523492, "num_tokens": 36549835.0, "step": 16890 }, { "entropy": 6.45180606842041, "epoch": 1.8079619027235272, "grad_norm": 2.0625, "learning_rate": 0.00046796583775036857, "loss": 6.19, "mean_token_accuracy": 0.14810781925916672, "num_tokens": 36560238.0, "step": 16895 }, { "entropy": 6.533177089691162, "epoch": 1.8084969768312913, "grad_norm": 1.34375, "learning_rate": 0.00046794617254225865, "loss": 6.2267, "mean_token_accuracy": 0.14068657979369165, "num_tokens": 36571267.0, "step": 16900 }, { "entropy": 6.52840747833252, "epoch": 1.809032050939055, "grad_norm": 1.4453125, "learning_rate": 0.0004679265017628551, "loss": 6.2861, "mean_token_accuracy": 0.14016860574483872, "num_tokens": 36582174.0, "step": 16905 }, { "entropy": 6.566719913482666, "epoch": 1.809567125046819, "grad_norm": 1.328125, "learning_rate": 0.0004679068254127259, "loss": 6.2379, "mean_token_accuracy": 0.1399499513208866, "num_tokens": 36593054.0, "step": 16910 }, { "entropy": 6.543996334075928, "epoch": 1.810102199154583, "grad_norm": 1.53125, "learning_rate": 0.00046788714349243923, "loss": 6.2411, "mean_token_accuracy": 0.13865780755877494, "num_tokens": 36603962.0, "step": 16915 }, { "entropy": 6.538334846496582, "epoch": 1.8106372732623468, "grad_norm": 1.40625, "learning_rate": 0.0004678674560025634, "loss": 6.2346, "mean_token_accuracy": 0.13803598582744597, "num_tokens": 36616003.0, "step": 16920 }, { "entropy": 6.555250835418701, "epoch": 1.811172347370111, "grad_norm": 1.3984375, "learning_rate": 0.0004678477629436669, "loss": 6.3134, "mean_token_accuracy": 0.1259820744395256, "num_tokens": 36627189.0, "step": 16925 }, { "entropy": 6.563538408279419, "epoch": 1.8117074214778746, "grad_norm": 1.5, "learning_rate": 0.0004678280643163184, "loss": 6.3285, "mean_token_accuracy": 0.1305183358490467, "num_tokens": 36637756.0, "step": 16930 }, { "entropy": 6.52625207901001, "epoch": 1.8122424955856387, "grad_norm": 1.8359375, "learning_rate": 0.0004678083601210865, "loss": 6.2622, "mean_token_accuracy": 0.14015371575951577, "num_tokens": 36648946.0, "step": 16935 }, { "entropy": 6.581425952911377, "epoch": 1.8127775696934025, "grad_norm": 1.4296875, "learning_rate": 0.0004677886503585404, "loss": 6.2769, "mean_token_accuracy": 0.13917845040559768, "num_tokens": 36660184.0, "step": 16940 }, { "entropy": 6.549855661392212, "epoch": 1.8133126438011664, "grad_norm": 1.421875, "learning_rate": 0.00046776893502924904, "loss": 6.3284, "mean_token_accuracy": 0.13336536437273025, "num_tokens": 36671346.0, "step": 16945 }, { "entropy": 6.584742641448974, "epoch": 1.8138477179089305, "grad_norm": 1.390625, "learning_rate": 0.0004677492141337818, "loss": 6.2225, "mean_token_accuracy": 0.13786211013793945, "num_tokens": 36682917.0, "step": 16950 }, { "entropy": 6.547979497909546, "epoch": 1.8143827920166942, "grad_norm": 1.796875, "learning_rate": 0.0004677294876727081, "loss": 6.305, "mean_token_accuracy": 0.12805510684847832, "num_tokens": 36693577.0, "step": 16955 }, { "entropy": 6.611744832992554, "epoch": 1.8149178661244583, "grad_norm": 1.4296875, "learning_rate": 0.0004677097556465975, "loss": 6.249, "mean_token_accuracy": 0.13698212802410126, "num_tokens": 36704915.0, "step": 16960 }, { "entropy": 6.596394205093384, "epoch": 1.8154529402322221, "grad_norm": 1.65625, "learning_rate": 0.00046769001805601983, "loss": 6.3643, "mean_token_accuracy": 0.12665193229913713, "num_tokens": 36716086.0, "step": 16965 }, { "entropy": 6.468046569824219, "epoch": 1.815988014339986, "grad_norm": 1.40625, "learning_rate": 0.00046767027490154494, "loss": 6.1918, "mean_token_accuracy": 0.13091371804475785, "num_tokens": 36726110.0, "step": 16970 }, { "entropy": 6.549561405181885, "epoch": 1.8165230884477501, "grad_norm": 1.4375, "learning_rate": 0.00046765052618374296, "loss": 6.1771, "mean_token_accuracy": 0.1403437852859497, "num_tokens": 36735846.0, "step": 16975 }, { "entropy": 6.515966844558716, "epoch": 1.8170581625555138, "grad_norm": 1.828125, "learning_rate": 0.000467630771903184, "loss": 6.259, "mean_token_accuracy": 0.1386712908744812, "num_tokens": 36746851.0, "step": 16980 }, { "entropy": 6.525477933883667, "epoch": 1.8175932366632779, "grad_norm": 1.5078125, "learning_rate": 0.0004676110120604387, "loss": 6.2324, "mean_token_accuracy": 0.13791928589344024, "num_tokens": 36758032.0, "step": 16985 }, { "entropy": 6.572210121154785, "epoch": 1.8181283107710418, "grad_norm": 1.8515625, "learning_rate": 0.0004675912466560775, "loss": 6.2518, "mean_token_accuracy": 0.14123788774013518, "num_tokens": 36768939.0, "step": 16990 }, { "entropy": 6.577953958511353, "epoch": 1.8186633848788056, "grad_norm": 2.46875, "learning_rate": 0.00046757147569067106, "loss": 6.304, "mean_token_accuracy": 0.13176384195685387, "num_tokens": 36780338.0, "step": 16995 }, { "entropy": 6.507962799072265, "epoch": 1.8191984589865697, "grad_norm": 1.2109375, "learning_rate": 0.0004675516991647903, "loss": 6.1541, "mean_token_accuracy": 0.13604221120476723, "num_tokens": 36791384.0, "step": 17000 }, { "entropy": 6.4729632377624515, "epoch": 1.8197335330943336, "grad_norm": 1.2421875, "learning_rate": 0.00046753191707900636, "loss": 6.2134, "mean_token_accuracy": 0.1321197956800461, "num_tokens": 36802460.0, "step": 17005 }, { "entropy": 6.536910820007324, "epoch": 1.8202686072020975, "grad_norm": 1.640625, "learning_rate": 0.00046751212943389026, "loss": 6.2864, "mean_token_accuracy": 0.13371748030185698, "num_tokens": 36813599.0, "step": 17010 }, { "entropy": 6.563910818099975, "epoch": 1.8208036813098614, "grad_norm": 1.421875, "learning_rate": 0.0004674923362300135, "loss": 6.158, "mean_token_accuracy": 0.1385357163846493, "num_tokens": 36823100.0, "step": 17015 }, { "entropy": 6.547238874435425, "epoch": 1.8213387554176252, "grad_norm": 1.5390625, "learning_rate": 0.00046747253746794767, "loss": 6.304, "mean_token_accuracy": 0.13121092841029167, "num_tokens": 36834245.0, "step": 17020 }, { "entropy": 6.488923406600952, "epoch": 1.8218738295253893, "grad_norm": 1.3515625, "learning_rate": 0.00046745273314826425, "loss": 6.1663, "mean_token_accuracy": 0.1463228791952133, "num_tokens": 36844126.0, "step": 17025 }, { "entropy": 6.494448804855347, "epoch": 1.8224089036331532, "grad_norm": 1.4765625, "learning_rate": 0.0004674329232715353, "loss": 6.1542, "mean_token_accuracy": 0.14492320418357849, "num_tokens": 36855451.0, "step": 17030 }, { "entropy": 6.573440742492676, "epoch": 1.822943977740917, "grad_norm": 1.5390625, "learning_rate": 0.0004674131078383327, "loss": 6.2544, "mean_token_accuracy": 0.13452650755643844, "num_tokens": 36864994.0, "step": 17035 }, { "entropy": 6.537502956390381, "epoch": 1.8234790518486812, "grad_norm": 1.3515625, "learning_rate": 0.0004673932868492286, "loss": 6.1962, "mean_token_accuracy": 0.13883368894457818, "num_tokens": 36875131.0, "step": 17040 }, { "entropy": 6.553777265548706, "epoch": 1.8240141259564449, "grad_norm": 1.5, "learning_rate": 0.00046737346030479546, "loss": 6.2549, "mean_token_accuracy": 0.13633736670017244, "num_tokens": 36884789.0, "step": 17045 }, { "entropy": 6.493189573287964, "epoch": 1.824549200064209, "grad_norm": 1.3984375, "learning_rate": 0.00046735362820560564, "loss": 6.1517, "mean_token_accuracy": 0.13749801069498063, "num_tokens": 36895199.0, "step": 17050 }, { "entropy": 6.533320331573487, "epoch": 1.8250842741719728, "grad_norm": 1.2421875, "learning_rate": 0.0004673337905522318, "loss": 6.257, "mean_token_accuracy": 0.13339270278811455, "num_tokens": 36906495.0, "step": 17055 }, { "entropy": 6.4933160781860355, "epoch": 1.8256193482797367, "grad_norm": 1.625, "learning_rate": 0.00046731394734524686, "loss": 6.2217, "mean_token_accuracy": 0.13503750115633012, "num_tokens": 36916907.0, "step": 17060 }, { "entropy": 6.482892751693726, "epoch": 1.8261544223875008, "grad_norm": 1.7265625, "learning_rate": 0.00046729409858522363, "loss": 6.1848, "mean_token_accuracy": 0.13926137164235114, "num_tokens": 36927872.0, "step": 17065 }, { "entropy": 6.506586217880249, "epoch": 1.8266894964952645, "grad_norm": 2.8125, "learning_rate": 0.0004672742442727354, "loss": 6.2337, "mean_token_accuracy": 0.13534507304430007, "num_tokens": 36938575.0, "step": 17070 }, { "entropy": 6.421038293838501, "epoch": 1.8272245706030286, "grad_norm": 1.6328125, "learning_rate": 0.00046725438440835536, "loss": 6.1076, "mean_token_accuracy": 0.14953663647174836, "num_tokens": 36949179.0, "step": 17075 }, { "entropy": 6.481749391555786, "epoch": 1.8277596447107924, "grad_norm": 4.46875, "learning_rate": 0.000467234518992657, "loss": 6.1621, "mean_token_accuracy": 0.1452023506164551, "num_tokens": 36959164.0, "step": 17080 }, { "entropy": 6.567118787765503, "epoch": 1.8282947188185563, "grad_norm": 1.7109375, "learning_rate": 0.00046721464802621383, "loss": 6.3111, "mean_token_accuracy": 0.13393226340413095, "num_tokens": 36969091.0, "step": 17085 }, { "entropy": 6.562323141098022, "epoch": 1.8288297929263204, "grad_norm": 1.921875, "learning_rate": 0.00046719477150959984, "loss": 6.2461, "mean_token_accuracy": 0.13492230623960494, "num_tokens": 36980481.0, "step": 17090 }, { "entropy": 6.547414779663086, "epoch": 1.829364867034084, "grad_norm": 2.40625, "learning_rate": 0.00046717488944338873, "loss": 6.2198, "mean_token_accuracy": 0.13818060755729675, "num_tokens": 36991349.0, "step": 17095 }, { "entropy": 6.537697601318359, "epoch": 1.8298999411418482, "grad_norm": 1.7109375, "learning_rate": 0.00046715500182815473, "loss": 6.2997, "mean_token_accuracy": 0.13604205325245858, "num_tokens": 37002803.0, "step": 17100 }, { "entropy": 6.5742217063903805, "epoch": 1.830435015249612, "grad_norm": 1.296875, "learning_rate": 0.00046713510866447204, "loss": 6.2486, "mean_token_accuracy": 0.13930715918540953, "num_tokens": 37013578.0, "step": 17105 }, { "entropy": 6.480613660812378, "epoch": 1.830970089357376, "grad_norm": 2.3125, "learning_rate": 0.0004671152099529152, "loss": 6.1601, "mean_token_accuracy": 0.14176603630185128, "num_tokens": 37024012.0, "step": 17110 }, { "entropy": 6.431010293960571, "epoch": 1.83150516346514, "grad_norm": 1.625, "learning_rate": 0.00046709530569405855, "loss": 6.1546, "mean_token_accuracy": 0.1426972985267639, "num_tokens": 37034149.0, "step": 17115 }, { "entropy": 6.464472866058349, "epoch": 1.8320402375729037, "grad_norm": 1.671875, "learning_rate": 0.0004670753958884769, "loss": 6.1467, "mean_token_accuracy": 0.14506796300411223, "num_tokens": 37045669.0, "step": 17120 }, { "entropy": 6.518822431564331, "epoch": 1.8325753116806678, "grad_norm": 1.328125, "learning_rate": 0.00046705548053674524, "loss": 6.2426, "mean_token_accuracy": 0.13655512034893036, "num_tokens": 37056611.0, "step": 17125 }, { "entropy": 6.462148952484131, "epoch": 1.8331103857884317, "grad_norm": 1.5390625, "learning_rate": 0.00046703555963943855, "loss": 6.2124, "mean_token_accuracy": 0.13259709179401397, "num_tokens": 37067387.0, "step": 17130 }, { "entropy": 6.603019952774048, "epoch": 1.8336454598961955, "grad_norm": 2.171875, "learning_rate": 0.00046701563319713214, "loss": 6.3093, "mean_token_accuracy": 0.1327134758234024, "num_tokens": 37078151.0, "step": 17135 }, { "entropy": 6.576609134674072, "epoch": 1.8341805340039596, "grad_norm": 1.3984375, "learning_rate": 0.00046699570121040126, "loss": 6.2613, "mean_token_accuracy": 0.13562018275260926, "num_tokens": 37088219.0, "step": 17140 }, { "entropy": 6.467413425445557, "epoch": 1.8347156081117235, "grad_norm": 1.578125, "learning_rate": 0.0004669757636798215, "loss": 6.1373, "mean_token_accuracy": 0.14191140681505204, "num_tokens": 37098769.0, "step": 17145 }, { "entropy": 6.534985876083374, "epoch": 1.8352506822194874, "grad_norm": 1.4296875, "learning_rate": 0.0004669558206059684, "loss": 6.276, "mean_token_accuracy": 0.1294104613363743, "num_tokens": 37110716.0, "step": 17150 }, { "entropy": 6.538275527954101, "epoch": 1.8357857563272513, "grad_norm": 1.546875, "learning_rate": 0.0004669358719894181, "loss": 6.1879, "mean_token_accuracy": 0.13603334054350852, "num_tokens": 37122785.0, "step": 17155 }, { "entropy": 6.480508327484131, "epoch": 1.8363208304350152, "grad_norm": 2.15625, "learning_rate": 0.0004669159178307465, "loss": 6.1969, "mean_token_accuracy": 0.13679319992661476, "num_tokens": 37133308.0, "step": 17160 }, { "entropy": 6.407593870162964, "epoch": 1.8368559045427792, "grad_norm": 1.3828125, "learning_rate": 0.0004668959581305296, "loss": 6.1535, "mean_token_accuracy": 0.14222812801599502, "num_tokens": 37143916.0, "step": 17165 }, { "entropy": 6.46957540512085, "epoch": 1.8373909786505431, "grad_norm": 1.3984375, "learning_rate": 0.00046687599288934394, "loss": 6.1696, "mean_token_accuracy": 0.13823763206601142, "num_tokens": 37154335.0, "step": 17170 }, { "entropy": 6.529861164093018, "epoch": 1.837926052758307, "grad_norm": 2.046875, "learning_rate": 0.000466856022107766, "loss": 6.2338, "mean_token_accuracy": 0.1369415447115898, "num_tokens": 37164116.0, "step": 17175 }, { "entropy": 6.50433087348938, "epoch": 1.838461126866071, "grad_norm": 1.5390625, "learning_rate": 0.00046683604578637235, "loss": 6.2956, "mean_token_accuracy": 0.13340672180056573, "num_tokens": 37175407.0, "step": 17180 }, { "entropy": 6.446762371063232, "epoch": 1.8389962009738348, "grad_norm": 1.375, "learning_rate": 0.00046681606392573975, "loss": 6.1736, "mean_token_accuracy": 0.13607601448893547, "num_tokens": 37185339.0, "step": 17185 }, { "entropy": 6.572753381729126, "epoch": 1.8395312750815989, "grad_norm": 1.578125, "learning_rate": 0.0004667960765264454, "loss": 6.2672, "mean_token_accuracy": 0.1362226776778698, "num_tokens": 37195145.0, "step": 17190 }, { "entropy": 6.537802410125733, "epoch": 1.8400663491893627, "grad_norm": 2.109375, "learning_rate": 0.0004667760835890662, "loss": 6.2779, "mean_token_accuracy": 0.13509466499090195, "num_tokens": 37206454.0, "step": 17195 }, { "entropy": 6.481271600723266, "epoch": 1.8406014232971266, "grad_norm": 1.640625, "learning_rate": 0.00046675608511417957, "loss": 6.1878, "mean_token_accuracy": 0.14024367779493332, "num_tokens": 37216646.0, "step": 17200 }, { "entropy": 6.436294937133789, "epoch": 1.8411364974048907, "grad_norm": 1.65625, "learning_rate": 0.00046673608110236293, "loss": 6.1472, "mean_token_accuracy": 0.14751357436180115, "num_tokens": 37227368.0, "step": 17205 }, { "entropy": 6.5536376476287845, "epoch": 1.8416715715126544, "grad_norm": 1.5546875, "learning_rate": 0.0004667160715541939, "loss": 6.2645, "mean_token_accuracy": 0.13471471667289733, "num_tokens": 37238150.0, "step": 17210 }, { "entropy": 6.509008359909058, "epoch": 1.8422066456204185, "grad_norm": 1.6640625, "learning_rate": 0.00046669605647025014, "loss": 6.2161, "mean_token_accuracy": 0.13703424036502837, "num_tokens": 37249534.0, "step": 17215 }, { "entropy": 6.5630042552948, "epoch": 1.8427417197281823, "grad_norm": 1.3046875, "learning_rate": 0.0004666760358511098, "loss": 6.2997, "mean_token_accuracy": 0.1386088714003563, "num_tokens": 37260633.0, "step": 17220 }, { "entropy": 6.573452997207641, "epoch": 1.8432767938359462, "grad_norm": 1.484375, "learning_rate": 0.00046665600969735086, "loss": 6.2714, "mean_token_accuracy": 0.13207167088985444, "num_tokens": 37271978.0, "step": 17225 }, { "entropy": 6.4870954036712645, "epoch": 1.8438118679437103, "grad_norm": 2.0625, "learning_rate": 0.0004666359780095515, "loss": 6.1157, "mean_token_accuracy": 0.14051857218146324, "num_tokens": 37284130.0, "step": 17230 }, { "entropy": 6.54051194190979, "epoch": 1.844346942051474, "grad_norm": 1.46875, "learning_rate": 0.0004666159407882902, "loss": 6.2914, "mean_token_accuracy": 0.1303947575390339, "num_tokens": 37295648.0, "step": 17235 }, { "entropy": 6.5121325016021725, "epoch": 1.844882016159238, "grad_norm": 1.5234375, "learning_rate": 0.0004665958980341456, "loss": 6.258, "mean_token_accuracy": 0.13691130727529527, "num_tokens": 37306715.0, "step": 17240 }, { "entropy": 6.534123659133911, "epoch": 1.845417090267002, "grad_norm": 1.65625, "learning_rate": 0.00046657584974769636, "loss": 6.2708, "mean_token_accuracy": 0.13898625373840331, "num_tokens": 37317605.0, "step": 17245 }, { "entropy": 6.527424573898315, "epoch": 1.8459521643747658, "grad_norm": 1.53125, "learning_rate": 0.0004665557959295213, "loss": 6.1895, "mean_token_accuracy": 0.14265326410531998, "num_tokens": 37328898.0, "step": 17250 }, { "entropy": 6.477344179153443, "epoch": 1.84648723848253, "grad_norm": 1.375, "learning_rate": 0.00046653573658019963, "loss": 6.1724, "mean_token_accuracy": 0.1402975931763649, "num_tokens": 37340108.0, "step": 17255 }, { "entropy": 6.543744611740112, "epoch": 1.8470223125902936, "grad_norm": 1.3359375, "learning_rate": 0.00046651567170031053, "loss": 6.2914, "mean_token_accuracy": 0.13802868351340294, "num_tokens": 37351773.0, "step": 17260 }, { "entropy": 6.494388151168823, "epoch": 1.8475573866980577, "grad_norm": 1.6328125, "learning_rate": 0.0004664956012904332, "loss": 6.215, "mean_token_accuracy": 0.13731587156653405, "num_tokens": 37362748.0, "step": 17265 }, { "entropy": 6.510460567474365, "epoch": 1.8480924608058216, "grad_norm": 1.5703125, "learning_rate": 0.0004664755253511474, "loss": 6.3006, "mean_token_accuracy": 0.13541723787784576, "num_tokens": 37373487.0, "step": 17270 }, { "entropy": 6.5544881343841555, "epoch": 1.8486275349135854, "grad_norm": 2.109375, "learning_rate": 0.0004664554438830326, "loss": 6.1428, "mean_token_accuracy": 0.13703005909919738, "num_tokens": 37383302.0, "step": 17275 }, { "entropy": 6.565484619140625, "epoch": 1.8491626090213495, "grad_norm": 1.9921875, "learning_rate": 0.0004664353568866689, "loss": 6.1759, "mean_token_accuracy": 0.13908227831125258, "num_tokens": 37393085.0, "step": 17280 }, { "entropy": 6.562853622436523, "epoch": 1.8496976831291134, "grad_norm": 1.4609375, "learning_rate": 0.000466415264362636, "loss": 6.2485, "mean_token_accuracy": 0.13739827275276184, "num_tokens": 37403774.0, "step": 17285 }, { "entropy": 6.544837522506714, "epoch": 1.8502327572368773, "grad_norm": 1.359375, "learning_rate": 0.00046639516631151435, "loss": 6.2261, "mean_token_accuracy": 0.14629105776548385, "num_tokens": 37414356.0, "step": 17290 }, { "entropy": 6.481632375717163, "epoch": 1.8507678313446412, "grad_norm": 2.359375, "learning_rate": 0.00046637506273388416, "loss": 6.2689, "mean_token_accuracy": 0.1359451398253441, "num_tokens": 37426381.0, "step": 17295 }, { "entropy": 6.522068500518799, "epoch": 1.851302905452405, "grad_norm": 1.765625, "learning_rate": 0.00046635495363032595, "loss": 6.2128, "mean_token_accuracy": 0.13729588389396669, "num_tokens": 37436259.0, "step": 17300 }, { "entropy": 6.532771444320678, "epoch": 1.8518379795601692, "grad_norm": 2.34375, "learning_rate": 0.00046633483900142026, "loss": 6.1925, "mean_token_accuracy": 0.1430345170199871, "num_tokens": 37447498.0, "step": 17305 }, { "entropy": 6.483018445968628, "epoch": 1.852373053667933, "grad_norm": 1.6484375, "learning_rate": 0.000466314718847748, "loss": 6.1869, "mean_token_accuracy": 0.14144012928009034, "num_tokens": 37457323.0, "step": 17310 }, { "entropy": 6.470933246612549, "epoch": 1.852908127775697, "grad_norm": 1.40625, "learning_rate": 0.0004662945931698901, "loss": 6.2246, "mean_token_accuracy": 0.1384797491133213, "num_tokens": 37468121.0, "step": 17315 }, { "entropy": 6.515081596374512, "epoch": 1.853443201883461, "grad_norm": 1.828125, "learning_rate": 0.00046627446196842784, "loss": 6.2497, "mean_token_accuracy": 0.1317722588777542, "num_tokens": 37479205.0, "step": 17320 }, { "entropy": 6.556810903549194, "epoch": 1.8539782759912247, "grad_norm": 1.546875, "learning_rate": 0.0004662543252439422, "loss": 6.3526, "mean_token_accuracy": 0.13010217621922493, "num_tokens": 37491015.0, "step": 17325 }, { "entropy": 6.579596424102784, "epoch": 1.8545133500989888, "grad_norm": 1.453125, "learning_rate": 0.00046623418299701494, "loss": 6.2675, "mean_token_accuracy": 0.13135558143258094, "num_tokens": 37503078.0, "step": 17330 }, { "entropy": 6.5604668140411375, "epoch": 1.8550484242067526, "grad_norm": 2.265625, "learning_rate": 0.0004662140352282274, "loss": 6.2443, "mean_token_accuracy": 0.1412036180496216, "num_tokens": 37514623.0, "step": 17335 }, { "entropy": 6.501449155807495, "epoch": 1.8555834983145165, "grad_norm": 1.9765625, "learning_rate": 0.00046619388193816155, "loss": 6.1845, "mean_token_accuracy": 0.13932041376829146, "num_tokens": 37525618.0, "step": 17340 }, { "entropy": 6.5468672752380375, "epoch": 1.8561185724222806, "grad_norm": 1.3359375, "learning_rate": 0.00046617372312739917, "loss": 6.2607, "mean_token_accuracy": 0.14140139073133468, "num_tokens": 37536023.0, "step": 17345 }, { "entropy": 6.581799411773682, "epoch": 1.8566536465300443, "grad_norm": 1.953125, "learning_rate": 0.0004661535587965224, "loss": 6.26, "mean_token_accuracy": 0.1331052377820015, "num_tokens": 37545886.0, "step": 17350 }, { "entropy": 6.489939403533936, "epoch": 1.8571887206378084, "grad_norm": 1.4921875, "learning_rate": 0.00046613338894611347, "loss": 6.1817, "mean_token_accuracy": 0.13516911789774894, "num_tokens": 37557587.0, "step": 17355 }, { "entropy": 6.430360794067383, "epoch": 1.8577237947455723, "grad_norm": 1.7265625, "learning_rate": 0.0004661132135767548, "loss": 6.1246, "mean_token_accuracy": 0.15580250471830367, "num_tokens": 37569379.0, "step": 17360 }, { "entropy": 6.574359893798828, "epoch": 1.8582588688533361, "grad_norm": 2.015625, "learning_rate": 0.000466093032689029, "loss": 6.2939, "mean_token_accuracy": 0.13142267763614654, "num_tokens": 37580478.0, "step": 17365 }, { "entropy": 6.483245992660523, "epoch": 1.8587939429611002, "grad_norm": 1.671875, "learning_rate": 0.0004660728462835187, "loss": 6.2211, "mean_token_accuracy": 0.14082368835806847, "num_tokens": 37591506.0, "step": 17370 }, { "entropy": 6.4595136642456055, "epoch": 1.8593290170688639, "grad_norm": 1.6171875, "learning_rate": 0.0004660526543608068, "loss": 6.0688, "mean_token_accuracy": 0.15273035317659378, "num_tokens": 37602074.0, "step": 17375 }, { "entropy": 6.5289915084838865, "epoch": 1.859864091176628, "grad_norm": 1.609375, "learning_rate": 0.0004660324569214763, "loss": 6.2628, "mean_token_accuracy": 0.1343717895448208, "num_tokens": 37612180.0, "step": 17380 }, { "entropy": 6.513068914413452, "epoch": 1.8603991652843919, "grad_norm": 1.5078125, "learning_rate": 0.0004660122539661106, "loss": 6.2351, "mean_token_accuracy": 0.14054446592926978, "num_tokens": 37622588.0, "step": 17385 }, { "entropy": 6.5763421058654785, "epoch": 1.8609342393921557, "grad_norm": 2.15625, "learning_rate": 0.0004659920454952928, "loss": 6.2204, "mean_token_accuracy": 0.14042455777525903, "num_tokens": 37634323.0, "step": 17390 }, { "entropy": 6.562207317352295, "epoch": 1.8614693134999198, "grad_norm": 1.8828125, "learning_rate": 0.0004659718315096065, "loss": 6.2767, "mean_token_accuracy": 0.13324531316757202, "num_tokens": 37645816.0, "step": 17395 }, { "entropy": 6.585940647125244, "epoch": 1.8620043876076835, "grad_norm": 1.7578125, "learning_rate": 0.00046595161200963545, "loss": 6.2841, "mean_token_accuracy": 0.13371996730566024, "num_tokens": 37656143.0, "step": 17400 }, { "entropy": 6.513905477523804, "epoch": 1.8625394617154476, "grad_norm": 2.578125, "learning_rate": 0.00046593138699596343, "loss": 6.1746, "mean_token_accuracy": 0.13611202463507652, "num_tokens": 37665959.0, "step": 17405 }, { "entropy": 6.486093330383301, "epoch": 1.8630745358232115, "grad_norm": 2.171875, "learning_rate": 0.00046591115646917443, "loss": 6.2345, "mean_token_accuracy": 0.13548298478126525, "num_tokens": 37677176.0, "step": 17410 }, { "entropy": 6.472007322311401, "epoch": 1.8636096099309754, "grad_norm": 2.109375, "learning_rate": 0.0004658909204298526, "loss": 6.2539, "mean_token_accuracy": 0.14066635966300964, "num_tokens": 37687740.0, "step": 17415 }, { "entropy": 6.482980394363404, "epoch": 1.8641446840387395, "grad_norm": 2.328125, "learning_rate": 0.0004658706788785823, "loss": 6.1911, "mean_token_accuracy": 0.14265646263957024, "num_tokens": 37698536.0, "step": 17420 }, { "entropy": 6.552716970443726, "epoch": 1.8646797581465033, "grad_norm": 1.75, "learning_rate": 0.00046585043181594793, "loss": 6.2199, "mean_token_accuracy": 0.14157683700323104, "num_tokens": 37708795.0, "step": 17425 }, { "entropy": 6.550864553451538, "epoch": 1.8652148322542672, "grad_norm": 1.640625, "learning_rate": 0.00046583017924253426, "loss": 6.2352, "mean_token_accuracy": 0.14017075598239898, "num_tokens": 37719136.0, "step": 17430 }, { "entropy": 6.603561115264893, "epoch": 1.8657499063620313, "grad_norm": 2.1875, "learning_rate": 0.0004658099211589259, "loss": 6.3101, "mean_token_accuracy": 0.13327914327383042, "num_tokens": 37730513.0, "step": 17435 }, { "entropy": 6.459116220474243, "epoch": 1.866284980469795, "grad_norm": 6.0625, "learning_rate": 0.00046578965756570787, "loss": 6.2347, "mean_token_accuracy": 0.13692908883094787, "num_tokens": 37741811.0, "step": 17440 }, { "entropy": 6.429191589355469, "epoch": 1.866820054577559, "grad_norm": 1.578125, "learning_rate": 0.00046576938846346527, "loss": 6.0706, "mean_token_accuracy": 0.14636265933513642, "num_tokens": 37752213.0, "step": 17445 }, { "entropy": 6.444896173477173, "epoch": 1.867355128685323, "grad_norm": 1.8359375, "learning_rate": 0.00046574911385278343, "loss": 6.0547, "mean_token_accuracy": 0.15159211903810502, "num_tokens": 37763253.0, "step": 17450 }, { "entropy": 6.566773557662964, "epoch": 1.8678902027930868, "grad_norm": 1.6015625, "learning_rate": 0.00046572883373424776, "loss": 6.2701, "mean_token_accuracy": 0.13228057101368904, "num_tokens": 37775087.0, "step": 17455 }, { "entropy": 6.56617431640625, "epoch": 1.868425276900851, "grad_norm": 2.21875, "learning_rate": 0.00046570854810844373, "loss": 6.2554, "mean_token_accuracy": 0.13026925027370453, "num_tokens": 37786119.0, "step": 17460 }, { "entropy": 6.5158192157745365, "epoch": 1.8689603510086146, "grad_norm": 3.1875, "learning_rate": 0.00046568825697595724, "loss": 6.2618, "mean_token_accuracy": 0.13482827097177505, "num_tokens": 37797482.0, "step": 17465 }, { "entropy": 6.523220825195312, "epoch": 1.8694954251163787, "grad_norm": 2.171875, "learning_rate": 0.0004656679603373741, "loss": 6.1945, "mean_token_accuracy": 0.13488890826702118, "num_tokens": 37808067.0, "step": 17470 }, { "entropy": 6.5920967102050785, "epoch": 1.8700304992241426, "grad_norm": 1.7265625, "learning_rate": 0.0004656476581932804, "loss": 6.3458, "mean_token_accuracy": 0.1309550918638706, "num_tokens": 37819762.0, "step": 17475 }, { "entropy": 6.509218740463257, "epoch": 1.8705655733319064, "grad_norm": 1.3125, "learning_rate": 0.0004656273505442624, "loss": 6.2132, "mean_token_accuracy": 0.14369545131921768, "num_tokens": 37829510.0, "step": 17480 }, { "entropy": 6.510902166366577, "epoch": 1.8711006474396705, "grad_norm": 2.015625, "learning_rate": 0.00046560703739090633, "loss": 6.283, "mean_token_accuracy": 0.1339593842625618, "num_tokens": 37839431.0, "step": 17485 }, { "entropy": 6.596603298187256, "epoch": 1.8716357215474342, "grad_norm": 1.5390625, "learning_rate": 0.00046558671873379886, "loss": 6.2963, "mean_token_accuracy": 0.1272880144417286, "num_tokens": 37850531.0, "step": 17490 }, { "entropy": 6.636654281616211, "epoch": 1.8721707956551983, "grad_norm": 1.515625, "learning_rate": 0.0004655663945735268, "loss": 6.3059, "mean_token_accuracy": 0.12858284413814544, "num_tokens": 37861964.0, "step": 17495 }, { "entropy": 6.4125974655151365, "epoch": 1.8727058697629622, "grad_norm": 1.5234375, "learning_rate": 0.0004655460649106768, "loss": 6.0291, "mean_token_accuracy": 0.15219689756631852, "num_tokens": 37873598.0, "step": 17500 }, { "entropy": 6.521950435638428, "epoch": 1.873240943870726, "grad_norm": 2.140625, "learning_rate": 0.00046552572974583597, "loss": 6.2854, "mean_token_accuracy": 0.13302481919527054, "num_tokens": 37884643.0, "step": 17505 }, { "entropy": 6.507148408889771, "epoch": 1.8737760179784901, "grad_norm": 1.96875, "learning_rate": 0.0004655053890795914, "loss": 6.2672, "mean_token_accuracy": 0.13397427871823311, "num_tokens": 37896566.0, "step": 17510 }, { "entropy": 6.59088625907898, "epoch": 1.8743110920862538, "grad_norm": 1.890625, "learning_rate": 0.00046548504291253054, "loss": 6.3087, "mean_token_accuracy": 0.13231249898672104, "num_tokens": 37907424.0, "step": 17515 }, { "entropy": 6.588667011260986, "epoch": 1.874846166194018, "grad_norm": 2.171875, "learning_rate": 0.0004654646912452408, "loss": 6.2393, "mean_token_accuracy": 0.14179185181856155, "num_tokens": 37917318.0, "step": 17520 }, { "entropy": 6.510469579696656, "epoch": 1.8753812403017818, "grad_norm": 2.015625, "learning_rate": 0.0004654443340783099, "loss": 6.2011, "mean_token_accuracy": 0.1401626721024513, "num_tokens": 37928521.0, "step": 17525 }, { "entropy": 6.499540185928344, "epoch": 1.8759163144095456, "grad_norm": 1.765625, "learning_rate": 0.00046542397141232554, "loss": 6.2778, "mean_token_accuracy": 0.1372986279428005, "num_tokens": 37939930.0, "step": 17530 }, { "entropy": 6.504684114456177, "epoch": 1.8764513885173097, "grad_norm": 1.6015625, "learning_rate": 0.0004654036032478759, "loss": 6.1869, "mean_token_accuracy": 0.14108899012207984, "num_tokens": 37949690.0, "step": 17535 }, { "entropy": 6.546181392669678, "epoch": 1.8769864626250736, "grad_norm": 1.9453125, "learning_rate": 0.00046538322958554885, "loss": 6.212, "mean_token_accuracy": 0.14192006289958953, "num_tokens": 37962162.0, "step": 17540 }, { "entropy": 6.594173574447632, "epoch": 1.8775215367328375, "grad_norm": 1.5078125, "learning_rate": 0.0004653628504259329, "loss": 6.2469, "mean_token_accuracy": 0.13679970055818558, "num_tokens": 37972707.0, "step": 17545 }, { "entropy": 6.458856296539307, "epoch": 1.8780566108406014, "grad_norm": 1.5078125, "learning_rate": 0.00046534246576961633, "loss": 6.1646, "mean_token_accuracy": 0.1458908274769783, "num_tokens": 37983101.0, "step": 17550 }, { "entropy": 6.422877454757691, "epoch": 1.8785916849483653, "grad_norm": 1.6953125, "learning_rate": 0.00046532207561718775, "loss": 6.139, "mean_token_accuracy": 0.14392440170049667, "num_tokens": 37994025.0, "step": 17555 }, { "entropy": 6.521886825561523, "epoch": 1.8791267590561294, "grad_norm": 1.4921875, "learning_rate": 0.00046530167996923613, "loss": 6.2433, "mean_token_accuracy": 0.13209235221147536, "num_tokens": 38004761.0, "step": 17560 }, { "entropy": 6.573818874359131, "epoch": 1.8796618331638932, "grad_norm": 1.6953125, "learning_rate": 0.0004652812788263501, "loss": 6.2461, "mean_token_accuracy": 0.13844591975212098, "num_tokens": 38015129.0, "step": 17565 }, { "entropy": 6.533925724029541, "epoch": 1.8801969072716571, "grad_norm": 1.453125, "learning_rate": 0.00046526087218911894, "loss": 6.2316, "mean_token_accuracy": 0.14329466223716736, "num_tokens": 38025501.0, "step": 17570 }, { "entropy": 6.5236128807067875, "epoch": 1.8807319813794212, "grad_norm": 1.6484375, "learning_rate": 0.00046524046005813185, "loss": 6.2105, "mean_token_accuracy": 0.13993176072835922, "num_tokens": 38034912.0, "step": 17575 }, { "entropy": 6.475555276870727, "epoch": 1.8812670554871849, "grad_norm": 1.28125, "learning_rate": 0.0004652200424339782, "loss": 6.1574, "mean_token_accuracy": 0.140637881308794, "num_tokens": 38045417.0, "step": 17580 }, { "entropy": 6.520765924453736, "epoch": 1.881802129594949, "grad_norm": 1.578125, "learning_rate": 0.0004651996193172475, "loss": 6.2945, "mean_token_accuracy": 0.1352642834186554, "num_tokens": 38057033.0, "step": 17585 }, { "entropy": 6.551823234558105, "epoch": 1.8823372037027128, "grad_norm": 1.40625, "learning_rate": 0.0004651791907085296, "loss": 6.2297, "mean_token_accuracy": 0.13857173919677734, "num_tokens": 38067804.0, "step": 17590 }, { "entropy": 6.541230058670044, "epoch": 1.8828722778104767, "grad_norm": 1.578125, "learning_rate": 0.0004651587566084143, "loss": 6.2188, "mean_token_accuracy": 0.1486022040247917, "num_tokens": 38079246.0, "step": 17595 }, { "entropy": 6.541295862197876, "epoch": 1.8834073519182408, "grad_norm": 1.609375, "learning_rate": 0.00046513831701749155, "loss": 6.3613, "mean_token_accuracy": 0.13094632104039192, "num_tokens": 38090628.0, "step": 17600 }, { "entropy": 6.515250587463379, "epoch": 1.8839424260260045, "grad_norm": 1.59375, "learning_rate": 0.00046511787193635165, "loss": 6.1465, "mean_token_accuracy": 0.14270028993487358, "num_tokens": 38100848.0, "step": 17605 }, { "entropy": 6.606397533416748, "epoch": 1.8844775001337686, "grad_norm": 1.375, "learning_rate": 0.00046509742136558493, "loss": 6.1929, "mean_token_accuracy": 0.1411973714828491, "num_tokens": 38110732.0, "step": 17610 }, { "entropy": 6.4958351135253904, "epoch": 1.8850125742415325, "grad_norm": 2.328125, "learning_rate": 0.00046507696530578185, "loss": 6.1807, "mean_token_accuracy": 0.14429498165845872, "num_tokens": 38121002.0, "step": 17615 }, { "entropy": 6.504161643981933, "epoch": 1.8855476483492963, "grad_norm": 1.4609375, "learning_rate": 0.0004650565037575331, "loss": 6.2381, "mean_token_accuracy": 0.1369054652750492, "num_tokens": 38132294.0, "step": 17620 }, { "entropy": 6.4798229217529295, "epoch": 1.8860827224570604, "grad_norm": 1.71875, "learning_rate": 0.00046503603672142955, "loss": 6.1406, "mean_token_accuracy": 0.1413409121334553, "num_tokens": 38142962.0, "step": 17625 }, { "entropy": 6.5535815238952635, "epoch": 1.886617796564824, "grad_norm": 1.6015625, "learning_rate": 0.0004650155641980621, "loss": 6.262, "mean_token_accuracy": 0.14034836292266845, "num_tokens": 38153737.0, "step": 17630 }, { "entropy": 6.567475128173828, "epoch": 1.8871528706725882, "grad_norm": 1.5703125, "learning_rate": 0.00046499508618802195, "loss": 6.2253, "mean_token_accuracy": 0.13480818271636963, "num_tokens": 38163897.0, "step": 17635 }, { "entropy": 6.487664747238159, "epoch": 1.887687944780352, "grad_norm": 1.671875, "learning_rate": 0.0004649746026919004, "loss": 6.1909, "mean_token_accuracy": 0.14665645807981492, "num_tokens": 38175123.0, "step": 17640 }, { "entropy": 6.484235763549805, "epoch": 1.888223018888116, "grad_norm": 1.9296875, "learning_rate": 0.00046495411371028886, "loss": 6.2169, "mean_token_accuracy": 0.14219552129507065, "num_tokens": 38186100.0, "step": 17645 }, { "entropy": 6.559158420562744, "epoch": 1.88875809299588, "grad_norm": 1.6953125, "learning_rate": 0.00046493361924377903, "loss": 6.2336, "mean_token_accuracy": 0.14047744050621985, "num_tokens": 38196385.0, "step": 17650 }, { "entropy": 6.4783586978912355, "epoch": 1.8892931671036437, "grad_norm": 1.5, "learning_rate": 0.0004649131192929626, "loss": 6.1755, "mean_token_accuracy": 0.13876958936452866, "num_tokens": 38207260.0, "step": 17655 }, { "entropy": 6.45147476196289, "epoch": 1.8898282412114078, "grad_norm": 1.6484375, "learning_rate": 0.0004648926138584315, "loss": 6.0844, "mean_token_accuracy": 0.14660956487059593, "num_tokens": 38217537.0, "step": 17660 }, { "entropy": 6.543872261047364, "epoch": 1.8903633153191717, "grad_norm": 2.375, "learning_rate": 0.00046487210294077794, "loss": 6.2185, "mean_token_accuracy": 0.13700347542762756, "num_tokens": 38228956.0, "step": 17665 }, { "entropy": 6.471927785873413, "epoch": 1.8908983894269356, "grad_norm": 1.4140625, "learning_rate": 0.00046485158654059405, "loss": 6.1452, "mean_token_accuracy": 0.14353640973567963, "num_tokens": 38240236.0, "step": 17670 }, { "entropy": 6.585081481933594, "epoch": 1.8914334635346997, "grad_norm": 1.421875, "learning_rate": 0.0004648310646584723, "loss": 6.278, "mean_token_accuracy": 0.13636186644434928, "num_tokens": 38251739.0, "step": 17675 }, { "entropy": 6.48091344833374, "epoch": 1.8919685376424635, "grad_norm": 2.421875, "learning_rate": 0.00046481053729500516, "loss": 6.2058, "mean_token_accuracy": 0.1312205635011196, "num_tokens": 38262090.0, "step": 17680 }, { "entropy": 6.503962993621826, "epoch": 1.8925036117502274, "grad_norm": 1.3984375, "learning_rate": 0.0004647900044507855, "loss": 6.221, "mean_token_accuracy": 0.1413418248295784, "num_tokens": 38272770.0, "step": 17685 }, { "entropy": 6.51068148612976, "epoch": 1.8930386858579913, "grad_norm": 1.5, "learning_rate": 0.0004647694661264061, "loss": 6.18, "mean_token_accuracy": 0.1368080921471119, "num_tokens": 38283449.0, "step": 17690 }, { "entropy": 6.534865188598633, "epoch": 1.8935737599657552, "grad_norm": 1.5703125, "learning_rate": 0.00046474892232246, "loss": 6.2303, "mean_token_accuracy": 0.13847722858190536, "num_tokens": 38293831.0, "step": 17695 }, { "entropy": 6.489880561828613, "epoch": 1.8941088340735193, "grad_norm": 2.25, "learning_rate": 0.00046472837303954053, "loss": 6.1643, "mean_token_accuracy": 0.13979624956846237, "num_tokens": 38304782.0, "step": 17700 }, { "entropy": 6.508448696136474, "epoch": 1.8946439081812831, "grad_norm": 2.609375, "learning_rate": 0.00046470781827824087, "loss": 6.2338, "mean_token_accuracy": 0.14288853406906127, "num_tokens": 38316547.0, "step": 17705 }, { "entropy": 6.580143833160401, "epoch": 1.895178982289047, "grad_norm": 1.5234375, "learning_rate": 0.00046468725803915464, "loss": 6.272, "mean_token_accuracy": 0.13468163907527925, "num_tokens": 38329488.0, "step": 17710 }, { "entropy": 6.461695432662964, "epoch": 1.8957140563968111, "grad_norm": 1.6015625, "learning_rate": 0.00046466669232287543, "loss": 6.0977, "mean_token_accuracy": 0.1440846249461174, "num_tokens": 38341290.0, "step": 17715 }, { "entropy": 6.52875862121582, "epoch": 1.8962491305045748, "grad_norm": 1.3828125, "learning_rate": 0.0004646461211299973, "loss": 6.2466, "mean_token_accuracy": 0.13937623724341391, "num_tokens": 38352445.0, "step": 17720 }, { "entropy": 6.528347730636597, "epoch": 1.8967842046123389, "grad_norm": 1.34375, "learning_rate": 0.0004646255444611139, "loss": 6.236, "mean_token_accuracy": 0.1415594771504402, "num_tokens": 38363825.0, "step": 17725 }, { "entropy": 6.49668550491333, "epoch": 1.8973192787201028, "grad_norm": 1.7734375, "learning_rate": 0.00046460496231681957, "loss": 6.31, "mean_token_accuracy": 0.13838377743959426, "num_tokens": 38375454.0, "step": 17730 }, { "entropy": 6.4484857559204105, "epoch": 1.8978543528278666, "grad_norm": 1.484375, "learning_rate": 0.00046458437469770866, "loss": 6.2497, "mean_token_accuracy": 0.1398676410317421, "num_tokens": 38385938.0, "step": 17735 }, { "entropy": 6.540100574493408, "epoch": 1.8983894269356307, "grad_norm": 1.625, "learning_rate": 0.00046456378160437555, "loss": 6.1708, "mean_token_accuracy": 0.14353546053171157, "num_tokens": 38396143.0, "step": 17740 }, { "entropy": 6.488660621643066, "epoch": 1.8989245010433944, "grad_norm": 1.7109375, "learning_rate": 0.0004645431830374149, "loss": 6.2618, "mean_token_accuracy": 0.12918649911880492, "num_tokens": 38407445.0, "step": 17745 }, { "entropy": 6.5336669921875, "epoch": 1.8994595751511585, "grad_norm": 1.40625, "learning_rate": 0.00046452257899742144, "loss": 6.2961, "mean_token_accuracy": 0.12962775230407714, "num_tokens": 38418438.0, "step": 17750 }, { "entropy": 6.467654991149902, "epoch": 1.8999946492589224, "grad_norm": 1.5234375, "learning_rate": 0.00046450196948499015, "loss": 6.143, "mean_token_accuracy": 0.13833793625235558, "num_tokens": 38428821.0, "step": 17755 }, { "entropy": 6.498792219161987, "epoch": 1.9005297233666862, "grad_norm": 1.4609375, "learning_rate": 0.0004644813545007161, "loss": 6.1544, "mean_token_accuracy": 0.13901732116937637, "num_tokens": 38439560.0, "step": 17760 }, { "entropy": 6.54771318435669, "epoch": 1.9010647974744503, "grad_norm": 1.5859375, "learning_rate": 0.0004644607340451946, "loss": 6.2406, "mean_token_accuracy": 0.1394535258412361, "num_tokens": 38449724.0, "step": 17765 }, { "entropy": 6.517421054840088, "epoch": 1.901599871582214, "grad_norm": 1.515625, "learning_rate": 0.00046444010811902105, "loss": 6.1717, "mean_token_accuracy": 0.14054683744907379, "num_tokens": 38459833.0, "step": 17770 }, { "entropy": 6.449574708938599, "epoch": 1.902134945689978, "grad_norm": 1.5859375, "learning_rate": 0.00046441947672279095, "loss": 6.1987, "mean_token_accuracy": 0.14699629992246627, "num_tokens": 38470682.0, "step": 17775 }, { "entropy": 6.484740591049194, "epoch": 1.902670019797742, "grad_norm": 1.75, "learning_rate": 0.0004643988398571001, "loss": 6.2184, "mean_token_accuracy": 0.13642918542027474, "num_tokens": 38481362.0, "step": 17780 }, { "entropy": 6.52804388999939, "epoch": 1.9032050939055059, "grad_norm": 1.2734375, "learning_rate": 0.0004643781975225444, "loss": 6.1884, "mean_token_accuracy": 0.14055032059550285, "num_tokens": 38492941.0, "step": 17785 }, { "entropy": 6.583075475692749, "epoch": 1.90374016801327, "grad_norm": 1.6796875, "learning_rate": 0.00046435754971971976, "loss": 6.2249, "mean_token_accuracy": 0.1341730184853077, "num_tokens": 38503823.0, "step": 17790 }, { "entropy": 6.473573112487793, "epoch": 1.9042752421210336, "grad_norm": 1.8125, "learning_rate": 0.00046433689644922256, "loss": 6.139, "mean_token_accuracy": 0.14910909831523894, "num_tokens": 38514482.0, "step": 17795 }, { "entropy": 6.472933340072632, "epoch": 1.9048103162287977, "grad_norm": 1.453125, "learning_rate": 0.00046431623771164897, "loss": 6.2275, "mean_token_accuracy": 0.13971884027123452, "num_tokens": 38525580.0, "step": 17800 }, { "entropy": 6.449027681350708, "epoch": 1.9053453903365616, "grad_norm": 1.53125, "learning_rate": 0.0004642955735075958, "loss": 6.2204, "mean_token_accuracy": 0.1396370619535446, "num_tokens": 38537025.0, "step": 17805 }, { "entropy": 6.487132024765015, "epoch": 1.9058804644443255, "grad_norm": 1.6796875, "learning_rate": 0.00046427490383765943, "loss": 6.2076, "mean_token_accuracy": 0.14065134525299072, "num_tokens": 38548974.0, "step": 17810 }, { "entropy": 6.4658825397491455, "epoch": 1.9064155385520896, "grad_norm": 1.375, "learning_rate": 0.0004642542287024368, "loss": 6.1266, "mean_token_accuracy": 0.14220650643110275, "num_tokens": 38559971.0, "step": 17815 }, { "entropy": 6.4972062587738035, "epoch": 1.9069506126598534, "grad_norm": 1.5859375, "learning_rate": 0.000464233548102525, "loss": 6.1885, "mean_token_accuracy": 0.13903797119855882, "num_tokens": 38570326.0, "step": 17820 }, { "entropy": 6.4395452499389645, "epoch": 1.9074856867676173, "grad_norm": 1.40625, "learning_rate": 0.000464212862038521, "loss": 6.2024, "mean_token_accuracy": 0.1364986389875412, "num_tokens": 38580799.0, "step": 17825 }, { "entropy": 6.44638843536377, "epoch": 1.9080207608753812, "grad_norm": 1.375, "learning_rate": 0.00046419217051102223, "loss": 6.2794, "mean_token_accuracy": 0.13144152835011483, "num_tokens": 38591136.0, "step": 17830 }, { "entropy": 6.521512222290039, "epoch": 1.908555834983145, "grad_norm": 1.4375, "learning_rate": 0.0004641714735206261, "loss": 6.184, "mean_token_accuracy": 0.14119268357753753, "num_tokens": 38602600.0, "step": 17835 }, { "entropy": 6.515765047073364, "epoch": 1.9090909090909092, "grad_norm": 1.328125, "learning_rate": 0.00046415077106793024, "loss": 6.1982, "mean_token_accuracy": 0.14135203510522842, "num_tokens": 38612641.0, "step": 17840 }, { "entropy": 6.525089740753174, "epoch": 1.909625983198673, "grad_norm": 1.5, "learning_rate": 0.0004641300631535325, "loss": 6.1835, "mean_token_accuracy": 0.14011745378375054, "num_tokens": 38622873.0, "step": 17845 }, { "entropy": 6.479873371124268, "epoch": 1.910161057306437, "grad_norm": 1.8515625, "learning_rate": 0.0004641093497780307, "loss": 6.2049, "mean_token_accuracy": 0.14634738862514496, "num_tokens": 38633523.0, "step": 17850 }, { "entropy": 6.488259887695312, "epoch": 1.910696131414201, "grad_norm": 2.578125, "learning_rate": 0.0004640886309420231, "loss": 6.235, "mean_token_accuracy": 0.1308392196893692, "num_tokens": 38645635.0, "step": 17855 }, { "entropy": 6.5185023784637455, "epoch": 1.9112312055219647, "grad_norm": 1.546875, "learning_rate": 0.0004640679066461078, "loss": 6.1824, "mean_token_accuracy": 0.1497434303164482, "num_tokens": 38656293.0, "step": 17860 }, { "entropy": 6.5067955493927006, "epoch": 1.9117662796297288, "grad_norm": 2.015625, "learning_rate": 0.0004640471768908832, "loss": 6.2991, "mean_token_accuracy": 0.13123812302947044, "num_tokens": 38667307.0, "step": 17865 }, { "entropy": 6.555864238739014, "epoch": 1.9123013537374927, "grad_norm": 1.4375, "learning_rate": 0.0004640264416769481, "loss": 6.1718, "mean_token_accuracy": 0.13502105697989464, "num_tokens": 38677775.0, "step": 17870 }, { "entropy": 6.471245193481446, "epoch": 1.9128364278452565, "grad_norm": 1.90625, "learning_rate": 0.00046400570100490086, "loss": 6.2694, "mean_token_accuracy": 0.13582777678966523, "num_tokens": 38688652.0, "step": 17875 }, { "entropy": 6.500534534454346, "epoch": 1.9133715019530206, "grad_norm": 2.734375, "learning_rate": 0.00046398495487534066, "loss": 6.2256, "mean_token_accuracy": 0.13551617562770843, "num_tokens": 38698694.0, "step": 17880 }, { "entropy": 6.506363296508789, "epoch": 1.9139065760607843, "grad_norm": 1.578125, "learning_rate": 0.0004639642032888664, "loss": 6.2449, "mean_token_accuracy": 0.136919304728508, "num_tokens": 38709864.0, "step": 17885 }, { "entropy": 6.50716872215271, "epoch": 1.9144416501685484, "grad_norm": 1.3984375, "learning_rate": 0.0004639434462460774, "loss": 6.2412, "mean_token_accuracy": 0.13497220128774642, "num_tokens": 38721034.0, "step": 17890 }, { "entropy": 6.568297719955444, "epoch": 1.9149767242763123, "grad_norm": 1.734375, "learning_rate": 0.00046392268374757285, "loss": 6.2328, "mean_token_accuracy": 0.13604136258363725, "num_tokens": 38731874.0, "step": 17895 }, { "entropy": 6.487967205047608, "epoch": 1.9155117983840761, "grad_norm": 1.484375, "learning_rate": 0.0004639019157939524, "loss": 6.1748, "mean_token_accuracy": 0.14495863467454911, "num_tokens": 38742447.0, "step": 17900 }, { "entropy": 6.484689235687256, "epoch": 1.9160468724918402, "grad_norm": 2.109375, "learning_rate": 0.0004638811423858157, "loss": 6.1054, "mean_token_accuracy": 0.13880375921726226, "num_tokens": 38754117.0, "step": 17905 }, { "entropy": 6.554324913024902, "epoch": 1.916581946599604, "grad_norm": 1.4140625, "learning_rate": 0.00046386036352376255, "loss": 6.2277, "mean_token_accuracy": 0.131800340116024, "num_tokens": 38765057.0, "step": 17910 }, { "entropy": 6.493456125259399, "epoch": 1.917117020707368, "grad_norm": 1.578125, "learning_rate": 0.00046383957920839285, "loss": 6.1745, "mean_token_accuracy": 0.14344696775078775, "num_tokens": 38775938.0, "step": 17915 }, { "entropy": 6.426898050308227, "epoch": 1.9176520948151319, "grad_norm": 1.7265625, "learning_rate": 0.00046381878944030697, "loss": 6.1086, "mean_token_accuracy": 0.1440959244966507, "num_tokens": 38787013.0, "step": 17920 }, { "entropy": 6.486614990234375, "epoch": 1.9181871689228958, "grad_norm": 3.40625, "learning_rate": 0.000463797994220105, "loss": 6.1635, "mean_token_accuracy": 0.14382546991109849, "num_tokens": 38798412.0, "step": 17925 }, { "entropy": 6.483612489700318, "epoch": 1.9187222430306599, "grad_norm": 1.5703125, "learning_rate": 0.00046377719354838756, "loss": 6.2512, "mean_token_accuracy": 0.13215523809194565, "num_tokens": 38809983.0, "step": 17930 }, { "entropy": 6.530688667297364, "epoch": 1.9192573171384235, "grad_norm": 1.7734375, "learning_rate": 0.00046375638742575506, "loss": 6.2353, "mean_token_accuracy": 0.1396634139120579, "num_tokens": 38820418.0, "step": 17935 }, { "entropy": 6.560414886474609, "epoch": 1.9197923912461876, "grad_norm": 2.03125, "learning_rate": 0.0004637355758528085, "loss": 6.2265, "mean_token_accuracy": 0.14094739705324172, "num_tokens": 38831482.0, "step": 17940 }, { "entropy": 6.572238254547119, "epoch": 1.9203274653539515, "grad_norm": 1.546875, "learning_rate": 0.0004637147588301486, "loss": 6.2519, "mean_token_accuracy": 0.13170821741223335, "num_tokens": 38842110.0, "step": 17945 }, { "entropy": 6.451564836502075, "epoch": 1.9208625394617154, "grad_norm": 1.71875, "learning_rate": 0.00046369393635837657, "loss": 6.1156, "mean_token_accuracy": 0.13936901614069938, "num_tokens": 38852861.0, "step": 17950 }, { "entropy": 6.468238449096679, "epoch": 1.9213976135694795, "grad_norm": 1.671875, "learning_rate": 0.00046367310843809374, "loss": 6.2604, "mean_token_accuracy": 0.13597493693232537, "num_tokens": 38864067.0, "step": 17955 }, { "entropy": 6.567491865158081, "epoch": 1.9219326876772433, "grad_norm": 1.5390625, "learning_rate": 0.00046365227506990137, "loss": 6.2192, "mean_token_accuracy": 0.1376200519502163, "num_tokens": 38875363.0, "step": 17960 }, { "entropy": 6.594467115402222, "epoch": 1.9224677617850072, "grad_norm": 1.4140625, "learning_rate": 0.0004636314362544011, "loss": 6.2283, "mean_token_accuracy": 0.1406591974198818, "num_tokens": 38886414.0, "step": 17965 }, { "entropy": 6.539594984054565, "epoch": 1.923002835892771, "grad_norm": 1.5703125, "learning_rate": 0.00046361059199219457, "loss": 6.297, "mean_token_accuracy": 0.13197313323616983, "num_tokens": 38897708.0, "step": 17970 }, { "entropy": 6.451222896575928, "epoch": 1.923537910000535, "grad_norm": 1.6171875, "learning_rate": 0.0004635897422838837, "loss": 6.1608, "mean_token_accuracy": 0.14442215859889984, "num_tokens": 38908683.0, "step": 17975 }, { "entropy": 6.420654535293579, "epoch": 1.924072984108299, "grad_norm": 1.6171875, "learning_rate": 0.00046356888713007055, "loss": 6.1313, "mean_token_accuracy": 0.14991554766893386, "num_tokens": 38919279.0, "step": 17980 }, { "entropy": 6.555045938491821, "epoch": 1.924608058216063, "grad_norm": 1.359375, "learning_rate": 0.00046354802653135723, "loss": 6.2259, "mean_token_accuracy": 0.1369065135717392, "num_tokens": 38929353.0, "step": 17985 }, { "entropy": 6.5306110858917235, "epoch": 1.9251431323238268, "grad_norm": 1.5625, "learning_rate": 0.0004635271604883462, "loss": 6.1951, "mean_token_accuracy": 0.14035843312740326, "num_tokens": 38939296.0, "step": 17990 }, { "entropy": 6.471765947341919, "epoch": 1.925678206431591, "grad_norm": 1.75, "learning_rate": 0.00046350628900163987, "loss": 6.2031, "mean_token_accuracy": 0.13961842954158782, "num_tokens": 38950149.0, "step": 17995 }, { "entropy": 6.5483925342559814, "epoch": 1.9262132805393546, "grad_norm": 1.5, "learning_rate": 0.000463485412071841, "loss": 6.2342, "mean_token_accuracy": 0.13433675169944764, "num_tokens": 38961052.0, "step": 18000 }, { "epoch": 1.9262132805393546, "eval_entropy": 6.365103536153418, "eval_loss": 6.311902046203613, "eval_mean_token_accuracy": 0.14091309935652785, "eval_num_tokens": 38961052.0, "eval_runtime": 22.5469, "eval_samples_per_second": 1316.325, "eval_steps_per_second": 164.546, "step": 18000 }, { "entropy": 6.537387180328369, "epoch": 1.9267483546471187, "grad_norm": 1.5078125, "learning_rate": 0.00046346452969955214, "loss": 6.2505, "mean_token_accuracy": 0.13952741846442224, "num_tokens": 38972344.0, "step": 18005 }, { "entropy": 6.534369659423828, "epoch": 1.9272834287548826, "grad_norm": 1.5, "learning_rate": 0.0004634436418853767, "loss": 6.197, "mean_token_accuracy": 0.13502275794744492, "num_tokens": 38982877.0, "step": 18010 }, { "entropy": 6.489065361022949, "epoch": 1.9278185028626464, "grad_norm": 1.5, "learning_rate": 0.00046342274862991745, "loss": 6.2001, "mean_token_accuracy": 0.13976141065359116, "num_tokens": 38994322.0, "step": 18015 }, { "entropy": 6.48278956413269, "epoch": 1.9283535769704105, "grad_norm": 1.765625, "learning_rate": 0.00046340184993377793, "loss": 6.1495, "mean_token_accuracy": 0.14276184588670732, "num_tokens": 39003447.0, "step": 18020 }, { "entropy": 6.493710613250732, "epoch": 1.9288886510781742, "grad_norm": 1.390625, "learning_rate": 0.00046338094579756136, "loss": 6.2228, "mean_token_accuracy": 0.13028390035033227, "num_tokens": 39013760.0, "step": 18025 }, { "entropy": 6.380214357376099, "epoch": 1.9294237251859383, "grad_norm": 1.453125, "learning_rate": 0.00046336003622187143, "loss": 6.0133, "mean_token_accuracy": 0.15164145305752755, "num_tokens": 39025559.0, "step": 18030 }, { "entropy": 6.507640695571899, "epoch": 1.9299587992937022, "grad_norm": 1.4765625, "learning_rate": 0.000463339121207312, "loss": 6.1936, "mean_token_accuracy": 0.1387665130198002, "num_tokens": 39036004.0, "step": 18035 }, { "entropy": 6.50057692527771, "epoch": 1.930493873401466, "grad_norm": 1.4375, "learning_rate": 0.0004633182007544868, "loss": 6.2379, "mean_token_accuracy": 0.1374046929180622, "num_tokens": 39047251.0, "step": 18040 }, { "entropy": 6.521696710586548, "epoch": 1.9310289475092302, "grad_norm": 1.515625, "learning_rate": 0.00046329727486400015, "loss": 6.267, "mean_token_accuracy": 0.13776894733309747, "num_tokens": 39057255.0, "step": 18045 }, { "entropy": 6.5461184024810795, "epoch": 1.9315640216169938, "grad_norm": 1.6953125, "learning_rate": 0.0004632763435364561, "loss": 6.2587, "mean_token_accuracy": 0.1345633938908577, "num_tokens": 39068186.0, "step": 18050 }, { "entropy": 6.460474252700806, "epoch": 1.932099095724758, "grad_norm": 1.703125, "learning_rate": 0.00046325540677245907, "loss": 6.1637, "mean_token_accuracy": 0.14090655818581582, "num_tokens": 39079173.0, "step": 18055 }, { "entropy": 6.509998750686646, "epoch": 1.9326341698325218, "grad_norm": 1.8828125, "learning_rate": 0.00046323446457261365, "loss": 6.241, "mean_token_accuracy": 0.13899825662374496, "num_tokens": 39089939.0, "step": 18060 }, { "entropy": 6.483740901947021, "epoch": 1.9331692439402857, "grad_norm": 1.5234375, "learning_rate": 0.0004632135169375245, "loss": 6.2411, "mean_token_accuracy": 0.1368535950779915, "num_tokens": 39100464.0, "step": 18065 }, { "entropy": 6.590921926498413, "epoch": 1.9337043180480498, "grad_norm": 1.3515625, "learning_rate": 0.0004631925638677965, "loss": 6.186, "mean_token_accuracy": 0.1361953742802143, "num_tokens": 39111161.0, "step": 18070 }, { "entropy": 6.5673949241638185, "epoch": 1.9342393921558134, "grad_norm": 1.625, "learning_rate": 0.00046317160536403463, "loss": 6.2036, "mean_token_accuracy": 0.14538534879684448, "num_tokens": 39122469.0, "step": 18075 }, { "entropy": 6.501009321212768, "epoch": 1.9347744662635775, "grad_norm": 1.3671875, "learning_rate": 0.00046315064142684416, "loss": 6.1719, "mean_token_accuracy": 0.1420877143740654, "num_tokens": 39131871.0, "step": 18080 }, { "entropy": 6.536379814147949, "epoch": 1.9353095403713414, "grad_norm": 1.3515625, "learning_rate": 0.0004631296720568304, "loss": 6.2211, "mean_token_accuracy": 0.13578182831406593, "num_tokens": 39143061.0, "step": 18085 }, { "entropy": 6.519476127624512, "epoch": 1.9358446144791053, "grad_norm": 1.515625, "learning_rate": 0.0004631086972545987, "loss": 6.2104, "mean_token_accuracy": 0.14594390690326692, "num_tokens": 39152452.0, "step": 18090 }, { "entropy": 6.481864023208618, "epoch": 1.9363796885868694, "grad_norm": 1.6953125, "learning_rate": 0.0004630877170207548, "loss": 6.168, "mean_token_accuracy": 0.14349544048309326, "num_tokens": 39163196.0, "step": 18095 }, { "entropy": 6.444577312469482, "epoch": 1.9369147626946333, "grad_norm": 1.4765625, "learning_rate": 0.0004630667313559045, "loss": 6.1546, "mean_token_accuracy": 0.13424062207341195, "num_tokens": 39173958.0, "step": 18100 }, { "entropy": 6.509752082824707, "epoch": 1.9374498368023971, "grad_norm": 1.4453125, "learning_rate": 0.00046304574026065376, "loss": 6.18, "mean_token_accuracy": 0.14818471521139145, "num_tokens": 39184483.0, "step": 18105 }, { "entropy": 6.464862442016601, "epoch": 1.937984910910161, "grad_norm": 1.3828125, "learning_rate": 0.0004630247437356087, "loss": 6.2379, "mean_token_accuracy": 0.13587528467178345, "num_tokens": 39196500.0, "step": 18110 }, { "entropy": 6.581671142578125, "epoch": 1.9385199850179249, "grad_norm": 1.3203125, "learning_rate": 0.00046300374178137566, "loss": 6.2811, "mean_token_accuracy": 0.13231036737561225, "num_tokens": 39207492.0, "step": 18115 }, { "entropy": 6.606667470932007, "epoch": 1.939055059125689, "grad_norm": 1.4375, "learning_rate": 0.0004629827343985609, "loss": 6.2132, "mean_token_accuracy": 0.1399967424571514, "num_tokens": 39218204.0, "step": 18120 }, { "entropy": 6.5478047847747805, "epoch": 1.9395901332334529, "grad_norm": 1.484375, "learning_rate": 0.00046296172158777116, "loss": 6.2639, "mean_token_accuracy": 0.13208532631397246, "num_tokens": 39229646.0, "step": 18125 }, { "entropy": 6.482489490509034, "epoch": 1.9401252073412167, "grad_norm": 1.5078125, "learning_rate": 0.0004629407033496131, "loss": 6.1818, "mean_token_accuracy": 0.1369784414768219, "num_tokens": 39240151.0, "step": 18130 }, { "entropy": 6.533039617538452, "epoch": 1.9406602814489808, "grad_norm": 1.421875, "learning_rate": 0.0004629196796846936, "loss": 6.2495, "mean_token_accuracy": 0.14209898710250854, "num_tokens": 39251571.0, "step": 18135 }, { "entropy": 6.579952049255371, "epoch": 1.9411953555567445, "grad_norm": 1.84375, "learning_rate": 0.00046289865059361983, "loss": 6.2067, "mean_token_accuracy": 0.13832592815160752, "num_tokens": 39262937.0, "step": 18140 }, { "entropy": 6.596141672134399, "epoch": 1.9417304296645086, "grad_norm": 1.6328125, "learning_rate": 0.00046287761607699887, "loss": 6.2854, "mean_token_accuracy": 0.1336644783616066, "num_tokens": 39274354.0, "step": 18145 }, { "entropy": 6.532996129989624, "epoch": 1.9422655037722725, "grad_norm": 1.4375, "learning_rate": 0.0004628565761354382, "loss": 6.1685, "mean_token_accuracy": 0.1417832262814045, "num_tokens": 39284314.0, "step": 18150 }, { "entropy": 6.474736070632934, "epoch": 1.9428005778800364, "grad_norm": 2.0625, "learning_rate": 0.00046283553076954527, "loss": 6.1918, "mean_token_accuracy": 0.13891778364777566, "num_tokens": 39295516.0, "step": 18155 }, { "entropy": 6.522478151321411, "epoch": 1.9433356519878004, "grad_norm": 1.1875, "learning_rate": 0.0004628144799799277, "loss": 6.2081, "mean_token_accuracy": 0.13308093473315238, "num_tokens": 39307221.0, "step": 18160 }, { "entropy": 6.490683937072754, "epoch": 1.943870726095564, "grad_norm": 1.65625, "learning_rate": 0.0004627934237671935, "loss": 6.2232, "mean_token_accuracy": 0.13667370676994323, "num_tokens": 39318448.0, "step": 18165 }, { "entropy": 6.452537965774536, "epoch": 1.9444058002033282, "grad_norm": 1.4453125, "learning_rate": 0.00046277236213195064, "loss": 6.134, "mean_token_accuracy": 0.14521567970514299, "num_tokens": 39329384.0, "step": 18170 }, { "entropy": 6.541502904891968, "epoch": 1.944940874311092, "grad_norm": 1.25, "learning_rate": 0.00046275129507480705, "loss": 6.2554, "mean_token_accuracy": 0.1390232525765896, "num_tokens": 39340342.0, "step": 18175 }, { "entropy": 6.410711622238159, "epoch": 1.945475948418856, "grad_norm": 1.4453125, "learning_rate": 0.0004627302225963713, "loss": 6.1136, "mean_token_accuracy": 0.14687473252415656, "num_tokens": 39350825.0, "step": 18180 }, { "entropy": 6.579923677444458, "epoch": 1.94601102252662, "grad_norm": 1.8984375, "learning_rate": 0.00046270914469725174, "loss": 6.2763, "mean_token_accuracy": 0.1316472865641117, "num_tokens": 39361986.0, "step": 18185 }, { "entropy": 6.550302743911743, "epoch": 1.9465460966343837, "grad_norm": 1.78125, "learning_rate": 0.00046268806137805704, "loss": 6.1579, "mean_token_accuracy": 0.13814951479434967, "num_tokens": 39372440.0, "step": 18190 }, { "entropy": 6.4940667152404785, "epoch": 1.9470811707421478, "grad_norm": 3.53125, "learning_rate": 0.0004626669726393958, "loss": 6.1892, "mean_token_accuracy": 0.15121543034911156, "num_tokens": 39383455.0, "step": 18195 }, { "entropy": 6.449176502227783, "epoch": 1.9476162448499117, "grad_norm": 1.546875, "learning_rate": 0.0004626458784818772, "loss": 6.2052, "mean_token_accuracy": 0.137010395526886, "num_tokens": 39393511.0, "step": 18200 }, { "entropy": 6.5185973167419435, "epoch": 1.9481513189576756, "grad_norm": 1.7109375, "learning_rate": 0.00046262477890611026, "loss": 6.1915, "mean_token_accuracy": 0.14350884780287743, "num_tokens": 39404049.0, "step": 18205 }, { "entropy": 6.524765062332153, "epoch": 1.9486863930654397, "grad_norm": 1.6953125, "learning_rate": 0.00046260367391270414, "loss": 6.2084, "mean_token_accuracy": 0.14273274093866348, "num_tokens": 39414771.0, "step": 18210 }, { "entropy": 6.455693674087525, "epoch": 1.9492214671732033, "grad_norm": 1.5859375, "learning_rate": 0.00046258256350226835, "loss": 6.1725, "mean_token_accuracy": 0.14329796582460402, "num_tokens": 39424869.0, "step": 18215 }, { "entropy": 6.48890872001648, "epoch": 1.9497565412809674, "grad_norm": 1.421875, "learning_rate": 0.0004625614476754123, "loss": 6.2549, "mean_token_accuracy": 0.1388202503323555, "num_tokens": 39435442.0, "step": 18220 }, { "entropy": 6.534210252761841, "epoch": 1.9502916153887313, "grad_norm": 2.109375, "learning_rate": 0.00046254032643274596, "loss": 6.19, "mean_token_accuracy": 0.14215890243649482, "num_tokens": 39446704.0, "step": 18225 }, { "entropy": 6.4775608539581295, "epoch": 1.9508266894964952, "grad_norm": 1.6953125, "learning_rate": 0.00046251919977487887, "loss": 6.2069, "mean_token_accuracy": 0.14251686334609986, "num_tokens": 39458079.0, "step": 18230 }, { "entropy": 6.534129285812378, "epoch": 1.9513617636042593, "grad_norm": 1.546875, "learning_rate": 0.00046249806770242135, "loss": 6.2009, "mean_token_accuracy": 0.14502133950591087, "num_tokens": 39469867.0, "step": 18235 }, { "entropy": 6.503177642822266, "epoch": 1.9518968377120232, "grad_norm": 1.4140625, "learning_rate": 0.0004624769302159834, "loss": 6.1893, "mean_token_accuracy": 0.13654508143663407, "num_tokens": 39481138.0, "step": 18240 }, { "entropy": 6.478667306900024, "epoch": 1.952431911819787, "grad_norm": 1.5546875, "learning_rate": 0.0004624557873161755, "loss": 6.1549, "mean_token_accuracy": 0.1422030508518219, "num_tokens": 39492066.0, "step": 18245 }, { "entropy": 6.619949913024902, "epoch": 1.952966985927551, "grad_norm": 1.3046875, "learning_rate": 0.0004624346390036081, "loss": 6.2338, "mean_token_accuracy": 0.1362333133816719, "num_tokens": 39502576.0, "step": 18250 }, { "entropy": 6.516488552093506, "epoch": 1.9535020600353148, "grad_norm": 1.3359375, "learning_rate": 0.0004624134852788918, "loss": 6.1736, "mean_token_accuracy": 0.1413075566291809, "num_tokens": 39513373.0, "step": 18255 }, { "entropy": 6.49299464225769, "epoch": 1.954037134143079, "grad_norm": 1.5078125, "learning_rate": 0.0004623923261426374, "loss": 6.2466, "mean_token_accuracy": 0.13643113598227502, "num_tokens": 39523970.0, "step": 18260 }, { "entropy": 6.487503910064698, "epoch": 1.9545722082508428, "grad_norm": 1.3828125, "learning_rate": 0.000462371161595456, "loss": 6.2189, "mean_token_accuracy": 0.14029355868697166, "num_tokens": 39533893.0, "step": 18265 }, { "entropy": 6.499411344528198, "epoch": 1.9551072823586066, "grad_norm": 1.6328125, "learning_rate": 0.0004623499916379586, "loss": 6.1877, "mean_token_accuracy": 0.13367502987384797, "num_tokens": 39544276.0, "step": 18270 }, { "entropy": 6.508891677856445, "epoch": 1.9556423564663707, "grad_norm": 2.484375, "learning_rate": 0.0004623288162707565, "loss": 6.1817, "mean_token_accuracy": 0.1446276016533375, "num_tokens": 39554443.0, "step": 18275 }, { "entropy": 6.481840372085571, "epoch": 1.9561774305741344, "grad_norm": 1.4296875, "learning_rate": 0.00046230763549446116, "loss": 6.1377, "mean_token_accuracy": 0.1417379431426525, "num_tokens": 39564508.0, "step": 18280 }, { "entropy": 6.506319046020508, "epoch": 1.9567125046818985, "grad_norm": 1.3515625, "learning_rate": 0.0004622864493096842, "loss": 6.2279, "mean_token_accuracy": 0.13477322906255723, "num_tokens": 39574757.0, "step": 18285 }, { "entropy": 6.530301570892334, "epoch": 1.9572475787896624, "grad_norm": 1.65625, "learning_rate": 0.00046226525771703733, "loss": 6.2871, "mean_token_accuracy": 0.1320313483476639, "num_tokens": 39585911.0, "step": 18290 }, { "entropy": 6.52979040145874, "epoch": 1.9577826528974263, "grad_norm": 1.453125, "learning_rate": 0.0004622440607171324, "loss": 6.1984, "mean_token_accuracy": 0.13540443405508995, "num_tokens": 39597443.0, "step": 18295 }, { "entropy": 6.5429998397827145, "epoch": 1.9583177270051904, "grad_norm": 1.3203125, "learning_rate": 0.00046222285831058155, "loss": 6.2385, "mean_token_accuracy": 0.13729900270700454, "num_tokens": 39608693.0, "step": 18300 }, { "entropy": 6.489964962005615, "epoch": 1.958852801112954, "grad_norm": 1.4921875, "learning_rate": 0.000462201650497997, "loss": 6.2462, "mean_token_accuracy": 0.13809031397104263, "num_tokens": 39620002.0, "step": 18305 }, { "entropy": 6.494258642196655, "epoch": 1.9593878752207181, "grad_norm": 1.453125, "learning_rate": 0.00046218043727999105, "loss": 6.212, "mean_token_accuracy": 0.14171760454773902, "num_tokens": 39629856.0, "step": 18310 }, { "entropy": 6.454374885559082, "epoch": 1.959922949328482, "grad_norm": 1.578125, "learning_rate": 0.00046215921865717637, "loss": 6.1583, "mean_token_accuracy": 0.1480446234345436, "num_tokens": 39640418.0, "step": 18315 }, { "entropy": 6.585394716262817, "epoch": 1.9604580234362459, "grad_norm": 2.59375, "learning_rate": 0.0004621379946301655, "loss": 6.2789, "mean_token_accuracy": 0.13282811343669892, "num_tokens": 39652871.0, "step": 18320 }, { "entropy": 6.538632917404175, "epoch": 1.96099309754401, "grad_norm": 1.5859375, "learning_rate": 0.0004621167651995713, "loss": 6.2056, "mean_token_accuracy": 0.13859786316752434, "num_tokens": 39663864.0, "step": 18325 }, { "entropy": 6.443591547012329, "epoch": 1.9615281716517736, "grad_norm": 1.3515625, "learning_rate": 0.0004620955303660068, "loss": 6.1861, "mean_token_accuracy": 0.14592609256505967, "num_tokens": 39675835.0, "step": 18330 }, { "entropy": 6.486690998077393, "epoch": 1.9620632457595377, "grad_norm": 2.046875, "learning_rate": 0.00046207429013008525, "loss": 6.223, "mean_token_accuracy": 0.13817154094576836, "num_tokens": 39686799.0, "step": 18335 }, { "entropy": 6.595781373977661, "epoch": 1.9625983198673016, "grad_norm": 2.078125, "learning_rate": 0.00046205304449241976, "loss": 6.1933, "mean_token_accuracy": 0.14235665500164033, "num_tokens": 39697564.0, "step": 18340 }, { "entropy": 6.546803331375122, "epoch": 1.9631333939750655, "grad_norm": 1.265625, "learning_rate": 0.0004620317934536239, "loss": 6.2155, "mean_token_accuracy": 0.13921477496623993, "num_tokens": 39708064.0, "step": 18345 }, { "entropy": 6.4622925281524655, "epoch": 1.9636684680828296, "grad_norm": 1.3203125, "learning_rate": 0.0004620105370143112, "loss": 6.0978, "mean_token_accuracy": 0.14588503614068032, "num_tokens": 39718076.0, "step": 18350 }, { "entropy": 6.4703590869903564, "epoch": 1.9642035421905932, "grad_norm": 1.25, "learning_rate": 0.0004619892751750957, "loss": 6.1888, "mean_token_accuracy": 0.1371205635368824, "num_tokens": 39729532.0, "step": 18355 }, { "entropy": 6.572897434234619, "epoch": 1.9647386162983573, "grad_norm": 1.4921875, "learning_rate": 0.00046196800793659116, "loss": 6.1947, "mean_token_accuracy": 0.13921429961919785, "num_tokens": 39740372.0, "step": 18360 }, { "entropy": 6.471987104415893, "epoch": 1.9652736904061212, "grad_norm": 1.3671875, "learning_rate": 0.0004619467352994115, "loss": 6.0726, "mean_token_accuracy": 0.1459924139082432, "num_tokens": 39751283.0, "step": 18365 }, { "entropy": 6.492894411087036, "epoch": 1.965808764513885, "grad_norm": 1.640625, "learning_rate": 0.0004619254572641712, "loss": 6.2841, "mean_token_accuracy": 0.1367352746427059, "num_tokens": 39763295.0, "step": 18370 }, { "entropy": 6.497032403945923, "epoch": 1.9663438386216492, "grad_norm": 1.375, "learning_rate": 0.00046190417383148465, "loss": 6.2029, "mean_token_accuracy": 0.13938141465187073, "num_tokens": 39773849.0, "step": 18375 }, { "entropy": 6.40442214012146, "epoch": 1.966878912729413, "grad_norm": 1.5234375, "learning_rate": 0.0004618828850019663, "loss": 6.0185, "mean_token_accuracy": 0.149911268055439, "num_tokens": 39784366.0, "step": 18380 }, { "entropy": 6.481572771072388, "epoch": 1.967413986837177, "grad_norm": 2.0, "learning_rate": 0.00046186159077623093, "loss": 6.1466, "mean_token_accuracy": 0.13839536607265474, "num_tokens": 39794226.0, "step": 18385 }, { "entropy": 6.461075973510742, "epoch": 1.9679490609449408, "grad_norm": 1.6484375, "learning_rate": 0.0004618402911548933, "loss": 6.1659, "mean_token_accuracy": 0.13925424218177795, "num_tokens": 39805557.0, "step": 18390 }, { "entropy": 6.508315753936768, "epoch": 1.9684841350527047, "grad_norm": 1.359375, "learning_rate": 0.0004618189861385686, "loss": 6.1437, "mean_token_accuracy": 0.14520555585622788, "num_tokens": 39816090.0, "step": 18395 }, { "entropy": 6.483796405792236, "epoch": 1.9690192091604688, "grad_norm": 1.6015625, "learning_rate": 0.0004617976757278719, "loss": 6.2453, "mean_token_accuracy": 0.13241346776485444, "num_tokens": 39826662.0, "step": 18400 }, { "entropy": 6.5719798564910885, "epoch": 1.9695542832682327, "grad_norm": 1.4609375, "learning_rate": 0.00046177635992341855, "loss": 6.2349, "mean_token_accuracy": 0.1341266453266144, "num_tokens": 39837805.0, "step": 18405 }, { "entropy": 6.577894020080566, "epoch": 1.9700893573759966, "grad_norm": 1.3203125, "learning_rate": 0.0004617550387258241, "loss": 6.2255, "mean_token_accuracy": 0.1321740508079529, "num_tokens": 39848052.0, "step": 18410 }, { "entropy": 6.544881772994995, "epoch": 1.9706244314837607, "grad_norm": 1.6484375, "learning_rate": 0.0004617337121357041, "loss": 6.2168, "mean_token_accuracy": 0.13785637766122819, "num_tokens": 39859448.0, "step": 18415 }, { "entropy": 6.523015117645263, "epoch": 1.9711595055915243, "grad_norm": 1.3984375, "learning_rate": 0.0004617123801536744, "loss": 6.1675, "mean_token_accuracy": 0.14234541207551957, "num_tokens": 39870053.0, "step": 18420 }, { "entropy": 6.52815432548523, "epoch": 1.9716945796992884, "grad_norm": 1.4609375, "learning_rate": 0.000461691042780351, "loss": 6.2812, "mean_token_accuracy": 0.1351883016526699, "num_tokens": 39881547.0, "step": 18425 }, { "entropy": 6.530121231079102, "epoch": 1.9722296538070523, "grad_norm": 1.8046875, "learning_rate": 0.00046166970001635, "loss": 6.2598, "mean_token_accuracy": 0.13887228742241858, "num_tokens": 39892974.0, "step": 18430 }, { "entropy": 6.54822850227356, "epoch": 1.9727647279148162, "grad_norm": 1.3515625, "learning_rate": 0.00046164835186228757, "loss": 6.2269, "mean_token_accuracy": 0.13992278203368186, "num_tokens": 39904210.0, "step": 18435 }, { "entropy": 6.473427581787109, "epoch": 1.9732998020225803, "grad_norm": 1.65625, "learning_rate": 0.00046162699831878026, "loss": 6.1996, "mean_token_accuracy": 0.13897218704223632, "num_tokens": 39915464.0, "step": 18440 }, { "entropy": 6.516928815841675, "epoch": 1.973834876130344, "grad_norm": 2.578125, "learning_rate": 0.0004616056393864446, "loss": 6.2168, "mean_token_accuracy": 0.13783070743083953, "num_tokens": 39927117.0, "step": 18445 }, { "entropy": 6.590982913970947, "epoch": 1.974369950238108, "grad_norm": 1.3046875, "learning_rate": 0.0004615842750658972, "loss": 6.2195, "mean_token_accuracy": 0.1418525017797947, "num_tokens": 39937363.0, "step": 18450 }, { "entropy": 6.485547065734863, "epoch": 1.974905024345872, "grad_norm": 1.4453125, "learning_rate": 0.0004615629053577552, "loss": 6.1033, "mean_token_accuracy": 0.14801151901483536, "num_tokens": 39948934.0, "step": 18455 }, { "entropy": 6.463800287246704, "epoch": 1.9754400984536358, "grad_norm": 1.1640625, "learning_rate": 0.0004615415302626355, "loss": 6.1452, "mean_token_accuracy": 0.14127560183405877, "num_tokens": 39959435.0, "step": 18460 }, { "entropy": 6.523458242416382, "epoch": 1.9759751725613999, "grad_norm": 1.3984375, "learning_rate": 0.00046152014978115535, "loss": 6.2302, "mean_token_accuracy": 0.13477562740445137, "num_tokens": 39969006.0, "step": 18465 }, { "entropy": 6.495766067504883, "epoch": 1.9765102466691635, "grad_norm": 1.421875, "learning_rate": 0.000461498763913932, "loss": 6.146, "mean_token_accuracy": 0.13650858923792838, "num_tokens": 39979264.0, "step": 18470 }, { "entropy": 6.57129921913147, "epoch": 1.9770453207769276, "grad_norm": 1.3046875, "learning_rate": 0.00046147737266158314, "loss": 6.3063, "mean_token_accuracy": 0.13355173617601396, "num_tokens": 39989791.0, "step": 18475 }, { "entropy": 6.5301202774047855, "epoch": 1.9775803948846915, "grad_norm": 1.359375, "learning_rate": 0.0004614559760247263, "loss": 6.1533, "mean_token_accuracy": 0.13895142823457718, "num_tokens": 39999591.0, "step": 18480 }, { "entropy": 6.482016563415527, "epoch": 1.9781154689924554, "grad_norm": 1.5234375, "learning_rate": 0.0004614345740039794, "loss": 6.3133, "mean_token_accuracy": 0.13693781420588494, "num_tokens": 40010811.0, "step": 18485 }, { "entropy": 6.539826583862305, "epoch": 1.9786505431002195, "grad_norm": 1.125, "learning_rate": 0.00046141316659996037, "loss": 6.2399, "mean_token_accuracy": 0.13596573919057847, "num_tokens": 40022190.0, "step": 18490 }, { "entropy": 6.58152756690979, "epoch": 1.9791856172079834, "grad_norm": 1.2890625, "learning_rate": 0.00046139175381328725, "loss": 6.2075, "mean_token_accuracy": 0.1355739116668701, "num_tokens": 40033905.0, "step": 18495 }, { "entropy": 6.540552377700806, "epoch": 1.9797206913157472, "grad_norm": 1.46875, "learning_rate": 0.0004613703356445786, "loss": 6.2615, "mean_token_accuracy": 0.1378948912024498, "num_tokens": 40044923.0, "step": 18500 }, { "entropy": 6.489380884170532, "epoch": 1.9802557654235111, "grad_norm": 1.140625, "learning_rate": 0.0004613489120944526, "loss": 6.1597, "mean_token_accuracy": 0.13925086632370948, "num_tokens": 40054988.0, "step": 18505 }, { "entropy": 6.544102430343628, "epoch": 1.980790839531275, "grad_norm": 1.15625, "learning_rate": 0.0004613274831635279, "loss": 6.2654, "mean_token_accuracy": 0.13340204507112502, "num_tokens": 40065565.0, "step": 18510 }, { "entropy": 6.505882740020752, "epoch": 1.981325913639039, "grad_norm": 1.7734375, "learning_rate": 0.00046130604885242333, "loss": 6.2434, "mean_token_accuracy": 0.13562422543764113, "num_tokens": 40076282.0, "step": 18515 }, { "entropy": 6.533380508422852, "epoch": 1.981860987746803, "grad_norm": 1.5546875, "learning_rate": 0.0004612846091617578, "loss": 6.1859, "mean_token_accuracy": 0.14382676631212235, "num_tokens": 40087546.0, "step": 18520 }, { "entropy": 6.54186487197876, "epoch": 1.9823960618545668, "grad_norm": 1.5, "learning_rate": 0.0004612631640921504, "loss": 6.2532, "mean_token_accuracy": 0.13900343030691148, "num_tokens": 40097937.0, "step": 18525 }, { "entropy": 6.532418060302734, "epoch": 1.982931135962331, "grad_norm": 1.40625, "learning_rate": 0.00046124171364422025, "loss": 6.1875, "mean_token_accuracy": 0.14462210536003112, "num_tokens": 40108639.0, "step": 18530 }, { "entropy": 6.446396064758301, "epoch": 1.9834662100700946, "grad_norm": 1.2109375, "learning_rate": 0.0004612202578185868, "loss": 6.2004, "mean_token_accuracy": 0.141569384932518, "num_tokens": 40119533.0, "step": 18535 }, { "entropy": 6.538776922225952, "epoch": 1.9840012841778587, "grad_norm": 1.5390625, "learning_rate": 0.0004611987966158695, "loss": 6.2132, "mean_token_accuracy": 0.1406353272497654, "num_tokens": 40131176.0, "step": 18540 }, { "entropy": 6.565519237518311, "epoch": 1.9845363582856226, "grad_norm": 1.375, "learning_rate": 0.00046117733003668825, "loss": 6.2267, "mean_token_accuracy": 0.1372864879667759, "num_tokens": 40143293.0, "step": 18545 }, { "entropy": 6.5465416431427, "epoch": 1.9850714323933865, "grad_norm": 1.671875, "learning_rate": 0.0004611558580816628, "loss": 6.1663, "mean_token_accuracy": 0.13630439192056656, "num_tokens": 40155312.0, "step": 18550 }, { "entropy": 6.527706098556519, "epoch": 1.9856065065011506, "grad_norm": 2.109375, "learning_rate": 0.000461134380751413, "loss": 6.2243, "mean_token_accuracy": 0.13936087787151336, "num_tokens": 40166261.0, "step": 18555 }, { "entropy": 6.438541650772095, "epoch": 1.9861415806089142, "grad_norm": 1.4140625, "learning_rate": 0.00046111289804655906, "loss": 6.1585, "mean_token_accuracy": 0.14726999700069426, "num_tokens": 40176641.0, "step": 18560 }, { "entropy": 6.49216136932373, "epoch": 1.9866766547166783, "grad_norm": 1.2890625, "learning_rate": 0.0004610914099677214, "loss": 6.2394, "mean_token_accuracy": 0.13794424757361412, "num_tokens": 40187784.0, "step": 18565 }, { "entropy": 6.482954502105713, "epoch": 1.9872117288244422, "grad_norm": 1.53125, "learning_rate": 0.0004610699165155204, "loss": 6.2356, "mean_token_accuracy": 0.13208975419402122, "num_tokens": 40198219.0, "step": 18570 }, { "entropy": 6.478134822845459, "epoch": 1.987746802932206, "grad_norm": 1.34375, "learning_rate": 0.00046104841769057677, "loss": 6.1835, "mean_token_accuracy": 0.1381744846701622, "num_tokens": 40208589.0, "step": 18575 }, { "entropy": 6.554107809066773, "epoch": 1.9882818770399702, "grad_norm": 1.4140625, "learning_rate": 0.0004610269134935112, "loss": 6.1706, "mean_token_accuracy": 0.1381148010492325, "num_tokens": 40219587.0, "step": 18580 }, { "entropy": 6.517787742614746, "epoch": 1.9888169511477338, "grad_norm": 1.4921875, "learning_rate": 0.0004610054039249446, "loss": 6.1878, "mean_token_accuracy": 0.13920636028051375, "num_tokens": 40230681.0, "step": 18585 }, { "entropy": 6.395852994918823, "epoch": 1.989352025255498, "grad_norm": 1.4921875, "learning_rate": 0.00046098388898549816, "loss": 6.1101, "mean_token_accuracy": 0.14935251027345658, "num_tokens": 40241356.0, "step": 18590 }, { "entropy": 6.527567195892334, "epoch": 1.9898870993632618, "grad_norm": 1.546875, "learning_rate": 0.00046096236867579306, "loss": 6.2086, "mean_token_accuracy": 0.1399472773075104, "num_tokens": 40251652.0, "step": 18595 }, { "entropy": 6.50946536064148, "epoch": 1.9904221734710257, "grad_norm": 1.3671875, "learning_rate": 0.00046094084299645065, "loss": 6.175, "mean_token_accuracy": 0.1382264256477356, "num_tokens": 40262819.0, "step": 18600 }, { "entropy": 6.514907598495483, "epoch": 1.9909572475787898, "grad_norm": 1.265625, "learning_rate": 0.00046091931194809253, "loss": 6.2721, "mean_token_accuracy": 0.12972357571125032, "num_tokens": 40274314.0, "step": 18605 }, { "entropy": 6.545491456985474, "epoch": 1.9914923216865534, "grad_norm": 1.4375, "learning_rate": 0.0004608977755313404, "loss": 6.2355, "mean_token_accuracy": 0.13660071194171905, "num_tokens": 40284733.0, "step": 18610 }, { "entropy": 6.5072033405303955, "epoch": 1.9920273957943175, "grad_norm": 1.265625, "learning_rate": 0.0004608762337468162, "loss": 6.1806, "mean_token_accuracy": 0.14152269139885904, "num_tokens": 40295484.0, "step": 18615 }, { "entropy": 6.4947264194488525, "epoch": 1.9925624699020814, "grad_norm": 1.3125, "learning_rate": 0.0004608546865951418, "loss": 6.1719, "mean_token_accuracy": 0.1392577826976776, "num_tokens": 40305470.0, "step": 18620 }, { "entropy": 6.535963344573974, "epoch": 1.9930975440098453, "grad_norm": 1.265625, "learning_rate": 0.00046083313407693945, "loss": 6.3028, "mean_token_accuracy": 0.13385921120643615, "num_tokens": 40316055.0, "step": 18625 }, { "entropy": 6.542084646224976, "epoch": 1.9936326181176094, "grad_norm": 1.4453125, "learning_rate": 0.0004608115761928315, "loss": 6.1854, "mean_token_accuracy": 0.13841846957802773, "num_tokens": 40326689.0, "step": 18630 }, { "entropy": 6.468710279464721, "epoch": 1.9941676922253733, "grad_norm": 1.5234375, "learning_rate": 0.00046079001294344036, "loss": 6.1954, "mean_token_accuracy": 0.13841242641210555, "num_tokens": 40338511.0, "step": 18635 }, { "entropy": 6.463043689727783, "epoch": 1.9947027663331371, "grad_norm": 1.3515625, "learning_rate": 0.0004607684443293887, "loss": 6.1925, "mean_token_accuracy": 0.1357182554900646, "num_tokens": 40350395.0, "step": 18640 }, { "entropy": 6.522072792053223, "epoch": 1.995237840440901, "grad_norm": 1.375, "learning_rate": 0.0004607468703512993, "loss": 6.1774, "mean_token_accuracy": 0.14726056009531022, "num_tokens": 40360166.0, "step": 18645 }, { "entropy": 6.487435245513916, "epoch": 1.995772914548665, "grad_norm": 1.2265625, "learning_rate": 0.00046072529100979514, "loss": 6.1994, "mean_token_accuracy": 0.13381341472268105, "num_tokens": 40370655.0, "step": 18650 }, { "entropy": 6.5325366973876955, "epoch": 1.996307988656429, "grad_norm": 1.125, "learning_rate": 0.0004607037063054993, "loss": 6.1682, "mean_token_accuracy": 0.14127666875720024, "num_tokens": 40381502.0, "step": 18655 }, { "entropy": 6.629591035842895, "epoch": 1.9968430627641929, "grad_norm": 1.296875, "learning_rate": 0.000460682116239035, "loss": 6.2635, "mean_token_accuracy": 0.133098354190588, "num_tokens": 40391815.0, "step": 18660 }, { "entropy": 6.489607810974121, "epoch": 1.9973781368719568, "grad_norm": 1.40625, "learning_rate": 0.00046066052081102576, "loss": 6.2393, "mean_token_accuracy": 0.1387154445052147, "num_tokens": 40403306.0, "step": 18665 }, { "entropy": 6.465019464492798, "epoch": 1.9979132109797209, "grad_norm": 1.3984375, "learning_rate": 0.00046063892002209505, "loss": 6.1506, "mean_token_accuracy": 0.14460196644067763, "num_tokens": 40414210.0, "step": 18670 }, { "entropy": 6.4084409236907955, "epoch": 1.9984482850874845, "grad_norm": 1.53125, "learning_rate": 0.0004606173138728666, "loss": 6.1339, "mean_token_accuracy": 0.15017177313566207, "num_tokens": 40424368.0, "step": 18675 }, { "entropy": 6.5114758014678955, "epoch": 1.9989833591952486, "grad_norm": 1.546875, "learning_rate": 0.0004605957023639643, "loss": 6.2301, "mean_token_accuracy": 0.13938649669289588, "num_tokens": 40436252.0, "step": 18680 }, { "entropy": 6.547441864013672, "epoch": 1.9995184333030125, "grad_norm": 1.3984375, "learning_rate": 0.00046057408549601223, "loss": 6.2263, "mean_token_accuracy": 0.14011163935065268, "num_tokens": 40447256.0, "step": 18685 }, { "entropy": 6.536722554100884, "epoch": 2.0, "grad_norm": 2.8125, "learning_rate": 0.0004605524632696344, "loss": 6.1625, "mean_token_accuracy": 0.14446689767969978, "num_tokens": 40456516.0, "step": 18690 }, { "entropy": 6.493961954116822, "epoch": 2.000535074107764, "grad_norm": 1.5859375, "learning_rate": 0.0004605308356854553, "loss": 6.123, "mean_token_accuracy": 0.14020592719316483, "num_tokens": 40467563.0, "step": 18695 }, { "entropy": 6.507263660430908, "epoch": 2.0010701482155278, "grad_norm": 1.3515625, "learning_rate": 0.0004605092027440994, "loss": 6.1657, "mean_token_accuracy": 0.1470101334154606, "num_tokens": 40478202.0, "step": 18700 }, { "entropy": 6.548767995834351, "epoch": 2.001605222323292, "grad_norm": 1.3671875, "learning_rate": 0.0004604875644461914, "loss": 6.1386, "mean_token_accuracy": 0.14174846112728118, "num_tokens": 40489677.0, "step": 18705 }, { "entropy": 6.478121328353882, "epoch": 2.0021402964310555, "grad_norm": 1.4453125, "learning_rate": 0.00046046592079235595, "loss": 6.1573, "mean_token_accuracy": 0.1418830409646034, "num_tokens": 40500694.0, "step": 18710 }, { "entropy": 6.4401421546936035, "epoch": 2.0026753705388196, "grad_norm": 1.5625, "learning_rate": 0.0004604442717832181, "loss": 6.1265, "mean_token_accuracy": 0.14176031202077866, "num_tokens": 40511539.0, "step": 18715 }, { "entropy": 6.450679159164428, "epoch": 2.0032104446465837, "grad_norm": 2.03125, "learning_rate": 0.000460422617419403, "loss": 6.1095, "mean_token_accuracy": 0.13956640735268594, "num_tokens": 40521906.0, "step": 18720 }, { "entropy": 6.537706279754639, "epoch": 2.0037455187543474, "grad_norm": 1.40625, "learning_rate": 0.00046040095770153594, "loss": 6.1543, "mean_token_accuracy": 0.13734177649021148, "num_tokens": 40531454.0, "step": 18725 }, { "entropy": 6.561151552200317, "epoch": 2.0042805928621115, "grad_norm": 1.421875, "learning_rate": 0.0004603792926302422, "loss": 6.1805, "mean_token_accuracy": 0.13300508707761766, "num_tokens": 40541497.0, "step": 18730 }, { "entropy": 6.520805358886719, "epoch": 2.004815666969875, "grad_norm": 1.3359375, "learning_rate": 0.0004603576222061475, "loss": 6.1818, "mean_token_accuracy": 0.13687062859535218, "num_tokens": 40552576.0, "step": 18735 }, { "entropy": 6.5069859504699705, "epoch": 2.005350741077639, "grad_norm": 1.5546875, "learning_rate": 0.0004603359464298774, "loss": 6.1513, "mean_token_accuracy": 0.14298826977610588, "num_tokens": 40562906.0, "step": 18740 }, { "entropy": 6.425133419036865, "epoch": 2.0058858151854033, "grad_norm": 1.390625, "learning_rate": 0.00046031426530205796, "loss": 6.0618, "mean_token_accuracy": 0.14545038118958473, "num_tokens": 40574510.0, "step": 18745 }, { "entropy": 6.397230625152588, "epoch": 2.006420889293167, "grad_norm": 1.34375, "learning_rate": 0.0004602925788233152, "loss": 6.1029, "mean_token_accuracy": 0.15217705965042114, "num_tokens": 40586170.0, "step": 18750 }, { "entropy": 6.505608367919922, "epoch": 2.006955963400931, "grad_norm": 1.4453125, "learning_rate": 0.00046027088699427516, "loss": 6.1433, "mean_token_accuracy": 0.13655173256993294, "num_tokens": 40597613.0, "step": 18755 }, { "entropy": 6.553638553619384, "epoch": 2.007491037508695, "grad_norm": 1.8984375, "learning_rate": 0.00046024918981556434, "loss": 6.18, "mean_token_accuracy": 0.14074890017509462, "num_tokens": 40608366.0, "step": 18760 }, { "entropy": 6.4714373588562015, "epoch": 2.008026111616459, "grad_norm": 1.5234375, "learning_rate": 0.0004602274872878092, "loss": 6.1155, "mean_token_accuracy": 0.14470703527331352, "num_tokens": 40618616.0, "step": 18765 }, { "entropy": 6.363052845001221, "epoch": 2.008561185724223, "grad_norm": 1.953125, "learning_rate": 0.00046020577941163635, "loss": 6.0195, "mean_token_accuracy": 0.14627309516072273, "num_tokens": 40628342.0, "step": 18770 }, { "entropy": 6.451393365859985, "epoch": 2.0090962598319866, "grad_norm": 1.34375, "learning_rate": 0.00046018406618767273, "loss": 6.0964, "mean_token_accuracy": 0.13995684161782265, "num_tokens": 40638644.0, "step": 18775 }, { "entropy": 6.468491172790527, "epoch": 2.0096313339397507, "grad_norm": 1.2109375, "learning_rate": 0.0004601623476165451, "loss": 6.0927, "mean_token_accuracy": 0.14497480690479278, "num_tokens": 40649945.0, "step": 18780 }, { "entropy": 6.54347071647644, "epoch": 2.010166408047515, "grad_norm": 1.296875, "learning_rate": 0.00046014062369888084, "loss": 6.2209, "mean_token_accuracy": 0.13651128634810447, "num_tokens": 40660896.0, "step": 18785 }, { "entropy": 6.5255241870880125, "epoch": 2.0107014821552784, "grad_norm": 1.46875, "learning_rate": 0.000460118894435307, "loss": 6.1937, "mean_token_accuracy": 0.13748193979263307, "num_tokens": 40672072.0, "step": 18790 }, { "entropy": 6.53931622505188, "epoch": 2.0112365562630425, "grad_norm": 1.421875, "learning_rate": 0.0004600971598264511, "loss": 6.2036, "mean_token_accuracy": 0.13760020434856415, "num_tokens": 40682622.0, "step": 18795 }, { "entropy": 6.446117830276489, "epoch": 2.011771630370806, "grad_norm": 1.4765625, "learning_rate": 0.0004600754198729407, "loss": 6.1048, "mean_token_accuracy": 0.1457574747502804, "num_tokens": 40693127.0, "step": 18800 }, { "entropy": 6.473992538452149, "epoch": 2.0123067044785703, "grad_norm": 1.2109375, "learning_rate": 0.00046005367457540366, "loss": 6.1559, "mean_token_accuracy": 0.13953919857740402, "num_tokens": 40705009.0, "step": 18805 }, { "entropy": 6.550481081008911, "epoch": 2.0128417785863344, "grad_norm": 1.3125, "learning_rate": 0.00046003192393446763, "loss": 6.168, "mean_token_accuracy": 0.14077396765351297, "num_tokens": 40716498.0, "step": 18810 }, { "entropy": 6.533742380142212, "epoch": 2.013376852694098, "grad_norm": 1.328125, "learning_rate": 0.0004600101679507609, "loss": 6.1398, "mean_token_accuracy": 0.1455170065164566, "num_tokens": 40727802.0, "step": 18815 }, { "entropy": 6.489166402816773, "epoch": 2.013911926801862, "grad_norm": 1.4296875, "learning_rate": 0.0004599884066249115, "loss": 6.1757, "mean_token_accuracy": 0.14338200241327287, "num_tokens": 40738866.0, "step": 18820 }, { "entropy": 6.498798942565918, "epoch": 2.014447000909626, "grad_norm": 1.3359375, "learning_rate": 0.0004599666399575479, "loss": 6.162, "mean_token_accuracy": 0.1386456497013569, "num_tokens": 40750214.0, "step": 18825 }, { "entropy": 6.508102321624756, "epoch": 2.01498207501739, "grad_norm": 1.4609375, "learning_rate": 0.0004599448679492986, "loss": 6.1412, "mean_token_accuracy": 0.14615290239453316, "num_tokens": 40759830.0, "step": 18830 }, { "entropy": 6.476041603088379, "epoch": 2.015517149125154, "grad_norm": 1.5390625, "learning_rate": 0.0004599230906007921, "loss": 6.1776, "mean_token_accuracy": 0.14038556143641473, "num_tokens": 40770007.0, "step": 18835 }, { "entropy": 6.50742359161377, "epoch": 2.0160522232329177, "grad_norm": 2.578125, "learning_rate": 0.0004599013079126575, "loss": 6.106, "mean_token_accuracy": 0.13792717307806016, "num_tokens": 40781495.0, "step": 18840 }, { "entropy": 6.555199909210205, "epoch": 2.0165872973406818, "grad_norm": 1.34375, "learning_rate": 0.0004598795198855235, "loss": 6.0916, "mean_token_accuracy": 0.14419957250356674, "num_tokens": 40792875.0, "step": 18845 }, { "entropy": 6.514164209365845, "epoch": 2.0171223714484454, "grad_norm": 1.4140625, "learning_rate": 0.0004598577265200193, "loss": 6.2186, "mean_token_accuracy": 0.13229865208268166, "num_tokens": 40804484.0, "step": 18850 }, { "entropy": 6.460537672042847, "epoch": 2.0176574455562095, "grad_norm": 1.859375, "learning_rate": 0.0004598359278167744, "loss": 6.1275, "mean_token_accuracy": 0.13799827843904494, "num_tokens": 40814692.0, "step": 18855 }, { "entropy": 6.4778059959411625, "epoch": 2.0181925196639736, "grad_norm": 1.46875, "learning_rate": 0.00045981412377641795, "loss": 6.0952, "mean_token_accuracy": 0.14357306510210038, "num_tokens": 40825443.0, "step": 18860 }, { "entropy": 6.522529554367066, "epoch": 2.0187275937717373, "grad_norm": 1.6015625, "learning_rate": 0.00045979231439957966, "loss": 6.1551, "mean_token_accuracy": 0.14059658572077752, "num_tokens": 40836699.0, "step": 18865 }, { "entropy": 6.514246606826783, "epoch": 2.0192626678795014, "grad_norm": 1.375, "learning_rate": 0.0004597704996868893, "loss": 6.1423, "mean_token_accuracy": 0.13985197693109513, "num_tokens": 40846736.0, "step": 18870 }, { "entropy": 6.526371955871582, "epoch": 2.019797741987265, "grad_norm": 1.5234375, "learning_rate": 0.0004597486796389766, "loss": 6.2235, "mean_token_accuracy": 0.1408810056746006, "num_tokens": 40858362.0, "step": 18875 }, { "entropy": 6.4865038871765135, "epoch": 2.020332816095029, "grad_norm": 1.4453125, "learning_rate": 0.00045972685425647186, "loss": 6.1446, "mean_token_accuracy": 0.14298768937587739, "num_tokens": 40869346.0, "step": 18880 }, { "entropy": 6.561742973327637, "epoch": 2.0208678902027932, "grad_norm": 1.3359375, "learning_rate": 0.0004597050235400051, "loss": 6.2191, "mean_token_accuracy": 0.1398242346942425, "num_tokens": 40880003.0, "step": 18885 }, { "entropy": 6.561382007598877, "epoch": 2.021402964310557, "grad_norm": 1.390625, "learning_rate": 0.00045968318749020675, "loss": 6.1449, "mean_token_accuracy": 0.14093911722302438, "num_tokens": 40891515.0, "step": 18890 }, { "entropy": 6.505699968338012, "epoch": 2.021938038418321, "grad_norm": 1.484375, "learning_rate": 0.0004596613461077073, "loss": 6.119, "mean_token_accuracy": 0.14346395581960678, "num_tokens": 40902024.0, "step": 18895 }, { "entropy": 6.468415212631226, "epoch": 2.022473112526085, "grad_norm": 1.5703125, "learning_rate": 0.00045963949939313754, "loss": 6.1127, "mean_token_accuracy": 0.14756014198064804, "num_tokens": 40912160.0, "step": 18900 }, { "entropy": 6.537594604492187, "epoch": 2.0230081866338487, "grad_norm": 1.2578125, "learning_rate": 0.000459617647347128, "loss": 6.1783, "mean_token_accuracy": 0.13268757611513138, "num_tokens": 40922516.0, "step": 18905 }, { "entropy": 6.5097065448760985, "epoch": 2.023543260741613, "grad_norm": 1.3984375, "learning_rate": 0.00045959578997031, "loss": 6.1772, "mean_token_accuracy": 0.136392692476511, "num_tokens": 40934148.0, "step": 18910 }, { "entropy": 6.559519243240357, "epoch": 2.0240783348493765, "grad_norm": 1.34375, "learning_rate": 0.00045957392726331443, "loss": 6.1026, "mean_token_accuracy": 0.14509733468294145, "num_tokens": 40944409.0, "step": 18915 }, { "entropy": 6.488625955581665, "epoch": 2.0246134089571406, "grad_norm": 1.828125, "learning_rate": 0.00045955205922677264, "loss": 6.1715, "mean_token_accuracy": 0.14190514534711837, "num_tokens": 40955133.0, "step": 18920 }, { "entropy": 6.518922281265259, "epoch": 2.0251484830649047, "grad_norm": 1.3671875, "learning_rate": 0.0004595301858613161, "loss": 6.2323, "mean_token_accuracy": 0.1429607316851616, "num_tokens": 40965508.0, "step": 18925 }, { "entropy": 6.571975135803223, "epoch": 2.0256835571726683, "grad_norm": 1.7265625, "learning_rate": 0.0004595083071675763, "loss": 6.2005, "mean_token_accuracy": 0.14501149132847785, "num_tokens": 40975931.0, "step": 18930 }, { "entropy": 6.506203508377075, "epoch": 2.0262186312804324, "grad_norm": 1.265625, "learning_rate": 0.00045948642314618514, "loss": 6.1573, "mean_token_accuracy": 0.14204735904932023, "num_tokens": 40985797.0, "step": 18935 }, { "entropy": 6.4477344989776615, "epoch": 2.026753705388196, "grad_norm": 1.359375, "learning_rate": 0.0004594645337977744, "loss": 6.1597, "mean_token_accuracy": 0.13660738468170167, "num_tokens": 40996501.0, "step": 18940 }, { "entropy": 6.477477931976319, "epoch": 2.02728877949596, "grad_norm": 1.5078125, "learning_rate": 0.0004594426391229762, "loss": 6.1236, "mean_token_accuracy": 0.1394515760242939, "num_tokens": 41005970.0, "step": 18945 }, { "entropy": 6.501707649230957, "epoch": 2.0278238536037243, "grad_norm": 1.703125, "learning_rate": 0.0004594207391224227, "loss": 6.1081, "mean_token_accuracy": 0.14223191663622856, "num_tokens": 41017208.0, "step": 18950 }, { "entropy": 6.586483001708984, "epoch": 2.028358927711488, "grad_norm": 1.59375, "learning_rate": 0.00045939883379674624, "loss": 6.2729, "mean_token_accuracy": 0.13285416290163993, "num_tokens": 41028435.0, "step": 18955 }, { "entropy": 6.510217237472534, "epoch": 2.028894001819252, "grad_norm": 1.53125, "learning_rate": 0.00045937692314657936, "loss": 6.1292, "mean_token_accuracy": 0.14351291060447693, "num_tokens": 41039256.0, "step": 18960 }, { "entropy": 6.439512014389038, "epoch": 2.0294290759270157, "grad_norm": 1.484375, "learning_rate": 0.0004593550071725548, "loss": 6.1381, "mean_token_accuracy": 0.1356598161160946, "num_tokens": 41050527.0, "step": 18965 }, { "entropy": 6.497146797180176, "epoch": 2.02996415003478, "grad_norm": 1.2734375, "learning_rate": 0.00045933308587530527, "loss": 6.1727, "mean_token_accuracy": 0.1396307997405529, "num_tokens": 41062259.0, "step": 18970 }, { "entropy": 6.493076324462891, "epoch": 2.030499224142544, "grad_norm": 1.4609375, "learning_rate": 0.0004593111592554638, "loss": 6.192, "mean_token_accuracy": 0.1417892321944237, "num_tokens": 41073011.0, "step": 18975 }, { "entropy": 6.4537712097167965, "epoch": 2.0310342982503076, "grad_norm": 1.4609375, "learning_rate": 0.0004592892273136635, "loss": 6.056, "mean_token_accuracy": 0.1453937515616417, "num_tokens": 41083482.0, "step": 18980 }, { "entropy": 6.476549673080444, "epoch": 2.0315693723580717, "grad_norm": 1.6484375, "learning_rate": 0.00045926729005053764, "loss": 6.1275, "mean_token_accuracy": 0.14689192473888396, "num_tokens": 41094028.0, "step": 18985 }, { "entropy": 6.480548477172851, "epoch": 2.0321044464658353, "grad_norm": 1.1328125, "learning_rate": 0.0004592453474667197, "loss": 6.11, "mean_token_accuracy": 0.14326013177633284, "num_tokens": 41106346.0, "step": 18990 }, { "entropy": 6.558454704284668, "epoch": 2.0326395205735994, "grad_norm": 1.328125, "learning_rate": 0.0004592233995628432, "loss": 6.0493, "mean_token_accuracy": 0.1450323536992073, "num_tokens": 41116130.0, "step": 18995 }, { "entropy": 6.436607503890992, "epoch": 2.0331745946813635, "grad_norm": 1.21875, "learning_rate": 0.000459201446339542, "loss": 6.0923, "mean_token_accuracy": 0.14622003808617592, "num_tokens": 41127103.0, "step": 19000 }, { "entropy": 6.416644954681397, "epoch": 2.033709668789127, "grad_norm": 1.2578125, "learning_rate": 0.0004591794877974499, "loss": 6.1282, "mean_token_accuracy": 0.13969530984759332, "num_tokens": 41138258.0, "step": 19005 }, { "entropy": 6.532529830932617, "epoch": 2.0342447428968913, "grad_norm": 1.4609375, "learning_rate": 0.00045915752393720094, "loss": 6.1633, "mean_token_accuracy": 0.1450706236064434, "num_tokens": 41148859.0, "step": 19010 }, { "entropy": 6.496345806121826, "epoch": 2.034779817004655, "grad_norm": 1.6875, "learning_rate": 0.00045913555475942937, "loss": 6.0614, "mean_token_accuracy": 0.1406131975352764, "num_tokens": 41158614.0, "step": 19015 }, { "entropy": 6.461399221420288, "epoch": 2.035314891112419, "grad_norm": 1.421875, "learning_rate": 0.0004591135802647695, "loss": 6.1302, "mean_token_accuracy": 0.1487656131386757, "num_tokens": 41170215.0, "step": 19020 }, { "entropy": 6.5223548412323, "epoch": 2.035849965220183, "grad_norm": 1.75, "learning_rate": 0.0004590916004538559, "loss": 6.1303, "mean_token_accuracy": 0.14125470146536828, "num_tokens": 41180784.0, "step": 19025 }, { "entropy": 6.528457736968994, "epoch": 2.036385039327947, "grad_norm": 1.5234375, "learning_rate": 0.00045906961532732316, "loss": 6.1562, "mean_token_accuracy": 0.1360959529876709, "num_tokens": 41191305.0, "step": 19030 }, { "entropy": 6.501538276672363, "epoch": 2.036920113435711, "grad_norm": 1.5859375, "learning_rate": 0.0004590476248858062, "loss": 6.1764, "mean_token_accuracy": 0.14044924229383468, "num_tokens": 41202388.0, "step": 19035 }, { "entropy": 6.460980367660523, "epoch": 2.037455187543475, "grad_norm": 1.7578125, "learning_rate": 0.0004590256291299399, "loss": 6.1173, "mean_token_accuracy": 0.14525325298309327, "num_tokens": 41212136.0, "step": 19040 }, { "entropy": 6.458244180679321, "epoch": 2.0379902616512386, "grad_norm": 1.9765625, "learning_rate": 0.00045900362806035945, "loss": 6.1674, "mean_token_accuracy": 0.1392577327787876, "num_tokens": 41223390.0, "step": 19045 }, { "entropy": 6.487509679794312, "epoch": 2.0385253357590027, "grad_norm": 1.6171875, "learning_rate": 0.00045898162167770006, "loss": 6.193, "mean_token_accuracy": 0.14385589063167573, "num_tokens": 41234775.0, "step": 19050 }, { "entropy": 6.516320753097534, "epoch": 2.0390604098667664, "grad_norm": 1.578125, "learning_rate": 0.0004589596099825973, "loss": 6.1062, "mean_token_accuracy": 0.1417277753353119, "num_tokens": 41245627.0, "step": 19055 }, { "entropy": 6.480148649215698, "epoch": 2.0395954839745305, "grad_norm": 2.171875, "learning_rate": 0.00045893759297568654, "loss": 6.1623, "mean_token_accuracy": 0.1406472384929657, "num_tokens": 41255441.0, "step": 19060 }, { "entropy": 6.369239854812622, "epoch": 2.0401305580822946, "grad_norm": 1.34375, "learning_rate": 0.0004589155706576036, "loss": 6.099, "mean_token_accuracy": 0.1408141165971756, "num_tokens": 41268686.0, "step": 19065 }, { "entropy": 6.583061981201172, "epoch": 2.0406656321900583, "grad_norm": 1.53125, "learning_rate": 0.00045889354302898445, "loss": 6.214, "mean_token_accuracy": 0.13442379906773566, "num_tokens": 41279384.0, "step": 19070 }, { "entropy": 6.608145332336425, "epoch": 2.0412007062978224, "grad_norm": 1.3515625, "learning_rate": 0.0004588715100904651, "loss": 6.1942, "mean_token_accuracy": 0.1354267381131649, "num_tokens": 41289923.0, "step": 19075 }, { "entropy": 6.458296060562134, "epoch": 2.041735780405586, "grad_norm": 1.71875, "learning_rate": 0.0004588494718426818, "loss": 6.1293, "mean_token_accuracy": 0.14421897679567336, "num_tokens": 41300486.0, "step": 19080 }, { "entropy": 6.401919412612915, "epoch": 2.04227085451335, "grad_norm": 1.578125, "learning_rate": 0.0004588274282862708, "loss": 6.1183, "mean_token_accuracy": 0.14360963180661201, "num_tokens": 41310507.0, "step": 19085 }, { "entropy": 6.4948516368865965, "epoch": 2.042805928621114, "grad_norm": 2.03125, "learning_rate": 0.00045880537942186855, "loss": 6.1519, "mean_token_accuracy": 0.1460525207221508, "num_tokens": 41321284.0, "step": 19090 }, { "entropy": 6.479793310165405, "epoch": 2.043341002728878, "grad_norm": 1.7265625, "learning_rate": 0.0004587833252501118, "loss": 6.0749, "mean_token_accuracy": 0.14869818538427354, "num_tokens": 41332037.0, "step": 19095 }, { "entropy": 6.436644220352173, "epoch": 2.043876076836642, "grad_norm": 1.421875, "learning_rate": 0.0004587612657716374, "loss": 6.1525, "mean_token_accuracy": 0.1404256284236908, "num_tokens": 41343480.0, "step": 19100 }, { "entropy": 6.514421033859253, "epoch": 2.0444111509444056, "grad_norm": 1.4140625, "learning_rate": 0.0004587392009870824, "loss": 6.1915, "mean_token_accuracy": 0.13664307445287704, "num_tokens": 41353656.0, "step": 19105 }, { "entropy": 6.488293075561524, "epoch": 2.0449462250521697, "grad_norm": 1.5, "learning_rate": 0.0004587171308970836, "loss": 6.1317, "mean_token_accuracy": 0.14327220767736434, "num_tokens": 41363640.0, "step": 19110 }, { "entropy": 6.492086029052734, "epoch": 2.045481299159934, "grad_norm": 1.3984375, "learning_rate": 0.00045869505550227857, "loss": 6.1687, "mean_token_accuracy": 0.13604222983121872, "num_tokens": 41374194.0, "step": 19115 }, { "entropy": 6.451062726974487, "epoch": 2.0460163732676975, "grad_norm": 1.3359375, "learning_rate": 0.0004586729748033046, "loss": 6.1238, "mean_token_accuracy": 0.14803083389997482, "num_tokens": 41384968.0, "step": 19120 }, { "entropy": 6.469352102279663, "epoch": 2.0465514473754616, "grad_norm": 2.34375, "learning_rate": 0.00045865088880079924, "loss": 6.0258, "mean_token_accuracy": 0.14876729846000672, "num_tokens": 41395117.0, "step": 19125 }, { "entropy": 6.5053938865661625, "epoch": 2.0470865214832252, "grad_norm": 1.2109375, "learning_rate": 0.0004586287974954004, "loss": 6.1412, "mean_token_accuracy": 0.14110405296087264, "num_tokens": 41406366.0, "step": 19130 }, { "entropy": 6.5320250511169435, "epoch": 2.0476215955909893, "grad_norm": 1.5390625, "learning_rate": 0.0004586067008877457, "loss": 6.1342, "mean_token_accuracy": 0.1459088757634163, "num_tokens": 41417388.0, "step": 19135 }, { "entropy": 6.4374086380004885, "epoch": 2.0481566696987534, "grad_norm": 1.453125, "learning_rate": 0.0004585845989784734, "loss": 6.0949, "mean_token_accuracy": 0.14255037009716034, "num_tokens": 41428085.0, "step": 19140 }, { "entropy": 6.516263008117676, "epoch": 2.048691743806517, "grad_norm": 1.2578125, "learning_rate": 0.00045856249176822155, "loss": 6.194, "mean_token_accuracy": 0.134604249894619, "num_tokens": 41439117.0, "step": 19145 }, { "entropy": 6.499457502365113, "epoch": 2.049226817914281, "grad_norm": 1.2265625, "learning_rate": 0.00045854037925762857, "loss": 6.1752, "mean_token_accuracy": 0.1368185169994831, "num_tokens": 41450042.0, "step": 19150 }, { "entropy": 6.46821665763855, "epoch": 2.049761892022045, "grad_norm": 1.4609375, "learning_rate": 0.00045851826144733296, "loss": 6.0794, "mean_token_accuracy": 0.15025001615285874, "num_tokens": 41460554.0, "step": 19155 }, { "entropy": 6.5151244640350345, "epoch": 2.050296966129809, "grad_norm": 1.7421875, "learning_rate": 0.00045849613833797326, "loss": 6.1735, "mean_token_accuracy": 0.14511755853891373, "num_tokens": 41471403.0, "step": 19160 }, { "entropy": 6.462577676773071, "epoch": 2.050832040237573, "grad_norm": 1.484375, "learning_rate": 0.00045847400993018835, "loss": 6.1478, "mean_token_accuracy": 0.13789881393313408, "num_tokens": 41482098.0, "step": 19165 }, { "entropy": 6.476891613006591, "epoch": 2.0513671143453367, "grad_norm": 1.671875, "learning_rate": 0.00045845187622461724, "loss": 6.14, "mean_token_accuracy": 0.14094822630286216, "num_tokens": 41493126.0, "step": 19170 }, { "entropy": 6.570120620727539, "epoch": 2.051902188453101, "grad_norm": 1.765625, "learning_rate": 0.000458429737221899, "loss": 6.2465, "mean_token_accuracy": 0.13628095909953117, "num_tokens": 41504242.0, "step": 19175 }, { "entropy": 6.4928771495819095, "epoch": 2.052437262560865, "grad_norm": 1.421875, "learning_rate": 0.0004584075929226728, "loss": 6.1236, "mean_token_accuracy": 0.14559295326471328, "num_tokens": 41515368.0, "step": 19180 }, { "entropy": 6.474678325653076, "epoch": 2.0529723366686286, "grad_norm": 1.5, "learning_rate": 0.0004583854433275782, "loss": 6.1557, "mean_token_accuracy": 0.1395520031452179, "num_tokens": 41525939.0, "step": 19185 }, { "entropy": 6.467396020889282, "epoch": 2.0535074107763926, "grad_norm": 1.6796875, "learning_rate": 0.00045836328843725465, "loss": 6.1785, "mean_token_accuracy": 0.14105122685432434, "num_tokens": 41536505.0, "step": 19190 }, { "entropy": 6.464931392669678, "epoch": 2.0540424848841563, "grad_norm": 1.296875, "learning_rate": 0.00045834112825234193, "loss": 6.1008, "mean_token_accuracy": 0.14669242650270461, "num_tokens": 41546293.0, "step": 19195 }, { "entropy": 6.471874475479126, "epoch": 2.0545775589919204, "grad_norm": 1.671875, "learning_rate": 0.00045831896277347985, "loss": 6.1223, "mean_token_accuracy": 0.14656351059675216, "num_tokens": 41556596.0, "step": 19200 }, { "entropy": 6.509445333480835, "epoch": 2.0551126330996845, "grad_norm": 1.296875, "learning_rate": 0.0004582967920013085, "loss": 6.1636, "mean_token_accuracy": 0.14745448306202888, "num_tokens": 41566732.0, "step": 19205 }, { "entropy": 6.532517051696777, "epoch": 2.055647707207448, "grad_norm": 1.3359375, "learning_rate": 0.00045827461593646806, "loss": 6.1857, "mean_token_accuracy": 0.13695996776223182, "num_tokens": 41577777.0, "step": 19210 }, { "entropy": 6.489979219436646, "epoch": 2.0561827813152123, "grad_norm": 1.5078125, "learning_rate": 0.0004582524345795989, "loss": 6.1474, "mean_token_accuracy": 0.14347779750823975, "num_tokens": 41587978.0, "step": 19215 }, { "entropy": 6.4816924095153805, "epoch": 2.056717855422976, "grad_norm": 1.3125, "learning_rate": 0.0004582302479313413, "loss": 6.1105, "mean_token_accuracy": 0.14375540167093276, "num_tokens": 41598977.0, "step": 19220 }, { "entropy": 6.502046680450439, "epoch": 2.05725292953074, "grad_norm": 1.515625, "learning_rate": 0.0004582080559923362, "loss": 6.154, "mean_token_accuracy": 0.13674740493297577, "num_tokens": 41609664.0, "step": 19225 }, { "entropy": 6.478590059280395, "epoch": 2.057788003638504, "grad_norm": 1.8828125, "learning_rate": 0.0004581858587632241, "loss": 6.1502, "mean_token_accuracy": 0.13895293027162553, "num_tokens": 41619427.0, "step": 19230 }, { "entropy": 6.472123718261718, "epoch": 2.0583230777462678, "grad_norm": 1.421875, "learning_rate": 0.0004581636562446461, "loss": 6.1411, "mean_token_accuracy": 0.1371616877615452, "num_tokens": 41629551.0, "step": 19235 }, { "entropy": 6.447014617919922, "epoch": 2.058858151854032, "grad_norm": 1.5859375, "learning_rate": 0.0004581414484372433, "loss": 6.1476, "mean_token_accuracy": 0.13804002851247787, "num_tokens": 41640183.0, "step": 19240 }, { "entropy": 6.43388876914978, "epoch": 2.0593932259617955, "grad_norm": 1.671875, "learning_rate": 0.0004581192353416569, "loss": 6.1404, "mean_token_accuracy": 0.14709998071193695, "num_tokens": 41651934.0, "step": 19245 }, { "entropy": 6.3898547172546385, "epoch": 2.0599283000695596, "grad_norm": 1.625, "learning_rate": 0.0004580970169585283, "loss": 6.0314, "mean_token_accuracy": 0.16168030798435212, "num_tokens": 41662418.0, "step": 19250 }, { "entropy": 6.408938789367676, "epoch": 2.0604633741773237, "grad_norm": 1.53125, "learning_rate": 0.00045807479328849906, "loss": 6.0462, "mean_token_accuracy": 0.14857290759682656, "num_tokens": 41673419.0, "step": 19255 }, { "entropy": 6.431122779846191, "epoch": 2.0609984482850874, "grad_norm": 1.3828125, "learning_rate": 0.00045805256433221087, "loss": 6.0671, "mean_token_accuracy": 0.1496027022600174, "num_tokens": 41684132.0, "step": 19260 }, { "entropy": 6.518172025680542, "epoch": 2.0615335223928515, "grad_norm": 1.4453125, "learning_rate": 0.0004580303300903056, "loss": 6.1558, "mean_token_accuracy": 0.1433491162955761, "num_tokens": 41695051.0, "step": 19265 }, { "entropy": 6.5380795955657955, "epoch": 2.062068596500615, "grad_norm": 2.203125, "learning_rate": 0.00045800809056342534, "loss": 6.1785, "mean_token_accuracy": 0.14187479242682458, "num_tokens": 41705986.0, "step": 19270 }, { "entropy": 6.489912509918213, "epoch": 2.0626036706083792, "grad_norm": 1.5625, "learning_rate": 0.00045798584575221213, "loss": 6.1659, "mean_token_accuracy": 0.13931995928287505, "num_tokens": 41717082.0, "step": 19275 }, { "entropy": 6.504186391830444, "epoch": 2.0631387447161433, "grad_norm": 1.7109375, "learning_rate": 0.0004579635956573084, "loss": 6.1781, "mean_token_accuracy": 0.1459621638059616, "num_tokens": 41728783.0, "step": 19280 }, { "entropy": 6.49009895324707, "epoch": 2.063673818823907, "grad_norm": 2.765625, "learning_rate": 0.00045794134027935646, "loss": 6.1654, "mean_token_accuracy": 0.14074748381972313, "num_tokens": 41740452.0, "step": 19285 }, { "entropy": 6.5198619842529295, "epoch": 2.064208892931671, "grad_norm": 1.4453125, "learning_rate": 0.0004579190796189991, "loss": 6.0982, "mean_token_accuracy": 0.1458289071917534, "num_tokens": 41750966.0, "step": 19290 }, { "entropy": 6.50558614730835, "epoch": 2.064743967039435, "grad_norm": 1.4140625, "learning_rate": 0.000457896813676879, "loss": 6.0919, "mean_token_accuracy": 0.144083159416914, "num_tokens": 41762174.0, "step": 19295 }, { "entropy": 6.455884265899658, "epoch": 2.065279041147199, "grad_norm": 1.3359375, "learning_rate": 0.00045787454245363907, "loss": 6.2008, "mean_token_accuracy": 0.13619274497032166, "num_tokens": 41773396.0, "step": 19300 }, { "entropy": 6.48363618850708, "epoch": 2.065814115254963, "grad_norm": 1.6015625, "learning_rate": 0.0004578522659499225, "loss": 6.1524, "mean_token_accuracy": 0.14194218069314957, "num_tokens": 41783833.0, "step": 19305 }, { "entropy": 6.466428661346436, "epoch": 2.0663491893627266, "grad_norm": 1.6015625, "learning_rate": 0.00045782998416637235, "loss": 6.1288, "mean_token_accuracy": 0.15198036134243012, "num_tokens": 41795363.0, "step": 19310 }, { "entropy": 6.538760805130005, "epoch": 2.0668842634704907, "grad_norm": 1.7578125, "learning_rate": 0.0004578076971036321, "loss": 6.1661, "mean_token_accuracy": 0.14131421819329262, "num_tokens": 41807575.0, "step": 19315 }, { "entropy": 6.3735511302948, "epoch": 2.067419337578255, "grad_norm": 1.4453125, "learning_rate": 0.0004577854047623454, "loss": 6.078, "mean_token_accuracy": 0.14580662548542023, "num_tokens": 41818496.0, "step": 19320 }, { "entropy": 6.499590063095093, "epoch": 2.0679544116860185, "grad_norm": 1.3203125, "learning_rate": 0.0004577631071431557, "loss": 6.1095, "mean_token_accuracy": 0.14684664011001586, "num_tokens": 41829106.0, "step": 19325 }, { "entropy": 6.45405125617981, "epoch": 2.0684894857937826, "grad_norm": 1.609375, "learning_rate": 0.00045774080424670704, "loss": 6.0955, "mean_token_accuracy": 0.14979782924056054, "num_tokens": 41838095.0, "step": 19330 }, { "entropy": 6.437284278869629, "epoch": 2.069024559901546, "grad_norm": 1.4609375, "learning_rate": 0.0004577184960736433, "loss": 6.1256, "mean_token_accuracy": 0.1353687562048435, "num_tokens": 41847980.0, "step": 19335 }, { "entropy": 6.553657579421997, "epoch": 2.0695596340093103, "grad_norm": 1.3359375, "learning_rate": 0.00045769618262460864, "loss": 6.1508, "mean_token_accuracy": 0.1402767464518547, "num_tokens": 41858625.0, "step": 19340 }, { "entropy": 6.507570505142212, "epoch": 2.0700947081170744, "grad_norm": 1.5703125, "learning_rate": 0.0004576738639002475, "loss": 6.1396, "mean_token_accuracy": 0.13780880868434905, "num_tokens": 41870939.0, "step": 19345 }, { "entropy": 6.5192183494567875, "epoch": 2.070629782224838, "grad_norm": 2.34375, "learning_rate": 0.0004576515399012041, "loss": 6.206, "mean_token_accuracy": 0.140149012953043, "num_tokens": 41882356.0, "step": 19350 }, { "entropy": 6.491689586639405, "epoch": 2.071164856332602, "grad_norm": 1.2890625, "learning_rate": 0.0004576292106281231, "loss": 6.1615, "mean_token_accuracy": 0.1387277662754059, "num_tokens": 41892306.0, "step": 19355 }, { "entropy": 6.512281131744385, "epoch": 2.071699930440366, "grad_norm": 1.625, "learning_rate": 0.00045760687608164933, "loss": 6.2056, "mean_token_accuracy": 0.13818393498659134, "num_tokens": 41902450.0, "step": 19360 }, { "entropy": 6.48457088470459, "epoch": 2.07223500454813, "grad_norm": 1.328125, "learning_rate": 0.0004575845362624278, "loss": 6.1249, "mean_token_accuracy": 0.1443415492773056, "num_tokens": 41913319.0, "step": 19365 }, { "entropy": 6.522418546676636, "epoch": 2.072770078655894, "grad_norm": 1.390625, "learning_rate": 0.00045756219117110337, "loss": 6.1643, "mean_token_accuracy": 0.14059045165777206, "num_tokens": 41923598.0, "step": 19370 }, { "entropy": 6.542702007293701, "epoch": 2.0733051527636577, "grad_norm": 1.4140625, "learning_rate": 0.00045753984080832127, "loss": 6.1426, "mean_token_accuracy": 0.1389916017651558, "num_tokens": 41934482.0, "step": 19375 }, { "entropy": 6.51252179145813, "epoch": 2.0738402268714218, "grad_norm": 1.5, "learning_rate": 0.000457517485174727, "loss": 6.1116, "mean_token_accuracy": 0.13963203877210617, "num_tokens": 41945994.0, "step": 19380 }, { "entropy": 6.4817948818206785, "epoch": 2.0743753009791854, "grad_norm": 1.3125, "learning_rate": 0.00045749512427096595, "loss": 6.1511, "mean_token_accuracy": 0.13679138645529748, "num_tokens": 41956564.0, "step": 19385 }, { "entropy": 6.440240144729614, "epoch": 2.0749103750869495, "grad_norm": 1.328125, "learning_rate": 0.00045747275809768386, "loss": 6.1358, "mean_token_accuracy": 0.14567358940839767, "num_tokens": 41966847.0, "step": 19390 }, { "entropy": 6.506151437759399, "epoch": 2.0754454491947136, "grad_norm": 1.2578125, "learning_rate": 0.0004574503866555265, "loss": 6.2249, "mean_token_accuracy": 0.1337882809340954, "num_tokens": 41977752.0, "step": 19395 }, { "entropy": 6.516854572296142, "epoch": 2.0759805233024773, "grad_norm": 1.21875, "learning_rate": 0.00045742800994513983, "loss": 6.1457, "mean_token_accuracy": 0.14443642646074295, "num_tokens": 41987837.0, "step": 19400 }, { "entropy": 6.52735481262207, "epoch": 2.0765155974102414, "grad_norm": 1.7421875, "learning_rate": 0.00045740562796717005, "loss": 6.152, "mean_token_accuracy": 0.13824782595038415, "num_tokens": 41997988.0, "step": 19405 }, { "entropy": 6.381102895736694, "epoch": 2.077050671518005, "grad_norm": 1.4765625, "learning_rate": 0.0004573832407222634, "loss": 6.0649, "mean_token_accuracy": 0.14729070663452148, "num_tokens": 42009643.0, "step": 19410 }, { "entropy": 6.475057315826416, "epoch": 2.077585745625769, "grad_norm": 1.3984375, "learning_rate": 0.0004573608482110663, "loss": 6.1287, "mean_token_accuracy": 0.13999679908156396, "num_tokens": 42019972.0, "step": 19415 }, { "entropy": 6.497097396850586, "epoch": 2.0781208197335332, "grad_norm": 1.2109375, "learning_rate": 0.00045733845043422535, "loss": 6.1293, "mean_token_accuracy": 0.14451572746038438, "num_tokens": 42030536.0, "step": 19420 }, { "entropy": 6.529263639450074, "epoch": 2.078655893841297, "grad_norm": 1.265625, "learning_rate": 0.0004573160473923872, "loss": 6.1129, "mean_token_accuracy": 0.1403690680861473, "num_tokens": 42041217.0, "step": 19425 }, { "entropy": 6.36537127494812, "epoch": 2.079190967949061, "grad_norm": 1.53125, "learning_rate": 0.0004572936390861988, "loss": 6.0204, "mean_token_accuracy": 0.14835600107908248, "num_tokens": 42051346.0, "step": 19430 }, { "entropy": 6.546513509750366, "epoch": 2.0797260420568247, "grad_norm": 1.59375, "learning_rate": 0.0004572712255163072, "loss": 6.2135, "mean_token_accuracy": 0.13938311040401458, "num_tokens": 42062718.0, "step": 19435 }, { "entropy": 6.524495077133179, "epoch": 2.0802611161645888, "grad_norm": 1.28125, "learning_rate": 0.0004572488066833596, "loss": 6.1332, "mean_token_accuracy": 0.1377783089876175, "num_tokens": 42073587.0, "step": 19440 }, { "entropy": 6.5476109981536865, "epoch": 2.080796190272353, "grad_norm": 1.3359375, "learning_rate": 0.00045722638258800335, "loss": 6.1524, "mean_token_accuracy": 0.14769052118062972, "num_tokens": 42083763.0, "step": 19445 }, { "entropy": 6.429262590408325, "epoch": 2.0813312643801165, "grad_norm": 1.4375, "learning_rate": 0.0004572039532308858, "loss": 6.0734, "mean_token_accuracy": 0.14719380512833596, "num_tokens": 42094062.0, "step": 19450 }, { "entropy": 6.463222217559815, "epoch": 2.0818663384878806, "grad_norm": 1.3671875, "learning_rate": 0.0004571815186126549, "loss": 6.16, "mean_token_accuracy": 0.13777271136641503, "num_tokens": 42106136.0, "step": 19455 }, { "entropy": 6.483076667785644, "epoch": 2.0824014125956447, "grad_norm": 1.7265625, "learning_rate": 0.00045715907873395805, "loss": 6.1578, "mean_token_accuracy": 0.13568266183137895, "num_tokens": 42116309.0, "step": 19460 }, { "entropy": 6.462263345718384, "epoch": 2.0829364867034084, "grad_norm": 1.3984375, "learning_rate": 0.0004571366335954435, "loss": 6.1484, "mean_token_accuracy": 0.14241429641842843, "num_tokens": 42127747.0, "step": 19465 }, { "entropy": 6.429238605499267, "epoch": 2.0834715608111725, "grad_norm": 1.515625, "learning_rate": 0.0004571141831977592, "loss": 6.0754, "mean_token_accuracy": 0.15075682997703552, "num_tokens": 42137992.0, "step": 19470 }, { "entropy": 6.457944917678833, "epoch": 2.084006634918936, "grad_norm": 1.4140625, "learning_rate": 0.0004570917275415535, "loss": 6.0855, "mean_token_accuracy": 0.14265020191669464, "num_tokens": 42148833.0, "step": 19475 }, { "entropy": 6.44670033454895, "epoch": 2.0845417090267, "grad_norm": 2.03125, "learning_rate": 0.0004570692666274747, "loss": 6.1596, "mean_token_accuracy": 0.14300988093018532, "num_tokens": 42159276.0, "step": 19480 }, { "entropy": 6.566137170791626, "epoch": 2.0850767831344643, "grad_norm": 1.8203125, "learning_rate": 0.0004570468004561715, "loss": 6.2044, "mean_token_accuracy": 0.14038451686501502, "num_tokens": 42171541.0, "step": 19485 }, { "entropy": 6.4842836380004885, "epoch": 2.085611857242228, "grad_norm": 1.421875, "learning_rate": 0.00045702432902829245, "loss": 6.1543, "mean_token_accuracy": 0.14726416394114494, "num_tokens": 42182888.0, "step": 19490 }, { "entropy": 6.458319664001465, "epoch": 2.086146931349992, "grad_norm": 1.4296875, "learning_rate": 0.0004570018523444865, "loss": 6.0786, "mean_token_accuracy": 0.152434304356575, "num_tokens": 42193405.0, "step": 19495 }, { "entropy": 6.482660341262817, "epoch": 2.0866820054577557, "grad_norm": 1.4296875, "learning_rate": 0.00045697937040540263, "loss": 6.0982, "mean_token_accuracy": 0.1448497325181961, "num_tokens": 42203355.0, "step": 19500 }, { "entropy": 6.451343965530396, "epoch": 2.08721707956552, "grad_norm": 1.390625, "learning_rate": 0.00045695688321169, "loss": 6.1103, "mean_token_accuracy": 0.13565196245908737, "num_tokens": 42213191.0, "step": 19505 }, { "entropy": 6.488658666610718, "epoch": 2.087752153673284, "grad_norm": 1.53125, "learning_rate": 0.00045693439076399797, "loss": 6.2014, "mean_token_accuracy": 0.13889316320419312, "num_tokens": 42223357.0, "step": 19510 }, { "entropy": 6.521796703338623, "epoch": 2.0882872277810476, "grad_norm": 1.484375, "learning_rate": 0.00045691189306297595, "loss": 6.1086, "mean_token_accuracy": 0.14505178332328797, "num_tokens": 42234917.0, "step": 19515 }, { "entropy": 6.564554977416992, "epoch": 2.0888223018888117, "grad_norm": 1.453125, "learning_rate": 0.00045688939010927353, "loss": 6.1679, "mean_token_accuracy": 0.1397237330675125, "num_tokens": 42245977.0, "step": 19520 }, { "entropy": 6.475429058074951, "epoch": 2.0893573759965753, "grad_norm": 1.5390625, "learning_rate": 0.0004568668819035406, "loss": 6.1243, "mean_token_accuracy": 0.1414799951016903, "num_tokens": 42257523.0, "step": 19525 }, { "entropy": 6.570040369033814, "epoch": 2.0898924501043394, "grad_norm": 1.6015625, "learning_rate": 0.00045684436844642694, "loss": 6.1557, "mean_token_accuracy": 0.14639808982610703, "num_tokens": 42267727.0, "step": 19530 }, { "entropy": 6.544137954711914, "epoch": 2.0904275242121035, "grad_norm": 1.7734375, "learning_rate": 0.0004568218497385828, "loss": 6.1275, "mean_token_accuracy": 0.1419399283826351, "num_tokens": 42278201.0, "step": 19535 }, { "entropy": 6.477737379074097, "epoch": 2.090962598319867, "grad_norm": 1.5390625, "learning_rate": 0.0004567993257806582, "loss": 6.2222, "mean_token_accuracy": 0.13735170289874077, "num_tokens": 42288695.0, "step": 19540 }, { "entropy": 6.477229118347168, "epoch": 2.0914976724276313, "grad_norm": 1.3828125, "learning_rate": 0.0004567767965733036, "loss": 6.2077, "mean_token_accuracy": 0.1436895728111267, "num_tokens": 42299418.0, "step": 19545 }, { "entropy": 6.500970315933228, "epoch": 2.092032746535395, "grad_norm": 1.5625, "learning_rate": 0.00045675426211716963, "loss": 6.0765, "mean_token_accuracy": 0.14467365369200708, "num_tokens": 42310901.0, "step": 19550 }, { "entropy": 6.553741312026977, "epoch": 2.092567820643159, "grad_norm": 1.296875, "learning_rate": 0.0004567317224129069, "loss": 6.0842, "mean_token_accuracy": 0.14897666946053506, "num_tokens": 42320055.0, "step": 19555 }, { "entropy": 6.481790685653687, "epoch": 2.093102894750923, "grad_norm": 1.359375, "learning_rate": 0.0004567091774611661, "loss": 6.2306, "mean_token_accuracy": 0.13946203663945198, "num_tokens": 42330393.0, "step": 19560 }, { "entropy": 6.40696496963501, "epoch": 2.093637968858687, "grad_norm": 1.515625, "learning_rate": 0.00045668662726259846, "loss": 6.1194, "mean_token_accuracy": 0.14474439173936843, "num_tokens": 42341384.0, "step": 19565 }, { "entropy": 6.495103406906128, "epoch": 2.094173042966451, "grad_norm": 1.5703125, "learning_rate": 0.00045666407181785496, "loss": 6.059, "mean_token_accuracy": 0.1518527738749981, "num_tokens": 42352351.0, "step": 19570 }, { "entropy": 6.419457292556762, "epoch": 2.094708117074215, "grad_norm": 1.8515625, "learning_rate": 0.0004566415111275869, "loss": 6.0675, "mean_token_accuracy": 0.14589630886912347, "num_tokens": 42363912.0, "step": 19575 }, { "entropy": 6.458062553405762, "epoch": 2.0952431911819787, "grad_norm": 1.5625, "learning_rate": 0.0004566189451924457, "loss": 6.144, "mean_token_accuracy": 0.14219927787780762, "num_tokens": 42374638.0, "step": 19580 }, { "entropy": 6.441175651550293, "epoch": 2.0957782652897428, "grad_norm": 1.359375, "learning_rate": 0.00045659637401308296, "loss": 6.0751, "mean_token_accuracy": 0.15543012022972108, "num_tokens": 42385976.0, "step": 19585 }, { "entropy": 6.469603681564331, "epoch": 2.0963133393975064, "grad_norm": 1.140625, "learning_rate": 0.0004565737975901505, "loss": 6.1399, "mean_token_accuracy": 0.13748691454529763, "num_tokens": 42395714.0, "step": 19590 }, { "entropy": 6.465291452407837, "epoch": 2.0968484135052705, "grad_norm": 1.375, "learning_rate": 0.0004565512159243001, "loss": 6.0442, "mean_token_accuracy": 0.1491420179605484, "num_tokens": 42406027.0, "step": 19595 }, { "entropy": 6.539014196395874, "epoch": 2.0973834876130346, "grad_norm": 1.5703125, "learning_rate": 0.0004565286290161839, "loss": 6.1953, "mean_token_accuracy": 0.1383569948375225, "num_tokens": 42417756.0, "step": 19600 }, { "entropy": 6.514355230331421, "epoch": 2.0979185617207983, "grad_norm": 1.6640625, "learning_rate": 0.00045650603686645403, "loss": 6.1937, "mean_token_accuracy": 0.13685153424739838, "num_tokens": 42429321.0, "step": 19605 }, { "entropy": 6.424641132354736, "epoch": 2.0984536358285624, "grad_norm": 1.2578125, "learning_rate": 0.00045648343947576284, "loss": 6.0116, "mean_token_accuracy": 0.15203089416027069, "num_tokens": 42440003.0, "step": 19610 }, { "entropy": 6.523432636260987, "epoch": 2.098988709936326, "grad_norm": 1.5, "learning_rate": 0.0004564608368447628, "loss": 6.1335, "mean_token_accuracy": 0.1436428375542164, "num_tokens": 42450743.0, "step": 19615 }, { "entropy": 6.451916790008545, "epoch": 2.09952378404409, "grad_norm": 1.953125, "learning_rate": 0.0004564382289741067, "loss": 6.1269, "mean_token_accuracy": 0.13660894110798835, "num_tokens": 42460885.0, "step": 19620 }, { "entropy": 6.415532541275025, "epoch": 2.1000588581518542, "grad_norm": 1.8984375, "learning_rate": 0.00045641561586444706, "loss": 6.1172, "mean_token_accuracy": 0.14363902807235718, "num_tokens": 42470854.0, "step": 19625 }, { "entropy": 6.425800848007202, "epoch": 2.100593932259618, "grad_norm": 1.7890625, "learning_rate": 0.00045639299751643714, "loss": 6.1878, "mean_token_accuracy": 0.13822885900735854, "num_tokens": 42482392.0, "step": 19630 }, { "entropy": 6.537102174758911, "epoch": 2.101129006367382, "grad_norm": 1.40625, "learning_rate": 0.00045637037393072996, "loss": 6.1574, "mean_token_accuracy": 0.1353036232292652, "num_tokens": 42494156.0, "step": 19635 }, { "entropy": 6.513655471801758, "epoch": 2.1016640804751456, "grad_norm": 1.3046875, "learning_rate": 0.0004563477451079786, "loss": 6.1477, "mean_token_accuracy": 0.1431437224149704, "num_tokens": 42505185.0, "step": 19640 }, { "entropy": 6.388147211074829, "epoch": 2.1021991545829097, "grad_norm": 1.390625, "learning_rate": 0.00045632511104883657, "loss": 6.0645, "mean_token_accuracy": 0.14328691661357879, "num_tokens": 42516415.0, "step": 19645 }, { "entropy": 6.4794971466064455, "epoch": 2.102734228690674, "grad_norm": 1.25, "learning_rate": 0.0004563024717539575, "loss": 6.1551, "mean_token_accuracy": 0.14822357147932053, "num_tokens": 42526945.0, "step": 19650 }, { "entropy": 6.578627300262451, "epoch": 2.1032693027984375, "grad_norm": 1.3046875, "learning_rate": 0.00045627982722399506, "loss": 6.2086, "mean_token_accuracy": 0.1379284031689167, "num_tokens": 42537629.0, "step": 19655 }, { "entropy": 6.435596323013305, "epoch": 2.1038043769062016, "grad_norm": 1.609375, "learning_rate": 0.00045625717745960306, "loss": 6.1465, "mean_token_accuracy": 0.1474095955491066, "num_tokens": 42547952.0, "step": 19660 }, { "entropy": 6.432778358459473, "epoch": 2.1043394510139652, "grad_norm": 1.4140625, "learning_rate": 0.00045623452246143547, "loss": 6.1244, "mean_token_accuracy": 0.1428218349814415, "num_tokens": 42559026.0, "step": 19665 }, { "entropy": 6.5374414920806885, "epoch": 2.1048745251217293, "grad_norm": 1.4765625, "learning_rate": 0.0004562118622301466, "loss": 6.1833, "mean_token_accuracy": 0.1409413531422615, "num_tokens": 42570046.0, "step": 19670 }, { "entropy": 6.548043823242187, "epoch": 2.1054095992294934, "grad_norm": 1.2265625, "learning_rate": 0.0004561891967663906, "loss": 6.1814, "mean_token_accuracy": 0.13744086623191834, "num_tokens": 42580440.0, "step": 19675 }, { "entropy": 6.514630222320557, "epoch": 2.105944673337257, "grad_norm": 1.3828125, "learning_rate": 0.00045616652607082203, "loss": 6.1228, "mean_token_accuracy": 0.13829393386840821, "num_tokens": 42591872.0, "step": 19680 }, { "entropy": 6.445277261734009, "epoch": 2.106479747445021, "grad_norm": 1.5703125, "learning_rate": 0.0004561438501440955, "loss": 6.043, "mean_token_accuracy": 0.13981586173176766, "num_tokens": 42602843.0, "step": 19685 }, { "entropy": 6.445372295379639, "epoch": 2.107014821552785, "grad_norm": 1.3984375, "learning_rate": 0.0004561211689868657, "loss": 6.1625, "mean_token_accuracy": 0.14785133600234984, "num_tokens": 42613476.0, "step": 19690 }, { "entropy": 6.4247962474823, "epoch": 2.107549895660549, "grad_norm": 1.546875, "learning_rate": 0.00045609848259978766, "loss": 6.0263, "mean_token_accuracy": 0.15796087831258773, "num_tokens": 42624059.0, "step": 19695 }, { "entropy": 6.483630037307739, "epoch": 2.108084969768313, "grad_norm": 1.3125, "learning_rate": 0.0004560757909835164, "loss": 6.1937, "mean_token_accuracy": 0.14062246009707452, "num_tokens": 42633980.0, "step": 19700 }, { "entropy": 6.498415565490722, "epoch": 2.1086200438760767, "grad_norm": 1.4453125, "learning_rate": 0.00045605309413870697, "loss": 6.1854, "mean_token_accuracy": 0.13881975784897804, "num_tokens": 42645504.0, "step": 19705 }, { "entropy": 6.537342214584351, "epoch": 2.109155117983841, "grad_norm": 1.3828125, "learning_rate": 0.0004560303920660151, "loss": 6.157, "mean_token_accuracy": 0.13537875711917877, "num_tokens": 42655403.0, "step": 19710 }, { "entropy": 6.579575824737549, "epoch": 2.1096901920916045, "grad_norm": 1.4375, "learning_rate": 0.00045600768476609596, "loss": 6.1938, "mean_token_accuracy": 0.14258636981248857, "num_tokens": 42666236.0, "step": 19715 }, { "entropy": 6.493932390213013, "epoch": 2.1102252661993686, "grad_norm": 1.6640625, "learning_rate": 0.00045598497223960533, "loss": 6.2648, "mean_token_accuracy": 0.13089609593153, "num_tokens": 42677365.0, "step": 19720 }, { "entropy": 6.489971113204956, "epoch": 2.1107603403071327, "grad_norm": 1.296875, "learning_rate": 0.00045596225448719913, "loss": 6.1204, "mean_token_accuracy": 0.1416928417980671, "num_tokens": 42688518.0, "step": 19725 }, { "entropy": 6.501855516433716, "epoch": 2.1112954144148963, "grad_norm": 2.15625, "learning_rate": 0.00045593953150953326, "loss": 6.1541, "mean_token_accuracy": 0.1406565338373184, "num_tokens": 42699877.0, "step": 19730 }, { "entropy": 6.451576900482178, "epoch": 2.1118304885226604, "grad_norm": 1.3984375, "learning_rate": 0.0004559168033072638, "loss": 6.1115, "mean_token_accuracy": 0.14994507431983947, "num_tokens": 42710191.0, "step": 19735 }, { "entropy": 6.479924058914184, "epoch": 2.1123655626304245, "grad_norm": 1.8984375, "learning_rate": 0.00045589406988104717, "loss": 6.2051, "mean_token_accuracy": 0.14160223454236984, "num_tokens": 42720874.0, "step": 19740 }, { "entropy": 6.5164580821990965, "epoch": 2.112900636738188, "grad_norm": 1.46875, "learning_rate": 0.0004558713312315396, "loss": 6.1598, "mean_token_accuracy": 0.14363001137971879, "num_tokens": 42731783.0, "step": 19745 }, { "entropy": 6.487932395935059, "epoch": 2.1134357108459523, "grad_norm": 1.46875, "learning_rate": 0.0004558485873593978, "loss": 6.1388, "mean_token_accuracy": 0.14117844849824907, "num_tokens": 42741602.0, "step": 19750 }, { "entropy": 6.53803071975708, "epoch": 2.113970784953716, "grad_norm": 1.4375, "learning_rate": 0.00045582583826527835, "loss": 6.1048, "mean_token_accuracy": 0.14546334072947503, "num_tokens": 42751249.0, "step": 19755 }, { "entropy": 6.469318437576294, "epoch": 2.11450585906148, "grad_norm": 1.359375, "learning_rate": 0.0004558030839498383, "loss": 6.1202, "mean_token_accuracy": 0.1475038781762123, "num_tokens": 42762083.0, "step": 19760 }, { "entropy": 6.468356037139893, "epoch": 2.115040933169244, "grad_norm": 1.40625, "learning_rate": 0.0004557803244137347, "loss": 5.9867, "mean_token_accuracy": 0.16054053381085395, "num_tokens": 42773443.0, "step": 19765 }, { "entropy": 6.450197792053222, "epoch": 2.115576007277008, "grad_norm": 1.3984375, "learning_rate": 0.0004557575596576245, "loss": 6.182, "mean_token_accuracy": 0.1410667136311531, "num_tokens": 42784126.0, "step": 19770 }, { "entropy": 6.411456775665283, "epoch": 2.116111081384772, "grad_norm": 1.4140625, "learning_rate": 0.00045573478968216526, "loss": 6.0743, "mean_token_accuracy": 0.1495702773332596, "num_tokens": 42795472.0, "step": 19775 }, { "entropy": 6.448283720016479, "epoch": 2.1166461554925355, "grad_norm": 1.359375, "learning_rate": 0.00045571201448801424, "loss": 6.1098, "mean_token_accuracy": 0.149944069981575, "num_tokens": 42805279.0, "step": 19780 }, { "entropy": 6.497313356399536, "epoch": 2.1171812296002996, "grad_norm": 1.8515625, "learning_rate": 0.0004556892340758293, "loss": 6.1671, "mean_token_accuracy": 0.14337343201041222, "num_tokens": 42815680.0, "step": 19785 }, { "entropy": 6.541849040985108, "epoch": 2.1177163037080637, "grad_norm": 1.65625, "learning_rate": 0.0004556664484462681, "loss": 6.2099, "mean_token_accuracy": 0.13567657470703126, "num_tokens": 42826724.0, "step": 19790 }, { "entropy": 6.561293220520019, "epoch": 2.1182513778158274, "grad_norm": 1.296875, "learning_rate": 0.00045564365759998856, "loss": 6.1381, "mean_token_accuracy": 0.13923074975609778, "num_tokens": 42837875.0, "step": 19795 }, { "entropy": 6.4971517562866214, "epoch": 2.1187864519235915, "grad_norm": 1.9921875, "learning_rate": 0.0004556208615376488, "loss": 6.1288, "mean_token_accuracy": 0.13982677981257438, "num_tokens": 42848714.0, "step": 19800 }, { "entropy": 6.450415515899659, "epoch": 2.119321526031355, "grad_norm": 1.28125, "learning_rate": 0.0004555980602599071, "loss": 6.2049, "mean_token_accuracy": 0.14171442985534669, "num_tokens": 42859764.0, "step": 19805 }, { "entropy": 6.411892223358154, "epoch": 2.1198566001391193, "grad_norm": 1.28125, "learning_rate": 0.0004555752537674217, "loss": 6.0488, "mean_token_accuracy": 0.1471356302499771, "num_tokens": 42870346.0, "step": 19810 }, { "entropy": 6.4905595779418945, "epoch": 2.1203916742468834, "grad_norm": 1.34375, "learning_rate": 0.0004555524420608513, "loss": 6.151, "mean_token_accuracy": 0.14037445932626724, "num_tokens": 42882706.0, "step": 19815 }, { "entropy": 6.459938287734985, "epoch": 2.120926748354647, "grad_norm": 1.2265625, "learning_rate": 0.00045552962514085443, "loss": 6.1399, "mean_token_accuracy": 0.14691274538636206, "num_tokens": 42893611.0, "step": 19820 }, { "entropy": 6.507153940200806, "epoch": 2.121461822462411, "grad_norm": 1.2734375, "learning_rate": 0.00045550680300809003, "loss": 6.0925, "mean_token_accuracy": 0.1446467638015747, "num_tokens": 42904034.0, "step": 19825 }, { "entropy": 6.4270158290863035, "epoch": 2.1219968965701748, "grad_norm": 1.34375, "learning_rate": 0.00045548397566321706, "loss": 6.1326, "mean_token_accuracy": 0.1386638194322586, "num_tokens": 42915530.0, "step": 19830 }, { "entropy": 6.4584770679473875, "epoch": 2.122531970677939, "grad_norm": 1.4140625, "learning_rate": 0.0004554611431068947, "loss": 6.1172, "mean_token_accuracy": 0.1420776851475239, "num_tokens": 42926696.0, "step": 19835 }, { "entropy": 6.492058563232422, "epoch": 2.123067044785703, "grad_norm": 1.3125, "learning_rate": 0.0004554383053397822, "loss": 6.1481, "mean_token_accuracy": 0.1484109416604042, "num_tokens": 42936985.0, "step": 19840 }, { "entropy": 6.484788322448731, "epoch": 2.1236021188934666, "grad_norm": 1.2109375, "learning_rate": 0.00045541546236253896, "loss": 6.1026, "mean_token_accuracy": 0.14406656697392464, "num_tokens": 42947996.0, "step": 19845 }, { "entropy": 6.438353872299194, "epoch": 2.1241371930012307, "grad_norm": 1.3515625, "learning_rate": 0.00045539261417582456, "loss": 6.0468, "mean_token_accuracy": 0.1453639894723892, "num_tokens": 42959669.0, "step": 19850 }, { "entropy": 6.403155374526977, "epoch": 2.124672267108995, "grad_norm": 1.40625, "learning_rate": 0.00045536976078029874, "loss": 6.015, "mean_token_accuracy": 0.1479623094201088, "num_tokens": 42969687.0, "step": 19855 }, { "entropy": 6.461460113525391, "epoch": 2.1252073412167585, "grad_norm": 1.3046875, "learning_rate": 0.0004553469021766215, "loss": 6.1957, "mean_token_accuracy": 0.13120304346084594, "num_tokens": 42980752.0, "step": 19860 }, { "entropy": 6.529850339889526, "epoch": 2.1257424153245226, "grad_norm": 1.53125, "learning_rate": 0.00045532403836545286, "loss": 6.2371, "mean_token_accuracy": 0.1411494120955467, "num_tokens": 42991949.0, "step": 19865 }, { "entropy": 6.461529397964478, "epoch": 2.1262774894322862, "grad_norm": 1.2734375, "learning_rate": 0.0004553011693474528, "loss": 6.0999, "mean_token_accuracy": 0.1494043216109276, "num_tokens": 43002689.0, "step": 19870 }, { "entropy": 6.485022020339966, "epoch": 2.1268125635400503, "grad_norm": 1.484375, "learning_rate": 0.0004552782951232819, "loss": 6.1641, "mean_token_accuracy": 0.14168797582387924, "num_tokens": 43012939.0, "step": 19875 }, { "entropy": 6.468227243423462, "epoch": 2.1273476376478144, "grad_norm": 1.671875, "learning_rate": 0.00045525541569360053, "loss": 6.1082, "mean_token_accuracy": 0.14344905391335488, "num_tokens": 43023887.0, "step": 19880 }, { "entropy": 6.423562860488891, "epoch": 2.127882711755578, "grad_norm": 1.3828125, "learning_rate": 0.0004552325310590694, "loss": 6.0478, "mean_token_accuracy": 0.1459365077316761, "num_tokens": 43034554.0, "step": 19885 }, { "entropy": 6.529317188262939, "epoch": 2.128417785863342, "grad_norm": 1.2578125, "learning_rate": 0.0004552096412203492, "loss": 6.1942, "mean_token_accuracy": 0.14376000091433525, "num_tokens": 43046322.0, "step": 19890 }, { "entropy": 6.50398736000061, "epoch": 2.128952859971106, "grad_norm": 1.578125, "learning_rate": 0.000455186746178101, "loss": 6.0681, "mean_token_accuracy": 0.14861174970865249, "num_tokens": 43055981.0, "step": 19895 }, { "entropy": 6.5121767044067385, "epoch": 2.12948793407887, "grad_norm": 1.3046875, "learning_rate": 0.00045516384593298584, "loss": 6.1534, "mean_token_accuracy": 0.13824398666620255, "num_tokens": 43067217.0, "step": 19900 }, { "entropy": 6.50492148399353, "epoch": 2.130023008186634, "grad_norm": 1.296875, "learning_rate": 0.00045514094048566486, "loss": 6.1485, "mean_token_accuracy": 0.1418042376637459, "num_tokens": 43078312.0, "step": 19905 }, { "entropy": 6.346564769744873, "epoch": 2.1305580822943977, "grad_norm": 1.5078125, "learning_rate": 0.00045511802983679955, "loss": 5.9708, "mean_token_accuracy": 0.15819320529699327, "num_tokens": 43090210.0, "step": 19910 }, { "entropy": 6.455585718154907, "epoch": 2.131093156402162, "grad_norm": 1.3984375, "learning_rate": 0.0004550951139870515, "loss": 6.0853, "mean_token_accuracy": 0.14370020031929015, "num_tokens": 43101282.0, "step": 19915 }, { "entropy": 6.4974658489227295, "epoch": 2.1316282305099254, "grad_norm": 1.328125, "learning_rate": 0.00045507219293708227, "loss": 6.2081, "mean_token_accuracy": 0.13790655955672265, "num_tokens": 43112856.0, "step": 19920 }, { "entropy": 6.454631757736206, "epoch": 2.1321633046176895, "grad_norm": 1.4375, "learning_rate": 0.00045504926668755384, "loss": 6.0685, "mean_token_accuracy": 0.15341846123337746, "num_tokens": 43123898.0, "step": 19925 }, { "entropy": 6.5012664794921875, "epoch": 2.1326983787254536, "grad_norm": 1.90625, "learning_rate": 0.0004550263352391281, "loss": 6.122, "mean_token_accuracy": 0.14729975908994675, "num_tokens": 43134651.0, "step": 19930 }, { "entropy": 6.511061096191407, "epoch": 2.1332334528332173, "grad_norm": 1.390625, "learning_rate": 0.0004550033985924672, "loss": 6.1586, "mean_token_accuracy": 0.14541507959365846, "num_tokens": 43145385.0, "step": 19935 }, { "entropy": 6.495218086242676, "epoch": 2.1337685269409814, "grad_norm": 1.4609375, "learning_rate": 0.0004549804567482335, "loss": 6.1447, "mean_token_accuracy": 0.1441176116466522, "num_tokens": 43157356.0, "step": 19940 }, { "entropy": 6.519485569000244, "epoch": 2.134303601048745, "grad_norm": 1.3984375, "learning_rate": 0.00045495750970708944, "loss": 6.1541, "mean_token_accuracy": 0.14577193707227706, "num_tokens": 43168289.0, "step": 19945 }, { "entropy": 6.421923637390137, "epoch": 2.134838675156509, "grad_norm": 1.3515625, "learning_rate": 0.00045493455746969746, "loss": 6.0807, "mean_token_accuracy": 0.14722421169281005, "num_tokens": 43177796.0, "step": 19950 }, { "entropy": 6.441613817214966, "epoch": 2.1353737492642733, "grad_norm": 1.2578125, "learning_rate": 0.0004549116000367205, "loss": 6.0906, "mean_token_accuracy": 0.1484612539410591, "num_tokens": 43188846.0, "step": 19955 }, { "entropy": 6.508660173416137, "epoch": 2.135908823372037, "grad_norm": 2.125, "learning_rate": 0.00045488863740882133, "loss": 6.188, "mean_token_accuracy": 0.1432749792933464, "num_tokens": 43199852.0, "step": 19960 }, { "entropy": 6.499727439880371, "epoch": 2.136443897479801, "grad_norm": 1.3046875, "learning_rate": 0.00045486566958666307, "loss": 6.0877, "mean_token_accuracy": 0.1441863916814327, "num_tokens": 43210591.0, "step": 19965 }, { "entropy": 6.491096925735474, "epoch": 2.136978971587565, "grad_norm": 1.2890625, "learning_rate": 0.00045484269657090887, "loss": 6.0798, "mean_token_accuracy": 0.14160085022449492, "num_tokens": 43221760.0, "step": 19970 }, { "entropy": 6.468918561935425, "epoch": 2.1375140456953288, "grad_norm": 1.1640625, "learning_rate": 0.00045481971836222205, "loss": 6.199, "mean_token_accuracy": 0.1341404989361763, "num_tokens": 43233693.0, "step": 19975 }, { "entropy": 6.487259244918823, "epoch": 2.138049119803093, "grad_norm": 1.203125, "learning_rate": 0.00045479673496126615, "loss": 6.155, "mean_token_accuracy": 0.14123794063925743, "num_tokens": 43244565.0, "step": 19980 }, { "entropy": 6.4275530815124515, "epoch": 2.1385841939108565, "grad_norm": 1.390625, "learning_rate": 0.00045477374636870485, "loss": 6.0779, "mean_token_accuracy": 0.1453502856194973, "num_tokens": 43254913.0, "step": 19985 }, { "entropy": 6.498678398132324, "epoch": 2.1391192680186206, "grad_norm": 1.2890625, "learning_rate": 0.00045475075258520175, "loss": 6.1316, "mean_token_accuracy": 0.14247939884662628, "num_tokens": 43265525.0, "step": 19990 }, { "entropy": 6.471640920639038, "epoch": 2.1396543421263843, "grad_norm": 3.109375, "learning_rate": 0.0004547277536114211, "loss": 6.2169, "mean_token_accuracy": 0.13235984146595, "num_tokens": 43276954.0, "step": 19995 }, { "entropy": 6.4997851848602295, "epoch": 2.1401894162341484, "grad_norm": 1.3203125, "learning_rate": 0.0004547047494480267, "loss": 6.1296, "mean_token_accuracy": 0.1417925976216793, "num_tokens": 43287491.0, "step": 20000 }, { "entropy": 6.481905317306518, "epoch": 2.1407244903419125, "grad_norm": 1.5, "learning_rate": 0.0004546817400956829, "loss": 6.1759, "mean_token_accuracy": 0.1345571480691433, "num_tokens": 43298341.0, "step": 20005 }, { "entropy": 6.405822467803955, "epoch": 2.141259564449676, "grad_norm": 1.5, "learning_rate": 0.00045465872555505417, "loss": 6.0836, "mean_token_accuracy": 0.15132260620594024, "num_tokens": 43309450.0, "step": 20010 }, { "entropy": 6.5346914768219, "epoch": 2.1417946385574402, "grad_norm": 1.3046875, "learning_rate": 0.000454635705826805, "loss": 6.133, "mean_token_accuracy": 0.1373695246875286, "num_tokens": 43320126.0, "step": 20015 }, { "entropy": 6.544931650161743, "epoch": 2.1423297126652043, "grad_norm": 1.484375, "learning_rate": 0.0004546126809116, "loss": 6.2096, "mean_token_accuracy": 0.13375122770667075, "num_tokens": 43331347.0, "step": 20020 }, { "entropy": 6.47828688621521, "epoch": 2.142864786772968, "grad_norm": 1.9609375, "learning_rate": 0.0004545896508101041, "loss": 6.1011, "mean_token_accuracy": 0.14316849485039712, "num_tokens": 43341351.0, "step": 20025 }, { "entropy": 6.532412767410278, "epoch": 2.143399860880732, "grad_norm": 1.484375, "learning_rate": 0.0004545666155229823, "loss": 6.1966, "mean_token_accuracy": 0.14234084039926528, "num_tokens": 43352471.0, "step": 20030 }, { "entropy": 6.519003868103027, "epoch": 2.1439349349884957, "grad_norm": 1.40625, "learning_rate": 0.00045454357505089965, "loss": 6.0795, "mean_token_accuracy": 0.14596754610538482, "num_tokens": 43363041.0, "step": 20035 }, { "entropy": 6.442016220092773, "epoch": 2.14447000909626, "grad_norm": 1.5078125, "learning_rate": 0.0004545205293945215, "loss": 6.0854, "mean_token_accuracy": 0.14105915054678916, "num_tokens": 43375034.0, "step": 20040 }, { "entropy": 6.487355136871338, "epoch": 2.145005083204024, "grad_norm": 1.8203125, "learning_rate": 0.0004544974785545134, "loss": 6.2379, "mean_token_accuracy": 0.13306314796209334, "num_tokens": 43386110.0, "step": 20045 }, { "entropy": 6.515271520614624, "epoch": 2.1455401573117876, "grad_norm": 1.234375, "learning_rate": 0.0004544744225315407, "loss": 6.12, "mean_token_accuracy": 0.14595941603183746, "num_tokens": 43396150.0, "step": 20050 }, { "entropy": 6.488174629211426, "epoch": 2.1460752314195517, "grad_norm": 1.640625, "learning_rate": 0.0004544513613262693, "loss": 6.1558, "mean_token_accuracy": 0.14052343890070915, "num_tokens": 43407237.0, "step": 20055 }, { "entropy": 6.469608306884766, "epoch": 2.1466103055273154, "grad_norm": 2.171875, "learning_rate": 0.0004544282949393652, "loss": 6.0608, "mean_token_accuracy": 0.14775441437959672, "num_tokens": 43417626.0, "step": 20060 }, { "entropy": 6.488646841049194, "epoch": 2.1471453796350795, "grad_norm": 1.828125, "learning_rate": 0.0004544052233714941, "loss": 6.1114, "mean_token_accuracy": 0.14532986730337144, "num_tokens": 43427368.0, "step": 20065 }, { "entropy": 6.430359697341919, "epoch": 2.1476804537428436, "grad_norm": 1.953125, "learning_rate": 0.00045438214662332245, "loss": 6.0955, "mean_token_accuracy": 0.1424453228712082, "num_tokens": 43438159.0, "step": 20070 }, { "entropy": 6.4834716796875, "epoch": 2.148215527850607, "grad_norm": 1.4921875, "learning_rate": 0.00045435906469551657, "loss": 6.1643, "mean_token_accuracy": 0.14322199895977974, "num_tokens": 43447403.0, "step": 20075 }, { "entropy": 6.49311900138855, "epoch": 2.1487506019583713, "grad_norm": 1.5859375, "learning_rate": 0.00045433597758874286, "loss": 6.0351, "mean_token_accuracy": 0.15143866688013077, "num_tokens": 43457713.0, "step": 20080 }, { "entropy": 6.494896507263183, "epoch": 2.149285676066135, "grad_norm": 2.84375, "learning_rate": 0.000454312885303668, "loss": 6.1651, "mean_token_accuracy": 0.1441124878823757, "num_tokens": 43468520.0, "step": 20085 }, { "entropy": 6.5642084121704105, "epoch": 2.149820750173899, "grad_norm": 1.6640625, "learning_rate": 0.00045428978784095873, "loss": 6.2057, "mean_token_accuracy": 0.13654238730669022, "num_tokens": 43480501.0, "step": 20090 }, { "entropy": 6.568170070648193, "epoch": 2.150355824281663, "grad_norm": 3.0, "learning_rate": 0.00045426668520128204, "loss": 6.1422, "mean_token_accuracy": 0.14247775599360465, "num_tokens": 43491297.0, "step": 20095 }, { "entropy": 6.522011947631836, "epoch": 2.150890898389427, "grad_norm": 1.2578125, "learning_rate": 0.0004542435773853051, "loss": 6.1619, "mean_token_accuracy": 0.14496304243803024, "num_tokens": 43501212.0, "step": 20100 }, { "entropy": 6.419024419784546, "epoch": 2.151425972497191, "grad_norm": 1.3984375, "learning_rate": 0.000454220464393695, "loss": 6.1826, "mean_token_accuracy": 0.13840727582573892, "num_tokens": 43511136.0, "step": 20105 }, { "entropy": 6.552536344528198, "epoch": 2.1519610466049546, "grad_norm": 1.3984375, "learning_rate": 0.0004541973462271192, "loss": 6.2204, "mean_token_accuracy": 0.1390797473490238, "num_tokens": 43522006.0, "step": 20110 }, { "entropy": 6.53021936416626, "epoch": 2.1524961207127187, "grad_norm": 1.5859375, "learning_rate": 0.0004541742228862451, "loss": 6.124, "mean_token_accuracy": 0.14211415946483613, "num_tokens": 43532746.0, "step": 20115 }, { "entropy": 6.430755567550659, "epoch": 2.1530311948204828, "grad_norm": 1.6640625, "learning_rate": 0.00045415109437174064, "loss": 6.1255, "mean_token_accuracy": 0.14374642074108124, "num_tokens": 43543707.0, "step": 20120 }, { "entropy": 6.490007734298706, "epoch": 2.1535662689282464, "grad_norm": 1.5, "learning_rate": 0.00045412796068427337, "loss": 6.1222, "mean_token_accuracy": 0.13703791201114654, "num_tokens": 43555029.0, "step": 20125 }, { "entropy": 6.537265777587891, "epoch": 2.1541013430360105, "grad_norm": 1.2265625, "learning_rate": 0.00045410482182451153, "loss": 6.1713, "mean_token_accuracy": 0.13964841812849044, "num_tokens": 43565639.0, "step": 20130 }, { "entropy": 6.462145185470581, "epoch": 2.1546364171437746, "grad_norm": 1.6015625, "learning_rate": 0.00045408167779312306, "loss": 6.0697, "mean_token_accuracy": 0.1506087988615036, "num_tokens": 43576333.0, "step": 20135 }, { "entropy": 6.521839714050293, "epoch": 2.1551714912515383, "grad_norm": 1.59375, "learning_rate": 0.00045405852859077626, "loss": 6.113, "mean_token_accuracy": 0.13899362310767174, "num_tokens": 43587012.0, "step": 20140 }, { "entropy": 6.470482683181762, "epoch": 2.1557065653593024, "grad_norm": 1.234375, "learning_rate": 0.00045403537421813975, "loss": 6.0721, "mean_token_accuracy": 0.14818194955587388, "num_tokens": 43597779.0, "step": 20145 }, { "entropy": 6.523967313766479, "epoch": 2.156241639467066, "grad_norm": 1.5078125, "learning_rate": 0.00045401221467588184, "loss": 6.1155, "mean_token_accuracy": 0.1424321189522743, "num_tokens": 43608631.0, "step": 20150 }, { "entropy": 6.515417098999023, "epoch": 2.15677671357483, "grad_norm": 1.59375, "learning_rate": 0.0004539890499646714, "loss": 6.0902, "mean_token_accuracy": 0.1509397327899933, "num_tokens": 43620254.0, "step": 20155 }, { "entropy": 6.435489892959595, "epoch": 2.1573117876825942, "grad_norm": 1.3515625, "learning_rate": 0.0004539658800851773, "loss": 6.0606, "mean_token_accuracy": 0.14455048590898514, "num_tokens": 43630986.0, "step": 20160 }, { "entropy": 6.40526442527771, "epoch": 2.157846861790358, "grad_norm": 1.3515625, "learning_rate": 0.0004539427050380686, "loss": 6.0707, "mean_token_accuracy": 0.13671587854623796, "num_tokens": 43641260.0, "step": 20165 }, { "entropy": 6.499885511398316, "epoch": 2.158381935898122, "grad_norm": 2.109375, "learning_rate": 0.00045391952482401444, "loss": 6.2201, "mean_token_accuracy": 0.14062789976596832, "num_tokens": 43652093.0, "step": 20170 }, { "entropy": 6.51837124824524, "epoch": 2.1589170100058857, "grad_norm": 1.46875, "learning_rate": 0.00045389633944368406, "loss": 6.1231, "mean_token_accuracy": 0.14618946686387063, "num_tokens": 43662799.0, "step": 20175 }, { "entropy": 6.461586856842041, "epoch": 2.1594520841136498, "grad_norm": 1.5390625, "learning_rate": 0.0004538731488977471, "loss": 6.0813, "mean_token_accuracy": 0.14218505173921586, "num_tokens": 43674198.0, "step": 20180 }, { "entropy": 6.459530305862427, "epoch": 2.159987158221414, "grad_norm": 1.3125, "learning_rate": 0.0004538499531868731, "loss": 6.135, "mean_token_accuracy": 0.14445096328854562, "num_tokens": 43684841.0, "step": 20185 }, { "entropy": 6.54753041267395, "epoch": 2.1605222323291775, "grad_norm": 1.3046875, "learning_rate": 0.00045382675231173174, "loss": 6.2075, "mean_token_accuracy": 0.1367589585483074, "num_tokens": 43695903.0, "step": 20190 }, { "entropy": 6.533148527145386, "epoch": 2.1610573064369416, "grad_norm": 1.4140625, "learning_rate": 0.0004538035462729931, "loss": 6.1088, "mean_token_accuracy": 0.14191216602921486, "num_tokens": 43706740.0, "step": 20195 }, { "entropy": 6.493363237380981, "epoch": 2.1615923805447053, "grad_norm": 1.671875, "learning_rate": 0.0004537803350713273, "loss": 6.0901, "mean_token_accuracy": 0.14305991306900978, "num_tokens": 43717124.0, "step": 20200 }, { "entropy": 6.43371696472168, "epoch": 2.1621274546524694, "grad_norm": 1.34375, "learning_rate": 0.0004537571187074043, "loss": 6.0843, "mean_token_accuracy": 0.14660966843366624, "num_tokens": 43727346.0, "step": 20205 }, { "entropy": 6.550573539733887, "epoch": 2.1626625287602335, "grad_norm": 1.484375, "learning_rate": 0.00045373389718189464, "loss": 6.2389, "mean_token_accuracy": 0.1285846747457981, "num_tokens": 43738297.0, "step": 20210 }, { "entropy": 6.51973147392273, "epoch": 2.163197602867997, "grad_norm": 1.65625, "learning_rate": 0.0004537106704954689, "loss": 6.1433, "mean_token_accuracy": 0.14054710939526557, "num_tokens": 43749543.0, "step": 20215 }, { "entropy": 6.507083559036255, "epoch": 2.163732676975761, "grad_norm": 1.6171875, "learning_rate": 0.00045368743864879755, "loss": 6.1228, "mean_token_accuracy": 0.14513924196362496, "num_tokens": 43760324.0, "step": 20220 }, { "entropy": 6.542077159881591, "epoch": 2.164267751083525, "grad_norm": 1.328125, "learning_rate": 0.00045366420164255156, "loss": 6.1701, "mean_token_accuracy": 0.13762131631374358, "num_tokens": 43770391.0, "step": 20225 }, { "entropy": 6.423087930679321, "epoch": 2.164802825191289, "grad_norm": 1.3359375, "learning_rate": 0.0004536409594774019, "loss": 6.0891, "mean_token_accuracy": 0.13530075773596764, "num_tokens": 43781516.0, "step": 20230 }, { "entropy": 6.377832555770874, "epoch": 2.165337899299053, "grad_norm": 1.2890625, "learning_rate": 0.00045361771215401953, "loss": 6.1231, "mean_token_accuracy": 0.14707974418997766, "num_tokens": 43794152.0, "step": 20235 }, { "entropy": 6.518850564956665, "epoch": 2.1658729734068167, "grad_norm": 1.6796875, "learning_rate": 0.00045359445967307595, "loss": 6.1344, "mean_token_accuracy": 0.14454821422696112, "num_tokens": 43805712.0, "step": 20240 }, { "entropy": 6.557677412033081, "epoch": 2.166408047514581, "grad_norm": 1.3046875, "learning_rate": 0.0004535712020352423, "loss": 6.1807, "mean_token_accuracy": 0.1400250017642975, "num_tokens": 43816985.0, "step": 20245 }, { "entropy": 6.487140893936157, "epoch": 2.166943121622345, "grad_norm": 1.5078125, "learning_rate": 0.0004535479392411904, "loss": 6.0772, "mean_token_accuracy": 0.14423147365450859, "num_tokens": 43828048.0, "step": 20250 }, { "entropy": 6.512788724899292, "epoch": 2.1674781957301086, "grad_norm": 1.421875, "learning_rate": 0.00045352467129159183, "loss": 6.126, "mean_token_accuracy": 0.1426374226808548, "num_tokens": 43838507.0, "step": 20255 }, { "entropy": 6.404138040542603, "epoch": 2.1680132698378727, "grad_norm": 1.375, "learning_rate": 0.00045350139818711846, "loss": 6.062, "mean_token_accuracy": 0.14408638179302216, "num_tokens": 43849328.0, "step": 20260 }, { "entropy": 6.454526615142822, "epoch": 2.1685483439456363, "grad_norm": 1.3671875, "learning_rate": 0.0004534781199284423, "loss": 6.127, "mean_token_accuracy": 0.14136345461010932, "num_tokens": 43860311.0, "step": 20265 }, { "entropy": 6.540534973144531, "epoch": 2.1690834180534004, "grad_norm": 1.8359375, "learning_rate": 0.0004534548365162354, "loss": 6.2035, "mean_token_accuracy": 0.14096086621284484, "num_tokens": 43871167.0, "step": 20270 }, { "entropy": 6.461973047256469, "epoch": 2.169618492161164, "grad_norm": 2.234375, "learning_rate": 0.00045343154795117024, "loss": 6.093, "mean_token_accuracy": 0.14626741260290146, "num_tokens": 43882332.0, "step": 20275 }, { "entropy": 6.528645181655884, "epoch": 2.170153566268928, "grad_norm": 1.3125, "learning_rate": 0.0004534082542339192, "loss": 6.0265, "mean_token_accuracy": 0.14352528899908065, "num_tokens": 43892971.0, "step": 20280 }, { "entropy": 6.464555978775024, "epoch": 2.1706886403766923, "grad_norm": 1.234375, "learning_rate": 0.00045338495536515497, "loss": 6.1306, "mean_token_accuracy": 0.14322419315576554, "num_tokens": 43904305.0, "step": 20285 }, { "entropy": 6.3747905731201175, "epoch": 2.171223714484456, "grad_norm": 1.1875, "learning_rate": 0.0004533616513455502, "loss": 6.0864, "mean_token_accuracy": 0.14520493596792222, "num_tokens": 43914431.0, "step": 20290 }, { "entropy": 6.445853567123413, "epoch": 2.17175878859222, "grad_norm": 1.421875, "learning_rate": 0.00045333834217577775, "loss": 6.1185, "mean_token_accuracy": 0.14553093761205674, "num_tokens": 43925350.0, "step": 20295 }, { "entropy": 6.422257614135742, "epoch": 2.172293862699984, "grad_norm": 1.703125, "learning_rate": 0.00045331502785651075, "loss": 6.1685, "mean_token_accuracy": 0.1409260854125023, "num_tokens": 43936194.0, "step": 20300 }, { "entropy": 6.531687641143799, "epoch": 2.172828936807748, "grad_norm": 1.375, "learning_rate": 0.0004532917083884224, "loss": 6.1372, "mean_token_accuracy": 0.1401752181351185, "num_tokens": 43946692.0, "step": 20305 }, { "entropy": 6.509691047668457, "epoch": 2.173364010915512, "grad_norm": 2.25, "learning_rate": 0.000453268383772186, "loss": 6.106, "mean_token_accuracy": 0.14296674653887748, "num_tokens": 43957493.0, "step": 20310 }, { "entropy": 6.503253221511841, "epoch": 2.1738990850232756, "grad_norm": 1.5, "learning_rate": 0.00045324505400847506, "loss": 6.1942, "mean_token_accuracy": 0.14070744961500167, "num_tokens": 43970203.0, "step": 20315 }, { "entropy": 6.489485073089599, "epoch": 2.1744341591310397, "grad_norm": 1.453125, "learning_rate": 0.00045322171909796327, "loss": 6.1093, "mean_token_accuracy": 0.1403039015829563, "num_tokens": 43980778.0, "step": 20320 }, { "entropy": 6.466435480117798, "epoch": 2.1749692332388038, "grad_norm": 1.3125, "learning_rate": 0.00045319837904132435, "loss": 6.1138, "mean_token_accuracy": 0.14622555673122406, "num_tokens": 43992239.0, "step": 20325 }, { "entropy": 6.502254819869995, "epoch": 2.1755043073465674, "grad_norm": 2.28125, "learning_rate": 0.0004531750338392323, "loss": 6.142, "mean_token_accuracy": 0.1422283098101616, "num_tokens": 44001882.0, "step": 20330 }, { "entropy": 6.442241382598877, "epoch": 2.1760393814543315, "grad_norm": 1.4453125, "learning_rate": 0.0004531516834923611, "loss": 6.1096, "mean_token_accuracy": 0.14044273942708968, "num_tokens": 44013192.0, "step": 20335 }, { "entropy": 6.558344841003418, "epoch": 2.176574455562095, "grad_norm": 1.4140625, "learning_rate": 0.0004531283280013852, "loss": 6.1723, "mean_token_accuracy": 0.13786421865224838, "num_tokens": 44023072.0, "step": 20340 }, { "entropy": 6.533612155914307, "epoch": 2.1771095296698593, "grad_norm": 1.2890625, "learning_rate": 0.00045310496736697875, "loss": 6.1623, "mean_token_accuracy": 0.13985364958643914, "num_tokens": 44034238.0, "step": 20345 }, { "entropy": 6.473046875, "epoch": 2.1776446037776234, "grad_norm": 1.4765625, "learning_rate": 0.00045308160158981646, "loss": 6.1339, "mean_token_accuracy": 0.14215909615159034, "num_tokens": 44044392.0, "step": 20350 }, { "entropy": 6.464304065704345, "epoch": 2.178179677885387, "grad_norm": 1.4296875, "learning_rate": 0.000453058230670573, "loss": 6.1651, "mean_token_accuracy": 0.14172023087739943, "num_tokens": 44056129.0, "step": 20355 }, { "entropy": 6.444278764724731, "epoch": 2.178714751993151, "grad_norm": 1.4140625, "learning_rate": 0.00045303485460992303, "loss": 6.108, "mean_token_accuracy": 0.15108377784490584, "num_tokens": 44067600.0, "step": 20360 }, { "entropy": 6.47888035774231, "epoch": 2.1792498261009148, "grad_norm": 1.2578125, "learning_rate": 0.00045301147340854177, "loss": 6.0012, "mean_token_accuracy": 0.1531740114092827, "num_tokens": 44077373.0, "step": 20365 }, { "entropy": 6.477386331558227, "epoch": 2.179784900208679, "grad_norm": 1.2265625, "learning_rate": 0.00045298808706710416, "loss": 6.2171, "mean_token_accuracy": 0.14295275062322615, "num_tokens": 44087422.0, "step": 20370 }, { "entropy": 6.520819902420044, "epoch": 2.180319974316443, "grad_norm": 1.3515625, "learning_rate": 0.00045296469558628555, "loss": 6.1703, "mean_token_accuracy": 0.14255437552928923, "num_tokens": 44098524.0, "step": 20375 }, { "entropy": 6.4786275863647464, "epoch": 2.1808550484242066, "grad_norm": 1.3046875, "learning_rate": 0.00045294129896676134, "loss": 6.073, "mean_token_accuracy": 0.15057651251554488, "num_tokens": 44108340.0, "step": 20380 }, { "entropy": 6.45948371887207, "epoch": 2.1813901225319707, "grad_norm": 1.390625, "learning_rate": 0.0004529178972092071, "loss": 6.1272, "mean_token_accuracy": 0.1359841264784336, "num_tokens": 44118985.0, "step": 20385 }, { "entropy": 6.517501878738403, "epoch": 2.1819251966397344, "grad_norm": 1.625, "learning_rate": 0.00045289449031429873, "loss": 6.1356, "mean_token_accuracy": 0.143955484777689, "num_tokens": 44129126.0, "step": 20390 }, { "entropy": 6.526478576660156, "epoch": 2.1824602707474985, "grad_norm": 1.2109375, "learning_rate": 0.00045287107828271184, "loss": 6.1595, "mean_token_accuracy": 0.14495654180645942, "num_tokens": 44139731.0, "step": 20395 }, { "entropy": 6.479117488861084, "epoch": 2.1829953448552626, "grad_norm": 1.3984375, "learning_rate": 0.0004528476611151226, "loss": 6.1024, "mean_token_accuracy": 0.14143309295177459, "num_tokens": 44149924.0, "step": 20400 }, { "entropy": 6.470751094818115, "epoch": 2.1835304189630262, "grad_norm": 1.640625, "learning_rate": 0.0004528242388122071, "loss": 6.1053, "mean_token_accuracy": 0.13908825367689132, "num_tokens": 44161155.0, "step": 20405 }, { "entropy": 6.491450452804566, "epoch": 2.1840654930707903, "grad_norm": 1.328125, "learning_rate": 0.0004528008113746417, "loss": 6.1656, "mean_token_accuracy": 0.14211047291755677, "num_tokens": 44171563.0, "step": 20410 }, { "entropy": 6.446858167648315, "epoch": 2.1846005671785544, "grad_norm": 1.390625, "learning_rate": 0.00045277737880310284, "loss": 6.0748, "mean_token_accuracy": 0.1416269823908806, "num_tokens": 44182719.0, "step": 20415 }, { "entropy": 6.42777271270752, "epoch": 2.185135641286318, "grad_norm": 1.5, "learning_rate": 0.00045275394109826715, "loss": 6.0576, "mean_token_accuracy": 0.14696394503116608, "num_tokens": 44192214.0, "step": 20420 }, { "entropy": 6.430699396133423, "epoch": 2.185670715394082, "grad_norm": 1.4453125, "learning_rate": 0.00045273049826081145, "loss": 6.1169, "mean_token_accuracy": 0.14169675558805467, "num_tokens": 44204074.0, "step": 20425 }, { "entropy": 6.55955171585083, "epoch": 2.186205789501846, "grad_norm": 1.2890625, "learning_rate": 0.0004527070502914125, "loss": 6.251, "mean_token_accuracy": 0.13508173003792762, "num_tokens": 44214402.0, "step": 20430 }, { "entropy": 6.564619398117065, "epoch": 2.18674086360961, "grad_norm": 1.359375, "learning_rate": 0.0004526835971907475, "loss": 6.1419, "mean_token_accuracy": 0.1409166358411312, "num_tokens": 44224479.0, "step": 20435 }, { "entropy": 6.47654242515564, "epoch": 2.187275937717374, "grad_norm": 1.9609375, "learning_rate": 0.00045266013895949356, "loss": 6.1461, "mean_token_accuracy": 0.141594035923481, "num_tokens": 44234069.0, "step": 20440 }, { "entropy": 6.449040937423706, "epoch": 2.1878110118251377, "grad_norm": 1.21875, "learning_rate": 0.0004526366755983281, "loss": 6.1501, "mean_token_accuracy": 0.13885367885231972, "num_tokens": 44244978.0, "step": 20445 }, { "entropy": 6.489460229873657, "epoch": 2.188346085932902, "grad_norm": 1.2265625, "learning_rate": 0.0004526132071079286, "loss": 6.1214, "mean_token_accuracy": 0.14799125045537947, "num_tokens": 44255657.0, "step": 20450 }, { "entropy": 6.473532009124756, "epoch": 2.1888811600406655, "grad_norm": 1.2421875, "learning_rate": 0.00045258973348897267, "loss": 6.0973, "mean_token_accuracy": 0.1426821157336235, "num_tokens": 44267370.0, "step": 20455 }, { "entropy": 6.413994073867798, "epoch": 2.1894162341484296, "grad_norm": 1.46875, "learning_rate": 0.0004525662547421382, "loss": 6.1232, "mean_token_accuracy": 0.14376394227147102, "num_tokens": 44277855.0, "step": 20460 }, { "entropy": 6.494499588012696, "epoch": 2.1899513082561937, "grad_norm": 1.3203125, "learning_rate": 0.000452542770868103, "loss": 6.0843, "mean_token_accuracy": 0.14557158648967744, "num_tokens": 44288233.0, "step": 20465 }, { "entropy": 6.45966534614563, "epoch": 2.1904863823639573, "grad_norm": 1.3046875, "learning_rate": 0.00045251928186754533, "loss": 6.142, "mean_token_accuracy": 0.15051595345139504, "num_tokens": 44298054.0, "step": 20470 }, { "entropy": 6.490744018554688, "epoch": 2.1910214564717214, "grad_norm": 1.59375, "learning_rate": 0.0004524957877411432, "loss": 6.1235, "mean_token_accuracy": 0.14246877953410148, "num_tokens": 44309435.0, "step": 20475 }, { "entropy": 6.545108270645142, "epoch": 2.191556530579485, "grad_norm": 1.5390625, "learning_rate": 0.0004524722884895753, "loss": 6.1941, "mean_token_accuracy": 0.14126525223255157, "num_tokens": 44320502.0, "step": 20480 }, { "entropy": 6.411724042892456, "epoch": 2.192091604687249, "grad_norm": 1.515625, "learning_rate": 0.00045244878411352, "loss": 6.0276, "mean_token_accuracy": 0.15645946338772773, "num_tokens": 44330911.0, "step": 20485 }, { "entropy": 6.504664468765259, "epoch": 2.1926266787950133, "grad_norm": 1.4140625, "learning_rate": 0.0004524252746136559, "loss": 6.1388, "mean_token_accuracy": 0.13888708055019378, "num_tokens": 44342159.0, "step": 20490 }, { "entropy": 6.480413436889648, "epoch": 2.193161752902777, "grad_norm": 1.3828125, "learning_rate": 0.00045240175999066194, "loss": 6.0836, "mean_token_accuracy": 0.14757447615265845, "num_tokens": 44352293.0, "step": 20495 }, { "entropy": 6.483118009567261, "epoch": 2.193696827010541, "grad_norm": 1.375, "learning_rate": 0.00045237824024521714, "loss": 6.2409, "mean_token_accuracy": 0.14210179299116135, "num_tokens": 44362321.0, "step": 20500 }, { "entropy": 6.492488813400269, "epoch": 2.1942319011183047, "grad_norm": 1.2421875, "learning_rate": 0.0004523547153780005, "loss": 6.1158, "mean_token_accuracy": 0.14138875603675843, "num_tokens": 44372682.0, "step": 20505 }, { "entropy": 6.498578691482544, "epoch": 2.194766975226069, "grad_norm": 1.640625, "learning_rate": 0.0004523311853896915, "loss": 6.1366, "mean_token_accuracy": 0.14599357843399047, "num_tokens": 44383482.0, "step": 20510 }, { "entropy": 6.35706672668457, "epoch": 2.195302049333833, "grad_norm": 2.6875, "learning_rate": 0.00045230765028096925, "loss": 5.953, "mean_token_accuracy": 0.16601943522691726, "num_tokens": 44395333.0, "step": 20515 }, { "entropy": 6.501402091979981, "epoch": 2.1958371234415965, "grad_norm": 1.5625, "learning_rate": 0.00045228411005251366, "loss": 6.2092, "mean_token_accuracy": 0.1356913849711418, "num_tokens": 44406210.0, "step": 20520 }, { "entropy": 6.562849664688111, "epoch": 2.1963721975493606, "grad_norm": 1.3203125, "learning_rate": 0.0004522605647050043, "loss": 6.1558, "mean_token_accuracy": 0.13747389018535613, "num_tokens": 44415834.0, "step": 20525 }, { "entropy": 6.608779859542847, "epoch": 2.1969072716571247, "grad_norm": 1.2734375, "learning_rate": 0.00045223701423912103, "loss": 6.2343, "mean_token_accuracy": 0.13901744186878204, "num_tokens": 44427902.0, "step": 20530 }, { "entropy": 6.484367179870605, "epoch": 2.1974423457648884, "grad_norm": 1.7578125, "learning_rate": 0.00045221345865554386, "loss": 6.0555, "mean_token_accuracy": 0.15032985359430312, "num_tokens": 44437406.0, "step": 20535 }, { "entropy": 6.450162410736084, "epoch": 2.1979774198726525, "grad_norm": 1.4296875, "learning_rate": 0.00045218989795495294, "loss": 6.0748, "mean_token_accuracy": 0.1465378113090992, "num_tokens": 44446889.0, "step": 20540 }, { "entropy": 6.4537286281585695, "epoch": 2.198512493980416, "grad_norm": 1.25, "learning_rate": 0.00045216633213802866, "loss": 6.1577, "mean_token_accuracy": 0.13990189880132675, "num_tokens": 44457132.0, "step": 20545 }, { "entropy": 6.475618886947632, "epoch": 2.1990475680881802, "grad_norm": 1.3515625, "learning_rate": 0.00045214276120545137, "loss": 6.1494, "mean_token_accuracy": 0.13710540011525155, "num_tokens": 44468006.0, "step": 20550 }, { "entropy": 6.533304738998413, "epoch": 2.199582642195944, "grad_norm": 4.25, "learning_rate": 0.0004521191851579019, "loss": 6.073, "mean_token_accuracy": 0.14562759175896645, "num_tokens": 44478650.0, "step": 20555 }, { "entropy": 6.467861270904541, "epoch": 2.200117716303708, "grad_norm": 1.46875, "learning_rate": 0.0004520956039960607, "loss": 6.1698, "mean_token_accuracy": 0.1399306148290634, "num_tokens": 44489842.0, "step": 20560 }, { "entropy": 6.47445764541626, "epoch": 2.200652790411472, "grad_norm": 1.3359375, "learning_rate": 0.00045207201772060887, "loss": 6.0808, "mean_token_accuracy": 0.1480284184217453, "num_tokens": 44500444.0, "step": 20565 }, { "entropy": 6.4193922996521, "epoch": 2.2011878645192358, "grad_norm": 1.3671875, "learning_rate": 0.0004520484263322274, "loss": 6.0527, "mean_token_accuracy": 0.14889391362667084, "num_tokens": 44510711.0, "step": 20570 }, { "entropy": 6.450742149353028, "epoch": 2.201722938627, "grad_norm": 1.2578125, "learning_rate": 0.0004520248298315975, "loss": 6.0965, "mean_token_accuracy": 0.1452381893992424, "num_tokens": 44522343.0, "step": 20575 }, { "entropy": 6.44204044342041, "epoch": 2.202258012734764, "grad_norm": 1.4375, "learning_rate": 0.00045200122821940057, "loss": 6.1594, "mean_token_accuracy": 0.14006644934415818, "num_tokens": 44533218.0, "step": 20580 }, { "entropy": 6.564455604553222, "epoch": 2.2027930868425276, "grad_norm": 1.3046875, "learning_rate": 0.00045197762149631795, "loss": 6.1796, "mean_token_accuracy": 0.14281179010868073, "num_tokens": 44543406.0, "step": 20585 }, { "entropy": 6.556970834732056, "epoch": 2.2033281609502917, "grad_norm": 1.34375, "learning_rate": 0.00045195400966303146, "loss": 6.1933, "mean_token_accuracy": 0.14433204755187035, "num_tokens": 44555329.0, "step": 20590 }, { "entropy": 6.536537981033325, "epoch": 2.2038632350580554, "grad_norm": 1.71875, "learning_rate": 0.0004519303927202228, "loss": 6.2119, "mean_token_accuracy": 0.14017735421657562, "num_tokens": 44565191.0, "step": 20595 }, { "entropy": 6.483732080459594, "epoch": 2.2043983091658195, "grad_norm": 1.421875, "learning_rate": 0.00045190677066857384, "loss": 6.0731, "mean_token_accuracy": 0.15376509577035904, "num_tokens": 44576374.0, "step": 20600 }, { "entropy": 6.444904947280884, "epoch": 2.2049333832735836, "grad_norm": 1.359375, "learning_rate": 0.0004518831435087668, "loss": 6.0705, "mean_token_accuracy": 0.1488921172916889, "num_tokens": 44586533.0, "step": 20605 }, { "entropy": 6.376462459564209, "epoch": 2.2054684573813472, "grad_norm": 1.2890625, "learning_rate": 0.0004518595112414838, "loss": 5.984, "mean_token_accuracy": 0.1550952360033989, "num_tokens": 44596753.0, "step": 20610 }, { "entropy": 6.551543855667115, "epoch": 2.2060035314891113, "grad_norm": 1.453125, "learning_rate": 0.0004518358738674073, "loss": 6.2167, "mean_token_accuracy": 0.13503544703125953, "num_tokens": 44607632.0, "step": 20615 }, { "entropy": 6.549866008758545, "epoch": 2.206538605596875, "grad_norm": 1.3359375, "learning_rate": 0.0004518122313872198, "loss": 6.14, "mean_token_accuracy": 0.13973730579018592, "num_tokens": 44618786.0, "step": 20620 }, { "entropy": 6.450780916213989, "epoch": 2.207073679704639, "grad_norm": 1.484375, "learning_rate": 0.00045178858380160396, "loss": 6.1131, "mean_token_accuracy": 0.14023820906877518, "num_tokens": 44628760.0, "step": 20625 }, { "entropy": 6.489461898803711, "epoch": 2.207608753812403, "grad_norm": 1.671875, "learning_rate": 0.0004517649311112426, "loss": 6.1759, "mean_token_accuracy": 0.14050846993923188, "num_tokens": 44641206.0, "step": 20630 }, { "entropy": 6.535753488540649, "epoch": 2.208143827920167, "grad_norm": 1.921875, "learning_rate": 0.0004517412733168187, "loss": 6.1087, "mean_token_accuracy": 0.14522838592529297, "num_tokens": 44651923.0, "step": 20635 }, { "entropy": 6.481085777282715, "epoch": 2.208678902027931, "grad_norm": 1.265625, "learning_rate": 0.00045171761041901533, "loss": 6.0931, "mean_token_accuracy": 0.1438140444457531, "num_tokens": 44662375.0, "step": 20640 }, { "entropy": 6.353289842605591, "epoch": 2.2092139761356946, "grad_norm": 1.6171875, "learning_rate": 0.0004516939424185158, "loss": 6.0426, "mean_token_accuracy": 0.15177821815013887, "num_tokens": 44673201.0, "step": 20645 }, { "entropy": 6.4304039001464846, "epoch": 2.2097490502434587, "grad_norm": 1.453125, "learning_rate": 0.0004516702693160035, "loss": 6.1092, "mean_token_accuracy": 0.1409784272313118, "num_tokens": 44684300.0, "step": 20650 }, { "entropy": 6.530240869522094, "epoch": 2.210284124351223, "grad_norm": 1.3671875, "learning_rate": 0.0004516465911121621, "loss": 6.1542, "mean_token_accuracy": 0.1425748884677887, "num_tokens": 44694603.0, "step": 20655 }, { "entropy": 6.508754730224609, "epoch": 2.2108191984589864, "grad_norm": 1.4375, "learning_rate": 0.0004516229078076751, "loss": 6.1331, "mean_token_accuracy": 0.1477656126022339, "num_tokens": 44704461.0, "step": 20660 }, { "entropy": 6.505958843231201, "epoch": 2.2113542725667505, "grad_norm": 1.34375, "learning_rate": 0.0004515992194032265, "loss": 6.1953, "mean_token_accuracy": 0.14030279144644736, "num_tokens": 44715784.0, "step": 20665 }, { "entropy": 6.4570409774780275, "epoch": 2.211889346674514, "grad_norm": 1.3203125, "learning_rate": 0.00045157552589950023, "loss": 6.0564, "mean_token_accuracy": 0.1499457612633705, "num_tokens": 44726025.0, "step": 20670 }, { "entropy": 6.408047342300415, "epoch": 2.2124244207822783, "grad_norm": 2.140625, "learning_rate": 0.0004515518272971805, "loss": 6.0459, "mean_token_accuracy": 0.1566786177456379, "num_tokens": 44736602.0, "step": 20675 }, { "entropy": 6.5007734298706055, "epoch": 2.2129594948900424, "grad_norm": 1.171875, "learning_rate": 0.0004515281235969515, "loss": 6.1917, "mean_token_accuracy": 0.13739494383335113, "num_tokens": 44746260.0, "step": 20680 }, { "entropy": 6.449839973449707, "epoch": 2.213494568997806, "grad_norm": 1.53125, "learning_rate": 0.0004515044147994978, "loss": 6.0885, "mean_token_accuracy": 0.1467547632753849, "num_tokens": 44756894.0, "step": 20685 }, { "entropy": 6.483930683135986, "epoch": 2.21402964310557, "grad_norm": 1.3125, "learning_rate": 0.0004514807009055039, "loss": 6.1661, "mean_token_accuracy": 0.1407784640789032, "num_tokens": 44768483.0, "step": 20690 }, { "entropy": 6.454762411117554, "epoch": 2.2145647172133343, "grad_norm": 1.78125, "learning_rate": 0.00045145698191565456, "loss": 6.0759, "mean_token_accuracy": 0.1482870250940323, "num_tokens": 44778843.0, "step": 20695 }, { "entropy": 6.458995056152344, "epoch": 2.215099791321098, "grad_norm": 1.6015625, "learning_rate": 0.00045143325783063466, "loss": 6.0455, "mean_token_accuracy": 0.14676833376288415, "num_tokens": 44788659.0, "step": 20700 }, { "entropy": 6.466281938552856, "epoch": 2.215634865428862, "grad_norm": 1.328125, "learning_rate": 0.0004514095286511293, "loss": 6.1412, "mean_token_accuracy": 0.14670583754777908, "num_tokens": 44799730.0, "step": 20705 }, { "entropy": 6.432733345031738, "epoch": 2.2161699395366257, "grad_norm": 1.375, "learning_rate": 0.0004513857943778235, "loss": 6.0962, "mean_token_accuracy": 0.1518693208694458, "num_tokens": 44811679.0, "step": 20710 }, { "entropy": 6.483310317993164, "epoch": 2.2167050136443898, "grad_norm": 1.171875, "learning_rate": 0.0004513620550114027, "loss": 6.1158, "mean_token_accuracy": 0.1437581568956375, "num_tokens": 44821996.0, "step": 20715 }, { "entropy": 6.5152074813842775, "epoch": 2.217240087752154, "grad_norm": 1.2265625, "learning_rate": 0.00045133831055255234, "loss": 6.1569, "mean_token_accuracy": 0.14024235755205156, "num_tokens": 44833713.0, "step": 20720 }, { "entropy": 6.488360595703125, "epoch": 2.2177751618599175, "grad_norm": 1.7109375, "learning_rate": 0.0004513145610019581, "loss": 6.1457, "mean_token_accuracy": 0.1454211637377739, "num_tokens": 44844751.0, "step": 20725 }, { "entropy": 6.4918300151824955, "epoch": 2.2183102359676816, "grad_norm": 1.265625, "learning_rate": 0.00045129080636030554, "loss": 6.2091, "mean_token_accuracy": 0.13638500720262528, "num_tokens": 44856089.0, "step": 20730 }, { "entropy": 6.480890226364136, "epoch": 2.2188453100754453, "grad_norm": 1.2421875, "learning_rate": 0.0004512670466282808, "loss": 6.1417, "mean_token_accuracy": 0.14371456801891327, "num_tokens": 44867313.0, "step": 20735 }, { "entropy": 6.519718313217163, "epoch": 2.2193803841832094, "grad_norm": 1.4609375, "learning_rate": 0.00045124328180656993, "loss": 6.1312, "mean_token_accuracy": 0.1397297464311123, "num_tokens": 44878430.0, "step": 20740 }, { "entropy": 6.489490127563476, "epoch": 2.2199154582909735, "grad_norm": 1.1875, "learning_rate": 0.00045121951189585897, "loss": 6.0613, "mean_token_accuracy": 0.14514275640249252, "num_tokens": 44888746.0, "step": 20745 }, { "entropy": 6.483740425109863, "epoch": 2.220450532398737, "grad_norm": 1.9140625, "learning_rate": 0.00045119573689683445, "loss": 6.1958, "mean_token_accuracy": 0.13851530104875565, "num_tokens": 44899412.0, "step": 20750 }, { "entropy": 6.474801683425904, "epoch": 2.2209856065065012, "grad_norm": 1.53125, "learning_rate": 0.00045117195681018273, "loss": 6.1286, "mean_token_accuracy": 0.14496598690748214, "num_tokens": 44910362.0, "step": 20755 }, { "entropy": 6.451879596710205, "epoch": 2.221520680614265, "grad_norm": 1.2265625, "learning_rate": 0.0004511481716365905, "loss": 6.0745, "mean_token_accuracy": 0.14089406579732894, "num_tokens": 44920552.0, "step": 20760 }, { "entropy": 6.464407587051392, "epoch": 2.222055754722029, "grad_norm": 1.8828125, "learning_rate": 0.0004511243813767446, "loss": 6.1087, "mean_token_accuracy": 0.13718210086226462, "num_tokens": 44932090.0, "step": 20765 }, { "entropy": 6.502533960342407, "epoch": 2.222590828829793, "grad_norm": 1.40625, "learning_rate": 0.000451100586031332, "loss": 6.1519, "mean_token_accuracy": 0.1424417018890381, "num_tokens": 44944122.0, "step": 20770 }, { "entropy": 6.524023962020874, "epoch": 2.2231259029375567, "grad_norm": 1.4140625, "learning_rate": 0.00045107678560103953, "loss": 6.1409, "mean_token_accuracy": 0.14315226897597313, "num_tokens": 44955104.0, "step": 20775 }, { "entropy": 6.473584270477295, "epoch": 2.223660977045321, "grad_norm": 1.4453125, "learning_rate": 0.00045105298008655485, "loss": 6.0998, "mean_token_accuracy": 0.14250846058130265, "num_tokens": 44965495.0, "step": 20780 }, { "entropy": 6.4412439346313475, "epoch": 2.2241960511530845, "grad_norm": 1.5859375, "learning_rate": 0.00045102916948856493, "loss": 6.1709, "mean_token_accuracy": 0.13755118027329444, "num_tokens": 44976627.0, "step": 20785 }, { "entropy": 6.515741062164307, "epoch": 2.2247311252608486, "grad_norm": 1.453125, "learning_rate": 0.0004510053538077576, "loss": 6.1913, "mean_token_accuracy": 0.13910733982920648, "num_tokens": 44987955.0, "step": 20790 }, { "entropy": 6.549260854721069, "epoch": 2.2252661993686127, "grad_norm": 1.5390625, "learning_rate": 0.0004509815330448203, "loss": 6.1411, "mean_token_accuracy": 0.14129999950528144, "num_tokens": 44998124.0, "step": 20795 }, { "entropy": 6.513506078720093, "epoch": 2.2258012734763764, "grad_norm": 1.3671875, "learning_rate": 0.000450957707200441, "loss": 6.162, "mean_token_accuracy": 0.13884468376636505, "num_tokens": 45007881.0, "step": 20800 }, { "entropy": 6.476696252822876, "epoch": 2.2263363475841405, "grad_norm": 1.2421875, "learning_rate": 0.0004509338762753076, "loss": 6.1042, "mean_token_accuracy": 0.15047593265771866, "num_tokens": 45018994.0, "step": 20805 }, { "entropy": 6.48284068107605, "epoch": 2.2268714216919046, "grad_norm": 1.296875, "learning_rate": 0.0004509100402701083, "loss": 6.1856, "mean_token_accuracy": 0.14077048227190972, "num_tokens": 45030109.0, "step": 20810 }, { "entropy": 6.394616651535034, "epoch": 2.227406495799668, "grad_norm": 1.5078125, "learning_rate": 0.00045088619918553136, "loss": 6.071, "mean_token_accuracy": 0.15419016480445863, "num_tokens": 45039872.0, "step": 20815 }, { "entropy": 6.5200457096099855, "epoch": 2.2279415699074323, "grad_norm": 1.4765625, "learning_rate": 0.0004508623530222651, "loss": 6.0711, "mean_token_accuracy": 0.15519756972789764, "num_tokens": 45049216.0, "step": 20820 }, { "entropy": 6.387506532669067, "epoch": 2.228476644015196, "grad_norm": 1.34375, "learning_rate": 0.00045083850178099805, "loss": 6.053, "mean_token_accuracy": 0.15361984074115753, "num_tokens": 45059191.0, "step": 20825 }, { "entropy": 6.400663280487061, "epoch": 2.22901171812296, "grad_norm": 1.3515625, "learning_rate": 0.000450814645462419, "loss": 6.067, "mean_token_accuracy": 0.14758966714143754, "num_tokens": 45069212.0, "step": 20830 }, { "entropy": 6.452826261520386, "epoch": 2.229546792230724, "grad_norm": 1.40625, "learning_rate": 0.00045079078406721676, "loss": 6.0877, "mean_token_accuracy": 0.14639023467898368, "num_tokens": 45080248.0, "step": 20835 }, { "entropy": 6.441942977905273, "epoch": 2.230081866338488, "grad_norm": 1.390625, "learning_rate": 0.00045076691759608035, "loss": 6.1001, "mean_token_accuracy": 0.14331901520490647, "num_tokens": 45091315.0, "step": 20840 }, { "entropy": 6.432116222381592, "epoch": 2.230616940446252, "grad_norm": 1.4609375, "learning_rate": 0.00045074304604969886, "loss": 6.1112, "mean_token_accuracy": 0.14278898015618324, "num_tokens": 45102674.0, "step": 20845 }, { "entropy": 6.445503377914429, "epoch": 2.2311520145540156, "grad_norm": 1.1640625, "learning_rate": 0.00045071916942876163, "loss": 6.1134, "mean_token_accuracy": 0.14575490057468415, "num_tokens": 45113171.0, "step": 20850 }, { "entropy": 6.473908710479736, "epoch": 2.2316870886617797, "grad_norm": 1.1953125, "learning_rate": 0.0004506952877339581, "loss": 6.09, "mean_token_accuracy": 0.1474693901836872, "num_tokens": 45122912.0, "step": 20855 }, { "entropy": 6.509590673446655, "epoch": 2.2322221627695438, "grad_norm": 1.3828125, "learning_rate": 0.0004506714009659778, "loss": 6.1443, "mean_token_accuracy": 0.14192293658852578, "num_tokens": 45133839.0, "step": 20860 }, { "entropy": 6.463809442520142, "epoch": 2.2327572368773074, "grad_norm": 1.21875, "learning_rate": 0.0004506475091255105, "loss": 6.0903, "mean_token_accuracy": 0.14849280714988708, "num_tokens": 45144914.0, "step": 20865 }, { "entropy": 6.458927726745605, "epoch": 2.2332923109850715, "grad_norm": 1.2421875, "learning_rate": 0.000450623612213246, "loss": 6.1172, "mean_token_accuracy": 0.14825727343559264, "num_tokens": 45155194.0, "step": 20870 }, { "entropy": 6.455564641952515, "epoch": 2.233827385092835, "grad_norm": 1.3359375, "learning_rate": 0.00045059971022987446, "loss": 6.2117, "mean_token_accuracy": 0.13915288597345352, "num_tokens": 45166771.0, "step": 20875 }, { "entropy": 6.472472715377807, "epoch": 2.2343624592005993, "grad_norm": 1.515625, "learning_rate": 0.00045057580317608585, "loss": 6.0733, "mean_token_accuracy": 0.14202259555459024, "num_tokens": 45177236.0, "step": 20880 }, { "entropy": 6.467026233673096, "epoch": 2.2348975333083634, "grad_norm": 1.1171875, "learning_rate": 0.00045055189105257064, "loss": 6.101, "mean_token_accuracy": 0.1369931496679783, "num_tokens": 45187382.0, "step": 20885 }, { "entropy": 6.4739213466644285, "epoch": 2.235432607416127, "grad_norm": 1.1171875, "learning_rate": 0.00045052797386001936, "loss": 6.135, "mean_token_accuracy": 0.14757725447416306, "num_tokens": 45197287.0, "step": 20890 }, { "entropy": 6.542567539215088, "epoch": 2.235967681523891, "grad_norm": 1.25, "learning_rate": 0.0004505040515991224, "loss": 6.1003, "mean_token_accuracy": 0.14881971925497056, "num_tokens": 45208737.0, "step": 20895 }, { "entropy": 6.474895811080932, "epoch": 2.236502755631655, "grad_norm": 1.296875, "learning_rate": 0.00045048012427057057, "loss": 6.2149, "mean_token_accuracy": 0.13522807210683824, "num_tokens": 45219586.0, "step": 20900 }, { "entropy": 6.533901405334473, "epoch": 2.237037829739419, "grad_norm": 1.171875, "learning_rate": 0.0004504561918750549, "loss": 6.1848, "mean_token_accuracy": 0.13439816907048224, "num_tokens": 45230730.0, "step": 20905 }, { "entropy": 6.512403869628907, "epoch": 2.237572903847183, "grad_norm": 1.25, "learning_rate": 0.0004504322544132663, "loss": 6.0176, "mean_token_accuracy": 0.156698514521122, "num_tokens": 45241330.0, "step": 20910 }, { "entropy": 6.397086954116821, "epoch": 2.2381079779549466, "grad_norm": 1.3828125, "learning_rate": 0.000450408311885896, "loss": 6.1369, "mean_token_accuracy": 0.14560230374336242, "num_tokens": 45251439.0, "step": 20915 }, { "entropy": 6.404899740219117, "epoch": 2.2386430520627107, "grad_norm": 1.6640625, "learning_rate": 0.00045038436429363537, "loss": 5.946, "mean_token_accuracy": 0.14653594940900802, "num_tokens": 45262078.0, "step": 20920 }, { "entropy": 6.538563394546509, "epoch": 2.2391781261704744, "grad_norm": 1.4296875, "learning_rate": 0.00045036041163717586, "loss": 6.1535, "mean_token_accuracy": 0.14452334865927696, "num_tokens": 45272466.0, "step": 20925 }, { "entropy": 6.489725923538208, "epoch": 2.2397132002782385, "grad_norm": 1.3359375, "learning_rate": 0.0004503364539172091, "loss": 6.063, "mean_token_accuracy": 0.14924193769693375, "num_tokens": 45281830.0, "step": 20930 }, { "entropy": 6.410014581680298, "epoch": 2.2402482743860026, "grad_norm": 1.2578125, "learning_rate": 0.0004503124911344268, "loss": 6.1334, "mean_token_accuracy": 0.1358873277902603, "num_tokens": 45293026.0, "step": 20935 }, { "entropy": 6.527070951461792, "epoch": 2.2407833484937663, "grad_norm": 1.3125, "learning_rate": 0.00045028852328952106, "loss": 6.1164, "mean_token_accuracy": 0.14645038545131683, "num_tokens": 45303532.0, "step": 20940 }, { "entropy": 6.393893194198609, "epoch": 2.2413184226015304, "grad_norm": 1.5234375, "learning_rate": 0.0004502645503831838, "loss": 5.9992, "mean_token_accuracy": 0.155904184281826, "num_tokens": 45314448.0, "step": 20945 }, { "entropy": 6.44235200881958, "epoch": 2.241853496709294, "grad_norm": 1.296875, "learning_rate": 0.00045024057241610727, "loss": 6.1283, "mean_token_accuracy": 0.13548970520496367, "num_tokens": 45323194.0, "step": 20950 }, { "entropy": 6.47519154548645, "epoch": 2.242388570817058, "grad_norm": 1.3359375, "learning_rate": 0.0004502165893889839, "loss": 6.0086, "mean_token_accuracy": 0.16086768731474876, "num_tokens": 45333464.0, "step": 20955 }, { "entropy": 6.43692307472229, "epoch": 2.242923644924822, "grad_norm": 1.265625, "learning_rate": 0.0004501926013025061, "loss": 6.1404, "mean_token_accuracy": 0.14124525263905524, "num_tokens": 45344364.0, "step": 20960 }, { "entropy": 6.488691997528076, "epoch": 2.243458719032586, "grad_norm": 1.1484375, "learning_rate": 0.00045016860815736646, "loss": 6.0773, "mean_token_accuracy": 0.1473349779844284, "num_tokens": 45355202.0, "step": 20965 }, { "entropy": 6.460700845718383, "epoch": 2.24399379314035, "grad_norm": 1.4375, "learning_rate": 0.0004501446099542579, "loss": 6.0183, "mean_token_accuracy": 0.1478226363658905, "num_tokens": 45365696.0, "step": 20970 }, { "entropy": 6.4001140117645265, "epoch": 2.244528867248114, "grad_norm": 1.3515625, "learning_rate": 0.0004501206066938734, "loss": 6.042, "mean_token_accuracy": 0.15158791840076447, "num_tokens": 45376609.0, "step": 20975 }, { "entropy": 6.508848190307617, "epoch": 2.2450639413558777, "grad_norm": 1.3125, "learning_rate": 0.00045009659837690606, "loss": 6.2067, "mean_token_accuracy": 0.1312944307923317, "num_tokens": 45386158.0, "step": 20980 }, { "entropy": 6.593734455108643, "epoch": 2.245599015463642, "grad_norm": 1.34375, "learning_rate": 0.000450072585004049, "loss": 6.1805, "mean_token_accuracy": 0.14177413135766984, "num_tokens": 45396824.0, "step": 20985 }, { "entropy": 6.512286615371704, "epoch": 2.2461340895714055, "grad_norm": 1.1484375, "learning_rate": 0.0004500485665759955, "loss": 6.1002, "mean_token_accuracy": 0.1438503846526146, "num_tokens": 45407219.0, "step": 20990 }, { "entropy": 6.457460355758667, "epoch": 2.2466691636791696, "grad_norm": 1.6328125, "learning_rate": 0.0004500245430934394, "loss": 6.1737, "mean_token_accuracy": 0.13699991330504419, "num_tokens": 45418572.0, "step": 20995 }, { "entropy": 6.435413551330567, "epoch": 2.2472042377869337, "grad_norm": 1.515625, "learning_rate": 0.00045000051455707413, "loss": 6.0558, "mean_token_accuracy": 0.14574682861566543, "num_tokens": 45429643.0, "step": 21000 }, { "epoch": 2.2472042377869337, "eval_entropy": 6.317055676889548, "eval_loss": 6.256918907165527, "eval_mean_token_accuracy": 0.1449485192102985, "eval_num_tokens": 45429643.0, "eval_runtime": 22.62, "eval_samples_per_second": 1312.069, "eval_steps_per_second": 164.014, "step": 21000 }, { "entropy": 6.494276714324951, "epoch": 2.2477393118946973, "grad_norm": 1.296875, "learning_rate": 0.0004499764809675937, "loss": 6.0739, "mean_token_accuracy": 0.14799585938453674, "num_tokens": 45440183.0, "step": 21005 }, { "entropy": 6.423533725738525, "epoch": 2.2482743860024614, "grad_norm": 1.21875, "learning_rate": 0.0004499524423256918, "loss": 6.1315, "mean_token_accuracy": 0.14049314931035042, "num_tokens": 45451252.0, "step": 21010 }, { "entropy": 6.446270084381103, "epoch": 2.248809460110225, "grad_norm": 1.2890625, "learning_rate": 0.00044992839863206284, "loss": 6.1529, "mean_token_accuracy": 0.14202596694231034, "num_tokens": 45462336.0, "step": 21015 }, { "entropy": 6.494549989700317, "epoch": 2.249344534217989, "grad_norm": 1.3515625, "learning_rate": 0.00044990434988740095, "loss": 6.1111, "mean_token_accuracy": 0.14548687189817427, "num_tokens": 45472526.0, "step": 21020 }, { "entropy": 6.534965944290161, "epoch": 2.2498796083257533, "grad_norm": 1.21875, "learning_rate": 0.0004498802960924005, "loss": 6.1623, "mean_token_accuracy": 0.1365474358201027, "num_tokens": 45483281.0, "step": 21025 }, { "entropy": 6.523278141021729, "epoch": 2.250414682433517, "grad_norm": 1.3984375, "learning_rate": 0.0004498562372477561, "loss": 6.0969, "mean_token_accuracy": 0.14712547808885573, "num_tokens": 45494258.0, "step": 21030 }, { "entropy": 6.462643814086914, "epoch": 2.250949756541281, "grad_norm": 3.140625, "learning_rate": 0.0004498321733541624, "loss": 6.1257, "mean_token_accuracy": 0.14377980679273605, "num_tokens": 45504233.0, "step": 21035 }, { "entropy": 6.43720498085022, "epoch": 2.2514848306490447, "grad_norm": 2.046875, "learning_rate": 0.00044980810441231424, "loss": 6.1091, "mean_token_accuracy": 0.14584841281175615, "num_tokens": 45513902.0, "step": 21040 }, { "entropy": 6.470683479309082, "epoch": 2.252019904756809, "grad_norm": 1.21875, "learning_rate": 0.0004497840304229066, "loss": 6.1432, "mean_token_accuracy": 0.14411644488573075, "num_tokens": 45524111.0, "step": 21045 }, { "entropy": 6.498909044265747, "epoch": 2.252554978864573, "grad_norm": 1.28125, "learning_rate": 0.00044975995138663466, "loss": 6.1165, "mean_token_accuracy": 0.14330133497714997, "num_tokens": 45534816.0, "step": 21050 }, { "entropy": 6.501578044891358, "epoch": 2.2530900529723366, "grad_norm": 1.3046875, "learning_rate": 0.00044973586730419373, "loss": 6.0939, "mean_token_accuracy": 0.15145739763975144, "num_tokens": 45546012.0, "step": 21055 }, { "entropy": 6.460418462753296, "epoch": 2.2536251270801007, "grad_norm": 1.4296875, "learning_rate": 0.0004497117781762792, "loss": 6.0878, "mean_token_accuracy": 0.14586476534605025, "num_tokens": 45555402.0, "step": 21060 }, { "entropy": 6.412470436096191, "epoch": 2.2541602011878643, "grad_norm": 1.46875, "learning_rate": 0.0004496876840035866, "loss": 6.1348, "mean_token_accuracy": 0.14630192518234253, "num_tokens": 45565537.0, "step": 21065 }, { "entropy": 6.4964922904968265, "epoch": 2.2546952752956284, "grad_norm": 1.359375, "learning_rate": 0.00044966358478681163, "loss": 6.1322, "mean_token_accuracy": 0.14896186143159867, "num_tokens": 45576449.0, "step": 21070 }, { "entropy": 6.588002252578735, "epoch": 2.2552303494033925, "grad_norm": 1.4296875, "learning_rate": 0.0004496394805266502, "loss": 6.1342, "mean_token_accuracy": 0.13857141211628915, "num_tokens": 45586477.0, "step": 21075 }, { "entropy": 6.426201105117798, "epoch": 2.255765423511156, "grad_norm": 1.296875, "learning_rate": 0.00044961537122379844, "loss": 6.1119, "mean_token_accuracy": 0.1415586143732071, "num_tokens": 45597279.0, "step": 21080 }, { "entropy": 6.510368394851684, "epoch": 2.2563004976189203, "grad_norm": 1.4140625, "learning_rate": 0.0004495912568789522, "loss": 6.1828, "mean_token_accuracy": 0.13857755735516547, "num_tokens": 45608216.0, "step": 21085 }, { "entropy": 6.460128498077393, "epoch": 2.2568355717266844, "grad_norm": 1.671875, "learning_rate": 0.00044956713749280805, "loss": 6.0675, "mean_token_accuracy": 0.14786242842674255, "num_tokens": 45620665.0, "step": 21090 }, { "entropy": 6.492896175384521, "epoch": 2.257370645834448, "grad_norm": 1.5, "learning_rate": 0.00044954301306606234, "loss": 6.1246, "mean_token_accuracy": 0.14504493921995162, "num_tokens": 45631635.0, "step": 21095 }, { "entropy": 6.3591552734375, "epoch": 2.257905719942212, "grad_norm": 1.34375, "learning_rate": 0.00044951888359941156, "loss": 6.0239, "mean_token_accuracy": 0.1540983110666275, "num_tokens": 45642507.0, "step": 21100 }, { "entropy": 6.44664888381958, "epoch": 2.2584407940499758, "grad_norm": 1.4296875, "learning_rate": 0.00044949474909355264, "loss": 6.1223, "mean_token_accuracy": 0.14081369936466218, "num_tokens": 45653123.0, "step": 21105 }, { "entropy": 6.526295232772827, "epoch": 2.25897586815774, "grad_norm": 1.59375, "learning_rate": 0.00044947060954918233, "loss": 6.0962, "mean_token_accuracy": 0.14571473002433777, "num_tokens": 45663228.0, "step": 21110 }, { "entropy": 6.507929992675781, "epoch": 2.2595109422655035, "grad_norm": 1.5078125, "learning_rate": 0.0004494464649669976, "loss": 6.1017, "mean_token_accuracy": 0.1444193385541439, "num_tokens": 45673389.0, "step": 21115 }, { "entropy": 6.452843856811524, "epoch": 2.2600460163732676, "grad_norm": 1.2109375, "learning_rate": 0.00044942231534769587, "loss": 6.0979, "mean_token_accuracy": 0.14502233862876893, "num_tokens": 45684803.0, "step": 21120 }, { "entropy": 6.4407342910766605, "epoch": 2.2605810904810317, "grad_norm": 1.421875, "learning_rate": 0.00044939816069197415, "loss": 6.1393, "mean_token_accuracy": 0.14629731476306915, "num_tokens": 45695164.0, "step": 21125 }, { "entropy": 6.530598545074463, "epoch": 2.2611161645887954, "grad_norm": 1.4296875, "learning_rate": 0.00044937400100053017, "loss": 6.168, "mean_token_accuracy": 0.14665451049804687, "num_tokens": 45706169.0, "step": 21130 }, { "entropy": 6.569778633117676, "epoch": 2.2616512386965595, "grad_norm": 1.34375, "learning_rate": 0.0004493498362740613, "loss": 6.225, "mean_token_accuracy": 0.13544171154499055, "num_tokens": 45717299.0, "step": 21135 }, { "entropy": 6.448068857192993, "epoch": 2.2621863128043236, "grad_norm": 1.4453125, "learning_rate": 0.00044932566651326546, "loss": 6.1028, "mean_token_accuracy": 0.14793309047818184, "num_tokens": 45728815.0, "step": 21140 }, { "entropy": 6.507202816009522, "epoch": 2.2627213869120872, "grad_norm": 1.2578125, "learning_rate": 0.0004493014917188405, "loss": 6.1588, "mean_token_accuracy": 0.13971466943621635, "num_tokens": 45740293.0, "step": 21145 }, { "entropy": 6.530271005630493, "epoch": 2.2632564610198513, "grad_norm": 1.4453125, "learning_rate": 0.00044927731189148447, "loss": 6.094, "mean_token_accuracy": 0.14648326188325883, "num_tokens": 45751243.0, "step": 21150 }, { "entropy": 6.39956750869751, "epoch": 2.263791535127615, "grad_norm": 1.0859375, "learning_rate": 0.00044925312703189546, "loss": 6.0779, "mean_token_accuracy": 0.1459802970290184, "num_tokens": 45762477.0, "step": 21155 }, { "entropy": 6.4832066059112545, "epoch": 2.264326609235379, "grad_norm": 1.7890625, "learning_rate": 0.000449228937140772, "loss": 6.1027, "mean_token_accuracy": 0.14622026681900024, "num_tokens": 45772929.0, "step": 21160 }, { "entropy": 6.514123630523682, "epoch": 2.264861683343143, "grad_norm": 1.1640625, "learning_rate": 0.00044920474221881243, "loss": 6.0967, "mean_token_accuracy": 0.14877657741308212, "num_tokens": 45782999.0, "step": 21165 }, { "entropy": 6.420357942581177, "epoch": 2.265396757450907, "grad_norm": 1.15625, "learning_rate": 0.00044918054226671545, "loss": 6.1001, "mean_token_accuracy": 0.15075411200523375, "num_tokens": 45793020.0, "step": 21170 }, { "entropy": 6.476064825057984, "epoch": 2.265931831558671, "grad_norm": 1.359375, "learning_rate": 0.00044915633728517975, "loss": 6.0645, "mean_token_accuracy": 0.15408962965011597, "num_tokens": 45803020.0, "step": 21175 }, { "entropy": 6.486395454406738, "epoch": 2.2664669056664346, "grad_norm": 1.234375, "learning_rate": 0.0004491321272749042, "loss": 6.1312, "mean_token_accuracy": 0.14978941082954406, "num_tokens": 45812700.0, "step": 21180 }, { "entropy": 6.529626274108887, "epoch": 2.2670019797741987, "grad_norm": 1.2734375, "learning_rate": 0.00044910791223658805, "loss": 6.1649, "mean_token_accuracy": 0.13963496387004853, "num_tokens": 45823097.0, "step": 21185 }, { "entropy": 6.494238567352295, "epoch": 2.267537053881963, "grad_norm": 4.03125, "learning_rate": 0.00044908369217093035, "loss": 6.0833, "mean_token_accuracy": 0.14395482316613198, "num_tokens": 45832935.0, "step": 21190 }, { "entropy": 6.492327690124512, "epoch": 2.2680721279897265, "grad_norm": 1.46875, "learning_rate": 0.00044905946707863057, "loss": 6.1948, "mean_token_accuracy": 0.13675348609685897, "num_tokens": 45844296.0, "step": 21195 }, { "entropy": 6.514334344863892, "epoch": 2.2686072020974906, "grad_norm": 1.7109375, "learning_rate": 0.0004490352369603881, "loss": 6.1275, "mean_token_accuracy": 0.14247518181800842, "num_tokens": 45854942.0, "step": 21200 }, { "entropy": 6.535731410980224, "epoch": 2.2691422762052547, "grad_norm": 1.2265625, "learning_rate": 0.00044901100181690256, "loss": 6.1779, "mean_token_accuracy": 0.14441046714782715, "num_tokens": 45866427.0, "step": 21205 }, { "entropy": 6.499472713470459, "epoch": 2.2696773503130183, "grad_norm": 1.2265625, "learning_rate": 0.00044898676164887387, "loss": 6.1453, "mean_token_accuracy": 0.14784806817770005, "num_tokens": 45877955.0, "step": 21210 }, { "entropy": 6.450230550765991, "epoch": 2.2702124244207824, "grad_norm": 1.3828125, "learning_rate": 0.00044896251645700185, "loss": 6.0154, "mean_token_accuracy": 0.15432262271642685, "num_tokens": 45888668.0, "step": 21215 }, { "entropy": 6.416332054138183, "epoch": 2.270747498528546, "grad_norm": 1.09375, "learning_rate": 0.0004489382662419866, "loss": 6.1028, "mean_token_accuracy": 0.1441604271531105, "num_tokens": 45898819.0, "step": 21220 }, { "entropy": 6.430312633514404, "epoch": 2.27128257263631, "grad_norm": 1.3671875, "learning_rate": 0.0004489140110045283, "loss": 6.1472, "mean_token_accuracy": 0.1442831501364708, "num_tokens": 45909390.0, "step": 21225 }, { "entropy": 6.480388879776001, "epoch": 2.271817646744074, "grad_norm": 1.1484375, "learning_rate": 0.0004488897507453275, "loss": 6.0749, "mean_token_accuracy": 0.14615595564246178, "num_tokens": 45919697.0, "step": 21230 }, { "entropy": 6.538076448440552, "epoch": 2.272352720851838, "grad_norm": 1.3359375, "learning_rate": 0.00044886548546508453, "loss": 6.168, "mean_token_accuracy": 0.1460796669125557, "num_tokens": 45929458.0, "step": 21235 }, { "entropy": 6.38146276473999, "epoch": 2.272887794959602, "grad_norm": 3.140625, "learning_rate": 0.0004488412151645001, "loss": 6.0441, "mean_token_accuracy": 0.14515896439552306, "num_tokens": 45939373.0, "step": 21240 }, { "entropy": 6.384886407852173, "epoch": 2.2734228690673657, "grad_norm": 1.5703125, "learning_rate": 0.00044881693984427504, "loss": 6.1016, "mean_token_accuracy": 0.14431605264544486, "num_tokens": 45949954.0, "step": 21245 }, { "entropy": 6.547086715698242, "epoch": 2.27395794317513, "grad_norm": 2.109375, "learning_rate": 0.0004487926595051102, "loss": 6.1483, "mean_token_accuracy": 0.1462262287735939, "num_tokens": 45960147.0, "step": 21250 }, { "entropy": 6.472574758529663, "epoch": 2.274493017282894, "grad_norm": 1.5234375, "learning_rate": 0.0004487683741477068, "loss": 6.0799, "mean_token_accuracy": 0.14728278070688247, "num_tokens": 45970718.0, "step": 21255 }, { "entropy": 6.425560331344604, "epoch": 2.2750280913906575, "grad_norm": 1.3828125, "learning_rate": 0.000448744083772766, "loss": 6.1151, "mean_token_accuracy": 0.1458531104028225, "num_tokens": 45981631.0, "step": 21260 }, { "entropy": 6.528663396835327, "epoch": 2.2755631654984216, "grad_norm": 1.5078125, "learning_rate": 0.00044871978838098917, "loss": 6.1722, "mean_token_accuracy": 0.13858664259314538, "num_tokens": 45992295.0, "step": 21265 }, { "entropy": 6.566414642333984, "epoch": 2.2760982396061853, "grad_norm": 1.265625, "learning_rate": 0.0004486954879730778, "loss": 6.143, "mean_token_accuracy": 0.1391966737806797, "num_tokens": 46002222.0, "step": 21270 }, { "entropy": 6.421219158172607, "epoch": 2.2766333137139494, "grad_norm": 1.3359375, "learning_rate": 0.0004486711825497337, "loss": 6.0149, "mean_token_accuracy": 0.1610435277223587, "num_tokens": 46012393.0, "step": 21275 }, { "entropy": 6.427218294143676, "epoch": 2.2771683878217135, "grad_norm": 1.140625, "learning_rate": 0.00044864687211165863, "loss": 6.0985, "mean_token_accuracy": 0.14419070109725, "num_tokens": 46022095.0, "step": 21280 }, { "entropy": 6.464762258529663, "epoch": 2.277703461929477, "grad_norm": 1.0703125, "learning_rate": 0.00044862255665955447, "loss": 6.1008, "mean_token_accuracy": 0.14105332791805267, "num_tokens": 46032973.0, "step": 21285 }, { "entropy": 6.492861986160278, "epoch": 2.2782385360372412, "grad_norm": 1.234375, "learning_rate": 0.0004485982361941234, "loss": 6.1009, "mean_token_accuracy": 0.1447777658700943, "num_tokens": 46043430.0, "step": 21290 }, { "entropy": 6.460416078567505, "epoch": 2.278773610145005, "grad_norm": 1.0859375, "learning_rate": 0.0004485739107160677, "loss": 6.0966, "mean_token_accuracy": 0.1445997916162014, "num_tokens": 46054580.0, "step": 21295 }, { "entropy": 6.481352138519287, "epoch": 2.279308684252769, "grad_norm": 1.203125, "learning_rate": 0.00044854958022608974, "loss": 6.1135, "mean_token_accuracy": 0.14967705085873603, "num_tokens": 46064898.0, "step": 21300 }, { "entropy": 6.406143474578857, "epoch": 2.279843758360533, "grad_norm": 2.171875, "learning_rate": 0.00044852524472489196, "loss": 6.0755, "mean_token_accuracy": 0.14774246960878373, "num_tokens": 46075985.0, "step": 21305 }, { "entropy": 6.512715768814087, "epoch": 2.2803788324682968, "grad_norm": 1.5078125, "learning_rate": 0.0004485009042131771, "loss": 6.1958, "mean_token_accuracy": 0.13976200819015502, "num_tokens": 46087544.0, "step": 21310 }, { "entropy": 6.571082544326782, "epoch": 2.280913906576061, "grad_norm": 1.296875, "learning_rate": 0.00044847655869164813, "loss": 6.1119, "mean_token_accuracy": 0.13850533664226533, "num_tokens": 46097613.0, "step": 21315 }, { "entropy": 6.423566579818726, "epoch": 2.281448980683825, "grad_norm": 1.296875, "learning_rate": 0.0004484522081610078, "loss": 6.0271, "mean_token_accuracy": 0.15793740898370742, "num_tokens": 46107728.0, "step": 21320 }, { "entropy": 6.400497674942017, "epoch": 2.2819840547915886, "grad_norm": 1.1484375, "learning_rate": 0.00044842785262195936, "loss": 6.0673, "mean_token_accuracy": 0.14456717669963837, "num_tokens": 46118309.0, "step": 21325 }, { "entropy": 6.467321157455444, "epoch": 2.2825191288993527, "grad_norm": 1.53125, "learning_rate": 0.00044840349207520604, "loss": 6.0903, "mean_token_accuracy": 0.1494164675474167, "num_tokens": 46128425.0, "step": 21330 }, { "entropy": 6.545786046981812, "epoch": 2.2830542030071164, "grad_norm": 1.4375, "learning_rate": 0.0004483791265214513, "loss": 6.2186, "mean_token_accuracy": 0.13865891844034195, "num_tokens": 46139506.0, "step": 21335 }, { "entropy": 6.482575273513794, "epoch": 2.2835892771148805, "grad_norm": 1.1484375, "learning_rate": 0.00044835475596139855, "loss": 6.1147, "mean_token_accuracy": 0.1408474177122116, "num_tokens": 46151226.0, "step": 21340 }, { "entropy": 6.514735078811645, "epoch": 2.284124351222644, "grad_norm": 1.71875, "learning_rate": 0.0004483303803957516, "loss": 6.1725, "mean_token_accuracy": 0.14154839813709258, "num_tokens": 46162749.0, "step": 21345 }, { "entropy": 6.514428520202637, "epoch": 2.2846594253304082, "grad_norm": 1.3671875, "learning_rate": 0.0004483059998252144, "loss": 6.1486, "mean_token_accuracy": 0.14344518333673478, "num_tokens": 46174802.0, "step": 21350 }, { "entropy": 6.512063503265381, "epoch": 2.2851944994381723, "grad_norm": 1.6015625, "learning_rate": 0.00044828161425049067, "loss": 6.1084, "mean_token_accuracy": 0.1469471648335457, "num_tokens": 46185579.0, "step": 21355 }, { "entropy": 6.490062093734741, "epoch": 2.285729573545936, "grad_norm": 1.3046875, "learning_rate": 0.00044825722367228477, "loss": 6.2184, "mean_token_accuracy": 0.1354774422943592, "num_tokens": 46196399.0, "step": 21360 }, { "entropy": 6.4843651294708256, "epoch": 2.2862646476537, "grad_norm": 1.1640625, "learning_rate": 0.00044823282809130084, "loss": 6.1173, "mean_token_accuracy": 0.1408316098153591, "num_tokens": 46206931.0, "step": 21365 }, { "entropy": 6.480353307723999, "epoch": 2.286799721761464, "grad_norm": 1.3046875, "learning_rate": 0.00044820842750824334, "loss": 6.123, "mean_token_accuracy": 0.14742770195007324, "num_tokens": 46217327.0, "step": 21370 }, { "entropy": 6.464926624298096, "epoch": 2.287334795869228, "grad_norm": 1.2109375, "learning_rate": 0.00044818402192381684, "loss": 6.1024, "mean_token_accuracy": 0.14369666427373887, "num_tokens": 46227981.0, "step": 21375 }, { "entropy": 6.46083517074585, "epoch": 2.287869869976992, "grad_norm": 1.34375, "learning_rate": 0.00044815961133872606, "loss": 6.1759, "mean_token_accuracy": 0.1374279096722603, "num_tokens": 46238500.0, "step": 21380 }, { "entropy": 6.423061943054199, "epoch": 2.2884049440847556, "grad_norm": 1.3359375, "learning_rate": 0.00044813519575367586, "loss": 6.0463, "mean_token_accuracy": 0.15272779762744904, "num_tokens": 46249530.0, "step": 21385 }, { "entropy": 6.463318729400635, "epoch": 2.2889400181925197, "grad_norm": 1.4140625, "learning_rate": 0.0004481107751693711, "loss": 6.0172, "mean_token_accuracy": 0.14625746756792068, "num_tokens": 46260272.0, "step": 21390 }, { "entropy": 6.405825805664063, "epoch": 2.2894750923002833, "grad_norm": 1.40625, "learning_rate": 0.0004480863495865171, "loss": 6.0766, "mean_token_accuracy": 0.14429645165801047, "num_tokens": 46271805.0, "step": 21395 }, { "entropy": 6.4480000019073485, "epoch": 2.2900101664080474, "grad_norm": 1.4453125, "learning_rate": 0.0004480619190058191, "loss": 6.1459, "mean_token_accuracy": 0.146460422873497, "num_tokens": 46282211.0, "step": 21400 }, { "entropy": 6.375118398666382, "epoch": 2.2905452405158115, "grad_norm": 1.328125, "learning_rate": 0.00044803748342798247, "loss": 6.038, "mean_token_accuracy": 0.14773557037115098, "num_tokens": 46292287.0, "step": 21405 }, { "entropy": 6.414663934707642, "epoch": 2.291080314623575, "grad_norm": 1.4140625, "learning_rate": 0.00044801304285371286, "loss": 6.1597, "mean_token_accuracy": 0.14005930796265603, "num_tokens": 46302978.0, "step": 21410 }, { "entropy": 6.48315954208374, "epoch": 2.2916153887313393, "grad_norm": 1.2578125, "learning_rate": 0.0004479885972837159, "loss": 6.136, "mean_token_accuracy": 0.1436718448996544, "num_tokens": 46313958.0, "step": 21415 }, { "entropy": 6.573699235916138, "epoch": 2.2921504628391034, "grad_norm": 1.359375, "learning_rate": 0.0004479641467186975, "loss": 6.1423, "mean_token_accuracy": 0.13935375362634658, "num_tokens": 46325262.0, "step": 21420 }, { "entropy": 6.473975706100464, "epoch": 2.292685536946867, "grad_norm": 1.125, "learning_rate": 0.00044793969115936375, "loss": 6.1566, "mean_token_accuracy": 0.14281628876924515, "num_tokens": 46336773.0, "step": 21425 }, { "entropy": 6.408493328094482, "epoch": 2.293220611054631, "grad_norm": 1.328125, "learning_rate": 0.0004479152306064207, "loss": 6.1091, "mean_token_accuracy": 0.1484253726899624, "num_tokens": 46346616.0, "step": 21430 }, { "entropy": 6.433761548995972, "epoch": 2.293755685162395, "grad_norm": 1.2734375, "learning_rate": 0.0004478907650605745, "loss": 6.142, "mean_token_accuracy": 0.14191639199852943, "num_tokens": 46358564.0, "step": 21435 }, { "entropy": 6.500779056549073, "epoch": 2.294290759270159, "grad_norm": 1.2578125, "learning_rate": 0.00044786629452253196, "loss": 6.0045, "mean_token_accuracy": 0.1546463519334793, "num_tokens": 46369207.0, "step": 21440 }, { "entropy": 6.500661611557007, "epoch": 2.294825833377923, "grad_norm": 1.2890625, "learning_rate": 0.0004478418189929994, "loss": 6.1084, "mean_token_accuracy": 0.1481148973107338, "num_tokens": 46379382.0, "step": 21445 }, { "entropy": 6.394848299026489, "epoch": 2.2953609074856867, "grad_norm": 1.296875, "learning_rate": 0.00044781733847268357, "loss": 6.2088, "mean_token_accuracy": 0.13839469999074935, "num_tokens": 46390738.0, "step": 21450 }, { "entropy": 6.445329666137695, "epoch": 2.2958959815934508, "grad_norm": 1.15625, "learning_rate": 0.00044779285296229137, "loss": 6.0085, "mean_token_accuracy": 0.15295333862304689, "num_tokens": 46401740.0, "step": 21455 }, { "entropy": 6.529813671112061, "epoch": 2.2964310557012144, "grad_norm": 1.25, "learning_rate": 0.00044776836246252985, "loss": 6.0751, "mean_token_accuracy": 0.14564138129353524, "num_tokens": 46412009.0, "step": 21460 }, { "entropy": 6.511179065704345, "epoch": 2.2969661298089785, "grad_norm": 1.1640625, "learning_rate": 0.0004477438669741061, "loss": 6.1671, "mean_token_accuracy": 0.14272557497024535, "num_tokens": 46422550.0, "step": 21465 }, { "entropy": 6.48570294380188, "epoch": 2.2975012039167426, "grad_norm": 1.4140625, "learning_rate": 0.0004477193664977275, "loss": 6.1433, "mean_token_accuracy": 0.142554097622633, "num_tokens": 46432797.0, "step": 21470 }, { "entropy": 6.362465810775757, "epoch": 2.2980362780245063, "grad_norm": 1.3046875, "learning_rate": 0.0004476948610341015, "loss": 5.9686, "mean_token_accuracy": 0.15197512730956078, "num_tokens": 46444638.0, "step": 21475 }, { "entropy": 6.499190998077393, "epoch": 2.2985713521322704, "grad_norm": 1.2109375, "learning_rate": 0.00044767035058393564, "loss": 6.0627, "mean_token_accuracy": 0.14615911543369292, "num_tokens": 46455404.0, "step": 21480 }, { "entropy": 6.454323482513428, "epoch": 2.2991064262400345, "grad_norm": 1.2265625, "learning_rate": 0.00044764583514793766, "loss": 6.1519, "mean_token_accuracy": 0.14273363053798677, "num_tokens": 46466821.0, "step": 21485 }, { "entropy": 6.49699592590332, "epoch": 2.299641500347798, "grad_norm": 1.1796875, "learning_rate": 0.0004476213147268154, "loss": 6.1234, "mean_token_accuracy": 0.1443875789642334, "num_tokens": 46477222.0, "step": 21490 }, { "entropy": 6.466975498199463, "epoch": 2.3001765744555622, "grad_norm": 1.265625, "learning_rate": 0.00044759678932127693, "loss": 6.0676, "mean_token_accuracy": 0.1496296063065529, "num_tokens": 46488596.0, "step": 21495 }, { "entropy": 6.467964744567871, "epoch": 2.300711648563326, "grad_norm": 1.578125, "learning_rate": 0.00044757225893203047, "loss": 6.1381, "mean_token_accuracy": 0.13738736882805824, "num_tokens": 46499799.0, "step": 21500 }, { "entropy": 6.530542659759521, "epoch": 2.30124672267109, "grad_norm": 1.234375, "learning_rate": 0.0004475477235597843, "loss": 6.1504, "mean_token_accuracy": 0.1487916424870491, "num_tokens": 46511077.0, "step": 21505 }, { "entropy": 6.540336608886719, "epoch": 2.3017817967788536, "grad_norm": 1.921875, "learning_rate": 0.0004475231832052469, "loss": 6.1816, "mean_token_accuracy": 0.13712119460105895, "num_tokens": 46523517.0, "step": 21510 }, { "entropy": 6.44324221611023, "epoch": 2.3023168708866177, "grad_norm": 1.3046875, "learning_rate": 0.0004474986378691267, "loss": 6.0796, "mean_token_accuracy": 0.1514226734638214, "num_tokens": 46533198.0, "step": 21515 }, { "entropy": 6.458317995071411, "epoch": 2.302851944994382, "grad_norm": 1.515625, "learning_rate": 0.00044747408755213265, "loss": 6.1211, "mean_token_accuracy": 0.1400451898574829, "num_tokens": 46544659.0, "step": 21520 }, { "entropy": 6.464485597610474, "epoch": 2.3033870191021455, "grad_norm": 1.265625, "learning_rate": 0.00044744953225497354, "loss": 6.0885, "mean_token_accuracy": 0.13881469368934632, "num_tokens": 46555897.0, "step": 21525 }, { "entropy": 6.473492383956909, "epoch": 2.3039220932099096, "grad_norm": 1.1875, "learning_rate": 0.00044742497197835845, "loss": 6.0981, "mean_token_accuracy": 0.1433671548962593, "num_tokens": 46565695.0, "step": 21530 }, { "entropy": 6.486868143081665, "epoch": 2.3044571673176737, "grad_norm": 1.234375, "learning_rate": 0.0004474004067229965, "loss": 6.1661, "mean_token_accuracy": 0.13898584991693497, "num_tokens": 46576620.0, "step": 21535 }, { "entropy": 6.560863399505616, "epoch": 2.3049922414254373, "grad_norm": 1.359375, "learning_rate": 0.000447375836489597, "loss": 6.1999, "mean_token_accuracy": 0.13523969948291778, "num_tokens": 46588264.0, "step": 21540 }, { "entropy": 6.492392110824585, "epoch": 2.3055273155332014, "grad_norm": 1.5234375, "learning_rate": 0.00044735126127886944, "loss": 6.1139, "mean_token_accuracy": 0.1459447041153908, "num_tokens": 46600180.0, "step": 21545 }, { "entropy": 6.416586303710938, "epoch": 2.306062389640965, "grad_norm": 1.6953125, "learning_rate": 0.0004473266810915235, "loss": 6.1079, "mean_token_accuracy": 0.14974152147769929, "num_tokens": 46610391.0, "step": 21550 }, { "entropy": 6.444928407669067, "epoch": 2.306597463748729, "grad_norm": 2.265625, "learning_rate": 0.0004473020959282688, "loss": 6.1754, "mean_token_accuracy": 0.14088292866945268, "num_tokens": 46622955.0, "step": 21555 }, { "entropy": 6.541250991821289, "epoch": 2.3071325378564933, "grad_norm": 1.4140625, "learning_rate": 0.00044727750578981535, "loss": 6.1494, "mean_token_accuracy": 0.14749521464109422, "num_tokens": 46632361.0, "step": 21560 }, { "entropy": 6.483514499664307, "epoch": 2.307667611964257, "grad_norm": 2.34375, "learning_rate": 0.0004472529106768731, "loss": 6.0878, "mean_token_accuracy": 0.14300166070461273, "num_tokens": 46642693.0, "step": 21565 }, { "entropy": 6.432924032211304, "epoch": 2.308202686072021, "grad_norm": 1.34375, "learning_rate": 0.0004472283105901522, "loss": 6.0188, "mean_token_accuracy": 0.1453826680779457, "num_tokens": 46653251.0, "step": 21570 }, { "entropy": 6.4843464374542235, "epoch": 2.3087377601797847, "grad_norm": 1.34375, "learning_rate": 0.0004472037055303631, "loss": 6.1826, "mean_token_accuracy": 0.13390331342816353, "num_tokens": 46664751.0, "step": 21575 }, { "entropy": 6.408978414535523, "epoch": 2.309272834287549, "grad_norm": 1.3671875, "learning_rate": 0.0004471790954982162, "loss": 6.0845, "mean_token_accuracy": 0.13748776018619538, "num_tokens": 46676825.0, "step": 21580 }, { "entropy": 6.457317972183228, "epoch": 2.309807908395313, "grad_norm": 1.328125, "learning_rate": 0.0004471544804944221, "loss": 6.0559, "mean_token_accuracy": 0.15056889727711678, "num_tokens": 46687202.0, "step": 21585 }, { "entropy": 6.474427318572998, "epoch": 2.3103429825030766, "grad_norm": 1.234375, "learning_rate": 0.0004471298605196916, "loss": 6.1895, "mean_token_accuracy": 0.14413033798336983, "num_tokens": 46697687.0, "step": 21590 }, { "entropy": 6.399207735061646, "epoch": 2.3108780566108407, "grad_norm": 1.6875, "learning_rate": 0.00044710523557473544, "loss": 6.0625, "mean_token_accuracy": 0.14721462577581407, "num_tokens": 46709088.0, "step": 21595 }, { "entropy": 6.450528955459594, "epoch": 2.3114131307186048, "grad_norm": 1.3046875, "learning_rate": 0.00044708060566026487, "loss": 6.1467, "mean_token_accuracy": 0.1441744640469551, "num_tokens": 46721675.0, "step": 21600 }, { "entropy": 6.5083414077758786, "epoch": 2.3119482048263684, "grad_norm": 1.21875, "learning_rate": 0.000447055970776991, "loss": 6.146, "mean_token_accuracy": 0.14367825761437417, "num_tokens": 46731854.0, "step": 21605 }, { "entropy": 6.498157739639282, "epoch": 2.3124832789341325, "grad_norm": 1.203125, "learning_rate": 0.00044703133092562514, "loss": 6.1645, "mean_token_accuracy": 0.1401453897356987, "num_tokens": 46742815.0, "step": 21610 }, { "entropy": 6.444508695602417, "epoch": 2.313018353041896, "grad_norm": 1.65625, "learning_rate": 0.00044700668610687884, "loss": 6.1099, "mean_token_accuracy": 0.1517878845334053, "num_tokens": 46753012.0, "step": 21615 }, { "entropy": 6.400829458236695, "epoch": 2.3135534271496603, "grad_norm": 1.328125, "learning_rate": 0.00044698203632146353, "loss": 6.0944, "mean_token_accuracy": 0.14552355259656907, "num_tokens": 46763701.0, "step": 21620 }, { "entropy": 6.538299131393432, "epoch": 2.314088501257424, "grad_norm": 1.4921875, "learning_rate": 0.0004469573815700911, "loss": 6.1682, "mean_token_accuracy": 0.13725191131234168, "num_tokens": 46775407.0, "step": 21625 }, { "entropy": 6.443868112564087, "epoch": 2.314623575365188, "grad_norm": 1.5390625, "learning_rate": 0.00044693272185347357, "loss": 6.0412, "mean_token_accuracy": 0.1495553120970726, "num_tokens": 46786282.0, "step": 21630 }, { "entropy": 6.434365463256836, "epoch": 2.315158649472952, "grad_norm": 1.3046875, "learning_rate": 0.0004469080571723228, "loss": 6.137, "mean_token_accuracy": 0.14069043099880219, "num_tokens": 46796768.0, "step": 21635 }, { "entropy": 6.460161018371582, "epoch": 2.315693723580716, "grad_norm": 1.5546875, "learning_rate": 0.00044688338752735095, "loss": 6.0414, "mean_token_accuracy": 0.1459738865494728, "num_tokens": 46806538.0, "step": 21640 }, { "entropy": 6.436695194244384, "epoch": 2.31622879768848, "grad_norm": 1.453125, "learning_rate": 0.0004468587129192705, "loss": 6.0413, "mean_token_accuracy": 0.15677194446325302, "num_tokens": 46816692.0, "step": 21645 }, { "entropy": 6.412927484512329, "epoch": 2.316763871796244, "grad_norm": 1.765625, "learning_rate": 0.00044683403334879384, "loss": 6.1357, "mean_token_accuracy": 0.14876748770475387, "num_tokens": 46827551.0, "step": 21650 }, { "entropy": 6.446659421920776, "epoch": 2.3172989459040076, "grad_norm": 1.28125, "learning_rate": 0.0004468093488166337, "loss": 6.255, "mean_token_accuracy": 0.13067039772868155, "num_tokens": 46840168.0, "step": 21655 }, { "entropy": 6.497695875167847, "epoch": 2.3178340200117717, "grad_norm": 1.21875, "learning_rate": 0.00044678465932350273, "loss": 6.1072, "mean_token_accuracy": 0.1501982994377613, "num_tokens": 46851086.0, "step": 21660 }, { "entropy": 6.443648338317871, "epoch": 2.3183690941195354, "grad_norm": 1.296875, "learning_rate": 0.00044675996487011373, "loss": 6.0513, "mean_token_accuracy": 0.15467752665281295, "num_tokens": 46861830.0, "step": 21665 }, { "entropy": 6.460092782974243, "epoch": 2.3189041682272995, "grad_norm": 2.5, "learning_rate": 0.00044673526545718, "loss": 6.1229, "mean_token_accuracy": 0.15216980874538422, "num_tokens": 46871348.0, "step": 21670 }, { "entropy": 6.397512769699096, "epoch": 2.3194392423350636, "grad_norm": 1.2421875, "learning_rate": 0.0004467105610854146, "loss": 6.1126, "mean_token_accuracy": 0.1430137500166893, "num_tokens": 46882737.0, "step": 21675 }, { "entropy": 6.517483139038086, "epoch": 2.3199743164428273, "grad_norm": 1.25, "learning_rate": 0.00044668585175553085, "loss": 6.1837, "mean_token_accuracy": 0.13247976154088975, "num_tokens": 46893616.0, "step": 21680 }, { "entropy": 6.594755077362061, "epoch": 2.3205093905505914, "grad_norm": 1.40625, "learning_rate": 0.0004466611374682423, "loss": 6.1107, "mean_token_accuracy": 0.14227721691131592, "num_tokens": 46904546.0, "step": 21685 }, { "entropy": 6.500962781906128, "epoch": 2.321044464658355, "grad_norm": 1.171875, "learning_rate": 0.00044663641822426244, "loss": 6.0923, "mean_token_accuracy": 0.1464128315448761, "num_tokens": 46915513.0, "step": 21690 }, { "entropy": 6.531744813919067, "epoch": 2.321579538766119, "grad_norm": 1.21875, "learning_rate": 0.00044661169402430517, "loss": 6.1596, "mean_token_accuracy": 0.14340778365731238, "num_tokens": 46925535.0, "step": 21695 }, { "entropy": 6.402699422836304, "epoch": 2.322114612873883, "grad_norm": 1.7578125, "learning_rate": 0.00044658696486908443, "loss": 6.1367, "mean_token_accuracy": 0.14523040503263474, "num_tokens": 46936222.0, "step": 21700 }, { "entropy": 6.4080376625061035, "epoch": 2.322649686981647, "grad_norm": 1.59375, "learning_rate": 0.0004465622307593141, "loss": 6.0408, "mean_token_accuracy": 0.15628817230463027, "num_tokens": 46946855.0, "step": 21705 }, { "entropy": 6.500241661071778, "epoch": 2.323184761089411, "grad_norm": 1.2734375, "learning_rate": 0.00044653749169570845, "loss": 6.1138, "mean_token_accuracy": 0.1438905455172062, "num_tokens": 46958246.0, "step": 21710 }, { "entropy": 6.426049470901489, "epoch": 2.3237198351971746, "grad_norm": 1.4375, "learning_rate": 0.00044651274767898186, "loss": 6.1027, "mean_token_accuracy": 0.15005214810371398, "num_tokens": 46969237.0, "step": 21715 }, { "entropy": 6.497728538513184, "epoch": 2.3242549093049387, "grad_norm": 1.3046875, "learning_rate": 0.0004464879987098488, "loss": 6.181, "mean_token_accuracy": 0.145807583630085, "num_tokens": 46979897.0, "step": 21720 }, { "entropy": 6.512001848220825, "epoch": 2.324789983412703, "grad_norm": 1.375, "learning_rate": 0.0004464632447890238, "loss": 6.062, "mean_token_accuracy": 0.1542833387851715, "num_tokens": 46989833.0, "step": 21725 }, { "entropy": 6.40179762840271, "epoch": 2.3253250575204665, "grad_norm": 1.28125, "learning_rate": 0.00044643848591722183, "loss": 6.0673, "mean_token_accuracy": 0.15154348015785218, "num_tokens": 46999822.0, "step": 21730 }, { "entropy": 6.415911293029785, "epoch": 2.3258601316282306, "grad_norm": 1.2890625, "learning_rate": 0.00044641372209515764, "loss": 6.0766, "mean_token_accuracy": 0.15227730497717856, "num_tokens": 47010176.0, "step": 21735 }, { "entropy": 6.408161258697509, "epoch": 2.3263952057359942, "grad_norm": 1.53125, "learning_rate": 0.0004463889533235462, "loss": 6.0748, "mean_token_accuracy": 0.149746111035347, "num_tokens": 47020184.0, "step": 21740 }, { "entropy": 6.489200210571289, "epoch": 2.3269302798437583, "grad_norm": 1.3671875, "learning_rate": 0.00044636417960310294, "loss": 6.1908, "mean_token_accuracy": 0.14212247133255004, "num_tokens": 47032066.0, "step": 21745 }, { "entropy": 6.504646682739258, "epoch": 2.3274653539515224, "grad_norm": 1.4375, "learning_rate": 0.0004463394009345431, "loss": 6.1965, "mean_token_accuracy": 0.13769288137555122, "num_tokens": 47043571.0, "step": 21750 }, { "entropy": 6.5607038021087645, "epoch": 2.328000428059286, "grad_norm": 1.703125, "learning_rate": 0.00044631461731858195, "loss": 6.1135, "mean_token_accuracy": 0.14365242198109626, "num_tokens": 47053813.0, "step": 21755 }, { "entropy": 6.518549680709839, "epoch": 2.32853550216705, "grad_norm": 1.21875, "learning_rate": 0.00044628982875593546, "loss": 6.1367, "mean_token_accuracy": 0.14682541340589522, "num_tokens": 47063671.0, "step": 21760 }, { "entropy": 6.3841774463653564, "epoch": 2.3290705762748143, "grad_norm": 1.3671875, "learning_rate": 0.00044626503524731917, "loss": 6.0416, "mean_token_accuracy": 0.15007409751415252, "num_tokens": 47073537.0, "step": 21765 }, { "entropy": 6.404321336746216, "epoch": 2.329605650382578, "grad_norm": 1.2265625, "learning_rate": 0.0004462402367934491, "loss": 6.1116, "mean_token_accuracy": 0.14446128010749817, "num_tokens": 47084272.0, "step": 21770 }, { "entropy": 6.508105659484864, "epoch": 2.330140724490342, "grad_norm": 1.34375, "learning_rate": 0.0004462154333950412, "loss": 6.1615, "mean_token_accuracy": 0.13968442976474763, "num_tokens": 47095198.0, "step": 21775 }, { "entropy": 6.586350345611573, "epoch": 2.3306757985981057, "grad_norm": 1.3125, "learning_rate": 0.0004461906250528117, "loss": 6.1676, "mean_token_accuracy": 0.13975676000118256, "num_tokens": 47106540.0, "step": 21780 }, { "entropy": 6.496125936508179, "epoch": 2.33121087270587, "grad_norm": 1.328125, "learning_rate": 0.000446165811767477, "loss": 6.1602, "mean_token_accuracy": 0.15234325900673867, "num_tokens": 47117301.0, "step": 21785 }, { "entropy": 6.421975374221802, "epoch": 2.3317459468136335, "grad_norm": 1.40625, "learning_rate": 0.0004461409935397536, "loss": 6.1342, "mean_token_accuracy": 0.1442764952778816, "num_tokens": 47127058.0, "step": 21790 }, { "entropy": 6.451207876205444, "epoch": 2.3322810209213976, "grad_norm": 1.2265625, "learning_rate": 0.00044611617037035794, "loss": 6.0745, "mean_token_accuracy": 0.1451098144054413, "num_tokens": 47137182.0, "step": 21795 }, { "entropy": 6.502760410308838, "epoch": 2.3328160950291617, "grad_norm": 1.2109375, "learning_rate": 0.000446091342260007, "loss": 6.1407, "mean_token_accuracy": 0.1408575102686882, "num_tokens": 47148591.0, "step": 21800 }, { "entropy": 6.490858745574951, "epoch": 2.3333511691369253, "grad_norm": 1.2734375, "learning_rate": 0.00044606650920941753, "loss": 6.0911, "mean_token_accuracy": 0.14580915346741677, "num_tokens": 47159014.0, "step": 21805 }, { "entropy": 6.452058935165406, "epoch": 2.3338862432446894, "grad_norm": 1.2265625, "learning_rate": 0.0004460416712193067, "loss": 6.1142, "mean_token_accuracy": 0.14342996776103972, "num_tokens": 47168760.0, "step": 21810 }, { "entropy": 6.425150775909424, "epoch": 2.3344213173524535, "grad_norm": 1.5, "learning_rate": 0.0004460168282903916, "loss": 6.1476, "mean_token_accuracy": 0.146635565161705, "num_tokens": 47180902.0, "step": 21815 }, { "entropy": 6.415819263458252, "epoch": 2.334956391460217, "grad_norm": 1.25, "learning_rate": 0.00044599198042338963, "loss": 6.0088, "mean_token_accuracy": 0.15336752980947493, "num_tokens": 47190458.0, "step": 21820 }, { "entropy": 6.486897945404053, "epoch": 2.3354914655679813, "grad_norm": 2.015625, "learning_rate": 0.00044596712761901824, "loss": 6.1608, "mean_token_accuracy": 0.14041486904025077, "num_tokens": 47201099.0, "step": 21825 }, { "entropy": 6.4499674320220945, "epoch": 2.336026539675745, "grad_norm": 1.625, "learning_rate": 0.0004459422698779951, "loss": 6.0878, "mean_token_accuracy": 0.15117376744747163, "num_tokens": 47211284.0, "step": 21830 }, { "entropy": 6.471955585479736, "epoch": 2.336561613783509, "grad_norm": 1.578125, "learning_rate": 0.0004459174072010379, "loss": 6.1736, "mean_token_accuracy": 0.140228820592165, "num_tokens": 47222875.0, "step": 21835 }, { "entropy": 6.461224126815796, "epoch": 2.337096687891273, "grad_norm": 1.28125, "learning_rate": 0.0004458925395888646, "loss": 6.1497, "mean_token_accuracy": 0.13779575526714324, "num_tokens": 47234238.0, "step": 21840 }, { "entropy": 6.491030359268189, "epoch": 2.3376317619990368, "grad_norm": 1.28125, "learning_rate": 0.00044586766704219326, "loss": 6.1376, "mean_token_accuracy": 0.14399240165948868, "num_tokens": 47244634.0, "step": 21845 }, { "entropy": 6.505905437469482, "epoch": 2.338166836106801, "grad_norm": 1.21875, "learning_rate": 0.000445842789561742, "loss": 6.1541, "mean_token_accuracy": 0.1389889657497406, "num_tokens": 47256538.0, "step": 21850 }, { "entropy": 6.419703626632691, "epoch": 2.3387019102145645, "grad_norm": 1.2109375, "learning_rate": 0.0004458179071482292, "loss": 5.9842, "mean_token_accuracy": 0.15503145307302474, "num_tokens": 47266373.0, "step": 21855 }, { "entropy": 6.44592866897583, "epoch": 2.3392369843223286, "grad_norm": 1.2890625, "learning_rate": 0.00044579301980237333, "loss": 6.1622, "mean_token_accuracy": 0.1415998123586178, "num_tokens": 47276441.0, "step": 21860 }, { "entropy": 6.475642395019531, "epoch": 2.3397720584300927, "grad_norm": 1.2421875, "learning_rate": 0.0004457681275248931, "loss": 6.1401, "mean_token_accuracy": 0.14419428408145904, "num_tokens": 47287299.0, "step": 21865 }, { "entropy": 6.433586645126343, "epoch": 2.3403071325378564, "grad_norm": 1.3046875, "learning_rate": 0.00044574323031650715, "loss": 6.0095, "mean_token_accuracy": 0.1488127738237381, "num_tokens": 47298007.0, "step": 21870 }, { "entropy": 6.395630836486816, "epoch": 2.3408422066456205, "grad_norm": 1.34375, "learning_rate": 0.0004457183281779343, "loss": 5.99, "mean_token_accuracy": 0.15820934772491455, "num_tokens": 47309729.0, "step": 21875 }, { "entropy": 6.472767734527588, "epoch": 2.3413772807533846, "grad_norm": 1.3203125, "learning_rate": 0.00044569342110989385, "loss": 6.0856, "mean_token_accuracy": 0.14362915158271788, "num_tokens": 47319050.0, "step": 21880 }, { "entropy": 6.502427625656128, "epoch": 2.3419123548611482, "grad_norm": 1.28125, "learning_rate": 0.0004456685091131048, "loss": 6.2318, "mean_token_accuracy": 0.14244758933782578, "num_tokens": 47330365.0, "step": 21885 }, { "entropy": 6.565773963928223, "epoch": 2.3424474289689123, "grad_norm": 1.4453125, "learning_rate": 0.00044564359218828654, "loss": 6.1175, "mean_token_accuracy": 0.14507446810603142, "num_tokens": 47341225.0, "step": 21890 }, { "entropy": 6.466375350952148, "epoch": 2.342982503076676, "grad_norm": 1.3125, "learning_rate": 0.00044561867033615854, "loss": 6.0724, "mean_token_accuracy": 0.1484555646777153, "num_tokens": 47352996.0, "step": 21895 }, { "entropy": 6.36544280052185, "epoch": 2.34351757718444, "grad_norm": 1.46875, "learning_rate": 0.0004455937435574404, "loss": 6.029, "mean_token_accuracy": 0.14715228229761124, "num_tokens": 47363577.0, "step": 21900 }, { "entropy": 6.528714418411255, "epoch": 2.3440526512922037, "grad_norm": 1.3203125, "learning_rate": 0.00044556881185285185, "loss": 6.2399, "mean_token_accuracy": 0.1366798348724842, "num_tokens": 47374389.0, "step": 21905 }, { "entropy": 6.43365478515625, "epoch": 2.344587725399968, "grad_norm": 1.390625, "learning_rate": 0.00044554387522311286, "loss": 6.0577, "mean_token_accuracy": 0.14907207265496253, "num_tokens": 47385624.0, "step": 21910 }, { "entropy": 6.469548654556275, "epoch": 2.345122799507732, "grad_norm": 1.390625, "learning_rate": 0.0004455189336689435, "loss": 6.1419, "mean_token_accuracy": 0.14058734253048896, "num_tokens": 47396611.0, "step": 21915 }, { "entropy": 6.524194955825806, "epoch": 2.3456578736154956, "grad_norm": 1.515625, "learning_rate": 0.00044549398719106374, "loss": 6.1362, "mean_token_accuracy": 0.14465692192316054, "num_tokens": 47406693.0, "step": 21920 }, { "entropy": 6.439492654800415, "epoch": 2.3461929477232597, "grad_norm": 1.3046875, "learning_rate": 0.0004454690357901942, "loss": 6.0396, "mean_token_accuracy": 0.14539337754249573, "num_tokens": 47417528.0, "step": 21925 }, { "entropy": 6.4850907802581785, "epoch": 2.346728021831024, "grad_norm": 1.421875, "learning_rate": 0.0004454440794670552, "loss": 6.1811, "mean_token_accuracy": 0.14375433847308158, "num_tokens": 47430032.0, "step": 21930 }, { "entropy": 6.543843221664429, "epoch": 2.3472630959387875, "grad_norm": 4.3125, "learning_rate": 0.00044541911822236724, "loss": 6.1904, "mean_token_accuracy": 0.14003921672701836, "num_tokens": 47441002.0, "step": 21935 }, { "entropy": 6.503658056259155, "epoch": 2.3477981700465516, "grad_norm": 1.34375, "learning_rate": 0.0004453941520568513, "loss": 6.0523, "mean_token_accuracy": 0.15220372527837753, "num_tokens": 47451716.0, "step": 21940 }, { "entropy": 6.424562406539917, "epoch": 2.348333244154315, "grad_norm": 1.265625, "learning_rate": 0.0004453691809712281, "loss": 6.0924, "mean_token_accuracy": 0.14600750505924226, "num_tokens": 47463039.0, "step": 21945 }, { "entropy": 6.391051959991455, "epoch": 2.3488683182620793, "grad_norm": 1.515625, "learning_rate": 0.00044534420496621877, "loss": 6.0232, "mean_token_accuracy": 0.1518831267952919, "num_tokens": 47473836.0, "step": 21950 }, { "entropy": 6.487048387527466, "epoch": 2.3494033923698434, "grad_norm": 1.28125, "learning_rate": 0.00044531922404254445, "loss": 6.1117, "mean_token_accuracy": 0.14269979447126388, "num_tokens": 47485103.0, "step": 21955 }, { "entropy": 6.413436937332153, "epoch": 2.349938466477607, "grad_norm": 1.1484375, "learning_rate": 0.0004452942382009265, "loss": 6.039, "mean_token_accuracy": 0.15239893049001693, "num_tokens": 47495509.0, "step": 21960 }, { "entropy": 6.4652406692504885, "epoch": 2.350473540585371, "grad_norm": 1.265625, "learning_rate": 0.0004452692474420863, "loss": 6.0953, "mean_token_accuracy": 0.14660671055316926, "num_tokens": 47506062.0, "step": 21965 }, { "entropy": 6.419542264938355, "epoch": 2.351008614693135, "grad_norm": 1.1796875, "learning_rate": 0.0004452442517667455, "loss": 6.0466, "mean_token_accuracy": 0.1540869191288948, "num_tokens": 47515632.0, "step": 21970 }, { "entropy": 6.395643329620361, "epoch": 2.351543688800899, "grad_norm": 1.2578125, "learning_rate": 0.0004452192511756259, "loss": 6.0084, "mean_token_accuracy": 0.15169961005449295, "num_tokens": 47525412.0, "step": 21975 }, { "entropy": 6.454103708267212, "epoch": 2.352078762908663, "grad_norm": 1.4140625, "learning_rate": 0.00044519424566944935, "loss": 6.0791, "mean_token_accuracy": 0.14625447019934654, "num_tokens": 47536094.0, "step": 21980 }, { "entropy": 6.431142520904541, "epoch": 2.3526138370164267, "grad_norm": 1.171875, "learning_rate": 0.00044516923524893777, "loss": 6.036, "mean_token_accuracy": 0.14398616775870324, "num_tokens": 47546893.0, "step": 21985 }, { "entropy": 6.47427191734314, "epoch": 2.353148911124191, "grad_norm": 1.2421875, "learning_rate": 0.00044514421991481354, "loss": 6.0402, "mean_token_accuracy": 0.14828135967254638, "num_tokens": 47557117.0, "step": 21990 }, { "entropy": 6.466085052490234, "epoch": 2.3536839852319544, "grad_norm": 1.140625, "learning_rate": 0.00044511919966779885, "loss": 6.0536, "mean_token_accuracy": 0.14336677640676498, "num_tokens": 47567878.0, "step": 21995 }, { "entropy": 6.446047401428222, "epoch": 2.3542190593397185, "grad_norm": 1.2265625, "learning_rate": 0.00044509417450861615, "loss": 6.124, "mean_token_accuracy": 0.13893141895532607, "num_tokens": 47578185.0, "step": 22000 }, { "entropy": 6.540997695922852, "epoch": 2.3547541334474826, "grad_norm": 1.21875, "learning_rate": 0.0004450691444379881, "loss": 6.233, "mean_token_accuracy": 0.13426421955227852, "num_tokens": 47590042.0, "step": 22005 }, { "entropy": 6.527778577804566, "epoch": 2.3552892075552463, "grad_norm": 1.1953125, "learning_rate": 0.00044504410945663735, "loss": 6.1192, "mean_token_accuracy": 0.14576566070318223, "num_tokens": 47601225.0, "step": 22010 }, { "entropy": 6.457901096343994, "epoch": 2.3558242816630104, "grad_norm": 1.1640625, "learning_rate": 0.00044501906956528686, "loss": 6.1441, "mean_token_accuracy": 0.14177038371562958, "num_tokens": 47612596.0, "step": 22015 }, { "entropy": 6.5307739734649655, "epoch": 2.356359355770774, "grad_norm": 1.3125, "learning_rate": 0.0004449940247646596, "loss": 6.1724, "mean_token_accuracy": 0.1433061607182026, "num_tokens": 47623156.0, "step": 22020 }, { "entropy": 6.4633606433868405, "epoch": 2.356894429878538, "grad_norm": 1.171875, "learning_rate": 0.00044496897505547886, "loss": 6.0726, "mean_token_accuracy": 0.1438271701335907, "num_tokens": 47633743.0, "step": 22025 }, { "entropy": 6.459659194946289, "epoch": 2.3574295039863022, "grad_norm": 1.4609375, "learning_rate": 0.0004449439204384677, "loss": 6.1354, "mean_token_accuracy": 0.14252169132232667, "num_tokens": 47643914.0, "step": 22030 }, { "entropy": 6.487078237533569, "epoch": 2.357964578094066, "grad_norm": 1.34375, "learning_rate": 0.00044491886091434983, "loss": 6.1292, "mean_token_accuracy": 0.1452212765812874, "num_tokens": 47655187.0, "step": 22035 }, { "entropy": 6.503546190261841, "epoch": 2.35849965220183, "grad_norm": 1.375, "learning_rate": 0.0004448937964838487, "loss": 6.1202, "mean_token_accuracy": 0.1437824249267578, "num_tokens": 47667193.0, "step": 22040 }, { "entropy": 6.48775954246521, "epoch": 2.359034726309594, "grad_norm": 1.234375, "learning_rate": 0.0004448687271476881, "loss": 6.14, "mean_token_accuracy": 0.14331882148981095, "num_tokens": 47678116.0, "step": 22045 }, { "entropy": 6.495173025131225, "epoch": 2.3595698004173578, "grad_norm": 1.5078125, "learning_rate": 0.0004448436529065918, "loss": 6.1154, "mean_token_accuracy": 0.14533022344112395, "num_tokens": 47689883.0, "step": 22050 }, { "entropy": 6.4617774963378904, "epoch": 2.360104874525122, "grad_norm": 1.3046875, "learning_rate": 0.0004448185737612839, "loss": 6.1052, "mean_token_accuracy": 0.14905785024166107, "num_tokens": 47699939.0, "step": 22055 }, { "entropy": 6.398660135269165, "epoch": 2.3606399486328855, "grad_norm": 1.578125, "learning_rate": 0.00044479348971248863, "loss": 6.0644, "mean_token_accuracy": 0.15168716311454772, "num_tokens": 47710477.0, "step": 22060 }, { "entropy": 6.475105714797974, "epoch": 2.3611750227406496, "grad_norm": 1.453125, "learning_rate": 0.0004447684007609301, "loss": 6.1046, "mean_token_accuracy": 0.1445338323712349, "num_tokens": 47720548.0, "step": 22065 }, { "entropy": 6.490202283859253, "epoch": 2.3617100968484133, "grad_norm": 1.234375, "learning_rate": 0.00044474330690733293, "loss": 6.0994, "mean_token_accuracy": 0.13948655053973197, "num_tokens": 47732135.0, "step": 22070 }, { "entropy": 6.475314044952393, "epoch": 2.3622451709561774, "grad_norm": 1.2890625, "learning_rate": 0.0004447182081524216, "loss": 6.1018, "mean_token_accuracy": 0.14495120644569398, "num_tokens": 47742934.0, "step": 22075 }, { "entropy": 6.464633131027222, "epoch": 2.3627802450639415, "grad_norm": 1.4140625, "learning_rate": 0.00044469310449692085, "loss": 6.1053, "mean_token_accuracy": 0.14303620159626007, "num_tokens": 47754586.0, "step": 22080 }, { "entropy": 6.516017961502075, "epoch": 2.363315319171705, "grad_norm": 1.3828125, "learning_rate": 0.00044466799594155556, "loss": 6.1103, "mean_token_accuracy": 0.14106715619564056, "num_tokens": 47765564.0, "step": 22085 }, { "entropy": 6.422468996047973, "epoch": 2.363850393279469, "grad_norm": 1.234375, "learning_rate": 0.00044464288248705075, "loss": 6.0754, "mean_token_accuracy": 0.14668594747781755, "num_tokens": 47776191.0, "step": 22090 }, { "entropy": 6.520417404174805, "epoch": 2.3643854673872333, "grad_norm": 1.1796875, "learning_rate": 0.00044461776413413153, "loss": 6.1997, "mean_token_accuracy": 0.1369754120707512, "num_tokens": 47787193.0, "step": 22095 }, { "entropy": 6.5552184104919435, "epoch": 2.364920541494997, "grad_norm": 1.4140625, "learning_rate": 0.0004445926408835232, "loss": 6.1552, "mean_token_accuracy": 0.1368870861828327, "num_tokens": 47798576.0, "step": 22100 }, { "entropy": 6.376204156875611, "epoch": 2.365455615602761, "grad_norm": 1.734375, "learning_rate": 0.0004445675127359511, "loss": 6.0147, "mean_token_accuracy": 0.15470883771777152, "num_tokens": 47809519.0, "step": 22105 }, { "entropy": 6.43874716758728, "epoch": 2.3659906897105247, "grad_norm": 1.15625, "learning_rate": 0.000444542379692141, "loss": 6.0799, "mean_token_accuracy": 0.14309703782200814, "num_tokens": 47820618.0, "step": 22110 }, { "entropy": 6.512845277786255, "epoch": 2.366525763818289, "grad_norm": 1.390625, "learning_rate": 0.0004445172417528186, "loss": 6.1709, "mean_token_accuracy": 0.14340648651123047, "num_tokens": 47831756.0, "step": 22115 }, { "entropy": 6.501999855041504, "epoch": 2.367060837926053, "grad_norm": 1.34375, "learning_rate": 0.00044449209891870954, "loss": 6.1097, "mean_token_accuracy": 0.14158237874507903, "num_tokens": 47841974.0, "step": 22120 }, { "entropy": 6.406654500961304, "epoch": 2.3675959120338166, "grad_norm": 1.296875, "learning_rate": 0.00044446695119053993, "loss": 6.043, "mean_token_accuracy": 0.14741935357451438, "num_tokens": 47852194.0, "step": 22125 }, { "entropy": 6.502700996398926, "epoch": 2.3681309861415807, "grad_norm": 1.390625, "learning_rate": 0.000444441798569036, "loss": 6.1969, "mean_token_accuracy": 0.13913919031620026, "num_tokens": 47863921.0, "step": 22130 }, { "entropy": 6.600926637649536, "epoch": 2.3686660602493443, "grad_norm": 1.1328125, "learning_rate": 0.00044441664105492393, "loss": 6.2935, "mean_token_accuracy": 0.134506893157959, "num_tokens": 47875520.0, "step": 22135 }, { "entropy": 6.531594085693359, "epoch": 2.3692011343571084, "grad_norm": 1.1953125, "learning_rate": 0.0004443914786489301, "loss": 6.047, "mean_token_accuracy": 0.14973307251930237, "num_tokens": 47886047.0, "step": 22140 }, { "entropy": 6.3686503887176515, "epoch": 2.3697362084648725, "grad_norm": 1.265625, "learning_rate": 0.00044436631135178113, "loss": 6.0022, "mean_token_accuracy": 0.1579115778207779, "num_tokens": 47896449.0, "step": 22145 }, { "entropy": 6.516362524032592, "epoch": 2.370271282572636, "grad_norm": 1.7890625, "learning_rate": 0.00044434113916420377, "loss": 6.1666, "mean_token_accuracy": 0.14160350561141968, "num_tokens": 47908613.0, "step": 22150 }, { "entropy": 6.55473747253418, "epoch": 2.3708063566804003, "grad_norm": 1.3828125, "learning_rate": 0.00044431596208692475, "loss": 6.2008, "mean_token_accuracy": 0.13570541143417358, "num_tokens": 47919474.0, "step": 22155 }, { "entropy": 6.4521135807037355, "epoch": 2.3713414307881644, "grad_norm": 1.40625, "learning_rate": 0.0004442907801206712, "loss": 6.0861, "mean_token_accuracy": 0.14394913166761397, "num_tokens": 47930929.0, "step": 22160 }, { "entropy": 6.437365913391114, "epoch": 2.371876504895928, "grad_norm": 1.2890625, "learning_rate": 0.00044426559326617013, "loss": 6.0503, "mean_token_accuracy": 0.15559595823287964, "num_tokens": 47942050.0, "step": 22165 }, { "entropy": 6.528932189941406, "epoch": 2.372411579003692, "grad_norm": 2.171875, "learning_rate": 0.0004442404015241488, "loss": 6.1952, "mean_token_accuracy": 0.14278719425201417, "num_tokens": 47953162.0, "step": 22170 }, { "entropy": 6.536012268066406, "epoch": 2.372946653111456, "grad_norm": 1.2421875, "learning_rate": 0.00044421520489533467, "loss": 6.1213, "mean_token_accuracy": 0.1446191668510437, "num_tokens": 47963140.0, "step": 22175 }, { "entropy": 6.445658540725708, "epoch": 2.37348172721922, "grad_norm": 1.5703125, "learning_rate": 0.00044419000338045527, "loss": 6.1728, "mean_token_accuracy": 0.14523965716362, "num_tokens": 47975622.0, "step": 22180 }, { "entropy": 6.5038165092468265, "epoch": 2.3740168013269836, "grad_norm": 1.171875, "learning_rate": 0.0004441647969802383, "loss": 6.1218, "mean_token_accuracy": 0.13845564275979996, "num_tokens": 47986450.0, "step": 22185 }, { "entropy": 6.540388774871826, "epoch": 2.3745518754347477, "grad_norm": 1.8515625, "learning_rate": 0.0004441395856954117, "loss": 6.1951, "mean_token_accuracy": 0.1351679116487503, "num_tokens": 47997441.0, "step": 22190 }, { "entropy": 6.459717512130737, "epoch": 2.3750869495425118, "grad_norm": 1.7265625, "learning_rate": 0.00044411436952670325, "loss": 6.0997, "mean_token_accuracy": 0.13807225227355957, "num_tokens": 48008995.0, "step": 22195 }, { "entropy": 6.522867441177368, "epoch": 2.3756220236502754, "grad_norm": 1.265625, "learning_rate": 0.00044408914847484103, "loss": 6.1119, "mean_token_accuracy": 0.14891570806503296, "num_tokens": 48019975.0, "step": 22200 }, { "entropy": 6.538968658447265, "epoch": 2.3761570977580395, "grad_norm": 1.2734375, "learning_rate": 0.0004440639225405536, "loss": 6.102, "mean_token_accuracy": 0.14091890752315522, "num_tokens": 48031278.0, "step": 22205 }, { "entropy": 6.399729013442993, "epoch": 2.3766921718658036, "grad_norm": 1.703125, "learning_rate": 0.000444038691724569, "loss": 6.0947, "mean_token_accuracy": 0.14269933402538298, "num_tokens": 48042050.0, "step": 22210 }, { "entropy": 6.337248373031616, "epoch": 2.3772272459735673, "grad_norm": 1.3046875, "learning_rate": 0.00044401345602761605, "loss": 5.9873, "mean_token_accuracy": 0.15868725776672363, "num_tokens": 48052833.0, "step": 22215 }, { "entropy": 6.39757809638977, "epoch": 2.3777623200813314, "grad_norm": 1.3515625, "learning_rate": 0.00044398821545042327, "loss": 6.0721, "mean_token_accuracy": 0.14557988718152046, "num_tokens": 48063425.0, "step": 22220 }, { "entropy": 6.440204334259033, "epoch": 2.378297394189095, "grad_norm": 1.3125, "learning_rate": 0.00044396296999371946, "loss": 6.0718, "mean_token_accuracy": 0.14883712083101272, "num_tokens": 48074941.0, "step": 22225 }, { "entropy": 6.4019585132598875, "epoch": 2.378832468296859, "grad_norm": 2.421875, "learning_rate": 0.00044393771965823376, "loss": 5.9255, "mean_token_accuracy": 0.1523391529917717, "num_tokens": 48085224.0, "step": 22230 }, { "entropy": 6.446329784393311, "epoch": 2.3793675424046232, "grad_norm": 2.609375, "learning_rate": 0.000443912464444695, "loss": 6.109, "mean_token_accuracy": 0.1432347536087036, "num_tokens": 48096509.0, "step": 22235 }, { "entropy": 6.423505973815918, "epoch": 2.379902616512387, "grad_norm": 1.2578125, "learning_rate": 0.0004438872043538327, "loss": 6.0792, "mean_token_accuracy": 0.14209741950035096, "num_tokens": 48106839.0, "step": 22240 }, { "entropy": 6.512378549575805, "epoch": 2.380437690620151, "grad_norm": 1.140625, "learning_rate": 0.000443861939386376, "loss": 6.1543, "mean_token_accuracy": 0.1461554616689682, "num_tokens": 48118209.0, "step": 22245 }, { "entropy": 6.45034556388855, "epoch": 2.3809727647279146, "grad_norm": 1.8515625, "learning_rate": 0.0004438366695430546, "loss": 6.1287, "mean_token_accuracy": 0.14676560685038567, "num_tokens": 48128651.0, "step": 22250 }, { "entropy": 6.477226495742798, "epoch": 2.3815078388356787, "grad_norm": 1.5234375, "learning_rate": 0.00044381139482459805, "loss": 6.1392, "mean_token_accuracy": 0.14449237436056137, "num_tokens": 48139612.0, "step": 22255 }, { "entropy": 6.503661060333252, "epoch": 2.382042912943443, "grad_norm": 1.3828125, "learning_rate": 0.00044378611523173615, "loss": 6.0652, "mean_token_accuracy": 0.15411824882030487, "num_tokens": 48150557.0, "step": 22260 }, { "entropy": 6.4357953548431395, "epoch": 2.3825779870512065, "grad_norm": 1.4765625, "learning_rate": 0.0004437608307651989, "loss": 6.0124, "mean_token_accuracy": 0.1511611297726631, "num_tokens": 48160784.0, "step": 22265 }, { "entropy": 6.403134393692016, "epoch": 2.3831130611589706, "grad_norm": 1.875, "learning_rate": 0.0004437355414257165, "loss": 6.1072, "mean_token_accuracy": 0.14343835189938545, "num_tokens": 48171075.0, "step": 22270 }, { "entropy": 6.475181961059571, "epoch": 2.3836481352667347, "grad_norm": 1.2734375, "learning_rate": 0.00044371024721401894, "loss": 6.1473, "mean_token_accuracy": 0.13750439882278442, "num_tokens": 48182713.0, "step": 22275 }, { "entropy": 6.499227380752563, "epoch": 2.3841832093744983, "grad_norm": 1.4375, "learning_rate": 0.0004436849481308367, "loss": 6.0628, "mean_token_accuracy": 0.15116696134209634, "num_tokens": 48194198.0, "step": 22280 }, { "entropy": 6.431978607177735, "epoch": 2.3847182834822624, "grad_norm": 1.5078125, "learning_rate": 0.00044365964417690035, "loss": 6.0245, "mean_token_accuracy": 0.1466377079486847, "num_tokens": 48205650.0, "step": 22285 }, { "entropy": 6.378844785690307, "epoch": 2.385253357590026, "grad_norm": 1.328125, "learning_rate": 0.0004436343353529404, "loss": 6.0531, "mean_token_accuracy": 0.14801887273788453, "num_tokens": 48216335.0, "step": 22290 }, { "entropy": 6.4176350116729735, "epoch": 2.38578843169779, "grad_norm": 1.3359375, "learning_rate": 0.00044360902165968774, "loss": 6.0909, "mean_token_accuracy": 0.14309422820806503, "num_tokens": 48227206.0, "step": 22295 }, { "entropy": 6.446830129623413, "epoch": 2.386323505805554, "grad_norm": 1.4375, "learning_rate": 0.0004435837030978733, "loss": 6.1048, "mean_token_accuracy": 0.14635014533996582, "num_tokens": 48237948.0, "step": 22300 }, { "entropy": 6.4844279289245605, "epoch": 2.386858579913318, "grad_norm": 1.71875, "learning_rate": 0.0004435583796682281, "loss": 6.0919, "mean_token_accuracy": 0.1542416825890541, "num_tokens": 48250086.0, "step": 22305 }, { "entropy": 6.506739091873169, "epoch": 2.387393654021082, "grad_norm": 1.3203125, "learning_rate": 0.0004435330513714834, "loss": 6.0987, "mean_token_accuracy": 0.14743863493204118, "num_tokens": 48261004.0, "step": 22310 }, { "entropy": 6.426657199859619, "epoch": 2.3879287281288457, "grad_norm": 1.2734375, "learning_rate": 0.0004435077182083705, "loss": 6.1134, "mean_token_accuracy": 0.14860199987888337, "num_tokens": 48271314.0, "step": 22315 }, { "entropy": 6.372504711151123, "epoch": 2.38846380223661, "grad_norm": 1.3828125, "learning_rate": 0.00044348238017962095, "loss": 6.0414, "mean_token_accuracy": 0.14628194123506547, "num_tokens": 48281899.0, "step": 22320 }, { "entropy": 6.41559100151062, "epoch": 2.388998876344374, "grad_norm": 1.5859375, "learning_rate": 0.0004434570372859663, "loss": 6.1192, "mean_token_accuracy": 0.14575926586985588, "num_tokens": 48292925.0, "step": 22325 }, { "entropy": 6.5548206806182865, "epoch": 2.3895339504521376, "grad_norm": 1.2734375, "learning_rate": 0.0004434316895281384, "loss": 6.1432, "mean_token_accuracy": 0.14652915820479392, "num_tokens": 48303138.0, "step": 22330 }, { "entropy": 6.401421737670899, "epoch": 2.3900690245599017, "grad_norm": 1.265625, "learning_rate": 0.0004434063369068691, "loss": 5.9991, "mean_token_accuracy": 0.1548761323094368, "num_tokens": 48313586.0, "step": 22335 }, { "entropy": 6.36795334815979, "epoch": 2.3906040986676653, "grad_norm": 1.4609375, "learning_rate": 0.00044338097942289045, "loss": 6.0416, "mean_token_accuracy": 0.1530877858400345, "num_tokens": 48324756.0, "step": 22340 }, { "entropy": 6.460367870330811, "epoch": 2.3911391727754294, "grad_norm": 1.640625, "learning_rate": 0.0004433556170769348, "loss": 6.1284, "mean_token_accuracy": 0.13945283815264703, "num_tokens": 48336012.0, "step": 22345 }, { "entropy": 6.510640048980713, "epoch": 2.391674246883193, "grad_norm": 1.2890625, "learning_rate": 0.0004433302498697343, "loss": 6.2045, "mean_token_accuracy": 0.1377773813903332, "num_tokens": 48348923.0, "step": 22350 }, { "entropy": 6.460583829879761, "epoch": 2.392209320990957, "grad_norm": 1.296875, "learning_rate": 0.00044330487780202144, "loss": 6.0267, "mean_token_accuracy": 0.16482816487550736, "num_tokens": 48359708.0, "step": 22355 }, { "entropy": 6.432282495498657, "epoch": 2.3927443950987213, "grad_norm": 1.46875, "learning_rate": 0.00044327950087452895, "loss": 6.0895, "mean_token_accuracy": 0.1476660691201687, "num_tokens": 48370497.0, "step": 22360 }, { "entropy": 6.411420297622681, "epoch": 2.393279469206485, "grad_norm": 1.3359375, "learning_rate": 0.0004432541190879895, "loss": 6.1063, "mean_token_accuracy": 0.14257829636335373, "num_tokens": 48381020.0, "step": 22365 }, { "entropy": 6.464663314819336, "epoch": 2.393814543314249, "grad_norm": 1.3046875, "learning_rate": 0.00044322873244313603, "loss": 6.0616, "mean_token_accuracy": 0.14460955560207367, "num_tokens": 48391696.0, "step": 22370 }, { "entropy": 6.423829746246338, "epoch": 2.394349617422013, "grad_norm": 1.8046875, "learning_rate": 0.00044320334094070154, "loss": 6.079, "mean_token_accuracy": 0.1458517111837864, "num_tokens": 48402403.0, "step": 22375 }, { "entropy": 6.4090986251831055, "epoch": 2.394884691529777, "grad_norm": 1.3046875, "learning_rate": 0.0004431779445814192, "loss": 6.1186, "mean_token_accuracy": 0.15605130344629287, "num_tokens": 48413579.0, "step": 22380 }, { "entropy": 6.525593090057373, "epoch": 2.395419765637541, "grad_norm": 1.421875, "learning_rate": 0.00044315254336602236, "loss": 6.1482, "mean_token_accuracy": 0.14264504760503768, "num_tokens": 48423814.0, "step": 22385 }, { "entropy": 6.512730932235717, "epoch": 2.3959548397453045, "grad_norm": 1.6015625, "learning_rate": 0.00044312713729524443, "loss": 6.2252, "mean_token_accuracy": 0.14166969284415246, "num_tokens": 48433937.0, "step": 22390 }, { "entropy": 6.485862922668457, "epoch": 2.3964899138530686, "grad_norm": 1.625, "learning_rate": 0.00044310172636981905, "loss": 6.083, "mean_token_accuracy": 0.14675567895174027, "num_tokens": 48444397.0, "step": 22395 }, { "entropy": 6.440472602844238, "epoch": 2.3970249879608327, "grad_norm": 1.2265625, "learning_rate": 0.0004430763105904799, "loss": 5.9751, "mean_token_accuracy": 0.1553073525428772, "num_tokens": 48454566.0, "step": 22400 }, { "entropy": 6.387523937225342, "epoch": 2.3975600620685964, "grad_norm": 1.296875, "learning_rate": 0.000443050889957961, "loss": 6.0137, "mean_token_accuracy": 0.15581767559051513, "num_tokens": 48465129.0, "step": 22405 }, { "entropy": 6.420242977142334, "epoch": 2.3980951361763605, "grad_norm": 1.390625, "learning_rate": 0.00044302546447299625, "loss": 6.038, "mean_token_accuracy": 0.1484654039144516, "num_tokens": 48475793.0, "step": 22410 }, { "entropy": 6.4296462059021, "epoch": 2.398630210284124, "grad_norm": 1.3359375, "learning_rate": 0.0004430000341363198, "loss": 5.972, "mean_token_accuracy": 0.1621704176068306, "num_tokens": 48486543.0, "step": 22415 }, { "entropy": 6.501266527175903, "epoch": 2.3991652843918883, "grad_norm": 1.203125, "learning_rate": 0.0004429745989486659, "loss": 6.153, "mean_token_accuracy": 0.14941118508577347, "num_tokens": 48498426.0, "step": 22420 }, { "entropy": 6.448358678817749, "epoch": 2.3997003584996524, "grad_norm": 1.53125, "learning_rate": 0.0004429491589107691, "loss": 6.031, "mean_token_accuracy": 0.15213921815156936, "num_tokens": 48508763.0, "step": 22425 }, { "entropy": 6.467694616317749, "epoch": 2.400235432607416, "grad_norm": 1.3671875, "learning_rate": 0.0004429237140233639, "loss": 6.1481, "mean_token_accuracy": 0.14018561094999313, "num_tokens": 48519112.0, "step": 22430 }, { "entropy": 6.507307338714599, "epoch": 2.40077050671518, "grad_norm": 1.2890625, "learning_rate": 0.0004428982642871852, "loss": 6.0948, "mean_token_accuracy": 0.1463563159108162, "num_tokens": 48530341.0, "step": 22435 }, { "entropy": 6.39431791305542, "epoch": 2.401305580822944, "grad_norm": 1.265625, "learning_rate": 0.0004428728097029676, "loss": 6.0186, "mean_token_accuracy": 0.15091662108898163, "num_tokens": 48541962.0, "step": 22440 }, { "entropy": 6.493698930740356, "epoch": 2.401840654930708, "grad_norm": 2.4375, "learning_rate": 0.00044284735027144624, "loss": 6.189, "mean_token_accuracy": 0.1351309634745121, "num_tokens": 48554206.0, "step": 22445 }, { "entropy": 6.404330825805664, "epoch": 2.402375729038472, "grad_norm": 1.6171875, "learning_rate": 0.0004428218859933562, "loss": 6.0494, "mean_token_accuracy": 0.14448442980647086, "num_tokens": 48563919.0, "step": 22450 }, { "entropy": 6.418425273895264, "epoch": 2.4029108031462356, "grad_norm": 1.4296875, "learning_rate": 0.00044279641686943277, "loss": 6.1431, "mean_token_accuracy": 0.1504869654774666, "num_tokens": 48575388.0, "step": 22455 }, { "entropy": 6.531083965301514, "epoch": 2.4034458772539997, "grad_norm": 1.390625, "learning_rate": 0.00044277094290041144, "loss": 6.1076, "mean_token_accuracy": 0.1469431161880493, "num_tokens": 48587492.0, "step": 22460 }, { "entropy": 6.383284330368042, "epoch": 2.4039809513617634, "grad_norm": 1.3671875, "learning_rate": 0.00044274546408702763, "loss": 5.938, "mean_token_accuracy": 0.16313221529126168, "num_tokens": 48598757.0, "step": 22465 }, { "entropy": 6.471029472351074, "epoch": 2.4045160254695275, "grad_norm": 1.640625, "learning_rate": 0.00044271998043001723, "loss": 6.0924, "mean_token_accuracy": 0.1484705038368702, "num_tokens": 48609912.0, "step": 22470 }, { "entropy": 6.4948567867279055, "epoch": 2.4050510995772916, "grad_norm": 1.4296875, "learning_rate": 0.0004426944919301158, "loss": 6.2193, "mean_token_accuracy": 0.13821542486548424, "num_tokens": 48621614.0, "step": 22475 }, { "entropy": 6.445605039596558, "epoch": 2.4055861736850552, "grad_norm": 1.3203125, "learning_rate": 0.00044266899858805964, "loss": 6.0922, "mean_token_accuracy": 0.1508389189839363, "num_tokens": 48632539.0, "step": 22480 }, { "entropy": 6.57605390548706, "epoch": 2.4061212477928193, "grad_norm": 1.2890625, "learning_rate": 0.00044264350040458463, "loss": 6.2041, "mean_token_accuracy": 0.14077507331967354, "num_tokens": 48644157.0, "step": 22485 }, { "entropy": 6.52549180984497, "epoch": 2.4066563219005834, "grad_norm": 2.875, "learning_rate": 0.00044261799738042713, "loss": 6.1872, "mean_token_accuracy": 0.146114069968462, "num_tokens": 48654928.0, "step": 22490 }, { "entropy": 6.498835039138794, "epoch": 2.407191396008347, "grad_norm": 1.2421875, "learning_rate": 0.0004425924895163235, "loss": 6.1033, "mean_token_accuracy": 0.15451390743255616, "num_tokens": 48665183.0, "step": 22495 }, { "entropy": 6.45039701461792, "epoch": 2.407726470116111, "grad_norm": 1.25, "learning_rate": 0.00044256697681301034, "loss": 6.0378, "mean_token_accuracy": 0.1531726285815239, "num_tokens": 48675233.0, "step": 22500 }, { "entropy": 6.467570495605469, "epoch": 2.408261544223875, "grad_norm": 1.1640625, "learning_rate": 0.0004425414592712242, "loss": 6.1008, "mean_token_accuracy": 0.14776048362255095, "num_tokens": 48685881.0, "step": 22505 }, { "entropy": 6.476493644714355, "epoch": 2.408796618331639, "grad_norm": 1.1796875, "learning_rate": 0.00044251593689170196, "loss": 6.1672, "mean_token_accuracy": 0.13813733235001563, "num_tokens": 48696402.0, "step": 22510 }, { "entropy": 6.492434930801392, "epoch": 2.409331692439403, "grad_norm": 1.546875, "learning_rate": 0.00044249040967518063, "loss": 6.1586, "mean_token_accuracy": 0.14482902586460114, "num_tokens": 48708041.0, "step": 22515 }, { "entropy": 6.511981630325318, "epoch": 2.4098667665471667, "grad_norm": 1.3125, "learning_rate": 0.00044246487762239717, "loss": 6.0598, "mean_token_accuracy": 0.14756403118371964, "num_tokens": 48718836.0, "step": 22520 }, { "entropy": 6.456007957458496, "epoch": 2.410401840654931, "grad_norm": 1.4453125, "learning_rate": 0.000442439340734089, "loss": 6.0968, "mean_token_accuracy": 0.14885153025388717, "num_tokens": 48729115.0, "step": 22525 }, { "entropy": 6.4136334419250485, "epoch": 2.4109369147626944, "grad_norm": 1.28125, "learning_rate": 0.00044241379901099334, "loss": 6.0653, "mean_token_accuracy": 0.1515069618821144, "num_tokens": 48740037.0, "step": 22530 }, { "entropy": 6.437617921829224, "epoch": 2.4114719888704585, "grad_norm": 1.375, "learning_rate": 0.00044238825245384775, "loss": 6.1073, "mean_token_accuracy": 0.1455809637904167, "num_tokens": 48750894.0, "step": 22535 }, { "entropy": 6.481311511993408, "epoch": 2.4120070629782226, "grad_norm": 1.1640625, "learning_rate": 0.0004423627010633899, "loss": 6.0347, "mean_token_accuracy": 0.1552007332444191, "num_tokens": 48761566.0, "step": 22540 }, { "entropy": 6.306411981582642, "epoch": 2.4125421370859863, "grad_norm": 1.5, "learning_rate": 0.00044233714484035765, "loss": 5.9936, "mean_token_accuracy": 0.15204857736825944, "num_tokens": 48772971.0, "step": 22545 }, { "entropy": 6.364185476303101, "epoch": 2.4130772111937504, "grad_norm": 1.078125, "learning_rate": 0.00044231158378548873, "loss": 6.0876, "mean_token_accuracy": 0.14920533671975136, "num_tokens": 48784548.0, "step": 22550 }, { "entropy": 6.321473407745361, "epoch": 2.4136122853015145, "grad_norm": 1.2265625, "learning_rate": 0.0004422860178995215, "loss": 5.9247, "mean_token_accuracy": 0.15894851684570313, "num_tokens": 48795228.0, "step": 22555 }, { "entropy": 6.471438884735107, "epoch": 2.414147359409278, "grad_norm": 1.2890625, "learning_rate": 0.00044226044718319383, "loss": 6.038, "mean_token_accuracy": 0.14554901495575906, "num_tokens": 48806497.0, "step": 22560 }, { "entropy": 6.473359823226929, "epoch": 2.4146824335170423, "grad_norm": 1.25, "learning_rate": 0.0004422348716372444, "loss": 6.0903, "mean_token_accuracy": 0.14836304187774657, "num_tokens": 48816402.0, "step": 22565 }, { "entropy": 6.509381818771362, "epoch": 2.415217507624806, "grad_norm": 1.234375, "learning_rate": 0.0004422092912624115, "loss": 6.0256, "mean_token_accuracy": 0.14918296039104462, "num_tokens": 48826151.0, "step": 22570 }, { "entropy": 6.412098503112793, "epoch": 2.41575258173257, "grad_norm": 1.3203125, "learning_rate": 0.00044218370605943376, "loss": 6.1332, "mean_token_accuracy": 0.1476098269224167, "num_tokens": 48836458.0, "step": 22575 }, { "entropy": 6.420450353622437, "epoch": 2.4162876558403337, "grad_norm": 1.2890625, "learning_rate": 0.00044215811602905003, "loss": 6.1031, "mean_token_accuracy": 0.14455177783966064, "num_tokens": 48845863.0, "step": 22580 }, { "entropy": 6.479944658279419, "epoch": 2.4168227299480978, "grad_norm": 1.1875, "learning_rate": 0.00044213252117199914, "loss": 6.1113, "mean_token_accuracy": 0.14214532673358918, "num_tokens": 48856453.0, "step": 22585 }, { "entropy": 6.492744493484497, "epoch": 2.417357804055862, "grad_norm": 1.1484375, "learning_rate": 0.00044210692148902034, "loss": 6.0395, "mean_token_accuracy": 0.14207544103264808, "num_tokens": 48867013.0, "step": 22590 }, { "entropy": 6.453858852386475, "epoch": 2.4178928781636255, "grad_norm": 1.1796875, "learning_rate": 0.0004420813169808525, "loss": 6.0759, "mean_token_accuracy": 0.14191123098134995, "num_tokens": 48876455.0, "step": 22595 }, { "entropy": 6.422561597824097, "epoch": 2.4184279522713896, "grad_norm": 1.578125, "learning_rate": 0.0004420557076482352, "loss": 6.1413, "mean_token_accuracy": 0.14265096932649612, "num_tokens": 48888223.0, "step": 22600 }, { "entropy": 6.4624885559082035, "epoch": 2.4189630263791537, "grad_norm": 1.328125, "learning_rate": 0.00044203009349190784, "loss": 6.1068, "mean_token_accuracy": 0.14904020428657533, "num_tokens": 48899287.0, "step": 22605 }, { "entropy": 6.471385812759399, "epoch": 2.4194981004869174, "grad_norm": 1.2578125, "learning_rate": 0.0004420044745126099, "loss": 6.1289, "mean_token_accuracy": 0.1431280069053173, "num_tokens": 48910740.0, "step": 22610 }, { "entropy": 6.415463924407959, "epoch": 2.4200331745946815, "grad_norm": 1.21875, "learning_rate": 0.00044197885071108127, "loss": 5.9592, "mean_token_accuracy": 0.14546657726168633, "num_tokens": 48921925.0, "step": 22615 }, { "entropy": 6.477572059631347, "epoch": 2.420568248702445, "grad_norm": 1.921875, "learning_rate": 0.0004419532220880619, "loss": 6.2234, "mean_token_accuracy": 0.13765173256397248, "num_tokens": 48933164.0, "step": 22620 }, { "entropy": 6.4573770523071286, "epoch": 2.4211033228102092, "grad_norm": 1.2734375, "learning_rate": 0.00044192758864429157, "loss": 6.1553, "mean_token_accuracy": 0.14260666817426682, "num_tokens": 48943285.0, "step": 22625 }, { "entropy": 6.4639030456542965, "epoch": 2.421638396917973, "grad_norm": 1.2109375, "learning_rate": 0.0004419019503805106, "loss": 6.0791, "mean_token_accuracy": 0.13802081048488618, "num_tokens": 48952852.0, "step": 22630 }, { "entropy": 6.475673580169678, "epoch": 2.422173471025737, "grad_norm": 1.34375, "learning_rate": 0.00044187630729745924, "loss": 6.2021, "mean_token_accuracy": 0.1392153263092041, "num_tokens": 48964339.0, "step": 22635 }, { "entropy": 6.548929643630982, "epoch": 2.422708545133501, "grad_norm": 1.578125, "learning_rate": 0.00044185065939587805, "loss": 6.0928, "mean_token_accuracy": 0.14192020371556283, "num_tokens": 48974754.0, "step": 22640 }, { "entropy": 6.529342985153198, "epoch": 2.4232436192412647, "grad_norm": 1.34375, "learning_rate": 0.00044182500667650746, "loss": 6.1153, "mean_token_accuracy": 0.15106630325317383, "num_tokens": 48985596.0, "step": 22645 }, { "entropy": 6.482286691665649, "epoch": 2.423778693349029, "grad_norm": 1.203125, "learning_rate": 0.0004417993491400882, "loss": 6.1493, "mean_token_accuracy": 0.14724427387118338, "num_tokens": 48997400.0, "step": 22650 }, { "entropy": 6.464413404464722, "epoch": 2.424313767456793, "grad_norm": 1.3125, "learning_rate": 0.00044177368678736126, "loss": 6.0676, "mean_token_accuracy": 0.14810301959514618, "num_tokens": 49007525.0, "step": 22655 }, { "entropy": 6.40142855644226, "epoch": 2.4248488415645566, "grad_norm": 1.2578125, "learning_rate": 0.00044174801961906744, "loss": 6.0985, "mean_token_accuracy": 0.146372439712286, "num_tokens": 49018205.0, "step": 22660 }, { "entropy": 6.501100969314575, "epoch": 2.4253839156723207, "grad_norm": 1.2890625, "learning_rate": 0.00044172234763594805, "loss": 6.1516, "mean_token_accuracy": 0.13930772989988327, "num_tokens": 49028760.0, "step": 22665 }, { "entropy": 6.497635555267334, "epoch": 2.4259189897800844, "grad_norm": 1.2578125, "learning_rate": 0.0004416966708387443, "loss": 6.0781, "mean_token_accuracy": 0.14591245353221893, "num_tokens": 49040734.0, "step": 22670 }, { "entropy": 6.443426513671875, "epoch": 2.4264540638878485, "grad_norm": 1.2421875, "learning_rate": 0.00044167098922819764, "loss": 6.0777, "mean_token_accuracy": 0.1393363393843174, "num_tokens": 49051474.0, "step": 22675 }, { "entropy": 6.413713979721069, "epoch": 2.4269891379956126, "grad_norm": 1.2578125, "learning_rate": 0.00044164530280504954, "loss": 6.0633, "mean_token_accuracy": 0.15655675828456878, "num_tokens": 49061697.0, "step": 22680 }, { "entropy": 6.4234696388244625, "epoch": 2.427524212103376, "grad_norm": 2.40625, "learning_rate": 0.00044161961157004176, "loss": 6.0956, "mean_token_accuracy": 0.15082429945468903, "num_tokens": 49072124.0, "step": 22685 }, { "entropy": 6.489072465896607, "epoch": 2.4280592862111403, "grad_norm": 1.390625, "learning_rate": 0.000441593915523916, "loss": 6.0859, "mean_token_accuracy": 0.14353536069393158, "num_tokens": 49082653.0, "step": 22690 }, { "entropy": 6.54815263748169, "epoch": 2.428594360318904, "grad_norm": 1.1796875, "learning_rate": 0.00044156821466741447, "loss": 6.1918, "mean_token_accuracy": 0.1378464676439762, "num_tokens": 49092481.0, "step": 22695 }, { "entropy": 6.503483247756958, "epoch": 2.429129434426668, "grad_norm": 1.1875, "learning_rate": 0.0004415425090012792, "loss": 6.1721, "mean_token_accuracy": 0.13664378374814987, "num_tokens": 49103189.0, "step": 22700 }, { "entropy": 6.508397340774536, "epoch": 2.429664508534432, "grad_norm": 1.125, "learning_rate": 0.00044151679852625226, "loss": 6.1281, "mean_token_accuracy": 0.14309491217136383, "num_tokens": 49114071.0, "step": 22705 }, { "entropy": 6.520497989654541, "epoch": 2.430199582642196, "grad_norm": 1.2421875, "learning_rate": 0.0004414910832430762, "loss": 6.0855, "mean_token_accuracy": 0.14919390380382538, "num_tokens": 49125521.0, "step": 22710 }, { "entropy": 6.4971236228942875, "epoch": 2.43073465674996, "grad_norm": 1.34375, "learning_rate": 0.0004414653631524935, "loss": 6.0561, "mean_token_accuracy": 0.14214812368154525, "num_tokens": 49136162.0, "step": 22715 }, { "entropy": 6.510256052017212, "epoch": 2.431269730857724, "grad_norm": 1.2890625, "learning_rate": 0.0004414396382552468, "loss": 6.0938, "mean_token_accuracy": 0.1436297044157982, "num_tokens": 49146127.0, "step": 22720 }, { "entropy": 6.46959342956543, "epoch": 2.4318048049654877, "grad_norm": 1.234375, "learning_rate": 0.00044141390855207904, "loss": 6.0393, "mean_token_accuracy": 0.15364223942160607, "num_tokens": 49156619.0, "step": 22725 }, { "entropy": 6.415626573562622, "epoch": 2.4323398790732518, "grad_norm": 1.40625, "learning_rate": 0.00044138817404373295, "loss": 6.2045, "mean_token_accuracy": 0.13829587697982787, "num_tokens": 49168578.0, "step": 22730 }, { "entropy": 6.500268459320068, "epoch": 2.4328749531810154, "grad_norm": 1.3515625, "learning_rate": 0.0004413624347309517, "loss": 6.1626, "mean_token_accuracy": 0.14751689434051513, "num_tokens": 49178845.0, "step": 22735 }, { "entropy": 6.527559614181518, "epoch": 2.4334100272887795, "grad_norm": 1.2734375, "learning_rate": 0.00044133669061447855, "loss": 6.1337, "mean_token_accuracy": 0.14516956731677055, "num_tokens": 49189067.0, "step": 22740 }, { "entropy": 6.511234521865845, "epoch": 2.433945101396543, "grad_norm": 1.1484375, "learning_rate": 0.00044131094169505694, "loss": 6.1373, "mean_token_accuracy": 0.13915981277823447, "num_tokens": 49200368.0, "step": 22745 }, { "entropy": 6.445730495452881, "epoch": 2.4344801755043073, "grad_norm": 1.3125, "learning_rate": 0.00044128518797343014, "loss": 6.0812, "mean_token_accuracy": 0.146923066675663, "num_tokens": 49211630.0, "step": 22750 }, { "entropy": 6.510638475418091, "epoch": 2.4350152496120714, "grad_norm": 1.734375, "learning_rate": 0.000441259429450342, "loss": 6.155, "mean_token_accuracy": 0.14221021831035613, "num_tokens": 49223092.0, "step": 22755 }, { "entropy": 6.516750764846802, "epoch": 2.435550323719835, "grad_norm": 1.4375, "learning_rate": 0.00044123366612653617, "loss": 6.1043, "mean_token_accuracy": 0.14769039750099183, "num_tokens": 49233963.0, "step": 22760 }, { "entropy": 6.510983324050903, "epoch": 2.436085397827599, "grad_norm": 1.1484375, "learning_rate": 0.0004412078980027565, "loss": 6.1335, "mean_token_accuracy": 0.14667008966207504, "num_tokens": 49243834.0, "step": 22765 }, { "entropy": 6.3816369533538815, "epoch": 2.4366204719353632, "grad_norm": 1.2578125, "learning_rate": 0.0004411821250797472, "loss": 5.957, "mean_token_accuracy": 0.15285905301570893, "num_tokens": 49254274.0, "step": 22770 }, { "entropy": 6.4198259830474855, "epoch": 2.437155546043127, "grad_norm": 1.3671875, "learning_rate": 0.0004411563473582524, "loss": 6.0114, "mean_token_accuracy": 0.15313953161239624, "num_tokens": 49264734.0, "step": 22775 }, { "entropy": 6.45964789390564, "epoch": 2.437690620150891, "grad_norm": 1.34375, "learning_rate": 0.0004411305648390163, "loss": 6.0657, "mean_token_accuracy": 0.14700526148080825, "num_tokens": 49274708.0, "step": 22780 }, { "entropy": 6.428467702865601, "epoch": 2.4382256942586547, "grad_norm": 1.1171875, "learning_rate": 0.0004411047775227836, "loss": 6.095, "mean_token_accuracy": 0.14973544627428054, "num_tokens": 49286318.0, "step": 22785 }, { "entropy": 6.561038875579834, "epoch": 2.4387607683664188, "grad_norm": 1.25, "learning_rate": 0.00044107898541029885, "loss": 6.1423, "mean_token_accuracy": 0.14294078052043915, "num_tokens": 49296948.0, "step": 22790 }, { "entropy": 6.394412851333618, "epoch": 2.439295842474183, "grad_norm": 1.203125, "learning_rate": 0.0004410531885023066, "loss": 6.0065, "mean_token_accuracy": 0.1525759816169739, "num_tokens": 49307060.0, "step": 22795 }, { "entropy": 6.4518519878387455, "epoch": 2.4398309165819465, "grad_norm": 1.40625, "learning_rate": 0.00044102738679955195, "loss": 6.1154, "mean_token_accuracy": 0.1396223224699497, "num_tokens": 49318449.0, "step": 22800 }, { "entropy": 6.4768232822418215, "epoch": 2.4403659906897106, "grad_norm": 1.3359375, "learning_rate": 0.0004410015803027798, "loss": 6.1246, "mean_token_accuracy": 0.1476379208266735, "num_tokens": 49329567.0, "step": 22805 }, { "entropy": 6.531068229675293, "epoch": 2.4409010647974743, "grad_norm": 1.53125, "learning_rate": 0.00044097576901273535, "loss": 6.1324, "mean_token_accuracy": 0.1490224227309227, "num_tokens": 49340854.0, "step": 22810 }, { "entropy": 6.511512708663941, "epoch": 2.4414361389052384, "grad_norm": 1.3125, "learning_rate": 0.0004409499529301639, "loss": 6.1751, "mean_token_accuracy": 0.1371899165213108, "num_tokens": 49352749.0, "step": 22815 }, { "entropy": 6.520124387741089, "epoch": 2.4419712130130025, "grad_norm": 1.0703125, "learning_rate": 0.0004409241320558109, "loss": 6.1539, "mean_token_accuracy": 0.13934962078928947, "num_tokens": 49364703.0, "step": 22820 }, { "entropy": 6.421018981933594, "epoch": 2.442506287120766, "grad_norm": 1.3203125, "learning_rate": 0.00044089830639042183, "loss": 6.0204, "mean_token_accuracy": 0.14887553080916405, "num_tokens": 49375873.0, "step": 22825 }, { "entropy": 6.493728590011597, "epoch": 2.44304136122853, "grad_norm": 1.21875, "learning_rate": 0.00044087247593474255, "loss": 6.1574, "mean_token_accuracy": 0.14297319129109382, "num_tokens": 49386578.0, "step": 22830 }, { "entropy": 6.490143918991089, "epoch": 2.4435764353362943, "grad_norm": 1.234375, "learning_rate": 0.0004408466406895188, "loss": 6.1052, "mean_token_accuracy": 0.14254355281591416, "num_tokens": 49398394.0, "step": 22835 }, { "entropy": 6.415010547637939, "epoch": 2.444111509444058, "grad_norm": 1.328125, "learning_rate": 0.0004408208006554966, "loss": 6.0455, "mean_token_accuracy": 0.16062988042831422, "num_tokens": 49408758.0, "step": 22840 }, { "entropy": 6.434513521194458, "epoch": 2.444646583551822, "grad_norm": 1.1875, "learning_rate": 0.0004407949558334221, "loss": 6.0638, "mean_token_accuracy": 0.14622282311320306, "num_tokens": 49420447.0, "step": 22845 }, { "entropy": 6.488108825683594, "epoch": 2.4451816576595857, "grad_norm": 3.625, "learning_rate": 0.00044076910622404153, "loss": 6.1242, "mean_token_accuracy": 0.14922792315483094, "num_tokens": 49430246.0, "step": 22850 }, { "entropy": 6.4994512557983395, "epoch": 2.44571673176735, "grad_norm": 1.765625, "learning_rate": 0.00044074325182810135, "loss": 6.0817, "mean_token_accuracy": 0.14986441880464554, "num_tokens": 49441272.0, "step": 22855 }, { "entropy": 6.449289035797119, "epoch": 2.4462518058751135, "grad_norm": 1.328125, "learning_rate": 0.00044071739264634803, "loss": 6.1198, "mean_token_accuracy": 0.1379289485514164, "num_tokens": 49452778.0, "step": 22860 }, { "entropy": 6.479628276824951, "epoch": 2.4467868799828776, "grad_norm": 1.25, "learning_rate": 0.0004406915286795283, "loss": 6.0987, "mean_token_accuracy": 0.14443983361124993, "num_tokens": 49463594.0, "step": 22865 }, { "entropy": 6.479138946533203, "epoch": 2.4473219540906417, "grad_norm": 1.0859375, "learning_rate": 0.0004406656599283889, "loss": 6.1224, "mean_token_accuracy": 0.14434010833501815, "num_tokens": 49473649.0, "step": 22870 }, { "entropy": 6.4379212856292725, "epoch": 2.4478570281984053, "grad_norm": 1.203125, "learning_rate": 0.0004406397863936769, "loss": 6.0499, "mean_token_accuracy": 0.15006129294633866, "num_tokens": 49485112.0, "step": 22875 }, { "entropy": 6.478448152542114, "epoch": 2.4483921023061694, "grad_norm": 1.328125, "learning_rate": 0.0004406139080761394, "loss": 6.1658, "mean_token_accuracy": 0.14289058968424798, "num_tokens": 49495455.0, "step": 22880 }, { "entropy": 6.483002424240112, "epoch": 2.4489271764139335, "grad_norm": 1.265625, "learning_rate": 0.0004405880249765235, "loss": 6.0915, "mean_token_accuracy": 0.1443782240152359, "num_tokens": 49506495.0, "step": 22885 }, { "entropy": 6.48294768333435, "epoch": 2.449462250521697, "grad_norm": 1.15625, "learning_rate": 0.00044056213709557667, "loss": 6.1201, "mean_token_accuracy": 0.14086200296878815, "num_tokens": 49516384.0, "step": 22890 }, { "entropy": 6.451174259185791, "epoch": 2.4499973246294613, "grad_norm": 1.4140625, "learning_rate": 0.00044053624443404646, "loss": 6.0919, "mean_token_accuracy": 0.15161909013986588, "num_tokens": 49527972.0, "step": 22895 }, { "entropy": 6.448730897903443, "epoch": 2.450532398737225, "grad_norm": 1.390625, "learning_rate": 0.0004405103469926803, "loss": 6.0456, "mean_token_accuracy": 0.14860376343131065, "num_tokens": 49540643.0, "step": 22900 }, { "entropy": 6.39932770729065, "epoch": 2.451067472844989, "grad_norm": 1.1875, "learning_rate": 0.00044048444477222626, "loss": 6.0153, "mean_token_accuracy": 0.1538733258843422, "num_tokens": 49550968.0, "step": 22905 }, { "entropy": 6.416860103607178, "epoch": 2.451602546952753, "grad_norm": 1.453125, "learning_rate": 0.0004404585377734321, "loss": 6.0506, "mean_token_accuracy": 0.14601152762770653, "num_tokens": 49562381.0, "step": 22910 }, { "entropy": 6.406810569763183, "epoch": 2.452137621060517, "grad_norm": 1.2890625, "learning_rate": 0.0004404326259970459, "loss": 6.1291, "mean_token_accuracy": 0.1447313718497753, "num_tokens": 49573414.0, "step": 22915 }, { "entropy": 6.488003444671631, "epoch": 2.452672695168281, "grad_norm": 1.2890625, "learning_rate": 0.0004404067094438159, "loss": 6.1581, "mean_token_accuracy": 0.1477361500263214, "num_tokens": 49583772.0, "step": 22920 }, { "entropy": 6.478089761734009, "epoch": 2.4532077692760446, "grad_norm": 1.2578125, "learning_rate": 0.0004403807881144903, "loss": 6.1583, "mean_token_accuracy": 0.13924882858991622, "num_tokens": 49594751.0, "step": 22925 }, { "entropy": 6.426532173156739, "epoch": 2.4537428433838087, "grad_norm": 1.2265625, "learning_rate": 0.00044035486200981786, "loss": 6.049, "mean_token_accuracy": 0.14557305574417115, "num_tokens": 49605048.0, "step": 22930 }, { "entropy": 6.513061380386352, "epoch": 2.4542779174915728, "grad_norm": 1.328125, "learning_rate": 0.00044032893113054683, "loss": 6.1763, "mean_token_accuracy": 0.14277911186218262, "num_tokens": 49616582.0, "step": 22935 }, { "entropy": 6.532836675643921, "epoch": 2.4548129915993364, "grad_norm": 1.3984375, "learning_rate": 0.0004403029954774263, "loss": 6.1013, "mean_token_accuracy": 0.14294343516230584, "num_tokens": 49626974.0, "step": 22940 }, { "entropy": 6.45196304321289, "epoch": 2.4553480657071005, "grad_norm": 1.265625, "learning_rate": 0.0004402770550512049, "loss": 6.0745, "mean_token_accuracy": 0.14586984887719154, "num_tokens": 49637580.0, "step": 22945 }, { "entropy": 6.513627624511718, "epoch": 2.455883139814864, "grad_norm": 1.2265625, "learning_rate": 0.0004402511098526318, "loss": 6.1349, "mean_token_accuracy": 0.1434204913675785, "num_tokens": 49648543.0, "step": 22950 }, { "entropy": 6.502149057388306, "epoch": 2.4564182139226283, "grad_norm": 1.2265625, "learning_rate": 0.0004402251598824561, "loss": 6.1328, "mean_token_accuracy": 0.14280304610729216, "num_tokens": 49659057.0, "step": 22955 }, { "entropy": 6.410835123062133, "epoch": 2.4569532880303924, "grad_norm": 1.2890625, "learning_rate": 0.0004401992051414272, "loss": 6.0753, "mean_token_accuracy": 0.14516770616173744, "num_tokens": 49671226.0, "step": 22960 }, { "entropy": 6.475321960449219, "epoch": 2.457488362138156, "grad_norm": 1.3515625, "learning_rate": 0.00044017324563029435, "loss": 6.0858, "mean_token_accuracy": 0.14667897745966912, "num_tokens": 49682063.0, "step": 22965 }, { "entropy": 6.423736429214477, "epoch": 2.45802343624592, "grad_norm": 1.171875, "learning_rate": 0.0004401472813498074, "loss": 6.0617, "mean_token_accuracy": 0.14960189312696456, "num_tokens": 49693768.0, "step": 22970 }, { "entropy": 6.466357040405273, "epoch": 2.458558510353684, "grad_norm": 1.234375, "learning_rate": 0.00044012131230071575, "loss": 6.1195, "mean_token_accuracy": 0.1430794417858124, "num_tokens": 49703807.0, "step": 22975 }, { "entropy": 6.444790935516357, "epoch": 2.459093584461448, "grad_norm": 1.2421875, "learning_rate": 0.0004400953384837695, "loss": 6.0938, "mean_token_accuracy": 0.14478445202112197, "num_tokens": 49714945.0, "step": 22980 }, { "entropy": 6.459289789199829, "epoch": 2.459628658569212, "grad_norm": 1.1796875, "learning_rate": 0.0004400693598997185, "loss": 6.026, "mean_token_accuracy": 0.15960747748613358, "num_tokens": 49727267.0, "step": 22985 }, { "entropy": 6.408087491989136, "epoch": 2.4601637326769756, "grad_norm": 1.25, "learning_rate": 0.00044004337654931293, "loss": 6.0221, "mean_token_accuracy": 0.14450939372181892, "num_tokens": 49738370.0, "step": 22990 }, { "entropy": 6.4737691402435305, "epoch": 2.4606988067847397, "grad_norm": 1.2890625, "learning_rate": 0.00044001738843330306, "loss": 6.1205, "mean_token_accuracy": 0.14351325035095214, "num_tokens": 49750113.0, "step": 22995 }, { "entropy": 6.486575174331665, "epoch": 2.461233880892504, "grad_norm": 1.3125, "learning_rate": 0.00043999139555243936, "loss": 6.186, "mean_token_accuracy": 0.1371962085366249, "num_tokens": 49761163.0, "step": 23000 }, { "entropy": 6.512165069580078, "epoch": 2.4617689550002675, "grad_norm": 1.2421875, "learning_rate": 0.0004399653979074722, "loss": 6.1001, "mean_token_accuracy": 0.14443175718188286, "num_tokens": 49771185.0, "step": 23005 }, { "entropy": 6.474620771408081, "epoch": 2.4623040291080316, "grad_norm": 1.5, "learning_rate": 0.00043993939549915245, "loss": 6.0988, "mean_token_accuracy": 0.14699120223522186, "num_tokens": 49781202.0, "step": 23010 }, { "entropy": 6.435923099517822, "epoch": 2.4628391032157952, "grad_norm": 1.3125, "learning_rate": 0.00043991338832823074, "loss": 6.0809, "mean_token_accuracy": 0.14400503635406495, "num_tokens": 49790971.0, "step": 23015 }, { "entropy": 6.422207832336426, "epoch": 2.4633741773235593, "grad_norm": 1.21875, "learning_rate": 0.0004398873763954582, "loss": 6.0504, "mean_token_accuracy": 0.14769563227891921, "num_tokens": 49800942.0, "step": 23020 }, { "entropy": 6.405848407745362, "epoch": 2.463909251431323, "grad_norm": 1.0625, "learning_rate": 0.00043986135970158573, "loss": 6.034, "mean_token_accuracy": 0.1474476121366024, "num_tokens": 49812043.0, "step": 23025 }, { "entropy": 6.365705394744873, "epoch": 2.464444325539087, "grad_norm": 1.15625, "learning_rate": 0.00043983533824736476, "loss": 6.0348, "mean_token_accuracy": 0.15809634178876877, "num_tokens": 49823045.0, "step": 23030 }, { "entropy": 6.503657388687134, "epoch": 2.464979399646851, "grad_norm": 1.6875, "learning_rate": 0.0004398093120335465, "loss": 6.1443, "mean_token_accuracy": 0.14928590059280394, "num_tokens": 49833014.0, "step": 23035 }, { "entropy": 6.409166574478149, "epoch": 2.465514473754615, "grad_norm": 1.2890625, "learning_rate": 0.00043978328106088254, "loss": 6.0483, "mean_token_accuracy": 0.14776428788900375, "num_tokens": 49843171.0, "step": 23040 }, { "entropy": 6.3962408065795895, "epoch": 2.466049547862379, "grad_norm": 1.2578125, "learning_rate": 0.0004397572453301246, "loss": 5.9595, "mean_token_accuracy": 0.15220305025577546, "num_tokens": 49853772.0, "step": 23045 }, { "entropy": 6.457070207595825, "epoch": 2.466584621970143, "grad_norm": 1.140625, "learning_rate": 0.00043973120484202416, "loss": 6.1059, "mean_token_accuracy": 0.1467456340789795, "num_tokens": 49865379.0, "step": 23050 }, { "entropy": 6.455566263198852, "epoch": 2.4671196960779067, "grad_norm": 1.234375, "learning_rate": 0.00043970515959733343, "loss": 6.1403, "mean_token_accuracy": 0.14159029349684715, "num_tokens": 49876453.0, "step": 23055 }, { "entropy": 6.37555570602417, "epoch": 2.467654770185671, "grad_norm": 1.1328125, "learning_rate": 0.00043967910959680435, "loss": 6.0181, "mean_token_accuracy": 0.15629979074001313, "num_tokens": 49886675.0, "step": 23060 }, { "entropy": 6.398741769790649, "epoch": 2.4681898442934345, "grad_norm": 1.1328125, "learning_rate": 0.0004396530548411891, "loss": 5.9593, "mean_token_accuracy": 0.14982084035873414, "num_tokens": 49896946.0, "step": 23065 }, { "entropy": 6.462337923049927, "epoch": 2.4687249184011986, "grad_norm": 1.25, "learning_rate": 0.0004396269953312401, "loss": 6.1644, "mean_token_accuracy": 0.1378537319600582, "num_tokens": 49906989.0, "step": 23070 }, { "entropy": 6.367944669723511, "epoch": 2.4692599925089627, "grad_norm": 1.3828125, "learning_rate": 0.00043960093106770964, "loss": 5.9328, "mean_token_accuracy": 0.15191028118133545, "num_tokens": 49917861.0, "step": 23075 }, { "entropy": 6.400054168701172, "epoch": 2.4697950666167263, "grad_norm": 1.375, "learning_rate": 0.00043957486205135047, "loss": 6.1082, "mean_token_accuracy": 0.14867668226361275, "num_tokens": 49930529.0, "step": 23080 }, { "entropy": 6.440872430801392, "epoch": 2.4703301407244904, "grad_norm": 1.1875, "learning_rate": 0.0004395487882829153, "loss": 6.0491, "mean_token_accuracy": 0.14804016947746276, "num_tokens": 49943067.0, "step": 23085 }, { "entropy": 6.468083000183105, "epoch": 2.470865214832254, "grad_norm": 1.1953125, "learning_rate": 0.00043952270976315707, "loss": 6.0929, "mean_token_accuracy": 0.14439067244529724, "num_tokens": 49953648.0, "step": 23090 }, { "entropy": 6.509150695800781, "epoch": 2.471400288940018, "grad_norm": 1.171875, "learning_rate": 0.00043949662649282853, "loss": 6.1519, "mean_token_accuracy": 0.13846293613314628, "num_tokens": 49963571.0, "step": 23095 }, { "entropy": 6.4821052074432375, "epoch": 2.4719353630477823, "grad_norm": 1.1953125, "learning_rate": 0.00043947053847268313, "loss": 6.0943, "mean_token_accuracy": 0.15272858291864394, "num_tokens": 49974627.0, "step": 23100 }, { "entropy": 6.520781564712524, "epoch": 2.472470437155546, "grad_norm": 1.1875, "learning_rate": 0.000439444445703474, "loss": 6.1571, "mean_token_accuracy": 0.14583753868937493, "num_tokens": 49986659.0, "step": 23105 }, { "entropy": 6.452333688735962, "epoch": 2.47300551126331, "grad_norm": 1.2109375, "learning_rate": 0.00043941834818595464, "loss": 6.0701, "mean_token_accuracy": 0.150446055829525, "num_tokens": 49997099.0, "step": 23110 }, { "entropy": 6.421077680587769, "epoch": 2.473540585371074, "grad_norm": 1.4765625, "learning_rate": 0.00043939224592087864, "loss": 6.0976, "mean_token_accuracy": 0.14522971212863922, "num_tokens": 50008148.0, "step": 23115 }, { "entropy": 6.531986284255981, "epoch": 2.474075659478838, "grad_norm": 1.3046875, "learning_rate": 0.00043936613890899955, "loss": 6.181, "mean_token_accuracy": 0.1413787081837654, "num_tokens": 50019335.0, "step": 23120 }, { "entropy": 6.427493143081665, "epoch": 2.474610733586602, "grad_norm": 1.2890625, "learning_rate": 0.0004393400271510713, "loss": 6.0461, "mean_token_accuracy": 0.1487402305006981, "num_tokens": 50029513.0, "step": 23125 }, { "entropy": 6.495285224914551, "epoch": 2.4751458076943655, "grad_norm": 1.1953125, "learning_rate": 0.00043931391064784786, "loss": 6.1566, "mean_token_accuracy": 0.1396355152130127, "num_tokens": 50039353.0, "step": 23130 }, { "entropy": 6.460680055618286, "epoch": 2.4756808818021296, "grad_norm": 1.3828125, "learning_rate": 0.00043928778940008334, "loss": 6.1395, "mean_token_accuracy": 0.14789653718471527, "num_tokens": 50050260.0, "step": 23135 }, { "entropy": 6.38835916519165, "epoch": 2.4762159559098933, "grad_norm": 1.1015625, "learning_rate": 0.00043926166340853203, "loss": 5.9717, "mean_token_accuracy": 0.14648790806531906, "num_tokens": 50061384.0, "step": 23140 }, { "entropy": 6.468059730529785, "epoch": 2.4767510300176574, "grad_norm": 1.359375, "learning_rate": 0.0004392355326739483, "loss": 6.0317, "mean_token_accuracy": 0.15342689007520677, "num_tokens": 50071984.0, "step": 23145 }, { "entropy": 6.456266403198242, "epoch": 2.4772861041254215, "grad_norm": 1.3125, "learning_rate": 0.00043920939719708656, "loss": 6.0433, "mean_token_accuracy": 0.1549179270863533, "num_tokens": 50083225.0, "step": 23150 }, { "entropy": 6.434696054458618, "epoch": 2.477821178233185, "grad_norm": 1.359375, "learning_rate": 0.0004391832569787016, "loss": 6.0641, "mean_token_accuracy": 0.15381431430578232, "num_tokens": 50093240.0, "step": 23155 }, { "entropy": 6.423350858688354, "epoch": 2.4783562523409493, "grad_norm": 1.171875, "learning_rate": 0.0004391571120195481, "loss": 6.0996, "mean_token_accuracy": 0.14446234777569772, "num_tokens": 50103870.0, "step": 23160 }, { "entropy": 6.4318469047546385, "epoch": 2.4788913264487134, "grad_norm": 1.625, "learning_rate": 0.0004391309623203811, "loss": 6.1336, "mean_token_accuracy": 0.1447260245680809, "num_tokens": 50115231.0, "step": 23165 }, { "entropy": 6.458612775802612, "epoch": 2.479426400556477, "grad_norm": 1.171875, "learning_rate": 0.0004391048078819556, "loss": 6.0209, "mean_token_accuracy": 0.14789726138114928, "num_tokens": 50125592.0, "step": 23170 }, { "entropy": 6.370980739593506, "epoch": 2.479961474664241, "grad_norm": 1.2578125, "learning_rate": 0.0004390786487050269, "loss": 6.0174, "mean_token_accuracy": 0.1512372836470604, "num_tokens": 50136713.0, "step": 23175 }, { "entropy": 6.459298944473266, "epoch": 2.4804965487720048, "grad_norm": 1.6875, "learning_rate": 0.0004390524847903502, "loss": 6.1103, "mean_token_accuracy": 0.1442016489803791, "num_tokens": 50148645.0, "step": 23180 }, { "entropy": 6.510531091690064, "epoch": 2.481031622879769, "grad_norm": 2.203125, "learning_rate": 0.0004390263161386811, "loss": 6.0781, "mean_token_accuracy": 0.1441599190235138, "num_tokens": 50159973.0, "step": 23185 }, { "entropy": 6.476980257034302, "epoch": 2.481566696987533, "grad_norm": 1.515625, "learning_rate": 0.00043900014275077517, "loss": 6.092, "mean_token_accuracy": 0.14473516941070558, "num_tokens": 50170591.0, "step": 23190 }, { "entropy": 6.434345006942749, "epoch": 2.4821017710952966, "grad_norm": 1.2421875, "learning_rate": 0.00043897396462738817, "loss": 6.1105, "mean_token_accuracy": 0.15290300399065018, "num_tokens": 50182414.0, "step": 23195 }, { "entropy": 6.4994419574737545, "epoch": 2.4826368452030607, "grad_norm": 1.1640625, "learning_rate": 0.0004389477817692759, "loss": 6.1605, "mean_token_accuracy": 0.14065559729933738, "num_tokens": 50192567.0, "step": 23200 }, { "entropy": 6.5225043296813965, "epoch": 2.4831719193108244, "grad_norm": 1.4453125, "learning_rate": 0.0004389215941771946, "loss": 6.1259, "mean_token_accuracy": 0.14196338802576064, "num_tokens": 50203142.0, "step": 23205 }, { "entropy": 6.466710758209229, "epoch": 2.4837069934185885, "grad_norm": 1.2734375, "learning_rate": 0.00043889540185190024, "loss": 6.1292, "mean_token_accuracy": 0.13840990290045738, "num_tokens": 50214854.0, "step": 23210 }, { "entropy": 6.476119756698608, "epoch": 2.4842420675263526, "grad_norm": 1.53125, "learning_rate": 0.0004388692047941492, "loss": 6.0901, "mean_token_accuracy": 0.13987003415822982, "num_tokens": 50225999.0, "step": 23215 }, { "entropy": 6.5091104984283445, "epoch": 2.4847771416341162, "grad_norm": 1.2421875, "learning_rate": 0.0004388430030046978, "loss": 6.1559, "mean_token_accuracy": 0.14605989456176757, "num_tokens": 50236657.0, "step": 23220 }, { "entropy": 6.5166901588439945, "epoch": 2.4853122157418803, "grad_norm": 1.4921875, "learning_rate": 0.0004388167964843029, "loss": 6.0963, "mean_token_accuracy": 0.1424080826342106, "num_tokens": 50246457.0, "step": 23225 }, { "entropy": 6.46362681388855, "epoch": 2.485847289849644, "grad_norm": 1.21875, "learning_rate": 0.0004387905852337209, "loss": 6.1028, "mean_token_accuracy": 0.14413710832595825, "num_tokens": 50257020.0, "step": 23230 }, { "entropy": 6.472870254516602, "epoch": 2.486382363957408, "grad_norm": 1.2265625, "learning_rate": 0.00043876436925370873, "loss": 6.0063, "mean_token_accuracy": 0.15392645075917244, "num_tokens": 50267173.0, "step": 23235 }, { "entropy": 6.422497415542603, "epoch": 2.486917438065172, "grad_norm": 1.2578125, "learning_rate": 0.0004387381485450235, "loss": 6.1328, "mean_token_accuracy": 0.14750081449747085, "num_tokens": 50278352.0, "step": 23240 }, { "entropy": 6.47580041885376, "epoch": 2.487452512172936, "grad_norm": 3.0625, "learning_rate": 0.00043871192310842216, "loss": 6.19, "mean_token_accuracy": 0.13669595420360564, "num_tokens": 50290301.0, "step": 23245 }, { "entropy": 6.599526119232178, "epoch": 2.4879875862807, "grad_norm": 1.6171875, "learning_rate": 0.0004386856929446621, "loss": 6.1808, "mean_token_accuracy": 0.136481686681509, "num_tokens": 50301707.0, "step": 23250 }, { "entropy": 6.518272590637207, "epoch": 2.4885226603884636, "grad_norm": 1.3515625, "learning_rate": 0.0004386594580545006, "loss": 6.1136, "mean_token_accuracy": 0.14791110083460807, "num_tokens": 50313334.0, "step": 23255 }, { "entropy": 6.407838249206543, "epoch": 2.4890577344962277, "grad_norm": 1.265625, "learning_rate": 0.0004386332184386953, "loss": 6.1039, "mean_token_accuracy": 0.14902055412530898, "num_tokens": 50324228.0, "step": 23260 }, { "entropy": 6.375598478317261, "epoch": 2.489592808603992, "grad_norm": 1.34375, "learning_rate": 0.00043860697409800383, "loss": 5.9396, "mean_token_accuracy": 0.1506534829735756, "num_tokens": 50335001.0, "step": 23265 }, { "entropy": 6.4696540355682375, "epoch": 2.4901278827117554, "grad_norm": 1.21875, "learning_rate": 0.00043858072503318393, "loss": 6.1171, "mean_token_accuracy": 0.1484534554183483, "num_tokens": 50346415.0, "step": 23270 }, { "entropy": 6.425711917877197, "epoch": 2.4906629568195195, "grad_norm": 1.4921875, "learning_rate": 0.00043855447124499356, "loss": 6.1339, "mean_token_accuracy": 0.14480747878551484, "num_tokens": 50357625.0, "step": 23275 }, { "entropy": 6.439349508285522, "epoch": 2.4911980309272836, "grad_norm": 1.15625, "learning_rate": 0.00043852821273419087, "loss": 6.0058, "mean_token_accuracy": 0.1571085900068283, "num_tokens": 50367672.0, "step": 23280 }, { "entropy": 6.428450393676758, "epoch": 2.4917331050350473, "grad_norm": 1.21875, "learning_rate": 0.000438501949501534, "loss": 6.0518, "mean_token_accuracy": 0.1523447170853615, "num_tokens": 50378220.0, "step": 23285 }, { "entropy": 6.446330785751343, "epoch": 2.4922681791428114, "grad_norm": 1.2421875, "learning_rate": 0.00043847568154778134, "loss": 5.9806, "mean_token_accuracy": 0.15336769074201584, "num_tokens": 50389517.0, "step": 23290 }, { "entropy": 6.468391418457031, "epoch": 2.492803253250575, "grad_norm": 1.4296875, "learning_rate": 0.0004384494088736913, "loss": 6.0891, "mean_token_accuracy": 0.15114848762750627, "num_tokens": 50401155.0, "step": 23295 }, { "entropy": 6.445683765411377, "epoch": 2.493338327358339, "grad_norm": 1.71875, "learning_rate": 0.0004384231314800226, "loss": 6.0912, "mean_token_accuracy": 0.14842903316020967, "num_tokens": 50412609.0, "step": 23300 }, { "entropy": 6.494117212295532, "epoch": 2.493873401466103, "grad_norm": 1.2421875, "learning_rate": 0.0004383968493675339, "loss": 6.0813, "mean_token_accuracy": 0.14793714582920076, "num_tokens": 50422665.0, "step": 23305 }, { "entropy": 6.494427299499511, "epoch": 2.494408475573867, "grad_norm": 1.1953125, "learning_rate": 0.0004383705625369841, "loss": 6.1177, "mean_token_accuracy": 0.1393368974328041, "num_tokens": 50434012.0, "step": 23310 }, { "entropy": 6.470083379745484, "epoch": 2.494943549681631, "grad_norm": 1.1640625, "learning_rate": 0.0004383442709891323, "loss": 6.0936, "mean_token_accuracy": 0.14519904255867006, "num_tokens": 50444270.0, "step": 23315 }, { "entropy": 6.392035007476807, "epoch": 2.4954786237893947, "grad_norm": 1.2109375, "learning_rate": 0.00043831797472473763, "loss": 5.9609, "mean_token_accuracy": 0.15484258234500886, "num_tokens": 50455236.0, "step": 23320 }, { "entropy": 6.444661092758179, "epoch": 2.4960136978971588, "grad_norm": 1.390625, "learning_rate": 0.0004382916737445594, "loss": 6.111, "mean_token_accuracy": 0.1406653791666031, "num_tokens": 50466431.0, "step": 23325 }, { "entropy": 6.523527050018311, "epoch": 2.496548772004923, "grad_norm": 1.171875, "learning_rate": 0.000438265368049357, "loss": 6.1519, "mean_token_accuracy": 0.13907749727368354, "num_tokens": 50477211.0, "step": 23330 }, { "entropy": 6.5079161643981935, "epoch": 2.4970838461126865, "grad_norm": 1.2109375, "learning_rate": 0.00043823905763989003, "loss": 6.0752, "mean_token_accuracy": 0.14193671345710754, "num_tokens": 50488668.0, "step": 23335 }, { "entropy": 6.446755361557007, "epoch": 2.4976189202204506, "grad_norm": 1.234375, "learning_rate": 0.00043821274251691823, "loss": 6.0011, "mean_token_accuracy": 0.1504003033041954, "num_tokens": 50498031.0, "step": 23340 }, { "entropy": 6.340474939346313, "epoch": 2.4981539943282143, "grad_norm": 1.2421875, "learning_rate": 0.00043818642268120153, "loss": 6.0373, "mean_token_accuracy": 0.1462131343781948, "num_tokens": 50508567.0, "step": 23345 }, { "entropy": 6.437395620346069, "epoch": 2.4986890684359784, "grad_norm": 1.828125, "learning_rate": 0.00043816009813349964, "loss": 6.0353, "mean_token_accuracy": 0.15378950387239457, "num_tokens": 50519057.0, "step": 23350 }, { "entropy": 6.538073492050171, "epoch": 2.4992241425437425, "grad_norm": 1.4609375, "learning_rate": 0.000438133768874573, "loss": 6.1038, "mean_token_accuracy": 0.1484562948346138, "num_tokens": 50530572.0, "step": 23355 }, { "entropy": 6.47088360786438, "epoch": 2.499759216651506, "grad_norm": 1.375, "learning_rate": 0.00043810743490518155, "loss": 6.1063, "mean_token_accuracy": 0.1463600903749466, "num_tokens": 50541195.0, "step": 23360 }, { "entropy": 6.515494632720947, "epoch": 2.5002942907592702, "grad_norm": 1.0703125, "learning_rate": 0.00043808109622608596, "loss": 6.1946, "mean_token_accuracy": 0.13623849898576737, "num_tokens": 50552655.0, "step": 23365 }, { "entropy": 6.481916379928589, "epoch": 2.500829364867034, "grad_norm": 1.25, "learning_rate": 0.00043805475283804657, "loss": 6.1129, "mean_token_accuracy": 0.14265030547976493, "num_tokens": 50562848.0, "step": 23370 }, { "entropy": 6.439973831176758, "epoch": 2.501364438974798, "grad_norm": 1.328125, "learning_rate": 0.0004380284047418241, "loss": 6.0784, "mean_token_accuracy": 0.15172381699085236, "num_tokens": 50572690.0, "step": 23375 }, { "entropy": 6.383023691177368, "epoch": 2.501899513082562, "grad_norm": 1.3125, "learning_rate": 0.0004380020519381794, "loss": 6.0451, "mean_token_accuracy": 0.15252356231212616, "num_tokens": 50583826.0, "step": 23380 }, { "entropy": 6.334165954589844, "epoch": 2.5024345871903257, "grad_norm": 1.6484375, "learning_rate": 0.00043797569442787334, "loss": 6.004, "mean_token_accuracy": 0.15069624707102774, "num_tokens": 50595148.0, "step": 23385 }, { "entropy": 6.488463115692139, "epoch": 2.50296966129809, "grad_norm": 1.390625, "learning_rate": 0.000437949332211667, "loss": 6.1861, "mean_token_accuracy": 0.1439678907394409, "num_tokens": 50606568.0, "step": 23390 }, { "entropy": 6.571941328048706, "epoch": 2.503504735405854, "grad_norm": 1.1953125, "learning_rate": 0.00043792296529032156, "loss": 6.121, "mean_token_accuracy": 0.14040026888251306, "num_tokens": 50618144.0, "step": 23395 }, { "entropy": 6.55412974357605, "epoch": 2.5040398095136176, "grad_norm": 1.265625, "learning_rate": 0.0004378965936645984, "loss": 6.0622, "mean_token_accuracy": 0.1514056220650673, "num_tokens": 50629721.0, "step": 23400 }, { "entropy": 6.443898248672485, "epoch": 2.5045748836213817, "grad_norm": 1.203125, "learning_rate": 0.00043787021733525904, "loss": 6.1071, "mean_token_accuracy": 0.14666295945644378, "num_tokens": 50640482.0, "step": 23405 }, { "entropy": 6.477694988250732, "epoch": 2.5051099577291454, "grad_norm": 1.078125, "learning_rate": 0.000437843836303065, "loss": 6.1533, "mean_token_accuracy": 0.13883556723594664, "num_tokens": 50652261.0, "step": 23410 }, { "entropy": 6.452952766418457, "epoch": 2.5056450318369095, "grad_norm": 1.2265625, "learning_rate": 0.0004378174505687781, "loss": 5.9393, "mean_token_accuracy": 0.15319164842367172, "num_tokens": 50662397.0, "step": 23415 }, { "entropy": 6.410601568222046, "epoch": 2.506180105944673, "grad_norm": 1.21875, "learning_rate": 0.0004377910601331601, "loss": 6.0564, "mean_token_accuracy": 0.1474452570080757, "num_tokens": 50673494.0, "step": 23420 }, { "entropy": 6.360077285766602, "epoch": 2.506715180052437, "grad_norm": 1.3359375, "learning_rate": 0.0004377646649969733, "loss": 6.0001, "mean_token_accuracy": 0.15623431354761125, "num_tokens": 50683963.0, "step": 23425 }, { "entropy": 6.472473907470703, "epoch": 2.5072502541602013, "grad_norm": 1.28125, "learning_rate": 0.00043773826516097945, "loss": 6.0933, "mean_token_accuracy": 0.14767294973134995, "num_tokens": 50694449.0, "step": 23430 }, { "entropy": 6.5044702053070065, "epoch": 2.507785328267965, "grad_norm": 1.3984375, "learning_rate": 0.00043771186062594114, "loss": 6.0732, "mean_token_accuracy": 0.15112870782613755, "num_tokens": 50705877.0, "step": 23435 }, { "entropy": 6.459271717071533, "epoch": 2.508320402375729, "grad_norm": 1.3046875, "learning_rate": 0.00043768545139262076, "loss": 6.0958, "mean_token_accuracy": 0.14634856283664704, "num_tokens": 50716581.0, "step": 23440 }, { "entropy": 6.450234508514404, "epoch": 2.508855476483493, "grad_norm": 1.1640625, "learning_rate": 0.0004376590374617809, "loss": 6.0854, "mean_token_accuracy": 0.14191805496811866, "num_tokens": 50727948.0, "step": 23445 }, { "entropy": 6.343714380264283, "epoch": 2.509390550591257, "grad_norm": 1.1796875, "learning_rate": 0.00043763261883418396, "loss": 5.9523, "mean_token_accuracy": 0.1620820701122284, "num_tokens": 50739189.0, "step": 23450 }, { "entropy": 6.4272877216339115, "epoch": 2.509925624699021, "grad_norm": 1.4140625, "learning_rate": 0.0004376061955105932, "loss": 6.0518, "mean_token_accuracy": 0.15062596499919892, "num_tokens": 50749439.0, "step": 23455 }, { "entropy": 6.463335657119751, "epoch": 2.5104606988067846, "grad_norm": 1.09375, "learning_rate": 0.00043757976749177137, "loss": 6.1681, "mean_token_accuracy": 0.14523911774158477, "num_tokens": 50761463.0, "step": 23460 }, { "entropy": 6.491697835922241, "epoch": 2.5109957729145487, "grad_norm": 1.1328125, "learning_rate": 0.0004375533347784816, "loss": 6.1556, "mean_token_accuracy": 0.1446097180247307, "num_tokens": 50771359.0, "step": 23465 }, { "entropy": 6.476978874206543, "epoch": 2.5115308470223123, "grad_norm": 1.234375, "learning_rate": 0.00043752689737148705, "loss": 6.0688, "mean_token_accuracy": 0.14670259952545167, "num_tokens": 50781669.0, "step": 23470 }, { "entropy": 6.47306456565857, "epoch": 2.5120659211300764, "grad_norm": 1.6640625, "learning_rate": 0.00043750045527155126, "loss": 6.0484, "mean_token_accuracy": 0.1475702315568924, "num_tokens": 50792217.0, "step": 23475 }, { "entropy": 6.445755338668823, "epoch": 2.5126009952378405, "grad_norm": 1.3984375, "learning_rate": 0.0004374740084794376, "loss": 6.1165, "mean_token_accuracy": 0.14298529252409936, "num_tokens": 50805288.0, "step": 23480 }, { "entropy": 6.423535013198853, "epoch": 2.513136069345604, "grad_norm": 1.4296875, "learning_rate": 0.0004374475569959098, "loss": 6.0433, "mean_token_accuracy": 0.15176984742283822, "num_tokens": 50815563.0, "step": 23485 }, { "entropy": 6.444725227355957, "epoch": 2.5136711434533683, "grad_norm": 1.2890625, "learning_rate": 0.0004374211008217316, "loss": 6.0499, "mean_token_accuracy": 0.15303923562169075, "num_tokens": 50826108.0, "step": 23490 }, { "entropy": 6.406829595565796, "epoch": 2.5142062175611324, "grad_norm": 1.25, "learning_rate": 0.00043739463995766696, "loss": 6.0413, "mean_token_accuracy": 0.14996329694986343, "num_tokens": 50837180.0, "step": 23495 }, { "entropy": 6.415341234207153, "epoch": 2.514741291668896, "grad_norm": 1.140625, "learning_rate": 0.0004373681744044799, "loss": 6.0346, "mean_token_accuracy": 0.15418055057525634, "num_tokens": 50847430.0, "step": 23500 }, { "entropy": 6.484678506851196, "epoch": 2.51527636577666, "grad_norm": 1.171875, "learning_rate": 0.00043734170416293467, "loss": 6.0842, "mean_token_accuracy": 0.14977000206708907, "num_tokens": 50858100.0, "step": 23505 }, { "entropy": 6.495728826522827, "epoch": 2.5158114398844242, "grad_norm": 1.3203125, "learning_rate": 0.00043731522923379554, "loss": 6.1318, "mean_token_accuracy": 0.1433524288237095, "num_tokens": 50868549.0, "step": 23510 }, { "entropy": 6.487738037109375, "epoch": 2.516346513992188, "grad_norm": 1.3046875, "learning_rate": 0.0004372887496178269, "loss": 6.0835, "mean_token_accuracy": 0.14577526077628136, "num_tokens": 50879522.0, "step": 23515 }, { "entropy": 6.4393473148345945, "epoch": 2.516881588099952, "grad_norm": 1.2734375, "learning_rate": 0.0004372622653157935, "loss": 6.0958, "mean_token_accuracy": 0.1456751585006714, "num_tokens": 50891139.0, "step": 23520 }, { "entropy": 6.421893692016601, "epoch": 2.5174166622077156, "grad_norm": 1.0703125, "learning_rate": 0.0004372357763284599, "loss": 6.1118, "mean_token_accuracy": 0.14199379533529283, "num_tokens": 50901267.0, "step": 23525 }, { "entropy": 6.463366556167602, "epoch": 2.5179517363154797, "grad_norm": 1.7578125, "learning_rate": 0.0004372092826565911, "loss": 6.0079, "mean_token_accuracy": 0.1521808072924614, "num_tokens": 50912137.0, "step": 23530 }, { "entropy": 6.458667516708374, "epoch": 2.5184868104232434, "grad_norm": 1.171875, "learning_rate": 0.0004371827843009521, "loss": 6.1097, "mean_token_accuracy": 0.1470927283167839, "num_tokens": 50922724.0, "step": 23535 }, { "entropy": 6.46234164237976, "epoch": 2.5190218845310075, "grad_norm": 1.71875, "learning_rate": 0.00043715628126230795, "loss": 6.1108, "mean_token_accuracy": 0.14309716820716858, "num_tokens": 50934617.0, "step": 23540 }, { "entropy": 6.464339351654052, "epoch": 2.5195569586387716, "grad_norm": 1.421875, "learning_rate": 0.0004371297735414239, "loss": 6.1085, "mean_token_accuracy": 0.1441352665424347, "num_tokens": 50945179.0, "step": 23545 }, { "entropy": 6.462499189376831, "epoch": 2.5200920327465353, "grad_norm": 1.2265625, "learning_rate": 0.00043710326113906555, "loss": 6.1225, "mean_token_accuracy": 0.15157264620065689, "num_tokens": 50955383.0, "step": 23550 }, { "entropy": 6.5211022853851315, "epoch": 2.5206271068542994, "grad_norm": 1.6015625, "learning_rate": 0.0004370767440559983, "loss": 6.0422, "mean_token_accuracy": 0.151044125854969, "num_tokens": 50966107.0, "step": 23555 }, { "entropy": 6.396521520614624, "epoch": 2.5211621809620635, "grad_norm": 1.1640625, "learning_rate": 0.00043705022229298775, "loss": 5.9656, "mean_token_accuracy": 0.16853859797120094, "num_tokens": 50977042.0, "step": 23560 }, { "entropy": 6.415504598617554, "epoch": 2.521697255069827, "grad_norm": 1.2421875, "learning_rate": 0.0004370236958507998, "loss": 6.1356, "mean_token_accuracy": 0.14767294153571128, "num_tokens": 50986999.0, "step": 23565 }, { "entropy": 6.4797906398773195, "epoch": 2.522232329177591, "grad_norm": 1.2109375, "learning_rate": 0.0004369971647302005, "loss": 6.0679, "mean_token_accuracy": 0.1419106476008892, "num_tokens": 50997824.0, "step": 23570 }, { "entropy": 6.577082347869873, "epoch": 2.522767403285355, "grad_norm": 1.265625, "learning_rate": 0.0004369706289319558, "loss": 6.1442, "mean_token_accuracy": 0.14608432352542877, "num_tokens": 51009001.0, "step": 23575 }, { "entropy": 6.476378059387207, "epoch": 2.523302477393119, "grad_norm": 1.2109375, "learning_rate": 0.00043694408845683185, "loss": 6.053, "mean_token_accuracy": 0.152521114051342, "num_tokens": 51019222.0, "step": 23580 }, { "entropy": 6.480445861816406, "epoch": 2.5238375515008826, "grad_norm": 1.1640625, "learning_rate": 0.0004369175433055952, "loss": 6.0567, "mean_token_accuracy": 0.1476146787405014, "num_tokens": 51029473.0, "step": 23585 }, { "entropy": 6.471163082122803, "epoch": 2.5243726256086467, "grad_norm": 1.2890625, "learning_rate": 0.00043689099347901227, "loss": 6.0797, "mean_token_accuracy": 0.14782582521438598, "num_tokens": 51040667.0, "step": 23590 }, { "entropy": 6.379007577896118, "epoch": 2.524907699716411, "grad_norm": 1.3984375, "learning_rate": 0.00043686443897784954, "loss": 5.9761, "mean_token_accuracy": 0.15364776849746703, "num_tokens": 51050386.0, "step": 23595 }, { "entropy": 6.458848714828491, "epoch": 2.5254427738241745, "grad_norm": 1.265625, "learning_rate": 0.000436837879802874, "loss": 6.1155, "mean_token_accuracy": 0.14842621833086014, "num_tokens": 51060752.0, "step": 23600 }, { "entropy": 6.440014266967774, "epoch": 2.5259778479319386, "grad_norm": 1.09375, "learning_rate": 0.00043681131595485234, "loss": 6.0811, "mean_token_accuracy": 0.14779562056064605, "num_tokens": 51072467.0, "step": 23605 }, { "entropy": 6.544898653030396, "epoch": 2.5265129220397027, "grad_norm": 1.125, "learning_rate": 0.0004367847474345517, "loss": 6.1633, "mean_token_accuracy": 0.14447703212499619, "num_tokens": 51083404.0, "step": 23610 }, { "entropy": 6.453373813629151, "epoch": 2.5270479961474663, "grad_norm": 1.2578125, "learning_rate": 0.00043675817424273925, "loss": 6.072, "mean_token_accuracy": 0.15299114361405372, "num_tokens": 51094392.0, "step": 23615 }, { "entropy": 6.488115406036377, "epoch": 2.5275830702552304, "grad_norm": 1.1875, "learning_rate": 0.00043673159638018215, "loss": 6.0907, "mean_token_accuracy": 0.14106457233428954, "num_tokens": 51104706.0, "step": 23620 }, { "entropy": 6.490919971466065, "epoch": 2.5281181443629945, "grad_norm": 1.2265625, "learning_rate": 0.000436705013847648, "loss": 6.1459, "mean_token_accuracy": 0.14325982183218003, "num_tokens": 51114881.0, "step": 23625 }, { "entropy": 6.531571578979492, "epoch": 2.528653218470758, "grad_norm": 1.140625, "learning_rate": 0.0004366784266459043, "loss": 6.1454, "mean_token_accuracy": 0.14374287724494933, "num_tokens": 51125705.0, "step": 23630 }, { "entropy": 6.535162162780762, "epoch": 2.5291882925785223, "grad_norm": 1.1328125, "learning_rate": 0.00043665183477571874, "loss": 6.1194, "mean_token_accuracy": 0.1407308377325535, "num_tokens": 51136460.0, "step": 23635 }, { "entropy": 6.430759429931641, "epoch": 2.529723366686286, "grad_norm": 1.40625, "learning_rate": 0.0004366252382378592, "loss": 6.0795, "mean_token_accuracy": 0.1493188112974167, "num_tokens": 51146206.0, "step": 23640 }, { "entropy": 6.424686098098755, "epoch": 2.53025844079405, "grad_norm": 1.234375, "learning_rate": 0.0004365986370330935, "loss": 6.1766, "mean_token_accuracy": 0.1391225829720497, "num_tokens": 51156650.0, "step": 23645 }, { "entropy": 6.480143070220947, "epoch": 2.5307935149018137, "grad_norm": 1.25, "learning_rate": 0.00043657203116218994, "loss": 6.1492, "mean_token_accuracy": 0.14662258252501487, "num_tokens": 51168401.0, "step": 23650 }, { "entropy": 6.523509883880616, "epoch": 2.531328589009578, "grad_norm": 1.140625, "learning_rate": 0.00043654542062591674, "loss": 6.1006, "mean_token_accuracy": 0.1411995768547058, "num_tokens": 51178571.0, "step": 23655 }, { "entropy": 6.503192996978759, "epoch": 2.531863663117342, "grad_norm": 1.1171875, "learning_rate": 0.00043651880542504214, "loss": 6.1787, "mean_token_accuracy": 0.13608428239822387, "num_tokens": 51189143.0, "step": 23660 }, { "entropy": 6.448965835571289, "epoch": 2.5323987372251056, "grad_norm": 1.328125, "learning_rate": 0.00043649218556033475, "loss": 6.0954, "mean_token_accuracy": 0.14627905040979386, "num_tokens": 51200552.0, "step": 23665 }, { "entropy": 6.4708034038543705, "epoch": 2.5329338113328697, "grad_norm": 1.4140625, "learning_rate": 0.0004364655610325632, "loss": 6.1068, "mean_token_accuracy": 0.14722600281238557, "num_tokens": 51210493.0, "step": 23670 }, { "entropy": 6.445748710632325, "epoch": 2.5334688854406338, "grad_norm": 1.2109375, "learning_rate": 0.0004364389318424962, "loss": 6.0863, "mean_token_accuracy": 0.14877480193972586, "num_tokens": 51220535.0, "step": 23675 }, { "entropy": 6.439504957199096, "epoch": 2.5340039595483974, "grad_norm": 1.1640625, "learning_rate": 0.00043641229799090285, "loss": 6.1407, "mean_token_accuracy": 0.14188293144106864, "num_tokens": 51232078.0, "step": 23680 }, { "entropy": 6.4832312107086185, "epoch": 2.5345390336561615, "grad_norm": 1.265625, "learning_rate": 0.000436385659478552, "loss": 6.1395, "mean_token_accuracy": 0.15170127898454666, "num_tokens": 51242750.0, "step": 23685 }, { "entropy": 6.575940847396851, "epoch": 2.535074107763925, "grad_norm": 1.3203125, "learning_rate": 0.00043635901630621293, "loss": 6.1446, "mean_token_accuracy": 0.13975838497281073, "num_tokens": 51254295.0, "step": 23690 }, { "entropy": 6.483678245544434, "epoch": 2.5356091818716893, "grad_norm": 1.2421875, "learning_rate": 0.00043633236847465497, "loss": 6.1006, "mean_token_accuracy": 0.14603102207183838, "num_tokens": 51265060.0, "step": 23695 }, { "entropy": 6.381811571121216, "epoch": 2.536144255979453, "grad_norm": 1.5703125, "learning_rate": 0.0004363057159846475, "loss": 6.0016, "mean_token_accuracy": 0.14961035996675492, "num_tokens": 51275623.0, "step": 23700 }, { "entropy": 6.393724012374878, "epoch": 2.536679330087217, "grad_norm": 1.1640625, "learning_rate": 0.0004362790588369602, "loss": 6.0025, "mean_token_accuracy": 0.15411610305309295, "num_tokens": 51285830.0, "step": 23705 }, { "entropy": 6.456270313262939, "epoch": 2.537214404194981, "grad_norm": 1.6875, "learning_rate": 0.0004362523970323627, "loss": 6.1147, "mean_token_accuracy": 0.14590513259172438, "num_tokens": 51297047.0, "step": 23710 }, { "entropy": 6.435363292694092, "epoch": 2.5377494783027448, "grad_norm": 1.8046875, "learning_rate": 0.00043622573057162484, "loss": 6.0433, "mean_token_accuracy": 0.14598360732197763, "num_tokens": 51307254.0, "step": 23715 }, { "entropy": 6.454430150985718, "epoch": 2.538284552410509, "grad_norm": 1.265625, "learning_rate": 0.0004361990594555167, "loss": 6.1944, "mean_token_accuracy": 0.13499054610729216, "num_tokens": 51317796.0, "step": 23720 }, { "entropy": 6.507284021377563, "epoch": 2.538819626518273, "grad_norm": 1.3203125, "learning_rate": 0.00043617238368480845, "loss": 6.189, "mean_token_accuracy": 0.14208370372653006, "num_tokens": 51330172.0, "step": 23725 }, { "entropy": 6.527377986907959, "epoch": 2.5393547006260366, "grad_norm": 1.3515625, "learning_rate": 0.00043614570326027015, "loss": 6.0374, "mean_token_accuracy": 0.15405570715665817, "num_tokens": 51340844.0, "step": 23730 }, { "entropy": 6.481348705291748, "epoch": 2.5398897747338007, "grad_norm": 1.2421875, "learning_rate": 0.0004361190181826724, "loss": 6.0786, "mean_token_accuracy": 0.1491836801171303, "num_tokens": 51352078.0, "step": 23735 }, { "entropy": 6.4385000705719, "epoch": 2.540424848841565, "grad_norm": 1.1796875, "learning_rate": 0.00043609232845278565, "loss": 6.173, "mean_token_accuracy": 0.13707626909017562, "num_tokens": 51364121.0, "step": 23740 }, { "entropy": 6.486933803558349, "epoch": 2.5409599229493285, "grad_norm": 1.9140625, "learning_rate": 0.0004360656340713805, "loss": 6.1241, "mean_token_accuracy": 0.15508515536785125, "num_tokens": 51375046.0, "step": 23745 }, { "entropy": 6.453219890594482, "epoch": 2.541494997057092, "grad_norm": 1.2890625, "learning_rate": 0.0004360389350392278, "loss": 6.0315, "mean_token_accuracy": 0.14416414871811867, "num_tokens": 51386363.0, "step": 23750 }, { "entropy": 6.3984826564788815, "epoch": 2.5420300711648562, "grad_norm": 1.1484375, "learning_rate": 0.00043601223135709846, "loss": 5.9987, "mean_token_accuracy": 0.15675863921642302, "num_tokens": 51398036.0, "step": 23755 }, { "entropy": 6.425463771820068, "epoch": 2.5425651452726203, "grad_norm": 1.2265625, "learning_rate": 0.0004359855230257636, "loss": 6.0867, "mean_token_accuracy": 0.14525877088308334, "num_tokens": 51408769.0, "step": 23760 }, { "entropy": 6.457871580123902, "epoch": 2.543100219380384, "grad_norm": 1.4453125, "learning_rate": 0.00043595881004599444, "loss": 6.1112, "mean_token_accuracy": 0.14525377601385117, "num_tokens": 51420315.0, "step": 23765 }, { "entropy": 6.445687532424927, "epoch": 2.543635293488148, "grad_norm": 1.171875, "learning_rate": 0.00043593209241856216, "loss": 6.0705, "mean_token_accuracy": 0.15387475341558457, "num_tokens": 51432283.0, "step": 23770 }, { "entropy": 6.468622398376465, "epoch": 2.544170367595912, "grad_norm": 1.0859375, "learning_rate": 0.00043590537014423833, "loss": 6.0751, "mean_token_accuracy": 0.15372790396213531, "num_tokens": 51443151.0, "step": 23775 }, { "entropy": 6.330078363418579, "epoch": 2.544705441703676, "grad_norm": 1.3671875, "learning_rate": 0.0004358786432237946, "loss": 6.0093, "mean_token_accuracy": 0.14666105732321738, "num_tokens": 51453964.0, "step": 23780 }, { "entropy": 6.450662469863891, "epoch": 2.54524051581144, "grad_norm": 1.2578125, "learning_rate": 0.0004358519116580026, "loss": 6.0491, "mean_token_accuracy": 0.15346280187368394, "num_tokens": 51464236.0, "step": 23785 }, { "entropy": 6.363191318511963, "epoch": 2.545775589919204, "grad_norm": 1.21875, "learning_rate": 0.0004358251754476344, "loss": 6.0205, "mean_token_accuracy": 0.15527293980121612, "num_tokens": 51474388.0, "step": 23790 }, { "entropy": 6.410833835601807, "epoch": 2.5463106640269677, "grad_norm": 1.2265625, "learning_rate": 0.0004357984345934617, "loss": 6.0515, "mean_token_accuracy": 0.13957794830203057, "num_tokens": 51485209.0, "step": 23795 }, { "entropy": 6.441276693344117, "epoch": 2.546845738134732, "grad_norm": 1.1953125, "learning_rate": 0.0004357716890962568, "loss": 6.0114, "mean_token_accuracy": 0.15188122242689134, "num_tokens": 51495993.0, "step": 23800 }, { "entropy": 6.450775861740112, "epoch": 2.5473808122424955, "grad_norm": 1.1953125, "learning_rate": 0.000435744938956792, "loss": 6.0183, "mean_token_accuracy": 0.1522235870361328, "num_tokens": 51506282.0, "step": 23805 }, { "entropy": 6.4267974376678465, "epoch": 2.5479158863502596, "grad_norm": 1.2890625, "learning_rate": 0.00043571818417583976, "loss": 6.1498, "mean_token_accuracy": 0.1420055314898491, "num_tokens": 51517728.0, "step": 23810 }, { "entropy": 6.458556127548218, "epoch": 2.548450960458023, "grad_norm": 1.3046875, "learning_rate": 0.0004356914247541724, "loss": 6.0643, "mean_token_accuracy": 0.15005556344985962, "num_tokens": 51528769.0, "step": 23815 }, { "entropy": 6.454838466644287, "epoch": 2.5489860345657873, "grad_norm": 1.1171875, "learning_rate": 0.00043566466069256283, "loss": 6.0478, "mean_token_accuracy": 0.14791302084922792, "num_tokens": 51540148.0, "step": 23820 }, { "entropy": 6.476283884048462, "epoch": 2.5495211086735514, "grad_norm": 1.140625, "learning_rate": 0.0004356378919917837, "loss": 6.0436, "mean_token_accuracy": 0.1498100385069847, "num_tokens": 51550657.0, "step": 23825 }, { "entropy": 6.441194677352906, "epoch": 2.550056182781315, "grad_norm": 1.1484375, "learning_rate": 0.0004356111186526081, "loss": 6.0477, "mean_token_accuracy": 0.15196770578622817, "num_tokens": 51560399.0, "step": 23830 }, { "entropy": 6.414425039291382, "epoch": 2.550591256889079, "grad_norm": 1.171875, "learning_rate": 0.00043558434067580894, "loss": 6.1238, "mean_token_accuracy": 0.1447290763258934, "num_tokens": 51571463.0, "step": 23835 }, { "entropy": 6.480480623245239, "epoch": 2.5511263309968433, "grad_norm": 1.1875, "learning_rate": 0.00043555755806215946, "loss": 6.0227, "mean_token_accuracy": 0.15467719733715057, "num_tokens": 51583136.0, "step": 23840 }, { "entropy": 6.4993109703063965, "epoch": 2.551661405104607, "grad_norm": 1.171875, "learning_rate": 0.00043553077081243314, "loss": 6.1543, "mean_token_accuracy": 0.1417586736381054, "num_tokens": 51594397.0, "step": 23845 }, { "entropy": 6.486432266235352, "epoch": 2.552196479212371, "grad_norm": 1.296875, "learning_rate": 0.0004355039789274034, "loss": 6.1892, "mean_token_accuracy": 0.1408970907330513, "num_tokens": 51605788.0, "step": 23850 }, { "entropy": 6.497194528579712, "epoch": 2.5527315533201347, "grad_norm": 1.109375, "learning_rate": 0.0004354771824078437, "loss": 6.0751, "mean_token_accuracy": 0.14397743716835976, "num_tokens": 51615693.0, "step": 23855 }, { "entropy": 6.396121883392334, "epoch": 2.553266627427899, "grad_norm": 1.2109375, "learning_rate": 0.00043545038125452793, "loss": 5.9849, "mean_token_accuracy": 0.15312101393938066, "num_tokens": 51626607.0, "step": 23860 }, { "entropy": 6.424760103225708, "epoch": 2.5538017015356624, "grad_norm": 1.140625, "learning_rate": 0.00043542357546823003, "loss": 6.0803, "mean_token_accuracy": 0.1500844404101372, "num_tokens": 51636905.0, "step": 23865 }, { "entropy": 6.450059413909912, "epoch": 2.5543367756434265, "grad_norm": 1.1796875, "learning_rate": 0.00043539676504972393, "loss": 6.0673, "mean_token_accuracy": 0.1490839898586273, "num_tokens": 51648142.0, "step": 23870 }, { "entropy": 6.512945318222046, "epoch": 2.5548718497511906, "grad_norm": 2.03125, "learning_rate": 0.0004353699499997837, "loss": 6.0832, "mean_token_accuracy": 0.1372237868607044, "num_tokens": 51659583.0, "step": 23875 }, { "entropy": 6.450292873382568, "epoch": 2.5554069238589543, "grad_norm": 1.1484375, "learning_rate": 0.0004353431303191837, "loss": 6.1439, "mean_token_accuracy": 0.1443669892847538, "num_tokens": 51670582.0, "step": 23880 }, { "entropy": 6.533113813400268, "epoch": 2.5559419979667184, "grad_norm": 1.2265625, "learning_rate": 0.00043531630600869846, "loss": 6.1521, "mean_token_accuracy": 0.13966882973909378, "num_tokens": 51680773.0, "step": 23885 }, { "entropy": 6.502314758300781, "epoch": 2.5564770720744825, "grad_norm": 1.1796875, "learning_rate": 0.0004352894770691024, "loss": 6.1002, "mean_token_accuracy": 0.14475717693567275, "num_tokens": 51690680.0, "step": 23890 }, { "entropy": 6.467441606521606, "epoch": 2.557012146182246, "grad_norm": 1.1796875, "learning_rate": 0.0004352626435011701, "loss": 6.0826, "mean_token_accuracy": 0.14894639998674392, "num_tokens": 51700910.0, "step": 23895 }, { "entropy": 6.467555284500122, "epoch": 2.5575472202900102, "grad_norm": 1.2578125, "learning_rate": 0.00043523580530567654, "loss": 6.0889, "mean_token_accuracy": 0.14425421729683877, "num_tokens": 51712331.0, "step": 23900 }, { "entropy": 6.374993991851807, "epoch": 2.5580822943977743, "grad_norm": 1.3203125, "learning_rate": 0.0004352089624833966, "loss": 5.9926, "mean_token_accuracy": 0.1546017974615097, "num_tokens": 51722805.0, "step": 23905 }, { "entropy": 6.422532653808593, "epoch": 2.558617368505538, "grad_norm": 1.3203125, "learning_rate": 0.00043518211503510535, "loss": 6.0655, "mean_token_accuracy": 0.150536473095417, "num_tokens": 51733909.0, "step": 23910 }, { "entropy": 6.460271120071411, "epoch": 2.559152442613302, "grad_norm": 1.1875, "learning_rate": 0.00043515526296157813, "loss": 6.136, "mean_token_accuracy": 0.139005671441555, "num_tokens": 51745062.0, "step": 23915 }, { "entropy": 6.463294887542725, "epoch": 2.5596875167210658, "grad_norm": 1.2890625, "learning_rate": 0.0004351284062635901, "loss": 6.1421, "mean_token_accuracy": 0.14392079263925553, "num_tokens": 51756235.0, "step": 23920 }, { "entropy": 6.4998626708984375, "epoch": 2.56022259082883, "grad_norm": 1.203125, "learning_rate": 0.000435101544941917, "loss": 6.0806, "mean_token_accuracy": 0.14673112258315085, "num_tokens": 51765689.0, "step": 23925 }, { "entropy": 6.408583688735962, "epoch": 2.5607576649365935, "grad_norm": 1.234375, "learning_rate": 0.0004350746789973341, "loss": 5.9467, "mean_token_accuracy": 0.15023422092199326, "num_tokens": 51777090.0, "step": 23930 }, { "entropy": 6.4311888217926025, "epoch": 2.5612927390443576, "grad_norm": 1.5703125, "learning_rate": 0.0004350478084306174, "loss": 6.0981, "mean_token_accuracy": 0.14473380595445634, "num_tokens": 51787360.0, "step": 23935 }, { "entropy": 6.3969158172607425, "epoch": 2.5618278131521217, "grad_norm": 1.3359375, "learning_rate": 0.0004350209332425428, "loss": 6.0308, "mean_token_accuracy": 0.14888717755675315, "num_tokens": 51799075.0, "step": 23940 }, { "entropy": 6.376031541824341, "epoch": 2.5623628872598854, "grad_norm": 1.1171875, "learning_rate": 0.00043499405343388613, "loss": 5.9073, "mean_token_accuracy": 0.16880181729793547, "num_tokens": 51810024.0, "step": 23945 }, { "entropy": 6.454634141921997, "epoch": 2.5628979613676495, "grad_norm": 1.1953125, "learning_rate": 0.0004349671690054238, "loss": 6.0535, "mean_token_accuracy": 0.14208773672580718, "num_tokens": 51820710.0, "step": 23950 }, { "entropy": 6.4697834014892575, "epoch": 2.5634330354754136, "grad_norm": 1.3515625, "learning_rate": 0.00043494027995793176, "loss": 6.066, "mean_token_accuracy": 0.1473910927772522, "num_tokens": 51831451.0, "step": 23955 }, { "entropy": 6.313320589065552, "epoch": 2.5639681095831772, "grad_norm": 1.1015625, "learning_rate": 0.0004349133862921867, "loss": 5.9907, "mean_token_accuracy": 0.16042271703481675, "num_tokens": 51841483.0, "step": 23960 }, { "entropy": 6.412751722335815, "epoch": 2.5645031836909413, "grad_norm": 1.171875, "learning_rate": 0.00043488648800896516, "loss": 6.0534, "mean_token_accuracy": 0.15336196273565292, "num_tokens": 51852838.0, "step": 23965 }, { "entropy": 6.406958389282226, "epoch": 2.565038257798705, "grad_norm": 1.625, "learning_rate": 0.0004348595851090436, "loss": 6.0733, "mean_token_accuracy": 0.14980074018239975, "num_tokens": 51863851.0, "step": 23970 }, { "entropy": 6.432291507720947, "epoch": 2.565573331906469, "grad_norm": 1.40625, "learning_rate": 0.00043483267759319907, "loss": 6.0092, "mean_token_accuracy": 0.15225662142038346, "num_tokens": 51874380.0, "step": 23975 }, { "entropy": 6.49734263420105, "epoch": 2.5661084060142327, "grad_norm": 1.2578125, "learning_rate": 0.0004348057654622084, "loss": 6.0402, "mean_token_accuracy": 0.15027616024017335, "num_tokens": 51884594.0, "step": 23980 }, { "entropy": 6.482366228103638, "epoch": 2.566643480121997, "grad_norm": 1.25, "learning_rate": 0.0004347788487168487, "loss": 6.1759, "mean_token_accuracy": 0.13969626873731614, "num_tokens": 51897679.0, "step": 23985 }, { "entropy": 6.483441352844238, "epoch": 2.567178554229761, "grad_norm": 1.1640625, "learning_rate": 0.0004347519273578972, "loss": 6.2197, "mean_token_accuracy": 0.13812159448862077, "num_tokens": 51907501.0, "step": 23990 }, { "entropy": 6.465521383285522, "epoch": 2.5677136283375246, "grad_norm": 1.34375, "learning_rate": 0.00043472500138613124, "loss": 6.0649, "mean_token_accuracy": 0.14138805717229844, "num_tokens": 51917732.0, "step": 23995 }, { "entropy": 6.463391351699829, "epoch": 2.5682487024452887, "grad_norm": 1.6328125, "learning_rate": 0.0004346980708023284, "loss": 6.1502, "mean_token_accuracy": 0.1416984058916569, "num_tokens": 51929038.0, "step": 24000 }, { "epoch": 2.5682487024452887, "eval_entropy": 6.27463636732487, "eval_loss": 6.196377277374268, "eval_mean_token_accuracy": 0.149448194002577, "eval_num_tokens": 51929038.0, "eval_runtime": 22.6201, "eval_samples_per_second": 1312.061, "eval_steps_per_second": 164.013, "step": 24000 }, { "entropy": 6.516879844665527, "epoch": 2.568783776553053, "grad_norm": 1.1640625, "learning_rate": 0.0004346711356072661, "loss": 6.1753, "mean_token_accuracy": 0.14101736843585969, "num_tokens": 51939481.0, "step": 24005 }, { "entropy": 6.5593249797821045, "epoch": 2.5693188506608164, "grad_norm": 1.328125, "learning_rate": 0.0004346441958017222, "loss": 6.1351, "mean_token_accuracy": 0.1444205828011036, "num_tokens": 51951393.0, "step": 24010 }, { "entropy": 6.53387942314148, "epoch": 2.5698539247685805, "grad_norm": 1.25, "learning_rate": 0.0004346172513864746, "loss": 6.1676, "mean_token_accuracy": 0.14086406603455542, "num_tokens": 51962897.0, "step": 24015 }, { "entropy": 6.456385469436645, "epoch": 2.5703889988763446, "grad_norm": 1.1796875, "learning_rate": 0.00043459030236230137, "loss": 6.1026, "mean_token_accuracy": 0.14337882846593858, "num_tokens": 51974443.0, "step": 24020 }, { "entropy": 6.391973829269409, "epoch": 2.5709240729841083, "grad_norm": 1.2265625, "learning_rate": 0.0004345633487299805, "loss": 6.0971, "mean_token_accuracy": 0.14847104549407958, "num_tokens": 51985158.0, "step": 24025 }, { "entropy": 6.52832260131836, "epoch": 2.571459147091872, "grad_norm": 1.15625, "learning_rate": 0.00043453639049029035, "loss": 6.2, "mean_token_accuracy": 0.1380402758717537, "num_tokens": 51994956.0, "step": 24030 }, { "entropy": 6.5086275100708, "epoch": 2.571994221199636, "grad_norm": 1.2265625, "learning_rate": 0.00043450942764400937, "loss": 5.9695, "mean_token_accuracy": 0.15147302001714708, "num_tokens": 52004922.0, "step": 24035 }, { "entropy": 6.386508321762085, "epoch": 2.5725292953074, "grad_norm": 1.28125, "learning_rate": 0.0004344824601919161, "loss": 6.0324, "mean_token_accuracy": 0.15597374141216278, "num_tokens": 52014684.0, "step": 24040 }, { "entropy": 6.441916227340698, "epoch": 2.573064369415164, "grad_norm": 1.3515625, "learning_rate": 0.00043445548813478914, "loss": 6.0492, "mean_token_accuracy": 0.15587343275547028, "num_tokens": 52025283.0, "step": 24045 }, { "entropy": 6.532823181152343, "epoch": 2.573599443522928, "grad_norm": 1.2265625, "learning_rate": 0.0004344285114734074, "loss": 6.1403, "mean_token_accuracy": 0.1462143950164318, "num_tokens": 52036513.0, "step": 24050 }, { "entropy": 6.517218828201294, "epoch": 2.574134517630692, "grad_norm": 1.234375, "learning_rate": 0.00043440153020854987, "loss": 6.0316, "mean_token_accuracy": 0.15213731974363326, "num_tokens": 52047230.0, "step": 24055 }, { "entropy": 6.448276519775391, "epoch": 2.5746695917384557, "grad_norm": 1.703125, "learning_rate": 0.0004343745443409954, "loss": 6.0953, "mean_token_accuracy": 0.14763810187578202, "num_tokens": 52058889.0, "step": 24060 }, { "entropy": 6.425657510757446, "epoch": 2.5752046658462198, "grad_norm": 1.34375, "learning_rate": 0.00043434755387152354, "loss": 6.0247, "mean_token_accuracy": 0.14771818220615388, "num_tokens": 52068478.0, "step": 24065 }, { "entropy": 6.386288118362427, "epoch": 2.575739739953984, "grad_norm": 1.140625, "learning_rate": 0.0004343205588009133, "loss": 6.076, "mean_token_accuracy": 0.1480717495083809, "num_tokens": 52079756.0, "step": 24070 }, { "entropy": 6.497709560394287, "epoch": 2.5762748140617475, "grad_norm": 1.203125, "learning_rate": 0.00043429355912994437, "loss": 6.0728, "mean_token_accuracy": 0.14538149759173394, "num_tokens": 52090452.0, "step": 24075 }, { "entropy": 6.452464532852173, "epoch": 2.5768098881695116, "grad_norm": 1.46875, "learning_rate": 0.0004342665548593964, "loss": 5.9936, "mean_token_accuracy": 0.14874869138002395, "num_tokens": 52101134.0, "step": 24080 }, { "entropy": 6.4219461441040036, "epoch": 2.5773449622772753, "grad_norm": 1.21875, "learning_rate": 0.0004342395459900489, "loss": 6.0363, "mean_token_accuracy": 0.14652038589119912, "num_tokens": 52111529.0, "step": 24085 }, { "entropy": 6.355379915237426, "epoch": 2.5778800363850394, "grad_norm": 1.2890625, "learning_rate": 0.00043421253252268194, "loss": 6.0313, "mean_token_accuracy": 0.14850951135158538, "num_tokens": 52122779.0, "step": 24090 }, { "entropy": 6.447815465927124, "epoch": 2.578415110492803, "grad_norm": 1.25, "learning_rate": 0.0004341855144580754, "loss": 6.0336, "mean_token_accuracy": 0.1435435838997364, "num_tokens": 52134140.0, "step": 24095 }, { "entropy": 6.467025518417358, "epoch": 2.578950184600567, "grad_norm": 1.1796875, "learning_rate": 0.00043415849179700956, "loss": 6.0545, "mean_token_accuracy": 0.1435348868370056, "num_tokens": 52146033.0, "step": 24100 }, { "entropy": 6.370548820495605, "epoch": 2.5794852587083312, "grad_norm": 1.2578125, "learning_rate": 0.0004341314645402647, "loss": 6.0735, "mean_token_accuracy": 0.14471182450652123, "num_tokens": 52157516.0, "step": 24105 }, { "entropy": 6.415873670578003, "epoch": 2.580020332816095, "grad_norm": 1.78125, "learning_rate": 0.0004341044326886211, "loss": 6.0722, "mean_token_accuracy": 0.1526182025671005, "num_tokens": 52167523.0, "step": 24110 }, { "entropy": 6.395650959014892, "epoch": 2.580555406923859, "grad_norm": 1.2578125, "learning_rate": 0.0004340773962428593, "loss": 5.9952, "mean_token_accuracy": 0.15602321103215216, "num_tokens": 52178235.0, "step": 24115 }, { "entropy": 6.370280075073242, "epoch": 2.581090481031623, "grad_norm": 1.21875, "learning_rate": 0.00043405035520376013, "loss": 5.9663, "mean_token_accuracy": 0.1569521740078926, "num_tokens": 52188586.0, "step": 24120 }, { "entropy": 6.424892568588257, "epoch": 2.5816255551393867, "grad_norm": 1.140625, "learning_rate": 0.0004340233095721043, "loss": 6.0651, "mean_token_accuracy": 0.15124413520097732, "num_tokens": 52199081.0, "step": 24125 }, { "entropy": 6.458188056945801, "epoch": 2.582160629247151, "grad_norm": 1.203125, "learning_rate": 0.0004339962593486727, "loss": 6.1105, "mean_token_accuracy": 0.14388948678970337, "num_tokens": 52210324.0, "step": 24130 }, { "entropy": 6.4354267597198485, "epoch": 2.5826957033549145, "grad_norm": 1.171875, "learning_rate": 0.00043396920453424656, "loss": 6.0934, "mean_token_accuracy": 0.14596305638551713, "num_tokens": 52221973.0, "step": 24135 }, { "entropy": 6.415314340591431, "epoch": 2.5832307774626786, "grad_norm": 1.421875, "learning_rate": 0.00043394214512960683, "loss": 6.0225, "mean_token_accuracy": 0.1482434719800949, "num_tokens": 52232560.0, "step": 24140 }, { "entropy": 6.429066514968872, "epoch": 2.5837658515704423, "grad_norm": 1.1171875, "learning_rate": 0.0004339150811355351, "loss": 5.9687, "mean_token_accuracy": 0.15345148146152496, "num_tokens": 52243416.0, "step": 24145 }, { "entropy": 6.370793199539184, "epoch": 2.5843009256782064, "grad_norm": 1.328125, "learning_rate": 0.0004338880125528127, "loss": 6.0729, "mean_token_accuracy": 0.14965935051441193, "num_tokens": 52254213.0, "step": 24150 }, { "entropy": 6.346394824981689, "epoch": 2.5848359997859705, "grad_norm": 1.3125, "learning_rate": 0.00043386093938222126, "loss": 6.0275, "mean_token_accuracy": 0.14227450117468834, "num_tokens": 52265381.0, "step": 24155 }, { "entropy": 6.439273071289063, "epoch": 2.585371073893734, "grad_norm": 1.234375, "learning_rate": 0.0004338338616245425, "loss": 5.9808, "mean_token_accuracy": 0.15383731126785277, "num_tokens": 52276407.0, "step": 24160 }, { "entropy": 6.47182822227478, "epoch": 2.585906148001498, "grad_norm": 1.5546875, "learning_rate": 0.00043380677928055834, "loss": 6.0297, "mean_token_accuracy": 0.14760112687945365, "num_tokens": 52286484.0, "step": 24165 }, { "entropy": 6.447051572799682, "epoch": 2.5864412221092623, "grad_norm": 1.2265625, "learning_rate": 0.00043377969235105075, "loss": 6.0181, "mean_token_accuracy": 0.1589368149638176, "num_tokens": 52297674.0, "step": 24170 }, { "entropy": 6.466054677963257, "epoch": 2.586976296217026, "grad_norm": 1.3125, "learning_rate": 0.0004337526008368018, "loss": 6.2, "mean_token_accuracy": 0.13537324145436286, "num_tokens": 52309100.0, "step": 24175 }, { "entropy": 6.463847732543945, "epoch": 2.58751137032479, "grad_norm": 1.2265625, "learning_rate": 0.0004337255047385938, "loss": 6.1466, "mean_token_accuracy": 0.14427336156368256, "num_tokens": 52320002.0, "step": 24180 }, { "entropy": 6.506901597976684, "epoch": 2.588046444432554, "grad_norm": 1.25, "learning_rate": 0.00043369840405720923, "loss": 6.0284, "mean_token_accuracy": 0.1494366154074669, "num_tokens": 52330073.0, "step": 24185 }, { "entropy": 6.470348787307739, "epoch": 2.588581518540318, "grad_norm": 1.109375, "learning_rate": 0.00043367129879343054, "loss": 6.0647, "mean_token_accuracy": 0.1489595964550972, "num_tokens": 52340472.0, "step": 24190 }, { "entropy": 6.375665807723999, "epoch": 2.589116592648082, "grad_norm": 1.4765625, "learning_rate": 0.00043364418894804033, "loss": 6.0988, "mean_token_accuracy": 0.1446430616080761, "num_tokens": 52350654.0, "step": 24195 }, { "entropy": 6.377849435806274, "epoch": 2.5896516667558456, "grad_norm": 1.1484375, "learning_rate": 0.00043361707452182146, "loss": 6.023, "mean_token_accuracy": 0.1453050084412098, "num_tokens": 52361412.0, "step": 24200 }, { "entropy": 6.456816053390503, "epoch": 2.5901867408636097, "grad_norm": 1.203125, "learning_rate": 0.00043358995551555693, "loss": 6.0259, "mean_token_accuracy": 0.15469790548086165, "num_tokens": 52372030.0, "step": 24205 }, { "entropy": 6.451414012908936, "epoch": 2.5907218149713733, "grad_norm": 1.34375, "learning_rate": 0.00043356283193002966, "loss": 6.102, "mean_token_accuracy": 0.14788893163204192, "num_tokens": 52382965.0, "step": 24210 }, { "entropy": 6.400993394851684, "epoch": 2.5912568890791374, "grad_norm": 1.140625, "learning_rate": 0.0004335357037660229, "loss": 5.9864, "mean_token_accuracy": 0.16124625951051713, "num_tokens": 52393959.0, "step": 24215 }, { "entropy": 6.459224557876587, "epoch": 2.5917919631869015, "grad_norm": 1.1796875, "learning_rate": 0.00043350857102432, "loss": 6.1135, "mean_token_accuracy": 0.14438671991229057, "num_tokens": 52405142.0, "step": 24220 }, { "entropy": 6.456777429580688, "epoch": 2.592327037294665, "grad_norm": 1.2109375, "learning_rate": 0.0004334814337057043, "loss": 6.0892, "mean_token_accuracy": 0.14303739219903946, "num_tokens": 52415927.0, "step": 24225 }, { "entropy": 6.43075041770935, "epoch": 2.5928621114024293, "grad_norm": 1.21875, "learning_rate": 0.00043345429181095957, "loss": 6.0079, "mean_token_accuracy": 0.15044942498207092, "num_tokens": 52426475.0, "step": 24230 }, { "entropy": 6.418110799789429, "epoch": 2.5933971855101934, "grad_norm": 1.2109375, "learning_rate": 0.00043342714534086945, "loss": 6.0459, "mean_token_accuracy": 0.1518814221024513, "num_tokens": 52437239.0, "step": 24235 }, { "entropy": 6.429792833328247, "epoch": 2.593932259617957, "grad_norm": 1.1640625, "learning_rate": 0.0004333999942962177, "loss": 6.0682, "mean_token_accuracy": 0.14043737947940826, "num_tokens": 52447323.0, "step": 24240 }, { "entropy": 6.528575420379639, "epoch": 2.594467333725721, "grad_norm": 4.09375, "learning_rate": 0.00043337283867778836, "loss": 6.1452, "mean_token_accuracy": 0.14742616713047027, "num_tokens": 52458465.0, "step": 24245 }, { "entropy": 6.451436614990234, "epoch": 2.595002407833485, "grad_norm": 1.21875, "learning_rate": 0.00043334567848636563, "loss": 6.1069, "mean_token_accuracy": 0.14342329725623132, "num_tokens": 52468809.0, "step": 24250 }, { "entropy": 6.460465335845948, "epoch": 2.595537481941249, "grad_norm": 1.25, "learning_rate": 0.00043331851372273365, "loss": 6.1086, "mean_token_accuracy": 0.14166531935334206, "num_tokens": 52479456.0, "step": 24255 }, { "entropy": 6.434340095520019, "epoch": 2.5960725560490125, "grad_norm": 1.21875, "learning_rate": 0.00043329134438767683, "loss": 6.0314, "mean_token_accuracy": 0.14960811734199525, "num_tokens": 52490146.0, "step": 24260 }, { "entropy": 6.475519704818725, "epoch": 2.5966076301567766, "grad_norm": 1.1875, "learning_rate": 0.0004332641704819797, "loss": 6.1205, "mean_token_accuracy": 0.14168959707021714, "num_tokens": 52499875.0, "step": 24265 }, { "entropy": 6.394170427322388, "epoch": 2.5971427042645407, "grad_norm": 1.3515625, "learning_rate": 0.00043323699200642686, "loss": 5.9511, "mean_token_accuracy": 0.15287287384271622, "num_tokens": 52510297.0, "step": 24270 }, { "entropy": 6.294159889221191, "epoch": 2.5976777783723044, "grad_norm": 1.421875, "learning_rate": 0.0004332098089618031, "loss": 5.9371, "mean_token_accuracy": 0.15982006639242172, "num_tokens": 52523111.0, "step": 24275 }, { "entropy": 6.367207765579224, "epoch": 2.5982128524800685, "grad_norm": 1.25, "learning_rate": 0.00043318262134889334, "loss": 6.0509, "mean_token_accuracy": 0.15884466767311095, "num_tokens": 52534097.0, "step": 24280 }, { "entropy": 6.45570821762085, "epoch": 2.5987479265878326, "grad_norm": 1.1875, "learning_rate": 0.0004331554291684827, "loss": 6.0907, "mean_token_accuracy": 0.14977332353591918, "num_tokens": 52544985.0, "step": 24285 }, { "entropy": 6.50822811126709, "epoch": 2.5992830006955963, "grad_norm": 1.1796875, "learning_rate": 0.0004331282324213561, "loss": 6.0785, "mean_token_accuracy": 0.1470681443810463, "num_tokens": 52555772.0, "step": 24290 }, { "entropy": 6.394162940979004, "epoch": 2.5998180748033604, "grad_norm": 1.4375, "learning_rate": 0.0004331010311082992, "loss": 6.0741, "mean_token_accuracy": 0.1432741865515709, "num_tokens": 52566578.0, "step": 24295 }, { "entropy": 6.414872694015503, "epoch": 2.6003531489111245, "grad_norm": 1.453125, "learning_rate": 0.00043307382523009717, "loss": 6.1515, "mean_token_accuracy": 0.13928197622299193, "num_tokens": 52578551.0, "step": 24300 }, { "entropy": 6.473379039764405, "epoch": 2.600888223018888, "grad_norm": 1.390625, "learning_rate": 0.0004330466147875356, "loss": 6.0349, "mean_token_accuracy": 0.15189071148633956, "num_tokens": 52589225.0, "step": 24305 }, { "entropy": 6.449392700195313, "epoch": 2.6014232971266518, "grad_norm": 1.1328125, "learning_rate": 0.00043301939978140024, "loss": 6.0077, "mean_token_accuracy": 0.15292997807264327, "num_tokens": 52599572.0, "step": 24310 }, { "entropy": 6.5235514640808105, "epoch": 2.601958371234416, "grad_norm": 1.1796875, "learning_rate": 0.00043299218021247693, "loss": 6.0975, "mean_token_accuracy": 0.14887815117835998, "num_tokens": 52610562.0, "step": 24315 }, { "entropy": 6.455296993255615, "epoch": 2.60249344534218, "grad_norm": 1.3359375, "learning_rate": 0.0004329649560815517, "loss": 6.1538, "mean_token_accuracy": 0.14208897054195405, "num_tokens": 52621078.0, "step": 24320 }, { "entropy": 6.351390933990478, "epoch": 2.6030285194499436, "grad_norm": 1.0546875, "learning_rate": 0.0004329377273894104, "loss": 6.0507, "mean_token_accuracy": 0.15557428300380707, "num_tokens": 52632336.0, "step": 24325 }, { "entropy": 6.331639194488526, "epoch": 2.6035635935577077, "grad_norm": 1.1484375, "learning_rate": 0.0004329104941368396, "loss": 5.974, "mean_token_accuracy": 0.15507864207029343, "num_tokens": 52643701.0, "step": 24330 }, { "entropy": 6.33278169631958, "epoch": 2.604098667665472, "grad_norm": 1.3203125, "learning_rate": 0.0004328832563246254, "loss": 5.9967, "mean_token_accuracy": 0.16262860000133514, "num_tokens": 52654052.0, "step": 24335 }, { "entropy": 6.350516843795776, "epoch": 2.6046337417732355, "grad_norm": 1.2265625, "learning_rate": 0.00043285601395355426, "loss": 5.9468, "mean_token_accuracy": 0.1586562916636467, "num_tokens": 52665033.0, "step": 24340 }, { "entropy": 6.429211378097534, "epoch": 2.6051688158809996, "grad_norm": 1.4140625, "learning_rate": 0.00043282876702441296, "loss": 6.1019, "mean_token_accuracy": 0.14732210487127304, "num_tokens": 52674726.0, "step": 24345 }, { "entropy": 6.438467884063721, "epoch": 2.6057038899887637, "grad_norm": 1.1796875, "learning_rate": 0.00043280151553798824, "loss": 6.0956, "mean_token_accuracy": 0.15359852015972136, "num_tokens": 52687221.0, "step": 24350 }, { "entropy": 6.471713638305664, "epoch": 2.6062389640965273, "grad_norm": 1.859375, "learning_rate": 0.0004327742594950669, "loss": 6.1259, "mean_token_accuracy": 0.14772944822907447, "num_tokens": 52697902.0, "step": 24355 }, { "entropy": 6.433329105377197, "epoch": 2.6067740382042914, "grad_norm": 1.28125, "learning_rate": 0.000432746998896436, "loss": 6.0359, "mean_token_accuracy": 0.1486979454755783, "num_tokens": 52707845.0, "step": 24360 }, { "entropy": 6.360949325561523, "epoch": 2.607309112312055, "grad_norm": 1.140625, "learning_rate": 0.0004327197337428827, "loss": 5.9886, "mean_token_accuracy": 0.14805514216423035, "num_tokens": 52719254.0, "step": 24365 }, { "entropy": 6.387172746658325, "epoch": 2.607844186419819, "grad_norm": 1.1484375, "learning_rate": 0.0004326924640351942, "loss": 6.0702, "mean_token_accuracy": 0.14471611082553865, "num_tokens": 52729765.0, "step": 24370 }, { "entropy": 6.455325651168823, "epoch": 2.608379260527583, "grad_norm": 1.2421875, "learning_rate": 0.00043266518977415797, "loss": 6.0394, "mean_token_accuracy": 0.14488050118088722, "num_tokens": 52740997.0, "step": 24375 }, { "entropy": 6.523528909683227, "epoch": 2.608914334635347, "grad_norm": 1.40625, "learning_rate": 0.0004326379109605615, "loss": 6.2147, "mean_token_accuracy": 0.14074205458164216, "num_tokens": 52753107.0, "step": 24380 }, { "entropy": 6.374628067016602, "epoch": 2.609449408743111, "grad_norm": 1.15625, "learning_rate": 0.0004326106275951926, "loss": 5.9975, "mean_token_accuracy": 0.14371056407690047, "num_tokens": 52765453.0, "step": 24385 }, { "entropy": 6.430091094970703, "epoch": 2.6099844828508747, "grad_norm": 1.28125, "learning_rate": 0.0004325833396788389, "loss": 6.08, "mean_token_accuracy": 0.1492977872490883, "num_tokens": 52776145.0, "step": 24390 }, { "entropy": 6.46644344329834, "epoch": 2.610519556958639, "grad_norm": 1.140625, "learning_rate": 0.0004325560472122884, "loss": 6.0946, "mean_token_accuracy": 0.1439564608037472, "num_tokens": 52788404.0, "step": 24395 }, { "entropy": 6.458155012130737, "epoch": 2.611054631066403, "grad_norm": 1.328125, "learning_rate": 0.0004325287501963293, "loss": 6.1135, "mean_token_accuracy": 0.1481269381940365, "num_tokens": 52800481.0, "step": 24400 }, { "entropy": 6.479500007629395, "epoch": 2.6115897051741666, "grad_norm": 1.84375, "learning_rate": 0.0004325014486317495, "loss": 6.0824, "mean_token_accuracy": 0.14577948302030563, "num_tokens": 52811539.0, "step": 24405 }, { "entropy": 6.483169221878052, "epoch": 2.6121247792819307, "grad_norm": 1.3203125, "learning_rate": 0.0004324741425193376, "loss": 6.086, "mean_token_accuracy": 0.15455956906080245, "num_tokens": 52822330.0, "step": 24410 }, { "entropy": 6.435340213775635, "epoch": 2.6126598533896943, "grad_norm": 2.25, "learning_rate": 0.000432446831859882, "loss": 6.0467, "mean_token_accuracy": 0.14749523997306824, "num_tokens": 52832447.0, "step": 24415 }, { "entropy": 6.390778493881226, "epoch": 2.6131949274974584, "grad_norm": 1.203125, "learning_rate": 0.0004324195166541712, "loss": 6.0102, "mean_token_accuracy": 0.15169788151979446, "num_tokens": 52843089.0, "step": 24420 }, { "entropy": 6.512231492996216, "epoch": 2.613730001605222, "grad_norm": 1.25, "learning_rate": 0.000432392196902994, "loss": 6.1017, "mean_token_accuracy": 0.1472408302128315, "num_tokens": 52854235.0, "step": 24425 }, { "entropy": 6.487987804412842, "epoch": 2.614265075712986, "grad_norm": 1.515625, "learning_rate": 0.0004323648726071392, "loss": 6.135, "mean_token_accuracy": 0.14550320953130721, "num_tokens": 52864693.0, "step": 24430 }, { "entropy": 6.454853820800781, "epoch": 2.6148001498207503, "grad_norm": 1.3828125, "learning_rate": 0.00043233754376739583, "loss": 6.1386, "mean_token_accuracy": 0.13794720098376273, "num_tokens": 52876410.0, "step": 24435 }, { "entropy": 6.511990690231324, "epoch": 2.615335223928514, "grad_norm": 1.0859375, "learning_rate": 0.00043231021038455297, "loss": 6.0957, "mean_token_accuracy": 0.14732400625944136, "num_tokens": 52887416.0, "step": 24440 }, { "entropy": 6.457764339447022, "epoch": 2.615870298036278, "grad_norm": 1.3984375, "learning_rate": 0.00043228287245939995, "loss": 6.0688, "mean_token_accuracy": 0.14884536266326903, "num_tokens": 52899191.0, "step": 24445 }, { "entropy": 6.423716735839844, "epoch": 2.616405372144042, "grad_norm": 1.234375, "learning_rate": 0.000432255529992726, "loss": 6.1069, "mean_token_accuracy": 0.14540746733546256, "num_tokens": 52910479.0, "step": 24450 }, { "entropy": 6.5056352615356445, "epoch": 2.6169404462518058, "grad_norm": 1.3828125, "learning_rate": 0.00043222818298532074, "loss": 6.0127, "mean_token_accuracy": 0.14803672283887864, "num_tokens": 52921121.0, "step": 24455 }, { "entropy": 6.44695553779602, "epoch": 2.61747552035957, "grad_norm": 1.703125, "learning_rate": 0.00043220083143797385, "loss": 6.09, "mean_token_accuracy": 0.13852541148662567, "num_tokens": 52931604.0, "step": 24460 }, { "entropy": 6.373794031143189, "epoch": 2.618010594467334, "grad_norm": 1.171875, "learning_rate": 0.000432173475351475, "loss": 6.032, "mean_token_accuracy": 0.14527107030153275, "num_tokens": 52942200.0, "step": 24465 }, { "entropy": 6.4063183784484865, "epoch": 2.6185456685750976, "grad_norm": 1.4453125, "learning_rate": 0.0004321461147266141, "loss": 6.0824, "mean_token_accuracy": 0.14536070376634597, "num_tokens": 52954350.0, "step": 24470 }, { "entropy": 6.480186939239502, "epoch": 2.6190807426828617, "grad_norm": 1.890625, "learning_rate": 0.00043211874956418134, "loss": 6.0619, "mean_token_accuracy": 0.16361079066991807, "num_tokens": 52965683.0, "step": 24475 }, { "entropy": 6.446354913711548, "epoch": 2.6196158167906254, "grad_norm": 1.25, "learning_rate": 0.0004320913798649667, "loss": 6.055, "mean_token_accuracy": 0.1539105162024498, "num_tokens": 52975463.0, "step": 24480 }, { "entropy": 6.352461862564087, "epoch": 2.6201508908983895, "grad_norm": 1.328125, "learning_rate": 0.0004320640056297605, "loss": 6.0591, "mean_token_accuracy": 0.1458171598613262, "num_tokens": 52986115.0, "step": 24485 }, { "entropy": 6.436176395416259, "epoch": 2.620685965006153, "grad_norm": 1.203125, "learning_rate": 0.0004320366268593532, "loss": 6.0464, "mean_token_accuracy": 0.1481872394680977, "num_tokens": 52995770.0, "step": 24490 }, { "entropy": 6.432749843597412, "epoch": 2.6212210391139172, "grad_norm": 1.3828125, "learning_rate": 0.00043200924355453544, "loss": 6.0518, "mean_token_accuracy": 0.14631206393241883, "num_tokens": 53006490.0, "step": 24495 }, { "entropy": 6.402523422241211, "epoch": 2.6217561132216813, "grad_norm": 1.546875, "learning_rate": 0.0004319818557160978, "loss": 5.9427, "mean_token_accuracy": 0.156124509871006, "num_tokens": 53016129.0, "step": 24500 }, { "entropy": 6.429434156417846, "epoch": 2.622291187329445, "grad_norm": 1.328125, "learning_rate": 0.00043195446334483116, "loss": 6.0573, "mean_token_accuracy": 0.147378371655941, "num_tokens": 53026568.0, "step": 24505 }, { "entropy": 6.433309268951416, "epoch": 2.622826261437209, "grad_norm": 1.296875, "learning_rate": 0.00043192706644152646, "loss": 6.0144, "mean_token_accuracy": 0.15224088430404664, "num_tokens": 53036488.0, "step": 24510 }, { "entropy": 6.49397087097168, "epoch": 2.623361335544973, "grad_norm": 1.1171875, "learning_rate": 0.0004318996650069747, "loss": 6.097, "mean_token_accuracy": 0.14693214744329453, "num_tokens": 53047195.0, "step": 24515 }, { "entropy": 6.420006895065308, "epoch": 2.623896409652737, "grad_norm": 1.2421875, "learning_rate": 0.0004318722590419672, "loss": 6.1675, "mean_token_accuracy": 0.13790112733840942, "num_tokens": 53058602.0, "step": 24520 }, { "entropy": 6.481870889663696, "epoch": 2.624431483760501, "grad_norm": 1.125, "learning_rate": 0.0004318448485472953, "loss": 6.133, "mean_token_accuracy": 0.14528400152921678, "num_tokens": 53070822.0, "step": 24525 }, { "entropy": 6.453919887542725, "epoch": 2.6249665578682646, "grad_norm": 1.75, "learning_rate": 0.00043181743352375035, "loss": 6.0908, "mean_token_accuracy": 0.14658737927675247, "num_tokens": 53082166.0, "step": 24530 }, { "entropy": 6.479091215133667, "epoch": 2.6255016319760287, "grad_norm": 1.0625, "learning_rate": 0.000431790013972124, "loss": 6.2179, "mean_token_accuracy": 0.143229378759861, "num_tokens": 53093688.0, "step": 24535 }, { "entropy": 6.460739183425903, "epoch": 2.6260367060837924, "grad_norm": 2.03125, "learning_rate": 0.0004317625898932082, "loss": 6.0775, "mean_token_accuracy": 0.148956398665905, "num_tokens": 53104793.0, "step": 24540 }, { "entropy": 6.434842872619629, "epoch": 2.6265717801915565, "grad_norm": 1.2265625, "learning_rate": 0.0004317351612877946, "loss": 6.0752, "mean_token_accuracy": 0.14351183474063872, "num_tokens": 53115835.0, "step": 24545 }, { "entropy": 6.37038779258728, "epoch": 2.6271068542993206, "grad_norm": 1.2578125, "learning_rate": 0.0004317077281566751, "loss": 5.9577, "mean_token_accuracy": 0.15568140149116516, "num_tokens": 53127153.0, "step": 24550 }, { "entropy": 6.372911405563355, "epoch": 2.627641928407084, "grad_norm": 1.0703125, "learning_rate": 0.00043168029050064214, "loss": 5.9788, "mean_token_accuracy": 0.15299040228128433, "num_tokens": 53137323.0, "step": 24555 }, { "entropy": 6.4208156108856205, "epoch": 2.6281770025148483, "grad_norm": 1.296875, "learning_rate": 0.00043165284832048773, "loss": 6.1423, "mean_token_accuracy": 0.14667749255895615, "num_tokens": 53146858.0, "step": 24560 }, { "entropy": 6.425225877761841, "epoch": 2.6287120766226124, "grad_norm": 1.203125, "learning_rate": 0.00043162540161700434, "loss": 6.1084, "mean_token_accuracy": 0.14319248422980307, "num_tokens": 53157225.0, "step": 24565 }, { "entropy": 6.424941825866699, "epoch": 2.629247150730376, "grad_norm": 1.21875, "learning_rate": 0.00043159795039098453, "loss": 6.063, "mean_token_accuracy": 0.1474204957485199, "num_tokens": 53167571.0, "step": 24570 }, { "entropy": 6.397244167327881, "epoch": 2.62978222483814, "grad_norm": 1.359375, "learning_rate": 0.0004315704946432209, "loss": 6.0289, "mean_token_accuracy": 0.15182553678750993, "num_tokens": 53178562.0, "step": 24575 }, { "entropy": 6.476341485977173, "epoch": 2.6303172989459043, "grad_norm": 1.25, "learning_rate": 0.00043154303437450617, "loss": 6.1639, "mean_token_accuracy": 0.14258697107434273, "num_tokens": 53188833.0, "step": 24580 }, { "entropy": 6.474404048919678, "epoch": 2.630852373053668, "grad_norm": 1.421875, "learning_rate": 0.00043151556958563337, "loss": 6.0815, "mean_token_accuracy": 0.15322111696004867, "num_tokens": 53199596.0, "step": 24585 }, { "entropy": 6.47436900138855, "epoch": 2.6313874471614316, "grad_norm": 1.6640625, "learning_rate": 0.0004314881002773955, "loss": 6.0773, "mean_token_accuracy": 0.15083299130201339, "num_tokens": 53209942.0, "step": 24590 }, { "entropy": 6.477980422973633, "epoch": 2.6319225212691957, "grad_norm": 1.140625, "learning_rate": 0.0004314606264505857, "loss": 6.1533, "mean_token_accuracy": 0.14410494416952133, "num_tokens": 53221546.0, "step": 24595 }, { "entropy": 6.475403738021851, "epoch": 2.63245759537696, "grad_norm": 1.203125, "learning_rate": 0.0004314331481059973, "loss": 6.1029, "mean_token_accuracy": 0.1430260181427002, "num_tokens": 53232343.0, "step": 24600 }, { "entropy": 6.409321403503418, "epoch": 2.6329926694847234, "grad_norm": 1.4609375, "learning_rate": 0.0004314056652444237, "loss": 6.0974, "mean_token_accuracy": 0.15831847935914994, "num_tokens": 53242820.0, "step": 24605 }, { "entropy": 6.507085609436035, "epoch": 2.6335277435924875, "grad_norm": 1.1875, "learning_rate": 0.00043137817786665863, "loss": 6.0829, "mean_token_accuracy": 0.14766844362020493, "num_tokens": 53253503.0, "step": 24610 }, { "entropy": 6.508805513381958, "epoch": 2.6340628177002516, "grad_norm": 1.2578125, "learning_rate": 0.00043135068597349545, "loss": 6.0755, "mean_token_accuracy": 0.15044575780630112, "num_tokens": 53264160.0, "step": 24615 }, { "entropy": 6.446940660476685, "epoch": 2.6345978918080153, "grad_norm": 1.28125, "learning_rate": 0.0004313231895657283, "loss": 6.0796, "mean_token_accuracy": 0.1428944207727909, "num_tokens": 53275002.0, "step": 24620 }, { "entropy": 6.383434438705445, "epoch": 2.6351329659157794, "grad_norm": 1.3828125, "learning_rate": 0.00043129568864415103, "loss": 5.9665, "mean_token_accuracy": 0.1554861694574356, "num_tokens": 53284216.0, "step": 24625 }, { "entropy": 6.431263828277588, "epoch": 2.6356680400235435, "grad_norm": 1.4140625, "learning_rate": 0.00043126818320955766, "loss": 5.9968, "mean_token_accuracy": 0.1596357226371765, "num_tokens": 53294277.0, "step": 24630 }, { "entropy": 6.410352087020874, "epoch": 2.636203114131307, "grad_norm": 1.3359375, "learning_rate": 0.0004312406732627425, "loss": 6.0504, "mean_token_accuracy": 0.14713098406791686, "num_tokens": 53304448.0, "step": 24635 }, { "entropy": 6.383740377426148, "epoch": 2.6367381882390712, "grad_norm": 1.1796875, "learning_rate": 0.00043121315880449983, "loss": 6.0372, "mean_token_accuracy": 0.14834167659282685, "num_tokens": 53315765.0, "step": 24640 }, { "entropy": 6.347890996932984, "epoch": 2.637273262346835, "grad_norm": 1.203125, "learning_rate": 0.00043118563983562415, "loss": 5.9345, "mean_token_accuracy": 0.15982358157634735, "num_tokens": 53326529.0, "step": 24645 }, { "entropy": 6.367116641998291, "epoch": 2.637808336454599, "grad_norm": 1.203125, "learning_rate": 0.00043115811635691006, "loss": 5.9236, "mean_token_accuracy": 0.15975846648216246, "num_tokens": 53336132.0, "step": 24650 }, { "entropy": 6.383596181869507, "epoch": 2.6383434105623627, "grad_norm": 1.3125, "learning_rate": 0.0004311305883691524, "loss": 6.0711, "mean_token_accuracy": 0.15277714729309083, "num_tokens": 53347284.0, "step": 24655 }, { "entropy": 6.443270826339722, "epoch": 2.6388784846701268, "grad_norm": 1.2109375, "learning_rate": 0.0004311030558731458, "loss": 6.0925, "mean_token_accuracy": 0.15340566188097, "num_tokens": 53357872.0, "step": 24660 }, { "entropy": 6.484456729888916, "epoch": 2.639413558777891, "grad_norm": 1.15625, "learning_rate": 0.00043107551886968545, "loss": 6.0668, "mean_token_accuracy": 0.14664531275629997, "num_tokens": 53370311.0, "step": 24665 }, { "entropy": 6.413418436050415, "epoch": 2.6399486328856545, "grad_norm": 1.1875, "learning_rate": 0.00043104797735956643, "loss": 5.9271, "mean_token_accuracy": 0.16085440367460252, "num_tokens": 53380320.0, "step": 24670 }, { "entropy": 6.411125373840332, "epoch": 2.6404837069934186, "grad_norm": 1.1484375, "learning_rate": 0.000431020431343584, "loss": 6.2001, "mean_token_accuracy": 0.14206002801656722, "num_tokens": 53391311.0, "step": 24675 }, { "entropy": 6.404000473022461, "epoch": 2.6410187811011827, "grad_norm": 1.375, "learning_rate": 0.0004309928808225335, "loss": 6.1327, "mean_token_accuracy": 0.14414913654327394, "num_tokens": 53402367.0, "step": 24680 }, { "entropy": 6.441148138046264, "epoch": 2.6415538552089464, "grad_norm": 1.421875, "learning_rate": 0.0004309653257972105, "loss": 6.0703, "mean_token_accuracy": 0.14555063843727112, "num_tokens": 53414253.0, "step": 24685 }, { "entropy": 6.493502807617188, "epoch": 2.6420889293167105, "grad_norm": 1.1796875, "learning_rate": 0.00043093776626841075, "loss": 6.0843, "mean_token_accuracy": 0.15417672991752623, "num_tokens": 53425727.0, "step": 24690 }, { "entropy": 6.439263868331909, "epoch": 2.6426240034244746, "grad_norm": 1.28125, "learning_rate": 0.00043091020223692974, "loss": 6.0923, "mean_token_accuracy": 0.14718570187687874, "num_tokens": 53435402.0, "step": 24695 }, { "entropy": 6.365416574478149, "epoch": 2.643159077532238, "grad_norm": 1.2734375, "learning_rate": 0.00043088263370356364, "loss": 6.0115, "mean_token_accuracy": 0.1540623649954796, "num_tokens": 53447421.0, "step": 24700 }, { "entropy": 6.426650619506836, "epoch": 2.643694151640002, "grad_norm": 1.140625, "learning_rate": 0.0004308550606691084, "loss": 5.9416, "mean_token_accuracy": 0.1605531767010689, "num_tokens": 53458346.0, "step": 24705 }, { "entropy": 6.4874035835266115, "epoch": 2.644229225747766, "grad_norm": 1.296875, "learning_rate": 0.0004308274831343601, "loss": 6.0939, "mean_token_accuracy": 0.14778290167450905, "num_tokens": 53469638.0, "step": 24710 }, { "entropy": 6.464153385162353, "epoch": 2.64476429985553, "grad_norm": 1.25, "learning_rate": 0.00043079990110011525, "loss": 6.1184, "mean_token_accuracy": 0.1428764671087265, "num_tokens": 53480645.0, "step": 24715 }, { "entropy": 6.435031175613403, "epoch": 2.6452993739632937, "grad_norm": 1.4609375, "learning_rate": 0.00043077231456717006, "loss": 6.0378, "mean_token_accuracy": 0.14761828482151032, "num_tokens": 53491958.0, "step": 24720 }, { "entropy": 6.392915153503418, "epoch": 2.645834448071058, "grad_norm": 1.2734375, "learning_rate": 0.00043074472353632124, "loss": 6.0321, "mean_token_accuracy": 0.14870360642671585, "num_tokens": 53502183.0, "step": 24725 }, { "entropy": 6.404493141174316, "epoch": 2.646369522178822, "grad_norm": 1.5234375, "learning_rate": 0.0004307171280083653, "loss": 6.0169, "mean_token_accuracy": 0.15042298138141633, "num_tokens": 53513373.0, "step": 24730 }, { "entropy": 6.382497024536133, "epoch": 2.6469045962865856, "grad_norm": 1.109375, "learning_rate": 0.0004306895279840992, "loss": 5.9469, "mean_token_accuracy": 0.15482517778873445, "num_tokens": 53523668.0, "step": 24735 }, { "entropy": 6.4751592636108395, "epoch": 2.6474396703943497, "grad_norm": 1.2890625, "learning_rate": 0.0004306619234643199, "loss": 6.089, "mean_token_accuracy": 0.1475205034017563, "num_tokens": 53535642.0, "step": 24740 }, { "entropy": 6.268040752410888, "epoch": 2.647974744502114, "grad_norm": 1.7421875, "learning_rate": 0.00043063431444982447, "loss": 5.8382, "mean_token_accuracy": 0.16326033398509027, "num_tokens": 53546192.0, "step": 24745 }, { "entropy": 6.401771163940429, "epoch": 2.6485098186098774, "grad_norm": 1.65625, "learning_rate": 0.00043060670094141005, "loss": 6.0694, "mean_token_accuracy": 0.15051522105932236, "num_tokens": 53557375.0, "step": 24750 }, { "entropy": 6.510762023925781, "epoch": 2.6490448927176415, "grad_norm": 1.25, "learning_rate": 0.00043057908293987404, "loss": 6.1119, "mean_token_accuracy": 0.14500435888767244, "num_tokens": 53568434.0, "step": 24755 }, { "entropy": 6.46000919342041, "epoch": 2.649579966825405, "grad_norm": 1.21875, "learning_rate": 0.0004305514604460138, "loss": 6.0497, "mean_token_accuracy": 0.1520714595913887, "num_tokens": 53579095.0, "step": 24760 }, { "entropy": 6.420160961151123, "epoch": 2.6501150409331693, "grad_norm": 1.28125, "learning_rate": 0.000430523833460627, "loss": 6.0498, "mean_token_accuracy": 0.14869655817747116, "num_tokens": 53590082.0, "step": 24765 }, { "entropy": 6.45833101272583, "epoch": 2.650650115040933, "grad_norm": 1.203125, "learning_rate": 0.00043049620198451147, "loss": 6.1186, "mean_token_accuracy": 0.14549318552017212, "num_tokens": 53600421.0, "step": 24770 }, { "entropy": 6.349174451828003, "epoch": 2.651185189148697, "grad_norm": 1.2109375, "learning_rate": 0.00043046856601846483, "loss": 5.9833, "mean_token_accuracy": 0.16112893372774123, "num_tokens": 53610994.0, "step": 24775 }, { "entropy": 6.464407253265381, "epoch": 2.651720263256461, "grad_norm": 1.1796875, "learning_rate": 0.00043044092556328517, "loss": 6.0772, "mean_token_accuracy": 0.1479618787765503, "num_tokens": 53622205.0, "step": 24780 }, { "entropy": 6.405384492874146, "epoch": 2.652255337364225, "grad_norm": 1.1875, "learning_rate": 0.00043041328061977073, "loss": 6.0266, "mean_token_accuracy": 0.15121926069259645, "num_tokens": 53632440.0, "step": 24785 }, { "entropy": 6.376495122909546, "epoch": 2.652790411471989, "grad_norm": 1.21875, "learning_rate": 0.00043038563118871965, "loss": 6.0356, "mean_token_accuracy": 0.15253866016864776, "num_tokens": 53642443.0, "step": 24790 }, { "entropy": 6.528036117553711, "epoch": 2.653325485579753, "grad_norm": 1.34375, "learning_rate": 0.0004303579772709303, "loss": 6.208, "mean_token_accuracy": 0.1376488521695137, "num_tokens": 53653671.0, "step": 24795 }, { "entropy": 6.458281230926514, "epoch": 2.6538605596875167, "grad_norm": 1.28125, "learning_rate": 0.00043033031886720107, "loss": 5.9964, "mean_token_accuracy": 0.15538475215435027, "num_tokens": 53664874.0, "step": 24800 }, { "entropy": 6.434471368789673, "epoch": 2.6543956337952808, "grad_norm": 1.171875, "learning_rate": 0.0004303026559783309, "loss": 6.0817, "mean_token_accuracy": 0.14613264203071594, "num_tokens": 53675623.0, "step": 24805 }, { "entropy": 6.422491359710693, "epoch": 2.6549307079030444, "grad_norm": 1.078125, "learning_rate": 0.0004302749886051182, "loss": 6.0629, "mean_token_accuracy": 0.14470580369234085, "num_tokens": 53685754.0, "step": 24810 }, { "entropy": 6.373309707641601, "epoch": 2.6554657820108085, "grad_norm": 1.4140625, "learning_rate": 0.0004302473167483621, "loss": 5.9771, "mean_token_accuracy": 0.15031711682677268, "num_tokens": 53696925.0, "step": 24815 }, { "entropy": 6.441711902618408, "epoch": 2.656000856118572, "grad_norm": 1.2734375, "learning_rate": 0.00043021964040886154, "loss": 6.0229, "mean_token_accuracy": 0.15357198864221572, "num_tokens": 53708046.0, "step": 24820 }, { "entropy": 6.334389972686767, "epoch": 2.6565359302263363, "grad_norm": 1.15625, "learning_rate": 0.0004301919595874156, "loss": 5.9309, "mean_token_accuracy": 0.1596555545926094, "num_tokens": 53719179.0, "step": 24825 }, { "entropy": 6.404006052017212, "epoch": 2.6570710043341004, "grad_norm": 1.21875, "learning_rate": 0.0004301642742848237, "loss": 6.0886, "mean_token_accuracy": 0.1488211527466774, "num_tokens": 53731523.0, "step": 24830 }, { "entropy": 6.4574353218078615, "epoch": 2.657606078441864, "grad_norm": 1.203125, "learning_rate": 0.0004301365845018853, "loss": 6.1935, "mean_token_accuracy": 0.13889062777161598, "num_tokens": 53742072.0, "step": 24835 }, { "entropy": 6.485256576538086, "epoch": 2.658141152549628, "grad_norm": 1.09375, "learning_rate": 0.0004301088902393996, "loss": 6.1156, "mean_token_accuracy": 0.14621224775910377, "num_tokens": 53754695.0, "step": 24840 }, { "entropy": 6.4294593811035154, "epoch": 2.6586762266573922, "grad_norm": 1.25, "learning_rate": 0.0004300811914981666, "loss": 5.9841, "mean_token_accuracy": 0.1572926238179207, "num_tokens": 53764587.0, "step": 24845 }, { "entropy": 6.477381372451783, "epoch": 2.659211300765156, "grad_norm": 1.2265625, "learning_rate": 0.000430053488278986, "loss": 6.1563, "mean_token_accuracy": 0.1446160852909088, "num_tokens": 53775609.0, "step": 24850 }, { "entropy": 6.383706712722779, "epoch": 2.65974637487292, "grad_norm": 1.34375, "learning_rate": 0.00043002578058265776, "loss": 6.0544, "mean_token_accuracy": 0.14788891226053238, "num_tokens": 53786495.0, "step": 24855 }, { "entropy": 6.42982931137085, "epoch": 2.660281448980684, "grad_norm": 1.2421875, "learning_rate": 0.0004299980684099818, "loss": 6.0484, "mean_token_accuracy": 0.1474327877163887, "num_tokens": 53797058.0, "step": 24860 }, { "entropy": 6.492137670516968, "epoch": 2.6608165230884477, "grad_norm": 1.28125, "learning_rate": 0.00042997035176175834, "loss": 6.0938, "mean_token_accuracy": 0.14735824167728423, "num_tokens": 53808148.0, "step": 24865 }, { "entropy": 6.425716733932495, "epoch": 2.661351597196212, "grad_norm": 1.4453125, "learning_rate": 0.0004299426306387879, "loss": 5.9765, "mean_token_accuracy": 0.16062136590480805, "num_tokens": 53818375.0, "step": 24870 }, { "entropy": 6.464401626586914, "epoch": 2.6618866713039755, "grad_norm": 1.4375, "learning_rate": 0.0004299149050418707, "loss": 6.1371, "mean_token_accuracy": 0.14501127004623413, "num_tokens": 53831273.0, "step": 24875 }, { "entropy": 6.367207431793213, "epoch": 2.6624217454117396, "grad_norm": 1.5859375, "learning_rate": 0.00042988717497180733, "loss": 6.0212, "mean_token_accuracy": 0.1531870424747467, "num_tokens": 53842492.0, "step": 24880 }, { "entropy": 6.438853931427002, "epoch": 2.6629568195195032, "grad_norm": 1.140625, "learning_rate": 0.00042985944042939867, "loss": 6.0598, "mean_token_accuracy": 0.14983204305171965, "num_tokens": 53853017.0, "step": 24885 }, { "entropy": 6.498943614959717, "epoch": 2.6634918936272673, "grad_norm": 1.3515625, "learning_rate": 0.00042983170141544535, "loss": 6.148, "mean_token_accuracy": 0.1471282422542572, "num_tokens": 53863606.0, "step": 24890 }, { "entropy": 6.376990270614624, "epoch": 2.6640269677350314, "grad_norm": 1.2265625, "learning_rate": 0.0004298039579307484, "loss": 6.0794, "mean_token_accuracy": 0.15422668308019638, "num_tokens": 53874689.0, "step": 24895 }, { "entropy": 6.489285039901733, "epoch": 2.664562041842795, "grad_norm": 1.375, "learning_rate": 0.000429776209976109, "loss": 6.0263, "mean_token_accuracy": 0.15514324307441713, "num_tokens": 53885247.0, "step": 24900 }, { "entropy": 6.432543611526489, "epoch": 2.665097115950559, "grad_norm": 1.234375, "learning_rate": 0.0004297484575523282, "loss": 6.1179, "mean_token_accuracy": 0.14705170542001725, "num_tokens": 53896829.0, "step": 24905 }, { "entropy": 6.4299815654754635, "epoch": 2.6656321900583233, "grad_norm": 1.234375, "learning_rate": 0.00042972070066020745, "loss": 6.0019, "mean_token_accuracy": 0.15523212403059006, "num_tokens": 53907236.0, "step": 24910 }, { "entropy": 6.46129002571106, "epoch": 2.666167264166087, "grad_norm": 1.734375, "learning_rate": 0.0004296929393005482, "loss": 6.0806, "mean_token_accuracy": 0.147062748670578, "num_tokens": 53918420.0, "step": 24915 }, { "entropy": 6.35111141204834, "epoch": 2.666702338273851, "grad_norm": 1.1875, "learning_rate": 0.0004296651734741521, "loss": 6.0094, "mean_token_accuracy": 0.15533339977264404, "num_tokens": 53928949.0, "step": 24920 }, { "entropy": 6.429946231842041, "epoch": 2.6672374123816147, "grad_norm": 1.1640625, "learning_rate": 0.00042963740318182085, "loss": 6.0974, "mean_token_accuracy": 0.1437372788786888, "num_tokens": 53939332.0, "step": 24925 }, { "entropy": 6.449320459365845, "epoch": 2.667772486489379, "grad_norm": 1.3359375, "learning_rate": 0.0004296096284243563, "loss": 6.0527, "mean_token_accuracy": 0.14638348892331124, "num_tokens": 53950703.0, "step": 24930 }, { "entropy": 6.524592351913452, "epoch": 2.6683075605971425, "grad_norm": 1.25, "learning_rate": 0.0004295818492025605, "loss": 6.1493, "mean_token_accuracy": 0.14144029915332795, "num_tokens": 53964061.0, "step": 24935 }, { "entropy": 6.435032606124878, "epoch": 2.6688426347049066, "grad_norm": 1.0859375, "learning_rate": 0.0004295540655172355, "loss": 6.0897, "mean_token_accuracy": 0.15345773547887803, "num_tokens": 53974980.0, "step": 24940 }, { "entropy": 6.350369501113891, "epoch": 2.6693777088126707, "grad_norm": 1.2421875, "learning_rate": 0.0004295262773691835, "loss": 5.9858, "mean_token_accuracy": 0.15522173494100572, "num_tokens": 53985437.0, "step": 24945 }, { "entropy": 6.410931539535523, "epoch": 2.6699127829204343, "grad_norm": 1.25, "learning_rate": 0.00042949848475920706, "loss": 6.0425, "mean_token_accuracy": 0.14897070825099945, "num_tokens": 53996952.0, "step": 24950 }, { "entropy": 6.481980085372925, "epoch": 2.6704478570281984, "grad_norm": 1.453125, "learning_rate": 0.0004294706876881085, "loss": 6.0386, "mean_token_accuracy": 0.15164224207401275, "num_tokens": 54007727.0, "step": 24955 }, { "entropy": 6.351395225524902, "epoch": 2.6709829311359625, "grad_norm": 1.390625, "learning_rate": 0.00042944288615669055, "loss": 5.9179, "mean_token_accuracy": 0.16518451124429703, "num_tokens": 54018275.0, "step": 24960 }, { "entropy": 6.390604639053345, "epoch": 2.671518005243726, "grad_norm": 1.2578125, "learning_rate": 0.00042941508016575597, "loss": 6.161, "mean_token_accuracy": 0.14320803731679915, "num_tokens": 54030376.0, "step": 24965 }, { "entropy": 6.420176219940186, "epoch": 2.6720530793514903, "grad_norm": 1.1953125, "learning_rate": 0.0004293872697161077, "loss": 6.0428, "mean_token_accuracy": 0.14821335524320603, "num_tokens": 54041487.0, "step": 24970 }, { "entropy": 6.461021041870117, "epoch": 2.6725881534592544, "grad_norm": 1.2109375, "learning_rate": 0.00042935945480854866, "loss": 6.0036, "mean_token_accuracy": 0.1632443353533745, "num_tokens": 54051273.0, "step": 24975 }, { "entropy": 6.391329097747803, "epoch": 2.673123227567018, "grad_norm": 1.1015625, "learning_rate": 0.0004293316354438821, "loss": 5.9997, "mean_token_accuracy": 0.15727767050266267, "num_tokens": 54061910.0, "step": 24980 }, { "entropy": 6.446732759475708, "epoch": 2.6736583016747817, "grad_norm": 1.171875, "learning_rate": 0.0004293038116229112, "loss": 6.112, "mean_token_accuracy": 0.14669544547796248, "num_tokens": 54072980.0, "step": 24985 }, { "entropy": 6.392126369476318, "epoch": 2.674193375782546, "grad_norm": 1.1328125, "learning_rate": 0.0004292759833464394, "loss": 6.0229, "mean_token_accuracy": 0.1577082723379135, "num_tokens": 54083027.0, "step": 24990 }, { "entropy": 6.342571830749511, "epoch": 2.67472844989031, "grad_norm": 1.3359375, "learning_rate": 0.00042924815061527033, "loss": 5.9767, "mean_token_accuracy": 0.14960994720458984, "num_tokens": 54094068.0, "step": 24995 }, { "entropy": 6.419144201278686, "epoch": 2.6752635239980735, "grad_norm": 1.234375, "learning_rate": 0.0004292203134302076, "loss": 6.0451, "mean_token_accuracy": 0.15052372217178345, "num_tokens": 54104683.0, "step": 25000 }, { "entropy": 6.448585128784179, "epoch": 2.6757985981058376, "grad_norm": 1.1953125, "learning_rate": 0.000429192471792055, "loss": 6.0159, "mean_token_accuracy": 0.14589312821626663, "num_tokens": 54115357.0, "step": 25005 }, { "entropy": 6.480725955963135, "epoch": 2.6763336722136017, "grad_norm": 1.296875, "learning_rate": 0.0004291646257016163, "loss": 6.0545, "mean_token_accuracy": 0.14583337679505348, "num_tokens": 54126410.0, "step": 25010 }, { "entropy": 6.371913909912109, "epoch": 2.6768687463213654, "grad_norm": 1.9609375, "learning_rate": 0.00042913677515969586, "loss": 5.9888, "mean_token_accuracy": 0.15447857975959778, "num_tokens": 54137279.0, "step": 25015 }, { "entropy": 6.391150856018067, "epoch": 2.6774038204291295, "grad_norm": 1.265625, "learning_rate": 0.0004291089201670976, "loss": 6.0744, "mean_token_accuracy": 0.15128765851259232, "num_tokens": 54146521.0, "step": 25020 }, { "entropy": 6.489438486099243, "epoch": 2.6779388945368936, "grad_norm": 1.203125, "learning_rate": 0.00042908106072462595, "loss": 6.1079, "mean_token_accuracy": 0.1405947297811508, "num_tokens": 54157277.0, "step": 25025 }, { "entropy": 6.485062789916992, "epoch": 2.6784739686446573, "grad_norm": 1.2265625, "learning_rate": 0.0004290531968330853, "loss": 6.1441, "mean_token_accuracy": 0.1452994555234909, "num_tokens": 54168078.0, "step": 25030 }, { "entropy": 6.527255439758301, "epoch": 2.6790090427524214, "grad_norm": 1.125, "learning_rate": 0.0004290253284932803, "loss": 6.1064, "mean_token_accuracy": 0.1496105045080185, "num_tokens": 54178567.0, "step": 25035 }, { "entropy": 6.407850360870361, "epoch": 2.679544116860185, "grad_norm": 1.5078125, "learning_rate": 0.0004289974557060155, "loss": 6.0353, "mean_token_accuracy": 0.14675920233130454, "num_tokens": 54189485.0, "step": 25040 }, { "entropy": 6.511658954620361, "epoch": 2.680079190967949, "grad_norm": 1.53125, "learning_rate": 0.00042896957847209593, "loss": 6.1334, "mean_token_accuracy": 0.14646179378032684, "num_tokens": 54199351.0, "step": 25045 }, { "entropy": 6.459256601333618, "epoch": 2.6806142650757128, "grad_norm": 1.171875, "learning_rate": 0.0004289416967923264, "loss": 6.0697, "mean_token_accuracy": 0.14572961181402205, "num_tokens": 54209001.0, "step": 25050 }, { "entropy": 6.423435878753662, "epoch": 2.681149339183477, "grad_norm": 1.46875, "learning_rate": 0.00042891381066751186, "loss": 6.1207, "mean_token_accuracy": 0.14531078115105628, "num_tokens": 54219783.0, "step": 25055 }, { "entropy": 6.477549695968628, "epoch": 2.681684413291241, "grad_norm": 1.203125, "learning_rate": 0.00042888592009845776, "loss": 6.0796, "mean_token_accuracy": 0.1480795480310917, "num_tokens": 54231337.0, "step": 25060 }, { "entropy": 6.467353487014771, "epoch": 2.6822194873990046, "grad_norm": 1.28125, "learning_rate": 0.0004288580250859694, "loss": 6.081, "mean_token_accuracy": 0.15658991187810897, "num_tokens": 54241650.0, "step": 25065 }, { "entropy": 6.433385515213013, "epoch": 2.6827545615067687, "grad_norm": 1.140625, "learning_rate": 0.0004288301256308521, "loss": 6.0851, "mean_token_accuracy": 0.1416018508374691, "num_tokens": 54252223.0, "step": 25070 }, { "entropy": 6.455324649810791, "epoch": 2.683289635614533, "grad_norm": 1.1484375, "learning_rate": 0.00042880222173391155, "loss": 6.0149, "mean_token_accuracy": 0.15223479270935059, "num_tokens": 54262469.0, "step": 25075 }, { "entropy": 6.428207540512085, "epoch": 2.6838247097222965, "grad_norm": 1.1796875, "learning_rate": 0.0004287743133959535, "loss": 6.0514, "mean_token_accuracy": 0.14683943539857863, "num_tokens": 54272885.0, "step": 25080 }, { "entropy": 6.396878862380982, "epoch": 2.6843597838300606, "grad_norm": 1.40625, "learning_rate": 0.0004287464006177837, "loss": 6.0714, "mean_token_accuracy": 0.14735295325517656, "num_tokens": 54283327.0, "step": 25085 }, { "entropy": 6.414928197860718, "epoch": 2.6848948579378242, "grad_norm": 1.15625, "learning_rate": 0.0004287184834002082, "loss": 6.0123, "mean_token_accuracy": 0.15037444978952408, "num_tokens": 54294761.0, "step": 25090 }, { "entropy": 6.527772426605225, "epoch": 2.6854299320455883, "grad_norm": 1.390625, "learning_rate": 0.00042869056174403303, "loss": 6.0762, "mean_token_accuracy": 0.1509876862168312, "num_tokens": 54305205.0, "step": 25095 }, { "entropy": 6.475588035583496, "epoch": 2.685965006153352, "grad_norm": 1.203125, "learning_rate": 0.0004286626356500647, "loss": 6.0723, "mean_token_accuracy": 0.15058556497097014, "num_tokens": 54315902.0, "step": 25100 }, { "entropy": 6.434620761871338, "epoch": 2.686500080261116, "grad_norm": 1.109375, "learning_rate": 0.0004286347051191091, "loss": 6.0781, "mean_token_accuracy": 0.15154436528682708, "num_tokens": 54327345.0, "step": 25105 }, { "entropy": 6.479596376419067, "epoch": 2.68703515436888, "grad_norm": 1.3203125, "learning_rate": 0.0004286067701519731, "loss": 6.1267, "mean_token_accuracy": 0.14832493662834167, "num_tokens": 54337548.0, "step": 25110 }, { "entropy": 6.468802404403687, "epoch": 2.687570228476644, "grad_norm": 1.2421875, "learning_rate": 0.00042857883074946324, "loss": 6.1058, "mean_token_accuracy": 0.1414439335465431, "num_tokens": 54348384.0, "step": 25115 }, { "entropy": 6.47977991104126, "epoch": 2.688105302584408, "grad_norm": 1.453125, "learning_rate": 0.0004285508869123862, "loss": 6.0501, "mean_token_accuracy": 0.14674096405506135, "num_tokens": 54358245.0, "step": 25120 }, { "entropy": 6.33971757888794, "epoch": 2.688640376692172, "grad_norm": 1.2109375, "learning_rate": 0.00042852293864154885, "loss": 6.0126, "mean_token_accuracy": 0.14785065352916718, "num_tokens": 54370421.0, "step": 25125 }, { "entropy": 6.456410455703735, "epoch": 2.6891754507999357, "grad_norm": 1.1328125, "learning_rate": 0.00042849498593775827, "loss": 5.9901, "mean_token_accuracy": 0.15010035261511803, "num_tokens": 54381368.0, "step": 25130 }, { "entropy": 6.464001274108886, "epoch": 2.6897105249077, "grad_norm": 1.1953125, "learning_rate": 0.00042846702880182147, "loss": 6.0585, "mean_token_accuracy": 0.1457326479256153, "num_tokens": 54392226.0, "step": 25135 }, { "entropy": 6.420953226089478, "epoch": 2.690245599015464, "grad_norm": 1.2578125, "learning_rate": 0.0004284390672345458, "loss": 6.0621, "mean_token_accuracy": 0.14454921185970307, "num_tokens": 54402295.0, "step": 25140 }, { "entropy": 6.513278436660767, "epoch": 2.6907806731232276, "grad_norm": 1.34375, "learning_rate": 0.0004284111012367387, "loss": 6.1109, "mean_token_accuracy": 0.1444273203611374, "num_tokens": 54413808.0, "step": 25145 }, { "entropy": 6.480533790588379, "epoch": 2.6913157472309917, "grad_norm": 1.25, "learning_rate": 0.00042838313080920755, "loss": 6.0945, "mean_token_accuracy": 0.14802695363759993, "num_tokens": 54425048.0, "step": 25150 }, { "entropy": 6.487511825561524, "epoch": 2.6918508213387553, "grad_norm": 1.171875, "learning_rate": 0.00042835515595276, "loss": 6.1262, "mean_token_accuracy": 0.14218694269657134, "num_tokens": 54435908.0, "step": 25155 }, { "entropy": 6.376295328140259, "epoch": 2.6923858954465194, "grad_norm": 1.3359375, "learning_rate": 0.0004283271766682039, "loss": 6.0451, "mean_token_accuracy": 0.15328938513994217, "num_tokens": 54447594.0, "step": 25160 }, { "entropy": 6.357793855667114, "epoch": 2.692920969554283, "grad_norm": 1.1328125, "learning_rate": 0.0004282991929563471, "loss": 5.992, "mean_token_accuracy": 0.1499350219964981, "num_tokens": 54458918.0, "step": 25165 }, { "entropy": 6.3818987846374515, "epoch": 2.693456043662047, "grad_norm": 1.21875, "learning_rate": 0.0004282712048179977, "loss": 5.9895, "mean_token_accuracy": 0.15822725892066955, "num_tokens": 54469423.0, "step": 25170 }, { "entropy": 6.473826122283936, "epoch": 2.6939911177698113, "grad_norm": 1.4765625, "learning_rate": 0.0004282432122539638, "loss": 6.1386, "mean_token_accuracy": 0.14685898870229722, "num_tokens": 54481895.0, "step": 25175 }, { "entropy": 6.487961006164551, "epoch": 2.694526191877575, "grad_norm": 1.203125, "learning_rate": 0.00042821521526505363, "loss": 6.0315, "mean_token_accuracy": 0.1499170407652855, "num_tokens": 54492233.0, "step": 25180 }, { "entropy": 6.439240312576294, "epoch": 2.695061265985339, "grad_norm": 1.1796875, "learning_rate": 0.0004281872138520757, "loss": 6.0055, "mean_token_accuracy": 0.15573531836271287, "num_tokens": 54502366.0, "step": 25185 }, { "entropy": 6.343453073501587, "epoch": 2.695596340093103, "grad_norm": 1.328125, "learning_rate": 0.00042815920801583845, "loss": 6.0539, "mean_token_accuracy": 0.15038024187088012, "num_tokens": 54512565.0, "step": 25190 }, { "entropy": 6.405899429321289, "epoch": 2.6961314142008668, "grad_norm": 1.3046875, "learning_rate": 0.00042813119775715066, "loss": 6.0446, "mean_token_accuracy": 0.15058374032378197, "num_tokens": 54522999.0, "step": 25195 }, { "entropy": 6.421649551391601, "epoch": 2.696666488308631, "grad_norm": 1.328125, "learning_rate": 0.00042810318307682095, "loss": 6.0422, "mean_token_accuracy": 0.14846908748149873, "num_tokens": 54533776.0, "step": 25200 }, { "entropy": 6.406240320205688, "epoch": 2.6972015624163945, "grad_norm": 1.21875, "learning_rate": 0.00042807516397565845, "loss": 6.0495, "mean_token_accuracy": 0.14737222194671631, "num_tokens": 54544972.0, "step": 25205 }, { "entropy": 6.41619553565979, "epoch": 2.6977366365241586, "grad_norm": 1.359375, "learning_rate": 0.0004280471404544721, "loss": 6.0431, "mean_token_accuracy": 0.14818297401070596, "num_tokens": 54556034.0, "step": 25210 }, { "entropy": 6.489672470092773, "epoch": 2.6982717106319223, "grad_norm": 1.1875, "learning_rate": 0.00042801911251407095, "loss": 5.9894, "mean_token_accuracy": 0.15989175885915757, "num_tokens": 54566662.0, "step": 25215 }, { "entropy": 6.464313793182373, "epoch": 2.6988067847396864, "grad_norm": 1.40625, "learning_rate": 0.0004279910801552645, "loss": 6.0637, "mean_token_accuracy": 0.14871048629283906, "num_tokens": 54578889.0, "step": 25220 }, { "entropy": 6.447121953964233, "epoch": 2.6993418588474505, "grad_norm": 1.2734375, "learning_rate": 0.0004279630433788621, "loss": 6.126, "mean_token_accuracy": 0.1456712655723095, "num_tokens": 54590456.0, "step": 25225 }, { "entropy": 6.448766422271729, "epoch": 2.699876932955214, "grad_norm": 1.1015625, "learning_rate": 0.0004279350021856734, "loss": 6.107, "mean_token_accuracy": 0.14201193749904634, "num_tokens": 54602327.0, "step": 25230 }, { "entropy": 6.521866321563721, "epoch": 2.7004120070629782, "grad_norm": 1.140625, "learning_rate": 0.00042790695657650787, "loss": 6.0531, "mean_token_accuracy": 0.1502055585384369, "num_tokens": 54612999.0, "step": 25235 }, { "entropy": 6.422251272201538, "epoch": 2.7009470811707423, "grad_norm": 1.2265625, "learning_rate": 0.00042787890655217553, "loss": 6.0265, "mean_token_accuracy": 0.14514252096414565, "num_tokens": 54624332.0, "step": 25240 }, { "entropy": 6.35856351852417, "epoch": 2.701482155278506, "grad_norm": 1.4453125, "learning_rate": 0.00042785085211348624, "loss": 6.0085, "mean_token_accuracy": 0.15130027532577514, "num_tokens": 54635679.0, "step": 25245 }, { "entropy": 6.424386024475098, "epoch": 2.70201722938627, "grad_norm": 1.1953125, "learning_rate": 0.00042782279326125005, "loss": 6.0455, "mean_token_accuracy": 0.15152093768119812, "num_tokens": 54646344.0, "step": 25250 }, { "entropy": 6.485493278503418, "epoch": 2.702552303494034, "grad_norm": 2.09375, "learning_rate": 0.00042779472999627724, "loss": 6.0933, "mean_token_accuracy": 0.1456468641757965, "num_tokens": 54657395.0, "step": 25255 }, { "entropy": 6.409106349945068, "epoch": 2.703087377601798, "grad_norm": 1.140625, "learning_rate": 0.000427766662319378, "loss": 6.0469, "mean_token_accuracy": 0.14813070893287658, "num_tokens": 54668755.0, "step": 25260 }, { "entropy": 6.453620576858521, "epoch": 2.7036224517095615, "grad_norm": 1.09375, "learning_rate": 0.00042773859023136285, "loss": 6.0406, "mean_token_accuracy": 0.14971143901348113, "num_tokens": 54679170.0, "step": 25265 }, { "entropy": 6.405198049545288, "epoch": 2.7041575258173256, "grad_norm": 1.3828125, "learning_rate": 0.0004277105137330424, "loss": 6.0492, "mean_token_accuracy": 0.15056706219911575, "num_tokens": 54688728.0, "step": 25270 }, { "entropy": 6.376384544372558, "epoch": 2.7046925999250897, "grad_norm": 1.2109375, "learning_rate": 0.00042768243282522735, "loss": 6.0513, "mean_token_accuracy": 0.15315230637788774, "num_tokens": 54700236.0, "step": 25275 }, { "entropy": 6.428701400756836, "epoch": 2.7052276740328534, "grad_norm": 1.171875, "learning_rate": 0.00042765434750872847, "loss": 6.0021, "mean_token_accuracy": 0.15179484635591506, "num_tokens": 54710586.0, "step": 25280 }, { "entropy": 6.43684573173523, "epoch": 2.7057627481406175, "grad_norm": 1.203125, "learning_rate": 0.00042762625778435676, "loss": 6.0005, "mean_token_accuracy": 0.15380548536777497, "num_tokens": 54721159.0, "step": 25285 }, { "entropy": 6.433546876907348, "epoch": 2.7062978222483816, "grad_norm": 1.25, "learning_rate": 0.0004275981636529233, "loss": 6.0788, "mean_token_accuracy": 0.15126713663339614, "num_tokens": 54731593.0, "step": 25290 }, { "entropy": 6.4233095169067385, "epoch": 2.706832896356145, "grad_norm": 1.203125, "learning_rate": 0.0004275700651152393, "loss": 5.9808, "mean_token_accuracy": 0.15337316542863846, "num_tokens": 54742890.0, "step": 25295 }, { "entropy": 6.359569358825683, "epoch": 2.7073679704639093, "grad_norm": 1.2265625, "learning_rate": 0.00042754196217211616, "loss": 6.0666, "mean_token_accuracy": 0.15261325538158416, "num_tokens": 54753344.0, "step": 25300 }, { "entropy": 6.481750774383545, "epoch": 2.7079030445716734, "grad_norm": 1.34375, "learning_rate": 0.00042751385482436523, "loss": 6.1473, "mean_token_accuracy": 0.14214920699596406, "num_tokens": 54763157.0, "step": 25305 }, { "entropy": 6.480219459533691, "epoch": 2.708438118679437, "grad_norm": 1.2265625, "learning_rate": 0.00042748574307279824, "loss": 6.0168, "mean_token_accuracy": 0.14984458982944487, "num_tokens": 54772515.0, "step": 25310 }, { "entropy": 6.3885527610778805, "epoch": 2.708973192787201, "grad_norm": 1.1328125, "learning_rate": 0.0004274576269182268, "loss": 5.9956, "mean_token_accuracy": 0.14940545037388803, "num_tokens": 54783178.0, "step": 25315 }, { "entropy": 6.457936239242554, "epoch": 2.709508266894965, "grad_norm": 1.109375, "learning_rate": 0.0004274295063614629, "loss": 6.1259, "mean_token_accuracy": 0.14772203788161278, "num_tokens": 54794709.0, "step": 25320 }, { "entropy": 6.480543708801269, "epoch": 2.710043341002729, "grad_norm": 1.3046875, "learning_rate": 0.0004274013814033184, "loss": 6.0533, "mean_token_accuracy": 0.15019096583127975, "num_tokens": 54804821.0, "step": 25325 }, { "entropy": 6.459848165512085, "epoch": 2.7105784151104926, "grad_norm": 1.25, "learning_rate": 0.00042737325204460523, "loss": 6.1038, "mean_token_accuracy": 0.1405377745628357, "num_tokens": 54815291.0, "step": 25330 }, { "entropy": 6.268032884597778, "epoch": 2.7111134892182567, "grad_norm": 1.578125, "learning_rate": 0.000427345118286136, "loss": 5.8781, "mean_token_accuracy": 0.16145387887954712, "num_tokens": 54826891.0, "step": 25335 }, { "entropy": 6.441977500915527, "epoch": 2.7116485633260208, "grad_norm": 1.1328125, "learning_rate": 0.0004273169801287228, "loss": 6.0936, "mean_token_accuracy": 0.14884840250015258, "num_tokens": 54837545.0, "step": 25340 }, { "entropy": 6.501547765731812, "epoch": 2.7121836374337844, "grad_norm": 1.109375, "learning_rate": 0.00042728883757317825, "loss": 6.172, "mean_token_accuracy": 0.13928472399711608, "num_tokens": 54848028.0, "step": 25345 }, { "entropy": 6.47163143157959, "epoch": 2.7127187115415485, "grad_norm": 0.9921875, "learning_rate": 0.00042726069062031495, "loss": 6.1053, "mean_token_accuracy": 0.14257197231054305, "num_tokens": 54858679.0, "step": 25350 }, { "entropy": 6.447218370437622, "epoch": 2.7132537856493126, "grad_norm": 1.1640625, "learning_rate": 0.00042723253927094565, "loss": 5.988, "mean_token_accuracy": 0.15201518535614014, "num_tokens": 54870892.0, "step": 25355 }, { "entropy": 6.411854791641235, "epoch": 2.7137888597570763, "grad_norm": 1.09375, "learning_rate": 0.000427204383525883, "loss": 5.962, "mean_token_accuracy": 0.15155672430992126, "num_tokens": 54881131.0, "step": 25360 }, { "entropy": 6.389288377761841, "epoch": 2.7143239338648404, "grad_norm": 1.2421875, "learning_rate": 0.0004271762233859403, "loss": 6.0734, "mean_token_accuracy": 0.1513580046594143, "num_tokens": 54891532.0, "step": 25365 }, { "entropy": 6.3969708442687985, "epoch": 2.714859007972604, "grad_norm": 1.1640625, "learning_rate": 0.00042714805885193046, "loss": 6.0154, "mean_token_accuracy": 0.15483452528715133, "num_tokens": 54902945.0, "step": 25370 }, { "entropy": 6.416445636749268, "epoch": 2.715394082080368, "grad_norm": 1.1640625, "learning_rate": 0.00042711988992466684, "loss": 6.0609, "mean_token_accuracy": 0.1438060313463211, "num_tokens": 54913943.0, "step": 25375 }, { "entropy": 6.459086894989014, "epoch": 2.715929156188132, "grad_norm": 1.1484375, "learning_rate": 0.00042709171660496275, "loss": 6.1081, "mean_token_accuracy": 0.15137378722429276, "num_tokens": 54924241.0, "step": 25380 }, { "entropy": 6.42902946472168, "epoch": 2.716464230295896, "grad_norm": 1.4140625, "learning_rate": 0.0004270635388936317, "loss": 6.0353, "mean_token_accuracy": 0.15176012068986894, "num_tokens": 54934083.0, "step": 25385 }, { "entropy": 6.4336676597595215, "epoch": 2.71699930440366, "grad_norm": 1.1484375, "learning_rate": 0.00042703535679148734, "loss": 6.1263, "mean_token_accuracy": 0.14425669983029366, "num_tokens": 54944928.0, "step": 25390 }, { "entropy": 6.357444190979004, "epoch": 2.7175343785114237, "grad_norm": 1.21875, "learning_rate": 0.00042700717029934345, "loss": 5.909, "mean_token_accuracy": 0.15729526579380035, "num_tokens": 54955715.0, "step": 25395 }, { "entropy": 6.38131160736084, "epoch": 2.7180694526191878, "grad_norm": 1.2109375, "learning_rate": 0.0004269789794180139, "loss": 6.109, "mean_token_accuracy": 0.14945384711027146, "num_tokens": 54966149.0, "step": 25400 }, { "entropy": 6.423126935958862, "epoch": 2.718604526726952, "grad_norm": 1.5703125, "learning_rate": 0.00042695078414831263, "loss": 6.0813, "mean_token_accuracy": 0.14676564559340477, "num_tokens": 54976854.0, "step": 25405 }, { "entropy": 6.480395746231079, "epoch": 2.7191396008347155, "grad_norm": 1.359375, "learning_rate": 0.0004269225844910538, "loss": 6.0717, "mean_token_accuracy": 0.14946893900632857, "num_tokens": 54987377.0, "step": 25410 }, { "entropy": 6.4805260181427, "epoch": 2.7196746749424796, "grad_norm": 1.125, "learning_rate": 0.0004268943804470518, "loss": 6.104, "mean_token_accuracy": 0.14189084023237228, "num_tokens": 54999488.0, "step": 25415 }, { "entropy": 6.543209362030029, "epoch": 2.7202097490502437, "grad_norm": 1.78125, "learning_rate": 0.00042686617201712074, "loss": 6.1492, "mean_token_accuracy": 0.14102415665984153, "num_tokens": 55011517.0, "step": 25420 }, { "entropy": 6.5075311183929445, "epoch": 2.7207448231580074, "grad_norm": 1.2734375, "learning_rate": 0.0004268379592020754, "loss": 6.0883, "mean_token_accuracy": 0.14639490693807602, "num_tokens": 55022133.0, "step": 25425 }, { "entropy": 6.380606174468994, "epoch": 2.7212798972657715, "grad_norm": 1.34375, "learning_rate": 0.00042680974200273036, "loss": 6.0547, "mean_token_accuracy": 0.14934568852186203, "num_tokens": 55032684.0, "step": 25430 }, { "entropy": 6.466644954681397, "epoch": 2.721814971373535, "grad_norm": 1.296875, "learning_rate": 0.0004267815204199003, "loss": 6.1029, "mean_token_accuracy": 0.15035367980599404, "num_tokens": 55042943.0, "step": 25435 }, { "entropy": 6.43906717300415, "epoch": 2.722350045481299, "grad_norm": 1.1640625, "learning_rate": 0.0004267532944544002, "loss": 6.0926, "mean_token_accuracy": 0.1449126720428467, "num_tokens": 55053805.0, "step": 25440 }, { "entropy": 6.397273015975952, "epoch": 2.722885119589063, "grad_norm": 1.1796875, "learning_rate": 0.00042672506410704495, "loss": 6.066, "mean_token_accuracy": 0.14536254554986955, "num_tokens": 55066611.0, "step": 25445 }, { "entropy": 6.443541193008423, "epoch": 2.723420193696827, "grad_norm": 1.234375, "learning_rate": 0.0004266968293786499, "loss": 6.0803, "mean_token_accuracy": 0.14655536636710167, "num_tokens": 55077954.0, "step": 25450 }, { "entropy": 6.4696681022644045, "epoch": 2.723955267804591, "grad_norm": 1.4375, "learning_rate": 0.0004266685902700302, "loss": 6.1103, "mean_token_accuracy": 0.1491883784532547, "num_tokens": 55090296.0, "step": 25455 }, { "entropy": 6.531213331222534, "epoch": 2.7244903419123547, "grad_norm": 1.1640625, "learning_rate": 0.0004266403467820013, "loss": 6.0781, "mean_token_accuracy": 0.14442493617534638, "num_tokens": 55100664.0, "step": 25460 }, { "entropy": 6.411429309844971, "epoch": 2.725025416020119, "grad_norm": 1.53125, "learning_rate": 0.0004266120989153786, "loss": 5.9759, "mean_token_accuracy": 0.15167819559574128, "num_tokens": 55111094.0, "step": 25465 }, { "entropy": 6.498197746276856, "epoch": 2.725560490127883, "grad_norm": 1.1640625, "learning_rate": 0.00042658384667097787, "loss": 6.1053, "mean_token_accuracy": 0.14239726811647416, "num_tokens": 55121877.0, "step": 25470 }, { "entropy": 6.418594217300415, "epoch": 2.7260955642356466, "grad_norm": 1.203125, "learning_rate": 0.0004265555900496149, "loss": 5.9952, "mean_token_accuracy": 0.15120193213224412, "num_tokens": 55133087.0, "step": 25475 }, { "entropy": 6.427367448806763, "epoch": 2.7266306383434107, "grad_norm": 1.375, "learning_rate": 0.00042652732905210555, "loss": 6.0785, "mean_token_accuracy": 0.14529965370893477, "num_tokens": 55144257.0, "step": 25480 }, { "entropy": 6.439451503753662, "epoch": 2.7271657124511743, "grad_norm": 1.1796875, "learning_rate": 0.0004264990636792659, "loss": 5.9624, "mean_token_accuracy": 0.15734648704528809, "num_tokens": 55154389.0, "step": 25485 }, { "entropy": 6.373074102401733, "epoch": 2.7277007865589384, "grad_norm": 1.0234375, "learning_rate": 0.000426470793931912, "loss": 5.9688, "mean_token_accuracy": 0.1599299654364586, "num_tokens": 55165734.0, "step": 25490 }, { "entropy": 6.29597053527832, "epoch": 2.728235860666702, "grad_norm": 1.234375, "learning_rate": 0.0004264425198108603, "loss": 5.9525, "mean_token_accuracy": 0.15958747416734695, "num_tokens": 55176448.0, "step": 25495 }, { "entropy": 6.41937141418457, "epoch": 2.728770934774466, "grad_norm": 1.2734375, "learning_rate": 0.00042641424131692707, "loss": 6.0222, "mean_token_accuracy": 0.1583247035741806, "num_tokens": 55187515.0, "step": 25500 }, { "entropy": 6.470597219467163, "epoch": 2.7293060088822303, "grad_norm": 1.125, "learning_rate": 0.0004263859584509289, "loss": 6.1298, "mean_token_accuracy": 0.14412814304232596, "num_tokens": 55199236.0, "step": 25505 }, { "entropy": 6.454286384582519, "epoch": 2.729841082989994, "grad_norm": 1.3515625, "learning_rate": 0.0004263576712136825, "loss": 6.0669, "mean_token_accuracy": 0.15354201048612595, "num_tokens": 55210151.0, "step": 25510 }, { "entropy": 6.429635143280029, "epoch": 2.730376157097758, "grad_norm": 1.25, "learning_rate": 0.00042632937960600454, "loss": 6.051, "mean_token_accuracy": 0.1496674232184887, "num_tokens": 55221322.0, "step": 25515 }, { "entropy": 6.3394568920135494, "epoch": 2.730911231205522, "grad_norm": 1.2421875, "learning_rate": 0.00042630108362871205, "loss": 5.9745, "mean_token_accuracy": 0.16026728898286818, "num_tokens": 55231901.0, "step": 25520 }, { "entropy": 6.440993118286133, "epoch": 2.731446305313286, "grad_norm": 1.46875, "learning_rate": 0.00042627278328262203, "loss": 6.0114, "mean_token_accuracy": 0.155671626329422, "num_tokens": 55243154.0, "step": 25525 }, { "entropy": 6.435354852676392, "epoch": 2.73198137942105, "grad_norm": 1.2890625, "learning_rate": 0.00042624447856855164, "loss": 6.0087, "mean_token_accuracy": 0.15432586893439293, "num_tokens": 55253485.0, "step": 25530 }, { "entropy": 6.496493625640869, "epoch": 2.732516453528814, "grad_norm": 1.1640625, "learning_rate": 0.00042621616948731816, "loss": 6.1003, "mean_token_accuracy": 0.14419427067041396, "num_tokens": 55264936.0, "step": 25535 }, { "entropy": 6.424218559265137, "epoch": 2.7330515276365777, "grad_norm": 1.3125, "learning_rate": 0.0004261878560397391, "loss": 6.0627, "mean_token_accuracy": 0.15414737910032272, "num_tokens": 55276138.0, "step": 25540 }, { "entropy": 6.428554201126099, "epoch": 2.7335866017443413, "grad_norm": 1.046875, "learning_rate": 0.00042615953822663195, "loss": 6.1017, "mean_token_accuracy": 0.14704363346099852, "num_tokens": 55287398.0, "step": 25545 }, { "entropy": 6.517673301696777, "epoch": 2.7341216758521054, "grad_norm": 1.0546875, "learning_rate": 0.00042613121604881426, "loss": 6.1362, "mean_token_accuracy": 0.14067264199256896, "num_tokens": 55298806.0, "step": 25550 }, { "entropy": 6.450430774688721, "epoch": 2.7346567499598695, "grad_norm": 1.09375, "learning_rate": 0.0004261028895071041, "loss": 6.0311, "mean_token_accuracy": 0.15255129635334014, "num_tokens": 55309976.0, "step": 25555 }, { "entropy": 6.466075468063354, "epoch": 2.735191824067633, "grad_norm": 1.203125, "learning_rate": 0.00042607455860231916, "loss": 6.0872, "mean_token_accuracy": 0.14783285185694695, "num_tokens": 55320806.0, "step": 25560 }, { "entropy": 6.418241882324219, "epoch": 2.7357268981753973, "grad_norm": 1.3515625, "learning_rate": 0.0004260462233352775, "loss": 6.087, "mean_token_accuracy": 0.15122041404247283, "num_tokens": 55332153.0, "step": 25565 }, { "entropy": 6.439561128616333, "epoch": 2.7362619722831614, "grad_norm": 1.203125, "learning_rate": 0.00042601788370679746, "loss": 6.0793, "mean_token_accuracy": 0.14657056778669358, "num_tokens": 55343595.0, "step": 25570 }, { "entropy": 6.4276245594024655, "epoch": 2.736797046390925, "grad_norm": 1.1015625, "learning_rate": 0.00042598953971769723, "loss": 6.0656, "mean_token_accuracy": 0.14435483440756797, "num_tokens": 55353891.0, "step": 25575 }, { "entropy": 6.4939628601074215, "epoch": 2.737332120498689, "grad_norm": 1.203125, "learning_rate": 0.0004259611913687952, "loss": 6.0097, "mean_token_accuracy": 0.15009569823741914, "num_tokens": 55364743.0, "step": 25580 }, { "entropy": 6.52032790184021, "epoch": 2.7378671946064532, "grad_norm": 1.203125, "learning_rate": 0.00042593283866091, "loss": 6.1151, "mean_token_accuracy": 0.14124570339918135, "num_tokens": 55375122.0, "step": 25585 }, { "entropy": 6.426980447769165, "epoch": 2.738402268714217, "grad_norm": 1.125, "learning_rate": 0.00042590448159486035, "loss": 6.0697, "mean_token_accuracy": 0.1450087994337082, "num_tokens": 55387281.0, "step": 25590 }, { "entropy": 6.457336950302124, "epoch": 2.738937342821981, "grad_norm": 1.1640625, "learning_rate": 0.00042587612017146496, "loss": 6.0904, "mean_token_accuracy": 0.14195430800318717, "num_tokens": 55397859.0, "step": 25595 }, { "entropy": 6.44852499961853, "epoch": 2.7394724169297446, "grad_norm": 1.125, "learning_rate": 0.00042584775439154276, "loss": 5.9934, "mean_token_accuracy": 0.15435815900564193, "num_tokens": 55408169.0, "step": 25600 }, { "entropy": 6.361451578140259, "epoch": 2.7400074910375087, "grad_norm": 1.15625, "learning_rate": 0.0004258193842559129, "loss": 5.9877, "mean_token_accuracy": 0.14957543089985847, "num_tokens": 55419342.0, "step": 25605 }, { "entropy": 6.3249797344207765, "epoch": 2.7405425651452724, "grad_norm": 1.046875, "learning_rate": 0.0004257910097653945, "loss": 5.9535, "mean_token_accuracy": 0.15536751300096513, "num_tokens": 55430271.0, "step": 25610 }, { "entropy": 6.473565578460693, "epoch": 2.7410776392530365, "grad_norm": 1.15625, "learning_rate": 0.0004257626309208069, "loss": 6.021, "mean_token_accuracy": 0.14854575842618942, "num_tokens": 55441901.0, "step": 25615 }, { "entropy": 6.395791482925415, "epoch": 2.7416127133608006, "grad_norm": 1.1484375, "learning_rate": 0.0004257342477229695, "loss": 6.0534, "mean_token_accuracy": 0.15168683230876923, "num_tokens": 55451743.0, "step": 25620 }, { "entropy": 6.432854413986206, "epoch": 2.7421477874685642, "grad_norm": 1.46875, "learning_rate": 0.00042570586017270196, "loss": 6.0243, "mean_token_accuracy": 0.15006721764802933, "num_tokens": 55462805.0, "step": 25625 }, { "entropy": 6.389247465133667, "epoch": 2.7426828615763283, "grad_norm": 1.2421875, "learning_rate": 0.00042567746827082377, "loss": 6.1115, "mean_token_accuracy": 0.1479640744626522, "num_tokens": 55474277.0, "step": 25630 }, { "entropy": 6.4561385154724125, "epoch": 2.7432179356840924, "grad_norm": 1.15625, "learning_rate": 0.0004256490720181549, "loss": 6.0112, "mean_token_accuracy": 0.14657876044511794, "num_tokens": 55485257.0, "step": 25635 }, { "entropy": 6.33825159072876, "epoch": 2.743753009791856, "grad_norm": 1.140625, "learning_rate": 0.00042562067141551523, "loss": 5.9763, "mean_token_accuracy": 0.15036061704158782, "num_tokens": 55495835.0, "step": 25640 }, { "entropy": 6.489846181869507, "epoch": 2.74428808389962, "grad_norm": 1.0859375, "learning_rate": 0.00042559226646372486, "loss": 6.1796, "mean_token_accuracy": 0.14170274659991264, "num_tokens": 55506256.0, "step": 25645 }, { "entropy": 6.486428928375244, "epoch": 2.744823158007384, "grad_norm": 1.3125, "learning_rate": 0.000425563857163604, "loss": 6.0313, "mean_token_accuracy": 0.15948477312922477, "num_tokens": 55516821.0, "step": 25650 }, { "entropy": 6.4164635181427006, "epoch": 2.745358232115148, "grad_norm": 1.1796875, "learning_rate": 0.00042553544351597286, "loss": 6.0697, "mean_token_accuracy": 0.1425837606191635, "num_tokens": 55527153.0, "step": 25655 }, { "entropy": 6.470670938491821, "epoch": 2.7458933062229116, "grad_norm": 1.2265625, "learning_rate": 0.00042550702552165195, "loss": 6.1313, "mean_token_accuracy": 0.1411615192890167, "num_tokens": 55538219.0, "step": 25660 }, { "entropy": 6.536293363571167, "epoch": 2.7464283803306757, "grad_norm": 1.1015625, "learning_rate": 0.00042547860318146183, "loss": 6.0693, "mean_token_accuracy": 0.14561992436647414, "num_tokens": 55548733.0, "step": 25665 }, { "entropy": 6.4749914646148685, "epoch": 2.74696345443844, "grad_norm": 1.3046875, "learning_rate": 0.00042545017649622314, "loss": 6.0572, "mean_token_accuracy": 0.14953542426228522, "num_tokens": 55559746.0, "step": 25670 }, { "entropy": 6.376782751083374, "epoch": 2.7474985285462035, "grad_norm": 1.1484375, "learning_rate": 0.0004254217454667569, "loss": 6.0431, "mean_token_accuracy": 0.14929199293255807, "num_tokens": 55570322.0, "step": 25675 }, { "entropy": 6.30539608001709, "epoch": 2.7480336026539676, "grad_norm": 1.125, "learning_rate": 0.0004253933100938837, "loss": 5.9438, "mean_token_accuracy": 0.15574714094400405, "num_tokens": 55580715.0, "step": 25680 }, { "entropy": 6.477630615234375, "epoch": 2.7485686767617317, "grad_norm": 1.1328125, "learning_rate": 0.0004253648703784249, "loss": 6.0305, "mean_token_accuracy": 0.15008877217769623, "num_tokens": 55591685.0, "step": 25685 }, { "entropy": 6.437804937362671, "epoch": 2.7491037508694953, "grad_norm": 1.15625, "learning_rate": 0.0004253364263212016, "loss": 6.0174, "mean_token_accuracy": 0.14492260217666625, "num_tokens": 55602288.0, "step": 25690 }, { "entropy": 6.4257549285888675, "epoch": 2.7496388249772594, "grad_norm": 1.171875, "learning_rate": 0.0004253079779230352, "loss": 6.1284, "mean_token_accuracy": 0.14752286523580552, "num_tokens": 55613011.0, "step": 25695 }, { "entropy": 6.3855335235595705, "epoch": 2.7501738990850235, "grad_norm": 1.2734375, "learning_rate": 0.0004252795251847469, "loss": 6.0398, "mean_token_accuracy": 0.1493801310658455, "num_tokens": 55623630.0, "step": 25700 }, { "entropy": 6.370765733718872, "epoch": 2.750708973192787, "grad_norm": 1.0703125, "learning_rate": 0.00042525106810715845, "loss": 6.0016, "mean_token_accuracy": 0.1563740164041519, "num_tokens": 55634764.0, "step": 25705 }, { "entropy": 6.477820873260498, "epoch": 2.7512440473005513, "grad_norm": 1.1484375, "learning_rate": 0.00042522260669109157, "loss": 6.0499, "mean_token_accuracy": 0.15210364609956742, "num_tokens": 55645085.0, "step": 25710 }, { "entropy": 6.484300136566162, "epoch": 2.751779121408315, "grad_norm": 1.21875, "learning_rate": 0.000425194140937368, "loss": 6.1454, "mean_token_accuracy": 0.1394964836537838, "num_tokens": 55656249.0, "step": 25715 }, { "entropy": 6.4998280048370365, "epoch": 2.752314195516079, "grad_norm": 1.0859375, "learning_rate": 0.00042516567084680977, "loss": 6.0942, "mean_token_accuracy": 0.1518393263220787, "num_tokens": 55668138.0, "step": 25720 }, { "entropy": 6.4903425693511965, "epoch": 2.7528492696238427, "grad_norm": 1.234375, "learning_rate": 0.0004251371964202389, "loss": 6.04, "mean_token_accuracy": 0.15156002789735795, "num_tokens": 55678747.0, "step": 25725 }, { "entropy": 6.476528024673462, "epoch": 2.753384343731607, "grad_norm": 1.140625, "learning_rate": 0.0004251087176584775, "loss": 6.1326, "mean_token_accuracy": 0.1491600140929222, "num_tokens": 55690266.0, "step": 25730 }, { "entropy": 6.437159252166748, "epoch": 2.753919417839371, "grad_norm": 1.296875, "learning_rate": 0.00042508023456234805, "loss": 6.0236, "mean_token_accuracy": 0.1483944557607174, "num_tokens": 55700229.0, "step": 25735 }, { "entropy": 6.423054265975952, "epoch": 2.7544544919471345, "grad_norm": 1.15625, "learning_rate": 0.00042505174713267286, "loss": 6.074, "mean_token_accuracy": 0.14628783166408538, "num_tokens": 55711564.0, "step": 25740 }, { "entropy": 6.439503717422485, "epoch": 2.7549895660548986, "grad_norm": 1.1875, "learning_rate": 0.0004250232553702746, "loss": 6.0228, "mean_token_accuracy": 0.1559218168258667, "num_tokens": 55722618.0, "step": 25745 }, { "entropy": 6.37799711227417, "epoch": 2.7555246401626627, "grad_norm": 1.671875, "learning_rate": 0.0004249947592759759, "loss": 5.9969, "mean_token_accuracy": 0.15584196150302887, "num_tokens": 55732828.0, "step": 25750 }, { "entropy": 6.399539756774902, "epoch": 2.7560597142704264, "grad_norm": 1.1328125, "learning_rate": 0.0004249662588505996, "loss": 5.9774, "mean_token_accuracy": 0.1494250327348709, "num_tokens": 55742283.0, "step": 25755 }, { "entropy": 6.403476762771606, "epoch": 2.7565947883781905, "grad_norm": 1.203125, "learning_rate": 0.00042493775409496867, "loss": 6.0411, "mean_token_accuracy": 0.14976274520158767, "num_tokens": 55752883.0, "step": 25760 }, { "entropy": 6.4517827987670895, "epoch": 2.757129862485954, "grad_norm": 1.34375, "learning_rate": 0.0004249092450099062, "loss": 6.0568, "mean_token_accuracy": 0.15013401955366135, "num_tokens": 55762730.0, "step": 25765 }, { "entropy": 6.311103868484497, "epoch": 2.7576649365937183, "grad_norm": 1.1875, "learning_rate": 0.0004248807315962353, "loss": 5.9962, "mean_token_accuracy": 0.1520252913236618, "num_tokens": 55774068.0, "step": 25770 }, { "entropy": 6.432100439071656, "epoch": 2.758200010701482, "grad_norm": 1.1953125, "learning_rate": 0.0004248522138547793, "loss": 6.0689, "mean_token_accuracy": 0.1418062664568424, "num_tokens": 55784896.0, "step": 25775 }, { "entropy": 6.414865493774414, "epoch": 2.758735084809246, "grad_norm": 1.203125, "learning_rate": 0.0004248236917863617, "loss": 6.0244, "mean_token_accuracy": 0.15214278548955917, "num_tokens": 55796186.0, "step": 25780 }, { "entropy": 6.412644672393799, "epoch": 2.75927015891701, "grad_norm": 1.1796875, "learning_rate": 0.00042479516539180605, "loss": 5.9686, "mean_token_accuracy": 0.16199107319116593, "num_tokens": 55806439.0, "step": 25785 }, { "entropy": 6.414120721817016, "epoch": 2.7598052330247738, "grad_norm": 1.1484375, "learning_rate": 0.000424766634671936, "loss": 6.0677, "mean_token_accuracy": 0.14124292209744455, "num_tokens": 55817955.0, "step": 25790 }, { "entropy": 6.456507301330566, "epoch": 2.760340307132538, "grad_norm": 1.3203125, "learning_rate": 0.00042473809962757553, "loss": 6.0465, "mean_token_accuracy": 0.14716726094484328, "num_tokens": 55828876.0, "step": 25795 }, { "entropy": 6.43586106300354, "epoch": 2.760875381240302, "grad_norm": 1.34375, "learning_rate": 0.0004247095602595485, "loss": 6.0036, "mean_token_accuracy": 0.15277801603078842, "num_tokens": 55839721.0, "step": 25800 }, { "entropy": 6.371204137802124, "epoch": 2.7614104553480656, "grad_norm": 1.140625, "learning_rate": 0.0004246810165686788, "loss": 6.0606, "mean_token_accuracy": 0.15058609694242478, "num_tokens": 55850427.0, "step": 25805 }, { "entropy": 6.464559412002563, "epoch": 2.7619455294558297, "grad_norm": 1.1328125, "learning_rate": 0.00042465246855579093, "loss": 6.0862, "mean_token_accuracy": 0.14228805601596833, "num_tokens": 55860245.0, "step": 25810 }, { "entropy": 6.446472454071045, "epoch": 2.762480603563594, "grad_norm": 1.1484375, "learning_rate": 0.00042462391622170897, "loss": 6.0673, "mean_token_accuracy": 0.1508305251598358, "num_tokens": 55869957.0, "step": 25815 }, { "entropy": 6.4355621337890625, "epoch": 2.7630156776713575, "grad_norm": 1.1328125, "learning_rate": 0.0004245953595672575, "loss": 6.1454, "mean_token_accuracy": 0.1406472772359848, "num_tokens": 55881159.0, "step": 25820 }, { "entropy": 6.6007133483886715, "epoch": 2.7635507517791216, "grad_norm": 1.1171875, "learning_rate": 0.000424566798593261, "loss": 6.0691, "mean_token_accuracy": 0.14426540583372116, "num_tokens": 55891830.0, "step": 25825 }, { "entropy": 6.466911125183105, "epoch": 2.7640858258868852, "grad_norm": 1.0703125, "learning_rate": 0.00042453823330054427, "loss": 6.0762, "mean_token_accuracy": 0.14225400537252425, "num_tokens": 55901904.0, "step": 25830 }, { "entropy": 6.364355087280273, "epoch": 2.7646208999946493, "grad_norm": 1.09375, "learning_rate": 0.000424509663689932, "loss": 6.0011, "mean_token_accuracy": 0.14474194422364234, "num_tokens": 55913808.0, "step": 25835 }, { "entropy": 6.415271329879761, "epoch": 2.765155974102413, "grad_norm": 1.25, "learning_rate": 0.0004244810897622492, "loss": 6.0294, "mean_token_accuracy": 0.1504080578684807, "num_tokens": 55924997.0, "step": 25840 }, { "entropy": 6.5113883972167965, "epoch": 2.765691048210177, "grad_norm": 1.453125, "learning_rate": 0.000424452511518321, "loss": 6.1361, "mean_token_accuracy": 0.14324550479650497, "num_tokens": 55935623.0, "step": 25845 }, { "entropy": 6.443820476531982, "epoch": 2.766226122317941, "grad_norm": 1.1484375, "learning_rate": 0.0004244239289589724, "loss": 6.1019, "mean_token_accuracy": 0.1478296235203743, "num_tokens": 55946733.0, "step": 25850 }, { "entropy": 6.423967504501343, "epoch": 2.766761196425705, "grad_norm": 1.2421875, "learning_rate": 0.000424395342085029, "loss": 6.1155, "mean_token_accuracy": 0.14689281582832336, "num_tokens": 55956158.0, "step": 25855 }, { "entropy": 6.474572324752808, "epoch": 2.767296270533469, "grad_norm": 1.5, "learning_rate": 0.00042436675089731603, "loss": 5.9912, "mean_token_accuracy": 0.15330372601747513, "num_tokens": 55966442.0, "step": 25860 }, { "entropy": 6.466239404678345, "epoch": 2.767831344641233, "grad_norm": 1.25, "learning_rate": 0.0004243381553966591, "loss": 6.0806, "mean_token_accuracy": 0.14939797669649124, "num_tokens": 55977314.0, "step": 25865 }, { "entropy": 6.385185813903808, "epoch": 2.7683664187489967, "grad_norm": 1.21875, "learning_rate": 0.00042430955558388396, "loss": 5.9946, "mean_token_accuracy": 0.15223354548215867, "num_tokens": 55987457.0, "step": 25870 }, { "entropy": 6.423221492767334, "epoch": 2.768901492856761, "grad_norm": 1.1640625, "learning_rate": 0.00042428095145981634, "loss": 6.0159, "mean_token_accuracy": 0.1532500207424164, "num_tokens": 55998319.0, "step": 25875 }, { "entropy": 6.392953205108642, "epoch": 2.7694365669645244, "grad_norm": 1.125, "learning_rate": 0.00042425234302528224, "loss": 5.9394, "mean_token_accuracy": 0.15218333899974823, "num_tokens": 56008654.0, "step": 25880 }, { "entropy": 6.441227436065674, "epoch": 2.7699716410722885, "grad_norm": 1.4375, "learning_rate": 0.0004242237302811077, "loss": 6.125, "mean_token_accuracy": 0.14420871809124947, "num_tokens": 56019793.0, "step": 25885 }, { "entropy": 6.475605630874634, "epoch": 2.770506715180052, "grad_norm": 1.1015625, "learning_rate": 0.000424195113228119, "loss": 6.0743, "mean_token_accuracy": 0.1509287327528, "num_tokens": 56031051.0, "step": 25890 }, { "entropy": 6.492498683929443, "epoch": 2.7710417892878163, "grad_norm": 1.1640625, "learning_rate": 0.0004241664918671423, "loss": 6.1262, "mean_token_accuracy": 0.14654675051569938, "num_tokens": 56041210.0, "step": 25895 }, { "entropy": 6.396188879013062, "epoch": 2.7715768633955804, "grad_norm": 1.15625, "learning_rate": 0.000424137866199004, "loss": 6.0037, "mean_token_accuracy": 0.1532615229487419, "num_tokens": 56051601.0, "step": 25900 }, { "entropy": 6.413284063339233, "epoch": 2.772111937503344, "grad_norm": 1.2109375, "learning_rate": 0.0004241092362245309, "loss": 5.9618, "mean_token_accuracy": 0.15736669600009917, "num_tokens": 56062669.0, "step": 25905 }, { "entropy": 6.384915113449097, "epoch": 2.772647011611108, "grad_norm": 1.125, "learning_rate": 0.00042408060194454956, "loss": 6.1136, "mean_token_accuracy": 0.14913412779569626, "num_tokens": 56074414.0, "step": 25910 }, { "entropy": 6.438897609710693, "epoch": 2.7731820857188723, "grad_norm": 1.296875, "learning_rate": 0.00042405196335988676, "loss": 6.0541, "mean_token_accuracy": 0.14428338557481765, "num_tokens": 56085428.0, "step": 25915 }, { "entropy": 6.469063854217529, "epoch": 2.773717159826636, "grad_norm": 1.2265625, "learning_rate": 0.00042402332047136943, "loss": 6.0541, "mean_token_accuracy": 0.14452765062451361, "num_tokens": 56097403.0, "step": 25920 }, { "entropy": 6.37754077911377, "epoch": 2.7742522339344, "grad_norm": 1.28125, "learning_rate": 0.0004239946732798247, "loss": 5.9623, "mean_token_accuracy": 0.15868452787399293, "num_tokens": 56107781.0, "step": 25925 }, { "entropy": 6.314821100234985, "epoch": 2.774787308042164, "grad_norm": 1.09375, "learning_rate": 0.00042396602178607973, "loss": 5.9184, "mean_token_accuracy": 0.16537774503231048, "num_tokens": 56118698.0, "step": 25930 }, { "entropy": 6.4062371253967285, "epoch": 2.7753223821499278, "grad_norm": 1.21875, "learning_rate": 0.0004239373659909618, "loss": 6.0459, "mean_token_accuracy": 0.14684186428785323, "num_tokens": 56128397.0, "step": 25935 }, { "entropy": 6.397486543655395, "epoch": 2.7758574562576914, "grad_norm": 1.1328125, "learning_rate": 0.0004239087058952984, "loss": 6.0384, "mean_token_accuracy": 0.15191538780927658, "num_tokens": 56138798.0, "step": 25940 }, { "entropy": 6.455853891372681, "epoch": 2.7763925303654555, "grad_norm": 1.125, "learning_rate": 0.000423880041499917, "loss": 5.9794, "mean_token_accuracy": 0.16300947815179825, "num_tokens": 56149936.0, "step": 25945 }, { "entropy": 6.455181455612182, "epoch": 2.7769276044732196, "grad_norm": 1.1015625, "learning_rate": 0.0004238513728056453, "loss": 6.0519, "mean_token_accuracy": 0.14964846074581145, "num_tokens": 56161433.0, "step": 25950 }, { "entropy": 6.446481704711914, "epoch": 2.7774626785809833, "grad_norm": 1.1875, "learning_rate": 0.00042382269981331116, "loss": 6.0707, "mean_token_accuracy": 0.1433508016169071, "num_tokens": 56172312.0, "step": 25955 }, { "entropy": 6.373271846771241, "epoch": 2.7779977526887474, "grad_norm": 1.2265625, "learning_rate": 0.00042379402252374244, "loss": 5.9855, "mean_token_accuracy": 0.15436504632234574, "num_tokens": 56183887.0, "step": 25960 }, { "entropy": 6.403153800964356, "epoch": 2.7785328267965115, "grad_norm": 1.2265625, "learning_rate": 0.00042376534093776727, "loss": 6.0185, "mean_token_accuracy": 0.1564489260315895, "num_tokens": 56194172.0, "step": 25965 }, { "entropy": 6.458992290496826, "epoch": 2.779067900904275, "grad_norm": 1.1875, "learning_rate": 0.0004237366550562137, "loss": 6.1362, "mean_token_accuracy": 0.14420275539159774, "num_tokens": 56204569.0, "step": 25970 }, { "entropy": 6.441669607162476, "epoch": 2.7796029750120392, "grad_norm": 1.203125, "learning_rate": 0.00042370796487991013, "loss": 6.0166, "mean_token_accuracy": 0.15280842930078506, "num_tokens": 56215875.0, "step": 25975 }, { "entropy": 6.47059588432312, "epoch": 2.7801380491198033, "grad_norm": 1.3046875, "learning_rate": 0.00042367927040968514, "loss": 6.0711, "mean_token_accuracy": 0.13782498762011527, "num_tokens": 56227633.0, "step": 25980 }, { "entropy": 6.278856658935547, "epoch": 2.780673123227567, "grad_norm": 1.125, "learning_rate": 0.0004236505716463669, "loss": 5.9493, "mean_token_accuracy": 0.15624210983514786, "num_tokens": 56239420.0, "step": 25985 }, { "entropy": 6.404437065124512, "epoch": 2.781208197335331, "grad_norm": 1.3828125, "learning_rate": 0.0004236218685907844, "loss": 6.0016, "mean_token_accuracy": 0.1480076566338539, "num_tokens": 56250538.0, "step": 25990 }, { "entropy": 6.4202343940734865, "epoch": 2.7817432714430947, "grad_norm": 1.1640625, "learning_rate": 0.0004235931612437663, "loss": 6.0775, "mean_token_accuracy": 0.146730624884367, "num_tokens": 56261423.0, "step": 25995 }, { "entropy": 6.429287576675415, "epoch": 2.782278345550859, "grad_norm": 1.34375, "learning_rate": 0.0004235644496061416, "loss": 6.0922, "mean_token_accuracy": 0.14426886811852455, "num_tokens": 56272581.0, "step": 26000 }, { "entropy": 6.458887147903442, "epoch": 2.7828134196586225, "grad_norm": 1.265625, "learning_rate": 0.0004235357336787392, "loss": 6.0192, "mean_token_accuracy": 0.15403840988874434, "num_tokens": 56283703.0, "step": 26005 }, { "entropy": 6.521402978897095, "epoch": 2.7833484937663866, "grad_norm": 1.1484375, "learning_rate": 0.00042350701346238853, "loss": 6.1323, "mean_token_accuracy": 0.14179784655570984, "num_tokens": 56294657.0, "step": 26010 }, { "entropy": 6.421674919128418, "epoch": 2.7838835678741507, "grad_norm": 1.125, "learning_rate": 0.0004234782889579185, "loss": 5.9539, "mean_token_accuracy": 0.15186866819858552, "num_tokens": 56305555.0, "step": 26015 }, { "entropy": 6.426959609985351, "epoch": 2.7844186419819144, "grad_norm": 1.1953125, "learning_rate": 0.00042344956016615885, "loss": 6.1186, "mean_token_accuracy": 0.1473462998867035, "num_tokens": 56316716.0, "step": 26020 }, { "entropy": 6.432470464706421, "epoch": 2.7849537160896785, "grad_norm": 1.1640625, "learning_rate": 0.0004234208270879389, "loss": 5.9717, "mean_token_accuracy": 0.14987516403198242, "num_tokens": 56326582.0, "step": 26025 }, { "entropy": 6.447471284866333, "epoch": 2.7854887901974426, "grad_norm": 1.140625, "learning_rate": 0.00042339208972408865, "loss": 6.0601, "mean_token_accuracy": 0.15618169754743577, "num_tokens": 56336687.0, "step": 26030 }, { "entropy": 6.364188575744629, "epoch": 2.786023864305206, "grad_norm": 1.1640625, "learning_rate": 0.0004233633480754375, "loss": 5.888, "mean_token_accuracy": 0.1612467125058174, "num_tokens": 56347493.0, "step": 26035 }, { "entropy": 6.418560409545899, "epoch": 2.7865589384129703, "grad_norm": 1.1484375, "learning_rate": 0.00042333460214281557, "loss": 5.9948, "mean_token_accuracy": 0.14950570613145828, "num_tokens": 56359259.0, "step": 26040 }, { "entropy": 6.374906349182129, "epoch": 2.787094012520734, "grad_norm": 1.125, "learning_rate": 0.00042330585192705284, "loss": 6.0223, "mean_token_accuracy": 0.14752267599105834, "num_tokens": 56370502.0, "step": 26045 }, { "entropy": 6.369175243377685, "epoch": 2.787629086628498, "grad_norm": 1.1953125, "learning_rate": 0.00042327709742897944, "loss": 6.0563, "mean_token_accuracy": 0.14704466462135315, "num_tokens": 56381047.0, "step": 26050 }, { "entropy": 6.40776834487915, "epoch": 2.7881641607362617, "grad_norm": 1.34375, "learning_rate": 0.00042324833864942576, "loss": 5.9862, "mean_token_accuracy": 0.15330395549535752, "num_tokens": 56392304.0, "step": 26055 }, { "entropy": 6.401726818084716, "epoch": 2.788699234844026, "grad_norm": 1.125, "learning_rate": 0.0004232195755892221, "loss": 5.9611, "mean_token_accuracy": 0.16093580797314644, "num_tokens": 56402480.0, "step": 26060 }, { "entropy": 6.3833600044250485, "epoch": 2.78923430895179, "grad_norm": 1.1796875, "learning_rate": 0.00042319080824919895, "loss": 6.0712, "mean_token_accuracy": 0.1508347600698471, "num_tokens": 56413659.0, "step": 26065 }, { "entropy": 6.425733613967895, "epoch": 2.7897693830595536, "grad_norm": 1.3828125, "learning_rate": 0.0004231620366301871, "loss": 6.1187, "mean_token_accuracy": 0.14508638828992843, "num_tokens": 56425272.0, "step": 26070 }, { "entropy": 6.53260235786438, "epoch": 2.7903044571673177, "grad_norm": 1.390625, "learning_rate": 0.00042313326073301733, "loss": 6.0579, "mean_token_accuracy": 0.1503555953502655, "num_tokens": 56436696.0, "step": 26075 }, { "entropy": 6.477833318710327, "epoch": 2.7908395312750818, "grad_norm": 1.0703125, "learning_rate": 0.0004231044805585204, "loss": 6.0882, "mean_token_accuracy": 0.1436576709151268, "num_tokens": 56446666.0, "step": 26080 }, { "entropy": 6.39180269241333, "epoch": 2.7913746053828454, "grad_norm": 1.234375, "learning_rate": 0.0004230756961075274, "loss": 6.0336, "mean_token_accuracy": 0.1507587678730488, "num_tokens": 56457082.0, "step": 26085 }, { "entropy": 6.378720235824585, "epoch": 2.7919096794906095, "grad_norm": 1.0859375, "learning_rate": 0.00042304690738086944, "loss": 5.9799, "mean_token_accuracy": 0.1521870255470276, "num_tokens": 56468492.0, "step": 26090 }, { "entropy": 6.441785383224487, "epoch": 2.7924447535983736, "grad_norm": 1.3984375, "learning_rate": 0.0004230181143793779, "loss": 6.0551, "mean_token_accuracy": 0.1534495547413826, "num_tokens": 56479353.0, "step": 26095 }, { "entropy": 6.439150476455689, "epoch": 2.7929798277061373, "grad_norm": 1.640625, "learning_rate": 0.00042298931710388414, "loss": 6.0529, "mean_token_accuracy": 0.149759179353714, "num_tokens": 56490105.0, "step": 26100 }, { "entropy": 6.472236633300781, "epoch": 2.7935149018139014, "grad_norm": 1.078125, "learning_rate": 0.0004229605155552195, "loss": 6.0803, "mean_token_accuracy": 0.1475442484021187, "num_tokens": 56501528.0, "step": 26105 }, { "entropy": 6.48919186592102, "epoch": 2.794049975921665, "grad_norm": 1.1640625, "learning_rate": 0.00042293170973421593, "loss": 6.1348, "mean_token_accuracy": 0.14328303709626197, "num_tokens": 56512952.0, "step": 26110 }, { "entropy": 6.501806163787842, "epoch": 2.794585050029429, "grad_norm": 1.359375, "learning_rate": 0.00042290289964170495, "loss": 6.0421, "mean_token_accuracy": 0.15625403225421905, "num_tokens": 56523332.0, "step": 26115 }, { "entropy": 6.467695331573486, "epoch": 2.795120124137193, "grad_norm": 1.3828125, "learning_rate": 0.0004228740852785185, "loss": 6.0375, "mean_token_accuracy": 0.14998308569192886, "num_tokens": 56534777.0, "step": 26120 }, { "entropy": 6.3937599658966064, "epoch": 2.795655198244957, "grad_norm": 1.1328125, "learning_rate": 0.00042284526664548866, "loss": 6.0314, "mean_token_accuracy": 0.14366142079234123, "num_tokens": 56545706.0, "step": 26125 }, { "entropy": 6.370588779449463, "epoch": 2.796190272352721, "grad_norm": 1.0703125, "learning_rate": 0.00042281644374344754, "loss": 6.0222, "mean_token_accuracy": 0.14527872279286386, "num_tokens": 56557014.0, "step": 26130 }, { "entropy": 6.445417165756226, "epoch": 2.7967253464604847, "grad_norm": 1.1171875, "learning_rate": 0.00042278761657322736, "loss": 6.0783, "mean_token_accuracy": 0.15204058587551117, "num_tokens": 56569707.0, "step": 26135 }, { "entropy": 6.4742724895477295, "epoch": 2.7972604205682488, "grad_norm": 1.109375, "learning_rate": 0.0004227587851356605, "loss": 6.0055, "mean_token_accuracy": 0.15044934898614884, "num_tokens": 56579924.0, "step": 26140 }, { "entropy": 6.5041240692138675, "epoch": 2.797795494676013, "grad_norm": 1.3359375, "learning_rate": 0.0004227299494315795, "loss": 6.0828, "mean_token_accuracy": 0.14583077430725097, "num_tokens": 56590301.0, "step": 26145 }, { "entropy": 6.4372642040252686, "epoch": 2.7983305687837765, "grad_norm": 1.1953125, "learning_rate": 0.00042270110946181693, "loss": 6.0091, "mean_token_accuracy": 0.15271706730127335, "num_tokens": 56600717.0, "step": 26150 }, { "entropy": 6.463856840133667, "epoch": 2.7988656428915406, "grad_norm": 2.765625, "learning_rate": 0.00042267226522720556, "loss": 6.058, "mean_token_accuracy": 0.14681680351495743, "num_tokens": 56611547.0, "step": 26155 }, { "entropy": 6.413233518600464, "epoch": 2.7994007169993043, "grad_norm": 1.1796875, "learning_rate": 0.0004226434167285784, "loss": 5.9598, "mean_token_accuracy": 0.15135293006896972, "num_tokens": 56622542.0, "step": 26160 }, { "entropy": 6.419681024551392, "epoch": 2.7999357911070684, "grad_norm": 1.6875, "learning_rate": 0.0004226145639667683, "loss": 6.0396, "mean_token_accuracy": 0.15508953779935836, "num_tokens": 56633359.0, "step": 26165 }, { "entropy": 6.3672102928161625, "epoch": 2.800470865214832, "grad_norm": 1.3125, "learning_rate": 0.0004225857069426083, "loss": 5.9271, "mean_token_accuracy": 0.15799694061279296, "num_tokens": 56644101.0, "step": 26170 }, { "entropy": 6.458103942871094, "epoch": 2.801005939322596, "grad_norm": 1.1015625, "learning_rate": 0.00042255684565693183, "loss": 5.9774, "mean_token_accuracy": 0.14844557791948318, "num_tokens": 56654630.0, "step": 26175 }, { "entropy": 6.389373016357422, "epoch": 2.80154101343036, "grad_norm": 1.28125, "learning_rate": 0.0004225279801105722, "loss": 5.9996, "mean_token_accuracy": 0.1511190876364708, "num_tokens": 56665826.0, "step": 26180 }, { "entropy": 6.3908380508422855, "epoch": 2.802076087538124, "grad_norm": 1.1953125, "learning_rate": 0.0004224991103043628, "loss": 6.039, "mean_token_accuracy": 0.14940351694822313, "num_tokens": 56676431.0, "step": 26185 }, { "entropy": 6.459698343276978, "epoch": 2.802611161645888, "grad_norm": 1.15625, "learning_rate": 0.00042247023623913745, "loss": 6.0262, "mean_token_accuracy": 0.15339324325323106, "num_tokens": 56687297.0, "step": 26190 }, { "entropy": 6.367177200317383, "epoch": 2.803146235753652, "grad_norm": 1.2109375, "learning_rate": 0.0004224413579157296, "loss": 6.0634, "mean_token_accuracy": 0.15312274917960167, "num_tokens": 56698392.0, "step": 26195 }, { "entropy": 6.439164924621582, "epoch": 2.8036813098614157, "grad_norm": 1.1484375, "learning_rate": 0.0004224124753349733, "loss": 6.0922, "mean_token_accuracy": 0.1526595890522003, "num_tokens": 56710588.0, "step": 26200 }, { "entropy": 6.354989147186279, "epoch": 2.80421638396918, "grad_norm": 1.1875, "learning_rate": 0.0004223835884977025, "loss": 5.9161, "mean_token_accuracy": 0.1574145197868347, "num_tokens": 56723143.0, "step": 26205 }, { "entropy": 6.426775741577148, "epoch": 2.804751458076944, "grad_norm": 1.109375, "learning_rate": 0.0004223546974047513, "loss": 6.0191, "mean_token_accuracy": 0.15531293153762818, "num_tokens": 56734097.0, "step": 26210 }, { "entropy": 6.447193622589111, "epoch": 2.8052865321847076, "grad_norm": 1.1328125, "learning_rate": 0.0004223258020569539, "loss": 6.0724, "mean_token_accuracy": 0.14504825249314307, "num_tokens": 56745311.0, "step": 26215 }, { "entropy": 6.452460050582886, "epoch": 2.8058216062924712, "grad_norm": 2.859375, "learning_rate": 0.0004222969024551447, "loss": 6.1228, "mean_token_accuracy": 0.15037810504436494, "num_tokens": 56755495.0, "step": 26220 }, { "entropy": 6.4384236335754395, "epoch": 2.8063566804002353, "grad_norm": 1.140625, "learning_rate": 0.00042226799860015817, "loss": 5.9966, "mean_token_accuracy": 0.15909594893455506, "num_tokens": 56766107.0, "step": 26225 }, { "entropy": 6.411249256134033, "epoch": 2.8068917545079994, "grad_norm": 1.078125, "learning_rate": 0.0004222390904928288, "loss": 6.0002, "mean_token_accuracy": 0.15537684857845308, "num_tokens": 56776877.0, "step": 26230 }, { "entropy": 6.433188629150391, "epoch": 2.807426828615763, "grad_norm": 1.2265625, "learning_rate": 0.00042221017813399146, "loss": 6.0797, "mean_token_accuracy": 0.15274036228656768, "num_tokens": 56786439.0, "step": 26235 }, { "entropy": 6.394668245315552, "epoch": 2.807961902723527, "grad_norm": 1.1015625, "learning_rate": 0.0004221812615244809, "loss": 6.085, "mean_token_accuracy": 0.1435970276594162, "num_tokens": 56797433.0, "step": 26240 }, { "entropy": 6.5347984790802, "epoch": 2.8084969768312913, "grad_norm": 1.296875, "learning_rate": 0.00042215234066513203, "loss": 6.0985, "mean_token_accuracy": 0.14584537744522094, "num_tokens": 56808270.0, "step": 26245 }, { "entropy": 6.486695766448975, "epoch": 2.809032050939055, "grad_norm": 1.1328125, "learning_rate": 0.00042212341555678, "loss": 6.0464, "mean_token_accuracy": 0.14755429029464723, "num_tokens": 56818590.0, "step": 26250 }, { "entropy": 6.395121812820435, "epoch": 2.809567125046819, "grad_norm": 1.3203125, "learning_rate": 0.0004220944862002601, "loss": 6.0743, "mean_token_accuracy": 0.14349693208932876, "num_tokens": 56828799.0, "step": 26255 }, { "entropy": 6.4509632110595705, "epoch": 2.810102199154583, "grad_norm": 1.1953125, "learning_rate": 0.00042206555259640744, "loss": 6.0575, "mean_token_accuracy": 0.14447470605373383, "num_tokens": 56839409.0, "step": 26260 }, { "entropy": 6.3562744617462155, "epoch": 2.810637273262347, "grad_norm": 1.0859375, "learning_rate": 0.00042203661474605775, "loss": 5.9809, "mean_token_accuracy": 0.15901046395301818, "num_tokens": 56849650.0, "step": 26265 }, { "entropy": 6.404301595687866, "epoch": 2.811172347370111, "grad_norm": 1.2109375, "learning_rate": 0.0004220076726500464, "loss": 6.0662, "mean_token_accuracy": 0.14773694723844527, "num_tokens": 56860437.0, "step": 26270 }, { "entropy": 6.469612503051758, "epoch": 2.8117074214778746, "grad_norm": 1.1875, "learning_rate": 0.00042197872630920927, "loss": 6.05, "mean_token_accuracy": 0.15329967737197875, "num_tokens": 56870314.0, "step": 26275 }, { "entropy": 6.4698954105377195, "epoch": 2.8122424955856387, "grad_norm": 1.2578125, "learning_rate": 0.00042194977572438194, "loss": 6.0576, "mean_token_accuracy": 0.14935247749090194, "num_tokens": 56881675.0, "step": 26280 }, { "entropy": 6.467679023742676, "epoch": 2.8127775696934023, "grad_norm": 1.1171875, "learning_rate": 0.00042192082089640055, "loss": 6.1217, "mean_token_accuracy": 0.14070313572883605, "num_tokens": 56893148.0, "step": 26285 }, { "entropy": 6.469432544708252, "epoch": 2.8133126438011664, "grad_norm": 1.3984375, "learning_rate": 0.0004218918618261011, "loss": 5.9625, "mean_token_accuracy": 0.15965280681848526, "num_tokens": 56904008.0, "step": 26290 }, { "entropy": 6.425285863876343, "epoch": 2.8138477179089305, "grad_norm": 1.4453125, "learning_rate": 0.00042186289851431976, "loss": 6.0114, "mean_token_accuracy": 0.15042104423046113, "num_tokens": 56914731.0, "step": 26295 }, { "entropy": 6.453146648406983, "epoch": 2.814382792016694, "grad_norm": 1.5546875, "learning_rate": 0.00042183393096189285, "loss": 6.1492, "mean_token_accuracy": 0.14326153546571732, "num_tokens": 56926037.0, "step": 26300 }, { "entropy": 6.337903356552124, "epoch": 2.8149178661244583, "grad_norm": 1.3046875, "learning_rate": 0.00042180495916965686, "loss": 5.9398, "mean_token_accuracy": 0.16146292984485627, "num_tokens": 56936456.0, "step": 26305 }, { "entropy": 6.434628009796143, "epoch": 2.8154529402322224, "grad_norm": 1.1640625, "learning_rate": 0.0004217759831384483, "loss": 5.9886, "mean_token_accuracy": 0.15641989186406136, "num_tokens": 56947929.0, "step": 26310 }, { "entropy": 6.406024360656739, "epoch": 2.815988014339986, "grad_norm": 1.1875, "learning_rate": 0.00042174700286910376, "loss": 5.9904, "mean_token_accuracy": 0.1581709712743759, "num_tokens": 56958153.0, "step": 26315 }, { "entropy": 6.469569826126099, "epoch": 2.81652308844775, "grad_norm": 1.1640625, "learning_rate": 0.0004217180183624602, "loss": 6.0666, "mean_token_accuracy": 0.14834050983190536, "num_tokens": 56968609.0, "step": 26320 }, { "entropy": 6.478921031951904, "epoch": 2.817058162555514, "grad_norm": 1.1875, "learning_rate": 0.0004216890296193545, "loss": 6.0752, "mean_token_accuracy": 0.15596452951431275, "num_tokens": 56978434.0, "step": 26325 }, { "entropy": 6.400845956802368, "epoch": 2.817593236663278, "grad_norm": 1.2734375, "learning_rate": 0.0004216600366406236, "loss": 6.0152, "mean_token_accuracy": 0.15164154171943664, "num_tokens": 56988826.0, "step": 26330 }, { "entropy": 6.378601503372193, "epoch": 2.8181283107710415, "grad_norm": 1.1015625, "learning_rate": 0.00042163103942710487, "loss": 6.0524, "mean_token_accuracy": 0.14799215495586396, "num_tokens": 57000385.0, "step": 26335 }, { "entropy": 6.337564897537232, "epoch": 2.8186633848788056, "grad_norm": 1.7265625, "learning_rate": 0.0004216020379796354, "loss": 6.0074, "mean_token_accuracy": 0.16381412819027902, "num_tokens": 57012137.0, "step": 26340 }, { "entropy": 6.459012174606324, "epoch": 2.8191984589865697, "grad_norm": 1.3828125, "learning_rate": 0.00042157303229905277, "loss": 6.1013, "mean_token_accuracy": 0.1492543637752533, "num_tokens": 57022533.0, "step": 26345 }, { "entropy": 6.499421882629394, "epoch": 2.8197335330943334, "grad_norm": 1.1796875, "learning_rate": 0.00042154402238619434, "loss": 6.0785, "mean_token_accuracy": 0.14749213978648185, "num_tokens": 57034438.0, "step": 26350 }, { "entropy": 6.470699071884155, "epoch": 2.8202686072020975, "grad_norm": 2.265625, "learning_rate": 0.00042151500824189785, "loss": 6.0944, "mean_token_accuracy": 0.1473413124680519, "num_tokens": 57046343.0, "step": 26355 }, { "entropy": 6.453160429000855, "epoch": 2.8208036813098616, "grad_norm": 1.0, "learning_rate": 0.00042148598986700117, "loss": 6.0663, "mean_token_accuracy": 0.14620157182216645, "num_tokens": 57058269.0, "step": 26360 }, { "entropy": 6.411958503723144, "epoch": 2.8213387554176252, "grad_norm": 1.25, "learning_rate": 0.00042145696726234207, "loss": 6.019, "mean_token_accuracy": 0.15512288808822633, "num_tokens": 57069192.0, "step": 26365 }, { "entropy": 6.482750320434571, "epoch": 2.8218738295253893, "grad_norm": 1.21875, "learning_rate": 0.0004214279404287586, "loss": 6.0665, "mean_token_accuracy": 0.15206675976514816, "num_tokens": 57080021.0, "step": 26370 }, { "entropy": 6.400658655166626, "epoch": 2.8224089036331534, "grad_norm": 1.171875, "learning_rate": 0.0004213989093670889, "loss": 5.9775, "mean_token_accuracy": 0.15042894184589387, "num_tokens": 57090336.0, "step": 26375 }, { "entropy": 6.367533254623413, "epoch": 2.822943977740917, "grad_norm": 1.1171875, "learning_rate": 0.0004213698740781713, "loss": 6.0344, "mean_token_accuracy": 0.15316496342420577, "num_tokens": 57101942.0, "step": 26380 }, { "entropy": 6.409625911712647, "epoch": 2.823479051848681, "grad_norm": 1.1640625, "learning_rate": 0.0004213408345628442, "loss": 5.9928, "mean_token_accuracy": 0.15230459123849868, "num_tokens": 57112353.0, "step": 26385 }, { "entropy": 6.296683311462402, "epoch": 2.824014125956445, "grad_norm": 1.234375, "learning_rate": 0.000421311790821946, "loss": 5.8886, "mean_token_accuracy": 0.1791028618812561, "num_tokens": 57123796.0, "step": 26390 }, { "entropy": 6.427670907974243, "epoch": 2.824549200064209, "grad_norm": 1.375, "learning_rate": 0.00042128274285631545, "loss": 6.0366, "mean_token_accuracy": 0.1501665234565735, "num_tokens": 57134463.0, "step": 26395 }, { "entropy": 6.385494089126587, "epoch": 2.8250842741719726, "grad_norm": 1.171875, "learning_rate": 0.00042125369066679124, "loss": 5.9582, "mean_token_accuracy": 0.15315476357936858, "num_tokens": 57146964.0, "step": 26400 }, { "entropy": 6.468384552001953, "epoch": 2.8256193482797367, "grad_norm": 1.21875, "learning_rate": 0.00042122463425421224, "loss": 6.0392, "mean_token_accuracy": 0.14576466307044028, "num_tokens": 57157322.0, "step": 26405 }, { "entropy": 6.382465791702271, "epoch": 2.826154422387501, "grad_norm": 1.171875, "learning_rate": 0.0004211955736194175, "loss": 5.9468, "mean_token_accuracy": 0.15780599564313888, "num_tokens": 57168758.0, "step": 26410 }, { "entropy": 6.398380136489868, "epoch": 2.8266894964952645, "grad_norm": 1.140625, "learning_rate": 0.00042116650876324616, "loss": 6.001, "mean_token_accuracy": 0.15427615046501159, "num_tokens": 57180322.0, "step": 26415 }, { "entropy": 6.41349687576294, "epoch": 2.8272245706030286, "grad_norm": 1.1328125, "learning_rate": 0.0004211374396865373, "loss": 6.0272, "mean_token_accuracy": 0.14819267392158508, "num_tokens": 57190836.0, "step": 26420 }, { "entropy": 6.36381311416626, "epoch": 2.8277596447107927, "grad_norm": 1.109375, "learning_rate": 0.0004211083663901305, "loss": 6.0015, "mean_token_accuracy": 0.15367063581943513, "num_tokens": 57202439.0, "step": 26425 }, { "entropy": 6.490589761734009, "epoch": 2.8282947188185563, "grad_norm": 1.8125, "learning_rate": 0.0004210792888748651, "loss": 6.1876, "mean_token_accuracy": 0.13698135167360306, "num_tokens": 57213335.0, "step": 26430 }, { "entropy": 6.464270114898682, "epoch": 2.8288297929263204, "grad_norm": 1.1171875, "learning_rate": 0.00042105020714158076, "loss": 6.0557, "mean_token_accuracy": 0.14554350972175598, "num_tokens": 57223840.0, "step": 26435 }, { "entropy": 6.436989593505859, "epoch": 2.829364867034084, "grad_norm": 1.171875, "learning_rate": 0.00042102112119111725, "loss": 6.0581, "mean_token_accuracy": 0.14175086393952369, "num_tokens": 57234702.0, "step": 26440 }, { "entropy": 6.332023239135742, "epoch": 2.829899941141848, "grad_norm": 1.203125, "learning_rate": 0.0004209920310243144, "loss": 5.9782, "mean_token_accuracy": 0.15748982429504393, "num_tokens": 57247415.0, "step": 26445 }, { "entropy": 6.385210418701172, "epoch": 2.830435015249612, "grad_norm": 1.234375, "learning_rate": 0.0004209629366420121, "loss": 6.0091, "mean_token_accuracy": 0.15433283820748328, "num_tokens": 57257768.0, "step": 26450 }, { "entropy": 6.505837678909302, "epoch": 2.830970089357376, "grad_norm": 1.28125, "learning_rate": 0.0004209338380450506, "loss": 6.1948, "mean_token_accuracy": 0.14097389876842498, "num_tokens": 57268114.0, "step": 26455 }, { "entropy": 6.484896898269653, "epoch": 2.83150516346514, "grad_norm": 1.1015625, "learning_rate": 0.00042090473523426994, "loss": 6.0809, "mean_token_accuracy": 0.14675534069538115, "num_tokens": 57278680.0, "step": 26460 }, { "entropy": 6.498466634750367, "epoch": 2.8320402375729037, "grad_norm": 1.1953125, "learning_rate": 0.00042087562821051055, "loss": 6.109, "mean_token_accuracy": 0.14393219649791716, "num_tokens": 57289823.0, "step": 26465 }, { "entropy": 6.427369689941406, "epoch": 2.832575311680668, "grad_norm": 1.03125, "learning_rate": 0.00042084651697461297, "loss": 6.0216, "mean_token_accuracy": 0.14882372915744782, "num_tokens": 57300137.0, "step": 26470 }, { "entropy": 6.400393676757813, "epoch": 2.833110385788432, "grad_norm": 1.0390625, "learning_rate": 0.00042081740152741763, "loss": 5.9434, "mean_token_accuracy": 0.16098742187023163, "num_tokens": 57311160.0, "step": 26475 }, { "entropy": 6.400449657440186, "epoch": 2.8336454598961955, "grad_norm": 1.078125, "learning_rate": 0.0004207882818697654, "loss": 6.0423, "mean_token_accuracy": 0.1490056574344635, "num_tokens": 57322708.0, "step": 26480 }, { "entropy": 6.414525842666626, "epoch": 2.8341805340039596, "grad_norm": 1.125, "learning_rate": 0.000420759158002497, "loss": 5.9982, "mean_token_accuracy": 0.15236240327358247, "num_tokens": 57333788.0, "step": 26485 }, { "entropy": 6.450986528396607, "epoch": 2.8347156081117237, "grad_norm": 1.1328125, "learning_rate": 0.00042073002992645337, "loss": 6.0377, "mean_token_accuracy": 0.15622793436050414, "num_tokens": 57344806.0, "step": 26490 }, { "entropy": 6.469390726089477, "epoch": 2.8352506822194874, "grad_norm": 1.21875, "learning_rate": 0.0004207008976424756, "loss": 6.0986, "mean_token_accuracy": 0.14586670994758605, "num_tokens": 57355086.0, "step": 26495 }, { "entropy": 6.382518625259399, "epoch": 2.835785756327251, "grad_norm": 1.25, "learning_rate": 0.0004206717611514049, "loss": 5.9287, "mean_token_accuracy": 0.1586865097284317, "num_tokens": 57364837.0, "step": 26500 }, { "entropy": 6.403486156463623, "epoch": 2.836320830435015, "grad_norm": 1.1796875, "learning_rate": 0.0004206426204540825, "loss": 6.0535, "mean_token_accuracy": 0.1502322018146515, "num_tokens": 57376049.0, "step": 26505 }, { "entropy": 6.4489173412323, "epoch": 2.8368559045427792, "grad_norm": 1.2890625, "learning_rate": 0.00042061347555135, "loss": 6.0787, "mean_token_accuracy": 0.1436118006706238, "num_tokens": 57387829.0, "step": 26510 }, { "entropy": 6.458997583389282, "epoch": 2.837390978650543, "grad_norm": 1.25, "learning_rate": 0.0004205843264440488, "loss": 5.9971, "mean_token_accuracy": 0.15300317704677582, "num_tokens": 57397165.0, "step": 26515 }, { "entropy": 6.392493343353271, "epoch": 2.837926052758307, "grad_norm": 1.1328125, "learning_rate": 0.00042055517313302064, "loss": 6.0106, "mean_token_accuracy": 0.1520601987838745, "num_tokens": 57408602.0, "step": 26520 }, { "entropy": 6.389436435699463, "epoch": 2.838461126866071, "grad_norm": 1.1171875, "learning_rate": 0.0004205260156191073, "loss": 5.9609, "mean_token_accuracy": 0.15610310882329942, "num_tokens": 57419393.0, "step": 26525 }, { "entropy": 6.384090375900269, "epoch": 2.8389962009738348, "grad_norm": 1.109375, "learning_rate": 0.00042049685390315074, "loss": 6.0686, "mean_token_accuracy": 0.14963267594575883, "num_tokens": 57431238.0, "step": 26530 }, { "entropy": 6.448880290985107, "epoch": 2.839531275081599, "grad_norm": 1.5390625, "learning_rate": 0.00042046768798599293, "loss": 6.0094, "mean_token_accuracy": 0.1601277098059654, "num_tokens": 57442080.0, "step": 26535 }, { "entropy": 6.407636880874634, "epoch": 2.840066349189363, "grad_norm": 1.6875, "learning_rate": 0.0004204385178684761, "loss": 6.0283, "mean_token_accuracy": 0.15068115368485452, "num_tokens": 57452539.0, "step": 26540 }, { "entropy": 6.436146354675293, "epoch": 2.8406014232971266, "grad_norm": 1.1328125, "learning_rate": 0.00042040934355144245, "loss": 6.1496, "mean_token_accuracy": 0.14302660301327705, "num_tokens": 57464936.0, "step": 26545 }, { "entropy": 6.438657236099243, "epoch": 2.8411364974048907, "grad_norm": 2.421875, "learning_rate": 0.0004203801650357346, "loss": 6.028, "mean_token_accuracy": 0.15072648823261262, "num_tokens": 57477460.0, "step": 26550 }, { "entropy": 6.457589626312256, "epoch": 2.8416715715126544, "grad_norm": 1.2578125, "learning_rate": 0.0004203509823221947, "loss": 6.0556, "mean_token_accuracy": 0.1504028744995594, "num_tokens": 57487707.0, "step": 26555 }, { "entropy": 6.40608811378479, "epoch": 2.8422066456204185, "grad_norm": 1.203125, "learning_rate": 0.0004203217954116657, "loss": 6.0787, "mean_token_accuracy": 0.14950546324253083, "num_tokens": 57498107.0, "step": 26560 }, { "entropy": 6.437542152404785, "epoch": 2.842741719728182, "grad_norm": 1.15625, "learning_rate": 0.00042029260430499033, "loss": 5.9793, "mean_token_accuracy": 0.14859019666910173, "num_tokens": 57509035.0, "step": 26565 }, { "entropy": 6.410235452651977, "epoch": 2.8432767938359462, "grad_norm": 1.3359375, "learning_rate": 0.00042026340900301135, "loss": 6.081, "mean_token_accuracy": 0.1445617437362671, "num_tokens": 57521234.0, "step": 26570 }, { "entropy": 6.414348936080932, "epoch": 2.8438118679437103, "grad_norm": 2.53125, "learning_rate": 0.0004202342095065719, "loss": 5.9914, "mean_token_accuracy": 0.15504412353038788, "num_tokens": 57532294.0, "step": 26575 }, { "entropy": 6.470386123657226, "epoch": 2.844346942051474, "grad_norm": 1.28125, "learning_rate": 0.000420205005816515, "loss": 6.0167, "mean_token_accuracy": 0.15683928579092027, "num_tokens": 57542047.0, "step": 26580 }, { "entropy": 6.353037595748901, "epoch": 2.844882016159238, "grad_norm": 1.1796875, "learning_rate": 0.000420175797933684, "loss": 6.0224, "mean_token_accuracy": 0.15064765363931656, "num_tokens": 57553254.0, "step": 26585 }, { "entropy": 6.3797187328338625, "epoch": 2.845417090267002, "grad_norm": 1.1171875, "learning_rate": 0.00042014658585892223, "loss": 5.9715, "mean_token_accuracy": 0.16147678792476655, "num_tokens": 57564321.0, "step": 26590 }, { "entropy": 6.345517015457153, "epoch": 2.845952164374766, "grad_norm": 1.328125, "learning_rate": 0.00042011736959307323, "loss": 5.9342, "mean_token_accuracy": 0.15159724205732344, "num_tokens": 57575018.0, "step": 26595 }, { "entropy": 6.385954093933106, "epoch": 2.84648723848253, "grad_norm": 1.2734375, "learning_rate": 0.00042008814913698054, "loss": 6.0149, "mean_token_accuracy": 0.15120517313480378, "num_tokens": 57585698.0, "step": 26600 }, { "entropy": 6.409604167938232, "epoch": 2.8470223125902936, "grad_norm": 1.09375, "learning_rate": 0.0004200589244914879, "loss": 5.9872, "mean_token_accuracy": 0.15515661984682083, "num_tokens": 57595363.0, "step": 26605 }, { "entropy": 6.3503913402557375, "epoch": 2.8475573866980577, "grad_norm": 1.25, "learning_rate": 0.00042002969565743925, "loss": 5.996, "mean_token_accuracy": 0.16248847618699075, "num_tokens": 57605908.0, "step": 26610 }, { "entropy": 6.310200881958008, "epoch": 2.8480924608058213, "grad_norm": 1.09375, "learning_rate": 0.0004200004626356785, "loss": 5.9436, "mean_token_accuracy": 0.15958615243434907, "num_tokens": 57616172.0, "step": 26615 }, { "entropy": 6.408188056945801, "epoch": 2.8486275349135854, "grad_norm": 1.2265625, "learning_rate": 0.00041997122542704974, "loss": 5.9952, "mean_token_accuracy": 0.15232954770326615, "num_tokens": 57626770.0, "step": 26620 }, { "entropy": 6.360273742675782, "epoch": 2.8491626090213495, "grad_norm": 1.1328125, "learning_rate": 0.0004199419840323972, "loss": 5.9103, "mean_token_accuracy": 0.16150974929332734, "num_tokens": 57636576.0, "step": 26625 }, { "entropy": 6.303816223144532, "epoch": 2.849697683129113, "grad_norm": 1.296875, "learning_rate": 0.00041991273845256536, "loss": 5.9971, "mean_token_accuracy": 0.15867117643356324, "num_tokens": 57646431.0, "step": 26630 }, { "entropy": 6.354286861419678, "epoch": 2.8502327572368773, "grad_norm": 1.6015625, "learning_rate": 0.00041988348868839836, "loss": 5.9978, "mean_token_accuracy": 0.1539828896522522, "num_tokens": 57657412.0, "step": 26635 }, { "entropy": 6.45865387916565, "epoch": 2.8507678313446414, "grad_norm": 1.09375, "learning_rate": 0.0004198542347407412, "loss": 6.0298, "mean_token_accuracy": 0.15559379905462264, "num_tokens": 57667434.0, "step": 26640 }, { "entropy": 6.401463174819947, "epoch": 2.851302905452405, "grad_norm": 1.2109375, "learning_rate": 0.0004198249766104382, "loss": 6.0464, "mean_token_accuracy": 0.15440521091222764, "num_tokens": 57677640.0, "step": 26645 }, { "entropy": 6.408425569534302, "epoch": 2.851837979560169, "grad_norm": 1.171875, "learning_rate": 0.0004197957142983344, "loss": 6.0351, "mean_token_accuracy": 0.15036824494600295, "num_tokens": 57687909.0, "step": 26650 }, { "entropy": 6.488574838638305, "epoch": 2.8523730536679333, "grad_norm": 1.2578125, "learning_rate": 0.0004197664478052747, "loss": 6.1527, "mean_token_accuracy": 0.1438972160220146, "num_tokens": 57700374.0, "step": 26655 }, { "entropy": 6.481727600097656, "epoch": 2.852908127775697, "grad_norm": 1.1875, "learning_rate": 0.0004197371771321042, "loss": 6.0284, "mean_token_accuracy": 0.1529959946870804, "num_tokens": 57711577.0, "step": 26660 }, { "entropy": 6.341199541091919, "epoch": 2.853443201883461, "grad_norm": 1.1484375, "learning_rate": 0.00041970790227966804, "loss": 5.943, "mean_token_accuracy": 0.1603742554783821, "num_tokens": 57721259.0, "step": 26665 }, { "entropy": 6.35086989402771, "epoch": 2.8539782759912247, "grad_norm": 1.2578125, "learning_rate": 0.00041967862324881154, "loss": 6.0149, "mean_token_accuracy": 0.15057576596736907, "num_tokens": 57731499.0, "step": 26670 }, { "entropy": 6.474545526504516, "epoch": 2.8545133500989888, "grad_norm": 1.28125, "learning_rate": 0.0004196493400403801, "loss": 6.1071, "mean_token_accuracy": 0.14337437376379966, "num_tokens": 57742343.0, "step": 26675 }, { "entropy": 6.468021583557129, "epoch": 2.8550484242067524, "grad_norm": 1.296875, "learning_rate": 0.0004196200526552193, "loss": 6.0299, "mean_token_accuracy": 0.15668390989303588, "num_tokens": 57752942.0, "step": 26680 }, { "entropy": 6.479112720489502, "epoch": 2.8555834983145165, "grad_norm": 1.0703125, "learning_rate": 0.0004195907610941748, "loss": 6.0438, "mean_token_accuracy": 0.15321232080459596, "num_tokens": 57763623.0, "step": 26685 }, { "entropy": 6.334421682357788, "epoch": 2.8561185724222806, "grad_norm": 1.1640625, "learning_rate": 0.0004195614653580924, "loss": 6.0258, "mean_token_accuracy": 0.1475632146000862, "num_tokens": 57774538.0, "step": 26690 }, { "entropy": 6.361044788360596, "epoch": 2.8566536465300443, "grad_norm": 1.234375, "learning_rate": 0.00041953216544781796, "loss": 6.0153, "mean_token_accuracy": 0.15029519498348237, "num_tokens": 57785420.0, "step": 26695 }, { "entropy": 6.420391607284546, "epoch": 2.8571887206378084, "grad_norm": 1.1953125, "learning_rate": 0.00041950286136419756, "loss": 6.0163, "mean_token_accuracy": 0.14479026794433594, "num_tokens": 57796488.0, "step": 26700 }, { "entropy": 6.480253791809082, "epoch": 2.8577237947455725, "grad_norm": 1.171875, "learning_rate": 0.00041947355310807737, "loss": 6.0123, "mean_token_accuracy": 0.1494418740272522, "num_tokens": 57806391.0, "step": 26705 }, { "entropy": 6.378093719482422, "epoch": 2.858258868853336, "grad_norm": 1.546875, "learning_rate": 0.00041944424068030364, "loss": 6.0517, "mean_token_accuracy": 0.14750756174325944, "num_tokens": 57817410.0, "step": 26710 }, { "entropy": 6.43929352760315, "epoch": 2.8587939429611002, "grad_norm": 1.109375, "learning_rate": 0.00041941492408172277, "loss": 6.0654, "mean_token_accuracy": 0.14923201352357865, "num_tokens": 57828582.0, "step": 26715 }, { "entropy": 6.347782039642334, "epoch": 2.859329017068864, "grad_norm": 1.1953125, "learning_rate": 0.00041938560331318124, "loss": 5.9856, "mean_token_accuracy": 0.16159299165010452, "num_tokens": 57838962.0, "step": 26720 }, { "entropy": 6.4341823101043705, "epoch": 2.859864091176628, "grad_norm": 1.2734375, "learning_rate": 0.0004193562783755257, "loss": 6.0343, "mean_token_accuracy": 0.15648251697421073, "num_tokens": 57849335.0, "step": 26725 }, { "entropy": 6.452866268157959, "epoch": 2.8603991652843916, "grad_norm": 1.265625, "learning_rate": 0.0004193269492696029, "loss": 6.0243, "mean_token_accuracy": 0.15065740644931794, "num_tokens": 57860904.0, "step": 26730 }, { "entropy": 6.449029970169067, "epoch": 2.8609342393921557, "grad_norm": 1.171875, "learning_rate": 0.0004192976159962597, "loss": 6.0281, "mean_token_accuracy": 0.1481325715780258, "num_tokens": 57870861.0, "step": 26735 }, { "entropy": 6.354551792144775, "epoch": 2.86146931349992, "grad_norm": 1.078125, "learning_rate": 0.0004192682785563432, "loss": 6.05, "mean_token_accuracy": 0.14433916807174682, "num_tokens": 57881590.0, "step": 26740 }, { "entropy": 6.410019636154175, "epoch": 2.8620043876076835, "grad_norm": 1.0546875, "learning_rate": 0.0004192389369507004, "loss": 6.0123, "mean_token_accuracy": 0.15093303620815277, "num_tokens": 57892736.0, "step": 26745 }, { "entropy": 6.542281436920166, "epoch": 2.8625394617154476, "grad_norm": 1.0546875, "learning_rate": 0.0004192095911801785, "loss": 6.0954, "mean_token_accuracy": 0.1412319876253605, "num_tokens": 57904340.0, "step": 26750 }, { "entropy": 6.458233070373535, "epoch": 2.8630745358232117, "grad_norm": 1.09375, "learning_rate": 0.000419180241245625, "loss": 6.0322, "mean_token_accuracy": 0.15415556877851486, "num_tokens": 57916369.0, "step": 26755 }, { "entropy": 6.366694164276123, "epoch": 2.8636096099309754, "grad_norm": 1.109375, "learning_rate": 0.0004191508871478873, "loss": 6.093, "mean_token_accuracy": 0.14483662545681, "num_tokens": 57926867.0, "step": 26760 }, { "entropy": 6.406448221206665, "epoch": 2.8641446840387395, "grad_norm": 1.109375, "learning_rate": 0.00041912152888781283, "loss": 5.9696, "mean_token_accuracy": 0.1496852308511734, "num_tokens": 57938408.0, "step": 26765 }, { "entropy": 6.488473749160766, "epoch": 2.8646797581465036, "grad_norm": 1.140625, "learning_rate": 0.00041909216646624967, "loss": 5.9853, "mean_token_accuracy": 0.1590641990303993, "num_tokens": 57948821.0, "step": 26770 }, { "entropy": 6.411574125289917, "epoch": 2.865214832254267, "grad_norm": 0.99609375, "learning_rate": 0.0004190627998840453, "loss": 6.0908, "mean_token_accuracy": 0.15112300589680672, "num_tokens": 57959589.0, "step": 26775 }, { "entropy": 6.400305986404419, "epoch": 2.8657499063620313, "grad_norm": 1.1484375, "learning_rate": 0.0004190334291420479, "loss": 6.0213, "mean_token_accuracy": 0.14814646989107133, "num_tokens": 57970508.0, "step": 26780 }, { "entropy": 6.4455334663391115, "epoch": 2.866284980469795, "grad_norm": 1.1328125, "learning_rate": 0.0004190040542411055, "loss": 6.0105, "mean_token_accuracy": 0.15378978252410888, "num_tokens": 57980411.0, "step": 26785 }, { "entropy": 6.424951362609863, "epoch": 2.866820054577559, "grad_norm": 1.109375, "learning_rate": 0.00041897467518206614, "loss": 6.0366, "mean_token_accuracy": 0.1573548808693886, "num_tokens": 57991457.0, "step": 26790 }, { "entropy": 6.458602666854858, "epoch": 2.8673551286853227, "grad_norm": 1.140625, "learning_rate": 0.0004189452919657784, "loss": 6.1027, "mean_token_accuracy": 0.13983291909098625, "num_tokens": 58001860.0, "step": 26795 }, { "entropy": 6.472284555435181, "epoch": 2.867890202793087, "grad_norm": 1.1796875, "learning_rate": 0.00041891590459309055, "loss": 6.0901, "mean_token_accuracy": 0.14592931792140007, "num_tokens": 58011958.0, "step": 26800 }, { "entropy": 6.407073545455932, "epoch": 2.868425276900851, "grad_norm": 1.0859375, "learning_rate": 0.00041888651306485117, "loss": 5.9973, "mean_token_accuracy": 0.153120244294405, "num_tokens": 58022216.0, "step": 26805 }, { "entropy": 6.403811883926392, "epoch": 2.8689603510086146, "grad_norm": 1.1328125, "learning_rate": 0.00041885711738190895, "loss": 6.0164, "mean_token_accuracy": 0.15083375424146653, "num_tokens": 58032502.0, "step": 26810 }, { "entropy": 6.372001981735229, "epoch": 2.8694954251163787, "grad_norm": 1.2109375, "learning_rate": 0.0004188277175451126, "loss": 6.0532, "mean_token_accuracy": 0.1517692118883133, "num_tokens": 58043944.0, "step": 26815 }, { "entropy": 6.443247604370117, "epoch": 2.8700304992241428, "grad_norm": 1.140625, "learning_rate": 0.00041879831355531123, "loss": 6.1012, "mean_token_accuracy": 0.14562223106622696, "num_tokens": 58055857.0, "step": 26820 }, { "entropy": 6.3814051151275635, "epoch": 2.8705655733319064, "grad_norm": 1.4375, "learning_rate": 0.0004187689054133537, "loss": 6.0435, "mean_token_accuracy": 0.15365127250552177, "num_tokens": 58067070.0, "step": 26825 }, { "entropy": 6.332041263580322, "epoch": 2.8711006474396705, "grad_norm": 1.3125, "learning_rate": 0.0004187394931200893, "loss": 5.875, "mean_token_accuracy": 0.15968974828720092, "num_tokens": 58077922.0, "step": 26830 }, { "entropy": 6.412332010269165, "epoch": 2.871635721547434, "grad_norm": 1.1484375, "learning_rate": 0.0004187100766763671, "loss": 5.9943, "mean_token_accuracy": 0.15546340197324754, "num_tokens": 58089698.0, "step": 26835 }, { "entropy": 6.462100601196289, "epoch": 2.8721707956551983, "grad_norm": 1.15625, "learning_rate": 0.00041868065608303674, "loss": 5.9928, "mean_token_accuracy": 0.15846218764781952, "num_tokens": 58100640.0, "step": 26840 }, { "entropy": 6.404068088531494, "epoch": 2.872705869762962, "grad_norm": 1.2421875, "learning_rate": 0.0004186512313409476, "loss": 6.0764, "mean_token_accuracy": 0.1470884382724762, "num_tokens": 58112810.0, "step": 26845 }, { "entropy": 6.468878316879272, "epoch": 2.873240943870726, "grad_norm": 1.359375, "learning_rate": 0.0004186218024509493, "loss": 6.1026, "mean_token_accuracy": 0.14706760197877883, "num_tokens": 58123818.0, "step": 26850 }, { "entropy": 6.450071716308594, "epoch": 2.87377601797849, "grad_norm": 1.140625, "learning_rate": 0.00041859236941389175, "loss": 6.0636, "mean_token_accuracy": 0.14915749058127403, "num_tokens": 58134785.0, "step": 26855 }, { "entropy": 6.4456321716308596, "epoch": 2.874311092086254, "grad_norm": 1.390625, "learning_rate": 0.0004185629322306246, "loss": 6.0542, "mean_token_accuracy": 0.15013698488473892, "num_tokens": 58144987.0, "step": 26860 }, { "entropy": 6.416501665115357, "epoch": 2.874846166194018, "grad_norm": 1.1484375, "learning_rate": 0.00041853349090199805, "loss": 5.9887, "mean_token_accuracy": 0.15730877071619034, "num_tokens": 58155031.0, "step": 26865 }, { "entropy": 6.322882843017578, "epoch": 2.875381240301782, "grad_norm": 1.0625, "learning_rate": 0.000418504045428862, "loss": 5.9662, "mean_token_accuracy": 0.1569364346563816, "num_tokens": 58165216.0, "step": 26870 }, { "entropy": 6.395208215713501, "epoch": 2.8759163144095456, "grad_norm": 1.09375, "learning_rate": 0.0004184745958120669, "loss": 6.0418, "mean_token_accuracy": 0.15620874911546706, "num_tokens": 58176329.0, "step": 26875 }, { "entropy": 6.495823526382447, "epoch": 2.8764513885173097, "grad_norm": 1.15625, "learning_rate": 0.00041844514205246293, "loss": 6.0473, "mean_token_accuracy": 0.1500655770301819, "num_tokens": 58187058.0, "step": 26880 }, { "entropy": 6.457627201080323, "epoch": 2.876986462625074, "grad_norm": 1.2578125, "learning_rate": 0.0004184156841509007, "loss": 6.0258, "mean_token_accuracy": 0.15183956176042557, "num_tokens": 58196579.0, "step": 26885 }, { "entropy": 6.296269464492798, "epoch": 2.8775215367328375, "grad_norm": 1.1328125, "learning_rate": 0.00041838622210823076, "loss": 5.9652, "mean_token_accuracy": 0.15458275824785234, "num_tokens": 58206689.0, "step": 26890 }, { "entropy": 6.426440954208374, "epoch": 2.878056610840601, "grad_norm": 1.2421875, "learning_rate": 0.0004183567559253037, "loss": 6.0319, "mean_token_accuracy": 0.1525313824415207, "num_tokens": 58218093.0, "step": 26895 }, { "entropy": 6.464215850830078, "epoch": 2.8785916849483653, "grad_norm": 1.1953125, "learning_rate": 0.00041832728560297055, "loss": 6.0616, "mean_token_accuracy": 0.14989352375268936, "num_tokens": 58228587.0, "step": 26900 }, { "entropy": 6.3886962890625, "epoch": 2.8791267590561294, "grad_norm": 1.4140625, "learning_rate": 0.00041829781114208214, "loss": 5.9254, "mean_token_accuracy": 0.15750156939029694, "num_tokens": 58240500.0, "step": 26905 }, { "entropy": 6.350870990753174, "epoch": 2.879661833163893, "grad_norm": 1.125, "learning_rate": 0.00041826833254348956, "loss": 6.0106, "mean_token_accuracy": 0.14876446574926377, "num_tokens": 58252253.0, "step": 26910 }, { "entropy": 6.457035493850708, "epoch": 2.880196907271657, "grad_norm": 1.171875, "learning_rate": 0.00041823884980804406, "loss": 6.0888, "mean_token_accuracy": 0.1494783192873001, "num_tokens": 58263356.0, "step": 26915 }, { "entropy": 6.3225400924682615, "epoch": 2.880731981379421, "grad_norm": 1.203125, "learning_rate": 0.00041820936293659685, "loss": 5.8802, "mean_token_accuracy": 0.1557753175497055, "num_tokens": 58273270.0, "step": 26920 }, { "entropy": 6.409237098693848, "epoch": 2.881267055487185, "grad_norm": 1.09375, "learning_rate": 0.00041817987192999947, "loss": 6.0043, "mean_token_accuracy": 0.14683982580900193, "num_tokens": 58284669.0, "step": 26925 }, { "entropy": 6.453193140029907, "epoch": 2.881802129594949, "grad_norm": 1.4296875, "learning_rate": 0.00041815037678910334, "loss": 6.1108, "mean_token_accuracy": 0.15075706243515014, "num_tokens": 58294791.0, "step": 26930 }, { "entropy": 6.490873908996582, "epoch": 2.882337203702713, "grad_norm": 1.1328125, "learning_rate": 0.0004181208775147602, "loss": 6.0651, "mean_token_accuracy": 0.1498957723379135, "num_tokens": 58305789.0, "step": 26935 }, { "entropy": 6.452756404876709, "epoch": 2.8828722778104767, "grad_norm": 1.3828125, "learning_rate": 0.0004180913741078218, "loss": 6.0455, "mean_token_accuracy": 0.14747522994875908, "num_tokens": 58317547.0, "step": 26940 }, { "entropy": 6.401312923431396, "epoch": 2.883407351918241, "grad_norm": 1.109375, "learning_rate": 0.0004180618665691402, "loss": 5.9892, "mean_token_accuracy": 0.1527828760445118, "num_tokens": 58328408.0, "step": 26945 }, { "entropy": 6.290218782424927, "epoch": 2.8839424260260045, "grad_norm": 1.234375, "learning_rate": 0.0004180323548995672, "loss": 5.8855, "mean_token_accuracy": 0.17409270107746125, "num_tokens": 58339356.0, "step": 26950 }, { "entropy": 6.368633222579956, "epoch": 2.8844775001337686, "grad_norm": 1.5, "learning_rate": 0.00041800283909995505, "loss": 5.9322, "mean_token_accuracy": 0.1625841073691845, "num_tokens": 58349016.0, "step": 26955 }, { "entropy": 6.4525960922241214, "epoch": 2.8850125742415322, "grad_norm": 1.2109375, "learning_rate": 0.0004179733191711561, "loss": 6.1007, "mean_token_accuracy": 0.14001980572938919, "num_tokens": 58360188.0, "step": 26960 }, { "entropy": 6.518548202514649, "epoch": 2.8855476483492963, "grad_norm": 1.4296875, "learning_rate": 0.00041794379511402263, "loss": 6.0611, "mean_token_accuracy": 0.14841486513614655, "num_tokens": 58370733.0, "step": 26965 }, { "entropy": 6.398956918716431, "epoch": 2.8860827224570604, "grad_norm": 1.21875, "learning_rate": 0.0004179142669294071, "loss": 5.9988, "mean_token_accuracy": 0.1466510623693466, "num_tokens": 58382249.0, "step": 26970 }, { "entropy": 6.369844722747803, "epoch": 2.886617796564824, "grad_norm": 1.3671875, "learning_rate": 0.00041788473461816224, "loss": 5.9615, "mean_token_accuracy": 0.15576791763305664, "num_tokens": 58393598.0, "step": 26975 }, { "entropy": 6.414325380325318, "epoch": 2.887152870672588, "grad_norm": 1.1328125, "learning_rate": 0.00041785519818114073, "loss": 6.0366, "mean_token_accuracy": 0.14889776557683945, "num_tokens": 58403920.0, "step": 26980 }, { "entropy": 6.387530279159546, "epoch": 2.8876879447803523, "grad_norm": 1.140625, "learning_rate": 0.00041782565761919546, "loss": 6.0416, "mean_token_accuracy": 0.14682680740952492, "num_tokens": 58413691.0, "step": 26985 }, { "entropy": 6.472382116317749, "epoch": 2.888223018888116, "grad_norm": 1.171875, "learning_rate": 0.00041779611293317936, "loss": 6.0945, "mean_token_accuracy": 0.14470405876636505, "num_tokens": 58425995.0, "step": 26990 }, { "entropy": 6.456513118743897, "epoch": 2.88875809299588, "grad_norm": 1.1484375, "learning_rate": 0.0004177665641239456, "loss": 6.0216, "mean_token_accuracy": 0.14884288981556892, "num_tokens": 58435984.0, "step": 26995 }, { "entropy": 6.4106457233428955, "epoch": 2.8892931671036437, "grad_norm": 1.0546875, "learning_rate": 0.00041773701119234734, "loss": 6.0759, "mean_token_accuracy": 0.1486773058772087, "num_tokens": 58447630.0, "step": 27000 }, { "epoch": 2.8892931671036437, "eval_entropy": 6.218136414042059, "eval_loss": 6.141349792480469, "eval_mean_token_accuracy": 0.15345027208970885, "eval_num_tokens": 58447630.0, "eval_runtime": 22.5656, "eval_samples_per_second": 1315.232, "eval_steps_per_second": 164.41, "step": 27000 }, { "entropy": 6.475987482070923, "epoch": 2.889828241211408, "grad_norm": 1.1796875, "learning_rate": 0.000417707454139238, "loss": 6.0968, "mean_token_accuracy": 0.1445332035422325, "num_tokens": 58458055.0, "step": 27005 }, { "entropy": 6.449408769607544, "epoch": 2.8903633153191715, "grad_norm": 1.1171875, "learning_rate": 0.0004176778929654709, "loss": 6.0675, "mean_token_accuracy": 0.14754040837287902, "num_tokens": 58469115.0, "step": 27010 }, { "entropy": 6.406867408752442, "epoch": 2.8908983894269356, "grad_norm": 1.15625, "learning_rate": 0.0004176483276718997, "loss": 5.9978, "mean_token_accuracy": 0.15539065301418303, "num_tokens": 58480038.0, "step": 27015 }, { "entropy": 6.432852125167846, "epoch": 2.8914334635346997, "grad_norm": 1.1484375, "learning_rate": 0.0004176187582593781, "loss": 6.081, "mean_token_accuracy": 0.148667773604393, "num_tokens": 58490413.0, "step": 27020 }, { "entropy": 6.439930152893067, "epoch": 2.8919685376424633, "grad_norm": 1.15625, "learning_rate": 0.0004175891847287599, "loss": 6.0004, "mean_token_accuracy": 0.15454812943935395, "num_tokens": 58500162.0, "step": 27025 }, { "entropy": 6.344527530670166, "epoch": 2.8925036117502274, "grad_norm": 1.3203125, "learning_rate": 0.000417559607080899, "loss": 5.933, "mean_token_accuracy": 0.1608852669596672, "num_tokens": 58511174.0, "step": 27030 }, { "entropy": 6.476472330093384, "epoch": 2.8930386858579915, "grad_norm": 1.34375, "learning_rate": 0.00041753002531664954, "loss": 6.0775, "mean_token_accuracy": 0.14391999989748, "num_tokens": 58521891.0, "step": 27035 }, { "entropy": 6.453176641464234, "epoch": 2.893573759965755, "grad_norm": 1.0703125, "learning_rate": 0.0004175004394368656, "loss": 6.0492, "mean_token_accuracy": 0.14994098395109176, "num_tokens": 58532029.0, "step": 27040 }, { "entropy": 6.432473039627075, "epoch": 2.8941088340735193, "grad_norm": 1.1015625, "learning_rate": 0.00041747084944240154, "loss": 6.0801, "mean_token_accuracy": 0.14973823130130767, "num_tokens": 58542568.0, "step": 27045 }, { "entropy": 6.419140338897705, "epoch": 2.8946439081812834, "grad_norm": 1.234375, "learning_rate": 0.0004174412553341116, "loss": 6.0023, "mean_token_accuracy": 0.15557052418589593, "num_tokens": 58553396.0, "step": 27050 }, { "entropy": 6.399484539031983, "epoch": 2.895178982289047, "grad_norm": 1.171875, "learning_rate": 0.0004174116571128506, "loss": 6.031, "mean_token_accuracy": 0.15424385517835618, "num_tokens": 58564792.0, "step": 27055 }, { "entropy": 6.417366600036621, "epoch": 2.895714056396811, "grad_norm": 1.171875, "learning_rate": 0.00041738205477947284, "loss": 6.0786, "mean_token_accuracy": 0.15295032560825347, "num_tokens": 58575666.0, "step": 27060 }, { "entropy": 6.389549016952515, "epoch": 2.8962491305045748, "grad_norm": 1.3828125, "learning_rate": 0.00041735244833483325, "loss": 5.994, "mean_token_accuracy": 0.1537250980734825, "num_tokens": 58587411.0, "step": 27065 }, { "entropy": 6.4272528171539305, "epoch": 2.896784204612339, "grad_norm": 1.203125, "learning_rate": 0.00041732283777978687, "loss": 5.9992, "mean_token_accuracy": 0.15173992663621902, "num_tokens": 58598283.0, "step": 27070 }, { "entropy": 6.410965633392334, "epoch": 2.8973192787201025, "grad_norm": 1.1328125, "learning_rate": 0.0004172932231151885, "loss": 6.009, "mean_token_accuracy": 0.15812394320964812, "num_tokens": 58608982.0, "step": 27075 }, { "entropy": 6.4257283210754395, "epoch": 2.8978543528278666, "grad_norm": 1.1171875, "learning_rate": 0.0004172636043418932, "loss": 6.0229, "mean_token_accuracy": 0.15144171118736266, "num_tokens": 58619022.0, "step": 27080 }, { "entropy": 6.323407220840454, "epoch": 2.8983894269356307, "grad_norm": 1.1015625, "learning_rate": 0.0004172339814607564, "loss": 5.9636, "mean_token_accuracy": 0.14988283067941666, "num_tokens": 58630559.0, "step": 27085 }, { "entropy": 6.463758897781372, "epoch": 2.8989245010433944, "grad_norm": 1.1171875, "learning_rate": 0.0004172043544726334, "loss": 6.0595, "mean_token_accuracy": 0.1427644357085228, "num_tokens": 58641346.0, "step": 27090 }, { "entropy": 6.41845850944519, "epoch": 2.8994595751511585, "grad_norm": 1.140625, "learning_rate": 0.0004171747233783796, "loss": 6.0226, "mean_token_accuracy": 0.1542175218462944, "num_tokens": 58652697.0, "step": 27095 }, { "entropy": 6.450353717803955, "epoch": 2.8999946492589226, "grad_norm": 1.0859375, "learning_rate": 0.0004171450881788507, "loss": 6.0545, "mean_token_accuracy": 0.13944205045700073, "num_tokens": 58665574.0, "step": 27100 }, { "entropy": 6.465345144271851, "epoch": 2.9005297233666862, "grad_norm": 1.34375, "learning_rate": 0.00041711544887490233, "loss": 5.9969, "mean_token_accuracy": 0.15176997631788253, "num_tokens": 58676079.0, "step": 27105 }, { "entropy": 6.399819040298462, "epoch": 2.9010647974744503, "grad_norm": 1.2734375, "learning_rate": 0.0004170858054673903, "loss": 6.0492, "mean_token_accuracy": 0.1519046515226364, "num_tokens": 58688465.0, "step": 27110 }, { "entropy": 6.407132577896118, "epoch": 2.901599871582214, "grad_norm": 1.1171875, "learning_rate": 0.0004170561579571706, "loss": 6.0257, "mean_token_accuracy": 0.14987270087003707, "num_tokens": 58698772.0, "step": 27115 }, { "entropy": 6.44085431098938, "epoch": 2.902134945689978, "grad_norm": 1.2734375, "learning_rate": 0.00041702650634509934, "loss": 6.1514, "mean_token_accuracy": 0.14457735121250154, "num_tokens": 58709505.0, "step": 27120 }, { "entropy": 6.4296571731567385, "epoch": 2.9026700197977418, "grad_norm": 1.21875, "learning_rate": 0.00041699685063203263, "loss": 6.0224, "mean_token_accuracy": 0.1492826148867607, "num_tokens": 58718652.0, "step": 27125 }, { "entropy": 6.487498712539673, "epoch": 2.903205093905506, "grad_norm": 1.1953125, "learning_rate": 0.00041696719081882685, "loss": 6.094, "mean_token_accuracy": 0.1454731434583664, "num_tokens": 58730207.0, "step": 27130 }, { "entropy": 6.4266680717468265, "epoch": 2.90374016801327, "grad_norm": 1.1875, "learning_rate": 0.00041693752690633837, "loss": 6.0097, "mean_token_accuracy": 0.15237852931022644, "num_tokens": 58741418.0, "step": 27135 }, { "entropy": 6.42526478767395, "epoch": 2.9042752421210336, "grad_norm": 1.328125, "learning_rate": 0.0004169078588954237, "loss": 6.1137, "mean_token_accuracy": 0.14109493046998978, "num_tokens": 58753535.0, "step": 27140 }, { "entropy": 6.437003946304321, "epoch": 2.9048103162287977, "grad_norm": 1.2421875, "learning_rate": 0.0004168781867869396, "loss": 6.0123, "mean_token_accuracy": 0.14849234148859977, "num_tokens": 58766220.0, "step": 27145 }, { "entropy": 6.506171417236328, "epoch": 2.905345390336562, "grad_norm": 1.0703125, "learning_rate": 0.00041684851058174284, "loss": 6.0229, "mean_token_accuracy": 0.14955549985170363, "num_tokens": 58776795.0, "step": 27150 }, { "entropy": 6.4761628150939945, "epoch": 2.9058804644443255, "grad_norm": 1.21875, "learning_rate": 0.0004168188302806902, "loss": 6.0424, "mean_token_accuracy": 0.1491883784532547, "num_tokens": 58787495.0, "step": 27155 }, { "entropy": 6.406315612792969, "epoch": 2.9064155385520896, "grad_norm": 1.1484375, "learning_rate": 0.0004167891458846387, "loss": 6.0162, "mean_token_accuracy": 0.1466240629553795, "num_tokens": 58798518.0, "step": 27160 }, { "entropy": 6.427061986923218, "epoch": 2.9069506126598537, "grad_norm": 1.265625, "learning_rate": 0.00041675945739444567, "loss": 6.0319, "mean_token_accuracy": 0.15119847953319548, "num_tokens": 58808849.0, "step": 27165 }, { "entropy": 6.476199579238892, "epoch": 2.9074856867676173, "grad_norm": 1.109375, "learning_rate": 0.0004167297648109682, "loss": 6.0151, "mean_token_accuracy": 0.15117928385734558, "num_tokens": 58821110.0, "step": 27170 }, { "entropy": 6.415807580947876, "epoch": 2.908020760875381, "grad_norm": 1.203125, "learning_rate": 0.00041670006813506366, "loss": 6.0839, "mean_token_accuracy": 0.15291107892990113, "num_tokens": 58831433.0, "step": 27175 }, { "entropy": 6.420373153686524, "epoch": 2.908555834983145, "grad_norm": 1.203125, "learning_rate": 0.00041667036736758954, "loss": 6.0885, "mean_token_accuracy": 0.14608990401029587, "num_tokens": 58842031.0, "step": 27180 }, { "entropy": 6.367661571502685, "epoch": 2.909090909090909, "grad_norm": 1.0859375, "learning_rate": 0.00041664066250940353, "loss": 5.9606, "mean_token_accuracy": 0.15397364273667336, "num_tokens": 58852767.0, "step": 27185 }, { "entropy": 6.415635824203491, "epoch": 2.909625983198673, "grad_norm": 1.0859375, "learning_rate": 0.00041661095356136326, "loss": 6.031, "mean_token_accuracy": 0.15012696236371995, "num_tokens": 58864147.0, "step": 27190 }, { "entropy": 6.442934036254883, "epoch": 2.910161057306437, "grad_norm": 1.2109375, "learning_rate": 0.00041658124052432655, "loss": 6.0106, "mean_token_accuracy": 0.15742222517728804, "num_tokens": 58874059.0, "step": 27195 }, { "entropy": 6.426301717758179, "epoch": 2.910696131414201, "grad_norm": 1.1015625, "learning_rate": 0.0004165515233991514, "loss": 6.0293, "mean_token_accuracy": 0.15060678273439407, "num_tokens": 58884433.0, "step": 27200 }, { "entropy": 6.449150037765503, "epoch": 2.9112312055219647, "grad_norm": 1.171875, "learning_rate": 0.0004165218021866961, "loss": 6.122, "mean_token_accuracy": 0.1371970519423485, "num_tokens": 58896062.0, "step": 27205 }, { "entropy": 6.407425832748413, "epoch": 2.911766279629729, "grad_norm": 1.140625, "learning_rate": 0.0004164920768878184, "loss": 6.0233, "mean_token_accuracy": 0.1486214742064476, "num_tokens": 58906926.0, "step": 27210 }, { "entropy": 6.400617933273315, "epoch": 2.912301353737493, "grad_norm": 1.1640625, "learning_rate": 0.00041646234750337697, "loss": 6.0054, "mean_token_accuracy": 0.15104922279715538, "num_tokens": 58919230.0, "step": 27215 }, { "entropy": 6.452187871932983, "epoch": 2.9128364278452565, "grad_norm": 1.21875, "learning_rate": 0.0004164326140342302, "loss": 6.0531, "mean_token_accuracy": 0.1487659588456154, "num_tokens": 58929094.0, "step": 27220 }, { "entropy": 6.454272985458374, "epoch": 2.9133715019530206, "grad_norm": 1.0859375, "learning_rate": 0.00041640287648123645, "loss": 6.0418, "mean_token_accuracy": 0.15363624840974807, "num_tokens": 58939952.0, "step": 27225 }, { "entropy": 6.414379692077636, "epoch": 2.9139065760607843, "grad_norm": 1.09375, "learning_rate": 0.00041637313484525464, "loss": 6.016, "mean_token_accuracy": 0.15773678943514824, "num_tokens": 58950520.0, "step": 27230 }, { "entropy": 6.46512999534607, "epoch": 2.9144416501685484, "grad_norm": 1.140625, "learning_rate": 0.0004163433891271434, "loss": 6.0758, "mean_token_accuracy": 0.14659190326929092, "num_tokens": 58960578.0, "step": 27235 }, { "entropy": 6.451051568984985, "epoch": 2.914976724276312, "grad_norm": 1.09375, "learning_rate": 0.00041631363932776154, "loss": 6.1116, "mean_token_accuracy": 0.14514343515038491, "num_tokens": 58972188.0, "step": 27240 }, { "entropy": 6.467039299011231, "epoch": 2.915511798384076, "grad_norm": 1.140625, "learning_rate": 0.00041628388544796835, "loss": 6.0174, "mean_token_accuracy": 0.15781626105308533, "num_tokens": 58982852.0, "step": 27245 }, { "entropy": 6.3892014503479, "epoch": 2.9160468724918402, "grad_norm": 1.140625, "learning_rate": 0.0004162541274886228, "loss": 5.9362, "mean_token_accuracy": 0.15954408347606658, "num_tokens": 58993713.0, "step": 27250 }, { "entropy": 6.349710321426391, "epoch": 2.916581946599604, "grad_norm": 1.1484375, "learning_rate": 0.00041622436545058405, "loss": 5.9212, "mean_token_accuracy": 0.1555197462439537, "num_tokens": 59004021.0, "step": 27255 }, { "entropy": 6.290597057342529, "epoch": 2.917117020707368, "grad_norm": 1.1484375, "learning_rate": 0.00041619459933471174, "loss": 5.9132, "mean_token_accuracy": 0.1709602952003479, "num_tokens": 59016592.0, "step": 27260 }, { "entropy": 6.413155460357666, "epoch": 2.917652094815132, "grad_norm": 1.15625, "learning_rate": 0.0004161648291418651, "loss": 5.9735, "mean_token_accuracy": 0.15514272898435594, "num_tokens": 59027116.0, "step": 27265 }, { "entropy": 6.420281267166137, "epoch": 2.9181871689228958, "grad_norm": 1.2734375, "learning_rate": 0.0004161350548729039, "loss": 6.0371, "mean_token_accuracy": 0.1501668229699135, "num_tokens": 59036917.0, "step": 27270 }, { "entropy": 6.408225107192993, "epoch": 2.91872224303066, "grad_norm": 1.1953125, "learning_rate": 0.0004161052765286878, "loss": 5.9869, "mean_token_accuracy": 0.15154383480548858, "num_tokens": 59046588.0, "step": 27275 }, { "entropy": 6.409810352325439, "epoch": 2.9192573171384235, "grad_norm": 1.1328125, "learning_rate": 0.0004160754941100767, "loss": 5.9397, "mean_token_accuracy": 0.15443408936262132, "num_tokens": 59057710.0, "step": 27280 }, { "entropy": 6.446805191040039, "epoch": 2.9197923912461876, "grad_norm": 1.09375, "learning_rate": 0.00041604570761793054, "loss": 6.0902, "mean_token_accuracy": 0.14076431468129158, "num_tokens": 59068795.0, "step": 27285 }, { "entropy": 6.412035226821899, "epoch": 2.9203274653539513, "grad_norm": 1.609375, "learning_rate": 0.0004160159170531094, "loss": 6.0235, "mean_token_accuracy": 0.15423106998205185, "num_tokens": 59079266.0, "step": 27290 }, { "entropy": 6.449249362945556, "epoch": 2.9208625394617154, "grad_norm": 1.1484375, "learning_rate": 0.0004159861224164734, "loss": 6.1401, "mean_token_accuracy": 0.1455086387693882, "num_tokens": 59088827.0, "step": 27295 }, { "entropy": 6.365843725204468, "epoch": 2.9213976135694795, "grad_norm": 1.1484375, "learning_rate": 0.000415956323708883, "loss": 6.0548, "mean_token_accuracy": 0.15366662293672562, "num_tokens": 59099097.0, "step": 27300 }, { "entropy": 6.468175649642944, "epoch": 2.921932687677243, "grad_norm": 1.09375, "learning_rate": 0.00041592652093119846, "loss": 6.0307, "mean_token_accuracy": 0.15391422361135482, "num_tokens": 59110175.0, "step": 27305 }, { "entropy": 6.478326654434204, "epoch": 2.9224677617850072, "grad_norm": 1.234375, "learning_rate": 0.00041589671408428055, "loss": 6.0586, "mean_token_accuracy": 0.15025347620248794, "num_tokens": 59121133.0, "step": 27310 }, { "entropy": 6.445691776275635, "epoch": 2.9230028358927713, "grad_norm": 1.140625, "learning_rate": 0.00041586690316898977, "loss": 6.0403, "mean_token_accuracy": 0.14851387068629265, "num_tokens": 59132750.0, "step": 27315 }, { "entropy": 6.43862476348877, "epoch": 2.923537910000535, "grad_norm": 1.2109375, "learning_rate": 0.00041583708818618693, "loss": 6.0313, "mean_token_accuracy": 0.15407897531986237, "num_tokens": 59143488.0, "step": 27320 }, { "entropy": 6.329753637313843, "epoch": 2.924072984108299, "grad_norm": 1.1171875, "learning_rate": 0.000415807269136733, "loss": 5.9743, "mean_token_accuracy": 0.15368232503533363, "num_tokens": 59154118.0, "step": 27325 }, { "entropy": 6.377227735519409, "epoch": 2.924608058216063, "grad_norm": 1.140625, "learning_rate": 0.00041577744602148893, "loss": 6.0542, "mean_token_accuracy": 0.15344493687152863, "num_tokens": 59164736.0, "step": 27330 }, { "entropy": 6.392939329147339, "epoch": 2.925143132323827, "grad_norm": 1.1875, "learning_rate": 0.000415747618841316, "loss": 6.0472, "mean_token_accuracy": 0.14772686511278152, "num_tokens": 59175895.0, "step": 27335 }, { "entropy": 6.4835912704467775, "epoch": 2.925678206431591, "grad_norm": 1.15625, "learning_rate": 0.0004157177875970752, "loss": 6.0073, "mean_token_accuracy": 0.15572786331176758, "num_tokens": 59186692.0, "step": 27340 }, { "entropy": 6.496181011199951, "epoch": 2.9262132805393546, "grad_norm": 1.21875, "learning_rate": 0.0004156879522896281, "loss": 6.018, "mean_token_accuracy": 0.15560057014226913, "num_tokens": 59197731.0, "step": 27345 }, { "entropy": 6.383993005752563, "epoch": 2.9267483546471187, "grad_norm": 1.1953125, "learning_rate": 0.0004156581129198362, "loss": 6.0293, "mean_token_accuracy": 0.14748637229204178, "num_tokens": 59209470.0, "step": 27350 }, { "entropy": 6.298841571807861, "epoch": 2.9272834287548823, "grad_norm": 1.2109375, "learning_rate": 0.000415628269488561, "loss": 5.9871, "mean_token_accuracy": 0.15218152552843095, "num_tokens": 59220085.0, "step": 27355 }, { "entropy": 6.360973834991455, "epoch": 2.9278185028626464, "grad_norm": 1.2421875, "learning_rate": 0.0004155984219966643, "loss": 6.0209, "mean_token_accuracy": 0.1494362786412239, "num_tokens": 59231862.0, "step": 27360 }, { "entropy": 6.415185260772705, "epoch": 2.9283535769704105, "grad_norm": 1.359375, "learning_rate": 0.00041556857044500796, "loss": 6.0486, "mean_token_accuracy": 0.14906044527888299, "num_tokens": 59242771.0, "step": 27365 }, { "entropy": 6.42555456161499, "epoch": 2.928888651078174, "grad_norm": 1.109375, "learning_rate": 0.0004155387148344538, "loss": 6.0168, "mean_token_accuracy": 0.153419528901577, "num_tokens": 59253456.0, "step": 27370 }, { "entropy": 6.425495147705078, "epoch": 2.9294237251859383, "grad_norm": 1.359375, "learning_rate": 0.00041550885516586405, "loss": 6.0414, "mean_token_accuracy": 0.14525327682495118, "num_tokens": 59265307.0, "step": 27375 }, { "entropy": 6.358096122741699, "epoch": 2.9299587992937024, "grad_norm": 1.234375, "learning_rate": 0.00041547899144010086, "loss": 5.9582, "mean_token_accuracy": 0.15358353555202484, "num_tokens": 59276920.0, "step": 27380 }, { "entropy": 6.435417509078979, "epoch": 2.930493873401466, "grad_norm": 1.1640625, "learning_rate": 0.00041544912365802655, "loss": 6.0298, "mean_token_accuracy": 0.14695076942443847, "num_tokens": 59288370.0, "step": 27385 }, { "entropy": 6.291209602355957, "epoch": 2.93102894750923, "grad_norm": 1.015625, "learning_rate": 0.0004154192518205035, "loss": 5.8909, "mean_token_accuracy": 0.162090727686882, "num_tokens": 59299719.0, "step": 27390 }, { "entropy": 6.416195917129516, "epoch": 2.931564021616994, "grad_norm": 1.3359375, "learning_rate": 0.00041538937592839427, "loss": 6.0079, "mean_token_accuracy": 0.15320963710546492, "num_tokens": 59310409.0, "step": 27395 }, { "entropy": 6.388006353378296, "epoch": 2.932099095724758, "grad_norm": 1.1328125, "learning_rate": 0.00041535949598256157, "loss": 5.9507, "mean_token_accuracy": 0.15338077545166015, "num_tokens": 59321429.0, "step": 27400 }, { "entropy": 6.504240322113037, "epoch": 2.9326341698325216, "grad_norm": 1.140625, "learning_rate": 0.00041532961198386813, "loss": 6.0541, "mean_token_accuracy": 0.14771268963813783, "num_tokens": 59332095.0, "step": 27405 }, { "entropy": 6.4194975852966305, "epoch": 2.9331692439402857, "grad_norm": 2.171875, "learning_rate": 0.0004152997239331769, "loss": 6.06, "mean_token_accuracy": 0.14679784029722215, "num_tokens": 59344002.0, "step": 27410 }, { "entropy": 6.353449726104737, "epoch": 2.9337043180480498, "grad_norm": 1.0703125, "learning_rate": 0.0004152698318313509, "loss": 6.0127, "mean_token_accuracy": 0.1552669957280159, "num_tokens": 59355148.0, "step": 27415 }, { "entropy": 6.3434511661529545, "epoch": 2.9342393921558134, "grad_norm": 1.984375, "learning_rate": 0.0004152399356792531, "loss": 5.9511, "mean_token_accuracy": 0.15712600573897362, "num_tokens": 59365916.0, "step": 27420 }, { "entropy": 6.37183313369751, "epoch": 2.9347744662635775, "grad_norm": 1.1640625, "learning_rate": 0.00041521003547774694, "loss": 5.971, "mean_token_accuracy": 0.15434334427118301, "num_tokens": 59376843.0, "step": 27425 }, { "entropy": 6.423746252059937, "epoch": 2.9353095403713416, "grad_norm": 1.2109375, "learning_rate": 0.0004151801312276957, "loss": 6.1175, "mean_token_accuracy": 0.14279583543539048, "num_tokens": 59388572.0, "step": 27430 }, { "entropy": 6.4508058547973635, "epoch": 2.9358446144791053, "grad_norm": 1.1796875, "learning_rate": 0.0004151502229299628, "loss": 6.0545, "mean_token_accuracy": 0.14788383841514588, "num_tokens": 59399122.0, "step": 27435 }, { "entropy": 6.374027919769287, "epoch": 2.9363796885868694, "grad_norm": 1.1171875, "learning_rate": 0.000415120310585412, "loss": 5.9703, "mean_token_accuracy": 0.15600283294916154, "num_tokens": 59409565.0, "step": 27440 }, { "entropy": 6.382921171188355, "epoch": 2.9369147626946335, "grad_norm": 1.1328125, "learning_rate": 0.0004150903941949068, "loss": 5.9919, "mean_token_accuracy": 0.15774423032999038, "num_tokens": 59420465.0, "step": 27445 }, { "entropy": 6.433543634414673, "epoch": 2.937449836802397, "grad_norm": 1.1640625, "learning_rate": 0.00041506047375931127, "loss": 6.0656, "mean_token_accuracy": 0.15041355937719345, "num_tokens": 59431457.0, "step": 27450 }, { "entropy": 6.426451063156128, "epoch": 2.937984910910161, "grad_norm": 1.1328125, "learning_rate": 0.0004150305492794892, "loss": 6.0291, "mean_token_accuracy": 0.16185689866542816, "num_tokens": 59442257.0, "step": 27455 }, { "entropy": 6.4615373611450195, "epoch": 2.938519985017925, "grad_norm": 1.3046875, "learning_rate": 0.0004150006207563047, "loss": 6.0308, "mean_token_accuracy": 0.15300246328115463, "num_tokens": 59453634.0, "step": 27460 }, { "entropy": 6.433228921890259, "epoch": 2.939055059125689, "grad_norm": 1.1328125, "learning_rate": 0.00041497068819062197, "loss": 6.096, "mean_token_accuracy": 0.14395620971918105, "num_tokens": 59463085.0, "step": 27465 }, { "entropy": 6.36746563911438, "epoch": 2.9395901332334526, "grad_norm": 1.0625, "learning_rate": 0.0004149407515833052, "loss": 5.9846, "mean_token_accuracy": 0.1500376746058464, "num_tokens": 59473195.0, "step": 27470 }, { "entropy": 6.389118623733521, "epoch": 2.9401252073412167, "grad_norm": 1.125, "learning_rate": 0.000414910810935219, "loss": 6.0541, "mean_token_accuracy": 0.1493223637342453, "num_tokens": 59483669.0, "step": 27475 }, { "entropy": 6.435322666168213, "epoch": 2.940660281448981, "grad_norm": 1.1484375, "learning_rate": 0.00041488086624722777, "loss": 6.0086, "mean_token_accuracy": 0.15059866905212402, "num_tokens": 59495036.0, "step": 27480 }, { "entropy": 6.404664468765259, "epoch": 2.9411953555567445, "grad_norm": 1.1015625, "learning_rate": 0.00041485091752019613, "loss": 5.9711, "mean_token_accuracy": 0.15397798717021943, "num_tokens": 59505130.0, "step": 27485 }, { "entropy": 6.333157396316528, "epoch": 2.9417304296645086, "grad_norm": 1.5078125, "learning_rate": 0.00041482096475498894, "loss": 5.8934, "mean_token_accuracy": 0.16456294506788255, "num_tokens": 59516275.0, "step": 27490 }, { "entropy": 6.475914049148559, "epoch": 2.9422655037722727, "grad_norm": 1.046875, "learning_rate": 0.00041479100795247106, "loss": 6.081, "mean_token_accuracy": 0.1537385419011116, "num_tokens": 59526978.0, "step": 27495 }, { "entropy": 6.432363796234131, "epoch": 2.9428005778800364, "grad_norm": 1.046875, "learning_rate": 0.0004147610471135074, "loss": 6.0437, "mean_token_accuracy": 0.15458419397473336, "num_tokens": 59536771.0, "step": 27500 }, { "entropy": 6.335936260223389, "epoch": 2.9433356519878004, "grad_norm": 1.2578125, "learning_rate": 0.00041473108223896314, "loss": 6.0177, "mean_token_accuracy": 0.14741022735834122, "num_tokens": 59548371.0, "step": 27505 }, { "entropy": 6.428878211975098, "epoch": 2.943870726095564, "grad_norm": 1.1171875, "learning_rate": 0.00041470111332970354, "loss": 6.0169, "mean_token_accuracy": 0.15384733378887178, "num_tokens": 59558578.0, "step": 27510 }, { "entropy": 6.35991415977478, "epoch": 2.944405800203328, "grad_norm": 1.1171875, "learning_rate": 0.000414671140386594, "loss": 6.0164, "mean_token_accuracy": 0.14995471239089966, "num_tokens": 59569023.0, "step": 27515 }, { "entropy": 6.407770490646362, "epoch": 2.944940874311092, "grad_norm": 1.5703125, "learning_rate": 0.0004146411634104999, "loss": 6.0674, "mean_token_accuracy": 0.15310516133904456, "num_tokens": 59580296.0, "step": 27520 }, { "entropy": 6.383061075210572, "epoch": 2.945475948418856, "grad_norm": 1.125, "learning_rate": 0.00041461118240228675, "loss": 5.9364, "mean_token_accuracy": 0.15555681586265563, "num_tokens": 59591298.0, "step": 27525 }, { "entropy": 6.437091207504272, "epoch": 2.94601102252662, "grad_norm": 1.2109375, "learning_rate": 0.00041458119736282033, "loss": 6.0341, "mean_token_accuracy": 0.14983945190906525, "num_tokens": 59602575.0, "step": 27530 }, { "entropy": 6.4226805686950685, "epoch": 2.9465460966343837, "grad_norm": 1.3046875, "learning_rate": 0.00041455120829296657, "loss": 6.0194, "mean_token_accuracy": 0.14529084265232087, "num_tokens": 59613287.0, "step": 27535 }, { "entropy": 6.403892993927002, "epoch": 2.947081170742148, "grad_norm": 1.328125, "learning_rate": 0.0004145212151935911, "loss": 6.069, "mean_token_accuracy": 0.1429272137582302, "num_tokens": 59623263.0, "step": 27540 }, { "entropy": 6.4750572681427006, "epoch": 2.947616244849912, "grad_norm": 1.1484375, "learning_rate": 0.0004144912180655603, "loss": 6.0469, "mean_token_accuracy": 0.15231718719005585, "num_tokens": 59634416.0, "step": 27545 }, { "entropy": 6.464210176467896, "epoch": 2.9481513189576756, "grad_norm": 1.1796875, "learning_rate": 0.0004144612169097401, "loss": 6.0162, "mean_token_accuracy": 0.15019172579050064, "num_tokens": 59643866.0, "step": 27550 }, { "entropy": 6.434405374526977, "epoch": 2.9486863930654397, "grad_norm": 1.1484375, "learning_rate": 0.0004144312117269969, "loss": 6.0185, "mean_token_accuracy": 0.14855857640504838, "num_tokens": 59654113.0, "step": 27555 }, { "entropy": 6.35472674369812, "epoch": 2.9492214671732033, "grad_norm": 1.1875, "learning_rate": 0.00041440120251819704, "loss": 5.9938, "mean_token_accuracy": 0.15294803082942962, "num_tokens": 59663837.0, "step": 27560 }, { "entropy": 6.229334783554077, "epoch": 2.9497565412809674, "grad_norm": 1.125, "learning_rate": 0.000414371189284207, "loss": 5.7741, "mean_token_accuracy": 0.1665445789694786, "num_tokens": 59673782.0, "step": 27565 }, { "entropy": 6.390994024276734, "epoch": 2.950291615388731, "grad_norm": 1.1796875, "learning_rate": 0.00041434117202589346, "loss": 5.9871, "mean_token_accuracy": 0.1559944733977318, "num_tokens": 59684775.0, "step": 27570 }, { "entropy": 6.391527700424194, "epoch": 2.950826689496495, "grad_norm": 1.125, "learning_rate": 0.0004143111507441232, "loss": 6.0096, "mean_token_accuracy": 0.15801829248666763, "num_tokens": 59695193.0, "step": 27575 }, { "entropy": 6.3698155879974365, "epoch": 2.9513617636042593, "grad_norm": 1.0625, "learning_rate": 0.00041428112543976303, "loss": 5.99, "mean_token_accuracy": 0.15096978098154068, "num_tokens": 59705707.0, "step": 27580 }, { "entropy": 6.4505504131317135, "epoch": 2.951896837712023, "grad_norm": 1.046875, "learning_rate": 0.00041425109611367987, "loss": 6.066, "mean_token_accuracy": 0.14882570505142212, "num_tokens": 59715882.0, "step": 27585 }, { "entropy": 6.4490138530731205, "epoch": 2.952431911819787, "grad_norm": 1.2421875, "learning_rate": 0.0004142210627667409, "loss": 6.0856, "mean_token_accuracy": 0.14480303153395652, "num_tokens": 59726690.0, "step": 27590 }, { "entropy": 6.389191675186157, "epoch": 2.952966985927551, "grad_norm": 1.140625, "learning_rate": 0.00041419102539981344, "loss": 6.0111, "mean_token_accuracy": 0.14854462146759034, "num_tokens": 59737052.0, "step": 27595 }, { "entropy": 6.434527730941772, "epoch": 2.953502060035315, "grad_norm": 1.0703125, "learning_rate": 0.0004141609840137646, "loss": 6.0436, "mean_token_accuracy": 0.15357411801815032, "num_tokens": 59747989.0, "step": 27600 }, { "entropy": 6.429065084457397, "epoch": 2.954037134143079, "grad_norm": 1.1484375, "learning_rate": 0.0004141309386094619, "loss": 5.9913, "mean_token_accuracy": 0.15697530955076217, "num_tokens": 59759169.0, "step": 27605 }, { "entropy": 6.380228662490845, "epoch": 2.954572208250843, "grad_norm": 1.25, "learning_rate": 0.0004141008891877728, "loss": 6.0156, "mean_token_accuracy": 0.15522422045469284, "num_tokens": 59769837.0, "step": 27610 }, { "entropy": 6.345466279983521, "epoch": 2.9551072823586066, "grad_norm": 1.1640625, "learning_rate": 0.00041407083574956515, "loss": 5.9517, "mean_token_accuracy": 0.15783219337463378, "num_tokens": 59780671.0, "step": 27615 }, { "entropy": 6.401721525192261, "epoch": 2.9556423564663707, "grad_norm": 1.078125, "learning_rate": 0.0004140407782957067, "loss": 5.9643, "mean_token_accuracy": 0.16064547449350358, "num_tokens": 59792006.0, "step": 27620 }, { "entropy": 6.422065687179566, "epoch": 2.9561774305741344, "grad_norm": 1.21875, "learning_rate": 0.0004140107168270653, "loss": 6.0295, "mean_token_accuracy": 0.14720279425382615, "num_tokens": 59802627.0, "step": 27625 }, { "entropy": 6.410897922515869, "epoch": 2.9567125046818985, "grad_norm": 1.0859375, "learning_rate": 0.00041398065134450897, "loss": 6.0284, "mean_token_accuracy": 0.1536417841911316, "num_tokens": 59813048.0, "step": 27630 }, { "entropy": 6.38020396232605, "epoch": 2.957247578789662, "grad_norm": 1.1953125, "learning_rate": 0.0004139505818489058, "loss": 6.0426, "mean_token_accuracy": 0.15560630112886428, "num_tokens": 59823730.0, "step": 27635 }, { "entropy": 6.4563154697418215, "epoch": 2.9577826528974263, "grad_norm": 1.1953125, "learning_rate": 0.00041392050834112415, "loss": 6.0584, "mean_token_accuracy": 0.15338130444288253, "num_tokens": 59835054.0, "step": 27640 }, { "entropy": 6.480252075195312, "epoch": 2.9583177270051904, "grad_norm": 1.1484375, "learning_rate": 0.0004138904308220324, "loss": 6.0754, "mean_token_accuracy": 0.14156820327043534, "num_tokens": 59845641.0, "step": 27645 }, { "entropy": 6.4223133563995365, "epoch": 2.958852801112954, "grad_norm": 1.1796875, "learning_rate": 0.00041386034929249895, "loss": 6.0374, "mean_token_accuracy": 0.14981416910886763, "num_tokens": 59856255.0, "step": 27650 }, { "entropy": 6.354643869400024, "epoch": 2.959387875220718, "grad_norm": 1.15625, "learning_rate": 0.0004138302637533924, "loss": 5.9411, "mean_token_accuracy": 0.1590716704726219, "num_tokens": 59867215.0, "step": 27655 }, { "entropy": 6.4137977123260494, "epoch": 2.959922949328482, "grad_norm": 1.21875, "learning_rate": 0.0004138001742055815, "loss": 6.0254, "mean_token_accuracy": 0.14877092093229294, "num_tokens": 59877690.0, "step": 27660 }, { "entropy": 6.398963975906372, "epoch": 2.960458023436246, "grad_norm": 1.1328125, "learning_rate": 0.0004137700806499351, "loss": 5.9881, "mean_token_accuracy": 0.15334503650665282, "num_tokens": 59888183.0, "step": 27665 }, { "entropy": 6.351258420944214, "epoch": 2.96099309754401, "grad_norm": 1.125, "learning_rate": 0.00041373998308732204, "loss": 5.99, "mean_token_accuracy": 0.15431084483861923, "num_tokens": 59898573.0, "step": 27670 }, { "entropy": 6.398924112319946, "epoch": 2.9615281716517736, "grad_norm": 1.171875, "learning_rate": 0.00041370988151861153, "loss": 6.0492, "mean_token_accuracy": 0.15366986244916916, "num_tokens": 59909605.0, "step": 27675 }, { "entropy": 6.409824514389038, "epoch": 2.9620632457595377, "grad_norm": 1.078125, "learning_rate": 0.00041367977594467263, "loss": 5.9896, "mean_token_accuracy": 0.1540689155459404, "num_tokens": 59920808.0, "step": 27680 }, { "entropy": 6.404238748550415, "epoch": 2.9625983198673014, "grad_norm": 1.078125, "learning_rate": 0.00041364966636637477, "loss": 6.0456, "mean_token_accuracy": 0.14962126165628434, "num_tokens": 59931302.0, "step": 27685 }, { "entropy": 6.466340351104736, "epoch": 2.9631333939750655, "grad_norm": 1.0625, "learning_rate": 0.00041361955278458725, "loss": 6.0493, "mean_token_accuracy": 0.1536378778517246, "num_tokens": 59942542.0, "step": 27690 }, { "entropy": 6.389356327056885, "epoch": 2.9636684680828296, "grad_norm": 1.7265625, "learning_rate": 0.0004135894352001796, "loss": 5.9841, "mean_token_accuracy": 0.15006993860006332, "num_tokens": 59953547.0, "step": 27695 }, { "entropy": 6.403418397903442, "epoch": 2.9642035421905932, "grad_norm": 1.171875, "learning_rate": 0.0004135593136140215, "loss": 6.023, "mean_token_accuracy": 0.15587370097637177, "num_tokens": 59964828.0, "step": 27700 }, { "entropy": 6.369388818740845, "epoch": 2.9647386162983573, "grad_norm": 1.1796875, "learning_rate": 0.00041352918802698265, "loss": 5.969, "mean_token_accuracy": 0.16224077343940735, "num_tokens": 59974989.0, "step": 27705 }, { "entropy": 6.341842174530029, "epoch": 2.9652736904061214, "grad_norm": 1.0546875, "learning_rate": 0.000413499058439933, "loss": 5.9127, "mean_token_accuracy": 0.15916519463062287, "num_tokens": 59985247.0, "step": 27710 }, { "entropy": 6.414313316345215, "epoch": 2.965808764513885, "grad_norm": 2.53125, "learning_rate": 0.0004134689248537425, "loss": 6.0149, "mean_token_accuracy": 0.14856530576944352, "num_tokens": 59995145.0, "step": 27715 }, { "entropy": 6.371766996383667, "epoch": 2.966343838621649, "grad_norm": 1.2578125, "learning_rate": 0.00041343878726928125, "loss": 5.9371, "mean_token_accuracy": 0.16496334373950958, "num_tokens": 60006400.0, "step": 27720 }, { "entropy": 6.361305904388428, "epoch": 2.9668789127294133, "grad_norm": 1.0859375, "learning_rate": 0.0004134086456874194, "loss": 5.9737, "mean_token_accuracy": 0.15512975305318832, "num_tokens": 60017408.0, "step": 27725 }, { "entropy": 6.379544019699097, "epoch": 2.967413986837177, "grad_norm": 1.1328125, "learning_rate": 0.00041337850010902743, "loss": 6.0188, "mean_token_accuracy": 0.15296598225831987, "num_tokens": 60030138.0, "step": 27730 }, { "entropy": 6.385231685638428, "epoch": 2.9679490609449406, "grad_norm": 1.0625, "learning_rate": 0.00041334835053497573, "loss": 5.978, "mean_token_accuracy": 0.14659226611256598, "num_tokens": 60040966.0, "step": 27735 }, { "entropy": 6.492963647842407, "epoch": 2.9684841350527047, "grad_norm": 1.046875, "learning_rate": 0.0004133181969661349, "loss": 6.0543, "mean_token_accuracy": 0.14986884072422982, "num_tokens": 60053090.0, "step": 27740 }, { "entropy": 6.470880222320557, "epoch": 2.969019209160469, "grad_norm": 1.3828125, "learning_rate": 0.00041328803940337546, "loss": 6.0897, "mean_token_accuracy": 0.14678103476762772, "num_tokens": 60063967.0, "step": 27745 }, { "entropy": 6.415389204025269, "epoch": 2.9695542832682325, "grad_norm": 1.0625, "learning_rate": 0.0004132578778475683, "loss": 5.9744, "mean_token_accuracy": 0.1518477164208889, "num_tokens": 60075025.0, "step": 27750 }, { "entropy": 6.43313627243042, "epoch": 2.9700893573759966, "grad_norm": 1.203125, "learning_rate": 0.0004132277122995844, "loss": 6.0169, "mean_token_accuracy": 0.15126500129699708, "num_tokens": 60084530.0, "step": 27755 }, { "entropy": 6.365266942977906, "epoch": 2.9706244314837607, "grad_norm": 1.2578125, "learning_rate": 0.0004131975427602948, "loss": 5.9633, "mean_token_accuracy": 0.15507979542016984, "num_tokens": 60095809.0, "step": 27760 }, { "entropy": 6.4003955841064455, "epoch": 2.9711595055915243, "grad_norm": 1.2109375, "learning_rate": 0.0004131673692305704, "loss": 6.029, "mean_token_accuracy": 0.15797365009784697, "num_tokens": 60106559.0, "step": 27765 }, { "entropy": 6.46792254447937, "epoch": 2.9716945796992884, "grad_norm": 1.078125, "learning_rate": 0.0004131371917112827, "loss": 6.0844, "mean_token_accuracy": 0.1433086320757866, "num_tokens": 60117557.0, "step": 27770 }, { "entropy": 6.450874853134155, "epoch": 2.9722296538070525, "grad_norm": 1.1484375, "learning_rate": 0.0004131070102033031, "loss": 6.0693, "mean_token_accuracy": 0.15197938233613967, "num_tokens": 60129211.0, "step": 27775 }, { "entropy": 6.464452648162842, "epoch": 2.972764727914816, "grad_norm": 1.0625, "learning_rate": 0.00041307682470750293, "loss": 5.9964, "mean_token_accuracy": 0.1517878532409668, "num_tokens": 60139345.0, "step": 27780 }, { "entropy": 6.340352725982666, "epoch": 2.9732998020225803, "grad_norm": 1.015625, "learning_rate": 0.0004130466352247538, "loss": 6.0297, "mean_token_accuracy": 0.1516973152756691, "num_tokens": 60148881.0, "step": 27785 }, { "entropy": 6.3354260444641115, "epoch": 2.973834876130344, "grad_norm": 1.1796875, "learning_rate": 0.00041301644175592756, "loss": 5.9228, "mean_token_accuracy": 0.15371652990579604, "num_tokens": 60159660.0, "step": 27790 }, { "entropy": 6.351105737686157, "epoch": 2.974369950238108, "grad_norm": 1.0703125, "learning_rate": 0.00041298624430189583, "loss": 5.9697, "mean_token_accuracy": 0.15795397460460664, "num_tokens": 60170649.0, "step": 27795 }, { "entropy": 6.347753095626831, "epoch": 2.9749050243458717, "grad_norm": 1.1796875, "learning_rate": 0.0004129560428635308, "loss": 5.9064, "mean_token_accuracy": 0.1559939756989479, "num_tokens": 60181419.0, "step": 27800 }, { "entropy": 6.399376487731933, "epoch": 2.9754400984536358, "grad_norm": 1.046875, "learning_rate": 0.0004129258374417044, "loss": 6.0437, "mean_token_accuracy": 0.14658892750740052, "num_tokens": 60192466.0, "step": 27805 }, { "entropy": 6.411078691482544, "epoch": 2.9759751725614, "grad_norm": 1.1875, "learning_rate": 0.0004128956280372888, "loss": 5.9845, "mean_token_accuracy": 0.15611995980143548, "num_tokens": 60203081.0, "step": 27810 }, { "entropy": 6.485304975509644, "epoch": 2.9765102466691635, "grad_norm": 1.234375, "learning_rate": 0.00041286541465115635, "loss": 6.0187, "mean_token_accuracy": 0.1460866793990135, "num_tokens": 60214203.0, "step": 27815 }, { "entropy": 6.3723798274993895, "epoch": 2.9770453207769276, "grad_norm": 1.140625, "learning_rate": 0.0004128351972841793, "loss": 5.9689, "mean_token_accuracy": 0.15676268488168715, "num_tokens": 60224904.0, "step": 27820 }, { "entropy": 6.3804093360900875, "epoch": 2.9775803948846917, "grad_norm": 1.0859375, "learning_rate": 0.00041280497593723046, "loss": 6.0368, "mean_token_accuracy": 0.14689499735832215, "num_tokens": 60234962.0, "step": 27825 }, { "entropy": 6.3462708473205565, "epoch": 2.9781154689924554, "grad_norm": 1.09375, "learning_rate": 0.00041277475061118223, "loss": 5.9693, "mean_token_accuracy": 0.15667566657066345, "num_tokens": 60245758.0, "step": 27830 }, { "entropy": 6.43084487915039, "epoch": 2.9786505431002195, "grad_norm": 1.15625, "learning_rate": 0.00041274452130690746, "loss": 6.0204, "mean_token_accuracy": 0.15288722962141038, "num_tokens": 60256809.0, "step": 27835 }, { "entropy": 6.395932006835937, "epoch": 2.9791856172079836, "grad_norm": 1.1640625, "learning_rate": 0.0004127142880252789, "loss": 5.9881, "mean_token_accuracy": 0.15346962809562684, "num_tokens": 60268031.0, "step": 27840 }, { "entropy": 6.409318685531616, "epoch": 2.9797206913157472, "grad_norm": 1.125, "learning_rate": 0.0004126840507671698, "loss": 6.1275, "mean_token_accuracy": 0.14479172229766846, "num_tokens": 60278526.0, "step": 27845 }, { "entropy": 6.5521461963653564, "epoch": 2.980255765423511, "grad_norm": 1.0859375, "learning_rate": 0.00041265380953345293, "loss": 6.0742, "mean_token_accuracy": 0.14635577350854873, "num_tokens": 60289412.0, "step": 27850 }, { "entropy": 6.337393188476563, "epoch": 2.980790839531275, "grad_norm": 1.2421875, "learning_rate": 0.00041262356432500175, "loss": 5.9974, "mean_token_accuracy": 0.15124422758817674, "num_tokens": 60301242.0, "step": 27855 }, { "entropy": 6.334535598754883, "epoch": 2.981325913639039, "grad_norm": 1.0703125, "learning_rate": 0.00041259331514268945, "loss": 5.9611, "mean_token_accuracy": 0.15645937919616698, "num_tokens": 60311625.0, "step": 27860 }, { "entropy": 6.449796152114868, "epoch": 2.9818609877468027, "grad_norm": 1.3515625, "learning_rate": 0.00041256306198738946, "loss": 6.063, "mean_token_accuracy": 0.15028143003582956, "num_tokens": 60321973.0, "step": 27865 }, { "entropy": 6.463498306274414, "epoch": 2.982396061854567, "grad_norm": 1.046875, "learning_rate": 0.00041253280485997545, "loss": 6.0473, "mean_token_accuracy": 0.1504575192928314, "num_tokens": 60332445.0, "step": 27870 }, { "entropy": 6.354874992370606, "epoch": 2.982931135962331, "grad_norm": 1.0703125, "learning_rate": 0.000412502543761321, "loss": 5.9499, "mean_token_accuracy": 0.1633001148700714, "num_tokens": 60342378.0, "step": 27875 }, { "entropy": 6.383931732177734, "epoch": 2.9834662100700946, "grad_norm": 1.0859375, "learning_rate": 0.0004124722786922999, "loss": 6.0145, "mean_token_accuracy": 0.1516401067376137, "num_tokens": 60353502.0, "step": 27880 }, { "entropy": 6.395445871353149, "epoch": 2.9840012841778587, "grad_norm": 1.0234375, "learning_rate": 0.0004124420096537861, "loss": 6.0073, "mean_token_accuracy": 0.15757451355457305, "num_tokens": 60364243.0, "step": 27885 }, { "entropy": 6.484308481216431, "epoch": 2.984536358285623, "grad_norm": 1.125, "learning_rate": 0.0004124117366466536, "loss": 6.0935, "mean_token_accuracy": 0.14572470933198928, "num_tokens": 60375354.0, "step": 27890 }, { "entropy": 6.385288524627685, "epoch": 2.9850714323933865, "grad_norm": 1.109375, "learning_rate": 0.00041238145967177647, "loss": 5.9547, "mean_token_accuracy": 0.15147797167301177, "num_tokens": 60385474.0, "step": 27895 }, { "entropy": 6.378428840637207, "epoch": 2.9856065065011506, "grad_norm": 1.1171875, "learning_rate": 0.0004123511787300291, "loss": 5.9623, "mean_token_accuracy": 0.1551640197634697, "num_tokens": 60395339.0, "step": 27900 }, { "entropy": 6.351378297805786, "epoch": 2.986141580608914, "grad_norm": 1.1640625, "learning_rate": 0.0004123208938222856, "loss": 5.9645, "mean_token_accuracy": 0.1584985539317131, "num_tokens": 60406202.0, "step": 27905 }, { "entropy": 6.395198583602905, "epoch": 2.9866766547166783, "grad_norm": 1.375, "learning_rate": 0.00041229060494942074, "loss": 5.9906, "mean_token_accuracy": 0.1583083376288414, "num_tokens": 60417251.0, "step": 27910 }, { "entropy": 6.448562288284302, "epoch": 2.987211728824442, "grad_norm": 1.1953125, "learning_rate": 0.00041226031211230883, "loss": 6.0321, "mean_token_accuracy": 0.15249701961874962, "num_tokens": 60427299.0, "step": 27915 }, { "entropy": 6.426578378677368, "epoch": 2.987746802932206, "grad_norm": 1.203125, "learning_rate": 0.00041223001531182475, "loss": 6.0502, "mean_token_accuracy": 0.15108333230018617, "num_tokens": 60438076.0, "step": 27920 }, { "entropy": 6.3369556903839115, "epoch": 2.98828187703997, "grad_norm": 1.1484375, "learning_rate": 0.00041219971454884325, "loss": 5.9149, "mean_token_accuracy": 0.16050671637058259, "num_tokens": 60449479.0, "step": 27925 }, { "entropy": 6.463460111618042, "epoch": 2.988816951147734, "grad_norm": 1.0859375, "learning_rate": 0.0004121694098242392, "loss": 6.0548, "mean_token_accuracy": 0.1454125702381134, "num_tokens": 60460664.0, "step": 27930 }, { "entropy": 6.375191640853882, "epoch": 2.989352025255498, "grad_norm": 1.2265625, "learning_rate": 0.0004121391011388878, "loss": 5.9834, "mean_token_accuracy": 0.15021138191223143, "num_tokens": 60470673.0, "step": 27935 }, { "entropy": 6.419484329223633, "epoch": 2.989887099363262, "grad_norm": 1.125, "learning_rate": 0.00041210878849366414, "loss": 6.0001, "mean_token_accuracy": 0.15605052858591079, "num_tokens": 60481378.0, "step": 27940 }, { "entropy": 6.365107154846191, "epoch": 2.9904221734710257, "grad_norm": 1.0703125, "learning_rate": 0.0004120784718894434, "loss": 6.0087, "mean_token_accuracy": 0.15472591072320938, "num_tokens": 60491264.0, "step": 27945 }, { "entropy": 6.28216667175293, "epoch": 2.99095724757879, "grad_norm": 1.109375, "learning_rate": 0.0004120481513271011, "loss": 5.9465, "mean_token_accuracy": 0.15602346807718276, "num_tokens": 60502053.0, "step": 27950 }, { "entropy": 6.376031160354614, "epoch": 2.9914923216865534, "grad_norm": 1.1953125, "learning_rate": 0.0004120178268075127, "loss": 5.9886, "mean_token_accuracy": 0.15874341875314713, "num_tokens": 60511995.0, "step": 27955 }, { "entropy": 6.442895889282227, "epoch": 2.9920273957943175, "grad_norm": 1.1328125, "learning_rate": 0.0004119874983315538, "loss": 6.0596, "mean_token_accuracy": 0.14812778383493425, "num_tokens": 60523127.0, "step": 27960 }, { "entropy": 6.416716241836548, "epoch": 2.992562469902081, "grad_norm": 1.0546875, "learning_rate": 0.00041195716590010015, "loss": 5.9831, "mean_token_accuracy": 0.1509658768773079, "num_tokens": 60533448.0, "step": 27965 }, { "entropy": 6.41400408744812, "epoch": 2.9930975440098453, "grad_norm": 1.1484375, "learning_rate": 0.0004119268295140275, "loss": 6.0706, "mean_token_accuracy": 0.14557889103889465, "num_tokens": 60544369.0, "step": 27970 }, { "entropy": 6.364752912521363, "epoch": 2.9936326181176094, "grad_norm": 1.03125, "learning_rate": 0.000411896489174212, "loss": 5.9639, "mean_token_accuracy": 0.14873671233654023, "num_tokens": 60555518.0, "step": 27975 }, { "entropy": 6.312710189819336, "epoch": 2.994167692225373, "grad_norm": 1.0625, "learning_rate": 0.0004118661448815295, "loss": 5.9035, "mean_token_accuracy": 0.16673846691846847, "num_tokens": 60566358.0, "step": 27980 }, { "entropy": 6.385731983184814, "epoch": 2.994702766333137, "grad_norm": 1.1328125, "learning_rate": 0.00041183579663685646, "loss": 6.0088, "mean_token_accuracy": 0.1563554175198078, "num_tokens": 60577935.0, "step": 27985 }, { "entropy": 6.445630693435669, "epoch": 2.9952378404409012, "grad_norm": 1.125, "learning_rate": 0.0004118054444410688, "loss": 5.9753, "mean_token_accuracy": 0.14864011406898497, "num_tokens": 60588690.0, "step": 27990 }, { "entropy": 6.325843334197998, "epoch": 2.995772914548665, "grad_norm": 1.046875, "learning_rate": 0.00041177508829504334, "loss": 5.9625, "mean_token_accuracy": 0.16436417251825333, "num_tokens": 60599090.0, "step": 27995 }, { "entropy": 6.421711063385009, "epoch": 2.996307988656429, "grad_norm": 0.9921875, "learning_rate": 0.00041174472819965636, "loss": 6.0269, "mean_token_accuracy": 0.1519262582063675, "num_tokens": 60609166.0, "step": 28000 }, { "entropy": 6.398266267776489, "epoch": 2.996843062764193, "grad_norm": 1.0390625, "learning_rate": 0.00041171436415578456, "loss": 6.0047, "mean_token_accuracy": 0.15476619750261306, "num_tokens": 60619769.0, "step": 28005 }, { "entropy": 6.3467248439788815, "epoch": 2.9973781368719568, "grad_norm": 1.421875, "learning_rate": 0.0004116839961643046, "loss": 6.0348, "mean_token_accuracy": 0.14713102728128433, "num_tokens": 60630984.0, "step": 28010 }, { "entropy": 6.420001125335693, "epoch": 2.997913210979721, "grad_norm": 1.90625, "learning_rate": 0.00041165362422609366, "loss": 6.063, "mean_token_accuracy": 0.14390405341982843, "num_tokens": 60642019.0, "step": 28015 }, { "entropy": 6.453832197189331, "epoch": 2.9984482850874845, "grad_norm": 1.109375, "learning_rate": 0.00041162324834202843, "loss": 6.0655, "mean_token_accuracy": 0.15092823654413223, "num_tokens": 60653359.0, "step": 28020 }, { "entropy": 6.34514217376709, "epoch": 2.9989833591952486, "grad_norm": 1.1484375, "learning_rate": 0.0004115928685129861, "loss": 5.8729, "mean_token_accuracy": 0.16281300336122512, "num_tokens": 60663627.0, "step": 28025 }, { "entropy": 6.373288774490357, "epoch": 2.9995184333030123, "grad_norm": 1.265625, "learning_rate": 0.00041156248473984383, "loss": 6.0344, "mean_token_accuracy": 0.15680067539215087, "num_tokens": 60675641.0, "step": 28030 }, { "entropy": 6.360870944129096, "epoch": 3.0, "grad_norm": 2.296875, "learning_rate": 0.0004115320970234791, "loss": 5.9725, "mean_token_accuracy": 0.15491654641098446, "num_tokens": 60684774.0, "step": 28035 }, { "entropy": 6.410578918457031, "epoch": 3.000535074107764, "grad_norm": 1.1484375, "learning_rate": 0.00041150170536476924, "loss": 6.0053, "mean_token_accuracy": 0.15335453152656556, "num_tokens": 60696477.0, "step": 28040 }, { "entropy": 6.406473636627197, "epoch": 3.0010701482155278, "grad_norm": 1.3125, "learning_rate": 0.00041147130976459175, "loss": 5.8741, "mean_token_accuracy": 0.15755282789468766, "num_tokens": 60709214.0, "step": 28045 }, { "entropy": 6.347487354278565, "epoch": 3.001605222323292, "grad_norm": 1.0703125, "learning_rate": 0.0004114409102238245, "loss": 5.8919, "mean_token_accuracy": 0.16338802874088287, "num_tokens": 60719938.0, "step": 28050 }, { "entropy": 6.220105457305908, "epoch": 3.0021402964310555, "grad_norm": 1.046875, "learning_rate": 0.00041141050674334495, "loss": 5.8139, "mean_token_accuracy": 0.16220145374536515, "num_tokens": 60730131.0, "step": 28055 }, { "entropy": 6.395209932327271, "epoch": 3.0026753705388196, "grad_norm": 1.0625, "learning_rate": 0.0004113800993240313, "loss": 5.9515, "mean_token_accuracy": 0.16078096777200698, "num_tokens": 60741652.0, "step": 28060 }, { "entropy": 6.347190189361572, "epoch": 3.0032104446465837, "grad_norm": 1.234375, "learning_rate": 0.00041134968796676145, "loss": 5.8776, "mean_token_accuracy": 0.16018084287643433, "num_tokens": 60752945.0, "step": 28065 }, { "entropy": 6.388903188705444, "epoch": 3.0037455187543474, "grad_norm": 1.15625, "learning_rate": 0.00041131927267241356, "loss": 5.9803, "mean_token_accuracy": 0.1514182671904564, "num_tokens": 60762695.0, "step": 28070 }, { "entropy": 6.3682637214660645, "epoch": 3.0042805928621115, "grad_norm": 1.3125, "learning_rate": 0.00041128885344186573, "loss": 5.9646, "mean_token_accuracy": 0.15713794827461242, "num_tokens": 60773158.0, "step": 28075 }, { "entropy": 6.354068326950073, "epoch": 3.004815666969875, "grad_norm": 1.125, "learning_rate": 0.00041125843027599643, "loss": 5.9971, "mean_token_accuracy": 0.15476930290460586, "num_tokens": 60784171.0, "step": 28080 }, { "entropy": 6.4271049976348875, "epoch": 3.005350741077639, "grad_norm": 1.234375, "learning_rate": 0.00041122800317568414, "loss": 5.9718, "mean_token_accuracy": 0.15115359872579576, "num_tokens": 60794961.0, "step": 28085 }, { "entropy": 6.435961723327637, "epoch": 3.0058858151854033, "grad_norm": 1.15625, "learning_rate": 0.0004111975721418074, "loss": 5.9004, "mean_token_accuracy": 0.15814843773841858, "num_tokens": 60805749.0, "step": 28090 }, { "entropy": 6.243784666061401, "epoch": 3.006420889293167, "grad_norm": 1.2578125, "learning_rate": 0.00041116713717524484, "loss": 5.8908, "mean_token_accuracy": 0.1612974688410759, "num_tokens": 60815701.0, "step": 28095 }, { "entropy": 6.377077198028564, "epoch": 3.006955963400931, "grad_norm": 1.2734375, "learning_rate": 0.0004111366982768754, "loss": 5.9758, "mean_token_accuracy": 0.15683746337890625, "num_tokens": 60826656.0, "step": 28100 }, { "entropy": 6.419827222824097, "epoch": 3.007491037508695, "grad_norm": 1.3359375, "learning_rate": 0.00041110625544757786, "loss": 5.9504, "mean_token_accuracy": 0.15912319123744964, "num_tokens": 60837839.0, "step": 28105 }, { "entropy": 6.3940911293029785, "epoch": 3.008026111616459, "grad_norm": 1.125, "learning_rate": 0.0004110758086882314, "loss": 5.9555, "mean_token_accuracy": 0.16115356087684632, "num_tokens": 60848323.0, "step": 28110 }, { "entropy": 6.314225482940674, "epoch": 3.008561185724223, "grad_norm": 1.0234375, "learning_rate": 0.000411045357999715, "loss": 5.9379, "mean_token_accuracy": 0.15480845123529435, "num_tokens": 60859049.0, "step": 28115 }, { "entropy": 6.43319730758667, "epoch": 3.0090962598319866, "grad_norm": 1.109375, "learning_rate": 0.0004110149033829081, "loss": 5.9877, "mean_token_accuracy": 0.15089671313762665, "num_tokens": 60870451.0, "step": 28120 }, { "entropy": 6.440711450576782, "epoch": 3.0096313339397507, "grad_norm": 1.140625, "learning_rate": 0.00041098444483868995, "loss": 5.9751, "mean_token_accuracy": 0.1604703962802887, "num_tokens": 60880530.0, "step": 28125 }, { "entropy": 6.38129415512085, "epoch": 3.010166408047515, "grad_norm": 1.1953125, "learning_rate": 0.00041095398236793996, "loss": 5.946, "mean_token_accuracy": 0.1557653769850731, "num_tokens": 60892170.0, "step": 28130 }, { "entropy": 6.379058742523194, "epoch": 3.0107014821552784, "grad_norm": 1.1171875, "learning_rate": 0.000410923515971538, "loss": 5.9672, "mean_token_accuracy": 0.15465303659439086, "num_tokens": 60902880.0, "step": 28135 }, { "entropy": 6.421414613723755, "epoch": 3.0112365562630425, "grad_norm": 1.0703125, "learning_rate": 0.0004108930456503635, "loss": 5.9501, "mean_token_accuracy": 0.15876395702362062, "num_tokens": 60912860.0, "step": 28140 }, { "entropy": 6.388135290145874, "epoch": 3.011771630370806, "grad_norm": 1.109375, "learning_rate": 0.00041086257140529646, "loss": 6.0202, "mean_token_accuracy": 0.15192243456840515, "num_tokens": 60923303.0, "step": 28145 }, { "entropy": 6.4348164081573485, "epoch": 3.0123067044785703, "grad_norm": 1.09375, "learning_rate": 0.0004108320932372167, "loss": 5.9939, "mean_token_accuracy": 0.1543033629655838, "num_tokens": 60935077.0, "step": 28150 }, { "entropy": 6.478570890426636, "epoch": 3.0128417785863344, "grad_norm": 1.0625, "learning_rate": 0.0004108016111470044, "loss": 6.0165, "mean_token_accuracy": 0.15099378377199174, "num_tokens": 60945883.0, "step": 28155 }, { "entropy": 6.410815668106079, "epoch": 3.013376852694098, "grad_norm": 1.2578125, "learning_rate": 0.0004107711251355396, "loss": 5.9349, "mean_token_accuracy": 0.14934438318014145, "num_tokens": 60957714.0, "step": 28160 }, { "entropy": 6.3299659252166744, "epoch": 3.013911926801862, "grad_norm": 1.1640625, "learning_rate": 0.0004107406352037027, "loss": 5.8907, "mean_token_accuracy": 0.15581267923116685, "num_tokens": 60968570.0, "step": 28165 }, { "entropy": 6.328975582122803, "epoch": 3.014447000909626, "grad_norm": 1.03125, "learning_rate": 0.000410710141352374, "loss": 5.9378, "mean_token_accuracy": 0.15894635021686554, "num_tokens": 60979079.0, "step": 28170 }, { "entropy": 6.431506252288818, "epoch": 3.01498207501739, "grad_norm": 1.0859375, "learning_rate": 0.00041067964358243404, "loss": 5.9627, "mean_token_accuracy": 0.15078989267349244, "num_tokens": 60990308.0, "step": 28175 }, { "entropy": 6.3574690341949465, "epoch": 3.015517149125154, "grad_norm": 1.109375, "learning_rate": 0.0004106491418947635, "loss": 5.8645, "mean_token_accuracy": 0.1561115190386772, "num_tokens": 61000819.0, "step": 28180 }, { "entropy": 6.344383096694946, "epoch": 3.0160522232329177, "grad_norm": 1.1875, "learning_rate": 0.000410618636290243, "loss": 5.9913, "mean_token_accuracy": 0.15278788655996323, "num_tokens": 61011071.0, "step": 28185 }, { "entropy": 6.440320301055908, "epoch": 3.0165872973406818, "grad_norm": 1.109375, "learning_rate": 0.00041058812676975337, "loss": 5.987, "mean_token_accuracy": 0.15354321002960206, "num_tokens": 61022499.0, "step": 28190 }, { "entropy": 6.412061023712158, "epoch": 3.0171223714484454, "grad_norm": 1.125, "learning_rate": 0.0004105576133341757, "loss": 5.9878, "mean_token_accuracy": 0.15434856861829757, "num_tokens": 61033250.0, "step": 28195 }, { "entropy": 6.296201705932617, "epoch": 3.0176574455562095, "grad_norm": 1.1015625, "learning_rate": 0.00041052709598439095, "loss": 5.9266, "mean_token_accuracy": 0.16604892164468765, "num_tokens": 61043222.0, "step": 28200 }, { "entropy": 6.379208087921143, "epoch": 3.0181925196639736, "grad_norm": 1.0703125, "learning_rate": 0.0004104965747212804, "loss": 6.0098, "mean_token_accuracy": 0.1558920919895172, "num_tokens": 61054830.0, "step": 28205 }, { "entropy": 6.423280382156372, "epoch": 3.0187275937717373, "grad_norm": 1.2109375, "learning_rate": 0.0004104660495457252, "loss": 6.0111, "mean_token_accuracy": 0.1564246028661728, "num_tokens": 61066385.0, "step": 28210 }, { "entropy": 6.5106419086456295, "epoch": 3.0192626678795014, "grad_norm": 1.140625, "learning_rate": 0.000410435520458607, "loss": 6.1185, "mean_token_accuracy": 0.14558550268411635, "num_tokens": 61077434.0, "step": 28215 }, { "entropy": 6.461359930038452, "epoch": 3.019797741987265, "grad_norm": 1.125, "learning_rate": 0.00041040498746080714, "loss": 5.9976, "mean_token_accuracy": 0.15234235376119615, "num_tokens": 61087661.0, "step": 28220 }, { "entropy": 6.4351903915405275, "epoch": 3.020332816095029, "grad_norm": 1.1328125, "learning_rate": 0.00041037445055320724, "loss": 6.0336, "mean_token_accuracy": 0.1492777556180954, "num_tokens": 61098364.0, "step": 28225 }, { "entropy": 6.398683404922485, "epoch": 3.0208678902027932, "grad_norm": 1.1484375, "learning_rate": 0.00041034390973668916, "loss": 5.92, "mean_token_accuracy": 0.1537134826183319, "num_tokens": 61109061.0, "step": 28230 }, { "entropy": 6.42435884475708, "epoch": 3.021402964310557, "grad_norm": 1.2109375, "learning_rate": 0.0004103133650121346, "loss": 5.9113, "mean_token_accuracy": 0.16135355085134506, "num_tokens": 61119191.0, "step": 28235 }, { "entropy": 6.315273761749268, "epoch": 3.021938038418321, "grad_norm": 1.1953125, "learning_rate": 0.00041028281638042576, "loss": 5.9424, "mean_token_accuracy": 0.15969904661178588, "num_tokens": 61130494.0, "step": 28240 }, { "entropy": 6.367139720916748, "epoch": 3.022473112526085, "grad_norm": 1.09375, "learning_rate": 0.0004102522638424445, "loss": 5.9293, "mean_token_accuracy": 0.15698544830083846, "num_tokens": 61141660.0, "step": 28245 }, { "entropy": 6.392562770843506, "epoch": 3.0230081866338487, "grad_norm": 1.0703125, "learning_rate": 0.00041022170739907324, "loss": 5.905, "mean_token_accuracy": 0.14998074620962143, "num_tokens": 61152864.0, "step": 28250 }, { "entropy": 6.396698760986328, "epoch": 3.023543260741613, "grad_norm": 1.09375, "learning_rate": 0.0004101911470511941, "loss": 5.9878, "mean_token_accuracy": 0.14747442454099655, "num_tokens": 61163877.0, "step": 28255 }, { "entropy": 6.3430884838104244, "epoch": 3.0240783348493765, "grad_norm": 1.109375, "learning_rate": 0.0004101605827996896, "loss": 5.8931, "mean_token_accuracy": 0.16737851202487947, "num_tokens": 61173771.0, "step": 28260 }, { "entropy": 6.281631374359131, "epoch": 3.0246134089571406, "grad_norm": 1.171875, "learning_rate": 0.0004101300146454423, "loss": 5.8729, "mean_token_accuracy": 0.1682440385222435, "num_tokens": 61183652.0, "step": 28265 }, { "entropy": 6.293827295303345, "epoch": 3.0251484830649047, "grad_norm": 1.0859375, "learning_rate": 0.00041009944258933473, "loss": 5.9268, "mean_token_accuracy": 0.16174889355897903, "num_tokens": 61195119.0, "step": 28270 }, { "entropy": 6.336084985733033, "epoch": 3.0256835571726683, "grad_norm": 1.1015625, "learning_rate": 0.00041006886663224983, "loss": 5.9782, "mean_token_accuracy": 0.1518526554107666, "num_tokens": 61206736.0, "step": 28275 }, { "entropy": 6.482681322097778, "epoch": 3.0262186312804324, "grad_norm": 1.140625, "learning_rate": 0.00041003828677507037, "loss": 6.0161, "mean_token_accuracy": 0.15353835076093675, "num_tokens": 61217064.0, "step": 28280 }, { "entropy": 6.3584208488464355, "epoch": 3.026753705388196, "grad_norm": 1.03125, "learning_rate": 0.00041000770301867934, "loss": 5.8667, "mean_token_accuracy": 0.16415573805570602, "num_tokens": 61228520.0, "step": 28285 }, { "entropy": 6.368174123764038, "epoch": 3.02728877949596, "grad_norm": 1.1328125, "learning_rate": 0.0004099771153639599, "loss": 5.9144, "mean_token_accuracy": 0.1541571006178856, "num_tokens": 61239835.0, "step": 28290 }, { "entropy": 6.354197311401367, "epoch": 3.0278238536037243, "grad_norm": 1.171875, "learning_rate": 0.0004099465238117951, "loss": 5.9306, "mean_token_accuracy": 0.15384036749601365, "num_tokens": 61250996.0, "step": 28295 }, { "entropy": 6.4189433574676515, "epoch": 3.028358927711488, "grad_norm": 1.0859375, "learning_rate": 0.0004099159283630685, "loss": 6.0088, "mean_token_accuracy": 0.15350789576768875, "num_tokens": 61261384.0, "step": 28300 }, { "entropy": 6.388854217529297, "epoch": 3.028894001819252, "grad_norm": 1.0390625, "learning_rate": 0.00040988532901866336, "loss": 5.9247, "mean_token_accuracy": 0.1600810021162033, "num_tokens": 61271519.0, "step": 28305 }, { "entropy": 6.399069452285767, "epoch": 3.0294290759270157, "grad_norm": 1.296875, "learning_rate": 0.0004098547257794633, "loss": 5.8931, "mean_token_accuracy": 0.1630704939365387, "num_tokens": 61281769.0, "step": 28310 }, { "entropy": 6.393092393875122, "epoch": 3.02996415003478, "grad_norm": 1.0625, "learning_rate": 0.00040982411864635206, "loss": 5.9893, "mean_token_accuracy": 0.15064765959978105, "num_tokens": 61293081.0, "step": 28315 }, { "entropy": 6.246655225753784, "epoch": 3.030499224142544, "grad_norm": 1.234375, "learning_rate": 0.0004097935076202133, "loss": 5.8607, "mean_token_accuracy": 0.1611799493432045, "num_tokens": 61303374.0, "step": 28320 }, { "entropy": 6.407056713104248, "epoch": 3.0310342982503076, "grad_norm": 1.375, "learning_rate": 0.00040976289270193097, "loss": 5.9986, "mean_token_accuracy": 0.14634813517332076, "num_tokens": 61314700.0, "step": 28325 }, { "entropy": 6.439814281463623, "epoch": 3.0315693723580717, "grad_norm": 1.140625, "learning_rate": 0.00040973227389238897, "loss": 5.9315, "mean_token_accuracy": 0.16132057309150696, "num_tokens": 61325463.0, "step": 28330 }, { "entropy": 6.388495445251465, "epoch": 3.0321044464658353, "grad_norm": 1.171875, "learning_rate": 0.0004097016511924716, "loss": 5.9003, "mean_token_accuracy": 0.1566726967692375, "num_tokens": 61337069.0, "step": 28335 }, { "entropy": 6.352614498138427, "epoch": 3.0326395205735994, "grad_norm": 1.1640625, "learning_rate": 0.0004096710246030629, "loss": 5.9708, "mean_token_accuracy": 0.15383996665477753, "num_tokens": 61347407.0, "step": 28340 }, { "entropy": 6.354043674468994, "epoch": 3.0331745946813635, "grad_norm": 1.09375, "learning_rate": 0.00040964039412504734, "loss": 5.9422, "mean_token_accuracy": 0.1611252874135971, "num_tokens": 61357950.0, "step": 28345 }, { "entropy": 6.43016881942749, "epoch": 3.033709668789127, "grad_norm": 1.234375, "learning_rate": 0.00040960975975930925, "loss": 5.9749, "mean_token_accuracy": 0.14716098606586456, "num_tokens": 61368394.0, "step": 28350 }, { "entropy": 6.37865195274353, "epoch": 3.0342447428968913, "grad_norm": 1.109375, "learning_rate": 0.0004095791215067333, "loss": 5.9883, "mean_token_accuracy": 0.1508757010102272, "num_tokens": 61379763.0, "step": 28355 }, { "entropy": 6.322301006317138, "epoch": 3.034779817004655, "grad_norm": 1.1171875, "learning_rate": 0.00040954847936820423, "loss": 5.914, "mean_token_accuracy": 0.15714257657527925, "num_tokens": 61390404.0, "step": 28360 }, { "entropy": 6.414450788497925, "epoch": 3.035314891112419, "grad_norm": 1.0625, "learning_rate": 0.00040951783334460657, "loss": 5.9234, "mean_token_accuracy": 0.15261534005403518, "num_tokens": 61401979.0, "step": 28365 }, { "entropy": 6.456271409988403, "epoch": 3.035849965220183, "grad_norm": 1.140625, "learning_rate": 0.0004094871834368254, "loss": 5.965, "mean_token_accuracy": 0.15429696887731553, "num_tokens": 61413306.0, "step": 28370 }, { "entropy": 6.299610757827759, "epoch": 3.036385039327947, "grad_norm": 1.09375, "learning_rate": 0.0004094565296457457, "loss": 5.7576, "mean_token_accuracy": 0.1691513791680336, "num_tokens": 61423371.0, "step": 28375 }, { "entropy": 6.395692157745361, "epoch": 3.036920113435711, "grad_norm": 1.125, "learning_rate": 0.00040942587197225275, "loss": 5.9773, "mean_token_accuracy": 0.15387784987688063, "num_tokens": 61435163.0, "step": 28380 }, { "entropy": 6.387797737121582, "epoch": 3.037455187543475, "grad_norm": 1.140625, "learning_rate": 0.0004093952104172315, "loss": 5.935, "mean_token_accuracy": 0.16325450092554092, "num_tokens": 61445485.0, "step": 28385 }, { "entropy": 6.394241285324097, "epoch": 3.0379902616512386, "grad_norm": 1.28125, "learning_rate": 0.0004093645449815674, "loss": 5.9034, "mean_token_accuracy": 0.1560398146510124, "num_tokens": 61455765.0, "step": 28390 }, { "entropy": 6.332876968383789, "epoch": 3.0385253357590027, "grad_norm": 1.8125, "learning_rate": 0.00040933387566614605, "loss": 5.9114, "mean_token_accuracy": 0.16253480762243272, "num_tokens": 61467337.0, "step": 28395 }, { "entropy": 6.458051443099976, "epoch": 3.0390604098667664, "grad_norm": 1.0078125, "learning_rate": 0.00040930320247185284, "loss": 6.0142, "mean_token_accuracy": 0.14988963156938553, "num_tokens": 61478568.0, "step": 28400 }, { "entropy": 6.448244667053222, "epoch": 3.0395954839745305, "grad_norm": 1.4765625, "learning_rate": 0.0004092725253995736, "loss": 5.9963, "mean_token_accuracy": 0.152896186709404, "num_tokens": 61488456.0, "step": 28405 }, { "entropy": 6.392563152313232, "epoch": 3.0401305580822946, "grad_norm": 1.2109375, "learning_rate": 0.00040924184445019404, "loss": 5.9646, "mean_token_accuracy": 0.15897001028060914, "num_tokens": 61499996.0, "step": 28410 }, { "entropy": 6.42240834236145, "epoch": 3.0406656321900583, "grad_norm": 1.0859375, "learning_rate": 0.00040921115962460003, "loss": 5.9271, "mean_token_accuracy": 0.1565393440425396, "num_tokens": 61511271.0, "step": 28415 }, { "entropy": 6.409761714935303, "epoch": 3.0412007062978224, "grad_norm": 1.0546875, "learning_rate": 0.0004091804709236777, "loss": 5.9565, "mean_token_accuracy": 0.15277852416038512, "num_tokens": 61522284.0, "step": 28420 }, { "entropy": 6.351357364654541, "epoch": 3.041735780405586, "grad_norm": 1.0390625, "learning_rate": 0.0004091497783483131, "loss": 5.8626, "mean_token_accuracy": 0.16499153673648834, "num_tokens": 61532494.0, "step": 28425 }, { "entropy": 6.300922060012818, "epoch": 3.04227085451335, "grad_norm": 1.1171875, "learning_rate": 0.0004091190818993925, "loss": 5.9326, "mean_token_accuracy": 0.15331994295120238, "num_tokens": 61543017.0, "step": 28430 }, { "entropy": 6.412792062759399, "epoch": 3.042805928621114, "grad_norm": 1.1171875, "learning_rate": 0.0004090883815778023, "loss": 5.9767, "mean_token_accuracy": 0.15794235989451408, "num_tokens": 61552984.0, "step": 28435 }, { "entropy": 6.479819250106812, "epoch": 3.043341002728878, "grad_norm": 1.1875, "learning_rate": 0.0004090576773844288, "loss": 5.9284, "mean_token_accuracy": 0.1557047411799431, "num_tokens": 61564045.0, "step": 28440 }, { "entropy": 6.343698120117187, "epoch": 3.043876076836642, "grad_norm": 1.109375, "learning_rate": 0.00040902696932015886, "loss": 5.935, "mean_token_accuracy": 0.15817259550094603, "num_tokens": 61575369.0, "step": 28445 }, { "entropy": 6.379320764541626, "epoch": 3.0444111509444056, "grad_norm": 1.1171875, "learning_rate": 0.00040899625738587895, "loss": 6.003, "mean_token_accuracy": 0.1543554574251175, "num_tokens": 61586221.0, "step": 28450 }, { "entropy": 6.403201580047607, "epoch": 3.0449462250521697, "grad_norm": 1.1796875, "learning_rate": 0.00040896554158247587, "loss": 5.9899, "mean_token_accuracy": 0.15057801008224486, "num_tokens": 61597091.0, "step": 28455 }, { "entropy": 6.355846929550171, "epoch": 3.045481299159934, "grad_norm": 1.0703125, "learning_rate": 0.00040893482191083677, "loss": 5.978, "mean_token_accuracy": 0.1554054096341133, "num_tokens": 61608026.0, "step": 28460 }, { "entropy": 6.431783390045166, "epoch": 3.0460163732676975, "grad_norm": 1.0390625, "learning_rate": 0.00040890409837184835, "loss": 5.9984, "mean_token_accuracy": 0.15024198293685914, "num_tokens": 61620078.0, "step": 28465 }, { "entropy": 6.326252603530884, "epoch": 3.0465514473754616, "grad_norm": 1.125, "learning_rate": 0.0004088733709663979, "loss": 5.9405, "mean_token_accuracy": 0.15764973908662797, "num_tokens": 61630839.0, "step": 28470 }, { "entropy": 6.339142179489135, "epoch": 3.0470865214832252, "grad_norm": 1.1640625, "learning_rate": 0.0004088426396953728, "loss": 5.8783, "mean_token_accuracy": 0.15866363048553467, "num_tokens": 61640927.0, "step": 28475 }, { "entropy": 6.356405210494995, "epoch": 3.0476215955909893, "grad_norm": 1.28125, "learning_rate": 0.0004088119045596602, "loss": 5.9317, "mean_token_accuracy": 0.16193742901086808, "num_tokens": 61650631.0, "step": 28480 }, { "entropy": 6.410415697097778, "epoch": 3.0481566696987534, "grad_norm": 1.296875, "learning_rate": 0.0004087811655601477, "loss": 6.001, "mean_token_accuracy": 0.14802129492163657, "num_tokens": 61661493.0, "step": 28485 }, { "entropy": 6.416506052017212, "epoch": 3.048691743806517, "grad_norm": 1.1171875, "learning_rate": 0.00040875042269772284, "loss": 6.0172, "mean_token_accuracy": 0.15235678479075432, "num_tokens": 61673116.0, "step": 28490 }, { "entropy": 6.371775579452515, "epoch": 3.049226817914281, "grad_norm": 1.1171875, "learning_rate": 0.00040871967597327333, "loss": 5.8828, "mean_token_accuracy": 0.1569344162940979, "num_tokens": 61683471.0, "step": 28495 }, { "entropy": 6.369965934753418, "epoch": 3.049761892022045, "grad_norm": 1.2265625, "learning_rate": 0.00040868892538768693, "loss": 6.0343, "mean_token_accuracy": 0.15754009187221527, "num_tokens": 61693264.0, "step": 28500 }, { "entropy": 6.329267263412476, "epoch": 3.050296966129809, "grad_norm": 1.15625, "learning_rate": 0.0004086581709418516, "loss": 5.9106, "mean_token_accuracy": 0.15956670492887498, "num_tokens": 61703566.0, "step": 28505 }, { "entropy": 6.424130153656006, "epoch": 3.050832040237573, "grad_norm": 1.15625, "learning_rate": 0.00040862741263665537, "loss": 5.9405, "mean_token_accuracy": 0.15940434485673904, "num_tokens": 61714981.0, "step": 28510 }, { "entropy": 6.369848728179932, "epoch": 3.0513671143453367, "grad_norm": 1.109375, "learning_rate": 0.00040859665047298635, "loss": 5.932, "mean_token_accuracy": 0.1638392314314842, "num_tokens": 61726036.0, "step": 28515 }, { "entropy": 6.387115716934204, "epoch": 3.051902188453101, "grad_norm": 1.1171875, "learning_rate": 0.0004085658844517329, "loss": 6.0136, "mean_token_accuracy": 0.14700674042105674, "num_tokens": 61736614.0, "step": 28520 }, { "entropy": 6.28294620513916, "epoch": 3.052437262560865, "grad_norm": 1.2421875, "learning_rate": 0.0004085351145737832, "loss": 5.8231, "mean_token_accuracy": 0.1625307872891426, "num_tokens": 61746817.0, "step": 28525 }, { "entropy": 6.27222752571106, "epoch": 3.0529723366686286, "grad_norm": 1.0234375, "learning_rate": 0.0004085043408400259, "loss": 5.7912, "mean_token_accuracy": 0.16653142720460892, "num_tokens": 61757714.0, "step": 28530 }, { "entropy": 6.365730285644531, "epoch": 3.0535074107763926, "grad_norm": 1.125, "learning_rate": 0.0004084735632513495, "loss": 5.9246, "mean_token_accuracy": 0.15825700163841247, "num_tokens": 61768719.0, "step": 28535 }, { "entropy": 6.349934387207031, "epoch": 3.0540424848841563, "grad_norm": 1.0859375, "learning_rate": 0.00040844278180864274, "loss": 5.95, "mean_token_accuracy": 0.1522581085562706, "num_tokens": 61778942.0, "step": 28540 }, { "entropy": 6.288566541671753, "epoch": 3.0545775589919204, "grad_norm": 1.2265625, "learning_rate": 0.0004084119965127944, "loss": 5.883, "mean_token_accuracy": 0.1649262487888336, "num_tokens": 61789427.0, "step": 28545 }, { "entropy": 6.335991716384887, "epoch": 3.0551126330996845, "grad_norm": 1.140625, "learning_rate": 0.0004083812073646933, "loss": 5.8891, "mean_token_accuracy": 0.1553598716855049, "num_tokens": 61799702.0, "step": 28550 }, { "entropy": 6.347196292877197, "epoch": 3.055647707207448, "grad_norm": 1.0703125, "learning_rate": 0.00040835041436522874, "loss": 5.8664, "mean_token_accuracy": 0.17108393758535384, "num_tokens": 61809346.0, "step": 28555 }, { "entropy": 6.392491149902344, "epoch": 3.0561827813152123, "grad_norm": 1.1796875, "learning_rate": 0.00040831961751528964, "loss": 5.9497, "mean_token_accuracy": 0.15463506951928138, "num_tokens": 61819762.0, "step": 28560 }, { "entropy": 6.370887708663941, "epoch": 3.056717855422976, "grad_norm": 1.1171875, "learning_rate": 0.00040828881681576534, "loss": 5.9771, "mean_token_accuracy": 0.1490010440349579, "num_tokens": 61830624.0, "step": 28565 }, { "entropy": 6.44011869430542, "epoch": 3.05725292953074, "grad_norm": 1.078125, "learning_rate": 0.0004082580122675451, "loss": 5.9619, "mean_token_accuracy": 0.15798602104187012, "num_tokens": 61841684.0, "step": 28570 }, { "entropy": 6.282222080230713, "epoch": 3.057788003638504, "grad_norm": 1.140625, "learning_rate": 0.00040822720387151856, "loss": 5.9205, "mean_token_accuracy": 0.16210090965032578, "num_tokens": 61852239.0, "step": 28575 }, { "entropy": 6.376353120803833, "epoch": 3.0583230777462678, "grad_norm": 1.0859375, "learning_rate": 0.0004081963916285752, "loss": 5.9919, "mean_token_accuracy": 0.14766313433647155, "num_tokens": 61863014.0, "step": 28580 }, { "entropy": 6.401373672485351, "epoch": 3.058858151854032, "grad_norm": 1.1640625, "learning_rate": 0.00040816557553960474, "loss": 5.8539, "mean_token_accuracy": 0.15622504204511642, "num_tokens": 61873819.0, "step": 28585 }, { "entropy": 6.369393920898437, "epoch": 3.0593932259617955, "grad_norm": 1.03125, "learning_rate": 0.00040813475560549705, "loss": 5.9101, "mean_token_accuracy": 0.1606850415468216, "num_tokens": 61885866.0, "step": 28590 }, { "entropy": 6.271197319030762, "epoch": 3.0599283000695596, "grad_norm": 1.09375, "learning_rate": 0.000408103931827142, "loss": 5.8584, "mean_token_accuracy": 0.16748880743980407, "num_tokens": 61895836.0, "step": 28595 }, { "entropy": 6.245470333099365, "epoch": 3.0604633741773237, "grad_norm": 1.2109375, "learning_rate": 0.0004080731042054296, "loss": 5.7513, "mean_token_accuracy": 0.17570354044437408, "num_tokens": 61906284.0, "step": 28600 }, { "entropy": 6.300371170043945, "epoch": 3.0609984482850874, "grad_norm": 1.0625, "learning_rate": 0.00040804227274125, "loss": 5.9482, "mean_token_accuracy": 0.15838894695043565, "num_tokens": 61917024.0, "step": 28605 }, { "entropy": 6.422211980819702, "epoch": 3.0615335223928515, "grad_norm": 1.3203125, "learning_rate": 0.00040801143743549343, "loss": 5.912, "mean_token_accuracy": 0.15592464804649353, "num_tokens": 61927631.0, "step": 28610 }, { "entropy": 6.384283971786499, "epoch": 3.062068596500615, "grad_norm": 1.0546875, "learning_rate": 0.00040798059828905036, "loss": 5.9204, "mean_token_accuracy": 0.16163181215524675, "num_tokens": 61938443.0, "step": 28615 }, { "entropy": 6.340835475921631, "epoch": 3.0626036706083792, "grad_norm": 1.1953125, "learning_rate": 0.0004079497553028112, "loss": 5.887, "mean_token_accuracy": 0.15771032273769378, "num_tokens": 61949148.0, "step": 28620 }, { "entropy": 6.345901441574097, "epoch": 3.0631387447161433, "grad_norm": 1.09375, "learning_rate": 0.0004079189084776665, "loss": 5.9418, "mean_token_accuracy": 0.16134458631277085, "num_tokens": 61959052.0, "step": 28625 }, { "entropy": 6.3141742706298825, "epoch": 3.063673818823907, "grad_norm": 1.0859375, "learning_rate": 0.000407888057814507, "loss": 5.8939, "mean_token_accuracy": 0.15774061977863313, "num_tokens": 61969906.0, "step": 28630 }, { "entropy": 6.35964937210083, "epoch": 3.064208892931671, "grad_norm": 1.0703125, "learning_rate": 0.00040785720331422355, "loss": 6.027, "mean_token_accuracy": 0.14716862812638282, "num_tokens": 61981511.0, "step": 28635 }, { "entropy": 6.3945362091064455, "epoch": 3.064743967039435, "grad_norm": 1.2109375, "learning_rate": 0.000407826344977707, "loss": 5.9946, "mean_token_accuracy": 0.15431149303913116, "num_tokens": 61993404.0, "step": 28640 }, { "entropy": 6.375944662094116, "epoch": 3.065279041147199, "grad_norm": 1.1875, "learning_rate": 0.0004077954828058484, "loss": 5.9975, "mean_token_accuracy": 0.14948178976774215, "num_tokens": 62004216.0, "step": 28645 }, { "entropy": 6.374816989898681, "epoch": 3.065814115254963, "grad_norm": 1.0859375, "learning_rate": 0.0004077646167995389, "loss": 5.9977, "mean_token_accuracy": 0.14840189814567567, "num_tokens": 62014841.0, "step": 28650 }, { "entropy": 6.363291788101196, "epoch": 3.0663491893627266, "grad_norm": 1.171875, "learning_rate": 0.00040773374695966976, "loss": 5.9378, "mean_token_accuracy": 0.16072302013635636, "num_tokens": 62025024.0, "step": 28655 }, { "entropy": 6.335741186141968, "epoch": 3.0668842634704907, "grad_norm": 1.1953125, "learning_rate": 0.0004077028732871323, "loss": 5.9554, "mean_token_accuracy": 0.15184295922517776, "num_tokens": 62037892.0, "step": 28660 }, { "entropy": 6.4262970924377445, "epoch": 3.067419337578255, "grad_norm": 1.1328125, "learning_rate": 0.00040767199578281793, "loss": 5.939, "mean_token_accuracy": 0.1591559410095215, "num_tokens": 62048226.0, "step": 28665 }, { "entropy": 6.4508216857910154, "epoch": 3.0679544116860185, "grad_norm": 1.234375, "learning_rate": 0.00040764111444761847, "loss": 6.0017, "mean_token_accuracy": 0.1513245016336441, "num_tokens": 62059339.0, "step": 28670 }, { "entropy": 6.415534400939942, "epoch": 3.0684894857937826, "grad_norm": 1.1328125, "learning_rate": 0.00040761022928242544, "loss": 5.9155, "mean_token_accuracy": 0.15683366507291793, "num_tokens": 62069008.0, "step": 28675 }, { "entropy": 6.341966915130615, "epoch": 3.069024559901546, "grad_norm": 1.0703125, "learning_rate": 0.00040757934028813066, "loss": 5.93, "mean_token_accuracy": 0.15979500263929367, "num_tokens": 62079405.0, "step": 28680 }, { "entropy": 6.313480806350708, "epoch": 3.0695596340093103, "grad_norm": 1.46875, "learning_rate": 0.000407548447465626, "loss": 5.8787, "mean_token_accuracy": 0.15607775896787643, "num_tokens": 62089928.0, "step": 28685 }, { "entropy": 6.343041133880615, "epoch": 3.0700947081170744, "grad_norm": 1.390625, "learning_rate": 0.0004075175508158036, "loss": 5.9162, "mean_token_accuracy": 0.1587581977248192, "num_tokens": 62100956.0, "step": 28690 }, { "entropy": 6.423848724365234, "epoch": 3.070629782224838, "grad_norm": 1.140625, "learning_rate": 0.00040748665033955557, "loss": 5.9242, "mean_token_accuracy": 0.16073236465454102, "num_tokens": 62111673.0, "step": 28695 }, { "entropy": 6.396885871887207, "epoch": 3.071164856332602, "grad_norm": 1.296875, "learning_rate": 0.0004074557460377741, "loss": 5.9687, "mean_token_accuracy": 0.15681967437267302, "num_tokens": 62122273.0, "step": 28700 }, { "entropy": 6.321943998336792, "epoch": 3.071699930440366, "grad_norm": 1.1015625, "learning_rate": 0.0004074248379113516, "loss": 5.9435, "mean_token_accuracy": 0.15532801300287247, "num_tokens": 62132836.0, "step": 28705 }, { "entropy": 6.439528512954712, "epoch": 3.07223500454813, "grad_norm": 1.203125, "learning_rate": 0.0004073939259611805, "loss": 5.9791, "mean_token_accuracy": 0.15018371492624283, "num_tokens": 62144228.0, "step": 28710 }, { "entropy": 6.347901964187622, "epoch": 3.072770078655894, "grad_norm": 1.1328125, "learning_rate": 0.0004073630101881534, "loss": 5.9165, "mean_token_accuracy": 0.1614033028483391, "num_tokens": 62155126.0, "step": 28715 }, { "entropy": 6.3915486335754395, "epoch": 3.0733051527636577, "grad_norm": 1.1796875, "learning_rate": 0.0004073320905931629, "loss": 5.9557, "mean_token_accuracy": 0.15612259805202483, "num_tokens": 62165973.0, "step": 28720 }, { "entropy": 6.375660133361817, "epoch": 3.0738402268714218, "grad_norm": 1.0625, "learning_rate": 0.0004073011671771019, "loss": 5.9286, "mean_token_accuracy": 0.15736870020627974, "num_tokens": 62176258.0, "step": 28725 }, { "entropy": 6.344737768173218, "epoch": 3.0743753009791854, "grad_norm": 1.1328125, "learning_rate": 0.00040727023994086345, "loss": 5.9851, "mean_token_accuracy": 0.156227408349514, "num_tokens": 62186078.0, "step": 28730 }, { "entropy": 6.409447717666626, "epoch": 3.0749103750869495, "grad_norm": 1.21875, "learning_rate": 0.0004072393088853402, "loss": 5.9576, "mean_token_accuracy": 0.15663001239299773, "num_tokens": 62197951.0, "step": 28735 }, { "entropy": 6.3858119487762455, "epoch": 3.0754454491947136, "grad_norm": 1.0546875, "learning_rate": 0.00040720837401142556, "loss": 5.9259, "mean_token_accuracy": 0.15541888475418092, "num_tokens": 62210187.0, "step": 28740 }, { "entropy": 6.4048034191131595, "epoch": 3.0759805233024773, "grad_norm": 1.1015625, "learning_rate": 0.0004071774353200128, "loss": 6.001, "mean_token_accuracy": 0.1503763422369957, "num_tokens": 62220561.0, "step": 28745 }, { "entropy": 6.381892967224121, "epoch": 3.0765155974102414, "grad_norm": 1.0703125, "learning_rate": 0.000407146492811995, "loss": 5.9867, "mean_token_accuracy": 0.14545643627643584, "num_tokens": 62232378.0, "step": 28750 }, { "entropy": 6.377732992172241, "epoch": 3.077050671518005, "grad_norm": 1.09375, "learning_rate": 0.0004071155464882659, "loss": 5.949, "mean_token_accuracy": 0.15475846230983734, "num_tokens": 62244823.0, "step": 28755 }, { "entropy": 6.356764316558838, "epoch": 3.077585745625769, "grad_norm": 1.0625, "learning_rate": 0.0004070845963497189, "loss": 5.8869, "mean_token_accuracy": 0.15887467712163925, "num_tokens": 62255070.0, "step": 28760 }, { "entropy": 6.4052284240722654, "epoch": 3.0781208197335332, "grad_norm": 1.0625, "learning_rate": 0.0004070536423972478, "loss": 6.0235, "mean_token_accuracy": 0.14962061643600463, "num_tokens": 62267081.0, "step": 28765 }, { "entropy": 6.436206674575805, "epoch": 3.078655893841297, "grad_norm": 1.46875, "learning_rate": 0.0004070226846317463, "loss": 6.0084, "mean_token_accuracy": 0.15470675528049468, "num_tokens": 62277512.0, "step": 28770 }, { "entropy": 6.3725659370422365, "epoch": 3.079190967949061, "grad_norm": 1.09375, "learning_rate": 0.00040699172305410833, "loss": 5.9168, "mean_token_accuracy": 0.16207044422626496, "num_tokens": 62287827.0, "step": 28775 }, { "entropy": 6.349752712249756, "epoch": 3.0797260420568247, "grad_norm": 1.34375, "learning_rate": 0.00040696075766522797, "loss": 5.972, "mean_token_accuracy": 0.15166343227028847, "num_tokens": 62299977.0, "step": 28780 }, { "entropy": 6.425171136856079, "epoch": 3.0802611161645888, "grad_norm": 1.0625, "learning_rate": 0.0004069297884659992, "loss": 5.9345, "mean_token_accuracy": 0.1589284896850586, "num_tokens": 62310157.0, "step": 28785 }, { "entropy": 6.325991678237915, "epoch": 3.080796190272353, "grad_norm": 1.1953125, "learning_rate": 0.0004068988154573163, "loss": 5.8835, "mean_token_accuracy": 0.16407085955142975, "num_tokens": 62320420.0, "step": 28790 }, { "entropy": 6.349064588546753, "epoch": 3.0813312643801165, "grad_norm": 1.078125, "learning_rate": 0.00040686783864007367, "loss": 5.9704, "mean_token_accuracy": 0.15712748616933822, "num_tokens": 62330551.0, "step": 28795 }, { "entropy": 6.484666728973389, "epoch": 3.0818663384878806, "grad_norm": 1.1328125, "learning_rate": 0.0004068368580151658, "loss": 5.9598, "mean_token_accuracy": 0.15234360843896866, "num_tokens": 62341131.0, "step": 28800 }, { "entropy": 6.4222148895263675, "epoch": 3.0824014125956447, "grad_norm": 1.09375, "learning_rate": 0.0004068058735834871, "loss": 6.0136, "mean_token_accuracy": 0.15784823447465895, "num_tokens": 62352432.0, "step": 28805 }, { "entropy": 6.464736986160278, "epoch": 3.0829364867034084, "grad_norm": 1.0625, "learning_rate": 0.0004067748853459323, "loss": 6.055, "mean_token_accuracy": 0.14557261541485786, "num_tokens": 62364029.0, "step": 28810 }, { "entropy": 6.459315299987793, "epoch": 3.0834715608111725, "grad_norm": 1.15625, "learning_rate": 0.0004067438933033963, "loss": 5.9271, "mean_token_accuracy": 0.1565525598824024, "num_tokens": 62373804.0, "step": 28815 }, { "entropy": 6.28947958946228, "epoch": 3.084006634918936, "grad_norm": 1.203125, "learning_rate": 0.00040671289745677387, "loss": 5.8193, "mean_token_accuracy": 0.17013251036405563, "num_tokens": 62384400.0, "step": 28820 }, { "entropy": 6.42479944229126, "epoch": 3.0845417090267, "grad_norm": 1.1015625, "learning_rate": 0.00040668189780695995, "loss": 6.017, "mean_token_accuracy": 0.1469181627035141, "num_tokens": 62395228.0, "step": 28825 }, { "entropy": 6.389599704742432, "epoch": 3.0850767831344643, "grad_norm": 1.265625, "learning_rate": 0.0004066508943548498, "loss": 5.9826, "mean_token_accuracy": 0.15213237404823304, "num_tokens": 62405458.0, "step": 28830 }, { "entropy": 6.461113595962525, "epoch": 3.085611857242228, "grad_norm": 1.7109375, "learning_rate": 0.00040661988710133856, "loss": 6.0153, "mean_token_accuracy": 0.15962322801351547, "num_tokens": 62416838.0, "step": 28835 }, { "entropy": 6.362878370285034, "epoch": 3.086146931349992, "grad_norm": 0.921875, "learning_rate": 0.00040658887604732154, "loss": 5.8538, "mean_token_accuracy": 0.15486933588981627, "num_tokens": 62427680.0, "step": 28840 }, { "entropy": 6.306428575515747, "epoch": 3.0866820054577557, "grad_norm": 1.046875, "learning_rate": 0.0004065578611936943, "loss": 5.9261, "mean_token_accuracy": 0.1594337671995163, "num_tokens": 62438785.0, "step": 28845 }, { "entropy": 6.428799629211426, "epoch": 3.08721707956552, "grad_norm": 1.234375, "learning_rate": 0.00040652684254135227, "loss": 6.0176, "mean_token_accuracy": 0.15119824558496475, "num_tokens": 62450362.0, "step": 28850 }, { "entropy": 6.462934303283691, "epoch": 3.087752153673284, "grad_norm": 1.1953125, "learning_rate": 0.0004064958200911911, "loss": 5.966, "mean_token_accuracy": 0.15713853687047957, "num_tokens": 62461962.0, "step": 28855 }, { "entropy": 6.3036689281463625, "epoch": 3.0882872277810476, "grad_norm": 1.125, "learning_rate": 0.0004064647938441066, "loss": 5.927, "mean_token_accuracy": 0.1616468459367752, "num_tokens": 62473290.0, "step": 28860 }, { "entropy": 6.445675897598266, "epoch": 3.0888223018888117, "grad_norm": 1.1640625, "learning_rate": 0.00040643376380099466, "loss": 6.1457, "mean_token_accuracy": 0.14052013978362082, "num_tokens": 62484219.0, "step": 28865 }, { "entropy": 6.389561414718628, "epoch": 3.0893573759965753, "grad_norm": 1.109375, "learning_rate": 0.0004064027299627514, "loss": 5.9362, "mean_token_accuracy": 0.15447770208120346, "num_tokens": 62494542.0, "step": 28870 }, { "entropy": 6.3965263843536375, "epoch": 3.0898924501043394, "grad_norm": 1.03125, "learning_rate": 0.00040637169233027264, "loss": 5.909, "mean_token_accuracy": 0.16100103855133058, "num_tokens": 62505351.0, "step": 28875 }, { "entropy": 6.335253429412842, "epoch": 3.0904275242121035, "grad_norm": 1.078125, "learning_rate": 0.00040634065090445473, "loss": 5.9444, "mean_token_accuracy": 0.16651447415351867, "num_tokens": 62515848.0, "step": 28880 }, { "entropy": 6.364611387252808, "epoch": 3.090962598319867, "grad_norm": 1.0078125, "learning_rate": 0.000406309605686194, "loss": 6.051, "mean_token_accuracy": 0.14376300573349, "num_tokens": 62527042.0, "step": 28885 }, { "entropy": 6.425643873214722, "epoch": 3.0914976724276313, "grad_norm": 1.1328125, "learning_rate": 0.0004062785566763869, "loss": 5.9909, "mean_token_accuracy": 0.1532561346888542, "num_tokens": 62537830.0, "step": 28890 }, { "entropy": 6.487792730331421, "epoch": 3.092032746535395, "grad_norm": 1.15625, "learning_rate": 0.0004062475038759298, "loss": 6.0019, "mean_token_accuracy": 0.14552898555994034, "num_tokens": 62548391.0, "step": 28895 }, { "entropy": 6.3615264892578125, "epoch": 3.092567820643159, "grad_norm": 1.125, "learning_rate": 0.0004062164472857196, "loss": 5.8651, "mean_token_accuracy": 0.15817667096853255, "num_tokens": 62557832.0, "step": 28900 }, { "entropy": 6.339266920089722, "epoch": 3.093102894750923, "grad_norm": 1.0078125, "learning_rate": 0.00040618538690665286, "loss": 6.0013, "mean_token_accuracy": 0.15629299432039262, "num_tokens": 62568451.0, "step": 28905 }, { "entropy": 6.295372104644775, "epoch": 3.093637968858687, "grad_norm": 1.0703125, "learning_rate": 0.00040615432273962657, "loss": 5.8241, "mean_token_accuracy": 0.16875190138816834, "num_tokens": 62579230.0, "step": 28910 }, { "entropy": 6.378387689590454, "epoch": 3.094173042966451, "grad_norm": 1.0234375, "learning_rate": 0.0004061232547855376, "loss": 5.9596, "mean_token_accuracy": 0.15371047109365463, "num_tokens": 62589853.0, "step": 28915 }, { "entropy": 6.4686285018920895, "epoch": 3.094708117074215, "grad_norm": 1.390625, "learning_rate": 0.0004060921830452831, "loss": 5.9821, "mean_token_accuracy": 0.16031330451369286, "num_tokens": 62600929.0, "step": 28920 }, { "entropy": 6.294451427459717, "epoch": 3.0952431911819787, "grad_norm": 1.1328125, "learning_rate": 0.0004060611075197601, "loss": 5.867, "mean_token_accuracy": 0.16166459769010544, "num_tokens": 62611583.0, "step": 28925 }, { "entropy": 6.41592493057251, "epoch": 3.0957782652897428, "grad_norm": 0.99609375, "learning_rate": 0.0004060300282098661, "loss": 5.9875, "mean_token_accuracy": 0.15419264435768126, "num_tokens": 62622609.0, "step": 28930 }, { "entropy": 6.417395544052124, "epoch": 3.0963133393975064, "grad_norm": 1.21875, "learning_rate": 0.00040599894511649854, "loss": 6.0581, "mean_token_accuracy": 0.14485844001173973, "num_tokens": 62633859.0, "step": 28935 }, { "entropy": 6.379701042175293, "epoch": 3.0968484135052705, "grad_norm": 1.1796875, "learning_rate": 0.0004059678582405548, "loss": 5.9092, "mean_token_accuracy": 0.15374657660722732, "num_tokens": 62644409.0, "step": 28940 }, { "entropy": 6.430233907699585, "epoch": 3.0973834876130346, "grad_norm": 1.203125, "learning_rate": 0.0004059367675829325, "loss": 5.958, "mean_token_accuracy": 0.15865289568901061, "num_tokens": 62653703.0, "step": 28945 }, { "entropy": 6.303378248214722, "epoch": 3.0979185617207983, "grad_norm": 1.265625, "learning_rate": 0.00040590567314452945, "loss": 5.9244, "mean_token_accuracy": 0.15482567399740219, "num_tokens": 62664413.0, "step": 28950 }, { "entropy": 6.271467208862305, "epoch": 3.0984536358285624, "grad_norm": 1.1953125, "learning_rate": 0.00040587457492624357, "loss": 5.8378, "mean_token_accuracy": 0.1652549535036087, "num_tokens": 62674520.0, "step": 28955 }, { "entropy": 6.404071187973022, "epoch": 3.098988709936326, "grad_norm": 1.2890625, "learning_rate": 0.00040584347292897265, "loss": 5.9813, "mean_token_accuracy": 0.1559201344847679, "num_tokens": 62685584.0, "step": 28960 }, { "entropy": 6.362800264358521, "epoch": 3.09952378404409, "grad_norm": 1.1484375, "learning_rate": 0.0004058123671536149, "loss": 5.8801, "mean_token_accuracy": 0.15910542458295823, "num_tokens": 62695999.0, "step": 28965 }, { "entropy": 6.3795764446258545, "epoch": 3.1000588581518542, "grad_norm": 1.1875, "learning_rate": 0.0004057812576010684, "loss": 5.989, "mean_token_accuracy": 0.15176919251680374, "num_tokens": 62706486.0, "step": 28970 }, { "entropy": 6.340600442886353, "epoch": 3.100593932259618, "grad_norm": 1.0859375, "learning_rate": 0.00040575014427223145, "loss": 5.8837, "mean_token_accuracy": 0.1638282373547554, "num_tokens": 62716667.0, "step": 28975 }, { "entropy": 6.376776599884034, "epoch": 3.101129006367382, "grad_norm": 1.2890625, "learning_rate": 0.00040571902716800246, "loss": 5.958, "mean_token_accuracy": 0.15509114414453506, "num_tokens": 62728101.0, "step": 28980 }, { "entropy": 6.380063915252686, "epoch": 3.1016640804751456, "grad_norm": 1.0859375, "learning_rate": 0.00040568790628927996, "loss": 5.9559, "mean_token_accuracy": 0.155802683532238, "num_tokens": 62739796.0, "step": 28985 }, { "entropy": 6.392907810211182, "epoch": 3.1021991545829097, "grad_norm": 1.15625, "learning_rate": 0.00040565678163696246, "loss": 5.931, "mean_token_accuracy": 0.15625655353069307, "num_tokens": 62751270.0, "step": 28990 }, { "entropy": 6.449762487411499, "epoch": 3.102734228690674, "grad_norm": 1.140625, "learning_rate": 0.0004056256532119488, "loss": 6.0006, "mean_token_accuracy": 0.14710320979356767, "num_tokens": 62761890.0, "step": 28995 }, { "entropy": 6.440887403488159, "epoch": 3.1032693027984375, "grad_norm": 1.109375, "learning_rate": 0.0004055945210151378, "loss": 5.9398, "mean_token_accuracy": 0.16247427314519883, "num_tokens": 62773177.0, "step": 29000 }, { "entropy": 6.375812578201294, "epoch": 3.1038043769062016, "grad_norm": 1.125, "learning_rate": 0.0004055633850474283, "loss": 5.9807, "mean_token_accuracy": 0.15744848996400834, "num_tokens": 62784511.0, "step": 29005 }, { "entropy": 6.375190210342407, "epoch": 3.1043394510139652, "grad_norm": 1.09375, "learning_rate": 0.0004055322453097194, "loss": 6.0388, "mean_token_accuracy": 0.14934343546628953, "num_tokens": 62795618.0, "step": 29010 }, { "entropy": 6.453359603881836, "epoch": 3.1048745251217293, "grad_norm": 1.0390625, "learning_rate": 0.00040550110180291024, "loss": 6.0172, "mean_token_accuracy": 0.14914680719375611, "num_tokens": 62805936.0, "step": 29015 }, { "entropy": 6.466299247741699, "epoch": 3.1054095992294934, "grad_norm": 1.1875, "learning_rate": 0.0004054699545279001, "loss": 5.9887, "mean_token_accuracy": 0.1534016475081444, "num_tokens": 62815511.0, "step": 29020 }, { "entropy": 6.361545515060425, "epoch": 3.105944673337257, "grad_norm": 1.078125, "learning_rate": 0.0004054388034855884, "loss": 5.9975, "mean_token_accuracy": 0.15505649298429489, "num_tokens": 62826382.0, "step": 29025 }, { "entropy": 6.422174310684204, "epoch": 3.106479747445021, "grad_norm": 1.15625, "learning_rate": 0.00040540764867687463, "loss": 6.0713, "mean_token_accuracy": 0.14908858835697175, "num_tokens": 62836546.0, "step": 29030 }, { "entropy": 6.459440040588379, "epoch": 3.107014821552785, "grad_norm": 1.1640625, "learning_rate": 0.00040537649010265826, "loss": 5.9723, "mean_token_accuracy": 0.154618801176548, "num_tokens": 62847407.0, "step": 29035 }, { "entropy": 6.449863338470459, "epoch": 3.107549895660549, "grad_norm": 1.1484375, "learning_rate": 0.000405345327763839, "loss": 6.026, "mean_token_accuracy": 0.15188460648059846, "num_tokens": 62857139.0, "step": 29040 }, { "entropy": 6.3002959251403805, "epoch": 3.108084969768313, "grad_norm": 1.0546875, "learning_rate": 0.00040531416166131686, "loss": 5.8915, "mean_token_accuracy": 0.16010829657316208, "num_tokens": 62867674.0, "step": 29045 }, { "entropy": 6.33874831199646, "epoch": 3.1086200438760767, "grad_norm": 1.25, "learning_rate": 0.00040528299179599155, "loss": 5.9253, "mean_token_accuracy": 0.1548525482416153, "num_tokens": 62878204.0, "step": 29050 }, { "entropy": 6.377233266830444, "epoch": 3.109155117983841, "grad_norm": 1.15625, "learning_rate": 0.0004052518181687631, "loss": 5.9425, "mean_token_accuracy": 0.15535207986831664, "num_tokens": 62888737.0, "step": 29055 }, { "entropy": 6.3253114223480225, "epoch": 3.1096901920916045, "grad_norm": 1.15625, "learning_rate": 0.00040522064078053174, "loss": 5.8845, "mean_token_accuracy": 0.17012615948915483, "num_tokens": 62899481.0, "step": 29060 }, { "entropy": 6.433621788024903, "epoch": 3.1102252661993686, "grad_norm": 1.0546875, "learning_rate": 0.00040518945963219767, "loss": 5.9994, "mean_token_accuracy": 0.1480240747332573, "num_tokens": 62910298.0, "step": 29065 }, { "entropy": 6.359187936782837, "epoch": 3.1107603403071327, "grad_norm": 1.265625, "learning_rate": 0.00040515827472466134, "loss": 5.8709, "mean_token_accuracy": 0.16265425384044646, "num_tokens": 62921132.0, "step": 29070 }, { "entropy": 6.32359504699707, "epoch": 3.1112954144148963, "grad_norm": 1.0703125, "learning_rate": 0.0004051270860588229, "loss": 5.9646, "mean_token_accuracy": 0.1616337090730667, "num_tokens": 62932107.0, "step": 29075 }, { "entropy": 6.342312526702881, "epoch": 3.1118304885226604, "grad_norm": 1.0546875, "learning_rate": 0.0004050958936355834, "loss": 5.8938, "mean_token_accuracy": 0.15413456559181213, "num_tokens": 62943177.0, "step": 29080 }, { "entropy": 6.331737852096557, "epoch": 3.1123655626304245, "grad_norm": 1.1796875, "learning_rate": 0.00040506469745584314, "loss": 5.9874, "mean_token_accuracy": 0.15459535866975785, "num_tokens": 62954017.0, "step": 29085 }, { "entropy": 6.35627589225769, "epoch": 3.112900636738188, "grad_norm": 0.98046875, "learning_rate": 0.00040503349752050294, "loss": 5.9629, "mean_token_accuracy": 0.15655742436647416, "num_tokens": 62964352.0, "step": 29090 }, { "entropy": 6.2931530475616455, "epoch": 3.1134357108459523, "grad_norm": 1.0546875, "learning_rate": 0.0004050022938304639, "loss": 5.8329, "mean_token_accuracy": 0.15995000153779984, "num_tokens": 62974414.0, "step": 29095 }, { "entropy": 6.357062721252442, "epoch": 3.113970784953716, "grad_norm": 1.09375, "learning_rate": 0.0004049710863866268, "loss": 5.968, "mean_token_accuracy": 0.14876952469348909, "num_tokens": 62985874.0, "step": 29100 }, { "entropy": 6.431989049911499, "epoch": 3.11450585906148, "grad_norm": 1.1875, "learning_rate": 0.0004049398751898929, "loss": 5.943, "mean_token_accuracy": 0.16048902422189712, "num_tokens": 62996553.0, "step": 29105 }, { "entropy": 6.374354362487793, "epoch": 3.115040933169244, "grad_norm": 1.0859375, "learning_rate": 0.0004049086602411633, "loss": 5.9831, "mean_token_accuracy": 0.1504706084728241, "num_tokens": 63008094.0, "step": 29110 }, { "entropy": 6.365182590484619, "epoch": 3.115576007277008, "grad_norm": 1.0546875, "learning_rate": 0.00040487744154133945, "loss": 5.9525, "mean_token_accuracy": 0.15034159719944, "num_tokens": 63018517.0, "step": 29115 }, { "entropy": 6.366289949417114, "epoch": 3.116111081384772, "grad_norm": 1.1015625, "learning_rate": 0.00040484621909132277, "loss": 5.8864, "mean_token_accuracy": 0.1610504299402237, "num_tokens": 63029759.0, "step": 29120 }, { "entropy": 6.372790431976318, "epoch": 3.1166461554925355, "grad_norm": 1.0234375, "learning_rate": 0.0004048149928920146, "loss": 5.9592, "mean_token_accuracy": 0.15761468559503555, "num_tokens": 63039862.0, "step": 29125 }, { "entropy": 6.413615894317627, "epoch": 3.1171812296002996, "grad_norm": 1.09375, "learning_rate": 0.0004047837629443169, "loss": 6.0207, "mean_token_accuracy": 0.15135485380887986, "num_tokens": 63050298.0, "step": 29130 }, { "entropy": 6.174431705474854, "epoch": 3.1177163037080637, "grad_norm": 1.15625, "learning_rate": 0.00040475252924913126, "loss": 5.7141, "mean_token_accuracy": 0.1886140987277031, "num_tokens": 63061280.0, "step": 29135 }, { "entropy": 6.3511982440948485, "epoch": 3.1182513778158274, "grad_norm": 1.1328125, "learning_rate": 0.0004047212918073595, "loss": 5.9706, "mean_token_accuracy": 0.1574666306376457, "num_tokens": 63071188.0, "step": 29140 }, { "entropy": 6.370877265930176, "epoch": 3.1187864519235915, "grad_norm": 1.125, "learning_rate": 0.00040469005061990364, "loss": 5.9281, "mean_token_accuracy": 0.1671280726790428, "num_tokens": 63081804.0, "step": 29145 }, { "entropy": 6.382890605926514, "epoch": 3.119321526031355, "grad_norm": 1.125, "learning_rate": 0.0004046588056876659, "loss": 5.9818, "mean_token_accuracy": 0.1525287926197052, "num_tokens": 63092671.0, "step": 29150 }, { "entropy": 6.440302944183349, "epoch": 3.1198566001391193, "grad_norm": 1.15625, "learning_rate": 0.00040462755701154834, "loss": 5.9653, "mean_token_accuracy": 0.15194248408079147, "num_tokens": 63104867.0, "step": 29155 }, { "entropy": 6.370601940155029, "epoch": 3.1203916742468834, "grad_norm": 1.0078125, "learning_rate": 0.00040459630459245327, "loss": 5.8815, "mean_token_accuracy": 0.159385646879673, "num_tokens": 63115491.0, "step": 29160 }, { "entropy": 6.284829950332641, "epoch": 3.120926748354647, "grad_norm": 1.0234375, "learning_rate": 0.0004045650484312831, "loss": 5.9054, "mean_token_accuracy": 0.1650222510099411, "num_tokens": 63127240.0, "step": 29165 }, { "entropy": 6.3696576118469235, "epoch": 3.121461822462411, "grad_norm": 1.1484375, "learning_rate": 0.0004045337885289404, "loss": 5.9094, "mean_token_accuracy": 0.15872186422348022, "num_tokens": 63137180.0, "step": 29170 }, { "entropy": 6.393830490112305, "epoch": 3.1219968965701748, "grad_norm": 1.0625, "learning_rate": 0.0004045025248863277, "loss": 6.028, "mean_token_accuracy": 0.15240999907255173, "num_tokens": 63147772.0, "step": 29175 }, { "entropy": 6.411131763458252, "epoch": 3.122531970677939, "grad_norm": 1.078125, "learning_rate": 0.0004044712575043479, "loss": 5.9565, "mean_token_accuracy": 0.160857655107975, "num_tokens": 63158592.0, "step": 29180 }, { "entropy": 6.33933916091919, "epoch": 3.123067044785703, "grad_norm": 1.0703125, "learning_rate": 0.00040443998638390363, "loss": 5.8784, "mean_token_accuracy": 0.16267508566379546, "num_tokens": 63168260.0, "step": 29185 }, { "entropy": 6.366162109375, "epoch": 3.1236021188934666, "grad_norm": 1.09375, "learning_rate": 0.00040440871152589797, "loss": 5.9294, "mean_token_accuracy": 0.15483079850673676, "num_tokens": 63178650.0, "step": 29190 }, { "entropy": 6.413234806060791, "epoch": 3.1241371930012307, "grad_norm": 1.1875, "learning_rate": 0.00040437743293123403, "loss": 5.9216, "mean_token_accuracy": 0.15838480293750762, "num_tokens": 63188491.0, "step": 29195 }, { "entropy": 6.3536951541900635, "epoch": 3.124672267108995, "grad_norm": 1.078125, "learning_rate": 0.00040434615060081473, "loss": 5.8701, "mean_token_accuracy": 0.1625393658876419, "num_tokens": 63198915.0, "step": 29200 }, { "entropy": 6.2969245433807375, "epoch": 3.1252073412167585, "grad_norm": 1.078125, "learning_rate": 0.0004043148645355436, "loss": 5.881, "mean_token_accuracy": 0.1598527640104294, "num_tokens": 63210010.0, "step": 29205 }, { "entropy": 6.340915966033935, "epoch": 3.1257424153245226, "grad_norm": 1.15625, "learning_rate": 0.000404283574736324, "loss": 5.9801, "mean_token_accuracy": 0.15568754747509955, "num_tokens": 63220233.0, "step": 29210 }, { "entropy": 6.356151437759399, "epoch": 3.1262774894322862, "grad_norm": 1.0234375, "learning_rate": 0.0004042522812040592, "loss": 5.8743, "mean_token_accuracy": 0.1614884153008461, "num_tokens": 63231258.0, "step": 29215 }, { "entropy": 6.322793292999267, "epoch": 3.1268125635400503, "grad_norm": 1.0859375, "learning_rate": 0.000404220983939653, "loss": 5.8971, "mean_token_accuracy": 0.15594108998775483, "num_tokens": 63241781.0, "step": 29220 }, { "entropy": 6.41398344039917, "epoch": 3.1273476376478144, "grad_norm": 1.25, "learning_rate": 0.0004041896829440091, "loss": 5.9642, "mean_token_accuracy": 0.1551414281129837, "num_tokens": 63253359.0, "step": 29225 }, { "entropy": 6.409118938446045, "epoch": 3.127882711755578, "grad_norm": 1.15625, "learning_rate": 0.0004041583782180312, "loss": 5.9504, "mean_token_accuracy": 0.15863436460494995, "num_tokens": 63263983.0, "step": 29230 }, { "entropy": 6.2934211730957035, "epoch": 3.128417785863342, "grad_norm": 1.0234375, "learning_rate": 0.0004041270697626233, "loss": 5.8355, "mean_token_accuracy": 0.16799573302268983, "num_tokens": 63274503.0, "step": 29235 }, { "entropy": 6.4362658023834225, "epoch": 3.128952859971106, "grad_norm": 1.0, "learning_rate": 0.0004040957575786894, "loss": 6.003, "mean_token_accuracy": 0.14309794157743455, "num_tokens": 63285863.0, "step": 29240 }, { "entropy": 6.39177680015564, "epoch": 3.12948793407887, "grad_norm": 1.0, "learning_rate": 0.0004040644416671337, "loss": 5.979, "mean_token_accuracy": 0.15556596517562865, "num_tokens": 63297089.0, "step": 29245 }, { "entropy": 6.326412391662598, "epoch": 3.130023008186634, "grad_norm": 1.09375, "learning_rate": 0.00040403312202886026, "loss": 5.9009, "mean_token_accuracy": 0.15734237283468247, "num_tokens": 63307591.0, "step": 29250 }, { "entropy": 6.376276350021362, "epoch": 3.1305580822943977, "grad_norm": 1.1796875, "learning_rate": 0.0004040017986647736, "loss": 5.8952, "mean_token_accuracy": 0.16391537040472032, "num_tokens": 63317895.0, "step": 29255 }, { "entropy": 6.429780530929565, "epoch": 3.131093156402162, "grad_norm": 1.1171875, "learning_rate": 0.00040397047157577823, "loss": 5.9449, "mean_token_accuracy": 0.15584082454442977, "num_tokens": 63327829.0, "step": 29260 }, { "entropy": 6.383227777481079, "epoch": 3.1316282305099254, "grad_norm": 1.0625, "learning_rate": 0.0004039391407627785, "loss": 5.9715, "mean_token_accuracy": 0.15879763811826705, "num_tokens": 63337842.0, "step": 29265 }, { "entropy": 6.3535138130187985, "epoch": 3.1321633046176895, "grad_norm": 1.1796875, "learning_rate": 0.00040390780622667923, "loss": 5.8678, "mean_token_accuracy": 0.16152637898921968, "num_tokens": 63349103.0, "step": 29270 }, { "entropy": 6.3497532367706295, "epoch": 3.1326983787254536, "grad_norm": 1.0234375, "learning_rate": 0.00040387646796838524, "loss": 5.9608, "mean_token_accuracy": 0.15106057077646257, "num_tokens": 63359172.0, "step": 29275 }, { "entropy": 6.358338403701782, "epoch": 3.1332334528332173, "grad_norm": 1.140625, "learning_rate": 0.00040384512598880127, "loss": 5.9068, "mean_token_accuracy": 0.16100118756294252, "num_tokens": 63370397.0, "step": 29280 }, { "entropy": 6.286371850967408, "epoch": 3.1337685269409814, "grad_norm": 1.1796875, "learning_rate": 0.00040381378028883234, "loss": 5.9115, "mean_token_accuracy": 0.1566196233034134, "num_tokens": 63380592.0, "step": 29285 }, { "entropy": 6.394053411483765, "epoch": 3.134303601048745, "grad_norm": 1.15625, "learning_rate": 0.00040378243086938373, "loss": 5.9959, "mean_token_accuracy": 0.15166891366243362, "num_tokens": 63392115.0, "step": 29290 }, { "entropy": 6.361499452590943, "epoch": 3.134838675156509, "grad_norm": 0.95703125, "learning_rate": 0.0004037510777313604, "loss": 5.9171, "mean_token_accuracy": 0.16227520853281022, "num_tokens": 63403287.0, "step": 29295 }, { "entropy": 6.416987609863281, "epoch": 3.1353737492642733, "grad_norm": 1.2109375, "learning_rate": 0.0004037197208756679, "loss": 5.9435, "mean_token_accuracy": 0.15949240922927857, "num_tokens": 63415248.0, "step": 29300 }, { "entropy": 6.372391605377198, "epoch": 3.135908823372037, "grad_norm": 1.1796875, "learning_rate": 0.0004036883603032115, "loss": 5.952, "mean_token_accuracy": 0.15586404204368592, "num_tokens": 63425693.0, "step": 29305 }, { "entropy": 6.344384002685547, "epoch": 3.136443897479801, "grad_norm": 1.15625, "learning_rate": 0.0004036569960148968, "loss": 5.8905, "mean_token_accuracy": 0.1557423874735832, "num_tokens": 63437711.0, "step": 29310 }, { "entropy": 6.338071966171265, "epoch": 3.136978971587565, "grad_norm": 1.140625, "learning_rate": 0.00040362562801162937, "loss": 5.9234, "mean_token_accuracy": 0.1586975112557411, "num_tokens": 63448190.0, "step": 29315 }, { "entropy": 6.395561695098877, "epoch": 3.1375140456953288, "grad_norm": 1.0390625, "learning_rate": 0.00040359425629431505, "loss": 5.9356, "mean_token_accuracy": 0.15726699382066728, "num_tokens": 63459285.0, "step": 29320 }, { "entropy": 6.376254367828369, "epoch": 3.138049119803093, "grad_norm": 1.1953125, "learning_rate": 0.00040356288086385966, "loss": 5.9645, "mean_token_accuracy": 0.15539701730012895, "num_tokens": 63469093.0, "step": 29325 }, { "entropy": 6.344139528274536, "epoch": 3.1385841939108565, "grad_norm": 0.99609375, "learning_rate": 0.00040353150172116916, "loss": 5.9065, "mean_token_accuracy": 0.16183784753084182, "num_tokens": 63479108.0, "step": 29330 }, { "entropy": 6.368555355072021, "epoch": 3.1391192680186206, "grad_norm": 1.078125, "learning_rate": 0.00040350011886714957, "loss": 6.0068, "mean_token_accuracy": 0.15531465262174607, "num_tokens": 63490656.0, "step": 29335 }, { "entropy": 6.364290618896485, "epoch": 3.1396543421263843, "grad_norm": 1.46875, "learning_rate": 0.00040346873230270706, "loss": 5.9121, "mean_token_accuracy": 0.16221346855163574, "num_tokens": 63501261.0, "step": 29340 }, { "entropy": 6.408905363082885, "epoch": 3.1401894162341484, "grad_norm": 1.109375, "learning_rate": 0.000403437342028748, "loss": 5.9658, "mean_token_accuracy": 0.15136737674474715, "num_tokens": 63511926.0, "step": 29345 }, { "entropy": 6.3899160861969, "epoch": 3.1407244903419125, "grad_norm": 1.0859375, "learning_rate": 0.00040340594804617874, "loss": 5.9582, "mean_token_accuracy": 0.15524366945028306, "num_tokens": 63523140.0, "step": 29350 }, { "entropy": 6.399950981140137, "epoch": 3.141259564449676, "grad_norm": 1.140625, "learning_rate": 0.00040337455035590583, "loss": 5.9397, "mean_token_accuracy": 0.1530905157327652, "num_tokens": 63532745.0, "step": 29355 }, { "entropy": 6.372034406661987, "epoch": 3.1417946385574402, "grad_norm": 1.1640625, "learning_rate": 0.00040334314895883574, "loss": 5.9543, "mean_token_accuracy": 0.16110007911920549, "num_tokens": 63544144.0, "step": 29360 }, { "entropy": 6.4220545291900635, "epoch": 3.1423297126652043, "grad_norm": 1.1015625, "learning_rate": 0.00040331174385587533, "loss": 5.993, "mean_token_accuracy": 0.14423295110464096, "num_tokens": 63554615.0, "step": 29365 }, { "entropy": 6.406157350540161, "epoch": 3.142864786772968, "grad_norm": 1.140625, "learning_rate": 0.0004032803350479313, "loss": 6.001, "mean_token_accuracy": 0.1512627460062504, "num_tokens": 63565620.0, "step": 29370 }, { "entropy": 6.318288421630859, "epoch": 3.143399860880732, "grad_norm": 1.15625, "learning_rate": 0.0004032489225359106, "loss": 5.8854, "mean_token_accuracy": 0.16330547928810119, "num_tokens": 63575787.0, "step": 29375 }, { "entropy": 6.284689569473267, "epoch": 3.1439349349884957, "grad_norm": 1.046875, "learning_rate": 0.0004032175063207203, "loss": 5.9684, "mean_token_accuracy": 0.15746026188135148, "num_tokens": 63586644.0, "step": 29380 }, { "entropy": 6.392738008499146, "epoch": 3.14447000909626, "grad_norm": 1.046875, "learning_rate": 0.00040318608640326756, "loss": 5.9385, "mean_token_accuracy": 0.1588975042104721, "num_tokens": 63596592.0, "step": 29385 }, { "entropy": 6.433361196517945, "epoch": 3.145005083204024, "grad_norm": 1.2109375, "learning_rate": 0.00040315466278445955, "loss": 5.9655, "mean_token_accuracy": 0.15891166180372238, "num_tokens": 63607263.0, "step": 29390 }, { "entropy": 6.274337959289551, "epoch": 3.1455401573117876, "grad_norm": 1.1953125, "learning_rate": 0.0004031232354652037, "loss": 5.8692, "mean_token_accuracy": 0.15941382199525833, "num_tokens": 63618494.0, "step": 29395 }, { "entropy": 6.273534202575684, "epoch": 3.1460752314195517, "grad_norm": 1.0859375, "learning_rate": 0.00040309180444640734, "loss": 5.8412, "mean_token_accuracy": 0.16065727174282074, "num_tokens": 63629100.0, "step": 29400 }, { "entropy": 6.269650554656982, "epoch": 3.1466103055273154, "grad_norm": 1.0625, "learning_rate": 0.00040306036972897823, "loss": 5.8784, "mean_token_accuracy": 0.16177345365285872, "num_tokens": 63640088.0, "step": 29405 }, { "entropy": 6.317392444610595, "epoch": 3.1471453796350795, "grad_norm": 1.0859375, "learning_rate": 0.0004030289313138239, "loss": 5.8615, "mean_token_accuracy": 0.16022471636533736, "num_tokens": 63650262.0, "step": 29410 }, { "entropy": 6.378565979003906, "epoch": 3.1476804537428436, "grad_norm": 1.1171875, "learning_rate": 0.00040299748920185214, "loss": 6.034, "mean_token_accuracy": 0.15019156485795976, "num_tokens": 63661919.0, "step": 29415 }, { "entropy": 6.36826491355896, "epoch": 3.148215527850607, "grad_norm": 1.03125, "learning_rate": 0.00040296604339397086, "loss": 5.9541, "mean_token_accuracy": 0.15172003954648972, "num_tokens": 63672185.0, "step": 29420 }, { "entropy": 6.42219386100769, "epoch": 3.1487506019583713, "grad_norm": 1.296875, "learning_rate": 0.0004029345938910881, "loss": 5.9948, "mean_token_accuracy": 0.15102996975183486, "num_tokens": 63682948.0, "step": 29425 }, { "entropy": 6.424622440338135, "epoch": 3.149285676066135, "grad_norm": 1.0859375, "learning_rate": 0.00040290314069411193, "loss": 6.0431, "mean_token_accuracy": 0.15101394504308702, "num_tokens": 63693227.0, "step": 29430 }, { "entropy": 6.397080707550049, "epoch": 3.149820750173899, "grad_norm": 1.0390625, "learning_rate": 0.0004028716838039505, "loss": 5.9571, "mean_token_accuracy": 0.1573994442820549, "num_tokens": 63705315.0, "step": 29435 }, { "entropy": 6.373774242401123, "epoch": 3.150355824281663, "grad_norm": 1.0234375, "learning_rate": 0.0004028402232215122, "loss": 5.9374, "mean_token_accuracy": 0.16167082041501998, "num_tokens": 63715924.0, "step": 29440 }, { "entropy": 6.3234312534332275, "epoch": 3.150890898389427, "grad_norm": 0.98828125, "learning_rate": 0.0004028087589477054, "loss": 5.9171, "mean_token_accuracy": 0.15592489689588546, "num_tokens": 63726889.0, "step": 29445 }, { "entropy": 6.452550888061523, "epoch": 3.151425972497191, "grad_norm": 1.140625, "learning_rate": 0.0004027772909834387, "loss": 6.0029, "mean_token_accuracy": 0.15547576695680618, "num_tokens": 63737102.0, "step": 29450 }, { "entropy": 6.383406066894532, "epoch": 3.1519610466049546, "grad_norm": 1.1171875, "learning_rate": 0.0004027458193296206, "loss": 5.9421, "mean_token_accuracy": 0.16061448752880098, "num_tokens": 63747079.0, "step": 29455 }, { "entropy": 6.392552518844605, "epoch": 3.1524961207127187, "grad_norm": 1.0625, "learning_rate": 0.0004027143439871599, "loss": 5.9838, "mean_token_accuracy": 0.15127613842487336, "num_tokens": 63758852.0, "step": 29460 }, { "entropy": 6.403622961044311, "epoch": 3.1530311948204828, "grad_norm": 1.0703125, "learning_rate": 0.0004026828649569656, "loss": 5.9148, "mean_token_accuracy": 0.1591234378516674, "num_tokens": 63770056.0, "step": 29465 }, { "entropy": 6.395105981826783, "epoch": 3.1535662689282464, "grad_norm": 1.0, "learning_rate": 0.00040265138223994647, "loss": 5.9903, "mean_token_accuracy": 0.15254399180412292, "num_tokens": 63781241.0, "step": 29470 }, { "entropy": 6.32801661491394, "epoch": 3.1541013430360105, "grad_norm": 1.03125, "learning_rate": 0.0004026198958370115, "loss": 5.947, "mean_token_accuracy": 0.15348548591136932, "num_tokens": 63792393.0, "step": 29475 }, { "entropy": 6.337164068222046, "epoch": 3.1546364171437746, "grad_norm": 1.015625, "learning_rate": 0.0004025884057490701, "loss": 5.9411, "mean_token_accuracy": 0.15471922159194945, "num_tokens": 63802474.0, "step": 29480 }, { "entropy": 6.437000799179077, "epoch": 3.1551714912515383, "grad_norm": 1.1875, "learning_rate": 0.0004025569119770313, "loss": 5.8837, "mean_token_accuracy": 0.1615707039833069, "num_tokens": 63812247.0, "step": 29485 }, { "entropy": 6.40889949798584, "epoch": 3.1557065653593024, "grad_norm": 1.1328125, "learning_rate": 0.00040252541452180467, "loss": 5.9816, "mean_token_accuracy": 0.15649447739124298, "num_tokens": 63822230.0, "step": 29490 }, { "entropy": 6.3203778743743895, "epoch": 3.156241639467066, "grad_norm": 1.0703125, "learning_rate": 0.0004024939133842996, "loss": 5.9896, "mean_token_accuracy": 0.15097686052322387, "num_tokens": 63832594.0, "step": 29495 }, { "entropy": 6.286804819107056, "epoch": 3.15677671357483, "grad_norm": 1.0078125, "learning_rate": 0.0004024624085654257, "loss": 5.9402, "mean_token_accuracy": 0.15497057735919953, "num_tokens": 63844602.0, "step": 29500 }, { "entropy": 6.317416667938232, "epoch": 3.1573117876825942, "grad_norm": 1.0546875, "learning_rate": 0.0004024309000660927, "loss": 5.8581, "mean_token_accuracy": 0.1668792262673378, "num_tokens": 63854683.0, "step": 29505 }, { "entropy": 6.355948543548584, "epoch": 3.157846861790358, "grad_norm": 1.109375, "learning_rate": 0.00040239938788721026, "loss": 5.8775, "mean_token_accuracy": 0.16038444489240647, "num_tokens": 63865889.0, "step": 29510 }, { "entropy": 6.332841396331787, "epoch": 3.158381935898122, "grad_norm": 1.0546875, "learning_rate": 0.00040236787202968847, "loss": 5.8888, "mean_token_accuracy": 0.15986775308847428, "num_tokens": 63875490.0, "step": 29515 }, { "entropy": 6.328046751022339, "epoch": 3.1589170100058857, "grad_norm": 1.3359375, "learning_rate": 0.0004023363524944373, "loss": 5.9477, "mean_token_accuracy": 0.16508255898952484, "num_tokens": 63886319.0, "step": 29520 }, { "entropy": 6.290478086471557, "epoch": 3.1594520841136498, "grad_norm": 1.078125, "learning_rate": 0.0004023048292823667, "loss": 5.8624, "mean_token_accuracy": 0.16136393398046495, "num_tokens": 63897588.0, "step": 29525 }, { "entropy": 6.291469573974609, "epoch": 3.159987158221414, "grad_norm": 1.046875, "learning_rate": 0.0004022733023943872, "loss": 5.9265, "mean_token_accuracy": 0.1569217175245285, "num_tokens": 63908350.0, "step": 29530 }, { "entropy": 6.344586658477783, "epoch": 3.1605222323291775, "grad_norm": 1.109375, "learning_rate": 0.0004022417718314089, "loss": 5.9681, "mean_token_accuracy": 0.1550351321697235, "num_tokens": 63918744.0, "step": 29535 }, { "entropy": 6.355932807922363, "epoch": 3.1610573064369416, "grad_norm": 1.0546875, "learning_rate": 0.0004022102375943424, "loss": 5.882, "mean_token_accuracy": 0.15787472128868102, "num_tokens": 63928593.0, "step": 29540 }, { "entropy": 6.304686212539673, "epoch": 3.1615923805447053, "grad_norm": 1.3046875, "learning_rate": 0.0004021786996840981, "loss": 5.9001, "mean_token_accuracy": 0.16535490453243257, "num_tokens": 63939912.0, "step": 29545 }, { "entropy": 6.34300127029419, "epoch": 3.1621274546524694, "grad_norm": 0.99609375, "learning_rate": 0.00040214715810158667, "loss": 5.9306, "mean_token_accuracy": 0.1600617691874504, "num_tokens": 63951356.0, "step": 29550 }, { "entropy": 6.356760263442993, "epoch": 3.1626625287602335, "grad_norm": 1.140625, "learning_rate": 0.000402115612847719, "loss": 5.9198, "mean_token_accuracy": 0.1635399952530861, "num_tokens": 63961252.0, "step": 29555 }, { "entropy": 6.350021123886108, "epoch": 3.163197602867997, "grad_norm": 1.0390625, "learning_rate": 0.0004020840639234059, "loss": 5.9619, "mean_token_accuracy": 0.15387832075357438, "num_tokens": 63972090.0, "step": 29560 }, { "entropy": 6.415095472335816, "epoch": 3.163732676975761, "grad_norm": 1.1015625, "learning_rate": 0.00040205251132955825, "loss": 5.9574, "mean_token_accuracy": 0.16154099851846696, "num_tokens": 63983092.0, "step": 29565 }, { "entropy": 6.323073959350586, "epoch": 3.164267751083525, "grad_norm": 1.0625, "learning_rate": 0.00040202095506708727, "loss": 5.9277, "mean_token_accuracy": 0.1551106594502926, "num_tokens": 63992527.0, "step": 29570 }, { "entropy": 6.353799724578858, "epoch": 3.164802825191289, "grad_norm": 1.09375, "learning_rate": 0.000401989395136904, "loss": 5.9398, "mean_token_accuracy": 0.1585277408361435, "num_tokens": 64003938.0, "step": 29575 }, { "entropy": 6.344430208206177, "epoch": 3.165337899299053, "grad_norm": 1.1484375, "learning_rate": 0.0004019578315399197, "loss": 5.8938, "mean_token_accuracy": 0.16204114705324174, "num_tokens": 64013925.0, "step": 29580 }, { "entropy": 6.417999935150147, "epoch": 3.1658729734068167, "grad_norm": 1.046875, "learning_rate": 0.0004019262642770459, "loss": 6.0679, "mean_token_accuracy": 0.1465699128806591, "num_tokens": 64024503.0, "step": 29585 }, { "entropy": 6.406581068038941, "epoch": 3.166408047514581, "grad_norm": 1.1015625, "learning_rate": 0.00040189469334919416, "loss": 5.9319, "mean_token_accuracy": 0.152252633869648, "num_tokens": 64035650.0, "step": 29590 }, { "entropy": 6.368275785446167, "epoch": 3.166943121622345, "grad_norm": 1.046875, "learning_rate": 0.0004018631187572759, "loss": 5.9597, "mean_token_accuracy": 0.15444018244743346, "num_tokens": 64047032.0, "step": 29595 }, { "entropy": 6.2575850009918215, "epoch": 3.1674781957301086, "grad_norm": 1.03125, "learning_rate": 0.00040183154050220295, "loss": 5.8035, "mean_token_accuracy": 0.17055485844612123, "num_tokens": 64057578.0, "step": 29600 }, { "entropy": 6.4077812194824215, "epoch": 3.1680132698378727, "grad_norm": 1.296875, "learning_rate": 0.000401799958584887, "loss": 6.0376, "mean_token_accuracy": 0.14759154468774796, "num_tokens": 64068679.0, "step": 29605 }, { "entropy": 6.362169504165649, "epoch": 3.1685483439456363, "grad_norm": 1.015625, "learning_rate": 0.00040176837300624015, "loss": 5.9583, "mean_token_accuracy": 0.15783792734146118, "num_tokens": 64078572.0, "step": 29610 }, { "entropy": 6.361863660812378, "epoch": 3.1690834180534004, "grad_norm": 1.078125, "learning_rate": 0.0004017367837671743, "loss": 5.8986, "mean_token_accuracy": 0.154576900601387, "num_tokens": 64088507.0, "step": 29615 }, { "entropy": 6.359227275848388, "epoch": 3.169618492161164, "grad_norm": 1.078125, "learning_rate": 0.00040170519086860166, "loss": 6.0076, "mean_token_accuracy": 0.15704898685216903, "num_tokens": 64099405.0, "step": 29620 }, { "entropy": 6.360221242904663, "epoch": 3.170153566268928, "grad_norm": 1.1171875, "learning_rate": 0.00040167359431143444, "loss": 5.9134, "mean_token_accuracy": 0.16285198479890822, "num_tokens": 64109554.0, "step": 29625 }, { "entropy": 6.344291257858276, "epoch": 3.1706886403766923, "grad_norm": 1.0859375, "learning_rate": 0.000401641994096585, "loss": 5.8658, "mean_token_accuracy": 0.16541523784399031, "num_tokens": 64119817.0, "step": 29630 }, { "entropy": 6.363594245910645, "epoch": 3.171223714484456, "grad_norm": 1.0625, "learning_rate": 0.0004016103902249658, "loss": 5.9719, "mean_token_accuracy": 0.15688366144895555, "num_tokens": 64131001.0, "step": 29635 }, { "entropy": 6.3750392436981205, "epoch": 3.17175878859222, "grad_norm": 1.1953125, "learning_rate": 0.0004015787826974892, "loss": 5.9208, "mean_token_accuracy": 0.15776150226593016, "num_tokens": 64142072.0, "step": 29640 }, { "entropy": 6.356777334213257, "epoch": 3.172293862699984, "grad_norm": 1.0234375, "learning_rate": 0.0004015471715150682, "loss": 5.9512, "mean_token_accuracy": 0.15699927657842636, "num_tokens": 64153097.0, "step": 29645 }, { "entropy": 6.370017004013062, "epoch": 3.172828936807748, "grad_norm": 0.98828125, "learning_rate": 0.0004015155566786154, "loss": 6.0232, "mean_token_accuracy": 0.15536363273859025, "num_tokens": 64164952.0, "step": 29650 }, { "entropy": 6.40717248916626, "epoch": 3.173364010915512, "grad_norm": 1.1875, "learning_rate": 0.00040148393818904366, "loss": 5.9283, "mean_token_accuracy": 0.15584930032491684, "num_tokens": 64175754.0, "step": 29655 }, { "entropy": 6.469638729095459, "epoch": 3.1738990850232756, "grad_norm": 1.0234375, "learning_rate": 0.0004014523160472659, "loss": 6.0072, "mean_token_accuracy": 0.15044259205460547, "num_tokens": 64186888.0, "step": 29660 }, { "entropy": 6.336843729019165, "epoch": 3.1744341591310397, "grad_norm": 1.421875, "learning_rate": 0.00040142069025419537, "loss": 5.9153, "mean_token_accuracy": 0.15512820184230805, "num_tokens": 64197362.0, "step": 29665 }, { "entropy": 6.39099087715149, "epoch": 3.1749692332388038, "grad_norm": 1.0859375, "learning_rate": 0.0004013890608107451, "loss": 5.975, "mean_token_accuracy": 0.15652958750724794, "num_tokens": 64208667.0, "step": 29670 }, { "entropy": 6.4285688400268555, "epoch": 3.1755043073465674, "grad_norm": 1.0546875, "learning_rate": 0.0004013574277178285, "loss": 6.0304, "mean_token_accuracy": 0.14242810159921646, "num_tokens": 64219525.0, "step": 29675 }, { "entropy": 6.334009027481079, "epoch": 3.1760393814543315, "grad_norm": 1.171875, "learning_rate": 0.00040132579097635897, "loss": 5.865, "mean_token_accuracy": 0.16089616864919662, "num_tokens": 64228916.0, "step": 29680 }, { "entropy": 6.291034460067749, "epoch": 3.176574455562095, "grad_norm": 1.0390625, "learning_rate": 0.00040129415058724993, "loss": 5.932, "mean_token_accuracy": 0.15501599460840226, "num_tokens": 64241467.0, "step": 29685 }, { "entropy": 6.40519118309021, "epoch": 3.1771095296698593, "grad_norm": 1.1171875, "learning_rate": 0.00040126250655141507, "loss": 5.8598, "mean_token_accuracy": 0.1638604983687401, "num_tokens": 64251330.0, "step": 29690 }, { "entropy": 6.341562747955322, "epoch": 3.1776446037776234, "grad_norm": 1.0859375, "learning_rate": 0.00040123085886976804, "loss": 5.8935, "mean_token_accuracy": 0.16218606978654862, "num_tokens": 64261991.0, "step": 29695 }, { "entropy": 6.370601797103882, "epoch": 3.178179677885387, "grad_norm": 1.046875, "learning_rate": 0.00040119920754322277, "loss": 5.9776, "mean_token_accuracy": 0.15086169093847274, "num_tokens": 64272402.0, "step": 29700 }, { "entropy": 6.303918981552124, "epoch": 3.178714751993151, "grad_norm": 1.1015625, "learning_rate": 0.00040116755257269297, "loss": 5.9, "mean_token_accuracy": 0.15702066123485564, "num_tokens": 64283390.0, "step": 29705 }, { "entropy": 6.328627967834473, "epoch": 3.1792498261009148, "grad_norm": 1.046875, "learning_rate": 0.00040113589395909295, "loss": 5.9318, "mean_token_accuracy": 0.16051373705267907, "num_tokens": 64294280.0, "step": 29710 }, { "entropy": 6.416330623626709, "epoch": 3.179784900208679, "grad_norm": 1.03125, "learning_rate": 0.0004011042317033367, "loss": 6.038, "mean_token_accuracy": 0.15104313045740128, "num_tokens": 64305927.0, "step": 29715 }, { "entropy": 6.331780195236206, "epoch": 3.180319974316443, "grad_norm": 1.140625, "learning_rate": 0.0004010725658063385, "loss": 5.8625, "mean_token_accuracy": 0.16446902900934218, "num_tokens": 64316319.0, "step": 29720 }, { "entropy": 6.366243553161621, "epoch": 3.1808550484242066, "grad_norm": 1.0546875, "learning_rate": 0.0004010408962690126, "loss": 5.9624, "mean_token_accuracy": 0.15584434568881989, "num_tokens": 64326958.0, "step": 29725 }, { "entropy": 6.392551422119141, "epoch": 3.1813901225319707, "grad_norm": 1.0546875, "learning_rate": 0.00040100922309227357, "loss": 5.9732, "mean_token_accuracy": 0.1517082579433918, "num_tokens": 64338433.0, "step": 29730 }, { "entropy": 6.317179346084595, "epoch": 3.1819251966397344, "grad_norm": 1.203125, "learning_rate": 0.00040097754627703593, "loss": 5.8043, "mean_token_accuracy": 0.17113238126039504, "num_tokens": 64349188.0, "step": 29735 }, { "entropy": 6.366120290756226, "epoch": 3.1824602707474985, "grad_norm": 1.03125, "learning_rate": 0.0004009458658242143, "loss": 5.9581, "mean_token_accuracy": 0.1516380116343498, "num_tokens": 64359837.0, "step": 29740 }, { "entropy": 6.291211891174316, "epoch": 3.1829953448552626, "grad_norm": 1.0546875, "learning_rate": 0.00040091418173472356, "loss": 5.9412, "mean_token_accuracy": 0.16010672599077225, "num_tokens": 64370927.0, "step": 29745 }, { "entropy": 6.256134986877441, "epoch": 3.1835304189630262, "grad_norm": 1.125, "learning_rate": 0.0004008824940094785, "loss": 5.8906, "mean_token_accuracy": 0.16023971736431122, "num_tokens": 64381683.0, "step": 29750 }, { "entropy": 6.340604782104492, "epoch": 3.1840654930707903, "grad_norm": 1.203125, "learning_rate": 0.0004008508026493941, "loss": 5.9169, "mean_token_accuracy": 0.1609143391251564, "num_tokens": 64394063.0, "step": 29755 }, { "entropy": 6.405573749542237, "epoch": 3.1846005671785544, "grad_norm": 1.0078125, "learning_rate": 0.00040081910765538543, "loss": 5.9388, "mean_token_accuracy": 0.15616747587919236, "num_tokens": 64405183.0, "step": 29760 }, { "entropy": 6.377527093887329, "epoch": 3.185135641286318, "grad_norm": 1.0859375, "learning_rate": 0.00040078740902836776, "loss": 5.8985, "mean_token_accuracy": 0.1661163702607155, "num_tokens": 64415325.0, "step": 29765 }, { "entropy": 6.3813148021698, "epoch": 3.185670715394082, "grad_norm": 1.015625, "learning_rate": 0.00040075570676925633, "loss": 5.9937, "mean_token_accuracy": 0.15144642516970636, "num_tokens": 64426240.0, "step": 29770 }, { "entropy": 6.31283917427063, "epoch": 3.186205789501846, "grad_norm": 1.0078125, "learning_rate": 0.0004007240008789664, "loss": 5.953, "mean_token_accuracy": 0.15445429980754852, "num_tokens": 64436664.0, "step": 29775 }, { "entropy": 6.410888624191284, "epoch": 3.18674086360961, "grad_norm": 1.015625, "learning_rate": 0.00040069229135841376, "loss": 6.0418, "mean_token_accuracy": 0.15271735638380052, "num_tokens": 64448731.0, "step": 29780 }, { "entropy": 6.473977565765381, "epoch": 3.187275937717374, "grad_norm": 1.015625, "learning_rate": 0.0004006605782085139, "loss": 6.0444, "mean_token_accuracy": 0.14402838796377182, "num_tokens": 64460916.0, "step": 29785 }, { "entropy": 6.40999846458435, "epoch": 3.1878110118251377, "grad_norm": 1.0703125, "learning_rate": 0.0004006288614301824, "loss": 5.9949, "mean_token_accuracy": 0.14986334294080733, "num_tokens": 64472114.0, "step": 29790 }, { "entropy": 6.358725118637085, "epoch": 3.188346085932902, "grad_norm": 1.0625, "learning_rate": 0.00040059714102433526, "loss": 5.9345, "mean_token_accuracy": 0.1622491955757141, "num_tokens": 64482465.0, "step": 29795 }, { "entropy": 6.283875274658203, "epoch": 3.1888811600406655, "grad_norm": 1.0859375, "learning_rate": 0.0004005654169918883, "loss": 5.8892, "mean_token_accuracy": 0.1609683558344841, "num_tokens": 64493285.0, "step": 29800 }, { "entropy": 6.384813594818115, "epoch": 3.1894162341484296, "grad_norm": 1.1171875, "learning_rate": 0.00040053368933375756, "loss": 6.0196, "mean_token_accuracy": 0.15509081035852432, "num_tokens": 64504037.0, "step": 29805 }, { "entropy": 6.3670854568481445, "epoch": 3.1899513082561937, "grad_norm": 1.203125, "learning_rate": 0.00040050195805085907, "loss": 5.8811, "mean_token_accuracy": 0.16009466648101806, "num_tokens": 64513900.0, "step": 29810 }, { "entropy": 6.294278478622436, "epoch": 3.1904863823639573, "grad_norm": 1.296875, "learning_rate": 0.00040047022314410936, "loss": 5.9878, "mean_token_accuracy": 0.15497070252895356, "num_tokens": 64525273.0, "step": 29815 }, { "entropy": 6.353809070587158, "epoch": 3.1910214564717214, "grad_norm": 1.171875, "learning_rate": 0.00040043848461442447, "loss": 5.9557, "mean_token_accuracy": 0.1586330845952034, "num_tokens": 64535929.0, "step": 29820 }, { "entropy": 6.363054037094116, "epoch": 3.191556530579485, "grad_norm": 1.0546875, "learning_rate": 0.000400406742462721, "loss": 5.9782, "mean_token_accuracy": 0.15211002975702287, "num_tokens": 64546975.0, "step": 29825 }, { "entropy": 6.4161481857299805, "epoch": 3.192091604687249, "grad_norm": 1.078125, "learning_rate": 0.00040037499668991544, "loss": 6.039, "mean_token_accuracy": 0.1494266539812088, "num_tokens": 64558295.0, "step": 29830 }, { "entropy": 6.356688594818115, "epoch": 3.1926266787950133, "grad_norm": 1.0625, "learning_rate": 0.00040034324729692453, "loss": 5.8319, "mean_token_accuracy": 0.1677412360906601, "num_tokens": 64569638.0, "step": 29835 }, { "entropy": 6.334647750854492, "epoch": 3.193161752902777, "grad_norm": 1.078125, "learning_rate": 0.0004003114942846649, "loss": 5.9582, "mean_token_accuracy": 0.15535537004470826, "num_tokens": 64580693.0, "step": 29840 }, { "entropy": 6.307066631317139, "epoch": 3.193696827010541, "grad_norm": 1.109375, "learning_rate": 0.00040027973765405353, "loss": 5.9293, "mean_token_accuracy": 0.16501223742961885, "num_tokens": 64590947.0, "step": 29845 }, { "entropy": 6.4647773742675785, "epoch": 3.1942319011183047, "grad_norm": 1.09375, "learning_rate": 0.0004002479774060073, "loss": 6.0168, "mean_token_accuracy": 0.15166086405515672, "num_tokens": 64602340.0, "step": 29850 }, { "entropy": 6.401280069351197, "epoch": 3.194766975226069, "grad_norm": 1.0078125, "learning_rate": 0.0004002162135414433, "loss": 5.9592, "mean_token_accuracy": 0.15214390009641648, "num_tokens": 64614410.0, "step": 29855 }, { "entropy": 6.464708137512207, "epoch": 3.195302049333833, "grad_norm": 1.3515625, "learning_rate": 0.0004001844460612788, "loss": 5.9799, "mean_token_accuracy": 0.1492728814482689, "num_tokens": 64624893.0, "step": 29860 }, { "entropy": 6.366494607925415, "epoch": 3.1958371234415965, "grad_norm": 0.9921875, "learning_rate": 0.00040015267496643097, "loss": 5.952, "mean_token_accuracy": 0.1558820605278015, "num_tokens": 64636172.0, "step": 29865 }, { "entropy": 6.310216283798217, "epoch": 3.1963721975493606, "grad_norm": 1.1015625, "learning_rate": 0.0004001209002578172, "loss": 5.9464, "mean_token_accuracy": 0.1533305451273918, "num_tokens": 64647605.0, "step": 29870 }, { "entropy": 6.416568994522095, "epoch": 3.1969072716571247, "grad_norm": 1.078125, "learning_rate": 0.0004000891219363551, "loss": 5.9832, "mean_token_accuracy": 0.15360431075096131, "num_tokens": 64657496.0, "step": 29875 }, { "entropy": 6.354289388656616, "epoch": 3.1974423457648884, "grad_norm": 1.25, "learning_rate": 0.00040005734000296225, "loss": 5.89, "mean_token_accuracy": 0.16566448509693146, "num_tokens": 64668905.0, "step": 29880 }, { "entropy": 6.308797836303711, "epoch": 3.1979774198726525, "grad_norm": 1.1015625, "learning_rate": 0.0004000255544585561, "loss": 5.9124, "mean_token_accuracy": 0.1583908438682556, "num_tokens": 64679207.0, "step": 29885 }, { "entropy": 6.378669023513794, "epoch": 3.198512493980416, "grad_norm": 1.15625, "learning_rate": 0.0003999937653040547, "loss": 5.9226, "mean_token_accuracy": 0.1611887440085411, "num_tokens": 64689536.0, "step": 29890 }, { "entropy": 6.42888069152832, "epoch": 3.1990475680881802, "grad_norm": 0.9765625, "learning_rate": 0.0003999619725403759, "loss": 6.1318, "mean_token_accuracy": 0.13800305128097534, "num_tokens": 64700304.0, "step": 29895 }, { "entropy": 6.342454814910889, "epoch": 3.199582642195944, "grad_norm": 1.03125, "learning_rate": 0.00039993017616843775, "loss": 5.8908, "mean_token_accuracy": 0.15604473352432252, "num_tokens": 64711657.0, "step": 29900 }, { "entropy": 6.290158033370972, "epoch": 3.200117716303708, "grad_norm": 1.1328125, "learning_rate": 0.0003998983761891582, "loss": 5.8969, "mean_token_accuracy": 0.16532329916954042, "num_tokens": 64722697.0, "step": 29905 }, { "entropy": 6.239257144927978, "epoch": 3.200652790411472, "grad_norm": 1.03125, "learning_rate": 0.00039986657260345567, "loss": 5.8511, "mean_token_accuracy": 0.16509920135140418, "num_tokens": 64732823.0, "step": 29910 }, { "entropy": 6.331918573379516, "epoch": 3.2011878645192358, "grad_norm": 0.95703125, "learning_rate": 0.0003998347654122484, "loss": 5.9643, "mean_token_accuracy": 0.15203783363103868, "num_tokens": 64744471.0, "step": 29915 }, { "entropy": 6.346285057067871, "epoch": 3.201722938627, "grad_norm": 1.078125, "learning_rate": 0.00039980295461645483, "loss": 5.9195, "mean_token_accuracy": 0.15709123611450196, "num_tokens": 64754079.0, "step": 29920 }, { "entropy": 6.355002355575562, "epoch": 3.202258012734764, "grad_norm": 1.1640625, "learning_rate": 0.00039977114021699344, "loss": 5.9279, "mean_token_accuracy": 0.15441327542066574, "num_tokens": 64764489.0, "step": 29925 }, { "entropy": 6.2970047950744625, "epoch": 3.2027930868425276, "grad_norm": 1.0390625, "learning_rate": 0.00039973932221478293, "loss": 5.8683, "mean_token_accuracy": 0.16683355569839478, "num_tokens": 64775512.0, "step": 29930 }, { "entropy": 6.290031671524048, "epoch": 3.2033281609502917, "grad_norm": 1.140625, "learning_rate": 0.00039970750061074206, "loss": 5.9015, "mean_token_accuracy": 0.15154138952493668, "num_tokens": 64787466.0, "step": 29935 }, { "entropy": 6.356723594665527, "epoch": 3.2038632350580554, "grad_norm": 1.0625, "learning_rate": 0.00039967567540578956, "loss": 5.9162, "mean_token_accuracy": 0.16016658693552016, "num_tokens": 64797380.0, "step": 29940 }, { "entropy": 6.333931303024292, "epoch": 3.2043983091658195, "grad_norm": 1.0078125, "learning_rate": 0.0003996438466008446, "loss": 5.9325, "mean_token_accuracy": 0.15466882288455963, "num_tokens": 64807609.0, "step": 29945 }, { "entropy": 6.260093784332275, "epoch": 3.2049333832735836, "grad_norm": 1.0390625, "learning_rate": 0.0003996120141968259, "loss": 5.8579, "mean_token_accuracy": 0.1614564210176468, "num_tokens": 64818601.0, "step": 29950 }, { "entropy": 6.360355949401855, "epoch": 3.2054684573813472, "grad_norm": 1.109375, "learning_rate": 0.00039958017819465285, "loss": 6.0538, "mean_token_accuracy": 0.15126702338457107, "num_tokens": 64829597.0, "step": 29955 }, { "entropy": 6.372115755081177, "epoch": 3.2060035314891113, "grad_norm": 1.015625, "learning_rate": 0.00039954833859524473, "loss": 5.9092, "mean_token_accuracy": 0.15976607650518418, "num_tokens": 64841293.0, "step": 29960 }, { "entropy": 6.429017066955566, "epoch": 3.206538605596875, "grad_norm": 1.140625, "learning_rate": 0.00039951649539952076, "loss": 5.9884, "mean_token_accuracy": 0.15325170159339904, "num_tokens": 64852724.0, "step": 29965 }, { "entropy": 6.417616653442383, "epoch": 3.207073679704639, "grad_norm": 1.2734375, "learning_rate": 0.00039948464860840047, "loss": 5.964, "mean_token_accuracy": 0.1635541468858719, "num_tokens": 64864915.0, "step": 29970 }, { "entropy": 6.3125204086303714, "epoch": 3.207608753812403, "grad_norm": 1.1171875, "learning_rate": 0.0003994527982228035, "loss": 5.8807, "mean_token_accuracy": 0.1576989471912384, "num_tokens": 64876431.0, "step": 29975 }, { "entropy": 6.30681586265564, "epoch": 3.208143827920167, "grad_norm": 1.0625, "learning_rate": 0.0003994209442436495, "loss": 5.9702, "mean_token_accuracy": 0.15983197689056397, "num_tokens": 64887492.0, "step": 29980 }, { "entropy": 6.387428426742554, "epoch": 3.208678902027931, "grad_norm": 1.1015625, "learning_rate": 0.00039938908667185816, "loss": 5.9732, "mean_token_accuracy": 0.15849171355366706, "num_tokens": 64897894.0, "step": 29985 }, { "entropy": 6.421723508834839, "epoch": 3.2092139761356946, "grad_norm": 1.0390625, "learning_rate": 0.00039935722550834944, "loss": 5.9658, "mean_token_accuracy": 0.1530484825372696, "num_tokens": 64909071.0, "step": 29990 }, { "entropy": 6.379126262664795, "epoch": 3.2097490502434587, "grad_norm": 1.046875, "learning_rate": 0.0003993253607540433, "loss": 5.9775, "mean_token_accuracy": 0.15862749069929122, "num_tokens": 64919434.0, "step": 29995 }, { "entropy": 6.260705375671387, "epoch": 3.210284124351223, "grad_norm": 1.09375, "learning_rate": 0.0003992934924098598, "loss": 5.8394, "mean_token_accuracy": 0.15183086544275284, "num_tokens": 64929897.0, "step": 30000 }, { "epoch": 3.210284124351223, "eval_entropy": 6.109120009851584, "eval_loss": 6.087357521057129, "eval_mean_token_accuracy": 0.15839566576251926, "eval_num_tokens": 64929897.0, "eval_runtime": 22.5489, "eval_samples_per_second": 1316.205, "eval_steps_per_second": 164.531, "step": 30000 }, { "entropy": 6.278308629989624, "epoch": 3.2108191984589864, "grad_norm": 1.2890625, "learning_rate": 0.0003992616204767192, "loss": 5.8154, "mean_token_accuracy": 0.17203904017806054, "num_tokens": 64940219.0, "step": 30005 }, { "entropy": 6.29177074432373, "epoch": 3.2113542725667505, "grad_norm": 1.1171875, "learning_rate": 0.0003992297449555419, "loss": 5.8311, "mean_token_accuracy": 0.16278219372034072, "num_tokens": 64950326.0, "step": 30010 }, { "entropy": 6.345028638839722, "epoch": 3.211889346674514, "grad_norm": 1.15625, "learning_rate": 0.00039919786584724796, "loss": 5.9786, "mean_token_accuracy": 0.15725551694631576, "num_tokens": 64960873.0, "step": 30015 }, { "entropy": 6.3224461555480955, "epoch": 3.2124244207822783, "grad_norm": 1.078125, "learning_rate": 0.00039916598315275825, "loss": 5.936, "mean_token_accuracy": 0.16303138583898544, "num_tokens": 64972138.0, "step": 30020 }, { "entropy": 6.396999931335449, "epoch": 3.2129594948900424, "grad_norm": 1.0703125, "learning_rate": 0.0003991340968729932, "loss": 6.0081, "mean_token_accuracy": 0.15102884247899057, "num_tokens": 64983002.0, "step": 30025 }, { "entropy": 6.322969722747803, "epoch": 3.213494568997806, "grad_norm": 1.1875, "learning_rate": 0.00039910220700887345, "loss": 5.9258, "mean_token_accuracy": 0.16074497997760773, "num_tokens": 64993973.0, "step": 30030 }, { "entropy": 6.389938831329346, "epoch": 3.21402964310557, "grad_norm": 1.0078125, "learning_rate": 0.00039907031356131993, "loss": 5.974, "mean_token_accuracy": 0.15092337876558304, "num_tokens": 65004711.0, "step": 30035 }, { "entropy": 6.381284141540528, "epoch": 3.2145647172133343, "grad_norm": 1.1484375, "learning_rate": 0.00039903841653125366, "loss": 5.924, "mean_token_accuracy": 0.14930544942617416, "num_tokens": 65016426.0, "step": 30040 }, { "entropy": 6.2594828605651855, "epoch": 3.215099791321098, "grad_norm": 1.0625, "learning_rate": 0.0003990065159195955, "loss": 5.8647, "mean_token_accuracy": 0.16954028904438018, "num_tokens": 65027999.0, "step": 30045 }, { "entropy": 6.351509666442871, "epoch": 3.215634865428862, "grad_norm": 1.1328125, "learning_rate": 0.0003989746117272665, "loss": 5.8883, "mean_token_accuracy": 0.16235044300556184, "num_tokens": 65038216.0, "step": 30050 }, { "entropy": 6.226224756240844, "epoch": 3.2161699395366257, "grad_norm": 1.1328125, "learning_rate": 0.0003989427039551881, "loss": 5.8284, "mean_token_accuracy": 0.16673026531934737, "num_tokens": 65049726.0, "step": 30055 }, { "entropy": 6.35144739151001, "epoch": 3.2167050136443898, "grad_norm": 1.0703125, "learning_rate": 0.00039891079260428157, "loss": 5.982, "mean_token_accuracy": 0.14802232831716539, "num_tokens": 65060675.0, "step": 30060 }, { "entropy": 6.442747449874878, "epoch": 3.217240087752154, "grad_norm": 1.015625, "learning_rate": 0.00039887887767546824, "loss": 5.9916, "mean_token_accuracy": 0.14647368639707564, "num_tokens": 65072378.0, "step": 30065 }, { "entropy": 6.463332986831665, "epoch": 3.2177751618599175, "grad_norm": 1.078125, "learning_rate": 0.0003988469591696698, "loss": 5.9619, "mean_token_accuracy": 0.15827011615037917, "num_tokens": 65082587.0, "step": 30070 }, { "entropy": 6.294886779785156, "epoch": 3.2183102359676816, "grad_norm": 1.0546875, "learning_rate": 0.0003988150370878078, "loss": 5.9365, "mean_token_accuracy": 0.16267811506986618, "num_tokens": 65093210.0, "step": 30075 }, { "entropy": 6.302612972259522, "epoch": 3.2188453100754453, "grad_norm": 1.0625, "learning_rate": 0.000398783111430804, "loss": 5.9146, "mean_token_accuracy": 0.160683211684227, "num_tokens": 65103074.0, "step": 30080 }, { "entropy": 6.354018354415894, "epoch": 3.2193803841832094, "grad_norm": 1.09375, "learning_rate": 0.00039875118219958016, "loss": 5.9482, "mean_token_accuracy": 0.15889522731304168, "num_tokens": 65113994.0, "step": 30085 }, { "entropy": 6.33398118019104, "epoch": 3.2199154582909735, "grad_norm": 1.0078125, "learning_rate": 0.0003987192493950585, "loss": 5.9083, "mean_token_accuracy": 0.1624709889292717, "num_tokens": 65125381.0, "step": 30090 }, { "entropy": 6.320818042755127, "epoch": 3.220450532398737, "grad_norm": 1.078125, "learning_rate": 0.00039868731301816076, "loss": 5.9164, "mean_token_accuracy": 0.1590525671839714, "num_tokens": 65135374.0, "step": 30095 }, { "entropy": 6.280558300018311, "epoch": 3.2209856065065012, "grad_norm": 1.15625, "learning_rate": 0.00039865537306980924, "loss": 5.8447, "mean_token_accuracy": 0.16420882791280747, "num_tokens": 65145514.0, "step": 30100 }, { "entropy": 6.287186908721924, "epoch": 3.221520680614265, "grad_norm": 1.1796875, "learning_rate": 0.0003986234295509262, "loss": 5.9362, "mean_token_accuracy": 0.15513650625944136, "num_tokens": 65156424.0, "step": 30105 }, { "entropy": 6.3921730518341064, "epoch": 3.222055754722029, "grad_norm": 1.1484375, "learning_rate": 0.00039859148246243405, "loss": 6.0245, "mean_token_accuracy": 0.1527112752199173, "num_tokens": 65167774.0, "step": 30110 }, { "entropy": 6.379287576675415, "epoch": 3.222590828829793, "grad_norm": 1.1171875, "learning_rate": 0.00039855953180525515, "loss": 6.0148, "mean_token_accuracy": 0.14563067853450776, "num_tokens": 65179552.0, "step": 30115 }, { "entropy": 6.441964721679687, "epoch": 3.2231259029375567, "grad_norm": 1.0078125, "learning_rate": 0.00039852757758031217, "loss": 5.9709, "mean_token_accuracy": 0.15981541574001312, "num_tokens": 65190386.0, "step": 30120 }, { "entropy": 6.387948513031006, "epoch": 3.223660977045321, "grad_norm": 0.98046875, "learning_rate": 0.00039849561978852775, "loss": 5.942, "mean_token_accuracy": 0.159147809445858, "num_tokens": 65201989.0, "step": 30125 }, { "entropy": 6.300851917266845, "epoch": 3.2241960511530845, "grad_norm": 1.078125, "learning_rate": 0.0003984636584308248, "loss": 5.8713, "mean_token_accuracy": 0.16563647538423537, "num_tokens": 65212862.0, "step": 30130 }, { "entropy": 6.323216390609741, "epoch": 3.2247311252608486, "grad_norm": 1.171875, "learning_rate": 0.00039843169350812585, "loss": 5.9096, "mean_token_accuracy": 0.16077035665512085, "num_tokens": 65223381.0, "step": 30135 }, { "entropy": 6.308974075317383, "epoch": 3.2252661993686127, "grad_norm": 1.1796875, "learning_rate": 0.0003983997250213542, "loss": 5.9501, "mean_token_accuracy": 0.15879506915807723, "num_tokens": 65234882.0, "step": 30140 }, { "entropy": 6.410314750671387, "epoch": 3.2258012734763764, "grad_norm": 1.0625, "learning_rate": 0.00039836775297143277, "loss": 5.9811, "mean_token_accuracy": 0.14933135509490966, "num_tokens": 65244421.0, "step": 30145 }, { "entropy": 6.347498655319214, "epoch": 3.2263363475841405, "grad_norm": 0.984375, "learning_rate": 0.00039833577735928484, "loss": 5.8911, "mean_token_accuracy": 0.1577087014913559, "num_tokens": 65255536.0, "step": 30150 }, { "entropy": 6.326552772521973, "epoch": 3.2268714216919046, "grad_norm": 1.015625, "learning_rate": 0.0003983037981858337, "loss": 5.9599, "mean_token_accuracy": 0.1589786484837532, "num_tokens": 65265776.0, "step": 30155 }, { "entropy": 6.335804176330567, "epoch": 3.227406495799668, "grad_norm": 1.0078125, "learning_rate": 0.00039827181545200264, "loss": 5.9264, "mean_token_accuracy": 0.1533484235405922, "num_tokens": 65276003.0, "step": 30160 }, { "entropy": 6.400363302230835, "epoch": 3.2279415699074323, "grad_norm": 1.0390625, "learning_rate": 0.0003982398291587153, "loss": 5.955, "mean_token_accuracy": 0.1554851770401001, "num_tokens": 65286817.0, "step": 30165 }, { "entropy": 6.326408815383911, "epoch": 3.228476644015196, "grad_norm": 1.0546875, "learning_rate": 0.0003982078393068952, "loss": 5.874, "mean_token_accuracy": 0.15594194382429122, "num_tokens": 65298142.0, "step": 30170 }, { "entropy": 6.273468255996704, "epoch": 3.22901171812296, "grad_norm": 1.15625, "learning_rate": 0.000398175845897466, "loss": 5.9134, "mean_token_accuracy": 0.1669686421751976, "num_tokens": 65308802.0, "step": 30175 }, { "entropy": 6.354543685913086, "epoch": 3.229546792230724, "grad_norm": 1.0078125, "learning_rate": 0.0003981438489313516, "loss": 5.9453, "mean_token_accuracy": 0.15112832933664322, "num_tokens": 65319749.0, "step": 30180 }, { "entropy": 6.34881739616394, "epoch": 3.230081866338488, "grad_norm": 1.09375, "learning_rate": 0.00039811184840947585, "loss": 5.9605, "mean_token_accuracy": 0.15768920183181762, "num_tokens": 65331519.0, "step": 30185 }, { "entropy": 6.393287134170532, "epoch": 3.230616940446252, "grad_norm": 1.0546875, "learning_rate": 0.0003980798443327629, "loss": 5.9913, "mean_token_accuracy": 0.15123530030250548, "num_tokens": 65342197.0, "step": 30190 }, { "entropy": 6.355892610549927, "epoch": 3.2311520145540156, "grad_norm": 1.171875, "learning_rate": 0.00039804783670213656, "loss": 5.945, "mean_token_accuracy": 0.15675339847803116, "num_tokens": 65353429.0, "step": 30195 }, { "entropy": 6.416421699523926, "epoch": 3.2316870886617797, "grad_norm": 1.09375, "learning_rate": 0.00039801582551852126, "loss": 5.9562, "mean_token_accuracy": 0.16048043966293335, "num_tokens": 65363836.0, "step": 30200 }, { "entropy": 6.373078966140747, "epoch": 3.2322221627695438, "grad_norm": 1.0546875, "learning_rate": 0.0003979838107828414, "loss": 5.9412, "mean_token_accuracy": 0.15665515065193175, "num_tokens": 65374329.0, "step": 30205 }, { "entropy": 6.357012701034546, "epoch": 3.2327572368773074, "grad_norm": 1.0390625, "learning_rate": 0.00039795179249602113, "loss": 5.9297, "mean_token_accuracy": 0.15692951381206513, "num_tokens": 65385686.0, "step": 30210 }, { "entropy": 6.353206014633178, "epoch": 3.2332923109850715, "grad_norm": 1.375, "learning_rate": 0.00039791977065898525, "loss": 5.9674, "mean_token_accuracy": 0.15095286220312118, "num_tokens": 65397181.0, "step": 30215 }, { "entropy": 6.342682790756226, "epoch": 3.233827385092835, "grad_norm": 1.09375, "learning_rate": 0.00039788774527265824, "loss": 5.9194, "mean_token_accuracy": 0.15264704674482346, "num_tokens": 65407935.0, "step": 30220 }, { "entropy": 6.350274467468262, "epoch": 3.2343624592005993, "grad_norm": 1.0, "learning_rate": 0.0003978557163379649, "loss": 5.9013, "mean_token_accuracy": 0.1554434195160866, "num_tokens": 65418699.0, "step": 30225 }, { "entropy": 6.35891752243042, "epoch": 3.2348975333083634, "grad_norm": 1.1015625, "learning_rate": 0.0003978236838558298, "loss": 5.9121, "mean_token_accuracy": 0.16260215491056443, "num_tokens": 65429783.0, "step": 30230 }, { "entropy": 6.225512599945068, "epoch": 3.235432607416127, "grad_norm": 1.140625, "learning_rate": 0.0003977916478271783, "loss": 5.8385, "mean_token_accuracy": 0.16431558281183242, "num_tokens": 65441001.0, "step": 30235 }, { "entropy": 6.376073694229126, "epoch": 3.235967681523891, "grad_norm": 1.046875, "learning_rate": 0.0003977596082529352, "loss": 5.9469, "mean_token_accuracy": 0.1567121058702469, "num_tokens": 65451219.0, "step": 30240 }, { "entropy": 6.363093280792237, "epoch": 3.236502755631655, "grad_norm": 1.125, "learning_rate": 0.0003977275651340256, "loss": 5.9506, "mean_token_accuracy": 0.15563741624355315, "num_tokens": 65461081.0, "step": 30245 }, { "entropy": 6.397721576690674, "epoch": 3.237037829739419, "grad_norm": 1.125, "learning_rate": 0.0003976955184713748, "loss": 5.9085, "mean_token_accuracy": 0.15638764351606368, "num_tokens": 65470391.0, "step": 30250 }, { "entropy": 6.317216110229492, "epoch": 3.237572903847183, "grad_norm": 1.0625, "learning_rate": 0.00039766346826590823, "loss": 5.9431, "mean_token_accuracy": 0.15324865728616716, "num_tokens": 65482199.0, "step": 30255 }, { "entropy": 6.352609252929687, "epoch": 3.2381079779549466, "grad_norm": 1.1328125, "learning_rate": 0.0003976314145185511, "loss": 5.9178, "mean_token_accuracy": 0.16132396161556245, "num_tokens": 65492497.0, "step": 30260 }, { "entropy": 6.290183591842651, "epoch": 3.2386430520627107, "grad_norm": 0.98828125, "learning_rate": 0.00039759935723022923, "loss": 5.8381, "mean_token_accuracy": 0.164548297226429, "num_tokens": 65503769.0, "step": 30265 }, { "entropy": 6.342886209487915, "epoch": 3.2391781261704744, "grad_norm": 1.1328125, "learning_rate": 0.00039756729640186815, "loss": 6.0066, "mean_token_accuracy": 0.15601623952388763, "num_tokens": 65513582.0, "step": 30270 }, { "entropy": 6.347898721694946, "epoch": 3.2397132002782385, "grad_norm": 1.0625, "learning_rate": 0.0003975352320343935, "loss": 5.9848, "mean_token_accuracy": 0.15583483427762984, "num_tokens": 65523829.0, "step": 30275 }, { "entropy": 6.399092006683349, "epoch": 3.2402482743860026, "grad_norm": 1.0625, "learning_rate": 0.00039750316412873134, "loss": 5.8979, "mean_token_accuracy": 0.16107711642980577, "num_tokens": 65534893.0, "step": 30280 }, { "entropy": 6.300617933273315, "epoch": 3.2407833484937663, "grad_norm": 1.296875, "learning_rate": 0.0003974710926858075, "loss": 5.7924, "mean_token_accuracy": 0.17038630247116088, "num_tokens": 65544551.0, "step": 30285 }, { "entropy": 6.29579644203186, "epoch": 3.2413184226015304, "grad_norm": 1.046875, "learning_rate": 0.0003974390177065481, "loss": 5.9043, "mean_token_accuracy": 0.15752414017915725, "num_tokens": 65554991.0, "step": 30290 }, { "entropy": 6.3608723163604735, "epoch": 3.241853496709294, "grad_norm": 0.984375, "learning_rate": 0.0003974069391918792, "loss": 5.9068, "mean_token_accuracy": 0.1599895879626274, "num_tokens": 65565784.0, "step": 30295 }, { "entropy": 6.345469331741333, "epoch": 3.242388570817058, "grad_norm": 1.09375, "learning_rate": 0.00039737485714272727, "loss": 5.9084, "mean_token_accuracy": 0.15767185688018798, "num_tokens": 65575545.0, "step": 30300 }, { "entropy": 6.3827485084533695, "epoch": 3.242923644924822, "grad_norm": 1.03125, "learning_rate": 0.0003973427715600184, "loss": 5.9909, "mean_token_accuracy": 0.1503295421600342, "num_tokens": 65585987.0, "step": 30305 }, { "entropy": 6.377721357345581, "epoch": 3.243458719032586, "grad_norm": 1.0546875, "learning_rate": 0.0003973106824446792, "loss": 5.9376, "mean_token_accuracy": 0.15477475076913833, "num_tokens": 65596991.0, "step": 30310 }, { "entropy": 6.345965433120727, "epoch": 3.24399379314035, "grad_norm": 1.0703125, "learning_rate": 0.00039727858979763634, "loss": 5.9304, "mean_token_accuracy": 0.15891605168581008, "num_tokens": 65608161.0, "step": 30315 }, { "entropy": 6.420300054550171, "epoch": 3.244528867248114, "grad_norm": 1.0078125, "learning_rate": 0.00039724649361981627, "loss": 5.9408, "mean_token_accuracy": 0.15988098531961442, "num_tokens": 65619859.0, "step": 30320 }, { "entropy": 6.360271692276001, "epoch": 3.2450639413558777, "grad_norm": 0.96484375, "learning_rate": 0.0003972143939121459, "loss": 5.9445, "mean_token_accuracy": 0.15330954268574715, "num_tokens": 65631400.0, "step": 30325 }, { "entropy": 6.368001508712768, "epoch": 3.245599015463642, "grad_norm": 1.0390625, "learning_rate": 0.0003971822906755521, "loss": 5.989, "mean_token_accuracy": 0.14804876297712327, "num_tokens": 65643519.0, "step": 30330 }, { "entropy": 6.327964448928833, "epoch": 3.2461340895714055, "grad_norm": 1.2421875, "learning_rate": 0.00039715018391096185, "loss": 5.8175, "mean_token_accuracy": 0.1632902964949608, "num_tokens": 65654628.0, "step": 30335 }, { "entropy": 6.339906930923462, "epoch": 3.2466691636791696, "grad_norm": 1.046875, "learning_rate": 0.0003971180736193022, "loss": 5.9346, "mean_token_accuracy": 0.15708688646554947, "num_tokens": 65665910.0, "step": 30340 }, { "entropy": 6.4237987995147705, "epoch": 3.2472042377869337, "grad_norm": 1.078125, "learning_rate": 0.00039708595980150025, "loss": 6.0396, "mean_token_accuracy": 0.1506817653775215, "num_tokens": 65677126.0, "step": 30345 }, { "entropy": 6.361273241043091, "epoch": 3.2477393118946973, "grad_norm": 1.078125, "learning_rate": 0.0003970538424584834, "loss": 5.9173, "mean_token_accuracy": 0.15372593253850936, "num_tokens": 65687609.0, "step": 30350 }, { "entropy": 6.354964017868042, "epoch": 3.2482743860024614, "grad_norm": 1.21875, "learning_rate": 0.00039702172159117907, "loss": 5.915, "mean_token_accuracy": 0.1537014976143837, "num_tokens": 65699585.0, "step": 30355 }, { "entropy": 6.349729537963867, "epoch": 3.248809460110225, "grad_norm": 1.015625, "learning_rate": 0.0003969895972005146, "loss": 6.0193, "mean_token_accuracy": 0.15579213500022887, "num_tokens": 65710455.0, "step": 30360 }, { "entropy": 6.367092132568359, "epoch": 3.249344534217989, "grad_norm": 1.0234375, "learning_rate": 0.0003969574692874177, "loss": 5.865, "mean_token_accuracy": 0.1579031988978386, "num_tokens": 65721797.0, "step": 30365 }, { "entropy": 6.30239052772522, "epoch": 3.2498796083257533, "grad_norm": 1.296875, "learning_rate": 0.00039692533785281605, "loss": 5.8588, "mean_token_accuracy": 0.16486866027116776, "num_tokens": 65733571.0, "step": 30370 }, { "entropy": 6.353970575332641, "epoch": 3.250414682433517, "grad_norm": 1.09375, "learning_rate": 0.0003968932028976373, "loss": 5.9569, "mean_token_accuracy": 0.1552031084895134, "num_tokens": 65744501.0, "step": 30375 }, { "entropy": 6.328138732910157, "epoch": 3.250949756541281, "grad_norm": 1.125, "learning_rate": 0.00039686106442280946, "loss": 5.9095, "mean_token_accuracy": 0.15840716511011124, "num_tokens": 65755428.0, "step": 30380 }, { "entropy": 6.3532479763031, "epoch": 3.2514848306490447, "grad_norm": 1.1875, "learning_rate": 0.0003968289224292606, "loss": 5.9071, "mean_token_accuracy": 0.15716451704502105, "num_tokens": 65765535.0, "step": 30385 }, { "entropy": 6.298753499984741, "epoch": 3.252019904756809, "grad_norm": 1.0625, "learning_rate": 0.00039679677691791866, "loss": 5.8597, "mean_token_accuracy": 0.15351609289646148, "num_tokens": 65776084.0, "step": 30390 }, { "entropy": 6.312137174606323, "epoch": 3.252554978864573, "grad_norm": 1.1171875, "learning_rate": 0.0003967646278897119, "loss": 5.87, "mean_token_accuracy": 0.16161112636327743, "num_tokens": 65787470.0, "step": 30395 }, { "entropy": 6.30234694480896, "epoch": 3.2530900529723366, "grad_norm": 1.046875, "learning_rate": 0.0003967324753455687, "loss": 5.8723, "mean_token_accuracy": 0.1661463126540184, "num_tokens": 65796942.0, "step": 30400 }, { "entropy": 6.182130241394043, "epoch": 3.2536251270801007, "grad_norm": 1.0234375, "learning_rate": 0.00039670031928641723, "loss": 5.8262, "mean_token_accuracy": 0.16282837241888046, "num_tokens": 65806902.0, "step": 30405 }, { "entropy": 6.4030442237854, "epoch": 3.2541602011878643, "grad_norm": 1.09375, "learning_rate": 0.00039666815971318623, "loss": 5.919, "mean_token_accuracy": 0.15807410776615144, "num_tokens": 65817689.0, "step": 30410 }, { "entropy": 6.339322757720947, "epoch": 3.2546952752956284, "grad_norm": 1.015625, "learning_rate": 0.00039663599662680414, "loss": 5.9026, "mean_token_accuracy": 0.1603048861026764, "num_tokens": 65827995.0, "step": 30415 }, { "entropy": 6.356000089645386, "epoch": 3.2552303494033925, "grad_norm": 1.2421875, "learning_rate": 0.0003966038300281999, "loss": 6.0326, "mean_token_accuracy": 0.1575124517083168, "num_tokens": 65838449.0, "step": 30420 }, { "entropy": 6.342786026000977, "epoch": 3.255765423511156, "grad_norm": 1.140625, "learning_rate": 0.000396571659918302, "loss": 5.8698, "mean_token_accuracy": 0.1662677600979805, "num_tokens": 65847898.0, "step": 30425 }, { "entropy": 6.267125654220581, "epoch": 3.2563004976189203, "grad_norm": 0.9765625, "learning_rate": 0.0003965394862980396, "loss": 5.8227, "mean_token_accuracy": 0.16681006401777268, "num_tokens": 65859876.0, "step": 30430 }, { "entropy": 6.341329097747803, "epoch": 3.2568355717266844, "grad_norm": 1.078125, "learning_rate": 0.0003965073091683416, "loss": 5.8833, "mean_token_accuracy": 0.16083730459213258, "num_tokens": 65869875.0, "step": 30435 }, { "entropy": 6.3444836139678955, "epoch": 3.257370645834448, "grad_norm": 1.09375, "learning_rate": 0.00039647512853013703, "loss": 5.9287, "mean_token_accuracy": 0.16226765811443328, "num_tokens": 65881351.0, "step": 30440 }, { "entropy": 6.325698614120483, "epoch": 3.257905719942212, "grad_norm": 1.0703125, "learning_rate": 0.0003964429443843552, "loss": 5.9615, "mean_token_accuracy": 0.15688835084438324, "num_tokens": 65892533.0, "step": 30445 }, { "entropy": 6.2956398010253904, "epoch": 3.2584407940499758, "grad_norm": 1.015625, "learning_rate": 0.00039641075673192564, "loss": 5.8325, "mean_token_accuracy": 0.15702176988124847, "num_tokens": 65903754.0, "step": 30450 }, { "entropy": 6.236862230300903, "epoch": 3.25897586815774, "grad_norm": 1.125, "learning_rate": 0.00039637856557377734, "loss": 5.7835, "mean_token_accuracy": 0.16829108595848083, "num_tokens": 65915461.0, "step": 30455 }, { "entropy": 6.300532960891724, "epoch": 3.2595109422655035, "grad_norm": 1.0234375, "learning_rate": 0.00039634637091083997, "loss": 5.9256, "mean_token_accuracy": 0.16011509597301482, "num_tokens": 65927108.0, "step": 30460 }, { "entropy": 6.351787137985229, "epoch": 3.2600460163732676, "grad_norm": 1.0859375, "learning_rate": 0.00039631417274404334, "loss": 5.9176, "mean_token_accuracy": 0.1591697856783867, "num_tokens": 65937965.0, "step": 30465 }, { "entropy": 6.310473012924194, "epoch": 3.2605810904810317, "grad_norm": 1.3203125, "learning_rate": 0.00039628197107431694, "loss": 5.8688, "mean_token_accuracy": 0.1680653288960457, "num_tokens": 65948393.0, "step": 30470 }, { "entropy": 6.269739723205566, "epoch": 3.2611161645887954, "grad_norm": 1.0546875, "learning_rate": 0.00039624976590259064, "loss": 5.874, "mean_token_accuracy": 0.15577549189329148, "num_tokens": 65958960.0, "step": 30475 }, { "entropy": 6.2846739292144775, "epoch": 3.2616512386965595, "grad_norm": 1.1640625, "learning_rate": 0.00039621755722979446, "loss": 5.8897, "mean_token_accuracy": 0.1537087231874466, "num_tokens": 65970937.0, "step": 30480 }, { "entropy": 6.401094150543213, "epoch": 3.2621863128043236, "grad_norm": 1.1796875, "learning_rate": 0.0003961853450568583, "loss": 5.9566, "mean_token_accuracy": 0.15662571489810945, "num_tokens": 65982444.0, "step": 30485 }, { "entropy": 6.447933912277222, "epoch": 3.2627213869120872, "grad_norm": 1.0546875, "learning_rate": 0.00039615312938471236, "loss": 5.9244, "mean_token_accuracy": 0.15535683333873748, "num_tokens": 65994392.0, "step": 30490 }, { "entropy": 6.37358775138855, "epoch": 3.2632564610198513, "grad_norm": 1.03125, "learning_rate": 0.00039612091021428683, "loss": 5.9581, "mean_token_accuracy": 0.15749985575675965, "num_tokens": 66004710.0, "step": 30495 }, { "entropy": 6.3385029315948485, "epoch": 3.263791535127615, "grad_norm": 1.0625, "learning_rate": 0.0003960886875465121, "loss": 5.9802, "mean_token_accuracy": 0.15836521983146667, "num_tokens": 66015402.0, "step": 30500 }, { "entropy": 6.2820641040802006, "epoch": 3.264326609235379, "grad_norm": 1.09375, "learning_rate": 0.00039605646138231835, "loss": 5.9079, "mean_token_accuracy": 0.1618013635277748, "num_tokens": 66026795.0, "step": 30505 }, { "entropy": 6.384062719345093, "epoch": 3.264861683343143, "grad_norm": 1.09375, "learning_rate": 0.00039602423172263644, "loss": 5.8773, "mean_token_accuracy": 0.16349391043186187, "num_tokens": 66037339.0, "step": 30510 }, { "entropy": 6.292804431915283, "epoch": 3.265396757450907, "grad_norm": 1.0703125, "learning_rate": 0.0003959919985683968, "loss": 5.9246, "mean_token_accuracy": 0.1612306445837021, "num_tokens": 66047415.0, "step": 30515 }, { "entropy": 6.378669929504395, "epoch": 3.265931831558671, "grad_norm": 1.1015625, "learning_rate": 0.00039595976192053023, "loss": 5.9342, "mean_token_accuracy": 0.16099851876497268, "num_tokens": 66057475.0, "step": 30520 }, { "entropy": 6.337419080734253, "epoch": 3.2664669056664346, "grad_norm": 1.1328125, "learning_rate": 0.0003959275217799675, "loss": 5.8595, "mean_token_accuracy": 0.16475404649972916, "num_tokens": 66067018.0, "step": 30525 }, { "entropy": 6.285846281051636, "epoch": 3.2670019797741987, "grad_norm": 1.078125, "learning_rate": 0.0003958952781476396, "loss": 5.9399, "mean_token_accuracy": 0.1552480012178421, "num_tokens": 66077822.0, "step": 30530 }, { "entropy": 6.354210376739502, "epoch": 3.267537053881963, "grad_norm": 1.0625, "learning_rate": 0.0003958630310244775, "loss": 5.9401, "mean_token_accuracy": 0.1593428686261177, "num_tokens": 66088849.0, "step": 30535 }, { "entropy": 6.428970527648926, "epoch": 3.2680721279897265, "grad_norm": 1.0859375, "learning_rate": 0.00039583078041141237, "loss": 5.9249, "mean_token_accuracy": 0.158566677570343, "num_tokens": 66098516.0, "step": 30540 }, { "entropy": 6.377659511566162, "epoch": 3.2686072020974906, "grad_norm": 1.0625, "learning_rate": 0.0003957985263093754, "loss": 5.9564, "mean_token_accuracy": 0.15967983603477479, "num_tokens": 66109202.0, "step": 30545 }, { "entropy": 6.377461004257202, "epoch": 3.2691422762052547, "grad_norm": 1.1015625, "learning_rate": 0.000395766268719298, "loss": 5.9073, "mean_token_accuracy": 0.1566906377673149, "num_tokens": 66119445.0, "step": 30550 }, { "entropy": 6.2991623878479, "epoch": 3.2696773503130183, "grad_norm": 1.0625, "learning_rate": 0.00039573400764211157, "loss": 5.9574, "mean_token_accuracy": 0.16321357041597367, "num_tokens": 66129922.0, "step": 30555 }, { "entropy": 6.350006341934204, "epoch": 3.2702124244207824, "grad_norm": 1.25, "learning_rate": 0.0003957017430787476, "loss": 5.9839, "mean_token_accuracy": 0.15093000382184982, "num_tokens": 66141118.0, "step": 30560 }, { "entropy": 6.435110425949096, "epoch": 3.270747498528546, "grad_norm": 1.0703125, "learning_rate": 0.00039566947503013786, "loss": 5.9735, "mean_token_accuracy": 0.15997108072042465, "num_tokens": 66152415.0, "step": 30565 }, { "entropy": 6.320454692840576, "epoch": 3.27128257263631, "grad_norm": 1.15625, "learning_rate": 0.0003956372034972139, "loss": 5.8676, "mean_token_accuracy": 0.1610361412167549, "num_tokens": 66163086.0, "step": 30570 }, { "entropy": 6.2855010509490965, "epoch": 3.271817646744074, "grad_norm": 1.078125, "learning_rate": 0.00039560492848090764, "loss": 5.9207, "mean_token_accuracy": 0.1584438070654869, "num_tokens": 66173020.0, "step": 30575 }, { "entropy": 6.336791896820069, "epoch": 3.272352720851838, "grad_norm": 1.0390625, "learning_rate": 0.000395572649982151, "loss": 5.938, "mean_token_accuracy": 0.1584812507033348, "num_tokens": 66183979.0, "step": 30580 }, { "entropy": 6.409608650207519, "epoch": 3.272887794959602, "grad_norm": 1.09375, "learning_rate": 0.00039554036800187604, "loss": 5.845, "mean_token_accuracy": 0.16065284609794617, "num_tokens": 66194703.0, "step": 30585 }, { "entropy": 6.3347899436950685, "epoch": 3.2734228690673657, "grad_norm": 1.0625, "learning_rate": 0.00039550808254101497, "loss": 5.921, "mean_token_accuracy": 0.1593735158443451, "num_tokens": 66206041.0, "step": 30590 }, { "entropy": 6.332829380035401, "epoch": 3.27395794317513, "grad_norm": 1.0390625, "learning_rate": 0.00039547579360049977, "loss": 5.9377, "mean_token_accuracy": 0.1615785002708435, "num_tokens": 66218197.0, "step": 30595 }, { "entropy": 6.368980455398559, "epoch": 3.274493017282894, "grad_norm": 1.0390625, "learning_rate": 0.00039544350118126315, "loss": 5.9105, "mean_token_accuracy": 0.15695230960845946, "num_tokens": 66229261.0, "step": 30600 }, { "entropy": 6.35713562965393, "epoch": 3.2750280913906575, "grad_norm": 1.140625, "learning_rate": 0.0003954112052842373, "loss": 5.8475, "mean_token_accuracy": 0.1681408628821373, "num_tokens": 66240162.0, "step": 30605 }, { "entropy": 6.204670429229736, "epoch": 3.2755631654984216, "grad_norm": 1.0703125, "learning_rate": 0.0003953789059103548, "loss": 5.8567, "mean_token_accuracy": 0.1588082954287529, "num_tokens": 66250284.0, "step": 30610 }, { "entropy": 6.343547391891479, "epoch": 3.2760982396061853, "grad_norm": 1.0390625, "learning_rate": 0.00039534660306054836, "loss": 5.9632, "mean_token_accuracy": 0.15208282172679902, "num_tokens": 66261164.0, "step": 30615 }, { "entropy": 6.356458473205566, "epoch": 3.2766333137139494, "grad_norm": 1.0390625, "learning_rate": 0.00039531429673575057, "loss": 5.8521, "mean_token_accuracy": 0.16048834323883057, "num_tokens": 66272201.0, "step": 30620 }, { "entropy": 6.337864732742309, "epoch": 3.2771683878217135, "grad_norm": 1.1015625, "learning_rate": 0.00039528198693689444, "loss": 5.9483, "mean_token_accuracy": 0.17062288671731948, "num_tokens": 66281297.0, "step": 30625 }, { "entropy": 6.281550693511963, "epoch": 3.277703461929477, "grad_norm": 1.1640625, "learning_rate": 0.0003952496736649129, "loss": 5.8797, "mean_token_accuracy": 0.16028413325548171, "num_tokens": 66290990.0, "step": 30630 }, { "entropy": 6.31608214378357, "epoch": 3.2782385360372412, "grad_norm": 1.4140625, "learning_rate": 0.0003952173569207388, "loss": 5.9202, "mean_token_accuracy": 0.15496979802846908, "num_tokens": 66301971.0, "step": 30635 }, { "entropy": 6.367606687545776, "epoch": 3.278773610145005, "grad_norm": 1.0703125, "learning_rate": 0.0003951850367053054, "loss": 5.9877, "mean_token_accuracy": 0.14890836849808692, "num_tokens": 66313576.0, "step": 30640 }, { "entropy": 6.418611192703247, "epoch": 3.279308684252769, "grad_norm": 1.0703125, "learning_rate": 0.0003951527130195461, "loss": 5.9617, "mean_token_accuracy": 0.15192402601242067, "num_tokens": 66325367.0, "step": 30645 }, { "entropy": 6.2988649845123295, "epoch": 3.279843758360533, "grad_norm": 0.99609375, "learning_rate": 0.00039512038586439404, "loss": 5.8314, "mean_token_accuracy": 0.16815833747386932, "num_tokens": 66335686.0, "step": 30650 }, { "entropy": 6.255978727340699, "epoch": 3.2803788324682968, "grad_norm": 1.2734375, "learning_rate": 0.00039508805524078263, "loss": 5.8648, "mean_token_accuracy": 0.16466347873210907, "num_tokens": 66345963.0, "step": 30655 }, { "entropy": 6.337360143661499, "epoch": 3.280913906576061, "grad_norm": 1.015625, "learning_rate": 0.00039505572114964554, "loss": 5.9539, "mean_token_accuracy": 0.1593144029378891, "num_tokens": 66357781.0, "step": 30660 }, { "entropy": 6.3978982925415036, "epoch": 3.281448980683825, "grad_norm": 1.1484375, "learning_rate": 0.0003950233835919164, "loss": 5.933, "mean_token_accuracy": 0.1651606097817421, "num_tokens": 66369360.0, "step": 30665 }, { "entropy": 6.280345153808594, "epoch": 3.2819840547915886, "grad_norm": 1.046875, "learning_rate": 0.0003949910425685289, "loss": 5.8826, "mean_token_accuracy": 0.156340554356575, "num_tokens": 66381481.0, "step": 30670 }, { "entropy": 6.314227294921875, "epoch": 3.2825191288993527, "grad_norm": 1.0859375, "learning_rate": 0.0003949586980804169, "loss": 5.8863, "mean_token_accuracy": 0.16042409539222718, "num_tokens": 66391469.0, "step": 30675 }, { "entropy": 6.342227029800415, "epoch": 3.2830542030071164, "grad_norm": 1.046875, "learning_rate": 0.00039492635012851443, "loss": 5.9013, "mean_token_accuracy": 0.15668895244598388, "num_tokens": 66402094.0, "step": 30680 }, { "entropy": 6.332187223434448, "epoch": 3.2835892771148805, "grad_norm": 1.0703125, "learning_rate": 0.00039489399871375536, "loss": 5.8909, "mean_token_accuracy": 0.155439243465662, "num_tokens": 66412149.0, "step": 30685 }, { "entropy": 6.366730976104736, "epoch": 3.284124351222644, "grad_norm": 1.0859375, "learning_rate": 0.0003948616438370739, "loss": 5.9718, "mean_token_accuracy": 0.15496269464492798, "num_tokens": 66423502.0, "step": 30690 }, { "entropy": 6.409840154647827, "epoch": 3.2846594253304082, "grad_norm": 1.0625, "learning_rate": 0.0003948292854994045, "loss": 5.8418, "mean_token_accuracy": 0.16197359412908555, "num_tokens": 66433684.0, "step": 30695 }, { "entropy": 6.245207786560059, "epoch": 3.2851944994381723, "grad_norm": 1.0859375, "learning_rate": 0.00039479692370168116, "loss": 5.834, "mean_token_accuracy": 0.16638642996549607, "num_tokens": 66444728.0, "step": 30700 }, { "entropy": 6.282481336593628, "epoch": 3.285729573545936, "grad_norm": 1.0078125, "learning_rate": 0.00039476455844483847, "loss": 5.9251, "mean_token_accuracy": 0.15469312518835068, "num_tokens": 66456117.0, "step": 30705 }, { "entropy": 6.3112281322479244, "epoch": 3.2862646476537, "grad_norm": 1.1171875, "learning_rate": 0.0003947321897298111, "loss": 5.9525, "mean_token_accuracy": 0.15750307068228722, "num_tokens": 66466467.0, "step": 30710 }, { "entropy": 6.399078464508056, "epoch": 3.286799721761464, "grad_norm": 1.0234375, "learning_rate": 0.0003946998175575335, "loss": 6.0138, "mean_token_accuracy": 0.146767558157444, "num_tokens": 66477702.0, "step": 30715 }, { "entropy": 6.359793472290039, "epoch": 3.287334795869228, "grad_norm": 1.0390625, "learning_rate": 0.00039466744192894046, "loss": 5.9233, "mean_token_accuracy": 0.15969512164592742, "num_tokens": 66489359.0, "step": 30720 }, { "entropy": 6.339571475982666, "epoch": 3.287869869976992, "grad_norm": 1.109375, "learning_rate": 0.0003946350628449669, "loss": 5.8621, "mean_token_accuracy": 0.16263861656188966, "num_tokens": 66500337.0, "step": 30725 }, { "entropy": 6.3483888626098635, "epoch": 3.2884049440847556, "grad_norm": 1.15625, "learning_rate": 0.00039460268030654767, "loss": 5.9262, "mean_token_accuracy": 0.1608071058988571, "num_tokens": 66510010.0, "step": 30730 }, { "entropy": 6.332152318954468, "epoch": 3.2889400181925197, "grad_norm": 1.0546875, "learning_rate": 0.00039457029431461794, "loss": 5.9149, "mean_token_accuracy": 0.16205437630414962, "num_tokens": 66521570.0, "step": 30735 }, { "entropy": 6.324231243133545, "epoch": 3.2894750923002833, "grad_norm": 1.0078125, "learning_rate": 0.0003945379048701127, "loss": 5.8759, "mean_token_accuracy": 0.1593353971838951, "num_tokens": 66532825.0, "step": 30740 }, { "entropy": 6.35346827507019, "epoch": 3.2900101664080474, "grad_norm": 1.171875, "learning_rate": 0.00039450551197396725, "loss": 5.8994, "mean_token_accuracy": 0.15889225900173187, "num_tokens": 66543265.0, "step": 30745 }, { "entropy": 6.340929746627808, "epoch": 3.2905452405158115, "grad_norm": 1.046875, "learning_rate": 0.00039447311562711693, "loss": 6.0322, "mean_token_accuracy": 0.15107912421226502, "num_tokens": 66553589.0, "step": 30750 }, { "entropy": 6.273663091659546, "epoch": 3.291080314623575, "grad_norm": 1.015625, "learning_rate": 0.00039444071583049717, "loss": 5.8925, "mean_token_accuracy": 0.16127362102270126, "num_tokens": 66564679.0, "step": 30755 }, { "entropy": 6.389392280578614, "epoch": 3.2916153887313393, "grad_norm": 1.09375, "learning_rate": 0.00039440831258504363, "loss": 5.9407, "mean_token_accuracy": 0.15777754485607148, "num_tokens": 66576408.0, "step": 30760 }, { "entropy": 6.405173969268799, "epoch": 3.2921504628391034, "grad_norm": 1.046875, "learning_rate": 0.00039437590589169177, "loss": 5.9786, "mean_token_accuracy": 0.15548625588417053, "num_tokens": 66587535.0, "step": 30765 }, { "entropy": 6.363118124008179, "epoch": 3.292685536946867, "grad_norm": 1.015625, "learning_rate": 0.00039434349575137736, "loss": 5.9487, "mean_token_accuracy": 0.1552908092737198, "num_tokens": 66598493.0, "step": 30770 }, { "entropy": 6.358616304397583, "epoch": 3.293220611054631, "grad_norm": 1.03125, "learning_rate": 0.0003943110821650364, "loss": 5.8795, "mean_token_accuracy": 0.1580806106328964, "num_tokens": 66609366.0, "step": 30775 }, { "entropy": 6.270710754394531, "epoch": 3.293755685162395, "grad_norm": 1.0234375, "learning_rate": 0.0003942786651336046, "loss": 5.7997, "mean_token_accuracy": 0.1702853560447693, "num_tokens": 66619902.0, "step": 30780 }, { "entropy": 6.311319875717163, "epoch": 3.294290759270159, "grad_norm": 1.0234375, "learning_rate": 0.0003942462446580181, "loss": 6.0035, "mean_token_accuracy": 0.14871114864945412, "num_tokens": 66630629.0, "step": 30785 }, { "entropy": 6.390186929702759, "epoch": 3.294825833377923, "grad_norm": 1.0703125, "learning_rate": 0.00039421382073921306, "loss": 5.9349, "mean_token_accuracy": 0.15790194422006607, "num_tokens": 66640720.0, "step": 30790 }, { "entropy": 6.3997447967529295, "epoch": 3.2953609074856867, "grad_norm": 1.09375, "learning_rate": 0.0003941813933781257, "loss": 5.9385, "mean_token_accuracy": 0.14949843138456345, "num_tokens": 66653021.0, "step": 30795 }, { "entropy": 6.364885377883911, "epoch": 3.2958959815934508, "grad_norm": 1.03125, "learning_rate": 0.0003941489625756923, "loss": 5.9149, "mean_token_accuracy": 0.15501758605241775, "num_tokens": 66663997.0, "step": 30800 }, { "entropy": 6.290837383270263, "epoch": 3.2964310557012144, "grad_norm": 1.203125, "learning_rate": 0.00039411652833284944, "loss": 5.8943, "mean_token_accuracy": 0.156836798787117, "num_tokens": 66674632.0, "step": 30805 }, { "entropy": 6.279900312423706, "epoch": 3.2969661298089785, "grad_norm": 1.0078125, "learning_rate": 0.0003940840906505336, "loss": 5.8825, "mean_token_accuracy": 0.1623164102435112, "num_tokens": 66685289.0, "step": 30810 }, { "entropy": 6.404059362411499, "epoch": 3.2975012039167426, "grad_norm": 1.140625, "learning_rate": 0.0003940516495296813, "loss": 5.9642, "mean_token_accuracy": 0.1562154173851013, "num_tokens": 66696448.0, "step": 30815 }, { "entropy": 6.410660028457642, "epoch": 3.2980362780245063, "grad_norm": 1.0625, "learning_rate": 0.00039401920497122934, "loss": 5.9674, "mean_token_accuracy": 0.15787955224514008, "num_tokens": 66706186.0, "step": 30820 }, { "entropy": 6.349200296401977, "epoch": 3.2985713521322704, "grad_norm": 1.0625, "learning_rate": 0.00039398675697611464, "loss": 6.0069, "mean_token_accuracy": 0.14906342029571534, "num_tokens": 66717586.0, "step": 30825 }, { "entropy": 6.401060390472412, "epoch": 3.2991064262400345, "grad_norm": 1.15625, "learning_rate": 0.000393954305545274, "loss": 5.8924, "mean_token_accuracy": 0.1589537024497986, "num_tokens": 66727985.0, "step": 30830 }, { "entropy": 6.301091575622559, "epoch": 3.299641500347798, "grad_norm": 0.93359375, "learning_rate": 0.00039392185067964444, "loss": 5.9243, "mean_token_accuracy": 0.15649376660585404, "num_tokens": 66738966.0, "step": 30835 }, { "entropy": 6.241626834869384, "epoch": 3.3001765744555622, "grad_norm": 1.0625, "learning_rate": 0.00039388939238016327, "loss": 5.8872, "mean_token_accuracy": 0.1605398878455162, "num_tokens": 66750442.0, "step": 30840 }, { "entropy": 6.389183282852173, "epoch": 3.300711648563326, "grad_norm": 1.0859375, "learning_rate": 0.0003938569306477675, "loss": 5.9748, "mean_token_accuracy": 0.15763875395059584, "num_tokens": 66761246.0, "step": 30845 }, { "entropy": 6.415066337585449, "epoch": 3.30124672267109, "grad_norm": 1.03125, "learning_rate": 0.00039382446548339464, "loss": 5.9631, "mean_token_accuracy": 0.15395050048828124, "num_tokens": 66771711.0, "step": 30850 }, { "entropy": 6.2245104789733885, "epoch": 3.3017817967788536, "grad_norm": 1.078125, "learning_rate": 0.0003937919968879819, "loss": 5.8412, "mean_token_accuracy": 0.17166627943515778, "num_tokens": 66783185.0, "step": 30855 }, { "entropy": 6.402577495574951, "epoch": 3.3023168708866177, "grad_norm": 1.03125, "learning_rate": 0.0003937595248624671, "loss": 5.9622, "mean_token_accuracy": 0.15840210616588593, "num_tokens": 66794541.0, "step": 30860 }, { "entropy": 6.348500490188599, "epoch": 3.302851944994382, "grad_norm": 1.1171875, "learning_rate": 0.0003937270494077876, "loss": 5.9166, "mean_token_accuracy": 0.16368071138858795, "num_tokens": 66805617.0, "step": 30865 }, { "entropy": 6.372380638122559, "epoch": 3.3033870191021455, "grad_norm": 1.0703125, "learning_rate": 0.00039369457052488134, "loss": 5.9199, "mean_token_accuracy": 0.16149611473083497, "num_tokens": 66814784.0, "step": 30870 }, { "entropy": 6.3330755710601805, "epoch": 3.3039220932099096, "grad_norm": 1.125, "learning_rate": 0.00039366208821468596, "loss": 5.952, "mean_token_accuracy": 0.1568122088909149, "num_tokens": 66825416.0, "step": 30875 }, { "entropy": 6.306815147399902, "epoch": 3.3044571673176737, "grad_norm": 0.9296875, "learning_rate": 0.0003936296024781394, "loss": 5.9107, "mean_token_accuracy": 0.1555990606546402, "num_tokens": 66836471.0, "step": 30880 }, { "entropy": 6.284813356399536, "epoch": 3.3049922414254373, "grad_norm": 1.0859375, "learning_rate": 0.00039359711331617993, "loss": 5.902, "mean_token_accuracy": 0.15928992331027986, "num_tokens": 66848911.0, "step": 30885 }, { "entropy": 6.371595191955566, "epoch": 3.3055273155332014, "grad_norm": 1.0703125, "learning_rate": 0.00039356462072974533, "loss": 5.893, "mean_token_accuracy": 0.16198835968971254, "num_tokens": 66860095.0, "step": 30890 }, { "entropy": 6.289154195785523, "epoch": 3.306062389640965, "grad_norm": 1.234375, "learning_rate": 0.00039353212471977394, "loss": 5.8142, "mean_token_accuracy": 0.16339728981256485, "num_tokens": 66872676.0, "step": 30895 }, { "entropy": 6.346558237075806, "epoch": 3.306597463748729, "grad_norm": 1.0546875, "learning_rate": 0.0003934996252872042, "loss": 5.9601, "mean_token_accuracy": 0.14937701299786568, "num_tokens": 66883686.0, "step": 30900 }, { "entropy": 6.305317354202271, "epoch": 3.3071325378564933, "grad_norm": 1.0703125, "learning_rate": 0.0003934671224329744, "loss": 5.9877, "mean_token_accuracy": 0.1567397877573967, "num_tokens": 66895971.0, "step": 30905 }, { "entropy": 6.377016019821167, "epoch": 3.307667611964257, "grad_norm": 1.015625, "learning_rate": 0.0003934346161580231, "loss": 5.951, "mean_token_accuracy": 0.15658905655145644, "num_tokens": 66907840.0, "step": 30910 }, { "entropy": 6.379696989059449, "epoch": 3.308202686072021, "grad_norm": 1.0390625, "learning_rate": 0.00039340210646328887, "loss": 5.9755, "mean_token_accuracy": 0.15224821716547013, "num_tokens": 66918956.0, "step": 30915 }, { "entropy": 6.315245485305786, "epoch": 3.3087377601797847, "grad_norm": 0.9609375, "learning_rate": 0.0003933695933497105, "loss": 5.8949, "mean_token_accuracy": 0.1622962161898613, "num_tokens": 66929653.0, "step": 30920 }, { "entropy": 6.300663232803345, "epoch": 3.309272834287549, "grad_norm": 1.0625, "learning_rate": 0.00039333707681822664, "loss": 5.8774, "mean_token_accuracy": 0.16511468291282655, "num_tokens": 66939268.0, "step": 30925 }, { "entropy": 6.29182014465332, "epoch": 3.309807908395313, "grad_norm": 1.0703125, "learning_rate": 0.00039330455686977645, "loss": 5.924, "mean_token_accuracy": 0.16224616318941115, "num_tokens": 66949669.0, "step": 30930 }, { "entropy": 6.402207279205323, "epoch": 3.3103429825030766, "grad_norm": 1.171875, "learning_rate": 0.0003932720335052987, "loss": 5.8997, "mean_token_accuracy": 0.16619591414928436, "num_tokens": 66959882.0, "step": 30935 }, { "entropy": 6.366602802276612, "epoch": 3.3108780566108407, "grad_norm": 1.125, "learning_rate": 0.0003932395067257327, "loss": 5.9856, "mean_token_accuracy": 0.1562362790107727, "num_tokens": 66972848.0, "step": 30940 }, { "entropy": 6.345404577255249, "epoch": 3.3114131307186048, "grad_norm": 1.140625, "learning_rate": 0.0003932069765320175, "loss": 5.8623, "mean_token_accuracy": 0.1639861837029457, "num_tokens": 66983289.0, "step": 30945 }, { "entropy": 6.334231662750244, "epoch": 3.3119482048263684, "grad_norm": 1.125, "learning_rate": 0.00039317444292509253, "loss": 5.8736, "mean_token_accuracy": 0.16246797442436217, "num_tokens": 66994194.0, "step": 30950 }, { "entropy": 6.350417709350586, "epoch": 3.3124832789341325, "grad_norm": 1.1171875, "learning_rate": 0.00039314190590589696, "loss": 5.9164, "mean_token_accuracy": 0.16368313133716583, "num_tokens": 67005889.0, "step": 30955 }, { "entropy": 6.258232831954956, "epoch": 3.313018353041896, "grad_norm": 1.5703125, "learning_rate": 0.0003931093654753706, "loss": 5.8426, "mean_token_accuracy": 0.15567004084587097, "num_tokens": 67017237.0, "step": 30960 }, { "entropy": 6.362979984283447, "epoch": 3.3135534271496603, "grad_norm": 1.0546875, "learning_rate": 0.0003930768216344529, "loss": 5.9228, "mean_token_accuracy": 0.16014671474695205, "num_tokens": 67027637.0, "step": 30965 }, { "entropy": 6.309683561325073, "epoch": 3.314088501257424, "grad_norm": 1.1015625, "learning_rate": 0.00039304427438408354, "loss": 5.955, "mean_token_accuracy": 0.15845882445573806, "num_tokens": 67039039.0, "step": 30970 }, { "entropy": 6.358542728424072, "epoch": 3.314623575365188, "grad_norm": 1.03125, "learning_rate": 0.00039301172372520235, "loss": 5.9332, "mean_token_accuracy": 0.15458953827619554, "num_tokens": 67048944.0, "step": 30975 }, { "entropy": 6.339445543289185, "epoch": 3.315158649472952, "grad_norm": 1.0390625, "learning_rate": 0.0003929791696587492, "loss": 5.9227, "mean_token_accuracy": 0.15854973793029786, "num_tokens": 67059724.0, "step": 30980 }, { "entropy": 6.308003616333008, "epoch": 3.315693723580716, "grad_norm": 1.1015625, "learning_rate": 0.0003929466121856641, "loss": 5.8552, "mean_token_accuracy": 0.16061045080423356, "num_tokens": 67070128.0, "step": 30985 }, { "entropy": 6.359524536132812, "epoch": 3.31622879768848, "grad_norm": 1.1953125, "learning_rate": 0.00039291405130688725, "loss": 5.9485, "mean_token_accuracy": 0.15897016525268554, "num_tokens": 67080739.0, "step": 30990 }, { "entropy": 6.348344182968139, "epoch": 3.316763871796244, "grad_norm": 1.1015625, "learning_rate": 0.00039288148702335863, "loss": 5.9001, "mean_token_accuracy": 0.15522107630968093, "num_tokens": 67091020.0, "step": 30995 }, { "entropy": 6.330518674850464, "epoch": 3.3172989459040076, "grad_norm": 1.0078125, "learning_rate": 0.0003928489193360186, "loss": 5.8971, "mean_token_accuracy": 0.15438204631209373, "num_tokens": 67101201.0, "step": 31000 }, { "entropy": 6.322536325454712, "epoch": 3.3178340200117717, "grad_norm": 0.96875, "learning_rate": 0.0003928163482458078, "loss": 5.9208, "mean_token_accuracy": 0.1649194300174713, "num_tokens": 67112829.0, "step": 31005 }, { "entropy": 6.402040195465088, "epoch": 3.3183690941195354, "grad_norm": 1.09375, "learning_rate": 0.00039278377375366624, "loss": 5.9593, "mean_token_accuracy": 0.16082851439714432, "num_tokens": 67123626.0, "step": 31010 }, { "entropy": 6.355078458786011, "epoch": 3.3189041682272995, "grad_norm": 1.2109375, "learning_rate": 0.00039275119586053487, "loss": 5.9484, "mean_token_accuracy": 0.15635877400636672, "num_tokens": 67134858.0, "step": 31015 }, { "entropy": 6.268181943893433, "epoch": 3.3194392423350636, "grad_norm": 1.0703125, "learning_rate": 0.0003927186145673543, "loss": 5.8195, "mean_token_accuracy": 0.1616908386349678, "num_tokens": 67144496.0, "step": 31020 }, { "entropy": 6.301995277404785, "epoch": 3.3199743164428273, "grad_norm": 1.078125, "learning_rate": 0.00039268602987506526, "loss": 5.882, "mean_token_accuracy": 0.16297390460968017, "num_tokens": 67155443.0, "step": 31025 }, { "entropy": 6.4214763164520265, "epoch": 3.3205093905505914, "grad_norm": 1.0703125, "learning_rate": 0.0003926534417846086, "loss": 5.9514, "mean_token_accuracy": 0.1517513081431389, "num_tokens": 67167604.0, "step": 31030 }, { "entropy": 6.355584764480591, "epoch": 3.321044464658355, "grad_norm": 0.98828125, "learning_rate": 0.00039262085029692536, "loss": 5.8682, "mean_token_accuracy": 0.160004360973835, "num_tokens": 67177915.0, "step": 31035 }, { "entropy": 6.3126136302948, "epoch": 3.321579538766119, "grad_norm": 1.125, "learning_rate": 0.00039258825541295666, "loss": 5.8829, "mean_token_accuracy": 0.16748716831207275, "num_tokens": 67188515.0, "step": 31040 }, { "entropy": 6.301870584487915, "epoch": 3.322114612873883, "grad_norm": 1.0703125, "learning_rate": 0.00039255565713364356, "loss": 5.9266, "mean_token_accuracy": 0.16151254624128342, "num_tokens": 67199139.0, "step": 31045 }, { "entropy": 6.34945240020752, "epoch": 3.322649686981647, "grad_norm": 1.03125, "learning_rate": 0.0003925230554599273, "loss": 5.9288, "mean_token_accuracy": 0.15427338033914567, "num_tokens": 67210335.0, "step": 31050 }, { "entropy": 6.395308160781861, "epoch": 3.323184761089411, "grad_norm": 1.0234375, "learning_rate": 0.00039249045039274947, "loss": 5.9108, "mean_token_accuracy": 0.16360032856464385, "num_tokens": 67220128.0, "step": 31055 }, { "entropy": 6.2978884220123295, "epoch": 3.3237198351971746, "grad_norm": 1.046875, "learning_rate": 0.0003924578419330513, "loss": 5.8966, "mean_token_accuracy": 0.16897470653057098, "num_tokens": 67231251.0, "step": 31060 }, { "entropy": 6.32319598197937, "epoch": 3.3242549093049387, "grad_norm": 1.0625, "learning_rate": 0.0003924252300817745, "loss": 5.9214, "mean_token_accuracy": 0.15588078498840333, "num_tokens": 67243336.0, "step": 31065 }, { "entropy": 6.383984327316284, "epoch": 3.324789983412703, "grad_norm": 1.0546875, "learning_rate": 0.0003923926148398606, "loss": 5.926, "mean_token_accuracy": 0.15499215871095656, "num_tokens": 67256210.0, "step": 31070 }, { "entropy": 6.381352043151855, "epoch": 3.3253250575204665, "grad_norm": 1.1328125, "learning_rate": 0.0003923599962082516, "loss": 5.8162, "mean_token_accuracy": 0.16563912630081176, "num_tokens": 67266271.0, "step": 31075 }, { "entropy": 6.326909446716309, "epoch": 3.3258601316282306, "grad_norm": 1.140625, "learning_rate": 0.00039232737418788905, "loss": 5.9312, "mean_token_accuracy": 0.159072907269001, "num_tokens": 67278206.0, "step": 31080 }, { "entropy": 6.335284852981568, "epoch": 3.3263952057359942, "grad_norm": 0.97265625, "learning_rate": 0.0003922947487797151, "loss": 5.9174, "mean_token_accuracy": 0.15958180129528046, "num_tokens": 67289002.0, "step": 31085 }, { "entropy": 6.3531371593475345, "epoch": 3.3269302798437583, "grad_norm": 1.0234375, "learning_rate": 0.00039226211998467177, "loss": 5.9588, "mean_token_accuracy": 0.16095621287822723, "num_tokens": 67300219.0, "step": 31090 }, { "entropy": 6.3867181777954105, "epoch": 3.3274653539515224, "grad_norm": 1.015625, "learning_rate": 0.00039222948780370126, "loss": 6.0061, "mean_token_accuracy": 0.15471390932798385, "num_tokens": 67311611.0, "step": 31095 }, { "entropy": 6.3437896251678465, "epoch": 3.328000428059286, "grad_norm": 0.95703125, "learning_rate": 0.0003921968522377456, "loss": 5.9328, "mean_token_accuracy": 0.16560337245464324, "num_tokens": 67322674.0, "step": 31100 }, { "entropy": 6.379694652557373, "epoch": 3.32853550216705, "grad_norm": 1.09375, "learning_rate": 0.0003921642132877474, "loss": 6.0223, "mean_token_accuracy": 0.15328683704137802, "num_tokens": 67333574.0, "step": 31105 }, { "entropy": 6.3997642993927, "epoch": 3.3290705762748143, "grad_norm": 1.0625, "learning_rate": 0.000392131570954649, "loss": 5.8673, "mean_token_accuracy": 0.15644650161266327, "num_tokens": 67343500.0, "step": 31110 }, { "entropy": 6.3466568946838375, "epoch": 3.329605650382578, "grad_norm": 1.0078125, "learning_rate": 0.000392098925239393, "loss": 5.9505, "mean_token_accuracy": 0.15643005967140197, "num_tokens": 67354108.0, "step": 31115 }, { "entropy": 6.332209920883178, "epoch": 3.330140724490342, "grad_norm": 1.0, "learning_rate": 0.00039206627614292195, "loss": 5.9783, "mean_token_accuracy": 0.1557902306318283, "num_tokens": 67366177.0, "step": 31120 }, { "entropy": 6.396706867218017, "epoch": 3.3306757985981057, "grad_norm": 1.1015625, "learning_rate": 0.0003920336236661786, "loss": 5.9342, "mean_token_accuracy": 0.15841941088438033, "num_tokens": 67377000.0, "step": 31125 }, { "entropy": 6.2952704429626465, "epoch": 3.33121087270587, "grad_norm": 1.0, "learning_rate": 0.00039200096781010586, "loss": 5.8777, "mean_token_accuracy": 0.16159260421991348, "num_tokens": 67388052.0, "step": 31130 }, { "entropy": 6.244263076782227, "epoch": 3.3317459468136335, "grad_norm": 1.0859375, "learning_rate": 0.0003919683085756466, "loss": 5.8989, "mean_token_accuracy": 0.169601409137249, "num_tokens": 67398701.0, "step": 31135 }, { "entropy": 6.3170084953308105, "epoch": 3.3322810209213976, "grad_norm": 0.984375, "learning_rate": 0.00039193564596374386, "loss": 5.9026, "mean_token_accuracy": 0.16090536415576934, "num_tokens": 67410207.0, "step": 31140 }, { "entropy": 6.369432020187378, "epoch": 3.3328160950291617, "grad_norm": 1.125, "learning_rate": 0.0003919029799753408, "loss": 5.9187, "mean_token_accuracy": 0.15353570580482484, "num_tokens": 67420883.0, "step": 31145 }, { "entropy": 6.315747022628784, "epoch": 3.3333511691369253, "grad_norm": 0.984375, "learning_rate": 0.0003918703106113806, "loss": 5.8852, "mean_token_accuracy": 0.16460797786712647, "num_tokens": 67430558.0, "step": 31150 }, { "entropy": 6.3260293960571286, "epoch": 3.3338862432446894, "grad_norm": 1.0234375, "learning_rate": 0.0003918376378728066, "loss": 5.9086, "mean_token_accuracy": 0.16336806416511535, "num_tokens": 67441774.0, "step": 31155 }, { "entropy": 6.3647431373596195, "epoch": 3.3344213173524535, "grad_norm": 1.0390625, "learning_rate": 0.00039180496176056224, "loss": 5.904, "mean_token_accuracy": 0.15873169302940368, "num_tokens": 67452176.0, "step": 31160 }, { "entropy": 6.343244838714599, "epoch": 3.334956391460217, "grad_norm": 1.0859375, "learning_rate": 0.00039177228227559095, "loss": 5.8285, "mean_token_accuracy": 0.17091814130544664, "num_tokens": 67462427.0, "step": 31165 }, { "entropy": 6.2919677734375, "epoch": 3.3354914655679813, "grad_norm": 1.09375, "learning_rate": 0.00039173959941883645, "loss": 5.9358, "mean_token_accuracy": 0.16480541378259658, "num_tokens": 67472611.0, "step": 31170 }, { "entropy": 6.32710223197937, "epoch": 3.336026539675745, "grad_norm": 1.0703125, "learning_rate": 0.00039170691319124253, "loss": 5.939, "mean_token_accuracy": 0.15119593739509582, "num_tokens": 67483138.0, "step": 31175 }, { "entropy": 6.332677841186523, "epoch": 3.336561613783509, "grad_norm": 1.1171875, "learning_rate": 0.0003916742235937528, "loss": 5.9065, "mean_token_accuracy": 0.15622949451208115, "num_tokens": 67493962.0, "step": 31180 }, { "entropy": 6.301177740097046, "epoch": 3.337096687891273, "grad_norm": 1.03125, "learning_rate": 0.0003916415306273112, "loss": 5.892, "mean_token_accuracy": 0.15975964069366455, "num_tokens": 67506882.0, "step": 31185 }, { "entropy": 6.359765815734863, "epoch": 3.3376317619990368, "grad_norm": 1.0625, "learning_rate": 0.00039160883429286195, "loss": 5.9196, "mean_token_accuracy": 0.16009874343872071, "num_tokens": 67517357.0, "step": 31190 }, { "entropy": 6.366964626312256, "epoch": 3.338166836106801, "grad_norm": 1.09375, "learning_rate": 0.00039157613459134884, "loss": 5.94, "mean_token_accuracy": 0.15779439359903336, "num_tokens": 67528480.0, "step": 31195 }, { "entropy": 6.358095359802246, "epoch": 3.3387019102145645, "grad_norm": 1.1015625, "learning_rate": 0.0003915434315237163, "loss": 5.9932, "mean_token_accuracy": 0.15827042907476424, "num_tokens": 67539288.0, "step": 31200 }, { "entropy": 6.263265371322632, "epoch": 3.3392369843223286, "grad_norm": 1.09375, "learning_rate": 0.0003915107250909085, "loss": 5.8479, "mean_token_accuracy": 0.16481115967035292, "num_tokens": 67551105.0, "step": 31205 }, { "entropy": 6.311769151687622, "epoch": 3.3397720584300927, "grad_norm": 0.96875, "learning_rate": 0.00039147801529386997, "loss": 5.9372, "mean_token_accuracy": 0.15335349142551422, "num_tokens": 67562421.0, "step": 31210 }, { "entropy": 6.341737508773804, "epoch": 3.3403071325378564, "grad_norm": 1.015625, "learning_rate": 0.00039144530213354505, "loss": 5.9461, "mean_token_accuracy": 0.15644164085388185, "num_tokens": 67574134.0, "step": 31215 }, { "entropy": 6.317190170288086, "epoch": 3.3408422066456205, "grad_norm": 1.0859375, "learning_rate": 0.0003914125856108785, "loss": 5.9072, "mean_token_accuracy": 0.15642464458942412, "num_tokens": 67585557.0, "step": 31220 }, { "entropy": 6.293677282333374, "epoch": 3.3413772807533846, "grad_norm": 1.046875, "learning_rate": 0.0003913798657268148, "loss": 5.8623, "mean_token_accuracy": 0.16006892770528794, "num_tokens": 67596854.0, "step": 31225 }, { "entropy": 6.419577264785767, "epoch": 3.3419123548611482, "grad_norm": 0.98828125, "learning_rate": 0.0003913471424822988, "loss": 5.9212, "mean_token_accuracy": 0.16011992394924163, "num_tokens": 67607282.0, "step": 31230 }, { "entropy": 6.339190149307251, "epoch": 3.3424474289689123, "grad_norm": 1.0703125, "learning_rate": 0.0003913144158782754, "loss": 5.9119, "mean_token_accuracy": 0.15739689767360687, "num_tokens": 67618228.0, "step": 31235 }, { "entropy": 6.267108154296875, "epoch": 3.342982503076676, "grad_norm": 1.078125, "learning_rate": 0.00039128168591568975, "loss": 5.8874, "mean_token_accuracy": 0.17052439004182815, "num_tokens": 67630618.0, "step": 31240 }, { "entropy": 6.31747670173645, "epoch": 3.34351757718444, "grad_norm": 1.0390625, "learning_rate": 0.0003912489525954866, "loss": 5.9598, "mean_token_accuracy": 0.1603257969021797, "num_tokens": 67641052.0, "step": 31245 }, { "entropy": 6.3459876537322994, "epoch": 3.3440526512922037, "grad_norm": 1.125, "learning_rate": 0.00039121621591861134, "loss": 5.8934, "mean_token_accuracy": 0.15915393382310866, "num_tokens": 67651315.0, "step": 31250 }, { "entropy": 6.323659610748291, "epoch": 3.344587725399968, "grad_norm": 0.99609375, "learning_rate": 0.00039118347588600917, "loss": 5.9251, "mean_token_accuracy": 0.1569801911711693, "num_tokens": 67661637.0, "step": 31255 }, { "entropy": 6.225724458694458, "epoch": 3.345122799507732, "grad_norm": 1.046875, "learning_rate": 0.0003911507324986254, "loss": 5.8243, "mean_token_accuracy": 0.16638871282339096, "num_tokens": 67672863.0, "step": 31260 }, { "entropy": 6.336835479736328, "epoch": 3.3456578736154956, "grad_norm": 1.0703125, "learning_rate": 0.0003911179857574056, "loss": 5.912, "mean_token_accuracy": 0.16022328436374664, "num_tokens": 67683711.0, "step": 31265 }, { "entropy": 6.363942003250122, "epoch": 3.3461929477232597, "grad_norm": 1.1953125, "learning_rate": 0.0003910852356632953, "loss": 5.8549, "mean_token_accuracy": 0.16481334418058396, "num_tokens": 67694345.0, "step": 31270 }, { "entropy": 6.393367624282837, "epoch": 3.346728021831024, "grad_norm": 1.0625, "learning_rate": 0.0003910524822172402, "loss": 5.9376, "mean_token_accuracy": 0.16247619837522506, "num_tokens": 67705339.0, "step": 31275 }, { "entropy": 6.255667066574096, "epoch": 3.3472630959387875, "grad_norm": 1.0078125, "learning_rate": 0.0003910197254201858, "loss": 5.8562, "mean_token_accuracy": 0.16282291561365128, "num_tokens": 67715800.0, "step": 31280 }, { "entropy": 6.372138547897339, "epoch": 3.3477981700465516, "grad_norm": 1.0390625, "learning_rate": 0.0003909869652730783, "loss": 6.0166, "mean_token_accuracy": 0.15958251804113388, "num_tokens": 67725733.0, "step": 31285 }, { "entropy": 6.350641536712646, "epoch": 3.348333244154315, "grad_norm": 1.0859375, "learning_rate": 0.00039095420177686334, "loss": 5.894, "mean_token_accuracy": 0.15774645507335663, "num_tokens": 67737637.0, "step": 31290 }, { "entropy": 6.31675009727478, "epoch": 3.3488683182620793, "grad_norm": 1.0859375, "learning_rate": 0.0003909214349324872, "loss": 5.8668, "mean_token_accuracy": 0.16342253088951111, "num_tokens": 67748016.0, "step": 31295 }, { "entropy": 6.322062206268311, "epoch": 3.3494033923698434, "grad_norm": 1.0703125, "learning_rate": 0.00039088866474089583, "loss": 5.9276, "mean_token_accuracy": 0.15619656443595886, "num_tokens": 67758439.0, "step": 31300 }, { "entropy": 6.404497146606445, "epoch": 3.349938466477607, "grad_norm": 1.1015625, "learning_rate": 0.00039085589120303564, "loss": 5.8705, "mean_token_accuracy": 0.16216991245746612, "num_tokens": 67768978.0, "step": 31305 }, { "entropy": 6.250673723220825, "epoch": 3.350473540585371, "grad_norm": 1.1484375, "learning_rate": 0.0003908231143198529, "loss": 5.8915, "mean_token_accuracy": 0.16979419738054274, "num_tokens": 67779557.0, "step": 31310 }, { "entropy": 6.32977294921875, "epoch": 3.351008614693135, "grad_norm": 0.98046875, "learning_rate": 0.00039079033409229394, "loss": 5.958, "mean_token_accuracy": 0.15410535782575607, "num_tokens": 67791561.0, "step": 31315 }, { "entropy": 6.380669593811035, "epoch": 3.351543688800899, "grad_norm": 1.0703125, "learning_rate": 0.0003907575505213053, "loss": 5.8844, "mean_token_accuracy": 0.15684252232313156, "num_tokens": 67801703.0, "step": 31320 }, { "entropy": 6.3797986030578615, "epoch": 3.352078762908663, "grad_norm": 1.078125, "learning_rate": 0.0003907247636078337, "loss": 5.9439, "mean_token_accuracy": 0.15947069525718688, "num_tokens": 67812413.0, "step": 31325 }, { "entropy": 6.353877973556519, "epoch": 3.3526138370164267, "grad_norm": 1.0546875, "learning_rate": 0.00039069197335282583, "loss": 5.9194, "mean_token_accuracy": 0.16312412023544312, "num_tokens": 67823184.0, "step": 31330 }, { "entropy": 6.391801548004151, "epoch": 3.353148911124191, "grad_norm": 1.0234375, "learning_rate": 0.00039065917975722854, "loss": 5.9345, "mean_token_accuracy": 0.1573050931096077, "num_tokens": 67834372.0, "step": 31335 }, { "entropy": 6.248562526702881, "epoch": 3.3536839852319544, "grad_norm": 1.1171875, "learning_rate": 0.0003906263828219886, "loss": 5.8087, "mean_token_accuracy": 0.16439150273799896, "num_tokens": 67845324.0, "step": 31340 }, { "entropy": 6.347679185867309, "epoch": 3.3542190593397185, "grad_norm": 1.0859375, "learning_rate": 0.0003905935825480531, "loss": 5.8557, "mean_token_accuracy": 0.15679066628217697, "num_tokens": 67856140.0, "step": 31345 }, { "entropy": 6.433311843872071, "epoch": 3.3547541334474826, "grad_norm": 1.1953125, "learning_rate": 0.00039056077893636916, "loss": 5.9935, "mean_token_accuracy": 0.15758806318044663, "num_tokens": 67867117.0, "step": 31350 }, { "entropy": 6.349848794937134, "epoch": 3.3552892075552463, "grad_norm": 1.0546875, "learning_rate": 0.00039052797198788406, "loss": 5.9921, "mean_token_accuracy": 0.15401579588651657, "num_tokens": 67877006.0, "step": 31355 }, { "entropy": 6.25895733833313, "epoch": 3.3558242816630104, "grad_norm": 1.140625, "learning_rate": 0.0003904951617035448, "loss": 5.7798, "mean_token_accuracy": 0.17360152751207353, "num_tokens": 67886873.0, "step": 31360 }, { "entropy": 6.412776279449463, "epoch": 3.356359355770774, "grad_norm": 1.1015625, "learning_rate": 0.0003904623480842992, "loss": 5.9865, "mean_token_accuracy": 0.15820162147283554, "num_tokens": 67897033.0, "step": 31365 }, { "entropy": 6.34528169631958, "epoch": 3.356894429878538, "grad_norm": 1.0078125, "learning_rate": 0.0003904295311310944, "loss": 5.8812, "mean_token_accuracy": 0.1615615278482437, "num_tokens": 67909030.0, "step": 31370 }, { "entropy": 6.348956489562989, "epoch": 3.3574295039863022, "grad_norm": 1.125, "learning_rate": 0.0003903967108448782, "loss": 5.9648, "mean_token_accuracy": 0.1602029547095299, "num_tokens": 67918736.0, "step": 31375 }, { "entropy": 6.2761951923370365, "epoch": 3.357964578094066, "grad_norm": 1.1484375, "learning_rate": 0.00039036388722659803, "loss": 5.8785, "mean_token_accuracy": 0.16833263784646987, "num_tokens": 67929392.0, "step": 31380 }, { "entropy": 6.430927419662476, "epoch": 3.35849965220183, "grad_norm": 1.0859375, "learning_rate": 0.000390331060277202, "loss": 6.0165, "mean_token_accuracy": 0.1486252225935459, "num_tokens": 67940634.0, "step": 31385 }, { "entropy": 6.353127098083496, "epoch": 3.359034726309594, "grad_norm": 1.0625, "learning_rate": 0.0003902982299976377, "loss": 5.8625, "mean_token_accuracy": 0.16376085430383683, "num_tokens": 67951132.0, "step": 31390 }, { "entropy": 6.283902263641357, "epoch": 3.3595698004173578, "grad_norm": 1.1484375, "learning_rate": 0.00039026539638885326, "loss": 5.9579, "mean_token_accuracy": 0.14900934025645257, "num_tokens": 67961651.0, "step": 31395 }, { "entropy": 6.246290493011474, "epoch": 3.360104874525122, "grad_norm": 1.203125, "learning_rate": 0.0003902325594517967, "loss": 5.8074, "mean_token_accuracy": 0.1670494332909584, "num_tokens": 67971906.0, "step": 31400 }, { "entropy": 6.3366259098052975, "epoch": 3.3606399486328855, "grad_norm": 1.0234375, "learning_rate": 0.00039019971918741615, "loss": 5.9343, "mean_token_accuracy": 0.15913352072238923, "num_tokens": 67983059.0, "step": 31405 }, { "entropy": 6.356402349472046, "epoch": 3.3611750227406496, "grad_norm": 1.4609375, "learning_rate": 0.00039016687559665985, "loss": 5.9422, "mean_token_accuracy": 0.15753271877765657, "num_tokens": 67993635.0, "step": 31410 }, { "entropy": 6.4557098865509035, "epoch": 3.3617100968484133, "grad_norm": 1.0390625, "learning_rate": 0.0003901340286804763, "loss": 5.9279, "mean_token_accuracy": 0.1639988660812378, "num_tokens": 68003857.0, "step": 31415 }, { "entropy": 6.304980707168579, "epoch": 3.3622451709561774, "grad_norm": 0.99609375, "learning_rate": 0.00039010117843981377, "loss": 5.8936, "mean_token_accuracy": 0.15766562670469284, "num_tokens": 68014993.0, "step": 31420 }, { "entropy": 6.3284016132354735, "epoch": 3.3627802450639415, "grad_norm": 1.1328125, "learning_rate": 0.00039006832487562096, "loss": 5.943, "mean_token_accuracy": 0.15819145143032073, "num_tokens": 68026245.0, "step": 31425 }, { "entropy": 6.371609163284302, "epoch": 3.363315319171705, "grad_norm": 1.1484375, "learning_rate": 0.0003900354679888464, "loss": 5.9644, "mean_token_accuracy": 0.16544907689094543, "num_tokens": 68038023.0, "step": 31430 }, { "entropy": 6.388720703125, "epoch": 3.363850393279469, "grad_norm": 1.0546875, "learning_rate": 0.0003900026077804389, "loss": 5.9273, "mean_token_accuracy": 0.15765781402587892, "num_tokens": 68048527.0, "step": 31435 }, { "entropy": 6.357768774032593, "epoch": 3.3643854673872333, "grad_norm": 1.03125, "learning_rate": 0.0003899697442513472, "loss": 5.9111, "mean_token_accuracy": 0.1544856533408165, "num_tokens": 68059345.0, "step": 31440 }, { "entropy": 6.296919059753418, "epoch": 3.364920541494997, "grad_norm": 0.98046875, "learning_rate": 0.00038993687740252034, "loss": 5.8924, "mean_token_accuracy": 0.15753896832466124, "num_tokens": 68070295.0, "step": 31445 }, { "entropy": 6.313209772109985, "epoch": 3.365455615602761, "grad_norm": 0.96484375, "learning_rate": 0.0003899040072349073, "loss": 5.8545, "mean_token_accuracy": 0.1584890104830265, "num_tokens": 68081665.0, "step": 31450 }, { "entropy": 6.321349859237671, "epoch": 3.3659906897105247, "grad_norm": 1.25, "learning_rate": 0.0003898711337494571, "loss": 5.8677, "mean_token_accuracy": 0.16856600791215898, "num_tokens": 68092474.0, "step": 31455 }, { "entropy": 6.346615743637085, "epoch": 3.366525763818289, "grad_norm": 1.15625, "learning_rate": 0.0003898382569471191, "loss": 5.9462, "mean_token_accuracy": 0.14840178340673446, "num_tokens": 68102981.0, "step": 31460 }, { "entropy": 6.346072196960449, "epoch": 3.367060837926053, "grad_norm": 1.109375, "learning_rate": 0.00038980537682884266, "loss": 5.86, "mean_token_accuracy": 0.16198442727327347, "num_tokens": 68113785.0, "step": 31465 }, { "entropy": 6.323547983169556, "epoch": 3.3675959120338166, "grad_norm": 1.1015625, "learning_rate": 0.00038977249339557703, "loss": 5.9511, "mean_token_accuracy": 0.16057277470827103, "num_tokens": 68123419.0, "step": 31470 }, { "entropy": 6.304243564605713, "epoch": 3.3681309861415807, "grad_norm": 1.0625, "learning_rate": 0.00038973960664827177, "loss": 5.8556, "mean_token_accuracy": 0.1623724192380905, "num_tokens": 68134816.0, "step": 31475 }, { "entropy": 6.367283773422241, "epoch": 3.3686660602493443, "grad_norm": 1.0234375, "learning_rate": 0.00038970671658787647, "loss": 5.8617, "mean_token_accuracy": 0.1598104566335678, "num_tokens": 68146063.0, "step": 31480 }, { "entropy": 6.355152702331543, "epoch": 3.3692011343571084, "grad_norm": 1.1171875, "learning_rate": 0.00038967382321534094, "loss": 5.9668, "mean_token_accuracy": 0.1639233112335205, "num_tokens": 68156735.0, "step": 31485 }, { "entropy": 6.359158134460449, "epoch": 3.3697362084648725, "grad_norm": 0.9921875, "learning_rate": 0.00038964092653161474, "loss": 5.9548, "mean_token_accuracy": 0.1563218541443348, "num_tokens": 68167768.0, "step": 31490 }, { "entropy": 6.365906190872193, "epoch": 3.370271282572636, "grad_norm": 0.98046875, "learning_rate": 0.000389608026537648, "loss": 5.8101, "mean_token_accuracy": 0.17123451828956604, "num_tokens": 68179325.0, "step": 31495 }, { "entropy": 6.316630744934082, "epoch": 3.3708063566804003, "grad_norm": 1.03125, "learning_rate": 0.0003895751232343906, "loss": 5.9713, "mean_token_accuracy": 0.15429348796606063, "num_tokens": 68190615.0, "step": 31500 }, { "entropy": 6.290878534317017, "epoch": 3.3713414307881644, "grad_norm": 1.0234375, "learning_rate": 0.0003895422166227926, "loss": 5.8828, "mean_token_accuracy": 0.1596289560198784, "num_tokens": 68201323.0, "step": 31505 }, { "entropy": 6.365823602676391, "epoch": 3.371876504895928, "grad_norm": 1.140625, "learning_rate": 0.0003895093067038042, "loss": 5.9176, "mean_token_accuracy": 0.15762345343828202, "num_tokens": 68213296.0, "step": 31510 }, { "entropy": 6.327750778198242, "epoch": 3.372411579003692, "grad_norm": 0.953125, "learning_rate": 0.0003894763934783757, "loss": 5.9638, "mean_token_accuracy": 0.15102601200342178, "num_tokens": 68224707.0, "step": 31515 }, { "entropy": 6.389570474624634, "epoch": 3.372946653111456, "grad_norm": 1.09375, "learning_rate": 0.0003894434769474573, "loss": 5.971, "mean_token_accuracy": 0.15209591686725615, "num_tokens": 68236651.0, "step": 31520 }, { "entropy": 6.403979301452637, "epoch": 3.37348172721922, "grad_norm": 1.0546875, "learning_rate": 0.0003894105571119996, "loss": 5.9507, "mean_token_accuracy": 0.15929437130689622, "num_tokens": 68246933.0, "step": 31525 }, { "entropy": 6.314308500289917, "epoch": 3.3740168013269836, "grad_norm": 1.0625, "learning_rate": 0.00038937763397295323, "loss": 5.9168, "mean_token_accuracy": 0.15775490328669547, "num_tokens": 68257934.0, "step": 31530 }, { "entropy": 6.317617321014405, "epoch": 3.3745518754347477, "grad_norm": 1.0078125, "learning_rate": 0.00038934470753126867, "loss": 5.8601, "mean_token_accuracy": 0.16134185045957566, "num_tokens": 68268841.0, "step": 31535 }, { "entropy": 6.331466150283814, "epoch": 3.3750869495425118, "grad_norm": 1.046875, "learning_rate": 0.00038931177778789685, "loss": 5.8935, "mean_token_accuracy": 0.16028808653354645, "num_tokens": 68280391.0, "step": 31540 }, { "entropy": 6.282064962387085, "epoch": 3.3756220236502754, "grad_norm": 1.078125, "learning_rate": 0.0003892788447437885, "loss": 5.8939, "mean_token_accuracy": 0.15922484695911407, "num_tokens": 68291886.0, "step": 31545 }, { "entropy": 6.278917741775513, "epoch": 3.3761570977580395, "grad_norm": 1.0859375, "learning_rate": 0.00038924590839989445, "loss": 5.8839, "mean_token_accuracy": 0.15601437389850617, "num_tokens": 68302909.0, "step": 31550 }, { "entropy": 6.347108936309814, "epoch": 3.3766921718658036, "grad_norm": 1.21875, "learning_rate": 0.00038921296875716596, "loss": 5.9772, "mean_token_accuracy": 0.15296049118041993, "num_tokens": 68314204.0, "step": 31555 }, { "entropy": 6.3367212295532225, "epoch": 3.3772272459735673, "grad_norm": 1.1015625, "learning_rate": 0.00038918002581655406, "loss": 5.8998, "mean_token_accuracy": 0.16221345961093903, "num_tokens": 68325861.0, "step": 31560 }, { "entropy": 6.399341154098511, "epoch": 3.3777623200813314, "grad_norm": 1.0390625, "learning_rate": 0.0003891470795790098, "loss": 5.937, "mean_token_accuracy": 0.1571291208267212, "num_tokens": 68336390.0, "step": 31565 }, { "entropy": 6.294640588760376, "epoch": 3.378297394189095, "grad_norm": 1.03125, "learning_rate": 0.00038911413004548477, "loss": 5.9231, "mean_token_accuracy": 0.15505021065473557, "num_tokens": 68347429.0, "step": 31570 }, { "entropy": 6.368715429306031, "epoch": 3.378832468296859, "grad_norm": 1.0546875, "learning_rate": 0.0003890811772169302, "loss": 6.0018, "mean_token_accuracy": 0.15658997595310212, "num_tokens": 68358417.0, "step": 31575 }, { "entropy": 6.382956600189209, "epoch": 3.3793675424046232, "grad_norm": 1.046875, "learning_rate": 0.00038904822109429773, "loss": 5.8542, "mean_token_accuracy": 0.167889204621315, "num_tokens": 68369495.0, "step": 31580 }, { "entropy": 6.324877309799194, "epoch": 3.379902616512387, "grad_norm": 1.0234375, "learning_rate": 0.0003890152616785389, "loss": 5.9343, "mean_token_accuracy": 0.16030012518167497, "num_tokens": 68380122.0, "step": 31585 }, { "entropy": 6.288950824737549, "epoch": 3.380437690620151, "grad_norm": 1.046875, "learning_rate": 0.00038898229897060544, "loss": 5.8978, "mean_token_accuracy": 0.16836827695369722, "num_tokens": 68389997.0, "step": 31590 }, { "entropy": 6.358822774887085, "epoch": 3.3809727647279146, "grad_norm": 1.109375, "learning_rate": 0.00038894933297144906, "loss": 5.9244, "mean_token_accuracy": 0.15334995836019516, "num_tokens": 68399726.0, "step": 31595 }, { "entropy": 6.333579015731812, "epoch": 3.3815078388356787, "grad_norm": 1.140625, "learning_rate": 0.00038891636368202173, "loss": 5.8348, "mean_token_accuracy": 0.16248081624507904, "num_tokens": 68410022.0, "step": 31600 }, { "entropy": 6.1293988704681395, "epoch": 3.382042912943443, "grad_norm": 1.0078125, "learning_rate": 0.00038888339110327544, "loss": 5.708, "mean_token_accuracy": 0.19186663925647734, "num_tokens": 68421269.0, "step": 31605 }, { "entropy": 6.182875490188598, "epoch": 3.3825779870512065, "grad_norm": 0.9921875, "learning_rate": 0.00038885041523616223, "loss": 5.8433, "mean_token_accuracy": 0.17163716852664948, "num_tokens": 68432979.0, "step": 31610 }, { "entropy": 6.3011555671691895, "epoch": 3.3831130611589706, "grad_norm": 1.0234375, "learning_rate": 0.00038881743608163414, "loss": 5.8481, "mean_token_accuracy": 0.16261026114225388, "num_tokens": 68443379.0, "step": 31615 }, { "entropy": 6.362244892120361, "epoch": 3.3836481352667347, "grad_norm": 1.1171875, "learning_rate": 0.00038878445364064375, "loss": 5.8982, "mean_token_accuracy": 0.15733107328414916, "num_tokens": 68454277.0, "step": 31620 }, { "entropy": 6.339710092544555, "epoch": 3.3841832093744983, "grad_norm": 1.015625, "learning_rate": 0.00038875146791414315, "loss": 5.891, "mean_token_accuracy": 0.15833710134029388, "num_tokens": 68465774.0, "step": 31625 }, { "entropy": 6.368165826797485, "epoch": 3.3847182834822624, "grad_norm": 1.1015625, "learning_rate": 0.00038871847890308497, "loss": 5.9049, "mean_token_accuracy": 0.15990494191646576, "num_tokens": 68476083.0, "step": 31630 }, { "entropy": 6.339833354949951, "epoch": 3.385253357590026, "grad_norm": 1.0625, "learning_rate": 0.0003886854866084216, "loss": 5.9309, "mean_token_accuracy": 0.16469287127256393, "num_tokens": 68486696.0, "step": 31635 }, { "entropy": 6.3527178287506105, "epoch": 3.38578843169779, "grad_norm": 1.0625, "learning_rate": 0.0003886524910311058, "loss": 5.9323, "mean_token_accuracy": 0.15948884338140487, "num_tokens": 68497458.0, "step": 31640 }, { "entropy": 6.331284379959106, "epoch": 3.386323505805554, "grad_norm": 1.0625, "learning_rate": 0.0003886194921720904, "loss": 5.9229, "mean_token_accuracy": 0.16019311547279358, "num_tokens": 68508603.0, "step": 31645 }, { "entropy": 6.321746873855591, "epoch": 3.386858579913318, "grad_norm": 1.0859375, "learning_rate": 0.000388586490032328, "loss": 5.8879, "mean_token_accuracy": 0.15804281681776047, "num_tokens": 68519389.0, "step": 31650 }, { "entropy": 6.3087553024292, "epoch": 3.387393654021082, "grad_norm": 1.0234375, "learning_rate": 0.0003885534846127717, "loss": 5.8032, "mean_token_accuracy": 0.16524447053670882, "num_tokens": 68529272.0, "step": 31655 }, { "entropy": 6.342393589019776, "epoch": 3.3879287281288457, "grad_norm": 1.0234375, "learning_rate": 0.0003885204759143746, "loss": 5.9107, "mean_token_accuracy": 0.1586567610502243, "num_tokens": 68539644.0, "step": 31660 }, { "entropy": 6.241860103607178, "epoch": 3.38846380223661, "grad_norm": 1.0625, "learning_rate": 0.0003884874639380895, "loss": 5.8642, "mean_token_accuracy": 0.16428154408931733, "num_tokens": 68549601.0, "step": 31665 }, { "entropy": 6.2896637439727785, "epoch": 3.388998876344374, "grad_norm": 1.0625, "learning_rate": 0.00038845444868486996, "loss": 5.9335, "mean_token_accuracy": 0.16821042448282242, "num_tokens": 68561105.0, "step": 31670 }, { "entropy": 6.3667925834655765, "epoch": 3.3895339504521376, "grad_norm": 1.078125, "learning_rate": 0.0003884214301556692, "loss": 5.9923, "mean_token_accuracy": 0.15034228265285493, "num_tokens": 68572117.0, "step": 31675 }, { "entropy": 6.36685094833374, "epoch": 3.3900690245599017, "grad_norm": 1.015625, "learning_rate": 0.00038838840835144053, "loss": 5.9396, "mean_token_accuracy": 0.15702482163906098, "num_tokens": 68582241.0, "step": 31680 }, { "entropy": 6.259359359741211, "epoch": 3.3906040986676653, "grad_norm": 1.078125, "learning_rate": 0.00038835538327313746, "loss": 5.8605, "mean_token_accuracy": 0.15754588693380356, "num_tokens": 68594977.0, "step": 31685 }, { "entropy": 6.258713626861573, "epoch": 3.3911391727754294, "grad_norm": 1.0546875, "learning_rate": 0.00038832235492171363, "loss": 5.8326, "mean_token_accuracy": 0.16828258633613585, "num_tokens": 68605483.0, "step": 31690 }, { "entropy": 6.253437137603759, "epoch": 3.391674246883193, "grad_norm": 1.21875, "learning_rate": 0.00038828932329812275, "loss": 5.8117, "mean_token_accuracy": 0.16914481818675994, "num_tokens": 68615274.0, "step": 31695 }, { "entropy": 6.355664348602295, "epoch": 3.392209320990957, "grad_norm": 1.0078125, "learning_rate": 0.0003882562884033186, "loss": 5.9228, "mean_token_accuracy": 0.15720644146203994, "num_tokens": 68626512.0, "step": 31700 }, { "entropy": 6.26300745010376, "epoch": 3.3927443950987213, "grad_norm": 1.0625, "learning_rate": 0.00038822325023825507, "loss": 5.8949, "mean_token_accuracy": 0.15540675669908524, "num_tokens": 68637846.0, "step": 31705 }, { "entropy": 6.349530410766602, "epoch": 3.393279469206485, "grad_norm": 1.0, "learning_rate": 0.00038819020880388603, "loss": 5.9335, "mean_token_accuracy": 0.1492257222533226, "num_tokens": 68650377.0, "step": 31710 }, { "entropy": 6.318300485610962, "epoch": 3.393814543314249, "grad_norm": 1.15625, "learning_rate": 0.0003881571641011656, "loss": 5.9141, "mean_token_accuracy": 0.15665498822927476, "num_tokens": 68661358.0, "step": 31715 }, { "entropy": 6.323435926437378, "epoch": 3.394349617422013, "grad_norm": 1.0, "learning_rate": 0.000388124116131048, "loss": 5.9006, "mean_token_accuracy": 0.1546189747750759, "num_tokens": 68673592.0, "step": 31720 }, { "entropy": 6.3038708686828615, "epoch": 3.394884691529777, "grad_norm": 1.09375, "learning_rate": 0.00038809106489448743, "loss": 5.8052, "mean_token_accuracy": 0.1700574591755867, "num_tokens": 68684225.0, "step": 31725 }, { "entropy": 6.300347852706909, "epoch": 3.395419765637541, "grad_norm": 1.078125, "learning_rate": 0.00038805801039243826, "loss": 5.9465, "mean_token_accuracy": 0.16030891984701157, "num_tokens": 68694243.0, "step": 31730 }, { "entropy": 6.326868724822998, "epoch": 3.3959548397453045, "grad_norm": 1.1484375, "learning_rate": 0.000388024952625855, "loss": 5.9112, "mean_token_accuracy": 0.15884208381175996, "num_tokens": 68704359.0, "step": 31735 }, { "entropy": 6.315462446212768, "epoch": 3.3964899138530686, "grad_norm": 1.046875, "learning_rate": 0.00038799189159569194, "loss": 5.9, "mean_token_accuracy": 0.16111193895339965, "num_tokens": 68714317.0, "step": 31740 }, { "entropy": 6.353393840789795, "epoch": 3.3970249879608327, "grad_norm": 1.125, "learning_rate": 0.000387958827302904, "loss": 5.9806, "mean_token_accuracy": 0.15453319549560546, "num_tokens": 68725601.0, "step": 31745 }, { "entropy": 6.392735719680786, "epoch": 3.3975600620685964, "grad_norm": 1.1015625, "learning_rate": 0.00038792575974844575, "loss": 5.9106, "mean_token_accuracy": 0.1610969141125679, "num_tokens": 68735692.0, "step": 31750 }, { "entropy": 6.308428049087524, "epoch": 3.3980951361763605, "grad_norm": 1.109375, "learning_rate": 0.0003878926889332721, "loss": 5.7975, "mean_token_accuracy": 0.17427408397197724, "num_tokens": 68746693.0, "step": 31755 }, { "entropy": 6.28787784576416, "epoch": 3.398630210284124, "grad_norm": 0.95703125, "learning_rate": 0.0003878596148583379, "loss": 5.9286, "mean_token_accuracy": 0.15945797115564347, "num_tokens": 68757769.0, "step": 31760 }, { "entropy": 6.30269718170166, "epoch": 3.3991652843918883, "grad_norm": 1.0546875, "learning_rate": 0.0003878265375245982, "loss": 5.854, "mean_token_accuracy": 0.15954254940152168, "num_tokens": 68768066.0, "step": 31765 }, { "entropy": 6.292194128036499, "epoch": 3.3997003584996524, "grad_norm": 1.1015625, "learning_rate": 0.000387793456933008, "loss": 5.857, "mean_token_accuracy": 0.15869167298078538, "num_tokens": 68780093.0, "step": 31770 }, { "entropy": 6.266055345535278, "epoch": 3.400235432607416, "grad_norm": 1.171875, "learning_rate": 0.0003877603730845227, "loss": 5.8914, "mean_token_accuracy": 0.15790022611618043, "num_tokens": 68791113.0, "step": 31775 }, { "entropy": 6.2849767208099365, "epoch": 3.40077050671518, "grad_norm": 0.94921875, "learning_rate": 0.0003877272859800975, "loss": 5.9339, "mean_token_accuracy": 0.16133314073085786, "num_tokens": 68801723.0, "step": 31780 }, { "entropy": 6.371356773376465, "epoch": 3.401305580822944, "grad_norm": 1.0234375, "learning_rate": 0.0003876941956206876, "loss": 5.9555, "mean_token_accuracy": 0.16009513437747955, "num_tokens": 68813130.0, "step": 31785 }, { "entropy": 6.361521816253662, "epoch": 3.401840654930708, "grad_norm": 1.1171875, "learning_rate": 0.00038766110200724876, "loss": 5.8986, "mean_token_accuracy": 0.16509010791778564, "num_tokens": 68823699.0, "step": 31790 }, { "entropy": 6.307452440261841, "epoch": 3.402375729038472, "grad_norm": 0.984375, "learning_rate": 0.00038762800514073636, "loss": 5.8883, "mean_token_accuracy": 0.1550749883055687, "num_tokens": 68835295.0, "step": 31795 }, { "entropy": 6.324655389785766, "epoch": 3.4029108031462356, "grad_norm": 1.140625, "learning_rate": 0.0003875949050221062, "loss": 5.9062, "mean_token_accuracy": 0.1618477925658226, "num_tokens": 68845618.0, "step": 31800 }, { "entropy": 6.356464481353759, "epoch": 3.4034458772539997, "grad_norm": 1.1171875, "learning_rate": 0.0003875618016523139, "loss": 5.9496, "mean_token_accuracy": 0.16324492692947387, "num_tokens": 68855829.0, "step": 31805 }, { "entropy": 6.2540099143981935, "epoch": 3.4039809513617634, "grad_norm": 0.96484375, "learning_rate": 0.0003875286950323155, "loss": 5.846, "mean_token_accuracy": 0.15765458196401597, "num_tokens": 68866731.0, "step": 31810 }, { "entropy": 6.4322796821594235, "epoch": 3.4045160254695275, "grad_norm": 1.046875, "learning_rate": 0.0003874955851630668, "loss": 6.0174, "mean_token_accuracy": 0.15160099565982818, "num_tokens": 68877795.0, "step": 31815 }, { "entropy": 6.353932428359985, "epoch": 3.4050510995772916, "grad_norm": 1.109375, "learning_rate": 0.00038746247204552386, "loss": 5.866, "mean_token_accuracy": 0.1612692132592201, "num_tokens": 68886993.0, "step": 31820 }, { "entropy": 6.267647314071655, "epoch": 3.4055861736850552, "grad_norm": 1.0, "learning_rate": 0.0003874293556806428, "loss": 5.938, "mean_token_accuracy": 0.1622720927000046, "num_tokens": 68899022.0, "step": 31825 }, { "entropy": 6.371612548828125, "epoch": 3.4061212477928193, "grad_norm": 1.0390625, "learning_rate": 0.00038739623606937995, "loss": 5.933, "mean_token_accuracy": 0.15989332199096679, "num_tokens": 68911052.0, "step": 31830 }, { "entropy": 6.317734479904175, "epoch": 3.4066563219005834, "grad_norm": 1.03125, "learning_rate": 0.00038736311321269155, "loss": 5.8045, "mean_token_accuracy": 0.1694153904914856, "num_tokens": 68921093.0, "step": 31835 }, { "entropy": 6.3295529842376705, "epoch": 3.407191396008347, "grad_norm": 1.015625, "learning_rate": 0.0003873299871115341, "loss": 5.9715, "mean_token_accuracy": 0.15886956751346587, "num_tokens": 68931664.0, "step": 31840 }, { "entropy": 6.307947063446045, "epoch": 3.407726470116111, "grad_norm": 1.0859375, "learning_rate": 0.0003872968577668641, "loss": 5.9106, "mean_token_accuracy": 0.16125652194023132, "num_tokens": 68942758.0, "step": 31845 }, { "entropy": 6.239259862899781, "epoch": 3.408261544223875, "grad_norm": 1.046875, "learning_rate": 0.00038726372517963796, "loss": 5.8211, "mean_token_accuracy": 0.16229881197214127, "num_tokens": 68953408.0, "step": 31850 }, { "entropy": 6.332345914840698, "epoch": 3.408796618331639, "grad_norm": 1.09375, "learning_rate": 0.00038723058935081264, "loss": 5.8961, "mean_token_accuracy": 0.16517670154571534, "num_tokens": 68964077.0, "step": 31855 }, { "entropy": 6.309142827987671, "epoch": 3.409331692439403, "grad_norm": 0.97265625, "learning_rate": 0.0003871974502813448, "loss": 5.8927, "mean_token_accuracy": 0.16793110966682434, "num_tokens": 68975761.0, "step": 31860 }, { "entropy": 6.298037099838257, "epoch": 3.4098667665471667, "grad_norm": 0.99609375, "learning_rate": 0.0003871643079721914, "loss": 5.9284, "mean_token_accuracy": 0.155129873752594, "num_tokens": 68986965.0, "step": 31865 }, { "entropy": 6.316431665420533, "epoch": 3.410401840654931, "grad_norm": 1.03125, "learning_rate": 0.0003871311624243092, "loss": 5.908, "mean_token_accuracy": 0.15330085158348083, "num_tokens": 68998102.0, "step": 31870 }, { "entropy": 6.34490213394165, "epoch": 3.4109369147626944, "grad_norm": 1.0390625, "learning_rate": 0.0003870980136386556, "loss": 5.9211, "mean_token_accuracy": 0.16159277260303498, "num_tokens": 69008530.0, "step": 31875 }, { "entropy": 6.335793447494507, "epoch": 3.4114719888704585, "grad_norm": 1.0, "learning_rate": 0.00038706486161618753, "loss": 5.9102, "mean_token_accuracy": 0.15928671956062318, "num_tokens": 69018866.0, "step": 31880 }, { "entropy": 6.35130615234375, "epoch": 3.4120070629782226, "grad_norm": 1.0625, "learning_rate": 0.00038703170635786237, "loss": 5.8993, "mean_token_accuracy": 0.16098407357931138, "num_tokens": 69029050.0, "step": 31885 }, { "entropy": 6.384246492385865, "epoch": 3.4125421370859863, "grad_norm": 1.03125, "learning_rate": 0.00038699854786463744, "loss": 5.8739, "mean_token_accuracy": 0.16203406155109407, "num_tokens": 69040117.0, "step": 31890 }, { "entropy": 6.288299036026001, "epoch": 3.4130772111937504, "grad_norm": 0.99609375, "learning_rate": 0.00038696538613747016, "loss": 5.9021, "mean_token_accuracy": 0.16400160342454911, "num_tokens": 69051704.0, "step": 31895 }, { "entropy": 6.30410590171814, "epoch": 3.4136122853015145, "grad_norm": 1.0390625, "learning_rate": 0.00038693222117731804, "loss": 5.8567, "mean_token_accuracy": 0.1556191086769104, "num_tokens": 69062359.0, "step": 31900 }, { "entropy": 6.274214506149292, "epoch": 3.414147359409278, "grad_norm": 1.015625, "learning_rate": 0.00038689905298513886, "loss": 5.8506, "mean_token_accuracy": 0.15844790190458297, "num_tokens": 69072936.0, "step": 31905 }, { "entropy": 6.3048765659332275, "epoch": 3.4146824335170423, "grad_norm": 1.1015625, "learning_rate": 0.00038686588156189024, "loss": 5.9379, "mean_token_accuracy": 0.1563955083489418, "num_tokens": 69083468.0, "step": 31910 }, { "entropy": 6.332125473022461, "epoch": 3.415217507624806, "grad_norm": 1.0390625, "learning_rate": 0.0003868327069085299, "loss": 5.9421, "mean_token_accuracy": 0.1580730512738228, "num_tokens": 69093565.0, "step": 31915 }, { "entropy": 6.307137393951416, "epoch": 3.41575258173257, "grad_norm": 1.265625, "learning_rate": 0.000386799529026016, "loss": 5.9538, "mean_token_accuracy": 0.14680009484291076, "num_tokens": 69103660.0, "step": 31920 }, { "entropy": 6.3387535572052, "epoch": 3.4162876558403337, "grad_norm": 0.99609375, "learning_rate": 0.0003867663479153063, "loss": 5.8809, "mean_token_accuracy": 0.16695121824741363, "num_tokens": 69114810.0, "step": 31925 }, { "entropy": 6.402694797515869, "epoch": 3.4168227299480978, "grad_norm": 1.03125, "learning_rate": 0.00038673316357735907, "loss": 5.9232, "mean_token_accuracy": 0.15985832661390303, "num_tokens": 69127634.0, "step": 31930 }, { "entropy": 6.348346948623657, "epoch": 3.417357804055862, "grad_norm": 1.1171875, "learning_rate": 0.0003866999760131324, "loss": 5.8848, "mean_token_accuracy": 0.16352824121713638, "num_tokens": 69136957.0, "step": 31935 }, { "entropy": 6.2364660739898685, "epoch": 3.4178928781636255, "grad_norm": 1.09375, "learning_rate": 0.00038666678522358464, "loss": 5.89, "mean_token_accuracy": 0.15699723809957505, "num_tokens": 69148353.0, "step": 31940 }, { "entropy": 6.327700757980347, "epoch": 3.4184279522713896, "grad_norm": 1.0546875, "learning_rate": 0.0003866335912096741, "loss": 5.9306, "mean_token_accuracy": 0.1624536857008934, "num_tokens": 69158329.0, "step": 31945 }, { "entropy": 6.261841344833374, "epoch": 3.4189630263791537, "grad_norm": 1.0859375, "learning_rate": 0.0003866003939723595, "loss": 5.7798, "mean_token_accuracy": 0.17109378725290297, "num_tokens": 69168689.0, "step": 31950 }, { "entropy": 6.3256516456604, "epoch": 3.4194981004869174, "grad_norm": 0.9375, "learning_rate": 0.00038656719351259894, "loss": 5.9498, "mean_token_accuracy": 0.15773107558488847, "num_tokens": 69181166.0, "step": 31955 }, { "entropy": 6.399148988723755, "epoch": 3.4200331745946815, "grad_norm": 1.15625, "learning_rate": 0.0003865339898313515, "loss": 5.8814, "mean_token_accuracy": 0.1617417961359024, "num_tokens": 69192221.0, "step": 31960 }, { "entropy": 6.303891324996949, "epoch": 3.420568248702445, "grad_norm": 1.109375, "learning_rate": 0.00038650078292957573, "loss": 5.9608, "mean_token_accuracy": 0.1584445282816887, "num_tokens": 69203225.0, "step": 31965 }, { "entropy": 6.335599708557129, "epoch": 3.4211033228102092, "grad_norm": 1.0234375, "learning_rate": 0.00038646757280823047, "loss": 5.9575, "mean_token_accuracy": 0.1586074247956276, "num_tokens": 69214349.0, "step": 31970 }, { "entropy": 6.374234056472778, "epoch": 3.421638396917973, "grad_norm": 1.0234375, "learning_rate": 0.0003864343594682748, "loss": 5.9845, "mean_token_accuracy": 0.15546428561210632, "num_tokens": 69225863.0, "step": 31975 }, { "entropy": 6.300914478302002, "epoch": 3.422173471025737, "grad_norm": 1.1015625, "learning_rate": 0.00038640114291066765, "loss": 5.8288, "mean_token_accuracy": 0.1624322295188904, "num_tokens": 69236572.0, "step": 31980 }, { "entropy": 6.242289447784424, "epoch": 3.422708545133501, "grad_norm": 1.1015625, "learning_rate": 0.00038636792313636816, "loss": 5.9266, "mean_token_accuracy": 0.16100641041994096, "num_tokens": 69246034.0, "step": 31985 }, { "entropy": 6.3090136528015135, "epoch": 3.4232436192412647, "grad_norm": 0.98828125, "learning_rate": 0.0003863347001463355, "loss": 5.857, "mean_token_accuracy": 0.16408784240484237, "num_tokens": 69256471.0, "step": 31990 }, { "entropy": 6.297390699386597, "epoch": 3.423778693349029, "grad_norm": 1.0625, "learning_rate": 0.000386301473941529, "loss": 5.8098, "mean_token_accuracy": 0.16568024158477784, "num_tokens": 69266601.0, "step": 31995 }, { "entropy": 6.331763505935669, "epoch": 3.424313767456793, "grad_norm": 1.0, "learning_rate": 0.0003862682445229081, "loss": 5.923, "mean_token_accuracy": 0.15627032220363618, "num_tokens": 69276929.0, "step": 32000 }, { "entropy": 6.300299406051636, "epoch": 3.4248488415645566, "grad_norm": 1.046875, "learning_rate": 0.00038623501189143225, "loss": 5.9155, "mean_token_accuracy": 0.15830177888274194, "num_tokens": 69287654.0, "step": 32005 }, { "entropy": 6.351689338684082, "epoch": 3.4253839156723207, "grad_norm": 1.1328125, "learning_rate": 0.0003862017760480611, "loss": 5.9276, "mean_token_accuracy": 0.1591900959610939, "num_tokens": 69297346.0, "step": 32010 }, { "entropy": 6.318662309646607, "epoch": 3.4259189897800844, "grad_norm": 1.0546875, "learning_rate": 0.00038616853699375425, "loss": 5.9058, "mean_token_accuracy": 0.1573764428496361, "num_tokens": 69307806.0, "step": 32015 }, { "entropy": 6.3174957752227785, "epoch": 3.4264540638878485, "grad_norm": 1.03125, "learning_rate": 0.0003861352947294716, "loss": 5.9326, "mean_token_accuracy": 0.152929325401783, "num_tokens": 69317964.0, "step": 32020 }, { "entropy": 6.276559734344483, "epoch": 3.4269891379956126, "grad_norm": 0.97265625, "learning_rate": 0.00038610204925617285, "loss": 5.8394, "mean_token_accuracy": 0.17031856626272202, "num_tokens": 69328051.0, "step": 32025 }, { "entropy": 6.312811946868896, "epoch": 3.427524212103376, "grad_norm": 0.96484375, "learning_rate": 0.00038606880057481807, "loss": 5.8754, "mean_token_accuracy": 0.15997047424316407, "num_tokens": 69339949.0, "step": 32030 }, { "entropy": 6.329340028762817, "epoch": 3.4280592862111403, "grad_norm": 1.2109375, "learning_rate": 0.00038603554868636735, "loss": 5.8381, "mean_token_accuracy": 0.16474646627902984, "num_tokens": 69350188.0, "step": 32035 }, { "entropy": 6.296643400192261, "epoch": 3.428594360318904, "grad_norm": 1.1484375, "learning_rate": 0.0003860022935917807, "loss": 5.9425, "mean_token_accuracy": 0.15817877650260925, "num_tokens": 69360244.0, "step": 32040 }, { "entropy": 6.313317394256591, "epoch": 3.429129434426668, "grad_norm": 1.0078125, "learning_rate": 0.0003859690352920184, "loss": 5.8915, "mean_token_accuracy": 0.16727111786603927, "num_tokens": 69371060.0, "step": 32045 }, { "entropy": 6.3673028469085695, "epoch": 3.429664508534432, "grad_norm": 1.1640625, "learning_rate": 0.00038593577378804087, "loss": 5.9066, "mean_token_accuracy": 0.1588660731911659, "num_tokens": 69382371.0, "step": 32050 }, { "entropy": 6.349514484405518, "epoch": 3.430199582642196, "grad_norm": 1.171875, "learning_rate": 0.0003859025090808083, "loss": 5.9125, "mean_token_accuracy": 0.1604286953806877, "num_tokens": 69392747.0, "step": 32055 }, { "entropy": 6.301175546646118, "epoch": 3.43073465674996, "grad_norm": 1.078125, "learning_rate": 0.0003858692411712815, "loss": 5.8579, "mean_token_accuracy": 0.16153329163789748, "num_tokens": 69403403.0, "step": 32060 }, { "entropy": 6.225199270248413, "epoch": 3.431269730857724, "grad_norm": 1.046875, "learning_rate": 0.000385835970060421, "loss": 5.8617, "mean_token_accuracy": 0.15935762971639633, "num_tokens": 69414276.0, "step": 32065 }, { "entropy": 6.296417999267578, "epoch": 3.4318048049654877, "grad_norm": 1.078125, "learning_rate": 0.00038580269574918735, "loss": 5.9034, "mean_token_accuracy": 0.16290783435106276, "num_tokens": 69424707.0, "step": 32070 }, { "entropy": 6.287415599822998, "epoch": 3.4323398790732518, "grad_norm": 1.0078125, "learning_rate": 0.00038576941823854135, "loss": 5.816, "mean_token_accuracy": 0.1699664279818535, "num_tokens": 69436638.0, "step": 32075 }, { "entropy": 6.312812566757202, "epoch": 3.4328749531810154, "grad_norm": 1.03125, "learning_rate": 0.00038573613752944407, "loss": 5.845, "mean_token_accuracy": 0.16942031383514405, "num_tokens": 69448431.0, "step": 32080 }, { "entropy": 6.275166845321655, "epoch": 3.4334100272887795, "grad_norm": 0.91796875, "learning_rate": 0.00038570285362285635, "loss": 5.8521, "mean_token_accuracy": 0.17633963823318483, "num_tokens": 69458897.0, "step": 32085 }, { "entropy": 6.352272033691406, "epoch": 3.433945101396543, "grad_norm": 1.0703125, "learning_rate": 0.00038566956651973927, "loss": 5.9059, "mean_token_accuracy": 0.16361568123102188, "num_tokens": 69468517.0, "step": 32090 }, { "entropy": 6.260795736312867, "epoch": 3.4344801755043073, "grad_norm": 1.0078125, "learning_rate": 0.000385636276221054, "loss": 5.9108, "mean_token_accuracy": 0.16212647408246994, "num_tokens": 69478634.0, "step": 32095 }, { "entropy": 6.306976175308227, "epoch": 3.4350152496120714, "grad_norm": 1.046875, "learning_rate": 0.0003856029827277619, "loss": 5.8635, "mean_token_accuracy": 0.1602925941348076, "num_tokens": 69490235.0, "step": 32100 }, { "entropy": 6.344009208679199, "epoch": 3.435550323719835, "grad_norm": 0.98046875, "learning_rate": 0.00038556968604082413, "loss": 5.9103, "mean_token_accuracy": 0.15271859019994735, "num_tokens": 69501678.0, "step": 32105 }, { "entropy": 6.316856956481933, "epoch": 3.436085397827599, "grad_norm": 1.0625, "learning_rate": 0.00038553638616120226, "loss": 5.88, "mean_token_accuracy": 0.15614512711763381, "num_tokens": 69512214.0, "step": 32110 }, { "entropy": 6.339391231536865, "epoch": 3.4366204719353632, "grad_norm": 1.0078125, "learning_rate": 0.00038550308308985773, "loss": 5.9348, "mean_token_accuracy": 0.15871186107397078, "num_tokens": 69522959.0, "step": 32115 }, { "entropy": 6.391413879394531, "epoch": 3.437155546043127, "grad_norm": 1.0546875, "learning_rate": 0.0003854697768277522, "loss": 5.9424, "mean_token_accuracy": 0.1565043792128563, "num_tokens": 69534187.0, "step": 32120 }, { "entropy": 6.321866655349732, "epoch": 3.437690620150891, "grad_norm": 0.94140625, "learning_rate": 0.0003854364673758474, "loss": 5.9168, "mean_token_accuracy": 0.16508125960826875, "num_tokens": 69545240.0, "step": 32125 }, { "entropy": 6.278854084014893, "epoch": 3.4382256942586547, "grad_norm": 1.0390625, "learning_rate": 0.00038540315473510514, "loss": 5.8425, "mean_token_accuracy": 0.16264792829751967, "num_tokens": 69555457.0, "step": 32130 }, { "entropy": 6.3264336585998535, "epoch": 3.4387607683664188, "grad_norm": 1.0546875, "learning_rate": 0.0003853698389064873, "loss": 5.926, "mean_token_accuracy": 0.16112860292196274, "num_tokens": 69565604.0, "step": 32135 }, { "entropy": 6.326237916946411, "epoch": 3.439295842474183, "grad_norm": 1.2890625, "learning_rate": 0.00038533651989095587, "loss": 5.9471, "mean_token_accuracy": 0.1595609739422798, "num_tokens": 69576265.0, "step": 32140 }, { "entropy": 6.385537195205688, "epoch": 3.4398309165819465, "grad_norm": 0.984375, "learning_rate": 0.0003853031976894729, "loss": 5.9326, "mean_token_accuracy": 0.15688954740762712, "num_tokens": 69586983.0, "step": 32145 }, { "entropy": 6.265933704376221, "epoch": 3.4403659906897106, "grad_norm": 1.1875, "learning_rate": 0.0003852698723030006, "loss": 5.8417, "mean_token_accuracy": 0.17649373561143875, "num_tokens": 69598455.0, "step": 32150 }, { "entropy": 6.2539159774780275, "epoch": 3.4409010647974743, "grad_norm": 0.9921875, "learning_rate": 0.00038523654373250125, "loss": 5.8563, "mean_token_accuracy": 0.1644023835659027, "num_tokens": 69609922.0, "step": 32155 }, { "entropy": 6.209725427627563, "epoch": 3.4414361389052384, "grad_norm": 1.0, "learning_rate": 0.00038520321197893715, "loss": 5.8229, "mean_token_accuracy": 0.16735931038856505, "num_tokens": 69620641.0, "step": 32160 }, { "entropy": 6.229537916183472, "epoch": 3.4419712130130025, "grad_norm": 1.015625, "learning_rate": 0.0003851698770432709, "loss": 5.7666, "mean_token_accuracy": 0.17419298738241196, "num_tokens": 69631906.0, "step": 32165 }, { "entropy": 6.2900513172149655, "epoch": 3.442506287120766, "grad_norm": 0.97265625, "learning_rate": 0.0003851365389264649, "loss": 5.9068, "mean_token_accuracy": 0.15961222648620604, "num_tokens": 69642379.0, "step": 32170 }, { "entropy": 6.224603080749512, "epoch": 3.44304136122853, "grad_norm": 1.0234375, "learning_rate": 0.00038510319762948166, "loss": 5.7576, "mean_token_accuracy": 0.17882909178733825, "num_tokens": 69653363.0, "step": 32175 }, { "entropy": 6.328620910644531, "epoch": 3.4435764353362943, "grad_norm": 1.0390625, "learning_rate": 0.0003850698531532843, "loss": 5.8333, "mean_token_accuracy": 0.17159477323293687, "num_tokens": 69663693.0, "step": 32180 }, { "entropy": 6.282576036453247, "epoch": 3.444111509444058, "grad_norm": 1.0625, "learning_rate": 0.00038503650549883523, "loss": 5.9042, "mean_token_accuracy": 0.15953197777271272, "num_tokens": 69673935.0, "step": 32185 }, { "entropy": 6.261271572113037, "epoch": 3.444646583551822, "grad_norm": 1.0625, "learning_rate": 0.0003850031546670975, "loss": 5.8358, "mean_token_accuracy": 0.16586310267448426, "num_tokens": 69684364.0, "step": 32190 }, { "entropy": 6.394167470932007, "epoch": 3.4451816576595857, "grad_norm": 1.0625, "learning_rate": 0.00038496980065903433, "loss": 5.9791, "mean_token_accuracy": 0.15507937297225, "num_tokens": 69695034.0, "step": 32195 }, { "entropy": 6.321878576278687, "epoch": 3.44571673176735, "grad_norm": 1.03125, "learning_rate": 0.0003849364434756084, "loss": 5.9301, "mean_token_accuracy": 0.15907459557056428, "num_tokens": 69705450.0, "step": 32200 }, { "entropy": 6.352947425842285, "epoch": 3.4462518058751135, "grad_norm": 1.1171875, "learning_rate": 0.0003849030831177832, "loss": 5.9657, "mean_token_accuracy": 0.16319047063589096, "num_tokens": 69716365.0, "step": 32205 }, { "entropy": 6.3500776290893555, "epoch": 3.4467868799828776, "grad_norm": 1.21875, "learning_rate": 0.00038486971958652196, "loss": 5.9385, "mean_token_accuracy": 0.16213259994983673, "num_tokens": 69726484.0, "step": 32210 }, { "entropy": 6.330366468429565, "epoch": 3.4473219540906417, "grad_norm": 1.03125, "learning_rate": 0.000384836352882788, "loss": 5.913, "mean_token_accuracy": 0.15099493861198426, "num_tokens": 69737498.0, "step": 32215 }, { "entropy": 6.297854089736939, "epoch": 3.4478570281984053, "grad_norm": 1.015625, "learning_rate": 0.00038480298300754473, "loss": 5.8566, "mean_token_accuracy": 0.17201900631189346, "num_tokens": 69748284.0, "step": 32220 }, { "entropy": 6.366368436813355, "epoch": 3.4483921023061694, "grad_norm": 0.984375, "learning_rate": 0.00038476960996175583, "loss": 5.9301, "mean_token_accuracy": 0.158074751496315, "num_tokens": 69759745.0, "step": 32225 }, { "entropy": 6.351711130142212, "epoch": 3.4489271764139335, "grad_norm": 1.25, "learning_rate": 0.0003847362337463848, "loss": 5.87, "mean_token_accuracy": 0.15959449708461762, "num_tokens": 69770546.0, "step": 32230 }, { "entropy": 6.240227365493775, "epoch": 3.449462250521697, "grad_norm": 0.9765625, "learning_rate": 0.00038470285436239545, "loss": 5.8501, "mean_token_accuracy": 0.16628433018922806, "num_tokens": 69781154.0, "step": 32235 }, { "entropy": 6.246967363357544, "epoch": 3.4499973246294613, "grad_norm": 1.046875, "learning_rate": 0.0003846694718107516, "loss": 5.8734, "mean_token_accuracy": 0.16160208880901336, "num_tokens": 69792311.0, "step": 32240 }, { "entropy": 6.388805150985718, "epoch": 3.450532398737225, "grad_norm": 1.015625, "learning_rate": 0.0003846360860924172, "loss": 5.9707, "mean_token_accuracy": 0.15758783221244813, "num_tokens": 69803181.0, "step": 32245 }, { "entropy": 6.406197261810303, "epoch": 3.451067472844989, "grad_norm": 1.0078125, "learning_rate": 0.00038460269720835615, "loss": 5.9114, "mean_token_accuracy": 0.15834384113550187, "num_tokens": 69815177.0, "step": 32250 }, { "entropy": 6.373444128036499, "epoch": 3.451602546952753, "grad_norm": 1.0625, "learning_rate": 0.00038456930515953265, "loss": 5.9259, "mean_token_accuracy": 0.15608040243387222, "num_tokens": 69826730.0, "step": 32255 }, { "entropy": 6.382324171066284, "epoch": 3.452137621060517, "grad_norm": 1.0234375, "learning_rate": 0.0003845359099469109, "loss": 5.9827, "mean_token_accuracy": 0.15593542009592057, "num_tokens": 69837321.0, "step": 32260 }, { "entropy": 6.289419555664063, "epoch": 3.452672695168281, "grad_norm": 1.0546875, "learning_rate": 0.0003845025115714551, "loss": 5.8321, "mean_token_accuracy": 0.16248447299003602, "num_tokens": 69849093.0, "step": 32265 }, { "entropy": 6.265369701385498, "epoch": 3.4532077692760446, "grad_norm": 1.0703125, "learning_rate": 0.0003844691100341297, "loss": 5.8038, "mean_token_accuracy": 0.16846926063299178, "num_tokens": 69859131.0, "step": 32270 }, { "entropy": 6.312549066543579, "epoch": 3.4537428433838087, "grad_norm": 0.98828125, "learning_rate": 0.0003844357053358991, "loss": 5.9378, "mean_token_accuracy": 0.1583368584513664, "num_tokens": 69870089.0, "step": 32275 }, { "entropy": 6.284450054168701, "epoch": 3.4542779174915728, "grad_norm": 1.109375, "learning_rate": 0.0003844022974777279, "loss": 5.8826, "mean_token_accuracy": 0.15874165073037147, "num_tokens": 69880761.0, "step": 32280 }, { "entropy": 6.348756599426269, "epoch": 3.4548129915993364, "grad_norm": 1.03125, "learning_rate": 0.0003843688864605807, "loss": 5.8536, "mean_token_accuracy": 0.159903821349144, "num_tokens": 69891205.0, "step": 32285 }, { "entropy": 6.292546176910401, "epoch": 3.4553480657071005, "grad_norm": 1.03125, "learning_rate": 0.00038433547228542233, "loss": 5.837, "mean_token_accuracy": 0.1605186015367508, "num_tokens": 69902038.0, "step": 32290 }, { "entropy": 6.406431436538696, "epoch": 3.455883139814864, "grad_norm": 1.046875, "learning_rate": 0.00038430205495321753, "loss": 6.0015, "mean_token_accuracy": 0.1554138869047165, "num_tokens": 69914449.0, "step": 32295 }, { "entropy": 6.411806249618531, "epoch": 3.4564182139226283, "grad_norm": 1.015625, "learning_rate": 0.0003842686344649312, "loss": 5.9319, "mean_token_accuracy": 0.15823803544044496, "num_tokens": 69926096.0, "step": 32300 }, { "entropy": 6.321509790420532, "epoch": 3.4569532880303924, "grad_norm": 1.0859375, "learning_rate": 0.00038423521082152844, "loss": 5.8689, "mean_token_accuracy": 0.16287225484848022, "num_tokens": 69935947.0, "step": 32305 }, { "entropy": 6.263888931274414, "epoch": 3.457488362138156, "grad_norm": 1.0625, "learning_rate": 0.0003842017840239744, "loss": 5.8368, "mean_token_accuracy": 0.15467387884855271, "num_tokens": 69946701.0, "step": 32310 }, { "entropy": 6.363356018066407, "epoch": 3.45802343624592, "grad_norm": 1.109375, "learning_rate": 0.0003841683540732341, "loss": 5.9776, "mean_token_accuracy": 0.1538686990737915, "num_tokens": 69957011.0, "step": 32315 }, { "entropy": 6.3516786098480225, "epoch": 3.458558510353684, "grad_norm": 1.125, "learning_rate": 0.0003841349209702729, "loss": 5.9067, "mean_token_accuracy": 0.16129202395677567, "num_tokens": 69968224.0, "step": 32320 }, { "entropy": 6.329697799682617, "epoch": 3.459093584461448, "grad_norm": 0.95703125, "learning_rate": 0.0003841014847160563, "loss": 5.9162, "mean_token_accuracy": 0.1564452365040779, "num_tokens": 69979171.0, "step": 32325 }, { "entropy": 6.3077648162841795, "epoch": 3.459628658569212, "grad_norm": 1.0625, "learning_rate": 0.0003840680453115496, "loss": 5.8934, "mean_token_accuracy": 0.16555799841880797, "num_tokens": 69990001.0, "step": 32330 }, { "entropy": 6.294379758834839, "epoch": 3.4601637326769756, "grad_norm": 1.1484375, "learning_rate": 0.00038403460275771836, "loss": 5.8282, "mean_token_accuracy": 0.1660100758075714, "num_tokens": 70001263.0, "step": 32335 }, { "entropy": 6.269306755065918, "epoch": 3.4606988067847397, "grad_norm": 1.0703125, "learning_rate": 0.00038400115705552833, "loss": 5.8639, "mean_token_accuracy": 0.16074927002191544, "num_tokens": 70011586.0, "step": 32340 }, { "entropy": 6.188043117523193, "epoch": 3.461233880892504, "grad_norm": 1.1484375, "learning_rate": 0.0003839677082059453, "loss": 5.7932, "mean_token_accuracy": 0.16687614172697068, "num_tokens": 70023607.0, "step": 32345 }, { "entropy": 6.359429788589478, "epoch": 3.4617689550002675, "grad_norm": 1.1484375, "learning_rate": 0.00038393425620993483, "loss": 5.9271, "mean_token_accuracy": 0.16150956600904465, "num_tokens": 70033099.0, "step": 32350 }, { "entropy": 6.341354131698608, "epoch": 3.4623040291080316, "grad_norm": 1.078125, "learning_rate": 0.00038390080106846314, "loss": 5.8856, "mean_token_accuracy": 0.17114627063274385, "num_tokens": 70043609.0, "step": 32355 }, { "entropy": 6.32601900100708, "epoch": 3.4628391032157952, "grad_norm": 1.0234375, "learning_rate": 0.0003838673427824962, "loss": 5.8845, "mean_token_accuracy": 0.16279274225234985, "num_tokens": 70054901.0, "step": 32360 }, { "entropy": 6.3464069843292235, "epoch": 3.4633741773235593, "grad_norm": 1.078125, "learning_rate": 0.00038383388135299984, "loss": 5.9245, "mean_token_accuracy": 0.1507847301661968, "num_tokens": 70065729.0, "step": 32365 }, { "entropy": 6.301975536346435, "epoch": 3.463909251431323, "grad_norm": 1.046875, "learning_rate": 0.0003838004167809406, "loss": 5.8895, "mean_token_accuracy": 0.15677526146173476, "num_tokens": 70077841.0, "step": 32370 }, { "entropy": 6.368082904815674, "epoch": 3.464444325539087, "grad_norm": 1.078125, "learning_rate": 0.0003837669490672845, "loss": 5.9395, "mean_token_accuracy": 0.15854401662945747, "num_tokens": 70089205.0, "step": 32375 }, { "entropy": 6.296151971817016, "epoch": 3.464979399646851, "grad_norm": 1.09375, "learning_rate": 0.0003837334782129981, "loss": 5.9406, "mean_token_accuracy": 0.16130901724100113, "num_tokens": 70100118.0, "step": 32380 }, { "entropy": 6.245764684677124, "epoch": 3.465514473754615, "grad_norm": 1.0078125, "learning_rate": 0.00038370000421904775, "loss": 5.8227, "mean_token_accuracy": 0.1635775536298752, "num_tokens": 70110502.0, "step": 32385 }, { "entropy": 6.361279487609863, "epoch": 3.466049547862379, "grad_norm": 1.0234375, "learning_rate": 0.0003836665270864001, "loss": 5.9043, "mean_token_accuracy": 0.15706646144390107, "num_tokens": 70121040.0, "step": 32390 }, { "entropy": 6.375798273086548, "epoch": 3.466584621970143, "grad_norm": 0.91015625, "learning_rate": 0.00038363304681602174, "loss": 5.9481, "mean_token_accuracy": 0.16092899143695832, "num_tokens": 70132537.0, "step": 32395 }, { "entropy": 6.344299554824829, "epoch": 3.4671196960779067, "grad_norm": 1.03125, "learning_rate": 0.0003835995634088794, "loss": 5.9145, "mean_token_accuracy": 0.16592612564563752, "num_tokens": 70143449.0, "step": 32400 }, { "entropy": 6.25213589668274, "epoch": 3.467654770185671, "grad_norm": 1.5234375, "learning_rate": 0.00038356607686593994, "loss": 5.818, "mean_token_accuracy": 0.16949212402105332, "num_tokens": 70154674.0, "step": 32405 }, { "entropy": 6.300141716003418, "epoch": 3.4681898442934345, "grad_norm": 1.0234375, "learning_rate": 0.0003835325871881703, "loss": 5.9033, "mean_token_accuracy": 0.15873501896858216, "num_tokens": 70165342.0, "step": 32410 }, { "entropy": 6.301844501495362, "epoch": 3.4687249184011986, "grad_norm": 1.0, "learning_rate": 0.0003834990943765374, "loss": 5.8612, "mean_token_accuracy": 0.168772791326046, "num_tokens": 70177028.0, "step": 32415 }, { "entropy": 6.308122777938843, "epoch": 3.4692599925089627, "grad_norm": 0.9296875, "learning_rate": 0.0003834655984320084, "loss": 5.9386, "mean_token_accuracy": 0.15778638422489166, "num_tokens": 70188655.0, "step": 32420 }, { "entropy": 6.370133972167968, "epoch": 3.4697950666167263, "grad_norm": 1.0078125, "learning_rate": 0.0003834320993555505, "loss": 5.987, "mean_token_accuracy": 0.15553724020719528, "num_tokens": 70199288.0, "step": 32425 }, { "entropy": 6.34001145362854, "epoch": 3.4703301407244904, "grad_norm": 1.0546875, "learning_rate": 0.00038339859714813104, "loss": 5.9197, "mean_token_accuracy": 0.16150389909744262, "num_tokens": 70210417.0, "step": 32430 }, { "entropy": 6.329990243911743, "epoch": 3.470865214832254, "grad_norm": 1.0, "learning_rate": 0.0003833650918107172, "loss": 5.8833, "mean_token_accuracy": 0.16289666295051575, "num_tokens": 70220339.0, "step": 32435 }, { "entropy": 6.269891977310181, "epoch": 3.471400288940018, "grad_norm": 0.99609375, "learning_rate": 0.0003833315833442766, "loss": 5.9253, "mean_token_accuracy": 0.15877319350838662, "num_tokens": 70230699.0, "step": 32440 }, { "entropy": 6.341040563583374, "epoch": 3.4719353630477823, "grad_norm": 1.078125, "learning_rate": 0.00038329807174977676, "loss": 5.8893, "mean_token_accuracy": 0.15928515940904617, "num_tokens": 70242464.0, "step": 32445 }, { "entropy": 6.382447052001953, "epoch": 3.472470437155546, "grad_norm": 1.078125, "learning_rate": 0.00038326455702818537, "loss": 5.9598, "mean_token_accuracy": 0.15855244249105455, "num_tokens": 70253631.0, "step": 32450 }, { "entropy": 6.311036014556885, "epoch": 3.47300551126331, "grad_norm": 0.96875, "learning_rate": 0.00038323103918047, "loss": 5.9294, "mean_token_accuracy": 0.15432786494493483, "num_tokens": 70266055.0, "step": 32455 }, { "entropy": 6.357668256759643, "epoch": 3.473540585371074, "grad_norm": 0.984375, "learning_rate": 0.0003831975182075987, "loss": 5.9521, "mean_token_accuracy": 0.15690529495477676, "num_tokens": 70276680.0, "step": 32460 }, { "entropy": 6.389079904556274, "epoch": 3.474075659478838, "grad_norm": 1.09375, "learning_rate": 0.00038316399411053917, "loss": 5.9102, "mean_token_accuracy": 0.15900541990995407, "num_tokens": 70287424.0, "step": 32465 }, { "entropy": 6.29692120552063, "epoch": 3.474610733586602, "grad_norm": 1.0625, "learning_rate": 0.0003831304668902595, "loss": 5.8548, "mean_token_accuracy": 0.1614769548177719, "num_tokens": 70298005.0, "step": 32470 }, { "entropy": 6.298631095886231, "epoch": 3.4751458076943655, "grad_norm": 1.125, "learning_rate": 0.0003830969365477279, "loss": 5.8603, "mean_token_accuracy": 0.15608108043670654, "num_tokens": 70309200.0, "step": 32475 }, { "entropy": 6.300459241867065, "epoch": 3.4756808818021296, "grad_norm": 0.9609375, "learning_rate": 0.00038306340308391233, "loss": 5.9078, "mean_token_accuracy": 0.166172793507576, "num_tokens": 70320957.0, "step": 32480 }, { "entropy": 6.346562433242798, "epoch": 3.4762159559098933, "grad_norm": 1.0546875, "learning_rate": 0.0003830298664997813, "loss": 5.8773, "mean_token_accuracy": 0.15796127915382385, "num_tokens": 70331960.0, "step": 32485 }, { "entropy": 6.334820556640625, "epoch": 3.4767510300176574, "grad_norm": 1.078125, "learning_rate": 0.000382996326796303, "loss": 5.8781, "mean_token_accuracy": 0.16563776433467864, "num_tokens": 70342449.0, "step": 32490 }, { "entropy": 6.302613019943237, "epoch": 3.4772861041254215, "grad_norm": 1.0703125, "learning_rate": 0.0003829627839744459, "loss": 5.8745, "mean_token_accuracy": 0.16176081001758574, "num_tokens": 70353322.0, "step": 32495 }, { "entropy": 6.267453336715699, "epoch": 3.477821178233185, "grad_norm": 0.99609375, "learning_rate": 0.0003829292380351786, "loss": 5.8644, "mean_token_accuracy": 0.16824857145547867, "num_tokens": 70364824.0, "step": 32500 }, { "entropy": 6.317816591262817, "epoch": 3.4783562523409493, "grad_norm": 1.1953125, "learning_rate": 0.0003828956889794698, "loss": 5.8703, "mean_token_accuracy": 0.16363078057765962, "num_tokens": 70376811.0, "step": 32505 }, { "entropy": 6.38158164024353, "epoch": 3.4788913264487134, "grad_norm": 1.0546875, "learning_rate": 0.00038286213680828804, "loss": 5.9172, "mean_token_accuracy": 0.1565524846315384, "num_tokens": 70387735.0, "step": 32510 }, { "entropy": 6.279308176040649, "epoch": 3.479426400556477, "grad_norm": 1.109375, "learning_rate": 0.0003828285815226023, "loss": 5.8247, "mean_token_accuracy": 0.16760330647230148, "num_tokens": 70398860.0, "step": 32515 }, { "entropy": 6.2192158699035645, "epoch": 3.479961474664241, "grad_norm": 1.0859375, "learning_rate": 0.00038279502312338137, "loss": 5.8565, "mean_token_accuracy": 0.16229538768529891, "num_tokens": 70409340.0, "step": 32520 }, { "entropy": 6.328462791442871, "epoch": 3.4804965487720048, "grad_norm": 1.0703125, "learning_rate": 0.0003827614616115943, "loss": 5.9743, "mean_token_accuracy": 0.15800178945064544, "num_tokens": 70419880.0, "step": 32525 }, { "entropy": 6.305415773391724, "epoch": 3.481031622879769, "grad_norm": 1.0625, "learning_rate": 0.0003827278969882102, "loss": 5.8579, "mean_token_accuracy": 0.17161226868629456, "num_tokens": 70431033.0, "step": 32530 }, { "entropy": 6.325243234634399, "epoch": 3.481566696987533, "grad_norm": 0.9609375, "learning_rate": 0.0003826943292541982, "loss": 5.9144, "mean_token_accuracy": 0.16484952867031097, "num_tokens": 70442315.0, "step": 32535 }, { "entropy": 6.317266321182251, "epoch": 3.4821017710952966, "grad_norm": 1.0859375, "learning_rate": 0.00038266075841052763, "loss": 5.9039, "mean_token_accuracy": 0.1608509436249733, "num_tokens": 70453195.0, "step": 32540 }, { "entropy": 6.2590655326843265, "epoch": 3.4826368452030607, "grad_norm": 1.0546875, "learning_rate": 0.0003826271844581677, "loss": 5.8714, "mean_token_accuracy": 0.1568625882267952, "num_tokens": 70463855.0, "step": 32545 }, { "entropy": 6.318711996078491, "epoch": 3.4831719193108244, "grad_norm": 1.0859375, "learning_rate": 0.000382593607398088, "loss": 5.9265, "mean_token_accuracy": 0.1588997557759285, "num_tokens": 70474517.0, "step": 32550 }, { "entropy": 6.347247982025147, "epoch": 3.4837069934185885, "grad_norm": 1.0, "learning_rate": 0.000382560027231258, "loss": 5.9669, "mean_token_accuracy": 0.15469202548265457, "num_tokens": 70486256.0, "step": 32555 }, { "entropy": 6.3545773983001705, "epoch": 3.4842420675263526, "grad_norm": 1.0859375, "learning_rate": 0.0003825264439586473, "loss": 5.905, "mean_token_accuracy": 0.16050328463315963, "num_tokens": 70496771.0, "step": 32560 }, { "entropy": 6.377040815353394, "epoch": 3.4847771416341162, "grad_norm": 1.109375, "learning_rate": 0.00038249285758122566, "loss": 6.018, "mean_token_accuracy": 0.16064516007900237, "num_tokens": 70507994.0, "step": 32565 }, { "entropy": 6.33535795211792, "epoch": 3.4853122157418803, "grad_norm": 1.109375, "learning_rate": 0.00038245926809996284, "loss": 5.9192, "mean_token_accuracy": 0.1587074175477028, "num_tokens": 70518544.0, "step": 32570 }, { "entropy": 6.3121864795684814, "epoch": 3.485847289849644, "grad_norm": 0.96484375, "learning_rate": 0.0003824256755158288, "loss": 5.916, "mean_token_accuracy": 0.16401700526475907, "num_tokens": 70530075.0, "step": 32575 }, { "entropy": 6.290967130661011, "epoch": 3.486382363957408, "grad_norm": 1.015625, "learning_rate": 0.0003823920798297934, "loss": 5.9039, "mean_token_accuracy": 0.16832053065299987, "num_tokens": 70542125.0, "step": 32580 }, { "entropy": 6.392250299453735, "epoch": 3.486917438065172, "grad_norm": 0.99609375, "learning_rate": 0.00038235848104282684, "loss": 5.904, "mean_token_accuracy": 0.15919075757265091, "num_tokens": 70552710.0, "step": 32585 }, { "entropy": 6.361128616333008, "epoch": 3.487452512172936, "grad_norm": 1.140625, "learning_rate": 0.00038232487915589925, "loss": 5.9174, "mean_token_accuracy": 0.15739620178937913, "num_tokens": 70564467.0, "step": 32590 }, { "entropy": 6.286491012573242, "epoch": 3.4879875862807, "grad_norm": 1.0703125, "learning_rate": 0.00038229127416998076, "loss": 5.8098, "mean_token_accuracy": 0.1699780896306038, "num_tokens": 70575164.0, "step": 32595 }, { "entropy": 6.304025459289551, "epoch": 3.4885226603884636, "grad_norm": 1.109375, "learning_rate": 0.00038225766608604184, "loss": 5.9091, "mean_token_accuracy": 0.1640378937125206, "num_tokens": 70584841.0, "step": 32600 }, { "entropy": 6.2706766605377195, "epoch": 3.4890577344962277, "grad_norm": 1.171875, "learning_rate": 0.00038222405490505296, "loss": 5.9304, "mean_token_accuracy": 0.160012823343277, "num_tokens": 70595189.0, "step": 32605 }, { "entropy": 6.306362009048462, "epoch": 3.489592808603992, "grad_norm": 1.0078125, "learning_rate": 0.00038219044062798454, "loss": 5.916, "mean_token_accuracy": 0.16167451739311217, "num_tokens": 70607858.0, "step": 32610 }, { "entropy": 6.3181709289550785, "epoch": 3.4901278827117554, "grad_norm": 1.03125, "learning_rate": 0.00038215682325580714, "loss": 5.8279, "mean_token_accuracy": 0.16553726941347122, "num_tokens": 70618281.0, "step": 32615 }, { "entropy": 6.301044511795044, "epoch": 3.4906629568195195, "grad_norm": 1.0, "learning_rate": 0.0003821232027894916, "loss": 5.8629, "mean_token_accuracy": 0.16180304437875748, "num_tokens": 70629822.0, "step": 32620 }, { "entropy": 6.316023874282837, "epoch": 3.4911980309272836, "grad_norm": 1.34375, "learning_rate": 0.0003820895792300086, "loss": 5.906, "mean_token_accuracy": 0.1644728049635887, "num_tokens": 70639981.0, "step": 32625 }, { "entropy": 6.416527318954468, "epoch": 3.4917331050350473, "grad_norm": 1.0703125, "learning_rate": 0.00038205595257832906, "loss": 5.9923, "mean_token_accuracy": 0.1507119506597519, "num_tokens": 70651196.0, "step": 32630 }, { "entropy": 6.313155221939087, "epoch": 3.4922681791428114, "grad_norm": 1.0078125, "learning_rate": 0.00038202232283542385, "loss": 5.893, "mean_token_accuracy": 0.1682975098490715, "num_tokens": 70662930.0, "step": 32635 }, { "entropy": 6.276983451843262, "epoch": 3.492803253250575, "grad_norm": 1.0234375, "learning_rate": 0.0003819886900022642, "loss": 5.9053, "mean_token_accuracy": 0.1617271438241005, "num_tokens": 70674276.0, "step": 32640 }, { "entropy": 6.326911687850952, "epoch": 3.493338327358339, "grad_norm": 0.98828125, "learning_rate": 0.0003819550540798212, "loss": 5.8507, "mean_token_accuracy": 0.16328026354312897, "num_tokens": 70684706.0, "step": 32645 }, { "entropy": 6.307913303375244, "epoch": 3.493873401466103, "grad_norm": 1.0625, "learning_rate": 0.000381921415069066, "loss": 5.8765, "mean_token_accuracy": 0.16126795262098312, "num_tokens": 70695468.0, "step": 32650 }, { "entropy": 6.2808191776275635, "epoch": 3.494408475573867, "grad_norm": 1.0546875, "learning_rate": 0.00038188777297096986, "loss": 5.8525, "mean_token_accuracy": 0.1679876536130905, "num_tokens": 70706141.0, "step": 32655 }, { "entropy": 6.354890298843384, "epoch": 3.494943549681631, "grad_norm": 1.09375, "learning_rate": 0.00038185412778650435, "loss": 5.9706, "mean_token_accuracy": 0.15468793958425522, "num_tokens": 70716615.0, "step": 32660 }, { "entropy": 6.339165306091308, "epoch": 3.4954786237893947, "grad_norm": 1.0234375, "learning_rate": 0.00038182047951664097, "loss": 5.8636, "mean_token_accuracy": 0.1672899380326271, "num_tokens": 70727734.0, "step": 32665 }, { "entropy": 6.296677303314209, "epoch": 3.4960136978971588, "grad_norm": 0.953125, "learning_rate": 0.0003817868281623512, "loss": 5.8127, "mean_token_accuracy": 0.17011006772518159, "num_tokens": 70738539.0, "step": 32670 }, { "entropy": 6.280001640319824, "epoch": 3.496548772004923, "grad_norm": 1.0546875, "learning_rate": 0.00038175317372460683, "loss": 5.8703, "mean_token_accuracy": 0.16863141655921937, "num_tokens": 70749043.0, "step": 32675 }, { "entropy": 6.2743360042572025, "epoch": 3.4970838461126865, "grad_norm": 1.109375, "learning_rate": 0.00038171951620437957, "loss": 5.8423, "mean_token_accuracy": 0.15791642665863037, "num_tokens": 70759154.0, "step": 32680 }, { "entropy": 6.279321336746216, "epoch": 3.4976189202204506, "grad_norm": 1.03125, "learning_rate": 0.00038168585560264124, "loss": 5.873, "mean_token_accuracy": 0.1636273294687271, "num_tokens": 70770650.0, "step": 32685 }, { "entropy": 6.320686149597168, "epoch": 3.4981539943282143, "grad_norm": 1.015625, "learning_rate": 0.0003816521919203639, "loss": 5.8891, "mean_token_accuracy": 0.162399585545063, "num_tokens": 70781254.0, "step": 32690 }, { "entropy": 6.2551344871521, "epoch": 3.4986890684359784, "grad_norm": 1.2109375, "learning_rate": 0.00038161852515851934, "loss": 5.8328, "mean_token_accuracy": 0.16874285638332367, "num_tokens": 70791090.0, "step": 32695 }, { "entropy": 6.290368509292603, "epoch": 3.4992241425437425, "grad_norm": 0.984375, "learning_rate": 0.0003815848553180799, "loss": 5.8767, "mean_token_accuracy": 0.16191707253456117, "num_tokens": 70801020.0, "step": 32700 }, { "entropy": 6.267124319076538, "epoch": 3.499759216651506, "grad_norm": 1.0703125, "learning_rate": 0.0003815511824000179, "loss": 5.8, "mean_token_accuracy": 0.17344696819782257, "num_tokens": 70811308.0, "step": 32705 }, { "entropy": 6.355609321594239, "epoch": 3.5002942907592702, "grad_norm": 1.015625, "learning_rate": 0.00038151750640530533, "loss": 5.9039, "mean_token_accuracy": 0.15553095638751985, "num_tokens": 70822155.0, "step": 32710 }, { "entropy": 6.393925905227661, "epoch": 3.500829364867034, "grad_norm": 1.15625, "learning_rate": 0.0003814838273349147, "loss": 5.9474, "mean_token_accuracy": 0.16177112758159637, "num_tokens": 70834132.0, "step": 32715 }, { "entropy": 6.281477355957032, "epoch": 3.501364438974798, "grad_norm": 1.0390625, "learning_rate": 0.00038145014518981864, "loss": 5.9328, "mean_token_accuracy": 0.15816295444965361, "num_tokens": 70845756.0, "step": 32720 }, { "entropy": 6.268712282180786, "epoch": 3.501899513082562, "grad_norm": 1.140625, "learning_rate": 0.0003814164599709895, "loss": 5.8294, "mean_token_accuracy": 0.1591949611902237, "num_tokens": 70856672.0, "step": 32725 }, { "entropy": 6.355001401901245, "epoch": 3.5024345871903257, "grad_norm": 1.0, "learning_rate": 0.00038138277167940006, "loss": 5.8902, "mean_token_accuracy": 0.1564883604645729, "num_tokens": 70867993.0, "step": 32730 }, { "entropy": 6.308818626403808, "epoch": 3.50296966129809, "grad_norm": 1.03125, "learning_rate": 0.0003813490803160231, "loss": 5.8744, "mean_token_accuracy": 0.16222167909145355, "num_tokens": 70878061.0, "step": 32735 }, { "entropy": 6.16586127281189, "epoch": 3.503504735405854, "grad_norm": 0.96875, "learning_rate": 0.00038131538588183133, "loss": 5.8351, "mean_token_accuracy": 0.1731823742389679, "num_tokens": 70889244.0, "step": 32740 }, { "entropy": 6.338774538040161, "epoch": 3.5040398095136176, "grad_norm": 1.03125, "learning_rate": 0.0003812816883777977, "loss": 5.8621, "mean_token_accuracy": 0.1597054660320282, "num_tokens": 70900391.0, "step": 32745 }, { "entropy": 6.355043077468872, "epoch": 3.5045748836213817, "grad_norm": 0.9921875, "learning_rate": 0.0003812479878048953, "loss": 5.7852, "mean_token_accuracy": 0.16761272102594377, "num_tokens": 70910743.0, "step": 32750 }, { "entropy": 6.30597333908081, "epoch": 3.5051099577291454, "grad_norm": 1.03125, "learning_rate": 0.00038121428416409725, "loss": 5.9304, "mean_token_accuracy": 0.1673692896962166, "num_tokens": 70922126.0, "step": 32755 }, { "entropy": 6.294538354873657, "epoch": 3.5056450318369095, "grad_norm": 1.015625, "learning_rate": 0.0003811805774563765, "loss": 5.9108, "mean_token_accuracy": 0.15461481362581253, "num_tokens": 70932657.0, "step": 32760 }, { "entropy": 6.302424955368042, "epoch": 3.506180105944673, "grad_norm": 0.984375, "learning_rate": 0.0003811468676827066, "loss": 5.8979, "mean_token_accuracy": 0.16161354780197143, "num_tokens": 70943609.0, "step": 32765 }, { "entropy": 6.3450218677520756, "epoch": 3.506715180052437, "grad_norm": 1.0859375, "learning_rate": 0.0003811131548440608, "loss": 5.9228, "mean_token_accuracy": 0.16106447726488113, "num_tokens": 70954055.0, "step": 32770 }, { "entropy": 6.273807716369629, "epoch": 3.5072502541602013, "grad_norm": 1.0234375, "learning_rate": 0.00038107943894141256, "loss": 5.829, "mean_token_accuracy": 0.1640218436717987, "num_tokens": 70965411.0, "step": 32775 }, { "entropy": 6.292558193206787, "epoch": 3.507785328267965, "grad_norm": 1.0625, "learning_rate": 0.00038104571997573544, "loss": 5.912, "mean_token_accuracy": 0.16155396550893783, "num_tokens": 70976310.0, "step": 32780 }, { "entropy": 6.341170454025269, "epoch": 3.508320402375729, "grad_norm": 0.98046875, "learning_rate": 0.0003810119979480031, "loss": 5.9278, "mean_token_accuracy": 0.15480765253305434, "num_tokens": 70986578.0, "step": 32785 }, { "entropy": 6.320988416671753, "epoch": 3.508855476483493, "grad_norm": 1.0625, "learning_rate": 0.0003809782728591891, "loss": 5.8735, "mean_token_accuracy": 0.16647864729166031, "num_tokens": 70997360.0, "step": 32790 }, { "entropy": 6.318946361541748, "epoch": 3.509390550591257, "grad_norm": 1.0859375, "learning_rate": 0.0003809445447102675, "loss": 5.878, "mean_token_accuracy": 0.16082950830459594, "num_tokens": 71006754.0, "step": 32795 }, { "entropy": 6.280398368835449, "epoch": 3.509925624699021, "grad_norm": 1.0, "learning_rate": 0.00038091081350221203, "loss": 5.842, "mean_token_accuracy": 0.16336054503917694, "num_tokens": 71017842.0, "step": 32800 }, { "entropy": 6.253239917755127, "epoch": 3.5104606988067846, "grad_norm": 1.0, "learning_rate": 0.00038087707923599657, "loss": 5.8702, "mean_token_accuracy": 0.1628894492983818, "num_tokens": 71028622.0, "step": 32805 }, { "entropy": 6.276207828521729, "epoch": 3.5109957729145487, "grad_norm": 0.97265625, "learning_rate": 0.00038084334191259547, "loss": 5.8039, "mean_token_accuracy": 0.1790011242032051, "num_tokens": 71041212.0, "step": 32810 }, { "entropy": 6.326844024658203, "epoch": 3.5115308470223123, "grad_norm": 1.046875, "learning_rate": 0.0003808096015329827, "loss": 5.9294, "mean_token_accuracy": 0.16065751761198044, "num_tokens": 71051394.0, "step": 32815 }, { "entropy": 6.259951639175415, "epoch": 3.5120659211300764, "grad_norm": 1.0546875, "learning_rate": 0.0003807758580981325, "loss": 5.864, "mean_token_accuracy": 0.16206077635288238, "num_tokens": 71062099.0, "step": 32820 }, { "entropy": 6.365071964263916, "epoch": 3.5126009952378405, "grad_norm": 1.0390625, "learning_rate": 0.00038074211160901933, "loss": 5.9629, "mean_token_accuracy": 0.15982577204704285, "num_tokens": 71072647.0, "step": 32825 }, { "entropy": 6.255735731124878, "epoch": 3.513136069345604, "grad_norm": 1.0703125, "learning_rate": 0.0003807083620666175, "loss": 5.836, "mean_token_accuracy": 0.17361668199300767, "num_tokens": 71083261.0, "step": 32830 }, { "entropy": 6.358639144897461, "epoch": 3.5136711434533683, "grad_norm": 1.0390625, "learning_rate": 0.00038067460947190156, "loss": 5.943, "mean_token_accuracy": 0.15948164761066436, "num_tokens": 71094427.0, "step": 32835 }, { "entropy": 6.366341018676758, "epoch": 3.5142062175611324, "grad_norm": 1.09375, "learning_rate": 0.0003806408538258462, "loss": 5.8773, "mean_token_accuracy": 0.16260990798473357, "num_tokens": 71103985.0, "step": 32840 }, { "entropy": 6.320037317276001, "epoch": 3.514741291668896, "grad_norm": 1.0546875, "learning_rate": 0.0003806070951294259, "loss": 5.8681, "mean_token_accuracy": 0.16164276450872422, "num_tokens": 71114748.0, "step": 32845 }, { "entropy": 6.2882936000823975, "epoch": 3.51527636577666, "grad_norm": 1.0078125, "learning_rate": 0.0003805733333836158, "loss": 5.8562, "mean_token_accuracy": 0.16257817000150682, "num_tokens": 71126074.0, "step": 32850 }, { "entropy": 6.3040163040161135, "epoch": 3.5158114398844242, "grad_norm": 1.078125, "learning_rate": 0.0003805395685893903, "loss": 5.9317, "mean_token_accuracy": 0.1589823320508003, "num_tokens": 71136471.0, "step": 32855 }, { "entropy": 6.3494720458984375, "epoch": 3.516346513992188, "grad_norm": 1.078125, "learning_rate": 0.0003805058007477247, "loss": 5.9621, "mean_token_accuracy": 0.15671808421611785, "num_tokens": 71147348.0, "step": 32860 }, { "entropy": 6.358083772659302, "epoch": 3.516881588099952, "grad_norm": 0.98828125, "learning_rate": 0.00038047202985959394, "loss": 5.9338, "mean_token_accuracy": 0.15788790732622146, "num_tokens": 71158015.0, "step": 32865 }, { "entropy": 6.323101997375488, "epoch": 3.5174166622077156, "grad_norm": 1.03125, "learning_rate": 0.0003804382559259731, "loss": 5.9116, "mean_token_accuracy": 0.16429262906312941, "num_tokens": 71169271.0, "step": 32870 }, { "entropy": 6.232525110244751, "epoch": 3.5179517363154797, "grad_norm": 1.078125, "learning_rate": 0.0003804044789478374, "loss": 5.8514, "mean_token_accuracy": 0.16764634251594543, "num_tokens": 71179493.0, "step": 32875 }, { "entropy": 6.319161510467529, "epoch": 3.5184868104232434, "grad_norm": 1.046875, "learning_rate": 0.0003803706989261622, "loss": 5.8679, "mean_token_accuracy": 0.16647125035524368, "num_tokens": 71190117.0, "step": 32880 }, { "entropy": 6.358170509338379, "epoch": 3.5190218845310075, "grad_norm": 1.0703125, "learning_rate": 0.0003803369158619229, "loss": 5.8838, "mean_token_accuracy": 0.15999316573143005, "num_tokens": 71200177.0, "step": 32885 }, { "entropy": 6.283342409133911, "epoch": 3.5195569586387716, "grad_norm": 1.046875, "learning_rate": 0.00038030312975609494, "loss": 5.9069, "mean_token_accuracy": 0.15875542312860488, "num_tokens": 71211505.0, "step": 32890 }, { "entropy": 6.267287969589233, "epoch": 3.5200920327465353, "grad_norm": 1.1328125, "learning_rate": 0.0003802693406096539, "loss": 5.8816, "mean_token_accuracy": 0.16798485219478607, "num_tokens": 71221055.0, "step": 32895 }, { "entropy": 6.339843082427978, "epoch": 3.5206271068542994, "grad_norm": 1.0625, "learning_rate": 0.0003802355484235756, "loss": 5.9235, "mean_token_accuracy": 0.15617521703243256, "num_tokens": 71230702.0, "step": 32900 }, { "entropy": 6.289839839935302, "epoch": 3.5211621809620635, "grad_norm": 1.1328125, "learning_rate": 0.0003802017531988354, "loss": 5.7851, "mean_token_accuracy": 0.1641812026500702, "num_tokens": 71241665.0, "step": 32905 }, { "entropy": 6.319408750534057, "epoch": 3.521697255069827, "grad_norm": 1.0078125, "learning_rate": 0.00038016795493640946, "loss": 5.917, "mean_token_accuracy": 0.1565326675772667, "num_tokens": 71252662.0, "step": 32910 }, { "entropy": 6.3108381748199465, "epoch": 3.522232329177591, "grad_norm": 1.0078125, "learning_rate": 0.0003801341536372736, "loss": 5.8736, "mean_token_accuracy": 0.1614254742860794, "num_tokens": 71263198.0, "step": 32915 }, { "entropy": 6.2513974666595455, "epoch": 3.522767403285355, "grad_norm": 0.984375, "learning_rate": 0.00038010034930240376, "loss": 5.8359, "mean_token_accuracy": 0.16449740678071975, "num_tokens": 71274464.0, "step": 32920 }, { "entropy": 6.283188199996948, "epoch": 3.523302477393119, "grad_norm": 0.98828125, "learning_rate": 0.0003800665419327762, "loss": 5.9183, "mean_token_accuracy": 0.1639164239168167, "num_tokens": 71285897.0, "step": 32925 }, { "entropy": 6.3186263084411625, "epoch": 3.5238375515008826, "grad_norm": 1.015625, "learning_rate": 0.0003800327315293669, "loss": 5.8222, "mean_token_accuracy": 0.16286759972572326, "num_tokens": 71296374.0, "step": 32930 }, { "entropy": 6.248643064498902, "epoch": 3.5243726256086467, "grad_norm": 1.09375, "learning_rate": 0.00037999891809315233, "loss": 5.8622, "mean_token_accuracy": 0.16666283160448075, "num_tokens": 71307401.0, "step": 32935 }, { "entropy": 6.269603967666626, "epoch": 3.524907699716411, "grad_norm": 1.0234375, "learning_rate": 0.00037996510162510873, "loss": 5.8272, "mean_token_accuracy": 0.16982169151306153, "num_tokens": 71318261.0, "step": 32940 }, { "entropy": 6.2529407978057865, "epoch": 3.5254427738241745, "grad_norm": 0.98828125, "learning_rate": 0.0003799312821262126, "loss": 5.8077, "mean_token_accuracy": 0.1708647847175598, "num_tokens": 71328911.0, "step": 32945 }, { "entropy": 6.333454847335815, "epoch": 3.5259778479319386, "grad_norm": 1.109375, "learning_rate": 0.00037989745959744037, "loss": 5.874, "mean_token_accuracy": 0.16341516524553298, "num_tokens": 71339783.0, "step": 32950 }, { "entropy": 6.365033102035523, "epoch": 3.5265129220397027, "grad_norm": 1.0703125, "learning_rate": 0.00037986363403976875, "loss": 5.881, "mean_token_accuracy": 0.1585460603237152, "num_tokens": 71349561.0, "step": 32955 }, { "entropy": 6.277154159545899, "epoch": 3.5270479961474663, "grad_norm": 1.078125, "learning_rate": 0.0003798298054541744, "loss": 5.8432, "mean_token_accuracy": 0.16497052013874053, "num_tokens": 71360037.0, "step": 32960 }, { "entropy": 6.216370296478272, "epoch": 3.5275830702552304, "grad_norm": 1.390625, "learning_rate": 0.0003797959738416343, "loss": 5.7762, "mean_token_accuracy": 0.17327365130186081, "num_tokens": 71371484.0, "step": 32965 }, { "entropy": 6.325392484664917, "epoch": 3.5281181443629945, "grad_norm": 1.015625, "learning_rate": 0.000379762139203125, "loss": 5.9183, "mean_token_accuracy": 0.16295462250709533, "num_tokens": 71382818.0, "step": 32970 }, { "entropy": 6.316901683807373, "epoch": 3.528653218470758, "grad_norm": 1.0625, "learning_rate": 0.0003797283015396238, "loss": 5.9005, "mean_token_accuracy": 0.16781142950057984, "num_tokens": 71393938.0, "step": 32975 }, { "entropy": 6.293283081054687, "epoch": 3.5291882925785223, "grad_norm": 1.0, "learning_rate": 0.00037969446085210753, "loss": 5.826, "mean_token_accuracy": 0.16788786202669143, "num_tokens": 71403678.0, "step": 32980 }, { "entropy": 6.256353664398193, "epoch": 3.529723366686286, "grad_norm": 1.1484375, "learning_rate": 0.00037966061714155344, "loss": 5.8818, "mean_token_accuracy": 0.16057596653699874, "num_tokens": 71414877.0, "step": 32985 }, { "entropy": 6.2734616756439205, "epoch": 3.53025844079405, "grad_norm": 1.0390625, "learning_rate": 0.00037962677040893867, "loss": 5.8347, "mean_token_accuracy": 0.15761218965053558, "num_tokens": 71424823.0, "step": 32990 }, { "entropy": 6.30154447555542, "epoch": 3.5307935149018137, "grad_norm": 2.046875, "learning_rate": 0.0003795929206552407, "loss": 5.8763, "mean_token_accuracy": 0.15798181742429734, "num_tokens": 71434664.0, "step": 32995 }, { "entropy": 6.242495775222778, "epoch": 3.531328589009578, "grad_norm": 1.0703125, "learning_rate": 0.0003795590678814368, "loss": 5.8356, "mean_token_accuracy": 0.16424114257097244, "num_tokens": 71444556.0, "step": 33000 }, { "epoch": 3.531328589009578, "eval_entropy": 6.045415704398143, "eval_loss": 6.024825096130371, "eval_mean_token_accuracy": 0.16277136240415577, "eval_num_tokens": 71444556.0, "eval_runtime": 22.6725, "eval_samples_per_second": 1309.032, "eval_steps_per_second": 163.634, "step": 33000 }, { "entropy": 6.245586204528808, "epoch": 3.531863663117342, "grad_norm": 1.0078125, "learning_rate": 0.0003795252120885045, "loss": 5.9221, "mean_token_accuracy": 0.1604601562023163, "num_tokens": 71454758.0, "step": 33005 }, { "entropy": 6.345170307159424, "epoch": 3.5323987372251056, "grad_norm": 1.171875, "learning_rate": 0.00037949135327742134, "loss": 5.8933, "mean_token_accuracy": 0.16132024228572844, "num_tokens": 71466594.0, "step": 33010 }, { "entropy": 6.283230113983154, "epoch": 3.5329338113328697, "grad_norm": 1.078125, "learning_rate": 0.0003794574914491652, "loss": 5.7873, "mean_token_accuracy": 0.16428978145122528, "num_tokens": 71477565.0, "step": 33015 }, { "entropy": 6.327844095230103, "epoch": 3.5334688854406338, "grad_norm": 0.9375, "learning_rate": 0.0003794236266047135, "loss": 5.9344, "mean_token_accuracy": 0.1568860188126564, "num_tokens": 71488986.0, "step": 33020 }, { "entropy": 6.302354431152343, "epoch": 3.5340039595483974, "grad_norm": 0.96484375, "learning_rate": 0.00037938975874504433, "loss": 5.918, "mean_token_accuracy": 0.16150644719600676, "num_tokens": 71499504.0, "step": 33025 }, { "entropy": 6.288755655288696, "epoch": 3.5345390336561615, "grad_norm": 1.0859375, "learning_rate": 0.0003793558878711356, "loss": 5.9088, "mean_token_accuracy": 0.16453662961721421, "num_tokens": 71511442.0, "step": 33030 }, { "entropy": 6.288678693771362, "epoch": 3.535074107763925, "grad_norm": 1.0859375, "learning_rate": 0.00037932201398396516, "loss": 5.8959, "mean_token_accuracy": 0.16129753589630128, "num_tokens": 71522190.0, "step": 33035 }, { "entropy": 6.290609073638916, "epoch": 3.5356091818716893, "grad_norm": 0.953125, "learning_rate": 0.0003792881370845113, "loss": 5.863, "mean_token_accuracy": 0.15768814086914062, "num_tokens": 71532458.0, "step": 33040 }, { "entropy": 6.315110969543457, "epoch": 3.536144255979453, "grad_norm": 1.0390625, "learning_rate": 0.0003792542571737521, "loss": 5.9197, "mean_token_accuracy": 0.16191675513982773, "num_tokens": 71543412.0, "step": 33045 }, { "entropy": 6.29269323348999, "epoch": 3.536679330087217, "grad_norm": 1.0390625, "learning_rate": 0.00037922037425266585, "loss": 5.8818, "mean_token_accuracy": 0.15710740238428117, "num_tokens": 71553777.0, "step": 33050 }, { "entropy": 6.309407806396484, "epoch": 3.537214404194981, "grad_norm": 1.125, "learning_rate": 0.00037918648832223107, "loss": 5.8715, "mean_token_accuracy": 0.16365666538476945, "num_tokens": 71564796.0, "step": 33055 }, { "entropy": 6.382484817504883, "epoch": 3.5377494783027448, "grad_norm": 1.0234375, "learning_rate": 0.0003791525993834259, "loss": 5.9247, "mean_token_accuracy": 0.15689361840486526, "num_tokens": 71576457.0, "step": 33060 }, { "entropy": 6.233383560180664, "epoch": 3.538284552410509, "grad_norm": 1.046875, "learning_rate": 0.0003791187074372292, "loss": 5.8392, "mean_token_accuracy": 0.16857126504182815, "num_tokens": 71587233.0, "step": 33065 }, { "entropy": 6.250586748123169, "epoch": 3.538819626518273, "grad_norm": 1.125, "learning_rate": 0.0003790848124846194, "loss": 5.8424, "mean_token_accuracy": 0.16508177518844605, "num_tokens": 71597366.0, "step": 33070 }, { "entropy": 6.333659934997558, "epoch": 3.5393547006260366, "grad_norm": 1.1015625, "learning_rate": 0.00037905091452657526, "loss": 5.9403, "mean_token_accuracy": 0.15991782397031784, "num_tokens": 71607617.0, "step": 33075 }, { "entropy": 6.287013578414917, "epoch": 3.5398897747338007, "grad_norm": 1.0546875, "learning_rate": 0.0003790170135640756, "loss": 5.8493, "mean_token_accuracy": 0.16849738210439683, "num_tokens": 71617794.0, "step": 33080 }, { "entropy": 6.304038858413696, "epoch": 3.540424848841565, "grad_norm": 1.078125, "learning_rate": 0.00037898310959809926, "loss": 5.866, "mean_token_accuracy": 0.16273611187934875, "num_tokens": 71629272.0, "step": 33085 }, { "entropy": 6.343652153015137, "epoch": 3.5409599229493285, "grad_norm": 0.99609375, "learning_rate": 0.00037894920262962527, "loss": 5.9347, "mean_token_accuracy": 0.15998715162277222, "num_tokens": 71639974.0, "step": 33090 }, { "entropy": 6.270119524002075, "epoch": 3.541494997057092, "grad_norm": 0.99609375, "learning_rate": 0.00037891529265963265, "loss": 5.8634, "mean_token_accuracy": 0.15684126913547516, "num_tokens": 71650462.0, "step": 33095 }, { "entropy": 6.192747259140015, "epoch": 3.5420300711648562, "grad_norm": 1.0859375, "learning_rate": 0.0003788813796891006, "loss": 5.7632, "mean_token_accuracy": 0.17775280624628068, "num_tokens": 71661405.0, "step": 33100 }, { "entropy": 6.233632183074951, "epoch": 3.5425651452726203, "grad_norm": 1.0859375, "learning_rate": 0.0003788474637190082, "loss": 5.7934, "mean_token_accuracy": 0.1712060257792473, "num_tokens": 71671757.0, "step": 33105 }, { "entropy": 6.249725484848023, "epoch": 3.543100219380384, "grad_norm": 1.0703125, "learning_rate": 0.000378813544750335, "loss": 5.8508, "mean_token_accuracy": 0.15948166251182555, "num_tokens": 71682464.0, "step": 33110 }, { "entropy": 6.353636264801025, "epoch": 3.543635293488148, "grad_norm": 0.94921875, "learning_rate": 0.0003787796227840602, "loss": 5.8945, "mean_token_accuracy": 0.16059373170137406, "num_tokens": 71693411.0, "step": 33115 }, { "entropy": 6.331058120727539, "epoch": 3.544170367595912, "grad_norm": 0.98828125, "learning_rate": 0.0003787456978211634, "loss": 5.847, "mean_token_accuracy": 0.15767382830381393, "num_tokens": 71705059.0, "step": 33120 }, { "entropy": 6.290031147003174, "epoch": 3.544705441703676, "grad_norm": 1.15625, "learning_rate": 0.00037871176986262417, "loss": 5.8682, "mean_token_accuracy": 0.16362518966197967, "num_tokens": 71715935.0, "step": 33125 }, { "entropy": 6.253857088088989, "epoch": 3.54524051581144, "grad_norm": 1.0078125, "learning_rate": 0.00037867783890942213, "loss": 5.8745, "mean_token_accuracy": 0.16832320541143417, "num_tokens": 71725913.0, "step": 33130 }, { "entropy": 6.318027925491333, "epoch": 3.545775589919204, "grad_norm": 1.1484375, "learning_rate": 0.0003786439049625371, "loss": 5.9702, "mean_token_accuracy": 0.1539229556918144, "num_tokens": 71736385.0, "step": 33135 }, { "entropy": 6.340768671035766, "epoch": 3.5463106640269677, "grad_norm": 1.0390625, "learning_rate": 0.0003786099680229488, "loss": 5.9515, "mean_token_accuracy": 0.15453873574733734, "num_tokens": 71747673.0, "step": 33140 }, { "entropy": 6.295876693725586, "epoch": 3.546845738134732, "grad_norm": 0.9921875, "learning_rate": 0.0003785760280916374, "loss": 5.9037, "mean_token_accuracy": 0.16629651933908463, "num_tokens": 71758329.0, "step": 33145 }, { "entropy": 6.350645112991333, "epoch": 3.5473808122424955, "grad_norm": 1.0625, "learning_rate": 0.00037854208516958254, "loss": 5.9038, "mean_token_accuracy": 0.16467938125133513, "num_tokens": 71769270.0, "step": 33150 }, { "entropy": 6.3669750690460205, "epoch": 3.5479158863502596, "grad_norm": 1.0703125, "learning_rate": 0.0003785081392577646, "loss": 5.8939, "mean_token_accuracy": 0.1608085811138153, "num_tokens": 71780506.0, "step": 33155 }, { "entropy": 6.3270836353302, "epoch": 3.548450960458023, "grad_norm": 1.1640625, "learning_rate": 0.00037847419035716374, "loss": 5.8733, "mean_token_accuracy": 0.15985905081033708, "num_tokens": 71790625.0, "step": 33160 }, { "entropy": 6.2802670955657955, "epoch": 3.5489860345657873, "grad_norm": 1.0390625, "learning_rate": 0.00037844023846876005, "loss": 5.8367, "mean_token_accuracy": 0.16678162068128585, "num_tokens": 71801259.0, "step": 33165 }, { "entropy": 6.325081396102905, "epoch": 3.5495211086735514, "grad_norm": 1.078125, "learning_rate": 0.00037840628359353415, "loss": 5.9273, "mean_token_accuracy": 0.1540044791996479, "num_tokens": 71812493.0, "step": 33170 }, { "entropy": 6.367501258850098, "epoch": 3.550056182781315, "grad_norm": 0.984375, "learning_rate": 0.0003783723257324663, "loss": 5.8947, "mean_token_accuracy": 0.15714661478996278, "num_tokens": 71823099.0, "step": 33175 }, { "entropy": 6.315748023986816, "epoch": 3.550591256889079, "grad_norm": 1.0546875, "learning_rate": 0.000378338364886537, "loss": 5.8801, "mean_token_accuracy": 0.16068095117807388, "num_tokens": 71833206.0, "step": 33180 }, { "entropy": 6.263298511505127, "epoch": 3.5511263309968433, "grad_norm": 1.0078125, "learning_rate": 0.000378304401056727, "loss": 5.8077, "mean_token_accuracy": 0.166708305478096, "num_tokens": 71844516.0, "step": 33185 }, { "entropy": 6.211860847473145, "epoch": 3.551661405104607, "grad_norm": 0.96484375, "learning_rate": 0.00037827043424401693, "loss": 5.7663, "mean_token_accuracy": 0.17388403415679932, "num_tokens": 71854636.0, "step": 33190 }, { "entropy": 6.3218179702758786, "epoch": 3.552196479212371, "grad_norm": 1.265625, "learning_rate": 0.0003782364644493876, "loss": 5.8543, "mean_token_accuracy": 0.16057040691375732, "num_tokens": 71864535.0, "step": 33195 }, { "entropy": 6.213329315185547, "epoch": 3.5527315533201347, "grad_norm": 1.046875, "learning_rate": 0.00037820249167381983, "loss": 5.8539, "mean_token_accuracy": 0.1617678165435791, "num_tokens": 71875588.0, "step": 33200 }, { "entropy": 6.24379711151123, "epoch": 3.553266627427899, "grad_norm": 0.98046875, "learning_rate": 0.0003781685159182946, "loss": 5.8869, "mean_token_accuracy": 0.15899092555046082, "num_tokens": 71886615.0, "step": 33205 }, { "entropy": 6.391722202301025, "epoch": 3.5538017015356624, "grad_norm": 1.046875, "learning_rate": 0.00037813453718379297, "loss": 5.955, "mean_token_accuracy": 0.15679136365652085, "num_tokens": 71896744.0, "step": 33210 }, { "entropy": 6.373698711395264, "epoch": 3.5543367756434265, "grad_norm": 1.109375, "learning_rate": 0.0003781005554712961, "loss": 5.9145, "mean_token_accuracy": 0.15683144181966782, "num_tokens": 71907436.0, "step": 33215 }, { "entropy": 6.325231981277466, "epoch": 3.5548718497511906, "grad_norm": 1.1328125, "learning_rate": 0.0003780665707817852, "loss": 5.9012, "mean_token_accuracy": 0.1664963886141777, "num_tokens": 71917688.0, "step": 33220 }, { "entropy": 6.250728797912598, "epoch": 3.5554069238589543, "grad_norm": 1.0390625, "learning_rate": 0.0003780325831162415, "loss": 5.857, "mean_token_accuracy": 0.16829234212636948, "num_tokens": 71928768.0, "step": 33225 }, { "entropy": 6.333405160903931, "epoch": 3.5559419979667184, "grad_norm": 1.0234375, "learning_rate": 0.0003779985924756465, "loss": 5.925, "mean_token_accuracy": 0.16023187041282655, "num_tokens": 71940492.0, "step": 33230 }, { "entropy": 6.343059492111206, "epoch": 3.5564770720744825, "grad_norm": 1.09375, "learning_rate": 0.0003779645988609816, "loss": 5.8736, "mean_token_accuracy": 0.1652322456240654, "num_tokens": 71950667.0, "step": 33235 }, { "entropy": 6.3293873310089115, "epoch": 3.557012146182246, "grad_norm": 1.0390625, "learning_rate": 0.0003779306022732283, "loss": 5.9219, "mean_token_accuracy": 0.1581512823700905, "num_tokens": 71961439.0, "step": 33240 }, { "entropy": 6.300443935394287, "epoch": 3.5575472202900102, "grad_norm": 0.9765625, "learning_rate": 0.00037789660271336843, "loss": 5.9035, "mean_token_accuracy": 0.16206044107675552, "num_tokens": 71972121.0, "step": 33245 }, { "entropy": 6.286059188842773, "epoch": 3.5580822943977743, "grad_norm": 1.09375, "learning_rate": 0.00037786260018238363, "loss": 5.8066, "mean_token_accuracy": 0.1674071043729782, "num_tokens": 71982093.0, "step": 33250 }, { "entropy": 6.367140388488769, "epoch": 3.558617368505538, "grad_norm": 1.03125, "learning_rate": 0.00037782859468125555, "loss": 5.895, "mean_token_accuracy": 0.159890079498291, "num_tokens": 71992834.0, "step": 33255 }, { "entropy": 6.347654008865357, "epoch": 3.559152442613302, "grad_norm": 1.140625, "learning_rate": 0.0003777945862109664, "loss": 5.9094, "mean_token_accuracy": 0.16240161955356597, "num_tokens": 72004945.0, "step": 33260 }, { "entropy": 6.307442951202392, "epoch": 3.5596875167210658, "grad_norm": 1.1015625, "learning_rate": 0.0003777605747724979, "loss": 5.8561, "mean_token_accuracy": 0.16739475280046462, "num_tokens": 72014559.0, "step": 33265 }, { "entropy": 6.3194599628448485, "epoch": 3.56022259082883, "grad_norm": 1.0234375, "learning_rate": 0.0003777265603668323, "loss": 5.9685, "mean_token_accuracy": 0.15597933828830718, "num_tokens": 72025773.0, "step": 33270 }, { "entropy": 6.282560348510742, "epoch": 3.5607576649365935, "grad_norm": 1.0703125, "learning_rate": 0.00037769254299495174, "loss": 5.7924, "mean_token_accuracy": 0.1717449426651001, "num_tokens": 72036107.0, "step": 33275 }, { "entropy": 6.341705751419068, "epoch": 3.5612927390443576, "grad_norm": 0.99609375, "learning_rate": 0.00037765852265783846, "loss": 5.8874, "mean_token_accuracy": 0.16180490851402282, "num_tokens": 72046085.0, "step": 33280 }, { "entropy": 6.2579014778137205, "epoch": 3.5618278131521217, "grad_norm": 1.078125, "learning_rate": 0.00037762449935647464, "loss": 5.9364, "mean_token_accuracy": 0.15832081586122512, "num_tokens": 72057232.0, "step": 33285 }, { "entropy": 6.319276142120361, "epoch": 3.5623628872598854, "grad_norm": 1.0859375, "learning_rate": 0.0003775904730918429, "loss": 5.9412, "mean_token_accuracy": 0.15819905400276185, "num_tokens": 72068027.0, "step": 33290 }, { "entropy": 6.281509113311768, "epoch": 3.5628979613676495, "grad_norm": 1.0234375, "learning_rate": 0.00037755644386492564, "loss": 5.7891, "mean_token_accuracy": 0.16080859005451204, "num_tokens": 72078926.0, "step": 33295 }, { "entropy": 6.276621723175049, "epoch": 3.5634330354754136, "grad_norm": 1.0078125, "learning_rate": 0.00037752241167670546, "loss": 5.7942, "mean_token_accuracy": 0.16109281182289123, "num_tokens": 72089273.0, "step": 33300 }, { "entropy": 6.180181074142456, "epoch": 3.5639681095831772, "grad_norm": 1.03125, "learning_rate": 0.0003774883765281651, "loss": 5.7154, "mean_token_accuracy": 0.17865117490291596, "num_tokens": 72100012.0, "step": 33305 }, { "entropy": 6.351718759536743, "epoch": 3.5645031836909413, "grad_norm": 1.140625, "learning_rate": 0.00037745433842028723, "loss": 5.9869, "mean_token_accuracy": 0.15524639636278154, "num_tokens": 72110575.0, "step": 33310 }, { "entropy": 6.314544343948365, "epoch": 3.565038257798705, "grad_norm": 1.046875, "learning_rate": 0.00037742029735405474, "loss": 5.8656, "mean_token_accuracy": 0.159775747358799, "num_tokens": 72120586.0, "step": 33315 }, { "entropy": 6.2989743709564205, "epoch": 3.565573331906469, "grad_norm": 1.078125, "learning_rate": 0.0003773862533304506, "loss": 5.819, "mean_token_accuracy": 0.16543969810009002, "num_tokens": 72131366.0, "step": 33320 }, { "entropy": 6.277252578735352, "epoch": 3.5661084060142327, "grad_norm": 1.046875, "learning_rate": 0.0003773522063504577, "loss": 5.8577, "mean_token_accuracy": 0.16269831657409667, "num_tokens": 72142909.0, "step": 33325 }, { "entropy": 6.282535457611084, "epoch": 3.566643480121997, "grad_norm": 1.0390625, "learning_rate": 0.0003773181564150593, "loss": 5.8834, "mean_token_accuracy": 0.1605241194367409, "num_tokens": 72152889.0, "step": 33330 }, { "entropy": 6.262091398239136, "epoch": 3.567178554229761, "grad_norm": 1.0703125, "learning_rate": 0.00037728410352523843, "loss": 5.8359, "mean_token_accuracy": 0.16631745919585228, "num_tokens": 72163305.0, "step": 33335 }, { "entropy": 6.306754398345947, "epoch": 3.5677136283375246, "grad_norm": 1.0703125, "learning_rate": 0.00037725004768197857, "loss": 5.8818, "mean_token_accuracy": 0.16170517951250077, "num_tokens": 72174233.0, "step": 33340 }, { "entropy": 6.31787075996399, "epoch": 3.5682487024452887, "grad_norm": 1.0625, "learning_rate": 0.00037721598888626283, "loss": 5.9172, "mean_token_accuracy": 0.15818060636520387, "num_tokens": 72184498.0, "step": 33345 }, { "entropy": 6.312997245788575, "epoch": 3.568783776553053, "grad_norm": 1.0703125, "learning_rate": 0.00037718192713907486, "loss": 5.8343, "mean_token_accuracy": 0.16473493874073028, "num_tokens": 72194404.0, "step": 33350 }, { "entropy": 6.26493091583252, "epoch": 3.5693188506608164, "grad_norm": 1.09375, "learning_rate": 0.000377147862441398, "loss": 5.868, "mean_token_accuracy": 0.16243913620710373, "num_tokens": 72204880.0, "step": 33355 }, { "entropy": 6.306521320343018, "epoch": 3.5698539247685805, "grad_norm": 1.078125, "learning_rate": 0.00037711379479421606, "loss": 5.8828, "mean_token_accuracy": 0.1628741890192032, "num_tokens": 72214993.0, "step": 33360 }, { "entropy": 6.285051441192627, "epoch": 3.5703889988763446, "grad_norm": 0.99609375, "learning_rate": 0.0003770797241985127, "loss": 5.8243, "mean_token_accuracy": 0.16735235452651978, "num_tokens": 72226032.0, "step": 33365 }, { "entropy": 6.294898891448975, "epoch": 3.5709240729841083, "grad_norm": 1.03125, "learning_rate": 0.00037704565065527153, "loss": 5.8707, "mean_token_accuracy": 0.15871503800153733, "num_tokens": 72237227.0, "step": 33370 }, { "entropy": 6.255304670333862, "epoch": 3.571459147091872, "grad_norm": 1.1171875, "learning_rate": 0.00037701157416547657, "loss": 5.7654, "mean_token_accuracy": 0.1695035606622696, "num_tokens": 72247069.0, "step": 33375 }, { "entropy": 6.330846118927002, "epoch": 3.571994221199636, "grad_norm": 1.0390625, "learning_rate": 0.00037697749473011166, "loss": 5.947, "mean_token_accuracy": 0.15930835753679276, "num_tokens": 72257939.0, "step": 33380 }, { "entropy": 6.301902866363525, "epoch": 3.5725292953074, "grad_norm": 1.015625, "learning_rate": 0.000376943412350161, "loss": 5.7903, "mean_token_accuracy": 0.1682878091931343, "num_tokens": 72268043.0, "step": 33385 }, { "entropy": 6.25487871170044, "epoch": 3.573064369415164, "grad_norm": 1.078125, "learning_rate": 0.0003769093270266087, "loss": 5.8037, "mean_token_accuracy": 0.17108939588069916, "num_tokens": 72279146.0, "step": 33390 }, { "entropy": 6.353640556335449, "epoch": 3.573599443522928, "grad_norm": 1.0625, "learning_rate": 0.0003768752387604388, "loss": 5.9075, "mean_token_accuracy": 0.15333650559186934, "num_tokens": 72290713.0, "step": 33395 }, { "entropy": 6.340715408325195, "epoch": 3.574134517630692, "grad_norm": 1.0234375, "learning_rate": 0.0003768411475526357, "loss": 5.9103, "mean_token_accuracy": 0.1565677523612976, "num_tokens": 72301295.0, "step": 33400 }, { "entropy": 6.321728181838989, "epoch": 3.5746695917384557, "grad_norm": 1.0625, "learning_rate": 0.00037680705340418385, "loss": 5.9459, "mean_token_accuracy": 0.16042459160089492, "num_tokens": 72312079.0, "step": 33405 }, { "entropy": 6.302862882614136, "epoch": 3.5752046658462198, "grad_norm": 1.046875, "learning_rate": 0.0003767729563160676, "loss": 5.845, "mean_token_accuracy": 0.16892948895692825, "num_tokens": 72323318.0, "step": 33410 }, { "entropy": 6.351793813705444, "epoch": 3.575739739953984, "grad_norm": 0.9921875, "learning_rate": 0.0003767388562892715, "loss": 5.9406, "mean_token_accuracy": 0.15882780998945237, "num_tokens": 72334444.0, "step": 33415 }, { "entropy": 6.340031909942627, "epoch": 3.5762748140617475, "grad_norm": 1.1171875, "learning_rate": 0.00037670475332478027, "loss": 5.8514, "mean_token_accuracy": 0.16590644866228105, "num_tokens": 72345158.0, "step": 33420 }, { "entropy": 6.292798089981079, "epoch": 3.5768098881695116, "grad_norm": 1.046875, "learning_rate": 0.00037667064742357857, "loss": 5.8947, "mean_token_accuracy": 0.15812153965234757, "num_tokens": 72356589.0, "step": 33425 }, { "entropy": 6.304518318176269, "epoch": 3.5773449622772753, "grad_norm": 0.97265625, "learning_rate": 0.00037663653858665115, "loss": 5.9525, "mean_token_accuracy": 0.16202996671199799, "num_tokens": 72368213.0, "step": 33430 }, { "entropy": 6.386752367019653, "epoch": 3.5778800363850394, "grad_norm": 1.0390625, "learning_rate": 0.0003766024268149831, "loss": 5.9726, "mean_token_accuracy": 0.15706840753555298, "num_tokens": 72378535.0, "step": 33435 }, { "entropy": 6.364438772201538, "epoch": 3.578415110492803, "grad_norm": 1.0, "learning_rate": 0.0003765683121095591, "loss": 5.8476, "mean_token_accuracy": 0.1591722175478935, "num_tokens": 72388837.0, "step": 33440 }, { "entropy": 6.2857973098754885, "epoch": 3.578950184600567, "grad_norm": 1.0625, "learning_rate": 0.00037653419447136445, "loss": 5.9201, "mean_token_accuracy": 0.1527429386973381, "num_tokens": 72399456.0, "step": 33445 }, { "entropy": 6.258721733093262, "epoch": 3.5794852587083312, "grad_norm": 1.0546875, "learning_rate": 0.0003765000739013842, "loss": 5.8024, "mean_token_accuracy": 0.1713217779994011, "num_tokens": 72410566.0, "step": 33450 }, { "entropy": 6.3207262516021725, "epoch": 3.580020332816095, "grad_norm": 1.1015625, "learning_rate": 0.0003764659504006035, "loss": 5.8667, "mean_token_accuracy": 0.16635714769363402, "num_tokens": 72422179.0, "step": 33455 }, { "entropy": 6.3077253818511965, "epoch": 3.580555406923859, "grad_norm": 1.1484375, "learning_rate": 0.0003764318239700079, "loss": 5.841, "mean_token_accuracy": 0.16019092500209808, "num_tokens": 72431770.0, "step": 33460 }, { "entropy": 6.25889892578125, "epoch": 3.581090481031623, "grad_norm": 1.1171875, "learning_rate": 0.0003763976946105825, "loss": 5.9352, "mean_token_accuracy": 0.1553734302520752, "num_tokens": 72443501.0, "step": 33465 }, { "entropy": 6.390499114990234, "epoch": 3.5816255551393867, "grad_norm": 1.03125, "learning_rate": 0.0003763635623233129, "loss": 5.9144, "mean_token_accuracy": 0.1541903391480446, "num_tokens": 72454470.0, "step": 33470 }, { "entropy": 6.327205610275269, "epoch": 3.582160629247151, "grad_norm": 1.0390625, "learning_rate": 0.0003763294271091848, "loss": 5.8228, "mean_token_accuracy": 0.16277832686901092, "num_tokens": 72465093.0, "step": 33475 }, { "entropy": 6.280293273925781, "epoch": 3.5826957033549145, "grad_norm": 1.046875, "learning_rate": 0.0003762952889691836, "loss": 5.9177, "mean_token_accuracy": 0.1618471324443817, "num_tokens": 72474971.0, "step": 33480 }, { "entropy": 6.281852197647095, "epoch": 3.5832307774626786, "grad_norm": 1.0546875, "learning_rate": 0.0003762611479042953, "loss": 5.9163, "mean_token_accuracy": 0.16396037489175797, "num_tokens": 72484715.0, "step": 33485 }, { "entropy": 6.359040641784668, "epoch": 3.5837658515704423, "grad_norm": 1.1328125, "learning_rate": 0.0003762270039155055, "loss": 5.9322, "mean_token_accuracy": 0.1638346567749977, "num_tokens": 72495073.0, "step": 33490 }, { "entropy": 6.333744764328003, "epoch": 3.5843009256782064, "grad_norm": 0.93359375, "learning_rate": 0.0003761928570038002, "loss": 5.93, "mean_token_accuracy": 0.1578065797686577, "num_tokens": 72505698.0, "step": 33495 }, { "entropy": 6.336458015441894, "epoch": 3.5848359997859705, "grad_norm": 1.109375, "learning_rate": 0.0003761587071701654, "loss": 5.8607, "mean_token_accuracy": 0.16250478476285934, "num_tokens": 72515969.0, "step": 33500 }, { "entropy": 6.3066077709198, "epoch": 3.585371073893734, "grad_norm": 1.03125, "learning_rate": 0.0003761245544155871, "loss": 5.9374, "mean_token_accuracy": 0.15899441465735437, "num_tokens": 72527254.0, "step": 33505 }, { "entropy": 6.248760461807251, "epoch": 3.585906148001498, "grad_norm": 0.953125, "learning_rate": 0.0003760903987410515, "loss": 5.8186, "mean_token_accuracy": 0.16429177522659302, "num_tokens": 72538451.0, "step": 33510 }, { "entropy": 6.369289827346802, "epoch": 3.5864412221092623, "grad_norm": 1.0625, "learning_rate": 0.00037605624014754485, "loss": 5.8892, "mean_token_accuracy": 0.164928574860096, "num_tokens": 72548855.0, "step": 33515 }, { "entropy": 6.334414863586426, "epoch": 3.586976296217026, "grad_norm": 1.046875, "learning_rate": 0.00037602207863605356, "loss": 5.8583, "mean_token_accuracy": 0.16809907108545302, "num_tokens": 72559056.0, "step": 33520 }, { "entropy": 6.253343105316162, "epoch": 3.58751137032479, "grad_norm": 1.046875, "learning_rate": 0.0003759879142075638, "loss": 5.8292, "mean_token_accuracy": 0.158990778028965, "num_tokens": 72569541.0, "step": 33525 }, { "entropy": 6.280427742004394, "epoch": 3.588046444432554, "grad_norm": 1.046875, "learning_rate": 0.0003759537468630622, "loss": 5.8651, "mean_token_accuracy": 0.16196625977754592, "num_tokens": 72580018.0, "step": 33530 }, { "entropy": 6.356660795211792, "epoch": 3.588581518540318, "grad_norm": 1.015625, "learning_rate": 0.0003759195766035355, "loss": 5.9162, "mean_token_accuracy": 0.15783238410949707, "num_tokens": 72591315.0, "step": 33535 }, { "entropy": 6.2773138046264645, "epoch": 3.589116592648082, "grad_norm": 1.046875, "learning_rate": 0.00037588540342997005, "loss": 5.8878, "mean_token_accuracy": 0.1599971830844879, "num_tokens": 72602228.0, "step": 33540 }, { "entropy": 6.243676090240479, "epoch": 3.5896516667558456, "grad_norm": 1.109375, "learning_rate": 0.0003758512273433529, "loss": 5.8288, "mean_token_accuracy": 0.16278162002563476, "num_tokens": 72614400.0, "step": 33545 }, { "entropy": 6.370948314666748, "epoch": 3.5901867408636097, "grad_norm": 1.0859375, "learning_rate": 0.0003758170483446707, "loss": 5.8273, "mean_token_accuracy": 0.17022197544574738, "num_tokens": 72625320.0, "step": 33550 }, { "entropy": 6.301578044891357, "epoch": 3.5907218149713733, "grad_norm": 1.0703125, "learning_rate": 0.00037578286643491027, "loss": 5.8767, "mean_token_accuracy": 0.15824514478445054, "num_tokens": 72635708.0, "step": 33555 }, { "entropy": 6.196026611328125, "epoch": 3.5912568890791374, "grad_norm": 0.9609375, "learning_rate": 0.0003757486816150588, "loss": 5.82, "mean_token_accuracy": 0.1725462332367897, "num_tokens": 72647325.0, "step": 33560 }, { "entropy": 6.225510883331299, "epoch": 3.5917919631869015, "grad_norm": 1.09375, "learning_rate": 0.0003757144938861033, "loss": 5.7633, "mean_token_accuracy": 0.180069799721241, "num_tokens": 72658153.0, "step": 33565 }, { "entropy": 6.262007093429565, "epoch": 3.592327037294665, "grad_norm": 0.96875, "learning_rate": 0.000375680303249031, "loss": 5.8684, "mean_token_accuracy": 0.16592867374420167, "num_tokens": 72668919.0, "step": 33570 }, { "entropy": 6.247193050384522, "epoch": 3.5928621114024293, "grad_norm": 1.0234375, "learning_rate": 0.00037564610970482903, "loss": 5.8762, "mean_token_accuracy": 0.15934530794620513, "num_tokens": 72679635.0, "step": 33575 }, { "entropy": 6.333421516418457, "epoch": 3.5933971855101934, "grad_norm": 0.96484375, "learning_rate": 0.00037561191325448487, "loss": 5.8926, "mean_token_accuracy": 0.16484256088733673, "num_tokens": 72690052.0, "step": 33580 }, { "entropy": 6.351057720184326, "epoch": 3.593932259617957, "grad_norm": 1.03125, "learning_rate": 0.0003755777138989858, "loss": 5.8901, "mean_token_accuracy": 0.15739807337522507, "num_tokens": 72699764.0, "step": 33585 }, { "entropy": 6.301752424240112, "epoch": 3.594467333725721, "grad_norm": 1.03125, "learning_rate": 0.00037554351163931934, "loss": 5.8805, "mean_token_accuracy": 0.16651146337389947, "num_tokens": 72710102.0, "step": 33590 }, { "entropy": 6.243757057189941, "epoch": 3.595002407833485, "grad_norm": 1.0546875, "learning_rate": 0.00037550930647647316, "loss": 5.8201, "mean_token_accuracy": 0.1668877676129341, "num_tokens": 72720989.0, "step": 33595 }, { "entropy": 6.309793329238891, "epoch": 3.595537481941249, "grad_norm": 1.078125, "learning_rate": 0.0003754750984114348, "loss": 5.826, "mean_token_accuracy": 0.16138134002685547, "num_tokens": 72732178.0, "step": 33600 }, { "entropy": 6.289971733093262, "epoch": 3.5960725560490125, "grad_norm": 1.0703125, "learning_rate": 0.00037544088744519214, "loss": 5.812, "mean_token_accuracy": 0.1757027566432953, "num_tokens": 72743204.0, "step": 33605 }, { "entropy": 6.190939331054688, "epoch": 3.5966076301567766, "grad_norm": 1.03125, "learning_rate": 0.000375406673578733, "loss": 5.8576, "mean_token_accuracy": 0.165828637778759, "num_tokens": 72753529.0, "step": 33610 }, { "entropy": 6.417770576477051, "epoch": 3.5971427042645407, "grad_norm": 1.125, "learning_rate": 0.00037537245681304525, "loss": 5.9152, "mean_token_accuracy": 0.15730011686682702, "num_tokens": 72765735.0, "step": 33615 }, { "entropy": 6.407018518447876, "epoch": 3.5976777783723044, "grad_norm": 1.03125, "learning_rate": 0.00037533823714911693, "loss": 5.9512, "mean_token_accuracy": 0.1606743350625038, "num_tokens": 72776911.0, "step": 33620 }, { "entropy": 6.305575942993164, "epoch": 3.5982128524800685, "grad_norm": 1.0234375, "learning_rate": 0.00037530401458793613, "loss": 5.8545, "mean_token_accuracy": 0.15720027834177017, "num_tokens": 72788363.0, "step": 33625 }, { "entropy": 6.34047040939331, "epoch": 3.5987479265878326, "grad_norm": 1.125, "learning_rate": 0.000375269789130491, "loss": 5.9459, "mean_token_accuracy": 0.15991251170635223, "num_tokens": 72799527.0, "step": 33630 }, { "entropy": 6.296006059646606, "epoch": 3.5992830006955963, "grad_norm": 1.0703125, "learning_rate": 0.00037523556077776973, "loss": 5.8065, "mean_token_accuracy": 0.17112400233745576, "num_tokens": 72811098.0, "step": 33635 }, { "entropy": 6.259709167480469, "epoch": 3.5998180748033604, "grad_norm": 1.015625, "learning_rate": 0.0003752013295307607, "loss": 5.8513, "mean_token_accuracy": 0.16081907004117965, "num_tokens": 72822601.0, "step": 33640 }, { "entropy": 6.279559183120727, "epoch": 3.6003531489111245, "grad_norm": 0.9609375, "learning_rate": 0.00037516709539045246, "loss": 5.8242, "mean_token_accuracy": 0.16791074126958846, "num_tokens": 72833825.0, "step": 33645 }, { "entropy": 6.288034868240357, "epoch": 3.600888223018888, "grad_norm": 1.0078125, "learning_rate": 0.0003751328583578334, "loss": 5.8686, "mean_token_accuracy": 0.16176730319857596, "num_tokens": 72844297.0, "step": 33650 }, { "entropy": 6.295990133285523, "epoch": 3.6014232971266518, "grad_norm": 1.0078125, "learning_rate": 0.0003750986184338921, "loss": 5.8653, "mean_token_accuracy": 0.17241712361574174, "num_tokens": 72855356.0, "step": 33655 }, { "entropy": 6.302987146377563, "epoch": 3.601958371234416, "grad_norm": 1.0234375, "learning_rate": 0.00037506437561961726, "loss": 5.8559, "mean_token_accuracy": 0.16170162856578826, "num_tokens": 72867570.0, "step": 33660 }, { "entropy": 6.2727912902832035, "epoch": 3.60249344534218, "grad_norm": 1.0625, "learning_rate": 0.00037503012991599766, "loss": 5.7897, "mean_token_accuracy": 0.16701353639364241, "num_tokens": 72877657.0, "step": 33665 }, { "entropy": 6.276722526550293, "epoch": 3.6030285194499436, "grad_norm": 1.2109375, "learning_rate": 0.00037499588132402205, "loss": 5.9146, "mean_token_accuracy": 0.15743363052606582, "num_tokens": 72888147.0, "step": 33670 }, { "entropy": 6.362894582748413, "epoch": 3.6035635935577077, "grad_norm": 0.95703125, "learning_rate": 0.00037496162984467944, "loss": 5.945, "mean_token_accuracy": 0.15752809420228003, "num_tokens": 72899226.0, "step": 33675 }, { "entropy": 6.427351760864258, "epoch": 3.604098667665472, "grad_norm": 1.0234375, "learning_rate": 0.0003749273754789589, "loss": 5.9608, "mean_token_accuracy": 0.1558823600411415, "num_tokens": 72909662.0, "step": 33680 }, { "entropy": 6.314149808883667, "epoch": 3.6046337417732355, "grad_norm": 1.09375, "learning_rate": 0.0003748931182278494, "loss": 5.8902, "mean_token_accuracy": 0.16263863891363145, "num_tokens": 72920003.0, "step": 33685 }, { "entropy": 6.307227039337159, "epoch": 3.6051688158809996, "grad_norm": 1.0703125, "learning_rate": 0.00037485885809234007, "loss": 5.8978, "mean_token_accuracy": 0.1625073879957199, "num_tokens": 72931833.0, "step": 33690 }, { "entropy": 6.332627201080323, "epoch": 3.6057038899887637, "grad_norm": 1.046875, "learning_rate": 0.0003748245950734203, "loss": 5.9017, "mean_token_accuracy": 0.16105087250471115, "num_tokens": 72943101.0, "step": 33695 }, { "entropy": 6.361263179779053, "epoch": 3.6062389640965273, "grad_norm": 0.9765625, "learning_rate": 0.0003747903291720794, "loss": 5.9233, "mean_token_accuracy": 0.16023811995983123, "num_tokens": 72954177.0, "step": 33700 }, { "entropy": 6.323302125930786, "epoch": 3.6067740382042914, "grad_norm": 1.0234375, "learning_rate": 0.00037475606038930663, "loss": 5.8677, "mean_token_accuracy": 0.1663643777370453, "num_tokens": 72966316.0, "step": 33705 }, { "entropy": 6.316651630401611, "epoch": 3.607309112312055, "grad_norm": 1.09375, "learning_rate": 0.00037472178872609177, "loss": 5.9479, "mean_token_accuracy": 0.15706914216279982, "num_tokens": 72977814.0, "step": 33710 }, { "entropy": 6.243829679489136, "epoch": 3.607844186419819, "grad_norm": 0.953125, "learning_rate": 0.00037468751418342426, "loss": 5.8206, "mean_token_accuracy": 0.16015633195638657, "num_tokens": 72988859.0, "step": 33715 }, { "entropy": 6.366285753250122, "epoch": 3.608379260527583, "grad_norm": 1.09375, "learning_rate": 0.00037465323676229376, "loss": 5.9318, "mean_token_accuracy": 0.16113610416650773, "num_tokens": 72999922.0, "step": 33720 }, { "entropy": 6.3517265796661375, "epoch": 3.608914334635347, "grad_norm": 1.03125, "learning_rate": 0.0003746189564636901, "loss": 6.0334, "mean_token_accuracy": 0.1598150312900543, "num_tokens": 73012906.0, "step": 33725 }, { "entropy": 6.3091363430023195, "epoch": 3.609449408743111, "grad_norm": 1.0703125, "learning_rate": 0.000374584673288603, "loss": 5.8241, "mean_token_accuracy": 0.16206476092338562, "num_tokens": 73023799.0, "step": 33730 }, { "entropy": 6.384814596176147, "epoch": 3.6099844828508747, "grad_norm": 0.99609375, "learning_rate": 0.0003745503872380225, "loss": 5.9872, "mean_token_accuracy": 0.1575897976756096, "num_tokens": 73035063.0, "step": 33735 }, { "entropy": 6.310947036743164, "epoch": 3.610519556958639, "grad_norm": 1.03125, "learning_rate": 0.0003745160983129386, "loss": 5.8885, "mean_token_accuracy": 0.16487934961915016, "num_tokens": 73045652.0, "step": 33740 }, { "entropy": 6.2667591094970705, "epoch": 3.611054631066403, "grad_norm": 0.9609375, "learning_rate": 0.0003744818065143413, "loss": 5.8643, "mean_token_accuracy": 0.16892859041690828, "num_tokens": 73056497.0, "step": 33745 }, { "entropy": 6.281037855148315, "epoch": 3.6115897051741666, "grad_norm": 1.109375, "learning_rate": 0.0003744475118432207, "loss": 5.8686, "mean_token_accuracy": 0.16180170625448226, "num_tokens": 73068076.0, "step": 33750 }, { "entropy": 6.298085021972656, "epoch": 3.6121247792819307, "grad_norm": 1.0625, "learning_rate": 0.0003744132143005673, "loss": 5.8025, "mean_token_accuracy": 0.16976210474967957, "num_tokens": 73079015.0, "step": 33755 }, { "entropy": 6.24893856048584, "epoch": 3.6126598533896943, "grad_norm": 1.0859375, "learning_rate": 0.0003743789138873713, "loss": 5.835, "mean_token_accuracy": 0.165553979575634, "num_tokens": 73089410.0, "step": 33760 }, { "entropy": 6.305367946624756, "epoch": 3.6131949274974584, "grad_norm": 1.0390625, "learning_rate": 0.0003743446106046231, "loss": 5.8629, "mean_token_accuracy": 0.16246774941682815, "num_tokens": 73100674.0, "step": 33765 }, { "entropy": 6.362798595428467, "epoch": 3.613730001605222, "grad_norm": 1.0234375, "learning_rate": 0.0003743103044533132, "loss": 5.9733, "mean_token_accuracy": 0.15456732511520385, "num_tokens": 73112571.0, "step": 33770 }, { "entropy": 6.308120059967041, "epoch": 3.614265075712986, "grad_norm": 1.1328125, "learning_rate": 0.0003742759954344323, "loss": 5.8208, "mean_token_accuracy": 0.16848097890615463, "num_tokens": 73122816.0, "step": 33775 }, { "entropy": 6.3646293640136715, "epoch": 3.6148001498207503, "grad_norm": 1.0078125, "learning_rate": 0.00037424168354897094, "loss": 5.999, "mean_token_accuracy": 0.15359702557325364, "num_tokens": 73134947.0, "step": 33780 }, { "entropy": 6.330209255218506, "epoch": 3.615335223928514, "grad_norm": 1.1015625, "learning_rate": 0.0003742073687979199, "loss": 5.8893, "mean_token_accuracy": 0.15802356451749802, "num_tokens": 73146237.0, "step": 33785 }, { "entropy": 6.332577657699585, "epoch": 3.615870298036278, "grad_norm": 0.9765625, "learning_rate": 0.00037417305118227006, "loss": 5.8248, "mean_token_accuracy": 0.16278859674930574, "num_tokens": 73157105.0, "step": 33790 }, { "entropy": 6.317631959915161, "epoch": 3.616405372144042, "grad_norm": 1.0078125, "learning_rate": 0.00037413873070301225, "loss": 5.8476, "mean_token_accuracy": 0.1643761083483696, "num_tokens": 73168381.0, "step": 33795 }, { "entropy": 6.26618390083313, "epoch": 3.6169404462518058, "grad_norm": 1.0546875, "learning_rate": 0.00037410440736113755, "loss": 5.8214, "mean_token_accuracy": 0.16245676577091217, "num_tokens": 73178485.0, "step": 33800 }, { "entropy": 6.236337900161743, "epoch": 3.61747552035957, "grad_norm": 1.046875, "learning_rate": 0.00037407008115763704, "loss": 5.8227, "mean_token_accuracy": 0.17278190702199936, "num_tokens": 73190690.0, "step": 33805 }, { "entropy": 6.327301120758056, "epoch": 3.618010594467334, "grad_norm": 0.9765625, "learning_rate": 0.0003740357520935018, "loss": 5.8732, "mean_token_accuracy": 0.1601618468761444, "num_tokens": 73201186.0, "step": 33810 }, { "entropy": 6.257332372665405, "epoch": 3.6185456685750976, "grad_norm": 1.0234375, "learning_rate": 0.0003740014201697232, "loss": 5.8571, "mean_token_accuracy": 0.1705920875072479, "num_tokens": 73213196.0, "step": 33815 }, { "entropy": 6.177969169616699, "epoch": 3.6190807426828617, "grad_norm": 1.0546875, "learning_rate": 0.0003739670853872924, "loss": 5.7799, "mean_token_accuracy": 0.17734836637973786, "num_tokens": 73224239.0, "step": 33820 }, { "entropy": 6.277150630950928, "epoch": 3.6196158167906254, "grad_norm": 1.0703125, "learning_rate": 0.0003739327477472009, "loss": 5.8633, "mean_token_accuracy": 0.15915914624929428, "num_tokens": 73236076.0, "step": 33825 }, { "entropy": 6.306683015823364, "epoch": 3.6201508908983895, "grad_norm": 1.0703125, "learning_rate": 0.0003738984072504404, "loss": 5.9163, "mean_token_accuracy": 0.16169165819883347, "num_tokens": 73246085.0, "step": 33830 }, { "entropy": 6.386234188079834, "epoch": 3.620685965006153, "grad_norm": 1.0390625, "learning_rate": 0.00037386406389800213, "loss": 5.894, "mean_token_accuracy": 0.16774669140577317, "num_tokens": 73256715.0, "step": 33835 }, { "entropy": 6.289839029312134, "epoch": 3.6212210391139172, "grad_norm": 1.0546875, "learning_rate": 0.0003738297176908779, "loss": 5.8541, "mean_token_accuracy": 0.17000709772109984, "num_tokens": 73267373.0, "step": 33840 }, { "entropy": 6.278871393203735, "epoch": 3.6217561132216813, "grad_norm": 1.0234375, "learning_rate": 0.00037379536863005965, "loss": 5.9001, "mean_token_accuracy": 0.16353202909231185, "num_tokens": 73278602.0, "step": 33845 }, { "entropy": 6.377517127990723, "epoch": 3.622291187329445, "grad_norm": 1.0, "learning_rate": 0.0003737610167165388, "loss": 5.8911, "mean_token_accuracy": 0.15787452310323716, "num_tokens": 73289535.0, "step": 33850 }, { "entropy": 6.295400953292846, "epoch": 3.622826261437209, "grad_norm": 1.078125, "learning_rate": 0.0003737266619513076, "loss": 5.8186, "mean_token_accuracy": 0.16900595277547836, "num_tokens": 73299621.0, "step": 33855 }, { "entropy": 6.301197910308838, "epoch": 3.623361335544973, "grad_norm": 1.0625, "learning_rate": 0.00037369230433535787, "loss": 5.9069, "mean_token_accuracy": 0.16431365460157393, "num_tokens": 73312060.0, "step": 33860 }, { "entropy": 6.317032766342163, "epoch": 3.623896409652737, "grad_norm": 1.046875, "learning_rate": 0.00037365794386968164, "loss": 5.8553, "mean_token_accuracy": 0.16412767618894578, "num_tokens": 73322478.0, "step": 33865 }, { "entropy": 6.335569858551025, "epoch": 3.624431483760501, "grad_norm": 1.0625, "learning_rate": 0.0003736235805552713, "loss": 5.8917, "mean_token_accuracy": 0.16322845071554185, "num_tokens": 73332424.0, "step": 33870 }, { "entropy": 6.312547492980957, "epoch": 3.6249665578682646, "grad_norm": 1.0625, "learning_rate": 0.00037358921439311884, "loss": 5.8667, "mean_token_accuracy": 0.1606592357158661, "num_tokens": 73344096.0, "step": 33875 }, { "entropy": 6.3592485904693605, "epoch": 3.6255016319760287, "grad_norm": 1.0859375, "learning_rate": 0.00037355484538421663, "loss": 5.8868, "mean_token_accuracy": 0.16532430648803711, "num_tokens": 73354558.0, "step": 33880 }, { "entropy": 6.330284547805786, "epoch": 3.6260367060837924, "grad_norm": 0.98828125, "learning_rate": 0.00037352047352955716, "loss": 5.8828, "mean_token_accuracy": 0.169416444003582, "num_tokens": 73366077.0, "step": 33885 }, { "entropy": 6.290639591217041, "epoch": 3.6265717801915565, "grad_norm": 1.1171875, "learning_rate": 0.00037348609883013285, "loss": 5.8249, "mean_token_accuracy": 0.16531923711299895, "num_tokens": 73376862.0, "step": 33890 }, { "entropy": 6.309758710861206, "epoch": 3.6271068542993206, "grad_norm": 0.9921875, "learning_rate": 0.0003734517212869363, "loss": 5.8806, "mean_token_accuracy": 0.16667633056640624, "num_tokens": 73388025.0, "step": 33895 }, { "entropy": 6.281341648101806, "epoch": 3.627641928407084, "grad_norm": 1.0078125, "learning_rate": 0.00037341734090096015, "loss": 5.7947, "mean_token_accuracy": 0.16127993166446686, "num_tokens": 73400363.0, "step": 33900 }, { "entropy": 6.344376087188721, "epoch": 3.6281770025148483, "grad_norm": 1.0390625, "learning_rate": 0.00037338295767319705, "loss": 5.8758, "mean_token_accuracy": 0.16153880953788757, "num_tokens": 73410679.0, "step": 33905 }, { "entropy": 6.337058782577515, "epoch": 3.6287120766226124, "grad_norm": 1.0078125, "learning_rate": 0.0003733485716046399, "loss": 5.8375, "mean_token_accuracy": 0.17425446808338166, "num_tokens": 73422079.0, "step": 33910 }, { "entropy": 6.285176610946655, "epoch": 3.629247150730376, "grad_norm": 1.0390625, "learning_rate": 0.0003733141826962815, "loss": 5.8707, "mean_token_accuracy": 0.16660492718219758, "num_tokens": 73432625.0, "step": 33915 }, { "entropy": 6.2838037490844725, "epoch": 3.62978222483814, "grad_norm": 1.03125, "learning_rate": 0.000373279790949115, "loss": 5.8022, "mean_token_accuracy": 0.16180456727743148, "num_tokens": 73443146.0, "step": 33920 }, { "entropy": 6.309251976013184, "epoch": 3.6303172989459043, "grad_norm": 1.0390625, "learning_rate": 0.0003732453963641332, "loss": 5.9178, "mean_token_accuracy": 0.1577128291130066, "num_tokens": 73453976.0, "step": 33925 }, { "entropy": 6.313342523574829, "epoch": 3.630852373053668, "grad_norm": 0.92578125, "learning_rate": 0.0003732109989423296, "loss": 5.8876, "mean_token_accuracy": 0.16147829741239547, "num_tokens": 73465199.0, "step": 33930 }, { "entropy": 6.2745280265808105, "epoch": 3.6313874471614316, "grad_norm": 1.1015625, "learning_rate": 0.00037317659868469705, "loss": 5.8705, "mean_token_accuracy": 0.16903657466173172, "num_tokens": 73476322.0, "step": 33935 }, { "entropy": 6.359165048599243, "epoch": 3.6319225212691957, "grad_norm": 1.109375, "learning_rate": 0.000373142195592229, "loss": 5.8916, "mean_token_accuracy": 0.16188059747219086, "num_tokens": 73486816.0, "step": 33940 }, { "entropy": 6.354881429672242, "epoch": 3.63245759537696, "grad_norm": 1.1484375, "learning_rate": 0.00037310778966591894, "loss": 5.8277, "mean_token_accuracy": 0.16649941504001617, "num_tokens": 73497930.0, "step": 33945 }, { "entropy": 6.339445352554321, "epoch": 3.6329926694847234, "grad_norm": 1.0703125, "learning_rate": 0.0003730733809067602, "loss": 5.84, "mean_token_accuracy": 0.15864249616861342, "num_tokens": 73508420.0, "step": 33950 }, { "entropy": 6.258512735366821, "epoch": 3.6335277435924875, "grad_norm": 1.0, "learning_rate": 0.00037303896931574634, "loss": 5.8631, "mean_token_accuracy": 0.16290916055440902, "num_tokens": 73518959.0, "step": 33955 }, { "entropy": 6.34955244064331, "epoch": 3.6340628177002516, "grad_norm": 1.0234375, "learning_rate": 0.0003730045548938711, "loss": 5.8999, "mean_token_accuracy": 0.15611769556999205, "num_tokens": 73529797.0, "step": 33960 }, { "entropy": 6.255859136581421, "epoch": 3.6345978918080153, "grad_norm": 1.0234375, "learning_rate": 0.00037297013764212803, "loss": 5.7528, "mean_token_accuracy": 0.17351702153682708, "num_tokens": 73540113.0, "step": 33965 }, { "entropy": 6.334931087493897, "epoch": 3.6351329659157794, "grad_norm": 1.03125, "learning_rate": 0.0003729357175615109, "loss": 5.8896, "mean_token_accuracy": 0.16234145313501358, "num_tokens": 73551151.0, "step": 33970 }, { "entropy": 6.359974670410156, "epoch": 3.6356680400235435, "grad_norm": 1.0390625, "learning_rate": 0.0003729012946530139, "loss": 5.8746, "mean_token_accuracy": 0.1636806070804596, "num_tokens": 73562442.0, "step": 33975 }, { "entropy": 6.302138566970825, "epoch": 3.636203114131307, "grad_norm": 1.015625, "learning_rate": 0.00037286686891763063, "loss": 5.8904, "mean_token_accuracy": 0.1609639883041382, "num_tokens": 73572386.0, "step": 33980 }, { "entropy": 6.307532024383545, "epoch": 3.6367381882390712, "grad_norm": 1.0625, "learning_rate": 0.00037283244035635535, "loss": 5.9029, "mean_token_accuracy": 0.16378871873021125, "num_tokens": 73584186.0, "step": 33985 }, { "entropy": 6.320316314697266, "epoch": 3.637273262346835, "grad_norm": 1.1015625, "learning_rate": 0.0003727980089701821, "loss": 5.8701, "mean_token_accuracy": 0.16141928732395172, "num_tokens": 73593706.0, "step": 33990 }, { "entropy": 6.304377317428589, "epoch": 3.637808336454599, "grad_norm": 1.125, "learning_rate": 0.000372763574760105, "loss": 5.9479, "mean_token_accuracy": 0.1577381432056427, "num_tokens": 73603268.0, "step": 33995 }, { "entropy": 6.323380613327027, "epoch": 3.6383434105623627, "grad_norm": 1.046875, "learning_rate": 0.0003727291377271185, "loss": 5.8881, "mean_token_accuracy": 0.1624779596924782, "num_tokens": 73613404.0, "step": 34000 }, { "entropy": 6.331086921691894, "epoch": 3.6388784846701268, "grad_norm": 1.015625, "learning_rate": 0.00037269469787221685, "loss": 5.9398, "mean_token_accuracy": 0.15521284490823745, "num_tokens": 73625083.0, "step": 34005 }, { "entropy": 6.3459430694580075, "epoch": 3.639413558777891, "grad_norm": 0.9765625, "learning_rate": 0.00037266025519639453, "loss": 5.8427, "mean_token_accuracy": 0.16366252452135086, "num_tokens": 73635161.0, "step": 34010 }, { "entropy": 6.368336725234985, "epoch": 3.6399486328856545, "grad_norm": 1.09375, "learning_rate": 0.000372625809700646, "loss": 5.9484, "mean_token_accuracy": 0.15813147127628327, "num_tokens": 73646033.0, "step": 34015 }, { "entropy": 6.293690776824951, "epoch": 3.6404837069934186, "grad_norm": 1.03125, "learning_rate": 0.000372591361385966, "loss": 5.8753, "mean_token_accuracy": 0.1635085254907608, "num_tokens": 73656528.0, "step": 34020 }, { "entropy": 6.363722658157348, "epoch": 3.6410187811011827, "grad_norm": 1.0078125, "learning_rate": 0.00037255691025334917, "loss": 5.9138, "mean_token_accuracy": 0.15826682150363922, "num_tokens": 73667838.0, "step": 34025 }, { "entropy": 6.245601511001587, "epoch": 3.6415538552089464, "grad_norm": 0.953125, "learning_rate": 0.0003725224563037903, "loss": 5.8244, "mean_token_accuracy": 0.1711862489581108, "num_tokens": 73677931.0, "step": 34030 }, { "entropy": 6.339200973510742, "epoch": 3.6420889293167105, "grad_norm": 1.0703125, "learning_rate": 0.00037248799953828413, "loss": 5.8697, "mean_token_accuracy": 0.16227660179138184, "num_tokens": 73689418.0, "step": 34035 }, { "entropy": 6.294109344482422, "epoch": 3.6426240034244746, "grad_norm": 1.0625, "learning_rate": 0.0003724535399578257, "loss": 5.8768, "mean_token_accuracy": 0.1553877741098404, "num_tokens": 73700751.0, "step": 34040 }, { "entropy": 6.304833030700683, "epoch": 3.643159077532238, "grad_norm": 1.03125, "learning_rate": 0.00037241907756341, "loss": 5.9045, "mean_token_accuracy": 0.16209035664796828, "num_tokens": 73711024.0, "step": 34045 }, { "entropy": 6.335999441146851, "epoch": 3.643694151640002, "grad_norm": 1.0703125, "learning_rate": 0.0003723846123560321, "loss": 5.956, "mean_token_accuracy": 0.1535182535648346, "num_tokens": 73721985.0, "step": 34050 }, { "entropy": 6.40370512008667, "epoch": 3.644229225747766, "grad_norm": 1.0703125, "learning_rate": 0.00037235014433668716, "loss": 5.9117, "mean_token_accuracy": 0.15805475413799286, "num_tokens": 73731902.0, "step": 34055 }, { "entropy": 6.3120194435119625, "epoch": 3.64476429985553, "grad_norm": 1.0625, "learning_rate": 0.00037231567350637064, "loss": 5.8804, "mean_token_accuracy": 0.1629341185092926, "num_tokens": 73742714.0, "step": 34060 }, { "entropy": 6.269410085678101, "epoch": 3.6452993739632937, "grad_norm": 1.1953125, "learning_rate": 0.0003722811998660776, "loss": 5.792, "mean_token_accuracy": 0.1707346796989441, "num_tokens": 73753515.0, "step": 34065 }, { "entropy": 6.297771883010864, "epoch": 3.645834448071058, "grad_norm": 1.0625, "learning_rate": 0.0003722467234168035, "loss": 5.8187, "mean_token_accuracy": 0.16770180314779282, "num_tokens": 73762849.0, "step": 34070 }, { "entropy": 6.351811075210572, "epoch": 3.646369522178822, "grad_norm": 1.1328125, "learning_rate": 0.0003722122441595441, "loss": 5.8455, "mean_token_accuracy": 0.16868671625852585, "num_tokens": 73772395.0, "step": 34075 }, { "entropy": 6.338011932373047, "epoch": 3.6469045962865856, "grad_norm": 1.0703125, "learning_rate": 0.0003721777620952948, "loss": 5.9366, "mean_token_accuracy": 0.16002675592899324, "num_tokens": 73783479.0, "step": 34080 }, { "entropy": 6.431539392471313, "epoch": 3.6474396703943497, "grad_norm": 1.0390625, "learning_rate": 0.0003721432772250512, "loss": 6.0351, "mean_token_accuracy": 0.1539298638701439, "num_tokens": 73794880.0, "step": 34085 }, { "entropy": 6.237025260925293, "epoch": 3.647974744502114, "grad_norm": 1.078125, "learning_rate": 0.00037210878954980917, "loss": 5.7751, "mean_token_accuracy": 0.17228213995695113, "num_tokens": 73806718.0, "step": 34090 }, { "entropy": 6.319400119781494, "epoch": 3.6485098186098774, "grad_norm": 1.0390625, "learning_rate": 0.0003720742990705645, "loss": 5.7938, "mean_token_accuracy": 0.1661811351776123, "num_tokens": 73816566.0, "step": 34095 }, { "entropy": 6.331762027740479, "epoch": 3.6490448927176415, "grad_norm": 1.109375, "learning_rate": 0.000372039805788313, "loss": 5.9199, "mean_token_accuracy": 0.15625611543655396, "num_tokens": 73827822.0, "step": 34100 }, { "entropy": 6.353215217590332, "epoch": 3.649579966825405, "grad_norm": 1.140625, "learning_rate": 0.00037200530970405083, "loss": 5.886, "mean_token_accuracy": 0.16049464344978331, "num_tokens": 73838753.0, "step": 34105 }, { "entropy": 6.240536737442016, "epoch": 3.6501150409331693, "grad_norm": 0.99609375, "learning_rate": 0.00037197081081877394, "loss": 5.7665, "mean_token_accuracy": 0.17169702500104905, "num_tokens": 73849847.0, "step": 34110 }, { "entropy": 6.317702054977417, "epoch": 3.650650115040933, "grad_norm": 0.99609375, "learning_rate": 0.00037193630913347843, "loss": 5.8355, "mean_token_accuracy": 0.16989925652742385, "num_tokens": 73861311.0, "step": 34115 }, { "entropy": 6.3534314155578615, "epoch": 3.651185189148697, "grad_norm": 1.109375, "learning_rate": 0.00037190180464916067, "loss": 5.9029, "mean_token_accuracy": 0.16300307661294938, "num_tokens": 73871108.0, "step": 34120 }, { "entropy": 6.2555633068084715, "epoch": 3.651720263256461, "grad_norm": 1.0703125, "learning_rate": 0.00037186729736681694, "loss": 5.8151, "mean_token_accuracy": 0.17111991196870804, "num_tokens": 73881700.0, "step": 34125 }, { "entropy": 6.313755941390991, "epoch": 3.652255337364225, "grad_norm": 1.0703125, "learning_rate": 0.0003718327872874436, "loss": 5.8304, "mean_token_accuracy": 0.1666287213563919, "num_tokens": 73893526.0, "step": 34130 }, { "entropy": 6.299549579620361, "epoch": 3.652790411471989, "grad_norm": 0.96875, "learning_rate": 0.00037179827441203715, "loss": 5.9447, "mean_token_accuracy": 0.15750505924224853, "num_tokens": 73904845.0, "step": 34135 }, { "entropy": 6.259123468399048, "epoch": 3.653325485579753, "grad_norm": 1.09375, "learning_rate": 0.00037176375874159413, "loss": 5.7948, "mean_token_accuracy": 0.17135713547468184, "num_tokens": 73915161.0, "step": 34140 }, { "entropy": 6.2540076732635494, "epoch": 3.6538605596875167, "grad_norm": 1.0390625, "learning_rate": 0.00037172924027711115, "loss": 5.8673, "mean_token_accuracy": 0.1636692017316818, "num_tokens": 73926504.0, "step": 34145 }, { "entropy": 6.31049599647522, "epoch": 3.6543956337952808, "grad_norm": 1.0390625, "learning_rate": 0.000371694719019585, "loss": 5.9099, "mean_token_accuracy": 0.16140279471874236, "num_tokens": 73937907.0, "step": 34150 }, { "entropy": 6.338151264190674, "epoch": 3.6549307079030444, "grad_norm": 0.97265625, "learning_rate": 0.0003716601949700124, "loss": 5.8382, "mean_token_accuracy": 0.16309933215379716, "num_tokens": 73947948.0, "step": 34155 }, { "entropy": 6.28208327293396, "epoch": 3.6554657820108085, "grad_norm": 1.0546875, "learning_rate": 0.00037162566812939024, "loss": 5.8174, "mean_token_accuracy": 0.1642332926392555, "num_tokens": 73961348.0, "step": 34160 }, { "entropy": 6.321191453933716, "epoch": 3.656000856118572, "grad_norm": 1.0234375, "learning_rate": 0.00037159113849871553, "loss": 5.8354, "mean_token_accuracy": 0.16450995057821274, "num_tokens": 73971848.0, "step": 34165 }, { "entropy": 6.298782300949097, "epoch": 3.6565359302263363, "grad_norm": 1.03125, "learning_rate": 0.00037155660607898517, "loss": 5.8557, "mean_token_accuracy": 0.16416125446558, "num_tokens": 73982277.0, "step": 34170 }, { "entropy": 6.29915189743042, "epoch": 3.6570710043341004, "grad_norm": 0.98828125, "learning_rate": 0.00037152207087119644, "loss": 5.9019, "mean_token_accuracy": 0.1652273029088974, "num_tokens": 73993265.0, "step": 34175 }, { "entropy": 6.349354028701782, "epoch": 3.657606078441864, "grad_norm": 1.0390625, "learning_rate": 0.0003714875328763465, "loss": 5.9508, "mean_token_accuracy": 0.1550610400736332, "num_tokens": 74004169.0, "step": 34180 }, { "entropy": 6.26728196144104, "epoch": 3.658141152549628, "grad_norm": 1.0546875, "learning_rate": 0.0003714529920954326, "loss": 5.8001, "mean_token_accuracy": 0.16892887502908707, "num_tokens": 74014284.0, "step": 34185 }, { "entropy": 6.315867900848389, "epoch": 3.6586762266573922, "grad_norm": 1.0390625, "learning_rate": 0.0003714184485294521, "loss": 5.843, "mean_token_accuracy": 0.1590195268392563, "num_tokens": 74025209.0, "step": 34190 }, { "entropy": 6.364714956283569, "epoch": 3.659211300765156, "grad_norm": 1.0859375, "learning_rate": 0.00037138390217940245, "loss": 5.8737, "mean_token_accuracy": 0.15671335756778718, "num_tokens": 74035534.0, "step": 34195 }, { "entropy": 6.284268140792847, "epoch": 3.65974637487292, "grad_norm": 0.99609375, "learning_rate": 0.0003713493530462811, "loss": 5.8532, "mean_token_accuracy": 0.17201230973005294, "num_tokens": 74046644.0, "step": 34200 }, { "entropy": 6.3318626403808596, "epoch": 3.660281448980684, "grad_norm": 1.0625, "learning_rate": 0.00037131480113108576, "loss": 5.9396, "mean_token_accuracy": 0.15582430809736253, "num_tokens": 74057362.0, "step": 34205 }, { "entropy": 6.2691246509552006, "epoch": 3.6608165230884477, "grad_norm": 1.0390625, "learning_rate": 0.0003712802464348141, "loss": 5.8178, "mean_token_accuracy": 0.16592249870300294, "num_tokens": 74068382.0, "step": 34210 }, { "entropy": 6.364492511749267, "epoch": 3.661351597196212, "grad_norm": 1.0859375, "learning_rate": 0.0003712456889584638, "loss": 5.9884, "mean_token_accuracy": 0.159273225069046, "num_tokens": 74079846.0, "step": 34215 }, { "entropy": 6.401228046417236, "epoch": 3.6618866713039755, "grad_norm": 0.984375, "learning_rate": 0.00037121112870303286, "loss": 5.9546, "mean_token_accuracy": 0.1539131984114647, "num_tokens": 74091022.0, "step": 34220 }, { "entropy": 6.344389915466309, "epoch": 3.6624217454117396, "grad_norm": 1.0703125, "learning_rate": 0.00037117656566951906, "loss": 5.9021, "mean_token_accuracy": 0.15877429395914078, "num_tokens": 74101774.0, "step": 34225 }, { "entropy": 6.3053899765014645, "epoch": 3.6629568195195032, "grad_norm": 1.0234375, "learning_rate": 0.00037114199985892034, "loss": 5.9025, "mean_token_accuracy": 0.15857402980327606, "num_tokens": 74112688.0, "step": 34230 }, { "entropy": 6.321385431289673, "epoch": 3.6634918936272673, "grad_norm": 0.98046875, "learning_rate": 0.00037110743127223507, "loss": 5.9151, "mean_token_accuracy": 0.16120167970657348, "num_tokens": 74123224.0, "step": 34235 }, { "entropy": 6.347961854934693, "epoch": 3.6640269677350314, "grad_norm": 0.9921875, "learning_rate": 0.0003710728599104611, "loss": 5.8559, "mean_token_accuracy": 0.16326914131641387, "num_tokens": 74133438.0, "step": 34240 }, { "entropy": 6.282892894744873, "epoch": 3.664562041842795, "grad_norm": 1.0, "learning_rate": 0.00037103828577459677, "loss": 5.8055, "mean_token_accuracy": 0.16518909484148026, "num_tokens": 74144670.0, "step": 34245 }, { "entropy": 6.264687395095825, "epoch": 3.665097115950559, "grad_norm": 1.1796875, "learning_rate": 0.0003710037088656405, "loss": 5.9, "mean_token_accuracy": 0.15802589058876038, "num_tokens": 74154725.0, "step": 34250 }, { "entropy": 6.2260641098022464, "epoch": 3.6656321900583233, "grad_norm": 1.0625, "learning_rate": 0.0003709691291845906, "loss": 5.8322, "mean_token_accuracy": 0.16472756415605544, "num_tokens": 74164949.0, "step": 34255 }, { "entropy": 6.281618356704712, "epoch": 3.666167264166087, "grad_norm": 0.9921875, "learning_rate": 0.00037093454673244557, "loss": 5.8691, "mean_token_accuracy": 0.16361724957823753, "num_tokens": 74176329.0, "step": 34260 }, { "entropy": 6.272856044769287, "epoch": 3.666702338273851, "grad_norm": 1.09375, "learning_rate": 0.000370899961510204, "loss": 5.7104, "mean_token_accuracy": 0.17780465632677078, "num_tokens": 74187320.0, "step": 34265 }, { "entropy": 6.280084085464478, "epoch": 3.6672374123816147, "grad_norm": 1.0390625, "learning_rate": 0.00037086537351886455, "loss": 5.8622, "mean_token_accuracy": 0.16217377185821533, "num_tokens": 74199012.0, "step": 34270 }, { "entropy": 6.314757299423218, "epoch": 3.667772486489379, "grad_norm": 1.15625, "learning_rate": 0.0003708307827594259, "loss": 5.9225, "mean_token_accuracy": 0.15940653532743454, "num_tokens": 74208985.0, "step": 34275 }, { "entropy": 6.292274141311646, "epoch": 3.6683075605971425, "grad_norm": 0.99609375, "learning_rate": 0.0003707961892328868, "loss": 5.8539, "mean_token_accuracy": 0.1649633005261421, "num_tokens": 74219857.0, "step": 34280 }, { "entropy": 6.226207828521728, "epoch": 3.6688426347049066, "grad_norm": 1.0625, "learning_rate": 0.00037076159294024627, "loss": 5.8168, "mean_token_accuracy": 0.16207949072122574, "num_tokens": 74230859.0, "step": 34285 }, { "entropy": 6.2409337043762205, "epoch": 3.6693777088126707, "grad_norm": 1.0859375, "learning_rate": 0.0003707269938825032, "loss": 5.7528, "mean_token_accuracy": 0.17265232801437377, "num_tokens": 74240996.0, "step": 34290 }, { "entropy": 6.348441934585571, "epoch": 3.6699127829204343, "grad_norm": 1.0078125, "learning_rate": 0.0003706923920606565, "loss": 5.9465, "mean_token_accuracy": 0.15911784172058105, "num_tokens": 74251524.0, "step": 34295 }, { "entropy": 6.399848365783692, "epoch": 3.6704478570281984, "grad_norm": 1.0546875, "learning_rate": 0.0003706577874757056, "loss": 5.8983, "mean_token_accuracy": 0.16071296781301497, "num_tokens": 74261798.0, "step": 34300 }, { "entropy": 6.235728788375854, "epoch": 3.6709829311359625, "grad_norm": 1.0703125, "learning_rate": 0.00037062318012864946, "loss": 5.8302, "mean_token_accuracy": 0.16458493918180467, "num_tokens": 74272132.0, "step": 34305 }, { "entropy": 6.297997856140137, "epoch": 3.671518005243726, "grad_norm": 1.0859375, "learning_rate": 0.00037058857002048745, "loss": 5.9367, "mean_token_accuracy": 0.1561678558588028, "num_tokens": 74282978.0, "step": 34310 }, { "entropy": 6.341502237319946, "epoch": 3.6720530793514903, "grad_norm": 1.03125, "learning_rate": 0.0003705539571522189, "loss": 5.8464, "mean_token_accuracy": 0.16535123586654663, "num_tokens": 74293978.0, "step": 34315 }, { "entropy": 6.296046400070191, "epoch": 3.6725881534592544, "grad_norm": 1.0859375, "learning_rate": 0.0003705193415248432, "loss": 5.8193, "mean_token_accuracy": 0.16576284915208817, "num_tokens": 74305008.0, "step": 34320 }, { "entropy": 6.338087558746338, "epoch": 3.673123227567018, "grad_norm": 0.98828125, "learning_rate": 0.00037048472313936005, "loss": 5.9358, "mean_token_accuracy": 0.15723528414964677, "num_tokens": 74316946.0, "step": 34325 }, { "entropy": 6.36484546661377, "epoch": 3.6736583016747817, "grad_norm": 0.984375, "learning_rate": 0.00037045010199676887, "loss": 5.9385, "mean_token_accuracy": 0.15448769852519034, "num_tokens": 74329330.0, "step": 34330 }, { "entropy": 6.331888103485108, "epoch": 3.674193375782546, "grad_norm": 0.99609375, "learning_rate": 0.0003704154780980694, "loss": 5.8967, "mean_token_accuracy": 0.1516728088259697, "num_tokens": 74340672.0, "step": 34335 }, { "entropy": 6.349123144149781, "epoch": 3.67472844989031, "grad_norm": 1.015625, "learning_rate": 0.00037038085144426146, "loss": 5.9505, "mean_token_accuracy": 0.15996967405080795, "num_tokens": 74351722.0, "step": 34340 }, { "entropy": 6.321597480773926, "epoch": 3.6752635239980735, "grad_norm": 1.0390625, "learning_rate": 0.0003703462220363448, "loss": 5.957, "mean_token_accuracy": 0.15777651071548462, "num_tokens": 74363032.0, "step": 34345 }, { "entropy": 6.308067083358765, "epoch": 3.6757985981058376, "grad_norm": 1.125, "learning_rate": 0.0003703115898753194, "loss": 5.8036, "mean_token_accuracy": 0.17217739969491958, "num_tokens": 74374217.0, "step": 34350 }, { "entropy": 6.25393238067627, "epoch": 3.6763336722136017, "grad_norm": 1.0390625, "learning_rate": 0.00037027695496218523, "loss": 5.8184, "mean_token_accuracy": 0.16426462084054946, "num_tokens": 74385450.0, "step": 34355 }, { "entropy": 6.246833467483521, "epoch": 3.6768687463213654, "grad_norm": 1.109375, "learning_rate": 0.00037024231729794227, "loss": 5.8173, "mean_token_accuracy": 0.1662520408630371, "num_tokens": 74396733.0, "step": 34360 }, { "entropy": 6.2930621147155765, "epoch": 3.6774038204291295, "grad_norm": 0.984375, "learning_rate": 0.0003702076768835909, "loss": 5.8308, "mean_token_accuracy": 0.16634928584098815, "num_tokens": 74407243.0, "step": 34365 }, { "entropy": 6.37715106010437, "epoch": 3.6779388945368936, "grad_norm": 1.0546875, "learning_rate": 0.00037017303372013124, "loss": 5.9249, "mean_token_accuracy": 0.1649870455265045, "num_tokens": 74418136.0, "step": 34370 }, { "entropy": 6.332508373260498, "epoch": 3.6784739686446573, "grad_norm": 1.03125, "learning_rate": 0.00037013838780856353, "loss": 5.8982, "mean_token_accuracy": 0.1623343423008919, "num_tokens": 74428553.0, "step": 34375 }, { "entropy": 6.281121492385864, "epoch": 3.6790090427524214, "grad_norm": 0.9609375, "learning_rate": 0.00037010373914988826, "loss": 5.8271, "mean_token_accuracy": 0.16810946315526962, "num_tokens": 74439276.0, "step": 34380 }, { "entropy": 6.284564781188965, "epoch": 3.679544116860185, "grad_norm": 1.078125, "learning_rate": 0.000370069087745106, "loss": 5.8938, "mean_token_accuracy": 0.1671067714691162, "num_tokens": 74450035.0, "step": 34385 }, { "entropy": 6.315889883041382, "epoch": 3.680079190967949, "grad_norm": 1.0078125, "learning_rate": 0.00037003443359521706, "loss": 5.8561, "mean_token_accuracy": 0.16323519349098206, "num_tokens": 74461187.0, "step": 34390 }, { "entropy": 6.31102442741394, "epoch": 3.6806142650757128, "grad_norm": 1.0703125, "learning_rate": 0.00036999977670122225, "loss": 5.8483, "mean_token_accuracy": 0.16658948361873627, "num_tokens": 74472773.0, "step": 34395 }, { "entropy": 6.271244955062866, "epoch": 3.681149339183477, "grad_norm": 1.125, "learning_rate": 0.0003699651170641222, "loss": 5.8, "mean_token_accuracy": 0.1708357647061348, "num_tokens": 74482639.0, "step": 34400 }, { "entropy": 6.27104926109314, "epoch": 3.681684413291241, "grad_norm": 1.046875, "learning_rate": 0.0003699304546849178, "loss": 5.8506, "mean_token_accuracy": 0.16220299750566483, "num_tokens": 74493768.0, "step": 34405 }, { "entropy": 6.2438489437103275, "epoch": 3.6822194873990046, "grad_norm": 1.0234375, "learning_rate": 0.00036989578956460984, "loss": 5.8299, "mean_token_accuracy": 0.17176394760608674, "num_tokens": 74504247.0, "step": 34410 }, { "entropy": 6.293617105484008, "epoch": 3.6827545615067687, "grad_norm": 1.296875, "learning_rate": 0.0003698611217041993, "loss": 5.8974, "mean_token_accuracy": 0.16543667316436766, "num_tokens": 74514486.0, "step": 34415 }, { "entropy": 6.236654567718506, "epoch": 3.683289635614533, "grad_norm": 1.0625, "learning_rate": 0.00036982645110468715, "loss": 5.821, "mean_token_accuracy": 0.16492801457643508, "num_tokens": 74524735.0, "step": 34420 }, { "entropy": 6.31121187210083, "epoch": 3.6838247097222965, "grad_norm": 1.09375, "learning_rate": 0.00036979177776707455, "loss": 5.8417, "mean_token_accuracy": 0.16876189559698104, "num_tokens": 74534807.0, "step": 34425 }, { "entropy": 6.2548853874206545, "epoch": 3.6843597838300606, "grad_norm": 1.015625, "learning_rate": 0.0003697571016923628, "loss": 5.8256, "mean_token_accuracy": 0.16664031594991685, "num_tokens": 74546306.0, "step": 34430 }, { "entropy": 6.288357925415039, "epoch": 3.6848948579378242, "grad_norm": 0.94140625, "learning_rate": 0.00036972242288155297, "loss": 5.8995, "mean_token_accuracy": 0.16425046175718308, "num_tokens": 74558525.0, "step": 34435 }, { "entropy": 6.322803544998169, "epoch": 3.6854299320455883, "grad_norm": 1.0078125, "learning_rate": 0.00036968774133564646, "loss": 5.9212, "mean_token_accuracy": 0.15794667601585388, "num_tokens": 74569842.0, "step": 34440 }, { "entropy": 6.317024850845337, "epoch": 3.685965006153352, "grad_norm": 0.99609375, "learning_rate": 0.0003696530570556448, "loss": 5.8978, "mean_token_accuracy": 0.15848851650953294, "num_tokens": 74581016.0, "step": 34445 }, { "entropy": 6.31795072555542, "epoch": 3.686500080261116, "grad_norm": 1.0625, "learning_rate": 0.0003696183700425494, "loss": 5.8781, "mean_token_accuracy": 0.158980393409729, "num_tokens": 74591798.0, "step": 34450 }, { "entropy": 6.293281173706054, "epoch": 3.68703515436888, "grad_norm": 0.9765625, "learning_rate": 0.0003695836802973618, "loss": 5.896, "mean_token_accuracy": 0.16030033379793168, "num_tokens": 74602351.0, "step": 34455 }, { "entropy": 6.296269369125366, "epoch": 3.687570228476644, "grad_norm": 1.0390625, "learning_rate": 0.00036954898782108375, "loss": 5.8612, "mean_token_accuracy": 0.1676389217376709, "num_tokens": 74612319.0, "step": 34460 }, { "entropy": 6.333703517913818, "epoch": 3.688105302584408, "grad_norm": 1.171875, "learning_rate": 0.00036951429261471695, "loss": 5.8094, "mean_token_accuracy": 0.16775441765785218, "num_tokens": 74622268.0, "step": 34465 }, { "entropy": 6.242875289916992, "epoch": 3.688640376692172, "grad_norm": 1.0703125, "learning_rate": 0.0003694795946792633, "loss": 5.8505, "mean_token_accuracy": 0.1674893394112587, "num_tokens": 74633261.0, "step": 34470 }, { "entropy": 6.1644392013549805, "epoch": 3.6891754507999357, "grad_norm": 1.0234375, "learning_rate": 0.00036944489401572454, "loss": 5.6868, "mean_token_accuracy": 0.18911835849285125, "num_tokens": 74643493.0, "step": 34475 }, { "entropy": 6.2617034912109375, "epoch": 3.6897105249077, "grad_norm": 1.0703125, "learning_rate": 0.0003694101906251028, "loss": 5.8419, "mean_token_accuracy": 0.15876721143722533, "num_tokens": 74653900.0, "step": 34480 }, { "entropy": 6.322824239730835, "epoch": 3.690245599015464, "grad_norm": 1.078125, "learning_rate": 0.0003693754845084001, "loss": 5.8552, "mean_token_accuracy": 0.16719542890787126, "num_tokens": 74664203.0, "step": 34485 }, { "entropy": 6.322741460800171, "epoch": 3.6907806731232276, "grad_norm": 0.99609375, "learning_rate": 0.0003693407756666185, "loss": 5.7984, "mean_token_accuracy": 0.16539121717214583, "num_tokens": 74674269.0, "step": 34490 }, { "entropy": 6.291463041305542, "epoch": 3.6913157472309917, "grad_norm": 1.1171875, "learning_rate": 0.00036930606410076025, "loss": 5.8671, "mean_token_accuracy": 0.15592025071382523, "num_tokens": 74684205.0, "step": 34495 }, { "entropy": 6.274758386611938, "epoch": 3.6918508213387553, "grad_norm": 1.0078125, "learning_rate": 0.0003692713498118276, "loss": 5.8241, "mean_token_accuracy": 0.16299035102128984, "num_tokens": 74695102.0, "step": 34500 }, { "entropy": 6.318067598342895, "epoch": 3.6923858954465194, "grad_norm": 1.1328125, "learning_rate": 0.000369236632800823, "loss": 5.8701, "mean_token_accuracy": 0.1642357274889946, "num_tokens": 74705795.0, "step": 34505 }, { "entropy": 6.278392744064331, "epoch": 3.692920969554283, "grad_norm": 1.1015625, "learning_rate": 0.00036920191306874896, "loss": 5.8664, "mean_token_accuracy": 0.16748203039169313, "num_tokens": 74716846.0, "step": 34510 }, { "entropy": 6.322901582717895, "epoch": 3.693456043662047, "grad_norm": 1.09375, "learning_rate": 0.0003691671906166079, "loss": 5.8819, "mean_token_accuracy": 0.16471364498138427, "num_tokens": 74726555.0, "step": 34515 }, { "entropy": 6.2918647766113285, "epoch": 3.6939911177698113, "grad_norm": 1.0, "learning_rate": 0.00036913246544540237, "loss": 5.8358, "mean_token_accuracy": 0.16606604307889938, "num_tokens": 74738090.0, "step": 34520 }, { "entropy": 6.304378318786621, "epoch": 3.694526191877575, "grad_norm": 1.03125, "learning_rate": 0.0003690977375561352, "loss": 5.8633, "mean_token_accuracy": 0.16613872200250626, "num_tokens": 74749534.0, "step": 34525 }, { "entropy": 6.287808561325074, "epoch": 3.695061265985339, "grad_norm": 1.0625, "learning_rate": 0.00036906300694980904, "loss": 5.9305, "mean_token_accuracy": 0.15472687780857086, "num_tokens": 74760867.0, "step": 34530 }, { "entropy": 6.330497932434082, "epoch": 3.695596340093103, "grad_norm": 1.265625, "learning_rate": 0.0003690282736274267, "loss": 5.8527, "mean_token_accuracy": 0.16153080761432648, "num_tokens": 74771667.0, "step": 34535 }, { "entropy": 6.287780141830444, "epoch": 3.6961314142008668, "grad_norm": 1.0078125, "learning_rate": 0.00036899353758999126, "loss": 5.7973, "mean_token_accuracy": 0.16311750411987305, "num_tokens": 74782590.0, "step": 34540 }, { "entropy": 6.330756902694702, "epoch": 3.696666488308631, "grad_norm": 1.0859375, "learning_rate": 0.0003689587988385057, "loss": 5.9234, "mean_token_accuracy": 0.1622853547334671, "num_tokens": 74793616.0, "step": 34545 }, { "entropy": 6.273142862319946, "epoch": 3.6972015624163945, "grad_norm": 1.0234375, "learning_rate": 0.0003689240573739729, "loss": 5.8695, "mean_token_accuracy": 0.1621156871318817, "num_tokens": 74804307.0, "step": 34550 }, { "entropy": 6.223696041107178, "epoch": 3.6977366365241586, "grad_norm": 1.0546875, "learning_rate": 0.00036888931319739614, "loss": 5.8318, "mean_token_accuracy": 0.16719074845314025, "num_tokens": 74814692.0, "step": 34555 }, { "entropy": 6.341226720809937, "epoch": 3.6982717106319223, "grad_norm": 0.99609375, "learning_rate": 0.0003688545663097787, "loss": 5.8938, "mean_token_accuracy": 0.15756750404834746, "num_tokens": 74825268.0, "step": 34560 }, { "entropy": 6.24339280128479, "epoch": 3.6988067847396864, "grad_norm": 1.0546875, "learning_rate": 0.0003688198167121238, "loss": 5.8162, "mean_token_accuracy": 0.1731596291065216, "num_tokens": 74836475.0, "step": 34565 }, { "entropy": 6.28680682182312, "epoch": 3.6993418588474505, "grad_norm": 1.0234375, "learning_rate": 0.000368785064405435, "loss": 5.8357, "mean_token_accuracy": 0.16334630250930787, "num_tokens": 74846782.0, "step": 34570 }, { "entropy": 6.309583234786987, "epoch": 3.699876932955214, "grad_norm": 1.0703125, "learning_rate": 0.00036875030939071557, "loss": 5.9219, "mean_token_accuracy": 0.15875375121831894, "num_tokens": 74857477.0, "step": 34575 }, { "entropy": 6.279532718658447, "epoch": 3.7004120070629782, "grad_norm": 0.97265625, "learning_rate": 0.00036871555166896906, "loss": 5.8482, "mean_token_accuracy": 0.16922761052846907, "num_tokens": 74869016.0, "step": 34580 }, { "entropy": 6.34052472114563, "epoch": 3.7009470811707423, "grad_norm": 1.1484375, "learning_rate": 0.0003686807912411993, "loss": 5.8776, "mean_token_accuracy": 0.15992706567049025, "num_tokens": 74879101.0, "step": 34585 }, { "entropy": 6.322452878952026, "epoch": 3.701482155278506, "grad_norm": 1.03125, "learning_rate": 0.0003686460281084098, "loss": 5.9168, "mean_token_accuracy": 0.1627537801861763, "num_tokens": 74891039.0, "step": 34590 }, { "entropy": 6.25791220664978, "epoch": 3.70201722938627, "grad_norm": 1.15625, "learning_rate": 0.00036861126227160436, "loss": 5.7959, "mean_token_accuracy": 0.16589162200689317, "num_tokens": 74900587.0, "step": 34595 }, { "entropy": 6.270650053024292, "epoch": 3.702552303494034, "grad_norm": 0.99609375, "learning_rate": 0.00036857649373178686, "loss": 5.7967, "mean_token_accuracy": 0.16379250288009645, "num_tokens": 74911614.0, "step": 34600 }, { "entropy": 6.3412017822265625, "epoch": 3.703087377601798, "grad_norm": 1.0703125, "learning_rate": 0.00036854172248996137, "loss": 5.8951, "mean_token_accuracy": 0.16312401443719865, "num_tokens": 74922559.0, "step": 34605 }, { "entropy": 6.297819328308106, "epoch": 3.7036224517095615, "grad_norm": 1.0859375, "learning_rate": 0.0003685069485471316, "loss": 5.8721, "mean_token_accuracy": 0.16428972482681276, "num_tokens": 74932993.0, "step": 34610 }, { "entropy": 6.34723424911499, "epoch": 3.7041575258173256, "grad_norm": 0.984375, "learning_rate": 0.00036847217190430205, "loss": 5.8746, "mean_token_accuracy": 0.1652375876903534, "num_tokens": 74943196.0, "step": 34615 }, { "entropy": 6.399463272094726, "epoch": 3.7046925999250897, "grad_norm": 1.0078125, "learning_rate": 0.00036843739256247655, "loss": 5.9244, "mean_token_accuracy": 0.15866760313510894, "num_tokens": 74954069.0, "step": 34620 }, { "entropy": 6.271916246414184, "epoch": 3.7052276740328534, "grad_norm": 1.1015625, "learning_rate": 0.00036840261052265943, "loss": 5.8275, "mean_token_accuracy": 0.16286930292844773, "num_tokens": 74964864.0, "step": 34625 }, { "entropy": 6.322920417785644, "epoch": 3.7057627481406175, "grad_norm": 0.98828125, "learning_rate": 0.00036836782578585515, "loss": 5.9213, "mean_token_accuracy": 0.1573136940598488, "num_tokens": 74976534.0, "step": 34630 }, { "entropy": 6.287053871154785, "epoch": 3.7062978222483816, "grad_norm": 1.109375, "learning_rate": 0.000368333038353068, "loss": 5.8512, "mean_token_accuracy": 0.16708462536334992, "num_tokens": 74987109.0, "step": 34635 }, { "entropy": 6.22062668800354, "epoch": 3.706832896356145, "grad_norm": 0.9921875, "learning_rate": 0.00036829824822530243, "loss": 5.7703, "mean_token_accuracy": 0.16949376165866853, "num_tokens": 74998649.0, "step": 34640 }, { "entropy": 6.313731050491333, "epoch": 3.7073679704639093, "grad_norm": 1.03125, "learning_rate": 0.0003682634554035631, "loss": 5.9061, "mean_token_accuracy": 0.15550928711891174, "num_tokens": 75009836.0, "step": 34645 }, { "entropy": 6.294948387145996, "epoch": 3.7079030445716734, "grad_norm": 1.0234375, "learning_rate": 0.0003682286598888546, "loss": 5.8767, "mean_token_accuracy": 0.16903305053710938, "num_tokens": 75020544.0, "step": 34650 }, { "entropy": 6.339992952346802, "epoch": 3.708438118679437, "grad_norm": 0.95703125, "learning_rate": 0.00036819386168218156, "loss": 5.939, "mean_token_accuracy": 0.15528673082590103, "num_tokens": 75031491.0, "step": 34655 }, { "entropy": 6.3113322257995605, "epoch": 3.708973192787201, "grad_norm": 1.1484375, "learning_rate": 0.00036815906078454895, "loss": 5.8142, "mean_token_accuracy": 0.1669834226369858, "num_tokens": 75042244.0, "step": 34660 }, { "entropy": 6.225776863098145, "epoch": 3.709508266894965, "grad_norm": 1.0546875, "learning_rate": 0.00036812425719696154, "loss": 5.8237, "mean_token_accuracy": 0.16185067296028138, "num_tokens": 75052854.0, "step": 34665 }, { "entropy": 6.334627151489258, "epoch": 3.710043341002729, "grad_norm": 1.171875, "learning_rate": 0.0003680894509204243, "loss": 5.9546, "mean_token_accuracy": 0.161827951669693, "num_tokens": 75063028.0, "step": 34670 }, { "entropy": 6.285592651367187, "epoch": 3.7105784151104926, "grad_norm": 0.99609375, "learning_rate": 0.0003680546419559422, "loss": 5.979, "mean_token_accuracy": 0.1581293299794197, "num_tokens": 75075020.0, "step": 34675 }, { "entropy": 6.342573451995849, "epoch": 3.7111134892182567, "grad_norm": 1.203125, "learning_rate": 0.0003680198303045204, "loss": 5.8792, "mean_token_accuracy": 0.15617574900388717, "num_tokens": 75085516.0, "step": 34680 }, { "entropy": 6.281200218200683, "epoch": 3.7116485633260208, "grad_norm": 1.2109375, "learning_rate": 0.0003679850159671641, "loss": 5.8006, "mean_token_accuracy": 0.17311845272779464, "num_tokens": 75095688.0, "step": 34685 }, { "entropy": 6.183791732788086, "epoch": 3.7121836374337844, "grad_norm": 0.953125, "learning_rate": 0.0003679501989448785, "loss": 5.8378, "mean_token_accuracy": 0.16540836542844772, "num_tokens": 75106202.0, "step": 34690 }, { "entropy": 6.312303781509399, "epoch": 3.7127187115415485, "grad_norm": 1.0234375, "learning_rate": 0.000367915379238669, "loss": 5.9403, "mean_token_accuracy": 0.15582226365804672, "num_tokens": 75116602.0, "step": 34695 }, { "entropy": 6.31956934928894, "epoch": 3.7132537856493126, "grad_norm": 1.0, "learning_rate": 0.000367880556849541, "loss": 5.8656, "mean_token_accuracy": 0.16297486424446106, "num_tokens": 75126523.0, "step": 34700 }, { "entropy": 6.323786878585816, "epoch": 3.7137888597570763, "grad_norm": 1.15625, "learning_rate": 0.00036784573177849994, "loss": 5.9264, "mean_token_accuracy": 0.16037774831056595, "num_tokens": 75136789.0, "step": 34705 }, { "entropy": 6.263908338546753, "epoch": 3.7143239338648404, "grad_norm": 1.0390625, "learning_rate": 0.00036781090402655136, "loss": 5.8579, "mean_token_accuracy": 0.16155781894922255, "num_tokens": 75148585.0, "step": 34710 }, { "entropy": 6.288842630386353, "epoch": 3.714859007972604, "grad_norm": 1.0234375, "learning_rate": 0.0003677760735947011, "loss": 5.8145, "mean_token_accuracy": 0.16585833132266997, "num_tokens": 75159584.0, "step": 34715 }, { "entropy": 6.217530107498169, "epoch": 3.715394082080368, "grad_norm": 1.0, "learning_rate": 0.0003677412404839546, "loss": 5.7915, "mean_token_accuracy": 0.1666298657655716, "num_tokens": 75170478.0, "step": 34720 }, { "entropy": 6.279090118408203, "epoch": 3.715929156188132, "grad_norm": 1.09375, "learning_rate": 0.0003677064046953179, "loss": 5.7924, "mean_token_accuracy": 0.17503705322742463, "num_tokens": 75181413.0, "step": 34725 }, { "entropy": 6.222601127624512, "epoch": 3.716464230295896, "grad_norm": 1.1484375, "learning_rate": 0.00036767156622979685, "loss": 5.795, "mean_token_accuracy": 0.16544003784656525, "num_tokens": 75192102.0, "step": 34730 }, { "entropy": 6.287989759445191, "epoch": 3.71699930440366, "grad_norm": 1.0, "learning_rate": 0.0003676367250883972, "loss": 5.8663, "mean_token_accuracy": 0.16687228977680207, "num_tokens": 75202868.0, "step": 34735 }, { "entropy": 6.2824976444244385, "epoch": 3.7175343785114237, "grad_norm": 1.015625, "learning_rate": 0.0003676018812721252, "loss": 5.8955, "mean_token_accuracy": 0.16027416586875914, "num_tokens": 75214157.0, "step": 34740 }, { "entropy": 6.284444808959961, "epoch": 3.7180694526191878, "grad_norm": 1.125, "learning_rate": 0.00036756703478198693, "loss": 5.8062, "mean_token_accuracy": 0.16534611135721206, "num_tokens": 75224403.0, "step": 34745 }, { "entropy": 6.193011331558227, "epoch": 3.718604526726952, "grad_norm": 2.171875, "learning_rate": 0.00036753218561898855, "loss": 5.7864, "mean_token_accuracy": 0.17493089586496352, "num_tokens": 75235678.0, "step": 34750 }, { "entropy": 6.246564960479736, "epoch": 3.7191396008347155, "grad_norm": 1.0703125, "learning_rate": 0.00036749733378413623, "loss": 5.8369, "mean_token_accuracy": 0.16435620188713074, "num_tokens": 75245615.0, "step": 34755 }, { "entropy": 6.2650120735168455, "epoch": 3.7196746749424796, "grad_norm": 1.046875, "learning_rate": 0.0003674624792784365, "loss": 5.8637, "mean_token_accuracy": 0.15525825470685958, "num_tokens": 75257117.0, "step": 34760 }, { "entropy": 6.333669424057007, "epoch": 3.7202097490502437, "grad_norm": 0.96484375, "learning_rate": 0.0003674276221028956, "loss": 5.8434, "mean_token_accuracy": 0.16054131835699081, "num_tokens": 75269155.0, "step": 34765 }, { "entropy": 6.318684673309326, "epoch": 3.7207448231580074, "grad_norm": 0.94140625, "learning_rate": 0.0003673927622585201, "loss": 5.8118, "mean_token_accuracy": 0.17176591902971267, "num_tokens": 75280344.0, "step": 34770 }, { "entropy": 6.287245798110962, "epoch": 3.7212798972657715, "grad_norm": 1.109375, "learning_rate": 0.00036735789974631664, "loss": 5.9213, "mean_token_accuracy": 0.1645456373691559, "num_tokens": 75290361.0, "step": 34775 }, { "entropy": 6.262863445281982, "epoch": 3.721814971373535, "grad_norm": 1.0859375, "learning_rate": 0.0003673230345672917, "loss": 5.8342, "mean_token_accuracy": 0.1579344838857651, "num_tokens": 75300718.0, "step": 34780 }, { "entropy": 6.25611720085144, "epoch": 3.722350045481299, "grad_norm": 1.1328125, "learning_rate": 0.00036728816672245215, "loss": 5.8092, "mean_token_accuracy": 0.17063530385494233, "num_tokens": 75310136.0, "step": 34785 }, { "entropy": 6.3288966655731205, "epoch": 3.722885119589063, "grad_norm": 0.99609375, "learning_rate": 0.0003672532962128048, "loss": 5.9914, "mean_token_accuracy": 0.16137541681528092, "num_tokens": 75321964.0, "step": 34790 }, { "entropy": 6.224659204483032, "epoch": 3.723420193696827, "grad_norm": 1.0234375, "learning_rate": 0.0003672184230393564, "loss": 5.8146, "mean_token_accuracy": 0.17425901889801027, "num_tokens": 75333001.0, "step": 34795 }, { "entropy": 6.289140224456787, "epoch": 3.723955267804591, "grad_norm": 0.984375, "learning_rate": 0.000367183547203114, "loss": 5.8959, "mean_token_accuracy": 0.16858494132757187, "num_tokens": 75344067.0, "step": 34800 }, { "entropy": 6.300594615936279, "epoch": 3.7244903419123547, "grad_norm": 1.0, "learning_rate": 0.00036714866870508466, "loss": 5.8572, "mean_token_accuracy": 0.16770034283399582, "num_tokens": 75354367.0, "step": 34805 }, { "entropy": 6.327038049697876, "epoch": 3.725025416020119, "grad_norm": 1.2109375, "learning_rate": 0.0003671137875462755, "loss": 5.8745, "mean_token_accuracy": 0.15784425884485245, "num_tokens": 75364327.0, "step": 34810 }, { "entropy": 6.120264673233033, "epoch": 3.725560490127883, "grad_norm": 1.125, "learning_rate": 0.00036707890372769366, "loss": 5.7059, "mean_token_accuracy": 0.1763496696949005, "num_tokens": 75376525.0, "step": 34815 }, { "entropy": 6.293916082382202, "epoch": 3.7260955642356466, "grad_norm": 1.03125, "learning_rate": 0.00036704401725034635, "loss": 5.8854, "mean_token_accuracy": 0.16640887260437012, "num_tokens": 75387327.0, "step": 34820 }, { "entropy": 6.3113795757293705, "epoch": 3.7266306383434107, "grad_norm": 0.96484375, "learning_rate": 0.00036700912811524103, "loss": 5.8037, "mean_token_accuracy": 0.16683290004730225, "num_tokens": 75397633.0, "step": 34825 }, { "entropy": 6.23141565322876, "epoch": 3.7271657124511743, "grad_norm": 1.1015625, "learning_rate": 0.00036697423632338507, "loss": 5.8054, "mean_token_accuracy": 0.16476970911026, "num_tokens": 75408851.0, "step": 34830 }, { "entropy": 6.180099582672119, "epoch": 3.7277007865589384, "grad_norm": 1.0234375, "learning_rate": 0.0003669393418757859, "loss": 5.7727, "mean_token_accuracy": 0.1654541626572609, "num_tokens": 75418834.0, "step": 34835 }, { "entropy": 6.2535802841186525, "epoch": 3.728235860666702, "grad_norm": 1.0078125, "learning_rate": 0.00036690444477345123, "loss": 5.8888, "mean_token_accuracy": 0.16026011109352112, "num_tokens": 75430529.0, "step": 34840 }, { "entropy": 6.287846279144287, "epoch": 3.728770934774466, "grad_norm": 1.0, "learning_rate": 0.00036686954501738856, "loss": 5.9076, "mean_token_accuracy": 0.1578081525862217, "num_tokens": 75441974.0, "step": 34845 }, { "entropy": 6.25370831489563, "epoch": 3.7293060088822303, "grad_norm": 1.03125, "learning_rate": 0.0003668346426086057, "loss": 5.8189, "mean_token_accuracy": 0.168346631526947, "num_tokens": 75453589.0, "step": 34850 }, { "entropy": 6.3074053764343265, "epoch": 3.729841082989994, "grad_norm": 1.09375, "learning_rate": 0.00036679973754811054, "loss": 5.9045, "mean_token_accuracy": 0.1574084520339966, "num_tokens": 75463816.0, "step": 34855 }, { "entropy": 6.269244575500489, "epoch": 3.730376157097758, "grad_norm": 1.0234375, "learning_rate": 0.0003667648298369107, "loss": 5.8652, "mean_token_accuracy": 0.16450998783111573, "num_tokens": 75474514.0, "step": 34860 }, { "entropy": 6.229407596588135, "epoch": 3.730911231205522, "grad_norm": 0.98046875, "learning_rate": 0.00036672991947601447, "loss": 5.7562, "mean_token_accuracy": 0.18163900971412658, "num_tokens": 75485092.0, "step": 34865 }, { "entropy": 6.294026184082031, "epoch": 3.731446305313286, "grad_norm": 0.98828125, "learning_rate": 0.0003666950064664296, "loss": 5.8327, "mean_token_accuracy": 0.1618741750717163, "num_tokens": 75495866.0, "step": 34870 }, { "entropy": 6.214341068267823, "epoch": 3.73198137942105, "grad_norm": 1.046875, "learning_rate": 0.0003666600908091642, "loss": 5.8006, "mean_token_accuracy": 0.16742578744888306, "num_tokens": 75505590.0, "step": 34875 }, { "entropy": 6.27507438659668, "epoch": 3.732516453528814, "grad_norm": 1.09375, "learning_rate": 0.00036662517250522677, "loss": 5.8327, "mean_token_accuracy": 0.16527419686317443, "num_tokens": 75515428.0, "step": 34880 }, { "entropy": 6.2495222091674805, "epoch": 3.7330515276365777, "grad_norm": 1.140625, "learning_rate": 0.0003665902515556252, "loss": 5.8986, "mean_token_accuracy": 0.1579550877213478, "num_tokens": 75527256.0, "step": 34885 }, { "entropy": 6.2948544979095455, "epoch": 3.7335866017443413, "grad_norm": 0.97265625, "learning_rate": 0.0003665553279613681, "loss": 5.8741, "mean_token_accuracy": 0.16310223937034607, "num_tokens": 75538320.0, "step": 34890 }, { "entropy": 6.281671762466431, "epoch": 3.7341216758521054, "grad_norm": 1.0546875, "learning_rate": 0.0003665204017234637, "loss": 5.8196, "mean_token_accuracy": 0.1686473712325096, "num_tokens": 75548527.0, "step": 34895 }, { "entropy": 6.224715328216552, "epoch": 3.7346567499598695, "grad_norm": 1.078125, "learning_rate": 0.0003664854728429206, "loss": 5.8597, "mean_token_accuracy": 0.16028425395488738, "num_tokens": 75559575.0, "step": 34900 }, { "entropy": 6.343696212768554, "epoch": 3.735191824067633, "grad_norm": 1.0234375, "learning_rate": 0.00036645054132074733, "loss": 5.8703, "mean_token_accuracy": 0.1653431162238121, "num_tokens": 75569920.0, "step": 34905 }, { "entropy": 6.323857164382934, "epoch": 3.7357268981753973, "grad_norm": 1.0078125, "learning_rate": 0.0003664156071579525, "loss": 5.8701, "mean_token_accuracy": 0.16388342678546905, "num_tokens": 75581401.0, "step": 34910 }, { "entropy": 6.310791158676148, "epoch": 3.7362619722831614, "grad_norm": 1.0234375, "learning_rate": 0.0003663806703555448, "loss": 5.9133, "mean_token_accuracy": 0.163347789645195, "num_tokens": 75591675.0, "step": 34915 }, { "entropy": 6.206449413299561, "epoch": 3.736797046390925, "grad_norm": 0.9921875, "learning_rate": 0.0003663457309145332, "loss": 5.7631, "mean_token_accuracy": 0.17214159965515136, "num_tokens": 75602211.0, "step": 34920 }, { "entropy": 6.234835052490235, "epoch": 3.737332120498689, "grad_norm": 1.0390625, "learning_rate": 0.0003663107888359264, "loss": 5.7993, "mean_token_accuracy": 0.16709952801465988, "num_tokens": 75612515.0, "step": 34925 }, { "entropy": 6.299939250946045, "epoch": 3.7378671946064532, "grad_norm": 1.125, "learning_rate": 0.0003662758441207333, "loss": 5.8162, "mean_token_accuracy": 0.16918123215436937, "num_tokens": 75622967.0, "step": 34930 }, { "entropy": 6.27443413734436, "epoch": 3.738402268714217, "grad_norm": 1.1484375, "learning_rate": 0.0003662408967699632, "loss": 5.813, "mean_token_accuracy": 0.1687221571803093, "num_tokens": 75633520.0, "step": 34935 }, { "entropy": 6.279186820983886, "epoch": 3.738937342821981, "grad_norm": 1.078125, "learning_rate": 0.00036620594678462496, "loss": 5.8372, "mean_token_accuracy": 0.17294271737337114, "num_tokens": 75643606.0, "step": 34940 }, { "entropy": 6.22420072555542, "epoch": 3.7394724169297446, "grad_norm": 0.94140625, "learning_rate": 0.0003661709941657278, "loss": 5.7919, "mean_token_accuracy": 0.17124523520469664, "num_tokens": 75655676.0, "step": 34945 }, { "entropy": 6.258344268798828, "epoch": 3.7400074910375087, "grad_norm": 1.09375, "learning_rate": 0.00036613603891428106, "loss": 5.8247, "mean_token_accuracy": 0.16786367893218995, "num_tokens": 75665470.0, "step": 34950 }, { "entropy": 6.282136487960815, "epoch": 3.7405425651452724, "grad_norm": 1.015625, "learning_rate": 0.00036610108103129395, "loss": 5.8737, "mean_token_accuracy": 0.1620388686656952, "num_tokens": 75677518.0, "step": 34955 }, { "entropy": 6.287706279754639, "epoch": 3.7410776392530365, "grad_norm": 1.0078125, "learning_rate": 0.00036606612051777595, "loss": 5.8787, "mean_token_accuracy": 0.157106713950634, "num_tokens": 75688705.0, "step": 34960 }, { "entropy": 6.303213453292846, "epoch": 3.7416127133608006, "grad_norm": 1.0625, "learning_rate": 0.00036603115737473646, "loss": 5.8632, "mean_token_accuracy": 0.1674398049712181, "num_tokens": 75699472.0, "step": 34965 }, { "entropy": 6.364735746383667, "epoch": 3.7421477874685642, "grad_norm": 1.1015625, "learning_rate": 0.00036599619160318514, "loss": 5.8655, "mean_token_accuracy": 0.16324151456356048, "num_tokens": 75710376.0, "step": 34970 }, { "entropy": 6.258538103103637, "epoch": 3.7426828615763283, "grad_norm": 0.9921875, "learning_rate": 0.00036596122320413154, "loss": 5.798, "mean_token_accuracy": 0.16803004145622252, "num_tokens": 75721980.0, "step": 34975 }, { "entropy": 6.270932054519653, "epoch": 3.7432179356840924, "grad_norm": 1.0078125, "learning_rate": 0.0003659262521785855, "loss": 5.7989, "mean_token_accuracy": 0.16955474466085435, "num_tokens": 75732071.0, "step": 34980 }, { "entropy": 6.256672382354736, "epoch": 3.743753009791856, "grad_norm": 1.0078125, "learning_rate": 0.0003658912785275567, "loss": 5.8616, "mean_token_accuracy": 0.16758882403373718, "num_tokens": 75742965.0, "step": 34985 }, { "entropy": 6.358363771438599, "epoch": 3.74428808389962, "grad_norm": 0.94921875, "learning_rate": 0.0003658563022520549, "loss": 5.8795, "mean_token_accuracy": 0.1592339515686035, "num_tokens": 75753687.0, "step": 34990 }, { "entropy": 6.292234230041504, "epoch": 3.744823158007384, "grad_norm": 1.015625, "learning_rate": 0.00036582132335309013, "loss": 5.8264, "mean_token_accuracy": 0.17115925550460814, "num_tokens": 75764028.0, "step": 34995 }, { "entropy": 6.3185286045074465, "epoch": 3.745358232115148, "grad_norm": 1.34375, "learning_rate": 0.00036578634183167256, "loss": 5.9058, "mean_token_accuracy": 0.15381855815649031, "num_tokens": 75774289.0, "step": 35000 }, { "entropy": 6.256444597244263, "epoch": 3.7458933062229116, "grad_norm": 1.03125, "learning_rate": 0.00036575135768881193, "loss": 5.8308, "mean_token_accuracy": 0.16894944310188292, "num_tokens": 75784647.0, "step": 35005 }, { "entropy": 6.255809736251831, "epoch": 3.7464283803306757, "grad_norm": 0.94921875, "learning_rate": 0.00036571637092551874, "loss": 5.8475, "mean_token_accuracy": 0.16678444892168046, "num_tokens": 75795619.0, "step": 35010 }, { "entropy": 6.2654634475708, "epoch": 3.74696345443844, "grad_norm": 0.99609375, "learning_rate": 0.000365681381542803, "loss": 5.841, "mean_token_accuracy": 0.16481574028730392, "num_tokens": 75805953.0, "step": 35015 }, { "entropy": 6.275837039947509, "epoch": 3.7474985285462035, "grad_norm": 1.0703125, "learning_rate": 0.0003656463895416752, "loss": 5.8307, "mean_token_accuracy": 0.16347971707582473, "num_tokens": 75816630.0, "step": 35020 }, { "entropy": 6.293793439865112, "epoch": 3.7480336026539676, "grad_norm": 1.109375, "learning_rate": 0.0003656113949231456, "loss": 5.8812, "mean_token_accuracy": 0.16405119001865387, "num_tokens": 75826236.0, "step": 35025 }, { "entropy": 6.233069944381714, "epoch": 3.7485686767617317, "grad_norm": 1.03125, "learning_rate": 0.0003655763976882246, "loss": 5.7801, "mean_token_accuracy": 0.166824871301651, "num_tokens": 75836403.0, "step": 35030 }, { "entropy": 6.206435823440552, "epoch": 3.7491037508694953, "grad_norm": 1.03125, "learning_rate": 0.0003655413978379231, "loss": 5.7983, "mean_token_accuracy": 0.17191967964172364, "num_tokens": 75846842.0, "step": 35035 }, { "entropy": 6.2723242282867435, "epoch": 3.7496388249772594, "grad_norm": 0.94140625, "learning_rate": 0.00036550639537325126, "loss": 5.8405, "mean_token_accuracy": 0.17438421845436097, "num_tokens": 75858340.0, "step": 35040 }, { "entropy": 6.3079548358917235, "epoch": 3.7501738990850235, "grad_norm": 1.015625, "learning_rate": 0.00036547139029522, "loss": 5.888, "mean_token_accuracy": 0.1620125725865364, "num_tokens": 75868617.0, "step": 35045 }, { "entropy": 6.355098295211792, "epoch": 3.750708973192787, "grad_norm": 1.2421875, "learning_rate": 0.0003654363826048401, "loss": 5.8709, "mean_token_accuracy": 0.16227293461561204, "num_tokens": 75879234.0, "step": 35050 }, { "entropy": 6.299662351608276, "epoch": 3.7512440473005513, "grad_norm": 1.03125, "learning_rate": 0.0003654013723031223, "loss": 5.8375, "mean_token_accuracy": 0.1668538600206375, "num_tokens": 75890598.0, "step": 35055 }, { "entropy": 6.371746587753296, "epoch": 3.751779121408315, "grad_norm": 0.96484375, "learning_rate": 0.0003653663593910776, "loss": 5.9785, "mean_token_accuracy": 0.15626693814992904, "num_tokens": 75902632.0, "step": 35060 }, { "entropy": 6.306219863891601, "epoch": 3.752314195516079, "grad_norm": 1.1015625, "learning_rate": 0.0003653313438697169, "loss": 5.8421, "mean_token_accuracy": 0.17288342714309693, "num_tokens": 75913722.0, "step": 35065 }, { "entropy": 6.303974533081055, "epoch": 3.7528492696238427, "grad_norm": 1.0078125, "learning_rate": 0.00036529632574005156, "loss": 5.9062, "mean_token_accuracy": 0.1651500552892685, "num_tokens": 75924520.0, "step": 35070 }, { "entropy": 6.206143093109131, "epoch": 3.753384343731607, "grad_norm": 1.0, "learning_rate": 0.0003652613050030923, "loss": 5.7713, "mean_token_accuracy": 0.17412907481193543, "num_tokens": 75935176.0, "step": 35075 }, { "entropy": 6.2746910572052, "epoch": 3.753919417839371, "grad_norm": 1.0234375, "learning_rate": 0.0003652262816598506, "loss": 5.86, "mean_token_accuracy": 0.16730018556118012, "num_tokens": 75945914.0, "step": 35080 }, { "entropy": 6.235084056854248, "epoch": 3.7544544919471345, "grad_norm": 1.0546875, "learning_rate": 0.00036519125571133775, "loss": 5.7771, "mean_token_accuracy": 0.17261414229869843, "num_tokens": 75956157.0, "step": 35085 }, { "entropy": 6.314530658721924, "epoch": 3.7549895660548986, "grad_norm": 1.1328125, "learning_rate": 0.00036515622715856496, "loss": 5.8264, "mean_token_accuracy": 0.16529861837625504, "num_tokens": 75966499.0, "step": 35090 }, { "entropy": 6.241733026504517, "epoch": 3.7555246401626627, "grad_norm": 0.98046875, "learning_rate": 0.0003651211960025439, "loss": 5.7819, "mean_token_accuracy": 0.17042669504880906, "num_tokens": 75977686.0, "step": 35095 }, { "entropy": 6.244101524353027, "epoch": 3.7560597142704264, "grad_norm": 1.1015625, "learning_rate": 0.0003650861622442859, "loss": 5.8453, "mean_token_accuracy": 0.16251111328601836, "num_tokens": 75988653.0, "step": 35100 }, { "entropy": 6.343206548690796, "epoch": 3.7565947883781905, "grad_norm": 1.203125, "learning_rate": 0.0003650511258848026, "loss": 5.9005, "mean_token_accuracy": 0.1573765516281128, "num_tokens": 75999407.0, "step": 35105 }, { "entropy": 6.328097534179688, "epoch": 3.757129862485954, "grad_norm": 1.0390625, "learning_rate": 0.0003650160869251057, "loss": 5.8647, "mean_token_accuracy": 0.1648359090089798, "num_tokens": 76010387.0, "step": 35110 }, { "entropy": 6.3228034496307375, "epoch": 3.7576649365937183, "grad_norm": 1.1171875, "learning_rate": 0.000364981045366207, "loss": 5.8382, "mean_token_accuracy": 0.16409987807273865, "num_tokens": 76019693.0, "step": 35115 }, { "entropy": 6.318949270248413, "epoch": 3.758200010701482, "grad_norm": 1.140625, "learning_rate": 0.00036494600120911825, "loss": 5.8924, "mean_token_accuracy": 0.15711281448602676, "num_tokens": 76030546.0, "step": 35120 }, { "entropy": 6.3107068061828615, "epoch": 3.758735084809246, "grad_norm": 1.046875, "learning_rate": 0.0003649109544548513, "loss": 5.8688, "mean_token_accuracy": 0.1723574712872505, "num_tokens": 76041321.0, "step": 35125 }, { "entropy": 6.284887218475342, "epoch": 3.75927015891701, "grad_norm": 1.0625, "learning_rate": 0.0003648759051044182, "loss": 5.8556, "mean_token_accuracy": 0.16269380748271942, "num_tokens": 76052151.0, "step": 35130 }, { "entropy": 6.323558950424195, "epoch": 3.7598052330247738, "grad_norm": 1.0078125, "learning_rate": 0.000364840853158831, "loss": 5.8202, "mean_token_accuracy": 0.1685632959008217, "num_tokens": 76063069.0, "step": 35135 }, { "entropy": 6.3019664764404295, "epoch": 3.760340307132538, "grad_norm": 1.0625, "learning_rate": 0.00036480579861910173, "loss": 5.8436, "mean_token_accuracy": 0.16555578857660294, "num_tokens": 76072808.0, "step": 35140 }, { "entropy": 6.317793941497802, "epoch": 3.760875381240302, "grad_norm": 1.0625, "learning_rate": 0.0003647707414862427, "loss": 5.8812, "mean_token_accuracy": 0.16084014773368835, "num_tokens": 76083665.0, "step": 35145 }, { "entropy": 6.341254138946534, "epoch": 3.7614104553480656, "grad_norm": 1.0390625, "learning_rate": 0.0003647356817612661, "loss": 5.9057, "mean_token_accuracy": 0.15865813195705414, "num_tokens": 76094232.0, "step": 35150 }, { "entropy": 6.249244642257691, "epoch": 3.7619455294558297, "grad_norm": 1.1015625, "learning_rate": 0.0003647006194451843, "loss": 5.8251, "mean_token_accuracy": 0.16888623237609862, "num_tokens": 76104354.0, "step": 35155 }, { "entropy": 6.279737329483032, "epoch": 3.762480603563594, "grad_norm": 1.0703125, "learning_rate": 0.0003646655545390097, "loss": 5.8413, "mean_token_accuracy": 0.16480566710233688, "num_tokens": 76116735.0, "step": 35160 }, { "entropy": 6.291060829162598, "epoch": 3.7630156776713575, "grad_norm": 0.92578125, "learning_rate": 0.00036463048704375484, "loss": 5.8233, "mean_token_accuracy": 0.1729306995868683, "num_tokens": 76127897.0, "step": 35165 }, { "entropy": 6.236211347579956, "epoch": 3.7635507517791216, "grad_norm": 1.1484375, "learning_rate": 0.0003645954169604322, "loss": 5.8196, "mean_token_accuracy": 0.168717722594738, "num_tokens": 76139272.0, "step": 35170 }, { "entropy": 6.259130620956421, "epoch": 3.7640858258868852, "grad_norm": 1.0859375, "learning_rate": 0.0003645603442900546, "loss": 5.8466, "mean_token_accuracy": 0.16696365624666215, "num_tokens": 76149226.0, "step": 35175 }, { "entropy": 6.258574199676514, "epoch": 3.7646208999946493, "grad_norm": 1.0625, "learning_rate": 0.00036452526903363455, "loss": 5.8997, "mean_token_accuracy": 0.15903866440057754, "num_tokens": 76160057.0, "step": 35180 }, { "entropy": 6.197706270217895, "epoch": 3.765155974102413, "grad_norm": 1.0625, "learning_rate": 0.00036449019119218494, "loss": 5.8511, "mean_token_accuracy": 0.1694413647055626, "num_tokens": 76170131.0, "step": 35185 }, { "entropy": 6.37061128616333, "epoch": 3.765691048210177, "grad_norm": 1.1328125, "learning_rate": 0.0003644551107667187, "loss": 5.8819, "mean_token_accuracy": 0.15701011717319488, "num_tokens": 76181245.0, "step": 35190 }, { "entropy": 6.393298959732055, "epoch": 3.766226122317941, "grad_norm": 1.0625, "learning_rate": 0.0003644200277582486, "loss": 5.9039, "mean_token_accuracy": 0.15780820697546005, "num_tokens": 76192568.0, "step": 35195 }, { "entropy": 6.29258131980896, "epoch": 3.766761196425705, "grad_norm": 1.1015625, "learning_rate": 0.00036438494216778795, "loss": 5.8675, "mean_token_accuracy": 0.1627265214920044, "num_tokens": 76205224.0, "step": 35200 }, { "entropy": 6.304104471206665, "epoch": 3.767296270533469, "grad_norm": 1.03125, "learning_rate": 0.00036434985399634947, "loss": 5.9141, "mean_token_accuracy": 0.1645101562142372, "num_tokens": 76216303.0, "step": 35205 }, { "entropy": 6.314153861999512, "epoch": 3.767831344641233, "grad_norm": 0.9609375, "learning_rate": 0.00036431476324494654, "loss": 5.8739, "mean_token_accuracy": 0.16379435509443283, "num_tokens": 76226743.0, "step": 35210 }, { "entropy": 6.153638410568237, "epoch": 3.7683664187489967, "grad_norm": 1.0625, "learning_rate": 0.0003642796699145925, "loss": 5.6476, "mean_token_accuracy": 0.1783464014530182, "num_tokens": 76237410.0, "step": 35215 }, { "entropy": 6.3173828125, "epoch": 3.768901492856761, "grad_norm": 1.0703125, "learning_rate": 0.0003642445740063004, "loss": 5.909, "mean_token_accuracy": 0.1596961110830307, "num_tokens": 76247424.0, "step": 35220 }, { "entropy": 6.252438402175903, "epoch": 3.7694365669645244, "grad_norm": 1.203125, "learning_rate": 0.0003642094755210838, "loss": 5.9504, "mean_token_accuracy": 0.15396868288517, "num_tokens": 76257476.0, "step": 35225 }, { "entropy": 6.3554582595825195, "epoch": 3.7699716410722885, "grad_norm": 1.0546875, "learning_rate": 0.00036417437445995614, "loss": 5.8495, "mean_token_accuracy": 0.16566233038902284, "num_tokens": 76268185.0, "step": 35230 }, { "entropy": 6.270586252212524, "epoch": 3.770506715180052, "grad_norm": 1.0859375, "learning_rate": 0.00036413927082393097, "loss": 5.7699, "mean_token_accuracy": 0.17412970662117006, "num_tokens": 76279477.0, "step": 35235 }, { "entropy": 6.225922060012818, "epoch": 3.7710417892878163, "grad_norm": 1.0546875, "learning_rate": 0.00036410416461402187, "loss": 5.7632, "mean_token_accuracy": 0.16957344859838486, "num_tokens": 76290301.0, "step": 35240 }, { "entropy": 6.26543869972229, "epoch": 3.7715768633955804, "grad_norm": 1.1015625, "learning_rate": 0.0003640690558312425, "loss": 5.8441, "mean_token_accuracy": 0.1667577877640724, "num_tokens": 76301704.0, "step": 35245 }, { "entropy": 6.225312185287476, "epoch": 3.772111937503344, "grad_norm": 0.99609375, "learning_rate": 0.0003640339444766067, "loss": 5.7556, "mean_token_accuracy": 0.18042795956134797, "num_tokens": 76312698.0, "step": 35250 }, { "entropy": 6.287018585205078, "epoch": 3.772647011611108, "grad_norm": 1.015625, "learning_rate": 0.0003639988305511283, "loss": 5.8321, "mean_token_accuracy": 0.16489026546478272, "num_tokens": 76322764.0, "step": 35255 }, { "entropy": 6.290817832946777, "epoch": 3.7731820857188723, "grad_norm": 1.0859375, "learning_rate": 0.0003639637140558211, "loss": 5.8822, "mean_token_accuracy": 0.16499026119709015, "num_tokens": 76333253.0, "step": 35260 }, { "entropy": 6.20125675201416, "epoch": 3.773717159826636, "grad_norm": 1.0078125, "learning_rate": 0.00036392859499169916, "loss": 5.759, "mean_token_accuracy": 0.1793952167034149, "num_tokens": 76344455.0, "step": 35265 }, { "entropy": 6.299957370758056, "epoch": 3.7742522339344, "grad_norm": 1.1015625, "learning_rate": 0.0003638934733597766, "loss": 5.7926, "mean_token_accuracy": 0.16533913165330888, "num_tokens": 76353736.0, "step": 35270 }, { "entropy": 6.297627544403076, "epoch": 3.774787308042164, "grad_norm": 0.9765625, "learning_rate": 0.00036385834916106746, "loss": 5.8766, "mean_token_accuracy": 0.15898518562316893, "num_tokens": 76364716.0, "step": 35275 }, { "entropy": 6.267363214492798, "epoch": 3.7753223821499278, "grad_norm": 1.0625, "learning_rate": 0.00036382322239658595, "loss": 5.8379, "mean_token_accuracy": 0.1676853522658348, "num_tokens": 76376680.0, "step": 35280 }, { "entropy": 6.305015993118286, "epoch": 3.7758574562576914, "grad_norm": 0.984375, "learning_rate": 0.0003637880930673464, "loss": 5.8475, "mean_token_accuracy": 0.16252332031726838, "num_tokens": 76387971.0, "step": 35285 }, { "entropy": 6.1979223728179935, "epoch": 3.7763925303654555, "grad_norm": 0.95703125, "learning_rate": 0.00036375296117436315, "loss": 5.7989, "mean_token_accuracy": 0.17304738014936447, "num_tokens": 76399222.0, "step": 35290 }, { "entropy": 6.151556968688965, "epoch": 3.7769276044732196, "grad_norm": 1.0, "learning_rate": 0.0003637178267186505, "loss": 5.7164, "mean_token_accuracy": 0.18364108204841614, "num_tokens": 76410610.0, "step": 35295 }, { "entropy": 6.254100179672241, "epoch": 3.7774626785809833, "grad_norm": 1.046875, "learning_rate": 0.0003636826897012232, "loss": 5.8542, "mean_token_accuracy": 0.1633177876472473, "num_tokens": 76421179.0, "step": 35300 }, { "entropy": 6.266663122177124, "epoch": 3.7779977526887474, "grad_norm": 1.171875, "learning_rate": 0.0003636475501230957, "loss": 5.9175, "mean_token_accuracy": 0.16353431940078736, "num_tokens": 76432273.0, "step": 35305 }, { "entropy": 6.289675378799439, "epoch": 3.7785328267965115, "grad_norm": 1.0859375, "learning_rate": 0.0003636124079852826, "loss": 5.7631, "mean_token_accuracy": 0.1811137929558754, "num_tokens": 76442653.0, "step": 35310 }, { "entropy": 6.352113914489746, "epoch": 3.779067900904275, "grad_norm": 1.046875, "learning_rate": 0.00036357726328879866, "loss": 5.8607, "mean_token_accuracy": 0.16307328641414642, "num_tokens": 76452942.0, "step": 35315 }, { "entropy": 6.270118188858032, "epoch": 3.7796029750120392, "grad_norm": 1.015625, "learning_rate": 0.0003635421160346587, "loss": 5.7842, "mean_token_accuracy": 0.17550411075353622, "num_tokens": 76463034.0, "step": 35320 }, { "entropy": 6.238749599456787, "epoch": 3.7801380491198033, "grad_norm": 1.0625, "learning_rate": 0.0003635069662238776, "loss": 5.8718, "mean_token_accuracy": 0.1640877529978752, "num_tokens": 76473093.0, "step": 35325 }, { "entropy": 6.2817004203796385, "epoch": 3.780673123227567, "grad_norm": 1.0546875, "learning_rate": 0.0003634718138574703, "loss": 5.8096, "mean_token_accuracy": 0.1704441323876381, "num_tokens": 76484560.0, "step": 35330 }, { "entropy": 6.357616329193116, "epoch": 3.781208197335331, "grad_norm": 1.046875, "learning_rate": 0.0003634366589364517, "loss": 5.8514, "mean_token_accuracy": 0.16230213940143584, "num_tokens": 76495250.0, "step": 35335 }, { "entropy": 6.2578671932220455, "epoch": 3.7817432714430947, "grad_norm": 1.0078125, "learning_rate": 0.00036340150146183713, "loss": 5.7831, "mean_token_accuracy": 0.17372276037931442, "num_tokens": 76507355.0, "step": 35340 }, { "entropy": 6.25367751121521, "epoch": 3.782278345550859, "grad_norm": 1.0546875, "learning_rate": 0.00036336634143464163, "loss": 5.8606, "mean_token_accuracy": 0.16631176620721816, "num_tokens": 76518788.0, "step": 35345 }, { "entropy": 6.2567798614501955, "epoch": 3.7828134196586225, "grad_norm": 1.0703125, "learning_rate": 0.00036333117885588035, "loss": 5.7503, "mean_token_accuracy": 0.16733985841274263, "num_tokens": 76528747.0, "step": 35350 }, { "entropy": 6.286323118209839, "epoch": 3.7833484937663866, "grad_norm": 1.0390625, "learning_rate": 0.00036329601372656875, "loss": 5.8414, "mean_token_accuracy": 0.16624962985515596, "num_tokens": 76540621.0, "step": 35355 }, { "entropy": 6.219751167297363, "epoch": 3.7838835678741507, "grad_norm": 1.0234375, "learning_rate": 0.00036326084604772213, "loss": 5.8739, "mean_token_accuracy": 0.16364406198263168, "num_tokens": 76552247.0, "step": 35360 }, { "entropy": 6.347431659698486, "epoch": 3.7844186419819144, "grad_norm": 1.0234375, "learning_rate": 0.00036322567582035606, "loss": 5.9667, "mean_token_accuracy": 0.16247354149818422, "num_tokens": 76563171.0, "step": 35365 }, { "entropy": 6.298011445999146, "epoch": 3.7849537160896785, "grad_norm": 1.015625, "learning_rate": 0.0003631905030454859, "loss": 5.8579, "mean_token_accuracy": 0.16204147189855575, "num_tokens": 76573126.0, "step": 35370 }, { "entropy": 6.310353088378906, "epoch": 3.7854887901974426, "grad_norm": 0.96875, "learning_rate": 0.00036315532772412734, "loss": 5.928, "mean_token_accuracy": 0.1636747270822525, "num_tokens": 76584418.0, "step": 35375 }, { "entropy": 6.245873546600341, "epoch": 3.786023864305206, "grad_norm": 1.0078125, "learning_rate": 0.0003631201498572962, "loss": 5.8644, "mean_token_accuracy": 0.16883888691663743, "num_tokens": 76595914.0, "step": 35380 }, { "entropy": 6.334771394729614, "epoch": 3.7865589384129703, "grad_norm": 1.078125, "learning_rate": 0.000363084969446008, "loss": 5.816, "mean_token_accuracy": 0.17093298733234405, "num_tokens": 76605956.0, "step": 35385 }, { "entropy": 6.26600193977356, "epoch": 3.787094012520734, "grad_norm": 1.03125, "learning_rate": 0.00036304978649127873, "loss": 5.853, "mean_token_accuracy": 0.1641773521900177, "num_tokens": 76617357.0, "step": 35390 }, { "entropy": 6.410581779479981, "epoch": 3.787629086628498, "grad_norm": 1.03125, "learning_rate": 0.00036301460099412425, "loss": 5.9967, "mean_token_accuracy": 0.15282383263111116, "num_tokens": 76627570.0, "step": 35395 }, { "entropy": 6.309091091156006, "epoch": 3.7881641607362617, "grad_norm": 0.99609375, "learning_rate": 0.00036297941295556057, "loss": 5.8476, "mean_token_accuracy": 0.16281991451978683, "num_tokens": 76638241.0, "step": 35400 }, { "entropy": 6.2564233303070065, "epoch": 3.788699234844026, "grad_norm": 1.1015625, "learning_rate": 0.00036294422237660365, "loss": 5.8236, "mean_token_accuracy": 0.16267549991607666, "num_tokens": 76647551.0, "step": 35405 }, { "entropy": 6.308247327804565, "epoch": 3.78923430895179, "grad_norm": 1.0234375, "learning_rate": 0.0003629090292582697, "loss": 5.9091, "mean_token_accuracy": 0.1632998377084732, "num_tokens": 76659434.0, "step": 35410 }, { "entropy": 6.299862003326416, "epoch": 3.7897693830595536, "grad_norm": 0.99609375, "learning_rate": 0.0003628738336015748, "loss": 5.8162, "mean_token_accuracy": 0.16908472925424575, "num_tokens": 76670826.0, "step": 35415 }, { "entropy": 6.279416561126709, "epoch": 3.7903044571673177, "grad_norm": 1.0625, "learning_rate": 0.00036283863540753544, "loss": 5.7827, "mean_token_accuracy": 0.17040937691926955, "num_tokens": 76681292.0, "step": 35420 }, { "entropy": 6.248061943054199, "epoch": 3.7908395312750818, "grad_norm": 1.078125, "learning_rate": 0.00036280343467716777, "loss": 5.8576, "mean_token_accuracy": 0.17083622962236406, "num_tokens": 76691065.0, "step": 35425 }, { "entropy": 6.2087695598602295, "epoch": 3.7913746053828454, "grad_norm": 1.015625, "learning_rate": 0.00036276823141148825, "loss": 5.8366, "mean_token_accuracy": 0.16953888833522796, "num_tokens": 76701787.0, "step": 35430 }, { "entropy": 6.286256933212281, "epoch": 3.7919096794906095, "grad_norm": 1.1484375, "learning_rate": 0.0003627330256115134, "loss": 5.8116, "mean_token_accuracy": 0.16993020325899125, "num_tokens": 76712247.0, "step": 35435 }, { "entropy": 6.273203945159912, "epoch": 3.7924447535983736, "grad_norm": 1.03125, "learning_rate": 0.0003626978172782597, "loss": 5.8048, "mean_token_accuracy": 0.16947497874498368, "num_tokens": 76722391.0, "step": 35440 }, { "entropy": 6.338073682785034, "epoch": 3.7929798277061373, "grad_norm": 0.9921875, "learning_rate": 0.0003626626064127439, "loss": 5.8233, "mean_token_accuracy": 0.16658732295036316, "num_tokens": 76733439.0, "step": 35445 }, { "entropy": 6.233079290390014, "epoch": 3.7935149018139014, "grad_norm": 1.09375, "learning_rate": 0.0003626273930159827, "loss": 5.7586, "mean_token_accuracy": 0.1723012000322342, "num_tokens": 76743161.0, "step": 35450 }, { "entropy": 6.295034456253052, "epoch": 3.794049975921665, "grad_norm": 1.1015625, "learning_rate": 0.00036259217708899274, "loss": 5.8737, "mean_token_accuracy": 0.16861267387866974, "num_tokens": 76752983.0, "step": 35455 }, { "entropy": 6.283630847930908, "epoch": 3.794585050029429, "grad_norm": 1.1640625, "learning_rate": 0.00036255695863279103, "loss": 5.8493, "mean_token_accuracy": 0.16610858589410782, "num_tokens": 76762822.0, "step": 35460 }, { "entropy": 6.281605863571167, "epoch": 3.795120124137193, "grad_norm": 1.1015625, "learning_rate": 0.00036252173764839444, "loss": 5.7994, "mean_token_accuracy": 0.16618733555078508, "num_tokens": 76772973.0, "step": 35465 }, { "entropy": 6.263587951660156, "epoch": 3.795655198244957, "grad_norm": 1.046875, "learning_rate": 0.00036248651413682, "loss": 5.7523, "mean_token_accuracy": 0.17198225408792495, "num_tokens": 76783761.0, "step": 35470 }, { "entropy": 6.32318606376648, "epoch": 3.796190272352721, "grad_norm": 1.078125, "learning_rate": 0.0003624512880990847, "loss": 5.8927, "mean_token_accuracy": 0.15895040184259415, "num_tokens": 76794435.0, "step": 35475 }, { "entropy": 6.254731559753418, "epoch": 3.7967253464604847, "grad_norm": 1.1015625, "learning_rate": 0.00036241605953620583, "loss": 5.8431, "mean_token_accuracy": 0.16541793793439866, "num_tokens": 76806199.0, "step": 35480 }, { "entropy": 6.3176483631134035, "epoch": 3.7972604205682488, "grad_norm": 1.0703125, "learning_rate": 0.0003623808284492004, "loss": 5.9363, "mean_token_accuracy": 0.16283540576696395, "num_tokens": 76816768.0, "step": 35485 }, { "entropy": 6.248099851608276, "epoch": 3.797795494676013, "grad_norm": 0.95703125, "learning_rate": 0.0003623455948390859, "loss": 5.848, "mean_token_accuracy": 0.16036945283412934, "num_tokens": 76827715.0, "step": 35490 }, { "entropy": 6.171203756332398, "epoch": 3.7983305687837765, "grad_norm": 1.0234375, "learning_rate": 0.00036231035870687965, "loss": 5.818, "mean_token_accuracy": 0.17283465713262558, "num_tokens": 76838142.0, "step": 35495 }, { "entropy": 6.293267154693604, "epoch": 3.7988656428915406, "grad_norm": 0.984375, "learning_rate": 0.000362275120053599, "loss": 5.8664, "mean_token_accuracy": 0.1666366070508957, "num_tokens": 76848294.0, "step": 35500 }, { "entropy": 6.314698028564453, "epoch": 3.7994007169993043, "grad_norm": 0.99609375, "learning_rate": 0.0003622398788802616, "loss": 5.8549, "mean_token_accuracy": 0.16645192056894303, "num_tokens": 76858129.0, "step": 35505 }, { "entropy": 6.247011661529541, "epoch": 3.7999357911070684, "grad_norm": 1.125, "learning_rate": 0.0003622046351878849, "loss": 5.7778, "mean_token_accuracy": 0.16928064674139023, "num_tokens": 76869113.0, "step": 35510 }, { "entropy": 6.357208776473999, "epoch": 3.800470865214832, "grad_norm": 1.0546875, "learning_rate": 0.0003621693889774866, "loss": 5.859, "mean_token_accuracy": 0.15819347351789476, "num_tokens": 76879665.0, "step": 35515 }, { "entropy": 6.195217418670654, "epoch": 3.801005939322596, "grad_norm": 1.0234375, "learning_rate": 0.0003621341402500845, "loss": 5.7643, "mean_token_accuracy": 0.17359169125556945, "num_tokens": 76890231.0, "step": 35520 }, { "entropy": 6.189562749862671, "epoch": 3.80154101343036, "grad_norm": 1.015625, "learning_rate": 0.0003620988890066963, "loss": 5.6975, "mean_token_accuracy": 0.16764242947101593, "num_tokens": 76900529.0, "step": 35525 }, { "entropy": 6.2184511661529545, "epoch": 3.802076087538124, "grad_norm": 1.0546875, "learning_rate": 0.0003620636352483399, "loss": 5.8905, "mean_token_accuracy": 0.1633472740650177, "num_tokens": 76911839.0, "step": 35530 }, { "entropy": 6.300917339324951, "epoch": 3.802611161645888, "grad_norm": 0.88671875, "learning_rate": 0.0003620283789760333, "loss": 5.889, "mean_token_accuracy": 0.16140837371349334, "num_tokens": 76922778.0, "step": 35535 }, { "entropy": 6.236767435073853, "epoch": 3.803146235753652, "grad_norm": 0.97265625, "learning_rate": 0.0003619931201907945, "loss": 5.7721, "mean_token_accuracy": 0.1713110014796257, "num_tokens": 76933689.0, "step": 35540 }, { "entropy": 6.126985359191894, "epoch": 3.8036813098614157, "grad_norm": 1.1328125, "learning_rate": 0.00036195785889364153, "loss": 5.7402, "mean_token_accuracy": 0.1814095512032509, "num_tokens": 76945317.0, "step": 35545 }, { "entropy": 6.271120595932007, "epoch": 3.80421638396918, "grad_norm": 0.98828125, "learning_rate": 0.0003619225950855927, "loss": 5.8192, "mean_token_accuracy": 0.1681966930627823, "num_tokens": 76956568.0, "step": 35550 }, { "entropy": 6.311864042282105, "epoch": 3.804751458076944, "grad_norm": 1.0234375, "learning_rate": 0.00036188732876766606, "loss": 5.8655, "mean_token_accuracy": 0.16582102775573732, "num_tokens": 76967630.0, "step": 35555 }, { "entropy": 6.280175399780274, "epoch": 3.8052865321847076, "grad_norm": 1.0625, "learning_rate": 0.0003618520599408801, "loss": 5.8198, "mean_token_accuracy": 0.17071013301610946, "num_tokens": 76978209.0, "step": 35560 }, { "entropy": 6.199865198135376, "epoch": 3.8058216062924712, "grad_norm": 1.0546875, "learning_rate": 0.000361816788606253, "loss": 5.7982, "mean_token_accuracy": 0.16862343847751618, "num_tokens": 76988697.0, "step": 35565 }, { "entropy": 6.2912740230560305, "epoch": 3.8063566804002353, "grad_norm": 1.0078125, "learning_rate": 0.00036178151476480336, "loss": 5.8111, "mean_token_accuracy": 0.16900004595518112, "num_tokens": 76999875.0, "step": 35570 }, { "entropy": 6.3070556163787845, "epoch": 3.8068917545079994, "grad_norm": 1.046875, "learning_rate": 0.00036174623841754973, "loss": 5.8502, "mean_token_accuracy": 0.17214745581150054, "num_tokens": 77009517.0, "step": 35575 }, { "entropy": 6.288237571716309, "epoch": 3.807426828615763, "grad_norm": 1.0546875, "learning_rate": 0.0003617109595655106, "loss": 5.8303, "mean_token_accuracy": 0.16968498080968858, "num_tokens": 77020039.0, "step": 35580 }, { "entropy": 6.3006915092468265, "epoch": 3.807961902723527, "grad_norm": 1.0546875, "learning_rate": 0.0003616756782097047, "loss": 5.9021, "mean_token_accuracy": 0.16186788082122802, "num_tokens": 77030913.0, "step": 35585 }, { "entropy": 6.292887163162232, "epoch": 3.8084969768312913, "grad_norm": 1.0390625, "learning_rate": 0.0003616403943511508, "loss": 5.8602, "mean_token_accuracy": 0.16290036737918853, "num_tokens": 77042011.0, "step": 35590 }, { "entropy": 6.286964464187622, "epoch": 3.809032050939055, "grad_norm": 1.046875, "learning_rate": 0.00036160510799086764, "loss": 5.8442, "mean_token_accuracy": 0.17023030817508697, "num_tokens": 77053267.0, "step": 35595 }, { "entropy": 6.319538259506226, "epoch": 3.809567125046819, "grad_norm": 1.0625, "learning_rate": 0.00036156981912987423, "loss": 5.8999, "mean_token_accuracy": 0.16030094623565674, "num_tokens": 77063736.0, "step": 35600 }, { "entropy": 6.29895052909851, "epoch": 3.810102199154583, "grad_norm": 1.046875, "learning_rate": 0.00036153452776918946, "loss": 5.8818, "mean_token_accuracy": 0.16244445443153382, "num_tokens": 77074373.0, "step": 35605 }, { "entropy": 6.295831251144409, "epoch": 3.810637273262347, "grad_norm": 1.0234375, "learning_rate": 0.00036149923390983236, "loss": 5.9089, "mean_token_accuracy": 0.16184933334589005, "num_tokens": 77084913.0, "step": 35610 }, { "entropy": 6.233998250961304, "epoch": 3.811172347370111, "grad_norm": 1.0546875, "learning_rate": 0.0003614639375528219, "loss": 5.8052, "mean_token_accuracy": 0.16721823662519456, "num_tokens": 77094640.0, "step": 35615 }, { "entropy": 6.265520763397217, "epoch": 3.8117074214778746, "grad_norm": 1.1328125, "learning_rate": 0.00036142863869917754, "loss": 5.7944, "mean_token_accuracy": 0.17177199572324753, "num_tokens": 77104592.0, "step": 35620 }, { "entropy": 6.302064418792725, "epoch": 3.8122424955856387, "grad_norm": 1.0234375, "learning_rate": 0.00036139333734991835, "loss": 5.8731, "mean_token_accuracy": 0.16489900946617125, "num_tokens": 77115074.0, "step": 35625 }, { "entropy": 6.291457271575927, "epoch": 3.8127775696934023, "grad_norm": 1.2265625, "learning_rate": 0.0003613580335060636, "loss": 5.853, "mean_token_accuracy": 0.16355439871549607, "num_tokens": 77126180.0, "step": 35630 }, { "entropy": 6.196222400665283, "epoch": 3.8133126438011664, "grad_norm": 1.15625, "learning_rate": 0.0003613227271686329, "loss": 5.7568, "mean_token_accuracy": 0.1722065880894661, "num_tokens": 77136015.0, "step": 35635 }, { "entropy": 6.354433631896972, "epoch": 3.8138477179089305, "grad_norm": 1.0390625, "learning_rate": 0.0003612874183386455, "loss": 5.8308, "mean_token_accuracy": 0.1643541380763054, "num_tokens": 77145463.0, "step": 35640 }, { "entropy": 6.242501592636108, "epoch": 3.814382792016694, "grad_norm": 1.0546875, "learning_rate": 0.00036125210701712097, "loss": 5.8079, "mean_token_accuracy": 0.16680112183094026, "num_tokens": 77156580.0, "step": 35645 }, { "entropy": 6.2673712253570555, "epoch": 3.8149178661244583, "grad_norm": 0.96875, "learning_rate": 0.0003612167932050791, "loss": 5.8017, "mean_token_accuracy": 0.16163493692874908, "num_tokens": 77167360.0, "step": 35650 }, { "entropy": 6.282958269119263, "epoch": 3.8154529402322224, "grad_norm": 0.9140625, "learning_rate": 0.00036118147690353936, "loss": 5.8418, "mean_token_accuracy": 0.16336119174957275, "num_tokens": 77178462.0, "step": 35655 }, { "entropy": 6.345319223403931, "epoch": 3.815988014339986, "grad_norm": 0.97265625, "learning_rate": 0.0003611461581135216, "loss": 5.8751, "mean_token_accuracy": 0.16105300784111024, "num_tokens": 77189245.0, "step": 35660 }, { "entropy": 6.299059915542602, "epoch": 3.81652308844775, "grad_norm": 0.99609375, "learning_rate": 0.0003611108368360456, "loss": 5.8454, "mean_token_accuracy": 0.1629843831062317, "num_tokens": 77199694.0, "step": 35665 }, { "entropy": 6.1996701717376705, "epoch": 3.817058162555514, "grad_norm": 1.03125, "learning_rate": 0.00036107551307213137, "loss": 5.8341, "mean_token_accuracy": 0.16538988053798676, "num_tokens": 77210503.0, "step": 35670 }, { "entropy": 6.2287757873535154, "epoch": 3.817593236663278, "grad_norm": 1.1171875, "learning_rate": 0.00036104018682279874, "loss": 5.8052, "mean_token_accuracy": 0.17024591714143752, "num_tokens": 77220719.0, "step": 35675 }, { "entropy": 6.2576549530029295, "epoch": 3.8181283107710415, "grad_norm": 1.0625, "learning_rate": 0.0003610048580890678, "loss": 5.7753, "mean_token_accuracy": 0.17588477581739426, "num_tokens": 77231484.0, "step": 35680 }, { "entropy": 6.269144868850708, "epoch": 3.8186633848788056, "grad_norm": 0.99609375, "learning_rate": 0.0003609695268719587, "loss": 5.8092, "mean_token_accuracy": 0.16856183409690856, "num_tokens": 77243193.0, "step": 35685 }, { "entropy": 6.23169732093811, "epoch": 3.8191984589865697, "grad_norm": 1.0078125, "learning_rate": 0.0003609341931724916, "loss": 5.7925, "mean_token_accuracy": 0.17351530492305756, "num_tokens": 77254035.0, "step": 35690 }, { "entropy": 6.315154314041138, "epoch": 3.8197335330943334, "grad_norm": 1.078125, "learning_rate": 0.0003608988569916867, "loss": 5.8286, "mean_token_accuracy": 0.17226627618074417, "num_tokens": 77264352.0, "step": 35695 }, { "entropy": 6.3072206497192385, "epoch": 3.8202686072020975, "grad_norm": 0.99609375, "learning_rate": 0.00036086351833056435, "loss": 5.8274, "mean_token_accuracy": 0.1708344981074333, "num_tokens": 77275419.0, "step": 35700 }, { "entropy": 6.2786191463470455, "epoch": 3.8208036813098616, "grad_norm": 1.140625, "learning_rate": 0.0003608281771901451, "loss": 5.8213, "mean_token_accuracy": 0.1677725151181221, "num_tokens": 77286479.0, "step": 35705 }, { "entropy": 6.285065412521362, "epoch": 3.8213387554176252, "grad_norm": 1.1015625, "learning_rate": 0.00036079283357144914, "loss": 5.8706, "mean_token_accuracy": 0.1617795392870903, "num_tokens": 77298369.0, "step": 35710 }, { "entropy": 6.236964273452759, "epoch": 3.8218738295253893, "grad_norm": 1.0078125, "learning_rate": 0.00036075748747549727, "loss": 5.7375, "mean_token_accuracy": 0.1780632257461548, "num_tokens": 77308907.0, "step": 35715 }, { "entropy": 6.304318809509278, "epoch": 3.8224089036331534, "grad_norm": 1.125, "learning_rate": 0.00036072213890331003, "loss": 5.7943, "mean_token_accuracy": 0.17002654075622559, "num_tokens": 77320353.0, "step": 35720 }, { "entropy": 6.2462094783782955, "epoch": 3.822943977740917, "grad_norm": 1.0625, "learning_rate": 0.000360686787855908, "loss": 5.8406, "mean_token_accuracy": 0.16056346148252487, "num_tokens": 77330689.0, "step": 35725 }, { "entropy": 6.196163034439087, "epoch": 3.823479051848681, "grad_norm": 1.03125, "learning_rate": 0.0003606514343343119, "loss": 5.7667, "mean_token_accuracy": 0.17046294659376143, "num_tokens": 77340728.0, "step": 35730 }, { "entropy": 6.299052381515503, "epoch": 3.824014125956445, "grad_norm": 1.0234375, "learning_rate": 0.0003606160783395429, "loss": 5.8356, "mean_token_accuracy": 0.16528089344501495, "num_tokens": 77351696.0, "step": 35735 }, { "entropy": 6.268429756164551, "epoch": 3.824549200064209, "grad_norm": 1.15625, "learning_rate": 0.0003605807198726216, "loss": 5.8203, "mean_token_accuracy": 0.16761292666196823, "num_tokens": 77362029.0, "step": 35740 }, { "entropy": 6.276534700393677, "epoch": 3.8250842741719726, "grad_norm": 1.09375, "learning_rate": 0.0003605453589345689, "loss": 5.8041, "mean_token_accuracy": 0.17053406536579133, "num_tokens": 77372305.0, "step": 35745 }, { "entropy": 6.30539288520813, "epoch": 3.8256193482797367, "grad_norm": 1.0078125, "learning_rate": 0.0003605099955264061, "loss": 5.8131, "mean_token_accuracy": 0.16626768857240676, "num_tokens": 77383251.0, "step": 35750 }, { "entropy": 6.291647005081177, "epoch": 3.826154422387501, "grad_norm": 1.1015625, "learning_rate": 0.0003604746296491542, "loss": 5.772, "mean_token_accuracy": 0.16223314851522447, "num_tokens": 77394596.0, "step": 35755 }, { "entropy": 6.2384950637817385, "epoch": 3.8266894964952645, "grad_norm": 1.0390625, "learning_rate": 0.00036043926130383436, "loss": 5.7007, "mean_token_accuracy": 0.17432086020708085, "num_tokens": 77404884.0, "step": 35760 }, { "entropy": 6.276313066482544, "epoch": 3.8272245706030286, "grad_norm": 1.0703125, "learning_rate": 0.0003604038904914678, "loss": 5.8944, "mean_token_accuracy": 0.15947764068841935, "num_tokens": 77415214.0, "step": 35765 }, { "entropy": 6.209713792800903, "epoch": 3.8277596447107927, "grad_norm": 1.015625, "learning_rate": 0.000360368517213076, "loss": 5.8676, "mean_token_accuracy": 0.16752667725086212, "num_tokens": 77425183.0, "step": 35770 }, { "entropy": 6.30035138130188, "epoch": 3.8282947188185563, "grad_norm": 0.97265625, "learning_rate": 0.0003603331414696802, "loss": 5.8369, "mean_token_accuracy": 0.16262524276971818, "num_tokens": 77436483.0, "step": 35775 }, { "entropy": 6.298367595672607, "epoch": 3.8288297929263204, "grad_norm": 0.9609375, "learning_rate": 0.000360297763262302, "loss": 5.8259, "mean_token_accuracy": 0.16752704679965974, "num_tokens": 77447035.0, "step": 35780 }, { "entropy": 6.3387243270874025, "epoch": 3.829364867034084, "grad_norm": 1.0390625, "learning_rate": 0.00036026238259196275, "loss": 5.823, "mean_token_accuracy": 0.16241919696331025, "num_tokens": 77458015.0, "step": 35785 }, { "entropy": 6.170380687713623, "epoch": 3.829899941141848, "grad_norm": 1.015625, "learning_rate": 0.0003602269994596843, "loss": 5.7392, "mean_token_accuracy": 0.17402630746364595, "num_tokens": 77468751.0, "step": 35790 }, { "entropy": 6.102038145065308, "epoch": 3.830435015249612, "grad_norm": 1.015625, "learning_rate": 0.0003601916138664882, "loss": 5.6772, "mean_token_accuracy": 0.18684207499027253, "num_tokens": 77479727.0, "step": 35795 }, { "entropy": 6.275479364395141, "epoch": 3.830970089357376, "grad_norm": 0.984375, "learning_rate": 0.0003601562258133961, "loss": 5.8147, "mean_token_accuracy": 0.1651994675397873, "num_tokens": 77490542.0, "step": 35800 }, { "entropy": 6.275581359863281, "epoch": 3.83150516346514, "grad_norm": 1.078125, "learning_rate": 0.00036012083530143014, "loss": 5.8454, "mean_token_accuracy": 0.16770517230033874, "num_tokens": 77500798.0, "step": 35805 }, { "entropy": 6.292004108428955, "epoch": 3.8320402375729037, "grad_norm": 1.0234375, "learning_rate": 0.0003600854423316119, "loss": 5.8764, "mean_token_accuracy": 0.16641412824392318, "num_tokens": 77511920.0, "step": 35810 }, { "entropy": 6.245090055465698, "epoch": 3.832575311680668, "grad_norm": 0.984375, "learning_rate": 0.0003600500469049635, "loss": 5.7925, "mean_token_accuracy": 0.16010576486587524, "num_tokens": 77522971.0, "step": 35815 }, { "entropy": 6.249296092987061, "epoch": 3.833110385788432, "grad_norm": 1.03125, "learning_rate": 0.00036001464902250693, "loss": 5.8579, "mean_token_accuracy": 0.1593555375933647, "num_tokens": 77533868.0, "step": 35820 }, { "entropy": 6.2390885829925535, "epoch": 3.8336454598961955, "grad_norm": 1.15625, "learning_rate": 0.00035997924868526435, "loss": 5.7862, "mean_token_accuracy": 0.16607200354337692, "num_tokens": 77544166.0, "step": 35825 }, { "entropy": 6.2872161865234375, "epoch": 3.8341805340039596, "grad_norm": 1.0546875, "learning_rate": 0.0003599438458942579, "loss": 5.736, "mean_token_accuracy": 0.17424460202455522, "num_tokens": 77555031.0, "step": 35830 }, { "entropy": 6.290793752670288, "epoch": 3.8347156081117237, "grad_norm": 1.0703125, "learning_rate": 0.00035990844065050977, "loss": 5.8166, "mean_token_accuracy": 0.1685725301504135, "num_tokens": 77565406.0, "step": 35835 }, { "entropy": 6.255692863464356, "epoch": 3.8352506822194874, "grad_norm": 1.0546875, "learning_rate": 0.00035987303295504237, "loss": 5.8606, "mean_token_accuracy": 0.16985175013542175, "num_tokens": 77576794.0, "step": 35840 }, { "entropy": 6.316875886917114, "epoch": 3.835785756327251, "grad_norm": 1.1015625, "learning_rate": 0.0003598376228088781, "loss": 5.8285, "mean_token_accuracy": 0.16490305215120316, "num_tokens": 77587727.0, "step": 35845 }, { "entropy": 6.2760453701019285, "epoch": 3.836320830435015, "grad_norm": 1.0546875, "learning_rate": 0.0003598022102130394, "loss": 5.8619, "mean_token_accuracy": 0.1645622193813324, "num_tokens": 77598576.0, "step": 35850 }, { "entropy": 6.32831974029541, "epoch": 3.8368559045427792, "grad_norm": 1.03125, "learning_rate": 0.00035976679516854876, "loss": 5.8435, "mean_token_accuracy": 0.16481590569019317, "num_tokens": 77609774.0, "step": 35855 }, { "entropy": 6.25217022895813, "epoch": 3.837390978650543, "grad_norm": 1.0234375, "learning_rate": 0.0003597313776764289, "loss": 5.8056, "mean_token_accuracy": 0.16425235643982888, "num_tokens": 77621304.0, "step": 35860 }, { "entropy": 6.2980499267578125, "epoch": 3.837926052758307, "grad_norm": 1.109375, "learning_rate": 0.00035969595773770223, "loss": 5.896, "mean_token_accuracy": 0.16278338581323623, "num_tokens": 77632574.0, "step": 35865 }, { "entropy": 6.32668514251709, "epoch": 3.838461126866071, "grad_norm": 0.984375, "learning_rate": 0.00035966053535339186, "loss": 5.8799, "mean_token_accuracy": 0.1555795967578888, "num_tokens": 77644397.0, "step": 35870 }, { "entropy": 6.302745246887207, "epoch": 3.8389962009738348, "grad_norm": 1.1015625, "learning_rate": 0.0003596251105245204, "loss": 5.8691, "mean_token_accuracy": 0.16325343251228333, "num_tokens": 77654467.0, "step": 35875 }, { "entropy": 6.21653733253479, "epoch": 3.839531275081599, "grad_norm": 0.984375, "learning_rate": 0.0003595896832521107, "loss": 5.8133, "mean_token_accuracy": 0.16927894353866577, "num_tokens": 77665337.0, "step": 35880 }, { "entropy": 6.381551265716553, "epoch": 3.840066349189363, "grad_norm": 1.0703125, "learning_rate": 0.0003595542535371859, "loss": 5.9487, "mean_token_accuracy": 0.15942352265119553, "num_tokens": 77677477.0, "step": 35885 }, { "entropy": 6.330146455764771, "epoch": 3.8406014232971266, "grad_norm": 1.0, "learning_rate": 0.0003595188213807688, "loss": 5.8967, "mean_token_accuracy": 0.15725045651197433, "num_tokens": 77688702.0, "step": 35890 }, { "entropy": 6.272120618820191, "epoch": 3.8411364974048907, "grad_norm": 1.0390625, "learning_rate": 0.00035948338678388266, "loss": 5.7602, "mean_token_accuracy": 0.164625683426857, "num_tokens": 77699099.0, "step": 35895 }, { "entropy": 6.252753400802613, "epoch": 3.8416715715126544, "grad_norm": 1.1953125, "learning_rate": 0.00035944794974755056, "loss": 5.8605, "mean_token_accuracy": 0.16059330552816392, "num_tokens": 77710676.0, "step": 35900 }, { "entropy": 6.324840784072876, "epoch": 3.8422066456204185, "grad_norm": 1.09375, "learning_rate": 0.0003594125102727958, "loss": 5.8174, "mean_token_accuracy": 0.1599571257829666, "num_tokens": 77720574.0, "step": 35905 }, { "entropy": 6.284859228134155, "epoch": 3.842741719728182, "grad_norm": 1.140625, "learning_rate": 0.00035937706836064166, "loss": 5.8603, "mean_token_accuracy": 0.17022818922996522, "num_tokens": 77732052.0, "step": 35910 }, { "entropy": 6.313472890853882, "epoch": 3.8432767938359462, "grad_norm": 1.078125, "learning_rate": 0.00035934162401211157, "loss": 5.8773, "mean_token_accuracy": 0.1651669055223465, "num_tokens": 77742327.0, "step": 35915 }, { "entropy": 6.261625862121582, "epoch": 3.8438118679437103, "grad_norm": 0.9453125, "learning_rate": 0.0003593061772282289, "loss": 5.9024, "mean_token_accuracy": 0.16134581714868546, "num_tokens": 77753857.0, "step": 35920 }, { "entropy": 6.257109022140503, "epoch": 3.844346942051474, "grad_norm": 1.0390625, "learning_rate": 0.0003592707280100172, "loss": 5.7963, "mean_token_accuracy": 0.1698404520750046, "num_tokens": 77764896.0, "step": 35925 }, { "entropy": 6.366816711425781, "epoch": 3.844882016159238, "grad_norm": 1.046875, "learning_rate": 0.00035923527635850006, "loss": 5.8814, "mean_token_accuracy": 0.16431044787168503, "num_tokens": 77776038.0, "step": 35930 }, { "entropy": 6.2763347148895265, "epoch": 3.845417090267002, "grad_norm": 0.9921875, "learning_rate": 0.0003591998222747012, "loss": 5.8743, "mean_token_accuracy": 0.16756754517555236, "num_tokens": 77786680.0, "step": 35935 }, { "entropy": 6.181291913986206, "epoch": 3.845952164374766, "grad_norm": 1.0390625, "learning_rate": 0.0003591643657596443, "loss": 5.8204, "mean_token_accuracy": 0.17224584072828292, "num_tokens": 77797076.0, "step": 35940 }, { "entropy": 6.25885238647461, "epoch": 3.84648723848253, "grad_norm": 1.109375, "learning_rate": 0.0003591289068143531, "loss": 5.796, "mean_token_accuracy": 0.1670084461569786, "num_tokens": 77807401.0, "step": 35945 }, { "entropy": 6.294942808151245, "epoch": 3.8470223125902936, "grad_norm": 1.0703125, "learning_rate": 0.00035909344543985167, "loss": 5.8749, "mean_token_accuracy": 0.16885351687669753, "num_tokens": 77817440.0, "step": 35950 }, { "entropy": 6.290264081954956, "epoch": 3.8475573866980577, "grad_norm": 1.0625, "learning_rate": 0.0003590579816371637, "loss": 5.9071, "mean_token_accuracy": 0.16409295052289963, "num_tokens": 77828275.0, "step": 35955 }, { "entropy": 6.30547251701355, "epoch": 3.8480924608058213, "grad_norm": 1.046875, "learning_rate": 0.00035902251540731336, "loss": 5.864, "mean_token_accuracy": 0.16861941814422607, "num_tokens": 77838744.0, "step": 35960 }, { "entropy": 6.284854984283447, "epoch": 3.8486275349135854, "grad_norm": 0.9921875, "learning_rate": 0.00035898704675132466, "loss": 5.833, "mean_token_accuracy": 0.16761332601308823, "num_tokens": 77850030.0, "step": 35965 }, { "entropy": 6.353755474090576, "epoch": 3.8491626090213495, "grad_norm": 1.0390625, "learning_rate": 0.0003589515756702218, "loss": 5.8854, "mean_token_accuracy": 0.16288974434137343, "num_tokens": 77861480.0, "step": 35970 }, { "entropy": 6.264103841781616, "epoch": 3.849697683129113, "grad_norm": 1.0, "learning_rate": 0.000358916102165029, "loss": 5.7766, "mean_token_accuracy": 0.16118398755788804, "num_tokens": 77873084.0, "step": 35975 }, { "entropy": 6.279567813873291, "epoch": 3.8502327572368773, "grad_norm": 1.0625, "learning_rate": 0.0003588806262367705, "loss": 5.8641, "mean_token_accuracy": 0.15943923443555832, "num_tokens": 77884149.0, "step": 35980 }, { "entropy": 6.235141181945801, "epoch": 3.8507678313446414, "grad_norm": 0.97265625, "learning_rate": 0.0003588451478864708, "loss": 5.8465, "mean_token_accuracy": 0.16400722563266754, "num_tokens": 77894836.0, "step": 35985 }, { "entropy": 6.283959627151489, "epoch": 3.851302905452405, "grad_norm": 1.0546875, "learning_rate": 0.00035880966711515427, "loss": 5.867, "mean_token_accuracy": 0.16262612193822862, "num_tokens": 77906574.0, "step": 35990 }, { "entropy": 6.342265224456787, "epoch": 3.851837979560169, "grad_norm": 0.9765625, "learning_rate": 0.0003587741839238452, "loss": 5.8511, "mean_token_accuracy": 0.1607644721865654, "num_tokens": 77917242.0, "step": 35995 }, { "entropy": 6.297548913955689, "epoch": 3.8523730536679333, "grad_norm": 1.0703125, "learning_rate": 0.0003587386983135685, "loss": 5.8425, "mean_token_accuracy": 0.1673976957798004, "num_tokens": 77927654.0, "step": 36000 }, { "epoch": 3.8523730536679333, "eval_entropy": 6.051930485838507, "eval_loss": 5.961282730102539, "eval_mean_token_accuracy": 0.16792737664278307, "eval_num_tokens": 77927654.0, "eval_runtime": 22.4431, "eval_samples_per_second": 1322.412, "eval_steps_per_second": 165.307, "step": 36000 }, { "entropy": 6.3046587944030765, "epoch": 3.852908127775697, "grad_norm": 1.0390625, "learning_rate": 0.00035870321028534863, "loss": 5.8507, "mean_token_accuracy": 0.16569745242595674, "num_tokens": 77939351.0, "step": 36005 }, { "entropy": 6.260647773742676, "epoch": 3.853443201883461, "grad_norm": 1.0625, "learning_rate": 0.0003586677198402102, "loss": 5.8074, "mean_token_accuracy": 0.16930219978094102, "num_tokens": 77950283.0, "step": 36010 }, { "entropy": 6.325207281112671, "epoch": 3.8539782759912247, "grad_norm": 1.1015625, "learning_rate": 0.0003586322269791783, "loss": 5.8038, "mean_token_accuracy": 0.16919428557157518, "num_tokens": 77960584.0, "step": 36015 }, { "entropy": 6.234644174575806, "epoch": 3.8545133500989888, "grad_norm": 1.1171875, "learning_rate": 0.00035859673170327743, "loss": 5.8645, "mean_token_accuracy": 0.1646178647875786, "num_tokens": 77971071.0, "step": 36020 }, { "entropy": 6.26893458366394, "epoch": 3.8550484242067524, "grad_norm": 1.0, "learning_rate": 0.00035856123401353275, "loss": 5.9294, "mean_token_accuracy": 0.15992742031812668, "num_tokens": 77981798.0, "step": 36025 }, { "entropy": 6.308112859725952, "epoch": 3.8555834983145165, "grad_norm": 0.98828125, "learning_rate": 0.0003585257339109692, "loss": 5.8351, "mean_token_accuracy": 0.161192786693573, "num_tokens": 77992020.0, "step": 36030 }, { "entropy": 6.244516181945801, "epoch": 3.8561185724222806, "grad_norm": 1.0546875, "learning_rate": 0.0003584902313966118, "loss": 5.7762, "mean_token_accuracy": 0.17786858528852462, "num_tokens": 78002281.0, "step": 36035 }, { "entropy": 6.300917339324951, "epoch": 3.8566536465300443, "grad_norm": 1.125, "learning_rate": 0.0003584547264714857, "loss": 5.8393, "mean_token_accuracy": 0.16790589392185212, "num_tokens": 78013135.0, "step": 36040 }, { "entropy": 6.287045621871949, "epoch": 3.8571887206378084, "grad_norm": 1.0078125, "learning_rate": 0.0003584192191366161, "loss": 5.7932, "mean_token_accuracy": 0.16770485341548919, "num_tokens": 78024050.0, "step": 36045 }, { "entropy": 6.265486192703247, "epoch": 3.8577237947455725, "grad_norm": 0.97265625, "learning_rate": 0.0003583837093930283, "loss": 5.8338, "mean_token_accuracy": 0.16543822586536408, "num_tokens": 78036175.0, "step": 36050 }, { "entropy": 6.287726402282715, "epoch": 3.858258868853336, "grad_norm": 0.96484375, "learning_rate": 0.00035834819724174754, "loss": 5.8658, "mean_token_accuracy": 0.17394015341997146, "num_tokens": 78047213.0, "step": 36055 }, { "entropy": 6.3623124122619625, "epoch": 3.8587939429611002, "grad_norm": 1.0546875, "learning_rate": 0.00035831268268379936, "loss": 5.8674, "mean_token_accuracy": 0.157046902179718, "num_tokens": 78057724.0, "step": 36060 }, { "entropy": 6.306342744827271, "epoch": 3.859329017068864, "grad_norm": 1.0, "learning_rate": 0.0003582771657202092, "loss": 5.8403, "mean_token_accuracy": 0.1685158431529999, "num_tokens": 78068596.0, "step": 36065 }, { "entropy": 6.301570081710816, "epoch": 3.859864091176628, "grad_norm": 1.046875, "learning_rate": 0.0003582416463520025, "loss": 5.8853, "mean_token_accuracy": 0.15786084085702895, "num_tokens": 78080106.0, "step": 36070 }, { "entropy": 6.327068281173706, "epoch": 3.8603991652843916, "grad_norm": 1.03125, "learning_rate": 0.000358206124580205, "loss": 5.9426, "mean_token_accuracy": 0.1574598118662834, "num_tokens": 78090479.0, "step": 36075 }, { "entropy": 6.338676595687867, "epoch": 3.8609342393921557, "grad_norm": 1.09375, "learning_rate": 0.0003581706004058424, "loss": 5.9362, "mean_token_accuracy": 0.1588417559862137, "num_tokens": 78101619.0, "step": 36080 }, { "entropy": 6.310629940032959, "epoch": 3.86146931349992, "grad_norm": 1.109375, "learning_rate": 0.00035813507382994025, "loss": 5.8056, "mean_token_accuracy": 0.16725719571113587, "num_tokens": 78112731.0, "step": 36085 }, { "entropy": 6.29030122756958, "epoch": 3.8620043876076835, "grad_norm": 1.1328125, "learning_rate": 0.0003580995448535246, "loss": 5.7531, "mean_token_accuracy": 0.16699458062648773, "num_tokens": 78124739.0, "step": 36090 }, { "entropy": 6.240477752685547, "epoch": 3.8625394617154476, "grad_norm": 1.0703125, "learning_rate": 0.0003580640134776213, "loss": 5.7946, "mean_token_accuracy": 0.16899154484272003, "num_tokens": 78135558.0, "step": 36095 }, { "entropy": 6.264164543151855, "epoch": 3.8630745358232117, "grad_norm": 0.98046875, "learning_rate": 0.0003580284797032563, "loss": 5.8296, "mean_token_accuracy": 0.1677076868712902, "num_tokens": 78145965.0, "step": 36100 }, { "entropy": 6.2039406299591064, "epoch": 3.8636096099309754, "grad_norm": 1.0546875, "learning_rate": 0.00035799294353145556, "loss": 5.8241, "mean_token_accuracy": 0.172109255194664, "num_tokens": 78157035.0, "step": 36105 }, { "entropy": 6.29672269821167, "epoch": 3.8641446840387395, "grad_norm": 1.0234375, "learning_rate": 0.0003579574049632452, "loss": 5.9003, "mean_token_accuracy": 0.161281980574131, "num_tokens": 78167439.0, "step": 36110 }, { "entropy": 6.325206661224366, "epoch": 3.8646797581465036, "grad_norm": 1.1484375, "learning_rate": 0.00035792186399965153, "loss": 5.8076, "mean_token_accuracy": 0.1706557974219322, "num_tokens": 78178932.0, "step": 36115 }, { "entropy": 6.332744550704956, "epoch": 3.865214832254267, "grad_norm": 1.03125, "learning_rate": 0.00035788632064170066, "loss": 5.8771, "mean_token_accuracy": 0.16194129437208177, "num_tokens": 78188576.0, "step": 36120 }, { "entropy": 6.2377769947052, "epoch": 3.8657499063620313, "grad_norm": 0.9921875, "learning_rate": 0.0003578507748904189, "loss": 5.8845, "mean_token_accuracy": 0.16167293787002562, "num_tokens": 78198971.0, "step": 36125 }, { "entropy": 6.2774810791015625, "epoch": 3.866284980469795, "grad_norm": 0.9921875, "learning_rate": 0.0003578152267468327, "loss": 5.8054, "mean_token_accuracy": 0.17032752335071563, "num_tokens": 78209278.0, "step": 36130 }, { "entropy": 6.331102466583252, "epoch": 3.866820054577559, "grad_norm": 1.140625, "learning_rate": 0.00035777967621196844, "loss": 5.8213, "mean_token_accuracy": 0.16893599629402162, "num_tokens": 78221019.0, "step": 36135 }, { "entropy": 6.302792119979858, "epoch": 3.8673551286853227, "grad_norm": 1.0234375, "learning_rate": 0.00035774412328685263, "loss": 5.8544, "mean_token_accuracy": 0.16384365409612656, "num_tokens": 78232448.0, "step": 36140 }, { "entropy": 6.263749599456787, "epoch": 3.867890202793087, "grad_norm": 1.03125, "learning_rate": 0.00035770856797251194, "loss": 5.8443, "mean_token_accuracy": 0.16548540592193603, "num_tokens": 78243225.0, "step": 36145 }, { "entropy": 6.282962369918823, "epoch": 3.868425276900851, "grad_norm": 0.93359375, "learning_rate": 0.00035767301026997294, "loss": 5.8693, "mean_token_accuracy": 0.15905255675315857, "num_tokens": 78254861.0, "step": 36150 }, { "entropy": 6.287518692016602, "epoch": 3.8689603510086146, "grad_norm": 1.140625, "learning_rate": 0.0003576374501802624, "loss": 5.8265, "mean_token_accuracy": 0.1721632421016693, "num_tokens": 78264639.0, "step": 36155 }, { "entropy": 6.3035060405731205, "epoch": 3.8694954251163787, "grad_norm": 1.078125, "learning_rate": 0.00035760188770440703, "loss": 5.8252, "mean_token_accuracy": 0.1705810934305191, "num_tokens": 78274758.0, "step": 36160 }, { "entropy": 6.303821468353272, "epoch": 3.8700304992241428, "grad_norm": 0.96875, "learning_rate": 0.0003575663228434339, "loss": 5.8593, "mean_token_accuracy": 0.16206761077046394, "num_tokens": 78285487.0, "step": 36165 }, { "entropy": 6.262525749206543, "epoch": 3.8705655733319064, "grad_norm": 1.0703125, "learning_rate": 0.0003575307555983697, "loss": 5.8484, "mean_token_accuracy": 0.164113150537014, "num_tokens": 78295806.0, "step": 36170 }, { "entropy": 6.3421714305877686, "epoch": 3.8711006474396705, "grad_norm": 1.0078125, "learning_rate": 0.00035749518597024153, "loss": 5.9399, "mean_token_accuracy": 0.17167294323444365, "num_tokens": 78307836.0, "step": 36175 }, { "entropy": 6.3413022518157955, "epoch": 3.871635721547434, "grad_norm": 1.0078125, "learning_rate": 0.0003574596139600765, "loss": 5.8426, "mean_token_accuracy": 0.16607799232006074, "num_tokens": 78319282.0, "step": 36180 }, { "entropy": 6.310227251052856, "epoch": 3.8721707956551983, "grad_norm": 1.078125, "learning_rate": 0.00035742403956890166, "loss": 5.8864, "mean_token_accuracy": 0.16553569883108138, "num_tokens": 78329781.0, "step": 36185 }, { "entropy": 6.306573915481567, "epoch": 3.872705869762962, "grad_norm": 1.0234375, "learning_rate": 0.0003573884627977443, "loss": 5.8555, "mean_token_accuracy": 0.166606904566288, "num_tokens": 78341075.0, "step": 36190 }, { "entropy": 6.265133666992187, "epoch": 3.873240943870726, "grad_norm": 1.0078125, "learning_rate": 0.00035735288364763165, "loss": 5.8924, "mean_token_accuracy": 0.16831295639276506, "num_tokens": 78353185.0, "step": 36195 }, { "entropy": 6.324784278869629, "epoch": 3.87377601797849, "grad_norm": 1.0703125, "learning_rate": 0.00035731730211959107, "loss": 5.8443, "mean_token_accuracy": 0.16487956792116165, "num_tokens": 78363459.0, "step": 36200 }, { "entropy": 6.250091409683227, "epoch": 3.874311092086254, "grad_norm": 1.0390625, "learning_rate": 0.0003572817182146499, "loss": 5.7849, "mean_token_accuracy": 0.17346064001321793, "num_tokens": 78374545.0, "step": 36205 }, { "entropy": 6.234345531463623, "epoch": 3.874846166194018, "grad_norm": 1.09375, "learning_rate": 0.0003572461319338357, "loss": 5.8408, "mean_token_accuracy": 0.16593010276556014, "num_tokens": 78386996.0, "step": 36210 }, { "entropy": 6.318127679824829, "epoch": 3.875381240301782, "grad_norm": 1.0703125, "learning_rate": 0.000357210543278176, "loss": 5.8526, "mean_token_accuracy": 0.1667104631662369, "num_tokens": 78397541.0, "step": 36215 }, { "entropy": 6.239848947525024, "epoch": 3.8759163144095456, "grad_norm": 1.0390625, "learning_rate": 0.00035717495224869844, "loss": 5.8227, "mean_token_accuracy": 0.16831468790769577, "num_tokens": 78408564.0, "step": 36220 }, { "entropy": 6.292734527587891, "epoch": 3.8764513885173097, "grad_norm": 0.94921875, "learning_rate": 0.0003571393588464307, "loss": 5.8798, "mean_token_accuracy": 0.16257468461990357, "num_tokens": 78419402.0, "step": 36225 }, { "entropy": 6.358195447921753, "epoch": 3.876986462625074, "grad_norm": 1.1015625, "learning_rate": 0.0003571037630724005, "loss": 5.8478, "mean_token_accuracy": 0.16404517441987992, "num_tokens": 78428749.0, "step": 36230 }, { "entropy": 6.221303081512451, "epoch": 3.8775215367328375, "grad_norm": 1.0234375, "learning_rate": 0.0003570681649276356, "loss": 5.7793, "mean_token_accuracy": 0.18045897036790848, "num_tokens": 78438882.0, "step": 36235 }, { "entropy": 6.236792039871216, "epoch": 3.878056610840601, "grad_norm": 1.125, "learning_rate": 0.000357032564413164, "loss": 5.8663, "mean_token_accuracy": 0.16735683679580687, "num_tokens": 78448930.0, "step": 36240 }, { "entropy": 6.294718456268311, "epoch": 3.8785916849483653, "grad_norm": 1.0390625, "learning_rate": 0.0003569969615300137, "loss": 5.9033, "mean_token_accuracy": 0.16925422698259354, "num_tokens": 78460301.0, "step": 36245 }, { "entropy": 6.306179237365723, "epoch": 3.8791267590561294, "grad_norm": 0.98828125, "learning_rate": 0.0003569613562792126, "loss": 5.7847, "mean_token_accuracy": 0.16314692348241805, "num_tokens": 78470527.0, "step": 36250 }, { "entropy": 6.302246522903443, "epoch": 3.879661833163893, "grad_norm": 1.0, "learning_rate": 0.00035692574866178883, "loss": 5.8841, "mean_token_accuracy": 0.15660009235143663, "num_tokens": 78482632.0, "step": 36255 }, { "entropy": 6.3071129322052, "epoch": 3.880196907271657, "grad_norm": 0.98828125, "learning_rate": 0.0003568901386787707, "loss": 5.9185, "mean_token_accuracy": 0.1608898714184761, "num_tokens": 78493777.0, "step": 36260 }, { "entropy": 6.276233053207397, "epoch": 3.880731981379421, "grad_norm": 1.0234375, "learning_rate": 0.0003568545263311862, "loss": 5.8108, "mean_token_accuracy": 0.16806600987911224, "num_tokens": 78504617.0, "step": 36265 }, { "entropy": 6.278386116027832, "epoch": 3.881267055487185, "grad_norm": 0.94921875, "learning_rate": 0.0003568189116200638, "loss": 5.8731, "mean_token_accuracy": 0.16740960031747817, "num_tokens": 78516007.0, "step": 36270 }, { "entropy": 6.251414680480957, "epoch": 3.881802129594949, "grad_norm": 1.2578125, "learning_rate": 0.0003567832945464319, "loss": 5.8174, "mean_token_accuracy": 0.1623209908604622, "num_tokens": 78527263.0, "step": 36275 }, { "entropy": 6.322605609893799, "epoch": 3.882337203702713, "grad_norm": 1.046875, "learning_rate": 0.0003567476751113187, "loss": 5.8068, "mean_token_accuracy": 0.17044685333967208, "num_tokens": 78538690.0, "step": 36280 }, { "entropy": 6.3256934642791744, "epoch": 3.8828722778104767, "grad_norm": 0.98828125, "learning_rate": 0.000356712053315753, "loss": 5.8102, "mean_token_accuracy": 0.17111668586730958, "num_tokens": 78548436.0, "step": 36285 }, { "entropy": 6.254909181594849, "epoch": 3.883407351918241, "grad_norm": 1.0078125, "learning_rate": 0.00035667642916076313, "loss": 5.7713, "mean_token_accuracy": 0.17160792499780655, "num_tokens": 78559533.0, "step": 36290 }, { "entropy": 6.33972659111023, "epoch": 3.8839424260260045, "grad_norm": 1.078125, "learning_rate": 0.00035664080264737795, "loss": 5.8559, "mean_token_accuracy": 0.16869236826896666, "num_tokens": 78569857.0, "step": 36295 }, { "entropy": 6.306995630264282, "epoch": 3.8844775001337686, "grad_norm": 0.97265625, "learning_rate": 0.00035660517377662603, "loss": 5.7936, "mean_token_accuracy": 0.16722323894500732, "num_tokens": 78580776.0, "step": 36300 }, { "entropy": 6.28712830543518, "epoch": 3.8850125742415322, "grad_norm": 0.99609375, "learning_rate": 0.00035656954254953616, "loss": 5.836, "mean_token_accuracy": 0.16143172979354858, "num_tokens": 78591799.0, "step": 36305 }, { "entropy": 6.295106744766235, "epoch": 3.8855476483492963, "grad_norm": 1.15625, "learning_rate": 0.00035653390896713726, "loss": 5.8538, "mean_token_accuracy": 0.1623251974582672, "num_tokens": 78602295.0, "step": 36310 }, { "entropy": 6.252322053909301, "epoch": 3.8860827224570604, "grad_norm": 0.9609375, "learning_rate": 0.0003564982730304581, "loss": 5.7906, "mean_token_accuracy": 0.16845737546682357, "num_tokens": 78612781.0, "step": 36315 }, { "entropy": 6.296971988677979, "epoch": 3.886617796564824, "grad_norm": 1.1484375, "learning_rate": 0.00035646263474052787, "loss": 5.8439, "mean_token_accuracy": 0.15743595212697983, "num_tokens": 78623271.0, "step": 36320 }, { "entropy": 6.214691305160523, "epoch": 3.887152870672588, "grad_norm": 1.015625, "learning_rate": 0.00035642699409837547, "loss": 5.7588, "mean_token_accuracy": 0.1761892169713974, "num_tokens": 78633352.0, "step": 36325 }, { "entropy": 6.2765968322753904, "epoch": 3.8876879447803523, "grad_norm": 1.0546875, "learning_rate": 0.00035639135110503, "loss": 5.8834, "mean_token_accuracy": 0.162577223777771, "num_tokens": 78644256.0, "step": 36330 }, { "entropy": 6.086524200439453, "epoch": 3.888223018888116, "grad_norm": 1.015625, "learning_rate": 0.0003563557057615208, "loss": 5.6563, "mean_token_accuracy": 0.19247435927391052, "num_tokens": 78654841.0, "step": 36335 }, { "entropy": 6.292187833786011, "epoch": 3.88875809299588, "grad_norm": 1.0703125, "learning_rate": 0.00035632005806887694, "loss": 5.824, "mean_token_accuracy": 0.17172516286373138, "num_tokens": 78664852.0, "step": 36340 }, { "entropy": 6.3009706974029545, "epoch": 3.8892931671036437, "grad_norm": 1.0546875, "learning_rate": 0.00035628440802812795, "loss": 5.8554, "mean_token_accuracy": 0.16082558929920196, "num_tokens": 78675356.0, "step": 36345 }, { "entropy": 6.191872882843017, "epoch": 3.889828241211408, "grad_norm": 1.09375, "learning_rate": 0.000356248755640303, "loss": 5.7205, "mean_token_accuracy": 0.17071663290262223, "num_tokens": 78686833.0, "step": 36350 }, { "entropy": 6.159688901901245, "epoch": 3.8903633153191715, "grad_norm": 1.0078125, "learning_rate": 0.0003562131009064317, "loss": 5.8088, "mean_token_accuracy": 0.16639503687620164, "num_tokens": 78697717.0, "step": 36355 }, { "entropy": 6.177570724487305, "epoch": 3.8908983894269356, "grad_norm": 1.0625, "learning_rate": 0.0003561774438275435, "loss": 5.8024, "mean_token_accuracy": 0.167417673766613, "num_tokens": 78707702.0, "step": 36360 }, { "entropy": 6.224910306930542, "epoch": 3.8914334635346997, "grad_norm": 1.046875, "learning_rate": 0.00035614178440466804, "loss": 5.7296, "mean_token_accuracy": 0.17706180810928346, "num_tokens": 78717523.0, "step": 36365 }, { "entropy": 6.288699531555176, "epoch": 3.8919685376424633, "grad_norm": 1.125, "learning_rate": 0.00035610612263883493, "loss": 5.8298, "mean_token_accuracy": 0.1668693631887436, "num_tokens": 78727837.0, "step": 36370 }, { "entropy": 6.277309942245483, "epoch": 3.8925036117502274, "grad_norm": 1.03125, "learning_rate": 0.0003560704585310739, "loss": 5.8561, "mean_token_accuracy": 0.16687612384557723, "num_tokens": 78740229.0, "step": 36375 }, { "entropy": 6.3078514575958256, "epoch": 3.8930386858579915, "grad_norm": 1.1015625, "learning_rate": 0.00035603479208241477, "loss": 5.8047, "mean_token_accuracy": 0.17354462891817093, "num_tokens": 78750769.0, "step": 36380 }, { "entropy": 6.193707990646362, "epoch": 3.893573759965755, "grad_norm": 1.078125, "learning_rate": 0.00035599912329388743, "loss": 5.7981, "mean_token_accuracy": 0.17444450706243514, "num_tokens": 78762065.0, "step": 36385 }, { "entropy": 6.267618942260742, "epoch": 3.8941088340735193, "grad_norm": 1.1484375, "learning_rate": 0.00035596345216652183, "loss": 5.8412, "mean_token_accuracy": 0.17130796164274215, "num_tokens": 78773907.0, "step": 36390 }, { "entropy": 6.324663829803467, "epoch": 3.8946439081812834, "grad_norm": 1.0625, "learning_rate": 0.0003559277787013479, "loss": 5.898, "mean_token_accuracy": 0.16542583107948303, "num_tokens": 78784314.0, "step": 36395 }, { "entropy": 6.248802900314331, "epoch": 3.895178982289047, "grad_norm": 0.91015625, "learning_rate": 0.00035589210289939567, "loss": 5.8723, "mean_token_accuracy": 0.1656489610671997, "num_tokens": 78795949.0, "step": 36400 }, { "entropy": 6.316931200027466, "epoch": 3.895714056396811, "grad_norm": 0.96484375, "learning_rate": 0.0003558564247616953, "loss": 5.8507, "mean_token_accuracy": 0.1754690185189247, "num_tokens": 78806676.0, "step": 36405 }, { "entropy": 6.371664762496948, "epoch": 3.8962491305045748, "grad_norm": 1.0546875, "learning_rate": 0.0003558207442892772, "loss": 5.9296, "mean_token_accuracy": 0.15978821814060212, "num_tokens": 78817416.0, "step": 36410 }, { "entropy": 6.18971438407898, "epoch": 3.896784204612339, "grad_norm": 1.046875, "learning_rate": 0.0003557850614831714, "loss": 5.708, "mean_token_accuracy": 0.1740609109401703, "num_tokens": 78827826.0, "step": 36415 }, { "entropy": 6.156196641921997, "epoch": 3.8973192787201025, "grad_norm": 1.0078125, "learning_rate": 0.0003557493763444083, "loss": 5.7875, "mean_token_accuracy": 0.16727984845638275, "num_tokens": 78838575.0, "step": 36420 }, { "entropy": 6.235447359085083, "epoch": 3.8978543528278666, "grad_norm": 1.0390625, "learning_rate": 0.0003557136888740183, "loss": 5.712, "mean_token_accuracy": 0.18018140345811845, "num_tokens": 78848439.0, "step": 36425 }, { "entropy": 6.2610077381134035, "epoch": 3.8983894269356307, "grad_norm": 1.078125, "learning_rate": 0.00035567799907303176, "loss": 5.7622, "mean_token_accuracy": 0.17579874843358995, "num_tokens": 78858453.0, "step": 36430 }, { "entropy": 6.261638402938843, "epoch": 3.8989245010433944, "grad_norm": 1.03125, "learning_rate": 0.00035564230694247944, "loss": 5.8655, "mean_token_accuracy": 0.16307085901498794, "num_tokens": 78870428.0, "step": 36435 }, { "entropy": 6.254569959640503, "epoch": 3.8994595751511585, "grad_norm": 1.0546875, "learning_rate": 0.00035560661248339187, "loss": 5.7312, "mean_token_accuracy": 0.16772444546222687, "num_tokens": 78880082.0, "step": 36440 }, { "entropy": 6.294638204574585, "epoch": 3.8999946492589226, "grad_norm": 1.015625, "learning_rate": 0.0003555709156967997, "loss": 5.8496, "mean_token_accuracy": 0.16874850839376448, "num_tokens": 78891312.0, "step": 36445 }, { "entropy": 6.173191738128662, "epoch": 3.9005297233666862, "grad_norm": 0.92578125, "learning_rate": 0.00035553521658373356, "loss": 5.7279, "mean_token_accuracy": 0.17557573020458223, "num_tokens": 78902437.0, "step": 36450 }, { "entropy": 6.187427759170532, "epoch": 3.9010647974744503, "grad_norm": 1.015625, "learning_rate": 0.0003554995151452245, "loss": 5.8096, "mean_token_accuracy": 0.1747441053390503, "num_tokens": 78912994.0, "step": 36455 }, { "entropy": 6.348058080673217, "epoch": 3.901599871582214, "grad_norm": 1.03125, "learning_rate": 0.0003554638113823031, "loss": 5.9633, "mean_token_accuracy": 0.16004401594400405, "num_tokens": 78924127.0, "step": 36460 }, { "entropy": 6.332845973968506, "epoch": 3.902134945689978, "grad_norm": 1.0078125, "learning_rate": 0.0003554281052960005, "loss": 5.9352, "mean_token_accuracy": 0.15664499402046203, "num_tokens": 78935360.0, "step": 36465 }, { "entropy": 6.294359159469605, "epoch": 3.9026700197977418, "grad_norm": 1.0703125, "learning_rate": 0.0003553923968873477, "loss": 5.8234, "mean_token_accuracy": 0.16597794145345687, "num_tokens": 78946660.0, "step": 36470 }, { "entropy": 6.301189613342285, "epoch": 3.903205093905506, "grad_norm": 1.0703125, "learning_rate": 0.00035535668615737563, "loss": 5.7912, "mean_token_accuracy": 0.1688423603773117, "num_tokens": 78957366.0, "step": 36475 }, { "entropy": 6.290768098831177, "epoch": 3.90374016801327, "grad_norm": 1.0625, "learning_rate": 0.00035532097310711567, "loss": 5.8448, "mean_token_accuracy": 0.16211143583059312, "num_tokens": 78967348.0, "step": 36480 }, { "entropy": 6.149294996261597, "epoch": 3.9042752421210336, "grad_norm": 1.0703125, "learning_rate": 0.00035528525773759884, "loss": 5.7585, "mean_token_accuracy": 0.17343586087226867, "num_tokens": 78977464.0, "step": 36485 }, { "entropy": 6.271198701858521, "epoch": 3.9048103162287977, "grad_norm": 1.046875, "learning_rate": 0.00035524954004985653, "loss": 5.8581, "mean_token_accuracy": 0.16649793833494186, "num_tokens": 78987748.0, "step": 36490 }, { "entropy": 6.30925612449646, "epoch": 3.905345390336562, "grad_norm": 1.0, "learning_rate": 0.00035521382004492, "loss": 5.8812, "mean_token_accuracy": 0.1646197497844696, "num_tokens": 78998546.0, "step": 36495 }, { "entropy": 6.1944262981414795, "epoch": 3.9058804644443255, "grad_norm": 1.078125, "learning_rate": 0.0003551780977238207, "loss": 5.732, "mean_token_accuracy": 0.1753976047039032, "num_tokens": 79009585.0, "step": 36500 }, { "entropy": 6.254201221466064, "epoch": 3.9064155385520896, "grad_norm": 1.0546875, "learning_rate": 0.00035514237308759003, "loss": 5.8114, "mean_token_accuracy": 0.1656595766544342, "num_tokens": 79019596.0, "step": 36505 }, { "entropy": 6.348634576797485, "epoch": 3.9069506126598537, "grad_norm": 1.0546875, "learning_rate": 0.00035510664613725963, "loss": 5.9373, "mean_token_accuracy": 0.1582107275724411, "num_tokens": 79030453.0, "step": 36510 }, { "entropy": 6.334802532196045, "epoch": 3.9074856867676173, "grad_norm": 1.015625, "learning_rate": 0.0003550709168738611, "loss": 5.8734, "mean_token_accuracy": 0.16165998876094817, "num_tokens": 79041441.0, "step": 36515 }, { "entropy": 6.26198992729187, "epoch": 3.908020760875381, "grad_norm": 1.0234375, "learning_rate": 0.00035503518529842604, "loss": 5.8361, "mean_token_accuracy": 0.1686975121498108, "num_tokens": 79052371.0, "step": 36520 }, { "entropy": 6.296244382858276, "epoch": 3.908555834983145, "grad_norm": 1.03125, "learning_rate": 0.00035499945141198634, "loss": 5.8647, "mean_token_accuracy": 0.16668905466794967, "num_tokens": 79062701.0, "step": 36525 }, { "entropy": 6.21030592918396, "epoch": 3.909090909090909, "grad_norm": 1.09375, "learning_rate": 0.00035496371521557364, "loss": 5.7754, "mean_token_accuracy": 0.16960149258375168, "num_tokens": 79073668.0, "step": 36530 }, { "entropy": 6.233974742889404, "epoch": 3.909625983198673, "grad_norm": 1.015625, "learning_rate": 0.0003549279767102199, "loss": 5.7105, "mean_token_accuracy": 0.16854656785726546, "num_tokens": 79085302.0, "step": 36535 }, { "entropy": 6.306700372695923, "epoch": 3.910161057306437, "grad_norm": 1.125, "learning_rate": 0.0003548922358969572, "loss": 5.852, "mean_token_accuracy": 0.161601322889328, "num_tokens": 79095816.0, "step": 36540 }, { "entropy": 6.280085897445678, "epoch": 3.910696131414201, "grad_norm": 1.0234375, "learning_rate": 0.00035485649277681725, "loss": 5.8563, "mean_token_accuracy": 0.16356271058320998, "num_tokens": 79106761.0, "step": 36545 }, { "entropy": 6.282624340057373, "epoch": 3.9112312055219647, "grad_norm": 1.046875, "learning_rate": 0.00035482074735083236, "loss": 5.8488, "mean_token_accuracy": 0.16808436959981918, "num_tokens": 79117100.0, "step": 36550 }, { "entropy": 6.228693723678589, "epoch": 3.911766279629729, "grad_norm": 1.125, "learning_rate": 0.0003547849996200346, "loss": 5.7704, "mean_token_accuracy": 0.17420238107442856, "num_tokens": 79127058.0, "step": 36555 }, { "entropy": 6.167876052856445, "epoch": 3.912301353737493, "grad_norm": 1.015625, "learning_rate": 0.00035474924958545616, "loss": 5.848, "mean_token_accuracy": 0.16458362489938735, "num_tokens": 79137649.0, "step": 36560 }, { "entropy": 6.3277379989624025, "epoch": 3.9128364278452565, "grad_norm": 1.0546875, "learning_rate": 0.0003547134972481294, "loss": 5.8481, "mean_token_accuracy": 0.16347002759575843, "num_tokens": 79147995.0, "step": 36565 }, { "entropy": 6.326274108886719, "epoch": 3.9133715019530206, "grad_norm": 1.015625, "learning_rate": 0.00035467774260908666, "loss": 5.8537, "mean_token_accuracy": 0.16643914431333542, "num_tokens": 79159522.0, "step": 36570 }, { "entropy": 6.119102954864502, "epoch": 3.9139065760607843, "grad_norm": 1.0, "learning_rate": 0.00035464198566936015, "loss": 5.7328, "mean_token_accuracy": 0.18016186207532883, "num_tokens": 79171055.0, "step": 36575 }, { "entropy": 6.281287956237793, "epoch": 3.9144416501685484, "grad_norm": 0.95703125, "learning_rate": 0.0003546062264299826, "loss": 5.7758, "mean_token_accuracy": 0.1712723731994629, "num_tokens": 79182283.0, "step": 36580 }, { "entropy": 6.3047465801239015, "epoch": 3.914976724276312, "grad_norm": 0.953125, "learning_rate": 0.0003545704648919864, "loss": 5.8948, "mean_token_accuracy": 0.16681932508945466, "num_tokens": 79193887.0, "step": 36585 }, { "entropy": 6.354300594329834, "epoch": 3.915511798384076, "grad_norm": 1.015625, "learning_rate": 0.00035453470105640416, "loss": 5.895, "mean_token_accuracy": 0.1655767560005188, "num_tokens": 79205572.0, "step": 36590 }, { "entropy": 6.277522850036621, "epoch": 3.9160468724918402, "grad_norm": 1.0234375, "learning_rate": 0.0003544989349242687, "loss": 5.8077, "mean_token_accuracy": 0.16847657263278962, "num_tokens": 79216280.0, "step": 36595 }, { "entropy": 6.1382848739624025, "epoch": 3.916581946599604, "grad_norm": 1.0, "learning_rate": 0.0003544631664966126, "loss": 5.6848, "mean_token_accuracy": 0.1760355055332184, "num_tokens": 79228312.0, "step": 36600 }, { "entropy": 6.207731485366821, "epoch": 3.917117020707368, "grad_norm": 1.0, "learning_rate": 0.0003544273957744688, "loss": 5.7542, "mean_token_accuracy": 0.17222584635019303, "num_tokens": 79239923.0, "step": 36605 }, { "entropy": 6.2506338596344, "epoch": 3.917652094815132, "grad_norm": 1.328125, "learning_rate": 0.0003543916227588701, "loss": 5.7917, "mean_token_accuracy": 0.169892118871212, "num_tokens": 79250689.0, "step": 36610 }, { "entropy": 6.326096487045288, "epoch": 3.9181871689228958, "grad_norm": 1.0546875, "learning_rate": 0.00035435584745084945, "loss": 5.8274, "mean_token_accuracy": 0.1637279734015465, "num_tokens": 79261998.0, "step": 36615 }, { "entropy": 6.261563062667847, "epoch": 3.91872224303066, "grad_norm": 1.109375, "learning_rate": 0.0003543200698514398, "loss": 5.7122, "mean_token_accuracy": 0.17058215290308, "num_tokens": 79272065.0, "step": 36620 }, { "entropy": 6.21262936592102, "epoch": 3.9192573171384235, "grad_norm": 0.9921875, "learning_rate": 0.00035428428996167426, "loss": 5.8483, "mean_token_accuracy": 0.16152085810899736, "num_tokens": 79282630.0, "step": 36625 }, { "entropy": 6.1748494625091555, "epoch": 3.9197923912461876, "grad_norm": 0.99609375, "learning_rate": 0.00035424850778258604, "loss": 5.7059, "mean_token_accuracy": 0.1766374334692955, "num_tokens": 79293800.0, "step": 36630 }, { "entropy": 6.310991096496582, "epoch": 3.9203274653539513, "grad_norm": 1.109375, "learning_rate": 0.0003542127233152083, "loss": 5.8655, "mean_token_accuracy": 0.16353379786014557, "num_tokens": 79304606.0, "step": 36635 }, { "entropy": 6.281627368927002, "epoch": 3.9208625394617154, "grad_norm": 1.125, "learning_rate": 0.0003541769365605743, "loss": 5.848, "mean_token_accuracy": 0.1665743187069893, "num_tokens": 79315685.0, "step": 36640 }, { "entropy": 6.215250158309937, "epoch": 3.9213976135694795, "grad_norm": 1.0234375, "learning_rate": 0.00035414114751971745, "loss": 5.7467, "mean_token_accuracy": 0.17499394863843917, "num_tokens": 79325518.0, "step": 36645 }, { "entropy": 6.260871648788452, "epoch": 3.921932687677243, "grad_norm": 1.0859375, "learning_rate": 0.0003541053561936709, "loss": 5.847, "mean_token_accuracy": 0.1570135697722435, "num_tokens": 79335557.0, "step": 36650 }, { "entropy": 6.287405395507813, "epoch": 3.9224677617850072, "grad_norm": 0.91015625, "learning_rate": 0.0003540695625834685, "loss": 5.8325, "mean_token_accuracy": 0.1688909649848938, "num_tokens": 79347360.0, "step": 36655 }, { "entropy": 6.308963966369629, "epoch": 3.9230028358927713, "grad_norm": 1.0703125, "learning_rate": 0.00035403376669014346, "loss": 5.8115, "mean_token_accuracy": 0.17020471394062042, "num_tokens": 79358360.0, "step": 36660 }, { "entropy": 6.25680832862854, "epoch": 3.923537910000535, "grad_norm": 0.96484375, "learning_rate": 0.00035399796851472956, "loss": 5.7835, "mean_token_accuracy": 0.17546045780181885, "num_tokens": 79369993.0, "step": 36665 }, { "entropy": 6.26623568534851, "epoch": 3.924072984108299, "grad_norm": 1.0390625, "learning_rate": 0.0003539621680582605, "loss": 5.86, "mean_token_accuracy": 0.16020029336214064, "num_tokens": 79380953.0, "step": 36670 }, { "entropy": 6.254879188537598, "epoch": 3.924608058216063, "grad_norm": 1.0390625, "learning_rate": 0.00035392636532176986, "loss": 5.7714, "mean_token_accuracy": 0.16864567250013351, "num_tokens": 79391122.0, "step": 36675 }, { "entropy": 6.2253814220428465, "epoch": 3.925143132323827, "grad_norm": 1.03125, "learning_rate": 0.0003538905603062915, "loss": 5.8151, "mean_token_accuracy": 0.17570442855358123, "num_tokens": 79402370.0, "step": 36680 }, { "entropy": 6.246590089797974, "epoch": 3.925678206431591, "grad_norm": 1.0625, "learning_rate": 0.0003538547530128593, "loss": 5.8614, "mean_token_accuracy": 0.15972468852996827, "num_tokens": 79413180.0, "step": 36685 }, { "entropy": 6.274309730529785, "epoch": 3.9262132805393546, "grad_norm": 1.015625, "learning_rate": 0.0003538189434425072, "loss": 5.8599, "mean_token_accuracy": 0.16024677008390426, "num_tokens": 79425273.0, "step": 36690 }, { "entropy": 6.354918050765991, "epoch": 3.9267483546471187, "grad_norm": 1.046875, "learning_rate": 0.00035378313159626913, "loss": 5.8127, "mean_token_accuracy": 0.1679301455616951, "num_tokens": 79435421.0, "step": 36695 }, { "entropy": 6.309850120544434, "epoch": 3.9272834287548823, "grad_norm": 1.0546875, "learning_rate": 0.0003537473174751793, "loss": 5.8425, "mean_token_accuracy": 0.16401665806770324, "num_tokens": 79446188.0, "step": 36700 }, { "entropy": 6.24430627822876, "epoch": 3.9278185028626464, "grad_norm": 1.046875, "learning_rate": 0.00035371150108027166, "loss": 5.7743, "mean_token_accuracy": 0.16943282932043074, "num_tokens": 79456743.0, "step": 36705 }, { "entropy": 6.293220853805542, "epoch": 3.9283535769704105, "grad_norm": 1.0546875, "learning_rate": 0.0003536756824125805, "loss": 5.7977, "mean_token_accuracy": 0.1619221419095993, "num_tokens": 79467406.0, "step": 36710 }, { "entropy": 6.337842226028442, "epoch": 3.928888651078174, "grad_norm": 1.078125, "learning_rate": 0.00035363986147314016, "loss": 5.9108, "mean_token_accuracy": 0.16672184467315673, "num_tokens": 79478959.0, "step": 36715 }, { "entropy": 6.297678136825562, "epoch": 3.9294237251859383, "grad_norm": 1.109375, "learning_rate": 0.0003536040382629848, "loss": 5.832, "mean_token_accuracy": 0.16358913779258727, "num_tokens": 79489830.0, "step": 36720 }, { "entropy": 6.304339599609375, "epoch": 3.9299587992937024, "grad_norm": 1.03125, "learning_rate": 0.0003535682127831488, "loss": 5.8599, "mean_token_accuracy": 0.165538090467453, "num_tokens": 79500129.0, "step": 36725 }, { "entropy": 6.215493202209473, "epoch": 3.930493873401466, "grad_norm": 0.98828125, "learning_rate": 0.0003535323850346668, "loss": 5.8143, "mean_token_accuracy": 0.16782088428735734, "num_tokens": 79511176.0, "step": 36730 }, { "entropy": 6.28864541053772, "epoch": 3.93102894750923, "grad_norm": 1.0625, "learning_rate": 0.0003534965550185732, "loss": 5.8979, "mean_token_accuracy": 0.15988607108592987, "num_tokens": 79522425.0, "step": 36735 }, { "entropy": 6.388380432128907, "epoch": 3.931564021616994, "grad_norm": 1.0546875, "learning_rate": 0.0003534607227359026, "loss": 5.9356, "mean_token_accuracy": 0.16367163956165315, "num_tokens": 79533685.0, "step": 36740 }, { "entropy": 6.2004035949707035, "epoch": 3.932099095724758, "grad_norm": 1.109375, "learning_rate": 0.0003534248881876897, "loss": 5.6789, "mean_token_accuracy": 0.17967598587274553, "num_tokens": 79545037.0, "step": 36745 }, { "entropy": 6.2943864345550535, "epoch": 3.9326341698325216, "grad_norm": 0.99609375, "learning_rate": 0.00035338905137496907, "loss": 5.9503, "mean_token_accuracy": 0.15540528297424316, "num_tokens": 79556455.0, "step": 36750 }, { "entropy": 6.231250524520874, "epoch": 3.9331692439402857, "grad_norm": 1.015625, "learning_rate": 0.0003533532122987757, "loss": 5.8068, "mean_token_accuracy": 0.16285452842712403, "num_tokens": 79566929.0, "step": 36755 }, { "entropy": 6.306809949874878, "epoch": 3.9337043180480498, "grad_norm": 1.1328125, "learning_rate": 0.0003533173709601443, "loss": 5.8794, "mean_token_accuracy": 0.1650908187031746, "num_tokens": 79576676.0, "step": 36760 }, { "entropy": 6.294534635543823, "epoch": 3.9342393921558134, "grad_norm": 1.09375, "learning_rate": 0.0003532815273601098, "loss": 5.852, "mean_token_accuracy": 0.16734279245138167, "num_tokens": 79586915.0, "step": 36765 }, { "entropy": 6.303210306167602, "epoch": 3.9347744662635775, "grad_norm": 1.2109375, "learning_rate": 0.0003532456814997072, "loss": 5.9008, "mean_token_accuracy": 0.16077319532632828, "num_tokens": 79599146.0, "step": 36770 }, { "entropy": 6.31865291595459, "epoch": 3.9353095403713416, "grad_norm": 1.0234375, "learning_rate": 0.00035320983337997153, "loss": 5.7875, "mean_token_accuracy": 0.16337188631296157, "num_tokens": 79609700.0, "step": 36775 }, { "entropy": 6.349803924560547, "epoch": 3.9358446144791053, "grad_norm": 1.03125, "learning_rate": 0.00035317398300193785, "loss": 5.8524, "mean_token_accuracy": 0.16208960711956025, "num_tokens": 79619990.0, "step": 36780 }, { "entropy": 6.233762645721436, "epoch": 3.9363796885868694, "grad_norm": 1.046875, "learning_rate": 0.0003531381303666416, "loss": 5.8068, "mean_token_accuracy": 0.1714277222752571, "num_tokens": 79631231.0, "step": 36785 }, { "entropy": 6.245834159851074, "epoch": 3.9369147626946335, "grad_norm": 1.015625, "learning_rate": 0.00035310227547511765, "loss": 5.9116, "mean_token_accuracy": 0.15720912665128708, "num_tokens": 79642536.0, "step": 36790 }, { "entropy": 6.277744960784912, "epoch": 3.937449836802397, "grad_norm": 1.015625, "learning_rate": 0.00035306641832840146, "loss": 5.8502, "mean_token_accuracy": 0.1649069219827652, "num_tokens": 79652908.0, "step": 36795 }, { "entropy": 6.32695198059082, "epoch": 3.937984910910161, "grad_norm": 1.046875, "learning_rate": 0.0003530305589275285, "loss": 5.8499, "mean_token_accuracy": 0.1686243712902069, "num_tokens": 79663483.0, "step": 36800 }, { "entropy": 6.307975101470947, "epoch": 3.938519985017925, "grad_norm": 1.015625, "learning_rate": 0.0003529946972735341, "loss": 5.9047, "mean_token_accuracy": 0.16523346453905105, "num_tokens": 79674456.0, "step": 36805 }, { "entropy": 6.263771963119507, "epoch": 3.939055059125689, "grad_norm": 1.0625, "learning_rate": 0.0003529588333674537, "loss": 5.7542, "mean_token_accuracy": 0.17260051518678665, "num_tokens": 79684921.0, "step": 36810 }, { "entropy": 6.26604061126709, "epoch": 3.9395901332334526, "grad_norm": 1.0703125, "learning_rate": 0.00035292296721032304, "loss": 5.8052, "mean_token_accuracy": 0.16809891611337663, "num_tokens": 79697168.0, "step": 36815 }, { "entropy": 6.205797147750855, "epoch": 3.9401252073412167, "grad_norm": 1.0625, "learning_rate": 0.0003528870988031776, "loss": 5.7851, "mean_token_accuracy": 0.17117432355880738, "num_tokens": 79708269.0, "step": 36820 }, { "entropy": 6.277674674987793, "epoch": 3.940660281448981, "grad_norm": 1.0078125, "learning_rate": 0.0003528512281470531, "loss": 5.835, "mean_token_accuracy": 0.16793565601110458, "num_tokens": 79718814.0, "step": 36825 }, { "entropy": 6.219945859909058, "epoch": 3.9411953555567445, "grad_norm": 1.09375, "learning_rate": 0.0003528153552429854, "loss": 5.7104, "mean_token_accuracy": 0.1774449974298477, "num_tokens": 79728478.0, "step": 36830 }, { "entropy": 6.181082487106323, "epoch": 3.9417304296645086, "grad_norm": 1.078125, "learning_rate": 0.0003527794800920102, "loss": 5.6927, "mean_token_accuracy": 0.18916188627481462, "num_tokens": 79738904.0, "step": 36835 }, { "entropy": 6.129179382324219, "epoch": 3.9422655037722727, "grad_norm": 0.984375, "learning_rate": 0.00035274360269516345, "loss": 5.7605, "mean_token_accuracy": 0.16195239424705504, "num_tokens": 79750726.0, "step": 36840 }, { "entropy": 6.2295183658599855, "epoch": 3.9428005778800364, "grad_norm": 1.046875, "learning_rate": 0.0003527077230534811, "loss": 5.7427, "mean_token_accuracy": 0.16579255908727647, "num_tokens": 79760585.0, "step": 36845 }, { "entropy": 6.405089473724365, "epoch": 3.9433356519878004, "grad_norm": 0.96484375, "learning_rate": 0.00035267184116799917, "loss": 5.9425, "mean_token_accuracy": 0.16418740451335906, "num_tokens": 79771544.0, "step": 36850 }, { "entropy": 6.2414123058319095, "epoch": 3.943870726095564, "grad_norm": 1.453125, "learning_rate": 0.0003526359570397538, "loss": 5.75, "mean_token_accuracy": 0.16756678223609925, "num_tokens": 79781979.0, "step": 36855 }, { "entropy": 6.254365015029907, "epoch": 3.944405800203328, "grad_norm": 1.0859375, "learning_rate": 0.00035260007066978096, "loss": 5.7448, "mean_token_accuracy": 0.17442805767059327, "num_tokens": 79792661.0, "step": 36860 }, { "entropy": 6.165874242782593, "epoch": 3.944940874311092, "grad_norm": 1.0625, "learning_rate": 0.00035256418205911706, "loss": 5.7291, "mean_token_accuracy": 0.1699835553765297, "num_tokens": 79803189.0, "step": 36865 }, { "entropy": 6.238031435012817, "epoch": 3.945475948418856, "grad_norm": 1.015625, "learning_rate": 0.0003525282912087983, "loss": 5.8239, "mean_token_accuracy": 0.1706695705652237, "num_tokens": 79813198.0, "step": 36870 }, { "entropy": 6.274373722076416, "epoch": 3.94601102252662, "grad_norm": 1.1640625, "learning_rate": 0.00035249239811986096, "loss": 5.8919, "mean_token_accuracy": 0.15779130905866623, "num_tokens": 79824025.0, "step": 36875 }, { "entropy": 6.2716944217681885, "epoch": 3.9465460966343837, "grad_norm": 1.109375, "learning_rate": 0.00035245650279334164, "loss": 5.763, "mean_token_accuracy": 0.1716931104660034, "num_tokens": 79834686.0, "step": 36880 }, { "entropy": 6.321073007583618, "epoch": 3.947081170742148, "grad_norm": 1.171875, "learning_rate": 0.00035242060523027653, "loss": 5.8245, "mean_token_accuracy": 0.16674508899450302, "num_tokens": 79844329.0, "step": 36885 }, { "entropy": 6.203620576858521, "epoch": 3.947616244849912, "grad_norm": 1.1171875, "learning_rate": 0.00035238470543170244, "loss": 5.823, "mean_token_accuracy": 0.1630680739879608, "num_tokens": 79853783.0, "step": 36890 }, { "entropy": 6.293093061447143, "epoch": 3.9481513189576756, "grad_norm": 0.984375, "learning_rate": 0.0003523488033986558, "loss": 5.8596, "mean_token_accuracy": 0.16185514628887177, "num_tokens": 79865760.0, "step": 36895 }, { "entropy": 6.3095855712890625, "epoch": 3.9486863930654397, "grad_norm": 1.0625, "learning_rate": 0.00035231289913217336, "loss": 5.9131, "mean_token_accuracy": 0.15662141293287277, "num_tokens": 79877414.0, "step": 36900 }, { "entropy": 6.266349411010742, "epoch": 3.9492214671732033, "grad_norm": 1.125, "learning_rate": 0.0003522769926332918, "loss": 5.8397, "mean_token_accuracy": 0.16920286267995835, "num_tokens": 79888618.0, "step": 36905 }, { "entropy": 6.326799583435059, "epoch": 3.9497565412809674, "grad_norm": 1.1015625, "learning_rate": 0.0003522410839030479, "loss": 5.8233, "mean_token_accuracy": 0.16315982192754747, "num_tokens": 79898979.0, "step": 36910 }, { "entropy": 6.291018676757813, "epoch": 3.950291615388731, "grad_norm": 1.0859375, "learning_rate": 0.0003522051729424786, "loss": 5.7846, "mean_token_accuracy": 0.16874949187040328, "num_tokens": 79908832.0, "step": 36915 }, { "entropy": 6.123280429840088, "epoch": 3.950826689496495, "grad_norm": 1.0390625, "learning_rate": 0.0003521692597526209, "loss": 5.7052, "mean_token_accuracy": 0.18034099787473679, "num_tokens": 79919031.0, "step": 36920 }, { "entropy": 6.182449722290039, "epoch": 3.9513617636042593, "grad_norm": 1.0703125, "learning_rate": 0.00035213334433451145, "loss": 5.791, "mean_token_accuracy": 0.1700556680560112, "num_tokens": 79929722.0, "step": 36925 }, { "entropy": 6.208298635482788, "epoch": 3.951896837712023, "grad_norm": 1.0625, "learning_rate": 0.00035209742668918767, "loss": 5.7828, "mean_token_accuracy": 0.17851172685623168, "num_tokens": 79940741.0, "step": 36930 }, { "entropy": 6.224713706970215, "epoch": 3.952431911819787, "grad_norm": 1.0078125, "learning_rate": 0.0003520615068176864, "loss": 5.7545, "mean_token_accuracy": 0.17638616710901261, "num_tokens": 79951679.0, "step": 36935 }, { "entropy": 6.295835256576538, "epoch": 3.952966985927551, "grad_norm": 0.99609375, "learning_rate": 0.00035202558472104513, "loss": 5.8056, "mean_token_accuracy": 0.17139533758163453, "num_tokens": 79961835.0, "step": 36940 }, { "entropy": 6.236645793914795, "epoch": 3.953502060035315, "grad_norm": 1.046875, "learning_rate": 0.00035198966040030083, "loss": 5.8147, "mean_token_accuracy": 0.16831371784210206, "num_tokens": 79973559.0, "step": 36945 }, { "entropy": 6.282147836685181, "epoch": 3.954037134143079, "grad_norm": 1.0078125, "learning_rate": 0.0003519537338564909, "loss": 5.8166, "mean_token_accuracy": 0.16848278641700745, "num_tokens": 79983969.0, "step": 36950 }, { "entropy": 6.242750644683838, "epoch": 3.954572208250843, "grad_norm": 0.9921875, "learning_rate": 0.00035191780509065266, "loss": 5.8657, "mean_token_accuracy": 0.16823097169399262, "num_tokens": 79994774.0, "step": 36955 }, { "entropy": 6.2912561893463135, "epoch": 3.9551072823586066, "grad_norm": 1.0859375, "learning_rate": 0.00035188187410382373, "loss": 5.865, "mean_token_accuracy": 0.16639801114797592, "num_tokens": 80006082.0, "step": 36960 }, { "entropy": 6.217170906066895, "epoch": 3.9556423564663707, "grad_norm": 1.0859375, "learning_rate": 0.0003518459408970414, "loss": 5.7573, "mean_token_accuracy": 0.17617507129907609, "num_tokens": 80016674.0, "step": 36965 }, { "entropy": 6.264249801635742, "epoch": 3.9561774305741344, "grad_norm": 0.9765625, "learning_rate": 0.0003518100054713433, "loss": 5.8162, "mean_token_accuracy": 0.16886071413755416, "num_tokens": 80027100.0, "step": 36970 }, { "entropy": 6.335049867630005, "epoch": 3.9567125046818985, "grad_norm": 1.0546875, "learning_rate": 0.0003517740678277672, "loss": 5.9094, "mean_token_accuracy": 0.16049308627843856, "num_tokens": 80038120.0, "step": 36975 }, { "entropy": 6.303026819229126, "epoch": 3.957247578789662, "grad_norm": 1.0390625, "learning_rate": 0.0003517381279673506, "loss": 5.7454, "mean_token_accuracy": 0.16873698234558104, "num_tokens": 80048547.0, "step": 36980 }, { "entropy": 6.315875673294068, "epoch": 3.9577826528974263, "grad_norm": 1.0234375, "learning_rate": 0.0003517021858911313, "loss": 5.8446, "mean_token_accuracy": 0.16843556612730026, "num_tokens": 80058327.0, "step": 36985 }, { "entropy": 6.19666895866394, "epoch": 3.9583177270051904, "grad_norm": 1.125, "learning_rate": 0.00035166624160014727, "loss": 5.8139, "mean_token_accuracy": 0.17890802025794983, "num_tokens": 80070195.0, "step": 36990 }, { "entropy": 6.328893327713013, "epoch": 3.958852801112954, "grad_norm": 0.98828125, "learning_rate": 0.0003516302950954362, "loss": 5.9158, "mean_token_accuracy": 0.15925091207027436, "num_tokens": 80081005.0, "step": 36995 }, { "entropy": 6.388414430618286, "epoch": 3.959387875220718, "grad_norm": 1.171875, "learning_rate": 0.00035159434637803617, "loss": 5.9082, "mean_token_accuracy": 0.16136977821588516, "num_tokens": 80092843.0, "step": 37000 }, { "entropy": 6.1674277782440186, "epoch": 3.959922949328482, "grad_norm": 0.9765625, "learning_rate": 0.0003515583954489851, "loss": 5.6512, "mean_token_accuracy": 0.17822759300470353, "num_tokens": 80103925.0, "step": 37005 }, { "entropy": 6.236816167831421, "epoch": 3.960458023436246, "grad_norm": 0.9453125, "learning_rate": 0.00035152244230932117, "loss": 5.8397, "mean_token_accuracy": 0.1666121155023575, "num_tokens": 80115767.0, "step": 37010 }, { "entropy": 6.280026054382324, "epoch": 3.96099309754401, "grad_norm": 1.078125, "learning_rate": 0.0003514864869600825, "loss": 5.8239, "mean_token_accuracy": 0.16872159242630005, "num_tokens": 80125847.0, "step": 37015 }, { "entropy": 6.348851013183594, "epoch": 3.9615281716517736, "grad_norm": 1.015625, "learning_rate": 0.0003514505294023072, "loss": 5.8276, "mean_token_accuracy": 0.1666027531027794, "num_tokens": 80138473.0, "step": 37020 }, { "entropy": 6.298523950576782, "epoch": 3.9620632457595377, "grad_norm": 1.0625, "learning_rate": 0.00035141456963703365, "loss": 5.7599, "mean_token_accuracy": 0.16777583509683608, "num_tokens": 80149120.0, "step": 37025 }, { "entropy": 6.3103431224822994, "epoch": 3.9625983198673014, "grad_norm": 1.0546875, "learning_rate": 0.0003513786076653001, "loss": 5.8532, "mean_token_accuracy": 0.17036662697792054, "num_tokens": 80159884.0, "step": 37030 }, { "entropy": 6.2660924911499025, "epoch": 3.9631333939750655, "grad_norm": 1.0078125, "learning_rate": 0.00035134264348814497, "loss": 5.9056, "mean_token_accuracy": 0.1583084061741829, "num_tokens": 80171267.0, "step": 37035 }, { "entropy": 6.265497398376465, "epoch": 3.9636684680828296, "grad_norm": 1.0703125, "learning_rate": 0.0003513066771066068, "loss": 5.7889, "mean_token_accuracy": 0.16365274861454965, "num_tokens": 80182170.0, "step": 37040 }, { "entropy": 6.323379993438721, "epoch": 3.9642035421905932, "grad_norm": 1.046875, "learning_rate": 0.00035127070852172403, "loss": 5.9236, "mean_token_accuracy": 0.16729040443897247, "num_tokens": 80193644.0, "step": 37045 }, { "entropy": 6.271738481521607, "epoch": 3.9647386162983573, "grad_norm": 0.99609375, "learning_rate": 0.0003512347377345353, "loss": 5.828, "mean_token_accuracy": 0.17145056277513504, "num_tokens": 80203873.0, "step": 37050 }, { "entropy": 6.391740179061889, "epoch": 3.9652736904061214, "grad_norm": 1.1015625, "learning_rate": 0.0003511987647460792, "loss": 5.8472, "mean_token_accuracy": 0.1726868510246277, "num_tokens": 80214424.0, "step": 37055 }, { "entropy": 6.28571515083313, "epoch": 3.965808764513885, "grad_norm": 1.1640625, "learning_rate": 0.0003511627895573944, "loss": 5.9044, "mean_token_accuracy": 0.16709455102682114, "num_tokens": 80224809.0, "step": 37060 }, { "entropy": 6.269046592712402, "epoch": 3.966343838621649, "grad_norm": 0.9609375, "learning_rate": 0.00035112681216951984, "loss": 5.8637, "mean_token_accuracy": 0.17391236871480942, "num_tokens": 80236730.0, "step": 37065 }, { "entropy": 6.344490623474121, "epoch": 3.9668789127294133, "grad_norm": 1.0859375, "learning_rate": 0.0003510908325834942, "loss": 5.87, "mean_token_accuracy": 0.1655582532286644, "num_tokens": 80246885.0, "step": 37070 }, { "entropy": 6.345082473754883, "epoch": 3.967413986837177, "grad_norm": 1.015625, "learning_rate": 0.0003510548508003566, "loss": 5.9002, "mean_token_accuracy": 0.1637043073773384, "num_tokens": 80258182.0, "step": 37075 }, { "entropy": 6.29580283164978, "epoch": 3.9679490609449406, "grad_norm": 0.953125, "learning_rate": 0.0003510188668211458, "loss": 5.8925, "mean_token_accuracy": 0.16271240562200545, "num_tokens": 80268871.0, "step": 37080 }, { "entropy": 6.2998847484588625, "epoch": 3.9684841350527047, "grad_norm": 1.0703125, "learning_rate": 0.0003509828806469009, "loss": 5.7972, "mean_token_accuracy": 0.17202295064926149, "num_tokens": 80278831.0, "step": 37085 }, { "entropy": 6.266251087188721, "epoch": 3.969019209160469, "grad_norm": 0.96875, "learning_rate": 0.00035094689227866093, "loss": 5.7824, "mean_token_accuracy": 0.16865532845258713, "num_tokens": 80289587.0, "step": 37090 }, { "entropy": 6.310770654678345, "epoch": 3.9695542832682325, "grad_norm": 1.046875, "learning_rate": 0.00035091090171746525, "loss": 5.9115, "mean_token_accuracy": 0.1615598276257515, "num_tokens": 80301265.0, "step": 37095 }, { "entropy": 6.346001148223877, "epoch": 3.9700893573759966, "grad_norm": 1.046875, "learning_rate": 0.0003508749089643529, "loss": 5.9085, "mean_token_accuracy": 0.1578210785984993, "num_tokens": 80313045.0, "step": 37100 }, { "entropy": 6.345733785629273, "epoch": 3.9706244314837607, "grad_norm": 1.0703125, "learning_rate": 0.0003508389140203631, "loss": 5.8689, "mean_token_accuracy": 0.16765982061624526, "num_tokens": 80323503.0, "step": 37105 }, { "entropy": 6.270084238052368, "epoch": 3.9711595055915243, "grad_norm": 1.1640625, "learning_rate": 0.0003508029168865355, "loss": 5.8074, "mean_token_accuracy": 0.17301734387874604, "num_tokens": 80333711.0, "step": 37110 }, { "entropy": 6.25204644203186, "epoch": 3.9716945796992884, "grad_norm": 1.0625, "learning_rate": 0.0003507669175639092, "loss": 5.8363, "mean_token_accuracy": 0.1669308215379715, "num_tokens": 80344029.0, "step": 37115 }, { "entropy": 6.243466711044311, "epoch": 3.9722296538070525, "grad_norm": 1.03125, "learning_rate": 0.00035073091605352383, "loss": 5.8507, "mean_token_accuracy": 0.16751897782087327, "num_tokens": 80354744.0, "step": 37120 }, { "entropy": 6.235168552398681, "epoch": 3.972764727914816, "grad_norm": 1.0390625, "learning_rate": 0.0003506949123564189, "loss": 5.8687, "mean_token_accuracy": 0.1689373582601547, "num_tokens": 80365043.0, "step": 37125 }, { "entropy": 6.278934621810913, "epoch": 3.9732998020225803, "grad_norm": 1.0703125, "learning_rate": 0.000350658906473634, "loss": 5.8246, "mean_token_accuracy": 0.17072444409132004, "num_tokens": 80374369.0, "step": 37130 }, { "entropy": 6.26380467414856, "epoch": 3.973834876130344, "grad_norm": 0.9609375, "learning_rate": 0.0003506228984062089, "loss": 5.8351, "mean_token_accuracy": 0.16555782556533813, "num_tokens": 80384941.0, "step": 37135 }, { "entropy": 6.225953817367554, "epoch": 3.974369950238108, "grad_norm": 1.09375, "learning_rate": 0.0003505868881551832, "loss": 5.8076, "mean_token_accuracy": 0.17525033205747603, "num_tokens": 80395097.0, "step": 37140 }, { "entropy": 6.262478256225586, "epoch": 3.9749050243458717, "grad_norm": 1.0390625, "learning_rate": 0.0003505508757215966, "loss": 5.8081, "mean_token_accuracy": 0.16484496593475342, "num_tokens": 80406027.0, "step": 37145 }, { "entropy": 6.256617164611816, "epoch": 3.9754400984536358, "grad_norm": 1.03125, "learning_rate": 0.00035051486110648924, "loss": 5.8742, "mean_token_accuracy": 0.16717528253793718, "num_tokens": 80417168.0, "step": 37150 }, { "entropy": 6.361312437057495, "epoch": 3.9759751725614, "grad_norm": 1.0625, "learning_rate": 0.00035047884431090075, "loss": 5.8949, "mean_token_accuracy": 0.15671358555555343, "num_tokens": 80428941.0, "step": 37155 }, { "entropy": 6.329995107650757, "epoch": 3.9765102466691635, "grad_norm": 1.078125, "learning_rate": 0.00035044282533587133, "loss": 5.8246, "mean_token_accuracy": 0.15741787403821944, "num_tokens": 80439585.0, "step": 37160 }, { "entropy": 6.2878499031066895, "epoch": 3.9770453207769276, "grad_norm": 0.9375, "learning_rate": 0.00035040680418244085, "loss": 5.882, "mean_token_accuracy": 0.15980205088853836, "num_tokens": 80451112.0, "step": 37165 }, { "entropy": 6.132896518707275, "epoch": 3.9775803948846917, "grad_norm": 1.0390625, "learning_rate": 0.0003503707808516496, "loss": 5.7207, "mean_token_accuracy": 0.17379957139492036, "num_tokens": 80460995.0, "step": 37170 }, { "entropy": 6.325543737411499, "epoch": 3.9781154689924554, "grad_norm": 0.984375, "learning_rate": 0.00035033475534453757, "loss": 5.8673, "mean_token_accuracy": 0.16464310735464097, "num_tokens": 80471842.0, "step": 37175 }, { "entropy": 6.281170797348023, "epoch": 3.9786505431002195, "grad_norm": 1.0546875, "learning_rate": 0.0003502987276621451, "loss": 5.8159, "mean_token_accuracy": 0.16406241953372955, "num_tokens": 80482567.0, "step": 37180 }, { "entropy": 6.222289228439331, "epoch": 3.9791856172079836, "grad_norm": 1.1796875, "learning_rate": 0.00035026269780551243, "loss": 5.7434, "mean_token_accuracy": 0.17189981043338776, "num_tokens": 80493507.0, "step": 37185 }, { "entropy": 6.261571216583252, "epoch": 3.9797206913157472, "grad_norm": 1.015625, "learning_rate": 0.0003502266657756799, "loss": 5.8059, "mean_token_accuracy": 0.17594601958990097, "num_tokens": 80504403.0, "step": 37190 }, { "entropy": 6.273215293884277, "epoch": 3.980255765423511, "grad_norm": 1.0390625, "learning_rate": 0.00035019063157368805, "loss": 5.9163, "mean_token_accuracy": 0.1646588310599327, "num_tokens": 80515848.0, "step": 37195 }, { "entropy": 6.248320817947388, "epoch": 3.980790839531275, "grad_norm": 1.09375, "learning_rate": 0.0003501545952005772, "loss": 5.7753, "mean_token_accuracy": 0.17049722820520402, "num_tokens": 80527437.0, "step": 37200 }, { "entropy": 6.251781797409057, "epoch": 3.981325913639039, "grad_norm": 1.0546875, "learning_rate": 0.00035011855665738795, "loss": 5.7484, "mean_token_accuracy": 0.16851401776075364, "num_tokens": 80537204.0, "step": 37205 }, { "entropy": 6.2889762878417965, "epoch": 3.9818609877468027, "grad_norm": 1.0546875, "learning_rate": 0.00035008251594516104, "loss": 5.8693, "mean_token_accuracy": 0.16984500885009765, "num_tokens": 80547671.0, "step": 37210 }, { "entropy": 6.2264384746551515, "epoch": 3.982396061854567, "grad_norm": 1.0, "learning_rate": 0.00035004647306493696, "loss": 5.7574, "mean_token_accuracy": 0.1725274920463562, "num_tokens": 80559494.0, "step": 37215 }, { "entropy": 6.267013788223267, "epoch": 3.982931135962331, "grad_norm": 1.0625, "learning_rate": 0.0003500104280177566, "loss": 5.8477, "mean_token_accuracy": 0.169740629196167, "num_tokens": 80569562.0, "step": 37220 }, { "entropy": 6.283298969268799, "epoch": 3.9834662100700946, "grad_norm": 0.9609375, "learning_rate": 0.0003499743808046606, "loss": 5.8075, "mean_token_accuracy": 0.169248366355896, "num_tokens": 80580910.0, "step": 37225 }, { "entropy": 6.339686632156372, "epoch": 3.9840012841778587, "grad_norm": 1.03125, "learning_rate": 0.00034993833142668985, "loss": 5.8496, "mean_token_accuracy": 0.17020798176527024, "num_tokens": 80592018.0, "step": 37230 }, { "entropy": 6.252121019363403, "epoch": 3.984536358285623, "grad_norm": 1.03125, "learning_rate": 0.00034990227988488537, "loss": 5.7926, "mean_token_accuracy": 0.17007801234722136, "num_tokens": 80601960.0, "step": 37235 }, { "entropy": 6.249980640411377, "epoch": 3.9850714323933865, "grad_norm": 1.09375, "learning_rate": 0.0003498662261802881, "loss": 5.8329, "mean_token_accuracy": 0.16772320121526718, "num_tokens": 80611965.0, "step": 37240 }, { "entropy": 6.249214220046997, "epoch": 3.9856065065011506, "grad_norm": 0.9765625, "learning_rate": 0.000349830170313939, "loss": 5.8503, "mean_token_accuracy": 0.16644722670316697, "num_tokens": 80622248.0, "step": 37245 }, { "entropy": 6.306484508514404, "epoch": 3.986141580608914, "grad_norm": 1.0625, "learning_rate": 0.0003497941122868793, "loss": 5.8607, "mean_token_accuracy": 0.16432967633008957, "num_tokens": 80633704.0, "step": 37250 }, { "entropy": 6.298017740249634, "epoch": 3.9866766547166783, "grad_norm": 1.03125, "learning_rate": 0.0003497580521001502, "loss": 5.7589, "mean_token_accuracy": 0.17036378979682923, "num_tokens": 80643833.0, "step": 37255 }, { "entropy": 6.302177906036377, "epoch": 3.987211728824442, "grad_norm": 1.0234375, "learning_rate": 0.00034972198975479266, "loss": 5.7856, "mean_token_accuracy": 0.17274591624736785, "num_tokens": 80653767.0, "step": 37260 }, { "entropy": 6.100484180450439, "epoch": 3.987746802932206, "grad_norm": 1.2890625, "learning_rate": 0.0003496859252518482, "loss": 5.6623, "mean_token_accuracy": 0.18450180888175965, "num_tokens": 80664824.0, "step": 37265 }, { "entropy": 6.272086811065674, "epoch": 3.98828187703997, "grad_norm": 1.3125, "learning_rate": 0.00034964985859235823, "loss": 5.8447, "mean_token_accuracy": 0.16902379393577577, "num_tokens": 80676514.0, "step": 37270 }, { "entropy": 6.208833646774292, "epoch": 3.988816951147734, "grad_norm": 0.9921875, "learning_rate": 0.00034961378977736414, "loss": 5.7235, "mean_token_accuracy": 0.17499614208936692, "num_tokens": 80687890.0, "step": 37275 }, { "entropy": 6.242137336730957, "epoch": 3.989352025255498, "grad_norm": 1.1015625, "learning_rate": 0.00034957771880790724, "loss": 5.8113, "mean_token_accuracy": 0.1729767367243767, "num_tokens": 80698351.0, "step": 37280 }, { "entropy": 6.319085168838501, "epoch": 3.989887099363262, "grad_norm": 1.0625, "learning_rate": 0.0003495416456850292, "loss": 5.8276, "mean_token_accuracy": 0.16478022038936616, "num_tokens": 80708026.0, "step": 37285 }, { "entropy": 6.261047124862671, "epoch": 3.9904221734710257, "grad_norm": 1.0625, "learning_rate": 0.0003495055704097716, "loss": 5.7682, "mean_token_accuracy": 0.1647244781255722, "num_tokens": 80718507.0, "step": 37290 }, { "entropy": 6.352835941314697, "epoch": 3.99095724757879, "grad_norm": 1.09375, "learning_rate": 0.0003494694929831762, "loss": 5.8923, "mean_token_accuracy": 0.16151949614286423, "num_tokens": 80728608.0, "step": 37295 }, { "entropy": 6.274320936203003, "epoch": 3.9914923216865534, "grad_norm": 1.0, "learning_rate": 0.00034943341340628464, "loss": 5.8421, "mean_token_accuracy": 0.1673188790678978, "num_tokens": 80739803.0, "step": 37300 }, { "entropy": 6.285736846923828, "epoch": 3.9920273957943175, "grad_norm": 1.0703125, "learning_rate": 0.0003493973316801387, "loss": 5.8085, "mean_token_accuracy": 0.1654793620109558, "num_tokens": 80751006.0, "step": 37305 }, { "entropy": 6.339663648605347, "epoch": 3.992562469902081, "grad_norm": 1.0546875, "learning_rate": 0.00034936124780578025, "loss": 5.882, "mean_token_accuracy": 0.1688527673482895, "num_tokens": 80761505.0, "step": 37310 }, { "entropy": 6.279870700836182, "epoch": 3.9930975440098453, "grad_norm": 0.91796875, "learning_rate": 0.0003493251617842513, "loss": 5.8793, "mean_token_accuracy": 0.1614377662539482, "num_tokens": 80773592.0, "step": 37315 }, { "entropy": 6.282383680343628, "epoch": 3.9936326181176094, "grad_norm": 1.0078125, "learning_rate": 0.00034928907361659364, "loss": 5.8117, "mean_token_accuracy": 0.1700040027499199, "num_tokens": 80784009.0, "step": 37320 }, { "entropy": 6.309854936599732, "epoch": 3.994167692225373, "grad_norm": 1.046875, "learning_rate": 0.00034925298330384946, "loss": 5.7324, "mean_token_accuracy": 0.17301151007413865, "num_tokens": 80794417.0, "step": 37325 }, { "entropy": 6.270126485824585, "epoch": 3.994702766333137, "grad_norm": 1.03125, "learning_rate": 0.00034921689084706084, "loss": 5.7868, "mean_token_accuracy": 0.17108288854360582, "num_tokens": 80805351.0, "step": 37330 }, { "entropy": 6.3386759757995605, "epoch": 3.9952378404409012, "grad_norm": 1.5390625, "learning_rate": 0.0003491807962472698, "loss": 5.9313, "mean_token_accuracy": 0.15817655473947526, "num_tokens": 80816166.0, "step": 37335 }, { "entropy": 6.2819935321807865, "epoch": 3.995772914548665, "grad_norm": 0.953125, "learning_rate": 0.00034914469950551885, "loss": 5.8276, "mean_token_accuracy": 0.16038715094327927, "num_tokens": 80828403.0, "step": 37340 }, { "entropy": 6.324321031570435, "epoch": 3.996307988656429, "grad_norm": 0.98828125, "learning_rate": 0.0003491086006228501, "loss": 5.8935, "mean_token_accuracy": 0.15619095265865326, "num_tokens": 80840090.0, "step": 37345 }, { "entropy": 6.2628098487854, "epoch": 3.996843062764193, "grad_norm": 1.03125, "learning_rate": 0.0003490724996003059, "loss": 5.7926, "mean_token_accuracy": 0.16580444276332856, "num_tokens": 80849985.0, "step": 37350 }, { "entropy": 6.272805023193359, "epoch": 3.9973781368719568, "grad_norm": 1.046875, "learning_rate": 0.0003490363964389287, "loss": 5.8405, "mean_token_accuracy": 0.16981692463159562, "num_tokens": 80860393.0, "step": 37355 }, { "entropy": 6.246946334838867, "epoch": 3.997913210979721, "grad_norm": 1.0390625, "learning_rate": 0.00034900029113976087, "loss": 5.7229, "mean_token_accuracy": 0.1731851413846016, "num_tokens": 80870052.0, "step": 37360 }, { "entropy": 6.2589295387268065, "epoch": 3.9984482850874845, "grad_norm": 1.0546875, "learning_rate": 0.0003489641837038451, "loss": 5.7865, "mean_token_accuracy": 0.17248416990041732, "num_tokens": 80881050.0, "step": 37365 }, { "entropy": 6.218121290206909, "epoch": 3.9989833591952486, "grad_norm": 1.1015625, "learning_rate": 0.000348928074132224, "loss": 5.7891, "mean_token_accuracy": 0.173410265147686, "num_tokens": 80893038.0, "step": 37370 }, { "entropy": 6.321192693710327, "epoch": 3.9995184333030123, "grad_norm": 1.609375, "learning_rate": 0.00034889196242593993, "loss": 5.937, "mean_token_accuracy": 0.1621978685259819, "num_tokens": 80904309.0, "step": 37375 }, { "entropy": 6.389489756690131, "epoch": 4.0, "grad_norm": 2.3125, "learning_rate": 0.000348855848586036, "loss": 5.8532, "mean_token_accuracy": 0.15825681222809684, "num_tokens": 80913032.0, "step": 37380 }, { "entropy": 6.3347913265228275, "epoch": 4.000535074107764, "grad_norm": 1.0078125, "learning_rate": 0.00034881973261355483, "loss": 5.7457, "mean_token_accuracy": 0.17044027149677277, "num_tokens": 80923294.0, "step": 37385 }, { "entropy": 6.288372278213501, "epoch": 4.001070148215528, "grad_norm": 0.9765625, "learning_rate": 0.0003487836145095391, "loss": 5.7544, "mean_token_accuracy": 0.17421556115150452, "num_tokens": 80934696.0, "step": 37390 }, { "entropy": 6.245721006393433, "epoch": 4.001605222323292, "grad_norm": 1.171875, "learning_rate": 0.00034874749427503204, "loss": 5.7434, "mean_token_accuracy": 0.17030953317880632, "num_tokens": 80944812.0, "step": 37395 }, { "entropy": 6.325200366973877, "epoch": 4.0021402964310555, "grad_norm": 1.0234375, "learning_rate": 0.0003487113719110764, "loss": 5.7818, "mean_token_accuracy": 0.16629712283611298, "num_tokens": 80955973.0, "step": 37400 }, { "entropy": 6.302761745452881, "epoch": 4.00267537053882, "grad_norm": 0.96875, "learning_rate": 0.00034867524741871513, "loss": 5.7489, "mean_token_accuracy": 0.1691051408648491, "num_tokens": 80968314.0, "step": 37405 }, { "entropy": 6.2343932628631595, "epoch": 4.003210444646584, "grad_norm": 0.97265625, "learning_rate": 0.0003486391207989916, "loss": 5.6332, "mean_token_accuracy": 0.1772414982318878, "num_tokens": 80979326.0, "step": 37410 }, { "entropy": 6.185273265838623, "epoch": 4.003745518754347, "grad_norm": 1.09375, "learning_rate": 0.0003486029920529488, "loss": 5.721, "mean_token_accuracy": 0.1824811652302742, "num_tokens": 80989299.0, "step": 37415 }, { "entropy": 6.293809413909912, "epoch": 4.004280592862111, "grad_norm": 1.1328125, "learning_rate": 0.00034856686118162983, "loss": 5.7933, "mean_token_accuracy": 0.16962538957595824, "num_tokens": 81000179.0, "step": 37420 }, { "entropy": 6.280058336257935, "epoch": 4.004815666969876, "grad_norm": 0.98046875, "learning_rate": 0.00034853072818607817, "loss": 5.7107, "mean_token_accuracy": 0.1801515355706215, "num_tokens": 81011251.0, "step": 37425 }, { "entropy": 6.3053418636322025, "epoch": 4.005350741077639, "grad_norm": 1.0390625, "learning_rate": 0.0003484945930673371, "loss": 5.8355, "mean_token_accuracy": 0.16421566307544708, "num_tokens": 81021970.0, "step": 37430 }, { "entropy": 6.229299831390381, "epoch": 4.005885815185403, "grad_norm": 1.015625, "learning_rate": 0.0003484584558264499, "loss": 5.8182, "mean_token_accuracy": 0.16532688587903976, "num_tokens": 81032605.0, "step": 37435 }, { "entropy": 6.33068814277649, "epoch": 4.006420889293167, "grad_norm": 1.1171875, "learning_rate": 0.00034842231646446014, "loss": 5.8251, "mean_token_accuracy": 0.16526200920343398, "num_tokens": 81043603.0, "step": 37440 }, { "entropy": 6.303011035919189, "epoch": 4.006955963400931, "grad_norm": 1.0078125, "learning_rate": 0.00034838617498241127, "loss": 5.7376, "mean_token_accuracy": 0.17534953653812407, "num_tokens": 81054803.0, "step": 37445 }, { "entropy": 6.310309410095215, "epoch": 4.007491037508695, "grad_norm": 1.1875, "learning_rate": 0.00034835003138134694, "loss": 5.8059, "mean_token_accuracy": 0.1676741734147072, "num_tokens": 81064269.0, "step": 37450 }, { "entropy": 6.267286062240601, "epoch": 4.008026111616459, "grad_norm": 1.4453125, "learning_rate": 0.00034831388566231074, "loss": 5.8012, "mean_token_accuracy": 0.1689737930893898, "num_tokens": 81075670.0, "step": 37455 }, { "entropy": 6.2436503887176515, "epoch": 4.008561185724223, "grad_norm": 0.99609375, "learning_rate": 0.0003482777378263465, "loss": 5.7123, "mean_token_accuracy": 0.17071218192577362, "num_tokens": 81086652.0, "step": 37460 }, { "entropy": 6.205674743652343, "epoch": 4.009096259831987, "grad_norm": 0.99609375, "learning_rate": 0.00034824158787449773, "loss": 5.7361, "mean_token_accuracy": 0.17279828190803528, "num_tokens": 81098070.0, "step": 37465 }, { "entropy": 6.316301774978638, "epoch": 4.00963133393975, "grad_norm": 1.0703125, "learning_rate": 0.0003482054358078085, "loss": 5.8379, "mean_token_accuracy": 0.16379799842834472, "num_tokens": 81108067.0, "step": 37470 }, { "entropy": 6.318091154098511, "epoch": 4.010166408047515, "grad_norm": 1.046875, "learning_rate": 0.0003481692816273226, "loss": 5.8021, "mean_token_accuracy": 0.1666486755013466, "num_tokens": 81117947.0, "step": 37475 }, { "entropy": 6.275303077697754, "epoch": 4.010701482155278, "grad_norm": 1.0859375, "learning_rate": 0.00034813312533408386, "loss": 5.7599, "mean_token_accuracy": 0.1716349393129349, "num_tokens": 81127976.0, "step": 37480 }, { "entropy": 6.225961923599243, "epoch": 4.011236556263042, "grad_norm": 1.0625, "learning_rate": 0.0003480969669291366, "loss": 5.7209, "mean_token_accuracy": 0.17604759484529495, "num_tokens": 81138240.0, "step": 37485 }, { "entropy": 6.16656904220581, "epoch": 4.011771630370807, "grad_norm": 1.0234375, "learning_rate": 0.0003480608064135245, "loss": 5.6709, "mean_token_accuracy": 0.17964994460344313, "num_tokens": 81149104.0, "step": 37490 }, { "entropy": 6.270893383026123, "epoch": 4.01230670447857, "grad_norm": 1.03125, "learning_rate": 0.00034802464378829194, "loss": 5.7413, "mean_token_accuracy": 0.17541696280241012, "num_tokens": 81159902.0, "step": 37495 }, { "entropy": 6.2099220752716064, "epoch": 4.012841778586334, "grad_norm": 1.109375, "learning_rate": 0.0003479884790544831, "loss": 5.6985, "mean_token_accuracy": 0.18142752200365067, "num_tokens": 81171906.0, "step": 37500 }, { "entropy": 6.2573436260223385, "epoch": 4.0133768526940985, "grad_norm": 0.98046875, "learning_rate": 0.00034795231221314217, "loss": 5.721, "mean_token_accuracy": 0.17114312201738358, "num_tokens": 81182555.0, "step": 37505 }, { "entropy": 6.2242742538452145, "epoch": 4.013911926801862, "grad_norm": 1.09375, "learning_rate": 0.0003479161432653134, "loss": 5.7442, "mean_token_accuracy": 0.16546323895454407, "num_tokens": 81192623.0, "step": 37510 }, { "entropy": 6.256116247177124, "epoch": 4.014447000909626, "grad_norm": 1.125, "learning_rate": 0.00034787997221204134, "loss": 5.7682, "mean_token_accuracy": 0.17137462943792342, "num_tokens": 81203945.0, "step": 37515 }, { "entropy": 6.217213582992554, "epoch": 4.01498207501739, "grad_norm": 0.9140625, "learning_rate": 0.00034784379905437033, "loss": 5.6901, "mean_token_accuracy": 0.17691457718610765, "num_tokens": 81215704.0, "step": 37520 }, { "entropy": 6.222658729553222, "epoch": 4.015517149125154, "grad_norm": 1.0078125, "learning_rate": 0.0003478076237933447, "loss": 5.7302, "mean_token_accuracy": 0.16740002036094664, "num_tokens": 81226873.0, "step": 37525 }, { "entropy": 6.286307859420776, "epoch": 4.016052223232918, "grad_norm": 1.1015625, "learning_rate": 0.00034777144643000936, "loss": 5.7813, "mean_token_accuracy": 0.16797034591436386, "num_tokens": 81237877.0, "step": 37530 }, { "entropy": 6.301793003082276, "epoch": 4.016587297340681, "grad_norm": 0.984375, "learning_rate": 0.00034773526696540866, "loss": 5.721, "mean_token_accuracy": 0.16905390173196794, "num_tokens": 81248484.0, "step": 37535 }, { "entropy": 6.2278244972229, "epoch": 4.017122371448446, "grad_norm": 1.046875, "learning_rate": 0.00034769908540058724, "loss": 5.7563, "mean_token_accuracy": 0.1683000549674034, "num_tokens": 81259392.0, "step": 37540 }, { "entropy": 6.259397363662719, "epoch": 4.0176574455562095, "grad_norm": 1.0625, "learning_rate": 0.0003476629017365901, "loss": 5.8351, "mean_token_accuracy": 0.16288402527570725, "num_tokens": 81271657.0, "step": 37545 }, { "entropy": 6.2613975524902346, "epoch": 4.018192519663973, "grad_norm": 1.0859375, "learning_rate": 0.00034762671597446176, "loss": 5.7703, "mean_token_accuracy": 0.17767518609762192, "num_tokens": 81282306.0, "step": 37550 }, { "entropy": 6.3224937438964846, "epoch": 4.018727593771738, "grad_norm": 1.0078125, "learning_rate": 0.00034759052811524733, "loss": 5.7356, "mean_token_accuracy": 0.1732997015118599, "num_tokens": 81292753.0, "step": 37555 }, { "entropy": 6.231118249893188, "epoch": 4.019262667879501, "grad_norm": 1.09375, "learning_rate": 0.00034755433815999146, "loss": 5.7057, "mean_token_accuracy": 0.16843431442975998, "num_tokens": 81304376.0, "step": 37560 }, { "entropy": 6.305465602874756, "epoch": 4.019797741987265, "grad_norm": 0.9375, "learning_rate": 0.0003475181461097394, "loss": 5.8329, "mean_token_accuracy": 0.16170111447572708, "num_tokens": 81316096.0, "step": 37565 }, { "entropy": 6.3264580249786375, "epoch": 4.02033281609503, "grad_norm": 0.99609375, "learning_rate": 0.000347481951965536, "loss": 5.8026, "mean_token_accuracy": 0.16345515847206116, "num_tokens": 81327231.0, "step": 37570 }, { "entropy": 6.247871589660645, "epoch": 4.020867890202793, "grad_norm": 0.98828125, "learning_rate": 0.0003474457557284264, "loss": 5.7246, "mean_token_accuracy": 0.17893346697092055, "num_tokens": 81336789.0, "step": 37575 }, { "entropy": 6.322264242172241, "epoch": 4.021402964310557, "grad_norm": 0.97265625, "learning_rate": 0.0003474095573994558, "loss": 5.8492, "mean_token_accuracy": 0.16730117052793503, "num_tokens": 81349004.0, "step": 37580 }, { "entropy": 6.292836999893188, "epoch": 4.0219380384183205, "grad_norm": 0.9765625, "learning_rate": 0.00034737335697966945, "loss": 5.7115, "mean_token_accuracy": 0.17440205812454224, "num_tokens": 81359264.0, "step": 37585 }, { "entropy": 6.26950626373291, "epoch": 4.022473112526085, "grad_norm": 1.125, "learning_rate": 0.0003473371544701126, "loss": 5.7637, "mean_token_accuracy": 0.17393714785575867, "num_tokens": 81370066.0, "step": 37590 }, { "entropy": 6.286291170120239, "epoch": 4.023008186633849, "grad_norm": 1.078125, "learning_rate": 0.00034730094987183054, "loss": 5.8198, "mean_token_accuracy": 0.16970873028039932, "num_tokens": 81379591.0, "step": 37595 }, { "entropy": 6.280666017532349, "epoch": 4.023543260741612, "grad_norm": 1.0390625, "learning_rate": 0.00034726474318586865, "loss": 5.7555, "mean_token_accuracy": 0.17056605219841003, "num_tokens": 81390582.0, "step": 37600 }, { "entropy": 6.231984615325928, "epoch": 4.024078334849377, "grad_norm": 1.1171875, "learning_rate": 0.0003472285344132725, "loss": 5.6795, "mean_token_accuracy": 0.17654876112937928, "num_tokens": 81401162.0, "step": 37605 }, { "entropy": 6.269675016403198, "epoch": 4.024613408957141, "grad_norm": 0.95703125, "learning_rate": 0.0003471923235550876, "loss": 5.7881, "mean_token_accuracy": 0.17021083682775498, "num_tokens": 81413300.0, "step": 37610 }, { "entropy": 6.292229557037354, "epoch": 4.025148483064904, "grad_norm": 0.99609375, "learning_rate": 0.0003471561106123595, "loss": 5.8378, "mean_token_accuracy": 0.1680195152759552, "num_tokens": 81424540.0, "step": 37615 }, { "entropy": 6.220543432235718, "epoch": 4.025683557172669, "grad_norm": 1.0859375, "learning_rate": 0.00034711989558613385, "loss": 5.7294, "mean_token_accuracy": 0.17636965662240983, "num_tokens": 81436072.0, "step": 37620 }, { "entropy": 6.22788143157959, "epoch": 4.0262186312804324, "grad_norm": 1.1171875, "learning_rate": 0.0003470836784774563, "loss": 5.7919, "mean_token_accuracy": 0.17135705649852753, "num_tokens": 81446612.0, "step": 37625 }, { "entropy": 6.263690757751465, "epoch": 4.026753705388196, "grad_norm": 1.09375, "learning_rate": 0.0003470474592873727, "loss": 5.7514, "mean_token_accuracy": 0.17054605782032012, "num_tokens": 81457880.0, "step": 37630 }, { "entropy": 6.248549222946167, "epoch": 4.02728877949596, "grad_norm": 1.0078125, "learning_rate": 0.0003470112380169288, "loss": 5.7229, "mean_token_accuracy": 0.17259492874145507, "num_tokens": 81468504.0, "step": 37635 }, { "entropy": 6.205244874954223, "epoch": 4.027823853603724, "grad_norm": 1.1171875, "learning_rate": 0.00034697501466717044, "loss": 5.6891, "mean_token_accuracy": 0.18118869811296462, "num_tokens": 81478846.0, "step": 37640 }, { "entropy": 6.248385190963745, "epoch": 4.028358927711488, "grad_norm": 1.046875, "learning_rate": 0.0003469387892391438, "loss": 5.7226, "mean_token_accuracy": 0.18087634593248367, "num_tokens": 81488809.0, "step": 37645 }, { "entropy": 6.270744848251343, "epoch": 4.028894001819252, "grad_norm": 1.125, "learning_rate": 0.0003469025617338947, "loss": 5.8695, "mean_token_accuracy": 0.1660054951906204, "num_tokens": 81499023.0, "step": 37650 }, { "entropy": 6.276517248153686, "epoch": 4.029429075927016, "grad_norm": 1.09375, "learning_rate": 0.0003468663321524692, "loss": 5.8541, "mean_token_accuracy": 0.16201117783784866, "num_tokens": 81510156.0, "step": 37655 }, { "entropy": 6.358996820449829, "epoch": 4.02996415003478, "grad_norm": 1.0625, "learning_rate": 0.0003468301004959135, "loss": 5.77, "mean_token_accuracy": 0.1730229765176773, "num_tokens": 81521611.0, "step": 37660 }, { "entropy": 6.289682674407959, "epoch": 4.0304992241425435, "grad_norm": 1.0625, "learning_rate": 0.00034679386676527373, "loss": 5.7513, "mean_token_accuracy": 0.17134176343679428, "num_tokens": 81532392.0, "step": 37665 }, { "entropy": 6.245242404937744, "epoch": 4.031034298250308, "grad_norm": 1.046875, "learning_rate": 0.00034675763096159607, "loss": 5.7785, "mean_token_accuracy": 0.17546357661485673, "num_tokens": 81541379.0, "step": 37670 }, { "entropy": 6.2264303207397464, "epoch": 4.031569372358072, "grad_norm": 1.078125, "learning_rate": 0.00034672139308592696, "loss": 5.7375, "mean_token_accuracy": 0.16577320098876952, "num_tokens": 81552901.0, "step": 37675 }, { "entropy": 6.317436075210571, "epoch": 4.032104446465835, "grad_norm": 1.03125, "learning_rate": 0.00034668515313931276, "loss": 5.7506, "mean_token_accuracy": 0.17503264248371125, "num_tokens": 81564944.0, "step": 37680 }, { "entropy": 6.2894073009490965, "epoch": 4.0326395205736, "grad_norm": 0.953125, "learning_rate": 0.0003466489111227998, "loss": 5.7291, "mean_token_accuracy": 0.17487321943044662, "num_tokens": 81575573.0, "step": 37685 }, { "entropy": 6.191955709457398, "epoch": 4.0331745946813635, "grad_norm": 1.0390625, "learning_rate": 0.00034661266703743456, "loss": 5.7086, "mean_token_accuracy": 0.1750045120716095, "num_tokens": 81586137.0, "step": 37690 }, { "entropy": 6.204108238220215, "epoch": 4.033709668789127, "grad_norm": 1.1953125, "learning_rate": 0.0003465764208842636, "loss": 5.667, "mean_token_accuracy": 0.1763617530465126, "num_tokens": 81597189.0, "step": 37695 }, { "entropy": 6.247480154037476, "epoch": 4.034244742896891, "grad_norm": 1.046875, "learning_rate": 0.0003465401726643336, "loss": 5.816, "mean_token_accuracy": 0.17020951062440873, "num_tokens": 81607643.0, "step": 37700 }, { "entropy": 6.3873899459838865, "epoch": 4.034779817004655, "grad_norm": 1.0078125, "learning_rate": 0.0003465039223786912, "loss": 5.9111, "mean_token_accuracy": 0.16151940822601318, "num_tokens": 81618680.0, "step": 37705 }, { "entropy": 6.223644065856933, "epoch": 4.035314891112419, "grad_norm": 1.015625, "learning_rate": 0.00034646767002838297, "loss": 5.7207, "mean_token_accuracy": 0.17578842788934707, "num_tokens": 81631165.0, "step": 37710 }, { "entropy": 6.261628437042236, "epoch": 4.035849965220183, "grad_norm": 1.0546875, "learning_rate": 0.00034643141561445595, "loss": 5.736, "mean_token_accuracy": 0.17555570006370544, "num_tokens": 81641767.0, "step": 37715 }, { "entropy": 6.331933259963989, "epoch": 4.036385039327947, "grad_norm": 1.0234375, "learning_rate": 0.00034639515913795677, "loss": 5.7982, "mean_token_accuracy": 0.16905938535928727, "num_tokens": 81653371.0, "step": 37720 }, { "entropy": 6.295555305480957, "epoch": 4.036920113435711, "grad_norm": 1.046875, "learning_rate": 0.0003463589005999324, "loss": 5.7626, "mean_token_accuracy": 0.16859230250120164, "num_tokens": 81663931.0, "step": 37725 }, { "entropy": 6.28400993347168, "epoch": 4.0374551875434745, "grad_norm": 1.046875, "learning_rate": 0.00034632264000142976, "loss": 5.729, "mean_token_accuracy": 0.1716735303401947, "num_tokens": 81674143.0, "step": 37730 }, { "entropy": 6.21218786239624, "epoch": 4.037990261651239, "grad_norm": 1.046875, "learning_rate": 0.000346286377343496, "loss": 5.766, "mean_token_accuracy": 0.16778441965579988, "num_tokens": 81684245.0, "step": 37735 }, { "entropy": 6.269164037704468, "epoch": 4.038525335759003, "grad_norm": 1.015625, "learning_rate": 0.0003462501126271781, "loss": 5.6899, "mean_token_accuracy": 0.16975414454936982, "num_tokens": 81694657.0, "step": 37740 }, { "entropy": 6.352934455871582, "epoch": 4.039060409866766, "grad_norm": 1.09375, "learning_rate": 0.00034621384585352313, "loss": 5.8622, "mean_token_accuracy": 0.16357823461294174, "num_tokens": 81705701.0, "step": 37745 }, { "entropy": 6.361921501159668, "epoch": 4.03959548397453, "grad_norm": 1.0703125, "learning_rate": 0.0003461775770235784, "loss": 5.7577, "mean_token_accuracy": 0.17577932476997377, "num_tokens": 81716229.0, "step": 37750 }, { "entropy": 6.208900213241577, "epoch": 4.040130558082295, "grad_norm": 1.0703125, "learning_rate": 0.00034614130613839117, "loss": 5.7021, "mean_token_accuracy": 0.17990388423204423, "num_tokens": 81727142.0, "step": 37755 }, { "entropy": 6.214471530914307, "epoch": 4.040665632190058, "grad_norm": 1.0625, "learning_rate": 0.0003461050331990088, "loss": 5.7486, "mean_token_accuracy": 0.1720317006111145, "num_tokens": 81737939.0, "step": 37760 }, { "entropy": 6.257893657684326, "epoch": 4.041200706297822, "grad_norm": 1.125, "learning_rate": 0.0003460687582064785, "loss": 5.7472, "mean_token_accuracy": 0.172711019217968, "num_tokens": 81748832.0, "step": 37765 }, { "entropy": 6.261841201782227, "epoch": 4.0417357804055865, "grad_norm": 1.171875, "learning_rate": 0.0003460324811618477, "loss": 5.6882, "mean_token_accuracy": 0.17649537324905396, "num_tokens": 81760105.0, "step": 37770 }, { "entropy": 6.217290687561035, "epoch": 4.04227085451335, "grad_norm": 1.0234375, "learning_rate": 0.0003459962020661641, "loss": 5.7309, "mean_token_accuracy": 0.16967908293008804, "num_tokens": 81772202.0, "step": 37775 }, { "entropy": 6.311113500595093, "epoch": 4.042805928621114, "grad_norm": 0.984375, "learning_rate": 0.00034595992092047514, "loss": 5.7852, "mean_token_accuracy": 0.16755472719669343, "num_tokens": 81784440.0, "step": 37780 }, { "entropy": 6.250010824203491, "epoch": 4.043341002728878, "grad_norm": 0.9765625, "learning_rate": 0.00034592363772582835, "loss": 5.7444, "mean_token_accuracy": 0.17268907576799392, "num_tokens": 81794575.0, "step": 37785 }, { "entropy": 6.246751689910889, "epoch": 4.043876076836642, "grad_norm": 1.1328125, "learning_rate": 0.00034588735248327154, "loss": 5.7406, "mean_token_accuracy": 0.17300597131252288, "num_tokens": 81804801.0, "step": 37790 }, { "entropy": 6.348835277557373, "epoch": 4.044411150944406, "grad_norm": 0.984375, "learning_rate": 0.0003458510651938525, "loss": 5.8241, "mean_token_accuracy": 0.16545987278223037, "num_tokens": 81815995.0, "step": 37795 }, { "entropy": 6.271431541442871, "epoch": 4.04494622505217, "grad_norm": 1.0546875, "learning_rate": 0.00034581477585861873, "loss": 5.8355, "mean_token_accuracy": 0.15955253839492797, "num_tokens": 81827461.0, "step": 37800 }, { "entropy": 6.25795841217041, "epoch": 4.045481299159934, "grad_norm": 1.21875, "learning_rate": 0.00034577848447861834, "loss": 5.6932, "mean_token_accuracy": 0.1745678648352623, "num_tokens": 81839750.0, "step": 37805 }, { "entropy": 6.285352039337158, "epoch": 4.0460163732676975, "grad_norm": 1.0234375, "learning_rate": 0.00034574219105489923, "loss": 5.7674, "mean_token_accuracy": 0.16940216571092606, "num_tokens": 81850648.0, "step": 37810 }, { "entropy": 6.301446723937988, "epoch": 4.046551447375461, "grad_norm": 1.09375, "learning_rate": 0.00034570589558850914, "loss": 5.8085, "mean_token_accuracy": 0.16758664399385453, "num_tokens": 81860858.0, "step": 37815 }, { "entropy": 6.304467964172363, "epoch": 4.047086521483226, "grad_norm": 1.0, "learning_rate": 0.0003456695980804963, "loss": 5.8392, "mean_token_accuracy": 0.16367246434092522, "num_tokens": 81872492.0, "step": 37820 }, { "entropy": 6.211684846878052, "epoch": 4.047621595590989, "grad_norm": 0.98828125, "learning_rate": 0.0003456332985319088, "loss": 5.6908, "mean_token_accuracy": 0.18024745136499404, "num_tokens": 81883412.0, "step": 37825 }, { "entropy": 6.313634538650513, "epoch": 4.048156669698753, "grad_norm": 1.0703125, "learning_rate": 0.0003455969969437947, "loss": 5.7809, "mean_token_accuracy": 0.17484208047389985, "num_tokens": 81893176.0, "step": 37830 }, { "entropy": 6.239349031448365, "epoch": 4.0486917438065175, "grad_norm": 1.15625, "learning_rate": 0.0003455606933172023, "loss": 5.6916, "mean_token_accuracy": 0.1822865426540375, "num_tokens": 81903521.0, "step": 37835 }, { "entropy": 6.303874731063843, "epoch": 4.049226817914281, "grad_norm": 1.140625, "learning_rate": 0.0003455243876531797, "loss": 5.8747, "mean_token_accuracy": 0.163229276239872, "num_tokens": 81914568.0, "step": 37840 }, { "entropy": 6.299867057800293, "epoch": 4.049761892022045, "grad_norm": 1.0234375, "learning_rate": 0.0003454880799527754, "loss": 5.8038, "mean_token_accuracy": 0.1698111042380333, "num_tokens": 81926129.0, "step": 37845 }, { "entropy": 6.307304620742798, "epoch": 4.050296966129809, "grad_norm": 1.0859375, "learning_rate": 0.00034545177021703754, "loss": 5.7558, "mean_token_accuracy": 0.17223914563655854, "num_tokens": 81936789.0, "step": 37850 }, { "entropy": 6.264991092681885, "epoch": 4.050832040237573, "grad_norm": 1.0078125, "learning_rate": 0.0003454154584470149, "loss": 5.7417, "mean_token_accuracy": 0.17586952894926072, "num_tokens": 81947368.0, "step": 37855 }, { "entropy": 6.266950464248657, "epoch": 4.051367114345337, "grad_norm": 1.0078125, "learning_rate": 0.0003453791446437556, "loss": 5.7773, "mean_token_accuracy": 0.17431425601243972, "num_tokens": 81958133.0, "step": 37860 }, { "entropy": 6.223511123657227, "epoch": 4.0519021884531, "grad_norm": 1.0546875, "learning_rate": 0.0003453428288083086, "loss": 5.7122, "mean_token_accuracy": 0.17702209055423737, "num_tokens": 81969184.0, "step": 37865 }, { "entropy": 6.262333536148072, "epoch": 4.052437262560865, "grad_norm": 1.109375, "learning_rate": 0.00034530651094172223, "loss": 5.8073, "mean_token_accuracy": 0.16486374884843827, "num_tokens": 81979960.0, "step": 37870 }, { "entropy": 6.266082048416138, "epoch": 4.0529723366686286, "grad_norm": 1.0625, "learning_rate": 0.00034527019104504513, "loss": 5.7901, "mean_token_accuracy": 0.1666714534163475, "num_tokens": 81989806.0, "step": 37875 }, { "entropy": 6.249438285827637, "epoch": 4.053507410776392, "grad_norm": 1.0546875, "learning_rate": 0.0003452338691193262, "loss": 5.824, "mean_token_accuracy": 0.1691303312778473, "num_tokens": 82000698.0, "step": 37880 }, { "entropy": 6.258549594879151, "epoch": 4.054042484884157, "grad_norm": 1.078125, "learning_rate": 0.00034519754516561425, "loss": 5.7856, "mean_token_accuracy": 0.1672586053609848, "num_tokens": 82011923.0, "step": 37885 }, { "entropy": 6.329784536361695, "epoch": 4.05457755899192, "grad_norm": 1.09375, "learning_rate": 0.0003451612191849579, "loss": 5.7703, "mean_token_accuracy": 0.17105883210897446, "num_tokens": 82021897.0, "step": 37890 }, { "entropy": 6.239301156997681, "epoch": 4.055112633099684, "grad_norm": 1.078125, "learning_rate": 0.00034512489117840634, "loss": 5.6447, "mean_token_accuracy": 0.18302484154701232, "num_tokens": 82032417.0, "step": 37895 }, { "entropy": 6.191380405426026, "epoch": 4.055647707207449, "grad_norm": 1.046875, "learning_rate": 0.0003450885611470084, "loss": 5.7561, "mean_token_accuracy": 0.17229849100112915, "num_tokens": 82042325.0, "step": 37900 }, { "entropy": 6.2148829936981205, "epoch": 4.056182781315212, "grad_norm": 0.9921875, "learning_rate": 0.00034505222909181295, "loss": 5.7467, "mean_token_accuracy": 0.17446747720241546, "num_tokens": 82054451.0, "step": 37905 }, { "entropy": 6.285666227340698, "epoch": 4.056717855422976, "grad_norm": 1.0859375, "learning_rate": 0.00034501589501386944, "loss": 5.7976, "mean_token_accuracy": 0.1648237556219101, "num_tokens": 82065692.0, "step": 37910 }, { "entropy": 6.186337995529175, "epoch": 4.05725292953074, "grad_norm": 1.0234375, "learning_rate": 0.0003449795589142266, "loss": 5.6445, "mean_token_accuracy": 0.18690255880355836, "num_tokens": 82076458.0, "step": 37915 }, { "entropy": 6.291577911376953, "epoch": 4.057788003638504, "grad_norm": 1.078125, "learning_rate": 0.0003449432207939339, "loss": 5.7897, "mean_token_accuracy": 0.17098807841539382, "num_tokens": 82087386.0, "step": 37920 }, { "entropy": 6.162258672714233, "epoch": 4.058323077746268, "grad_norm": 1.0703125, "learning_rate": 0.00034490688065404065, "loss": 5.649, "mean_token_accuracy": 0.17562125623226166, "num_tokens": 82096811.0, "step": 37925 }, { "entropy": 6.251354932785034, "epoch": 4.058858151854031, "grad_norm": 1.0859375, "learning_rate": 0.00034487053849559593, "loss": 5.7927, "mean_token_accuracy": 0.16775367110967637, "num_tokens": 82107681.0, "step": 37930 }, { "entropy": 6.279455041885376, "epoch": 4.059393225961796, "grad_norm": 0.98828125, "learning_rate": 0.0003448341943196492, "loss": 5.7327, "mean_token_accuracy": 0.17519331723451614, "num_tokens": 82118562.0, "step": 37935 }, { "entropy": 6.3481956958770756, "epoch": 4.05992830006956, "grad_norm": 1.15625, "learning_rate": 0.00034479784812725, "loss": 5.7496, "mean_token_accuracy": 0.1772896468639374, "num_tokens": 82128818.0, "step": 37940 }, { "entropy": 6.246513605117798, "epoch": 4.060463374177323, "grad_norm": 1.0546875, "learning_rate": 0.00034476149991944765, "loss": 5.7896, "mean_token_accuracy": 0.1738346815109253, "num_tokens": 82140064.0, "step": 37945 }, { "entropy": 6.313934946060181, "epoch": 4.060998448285088, "grad_norm": 1.0390625, "learning_rate": 0.00034472514969729193, "loss": 5.7789, "mean_token_accuracy": 0.17546508759260177, "num_tokens": 82150363.0, "step": 37950 }, { "entropy": 6.295075416564941, "epoch": 4.0615335223928515, "grad_norm": 1.046875, "learning_rate": 0.0003446887974618322, "loss": 5.731, "mean_token_accuracy": 0.16942477226257324, "num_tokens": 82161065.0, "step": 37955 }, { "entropy": 6.165819501876831, "epoch": 4.062068596500615, "grad_norm": 1.109375, "learning_rate": 0.00034465244321411827, "loss": 5.7168, "mean_token_accuracy": 0.17844400703907012, "num_tokens": 82171041.0, "step": 37960 }, { "entropy": 6.29562029838562, "epoch": 4.06260367060838, "grad_norm": 1.0546875, "learning_rate": 0.0003446160869551998, "loss": 5.7822, "mean_token_accuracy": 0.17140478789806365, "num_tokens": 82181696.0, "step": 37965 }, { "entropy": 6.295318508148194, "epoch": 4.063138744716143, "grad_norm": 1.03125, "learning_rate": 0.00034457972868612665, "loss": 5.863, "mean_token_accuracy": 0.17098952680826188, "num_tokens": 82192593.0, "step": 37970 }, { "entropy": 6.285124921798706, "epoch": 4.063673818823907, "grad_norm": 1.1015625, "learning_rate": 0.00034454336840794857, "loss": 5.7222, "mean_token_accuracy": 0.17457335740327834, "num_tokens": 82203147.0, "step": 37975 }, { "entropy": 6.287363767623901, "epoch": 4.064208892931671, "grad_norm": 1.0546875, "learning_rate": 0.0003445070061217155, "loss": 5.7568, "mean_token_accuracy": 0.17293775975704193, "num_tokens": 82213174.0, "step": 37980 }, { "entropy": 6.286933326721192, "epoch": 4.064743967039435, "grad_norm": 1.03125, "learning_rate": 0.00034447064182847745, "loss": 5.7715, "mean_token_accuracy": 0.1691661849617958, "num_tokens": 82225359.0, "step": 37985 }, { "entropy": 6.211173152923584, "epoch": 4.065279041147199, "grad_norm": 1.171875, "learning_rate": 0.00034443427552928435, "loss": 5.6439, "mean_token_accuracy": 0.17668796330690384, "num_tokens": 82235973.0, "step": 37990 }, { "entropy": 6.204849195480347, "epoch": 4.0658141152549625, "grad_norm": 1.0546875, "learning_rate": 0.00034439790722518634, "loss": 5.7361, "mean_token_accuracy": 0.17124791145324708, "num_tokens": 82246503.0, "step": 37995 }, { "entropy": 6.244542741775513, "epoch": 4.066349189362727, "grad_norm": 1.0859375, "learning_rate": 0.00034436153691723344, "loss": 5.7767, "mean_token_accuracy": 0.16877007335424424, "num_tokens": 82256693.0, "step": 38000 }, { "entropy": 6.21637372970581, "epoch": 4.066884263470491, "grad_norm": 1.171875, "learning_rate": 0.00034432516460647595, "loss": 5.6606, "mean_token_accuracy": 0.1752988278865814, "num_tokens": 82266721.0, "step": 38005 }, { "entropy": 6.288914680480957, "epoch": 4.067419337578254, "grad_norm": 1.0234375, "learning_rate": 0.00034428879029396405, "loss": 5.8443, "mean_token_accuracy": 0.1649675726890564, "num_tokens": 82276921.0, "step": 38010 }, { "entropy": 6.302992486953736, "epoch": 4.067954411686019, "grad_norm": 0.9765625, "learning_rate": 0.0003442524139807481, "loss": 5.7831, "mean_token_accuracy": 0.16772380322217942, "num_tokens": 82288796.0, "step": 38015 }, { "entropy": 6.3247734069824215, "epoch": 4.068489485793783, "grad_norm": 1.0, "learning_rate": 0.00034421603566787837, "loss": 5.7941, "mean_token_accuracy": 0.16912074238061905, "num_tokens": 82299870.0, "step": 38020 }, { "entropy": 6.193896961212158, "epoch": 4.069024559901546, "grad_norm": 1.0703125, "learning_rate": 0.00034417965535640544, "loss": 5.6506, "mean_token_accuracy": 0.1809525817632675, "num_tokens": 82311112.0, "step": 38025 }, { "entropy": 6.3050071716308596, "epoch": 4.06955963400931, "grad_norm": 1.078125, "learning_rate": 0.0003441432730473795, "loss": 5.873, "mean_token_accuracy": 0.16846924722194673, "num_tokens": 82322236.0, "step": 38030 }, { "entropy": 6.275807905197143, "epoch": 4.070094708117074, "grad_norm": 1.109375, "learning_rate": 0.00034410688874185144, "loss": 5.7783, "mean_token_accuracy": 0.17150893211364746, "num_tokens": 82331915.0, "step": 38035 }, { "entropy": 6.194033193588257, "epoch": 4.070629782224838, "grad_norm": 1.1796875, "learning_rate": 0.0003440705024408716, "loss": 5.722, "mean_token_accuracy": 0.17692021131515503, "num_tokens": 82343193.0, "step": 38040 }, { "entropy": 6.202600622177124, "epoch": 4.071164856332602, "grad_norm": 1.0234375, "learning_rate": 0.0003440341141454908, "loss": 5.7686, "mean_token_accuracy": 0.1782764032483101, "num_tokens": 82354783.0, "step": 38045 }, { "entropy": 6.303980875015259, "epoch": 4.071699930440366, "grad_norm": 1.0078125, "learning_rate": 0.00034399772385675955, "loss": 5.7432, "mean_token_accuracy": 0.17638404965400695, "num_tokens": 82365471.0, "step": 38050 }, { "entropy": 6.313400506973267, "epoch": 4.07223500454813, "grad_norm": 1.03125, "learning_rate": 0.00034396133157572873, "loss": 5.794, "mean_token_accuracy": 0.16631372272968292, "num_tokens": 82376751.0, "step": 38055 }, { "entropy": 6.1582489013671875, "epoch": 4.072770078655894, "grad_norm": 0.953125, "learning_rate": 0.00034392493730344917, "loss": 5.6545, "mean_token_accuracy": 0.18481099754571914, "num_tokens": 82388385.0, "step": 38060 }, { "entropy": 6.2365272521972654, "epoch": 4.073305152763658, "grad_norm": 0.99609375, "learning_rate": 0.00034388854104097167, "loss": 5.653, "mean_token_accuracy": 0.17429738491773605, "num_tokens": 82398703.0, "step": 38065 }, { "entropy": 6.13312931060791, "epoch": 4.073840226871422, "grad_norm": 0.99609375, "learning_rate": 0.00034385214278934736, "loss": 5.6594, "mean_token_accuracy": 0.17061042040586472, "num_tokens": 82410218.0, "step": 38070 }, { "entropy": 6.192829132080078, "epoch": 4.074375300979185, "grad_norm": 1.015625, "learning_rate": 0.000343815742549627, "loss": 5.6748, "mean_token_accuracy": 0.1856613650918007, "num_tokens": 82421932.0, "step": 38075 }, { "entropy": 6.1912078857421875, "epoch": 4.07491037508695, "grad_norm": 1.015625, "learning_rate": 0.0003437793403228618, "loss": 5.6872, "mean_token_accuracy": 0.1751426264643669, "num_tokens": 82432437.0, "step": 38080 }, { "entropy": 6.174805688858032, "epoch": 4.075445449194714, "grad_norm": 1.3046875, "learning_rate": 0.00034374293611010275, "loss": 5.7356, "mean_token_accuracy": 0.17362565100193023, "num_tokens": 82443379.0, "step": 38085 }, { "entropy": 6.226037216186524, "epoch": 4.075980523302477, "grad_norm": 1.0078125, "learning_rate": 0.00034370652991240117, "loss": 5.6944, "mean_token_accuracy": 0.1814407378435135, "num_tokens": 82454594.0, "step": 38090 }, { "entropy": 6.232190036773682, "epoch": 4.076515597410241, "grad_norm": 1.0390625, "learning_rate": 0.0003436701217308081, "loss": 5.6648, "mean_token_accuracy": 0.18512912690639496, "num_tokens": 82465390.0, "step": 38095 }, { "entropy": 6.227863931655884, "epoch": 4.0770506715180055, "grad_norm": 1.1484375, "learning_rate": 0.000343633711566375, "loss": 5.7324, "mean_token_accuracy": 0.17489729523658754, "num_tokens": 82475744.0, "step": 38100 }, { "entropy": 6.275246477127075, "epoch": 4.077585745625769, "grad_norm": 1.1171875, "learning_rate": 0.00034359729942015307, "loss": 5.7231, "mean_token_accuracy": 0.18077125251293183, "num_tokens": 82486543.0, "step": 38105 }, { "entropy": 6.226014900207519, "epoch": 4.078120819733533, "grad_norm": 1.015625, "learning_rate": 0.0003435608852931938, "loss": 5.7094, "mean_token_accuracy": 0.17912439703941346, "num_tokens": 82497764.0, "step": 38110 }, { "entropy": 6.290340852737427, "epoch": 4.078655893841297, "grad_norm": 0.9921875, "learning_rate": 0.0003435244691865485, "loss": 5.8237, "mean_token_accuracy": 0.17227209657430648, "num_tokens": 82508494.0, "step": 38115 }, { "entropy": 6.309279203414917, "epoch": 4.079190967949061, "grad_norm": 1.03125, "learning_rate": 0.00034348805110126886, "loss": 5.8247, "mean_token_accuracy": 0.17303960919380187, "num_tokens": 82520144.0, "step": 38120 }, { "entropy": 6.277739334106445, "epoch": 4.079726042056825, "grad_norm": 0.98046875, "learning_rate": 0.00034345163103840636, "loss": 5.7291, "mean_token_accuracy": 0.16997509598731994, "num_tokens": 82531488.0, "step": 38125 }, { "entropy": 6.221525239944458, "epoch": 4.080261116164589, "grad_norm": 0.9921875, "learning_rate": 0.00034341520899901267, "loss": 5.7243, "mean_token_accuracy": 0.1786672964692116, "num_tokens": 82542963.0, "step": 38130 }, { "entropy": 6.1434112071990965, "epoch": 4.080796190272353, "grad_norm": 1.0546875, "learning_rate": 0.0003433787849841393, "loss": 5.6767, "mean_token_accuracy": 0.17559418231248855, "num_tokens": 82554560.0, "step": 38135 }, { "entropy": 6.2761842727661135, "epoch": 4.0813312643801165, "grad_norm": 1.0234375, "learning_rate": 0.0003433423589948383, "loss": 5.7196, "mean_token_accuracy": 0.1671050325036049, "num_tokens": 82564699.0, "step": 38140 }, { "entropy": 6.3492138385772705, "epoch": 4.08186633848788, "grad_norm": 1.0078125, "learning_rate": 0.0003433059310321612, "loss": 5.8876, "mean_token_accuracy": 0.15981266498565674, "num_tokens": 82576316.0, "step": 38145 }, { "entropy": 6.264504098892212, "epoch": 4.082401412595645, "grad_norm": 1.1171875, "learning_rate": 0.00034326950109715986, "loss": 5.7854, "mean_token_accuracy": 0.1711555764079094, "num_tokens": 82588247.0, "step": 38150 }, { "entropy": 6.242075061798095, "epoch": 4.082936486703408, "grad_norm": 1.09375, "learning_rate": 0.00034323306919088644, "loss": 5.7061, "mean_token_accuracy": 0.16867393106222153, "num_tokens": 82598591.0, "step": 38155 }, { "entropy": 6.265572357177734, "epoch": 4.083471560811172, "grad_norm": 1.0078125, "learning_rate": 0.0003431966353143926, "loss": 5.7921, "mean_token_accuracy": 0.17080275118350982, "num_tokens": 82610401.0, "step": 38160 }, { "entropy": 6.265258407592773, "epoch": 4.084006634918937, "grad_norm": 1.0625, "learning_rate": 0.0003431601994687305, "loss": 5.7503, "mean_token_accuracy": 0.17027007937431335, "num_tokens": 82622135.0, "step": 38165 }, { "entropy": 6.182986402511597, "epoch": 4.0845417090267, "grad_norm": 1.03125, "learning_rate": 0.00034312376165495235, "loss": 5.7106, "mean_token_accuracy": 0.17283529788255692, "num_tokens": 82632318.0, "step": 38170 }, { "entropy": 6.151744985580445, "epoch": 4.085076783134464, "grad_norm": 0.984375, "learning_rate": 0.00034308732187411005, "loss": 5.677, "mean_token_accuracy": 0.1781136766076088, "num_tokens": 82642369.0, "step": 38175 }, { "entropy": 6.251854133605957, "epoch": 4.085611857242228, "grad_norm": 1.0, "learning_rate": 0.00034305088012725587, "loss": 5.7698, "mean_token_accuracy": 0.17158391028642656, "num_tokens": 82653271.0, "step": 38180 }, { "entropy": 6.309986877441406, "epoch": 4.086146931349992, "grad_norm": 0.9765625, "learning_rate": 0.00034301443641544224, "loss": 5.799, "mean_token_accuracy": 0.16259725391864777, "num_tokens": 82663748.0, "step": 38185 }, { "entropy": 6.275076770782471, "epoch": 4.086682005457756, "grad_norm": 1.109375, "learning_rate": 0.00034297799073972117, "loss": 5.777, "mean_token_accuracy": 0.1700163170695305, "num_tokens": 82674352.0, "step": 38190 }, { "entropy": 6.198044919967652, "epoch": 4.087217079565519, "grad_norm": 1.0390625, "learning_rate": 0.0003429415431011452, "loss": 5.6821, "mean_token_accuracy": 0.18055697679519653, "num_tokens": 82685479.0, "step": 38195 }, { "entropy": 6.253774690628052, "epoch": 4.087752153673284, "grad_norm": 1.0390625, "learning_rate": 0.00034290509350076676, "loss": 5.8349, "mean_token_accuracy": 0.16267903447151183, "num_tokens": 82696379.0, "step": 38200 }, { "entropy": 6.298346519470215, "epoch": 4.088287227781048, "grad_norm": 1.0078125, "learning_rate": 0.0003428686419396383, "loss": 5.7501, "mean_token_accuracy": 0.17049286961555482, "num_tokens": 82707705.0, "step": 38205 }, { "entropy": 6.2453453063964846, "epoch": 4.088822301888811, "grad_norm": 1.0625, "learning_rate": 0.00034283218841881224, "loss": 5.7198, "mean_token_accuracy": 0.17534486800432206, "num_tokens": 82718770.0, "step": 38210 }, { "entropy": 6.291575860977173, "epoch": 4.089357375996576, "grad_norm": 1.1875, "learning_rate": 0.0003427957329393413, "loss": 5.7501, "mean_token_accuracy": 0.17662801146507262, "num_tokens": 82728781.0, "step": 38215 }, { "entropy": 6.20381498336792, "epoch": 4.089892450104339, "grad_norm": 0.98046875, "learning_rate": 0.00034275927550227815, "loss": 5.7572, "mean_token_accuracy": 0.1698474943637848, "num_tokens": 82739626.0, "step": 38220 }, { "entropy": 6.180071878433227, "epoch": 4.090427524212103, "grad_norm": 1.09375, "learning_rate": 0.00034272281610867543, "loss": 5.727, "mean_token_accuracy": 0.18194008320569993, "num_tokens": 82750106.0, "step": 38225 }, { "entropy": 6.26355996131897, "epoch": 4.090962598319868, "grad_norm": 1.15625, "learning_rate": 0.0003426863547595859, "loss": 5.7669, "mean_token_accuracy": 0.17264048010110855, "num_tokens": 82760605.0, "step": 38230 }, { "entropy": 6.3290284156799315, "epoch": 4.091497672427631, "grad_norm": 0.9296875, "learning_rate": 0.0003426498914560624, "loss": 5.776, "mean_token_accuracy": 0.16798558682203293, "num_tokens": 82772062.0, "step": 38235 }, { "entropy": 6.305690050125122, "epoch": 4.092032746535395, "grad_norm": 1.0078125, "learning_rate": 0.00034261342619915775, "loss": 5.7352, "mean_token_accuracy": 0.1675169959664345, "num_tokens": 82783227.0, "step": 38240 }, { "entropy": 6.234047937393188, "epoch": 4.0925678206431595, "grad_norm": 1.0546875, "learning_rate": 0.000342576958989925, "loss": 5.7527, "mean_token_accuracy": 0.171070958673954, "num_tokens": 82794810.0, "step": 38245 }, { "entropy": 6.267085886001587, "epoch": 4.093102894750923, "grad_norm": 1.0, "learning_rate": 0.000342540489829417, "loss": 5.7833, "mean_token_accuracy": 0.16440305411815642, "num_tokens": 82806463.0, "step": 38250 }, { "entropy": 6.258987188339233, "epoch": 4.093637968858687, "grad_norm": 1.03125, "learning_rate": 0.0003425040187186869, "loss": 5.7274, "mean_token_accuracy": 0.16952957957983017, "num_tokens": 82817960.0, "step": 38255 }, { "entropy": 6.27686915397644, "epoch": 4.0941730429664505, "grad_norm": 1.1328125, "learning_rate": 0.00034246754565878763, "loss": 5.8083, "mean_token_accuracy": 0.169060680270195, "num_tokens": 82828315.0, "step": 38260 }, { "entropy": 6.225319528579712, "epoch": 4.094708117074215, "grad_norm": 1.015625, "learning_rate": 0.00034243107065077253, "loss": 5.7606, "mean_token_accuracy": 0.17396796941757203, "num_tokens": 82839816.0, "step": 38265 }, { "entropy": 6.344619989395142, "epoch": 4.095243191181979, "grad_norm": 1.1328125, "learning_rate": 0.00034239459369569475, "loss": 5.8794, "mean_token_accuracy": 0.1644282341003418, "num_tokens": 82850855.0, "step": 38270 }, { "entropy": 6.349449729919433, "epoch": 4.095778265289742, "grad_norm": 1.046875, "learning_rate": 0.00034235811479460754, "loss": 5.784, "mean_token_accuracy": 0.17261106222867967, "num_tokens": 82861591.0, "step": 38275 }, { "entropy": 6.2067461013793945, "epoch": 4.096313339397507, "grad_norm": 1.046875, "learning_rate": 0.0003423216339485642, "loss": 5.6767, "mean_token_accuracy": 0.18088046759366988, "num_tokens": 82872695.0, "step": 38280 }, { "entropy": 6.249995422363281, "epoch": 4.0968484135052705, "grad_norm": 1.1015625, "learning_rate": 0.00034228515115861824, "loss": 5.882, "mean_token_accuracy": 0.16851209849119186, "num_tokens": 82883384.0, "step": 38285 }, { "entropy": 6.250592565536499, "epoch": 4.097383487613034, "grad_norm": 1.0390625, "learning_rate": 0.00034224866642582286, "loss": 5.7197, "mean_token_accuracy": 0.17073734998703002, "num_tokens": 82894114.0, "step": 38290 }, { "entropy": 6.290414619445801, "epoch": 4.097918561720799, "grad_norm": 1.0234375, "learning_rate": 0.0003422121797512317, "loss": 5.7735, "mean_token_accuracy": 0.1685799703001976, "num_tokens": 82904648.0, "step": 38295 }, { "entropy": 6.2708948135375975, "epoch": 4.098453635828562, "grad_norm": 0.9765625, "learning_rate": 0.00034217569113589847, "loss": 5.7622, "mean_token_accuracy": 0.16688250750303268, "num_tokens": 82914998.0, "step": 38300 }, { "entropy": 6.2449136734008786, "epoch": 4.098988709936326, "grad_norm": 1.0078125, "learning_rate": 0.0003421392005808764, "loss": 5.7744, "mean_token_accuracy": 0.17080995440483093, "num_tokens": 82925206.0, "step": 38305 }, { "entropy": 6.3334746837615965, "epoch": 4.09952378404409, "grad_norm": 0.99609375, "learning_rate": 0.00034210270808721945, "loss": 5.8478, "mean_token_accuracy": 0.1705235242843628, "num_tokens": 82936722.0, "step": 38310 }, { "entropy": 6.3003369808197025, "epoch": 4.100058858151854, "grad_norm": 1.0078125, "learning_rate": 0.00034206621365598123, "loss": 5.7955, "mean_token_accuracy": 0.17415544241666794, "num_tokens": 82947869.0, "step": 38315 }, { "entropy": 6.317213249206543, "epoch": 4.100593932259618, "grad_norm": 1.1484375, "learning_rate": 0.00034202971728821546, "loss": 5.7468, "mean_token_accuracy": 0.1727177232503891, "num_tokens": 82959004.0, "step": 38320 }, { "entropy": 6.330524015426636, "epoch": 4.1011290063673815, "grad_norm": 0.9609375, "learning_rate": 0.000341993218984976, "loss": 5.8083, "mean_token_accuracy": 0.16421699821949004, "num_tokens": 82969935.0, "step": 38325 }, { "entropy": 6.233648252487183, "epoch": 4.101664080475146, "grad_norm": 1.1796875, "learning_rate": 0.0003419567187473168, "loss": 5.6952, "mean_token_accuracy": 0.17303632944822311, "num_tokens": 82979784.0, "step": 38330 }, { "entropy": 6.291279888153076, "epoch": 4.10219915458291, "grad_norm": 1.0703125, "learning_rate": 0.0003419202165762918, "loss": 5.841, "mean_token_accuracy": 0.16909376829862593, "num_tokens": 82990784.0, "step": 38335 }, { "entropy": 6.199710845947266, "epoch": 4.102734228690673, "grad_norm": 1.1328125, "learning_rate": 0.0003418837124729549, "loss": 5.6915, "mean_token_accuracy": 0.17105703800916672, "num_tokens": 83001088.0, "step": 38340 }, { "entropy": 6.25602536201477, "epoch": 4.103269302798438, "grad_norm": 1.09375, "learning_rate": 0.0003418472064383602, "loss": 5.7375, "mean_token_accuracy": 0.17773725241422653, "num_tokens": 83011878.0, "step": 38345 }, { "entropy": 6.252611827850342, "epoch": 4.103804376906202, "grad_norm": 1.03125, "learning_rate": 0.0003418106984735619, "loss": 5.7639, "mean_token_accuracy": 0.17115962952375413, "num_tokens": 83022190.0, "step": 38350 }, { "entropy": 6.204939126968384, "epoch": 4.104339451013965, "grad_norm": 1.0859375, "learning_rate": 0.00034177418857961393, "loss": 5.7225, "mean_token_accuracy": 0.17241987735033035, "num_tokens": 83032452.0, "step": 38355 }, { "entropy": 6.225674629211426, "epoch": 4.10487452512173, "grad_norm": 1.0859375, "learning_rate": 0.00034173767675757066, "loss": 5.697, "mean_token_accuracy": 0.17206112444400787, "num_tokens": 83042474.0, "step": 38360 }, { "entropy": 6.252194452285766, "epoch": 4.1054095992294934, "grad_norm": 1.109375, "learning_rate": 0.0003417011630084864, "loss": 5.7638, "mean_token_accuracy": 0.16750158071517945, "num_tokens": 83053014.0, "step": 38365 }, { "entropy": 6.249929285049438, "epoch": 4.105944673337257, "grad_norm": 1.015625, "learning_rate": 0.0003416646473334155, "loss": 5.7181, "mean_token_accuracy": 0.1721334621310234, "num_tokens": 83064041.0, "step": 38370 }, { "entropy": 6.263981723785401, "epoch": 4.106479747445021, "grad_norm": 1.0390625, "learning_rate": 0.0003416281297334122, "loss": 5.7554, "mean_token_accuracy": 0.17104144096374513, "num_tokens": 83074808.0, "step": 38375 }, { "entropy": 6.193484210968018, "epoch": 4.107014821552785, "grad_norm": 1.03125, "learning_rate": 0.00034159161020953094, "loss": 5.6635, "mean_token_accuracy": 0.17871723771095277, "num_tokens": 83086546.0, "step": 38380 }, { "entropy": 6.241353988647461, "epoch": 4.107549895660549, "grad_norm": 1.078125, "learning_rate": 0.0003415550887628264, "loss": 5.7859, "mean_token_accuracy": 0.16750048696994782, "num_tokens": 83097129.0, "step": 38385 }, { "entropy": 6.306561422348023, "epoch": 4.108084969768313, "grad_norm": 1.0078125, "learning_rate": 0.000341518565394353, "loss": 5.7763, "mean_token_accuracy": 0.17379921823740005, "num_tokens": 83108992.0, "step": 38390 }, { "entropy": 6.216528797149659, "epoch": 4.108620043876077, "grad_norm": 1.1640625, "learning_rate": 0.0003414820401051654, "loss": 5.7019, "mean_token_accuracy": 0.1804526373744011, "num_tokens": 83119246.0, "step": 38395 }, { "entropy": 6.234282541275024, "epoch": 4.109155117983841, "grad_norm": 1.0859375, "learning_rate": 0.00034144551289631814, "loss": 5.7255, "mean_token_accuracy": 0.17715137153863908, "num_tokens": 83130390.0, "step": 38400 }, { "entropy": 6.228002977371216, "epoch": 4.1096901920916045, "grad_norm": 1.046875, "learning_rate": 0.00034140898376886614, "loss": 5.7023, "mean_token_accuracy": 0.1816617414355278, "num_tokens": 83141245.0, "step": 38405 }, { "entropy": 6.28403959274292, "epoch": 4.110225266199369, "grad_norm": 1.078125, "learning_rate": 0.00034137245272386404, "loss": 5.7516, "mean_token_accuracy": 0.1705560192465782, "num_tokens": 83150906.0, "step": 38410 }, { "entropy": 6.331057357788086, "epoch": 4.110760340307133, "grad_norm": 1.15625, "learning_rate": 0.00034133591976236665, "loss": 5.835, "mean_token_accuracy": 0.16667293161153793, "num_tokens": 83161640.0, "step": 38415 }, { "entropy": 6.250393342971802, "epoch": 4.111295414414896, "grad_norm": 1.078125, "learning_rate": 0.00034129938488542896, "loss": 5.7268, "mean_token_accuracy": 0.17511783987283708, "num_tokens": 83172351.0, "step": 38420 }, { "entropy": 6.092566680908203, "epoch": 4.11183048852266, "grad_norm": 1.0703125, "learning_rate": 0.0003412628480941058, "loss": 5.6807, "mean_token_accuracy": 0.17273126542568207, "num_tokens": 83183523.0, "step": 38425 }, { "entropy": 6.2752213954925535, "epoch": 4.1123655626304245, "grad_norm": 1.140625, "learning_rate": 0.0003412263093894522, "loss": 5.7133, "mean_token_accuracy": 0.17185481190681456, "num_tokens": 83193669.0, "step": 38430 }, { "entropy": 6.247622966766357, "epoch": 4.112900636738188, "grad_norm": 1.046875, "learning_rate": 0.0003411897687725233, "loss": 5.7083, "mean_token_accuracy": 0.17676686346530915, "num_tokens": 83203576.0, "step": 38435 }, { "entropy": 6.276543855667114, "epoch": 4.113435710845952, "grad_norm": 1.03125, "learning_rate": 0.00034115322624437395, "loss": 5.8021, "mean_token_accuracy": 0.17264641523361207, "num_tokens": 83213622.0, "step": 38440 }, { "entropy": 6.217222070693969, "epoch": 4.113970784953716, "grad_norm": 1.1875, "learning_rate": 0.00034111668180605967, "loss": 5.7265, "mean_token_accuracy": 0.17345581501722335, "num_tokens": 83224477.0, "step": 38445 }, { "entropy": 6.29837555885315, "epoch": 4.11450585906148, "grad_norm": 1.046875, "learning_rate": 0.00034108013545863547, "loss": 5.813, "mean_token_accuracy": 0.1690448984503746, "num_tokens": 83235974.0, "step": 38450 }, { "entropy": 6.313672637939453, "epoch": 4.115040933169244, "grad_norm": 1.0546875, "learning_rate": 0.0003410435872031565, "loss": 5.7298, "mean_token_accuracy": 0.16574726998806, "num_tokens": 83246509.0, "step": 38455 }, { "entropy": 6.24420485496521, "epoch": 4.115576007277008, "grad_norm": 1.09375, "learning_rate": 0.0003410070370406784, "loss": 5.7306, "mean_token_accuracy": 0.17933278977870942, "num_tokens": 83256312.0, "step": 38460 }, { "entropy": 6.238118648529053, "epoch": 4.116111081384772, "grad_norm": 1.046875, "learning_rate": 0.00034097048497225643, "loss": 5.7958, "mean_token_accuracy": 0.16857805252075195, "num_tokens": 83266978.0, "step": 38465 }, { "entropy": 6.323090314865112, "epoch": 4.1166461554925355, "grad_norm": 1.1328125, "learning_rate": 0.00034093393099894577, "loss": 5.7943, "mean_token_accuracy": 0.17504110485315322, "num_tokens": 83277805.0, "step": 38470 }, { "entropy": 6.204800081253052, "epoch": 4.1171812296003, "grad_norm": 1.15625, "learning_rate": 0.00034089737512180216, "loss": 5.7531, "mean_token_accuracy": 0.1752119168639183, "num_tokens": 83288172.0, "step": 38475 }, { "entropy": 6.197217226028442, "epoch": 4.117716303708064, "grad_norm": 1.0, "learning_rate": 0.00034086081734188126, "loss": 5.7482, "mean_token_accuracy": 0.17203341722488402, "num_tokens": 83299455.0, "step": 38480 }, { "entropy": 6.193733406066895, "epoch": 4.118251377815827, "grad_norm": 0.9609375, "learning_rate": 0.0003408242576602384, "loss": 5.7437, "mean_token_accuracy": 0.1678423047065735, "num_tokens": 83310492.0, "step": 38485 }, { "entropy": 6.284328889846802, "epoch": 4.118786451923591, "grad_norm": 1.046875, "learning_rate": 0.0003407876960779293, "loss": 5.764, "mean_token_accuracy": 0.1752527579665184, "num_tokens": 83320982.0, "step": 38490 }, { "entropy": 6.34103422164917, "epoch": 4.119321526031356, "grad_norm": 1.15625, "learning_rate": 0.0003407511325960099, "loss": 5.7584, "mean_token_accuracy": 0.17421720772981644, "num_tokens": 83331202.0, "step": 38495 }, { "entropy": 6.282748079299926, "epoch": 4.119856600139119, "grad_norm": 1.109375, "learning_rate": 0.0003407145672155356, "loss": 5.7534, "mean_token_accuracy": 0.16586170494556426, "num_tokens": 83341893.0, "step": 38500 }, { "entropy": 6.213403129577637, "epoch": 4.120391674246883, "grad_norm": 0.96875, "learning_rate": 0.0003406779999375625, "loss": 5.7395, "mean_token_accuracy": 0.16829076707363128, "num_tokens": 83353135.0, "step": 38505 }, { "entropy": 6.172280216217041, "epoch": 4.1209267483546475, "grad_norm": 1.1015625, "learning_rate": 0.0003406414307631464, "loss": 5.7146, "mean_token_accuracy": 0.1719372346997261, "num_tokens": 83364155.0, "step": 38510 }, { "entropy": 6.25323371887207, "epoch": 4.121461822462411, "grad_norm": 1.0546875, "learning_rate": 0.00034060485969334304, "loss": 5.7952, "mean_token_accuracy": 0.16920054852962493, "num_tokens": 83375017.0, "step": 38515 }, { "entropy": 6.236517667770386, "epoch": 4.121996896570175, "grad_norm": 1.03125, "learning_rate": 0.0003405682867292087, "loss": 5.7579, "mean_token_accuracy": 0.17349154353141785, "num_tokens": 83386334.0, "step": 38520 }, { "entropy": 6.306081533432007, "epoch": 4.122531970677939, "grad_norm": 1.0390625, "learning_rate": 0.00034053171187179934, "loss": 5.7853, "mean_token_accuracy": 0.17339014112949372, "num_tokens": 83397350.0, "step": 38525 }, { "entropy": 6.255033016204834, "epoch": 4.123067044785703, "grad_norm": 1.0625, "learning_rate": 0.00034049513512217095, "loss": 5.7229, "mean_token_accuracy": 0.1799115315079689, "num_tokens": 83407879.0, "step": 38530 }, { "entropy": 6.255897855758667, "epoch": 4.123602118893467, "grad_norm": 1.046875, "learning_rate": 0.0003404585564813797, "loss": 5.8103, "mean_token_accuracy": 0.1671220064163208, "num_tokens": 83418861.0, "step": 38535 }, { "entropy": 6.181458282470703, "epoch": 4.12413719300123, "grad_norm": 1.0859375, "learning_rate": 0.000340421975950482, "loss": 5.6499, "mean_token_accuracy": 0.18048853278160096, "num_tokens": 83429436.0, "step": 38540 }, { "entropy": 6.20248327255249, "epoch": 4.124672267108995, "grad_norm": 1.0625, "learning_rate": 0.00034038539353053375, "loss": 5.7527, "mean_token_accuracy": 0.17195129841566087, "num_tokens": 83440123.0, "step": 38545 }, { "entropy": 6.2321820735931395, "epoch": 4.1252073412167585, "grad_norm": 0.96484375, "learning_rate": 0.00034034880922259147, "loss": 5.6614, "mean_token_accuracy": 0.1829308718442917, "num_tokens": 83451558.0, "step": 38550 }, { "entropy": 6.258267641067505, "epoch": 4.125742415324522, "grad_norm": 1.1484375, "learning_rate": 0.00034031222302771165, "loss": 5.7578, "mean_token_accuracy": 0.17698044776916505, "num_tokens": 83461971.0, "step": 38555 }, { "entropy": 6.291214799880981, "epoch": 4.126277489432287, "grad_norm": 0.99609375, "learning_rate": 0.0003402756349469504, "loss": 5.7906, "mean_token_accuracy": 0.16761258542537688, "num_tokens": 83473307.0, "step": 38560 }, { "entropy": 6.2606010913848875, "epoch": 4.12681256354005, "grad_norm": 1.0, "learning_rate": 0.0003402390449813645, "loss": 5.7552, "mean_token_accuracy": 0.1685497894883156, "num_tokens": 83484844.0, "step": 38565 }, { "entropy": 6.244180822372437, "epoch": 4.127347637647814, "grad_norm": 1.0625, "learning_rate": 0.0003402024531320102, "loss": 5.7571, "mean_token_accuracy": 0.1702340602874756, "num_tokens": 83494876.0, "step": 38570 }, { "entropy": 6.288418292999268, "epoch": 4.1278827117555785, "grad_norm": 0.96484375, "learning_rate": 0.0003401658593999443, "loss": 5.817, "mean_token_accuracy": 0.16212920993566513, "num_tokens": 83507378.0, "step": 38575 }, { "entropy": 6.270894384384155, "epoch": 4.128417785863342, "grad_norm": 1.109375, "learning_rate": 0.00034012926378622344, "loss": 5.7713, "mean_token_accuracy": 0.17495738267898558, "num_tokens": 83518684.0, "step": 38580 }, { "entropy": 6.234004163742066, "epoch": 4.128952859971106, "grad_norm": 0.95703125, "learning_rate": 0.0003400926662919041, "loss": 5.723, "mean_token_accuracy": 0.1676715523004532, "num_tokens": 83530244.0, "step": 38585 }, { "entropy": 6.258831644058228, "epoch": 4.12948793407887, "grad_norm": 1.0390625, "learning_rate": 0.00034005606691804325, "loss": 5.7345, "mean_token_accuracy": 0.17192655354738234, "num_tokens": 83540672.0, "step": 38590 }, { "entropy": 6.264812803268432, "epoch": 4.130023008186634, "grad_norm": 1.046875, "learning_rate": 0.0003400194656656976, "loss": 5.7534, "mean_token_accuracy": 0.16790501028299332, "num_tokens": 83551502.0, "step": 38595 }, { "entropy": 6.328976678848266, "epoch": 4.130558082294398, "grad_norm": 1.03125, "learning_rate": 0.00033998286253592404, "loss": 5.8451, "mean_token_accuracy": 0.16632744967937468, "num_tokens": 83562567.0, "step": 38600 }, { "entropy": 6.259438943862915, "epoch": 4.131093156402161, "grad_norm": 1.03125, "learning_rate": 0.00033994625752977944, "loss": 5.7523, "mean_token_accuracy": 0.17628497034311294, "num_tokens": 83573256.0, "step": 38605 }, { "entropy": 6.2365327835083, "epoch": 4.131628230509926, "grad_norm": 1.0625, "learning_rate": 0.0003399096506483208, "loss": 5.7644, "mean_token_accuracy": 0.16965112835168839, "num_tokens": 83585628.0, "step": 38610 }, { "entropy": 6.243737316131591, "epoch": 4.1321633046176895, "grad_norm": 1.109375, "learning_rate": 0.00033987304189260503, "loss": 5.6851, "mean_token_accuracy": 0.18121615052223206, "num_tokens": 83596409.0, "step": 38615 }, { "entropy": 6.304189395904541, "epoch": 4.132698378725453, "grad_norm": 1.046875, "learning_rate": 0.00033983643126368936, "loss": 5.8205, "mean_token_accuracy": 0.16338122338056565, "num_tokens": 83606342.0, "step": 38620 }, { "entropy": 6.223437023162842, "epoch": 4.133233452833218, "grad_norm": 1.0546875, "learning_rate": 0.0003397998187626309, "loss": 5.6986, "mean_token_accuracy": 0.17559425681829452, "num_tokens": 83616154.0, "step": 38625 }, { "entropy": 6.211090803146362, "epoch": 4.133768526940981, "grad_norm": 1.125, "learning_rate": 0.0003397632043904866, "loss": 5.7484, "mean_token_accuracy": 0.16869962364435195, "num_tokens": 83626063.0, "step": 38630 }, { "entropy": 6.195105075836182, "epoch": 4.134303601048745, "grad_norm": 1.125, "learning_rate": 0.000339726588148314, "loss": 5.7059, "mean_token_accuracy": 0.170663782954216, "num_tokens": 83638500.0, "step": 38635 }, { "entropy": 6.314938974380493, "epoch": 4.13483867515651, "grad_norm": 1.046875, "learning_rate": 0.00033968997003717033, "loss": 5.7792, "mean_token_accuracy": 0.17348968833684922, "num_tokens": 83648304.0, "step": 38640 }, { "entropy": 6.233226537704468, "epoch": 4.135373749264273, "grad_norm": 1.0078125, "learning_rate": 0.0003396533500581128, "loss": 5.7063, "mean_token_accuracy": 0.17401327341794967, "num_tokens": 83659645.0, "step": 38645 }, { "entropy": 6.179140281677246, "epoch": 4.135908823372037, "grad_norm": 1.1328125, "learning_rate": 0.00033961672821219887, "loss": 5.6653, "mean_token_accuracy": 0.1806710571050644, "num_tokens": 83671017.0, "step": 38650 }, { "entropy": 6.293850374221802, "epoch": 4.136443897479801, "grad_norm": 1.0859375, "learning_rate": 0.0003395801045004859, "loss": 5.7808, "mean_token_accuracy": 0.16965127140283584, "num_tokens": 83681977.0, "step": 38655 }, { "entropy": 6.196278810501099, "epoch": 4.136978971587565, "grad_norm": 1.0859375, "learning_rate": 0.0003395434789240316, "loss": 5.6177, "mean_token_accuracy": 0.17436975985765457, "num_tokens": 83692511.0, "step": 38660 }, { "entropy": 6.196047925949097, "epoch": 4.137514045695329, "grad_norm": 1.015625, "learning_rate": 0.00033950685148389343, "loss": 5.7091, "mean_token_accuracy": 0.17282407879829406, "num_tokens": 83703437.0, "step": 38665 }, { "entropy": 6.159739828109741, "epoch": 4.138049119803092, "grad_norm": 1.1328125, "learning_rate": 0.00033947022218112894, "loss": 5.7118, "mean_token_accuracy": 0.1744796574115753, "num_tokens": 83714695.0, "step": 38670 }, { "entropy": 6.274883127212524, "epoch": 4.138584193910857, "grad_norm": 1.015625, "learning_rate": 0.0003394335910167959, "loss": 5.8545, "mean_token_accuracy": 0.16248321682214736, "num_tokens": 83725464.0, "step": 38675 }, { "entropy": 6.392390775680542, "epoch": 4.139119268018621, "grad_norm": 0.9921875, "learning_rate": 0.0003393969579919519, "loss": 5.812, "mean_token_accuracy": 0.17189232409000396, "num_tokens": 83735880.0, "step": 38680 }, { "entropy": 6.252367210388184, "epoch": 4.139654342126384, "grad_norm": 1.125, "learning_rate": 0.00033936032310765476, "loss": 5.732, "mean_token_accuracy": 0.18000553846359252, "num_tokens": 83746629.0, "step": 38685 }, { "entropy": 6.163100147247315, "epoch": 4.140189416234149, "grad_norm": 1.0390625, "learning_rate": 0.00033932368636496236, "loss": 5.6663, "mean_token_accuracy": 0.17691175639629364, "num_tokens": 83756890.0, "step": 38690 }, { "entropy": 6.24241623878479, "epoch": 4.1407244903419125, "grad_norm": 1.109375, "learning_rate": 0.00033928704776493265, "loss": 5.6953, "mean_token_accuracy": 0.17988835275173187, "num_tokens": 83766742.0, "step": 38695 }, { "entropy": 6.228583908081054, "epoch": 4.141259564449676, "grad_norm": 1.03125, "learning_rate": 0.0003392504073086234, "loss": 5.7331, "mean_token_accuracy": 0.174988853931427, "num_tokens": 83777535.0, "step": 38700 }, { "entropy": 6.243880367279052, "epoch": 4.14179463855744, "grad_norm": 1.1015625, "learning_rate": 0.00033921376499709263, "loss": 5.6247, "mean_token_accuracy": 0.183569498360157, "num_tokens": 83787487.0, "step": 38705 }, { "entropy": 6.223325920104981, "epoch": 4.142329712665204, "grad_norm": 1.1953125, "learning_rate": 0.00033917712083139846, "loss": 5.6321, "mean_token_accuracy": 0.17936672568321227, "num_tokens": 83796497.0, "step": 38710 }, { "entropy": 6.294893789291382, "epoch": 4.142864786772968, "grad_norm": 1.015625, "learning_rate": 0.00033914047481259894, "loss": 5.8042, "mean_token_accuracy": 0.1666974902153015, "num_tokens": 83807522.0, "step": 38715 }, { "entropy": 6.171779680252075, "epoch": 4.143399860880732, "grad_norm": 1.046875, "learning_rate": 0.00033910382694175216, "loss": 5.6397, "mean_token_accuracy": 0.17709069103002548, "num_tokens": 83819118.0, "step": 38720 }, { "entropy": 6.26424126625061, "epoch": 4.143934934988496, "grad_norm": 1.140625, "learning_rate": 0.0003390671772199165, "loss": 5.7994, "mean_token_accuracy": 0.16642931550741197, "num_tokens": 83829161.0, "step": 38725 }, { "entropy": 6.246732711791992, "epoch": 4.14447000909626, "grad_norm": 1.0390625, "learning_rate": 0.00033903052564815005, "loss": 5.7291, "mean_token_accuracy": 0.17864172011613846, "num_tokens": 83840291.0, "step": 38730 }, { "entropy": 6.234924221038819, "epoch": 4.1450050832040235, "grad_norm": 1.078125, "learning_rate": 0.00033899387222751114, "loss": 5.6589, "mean_token_accuracy": 0.17054994106292726, "num_tokens": 83850258.0, "step": 38735 }, { "entropy": 6.233138608932495, "epoch": 4.145540157311788, "grad_norm": 1.078125, "learning_rate": 0.0003389572169590582, "loss": 5.7914, "mean_token_accuracy": 0.16604382246732713, "num_tokens": 83861693.0, "step": 38740 }, { "entropy": 6.297372436523437, "epoch": 4.146075231419552, "grad_norm": 1.078125, "learning_rate": 0.00033892055984384954, "loss": 5.7716, "mean_token_accuracy": 0.16967786401510238, "num_tokens": 83872947.0, "step": 38745 }, { "entropy": 6.232273149490356, "epoch": 4.146610305527315, "grad_norm": 0.98046875, "learning_rate": 0.0003388839008829438, "loss": 5.648, "mean_token_accuracy": 0.18439525365829468, "num_tokens": 83885216.0, "step": 38750 }, { "entropy": 6.3032567501068115, "epoch": 4.147145379635079, "grad_norm": 1.046875, "learning_rate": 0.00033884724007739934, "loss": 5.8535, "mean_token_accuracy": 0.1677940830588341, "num_tokens": 83895318.0, "step": 38755 }, { "entropy": 6.237649393081665, "epoch": 4.1476804537428436, "grad_norm": 0.9609375, "learning_rate": 0.00033881057742827484, "loss": 5.7209, "mean_token_accuracy": 0.17289944738149643, "num_tokens": 83905782.0, "step": 38760 }, { "entropy": 6.272621917724609, "epoch": 4.148215527850607, "grad_norm": 1.078125, "learning_rate": 0.00033877391293662886, "loss": 5.7873, "mean_token_accuracy": 0.17372253388166428, "num_tokens": 83916243.0, "step": 38765 }, { "entropy": 6.262971258163452, "epoch": 4.148750601958371, "grad_norm": 1.0625, "learning_rate": 0.00033873724660352014, "loss": 5.7727, "mean_token_accuracy": 0.1719535768032074, "num_tokens": 83928573.0, "step": 38770 }, { "entropy": 6.286967039108276, "epoch": 4.149285676066135, "grad_norm": 0.984375, "learning_rate": 0.0003387005784300073, "loss": 5.7583, "mean_token_accuracy": 0.17370217740535737, "num_tokens": 83939164.0, "step": 38775 }, { "entropy": 6.254478693008423, "epoch": 4.149820750173899, "grad_norm": 1.0234375, "learning_rate": 0.00033866390841714924, "loss": 5.7374, "mean_token_accuracy": 0.1659915030002594, "num_tokens": 83950018.0, "step": 38780 }, { "entropy": 6.174606561660767, "epoch": 4.150355824281663, "grad_norm": 1.015625, "learning_rate": 0.0003386272365660047, "loss": 5.7755, "mean_token_accuracy": 0.1723278820514679, "num_tokens": 83960505.0, "step": 38785 }, { "entropy": 6.270124053955078, "epoch": 4.150890898389427, "grad_norm": 1.125, "learning_rate": 0.0003385905628776328, "loss": 5.7833, "mean_token_accuracy": 0.1740940183401108, "num_tokens": 83971138.0, "step": 38790 }, { "entropy": 6.272457647323608, "epoch": 4.151425972497191, "grad_norm": 1.0078125, "learning_rate": 0.0003385538873530922, "loss": 5.7471, "mean_token_accuracy": 0.1663058191537857, "num_tokens": 83981562.0, "step": 38795 }, { "entropy": 6.2833983421325685, "epoch": 4.151961046604955, "grad_norm": 1.09375, "learning_rate": 0.00033851720999344216, "loss": 5.7668, "mean_token_accuracy": 0.17536666691303254, "num_tokens": 83991854.0, "step": 38800 }, { "entropy": 6.246865129470825, "epoch": 4.152496120712719, "grad_norm": 0.93359375, "learning_rate": 0.0003384805307997415, "loss": 5.8058, "mean_token_accuracy": 0.16788025945425034, "num_tokens": 84003332.0, "step": 38805 }, { "entropy": 6.249060821533203, "epoch": 4.153031194820483, "grad_norm": 0.9609375, "learning_rate": 0.00033844384977304947, "loss": 5.7482, "mean_token_accuracy": 0.17894160747528076, "num_tokens": 84014774.0, "step": 38810 }, { "entropy": 6.288170576095581, "epoch": 4.153566268928246, "grad_norm": 1.0546875, "learning_rate": 0.0003384071669144252, "loss": 5.7501, "mean_token_accuracy": 0.17208007276058196, "num_tokens": 84025399.0, "step": 38815 }, { "entropy": 6.281281280517578, "epoch": 4.15410134303601, "grad_norm": 1.0703125, "learning_rate": 0.00033837048222492785, "loss": 5.8224, "mean_token_accuracy": 0.17033134996891022, "num_tokens": 84036388.0, "step": 38820 }, { "entropy": 6.306655025482177, "epoch": 4.154636417143775, "grad_norm": 1.0390625, "learning_rate": 0.0003383337957056168, "loss": 5.8311, "mean_token_accuracy": 0.17434114813804627, "num_tokens": 84046502.0, "step": 38825 }, { "entropy": 6.184350538253784, "epoch": 4.155171491251538, "grad_norm": 1.2421875, "learning_rate": 0.0003382971073575513, "loss": 5.7462, "mean_token_accuracy": 0.17545267790555955, "num_tokens": 84058230.0, "step": 38830 }, { "entropy": 6.256945705413818, "epoch": 4.155706565359302, "grad_norm": 1.0859375, "learning_rate": 0.0003382604171817906, "loss": 5.7071, "mean_token_accuracy": 0.17680657804012298, "num_tokens": 84068638.0, "step": 38835 }, { "entropy": 6.333917236328125, "epoch": 4.1562416394670665, "grad_norm": 1.0234375, "learning_rate": 0.00033822372517939436, "loss": 5.8521, "mean_token_accuracy": 0.16271225959062577, "num_tokens": 84079778.0, "step": 38840 }, { "entropy": 6.2487341403961185, "epoch": 4.15677671357483, "grad_norm": 1.0390625, "learning_rate": 0.00033818703135142194, "loss": 5.8163, "mean_token_accuracy": 0.16644812673330306, "num_tokens": 84090898.0, "step": 38845 }, { "entropy": 6.226038312911987, "epoch": 4.157311787682594, "grad_norm": 0.94921875, "learning_rate": 0.0003381503356989328, "loss": 5.7763, "mean_token_accuracy": 0.1685054212808609, "num_tokens": 84102813.0, "step": 38850 }, { "entropy": 6.302504777908325, "epoch": 4.157846861790358, "grad_norm": 1.0390625, "learning_rate": 0.0003381136382229867, "loss": 5.7306, "mean_token_accuracy": 0.17435929030179978, "num_tokens": 84114446.0, "step": 38855 }, { "entropy": 6.276942873001099, "epoch": 4.158381935898122, "grad_norm": 0.94140625, "learning_rate": 0.00033807693892464304, "loss": 5.7743, "mean_token_accuracy": 0.1665506199002266, "num_tokens": 84124831.0, "step": 38860 }, { "entropy": 6.232707166671753, "epoch": 4.158917010005886, "grad_norm": 1.125, "learning_rate": 0.0003380402378049616, "loss": 5.7581, "mean_token_accuracy": 0.16683083176612853, "num_tokens": 84134483.0, "step": 38865 }, { "entropy": 6.210233402252197, "epoch": 4.159452084113649, "grad_norm": 1.078125, "learning_rate": 0.0003380035348650023, "loss": 5.7387, "mean_token_accuracy": 0.17746644020080565, "num_tokens": 84144551.0, "step": 38870 }, { "entropy": 6.246590995788575, "epoch": 4.159987158221414, "grad_norm": 1.1015625, "learning_rate": 0.0003379668301058247, "loss": 5.7704, "mean_token_accuracy": 0.17842099368572234, "num_tokens": 84154192.0, "step": 38875 }, { "entropy": 6.2920409679412845, "epoch": 4.1605222323291775, "grad_norm": 1.125, "learning_rate": 0.0003379301235284887, "loss": 5.795, "mean_token_accuracy": 0.17004317939281463, "num_tokens": 84164596.0, "step": 38880 }, { "entropy": 6.316910171508789, "epoch": 4.161057306436941, "grad_norm": 1.0234375, "learning_rate": 0.0003378934151340544, "loss": 5.8753, "mean_token_accuracy": 0.16843308061361312, "num_tokens": 84174804.0, "step": 38885 }, { "entropy": 6.290418291091919, "epoch": 4.161592380544706, "grad_norm": 0.96875, "learning_rate": 0.0003378567049235814, "loss": 5.7573, "mean_token_accuracy": 0.16852914094924926, "num_tokens": 84186137.0, "step": 38890 }, { "entropy": 6.2497076988220215, "epoch": 4.162127454652469, "grad_norm": 0.9921875, "learning_rate": 0.0003378199928981299, "loss": 5.7773, "mean_token_accuracy": 0.17204478681087493, "num_tokens": 84197279.0, "step": 38895 }, { "entropy": 6.272364282608033, "epoch": 4.162662528760233, "grad_norm": 1.1640625, "learning_rate": 0.00033778327905876, "loss": 5.6883, "mean_token_accuracy": 0.17677990049123765, "num_tokens": 84206762.0, "step": 38900 }, { "entropy": 6.329651880264282, "epoch": 4.163197602867998, "grad_norm": 1.1796875, "learning_rate": 0.00033774656340653165, "loss": 5.8583, "mean_token_accuracy": 0.16134756952524185, "num_tokens": 84216588.0, "step": 38905 }, { "entropy": 6.1984673023223875, "epoch": 4.163732676975761, "grad_norm": 1.0625, "learning_rate": 0.0003377098459425052, "loss": 5.6542, "mean_token_accuracy": 0.1767432525753975, "num_tokens": 84227173.0, "step": 38910 }, { "entropy": 6.256656837463379, "epoch": 4.164267751083525, "grad_norm": 1.078125, "learning_rate": 0.00033767312666774067, "loss": 5.8097, "mean_token_accuracy": 0.17235388308763505, "num_tokens": 84237648.0, "step": 38915 }, { "entropy": 6.241890907287598, "epoch": 4.164802825191289, "grad_norm": 1.0390625, "learning_rate": 0.00033763640558329844, "loss": 5.7423, "mean_token_accuracy": 0.17544806152582168, "num_tokens": 84248545.0, "step": 38920 }, { "entropy": 6.213069915771484, "epoch": 4.165337899299053, "grad_norm": 1.1015625, "learning_rate": 0.00033759968269023887, "loss": 5.6459, "mean_token_accuracy": 0.1841380402445793, "num_tokens": 84259841.0, "step": 38925 }, { "entropy": 6.273794555664063, "epoch": 4.165872973406817, "grad_norm": 1.0546875, "learning_rate": 0.0003375629579896222, "loss": 5.7269, "mean_token_accuracy": 0.1746656060218811, "num_tokens": 84270092.0, "step": 38930 }, { "entropy": 6.203826427459717, "epoch": 4.16640804751458, "grad_norm": 1.0625, "learning_rate": 0.00033752623148250894, "loss": 5.6794, "mean_token_accuracy": 0.1756369560956955, "num_tokens": 84281432.0, "step": 38935 }, { "entropy": 6.308147764205932, "epoch": 4.166943121622345, "grad_norm": 0.9453125, "learning_rate": 0.0003374895031699595, "loss": 5.7316, "mean_token_accuracy": 0.17380395531654358, "num_tokens": 84292449.0, "step": 38940 }, { "entropy": 6.283732271194458, "epoch": 4.167478195730109, "grad_norm": 1.015625, "learning_rate": 0.0003374527730530344, "loss": 5.7885, "mean_token_accuracy": 0.16631855219602584, "num_tokens": 84303891.0, "step": 38945 }, { "entropy": 6.320101547241211, "epoch": 4.168013269837872, "grad_norm": 0.9921875, "learning_rate": 0.00033741604113279427, "loss": 5.8388, "mean_token_accuracy": 0.16577471941709518, "num_tokens": 84315204.0, "step": 38950 }, { "entropy": 6.273954820632935, "epoch": 4.168548343945637, "grad_norm": 1.0703125, "learning_rate": 0.0003373793074102998, "loss": 5.7711, "mean_token_accuracy": 0.16355708092451096, "num_tokens": 84325661.0, "step": 38955 }, { "entropy": 6.271699380874634, "epoch": 4.1690834180534, "grad_norm": 1.0234375, "learning_rate": 0.0003373425718866115, "loss": 5.802, "mean_token_accuracy": 0.16949939876794815, "num_tokens": 84336682.0, "step": 38960 }, { "entropy": 6.278829765319824, "epoch": 4.169618492161164, "grad_norm": 1.0546875, "learning_rate": 0.0003373058345627902, "loss": 5.7225, "mean_token_accuracy": 0.176815964281559, "num_tokens": 84346629.0, "step": 38965 }, { "entropy": 6.2218499183654785, "epoch": 4.170153566268929, "grad_norm": 1.0703125, "learning_rate": 0.00033726909543989683, "loss": 5.7695, "mean_token_accuracy": 0.169442380964756, "num_tokens": 84357526.0, "step": 38970 }, { "entropy": 6.300594615936279, "epoch": 4.170688640376692, "grad_norm": 1.078125, "learning_rate": 0.00033723235451899193, "loss": 5.7733, "mean_token_accuracy": 0.17011303156614305, "num_tokens": 84367353.0, "step": 38975 }, { "entropy": 6.28247036933899, "epoch": 4.171223714484456, "grad_norm": 1.1640625, "learning_rate": 0.00033719561180113654, "loss": 5.8197, "mean_token_accuracy": 0.17034442573785782, "num_tokens": 84379320.0, "step": 38980 }, { "entropy": 6.225915908813477, "epoch": 4.17175878859222, "grad_norm": 1.1171875, "learning_rate": 0.0003371588672873917, "loss": 5.7024, "mean_token_accuracy": 0.18226235955953599, "num_tokens": 84390020.0, "step": 38985 }, { "entropy": 6.284407711029052, "epoch": 4.172293862699984, "grad_norm": 1.03125, "learning_rate": 0.0003371221209788183, "loss": 5.767, "mean_token_accuracy": 0.170236437022686, "num_tokens": 84401292.0, "step": 38990 }, { "entropy": 6.296018123626709, "epoch": 4.172828936807748, "grad_norm": 1.0078125, "learning_rate": 0.00033708537287647724, "loss": 5.7235, "mean_token_accuracy": 0.17415497303009034, "num_tokens": 84410780.0, "step": 38995 }, { "entropy": 6.2215358257293705, "epoch": 4.1733640109155115, "grad_norm": 1.0390625, "learning_rate": 0.00033704862298142985, "loss": 5.7764, "mean_token_accuracy": 0.17673480361700059, "num_tokens": 84422473.0, "step": 39000 }, { "epoch": 4.1733640109155115, "eval_entropy": 6.0272732303470296, "eval_loss": 5.92086124420166, "eval_mean_token_accuracy": 0.1719300416516607, "eval_num_tokens": 84422473.0, "eval_runtime": 22.6765, "eval_samples_per_second": 1308.802, "eval_steps_per_second": 163.606, "step": 39000 } ], "logging_steps": 5, "max_steps": 93440, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.240356593088e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }