{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9631333939750656, "eval_steps": 3000, "global_step": 9000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691989517211914, "epoch": 0.0005350741077639254, "grad_norm": 10.75, "learning_rate": 2e-06, "loss": 10.8201, "mean_token_accuracy": 0.0, "num_tokens": 10038.0, "step": 5 }, { "entropy": 10.69193468093872, "epoch": 0.0010701482155278507, "grad_norm": 11.9375, "learning_rate": 4.5e-06, "loss": 10.789, "mean_token_accuracy": 0.00010810811072587967, "num_tokens": 21916.0, "step": 10 }, { "entropy": 10.690756225585938, "epoch": 0.0016052223232917758, "grad_norm": 8.875, "learning_rate": 7e-06, "loss": 10.5855, "mean_token_accuracy": 0.029181174421682953, "num_tokens": 33434.0, "step": 15 }, { "entropy": 10.660381984710693, "epoch": 0.0021402964310557014, "grad_norm": 5.71875, "learning_rate": 9.5e-06, "loss": 10.3113, "mean_token_accuracy": 0.04592931531369686, "num_tokens": 44216.0, "step": 20 }, { "entropy": 10.51073760986328, "epoch": 0.0026753705388196263, "grad_norm": 3.71875, "learning_rate": 1.2e-05, "loss": 10.1036, "mean_token_accuracy": 0.04351861346513033, "num_tokens": 54874.0, "step": 25 }, { "entropy": 10.5190824508667, "epoch": 0.0032104446465835517, "grad_norm": 3.09375, "learning_rate": 1.4500000000000002e-05, "loss": 9.9872, "mean_token_accuracy": 0.041112912446260454, "num_tokens": 65085.0, "step": 30 }, { "entropy": 10.547387790679931, "epoch": 0.003745518754347477, "grad_norm": 2.859375, "learning_rate": 1.7000000000000003e-05, "loss": 9.904, "mean_token_accuracy": 0.04395376648753881, "num_tokens": 75601.0, "step": 35 }, { "entropy": 10.474061203002929, "epoch": 0.004280592862111403, "grad_norm": 2.515625, "learning_rate": 1.95e-05, "loss": 9.8879, "mean_token_accuracy": 0.04307105913758278, "num_tokens": 86193.0, "step": 40 }, { "entropy": 10.531705379486084, "epoch": 0.004815666969875327, "grad_norm": 2.40625, "learning_rate": 2.2e-05, "loss": 9.8417, "mean_token_accuracy": 0.043867765367031096, "num_tokens": 96957.0, "step": 45 }, { "entropy": 10.478270435333252, "epoch": 0.005350741077639253, "grad_norm": 2.171875, "learning_rate": 2.4500000000000003e-05, "loss": 9.8114, "mean_token_accuracy": 0.046108495071530343, "num_tokens": 108408.0, "step": 50 }, { "entropy": 10.473760986328125, "epoch": 0.005885815185403178, "grad_norm": 1.7578125, "learning_rate": 2.7e-05, "loss": 9.7686, "mean_token_accuracy": 0.05027508921921253, "num_tokens": 119273.0, "step": 55 }, { "entropy": 10.462549209594727, "epoch": 0.006420889293167103, "grad_norm": 1.921875, "learning_rate": 2.95e-05, "loss": 9.6954, "mean_token_accuracy": 0.05541543699800968, "num_tokens": 130817.0, "step": 60 }, { "entropy": 10.302016353607177, "epoch": 0.006955963400931029, "grad_norm": 1.8671875, "learning_rate": 3.2e-05, "loss": 9.6448, "mean_token_accuracy": 0.05586838573217392, "num_tokens": 142599.0, "step": 65 }, { "entropy": 10.404022407531738, "epoch": 0.007491037508694954, "grad_norm": 1.9609375, "learning_rate": 3.4500000000000005e-05, "loss": 9.5697, "mean_token_accuracy": 0.05663685463368893, "num_tokens": 153617.0, "step": 70 }, { "entropy": 10.37060546875, "epoch": 0.00802611161645888, "grad_norm": 1.6953125, "learning_rate": 3.7e-05, "loss": 9.5239, "mean_token_accuracy": 0.05575243458151817, "num_tokens": 165280.0, "step": 75 }, { "entropy": 10.341149616241456, "epoch": 0.008561185724222806, "grad_norm": 1.546875, "learning_rate": 3.95e-05, "loss": 9.4643, "mean_token_accuracy": 0.055300182476639745, "num_tokens": 176896.0, "step": 80 }, { "entropy": 10.367101669311523, "epoch": 0.00909625983198673, "grad_norm": 1.5859375, "learning_rate": 4.2000000000000004e-05, "loss": 9.4019, "mean_token_accuracy": 0.05629164129495621, "num_tokens": 188000.0, "step": 85 }, { "entropy": 10.27455005645752, "epoch": 0.009631333939750655, "grad_norm": 1.6953125, "learning_rate": 4.45e-05, "loss": 9.3493, "mean_token_accuracy": 0.057158011198043826, "num_tokens": 199360.0, "step": 90 }, { "entropy": 10.319551277160645, "epoch": 0.01016640804751458, "grad_norm": 1.5703125, "learning_rate": 4.7000000000000004e-05, "loss": 9.2957, "mean_token_accuracy": 0.052791529521346095, "num_tokens": 210214.0, "step": 95 }, { "entropy": 10.196423625946045, "epoch": 0.010701482155278505, "grad_norm": 1.5078125, "learning_rate": 4.9500000000000004e-05, "loss": 9.1506, "mean_token_accuracy": 0.06025413721799851, "num_tokens": 220567.0, "step": 100 }, { "entropy": 10.14912462234497, "epoch": 0.011236556263042432, "grad_norm": 1.578125, "learning_rate": 5.2e-05, "loss": 9.057, "mean_token_accuracy": 0.06051998771727085, "num_tokens": 230585.0, "step": 105 }, { "entropy": 10.099914455413819, "epoch": 0.011771630370806356, "grad_norm": 1.53125, "learning_rate": 5.45e-05, "loss": 8.9907, "mean_token_accuracy": 0.06339392885565757, "num_tokens": 241996.0, "step": 110 }, { "entropy": 10.083064746856689, "epoch": 0.012306704478570282, "grad_norm": 1.3671875, "learning_rate": 5.7e-05, "loss": 8.9558, "mean_token_accuracy": 0.05828723199665546, "num_tokens": 253348.0, "step": 115 }, { "entropy": 9.981218147277833, "epoch": 0.012841778586334207, "grad_norm": 1.421875, "learning_rate": 5.9499999999999996e-05, "loss": 8.8376, "mean_token_accuracy": 0.05671278983354568, "num_tokens": 264239.0, "step": 120 }, { "entropy": 9.828715324401855, "epoch": 0.013376852694098133, "grad_norm": 1.2578125, "learning_rate": 6.2e-05, "loss": 8.7502, "mean_token_accuracy": 0.056628919392824176, "num_tokens": 274522.0, "step": 125 }, { "entropy": 9.77067985534668, "epoch": 0.013911926801862057, "grad_norm": 1.34375, "learning_rate": 6.450000000000001e-05, "loss": 8.6474, "mean_token_accuracy": 0.06091504544019699, "num_tokens": 284492.0, "step": 130 }, { "entropy": 9.592880916595458, "epoch": 0.014447000909625984, "grad_norm": 1.40625, "learning_rate": 6.7e-05, "loss": 8.6035, "mean_token_accuracy": 0.05946716032922268, "num_tokens": 294796.0, "step": 135 }, { "entropy": 9.45958080291748, "epoch": 0.014982075017389908, "grad_norm": 1.0, "learning_rate": 6.950000000000001e-05, "loss": 8.574, "mean_token_accuracy": 0.05749143101274967, "num_tokens": 305252.0, "step": 140 }, { "entropy": 9.359578514099121, "epoch": 0.015517149125153834, "grad_norm": 1.0859375, "learning_rate": 7.2e-05, "loss": 8.4804, "mean_token_accuracy": 0.056437050178647044, "num_tokens": 315505.0, "step": 145 }, { "entropy": 9.158096408843994, "epoch": 0.01605222323291776, "grad_norm": 1.5, "learning_rate": 7.45e-05, "loss": 8.4819, "mean_token_accuracy": 0.05990221984684467, "num_tokens": 326997.0, "step": 150 }, { "entropy": 9.094014644622803, "epoch": 0.016587297340681685, "grad_norm": 1.109375, "learning_rate": 7.7e-05, "loss": 8.4165, "mean_token_accuracy": 0.05523004196584225, "num_tokens": 338089.0, "step": 155 }, { "entropy": 8.880174732208252, "epoch": 0.01712237144844561, "grad_norm": 1.234375, "learning_rate": 7.950000000000001e-05, "loss": 8.4077, "mean_token_accuracy": 0.05682347491383553, "num_tokens": 348536.0, "step": 160 }, { "entropy": 8.93060073852539, "epoch": 0.017657445556209534, "grad_norm": 0.9296875, "learning_rate": 8.2e-05, "loss": 8.4181, "mean_token_accuracy": 0.058796605467796324, "num_tokens": 359776.0, "step": 165 }, { "entropy": 8.809493732452392, "epoch": 0.01819251966397346, "grad_norm": 1.015625, "learning_rate": 8.450000000000001e-05, "loss": 8.3472, "mean_token_accuracy": 0.06165213547646999, "num_tokens": 370810.0, "step": 170 }, { "entropy": 8.747115898132325, "epoch": 0.018727593771737387, "grad_norm": 0.94140625, "learning_rate": 8.7e-05, "loss": 8.3511, "mean_token_accuracy": 0.05888295993208885, "num_tokens": 381788.0, "step": 175 }, { "entropy": 8.742884063720703, "epoch": 0.01926266787950131, "grad_norm": 1.0390625, "learning_rate": 8.95e-05, "loss": 8.3376, "mean_token_accuracy": 0.0602983683347702, "num_tokens": 391984.0, "step": 180 }, { "entropy": 8.610486602783203, "epoch": 0.019797741987265235, "grad_norm": 1.0, "learning_rate": 9.2e-05, "loss": 8.3311, "mean_token_accuracy": 0.058925900235772134, "num_tokens": 403430.0, "step": 185 }, { "entropy": 8.670144844055176, "epoch": 0.02033281609502916, "grad_norm": 1.0234375, "learning_rate": 9.45e-05, "loss": 8.318, "mean_token_accuracy": 0.05627542734146118, "num_tokens": 414467.0, "step": 190 }, { "entropy": 8.56268243789673, "epoch": 0.020867890202793088, "grad_norm": 0.921875, "learning_rate": 9.7e-05, "loss": 8.2838, "mean_token_accuracy": 0.06462269835174084, "num_tokens": 425752.0, "step": 195 }, { "entropy": 8.562543296813965, "epoch": 0.02140296431055701, "grad_norm": 0.94921875, "learning_rate": 9.95e-05, "loss": 8.2618, "mean_token_accuracy": 0.06471644267439843, "num_tokens": 435908.0, "step": 200 }, { "entropy": 8.58950891494751, "epoch": 0.021938038418320937, "grad_norm": 1.0390625, "learning_rate": 0.000102, "loss": 8.3051, "mean_token_accuracy": 0.05973440445959568, "num_tokens": 446424.0, "step": 205 }, { "entropy": 8.575794887542724, "epoch": 0.022473112526084863, "grad_norm": 1.03125, "learning_rate": 0.00010449999999999999, "loss": 8.2691, "mean_token_accuracy": 0.0648487914353609, "num_tokens": 456854.0, "step": 210 }, { "entropy": 8.506811428070069, "epoch": 0.02300818663384879, "grad_norm": 1.078125, "learning_rate": 0.000107, "loss": 8.2861, "mean_token_accuracy": 0.06673729792237282, "num_tokens": 467899.0, "step": 215 }, { "entropy": 8.497941493988037, "epoch": 0.023543260741612712, "grad_norm": 1.0078125, "learning_rate": 0.0001095, "loss": 8.2297, "mean_token_accuracy": 0.06340378113090991, "num_tokens": 478683.0, "step": 220 }, { "entropy": 8.574148082733155, "epoch": 0.02407833484937664, "grad_norm": 1.046875, "learning_rate": 0.000112, "loss": 8.2648, "mean_token_accuracy": 0.06170066706836223, "num_tokens": 488745.0, "step": 225 }, { "entropy": 8.4907470703125, "epoch": 0.024613408957140565, "grad_norm": 1.0703125, "learning_rate": 0.0001145, "loss": 8.3431, "mean_token_accuracy": 0.059930100291967395, "num_tokens": 499448.0, "step": 230 }, { "entropy": 8.599916458129883, "epoch": 0.02514848306490449, "grad_norm": 0.95703125, "learning_rate": 0.00011700000000000001, "loss": 8.27, "mean_token_accuracy": 0.0650645636022091, "num_tokens": 510148.0, "step": 235 }, { "entropy": 8.483675956726074, "epoch": 0.025683557172668414, "grad_norm": 1.0078125, "learning_rate": 0.00011949999999999999, "loss": 8.1965, "mean_token_accuracy": 0.06112907975912094, "num_tokens": 522093.0, "step": 240 }, { "entropy": 8.460341262817384, "epoch": 0.02621863128043234, "grad_norm": 1.015625, "learning_rate": 0.000122, "loss": 8.2277, "mean_token_accuracy": 0.06530554480850696, "num_tokens": 532598.0, "step": 245 }, { "entropy": 8.49462070465088, "epoch": 0.026753705388196266, "grad_norm": 1.171875, "learning_rate": 0.0001245, "loss": 8.1956, "mean_token_accuracy": 0.06578520573675632, "num_tokens": 542652.0, "step": 250 }, { "entropy": 8.460633659362793, "epoch": 0.027288779495960192, "grad_norm": 1.015625, "learning_rate": 0.000127, "loss": 8.2328, "mean_token_accuracy": 0.06693280301988125, "num_tokens": 552526.0, "step": 255 }, { "entropy": 8.399180793762207, "epoch": 0.027823853603724115, "grad_norm": 0.98046875, "learning_rate": 0.0001295, "loss": 8.2517, "mean_token_accuracy": 0.06344069167971611, "num_tokens": 563143.0, "step": 260 }, { "entropy": 8.48379201889038, "epoch": 0.02835892771148804, "grad_norm": 0.94921875, "learning_rate": 0.000132, "loss": 8.2149, "mean_token_accuracy": 0.06581672765314579, "num_tokens": 573814.0, "step": 265 }, { "entropy": 8.457896327972412, "epoch": 0.028894001819251967, "grad_norm": 0.890625, "learning_rate": 0.00013450000000000002, "loss": 8.1733, "mean_token_accuracy": 0.07218663729727268, "num_tokens": 585367.0, "step": 270 }, { "entropy": 8.507985496520996, "epoch": 0.02942907592701589, "grad_norm": 3.078125, "learning_rate": 0.00013700000000000002, "loss": 8.2318, "mean_token_accuracy": 0.06521918512880802, "num_tokens": 595902.0, "step": 275 }, { "entropy": 8.41034107208252, "epoch": 0.029964150034779816, "grad_norm": 1.4375, "learning_rate": 0.0001395, "loss": 8.138, "mean_token_accuracy": 0.0642226304858923, "num_tokens": 607178.0, "step": 280 }, { "entropy": 8.431483745574951, "epoch": 0.030499224142543743, "grad_norm": 0.94140625, "learning_rate": 0.00014199999999999998, "loss": 8.1309, "mean_token_accuracy": 0.06817701198160649, "num_tokens": 618604.0, "step": 285 }, { "entropy": 8.404507827758788, "epoch": 0.03103429825030767, "grad_norm": 0.9921875, "learning_rate": 0.0001445, "loss": 8.2, "mean_token_accuracy": 0.0719299040734768, "num_tokens": 628111.0, "step": 290 }, { "entropy": 8.490602397918702, "epoch": 0.03156937235807159, "grad_norm": 1.453125, "learning_rate": 0.000147, "loss": 8.2289, "mean_token_accuracy": 0.06933129876852036, "num_tokens": 639358.0, "step": 295 }, { "entropy": 8.35900354385376, "epoch": 0.03210444646583552, "grad_norm": 1.0078125, "learning_rate": 0.0001495, "loss": 8.0903, "mean_token_accuracy": 0.07086234539747238, "num_tokens": 649504.0, "step": 300 }, { "entropy": 8.400328350067138, "epoch": 0.032639520573599444, "grad_norm": 1.1171875, "learning_rate": 0.000152, "loss": 8.1111, "mean_token_accuracy": 0.0681851863861084, "num_tokens": 659924.0, "step": 305 }, { "entropy": 8.422282886505126, "epoch": 0.03317459468136337, "grad_norm": 1.328125, "learning_rate": 0.00015450000000000001, "loss": 8.15, "mean_token_accuracy": 0.06455899253487588, "num_tokens": 671120.0, "step": 310 }, { "entropy": 8.319589424133301, "epoch": 0.033709668789127296, "grad_norm": 1.0390625, "learning_rate": 0.000157, "loss": 8.1985, "mean_token_accuracy": 0.06430512070655822, "num_tokens": 681956.0, "step": 315 }, { "entropy": 8.48956241607666, "epoch": 0.03424474289689122, "grad_norm": 0.953125, "learning_rate": 0.0001595, "loss": 8.182, "mean_token_accuracy": 0.06503869034349918, "num_tokens": 693226.0, "step": 320 }, { "entropy": 8.33993911743164, "epoch": 0.03477981700465514, "grad_norm": 0.94140625, "learning_rate": 0.000162, "loss": 8.1812, "mean_token_accuracy": 0.07134119421243668, "num_tokens": 704691.0, "step": 325 }, { "entropy": 8.362220954895019, "epoch": 0.03531489111241907, "grad_norm": 0.94921875, "learning_rate": 0.00016450000000000001, "loss": 8.1304, "mean_token_accuracy": 0.062357674539089206, "num_tokens": 716000.0, "step": 330 }, { "entropy": 8.332426834106446, "epoch": 0.035849965220182994, "grad_norm": 0.9296875, "learning_rate": 0.00016700000000000002, "loss": 8.0529, "mean_token_accuracy": 0.06962560564279556, "num_tokens": 726723.0, "step": 335 }, { "entropy": 8.32654685974121, "epoch": 0.03638503932794692, "grad_norm": 1.0390625, "learning_rate": 0.00016950000000000003, "loss": 8.0646, "mean_token_accuracy": 0.07072275690734386, "num_tokens": 736740.0, "step": 340 }, { "entropy": 8.333600425720215, "epoch": 0.03692011343571085, "grad_norm": 1.859375, "learning_rate": 0.00017199999999999998, "loss": 8.1131, "mean_token_accuracy": 0.068069913610816, "num_tokens": 747567.0, "step": 345 }, { "entropy": 8.398985290527344, "epoch": 0.03745518754347477, "grad_norm": 1.03125, "learning_rate": 0.00017449999999999999, "loss": 8.0626, "mean_token_accuracy": 0.06914932392537594, "num_tokens": 757937.0, "step": 350 }, { "entropy": 8.163579368591309, "epoch": 0.0379902616512387, "grad_norm": 1.0234375, "learning_rate": 0.000177, "loss": 8.0955, "mean_token_accuracy": 0.07165054567158222, "num_tokens": 768003.0, "step": 355 }, { "entropy": 8.49596710205078, "epoch": 0.03852533575900262, "grad_norm": 0.9453125, "learning_rate": 0.0001795, "loss": 8.1288, "mean_token_accuracy": 0.06314317509531975, "num_tokens": 779098.0, "step": 360 }, { "entropy": 8.285042762756348, "epoch": 0.039060409866766545, "grad_norm": 1.1796875, "learning_rate": 0.000182, "loss": 8.099, "mean_token_accuracy": 0.06513171158730983, "num_tokens": 790002.0, "step": 365 }, { "entropy": 8.28923921585083, "epoch": 0.03959548397453047, "grad_norm": 1.0234375, "learning_rate": 0.0001845, "loss": 8.0887, "mean_token_accuracy": 0.06843880005180836, "num_tokens": 800444.0, "step": 370 }, { "entropy": 8.375462627410888, "epoch": 0.0401305580822944, "grad_norm": 1.0390625, "learning_rate": 0.000187, "loss": 8.0323, "mean_token_accuracy": 0.0713271751999855, "num_tokens": 810912.0, "step": 375 }, { "entropy": 8.272585010528564, "epoch": 0.04066563219005832, "grad_norm": 0.9375, "learning_rate": 0.0001895, "loss": 8.1198, "mean_token_accuracy": 0.0620170421898365, "num_tokens": 822809.0, "step": 380 }, { "entropy": 8.293894195556641, "epoch": 0.04120070629782225, "grad_norm": 1.0078125, "learning_rate": 0.000192, "loss": 8.0433, "mean_token_accuracy": 0.07052243873476982, "num_tokens": 833362.0, "step": 385 }, { "entropy": 8.276584053039551, "epoch": 0.041735780405586176, "grad_norm": 1.109375, "learning_rate": 0.0001945, "loss": 8.0465, "mean_token_accuracy": 0.07357921116054059, "num_tokens": 844239.0, "step": 390 }, { "entropy": 8.217984676361084, "epoch": 0.0422708545133501, "grad_norm": 1.0546875, "learning_rate": 0.00019700000000000002, "loss": 8.0493, "mean_token_accuracy": 0.06498224660754204, "num_tokens": 855178.0, "step": 395 }, { "entropy": 8.19730110168457, "epoch": 0.04280592862111402, "grad_norm": 1.15625, "learning_rate": 0.00019950000000000002, "loss": 8.0369, "mean_token_accuracy": 0.07206248976290226, "num_tokens": 866120.0, "step": 400 }, { "entropy": 8.337959480285644, "epoch": 0.04334100272887795, "grad_norm": 0.9453125, "learning_rate": 0.000202, "loss": 8.0361, "mean_token_accuracy": 0.07243039160966873, "num_tokens": 876569.0, "step": 405 }, { "entropy": 8.284227752685547, "epoch": 0.043876076836641874, "grad_norm": 0.9921875, "learning_rate": 0.00020449999999999998, "loss": 8.0951, "mean_token_accuracy": 0.06462065242230892, "num_tokens": 887580.0, "step": 410 }, { "entropy": 8.235477828979493, "epoch": 0.0444111509444058, "grad_norm": 1.046875, "learning_rate": 0.000207, "loss": 8.0165, "mean_token_accuracy": 0.0666106827557087, "num_tokens": 897922.0, "step": 415 }, { "entropy": 8.222909069061279, "epoch": 0.044946225052169726, "grad_norm": 1.0234375, "learning_rate": 0.0002095, "loss": 7.9827, "mean_token_accuracy": 0.07159848175942898, "num_tokens": 908522.0, "step": 420 }, { "entropy": 8.27180290222168, "epoch": 0.04548129915993365, "grad_norm": 1.078125, "learning_rate": 0.000212, "loss": 7.9946, "mean_token_accuracy": 0.06654324233531952, "num_tokens": 918253.0, "step": 425 }, { "entropy": 8.194285202026368, "epoch": 0.04601637326769758, "grad_norm": 0.91015625, "learning_rate": 0.0002145, "loss": 8.0034, "mean_token_accuracy": 0.07207662984728813, "num_tokens": 929150.0, "step": 430 }, { "entropy": 8.239371013641357, "epoch": 0.0465514473754615, "grad_norm": 0.94140625, "learning_rate": 0.00021700000000000002, "loss": 8.0511, "mean_token_accuracy": 0.07106035277247429, "num_tokens": 941041.0, "step": 435 }, { "entropy": 8.180944156646728, "epoch": 0.047086521483225424, "grad_norm": 1.59375, "learning_rate": 0.0002195, "loss": 7.9757, "mean_token_accuracy": 0.07760139927268028, "num_tokens": 952714.0, "step": 440 }, { "entropy": 8.150847339630127, "epoch": 0.04762159559098935, "grad_norm": 1.109375, "learning_rate": 0.000222, "loss": 8.0514, "mean_token_accuracy": 0.06907343231141568, "num_tokens": 964330.0, "step": 445 }, { "entropy": 8.246770858764648, "epoch": 0.04815666969875328, "grad_norm": 1.1796875, "learning_rate": 0.0002245, "loss": 7.9805, "mean_token_accuracy": 0.06862297914922237, "num_tokens": 975257.0, "step": 450 }, { "entropy": 8.260761165618897, "epoch": 0.0486917438065172, "grad_norm": 1.09375, "learning_rate": 0.00022700000000000002, "loss": 7.9876, "mean_token_accuracy": 0.07001541927456856, "num_tokens": 986335.0, "step": 455 }, { "entropy": 8.069970512390137, "epoch": 0.04922681791428113, "grad_norm": 0.859375, "learning_rate": 0.00022950000000000002, "loss": 7.8883, "mean_token_accuracy": 0.07471956759691238, "num_tokens": 997521.0, "step": 460 }, { "entropy": 8.172566795349121, "epoch": 0.049761892022045055, "grad_norm": 0.921875, "learning_rate": 0.00023200000000000003, "loss": 7.941, "mean_token_accuracy": 0.0669164728373289, "num_tokens": 1008383.0, "step": 465 }, { "entropy": 8.124609184265136, "epoch": 0.05029696612980898, "grad_norm": 1.09375, "learning_rate": 0.00023449999999999998, "loss": 7.998, "mean_token_accuracy": 0.06806416064500809, "num_tokens": 1020552.0, "step": 470 }, { "entropy": 8.196929836273194, "epoch": 0.0508320402375729, "grad_norm": 0.90625, "learning_rate": 0.000237, "loss": 7.9718, "mean_token_accuracy": 0.07053619101643563, "num_tokens": 1031127.0, "step": 475 }, { "entropy": 8.022743558883667, "epoch": 0.05136711434533683, "grad_norm": 0.890625, "learning_rate": 0.0002395, "loss": 7.8837, "mean_token_accuracy": 0.07386223524808884, "num_tokens": 1043209.0, "step": 480 }, { "entropy": 8.2311222076416, "epoch": 0.05190218845310075, "grad_norm": 0.96875, "learning_rate": 0.000242, "loss": 8.0182, "mean_token_accuracy": 0.06782832555472851, "num_tokens": 1054032.0, "step": 485 }, { "entropy": 8.030213356018066, "epoch": 0.05243726256086468, "grad_norm": 1.03125, "learning_rate": 0.0002445, "loss": 7.8628, "mean_token_accuracy": 0.07288614809513091, "num_tokens": 1064565.0, "step": 490 }, { "entropy": 8.178169107437133, "epoch": 0.052972336668628606, "grad_norm": 0.94140625, "learning_rate": 0.000247, "loss": 7.9975, "mean_token_accuracy": 0.0721826508641243, "num_tokens": 1076352.0, "step": 495 }, { "entropy": 8.112149047851563, "epoch": 0.05350741077639253, "grad_norm": 1.1484375, "learning_rate": 0.0002495, "loss": 7.9381, "mean_token_accuracy": 0.07542271986603737, "num_tokens": 1087697.0, "step": 500 }, { "entropy": 8.137825202941894, "epoch": 0.05404248488415646, "grad_norm": 0.99609375, "learning_rate": 0.000252, "loss": 7.876, "mean_token_accuracy": 0.07182962782680988, "num_tokens": 1098056.0, "step": 505 }, { "entropy": 8.017078876495361, "epoch": 0.054577558991920384, "grad_norm": 1.0, "learning_rate": 0.0002545, "loss": 7.8477, "mean_token_accuracy": 0.07691125422716141, "num_tokens": 1109219.0, "step": 510 }, { "entropy": 8.091530561447144, "epoch": 0.055112633099684304, "grad_norm": 0.94140625, "learning_rate": 0.000257, "loss": 7.9312, "mean_token_accuracy": 0.0700716007500887, "num_tokens": 1120248.0, "step": 515 }, { "entropy": 8.096777963638306, "epoch": 0.05564770720744823, "grad_norm": 1.1171875, "learning_rate": 0.0002595, "loss": 7.9366, "mean_token_accuracy": 0.07186660170555115, "num_tokens": 1131278.0, "step": 520 }, { "entropy": 8.089863491058349, "epoch": 0.056182781315212156, "grad_norm": 1.1875, "learning_rate": 0.000262, "loss": 7.9537, "mean_token_accuracy": 0.06224438659846783, "num_tokens": 1143147.0, "step": 525 }, { "entropy": 8.162030553817749, "epoch": 0.05671785542297608, "grad_norm": 0.89453125, "learning_rate": 0.00026450000000000003, "loss": 7.84, "mean_token_accuracy": 0.0739860113710165, "num_tokens": 1154316.0, "step": 530 }, { "entropy": 7.977855777740478, "epoch": 0.05725292953074001, "grad_norm": 1.0234375, "learning_rate": 0.00026700000000000004, "loss": 7.8967, "mean_token_accuracy": 0.06953345276415349, "num_tokens": 1164696.0, "step": 535 }, { "entropy": 8.048009157180786, "epoch": 0.057788003638503935, "grad_norm": 1.0, "learning_rate": 0.00026950000000000005, "loss": 7.8769, "mean_token_accuracy": 0.07776758968830108, "num_tokens": 1176129.0, "step": 540 }, { "entropy": 8.093161487579346, "epoch": 0.05832307774626786, "grad_norm": 1.0625, "learning_rate": 0.00027200000000000005, "loss": 7.8881, "mean_token_accuracy": 0.07334664314985276, "num_tokens": 1186499.0, "step": 545 }, { "entropy": 8.04116907119751, "epoch": 0.05885815185403178, "grad_norm": 0.98046875, "learning_rate": 0.0002745, "loss": 7.8557, "mean_token_accuracy": 0.07062512040138244, "num_tokens": 1196841.0, "step": 550 }, { "entropy": 8.01404366493225, "epoch": 0.059393225961795706, "grad_norm": 0.91796875, "learning_rate": 0.000277, "loss": 7.8108, "mean_token_accuracy": 0.07467551231384277, "num_tokens": 1207647.0, "step": 555 }, { "entropy": 7.952892255783081, "epoch": 0.05992830006955963, "grad_norm": 1.1015625, "learning_rate": 0.0002795, "loss": 7.801, "mean_token_accuracy": 0.07650438733398915, "num_tokens": 1217072.0, "step": 560 }, { "entropy": 8.061871433258057, "epoch": 0.06046337417732356, "grad_norm": 1.0859375, "learning_rate": 0.00028199999999999997, "loss": 7.9129, "mean_token_accuracy": 0.0698221705853939, "num_tokens": 1228564.0, "step": 565 }, { "entropy": 7.987078428268433, "epoch": 0.060998448285087485, "grad_norm": 0.99609375, "learning_rate": 0.0002845, "loss": 7.8458, "mean_token_accuracy": 0.07497354932129383, "num_tokens": 1238755.0, "step": 570 }, { "entropy": 7.964116954803467, "epoch": 0.06153352239285141, "grad_norm": 1.1484375, "learning_rate": 0.000287, "loss": 7.8004, "mean_token_accuracy": 0.0752273216843605, "num_tokens": 1248968.0, "step": 575 }, { "entropy": 7.962353372573853, "epoch": 0.06206859650061534, "grad_norm": 1.0, "learning_rate": 0.0002895, "loss": 7.7714, "mean_token_accuracy": 0.07172017395496369, "num_tokens": 1259256.0, "step": 580 }, { "entropy": 7.952462911605835, "epoch": 0.06260367060837926, "grad_norm": 1.0859375, "learning_rate": 0.000292, "loss": 7.8067, "mean_token_accuracy": 0.07487296611070633, "num_tokens": 1270469.0, "step": 585 }, { "entropy": 7.963806390762329, "epoch": 0.06313874471614318, "grad_norm": 1.0078125, "learning_rate": 0.0002945, "loss": 7.7694, "mean_token_accuracy": 0.07279012463986874, "num_tokens": 1280558.0, "step": 590 }, { "entropy": 7.986854600906372, "epoch": 0.06367381882390712, "grad_norm": 1.046875, "learning_rate": 0.000297, "loss": 7.8307, "mean_token_accuracy": 0.0718784749507904, "num_tokens": 1291372.0, "step": 595 }, { "entropy": 8.02498688697815, "epoch": 0.06420889293167104, "grad_norm": 0.9921875, "learning_rate": 0.0002995, "loss": 7.9061, "mean_token_accuracy": 0.0674042422324419, "num_tokens": 1302521.0, "step": 600 }, { "entropy": 7.8433699131011965, "epoch": 0.06474396703943497, "grad_norm": 1.109375, "learning_rate": 0.000302, "loss": 7.7274, "mean_token_accuracy": 0.07444682195782662, "num_tokens": 1313632.0, "step": 605 }, { "entropy": 8.005569124221802, "epoch": 0.06527904114719889, "grad_norm": 0.96484375, "learning_rate": 0.0003045, "loss": 7.8118, "mean_token_accuracy": 0.07571293860673904, "num_tokens": 1325247.0, "step": 610 }, { "entropy": 7.937390947341919, "epoch": 0.06581411525496281, "grad_norm": 0.9453125, "learning_rate": 0.000307, "loss": 7.8015, "mean_token_accuracy": 0.075490290671587, "num_tokens": 1336026.0, "step": 615 }, { "entropy": 7.93022665977478, "epoch": 0.06634918936272674, "grad_norm": 0.93359375, "learning_rate": 0.0003095, "loss": 7.7122, "mean_token_accuracy": 0.0769732192158699, "num_tokens": 1346920.0, "step": 620 }, { "entropy": 7.828203010559082, "epoch": 0.06688426347049066, "grad_norm": 1.21875, "learning_rate": 0.000312, "loss": 7.8585, "mean_token_accuracy": 0.0724661260843277, "num_tokens": 1359752.0, "step": 625 }, { "entropy": 8.050937986373901, "epoch": 0.06741933757825459, "grad_norm": 0.95703125, "learning_rate": 0.0003145, "loss": 7.8615, "mean_token_accuracy": 0.07357175201177597, "num_tokens": 1370874.0, "step": 630 }, { "entropy": 7.897751331329346, "epoch": 0.06795441168601851, "grad_norm": 0.9140625, "learning_rate": 0.000317, "loss": 7.7624, "mean_token_accuracy": 0.07756051793694496, "num_tokens": 1382316.0, "step": 635 }, { "entropy": 7.840310096740723, "epoch": 0.06848948579378245, "grad_norm": 1.0, "learning_rate": 0.0003195, "loss": 7.7878, "mean_token_accuracy": 0.07577594220638276, "num_tokens": 1394656.0, "step": 640 }, { "entropy": 7.928963756561279, "epoch": 0.06902455990154636, "grad_norm": 1.0, "learning_rate": 0.000322, "loss": 7.7522, "mean_token_accuracy": 0.07719769552350045, "num_tokens": 1405061.0, "step": 645 }, { "entropy": 7.838529491424561, "epoch": 0.06955963400931028, "grad_norm": 0.9140625, "learning_rate": 0.00032450000000000003, "loss": 7.7183, "mean_token_accuracy": 0.08189134374260902, "num_tokens": 1415573.0, "step": 650 }, { "entropy": 7.810403823852539, "epoch": 0.07009470811707422, "grad_norm": 1.015625, "learning_rate": 0.00032700000000000003, "loss": 7.7436, "mean_token_accuracy": 0.07435674965381622, "num_tokens": 1426103.0, "step": 655 }, { "entropy": 7.886046600341797, "epoch": 0.07062978222483814, "grad_norm": 1.6796875, "learning_rate": 0.00032950000000000004, "loss": 7.7599, "mean_token_accuracy": 0.07234186008572578, "num_tokens": 1437256.0, "step": 660 }, { "entropy": 7.909786796569824, "epoch": 0.07116485633260207, "grad_norm": 1.0859375, "learning_rate": 0.00033200000000000005, "loss": 7.7241, "mean_token_accuracy": 0.0786049198359251, "num_tokens": 1446975.0, "step": 665 }, { "entropy": 7.831602573394775, "epoch": 0.07169993044036599, "grad_norm": 0.99609375, "learning_rate": 0.00033450000000000005, "loss": 7.7425, "mean_token_accuracy": 0.07444198578596115, "num_tokens": 1457751.0, "step": 670 }, { "entropy": 7.829366731643677, "epoch": 0.07223500454812992, "grad_norm": 1.046875, "learning_rate": 0.000337, "loss": 7.7049, "mean_token_accuracy": 0.0754860796034336, "num_tokens": 1468186.0, "step": 675 }, { "entropy": 7.825147390365601, "epoch": 0.07277007865589384, "grad_norm": 0.83203125, "learning_rate": 0.0003395, "loss": 7.7508, "mean_token_accuracy": 0.07570655383169651, "num_tokens": 1479780.0, "step": 680 }, { "entropy": 7.8603636741638185, "epoch": 0.07330515276365776, "grad_norm": 0.94921875, "learning_rate": 0.000342, "loss": 7.6712, "mean_token_accuracy": 0.0832133986055851, "num_tokens": 1490565.0, "step": 685 }, { "entropy": 7.892835903167724, "epoch": 0.0738402268714217, "grad_norm": 0.96875, "learning_rate": 0.00034449999999999997, "loss": 7.7227, "mean_token_accuracy": 0.07809135504066944, "num_tokens": 1501552.0, "step": 690 }, { "entropy": 7.798111057281494, "epoch": 0.07437530097918561, "grad_norm": 0.9375, "learning_rate": 0.000347, "loss": 7.7035, "mean_token_accuracy": 0.07376831583678722, "num_tokens": 1513311.0, "step": 695 }, { "entropy": 7.795570516586304, "epoch": 0.07491037508694955, "grad_norm": 0.98046875, "learning_rate": 0.0003495, "loss": 7.7428, "mean_token_accuracy": 0.08057990670204163, "num_tokens": 1524142.0, "step": 700 }, { "entropy": 7.8165356636047365, "epoch": 0.07544544919471347, "grad_norm": 1.03125, "learning_rate": 0.000352, "loss": 7.7188, "mean_token_accuracy": 0.07599906846880913, "num_tokens": 1535571.0, "step": 705 }, { "entropy": 7.865922546386718, "epoch": 0.0759805233024774, "grad_norm": 0.89453125, "learning_rate": 0.0003545, "loss": 7.7225, "mean_token_accuracy": 0.07798022851347923, "num_tokens": 1546528.0, "step": 710 }, { "entropy": 7.727042579650879, "epoch": 0.07651559741024132, "grad_norm": 0.8828125, "learning_rate": 0.000357, "loss": 7.7386, "mean_token_accuracy": 0.07202219888567925, "num_tokens": 1557264.0, "step": 715 }, { "entropy": 7.867890882492065, "epoch": 0.07705067151800524, "grad_norm": 1.0625, "learning_rate": 0.0003595, "loss": 7.6785, "mean_token_accuracy": 0.08276100754737854, "num_tokens": 1566773.0, "step": 720 }, { "entropy": 7.699678039550781, "epoch": 0.07758574562576917, "grad_norm": 0.96875, "learning_rate": 0.000362, "loss": 7.6459, "mean_token_accuracy": 0.08662735894322396, "num_tokens": 1578173.0, "step": 725 }, { "entropy": 7.779191970825195, "epoch": 0.07812081973353309, "grad_norm": 0.98046875, "learning_rate": 0.0003645, "loss": 7.6221, "mean_token_accuracy": 0.08249625936150551, "num_tokens": 1588537.0, "step": 730 }, { "entropy": 7.7231770038604735, "epoch": 0.07865589384129702, "grad_norm": 0.98046875, "learning_rate": 0.000367, "loss": 7.6355, "mean_token_accuracy": 0.08746174871921539, "num_tokens": 1599159.0, "step": 735 }, { "entropy": 7.7618378639221195, "epoch": 0.07919096794906094, "grad_norm": 0.9921875, "learning_rate": 0.0003695, "loss": 7.6989, "mean_token_accuracy": 0.07925031632184983, "num_tokens": 1610378.0, "step": 740 }, { "entropy": 7.720492362976074, "epoch": 0.07972604205682488, "grad_norm": 1.1328125, "learning_rate": 0.000372, "loss": 7.705, "mean_token_accuracy": 0.07612368240952491, "num_tokens": 1621215.0, "step": 745 }, { "entropy": 7.786748743057251, "epoch": 0.0802611161645888, "grad_norm": 1.0625, "learning_rate": 0.0003745, "loss": 7.6622, "mean_token_accuracy": 0.0790612380951643, "num_tokens": 1631170.0, "step": 750 }, { "entropy": 7.78691840171814, "epoch": 0.08079619027235273, "grad_norm": 0.98828125, "learning_rate": 0.000377, "loss": 7.6574, "mean_token_accuracy": 0.07428538724780083, "num_tokens": 1641897.0, "step": 755 }, { "entropy": 7.766008996963501, "epoch": 0.08133126438011665, "grad_norm": 0.95703125, "learning_rate": 0.0003795, "loss": 7.7353, "mean_token_accuracy": 0.07569916620850563, "num_tokens": 1653592.0, "step": 760 }, { "entropy": 7.616559743881226, "epoch": 0.08186633848788057, "grad_norm": 0.9375, "learning_rate": 0.000382, "loss": 7.6528, "mean_token_accuracy": 0.07474047541618348, "num_tokens": 1665760.0, "step": 765 }, { "entropy": 7.830330228805542, "epoch": 0.0824014125956445, "grad_norm": 0.9609375, "learning_rate": 0.0003845, "loss": 7.6454, "mean_token_accuracy": 0.08570240736007691, "num_tokens": 1676211.0, "step": 770 }, { "entropy": 7.737586927413941, "epoch": 0.08293648670340842, "grad_norm": 1.0, "learning_rate": 0.00038700000000000003, "loss": 7.6666, "mean_token_accuracy": 0.0797475405037403, "num_tokens": 1686405.0, "step": 775 }, { "entropy": 7.75378794670105, "epoch": 0.08347156081117235, "grad_norm": 1.0546875, "learning_rate": 0.00038950000000000003, "loss": 7.6699, "mean_token_accuracy": 0.07950277514755726, "num_tokens": 1697340.0, "step": 780 }, { "entropy": 7.726286888122559, "epoch": 0.08400663491893627, "grad_norm": 1.046875, "learning_rate": 0.00039200000000000004, "loss": 7.5787, "mean_token_accuracy": 0.0861763522028923, "num_tokens": 1707250.0, "step": 785 }, { "entropy": 7.63549427986145, "epoch": 0.0845417090267002, "grad_norm": 1.0078125, "learning_rate": 0.00039450000000000005, "loss": 7.5653, "mean_token_accuracy": 0.0784637302160263, "num_tokens": 1718333.0, "step": 790 }, { "entropy": 7.709765481948852, "epoch": 0.08507678313446412, "grad_norm": 1.0625, "learning_rate": 0.00039700000000000005, "loss": 7.6627, "mean_token_accuracy": 0.07198781482875347, "num_tokens": 1730520.0, "step": 795 }, { "entropy": 7.7255151748657225, "epoch": 0.08561185724222804, "grad_norm": 1.0625, "learning_rate": 0.0003995, "loss": 7.7149, "mean_token_accuracy": 0.07679420076310635, "num_tokens": 1741898.0, "step": 800 }, { "entropy": 7.718593311309815, "epoch": 0.08614693134999198, "grad_norm": 1.09375, "learning_rate": 0.000402, "loss": 7.6508, "mean_token_accuracy": 0.08017718270421029, "num_tokens": 1751671.0, "step": 805 }, { "entropy": 7.577520227432251, "epoch": 0.0866820054577559, "grad_norm": 0.91015625, "learning_rate": 0.0004045, "loss": 7.6669, "mean_token_accuracy": 0.08265335634350776, "num_tokens": 1762076.0, "step": 810 }, { "entropy": 7.796188259124756, "epoch": 0.08721707956551983, "grad_norm": 0.98046875, "learning_rate": 0.00040699999999999997, "loss": 7.642, "mean_token_accuracy": 0.07752098590135574, "num_tokens": 1772666.0, "step": 815 }, { "entropy": 7.724516534805298, "epoch": 0.08775215367328375, "grad_norm": 0.94921875, "learning_rate": 0.0004095, "loss": 7.6572, "mean_token_accuracy": 0.08227546997368336, "num_tokens": 1783621.0, "step": 820 }, { "entropy": 7.700971364974976, "epoch": 0.08828722778104768, "grad_norm": 1.5234375, "learning_rate": 0.000412, "loss": 7.7147, "mean_token_accuracy": 0.07807004414498805, "num_tokens": 1794654.0, "step": 825 }, { "entropy": 7.651264762878418, "epoch": 0.0888223018888116, "grad_norm": 0.88671875, "learning_rate": 0.0004145, "loss": 7.6008, "mean_token_accuracy": 0.0848226711153984, "num_tokens": 1805853.0, "step": 830 }, { "entropy": 7.536796283721924, "epoch": 0.08935737599657552, "grad_norm": 0.9375, "learning_rate": 0.000417, "loss": 7.5896, "mean_token_accuracy": 0.0828265130519867, "num_tokens": 1817006.0, "step": 835 }, { "entropy": 7.733750724792481, "epoch": 0.08989245010433945, "grad_norm": 1.0, "learning_rate": 0.0004195, "loss": 7.583, "mean_token_accuracy": 0.07734453342854977, "num_tokens": 1827166.0, "step": 840 }, { "entropy": 7.7373639106750485, "epoch": 0.09042752421210337, "grad_norm": 1.140625, "learning_rate": 0.000422, "loss": 7.6809, "mean_token_accuracy": 0.07751412987709046, "num_tokens": 1837182.0, "step": 845 }, { "entropy": 7.567351484298706, "epoch": 0.0909625983198673, "grad_norm": 0.94140625, "learning_rate": 0.0004245, "loss": 7.6388, "mean_token_accuracy": 0.07895995602011681, "num_tokens": 1849034.0, "step": 850 }, { "entropy": 7.595164203643799, "epoch": 0.09149767242763122, "grad_norm": 0.98828125, "learning_rate": 0.000427, "loss": 7.5075, "mean_token_accuracy": 0.08833360373973846, "num_tokens": 1859033.0, "step": 855 }, { "entropy": 7.610419750213623, "epoch": 0.09203274653539516, "grad_norm": 0.9765625, "learning_rate": 0.0004295, "loss": 7.6121, "mean_token_accuracy": 0.08088177517056465, "num_tokens": 1870274.0, "step": 860 }, { "entropy": 7.5731220722198485, "epoch": 0.09256782064315908, "grad_norm": 1.265625, "learning_rate": 0.000432, "loss": 7.5611, "mean_token_accuracy": 0.08315053284168243, "num_tokens": 1881306.0, "step": 865 }, { "entropy": 7.561473751068116, "epoch": 0.093102894750923, "grad_norm": 1.0078125, "learning_rate": 0.0004345, "loss": 7.5356, "mean_token_accuracy": 0.08015808910131454, "num_tokens": 1892464.0, "step": 870 }, { "entropy": 7.661314296722412, "epoch": 0.09363796885868693, "grad_norm": 0.9609375, "learning_rate": 0.000437, "loss": 7.6219, "mean_token_accuracy": 0.07585933655500413, "num_tokens": 1903743.0, "step": 875 }, { "entropy": 7.607653522491455, "epoch": 0.09417304296645085, "grad_norm": 1.0, "learning_rate": 0.0004395, "loss": 7.5902, "mean_token_accuracy": 0.08468717783689499, "num_tokens": 1915253.0, "step": 880 }, { "entropy": 7.622669744491577, "epoch": 0.09470811707421478, "grad_norm": 1.2421875, "learning_rate": 0.000442, "loss": 7.5473, "mean_token_accuracy": 0.08187699615955353, "num_tokens": 1926113.0, "step": 885 }, { "entropy": 7.57468581199646, "epoch": 0.0952431911819787, "grad_norm": 0.98046875, "learning_rate": 0.0004445, "loss": 7.6456, "mean_token_accuracy": 0.08173620626330376, "num_tokens": 1937718.0, "step": 890 }, { "entropy": 7.625470066070557, "epoch": 0.09577826528974263, "grad_norm": 1.0234375, "learning_rate": 0.000447, "loss": 7.6334, "mean_token_accuracy": 0.0791581004858017, "num_tokens": 1948307.0, "step": 895 }, { "entropy": 7.575066232681275, "epoch": 0.09631333939750655, "grad_norm": 0.96484375, "learning_rate": 0.00044950000000000003, "loss": 7.4358, "mean_token_accuracy": 0.09009880647063255, "num_tokens": 1957861.0, "step": 900 }, { "entropy": 7.480437755584717, "epoch": 0.09684841350527049, "grad_norm": 0.92578125, "learning_rate": 0.00045200000000000004, "loss": 7.4911, "mean_token_accuracy": 0.08970233350992203, "num_tokens": 1967984.0, "step": 905 }, { "entropy": 7.55365891456604, "epoch": 0.0973834876130344, "grad_norm": 1.0, "learning_rate": 0.00045450000000000004, "loss": 7.4885, "mean_token_accuracy": 0.08413884043693542, "num_tokens": 1978608.0, "step": 910 }, { "entropy": 7.550483322143554, "epoch": 0.09791856172079832, "grad_norm": 0.98828125, "learning_rate": 0.00045700000000000005, "loss": 7.547, "mean_token_accuracy": 0.08248279690742492, "num_tokens": 1989355.0, "step": 915 }, { "entropy": 7.514042758941651, "epoch": 0.09845363582856226, "grad_norm": 0.96484375, "learning_rate": 0.00045950000000000006, "loss": 7.5303, "mean_token_accuracy": 0.08344742506742478, "num_tokens": 1999754.0, "step": 920 }, { "entropy": 7.540969705581665, "epoch": 0.09898870993632618, "grad_norm": 0.99609375, "learning_rate": 0.000462, "loss": 7.5232, "mean_token_accuracy": 0.0832397285848856, "num_tokens": 2010877.0, "step": 925 }, { "entropy": 7.635095930099487, "epoch": 0.09952378404409011, "grad_norm": 0.9140625, "learning_rate": 0.0004645, "loss": 7.6286, "mean_token_accuracy": 0.08003128916025162, "num_tokens": 2022301.0, "step": 930 }, { "entropy": 7.549521160125733, "epoch": 0.10005885815185403, "grad_norm": 0.99609375, "learning_rate": 0.000467, "loss": 7.5119, "mean_token_accuracy": 0.08251530304551125, "num_tokens": 2033537.0, "step": 935 }, { "entropy": 7.477602958679199, "epoch": 0.10059393225961796, "grad_norm": 1.0390625, "learning_rate": 0.0004695, "loss": 7.4502, "mean_token_accuracy": 0.0781034879386425, "num_tokens": 2044360.0, "step": 940 }, { "entropy": 7.583854675292969, "epoch": 0.10112900636738188, "grad_norm": 0.9296875, "learning_rate": 0.000472, "loss": 7.5601, "mean_token_accuracy": 0.08421726487576961, "num_tokens": 2055000.0, "step": 945 }, { "entropy": 7.492854499816895, "epoch": 0.1016640804751458, "grad_norm": 0.9609375, "learning_rate": 0.0004745, "loss": 7.5467, "mean_token_accuracy": 0.08681007251143455, "num_tokens": 2064807.0, "step": 950 }, { "entropy": 7.5536168098449705, "epoch": 0.10219915458290973, "grad_norm": 0.96484375, "learning_rate": 0.000477, "loss": 7.5102, "mean_token_accuracy": 0.08256960362195968, "num_tokens": 2075618.0, "step": 955 }, { "entropy": 7.505359792709351, "epoch": 0.10273422869067365, "grad_norm": 0.953125, "learning_rate": 0.0004795, "loss": 7.5116, "mean_token_accuracy": 0.08244576305150986, "num_tokens": 2086226.0, "step": 960 }, { "entropy": 7.541278457641601, "epoch": 0.10326930279843759, "grad_norm": 0.89453125, "learning_rate": 0.000482, "loss": 7.5116, "mean_token_accuracy": 0.08005514740943909, "num_tokens": 2097222.0, "step": 965 }, { "entropy": 7.481921100616455, "epoch": 0.1038043769062015, "grad_norm": 0.90625, "learning_rate": 0.0004845, "loss": 7.541, "mean_token_accuracy": 0.08661947920918464, "num_tokens": 2108919.0, "step": 970 }, { "entropy": 7.46715989112854, "epoch": 0.10433945101396544, "grad_norm": 0.96875, "learning_rate": 0.000487, "loss": 7.4939, "mean_token_accuracy": 0.08317564725875855, "num_tokens": 2120215.0, "step": 975 }, { "entropy": 7.5228071212768555, "epoch": 0.10487452512172936, "grad_norm": 1.015625, "learning_rate": 0.0004895, "loss": 7.5188, "mean_token_accuracy": 0.0818349651992321, "num_tokens": 2131503.0, "step": 980 }, { "entropy": 7.487857866287231, "epoch": 0.10540959922949328, "grad_norm": 0.96484375, "learning_rate": 0.000492, "loss": 7.4588, "mean_token_accuracy": 0.08936587274074555, "num_tokens": 2141551.0, "step": 985 }, { "entropy": 7.4559633255004885, "epoch": 0.10594467333725721, "grad_norm": 0.92578125, "learning_rate": 0.0004945, "loss": 7.4615, "mean_token_accuracy": 0.08929954171180725, "num_tokens": 2151821.0, "step": 990 }, { "entropy": 7.451591444015503, "epoch": 0.10647974744502113, "grad_norm": 1.03125, "learning_rate": 0.000497, "loss": 7.5065, "mean_token_accuracy": 0.08539062738418579, "num_tokens": 2162474.0, "step": 995 }, { "entropy": 7.53413724899292, "epoch": 0.10701482155278506, "grad_norm": 0.96875, "learning_rate": 0.0004995, "loss": 7.5602, "mean_token_accuracy": 0.08457510098814965, "num_tokens": 2173985.0, "step": 1000 }, { "entropy": 7.5422203063964846, "epoch": 0.10754989566054898, "grad_norm": 0.90625, "learning_rate": 0.0004999999979210101, "loss": 7.5944, "mean_token_accuracy": 0.07782966643571854, "num_tokens": 2186432.0, "step": 1005 }, { "entropy": 7.4759071350097654, "epoch": 0.10808496976831292, "grad_norm": 0.96484375, "learning_rate": 0.0004999999894751138, "loss": 7.4463, "mean_token_accuracy": 0.0834141232073307, "num_tokens": 2197085.0, "step": 1010 }, { "entropy": 7.424153137207031, "epoch": 0.10862004387607684, "grad_norm": 0.98828125, "learning_rate": 0.0004999999745323744, "loss": 7.4486, "mean_token_accuracy": 0.08975227214396, "num_tokens": 2207162.0, "step": 1015 }, { "entropy": 7.464861583709717, "epoch": 0.10915511798384077, "grad_norm": 0.9609375, "learning_rate": 0.0004999999530927923, "loss": 7.5469, "mean_token_accuracy": 0.07938519641757011, "num_tokens": 2218714.0, "step": 1020 }, { "entropy": 7.515410757064819, "epoch": 0.10969019209160469, "grad_norm": 0.96875, "learning_rate": 0.0004999999251563682, "loss": 7.4879, "mean_token_accuracy": 0.08599804565310479, "num_tokens": 2229711.0, "step": 1025 }, { "entropy": 7.45625114440918, "epoch": 0.11022526619936861, "grad_norm": 0.9140625, "learning_rate": 0.0004999998907231029, "loss": 7.4912, "mean_token_accuracy": 0.08116911202669144, "num_tokens": 2239885.0, "step": 1030 }, { "entropy": 7.481421899795532, "epoch": 0.11076034030713254, "grad_norm": 1.0, "learning_rate": 0.0004999998497929974, "loss": 7.4923, "mean_token_accuracy": 0.08827452957630158, "num_tokens": 2250221.0, "step": 1035 }, { "entropy": 7.4760716438293455, "epoch": 0.11129541441489646, "grad_norm": 0.91796875, "learning_rate": 0.0004999998023660527, "loss": 7.5526, "mean_token_accuracy": 0.07815601006150245, "num_tokens": 2261059.0, "step": 1040 }, { "entropy": 7.454020214080811, "epoch": 0.11183048852266039, "grad_norm": 0.8984375, "learning_rate": 0.0004999997484422705, "loss": 7.4273, "mean_token_accuracy": 0.08656688034534454, "num_tokens": 2271174.0, "step": 1045 }, { "entropy": 7.404057025909424, "epoch": 0.11236556263042431, "grad_norm": 1.0625, "learning_rate": 0.0004999996880216521, "loss": 7.5037, "mean_token_accuracy": 0.08764296993613244, "num_tokens": 2282431.0, "step": 1050 }, { "entropy": 7.506435585021973, "epoch": 0.11290063673818825, "grad_norm": 1.109375, "learning_rate": 0.0004999996211041994, "loss": 7.4922, "mean_token_accuracy": 0.08441931083798408, "num_tokens": 2292891.0, "step": 1055 }, { "entropy": 7.472446441650391, "epoch": 0.11343571084595216, "grad_norm": 0.97265625, "learning_rate": 0.0004999995476899141, "loss": 7.5049, "mean_token_accuracy": 0.08200813457369804, "num_tokens": 2303764.0, "step": 1060 }, { "entropy": 7.319696569442749, "epoch": 0.11397078495371608, "grad_norm": 1.0234375, "learning_rate": 0.0004999994677787987, "loss": 7.4002, "mean_token_accuracy": 0.09418007209897042, "num_tokens": 2314172.0, "step": 1065 }, { "entropy": 7.449784660339356, "epoch": 0.11450585906148002, "grad_norm": 1.046875, "learning_rate": 0.0004999993813708551, "loss": 7.3939, "mean_token_accuracy": 0.08950763419270516, "num_tokens": 2324848.0, "step": 1070 }, { "entropy": 7.320974636077881, "epoch": 0.11504093316924394, "grad_norm": 0.89453125, "learning_rate": 0.000499999288466086, "loss": 7.4332, "mean_token_accuracy": 0.08251803517341613, "num_tokens": 2336601.0, "step": 1075 }, { "entropy": 7.46982364654541, "epoch": 0.11557600727700787, "grad_norm": 0.95703125, "learning_rate": 0.0004999991890644941, "loss": 7.4167, "mean_token_accuracy": 0.0846226740628481, "num_tokens": 2347281.0, "step": 1080 }, { "entropy": 7.453939628601074, "epoch": 0.11611108138477179, "grad_norm": 1.0, "learning_rate": 0.0004999990831660822, "loss": 7.4224, "mean_token_accuracy": 0.0908889777958393, "num_tokens": 2358199.0, "step": 1085 }, { "entropy": 7.446761226654052, "epoch": 0.11664615549253572, "grad_norm": 1.0234375, "learning_rate": 0.0004999989707708534, "loss": 7.4877, "mean_token_accuracy": 0.08379835970699787, "num_tokens": 2369092.0, "step": 1090 }, { "entropy": 7.3978382587432865, "epoch": 0.11718122960029964, "grad_norm": 0.984375, "learning_rate": 0.0004999988518788111, "loss": 7.458, "mean_token_accuracy": 0.08341244608163834, "num_tokens": 2378849.0, "step": 1095 }, { "entropy": 7.428147649765014, "epoch": 0.11771630370806356, "grad_norm": 0.90234375, "learning_rate": 0.0004999987264899583, "loss": 7.4385, "mean_token_accuracy": 0.09159169495105743, "num_tokens": 2389587.0, "step": 1100 }, { "entropy": 7.492716360092163, "epoch": 0.1182513778158275, "grad_norm": 0.97265625, "learning_rate": 0.000499998594604299, "loss": 7.434, "mean_token_accuracy": 0.08649549037218093, "num_tokens": 2400442.0, "step": 1105 }, { "entropy": 7.284411334991455, "epoch": 0.11878645192359141, "grad_norm": 0.890625, "learning_rate": 0.000499998456221837, "loss": 7.4154, "mean_token_accuracy": 0.08677608072757721, "num_tokens": 2410771.0, "step": 1110 }, { "entropy": 7.476975584030152, "epoch": 0.11932152603135535, "grad_norm": 1.0, "learning_rate": 0.0004999983113425762, "loss": 7.4299, "mean_token_accuracy": 0.09064068272709846, "num_tokens": 2421112.0, "step": 1115 }, { "entropy": 7.400354480743408, "epoch": 0.11985660013911927, "grad_norm": 0.91796875, "learning_rate": 0.0004999981599665207, "loss": 7.4163, "mean_token_accuracy": 0.08564619868993759, "num_tokens": 2431891.0, "step": 1120 }, { "entropy": 7.315796279907227, "epoch": 0.1203916742468832, "grad_norm": 1.0078125, "learning_rate": 0.0004999980020936748, "loss": 7.3479, "mean_token_accuracy": 0.08722568973898888, "num_tokens": 2442987.0, "step": 1125 }, { "entropy": 7.354978418350219, "epoch": 0.12092674835464712, "grad_norm": 1.09375, "learning_rate": 0.0004999978377240434, "loss": 7.4002, "mean_token_accuracy": 0.08564592450857163, "num_tokens": 2452703.0, "step": 1130 }, { "entropy": 7.375062036514282, "epoch": 0.12146182246241104, "grad_norm": 0.984375, "learning_rate": 0.000499997666857631, "loss": 7.4598, "mean_token_accuracy": 0.08786297589540482, "num_tokens": 2462975.0, "step": 1135 }, { "entropy": 7.394401025772095, "epoch": 0.12199689657017497, "grad_norm": 0.8359375, "learning_rate": 0.0004999974894944426, "loss": 7.4003, "mean_token_accuracy": 0.08598766103386879, "num_tokens": 2473853.0, "step": 1140 }, { "entropy": 7.384897661209107, "epoch": 0.12253197067793889, "grad_norm": 0.90625, "learning_rate": 0.0004999973056344832, "loss": 7.3822, "mean_token_accuracy": 0.08470982015132904, "num_tokens": 2485633.0, "step": 1145 }, { "entropy": 7.337519359588623, "epoch": 0.12306704478570282, "grad_norm": 0.91796875, "learning_rate": 0.0004999971152777583, "loss": 7.3414, "mean_token_accuracy": 0.08668373227119446, "num_tokens": 2496922.0, "step": 1150 }, { "entropy": 7.443722057342529, "epoch": 0.12360211889346674, "grad_norm": 0.87109375, "learning_rate": 0.0004999969184242733, "loss": 7.4147, "mean_token_accuracy": 0.0896741084754467, "num_tokens": 2507890.0, "step": 1155 }, { "entropy": 7.319026279449463, "epoch": 0.12413719300123068, "grad_norm": 1.0390625, "learning_rate": 0.000499996715074034, "loss": 7.4076, "mean_token_accuracy": 0.09130077436566353, "num_tokens": 2519749.0, "step": 1160 }, { "entropy": 7.3418297290802, "epoch": 0.1246722671089946, "grad_norm": 0.97265625, "learning_rate": 0.0004999965052270461, "loss": 7.4121, "mean_token_accuracy": 0.09187431186437607, "num_tokens": 2530666.0, "step": 1165 }, { "entropy": 7.364394998550415, "epoch": 0.12520734121675853, "grad_norm": 0.89453125, "learning_rate": 0.0004999962888833157, "loss": 7.4155, "mean_token_accuracy": 0.08915347754955291, "num_tokens": 2541594.0, "step": 1170 }, { "entropy": 7.363469171524048, "epoch": 0.12574241532452243, "grad_norm": 0.9453125, "learning_rate": 0.0004999960660428491, "loss": 7.3946, "mean_token_accuracy": 0.0930194191634655, "num_tokens": 2552330.0, "step": 1175 }, { "entropy": 7.449467992782592, "epoch": 0.12627748943228637, "grad_norm": 0.87109375, "learning_rate": 0.0004999958367056526, "loss": 7.4494, "mean_token_accuracy": 0.08116971924901009, "num_tokens": 2564601.0, "step": 1180 }, { "entropy": 7.422946262359619, "epoch": 0.1268125635400503, "grad_norm": 0.9921875, "learning_rate": 0.000499995600871733, "loss": 7.4242, "mean_token_accuracy": 0.08717223256826401, "num_tokens": 2575539.0, "step": 1185 }, { "entropy": 7.284857511520386, "epoch": 0.12734763764781423, "grad_norm": 0.89453125, "learning_rate": 0.0004999953585410971, "loss": 7.3588, "mean_token_accuracy": 0.08616523109376431, "num_tokens": 2586635.0, "step": 1190 }, { "entropy": 7.405594778060913, "epoch": 0.12788271175557814, "grad_norm": 1.1171875, "learning_rate": 0.0004999951097137518, "loss": 7.388, "mean_token_accuracy": 0.08991223797202111, "num_tokens": 2596814.0, "step": 1195 }, { "entropy": 7.325789880752564, "epoch": 0.12841778586334207, "grad_norm": 0.86328125, "learning_rate": 0.0004999948543897044, "loss": 7.4089, "mean_token_accuracy": 0.08616380542516708, "num_tokens": 2608087.0, "step": 1200 }, { "entropy": 7.498183393478394, "epoch": 0.128952859971106, "grad_norm": 0.9609375, "learning_rate": 0.0004999945925689621, "loss": 7.41, "mean_token_accuracy": 0.08784973174333573, "num_tokens": 2619377.0, "step": 1205 }, { "entropy": 7.285972166061401, "epoch": 0.12948793407886994, "grad_norm": 1.0234375, "learning_rate": 0.0004999943242515325, "loss": 7.314, "mean_token_accuracy": 0.08880106881260871, "num_tokens": 2629089.0, "step": 1210 }, { "entropy": 7.320152521133423, "epoch": 0.13002300818663384, "grad_norm": 0.8828125, "learning_rate": 0.0004999940494374236, "loss": 7.3835, "mean_token_accuracy": 0.08867338374257087, "num_tokens": 2639743.0, "step": 1215 }, { "entropy": 7.45218596458435, "epoch": 0.13055808229439778, "grad_norm": 1.015625, "learning_rate": 0.000499993768126643, "loss": 7.4254, "mean_token_accuracy": 0.082533248513937, "num_tokens": 2650631.0, "step": 1220 }, { "entropy": 7.268480491638184, "epoch": 0.1310931564021617, "grad_norm": 0.96484375, "learning_rate": 0.000499993480319199, "loss": 7.3811, "mean_token_accuracy": 0.0892926201224327, "num_tokens": 2660197.0, "step": 1225 }, { "entropy": 7.394870710372925, "epoch": 0.13162823050992561, "grad_norm": 0.98828125, "learning_rate": 0.0004999931860150999, "loss": 7.3556, "mean_token_accuracy": 0.08826216235756874, "num_tokens": 2670162.0, "step": 1230 }, { "entropy": 7.390807247161865, "epoch": 0.13216330461768955, "grad_norm": 0.90234375, "learning_rate": 0.0004999928852143541, "loss": 7.3554, "mean_token_accuracy": 0.08857011944055557, "num_tokens": 2681233.0, "step": 1235 }, { "entropy": 7.200170421600342, "epoch": 0.13269837872545348, "grad_norm": 0.87109375, "learning_rate": 0.0004999925779169703, "loss": 7.3187, "mean_token_accuracy": 0.09283828288316727, "num_tokens": 2692145.0, "step": 1240 }, { "entropy": 7.413662004470825, "epoch": 0.13323345283321741, "grad_norm": 0.91015625, "learning_rate": 0.0004999922641229575, "loss": 7.3447, "mean_token_accuracy": 0.09158495515584945, "num_tokens": 2703192.0, "step": 1245 }, { "entropy": 7.324686527252197, "epoch": 0.13376852694098132, "grad_norm": 0.87890625, "learning_rate": 0.0004999919438323248, "loss": 7.3597, "mean_token_accuracy": 0.08890319019556045, "num_tokens": 2714804.0, "step": 1250 }, { "entropy": 7.333380794525146, "epoch": 0.13430360104874525, "grad_norm": 1.046875, "learning_rate": 0.0004999916170450812, "loss": 7.3259, "mean_token_accuracy": 0.09193522408604622, "num_tokens": 2724340.0, "step": 1255 }, { "entropy": 7.259483861923218, "epoch": 0.13483867515650919, "grad_norm": 0.91796875, "learning_rate": 0.0004999912837612364, "loss": 7.3341, "mean_token_accuracy": 0.09227988123893738, "num_tokens": 2735767.0, "step": 1260 }, { "entropy": 7.455391693115234, "epoch": 0.1353737492642731, "grad_norm": 0.91796875, "learning_rate": 0.0004999909439807997, "loss": 7.3851, "mean_token_accuracy": 0.08482631966471672, "num_tokens": 2747658.0, "step": 1265 }, { "entropy": 7.264850521087647, "epoch": 0.13590882337203702, "grad_norm": 1.015625, "learning_rate": 0.0004999905977037813, "loss": 7.2465, "mean_token_accuracy": 0.09336961582303047, "num_tokens": 2757901.0, "step": 1270 }, { "entropy": 7.284139823913574, "epoch": 0.13644389747980096, "grad_norm": 1.015625, "learning_rate": 0.0004999902449301909, "loss": 7.2989, "mean_token_accuracy": 0.0874991238117218, "num_tokens": 2768945.0, "step": 1275 }, { "entropy": 7.24199595451355, "epoch": 0.1369789715875649, "grad_norm": 0.80859375, "learning_rate": 0.0004999898856600387, "loss": 7.271, "mean_token_accuracy": 0.103138717263937, "num_tokens": 2780276.0, "step": 1280 }, { "entropy": 7.350469398498535, "epoch": 0.1375140456953288, "grad_norm": 0.9140625, "learning_rate": 0.0004999895198933354, "loss": 7.3416, "mean_token_accuracy": 0.09537098631262779, "num_tokens": 2791183.0, "step": 1285 }, { "entropy": 7.342680644989014, "epoch": 0.13804911980309273, "grad_norm": 0.94140625, "learning_rate": 0.0004999891476300911, "loss": 7.2607, "mean_token_accuracy": 0.08925738111138344, "num_tokens": 2801928.0, "step": 1290 }, { "entropy": 7.263091659545898, "epoch": 0.13858419391085666, "grad_norm": 0.890625, "learning_rate": 0.000499988768870317, "loss": 7.3525, "mean_token_accuracy": 0.08583549410104752, "num_tokens": 2813415.0, "step": 1295 }, { "entropy": 7.329908657073974, "epoch": 0.13911926801862057, "grad_norm": 0.98046875, "learning_rate": 0.0004999883836140236, "loss": 7.3533, "mean_token_accuracy": 0.08882890194654465, "num_tokens": 2825288.0, "step": 1300 }, { "entropy": 7.312420797348023, "epoch": 0.1396543421263845, "grad_norm": 0.96484375, "learning_rate": 0.0004999879918612224, "loss": 7.3068, "mean_token_accuracy": 0.09304987639188766, "num_tokens": 2836298.0, "step": 1305 }, { "entropy": 7.313601350784301, "epoch": 0.14018941623414843, "grad_norm": 1.03125, "learning_rate": 0.0004999875936119245, "loss": 7.2898, "mean_token_accuracy": 0.0945392332971096, "num_tokens": 2846367.0, "step": 1310 }, { "entropy": 7.240101766586304, "epoch": 0.14072449034191237, "grad_norm": 0.9921875, "learning_rate": 0.0004999871888661415, "loss": 7.3047, "mean_token_accuracy": 0.08923600688576698, "num_tokens": 2856832.0, "step": 1315 }, { "entropy": 7.309039974212647, "epoch": 0.14125956444967627, "grad_norm": 0.9140625, "learning_rate": 0.000499986777623885, "loss": 7.3245, "mean_token_accuracy": 0.08692366257309914, "num_tokens": 2867954.0, "step": 1320 }, { "entropy": 7.439533376693726, "epoch": 0.1417946385574402, "grad_norm": 0.9921875, "learning_rate": 0.0004999863598851669, "loss": 7.3611, "mean_token_accuracy": 0.09297569468617439, "num_tokens": 2878714.0, "step": 1325 }, { "entropy": 7.053972816467285, "epoch": 0.14232971266520414, "grad_norm": 1.3359375, "learning_rate": 0.0004999859356499992, "loss": 7.298, "mean_token_accuracy": 0.10052636489272118, "num_tokens": 2890697.0, "step": 1330 }, { "entropy": 7.382122421264649, "epoch": 0.14286478677296804, "grad_norm": 1.0078125, "learning_rate": 0.0004999855049183943, "loss": 7.3219, "mean_token_accuracy": 0.08626203685998916, "num_tokens": 2901468.0, "step": 1335 }, { "entropy": 7.25765290260315, "epoch": 0.14339986088073198, "grad_norm": 0.94140625, "learning_rate": 0.0004999850676903646, "loss": 7.2671, "mean_token_accuracy": 0.09408968985080719, "num_tokens": 2913466.0, "step": 1340 }, { "entropy": 7.231286239624024, "epoch": 0.1439349349884959, "grad_norm": 0.8984375, "learning_rate": 0.0004999846239659226, "loss": 7.2505, "mean_token_accuracy": 0.09706522151827812, "num_tokens": 2923638.0, "step": 1345 }, { "entropy": 7.269954109191895, "epoch": 0.14447000909625984, "grad_norm": 1.015625, "learning_rate": 0.0004999841737450812, "loss": 7.3357, "mean_token_accuracy": 0.09442631006240845, "num_tokens": 2934790.0, "step": 1350 }, { "entropy": 7.268723440170288, "epoch": 0.14500508320402375, "grad_norm": 1.0234375, "learning_rate": 0.0004999837170278535, "loss": 7.2757, "mean_token_accuracy": 0.08723422512412071, "num_tokens": 2946320.0, "step": 1355 }, { "entropy": 7.3566694259643555, "epoch": 0.14554015731178768, "grad_norm": 1.0546875, "learning_rate": 0.0004999832538142526, "loss": 7.2369, "mean_token_accuracy": 0.09091865047812461, "num_tokens": 2957077.0, "step": 1360 }, { "entropy": 7.177463865280151, "epoch": 0.14607523141955162, "grad_norm": 0.953125, "learning_rate": 0.0004999827841042917, "loss": 7.2678, "mean_token_accuracy": 0.08816000148653984, "num_tokens": 2967286.0, "step": 1365 }, { "entropy": 7.2939177513122555, "epoch": 0.14661030552731552, "grad_norm": 1.34375, "learning_rate": 0.0004999823078979846, "loss": 7.3057, "mean_token_accuracy": 0.09016561508178711, "num_tokens": 2979516.0, "step": 1370 }, { "entropy": 7.379639339447022, "epoch": 0.14714537963507945, "grad_norm": 0.96484375, "learning_rate": 0.0004999818251953449, "loss": 7.419, "mean_token_accuracy": 0.08294185698032379, "num_tokens": 2991594.0, "step": 1375 }, { "entropy": 7.246149206161499, "epoch": 0.1476804537428434, "grad_norm": 1.0234375, "learning_rate": 0.0004999813359963867, "loss": 7.2972, "mean_token_accuracy": 0.08775367885828018, "num_tokens": 3002487.0, "step": 1380 }, { "entropy": 7.372300243377685, "epoch": 0.14821552785060732, "grad_norm": 0.98828125, "learning_rate": 0.0004999808403011241, "loss": 7.3157, "mean_token_accuracy": 0.09396110102534294, "num_tokens": 3013197.0, "step": 1385 }, { "entropy": 7.142706060409546, "epoch": 0.14875060195837123, "grad_norm": 0.8984375, "learning_rate": 0.0004999803381095712, "loss": 7.3451, "mean_token_accuracy": 0.09063652530312538, "num_tokens": 3024512.0, "step": 1390 }, { "entropy": 7.415092658996582, "epoch": 0.14928567606613516, "grad_norm": 0.9296875, "learning_rate": 0.0004999798294217428, "loss": 7.3046, "mean_token_accuracy": 0.08789012357592582, "num_tokens": 3035621.0, "step": 1395 }, { "entropy": 7.229216432571411, "epoch": 0.1498207501738991, "grad_norm": 0.97265625, "learning_rate": 0.0004999793142376533, "loss": 7.2876, "mean_token_accuracy": 0.09253833740949631, "num_tokens": 3046492.0, "step": 1400 }, { "entropy": 7.263148021697998, "epoch": 0.150355824281663, "grad_norm": 0.90625, "learning_rate": 0.0004999787925573177, "loss": 7.3086, "mean_token_accuracy": 0.09204896241426468, "num_tokens": 3057715.0, "step": 1405 }, { "entropy": 7.3932922840118405, "epoch": 0.15089089838942693, "grad_norm": 0.9140625, "learning_rate": 0.0004999782643807513, "loss": 7.2654, "mean_token_accuracy": 0.09031828343868256, "num_tokens": 3068344.0, "step": 1410 }, { "entropy": 7.193799686431885, "epoch": 0.15142597249719086, "grad_norm": 0.8671875, "learning_rate": 0.0004999777297079689, "loss": 7.2547, "mean_token_accuracy": 0.09031877219676972, "num_tokens": 3079576.0, "step": 1415 }, { "entropy": 7.342895412445069, "epoch": 0.1519610466049548, "grad_norm": 0.98046875, "learning_rate": 0.0004999771885389863, "loss": 7.2153, "mean_token_accuracy": 0.09486196860671044, "num_tokens": 3090201.0, "step": 1420 }, { "entropy": 7.1453712463378904, "epoch": 0.1524961207127187, "grad_norm": 1.03125, "learning_rate": 0.0004999766408738189, "loss": 7.1936, "mean_token_accuracy": 0.10047192424535752, "num_tokens": 3099824.0, "step": 1425 }, { "entropy": 7.24136872291565, "epoch": 0.15303119482048264, "grad_norm": 0.90625, "learning_rate": 0.0004999760867124827, "loss": 7.2738, "mean_token_accuracy": 0.09082015976309776, "num_tokens": 3109948.0, "step": 1430 }, { "entropy": 7.299263906478882, "epoch": 0.15356626892824657, "grad_norm": 0.8984375, "learning_rate": 0.0004999755260549937, "loss": 7.2626, "mean_token_accuracy": 0.0974075585603714, "num_tokens": 3121492.0, "step": 1435 }, { "entropy": 7.21744818687439, "epoch": 0.15410134303601047, "grad_norm": 1.671875, "learning_rate": 0.0004999749589013677, "loss": 7.0545, "mean_token_accuracy": 0.10996845588088036, "num_tokens": 3131990.0, "step": 1440 }, { "entropy": 7.1235129833221436, "epoch": 0.1546364171437744, "grad_norm": 0.8828125, "learning_rate": 0.0004999743852516217, "loss": 7.2409, "mean_token_accuracy": 0.0921150028705597, "num_tokens": 3142567.0, "step": 1445 }, { "entropy": 7.32010293006897, "epoch": 0.15517149125153834, "grad_norm": 1.328125, "learning_rate": 0.0004999738051057717, "loss": 7.2522, "mean_token_accuracy": 0.09435679912567138, "num_tokens": 3153083.0, "step": 1450 }, { "entropy": 7.188344669342041, "epoch": 0.15570656535930227, "grad_norm": 0.984375, "learning_rate": 0.0004999732184638347, "loss": 7.2555, "mean_token_accuracy": 0.09004457890987397, "num_tokens": 3163985.0, "step": 1455 }, { "entropy": 7.262719058990479, "epoch": 0.15624163946706618, "grad_norm": 0.92578125, "learning_rate": 0.0004999726253258278, "loss": 7.2392, "mean_token_accuracy": 0.09183276668190957, "num_tokens": 3175259.0, "step": 1460 }, { "entropy": 7.254732751846314, "epoch": 0.1567767135748301, "grad_norm": 0.99609375, "learning_rate": 0.0004999720256917678, "loss": 7.206, "mean_token_accuracy": 0.0977108657360077, "num_tokens": 3185487.0, "step": 1465 }, { "entropy": 7.127510118484497, "epoch": 0.15731178768259405, "grad_norm": 0.94921875, "learning_rate": 0.0004999714195616723, "loss": 7.1831, "mean_token_accuracy": 0.09826227650046349, "num_tokens": 3196200.0, "step": 1470 }, { "entropy": 7.333015441894531, "epoch": 0.15784686179035795, "grad_norm": 0.96875, "learning_rate": 0.0004999708069355586, "loss": 7.3054, "mean_token_accuracy": 0.0843054249882698, "num_tokens": 3207675.0, "step": 1475 }, { "entropy": 7.17571177482605, "epoch": 0.15838193589812188, "grad_norm": 1.078125, "learning_rate": 0.0004999701878134445, "loss": 7.1815, "mean_token_accuracy": 0.09501941055059433, "num_tokens": 3218117.0, "step": 1480 }, { "entropy": 7.304254627227783, "epoch": 0.15891701000588582, "grad_norm": 0.94140625, "learning_rate": 0.0004999695621953477, "loss": 7.2505, "mean_token_accuracy": 0.10208047479391098, "num_tokens": 3229208.0, "step": 1485 }, { "entropy": 7.173984098434448, "epoch": 0.15945208411364975, "grad_norm": 0.96875, "learning_rate": 0.0004999689300812866, "loss": 7.1584, "mean_token_accuracy": 0.101242895424366, "num_tokens": 3239586.0, "step": 1490 }, { "entropy": 7.24401364326477, "epoch": 0.15998715822141366, "grad_norm": 0.8515625, "learning_rate": 0.0004999682914712791, "loss": 7.2254, "mean_token_accuracy": 0.09680869728326798, "num_tokens": 3250103.0, "step": 1495 }, { "entropy": 7.228427124023438, "epoch": 0.1605222323291776, "grad_norm": 0.91015625, "learning_rate": 0.0004999676463653439, "loss": 7.2027, "mean_token_accuracy": 0.10232653468847275, "num_tokens": 3261844.0, "step": 1500 }, { "entropy": 7.227877807617188, "epoch": 0.16105730643694152, "grad_norm": 1.09375, "learning_rate": 0.0004999669947634996, "loss": 7.1639, "mean_token_accuracy": 0.09760255515575408, "num_tokens": 3272073.0, "step": 1505 }, { "entropy": 7.178577184677124, "epoch": 0.16159238054470546, "grad_norm": 0.9609375, "learning_rate": 0.0004999663366657647, "loss": 7.1667, "mean_token_accuracy": 0.09620498046278954, "num_tokens": 3281725.0, "step": 1510 }, { "entropy": 7.214940547943115, "epoch": 0.16212745465246936, "grad_norm": 0.97265625, "learning_rate": 0.0004999656720721586, "loss": 7.3059, "mean_token_accuracy": 0.094396660476923, "num_tokens": 3292708.0, "step": 1515 }, { "entropy": 7.296448183059693, "epoch": 0.1626625287602333, "grad_norm": 0.98828125, "learning_rate": 0.0004999650009827004, "loss": 7.2773, "mean_token_accuracy": 0.09127842709422111, "num_tokens": 3303548.0, "step": 1520 }, { "entropy": 7.19203143119812, "epoch": 0.16319760286799723, "grad_norm": 0.921875, "learning_rate": 0.0004999643233974092, "loss": 7.1486, "mean_token_accuracy": 0.09975013583898544, "num_tokens": 3314261.0, "step": 1525 }, { "entropy": 7.1947274684906, "epoch": 0.16373267697576113, "grad_norm": 0.98046875, "learning_rate": 0.0004999636393163049, "loss": 7.1714, "mean_token_accuracy": 0.09445247575640678, "num_tokens": 3324833.0, "step": 1530 }, { "entropy": 7.053837537765503, "epoch": 0.16426775108352507, "grad_norm": 1.0703125, "learning_rate": 0.0004999629487394071, "loss": 7.0568, "mean_token_accuracy": 0.10237468853592872, "num_tokens": 3334790.0, "step": 1535 }, { "entropy": 7.266930866241455, "epoch": 0.164802825191289, "grad_norm": 1.1484375, "learning_rate": 0.0004999622516667358, "loss": 7.205, "mean_token_accuracy": 0.09691800698637962, "num_tokens": 3345115.0, "step": 1540 }, { "entropy": 7.133483982086181, "epoch": 0.16533789929905293, "grad_norm": 0.875, "learning_rate": 0.000499961548098311, "loss": 7.089, "mean_token_accuracy": 0.10441275909543038, "num_tokens": 3356187.0, "step": 1545 }, { "entropy": 7.117019701004028, "epoch": 0.16587297340681684, "grad_norm": 0.94921875, "learning_rate": 0.0004999608380341533, "loss": 7.1282, "mean_token_accuracy": 0.09887576475739479, "num_tokens": 3367218.0, "step": 1550 }, { "entropy": 7.160897636413575, "epoch": 0.16640804751458077, "grad_norm": 0.98046875, "learning_rate": 0.0004999601214742829, "loss": 7.27, "mean_token_accuracy": 0.08936030119657516, "num_tokens": 3377557.0, "step": 1555 }, { "entropy": 7.371627759933472, "epoch": 0.1669431216223447, "grad_norm": 0.96484375, "learning_rate": 0.0004999593984187206, "loss": 7.2482, "mean_token_accuracy": 0.09751093834638595, "num_tokens": 3387402.0, "step": 1560 }, { "entropy": 7.0916835308074955, "epoch": 0.1674781957301086, "grad_norm": 0.87890625, "learning_rate": 0.0004999586688674872, "loss": 7.1346, "mean_token_accuracy": 0.09648581743240356, "num_tokens": 3397924.0, "step": 1565 }, { "entropy": 7.216659879684448, "epoch": 0.16801326983787254, "grad_norm": 0.94921875, "learning_rate": 0.000499957932820604, "loss": 7.2118, "mean_token_accuracy": 0.08759412840008736, "num_tokens": 3408622.0, "step": 1570 }, { "entropy": 7.262946891784668, "epoch": 0.16854834394563648, "grad_norm": 0.98046875, "learning_rate": 0.000499957190278092, "loss": 7.1622, "mean_token_accuracy": 0.09248490408062934, "num_tokens": 3419692.0, "step": 1575 }, { "entropy": 7.098281383514404, "epoch": 0.1690834180534004, "grad_norm": 1.015625, "learning_rate": 0.0004999564412399728, "loss": 7.2154, "mean_token_accuracy": 0.09459864124655723, "num_tokens": 3430986.0, "step": 1580 }, { "entropy": 7.176830434799195, "epoch": 0.1696184921611643, "grad_norm": 1.0390625, "learning_rate": 0.000499955685706268, "loss": 7.1354, "mean_token_accuracy": 0.09504674524068832, "num_tokens": 3442211.0, "step": 1585 }, { "entropy": 7.03007402420044, "epoch": 0.17015356626892825, "grad_norm": 1.140625, "learning_rate": 0.0004999549236769993, "loss": 7.1229, "mean_token_accuracy": 0.10297105386853218, "num_tokens": 3453585.0, "step": 1590 }, { "entropy": 7.225273466110229, "epoch": 0.17068864037669218, "grad_norm": 1.0078125, "learning_rate": 0.0004999541551521888, "loss": 7.1695, "mean_token_accuracy": 0.0996770367026329, "num_tokens": 3464156.0, "step": 1595 }, { "entropy": 7.249066162109375, "epoch": 0.17122371448445609, "grad_norm": 1.0703125, "learning_rate": 0.0004999533801318587, "loss": 7.2238, "mean_token_accuracy": 0.08952004536986351, "num_tokens": 3474853.0, "step": 1600 }, { "entropy": 7.262774181365967, "epoch": 0.17175878859222002, "grad_norm": 1.03125, "learning_rate": 0.0004999525986160313, "loss": 7.194, "mean_token_accuracy": 0.10073793306946754, "num_tokens": 3486841.0, "step": 1605 }, { "entropy": 7.140778827667236, "epoch": 0.17229386269998395, "grad_norm": 0.9140625, "learning_rate": 0.0004999518106047293, "loss": 7.2169, "mean_token_accuracy": 0.09210691601037979, "num_tokens": 3498735.0, "step": 1610 }, { "entropy": 7.175544404983521, "epoch": 0.17282893680774788, "grad_norm": 0.87890625, "learning_rate": 0.0004999510160979754, "loss": 7.2352, "mean_token_accuracy": 0.10104434639215469, "num_tokens": 3508829.0, "step": 1615 }, { "entropy": 7.1884317874908445, "epoch": 0.1733640109155118, "grad_norm": 0.94921875, "learning_rate": 0.0004999502150957925, "loss": 7.141, "mean_token_accuracy": 0.09438429847359657, "num_tokens": 3519465.0, "step": 1620 }, { "entropy": 7.188577127456665, "epoch": 0.17389908502327572, "grad_norm": 0.93359375, "learning_rate": 0.0004999494075982037, "loss": 7.1086, "mean_token_accuracy": 0.10255491808056831, "num_tokens": 3530401.0, "step": 1625 }, { "entropy": 7.12376561164856, "epoch": 0.17443415913103966, "grad_norm": 0.98828125, "learning_rate": 0.0004999485936052324, "loss": 7.1856, "mean_token_accuracy": 0.09849482700228691, "num_tokens": 3541136.0, "step": 1630 }, { "entropy": 7.288824605941772, "epoch": 0.17496923323880356, "grad_norm": 0.95703125, "learning_rate": 0.000499947773116902, "loss": 7.1753, "mean_token_accuracy": 0.09568259268999099, "num_tokens": 3552525.0, "step": 1635 }, { "entropy": 7.090163278579712, "epoch": 0.1755043073465675, "grad_norm": 0.9140625, "learning_rate": 0.0004999469461332365, "loss": 7.1414, "mean_token_accuracy": 0.09975111782550812, "num_tokens": 3563028.0, "step": 1640 }, { "entropy": 7.199271249771118, "epoch": 0.17603938145433143, "grad_norm": 0.9453125, "learning_rate": 0.0004999461126542592, "loss": 7.0912, "mean_token_accuracy": 0.10047454982995987, "num_tokens": 3573354.0, "step": 1645 }, { "entropy": 6.979637813568115, "epoch": 0.17657445556209536, "grad_norm": 0.83984375, "learning_rate": 0.0004999452726799947, "loss": 7.0802, "mean_token_accuracy": 0.09618928134441376, "num_tokens": 3585576.0, "step": 1650 }, { "entropy": 7.297661590576172, "epoch": 0.17710952966985927, "grad_norm": 0.98828125, "learning_rate": 0.0004999444262104671, "loss": 7.2058, "mean_token_accuracy": 0.08774002119898797, "num_tokens": 3596478.0, "step": 1655 }, { "entropy": 7.110372161865234, "epoch": 0.1776446037776232, "grad_norm": 1.0390625, "learning_rate": 0.0004999435732457007, "loss": 7.153, "mean_token_accuracy": 0.09257297441363335, "num_tokens": 3608014.0, "step": 1660 }, { "entropy": 7.221296691894532, "epoch": 0.17817967788538713, "grad_norm": 0.9921875, "learning_rate": 0.0004999427137857203, "loss": 7.2102, "mean_token_accuracy": 0.09210594072937965, "num_tokens": 3620120.0, "step": 1665 }, { "entropy": 7.107110977172852, "epoch": 0.17871475199315104, "grad_norm": 0.953125, "learning_rate": 0.0004999418478305506, "loss": 7.1096, "mean_token_accuracy": 0.09546202942728996, "num_tokens": 3632578.0, "step": 1670 }, { "entropy": 7.156751394271851, "epoch": 0.17924982610091497, "grad_norm": 0.984375, "learning_rate": 0.0004999409753802167, "loss": 7.131, "mean_token_accuracy": 0.10362366437911988, "num_tokens": 3643245.0, "step": 1675 }, { "entropy": 7.167398452758789, "epoch": 0.1797849002086789, "grad_norm": 0.91015625, "learning_rate": 0.0004999400964347437, "loss": 7.1251, "mean_token_accuracy": 0.09799086153507233, "num_tokens": 3655832.0, "step": 1680 }, { "entropy": 7.151060581207275, "epoch": 0.18031997431644284, "grad_norm": 0.93359375, "learning_rate": 0.0004999392109941571, "loss": 7.1001, "mean_token_accuracy": 0.09830698594450951, "num_tokens": 3666566.0, "step": 1685 }, { "entropy": 7.172510385513306, "epoch": 0.18085504842420674, "grad_norm": 0.91796875, "learning_rate": 0.0004999383190584822, "loss": 7.1298, "mean_token_accuracy": 0.10040193051099777, "num_tokens": 3677572.0, "step": 1690 }, { "entropy": 7.112444877624512, "epoch": 0.18139012253197068, "grad_norm": 0.99609375, "learning_rate": 0.0004999374206277451, "loss": 7.0549, "mean_token_accuracy": 0.09736391827464104, "num_tokens": 3687116.0, "step": 1695 }, { "entropy": 7.057082557678223, "epoch": 0.1819251966397346, "grad_norm": 0.9140625, "learning_rate": 0.0004999365157019717, "loss": 7.1658, "mean_token_accuracy": 0.09722192957997322, "num_tokens": 3697961.0, "step": 1700 }, { "entropy": 7.233665180206299, "epoch": 0.18246027074749852, "grad_norm": 0.9765625, "learning_rate": 0.0004999356042811878, "loss": 7.0802, "mean_token_accuracy": 0.10210576206445694, "num_tokens": 3708834.0, "step": 1705 }, { "entropy": 7.087706089019775, "epoch": 0.18299534485526245, "grad_norm": 0.93359375, "learning_rate": 0.00049993468636542, "loss": 7.1472, "mean_token_accuracy": 0.09556594043970108, "num_tokens": 3719835.0, "step": 1710 }, { "entropy": 7.116140556335449, "epoch": 0.18353041896302638, "grad_norm": 1.03125, "learning_rate": 0.0004999337619546948, "loss": 7.0339, "mean_token_accuracy": 0.10466360598802567, "num_tokens": 3730408.0, "step": 1715 }, { "entropy": 7.085261631011963, "epoch": 0.18406549307079031, "grad_norm": 0.91015625, "learning_rate": 0.0004999328310490387, "loss": 7.1275, "mean_token_accuracy": 0.09871943295001984, "num_tokens": 3741257.0, "step": 1720 }, { "entropy": 7.190493202209472, "epoch": 0.18460056717855422, "grad_norm": 0.96875, "learning_rate": 0.0004999318936484789, "loss": 7.1175, "mean_token_accuracy": 0.10177163109183311, "num_tokens": 3752615.0, "step": 1725 }, { "entropy": 7.106344223022461, "epoch": 0.18513564128631815, "grad_norm": 0.93359375, "learning_rate": 0.0004999309497530422, "loss": 7.1395, "mean_token_accuracy": 0.09094236344099045, "num_tokens": 3763656.0, "step": 1730 }, { "entropy": 7.083023738861084, "epoch": 0.1856707153940821, "grad_norm": 0.91015625, "learning_rate": 0.0004999299993627558, "loss": 7.1148, "mean_token_accuracy": 0.10153383314609528, "num_tokens": 3775257.0, "step": 1735 }, { "entropy": 7.0514672756195065, "epoch": 0.186205789501846, "grad_norm": 0.94921875, "learning_rate": 0.0004999290424776475, "loss": 7.0758, "mean_token_accuracy": 0.1056319996714592, "num_tokens": 3786094.0, "step": 1740 }, { "entropy": 7.330498886108399, "epoch": 0.18674086360960993, "grad_norm": 1.015625, "learning_rate": 0.0004999280790977445, "loss": 7.1657, "mean_token_accuracy": 0.09170655235648155, "num_tokens": 3796672.0, "step": 1745 }, { "entropy": 7.131537580490113, "epoch": 0.18727593771737386, "grad_norm": 0.984375, "learning_rate": 0.000499927109223075, "loss": 7.1508, "mean_token_accuracy": 0.09670756980776787, "num_tokens": 3807910.0, "step": 1750 }, { "entropy": 7.103532934188843, "epoch": 0.1878110118251378, "grad_norm": 0.95703125, "learning_rate": 0.0004999261328536667, "loss": 7.1028, "mean_token_accuracy": 0.1024494618177414, "num_tokens": 3820792.0, "step": 1755 }, { "entropy": 7.02842001914978, "epoch": 0.1883460859329017, "grad_norm": 0.921875, "learning_rate": 0.0004999251499895479, "loss": 7.0234, "mean_token_accuracy": 0.1013932503759861, "num_tokens": 3831126.0, "step": 1760 }, { "entropy": 7.213843870162964, "epoch": 0.18888116004066563, "grad_norm": 0.9140625, "learning_rate": 0.0004999241606307471, "loss": 7.1353, "mean_token_accuracy": 0.10057510435581207, "num_tokens": 3841923.0, "step": 1765 }, { "entropy": 7.119020175933838, "epoch": 0.18941623414842956, "grad_norm": 1.0234375, "learning_rate": 0.0004999231647772927, "loss": 7.0491, "mean_token_accuracy": 0.10542590543627739, "num_tokens": 3852504.0, "step": 1770 }, { "entropy": 6.992453765869141, "epoch": 0.1899513082561935, "grad_norm": 0.96875, "learning_rate": 0.0004999221624292136, "loss": 7.0559, "mean_token_accuracy": 0.10485710874199868, "num_tokens": 3862761.0, "step": 1775 }, { "entropy": 7.134696340560913, "epoch": 0.1904863823639574, "grad_norm": 0.96875, "learning_rate": 0.0004999211535865385, "loss": 7.0556, "mean_token_accuracy": 0.09678238332271576, "num_tokens": 3873662.0, "step": 1780 }, { "entropy": 7.063473129272461, "epoch": 0.19102145647172133, "grad_norm": 0.95703125, "learning_rate": 0.0004999201382492969, "loss": 7.0088, "mean_token_accuracy": 0.10047155022621154, "num_tokens": 3884835.0, "step": 1785 }, { "entropy": 7.110291051864624, "epoch": 0.19155653057948527, "grad_norm": 1.0078125, "learning_rate": 0.0004999191164175178, "loss": 7.154, "mean_token_accuracy": 0.09878607764840126, "num_tokens": 3895073.0, "step": 1790 }, { "entropy": 7.209331798553467, "epoch": 0.19209160468724917, "grad_norm": 0.98828125, "learning_rate": 0.0004999180880912309, "loss": 7.1115, "mean_token_accuracy": 0.09884128645062447, "num_tokens": 3905440.0, "step": 1795 }, { "entropy": 7.072672271728516, "epoch": 0.1926266787950131, "grad_norm": 1.078125, "learning_rate": 0.0004999170532704657, "loss": 7.1145, "mean_token_accuracy": 0.0968818336725235, "num_tokens": 3917135.0, "step": 1800 }, { "entropy": 7.13597002029419, "epoch": 0.19316175290277704, "grad_norm": 0.84375, "learning_rate": 0.0004999160119552523, "loss": 7.117, "mean_token_accuracy": 0.10278327167034149, "num_tokens": 3928247.0, "step": 1805 }, { "entropy": 7.091355848312378, "epoch": 0.19369682701054097, "grad_norm": 0.9375, "learning_rate": 0.0004999149641456206, "loss": 7.1009, "mean_token_accuracy": 0.09872358813881874, "num_tokens": 3938609.0, "step": 1810 }, { "entropy": 7.21585783958435, "epoch": 0.19423190111830488, "grad_norm": 1.046875, "learning_rate": 0.000499913909841601, "loss": 7.0861, "mean_token_accuracy": 0.10127425193786621, "num_tokens": 3949221.0, "step": 1815 }, { "entropy": 7.009944200515747, "epoch": 0.1947669752260688, "grad_norm": 1.015625, "learning_rate": 0.0004999128490432238, "loss": 7.0484, "mean_token_accuracy": 0.09548230320215226, "num_tokens": 3959475.0, "step": 1820 }, { "entropy": 7.083078098297119, "epoch": 0.19530204933383274, "grad_norm": 1.046875, "learning_rate": 0.0004999117817505196, "loss": 7.0515, "mean_token_accuracy": 0.1084510900080204, "num_tokens": 3969638.0, "step": 1825 }, { "entropy": 7.053667259216309, "epoch": 0.19583712344159665, "grad_norm": 0.94140625, "learning_rate": 0.0004999107079635194, "loss": 7.1079, "mean_token_accuracy": 0.10137292668223381, "num_tokens": 3980543.0, "step": 1830 }, { "entropy": 7.355273485183716, "epoch": 0.19637219754936058, "grad_norm": 0.921875, "learning_rate": 0.000499909627682254, "loss": 7.162, "mean_token_accuracy": 0.08682658635079861, "num_tokens": 3993518.0, "step": 1835 }, { "entropy": 7.068727111816406, "epoch": 0.19690727165712452, "grad_norm": 1.046875, "learning_rate": 0.0004999085409067549, "loss": 7.1487, "mean_token_accuracy": 0.09789205938577653, "num_tokens": 4002940.0, "step": 1840 }, { "entropy": 7.013206481933594, "epoch": 0.19744234576488845, "grad_norm": 0.94921875, "learning_rate": 0.0004999074476370531, "loss": 7.0792, "mean_token_accuracy": 0.09683184549212456, "num_tokens": 4013982.0, "step": 1845 }, { "entropy": 7.100980806350708, "epoch": 0.19797741987265235, "grad_norm": 0.98828125, "learning_rate": 0.0004999063478731805, "loss": 7.0638, "mean_token_accuracy": 0.10558338239789009, "num_tokens": 4025607.0, "step": 1850 }, { "entropy": 7.0951310157775875, "epoch": 0.1985124939804163, "grad_norm": 0.9140625, "learning_rate": 0.0004999052416151687, "loss": 7.1104, "mean_token_accuracy": 0.10141080170869828, "num_tokens": 4037467.0, "step": 1855 }, { "entropy": 7.149590158462525, "epoch": 0.19904756808818022, "grad_norm": 0.890625, "learning_rate": 0.0004999041288630496, "loss": 7.1127, "mean_token_accuracy": 0.10126180425286294, "num_tokens": 4049146.0, "step": 1860 }, { "entropy": 7.181366395950318, "epoch": 0.19958264219594413, "grad_norm": 0.90234375, "learning_rate": 0.0004999030096168553, "loss": 7.1485, "mean_token_accuracy": 0.09781184569001197, "num_tokens": 4060500.0, "step": 1865 }, { "entropy": 7.157667875289917, "epoch": 0.20011771630370806, "grad_norm": 1.0234375, "learning_rate": 0.0004999018838766182, "loss": 7.0987, "mean_token_accuracy": 0.0985781691968441, "num_tokens": 4070553.0, "step": 1870 }, { "entropy": 7.14162769317627, "epoch": 0.200652790411472, "grad_norm": 0.98046875, "learning_rate": 0.000499900751642371, "loss": 7.0343, "mean_token_accuracy": 0.11338024884462357, "num_tokens": 4079653.0, "step": 1875 }, { "entropy": 7.015338134765625, "epoch": 0.20118786451923593, "grad_norm": 0.921875, "learning_rate": 0.0004998996129141461, "loss": 7.123, "mean_token_accuracy": 0.09923376441001892, "num_tokens": 4089912.0, "step": 1880 }, { "entropy": 7.212585592269898, "epoch": 0.20172293862699983, "grad_norm": 0.98828125, "learning_rate": 0.0004998984676919764, "loss": 7.0772, "mean_token_accuracy": 0.09714810699224471, "num_tokens": 4100577.0, "step": 1885 }, { "entropy": 7.073903751373291, "epoch": 0.20225801273476376, "grad_norm": 0.96484375, "learning_rate": 0.0004998973159758952, "loss": 7.1033, "mean_token_accuracy": 0.09901956990361213, "num_tokens": 4111752.0, "step": 1890 }, { "entropy": 7.06131501197815, "epoch": 0.2027930868425277, "grad_norm": 1.015625, "learning_rate": 0.0004998961577659355, "loss": 7.0616, "mean_token_accuracy": 0.10182834565639495, "num_tokens": 4122616.0, "step": 1895 }, { "entropy": 7.192514705657959, "epoch": 0.2033281609502916, "grad_norm": 0.90234375, "learning_rate": 0.0004998949930621309, "loss": 7.1547, "mean_token_accuracy": 0.10196215733885765, "num_tokens": 4134275.0, "step": 1900 }, { "entropy": 7.112344741821289, "epoch": 0.20386323505805554, "grad_norm": 1.046875, "learning_rate": 0.0004998938218645149, "loss": 7.0506, "mean_token_accuracy": 0.10170819535851479, "num_tokens": 4146412.0, "step": 1905 }, { "entropy": 7.029837560653687, "epoch": 0.20439830916581947, "grad_norm": 0.91796875, "learning_rate": 0.0004998926441731215, "loss": 7.0512, "mean_token_accuracy": 0.1002343863248825, "num_tokens": 4157592.0, "step": 1910 }, { "entropy": 7.06212477684021, "epoch": 0.2049333832735834, "grad_norm": 0.95703125, "learning_rate": 0.0004998914599879845, "loss": 7.0269, "mean_token_accuracy": 0.09835589304566383, "num_tokens": 4168637.0, "step": 1915 }, { "entropy": 7.0664630889892575, "epoch": 0.2054684573813473, "grad_norm": 0.96875, "learning_rate": 0.0004998902693091382, "loss": 7.0736, "mean_token_accuracy": 0.09925776198506356, "num_tokens": 4179951.0, "step": 1920 }, { "entropy": 7.0451087474823, "epoch": 0.20600353148911124, "grad_norm": 0.96875, "learning_rate": 0.0004998890721366171, "loss": 6.9616, "mean_token_accuracy": 0.10666931569576263, "num_tokens": 4189895.0, "step": 1925 }, { "entropy": 7.097507953643799, "epoch": 0.20653860559687517, "grad_norm": 1.0234375, "learning_rate": 0.0004998878684704556, "loss": 7.0214, "mean_token_accuracy": 0.10524726510047913, "num_tokens": 4199796.0, "step": 1930 }, { "entropy": 7.036600160598755, "epoch": 0.20707367970463908, "grad_norm": 1.0234375, "learning_rate": 0.0004998866583106884, "loss": 7.0461, "mean_token_accuracy": 0.09883956611156464, "num_tokens": 4210428.0, "step": 1935 }, { "entropy": 7.218980216979981, "epoch": 0.207608753812403, "grad_norm": 1.0078125, "learning_rate": 0.0004998854416573506, "loss": 7.1246, "mean_token_accuracy": 0.10078881680965424, "num_tokens": 4221515.0, "step": 1940 }, { "entropy": 7.1100975513458256, "epoch": 0.20814382792016695, "grad_norm": 1.0390625, "learning_rate": 0.0004998842185104772, "loss": 7.1387, "mean_token_accuracy": 0.09548087790608406, "num_tokens": 4232580.0, "step": 1945 }, { "entropy": 7.041958284378052, "epoch": 0.20867890202793088, "grad_norm": 0.96875, "learning_rate": 0.0004998829888701036, "loss": 7.0484, "mean_token_accuracy": 0.10664152652025223, "num_tokens": 4242871.0, "step": 1950 }, { "entropy": 7.147633504867554, "epoch": 0.20921397613569478, "grad_norm": 0.97265625, "learning_rate": 0.0004998817527362654, "loss": 7.0773, "mean_token_accuracy": 0.09752313494682312, "num_tokens": 4253419.0, "step": 1955 }, { "entropy": 7.032255792617798, "epoch": 0.20974905024345872, "grad_norm": 0.93359375, "learning_rate": 0.0004998805101089982, "loss": 7.0528, "mean_token_accuracy": 0.10345240533351899, "num_tokens": 4264327.0, "step": 1960 }, { "entropy": 7.170184564590454, "epoch": 0.21028412435122265, "grad_norm": 0.91796875, "learning_rate": 0.0004998792609883378, "loss": 7.0428, "mean_token_accuracy": 0.10343464836478233, "num_tokens": 4274568.0, "step": 1965 }, { "entropy": 7.056762933731079, "epoch": 0.21081919845898656, "grad_norm": 1.171875, "learning_rate": 0.0004998780053743203, "loss": 7.0324, "mean_token_accuracy": 0.10682544857263565, "num_tokens": 4284895.0, "step": 1970 }, { "entropy": 7.12225079536438, "epoch": 0.2113542725667505, "grad_norm": 0.953125, "learning_rate": 0.0004998767432669822, "loss": 7.0637, "mean_token_accuracy": 0.0994573712348938, "num_tokens": 4297258.0, "step": 1975 }, { "entropy": 7.026572132110596, "epoch": 0.21188934667451442, "grad_norm": 0.9921875, "learning_rate": 0.0004998754746663595, "loss": 6.9842, "mean_token_accuracy": 0.10585973560810089, "num_tokens": 4308307.0, "step": 1980 }, { "entropy": 7.050811910629273, "epoch": 0.21242442078227836, "grad_norm": 0.9296875, "learning_rate": 0.0004998741995724892, "loss": 7.0491, "mean_token_accuracy": 0.10263351649045944, "num_tokens": 4318801.0, "step": 1985 }, { "entropy": 7.070459413528442, "epoch": 0.21295949489004226, "grad_norm": 0.984375, "learning_rate": 0.0004998729179854079, "loss": 7.0252, "mean_token_accuracy": 0.10016985535621643, "num_tokens": 4329531.0, "step": 1990 }, { "entropy": 7.054882478713989, "epoch": 0.2134945689978062, "grad_norm": 0.91796875, "learning_rate": 0.0004998716299051527, "loss": 7.0253, "mean_token_accuracy": 0.10470812693238259, "num_tokens": 4341203.0, "step": 1995 }, { "entropy": 7.026881456375122, "epoch": 0.21402964310557013, "grad_norm": 0.98046875, "learning_rate": 0.0004998703353317609, "loss": 7.0788, "mean_token_accuracy": 0.0973646655678749, "num_tokens": 4352426.0, "step": 2000 }, { "entropy": 7.11639552116394, "epoch": 0.21456471721333403, "grad_norm": 0.94140625, "learning_rate": 0.0004998690342652697, "loss": 7.0103, "mean_token_accuracy": 0.10563170909881592, "num_tokens": 4363413.0, "step": 2005 }, { "entropy": 7.054438829421997, "epoch": 0.21509979132109797, "grad_norm": 0.890625, "learning_rate": 0.0004998677267057166, "loss": 6.951, "mean_token_accuracy": 0.10644056648015976, "num_tokens": 4373470.0, "step": 2010 }, { "entropy": 6.9533806324005125, "epoch": 0.2156348654288619, "grad_norm": 1.015625, "learning_rate": 0.0004998664126531397, "loss": 7.0164, "mean_token_accuracy": 0.10371329113841057, "num_tokens": 4384438.0, "step": 2015 }, { "entropy": 7.1470112800598145, "epoch": 0.21616993953662583, "grad_norm": 0.953125, "learning_rate": 0.0004998650921075766, "loss": 6.9978, "mean_token_accuracy": 0.10406329333782197, "num_tokens": 4395100.0, "step": 2020 }, { "entropy": 6.9813416481018065, "epoch": 0.21670501364438974, "grad_norm": 0.90234375, "learning_rate": 0.0004998637650690656, "loss": 7.1179, "mean_token_accuracy": 0.09519804865121842, "num_tokens": 4407131.0, "step": 2025 }, { "entropy": 7.10913496017456, "epoch": 0.21724008775215367, "grad_norm": 1.046875, "learning_rate": 0.000499862431537645, "loss": 6.9569, "mean_token_accuracy": 0.10057392492890357, "num_tokens": 4417701.0, "step": 2030 }, { "entropy": 6.981591272354126, "epoch": 0.2177751618599176, "grad_norm": 1.109375, "learning_rate": 0.0004998610915133533, "loss": 7.0173, "mean_token_accuracy": 0.10014636293053628, "num_tokens": 4429309.0, "step": 2035 }, { "entropy": 7.007551097869873, "epoch": 0.21831023596768154, "grad_norm": 0.9375, "learning_rate": 0.0004998597449962292, "loss": 7.0663, "mean_token_accuracy": 0.10122283399105073, "num_tokens": 4440850.0, "step": 2040 }, { "entropy": 7.092380857467651, "epoch": 0.21884531007544544, "grad_norm": 0.953125, "learning_rate": 0.0004998583919863115, "loss": 7.0501, "mean_token_accuracy": 0.09975898936390877, "num_tokens": 4451995.0, "step": 2045 }, { "entropy": 6.99484076499939, "epoch": 0.21938038418320938, "grad_norm": 1.046875, "learning_rate": 0.0004998570324836393, "loss": 6.959, "mean_token_accuracy": 0.10816834419965744, "num_tokens": 4461916.0, "step": 2050 }, { "entropy": 7.084143257141113, "epoch": 0.2199154582909733, "grad_norm": 1.0546875, "learning_rate": 0.000499855666488252, "loss": 7.0571, "mean_token_accuracy": 0.10147327557206154, "num_tokens": 4471603.0, "step": 2055 }, { "entropy": 7.105906391143799, "epoch": 0.22045053239873721, "grad_norm": 0.98046875, "learning_rate": 0.0004998542940001889, "loss": 7.083, "mean_token_accuracy": 0.10265670791268348, "num_tokens": 4483166.0, "step": 2060 }, { "entropy": 7.020576333999633, "epoch": 0.22098560650650115, "grad_norm": 1.0, "learning_rate": 0.0004998529150194895, "loss": 7.0022, "mean_token_accuracy": 0.09936799854040146, "num_tokens": 4493824.0, "step": 2065 }, { "entropy": 7.097088718414307, "epoch": 0.22152068061426508, "grad_norm": 0.953125, "learning_rate": 0.0004998515295461939, "loss": 6.9225, "mean_token_accuracy": 0.1188635177910328, "num_tokens": 4505674.0, "step": 2070 }, { "entropy": 6.968977689743042, "epoch": 0.22205575472202901, "grad_norm": 0.97265625, "learning_rate": 0.000499850137580342, "loss": 7.0049, "mean_token_accuracy": 0.10718596279621125, "num_tokens": 4516516.0, "step": 2075 }, { "entropy": 7.039025449752808, "epoch": 0.22259082882979292, "grad_norm": 1.0859375, "learning_rate": 0.0004998487391219739, "loss": 6.9963, "mean_token_accuracy": 0.09949744194746017, "num_tokens": 4527811.0, "step": 2080 }, { "entropy": 7.0311308860778805, "epoch": 0.22312590293755685, "grad_norm": 0.88671875, "learning_rate": 0.0004998473341711301, "loss": 6.9388, "mean_token_accuracy": 0.09995686337351799, "num_tokens": 4538988.0, "step": 2085 }, { "entropy": 7.018882703781128, "epoch": 0.22366097704532079, "grad_norm": 1.03125, "learning_rate": 0.0004998459227278512, "loss": 6.9733, "mean_token_accuracy": 0.1059156596660614, "num_tokens": 4550049.0, "step": 2090 }, { "entropy": 7.072498369216919, "epoch": 0.2241960511530847, "grad_norm": 1.0625, "learning_rate": 0.0004998445047921777, "loss": 7.0719, "mean_token_accuracy": 0.10480737760663032, "num_tokens": 4559784.0, "step": 2095 }, { "entropy": 7.031924390792847, "epoch": 0.22473112526084862, "grad_norm": 1.0625, "learning_rate": 0.0004998430803641509, "loss": 6.9337, "mean_token_accuracy": 0.10361162722110748, "num_tokens": 4569982.0, "step": 2100 }, { "entropy": 6.939174699783325, "epoch": 0.22526619936861256, "grad_norm": 0.93359375, "learning_rate": 0.0004998416494438118, "loss": 6.9534, "mean_token_accuracy": 0.10496753230690956, "num_tokens": 4581117.0, "step": 2105 }, { "entropy": 7.033869123458862, "epoch": 0.2258012734763765, "grad_norm": 1.109375, "learning_rate": 0.0004998402120312014, "loss": 7.0198, "mean_token_accuracy": 0.10706626474857331, "num_tokens": 4592012.0, "step": 2110 }, { "entropy": 7.034424209594727, "epoch": 0.2263363475841404, "grad_norm": 0.96875, "learning_rate": 0.0004998387681263616, "loss": 7.0581, "mean_token_accuracy": 0.10076023638248444, "num_tokens": 4602591.0, "step": 2115 }, { "entropy": 7.038776493072509, "epoch": 0.22687142169190433, "grad_norm": 1.015625, "learning_rate": 0.000499837317729334, "loss": 6.985, "mean_token_accuracy": 0.10343138575553894, "num_tokens": 4613418.0, "step": 2120 }, { "entropy": 6.944168281555176, "epoch": 0.22740649579966826, "grad_norm": 0.90625, "learning_rate": 0.0004998358608401603, "loss": 6.9051, "mean_token_accuracy": 0.11338085606694222, "num_tokens": 4625156.0, "step": 2125 }, { "entropy": 7.1117607116699215, "epoch": 0.22794156990743217, "grad_norm": 0.94140625, "learning_rate": 0.000499834397458883, "loss": 6.937, "mean_token_accuracy": 0.10821644887328148, "num_tokens": 4634523.0, "step": 2130 }, { "entropy": 6.958322238922119, "epoch": 0.2284766440151961, "grad_norm": 1.0, "learning_rate": 0.0004998329275855438, "loss": 6.929, "mean_token_accuracy": 0.11250298544764518, "num_tokens": 4646292.0, "step": 2135 }, { "entropy": 6.985101842880249, "epoch": 0.22901171812296003, "grad_norm": 0.984375, "learning_rate": 0.0004998314512201855, "loss": 6.9099, "mean_token_accuracy": 0.10238043665885925, "num_tokens": 4656417.0, "step": 2140 }, { "entropy": 6.924033832550049, "epoch": 0.22954679223072397, "grad_norm": 1.0703125, "learning_rate": 0.0004998299683628507, "loss": 6.9282, "mean_token_accuracy": 0.10534189045429229, "num_tokens": 4666933.0, "step": 2145 }, { "entropy": 7.059316158294678, "epoch": 0.23008186633848787, "grad_norm": 0.9765625, "learning_rate": 0.0004998284790135821, "loss": 7.1084, "mean_token_accuracy": 0.09782184064388275, "num_tokens": 4678482.0, "step": 2150 }, { "entropy": 7.053033971786499, "epoch": 0.2306169404462518, "grad_norm": 1.0703125, "learning_rate": 0.0004998269831724228, "loss": 6.9481, "mean_token_accuracy": 0.1064787782728672, "num_tokens": 4688454.0, "step": 2155 }, { "entropy": 6.9519795894622805, "epoch": 0.23115201455401574, "grad_norm": 1.0234375, "learning_rate": 0.0004998254808394159, "loss": 6.9839, "mean_token_accuracy": 0.1061179980635643, "num_tokens": 4699545.0, "step": 2160 }, { "entropy": 7.083680486679077, "epoch": 0.23168708866177964, "grad_norm": 0.85546875, "learning_rate": 0.0004998239720146048, "loss": 6.9986, "mean_token_accuracy": 0.10272667407989503, "num_tokens": 4711149.0, "step": 2165 }, { "entropy": 6.961511278152466, "epoch": 0.23222216276954358, "grad_norm": 0.9453125, "learning_rate": 0.0004998224566980332, "loss": 6.9935, "mean_token_accuracy": 0.10200226753950119, "num_tokens": 4722651.0, "step": 2170 }, { "entropy": 7.031105852127075, "epoch": 0.2327572368773075, "grad_norm": 1.046875, "learning_rate": 0.0004998209348897447, "loss": 6.9926, "mean_token_accuracy": 0.09458313658833503, "num_tokens": 4733883.0, "step": 2175 }, { "entropy": 7.135159015655518, "epoch": 0.23329231098507144, "grad_norm": 0.98046875, "learning_rate": 0.0004998194065897833, "loss": 6.955, "mean_token_accuracy": 0.10691621899604797, "num_tokens": 4744517.0, "step": 2180 }, { "entropy": 6.9776819229125975, "epoch": 0.23382738509283535, "grad_norm": 1.0390625, "learning_rate": 0.000499817871798193, "loss": 6.9804, "mean_token_accuracy": 0.11214952319860458, "num_tokens": 4755481.0, "step": 2185 }, { "entropy": 6.972070980072021, "epoch": 0.23436245920059928, "grad_norm": 1.1171875, "learning_rate": 0.0004998163305150185, "loss": 6.9039, "mean_token_accuracy": 0.11068079173564911, "num_tokens": 4765535.0, "step": 2190 }, { "entropy": 6.973287200927734, "epoch": 0.23489753330836322, "grad_norm": 0.98828125, "learning_rate": 0.0004998147827403038, "loss": 7.0273, "mean_token_accuracy": 0.10471541583538055, "num_tokens": 4777045.0, "step": 2195 }, { "entropy": 7.077732086181641, "epoch": 0.23543260741612712, "grad_norm": 0.9921875, "learning_rate": 0.000499813228474094, "loss": 6.9064, "mean_token_accuracy": 0.10825864002108573, "num_tokens": 4787958.0, "step": 2200 }, { "entropy": 6.917084503173828, "epoch": 0.23596768152389105, "grad_norm": 0.953125, "learning_rate": 0.0004998116677164338, "loss": 6.9445, "mean_token_accuracy": 0.10730226412415504, "num_tokens": 4798502.0, "step": 2205 }, { "entropy": 6.931448936462402, "epoch": 0.236502755631655, "grad_norm": 0.9921875, "learning_rate": 0.0004998101004673682, "loss": 6.9413, "mean_token_accuracy": 0.11088823229074478, "num_tokens": 4809179.0, "step": 2210 }, { "entropy": 7.135161733627319, "epoch": 0.23703782973941892, "grad_norm": 1.015625, "learning_rate": 0.0004998085267269426, "loss": 7.0215, "mean_token_accuracy": 0.09467339664697647, "num_tokens": 4819803.0, "step": 2215 }, { "entropy": 7.004361200332641, "epoch": 0.23757290384718283, "grad_norm": 0.96875, "learning_rate": 0.0004998069464952025, "loss": 6.9916, "mean_token_accuracy": 0.10000614672899247, "num_tokens": 4831226.0, "step": 2220 }, { "entropy": 7.049906778335571, "epoch": 0.23810797795494676, "grad_norm": 0.9453125, "learning_rate": 0.0004998053597721932, "loss": 7.0124, "mean_token_accuracy": 0.10538152158260346, "num_tokens": 4842168.0, "step": 2225 }, { "entropy": 7.019608783721924, "epoch": 0.2386430520627107, "grad_norm": 0.94140625, "learning_rate": 0.0004998037665579608, "loss": 6.9621, "mean_token_accuracy": 0.10858180820941925, "num_tokens": 4852655.0, "step": 2230 }, { "entropy": 6.915230321884155, "epoch": 0.2391781261704746, "grad_norm": 0.95703125, "learning_rate": 0.0004998021668525513, "loss": 6.8626, "mean_token_accuracy": 0.10984659045934678, "num_tokens": 4862164.0, "step": 2235 }, { "entropy": 7.046167945861816, "epoch": 0.23971320027823853, "grad_norm": 0.9609375, "learning_rate": 0.0004998005606560107, "loss": 6.9964, "mean_token_accuracy": 0.10990610420703888, "num_tokens": 4874233.0, "step": 2240 }, { "entropy": 6.992388391494751, "epoch": 0.24024827438600246, "grad_norm": 0.953125, "learning_rate": 0.0004997989479683856, "loss": 6.9876, "mean_token_accuracy": 0.1066631942987442, "num_tokens": 4885948.0, "step": 2245 }, { "entropy": 6.963246202468872, "epoch": 0.2407833484937664, "grad_norm": 0.90234375, "learning_rate": 0.0004997973287897224, "loss": 6.9667, "mean_token_accuracy": 0.10817388147115707, "num_tokens": 4897128.0, "step": 2250 }, { "entropy": 6.980781888961792, "epoch": 0.2413184226015303, "grad_norm": 0.98828125, "learning_rate": 0.0004997957031200681, "loss": 6.939, "mean_token_accuracy": 0.11121672838926315, "num_tokens": 4907699.0, "step": 2255 }, { "entropy": 6.887354183197021, "epoch": 0.24185349670929424, "grad_norm": 0.984375, "learning_rate": 0.0004997940709594692, "loss": 6.8796, "mean_token_accuracy": 0.10674800127744674, "num_tokens": 4918772.0, "step": 2260 }, { "entropy": 7.091795778274536, "epoch": 0.24238857081705817, "grad_norm": 1.078125, "learning_rate": 0.0004997924323079733, "loss": 6.9368, "mean_token_accuracy": 0.10729291215538979, "num_tokens": 4930046.0, "step": 2265 }, { "entropy": 6.9101183891296385, "epoch": 0.24292364492482207, "grad_norm": 1.078125, "learning_rate": 0.0004997907871656273, "loss": 6.9568, "mean_token_accuracy": 0.10801581889390946, "num_tokens": 4940609.0, "step": 2270 }, { "entropy": 7.002806997299194, "epoch": 0.243458719032586, "grad_norm": 1.0, "learning_rate": 0.0004997891355324791, "loss": 6.9658, "mean_token_accuracy": 0.10598139539361, "num_tokens": 4951339.0, "step": 2275 }, { "entropy": 6.983994722366333, "epoch": 0.24399379314034994, "grad_norm": 0.9921875, "learning_rate": 0.0004997874774085761, "loss": 6.878, "mean_token_accuracy": 0.10262224972248077, "num_tokens": 4961083.0, "step": 2280 }, { "entropy": 6.895718050003052, "epoch": 0.24452886724811387, "grad_norm": 1.0859375, "learning_rate": 0.0004997858127939662, "loss": 6.8908, "mean_token_accuracy": 0.10761211439967155, "num_tokens": 4971399.0, "step": 2285 }, { "entropy": 7.041612005233764, "epoch": 0.24506394135587778, "grad_norm": 0.99609375, "learning_rate": 0.0004997841416886976, "loss": 6.9715, "mean_token_accuracy": 0.1061974436044693, "num_tokens": 4982429.0, "step": 2290 }, { "entropy": 7.0298323154449465, "epoch": 0.2455990154636417, "grad_norm": 1.0234375, "learning_rate": 0.0004997824640928186, "loss": 7.0184, "mean_token_accuracy": 0.10754595324397087, "num_tokens": 4993706.0, "step": 2295 }, { "entropy": 6.988226366043091, "epoch": 0.24613408957140565, "grad_norm": 0.97265625, "learning_rate": 0.0004997807800063774, "loss": 6.9127, "mean_token_accuracy": 0.10858980864286423, "num_tokens": 5005411.0, "step": 2300 }, { "entropy": 7.023472309112549, "epoch": 0.24666916367916958, "grad_norm": 0.97265625, "learning_rate": 0.000499779089429423, "loss": 7.0413, "mean_token_accuracy": 0.10208934471011162, "num_tokens": 5016011.0, "step": 2305 }, { "entropy": 7.013689231872559, "epoch": 0.24720423778693348, "grad_norm": 0.91015625, "learning_rate": 0.0004997773923620037, "loss": 6.9954, "mean_token_accuracy": 0.10329191759228706, "num_tokens": 5027841.0, "step": 2310 }, { "entropy": 7.100406980514526, "epoch": 0.24773931189469742, "grad_norm": 0.95703125, "learning_rate": 0.0004997756888041689, "loss": 6.9853, "mean_token_accuracy": 0.09798330888152122, "num_tokens": 5038640.0, "step": 2315 }, { "entropy": 6.95166802406311, "epoch": 0.24827438600246135, "grad_norm": 1.0, "learning_rate": 0.0004997739787559677, "loss": 6.9356, "mean_token_accuracy": 0.10357877835631371, "num_tokens": 5050423.0, "step": 2320 }, { "entropy": 6.978884506225586, "epoch": 0.24880946011022526, "grad_norm": 1.140625, "learning_rate": 0.0004997722622174494, "loss": 6.954, "mean_token_accuracy": 0.10356095060706139, "num_tokens": 5060654.0, "step": 2325 }, { "entropy": 6.934212970733642, "epoch": 0.2493445342179892, "grad_norm": 1.015625, "learning_rate": 0.0004997705391886636, "loss": 6.8582, "mean_token_accuracy": 0.11322998628020287, "num_tokens": 5070165.0, "step": 2330 }, { "entropy": 6.913174200057983, "epoch": 0.24987960832575312, "grad_norm": 1.0, "learning_rate": 0.0004997688096696601, "loss": 6.8995, "mean_token_accuracy": 0.10103722065687179, "num_tokens": 5080937.0, "step": 2335 }, { "entropy": 6.911728572845459, "epoch": 0.25041468243351706, "grad_norm": 0.96484375, "learning_rate": 0.0004997670736604888, "loss": 6.8744, "mean_token_accuracy": 0.11288927420973778, "num_tokens": 5090955.0, "step": 2340 }, { "entropy": 7.074804210662842, "epoch": 0.250949756541281, "grad_norm": 0.96484375, "learning_rate": 0.0004997653311611998, "loss": 7.0112, "mean_token_accuracy": 0.09920887500047684, "num_tokens": 5102201.0, "step": 2345 }, { "entropy": 7.0164875984191895, "epoch": 0.25148483064904487, "grad_norm": 1.0390625, "learning_rate": 0.0004997635821718435, "loss": 6.9312, "mean_token_accuracy": 0.11026841551065444, "num_tokens": 5112235.0, "step": 2350 }, { "entropy": 6.8925614833831785, "epoch": 0.2520199047568088, "grad_norm": 1.40625, "learning_rate": 0.0004997618266924704, "loss": 6.8219, "mean_token_accuracy": 0.10299434512853622, "num_tokens": 5122360.0, "step": 2355 }, { "entropy": 7.002241230010986, "epoch": 0.25255497886457273, "grad_norm": 1.015625, "learning_rate": 0.000499760064723131, "loss": 6.9801, "mean_token_accuracy": 0.1024145670235157, "num_tokens": 5133084.0, "step": 2360 }, { "entropy": 6.938703870773315, "epoch": 0.25309005297233667, "grad_norm": 0.98046875, "learning_rate": 0.0004997582962638764, "loss": 6.9133, "mean_token_accuracy": 0.09837969020009041, "num_tokens": 5144495.0, "step": 2365 }, { "entropy": 7.031873512268066, "epoch": 0.2536251270801006, "grad_norm": 1.0, "learning_rate": 0.0004997565213147575, "loss": 6.9238, "mean_token_accuracy": 0.10646962001919746, "num_tokens": 5154824.0, "step": 2370 }, { "entropy": 6.939056253433227, "epoch": 0.25416020118786453, "grad_norm": 1.03125, "learning_rate": 0.0004997547398758257, "loss": 6.9111, "mean_token_accuracy": 0.10193499475717545, "num_tokens": 5165061.0, "step": 2375 }, { "entropy": 6.981441783905029, "epoch": 0.25469527529562846, "grad_norm": 1.0, "learning_rate": 0.0004997529519471323, "loss": 6.8679, "mean_token_accuracy": 0.11417916044592857, "num_tokens": 5174964.0, "step": 2380 }, { "entropy": 6.884857940673828, "epoch": 0.25523034940339234, "grad_norm": 1.0859375, "learning_rate": 0.0004997511575287291, "loss": 6.9267, "mean_token_accuracy": 0.10812475010752678, "num_tokens": 5185458.0, "step": 2385 }, { "entropy": 6.991512250900269, "epoch": 0.2557654235111563, "grad_norm": 1.03125, "learning_rate": 0.0004997493566206677, "loss": 6.9025, "mean_token_accuracy": 0.10954718366265297, "num_tokens": 5196193.0, "step": 2390 }, { "entropy": 6.966927862167358, "epoch": 0.2563004976189202, "grad_norm": 0.94140625, "learning_rate": 0.0004997475492230003, "loss": 7.0198, "mean_token_accuracy": 0.09881971776485443, "num_tokens": 5208541.0, "step": 2395 }, { "entropy": 6.989241456985473, "epoch": 0.25683557172668414, "grad_norm": 1.0234375, "learning_rate": 0.000499745735335779, "loss": 6.8501, "mean_token_accuracy": 0.10620964914560319, "num_tokens": 5218567.0, "step": 2400 }, { "entropy": 6.943647241592407, "epoch": 0.2573706458344481, "grad_norm": 0.97265625, "learning_rate": 0.0004997439149590561, "loss": 6.9666, "mean_token_accuracy": 0.10247603580355644, "num_tokens": 5228293.0, "step": 2405 }, { "entropy": 6.982013940811157, "epoch": 0.257905719942212, "grad_norm": 1.09375, "learning_rate": 0.0004997420880928843, "loss": 6.913, "mean_token_accuracy": 0.10574470162391662, "num_tokens": 5238880.0, "step": 2410 }, { "entropy": 6.9576988697052, "epoch": 0.25844079404997594, "grad_norm": 0.98046875, "learning_rate": 0.0004997402547373162, "loss": 6.9947, "mean_token_accuracy": 0.10212295204401016, "num_tokens": 5250104.0, "step": 2415 }, { "entropy": 7.100748538970947, "epoch": 0.2589758681577399, "grad_norm": 0.94921875, "learning_rate": 0.0004997384148924049, "loss": 7.0243, "mean_token_accuracy": 0.10289878994226456, "num_tokens": 5260355.0, "step": 2420 }, { "entropy": 6.962227201461792, "epoch": 0.25951094226550375, "grad_norm": 1.0078125, "learning_rate": 0.0004997365685582035, "loss": 6.9296, "mean_token_accuracy": 0.10283196046948433, "num_tokens": 5272117.0, "step": 2425 }, { "entropy": 6.9883177280426025, "epoch": 0.2600460163732677, "grad_norm": 0.890625, "learning_rate": 0.0004997347157347651, "loss": 7.0307, "mean_token_accuracy": 0.10037739872932434, "num_tokens": 5284583.0, "step": 2430 }, { "entropy": 7.049625587463379, "epoch": 0.2605810904810316, "grad_norm": 0.93359375, "learning_rate": 0.0004997328564221435, "loss": 6.8241, "mean_token_accuracy": 0.12059795558452606, "num_tokens": 5295846.0, "step": 2435 }, { "entropy": 6.871410655975342, "epoch": 0.26111616458879555, "grad_norm": 0.91796875, "learning_rate": 0.0004997309906203922, "loss": 6.9662, "mean_token_accuracy": 0.10526571422815323, "num_tokens": 5307802.0, "step": 2440 }, { "entropy": 7.033421468734741, "epoch": 0.2616512386965595, "grad_norm": 1.046875, "learning_rate": 0.0004997291183295652, "loss": 6.8913, "mean_token_accuracy": 0.10737156346440316, "num_tokens": 5318263.0, "step": 2445 }, { "entropy": 6.998748159408569, "epoch": 0.2621863128043234, "grad_norm": 0.98046875, "learning_rate": 0.0004997272395497164, "loss": 6.9388, "mean_token_accuracy": 0.10455406904220581, "num_tokens": 5328555.0, "step": 2450 }, { "entropy": 6.912611675262451, "epoch": 0.26272138691208735, "grad_norm": 0.96484375, "learning_rate": 0.0004997253542809002, "loss": 6.9152, "mean_token_accuracy": 0.10682450905442238, "num_tokens": 5339954.0, "step": 2455 }, { "entropy": 7.079062366485596, "epoch": 0.26325646101985123, "grad_norm": 0.984375, "learning_rate": 0.0004997234625231709, "loss": 6.9637, "mean_token_accuracy": 0.10808332860469819, "num_tokens": 5350919.0, "step": 2460 }, { "entropy": 6.93997278213501, "epoch": 0.26379153512761516, "grad_norm": 0.91015625, "learning_rate": 0.0004997215642765832, "loss": 6.925, "mean_token_accuracy": 0.10664721727371215, "num_tokens": 5361844.0, "step": 2465 }, { "entropy": 6.987752532958984, "epoch": 0.2643266092353791, "grad_norm": 0.95703125, "learning_rate": 0.000499719659541192, "loss": 6.9562, "mean_token_accuracy": 0.10334968268871307, "num_tokens": 5372026.0, "step": 2470 }, { "entropy": 6.954167985916138, "epoch": 0.26486168334314303, "grad_norm": 0.890625, "learning_rate": 0.0004997177483170521, "loss": 6.9927, "mean_token_accuracy": 0.10936494544148445, "num_tokens": 5382965.0, "step": 2475 }, { "entropy": 7.007135391235352, "epoch": 0.26539675745090696, "grad_norm": 1.0390625, "learning_rate": 0.0004997158306042188, "loss": 6.9458, "mean_token_accuracy": 0.10711643844842911, "num_tokens": 5393738.0, "step": 2480 }, { "entropy": 6.897781848907471, "epoch": 0.2659318315586709, "grad_norm": 1.0625, "learning_rate": 0.0004997139064027476, "loss": 6.8237, "mean_token_accuracy": 0.1119477018713951, "num_tokens": 5404059.0, "step": 2485 }, { "entropy": 6.912676382064819, "epoch": 0.26646690566643483, "grad_norm": 1.046875, "learning_rate": 0.0004997119757126938, "loss": 6.855, "mean_token_accuracy": 0.10871710032224655, "num_tokens": 5414152.0, "step": 2490 }, { "entropy": 7.022440433502197, "epoch": 0.2670019797741987, "grad_norm": 1.015625, "learning_rate": 0.0004997100385341133, "loss": 7.0235, "mean_token_accuracy": 0.10726772770285606, "num_tokens": 5425227.0, "step": 2495 }, { "entropy": 7.004488468170166, "epoch": 0.26753705388196264, "grad_norm": 0.98828125, "learning_rate": 0.0004997080948670621, "loss": 6.8663, "mean_token_accuracy": 0.11122208759188652, "num_tokens": 5435716.0, "step": 2500 }, { "entropy": 6.936031723022461, "epoch": 0.26807212798972657, "grad_norm": 0.9609375, "learning_rate": 0.0004997061447115962, "loss": 6.9347, "mean_token_accuracy": 0.10375397354364395, "num_tokens": 5446519.0, "step": 2505 }, { "entropy": 6.975105237960816, "epoch": 0.2686072020974905, "grad_norm": 1.0078125, "learning_rate": 0.0004997041880677719, "loss": 6.925, "mean_token_accuracy": 0.10548185482621193, "num_tokens": 5457496.0, "step": 2510 }, { "entropy": 6.880755996704101, "epoch": 0.26914227620525444, "grad_norm": 1.1171875, "learning_rate": 0.0004997022249356457, "loss": 6.823, "mean_token_accuracy": 0.11008255481719971, "num_tokens": 5469059.0, "step": 2515 }, { "entropy": 6.923517560958862, "epoch": 0.26967735031301837, "grad_norm": 1.3203125, "learning_rate": 0.0004997002553152745, "loss": 6.9138, "mean_token_accuracy": 0.10938023030757904, "num_tokens": 5480324.0, "step": 2520 }, { "entropy": 6.9742035388946535, "epoch": 0.2702124244207823, "grad_norm": 0.98828125, "learning_rate": 0.0004996982792067148, "loss": 6.9339, "mean_token_accuracy": 0.09864719212055206, "num_tokens": 5491513.0, "step": 2525 }, { "entropy": 6.8970160484313965, "epoch": 0.2707474985285462, "grad_norm": 0.95703125, "learning_rate": 0.000499696296610024, "loss": 6.8394, "mean_token_accuracy": 0.1051232136785984, "num_tokens": 5502414.0, "step": 2530 }, { "entropy": 6.9252660274505615, "epoch": 0.2712825726363101, "grad_norm": 0.94140625, "learning_rate": 0.0004996943075252592, "loss": 6.9715, "mean_token_accuracy": 0.1062911570072174, "num_tokens": 5512962.0, "step": 2535 }, { "entropy": 6.977799654006958, "epoch": 0.27181764674407405, "grad_norm": 0.9609375, "learning_rate": 0.0004996923119524777, "loss": 6.8355, "mean_token_accuracy": 0.10766077339649201, "num_tokens": 5524648.0, "step": 2540 }, { "entropy": 6.855292940139771, "epoch": 0.272352720851838, "grad_norm": 1.0078125, "learning_rate": 0.0004996903098917375, "loss": 6.9214, "mean_token_accuracy": 0.0998130515217781, "num_tokens": 5536158.0, "step": 2545 }, { "entropy": 6.939780187606812, "epoch": 0.2728877949596019, "grad_norm": 1.0078125, "learning_rate": 0.000499688301343096, "loss": 6.8405, "mean_token_accuracy": 0.10747457072138786, "num_tokens": 5547374.0, "step": 2550 }, { "entropy": 7.020946025848389, "epoch": 0.27342286906736585, "grad_norm": 1.0, "learning_rate": 0.0004996862863066114, "loss": 6.9137, "mean_token_accuracy": 0.10850636437535285, "num_tokens": 5559212.0, "step": 2555 }, { "entropy": 6.907329320907593, "epoch": 0.2739579431751298, "grad_norm": 1.078125, "learning_rate": 0.0004996842647823419, "loss": 6.8823, "mean_token_accuracy": 0.10653341263532638, "num_tokens": 5569302.0, "step": 2560 }, { "entropy": 6.910869598388672, "epoch": 0.27449301728289366, "grad_norm": 1.140625, "learning_rate": 0.0004996822367703458, "loss": 6.8905, "mean_token_accuracy": 0.10348111093044281, "num_tokens": 5581688.0, "step": 2565 }, { "entropy": 6.955097198486328, "epoch": 0.2750280913906576, "grad_norm": 1.1328125, "learning_rate": 0.0004996802022706817, "loss": 6.8211, "mean_token_accuracy": 0.10833865478634834, "num_tokens": 5591376.0, "step": 2570 }, { "entropy": 6.861729669570923, "epoch": 0.2755631654984215, "grad_norm": 1.046875, "learning_rate": 0.0004996781612834083, "loss": 6.8798, "mean_token_accuracy": 0.10732169449329376, "num_tokens": 5601510.0, "step": 2575 }, { "entropy": 7.005447006225586, "epoch": 0.27609823960618546, "grad_norm": 1.1484375, "learning_rate": 0.0004996761138085846, "loss": 6.9316, "mean_token_accuracy": 0.1021797627210617, "num_tokens": 5611436.0, "step": 2580 }, { "entropy": 6.92574257850647, "epoch": 0.2766333137139494, "grad_norm": 1.21875, "learning_rate": 0.0004996740598462697, "loss": 6.9341, "mean_token_accuracy": 0.10267650112509727, "num_tokens": 5620470.0, "step": 2585 }, { "entropy": 6.860880899429321, "epoch": 0.2771683878217133, "grad_norm": 1.0234375, "learning_rate": 0.0004996719993965229, "loss": 6.8297, "mean_token_accuracy": 0.10769467577338218, "num_tokens": 5630740.0, "step": 2590 }, { "entropy": 6.8753687858581545, "epoch": 0.27770346192947726, "grad_norm": 1.0546875, "learning_rate": 0.0004996699324594036, "loss": 6.8303, "mean_token_accuracy": 0.11734023317694664, "num_tokens": 5641138.0, "step": 2595 }, { "entropy": 6.985844898223877, "epoch": 0.27823853603724114, "grad_norm": 0.9921875, "learning_rate": 0.0004996678590349717, "loss": 6.974, "mean_token_accuracy": 0.1085183672606945, "num_tokens": 5652474.0, "step": 2600 }, { "entropy": 6.9662446022033695, "epoch": 0.27877361014500507, "grad_norm": 1.0390625, "learning_rate": 0.0004996657791232868, "loss": 6.8709, "mean_token_accuracy": 0.11153203919529915, "num_tokens": 5663178.0, "step": 2605 }, { "entropy": 6.891348218917846, "epoch": 0.279308684252769, "grad_norm": 1.1171875, "learning_rate": 0.0004996636927244092, "loss": 6.8963, "mean_token_accuracy": 0.10582477301359176, "num_tokens": 5673565.0, "step": 2610 }, { "entropy": 7.040777587890625, "epoch": 0.27984375836053293, "grad_norm": 1.1171875, "learning_rate": 0.000499661599838399, "loss": 6.9389, "mean_token_accuracy": 0.10204790085554123, "num_tokens": 5684651.0, "step": 2615 }, { "entropy": 6.929867219924927, "epoch": 0.28037883246829687, "grad_norm": 1.0078125, "learning_rate": 0.0004996595004653167, "loss": 6.8204, "mean_token_accuracy": 0.10971119105815888, "num_tokens": 5696081.0, "step": 2620 }, { "entropy": 6.925084161758423, "epoch": 0.2809139065760608, "grad_norm": 0.9921875, "learning_rate": 0.0004996573946052229, "loss": 6.855, "mean_token_accuracy": 0.10883698239922523, "num_tokens": 5706830.0, "step": 2625 }, { "entropy": 6.910267782211304, "epoch": 0.28144898068382473, "grad_norm": 1.1328125, "learning_rate": 0.0004996552822581783, "loss": 6.8815, "mean_token_accuracy": 0.11361035332083702, "num_tokens": 5717261.0, "step": 2630 }, { "entropy": 6.91580810546875, "epoch": 0.2819840547915886, "grad_norm": 1.1640625, "learning_rate": 0.000499653163424244, "loss": 6.8481, "mean_token_accuracy": 0.10841184929013252, "num_tokens": 5727280.0, "step": 2635 }, { "entropy": 6.938942956924438, "epoch": 0.28251912889935255, "grad_norm": 0.97265625, "learning_rate": 0.0004996510381034814, "loss": 6.9083, "mean_token_accuracy": 0.10522805228829384, "num_tokens": 5737485.0, "step": 2640 }, { "entropy": 6.926429605484008, "epoch": 0.2830542030071165, "grad_norm": 0.9921875, "learning_rate": 0.0004996489062959515, "loss": 6.8735, "mean_token_accuracy": 0.10467999801039696, "num_tokens": 5747683.0, "step": 2645 }, { "entropy": 6.867719650268555, "epoch": 0.2835892771148804, "grad_norm": 1.046875, "learning_rate": 0.0004996467680017159, "loss": 6.9325, "mean_token_accuracy": 0.10280923023819924, "num_tokens": 5758148.0, "step": 2650 }, { "entropy": 6.917259216308594, "epoch": 0.28412435122264434, "grad_norm": 0.96484375, "learning_rate": 0.0004996446232208365, "loss": 6.8627, "mean_token_accuracy": 0.11170612499117852, "num_tokens": 5769109.0, "step": 2655 }, { "entropy": 6.9372947216033936, "epoch": 0.2846594253304083, "grad_norm": 1.03125, "learning_rate": 0.0004996424719533753, "loss": 6.8939, "mean_token_accuracy": 0.1052110217511654, "num_tokens": 5780344.0, "step": 2660 }, { "entropy": 6.913125228881836, "epoch": 0.2851944994381722, "grad_norm": 1.0859375, "learning_rate": 0.0004996403141993941, "loss": 6.6962, "mean_token_accuracy": 0.11824454516172409, "num_tokens": 5790167.0, "step": 2665 }, { "entropy": 6.92453293800354, "epoch": 0.2857295735459361, "grad_norm": 1.0625, "learning_rate": 0.0004996381499589555, "loss": 6.8624, "mean_token_accuracy": 0.10613423809409142, "num_tokens": 5800076.0, "step": 2670 }, { "entropy": 6.944131517410279, "epoch": 0.2862646476537, "grad_norm": 0.98828125, "learning_rate": 0.0004996359792321219, "loss": 6.8113, "mean_token_accuracy": 0.11141969487071038, "num_tokens": 5810547.0, "step": 2675 }, { "entropy": 6.8161341667175295, "epoch": 0.28679972176146395, "grad_norm": 1.0625, "learning_rate": 0.000499633802018956, "loss": 6.8478, "mean_token_accuracy": 0.1100471280515194, "num_tokens": 5821210.0, "step": 2680 }, { "entropy": 6.917617702484131, "epoch": 0.2873347958692279, "grad_norm": 1.0078125, "learning_rate": 0.0004996316183195204, "loss": 6.8869, "mean_token_accuracy": 0.10786092206835747, "num_tokens": 5832361.0, "step": 2685 }, { "entropy": 6.962878274917602, "epoch": 0.2878698699769918, "grad_norm": 1.03125, "learning_rate": 0.0004996294281338786, "loss": 6.8717, "mean_token_accuracy": 0.10681624412536621, "num_tokens": 5843242.0, "step": 2690 }, { "entropy": 6.976676988601684, "epoch": 0.28840494408475575, "grad_norm": 0.9453125, "learning_rate": 0.0004996272314620936, "loss": 6.9215, "mean_token_accuracy": 0.10194345191121101, "num_tokens": 5855163.0, "step": 2695 }, { "entropy": 6.837163925170898, "epoch": 0.2889400181925197, "grad_norm": 0.97265625, "learning_rate": 0.0004996250283042288, "loss": 6.8839, "mean_token_accuracy": 0.11228486746549607, "num_tokens": 5866908.0, "step": 2700 }, { "entropy": 6.974035596847534, "epoch": 0.28947509230028357, "grad_norm": 1.0546875, "learning_rate": 0.000499622818660348, "loss": 6.9045, "mean_token_accuracy": 0.10939288139343262, "num_tokens": 5877342.0, "step": 2705 }, { "entropy": 6.942460250854492, "epoch": 0.2900101664080475, "grad_norm": 1.078125, "learning_rate": 0.0004996206025305147, "loss": 6.8573, "mean_token_accuracy": 0.10582418739795685, "num_tokens": 5887960.0, "step": 2710 }, { "entropy": 6.87635645866394, "epoch": 0.29054524051581143, "grad_norm": 1.0390625, "learning_rate": 0.0004996183799147932, "loss": 6.8397, "mean_token_accuracy": 0.1095063179731369, "num_tokens": 5899887.0, "step": 2715 }, { "entropy": 6.917806816101074, "epoch": 0.29108031462357536, "grad_norm": 1.0390625, "learning_rate": 0.0004996161508132475, "loss": 6.8583, "mean_token_accuracy": 0.10231703668832778, "num_tokens": 5911022.0, "step": 2720 }, { "entropy": 7.016377210617065, "epoch": 0.2916153887313393, "grad_norm": 0.99609375, "learning_rate": 0.000499613915225942, "loss": 6.9222, "mean_token_accuracy": 0.11102863773703575, "num_tokens": 5922780.0, "step": 2725 }, { "entropy": 6.881858253479004, "epoch": 0.29215046283910323, "grad_norm": 1.0546875, "learning_rate": 0.0004996116731529412, "loss": 6.9251, "mean_token_accuracy": 0.10592872574925423, "num_tokens": 5934112.0, "step": 2730 }, { "entropy": 6.8940752983093265, "epoch": 0.29268553694686716, "grad_norm": 1.0546875, "learning_rate": 0.00049960942459431, "loss": 6.8866, "mean_token_accuracy": 0.1067856416106224, "num_tokens": 5944386.0, "step": 2735 }, { "entropy": 6.870763492584229, "epoch": 0.29322061105463104, "grad_norm": 1.03125, "learning_rate": 0.0004996071695501132, "loss": 6.813, "mean_token_accuracy": 0.10948670953512192, "num_tokens": 5955552.0, "step": 2740 }, { "entropy": 6.921037864685059, "epoch": 0.293755685162395, "grad_norm": 1.0, "learning_rate": 0.0004996049080204159, "loss": 6.8137, "mean_token_accuracy": 0.1098986655473709, "num_tokens": 5966790.0, "step": 2745 }, { "entropy": 6.925626182556153, "epoch": 0.2942907592701589, "grad_norm": 1.0625, "learning_rate": 0.0004996026400052835, "loss": 6.8214, "mean_token_accuracy": 0.10917853116989136, "num_tokens": 5977704.0, "step": 2750 }, { "entropy": 6.853207015991211, "epoch": 0.29482583337792284, "grad_norm": 0.953125, "learning_rate": 0.0004996003655047814, "loss": 6.8364, "mean_token_accuracy": 0.11162171512842178, "num_tokens": 5989221.0, "step": 2755 }, { "entropy": 6.919997644424439, "epoch": 0.2953609074856868, "grad_norm": 0.89453125, "learning_rate": 0.0004995980845189753, "loss": 6.871, "mean_token_accuracy": 0.10931915193796157, "num_tokens": 6000906.0, "step": 2760 }, { "entropy": 6.931192445755005, "epoch": 0.2958959815934507, "grad_norm": 1.015625, "learning_rate": 0.0004995957970479312, "loss": 6.8945, "mean_token_accuracy": 0.10708941668272018, "num_tokens": 6012039.0, "step": 2765 }, { "entropy": 6.8547321319580075, "epoch": 0.29643105570121464, "grad_norm": 0.93359375, "learning_rate": 0.0004995935030917148, "loss": 6.776, "mean_token_accuracy": 0.11066783592104912, "num_tokens": 6024383.0, "step": 2770 }, { "entropy": 6.994161558151245, "epoch": 0.2969661298089785, "grad_norm": 1.0859375, "learning_rate": 0.0004995912026503926, "loss": 6.8508, "mean_token_accuracy": 0.10267031714320182, "num_tokens": 6034904.0, "step": 2775 }, { "entropy": 6.838885879516601, "epoch": 0.29750120391674245, "grad_norm": 1.0234375, "learning_rate": 0.000499588895724031, "loss": 6.8488, "mean_token_accuracy": 0.10749915912747383, "num_tokens": 6044449.0, "step": 2780 }, { "entropy": 6.962449741363526, "epoch": 0.2980362780245064, "grad_norm": 1.109375, "learning_rate": 0.0004995865823126968, "loss": 6.8765, "mean_token_accuracy": 0.10825972631573677, "num_tokens": 6054465.0, "step": 2785 }, { "entropy": 6.8947694301605225, "epoch": 0.2985713521322703, "grad_norm": 1.0859375, "learning_rate": 0.0004995842624164564, "loss": 6.8962, "mean_token_accuracy": 0.10824007838964463, "num_tokens": 6065539.0, "step": 2790 }, { "entropy": 6.909287405014038, "epoch": 0.29910642624003425, "grad_norm": 1.0859375, "learning_rate": 0.000499581936035377, "loss": 6.8459, "mean_token_accuracy": 0.10840294510126114, "num_tokens": 6076135.0, "step": 2795 }, { "entropy": 6.903677034378052, "epoch": 0.2996415003477982, "grad_norm": 1.0546875, "learning_rate": 0.0004995796031695257, "loss": 6.8641, "mean_token_accuracy": 0.10931005999445915, "num_tokens": 6086604.0, "step": 2800 }, { "entropy": 6.90281114578247, "epoch": 0.3001765744555621, "grad_norm": 1.125, "learning_rate": 0.00049957726381897, "loss": 6.8781, "mean_token_accuracy": 0.10950748696923256, "num_tokens": 6095672.0, "step": 2805 }, { "entropy": 6.90290675163269, "epoch": 0.300711648563326, "grad_norm": 1.0, "learning_rate": 0.0004995749179837773, "loss": 6.7498, "mean_token_accuracy": 0.11466853022575378, "num_tokens": 6105652.0, "step": 2810 }, { "entropy": 6.826155042648315, "epoch": 0.30124672267108993, "grad_norm": 0.99609375, "learning_rate": 0.0004995725656640155, "loss": 6.7856, "mean_token_accuracy": 0.11099454537034034, "num_tokens": 6116930.0, "step": 2815 }, { "entropy": 6.844819593429565, "epoch": 0.30178179677885386, "grad_norm": 1.03125, "learning_rate": 0.0004995702068597524, "loss": 6.7894, "mean_token_accuracy": 0.11423054486513137, "num_tokens": 6126659.0, "step": 2820 }, { "entropy": 6.890478515625, "epoch": 0.3023168708866178, "grad_norm": 1.015625, "learning_rate": 0.0004995678415710561, "loss": 6.8288, "mean_token_accuracy": 0.11060848459601402, "num_tokens": 6137227.0, "step": 2825 }, { "entropy": 6.962517929077149, "epoch": 0.3028519449943817, "grad_norm": 0.98046875, "learning_rate": 0.000499565469797995, "loss": 6.8821, "mean_token_accuracy": 0.10931277051568031, "num_tokens": 6147800.0, "step": 2830 }, { "entropy": 6.822924327850342, "epoch": 0.30338701910214566, "grad_norm": 1.0, "learning_rate": 0.0004995630915406374, "loss": 6.7326, "mean_token_accuracy": 0.12161283493041992, "num_tokens": 6157671.0, "step": 2835 }, { "entropy": 6.918770694732666, "epoch": 0.3039220932099096, "grad_norm": 1.0390625, "learning_rate": 0.0004995607067990521, "loss": 6.8698, "mean_token_accuracy": 0.10645673274993897, "num_tokens": 6168651.0, "step": 2840 }, { "entropy": 6.873465251922608, "epoch": 0.30445716731767347, "grad_norm": 1.453125, "learning_rate": 0.000499558315573308, "loss": 6.8487, "mean_token_accuracy": 0.1086043007671833, "num_tokens": 6179925.0, "step": 2845 }, { "entropy": 6.818239831924439, "epoch": 0.3049922414254374, "grad_norm": 1.234375, "learning_rate": 0.0004995559178634741, "loss": 6.8438, "mean_token_accuracy": 0.10887812077999115, "num_tokens": 6190541.0, "step": 2850 }, { "entropy": 7.041949510574341, "epoch": 0.30552731553320134, "grad_norm": 1.0546875, "learning_rate": 0.0004995535136696196, "loss": 6.8866, "mean_token_accuracy": 0.09955592602491378, "num_tokens": 6201491.0, "step": 2855 }, { "entropy": 6.8139080047607425, "epoch": 0.30606238964096527, "grad_norm": 1.0078125, "learning_rate": 0.000499551102991814, "loss": 6.6991, "mean_token_accuracy": 0.11249880269169807, "num_tokens": 6212443.0, "step": 2860 }, { "entropy": 6.817849111557007, "epoch": 0.3065974637487292, "grad_norm": 1.1328125, "learning_rate": 0.0004995486858301268, "loss": 6.8981, "mean_token_accuracy": 0.1030767761170864, "num_tokens": 6222623.0, "step": 2865 }, { "entropy": 6.925403165817261, "epoch": 0.30713253785649314, "grad_norm": 0.9609375, "learning_rate": 0.0004995462621846279, "loss": 6.7852, "mean_token_accuracy": 0.10933116525411606, "num_tokens": 6233712.0, "step": 2870 }, { "entropy": 6.854152202606201, "epoch": 0.30766761196425707, "grad_norm": 1.1171875, "learning_rate": 0.0004995438320553871, "loss": 6.8534, "mean_token_accuracy": 0.10412434935569763, "num_tokens": 6244254.0, "step": 2875 }, { "entropy": 6.823256492614746, "epoch": 0.30820268607202095, "grad_norm": 1.2265625, "learning_rate": 0.0004995413954424748, "loss": 6.7504, "mean_token_accuracy": 0.116096231341362, "num_tokens": 6254202.0, "step": 2880 }, { "entropy": 6.877709770202637, "epoch": 0.3087377601797849, "grad_norm": 1.140625, "learning_rate": 0.0004995389523459612, "loss": 6.8231, "mean_token_accuracy": 0.10538254305720329, "num_tokens": 6264496.0, "step": 2885 }, { "entropy": 6.839356851577759, "epoch": 0.3092728342875488, "grad_norm": 1.078125, "learning_rate": 0.000499536502765917, "loss": 6.828, "mean_token_accuracy": 0.1125398851931095, "num_tokens": 6275835.0, "step": 2890 }, { "entropy": 6.893553924560547, "epoch": 0.30980790839531275, "grad_norm": 1.2421875, "learning_rate": 0.0004995340467024128, "loss": 6.7842, "mean_token_accuracy": 0.10834744572639465, "num_tokens": 6286805.0, "step": 2895 }, { "entropy": 6.906386661529541, "epoch": 0.3103429825030767, "grad_norm": 0.984375, "learning_rate": 0.0004995315841555195, "loss": 6.7916, "mean_token_accuracy": 0.10366136953234673, "num_tokens": 6298444.0, "step": 2900 }, { "entropy": 6.783759641647339, "epoch": 0.3108780566108406, "grad_norm": 1.1015625, "learning_rate": 0.0004995291151253083, "loss": 6.7348, "mean_token_accuracy": 0.11380124613642692, "num_tokens": 6308259.0, "step": 2905 }, { "entropy": 6.846135902404785, "epoch": 0.31141313071860455, "grad_norm": 1.0234375, "learning_rate": 0.0004995266396118505, "loss": 6.8013, "mean_token_accuracy": 0.10161566883325576, "num_tokens": 6320058.0, "step": 2910 }, { "entropy": 6.900366973876953, "epoch": 0.3119482048263684, "grad_norm": 0.9140625, "learning_rate": 0.0004995241576152174, "loss": 6.7723, "mean_token_accuracy": 0.10676236972212791, "num_tokens": 6331203.0, "step": 2915 }, { "entropy": 6.897499227523804, "epoch": 0.31248327893413236, "grad_norm": 1.078125, "learning_rate": 0.000499521669135481, "loss": 6.8882, "mean_token_accuracy": 0.10588050186634064, "num_tokens": 6342027.0, "step": 2920 }, { "entropy": 6.894981956481933, "epoch": 0.3130183530418963, "grad_norm": 1.015625, "learning_rate": 0.0004995191741727128, "loss": 6.7873, "mean_token_accuracy": 0.10809844583272935, "num_tokens": 6352580.0, "step": 2925 }, { "entropy": 6.887385463714599, "epoch": 0.3135534271496602, "grad_norm": 0.94140625, "learning_rate": 0.000499516672726985, "loss": 6.8106, "mean_token_accuracy": 0.11217835023999215, "num_tokens": 6363997.0, "step": 2930 }, { "entropy": 6.83791708946228, "epoch": 0.31408850125742416, "grad_norm": 0.98046875, "learning_rate": 0.0004995141647983699, "loss": 6.8464, "mean_token_accuracy": 0.11019290536642075, "num_tokens": 6375284.0, "step": 2935 }, { "entropy": 6.8710222244262695, "epoch": 0.3146235753651881, "grad_norm": 0.984375, "learning_rate": 0.0004995116503869398, "loss": 6.7437, "mean_token_accuracy": 0.11758178621530532, "num_tokens": 6386698.0, "step": 2940 }, { "entropy": 6.864429473876953, "epoch": 0.315158649472952, "grad_norm": 1.3203125, "learning_rate": 0.0004995091294927673, "loss": 6.818, "mean_token_accuracy": 0.10886727124452591, "num_tokens": 6397237.0, "step": 2945 }, { "entropy": 6.973788785934448, "epoch": 0.3156937235807159, "grad_norm": 1.0, "learning_rate": 0.0004995066021159253, "loss": 6.9364, "mean_token_accuracy": 0.10483678579330444, "num_tokens": 6408266.0, "step": 2950 }, { "entropy": 6.842577266693115, "epoch": 0.31622879768847983, "grad_norm": 1.0546875, "learning_rate": 0.0004995040682564867, "loss": 6.8199, "mean_token_accuracy": 0.11405593305826187, "num_tokens": 6419563.0, "step": 2955 }, { "entropy": 6.8359404563903805, "epoch": 0.31676387179624377, "grad_norm": 1.0078125, "learning_rate": 0.0004995015279145247, "loss": 6.7863, "mean_token_accuracy": 0.11180907115340233, "num_tokens": 6430220.0, "step": 2960 }, { "entropy": 6.857833385467529, "epoch": 0.3172989459040077, "grad_norm": 1.1015625, "learning_rate": 0.0004994989810901126, "loss": 6.7961, "mean_token_accuracy": 0.10685641467571258, "num_tokens": 6440157.0, "step": 2965 }, { "entropy": 6.856301593780517, "epoch": 0.31783402001177163, "grad_norm": 1.1484375, "learning_rate": 0.0004994964277833239, "loss": 6.8463, "mean_token_accuracy": 0.11110184714198112, "num_tokens": 6449511.0, "step": 2970 }, { "entropy": 6.923713493347168, "epoch": 0.31836909411953557, "grad_norm": 0.9765625, "learning_rate": 0.0004994938679942324, "loss": 6.8365, "mean_token_accuracy": 0.10282818749547004, "num_tokens": 6460608.0, "step": 2975 }, { "entropy": 6.919619989395142, "epoch": 0.3189041682272995, "grad_norm": 1.046875, "learning_rate": 0.0004994913017229121, "loss": 6.8372, "mean_token_accuracy": 0.1131968080997467, "num_tokens": 6472737.0, "step": 2980 }, { "entropy": 6.817192554473877, "epoch": 0.31943924233506343, "grad_norm": 1.0703125, "learning_rate": 0.0004994887289694371, "loss": 6.7184, "mean_token_accuracy": 0.11385754495859146, "num_tokens": 6482993.0, "step": 2985 }, { "entropy": 6.960534572601318, "epoch": 0.3199743164428273, "grad_norm": 1.078125, "learning_rate": 0.0004994861497338814, "loss": 6.9207, "mean_token_accuracy": 0.11038238108158112, "num_tokens": 6494530.0, "step": 2990 }, { "entropy": 6.894915056228638, "epoch": 0.32050939055059124, "grad_norm": 1.0703125, "learning_rate": 0.0004994835640163198, "loss": 6.7626, "mean_token_accuracy": 0.10633266866207122, "num_tokens": 6504691.0, "step": 2995 }, { "entropy": 6.885722494125366, "epoch": 0.3210444646583552, "grad_norm": 1.0859375, "learning_rate": 0.0004994809718168267, "loss": 6.7865, "mean_token_accuracy": 0.10957603380084038, "num_tokens": 6514924.0, "step": 3000 }, { "epoch": 0.3210444646583552, "eval_entropy": 6.6982880289021205, "eval_loss": 6.9056596755981445, "eval_mean_token_accuracy": 0.11213191206946045, "eval_num_tokens": 6514924.0, "eval_runtime": 22.6381, "eval_samples_per_second": 1311.022, "eval_steps_per_second": 163.883, "step": 3000 }, { "entropy": 6.774571943283081, "epoch": 0.3215795387661191, "grad_norm": 1.0703125, "learning_rate": 0.0004994783731354771, "loss": 6.7524, "mean_token_accuracy": 0.11166785731911659, "num_tokens": 6526097.0, "step": 3005 }, { "entropy": 6.929418516159058, "epoch": 0.32211461287388304, "grad_norm": 1.0625, "learning_rate": 0.0004994757679723461, "loss": 6.8149, "mean_token_accuracy": 0.10639956593513489, "num_tokens": 6536384.0, "step": 3010 }, { "entropy": 6.919300746917725, "epoch": 0.322649686981647, "grad_norm": 1.0546875, "learning_rate": 0.0004994731563275088, "loss": 6.8694, "mean_token_accuracy": 0.1046457588672638, "num_tokens": 6547161.0, "step": 3015 }, { "entropy": 6.785147857666016, "epoch": 0.3231847610894109, "grad_norm": 1.046875, "learning_rate": 0.0004994705382010406, "loss": 6.7936, "mean_token_accuracy": 0.10720081478357316, "num_tokens": 6556751.0, "step": 3020 }, { "entropy": 6.861992263793946, "epoch": 0.3237198351971748, "grad_norm": 1.109375, "learning_rate": 0.0004994679135930174, "loss": 6.8486, "mean_token_accuracy": 0.1134506493806839, "num_tokens": 6567655.0, "step": 3025 }, { "entropy": 6.987712669372558, "epoch": 0.3242549093049387, "grad_norm": 1.1484375, "learning_rate": 0.0004994652825035144, "loss": 6.8797, "mean_token_accuracy": 0.10770419910550118, "num_tokens": 6579127.0, "step": 3030 }, { "entropy": 6.9072469711303714, "epoch": 0.32478998341270265, "grad_norm": 1.265625, "learning_rate": 0.0004994626449326081, "loss": 6.8376, "mean_token_accuracy": 0.11200311556458473, "num_tokens": 6590779.0, "step": 3035 }, { "entropy": 6.858027362823487, "epoch": 0.3253250575204666, "grad_norm": 1.09375, "learning_rate": 0.0004994600008803745, "loss": 6.7456, "mean_token_accuracy": 0.11969574466347695, "num_tokens": 6600849.0, "step": 3040 }, { "entropy": 6.831806564331055, "epoch": 0.3258601316282305, "grad_norm": 1.09375, "learning_rate": 0.0004994573503468899, "loss": 6.7547, "mean_token_accuracy": 0.11736322343349456, "num_tokens": 6610633.0, "step": 3045 }, { "entropy": 6.787566423416138, "epoch": 0.32639520573599445, "grad_norm": 0.953125, "learning_rate": 0.0004994546933322308, "loss": 6.7953, "mean_token_accuracy": 0.10811478719115257, "num_tokens": 6621327.0, "step": 3050 }, { "entropy": 6.93750228881836, "epoch": 0.3269302798437584, "grad_norm": 0.984375, "learning_rate": 0.000499452029836474, "loss": 6.7415, "mean_token_accuracy": 0.11278096809983254, "num_tokens": 6632267.0, "step": 3055 }, { "entropy": 6.810693454742432, "epoch": 0.32746535395152226, "grad_norm": 1.1796875, "learning_rate": 0.0004994493598596963, "loss": 6.7705, "mean_token_accuracy": 0.10761533975601197, "num_tokens": 6642714.0, "step": 3060 }, { "entropy": 6.849345254898071, "epoch": 0.3280004280592862, "grad_norm": 1.078125, "learning_rate": 0.0004994466834019749, "loss": 6.7758, "mean_token_accuracy": 0.11640546843409538, "num_tokens": 6652353.0, "step": 3065 }, { "entropy": 6.842514944076538, "epoch": 0.32853550216705013, "grad_norm": 1.0859375, "learning_rate": 0.0004994440004633871, "loss": 6.7517, "mean_token_accuracy": 0.11130421757698059, "num_tokens": 6663133.0, "step": 3070 }, { "entropy": 6.801913261413574, "epoch": 0.32907057627481406, "grad_norm": 1.1953125, "learning_rate": 0.0004994413110440103, "loss": 6.7354, "mean_token_accuracy": 0.11714180111885071, "num_tokens": 6673984.0, "step": 3075 }, { "entropy": 6.8637457370758055, "epoch": 0.329605650382578, "grad_norm": 0.875, "learning_rate": 0.0004994386151439222, "loss": 6.8076, "mean_token_accuracy": 0.1080280676484108, "num_tokens": 6686171.0, "step": 3080 }, { "entropy": 6.933955192565918, "epoch": 0.33014072449034193, "grad_norm": 1.109375, "learning_rate": 0.0004994359127632006, "loss": 6.8475, "mean_token_accuracy": 0.10514529719948769, "num_tokens": 6696609.0, "step": 3085 }, { "entropy": 6.89633002281189, "epoch": 0.33067579859810586, "grad_norm": 1.1875, "learning_rate": 0.0004994332039019235, "loss": 6.7854, "mean_token_accuracy": 0.11049062609672547, "num_tokens": 6706188.0, "step": 3090 }, { "entropy": 6.708978939056396, "epoch": 0.33121087270586974, "grad_norm": 1.125, "learning_rate": 0.0004994304885601694, "loss": 6.7667, "mean_token_accuracy": 0.11125922203063965, "num_tokens": 6716276.0, "step": 3095 }, { "entropy": 6.774325132369995, "epoch": 0.3317459468136337, "grad_norm": 1.2890625, "learning_rate": 0.0004994277667380162, "loss": 6.737, "mean_token_accuracy": 0.1192335270345211, "num_tokens": 6727176.0, "step": 3100 }, { "entropy": 6.887723302841186, "epoch": 0.3322810209213976, "grad_norm": 1.1171875, "learning_rate": 0.0004994250384355429, "loss": 6.8119, "mean_token_accuracy": 0.11386096626520156, "num_tokens": 6737768.0, "step": 3105 }, { "entropy": 6.840688323974609, "epoch": 0.33281609502916154, "grad_norm": 6.46875, "learning_rate": 0.0004994223036528282, "loss": 6.7618, "mean_token_accuracy": 0.11079908534884453, "num_tokens": 6747962.0, "step": 3110 }, { "entropy": 6.8406102657318115, "epoch": 0.3333511691369255, "grad_norm": 1.1171875, "learning_rate": 0.000499419562389951, "loss": 6.7548, "mean_token_accuracy": 0.1147709958255291, "num_tokens": 6758400.0, "step": 3115 }, { "entropy": 6.851141119003296, "epoch": 0.3338862432446894, "grad_norm": 1.0390625, "learning_rate": 0.0004994168146469904, "loss": 6.7693, "mean_token_accuracy": 0.11088330820202827, "num_tokens": 6768855.0, "step": 3120 }, { "entropy": 6.863172101974487, "epoch": 0.33442131735245334, "grad_norm": 1.0234375, "learning_rate": 0.0004994140604240259, "loss": 6.7514, "mean_token_accuracy": 0.1078583225607872, "num_tokens": 6778656.0, "step": 3125 }, { "entropy": 6.882100915908813, "epoch": 0.3349563914602172, "grad_norm": 0.98046875, "learning_rate": 0.0004994112997211369, "loss": 6.8182, "mean_token_accuracy": 0.11499066054821014, "num_tokens": 6789960.0, "step": 3130 }, { "entropy": 6.730247640609742, "epoch": 0.33549146556798115, "grad_norm": 1.1875, "learning_rate": 0.0004994085325384031, "loss": 6.8076, "mean_token_accuracy": 0.10851202681660652, "num_tokens": 6800188.0, "step": 3135 }, { "entropy": 6.906764650344849, "epoch": 0.3360265396757451, "grad_norm": 1.0546875, "learning_rate": 0.0004994057588759045, "loss": 6.7393, "mean_token_accuracy": 0.11358117088675498, "num_tokens": 6811032.0, "step": 3140 }, { "entropy": 6.824139022827149, "epoch": 0.336561613783509, "grad_norm": 1.0625, "learning_rate": 0.0004994029787337212, "loss": 6.7666, "mean_token_accuracy": 0.10829171538352966, "num_tokens": 6823060.0, "step": 3145 }, { "entropy": 6.8112482070922855, "epoch": 0.33709668789127295, "grad_norm": 1.0703125, "learning_rate": 0.0004994001921119333, "loss": 6.8496, "mean_token_accuracy": 0.10913093164563178, "num_tokens": 6833559.0, "step": 3150 }, { "entropy": 6.894295167922974, "epoch": 0.3376317619990369, "grad_norm": 1.1171875, "learning_rate": 0.0004993973990106215, "loss": 6.7974, "mean_token_accuracy": 0.11234046593308449, "num_tokens": 6843657.0, "step": 3155 }, { "entropy": 6.814738702774048, "epoch": 0.3381668361068008, "grad_norm": 1.1171875, "learning_rate": 0.0004993945994298662, "loss": 6.7267, "mean_token_accuracy": 0.10636094883084297, "num_tokens": 6853615.0, "step": 3160 }, { "entropy": 6.858942174911499, "epoch": 0.3387019102145647, "grad_norm": 1.03125, "learning_rate": 0.0004993917933697484, "loss": 6.8354, "mean_token_accuracy": 0.10942788496613502, "num_tokens": 6865256.0, "step": 3165 }, { "entropy": 7.015973472595215, "epoch": 0.3392369843223286, "grad_norm": 1.1171875, "learning_rate": 0.0004993889808303493, "loss": 6.8711, "mean_token_accuracy": 0.11036419197916984, "num_tokens": 6875358.0, "step": 3170 }, { "entropy": 6.757581901550293, "epoch": 0.33977205843009256, "grad_norm": 1.015625, "learning_rate": 0.0004993861618117498, "loss": 6.7711, "mean_token_accuracy": 0.1102716788649559, "num_tokens": 6886584.0, "step": 3175 }, { "entropy": 6.8233020305633545, "epoch": 0.3403071325378565, "grad_norm": 1.0546875, "learning_rate": 0.0004993833363140314, "loss": 6.7109, "mean_token_accuracy": 0.11896613985300064, "num_tokens": 6896958.0, "step": 3180 }, { "entropy": 6.830180215835571, "epoch": 0.3408422066456204, "grad_norm": 1.03125, "learning_rate": 0.0004993805043372756, "loss": 6.775, "mean_token_accuracy": 0.1163598895072937, "num_tokens": 6907944.0, "step": 3185 }, { "entropy": 6.831008625030518, "epoch": 0.34137728075338436, "grad_norm": 1.0078125, "learning_rate": 0.0004993776658815644, "loss": 6.8739, "mean_token_accuracy": 0.1049034409224987, "num_tokens": 6919486.0, "step": 3190 }, { "entropy": 6.957132577896118, "epoch": 0.3419123548611483, "grad_norm": 1.2578125, "learning_rate": 0.0004993748209469796, "loss": 6.8414, "mean_token_accuracy": 0.11248302012681961, "num_tokens": 6930650.0, "step": 3195 }, { "entropy": 6.833132362365722, "epoch": 0.34244742896891217, "grad_norm": 1.015625, "learning_rate": 0.0004993719695336033, "loss": 6.7926, "mean_token_accuracy": 0.11160960346460343, "num_tokens": 6941519.0, "step": 3200 }, { "entropy": 6.775629329681396, "epoch": 0.3429825030766761, "grad_norm": 1.5078125, "learning_rate": 0.0004993691116415179, "loss": 6.8265, "mean_token_accuracy": 0.10980288833379745, "num_tokens": 6952952.0, "step": 3205 }, { "entropy": 6.945135641098022, "epoch": 0.34351757718444004, "grad_norm": 1.0078125, "learning_rate": 0.000499366247270806, "loss": 6.7907, "mean_token_accuracy": 0.11398276537656785, "num_tokens": 6962867.0, "step": 3210 }, { "entropy": 6.850128173828125, "epoch": 0.34405265129220397, "grad_norm": 1.0546875, "learning_rate": 0.0004993633764215502, "loss": 6.7128, "mean_token_accuracy": 0.1149346224963665, "num_tokens": 6973434.0, "step": 3215 }, { "entropy": 6.805971765518189, "epoch": 0.3445877253999679, "grad_norm": 1.125, "learning_rate": 0.0004993604990938336, "loss": 6.7242, "mean_token_accuracy": 0.12372536882758141, "num_tokens": 6984161.0, "step": 3220 }, { "entropy": 6.831466388702393, "epoch": 0.34512279950773184, "grad_norm": 1.078125, "learning_rate": 0.0004993576152877389, "loss": 6.7023, "mean_token_accuracy": 0.11155548840761184, "num_tokens": 6994700.0, "step": 3225 }, { "entropy": 6.859937858581543, "epoch": 0.34565787361549577, "grad_norm": 1.0859375, "learning_rate": 0.0004993547250033496, "loss": 6.8702, "mean_token_accuracy": 0.10222596898674965, "num_tokens": 7006497.0, "step": 3230 }, { "entropy": 6.907996559143067, "epoch": 0.34619294772325965, "grad_norm": 1.0703125, "learning_rate": 0.0004993518282407493, "loss": 6.7762, "mean_token_accuracy": 0.11640164703130722, "num_tokens": 7016415.0, "step": 3235 }, { "entropy": 6.780554246902466, "epoch": 0.3467280218310236, "grad_norm": 1.2109375, "learning_rate": 0.0004993489250000213, "loss": 6.7293, "mean_token_accuracy": 0.11351820677518845, "num_tokens": 7026610.0, "step": 3240 }, { "entropy": 6.797022676467895, "epoch": 0.3472630959387875, "grad_norm": 1.0390625, "learning_rate": 0.0004993460152812497, "loss": 6.7409, "mean_token_accuracy": 0.11043249741196633, "num_tokens": 7038236.0, "step": 3245 }, { "entropy": 6.871045017242432, "epoch": 0.34779817004655145, "grad_norm": 1.140625, "learning_rate": 0.0004993430990845184, "loss": 6.7892, "mean_token_accuracy": 0.12099697217345237, "num_tokens": 7049438.0, "step": 3250 }, { "entropy": 6.795158195495605, "epoch": 0.3483332441543154, "grad_norm": 1.0859375, "learning_rate": 0.0004993401764099118, "loss": 6.75, "mean_token_accuracy": 0.10678878873586654, "num_tokens": 7061001.0, "step": 3255 }, { "entropy": 6.869133567810058, "epoch": 0.3488683182620793, "grad_norm": 1.09375, "learning_rate": 0.0004993372472575139, "loss": 6.7464, "mean_token_accuracy": 0.11511967554688454, "num_tokens": 7071328.0, "step": 3260 }, { "entropy": 6.9016501903533936, "epoch": 0.34940339236984325, "grad_norm": 1.140625, "learning_rate": 0.0004993343116274096, "loss": 6.93, "mean_token_accuracy": 0.10523641705513001, "num_tokens": 7082597.0, "step": 3265 }, { "entropy": 6.860869073867798, "epoch": 0.3499384664776071, "grad_norm": 1.0390625, "learning_rate": 0.0004993313695196836, "loss": 6.759, "mean_token_accuracy": 0.116279286891222, "num_tokens": 7093463.0, "step": 3270 }, { "entropy": 6.816839218139648, "epoch": 0.35047354058537106, "grad_norm": 0.984375, "learning_rate": 0.0004993284209344208, "loss": 6.8225, "mean_token_accuracy": 0.11397869065403939, "num_tokens": 7104350.0, "step": 3275 }, { "entropy": 6.929663181304932, "epoch": 0.351008614693135, "grad_norm": 1.2265625, "learning_rate": 0.0004993254658717065, "loss": 6.78, "mean_token_accuracy": 0.11524501666426659, "num_tokens": 7114851.0, "step": 3280 }, { "entropy": 6.865924549102783, "epoch": 0.3515436888008989, "grad_norm": 1.078125, "learning_rate": 0.0004993225043316257, "loss": 6.8189, "mean_token_accuracy": 0.10788183063268661, "num_tokens": 7126440.0, "step": 3285 }, { "entropy": 6.94174747467041, "epoch": 0.35207876290866286, "grad_norm": 1.125, "learning_rate": 0.0004993195363142643, "loss": 6.8435, "mean_token_accuracy": 0.10635844394564628, "num_tokens": 7137884.0, "step": 3290 }, { "entropy": 6.8471081256866455, "epoch": 0.3526138370164268, "grad_norm": 1.2265625, "learning_rate": 0.0004993165618197076, "loss": 6.8169, "mean_token_accuracy": 0.10543133914470673, "num_tokens": 7147930.0, "step": 3295 }, { "entropy": 6.814928293228149, "epoch": 0.3531489111241907, "grad_norm": 1.0078125, "learning_rate": 0.0004993135808480418, "loss": 6.6758, "mean_token_accuracy": 0.12192264795303345, "num_tokens": 7159200.0, "step": 3300 }, { "entropy": 6.856072282791137, "epoch": 0.3536839852319546, "grad_norm": 1.0625, "learning_rate": 0.0004993105933993529, "loss": 6.7738, "mean_token_accuracy": 0.11219395026564598, "num_tokens": 7169601.0, "step": 3305 }, { "entropy": 6.731938648223877, "epoch": 0.35421905933971853, "grad_norm": 1.0546875, "learning_rate": 0.0004993075994737271, "loss": 6.7014, "mean_token_accuracy": 0.12335732132196427, "num_tokens": 7180465.0, "step": 3310 }, { "entropy": 6.827739572525024, "epoch": 0.35475413344748247, "grad_norm": 1.0625, "learning_rate": 0.0004993045990712508, "loss": 6.7214, "mean_token_accuracy": 0.1124566912651062, "num_tokens": 7190603.0, "step": 3315 }, { "entropy": 6.744693279266357, "epoch": 0.3552892075552464, "grad_norm": 1.015625, "learning_rate": 0.0004993015921920109, "loss": 6.6822, "mean_token_accuracy": 0.1178012415766716, "num_tokens": 7201017.0, "step": 3320 }, { "entropy": 6.700474643707276, "epoch": 0.35582428166301033, "grad_norm": 1.109375, "learning_rate": 0.000499298578836094, "loss": 6.6851, "mean_token_accuracy": 0.11364478841423989, "num_tokens": 7210908.0, "step": 3325 }, { "entropy": 6.913705682754516, "epoch": 0.35635935577077427, "grad_norm": 1.078125, "learning_rate": 0.000499295559003587, "loss": 6.7313, "mean_token_accuracy": 0.11469347327947617, "num_tokens": 7221306.0, "step": 3330 }, { "entropy": 6.857224035263061, "epoch": 0.3568944298785382, "grad_norm": 0.984375, "learning_rate": 0.0004992925326945774, "loss": 6.8446, "mean_token_accuracy": 0.11008940190076828, "num_tokens": 7233076.0, "step": 3335 }, { "entropy": 6.836943006515503, "epoch": 0.3574295039863021, "grad_norm": 1.1875, "learning_rate": 0.0004992894999091524, "loss": 6.833, "mean_token_accuracy": 0.11023118868470191, "num_tokens": 7244703.0, "step": 3340 }, { "entropy": 6.865760707855225, "epoch": 0.357964578094066, "grad_norm": 1.0546875, "learning_rate": 0.0004992864606473996, "loss": 6.8127, "mean_token_accuracy": 0.10562887638807297, "num_tokens": 7255438.0, "step": 3345 }, { "entropy": 6.873836708068848, "epoch": 0.35849965220182994, "grad_norm": 1.1171875, "learning_rate": 0.0004992834149094069, "loss": 6.7746, "mean_token_accuracy": 0.10823791846632957, "num_tokens": 7265720.0, "step": 3350 }, { "entropy": 6.854056453704834, "epoch": 0.3590347263095939, "grad_norm": 1.0625, "learning_rate": 0.0004992803626952619, "loss": 6.8105, "mean_token_accuracy": 0.10965728536248207, "num_tokens": 7277791.0, "step": 3355 }, { "entropy": 6.743177652359009, "epoch": 0.3595698004173578, "grad_norm": 1.0625, "learning_rate": 0.000499277304005053, "loss": 6.6904, "mean_token_accuracy": 0.11896344646811485, "num_tokens": 7288521.0, "step": 3360 }, { "entropy": 6.8449372291564945, "epoch": 0.36010487452512174, "grad_norm": 1.03125, "learning_rate": 0.0004992742388388686, "loss": 6.8681, "mean_token_accuracy": 0.10312251970171929, "num_tokens": 7299298.0, "step": 3365 }, { "entropy": 6.848871850967408, "epoch": 0.3606399486328857, "grad_norm": 1.0390625, "learning_rate": 0.0004992711671967968, "loss": 6.6907, "mean_token_accuracy": 0.11500442028045654, "num_tokens": 7310271.0, "step": 3370 }, { "entropy": 6.832868242263794, "epoch": 0.36117502274064955, "grad_norm": 1.046875, "learning_rate": 0.0004992680890789268, "loss": 6.7535, "mean_token_accuracy": 0.11115506291389465, "num_tokens": 7321112.0, "step": 3375 }, { "entropy": 6.744096136093139, "epoch": 0.3617100968484135, "grad_norm": 1.125, "learning_rate": 0.0004992650044853471, "loss": 6.7111, "mean_token_accuracy": 0.11423057690262794, "num_tokens": 7331976.0, "step": 3380 }, { "entropy": 6.881365203857422, "epoch": 0.3622451709561774, "grad_norm": 1.15625, "learning_rate": 0.000499261913416147, "loss": 6.8157, "mean_token_accuracy": 0.11083743125200271, "num_tokens": 7342800.0, "step": 3385 }, { "entropy": 6.820743465423584, "epoch": 0.36278024506394135, "grad_norm": 0.98046875, "learning_rate": 0.0004992588158714157, "loss": 6.6508, "mean_token_accuracy": 0.11105694174766541, "num_tokens": 7354213.0, "step": 3390 }, { "entropy": 6.789371490478516, "epoch": 0.3633153191717053, "grad_norm": 1.1328125, "learning_rate": 0.0004992557118512424, "loss": 6.7069, "mean_token_accuracy": 0.11869031190872192, "num_tokens": 7363250.0, "step": 3395 }, { "entropy": 6.7624798774719235, "epoch": 0.3638503932794692, "grad_norm": 1.078125, "learning_rate": 0.0004992526013557171, "loss": 6.7605, "mean_token_accuracy": 0.11203641667962075, "num_tokens": 7374185.0, "step": 3400 }, { "entropy": 6.752663087844849, "epoch": 0.36438546738723315, "grad_norm": 1.0703125, "learning_rate": 0.0004992494843849294, "loss": 6.7287, "mean_token_accuracy": 0.10924962237477302, "num_tokens": 7384579.0, "step": 3405 }, { "entropy": 6.896695327758789, "epoch": 0.36492054149499703, "grad_norm": 1.1171875, "learning_rate": 0.0004992463609389694, "loss": 6.7422, "mean_token_accuracy": 0.10970545783638955, "num_tokens": 7395277.0, "step": 3410 }, { "entropy": 6.726968002319336, "epoch": 0.36545561560276096, "grad_norm": 1.0078125, "learning_rate": 0.0004992432310179272, "loss": 6.7332, "mean_token_accuracy": 0.1160312682390213, "num_tokens": 7406688.0, "step": 3415 }, { "entropy": 6.766181993484497, "epoch": 0.3659906897105249, "grad_norm": 0.99609375, "learning_rate": 0.0004992400946218932, "loss": 6.795, "mean_token_accuracy": 0.11444359049201011, "num_tokens": 7417378.0, "step": 3420 }, { "entropy": 6.967504692077637, "epoch": 0.36652576381828883, "grad_norm": 1.046875, "learning_rate": 0.0004992369517509581, "loss": 6.8179, "mean_token_accuracy": 0.1145808644592762, "num_tokens": 7427675.0, "step": 3425 }, { "entropy": 6.834393882751465, "epoch": 0.36706083792605276, "grad_norm": 1.0625, "learning_rate": 0.0004992338024052123, "loss": 6.8405, "mean_token_accuracy": 0.10944146141409875, "num_tokens": 7438083.0, "step": 3430 }, { "entropy": 6.772138452529907, "epoch": 0.3675959120338167, "grad_norm": 1.0859375, "learning_rate": 0.0004992306465847473, "loss": 6.6866, "mean_token_accuracy": 0.11544951871037483, "num_tokens": 7449051.0, "step": 3435 }, { "entropy": 6.803123044967651, "epoch": 0.36813098614158063, "grad_norm": 1.03125, "learning_rate": 0.0004992274842896536, "loss": 6.7313, "mean_token_accuracy": 0.11575418040156364, "num_tokens": 7459074.0, "step": 3440 }, { "entropy": 6.810998582839966, "epoch": 0.3686660602493445, "grad_norm": 1.0625, "learning_rate": 0.0004992243155200229, "loss": 6.7908, "mean_token_accuracy": 0.11545799896121026, "num_tokens": 7470472.0, "step": 3445 }, { "entropy": 6.810088348388672, "epoch": 0.36920113435710844, "grad_norm": 1.0, "learning_rate": 0.0004992211402759466, "loss": 6.7589, "mean_token_accuracy": 0.11591348797082901, "num_tokens": 7481477.0, "step": 3450 }, { "entropy": 6.811910390853882, "epoch": 0.3697362084648724, "grad_norm": 1.0390625, "learning_rate": 0.0004992179585575164, "loss": 6.7166, "mean_token_accuracy": 0.11710453182458877, "num_tokens": 7491906.0, "step": 3455 }, { "entropy": 6.801189374923706, "epoch": 0.3702712825726363, "grad_norm": 1.1328125, "learning_rate": 0.000499214770364824, "loss": 6.6567, "mean_token_accuracy": 0.10969180539250374, "num_tokens": 7502447.0, "step": 3460 }, { "entropy": 6.731618452072143, "epoch": 0.37080635668040024, "grad_norm": 1.1328125, "learning_rate": 0.0004992115756979617, "loss": 6.6488, "mean_token_accuracy": 0.12150704562664032, "num_tokens": 7513505.0, "step": 3465 }, { "entropy": 6.763904094696045, "epoch": 0.3713414307881642, "grad_norm": 1.0390625, "learning_rate": 0.0004992083745570218, "loss": 6.6731, "mean_token_accuracy": 0.11672577038407325, "num_tokens": 7524884.0, "step": 3470 }, { "entropy": 6.764589834213257, "epoch": 0.3718765048959281, "grad_norm": 1.078125, "learning_rate": 0.0004992051669420964, "loss": 6.7534, "mean_token_accuracy": 0.11659367606043816, "num_tokens": 7535942.0, "step": 3475 }, { "entropy": 6.77218713760376, "epoch": 0.372411579003692, "grad_norm": 1.0859375, "learning_rate": 0.0004992019528532785, "loss": 6.7354, "mean_token_accuracy": 0.12092937007546425, "num_tokens": 7545506.0, "step": 3480 }, { "entropy": 6.874322080612183, "epoch": 0.3729466531114559, "grad_norm": 1.25, "learning_rate": 0.0004991987322906605, "loss": 6.801, "mean_token_accuracy": 0.10959522724151612, "num_tokens": 7555328.0, "step": 3485 }, { "entropy": 6.811362361907959, "epoch": 0.37348172721921985, "grad_norm": 1.1640625, "learning_rate": 0.0004991955052543357, "loss": 6.6899, "mean_token_accuracy": 0.1134427696466446, "num_tokens": 7565762.0, "step": 3490 }, { "entropy": 6.830954933166504, "epoch": 0.3740168013269838, "grad_norm": 1.09375, "learning_rate": 0.0004991922717443972, "loss": 6.7216, "mean_token_accuracy": 0.12056689336895943, "num_tokens": 7575884.0, "step": 3495 }, { "entropy": 6.742701625823974, "epoch": 0.3745518754347477, "grad_norm": 1.046875, "learning_rate": 0.0004991890317609384, "loss": 6.7499, "mean_token_accuracy": 0.11369063630700112, "num_tokens": 7586100.0, "step": 3500 }, { "entropy": 6.859546327590943, "epoch": 0.37508694954251165, "grad_norm": 1.171875, "learning_rate": 0.0004991857853040528, "loss": 6.7591, "mean_token_accuracy": 0.11486376821994781, "num_tokens": 7597137.0, "step": 3505 }, { "entropy": 6.82744083404541, "epoch": 0.3756220236502756, "grad_norm": 1.0703125, "learning_rate": 0.0004991825323738341, "loss": 6.7932, "mean_token_accuracy": 0.11721144542098046, "num_tokens": 7607640.0, "step": 3510 }, { "entropy": 6.840407514572144, "epoch": 0.3761570977580395, "grad_norm": 1.1953125, "learning_rate": 0.0004991792729703763, "loss": 6.851, "mean_token_accuracy": 0.1160910353064537, "num_tokens": 7618319.0, "step": 3515 }, { "entropy": 6.877895498275757, "epoch": 0.3766921718658034, "grad_norm": 1.046875, "learning_rate": 0.0004991760070937734, "loss": 6.7208, "mean_token_accuracy": 0.11491079404950141, "num_tokens": 7628350.0, "step": 3520 }, { "entropy": 6.842350673675537, "epoch": 0.3772272459735673, "grad_norm": 1.203125, "learning_rate": 0.0004991727347441199, "loss": 6.7361, "mean_token_accuracy": 0.11011843830347061, "num_tokens": 7637857.0, "step": 3525 }, { "entropy": 6.858046007156372, "epoch": 0.37776232008133126, "grad_norm": 1.125, "learning_rate": 0.0004991694559215102, "loss": 6.7602, "mean_token_accuracy": 0.11095951348543168, "num_tokens": 7648242.0, "step": 3530 }, { "entropy": 6.830993270874023, "epoch": 0.3782973941890952, "grad_norm": 0.9453125, "learning_rate": 0.000499166170626039, "loss": 6.7743, "mean_token_accuracy": 0.10925297141075134, "num_tokens": 7660565.0, "step": 3535 }, { "entropy": 6.797787475585937, "epoch": 0.3788324682968591, "grad_norm": 1.21875, "learning_rate": 0.000499162878857801, "loss": 6.7711, "mean_token_accuracy": 0.1141252376139164, "num_tokens": 7671600.0, "step": 3540 }, { "entropy": 6.854355716705323, "epoch": 0.37936754240462306, "grad_norm": 1.03125, "learning_rate": 0.0004991595806168915, "loss": 6.7761, "mean_token_accuracy": 0.10867656469345092, "num_tokens": 7682453.0, "step": 3545 }, { "entropy": 6.801757192611694, "epoch": 0.379902616512387, "grad_norm": 1.0, "learning_rate": 0.0004991562759034055, "loss": 6.7221, "mean_token_accuracy": 0.11367509812116623, "num_tokens": 7693490.0, "step": 3550 }, { "entropy": 6.828986072540284, "epoch": 0.38043769062015087, "grad_norm": 1.0859375, "learning_rate": 0.0004991529647174386, "loss": 6.6761, "mean_token_accuracy": 0.1118717484176159, "num_tokens": 7703478.0, "step": 3555 }, { "entropy": 6.7392528533935545, "epoch": 0.3809727647279148, "grad_norm": 1.0859375, "learning_rate": 0.0004991496470590864, "loss": 6.7761, "mean_token_accuracy": 0.1103611208498478, "num_tokens": 7714647.0, "step": 3560 }, { "entropy": 6.863647413253784, "epoch": 0.38150783883567874, "grad_norm": 1.1015625, "learning_rate": 0.0004991463229284445, "loss": 6.7173, "mean_token_accuracy": 0.11717814281582832, "num_tokens": 7725528.0, "step": 3565 }, { "entropy": 6.771598768234253, "epoch": 0.38204291294344267, "grad_norm": 1.109375, "learning_rate": 0.0004991429923256091, "loss": 6.7756, "mean_token_accuracy": 0.11080185323953629, "num_tokens": 7737708.0, "step": 3570 }, { "entropy": 6.878248071670532, "epoch": 0.3825779870512066, "grad_norm": 1.015625, "learning_rate": 0.0004991396552506762, "loss": 6.764, "mean_token_accuracy": 0.11186526715755463, "num_tokens": 7749093.0, "step": 3575 }, { "entropy": 6.7422984600067135, "epoch": 0.38311306115897054, "grad_norm": 1.0546875, "learning_rate": 0.0004991363117037423, "loss": 6.7004, "mean_token_accuracy": 0.11901898533105851, "num_tokens": 7760024.0, "step": 3580 }, { "entropy": 6.767995119094849, "epoch": 0.38364813526673447, "grad_norm": 1.03125, "learning_rate": 0.0004991329616849039, "loss": 6.7284, "mean_token_accuracy": 0.11957356333732605, "num_tokens": 7770801.0, "step": 3585 }, { "entropy": 6.866620016098023, "epoch": 0.38418320937449835, "grad_norm": 1.046875, "learning_rate": 0.0004991296051942578, "loss": 6.7847, "mean_token_accuracy": 0.1116973415017128, "num_tokens": 7782257.0, "step": 3590 }, { "entropy": 6.763524389266967, "epoch": 0.3847182834822623, "grad_norm": 1.015625, "learning_rate": 0.0004991262422319008, "loss": 6.7091, "mean_token_accuracy": 0.11752377822995186, "num_tokens": 7793016.0, "step": 3595 }, { "entropy": 6.7549824714660645, "epoch": 0.3852533575900262, "grad_norm": 1.25, "learning_rate": 0.00049912287279793, "loss": 6.6492, "mean_token_accuracy": 0.1228921391069889, "num_tokens": 7802207.0, "step": 3600 }, { "entropy": 6.812817192077636, "epoch": 0.38578843169779015, "grad_norm": 1.171875, "learning_rate": 0.0004991194968924429, "loss": 6.7834, "mean_token_accuracy": 0.11178419142961502, "num_tokens": 7813487.0, "step": 3605 }, { "entropy": 6.858286571502686, "epoch": 0.3863235058055541, "grad_norm": 1.109375, "learning_rate": 0.0004991161145155367, "loss": 6.7563, "mean_token_accuracy": 0.11035445258021355, "num_tokens": 7824587.0, "step": 3610 }, { "entropy": 6.882280063629151, "epoch": 0.386858579913318, "grad_norm": 1.0625, "learning_rate": 0.0004991127256673091, "loss": 6.7368, "mean_token_accuracy": 0.11012360826134682, "num_tokens": 7836240.0, "step": 3615 }, { "entropy": 6.753285121917725, "epoch": 0.38739365402108195, "grad_norm": 1.15625, "learning_rate": 0.0004991093303478582, "loss": 6.6861, "mean_token_accuracy": 0.11604151576757431, "num_tokens": 7847014.0, "step": 3620 }, { "entropy": 6.788820505142212, "epoch": 0.3879287281288458, "grad_norm": 1.046875, "learning_rate": 0.0004991059285572818, "loss": 6.807, "mean_token_accuracy": 0.11351005062460899, "num_tokens": 7857899.0, "step": 3625 }, { "entropy": 6.857131767272949, "epoch": 0.38846380223660976, "grad_norm": 1.0234375, "learning_rate": 0.0004991025202956781, "loss": 6.6902, "mean_token_accuracy": 0.11639388576149941, "num_tokens": 7868987.0, "step": 3630 }, { "entropy": 6.850029611587525, "epoch": 0.3889988763443737, "grad_norm": 1.1875, "learning_rate": 0.0004990991055631457, "loss": 6.81, "mean_token_accuracy": 0.11189388036727906, "num_tokens": 7879547.0, "step": 3635 }, { "entropy": 6.762338304519654, "epoch": 0.3895339504521376, "grad_norm": 1.0625, "learning_rate": 0.0004990956843597832, "loss": 6.6763, "mean_token_accuracy": 0.1170013889670372, "num_tokens": 7889824.0, "step": 3640 }, { "entropy": 6.673375177383423, "epoch": 0.39006902455990156, "grad_norm": 1.1015625, "learning_rate": 0.0004990922566856892, "loss": 6.669, "mean_token_accuracy": 0.11331403329968452, "num_tokens": 7901156.0, "step": 3645 }, { "entropy": 6.770735454559326, "epoch": 0.3906040986676655, "grad_norm": 1.296875, "learning_rate": 0.0004990888225409629, "loss": 6.7076, "mean_token_accuracy": 0.11252901628613472, "num_tokens": 7911695.0, "step": 3650 }, { "entropy": 6.755655097961426, "epoch": 0.3911391727754294, "grad_norm": 0.984375, "learning_rate": 0.0004990853819257033, "loss": 6.7026, "mean_token_accuracy": 0.11720905601978301, "num_tokens": 7923559.0, "step": 3655 }, { "entropy": 6.84619779586792, "epoch": 0.3916742468831933, "grad_norm": 1.09375, "learning_rate": 0.0004990819348400097, "loss": 6.7214, "mean_token_accuracy": 0.11208191886544228, "num_tokens": 7935792.0, "step": 3660 }, { "entropy": 6.793423795700074, "epoch": 0.39220932099095723, "grad_norm": 1.359375, "learning_rate": 0.0004990784812839818, "loss": 6.7092, "mean_token_accuracy": 0.1186470128595829, "num_tokens": 7946987.0, "step": 3665 }, { "entropy": 6.699849939346313, "epoch": 0.39274439509872117, "grad_norm": 1.125, "learning_rate": 0.0004990750212577192, "loss": 6.6369, "mean_token_accuracy": 0.12066235840320587, "num_tokens": 7957160.0, "step": 3670 }, { "entropy": 6.781460571289062, "epoch": 0.3932794692064851, "grad_norm": 1.09375, "learning_rate": 0.0004990715547613219, "loss": 6.7333, "mean_token_accuracy": 0.10956480428576469, "num_tokens": 7968833.0, "step": 3675 }, { "entropy": 6.873096227645874, "epoch": 0.39381454331424903, "grad_norm": 0.9921875, "learning_rate": 0.0004990680817948898, "loss": 6.7822, "mean_token_accuracy": 0.10927629321813584, "num_tokens": 7980661.0, "step": 3680 }, { "entropy": 6.861059999465942, "epoch": 0.39434961742201297, "grad_norm": 1.1171875, "learning_rate": 0.0004990646023585234, "loss": 6.7065, "mean_token_accuracy": 0.11303527727723121, "num_tokens": 7992677.0, "step": 3685 }, { "entropy": 6.700655746459961, "epoch": 0.3948846915297769, "grad_norm": 1.125, "learning_rate": 0.0004990611164523231, "loss": 6.6919, "mean_token_accuracy": 0.1178669311106205, "num_tokens": 8002796.0, "step": 3690 }, { "entropy": 6.6995728492736815, "epoch": 0.3954197656375408, "grad_norm": 1.171875, "learning_rate": 0.0004990576240763896, "loss": 6.7181, "mean_token_accuracy": 0.11917829737067223, "num_tokens": 8012779.0, "step": 3695 }, { "entropy": 6.79206166267395, "epoch": 0.3959548397453047, "grad_norm": 1.015625, "learning_rate": 0.0004990541252308237, "loss": 6.6986, "mean_token_accuracy": 0.11830845102667809, "num_tokens": 8023442.0, "step": 3700 }, { "entropy": 6.777542209625244, "epoch": 0.39648991385306864, "grad_norm": 1.109375, "learning_rate": 0.0004990506199157263, "loss": 6.7844, "mean_token_accuracy": 0.11193263530731201, "num_tokens": 8035163.0, "step": 3705 }, { "entropy": 6.826216363906861, "epoch": 0.3970249879608326, "grad_norm": 1.1484375, "learning_rate": 0.0004990471081311988, "loss": 6.7221, "mean_token_accuracy": 0.11202551424503326, "num_tokens": 8045330.0, "step": 3710 }, { "entropy": 6.826126527786255, "epoch": 0.3975600620685965, "grad_norm": 0.9921875, "learning_rate": 0.0004990435898773426, "loss": 6.7341, "mean_token_accuracy": 0.11674164608120918, "num_tokens": 8056154.0, "step": 3715 }, { "entropy": 6.795881938934326, "epoch": 0.39809513617636044, "grad_norm": 1.015625, "learning_rate": 0.0004990400651542592, "loss": 6.6916, "mean_token_accuracy": 0.1208396390080452, "num_tokens": 8066101.0, "step": 3720 }, { "entropy": 6.82635269165039, "epoch": 0.3986302102841244, "grad_norm": 1.09375, "learning_rate": 0.0004990365339620504, "loss": 6.778, "mean_token_accuracy": 0.11029551848769188, "num_tokens": 8077249.0, "step": 3725 }, { "entropy": 6.791606903076172, "epoch": 0.39916528439188825, "grad_norm": 1.2734375, "learning_rate": 0.000499032996300818, "loss": 6.7108, "mean_token_accuracy": 0.11683286353945732, "num_tokens": 8088532.0, "step": 3730 }, { "entropy": 6.7761242389678955, "epoch": 0.3997003584996522, "grad_norm": 1.265625, "learning_rate": 0.0004990294521706645, "loss": 6.7513, "mean_token_accuracy": 0.11043450236320496, "num_tokens": 8099541.0, "step": 3735 }, { "entropy": 6.778212356567383, "epoch": 0.4002354326074161, "grad_norm": 1.0, "learning_rate": 0.000499025901571692, "loss": 6.7925, "mean_token_accuracy": 0.11460375785827637, "num_tokens": 8110532.0, "step": 3740 }, { "entropy": 6.860037422180175, "epoch": 0.40077050671518005, "grad_norm": 1.265625, "learning_rate": 0.0004990223445040031, "loss": 6.7246, "mean_token_accuracy": 0.12051974311470985, "num_tokens": 8120991.0, "step": 3745 }, { "entropy": 6.796218538284302, "epoch": 0.401305580822944, "grad_norm": 1.0390625, "learning_rate": 0.0004990187809677004, "loss": 6.6332, "mean_token_accuracy": 0.11498752385377883, "num_tokens": 8130737.0, "step": 3750 }, { "entropy": 6.687275981903076, "epoch": 0.4018406549307079, "grad_norm": 1.3203125, "learning_rate": 0.0004990152109628869, "loss": 6.6614, "mean_token_accuracy": 0.11621819585561752, "num_tokens": 8142315.0, "step": 3755 }, { "entropy": 6.747700786590576, "epoch": 0.40237572903847185, "grad_norm": 1.2734375, "learning_rate": 0.0004990116344896657, "loss": 6.7604, "mean_token_accuracy": 0.10932756140828133, "num_tokens": 8153618.0, "step": 3760 }, { "entropy": 6.786961269378662, "epoch": 0.40291080314623573, "grad_norm": 1.109375, "learning_rate": 0.00049900805154814, "loss": 6.6973, "mean_token_accuracy": 0.11853857338428497, "num_tokens": 8164304.0, "step": 3765 }, { "entropy": 6.784421157836914, "epoch": 0.40344587725399966, "grad_norm": 1.1328125, "learning_rate": 0.0004990044621384134, "loss": 6.694, "mean_token_accuracy": 0.11464422270655632, "num_tokens": 8175289.0, "step": 3770 }, { "entropy": 6.834812927246094, "epoch": 0.4039809513617636, "grad_norm": 1.125, "learning_rate": 0.0004990008662605893, "loss": 6.7375, "mean_token_accuracy": 0.11080463156104088, "num_tokens": 8186274.0, "step": 3775 }, { "entropy": 6.850270223617554, "epoch": 0.40451602546952753, "grad_norm": 1.1640625, "learning_rate": 0.0004989972639147717, "loss": 6.6819, "mean_token_accuracy": 0.11826486811041832, "num_tokens": 8196380.0, "step": 3780 }, { "entropy": 6.745476388931275, "epoch": 0.40505109957729146, "grad_norm": 1.15625, "learning_rate": 0.0004989936551010646, "loss": 6.7327, "mean_token_accuracy": 0.11468399837613105, "num_tokens": 8207204.0, "step": 3785 }, { "entropy": 6.715826034545898, "epoch": 0.4055861736850554, "grad_norm": 1.1796875, "learning_rate": 0.0004989900398195722, "loss": 6.6512, "mean_token_accuracy": 0.11534782201051712, "num_tokens": 8217745.0, "step": 3790 }, { "entropy": 6.774829626083374, "epoch": 0.40612124779281933, "grad_norm": 1.140625, "learning_rate": 0.0004989864180703988, "loss": 6.6424, "mean_token_accuracy": 0.11919590383768082, "num_tokens": 8228171.0, "step": 3795 }, { "entropy": 6.758113431930542, "epoch": 0.4066563219005832, "grad_norm": 1.2421875, "learning_rate": 0.0004989827898536491, "loss": 6.6973, "mean_token_accuracy": 0.11042807400226592, "num_tokens": 8239220.0, "step": 3800 }, { "entropy": 6.832132291793823, "epoch": 0.40719139600834714, "grad_norm": 1.1640625, "learning_rate": 0.0004989791551694279, "loss": 6.7518, "mean_token_accuracy": 0.109524205327034, "num_tokens": 8250363.0, "step": 3805 }, { "entropy": 6.776221656799317, "epoch": 0.4077264701161111, "grad_norm": 1.1171875, "learning_rate": 0.0004989755140178398, "loss": 6.7123, "mean_token_accuracy": 0.11326616704463958, "num_tokens": 8261207.0, "step": 3810 }, { "entropy": 6.741102790832519, "epoch": 0.408261544223875, "grad_norm": 1.109375, "learning_rate": 0.0004989718663989905, "loss": 6.6174, "mean_token_accuracy": 0.11389720663428307, "num_tokens": 8272343.0, "step": 3815 }, { "entropy": 6.711847400665283, "epoch": 0.40879661833163894, "grad_norm": 1.0625, "learning_rate": 0.0004989682123129849, "loss": 6.6662, "mean_token_accuracy": 0.11849249228835106, "num_tokens": 8282677.0, "step": 3820 }, { "entropy": 6.69567084312439, "epoch": 0.40933169243940287, "grad_norm": 1.03125, "learning_rate": 0.0004989645517599286, "loss": 6.6745, "mean_token_accuracy": 0.11427896246314048, "num_tokens": 8292753.0, "step": 3825 }, { "entropy": 6.774503755569458, "epoch": 0.4098667665471668, "grad_norm": 1.046875, "learning_rate": 0.0004989608847399275, "loss": 6.6625, "mean_token_accuracy": 0.11602176800370216, "num_tokens": 8302747.0, "step": 3830 }, { "entropy": 6.774828100204468, "epoch": 0.4104018406549307, "grad_norm": 1.0703125, "learning_rate": 0.0004989572112530871, "loss": 6.7446, "mean_token_accuracy": 0.10802446901798249, "num_tokens": 8314766.0, "step": 3835 }, { "entropy": 6.862928152084351, "epoch": 0.4109369147626946, "grad_norm": 1.0625, "learning_rate": 0.0004989535312995139, "loss": 6.7682, "mean_token_accuracy": 0.11004860624670983, "num_tokens": 8325791.0, "step": 3840 }, { "entropy": 6.746032285690307, "epoch": 0.41147198887045855, "grad_norm": 1.1328125, "learning_rate": 0.0004989498448793139, "loss": 6.6939, "mean_token_accuracy": 0.11601744443178177, "num_tokens": 8335809.0, "step": 3845 }, { "entropy": 6.742163610458374, "epoch": 0.4120070629782225, "grad_norm": 1.0546875, "learning_rate": 0.0004989461519925935, "loss": 6.6923, "mean_token_accuracy": 0.11100121140480042, "num_tokens": 8347505.0, "step": 3850 }, { "entropy": 6.8387268543243405, "epoch": 0.4125421370859864, "grad_norm": 1.0625, "learning_rate": 0.0004989424526394596, "loss": 6.7162, "mean_token_accuracy": 0.1083609253168106, "num_tokens": 8358363.0, "step": 3855 }, { "entropy": 6.726605081558228, "epoch": 0.41307721119375035, "grad_norm": 1.1015625, "learning_rate": 0.0004989387468200187, "loss": 6.7182, "mean_token_accuracy": 0.1165882483124733, "num_tokens": 8369076.0, "step": 3860 }, { "entropy": 6.849684762954712, "epoch": 0.4136122853015143, "grad_norm": 1.109375, "learning_rate": 0.000498935034534378, "loss": 6.7567, "mean_token_accuracy": 0.11488589569926262, "num_tokens": 8380071.0, "step": 3865 }, { "entropy": 6.779253625869751, "epoch": 0.41414735940927816, "grad_norm": 1.0703125, "learning_rate": 0.0004989313157826446, "loss": 6.7043, "mean_token_accuracy": 0.11365948691964149, "num_tokens": 8390574.0, "step": 3870 }, { "entropy": 6.762129831314087, "epoch": 0.4146824335170421, "grad_norm": 1.0859375, "learning_rate": 0.000498927590564926, "loss": 6.7016, "mean_token_accuracy": 0.11860018000006675, "num_tokens": 8401154.0, "step": 3875 }, { "entropy": 6.805259132385254, "epoch": 0.415217507624806, "grad_norm": 1.0546875, "learning_rate": 0.0004989238588813296, "loss": 6.7816, "mean_token_accuracy": 0.10864789858460426, "num_tokens": 8412113.0, "step": 3880 }, { "entropy": 6.893309640884399, "epoch": 0.41575258173256996, "grad_norm": 1.203125, "learning_rate": 0.0004989201207319634, "loss": 6.7582, "mean_token_accuracy": 0.11186528205871582, "num_tokens": 8422734.0, "step": 3885 }, { "entropy": 6.758945322036743, "epoch": 0.4162876558403339, "grad_norm": 1.125, "learning_rate": 0.0004989163761169351, "loss": 6.6912, "mean_token_accuracy": 0.11084168404340744, "num_tokens": 8433647.0, "step": 3890 }, { "entropy": 6.744187116622925, "epoch": 0.4168227299480978, "grad_norm": 1.203125, "learning_rate": 0.0004989126250363529, "loss": 6.7234, "mean_token_accuracy": 0.11423909962177277, "num_tokens": 8444726.0, "step": 3895 }, { "entropy": 6.83604621887207, "epoch": 0.41735780405586176, "grad_norm": 1.09375, "learning_rate": 0.0004989088674903251, "loss": 6.7264, "mean_token_accuracy": 0.11136697009205818, "num_tokens": 8455351.0, "step": 3900 }, { "entropy": 6.788657855987549, "epoch": 0.41789287816362564, "grad_norm": 1.0703125, "learning_rate": 0.0004989051034789602, "loss": 6.7073, "mean_token_accuracy": 0.11919761151075363, "num_tokens": 8466423.0, "step": 3905 }, { "entropy": 6.769079303741455, "epoch": 0.41842795227138957, "grad_norm": 1.28125, "learning_rate": 0.000498901333002367, "loss": 6.6522, "mean_token_accuracy": 0.11701465100049972, "num_tokens": 8475841.0, "step": 3910 }, { "entropy": 6.814233303070068, "epoch": 0.4189630263791535, "grad_norm": 1.03125, "learning_rate": 0.0004988975560606541, "loss": 6.762, "mean_token_accuracy": 0.11229455918073654, "num_tokens": 8487656.0, "step": 3915 }, { "entropy": 6.776022148132324, "epoch": 0.41949810048691744, "grad_norm": 1.1640625, "learning_rate": 0.0004988937726539308, "loss": 6.7744, "mean_token_accuracy": 0.10670395717024803, "num_tokens": 8497959.0, "step": 3920 }, { "entropy": 6.763610315322876, "epoch": 0.42003317459468137, "grad_norm": 1.078125, "learning_rate": 0.0004988899827823062, "loss": 6.6751, "mean_token_accuracy": 0.11493971273303032, "num_tokens": 8508228.0, "step": 3925 }, { "entropy": 6.782846927642822, "epoch": 0.4205682487024453, "grad_norm": 1.171875, "learning_rate": 0.00049888618644589, "loss": 6.7229, "mean_token_accuracy": 0.11063806042075157, "num_tokens": 8518999.0, "step": 3930 }, { "entropy": 6.691450452804565, "epoch": 0.42110332281020924, "grad_norm": 1.2265625, "learning_rate": 0.0004988823836447916, "loss": 6.7519, "mean_token_accuracy": 0.11179999187588692, "num_tokens": 8529583.0, "step": 3935 }, { "entropy": 6.894530963897705, "epoch": 0.4216383969179731, "grad_norm": 1.4609375, "learning_rate": 0.0004988785743791207, "loss": 6.8223, "mean_token_accuracy": 0.10763506144285202, "num_tokens": 8540069.0, "step": 3940 }, { "entropy": 6.875021266937256, "epoch": 0.42217347102573705, "grad_norm": 1.1953125, "learning_rate": 0.0004988747586489876, "loss": 6.7009, "mean_token_accuracy": 0.11498932242393493, "num_tokens": 8550441.0, "step": 3945 }, { "entropy": 6.709805822372436, "epoch": 0.422708545133501, "grad_norm": 1.0546875, "learning_rate": 0.000498870936454502, "loss": 6.6653, "mean_token_accuracy": 0.11834602132439613, "num_tokens": 8560257.0, "step": 3950 }, { "entropy": 6.828940343856812, "epoch": 0.4232436192412649, "grad_norm": 1.078125, "learning_rate": 0.0004988671077957749, "loss": 6.7485, "mean_token_accuracy": 0.1175241857767105, "num_tokens": 8570991.0, "step": 3955 }, { "entropy": 6.891437435150147, "epoch": 0.42377869334902885, "grad_norm": 1.609375, "learning_rate": 0.0004988632726729164, "loss": 6.8051, "mean_token_accuracy": 0.10697821751236916, "num_tokens": 8583668.0, "step": 3960 }, { "entropy": 6.802229166030884, "epoch": 0.4243137674567928, "grad_norm": 1.109375, "learning_rate": 0.0004988594310860374, "loss": 6.7184, "mean_token_accuracy": 0.1156295083463192, "num_tokens": 8593727.0, "step": 3965 }, { "entropy": 6.714612770080566, "epoch": 0.4248488415645567, "grad_norm": 1.0625, "learning_rate": 0.0004988555830352485, "loss": 6.7209, "mean_token_accuracy": 0.11398242264986039, "num_tokens": 8605470.0, "step": 3970 }, { "entropy": 6.7963508605957035, "epoch": 0.4253839156723206, "grad_norm": 1.0234375, "learning_rate": 0.0004988517285206614, "loss": 6.6687, "mean_token_accuracy": 0.11099848076701165, "num_tokens": 8617176.0, "step": 3975 }, { "entropy": 6.803634119033814, "epoch": 0.4259189897800845, "grad_norm": 1.0703125, "learning_rate": 0.0004988478675423871, "loss": 6.7558, "mean_token_accuracy": 0.11225240230560303, "num_tokens": 8627756.0, "step": 3980 }, { "entropy": 6.793984985351562, "epoch": 0.42645406388784846, "grad_norm": 1.234375, "learning_rate": 0.0004988440001005369, "loss": 6.6853, "mean_token_accuracy": 0.11842627823352814, "num_tokens": 8637766.0, "step": 3985 }, { "entropy": 6.800572538375855, "epoch": 0.4269891379956124, "grad_norm": 1.1640625, "learning_rate": 0.0004988401261952227, "loss": 6.7096, "mean_token_accuracy": 0.11486690863966942, "num_tokens": 8648562.0, "step": 3990 }, { "entropy": 6.808977746963501, "epoch": 0.4275242121033763, "grad_norm": 1.1875, "learning_rate": 0.0004988362458265565, "loss": 6.7412, "mean_token_accuracy": 0.10799469202756881, "num_tokens": 8658393.0, "step": 3995 }, { "entropy": 6.730482482910157, "epoch": 0.42805928621114026, "grad_norm": 1.125, "learning_rate": 0.0004988323589946499, "loss": 6.6543, "mean_token_accuracy": 0.1162540040910244, "num_tokens": 8668365.0, "step": 4000 }, { "entropy": 6.777298212051392, "epoch": 0.4285943603189042, "grad_norm": 1.1953125, "learning_rate": 0.0004988284656996156, "loss": 6.7009, "mean_token_accuracy": 0.1099359154701233, "num_tokens": 8679228.0, "step": 4005 }, { "entropy": 6.780287981033325, "epoch": 0.42912943442666807, "grad_norm": 1.234375, "learning_rate": 0.0004988245659415656, "loss": 6.5866, "mean_token_accuracy": 0.12446512654423714, "num_tokens": 8688940.0, "step": 4010 }, { "entropy": 6.810698747634888, "epoch": 0.429664508534432, "grad_norm": 1.1796875, "learning_rate": 0.0004988206597206129, "loss": 6.7438, "mean_token_accuracy": 0.10872282534837723, "num_tokens": 8699923.0, "step": 4015 }, { "entropy": 6.720220708847046, "epoch": 0.43019958264219593, "grad_norm": 1.0546875, "learning_rate": 0.00049881674703687, "loss": 6.58, "mean_token_accuracy": 0.12176239043474198, "num_tokens": 8710445.0, "step": 4020 }, { "entropy": 6.721858978271484, "epoch": 0.43073465674995987, "grad_norm": 1.3046875, "learning_rate": 0.0004988128278904499, "loss": 6.7083, "mean_token_accuracy": 0.11447286382317542, "num_tokens": 8720686.0, "step": 4025 }, { "entropy": 6.834508752822876, "epoch": 0.4312697308577238, "grad_norm": 1.140625, "learning_rate": 0.000498808902281466, "loss": 6.7282, "mean_token_accuracy": 0.11510429829359055, "num_tokens": 8732122.0, "step": 4030 }, { "entropy": 6.744071006774902, "epoch": 0.43180480496548773, "grad_norm": 1.125, "learning_rate": 0.0004988049702100315, "loss": 6.6825, "mean_token_accuracy": 0.1182553879916668, "num_tokens": 8744122.0, "step": 4035 }, { "entropy": 6.787398195266723, "epoch": 0.43233987907325166, "grad_norm": 0.984375, "learning_rate": 0.0004988010316762598, "loss": 6.6911, "mean_token_accuracy": 0.115293999761343, "num_tokens": 8754758.0, "step": 4040 }, { "entropy": 6.7287671089172365, "epoch": 0.4328749531810156, "grad_norm": 1.1953125, "learning_rate": 0.0004987970866802649, "loss": 6.7121, "mean_token_accuracy": 0.10785665214061738, "num_tokens": 8766577.0, "step": 4045 }, { "entropy": 6.773381233215332, "epoch": 0.4334100272887795, "grad_norm": 1.1171875, "learning_rate": 0.0004987931352221605, "loss": 6.7083, "mean_token_accuracy": 0.11141579747200012, "num_tokens": 8777698.0, "step": 4050 }, { "entropy": 6.788628673553466, "epoch": 0.4339451013965434, "grad_norm": 1.0546875, "learning_rate": 0.0004987891773020606, "loss": 6.7231, "mean_token_accuracy": 0.11151274070143699, "num_tokens": 8788637.0, "step": 4055 }, { "entropy": 6.799765920639038, "epoch": 0.43448017550430734, "grad_norm": 1.265625, "learning_rate": 0.0004987852129200799, "loss": 6.7009, "mean_token_accuracy": 0.11956919953227044, "num_tokens": 8799709.0, "step": 4060 }, { "entropy": 6.795716381072998, "epoch": 0.4350152496120713, "grad_norm": 1.171875, "learning_rate": 0.0004987812420763326, "loss": 6.6905, "mean_token_accuracy": 0.11553208827972412, "num_tokens": 8810469.0, "step": 4065 }, { "entropy": 6.7736915111541744, "epoch": 0.4355503237198352, "grad_norm": 1.171875, "learning_rate": 0.0004987772647709333, "loss": 6.6708, "mean_token_accuracy": 0.1123408019542694, "num_tokens": 8821142.0, "step": 4070 }, { "entropy": 6.70412278175354, "epoch": 0.43608539782759914, "grad_norm": 1.1796875, "learning_rate": 0.000498773281003997, "loss": 6.6226, "mean_token_accuracy": 0.12270026281476021, "num_tokens": 8832951.0, "step": 4075 }, { "entropy": 6.725498294830322, "epoch": 0.4366204719353631, "grad_norm": 1.3203125, "learning_rate": 0.0004987692907756385, "loss": 6.7344, "mean_token_accuracy": 0.10939609631896019, "num_tokens": 8843579.0, "step": 4080 }, { "entropy": 6.6969774723052975, "epoch": 0.43715554604312695, "grad_norm": 1.125, "learning_rate": 0.0004987652940859733, "loss": 6.6606, "mean_token_accuracy": 0.10758041813969613, "num_tokens": 8854612.0, "step": 4085 }, { "entropy": 6.766866064071655, "epoch": 0.4376906201508909, "grad_norm": 1.0390625, "learning_rate": 0.0004987612909351167, "loss": 6.6101, "mean_token_accuracy": 0.12067801505327225, "num_tokens": 8865584.0, "step": 4090 }, { "entropy": 6.688352346420288, "epoch": 0.4382256942586548, "grad_norm": 1.109375, "learning_rate": 0.0004987572813231842, "loss": 6.66, "mean_token_accuracy": 0.12287814989686012, "num_tokens": 8876662.0, "step": 4095 }, { "entropy": 6.756010103225708, "epoch": 0.43876076836641875, "grad_norm": 1.09375, "learning_rate": 0.0004987532652502917, "loss": 6.6831, "mean_token_accuracy": 0.11270663142204285, "num_tokens": 8887249.0, "step": 4100 }, { "entropy": 6.713475131988526, "epoch": 0.4392958424741827, "grad_norm": 1.2109375, "learning_rate": 0.0004987492427165551, "loss": 6.531, "mean_token_accuracy": 0.1301178902387619, "num_tokens": 8898635.0, "step": 4105 }, { "entropy": 6.678007888793945, "epoch": 0.4398309165819466, "grad_norm": 1.09375, "learning_rate": 0.0004987452137220906, "loss": 6.6895, "mean_token_accuracy": 0.11399767398834229, "num_tokens": 8908794.0, "step": 4110 }, { "entropy": 6.847482490539551, "epoch": 0.44036599068971055, "grad_norm": 1.171875, "learning_rate": 0.0004987411782670144, "loss": 6.7013, "mean_token_accuracy": 0.10850507244467736, "num_tokens": 8919015.0, "step": 4115 }, { "entropy": 6.8152250289917, "epoch": 0.44090106479747443, "grad_norm": 1.140625, "learning_rate": 0.0004987371363514431, "loss": 6.7349, "mean_token_accuracy": 0.10842297747731208, "num_tokens": 8929028.0, "step": 4120 }, { "entropy": 6.664592504501343, "epoch": 0.44143613890523836, "grad_norm": 1.125, "learning_rate": 0.0004987330879754933, "loss": 6.6382, "mean_token_accuracy": 0.11036456525325775, "num_tokens": 8939789.0, "step": 4125 }, { "entropy": 6.707959175109863, "epoch": 0.4419712130130023, "grad_norm": 1.015625, "learning_rate": 0.0004987290331392823, "loss": 6.6225, "mean_token_accuracy": 0.11801224276423454, "num_tokens": 8950657.0, "step": 4130 }, { "entropy": 6.828504610061645, "epoch": 0.44250628712076623, "grad_norm": 1.0546875, "learning_rate": 0.0004987249718429269, "loss": 6.7236, "mean_token_accuracy": 0.11803532913327217, "num_tokens": 8960744.0, "step": 4135 }, { "entropy": 6.705205869674683, "epoch": 0.44304136122853016, "grad_norm": 1.09375, "learning_rate": 0.0004987209040865441, "loss": 6.5768, "mean_token_accuracy": 0.12112260162830353, "num_tokens": 8972411.0, "step": 4140 }, { "entropy": 6.801696109771728, "epoch": 0.4435764353362941, "grad_norm": 1.2265625, "learning_rate": 0.0004987168298702519, "loss": 6.7465, "mean_token_accuracy": 0.11419489085674286, "num_tokens": 8982818.0, "step": 4145 }, { "entropy": 6.745963048934937, "epoch": 0.44411150944405803, "grad_norm": 1.234375, "learning_rate": 0.0004987127491941675, "loss": 6.6657, "mean_token_accuracy": 0.1177960142493248, "num_tokens": 8993227.0, "step": 4150 }, { "entropy": 6.669366073608399, "epoch": 0.4446465835518219, "grad_norm": 1.25, "learning_rate": 0.0004987086620584091, "loss": 6.6037, "mean_token_accuracy": 0.11799841225147248, "num_tokens": 9003796.0, "step": 4155 }, { "entropy": 6.772842884063721, "epoch": 0.44518165765958584, "grad_norm": 1.421875, "learning_rate": 0.0004987045684630944, "loss": 6.6369, "mean_token_accuracy": 0.12047947198152542, "num_tokens": 9014931.0, "step": 4160 }, { "entropy": 6.774410676956177, "epoch": 0.44571673176734977, "grad_norm": 1.15625, "learning_rate": 0.0004987004684083417, "loss": 6.6984, "mean_token_accuracy": 0.1164324201643467, "num_tokens": 9025312.0, "step": 4165 }, { "entropy": 6.7285847663879395, "epoch": 0.4462518058751137, "grad_norm": 1.1015625, "learning_rate": 0.0004986963618942694, "loss": 6.6642, "mean_token_accuracy": 0.12318786159157753, "num_tokens": 9035563.0, "step": 4170 }, { "entropy": 6.795755052566529, "epoch": 0.44678687998287764, "grad_norm": 1.2578125, "learning_rate": 0.0004986922489209961, "loss": 6.7039, "mean_token_accuracy": 0.1175026074051857, "num_tokens": 9046065.0, "step": 4175 }, { "entropy": 6.751359653472901, "epoch": 0.44732195409064157, "grad_norm": 1.0625, "learning_rate": 0.0004986881294886406, "loss": 6.6057, "mean_token_accuracy": 0.1231963075697422, "num_tokens": 9056696.0, "step": 4180 }, { "entropy": 6.676720142364502, "epoch": 0.4478570281984055, "grad_norm": 1.171875, "learning_rate": 0.0004986840035973218, "loss": 6.6808, "mean_token_accuracy": 0.11223538517951966, "num_tokens": 9067035.0, "step": 4185 }, { "entropy": 6.6606361865997314, "epoch": 0.4483921023061694, "grad_norm": 1.140625, "learning_rate": 0.0004986798712471588, "loss": 6.6574, "mean_token_accuracy": 0.11127996742725373, "num_tokens": 9078253.0, "step": 4190 }, { "entropy": 6.8346106052398685, "epoch": 0.4489271764139333, "grad_norm": 1.296875, "learning_rate": 0.0004986757324382709, "loss": 6.7174, "mean_token_accuracy": 0.10800155103206635, "num_tokens": 9088184.0, "step": 4195 }, { "entropy": 6.7804230690002445, "epoch": 0.44946225052169725, "grad_norm": 1.1953125, "learning_rate": 0.0004986715871707777, "loss": 6.7777, "mean_token_accuracy": 0.1087512344121933, "num_tokens": 9099321.0, "step": 4200 }, { "entropy": 6.843128871917725, "epoch": 0.4499973246294612, "grad_norm": 1.140625, "learning_rate": 0.0004986674354447988, "loss": 6.8009, "mean_token_accuracy": 0.11305928155779839, "num_tokens": 9111410.0, "step": 4205 }, { "entropy": 6.831840133666992, "epoch": 0.4505323987372251, "grad_norm": 1.1796875, "learning_rate": 0.0004986632772604543, "loss": 6.6256, "mean_token_accuracy": 0.11788237541913986, "num_tokens": 9121932.0, "step": 4210 }, { "entropy": 6.651640558242798, "epoch": 0.45106747284498905, "grad_norm": 1.6640625, "learning_rate": 0.0004986591126178639, "loss": 6.7181, "mean_token_accuracy": 0.1195308357477188, "num_tokens": 9132686.0, "step": 4215 }, { "entropy": 6.678121089935303, "epoch": 0.451602546952753, "grad_norm": 1.4375, "learning_rate": 0.0004986549415171482, "loss": 6.6445, "mean_token_accuracy": 0.11687054708600045, "num_tokens": 9143582.0, "step": 4220 }, { "entropy": 6.877950763702392, "epoch": 0.45213762106051686, "grad_norm": 1.09375, "learning_rate": 0.0004986507639584274, "loss": 6.7232, "mean_token_accuracy": 0.11007717251777649, "num_tokens": 9156173.0, "step": 4225 }, { "entropy": 6.7473616123199465, "epoch": 0.4526726951682808, "grad_norm": 1.2265625, "learning_rate": 0.0004986465799418223, "loss": 6.7062, "mean_token_accuracy": 0.11616904065012931, "num_tokens": 9166882.0, "step": 4230 }, { "entropy": 6.726114082336426, "epoch": 0.4532077692760447, "grad_norm": 1.28125, "learning_rate": 0.0004986423894674534, "loss": 6.7034, "mean_token_accuracy": 0.11051197499036788, "num_tokens": 9177525.0, "step": 4235 }, { "entropy": 6.824288320541382, "epoch": 0.45374284338380866, "grad_norm": 1.21875, "learning_rate": 0.0004986381925354422, "loss": 6.6713, "mean_token_accuracy": 0.11391364932060241, "num_tokens": 9188586.0, "step": 4240 }, { "entropy": 6.741261911392212, "epoch": 0.4542779174915726, "grad_norm": 1.328125, "learning_rate": 0.0004986339891459094, "loss": 6.5797, "mean_token_accuracy": 0.11786932200193405, "num_tokens": 9199920.0, "step": 4245 }, { "entropy": 6.590327644348145, "epoch": 0.4548129915993365, "grad_norm": 1.21875, "learning_rate": 0.0004986297792989768, "loss": 6.583, "mean_token_accuracy": 0.12098821178078652, "num_tokens": 9210923.0, "step": 4250 }, { "entropy": 6.832316637039185, "epoch": 0.45534806570710046, "grad_norm": 1.2421875, "learning_rate": 0.0004986255629947655, "loss": 6.7539, "mean_token_accuracy": 0.10964171513915062, "num_tokens": 9221459.0, "step": 4255 }, { "entropy": 6.773038291931153, "epoch": 0.45588313981486434, "grad_norm": 1.1953125, "learning_rate": 0.0004986213402333978, "loss": 6.6935, "mean_token_accuracy": 0.11024248600006104, "num_tokens": 9231768.0, "step": 4260 }, { "entropy": 6.713382816314697, "epoch": 0.45641821392262827, "grad_norm": 1.09375, "learning_rate": 0.0004986171110149951, "loss": 6.6848, "mean_token_accuracy": 0.11179919168353081, "num_tokens": 9242230.0, "step": 4265 }, { "entropy": 6.807206058502198, "epoch": 0.4569532880303922, "grad_norm": 1.0859375, "learning_rate": 0.0004986128753396798, "loss": 6.5794, "mean_token_accuracy": 0.1219303086400032, "num_tokens": 9252485.0, "step": 4270 }, { "entropy": 6.657087945938111, "epoch": 0.45748836213815613, "grad_norm": 1.3125, "learning_rate": 0.0004986086332075742, "loss": 6.6527, "mean_token_accuracy": 0.12027468383312226, "num_tokens": 9263014.0, "step": 4275 }, { "entropy": 6.737786865234375, "epoch": 0.45802343624592007, "grad_norm": 1.3046875, "learning_rate": 0.0004986043846188006, "loss": 6.6932, "mean_token_accuracy": 0.12059752494096757, "num_tokens": 9273777.0, "step": 4280 }, { "entropy": 6.658463954925537, "epoch": 0.458558510353684, "grad_norm": 1.3203125, "learning_rate": 0.000498600129573482, "loss": 6.6266, "mean_token_accuracy": 0.11395588889718056, "num_tokens": 9284738.0, "step": 4285 }, { "entropy": 6.793663120269775, "epoch": 0.45909358446144793, "grad_norm": 1.125, "learning_rate": 0.000498595868071741, "loss": 6.6807, "mean_token_accuracy": 0.11528572961688041, "num_tokens": 9295921.0, "step": 4290 }, { "entropy": 6.744870233535766, "epoch": 0.4596286585692118, "grad_norm": 1.2421875, "learning_rate": 0.0004985916001137006, "loss": 6.6609, "mean_token_accuracy": 0.11062274277210235, "num_tokens": 9306568.0, "step": 4295 }, { "entropy": 6.757999467849731, "epoch": 0.46016373267697575, "grad_norm": 1.1875, "learning_rate": 0.0004985873256994843, "loss": 6.6262, "mean_token_accuracy": 0.11653959006071091, "num_tokens": 9316468.0, "step": 4300 }, { "entropy": 6.737951755523682, "epoch": 0.4606988067847397, "grad_norm": 1.21875, "learning_rate": 0.0004985830448292154, "loss": 6.7008, "mean_token_accuracy": 0.1143273763358593, "num_tokens": 9328185.0, "step": 4305 }, { "entropy": 6.743026876449585, "epoch": 0.4612338808925036, "grad_norm": 1.234375, "learning_rate": 0.0004985787575030175, "loss": 6.6547, "mean_token_accuracy": 0.11528828516602516, "num_tokens": 9338591.0, "step": 4310 }, { "entropy": 6.768393468856812, "epoch": 0.46176895500026754, "grad_norm": 1.078125, "learning_rate": 0.0004985744637210144, "loss": 6.6761, "mean_token_accuracy": 0.11174369007349014, "num_tokens": 9349286.0, "step": 4315 }, { "entropy": 6.783293533325195, "epoch": 0.4623040291080315, "grad_norm": 1.375, "learning_rate": 0.00049857016348333, "loss": 6.658, "mean_token_accuracy": 0.11993650272488594, "num_tokens": 9359752.0, "step": 4320 }, { "entropy": 6.78243350982666, "epoch": 0.4628391032157954, "grad_norm": 1.1953125, "learning_rate": 0.0004985658567900886, "loss": 6.7129, "mean_token_accuracy": 0.1122040569782257, "num_tokens": 9371823.0, "step": 4325 }, { "entropy": 6.643386602401733, "epoch": 0.4633741773235593, "grad_norm": 1.0703125, "learning_rate": 0.0004985615436414145, "loss": 6.5839, "mean_token_accuracy": 0.11392313092947007, "num_tokens": 9383127.0, "step": 4330 }, { "entropy": 6.734666919708252, "epoch": 0.4639092514313232, "grad_norm": 1.1875, "learning_rate": 0.0004985572240374321, "loss": 6.6771, "mean_token_accuracy": 0.11793937757611275, "num_tokens": 9394296.0, "step": 4335 }, { "entropy": 6.754271030426025, "epoch": 0.46444432553908715, "grad_norm": 1.1640625, "learning_rate": 0.0004985528979782665, "loss": 6.6688, "mean_token_accuracy": 0.11072949096560478, "num_tokens": 9405988.0, "step": 4340 }, { "entropy": 6.822707033157348, "epoch": 0.4649793996468511, "grad_norm": 1.1015625, "learning_rate": 0.0004985485654640423, "loss": 6.6693, "mean_token_accuracy": 0.1139429748058319, "num_tokens": 9417479.0, "step": 4345 }, { "entropy": 6.696816492080688, "epoch": 0.465514473754615, "grad_norm": 1.375, "learning_rate": 0.0004985442264948847, "loss": 6.6197, "mean_token_accuracy": 0.11986967846751213, "num_tokens": 9428050.0, "step": 4350 }, { "entropy": 6.653148794174195, "epoch": 0.46604954786237895, "grad_norm": 1.1484375, "learning_rate": 0.0004985398810709189, "loss": 6.5722, "mean_token_accuracy": 0.12251258864998818, "num_tokens": 9438229.0, "step": 4355 }, { "entropy": 6.654054975509643, "epoch": 0.4665846219701429, "grad_norm": 1.171875, "learning_rate": 0.0004985355291922704, "loss": 6.6493, "mean_token_accuracy": 0.11258513107895851, "num_tokens": 9449611.0, "step": 4360 }, { "entropy": 6.709498739242553, "epoch": 0.46711969607790677, "grad_norm": 1.515625, "learning_rate": 0.000498531170859065, "loss": 6.614, "mean_token_accuracy": 0.11630048006772994, "num_tokens": 9460234.0, "step": 4365 }, { "entropy": 6.828418874740601, "epoch": 0.4676547701856707, "grad_norm": 1.625, "learning_rate": 0.0004985268060714285, "loss": 6.7023, "mean_token_accuracy": 0.1152671605348587, "num_tokens": 9472136.0, "step": 4370 }, { "entropy": 6.6818465232849125, "epoch": 0.46818984429343463, "grad_norm": 1.3515625, "learning_rate": 0.0004985224348294868, "loss": 6.6403, "mean_token_accuracy": 0.12047104090452194, "num_tokens": 9482602.0, "step": 4375 }, { "entropy": 6.785189914703369, "epoch": 0.46872491840119856, "grad_norm": 1.28125, "learning_rate": 0.0004985180571333663, "loss": 6.6442, "mean_token_accuracy": 0.11965756639838218, "num_tokens": 9493782.0, "step": 4380 }, { "entropy": 6.763046312332153, "epoch": 0.4692599925089625, "grad_norm": 1.5078125, "learning_rate": 0.0004985136729831932, "loss": 6.6249, "mean_token_accuracy": 0.11808878481388092, "num_tokens": 9504389.0, "step": 4385 }, { "entropy": 6.648394393920898, "epoch": 0.46979506661672643, "grad_norm": 1.5390625, "learning_rate": 0.0004985092823790942, "loss": 6.7447, "mean_token_accuracy": 0.1183752790093422, "num_tokens": 9515166.0, "step": 4390 }, { "entropy": 6.747145318984986, "epoch": 0.47033014072449036, "grad_norm": 1.140625, "learning_rate": 0.0004985048853211961, "loss": 6.6434, "mean_token_accuracy": 0.116434495896101, "num_tokens": 9525566.0, "step": 4395 }, { "entropy": 6.7929564952850345, "epoch": 0.47086521483225424, "grad_norm": 1.21875, "learning_rate": 0.000498500481809626, "loss": 6.5549, "mean_token_accuracy": 0.1208685427904129, "num_tokens": 9536021.0, "step": 4400 }, { "entropy": 6.649615907669068, "epoch": 0.4714002889400182, "grad_norm": 1.3984375, "learning_rate": 0.0004984960718445107, "loss": 6.6641, "mean_token_accuracy": 0.11327528953552246, "num_tokens": 9546827.0, "step": 4405 }, { "entropy": 6.756602811813354, "epoch": 0.4719353630477821, "grad_norm": 1.28125, "learning_rate": 0.0004984916554259778, "loss": 6.7758, "mean_token_accuracy": 0.10899243578314781, "num_tokens": 9558104.0, "step": 4410 }, { "entropy": 6.866197681427002, "epoch": 0.47247043715554604, "grad_norm": 1.1796875, "learning_rate": 0.0004984872325541547, "loss": 6.668, "mean_token_accuracy": 0.11704885140061379, "num_tokens": 9568487.0, "step": 4415 }, { "entropy": 6.716640186309815, "epoch": 0.47300551126331, "grad_norm": 1.3125, "learning_rate": 0.0004984828032291692, "loss": 6.6107, "mean_token_accuracy": 0.12084364518523216, "num_tokens": 9579509.0, "step": 4420 }, { "entropy": 6.742200565338135, "epoch": 0.4735405853710739, "grad_norm": 1.96875, "learning_rate": 0.0004984783674511492, "loss": 6.64, "mean_token_accuracy": 0.1198382891714573, "num_tokens": 9589931.0, "step": 4425 }, { "entropy": 6.761376428604126, "epoch": 0.47407565947883784, "grad_norm": 1.328125, "learning_rate": 0.0004984739252202227, "loss": 6.6733, "mean_token_accuracy": 0.11940053328871728, "num_tokens": 9599764.0, "step": 4430 }, { "entropy": 6.7573480129241945, "epoch": 0.4746107335866017, "grad_norm": 1.2578125, "learning_rate": 0.000498469476536518, "loss": 6.6472, "mean_token_accuracy": 0.1184098556637764, "num_tokens": 9611145.0, "step": 4435 }, { "entropy": 6.6948751449584964, "epoch": 0.47514580769436565, "grad_norm": 1.4453125, "learning_rate": 0.0004984650214001636, "loss": 6.6436, "mean_token_accuracy": 0.12355822175741196, "num_tokens": 9621441.0, "step": 4440 }, { "entropy": 6.741222667694092, "epoch": 0.4756808818021296, "grad_norm": 1.59375, "learning_rate": 0.0004984605598112881, "loss": 6.6857, "mean_token_accuracy": 0.12146021127700805, "num_tokens": 9631874.0, "step": 4445 }, { "entropy": 6.717041254043579, "epoch": 0.4762159559098935, "grad_norm": 1.1484375, "learning_rate": 0.0004984560917700204, "loss": 6.6614, "mean_token_accuracy": 0.11106858849525451, "num_tokens": 9643006.0, "step": 4450 }, { "entropy": 6.698492193222046, "epoch": 0.47675103001765745, "grad_norm": 1.328125, "learning_rate": 0.0004984516172764894, "loss": 6.5533, "mean_token_accuracy": 0.12116582468152046, "num_tokens": 9653897.0, "step": 4455 }, { "entropy": 6.691738748550415, "epoch": 0.4772861041254214, "grad_norm": 1.2734375, "learning_rate": 0.0004984471363308243, "loss": 6.6263, "mean_token_accuracy": 0.1176533468067646, "num_tokens": 9664460.0, "step": 4460 }, { "entropy": 6.711106204986573, "epoch": 0.4778211782331853, "grad_norm": 1.1015625, "learning_rate": 0.0004984426489331546, "loss": 6.6385, "mean_token_accuracy": 0.12148366495966911, "num_tokens": 9674534.0, "step": 4465 }, { "entropy": 6.8625555515289305, "epoch": 0.4783562523409492, "grad_norm": 1.2109375, "learning_rate": 0.0004984381550836097, "loss": 6.732, "mean_token_accuracy": 0.11358912587165833, "num_tokens": 9684828.0, "step": 4470 }, { "entropy": 6.851891565322876, "epoch": 0.47889132644871313, "grad_norm": 1.6015625, "learning_rate": 0.0004984336547823196, "loss": 6.6838, "mean_token_accuracy": 0.11679960638284684, "num_tokens": 9694536.0, "step": 4475 }, { "entropy": 6.712016582489014, "epoch": 0.47942640055647706, "grad_norm": 1.0703125, "learning_rate": 0.000498429148029414, "loss": 6.5548, "mean_token_accuracy": 0.12640432715415956, "num_tokens": 9705715.0, "step": 4480 }, { "entropy": 6.654127883911133, "epoch": 0.479961474664241, "grad_norm": 1.125, "learning_rate": 0.0004984246348250233, "loss": 6.6293, "mean_token_accuracy": 0.12291777729988099, "num_tokens": 9717505.0, "step": 4485 }, { "entropy": 6.698559045791626, "epoch": 0.4804965487720049, "grad_norm": 1.15625, "learning_rate": 0.0004984201151692775, "loss": 6.5005, "mean_token_accuracy": 0.11582913845777512, "num_tokens": 9727910.0, "step": 4490 }, { "entropy": 6.681623268127441, "epoch": 0.48103162287976886, "grad_norm": 1.2578125, "learning_rate": 0.0004984155890623074, "loss": 6.6164, "mean_token_accuracy": 0.12003767117857933, "num_tokens": 9738528.0, "step": 4495 }, { "entropy": 6.688356590270996, "epoch": 0.4815666969875328, "grad_norm": 1.1484375, "learning_rate": 0.0004984110565042435, "loss": 6.6433, "mean_token_accuracy": 0.11511807218194008, "num_tokens": 9749744.0, "step": 4500 }, { "entropy": 6.787782335281372, "epoch": 0.48210177109529667, "grad_norm": 1.1796875, "learning_rate": 0.0004984065174952168, "loss": 6.6415, "mean_token_accuracy": 0.11788514703512191, "num_tokens": 9759968.0, "step": 4505 }, { "entropy": 6.7138995170593265, "epoch": 0.4826368452030606, "grad_norm": 1.3046875, "learning_rate": 0.0004984019720353582, "loss": 6.6483, "mean_token_accuracy": 0.11984834149479866, "num_tokens": 9769791.0, "step": 4510 }, { "entropy": 6.669849443435669, "epoch": 0.48317191931082454, "grad_norm": 1.1953125, "learning_rate": 0.0004983974201247991, "loss": 6.6168, "mean_token_accuracy": 0.12382967993617058, "num_tokens": 9780369.0, "step": 4515 }, { "entropy": 6.718169641494751, "epoch": 0.48370699341858847, "grad_norm": 1.0703125, "learning_rate": 0.0004983928617636709, "loss": 6.6649, "mean_token_accuracy": 0.11595848128199578, "num_tokens": 9791125.0, "step": 4520 }, { "entropy": 6.822065162658691, "epoch": 0.4842420675263524, "grad_norm": 1.296875, "learning_rate": 0.0004983882969521052, "loss": 6.6623, "mean_token_accuracy": 0.11691764071583748, "num_tokens": 9801697.0, "step": 4525 }, { "entropy": 6.784085750579834, "epoch": 0.48477714163411634, "grad_norm": 1.046875, "learning_rate": 0.0004983837256902338, "loss": 6.7085, "mean_token_accuracy": 0.1206382617354393, "num_tokens": 9812171.0, "step": 4530 }, { "entropy": 6.700609016418457, "epoch": 0.48531221574188027, "grad_norm": 1.1171875, "learning_rate": 0.0004983791479781887, "loss": 6.5452, "mean_token_accuracy": 0.12644470036029815, "num_tokens": 9821596.0, "step": 4535 }, { "entropy": 6.76994104385376, "epoch": 0.48584728984964415, "grad_norm": 1.296875, "learning_rate": 0.0004983745638161021, "loss": 6.6662, "mean_token_accuracy": 0.10886719152331352, "num_tokens": 9831634.0, "step": 4540 }, { "entropy": 6.702042055130005, "epoch": 0.4863823639574081, "grad_norm": 1.4296875, "learning_rate": 0.0004983699732041064, "loss": 6.6297, "mean_token_accuracy": 0.12174258530139923, "num_tokens": 9841662.0, "step": 4545 }, { "entropy": 6.773559427261352, "epoch": 0.486917438065172, "grad_norm": 1.109375, "learning_rate": 0.000498365376142334, "loss": 6.618, "mean_token_accuracy": 0.11437310129404069, "num_tokens": 9853797.0, "step": 4550 }, { "entropy": 6.712430953979492, "epoch": 0.48745251217293595, "grad_norm": 1.1484375, "learning_rate": 0.0004983607726309179, "loss": 6.6691, "mean_token_accuracy": 0.1182169571518898, "num_tokens": 9865245.0, "step": 4555 }, { "entropy": 6.814268589019775, "epoch": 0.4879875862806999, "grad_norm": 1.234375, "learning_rate": 0.0004983561626699908, "loss": 6.7454, "mean_token_accuracy": 0.10475116744637489, "num_tokens": 9876207.0, "step": 4560 }, { "entropy": 6.760530710220337, "epoch": 0.4885226603884638, "grad_norm": 1.234375, "learning_rate": 0.0004983515462596859, "loss": 6.5712, "mean_token_accuracy": 0.12076753973960877, "num_tokens": 9887210.0, "step": 4565 }, { "entropy": 6.743468475341797, "epoch": 0.48905773449622775, "grad_norm": 1.2578125, "learning_rate": 0.0004983469234001365, "loss": 6.746, "mean_token_accuracy": 0.11424284428358078, "num_tokens": 9899607.0, "step": 4570 }, { "entropy": 6.662120580673218, "epoch": 0.4895928086039917, "grad_norm": 1.3515625, "learning_rate": 0.000498342294091476, "loss": 6.5284, "mean_token_accuracy": 0.1255207620561123, "num_tokens": 9909910.0, "step": 4575 }, { "entropy": 6.648574686050415, "epoch": 0.49012788271175556, "grad_norm": 1.25, "learning_rate": 0.0004983376583338382, "loss": 6.6563, "mean_token_accuracy": 0.11490331664681434, "num_tokens": 9922137.0, "step": 4580 }, { "entropy": 6.735975837707519, "epoch": 0.4906629568195195, "grad_norm": 1.1953125, "learning_rate": 0.0004983330161273569, "loss": 6.6451, "mean_token_accuracy": 0.11815119236707687, "num_tokens": 9932514.0, "step": 4585 }, { "entropy": 6.717578268051147, "epoch": 0.4911980309272834, "grad_norm": 1.5390625, "learning_rate": 0.0004983283674721662, "loss": 6.6847, "mean_token_accuracy": 0.11441330313682556, "num_tokens": 9943054.0, "step": 4590 }, { "entropy": 6.8306371688842775, "epoch": 0.49173310503504736, "grad_norm": 1.1796875, "learning_rate": 0.0004983237123684002, "loss": 6.6517, "mean_token_accuracy": 0.11424371600151062, "num_tokens": 9953791.0, "step": 4595 }, { "entropy": 6.725871992111206, "epoch": 0.4922681791428113, "grad_norm": 1.234375, "learning_rate": 0.0004983190508161934, "loss": 6.6071, "mean_token_accuracy": 0.1176756463944912, "num_tokens": 9964782.0, "step": 4600 }, { "entropy": 6.776705169677735, "epoch": 0.4928032532505752, "grad_norm": 1.6953125, "learning_rate": 0.0004983143828156804, "loss": 6.6759, "mean_token_accuracy": 0.1201729841530323, "num_tokens": 9975843.0, "step": 4605 }, { "entropy": 6.766890525817871, "epoch": 0.49333832735833916, "grad_norm": 1.5859375, "learning_rate": 0.0004983097083669959, "loss": 6.6515, "mean_token_accuracy": 0.12076375931501389, "num_tokens": 9987060.0, "step": 4610 }, { "entropy": 6.729199981689453, "epoch": 0.49387340146610303, "grad_norm": 1.296875, "learning_rate": 0.0004983050274702751, "loss": 6.6204, "mean_token_accuracy": 0.11678859367966651, "num_tokens": 9997380.0, "step": 4615 }, { "entropy": 6.704911518096924, "epoch": 0.49440847557386697, "grad_norm": 1.1171875, "learning_rate": 0.0004983003401256529, "loss": 6.6666, "mean_token_accuracy": 0.11961752027273179, "num_tokens": 10007955.0, "step": 4620 }, { "entropy": 6.858521175384522, "epoch": 0.4949435496816309, "grad_norm": 1.390625, "learning_rate": 0.0004982956463332647, "loss": 6.7414, "mean_token_accuracy": 0.11539428681135178, "num_tokens": 10017645.0, "step": 4625 }, { "entropy": 6.7818702220916744, "epoch": 0.49547862378939483, "grad_norm": 2.328125, "learning_rate": 0.0004982909460932463, "loss": 6.6603, "mean_token_accuracy": 0.11978099420666695, "num_tokens": 10027619.0, "step": 4630 }, { "entropy": 6.654353475570678, "epoch": 0.49601369789715877, "grad_norm": 1.15625, "learning_rate": 0.000498286239405733, "loss": 6.5454, "mean_token_accuracy": 0.12450932785868644, "num_tokens": 10037551.0, "step": 4635 }, { "entropy": 6.672497034072876, "epoch": 0.4965487720049227, "grad_norm": 1.1171875, "learning_rate": 0.000498281526270861, "loss": 6.5851, "mean_token_accuracy": 0.13364579305052757, "num_tokens": 10047771.0, "step": 4640 }, { "entropy": 6.803449487686157, "epoch": 0.49708384611268663, "grad_norm": 1.203125, "learning_rate": 0.0004982768066887663, "loss": 6.7076, "mean_token_accuracy": 0.112837415933609, "num_tokens": 10058771.0, "step": 4645 }, { "entropy": 6.723805093765259, "epoch": 0.4976189202204505, "grad_norm": 1.2109375, "learning_rate": 0.0004982720806595851, "loss": 6.5841, "mean_token_accuracy": 0.12232825830578804, "num_tokens": 10070318.0, "step": 4650 }, { "entropy": 6.68502402305603, "epoch": 0.49815399432821444, "grad_norm": 1.1171875, "learning_rate": 0.0004982673481834541, "loss": 6.614, "mean_token_accuracy": 0.11796658039093018, "num_tokens": 10081810.0, "step": 4655 }, { "entropy": 6.6698534965515135, "epoch": 0.4986890684359784, "grad_norm": 1.1953125, "learning_rate": 0.0004982626092605097, "loss": 6.6297, "mean_token_accuracy": 0.11533761844038963, "num_tokens": 10091724.0, "step": 4660 }, { "entropy": 6.763433408737183, "epoch": 0.4992241425437423, "grad_norm": 1.3359375, "learning_rate": 0.0004982578638908888, "loss": 6.6159, "mean_token_accuracy": 0.11898914724588394, "num_tokens": 10102510.0, "step": 4665 }, { "entropy": 6.755692815780639, "epoch": 0.49975921665150624, "grad_norm": 1.2734375, "learning_rate": 0.0004982531120747286, "loss": 6.6781, "mean_token_accuracy": 0.11363844275474548, "num_tokens": 10112636.0, "step": 4670 }, { "entropy": 6.679724454879761, "epoch": 0.5002942907592701, "grad_norm": 1.546875, "learning_rate": 0.000498248353812166, "loss": 6.684, "mean_token_accuracy": 0.11922202631831169, "num_tokens": 10123562.0, "step": 4675 }, { "entropy": 6.720367956161499, "epoch": 0.5008293648670341, "grad_norm": 1.234375, "learning_rate": 0.0004982435891033387, "loss": 6.6344, "mean_token_accuracy": 0.11208936050534249, "num_tokens": 10134731.0, "step": 4680 }, { "entropy": 6.773916530609131, "epoch": 0.501364438974798, "grad_norm": 1.2265625, "learning_rate": 0.000498238817948384, "loss": 6.6307, "mean_token_accuracy": 0.11377799212932586, "num_tokens": 10145232.0, "step": 4685 }, { "entropy": 6.715243864059448, "epoch": 0.501899513082562, "grad_norm": 1.3671875, "learning_rate": 0.0004982340403474398, "loss": 6.601, "mean_token_accuracy": 0.11478810831904411, "num_tokens": 10155857.0, "step": 4690 }, { "entropy": 6.7384484767913815, "epoch": 0.5024345871903259, "grad_norm": 1.1796875, "learning_rate": 0.0004982292563006441, "loss": 6.6107, "mean_token_accuracy": 0.12016694247722626, "num_tokens": 10166145.0, "step": 4695 }, { "entropy": 6.8165631771087645, "epoch": 0.5029696612980897, "grad_norm": 1.2421875, "learning_rate": 0.000498224465808135, "loss": 6.7341, "mean_token_accuracy": 0.10747307166457176, "num_tokens": 10177086.0, "step": 4700 }, { "entropy": 6.807919645309449, "epoch": 0.5035047354058537, "grad_norm": 1.6015625, "learning_rate": 0.0004982196688700509, "loss": 6.6168, "mean_token_accuracy": 0.11652338951826095, "num_tokens": 10187120.0, "step": 4705 }, { "entropy": 6.746653747558594, "epoch": 0.5040398095136176, "grad_norm": 1.3359375, "learning_rate": 0.0004982148654865302, "loss": 6.6816, "mean_token_accuracy": 0.1173696868121624, "num_tokens": 10197784.0, "step": 4710 }, { "entropy": 6.769271898269653, "epoch": 0.5045748836213816, "grad_norm": 1.1875, "learning_rate": 0.0004982100556577115, "loss": 6.5533, "mean_token_accuracy": 0.12568439543247223, "num_tokens": 10209373.0, "step": 4715 }, { "entropy": 6.758709573745728, "epoch": 0.5051099577291455, "grad_norm": 1.328125, "learning_rate": 0.0004982052393837338, "loss": 6.669, "mean_token_accuracy": 0.11871311962604522, "num_tokens": 10220316.0, "step": 4720 }, { "entropy": 6.6824239730834964, "epoch": 0.5056450318369095, "grad_norm": 1.2265625, "learning_rate": 0.0004982004166647363, "loss": 6.5571, "mean_token_accuracy": 0.12401916012167931, "num_tokens": 10230478.0, "step": 4725 }, { "entropy": 6.623062801361084, "epoch": 0.5061801059446733, "grad_norm": 1.1796875, "learning_rate": 0.0004981955875008582, "loss": 6.6518, "mean_token_accuracy": 0.11519326344132423, "num_tokens": 10240641.0, "step": 4730 }, { "entropy": 6.744868040084839, "epoch": 0.5067151800524372, "grad_norm": 1.2578125, "learning_rate": 0.0004981907518922387, "loss": 6.6428, "mean_token_accuracy": 0.12281770035624504, "num_tokens": 10250676.0, "step": 4735 }, { "entropy": 6.859378337860107, "epoch": 0.5072502541602012, "grad_norm": 1.9765625, "learning_rate": 0.0004981859098390177, "loss": 6.7032, "mean_token_accuracy": 0.11514592617750168, "num_tokens": 10262016.0, "step": 4740 }, { "entropy": 6.7457503318786625, "epoch": 0.5077853282679651, "grad_norm": 1.3046875, "learning_rate": 0.0004981810613413348, "loss": 6.6448, "mean_token_accuracy": 0.12012371569871902, "num_tokens": 10271985.0, "step": 4745 }, { "entropy": 6.745742273330689, "epoch": 0.5083204023757291, "grad_norm": 1.2734375, "learning_rate": 0.0004981762063993302, "loss": 6.6133, "mean_token_accuracy": 0.12136726751923561, "num_tokens": 10282156.0, "step": 4750 }, { "entropy": 6.716922092437744, "epoch": 0.5088554764834929, "grad_norm": 1.34375, "learning_rate": 0.000498171345013144, "loss": 6.611, "mean_token_accuracy": 0.11782191470265388, "num_tokens": 10292576.0, "step": 4755 }, { "entropy": 6.661800575256348, "epoch": 0.5093905505912569, "grad_norm": 1.6640625, "learning_rate": 0.0004981664771829165, "loss": 6.6254, "mean_token_accuracy": 0.1142365463078022, "num_tokens": 10303648.0, "step": 4760 }, { "entropy": 6.715044784545898, "epoch": 0.5099256246990208, "grad_norm": 1.2734375, "learning_rate": 0.0004981616029087884, "loss": 6.5102, "mean_token_accuracy": 0.12722289934754372, "num_tokens": 10314275.0, "step": 4765 }, { "entropy": 6.675028467178345, "epoch": 0.5104606988067847, "grad_norm": 1.3515625, "learning_rate": 0.0004981567221909004, "loss": 6.6398, "mean_token_accuracy": 0.11122743040323257, "num_tokens": 10325386.0, "step": 4770 }, { "entropy": 6.712424802780151, "epoch": 0.5109957729145487, "grad_norm": 1.8828125, "learning_rate": 0.0004981518350293935, "loss": 6.6132, "mean_token_accuracy": 0.11537306159734725, "num_tokens": 10335041.0, "step": 4775 }, { "entropy": 6.743242788314819, "epoch": 0.5115308470223126, "grad_norm": 1.6796875, "learning_rate": 0.0004981469414244086, "loss": 6.5693, "mean_token_accuracy": 0.12268173769116401, "num_tokens": 10345746.0, "step": 4780 }, { "entropy": 6.624886989593506, "epoch": 0.5120659211300765, "grad_norm": 1.25, "learning_rate": 0.000498142041376087, "loss": 6.6945, "mean_token_accuracy": 0.11829338818788529, "num_tokens": 10356995.0, "step": 4785 }, { "entropy": 6.7250689506530765, "epoch": 0.5126009952378404, "grad_norm": 1.359375, "learning_rate": 0.0004981371348845705, "loss": 6.5939, "mean_token_accuracy": 0.1246476911008358, "num_tokens": 10368445.0, "step": 4790 }, { "entropy": 6.810773944854736, "epoch": 0.5131360693456044, "grad_norm": 1.1875, "learning_rate": 0.0004981322219500006, "loss": 6.5364, "mean_token_accuracy": 0.1264880530536175, "num_tokens": 10378256.0, "step": 4795 }, { "entropy": 6.698590278625488, "epoch": 0.5136711434533683, "grad_norm": 1.328125, "learning_rate": 0.000498127302572519, "loss": 6.6306, "mean_token_accuracy": 0.11948861032724381, "num_tokens": 10388698.0, "step": 4800 }, { "entropy": 6.626500415802002, "epoch": 0.5142062175611322, "grad_norm": 1.3203125, "learning_rate": 0.0004981223767522679, "loss": 6.6314, "mean_token_accuracy": 0.12543342038989067, "num_tokens": 10399975.0, "step": 4805 }, { "entropy": 6.73018741607666, "epoch": 0.5147412916688962, "grad_norm": 1.234375, "learning_rate": 0.0004981174444893896, "loss": 6.632, "mean_token_accuracy": 0.11657147109508514, "num_tokens": 10410480.0, "step": 4810 }, { "entropy": 6.754246234893799, "epoch": 0.51527636577666, "grad_norm": 1.484375, "learning_rate": 0.0004981125057840264, "loss": 6.5903, "mean_token_accuracy": 0.12315746694803238, "num_tokens": 10421023.0, "step": 4815 }, { "entropy": 6.691860723495483, "epoch": 0.515811439884424, "grad_norm": 1.34375, "learning_rate": 0.000498107560636321, "loss": 6.6376, "mean_token_accuracy": 0.11937036588788033, "num_tokens": 10431152.0, "step": 4820 }, { "entropy": 6.669547367095947, "epoch": 0.5163465139921879, "grad_norm": 1.375, "learning_rate": 0.0004981026090464161, "loss": 6.5395, "mean_token_accuracy": 0.11537841185927392, "num_tokens": 10441986.0, "step": 4825 }, { "entropy": 6.76296591758728, "epoch": 0.5168815880999519, "grad_norm": 1.515625, "learning_rate": 0.0004980976510144548, "loss": 6.6294, "mean_token_accuracy": 0.11330693066120148, "num_tokens": 10452932.0, "step": 4830 }, { "entropy": 6.730077743530273, "epoch": 0.5174166622077158, "grad_norm": 1.1875, "learning_rate": 0.0004980926865405801, "loss": 6.7059, "mean_token_accuracy": 0.1165323257446289, "num_tokens": 10463411.0, "step": 4835 }, { "entropy": 6.755215454101562, "epoch": 0.5179517363154797, "grad_norm": 1.3203125, "learning_rate": 0.0004980877156249354, "loss": 6.5955, "mean_token_accuracy": 0.12119976133108139, "num_tokens": 10474820.0, "step": 4840 }, { "entropy": 6.693712377548218, "epoch": 0.5184868104232436, "grad_norm": 1.3671875, "learning_rate": 0.0004980827382676643, "loss": 6.5956, "mean_token_accuracy": 0.12424970418214798, "num_tokens": 10485701.0, "step": 4845 }, { "entropy": 6.697637557983398, "epoch": 0.5190218845310075, "grad_norm": 1.375, "learning_rate": 0.0004980777544689105, "loss": 6.5925, "mean_token_accuracy": 0.12146328687667847, "num_tokens": 10495825.0, "step": 4850 }, { "entropy": 6.6988880157470705, "epoch": 0.5195569586387715, "grad_norm": 1.265625, "learning_rate": 0.0004980727642288178, "loss": 6.5759, "mean_token_accuracy": 0.12025154009461403, "num_tokens": 10505847.0, "step": 4855 }, { "entropy": 6.712225770950317, "epoch": 0.5200920327465354, "grad_norm": 1.359375, "learning_rate": 0.0004980677675475305, "loss": 6.6367, "mean_token_accuracy": 0.11677327230572701, "num_tokens": 10516596.0, "step": 4860 }, { "entropy": 6.733681726455688, "epoch": 0.5206271068542994, "grad_norm": 1.3203125, "learning_rate": 0.0004980627644251926, "loss": 6.5497, "mean_token_accuracy": 0.1293226294219494, "num_tokens": 10528175.0, "step": 4865 }, { "entropy": 6.651979970932007, "epoch": 0.5211621809620632, "grad_norm": 1.3203125, "learning_rate": 0.0004980577548619489, "loss": 6.6329, "mean_token_accuracy": 0.11742270663380623, "num_tokens": 10540076.0, "step": 4870 }, { "entropy": 6.686881160736084, "epoch": 0.5216972550698272, "grad_norm": 1.25, "learning_rate": 0.0004980527388579437, "loss": 6.6555, "mean_token_accuracy": 0.11610461995005608, "num_tokens": 10552025.0, "step": 4875 }, { "entropy": 6.746124219894409, "epoch": 0.5222323291775911, "grad_norm": 1.1875, "learning_rate": 0.0004980477164133221, "loss": 6.6528, "mean_token_accuracy": 0.11348175257444382, "num_tokens": 10562535.0, "step": 4880 }, { "entropy": 6.723954057693481, "epoch": 0.522767403285355, "grad_norm": 1.2421875, "learning_rate": 0.000498042687528229, "loss": 6.574, "mean_token_accuracy": 0.12090551033616066, "num_tokens": 10572989.0, "step": 4885 }, { "entropy": 6.658336591720581, "epoch": 0.523302477393119, "grad_norm": 1.234375, "learning_rate": 0.0004980376522028098, "loss": 6.6058, "mean_token_accuracy": 0.12160259932279587, "num_tokens": 10583033.0, "step": 4890 }, { "entropy": 6.734746789932251, "epoch": 0.5238375515008828, "grad_norm": 1.6015625, "learning_rate": 0.0004980326104372095, "loss": 6.6853, "mean_token_accuracy": 0.11474591270089149, "num_tokens": 10595205.0, "step": 4895 }, { "entropy": 6.786480188369751, "epoch": 0.5243726256086468, "grad_norm": 1.4609375, "learning_rate": 0.000498027562231574, "loss": 6.5392, "mean_token_accuracy": 0.12003358751535416, "num_tokens": 10605244.0, "step": 4900 }, { "entropy": 6.718193483352661, "epoch": 0.5249076997164107, "grad_norm": 1.21875, "learning_rate": 0.000498022507586049, "loss": 6.6214, "mean_token_accuracy": 0.11722708195447921, "num_tokens": 10615817.0, "step": 4905 }, { "entropy": 6.725398159027099, "epoch": 0.5254427738241747, "grad_norm": 1.2265625, "learning_rate": 0.0004980174465007804, "loss": 6.6366, "mean_token_accuracy": 0.11559919267892838, "num_tokens": 10627160.0, "step": 4910 }, { "entropy": 6.766883087158203, "epoch": 0.5259778479319386, "grad_norm": 1.390625, "learning_rate": 0.0004980123789759145, "loss": 6.631, "mean_token_accuracy": 0.12066573053598403, "num_tokens": 10637552.0, "step": 4915 }, { "entropy": 6.666731262207032, "epoch": 0.5265129220397025, "grad_norm": 1.7734375, "learning_rate": 0.0004980073050115973, "loss": 6.6807, "mean_token_accuracy": 0.11911093890666961, "num_tokens": 10648773.0, "step": 4920 }, { "entropy": 6.761361503601075, "epoch": 0.5270479961474664, "grad_norm": 1.40625, "learning_rate": 0.0004980022246079755, "loss": 6.6387, "mean_token_accuracy": 0.1175591915845871, "num_tokens": 10659537.0, "step": 4925 }, { "entropy": 6.820301675796509, "epoch": 0.5275830702552303, "grad_norm": 1.234375, "learning_rate": 0.000497997137765196, "loss": 6.6932, "mean_token_accuracy": 0.11372315660119056, "num_tokens": 10671390.0, "step": 4930 }, { "entropy": 6.718183946609497, "epoch": 0.5281181443629943, "grad_norm": 1.609375, "learning_rate": 0.0004979920444834054, "loss": 6.5349, "mean_token_accuracy": 0.12883347496390343, "num_tokens": 10682389.0, "step": 4935 }, { "entropy": 6.594164085388184, "epoch": 0.5286532184707582, "grad_norm": 1.296875, "learning_rate": 0.0004979869447627508, "loss": 6.606, "mean_token_accuracy": 0.12021337449550629, "num_tokens": 10692400.0, "step": 4940 }, { "entropy": 6.691273975372314, "epoch": 0.5291882925785222, "grad_norm": 1.2734375, "learning_rate": 0.0004979818386033795, "loss": 6.526, "mean_token_accuracy": 0.12336401715874672, "num_tokens": 10702396.0, "step": 4945 }, { "entropy": 6.723889923095703, "epoch": 0.5297233666862861, "grad_norm": 1.7265625, "learning_rate": 0.000497976726005439, "loss": 6.6549, "mean_token_accuracy": 0.11776790469884872, "num_tokens": 10712863.0, "step": 4950 }, { "entropy": 6.707800340652466, "epoch": 0.5302584407940499, "grad_norm": 1.2109375, "learning_rate": 0.0004979716069690768, "loss": 6.6556, "mean_token_accuracy": 0.11826993152499199, "num_tokens": 10724234.0, "step": 4955 }, { "entropy": 6.8028627872467045, "epoch": 0.5307935149018139, "grad_norm": 2.09375, "learning_rate": 0.0004979664814944409, "loss": 6.6898, "mean_token_accuracy": 0.11730713248252869, "num_tokens": 10734405.0, "step": 4960 }, { "entropy": 6.796906423568726, "epoch": 0.5313285890095778, "grad_norm": 1.40625, "learning_rate": 0.0004979613495816791, "loss": 6.6269, "mean_token_accuracy": 0.11673597991466522, "num_tokens": 10744573.0, "step": 4965 }, { "entropy": 6.81073899269104, "epoch": 0.5318636631173418, "grad_norm": 1.6171875, "learning_rate": 0.0004979562112309397, "loss": 6.6701, "mean_token_accuracy": 0.12054512575268746, "num_tokens": 10755555.0, "step": 4970 }, { "entropy": 6.69157977104187, "epoch": 0.5323987372251057, "grad_norm": 1.1640625, "learning_rate": 0.000497951066442371, "loss": 6.6797, "mean_token_accuracy": 0.11503533869981766, "num_tokens": 10766493.0, "step": 4975 }, { "entropy": 6.757311391830444, "epoch": 0.5329338113328697, "grad_norm": 1.3984375, "learning_rate": 0.0004979459152161215, "loss": 6.6385, "mean_token_accuracy": 0.11236128360033035, "num_tokens": 10776735.0, "step": 4980 }, { "entropy": 6.700515174865723, "epoch": 0.5334688854406335, "grad_norm": 1.2578125, "learning_rate": 0.0004979407575523402, "loss": 6.6145, "mean_token_accuracy": 0.12050373330712319, "num_tokens": 10787500.0, "step": 4985 }, { "entropy": 6.703393936157227, "epoch": 0.5340039595483974, "grad_norm": 1.609375, "learning_rate": 0.0004979355934511757, "loss": 6.6344, "mean_token_accuracy": 0.12052067667245865, "num_tokens": 10798002.0, "step": 4990 }, { "entropy": 6.75645604133606, "epoch": 0.5345390336561614, "grad_norm": 1.375, "learning_rate": 0.0004979304229127773, "loss": 6.6112, "mean_token_accuracy": 0.11992594972252846, "num_tokens": 10808982.0, "step": 4995 }, { "entropy": 6.736630868911743, "epoch": 0.5350741077639253, "grad_norm": 1.2421875, "learning_rate": 0.0004979252459372944, "loss": 6.5706, "mean_token_accuracy": 0.11807732656598091, "num_tokens": 10821619.0, "step": 5000 }, { "entropy": 6.699893808364868, "epoch": 0.5356091818716893, "grad_norm": 1.390625, "learning_rate": 0.0004979200625248761, "loss": 6.5904, "mean_token_accuracy": 0.12047486156225204, "num_tokens": 10832344.0, "step": 5005 }, { "entropy": 6.670212745666504, "epoch": 0.5361442559794531, "grad_norm": 1.4296875, "learning_rate": 0.0004979148726756725, "loss": 6.5571, "mean_token_accuracy": 0.11860336735844612, "num_tokens": 10843149.0, "step": 5010 }, { "entropy": 6.675074863433838, "epoch": 0.5366793300872171, "grad_norm": 1.6171875, "learning_rate": 0.0004979096763898333, "loss": 6.5998, "mean_token_accuracy": 0.12452303320169449, "num_tokens": 10854590.0, "step": 5015 }, { "entropy": 6.791008424758911, "epoch": 0.537214404194981, "grad_norm": 1.78125, "learning_rate": 0.0004979044736675084, "loss": 6.5671, "mean_token_accuracy": 0.11767032742500305, "num_tokens": 10865500.0, "step": 5020 }, { "entropy": 6.680721569061279, "epoch": 0.5377494783027449, "grad_norm": 1.9375, "learning_rate": 0.0004978992645088483, "loss": 6.6021, "mean_token_accuracy": 0.12172115072607995, "num_tokens": 10876866.0, "step": 5025 }, { "entropy": 6.5734340190887455, "epoch": 0.5382845524105089, "grad_norm": 1.265625, "learning_rate": 0.000497894048914003, "loss": 6.5612, "mean_token_accuracy": 0.11841940134763718, "num_tokens": 10888627.0, "step": 5030 }, { "entropy": 6.746210193634033, "epoch": 0.5388196265182728, "grad_norm": 1.9921875, "learning_rate": 0.0004978888268831236, "loss": 6.6696, "mean_token_accuracy": 0.11132773160934448, "num_tokens": 10900992.0, "step": 5035 }, { "entropy": 6.842794561386109, "epoch": 0.5393547006260367, "grad_norm": 1.40625, "learning_rate": 0.0004978835984163606, "loss": 6.7276, "mean_token_accuracy": 0.10932021215558052, "num_tokens": 10912323.0, "step": 5040 }, { "entropy": 6.800081539154053, "epoch": 0.5398897747338006, "grad_norm": 1.5078125, "learning_rate": 0.0004978783635138649, "loss": 6.6771, "mean_token_accuracy": 0.11647720038890838, "num_tokens": 10923991.0, "step": 5045 }, { "entropy": 6.639073657989502, "epoch": 0.5404248488415646, "grad_norm": 1.34375, "learning_rate": 0.0004978731221757878, "loss": 6.5041, "mean_token_accuracy": 0.12417407482862472, "num_tokens": 10934081.0, "step": 5050 }, { "entropy": 6.727223587036133, "epoch": 0.5409599229493285, "grad_norm": 1.5546875, "learning_rate": 0.0004978678744022808, "loss": 6.6006, "mean_token_accuracy": 0.117810919880867, "num_tokens": 10944729.0, "step": 5055 }, { "entropy": 6.709056615829468, "epoch": 0.5414949970570924, "grad_norm": 1.296875, "learning_rate": 0.000497862620193495, "loss": 6.6635, "mean_token_accuracy": 0.11320299580693245, "num_tokens": 10955708.0, "step": 5060 }, { "entropy": 6.72125997543335, "epoch": 0.5420300711648564, "grad_norm": 1.40625, "learning_rate": 0.0004978573595495826, "loss": 6.6002, "mean_token_accuracy": 0.11878297626972198, "num_tokens": 10966427.0, "step": 5065 }, { "entropy": 6.740125894546509, "epoch": 0.5425651452726202, "grad_norm": 1.9140625, "learning_rate": 0.000497852092470695, "loss": 6.6485, "mean_token_accuracy": 0.11773342937231064, "num_tokens": 10977741.0, "step": 5070 }, { "entropy": 6.7118854999542235, "epoch": 0.5431002193803842, "grad_norm": 1.5390625, "learning_rate": 0.0004978468189569847, "loss": 6.5956, "mean_token_accuracy": 0.12482826039195061, "num_tokens": 10989127.0, "step": 5075 }, { "entropy": 6.6592412948608395, "epoch": 0.5436352934881481, "grad_norm": 1.9140625, "learning_rate": 0.0004978415390086038, "loss": 6.6217, "mean_token_accuracy": 0.11322500184178352, "num_tokens": 10999791.0, "step": 5080 }, { "entropy": 6.783138751983643, "epoch": 0.5441703675959121, "grad_norm": 1.3515625, "learning_rate": 0.0004978362526257047, "loss": 6.6783, "mean_token_accuracy": 0.11360784098505974, "num_tokens": 11010045.0, "step": 5085 }, { "entropy": 6.735276794433593, "epoch": 0.544705441703676, "grad_norm": 1.515625, "learning_rate": 0.0004978309598084403, "loss": 6.6067, "mean_token_accuracy": 0.11822862327098846, "num_tokens": 11020729.0, "step": 5090 }, { "entropy": 6.708194351196289, "epoch": 0.5452405158114398, "grad_norm": 1.40625, "learning_rate": 0.0004978256605569631, "loss": 6.6289, "mean_token_accuracy": 0.1177783451974392, "num_tokens": 11030641.0, "step": 5095 }, { "entropy": 6.784500598907471, "epoch": 0.5457755899192038, "grad_norm": 1.3515625, "learning_rate": 0.0004978203548714262, "loss": 6.6366, "mean_token_accuracy": 0.12379909828305244, "num_tokens": 11041533.0, "step": 5100 }, { "entropy": 6.726690483093262, "epoch": 0.5463106640269677, "grad_norm": 1.265625, "learning_rate": 0.000497815042751983, "loss": 6.58, "mean_token_accuracy": 0.11729968935251237, "num_tokens": 11052170.0, "step": 5105 }, { "entropy": 6.652199029922485, "epoch": 0.5468457381347317, "grad_norm": 1.2421875, "learning_rate": 0.0004978097241987868, "loss": 6.5646, "mean_token_accuracy": 0.1203967772424221, "num_tokens": 11062872.0, "step": 5110 }, { "entropy": 6.719713973999023, "epoch": 0.5473808122424956, "grad_norm": 1.390625, "learning_rate": 0.000497804399211991, "loss": 6.6657, "mean_token_accuracy": 0.11651256605982781, "num_tokens": 11074199.0, "step": 5115 }, { "entropy": 6.7464769840240475, "epoch": 0.5479158863502596, "grad_norm": 1.3046875, "learning_rate": 0.0004977990677917495, "loss": 6.6129, "mean_token_accuracy": 0.11894905865192414, "num_tokens": 11083881.0, "step": 5120 }, { "entropy": 6.6402746677398685, "epoch": 0.5484509604580234, "grad_norm": 1.328125, "learning_rate": 0.0004977937299382162, "loss": 6.6584, "mean_token_accuracy": 0.1151296466588974, "num_tokens": 11094374.0, "step": 5125 }, { "entropy": 6.679858827590943, "epoch": 0.5489860345657873, "grad_norm": 3.578125, "learning_rate": 0.0004977883856515453, "loss": 6.4958, "mean_token_accuracy": 0.1267719380557537, "num_tokens": 11105174.0, "step": 5130 }, { "entropy": 6.751749181747437, "epoch": 0.5495211086735513, "grad_norm": 1.3984375, "learning_rate": 0.000497783034931891, "loss": 6.656, "mean_token_accuracy": 0.11584192886948586, "num_tokens": 11117223.0, "step": 5135 }, { "entropy": 6.7202818393707275, "epoch": 0.5500561827813152, "grad_norm": 1.5234375, "learning_rate": 0.000497777677779408, "loss": 6.579, "mean_token_accuracy": 0.12366545721888542, "num_tokens": 11127240.0, "step": 5140 }, { "entropy": 6.676993894577026, "epoch": 0.5505912568890792, "grad_norm": 1.3828125, "learning_rate": 0.0004977723141942509, "loss": 6.5678, "mean_token_accuracy": 0.1281234510242939, "num_tokens": 11137287.0, "step": 5145 }, { "entropy": 6.7371532917022705, "epoch": 0.551126330996843, "grad_norm": 1.2578125, "learning_rate": 0.0004977669441765743, "loss": 6.7007, "mean_token_accuracy": 0.11768926754593849, "num_tokens": 11148988.0, "step": 5150 }, { "entropy": 6.705612564086914, "epoch": 0.551661405104607, "grad_norm": 1.2734375, "learning_rate": 0.0004977615677265336, "loss": 6.6389, "mean_token_accuracy": 0.12069165110588073, "num_tokens": 11159874.0, "step": 5155 }, { "entropy": 6.73426923751831, "epoch": 0.5521964792123709, "grad_norm": 1.671875, "learning_rate": 0.000497756184844284, "loss": 6.6121, "mean_token_accuracy": 0.12401502057909966, "num_tokens": 11170703.0, "step": 5160 }, { "entropy": 6.744797801971435, "epoch": 0.5527315533201348, "grad_norm": 1.21875, "learning_rate": 0.0004977507955299809, "loss": 6.5001, "mean_token_accuracy": 0.1257123127579689, "num_tokens": 11182230.0, "step": 5165 }, { "entropy": 6.698776006698608, "epoch": 0.5532666274278988, "grad_norm": 1.4140625, "learning_rate": 0.0004977453997837797, "loss": 6.5677, "mean_token_accuracy": 0.10981405228376388, "num_tokens": 11192897.0, "step": 5170 }, { "entropy": 6.682893180847168, "epoch": 0.5538017015356627, "grad_norm": 1.2578125, "learning_rate": 0.0004977399976058366, "loss": 6.6521, "mean_token_accuracy": 0.11399049237370491, "num_tokens": 11203942.0, "step": 5175 }, { "entropy": 6.743161678314209, "epoch": 0.5543367756434266, "grad_norm": 1.203125, "learning_rate": 0.0004977345889963072, "loss": 6.7014, "mean_token_accuracy": 0.11261942982673645, "num_tokens": 11214361.0, "step": 5180 }, { "entropy": 6.6744081497192385, "epoch": 0.5548718497511905, "grad_norm": 1.2890625, "learning_rate": 0.0004977291739553479, "loss": 6.5902, "mean_token_accuracy": 0.12366337925195695, "num_tokens": 11225928.0, "step": 5185 }, { "entropy": 6.682669401168823, "epoch": 0.5554069238589545, "grad_norm": 1.03125, "learning_rate": 0.0004977237524831149, "loss": 6.5444, "mean_token_accuracy": 0.11170822679996491, "num_tokens": 11236660.0, "step": 5190 }, { "entropy": 6.714070177078247, "epoch": 0.5559419979667184, "grad_norm": 1.2734375, "learning_rate": 0.0004977183245797649, "loss": 6.5723, "mean_token_accuracy": 0.1271256498992443, "num_tokens": 11247272.0, "step": 5195 }, { "entropy": 6.77830867767334, "epoch": 0.5564770720744823, "grad_norm": 1.2734375, "learning_rate": 0.0004977128902454547, "loss": 6.6722, "mean_token_accuracy": 0.11327713802456855, "num_tokens": 11258472.0, "step": 5200 }, { "entropy": 6.7154069423675535, "epoch": 0.5570121461822463, "grad_norm": 1.3046875, "learning_rate": 0.0004977074494803409, "loss": 6.5841, "mean_token_accuracy": 0.1255582146346569, "num_tokens": 11268344.0, "step": 5205 }, { "entropy": 6.722737216949463, "epoch": 0.5575472202900101, "grad_norm": 1.2734375, "learning_rate": 0.0004977020022845809, "loss": 6.6762, "mean_token_accuracy": 0.11227439492940902, "num_tokens": 11279931.0, "step": 5210 }, { "entropy": 6.80668683052063, "epoch": 0.5580822943977741, "grad_norm": 1.3125, "learning_rate": 0.0004976965486583318, "loss": 6.6255, "mean_token_accuracy": 0.11421727836132049, "num_tokens": 11290595.0, "step": 5215 }, { "entropy": 6.7050305843353275, "epoch": 0.558617368505538, "grad_norm": 1.6015625, "learning_rate": 0.0004976910886017513, "loss": 6.6411, "mean_token_accuracy": 0.12072176486253738, "num_tokens": 11300774.0, "step": 5220 }, { "entropy": 6.6693981170654295, "epoch": 0.559152442613302, "grad_norm": 1.75, "learning_rate": 0.0004976856221149969, "loss": 6.5309, "mean_token_accuracy": 0.12517891749739646, "num_tokens": 11310288.0, "step": 5225 }, { "entropy": 6.700547170639038, "epoch": 0.5596875167210659, "grad_norm": 1.1484375, "learning_rate": 0.0004976801491982263, "loss": 6.6109, "mean_token_accuracy": 0.11751497983932495, "num_tokens": 11321599.0, "step": 5230 }, { "entropy": 6.786514472961426, "epoch": 0.5602225908288297, "grad_norm": 1.3828125, "learning_rate": 0.0004976746698515977, "loss": 6.6606, "mean_token_accuracy": 0.11887592300772667, "num_tokens": 11331383.0, "step": 5235 }, { "entropy": 6.712525081634522, "epoch": 0.5607576649365937, "grad_norm": 1.2421875, "learning_rate": 0.0004976691840752694, "loss": 6.6195, "mean_token_accuracy": 0.11564537510275841, "num_tokens": 11342085.0, "step": 5240 }, { "entropy": 6.718255138397216, "epoch": 0.5612927390443576, "grad_norm": 1.171875, "learning_rate": 0.0004976636918693996, "loss": 6.6574, "mean_token_accuracy": 0.11577147841453553, "num_tokens": 11354061.0, "step": 5245 }, { "entropy": 6.779119157791138, "epoch": 0.5618278131521216, "grad_norm": 1.3125, "learning_rate": 0.0004976581932341471, "loss": 6.6136, "mean_token_accuracy": 0.12151364013552665, "num_tokens": 11364448.0, "step": 5250 }, { "entropy": 6.769805908203125, "epoch": 0.5623628872598855, "grad_norm": 1.3046875, "learning_rate": 0.0004976526881696706, "loss": 6.5791, "mean_token_accuracy": 0.12037570253014565, "num_tokens": 11374838.0, "step": 5255 }, { "entropy": 6.629622316360473, "epoch": 0.5628979613676495, "grad_norm": 1.25, "learning_rate": 0.0004976471766761288, "loss": 6.6105, "mean_token_accuracy": 0.12379851192235947, "num_tokens": 11385310.0, "step": 5260 }, { "entropy": 6.691438817977906, "epoch": 0.5634330354754133, "grad_norm": 1.6328125, "learning_rate": 0.0004976416587536812, "loss": 6.6142, "mean_token_accuracy": 0.11430059969425202, "num_tokens": 11396590.0, "step": 5265 }, { "entropy": 6.742701053619385, "epoch": 0.5639681095831772, "grad_norm": 1.1875, "learning_rate": 0.0004976361344024871, "loss": 6.5707, "mean_token_accuracy": 0.12226603850722313, "num_tokens": 11407218.0, "step": 5270 }, { "entropy": 6.652452564239502, "epoch": 0.5645031836909412, "grad_norm": 1.5078125, "learning_rate": 0.0004976306036227056, "loss": 6.5931, "mean_token_accuracy": 0.11696631386876107, "num_tokens": 11417716.0, "step": 5275 }, { "entropy": 6.721119165420532, "epoch": 0.5650382577987051, "grad_norm": 1.3515625, "learning_rate": 0.000497625066414497, "loss": 6.6823, "mean_token_accuracy": 0.11784773990511895, "num_tokens": 11428295.0, "step": 5280 }, { "entropy": 6.797392892837524, "epoch": 0.5655733319064691, "grad_norm": 1.21875, "learning_rate": 0.0004976195227780207, "loss": 6.6173, "mean_token_accuracy": 0.11284109130501747, "num_tokens": 11439044.0, "step": 5285 }, { "entropy": 6.779853343963623, "epoch": 0.566108406014233, "grad_norm": 1.3515625, "learning_rate": 0.0004976139727134371, "loss": 6.5497, "mean_token_accuracy": 0.11817987859249116, "num_tokens": 11450029.0, "step": 5290 }, { "entropy": 6.715458774566651, "epoch": 0.566643480121997, "grad_norm": 1.21875, "learning_rate": 0.0004976084162209062, "loss": 6.7264, "mean_token_accuracy": 0.10616886764764785, "num_tokens": 11461190.0, "step": 5295 }, { "entropy": 6.745611715316772, "epoch": 0.5671785542297608, "grad_norm": 1.2421875, "learning_rate": 0.0004976028533005886, "loss": 6.5772, "mean_token_accuracy": 0.11882699206471443, "num_tokens": 11472143.0, "step": 5300 }, { "entropy": 6.771622133255005, "epoch": 0.5677136283375247, "grad_norm": 1.4765625, "learning_rate": 0.0004975972839526449, "loss": 6.7163, "mean_token_accuracy": 0.1069483369588852, "num_tokens": 11483745.0, "step": 5305 }, { "entropy": 6.7719972133636475, "epoch": 0.5682487024452887, "grad_norm": 1.265625, "learning_rate": 0.0004975917081772358, "loss": 6.5791, "mean_token_accuracy": 0.1188987985253334, "num_tokens": 11495695.0, "step": 5310 }, { "entropy": 6.718594884872436, "epoch": 0.5687837765530526, "grad_norm": 1.4140625, "learning_rate": 0.0004975861259745225, "loss": 6.6224, "mean_token_accuracy": 0.11705151796340943, "num_tokens": 11505576.0, "step": 5315 }, { "entropy": 6.661882305145264, "epoch": 0.5693188506608166, "grad_norm": 1.34375, "learning_rate": 0.0004975805373446662, "loss": 6.479, "mean_token_accuracy": 0.12648551389575005, "num_tokens": 11516614.0, "step": 5320 }, { "entropy": 6.7097954750061035, "epoch": 0.5698539247685804, "grad_norm": 1.359375, "learning_rate": 0.000497574942287828, "loss": 6.6111, "mean_token_accuracy": 0.11843594536185265, "num_tokens": 11528032.0, "step": 5325 }, { "entropy": 6.664940547943115, "epoch": 0.5703889988763444, "grad_norm": 1.609375, "learning_rate": 0.0004975693408041697, "loss": 6.6154, "mean_token_accuracy": 0.11421292722225189, "num_tokens": 11538822.0, "step": 5330 }, { "entropy": 6.699612236022949, "epoch": 0.5709240729841083, "grad_norm": 1.34375, "learning_rate": 0.0004975637328938529, "loss": 6.6399, "mean_token_accuracy": 0.11097949370741844, "num_tokens": 11548895.0, "step": 5335 }, { "entropy": 6.714142751693726, "epoch": 0.5714591470918722, "grad_norm": 1.328125, "learning_rate": 0.0004975581185570398, "loss": 6.5215, "mean_token_accuracy": 0.11886597573757171, "num_tokens": 11559613.0, "step": 5340 }, { "entropy": 6.713043832778931, "epoch": 0.5719942211996362, "grad_norm": 1.1640625, "learning_rate": 0.0004975524977938921, "loss": 6.5537, "mean_token_accuracy": 0.12163764908909798, "num_tokens": 11571092.0, "step": 5345 }, { "entropy": 6.692736101150513, "epoch": 0.5725292953074, "grad_norm": 1.4296875, "learning_rate": 0.0004975468706045722, "loss": 6.6814, "mean_token_accuracy": 0.11672013476490975, "num_tokens": 11581448.0, "step": 5350 }, { "entropy": 6.728510904312134, "epoch": 0.573064369415164, "grad_norm": 1.4375, "learning_rate": 0.0004975412369892429, "loss": 6.58, "mean_token_accuracy": 0.12553823739290237, "num_tokens": 11592273.0, "step": 5355 }, { "entropy": 6.757077264785766, "epoch": 0.5735994435229279, "grad_norm": 1.25, "learning_rate": 0.0004975355969480665, "loss": 6.5555, "mean_token_accuracy": 0.125929856300354, "num_tokens": 11602759.0, "step": 5360 }, { "entropy": 6.640834856033325, "epoch": 0.5741345176306919, "grad_norm": 1.3359375, "learning_rate": 0.0004975299504812061, "loss": 6.608, "mean_token_accuracy": 0.11442179679870605, "num_tokens": 11613977.0, "step": 5365 }, { "entropy": 6.71792254447937, "epoch": 0.5746695917384558, "grad_norm": 1.2734375, "learning_rate": 0.0004975242975888246, "loss": 6.636, "mean_token_accuracy": 0.12084050849080086, "num_tokens": 11625425.0, "step": 5370 }, { "entropy": 6.744046688079834, "epoch": 0.5752046658462197, "grad_norm": 1.3671875, "learning_rate": 0.0004975186382710854, "loss": 6.6071, "mean_token_accuracy": 0.11423679888248443, "num_tokens": 11636530.0, "step": 5375 }, { "entropy": 6.741583633422851, "epoch": 0.5757397399539836, "grad_norm": 1.3125, "learning_rate": 0.0004975129725281516, "loss": 6.5856, "mean_token_accuracy": 0.12342779189348221, "num_tokens": 11646516.0, "step": 5380 }, { "entropy": 6.701775741577149, "epoch": 0.5762748140617475, "grad_norm": 1.2890625, "learning_rate": 0.0004975073003601871, "loss": 6.5849, "mean_token_accuracy": 0.11874212771654129, "num_tokens": 11657424.0, "step": 5385 }, { "entropy": 6.704905319213867, "epoch": 0.5768098881695115, "grad_norm": 1.3125, "learning_rate": 0.0004975016217673556, "loss": 6.599, "mean_token_accuracy": 0.12148372679948807, "num_tokens": 11669447.0, "step": 5390 }, { "entropy": 6.697764110565186, "epoch": 0.5773449622772754, "grad_norm": 1.4140625, "learning_rate": 0.000497495936749821, "loss": 6.5675, "mean_token_accuracy": 0.12611041441559792, "num_tokens": 11679612.0, "step": 5395 }, { "entropy": 6.683344936370849, "epoch": 0.5778800363850394, "grad_norm": 1.3046875, "learning_rate": 0.0004974902453077474, "loss": 6.5514, "mean_token_accuracy": 0.1218061052262783, "num_tokens": 11689527.0, "step": 5400 }, { "entropy": 6.765136861801148, "epoch": 0.5784151104928033, "grad_norm": 1.3671875, "learning_rate": 0.0004974845474412993, "loss": 6.5856, "mean_token_accuracy": 0.12035764157772064, "num_tokens": 11700452.0, "step": 5405 }, { "entropy": 6.700014257431031, "epoch": 0.5789501846005671, "grad_norm": 1.625, "learning_rate": 0.0004974788431506412, "loss": 6.5971, "mean_token_accuracy": 0.1191385418176651, "num_tokens": 11710902.0, "step": 5410 }, { "entropy": 6.735801887512207, "epoch": 0.5794852587083311, "grad_norm": 1.484375, "learning_rate": 0.0004974731324359378, "loss": 6.6328, "mean_token_accuracy": 0.10948319584131241, "num_tokens": 11721901.0, "step": 5415 }, { "entropy": 6.765271472930908, "epoch": 0.580020332816095, "grad_norm": 1.2421875, "learning_rate": 0.0004974674152973538, "loss": 6.6146, "mean_token_accuracy": 0.11682233065366746, "num_tokens": 11733622.0, "step": 5420 }, { "entropy": 6.789870738983154, "epoch": 0.580555406923859, "grad_norm": 1.3359375, "learning_rate": 0.0004974616917350545, "loss": 6.6101, "mean_token_accuracy": 0.11982190161943436, "num_tokens": 11745116.0, "step": 5425 }, { "entropy": 6.661038208007812, "epoch": 0.5810904810316229, "grad_norm": 1.28125, "learning_rate": 0.0004974559617492052, "loss": 6.5446, "mean_token_accuracy": 0.12379105761647224, "num_tokens": 11756203.0, "step": 5430 }, { "entropy": 6.719126272201538, "epoch": 0.5816255551393869, "grad_norm": 1.375, "learning_rate": 0.0004974502253399712, "loss": 6.6041, "mean_token_accuracy": 0.12229030430316926, "num_tokens": 11766797.0, "step": 5435 }, { "entropy": 6.752104377746582, "epoch": 0.5821606292471507, "grad_norm": 1.3359375, "learning_rate": 0.0004974444825075182, "loss": 6.6896, "mean_token_accuracy": 0.11470270082354546, "num_tokens": 11778110.0, "step": 5440 }, { "entropy": 6.6274865627288815, "epoch": 0.5826957033549146, "grad_norm": 1.59375, "learning_rate": 0.000497438733252012, "loss": 6.551, "mean_token_accuracy": 0.12010784074664116, "num_tokens": 11788396.0, "step": 5445 }, { "entropy": 6.7564613819122314, "epoch": 0.5832307774626786, "grad_norm": 2.53125, "learning_rate": 0.0004974329775736188, "loss": 6.6412, "mean_token_accuracy": 0.1130734585225582, "num_tokens": 11798691.0, "step": 5450 }, { "entropy": 6.8176110744476315, "epoch": 0.5837658515704425, "grad_norm": 1.421875, "learning_rate": 0.0004974272154725044, "loss": 6.6809, "mean_token_accuracy": 0.1145077645778656, "num_tokens": 11808965.0, "step": 5455 }, { "entropy": 6.655050134658813, "epoch": 0.5843009256782065, "grad_norm": 1.3359375, "learning_rate": 0.0004974214469488355, "loss": 6.5144, "mean_token_accuracy": 0.12288807928562165, "num_tokens": 11819932.0, "step": 5460 }, { "entropy": 6.678020906448364, "epoch": 0.5848359997859703, "grad_norm": 1.5078125, "learning_rate": 0.0004974156720027786, "loss": 6.6115, "mean_token_accuracy": 0.11556534245610237, "num_tokens": 11831332.0, "step": 5465 }, { "entropy": 6.728974628448486, "epoch": 0.5853710738937343, "grad_norm": 1.53125, "learning_rate": 0.0004974098906345004, "loss": 6.5811, "mean_token_accuracy": 0.11275865510106087, "num_tokens": 11840947.0, "step": 5470 }, { "entropy": 6.7000159740448, "epoch": 0.5859061480014982, "grad_norm": 1.3046875, "learning_rate": 0.0004974041028441679, "loss": 6.5377, "mean_token_accuracy": 0.11802567318081855, "num_tokens": 11851640.0, "step": 5475 }, { "entropy": 6.733285045623779, "epoch": 0.5864412221092621, "grad_norm": 1.375, "learning_rate": 0.0004973983086319481, "loss": 6.6649, "mean_token_accuracy": 0.11307286396622658, "num_tokens": 11863608.0, "step": 5480 }, { "entropy": 6.722926664352417, "epoch": 0.5869762962170261, "grad_norm": 1.125, "learning_rate": 0.0004973925079980085, "loss": 6.5586, "mean_token_accuracy": 0.11841953471302986, "num_tokens": 11874707.0, "step": 5485 }, { "entropy": 6.687315177917481, "epoch": 0.58751137032479, "grad_norm": 1.59375, "learning_rate": 0.0004973867009425164, "loss": 6.659, "mean_token_accuracy": 0.11953919008374214, "num_tokens": 11885118.0, "step": 5490 }, { "entropy": 6.783655786514283, "epoch": 0.5880464444325539, "grad_norm": 1.2578125, "learning_rate": 0.0004973808874656396, "loss": 6.6231, "mean_token_accuracy": 0.11821292191743851, "num_tokens": 11895859.0, "step": 5495 }, { "entropy": 6.7643838882446286, "epoch": 0.5885815185403178, "grad_norm": 1.28125, "learning_rate": 0.0004973750675675458, "loss": 6.64, "mean_token_accuracy": 0.11871552392840386, "num_tokens": 11907019.0, "step": 5500 }, { "entropy": 6.729001569747925, "epoch": 0.5891165926480818, "grad_norm": 1.125, "learning_rate": 0.0004973692412484034, "loss": 6.5712, "mean_token_accuracy": 0.1146469995379448, "num_tokens": 11918257.0, "step": 5505 }, { "entropy": 6.721626091003418, "epoch": 0.5896516667558457, "grad_norm": 1.6015625, "learning_rate": 0.0004973634085083802, "loss": 6.5975, "mean_token_accuracy": 0.12574032694101334, "num_tokens": 11929003.0, "step": 5510 }, { "entropy": 6.757476425170898, "epoch": 0.5901867408636096, "grad_norm": 1.1640625, "learning_rate": 0.000497357569347645, "loss": 6.7213, "mean_token_accuracy": 0.11348426267504692, "num_tokens": 11939786.0, "step": 5515 }, { "entropy": 6.751842021942139, "epoch": 0.5907218149713735, "grad_norm": 1.1640625, "learning_rate": 0.0004973517237663661, "loss": 6.6311, "mean_token_accuracy": 0.11161758229136468, "num_tokens": 11951042.0, "step": 5520 }, { "entropy": 6.710853910446167, "epoch": 0.5912568890791374, "grad_norm": 1.953125, "learning_rate": 0.0004973458717647124, "loss": 6.5283, "mean_token_accuracy": 0.12709658294916154, "num_tokens": 11961982.0, "step": 5525 }, { "entropy": 6.703456449508667, "epoch": 0.5917919631869014, "grad_norm": 1.2890625, "learning_rate": 0.000497340013342853, "loss": 6.5923, "mean_token_accuracy": 0.12106578648090363, "num_tokens": 11972078.0, "step": 5530 }, { "entropy": 6.719264888763428, "epoch": 0.5923270372946653, "grad_norm": 1.609375, "learning_rate": 0.000497334148500957, "loss": 6.6446, "mean_token_accuracy": 0.11806860640645027, "num_tokens": 11984037.0, "step": 5535 }, { "entropy": 6.7681842803955075, "epoch": 0.5928621114024293, "grad_norm": 1.2890625, "learning_rate": 0.0004973282772391936, "loss": 6.5852, "mean_token_accuracy": 0.11801839917898178, "num_tokens": 11993688.0, "step": 5540 }, { "entropy": 6.667469120025634, "epoch": 0.5933971855101932, "grad_norm": 1.328125, "learning_rate": 0.0004973223995577324, "loss": 6.5477, "mean_token_accuracy": 0.11981470957398414, "num_tokens": 12003759.0, "step": 5545 }, { "entropy": 6.715129756927491, "epoch": 0.593932259617957, "grad_norm": 1.3125, "learning_rate": 0.0004973165154567432, "loss": 6.5858, "mean_token_accuracy": 0.1203451156616211, "num_tokens": 12015030.0, "step": 5550 }, { "entropy": 6.72750506401062, "epoch": 0.594467333725721, "grad_norm": 1.140625, "learning_rate": 0.0004973106249363959, "loss": 6.6509, "mean_token_accuracy": 0.11390956789255142, "num_tokens": 12026181.0, "step": 5555 }, { "entropy": 6.618847751617432, "epoch": 0.5950024078334849, "grad_norm": 1.28125, "learning_rate": 0.0004973047279968606, "loss": 6.4185, "mean_token_accuracy": 0.13287391439080237, "num_tokens": 12037336.0, "step": 5560 }, { "entropy": 6.65236268043518, "epoch": 0.5955374819412489, "grad_norm": 1.234375, "learning_rate": 0.0004972988246383074, "loss": 6.4918, "mean_token_accuracy": 0.12340264916419982, "num_tokens": 12048425.0, "step": 5565 }, { "entropy": 6.557363128662109, "epoch": 0.5960725560490128, "grad_norm": 1.65625, "learning_rate": 0.0004972929148609068, "loss": 6.4594, "mean_token_accuracy": 0.13635959550738336, "num_tokens": 12059814.0, "step": 5570 }, { "entropy": 6.68271279335022, "epoch": 0.5966076301567768, "grad_norm": 1.59375, "learning_rate": 0.0004972869986648296, "loss": 6.54, "mean_token_accuracy": 0.12527887672185897, "num_tokens": 12069377.0, "step": 5575 }, { "entropy": 6.707939195632934, "epoch": 0.5971427042645406, "grad_norm": 1.2890625, "learning_rate": 0.0004972810760502467, "loss": 6.666, "mean_token_accuracy": 0.11514274403452873, "num_tokens": 12080277.0, "step": 5580 }, { "entropy": 6.727867317199707, "epoch": 0.5976777783723045, "grad_norm": 1.21875, "learning_rate": 0.0004972751470173287, "loss": 6.5453, "mean_token_accuracy": 0.12022876664996147, "num_tokens": 12091375.0, "step": 5585 }, { "entropy": 6.676542520523071, "epoch": 0.5982128524800685, "grad_norm": 1.203125, "learning_rate": 0.0004972692115662473, "loss": 6.5893, "mean_token_accuracy": 0.11981748417019844, "num_tokens": 12103110.0, "step": 5590 }, { "entropy": 6.751420688629151, "epoch": 0.5987479265878324, "grad_norm": 1.7421875, "learning_rate": 0.0004972632696971735, "loss": 6.6451, "mean_token_accuracy": 0.11599904671311378, "num_tokens": 12112454.0, "step": 5595 }, { "entropy": 6.6340423107147215, "epoch": 0.5992830006955964, "grad_norm": 1.28125, "learning_rate": 0.0004972573214102791, "loss": 6.5246, "mean_token_accuracy": 0.11687616854906083, "num_tokens": 12125140.0, "step": 5600 }, { "entropy": 6.698513317108154, "epoch": 0.5998180748033602, "grad_norm": 1.8046875, "learning_rate": 0.0004972513667057358, "loss": 6.5691, "mean_token_accuracy": 0.12039392963051795, "num_tokens": 12136061.0, "step": 5605 }, { "entropy": 6.791307878494263, "epoch": 0.6003531489111242, "grad_norm": 1.171875, "learning_rate": 0.0004972454055837155, "loss": 6.6003, "mean_token_accuracy": 0.12150818780064583, "num_tokens": 12146654.0, "step": 5610 }, { "entropy": 6.723158931732177, "epoch": 0.6008882230188881, "grad_norm": 1.390625, "learning_rate": 0.0004972394380443903, "loss": 6.5878, "mean_token_accuracy": 0.11757106855511665, "num_tokens": 12157881.0, "step": 5615 }, { "entropy": 6.675697088241577, "epoch": 0.601423297126652, "grad_norm": 1.671875, "learning_rate": 0.0004972334640879325, "loss": 6.6085, "mean_token_accuracy": 0.11922492906451225, "num_tokens": 12168534.0, "step": 5620 }, { "entropy": 6.661304664611817, "epoch": 0.601958371234416, "grad_norm": 1.2421875, "learning_rate": 0.0004972274837145147, "loss": 6.5432, "mean_token_accuracy": 0.11988529115915299, "num_tokens": 12178773.0, "step": 5625 }, { "entropy": 6.739487743377685, "epoch": 0.6024934453421799, "grad_norm": 1.1875, "learning_rate": 0.0004972214969243096, "loss": 6.5808, "mean_token_accuracy": 0.11824664920568466, "num_tokens": 12188819.0, "step": 5630 }, { "entropy": 6.660564947128296, "epoch": 0.6030285194499438, "grad_norm": 1.2265625, "learning_rate": 0.00049721550371749, "loss": 6.5607, "mean_token_accuracy": 0.12463830485939979, "num_tokens": 12199198.0, "step": 5635 }, { "entropy": 6.6687784671783445, "epoch": 0.6035635935577077, "grad_norm": 1.1015625, "learning_rate": 0.0004972095040942289, "loss": 6.5644, "mean_token_accuracy": 0.1162213332951069, "num_tokens": 12210765.0, "step": 5640 }, { "entropy": 6.709344291687012, "epoch": 0.6040986676654717, "grad_norm": 1.71875, "learning_rate": 0.0004972034980546996, "loss": 6.6061, "mean_token_accuracy": 0.11544334441423416, "num_tokens": 12221067.0, "step": 5645 }, { "entropy": 6.653585481643677, "epoch": 0.6046337417732356, "grad_norm": 1.1875, "learning_rate": 0.0004971974855990755, "loss": 6.6023, "mean_token_accuracy": 0.11971136629581451, "num_tokens": 12232994.0, "step": 5650 }, { "entropy": 6.738733911514283, "epoch": 0.6051688158809995, "grad_norm": 1.4140625, "learning_rate": 0.0004971914667275302, "loss": 6.5538, "mean_token_accuracy": 0.12072688415646553, "num_tokens": 12243327.0, "step": 5655 }, { "entropy": 6.6140237808227536, "epoch": 0.6057038899887635, "grad_norm": 1.21875, "learning_rate": 0.0004971854414402377, "loss": 6.4752, "mean_token_accuracy": 0.12842355743050576, "num_tokens": 12254249.0, "step": 5660 }, { "entropy": 6.662600469589234, "epoch": 0.6062389640965273, "grad_norm": 1.296875, "learning_rate": 0.0004971794097373716, "loss": 6.5208, "mean_token_accuracy": 0.12328208535909653, "num_tokens": 12264487.0, "step": 5665 }, { "entropy": 6.569520473480225, "epoch": 0.6067740382042913, "grad_norm": 1.375, "learning_rate": 0.0004971733716191063, "loss": 6.5189, "mean_token_accuracy": 0.1292000360786915, "num_tokens": 12274801.0, "step": 5670 }, { "entropy": 6.636984205245971, "epoch": 0.6073091123120552, "grad_norm": 1.4375, "learning_rate": 0.0004971673270856162, "loss": 6.4777, "mean_token_accuracy": 0.11988460049033164, "num_tokens": 12284647.0, "step": 5675 }, { "entropy": 6.658068609237671, "epoch": 0.6078441864198192, "grad_norm": 1.2578125, "learning_rate": 0.0004971612761370756, "loss": 6.6033, "mean_token_accuracy": 0.11951280906796455, "num_tokens": 12295215.0, "step": 5680 }, { "entropy": 6.673429822921753, "epoch": 0.6083792605275831, "grad_norm": 1.4609375, "learning_rate": 0.0004971552187736596, "loss": 6.516, "mean_token_accuracy": 0.12064156159758568, "num_tokens": 12305324.0, "step": 5685 }, { "entropy": 6.668921661376953, "epoch": 0.6089143346353469, "grad_norm": 1.4375, "learning_rate": 0.0004971491549955427, "loss": 6.5372, "mean_token_accuracy": 0.12246538251638413, "num_tokens": 12316399.0, "step": 5690 }, { "entropy": 6.6165331363677975, "epoch": 0.6094494087431109, "grad_norm": 1.2265625, "learning_rate": 0.0004971430848029002, "loss": 6.5219, "mean_token_accuracy": 0.12773501947522165, "num_tokens": 12328033.0, "step": 5695 }, { "entropy": 6.681158256530762, "epoch": 0.6099844828508748, "grad_norm": 1.3984375, "learning_rate": 0.0004971370081959073, "loss": 6.5622, "mean_token_accuracy": 0.12176148667931556, "num_tokens": 12338962.0, "step": 5700 }, { "entropy": 6.697946166992187, "epoch": 0.6105195569586388, "grad_norm": 1.6328125, "learning_rate": 0.0004971309251747396, "loss": 6.5526, "mean_token_accuracy": 0.11940340176224709, "num_tokens": 12350216.0, "step": 5705 }, { "entropy": 6.745215272903442, "epoch": 0.6110546310664027, "grad_norm": 1.171875, "learning_rate": 0.0004971248357395726, "loss": 6.5806, "mean_token_accuracy": 0.11893382146954537, "num_tokens": 12361277.0, "step": 5710 }, { "entropy": 6.580714225769043, "epoch": 0.6115897051741667, "grad_norm": 1.4765625, "learning_rate": 0.0004971187398905821, "loss": 6.4858, "mean_token_accuracy": 0.12100339159369469, "num_tokens": 12373308.0, "step": 5715 }, { "entropy": 6.731028461456299, "epoch": 0.6121247792819305, "grad_norm": 1.3203125, "learning_rate": 0.0004971126376279443, "loss": 6.7259, "mean_token_accuracy": 0.11148046106100082, "num_tokens": 12383943.0, "step": 5720 }, { "entropy": 6.721910047531128, "epoch": 0.6126598533896944, "grad_norm": 1.3125, "learning_rate": 0.0004971065289518354, "loss": 6.482, "mean_token_accuracy": 0.12279203087091446, "num_tokens": 12394575.0, "step": 5725 }, { "entropy": 6.715807628631592, "epoch": 0.6131949274974584, "grad_norm": 1.265625, "learning_rate": 0.0004971004138624315, "loss": 6.5895, "mean_token_accuracy": 0.11779340729117393, "num_tokens": 12405536.0, "step": 5730 }, { "entropy": 6.606629800796509, "epoch": 0.6137300016052223, "grad_norm": 1.7109375, "learning_rate": 0.0004970942923599094, "loss": 6.4743, "mean_token_accuracy": 0.12641754895448684, "num_tokens": 12416148.0, "step": 5735 }, { "entropy": 6.612427473068237, "epoch": 0.6142650757129863, "grad_norm": 1.3828125, "learning_rate": 0.0004970881644444459, "loss": 6.48, "mean_token_accuracy": 0.12701191157102584, "num_tokens": 12426182.0, "step": 5740 }, { "entropy": 6.647663402557373, "epoch": 0.6148001498207502, "grad_norm": 1.1796875, "learning_rate": 0.0004970820301162178, "loss": 6.6625, "mean_token_accuracy": 0.11574866473674775, "num_tokens": 12437548.0, "step": 5745 }, { "entropy": 6.737516117095947, "epoch": 0.6153352239285141, "grad_norm": 1.7890625, "learning_rate": 0.0004970758893754022, "loss": 6.5979, "mean_token_accuracy": 0.11561758294701577, "num_tokens": 12449720.0, "step": 5750 }, { "entropy": 6.817887496948242, "epoch": 0.615870298036278, "grad_norm": 1.140625, "learning_rate": 0.0004970697422221767, "loss": 6.574, "mean_token_accuracy": 0.1215938724577427, "num_tokens": 12460666.0, "step": 5755 }, { "entropy": 6.7063861846923825, "epoch": 0.6164053721440419, "grad_norm": 1.3125, "learning_rate": 0.0004970635886567185, "loss": 6.5911, "mean_token_accuracy": 0.12281558737158775, "num_tokens": 12471472.0, "step": 5760 }, { "entropy": 6.611774969100952, "epoch": 0.6169404462518059, "grad_norm": 2.953125, "learning_rate": 0.0004970574286792054, "loss": 6.5681, "mean_token_accuracy": 0.11770694702863693, "num_tokens": 12482127.0, "step": 5765 }, { "entropy": 6.611656904220581, "epoch": 0.6174755203595698, "grad_norm": 1.34375, "learning_rate": 0.0004970512622898152, "loss": 6.5767, "mean_token_accuracy": 0.12225481644272804, "num_tokens": 12493680.0, "step": 5770 }, { "entropy": 6.65736231803894, "epoch": 0.6180105944673338, "grad_norm": 1.2734375, "learning_rate": 0.000497045089488726, "loss": 6.523, "mean_token_accuracy": 0.12167870178818703, "num_tokens": 12505838.0, "step": 5775 }, { "entropy": 6.704753160476685, "epoch": 0.6185456685750976, "grad_norm": 1.5078125, "learning_rate": 0.0004970389102761161, "loss": 6.5102, "mean_token_accuracy": 0.12942416369915008, "num_tokens": 12516334.0, "step": 5780 }, { "entropy": 6.661266231536866, "epoch": 0.6190807426828616, "grad_norm": 1.3984375, "learning_rate": 0.0004970327246521638, "loss": 6.5879, "mean_token_accuracy": 0.12000072821974754, "num_tokens": 12526440.0, "step": 5785 }, { "entropy": 6.680879926681518, "epoch": 0.6196158167906255, "grad_norm": 1.359375, "learning_rate": 0.0004970265326170478, "loss": 6.5266, "mean_token_accuracy": 0.11807752102613449, "num_tokens": 12538127.0, "step": 5790 }, { "entropy": 6.722283792495728, "epoch": 0.6201508908983894, "grad_norm": 1.34375, "learning_rate": 0.0004970203341709469, "loss": 6.5914, "mean_token_accuracy": 0.12216417640447616, "num_tokens": 12548459.0, "step": 5795 }, { "entropy": 6.58387131690979, "epoch": 0.6206859650061534, "grad_norm": 1.28125, "learning_rate": 0.00049701412931404, "loss": 6.5481, "mean_token_accuracy": 0.12659149914979934, "num_tokens": 12558989.0, "step": 5800 }, { "entropy": 6.62721471786499, "epoch": 0.6212210391139172, "grad_norm": 1.2109375, "learning_rate": 0.0004970079180465064, "loss": 6.4916, "mean_token_accuracy": 0.1283690959215164, "num_tokens": 12569449.0, "step": 5805 }, { "entropy": 6.644355916976929, "epoch": 0.6217561132216812, "grad_norm": 1.296875, "learning_rate": 0.0004970017003685253, "loss": 6.5297, "mean_token_accuracy": 0.12029706984758377, "num_tokens": 12580733.0, "step": 5810 }, { "entropy": 6.65497670173645, "epoch": 0.6222911873294451, "grad_norm": 1.3203125, "learning_rate": 0.0004969954762802763, "loss": 6.5326, "mean_token_accuracy": 0.11786738261580468, "num_tokens": 12590869.0, "step": 5815 }, { "entropy": 6.706523609161377, "epoch": 0.6228262614372091, "grad_norm": 1.40625, "learning_rate": 0.000496989245781939, "loss": 6.6305, "mean_token_accuracy": 0.11878098174929619, "num_tokens": 12602109.0, "step": 5820 }, { "entropy": 6.690067100524902, "epoch": 0.623361335544973, "grad_norm": 1.2578125, "learning_rate": 0.0004969830088736937, "loss": 6.5463, "mean_token_accuracy": 0.11708159074187278, "num_tokens": 12612234.0, "step": 5825 }, { "entropy": 6.761075687408447, "epoch": 0.6238964096527368, "grad_norm": 1.3125, "learning_rate": 0.00049697676555572, "loss": 6.6967, "mean_token_accuracy": 0.11268940791487694, "num_tokens": 12623252.0, "step": 5830 }, { "entropy": 6.709875154495239, "epoch": 0.6244314837605008, "grad_norm": 1.25, "learning_rate": 0.0004969705158281985, "loss": 6.4508, "mean_token_accuracy": 0.12307255640625954, "num_tokens": 12632796.0, "step": 5835 }, { "entropy": 6.652636289596558, "epoch": 0.6249665578682647, "grad_norm": 1.65625, "learning_rate": 0.0004969642596913095, "loss": 6.5512, "mean_token_accuracy": 0.11847778558731079, "num_tokens": 12643278.0, "step": 5840 }, { "entropy": 6.670278692245484, "epoch": 0.6255016319760287, "grad_norm": 5.25, "learning_rate": 0.0004969579971452337, "loss": 6.6218, "mean_token_accuracy": 0.12104167938232421, "num_tokens": 12654446.0, "step": 5845 }, { "entropy": 6.704672002792359, "epoch": 0.6260367060837926, "grad_norm": 1.4296875, "learning_rate": 0.0004969517281901519, "loss": 6.5988, "mean_token_accuracy": 0.12173526436090469, "num_tokens": 12664281.0, "step": 5850 }, { "entropy": 6.726960182189941, "epoch": 0.6265717801915566, "grad_norm": 1.671875, "learning_rate": 0.0004969454528262451, "loss": 6.5829, "mean_token_accuracy": 0.11787922754883766, "num_tokens": 12675252.0, "step": 5855 }, { "entropy": 6.665972471237183, "epoch": 0.6271068542993204, "grad_norm": 1.9765625, "learning_rate": 0.0004969391710536946, "loss": 6.5794, "mean_token_accuracy": 0.1184937097132206, "num_tokens": 12685764.0, "step": 5860 }, { "entropy": 6.591383934020996, "epoch": 0.6276419284070843, "grad_norm": 1.6328125, "learning_rate": 0.0004969328828726817, "loss": 6.4757, "mean_token_accuracy": 0.12730447500944136, "num_tokens": 12696974.0, "step": 5865 }, { "entropy": 6.757170295715332, "epoch": 0.6281770025148483, "grad_norm": 1.453125, "learning_rate": 0.0004969265882833879, "loss": 6.6372, "mean_token_accuracy": 0.11200533658266068, "num_tokens": 12708217.0, "step": 5870 }, { "entropy": 6.707298660278321, "epoch": 0.6287120766226122, "grad_norm": 1.6953125, "learning_rate": 0.0004969202872859952, "loss": 6.516, "mean_token_accuracy": 0.12099341303110123, "num_tokens": 12717840.0, "step": 5875 }, { "entropy": 6.622361516952514, "epoch": 0.6292471507303762, "grad_norm": 1.3828125, "learning_rate": 0.0004969139798806854, "loss": 6.6088, "mean_token_accuracy": 0.11309082061052322, "num_tokens": 12728390.0, "step": 5880 }, { "entropy": 6.653683233261108, "epoch": 0.6297822248381401, "grad_norm": 1.2734375, "learning_rate": 0.0004969076660676405, "loss": 6.6113, "mean_token_accuracy": 0.11578750982880592, "num_tokens": 12738650.0, "step": 5885 }, { "entropy": 6.735027837753296, "epoch": 0.630317298945904, "grad_norm": 1.484375, "learning_rate": 0.000496901345847043, "loss": 6.5966, "mean_token_accuracy": 0.11822382658720017, "num_tokens": 12748989.0, "step": 5890 }, { "entropy": 6.689414024353027, "epoch": 0.6308523730536679, "grad_norm": 1.2578125, "learning_rate": 0.0004968950192190752, "loss": 6.559, "mean_token_accuracy": 0.12090246379375458, "num_tokens": 12761132.0, "step": 5895 }, { "entropy": 6.6849761486053465, "epoch": 0.6313874471614318, "grad_norm": 1.25, "learning_rate": 0.00049688868618392, "loss": 6.5651, "mean_token_accuracy": 0.1228780284523964, "num_tokens": 12771478.0, "step": 5900 }, { "entropy": 6.716721773147583, "epoch": 0.6319225212691958, "grad_norm": 1.2109375, "learning_rate": 0.0004968823467417602, "loss": 6.6244, "mean_token_accuracy": 0.1174764983355999, "num_tokens": 12782096.0, "step": 5905 }, { "entropy": 6.716968536376953, "epoch": 0.6324575953769597, "grad_norm": 1.171875, "learning_rate": 0.0004968760008927788, "loss": 6.5262, "mean_token_accuracy": 0.12529518380761145, "num_tokens": 12792467.0, "step": 5910 }, { "entropy": 6.6767195701599125, "epoch": 0.6329926694847237, "grad_norm": 1.25, "learning_rate": 0.000496869648637159, "loss": 6.5373, "mean_token_accuracy": 0.12640023306012155, "num_tokens": 12803248.0, "step": 5915 }, { "entropy": 6.697324562072754, "epoch": 0.6335277435924875, "grad_norm": 1.3125, "learning_rate": 0.0004968632899750844, "loss": 6.5591, "mean_token_accuracy": 0.12147547379136085, "num_tokens": 12813701.0, "step": 5920 }, { "entropy": 6.800759792327881, "epoch": 0.6340628177002515, "grad_norm": 1.4453125, "learning_rate": 0.0004968569249067383, "loss": 6.6272, "mean_token_accuracy": 0.11679861545562745, "num_tokens": 12824945.0, "step": 5925 }, { "entropy": 6.671930313110352, "epoch": 0.6345978918080154, "grad_norm": 1.09375, "learning_rate": 0.0004968505534323047, "loss": 6.5786, "mean_token_accuracy": 0.1162982702255249, "num_tokens": 12836699.0, "step": 5930 }, { "entropy": 6.6336596488952635, "epoch": 0.6351329659157794, "grad_norm": 1.28125, "learning_rate": 0.0004968441755519677, "loss": 6.5291, "mean_token_accuracy": 0.11951676458120346, "num_tokens": 12846905.0, "step": 5935 }, { "entropy": 6.7043437480926515, "epoch": 0.6356680400235433, "grad_norm": 1.375, "learning_rate": 0.0004968377912659112, "loss": 6.5001, "mean_token_accuracy": 0.12340181395411491, "num_tokens": 12856919.0, "step": 5940 }, { "entropy": 6.60842661857605, "epoch": 0.6362031141313071, "grad_norm": 1.7109375, "learning_rate": 0.0004968314005743196, "loss": 6.4565, "mean_token_accuracy": 0.12368626967072487, "num_tokens": 12867863.0, "step": 5945 }, { "entropy": 6.611450290679931, "epoch": 0.6367381882390711, "grad_norm": 1.1796875, "learning_rate": 0.0004968250034773776, "loss": 6.5429, "mean_token_accuracy": 0.12223007977008819, "num_tokens": 12877877.0, "step": 5950 }, { "entropy": 6.737860918045044, "epoch": 0.637273262346835, "grad_norm": 1.59375, "learning_rate": 0.0004968185999752697, "loss": 6.6383, "mean_token_accuracy": 0.11434445828199387, "num_tokens": 12887954.0, "step": 5955 }, { "entropy": 6.707271003723145, "epoch": 0.637808336454599, "grad_norm": 1.1875, "learning_rate": 0.0004968121900681809, "loss": 6.5511, "mean_token_accuracy": 0.12070679739117622, "num_tokens": 12897744.0, "step": 5960 }, { "entropy": 6.68266224861145, "epoch": 0.6383434105623629, "grad_norm": 1.640625, "learning_rate": 0.0004968057737562964, "loss": 6.617, "mean_token_accuracy": 0.12236501500010491, "num_tokens": 12909193.0, "step": 5965 }, { "entropy": 6.663351440429688, "epoch": 0.6388784846701269, "grad_norm": 1.3125, "learning_rate": 0.0004967993510398012, "loss": 6.4973, "mean_token_accuracy": 0.12318923175334931, "num_tokens": 12919879.0, "step": 5970 }, { "entropy": 6.623578882217407, "epoch": 0.6394135587778907, "grad_norm": 1.2734375, "learning_rate": 0.0004967929219188809, "loss": 6.5387, "mean_token_accuracy": 0.12540650963783265, "num_tokens": 12930297.0, "step": 5975 }, { "entropy": 6.649103832244873, "epoch": 0.6399486328856546, "grad_norm": 1.375, "learning_rate": 0.0004967864863937212, "loss": 6.5329, "mean_token_accuracy": 0.12860941588878633, "num_tokens": 12940467.0, "step": 5980 }, { "entropy": 6.6491728782653805, "epoch": 0.6404837069934186, "grad_norm": 1.4296875, "learning_rate": 0.0004967800444645079, "loss": 6.5204, "mean_token_accuracy": 0.11868370845913886, "num_tokens": 12950417.0, "step": 5985 }, { "entropy": 6.636889123916626, "epoch": 0.6410187811011825, "grad_norm": 1.4765625, "learning_rate": 0.0004967735961314269, "loss": 6.4761, "mean_token_accuracy": 0.122308399528265, "num_tokens": 12960957.0, "step": 5990 }, { "entropy": 6.666227865219116, "epoch": 0.6415538552089465, "grad_norm": 1.125, "learning_rate": 0.0004967671413946646, "loss": 6.575, "mean_token_accuracy": 0.12026591822504998, "num_tokens": 12971194.0, "step": 5995 }, { "entropy": 6.6303346157073975, "epoch": 0.6420889293167104, "grad_norm": 1.5390625, "learning_rate": 0.0004967606802544071, "loss": 6.5736, "mean_token_accuracy": 0.11933250203728676, "num_tokens": 12982479.0, "step": 6000 }, { "epoch": 0.6420889293167104, "eval_entropy": 6.587495564643263, "eval_loss": 6.633632183074951, "eval_mean_token_accuracy": 0.123240454485414, "eval_num_tokens": 12982479.0, "eval_runtime": 22.6134, "eval_samples_per_second": 1312.45, "eval_steps_per_second": 164.062, "step": 6000 }, { "entropy": 6.708343410491944, "epoch": 0.6426240034244743, "grad_norm": 1.2578125, "learning_rate": 0.0004967542127108412, "loss": 6.6257, "mean_token_accuracy": 0.1161632239818573, "num_tokens": 12994119.0, "step": 6005 }, { "entropy": 6.693649530410767, "epoch": 0.6431590775322382, "grad_norm": 1.140625, "learning_rate": 0.0004967477387641537, "loss": 6.5309, "mean_token_accuracy": 0.1253574460744858, "num_tokens": 13005437.0, "step": 6010 }, { "entropy": 6.6332213401794435, "epoch": 0.6436941516400021, "grad_norm": 1.65625, "learning_rate": 0.0004967412584145312, "loss": 6.555, "mean_token_accuracy": 0.12132607325911522, "num_tokens": 13017278.0, "step": 6015 }, { "entropy": 6.6542360305786135, "epoch": 0.6442292257477661, "grad_norm": 1.21875, "learning_rate": 0.0004967347716621611, "loss": 6.5282, "mean_token_accuracy": 0.12165799587965012, "num_tokens": 13028010.0, "step": 6020 }, { "entropy": 6.629656457901001, "epoch": 0.64476429985553, "grad_norm": 1.1484375, "learning_rate": 0.0004967282785072306, "loss": 6.5233, "mean_token_accuracy": 0.12609869465231896, "num_tokens": 13038740.0, "step": 6025 }, { "entropy": 6.6070208072662355, "epoch": 0.645299373963294, "grad_norm": 1.203125, "learning_rate": 0.0004967217789499272, "loss": 6.543, "mean_token_accuracy": 0.12261505052447319, "num_tokens": 13049921.0, "step": 6030 }, { "entropy": 6.6102134704589846, "epoch": 0.6458344480710578, "grad_norm": 1.5, "learning_rate": 0.0004967152729904386, "loss": 6.4664, "mean_token_accuracy": 0.12932628467679025, "num_tokens": 13060907.0, "step": 6035 }, { "entropy": 6.6852294445037845, "epoch": 0.6463695221788218, "grad_norm": 1.1875, "learning_rate": 0.0004967087606289527, "loss": 6.501, "mean_token_accuracy": 0.12574908435344695, "num_tokens": 13071720.0, "step": 6040 }, { "entropy": 6.666558074951172, "epoch": 0.6469045962865857, "grad_norm": 1.203125, "learning_rate": 0.0004967022418656575, "loss": 6.5475, "mean_token_accuracy": 0.12468422725796699, "num_tokens": 13082474.0, "step": 6045 }, { "entropy": 6.596642351150512, "epoch": 0.6474396703943496, "grad_norm": 1.359375, "learning_rate": 0.0004966957167007412, "loss": 6.468, "mean_token_accuracy": 0.12356942817568779, "num_tokens": 13092777.0, "step": 6050 }, { "entropy": 6.594368410110474, "epoch": 0.6479747445021136, "grad_norm": 1.328125, "learning_rate": 0.0004966891851343922, "loss": 6.4676, "mean_token_accuracy": 0.12478138655424117, "num_tokens": 13104019.0, "step": 6055 }, { "entropy": 6.70648775100708, "epoch": 0.6485098186098774, "grad_norm": 1.15625, "learning_rate": 0.0004966826471667992, "loss": 6.4973, "mean_token_accuracy": 0.12690474689006806, "num_tokens": 13115741.0, "step": 6060 }, { "entropy": 6.651901435852051, "epoch": 0.6490448927176414, "grad_norm": 1.21875, "learning_rate": 0.0004966761027981509, "loss": 6.5075, "mean_token_accuracy": 0.12609103322029114, "num_tokens": 13126838.0, "step": 6065 }, { "entropy": 6.642081689834595, "epoch": 0.6495799668254053, "grad_norm": 1.1875, "learning_rate": 0.0004966695520286362, "loss": 6.6086, "mean_token_accuracy": 0.11905003264546395, "num_tokens": 13137485.0, "step": 6070 }, { "entropy": 6.6793499946594235, "epoch": 0.6501150409331693, "grad_norm": 1.2265625, "learning_rate": 0.0004966629948584444, "loss": 6.4684, "mean_token_accuracy": 0.1274704895913601, "num_tokens": 13147631.0, "step": 6075 }, { "entropy": 6.597648620605469, "epoch": 0.6506501150409332, "grad_norm": 1.46875, "learning_rate": 0.0004966564312877647, "loss": 6.5373, "mean_token_accuracy": 0.1260016866028309, "num_tokens": 13158468.0, "step": 6080 }, { "entropy": 6.723154020309448, "epoch": 0.651185189148697, "grad_norm": 3.109375, "learning_rate": 0.0004966498613167868, "loss": 6.5746, "mean_token_accuracy": 0.11794209703803063, "num_tokens": 13169263.0, "step": 6085 }, { "entropy": 6.676345491409302, "epoch": 0.651720263256461, "grad_norm": 1.375, "learning_rate": 0.0004966432849457002, "loss": 6.4874, "mean_token_accuracy": 0.13016888946294786, "num_tokens": 13178647.0, "step": 6090 }, { "entropy": 6.582516241073608, "epoch": 0.6522553373642249, "grad_norm": 1.1796875, "learning_rate": 0.000496636702174695, "loss": 6.4788, "mean_token_accuracy": 0.12643413320183755, "num_tokens": 13189883.0, "step": 6095 }, { "entropy": 6.648423719406128, "epoch": 0.6527904114719889, "grad_norm": 1.25, "learning_rate": 0.0004966301130039611, "loss": 6.6022, "mean_token_accuracy": 0.12256921008229256, "num_tokens": 13200920.0, "step": 6100 }, { "entropy": 6.701182746887207, "epoch": 0.6533254855797528, "grad_norm": 2.796875, "learning_rate": 0.0004966235174336889, "loss": 6.5918, "mean_token_accuracy": 0.11332411095499992, "num_tokens": 13211765.0, "step": 6105 }, { "entropy": 6.659097290039062, "epoch": 0.6538605596875168, "grad_norm": 1.390625, "learning_rate": 0.0004966169154640687, "loss": 6.5191, "mean_token_accuracy": 0.1247679390013218, "num_tokens": 13221768.0, "step": 6110 }, { "entropy": 6.609342384338379, "epoch": 0.6543956337952807, "grad_norm": 1.21875, "learning_rate": 0.0004966103070952912, "loss": 6.5209, "mean_token_accuracy": 0.12406276315450668, "num_tokens": 13233545.0, "step": 6115 }, { "entropy": 6.693496465682983, "epoch": 0.6549307079030445, "grad_norm": 1.2109375, "learning_rate": 0.0004966036923275472, "loss": 6.5591, "mean_token_accuracy": 0.13287978991866112, "num_tokens": 13245018.0, "step": 6120 }, { "entropy": 6.604655790328979, "epoch": 0.6554657820108085, "grad_norm": 1.7578125, "learning_rate": 0.0004965970711610278, "loss": 6.4761, "mean_token_accuracy": 0.12369921505451202, "num_tokens": 13255772.0, "step": 6125 }, { "entropy": 6.611993074417114, "epoch": 0.6560008561185724, "grad_norm": 1.6796875, "learning_rate": 0.0004965904435959241, "loss": 6.5591, "mean_token_accuracy": 0.11679132431745529, "num_tokens": 13267271.0, "step": 6130 }, { "entropy": 6.685591697692871, "epoch": 0.6565359302263364, "grad_norm": 1.5625, "learning_rate": 0.0004965838096324274, "loss": 6.558, "mean_token_accuracy": 0.12077526301145554, "num_tokens": 13278467.0, "step": 6135 }, { "entropy": 6.647955656051636, "epoch": 0.6570710043341003, "grad_norm": 1.296875, "learning_rate": 0.0004965771692707294, "loss": 6.625, "mean_token_accuracy": 0.11517797484993934, "num_tokens": 13288522.0, "step": 6140 }, { "entropy": 6.735994911193847, "epoch": 0.6576060784418643, "grad_norm": 1.65625, "learning_rate": 0.0004965705225110218, "loss": 6.5958, "mean_token_accuracy": 0.1102604016661644, "num_tokens": 13299355.0, "step": 6145 }, { "entropy": 6.69739933013916, "epoch": 0.6581411525496281, "grad_norm": 1.2578125, "learning_rate": 0.0004965638693534964, "loss": 6.5269, "mean_token_accuracy": 0.12430242151021957, "num_tokens": 13310334.0, "step": 6150 }, { "entropy": 6.717443895339966, "epoch": 0.658676226657392, "grad_norm": 1.59375, "learning_rate": 0.0004965572097983455, "loss": 6.5918, "mean_token_accuracy": 0.11856616660952568, "num_tokens": 13320917.0, "step": 6155 }, { "entropy": 6.674542045593261, "epoch": 0.659211300765156, "grad_norm": 1.078125, "learning_rate": 0.0004965505438457613, "loss": 6.4852, "mean_token_accuracy": 0.12417368888854981, "num_tokens": 13331707.0, "step": 6160 }, { "entropy": 6.640851926803589, "epoch": 0.6597463748729199, "grad_norm": 1.2109375, "learning_rate": 0.0004965438714959363, "loss": 6.629, "mean_token_accuracy": 0.11581350415945053, "num_tokens": 13341784.0, "step": 6165 }, { "entropy": 6.735370779037476, "epoch": 0.6602814489806839, "grad_norm": 1.4921875, "learning_rate": 0.000496537192749063, "loss": 6.5809, "mean_token_accuracy": 0.11734402552247047, "num_tokens": 13351633.0, "step": 6170 }, { "entropy": 6.681562995910644, "epoch": 0.6608165230884477, "grad_norm": 1.2421875, "learning_rate": 0.0004965305076053345, "loss": 6.4794, "mean_token_accuracy": 0.12656131833791734, "num_tokens": 13362444.0, "step": 6175 }, { "entropy": 6.592486047744751, "epoch": 0.6613515971962117, "grad_norm": 1.3984375, "learning_rate": 0.0004965238160649437, "loss": 6.6139, "mean_token_accuracy": 0.11791914477944374, "num_tokens": 13374322.0, "step": 6180 }, { "entropy": 6.651375102996826, "epoch": 0.6618866713039756, "grad_norm": 1.390625, "learning_rate": 0.0004965171181280838, "loss": 6.5627, "mean_token_accuracy": 0.11961539909243583, "num_tokens": 13384188.0, "step": 6185 }, { "entropy": 6.709027862548828, "epoch": 0.6624217454117395, "grad_norm": 1.2265625, "learning_rate": 0.0004965104137949483, "loss": 6.5697, "mean_token_accuracy": 0.11759102568030358, "num_tokens": 13395648.0, "step": 6190 }, { "entropy": 6.718053483963013, "epoch": 0.6629568195195035, "grad_norm": 1.28125, "learning_rate": 0.0004965037030657308, "loss": 6.594, "mean_token_accuracy": 0.12067084982991219, "num_tokens": 13406769.0, "step": 6195 }, { "entropy": 6.728432607650757, "epoch": 0.6634918936272673, "grad_norm": 1.5078125, "learning_rate": 0.0004964969859406248, "loss": 6.563, "mean_token_accuracy": 0.11147924661636352, "num_tokens": 13417509.0, "step": 6200 }, { "entropy": 6.6613959789276125, "epoch": 0.6640269677350313, "grad_norm": 2.703125, "learning_rate": 0.0004964902624198246, "loss": 6.4816, "mean_token_accuracy": 0.11563964560627937, "num_tokens": 13429441.0, "step": 6205 }, { "entropy": 6.6188640117645265, "epoch": 0.6645620418427952, "grad_norm": 1.375, "learning_rate": 0.0004964835325035243, "loss": 6.511, "mean_token_accuracy": 0.12196975350379943, "num_tokens": 13439332.0, "step": 6210 }, { "entropy": 6.617918682098389, "epoch": 0.6650971159505592, "grad_norm": 1.3046875, "learning_rate": 0.0004964767961919179, "loss": 6.4908, "mean_token_accuracy": 0.12061900198459626, "num_tokens": 13449400.0, "step": 6215 }, { "entropy": 6.680626916885376, "epoch": 0.6656321900583231, "grad_norm": 1.2734375, "learning_rate": 0.0004964700534852003, "loss": 6.5983, "mean_token_accuracy": 0.11767825335264206, "num_tokens": 13460134.0, "step": 6220 }, { "entropy": 6.686565780639649, "epoch": 0.666167264166087, "grad_norm": 1.390625, "learning_rate": 0.0004964633043835658, "loss": 6.5323, "mean_token_accuracy": 0.12875395640730858, "num_tokens": 13469954.0, "step": 6225 }, { "entropy": 6.679265308380127, "epoch": 0.666702338273851, "grad_norm": 1.5703125, "learning_rate": 0.0004964565488872097, "loss": 6.5229, "mean_token_accuracy": 0.12348946034908295, "num_tokens": 13479866.0, "step": 6230 }, { "entropy": 6.563807821273803, "epoch": 0.6672374123816148, "grad_norm": 1.3125, "learning_rate": 0.0004964497869963268, "loss": 6.478, "mean_token_accuracy": 0.12527237683534623, "num_tokens": 13490088.0, "step": 6235 }, { "entropy": 6.656466770172119, "epoch": 0.6677724864893788, "grad_norm": 1.3125, "learning_rate": 0.0004964430187111125, "loss": 6.5728, "mean_token_accuracy": 0.12173057049512863, "num_tokens": 13500898.0, "step": 6240 }, { "entropy": 6.687621164321899, "epoch": 0.6683075605971427, "grad_norm": 1.109375, "learning_rate": 0.0004964362440317621, "loss": 6.5927, "mean_token_accuracy": 0.1209525316953659, "num_tokens": 13511537.0, "step": 6245 }, { "entropy": 6.633641624450684, "epoch": 0.6688426347049067, "grad_norm": 1.2109375, "learning_rate": 0.0004964294629584712, "loss": 6.5303, "mean_token_accuracy": 0.12212182357907295, "num_tokens": 13522916.0, "step": 6250 }, { "entropy": 6.683465242385864, "epoch": 0.6693777088126706, "grad_norm": 1.2890625, "learning_rate": 0.0004964226754914357, "loss": 6.4758, "mean_token_accuracy": 0.12490794360637665, "num_tokens": 13533817.0, "step": 6255 }, { "entropy": 6.711468744277954, "epoch": 0.6699127829204344, "grad_norm": 1.625, "learning_rate": 0.0004964158816308517, "loss": 6.5852, "mean_token_accuracy": 0.11734790429472923, "num_tokens": 13543723.0, "step": 6260 }, { "entropy": 6.586713552474976, "epoch": 0.6704478570281984, "grad_norm": 1.4453125, "learning_rate": 0.0004964090813769151, "loss": 6.434, "mean_token_accuracy": 0.1227193221449852, "num_tokens": 13555269.0, "step": 6265 }, { "entropy": 6.64307050704956, "epoch": 0.6709829311359623, "grad_norm": 1.328125, "learning_rate": 0.0004964022747298224, "loss": 6.6139, "mean_token_accuracy": 0.11729198768734932, "num_tokens": 13567465.0, "step": 6270 }, { "entropy": 6.752734518051147, "epoch": 0.6715180052437263, "grad_norm": 1.4296875, "learning_rate": 0.0004963954616897701, "loss": 6.5446, "mean_token_accuracy": 0.11841646209359169, "num_tokens": 13578637.0, "step": 6275 }, { "entropy": 6.68422417640686, "epoch": 0.6720530793514902, "grad_norm": 1.5078125, "learning_rate": 0.000496388642256955, "loss": 6.5505, "mean_token_accuracy": 0.12172395139932632, "num_tokens": 13589074.0, "step": 6280 }, { "entropy": 6.646722793579102, "epoch": 0.6725881534592542, "grad_norm": 1.1640625, "learning_rate": 0.000496381816431574, "loss": 6.514, "mean_token_accuracy": 0.12342069149017335, "num_tokens": 13599624.0, "step": 6285 }, { "entropy": 6.719354677200317, "epoch": 0.673123227567018, "grad_norm": 1.2734375, "learning_rate": 0.0004963749842138241, "loss": 6.5363, "mean_token_accuracy": 0.12487530261278153, "num_tokens": 13610293.0, "step": 6290 }, { "entropy": 6.675761699676514, "epoch": 0.6736583016747819, "grad_norm": 1.9453125, "learning_rate": 0.0004963681456039027, "loss": 6.5611, "mean_token_accuracy": 0.11623863652348518, "num_tokens": 13621641.0, "step": 6295 }, { "entropy": 6.602420663833618, "epoch": 0.6741933757825459, "grad_norm": 1.2890625, "learning_rate": 0.0004963613006020072, "loss": 6.5252, "mean_token_accuracy": 0.1208052784204483, "num_tokens": 13632083.0, "step": 6300 }, { "entropy": 6.604093360900879, "epoch": 0.6747284498903098, "grad_norm": 1.5546875, "learning_rate": 0.0004963544492083352, "loss": 6.41, "mean_token_accuracy": 0.13683966994285585, "num_tokens": 13644084.0, "step": 6305 }, { "entropy": 6.6350510597229, "epoch": 0.6752635239980738, "grad_norm": 1.6328125, "learning_rate": 0.0004963475914230845, "loss": 6.5449, "mean_token_accuracy": 0.11910239085555077, "num_tokens": 13656231.0, "step": 6310 }, { "entropy": 6.699683904647827, "epoch": 0.6757985981058376, "grad_norm": 2.140625, "learning_rate": 0.0004963407272464533, "loss": 6.5952, "mean_token_accuracy": 0.11810294091701508, "num_tokens": 13667334.0, "step": 6315 }, { "entropy": 6.724069118499756, "epoch": 0.6763336722136016, "grad_norm": 1.40625, "learning_rate": 0.0004963338566786398, "loss": 6.5828, "mean_token_accuracy": 0.12107535973191261, "num_tokens": 13678615.0, "step": 6320 }, { "entropy": 6.693145990371704, "epoch": 0.6768687463213655, "grad_norm": 1.578125, "learning_rate": 0.0004963269797198422, "loss": 6.5874, "mean_token_accuracy": 0.12346574515104294, "num_tokens": 13689890.0, "step": 6325 }, { "entropy": 6.558933973312378, "epoch": 0.6774038204291294, "grad_norm": 1.6328125, "learning_rate": 0.0004963200963702592, "loss": 6.4168, "mean_token_accuracy": 0.13032166957855223, "num_tokens": 13699120.0, "step": 6330 }, { "entropy": 6.581582736968994, "epoch": 0.6779388945368934, "grad_norm": 1.25, "learning_rate": 0.0004963132066300894, "loss": 6.5395, "mean_token_accuracy": 0.11724406257271766, "num_tokens": 13710016.0, "step": 6335 }, { "entropy": 6.6938841342926025, "epoch": 0.6784739686446573, "grad_norm": 1.5546875, "learning_rate": 0.0004963063104995319, "loss": 6.6391, "mean_token_accuracy": 0.11238991096615791, "num_tokens": 13721576.0, "step": 6340 }, { "entropy": 6.745585584640503, "epoch": 0.6790090427524212, "grad_norm": 1.453125, "learning_rate": 0.0004962994079787859, "loss": 6.591, "mean_token_accuracy": 0.12299842238426209, "num_tokens": 13732568.0, "step": 6345 }, { "entropy": 6.657323408126831, "epoch": 0.6795441168601851, "grad_norm": 1.4296875, "learning_rate": 0.0004962924990680504, "loss": 6.4794, "mean_token_accuracy": 0.12324386537075042, "num_tokens": 13742569.0, "step": 6350 }, { "entropy": 6.627435684204102, "epoch": 0.6800791909679491, "grad_norm": 1.453125, "learning_rate": 0.0004962855837675252, "loss": 6.6034, "mean_token_accuracy": 0.11716282293200493, "num_tokens": 13752689.0, "step": 6355 }, { "entropy": 6.6892821311950685, "epoch": 0.680614265075713, "grad_norm": 1.453125, "learning_rate": 0.0004962786620774099, "loss": 6.5905, "mean_token_accuracy": 0.11979246288537979, "num_tokens": 13763709.0, "step": 6360 }, { "entropy": 6.705752182006836, "epoch": 0.6811493391834769, "grad_norm": 1.6796875, "learning_rate": 0.0004962717339979043, "loss": 6.4891, "mean_token_accuracy": 0.1252245396375656, "num_tokens": 13773726.0, "step": 6365 }, { "entropy": 6.608482742309571, "epoch": 0.6816844132912409, "grad_norm": 1.328125, "learning_rate": 0.0004962647995292084, "loss": 6.5296, "mean_token_accuracy": 0.12159904614090919, "num_tokens": 13785435.0, "step": 6370 }, { "entropy": 6.640556859970093, "epoch": 0.6822194873990047, "grad_norm": 1.71875, "learning_rate": 0.0004962578586715226, "loss": 6.52, "mean_token_accuracy": 0.11594315767288207, "num_tokens": 13797104.0, "step": 6375 }, { "entropy": 6.7496202945709225, "epoch": 0.6827545615067687, "grad_norm": 1.3515625, "learning_rate": 0.0004962509114250471, "loss": 6.6121, "mean_token_accuracy": 0.11787962764501572, "num_tokens": 13807756.0, "step": 6380 }, { "entropy": 6.491614484786988, "epoch": 0.6832896356145326, "grad_norm": 1.453125, "learning_rate": 0.0004962439577899828, "loss": 6.314, "mean_token_accuracy": 0.13807514384388925, "num_tokens": 13818490.0, "step": 6385 }, { "entropy": 6.646625661849976, "epoch": 0.6838247097222966, "grad_norm": 1.28125, "learning_rate": 0.0004962369977665301, "loss": 6.5814, "mean_token_accuracy": 0.11426923871040344, "num_tokens": 13829465.0, "step": 6390 }, { "entropy": 6.783056354522705, "epoch": 0.6843597838300605, "grad_norm": 1.171875, "learning_rate": 0.0004962300313548903, "loss": 6.5539, "mean_token_accuracy": 0.12248866409063339, "num_tokens": 13840863.0, "step": 6395 }, { "entropy": 6.695218420028686, "epoch": 0.6848948579378243, "grad_norm": 1.2265625, "learning_rate": 0.0004962230585552645, "loss": 6.549, "mean_token_accuracy": 0.12046386897563935, "num_tokens": 13851711.0, "step": 6400 }, { "entropy": 6.581887054443359, "epoch": 0.6854299320455883, "grad_norm": 1.6953125, "learning_rate": 0.0004962160793678539, "loss": 6.5789, "mean_token_accuracy": 0.11757319420576096, "num_tokens": 13864576.0, "step": 6405 }, { "entropy": 6.6630912780761715, "epoch": 0.6859650061533522, "grad_norm": 1.3359375, "learning_rate": 0.00049620909379286, "loss": 6.4883, "mean_token_accuracy": 0.12629830315709115, "num_tokens": 13875150.0, "step": 6410 }, { "entropy": 6.683273983001709, "epoch": 0.6865000802611162, "grad_norm": 2.546875, "learning_rate": 0.0004962021018304847, "loss": 6.5422, "mean_token_accuracy": 0.12137580290436745, "num_tokens": 13886070.0, "step": 6415 }, { "entropy": 6.600133419036865, "epoch": 0.6870351543688801, "grad_norm": 1.078125, "learning_rate": 0.0004961951034809298, "loss": 6.4596, "mean_token_accuracy": 0.11954843401908874, "num_tokens": 13897898.0, "step": 6420 }, { "entropy": 6.743383502960205, "epoch": 0.6875702284766441, "grad_norm": 1.2578125, "learning_rate": 0.0004961880987443974, "loss": 6.5996, "mean_token_accuracy": 0.1191033512353897, "num_tokens": 13909578.0, "step": 6425 }, { "entropy": 6.5636146068573, "epoch": 0.6881053025844079, "grad_norm": 1.46875, "learning_rate": 0.0004961810876210897, "loss": 6.4561, "mean_token_accuracy": 0.12540539875626563, "num_tokens": 13920537.0, "step": 6430 }, { "entropy": 6.548890447616577, "epoch": 0.6886403766921718, "grad_norm": 1.2734375, "learning_rate": 0.0004961740701112091, "loss": 6.5134, "mean_token_accuracy": 0.12369008883833885, "num_tokens": 13931015.0, "step": 6435 }, { "entropy": 6.668211126327515, "epoch": 0.6891754507999358, "grad_norm": 1.2109375, "learning_rate": 0.0004961670462149583, "loss": 6.5521, "mean_token_accuracy": 0.12055359557271003, "num_tokens": 13942691.0, "step": 6440 }, { "entropy": 6.767236375808716, "epoch": 0.6897105249076997, "grad_norm": 1.21875, "learning_rate": 0.0004961600159325403, "loss": 6.637, "mean_token_accuracy": 0.10908434465527535, "num_tokens": 13953945.0, "step": 6445 }, { "entropy": 6.751330995559693, "epoch": 0.6902455990154637, "grad_norm": 1.328125, "learning_rate": 0.0004961529792641577, "loss": 6.6236, "mean_token_accuracy": 0.1173236459493637, "num_tokens": 13965658.0, "step": 6450 }, { "entropy": 6.731899356842041, "epoch": 0.6907806731232276, "grad_norm": 1.2578125, "learning_rate": 0.0004961459362100141, "loss": 6.5992, "mean_token_accuracy": 0.12082590013742447, "num_tokens": 13976184.0, "step": 6455 }, { "entropy": 6.6650745391845705, "epoch": 0.6913157472309915, "grad_norm": 1.1953125, "learning_rate": 0.0004961388867703125, "loss": 6.5114, "mean_token_accuracy": 0.11692757606506347, "num_tokens": 13986243.0, "step": 6460 }, { "entropy": 6.65087571144104, "epoch": 0.6918508213387554, "grad_norm": 1.109375, "learning_rate": 0.0004961318309452566, "loss": 6.507, "mean_token_accuracy": 0.12220369726419449, "num_tokens": 13995904.0, "step": 6465 }, { "entropy": 6.659942245483398, "epoch": 0.6923858954465193, "grad_norm": 1.3359375, "learning_rate": 0.0004961247687350504, "loss": 6.5498, "mean_token_accuracy": 0.12576377019286156, "num_tokens": 14006711.0, "step": 6470 }, { "entropy": 6.628136539459229, "epoch": 0.6929209695542833, "grad_norm": 1.2890625, "learning_rate": 0.0004961177001398974, "loss": 6.527, "mean_token_accuracy": 0.12062407061457633, "num_tokens": 14018177.0, "step": 6475 }, { "entropy": 6.665041160583496, "epoch": 0.6934560436620472, "grad_norm": 1.40625, "learning_rate": 0.0004961106251600018, "loss": 6.4884, "mean_token_accuracy": 0.11637992933392524, "num_tokens": 14028725.0, "step": 6480 }, { "entropy": 6.6288951396942135, "epoch": 0.6939911177698111, "grad_norm": 1.2578125, "learning_rate": 0.0004961035437955681, "loss": 6.5271, "mean_token_accuracy": 0.13461530953645706, "num_tokens": 14040448.0, "step": 6485 }, { "entropy": 6.62433614730835, "epoch": 0.694526191877575, "grad_norm": 1.2109375, "learning_rate": 0.0004960964560468005, "loss": 6.5734, "mean_token_accuracy": 0.11507597416639329, "num_tokens": 14051731.0, "step": 6490 }, { "entropy": 6.7240547180175785, "epoch": 0.695061265985339, "grad_norm": 1.1953125, "learning_rate": 0.0004960893619139039, "loss": 6.5658, "mean_token_accuracy": 0.11801211908459663, "num_tokens": 14062330.0, "step": 6495 }, { "entropy": 6.683112001419067, "epoch": 0.6955963400931029, "grad_norm": 1.1640625, "learning_rate": 0.0004960822613970831, "loss": 6.4486, "mean_token_accuracy": 0.12386781573295594, "num_tokens": 14073991.0, "step": 6500 }, { "entropy": 6.640247869491577, "epoch": 0.6961314142008668, "grad_norm": 1.421875, "learning_rate": 0.0004960751544965431, "loss": 6.5076, "mean_token_accuracy": 0.12210935950279236, "num_tokens": 14085132.0, "step": 6505 }, { "entropy": 6.592376041412353, "epoch": 0.6966664883086308, "grad_norm": 1.3515625, "learning_rate": 0.0004960680412124889, "loss": 6.4499, "mean_token_accuracy": 0.12720930054783822, "num_tokens": 14095371.0, "step": 6510 }, { "entropy": 6.5528076171875, "epoch": 0.6972015624163946, "grad_norm": 1.7421875, "learning_rate": 0.0004960609215451261, "loss": 6.5341, "mean_token_accuracy": 0.12374990880489349, "num_tokens": 14106117.0, "step": 6515 }, { "entropy": 6.649059104919433, "epoch": 0.6977366365241586, "grad_norm": 1.2734375, "learning_rate": 0.0004960537954946604, "loss": 6.5267, "mean_token_accuracy": 0.12003685981035232, "num_tokens": 14117112.0, "step": 6520 }, { "entropy": 6.596162796020508, "epoch": 0.6982717106319225, "grad_norm": 1.3046875, "learning_rate": 0.0004960466630612974, "loss": 6.4541, "mean_token_accuracy": 0.13205637782812119, "num_tokens": 14128037.0, "step": 6525 }, { "entropy": 6.556289529800415, "epoch": 0.6988067847396865, "grad_norm": 1.2734375, "learning_rate": 0.0004960395242452429, "loss": 6.4584, "mean_token_accuracy": 0.12506138905882835, "num_tokens": 14140183.0, "step": 6530 }, { "entropy": 6.6649885177612305, "epoch": 0.6993418588474504, "grad_norm": 1.4921875, "learning_rate": 0.0004960323790467033, "loss": 6.5995, "mean_token_accuracy": 0.12367913722991944, "num_tokens": 14151635.0, "step": 6535 }, { "entropy": 6.737906551361084, "epoch": 0.6998769329552142, "grad_norm": 1.28125, "learning_rate": 0.0004960252274658849, "loss": 6.5577, "mean_token_accuracy": 0.12105544358491897, "num_tokens": 14162660.0, "step": 6540 }, { "entropy": 6.671280765533448, "epoch": 0.7004120070629782, "grad_norm": 1.3828125, "learning_rate": 0.0004960180695029939, "loss": 6.5407, "mean_token_accuracy": 0.12037990167737007, "num_tokens": 14173496.0, "step": 6545 }, { "entropy": 6.617800331115722, "epoch": 0.7009470811707421, "grad_norm": 1.34375, "learning_rate": 0.0004960109051582374, "loss": 6.4934, "mean_token_accuracy": 0.11847614273428916, "num_tokens": 14185479.0, "step": 6550 }, { "entropy": 6.60119400024414, "epoch": 0.7014821552785061, "grad_norm": 1.3046875, "learning_rate": 0.0004960037344318221, "loss": 6.4507, "mean_token_accuracy": 0.12120893523097039, "num_tokens": 14197441.0, "step": 6555 }, { "entropy": 6.566002035140992, "epoch": 0.70201722938627, "grad_norm": 1.2890625, "learning_rate": 0.0004959965573239548, "loss": 6.4247, "mean_token_accuracy": 0.12884053736925125, "num_tokens": 14207832.0, "step": 6560 }, { "entropy": 6.55321888923645, "epoch": 0.702552303494034, "grad_norm": 1.3203125, "learning_rate": 0.0004959893738348432, "loss": 6.4945, "mean_token_accuracy": 0.12767787277698517, "num_tokens": 14217976.0, "step": 6565 }, { "entropy": 6.674604034423828, "epoch": 0.7030873776017978, "grad_norm": 1.421875, "learning_rate": 0.0004959821839646943, "loss": 6.4431, "mean_token_accuracy": 0.12329324334859848, "num_tokens": 14227557.0, "step": 6570 }, { "entropy": 6.662657594680786, "epoch": 0.7036224517095617, "grad_norm": 1.28125, "learning_rate": 0.000495974987713716, "loss": 6.571, "mean_token_accuracy": 0.11384310796856881, "num_tokens": 14238912.0, "step": 6575 }, { "entropy": 6.638991737365723, "epoch": 0.7041575258173257, "grad_norm": 1.25, "learning_rate": 0.0004959677850821159, "loss": 6.5012, "mean_token_accuracy": 0.12319194078445435, "num_tokens": 14249968.0, "step": 6580 }, { "entropy": 6.620342445373535, "epoch": 0.7046925999250896, "grad_norm": 1.265625, "learning_rate": 0.0004959605760701021, "loss": 6.5569, "mean_token_accuracy": 0.12182011604309081, "num_tokens": 14260809.0, "step": 6585 }, { "entropy": 6.663771057128907, "epoch": 0.7052276740328536, "grad_norm": 1.5, "learning_rate": 0.0004959533606778827, "loss": 6.527, "mean_token_accuracy": 0.1212913878262043, "num_tokens": 14271971.0, "step": 6590 }, { "entropy": 6.70226559638977, "epoch": 0.7057627481406175, "grad_norm": 1.265625, "learning_rate": 0.0004959461389056661, "loss": 6.5913, "mean_token_accuracy": 0.12781344801187516, "num_tokens": 14283550.0, "step": 6595 }, { "entropy": 6.566189193725586, "epoch": 0.7062978222483814, "grad_norm": 1.25, "learning_rate": 0.0004959389107536608, "loss": 6.4158, "mean_token_accuracy": 0.12276504635810852, "num_tokens": 14293769.0, "step": 6600 }, { "entropy": 6.642466735839844, "epoch": 0.7068328963561453, "grad_norm": 1.3203125, "learning_rate": 0.0004959316762220754, "loss": 6.5368, "mean_token_accuracy": 0.11977979466319084, "num_tokens": 14304668.0, "step": 6605 }, { "entropy": 6.650493144989014, "epoch": 0.7073679704639092, "grad_norm": 1.234375, "learning_rate": 0.000495924435311119, "loss": 6.5975, "mean_token_accuracy": 0.11864884719252586, "num_tokens": 14315912.0, "step": 6610 }, { "entropy": 6.61599588394165, "epoch": 0.7079030445716732, "grad_norm": 1.1875, "learning_rate": 0.0004959171880210005, "loss": 6.5415, "mean_token_accuracy": 0.1240161381661892, "num_tokens": 14327386.0, "step": 6615 }, { "entropy": 6.61832332611084, "epoch": 0.7084381186794371, "grad_norm": 1.1640625, "learning_rate": 0.0004959099343519294, "loss": 6.5297, "mean_token_accuracy": 0.11902955025434495, "num_tokens": 14338629.0, "step": 6620 }, { "entropy": 6.745673322677613, "epoch": 0.7089731927872011, "grad_norm": 1.171875, "learning_rate": 0.0004959026743041148, "loss": 6.5523, "mean_token_accuracy": 0.12611126601696016, "num_tokens": 14349195.0, "step": 6625 }, { "entropy": 6.707384347915649, "epoch": 0.7095082668949649, "grad_norm": 1.4375, "learning_rate": 0.0004958954078777665, "loss": 6.5804, "mean_token_accuracy": 0.11705741733312607, "num_tokens": 14359449.0, "step": 6630 }, { "entropy": 6.607598972320557, "epoch": 0.7100433410027289, "grad_norm": 1.3828125, "learning_rate": 0.0004958881350730944, "loss": 6.4914, "mean_token_accuracy": 0.12530679404735565, "num_tokens": 14369904.0, "step": 6635 }, { "entropy": 6.640906763076782, "epoch": 0.7105784151104928, "grad_norm": 1.4453125, "learning_rate": 0.0004958808558903085, "loss": 6.502, "mean_token_accuracy": 0.12301137670874596, "num_tokens": 14382635.0, "step": 6640 }, { "entropy": 6.597404193878174, "epoch": 0.7111134892182567, "grad_norm": 1.4140625, "learning_rate": 0.0004958735703296189, "loss": 6.4504, "mean_token_accuracy": 0.12635595500469207, "num_tokens": 14393238.0, "step": 6645 }, { "entropy": 6.605778455734253, "epoch": 0.7116485633260207, "grad_norm": 1.25, "learning_rate": 0.000495866278391236, "loss": 6.4988, "mean_token_accuracy": 0.12151379361748696, "num_tokens": 14403734.0, "step": 6650 }, { "entropy": 6.662947177886963, "epoch": 0.7121836374337845, "grad_norm": 1.6640625, "learning_rate": 0.0004958589800753703, "loss": 6.493, "mean_token_accuracy": 0.12501125037670135, "num_tokens": 14414201.0, "step": 6655 }, { "entropy": 6.639647436141968, "epoch": 0.7127187115415485, "grad_norm": 1.21875, "learning_rate": 0.0004958516753822326, "loss": 6.5273, "mean_token_accuracy": 0.12744878232479095, "num_tokens": 14425153.0, "step": 6660 }, { "entropy": 6.599532556533814, "epoch": 0.7132537856493124, "grad_norm": 1.453125, "learning_rate": 0.0004958443643120338, "loss": 6.5016, "mean_token_accuracy": 0.12863869071006775, "num_tokens": 14435942.0, "step": 6665 }, { "entropy": 6.614558696746826, "epoch": 0.7137888597570764, "grad_norm": 1.4453125, "learning_rate": 0.000495837046864985, "loss": 6.4763, "mean_token_accuracy": 0.12335674315690995, "num_tokens": 14446371.0, "step": 6670 }, { "entropy": 6.617805099487304, "epoch": 0.7143239338648403, "grad_norm": 1.421875, "learning_rate": 0.0004958297230412976, "loss": 6.4252, "mean_token_accuracy": 0.127166984975338, "num_tokens": 14456598.0, "step": 6675 }, { "entropy": 6.555561685562134, "epoch": 0.7148590079726042, "grad_norm": 2.703125, "learning_rate": 0.0004958223928411829, "loss": 6.5309, "mean_token_accuracy": 0.1143219605088234, "num_tokens": 14466775.0, "step": 6680 }, { "entropy": 6.574054431915283, "epoch": 0.7153940820803681, "grad_norm": 1.375, "learning_rate": 0.0004958150562648526, "loss": 6.4665, "mean_token_accuracy": 0.12366539910435677, "num_tokens": 14476876.0, "step": 6685 }, { "entropy": 6.590529203414917, "epoch": 0.715929156188132, "grad_norm": 1.3984375, "learning_rate": 0.0004958077133125187, "loss": 6.4797, "mean_token_accuracy": 0.12587342411279678, "num_tokens": 14487698.0, "step": 6690 }, { "entropy": 6.692271709442139, "epoch": 0.716464230295896, "grad_norm": 1.640625, "learning_rate": 0.000495800363984393, "loss": 6.4987, "mean_token_accuracy": 0.12271760776638985, "num_tokens": 14498572.0, "step": 6695 }, { "entropy": 6.623218107223511, "epoch": 0.7169993044036599, "grad_norm": 1.3515625, "learning_rate": 0.0004957930082806878, "loss": 6.5438, "mean_token_accuracy": 0.12247662395238876, "num_tokens": 14509673.0, "step": 6700 }, { "entropy": 6.70994553565979, "epoch": 0.7175343785114239, "grad_norm": 1.515625, "learning_rate": 0.0004957856462016155, "loss": 6.6279, "mean_token_accuracy": 0.1105528324842453, "num_tokens": 14519974.0, "step": 6705 }, { "entropy": 6.691906595230103, "epoch": 0.7180694526191878, "grad_norm": 2.21875, "learning_rate": 0.0004957782777473888, "loss": 6.5373, "mean_token_accuracy": 0.11652741655707359, "num_tokens": 14531194.0, "step": 6710 }, { "entropy": 6.606967735290527, "epoch": 0.7186045267269516, "grad_norm": 1.75, "learning_rate": 0.0004957709029182203, "loss": 6.4862, "mean_token_accuracy": 0.12221086099743843, "num_tokens": 14542393.0, "step": 6715 }, { "entropy": 6.582061862945556, "epoch": 0.7191396008347156, "grad_norm": 1.375, "learning_rate": 0.0004957635217143231, "loss": 6.4944, "mean_token_accuracy": 0.13097272515296937, "num_tokens": 14552934.0, "step": 6720 }, { "entropy": 6.62083740234375, "epoch": 0.7196746749424795, "grad_norm": 1.3984375, "learning_rate": 0.00049575613413591, "loss": 6.4978, "mean_token_accuracy": 0.120374695956707, "num_tokens": 14563643.0, "step": 6725 }, { "entropy": 6.601111316680909, "epoch": 0.7202097490502435, "grad_norm": 1.296875, "learning_rate": 0.0004957487401831947, "loss": 6.445, "mean_token_accuracy": 0.12362169623374938, "num_tokens": 14574422.0, "step": 6730 }, { "entropy": 6.584991502761841, "epoch": 0.7207448231580074, "grad_norm": 1.140625, "learning_rate": 0.0004957413398563906, "loss": 6.4292, "mean_token_accuracy": 0.11930982172489166, "num_tokens": 14585002.0, "step": 6735 }, { "entropy": 6.625512647628784, "epoch": 0.7212798972657714, "grad_norm": 1.6875, "learning_rate": 0.0004957339331557113, "loss": 6.4612, "mean_token_accuracy": 0.1259589172899723, "num_tokens": 14595172.0, "step": 6740 }, { "entropy": 6.599657821655273, "epoch": 0.7218149713735352, "grad_norm": 1.2421875, "learning_rate": 0.0004957265200813706, "loss": 6.5742, "mean_token_accuracy": 0.11676609218120575, "num_tokens": 14606316.0, "step": 6745 }, { "entropy": 6.696068477630615, "epoch": 0.7223500454812991, "grad_norm": 1.609375, "learning_rate": 0.0004957191006335827, "loss": 6.4903, "mean_token_accuracy": 0.12656715735793114, "num_tokens": 14616394.0, "step": 6750 }, { "entropy": 6.555004119873047, "epoch": 0.7228851195890631, "grad_norm": 1.5, "learning_rate": 0.0004957116748125618, "loss": 6.4925, "mean_token_accuracy": 0.11967325806617737, "num_tokens": 14627474.0, "step": 6755 }, { "entropy": 6.575228595733643, "epoch": 0.723420193696827, "grad_norm": 1.28125, "learning_rate": 0.0004957042426185223, "loss": 6.4314, "mean_token_accuracy": 0.13004304990172386, "num_tokens": 14638343.0, "step": 6760 }, { "entropy": 6.614687061309814, "epoch": 0.723955267804591, "grad_norm": 1.328125, "learning_rate": 0.0004956968040516789, "loss": 6.4941, "mean_token_accuracy": 0.12631681188941002, "num_tokens": 14649115.0, "step": 6765 }, { "entropy": 6.607396507263184, "epoch": 0.7244903419123548, "grad_norm": 1.1328125, "learning_rate": 0.0004956893591122461, "loss": 6.5614, "mean_token_accuracy": 0.1266578659415245, "num_tokens": 14659714.0, "step": 6770 }, { "entropy": 6.730130004882812, "epoch": 0.7250254160201188, "grad_norm": 1.2578125, "learning_rate": 0.0004956819078004392, "loss": 6.5943, "mean_token_accuracy": 0.1168831467628479, "num_tokens": 14670481.0, "step": 6775 }, { "entropy": 6.612733459472656, "epoch": 0.7255604901278827, "grad_norm": 1.515625, "learning_rate": 0.0004956744501164732, "loss": 6.4208, "mean_token_accuracy": 0.12815224677324294, "num_tokens": 14680816.0, "step": 6780 }, { "entropy": 6.573790550231934, "epoch": 0.7260955642356466, "grad_norm": 1.1796875, "learning_rate": 0.0004956669860605634, "loss": 6.5177, "mean_token_accuracy": 0.12638939991593362, "num_tokens": 14692723.0, "step": 6785 }, { "entropy": 6.630371952056885, "epoch": 0.7266306383434106, "grad_norm": 1.3125, "learning_rate": 0.0004956595156329254, "loss": 6.5369, "mean_token_accuracy": 0.12008581012487411, "num_tokens": 14703824.0, "step": 6790 }, { "entropy": 6.706773328781128, "epoch": 0.7271657124511745, "grad_norm": 1.28125, "learning_rate": 0.000495652038833775, "loss": 6.5182, "mean_token_accuracy": 0.12735376432538031, "num_tokens": 14715934.0, "step": 6795 }, { "entropy": 6.598440217971802, "epoch": 0.7277007865589384, "grad_norm": 1.328125, "learning_rate": 0.0004956445556633279, "loss": 6.5177, "mean_token_accuracy": 0.12028545215725898, "num_tokens": 14725617.0, "step": 6800 }, { "entropy": 6.634641218185425, "epoch": 0.7282358606667023, "grad_norm": 1.328125, "learning_rate": 0.0004956370661218003, "loss": 6.4967, "mean_token_accuracy": 0.12309338971972465, "num_tokens": 14736430.0, "step": 6805 }, { "entropy": 6.666610288619995, "epoch": 0.7287709347744663, "grad_norm": 1.4375, "learning_rate": 0.0004956295702094084, "loss": 6.5171, "mean_token_accuracy": 0.12309236079454422, "num_tokens": 14746740.0, "step": 6810 }, { "entropy": 6.582339763641357, "epoch": 0.7293060088822302, "grad_norm": 1.5625, "learning_rate": 0.0004956220679263687, "loss": 6.4535, "mean_token_accuracy": 0.12928269281983376, "num_tokens": 14756884.0, "step": 6815 }, { "entropy": 6.589403057098389, "epoch": 0.7298410829899941, "grad_norm": 1.2734375, "learning_rate": 0.0004956145592728976, "loss": 6.4581, "mean_token_accuracy": 0.1312728136777878, "num_tokens": 14766974.0, "step": 6820 }, { "entropy": 6.623006343841553, "epoch": 0.730376157097758, "grad_norm": 1.359375, "learning_rate": 0.0004956070442492123, "loss": 6.6176, "mean_token_accuracy": 0.11667682155966759, "num_tokens": 14778449.0, "step": 6825 }, { "entropy": 6.7070536613464355, "epoch": 0.7309112312055219, "grad_norm": 1.3671875, "learning_rate": 0.0004955995228555296, "loss": 6.5422, "mean_token_accuracy": 0.1225484624505043, "num_tokens": 14788989.0, "step": 6830 }, { "entropy": 6.628703689575195, "epoch": 0.7314463053132859, "grad_norm": 1.2890625, "learning_rate": 0.0004955919950920666, "loss": 6.5023, "mean_token_accuracy": 0.12728202119469642, "num_tokens": 14798454.0, "step": 6835 }, { "entropy": 6.660853433609009, "epoch": 0.7319813794210498, "grad_norm": 1.515625, "learning_rate": 0.0004955844609590408, "loss": 6.4467, "mean_token_accuracy": 0.12790426537394523, "num_tokens": 14808920.0, "step": 6840 }, { "entropy": 6.635347509384156, "epoch": 0.7325164535288138, "grad_norm": 1.1875, "learning_rate": 0.0004955769204566696, "loss": 6.4426, "mean_token_accuracy": 0.1228242613375187, "num_tokens": 14819250.0, "step": 6845 }, { "entropy": 6.662122344970703, "epoch": 0.7330515276365777, "grad_norm": 1.5078125, "learning_rate": 0.0004955693735851709, "loss": 6.5277, "mean_token_accuracy": 0.12443855032324791, "num_tokens": 14829789.0, "step": 6850 }, { "entropy": 6.562832450866699, "epoch": 0.7335866017443415, "grad_norm": 1.5625, "learning_rate": 0.0004955618203447625, "loss": 6.5037, "mean_token_accuracy": 0.1241986483335495, "num_tokens": 14840527.0, "step": 6855 }, { "entropy": 6.608736944198609, "epoch": 0.7341216758521055, "grad_norm": 1.46875, "learning_rate": 0.0004955542607356625, "loss": 6.5588, "mean_token_accuracy": 0.12313508540391922, "num_tokens": 14850922.0, "step": 6860 }, { "entropy": 6.655763769149781, "epoch": 0.7346567499598694, "grad_norm": 1.9609375, "learning_rate": 0.0004955466947580893, "loss": 6.5061, "mean_token_accuracy": 0.12578540593385695, "num_tokens": 14862226.0, "step": 6865 }, { "entropy": 6.597611951828003, "epoch": 0.7351918240676334, "grad_norm": 1.5859375, "learning_rate": 0.0004955391224122611, "loss": 6.4097, "mean_token_accuracy": 0.1363422118127346, "num_tokens": 14872461.0, "step": 6870 }, { "entropy": 6.608497571945191, "epoch": 0.7357268981753973, "grad_norm": 1.4765625, "learning_rate": 0.000495531543698397, "loss": 6.5258, "mean_token_accuracy": 0.12411358803510666, "num_tokens": 14883088.0, "step": 6875 }, { "entropy": 6.693577766418457, "epoch": 0.7362619722831613, "grad_norm": 1.234375, "learning_rate": 0.0004955239586167153, "loss": 6.5405, "mean_token_accuracy": 0.12336590811610222, "num_tokens": 14894055.0, "step": 6880 }, { "entropy": 6.6278046607971195, "epoch": 0.7367970463909251, "grad_norm": 1.5703125, "learning_rate": 0.0004955163671674354, "loss": 6.5092, "mean_token_accuracy": 0.1199507437646389, "num_tokens": 14904760.0, "step": 6885 }, { "entropy": 6.727400636672973, "epoch": 0.737332120498689, "grad_norm": 2.65625, "learning_rate": 0.0004955087693507764, "loss": 6.6256, "mean_token_accuracy": 0.11664849147200584, "num_tokens": 14915983.0, "step": 6890 }, { "entropy": 6.65953311920166, "epoch": 0.737867194606453, "grad_norm": 1.5078125, "learning_rate": 0.0004955011651669577, "loss": 6.5148, "mean_token_accuracy": 0.11811737567186356, "num_tokens": 14925959.0, "step": 6895 }, { "entropy": 6.5658063888549805, "epoch": 0.7384022687142169, "grad_norm": 1.21875, "learning_rate": 0.0004954935546161988, "loss": 6.4756, "mean_token_accuracy": 0.12480072304606438, "num_tokens": 14936138.0, "step": 6900 }, { "entropy": 6.680220413208008, "epoch": 0.7389373428219809, "grad_norm": 1.234375, "learning_rate": 0.0004954859376987195, "loss": 6.5023, "mean_token_accuracy": 0.1277581550180912, "num_tokens": 14946979.0, "step": 6905 }, { "entropy": 6.584284877777099, "epoch": 0.7394724169297447, "grad_norm": 1.3359375, "learning_rate": 0.0004954783144147397, "loss": 6.5679, "mean_token_accuracy": 0.12042608857154846, "num_tokens": 14958324.0, "step": 6910 }, { "entropy": 6.737890386581421, "epoch": 0.7400074910375087, "grad_norm": 1.234375, "learning_rate": 0.0004954706847644796, "loss": 6.5574, "mean_token_accuracy": 0.11832675114274024, "num_tokens": 14969048.0, "step": 6915 }, { "entropy": 6.710620450973511, "epoch": 0.7405425651452726, "grad_norm": 1.265625, "learning_rate": 0.0004954630487481594, "loss": 6.5496, "mean_token_accuracy": 0.12008848264813424, "num_tokens": 14979825.0, "step": 6920 }, { "entropy": 6.595880651473999, "epoch": 0.7410776392530365, "grad_norm": 1.3671875, "learning_rate": 0.0004954554063659998, "loss": 6.481, "mean_token_accuracy": 0.12603807896375657, "num_tokens": 14990138.0, "step": 6925 }, { "entropy": 6.596027612686157, "epoch": 0.7416127133608005, "grad_norm": 1.4453125, "learning_rate": 0.0004954477576182212, "loss": 6.4498, "mean_token_accuracy": 0.1261916309595108, "num_tokens": 15002276.0, "step": 6930 }, { "entropy": 6.646682214736939, "epoch": 0.7421477874685644, "grad_norm": 1.3828125, "learning_rate": 0.0004954401025050445, "loss": 6.5709, "mean_token_accuracy": 0.12357406765222549, "num_tokens": 15013622.0, "step": 6935 }, { "entropy": 6.676917219161988, "epoch": 0.7426828615763283, "grad_norm": 1.3203125, "learning_rate": 0.0004954324410266909, "loss": 6.531, "mean_token_accuracy": 0.12281017452478409, "num_tokens": 15024067.0, "step": 6940 }, { "entropy": 6.628924036026001, "epoch": 0.7432179356840922, "grad_norm": 1.359375, "learning_rate": 0.0004954247731833815, "loss": 6.4168, "mean_token_accuracy": 0.13402525782585145, "num_tokens": 15033646.0, "step": 6945 }, { "entropy": 6.559259271621704, "epoch": 0.7437530097918562, "grad_norm": 1.2734375, "learning_rate": 0.0004954170989753377, "loss": 6.4686, "mean_token_accuracy": 0.12331727594137191, "num_tokens": 15044655.0, "step": 6950 }, { "entropy": 6.714093255996704, "epoch": 0.7442880838996201, "grad_norm": 1.6328125, "learning_rate": 0.0004954094184027813, "loss": 6.5556, "mean_token_accuracy": 0.11801010146737098, "num_tokens": 15055492.0, "step": 6955 }, { "entropy": 6.666389083862304, "epoch": 0.744823158007384, "grad_norm": 1.3046875, "learning_rate": 0.0004954017314659339, "loss": 6.53, "mean_token_accuracy": 0.1155826836824417, "num_tokens": 15066472.0, "step": 6960 }, { "entropy": 6.671958112716675, "epoch": 0.745358232115148, "grad_norm": 1.328125, "learning_rate": 0.0004953940381650174, "loss": 6.5027, "mean_token_accuracy": 0.12497956231236458, "num_tokens": 15076851.0, "step": 6965 }, { "entropy": 6.544204425811768, "epoch": 0.7458933062229118, "grad_norm": 1.4453125, "learning_rate": 0.0004953863385002541, "loss": 6.4337, "mean_token_accuracy": 0.12553054392337798, "num_tokens": 15086997.0, "step": 6970 }, { "entropy": 6.669872713088989, "epoch": 0.7464283803306758, "grad_norm": 1.3359375, "learning_rate": 0.0004953786324718661, "loss": 6.5781, "mean_token_accuracy": 0.1174256332218647, "num_tokens": 15098625.0, "step": 6975 }, { "entropy": 6.628860807418823, "epoch": 0.7469634544384397, "grad_norm": 1.2890625, "learning_rate": 0.0004953709200800761, "loss": 6.3992, "mean_token_accuracy": 0.1296637736260891, "num_tokens": 15108265.0, "step": 6980 }, { "entropy": 6.58307580947876, "epoch": 0.7474985285462037, "grad_norm": 1.4453125, "learning_rate": 0.0004953632013251068, "loss": 6.4934, "mean_token_accuracy": 0.12321807146072387, "num_tokens": 15118794.0, "step": 6985 }, { "entropy": 6.648694610595703, "epoch": 0.7480336026539676, "grad_norm": 1.5859375, "learning_rate": 0.0004953554762071811, "loss": 6.5249, "mean_token_accuracy": 0.12125022262334824, "num_tokens": 15130084.0, "step": 6990 }, { "entropy": 6.664281702041626, "epoch": 0.7485686767617316, "grad_norm": 1.515625, "learning_rate": 0.0004953477447265218, "loss": 6.5118, "mean_token_accuracy": 0.11916638761758805, "num_tokens": 15142193.0, "step": 6995 }, { "entropy": 6.637905645370483, "epoch": 0.7491037508694954, "grad_norm": 1.546875, "learning_rate": 0.0004953400068833524, "loss": 6.6153, "mean_token_accuracy": 0.12101433128118515, "num_tokens": 15152817.0, "step": 7000 }, { "entropy": 6.557371330261231, "epoch": 0.7496388249772593, "grad_norm": 1.3203125, "learning_rate": 0.0004953322626778964, "loss": 6.317, "mean_token_accuracy": 0.13028131946921348, "num_tokens": 15162352.0, "step": 7005 }, { "entropy": 6.673658227920532, "epoch": 0.7501738990850233, "grad_norm": 1.421875, "learning_rate": 0.0004953245121103771, "loss": 6.4892, "mean_token_accuracy": 0.12943382561206818, "num_tokens": 15173091.0, "step": 7010 }, { "entropy": 6.693431568145752, "epoch": 0.7507089731927872, "grad_norm": 1.4765625, "learning_rate": 0.0004953167551810185, "loss": 6.6457, "mean_token_accuracy": 0.11348064690828323, "num_tokens": 15184422.0, "step": 7015 }, { "entropy": 6.567291927337647, "epoch": 0.7512440473005512, "grad_norm": 1.4609375, "learning_rate": 0.0004953089918900447, "loss": 6.3901, "mean_token_accuracy": 0.13483602181077003, "num_tokens": 15194765.0, "step": 7020 }, { "entropy": 6.645245218276978, "epoch": 0.751779121408315, "grad_norm": 1.5546875, "learning_rate": 0.0004953012222376795, "loss": 6.5368, "mean_token_accuracy": 0.11706858575344085, "num_tokens": 15206007.0, "step": 7025 }, { "entropy": 6.627328014373779, "epoch": 0.752314195516079, "grad_norm": 1.4609375, "learning_rate": 0.0004952934462241476, "loss": 6.489, "mean_token_accuracy": 0.12645872682332993, "num_tokens": 15216634.0, "step": 7030 }, { "entropy": 6.62941837310791, "epoch": 0.7528492696238429, "grad_norm": 1.109375, "learning_rate": 0.0004952856638496734, "loss": 6.5516, "mean_token_accuracy": 0.1180113211274147, "num_tokens": 15226931.0, "step": 7035 }, { "entropy": 6.64382848739624, "epoch": 0.7533843437316068, "grad_norm": 1.5, "learning_rate": 0.0004952778751144817, "loss": 6.5267, "mean_token_accuracy": 0.12257011234760284, "num_tokens": 15239034.0, "step": 7040 }, { "entropy": 6.664216995239258, "epoch": 0.7539194178393708, "grad_norm": 1.390625, "learning_rate": 0.0004952700800187971, "loss": 6.5176, "mean_token_accuracy": 0.12180257961153984, "num_tokens": 15250088.0, "step": 7045 }, { "entropy": 6.677762746810913, "epoch": 0.7544544919471347, "grad_norm": 1.5, "learning_rate": 0.000495262278562845, "loss": 6.4659, "mean_token_accuracy": 0.12146370336413384, "num_tokens": 15261150.0, "step": 7050 }, { "entropy": 6.664985132217407, "epoch": 0.7549895660548986, "grad_norm": 1.28125, "learning_rate": 0.0004952544707468506, "loss": 6.5414, "mean_token_accuracy": 0.12395042702555656, "num_tokens": 15270865.0, "step": 7055 }, { "entropy": 6.677373027801513, "epoch": 0.7555246401626625, "grad_norm": 1.40625, "learning_rate": 0.0004952466565710391, "loss": 6.5552, "mean_token_accuracy": 0.118691186606884, "num_tokens": 15282809.0, "step": 7060 }, { "entropy": 6.694124698638916, "epoch": 0.7560597142704265, "grad_norm": 1.3046875, "learning_rate": 0.0004952388360356366, "loss": 6.5083, "mean_token_accuracy": 0.12859989702701569, "num_tokens": 15293166.0, "step": 7065 }, { "entropy": 6.616050100326538, "epoch": 0.7565947883781904, "grad_norm": 1.5, "learning_rate": 0.0004952310091408685, "loss": 6.4966, "mean_token_accuracy": 0.12518092021346092, "num_tokens": 15302985.0, "step": 7070 }, { "entropy": 6.651115751266479, "epoch": 0.7571298624859543, "grad_norm": 1.59375, "learning_rate": 0.0004952231758869611, "loss": 6.5415, "mean_token_accuracy": 0.1267145797610283, "num_tokens": 15314737.0, "step": 7075 }, { "entropy": 6.614376068115234, "epoch": 0.7576649365937183, "grad_norm": 1.2421875, "learning_rate": 0.0004952153362741403, "loss": 6.464, "mean_token_accuracy": 0.13092187345027922, "num_tokens": 15325441.0, "step": 7080 }, { "entropy": 6.599036788940429, "epoch": 0.7582000107014821, "grad_norm": 1.2265625, "learning_rate": 0.0004952074903026327, "loss": 6.3991, "mean_token_accuracy": 0.12750762775540353, "num_tokens": 15334939.0, "step": 7085 }, { "entropy": 6.595050287246704, "epoch": 0.7587350848092461, "grad_norm": 1.21875, "learning_rate": 0.0004951996379726647, "loss": 6.5734, "mean_token_accuracy": 0.12048307284712792, "num_tokens": 15345655.0, "step": 7090 }, { "entropy": 6.538129758834839, "epoch": 0.75927015891701, "grad_norm": 1.4375, "learning_rate": 0.0004951917792844631, "loss": 6.3968, "mean_token_accuracy": 0.13058631792664527, "num_tokens": 15356035.0, "step": 7095 }, { "entropy": 6.659978437423706, "epoch": 0.759805233024774, "grad_norm": 1.1875, "learning_rate": 0.0004951839142382548, "loss": 6.5094, "mean_token_accuracy": 0.12489819005131722, "num_tokens": 15368509.0, "step": 7100 }, { "entropy": 6.615253734588623, "epoch": 0.7603403071325379, "grad_norm": 1.171875, "learning_rate": 0.000495176042834267, "loss": 6.4777, "mean_token_accuracy": 0.1264044873416424, "num_tokens": 15379662.0, "step": 7105 }, { "entropy": 6.601353359222412, "epoch": 0.7608753812403017, "grad_norm": 1.4609375, "learning_rate": 0.0004951681650727268, "loss": 6.4844, "mean_token_accuracy": 0.11898941099643708, "num_tokens": 15389698.0, "step": 7110 }, { "entropy": 6.746938896179199, "epoch": 0.7614104553480657, "grad_norm": 1.203125, "learning_rate": 0.0004951602809538619, "loss": 6.5772, "mean_token_accuracy": 0.11864528879523277, "num_tokens": 15400724.0, "step": 7115 }, { "entropy": 6.733620023727417, "epoch": 0.7619455294558296, "grad_norm": 1.25, "learning_rate": 0.0004951523904778997, "loss": 6.5659, "mean_token_accuracy": 0.11942593604326249, "num_tokens": 15410732.0, "step": 7120 }, { "entropy": 6.618440341949463, "epoch": 0.7624806035635936, "grad_norm": 1.421875, "learning_rate": 0.0004951444936450682, "loss": 6.4671, "mean_token_accuracy": 0.13049914836883544, "num_tokens": 15420185.0, "step": 7125 }, { "entropy": 6.591977787017822, "epoch": 0.7630156776713575, "grad_norm": 1.515625, "learning_rate": 0.0004951365904555954, "loss": 6.4038, "mean_token_accuracy": 0.1246684692800045, "num_tokens": 15431904.0, "step": 7130 }, { "entropy": 6.575604772567749, "epoch": 0.7635507517791215, "grad_norm": 1.2890625, "learning_rate": 0.0004951286809097094, "loss": 6.5303, "mean_token_accuracy": 0.11952223181724549, "num_tokens": 15442650.0, "step": 7135 }, { "entropy": 6.564087724685669, "epoch": 0.7640858258868853, "grad_norm": 1.484375, "learning_rate": 0.0004951207650076388, "loss": 6.5026, "mean_token_accuracy": 0.12019338682293892, "num_tokens": 15454273.0, "step": 7140 }, { "entropy": 6.638538455963134, "epoch": 0.7646208999946492, "grad_norm": 1.2890625, "learning_rate": 0.000495112842749612, "loss": 6.4855, "mean_token_accuracy": 0.1241270050406456, "num_tokens": 15465751.0, "step": 7145 }, { "entropy": 6.656053924560547, "epoch": 0.7651559741024132, "grad_norm": 1.359375, "learning_rate": 0.0004951049141358578, "loss": 6.5927, "mean_token_accuracy": 0.11400035619735718, "num_tokens": 15475340.0, "step": 7150 }, { "entropy": 6.713410806655884, "epoch": 0.7656910482101771, "grad_norm": 1.265625, "learning_rate": 0.0004950969791666051, "loss": 6.5507, "mean_token_accuracy": 0.1195062555372715, "num_tokens": 15486246.0, "step": 7155 }, { "entropy": 6.696958923339844, "epoch": 0.7662261223179411, "grad_norm": 1.390625, "learning_rate": 0.0004950890378420831, "loss": 6.5556, "mean_token_accuracy": 0.12101633250713348, "num_tokens": 15497331.0, "step": 7160 }, { "entropy": 6.624008226394653, "epoch": 0.766761196425705, "grad_norm": 1.1328125, "learning_rate": 0.000495081090162521, "loss": 6.496, "mean_token_accuracy": 0.1252144269645214, "num_tokens": 15508036.0, "step": 7165 }, { "entropy": 6.651372194290161, "epoch": 0.7672962705334689, "grad_norm": 1.3984375, "learning_rate": 0.0004950731361281483, "loss": 6.4892, "mean_token_accuracy": 0.12409828379750251, "num_tokens": 15518381.0, "step": 7170 }, { "entropy": 6.648929023742676, "epoch": 0.7678313446412328, "grad_norm": 1.296875, "learning_rate": 0.0004950651757391948, "loss": 6.4927, "mean_token_accuracy": 0.12453809827566147, "num_tokens": 15528939.0, "step": 7175 }, { "entropy": 6.691262435913086, "epoch": 0.7683664187489967, "grad_norm": 1.25, "learning_rate": 0.0004950572089958904, "loss": 6.4844, "mean_token_accuracy": 0.11920621544122696, "num_tokens": 15539718.0, "step": 7180 }, { "entropy": 6.671784210205078, "epoch": 0.7689014928567607, "grad_norm": 1.375, "learning_rate": 0.0004950492358984648, "loss": 6.6442, "mean_token_accuracy": 0.11607598587870598, "num_tokens": 15550970.0, "step": 7185 }, { "entropy": 6.673526191711426, "epoch": 0.7694365669645246, "grad_norm": 1.296875, "learning_rate": 0.0004950412564471486, "loss": 6.4146, "mean_token_accuracy": 0.1274817906320095, "num_tokens": 15560490.0, "step": 7190 }, { "entropy": 6.616913270950318, "epoch": 0.7699716410722885, "grad_norm": 1.390625, "learning_rate": 0.000495033270642172, "loss": 6.4266, "mean_token_accuracy": 0.1294262781739235, "num_tokens": 15570188.0, "step": 7195 }, { "entropy": 6.589165592193604, "epoch": 0.7705067151800524, "grad_norm": 1.296875, "learning_rate": 0.0004950252784837655, "loss": 6.4459, "mean_token_accuracy": 0.12019804939627647, "num_tokens": 15581446.0, "step": 7200 }, { "entropy": 6.63636999130249, "epoch": 0.7710417892878164, "grad_norm": 1.8125, "learning_rate": 0.0004950172799721601, "loss": 6.5597, "mean_token_accuracy": 0.12001867443323136, "num_tokens": 15594362.0, "step": 7205 }, { "entropy": 6.646881103515625, "epoch": 0.7715768633955803, "grad_norm": 1.5390625, "learning_rate": 0.0004950092751075866, "loss": 6.4336, "mean_token_accuracy": 0.13300900235772134, "num_tokens": 15605531.0, "step": 7210 }, { "entropy": 6.632643985748291, "epoch": 0.7721119375033442, "grad_norm": 1.65625, "learning_rate": 0.0004950012638902763, "loss": 6.4747, "mean_token_accuracy": 0.12664539813995362, "num_tokens": 15614962.0, "step": 7215 }, { "entropy": 6.527265357971191, "epoch": 0.7726470116111082, "grad_norm": 2.078125, "learning_rate": 0.0004949932463204603, "loss": 6.5196, "mean_token_accuracy": 0.12367821410298348, "num_tokens": 15625475.0, "step": 7220 }, { "entropy": 6.600604248046875, "epoch": 0.773182085718872, "grad_norm": 1.1953125, "learning_rate": 0.0004949852223983703, "loss": 6.5051, "mean_token_accuracy": 0.11932418122887611, "num_tokens": 15637359.0, "step": 7225 }, { "entropy": 6.792949867248535, "epoch": 0.773717159826636, "grad_norm": 1.5078125, "learning_rate": 0.0004949771921242379, "loss": 6.5462, "mean_token_accuracy": 0.117109165340662, "num_tokens": 15648368.0, "step": 7230 }, { "entropy": 6.6926452159881595, "epoch": 0.7742522339343999, "grad_norm": 1.34375, "learning_rate": 0.0004949691554982951, "loss": 6.4385, "mean_token_accuracy": 0.13027268201112746, "num_tokens": 15659295.0, "step": 7235 }, { "entropy": 6.543884658813477, "epoch": 0.7747873080421639, "grad_norm": 1.5859375, "learning_rate": 0.0004949611125207737, "loss": 6.4051, "mean_token_accuracy": 0.12192230448126792, "num_tokens": 15669975.0, "step": 7240 }, { "entropy": 6.570065546035766, "epoch": 0.7753223821499278, "grad_norm": 1.5390625, "learning_rate": 0.000494953063191906, "loss": 6.4946, "mean_token_accuracy": 0.11872415691614151, "num_tokens": 15680343.0, "step": 7245 }, { "entropy": 6.683220624923706, "epoch": 0.7758574562576916, "grad_norm": 1.34375, "learning_rate": 0.0004949450075119247, "loss": 6.5525, "mean_token_accuracy": 0.12026704177260399, "num_tokens": 15692246.0, "step": 7250 }, { "entropy": 6.6822953701019285, "epoch": 0.7763925303654556, "grad_norm": 1.140625, "learning_rate": 0.0004949369454810621, "loss": 6.5062, "mean_token_accuracy": 0.12393845468759537, "num_tokens": 15704262.0, "step": 7255 }, { "entropy": 6.547556638717651, "epoch": 0.7769276044732195, "grad_norm": 1.5234375, "learning_rate": 0.0004949288770995512, "loss": 6.4991, "mean_token_accuracy": 0.12381231859326362, "num_tokens": 15715078.0, "step": 7260 }, { "entropy": 6.660402727127075, "epoch": 0.7774626785809835, "grad_norm": 1.3125, "learning_rate": 0.0004949208023676249, "loss": 6.5459, "mean_token_accuracy": 0.1232883907854557, "num_tokens": 15726503.0, "step": 7265 }, { "entropy": 6.587308025360107, "epoch": 0.7779977526887474, "grad_norm": 2.140625, "learning_rate": 0.0004949127212855161, "loss": 6.4327, "mean_token_accuracy": 0.12670731246471406, "num_tokens": 15738854.0, "step": 7270 }, { "entropy": 6.611951589584351, "epoch": 0.7785328267965114, "grad_norm": 1.5859375, "learning_rate": 0.0004949046338534587, "loss": 6.5893, "mean_token_accuracy": 0.12085817605257035, "num_tokens": 15750836.0, "step": 7275 }, { "entropy": 6.783895874023438, "epoch": 0.7790679009042752, "grad_norm": 1.4765625, "learning_rate": 0.0004948965400716857, "loss": 6.5934, "mean_token_accuracy": 0.12155032604932785, "num_tokens": 15762355.0, "step": 7280 }, { "entropy": 6.6959075927734375, "epoch": 0.7796029750120391, "grad_norm": 1.3828125, "learning_rate": 0.000494888439940431, "loss": 6.5948, "mean_token_accuracy": 0.12169316858053207, "num_tokens": 15772952.0, "step": 7285 }, { "entropy": 6.562328147888183, "epoch": 0.7801380491198031, "grad_norm": 1.5703125, "learning_rate": 0.0004948803334599286, "loss": 6.4051, "mean_token_accuracy": 0.13314662128686905, "num_tokens": 15782997.0, "step": 7290 }, { "entropy": 6.598123836517334, "epoch": 0.780673123227567, "grad_norm": 1.6875, "learning_rate": 0.0004948722206304123, "loss": 6.5065, "mean_token_accuracy": 0.12343615815043449, "num_tokens": 15794060.0, "step": 7295 }, { "entropy": 6.707820177078247, "epoch": 0.781208197335331, "grad_norm": 1.1953125, "learning_rate": 0.0004948641014521167, "loss": 6.5704, "mean_token_accuracy": 0.12031665593385696, "num_tokens": 15804149.0, "step": 7300 }, { "entropy": 6.668608617782593, "epoch": 0.7817432714430949, "grad_norm": 1.40625, "learning_rate": 0.000494855975925276, "loss": 6.496, "mean_token_accuracy": 0.12902145832777023, "num_tokens": 15814643.0, "step": 7305 }, { "entropy": 6.645229959487915, "epoch": 0.7822783455508588, "grad_norm": 1.4921875, "learning_rate": 0.0004948478440501249, "loss": 6.4438, "mean_token_accuracy": 0.1254532441496849, "num_tokens": 15824640.0, "step": 7310 }, { "entropy": 6.553537178039551, "epoch": 0.7828134196586227, "grad_norm": 1.40625, "learning_rate": 0.0004948397058268982, "loss": 6.4806, "mean_token_accuracy": 0.12377227991819381, "num_tokens": 15836160.0, "step": 7315 }, { "entropy": 6.6396448612213135, "epoch": 0.7833484937663866, "grad_norm": 1.453125, "learning_rate": 0.0004948315612558308, "loss": 6.5149, "mean_token_accuracy": 0.12054053619503975, "num_tokens": 15846886.0, "step": 7320 }, { "entropy": 6.6480477809906, "epoch": 0.7838835678741506, "grad_norm": 1.5859375, "learning_rate": 0.000494823410337158, "loss": 6.4443, "mean_token_accuracy": 0.13052470311522485, "num_tokens": 15857309.0, "step": 7325 }, { "entropy": 6.601436614990234, "epoch": 0.7844186419819145, "grad_norm": 1.5546875, "learning_rate": 0.0004948152530711153, "loss": 6.5795, "mean_token_accuracy": 0.12191757187247276, "num_tokens": 15869620.0, "step": 7330 }, { "entropy": 6.614558506011963, "epoch": 0.7849537160896785, "grad_norm": 1.359375, "learning_rate": 0.0004948070894579378, "loss": 6.4211, "mean_token_accuracy": 0.129998816549778, "num_tokens": 15880915.0, "step": 7335 }, { "entropy": 6.605517482757568, "epoch": 0.7854887901974423, "grad_norm": 1.296875, "learning_rate": 0.0004947989194978616, "loss": 6.495, "mean_token_accuracy": 0.1268579512834549, "num_tokens": 15891150.0, "step": 7340 }, { "entropy": 6.656474876403808, "epoch": 0.7860238643052063, "grad_norm": 1.2265625, "learning_rate": 0.0004947907431911225, "loss": 6.4923, "mean_token_accuracy": 0.12626128271222115, "num_tokens": 15902526.0, "step": 7345 }, { "entropy": 6.591264724731445, "epoch": 0.7865589384129702, "grad_norm": 1.53125, "learning_rate": 0.0004947825605379566, "loss": 6.4372, "mean_token_accuracy": 0.12627596408128738, "num_tokens": 15913425.0, "step": 7350 }, { "entropy": 6.613666772842407, "epoch": 0.7870940125207341, "grad_norm": 1.3125, "learning_rate": 0.0004947743715386, "loss": 6.4193, "mean_token_accuracy": 0.12343008667230607, "num_tokens": 15924324.0, "step": 7355 }, { "entropy": 6.57948784828186, "epoch": 0.7876290866284981, "grad_norm": 1.6640625, "learning_rate": 0.0004947661761932894, "loss": 6.4727, "mean_token_accuracy": 0.12277128249406814, "num_tokens": 15935533.0, "step": 7360 }, { "entropy": 6.5657641887664795, "epoch": 0.7881641607362619, "grad_norm": 1.3203125, "learning_rate": 0.0004947579745022613, "loss": 6.4295, "mean_token_accuracy": 0.12148091346025466, "num_tokens": 15947007.0, "step": 7365 }, { "entropy": 6.581766366958618, "epoch": 0.7886992348440259, "grad_norm": 1.421875, "learning_rate": 0.0004947497664657527, "loss": 6.4862, "mean_token_accuracy": 0.12112942487001419, "num_tokens": 15957405.0, "step": 7370 }, { "entropy": 6.61507477760315, "epoch": 0.7892343089517898, "grad_norm": 1.296875, "learning_rate": 0.0004947415520840003, "loss": 6.4761, "mean_token_accuracy": 0.12532250955700874, "num_tokens": 15969895.0, "step": 7375 }, { "entropy": 6.637605905532837, "epoch": 0.7897693830595538, "grad_norm": 1.4921875, "learning_rate": 0.0004947333313572416, "loss": 6.3931, "mean_token_accuracy": 0.13630961254239082, "num_tokens": 15979854.0, "step": 7380 }, { "entropy": 6.567370319366455, "epoch": 0.7903044571673177, "grad_norm": 1.390625, "learning_rate": 0.0004947251042857137, "loss": 6.3963, "mean_token_accuracy": 0.13095270618796348, "num_tokens": 15991341.0, "step": 7385 }, { "entropy": 6.531961727142334, "epoch": 0.7908395312750816, "grad_norm": 1.640625, "learning_rate": 0.0004947168708696544, "loss": 6.4554, "mean_token_accuracy": 0.12993446215987206, "num_tokens": 16001944.0, "step": 7390 }, { "entropy": 6.560093545913697, "epoch": 0.7913746053828455, "grad_norm": 1.2734375, "learning_rate": 0.0004947086311093013, "loss": 6.4423, "mean_token_accuracy": 0.1281399607658386, "num_tokens": 16011771.0, "step": 7395 }, { "entropy": 6.687586164474487, "epoch": 0.7919096794906094, "grad_norm": 1.3046875, "learning_rate": 0.0004947003850048924, "loss": 6.6005, "mean_token_accuracy": 0.11408599764108658, "num_tokens": 16023901.0, "step": 7400 }, { "entropy": 6.740469646453858, "epoch": 0.7924447535983734, "grad_norm": 1.4296875, "learning_rate": 0.0004946921325566656, "loss": 6.5191, "mean_token_accuracy": 0.1196585789322853, "num_tokens": 16035014.0, "step": 7405 }, { "entropy": 6.650988531112671, "epoch": 0.7929798277061373, "grad_norm": 1.2109375, "learning_rate": 0.0004946838737648595, "loss": 6.5891, "mean_token_accuracy": 0.11678230240941048, "num_tokens": 16046927.0, "step": 7410 }, { "entropy": 6.613309526443482, "epoch": 0.7935149018139013, "grad_norm": 1.296875, "learning_rate": 0.0004946756086297124, "loss": 6.4909, "mean_token_accuracy": 0.12795686945319176, "num_tokens": 16057341.0, "step": 7415 }, { "entropy": 6.654987621307373, "epoch": 0.7940499759216652, "grad_norm": 1.5078125, "learning_rate": 0.0004946673371514628, "loss": 6.4782, "mean_token_accuracy": 0.12236208170652389, "num_tokens": 16068408.0, "step": 7420 }, { "entropy": 6.5727095127105715, "epoch": 0.794585050029429, "grad_norm": 1.6875, "learning_rate": 0.0004946590593303499, "loss": 6.4494, "mean_token_accuracy": 0.1296915277838707, "num_tokens": 16078693.0, "step": 7425 }, { "entropy": 6.60039119720459, "epoch": 0.795120124137193, "grad_norm": 1.3203125, "learning_rate": 0.0004946507751666124, "loss": 6.4975, "mean_token_accuracy": 0.1274369865655899, "num_tokens": 16089127.0, "step": 7430 }, { "entropy": 6.586338949203491, "epoch": 0.7956551982449569, "grad_norm": 1.5078125, "learning_rate": 0.0004946424846604897, "loss": 6.4071, "mean_token_accuracy": 0.13582724407315255, "num_tokens": 16099726.0, "step": 7435 }, { "entropy": 6.615121269226075, "epoch": 0.7961902723527209, "grad_norm": 1.234375, "learning_rate": 0.0004946341878122212, "loss": 6.4573, "mean_token_accuracy": 0.12698574587702752, "num_tokens": 16111017.0, "step": 7440 }, { "entropy": 6.624665117263794, "epoch": 0.7967253464604848, "grad_norm": 1.484375, "learning_rate": 0.0004946258846220462, "loss": 6.5288, "mean_token_accuracy": 0.12629680335521698, "num_tokens": 16121406.0, "step": 7445 }, { "entropy": 6.636161994934082, "epoch": 0.7972604205682488, "grad_norm": 1.875, "learning_rate": 0.0004946175750902049, "loss": 6.4516, "mean_token_accuracy": 0.12538782581686975, "num_tokens": 16131587.0, "step": 7450 }, { "entropy": 6.5716126441955565, "epoch": 0.7977954946760126, "grad_norm": 2.0625, "learning_rate": 0.0004946092592169368, "loss": 6.4116, "mean_token_accuracy": 0.12958415150642394, "num_tokens": 16142578.0, "step": 7455 }, { "entropy": 6.619257640838623, "epoch": 0.7983305687837765, "grad_norm": 1.4921875, "learning_rate": 0.0004946009370024822, "loss": 6.426, "mean_token_accuracy": 0.1310078866779804, "num_tokens": 16153501.0, "step": 7460 }, { "entropy": 6.572661924362182, "epoch": 0.7988656428915405, "grad_norm": 1.890625, "learning_rate": 0.0004945926084470814, "loss": 6.5052, "mean_token_accuracy": 0.12284256890416145, "num_tokens": 16164273.0, "step": 7465 }, { "entropy": 6.610775899887085, "epoch": 0.7994007169993044, "grad_norm": 1.3046875, "learning_rate": 0.0004945842735509749, "loss": 6.4856, "mean_token_accuracy": 0.12552264481782913, "num_tokens": 16175071.0, "step": 7470 }, { "entropy": 6.680575323104859, "epoch": 0.7999357911070684, "grad_norm": 1.2421875, "learning_rate": 0.0004945759323144034, "loss": 6.5288, "mean_token_accuracy": 0.11573776230216026, "num_tokens": 16185404.0, "step": 7475 }, { "entropy": 6.629665231704712, "epoch": 0.8004708652148322, "grad_norm": 1.4609375, "learning_rate": 0.0004945675847376077, "loss": 6.5139, "mean_token_accuracy": 0.12014818266034126, "num_tokens": 16196881.0, "step": 7480 }, { "entropy": 6.639012718200684, "epoch": 0.8010059393225962, "grad_norm": 1.2734375, "learning_rate": 0.0004945592308208288, "loss": 6.5439, "mean_token_accuracy": 0.12018415406346321, "num_tokens": 16207534.0, "step": 7485 }, { "entropy": 6.646149730682373, "epoch": 0.8015410134303601, "grad_norm": 1.1875, "learning_rate": 0.000494550870564308, "loss": 6.4188, "mean_token_accuracy": 0.13105716928839684, "num_tokens": 16217371.0, "step": 7490 }, { "entropy": 6.6225439548492435, "epoch": 0.802076087538124, "grad_norm": 1.484375, "learning_rate": 0.0004945425039682866, "loss": 6.467, "mean_token_accuracy": 0.1279752753674984, "num_tokens": 16227898.0, "step": 7495 }, { "entropy": 6.564583015441895, "epoch": 0.802611161645888, "grad_norm": 1.4921875, "learning_rate": 0.0004945341310330064, "loss": 6.4619, "mean_token_accuracy": 0.1270508736371994, "num_tokens": 16238966.0, "step": 7500 }, { "entropy": 6.590152359008789, "epoch": 0.8031462357536518, "grad_norm": 1.7890625, "learning_rate": 0.0004945257517587089, "loss": 6.4931, "mean_token_accuracy": 0.12701256275177003, "num_tokens": 16250129.0, "step": 7505 }, { "entropy": 6.5930369853973385, "epoch": 0.8036813098614158, "grad_norm": 1.2421875, "learning_rate": 0.0004945173661456361, "loss": 6.5149, "mean_token_accuracy": 0.12291709631681443, "num_tokens": 16260877.0, "step": 7510 }, { "entropy": 6.699715852737427, "epoch": 0.8042163839691797, "grad_norm": 1.1640625, "learning_rate": 0.0004945089741940303, "loss": 6.472, "mean_token_accuracy": 0.12913578376173973, "num_tokens": 16270548.0, "step": 7515 }, { "entropy": 6.676292562484742, "epoch": 0.8047514580769437, "grad_norm": 1.2734375, "learning_rate": 0.0004945005759041338, "loss": 6.497, "mean_token_accuracy": 0.12249005734920501, "num_tokens": 16281014.0, "step": 7520 }, { "entropy": 6.624485683441162, "epoch": 0.8052865321847076, "grad_norm": 1.2421875, "learning_rate": 0.0004944921712761889, "loss": 6.5405, "mean_token_accuracy": 0.12573966085910798, "num_tokens": 16291653.0, "step": 7525 }, { "entropy": 6.5947753429412845, "epoch": 0.8058216062924715, "grad_norm": 1.28125, "learning_rate": 0.0004944837603104383, "loss": 6.3863, "mean_token_accuracy": 0.13147774934768677, "num_tokens": 16301703.0, "step": 7530 }, { "entropy": 6.560491371154785, "epoch": 0.8063566804002354, "grad_norm": 1.4453125, "learning_rate": 0.0004944753430071252, "loss": 6.4576, "mean_token_accuracy": 0.12715979367494584, "num_tokens": 16312252.0, "step": 7535 }, { "entropy": 6.584918880462647, "epoch": 0.8068917545079993, "grad_norm": 1.375, "learning_rate": 0.0004944669193664923, "loss": 6.4331, "mean_token_accuracy": 0.12487595155835152, "num_tokens": 16324073.0, "step": 7540 }, { "entropy": 6.6717156887054445, "epoch": 0.8074268286157633, "grad_norm": 1.25, "learning_rate": 0.0004944584893887829, "loss": 6.4445, "mean_token_accuracy": 0.12484904229640961, "num_tokens": 16334637.0, "step": 7545 }, { "entropy": 6.605461120605469, "epoch": 0.8079619027235272, "grad_norm": 1.34375, "learning_rate": 0.0004944500530742404, "loss": 6.5743, "mean_token_accuracy": 0.11794036030769348, "num_tokens": 16345581.0, "step": 7550 }, { "entropy": 6.6252374172210695, "epoch": 0.8084969768312912, "grad_norm": 1.453125, "learning_rate": 0.0004944416104231086, "loss": 6.5663, "mean_token_accuracy": 0.1216730572283268, "num_tokens": 16356995.0, "step": 7555 }, { "entropy": 6.688077592849732, "epoch": 0.8090320509390551, "grad_norm": 1.3046875, "learning_rate": 0.0004944331614356311, "loss": 6.5093, "mean_token_accuracy": 0.11890427842736244, "num_tokens": 16368841.0, "step": 7560 }, { "entropy": 6.692157506942749, "epoch": 0.8095671250468189, "grad_norm": 1.2578125, "learning_rate": 0.0004944247061120519, "loss": 6.4279, "mean_token_accuracy": 0.12462588772177696, "num_tokens": 16379295.0, "step": 7565 }, { "entropy": 6.576985025405884, "epoch": 0.8101021991545829, "grad_norm": 1.6953125, "learning_rate": 0.0004944162444526151, "loss": 6.4721, "mean_token_accuracy": 0.13099455311894417, "num_tokens": 16389512.0, "step": 7570 }, { "entropy": 6.476492547988892, "epoch": 0.8106372732623468, "grad_norm": 1.1796875, "learning_rate": 0.0004944077764575651, "loss": 6.3894, "mean_token_accuracy": 0.13501969650387763, "num_tokens": 16400720.0, "step": 7575 }, { "entropy": 6.580502033233643, "epoch": 0.8111723473701108, "grad_norm": 1.7890625, "learning_rate": 0.0004943993021271463, "loss": 6.4658, "mean_token_accuracy": 0.12537092193961144, "num_tokens": 16411278.0, "step": 7580 }, { "entropy": 6.67013144493103, "epoch": 0.8117074214778747, "grad_norm": 1.28125, "learning_rate": 0.0004943908214616035, "loss": 6.5088, "mean_token_accuracy": 0.12090714648365974, "num_tokens": 16421665.0, "step": 7585 }, { "entropy": 6.671138763427734, "epoch": 0.8122424955856387, "grad_norm": 1.25, "learning_rate": 0.0004943823344611818, "loss": 6.5485, "mean_token_accuracy": 0.11637551337480545, "num_tokens": 16432943.0, "step": 7590 }, { "entropy": 6.666892385482788, "epoch": 0.8127775696934025, "grad_norm": 1.421875, "learning_rate": 0.0004943738411261258, "loss": 6.451, "mean_token_accuracy": 0.12569426372647285, "num_tokens": 16444506.0, "step": 7595 }, { "entropy": 6.5838854789733885, "epoch": 0.8133126438011664, "grad_norm": 2.578125, "learning_rate": 0.0004943653414566809, "loss": 6.4841, "mean_token_accuracy": 0.12255563437938691, "num_tokens": 16455403.0, "step": 7600 }, { "entropy": 6.685585021972656, "epoch": 0.8138477179089304, "grad_norm": 1.7421875, "learning_rate": 0.0004943568354530927, "loss": 6.5825, "mean_token_accuracy": 0.11601466611027718, "num_tokens": 16465616.0, "step": 7605 }, { "entropy": 6.6593701362609865, "epoch": 0.8143827920166943, "grad_norm": 1.2890625, "learning_rate": 0.0004943483231156068, "loss": 6.5438, "mean_token_accuracy": 0.12109178379178047, "num_tokens": 16476850.0, "step": 7610 }, { "entropy": 6.668148422241211, "epoch": 0.8149178661244583, "grad_norm": 1.21875, "learning_rate": 0.0004943398044444687, "loss": 6.4975, "mean_token_accuracy": 0.1246594287455082, "num_tokens": 16489118.0, "step": 7615 }, { "entropy": 6.676653909683227, "epoch": 0.8154529402322221, "grad_norm": 1.3984375, "learning_rate": 0.0004943312794399246, "loss": 6.4363, "mean_token_accuracy": 0.12908004522323607, "num_tokens": 16499336.0, "step": 7620 }, { "entropy": 6.601690435409546, "epoch": 0.8159880143399861, "grad_norm": 1.875, "learning_rate": 0.0004943227481022207, "loss": 6.5219, "mean_token_accuracy": 0.11842733025550842, "num_tokens": 16510158.0, "step": 7625 }, { "entropy": 6.564496660232544, "epoch": 0.81652308844775, "grad_norm": 1.453125, "learning_rate": 0.0004943142104316033, "loss": 6.4621, "mean_token_accuracy": 0.12559000104665757, "num_tokens": 16521080.0, "step": 7630 }, { "entropy": 6.656149530410767, "epoch": 0.8170581625555139, "grad_norm": 1.296875, "learning_rate": 0.0004943056664283189, "loss": 6.4704, "mean_token_accuracy": 0.12910144105553628, "num_tokens": 16531072.0, "step": 7635 }, { "entropy": 6.6499816417694095, "epoch": 0.8175932366632779, "grad_norm": 1.359375, "learning_rate": 0.000494297116092614, "loss": 6.5586, "mean_token_accuracy": 0.11900619938969612, "num_tokens": 16542588.0, "step": 7640 }, { "entropy": 6.663675832748413, "epoch": 0.8181283107710418, "grad_norm": 1.609375, "learning_rate": 0.0004942885594247359, "loss": 6.4237, "mean_token_accuracy": 0.12086946368217469, "num_tokens": 16553466.0, "step": 7645 }, { "entropy": 6.618226099014282, "epoch": 0.8186633848788057, "grad_norm": 1.40625, "learning_rate": 0.0004942799964249314, "loss": 6.4553, "mean_token_accuracy": 0.1253214955329895, "num_tokens": 16564084.0, "step": 7650 }, { "entropy": 6.56568751335144, "epoch": 0.8191984589865696, "grad_norm": 1.3828125, "learning_rate": 0.0004942714270934479, "loss": 6.4666, "mean_token_accuracy": 0.13621146976947784, "num_tokens": 16575665.0, "step": 7655 }, { "entropy": 6.610156917572022, "epoch": 0.8197335330943336, "grad_norm": 1.2734375, "learning_rate": 0.0004942628514305326, "loss": 6.4752, "mean_token_accuracy": 0.12168620154261589, "num_tokens": 16586518.0, "step": 7660 }, { "entropy": 6.63839054107666, "epoch": 0.8202686072020975, "grad_norm": 1.2734375, "learning_rate": 0.0004942542694364333, "loss": 6.4753, "mean_token_accuracy": 0.12710672691464425, "num_tokens": 16597345.0, "step": 7665 }, { "entropy": 6.6390495777130125, "epoch": 0.8208036813098614, "grad_norm": 1.9609375, "learning_rate": 0.0004942456811113978, "loss": 6.4888, "mean_token_accuracy": 0.12848000451922417, "num_tokens": 16609586.0, "step": 7670 }, { "entropy": 6.635290050506592, "epoch": 0.8213387554176254, "grad_norm": 1.3125, "learning_rate": 0.0004942370864556741, "loss": 6.3679, "mean_token_accuracy": 0.13500959426164627, "num_tokens": 16620165.0, "step": 7675 }, { "entropy": 6.571346569061279, "epoch": 0.8218738295253892, "grad_norm": 1.640625, "learning_rate": 0.0004942284854695104, "loss": 6.4753, "mean_token_accuracy": 0.12547776997089385, "num_tokens": 16631200.0, "step": 7680 }, { "entropy": 6.609015321731567, "epoch": 0.8224089036331532, "grad_norm": 1.3125, "learning_rate": 0.0004942198781531549, "loss": 6.5048, "mean_token_accuracy": 0.1238760806620121, "num_tokens": 16642553.0, "step": 7685 }, { "entropy": 6.665633964538574, "epoch": 0.8229439777409171, "grad_norm": 1.2265625, "learning_rate": 0.0004942112645068561, "loss": 6.5156, "mean_token_accuracy": 0.12217526063323021, "num_tokens": 16653431.0, "step": 7690 }, { "entropy": 6.571784734725952, "epoch": 0.8234790518486811, "grad_norm": 1.2265625, "learning_rate": 0.000494202644530863, "loss": 6.4593, "mean_token_accuracy": 0.12343985810875893, "num_tokens": 16664880.0, "step": 7695 }, { "entropy": 6.5380603790283205, "epoch": 0.824014125956445, "grad_norm": 1.4921875, "learning_rate": 0.0004941940182254244, "loss": 6.4767, "mean_token_accuracy": 0.12872528284788132, "num_tokens": 16676224.0, "step": 7700 }, { "entropy": 6.582237911224365, "epoch": 0.8245492000642088, "grad_norm": 1.4296875, "learning_rate": 0.0004941853855907892, "loss": 6.5396, "mean_token_accuracy": 0.12095732614398003, "num_tokens": 16687732.0, "step": 7705 }, { "entropy": 6.682282161712647, "epoch": 0.8250842741719728, "grad_norm": 1.3671875, "learning_rate": 0.0004941767466272068, "loss": 6.4688, "mean_token_accuracy": 0.129934361577034, "num_tokens": 16698257.0, "step": 7710 }, { "entropy": 6.666169214248657, "epoch": 0.8256193482797367, "grad_norm": 1.1796875, "learning_rate": 0.0004941681013349267, "loss": 6.4383, "mean_token_accuracy": 0.12359966635704041, "num_tokens": 16708860.0, "step": 7715 }, { "entropy": 6.602855110168457, "epoch": 0.8261544223875007, "grad_norm": 1.34375, "learning_rate": 0.0004941594497141985, "loss": 6.438, "mean_token_accuracy": 0.12608251199126244, "num_tokens": 16719987.0, "step": 7720 }, { "entropy": 6.643445825576782, "epoch": 0.8266894964952646, "grad_norm": 1.4609375, "learning_rate": 0.0004941507917652718, "loss": 6.5341, "mean_token_accuracy": 0.11999792009592056, "num_tokens": 16730861.0, "step": 7725 }, { "entropy": 6.553995418548584, "epoch": 0.8272245706030286, "grad_norm": 1.5546875, "learning_rate": 0.0004941421274883969, "loss": 6.383, "mean_token_accuracy": 0.13347533941268921, "num_tokens": 16740968.0, "step": 7730 }, { "entropy": 6.578843641281128, "epoch": 0.8277596447107924, "grad_norm": 1.234375, "learning_rate": 0.000494133456883824, "loss": 6.4878, "mean_token_accuracy": 0.12768243104219437, "num_tokens": 16750700.0, "step": 7735 }, { "entropy": 6.617146635055542, "epoch": 0.8282947188185563, "grad_norm": 1.4609375, "learning_rate": 0.0004941247799518031, "loss": 6.476, "mean_token_accuracy": 0.12326866835355758, "num_tokens": 16760719.0, "step": 7740 }, { "entropy": 6.594090604782105, "epoch": 0.8288297929263203, "grad_norm": 1.234375, "learning_rate": 0.0004941160966925851, "loss": 6.3544, "mean_token_accuracy": 0.1272714115679264, "num_tokens": 16771331.0, "step": 7745 }, { "entropy": 6.494041490554809, "epoch": 0.8293648670340842, "grad_norm": 1.2734375, "learning_rate": 0.0004941074071064205, "loss": 6.4433, "mean_token_accuracy": 0.12712007239460946, "num_tokens": 16781306.0, "step": 7750 }, { "entropy": 6.638606166839599, "epoch": 0.8298999411418482, "grad_norm": 1.4921875, "learning_rate": 0.0004940987111935605, "loss": 6.4686, "mean_token_accuracy": 0.12214233577251435, "num_tokens": 16793013.0, "step": 7755 }, { "entropy": 6.612168407440185, "epoch": 0.830435015249612, "grad_norm": 1.2109375, "learning_rate": 0.0004940900089542558, "loss": 6.4737, "mean_token_accuracy": 0.12796134501695633, "num_tokens": 16803987.0, "step": 7760 }, { "entropy": 6.5910180568695065, "epoch": 0.830970089357376, "grad_norm": 1.2734375, "learning_rate": 0.000494081300388758, "loss": 6.4697, "mean_token_accuracy": 0.11712961420416831, "num_tokens": 16815031.0, "step": 7765 }, { "entropy": 6.678561735153198, "epoch": 0.8315051634651399, "grad_norm": 1.265625, "learning_rate": 0.0004940725854973184, "loss": 6.5281, "mean_token_accuracy": 0.12335440516471863, "num_tokens": 16826313.0, "step": 7770 }, { "entropy": 6.646420955657959, "epoch": 0.8320402375729038, "grad_norm": 1.2109375, "learning_rate": 0.0004940638642801886, "loss": 6.5086, "mean_token_accuracy": 0.12422936633229256, "num_tokens": 16838470.0, "step": 7775 }, { "entropy": 6.546121120452881, "epoch": 0.8325753116806678, "grad_norm": 1.5078125, "learning_rate": 0.0004940551367376205, "loss": 6.4028, "mean_token_accuracy": 0.12903384640812873, "num_tokens": 16849266.0, "step": 7780 }, { "entropy": 6.566736698150635, "epoch": 0.8331103857884317, "grad_norm": 1.28125, "learning_rate": 0.0004940464028698662, "loss": 6.5309, "mean_token_accuracy": 0.12425655499100685, "num_tokens": 16860720.0, "step": 7785 }, { "entropy": 6.63223614692688, "epoch": 0.8336454598961957, "grad_norm": 1.34375, "learning_rate": 0.0004940376626771779, "loss": 6.4921, "mean_token_accuracy": 0.12509471029043198, "num_tokens": 16872004.0, "step": 7790 }, { "entropy": 6.648682880401611, "epoch": 0.8341805340039595, "grad_norm": 1.9453125, "learning_rate": 0.0004940289161598076, "loss": 6.5292, "mean_token_accuracy": 0.1173703834414482, "num_tokens": 16882898.0, "step": 7795 }, { "entropy": 6.628533267974854, "epoch": 0.8347156081117235, "grad_norm": 1.515625, "learning_rate": 0.0004940201633180084, "loss": 6.4511, "mean_token_accuracy": 0.11566249057650566, "num_tokens": 16894331.0, "step": 7800 }, { "entropy": 6.6906242847442625, "epoch": 0.8352506822194874, "grad_norm": 1.1953125, "learning_rate": 0.0004940114041520326, "loss": 6.5387, "mean_token_accuracy": 0.1246345192193985, "num_tokens": 16903656.0, "step": 7805 }, { "entropy": 6.581471395492554, "epoch": 0.8357857563272513, "grad_norm": 1.1953125, "learning_rate": 0.0004940026386621333, "loss": 6.5019, "mean_token_accuracy": 0.12531133443117143, "num_tokens": 16915878.0, "step": 7810 }, { "entropy": 6.6755578994750975, "epoch": 0.8363208304350153, "grad_norm": 1.4453125, "learning_rate": 0.0004939938668485636, "loss": 6.5432, "mean_token_accuracy": 0.1215199887752533, "num_tokens": 16926577.0, "step": 7815 }, { "entropy": 6.565039253234863, "epoch": 0.8368559045427791, "grad_norm": 1.3359375, "learning_rate": 0.0004939850887115768, "loss": 6.4234, "mean_token_accuracy": 0.1319645993411541, "num_tokens": 16938012.0, "step": 7820 }, { "entropy": 6.569745969772339, "epoch": 0.8373909786505431, "grad_norm": 1.3828125, "learning_rate": 0.0004939763042514263, "loss": 6.4132, "mean_token_accuracy": 0.12320912629365921, "num_tokens": 16949007.0, "step": 7825 }, { "entropy": 6.491839742660522, "epoch": 0.837926052758307, "grad_norm": 1.2578125, "learning_rate": 0.0004939675134683658, "loss": 6.3726, "mean_token_accuracy": 0.13265551403164863, "num_tokens": 16959425.0, "step": 7830 }, { "entropy": 6.643397045135498, "epoch": 0.838461126866071, "grad_norm": 1.4765625, "learning_rate": 0.0004939587163626491, "loss": 6.4972, "mean_token_accuracy": 0.11856562122702599, "num_tokens": 16970002.0, "step": 7835 }, { "entropy": 6.622504758834839, "epoch": 0.8389962009738349, "grad_norm": 1.8359375, "learning_rate": 0.0004939499129345302, "loss": 6.5261, "mean_token_accuracy": 0.12169675678014755, "num_tokens": 16980739.0, "step": 7840 }, { "entropy": 6.638087224960327, "epoch": 0.8395312750815987, "grad_norm": 1.78125, "learning_rate": 0.0004939411031842633, "loss": 6.4766, "mean_token_accuracy": 0.1255985088646412, "num_tokens": 16991643.0, "step": 7845 }, { "entropy": 6.454816770553589, "epoch": 0.8400663491893627, "grad_norm": 1.5390625, "learning_rate": 0.000493932287112103, "loss": 6.3395, "mean_token_accuracy": 0.1409579671919346, "num_tokens": 17001975.0, "step": 7850 }, { "entropy": 6.637519359588623, "epoch": 0.8406014232971266, "grad_norm": 1.34375, "learning_rate": 0.0004939234647183035, "loss": 6.4786, "mean_token_accuracy": 0.12199027836322784, "num_tokens": 17012658.0, "step": 7855 }, { "entropy": 6.653904962539673, "epoch": 0.8411364974048906, "grad_norm": 1.3359375, "learning_rate": 0.0004939146360031197, "loss": 6.4875, "mean_token_accuracy": 0.12131756246089935, "num_tokens": 17023196.0, "step": 7860 }, { "entropy": 6.606409931182862, "epoch": 0.8416715715126545, "grad_norm": 1.4140625, "learning_rate": 0.0004939058009668067, "loss": 6.5086, "mean_token_accuracy": 0.12194685339927673, "num_tokens": 17034589.0, "step": 7865 }, { "entropy": 6.642972040176391, "epoch": 0.8422066456204185, "grad_norm": 2.25, "learning_rate": 0.0004938969596096194, "loss": 6.4733, "mean_token_accuracy": 0.12159970998764039, "num_tokens": 17046139.0, "step": 7870 }, { "entropy": 6.589673328399658, "epoch": 0.8427417197281823, "grad_norm": 1.375, "learning_rate": 0.000493888111931813, "loss": 6.4945, "mean_token_accuracy": 0.12014141380786895, "num_tokens": 17056926.0, "step": 7875 }, { "entropy": 6.539459180831909, "epoch": 0.8432767938359462, "grad_norm": 3.125, "learning_rate": 0.0004938792579336433, "loss": 6.4375, "mean_token_accuracy": 0.12531604021787643, "num_tokens": 17067339.0, "step": 7880 }, { "entropy": 6.603718090057373, "epoch": 0.8438118679437102, "grad_norm": 2.140625, "learning_rate": 0.0004938703976153657, "loss": 6.4518, "mean_token_accuracy": 0.1254698507487774, "num_tokens": 17078037.0, "step": 7885 }, { "entropy": 6.632722282409668, "epoch": 0.8443469420514741, "grad_norm": 1.2890625, "learning_rate": 0.0004938615309772362, "loss": 6.4862, "mean_token_accuracy": 0.11615241914987565, "num_tokens": 17089069.0, "step": 7890 }, { "entropy": 6.616069984436035, "epoch": 0.8448820161592381, "grad_norm": 1.2578125, "learning_rate": 0.0004938526580195107, "loss": 6.4657, "mean_token_accuracy": 0.12840015292167664, "num_tokens": 17100006.0, "step": 7895 }, { "entropy": 6.608232641220093, "epoch": 0.845417090267002, "grad_norm": 1.34375, "learning_rate": 0.0004938437787424454, "loss": 6.501, "mean_token_accuracy": 0.12470883950591087, "num_tokens": 17111896.0, "step": 7900 }, { "entropy": 6.601596450805664, "epoch": 0.845952164374766, "grad_norm": 1.9609375, "learning_rate": 0.0004938348931462969, "loss": 6.5061, "mean_token_accuracy": 0.1278610810637474, "num_tokens": 17123202.0, "step": 7905 }, { "entropy": 6.600058317184448, "epoch": 0.8464872384825298, "grad_norm": 1.4375, "learning_rate": 0.0004938260012313215, "loss": 6.4451, "mean_token_accuracy": 0.12930461540818214, "num_tokens": 17134013.0, "step": 7910 }, { "entropy": 6.536851596832276, "epoch": 0.8470223125902937, "grad_norm": 1.890625, "learning_rate": 0.0004938171029977761, "loss": 6.4564, "mean_token_accuracy": 0.12916264310479164, "num_tokens": 17144041.0, "step": 7915 }, { "entropy": 6.553992843627929, "epoch": 0.8475573866980577, "grad_norm": 1.4375, "learning_rate": 0.0004938081984459176, "loss": 6.4397, "mean_token_accuracy": 0.12721440196037292, "num_tokens": 17155334.0, "step": 7920 }, { "entropy": 6.6116251945495605, "epoch": 0.8480924608058216, "grad_norm": 1.6171875, "learning_rate": 0.000493799287576003, "loss": 6.3996, "mean_token_accuracy": 0.12881384789943695, "num_tokens": 17166243.0, "step": 7925 }, { "entropy": 6.599978303909301, "epoch": 0.8486275349135856, "grad_norm": 1.421875, "learning_rate": 0.0004937903703882898, "loss": 6.4664, "mean_token_accuracy": 0.12380218654870986, "num_tokens": 17177709.0, "step": 7930 }, { "entropy": 6.550316333770752, "epoch": 0.8491626090213494, "grad_norm": 1.28125, "learning_rate": 0.0004937814468830353, "loss": 6.4306, "mean_token_accuracy": 0.12615659311413766, "num_tokens": 17188275.0, "step": 7935 }, { "entropy": 6.639209222793579, "epoch": 0.8496976831291134, "grad_norm": 1.2890625, "learning_rate": 0.0004937725170604975, "loss": 6.5549, "mean_token_accuracy": 0.12421398386359214, "num_tokens": 17199527.0, "step": 7940 }, { "entropy": 6.658242416381836, "epoch": 0.8502327572368773, "grad_norm": 1.4453125, "learning_rate": 0.0004937635809209339, "loss": 6.4738, "mean_token_accuracy": 0.12579896971583365, "num_tokens": 17209500.0, "step": 7945 }, { "entropy": 6.567161989212036, "epoch": 0.8507678313446412, "grad_norm": 1.828125, "learning_rate": 0.0004937546384646027, "loss": 6.4189, "mean_token_accuracy": 0.1228828877210617, "num_tokens": 17219589.0, "step": 7950 }, { "entropy": 6.668274545669556, "epoch": 0.8513029054524052, "grad_norm": 1.8125, "learning_rate": 0.0004937456896917619, "loss": 6.4642, "mean_token_accuracy": 0.1268440864980221, "num_tokens": 17230508.0, "step": 7955 }, { "entropy": 6.628099966049194, "epoch": 0.851837979560169, "grad_norm": 1.328125, "learning_rate": 0.0004937367346026702, "loss": 6.4648, "mean_token_accuracy": 0.12629646956920623, "num_tokens": 17240886.0, "step": 7960 }, { "entropy": 6.5766232967376705, "epoch": 0.852373053667933, "grad_norm": 1.5078125, "learning_rate": 0.0004937277731975858, "loss": 6.4924, "mean_token_accuracy": 0.12928350567817687, "num_tokens": 17252247.0, "step": 7965 }, { "entropy": 6.573000049591064, "epoch": 0.8529081277756969, "grad_norm": 1.71875, "learning_rate": 0.0004937188054767679, "loss": 6.4584, "mean_token_accuracy": 0.12772766575217248, "num_tokens": 17262845.0, "step": 7970 }, { "entropy": 6.6421280860900875, "epoch": 0.8534432018834609, "grad_norm": 1.578125, "learning_rate": 0.0004937098314404751, "loss": 6.4562, "mean_token_accuracy": 0.12444490268826484, "num_tokens": 17274247.0, "step": 7975 }, { "entropy": 6.644790935516357, "epoch": 0.8539782759912248, "grad_norm": 1.40625, "learning_rate": 0.0004937008510889668, "loss": 6.4871, "mean_token_accuracy": 0.12767765745520593, "num_tokens": 17285471.0, "step": 7980 }, { "entropy": 6.589143466949463, "epoch": 0.8545133500989887, "grad_norm": 1.4453125, "learning_rate": 0.0004936918644225021, "loss": 6.5025, "mean_token_accuracy": 0.12948852255940438, "num_tokens": 17296243.0, "step": 7985 }, { "entropy": 6.579883146286011, "epoch": 0.8550484242067526, "grad_norm": 1.3828125, "learning_rate": 0.0004936828714413405, "loss": 6.4633, "mean_token_accuracy": 0.12740985825657844, "num_tokens": 17307301.0, "step": 7990 }, { "entropy": 6.545937824249267, "epoch": 0.8555834983145165, "grad_norm": 1.5078125, "learning_rate": 0.0004936738721457417, "loss": 6.3969, "mean_token_accuracy": 0.13528102710843087, "num_tokens": 17318550.0, "step": 7995 }, { "entropy": 6.5888251781463625, "epoch": 0.8561185724222805, "grad_norm": 1.4609375, "learning_rate": 0.0004936648665359657, "loss": 6.4592, "mean_token_accuracy": 0.12461457923054695, "num_tokens": 17328577.0, "step": 8000 }, { "entropy": 6.586920166015625, "epoch": 0.8566536465300444, "grad_norm": 1.3984375, "learning_rate": 0.0004936558546122723, "loss": 6.5184, "mean_token_accuracy": 0.12257596775889397, "num_tokens": 17341013.0, "step": 8005 }, { "entropy": 6.589303112030029, "epoch": 0.8571887206378084, "grad_norm": 1.453125, "learning_rate": 0.0004936468363749217, "loss": 6.4655, "mean_token_accuracy": 0.12056496143341064, "num_tokens": 17351956.0, "step": 8010 }, { "entropy": 6.6829746723175045, "epoch": 0.8577237947455723, "grad_norm": 1.3515625, "learning_rate": 0.0004936378118241746, "loss": 6.4386, "mean_token_accuracy": 0.117622260004282, "num_tokens": 17363465.0, "step": 8015 }, { "entropy": 6.584981489181518, "epoch": 0.8582588688533361, "grad_norm": 1.28125, "learning_rate": 0.0004936287809602913, "loss": 6.4964, "mean_token_accuracy": 0.1258731223642826, "num_tokens": 17374458.0, "step": 8020 }, { "entropy": 6.558772945404053, "epoch": 0.8587939429611001, "grad_norm": 1.546875, "learning_rate": 0.0004936197437835329, "loss": 6.4979, "mean_token_accuracy": 0.12399565950036048, "num_tokens": 17385492.0, "step": 8025 }, { "entropy": 6.684000682830811, "epoch": 0.859329017068864, "grad_norm": 1.28125, "learning_rate": 0.0004936107002941599, "loss": 6.446, "mean_token_accuracy": 0.1296046145260334, "num_tokens": 17395640.0, "step": 8030 }, { "entropy": 6.621039772033692, "epoch": 0.859864091176628, "grad_norm": 1.296875, "learning_rate": 0.0004936016504924337, "loss": 6.4657, "mean_token_accuracy": 0.12447260543704033, "num_tokens": 17405211.0, "step": 8035 }, { "entropy": 6.572212600708008, "epoch": 0.8603991652843919, "grad_norm": 1.578125, "learning_rate": 0.0004935925943786155, "loss": 6.4385, "mean_token_accuracy": 0.12494494318962097, "num_tokens": 17415421.0, "step": 8040 }, { "entropy": 6.5851781368255615, "epoch": 0.8609342393921559, "grad_norm": 1.3203125, "learning_rate": 0.0004935835319529669, "loss": 6.4882, "mean_token_accuracy": 0.12248977199196816, "num_tokens": 17426040.0, "step": 8045 }, { "entropy": 6.55501275062561, "epoch": 0.8614693134999197, "grad_norm": 1.34375, "learning_rate": 0.0004935744632157496, "loss": 6.4693, "mean_token_accuracy": 0.12371492311358452, "num_tokens": 17436305.0, "step": 8050 }, { "entropy": 6.602463960647583, "epoch": 0.8620043876076836, "grad_norm": 1.3515625, "learning_rate": 0.0004935653881672253, "loss": 6.5244, "mean_token_accuracy": 0.12265571355819702, "num_tokens": 17446786.0, "step": 8055 }, { "entropy": 6.612880706787109, "epoch": 0.8625394617154476, "grad_norm": 1.578125, "learning_rate": 0.0004935563068076561, "loss": 6.422, "mean_token_accuracy": 0.1300605744123459, "num_tokens": 17456613.0, "step": 8060 }, { "entropy": 6.542842960357666, "epoch": 0.8630745358232115, "grad_norm": 1.46875, "learning_rate": 0.0004935472191373044, "loss": 6.3675, "mean_token_accuracy": 0.12812848910689353, "num_tokens": 17467281.0, "step": 8065 }, { "entropy": 6.56179370880127, "epoch": 0.8636096099309755, "grad_norm": 1.40625, "learning_rate": 0.0004935381251564324, "loss": 6.4896, "mean_token_accuracy": 0.12458937540650368, "num_tokens": 17478271.0, "step": 8070 }, { "entropy": 6.59501895904541, "epoch": 0.8641446840387393, "grad_norm": 1.8671875, "learning_rate": 0.0004935290248653027, "loss": 6.4665, "mean_token_accuracy": 0.12613890841603279, "num_tokens": 17489519.0, "step": 8075 }, { "entropy": 6.614124202728272, "epoch": 0.8646797581465033, "grad_norm": 1.25, "learning_rate": 0.0004935199182641781, "loss": 6.4417, "mean_token_accuracy": 0.12557547613978387, "num_tokens": 17500076.0, "step": 8080 }, { "entropy": 6.614273643493652, "epoch": 0.8652148322542672, "grad_norm": 1.53125, "learning_rate": 0.0004935108053533216, "loss": 6.4453, "mean_token_accuracy": 0.12125986739993096, "num_tokens": 17509898.0, "step": 8085 }, { "entropy": 6.550960397720337, "epoch": 0.8657499063620312, "grad_norm": 1.609375, "learning_rate": 0.0004935016861329964, "loss": 6.406, "mean_token_accuracy": 0.1296715520322323, "num_tokens": 17519890.0, "step": 8090 }, { "entropy": 6.530986309051514, "epoch": 0.8662849804697951, "grad_norm": 1.2734375, "learning_rate": 0.0004934925606034656, "loss": 6.4381, "mean_token_accuracy": 0.12463523522019386, "num_tokens": 17530927.0, "step": 8095 }, { "entropy": 6.6647419929504395, "epoch": 0.866820054577559, "grad_norm": 1.484375, "learning_rate": 0.0004934834287649928, "loss": 6.5129, "mean_token_accuracy": 0.12179197296500206, "num_tokens": 17541174.0, "step": 8100 }, { "entropy": 6.6586121082305905, "epoch": 0.8673551286853229, "grad_norm": 2.21875, "learning_rate": 0.0004934742906178417, "loss": 6.4765, "mean_token_accuracy": 0.11956845298409462, "num_tokens": 17552460.0, "step": 8105 }, { "entropy": 6.6295825958251955, "epoch": 0.8678902027930868, "grad_norm": 1.5, "learning_rate": 0.0004934651461622762, "loss": 6.483, "mean_token_accuracy": 0.12741912975907327, "num_tokens": 17563908.0, "step": 8110 }, { "entropy": 6.586279296875, "epoch": 0.8684252769008508, "grad_norm": 1.1953125, "learning_rate": 0.0004934559953985603, "loss": 6.4953, "mean_token_accuracy": 0.1282585471868515, "num_tokens": 17574314.0, "step": 8115 }, { "entropy": 6.640317058563232, "epoch": 0.8689603510086147, "grad_norm": 1.3671875, "learning_rate": 0.0004934468383269582, "loss": 6.4568, "mean_token_accuracy": 0.12750404104590415, "num_tokens": 17583719.0, "step": 8120 }, { "entropy": 6.520741510391235, "epoch": 0.8694954251163787, "grad_norm": 1.5390625, "learning_rate": 0.0004934376749477344, "loss": 6.4474, "mean_token_accuracy": 0.1261451207101345, "num_tokens": 17594522.0, "step": 8125 }, { "entropy": 6.550720930099487, "epoch": 0.8700304992241426, "grad_norm": 1.5703125, "learning_rate": 0.0004934285052611533, "loss": 6.384, "mean_token_accuracy": 0.13392736613750458, "num_tokens": 17604632.0, "step": 8130 }, { "entropy": 6.7096068382263185, "epoch": 0.8705655733319064, "grad_norm": 2.53125, "learning_rate": 0.00049341932926748, "loss": 6.5216, "mean_token_accuracy": 0.12129078730940819, "num_tokens": 17615459.0, "step": 8135 }, { "entropy": 6.650518894195557, "epoch": 0.8711006474396704, "grad_norm": 1.359375, "learning_rate": 0.0004934101469669791, "loss": 6.4636, "mean_token_accuracy": 0.1257311299443245, "num_tokens": 17625800.0, "step": 8140 }, { "entropy": 6.517386484146118, "epoch": 0.8716357215474343, "grad_norm": 1.4296875, "learning_rate": 0.0004934009583599159, "loss": 6.3112, "mean_token_accuracy": 0.13819433227181435, "num_tokens": 17637264.0, "step": 8145 }, { "entropy": 6.515216493606568, "epoch": 0.8721707956551983, "grad_norm": 1.421875, "learning_rate": 0.0004933917634465558, "loss": 6.3499, "mean_token_accuracy": 0.12682703286409377, "num_tokens": 17648256.0, "step": 8150 }, { "entropy": 6.564549684524536, "epoch": 0.8727058697629622, "grad_norm": 1.625, "learning_rate": 0.0004933825622271642, "loss": 6.4983, "mean_token_accuracy": 0.12459777966141701, "num_tokens": 17659096.0, "step": 8155 }, { "entropy": 6.629525566101075, "epoch": 0.8732409438707261, "grad_norm": 1.2578125, "learning_rate": 0.0004933733547020069, "loss": 6.4714, "mean_token_accuracy": 0.12370945960283279, "num_tokens": 17669808.0, "step": 8160 }, { "entropy": 6.615776252746582, "epoch": 0.87377601797849, "grad_norm": 1.4609375, "learning_rate": 0.0004933641408713495, "loss": 6.4171, "mean_token_accuracy": 0.12331488877534866, "num_tokens": 17680375.0, "step": 8165 }, { "entropy": 6.513298511505127, "epoch": 0.8743110920862539, "grad_norm": 1.4921875, "learning_rate": 0.0004933549207354582, "loss": 6.3829, "mean_token_accuracy": 0.13013615384697913, "num_tokens": 17690780.0, "step": 8170 }, { "entropy": 6.601052331924438, "epoch": 0.8748461661940179, "grad_norm": 2.125, "learning_rate": 0.0004933456942945994, "loss": 6.483, "mean_token_accuracy": 0.12874177172780038, "num_tokens": 17702170.0, "step": 8175 }, { "entropy": 6.5550049304962155, "epoch": 0.8753812403017818, "grad_norm": 1.9609375, "learning_rate": 0.0004933364615490393, "loss": 6.4206, "mean_token_accuracy": 0.12599021792411805, "num_tokens": 17712631.0, "step": 8180 }, { "entropy": 6.611193418502808, "epoch": 0.8759163144095458, "grad_norm": 1.4375, "learning_rate": 0.0004933272224990445, "loss": 6.5003, "mean_token_accuracy": 0.12176733165979385, "num_tokens": 17723692.0, "step": 8185 }, { "entropy": 6.6318916320800785, "epoch": 0.8764513885173096, "grad_norm": 1.5234375, "learning_rate": 0.0004933179771448819, "loss": 6.4129, "mean_token_accuracy": 0.13463898748159409, "num_tokens": 17735264.0, "step": 8190 }, { "entropy": 6.5342247009277346, "epoch": 0.8769864626250736, "grad_norm": 1.3984375, "learning_rate": 0.0004933087254868183, "loss": 6.3354, "mean_token_accuracy": 0.1375872351229191, "num_tokens": 17747060.0, "step": 8195 }, { "entropy": 6.510075902938842, "epoch": 0.8775215367328375, "grad_norm": 1.6484375, "learning_rate": 0.000493299467525121, "loss": 6.4422, "mean_token_accuracy": 0.12407493069767953, "num_tokens": 17758159.0, "step": 8200 }, { "entropy": 6.57683801651001, "epoch": 0.8780566108406014, "grad_norm": 1.265625, "learning_rate": 0.0004932902032600573, "loss": 6.4594, "mean_token_accuracy": 0.12217129170894622, "num_tokens": 17768444.0, "step": 8205 }, { "entropy": 6.646522092819214, "epoch": 0.8785916849483654, "grad_norm": 1.4296875, "learning_rate": 0.0004932809326918945, "loss": 6.3517, "mean_token_accuracy": 0.1339459776878357, "num_tokens": 17779303.0, "step": 8210 }, { "entropy": 6.622037935256958, "epoch": 0.8791267590561292, "grad_norm": 1.265625, "learning_rate": 0.0004932716558209005, "loss": 6.5405, "mean_token_accuracy": 0.11944242864847184, "num_tokens": 17789853.0, "step": 8215 }, { "entropy": 6.602828121185302, "epoch": 0.8796618331638932, "grad_norm": 1.6953125, "learning_rate": 0.0004932623726473432, "loss": 6.3894, "mean_token_accuracy": 0.1371438518166542, "num_tokens": 17799232.0, "step": 8220 }, { "entropy": 6.487914800643921, "epoch": 0.8801969072716571, "grad_norm": 1.640625, "learning_rate": 0.0004932530831714904, "loss": 6.4097, "mean_token_accuracy": 0.12824408933520318, "num_tokens": 17808870.0, "step": 8225 }, { "entropy": 6.5319726943969725, "epoch": 0.8807319813794211, "grad_norm": 1.3046875, "learning_rate": 0.0004932437873936107, "loss": 6.4906, "mean_token_accuracy": 0.11963605657219886, "num_tokens": 17819394.0, "step": 8230 }, { "entropy": 6.662888050079346, "epoch": 0.881267055487185, "grad_norm": 1.484375, "learning_rate": 0.0004932344853139721, "loss": 6.4679, "mean_token_accuracy": 0.12477930113673211, "num_tokens": 17830220.0, "step": 8235 }, { "entropy": 6.598001623153687, "epoch": 0.8818021295949489, "grad_norm": 1.5234375, "learning_rate": 0.0004932251769328436, "loss": 6.4034, "mean_token_accuracy": 0.1247767224907875, "num_tokens": 17841971.0, "step": 8240 }, { "entropy": 6.5990701675415036, "epoch": 0.8823372037027128, "grad_norm": 1.359375, "learning_rate": 0.0004932158622504937, "loss": 6.4173, "mean_token_accuracy": 0.12920651137828826, "num_tokens": 17851890.0, "step": 8245 }, { "entropy": 6.519874525070191, "epoch": 0.8828722778104767, "grad_norm": 1.421875, "learning_rate": 0.0004932065412671915, "loss": 6.4123, "mean_token_accuracy": 0.13252334222197532, "num_tokens": 17862855.0, "step": 8250 }, { "entropy": 6.629786729812622, "epoch": 0.8834073519182407, "grad_norm": 1.4921875, "learning_rate": 0.0004931972139832058, "loss": 6.4243, "mean_token_accuracy": 0.12248511165380478, "num_tokens": 17873550.0, "step": 8255 }, { "entropy": 6.638599252700805, "epoch": 0.8839424260260046, "grad_norm": 2.46875, "learning_rate": 0.0004931878803988066, "loss": 6.4432, "mean_token_accuracy": 0.13054898232221604, "num_tokens": 17884067.0, "step": 8260 }, { "entropy": 6.601341295242309, "epoch": 0.8844775001337686, "grad_norm": 1.5234375, "learning_rate": 0.0004931785405142627, "loss": 6.4715, "mean_token_accuracy": 0.12773810103535652, "num_tokens": 17894587.0, "step": 8265 }, { "entropy": 6.557901048660279, "epoch": 0.8850125742415325, "grad_norm": 1.375, "learning_rate": 0.0004931691943298443, "loss": 6.4536, "mean_token_accuracy": 0.12345588281750679, "num_tokens": 17905297.0, "step": 8270 }, { "entropy": 6.472777080535889, "epoch": 0.8855476483492963, "grad_norm": 1.3046875, "learning_rate": 0.000493159841845821, "loss": 6.3637, "mean_token_accuracy": 0.12871376648545266, "num_tokens": 17916225.0, "step": 8275 }, { "entropy": 6.641252183914185, "epoch": 0.8860827224570603, "grad_norm": 2.890625, "learning_rate": 0.0004931504830624629, "loss": 6.4114, "mean_token_accuracy": 0.12872292771935462, "num_tokens": 17925795.0, "step": 8280 }, { "entropy": 6.560930967330933, "epoch": 0.8866177965648242, "grad_norm": 1.2734375, "learning_rate": 0.0004931411179800403, "loss": 6.4212, "mean_token_accuracy": 0.12332068607211114, "num_tokens": 17936134.0, "step": 8285 }, { "entropy": 6.576021671295166, "epoch": 0.8871528706725882, "grad_norm": 1.7734375, "learning_rate": 0.0004931317465988235, "loss": 6.4877, "mean_token_accuracy": 0.12288779988884926, "num_tokens": 17946393.0, "step": 8290 }, { "entropy": 6.620288515090943, "epoch": 0.8876879447803521, "grad_norm": 1.5546875, "learning_rate": 0.0004931223689190832, "loss": 6.4979, "mean_token_accuracy": 0.12131898999214172, "num_tokens": 17957527.0, "step": 8295 }, { "entropy": 6.60401668548584, "epoch": 0.8882230188881161, "grad_norm": 1.390625, "learning_rate": 0.0004931129849410903, "loss": 6.5001, "mean_token_accuracy": 0.12653226852416993, "num_tokens": 17968390.0, "step": 8300 }, { "entropy": 6.624185705184937, "epoch": 0.8887580929958799, "grad_norm": 1.484375, "learning_rate": 0.0004931035946651154, "loss": 6.424, "mean_token_accuracy": 0.13672848865389825, "num_tokens": 17978667.0, "step": 8305 }, { "entropy": 6.649472332000732, "epoch": 0.8892931671036438, "grad_norm": 1.734375, "learning_rate": 0.0004930941980914299, "loss": 6.484, "mean_token_accuracy": 0.12073868960142135, "num_tokens": 17989008.0, "step": 8310 }, { "entropy": 6.55554428100586, "epoch": 0.8898282412114078, "grad_norm": 1.6796875, "learning_rate": 0.0004930847952203052, "loss": 6.4167, "mean_token_accuracy": 0.11992595419287681, "num_tokens": 18000199.0, "step": 8315 }, { "entropy": 6.6081115245819095, "epoch": 0.8903633153191717, "grad_norm": 2.21875, "learning_rate": 0.0004930753860520126, "loss": 6.3714, "mean_token_accuracy": 0.12737504318356513, "num_tokens": 18010941.0, "step": 8320 }, { "entropy": 6.636107873916626, "epoch": 0.8908983894269357, "grad_norm": 1.3828125, "learning_rate": 0.0004930659705868237, "loss": 6.4755, "mean_token_accuracy": 0.12668566182255744, "num_tokens": 18021519.0, "step": 8325 }, { "entropy": 6.576786231994629, "epoch": 0.8914334635346995, "grad_norm": 2.296875, "learning_rate": 0.0004930565488250108, "loss": 6.4282, "mean_token_accuracy": 0.12401631250977516, "num_tokens": 18032773.0, "step": 8330 }, { "entropy": 6.560948514938355, "epoch": 0.8919685376424635, "grad_norm": 1.625, "learning_rate": 0.0004930471207668456, "loss": 6.3931, "mean_token_accuracy": 0.1288905918598175, "num_tokens": 18043250.0, "step": 8335 }, { "entropy": 6.577342367172241, "epoch": 0.8925036117502274, "grad_norm": 1.4453125, "learning_rate": 0.0004930376864126005, "loss": 6.4045, "mean_token_accuracy": 0.13135718554258347, "num_tokens": 18055165.0, "step": 8340 }, { "entropy": 6.533294534683227, "epoch": 0.8930386858579913, "grad_norm": 1.375, "learning_rate": 0.0004930282457625476, "loss": 6.3655, "mean_token_accuracy": 0.1319275178015232, "num_tokens": 18065296.0, "step": 8345 }, { "entropy": 6.483318853378296, "epoch": 0.8935737599657553, "grad_norm": 1.734375, "learning_rate": 0.00049301879881696, "loss": 6.3713, "mean_token_accuracy": 0.12717922553420066, "num_tokens": 18075536.0, "step": 8350 }, { "entropy": 6.523620080947876, "epoch": 0.8941088340735192, "grad_norm": 1.4296875, "learning_rate": 0.0004930093455761101, "loss": 6.4792, "mean_token_accuracy": 0.1299550086259842, "num_tokens": 18086253.0, "step": 8355 }, { "entropy": 6.625021934509277, "epoch": 0.8946439081812831, "grad_norm": 2.15625, "learning_rate": 0.000492999886040271, "loss": 6.4867, "mean_token_accuracy": 0.12763941064476966, "num_tokens": 18097335.0, "step": 8360 }, { "entropy": 6.678513479232788, "epoch": 0.895178982289047, "grad_norm": 1.53125, "learning_rate": 0.0004929904202097159, "loss": 6.4165, "mean_token_accuracy": 0.1255946137011051, "num_tokens": 18107293.0, "step": 8365 }, { "entropy": 6.574617719650268, "epoch": 0.895714056396811, "grad_norm": 2.0, "learning_rate": 0.0004929809480847179, "loss": 6.529, "mean_token_accuracy": 0.11832507178187371, "num_tokens": 18117705.0, "step": 8370 }, { "entropy": 6.6313234806060795, "epoch": 0.8962491305045749, "grad_norm": 2.015625, "learning_rate": 0.0004929714696655507, "loss": 6.4331, "mean_token_accuracy": 0.12140770703554153, "num_tokens": 18129003.0, "step": 8375 }, { "entropy": 6.6004438400268555, "epoch": 0.8967842046123388, "grad_norm": 1.6796875, "learning_rate": 0.000492961984952488, "loss": 6.3848, "mean_token_accuracy": 0.1367577515542507, "num_tokens": 18140843.0, "step": 8380 }, { "entropy": 6.557983160018921, "epoch": 0.8973192787201028, "grad_norm": 1.375, "learning_rate": 0.0004929524939458037, "loss": 6.4735, "mean_token_accuracy": 0.12216648012399674, "num_tokens": 18151476.0, "step": 8385 }, { "entropy": 6.597401762008667, "epoch": 0.8978543528278666, "grad_norm": 1.75, "learning_rate": 0.0004929429966457716, "loss": 6.4974, "mean_token_accuracy": 0.11995471492409707, "num_tokens": 18161304.0, "step": 8390 }, { "entropy": 6.655696821212769, "epoch": 0.8983894269356306, "grad_norm": 1.3671875, "learning_rate": 0.0004929334930526662, "loss": 6.4287, "mean_token_accuracy": 0.13061922267079354, "num_tokens": 18173696.0, "step": 8395 }, { "entropy": 6.572501087188721, "epoch": 0.8989245010433945, "grad_norm": 1.9609375, "learning_rate": 0.0004929239831667617, "loss": 6.4387, "mean_token_accuracy": 0.12057856544852256, "num_tokens": 18186024.0, "step": 8400 }, { "entropy": 6.567807579040528, "epoch": 0.8994595751511585, "grad_norm": 1.328125, "learning_rate": 0.0004929144669883329, "loss": 6.4628, "mean_token_accuracy": 0.13044245541095734, "num_tokens": 18196976.0, "step": 8405 }, { "entropy": 6.587893533706665, "epoch": 0.8999946492589224, "grad_norm": 1.8984375, "learning_rate": 0.0004929049445176545, "loss": 6.4553, "mean_token_accuracy": 0.12222403511404992, "num_tokens": 18208086.0, "step": 8410 }, { "entropy": 6.598808670043946, "epoch": 0.9005297233666862, "grad_norm": 1.4609375, "learning_rate": 0.0004928954157550013, "loss": 6.4026, "mean_token_accuracy": 0.1364985041320324, "num_tokens": 18218468.0, "step": 8415 }, { "entropy": 6.641229772567749, "epoch": 0.9010647974744502, "grad_norm": 1.640625, "learning_rate": 0.0004928858807006488, "loss": 6.511, "mean_token_accuracy": 0.12634748592972755, "num_tokens": 18230489.0, "step": 8420 }, { "entropy": 6.616871500015259, "epoch": 0.9015998715822141, "grad_norm": 1.5625, "learning_rate": 0.0004928763393548721, "loss": 6.4344, "mean_token_accuracy": 0.12947860807180406, "num_tokens": 18239968.0, "step": 8425 }, { "entropy": 6.5853495597839355, "epoch": 0.9021349456899781, "grad_norm": 1.7734375, "learning_rate": 0.0004928667917179465, "loss": 6.4898, "mean_token_accuracy": 0.12196068912744522, "num_tokens": 18250902.0, "step": 8430 }, { "entropy": 6.663750267028808, "epoch": 0.902670019797742, "grad_norm": 1.453125, "learning_rate": 0.0004928572377901481, "loss": 6.4837, "mean_token_accuracy": 0.12794666811823846, "num_tokens": 18262094.0, "step": 8435 }, { "entropy": 6.584063005447388, "epoch": 0.903205093905506, "grad_norm": 1.4296875, "learning_rate": 0.0004928476775717524, "loss": 6.4512, "mean_token_accuracy": 0.12302127629518508, "num_tokens": 18272765.0, "step": 8440 }, { "entropy": 6.568285655975342, "epoch": 0.9037401680132698, "grad_norm": 1.6796875, "learning_rate": 0.0004928381110630358, "loss": 6.3773, "mean_token_accuracy": 0.13741017803549765, "num_tokens": 18284570.0, "step": 8445 }, { "entropy": 6.740869760513306, "epoch": 0.9042752421210337, "grad_norm": 1.65625, "learning_rate": 0.0004928285382642742, "loss": 6.4835, "mean_token_accuracy": 0.1234114944934845, "num_tokens": 18295170.0, "step": 8450 }, { "entropy": 6.594295454025269, "epoch": 0.9048103162287977, "grad_norm": 1.4140625, "learning_rate": 0.0004928189591757443, "loss": 6.4201, "mean_token_accuracy": 0.122423455119133, "num_tokens": 18306388.0, "step": 8455 }, { "entropy": 6.5661896705627445, "epoch": 0.9053453903365616, "grad_norm": 1.359375, "learning_rate": 0.0004928093737977225, "loss": 6.429, "mean_token_accuracy": 0.13050043657422067, "num_tokens": 18316363.0, "step": 8460 }, { "entropy": 6.4683513164520265, "epoch": 0.9058804644443256, "grad_norm": 8.5625, "learning_rate": 0.0004927997821304856, "loss": 6.3861, "mean_token_accuracy": 0.12661736011505126, "num_tokens": 18327397.0, "step": 8465 }, { "entropy": 6.5845592498779295, "epoch": 0.9064155385520895, "grad_norm": 1.890625, "learning_rate": 0.0004927901841743107, "loss": 6.4818, "mean_token_accuracy": 0.12432613149285317, "num_tokens": 18338909.0, "step": 8470 }, { "entropy": 6.639092874526978, "epoch": 0.9069506126598534, "grad_norm": 1.703125, "learning_rate": 0.0004927805799294747, "loss": 6.4568, "mean_token_accuracy": 0.12108288407325744, "num_tokens": 18350110.0, "step": 8475 }, { "entropy": 6.679194068908691, "epoch": 0.9074856867676173, "grad_norm": 2.515625, "learning_rate": 0.0004927709693962551, "loss": 6.5177, "mean_token_accuracy": 0.11563151106238365, "num_tokens": 18361590.0, "step": 8480 }, { "entropy": 6.59504246711731, "epoch": 0.9080207608753812, "grad_norm": 1.9453125, "learning_rate": 0.0004927613525749295, "loss": 6.4634, "mean_token_accuracy": 0.12366845831274986, "num_tokens": 18372602.0, "step": 8485 }, { "entropy": 6.630734634399414, "epoch": 0.9085558349831452, "grad_norm": 1.4609375, "learning_rate": 0.0004927517294657753, "loss": 6.499, "mean_token_accuracy": 0.12221666947007179, "num_tokens": 18384653.0, "step": 8490 }, { "entropy": 6.684356164932251, "epoch": 0.9090909090909091, "grad_norm": 1.8828125, "learning_rate": 0.0004927421000690705, "loss": 6.4559, "mean_token_accuracy": 0.12245200499892235, "num_tokens": 18395379.0, "step": 8495 }, { "entropy": 6.63131685256958, "epoch": 0.909625983198673, "grad_norm": 1.7890625, "learning_rate": 0.0004927324643850933, "loss": 6.4256, "mean_token_accuracy": 0.12843620777130127, "num_tokens": 18405915.0, "step": 8500 }, { "entropy": 6.438924121856689, "epoch": 0.9101610573064369, "grad_norm": 1.6484375, "learning_rate": 0.0004927228224141217, "loss": 6.3293, "mean_token_accuracy": 0.14597983360290528, "num_tokens": 18416656.0, "step": 8505 }, { "entropy": 6.542063999176025, "epoch": 0.9106961314142009, "grad_norm": 2.5, "learning_rate": 0.0004927131741564342, "loss": 6.4477, "mean_token_accuracy": 0.12013882920145988, "num_tokens": 18427141.0, "step": 8510 }, { "entropy": 6.607851362228393, "epoch": 0.9112312055219648, "grad_norm": 1.734375, "learning_rate": 0.0004927035196123094, "loss": 6.4915, "mean_token_accuracy": 0.12988717779517173, "num_tokens": 18437135.0, "step": 8515 }, { "entropy": 6.685029554367065, "epoch": 0.9117662796297287, "grad_norm": 1.4453125, "learning_rate": 0.000492693858782026, "loss": 6.5639, "mean_token_accuracy": 0.11965355947613716, "num_tokens": 18448567.0, "step": 8520 }, { "entropy": 6.679243803024292, "epoch": 0.9123013537374927, "grad_norm": 1.5546875, "learning_rate": 0.000492684191665863, "loss": 6.511, "mean_token_accuracy": 0.11756190657615662, "num_tokens": 18459385.0, "step": 8525 }, { "entropy": 6.561179542541504, "epoch": 0.9128364278452565, "grad_norm": 1.421875, "learning_rate": 0.0004926745182640996, "loss": 6.4677, "mean_token_accuracy": 0.1285193495452404, "num_tokens": 18471376.0, "step": 8530 }, { "entropy": 6.649504232406616, "epoch": 0.9133715019530205, "grad_norm": 1.7890625, "learning_rate": 0.0004926648385770152, "loss": 6.5335, "mean_token_accuracy": 0.11931721493601799, "num_tokens": 18481950.0, "step": 8535 }, { "entropy": 6.654511833190918, "epoch": 0.9139065760607844, "grad_norm": 1.4375, "learning_rate": 0.0004926551526048891, "loss": 6.4524, "mean_token_accuracy": 0.12727693393826484, "num_tokens": 18492436.0, "step": 8540 }, { "entropy": 6.575570774078369, "epoch": 0.9144416501685484, "grad_norm": 2.390625, "learning_rate": 0.0004926454603480009, "loss": 6.2964, "mean_token_accuracy": 0.12638833299279212, "num_tokens": 18504279.0, "step": 8545 }, { "entropy": 6.573821878433227, "epoch": 0.9149767242763123, "grad_norm": 3.546875, "learning_rate": 0.0004926357618066307, "loss": 6.4443, "mean_token_accuracy": 0.12484021857380867, "num_tokens": 18515262.0, "step": 8550 }, { "entropy": 6.63035249710083, "epoch": 0.9155117983840761, "grad_norm": 1.6484375, "learning_rate": 0.0004926260569810586, "loss": 6.4951, "mean_token_accuracy": 0.12227512821555138, "num_tokens": 18525176.0, "step": 8555 }, { "entropy": 6.5566153049469, "epoch": 0.9160468724918401, "grad_norm": 1.59375, "learning_rate": 0.0004926163458715645, "loss": 6.4617, "mean_token_accuracy": 0.12596529051661493, "num_tokens": 18536674.0, "step": 8560 }, { "entropy": 6.5605353832244875, "epoch": 0.916581946599604, "grad_norm": 4.03125, "learning_rate": 0.0004926066284784292, "loss": 6.4496, "mean_token_accuracy": 0.12597779259085656, "num_tokens": 18547398.0, "step": 8565 }, { "entropy": 6.563134813308716, "epoch": 0.917117020707368, "grad_norm": 1.7578125, "learning_rate": 0.0004925969048019329, "loss": 6.4943, "mean_token_accuracy": 0.12652412205934524, "num_tokens": 18558838.0, "step": 8570 }, { "entropy": 6.629328727722168, "epoch": 0.9176520948151319, "grad_norm": 2.265625, "learning_rate": 0.0004925871748423566, "loss": 6.4395, "mean_token_accuracy": 0.1258179649710655, "num_tokens": 18569881.0, "step": 8575 }, { "entropy": 6.6013552188873295, "epoch": 0.9181871689228959, "grad_norm": 1.6640625, "learning_rate": 0.0004925774385999812, "loss": 6.3501, "mean_token_accuracy": 0.13269954398274422, "num_tokens": 18579556.0, "step": 8580 }, { "entropy": 6.4663420677185055, "epoch": 0.9187222430306597, "grad_norm": 1.71875, "learning_rate": 0.0004925676960750878, "loss": 6.3516, "mean_token_accuracy": 0.1361738361418247, "num_tokens": 18590580.0, "step": 8585 }, { "entropy": 6.634561157226562, "epoch": 0.9192573171384236, "grad_norm": 1.71875, "learning_rate": 0.0004925579472679578, "loss": 6.4828, "mean_token_accuracy": 0.1265283964574337, "num_tokens": 18600813.0, "step": 8590 }, { "entropy": 6.598533678054809, "epoch": 0.9197923912461876, "grad_norm": 1.484375, "learning_rate": 0.0004925481921788726, "loss": 6.391, "mean_token_accuracy": 0.1304919548332691, "num_tokens": 18610807.0, "step": 8595 }, { "entropy": 6.510357618331909, "epoch": 0.9203274653539515, "grad_norm": 1.515625, "learning_rate": 0.000492538430808114, "loss": 6.3577, "mean_token_accuracy": 0.12540487572550774, "num_tokens": 18622108.0, "step": 8600 }, { "entropy": 6.557230615615845, "epoch": 0.9208625394617155, "grad_norm": 1.4140625, "learning_rate": 0.0004925286631559636, "loss": 6.5401, "mean_token_accuracy": 0.12565935403108597, "num_tokens": 18633098.0, "step": 8605 }, { "entropy": 6.648445987701416, "epoch": 0.9213976135694794, "grad_norm": 1.5859375, "learning_rate": 0.0004925188892227038, "loss": 6.4225, "mean_token_accuracy": 0.12731703594326974, "num_tokens": 18643603.0, "step": 8610 }, { "entropy": 6.638711643218994, "epoch": 0.9219326876772433, "grad_norm": 2.15625, "learning_rate": 0.0004925091090086166, "loss": 6.4527, "mean_token_accuracy": 0.1319430947303772, "num_tokens": 18654354.0, "step": 8615 }, { "entropy": 6.621751213073731, "epoch": 0.9224677617850072, "grad_norm": 1.6171875, "learning_rate": 0.0004924993225139845, "loss": 6.5275, "mean_token_accuracy": 0.12473874017596245, "num_tokens": 18665349.0, "step": 8620 }, { "entropy": 6.635911178588867, "epoch": 0.9230028358927711, "grad_norm": 1.53125, "learning_rate": 0.0004924895297390899, "loss": 6.4661, "mean_token_accuracy": 0.1247866302728653, "num_tokens": 18676575.0, "step": 8625 }, { "entropy": 6.631935882568359, "epoch": 0.9235379100005351, "grad_norm": 1.4296875, "learning_rate": 0.0004924797306842157, "loss": 6.4019, "mean_token_accuracy": 0.13183975219726562, "num_tokens": 18686501.0, "step": 8630 }, { "entropy": 6.582294940948486, "epoch": 0.924072984108299, "grad_norm": 2.140625, "learning_rate": 0.0004924699253496449, "loss": 6.474, "mean_token_accuracy": 0.1282108373939991, "num_tokens": 18697246.0, "step": 8635 }, { "entropy": 6.533542108535767, "epoch": 0.924608058216063, "grad_norm": 1.921875, "learning_rate": 0.0004924601137356605, "loss": 6.3935, "mean_token_accuracy": 0.1339188501238823, "num_tokens": 18708177.0, "step": 8640 }, { "entropy": 6.60825548171997, "epoch": 0.9251431323238268, "grad_norm": 1.546875, "learning_rate": 0.000492450295842546, "loss": 6.458, "mean_token_accuracy": 0.12657491490244865, "num_tokens": 18719334.0, "step": 8645 }, { "entropy": 6.618236446380616, "epoch": 0.9256782064315908, "grad_norm": 1.6171875, "learning_rate": 0.0004924404716705847, "loss": 6.4091, "mean_token_accuracy": 0.13286964371800422, "num_tokens": 18729174.0, "step": 8650 }, { "entropy": 6.537341594696045, "epoch": 0.9262132805393547, "grad_norm": 1.703125, "learning_rate": 0.0004924306412200603, "loss": 6.517, "mean_token_accuracy": 0.122911486774683, "num_tokens": 18740277.0, "step": 8655 }, { "entropy": 6.627772474288941, "epoch": 0.9267483546471186, "grad_norm": 1.46875, "learning_rate": 0.0004924208044912567, "loss": 6.4767, "mean_token_accuracy": 0.12486343458294868, "num_tokens": 18751864.0, "step": 8660 }, { "entropy": 6.609443330764771, "epoch": 0.9272834287548826, "grad_norm": 2.828125, "learning_rate": 0.0004924109614844579, "loss": 6.3891, "mean_token_accuracy": 0.1359869807958603, "num_tokens": 18762786.0, "step": 8665 }, { "entropy": 6.555660629272461, "epoch": 0.9278185028626464, "grad_norm": 1.7890625, "learning_rate": 0.0004924011121999482, "loss": 6.4339, "mean_token_accuracy": 0.13116455525159837, "num_tokens": 18772913.0, "step": 8670 }, { "entropy": 6.5695160865783695, "epoch": 0.9283535769704104, "grad_norm": 1.5390625, "learning_rate": 0.0004923912566380118, "loss": 6.4058, "mean_token_accuracy": 0.12949569448828696, "num_tokens": 18784204.0, "step": 8675 }, { "entropy": 6.5018853664398195, "epoch": 0.9288886510781743, "grad_norm": 1.59375, "learning_rate": 0.0004923813947989336, "loss": 6.4945, "mean_token_accuracy": 0.12146714031696319, "num_tokens": 18795425.0, "step": 8680 }, { "entropy": 6.64973201751709, "epoch": 0.9294237251859383, "grad_norm": 1.796875, "learning_rate": 0.0004923715266829981, "loss": 6.4345, "mean_token_accuracy": 0.1265689440071583, "num_tokens": 18806850.0, "step": 8685 }, { "entropy": 6.641017436981201, "epoch": 0.9299587992937022, "grad_norm": 1.3671875, "learning_rate": 0.0004923616522904903, "loss": 6.3843, "mean_token_accuracy": 0.1314132884144783, "num_tokens": 18817272.0, "step": 8690 }, { "entropy": 6.597755098342896, "epoch": 0.930493873401466, "grad_norm": 1.7734375, "learning_rate": 0.0004923517716216953, "loss": 6.5085, "mean_token_accuracy": 0.12215960323810578, "num_tokens": 18827075.0, "step": 8695 }, { "entropy": 6.62264838218689, "epoch": 0.93102894750923, "grad_norm": 3.390625, "learning_rate": 0.0004923418846768985, "loss": 6.4421, "mean_token_accuracy": 0.12476111203432083, "num_tokens": 18837635.0, "step": 8700 }, { "entropy": 6.642798328399659, "epoch": 0.9315640216169939, "grad_norm": 1.5546875, "learning_rate": 0.0004923319914563852, "loss": 6.4275, "mean_token_accuracy": 0.13177590519189836, "num_tokens": 18848559.0, "step": 8705 }, { "entropy": 6.670168113708496, "epoch": 0.9320990957247579, "grad_norm": 1.8828125, "learning_rate": 0.0004923220919604413, "loss": 6.4681, "mean_token_accuracy": 0.1240908034145832, "num_tokens": 18859327.0, "step": 8710 }, { "entropy": 6.591074991226196, "epoch": 0.9326341698325218, "grad_norm": 1.5859375, "learning_rate": 0.0004923121861893525, "loss": 6.4075, "mean_token_accuracy": 0.1274246610701084, "num_tokens": 18869403.0, "step": 8715 }, { "entropy": 6.583342885971069, "epoch": 0.9331692439402858, "grad_norm": 1.7421875, "learning_rate": 0.0004923022741434049, "loss": 6.4379, "mean_token_accuracy": 0.12099683731794357, "num_tokens": 18879890.0, "step": 8720 }, { "entropy": 6.615302467346192, "epoch": 0.9337043180480497, "grad_norm": 1.9375, "learning_rate": 0.0004922923558228846, "loss": 6.4721, "mean_token_accuracy": 0.12057366967201233, "num_tokens": 18890361.0, "step": 8725 }, { "entropy": 6.579403305053711, "epoch": 0.9342393921558135, "grad_norm": 2.171875, "learning_rate": 0.0004922824312280781, "loss": 6.3868, "mean_token_accuracy": 0.13047217801213265, "num_tokens": 18902344.0, "step": 8730 }, { "entropy": 6.569160079956054, "epoch": 0.9347744662635775, "grad_norm": 1.890625, "learning_rate": 0.000492272500359272, "loss": 6.3847, "mean_token_accuracy": 0.13155013620853423, "num_tokens": 18911364.0, "step": 8735 }, { "entropy": 6.588317584991455, "epoch": 0.9353095403713414, "grad_norm": 1.7265625, "learning_rate": 0.0004922625632167529, "loss": 6.488, "mean_token_accuracy": 0.11757436320185662, "num_tokens": 18922254.0, "step": 8740 }, { "entropy": 6.664959383010864, "epoch": 0.9358446144791054, "grad_norm": 1.40625, "learning_rate": 0.0004922526198008078, "loss": 6.4452, "mean_token_accuracy": 0.1260450467467308, "num_tokens": 18932943.0, "step": 8745 }, { "entropy": 6.618773317337036, "epoch": 0.9363796885868693, "grad_norm": 1.578125, "learning_rate": 0.0004922426701117239, "loss": 6.5241, "mean_token_accuracy": 0.12151310667395591, "num_tokens": 18943523.0, "step": 8750 }, { "entropy": 6.609319257736206, "epoch": 0.9369147626946333, "grad_norm": 1.4296875, "learning_rate": 0.0004922327141497884, "loss": 6.508, "mean_token_accuracy": 0.1161932684481144, "num_tokens": 18955220.0, "step": 8755 }, { "entropy": 6.675847339630127, "epoch": 0.9374498368023971, "grad_norm": 1.5390625, "learning_rate": 0.0004922227519152888, "loss": 6.5421, "mean_token_accuracy": 0.12342641204595566, "num_tokens": 18966714.0, "step": 8760 }, { "entropy": 6.56199951171875, "epoch": 0.937984910910161, "grad_norm": 1.8203125, "learning_rate": 0.0004922127834085128, "loss": 6.3913, "mean_token_accuracy": 0.12646044045686722, "num_tokens": 18977998.0, "step": 8765 }, { "entropy": 6.567882633209228, "epoch": 0.938519985017925, "grad_norm": 1.9609375, "learning_rate": 0.0004922028086297481, "loss": 6.3818, "mean_token_accuracy": 0.127099596709013, "num_tokens": 18990210.0, "step": 8770 }, { "entropy": 6.6765382289886475, "epoch": 0.9390550591256889, "grad_norm": 1.5078125, "learning_rate": 0.0004921928275792828, "loss": 6.4995, "mean_token_accuracy": 0.12616633251309395, "num_tokens": 19000529.0, "step": 8775 }, { "entropy": 6.628943872451782, "epoch": 0.9395901332334529, "grad_norm": 2.6875, "learning_rate": 0.0004921828402574052, "loss": 6.4251, "mean_token_accuracy": 0.13188672289252282, "num_tokens": 19011386.0, "step": 8780 }, { "entropy": 6.550263404846191, "epoch": 0.9401252073412167, "grad_norm": 1.6640625, "learning_rate": 0.0004921728466644037, "loss": 6.4043, "mean_token_accuracy": 0.12869123220443726, "num_tokens": 19022196.0, "step": 8785 }, { "entropy": 6.533733606338501, "epoch": 0.9406602814489807, "grad_norm": 1.5625, "learning_rate": 0.0004921628468005666, "loss": 6.4358, "mean_token_accuracy": 0.13189285323023797, "num_tokens": 19033221.0, "step": 8790 }, { "entropy": 6.611112642288208, "epoch": 0.9411953555567446, "grad_norm": 1.4765625, "learning_rate": 0.000492152840666183, "loss": 6.4878, "mean_token_accuracy": 0.12585045173764228, "num_tokens": 19044953.0, "step": 8795 }, { "entropy": 6.711111831665039, "epoch": 0.9417304296645085, "grad_norm": 1.515625, "learning_rate": 0.0004921428282615415, "loss": 6.5018, "mean_token_accuracy": 0.12096112072467805, "num_tokens": 19055512.0, "step": 8800 }, { "entropy": 6.635407400131226, "epoch": 0.9422655037722725, "grad_norm": 1.5859375, "learning_rate": 0.0004921328095869313, "loss": 6.5027, "mean_token_accuracy": 0.1203993707895279, "num_tokens": 19065659.0, "step": 8805 }, { "entropy": 6.658339595794677, "epoch": 0.9428005778800364, "grad_norm": 1.8125, "learning_rate": 0.0004921227846426418, "loss": 6.433, "mean_token_accuracy": 0.1371263563632965, "num_tokens": 19076955.0, "step": 8810 }, { "entropy": 6.572042465209961, "epoch": 0.9433356519878003, "grad_norm": 1.625, "learning_rate": 0.0004921127534289624, "loss": 6.5106, "mean_token_accuracy": 0.11860493347048759, "num_tokens": 19088305.0, "step": 8815 }, { "entropy": 6.568140172958374, "epoch": 0.9438707260955642, "grad_norm": 1.65625, "learning_rate": 0.0004921027159461829, "loss": 6.5098, "mean_token_accuracy": 0.12441008612513542, "num_tokens": 19098046.0, "step": 8820 }, { "entropy": 6.6841308116912845, "epoch": 0.9444058002033282, "grad_norm": 1.75, "learning_rate": 0.0004920926721945927, "loss": 6.4226, "mean_token_accuracy": 0.12864333316683768, "num_tokens": 19109019.0, "step": 8825 }, { "entropy": 6.662001609802246, "epoch": 0.9449408743110921, "grad_norm": 1.484375, "learning_rate": 0.0004920826221744823, "loss": 6.4228, "mean_token_accuracy": 0.12871572971343995, "num_tokens": 19119624.0, "step": 8830 }, { "entropy": 6.636339902877808, "epoch": 0.945475948418856, "grad_norm": 1.4453125, "learning_rate": 0.0004920725658861417, "loss": 6.4741, "mean_token_accuracy": 0.12303901016712189, "num_tokens": 19130577.0, "step": 8835 }, { "entropy": 6.589366340637207, "epoch": 0.94601102252662, "grad_norm": 1.4140625, "learning_rate": 0.0004920625033298611, "loss": 6.3814, "mean_token_accuracy": 0.12903112173080444, "num_tokens": 19140254.0, "step": 8840 }, { "entropy": 6.569903993606568, "epoch": 0.9465460966343838, "grad_norm": 1.6015625, "learning_rate": 0.0004920524345059314, "loss": 6.4247, "mean_token_accuracy": 0.12659077122807502, "num_tokens": 19151357.0, "step": 8845 }, { "entropy": 6.6806480884552, "epoch": 0.9470811707421478, "grad_norm": 1.3515625, "learning_rate": 0.0004920423594146431, "loss": 6.4208, "mean_token_accuracy": 0.13126432448625563, "num_tokens": 19162069.0, "step": 8850 }, { "entropy": 6.546973991394043, "epoch": 0.9476162448499117, "grad_norm": 1.484375, "learning_rate": 0.0004920322780562872, "loss": 6.3129, "mean_token_accuracy": 0.13278165608644485, "num_tokens": 19172515.0, "step": 8855 }, { "entropy": 6.469416666030884, "epoch": 0.9481513189576757, "grad_norm": 1.3125, "learning_rate": 0.0004920221904311546, "loss": 6.3304, "mean_token_accuracy": 0.1281422682106495, "num_tokens": 19182450.0, "step": 8860 }, { "entropy": 6.6383439064025875, "epoch": 0.9486863930654396, "grad_norm": 1.53125, "learning_rate": 0.0004920120965395369, "loss": 6.5292, "mean_token_accuracy": 0.12080127596855164, "num_tokens": 19193833.0, "step": 8865 }, { "entropy": 6.678140926361084, "epoch": 0.9492214671732034, "grad_norm": 2.640625, "learning_rate": 0.0004920019963817253, "loss": 6.4762, "mean_token_accuracy": 0.1225566104054451, "num_tokens": 19204970.0, "step": 8870 }, { "entropy": 6.609140682220459, "epoch": 0.9497565412809674, "grad_norm": 1.7265625, "learning_rate": 0.0004919918899580117, "loss": 6.4331, "mean_token_accuracy": 0.1269660323858261, "num_tokens": 19215795.0, "step": 8875 }, { "entropy": 6.611617612838745, "epoch": 0.9502916153887313, "grad_norm": 1.8671875, "learning_rate": 0.0004919817772686876, "loss": 6.4649, "mean_token_accuracy": 0.11650814116001129, "num_tokens": 19226375.0, "step": 8880 }, { "entropy": 6.680630016326904, "epoch": 0.9508266894964953, "grad_norm": 1.8515625, "learning_rate": 0.0004919716583140453, "loss": 6.468, "mean_token_accuracy": 0.13823570236563681, "num_tokens": 19236066.0, "step": 8885 }, { "entropy": 6.529271268844605, "epoch": 0.9513617636042592, "grad_norm": 2.203125, "learning_rate": 0.0004919615330943769, "loss": 6.3353, "mean_token_accuracy": 0.1377024307847023, "num_tokens": 19246757.0, "step": 8890 }, { "entropy": 6.614864778518677, "epoch": 0.9518968377120232, "grad_norm": 1.4921875, "learning_rate": 0.0004919514016099746, "loss": 6.5, "mean_token_accuracy": 0.12600353509187698, "num_tokens": 19257875.0, "step": 8895 }, { "entropy": 6.6503785133361815, "epoch": 0.952431911819787, "grad_norm": 1.5, "learning_rate": 0.000491941263861131, "loss": 6.4781, "mean_token_accuracy": 0.125810706615448, "num_tokens": 19270236.0, "step": 8900 }, { "entropy": 6.588436317443848, "epoch": 0.9529669859275509, "grad_norm": 2.609375, "learning_rate": 0.000491931119848139, "loss": 6.4612, "mean_token_accuracy": 0.12382268756628037, "num_tokens": 19280877.0, "step": 8905 }, { "entropy": 6.525938892364502, "epoch": 0.9535020600353149, "grad_norm": 2.0, "learning_rate": 0.0004919209695712915, "loss": 6.3569, "mean_token_accuracy": 0.13123888075351714, "num_tokens": 19292852.0, "step": 8910 }, { "entropy": 6.636586141586304, "epoch": 0.9540371341430788, "grad_norm": 7.90625, "learning_rate": 0.0004919108130308814, "loss": 6.5481, "mean_token_accuracy": 0.11724269837141037, "num_tokens": 19305516.0, "step": 8915 }, { "entropy": 6.625235986709595, "epoch": 0.9545722082508428, "grad_norm": 1.4609375, "learning_rate": 0.0004919006502272019, "loss": 6.3795, "mean_token_accuracy": 0.13500440642237663, "num_tokens": 19315436.0, "step": 8920 }, { "entropy": 6.508727741241455, "epoch": 0.9551072823586066, "grad_norm": 1.453125, "learning_rate": 0.0004918904811605468, "loss": 6.4376, "mean_token_accuracy": 0.1264245629310608, "num_tokens": 19325393.0, "step": 8925 }, { "entropy": 6.5293982982635494, "epoch": 0.9556423564663706, "grad_norm": 1.71875, "learning_rate": 0.0004918803058312094, "loss": 6.4306, "mean_token_accuracy": 0.12973214834928512, "num_tokens": 19336722.0, "step": 8930 }, { "entropy": 6.7406854152679445, "epoch": 0.9561774305741345, "grad_norm": 1.796875, "learning_rate": 0.0004918701242394837, "loss": 6.5851, "mean_token_accuracy": 0.11917414888739586, "num_tokens": 19348406.0, "step": 8935 }, { "entropy": 6.599468946456909, "epoch": 0.9567125046818984, "grad_norm": 1.609375, "learning_rate": 0.0004918599363856637, "loss": 6.3923, "mean_token_accuracy": 0.1359890453517437, "num_tokens": 19359714.0, "step": 8940 }, { "entropy": 6.630413579940796, "epoch": 0.9572475787896624, "grad_norm": 1.765625, "learning_rate": 0.0004918497422700434, "loss": 6.4143, "mean_token_accuracy": 0.12925480753183366, "num_tokens": 19370833.0, "step": 8945 }, { "entropy": 6.610364055633545, "epoch": 0.9577826528974263, "grad_norm": 1.5078125, "learning_rate": 0.0004918395418929174, "loss": 6.4944, "mean_token_accuracy": 0.12302698343992233, "num_tokens": 19382098.0, "step": 8950 }, { "entropy": 6.624408388137818, "epoch": 0.9583177270051902, "grad_norm": 2.015625, "learning_rate": 0.00049182933525458, "loss": 6.4757, "mean_token_accuracy": 0.12349115982651711, "num_tokens": 19393595.0, "step": 8955 }, { "entropy": 6.640421295166016, "epoch": 0.9588528011129541, "grad_norm": 1.625, "learning_rate": 0.000491819122355326, "loss": 6.4125, "mean_token_accuracy": 0.13156883418560028, "num_tokens": 19405296.0, "step": 8960 }, { "entropy": 6.634973096847534, "epoch": 0.9593878752207181, "grad_norm": 1.4609375, "learning_rate": 0.0004918089031954503, "loss": 6.4472, "mean_token_accuracy": 0.12182890325784683, "num_tokens": 19415693.0, "step": 8965 }, { "entropy": 6.580959510803223, "epoch": 0.959922949328482, "grad_norm": 1.78125, "learning_rate": 0.000491798677775248, "loss": 6.4961, "mean_token_accuracy": 0.12708681151270868, "num_tokens": 19426140.0, "step": 8970 }, { "entropy": 6.693287134170532, "epoch": 0.9604580234362459, "grad_norm": 1.578125, "learning_rate": 0.0004917884460950144, "loss": 6.5297, "mean_token_accuracy": 0.1222914569079876, "num_tokens": 19437543.0, "step": 8975 }, { "entropy": 6.634545707702637, "epoch": 0.9609930975440099, "grad_norm": 1.390625, "learning_rate": 0.000491778208155045, "loss": 6.4384, "mean_token_accuracy": 0.1252037465572357, "num_tokens": 19447788.0, "step": 8980 }, { "entropy": 6.65233883857727, "epoch": 0.9615281716517737, "grad_norm": 1.796875, "learning_rate": 0.0004917679639556351, "loss": 6.4577, "mean_token_accuracy": 0.12330029979348182, "num_tokens": 19457587.0, "step": 8985 }, { "entropy": 6.6310333728790285, "epoch": 0.9620632457595377, "grad_norm": 1.8515625, "learning_rate": 0.0004917577134970808, "loss": 6.3826, "mean_token_accuracy": 0.1255684621632099, "num_tokens": 19467422.0, "step": 8990 }, { "entropy": 6.586491394042969, "epoch": 0.9625983198673016, "grad_norm": 1.609375, "learning_rate": 0.0004917474567796778, "loss": 6.4322, "mean_token_accuracy": 0.12582321763038634, "num_tokens": 19479037.0, "step": 8995 }, { "entropy": 6.5694173812866214, "epoch": 0.9631333939750656, "grad_norm": 1.5546875, "learning_rate": 0.0004917371938037226, "loss": 6.3603, "mean_token_accuracy": 0.1418306939303875, "num_tokens": 19489639.0, "step": 9000 }, { "epoch": 0.9631333939750656, "eval_entropy": 6.45046752675203, "eval_loss": 6.510419845581055, "eval_mean_token_accuracy": 0.12865163465319177, "eval_num_tokens": 19489639.0, "eval_runtime": 22.7134, "eval_samples_per_second": 1306.673, "eval_steps_per_second": 163.34, "step": 9000 } ], "logging_steps": 5, "max_steps": 93440, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.8647633788928e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }