{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.2838792093964018, "eval_steps": 500, "global_step": 4000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691987895965577, "epoch": 0.00035484901174550227, "grad_norm": 11.625, "learning_rate": 2e-06, "loss": 10.8366, "mean_token_accuracy": 0.0, "num_tokens": 11280.0, "step": 5 }, { "entropy": 10.691946220397949, "epoch": 0.0007096980234910045, "grad_norm": 11.5625, "learning_rate": 4.5e-06, "loss": 10.7735, "mean_token_accuracy": 0.00010460250778123736, "num_tokens": 21887.0, "step": 10 }, { "entropy": 10.69083604812622, "epoch": 0.001064547035236507, "grad_norm": 9.6875, "learning_rate": 7e-06, "loss": 10.5654, "mean_token_accuracy": 0.02854402889497578, "num_tokens": 32911.0, "step": 15 }, { "entropy": 10.66428632736206, "epoch": 0.001419396046982009, "grad_norm": 6.0625, "learning_rate": 9.5e-06, "loss": 10.3144, "mean_token_accuracy": 0.04550958257168532, "num_tokens": 43994.0, "step": 20 }, { "entropy": 10.494576263427735, "epoch": 0.0017742450587275114, "grad_norm": 4.28125, "learning_rate": 1.2e-05, "loss": 10.105, "mean_token_accuracy": 0.041560862213373184, "num_tokens": 54342.0, "step": 25 }, { "entropy": 10.533498859405517, "epoch": 0.002129094070473014, "grad_norm": 2.921875, "learning_rate": 1.4500000000000002e-05, "loss": 9.9509, "mean_token_accuracy": 0.044634624011814596, "num_tokens": 64768.0, "step": 30 }, { "entropy": 10.53185338973999, "epoch": 0.002483943082218516, "grad_norm": 2.59375, "learning_rate": 1.7000000000000003e-05, "loss": 9.9269, "mean_token_accuracy": 0.04376727268099785, "num_tokens": 75530.0, "step": 35 }, { "entropy": 10.487653255462646, "epoch": 0.002838792093964018, "grad_norm": 2.40625, "learning_rate": 1.95e-05, "loss": 9.8511, "mean_token_accuracy": 0.045070053450763224, "num_tokens": 85983.0, "step": 40 }, { "entropy": 10.522008514404297, "epoch": 0.0031936411057095207, "grad_norm": 2.28125, "learning_rate": 2.2e-05, "loss": 9.8344, "mean_token_accuracy": 0.04323017336428166, "num_tokens": 96168.0, "step": 45 }, { "entropy": 10.482469272613525, "epoch": 0.0035484901174550228, "grad_norm": 1.8046875, "learning_rate": 2.4500000000000003e-05, "loss": 9.7891, "mean_token_accuracy": 0.05232359655201435, "num_tokens": 107899.0, "step": 50 }, { "entropy": 10.414291763305664, "epoch": 0.0039033391292005253, "grad_norm": 2.03125, "learning_rate": 2.7e-05, "loss": 9.7448, "mean_token_accuracy": 0.05363052934408188, "num_tokens": 119073.0, "step": 55 }, { "entropy": 10.483110237121583, "epoch": 0.004258188140946028, "grad_norm": 2.03125, "learning_rate": 2.95e-05, "loss": 9.7062, "mean_token_accuracy": 0.05208716280758381, "num_tokens": 129149.0, "step": 60 }, { "entropy": 10.321412563323975, "epoch": 0.00461303715269153, "grad_norm": 1.890625, "learning_rate": 3.2e-05, "loss": 9.5992, "mean_token_accuracy": 0.05521074235439301, "num_tokens": 139045.0, "step": 65 }, { "entropy": 10.363921737670898, "epoch": 0.004967886164437032, "grad_norm": 1.859375, "learning_rate": 3.4500000000000005e-05, "loss": 9.6115, "mean_token_accuracy": 0.054533609002828595, "num_tokens": 150251.0, "step": 70 }, { "entropy": 10.423143291473389, "epoch": 0.005322735176182534, "grad_norm": 1.984375, "learning_rate": 3.7e-05, "loss": 9.5269, "mean_token_accuracy": 0.05440324060618877, "num_tokens": 160230.0, "step": 75 }, { "entropy": 10.341320323944093, "epoch": 0.005677584187928036, "grad_norm": 1.546875, "learning_rate": 3.95e-05, "loss": 9.478, "mean_token_accuracy": 0.05366469696164131, "num_tokens": 170692.0, "step": 80 }, { "entropy": 10.290056896209716, "epoch": 0.006032433199673539, "grad_norm": 2.078125, "learning_rate": 4.2000000000000004e-05, "loss": 9.3959, "mean_token_accuracy": 0.05197730958461762, "num_tokens": 180616.0, "step": 85 }, { "entropy": 10.320787811279297, "epoch": 0.006387282211419041, "grad_norm": 1.7421875, "learning_rate": 4.45e-05, "loss": 9.3057, "mean_token_accuracy": 0.05711167939007282, "num_tokens": 191016.0, "step": 90 }, { "entropy": 10.258602237701416, "epoch": 0.0067421312231645434, "grad_norm": 1.640625, "learning_rate": 4.7000000000000004e-05, "loss": 9.2578, "mean_token_accuracy": 0.05482340231537819, "num_tokens": 202433.0, "step": 95 }, { "entropy": 10.235629463195801, "epoch": 0.0070969802349100455, "grad_norm": 1.40625, "learning_rate": 4.9500000000000004e-05, "loss": 9.2401, "mean_token_accuracy": 0.05469023734331131, "num_tokens": 214586.0, "step": 100 }, { "entropy": 10.223749732971191, "epoch": 0.007451829246655548, "grad_norm": 1.484375, "learning_rate": 5.2e-05, "loss": 9.0977, "mean_token_accuracy": 0.05747384466230869, "num_tokens": 225155.0, "step": 105 }, { "entropy": 10.136597728729248, "epoch": 0.007806678258401051, "grad_norm": 1.4609375, "learning_rate": 5.45e-05, "loss": 8.9983, "mean_token_accuracy": 0.05849210806190967, "num_tokens": 236050.0, "step": 110 }, { "entropy": 10.020172691345214, "epoch": 0.008161527270146553, "grad_norm": 1.375, "learning_rate": 5.7e-05, "loss": 8.8941, "mean_token_accuracy": 0.05953489430248737, "num_tokens": 245825.0, "step": 115 }, { "entropy": 9.979390907287598, "epoch": 0.008516376281892056, "grad_norm": 1.9453125, "learning_rate": 5.9499999999999996e-05, "loss": 8.8174, "mean_token_accuracy": 0.06152731701731682, "num_tokens": 256752.0, "step": 120 }, { "entropy": 9.866498374938965, "epoch": 0.008871225293637557, "grad_norm": 1.15625, "learning_rate": 6.2e-05, "loss": 8.802, "mean_token_accuracy": 0.05181486271321774, "num_tokens": 267603.0, "step": 125 }, { "entropy": 9.726642417907716, "epoch": 0.00922607430538306, "grad_norm": 1.1875, "learning_rate": 6.450000000000001e-05, "loss": 8.7071, "mean_token_accuracy": 0.05791006051003933, "num_tokens": 277478.0, "step": 130 }, { "entropy": 9.658979320526123, "epoch": 0.009580923317128561, "grad_norm": 1.2109375, "learning_rate": 6.7e-05, "loss": 8.66, "mean_token_accuracy": 0.05634133592247963, "num_tokens": 289710.0, "step": 135 }, { "entropy": 9.384044075012207, "epoch": 0.009935772328874064, "grad_norm": 1.1796875, "learning_rate": 6.950000000000001e-05, "loss": 8.5346, "mean_token_accuracy": 0.05907244272530079, "num_tokens": 299295.0, "step": 140 }, { "entropy": 9.350571346282958, "epoch": 0.010290621340619567, "grad_norm": 0.9375, "learning_rate": 7.2e-05, "loss": 8.5165, "mean_token_accuracy": 0.05372942052781582, "num_tokens": 310544.0, "step": 145 }, { "entropy": 9.217219734191895, "epoch": 0.010645470352365068, "grad_norm": 1.09375, "learning_rate": 7.45e-05, "loss": 8.4485, "mean_token_accuracy": 0.05611223764717579, "num_tokens": 321558.0, "step": 150 }, { "entropy": 9.077949619293213, "epoch": 0.011000319364110571, "grad_norm": 1.203125, "learning_rate": 7.7e-05, "loss": 8.44, "mean_token_accuracy": 0.05572409965097904, "num_tokens": 333265.0, "step": 155 }, { "entropy": 8.919435977935791, "epoch": 0.011355168375856073, "grad_norm": 1.1328125, "learning_rate": 7.950000000000001e-05, "loss": 8.3707, "mean_token_accuracy": 0.060116075351834296, "num_tokens": 343406.0, "step": 160 }, { "entropy": 8.981222343444824, "epoch": 0.011710017387601575, "grad_norm": 1.140625, "learning_rate": 8.2e-05, "loss": 8.4388, "mean_token_accuracy": 0.05228844713419676, "num_tokens": 354934.0, "step": 165 }, { "entropy": 8.788821792602539, "epoch": 0.012064866399347078, "grad_norm": 0.95703125, "learning_rate": 8.450000000000001e-05, "loss": 8.3627, "mean_token_accuracy": 0.05599985755980015, "num_tokens": 364991.0, "step": 170 }, { "entropy": 8.838678550720214, "epoch": 0.01241971541109258, "grad_norm": 0.87109375, "learning_rate": 8.7e-05, "loss": 8.3174, "mean_token_accuracy": 0.05698671489953995, "num_tokens": 375362.0, "step": 175 }, { "entropy": 8.669477367401123, "epoch": 0.012774564422838083, "grad_norm": 1.046875, "learning_rate": 8.95e-05, "loss": 8.2929, "mean_token_accuracy": 0.06303150560706854, "num_tokens": 386758.0, "step": 180 }, { "entropy": 8.66919822692871, "epoch": 0.013129413434583584, "grad_norm": 0.9140625, "learning_rate": 9.2e-05, "loss": 8.304, "mean_token_accuracy": 0.061275123804807666, "num_tokens": 397073.0, "step": 185 }, { "entropy": 8.68841199874878, "epoch": 0.013484262446329087, "grad_norm": 0.85546875, "learning_rate": 9.45e-05, "loss": 8.4007, "mean_token_accuracy": 0.05668871849775314, "num_tokens": 408098.0, "step": 190 }, { "entropy": 8.577757740020752, "epoch": 0.01383911145807459, "grad_norm": 1.2109375, "learning_rate": 9.7e-05, "loss": 8.2425, "mean_token_accuracy": 0.06331006735563278, "num_tokens": 418910.0, "step": 195 }, { "entropy": 8.616193675994873, "epoch": 0.014193960469820091, "grad_norm": 1.0546875, "learning_rate": 9.95e-05, "loss": 8.3266, "mean_token_accuracy": 0.059384917840361595, "num_tokens": 429328.0, "step": 200 }, { "entropy": 8.564495944976807, "epoch": 0.014548809481565594, "grad_norm": 1.96875, "learning_rate": 0.000102, "loss": 8.286, "mean_token_accuracy": 0.058925506100058554, "num_tokens": 440293.0, "step": 205 }, { "entropy": 8.546427249908447, "epoch": 0.014903658493311095, "grad_norm": 1.28125, "learning_rate": 0.00010449999999999999, "loss": 8.2513, "mean_token_accuracy": 0.057647600024938586, "num_tokens": 451509.0, "step": 210 }, { "entropy": 8.532197761535645, "epoch": 0.015258507505056598, "grad_norm": 0.91015625, "learning_rate": 0.000107, "loss": 8.258, "mean_token_accuracy": 0.058545221015810965, "num_tokens": 461660.0, "step": 215 }, { "entropy": 8.52504529953003, "epoch": 0.015613356516802101, "grad_norm": 1.1953125, "learning_rate": 0.0001095, "loss": 8.2467, "mean_token_accuracy": 0.0674739558249712, "num_tokens": 471362.0, "step": 220 }, { "entropy": 8.518447113037109, "epoch": 0.015968205528547604, "grad_norm": 1.15625, "learning_rate": 0.000112, "loss": 8.1115, "mean_token_accuracy": 0.07247221358120441, "num_tokens": 482036.0, "step": 225 }, { "entropy": 8.392018604278565, "epoch": 0.016323054540293105, "grad_norm": 1.0703125, "learning_rate": 0.0001145, "loss": 8.2038, "mean_token_accuracy": 0.06354649700224399, "num_tokens": 492633.0, "step": 230 }, { "entropy": 8.478435707092284, "epoch": 0.016677903552038607, "grad_norm": 1.140625, "learning_rate": 0.00011700000000000001, "loss": 8.2366, "mean_token_accuracy": 0.06092475391924381, "num_tokens": 502613.0, "step": 235 }, { "entropy": 8.442237091064452, "epoch": 0.01703275256378411, "grad_norm": 1.1328125, "learning_rate": 0.00011949999999999999, "loss": 8.26, "mean_token_accuracy": 0.06470727063715458, "num_tokens": 513256.0, "step": 240 }, { "entropy": 8.596701526641846, "epoch": 0.017387601575529613, "grad_norm": 1.0625, "learning_rate": 0.000122, "loss": 8.2988, "mean_token_accuracy": 0.061711058393120764, "num_tokens": 523355.0, "step": 245 }, { "entropy": 8.451476860046387, "epoch": 0.017742450587275114, "grad_norm": 1.015625, "learning_rate": 0.0001245, "loss": 8.2216, "mean_token_accuracy": 0.06455190740525722, "num_tokens": 535195.0, "step": 250 }, { "entropy": 8.469265937805176, "epoch": 0.018097299599020615, "grad_norm": 1.046875, "learning_rate": 0.000127, "loss": 8.1852, "mean_token_accuracy": 0.06743233427405357, "num_tokens": 544831.0, "step": 255 }, { "entropy": 8.445653438568115, "epoch": 0.01845214861076612, "grad_norm": 1.2421875, "learning_rate": 0.0001295, "loss": 8.2694, "mean_token_accuracy": 0.059878384508192536, "num_tokens": 555835.0, "step": 260 }, { "entropy": 8.478738117218018, "epoch": 0.01880699762251162, "grad_norm": 1.1796875, "learning_rate": 0.000132, "loss": 8.2247, "mean_token_accuracy": 0.06131057888269424, "num_tokens": 566875.0, "step": 265 }, { "entropy": 8.375457763671875, "epoch": 0.019161846634257122, "grad_norm": 1.09375, "learning_rate": 0.00013450000000000002, "loss": 8.237, "mean_token_accuracy": 0.06333270035684109, "num_tokens": 577462.0, "step": 270 }, { "entropy": 8.501999855041504, "epoch": 0.019516695646002627, "grad_norm": 1.0703125, "learning_rate": 0.00013700000000000002, "loss": 8.1721, "mean_token_accuracy": 0.06697900146245957, "num_tokens": 587569.0, "step": 275 }, { "entropy": 8.420077037811279, "epoch": 0.019871544657748128, "grad_norm": 0.921875, "learning_rate": 0.0001395, "loss": 8.2355, "mean_token_accuracy": 0.05800015553832054, "num_tokens": 599322.0, "step": 280 }, { "entropy": 8.452305221557618, "epoch": 0.02022639366949363, "grad_norm": 0.921875, "learning_rate": 0.00014199999999999998, "loss": 8.2397, "mean_token_accuracy": 0.06376027651131153, "num_tokens": 610060.0, "step": 285 }, { "entropy": 8.481741237640382, "epoch": 0.020581242681239134, "grad_norm": 1.234375, "learning_rate": 0.0001445, "loss": 8.295, "mean_token_accuracy": 0.06520596966147423, "num_tokens": 620091.0, "step": 290 }, { "entropy": 8.525186729431152, "epoch": 0.020936091692984635, "grad_norm": 2.140625, "learning_rate": 0.000147, "loss": 8.12, "mean_token_accuracy": 0.0748389147222042, "num_tokens": 631440.0, "step": 295 }, { "entropy": 8.37361249923706, "epoch": 0.021290940704730137, "grad_norm": 1.015625, "learning_rate": 0.0001495, "loss": 8.0801, "mean_token_accuracy": 0.06787928678095341, "num_tokens": 641374.0, "step": 300 }, { "entropy": 8.305605411529541, "epoch": 0.02164578971647564, "grad_norm": 1.0, "learning_rate": 0.000152, "loss": 8.1269, "mean_token_accuracy": 0.06664356999099255, "num_tokens": 652772.0, "step": 305 }, { "entropy": 8.341912460327148, "epoch": 0.022000638728221143, "grad_norm": 1.1328125, "learning_rate": 0.00015450000000000001, "loss": 8.1348, "mean_token_accuracy": 0.07087188474833965, "num_tokens": 664052.0, "step": 310 }, { "entropy": 8.363450813293458, "epoch": 0.022355487739966644, "grad_norm": 1.03125, "learning_rate": 0.000157, "loss": 8.1412, "mean_token_accuracy": 0.07019479162991046, "num_tokens": 675937.0, "step": 315 }, { "entropy": 8.314255905151366, "epoch": 0.022710336751712145, "grad_norm": 0.93359375, "learning_rate": 0.0001595, "loss": 8.065, "mean_token_accuracy": 0.07636438310146332, "num_tokens": 687149.0, "step": 320 }, { "entropy": 8.342943286895752, "epoch": 0.02306518576345765, "grad_norm": 1.0390625, "learning_rate": 0.000162, "loss": 8.0868, "mean_token_accuracy": 0.06923852488398552, "num_tokens": 697646.0, "step": 325 }, { "entropy": 8.419994449615478, "epoch": 0.02342003477520315, "grad_norm": 1.1484375, "learning_rate": 0.00016450000000000001, "loss": 8.2002, "mean_token_accuracy": 0.06634289510548115, "num_tokens": 708612.0, "step": 330 }, { "entropy": 8.354696655273438, "epoch": 0.023774883786948652, "grad_norm": 1.0546875, "learning_rate": 0.00016700000000000002, "loss": 8.1205, "mean_token_accuracy": 0.07153847180306912, "num_tokens": 719705.0, "step": 335 }, { "entropy": 8.35772638320923, "epoch": 0.024129732798694157, "grad_norm": 0.890625, "learning_rate": 0.00016950000000000003, "loss": 8.0862, "mean_token_accuracy": 0.06683175601065158, "num_tokens": 730552.0, "step": 340 }, { "entropy": 8.334082317352294, "epoch": 0.024484581810439658, "grad_norm": 1.140625, "learning_rate": 0.00017199999999999998, "loss": 8.0935, "mean_token_accuracy": 0.06866642013192177, "num_tokens": 741651.0, "step": 345 }, { "entropy": 8.407394886016846, "epoch": 0.02483943082218516, "grad_norm": 1.03125, "learning_rate": 0.00017449999999999999, "loss": 8.1023, "mean_token_accuracy": 0.06832008063793182, "num_tokens": 751820.0, "step": 350 }, { "entropy": 8.351481819152832, "epoch": 0.025194279833930664, "grad_norm": 1.21875, "learning_rate": 0.000177, "loss": 8.1154, "mean_token_accuracy": 0.06219382137060166, "num_tokens": 762125.0, "step": 355 }, { "entropy": 8.352156829833984, "epoch": 0.025549128845676165, "grad_norm": 0.92578125, "learning_rate": 0.0001795, "loss": 8.0332, "mean_token_accuracy": 0.07175925448536873, "num_tokens": 773137.0, "step": 360 }, { "entropy": 8.26557502746582, "epoch": 0.025903977857421667, "grad_norm": 1.015625, "learning_rate": 0.000182, "loss": 8.117, "mean_token_accuracy": 0.06638101302087307, "num_tokens": 784702.0, "step": 365 }, { "entropy": 8.30114049911499, "epoch": 0.026258826869167168, "grad_norm": 0.9296875, "learning_rate": 0.0001845, "loss": 8.0759, "mean_token_accuracy": 0.06737305559217929, "num_tokens": 795806.0, "step": 370 }, { "entropy": 8.324819755554199, "epoch": 0.026613675880912673, "grad_norm": 0.8515625, "learning_rate": 0.000187, "loss": 8.0175, "mean_token_accuracy": 0.06811637170612812, "num_tokens": 806006.0, "step": 375 }, { "entropy": 8.294619274139404, "epoch": 0.026968524892658174, "grad_norm": 0.98828125, "learning_rate": 0.0001895, "loss": 8.0306, "mean_token_accuracy": 0.0675454068928957, "num_tokens": 816345.0, "step": 380 }, { "entropy": 8.203885173797607, "epoch": 0.027323373904403675, "grad_norm": 0.92578125, "learning_rate": 0.000192, "loss": 8.0311, "mean_token_accuracy": 0.06778408177196979, "num_tokens": 827038.0, "step": 385 }, { "entropy": 8.261708545684815, "epoch": 0.02767822291614918, "grad_norm": 0.84765625, "learning_rate": 0.0001945, "loss": 8.0325, "mean_token_accuracy": 0.07145289778709411, "num_tokens": 837465.0, "step": 390 }, { "entropy": 8.322563171386719, "epoch": 0.02803307192789468, "grad_norm": 1.1015625, "learning_rate": 0.00019700000000000002, "loss": 8.0101, "mean_token_accuracy": 0.0660801563411951, "num_tokens": 848461.0, "step": 395 }, { "entropy": 8.286761474609374, "epoch": 0.028387920939640182, "grad_norm": 1.5390625, "learning_rate": 0.00019950000000000002, "loss": 8.0912, "mean_token_accuracy": 0.06686392053961754, "num_tokens": 859215.0, "step": 400 }, { "entropy": 8.153140926361084, "epoch": 0.028742769951385687, "grad_norm": 0.95703125, "learning_rate": 0.000202, "loss": 7.9714, "mean_token_accuracy": 0.06791464723646641, "num_tokens": 869165.0, "step": 405 }, { "entropy": 8.278606796264649, "epoch": 0.029097618963131188, "grad_norm": 1.1796875, "learning_rate": 0.00020449999999999998, "loss": 8.0299, "mean_token_accuracy": 0.06314935013651848, "num_tokens": 879737.0, "step": 410 }, { "entropy": 8.317267990112304, "epoch": 0.02945246797487669, "grad_norm": 0.97265625, "learning_rate": 0.000207, "loss": 8.0687, "mean_token_accuracy": 0.06716468073427677, "num_tokens": 889960.0, "step": 415 }, { "entropy": 8.284847354888916, "epoch": 0.02980731698662219, "grad_norm": 1.0390625, "learning_rate": 0.0002095, "loss": 8.0315, "mean_token_accuracy": 0.06850776262581348, "num_tokens": 902004.0, "step": 420 }, { "entropy": 8.195465469360352, "epoch": 0.030162165998367695, "grad_norm": 1.015625, "learning_rate": 0.000212, "loss": 7.9605, "mean_token_accuracy": 0.06964701861143112, "num_tokens": 912448.0, "step": 425 }, { "entropy": 8.246010208129883, "epoch": 0.030517015010113197, "grad_norm": 1.1015625, "learning_rate": 0.0002145, "loss": 8.0425, "mean_token_accuracy": 0.06564139947295189, "num_tokens": 922295.0, "step": 430 }, { "entropy": 8.212500381469727, "epoch": 0.030871864021858698, "grad_norm": 1.15625, "learning_rate": 0.00021700000000000002, "loss": 7.9675, "mean_token_accuracy": 0.07113610915839672, "num_tokens": 932849.0, "step": 435 }, { "entropy": 8.252998352050781, "epoch": 0.031226713033604202, "grad_norm": 1.1640625, "learning_rate": 0.0002195, "loss": 7.9716, "mean_token_accuracy": 0.06684075817465782, "num_tokens": 943570.0, "step": 440 }, { "entropy": 8.093912363052368, "epoch": 0.031581562045349704, "grad_norm": 1.0625, "learning_rate": 0.000222, "loss": 8.0064, "mean_token_accuracy": 0.06446249783039093, "num_tokens": 953681.0, "step": 445 }, { "entropy": 8.259466552734375, "epoch": 0.03193641105709521, "grad_norm": 1.0390625, "learning_rate": 0.0002245, "loss": 8.0026, "mean_token_accuracy": 0.06529812254011631, "num_tokens": 965027.0, "step": 450 }, { "entropy": 8.120300006866454, "epoch": 0.032291260068840706, "grad_norm": 1.0703125, "learning_rate": 0.00022700000000000002, "loss": 7.9335, "mean_token_accuracy": 0.06843561045825482, "num_tokens": 975757.0, "step": 455 }, { "entropy": 8.253607749938965, "epoch": 0.03264610908058621, "grad_norm": 0.8359375, "learning_rate": 0.00022950000000000002, "loss": 7.975, "mean_token_accuracy": 0.07162793055176735, "num_tokens": 987354.0, "step": 460 }, { "entropy": 8.038683032989502, "epoch": 0.033000958092331716, "grad_norm": 1.0625, "learning_rate": 0.00023200000000000003, "loss": 7.9604, "mean_token_accuracy": 0.06958170719444752, "num_tokens": 997844.0, "step": 465 }, { "entropy": 8.277831172943115, "epoch": 0.03335580710407721, "grad_norm": 1.1484375, "learning_rate": 0.00023449999999999998, "loss": 8.0444, "mean_token_accuracy": 0.07072999998927117, "num_tokens": 1008748.0, "step": 470 }, { "entropy": 8.073792266845704, "epoch": 0.03371065611582272, "grad_norm": 1.078125, "learning_rate": 0.000237, "loss": 7.8659, "mean_token_accuracy": 0.0738751970231533, "num_tokens": 1018612.0, "step": 475 }, { "entropy": 8.137950706481934, "epoch": 0.03406550512756822, "grad_norm": 1.2578125, "learning_rate": 0.0002395, "loss": 7.9242, "mean_token_accuracy": 0.07282396517693997, "num_tokens": 1029431.0, "step": 480 }, { "entropy": 8.098453617095947, "epoch": 0.03442035413931372, "grad_norm": 1.1328125, "learning_rate": 0.000242, "loss": 7.9572, "mean_token_accuracy": 0.06277543865144253, "num_tokens": 1041255.0, "step": 485 }, { "entropy": 8.044496870040893, "epoch": 0.034775203151059225, "grad_norm": 1.375, "learning_rate": 0.0002445, "loss": 7.7917, "mean_token_accuracy": 0.08647977113723755, "num_tokens": 1052416.0, "step": 490 }, { "entropy": 8.117148971557617, "epoch": 0.03513005216280473, "grad_norm": 0.98046875, "learning_rate": 0.000247, "loss": 7.9132, "mean_token_accuracy": 0.07025011256337166, "num_tokens": 1063801.0, "step": 495 }, { "entropy": 8.052232360839843, "epoch": 0.03548490117455023, "grad_norm": 1.1015625, "learning_rate": 0.0002495, "loss": 7.9351, "mean_token_accuracy": 0.06856431551277638, "num_tokens": 1074984.0, "step": 500 }, { "entropy": 8.149673557281494, "epoch": 0.03583975018629573, "grad_norm": 1.03125, "learning_rate": 0.000252, "loss": 7.8893, "mean_token_accuracy": 0.07065611332654953, "num_tokens": 1086306.0, "step": 505 }, { "entropy": 8.180394887924194, "epoch": 0.03619459919804123, "grad_norm": 1.125, "learning_rate": 0.0002545, "loss": 7.8803, "mean_token_accuracy": 0.06889106482267379, "num_tokens": 1096569.0, "step": 510 }, { "entropy": 8.032092428207397, "epoch": 0.036549448209786735, "grad_norm": 1.15625, "learning_rate": 0.000257, "loss": 7.9032, "mean_token_accuracy": 0.0709243293851614, "num_tokens": 1106599.0, "step": 515 }, { "entropy": 8.193197917938232, "epoch": 0.03690429722153224, "grad_norm": 0.99609375, "learning_rate": 0.0002595, "loss": 7.9409, "mean_token_accuracy": 0.06765258684754372, "num_tokens": 1118337.0, "step": 520 }, { "entropy": 7.961832189559937, "epoch": 0.03725914623327774, "grad_norm": 1.015625, "learning_rate": 0.000262, "loss": 7.9391, "mean_token_accuracy": 0.07329438030719757, "num_tokens": 1129685.0, "step": 525 }, { "entropy": 8.117317533493042, "epoch": 0.03761399524502324, "grad_norm": 0.91015625, "learning_rate": 0.00026450000000000003, "loss": 7.8971, "mean_token_accuracy": 0.07165143899619579, "num_tokens": 1141055.0, "step": 530 }, { "entropy": 8.06903042793274, "epoch": 0.03796884425676875, "grad_norm": 0.86328125, "learning_rate": 0.00026700000000000004, "loss": 7.9105, "mean_token_accuracy": 0.0673241663724184, "num_tokens": 1153130.0, "step": 535 }, { "entropy": 8.082281255722046, "epoch": 0.038323693268514245, "grad_norm": 1.0625, "learning_rate": 0.00026950000000000005, "loss": 7.8957, "mean_token_accuracy": 0.06771765686571599, "num_tokens": 1163764.0, "step": 540 }, { "entropy": 8.043478631973267, "epoch": 0.03867854228025975, "grad_norm": 0.99609375, "learning_rate": 0.00027200000000000005, "loss": 7.8448, "mean_token_accuracy": 0.07466785535216332, "num_tokens": 1173902.0, "step": 545 }, { "entropy": 7.998564767837524, "epoch": 0.039033391292005254, "grad_norm": 1.015625, "learning_rate": 0.0002745, "loss": 7.7856, "mean_token_accuracy": 0.07209023796021938, "num_tokens": 1185055.0, "step": 550 }, { "entropy": 8.057881355285645, "epoch": 0.03938824030375075, "grad_norm": 1.2421875, "learning_rate": 0.000277, "loss": 7.8076, "mean_token_accuracy": 0.07696683742105961, "num_tokens": 1195695.0, "step": 555 }, { "entropy": 7.934873914718628, "epoch": 0.039743089315496256, "grad_norm": 0.9453125, "learning_rate": 0.0002795, "loss": 7.8796, "mean_token_accuracy": 0.07105770707130432, "num_tokens": 1207459.0, "step": 560 }, { "entropy": 7.985773086547852, "epoch": 0.04009793832724176, "grad_norm": 1.0859375, "learning_rate": 0.00028199999999999997, "loss": 7.8242, "mean_token_accuracy": 0.07130814269185067, "num_tokens": 1217533.0, "step": 565 }, { "entropy": 7.973219776153565, "epoch": 0.04045278733898726, "grad_norm": 1.0625, "learning_rate": 0.0002845, "loss": 7.8496, "mean_token_accuracy": 0.07043180353939534, "num_tokens": 1231146.0, "step": 570 }, { "entropy": 7.945406341552735, "epoch": 0.040807636350732764, "grad_norm": 0.97265625, "learning_rate": 0.000287, "loss": 7.8843, "mean_token_accuracy": 0.07025334909558296, "num_tokens": 1243120.0, "step": 575 }, { "entropy": 8.011637639999389, "epoch": 0.04116248536247827, "grad_norm": 0.89453125, "learning_rate": 0.0002895, "loss": 7.9156, "mean_token_accuracy": 0.06993781737983226, "num_tokens": 1255180.0, "step": 580 }, { "entropy": 8.02280888557434, "epoch": 0.041517334374223766, "grad_norm": 1.0078125, "learning_rate": 0.000292, "loss": 7.8431, "mean_token_accuracy": 0.07286351397633553, "num_tokens": 1266382.0, "step": 585 }, { "entropy": 8.03951153755188, "epoch": 0.04187218338596927, "grad_norm": 1.0, "learning_rate": 0.0002945, "loss": 7.805, "mean_token_accuracy": 0.07100504785776138, "num_tokens": 1278184.0, "step": 590 }, { "entropy": 7.95987548828125, "epoch": 0.042227032397714775, "grad_norm": 1.1953125, "learning_rate": 0.000297, "loss": 7.7979, "mean_token_accuracy": 0.07571852058172227, "num_tokens": 1289273.0, "step": 595 }, { "entropy": 7.960937976837158, "epoch": 0.04258188140946027, "grad_norm": 1.3203125, "learning_rate": 0.0002995, "loss": 7.7835, "mean_token_accuracy": 0.07141958326101303, "num_tokens": 1299684.0, "step": 600 }, { "entropy": 8.025558280944825, "epoch": 0.04293673042120578, "grad_norm": 0.9765625, "learning_rate": 0.000302, "loss": 7.8675, "mean_token_accuracy": 0.06696930788457393, "num_tokens": 1310859.0, "step": 605 }, { "entropy": 7.910726022720337, "epoch": 0.04329157943295128, "grad_norm": 1.203125, "learning_rate": 0.0003045, "loss": 7.7781, "mean_token_accuracy": 0.07068931050598622, "num_tokens": 1322011.0, "step": 610 }, { "entropy": 7.939458894729614, "epoch": 0.04364642844469678, "grad_norm": 1.1171875, "learning_rate": 0.000307, "loss": 7.7663, "mean_token_accuracy": 0.07447356693446636, "num_tokens": 1332187.0, "step": 615 }, { "entropy": 7.852445602416992, "epoch": 0.044001277456442285, "grad_norm": 1.5859375, "learning_rate": 0.0003095, "loss": 7.6762, "mean_token_accuracy": 0.07490805983543396, "num_tokens": 1342678.0, "step": 620 }, { "entropy": 7.9485992908477785, "epoch": 0.04435612646818778, "grad_norm": 1.0625, "learning_rate": 0.000312, "loss": 7.8034, "mean_token_accuracy": 0.0721922166645527, "num_tokens": 1352563.0, "step": 625 }, { "entropy": 7.916344928741455, "epoch": 0.04471097547993329, "grad_norm": 0.94140625, "learning_rate": 0.0003145, "loss": 7.8087, "mean_token_accuracy": 0.0754479069262743, "num_tokens": 1363514.0, "step": 630 }, { "entropy": 7.988961410522461, "epoch": 0.04506582449167879, "grad_norm": 1.1875, "learning_rate": 0.000317, "loss": 7.9224, "mean_token_accuracy": 0.06770290434360504, "num_tokens": 1374914.0, "step": 635 }, { "entropy": 7.941910457611084, "epoch": 0.04542067350342429, "grad_norm": 0.9921875, "learning_rate": 0.0003195, "loss": 7.7749, "mean_token_accuracy": 0.07321363165974618, "num_tokens": 1385757.0, "step": 640 }, { "entropy": 7.951854848861695, "epoch": 0.045775522515169795, "grad_norm": 1.0546875, "learning_rate": 0.000322, "loss": 7.7757, "mean_token_accuracy": 0.07017956748604774, "num_tokens": 1397376.0, "step": 645 }, { "entropy": 7.916997385025025, "epoch": 0.0461303715269153, "grad_norm": 0.9765625, "learning_rate": 0.00032450000000000003, "loss": 7.7839, "mean_token_accuracy": 0.07471574619412422, "num_tokens": 1408491.0, "step": 650 }, { "entropy": 7.876117801666259, "epoch": 0.0464852205386608, "grad_norm": 1.2890625, "learning_rate": 0.00032700000000000003, "loss": 7.704, "mean_token_accuracy": 0.09316127598285676, "num_tokens": 1417643.0, "step": 655 }, { "entropy": 7.789826583862305, "epoch": 0.0468400695504063, "grad_norm": 1.0390625, "learning_rate": 0.00032950000000000004, "loss": 7.7654, "mean_token_accuracy": 0.0712949451059103, "num_tokens": 1427446.0, "step": 660 }, { "entropy": 7.888260316848755, "epoch": 0.04719491856215181, "grad_norm": 0.97265625, "learning_rate": 0.00033200000000000005, "loss": 7.7251, "mean_token_accuracy": 0.0718452412635088, "num_tokens": 1437782.0, "step": 665 }, { "entropy": 7.854969501495361, "epoch": 0.047549767573897304, "grad_norm": 0.9296875, "learning_rate": 0.00033450000000000005, "loss": 7.7738, "mean_token_accuracy": 0.07261287756264209, "num_tokens": 1448778.0, "step": 670 }, { "entropy": 7.974173069000244, "epoch": 0.04790461658564281, "grad_norm": 1.0234375, "learning_rate": 0.000337, "loss": 7.7582, "mean_token_accuracy": 0.07418306656181813, "num_tokens": 1460343.0, "step": 675 }, { "entropy": 7.7097618103027346, "epoch": 0.048259465597388314, "grad_norm": 0.94921875, "learning_rate": 0.0003395, "loss": 7.6886, "mean_token_accuracy": 0.07660397589206695, "num_tokens": 1471728.0, "step": 680 }, { "entropy": 7.960760021209717, "epoch": 0.04861431460913381, "grad_norm": 1.078125, "learning_rate": 0.000342, "loss": 7.7778, "mean_token_accuracy": 0.0769094929099083, "num_tokens": 1482946.0, "step": 685 }, { "entropy": 7.7662310123443605, "epoch": 0.048969163620879316, "grad_norm": 1.0703125, "learning_rate": 0.00034449999999999997, "loss": 7.6265, "mean_token_accuracy": 0.0757428240031004, "num_tokens": 1494028.0, "step": 690 }, { "entropy": 7.854742527008057, "epoch": 0.04932401263262482, "grad_norm": 1.1640625, "learning_rate": 0.000347, "loss": 7.7516, "mean_token_accuracy": 0.07619248703122139, "num_tokens": 1503763.0, "step": 695 }, { "entropy": 7.773598098754883, "epoch": 0.04967886164437032, "grad_norm": 0.9765625, "learning_rate": 0.0003495, "loss": 7.6727, "mean_token_accuracy": 0.07600370906293392, "num_tokens": 1514488.0, "step": 700 }, { "entropy": 7.798940801620484, "epoch": 0.05003371065611582, "grad_norm": 1.21875, "learning_rate": 0.000352, "loss": 7.6922, "mean_token_accuracy": 0.07355734147131443, "num_tokens": 1524489.0, "step": 705 }, { "entropy": 7.838931655883789, "epoch": 0.05038855966786133, "grad_norm": 1.0078125, "learning_rate": 0.0003545, "loss": 7.6913, "mean_token_accuracy": 0.07631286308169365, "num_tokens": 1535005.0, "step": 710 }, { "entropy": 7.7826978206634525, "epoch": 0.050743408679606826, "grad_norm": 1.0078125, "learning_rate": 0.000357, "loss": 7.6585, "mean_token_accuracy": 0.07577394507825375, "num_tokens": 1546049.0, "step": 715 }, { "entropy": 7.830225944519043, "epoch": 0.05109825769135233, "grad_norm": 1.234375, "learning_rate": 0.0003595, "loss": 7.6845, "mean_token_accuracy": 0.0732595931738615, "num_tokens": 1556468.0, "step": 720 }, { "entropy": 7.741913080215454, "epoch": 0.05145310670309783, "grad_norm": 1.046875, "learning_rate": 0.000362, "loss": 7.6607, "mean_token_accuracy": 0.08094885796308518, "num_tokens": 1567341.0, "step": 725 }, { "entropy": 7.8365312099456785, "epoch": 0.05180795571484333, "grad_norm": 0.9609375, "learning_rate": 0.0003645, "loss": 7.7157, "mean_token_accuracy": 0.07318115755915641, "num_tokens": 1578492.0, "step": 730 }, { "entropy": 7.815832948684692, "epoch": 0.05216280472658884, "grad_norm": 0.984375, "learning_rate": 0.000367, "loss": 7.6973, "mean_token_accuracy": 0.07630126550793648, "num_tokens": 1589147.0, "step": 735 }, { "entropy": 7.671171092987061, "epoch": 0.052517653738334336, "grad_norm": 1.046875, "learning_rate": 0.0003695, "loss": 7.5389, "mean_token_accuracy": 0.08950962349772454, "num_tokens": 1598725.0, "step": 740 }, { "entropy": 7.733880805969238, "epoch": 0.05287250275007984, "grad_norm": 0.97265625, "learning_rate": 0.000372, "loss": 7.6096, "mean_token_accuracy": 0.07969549223780632, "num_tokens": 1608913.0, "step": 745 }, { "entropy": 7.702016448974609, "epoch": 0.053227351761825345, "grad_norm": 1.0390625, "learning_rate": 0.0003745, "loss": 7.6984, "mean_token_accuracy": 0.07809793129563332, "num_tokens": 1619138.0, "step": 750 }, { "entropy": 7.733037090301513, "epoch": 0.05358220077357084, "grad_norm": 1.5625, "learning_rate": 0.000377, "loss": 7.5857, "mean_token_accuracy": 0.07457101494073867, "num_tokens": 1631217.0, "step": 755 }, { "entropy": 7.7332252025604244, "epoch": 0.05393704978531635, "grad_norm": 0.98828125, "learning_rate": 0.0003795, "loss": 7.66, "mean_token_accuracy": 0.07894963994622231, "num_tokens": 1642552.0, "step": 760 }, { "entropy": 7.6441277980804445, "epoch": 0.05429189879706185, "grad_norm": 0.9765625, "learning_rate": 0.000382, "loss": 7.6736, "mean_token_accuracy": 0.07516682222485542, "num_tokens": 1653422.0, "step": 765 }, { "entropy": 7.763870811462402, "epoch": 0.05464674780880735, "grad_norm": 1.046875, "learning_rate": 0.0003845, "loss": 7.6713, "mean_token_accuracy": 0.07678476013243199, "num_tokens": 1664709.0, "step": 770 }, { "entropy": 7.717665433883667, "epoch": 0.055001596820552855, "grad_norm": 1.0, "learning_rate": 0.00038700000000000003, "loss": 7.6484, "mean_token_accuracy": 0.07786873653531075, "num_tokens": 1676114.0, "step": 775 }, { "entropy": 7.750670051574707, "epoch": 0.05535644583229836, "grad_norm": 1.0, "learning_rate": 0.00038950000000000003, "loss": 7.7339, "mean_token_accuracy": 0.07396974675357341, "num_tokens": 1687558.0, "step": 780 }, { "entropy": 7.702802991867065, "epoch": 0.05571129484404386, "grad_norm": 0.86328125, "learning_rate": 0.00039200000000000004, "loss": 7.6509, "mean_token_accuracy": 0.07516442388296127, "num_tokens": 1699046.0, "step": 785 }, { "entropy": 7.7537883758544925, "epoch": 0.05606614385578936, "grad_norm": 0.99609375, "learning_rate": 0.00039450000000000005, "loss": 7.6358, "mean_token_accuracy": 0.07771104238927365, "num_tokens": 1709274.0, "step": 790 }, { "entropy": 7.673342323303222, "epoch": 0.05642099286753487, "grad_norm": 0.94140625, "learning_rate": 0.00039700000000000005, "loss": 7.5738, "mean_token_accuracy": 0.07565616965293884, "num_tokens": 1720358.0, "step": 795 }, { "entropy": 7.7894445896148685, "epoch": 0.056775841879280364, "grad_norm": 0.9453125, "learning_rate": 0.0003995, "loss": 7.7079, "mean_token_accuracy": 0.08025034442543984, "num_tokens": 1731684.0, "step": 800 }, { "entropy": 7.651151466369629, "epoch": 0.05713069089102587, "grad_norm": 1.2109375, "learning_rate": 0.000402, "loss": 7.6573, "mean_token_accuracy": 0.07534100264310836, "num_tokens": 1741862.0, "step": 805 }, { "entropy": 7.712702083587646, "epoch": 0.057485539902771374, "grad_norm": 0.9921875, "learning_rate": 0.0004045, "loss": 7.6288, "mean_token_accuracy": 0.07567652054131031, "num_tokens": 1753166.0, "step": 810 }, { "entropy": 7.656327629089356, "epoch": 0.05784038891451687, "grad_norm": 1.015625, "learning_rate": 0.00040699999999999997, "loss": 7.6233, "mean_token_accuracy": 0.08203103095293045, "num_tokens": 1764166.0, "step": 815 }, { "entropy": 7.6826342105865475, "epoch": 0.058195237926262376, "grad_norm": 0.953125, "learning_rate": 0.0004095, "loss": 7.5671, "mean_token_accuracy": 0.07672160528600216, "num_tokens": 1774894.0, "step": 820 }, { "entropy": 7.5881028175354, "epoch": 0.05855008693800788, "grad_norm": 0.93359375, "learning_rate": 0.000412, "loss": 7.5501, "mean_token_accuracy": 0.08005938455462455, "num_tokens": 1785038.0, "step": 825 }, { "entropy": 7.658244895935058, "epoch": 0.05890493594975338, "grad_norm": 1.3046875, "learning_rate": 0.0004145, "loss": 7.6152, "mean_token_accuracy": 0.07943779826164246, "num_tokens": 1795837.0, "step": 830 }, { "entropy": 7.661693716049195, "epoch": 0.05925978496149888, "grad_norm": 0.97265625, "learning_rate": 0.000417, "loss": 7.608, "mean_token_accuracy": 0.07967479974031448, "num_tokens": 1806885.0, "step": 835 }, { "entropy": 7.671980381011963, "epoch": 0.05961463397324438, "grad_norm": 0.94921875, "learning_rate": 0.0004195, "loss": 7.6108, "mean_token_accuracy": 0.08177201226353645, "num_tokens": 1817403.0, "step": 840 }, { "entropy": 7.65054988861084, "epoch": 0.059969482984989886, "grad_norm": 0.8828125, "learning_rate": 0.000422, "loss": 7.5622, "mean_token_accuracy": 0.08333921730518341, "num_tokens": 1828929.0, "step": 845 }, { "entropy": 7.580755519866943, "epoch": 0.06032433199673539, "grad_norm": 0.9140625, "learning_rate": 0.0004245, "loss": 7.5877, "mean_token_accuracy": 0.08306344002485275, "num_tokens": 1839387.0, "step": 850 }, { "entropy": 7.6390235900878904, "epoch": 0.06067918100848089, "grad_norm": 1.03125, "learning_rate": 0.000427, "loss": 7.5976, "mean_token_accuracy": 0.07957985401153564, "num_tokens": 1850325.0, "step": 855 }, { "entropy": 7.6384642124176025, "epoch": 0.06103403002022639, "grad_norm": 0.984375, "learning_rate": 0.0004295, "loss": 7.591, "mean_token_accuracy": 0.07911092862486839, "num_tokens": 1861028.0, "step": 860 }, { "entropy": 7.572419548034668, "epoch": 0.0613888790319719, "grad_norm": 0.96875, "learning_rate": 0.000432, "loss": 7.5673, "mean_token_accuracy": 0.08450285941362382, "num_tokens": 1872676.0, "step": 865 }, { "entropy": 7.608766698837281, "epoch": 0.061743728043717395, "grad_norm": 0.98828125, "learning_rate": 0.0004345, "loss": 7.6249, "mean_token_accuracy": 0.08118002340197564, "num_tokens": 1883839.0, "step": 870 }, { "entropy": 7.498948860168457, "epoch": 0.0620985770554629, "grad_norm": 0.9375, "learning_rate": 0.000437, "loss": 7.473, "mean_token_accuracy": 0.08832938000559806, "num_tokens": 1894805.0, "step": 875 }, { "entropy": 7.565404224395752, "epoch": 0.062453426067208405, "grad_norm": 0.98828125, "learning_rate": 0.0004395, "loss": 7.4774, "mean_token_accuracy": 0.08059397265315056, "num_tokens": 1904770.0, "step": 880 }, { "entropy": 7.594593524932861, "epoch": 0.06280827507895391, "grad_norm": 0.859375, "learning_rate": 0.000442, "loss": 7.534, "mean_token_accuracy": 0.08095177710056305, "num_tokens": 1916190.0, "step": 885 }, { "entropy": 7.64970817565918, "epoch": 0.06316312409069941, "grad_norm": 0.96875, "learning_rate": 0.0004445, "loss": 7.5897, "mean_token_accuracy": 0.07850743383169174, "num_tokens": 1926519.0, "step": 890 }, { "entropy": 7.572882080078125, "epoch": 0.0635179731024449, "grad_norm": 0.90625, "learning_rate": 0.000447, "loss": 7.5959, "mean_token_accuracy": 0.08198425024747849, "num_tokens": 1936625.0, "step": 895 }, { "entropy": 7.570544862747193, "epoch": 0.06387282211419042, "grad_norm": 0.9609375, "learning_rate": 0.00044950000000000003, "loss": 7.552, "mean_token_accuracy": 0.08835628777742385, "num_tokens": 1946892.0, "step": 900 }, { "entropy": 7.569087743759155, "epoch": 0.06422767112593591, "grad_norm": 0.875, "learning_rate": 0.00045200000000000004, "loss": 7.5459, "mean_token_accuracy": 0.0858149766921997, "num_tokens": 1958464.0, "step": 905 }, { "entropy": 7.445690727233886, "epoch": 0.06458252013768141, "grad_norm": 1.0078125, "learning_rate": 0.00045450000000000004, "loss": 7.4842, "mean_token_accuracy": 0.08828370273113251, "num_tokens": 1968717.0, "step": 910 }, { "entropy": 7.524918699264527, "epoch": 0.06493736914942692, "grad_norm": 1.015625, "learning_rate": 0.00045700000000000005, "loss": 7.5477, "mean_token_accuracy": 0.08735504001379013, "num_tokens": 1979054.0, "step": 915 }, { "entropy": 7.48834342956543, "epoch": 0.06529221816117242, "grad_norm": 0.890625, "learning_rate": 0.00045950000000000006, "loss": 7.51, "mean_token_accuracy": 0.07926352620124817, "num_tokens": 1991069.0, "step": 920 }, { "entropy": 7.58330545425415, "epoch": 0.06564706717291792, "grad_norm": 0.94921875, "learning_rate": 0.000462, "loss": 7.5667, "mean_token_accuracy": 0.08001754432916641, "num_tokens": 2002182.0, "step": 925 }, { "entropy": 7.495837259292602, "epoch": 0.06600191618466343, "grad_norm": 1.0234375, "learning_rate": 0.0004645, "loss": 7.4959, "mean_token_accuracy": 0.08842689022421837, "num_tokens": 2012165.0, "step": 930 }, { "entropy": 7.61547622680664, "epoch": 0.06635676519640893, "grad_norm": 1.1171875, "learning_rate": 0.000467, "loss": 7.5157, "mean_token_accuracy": 0.08534864895045757, "num_tokens": 2022379.0, "step": 935 }, { "entropy": 7.350019550323486, "epoch": 0.06671161420815443, "grad_norm": 0.921875, "learning_rate": 0.0004695, "loss": 7.469, "mean_token_accuracy": 0.08241500668227672, "num_tokens": 2033497.0, "step": 940 }, { "entropy": 7.599674367904663, "epoch": 0.06706646321989994, "grad_norm": 0.9765625, "learning_rate": 0.000472, "loss": 7.5326, "mean_token_accuracy": 0.08250435441732407, "num_tokens": 2044914.0, "step": 945 }, { "entropy": 7.5432432174682615, "epoch": 0.06742131223164544, "grad_norm": 0.86328125, "learning_rate": 0.0004745, "loss": 7.5577, "mean_token_accuracy": 0.07833333164453507, "num_tokens": 2056450.0, "step": 950 }, { "entropy": 7.4970087051391605, "epoch": 0.06777616124339093, "grad_norm": 0.9140625, "learning_rate": 0.000477, "loss": 7.5441, "mean_token_accuracy": 0.08571040853857995, "num_tokens": 2067132.0, "step": 955 }, { "entropy": 7.541100406646729, "epoch": 0.06813101025513645, "grad_norm": 1.0, "learning_rate": 0.0004795, "loss": 7.5381, "mean_token_accuracy": 0.084527288377285, "num_tokens": 2077268.0, "step": 960 }, { "entropy": 7.537912464141845, "epoch": 0.06848585926688194, "grad_norm": 0.97265625, "learning_rate": 0.000482, "loss": 7.5354, "mean_token_accuracy": 0.08061212226748467, "num_tokens": 2088550.0, "step": 965 }, { "entropy": 7.5197999477386475, "epoch": 0.06884070827862744, "grad_norm": 0.90234375, "learning_rate": 0.0004845, "loss": 7.5101, "mean_token_accuracy": 0.08455962091684341, "num_tokens": 2099937.0, "step": 970 }, { "entropy": 7.416968822479248, "epoch": 0.06919555729037295, "grad_norm": 1.0078125, "learning_rate": 0.000487, "loss": 7.4727, "mean_token_accuracy": 0.08963474035263061, "num_tokens": 2110257.0, "step": 975 }, { "entropy": 7.585858726501465, "epoch": 0.06955040630211845, "grad_norm": 0.9296875, "learning_rate": 0.0004895, "loss": 7.5953, "mean_token_accuracy": 0.07949252240359783, "num_tokens": 2122537.0, "step": 980 }, { "entropy": 7.555169153213501, "epoch": 0.06990525531386395, "grad_norm": 1.0078125, "learning_rate": 0.000492, "loss": 7.5226, "mean_token_accuracy": 0.08293924927711487, "num_tokens": 2132892.0, "step": 985 }, { "entropy": 7.499892282485962, "epoch": 0.07026010432560946, "grad_norm": 0.8984375, "learning_rate": 0.0004945, "loss": 7.4475, "mean_token_accuracy": 0.08585060015320778, "num_tokens": 2143465.0, "step": 990 }, { "entropy": 7.430732774734497, "epoch": 0.07061495333735496, "grad_norm": 0.9453125, "learning_rate": 0.000497, "loss": 7.4201, "mean_token_accuracy": 0.08321849703788757, "num_tokens": 2154439.0, "step": 995 }, { "entropy": 7.451830673217773, "epoch": 0.07096980234910046, "grad_norm": 1.0078125, "learning_rate": 0.0004995, "loss": 7.4062, "mean_token_accuracy": 0.08034207150340081, "num_tokens": 2164849.0, "step": 1000 }, { "entropy": 7.4653853416442875, "epoch": 0.07132465136084595, "grad_norm": 1.03125, "learning_rate": 0.000499998026082006, "loss": 7.5331, "mean_token_accuracy": 0.08420314416289329, "num_tokens": 2174889.0, "step": 1005 }, { "entropy": 7.4106261253356935, "epoch": 0.07167950037259146, "grad_norm": 0.98828125, "learning_rate": 0.0004999900070995136, "loss": 7.443, "mean_token_accuracy": 0.08532139733433723, "num_tokens": 2184969.0, "step": 1010 }, { "entropy": 7.500397348403931, "epoch": 0.07203434938433696, "grad_norm": 1.0546875, "learning_rate": 0.0004999758199023239, "loss": 7.4641, "mean_token_accuracy": 0.08998854607343673, "num_tokens": 2194549.0, "step": 1015 }, { "entropy": 7.426589250564575, "epoch": 0.07238919839608246, "grad_norm": 1.0078125, "learning_rate": 0.0004999554648793858, "loss": 7.4863, "mean_token_accuracy": 0.08732765316963195, "num_tokens": 2206300.0, "step": 1020 }, { "entropy": 7.3821296215057375, "epoch": 0.07274404740782797, "grad_norm": 1.078125, "learning_rate": 0.0004999289425887425, "loss": 7.4323, "mean_token_accuracy": 0.08991043567657471, "num_tokens": 2216717.0, "step": 1025 }, { "entropy": 7.46541018486023, "epoch": 0.07309889641957347, "grad_norm": 0.8515625, "learning_rate": 0.0004998962537575161, "loss": 7.4952, "mean_token_accuracy": 0.08183322325348855, "num_tokens": 2227047.0, "step": 1030 }, { "entropy": 7.472234773635864, "epoch": 0.07345374543131897, "grad_norm": 0.984375, "learning_rate": 0.0004998573992818874, "loss": 7.3876, "mean_token_accuracy": 0.08948077708482742, "num_tokens": 2236811.0, "step": 1035 }, { "entropy": 7.367137098312378, "epoch": 0.07380859444306448, "grad_norm": 1.09375, "learning_rate": 0.0004998123802270715, "loss": 7.4732, "mean_token_accuracy": 0.08651004880666732, "num_tokens": 2248949.0, "step": 1040 }, { "entropy": 7.470364713668824, "epoch": 0.07416344345480998, "grad_norm": 0.90625, "learning_rate": 0.0004997611978272886, "loss": 7.4892, "mean_token_accuracy": 0.09045022875070571, "num_tokens": 2260720.0, "step": 1045 }, { "entropy": 7.41192946434021, "epoch": 0.07451829246655547, "grad_norm": 0.9453125, "learning_rate": 0.0004997038534857298, "loss": 7.4659, "mean_token_accuracy": 0.08553651496767997, "num_tokens": 2271855.0, "step": 1050 }, { "entropy": 7.329938554763794, "epoch": 0.07487314147830099, "grad_norm": 0.89453125, "learning_rate": 0.0004996403487745194, "loss": 7.4186, "mean_token_accuracy": 0.08984486237168313, "num_tokens": 2283203.0, "step": 1055 }, { "entropy": 7.525700807571411, "epoch": 0.07522799049004648, "grad_norm": 0.94140625, "learning_rate": 0.000499570685434671, "loss": 7.4772, "mean_token_accuracy": 0.0798021551221609, "num_tokens": 2295881.0, "step": 1060 }, { "entropy": 7.448550653457642, "epoch": 0.07558283950179198, "grad_norm": 0.984375, "learning_rate": 0.0004994948653760405, "loss": 7.4512, "mean_token_accuracy": 0.08743728250265122, "num_tokens": 2306411.0, "step": 1065 }, { "entropy": 7.442822980880737, "epoch": 0.0759376885135375, "grad_norm": 0.87890625, "learning_rate": 0.0004994128906772729, "loss": 7.4075, "mean_token_accuracy": 0.08435096815228463, "num_tokens": 2317519.0, "step": 1070 }, { "entropy": 7.448988389968872, "epoch": 0.07629253752528299, "grad_norm": 0.98828125, "learning_rate": 0.000499324763585746, "loss": 7.4994, "mean_token_accuracy": 0.08249662891030311, "num_tokens": 2327921.0, "step": 1075 }, { "entropy": 7.324292278289795, "epoch": 0.07664738653702849, "grad_norm": 0.93359375, "learning_rate": 0.0004992304865175085, "loss": 7.3506, "mean_token_accuracy": 0.09711327776312828, "num_tokens": 2338925.0, "step": 1080 }, { "entropy": 7.464797782897949, "epoch": 0.077002235548774, "grad_norm": 0.9296875, "learning_rate": 0.0004991300620572138, "loss": 7.4976, "mean_token_accuracy": 0.08892218843102455, "num_tokens": 2349576.0, "step": 1085 }, { "entropy": 7.314234113693237, "epoch": 0.0773570845605195, "grad_norm": 1.0703125, "learning_rate": 0.0004990234929580494, "loss": 7.3705, "mean_token_accuracy": 0.08954303413629532, "num_tokens": 2359671.0, "step": 1090 }, { "entropy": 7.498252105712891, "epoch": 0.077711933572265, "grad_norm": 1.0234375, "learning_rate": 0.0004989107821416609, "loss": 7.4653, "mean_token_accuracy": 0.08781479671597481, "num_tokens": 2370173.0, "step": 1095 }, { "entropy": 7.377524137496948, "epoch": 0.07806678258401051, "grad_norm": 0.91796875, "learning_rate": 0.0004987919326980723, "loss": 7.3908, "mean_token_accuracy": 0.08205282092094421, "num_tokens": 2381330.0, "step": 1100 }, { "entropy": 7.393895387649536, "epoch": 0.078421631595756, "grad_norm": 0.94921875, "learning_rate": 0.0004986669478856011, "loss": 7.4112, "mean_token_accuracy": 0.08845710456371307, "num_tokens": 2392487.0, "step": 1105 }, { "entropy": 7.278064727783203, "epoch": 0.0787764806075015, "grad_norm": 0.8828125, "learning_rate": 0.0004985358311307688, "loss": 7.3277, "mean_token_accuracy": 0.09402666017413139, "num_tokens": 2404083.0, "step": 1110 }, { "entropy": 7.404061222076416, "epoch": 0.07913132961924702, "grad_norm": 0.9375, "learning_rate": 0.0004983985860282081, "loss": 7.4268, "mean_token_accuracy": 0.08385513573884965, "num_tokens": 2414646.0, "step": 1115 }, { "entropy": 7.46454119682312, "epoch": 0.07948617863099251, "grad_norm": 1.046875, "learning_rate": 0.0004982552163405623, "loss": 7.4392, "mean_token_accuracy": 0.08458093479275704, "num_tokens": 2425823.0, "step": 1120 }, { "entropy": 7.345199346542358, "epoch": 0.07984102764273801, "grad_norm": 0.9140625, "learning_rate": 0.0004981057259983839, "loss": 7.4252, "mean_token_accuracy": 0.08571918532252312, "num_tokens": 2436999.0, "step": 1125 }, { "entropy": 7.397942304611206, "epoch": 0.08019587665448352, "grad_norm": 0.96875, "learning_rate": 0.0004979501191000262, "loss": 7.3874, "mean_token_accuracy": 0.08777525499463082, "num_tokens": 2448166.0, "step": 1130 }, { "entropy": 7.41080527305603, "epoch": 0.08055072566622902, "grad_norm": 1.0234375, "learning_rate": 0.0004977883999115311, "loss": 7.414, "mean_token_accuracy": 0.08722149506211281, "num_tokens": 2459018.0, "step": 1135 }, { "entropy": 7.315374708175659, "epoch": 0.08090557467797452, "grad_norm": 1.1015625, "learning_rate": 0.0004976205728665113, "loss": 7.3751, "mean_token_accuracy": 0.08800306916236877, "num_tokens": 2469113.0, "step": 1140 }, { "entropy": 7.370522165298462, "epoch": 0.08126042368972003, "grad_norm": 1.0546875, "learning_rate": 0.0004974466425660307, "loss": 7.3597, "mean_token_accuracy": 0.09009913429617881, "num_tokens": 2481506.0, "step": 1145 }, { "entropy": 7.3977306365966795, "epoch": 0.08161527270146553, "grad_norm": 1.03125, "learning_rate": 0.0004972666137784759, "loss": 7.3996, "mean_token_accuracy": 0.09371651038527488, "num_tokens": 2491924.0, "step": 1150 }, { "entropy": 7.312761831283569, "epoch": 0.08197012171321102, "grad_norm": 0.92578125, "learning_rate": 0.0004970804914394271, "loss": 7.3336, "mean_token_accuracy": 0.08466937094926834, "num_tokens": 2503920.0, "step": 1155 }, { "entropy": 7.372441291809082, "epoch": 0.08232497072495654, "grad_norm": 0.96484375, "learning_rate": 0.0004968882806515225, "loss": 7.3572, "mean_token_accuracy": 0.08929058611392975, "num_tokens": 2514366.0, "step": 1160 }, { "entropy": 7.331275081634521, "epoch": 0.08267981973670203, "grad_norm": 0.96875, "learning_rate": 0.0004966899866843177, "loss": 7.4348, "mean_token_accuracy": 0.08657754585146904, "num_tokens": 2524749.0, "step": 1165 }, { "entropy": 7.35433521270752, "epoch": 0.08303466874844753, "grad_norm": 0.9296875, "learning_rate": 0.000496485614974142, "loss": 7.4169, "mean_token_accuracy": 0.09042649567127228, "num_tokens": 2536202.0, "step": 1170 }, { "entropy": 7.385815572738648, "epoch": 0.08338951776019304, "grad_norm": 1.140625, "learning_rate": 0.0004962751711239492, "loss": 7.3481, "mean_token_accuracy": 0.09155565276741981, "num_tokens": 2545573.0, "step": 1175 }, { "entropy": 7.3866798877716064, "epoch": 0.08374436677193854, "grad_norm": 0.91015625, "learning_rate": 0.0004960586609031636, "loss": 7.3933, "mean_token_accuracy": 0.09010633900761604, "num_tokens": 2556627.0, "step": 1180 }, { "entropy": 7.227568435668945, "epoch": 0.08409921578368404, "grad_norm": 0.8671875, "learning_rate": 0.0004958360902475224, "loss": 7.3546, "mean_token_accuracy": 0.08734624981880187, "num_tokens": 2567064.0, "step": 1185 }, { "entropy": 7.4254954814910885, "epoch": 0.08445406479542955, "grad_norm": 0.99609375, "learning_rate": 0.0004956074652589125, "loss": 7.3938, "mean_token_accuracy": 0.08469272255897523, "num_tokens": 2577772.0, "step": 1190 }, { "entropy": 7.222232055664063, "epoch": 0.08480891380717505, "grad_norm": 0.98828125, "learning_rate": 0.0004953727922052035, "loss": 7.3055, "mean_token_accuracy": 0.08891206458210946, "num_tokens": 2588880.0, "step": 1195 }, { "entropy": 7.418983125686646, "epoch": 0.08516376281892055, "grad_norm": 0.92578125, "learning_rate": 0.0004951320775200756, "loss": 7.3926, "mean_token_accuracy": 0.08361146301031112, "num_tokens": 2600146.0, "step": 1200 }, { "entropy": 7.26065993309021, "epoch": 0.08551861183066606, "grad_norm": 0.9765625, "learning_rate": 0.0004948853278028436, "loss": 7.3419, "mean_token_accuracy": 0.08811083883047104, "num_tokens": 2610305.0, "step": 1205 }, { "entropy": 7.385571146011353, "epoch": 0.08587346084241156, "grad_norm": 0.89453125, "learning_rate": 0.0004946325498182755, "loss": 7.351, "mean_token_accuracy": 0.08472810387611389, "num_tokens": 2621218.0, "step": 1210 }, { "entropy": 7.362215375900268, "epoch": 0.08622830985415705, "grad_norm": 0.94140625, "learning_rate": 0.0004943737504964076, "loss": 7.4032, "mean_token_accuracy": 0.07960698269307613, "num_tokens": 2632399.0, "step": 1215 }, { "entropy": 7.4094336986541744, "epoch": 0.08658315886590257, "grad_norm": 0.96484375, "learning_rate": 0.000494108936932354, "loss": 7.2759, "mean_token_accuracy": 0.09264603853225709, "num_tokens": 2643043.0, "step": 1220 }, { "entropy": 7.263467264175415, "epoch": 0.08693800787764806, "grad_norm": 0.95703125, "learning_rate": 0.0004938381163861124, "loss": 7.3037, "mean_token_accuracy": 0.08933228254318237, "num_tokens": 2653336.0, "step": 1225 }, { "entropy": 7.435257434844971, "epoch": 0.08729285688939356, "grad_norm": 1.015625, "learning_rate": 0.0004935612962823645, "loss": 7.3784, "mean_token_accuracy": 0.08661267906427383, "num_tokens": 2664414.0, "step": 1230 }, { "entropy": 7.223228883743286, "epoch": 0.08764770590113906, "grad_norm": 1.015625, "learning_rate": 0.0004932784842102739, "loss": 7.3525, "mean_token_accuracy": 0.09211425483226776, "num_tokens": 2674338.0, "step": 1235 }, { "entropy": 7.366180896759033, "epoch": 0.08800255491288457, "grad_norm": 0.91015625, "learning_rate": 0.0004929896879232758, "loss": 7.3397, "mean_token_accuracy": 0.08799645379185676, "num_tokens": 2686022.0, "step": 1240 }, { "entropy": 7.351464748382568, "epoch": 0.08835740392463007, "grad_norm": 0.9140625, "learning_rate": 0.0004926949153388668, "loss": 7.304, "mean_token_accuracy": 0.08788969665765763, "num_tokens": 2696746.0, "step": 1245 }, { "entropy": 7.238297367095948, "epoch": 0.08871225293637557, "grad_norm": 0.859375, "learning_rate": 0.0004923941745383859, "loss": 7.3415, "mean_token_accuracy": 0.08992047309875488, "num_tokens": 2706737.0, "step": 1250 }, { "entropy": 7.3518078327178955, "epoch": 0.08906710194812108, "grad_norm": 1.0390625, "learning_rate": 0.000492087473766794, "loss": 7.3486, "mean_token_accuracy": 0.08713155873119831, "num_tokens": 2717757.0, "step": 1255 }, { "entropy": 7.33965802192688, "epoch": 0.08942195095986658, "grad_norm": 1.0234375, "learning_rate": 0.000491774821432448, "loss": 7.2968, "mean_token_accuracy": 0.09177965298295021, "num_tokens": 2728714.0, "step": 1260 }, { "entropy": 7.179767322540283, "epoch": 0.08977679997161207, "grad_norm": 0.94921875, "learning_rate": 0.0004914562261068693, "loss": 7.2606, "mean_token_accuracy": 0.09344343543052673, "num_tokens": 2739892.0, "step": 1265 }, { "entropy": 7.360199499130249, "epoch": 0.09013164898335758, "grad_norm": 1.0546875, "learning_rate": 0.0004911316965245098, "loss": 7.3165, "mean_token_accuracy": 0.09559072181582451, "num_tokens": 2750164.0, "step": 1270 }, { "entropy": 7.324847936630249, "epoch": 0.09048649799510308, "grad_norm": 1.0546875, "learning_rate": 0.000490801241582512, "loss": 7.3193, "mean_token_accuracy": 0.08874515891075134, "num_tokens": 2760865.0, "step": 1275 }, { "entropy": 7.346493816375732, "epoch": 0.09084134700684858, "grad_norm": 0.8984375, "learning_rate": 0.000490464870340465, "loss": 7.3471, "mean_token_accuracy": 0.09163894280791282, "num_tokens": 2772993.0, "step": 1280 }, { "entropy": 7.259117269515992, "epoch": 0.09119619601859409, "grad_norm": 1.0, "learning_rate": 0.0004901225920201563, "loss": 7.2786, "mean_token_accuracy": 0.09321993291378021, "num_tokens": 2782573.0, "step": 1285 }, { "entropy": 7.327762031555176, "epoch": 0.09155104503033959, "grad_norm": 1.0390625, "learning_rate": 0.000489774416005319, "loss": 7.3555, "mean_token_accuracy": 0.08510730862617492, "num_tokens": 2793372.0, "step": 1290 }, { "entropy": 7.372673606872558, "epoch": 0.09190589404208509, "grad_norm": 0.9609375, "learning_rate": 0.0004894203518413742, "loss": 7.3335, "mean_token_accuracy": 0.08849020972847939, "num_tokens": 2805067.0, "step": 1295 }, { "entropy": 7.204169082641601, "epoch": 0.0922607430538306, "grad_norm": 1.09375, "learning_rate": 0.0004890604092351701, "loss": 7.2726, "mean_token_accuracy": 0.09518759399652481, "num_tokens": 2815029.0, "step": 1300 }, { "entropy": 7.380017948150635, "epoch": 0.0926155920655761, "grad_norm": 0.890625, "learning_rate": 0.000488694598054715, "loss": 7.3445, "mean_token_accuracy": 0.09246201291680337, "num_tokens": 2825206.0, "step": 1305 }, { "entropy": 7.238814830780029, "epoch": 0.0929704410773216, "grad_norm": 0.9453125, "learning_rate": 0.0004883229283289071, "loss": 7.3075, "mean_token_accuracy": 0.09198266863822938, "num_tokens": 2837134.0, "step": 1310 }, { "entropy": 7.282371139526367, "epoch": 0.0933252900890671, "grad_norm": 0.875, "learning_rate": 0.00048794541024725993, "loss": 7.261, "mean_token_accuracy": 0.09279094189405442, "num_tokens": 2848085.0, "step": 1315 }, { "entropy": 7.297031307220459, "epoch": 0.0936801391008126, "grad_norm": 0.94921875, "learning_rate": 0.0004875620541596221, "loss": 7.2988, "mean_token_accuracy": 0.092452073097229, "num_tokens": 2858270.0, "step": 1320 }, { "entropy": 7.190067005157471, "epoch": 0.0940349881125581, "grad_norm": 0.89453125, "learning_rate": 0.00048717287057589454, "loss": 7.1873, "mean_token_accuracy": 0.09650815352797508, "num_tokens": 2868319.0, "step": 1325 }, { "entropy": 7.2879091739654545, "epoch": 0.09438983712430361, "grad_norm": 0.94921875, "learning_rate": 0.0004867778701657417, "loss": 7.2142, "mean_token_accuracy": 0.09751713499426842, "num_tokens": 2879042.0, "step": 1330 }, { "entropy": 7.145177888870239, "epoch": 0.09474468613604911, "grad_norm": 0.890625, "learning_rate": 0.00048637706375829955, "loss": 7.2146, "mean_token_accuracy": 0.09119046702980996, "num_tokens": 2890687.0, "step": 1335 }, { "entropy": 7.305484199523926, "epoch": 0.09509953514779461, "grad_norm": 0.95703125, "learning_rate": 0.000485970462341878, "loss": 7.2883, "mean_token_accuracy": 0.0910595864057541, "num_tokens": 2900901.0, "step": 1340 }, { "entropy": 7.299550008773804, "epoch": 0.09545438415954012, "grad_norm": 1.015625, "learning_rate": 0.00048555807706366044, "loss": 7.2978, "mean_token_accuracy": 0.09110193699598312, "num_tokens": 2912233.0, "step": 1345 }, { "entropy": 7.180187082290649, "epoch": 0.09580923317128562, "grad_norm": 1.015625, "learning_rate": 0.00048513991922939756, "loss": 7.1896, "mean_token_accuracy": 0.09826849699020386, "num_tokens": 2923002.0, "step": 1350 }, { "entropy": 7.222209358215332, "epoch": 0.09616408218303112, "grad_norm": 0.9375, "learning_rate": 0.00048471600030309744, "loss": 7.2904, "mean_token_accuracy": 0.09233295768499375, "num_tokens": 2934139.0, "step": 1355 }, { "entropy": 7.296793508529663, "epoch": 0.09651893119477663, "grad_norm": 1.03125, "learning_rate": 0.00048428633190671186, "loss": 7.264, "mean_token_accuracy": 0.09283363372087479, "num_tokens": 2945229.0, "step": 1360 }, { "entropy": 7.259587001800537, "epoch": 0.09687378020652213, "grad_norm": 0.97265625, "learning_rate": 0.0004838509258198167, "loss": 7.2666, "mean_token_accuracy": 0.09352016374468804, "num_tokens": 2956118.0, "step": 1365 }, { "entropy": 7.230564737319947, "epoch": 0.09722862921826762, "grad_norm": 0.93359375, "learning_rate": 0.00048340979397929, "loss": 7.1702, "mean_token_accuracy": 0.09822328612208367, "num_tokens": 2967120.0, "step": 1370 }, { "entropy": 7.109541511535644, "epoch": 0.09758347823001313, "grad_norm": 1.0625, "learning_rate": 0.00048296294847898386, "loss": 7.2177, "mean_token_accuracy": 0.0937571682035923, "num_tokens": 2977852.0, "step": 1375 }, { "entropy": 7.361109018325806, "epoch": 0.09793832724175863, "grad_norm": 0.96484375, "learning_rate": 0.0004825104015693934, "loss": 7.3398, "mean_token_accuracy": 0.08829166814684868, "num_tokens": 2988076.0, "step": 1380 }, { "entropy": 7.184476566314697, "epoch": 0.09829317625350413, "grad_norm": 0.90625, "learning_rate": 0.0004820521656573208, "loss": 7.1971, "mean_token_accuracy": 0.09840201437473298, "num_tokens": 2999159.0, "step": 1385 }, { "entropy": 7.314798021316529, "epoch": 0.09864802526524964, "grad_norm": 0.96484375, "learning_rate": 0.00048158825330553505, "loss": 7.2446, "mean_token_accuracy": 0.09077045172452927, "num_tokens": 3009419.0, "step": 1390 }, { "entropy": 7.1688261985778805, "epoch": 0.09900287427699514, "grad_norm": 0.875, "learning_rate": 0.00048111867723242763, "loss": 7.2273, "mean_token_accuracy": 0.09468511268496513, "num_tokens": 3020261.0, "step": 1395 }, { "entropy": 7.288452386856079, "epoch": 0.09935772328874064, "grad_norm": 0.9453125, "learning_rate": 0.0004806434503116637, "loss": 7.264, "mean_token_accuracy": 0.0897028960287571, "num_tokens": 3031118.0, "step": 1400 }, { "entropy": 7.270044612884521, "epoch": 0.09971257230048615, "grad_norm": 0.91796875, "learning_rate": 0.0004801625855718296, "loss": 7.303, "mean_token_accuracy": 0.09120242893695832, "num_tokens": 3041921.0, "step": 1405 }, { "entropy": 7.301294279098511, "epoch": 0.10006742131223165, "grad_norm": 1.0390625, "learning_rate": 0.00047967609619607477, "loss": 7.2724, "mean_token_accuracy": 0.0923406146466732, "num_tokens": 3053935.0, "step": 1410 }, { "entropy": 7.298661994934082, "epoch": 0.10042227032397714, "grad_norm": 0.984375, "learning_rate": 0.0004791839955217513, "loss": 7.2681, "mean_token_accuracy": 0.09436995908617973, "num_tokens": 3065260.0, "step": 1415 }, { "entropy": 7.141231632232666, "epoch": 0.10077711933572266, "grad_norm": 0.94140625, "learning_rate": 0.00047868629704004786, "loss": 7.212, "mean_token_accuracy": 0.09240631237626076, "num_tokens": 3076012.0, "step": 1420 }, { "entropy": 7.3381248950958256, "epoch": 0.10113196834746815, "grad_norm": 0.9375, "learning_rate": 0.00047818301439561965, "loss": 7.2001, "mean_token_accuracy": 0.09209805354475975, "num_tokens": 3086517.0, "step": 1425 }, { "entropy": 7.143636035919189, "epoch": 0.10148681735921365, "grad_norm": 0.90625, "learning_rate": 0.00047767416138621454, "loss": 7.2568, "mean_token_accuracy": 0.09073155596852303, "num_tokens": 3097511.0, "step": 1430 }, { "entropy": 7.358057594299316, "epoch": 0.10184166637095916, "grad_norm": 1.0078125, "learning_rate": 0.000477159751962295, "loss": 7.2242, "mean_token_accuracy": 0.08778738155961037, "num_tokens": 3108482.0, "step": 1435 }, { "entropy": 7.192478942871094, "epoch": 0.10219651538270466, "grad_norm": 0.83984375, "learning_rate": 0.00047663980022665507, "loss": 7.2047, "mean_token_accuracy": 0.09349827691912652, "num_tokens": 3119630.0, "step": 1440 }, { "entropy": 7.235249710083008, "epoch": 0.10255136439445016, "grad_norm": 1.0078125, "learning_rate": 0.00047611432043403437, "loss": 7.2685, "mean_token_accuracy": 0.08921699076890946, "num_tokens": 3131050.0, "step": 1445 }, { "entropy": 7.221825456619262, "epoch": 0.10290621340619566, "grad_norm": 0.96875, "learning_rate": 0.0004755833269907267, "loss": 7.2587, "mean_token_accuracy": 0.09253018423914909, "num_tokens": 3141956.0, "step": 1450 }, { "entropy": 7.341269016265869, "epoch": 0.10326106241794117, "grad_norm": 0.94140625, "learning_rate": 0.0004750468344541857, "loss": 7.2215, "mean_token_accuracy": 0.09548219069838523, "num_tokens": 3152693.0, "step": 1455 }, { "entropy": 7.267981004714966, "epoch": 0.10361591142968667, "grad_norm": 0.8984375, "learning_rate": 0.00047450485753262525, "loss": 7.2577, "mean_token_accuracy": 0.0954539954662323, "num_tokens": 3163736.0, "step": 1460 }, { "entropy": 7.165822839736938, "epoch": 0.10397076044143216, "grad_norm": 0.9375, "learning_rate": 0.00047395741108461633, "loss": 7.2569, "mean_token_accuracy": 0.08883126974105834, "num_tokens": 3175537.0, "step": 1465 }, { "entropy": 7.244705867767334, "epoch": 0.10432560945317768, "grad_norm": 0.94921875, "learning_rate": 0.00047340451011867985, "loss": 7.1729, "mean_token_accuracy": 0.09741863459348679, "num_tokens": 3185659.0, "step": 1470 }, { "entropy": 7.163289546966553, "epoch": 0.10468045846492317, "grad_norm": 0.9921875, "learning_rate": 0.00047284616979287515, "loss": 7.0888, "mean_token_accuracy": 0.10371233746409417, "num_tokens": 3196548.0, "step": 1475 }, { "entropy": 7.239425230026245, "epoch": 0.10503530747666867, "grad_norm": 0.86328125, "learning_rate": 0.00047228240541438433, "loss": 7.1853, "mean_token_accuracy": 0.09878996461629867, "num_tokens": 3207516.0, "step": 1480 }, { "entropy": 7.1664224624633786, "epoch": 0.10539015648841418, "grad_norm": 0.98828125, "learning_rate": 0.00047171323243909257, "loss": 7.2059, "mean_token_accuracy": 0.09172281622886658, "num_tokens": 3219171.0, "step": 1485 }, { "entropy": 7.128496742248535, "epoch": 0.10574500550015968, "grad_norm": 0.88671875, "learning_rate": 0.00047113866647116457, "loss": 7.1106, "mean_token_accuracy": 0.10128247514367103, "num_tokens": 3230911.0, "step": 1490 }, { "entropy": 7.15082368850708, "epoch": 0.10609985451190518, "grad_norm": 0.98828125, "learning_rate": 0.0004705587232626164, "loss": 7.2156, "mean_token_accuracy": 0.09450112357735634, "num_tokens": 3240977.0, "step": 1495 }, { "entropy": 7.310815048217774, "epoch": 0.10645470352365069, "grad_norm": 1.0390625, "learning_rate": 0.00046997341871288424, "loss": 7.2455, "mean_token_accuracy": 0.09728037863969803, "num_tokens": 3251714.0, "step": 1500 }, { "entropy": 7.228920888900757, "epoch": 0.10680955253539619, "grad_norm": 1.0546875, "learning_rate": 0.0004693827688683879, "loss": 7.2048, "mean_token_accuracy": 0.09683412909507752, "num_tokens": 3262558.0, "step": 1505 }, { "entropy": 7.222548103332519, "epoch": 0.10716440154714169, "grad_norm": 0.94140625, "learning_rate": 0.0004687867899220914, "loss": 7.1702, "mean_token_accuracy": 0.09433976039290429, "num_tokens": 3273473.0, "step": 1510 }, { "entropy": 7.1861412525177, "epoch": 0.1075192505588872, "grad_norm": 1.1015625, "learning_rate": 0.00046818549821305846, "loss": 7.2912, "mean_token_accuracy": 0.09852436482906342, "num_tokens": 3284238.0, "step": 1515 }, { "entropy": 7.240938949584961, "epoch": 0.1078740995706327, "grad_norm": 0.9140625, "learning_rate": 0.00046757891022600494, "loss": 7.1773, "mean_token_accuracy": 0.10066472664475441, "num_tokens": 3294848.0, "step": 1520 }, { "entropy": 7.1551109790802006, "epoch": 0.10822894858237819, "grad_norm": 0.890625, "learning_rate": 0.0004669670425908471, "loss": 7.1802, "mean_token_accuracy": 0.09828831255435944, "num_tokens": 3305487.0, "step": 1525 }, { "entropy": 7.182540702819824, "epoch": 0.1085837975941237, "grad_norm": 1.0390625, "learning_rate": 0.0004663499120822451, "loss": 7.1249, "mean_token_accuracy": 0.09082185253500938, "num_tokens": 3317032.0, "step": 1530 }, { "entropy": 7.226040554046631, "epoch": 0.1089386466058692, "grad_norm": 1.0078125, "learning_rate": 0.0004657275356191437, "loss": 7.1868, "mean_token_accuracy": 0.09265627264976502, "num_tokens": 3327695.0, "step": 1535 }, { "entropy": 7.1324906826019285, "epoch": 0.1092934956176147, "grad_norm": 1.0390625, "learning_rate": 0.00046509993026430804, "loss": 7.1214, "mean_token_accuracy": 0.09917151257395744, "num_tokens": 3337445.0, "step": 1540 }, { "entropy": 7.162045288085937, "epoch": 0.10964834462936021, "grad_norm": 0.9453125, "learning_rate": 0.0004644671132238558, "loss": 7.1469, "mean_token_accuracy": 0.09252285063266755, "num_tokens": 3347958.0, "step": 1545 }, { "entropy": 7.268742990493775, "epoch": 0.11000319364110571, "grad_norm": 0.9921875, "learning_rate": 0.00046382910184678585, "loss": 7.103, "mean_token_accuracy": 0.09710876047611236, "num_tokens": 3357974.0, "step": 1550 }, { "entropy": 7.088126087188721, "epoch": 0.11035804265285121, "grad_norm": 0.93359375, "learning_rate": 0.0004631859136245025, "loss": 7.1715, "mean_token_accuracy": 0.09461688697338104, "num_tokens": 3368901.0, "step": 1555 }, { "entropy": 7.292183065414429, "epoch": 0.11071289166459672, "grad_norm": 0.90234375, "learning_rate": 0.0004625375661903357, "loss": 7.1501, "mean_token_accuracy": 0.09700253531336785, "num_tokens": 3379028.0, "step": 1560 }, { "entropy": 7.114231586456299, "epoch": 0.11106774067634222, "grad_norm": 0.96875, "learning_rate": 0.00046188407731905787, "loss": 7.2125, "mean_token_accuracy": 0.0952233262360096, "num_tokens": 3389688.0, "step": 1565 }, { "entropy": 7.312720584869385, "epoch": 0.11142258968808771, "grad_norm": 0.921875, "learning_rate": 0.00046122546492639643, "loss": 7.2162, "mean_token_accuracy": 0.0928651139140129, "num_tokens": 3400782.0, "step": 1570 }, { "entropy": 7.103663063049316, "epoch": 0.11177743869983323, "grad_norm": 0.8984375, "learning_rate": 0.000460561747068543, "loss": 7.1171, "mean_token_accuracy": 0.0949582502245903, "num_tokens": 3412404.0, "step": 1575 }, { "entropy": 7.07365198135376, "epoch": 0.11213228771157872, "grad_norm": 0.89453125, "learning_rate": 0.0004598929419416578, "loss": 7.1578, "mean_token_accuracy": 0.09038265198469161, "num_tokens": 3424129.0, "step": 1580 }, { "entropy": 7.2252601146697994, "epoch": 0.11248713672332422, "grad_norm": 0.984375, "learning_rate": 0.00045921906788137123, "loss": 7.1011, "mean_token_accuracy": 0.09262050092220306, "num_tokens": 3436570.0, "step": 1585 }, { "entropy": 7.137156534194946, "epoch": 0.11284198573506973, "grad_norm": 0.9921875, "learning_rate": 0.00045854014336228115, "loss": 7.1351, "mean_token_accuracy": 0.09676287397742271, "num_tokens": 3447222.0, "step": 1590 }, { "entropy": 7.170758247375488, "epoch": 0.11319683474681523, "grad_norm": 0.8671875, "learning_rate": 0.00045785618699744615, "loss": 7.1081, "mean_token_accuracy": 0.096658343821764, "num_tokens": 3458921.0, "step": 1595 }, { "entropy": 7.246716260910034, "epoch": 0.11355168375856073, "grad_norm": 0.9765625, "learning_rate": 0.00045716721753787543, "loss": 7.2579, "mean_token_accuracy": 0.08915452212095261, "num_tokens": 3470065.0, "step": 1600 }, { "entropy": 7.13914909362793, "epoch": 0.11390653277030624, "grad_norm": 0.9375, "learning_rate": 0.0004564732538720148, "loss": 7.0704, "mean_token_accuracy": 0.10325511917471886, "num_tokens": 3481062.0, "step": 1605 }, { "entropy": 7.162566661834717, "epoch": 0.11426138178205174, "grad_norm": 0.88671875, "learning_rate": 0.00045577431502522877, "loss": 7.0767, "mean_token_accuracy": 0.09748337939381599, "num_tokens": 3491586.0, "step": 1610 }, { "entropy": 7.1580146789550785, "epoch": 0.11461623079379724, "grad_norm": 0.9453125, "learning_rate": 0.0004550704201592787, "loss": 7.1824, "mean_token_accuracy": 0.0963168665766716, "num_tokens": 3502367.0, "step": 1615 }, { "entropy": 7.106345272064209, "epoch": 0.11497107980554275, "grad_norm": 0.94921875, "learning_rate": 0.0004543615885717981, "loss": 7.0516, "mean_token_accuracy": 0.10276207253336907, "num_tokens": 3512114.0, "step": 1620 }, { "entropy": 7.237199068069458, "epoch": 0.11532592881728825, "grad_norm": 1.015625, "learning_rate": 0.00045364783969576296, "loss": 7.2058, "mean_token_accuracy": 0.09948946833610535, "num_tokens": 3522954.0, "step": 1625 }, { "entropy": 7.1651527881622314, "epoch": 0.11568077782903374, "grad_norm": 0.9375, "learning_rate": 0.0004529291930989592, "loss": 7.1538, "mean_token_accuracy": 0.09592896923422814, "num_tokens": 3533205.0, "step": 1630 }, { "entropy": 7.125106525421143, "epoch": 0.11603562684077925, "grad_norm": 0.94921875, "learning_rate": 0.0004522056684834464, "loss": 7.058, "mean_token_accuracy": 0.0978856511414051, "num_tokens": 3542901.0, "step": 1635 }, { "entropy": 7.144106674194336, "epoch": 0.11639047585252475, "grad_norm": 0.96484375, "learning_rate": 0.0004514772856850173, "loss": 7.1462, "mean_token_accuracy": 0.09332720711827278, "num_tokens": 3554141.0, "step": 1640 }, { "entropy": 7.1256311416625975, "epoch": 0.11674532486427025, "grad_norm": 0.94921875, "learning_rate": 0.0004507440646726542, "loss": 7.0938, "mean_token_accuracy": 0.10101081579923629, "num_tokens": 3566074.0, "step": 1645 }, { "entropy": 7.188183689117432, "epoch": 0.11710017387601576, "grad_norm": 0.9296875, "learning_rate": 0.0004500060255479818, "loss": 7.1298, "mean_token_accuracy": 0.09676677137613296, "num_tokens": 3576939.0, "step": 1650 }, { "entropy": 7.127859163284302, "epoch": 0.11745502288776126, "grad_norm": 0.9140625, "learning_rate": 0.0004492631885447151, "loss": 7.1605, "mean_token_accuracy": 0.09790143445134163, "num_tokens": 3587871.0, "step": 1655 }, { "entropy": 7.06299614906311, "epoch": 0.11780987189950676, "grad_norm": 0.984375, "learning_rate": 0.00044851557402810616, "loss": 7.0346, "mean_token_accuracy": 0.10373768284916877, "num_tokens": 3597597.0, "step": 1660 }, { "entropy": 7.241457796096801, "epoch": 0.11816472091125227, "grad_norm": 1.0078125, "learning_rate": 0.00044776320249438444, "loss": 7.1148, "mean_token_accuracy": 0.09652233868837357, "num_tokens": 3607646.0, "step": 1665 }, { "entropy": 7.178923034667969, "epoch": 0.11851956992299777, "grad_norm": 0.93359375, "learning_rate": 0.00044700609457019565, "loss": 7.1293, "mean_token_accuracy": 0.09854810833930969, "num_tokens": 3618795.0, "step": 1670 }, { "entropy": 7.151714897155761, "epoch": 0.11887441893474326, "grad_norm": 1.34375, "learning_rate": 0.0004462442710120359, "loss": 7.1202, "mean_token_accuracy": 0.09609093591570854, "num_tokens": 3629347.0, "step": 1675 }, { "entropy": 7.126868963241577, "epoch": 0.11922926794648876, "grad_norm": 0.94921875, "learning_rate": 0.000445477752705683, "loss": 7.0511, "mean_token_accuracy": 0.09984703361988068, "num_tokens": 3638849.0, "step": 1680 }, { "entropy": 7.176082944869995, "epoch": 0.11958411695823427, "grad_norm": 0.9609375, "learning_rate": 0.00044470656066562336, "loss": 7.1147, "mean_token_accuracy": 0.10202176421880722, "num_tokens": 3649630.0, "step": 1685 }, { "entropy": 7.105949640274048, "epoch": 0.11993896596997977, "grad_norm": 0.8515625, "learning_rate": 0.0004439307160344765, "loss": 7.165, "mean_token_accuracy": 0.09765942394733429, "num_tokens": 3660885.0, "step": 1690 }, { "entropy": 7.150793170928955, "epoch": 0.12029381498172527, "grad_norm": 1.328125, "learning_rate": 0.00044315024008241473, "loss": 7.1008, "mean_token_accuracy": 0.09718259535729885, "num_tokens": 3672714.0, "step": 1695 }, { "entropy": 7.211589431762695, "epoch": 0.12064866399347078, "grad_norm": 1.0, "learning_rate": 0.0004423651542065806, "loss": 7.0464, "mean_token_accuracy": 0.09509608298540115, "num_tokens": 3683393.0, "step": 1700 }, { "entropy": 7.014157676696778, "epoch": 0.12100351300521628, "grad_norm": 0.9453125, "learning_rate": 0.00044157547993050006, "loss": 7.1575, "mean_token_accuracy": 0.09731999039649963, "num_tokens": 3694158.0, "step": 1705 }, { "entropy": 7.235012865066528, "epoch": 0.12135836201696178, "grad_norm": 0.9921875, "learning_rate": 0.00044078123890349227, "loss": 7.0723, "mean_token_accuracy": 0.10333672091364861, "num_tokens": 3704334.0, "step": 1710 }, { "entropy": 7.064513492584228, "epoch": 0.12171321102870729, "grad_norm": 0.96484375, "learning_rate": 0.00043998245290007606, "loss": 7.0853, "mean_token_accuracy": 0.10058822184801101, "num_tokens": 3714492.0, "step": 1715 }, { "entropy": 7.091410732269287, "epoch": 0.12206806004045279, "grad_norm": 0.92578125, "learning_rate": 0.00043917914381937323, "loss": 7.0897, "mean_token_accuracy": 0.08864482194185257, "num_tokens": 3726138.0, "step": 1720 }, { "entropy": 7.256516599655152, "epoch": 0.12242290905219828, "grad_norm": 0.98046875, "learning_rate": 0.00043837133368450815, "loss": 7.1157, "mean_token_accuracy": 0.09941046983003617, "num_tokens": 3735382.0, "step": 1725 }, { "entropy": 7.111510515213013, "epoch": 0.1227777580639438, "grad_norm": 0.9921875, "learning_rate": 0.0004375590446420037, "loss": 7.0708, "mean_token_accuracy": 0.0973458357155323, "num_tokens": 3746160.0, "step": 1730 }, { "entropy": 7.065353298187256, "epoch": 0.1231326070756893, "grad_norm": 0.8671875, "learning_rate": 0.0004367422989611743, "loss": 7.0785, "mean_token_accuracy": 0.09655671492218972, "num_tokens": 3757679.0, "step": 1735 }, { "entropy": 7.209886121749878, "epoch": 0.12348745608743479, "grad_norm": 0.95703125, "learning_rate": 0.0004359211190335153, "loss": 7.084, "mean_token_accuracy": 0.09250145927071571, "num_tokens": 3767514.0, "step": 1740 }, { "entropy": 7.113470029830933, "epoch": 0.1238423050991803, "grad_norm": 0.9296875, "learning_rate": 0.00043509552737208923, "loss": 7.0898, "mean_token_accuracy": 0.09914448335766793, "num_tokens": 3778396.0, "step": 1745 }, { "entropy": 7.160091066360474, "epoch": 0.1241971541109258, "grad_norm": 0.9140625, "learning_rate": 0.00043426554661090853, "loss": 7.1196, "mean_token_accuracy": 0.09739524349570275, "num_tokens": 3789351.0, "step": 1750 }, { "entropy": 7.046756172180176, "epoch": 0.1245520031226713, "grad_norm": 1.046875, "learning_rate": 0.00043343119950431516, "loss": 7.0865, "mean_token_accuracy": 0.09295786619186401, "num_tokens": 3799709.0, "step": 1755 }, { "entropy": 7.234890604019165, "epoch": 0.12490685213441681, "grad_norm": 1.015625, "learning_rate": 0.00043259250892635644, "loss": 7.0903, "mean_token_accuracy": 0.09519705399870873, "num_tokens": 3810633.0, "step": 1760 }, { "entropy": 7.040793085098267, "epoch": 0.1252617011461623, "grad_norm": 0.94140625, "learning_rate": 0.0004317494978701582, "loss": 7.1194, "mean_token_accuracy": 0.09463633596897125, "num_tokens": 3821984.0, "step": 1765 }, { "entropy": 7.0925640106201175, "epoch": 0.12561655015790782, "grad_norm": 1.0390625, "learning_rate": 0.0004309021894472943, "loss": 7.0725, "mean_token_accuracy": 0.10138425305485725, "num_tokens": 3832488.0, "step": 1770 }, { "entropy": 7.049199962615967, "epoch": 0.1259713991696533, "grad_norm": 0.99609375, "learning_rate": 0.0004300506068871534, "loss": 6.9459, "mean_token_accuracy": 0.11415167003870011, "num_tokens": 3842329.0, "step": 1775 }, { "entropy": 7.090542364120483, "epoch": 0.12632624818139881, "grad_norm": 0.92578125, "learning_rate": 0.00042919477353630135, "loss": 7.0909, "mean_token_accuracy": 0.10182333439588546, "num_tokens": 3853585.0, "step": 1780 }, { "entropy": 7.182557058334351, "epoch": 0.12668109719314433, "grad_norm": 1.03125, "learning_rate": 0.000428334712857842, "loss": 7.0519, "mean_token_accuracy": 0.1040547601878643, "num_tokens": 3863538.0, "step": 1785 }, { "entropy": 7.089897584915161, "epoch": 0.1270359462048898, "grad_norm": 1.0859375, "learning_rate": 0.00042747044843077304, "loss": 7.1704, "mean_token_accuracy": 0.09324254468083382, "num_tokens": 3874277.0, "step": 1790 }, { "entropy": 7.142627429962158, "epoch": 0.12739079521663532, "grad_norm": 0.94140625, "learning_rate": 0.00042660200394934047, "loss": 7.0251, "mean_token_accuracy": 0.10115873888134956, "num_tokens": 3884591.0, "step": 1795 }, { "entropy": 7.1000548839569095, "epoch": 0.12774564422838083, "grad_norm": 0.95703125, "learning_rate": 0.00042572940322238844, "loss": 7.1397, "mean_token_accuracy": 0.09500750824809075, "num_tokens": 3895199.0, "step": 1800 }, { "entropy": 7.094432258605957, "epoch": 0.12810049324012632, "grad_norm": 0.92578125, "learning_rate": 0.00042485267017270664, "loss": 6.9529, "mean_token_accuracy": 0.10029699578881264, "num_tokens": 3907047.0, "step": 1805 }, { "entropy": 7.037583446502685, "epoch": 0.12845534225187183, "grad_norm": 1.09375, "learning_rate": 0.0004239718288363745, "loss": 7.0352, "mean_token_accuracy": 0.10667306259274482, "num_tokens": 3918385.0, "step": 1810 }, { "entropy": 7.121558809280396, "epoch": 0.12881019126361734, "grad_norm": 1.0234375, "learning_rate": 0.0004230869033621023, "loss": 7.0685, "mean_token_accuracy": 0.10168422237038613, "num_tokens": 3928468.0, "step": 1815 }, { "entropy": 7.143169403076172, "epoch": 0.12916504027536282, "grad_norm": 0.91796875, "learning_rate": 0.0004221979180105688, "loss": 7.0534, "mean_token_accuracy": 0.09920291230082512, "num_tokens": 3939530.0, "step": 1820 }, { "entropy": 7.0373697757720945, "epoch": 0.12951988928710834, "grad_norm": 0.87109375, "learning_rate": 0.00042130489715375645, "loss": 7.0355, "mean_token_accuracy": 0.0987101249396801, "num_tokens": 3950146.0, "step": 1825 }, { "entropy": 7.019313764572144, "epoch": 0.12987473829885385, "grad_norm": 0.8671875, "learning_rate": 0.00042040786527428335, "loss": 7.0325, "mean_token_accuracy": 0.0973743423819542, "num_tokens": 3961499.0, "step": 1830 }, { "entropy": 7.121405696868896, "epoch": 0.13022958731059933, "grad_norm": 0.92578125, "learning_rate": 0.0004195068469647315, "loss": 7.0472, "mean_token_accuracy": 0.10192081406712532, "num_tokens": 3972724.0, "step": 1835 }, { "entropy": 7.079566621780396, "epoch": 0.13058443632234484, "grad_norm": 0.90234375, "learning_rate": 0.00041860186692697297, "loss": 7.0077, "mean_token_accuracy": 0.1040501557290554, "num_tokens": 3983457.0, "step": 1840 }, { "entropy": 7.119902420043945, "epoch": 0.13093928533409036, "grad_norm": 0.9453125, "learning_rate": 0.00041769294997149264, "loss": 7.0384, "mean_token_accuracy": 0.09878516718745231, "num_tokens": 3994581.0, "step": 1845 }, { "entropy": 7.0431475162506105, "epoch": 0.13129413434583584, "grad_norm": 0.93359375, "learning_rate": 0.0004167801210167081, "loss": 7.054, "mean_token_accuracy": 0.10154439359903336, "num_tokens": 4005940.0, "step": 1850 }, { "entropy": 7.145562553405762, "epoch": 0.13164898335758135, "grad_norm": 0.96484375, "learning_rate": 0.0004158634050882861, "loss": 7.0096, "mean_token_accuracy": 0.109462571144104, "num_tokens": 4015961.0, "step": 1855 }, { "entropy": 7.093667459487915, "epoch": 0.13200383236932686, "grad_norm": 1.078125, "learning_rate": 0.0004149428273184569, "loss": 7.0528, "mean_token_accuracy": 0.10200647190213204, "num_tokens": 4025498.0, "step": 1860 }, { "entropy": 7.101914739608764, "epoch": 0.13235868138107235, "grad_norm": 0.90625, "learning_rate": 0.0004140184129453253, "loss": 7.021, "mean_token_accuracy": 0.09907697066664696, "num_tokens": 4036123.0, "step": 1865 }, { "entropy": 7.147734260559082, "epoch": 0.13271353039281786, "grad_norm": 0.890625, "learning_rate": 0.000413090187312178, "loss": 7.0086, "mean_token_accuracy": 0.10064524784684181, "num_tokens": 4046915.0, "step": 1870 }, { "entropy": 7.052229022979736, "epoch": 0.13306837940456337, "grad_norm": 0.953125, "learning_rate": 0.0004121581758667898, "loss": 7.0852, "mean_token_accuracy": 0.09829342514276504, "num_tokens": 4058050.0, "step": 1875 }, { "entropy": 7.142696905136108, "epoch": 0.13342322841630885, "grad_norm": 1.0234375, "learning_rate": 0.00041122240416072533, "loss": 7.0328, "mean_token_accuracy": 0.1022889830172062, "num_tokens": 4069184.0, "step": 1880 }, { "entropy": 7.088444232940674, "epoch": 0.13377807742805436, "grad_norm": 0.96875, "learning_rate": 0.0004102828978486385, "loss": 7.0415, "mean_token_accuracy": 0.10254081562161446, "num_tokens": 4079140.0, "step": 1885 }, { "entropy": 7.028472805023194, "epoch": 0.13413292643979988, "grad_norm": 0.98046875, "learning_rate": 0.0004093396826875695, "loss": 6.973, "mean_token_accuracy": 0.10482171401381493, "num_tokens": 4088905.0, "step": 1890 }, { "entropy": 7.023287677764893, "epoch": 0.13448777545154536, "grad_norm": 0.9765625, "learning_rate": 0.00040839278453623837, "loss": 7.0046, "mean_token_accuracy": 0.10013890415430068, "num_tokens": 4099425.0, "step": 1895 }, { "entropy": 7.070297384262085, "epoch": 0.13484262446329087, "grad_norm": 0.98046875, "learning_rate": 0.0004074422293543363, "loss": 6.9933, "mean_token_accuracy": 0.10154245495796203, "num_tokens": 4109313.0, "step": 1900 }, { "entropy": 7.08957085609436, "epoch": 0.13519747347503638, "grad_norm": 0.89453125, "learning_rate": 0.0004064880432018137, "loss": 7.0308, "mean_token_accuracy": 0.1028820551931858, "num_tokens": 4120326.0, "step": 1905 }, { "entropy": 7.095383787155152, "epoch": 0.13555232248678187, "grad_norm": 0.96484375, "learning_rate": 0.00040553025223816615, "loss": 7.0657, "mean_token_accuracy": 0.10205548778176307, "num_tokens": 4131001.0, "step": 1910 }, { "entropy": 7.074268007278443, "epoch": 0.13590717149852738, "grad_norm": 0.91015625, "learning_rate": 0.00040456888272171653, "loss": 7.0221, "mean_token_accuracy": 0.10284601524472237, "num_tokens": 4142565.0, "step": 1915 }, { "entropy": 7.059752988815307, "epoch": 0.1362620205102729, "grad_norm": 1.0078125, "learning_rate": 0.00040360396100889577, "loss": 7.0084, "mean_token_accuracy": 0.09651347175240517, "num_tokens": 4153453.0, "step": 1920 }, { "entropy": 7.082843971252442, "epoch": 0.13661686952201837, "grad_norm": 0.89453125, "learning_rate": 0.0004026355135535202, "loss": 7.0471, "mean_token_accuracy": 0.10347581580281258, "num_tokens": 4164445.0, "step": 1925 }, { "entropy": 7.052491092681885, "epoch": 0.1369717185337639, "grad_norm": 0.94140625, "learning_rate": 0.000401663566906066, "loss": 6.9734, "mean_token_accuracy": 0.10101649984717369, "num_tokens": 4175221.0, "step": 1930 }, { "entropy": 7.1004551410675045, "epoch": 0.1373265675455094, "grad_norm": 0.9296875, "learning_rate": 0.00040068814771294134, "loss": 6.9814, "mean_token_accuracy": 0.09965018033981324, "num_tokens": 4185686.0, "step": 1935 }, { "entropy": 6.955038690567017, "epoch": 0.13768141655725488, "grad_norm": 0.95703125, "learning_rate": 0.0003997092827157562, "loss": 6.9261, "mean_token_accuracy": 0.10875649526715278, "num_tokens": 4196217.0, "step": 1940 }, { "entropy": 7.081155776977539, "epoch": 0.1380362655690004, "grad_norm": 1.03125, "learning_rate": 0.000398726998750589, "loss": 7.064, "mean_token_accuracy": 0.10312055200338363, "num_tokens": 4206820.0, "step": 1945 }, { "entropy": 7.1204061031341555, "epoch": 0.1383911145807459, "grad_norm": 0.9296875, "learning_rate": 0.00039774132274725076, "loss": 7.0435, "mean_token_accuracy": 0.10409965664148331, "num_tokens": 4217855.0, "step": 1950 }, { "entropy": 7.0895867347717285, "epoch": 0.1387459635924914, "grad_norm": 0.94921875, "learning_rate": 0.00039675228172854707, "loss": 7.0694, "mean_token_accuracy": 0.09884442016482353, "num_tokens": 4229654.0, "step": 1955 }, { "entropy": 7.1512257099151615, "epoch": 0.1391008126042369, "grad_norm": 1.078125, "learning_rate": 0.0003957599028095371, "loss": 6.9793, "mean_token_accuracy": 0.10423392802476883, "num_tokens": 4240929.0, "step": 1960 }, { "entropy": 7.06306209564209, "epoch": 0.1394556616159824, "grad_norm": 0.9765625, "learning_rate": 0.00039476421319679017, "loss": 7.0795, "mean_token_accuracy": 0.10174657627940178, "num_tokens": 4252605.0, "step": 1965 }, { "entropy": 7.071248960494995, "epoch": 0.1398105106277279, "grad_norm": 0.91796875, "learning_rate": 0.00039376524018764, "loss": 6.9608, "mean_token_accuracy": 0.10477321967482567, "num_tokens": 4263690.0, "step": 1970 }, { "entropy": 7.039036417007447, "epoch": 0.1401653596394734, "grad_norm": 0.95703125, "learning_rate": 0.00039276301116943616, "loss": 6.986, "mean_token_accuracy": 0.09907544031739235, "num_tokens": 4274662.0, "step": 1975 }, { "entropy": 7.023434638977051, "epoch": 0.14052020865121892, "grad_norm": 0.984375, "learning_rate": 0.0003917575536187936, "loss": 6.9599, "mean_token_accuracy": 0.10383629649877549, "num_tokens": 4286231.0, "step": 1980 }, { "entropy": 7.086272573471069, "epoch": 0.1408750576629644, "grad_norm": 0.9921875, "learning_rate": 0.00039074889510083894, "loss": 6.9781, "mean_token_accuracy": 0.1037204198539257, "num_tokens": 4297489.0, "step": 1985 }, { "entropy": 7.031176328659058, "epoch": 0.14122990667470992, "grad_norm": 0.9453125, "learning_rate": 0.00038973706326845495, "loss": 7.0469, "mean_token_accuracy": 0.10251927375793457, "num_tokens": 4308164.0, "step": 1990 }, { "entropy": 7.13521671295166, "epoch": 0.14158475568645543, "grad_norm": 0.90234375, "learning_rate": 0.0003887220858615225, "loss": 7.0006, "mean_token_accuracy": 0.10318920761346817, "num_tokens": 4319209.0, "step": 1995 }, { "entropy": 6.968696165084839, "epoch": 0.1419396046982009, "grad_norm": 1.015625, "learning_rate": 0.0003877039907061597, "loss": 6.9492, "mean_token_accuracy": 0.10085738375782967, "num_tokens": 4329816.0, "step": 2000 }, { "entropy": 7.155592060089111, "epoch": 0.14229445370994642, "grad_norm": 1.0, "learning_rate": 0.0003866828057139598, "loss": 7.0195, "mean_token_accuracy": 0.10258031487464905, "num_tokens": 4340752.0, "step": 2005 }, { "entropy": 7.004485082626343, "epoch": 0.1426493027216919, "grad_norm": 0.9609375, "learning_rate": 0.00038565855888122503, "loss": 6.9452, "mean_token_accuracy": 0.10718585550785065, "num_tokens": 4352299.0, "step": 2010 }, { "entropy": 7.016558504104614, "epoch": 0.14300415173343742, "grad_norm": 0.87890625, "learning_rate": 0.00038463127828819975, "loss": 6.9894, "mean_token_accuracy": 0.10042356625199318, "num_tokens": 4363314.0, "step": 2015 }, { "entropy": 7.06671667098999, "epoch": 0.14335900074518293, "grad_norm": 0.94140625, "learning_rate": 0.00038360099209830043, "loss": 6.9807, "mean_token_accuracy": 0.094207713752985, "num_tokens": 4374741.0, "step": 2020 }, { "entropy": 7.052701568603515, "epoch": 0.1437138497569284, "grad_norm": 0.94921875, "learning_rate": 0.0003825677285573433, "loss": 6.9085, "mean_token_accuracy": 0.10400079190731049, "num_tokens": 4385496.0, "step": 2025 }, { "entropy": 6.985438394546509, "epoch": 0.14406869876867393, "grad_norm": 0.9609375, "learning_rate": 0.00038153151599277027, "loss": 7.0456, "mean_token_accuracy": 0.0999737560749054, "num_tokens": 4396411.0, "step": 2030 }, { "entropy": 7.02910966873169, "epoch": 0.14442354778041944, "grad_norm": 0.97265625, "learning_rate": 0.0003804923828128723, "loss": 6.931, "mean_token_accuracy": 0.10462129339575768, "num_tokens": 4406299.0, "step": 2035 }, { "entropy": 6.981289100646973, "epoch": 0.14477839679216492, "grad_norm": 0.8984375, "learning_rate": 0.0003794503575060104, "loss": 6.9247, "mean_token_accuracy": 0.10906698405742646, "num_tokens": 4417843.0, "step": 2040 }, { "entropy": 7.01538462638855, "epoch": 0.14513324580391043, "grad_norm": 0.9921875, "learning_rate": 0.00037840546863983484, "loss": 6.9303, "mean_token_accuracy": 0.10332909226417542, "num_tokens": 4428402.0, "step": 2045 }, { "entropy": 6.98654146194458, "epoch": 0.14548809481565594, "grad_norm": 1.1015625, "learning_rate": 0.0003773577448605015, "loss": 6.9306, "mean_token_accuracy": 0.10650690644979477, "num_tokens": 4439179.0, "step": 2050 }, { "entropy": 7.098060894012451, "epoch": 0.14584294382740143, "grad_norm": 1.0, "learning_rate": 0.0003763072148918872, "loss": 7.0222, "mean_token_accuracy": 0.10229001268744468, "num_tokens": 4450220.0, "step": 2055 }, { "entropy": 7.02388334274292, "epoch": 0.14619779283914694, "grad_norm": 0.95703125, "learning_rate": 0.0003752539075348017, "loss": 6.9459, "mean_token_accuracy": 0.09994500055909157, "num_tokens": 4460861.0, "step": 2060 }, { "entropy": 7.0822837352752686, "epoch": 0.14655264185089245, "grad_norm": 0.92578125, "learning_rate": 0.00037419785166619817, "loss": 6.9768, "mean_token_accuracy": 0.10057543143630028, "num_tokens": 4472241.0, "step": 2065 }, { "entropy": 7.131308603286743, "epoch": 0.14690749086263793, "grad_norm": 0.921875, "learning_rate": 0.0003731390762383818, "loss": 7.0109, "mean_token_accuracy": 0.099363424628973, "num_tokens": 4483682.0, "step": 2070 }, { "entropy": 7.054377174377441, "epoch": 0.14726233987438345, "grad_norm": 0.98828125, "learning_rate": 0.0003720776102782158, "loss": 6.9847, "mean_token_accuracy": 0.10540137887001037, "num_tokens": 4494175.0, "step": 2075 }, { "entropy": 6.972439384460449, "epoch": 0.14761718888612896, "grad_norm": 0.93359375, "learning_rate": 0.00037101348288632555, "loss": 6.7905, "mean_token_accuracy": 0.09852890223264694, "num_tokens": 4504781.0, "step": 2080 }, { "entropy": 7.004600477218628, "epoch": 0.14797203789787444, "grad_norm": 1.0078125, "learning_rate": 0.0003699467232363012, "loss": 6.9715, "mean_token_accuracy": 0.09647675678133964, "num_tokens": 4516246.0, "step": 2085 }, { "entropy": 7.0212174415588375, "epoch": 0.14832688690961995, "grad_norm": 1.0, "learning_rate": 0.0003688773605738973, "loss": 6.8931, "mean_token_accuracy": 0.10757157430052758, "num_tokens": 4526678.0, "step": 2090 }, { "entropy": 6.9830567836761475, "epoch": 0.14868173592136547, "grad_norm": 1.109375, "learning_rate": 0.00036780542421623134, "loss": 6.9876, "mean_token_accuracy": 0.10509380027651787, "num_tokens": 4537554.0, "step": 2095 }, { "entropy": 6.98748779296875, "epoch": 0.14903658493311095, "grad_norm": 0.94140625, "learning_rate": 0.0003667309435509802, "loss": 6.9897, "mean_token_accuracy": 0.09809067100286484, "num_tokens": 4548226.0, "step": 2100 }, { "entropy": 7.235601758956909, "epoch": 0.14939143394485646, "grad_norm": 0.94921875, "learning_rate": 0.0003656539480355741, "loss": 7.0464, "mean_token_accuracy": 0.09804995954036713, "num_tokens": 4560836.0, "step": 2105 }, { "entropy": 7.032708978652954, "epoch": 0.14974628295660197, "grad_norm": 0.97265625, "learning_rate": 0.0003645744671963891, "loss": 6.9384, "mean_token_accuracy": 0.10675909146666526, "num_tokens": 4572473.0, "step": 2110 }, { "entropy": 6.9664177894592285, "epoch": 0.15010113196834746, "grad_norm": 0.95703125, "learning_rate": 0.0003634925306279376, "loss": 6.995, "mean_token_accuracy": 0.09995530992746353, "num_tokens": 4584029.0, "step": 2115 }, { "entropy": 7.070379304885864, "epoch": 0.15045598098009297, "grad_norm": 0.91015625, "learning_rate": 0.0003624081679920574, "loss": 6.9981, "mean_token_accuracy": 0.09843715131282807, "num_tokens": 4595539.0, "step": 2120 }, { "entropy": 7.080266904830933, "epoch": 0.15081082999183848, "grad_norm": 1.2265625, "learning_rate": 0.0003613214090170977, "loss": 6.9609, "mean_token_accuracy": 0.10313019677996635, "num_tokens": 4606914.0, "step": 2125 }, { "entropy": 7.061946630477905, "epoch": 0.15116567900358396, "grad_norm": 0.86328125, "learning_rate": 0.0003602322834971048, "loss": 6.9116, "mean_token_accuracy": 0.10261239334940911, "num_tokens": 4618100.0, "step": 2130 }, { "entropy": 6.969537210464478, "epoch": 0.15152052801532948, "grad_norm": 0.94921875, "learning_rate": 0.0003591408212910051, "loss": 6.925, "mean_token_accuracy": 0.1127280555665493, "num_tokens": 4628896.0, "step": 2135 }, { "entropy": 7.063964605331421, "epoch": 0.151875377027075, "grad_norm": 1.0078125, "learning_rate": 0.0003580470523217863, "loss": 6.9457, "mean_token_accuracy": 0.10601773262023925, "num_tokens": 4639280.0, "step": 2140 }, { "entropy": 6.949308109283447, "epoch": 0.15223022603882047, "grad_norm": 0.92578125, "learning_rate": 0.0003569510065756771, "loss": 6.8887, "mean_token_accuracy": 0.10163175389170646, "num_tokens": 4649687.0, "step": 2145 }, { "entropy": 7.031176376342773, "epoch": 0.15258507505056598, "grad_norm": 0.8984375, "learning_rate": 0.0003558527141013254, "loss": 6.9478, "mean_token_accuracy": 0.10624543651938438, "num_tokens": 4661721.0, "step": 2150 }, { "entropy": 7.0959258556365965, "epoch": 0.1529399240623115, "grad_norm": 1.0078125, "learning_rate": 0.0003547522050089742, "loss": 6.9916, "mean_token_accuracy": 0.09919418841600418, "num_tokens": 4673648.0, "step": 2155 }, { "entropy": 7.012122440338135, "epoch": 0.15329477307405698, "grad_norm": 0.90625, "learning_rate": 0.00035364950946963606, "loss": 6.9773, "mean_token_accuracy": 0.10032318979501724, "num_tokens": 4684786.0, "step": 2160 }, { "entropy": 7.042158746719361, "epoch": 0.1536496220858025, "grad_norm": 0.9140625, "learning_rate": 0.0003525446577142663, "loss": 6.9531, "mean_token_accuracy": 0.09853310063481331, "num_tokens": 4695353.0, "step": 2165 }, { "entropy": 6.978724813461303, "epoch": 0.154004471097548, "grad_norm": 0.97265625, "learning_rate": 0.00035143768003293395, "loss": 6.8553, "mean_token_accuracy": 0.11324087306857109, "num_tokens": 4705719.0, "step": 2170 }, { "entropy": 7.0046632289886475, "epoch": 0.15435932010929349, "grad_norm": 0.87890625, "learning_rate": 0.0003503286067739913, "loss": 7.0269, "mean_token_accuracy": 0.09866114109754562, "num_tokens": 4718978.0, "step": 2175 }, { "entropy": 7.1116374969482425, "epoch": 0.154714169121039, "grad_norm": 1.0078125, "learning_rate": 0.00034921746834324193, "loss": 6.88, "mean_token_accuracy": 0.11316526606678963, "num_tokens": 4729099.0, "step": 2180 }, { "entropy": 6.8555004596710205, "epoch": 0.1550690181327845, "grad_norm": 0.92578125, "learning_rate": 0.0003481042952031072, "loss": 6.9688, "mean_token_accuracy": 0.09804181829094887, "num_tokens": 4740508.0, "step": 2185 }, { "entropy": 7.0752723693847654, "epoch": 0.15542386714453, "grad_norm": 0.91015625, "learning_rate": 0.0003469891178717911, "loss": 6.8949, "mean_token_accuracy": 0.11416682377457618, "num_tokens": 4752142.0, "step": 2190 }, { "entropy": 7.102331590652466, "epoch": 0.1557787161562755, "grad_norm": 0.98046875, "learning_rate": 0.0003458719669224436, "loss": 6.9794, "mean_token_accuracy": 0.10389717966318131, "num_tokens": 4762708.0, "step": 2195 }, { "entropy": 6.950309753417969, "epoch": 0.15613356516802102, "grad_norm": 0.8984375, "learning_rate": 0.0003447528729823221, "loss": 6.8937, "mean_token_accuracy": 0.11124820932745934, "num_tokens": 4773239.0, "step": 2200 }, { "entropy": 6.958485841751099, "epoch": 0.1564884141797665, "grad_norm": 1.0546875, "learning_rate": 0.0003436318667319525, "loss": 6.8641, "mean_token_accuracy": 0.10944292694330215, "num_tokens": 4783489.0, "step": 2205 }, { "entropy": 6.992775583267212, "epoch": 0.156843263191512, "grad_norm": 0.98046875, "learning_rate": 0.00034250897890428716, "loss": 6.8619, "mean_token_accuracy": 0.11418202966451645, "num_tokens": 4794425.0, "step": 2210 }, { "entropy": 7.0300380229949955, "epoch": 0.15719811220325752, "grad_norm": 0.85546875, "learning_rate": 0.0003413842402838633, "loss": 6.9179, "mean_token_accuracy": 0.10028508976101876, "num_tokens": 4806391.0, "step": 2215 }, { "entropy": 6.990481758117676, "epoch": 0.157552961215003, "grad_norm": 1.0859375, "learning_rate": 0.00034025768170595834, "loss": 6.8839, "mean_token_accuracy": 0.10272055044770241, "num_tokens": 4816689.0, "step": 2220 }, { "entropy": 7.015410566329956, "epoch": 0.15790781022674852, "grad_norm": 1.09375, "learning_rate": 0.0003391293340557446, "loss": 6.9709, "mean_token_accuracy": 0.09755917191505432, "num_tokens": 4827892.0, "step": 2225 }, { "entropy": 7.008429431915284, "epoch": 0.15826265923849403, "grad_norm": 0.98828125, "learning_rate": 0.0003379992282674431, "loss": 6.8583, "mean_token_accuracy": 0.11253580972552299, "num_tokens": 4838174.0, "step": 2230 }, { "entropy": 7.028060054779052, "epoch": 0.15861750825023951, "grad_norm": 1.078125, "learning_rate": 0.0003368673953234749, "loss": 6.9501, "mean_token_accuracy": 0.10639444887638091, "num_tokens": 4849390.0, "step": 2235 }, { "entropy": 7.012446880340576, "epoch": 0.15897235726198503, "grad_norm": 1.0703125, "learning_rate": 0.00033573386625361176, "loss": 6.9322, "mean_token_accuracy": 0.1081770859658718, "num_tokens": 4859130.0, "step": 2240 }, { "entropy": 6.958835411071777, "epoch": 0.15932720627373054, "grad_norm": 0.91796875, "learning_rate": 0.00033459867213412567, "loss": 6.7842, "mean_token_accuracy": 0.1121189422905445, "num_tokens": 4869992.0, "step": 2245 }, { "entropy": 6.9395585536956785, "epoch": 0.15968205528547602, "grad_norm": 0.99609375, "learning_rate": 0.000333461844086937, "loss": 6.8761, "mean_token_accuracy": 0.10806992277503014, "num_tokens": 4880178.0, "step": 2250 }, { "entropy": 7.033035564422607, "epoch": 0.16003690429722153, "grad_norm": 0.921875, "learning_rate": 0.00033232341327876097, "loss": 6.9967, "mean_token_accuracy": 0.10657852441072464, "num_tokens": 4892521.0, "step": 2255 }, { "entropy": 7.062964677810669, "epoch": 0.16039175330896704, "grad_norm": 0.9609375, "learning_rate": 0.0003311834109202531, "loss": 6.8279, "mean_token_accuracy": 0.10873689278960227, "num_tokens": 4904015.0, "step": 2260 }, { "entropy": 7.0085608005523685, "epoch": 0.16074660232071253, "grad_norm": 1.109375, "learning_rate": 0.00033004186826515416, "loss": 6.9017, "mean_token_accuracy": 0.11354547590017319, "num_tokens": 4914806.0, "step": 2265 }, { "entropy": 6.913502645492554, "epoch": 0.16110145133245804, "grad_norm": 0.9609375, "learning_rate": 0.0003288988166094324, "loss": 6.9735, "mean_token_accuracy": 0.10321487337350846, "num_tokens": 4926590.0, "step": 2270 }, { "entropy": 7.050243616104126, "epoch": 0.16145630034420355, "grad_norm": 0.875, "learning_rate": 0.00032775428729042656, "loss": 6.8725, "mean_token_accuracy": 0.10716884061694146, "num_tokens": 4937212.0, "step": 2275 }, { "entropy": 7.00547342300415, "epoch": 0.16181114935594904, "grad_norm": 1.0078125, "learning_rate": 0.000326608311685986, "loss": 6.9122, "mean_token_accuracy": 0.10085045397281647, "num_tokens": 4948059.0, "step": 2280 }, { "entropy": 7.020096683502198, "epoch": 0.16216599836769455, "grad_norm": 1.0234375, "learning_rate": 0.0003254609212136108, "loss": 6.9249, "mean_token_accuracy": 0.10465004742145538, "num_tokens": 4958962.0, "step": 2285 }, { "entropy": 6.947905540466309, "epoch": 0.16252084737944006, "grad_norm": 1.0625, "learning_rate": 0.00032431214732959036, "loss": 6.7898, "mean_token_accuracy": 0.1130453810095787, "num_tokens": 4969480.0, "step": 2290 }, { "entropy": 6.939700412750244, "epoch": 0.16287569639118554, "grad_norm": 0.98828125, "learning_rate": 0.000323162021528141, "loss": 6.8669, "mean_token_accuracy": 0.10693132355809212, "num_tokens": 4979784.0, "step": 2295 }, { "entropy": 6.982529783248902, "epoch": 0.16323054540293105, "grad_norm": 0.98828125, "learning_rate": 0.00032201057534054264, "loss": 6.9363, "mean_token_accuracy": 0.11092625781893731, "num_tokens": 4990308.0, "step": 2300 }, { "entropy": 7.040096569061279, "epoch": 0.16358539441467657, "grad_norm": 0.94921875, "learning_rate": 0.00032085784033427414, "loss": 6.9497, "mean_token_accuracy": 0.10680189654231072, "num_tokens": 5002068.0, "step": 2305 }, { "entropy": 7.060698699951172, "epoch": 0.16394024342642205, "grad_norm": 0.93359375, "learning_rate": 0.0003197038481121478, "loss": 6.8228, "mean_token_accuracy": 0.11382793858647347, "num_tokens": 5012567.0, "step": 2310 }, { "entropy": 6.907808923721314, "epoch": 0.16429509243816756, "grad_norm": 0.96484375, "learning_rate": 0.0003185486303114436, "loss": 6.8369, "mean_token_accuracy": 0.11393960565328598, "num_tokens": 5022899.0, "step": 2315 }, { "entropy": 6.992615556716919, "epoch": 0.16464994144991307, "grad_norm": 0.984375, "learning_rate": 0.0003173922186030409, "loss": 6.7848, "mean_token_accuracy": 0.11245036497712135, "num_tokens": 5033221.0, "step": 2320 }, { "entropy": 7.0934224128723145, "epoch": 0.16500479046165856, "grad_norm": 0.94140625, "learning_rate": 0.000316234644690551, "loss": 6.9766, "mean_token_accuracy": 0.10262498036026954, "num_tokens": 5045265.0, "step": 2325 }, { "entropy": 6.954192686080932, "epoch": 0.16535963947340407, "grad_norm": 1.0546875, "learning_rate": 0.0003150759403094473, "loss": 6.8155, "mean_token_accuracy": 0.10801345705986024, "num_tokens": 5055735.0, "step": 2330 }, { "entropy": 6.902051687240601, "epoch": 0.16571448848514958, "grad_norm": 0.96484375, "learning_rate": 0.00031391613722619587, "loss": 6.8765, "mean_token_accuracy": 0.10825056955218315, "num_tokens": 5066258.0, "step": 2335 }, { "entropy": 7.005957317352295, "epoch": 0.16606933749689506, "grad_norm": 0.96875, "learning_rate": 0.000312755267237384, "loss": 6.9255, "mean_token_accuracy": 0.1042802594602108, "num_tokens": 5077202.0, "step": 2340 }, { "entropy": 7.0072572231292725, "epoch": 0.16642418650864058, "grad_norm": 0.94921875, "learning_rate": 0.0003115933621688488, "loss": 6.8858, "mean_token_accuracy": 0.10783494263887405, "num_tokens": 5088367.0, "step": 2345 }, { "entropy": 7.012457418441772, "epoch": 0.1667790355203861, "grad_norm": 0.96484375, "learning_rate": 0.00031043045387480487, "loss": 6.8797, "mean_token_accuracy": 0.10552211254835128, "num_tokens": 5098724.0, "step": 2350 }, { "entropy": 6.929810476303101, "epoch": 0.16713388453213157, "grad_norm": 0.95703125, "learning_rate": 0.0003092665742369703, "loss": 6.7804, "mean_token_accuracy": 0.11827445849776268, "num_tokens": 5109996.0, "step": 2355 }, { "entropy": 6.902822065353393, "epoch": 0.16748873354387708, "grad_norm": 0.94140625, "learning_rate": 0.00030810175516369343, "loss": 6.9349, "mean_token_accuracy": 0.11100076511502266, "num_tokens": 5121137.0, "step": 2360 }, { "entropy": 7.053985357284546, "epoch": 0.1678435825556226, "grad_norm": 1.046875, "learning_rate": 0.0003069360285890775, "loss": 6.9059, "mean_token_accuracy": 0.10487226918339729, "num_tokens": 5132369.0, "step": 2365 }, { "entropy": 6.991532182693481, "epoch": 0.16819843156736808, "grad_norm": 1.03125, "learning_rate": 0.00030576942647210547, "loss": 6.7483, "mean_token_accuracy": 0.11153419762849807, "num_tokens": 5143360.0, "step": 2370 }, { "entropy": 6.964412689208984, "epoch": 0.1685532805791136, "grad_norm": 0.9140625, "learning_rate": 0.00030460198079576355, "loss": 6.8533, "mean_token_accuracy": 0.10653385668992996, "num_tokens": 5153975.0, "step": 2375 }, { "entropy": 7.016902065277099, "epoch": 0.1689081295908591, "grad_norm": 1.046875, "learning_rate": 0.0003034337235661648, "loss": 6.8784, "mean_token_accuracy": 0.10774541646242142, "num_tokens": 5165037.0, "step": 2380 }, { "entropy": 6.897519445419311, "epoch": 0.16926297860260459, "grad_norm": 1.0, "learning_rate": 0.0003022646868116714, "loss": 6.7927, "mean_token_accuracy": 0.1141560547053814, "num_tokens": 5175316.0, "step": 2385 }, { "entropy": 6.936920261383056, "epoch": 0.1696178276143501, "grad_norm": 0.91796875, "learning_rate": 0.0003010949025820163, "loss": 6.8653, "mean_token_accuracy": 0.1071905441582203, "num_tokens": 5187567.0, "step": 2390 }, { "entropy": 7.035586547851563, "epoch": 0.1699726766260956, "grad_norm": 0.98046875, "learning_rate": 0.0002999244029474252, "loss": 6.8021, "mean_token_accuracy": 0.11246755048632621, "num_tokens": 5198046.0, "step": 2395 }, { "entropy": 6.898006439208984, "epoch": 0.1703275256378411, "grad_norm": 1.015625, "learning_rate": 0.00029875321999773684, "loss": 6.8817, "mean_token_accuracy": 0.105026775598526, "num_tokens": 5207954.0, "step": 2400 }, { "entropy": 6.970842695236206, "epoch": 0.1706823746495866, "grad_norm": 1.078125, "learning_rate": 0.00029758138584152333, "loss": 6.8182, "mean_token_accuracy": 0.11151416301727295, "num_tokens": 5218524.0, "step": 2405 }, { "entropy": 6.9917010307312015, "epoch": 0.17103722366133212, "grad_norm": 1.046875, "learning_rate": 0.0002964089326052102, "loss": 6.9518, "mean_token_accuracy": 0.1023468978703022, "num_tokens": 5230375.0, "step": 2410 }, { "entropy": 7.060526180267334, "epoch": 0.1713920726730776, "grad_norm": 0.8671875, "learning_rate": 0.0002952358924321949, "loss": 6.9012, "mean_token_accuracy": 0.11125127226114273, "num_tokens": 5240425.0, "step": 2415 }, { "entropy": 7.019340848922729, "epoch": 0.1717469216848231, "grad_norm": 0.91796875, "learning_rate": 0.00029406229748196657, "loss": 6.825, "mean_token_accuracy": 0.10501738041639327, "num_tokens": 5251713.0, "step": 2420 }, { "entropy": 6.970897150039673, "epoch": 0.17210177069656862, "grad_norm": 1.0, "learning_rate": 0.0002928881799292235, "loss": 6.8769, "mean_token_accuracy": 0.10659899786114693, "num_tokens": 5262639.0, "step": 2425 }, { "entropy": 6.917237234115601, "epoch": 0.1724566197083141, "grad_norm": 0.9296875, "learning_rate": 0.00029171357196299154, "loss": 6.8396, "mean_token_accuracy": 0.116180519759655, "num_tokens": 5273609.0, "step": 2430 }, { "entropy": 7.0096338272094725, "epoch": 0.17281146872005962, "grad_norm": 1.0546875, "learning_rate": 0.0002905385057857414, "loss": 6.8977, "mean_token_accuracy": 0.10368822440505028, "num_tokens": 5284090.0, "step": 2435 }, { "entropy": 7.017961835861206, "epoch": 0.17316631773180513, "grad_norm": 1.0859375, "learning_rate": 0.0002893630136125058, "loss": 6.8516, "mean_token_accuracy": 0.10498897284269333, "num_tokens": 5294537.0, "step": 2440 }, { "entropy": 6.940798044204712, "epoch": 0.17352116674355061, "grad_norm": 0.9921875, "learning_rate": 0.0002881871276699967, "loss": 6.8249, "mean_token_accuracy": 0.1162478543817997, "num_tokens": 5305524.0, "step": 2445 }, { "entropy": 6.935272312164306, "epoch": 0.17387601575529613, "grad_norm": 0.9375, "learning_rate": 0.00028701088019572114, "loss": 6.8247, "mean_token_accuracy": 0.10882443636655807, "num_tokens": 5317408.0, "step": 2450 }, { "entropy": 6.978143835067749, "epoch": 0.1742308647670416, "grad_norm": 0.91015625, "learning_rate": 0.0002858343034370977, "loss": 6.871, "mean_token_accuracy": 0.10791338384151458, "num_tokens": 5328275.0, "step": 2455 }, { "entropy": 6.904288864135742, "epoch": 0.17458571377878712, "grad_norm": 1.0546875, "learning_rate": 0.00028465742965057267, "loss": 6.8864, "mean_token_accuracy": 0.11189721897244453, "num_tokens": 5338990.0, "step": 2460 }, { "entropy": 7.034686183929443, "epoch": 0.17494056279053263, "grad_norm": 1.0390625, "learning_rate": 0.00028348029110073533, "loss": 6.851, "mean_token_accuracy": 0.1080154150724411, "num_tokens": 5349826.0, "step": 2465 }, { "entropy": 6.9757061958312985, "epoch": 0.17529541180227812, "grad_norm": 0.96875, "learning_rate": 0.00028230292005943365, "loss": 6.8879, "mean_token_accuracy": 0.11000979393720627, "num_tokens": 5361354.0, "step": 2470 }, { "entropy": 6.949403190612793, "epoch": 0.17565026081402363, "grad_norm": 1.046875, "learning_rate": 0.00028112534880488945, "loss": 6.885, "mean_token_accuracy": 0.1100533053278923, "num_tokens": 5371079.0, "step": 2475 }, { "entropy": 7.012681579589843, "epoch": 0.17600510982576914, "grad_norm": 0.96484375, "learning_rate": 0.0002799476096208137, "loss": 6.8556, "mean_token_accuracy": 0.10374706834554673, "num_tokens": 5381351.0, "step": 2480 }, { "entropy": 6.982795715332031, "epoch": 0.17635995883751462, "grad_norm": 0.9140625, "learning_rate": 0.00027876973479552087, "loss": 6.7851, "mean_token_accuracy": 0.11224160492420196, "num_tokens": 5391638.0, "step": 2485 }, { "entropy": 6.904779100418091, "epoch": 0.17671480784926014, "grad_norm": 0.890625, "learning_rate": 0.00027759175662104424, "loss": 6.8322, "mean_token_accuracy": 0.10784663334488868, "num_tokens": 5402882.0, "step": 2490 }, { "entropy": 7.070130634307861, "epoch": 0.17706965686100565, "grad_norm": 1.03125, "learning_rate": 0.0002764137073922508, "loss": 6.818, "mean_token_accuracy": 0.11323273256421089, "num_tokens": 5412563.0, "step": 2495 }, { "entropy": 6.9515509605407715, "epoch": 0.17742450587275113, "grad_norm": 0.91015625, "learning_rate": 0.00027523561940595505, "loss": 6.8012, "mean_token_accuracy": 0.10688069686293603, "num_tokens": 5423980.0, "step": 2500 }, { "entropy": 6.983108234405518, "epoch": 0.17777935488449664, "grad_norm": 1.046875, "learning_rate": 0.0002740575249600342, "loss": 6.8567, "mean_token_accuracy": 0.11107314750552177, "num_tokens": 5434179.0, "step": 2505 }, { "entropy": 6.975622844696045, "epoch": 0.17813420389624215, "grad_norm": 1.0078125, "learning_rate": 0.00027287945635254263, "loss": 6.8159, "mean_token_accuracy": 0.11661912426352501, "num_tokens": 5444673.0, "step": 2510 }, { "entropy": 6.953983354568481, "epoch": 0.17848905290798764, "grad_norm": 1.3359375, "learning_rate": 0.00027170144588082635, "loss": 6.9607, "mean_token_accuracy": 0.10692217573523521, "num_tokens": 5456436.0, "step": 2515 }, { "entropy": 6.990560388565063, "epoch": 0.17884390191973315, "grad_norm": 0.984375, "learning_rate": 0.00027052352584063763, "loss": 6.829, "mean_token_accuracy": 0.10766687542200089, "num_tokens": 5467722.0, "step": 2520 }, { "entropy": 6.96366696357727, "epoch": 0.17919875093147866, "grad_norm": 1.0, "learning_rate": 0.00026934572852524907, "loss": 6.8025, "mean_token_accuracy": 0.10859449803829194, "num_tokens": 5478696.0, "step": 2525 }, { "entropy": 6.942538738250732, "epoch": 0.17955359994322415, "grad_norm": 0.953125, "learning_rate": 0.00026816808622456937, "loss": 6.782, "mean_token_accuracy": 0.10927296131849289, "num_tokens": 5490355.0, "step": 2530 }, { "entropy": 6.861541128158569, "epoch": 0.17990844895496966, "grad_norm": 1.0390625, "learning_rate": 0.0002669906312242569, "loss": 6.7646, "mean_token_accuracy": 0.1071113832294941, "num_tokens": 5501543.0, "step": 2535 }, { "entropy": 7.008576345443726, "epoch": 0.18026329796671517, "grad_norm": 1.0625, "learning_rate": 0.00026581339580483525, "loss": 6.7959, "mean_token_accuracy": 0.1064346343278885, "num_tokens": 5513374.0, "step": 2540 }, { "entropy": 6.9608423709869385, "epoch": 0.18061814697846065, "grad_norm": 0.9921875, "learning_rate": 0.0002646364122408082, "loss": 6.8561, "mean_token_accuracy": 0.1085042454302311, "num_tokens": 5523608.0, "step": 2545 }, { "entropy": 6.885600328445435, "epoch": 0.18097299599020616, "grad_norm": 0.97265625, "learning_rate": 0.0002634597127997749, "loss": 6.8051, "mean_token_accuracy": 0.11450423449277877, "num_tokens": 5535108.0, "step": 2550 }, { "entropy": 6.912053108215332, "epoch": 0.18132784500195168, "grad_norm": 1.078125, "learning_rate": 0.0002622833297415445, "loss": 6.7962, "mean_token_accuracy": 0.11635999530553817, "num_tokens": 5545927.0, "step": 2555 }, { "entropy": 7.005493640899658, "epoch": 0.18168269401369716, "grad_norm": 0.953125, "learning_rate": 0.0002611072953172531, "loss": 6.8012, "mean_token_accuracy": 0.1119636908173561, "num_tokens": 5556337.0, "step": 2560 }, { "entropy": 6.92455563545227, "epoch": 0.18203754302544267, "grad_norm": 0.98046875, "learning_rate": 0.00025993164176847845, "loss": 6.7837, "mean_token_accuracy": 0.1091103196144104, "num_tokens": 5567024.0, "step": 2565 }, { "entropy": 6.922195863723755, "epoch": 0.18239239203718818, "grad_norm": 0.9921875, "learning_rate": 0.0002587564013263564, "loss": 6.8145, "mean_token_accuracy": 0.10922716110944748, "num_tokens": 5578168.0, "step": 2570 }, { "entropy": 6.919791984558105, "epoch": 0.18274724104893367, "grad_norm": 0.90625, "learning_rate": 0.0002575816062106974, "loss": 6.8679, "mean_token_accuracy": 0.11193211972713471, "num_tokens": 5589000.0, "step": 2575 }, { "entropy": 6.992647314071656, "epoch": 0.18310209006067918, "grad_norm": 0.99609375, "learning_rate": 0.00025640728862910293, "loss": 6.8424, "mean_token_accuracy": 0.107405274361372, "num_tokens": 5599019.0, "step": 2580 }, { "entropy": 6.995386791229248, "epoch": 0.1834569390724247, "grad_norm": 1.0625, "learning_rate": 0.00025523348077608285, "loss": 6.8686, "mean_token_accuracy": 0.10983893051743507, "num_tokens": 5610169.0, "step": 2585 }, { "entropy": 6.944970226287841, "epoch": 0.18381178808417017, "grad_norm": 0.94140625, "learning_rate": 0.00025406021483217225, "loss": 6.8337, "mean_token_accuracy": 0.11445480808615685, "num_tokens": 5621471.0, "step": 2590 }, { "entropy": 6.932586908340454, "epoch": 0.1841666370959157, "grad_norm": 1.1328125, "learning_rate": 0.00025288752296304963, "loss": 6.8451, "mean_token_accuracy": 0.10618517324328422, "num_tokens": 5632708.0, "step": 2595 }, { "entropy": 6.991014862060547, "epoch": 0.1845214861076612, "grad_norm": 1.0390625, "learning_rate": 0.000251715437318655, "loss": 6.8711, "mean_token_accuracy": 0.11433243229985238, "num_tokens": 5643057.0, "step": 2600 }, { "entropy": 7.0343590259552, "epoch": 0.18487633511940668, "grad_norm": 0.953125, "learning_rate": 0.0002505439900323084, "loss": 6.8464, "mean_token_accuracy": 0.11091703474521637, "num_tokens": 5654928.0, "step": 2605 }, { "entropy": 6.969445991516113, "epoch": 0.1852311841311522, "grad_norm": 1.0625, "learning_rate": 0.00024937321321982894, "loss": 6.7362, "mean_token_accuracy": 0.11556778773665428, "num_tokens": 5665135.0, "step": 2610 }, { "entropy": 6.9363429069519045, "epoch": 0.1855860331428977, "grad_norm": 0.98828125, "learning_rate": 0.00024820313897865433, "loss": 6.7503, "mean_token_accuracy": 0.11977223679423332, "num_tokens": 5676044.0, "step": 2615 }, { "entropy": 6.928713369369507, "epoch": 0.1859408821546432, "grad_norm": 0.96875, "learning_rate": 0.00024703379938696105, "loss": 6.8882, "mean_token_accuracy": 0.10680016577243805, "num_tokens": 5688329.0, "step": 2620 }, { "entropy": 6.944188451766967, "epoch": 0.1862957311663887, "grad_norm": 0.9375, "learning_rate": 0.00024586522650278447, "loss": 6.7589, "mean_token_accuracy": 0.11397264674305915, "num_tokens": 5698762.0, "step": 2625 }, { "entropy": 6.975194931030273, "epoch": 0.1866505801781342, "grad_norm": 1.0703125, "learning_rate": 0.00024469745236314064, "loss": 6.8735, "mean_token_accuracy": 0.10839726105332374, "num_tokens": 5709087.0, "step": 2630 }, { "entropy": 6.99052848815918, "epoch": 0.1870054291898797, "grad_norm": 1.0, "learning_rate": 0.00024353050898314767, "loss": 6.8089, "mean_token_accuracy": 0.1089420735836029, "num_tokens": 5719633.0, "step": 2635 }, { "entropy": 6.9208982467651365, "epoch": 0.1873602782016252, "grad_norm": 1.078125, "learning_rate": 0.00024236442835514743, "loss": 6.8141, "mean_token_accuracy": 0.11238551586866379, "num_tokens": 5730234.0, "step": 2640 }, { "entropy": 6.96273512840271, "epoch": 0.18771512721337072, "grad_norm": 1.046875, "learning_rate": 0.00024119924244782965, "loss": 6.8139, "mean_token_accuracy": 0.11327897533774375, "num_tokens": 5741279.0, "step": 2645 }, { "entropy": 6.967271327972412, "epoch": 0.1880699762251162, "grad_norm": 1.0, "learning_rate": 0.00024003498320535462, "loss": 6.8053, "mean_token_accuracy": 0.11368138119578361, "num_tokens": 5751699.0, "step": 2650 }, { "entropy": 6.979606866836548, "epoch": 0.18842482523686171, "grad_norm": 1.0078125, "learning_rate": 0.00023887168254647727, "loss": 6.8163, "mean_token_accuracy": 0.11396170631051064, "num_tokens": 5761527.0, "step": 2655 }, { "entropy": 6.991921281814575, "epoch": 0.18877967424860723, "grad_norm": 1.0234375, "learning_rate": 0.00023770937236367308, "loss": 6.8199, "mean_token_accuracy": 0.11399022936820984, "num_tokens": 5771348.0, "step": 2660 }, { "entropy": 6.988916683197021, "epoch": 0.1891345232603527, "grad_norm": 1.125, "learning_rate": 0.00023654808452226278, "loss": 6.8105, "mean_token_accuracy": 0.11595386117696763, "num_tokens": 5780350.0, "step": 2665 }, { "entropy": 6.9241063594818115, "epoch": 0.18948937227209822, "grad_norm": 0.9765625, "learning_rate": 0.00023538785085953912, "loss": 6.8008, "mean_token_accuracy": 0.11144680380821229, "num_tokens": 5791743.0, "step": 2670 }, { "entropy": 6.939181470870972, "epoch": 0.18984422128384373, "grad_norm": 0.9765625, "learning_rate": 0.00023422870318389404, "loss": 6.738, "mean_token_accuracy": 0.11290448680520057, "num_tokens": 5802958.0, "step": 2675 }, { "entropy": 6.964320516586303, "epoch": 0.19019907029558922, "grad_norm": 0.94140625, "learning_rate": 0.0002330706732739468, "loss": 6.8065, "mean_token_accuracy": 0.106526218354702, "num_tokens": 5814503.0, "step": 2680 }, { "entropy": 6.862625169754028, "epoch": 0.19055391930733473, "grad_norm": 0.92578125, "learning_rate": 0.00023191379287767211, "loss": 6.6636, "mean_token_accuracy": 0.12738021984696388, "num_tokens": 5826182.0, "step": 2685 }, { "entropy": 6.933192300796509, "epoch": 0.19090876831908024, "grad_norm": 1.0078125, "learning_rate": 0.0002307580937115305, "loss": 6.7616, "mean_token_accuracy": 0.11562723517417908, "num_tokens": 5837426.0, "step": 2690 }, { "entropy": 6.910529088973999, "epoch": 0.19126361733082572, "grad_norm": 0.91796875, "learning_rate": 0.00022960360745959846, "loss": 6.8184, "mean_token_accuracy": 0.10251531153917312, "num_tokens": 5848344.0, "step": 2695 }, { "entropy": 6.921610736846924, "epoch": 0.19161846634257124, "grad_norm": 0.9609375, "learning_rate": 0.00022845036577269972, "loss": 6.7971, "mean_token_accuracy": 0.11794155836105347, "num_tokens": 5859905.0, "step": 2700 }, { "entropy": 6.920235109329224, "epoch": 0.19197331535431675, "grad_norm": 1.0625, "learning_rate": 0.00022729840026753777, "loss": 6.794, "mean_token_accuracy": 0.1141629844903946, "num_tokens": 5871121.0, "step": 2705 }, { "entropy": 6.976440477371216, "epoch": 0.19232816436606223, "grad_norm": 0.984375, "learning_rate": 0.0002261477425258287, "loss": 6.7817, "mean_token_accuracy": 0.11112578511238098, "num_tokens": 5882211.0, "step": 2710 }, { "entropy": 6.9788895606994625, "epoch": 0.19268301337780774, "grad_norm": 1.078125, "learning_rate": 0.0002249984240934358, "loss": 6.7742, "mean_token_accuracy": 0.11779958754777908, "num_tokens": 5892702.0, "step": 2715 }, { "entropy": 6.8424193382263185, "epoch": 0.19303786238955326, "grad_norm": 0.99609375, "learning_rate": 0.00022385047647950464, "loss": 6.7369, "mean_token_accuracy": 0.11136523112654687, "num_tokens": 5903655.0, "step": 2720 }, { "entropy": 6.986451768875122, "epoch": 0.19339271140129874, "grad_norm": 0.94921875, "learning_rate": 0.0002227039311555986, "loss": 6.8988, "mean_token_accuracy": 0.11267425641417503, "num_tokens": 5915387.0, "step": 2725 }, { "entropy": 7.007633018493652, "epoch": 0.19374756041304425, "grad_norm": 0.90234375, "learning_rate": 0.0002215588195548372, "loss": 6.7527, "mean_token_accuracy": 0.11794544607400895, "num_tokens": 5926827.0, "step": 2730 }, { "entropy": 6.983679103851318, "epoch": 0.19410240942478976, "grad_norm": 1.1015625, "learning_rate": 0.00022041517307103337, "loss": 6.834, "mean_token_accuracy": 0.10779970809817314, "num_tokens": 5937459.0, "step": 2735 }, { "entropy": 6.914843559265137, "epoch": 0.19445725843653525, "grad_norm": 1.171875, "learning_rate": 0.0002192730230578331, "loss": 6.7607, "mean_token_accuracy": 0.11893753930926323, "num_tokens": 5949116.0, "step": 2740 }, { "entropy": 6.978890895843506, "epoch": 0.19481210744828076, "grad_norm": 1.5859375, "learning_rate": 0.0002181324008278559, "loss": 6.8364, "mean_token_accuracy": 0.11154205128550529, "num_tokens": 5959447.0, "step": 2745 }, { "entropy": 6.891154098510742, "epoch": 0.19516695646002627, "grad_norm": 0.98828125, "learning_rate": 0.00021699333765183655, "loss": 6.7122, "mean_token_accuracy": 0.1195847325026989, "num_tokens": 5969754.0, "step": 2750 }, { "entropy": 6.881964254379272, "epoch": 0.19552180547177175, "grad_norm": 0.953125, "learning_rate": 0.0002158558647577673, "loss": 6.8052, "mean_token_accuracy": 0.1127731017768383, "num_tokens": 5981395.0, "step": 2755 }, { "entropy": 7.011906147003174, "epoch": 0.19587665448351727, "grad_norm": 1.046875, "learning_rate": 0.00021472001333004215, "loss": 6.8374, "mean_token_accuracy": 0.11157171055674553, "num_tokens": 5992177.0, "step": 2760 }, { "entropy": 6.933767938613892, "epoch": 0.19623150349526278, "grad_norm": 1.140625, "learning_rate": 0.00021358581450860186, "loss": 6.7019, "mean_token_accuracy": 0.11525828316807747, "num_tokens": 6001683.0, "step": 2765 }, { "entropy": 6.925135231018066, "epoch": 0.19658635250700826, "grad_norm": 1.0546875, "learning_rate": 0.0002124532993880799, "loss": 6.8463, "mean_token_accuracy": 0.11589981392025947, "num_tokens": 6013278.0, "step": 2770 }, { "entropy": 6.982972240447998, "epoch": 0.19694120151875377, "grad_norm": 0.921875, "learning_rate": 0.00021132249901695044, "loss": 6.7965, "mean_token_accuracy": 0.10612709373235703, "num_tokens": 6024083.0, "step": 2775 }, { "entropy": 6.957027196884155, "epoch": 0.19729605053049928, "grad_norm": 0.9921875, "learning_rate": 0.00021019344439667705, "loss": 6.7964, "mean_token_accuracy": 0.11672135517001152, "num_tokens": 6034445.0, "step": 2780 }, { "entropy": 6.9106330394744875, "epoch": 0.19765089954224477, "grad_norm": 1.0859375, "learning_rate": 0.00020906616648086213, "loss": 6.8121, "mean_token_accuracy": 0.11197659894824027, "num_tokens": 6044698.0, "step": 2785 }, { "entropy": 6.947172451019287, "epoch": 0.19800574855399028, "grad_norm": 1.0546875, "learning_rate": 0.00020794069617439942, "loss": 6.8269, "mean_token_accuracy": 0.11555901169776917, "num_tokens": 6054921.0, "step": 2790 }, { "entropy": 6.985541725158692, "epoch": 0.1983605975657358, "grad_norm": 1.03125, "learning_rate": 0.00020681706433262593, "loss": 6.6881, "mean_token_accuracy": 0.11160681322216988, "num_tokens": 6065086.0, "step": 2795 }, { "entropy": 6.9685831546783445, "epoch": 0.19871544657748128, "grad_norm": 1.1171875, "learning_rate": 0.00020569530176047602, "loss": 6.8081, "mean_token_accuracy": 0.11681672781705857, "num_tokens": 6076179.0, "step": 2800 }, { "entropy": 6.895740032196045, "epoch": 0.1990702955892268, "grad_norm": 0.984375, "learning_rate": 0.0002045754392116374, "loss": 6.76, "mean_token_accuracy": 0.1167929820716381, "num_tokens": 6086643.0, "step": 2805 }, { "entropy": 6.869204473495484, "epoch": 0.1994251446009723, "grad_norm": 1.0703125, "learning_rate": 0.00020345750738770757, "loss": 6.7624, "mean_token_accuracy": 0.10626718774437904, "num_tokens": 6097482.0, "step": 2810 }, { "entropy": 6.947177410125732, "epoch": 0.19977999361271778, "grad_norm": 0.9765625, "learning_rate": 0.00020234153693735214, "loss": 6.74, "mean_token_accuracy": 0.11464135870337486, "num_tokens": 6107718.0, "step": 2815 }, { "entropy": 6.9241992950439455, "epoch": 0.2001348426244633, "grad_norm": 1.0078125, "learning_rate": 0.0002012275584554647, "loss": 6.7492, "mean_token_accuracy": 0.10922236144542694, "num_tokens": 6117304.0, "step": 2820 }, { "entropy": 6.93255729675293, "epoch": 0.2004896916362088, "grad_norm": 1.0546875, "learning_rate": 0.00020011560248232803, "loss": 6.6845, "mean_token_accuracy": 0.11656132563948632, "num_tokens": 6127383.0, "step": 2825 }, { "entropy": 6.9440559387207035, "epoch": 0.2008445406479543, "grad_norm": 0.9765625, "learning_rate": 0.00019900569950277692, "loss": 6.7635, "mean_token_accuracy": 0.11715753227472306, "num_tokens": 6138163.0, "step": 2830 }, { "entropy": 6.8963623046875, "epoch": 0.2011993896596998, "grad_norm": 0.9375, "learning_rate": 0.00019789787994536228, "loss": 6.7243, "mean_token_accuracy": 0.11367726176977158, "num_tokens": 6149519.0, "step": 2835 }, { "entropy": 6.944343852996826, "epoch": 0.2015542386714453, "grad_norm": 1.046875, "learning_rate": 0.00019679217418151667, "loss": 6.7561, "mean_token_accuracy": 0.11886984705924988, "num_tokens": 6160234.0, "step": 2840 }, { "entropy": 6.953767442703247, "epoch": 0.2019090876831908, "grad_norm": 1.046875, "learning_rate": 0.00019568861252472236, "loss": 6.7664, "mean_token_accuracy": 0.11626882553100586, "num_tokens": 6170589.0, "step": 2845 }, { "entropy": 6.919698905944824, "epoch": 0.2022639366949363, "grad_norm": 0.94921875, "learning_rate": 0.00019458722522967952, "loss": 6.7532, "mean_token_accuracy": 0.11209649443626404, "num_tokens": 6182291.0, "step": 2850 }, { "entropy": 6.921873092651367, "epoch": 0.20261878570668182, "grad_norm": 1.0390625, "learning_rate": 0.00019348804249147723, "loss": 6.7244, "mean_token_accuracy": 0.11564923822879791, "num_tokens": 6192461.0, "step": 2855 }, { "entropy": 6.8797821521759035, "epoch": 0.2029736347184273, "grad_norm": 0.90234375, "learning_rate": 0.0001923910944447655, "loss": 6.6885, "mean_token_accuracy": 0.11495175957679749, "num_tokens": 6203038.0, "step": 2860 }, { "entropy": 6.976866340637207, "epoch": 0.20332848373017282, "grad_norm": 1.046875, "learning_rate": 0.00019129641116292928, "loss": 6.7681, "mean_token_accuracy": 0.10720009878277778, "num_tokens": 6212772.0, "step": 2865 }, { "entropy": 6.932071924209595, "epoch": 0.20368333274191833, "grad_norm": 0.953125, "learning_rate": 0.00019020402265726343, "loss": 6.7421, "mean_token_accuracy": 0.11611971035599708, "num_tokens": 6224751.0, "step": 2870 }, { "entropy": 6.8816296577453615, "epoch": 0.2040381817536638, "grad_norm": 1.0703125, "learning_rate": 0.0001891139588761509, "loss": 6.7564, "mean_token_accuracy": 0.11213191598653793, "num_tokens": 6236112.0, "step": 2875 }, { "entropy": 6.855004405975341, "epoch": 0.20439303076540932, "grad_norm": 1.0, "learning_rate": 0.00018802624970424076, "loss": 6.6789, "mean_token_accuracy": 0.11986380815505981, "num_tokens": 6247472.0, "step": 2880 }, { "entropy": 6.962516593933105, "epoch": 0.20474787977715483, "grad_norm": 1.015625, "learning_rate": 0.00018694092496162945, "loss": 6.7785, "mean_token_accuracy": 0.11515040174126626, "num_tokens": 6257330.0, "step": 2885 }, { "entropy": 6.893075942993164, "epoch": 0.20510272878890032, "grad_norm": 0.921875, "learning_rate": 0.00018585801440304306, "loss": 6.7531, "mean_token_accuracy": 0.11047643274068833, "num_tokens": 6267879.0, "step": 2890 }, { "entropy": 6.980209064483643, "epoch": 0.20545757780064583, "grad_norm": 0.9375, "learning_rate": 0.00018477754771702165, "loss": 6.786, "mean_token_accuracy": 0.1101107120513916, "num_tokens": 6279252.0, "step": 2895 }, { "entropy": 6.962943887710571, "epoch": 0.2058124268123913, "grad_norm": 0.99609375, "learning_rate": 0.00018369955452510506, "loss": 6.7178, "mean_token_accuracy": 0.11665593087673187, "num_tokens": 6288915.0, "step": 2900 }, { "entropy": 6.84703803062439, "epoch": 0.20616727582413683, "grad_norm": 0.9765625, "learning_rate": 0.0001826240643810212, "loss": 6.7232, "mean_token_accuracy": 0.11100221052765846, "num_tokens": 6300065.0, "step": 2905 }, { "entropy": 6.887630128860474, "epoch": 0.20652212483588234, "grad_norm": 0.9375, "learning_rate": 0.0001815511067698758, "loss": 6.7618, "mean_token_accuracy": 0.1111633986234665, "num_tokens": 6311185.0, "step": 2910 }, { "entropy": 6.956713914871216, "epoch": 0.20687697384762782, "grad_norm": 0.8359375, "learning_rate": 0.0001804807111073436, "loss": 6.8147, "mean_token_accuracy": 0.10564543157815934, "num_tokens": 6324160.0, "step": 2915 }, { "entropy": 6.998915100097657, "epoch": 0.20723182285937333, "grad_norm": 0.95703125, "learning_rate": 0.0001794129067388625, "loss": 6.7176, "mean_token_accuracy": 0.1167424201965332, "num_tokens": 6334212.0, "step": 2920 }, { "entropy": 6.9070930004119875, "epoch": 0.20758667187111884, "grad_norm": 1.0234375, "learning_rate": 0.00017834772293882868, "loss": 6.7137, "mean_token_accuracy": 0.1089239127933979, "num_tokens": 6345898.0, "step": 2925 }, { "entropy": 6.909444189071655, "epoch": 0.20794152088286433, "grad_norm": 1.015625, "learning_rate": 0.000177285188909794, "loss": 6.7742, "mean_token_accuracy": 0.11567335724830627, "num_tokens": 6356287.0, "step": 2930 }, { "entropy": 6.9139430046081545, "epoch": 0.20829636989460984, "grad_norm": 1.0234375, "learning_rate": 0.0001762253337816656, "loss": 6.7081, "mean_token_accuracy": 0.11572626531124115, "num_tokens": 6367415.0, "step": 2935 }, { "entropy": 6.938155174255371, "epoch": 0.20865121890635535, "grad_norm": 1.1953125, "learning_rate": 0.00017516818661090738, "loss": 6.78, "mean_token_accuracy": 0.11153295859694481, "num_tokens": 6378463.0, "step": 2940 }, { "entropy": 6.928212881088257, "epoch": 0.20900606791810084, "grad_norm": 0.91015625, "learning_rate": 0.0001741137763797428, "loss": 6.7762, "mean_token_accuracy": 0.1111447274684906, "num_tokens": 6389075.0, "step": 2945 }, { "entropy": 6.880980730056763, "epoch": 0.20936091692984635, "grad_norm": 1.0625, "learning_rate": 0.00017306213199536115, "loss": 6.6766, "mean_token_accuracy": 0.1157895028591156, "num_tokens": 6398872.0, "step": 2950 }, { "entropy": 6.899291181564331, "epoch": 0.20971576594159186, "grad_norm": 1.0625, "learning_rate": 0.0001720132822891243, "loss": 6.6369, "mean_token_accuracy": 0.11267390474677086, "num_tokens": 6408557.0, "step": 2955 }, { "entropy": 6.963399028778076, "epoch": 0.21007061495333734, "grad_norm": 1.03125, "learning_rate": 0.0001709672560157769, "loss": 6.6999, "mean_token_accuracy": 0.1197504609823227, "num_tokens": 6420191.0, "step": 2960 }, { "entropy": 6.916766119003296, "epoch": 0.21042546396508285, "grad_norm": 1.03125, "learning_rate": 0.00016992408185265758, "loss": 6.8834, "mean_token_accuracy": 0.10643507018685341, "num_tokens": 6432277.0, "step": 2965 }, { "entropy": 6.881908321380616, "epoch": 0.21078031297682837, "grad_norm": 0.96484375, "learning_rate": 0.00016888378839891298, "loss": 6.6181, "mean_token_accuracy": 0.11972883269190789, "num_tokens": 6442321.0, "step": 2970 }, { "entropy": 6.883301639556885, "epoch": 0.21113516198857385, "grad_norm": 1.03125, "learning_rate": 0.0001678464041747137, "loss": 6.6313, "mean_token_accuracy": 0.11854083985090255, "num_tokens": 6452545.0, "step": 2975 }, { "entropy": 6.903544282913208, "epoch": 0.21149001100031936, "grad_norm": 0.890625, "learning_rate": 0.00016681195762047223, "loss": 6.7528, "mean_token_accuracy": 0.1161648727953434, "num_tokens": 6463188.0, "step": 2980 }, { "entropy": 6.933883905410767, "epoch": 0.21184486001206487, "grad_norm": 0.9140625, "learning_rate": 0.00016578047709606337, "loss": 6.7657, "mean_token_accuracy": 0.11609257981181145, "num_tokens": 6473847.0, "step": 2985 }, { "entropy": 6.880580806732178, "epoch": 0.21219970902381036, "grad_norm": 0.96875, "learning_rate": 0.00016475199088004678, "loss": 6.765, "mean_token_accuracy": 0.11903324723243713, "num_tokens": 6485178.0, "step": 2990 }, { "entropy": 6.987133598327636, "epoch": 0.21255455803555587, "grad_norm": 1.078125, "learning_rate": 0.00016372652716889163, "loss": 6.7447, "mean_token_accuracy": 0.11706713512539864, "num_tokens": 6495102.0, "step": 2995 }, { "entropy": 6.990228223800659, "epoch": 0.21290940704730138, "grad_norm": 1.015625, "learning_rate": 0.0001627041140762035, "loss": 6.7779, "mean_token_accuracy": 0.11222531944513321, "num_tokens": 6505829.0, "step": 3000 }, { "entropy": 6.96190915107727, "epoch": 0.21326425605904686, "grad_norm": 1.1015625, "learning_rate": 0.00016168477963195382, "loss": 6.759, "mean_token_accuracy": 0.11352370381355285, "num_tokens": 6516680.0, "step": 3005 }, { "entropy": 6.973738527297973, "epoch": 0.21361910507079238, "grad_norm": 1.015625, "learning_rate": 0.0001606685517817114, "loss": 6.7292, "mean_token_accuracy": 0.1163517877459526, "num_tokens": 6527598.0, "step": 3010 }, { "entropy": 6.962150144577026, "epoch": 0.2139739540825379, "grad_norm": 1.0078125, "learning_rate": 0.00015965545838587592, "loss": 6.7184, "mean_token_accuracy": 0.1174961932003498, "num_tokens": 6537753.0, "step": 3015 }, { "entropy": 6.981777715682983, "epoch": 0.21432880309428337, "grad_norm": 0.9375, "learning_rate": 0.00015864552721891467, "loss": 6.7854, "mean_token_accuracy": 0.11007496267557144, "num_tokens": 6549216.0, "step": 3020 }, { "entropy": 6.869253921508789, "epoch": 0.21468365210602888, "grad_norm": 1.0234375, "learning_rate": 0.00015763878596860076, "loss": 6.6446, "mean_token_accuracy": 0.11534056067466736, "num_tokens": 6560544.0, "step": 3025 }, { "entropy": 6.821149206161499, "epoch": 0.2150385011177744, "grad_norm": 1.328125, "learning_rate": 0.00015663526223525412, "loss": 6.698, "mean_token_accuracy": 0.12389928475022316, "num_tokens": 6571209.0, "step": 3030 }, { "entropy": 6.933113956451416, "epoch": 0.21539335012951988, "grad_norm": 1.0390625, "learning_rate": 0.0001556349835309848, "loss": 6.8094, "mean_token_accuracy": 0.11183796897530555, "num_tokens": 6582037.0, "step": 3035 }, { "entropy": 6.959015846252441, "epoch": 0.2157481991412654, "grad_norm": 1.0390625, "learning_rate": 0.0001546379772789389, "loss": 6.7874, "mean_token_accuracy": 0.10982848852872848, "num_tokens": 6592305.0, "step": 3040 }, { "entropy": 6.940833950042725, "epoch": 0.2161030481530109, "grad_norm": 1.1953125, "learning_rate": 0.00015364427081254622, "loss": 6.7541, "mean_token_accuracy": 0.11645998880267143, "num_tokens": 6602497.0, "step": 3045 }, { "entropy": 6.894253969192505, "epoch": 0.21645789716475639, "grad_norm": 1.078125, "learning_rate": 0.00015265389137477165, "loss": 6.6626, "mean_token_accuracy": 0.11727668344974518, "num_tokens": 6612652.0, "step": 3050 }, { "entropy": 6.894760370254517, "epoch": 0.2168127461765019, "grad_norm": 1.03125, "learning_rate": 0.00015166686611736786, "loss": 6.7149, "mean_token_accuracy": 0.11366080418229103, "num_tokens": 6623115.0, "step": 3055 }, { "entropy": 6.945737648010254, "epoch": 0.2171675951882474, "grad_norm": 0.97265625, "learning_rate": 0.00015068322210013064, "loss": 6.734, "mean_token_accuracy": 0.11728146597743035, "num_tokens": 6633588.0, "step": 3060 }, { "entropy": 6.904243087768554, "epoch": 0.2175224441999929, "grad_norm": 0.984375, "learning_rate": 0.0001497029862901578, "loss": 6.6279, "mean_token_accuracy": 0.12072202116250992, "num_tokens": 6643549.0, "step": 3065 }, { "entropy": 6.9069630146026615, "epoch": 0.2178772932117384, "grad_norm": 1.078125, "learning_rate": 0.00014872618556110905, "loss": 6.7424, "mean_token_accuracy": 0.11412831842899322, "num_tokens": 6654416.0, "step": 3070 }, { "entropy": 6.90707483291626, "epoch": 0.21823214222348392, "grad_norm": 0.95703125, "learning_rate": 0.00014775284669246992, "loss": 6.695, "mean_token_accuracy": 0.11946465820074081, "num_tokens": 6664941.0, "step": 3075 }, { "entropy": 6.976225709915161, "epoch": 0.2185869912352294, "grad_norm": 0.9921875, "learning_rate": 0.00014678299636881716, "loss": 6.7332, "mean_token_accuracy": 0.11498805359005929, "num_tokens": 6676030.0, "step": 3080 }, { "entropy": 6.959792900085449, "epoch": 0.2189418402469749, "grad_norm": 1.0546875, "learning_rate": 0.0001458166611790873, "loss": 6.6919, "mean_token_accuracy": 0.1207390733063221, "num_tokens": 6686657.0, "step": 3085 }, { "entropy": 6.874952030181885, "epoch": 0.21929668925872042, "grad_norm": 0.98828125, "learning_rate": 0.00014485386761584773, "loss": 6.6572, "mean_token_accuracy": 0.11877228617668152, "num_tokens": 6697167.0, "step": 3090 }, { "entropy": 6.829386806488037, "epoch": 0.2196515382704659, "grad_norm": 0.94921875, "learning_rate": 0.00014389464207457042, "loss": 6.6697, "mean_token_accuracy": 0.12100081443786621, "num_tokens": 6708020.0, "step": 3095 }, { "entropy": 6.862614345550537, "epoch": 0.22000638728221142, "grad_norm": 0.94921875, "learning_rate": 0.00014293901085290795, "loss": 6.6949, "mean_token_accuracy": 0.12770810574293137, "num_tokens": 6718847.0, "step": 3100 }, { "entropy": 6.915661096572876, "epoch": 0.22036123629395693, "grad_norm": 1.0703125, "learning_rate": 0.00014198700014997307, "loss": 6.6479, "mean_token_accuracy": 0.11721537113189698, "num_tokens": 6728723.0, "step": 3105 }, { "entropy": 6.953972959518433, "epoch": 0.22071608530570241, "grad_norm": 1.0859375, "learning_rate": 0.00014103863606562016, "loss": 6.7526, "mean_token_accuracy": 0.1185606837272644, "num_tokens": 6739580.0, "step": 3110 }, { "entropy": 6.89875636100769, "epoch": 0.22107093431744793, "grad_norm": 1.0390625, "learning_rate": 0.00014009394459972964, "loss": 6.6621, "mean_token_accuracy": 0.11878013461828232, "num_tokens": 6749170.0, "step": 3115 }, { "entropy": 6.920209312438965, "epoch": 0.22142578332919344, "grad_norm": 0.94140625, "learning_rate": 0.00013915295165149513, "loss": 6.7674, "mean_token_accuracy": 0.10977763012051582, "num_tokens": 6760501.0, "step": 3120 }, { "entropy": 6.926711320877075, "epoch": 0.22178063234093892, "grad_norm": 0.95703125, "learning_rate": 0.00013821568301871384, "loss": 6.7539, "mean_token_accuracy": 0.11706191524863244, "num_tokens": 6771447.0, "step": 3125 }, { "entropy": 6.960322713851928, "epoch": 0.22213548135268443, "grad_norm": 0.98828125, "learning_rate": 0.00013728216439707862, "loss": 6.7277, "mean_token_accuracy": 0.11347573921084404, "num_tokens": 6782270.0, "step": 3130 }, { "entropy": 6.892803621292114, "epoch": 0.22249033036442994, "grad_norm": 1.046875, "learning_rate": 0.00013635242137947419, "loss": 6.6479, "mean_token_accuracy": 0.12015805542469024, "num_tokens": 6792508.0, "step": 3135 }, { "entropy": 6.831935453414917, "epoch": 0.22284517937617543, "grad_norm": 1.09375, "learning_rate": 0.00013542647945527498, "loss": 6.6295, "mean_token_accuracy": 0.1160468690097332, "num_tokens": 6803213.0, "step": 3140 }, { "entropy": 6.897925138473511, "epoch": 0.22320002838792094, "grad_norm": 1.09375, "learning_rate": 0.0001345043640096465, "loss": 6.7042, "mean_token_accuracy": 0.12162062004208565, "num_tokens": 6813752.0, "step": 3145 }, { "entropy": 6.932341814041138, "epoch": 0.22355487739966645, "grad_norm": 1.0390625, "learning_rate": 0.00013358610032284957, "loss": 6.7874, "mean_token_accuracy": 0.11463806629180909, "num_tokens": 6823820.0, "step": 3150 }, { "entropy": 6.943445920944214, "epoch": 0.22390972641141194, "grad_norm": 1.015625, "learning_rate": 0.000132671713569547, "loss": 6.6865, "mean_token_accuracy": 0.11416048631072044, "num_tokens": 6834129.0, "step": 3155 }, { "entropy": 6.927700805664062, "epoch": 0.22426457542315745, "grad_norm": 1.0078125, "learning_rate": 0.0001317612288181136, "loss": 6.6774, "mean_token_accuracy": 0.11954404041171074, "num_tokens": 6844783.0, "step": 3160 }, { "entropy": 6.878494024276733, "epoch": 0.22461942443490296, "grad_norm": 0.96484375, "learning_rate": 0.00013085467102994864, "loss": 6.6783, "mean_token_accuracy": 0.11336983665823937, "num_tokens": 6855629.0, "step": 3165 }, { "entropy": 6.8463006019592285, "epoch": 0.22497427344664844, "grad_norm": 1.1015625, "learning_rate": 0.00012995206505879198, "loss": 6.6487, "mean_token_accuracy": 0.1187258817255497, "num_tokens": 6866001.0, "step": 3170 }, { "entropy": 6.919407176971435, "epoch": 0.22532912245839395, "grad_norm": 1.0390625, "learning_rate": 0.0001290534356500421, "loss": 6.667, "mean_token_accuracy": 0.11951685026288032, "num_tokens": 6876905.0, "step": 3175 }, { "entropy": 6.943590211868286, "epoch": 0.22568397147013947, "grad_norm": 0.953125, "learning_rate": 0.00012815880744007827, "loss": 6.6999, "mean_token_accuracy": 0.11903873905539512, "num_tokens": 6887417.0, "step": 3180 }, { "entropy": 6.95784821510315, "epoch": 0.22603882048188495, "grad_norm": 1.1484375, "learning_rate": 0.00012726820495558483, "loss": 6.759, "mean_token_accuracy": 0.1151184655725956, "num_tokens": 6898539.0, "step": 3185 }, { "entropy": 6.923780822753907, "epoch": 0.22639366949363046, "grad_norm": 1.5859375, "learning_rate": 0.00012638165261287868, "loss": 6.6688, "mean_token_accuracy": 0.12356014847755432, "num_tokens": 6909262.0, "step": 3190 }, { "entropy": 6.883513402938843, "epoch": 0.22674851850537597, "grad_norm": 1.0078125, "learning_rate": 0.0001254991747172402, "loss": 6.664, "mean_token_accuracy": 0.11952543929219246, "num_tokens": 6919447.0, "step": 3195 }, { "entropy": 6.895750331878662, "epoch": 0.22710336751712146, "grad_norm": 1.109375, "learning_rate": 0.00012462079546224662, "loss": 6.7189, "mean_token_accuracy": 0.1153471127152443, "num_tokens": 6929427.0, "step": 3200 }, { "entropy": 6.833416271209717, "epoch": 0.22745821652886697, "grad_norm": 1.0546875, "learning_rate": 0.00012374653892910896, "loss": 6.6299, "mean_token_accuracy": 0.11555138975381851, "num_tokens": 6940510.0, "step": 3205 }, { "entropy": 6.874943971633911, "epoch": 0.22781306554061248, "grad_norm": 1.1015625, "learning_rate": 0.00012287642908601166, "loss": 6.6891, "mean_token_accuracy": 0.11487954929471016, "num_tokens": 6952325.0, "step": 3210 }, { "entropy": 6.91046552658081, "epoch": 0.22816791455235796, "grad_norm": 1.015625, "learning_rate": 0.00012201048978745569, "loss": 6.6282, "mean_token_accuracy": 0.12046413272619247, "num_tokens": 6964522.0, "step": 3215 }, { "entropy": 6.913842248916626, "epoch": 0.22852276356410348, "grad_norm": 0.87890625, "learning_rate": 0.00012114874477360427, "loss": 6.7334, "mean_token_accuracy": 0.11849887520074845, "num_tokens": 6976076.0, "step": 3220 }, { "entropy": 6.974657344818115, "epoch": 0.228877612575849, "grad_norm": 1.0390625, "learning_rate": 0.00012029121766963236, "loss": 6.6695, "mean_token_accuracy": 0.11764323636889458, "num_tokens": 6986931.0, "step": 3225 }, { "entropy": 6.897745180130005, "epoch": 0.22923246158759447, "grad_norm": 1.0703125, "learning_rate": 0.00011943793198507858, "loss": 6.6811, "mean_token_accuracy": 0.12203874811530113, "num_tokens": 6997645.0, "step": 3230 }, { "entropy": 6.938256788253784, "epoch": 0.22958731059933998, "grad_norm": 1.0625, "learning_rate": 0.00011858891111320104, "loss": 6.7146, "mean_token_accuracy": 0.11457696259021759, "num_tokens": 7008233.0, "step": 3235 }, { "entropy": 6.907660245895386, "epoch": 0.2299421596110855, "grad_norm": 0.96875, "learning_rate": 0.0001177441783303359, "loss": 6.6888, "mean_token_accuracy": 0.11507107317447662, "num_tokens": 7019929.0, "step": 3240 }, { "entropy": 6.846661710739136, "epoch": 0.23029700862283098, "grad_norm": 0.9375, "learning_rate": 0.00011690375679525896, "loss": 6.6575, "mean_token_accuracy": 0.11631618216633796, "num_tokens": 7032713.0, "step": 3245 }, { "entropy": 6.915798330307007, "epoch": 0.2306518576345765, "grad_norm": 1.28125, "learning_rate": 0.00011606766954855124, "loss": 6.7228, "mean_token_accuracy": 0.11966453865170479, "num_tokens": 7042587.0, "step": 3250 }, { "entropy": 6.874674701690674, "epoch": 0.231006706646322, "grad_norm": 0.94921875, "learning_rate": 0.00011523593951196702, "loss": 6.6065, "mean_token_accuracy": 0.12491928935050964, "num_tokens": 7054033.0, "step": 3255 }, { "entropy": 6.974572467803955, "epoch": 0.23136155565806749, "grad_norm": 1.015625, "learning_rate": 0.00011440858948780523, "loss": 6.7722, "mean_token_accuracy": 0.11307616308331489, "num_tokens": 7064898.0, "step": 3260 }, { "entropy": 6.9082679271698, "epoch": 0.231716404669813, "grad_norm": 1.0859375, "learning_rate": 0.00011358564215828484, "loss": 6.7495, "mean_token_accuracy": 0.11240610033273697, "num_tokens": 7076648.0, "step": 3265 }, { "entropy": 6.857656526565552, "epoch": 0.2320712536815585, "grad_norm": 1.015625, "learning_rate": 0.00011276712008492254, "loss": 6.6186, "mean_token_accuracy": 0.11947273984551429, "num_tokens": 7087277.0, "step": 3270 }, { "entropy": 6.936608982086182, "epoch": 0.232426102693304, "grad_norm": 1.2578125, "learning_rate": 0.00011195304570791451, "loss": 6.7576, "mean_token_accuracy": 0.11462770700454712, "num_tokens": 7097793.0, "step": 3275 }, { "entropy": 6.932996559143066, "epoch": 0.2327809517050495, "grad_norm": 0.9921875, "learning_rate": 0.00011114344134552094, "loss": 6.7286, "mean_token_accuracy": 0.12135483473539352, "num_tokens": 7109871.0, "step": 3280 }, { "entropy": 6.8868207931518555, "epoch": 0.23313580071679502, "grad_norm": 1.015625, "learning_rate": 0.0001103383291934545, "loss": 6.6623, "mean_token_accuracy": 0.11861934661865234, "num_tokens": 7120394.0, "step": 3285 }, { "entropy": 6.875744438171386, "epoch": 0.2334906497285405, "grad_norm": 1.0703125, "learning_rate": 0.00010953773132427141, "loss": 6.6438, "mean_token_accuracy": 0.1195549950003624, "num_tokens": 7129536.0, "step": 3290 }, { "entropy": 6.916903686523438, "epoch": 0.233845498740286, "grad_norm": 0.9296875, "learning_rate": 0.00010874166968676677, "loss": 6.6908, "mean_token_accuracy": 0.11509603783488273, "num_tokens": 7140537.0, "step": 3295 }, { "entropy": 6.920742654800415, "epoch": 0.23420034775203152, "grad_norm": 0.94140625, "learning_rate": 0.00010795016610537251, "loss": 6.7232, "mean_token_accuracy": 0.10810523480176926, "num_tokens": 7152531.0, "step": 3300 }, { "entropy": 6.898392820358277, "epoch": 0.234555196763777, "grad_norm": 1.046875, "learning_rate": 0.00010716324227955904, "loss": 6.6826, "mean_token_accuracy": 0.11774844750761986, "num_tokens": 7163618.0, "step": 3305 }, { "entropy": 6.924509000778198, "epoch": 0.23491004577552252, "grad_norm": 0.98046875, "learning_rate": 0.0001063809197832406, "loss": 6.7289, "mean_token_accuracy": 0.10998155847191811, "num_tokens": 7174878.0, "step": 3310 }, { "entropy": 6.907207393646241, "epoch": 0.23526489478726803, "grad_norm": 0.9609375, "learning_rate": 0.00010560322006418368, "loss": 6.7345, "mean_token_accuracy": 0.11835642680525779, "num_tokens": 7185990.0, "step": 3315 }, { "entropy": 6.900880765914917, "epoch": 0.23561974379901351, "grad_norm": 1.078125, "learning_rate": 0.00010483016444341887, "loss": 6.6185, "mean_token_accuracy": 0.11699626222252846, "num_tokens": 7197210.0, "step": 3320 }, { "entropy": 6.9281552791595455, "epoch": 0.23597459281075903, "grad_norm": 0.9609375, "learning_rate": 0.00010406177411465654, "loss": 6.7186, "mean_token_accuracy": 0.1193569615483284, "num_tokens": 7209830.0, "step": 3325 }, { "entropy": 6.900598859786987, "epoch": 0.23632944182250454, "grad_norm": 1.0078125, "learning_rate": 0.00010329807014370562, "loss": 6.6717, "mean_token_accuracy": 0.12067487388849259, "num_tokens": 7220418.0, "step": 3330 }, { "entropy": 6.939119815826416, "epoch": 0.23668429083425002, "grad_norm": 1.09375, "learning_rate": 0.00010253907346789632, "loss": 6.7325, "mean_token_accuracy": 0.11611759215593338, "num_tokens": 7231346.0, "step": 3335 }, { "entropy": 6.894758605957032, "epoch": 0.23703913984599553, "grad_norm": 1.0546875, "learning_rate": 0.00010178480489550596, "loss": 6.6841, "mean_token_accuracy": 0.11972085833549499, "num_tokens": 7241601.0, "step": 3340 }, { "entropy": 6.89703402519226, "epoch": 0.23739398885774102, "grad_norm": 1.0078125, "learning_rate": 0.00010103528510518836, "loss": 6.7194, "mean_token_accuracy": 0.11930551305413246, "num_tokens": 7251593.0, "step": 3345 }, { "entropy": 6.949892139434814, "epoch": 0.23774883786948653, "grad_norm": 0.984375, "learning_rate": 0.0001002905346454073, "loss": 6.6969, "mean_token_accuracy": 0.11625106632709503, "num_tokens": 7261847.0, "step": 3350 }, { "entropy": 6.926833295822144, "epoch": 0.23810368688123204, "grad_norm": 0.98046875, "learning_rate": 9.955057393387285e-05, "loss": 6.6547, "mean_token_accuracy": 0.11575050577521324, "num_tokens": 7272776.0, "step": 3355 }, { "entropy": 6.9255749702453615, "epoch": 0.23845853589297752, "grad_norm": 1.03125, "learning_rate": 9.88154232569816e-05, "loss": 6.7156, "mean_token_accuracy": 0.11705949753522873, "num_tokens": 7283209.0, "step": 3360 }, { "entropy": 6.934648704528809, "epoch": 0.23881338490472304, "grad_norm": 0.98046875, "learning_rate": 9.808510276926075e-05, "loss": 6.7329, "mean_token_accuracy": 0.11349123865365982, "num_tokens": 7295689.0, "step": 3365 }, { "entropy": 6.959022426605225, "epoch": 0.23916823391646855, "grad_norm": 0.98046875, "learning_rate": 9.735963249281549e-05, "loss": 6.7181, "mean_token_accuracy": 0.11319687142968178, "num_tokens": 7306387.0, "step": 3370 }, { "entropy": 6.982965707778931, "epoch": 0.23952308292821403, "grad_norm": 0.9609375, "learning_rate": 9.663903231677974e-05, "loss": 6.7066, "mean_token_accuracy": 0.11758791878819466, "num_tokens": 7316309.0, "step": 3375 }, { "entropy": 6.930968475341797, "epoch": 0.23987793193995954, "grad_norm": 0.9765625, "learning_rate": 9.592332199677145e-05, "loss": 6.685, "mean_token_accuracy": 0.11790387853980064, "num_tokens": 7327014.0, "step": 3380 }, { "entropy": 6.944451522827149, "epoch": 0.24023278095170505, "grad_norm": 0.9375, "learning_rate": 9.521252115435061e-05, "loss": 6.7385, "mean_token_accuracy": 0.11535362228751182, "num_tokens": 7338988.0, "step": 3385 }, { "entropy": 6.884167432785034, "epoch": 0.24058762996345054, "grad_norm": 0.98046875, "learning_rate": 9.450664927648126e-05, "loss": 6.6508, "mean_token_accuracy": 0.11925841495394707, "num_tokens": 7350157.0, "step": 3390 }, { "entropy": 6.876544237136841, "epoch": 0.24094247897519605, "grad_norm": 1.0078125, "learning_rate": 9.380572571499758e-05, "loss": 6.7284, "mean_token_accuracy": 0.1159207582473755, "num_tokens": 7361150.0, "step": 3395 }, { "entropy": 6.894723176956177, "epoch": 0.24129732798694156, "grad_norm": 1.03125, "learning_rate": 9.310976968607307e-05, "loss": 6.731, "mean_token_accuracy": 0.11307122632861137, "num_tokens": 7371402.0, "step": 3400 }, { "entropy": 6.9833005428314205, "epoch": 0.24165217699868705, "grad_norm": 1.046875, "learning_rate": 9.241880026969381e-05, "loss": 6.7352, "mean_token_accuracy": 0.11756485924124718, "num_tokens": 7383408.0, "step": 3405 }, { "entropy": 6.961392974853515, "epoch": 0.24200702601043256, "grad_norm": 0.97265625, "learning_rate": 9.173283640913537e-05, "loss": 6.7165, "mean_token_accuracy": 0.1206088550388813, "num_tokens": 7394279.0, "step": 3410 }, { "entropy": 6.898759508132935, "epoch": 0.24236187502217807, "grad_norm": 1.046875, "learning_rate": 9.10518969104436e-05, "loss": 6.6583, "mean_token_accuracy": 0.12198479548096657, "num_tokens": 7404378.0, "step": 3415 }, { "entropy": 6.918609380722046, "epoch": 0.24271672403392355, "grad_norm": 1.015625, "learning_rate": 9.037600044191868e-05, "loss": 6.6528, "mean_token_accuracy": 0.12128686606884002, "num_tokens": 7414764.0, "step": 3420 }, { "entropy": 6.887308645248413, "epoch": 0.24307157304566906, "grad_norm": 0.98828125, "learning_rate": 8.970516553360383e-05, "loss": 6.6972, "mean_token_accuracy": 0.11562930271029473, "num_tokens": 7424812.0, "step": 3425 }, { "entropy": 6.895921945571899, "epoch": 0.24342642205741458, "grad_norm": 0.96484375, "learning_rate": 8.903941057677692e-05, "loss": 6.6579, "mean_token_accuracy": 0.12255302146077156, "num_tokens": 7435950.0, "step": 3430 }, { "entropy": 6.885326671600342, "epoch": 0.24378127106916006, "grad_norm": 0.98046875, "learning_rate": 8.837875382344635e-05, "loss": 6.6393, "mean_token_accuracy": 0.1146620586514473, "num_tokens": 7447014.0, "step": 3435 }, { "entropy": 6.936746978759766, "epoch": 0.24413612008090557, "grad_norm": 1.046875, "learning_rate": 8.772321338585076e-05, "loss": 6.774, "mean_token_accuracy": 0.11369867399334907, "num_tokens": 7457407.0, "step": 3440 }, { "entropy": 6.993791627883911, "epoch": 0.24449096909265108, "grad_norm": 1.21875, "learning_rate": 8.707280723596242e-05, "loss": 6.7533, "mean_token_accuracy": 0.11441439390182495, "num_tokens": 7467702.0, "step": 3445 }, { "entropy": 6.904029130935669, "epoch": 0.24484581810439657, "grad_norm": 1.0, "learning_rate": 8.64275532049944e-05, "loss": 6.7329, "mean_token_accuracy": 0.11672649085521698, "num_tokens": 7478600.0, "step": 3450 }, { "entropy": 6.91153998374939, "epoch": 0.24520066711614208, "grad_norm": 1.078125, "learning_rate": 8.578746898291198e-05, "loss": 6.6492, "mean_token_accuracy": 0.12071453183889388, "num_tokens": 7489506.0, "step": 3455 }, { "entropy": 6.917312812805176, "epoch": 0.2455555161278876, "grad_norm": 1.0546875, "learning_rate": 8.515257211794742e-05, "loss": 6.7254, "mean_token_accuracy": 0.11843133196234704, "num_tokens": 7500868.0, "step": 3460 }, { "entropy": 6.910033273696899, "epoch": 0.24591036513963307, "grad_norm": 0.9921875, "learning_rate": 8.452288001611896e-05, "loss": 6.7207, "mean_token_accuracy": 0.11954324990510941, "num_tokens": 7512112.0, "step": 3465 }, { "entropy": 6.897333860397339, "epoch": 0.2462652141513786, "grad_norm": 1.0078125, "learning_rate": 8.389840994075379e-05, "loss": 6.6762, "mean_token_accuracy": 0.1220260314643383, "num_tokens": 7521991.0, "step": 3470 }, { "entropy": 6.927293682098389, "epoch": 0.2466200631631241, "grad_norm": 1.1171875, "learning_rate": 8.327917901201435e-05, "loss": 6.7231, "mean_token_accuracy": 0.11752912998199463, "num_tokens": 7533348.0, "step": 3475 }, { "entropy": 6.929921293258667, "epoch": 0.24697491217486958, "grad_norm": 1.1015625, "learning_rate": 8.266520420642931e-05, "loss": 6.6797, "mean_token_accuracy": 0.11157228797674179, "num_tokens": 7544216.0, "step": 3480 }, { "entropy": 6.974991369247436, "epoch": 0.2473297611866151, "grad_norm": 1.0546875, "learning_rate": 8.205650235642828e-05, "loss": 6.6547, "mean_token_accuracy": 0.11899005919694901, "num_tokens": 7554680.0, "step": 3485 }, { "entropy": 6.893148899078369, "epoch": 0.2476846101983606, "grad_norm": 1.296875, "learning_rate": 8.145309014987978e-05, "loss": 6.6183, "mean_token_accuracy": 0.12230683043599129, "num_tokens": 7566447.0, "step": 3490 }, { "entropy": 6.903786039352417, "epoch": 0.2480394592101061, "grad_norm": 0.890625, "learning_rate": 8.085498412963437e-05, "loss": 6.6682, "mean_token_accuracy": 0.11672690510749817, "num_tokens": 7576740.0, "step": 3495 }, { "entropy": 6.8675392150878904, "epoch": 0.2483943082218516, "grad_norm": 1.03125, "learning_rate": 8.026220069307078e-05, "loss": 6.6495, "mean_token_accuracy": 0.12221679538488388, "num_tokens": 7586934.0, "step": 3500 }, { "entropy": 6.861029815673828, "epoch": 0.2487491572335971, "grad_norm": 1.046875, "learning_rate": 7.967475609164621e-05, "loss": 6.6728, "mean_token_accuracy": 0.11949237585067748, "num_tokens": 7597057.0, "step": 3505 }, { "entropy": 6.888288068771362, "epoch": 0.2491040062453426, "grad_norm": 0.96875, "learning_rate": 7.909266643045124e-05, "loss": 6.7059, "mean_token_accuracy": 0.12211771532893181, "num_tokens": 7607862.0, "step": 3510 }, { "entropy": 6.922192668914795, "epoch": 0.2494588552570881, "grad_norm": 0.96875, "learning_rate": 7.851594766776802e-05, "loss": 6.6217, "mean_token_accuracy": 0.11825456395745278, "num_tokens": 7618177.0, "step": 3515 }, { "entropy": 6.901932573318481, "epoch": 0.24981370426883362, "grad_norm": 1.09375, "learning_rate": 7.794461561463265e-05, "loss": 6.6505, "mean_token_accuracy": 0.11542822048068047, "num_tokens": 7627421.0, "step": 3520 }, { "entropy": 6.9293403148651125, "epoch": 0.25016855328057913, "grad_norm": 1.046875, "learning_rate": 7.7378685934402e-05, "loss": 6.679, "mean_token_accuracy": 0.1198351226747036, "num_tokens": 7637925.0, "step": 3525 }, { "entropy": 6.8656940937042235, "epoch": 0.2505234022923246, "grad_norm": 0.9765625, "learning_rate": 7.68181741423242e-05, "loss": 6.6571, "mean_token_accuracy": 0.11692882925271988, "num_tokens": 7650017.0, "step": 3530 }, { "entropy": 6.934590530395508, "epoch": 0.2508782513040701, "grad_norm": 1.015625, "learning_rate": 7.626309560511313e-05, "loss": 6.6411, "mean_token_accuracy": 0.11810349896550179, "num_tokens": 7659486.0, "step": 3535 }, { "entropy": 6.949629020690918, "epoch": 0.25123310031581564, "grad_norm": 1.0234375, "learning_rate": 7.571346554052724e-05, "loss": 6.7198, "mean_token_accuracy": 0.11788795962929725, "num_tokens": 7670112.0, "step": 3540 }, { "entropy": 6.965910148620606, "epoch": 0.2515879493275611, "grad_norm": 1.0546875, "learning_rate": 7.516929901695249e-05, "loss": 6.6778, "mean_token_accuracy": 0.11800421997904778, "num_tokens": 7680694.0, "step": 3545 }, { "entropy": 6.911430931091308, "epoch": 0.2519427983393066, "grad_norm": 0.9765625, "learning_rate": 7.463061095298893e-05, "loss": 6.6793, "mean_token_accuracy": 0.12085908353328705, "num_tokens": 7691325.0, "step": 3550 }, { "entropy": 6.91486668586731, "epoch": 0.25229764735105215, "grad_norm": 1.125, "learning_rate": 7.409741611704198e-05, "loss": 6.7267, "mean_token_accuracy": 0.11704744473099708, "num_tokens": 7701357.0, "step": 3555 }, { "entropy": 6.929149150848389, "epoch": 0.25265249636279763, "grad_norm": 1.0625, "learning_rate": 7.35697291269174e-05, "loss": 6.658, "mean_token_accuracy": 0.11903805285692215, "num_tokens": 7712413.0, "step": 3560 }, { "entropy": 6.8867885112762455, "epoch": 0.2530073453745431, "grad_norm": 1.1015625, "learning_rate": 7.304756444942056e-05, "loss": 6.6408, "mean_token_accuracy": 0.12372073084115982, "num_tokens": 7722368.0, "step": 3565 }, { "entropy": 6.907924747467041, "epoch": 0.25336219438628865, "grad_norm": 0.953125, "learning_rate": 7.253093639995994e-05, "loss": 6.6998, "mean_token_accuracy": 0.11535773724317551, "num_tokens": 7732400.0, "step": 3570 }, { "entropy": 6.886477708816528, "epoch": 0.25371704339803414, "grad_norm": 1.0390625, "learning_rate": 7.20198591421544e-05, "loss": 6.6433, "mean_token_accuracy": 0.12137167230248451, "num_tokens": 7743039.0, "step": 3575 }, { "entropy": 6.903571033477784, "epoch": 0.2540718924097796, "grad_norm": 1.0546875, "learning_rate": 7.151434668744517e-05, "loss": 6.664, "mean_token_accuracy": 0.12039644718170166, "num_tokens": 7753330.0, "step": 3580 }, { "entropy": 6.927321577072144, "epoch": 0.25442674142152516, "grad_norm": 1.0390625, "learning_rate": 7.101441289471153e-05, "loss": 6.8305, "mean_token_accuracy": 0.11104075610637665, "num_tokens": 7766025.0, "step": 3585 }, { "entropy": 6.935055541992187, "epoch": 0.25478159043327064, "grad_norm": 0.87890625, "learning_rate": 7.052007146989098e-05, "loss": 6.665, "mean_token_accuracy": 0.11942187026143074, "num_tokens": 7778019.0, "step": 3590 }, { "entropy": 6.958627414703369, "epoch": 0.2551364394450161, "grad_norm": 1.0234375, "learning_rate": 7.003133596560341e-05, "loss": 6.6767, "mean_token_accuracy": 0.11973414793610573, "num_tokens": 7788270.0, "step": 3595 }, { "entropy": 6.89090781211853, "epoch": 0.25549128845676167, "grad_norm": 0.9609375, "learning_rate": 6.954821978077952e-05, "loss": 6.6036, "mean_token_accuracy": 0.11703894287347794, "num_tokens": 7798840.0, "step": 3600 }, { "entropy": 6.909499025344848, "epoch": 0.25584613746850715, "grad_norm": 1.0859375, "learning_rate": 6.907073616029356e-05, "loss": 6.681, "mean_token_accuracy": 0.12205352336168289, "num_tokens": 7809518.0, "step": 3605 }, { "entropy": 6.878241539001465, "epoch": 0.25620098648025263, "grad_norm": 1.0390625, "learning_rate": 6.85988981946002e-05, "loss": 6.6909, "mean_token_accuracy": 0.10755472555756569, "num_tokens": 7821330.0, "step": 3610 }, { "entropy": 6.925350141525269, "epoch": 0.2565558354919982, "grad_norm": 1.0234375, "learning_rate": 6.813271881937564e-05, "loss": 6.7109, "mean_token_accuracy": 0.11788954213261604, "num_tokens": 7832197.0, "step": 3615 }, { "entropy": 6.881024694442749, "epoch": 0.25691068450374366, "grad_norm": 0.96875, "learning_rate": 6.767221081516286e-05, "loss": 6.588, "mean_token_accuracy": 0.1230659082531929, "num_tokens": 7843211.0, "step": 3620 }, { "entropy": 6.960159206390381, "epoch": 0.25726553351548914, "grad_norm": 1.125, "learning_rate": 6.72173868070215e-05, "loss": 6.7808, "mean_token_accuracy": 0.11099758520722389, "num_tokens": 7853978.0, "step": 3625 }, { "entropy": 6.953175163269043, "epoch": 0.2576203825272347, "grad_norm": 1.0390625, "learning_rate": 6.676825926418149e-05, "loss": 6.6799, "mean_token_accuracy": 0.11211542040109634, "num_tokens": 7864997.0, "step": 3630 }, { "entropy": 6.890735101699829, "epoch": 0.25797523153898017, "grad_norm": 1.0390625, "learning_rate": 6.632484049970122e-05, "loss": 6.6225, "mean_token_accuracy": 0.11647328063845634, "num_tokens": 7876661.0, "step": 3635 }, { "entropy": 6.9656445503234865, "epoch": 0.25833008055072565, "grad_norm": 0.9765625, "learning_rate": 6.588714267013019e-05, "loss": 6.764, "mean_token_accuracy": 0.11779887527227402, "num_tokens": 7887371.0, "step": 3640 }, { "entropy": 6.9499565124511715, "epoch": 0.2586849295624712, "grad_norm": 1.0234375, "learning_rate": 6.545517777517544e-05, "loss": 6.6805, "mean_token_accuracy": 0.11770134717226029, "num_tokens": 7897525.0, "step": 3645 }, { "entropy": 6.946199750900268, "epoch": 0.2590397785742167, "grad_norm": 0.95703125, "learning_rate": 6.502895765737281e-05, "loss": 6.7235, "mean_token_accuracy": 0.1178074173629284, "num_tokens": 7908435.0, "step": 3650 }, { "entropy": 6.921179342269897, "epoch": 0.25939462758596216, "grad_norm": 1.0703125, "learning_rate": 6.460849400176212e-05, "loss": 6.6916, "mean_token_accuracy": 0.1157444454729557, "num_tokens": 7918715.0, "step": 3655 }, { "entropy": 6.931416177749634, "epoch": 0.2597494765977077, "grad_norm": 1.0, "learning_rate": 6.419379833556694e-05, "loss": 6.6955, "mean_token_accuracy": 0.11740139499306679, "num_tokens": 7929402.0, "step": 3660 }, { "entropy": 6.880896282196045, "epoch": 0.2601043256094532, "grad_norm": 0.99609375, "learning_rate": 6.378488202787835e-05, "loss": 6.6451, "mean_token_accuracy": 0.11704148054122925, "num_tokens": 7939798.0, "step": 3665 }, { "entropy": 6.927146577835083, "epoch": 0.26045917462119866, "grad_norm": 0.96484375, "learning_rate": 6.33817562893435e-05, "loss": 6.6814, "mean_token_accuracy": 0.11822885200381279, "num_tokens": 7950544.0, "step": 3670 }, { "entropy": 6.933592939376831, "epoch": 0.2608140236329442, "grad_norm": 1.0625, "learning_rate": 6.29844321718582e-05, "loss": 6.7151, "mean_token_accuracy": 0.11442160904407501, "num_tokens": 7961251.0, "step": 3675 }, { "entropy": 6.898577785491943, "epoch": 0.2611688726446897, "grad_norm": 0.9765625, "learning_rate": 6.259292056826383e-05, "loss": 6.5891, "mean_token_accuracy": 0.12350033447146416, "num_tokens": 7971909.0, "step": 3680 }, { "entropy": 6.908445596694946, "epoch": 0.26152372165643517, "grad_norm": 1.09375, "learning_rate": 6.220723221204873e-05, "loss": 6.6068, "mean_token_accuracy": 0.11457800269126892, "num_tokens": 7982233.0, "step": 3685 }, { "entropy": 6.8943500995635985, "epoch": 0.2618785706681807, "grad_norm": 1.046875, "learning_rate": 6.182737767705406e-05, "loss": 6.6803, "mean_token_accuracy": 0.11808677315711975, "num_tokens": 7993106.0, "step": 3690 }, { "entropy": 6.923571586608887, "epoch": 0.2622334196799262, "grad_norm": 0.91796875, "learning_rate": 6.145336737718375e-05, "loss": 6.6325, "mean_token_accuracy": 0.12257145568728448, "num_tokens": 8003573.0, "step": 3695 }, { "entropy": 6.928370189666748, "epoch": 0.2625882686916717, "grad_norm": 1.1484375, "learning_rate": 6.10852115661191e-05, "loss": 6.6751, "mean_token_accuracy": 0.12011749297380447, "num_tokens": 8015754.0, "step": 3700 }, { "entropy": 6.903116941452026, "epoch": 0.2629431177034172, "grad_norm": 1.0390625, "learning_rate": 6.072292033703766e-05, "loss": 6.6714, "mean_token_accuracy": 0.11671165302395821, "num_tokens": 8027052.0, "step": 3705 }, { "entropy": 6.932568502426148, "epoch": 0.2632979667151627, "grad_norm": 1.0390625, "learning_rate": 6.036650362233648e-05, "loss": 6.696, "mean_token_accuracy": 0.11432547047734261, "num_tokens": 8037012.0, "step": 3710 }, { "entropy": 6.931543302536011, "epoch": 0.2636528157269082, "grad_norm": 1.03125, "learning_rate": 6.0015971193359824e-05, "loss": 6.6487, "mean_token_accuracy": 0.12174257934093476, "num_tokens": 8048262.0, "step": 3715 }, { "entropy": 6.930430459976196, "epoch": 0.2640076647386537, "grad_norm": 1.015625, "learning_rate": 5.9671332660131306e-05, "loss": 6.699, "mean_token_accuracy": 0.11781065538525581, "num_tokens": 8058596.0, "step": 3720 }, { "entropy": 6.929144048690796, "epoch": 0.2643625137503992, "grad_norm": 0.95703125, "learning_rate": 5.933259747109042e-05, "loss": 6.6519, "mean_token_accuracy": 0.11106657981872559, "num_tokens": 8069844.0, "step": 3725 }, { "entropy": 6.88266658782959, "epoch": 0.2647173627621447, "grad_norm": 1.015625, "learning_rate": 5.899977491283351e-05, "loss": 6.6881, "mean_token_accuracy": 0.12003748938441276, "num_tokens": 8081846.0, "step": 3730 }, { "entropy": 6.920104074478149, "epoch": 0.26507221177389023, "grad_norm": 0.99609375, "learning_rate": 5.867287410985908e-05, "loss": 6.6991, "mean_token_accuracy": 0.11774004176259041, "num_tokens": 8093022.0, "step": 3735 }, { "entropy": 6.895397806167603, "epoch": 0.2654270607856357, "grad_norm": 1.109375, "learning_rate": 5.835190402431779e-05, "loss": 6.6226, "mean_token_accuracy": 0.12504190653562547, "num_tokens": 8103611.0, "step": 3740 }, { "entropy": 6.899374628067017, "epoch": 0.2657819097973812, "grad_norm": 0.94140625, "learning_rate": 5.803687345576673e-05, "loss": 6.6881, "mean_token_accuracy": 0.11690897643566131, "num_tokens": 8114790.0, "step": 3745 }, { "entropy": 6.932241773605346, "epoch": 0.26613675880912674, "grad_norm": 0.94921875, "learning_rate": 5.7727791040927977e-05, "loss": 6.7148, "mean_token_accuracy": 0.11744922772049904, "num_tokens": 8126381.0, "step": 3750 }, { "entropy": 6.960609054565429, "epoch": 0.2664916078208722, "grad_norm": 0.99609375, "learning_rate": 5.742466525345213e-05, "loss": 6.6522, "mean_token_accuracy": 0.12371964380145073, "num_tokens": 8136350.0, "step": 3755 }, { "entropy": 6.941921281814575, "epoch": 0.2668464568326177, "grad_norm": 0.94921875, "learning_rate": 5.7127504403685775e-05, "loss": 6.6532, "mean_token_accuracy": 0.1170349232852459, "num_tokens": 8147423.0, "step": 3760 }, { "entropy": 6.923337173461914, "epoch": 0.26720130584436325, "grad_norm": 0.9921875, "learning_rate": 5.6836316638443664e-05, "loss": 6.7022, "mean_token_accuracy": 0.11876644045114518, "num_tokens": 8159038.0, "step": 3765 }, { "entropy": 6.921943235397339, "epoch": 0.26755615485610873, "grad_norm": 1.0, "learning_rate": 5.655110994078553e-05, "loss": 6.6928, "mean_token_accuracy": 0.10893744677305221, "num_tokens": 8170090.0, "step": 3770 }, { "entropy": 6.947346019744873, "epoch": 0.2679110038678542, "grad_norm": 1.0703125, "learning_rate": 5.6271892129797056e-05, "loss": 6.7596, "mean_token_accuracy": 0.11551009640097618, "num_tokens": 8180850.0, "step": 3775 }, { "entropy": 6.864495182037354, "epoch": 0.26826585287959975, "grad_norm": 0.92578125, "learning_rate": 5.599867086037556e-05, "loss": 6.5669, "mean_token_accuracy": 0.12351947873830796, "num_tokens": 8192060.0, "step": 3780 }, { "entropy": 6.8995952129364015, "epoch": 0.26862070189134524, "grad_norm": 1.015625, "learning_rate": 5.573145362302012e-05, "loss": 6.6326, "mean_token_accuracy": 0.11770756691694259, "num_tokens": 8202481.0, "step": 3785 }, { "entropy": 6.8297656059265135, "epoch": 0.2689755509030907, "grad_norm": 0.9609375, "learning_rate": 5.5470247743626404e-05, "loss": 6.5658, "mean_token_accuracy": 0.11838041692972183, "num_tokens": 8213380.0, "step": 3790 }, { "entropy": 6.906297636032105, "epoch": 0.26933039991483626, "grad_norm": 1.0625, "learning_rate": 5.5215060383285414e-05, "loss": 6.5728, "mean_token_accuracy": 0.129020606726408, "num_tokens": 8224134.0, "step": 3795 }, { "entropy": 6.911903619766235, "epoch": 0.26968524892658174, "grad_norm": 1.0234375, "learning_rate": 5.496589853808759e-05, "loss": 6.7244, "mean_token_accuracy": 0.11370877847075463, "num_tokens": 8234848.0, "step": 3800 }, { "entropy": 6.91424789428711, "epoch": 0.27004009793832723, "grad_norm": 1.0078125, "learning_rate": 5.47227690389308e-05, "loss": 6.7777, "mean_token_accuracy": 0.11399624422192574, "num_tokens": 8246418.0, "step": 3805 }, { "entropy": 6.8825397968292235, "epoch": 0.27039494695007277, "grad_norm": 1.0234375, "learning_rate": 5.448567855133306e-05, "loss": 6.7259, "mean_token_accuracy": 0.11647468656301499, "num_tokens": 8257381.0, "step": 3810 }, { "entropy": 6.904556608200073, "epoch": 0.27074979596181825, "grad_norm": 1.0078125, "learning_rate": 5.425463357524986e-05, "loss": 6.6413, "mean_token_accuracy": 0.11780207231640816, "num_tokens": 8268081.0, "step": 3815 }, { "entropy": 6.906604909896851, "epoch": 0.27110464497356374, "grad_norm": 1.0078125, "learning_rate": 5.402964044489591e-05, "loss": 6.6862, "mean_token_accuracy": 0.11650073826313019, "num_tokens": 8279249.0, "step": 3820 }, { "entropy": 6.922502040863037, "epoch": 0.2714594939853093, "grad_norm": 0.99609375, "learning_rate": 5.381070532857153e-05, "loss": 6.7084, "mean_token_accuracy": 0.12033580988645554, "num_tokens": 8290393.0, "step": 3825 }, { "entropy": 6.929503679275513, "epoch": 0.27181434299705476, "grad_norm": 0.94921875, "learning_rate": 5.359783422849357e-05, "loss": 6.6851, "mean_token_accuracy": 0.1163526363670826, "num_tokens": 8301433.0, "step": 3830 }, { "entropy": 6.92271409034729, "epoch": 0.27216919200880024, "grad_norm": 1.0, "learning_rate": 5.3391032980630736e-05, "loss": 6.6818, "mean_token_accuracy": 0.11504198163747788, "num_tokens": 8312619.0, "step": 3835 }, { "entropy": 6.896023178100586, "epoch": 0.2725240410205458, "grad_norm": 1.0, "learning_rate": 5.31903072545437e-05, "loss": 6.6803, "mean_token_accuracy": 0.12109971940517425, "num_tokens": 8323652.0, "step": 3840 }, { "entropy": 6.891341304779052, "epoch": 0.27287889003229127, "grad_norm": 1.015625, "learning_rate": 5.29956625532297e-05, "loss": 6.6238, "mean_token_accuracy": 0.12293785959482192, "num_tokens": 8334958.0, "step": 3845 }, { "entropy": 6.958847713470459, "epoch": 0.27323373904403675, "grad_norm": 1.0, "learning_rate": 5.280710421297146e-05, "loss": 6.6835, "mean_token_accuracy": 0.120095656812191, "num_tokens": 8346240.0, "step": 3850 }, { "entropy": 6.87413477897644, "epoch": 0.2735885880557823, "grad_norm": 0.9921875, "learning_rate": 5.2624637403191165e-05, "loss": 6.6334, "mean_token_accuracy": 0.12251618504524231, "num_tokens": 8357054.0, "step": 3855 }, { "entropy": 6.915471601486206, "epoch": 0.2739434370675278, "grad_norm": 0.9765625, "learning_rate": 5.2448267126308605e-05, "loss": 6.6413, "mean_token_accuracy": 0.11810965240001678, "num_tokens": 8367537.0, "step": 3860 }, { "entropy": 6.940497732162475, "epoch": 0.27429828607927326, "grad_norm": 0.9609375, "learning_rate": 5.2277998217603954e-05, "loss": 6.6921, "mean_token_accuracy": 0.12038057744503021, "num_tokens": 8378883.0, "step": 3865 }, { "entropy": 6.86297574043274, "epoch": 0.2746531350910188, "grad_norm": 0.92578125, "learning_rate": 5.211383534508541e-05, "loss": 6.6545, "mean_token_accuracy": 0.11472266688942909, "num_tokens": 8390256.0, "step": 3870 }, { "entropy": 6.914893102645874, "epoch": 0.2750079841027643, "grad_norm": 0.8984375, "learning_rate": 5.1955783009361044e-05, "loss": 6.6852, "mean_token_accuracy": 0.12082903608679771, "num_tokens": 8402069.0, "step": 3875 }, { "entropy": 6.890155506134033, "epoch": 0.27536283311450976, "grad_norm": 0.9921875, "learning_rate": 5.180384554351543e-05, "loss": 6.6343, "mean_token_accuracy": 0.11720600947737694, "num_tokens": 8413057.0, "step": 3880 }, { "entropy": 6.9145495891571045, "epoch": 0.2757176821262553, "grad_norm": 1.265625, "learning_rate": 5.1658027112990976e-05, "loss": 6.6949, "mean_token_accuracy": 0.11869274899363517, "num_tokens": 8423498.0, "step": 3885 }, { "entropy": 6.978256702423096, "epoch": 0.2760725311380008, "grad_norm": 1.0859375, "learning_rate": 5.151833171547365e-05, "loss": 6.7583, "mean_token_accuracy": 0.11291131228208542, "num_tokens": 8436089.0, "step": 3890 }, { "entropy": 6.89947247505188, "epoch": 0.27642738014974627, "grad_norm": 0.94921875, "learning_rate": 5.1384763180783274e-05, "loss": 6.6264, "mean_token_accuracy": 0.12786499485373498, "num_tokens": 8447229.0, "step": 3895 }, { "entropy": 6.890417098999023, "epoch": 0.2767822291614918, "grad_norm": 1.03125, "learning_rate": 5.125732517076876e-05, "loss": 6.6047, "mean_token_accuracy": 0.11827500388026238, "num_tokens": 8458609.0, "step": 3900 }, { "entropy": 6.972503757476806, "epoch": 0.2771370781732373, "grad_norm": 0.93359375, "learning_rate": 5.113602117920747e-05, "loss": 6.7067, "mean_token_accuracy": 0.1188644677400589, "num_tokens": 8469611.0, "step": 3905 }, { "entropy": 6.930065536499024, "epoch": 0.2774919271849828, "grad_norm": 1.0, "learning_rate": 5.102085453170966e-05, "loss": 6.6483, "mean_token_accuracy": 0.12115825936198235, "num_tokens": 8479876.0, "step": 3910 }, { "entropy": 6.9319757461547855, "epoch": 0.2778467761967283, "grad_norm": 1.25, "learning_rate": 5.091182838562709e-05, "loss": 6.6188, "mean_token_accuracy": 0.12365344688296317, "num_tokens": 8490546.0, "step": 3915 }, { "entropy": 6.9066798210144045, "epoch": 0.2782016252084738, "grad_norm": 1.015625, "learning_rate": 5.0808945729966716e-05, "loss": 6.6893, "mean_token_accuracy": 0.11520710811018944, "num_tokens": 8500743.0, "step": 3920 }, { "entropy": 6.868925666809082, "epoch": 0.2785564742202193, "grad_norm": 1.0625, "learning_rate": 5.071220938530844e-05, "loss": 6.5938, "mean_token_accuracy": 0.11712982580065727, "num_tokens": 8511925.0, "step": 3925 }, { "entropy": 6.890713214874268, "epoch": 0.2789113232319648, "grad_norm": 0.98828125, "learning_rate": 5.0621622003728026e-05, "loss": 6.6374, "mean_token_accuracy": 0.12227466553449631, "num_tokens": 8522985.0, "step": 3930 }, { "entropy": 6.901251649856567, "epoch": 0.2792661722437103, "grad_norm": 1.109375, "learning_rate": 5.053718606872433e-05, "loss": 6.7275, "mean_token_accuracy": 0.11807807758450509, "num_tokens": 8533605.0, "step": 3935 }, { "entropy": 6.908018302917481, "epoch": 0.2796210212554558, "grad_norm": 1.0234375, "learning_rate": 5.0458903895151134e-05, "loss": 6.5982, "mean_token_accuracy": 0.12040912881493568, "num_tokens": 8543432.0, "step": 3940 }, { "entropy": 6.9275435447692875, "epoch": 0.27997587026720133, "grad_norm": 0.93359375, "learning_rate": 5.038677762915381e-05, "loss": 6.6326, "mean_token_accuracy": 0.1237033523619175, "num_tokens": 8554126.0, "step": 3945 }, { "entropy": 6.918662261962891, "epoch": 0.2803307192789468, "grad_norm": 0.99609375, "learning_rate": 5.032080924811033e-05, "loss": 6.7198, "mean_token_accuracy": 0.11921019554138183, "num_tokens": 8565888.0, "step": 3950 }, { "entropy": 6.898773241043091, "epoch": 0.2806855682906923, "grad_norm": 0.98046875, "learning_rate": 5.026100056057718e-05, "loss": 6.5833, "mean_token_accuracy": 0.13030335307121277, "num_tokens": 8576530.0, "step": 3955 }, { "entropy": 6.86242094039917, "epoch": 0.28104041730243784, "grad_norm": 0.95703125, "learning_rate": 5.0207353206239764e-05, "loss": 6.5687, "mean_token_accuracy": 0.12123869508504867, "num_tokens": 8586680.0, "step": 3960 }, { "entropy": 6.947777605056762, "epoch": 0.2813952663141833, "grad_norm": 1.0234375, "learning_rate": 5.0159868655867436e-05, "loss": 6.6621, "mean_token_accuracy": 0.12036449238657951, "num_tokens": 8597855.0, "step": 3965 }, { "entropy": 6.919398593902588, "epoch": 0.2817501153259288, "grad_norm": 1.109375, "learning_rate": 5.011854821127305e-05, "loss": 6.6475, "mean_token_accuracy": 0.12463936805725098, "num_tokens": 8607784.0, "step": 3970 }, { "entropy": 6.943834066390991, "epoch": 0.28210496433767435, "grad_norm": 0.99609375, "learning_rate": 5.008339300527755e-05, "loss": 6.7414, "mean_token_accuracy": 0.11712408363819123, "num_tokens": 8618551.0, "step": 3975 }, { "entropy": 6.955399227142334, "epoch": 0.28245981334941983, "grad_norm": 1.0390625, "learning_rate": 5.005440400167859e-05, "loss": 6.713, "mean_token_accuracy": 0.1156159557402134, "num_tokens": 8629976.0, "step": 3980 }, { "entropy": 6.911387777328491, "epoch": 0.2828146623611653, "grad_norm": 1.0390625, "learning_rate": 5.003158199522442e-05, "loss": 6.6026, "mean_token_accuracy": 0.12028560936450958, "num_tokens": 8639813.0, "step": 3985 }, { "entropy": 6.904646682739258, "epoch": 0.28316951137291085, "grad_norm": 1.0234375, "learning_rate": 5.0014927611591806e-05, "loss": 6.6187, "mean_token_accuracy": 0.12312156781554222, "num_tokens": 8649926.0, "step": 3990 }, { "entropy": 6.8725347995758055, "epoch": 0.28352436038465634, "grad_norm": 0.984375, "learning_rate": 5.000444130736916e-05, "loss": 6.5418, "mean_token_accuracy": 0.11879919618368148, "num_tokens": 8662061.0, "step": 3995 }, { "entropy": 6.871374559402466, "epoch": 0.2838792093964018, "grad_norm": 0.9921875, "learning_rate": 5.0000123370043736e-05, "loss": 6.6512, "mean_token_accuracy": 0.1119718685746193, "num_tokens": 8673356.0, "step": 4000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.2642663960576e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }