{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.17742450587275113, "eval_steps": 500, "global_step": 2500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691987895965577, "epoch": 0.00035484901174550227, "grad_norm": 11.625, "learning_rate": 2e-06, "loss": 10.8366, "mean_token_accuracy": 0.0, "num_tokens": 11280.0, "step": 5 }, { "entropy": 10.691946220397949, "epoch": 0.0007096980234910045, "grad_norm": 11.5625, "learning_rate": 4.5e-06, "loss": 10.7735, "mean_token_accuracy": 0.00010460250778123736, "num_tokens": 21887.0, "step": 10 }, { "entropy": 10.69083604812622, "epoch": 0.001064547035236507, "grad_norm": 9.6875, "learning_rate": 7e-06, "loss": 10.5654, "mean_token_accuracy": 0.02854402889497578, "num_tokens": 32911.0, "step": 15 }, { "entropy": 10.66428632736206, "epoch": 0.001419396046982009, "grad_norm": 6.0625, "learning_rate": 9.5e-06, "loss": 10.3144, "mean_token_accuracy": 0.04550958257168532, "num_tokens": 43994.0, "step": 20 }, { "entropy": 10.494576263427735, "epoch": 0.0017742450587275114, "grad_norm": 4.28125, "learning_rate": 1.2e-05, "loss": 10.105, "mean_token_accuracy": 0.041560862213373184, "num_tokens": 54342.0, "step": 25 }, { "entropy": 10.533498859405517, "epoch": 0.002129094070473014, "grad_norm": 2.921875, "learning_rate": 1.4500000000000002e-05, "loss": 9.9509, "mean_token_accuracy": 0.044634624011814596, "num_tokens": 64768.0, "step": 30 }, { "entropy": 10.53185338973999, "epoch": 0.002483943082218516, "grad_norm": 2.59375, "learning_rate": 1.7000000000000003e-05, "loss": 9.9269, "mean_token_accuracy": 0.04376727268099785, "num_tokens": 75530.0, "step": 35 }, { "entropy": 10.487653255462646, "epoch": 0.002838792093964018, "grad_norm": 2.40625, "learning_rate": 1.95e-05, "loss": 9.8511, "mean_token_accuracy": 0.045070053450763224, "num_tokens": 85983.0, "step": 40 }, { "entropy": 10.522008514404297, "epoch": 0.0031936411057095207, "grad_norm": 2.28125, "learning_rate": 2.2e-05, "loss": 9.8344, "mean_token_accuracy": 0.04323017336428166, "num_tokens": 96168.0, "step": 45 }, { "entropy": 10.482469272613525, "epoch": 0.0035484901174550228, "grad_norm": 1.8046875, "learning_rate": 2.4500000000000003e-05, "loss": 9.7891, "mean_token_accuracy": 0.05232359655201435, "num_tokens": 107899.0, "step": 50 }, { "entropy": 10.414291763305664, "epoch": 0.0039033391292005253, "grad_norm": 2.03125, "learning_rate": 2.7e-05, "loss": 9.7448, "mean_token_accuracy": 0.05363052934408188, "num_tokens": 119073.0, "step": 55 }, { "entropy": 10.483110237121583, "epoch": 0.004258188140946028, "grad_norm": 2.03125, "learning_rate": 2.95e-05, "loss": 9.7062, "mean_token_accuracy": 0.05208716280758381, "num_tokens": 129149.0, "step": 60 }, { "entropy": 10.321412563323975, "epoch": 0.00461303715269153, "grad_norm": 1.890625, "learning_rate": 3.2e-05, "loss": 9.5992, "mean_token_accuracy": 0.05521074235439301, "num_tokens": 139045.0, "step": 65 }, { "entropy": 10.363921737670898, "epoch": 0.004967886164437032, "grad_norm": 1.859375, "learning_rate": 3.4500000000000005e-05, "loss": 9.6115, "mean_token_accuracy": 0.054533609002828595, "num_tokens": 150251.0, "step": 70 }, { "entropy": 10.423143291473389, "epoch": 0.005322735176182534, "grad_norm": 1.984375, "learning_rate": 3.7e-05, "loss": 9.5269, "mean_token_accuracy": 0.05440324060618877, "num_tokens": 160230.0, "step": 75 }, { "entropy": 10.341320323944093, "epoch": 0.005677584187928036, "grad_norm": 1.546875, "learning_rate": 3.95e-05, "loss": 9.478, "mean_token_accuracy": 0.05366469696164131, "num_tokens": 170692.0, "step": 80 }, { "entropy": 10.290056896209716, "epoch": 0.006032433199673539, "grad_norm": 2.078125, "learning_rate": 4.2000000000000004e-05, "loss": 9.3959, "mean_token_accuracy": 0.05197730958461762, "num_tokens": 180616.0, "step": 85 }, { "entropy": 10.320787811279297, "epoch": 0.006387282211419041, "grad_norm": 1.7421875, "learning_rate": 4.45e-05, "loss": 9.3057, "mean_token_accuracy": 0.05711167939007282, "num_tokens": 191016.0, "step": 90 }, { "entropy": 10.258602237701416, "epoch": 0.0067421312231645434, "grad_norm": 1.640625, "learning_rate": 4.7000000000000004e-05, "loss": 9.2578, "mean_token_accuracy": 0.05482340231537819, "num_tokens": 202433.0, "step": 95 }, { "entropy": 10.235629463195801, "epoch": 0.0070969802349100455, "grad_norm": 1.40625, "learning_rate": 4.9500000000000004e-05, "loss": 9.2401, "mean_token_accuracy": 0.05469023734331131, "num_tokens": 214586.0, "step": 100 }, { "entropy": 10.223749732971191, "epoch": 0.007451829246655548, "grad_norm": 1.484375, "learning_rate": 5.2e-05, "loss": 9.0977, "mean_token_accuracy": 0.05747384466230869, "num_tokens": 225155.0, "step": 105 }, { "entropy": 10.136597728729248, "epoch": 0.007806678258401051, "grad_norm": 1.4609375, "learning_rate": 5.45e-05, "loss": 8.9983, "mean_token_accuracy": 0.05849210806190967, "num_tokens": 236050.0, "step": 110 }, { "entropy": 10.020172691345214, "epoch": 0.008161527270146553, "grad_norm": 1.375, "learning_rate": 5.7e-05, "loss": 8.8941, "mean_token_accuracy": 0.05953489430248737, "num_tokens": 245825.0, "step": 115 }, { "entropy": 9.979390907287598, "epoch": 0.008516376281892056, "grad_norm": 1.9453125, "learning_rate": 5.9499999999999996e-05, "loss": 8.8174, "mean_token_accuracy": 0.06152731701731682, "num_tokens": 256752.0, "step": 120 }, { "entropy": 9.866498374938965, "epoch": 0.008871225293637557, "grad_norm": 1.15625, "learning_rate": 6.2e-05, "loss": 8.802, "mean_token_accuracy": 0.05181486271321774, "num_tokens": 267603.0, "step": 125 }, { "entropy": 9.726642417907716, "epoch": 0.00922607430538306, "grad_norm": 1.1875, "learning_rate": 6.450000000000001e-05, "loss": 8.7071, "mean_token_accuracy": 0.05791006051003933, "num_tokens": 277478.0, "step": 130 }, { "entropy": 9.658979320526123, "epoch": 0.009580923317128561, "grad_norm": 1.2109375, "learning_rate": 6.7e-05, "loss": 8.66, "mean_token_accuracy": 0.05634133592247963, "num_tokens": 289710.0, "step": 135 }, { "entropy": 9.384044075012207, "epoch": 0.009935772328874064, "grad_norm": 1.1796875, "learning_rate": 6.950000000000001e-05, "loss": 8.5346, "mean_token_accuracy": 0.05907244272530079, "num_tokens": 299295.0, "step": 140 }, { "entropy": 9.350571346282958, "epoch": 0.010290621340619567, "grad_norm": 0.9375, "learning_rate": 7.2e-05, "loss": 8.5165, "mean_token_accuracy": 0.05372942052781582, "num_tokens": 310544.0, "step": 145 }, { "entropy": 9.217219734191895, "epoch": 0.010645470352365068, "grad_norm": 1.09375, "learning_rate": 7.45e-05, "loss": 8.4485, "mean_token_accuracy": 0.05611223764717579, "num_tokens": 321558.0, "step": 150 }, { "entropy": 9.077949619293213, "epoch": 0.011000319364110571, "grad_norm": 1.203125, "learning_rate": 7.7e-05, "loss": 8.44, "mean_token_accuracy": 0.05572409965097904, "num_tokens": 333265.0, "step": 155 }, { "entropy": 8.919435977935791, "epoch": 0.011355168375856073, "grad_norm": 1.1328125, "learning_rate": 7.950000000000001e-05, "loss": 8.3707, "mean_token_accuracy": 0.060116075351834296, "num_tokens": 343406.0, "step": 160 }, { "entropy": 8.981222343444824, "epoch": 0.011710017387601575, "grad_norm": 1.140625, "learning_rate": 8.2e-05, "loss": 8.4388, "mean_token_accuracy": 0.05228844713419676, "num_tokens": 354934.0, "step": 165 }, { "entropy": 8.788821792602539, "epoch": 0.012064866399347078, "grad_norm": 0.95703125, "learning_rate": 8.450000000000001e-05, "loss": 8.3627, "mean_token_accuracy": 0.05599985755980015, "num_tokens": 364991.0, "step": 170 }, { "entropy": 8.838678550720214, "epoch": 0.01241971541109258, "grad_norm": 0.87109375, "learning_rate": 8.7e-05, "loss": 8.3174, "mean_token_accuracy": 0.05698671489953995, "num_tokens": 375362.0, "step": 175 }, { "entropy": 8.669477367401123, "epoch": 0.012774564422838083, "grad_norm": 1.046875, "learning_rate": 8.95e-05, "loss": 8.2929, "mean_token_accuracy": 0.06303150560706854, "num_tokens": 386758.0, "step": 180 }, { "entropy": 8.66919822692871, "epoch": 0.013129413434583584, "grad_norm": 0.9140625, "learning_rate": 9.2e-05, "loss": 8.304, "mean_token_accuracy": 0.061275123804807666, "num_tokens": 397073.0, "step": 185 }, { "entropy": 8.68841199874878, "epoch": 0.013484262446329087, "grad_norm": 0.85546875, "learning_rate": 9.45e-05, "loss": 8.4007, "mean_token_accuracy": 0.05668871849775314, "num_tokens": 408098.0, "step": 190 }, { "entropy": 8.577757740020752, "epoch": 0.01383911145807459, "grad_norm": 1.2109375, "learning_rate": 9.7e-05, "loss": 8.2425, "mean_token_accuracy": 0.06331006735563278, "num_tokens": 418910.0, "step": 195 }, { "entropy": 8.616193675994873, "epoch": 0.014193960469820091, "grad_norm": 1.0546875, "learning_rate": 9.95e-05, "loss": 8.3266, "mean_token_accuracy": 0.059384917840361595, "num_tokens": 429328.0, "step": 200 }, { "entropy": 8.564495944976807, "epoch": 0.014548809481565594, "grad_norm": 1.96875, "learning_rate": 0.000102, "loss": 8.286, "mean_token_accuracy": 0.058925506100058554, "num_tokens": 440293.0, "step": 205 }, { "entropy": 8.546427249908447, "epoch": 0.014903658493311095, "grad_norm": 1.28125, "learning_rate": 0.00010449999999999999, "loss": 8.2513, "mean_token_accuracy": 0.057647600024938586, "num_tokens": 451509.0, "step": 210 }, { "entropy": 8.532197761535645, "epoch": 0.015258507505056598, "grad_norm": 0.91015625, "learning_rate": 0.000107, "loss": 8.258, "mean_token_accuracy": 0.058545221015810965, "num_tokens": 461660.0, "step": 215 }, { "entropy": 8.52504529953003, "epoch": 0.015613356516802101, "grad_norm": 1.1953125, "learning_rate": 0.0001095, "loss": 8.2467, "mean_token_accuracy": 0.0674739558249712, "num_tokens": 471362.0, "step": 220 }, { "entropy": 8.518447113037109, "epoch": 0.015968205528547604, "grad_norm": 1.15625, "learning_rate": 0.000112, "loss": 8.1115, "mean_token_accuracy": 0.07247221358120441, "num_tokens": 482036.0, "step": 225 }, { "entropy": 8.392018604278565, "epoch": 0.016323054540293105, "grad_norm": 1.0703125, "learning_rate": 0.0001145, "loss": 8.2038, "mean_token_accuracy": 0.06354649700224399, "num_tokens": 492633.0, "step": 230 }, { "entropy": 8.478435707092284, "epoch": 0.016677903552038607, "grad_norm": 1.140625, "learning_rate": 0.00011700000000000001, "loss": 8.2366, "mean_token_accuracy": 0.06092475391924381, "num_tokens": 502613.0, "step": 235 }, { "entropy": 8.442237091064452, "epoch": 0.01703275256378411, "grad_norm": 1.1328125, "learning_rate": 0.00011949999999999999, "loss": 8.26, "mean_token_accuracy": 0.06470727063715458, "num_tokens": 513256.0, "step": 240 }, { "entropy": 8.596701526641846, "epoch": 0.017387601575529613, "grad_norm": 1.0625, "learning_rate": 0.000122, "loss": 8.2988, "mean_token_accuracy": 0.061711058393120764, "num_tokens": 523355.0, "step": 245 }, { "entropy": 8.451476860046387, "epoch": 0.017742450587275114, "grad_norm": 1.015625, "learning_rate": 0.0001245, "loss": 8.2216, "mean_token_accuracy": 0.06455190740525722, "num_tokens": 535195.0, "step": 250 }, { "entropy": 8.469265937805176, "epoch": 0.018097299599020615, "grad_norm": 1.046875, "learning_rate": 0.000127, "loss": 8.1852, "mean_token_accuracy": 0.06743233427405357, "num_tokens": 544831.0, "step": 255 }, { "entropy": 8.445653438568115, "epoch": 0.01845214861076612, "grad_norm": 1.2421875, "learning_rate": 0.0001295, "loss": 8.2694, "mean_token_accuracy": 0.059878384508192536, "num_tokens": 555835.0, "step": 260 }, { "entropy": 8.478738117218018, "epoch": 0.01880699762251162, "grad_norm": 1.1796875, "learning_rate": 0.000132, "loss": 8.2247, "mean_token_accuracy": 0.06131057888269424, "num_tokens": 566875.0, "step": 265 }, { "entropy": 8.375457763671875, "epoch": 0.019161846634257122, "grad_norm": 1.09375, "learning_rate": 0.00013450000000000002, "loss": 8.237, "mean_token_accuracy": 0.06333270035684109, "num_tokens": 577462.0, "step": 270 }, { "entropy": 8.501999855041504, "epoch": 0.019516695646002627, "grad_norm": 1.0703125, "learning_rate": 0.00013700000000000002, "loss": 8.1721, "mean_token_accuracy": 0.06697900146245957, "num_tokens": 587569.0, "step": 275 }, { "entropy": 8.420077037811279, "epoch": 0.019871544657748128, "grad_norm": 0.921875, "learning_rate": 0.0001395, "loss": 8.2355, "mean_token_accuracy": 0.05800015553832054, "num_tokens": 599322.0, "step": 280 }, { "entropy": 8.452305221557618, "epoch": 0.02022639366949363, "grad_norm": 0.921875, "learning_rate": 0.00014199999999999998, "loss": 8.2397, "mean_token_accuracy": 0.06376027651131153, "num_tokens": 610060.0, "step": 285 }, { "entropy": 8.481741237640382, "epoch": 0.020581242681239134, "grad_norm": 1.234375, "learning_rate": 0.0001445, "loss": 8.295, "mean_token_accuracy": 0.06520596966147423, "num_tokens": 620091.0, "step": 290 }, { "entropy": 8.525186729431152, "epoch": 0.020936091692984635, "grad_norm": 2.140625, "learning_rate": 0.000147, "loss": 8.12, "mean_token_accuracy": 0.0748389147222042, "num_tokens": 631440.0, "step": 295 }, { "entropy": 8.37361249923706, "epoch": 0.021290940704730137, "grad_norm": 1.015625, "learning_rate": 0.0001495, "loss": 8.0801, "mean_token_accuracy": 0.06787928678095341, "num_tokens": 641374.0, "step": 300 }, { "entropy": 8.305605411529541, "epoch": 0.02164578971647564, "grad_norm": 1.0, "learning_rate": 0.000152, "loss": 8.1269, "mean_token_accuracy": 0.06664356999099255, "num_tokens": 652772.0, "step": 305 }, { "entropy": 8.341912460327148, "epoch": 0.022000638728221143, "grad_norm": 1.1328125, "learning_rate": 0.00015450000000000001, "loss": 8.1348, "mean_token_accuracy": 0.07087188474833965, "num_tokens": 664052.0, "step": 310 }, { "entropy": 8.363450813293458, "epoch": 0.022355487739966644, "grad_norm": 1.03125, "learning_rate": 0.000157, "loss": 8.1412, "mean_token_accuracy": 0.07019479162991046, "num_tokens": 675937.0, "step": 315 }, { "entropy": 8.314255905151366, "epoch": 0.022710336751712145, "grad_norm": 0.93359375, "learning_rate": 0.0001595, "loss": 8.065, "mean_token_accuracy": 0.07636438310146332, "num_tokens": 687149.0, "step": 320 }, { "entropy": 8.342943286895752, "epoch": 0.02306518576345765, "grad_norm": 1.0390625, "learning_rate": 0.000162, "loss": 8.0868, "mean_token_accuracy": 0.06923852488398552, "num_tokens": 697646.0, "step": 325 }, { "entropy": 8.419994449615478, "epoch": 0.02342003477520315, "grad_norm": 1.1484375, "learning_rate": 0.00016450000000000001, "loss": 8.2002, "mean_token_accuracy": 0.06634289510548115, "num_tokens": 708612.0, "step": 330 }, { "entropy": 8.354696655273438, "epoch": 0.023774883786948652, "grad_norm": 1.0546875, "learning_rate": 0.00016700000000000002, "loss": 8.1205, "mean_token_accuracy": 0.07153847180306912, "num_tokens": 719705.0, "step": 335 }, { "entropy": 8.35772638320923, "epoch": 0.024129732798694157, "grad_norm": 0.890625, "learning_rate": 0.00016950000000000003, "loss": 8.0862, "mean_token_accuracy": 0.06683175601065158, "num_tokens": 730552.0, "step": 340 }, { "entropy": 8.334082317352294, "epoch": 0.024484581810439658, "grad_norm": 1.140625, "learning_rate": 0.00017199999999999998, "loss": 8.0935, "mean_token_accuracy": 0.06866642013192177, "num_tokens": 741651.0, "step": 345 }, { "entropy": 8.407394886016846, "epoch": 0.02483943082218516, "grad_norm": 1.03125, "learning_rate": 0.00017449999999999999, "loss": 8.1023, "mean_token_accuracy": 0.06832008063793182, "num_tokens": 751820.0, "step": 350 }, { "entropy": 8.351481819152832, "epoch": 0.025194279833930664, "grad_norm": 1.21875, "learning_rate": 0.000177, "loss": 8.1154, "mean_token_accuracy": 0.06219382137060166, "num_tokens": 762125.0, "step": 355 }, { "entropy": 8.352156829833984, "epoch": 0.025549128845676165, "grad_norm": 0.92578125, "learning_rate": 0.0001795, "loss": 8.0332, "mean_token_accuracy": 0.07175925448536873, "num_tokens": 773137.0, "step": 360 }, { "entropy": 8.26557502746582, "epoch": 0.025903977857421667, "grad_norm": 1.015625, "learning_rate": 0.000182, "loss": 8.117, "mean_token_accuracy": 0.06638101302087307, "num_tokens": 784702.0, "step": 365 }, { "entropy": 8.30114049911499, "epoch": 0.026258826869167168, "grad_norm": 0.9296875, "learning_rate": 0.0001845, "loss": 8.0759, "mean_token_accuracy": 0.06737305559217929, "num_tokens": 795806.0, "step": 370 }, { "entropy": 8.324819755554199, "epoch": 0.026613675880912673, "grad_norm": 0.8515625, "learning_rate": 0.000187, "loss": 8.0175, "mean_token_accuracy": 0.06811637170612812, "num_tokens": 806006.0, "step": 375 }, { "entropy": 8.294619274139404, "epoch": 0.026968524892658174, "grad_norm": 0.98828125, "learning_rate": 0.0001895, "loss": 8.0306, "mean_token_accuracy": 0.0675454068928957, "num_tokens": 816345.0, "step": 380 }, { "entropy": 8.203885173797607, "epoch": 0.027323373904403675, "grad_norm": 0.92578125, "learning_rate": 0.000192, "loss": 8.0311, "mean_token_accuracy": 0.06778408177196979, "num_tokens": 827038.0, "step": 385 }, { "entropy": 8.261708545684815, "epoch": 0.02767822291614918, "grad_norm": 0.84765625, "learning_rate": 0.0001945, "loss": 8.0325, "mean_token_accuracy": 0.07145289778709411, "num_tokens": 837465.0, "step": 390 }, { "entropy": 8.322563171386719, "epoch": 0.02803307192789468, "grad_norm": 1.1015625, "learning_rate": 0.00019700000000000002, "loss": 8.0101, "mean_token_accuracy": 0.0660801563411951, "num_tokens": 848461.0, "step": 395 }, { "entropy": 8.286761474609374, "epoch": 0.028387920939640182, "grad_norm": 1.5390625, "learning_rate": 0.00019950000000000002, "loss": 8.0912, "mean_token_accuracy": 0.06686392053961754, "num_tokens": 859215.0, "step": 400 }, { "entropy": 8.153140926361084, "epoch": 0.028742769951385687, "grad_norm": 0.95703125, "learning_rate": 0.000202, "loss": 7.9714, "mean_token_accuracy": 0.06791464723646641, "num_tokens": 869165.0, "step": 405 }, { "entropy": 8.278606796264649, "epoch": 0.029097618963131188, "grad_norm": 1.1796875, "learning_rate": 0.00020449999999999998, "loss": 8.0299, "mean_token_accuracy": 0.06314935013651848, "num_tokens": 879737.0, "step": 410 }, { "entropy": 8.317267990112304, "epoch": 0.02945246797487669, "grad_norm": 0.97265625, "learning_rate": 0.000207, "loss": 8.0687, "mean_token_accuracy": 0.06716468073427677, "num_tokens": 889960.0, "step": 415 }, { "entropy": 8.284847354888916, "epoch": 0.02980731698662219, "grad_norm": 1.0390625, "learning_rate": 0.0002095, "loss": 8.0315, "mean_token_accuracy": 0.06850776262581348, "num_tokens": 902004.0, "step": 420 }, { "entropy": 8.195465469360352, "epoch": 0.030162165998367695, "grad_norm": 1.015625, "learning_rate": 0.000212, "loss": 7.9605, "mean_token_accuracy": 0.06964701861143112, "num_tokens": 912448.0, "step": 425 }, { "entropy": 8.246010208129883, "epoch": 0.030517015010113197, "grad_norm": 1.1015625, "learning_rate": 0.0002145, "loss": 8.0425, "mean_token_accuracy": 0.06564139947295189, "num_tokens": 922295.0, "step": 430 }, { "entropy": 8.212500381469727, "epoch": 0.030871864021858698, "grad_norm": 1.15625, "learning_rate": 0.00021700000000000002, "loss": 7.9675, "mean_token_accuracy": 0.07113610915839672, "num_tokens": 932849.0, "step": 435 }, { "entropy": 8.252998352050781, "epoch": 0.031226713033604202, "grad_norm": 1.1640625, "learning_rate": 0.0002195, "loss": 7.9716, "mean_token_accuracy": 0.06684075817465782, "num_tokens": 943570.0, "step": 440 }, { "entropy": 8.093912363052368, "epoch": 0.031581562045349704, "grad_norm": 1.0625, "learning_rate": 0.000222, "loss": 8.0064, "mean_token_accuracy": 0.06446249783039093, "num_tokens": 953681.0, "step": 445 }, { "entropy": 8.259466552734375, "epoch": 0.03193641105709521, "grad_norm": 1.0390625, "learning_rate": 0.0002245, "loss": 8.0026, "mean_token_accuracy": 0.06529812254011631, "num_tokens": 965027.0, "step": 450 }, { "entropy": 8.120300006866454, "epoch": 0.032291260068840706, "grad_norm": 1.0703125, "learning_rate": 0.00022700000000000002, "loss": 7.9335, "mean_token_accuracy": 0.06843561045825482, "num_tokens": 975757.0, "step": 455 }, { "entropy": 8.253607749938965, "epoch": 0.03264610908058621, "grad_norm": 0.8359375, "learning_rate": 0.00022950000000000002, "loss": 7.975, "mean_token_accuracy": 0.07162793055176735, "num_tokens": 987354.0, "step": 460 }, { "entropy": 8.038683032989502, "epoch": 0.033000958092331716, "grad_norm": 1.0625, "learning_rate": 0.00023200000000000003, "loss": 7.9604, "mean_token_accuracy": 0.06958170719444752, "num_tokens": 997844.0, "step": 465 }, { "entropy": 8.277831172943115, "epoch": 0.03335580710407721, "grad_norm": 1.1484375, "learning_rate": 0.00023449999999999998, "loss": 8.0444, "mean_token_accuracy": 0.07072999998927117, "num_tokens": 1008748.0, "step": 470 }, { "entropy": 8.073792266845704, "epoch": 0.03371065611582272, "grad_norm": 1.078125, "learning_rate": 0.000237, "loss": 7.8659, "mean_token_accuracy": 0.0738751970231533, "num_tokens": 1018612.0, "step": 475 }, { "entropy": 8.137950706481934, "epoch": 0.03406550512756822, "grad_norm": 1.2578125, "learning_rate": 0.0002395, "loss": 7.9242, "mean_token_accuracy": 0.07282396517693997, "num_tokens": 1029431.0, "step": 480 }, { "entropy": 8.098453617095947, "epoch": 0.03442035413931372, "grad_norm": 1.1328125, "learning_rate": 0.000242, "loss": 7.9572, "mean_token_accuracy": 0.06277543865144253, "num_tokens": 1041255.0, "step": 485 }, { "entropy": 8.044496870040893, "epoch": 0.034775203151059225, "grad_norm": 1.375, "learning_rate": 0.0002445, "loss": 7.7917, "mean_token_accuracy": 0.08647977113723755, "num_tokens": 1052416.0, "step": 490 }, { "entropy": 8.117148971557617, "epoch": 0.03513005216280473, "grad_norm": 0.98046875, "learning_rate": 0.000247, "loss": 7.9132, "mean_token_accuracy": 0.07025011256337166, "num_tokens": 1063801.0, "step": 495 }, { "entropy": 8.052232360839843, "epoch": 0.03548490117455023, "grad_norm": 1.1015625, "learning_rate": 0.0002495, "loss": 7.9351, "mean_token_accuracy": 0.06856431551277638, "num_tokens": 1074984.0, "step": 500 }, { "entropy": 8.149673557281494, "epoch": 0.03583975018629573, "grad_norm": 1.03125, "learning_rate": 0.000252, "loss": 7.8893, "mean_token_accuracy": 0.07065611332654953, "num_tokens": 1086306.0, "step": 505 }, { "entropy": 8.180394887924194, "epoch": 0.03619459919804123, "grad_norm": 1.125, "learning_rate": 0.0002545, "loss": 7.8803, "mean_token_accuracy": 0.06889106482267379, "num_tokens": 1096569.0, "step": 510 }, { "entropy": 8.032092428207397, "epoch": 0.036549448209786735, "grad_norm": 1.15625, "learning_rate": 0.000257, "loss": 7.9032, "mean_token_accuracy": 0.0709243293851614, "num_tokens": 1106599.0, "step": 515 }, { "entropy": 8.193197917938232, "epoch": 0.03690429722153224, "grad_norm": 0.99609375, "learning_rate": 0.0002595, "loss": 7.9409, "mean_token_accuracy": 0.06765258684754372, "num_tokens": 1118337.0, "step": 520 }, { "entropy": 7.961832189559937, "epoch": 0.03725914623327774, "grad_norm": 1.015625, "learning_rate": 0.000262, "loss": 7.9391, "mean_token_accuracy": 0.07329438030719757, "num_tokens": 1129685.0, "step": 525 }, { "entropy": 8.117317533493042, "epoch": 0.03761399524502324, "grad_norm": 0.91015625, "learning_rate": 0.00026450000000000003, "loss": 7.8971, "mean_token_accuracy": 0.07165143899619579, "num_tokens": 1141055.0, "step": 530 }, { "entropy": 8.06903042793274, "epoch": 0.03796884425676875, "grad_norm": 0.86328125, "learning_rate": 0.00026700000000000004, "loss": 7.9105, "mean_token_accuracy": 0.0673241663724184, "num_tokens": 1153130.0, "step": 535 }, { "entropy": 8.082281255722046, "epoch": 0.038323693268514245, "grad_norm": 1.0625, "learning_rate": 0.00026950000000000005, "loss": 7.8957, "mean_token_accuracy": 0.06771765686571599, "num_tokens": 1163764.0, "step": 540 }, { "entropy": 8.043478631973267, "epoch": 0.03867854228025975, "grad_norm": 0.99609375, "learning_rate": 0.00027200000000000005, "loss": 7.8448, "mean_token_accuracy": 0.07466785535216332, "num_tokens": 1173902.0, "step": 545 }, { "entropy": 7.998564767837524, "epoch": 0.039033391292005254, "grad_norm": 1.015625, "learning_rate": 0.0002745, "loss": 7.7856, "mean_token_accuracy": 0.07209023796021938, "num_tokens": 1185055.0, "step": 550 }, { "entropy": 8.057881355285645, "epoch": 0.03938824030375075, "grad_norm": 1.2421875, "learning_rate": 0.000277, "loss": 7.8076, "mean_token_accuracy": 0.07696683742105961, "num_tokens": 1195695.0, "step": 555 }, { "entropy": 7.934873914718628, "epoch": 0.039743089315496256, "grad_norm": 0.9453125, "learning_rate": 0.0002795, "loss": 7.8796, "mean_token_accuracy": 0.07105770707130432, "num_tokens": 1207459.0, "step": 560 }, { "entropy": 7.985773086547852, "epoch": 0.04009793832724176, "grad_norm": 1.0859375, "learning_rate": 0.00028199999999999997, "loss": 7.8242, "mean_token_accuracy": 0.07130814269185067, "num_tokens": 1217533.0, "step": 565 }, { "entropy": 7.973219776153565, "epoch": 0.04045278733898726, "grad_norm": 1.0625, "learning_rate": 0.0002845, "loss": 7.8496, "mean_token_accuracy": 0.07043180353939534, "num_tokens": 1231146.0, "step": 570 }, { "entropy": 7.945406341552735, "epoch": 0.040807636350732764, "grad_norm": 0.97265625, "learning_rate": 0.000287, "loss": 7.8843, "mean_token_accuracy": 0.07025334909558296, "num_tokens": 1243120.0, "step": 575 }, { "entropy": 8.011637639999389, "epoch": 0.04116248536247827, "grad_norm": 0.89453125, "learning_rate": 0.0002895, "loss": 7.9156, "mean_token_accuracy": 0.06993781737983226, "num_tokens": 1255180.0, "step": 580 }, { "entropy": 8.02280888557434, "epoch": 0.041517334374223766, "grad_norm": 1.0078125, "learning_rate": 0.000292, "loss": 7.8431, "mean_token_accuracy": 0.07286351397633553, "num_tokens": 1266382.0, "step": 585 }, { "entropy": 8.03951153755188, "epoch": 0.04187218338596927, "grad_norm": 1.0, "learning_rate": 0.0002945, "loss": 7.805, "mean_token_accuracy": 0.07100504785776138, "num_tokens": 1278184.0, "step": 590 }, { "entropy": 7.95987548828125, "epoch": 0.042227032397714775, "grad_norm": 1.1953125, "learning_rate": 0.000297, "loss": 7.7979, "mean_token_accuracy": 0.07571852058172227, "num_tokens": 1289273.0, "step": 595 }, { "entropy": 7.960937976837158, "epoch": 0.04258188140946027, "grad_norm": 1.3203125, "learning_rate": 0.0002995, "loss": 7.7835, "mean_token_accuracy": 0.07141958326101303, "num_tokens": 1299684.0, "step": 600 }, { "entropy": 8.025558280944825, "epoch": 0.04293673042120578, "grad_norm": 0.9765625, "learning_rate": 0.000302, "loss": 7.8675, "mean_token_accuracy": 0.06696930788457393, "num_tokens": 1310859.0, "step": 605 }, { "entropy": 7.910726022720337, "epoch": 0.04329157943295128, "grad_norm": 1.203125, "learning_rate": 0.0003045, "loss": 7.7781, "mean_token_accuracy": 0.07068931050598622, "num_tokens": 1322011.0, "step": 610 }, { "entropy": 7.939458894729614, "epoch": 0.04364642844469678, "grad_norm": 1.1171875, "learning_rate": 0.000307, "loss": 7.7663, "mean_token_accuracy": 0.07447356693446636, "num_tokens": 1332187.0, "step": 615 }, { "entropy": 7.852445602416992, "epoch": 0.044001277456442285, "grad_norm": 1.5859375, "learning_rate": 0.0003095, "loss": 7.6762, "mean_token_accuracy": 0.07490805983543396, "num_tokens": 1342678.0, "step": 620 }, { "entropy": 7.9485992908477785, "epoch": 0.04435612646818778, "grad_norm": 1.0625, "learning_rate": 0.000312, "loss": 7.8034, "mean_token_accuracy": 0.0721922166645527, "num_tokens": 1352563.0, "step": 625 }, { "entropy": 7.916344928741455, "epoch": 0.04471097547993329, "grad_norm": 0.94140625, "learning_rate": 0.0003145, "loss": 7.8087, "mean_token_accuracy": 0.0754479069262743, "num_tokens": 1363514.0, "step": 630 }, { "entropy": 7.988961410522461, "epoch": 0.04506582449167879, "grad_norm": 1.1875, "learning_rate": 0.000317, "loss": 7.9224, "mean_token_accuracy": 0.06770290434360504, "num_tokens": 1374914.0, "step": 635 }, { "entropy": 7.941910457611084, "epoch": 0.04542067350342429, "grad_norm": 0.9921875, "learning_rate": 0.0003195, "loss": 7.7749, "mean_token_accuracy": 0.07321363165974618, "num_tokens": 1385757.0, "step": 640 }, { "entropy": 7.951854848861695, "epoch": 0.045775522515169795, "grad_norm": 1.0546875, "learning_rate": 0.000322, "loss": 7.7757, "mean_token_accuracy": 0.07017956748604774, "num_tokens": 1397376.0, "step": 645 }, { "entropy": 7.916997385025025, "epoch": 0.0461303715269153, "grad_norm": 0.9765625, "learning_rate": 0.00032450000000000003, "loss": 7.7839, "mean_token_accuracy": 0.07471574619412422, "num_tokens": 1408491.0, "step": 650 }, { "entropy": 7.876117801666259, "epoch": 0.0464852205386608, "grad_norm": 1.2890625, "learning_rate": 0.00032700000000000003, "loss": 7.704, "mean_token_accuracy": 0.09316127598285676, "num_tokens": 1417643.0, "step": 655 }, { "entropy": 7.789826583862305, "epoch": 0.0468400695504063, "grad_norm": 1.0390625, "learning_rate": 0.00032950000000000004, "loss": 7.7654, "mean_token_accuracy": 0.0712949451059103, "num_tokens": 1427446.0, "step": 660 }, { "entropy": 7.888260316848755, "epoch": 0.04719491856215181, "grad_norm": 0.97265625, "learning_rate": 0.00033200000000000005, "loss": 7.7251, "mean_token_accuracy": 0.0718452412635088, "num_tokens": 1437782.0, "step": 665 }, { "entropy": 7.854969501495361, "epoch": 0.047549767573897304, "grad_norm": 0.9296875, "learning_rate": 0.00033450000000000005, "loss": 7.7738, "mean_token_accuracy": 0.07261287756264209, "num_tokens": 1448778.0, "step": 670 }, { "entropy": 7.974173069000244, "epoch": 0.04790461658564281, "grad_norm": 1.0234375, "learning_rate": 0.000337, "loss": 7.7582, "mean_token_accuracy": 0.07418306656181813, "num_tokens": 1460343.0, "step": 675 }, { "entropy": 7.7097618103027346, "epoch": 0.048259465597388314, "grad_norm": 0.94921875, "learning_rate": 0.0003395, "loss": 7.6886, "mean_token_accuracy": 0.07660397589206695, "num_tokens": 1471728.0, "step": 680 }, { "entropy": 7.960760021209717, "epoch": 0.04861431460913381, "grad_norm": 1.078125, "learning_rate": 0.000342, "loss": 7.7778, "mean_token_accuracy": 0.0769094929099083, "num_tokens": 1482946.0, "step": 685 }, { "entropy": 7.7662310123443605, "epoch": 0.048969163620879316, "grad_norm": 1.0703125, "learning_rate": 0.00034449999999999997, "loss": 7.6265, "mean_token_accuracy": 0.0757428240031004, "num_tokens": 1494028.0, "step": 690 }, { "entropy": 7.854742527008057, "epoch": 0.04932401263262482, "grad_norm": 1.1640625, "learning_rate": 0.000347, "loss": 7.7516, "mean_token_accuracy": 0.07619248703122139, "num_tokens": 1503763.0, "step": 695 }, { "entropy": 7.773598098754883, "epoch": 0.04967886164437032, "grad_norm": 0.9765625, "learning_rate": 0.0003495, "loss": 7.6727, "mean_token_accuracy": 0.07600370906293392, "num_tokens": 1514488.0, "step": 700 }, { "entropy": 7.798940801620484, "epoch": 0.05003371065611582, "grad_norm": 1.21875, "learning_rate": 0.000352, "loss": 7.6922, "mean_token_accuracy": 0.07355734147131443, "num_tokens": 1524489.0, "step": 705 }, { "entropy": 7.838931655883789, "epoch": 0.05038855966786133, "grad_norm": 1.0078125, "learning_rate": 0.0003545, "loss": 7.6913, "mean_token_accuracy": 0.07631286308169365, "num_tokens": 1535005.0, "step": 710 }, { "entropy": 7.7826978206634525, "epoch": 0.050743408679606826, "grad_norm": 1.0078125, "learning_rate": 0.000357, "loss": 7.6585, "mean_token_accuracy": 0.07577394507825375, "num_tokens": 1546049.0, "step": 715 }, { "entropy": 7.830225944519043, "epoch": 0.05109825769135233, "grad_norm": 1.234375, "learning_rate": 0.0003595, "loss": 7.6845, "mean_token_accuracy": 0.0732595931738615, "num_tokens": 1556468.0, "step": 720 }, { "entropy": 7.741913080215454, "epoch": 0.05145310670309783, "grad_norm": 1.046875, "learning_rate": 0.000362, "loss": 7.6607, "mean_token_accuracy": 0.08094885796308518, "num_tokens": 1567341.0, "step": 725 }, { "entropy": 7.8365312099456785, "epoch": 0.05180795571484333, "grad_norm": 0.9609375, "learning_rate": 0.0003645, "loss": 7.7157, "mean_token_accuracy": 0.07318115755915641, "num_tokens": 1578492.0, "step": 730 }, { "entropy": 7.815832948684692, "epoch": 0.05216280472658884, "grad_norm": 0.984375, "learning_rate": 0.000367, "loss": 7.6973, "mean_token_accuracy": 0.07630126550793648, "num_tokens": 1589147.0, "step": 735 }, { "entropy": 7.671171092987061, "epoch": 0.052517653738334336, "grad_norm": 1.046875, "learning_rate": 0.0003695, "loss": 7.5389, "mean_token_accuracy": 0.08950962349772454, "num_tokens": 1598725.0, "step": 740 }, { "entropy": 7.733880805969238, "epoch": 0.05287250275007984, "grad_norm": 0.97265625, "learning_rate": 0.000372, "loss": 7.6096, "mean_token_accuracy": 0.07969549223780632, "num_tokens": 1608913.0, "step": 745 }, { "entropy": 7.702016448974609, "epoch": 0.053227351761825345, "grad_norm": 1.0390625, "learning_rate": 0.0003745, "loss": 7.6984, "mean_token_accuracy": 0.07809793129563332, "num_tokens": 1619138.0, "step": 750 }, { "entropy": 7.733037090301513, "epoch": 0.05358220077357084, "grad_norm": 1.5625, "learning_rate": 0.000377, "loss": 7.5857, "mean_token_accuracy": 0.07457101494073867, "num_tokens": 1631217.0, "step": 755 }, { "entropy": 7.7332252025604244, "epoch": 0.05393704978531635, "grad_norm": 0.98828125, "learning_rate": 0.0003795, "loss": 7.66, "mean_token_accuracy": 0.07894963994622231, "num_tokens": 1642552.0, "step": 760 }, { "entropy": 7.6441277980804445, "epoch": 0.05429189879706185, "grad_norm": 0.9765625, "learning_rate": 0.000382, "loss": 7.6736, "mean_token_accuracy": 0.07516682222485542, "num_tokens": 1653422.0, "step": 765 }, { "entropy": 7.763870811462402, "epoch": 0.05464674780880735, "grad_norm": 1.046875, "learning_rate": 0.0003845, "loss": 7.6713, "mean_token_accuracy": 0.07678476013243199, "num_tokens": 1664709.0, "step": 770 }, { "entropy": 7.717665433883667, "epoch": 0.055001596820552855, "grad_norm": 1.0, "learning_rate": 0.00038700000000000003, "loss": 7.6484, "mean_token_accuracy": 0.07786873653531075, "num_tokens": 1676114.0, "step": 775 }, { "entropy": 7.750670051574707, "epoch": 0.05535644583229836, "grad_norm": 1.0, "learning_rate": 0.00038950000000000003, "loss": 7.7339, "mean_token_accuracy": 0.07396974675357341, "num_tokens": 1687558.0, "step": 780 }, { "entropy": 7.702802991867065, "epoch": 0.05571129484404386, "grad_norm": 0.86328125, "learning_rate": 0.00039200000000000004, "loss": 7.6509, "mean_token_accuracy": 0.07516442388296127, "num_tokens": 1699046.0, "step": 785 }, { "entropy": 7.7537883758544925, "epoch": 0.05606614385578936, "grad_norm": 0.99609375, "learning_rate": 0.00039450000000000005, "loss": 7.6358, "mean_token_accuracy": 0.07771104238927365, "num_tokens": 1709274.0, "step": 790 }, { "entropy": 7.673342323303222, "epoch": 0.05642099286753487, "grad_norm": 0.94140625, "learning_rate": 0.00039700000000000005, "loss": 7.5738, "mean_token_accuracy": 0.07565616965293884, "num_tokens": 1720358.0, "step": 795 }, { "entropy": 7.7894445896148685, "epoch": 0.056775841879280364, "grad_norm": 0.9453125, "learning_rate": 0.0003995, "loss": 7.7079, "mean_token_accuracy": 0.08025034442543984, "num_tokens": 1731684.0, "step": 800 }, { "entropy": 7.651151466369629, "epoch": 0.05713069089102587, "grad_norm": 1.2109375, "learning_rate": 0.000402, "loss": 7.6573, "mean_token_accuracy": 0.07534100264310836, "num_tokens": 1741862.0, "step": 805 }, { "entropy": 7.712702083587646, "epoch": 0.057485539902771374, "grad_norm": 0.9921875, "learning_rate": 0.0004045, "loss": 7.6288, "mean_token_accuracy": 0.07567652054131031, "num_tokens": 1753166.0, "step": 810 }, { "entropy": 7.656327629089356, "epoch": 0.05784038891451687, "grad_norm": 1.015625, "learning_rate": 0.00040699999999999997, "loss": 7.6233, "mean_token_accuracy": 0.08203103095293045, "num_tokens": 1764166.0, "step": 815 }, { "entropy": 7.6826342105865475, "epoch": 0.058195237926262376, "grad_norm": 0.953125, "learning_rate": 0.0004095, "loss": 7.5671, "mean_token_accuracy": 0.07672160528600216, "num_tokens": 1774894.0, "step": 820 }, { "entropy": 7.5881028175354, "epoch": 0.05855008693800788, "grad_norm": 0.93359375, "learning_rate": 0.000412, "loss": 7.5501, "mean_token_accuracy": 0.08005938455462455, "num_tokens": 1785038.0, "step": 825 }, { "entropy": 7.658244895935058, "epoch": 0.05890493594975338, "grad_norm": 1.3046875, "learning_rate": 0.0004145, "loss": 7.6152, "mean_token_accuracy": 0.07943779826164246, "num_tokens": 1795837.0, "step": 830 }, { "entropy": 7.661693716049195, "epoch": 0.05925978496149888, "grad_norm": 0.97265625, "learning_rate": 0.000417, "loss": 7.608, "mean_token_accuracy": 0.07967479974031448, "num_tokens": 1806885.0, "step": 835 }, { "entropy": 7.671980381011963, "epoch": 0.05961463397324438, "grad_norm": 0.94921875, "learning_rate": 0.0004195, "loss": 7.6108, "mean_token_accuracy": 0.08177201226353645, "num_tokens": 1817403.0, "step": 840 }, { "entropy": 7.65054988861084, "epoch": 0.059969482984989886, "grad_norm": 0.8828125, "learning_rate": 0.000422, "loss": 7.5622, "mean_token_accuracy": 0.08333921730518341, "num_tokens": 1828929.0, "step": 845 }, { "entropy": 7.580755519866943, "epoch": 0.06032433199673539, "grad_norm": 0.9140625, "learning_rate": 0.0004245, "loss": 7.5877, "mean_token_accuracy": 0.08306344002485275, "num_tokens": 1839387.0, "step": 850 }, { "entropy": 7.6390235900878904, "epoch": 0.06067918100848089, "grad_norm": 1.03125, "learning_rate": 0.000427, "loss": 7.5976, "mean_token_accuracy": 0.07957985401153564, "num_tokens": 1850325.0, "step": 855 }, { "entropy": 7.6384642124176025, "epoch": 0.06103403002022639, "grad_norm": 0.984375, "learning_rate": 0.0004295, "loss": 7.591, "mean_token_accuracy": 0.07911092862486839, "num_tokens": 1861028.0, "step": 860 }, { "entropy": 7.572419548034668, "epoch": 0.0613888790319719, "grad_norm": 0.96875, "learning_rate": 0.000432, "loss": 7.5673, "mean_token_accuracy": 0.08450285941362382, "num_tokens": 1872676.0, "step": 865 }, { "entropy": 7.608766698837281, "epoch": 0.061743728043717395, "grad_norm": 0.98828125, "learning_rate": 0.0004345, "loss": 7.6249, "mean_token_accuracy": 0.08118002340197564, "num_tokens": 1883839.0, "step": 870 }, { "entropy": 7.498948860168457, "epoch": 0.0620985770554629, "grad_norm": 0.9375, "learning_rate": 0.000437, "loss": 7.473, "mean_token_accuracy": 0.08832938000559806, "num_tokens": 1894805.0, "step": 875 }, { "entropy": 7.565404224395752, "epoch": 0.062453426067208405, "grad_norm": 0.98828125, "learning_rate": 0.0004395, "loss": 7.4774, "mean_token_accuracy": 0.08059397265315056, "num_tokens": 1904770.0, "step": 880 }, { "entropy": 7.594593524932861, "epoch": 0.06280827507895391, "grad_norm": 0.859375, "learning_rate": 0.000442, "loss": 7.534, "mean_token_accuracy": 0.08095177710056305, "num_tokens": 1916190.0, "step": 885 }, { "entropy": 7.64970817565918, "epoch": 0.06316312409069941, "grad_norm": 0.96875, "learning_rate": 0.0004445, "loss": 7.5897, "mean_token_accuracy": 0.07850743383169174, "num_tokens": 1926519.0, "step": 890 }, { "entropy": 7.572882080078125, "epoch": 0.0635179731024449, "grad_norm": 0.90625, "learning_rate": 0.000447, "loss": 7.5959, "mean_token_accuracy": 0.08198425024747849, "num_tokens": 1936625.0, "step": 895 }, { "entropy": 7.570544862747193, "epoch": 0.06387282211419042, "grad_norm": 0.9609375, "learning_rate": 0.00044950000000000003, "loss": 7.552, "mean_token_accuracy": 0.08835628777742385, "num_tokens": 1946892.0, "step": 900 }, { "entropy": 7.569087743759155, "epoch": 0.06422767112593591, "grad_norm": 0.875, "learning_rate": 0.00045200000000000004, "loss": 7.5459, "mean_token_accuracy": 0.0858149766921997, "num_tokens": 1958464.0, "step": 905 }, { "entropy": 7.445690727233886, "epoch": 0.06458252013768141, "grad_norm": 1.0078125, "learning_rate": 0.00045450000000000004, "loss": 7.4842, "mean_token_accuracy": 0.08828370273113251, "num_tokens": 1968717.0, "step": 910 }, { "entropy": 7.524918699264527, "epoch": 0.06493736914942692, "grad_norm": 1.015625, "learning_rate": 0.00045700000000000005, "loss": 7.5477, "mean_token_accuracy": 0.08735504001379013, "num_tokens": 1979054.0, "step": 915 }, { "entropy": 7.48834342956543, "epoch": 0.06529221816117242, "grad_norm": 0.890625, "learning_rate": 0.00045950000000000006, "loss": 7.51, "mean_token_accuracy": 0.07926352620124817, "num_tokens": 1991069.0, "step": 920 }, { "entropy": 7.58330545425415, "epoch": 0.06564706717291792, "grad_norm": 0.94921875, "learning_rate": 0.000462, "loss": 7.5667, "mean_token_accuracy": 0.08001754432916641, "num_tokens": 2002182.0, "step": 925 }, { "entropy": 7.495837259292602, "epoch": 0.06600191618466343, "grad_norm": 1.0234375, "learning_rate": 0.0004645, "loss": 7.4959, "mean_token_accuracy": 0.08842689022421837, "num_tokens": 2012165.0, "step": 930 }, { "entropy": 7.61547622680664, "epoch": 0.06635676519640893, "grad_norm": 1.1171875, "learning_rate": 0.000467, "loss": 7.5157, "mean_token_accuracy": 0.08534864895045757, "num_tokens": 2022379.0, "step": 935 }, { "entropy": 7.350019550323486, "epoch": 0.06671161420815443, "grad_norm": 0.921875, "learning_rate": 0.0004695, "loss": 7.469, "mean_token_accuracy": 0.08241500668227672, "num_tokens": 2033497.0, "step": 940 }, { "entropy": 7.599674367904663, "epoch": 0.06706646321989994, "grad_norm": 0.9765625, "learning_rate": 0.000472, "loss": 7.5326, "mean_token_accuracy": 0.08250435441732407, "num_tokens": 2044914.0, "step": 945 }, { "entropy": 7.5432432174682615, "epoch": 0.06742131223164544, "grad_norm": 0.86328125, "learning_rate": 0.0004745, "loss": 7.5577, "mean_token_accuracy": 0.07833333164453507, "num_tokens": 2056450.0, "step": 950 }, { "entropy": 7.4970087051391605, "epoch": 0.06777616124339093, "grad_norm": 0.9140625, "learning_rate": 0.000477, "loss": 7.5441, "mean_token_accuracy": 0.08571040853857995, "num_tokens": 2067132.0, "step": 955 }, { "entropy": 7.541100406646729, "epoch": 0.06813101025513645, "grad_norm": 1.0, "learning_rate": 0.0004795, "loss": 7.5381, "mean_token_accuracy": 0.084527288377285, "num_tokens": 2077268.0, "step": 960 }, { "entropy": 7.537912464141845, "epoch": 0.06848585926688194, "grad_norm": 0.97265625, "learning_rate": 0.000482, "loss": 7.5354, "mean_token_accuracy": 0.08061212226748467, "num_tokens": 2088550.0, "step": 965 }, { "entropy": 7.5197999477386475, "epoch": 0.06884070827862744, "grad_norm": 0.90234375, "learning_rate": 0.0004845, "loss": 7.5101, "mean_token_accuracy": 0.08455962091684341, "num_tokens": 2099937.0, "step": 970 }, { "entropy": 7.416968822479248, "epoch": 0.06919555729037295, "grad_norm": 1.0078125, "learning_rate": 0.000487, "loss": 7.4727, "mean_token_accuracy": 0.08963474035263061, "num_tokens": 2110257.0, "step": 975 }, { "entropy": 7.585858726501465, "epoch": 0.06955040630211845, "grad_norm": 0.9296875, "learning_rate": 0.0004895, "loss": 7.5953, "mean_token_accuracy": 0.07949252240359783, "num_tokens": 2122537.0, "step": 980 }, { "entropy": 7.555169153213501, "epoch": 0.06990525531386395, "grad_norm": 1.0078125, "learning_rate": 0.000492, "loss": 7.5226, "mean_token_accuracy": 0.08293924927711487, "num_tokens": 2132892.0, "step": 985 }, { "entropy": 7.499892282485962, "epoch": 0.07026010432560946, "grad_norm": 0.8984375, "learning_rate": 0.0004945, "loss": 7.4475, "mean_token_accuracy": 0.08585060015320778, "num_tokens": 2143465.0, "step": 990 }, { "entropy": 7.430732774734497, "epoch": 0.07061495333735496, "grad_norm": 0.9453125, "learning_rate": 0.000497, "loss": 7.4201, "mean_token_accuracy": 0.08321849703788757, "num_tokens": 2154439.0, "step": 995 }, { "entropy": 7.451830673217773, "epoch": 0.07096980234910046, "grad_norm": 1.0078125, "learning_rate": 0.0004995, "loss": 7.4062, "mean_token_accuracy": 0.08034207150340081, "num_tokens": 2164849.0, "step": 1000 }, { "entropy": 7.4653853416442875, "epoch": 0.07132465136084595, "grad_norm": 1.03125, "learning_rate": 0.000499998026082006, "loss": 7.5331, "mean_token_accuracy": 0.08420314416289329, "num_tokens": 2174889.0, "step": 1005 }, { "entropy": 7.4106261253356935, "epoch": 0.07167950037259146, "grad_norm": 0.98828125, "learning_rate": 0.0004999900070995136, "loss": 7.443, "mean_token_accuracy": 0.08532139733433723, "num_tokens": 2184969.0, "step": 1010 }, { "entropy": 7.500397348403931, "epoch": 0.07203434938433696, "grad_norm": 1.0546875, "learning_rate": 0.0004999758199023239, "loss": 7.4641, "mean_token_accuracy": 0.08998854607343673, "num_tokens": 2194549.0, "step": 1015 }, { "entropy": 7.426589250564575, "epoch": 0.07238919839608246, "grad_norm": 1.0078125, "learning_rate": 0.0004999554648793858, "loss": 7.4863, "mean_token_accuracy": 0.08732765316963195, "num_tokens": 2206300.0, "step": 1020 }, { "entropy": 7.3821296215057375, "epoch": 0.07274404740782797, "grad_norm": 1.078125, "learning_rate": 0.0004999289425887425, "loss": 7.4323, "mean_token_accuracy": 0.08991043567657471, "num_tokens": 2216717.0, "step": 1025 }, { "entropy": 7.46541018486023, "epoch": 0.07309889641957347, "grad_norm": 0.8515625, "learning_rate": 0.0004998962537575161, "loss": 7.4952, "mean_token_accuracy": 0.08183322325348855, "num_tokens": 2227047.0, "step": 1030 }, { "entropy": 7.472234773635864, "epoch": 0.07345374543131897, "grad_norm": 0.984375, "learning_rate": 0.0004998573992818874, "loss": 7.3876, "mean_token_accuracy": 0.08948077708482742, "num_tokens": 2236811.0, "step": 1035 }, { "entropy": 7.367137098312378, "epoch": 0.07380859444306448, "grad_norm": 1.09375, "learning_rate": 0.0004998123802270715, "loss": 7.4732, "mean_token_accuracy": 0.08651004880666732, "num_tokens": 2248949.0, "step": 1040 }, { "entropy": 7.470364713668824, "epoch": 0.07416344345480998, "grad_norm": 0.90625, "learning_rate": 0.0004997611978272886, "loss": 7.4892, "mean_token_accuracy": 0.09045022875070571, "num_tokens": 2260720.0, "step": 1045 }, { "entropy": 7.41192946434021, "epoch": 0.07451829246655547, "grad_norm": 0.9453125, "learning_rate": 0.0004997038534857298, "loss": 7.4659, "mean_token_accuracy": 0.08553651496767997, "num_tokens": 2271855.0, "step": 1050 }, { "entropy": 7.329938554763794, "epoch": 0.07487314147830099, "grad_norm": 0.89453125, "learning_rate": 0.0004996403487745194, "loss": 7.4186, "mean_token_accuracy": 0.08984486237168313, "num_tokens": 2283203.0, "step": 1055 }, { "entropy": 7.525700807571411, "epoch": 0.07522799049004648, "grad_norm": 0.94140625, "learning_rate": 0.000499570685434671, "loss": 7.4772, "mean_token_accuracy": 0.0798021551221609, "num_tokens": 2295881.0, "step": 1060 }, { "entropy": 7.448550653457642, "epoch": 0.07558283950179198, "grad_norm": 0.984375, "learning_rate": 0.0004994948653760405, "loss": 7.4512, "mean_token_accuracy": 0.08743728250265122, "num_tokens": 2306411.0, "step": 1065 }, { "entropy": 7.442822980880737, "epoch": 0.0759376885135375, "grad_norm": 0.87890625, "learning_rate": 0.0004994128906772729, "loss": 7.4075, "mean_token_accuracy": 0.08435096815228463, "num_tokens": 2317519.0, "step": 1070 }, { "entropy": 7.448988389968872, "epoch": 0.07629253752528299, "grad_norm": 0.98828125, "learning_rate": 0.000499324763585746, "loss": 7.4994, "mean_token_accuracy": 0.08249662891030311, "num_tokens": 2327921.0, "step": 1075 }, { "entropy": 7.324292278289795, "epoch": 0.07664738653702849, "grad_norm": 0.93359375, "learning_rate": 0.0004992304865175085, "loss": 7.3506, "mean_token_accuracy": 0.09711327776312828, "num_tokens": 2338925.0, "step": 1080 }, { "entropy": 7.464797782897949, "epoch": 0.077002235548774, "grad_norm": 0.9296875, "learning_rate": 0.0004991300620572138, "loss": 7.4976, "mean_token_accuracy": 0.08892218843102455, "num_tokens": 2349576.0, "step": 1085 }, { "entropy": 7.314234113693237, "epoch": 0.0773570845605195, "grad_norm": 1.0703125, "learning_rate": 0.0004990234929580494, "loss": 7.3705, "mean_token_accuracy": 0.08954303413629532, "num_tokens": 2359671.0, "step": 1090 }, { "entropy": 7.498252105712891, "epoch": 0.077711933572265, "grad_norm": 1.0234375, "learning_rate": 0.0004989107821416609, "loss": 7.4653, "mean_token_accuracy": 0.08781479671597481, "num_tokens": 2370173.0, "step": 1095 }, { "entropy": 7.377524137496948, "epoch": 0.07806678258401051, "grad_norm": 0.91796875, "learning_rate": 0.0004987919326980723, "loss": 7.3908, "mean_token_accuracy": 0.08205282092094421, "num_tokens": 2381330.0, "step": 1100 }, { "entropy": 7.393895387649536, "epoch": 0.078421631595756, "grad_norm": 0.94921875, "learning_rate": 0.0004986669478856011, "loss": 7.4112, "mean_token_accuracy": 0.08845710456371307, "num_tokens": 2392487.0, "step": 1105 }, { "entropy": 7.278064727783203, "epoch": 0.0787764806075015, "grad_norm": 0.8828125, "learning_rate": 0.0004985358311307688, "loss": 7.3277, "mean_token_accuracy": 0.09402666017413139, "num_tokens": 2404083.0, "step": 1110 }, { "entropy": 7.404061222076416, "epoch": 0.07913132961924702, "grad_norm": 0.9375, "learning_rate": 0.0004983985860282081, "loss": 7.4268, "mean_token_accuracy": 0.08385513573884965, "num_tokens": 2414646.0, "step": 1115 }, { "entropy": 7.46454119682312, "epoch": 0.07948617863099251, "grad_norm": 1.046875, "learning_rate": 0.0004982552163405623, "loss": 7.4392, "mean_token_accuracy": 0.08458093479275704, "num_tokens": 2425823.0, "step": 1120 }, { "entropy": 7.345199346542358, "epoch": 0.07984102764273801, "grad_norm": 0.9140625, "learning_rate": 0.0004981057259983839, "loss": 7.4252, "mean_token_accuracy": 0.08571918532252312, "num_tokens": 2436999.0, "step": 1125 }, { "entropy": 7.397942304611206, "epoch": 0.08019587665448352, "grad_norm": 0.96875, "learning_rate": 0.0004979501191000262, "loss": 7.3874, "mean_token_accuracy": 0.08777525499463082, "num_tokens": 2448166.0, "step": 1130 }, { "entropy": 7.41080527305603, "epoch": 0.08055072566622902, "grad_norm": 1.0234375, "learning_rate": 0.0004977883999115311, "loss": 7.414, "mean_token_accuracy": 0.08722149506211281, "num_tokens": 2459018.0, "step": 1135 }, { "entropy": 7.315374708175659, "epoch": 0.08090557467797452, "grad_norm": 1.1015625, "learning_rate": 0.0004976205728665113, "loss": 7.3751, "mean_token_accuracy": 0.08800306916236877, "num_tokens": 2469113.0, "step": 1140 }, { "entropy": 7.370522165298462, "epoch": 0.08126042368972003, "grad_norm": 1.0546875, "learning_rate": 0.0004974466425660307, "loss": 7.3597, "mean_token_accuracy": 0.09009913429617881, "num_tokens": 2481506.0, "step": 1145 }, { "entropy": 7.3977306365966795, "epoch": 0.08161527270146553, "grad_norm": 1.03125, "learning_rate": 0.0004972666137784759, "loss": 7.3996, "mean_token_accuracy": 0.09371651038527488, "num_tokens": 2491924.0, "step": 1150 }, { "entropy": 7.312761831283569, "epoch": 0.08197012171321102, "grad_norm": 0.92578125, "learning_rate": 0.0004970804914394271, "loss": 7.3336, "mean_token_accuracy": 0.08466937094926834, "num_tokens": 2503920.0, "step": 1155 }, { "entropy": 7.372441291809082, "epoch": 0.08232497072495654, "grad_norm": 0.96484375, "learning_rate": 0.0004968882806515225, "loss": 7.3572, "mean_token_accuracy": 0.08929058611392975, "num_tokens": 2514366.0, "step": 1160 }, { "entropy": 7.331275081634521, "epoch": 0.08267981973670203, "grad_norm": 0.96875, "learning_rate": 0.0004966899866843177, "loss": 7.4348, "mean_token_accuracy": 0.08657754585146904, "num_tokens": 2524749.0, "step": 1165 }, { "entropy": 7.35433521270752, "epoch": 0.08303466874844753, "grad_norm": 0.9296875, "learning_rate": 0.000496485614974142, "loss": 7.4169, "mean_token_accuracy": 0.09042649567127228, "num_tokens": 2536202.0, "step": 1170 }, { "entropy": 7.385815572738648, "epoch": 0.08338951776019304, "grad_norm": 1.140625, "learning_rate": 0.0004962751711239492, "loss": 7.3481, "mean_token_accuracy": 0.09155565276741981, "num_tokens": 2545573.0, "step": 1175 }, { "entropy": 7.3866798877716064, "epoch": 0.08374436677193854, "grad_norm": 0.91015625, "learning_rate": 0.0004960586609031636, "loss": 7.3933, "mean_token_accuracy": 0.09010633900761604, "num_tokens": 2556627.0, "step": 1180 }, { "entropy": 7.227568435668945, "epoch": 0.08409921578368404, "grad_norm": 0.8671875, "learning_rate": 0.0004958360902475224, "loss": 7.3546, "mean_token_accuracy": 0.08734624981880187, "num_tokens": 2567064.0, "step": 1185 }, { "entropy": 7.4254954814910885, "epoch": 0.08445406479542955, "grad_norm": 0.99609375, "learning_rate": 0.0004956074652589125, "loss": 7.3938, "mean_token_accuracy": 0.08469272255897523, "num_tokens": 2577772.0, "step": 1190 }, { "entropy": 7.222232055664063, "epoch": 0.08480891380717505, "grad_norm": 0.98828125, "learning_rate": 0.0004953727922052035, "loss": 7.3055, "mean_token_accuracy": 0.08891206458210946, "num_tokens": 2588880.0, "step": 1195 }, { "entropy": 7.418983125686646, "epoch": 0.08516376281892055, "grad_norm": 0.92578125, "learning_rate": 0.0004951320775200756, "loss": 7.3926, "mean_token_accuracy": 0.08361146301031112, "num_tokens": 2600146.0, "step": 1200 }, { "entropy": 7.26065993309021, "epoch": 0.08551861183066606, "grad_norm": 0.9765625, "learning_rate": 0.0004948853278028436, "loss": 7.3419, "mean_token_accuracy": 0.08811083883047104, "num_tokens": 2610305.0, "step": 1205 }, { "entropy": 7.385571146011353, "epoch": 0.08587346084241156, "grad_norm": 0.89453125, "learning_rate": 0.0004946325498182755, "loss": 7.351, "mean_token_accuracy": 0.08472810387611389, "num_tokens": 2621218.0, "step": 1210 }, { "entropy": 7.362215375900268, "epoch": 0.08622830985415705, "grad_norm": 0.94140625, "learning_rate": 0.0004943737504964076, "loss": 7.4032, "mean_token_accuracy": 0.07960698269307613, "num_tokens": 2632399.0, "step": 1215 }, { "entropy": 7.4094336986541744, "epoch": 0.08658315886590257, "grad_norm": 0.96484375, "learning_rate": 0.000494108936932354, "loss": 7.2759, "mean_token_accuracy": 0.09264603853225709, "num_tokens": 2643043.0, "step": 1220 }, { "entropy": 7.263467264175415, "epoch": 0.08693800787764806, "grad_norm": 0.95703125, "learning_rate": 0.0004938381163861124, "loss": 7.3037, "mean_token_accuracy": 0.08933228254318237, "num_tokens": 2653336.0, "step": 1225 }, { "entropy": 7.435257434844971, "epoch": 0.08729285688939356, "grad_norm": 1.015625, "learning_rate": 0.0004935612962823645, "loss": 7.3784, "mean_token_accuracy": 0.08661267906427383, "num_tokens": 2664414.0, "step": 1230 }, { "entropy": 7.223228883743286, "epoch": 0.08764770590113906, "grad_norm": 1.015625, "learning_rate": 0.0004932784842102739, "loss": 7.3525, "mean_token_accuracy": 0.09211425483226776, "num_tokens": 2674338.0, "step": 1235 }, { "entropy": 7.366180896759033, "epoch": 0.08800255491288457, "grad_norm": 0.91015625, "learning_rate": 0.0004929896879232758, "loss": 7.3397, "mean_token_accuracy": 0.08799645379185676, "num_tokens": 2686022.0, "step": 1240 }, { "entropy": 7.351464748382568, "epoch": 0.08835740392463007, "grad_norm": 0.9140625, "learning_rate": 0.0004926949153388668, "loss": 7.304, "mean_token_accuracy": 0.08788969665765763, "num_tokens": 2696746.0, "step": 1245 }, { "entropy": 7.238297367095948, "epoch": 0.08871225293637557, "grad_norm": 0.859375, "learning_rate": 0.0004923941745383859, "loss": 7.3415, "mean_token_accuracy": 0.08992047309875488, "num_tokens": 2706737.0, "step": 1250 }, { "entropy": 7.3518078327178955, "epoch": 0.08906710194812108, "grad_norm": 1.0390625, "learning_rate": 0.000492087473766794, "loss": 7.3486, "mean_token_accuracy": 0.08713155873119831, "num_tokens": 2717757.0, "step": 1255 }, { "entropy": 7.33965802192688, "epoch": 0.08942195095986658, "grad_norm": 1.0234375, "learning_rate": 0.000491774821432448, "loss": 7.2968, "mean_token_accuracy": 0.09177965298295021, "num_tokens": 2728714.0, "step": 1260 }, { "entropy": 7.179767322540283, "epoch": 0.08977679997161207, "grad_norm": 0.94921875, "learning_rate": 0.0004914562261068693, "loss": 7.2606, "mean_token_accuracy": 0.09344343543052673, "num_tokens": 2739892.0, "step": 1265 }, { "entropy": 7.360199499130249, "epoch": 0.09013164898335758, "grad_norm": 1.0546875, "learning_rate": 0.0004911316965245098, "loss": 7.3165, "mean_token_accuracy": 0.09559072181582451, "num_tokens": 2750164.0, "step": 1270 }, { "entropy": 7.324847936630249, "epoch": 0.09048649799510308, "grad_norm": 1.0546875, "learning_rate": 0.000490801241582512, "loss": 7.3193, "mean_token_accuracy": 0.08874515891075134, "num_tokens": 2760865.0, "step": 1275 }, { "entropy": 7.346493816375732, "epoch": 0.09084134700684858, "grad_norm": 0.8984375, "learning_rate": 0.000490464870340465, "loss": 7.3471, "mean_token_accuracy": 0.09163894280791282, "num_tokens": 2772993.0, "step": 1280 }, { "entropy": 7.259117269515992, "epoch": 0.09119619601859409, "grad_norm": 1.0, "learning_rate": 0.0004901225920201563, "loss": 7.2786, "mean_token_accuracy": 0.09321993291378021, "num_tokens": 2782573.0, "step": 1285 }, { "entropy": 7.327762031555176, "epoch": 0.09155104503033959, "grad_norm": 1.0390625, "learning_rate": 0.000489774416005319, "loss": 7.3555, "mean_token_accuracy": 0.08510730862617492, "num_tokens": 2793372.0, "step": 1290 }, { "entropy": 7.372673606872558, "epoch": 0.09190589404208509, "grad_norm": 0.9609375, "learning_rate": 0.0004894203518413742, "loss": 7.3335, "mean_token_accuracy": 0.08849020972847939, "num_tokens": 2805067.0, "step": 1295 }, { "entropy": 7.204169082641601, "epoch": 0.0922607430538306, "grad_norm": 1.09375, "learning_rate": 0.0004890604092351701, "loss": 7.2726, "mean_token_accuracy": 0.09518759399652481, "num_tokens": 2815029.0, "step": 1300 }, { "entropy": 7.380017948150635, "epoch": 0.0926155920655761, "grad_norm": 0.890625, "learning_rate": 0.000488694598054715, "loss": 7.3445, "mean_token_accuracy": 0.09246201291680337, "num_tokens": 2825206.0, "step": 1305 }, { "entropy": 7.238814830780029, "epoch": 0.0929704410773216, "grad_norm": 0.9453125, "learning_rate": 0.0004883229283289071, "loss": 7.3075, "mean_token_accuracy": 0.09198266863822938, "num_tokens": 2837134.0, "step": 1310 }, { "entropy": 7.282371139526367, "epoch": 0.0933252900890671, "grad_norm": 0.875, "learning_rate": 0.00048794541024725993, "loss": 7.261, "mean_token_accuracy": 0.09279094189405442, "num_tokens": 2848085.0, "step": 1315 }, { "entropy": 7.297031307220459, "epoch": 0.0936801391008126, "grad_norm": 0.94921875, "learning_rate": 0.0004875620541596221, "loss": 7.2988, "mean_token_accuracy": 0.092452073097229, "num_tokens": 2858270.0, "step": 1320 }, { "entropy": 7.190067005157471, "epoch": 0.0940349881125581, "grad_norm": 0.89453125, "learning_rate": 0.00048717287057589454, "loss": 7.1873, "mean_token_accuracy": 0.09650815352797508, "num_tokens": 2868319.0, "step": 1325 }, { "entropy": 7.2879091739654545, "epoch": 0.09438983712430361, "grad_norm": 0.94921875, "learning_rate": 0.0004867778701657417, "loss": 7.2142, "mean_token_accuracy": 0.09751713499426842, "num_tokens": 2879042.0, "step": 1330 }, { "entropy": 7.145177888870239, "epoch": 0.09474468613604911, "grad_norm": 0.890625, "learning_rate": 0.00048637706375829955, "loss": 7.2146, "mean_token_accuracy": 0.09119046702980996, "num_tokens": 2890687.0, "step": 1335 }, { "entropy": 7.305484199523926, "epoch": 0.09509953514779461, "grad_norm": 0.95703125, "learning_rate": 0.000485970462341878, "loss": 7.2883, "mean_token_accuracy": 0.0910595864057541, "num_tokens": 2900901.0, "step": 1340 }, { "entropy": 7.299550008773804, "epoch": 0.09545438415954012, "grad_norm": 1.015625, "learning_rate": 0.00048555807706366044, "loss": 7.2978, "mean_token_accuracy": 0.09110193699598312, "num_tokens": 2912233.0, "step": 1345 }, { "entropy": 7.180187082290649, "epoch": 0.09580923317128562, "grad_norm": 1.015625, "learning_rate": 0.00048513991922939756, "loss": 7.1896, "mean_token_accuracy": 0.09826849699020386, "num_tokens": 2923002.0, "step": 1350 }, { "entropy": 7.222209358215332, "epoch": 0.09616408218303112, "grad_norm": 0.9375, "learning_rate": 0.00048471600030309744, "loss": 7.2904, "mean_token_accuracy": 0.09233295768499375, "num_tokens": 2934139.0, "step": 1355 }, { "entropy": 7.296793508529663, "epoch": 0.09651893119477663, "grad_norm": 1.03125, "learning_rate": 0.00048428633190671186, "loss": 7.264, "mean_token_accuracy": 0.09283363372087479, "num_tokens": 2945229.0, "step": 1360 }, { "entropy": 7.259587001800537, "epoch": 0.09687378020652213, "grad_norm": 0.97265625, "learning_rate": 0.0004838509258198167, "loss": 7.2666, "mean_token_accuracy": 0.09352016374468804, "num_tokens": 2956118.0, "step": 1365 }, { "entropy": 7.230564737319947, "epoch": 0.09722862921826762, "grad_norm": 0.93359375, "learning_rate": 0.00048340979397929, "loss": 7.1702, "mean_token_accuracy": 0.09822328612208367, "num_tokens": 2967120.0, "step": 1370 }, { "entropy": 7.109541511535644, "epoch": 0.09758347823001313, "grad_norm": 1.0625, "learning_rate": 0.00048296294847898386, "loss": 7.2177, "mean_token_accuracy": 0.0937571682035923, "num_tokens": 2977852.0, "step": 1375 }, { "entropy": 7.361109018325806, "epoch": 0.09793832724175863, "grad_norm": 0.96484375, "learning_rate": 0.0004825104015693934, "loss": 7.3398, "mean_token_accuracy": 0.08829166814684868, "num_tokens": 2988076.0, "step": 1380 }, { "entropy": 7.184476566314697, "epoch": 0.09829317625350413, "grad_norm": 0.90625, "learning_rate": 0.0004820521656573208, "loss": 7.1971, "mean_token_accuracy": 0.09840201437473298, "num_tokens": 2999159.0, "step": 1385 }, { "entropy": 7.314798021316529, "epoch": 0.09864802526524964, "grad_norm": 0.96484375, "learning_rate": 0.00048158825330553505, "loss": 7.2446, "mean_token_accuracy": 0.09077045172452927, "num_tokens": 3009419.0, "step": 1390 }, { "entropy": 7.1688261985778805, "epoch": 0.09900287427699514, "grad_norm": 0.875, "learning_rate": 0.00048111867723242763, "loss": 7.2273, "mean_token_accuracy": 0.09468511268496513, "num_tokens": 3020261.0, "step": 1395 }, { "entropy": 7.288452386856079, "epoch": 0.09935772328874064, "grad_norm": 0.9453125, "learning_rate": 0.0004806434503116637, "loss": 7.264, "mean_token_accuracy": 0.0897028960287571, "num_tokens": 3031118.0, "step": 1400 }, { "entropy": 7.270044612884521, "epoch": 0.09971257230048615, "grad_norm": 0.91796875, "learning_rate": 0.0004801625855718296, "loss": 7.303, "mean_token_accuracy": 0.09120242893695832, "num_tokens": 3041921.0, "step": 1405 }, { "entropy": 7.301294279098511, "epoch": 0.10006742131223165, "grad_norm": 1.0390625, "learning_rate": 0.00047967609619607477, "loss": 7.2724, "mean_token_accuracy": 0.0923406146466732, "num_tokens": 3053935.0, "step": 1410 }, { "entropy": 7.298661994934082, "epoch": 0.10042227032397714, "grad_norm": 0.984375, "learning_rate": 0.0004791839955217513, "loss": 7.2681, "mean_token_accuracy": 0.09436995908617973, "num_tokens": 3065260.0, "step": 1415 }, { "entropy": 7.141231632232666, "epoch": 0.10077711933572266, "grad_norm": 0.94140625, "learning_rate": 0.00047868629704004786, "loss": 7.212, "mean_token_accuracy": 0.09240631237626076, "num_tokens": 3076012.0, "step": 1420 }, { "entropy": 7.3381248950958256, "epoch": 0.10113196834746815, "grad_norm": 0.9375, "learning_rate": 0.00047818301439561965, "loss": 7.2001, "mean_token_accuracy": 0.09209805354475975, "num_tokens": 3086517.0, "step": 1425 }, { "entropy": 7.143636035919189, "epoch": 0.10148681735921365, "grad_norm": 0.90625, "learning_rate": 0.00047767416138621454, "loss": 7.2568, "mean_token_accuracy": 0.09073155596852303, "num_tokens": 3097511.0, "step": 1430 }, { "entropy": 7.358057594299316, "epoch": 0.10184166637095916, "grad_norm": 1.0078125, "learning_rate": 0.000477159751962295, "loss": 7.2242, "mean_token_accuracy": 0.08778738155961037, "num_tokens": 3108482.0, "step": 1435 }, { "entropy": 7.192478942871094, "epoch": 0.10219651538270466, "grad_norm": 0.83984375, "learning_rate": 0.00047663980022665507, "loss": 7.2047, "mean_token_accuracy": 0.09349827691912652, "num_tokens": 3119630.0, "step": 1440 }, { "entropy": 7.235249710083008, "epoch": 0.10255136439445016, "grad_norm": 1.0078125, "learning_rate": 0.00047611432043403437, "loss": 7.2685, "mean_token_accuracy": 0.08921699076890946, "num_tokens": 3131050.0, "step": 1445 }, { "entropy": 7.221825456619262, "epoch": 0.10290621340619566, "grad_norm": 0.96875, "learning_rate": 0.0004755833269907267, "loss": 7.2587, "mean_token_accuracy": 0.09253018423914909, "num_tokens": 3141956.0, "step": 1450 }, { "entropy": 7.341269016265869, "epoch": 0.10326106241794117, "grad_norm": 0.94140625, "learning_rate": 0.0004750468344541857, "loss": 7.2215, "mean_token_accuracy": 0.09548219069838523, "num_tokens": 3152693.0, "step": 1455 }, { "entropy": 7.267981004714966, "epoch": 0.10361591142968667, "grad_norm": 0.8984375, "learning_rate": 0.00047450485753262525, "loss": 7.2577, "mean_token_accuracy": 0.0954539954662323, "num_tokens": 3163736.0, "step": 1460 }, { "entropy": 7.165822839736938, "epoch": 0.10397076044143216, "grad_norm": 0.9375, "learning_rate": 0.00047395741108461633, "loss": 7.2569, "mean_token_accuracy": 0.08883126974105834, "num_tokens": 3175537.0, "step": 1465 }, { "entropy": 7.244705867767334, "epoch": 0.10432560945317768, "grad_norm": 0.94921875, "learning_rate": 0.00047340451011867985, "loss": 7.1729, "mean_token_accuracy": 0.09741863459348679, "num_tokens": 3185659.0, "step": 1470 }, { "entropy": 7.163289546966553, "epoch": 0.10468045846492317, "grad_norm": 0.9921875, "learning_rate": 0.00047284616979287515, "loss": 7.0888, "mean_token_accuracy": 0.10371233746409417, "num_tokens": 3196548.0, "step": 1475 }, { "entropy": 7.239425230026245, "epoch": 0.10503530747666867, "grad_norm": 0.86328125, "learning_rate": 0.00047228240541438433, "loss": 7.1853, "mean_token_accuracy": 0.09878996461629867, "num_tokens": 3207516.0, "step": 1480 }, { "entropy": 7.1664224624633786, "epoch": 0.10539015648841418, "grad_norm": 0.98828125, "learning_rate": 0.00047171323243909257, "loss": 7.2059, "mean_token_accuracy": 0.09172281622886658, "num_tokens": 3219171.0, "step": 1485 }, { "entropy": 7.128496742248535, "epoch": 0.10574500550015968, "grad_norm": 0.88671875, "learning_rate": 0.00047113866647116457, "loss": 7.1106, "mean_token_accuracy": 0.10128247514367103, "num_tokens": 3230911.0, "step": 1490 }, { "entropy": 7.15082368850708, "epoch": 0.10609985451190518, "grad_norm": 0.98828125, "learning_rate": 0.0004705587232626164, "loss": 7.2156, "mean_token_accuracy": 0.09450112357735634, "num_tokens": 3240977.0, "step": 1495 }, { "entropy": 7.310815048217774, "epoch": 0.10645470352365069, "grad_norm": 1.0390625, "learning_rate": 0.00046997341871288424, "loss": 7.2455, "mean_token_accuracy": 0.09728037863969803, "num_tokens": 3251714.0, "step": 1500 }, { "entropy": 7.228920888900757, "epoch": 0.10680955253539619, "grad_norm": 1.0546875, "learning_rate": 0.0004693827688683879, "loss": 7.2048, "mean_token_accuracy": 0.09683412909507752, "num_tokens": 3262558.0, "step": 1505 }, { "entropy": 7.222548103332519, "epoch": 0.10716440154714169, "grad_norm": 0.94140625, "learning_rate": 0.0004687867899220914, "loss": 7.1702, "mean_token_accuracy": 0.09433976039290429, "num_tokens": 3273473.0, "step": 1510 }, { "entropy": 7.1861412525177, "epoch": 0.1075192505588872, "grad_norm": 1.1015625, "learning_rate": 0.00046818549821305846, "loss": 7.2912, "mean_token_accuracy": 0.09852436482906342, "num_tokens": 3284238.0, "step": 1515 }, { "entropy": 7.240938949584961, "epoch": 0.1078740995706327, "grad_norm": 0.9140625, "learning_rate": 0.00046757891022600494, "loss": 7.1773, "mean_token_accuracy": 0.10066472664475441, "num_tokens": 3294848.0, "step": 1520 }, { "entropy": 7.1551109790802006, "epoch": 0.10822894858237819, "grad_norm": 0.890625, "learning_rate": 0.0004669670425908471, "loss": 7.1802, "mean_token_accuracy": 0.09828831255435944, "num_tokens": 3305487.0, "step": 1525 }, { "entropy": 7.182540702819824, "epoch": 0.1085837975941237, "grad_norm": 1.0390625, "learning_rate": 0.0004663499120822451, "loss": 7.1249, "mean_token_accuracy": 0.09082185253500938, "num_tokens": 3317032.0, "step": 1530 }, { "entropy": 7.226040554046631, "epoch": 0.1089386466058692, "grad_norm": 1.0078125, "learning_rate": 0.0004657275356191437, "loss": 7.1868, "mean_token_accuracy": 0.09265627264976502, "num_tokens": 3327695.0, "step": 1535 }, { "entropy": 7.1324906826019285, "epoch": 0.1092934956176147, "grad_norm": 1.0390625, "learning_rate": 0.00046509993026430804, "loss": 7.1214, "mean_token_accuracy": 0.09917151257395744, "num_tokens": 3337445.0, "step": 1540 }, { "entropy": 7.162045288085937, "epoch": 0.10964834462936021, "grad_norm": 0.9453125, "learning_rate": 0.0004644671132238558, "loss": 7.1469, "mean_token_accuracy": 0.09252285063266755, "num_tokens": 3347958.0, "step": 1545 }, { "entropy": 7.268742990493775, "epoch": 0.11000319364110571, "grad_norm": 0.9921875, "learning_rate": 0.00046382910184678585, "loss": 7.103, "mean_token_accuracy": 0.09710876047611236, "num_tokens": 3357974.0, "step": 1550 }, { "entropy": 7.088126087188721, "epoch": 0.11035804265285121, "grad_norm": 0.93359375, "learning_rate": 0.0004631859136245025, "loss": 7.1715, "mean_token_accuracy": 0.09461688697338104, "num_tokens": 3368901.0, "step": 1555 }, { "entropy": 7.292183065414429, "epoch": 0.11071289166459672, "grad_norm": 0.90234375, "learning_rate": 0.0004625375661903357, "loss": 7.1501, "mean_token_accuracy": 0.09700253531336785, "num_tokens": 3379028.0, "step": 1560 }, { "entropy": 7.114231586456299, "epoch": 0.11106774067634222, "grad_norm": 0.96875, "learning_rate": 0.00046188407731905787, "loss": 7.2125, "mean_token_accuracy": 0.0952233262360096, "num_tokens": 3389688.0, "step": 1565 }, { "entropy": 7.312720584869385, "epoch": 0.11142258968808771, "grad_norm": 0.921875, "learning_rate": 0.00046122546492639643, "loss": 7.2162, "mean_token_accuracy": 0.0928651139140129, "num_tokens": 3400782.0, "step": 1570 }, { "entropy": 7.103663063049316, "epoch": 0.11177743869983323, "grad_norm": 0.8984375, "learning_rate": 0.000460561747068543, "loss": 7.1171, "mean_token_accuracy": 0.0949582502245903, "num_tokens": 3412404.0, "step": 1575 }, { "entropy": 7.07365198135376, "epoch": 0.11213228771157872, "grad_norm": 0.89453125, "learning_rate": 0.0004598929419416578, "loss": 7.1578, "mean_token_accuracy": 0.09038265198469161, "num_tokens": 3424129.0, "step": 1580 }, { "entropy": 7.2252601146697994, "epoch": 0.11248713672332422, "grad_norm": 0.984375, "learning_rate": 0.00045921906788137123, "loss": 7.1011, "mean_token_accuracy": 0.09262050092220306, "num_tokens": 3436570.0, "step": 1585 }, { "entropy": 7.137156534194946, "epoch": 0.11284198573506973, "grad_norm": 0.9921875, "learning_rate": 0.00045854014336228115, "loss": 7.1351, "mean_token_accuracy": 0.09676287397742271, "num_tokens": 3447222.0, "step": 1590 }, { "entropy": 7.170758247375488, "epoch": 0.11319683474681523, "grad_norm": 0.8671875, "learning_rate": 0.00045785618699744615, "loss": 7.1081, "mean_token_accuracy": 0.096658343821764, "num_tokens": 3458921.0, "step": 1595 }, { "entropy": 7.246716260910034, "epoch": 0.11355168375856073, "grad_norm": 0.9765625, "learning_rate": 0.00045716721753787543, "loss": 7.2579, "mean_token_accuracy": 0.08915452212095261, "num_tokens": 3470065.0, "step": 1600 }, { "entropy": 7.13914909362793, "epoch": 0.11390653277030624, "grad_norm": 0.9375, "learning_rate": 0.0004564732538720148, "loss": 7.0704, "mean_token_accuracy": 0.10325511917471886, "num_tokens": 3481062.0, "step": 1605 }, { "entropy": 7.162566661834717, "epoch": 0.11426138178205174, "grad_norm": 0.88671875, "learning_rate": 0.00045577431502522877, "loss": 7.0767, "mean_token_accuracy": 0.09748337939381599, "num_tokens": 3491586.0, "step": 1610 }, { "entropy": 7.1580146789550785, "epoch": 0.11461623079379724, "grad_norm": 0.9453125, "learning_rate": 0.0004550704201592787, "loss": 7.1824, "mean_token_accuracy": 0.0963168665766716, "num_tokens": 3502367.0, "step": 1615 }, { "entropy": 7.106345272064209, "epoch": 0.11497107980554275, "grad_norm": 0.94921875, "learning_rate": 0.0004543615885717981, "loss": 7.0516, "mean_token_accuracy": 0.10276207253336907, "num_tokens": 3512114.0, "step": 1620 }, { "entropy": 7.237199068069458, "epoch": 0.11532592881728825, "grad_norm": 1.015625, "learning_rate": 0.00045364783969576296, "loss": 7.2058, "mean_token_accuracy": 0.09948946833610535, "num_tokens": 3522954.0, "step": 1625 }, { "entropy": 7.1651527881622314, "epoch": 0.11568077782903374, "grad_norm": 0.9375, "learning_rate": 0.0004529291930989592, "loss": 7.1538, "mean_token_accuracy": 0.09592896923422814, "num_tokens": 3533205.0, "step": 1630 }, { "entropy": 7.125106525421143, "epoch": 0.11603562684077925, "grad_norm": 0.94921875, "learning_rate": 0.0004522056684834464, "loss": 7.058, "mean_token_accuracy": 0.0978856511414051, "num_tokens": 3542901.0, "step": 1635 }, { "entropy": 7.144106674194336, "epoch": 0.11639047585252475, "grad_norm": 0.96484375, "learning_rate": 0.0004514772856850173, "loss": 7.1462, "mean_token_accuracy": 0.09332720711827278, "num_tokens": 3554141.0, "step": 1640 }, { "entropy": 7.1256311416625975, "epoch": 0.11674532486427025, "grad_norm": 0.94921875, "learning_rate": 0.0004507440646726542, "loss": 7.0938, "mean_token_accuracy": 0.10101081579923629, "num_tokens": 3566074.0, "step": 1645 }, { "entropy": 7.188183689117432, "epoch": 0.11710017387601576, "grad_norm": 0.9296875, "learning_rate": 0.0004500060255479818, "loss": 7.1298, "mean_token_accuracy": 0.09676677137613296, "num_tokens": 3576939.0, "step": 1650 }, { "entropy": 7.127859163284302, "epoch": 0.11745502288776126, "grad_norm": 0.9140625, "learning_rate": 0.0004492631885447151, "loss": 7.1605, "mean_token_accuracy": 0.09790143445134163, "num_tokens": 3587871.0, "step": 1655 }, { "entropy": 7.06299614906311, "epoch": 0.11780987189950676, "grad_norm": 0.984375, "learning_rate": 0.00044851557402810616, "loss": 7.0346, "mean_token_accuracy": 0.10373768284916877, "num_tokens": 3597597.0, "step": 1660 }, { "entropy": 7.241457796096801, "epoch": 0.11816472091125227, "grad_norm": 1.0078125, "learning_rate": 0.00044776320249438444, "loss": 7.1148, "mean_token_accuracy": 0.09652233868837357, "num_tokens": 3607646.0, "step": 1665 }, { "entropy": 7.178923034667969, "epoch": 0.11851956992299777, "grad_norm": 0.93359375, "learning_rate": 0.00044700609457019565, "loss": 7.1293, "mean_token_accuracy": 0.09854810833930969, "num_tokens": 3618795.0, "step": 1670 }, { "entropy": 7.151714897155761, "epoch": 0.11887441893474326, "grad_norm": 1.34375, "learning_rate": 0.0004462442710120359, "loss": 7.1202, "mean_token_accuracy": 0.09609093591570854, "num_tokens": 3629347.0, "step": 1675 }, { "entropy": 7.126868963241577, "epoch": 0.11922926794648876, "grad_norm": 0.94921875, "learning_rate": 0.000445477752705683, "loss": 7.0511, "mean_token_accuracy": 0.09984703361988068, "num_tokens": 3638849.0, "step": 1680 }, { "entropy": 7.176082944869995, "epoch": 0.11958411695823427, "grad_norm": 0.9609375, "learning_rate": 0.00044470656066562336, "loss": 7.1147, "mean_token_accuracy": 0.10202176421880722, "num_tokens": 3649630.0, "step": 1685 }, { "entropy": 7.105949640274048, "epoch": 0.11993896596997977, "grad_norm": 0.8515625, "learning_rate": 0.0004439307160344765, "loss": 7.165, "mean_token_accuracy": 0.09765942394733429, "num_tokens": 3660885.0, "step": 1690 }, { "entropy": 7.150793170928955, "epoch": 0.12029381498172527, "grad_norm": 1.328125, "learning_rate": 0.00044315024008241473, "loss": 7.1008, "mean_token_accuracy": 0.09718259535729885, "num_tokens": 3672714.0, "step": 1695 }, { "entropy": 7.211589431762695, "epoch": 0.12064866399347078, "grad_norm": 1.0, "learning_rate": 0.0004423651542065806, "loss": 7.0464, "mean_token_accuracy": 0.09509608298540115, "num_tokens": 3683393.0, "step": 1700 }, { "entropy": 7.014157676696778, "epoch": 0.12100351300521628, "grad_norm": 0.9453125, "learning_rate": 0.00044157547993050006, "loss": 7.1575, "mean_token_accuracy": 0.09731999039649963, "num_tokens": 3694158.0, "step": 1705 }, { "entropy": 7.235012865066528, "epoch": 0.12135836201696178, "grad_norm": 0.9921875, "learning_rate": 0.00044078123890349227, "loss": 7.0723, "mean_token_accuracy": 0.10333672091364861, "num_tokens": 3704334.0, "step": 1710 }, { "entropy": 7.064513492584228, "epoch": 0.12171321102870729, "grad_norm": 0.96484375, "learning_rate": 0.00043998245290007606, "loss": 7.0853, "mean_token_accuracy": 0.10058822184801101, "num_tokens": 3714492.0, "step": 1715 }, { "entropy": 7.091410732269287, "epoch": 0.12206806004045279, "grad_norm": 0.92578125, "learning_rate": 0.00043917914381937323, "loss": 7.0897, "mean_token_accuracy": 0.08864482194185257, "num_tokens": 3726138.0, "step": 1720 }, { "entropy": 7.256516599655152, "epoch": 0.12242290905219828, "grad_norm": 0.98046875, "learning_rate": 0.00043837133368450815, "loss": 7.1157, "mean_token_accuracy": 0.09941046983003617, "num_tokens": 3735382.0, "step": 1725 }, { "entropy": 7.111510515213013, "epoch": 0.1227777580639438, "grad_norm": 0.9921875, "learning_rate": 0.0004375590446420037, "loss": 7.0708, "mean_token_accuracy": 0.0973458357155323, "num_tokens": 3746160.0, "step": 1730 }, { "entropy": 7.065353298187256, "epoch": 0.1231326070756893, "grad_norm": 0.8671875, "learning_rate": 0.0004367422989611743, "loss": 7.0785, "mean_token_accuracy": 0.09655671492218972, "num_tokens": 3757679.0, "step": 1735 }, { "entropy": 7.209886121749878, "epoch": 0.12348745608743479, "grad_norm": 0.95703125, "learning_rate": 0.0004359211190335153, "loss": 7.084, "mean_token_accuracy": 0.09250145927071571, "num_tokens": 3767514.0, "step": 1740 }, { "entropy": 7.113470029830933, "epoch": 0.1238423050991803, "grad_norm": 0.9296875, "learning_rate": 0.00043509552737208923, "loss": 7.0898, "mean_token_accuracy": 0.09914448335766793, "num_tokens": 3778396.0, "step": 1745 }, { "entropy": 7.160091066360474, "epoch": 0.1241971541109258, "grad_norm": 0.9140625, "learning_rate": 0.00043426554661090853, "loss": 7.1196, "mean_token_accuracy": 0.09739524349570275, "num_tokens": 3789351.0, "step": 1750 }, { "entropy": 7.046756172180176, "epoch": 0.1245520031226713, "grad_norm": 1.046875, "learning_rate": 0.00043343119950431516, "loss": 7.0865, "mean_token_accuracy": 0.09295786619186401, "num_tokens": 3799709.0, "step": 1755 }, { "entropy": 7.234890604019165, "epoch": 0.12490685213441681, "grad_norm": 1.015625, "learning_rate": 0.00043259250892635644, "loss": 7.0903, "mean_token_accuracy": 0.09519705399870873, "num_tokens": 3810633.0, "step": 1760 }, { "entropy": 7.040793085098267, "epoch": 0.1252617011461623, "grad_norm": 0.94140625, "learning_rate": 0.0004317494978701582, "loss": 7.1194, "mean_token_accuracy": 0.09463633596897125, "num_tokens": 3821984.0, "step": 1765 }, { "entropy": 7.0925640106201175, "epoch": 0.12561655015790782, "grad_norm": 1.0390625, "learning_rate": 0.0004309021894472943, "loss": 7.0725, "mean_token_accuracy": 0.10138425305485725, "num_tokens": 3832488.0, "step": 1770 }, { "entropy": 7.049199962615967, "epoch": 0.1259713991696533, "grad_norm": 0.99609375, "learning_rate": 0.0004300506068871534, "loss": 6.9459, "mean_token_accuracy": 0.11415167003870011, "num_tokens": 3842329.0, "step": 1775 }, { "entropy": 7.090542364120483, "epoch": 0.12632624818139881, "grad_norm": 0.92578125, "learning_rate": 0.00042919477353630135, "loss": 7.0909, "mean_token_accuracy": 0.10182333439588546, "num_tokens": 3853585.0, "step": 1780 }, { "entropy": 7.182557058334351, "epoch": 0.12668109719314433, "grad_norm": 1.03125, "learning_rate": 0.000428334712857842, "loss": 7.0519, "mean_token_accuracy": 0.1040547601878643, "num_tokens": 3863538.0, "step": 1785 }, { "entropy": 7.089897584915161, "epoch": 0.1270359462048898, "grad_norm": 1.0859375, "learning_rate": 0.00042747044843077304, "loss": 7.1704, "mean_token_accuracy": 0.09324254468083382, "num_tokens": 3874277.0, "step": 1790 }, { "entropy": 7.142627429962158, "epoch": 0.12739079521663532, "grad_norm": 0.94140625, "learning_rate": 0.00042660200394934047, "loss": 7.0251, "mean_token_accuracy": 0.10115873888134956, "num_tokens": 3884591.0, "step": 1795 }, { "entropy": 7.1000548839569095, "epoch": 0.12774564422838083, "grad_norm": 0.95703125, "learning_rate": 0.00042572940322238844, "loss": 7.1397, "mean_token_accuracy": 0.09500750824809075, "num_tokens": 3895199.0, "step": 1800 }, { "entropy": 7.094432258605957, "epoch": 0.12810049324012632, "grad_norm": 0.92578125, "learning_rate": 0.00042485267017270664, "loss": 6.9529, "mean_token_accuracy": 0.10029699578881264, "num_tokens": 3907047.0, "step": 1805 }, { "entropy": 7.037583446502685, "epoch": 0.12845534225187183, "grad_norm": 1.09375, "learning_rate": 0.0004239718288363745, "loss": 7.0352, "mean_token_accuracy": 0.10667306259274482, "num_tokens": 3918385.0, "step": 1810 }, { "entropy": 7.121558809280396, "epoch": 0.12881019126361734, "grad_norm": 1.0234375, "learning_rate": 0.0004230869033621023, "loss": 7.0685, "mean_token_accuracy": 0.10168422237038613, "num_tokens": 3928468.0, "step": 1815 }, { "entropy": 7.143169403076172, "epoch": 0.12916504027536282, "grad_norm": 0.91796875, "learning_rate": 0.0004221979180105688, "loss": 7.0534, "mean_token_accuracy": 0.09920291230082512, "num_tokens": 3939530.0, "step": 1820 }, { "entropy": 7.0373697757720945, "epoch": 0.12951988928710834, "grad_norm": 0.87109375, "learning_rate": 0.00042130489715375645, "loss": 7.0355, "mean_token_accuracy": 0.0987101249396801, "num_tokens": 3950146.0, "step": 1825 }, { "entropy": 7.019313764572144, "epoch": 0.12987473829885385, "grad_norm": 0.8671875, "learning_rate": 0.00042040786527428335, "loss": 7.0325, "mean_token_accuracy": 0.0973743423819542, "num_tokens": 3961499.0, "step": 1830 }, { "entropy": 7.121405696868896, "epoch": 0.13022958731059933, "grad_norm": 0.92578125, "learning_rate": 0.0004195068469647315, "loss": 7.0472, "mean_token_accuracy": 0.10192081406712532, "num_tokens": 3972724.0, "step": 1835 }, { "entropy": 7.079566621780396, "epoch": 0.13058443632234484, "grad_norm": 0.90234375, "learning_rate": 0.00041860186692697297, "loss": 7.0077, "mean_token_accuracy": 0.1040501557290554, "num_tokens": 3983457.0, "step": 1840 }, { "entropy": 7.119902420043945, "epoch": 0.13093928533409036, "grad_norm": 0.9453125, "learning_rate": 0.00041769294997149264, "loss": 7.0384, "mean_token_accuracy": 0.09878516718745231, "num_tokens": 3994581.0, "step": 1845 }, { "entropy": 7.0431475162506105, "epoch": 0.13129413434583584, "grad_norm": 0.93359375, "learning_rate": 0.0004167801210167081, "loss": 7.054, "mean_token_accuracy": 0.10154439359903336, "num_tokens": 4005940.0, "step": 1850 }, { "entropy": 7.145562553405762, "epoch": 0.13164898335758135, "grad_norm": 0.96484375, "learning_rate": 0.0004158634050882861, "loss": 7.0096, "mean_token_accuracy": 0.109462571144104, "num_tokens": 4015961.0, "step": 1855 }, { "entropy": 7.093667459487915, "epoch": 0.13200383236932686, "grad_norm": 1.078125, "learning_rate": 0.0004149428273184569, "loss": 7.0528, "mean_token_accuracy": 0.10200647190213204, "num_tokens": 4025498.0, "step": 1860 }, { "entropy": 7.101914739608764, "epoch": 0.13235868138107235, "grad_norm": 0.90625, "learning_rate": 0.0004140184129453253, "loss": 7.021, "mean_token_accuracy": 0.09907697066664696, "num_tokens": 4036123.0, "step": 1865 }, { "entropy": 7.147734260559082, "epoch": 0.13271353039281786, "grad_norm": 0.890625, "learning_rate": 0.000413090187312178, "loss": 7.0086, "mean_token_accuracy": 0.10064524784684181, "num_tokens": 4046915.0, "step": 1870 }, { "entropy": 7.052229022979736, "epoch": 0.13306837940456337, "grad_norm": 0.953125, "learning_rate": 0.0004121581758667898, "loss": 7.0852, "mean_token_accuracy": 0.09829342514276504, "num_tokens": 4058050.0, "step": 1875 }, { "entropy": 7.142696905136108, "epoch": 0.13342322841630885, "grad_norm": 1.0234375, "learning_rate": 0.00041122240416072533, "loss": 7.0328, "mean_token_accuracy": 0.1022889830172062, "num_tokens": 4069184.0, "step": 1880 }, { "entropy": 7.088444232940674, "epoch": 0.13377807742805436, "grad_norm": 0.96875, "learning_rate": 0.0004102828978486385, "loss": 7.0415, "mean_token_accuracy": 0.10254081562161446, "num_tokens": 4079140.0, "step": 1885 }, { "entropy": 7.028472805023194, "epoch": 0.13413292643979988, "grad_norm": 0.98046875, "learning_rate": 0.0004093396826875695, "loss": 6.973, "mean_token_accuracy": 0.10482171401381493, "num_tokens": 4088905.0, "step": 1890 }, { "entropy": 7.023287677764893, "epoch": 0.13448777545154536, "grad_norm": 0.9765625, "learning_rate": 0.00040839278453623837, "loss": 7.0046, "mean_token_accuracy": 0.10013890415430068, "num_tokens": 4099425.0, "step": 1895 }, { "entropy": 7.070297384262085, "epoch": 0.13484262446329087, "grad_norm": 0.98046875, "learning_rate": 0.0004074422293543363, "loss": 6.9933, "mean_token_accuracy": 0.10154245495796203, "num_tokens": 4109313.0, "step": 1900 }, { "entropy": 7.08957085609436, "epoch": 0.13519747347503638, "grad_norm": 0.89453125, "learning_rate": 0.0004064880432018137, "loss": 7.0308, "mean_token_accuracy": 0.1028820551931858, "num_tokens": 4120326.0, "step": 1905 }, { "entropy": 7.095383787155152, "epoch": 0.13555232248678187, "grad_norm": 0.96484375, "learning_rate": 0.00040553025223816615, "loss": 7.0657, "mean_token_accuracy": 0.10205548778176307, "num_tokens": 4131001.0, "step": 1910 }, { "entropy": 7.074268007278443, "epoch": 0.13590717149852738, "grad_norm": 0.91015625, "learning_rate": 0.00040456888272171653, "loss": 7.0221, "mean_token_accuracy": 0.10284601524472237, "num_tokens": 4142565.0, "step": 1915 }, { "entropy": 7.059752988815307, "epoch": 0.1362620205102729, "grad_norm": 1.0078125, "learning_rate": 0.00040360396100889577, "loss": 7.0084, "mean_token_accuracy": 0.09651347175240517, "num_tokens": 4153453.0, "step": 1920 }, { "entropy": 7.082843971252442, "epoch": 0.13661686952201837, "grad_norm": 0.89453125, "learning_rate": 0.0004026355135535202, "loss": 7.0471, "mean_token_accuracy": 0.10347581580281258, "num_tokens": 4164445.0, "step": 1925 }, { "entropy": 7.052491092681885, "epoch": 0.1369717185337639, "grad_norm": 0.94140625, "learning_rate": 0.000401663566906066, "loss": 6.9734, "mean_token_accuracy": 0.10101649984717369, "num_tokens": 4175221.0, "step": 1930 }, { "entropy": 7.1004551410675045, "epoch": 0.1373265675455094, "grad_norm": 0.9296875, "learning_rate": 0.00040068814771294134, "loss": 6.9814, "mean_token_accuracy": 0.09965018033981324, "num_tokens": 4185686.0, "step": 1935 }, { "entropy": 6.955038690567017, "epoch": 0.13768141655725488, "grad_norm": 0.95703125, "learning_rate": 0.0003997092827157562, "loss": 6.9261, "mean_token_accuracy": 0.10875649526715278, "num_tokens": 4196217.0, "step": 1940 }, { "entropy": 7.081155776977539, "epoch": 0.1380362655690004, "grad_norm": 1.03125, "learning_rate": 0.000398726998750589, "loss": 7.064, "mean_token_accuracy": 0.10312055200338363, "num_tokens": 4206820.0, "step": 1945 }, { "entropy": 7.1204061031341555, "epoch": 0.1383911145807459, "grad_norm": 0.9296875, "learning_rate": 0.00039774132274725076, "loss": 7.0435, "mean_token_accuracy": 0.10409965664148331, "num_tokens": 4217855.0, "step": 1950 }, { "entropy": 7.0895867347717285, "epoch": 0.1387459635924914, "grad_norm": 0.94921875, "learning_rate": 0.00039675228172854707, "loss": 7.0694, "mean_token_accuracy": 0.09884442016482353, "num_tokens": 4229654.0, "step": 1955 }, { "entropy": 7.1512257099151615, "epoch": 0.1391008126042369, "grad_norm": 1.078125, "learning_rate": 0.0003957599028095371, "loss": 6.9793, "mean_token_accuracy": 0.10423392802476883, "num_tokens": 4240929.0, "step": 1960 }, { "entropy": 7.06306209564209, "epoch": 0.1394556616159824, "grad_norm": 0.9765625, "learning_rate": 0.00039476421319679017, "loss": 7.0795, "mean_token_accuracy": 0.10174657627940178, "num_tokens": 4252605.0, "step": 1965 }, { "entropy": 7.071248960494995, "epoch": 0.1398105106277279, "grad_norm": 0.91796875, "learning_rate": 0.00039376524018764, "loss": 6.9608, "mean_token_accuracy": 0.10477321967482567, "num_tokens": 4263690.0, "step": 1970 }, { "entropy": 7.039036417007447, "epoch": 0.1401653596394734, "grad_norm": 0.95703125, "learning_rate": 0.00039276301116943616, "loss": 6.986, "mean_token_accuracy": 0.09907544031739235, "num_tokens": 4274662.0, "step": 1975 }, { "entropy": 7.023434638977051, "epoch": 0.14052020865121892, "grad_norm": 0.984375, "learning_rate": 0.0003917575536187936, "loss": 6.9599, "mean_token_accuracy": 0.10383629649877549, "num_tokens": 4286231.0, "step": 1980 }, { "entropy": 7.086272573471069, "epoch": 0.1408750576629644, "grad_norm": 0.9921875, "learning_rate": 0.00039074889510083894, "loss": 6.9781, "mean_token_accuracy": 0.1037204198539257, "num_tokens": 4297489.0, "step": 1985 }, { "entropy": 7.031176328659058, "epoch": 0.14122990667470992, "grad_norm": 0.9453125, "learning_rate": 0.00038973706326845495, "loss": 7.0469, "mean_token_accuracy": 0.10251927375793457, "num_tokens": 4308164.0, "step": 1990 }, { "entropy": 7.13521671295166, "epoch": 0.14158475568645543, "grad_norm": 0.90234375, "learning_rate": 0.0003887220858615225, "loss": 7.0006, "mean_token_accuracy": 0.10318920761346817, "num_tokens": 4319209.0, "step": 1995 }, { "entropy": 6.968696165084839, "epoch": 0.1419396046982009, "grad_norm": 1.015625, "learning_rate": 0.0003877039907061597, "loss": 6.9492, "mean_token_accuracy": 0.10085738375782967, "num_tokens": 4329816.0, "step": 2000 }, { "entropy": 7.155592060089111, "epoch": 0.14229445370994642, "grad_norm": 1.0, "learning_rate": 0.0003866828057139598, "loss": 7.0195, "mean_token_accuracy": 0.10258031487464905, "num_tokens": 4340752.0, "step": 2005 }, { "entropy": 7.004485082626343, "epoch": 0.1426493027216919, "grad_norm": 0.9609375, "learning_rate": 0.00038565855888122503, "loss": 6.9452, "mean_token_accuracy": 0.10718585550785065, "num_tokens": 4352299.0, "step": 2010 }, { "entropy": 7.016558504104614, "epoch": 0.14300415173343742, "grad_norm": 0.87890625, "learning_rate": 0.00038463127828819975, "loss": 6.9894, "mean_token_accuracy": 0.10042356625199318, "num_tokens": 4363314.0, "step": 2015 }, { "entropy": 7.06671667098999, "epoch": 0.14335900074518293, "grad_norm": 0.94140625, "learning_rate": 0.00038360099209830043, "loss": 6.9807, "mean_token_accuracy": 0.094207713752985, "num_tokens": 4374741.0, "step": 2020 }, { "entropy": 7.052701568603515, "epoch": 0.1437138497569284, "grad_norm": 0.94921875, "learning_rate": 0.0003825677285573433, "loss": 6.9085, "mean_token_accuracy": 0.10400079190731049, "num_tokens": 4385496.0, "step": 2025 }, { "entropy": 6.985438394546509, "epoch": 0.14406869876867393, "grad_norm": 0.9609375, "learning_rate": 0.00038153151599277027, "loss": 7.0456, "mean_token_accuracy": 0.0999737560749054, "num_tokens": 4396411.0, "step": 2030 }, { "entropy": 7.02910966873169, "epoch": 0.14442354778041944, "grad_norm": 0.97265625, "learning_rate": 0.0003804923828128723, "loss": 6.931, "mean_token_accuracy": 0.10462129339575768, "num_tokens": 4406299.0, "step": 2035 }, { "entropy": 6.981289100646973, "epoch": 0.14477839679216492, "grad_norm": 0.8984375, "learning_rate": 0.0003794503575060104, "loss": 6.9247, "mean_token_accuracy": 0.10906698405742646, "num_tokens": 4417843.0, "step": 2040 }, { "entropy": 7.01538462638855, "epoch": 0.14513324580391043, "grad_norm": 0.9921875, "learning_rate": 0.00037840546863983484, "loss": 6.9303, "mean_token_accuracy": 0.10332909226417542, "num_tokens": 4428402.0, "step": 2045 }, { "entropy": 6.98654146194458, "epoch": 0.14548809481565594, "grad_norm": 1.1015625, "learning_rate": 0.0003773577448605015, "loss": 6.9306, "mean_token_accuracy": 0.10650690644979477, "num_tokens": 4439179.0, "step": 2050 }, { "entropy": 7.098060894012451, "epoch": 0.14584294382740143, "grad_norm": 1.0, "learning_rate": 0.0003763072148918872, "loss": 7.0222, "mean_token_accuracy": 0.10229001268744468, "num_tokens": 4450220.0, "step": 2055 }, { "entropy": 7.02388334274292, "epoch": 0.14619779283914694, "grad_norm": 0.95703125, "learning_rate": 0.0003752539075348017, "loss": 6.9459, "mean_token_accuracy": 0.09994500055909157, "num_tokens": 4460861.0, "step": 2060 }, { "entropy": 7.0822837352752686, "epoch": 0.14655264185089245, "grad_norm": 0.92578125, "learning_rate": 0.00037419785166619817, "loss": 6.9768, "mean_token_accuracy": 0.10057543143630028, "num_tokens": 4472241.0, "step": 2065 }, { "entropy": 7.131308603286743, "epoch": 0.14690749086263793, "grad_norm": 0.921875, "learning_rate": 0.0003731390762383818, "loss": 7.0109, "mean_token_accuracy": 0.099363424628973, "num_tokens": 4483682.0, "step": 2070 }, { "entropy": 7.054377174377441, "epoch": 0.14726233987438345, "grad_norm": 0.98828125, "learning_rate": 0.0003720776102782158, "loss": 6.9847, "mean_token_accuracy": 0.10540137887001037, "num_tokens": 4494175.0, "step": 2075 }, { "entropy": 6.972439384460449, "epoch": 0.14761718888612896, "grad_norm": 0.93359375, "learning_rate": 0.00037101348288632555, "loss": 6.7905, "mean_token_accuracy": 0.09852890223264694, "num_tokens": 4504781.0, "step": 2080 }, { "entropy": 7.004600477218628, "epoch": 0.14797203789787444, "grad_norm": 1.0078125, "learning_rate": 0.0003699467232363012, "loss": 6.9715, "mean_token_accuracy": 0.09647675678133964, "num_tokens": 4516246.0, "step": 2085 }, { "entropy": 7.0212174415588375, "epoch": 0.14832688690961995, "grad_norm": 1.0, "learning_rate": 0.0003688773605738973, "loss": 6.8931, "mean_token_accuracy": 0.10757157430052758, "num_tokens": 4526678.0, "step": 2090 }, { "entropy": 6.9830567836761475, "epoch": 0.14868173592136547, "grad_norm": 1.109375, "learning_rate": 0.00036780542421623134, "loss": 6.9876, "mean_token_accuracy": 0.10509380027651787, "num_tokens": 4537554.0, "step": 2095 }, { "entropy": 6.98748779296875, "epoch": 0.14903658493311095, "grad_norm": 0.94140625, "learning_rate": 0.0003667309435509802, "loss": 6.9897, "mean_token_accuracy": 0.09809067100286484, "num_tokens": 4548226.0, "step": 2100 }, { "entropy": 7.235601758956909, "epoch": 0.14939143394485646, "grad_norm": 0.94921875, "learning_rate": 0.0003656539480355741, "loss": 7.0464, "mean_token_accuracy": 0.09804995954036713, "num_tokens": 4560836.0, "step": 2105 }, { "entropy": 7.032708978652954, "epoch": 0.14974628295660197, "grad_norm": 0.97265625, "learning_rate": 0.0003645744671963891, "loss": 6.9384, "mean_token_accuracy": 0.10675909146666526, "num_tokens": 4572473.0, "step": 2110 }, { "entropy": 6.9664177894592285, "epoch": 0.15010113196834746, "grad_norm": 0.95703125, "learning_rate": 0.0003634925306279376, "loss": 6.995, "mean_token_accuracy": 0.09995530992746353, "num_tokens": 4584029.0, "step": 2115 }, { "entropy": 7.070379304885864, "epoch": 0.15045598098009297, "grad_norm": 0.91015625, "learning_rate": 0.0003624081679920574, "loss": 6.9981, "mean_token_accuracy": 0.09843715131282807, "num_tokens": 4595539.0, "step": 2120 }, { "entropy": 7.080266904830933, "epoch": 0.15081082999183848, "grad_norm": 1.2265625, "learning_rate": 0.0003613214090170977, "loss": 6.9609, "mean_token_accuracy": 0.10313019677996635, "num_tokens": 4606914.0, "step": 2125 }, { "entropy": 7.061946630477905, "epoch": 0.15116567900358396, "grad_norm": 0.86328125, "learning_rate": 0.0003602322834971048, "loss": 6.9116, "mean_token_accuracy": 0.10261239334940911, "num_tokens": 4618100.0, "step": 2130 }, { "entropy": 6.969537210464478, "epoch": 0.15152052801532948, "grad_norm": 0.94921875, "learning_rate": 0.0003591408212910051, "loss": 6.925, "mean_token_accuracy": 0.1127280555665493, "num_tokens": 4628896.0, "step": 2135 }, { "entropy": 7.063964605331421, "epoch": 0.151875377027075, "grad_norm": 1.0078125, "learning_rate": 0.0003580470523217863, "loss": 6.9457, "mean_token_accuracy": 0.10601773262023925, "num_tokens": 4639280.0, "step": 2140 }, { "entropy": 6.949308109283447, "epoch": 0.15223022603882047, "grad_norm": 0.92578125, "learning_rate": 0.0003569510065756771, "loss": 6.8887, "mean_token_accuracy": 0.10163175389170646, "num_tokens": 4649687.0, "step": 2145 }, { "entropy": 7.031176376342773, "epoch": 0.15258507505056598, "grad_norm": 0.8984375, "learning_rate": 0.0003558527141013254, "loss": 6.9478, "mean_token_accuracy": 0.10624543651938438, "num_tokens": 4661721.0, "step": 2150 }, { "entropy": 7.0959258556365965, "epoch": 0.1529399240623115, "grad_norm": 1.0078125, "learning_rate": 0.0003547522050089742, "loss": 6.9916, "mean_token_accuracy": 0.09919418841600418, "num_tokens": 4673648.0, "step": 2155 }, { "entropy": 7.012122440338135, "epoch": 0.15329477307405698, "grad_norm": 0.90625, "learning_rate": 0.00035364950946963606, "loss": 6.9773, "mean_token_accuracy": 0.10032318979501724, "num_tokens": 4684786.0, "step": 2160 }, { "entropy": 7.042158746719361, "epoch": 0.1536496220858025, "grad_norm": 0.9140625, "learning_rate": 0.0003525446577142663, "loss": 6.9531, "mean_token_accuracy": 0.09853310063481331, "num_tokens": 4695353.0, "step": 2165 }, { "entropy": 6.978724813461303, "epoch": 0.154004471097548, "grad_norm": 0.97265625, "learning_rate": 0.00035143768003293395, "loss": 6.8553, "mean_token_accuracy": 0.11324087306857109, "num_tokens": 4705719.0, "step": 2170 }, { "entropy": 7.0046632289886475, "epoch": 0.15435932010929349, "grad_norm": 0.87890625, "learning_rate": 0.0003503286067739913, "loss": 7.0269, "mean_token_accuracy": 0.09866114109754562, "num_tokens": 4718978.0, "step": 2175 }, { "entropy": 7.1116374969482425, "epoch": 0.154714169121039, "grad_norm": 1.0078125, "learning_rate": 0.00034921746834324193, "loss": 6.88, "mean_token_accuracy": 0.11316526606678963, "num_tokens": 4729099.0, "step": 2180 }, { "entropy": 6.8555004596710205, "epoch": 0.1550690181327845, "grad_norm": 0.92578125, "learning_rate": 0.0003481042952031072, "loss": 6.9688, "mean_token_accuracy": 0.09804181829094887, "num_tokens": 4740508.0, "step": 2185 }, { "entropy": 7.0752723693847654, "epoch": 0.15542386714453, "grad_norm": 0.91015625, "learning_rate": 0.0003469891178717911, "loss": 6.8949, "mean_token_accuracy": 0.11416682377457618, "num_tokens": 4752142.0, "step": 2190 }, { "entropy": 7.102331590652466, "epoch": 0.1557787161562755, "grad_norm": 0.98046875, "learning_rate": 0.0003458719669224436, "loss": 6.9794, "mean_token_accuracy": 0.10389717966318131, "num_tokens": 4762708.0, "step": 2195 }, { "entropy": 6.950309753417969, "epoch": 0.15613356516802102, "grad_norm": 0.8984375, "learning_rate": 0.0003447528729823221, "loss": 6.8937, "mean_token_accuracy": 0.11124820932745934, "num_tokens": 4773239.0, "step": 2200 }, { "entropy": 6.958485841751099, "epoch": 0.1564884141797665, "grad_norm": 1.0546875, "learning_rate": 0.0003436318667319525, "loss": 6.8641, "mean_token_accuracy": 0.10944292694330215, "num_tokens": 4783489.0, "step": 2205 }, { "entropy": 6.992775583267212, "epoch": 0.156843263191512, "grad_norm": 0.98046875, "learning_rate": 0.00034250897890428716, "loss": 6.8619, "mean_token_accuracy": 0.11418202966451645, "num_tokens": 4794425.0, "step": 2210 }, { "entropy": 7.0300380229949955, "epoch": 0.15719811220325752, "grad_norm": 0.85546875, "learning_rate": 0.0003413842402838633, "loss": 6.9179, "mean_token_accuracy": 0.10028508976101876, "num_tokens": 4806391.0, "step": 2215 }, { "entropy": 6.990481758117676, "epoch": 0.157552961215003, "grad_norm": 1.0859375, "learning_rate": 0.00034025768170595834, "loss": 6.8839, "mean_token_accuracy": 0.10272055044770241, "num_tokens": 4816689.0, "step": 2220 }, { "entropy": 7.015410566329956, "epoch": 0.15790781022674852, "grad_norm": 1.09375, "learning_rate": 0.0003391293340557446, "loss": 6.9709, "mean_token_accuracy": 0.09755917191505432, "num_tokens": 4827892.0, "step": 2225 }, { "entropy": 7.008429431915284, "epoch": 0.15826265923849403, "grad_norm": 0.98828125, "learning_rate": 0.0003379992282674431, "loss": 6.8583, "mean_token_accuracy": 0.11253580972552299, "num_tokens": 4838174.0, "step": 2230 }, { "entropy": 7.028060054779052, "epoch": 0.15861750825023951, "grad_norm": 1.078125, "learning_rate": 0.0003368673953234749, "loss": 6.9501, "mean_token_accuracy": 0.10639444887638091, "num_tokens": 4849390.0, "step": 2235 }, { "entropy": 7.012446880340576, "epoch": 0.15897235726198503, "grad_norm": 1.0703125, "learning_rate": 0.00033573386625361176, "loss": 6.9322, "mean_token_accuracy": 0.1081770859658718, "num_tokens": 4859130.0, "step": 2240 }, { "entropy": 6.958835411071777, "epoch": 0.15932720627373054, "grad_norm": 0.91796875, "learning_rate": 0.00033459867213412567, "loss": 6.7842, "mean_token_accuracy": 0.1121189422905445, "num_tokens": 4869992.0, "step": 2245 }, { "entropy": 6.9395585536956785, "epoch": 0.15968205528547602, "grad_norm": 0.99609375, "learning_rate": 0.000333461844086937, "loss": 6.8761, "mean_token_accuracy": 0.10806992277503014, "num_tokens": 4880178.0, "step": 2250 }, { "entropy": 7.033035564422607, "epoch": 0.16003690429722153, "grad_norm": 0.921875, "learning_rate": 0.00033232341327876097, "loss": 6.9967, "mean_token_accuracy": 0.10657852441072464, "num_tokens": 4892521.0, "step": 2255 }, { "entropy": 7.062964677810669, "epoch": 0.16039175330896704, "grad_norm": 0.9609375, "learning_rate": 0.0003311834109202531, "loss": 6.8279, "mean_token_accuracy": 0.10873689278960227, "num_tokens": 4904015.0, "step": 2260 }, { "entropy": 7.0085608005523685, "epoch": 0.16074660232071253, "grad_norm": 1.109375, "learning_rate": 0.00033004186826515416, "loss": 6.9017, "mean_token_accuracy": 0.11354547590017319, "num_tokens": 4914806.0, "step": 2265 }, { "entropy": 6.913502645492554, "epoch": 0.16110145133245804, "grad_norm": 0.9609375, "learning_rate": 0.0003288988166094324, "loss": 6.9735, "mean_token_accuracy": 0.10321487337350846, "num_tokens": 4926590.0, "step": 2270 }, { "entropy": 7.050243616104126, "epoch": 0.16145630034420355, "grad_norm": 0.875, "learning_rate": 0.00032775428729042656, "loss": 6.8725, "mean_token_accuracy": 0.10716884061694146, "num_tokens": 4937212.0, "step": 2275 }, { "entropy": 7.00547342300415, "epoch": 0.16181114935594904, "grad_norm": 1.0078125, "learning_rate": 0.000326608311685986, "loss": 6.9122, "mean_token_accuracy": 0.10085045397281647, "num_tokens": 4948059.0, "step": 2280 }, { "entropy": 7.020096683502198, "epoch": 0.16216599836769455, "grad_norm": 1.0234375, "learning_rate": 0.0003254609212136108, "loss": 6.9249, "mean_token_accuracy": 0.10465004742145538, "num_tokens": 4958962.0, "step": 2285 }, { "entropy": 6.947905540466309, "epoch": 0.16252084737944006, "grad_norm": 1.0625, "learning_rate": 0.00032431214732959036, "loss": 6.7898, "mean_token_accuracy": 0.1130453810095787, "num_tokens": 4969480.0, "step": 2290 }, { "entropy": 6.939700412750244, "epoch": 0.16287569639118554, "grad_norm": 0.98828125, "learning_rate": 0.000323162021528141, "loss": 6.8669, "mean_token_accuracy": 0.10693132355809212, "num_tokens": 4979784.0, "step": 2295 }, { "entropy": 6.982529783248902, "epoch": 0.16323054540293105, "grad_norm": 0.98828125, "learning_rate": 0.00032201057534054264, "loss": 6.9363, "mean_token_accuracy": 0.11092625781893731, "num_tokens": 4990308.0, "step": 2300 }, { "entropy": 7.040096569061279, "epoch": 0.16358539441467657, "grad_norm": 0.94921875, "learning_rate": 0.00032085784033427414, "loss": 6.9497, "mean_token_accuracy": 0.10680189654231072, "num_tokens": 5002068.0, "step": 2305 }, { "entropy": 7.060698699951172, "epoch": 0.16394024342642205, "grad_norm": 0.93359375, "learning_rate": 0.0003197038481121478, "loss": 6.8228, "mean_token_accuracy": 0.11382793858647347, "num_tokens": 5012567.0, "step": 2310 }, { "entropy": 6.907808923721314, "epoch": 0.16429509243816756, "grad_norm": 0.96484375, "learning_rate": 0.0003185486303114436, "loss": 6.8369, "mean_token_accuracy": 0.11393960565328598, "num_tokens": 5022899.0, "step": 2315 }, { "entropy": 6.992615556716919, "epoch": 0.16464994144991307, "grad_norm": 0.984375, "learning_rate": 0.0003173922186030409, "loss": 6.7848, "mean_token_accuracy": 0.11245036497712135, "num_tokens": 5033221.0, "step": 2320 }, { "entropy": 7.0934224128723145, "epoch": 0.16500479046165856, "grad_norm": 0.94140625, "learning_rate": 0.000316234644690551, "loss": 6.9766, "mean_token_accuracy": 0.10262498036026954, "num_tokens": 5045265.0, "step": 2325 }, { "entropy": 6.954192686080932, "epoch": 0.16535963947340407, "grad_norm": 1.0546875, "learning_rate": 0.0003150759403094473, "loss": 6.8155, "mean_token_accuracy": 0.10801345705986024, "num_tokens": 5055735.0, "step": 2330 }, { "entropy": 6.902051687240601, "epoch": 0.16571448848514958, "grad_norm": 0.96484375, "learning_rate": 0.00031391613722619587, "loss": 6.8765, "mean_token_accuracy": 0.10825056955218315, "num_tokens": 5066258.0, "step": 2335 }, { "entropy": 7.005957317352295, "epoch": 0.16606933749689506, "grad_norm": 0.96875, "learning_rate": 0.000312755267237384, "loss": 6.9255, "mean_token_accuracy": 0.1042802594602108, "num_tokens": 5077202.0, "step": 2340 }, { "entropy": 7.0072572231292725, "epoch": 0.16642418650864058, "grad_norm": 0.94921875, "learning_rate": 0.0003115933621688488, "loss": 6.8858, "mean_token_accuracy": 0.10783494263887405, "num_tokens": 5088367.0, "step": 2345 }, { "entropy": 7.012457418441772, "epoch": 0.1667790355203861, "grad_norm": 0.96484375, "learning_rate": 0.00031043045387480487, "loss": 6.8797, "mean_token_accuracy": 0.10552211254835128, "num_tokens": 5098724.0, "step": 2350 }, { "entropy": 6.929810476303101, "epoch": 0.16713388453213157, "grad_norm": 0.95703125, "learning_rate": 0.0003092665742369703, "loss": 6.7804, "mean_token_accuracy": 0.11827445849776268, "num_tokens": 5109996.0, "step": 2355 }, { "entropy": 6.902822065353393, "epoch": 0.16748873354387708, "grad_norm": 0.94140625, "learning_rate": 0.00030810175516369343, "loss": 6.9349, "mean_token_accuracy": 0.11100076511502266, "num_tokens": 5121137.0, "step": 2360 }, { "entropy": 7.053985357284546, "epoch": 0.1678435825556226, "grad_norm": 1.046875, "learning_rate": 0.0003069360285890775, "loss": 6.9059, "mean_token_accuracy": 0.10487226918339729, "num_tokens": 5132369.0, "step": 2365 }, { "entropy": 6.991532182693481, "epoch": 0.16819843156736808, "grad_norm": 1.03125, "learning_rate": 0.00030576942647210547, "loss": 6.7483, "mean_token_accuracy": 0.11153419762849807, "num_tokens": 5143360.0, "step": 2370 }, { "entropy": 6.964412689208984, "epoch": 0.1685532805791136, "grad_norm": 0.9140625, "learning_rate": 0.00030460198079576355, "loss": 6.8533, "mean_token_accuracy": 0.10653385668992996, "num_tokens": 5153975.0, "step": 2375 }, { "entropy": 7.016902065277099, "epoch": 0.1689081295908591, "grad_norm": 1.046875, "learning_rate": 0.0003034337235661648, "loss": 6.8784, "mean_token_accuracy": 0.10774541646242142, "num_tokens": 5165037.0, "step": 2380 }, { "entropy": 6.897519445419311, "epoch": 0.16926297860260459, "grad_norm": 1.0, "learning_rate": 0.0003022646868116714, "loss": 6.7927, "mean_token_accuracy": 0.1141560547053814, "num_tokens": 5175316.0, "step": 2385 }, { "entropy": 6.936920261383056, "epoch": 0.1696178276143501, "grad_norm": 0.91796875, "learning_rate": 0.0003010949025820163, "loss": 6.8653, "mean_token_accuracy": 0.1071905441582203, "num_tokens": 5187567.0, "step": 2390 }, { "entropy": 7.035586547851563, "epoch": 0.1699726766260956, "grad_norm": 0.98046875, "learning_rate": 0.0002999244029474252, "loss": 6.8021, "mean_token_accuracy": 0.11246755048632621, "num_tokens": 5198046.0, "step": 2395 }, { "entropy": 6.898006439208984, "epoch": 0.1703275256378411, "grad_norm": 1.015625, "learning_rate": 0.00029875321999773684, "loss": 6.8817, "mean_token_accuracy": 0.105026775598526, "num_tokens": 5207954.0, "step": 2400 }, { "entropy": 6.970842695236206, "epoch": 0.1706823746495866, "grad_norm": 1.078125, "learning_rate": 0.00029758138584152333, "loss": 6.8182, "mean_token_accuracy": 0.11151416301727295, "num_tokens": 5218524.0, "step": 2405 }, { "entropy": 6.9917010307312015, "epoch": 0.17103722366133212, "grad_norm": 1.046875, "learning_rate": 0.0002964089326052102, "loss": 6.9518, "mean_token_accuracy": 0.1023468978703022, "num_tokens": 5230375.0, "step": 2410 }, { "entropy": 7.060526180267334, "epoch": 0.1713920726730776, "grad_norm": 0.8671875, "learning_rate": 0.0002952358924321949, "loss": 6.9012, "mean_token_accuracy": 0.11125127226114273, "num_tokens": 5240425.0, "step": 2415 }, { "entropy": 7.019340848922729, "epoch": 0.1717469216848231, "grad_norm": 0.91796875, "learning_rate": 0.00029406229748196657, "loss": 6.825, "mean_token_accuracy": 0.10501738041639327, "num_tokens": 5251713.0, "step": 2420 }, { "entropy": 6.970897150039673, "epoch": 0.17210177069656862, "grad_norm": 1.0, "learning_rate": 0.0002928881799292235, "loss": 6.8769, "mean_token_accuracy": 0.10659899786114693, "num_tokens": 5262639.0, "step": 2425 }, { "entropy": 6.917237234115601, "epoch": 0.1724566197083141, "grad_norm": 0.9296875, "learning_rate": 0.00029171357196299154, "loss": 6.8396, "mean_token_accuracy": 0.116180519759655, "num_tokens": 5273609.0, "step": 2430 }, { "entropy": 7.0096338272094725, "epoch": 0.17281146872005962, "grad_norm": 1.0546875, "learning_rate": 0.0002905385057857414, "loss": 6.8977, "mean_token_accuracy": 0.10368822440505028, "num_tokens": 5284090.0, "step": 2435 }, { "entropy": 7.017961835861206, "epoch": 0.17316631773180513, "grad_norm": 1.0859375, "learning_rate": 0.0002893630136125058, "loss": 6.8516, "mean_token_accuracy": 0.10498897284269333, "num_tokens": 5294537.0, "step": 2440 }, { "entropy": 6.940798044204712, "epoch": 0.17352116674355061, "grad_norm": 0.9921875, "learning_rate": 0.0002881871276699967, "loss": 6.8249, "mean_token_accuracy": 0.1162478543817997, "num_tokens": 5305524.0, "step": 2445 }, { "entropy": 6.935272312164306, "epoch": 0.17387601575529613, "grad_norm": 0.9375, "learning_rate": 0.00028701088019572114, "loss": 6.8247, "mean_token_accuracy": 0.10882443636655807, "num_tokens": 5317408.0, "step": 2450 }, { "entropy": 6.978143835067749, "epoch": 0.1742308647670416, "grad_norm": 0.91015625, "learning_rate": 0.0002858343034370977, "loss": 6.871, "mean_token_accuracy": 0.10791338384151458, "num_tokens": 5328275.0, "step": 2455 }, { "entropy": 6.904288864135742, "epoch": 0.17458571377878712, "grad_norm": 1.0546875, "learning_rate": 0.00028465742965057267, "loss": 6.8864, "mean_token_accuracy": 0.11189721897244453, "num_tokens": 5338990.0, "step": 2460 }, { "entropy": 7.034686183929443, "epoch": 0.17494056279053263, "grad_norm": 1.0390625, "learning_rate": 0.00028348029110073533, "loss": 6.851, "mean_token_accuracy": 0.1080154150724411, "num_tokens": 5349826.0, "step": 2465 }, { "entropy": 6.9757061958312985, "epoch": 0.17529541180227812, "grad_norm": 0.96875, "learning_rate": 0.00028230292005943365, "loss": 6.8879, "mean_token_accuracy": 0.11000979393720627, "num_tokens": 5361354.0, "step": 2470 }, { "entropy": 6.949403190612793, "epoch": 0.17565026081402363, "grad_norm": 1.046875, "learning_rate": 0.00028112534880488945, "loss": 6.885, "mean_token_accuracy": 0.1100533053278923, "num_tokens": 5371079.0, "step": 2475 }, { "entropy": 7.012681579589843, "epoch": 0.17600510982576914, "grad_norm": 0.96484375, "learning_rate": 0.0002799476096208137, "loss": 6.8556, "mean_token_accuracy": 0.10374706834554673, "num_tokens": 5381351.0, "step": 2480 }, { "entropy": 6.982795715332031, "epoch": 0.17635995883751462, "grad_norm": 0.9140625, "learning_rate": 0.00027876973479552087, "loss": 6.7851, "mean_token_accuracy": 0.11224160492420196, "num_tokens": 5391638.0, "step": 2485 }, { "entropy": 6.904779100418091, "epoch": 0.17671480784926014, "grad_norm": 0.890625, "learning_rate": 0.00027759175662104424, "loss": 6.8322, "mean_token_accuracy": 0.10784663334488868, "num_tokens": 5402882.0, "step": 2490 }, { "entropy": 7.070130634307861, "epoch": 0.17706965686100565, "grad_norm": 1.03125, "learning_rate": 0.0002764137073922508, "loss": 6.818, "mean_token_accuracy": 0.11323273256421089, "num_tokens": 5412563.0, "step": 2495 }, { "entropy": 6.9515509605407715, "epoch": 0.17742450587275113, "grad_norm": 0.91015625, "learning_rate": 0.00027523561940595505, "loss": 6.8012, "mean_token_accuracy": 0.10688069686293603, "num_tokens": 5423980.0, "step": 2500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 7893713940480000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }