{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.03548490117455023, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691987895965577, "epoch": 0.00035484901174550227, "grad_norm": 11.625, "learning_rate": 2e-06, "loss": 10.8366, "mean_token_accuracy": 0.0, "num_tokens": 11280.0, "step": 5 }, { "entropy": 10.691946220397949, "epoch": 0.0007096980234910045, "grad_norm": 11.5625, "learning_rate": 4.5e-06, "loss": 10.7735, "mean_token_accuracy": 0.00010460250778123736, "num_tokens": 21887.0, "step": 10 }, { "entropy": 10.69083604812622, "epoch": 0.001064547035236507, "grad_norm": 9.6875, "learning_rate": 7e-06, "loss": 10.5654, "mean_token_accuracy": 0.02854402889497578, "num_tokens": 32911.0, "step": 15 }, { "entropy": 10.66428632736206, "epoch": 0.001419396046982009, "grad_norm": 6.0625, "learning_rate": 9.5e-06, "loss": 10.3144, "mean_token_accuracy": 0.04550958257168532, "num_tokens": 43994.0, "step": 20 }, { "entropy": 10.494576263427735, "epoch": 0.0017742450587275114, "grad_norm": 4.28125, "learning_rate": 1.2e-05, "loss": 10.105, "mean_token_accuracy": 0.041560862213373184, "num_tokens": 54342.0, "step": 25 }, { "entropy": 10.533498859405517, "epoch": 0.002129094070473014, "grad_norm": 2.921875, "learning_rate": 1.4500000000000002e-05, "loss": 9.9509, "mean_token_accuracy": 0.044634624011814596, "num_tokens": 64768.0, "step": 30 }, { "entropy": 10.53185338973999, "epoch": 0.002483943082218516, "grad_norm": 2.59375, "learning_rate": 1.7000000000000003e-05, "loss": 9.9269, "mean_token_accuracy": 0.04376727268099785, "num_tokens": 75530.0, "step": 35 }, { "entropy": 10.487653255462646, "epoch": 0.002838792093964018, "grad_norm": 2.40625, "learning_rate": 1.95e-05, "loss": 9.8511, "mean_token_accuracy": 0.045070053450763224, "num_tokens": 85983.0, "step": 40 }, { "entropy": 10.522008514404297, "epoch": 0.0031936411057095207, "grad_norm": 2.28125, "learning_rate": 2.2e-05, "loss": 9.8344, "mean_token_accuracy": 0.04323017336428166, "num_tokens": 96168.0, "step": 45 }, { "entropy": 10.482469272613525, "epoch": 0.0035484901174550228, "grad_norm": 1.8046875, "learning_rate": 2.4500000000000003e-05, "loss": 9.7891, "mean_token_accuracy": 0.05232359655201435, "num_tokens": 107899.0, "step": 50 }, { "entropy": 10.414291763305664, "epoch": 0.0039033391292005253, "grad_norm": 2.03125, "learning_rate": 2.7e-05, "loss": 9.7448, "mean_token_accuracy": 0.05363052934408188, "num_tokens": 119073.0, "step": 55 }, { "entropy": 10.483110237121583, "epoch": 0.004258188140946028, "grad_norm": 2.03125, "learning_rate": 2.95e-05, "loss": 9.7062, "mean_token_accuracy": 0.05208716280758381, "num_tokens": 129149.0, "step": 60 }, { "entropy": 10.321412563323975, "epoch": 0.00461303715269153, "grad_norm": 1.890625, "learning_rate": 3.2e-05, "loss": 9.5992, "mean_token_accuracy": 0.05521074235439301, "num_tokens": 139045.0, "step": 65 }, { "entropy": 10.363921737670898, "epoch": 0.004967886164437032, "grad_norm": 1.859375, "learning_rate": 3.4500000000000005e-05, "loss": 9.6115, "mean_token_accuracy": 0.054533609002828595, "num_tokens": 150251.0, "step": 70 }, { "entropy": 10.423143291473389, "epoch": 0.005322735176182534, "grad_norm": 1.984375, "learning_rate": 3.7e-05, "loss": 9.5269, "mean_token_accuracy": 0.05440324060618877, "num_tokens": 160230.0, "step": 75 }, { "entropy": 10.341320323944093, "epoch": 0.005677584187928036, "grad_norm": 1.546875, "learning_rate": 3.95e-05, "loss": 9.478, "mean_token_accuracy": 0.05366469696164131, "num_tokens": 170692.0, "step": 80 }, { "entropy": 10.290056896209716, "epoch": 0.006032433199673539, "grad_norm": 2.078125, "learning_rate": 4.2000000000000004e-05, "loss": 9.3959, "mean_token_accuracy": 0.05197730958461762, "num_tokens": 180616.0, "step": 85 }, { "entropy": 10.320787811279297, "epoch": 0.006387282211419041, "grad_norm": 1.7421875, "learning_rate": 4.45e-05, "loss": 9.3057, "mean_token_accuracy": 0.05711167939007282, "num_tokens": 191016.0, "step": 90 }, { "entropy": 10.258602237701416, "epoch": 0.0067421312231645434, "grad_norm": 1.640625, "learning_rate": 4.7000000000000004e-05, "loss": 9.2578, "mean_token_accuracy": 0.05482340231537819, "num_tokens": 202433.0, "step": 95 }, { "entropy": 10.235629463195801, "epoch": 0.0070969802349100455, "grad_norm": 1.40625, "learning_rate": 4.9500000000000004e-05, "loss": 9.2401, "mean_token_accuracy": 0.05469023734331131, "num_tokens": 214586.0, "step": 100 }, { "entropy": 10.223749732971191, "epoch": 0.007451829246655548, "grad_norm": 1.484375, "learning_rate": 5.2e-05, "loss": 9.0977, "mean_token_accuracy": 0.05747384466230869, "num_tokens": 225155.0, "step": 105 }, { "entropy": 10.136597728729248, "epoch": 0.007806678258401051, "grad_norm": 1.4609375, "learning_rate": 5.45e-05, "loss": 8.9983, "mean_token_accuracy": 0.05849210806190967, "num_tokens": 236050.0, "step": 110 }, { "entropy": 10.020172691345214, "epoch": 0.008161527270146553, "grad_norm": 1.375, "learning_rate": 5.7e-05, "loss": 8.8941, "mean_token_accuracy": 0.05953489430248737, "num_tokens": 245825.0, "step": 115 }, { "entropy": 9.979390907287598, "epoch": 0.008516376281892056, "grad_norm": 1.9453125, "learning_rate": 5.9499999999999996e-05, "loss": 8.8174, "mean_token_accuracy": 0.06152731701731682, "num_tokens": 256752.0, "step": 120 }, { "entropy": 9.866498374938965, "epoch": 0.008871225293637557, "grad_norm": 1.15625, "learning_rate": 6.2e-05, "loss": 8.802, "mean_token_accuracy": 0.05181486271321774, "num_tokens": 267603.0, "step": 125 }, { "entropy": 9.726642417907716, "epoch": 0.00922607430538306, "grad_norm": 1.1875, "learning_rate": 6.450000000000001e-05, "loss": 8.7071, "mean_token_accuracy": 0.05791006051003933, "num_tokens": 277478.0, "step": 130 }, { "entropy": 9.658979320526123, "epoch": 0.009580923317128561, "grad_norm": 1.2109375, "learning_rate": 6.7e-05, "loss": 8.66, "mean_token_accuracy": 0.05634133592247963, "num_tokens": 289710.0, "step": 135 }, { "entropy": 9.384044075012207, "epoch": 0.009935772328874064, "grad_norm": 1.1796875, "learning_rate": 6.950000000000001e-05, "loss": 8.5346, "mean_token_accuracy": 0.05907244272530079, "num_tokens": 299295.0, "step": 140 }, { "entropy": 9.350571346282958, "epoch": 0.010290621340619567, "grad_norm": 0.9375, "learning_rate": 7.2e-05, "loss": 8.5165, "mean_token_accuracy": 0.05372942052781582, "num_tokens": 310544.0, "step": 145 }, { "entropy": 9.217219734191895, "epoch": 0.010645470352365068, "grad_norm": 1.09375, "learning_rate": 7.45e-05, "loss": 8.4485, "mean_token_accuracy": 0.05611223764717579, "num_tokens": 321558.0, "step": 150 }, { "entropy": 9.077949619293213, "epoch": 0.011000319364110571, "grad_norm": 1.203125, "learning_rate": 7.7e-05, "loss": 8.44, "mean_token_accuracy": 0.05572409965097904, "num_tokens": 333265.0, "step": 155 }, { "entropy": 8.919435977935791, "epoch": 0.011355168375856073, "grad_norm": 1.1328125, "learning_rate": 7.950000000000001e-05, "loss": 8.3707, "mean_token_accuracy": 0.060116075351834296, "num_tokens": 343406.0, "step": 160 }, { "entropy": 8.981222343444824, "epoch": 0.011710017387601575, "grad_norm": 1.140625, "learning_rate": 8.2e-05, "loss": 8.4388, "mean_token_accuracy": 0.05228844713419676, "num_tokens": 354934.0, "step": 165 }, { "entropy": 8.788821792602539, "epoch": 0.012064866399347078, "grad_norm": 0.95703125, "learning_rate": 8.450000000000001e-05, "loss": 8.3627, "mean_token_accuracy": 0.05599985755980015, "num_tokens": 364991.0, "step": 170 }, { "entropy": 8.838678550720214, "epoch": 0.01241971541109258, "grad_norm": 0.87109375, "learning_rate": 8.7e-05, "loss": 8.3174, "mean_token_accuracy": 0.05698671489953995, "num_tokens": 375362.0, "step": 175 }, { "entropy": 8.669477367401123, "epoch": 0.012774564422838083, "grad_norm": 1.046875, "learning_rate": 8.95e-05, "loss": 8.2929, "mean_token_accuracy": 0.06303150560706854, "num_tokens": 386758.0, "step": 180 }, { "entropy": 8.66919822692871, "epoch": 0.013129413434583584, "grad_norm": 0.9140625, "learning_rate": 9.2e-05, "loss": 8.304, "mean_token_accuracy": 0.061275123804807666, "num_tokens": 397073.0, "step": 185 }, { "entropy": 8.68841199874878, "epoch": 0.013484262446329087, "grad_norm": 0.85546875, "learning_rate": 9.45e-05, "loss": 8.4007, "mean_token_accuracy": 0.05668871849775314, "num_tokens": 408098.0, "step": 190 }, { "entropy": 8.577757740020752, "epoch": 0.01383911145807459, "grad_norm": 1.2109375, "learning_rate": 9.7e-05, "loss": 8.2425, "mean_token_accuracy": 0.06331006735563278, "num_tokens": 418910.0, "step": 195 }, { "entropy": 8.616193675994873, "epoch": 0.014193960469820091, "grad_norm": 1.0546875, "learning_rate": 9.95e-05, "loss": 8.3266, "mean_token_accuracy": 0.059384917840361595, "num_tokens": 429328.0, "step": 200 }, { "entropy": 8.564495944976807, "epoch": 0.014548809481565594, "grad_norm": 1.96875, "learning_rate": 0.000102, "loss": 8.286, "mean_token_accuracy": 0.058925506100058554, "num_tokens": 440293.0, "step": 205 }, { "entropy": 8.546427249908447, "epoch": 0.014903658493311095, "grad_norm": 1.28125, "learning_rate": 0.00010449999999999999, "loss": 8.2513, "mean_token_accuracy": 0.057647600024938586, "num_tokens": 451509.0, "step": 210 }, { "entropy": 8.532197761535645, "epoch": 0.015258507505056598, "grad_norm": 0.91015625, "learning_rate": 0.000107, "loss": 8.258, "mean_token_accuracy": 0.058545221015810965, "num_tokens": 461660.0, "step": 215 }, { "entropy": 8.52504529953003, "epoch": 0.015613356516802101, "grad_norm": 1.1953125, "learning_rate": 0.0001095, "loss": 8.2467, "mean_token_accuracy": 0.0674739558249712, "num_tokens": 471362.0, "step": 220 }, { "entropy": 8.518447113037109, "epoch": 0.015968205528547604, "grad_norm": 1.15625, "learning_rate": 0.000112, "loss": 8.1115, "mean_token_accuracy": 0.07247221358120441, "num_tokens": 482036.0, "step": 225 }, { "entropy": 8.392018604278565, "epoch": 0.016323054540293105, "grad_norm": 1.0703125, "learning_rate": 0.0001145, "loss": 8.2038, "mean_token_accuracy": 0.06354649700224399, "num_tokens": 492633.0, "step": 230 }, { "entropy": 8.478435707092284, "epoch": 0.016677903552038607, "grad_norm": 1.140625, "learning_rate": 0.00011700000000000001, "loss": 8.2366, "mean_token_accuracy": 0.06092475391924381, "num_tokens": 502613.0, "step": 235 }, { "entropy": 8.442237091064452, "epoch": 0.01703275256378411, "grad_norm": 1.1328125, "learning_rate": 0.00011949999999999999, "loss": 8.26, "mean_token_accuracy": 0.06470727063715458, "num_tokens": 513256.0, "step": 240 }, { "entropy": 8.596701526641846, "epoch": 0.017387601575529613, "grad_norm": 1.0625, "learning_rate": 0.000122, "loss": 8.2988, "mean_token_accuracy": 0.061711058393120764, "num_tokens": 523355.0, "step": 245 }, { "entropy": 8.451476860046387, "epoch": 0.017742450587275114, "grad_norm": 1.015625, "learning_rate": 0.0001245, "loss": 8.2216, "mean_token_accuracy": 0.06455190740525722, "num_tokens": 535195.0, "step": 250 }, { "entropy": 8.469265937805176, "epoch": 0.018097299599020615, "grad_norm": 1.046875, "learning_rate": 0.000127, "loss": 8.1852, "mean_token_accuracy": 0.06743233427405357, "num_tokens": 544831.0, "step": 255 }, { "entropy": 8.445653438568115, "epoch": 0.01845214861076612, "grad_norm": 1.2421875, "learning_rate": 0.0001295, "loss": 8.2694, "mean_token_accuracy": 0.059878384508192536, "num_tokens": 555835.0, "step": 260 }, { "entropy": 8.478738117218018, "epoch": 0.01880699762251162, "grad_norm": 1.1796875, "learning_rate": 0.000132, "loss": 8.2247, "mean_token_accuracy": 0.06131057888269424, "num_tokens": 566875.0, "step": 265 }, { "entropy": 8.375457763671875, "epoch": 0.019161846634257122, "grad_norm": 1.09375, "learning_rate": 0.00013450000000000002, "loss": 8.237, "mean_token_accuracy": 0.06333270035684109, "num_tokens": 577462.0, "step": 270 }, { "entropy": 8.501999855041504, "epoch": 0.019516695646002627, "grad_norm": 1.0703125, "learning_rate": 0.00013700000000000002, "loss": 8.1721, "mean_token_accuracy": 0.06697900146245957, "num_tokens": 587569.0, "step": 275 }, { "entropy": 8.420077037811279, "epoch": 0.019871544657748128, "grad_norm": 0.921875, "learning_rate": 0.0001395, "loss": 8.2355, "mean_token_accuracy": 0.05800015553832054, "num_tokens": 599322.0, "step": 280 }, { "entropy": 8.452305221557618, "epoch": 0.02022639366949363, "grad_norm": 0.921875, "learning_rate": 0.00014199999999999998, "loss": 8.2397, "mean_token_accuracy": 0.06376027651131153, "num_tokens": 610060.0, "step": 285 }, { "entropy": 8.481741237640382, "epoch": 0.020581242681239134, "grad_norm": 1.234375, "learning_rate": 0.0001445, "loss": 8.295, "mean_token_accuracy": 0.06520596966147423, "num_tokens": 620091.0, "step": 290 }, { "entropy": 8.525186729431152, "epoch": 0.020936091692984635, "grad_norm": 2.140625, "learning_rate": 0.000147, "loss": 8.12, "mean_token_accuracy": 0.0748389147222042, "num_tokens": 631440.0, "step": 295 }, { "entropy": 8.37361249923706, "epoch": 0.021290940704730137, "grad_norm": 1.015625, "learning_rate": 0.0001495, "loss": 8.0801, "mean_token_accuracy": 0.06787928678095341, "num_tokens": 641374.0, "step": 300 }, { "entropy": 8.305605411529541, "epoch": 0.02164578971647564, "grad_norm": 1.0, "learning_rate": 0.000152, "loss": 8.1269, "mean_token_accuracy": 0.06664356999099255, "num_tokens": 652772.0, "step": 305 }, { "entropy": 8.341912460327148, "epoch": 0.022000638728221143, "grad_norm": 1.1328125, "learning_rate": 0.00015450000000000001, "loss": 8.1348, "mean_token_accuracy": 0.07087188474833965, "num_tokens": 664052.0, "step": 310 }, { "entropy": 8.363450813293458, "epoch": 0.022355487739966644, "grad_norm": 1.03125, "learning_rate": 0.000157, "loss": 8.1412, "mean_token_accuracy": 0.07019479162991046, "num_tokens": 675937.0, "step": 315 }, { "entropy": 8.314255905151366, "epoch": 0.022710336751712145, "grad_norm": 0.93359375, "learning_rate": 0.0001595, "loss": 8.065, "mean_token_accuracy": 0.07636438310146332, "num_tokens": 687149.0, "step": 320 }, { "entropy": 8.342943286895752, "epoch": 0.02306518576345765, "grad_norm": 1.0390625, "learning_rate": 0.000162, "loss": 8.0868, "mean_token_accuracy": 0.06923852488398552, "num_tokens": 697646.0, "step": 325 }, { "entropy": 8.419994449615478, "epoch": 0.02342003477520315, "grad_norm": 1.1484375, "learning_rate": 0.00016450000000000001, "loss": 8.2002, "mean_token_accuracy": 0.06634289510548115, "num_tokens": 708612.0, "step": 330 }, { "entropy": 8.354696655273438, "epoch": 0.023774883786948652, "grad_norm": 1.0546875, "learning_rate": 0.00016700000000000002, "loss": 8.1205, "mean_token_accuracy": 0.07153847180306912, "num_tokens": 719705.0, "step": 335 }, { "entropy": 8.35772638320923, "epoch": 0.024129732798694157, "grad_norm": 0.890625, "learning_rate": 0.00016950000000000003, "loss": 8.0862, "mean_token_accuracy": 0.06683175601065158, "num_tokens": 730552.0, "step": 340 }, { "entropy": 8.334082317352294, "epoch": 0.024484581810439658, "grad_norm": 1.140625, "learning_rate": 0.00017199999999999998, "loss": 8.0935, "mean_token_accuracy": 0.06866642013192177, "num_tokens": 741651.0, "step": 345 }, { "entropy": 8.407394886016846, "epoch": 0.02483943082218516, "grad_norm": 1.03125, "learning_rate": 0.00017449999999999999, "loss": 8.1023, "mean_token_accuracy": 0.06832008063793182, "num_tokens": 751820.0, "step": 350 }, { "entropy": 8.351481819152832, "epoch": 0.025194279833930664, "grad_norm": 1.21875, "learning_rate": 0.000177, "loss": 8.1154, "mean_token_accuracy": 0.06219382137060166, "num_tokens": 762125.0, "step": 355 }, { "entropy": 8.352156829833984, "epoch": 0.025549128845676165, "grad_norm": 0.92578125, "learning_rate": 0.0001795, "loss": 8.0332, "mean_token_accuracy": 0.07175925448536873, "num_tokens": 773137.0, "step": 360 }, { "entropy": 8.26557502746582, "epoch": 0.025903977857421667, "grad_norm": 1.015625, "learning_rate": 0.000182, "loss": 8.117, "mean_token_accuracy": 0.06638101302087307, "num_tokens": 784702.0, "step": 365 }, { "entropy": 8.30114049911499, "epoch": 0.026258826869167168, "grad_norm": 0.9296875, "learning_rate": 0.0001845, "loss": 8.0759, "mean_token_accuracy": 0.06737305559217929, "num_tokens": 795806.0, "step": 370 }, { "entropy": 8.324819755554199, "epoch": 0.026613675880912673, "grad_norm": 0.8515625, "learning_rate": 0.000187, "loss": 8.0175, "mean_token_accuracy": 0.06811637170612812, "num_tokens": 806006.0, "step": 375 }, { "entropy": 8.294619274139404, "epoch": 0.026968524892658174, "grad_norm": 0.98828125, "learning_rate": 0.0001895, "loss": 8.0306, "mean_token_accuracy": 0.0675454068928957, "num_tokens": 816345.0, "step": 380 }, { "entropy": 8.203885173797607, "epoch": 0.027323373904403675, "grad_norm": 0.92578125, "learning_rate": 0.000192, "loss": 8.0311, "mean_token_accuracy": 0.06778408177196979, "num_tokens": 827038.0, "step": 385 }, { "entropy": 8.261708545684815, "epoch": 0.02767822291614918, "grad_norm": 0.84765625, "learning_rate": 0.0001945, "loss": 8.0325, "mean_token_accuracy": 0.07145289778709411, "num_tokens": 837465.0, "step": 390 }, { "entropy": 8.322563171386719, "epoch": 0.02803307192789468, "grad_norm": 1.1015625, "learning_rate": 0.00019700000000000002, "loss": 8.0101, "mean_token_accuracy": 0.0660801563411951, "num_tokens": 848461.0, "step": 395 }, { "entropy": 8.286761474609374, "epoch": 0.028387920939640182, "grad_norm": 1.5390625, "learning_rate": 0.00019950000000000002, "loss": 8.0912, "mean_token_accuracy": 0.06686392053961754, "num_tokens": 859215.0, "step": 400 }, { "entropy": 8.153140926361084, "epoch": 0.028742769951385687, "grad_norm": 0.95703125, "learning_rate": 0.000202, "loss": 7.9714, "mean_token_accuracy": 0.06791464723646641, "num_tokens": 869165.0, "step": 405 }, { "entropy": 8.278606796264649, "epoch": 0.029097618963131188, "grad_norm": 1.1796875, "learning_rate": 0.00020449999999999998, "loss": 8.0299, "mean_token_accuracy": 0.06314935013651848, "num_tokens": 879737.0, "step": 410 }, { "entropy": 8.317267990112304, "epoch": 0.02945246797487669, "grad_norm": 0.97265625, "learning_rate": 0.000207, "loss": 8.0687, "mean_token_accuracy": 0.06716468073427677, "num_tokens": 889960.0, "step": 415 }, { "entropy": 8.284847354888916, "epoch": 0.02980731698662219, "grad_norm": 1.0390625, "learning_rate": 0.0002095, "loss": 8.0315, "mean_token_accuracy": 0.06850776262581348, "num_tokens": 902004.0, "step": 420 }, { "entropy": 8.195465469360352, "epoch": 0.030162165998367695, "grad_norm": 1.015625, "learning_rate": 0.000212, "loss": 7.9605, "mean_token_accuracy": 0.06964701861143112, "num_tokens": 912448.0, "step": 425 }, { "entropy": 8.246010208129883, "epoch": 0.030517015010113197, "grad_norm": 1.1015625, "learning_rate": 0.0002145, "loss": 8.0425, "mean_token_accuracy": 0.06564139947295189, "num_tokens": 922295.0, "step": 430 }, { "entropy": 8.212500381469727, "epoch": 0.030871864021858698, "grad_norm": 1.15625, "learning_rate": 0.00021700000000000002, "loss": 7.9675, "mean_token_accuracy": 0.07113610915839672, "num_tokens": 932849.0, "step": 435 }, { "entropy": 8.252998352050781, "epoch": 0.031226713033604202, "grad_norm": 1.1640625, "learning_rate": 0.0002195, "loss": 7.9716, "mean_token_accuracy": 0.06684075817465782, "num_tokens": 943570.0, "step": 440 }, { "entropy": 8.093912363052368, "epoch": 0.031581562045349704, "grad_norm": 1.0625, "learning_rate": 0.000222, "loss": 8.0064, "mean_token_accuracy": 0.06446249783039093, "num_tokens": 953681.0, "step": 445 }, { "entropy": 8.259466552734375, "epoch": 0.03193641105709521, "grad_norm": 1.0390625, "learning_rate": 0.0002245, "loss": 8.0026, "mean_token_accuracy": 0.06529812254011631, "num_tokens": 965027.0, "step": 450 }, { "entropy": 8.120300006866454, "epoch": 0.032291260068840706, "grad_norm": 1.0703125, "learning_rate": 0.00022700000000000002, "loss": 7.9335, "mean_token_accuracy": 0.06843561045825482, "num_tokens": 975757.0, "step": 455 }, { "entropy": 8.253607749938965, "epoch": 0.03264610908058621, "grad_norm": 0.8359375, "learning_rate": 0.00022950000000000002, "loss": 7.975, "mean_token_accuracy": 0.07162793055176735, "num_tokens": 987354.0, "step": 460 }, { "entropy": 8.038683032989502, "epoch": 0.033000958092331716, "grad_norm": 1.0625, "learning_rate": 0.00023200000000000003, "loss": 7.9604, "mean_token_accuracy": 0.06958170719444752, "num_tokens": 997844.0, "step": 465 }, { "entropy": 8.277831172943115, "epoch": 0.03335580710407721, "grad_norm": 1.1484375, "learning_rate": 0.00023449999999999998, "loss": 8.0444, "mean_token_accuracy": 0.07072999998927117, "num_tokens": 1008748.0, "step": 470 }, { "entropy": 8.073792266845704, "epoch": 0.03371065611582272, "grad_norm": 1.078125, "learning_rate": 0.000237, "loss": 7.8659, "mean_token_accuracy": 0.0738751970231533, "num_tokens": 1018612.0, "step": 475 }, { "entropy": 8.137950706481934, "epoch": 0.03406550512756822, "grad_norm": 1.2578125, "learning_rate": 0.0002395, "loss": 7.9242, "mean_token_accuracy": 0.07282396517693997, "num_tokens": 1029431.0, "step": 480 }, { "entropy": 8.098453617095947, "epoch": 0.03442035413931372, "grad_norm": 1.1328125, "learning_rate": 0.000242, "loss": 7.9572, "mean_token_accuracy": 0.06277543865144253, "num_tokens": 1041255.0, "step": 485 }, { "entropy": 8.044496870040893, "epoch": 0.034775203151059225, "grad_norm": 1.375, "learning_rate": 0.0002445, "loss": 7.7917, "mean_token_accuracy": 0.08647977113723755, "num_tokens": 1052416.0, "step": 490 }, { "entropy": 8.117148971557617, "epoch": 0.03513005216280473, "grad_norm": 0.98046875, "learning_rate": 0.000247, "loss": 7.9132, "mean_token_accuracy": 0.07025011256337166, "num_tokens": 1063801.0, "step": 495 }, { "entropy": 8.052232360839843, "epoch": 0.03548490117455023, "grad_norm": 1.1015625, "learning_rate": 0.0002495, "loss": 7.9351, "mean_token_accuracy": 0.06856431551277638, "num_tokens": 1074984.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1584891316224000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }