{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.03304583457255213, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742584800720214, "epoch": 0.0003304583457255213, "grad_norm": 5.03125, "learning_rate": 2e-06, "loss": 10.7734, "mean_token_accuracy": 0.0, "num_tokens": 10288.0, "step": 5 }, { "entropy": 10.742583179473877, "epoch": 0.0006609166914510426, "grad_norm": 4.28125, "learning_rate": 4.5e-06, "loss": 10.7648, "mean_token_accuracy": 8.474576170556248e-05, "num_tokens": 20647.0, "step": 10 }, { "entropy": 10.74263048171997, "epoch": 0.000991375037176564, "grad_norm": 4.5, "learning_rate": 7e-06, "loss": 10.7389, "mean_token_accuracy": 0.00012787723680958153, "num_tokens": 30934.0, "step": 15 }, { "entropy": 10.742611503601074, "epoch": 0.0013218333829020852, "grad_norm": 4.8125, "learning_rate": 9.5e-06, "loss": 10.7077, "mean_token_accuracy": 0.0007004500948823988, "num_tokens": 41985.0, "step": 20 }, { "entropy": 10.742591762542725, "epoch": 0.0016522917286276066, "grad_norm": 4.5, "learning_rate": 1.2e-05, "loss": 10.5981, "mean_token_accuracy": 0.005805681901983916, "num_tokens": 52249.0, "step": 25 }, { "entropy": 10.742315578460694, "epoch": 0.001982750074353128, "grad_norm": 3.765625, "learning_rate": 1.4500000000000002e-05, "loss": 10.4964, "mean_token_accuracy": 0.02333841286599636, "num_tokens": 63022.0, "step": 30 }, { "entropy": 10.741240406036377, "epoch": 0.002313208420078649, "grad_norm": 3.34375, "learning_rate": 1.7000000000000003e-05, "loss": 10.3567, "mean_token_accuracy": 0.041300085932016374, "num_tokens": 74862.0, "step": 35 }, { "entropy": 10.738348007202148, "epoch": 0.0026436667658041703, "grad_norm": 2.5, "learning_rate": 1.95e-05, "loss": 10.2419, "mean_token_accuracy": 0.03633426204323768, "num_tokens": 86588.0, "step": 40 }, { "entropy": 10.734376811981202, "epoch": 0.0029741251115296915, "grad_norm": 2.328125, "learning_rate": 2.2e-05, "loss": 10.1017, "mean_token_accuracy": 0.037262484431266785, "num_tokens": 96248.0, "step": 45 }, { "entropy": 10.731352519989013, "epoch": 0.003304583457255213, "grad_norm": 1.953125, "learning_rate": 2.4500000000000003e-05, "loss": 10.0565, "mean_token_accuracy": 0.03895317334681749, "num_tokens": 107167.0, "step": 50 }, { "entropy": 10.729418754577637, "epoch": 0.0036350418029807343, "grad_norm": 1.9609375, "learning_rate": 2.7e-05, "loss": 9.943, "mean_token_accuracy": 0.04272819831967354, "num_tokens": 117207.0, "step": 55 }, { "entropy": 10.726603794097901, "epoch": 0.003965500148706256, "grad_norm": 1.78125, "learning_rate": 2.95e-05, "loss": 9.9323, "mean_token_accuracy": 0.034439234621822835, "num_tokens": 127335.0, "step": 60 }, { "entropy": 10.724784851074219, "epoch": 0.004295958494431777, "grad_norm": 1.890625, "learning_rate": 3.2e-05, "loss": 9.8653, "mean_token_accuracy": 0.04371197037398815, "num_tokens": 138329.0, "step": 65 }, { "entropy": 10.722426414489746, "epoch": 0.004626416840157298, "grad_norm": 1.8046875, "learning_rate": 3.4500000000000005e-05, "loss": 9.8277, "mean_token_accuracy": 0.040007464960217475, "num_tokens": 149993.0, "step": 70 }, { "entropy": 10.71851463317871, "epoch": 0.00495687518588282, "grad_norm": 1.7890625, "learning_rate": 3.7e-05, "loss": 9.7389, "mean_token_accuracy": 0.0400556480512023, "num_tokens": 160872.0, "step": 75 }, { "entropy": 10.713956546783447, "epoch": 0.005287333531608341, "grad_norm": 1.703125, "learning_rate": 3.95e-05, "loss": 9.7214, "mean_token_accuracy": 0.037986579909920694, "num_tokens": 172141.0, "step": 80 }, { "entropy": 10.708513736724854, "epoch": 0.005617791877333862, "grad_norm": 1.71875, "learning_rate": 4.2000000000000004e-05, "loss": 9.5993, "mean_token_accuracy": 0.0436050308868289, "num_tokens": 183762.0, "step": 85 }, { "entropy": 10.700162410736084, "epoch": 0.005948250223059383, "grad_norm": 1.6953125, "learning_rate": 4.45e-05, "loss": 9.5659, "mean_token_accuracy": 0.039148312993347645, "num_tokens": 196109.0, "step": 90 }, { "entropy": 10.689516925811768, "epoch": 0.006278708568784905, "grad_norm": 1.7890625, "learning_rate": 4.7000000000000004e-05, "loss": 9.4243, "mean_token_accuracy": 0.040336356125772, "num_tokens": 205671.0, "step": 95 }, { "entropy": 10.678232765197754, "epoch": 0.006609166914510426, "grad_norm": 1.6328125, "learning_rate": 4.9500000000000004e-05, "loss": 9.4066, "mean_token_accuracy": 0.04090222828090191, "num_tokens": 217256.0, "step": 100 }, { "entropy": 10.663106441497803, "epoch": 0.006939625260235947, "grad_norm": 1.828125, "learning_rate": 5.2e-05, "loss": 9.2659, "mean_token_accuracy": 0.051931383460760115, "num_tokens": 228066.0, "step": 105 }, { "entropy": 10.637630844116211, "epoch": 0.007270083605961469, "grad_norm": 1.7578125, "learning_rate": 5.45e-05, "loss": 9.2057, "mean_token_accuracy": 0.0478770911693573, "num_tokens": 238643.0, "step": 110 }, { "entropy": 10.609512996673583, "epoch": 0.00760054195168699, "grad_norm": 1.765625, "learning_rate": 5.7e-05, "loss": 9.1192, "mean_token_accuracy": 0.04669556953012943, "num_tokens": 249812.0, "step": 115 }, { "entropy": 10.571122074127198, "epoch": 0.007931000297412512, "grad_norm": 1.546875, "learning_rate": 5.9499999999999996e-05, "loss": 8.9947, "mean_token_accuracy": 0.04946679100394249, "num_tokens": 261942.0, "step": 120 }, { "entropy": 10.517377948760986, "epoch": 0.008261458643138032, "grad_norm": 1.671875, "learning_rate": 6.2e-05, "loss": 8.8178, "mean_token_accuracy": 0.053763845935463905, "num_tokens": 272537.0, "step": 125 }, { "entropy": 10.431371021270753, "epoch": 0.008591916988863553, "grad_norm": 1.5625, "learning_rate": 6.450000000000001e-05, "loss": 8.7253, "mean_token_accuracy": 0.051454832404851915, "num_tokens": 283610.0, "step": 130 }, { "entropy": 10.352199172973632, "epoch": 0.008922375334589075, "grad_norm": 1.4296875, "learning_rate": 6.7e-05, "loss": 8.6516, "mean_token_accuracy": 0.048623890802264216, "num_tokens": 294257.0, "step": 135 }, { "entropy": 10.283658027648926, "epoch": 0.009252833680314597, "grad_norm": 1.578125, "learning_rate": 6.950000000000001e-05, "loss": 8.5669, "mean_token_accuracy": 0.04829129688441754, "num_tokens": 304405.0, "step": 140 }, { "entropy": 10.165488147735596, "epoch": 0.009583292026040118, "grad_norm": 1.28125, "learning_rate": 7.2e-05, "loss": 8.3473, "mean_token_accuracy": 0.05426618978381157, "num_tokens": 314413.0, "step": 145 }, { "entropy": 10.042571830749512, "epoch": 0.00991375037176564, "grad_norm": 1.3125, "learning_rate": 7.45e-05, "loss": 8.3318, "mean_token_accuracy": 0.05118043087422848, "num_tokens": 325010.0, "step": 150 }, { "entropy": 9.901912784576416, "epoch": 0.01024420871749116, "grad_norm": 1.2890625, "learning_rate": 7.7e-05, "loss": 8.2007, "mean_token_accuracy": 0.05208889953792095, "num_tokens": 336421.0, "step": 155 }, { "entropy": 9.73304557800293, "epoch": 0.010574667063216681, "grad_norm": 1.28125, "learning_rate": 7.950000000000001e-05, "loss": 8.0228, "mean_token_accuracy": 0.06282360814511775, "num_tokens": 346930.0, "step": 160 }, { "entropy": 9.518652629852294, "epoch": 0.010905125408942203, "grad_norm": 1.25, "learning_rate": 8.2e-05, "loss": 7.9883, "mean_token_accuracy": 0.062138063833117485, "num_tokens": 357874.0, "step": 165 }, { "entropy": 9.32524814605713, "epoch": 0.011235583754667725, "grad_norm": 1.3125, "learning_rate": 8.450000000000001e-05, "loss": 8.0045, "mean_token_accuracy": 0.05923859886825085, "num_tokens": 370138.0, "step": 170 }, { "entropy": 9.140588092803956, "epoch": 0.011566042100393246, "grad_norm": 1.125, "learning_rate": 8.7e-05, "loss": 7.9149, "mean_token_accuracy": 0.061116486042737964, "num_tokens": 379999.0, "step": 175 }, { "entropy": 8.904661655426025, "epoch": 0.011896500446118766, "grad_norm": 0.80078125, "learning_rate": 8.95e-05, "loss": 7.7459, "mean_token_accuracy": 0.0650369856506586, "num_tokens": 392754.0, "step": 180 }, { "entropy": 8.754450225830078, "epoch": 0.012226958791844288, "grad_norm": 0.96875, "learning_rate": 9.2e-05, "loss": 7.7896, "mean_token_accuracy": 0.06155076548457146, "num_tokens": 403771.0, "step": 185 }, { "entropy": 8.645609664916993, "epoch": 0.01255741713756981, "grad_norm": 1.4765625, "learning_rate": 9.45e-05, "loss": 7.7912, "mean_token_accuracy": 0.06344522796571254, "num_tokens": 415381.0, "step": 190 }, { "entropy": 8.569410800933838, "epoch": 0.01288787548329533, "grad_norm": 0.91796875, "learning_rate": 9.7e-05, "loss": 7.6569, "mean_token_accuracy": 0.06627831235527992, "num_tokens": 425919.0, "step": 195 }, { "entropy": 8.510480690002442, "epoch": 0.013218333829020852, "grad_norm": 0.96875, "learning_rate": 9.95e-05, "loss": 7.6221, "mean_token_accuracy": 0.06085339933633804, "num_tokens": 437753.0, "step": 200 }, { "entropy": 8.409182167053222, "epoch": 0.013548792174746372, "grad_norm": 1.0078125, "learning_rate": 0.000102, "loss": 7.6117, "mean_token_accuracy": 0.06501428484916687, "num_tokens": 449079.0, "step": 205 }, { "entropy": 8.41590747833252, "epoch": 0.013879250520471894, "grad_norm": 1.3359375, "learning_rate": 0.00010449999999999999, "loss": 7.5895, "mean_token_accuracy": 0.06874292232096195, "num_tokens": 459250.0, "step": 210 }, { "entropy": 8.25771951675415, "epoch": 0.014209708866197416, "grad_norm": 0.83203125, "learning_rate": 0.000107, "loss": 7.5524, "mean_token_accuracy": 0.06953966170549393, "num_tokens": 470898.0, "step": 215 }, { "entropy": 8.192992210388184, "epoch": 0.014540167211922937, "grad_norm": 0.8828125, "learning_rate": 0.0001095, "loss": 7.5374, "mean_token_accuracy": 0.07173516266047955, "num_tokens": 481116.0, "step": 220 }, { "entropy": 8.23768253326416, "epoch": 0.014870625557648459, "grad_norm": 0.890625, "learning_rate": 0.000112, "loss": 7.5324, "mean_token_accuracy": 0.0693703394383192, "num_tokens": 492639.0, "step": 225 }, { "entropy": 8.176224327087402, "epoch": 0.01520108390337398, "grad_norm": 1.2109375, "learning_rate": 0.0001145, "loss": 7.5754, "mean_token_accuracy": 0.06600871868431568, "num_tokens": 504838.0, "step": 230 }, { "entropy": 8.241323566436767, "epoch": 0.0155315422490995, "grad_norm": 1.09375, "learning_rate": 0.00011700000000000001, "loss": 7.5075, "mean_token_accuracy": 0.05977615527808666, "num_tokens": 515982.0, "step": 235 }, { "entropy": 8.07399296760559, "epoch": 0.015862000594825024, "grad_norm": 0.8359375, "learning_rate": 0.00011949999999999999, "loss": 7.4775, "mean_token_accuracy": 0.06939641572535038, "num_tokens": 526830.0, "step": 240 }, { "entropy": 8.070019817352295, "epoch": 0.016192458940550544, "grad_norm": 0.921875, "learning_rate": 0.000122, "loss": 7.5155, "mean_token_accuracy": 0.06779546402394772, "num_tokens": 538111.0, "step": 245 }, { "entropy": 8.138901233673096, "epoch": 0.016522917286276063, "grad_norm": 0.8828125, "learning_rate": 0.0001245, "loss": 7.4836, "mean_token_accuracy": 0.06842113994061946, "num_tokens": 548286.0, "step": 250 }, { "entropy": 8.062221097946168, "epoch": 0.016853375632001587, "grad_norm": 0.89453125, "learning_rate": 0.000127, "loss": 7.4483, "mean_token_accuracy": 0.07109758108854294, "num_tokens": 558638.0, "step": 255 }, { "entropy": 8.011436653137206, "epoch": 0.017183833977727107, "grad_norm": 0.78125, "learning_rate": 0.0001295, "loss": 7.418, "mean_token_accuracy": 0.07253723293542862, "num_tokens": 568909.0, "step": 260 }, { "entropy": 8.036324262619019, "epoch": 0.01751429232345263, "grad_norm": 0.890625, "learning_rate": 0.000132, "loss": 7.3883, "mean_token_accuracy": 0.07206913344562053, "num_tokens": 580392.0, "step": 265 }, { "entropy": 7.999330711364746, "epoch": 0.01784475066917815, "grad_norm": 0.9453125, "learning_rate": 0.00013450000000000002, "loss": 7.44, "mean_token_accuracy": 0.068961101770401, "num_tokens": 590160.0, "step": 270 }, { "entropy": 7.934969806671143, "epoch": 0.01817520901490367, "grad_norm": 1.1484375, "learning_rate": 0.00013700000000000002, "loss": 7.3588, "mean_token_accuracy": 0.0708784569054842, "num_tokens": 601054.0, "step": 275 }, { "entropy": 7.9982236385345455, "epoch": 0.018505667360629193, "grad_norm": 1.078125, "learning_rate": 0.0001395, "loss": 7.4727, "mean_token_accuracy": 0.06899206414818763, "num_tokens": 611908.0, "step": 280 }, { "entropy": 7.999399185180664, "epoch": 0.018836125706354713, "grad_norm": 0.8828125, "learning_rate": 0.00014199999999999998, "loss": 7.4195, "mean_token_accuracy": 0.07329106517136097, "num_tokens": 622259.0, "step": 285 }, { "entropy": 7.868047714233398, "epoch": 0.019166584052080236, "grad_norm": 0.94140625, "learning_rate": 0.0001445, "loss": 7.2845, "mean_token_accuracy": 0.0750714760273695, "num_tokens": 632728.0, "step": 290 }, { "entropy": 7.929320621490478, "epoch": 0.019497042397805756, "grad_norm": 0.9375, "learning_rate": 0.000147, "loss": 7.4673, "mean_token_accuracy": 0.07401705160737038, "num_tokens": 644600.0, "step": 295 }, { "entropy": 7.919670248031617, "epoch": 0.01982750074353128, "grad_norm": 1.140625, "learning_rate": 0.0001495, "loss": 7.3135, "mean_token_accuracy": 0.07708279564976692, "num_tokens": 654004.0, "step": 300 }, { "entropy": 7.94478325843811, "epoch": 0.0201579590892568, "grad_norm": 0.8359375, "learning_rate": 0.000152, "loss": 7.3297, "mean_token_accuracy": 0.07512539699673652, "num_tokens": 665275.0, "step": 305 }, { "entropy": 7.877188873291016, "epoch": 0.02048841743498232, "grad_norm": 1.1484375, "learning_rate": 0.00015450000000000001, "loss": 7.3807, "mean_token_accuracy": 0.07405197396874427, "num_tokens": 677397.0, "step": 310 }, { "entropy": 7.885754251480103, "epoch": 0.020818875780707843, "grad_norm": 0.9453125, "learning_rate": 0.000157, "loss": 7.2468, "mean_token_accuracy": 0.08046135641634464, "num_tokens": 687975.0, "step": 315 }, { "entropy": 7.784027528762818, "epoch": 0.021149334126433363, "grad_norm": 1.0625, "learning_rate": 0.0001595, "loss": 7.2053, "mean_token_accuracy": 0.08028579428792, "num_tokens": 699102.0, "step": 320 }, { "entropy": 7.772454404830933, "epoch": 0.021479792472158886, "grad_norm": 0.82421875, "learning_rate": 0.000162, "loss": 7.2547, "mean_token_accuracy": 0.07418597042560578, "num_tokens": 712007.0, "step": 325 }, { "entropy": 7.787219858169555, "epoch": 0.021810250817884406, "grad_norm": 0.95703125, "learning_rate": 0.00016450000000000001, "loss": 7.2527, "mean_token_accuracy": 0.08365209773182869, "num_tokens": 723757.0, "step": 330 }, { "entropy": 7.8013787269592285, "epoch": 0.022140709163609926, "grad_norm": 1.078125, "learning_rate": 0.00016700000000000002, "loss": 7.2636, "mean_token_accuracy": 0.08137313425540924, "num_tokens": 734353.0, "step": 335 }, { "entropy": 7.695002651214599, "epoch": 0.02247116750933545, "grad_norm": 0.953125, "learning_rate": 0.00016950000000000003, "loss": 7.1554, "mean_token_accuracy": 0.08258310481905937, "num_tokens": 744673.0, "step": 340 }, { "entropy": 7.7564044952392575, "epoch": 0.02280162585506097, "grad_norm": 0.96875, "learning_rate": 0.00017199999999999998, "loss": 7.1906, "mean_token_accuracy": 0.07295942604541779, "num_tokens": 755181.0, "step": 345 }, { "entropy": 7.736034250259399, "epoch": 0.023132084200786492, "grad_norm": 0.98046875, "learning_rate": 0.00017449999999999999, "loss": 7.21, "mean_token_accuracy": 0.08095265403389931, "num_tokens": 765558.0, "step": 350 }, { "entropy": 7.752234363555909, "epoch": 0.023462542546512012, "grad_norm": 0.921875, "learning_rate": 0.000177, "loss": 7.2351, "mean_token_accuracy": 0.07383172325789929, "num_tokens": 778224.0, "step": 355 }, { "entropy": 7.743930006027222, "epoch": 0.023793000892237532, "grad_norm": 0.92578125, "learning_rate": 0.0001795, "loss": 7.1656, "mean_token_accuracy": 0.07890524119138717, "num_tokens": 789586.0, "step": 360 }, { "entropy": 7.688452529907226, "epoch": 0.024123459237963055, "grad_norm": 0.96875, "learning_rate": 0.000182, "loss": 7.2174, "mean_token_accuracy": 0.07619251199066639, "num_tokens": 801595.0, "step": 365 }, { "entropy": 7.692495965957642, "epoch": 0.024453917583688575, "grad_norm": 0.74609375, "learning_rate": 0.0001845, "loss": 7.2437, "mean_token_accuracy": 0.08221447616815566, "num_tokens": 812850.0, "step": 370 }, { "entropy": 7.707998418807984, "epoch": 0.0247843759294141, "grad_norm": 0.83984375, "learning_rate": 0.000187, "loss": 7.2205, "mean_token_accuracy": 0.0778277974575758, "num_tokens": 823125.0, "step": 375 }, { "entropy": 7.7771612167358395, "epoch": 0.02511483427513962, "grad_norm": 0.890625, "learning_rate": 0.0001895, "loss": 7.1487, "mean_token_accuracy": 0.08065758869051934, "num_tokens": 834838.0, "step": 380 }, { "entropy": 7.648675203323364, "epoch": 0.02544529262086514, "grad_norm": 1.1015625, "learning_rate": 0.000192, "loss": 7.1992, "mean_token_accuracy": 0.08622882142663002, "num_tokens": 845976.0, "step": 385 }, { "entropy": 7.634294128417968, "epoch": 0.02577575096659066, "grad_norm": 1.109375, "learning_rate": 0.0001945, "loss": 7.1816, "mean_token_accuracy": 0.08291547074913978, "num_tokens": 857193.0, "step": 390 }, { "entropy": 7.7122198104858395, "epoch": 0.02610620931231618, "grad_norm": 0.8984375, "learning_rate": 0.00019700000000000002, "loss": 7.1746, "mean_token_accuracy": 0.0808206096291542, "num_tokens": 868471.0, "step": 395 }, { "entropy": 7.663157796859741, "epoch": 0.026436667658041705, "grad_norm": 1.0234375, "learning_rate": 0.00019950000000000002, "loss": 7.1046, "mean_token_accuracy": 0.08876307979226113, "num_tokens": 879339.0, "step": 400 }, { "entropy": 7.579256820678711, "epoch": 0.026767126003767225, "grad_norm": 0.90625, "learning_rate": 0.000202, "loss": 7.0452, "mean_token_accuracy": 0.08175178617238998, "num_tokens": 890081.0, "step": 405 }, { "entropy": 7.595317792892456, "epoch": 0.027097584349492745, "grad_norm": 1.15625, "learning_rate": 0.00020449999999999998, "loss": 7.0651, "mean_token_accuracy": 0.08560339361429214, "num_tokens": 899967.0, "step": 410 }, { "entropy": 7.630031490325928, "epoch": 0.027428042695218268, "grad_norm": 1.0390625, "learning_rate": 0.000207, "loss": 7.1014, "mean_token_accuracy": 0.08190736398100854, "num_tokens": 910697.0, "step": 415 }, { "entropy": 7.6542994499206545, "epoch": 0.027758501040943788, "grad_norm": 1.1015625, "learning_rate": 0.0002095, "loss": 7.1607, "mean_token_accuracy": 0.08872515186667443, "num_tokens": 920879.0, "step": 420 }, { "entropy": 7.579720592498779, "epoch": 0.02808895938666931, "grad_norm": 0.9921875, "learning_rate": 0.000212, "loss": 7.0708, "mean_token_accuracy": 0.09260708317160607, "num_tokens": 931566.0, "step": 425 }, { "entropy": 7.549066686630249, "epoch": 0.02841941773239483, "grad_norm": 0.9375, "learning_rate": 0.0002145, "loss": 7.0116, "mean_token_accuracy": 0.08882770761847496, "num_tokens": 941736.0, "step": 430 }, { "entropy": 7.600239658355713, "epoch": 0.028749876078120355, "grad_norm": 1.078125, "learning_rate": 0.00021700000000000002, "loss": 7.0376, "mean_token_accuracy": 0.08477143570780754, "num_tokens": 951652.0, "step": 435 }, { "entropy": 7.493011617660523, "epoch": 0.029080334423845874, "grad_norm": 0.9375, "learning_rate": 0.0002195, "loss": 6.9774, "mean_token_accuracy": 0.08458059877157212, "num_tokens": 963242.0, "step": 440 }, { "entropy": 7.5284465789794925, "epoch": 0.029410792769571394, "grad_norm": 1.0, "learning_rate": 0.000222, "loss": 7.0074, "mean_token_accuracy": 0.08982692956924439, "num_tokens": 974078.0, "step": 445 }, { "entropy": 7.516528034210205, "epoch": 0.029741251115296918, "grad_norm": 0.75, "learning_rate": 0.0002245, "loss": 6.9731, "mean_token_accuracy": 0.0934697650372982, "num_tokens": 986324.0, "step": 450 }, { "entropy": 7.518308115005493, "epoch": 0.030071709461022438, "grad_norm": 0.94140625, "learning_rate": 0.00022700000000000002, "loss": 6.9854, "mean_token_accuracy": 0.0866778276860714, "num_tokens": 997625.0, "step": 455 }, { "entropy": 7.468284225463867, "epoch": 0.03040216780674796, "grad_norm": 0.9765625, "learning_rate": 0.00022950000000000002, "loss": 6.9674, "mean_token_accuracy": 0.08939552903175355, "num_tokens": 1007914.0, "step": 460 }, { "entropy": 7.482946729660034, "epoch": 0.03073262615247348, "grad_norm": 0.91015625, "learning_rate": 0.00023200000000000003, "loss": 6.9344, "mean_token_accuracy": 0.08928446583449841, "num_tokens": 1018510.0, "step": 465 }, { "entropy": 7.432837677001953, "epoch": 0.031063084498199, "grad_norm": 1.2109375, "learning_rate": 0.00023449999999999998, "loss": 6.9009, "mean_token_accuracy": 0.09617745354771615, "num_tokens": 1028532.0, "step": 470 }, { "entropy": 7.4032214164733885, "epoch": 0.031393542843924524, "grad_norm": 0.93359375, "learning_rate": 0.000237, "loss": 7.0566, "mean_token_accuracy": 0.0882367193698883, "num_tokens": 1040252.0, "step": 475 }, { "entropy": 7.425141048431397, "epoch": 0.03172400118965005, "grad_norm": 1.03125, "learning_rate": 0.0002395, "loss": 6.856, "mean_token_accuracy": 0.09330087304115295, "num_tokens": 1050486.0, "step": 480 }, { "entropy": 7.379268646240234, "epoch": 0.032054459535375564, "grad_norm": 1.0703125, "learning_rate": 0.000242, "loss": 6.9016, "mean_token_accuracy": 0.09040206372737884, "num_tokens": 1061218.0, "step": 485 }, { "entropy": 7.510239171981811, "epoch": 0.03238491788110109, "grad_norm": 1.265625, "learning_rate": 0.0002445, "loss": 7.0114, "mean_token_accuracy": 0.08968377225100994, "num_tokens": 1071077.0, "step": 490 }, { "entropy": 7.438390588760376, "epoch": 0.03271537622682661, "grad_norm": 1.078125, "learning_rate": 0.000247, "loss": 6.9756, "mean_token_accuracy": 0.08917649313807488, "num_tokens": 1081434.0, "step": 495 }, { "entropy": 7.337517833709716, "epoch": 0.03304583457255213, "grad_norm": 1.0390625, "learning_rate": 0.0002495, "loss": 6.9296, "mean_token_accuracy": 0.09428177699446678, "num_tokens": 1092237.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 265734562775040.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }