{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.0053732818931146765, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.692043209075928, "epoch": 5.3732818931146765e-05, "grad_norm": 12.625, "learning_rate": 2e-06, "loss": 10.8501, "mean_token_accuracy": 0.0, "num_tokens": 12012.0, "step": 5 }, { "entropy": 10.69202766418457, "epoch": 0.00010746563786229353, "grad_norm": 14.3125, "learning_rate": 4.5e-06, "loss": 10.7855, "mean_token_accuracy": 0.00020087850280106067, "num_tokens": 23548.0, "step": 10 }, { "entropy": 10.69138708114624, "epoch": 0.0001611984567934403, "grad_norm": 9.8125, "learning_rate": 7e-06, "loss": 10.5161, "mean_token_accuracy": 0.016332162456819788, "num_tokens": 35237.0, "step": 15 }, { "entropy": 10.685348415374756, "epoch": 0.00021493127572458706, "grad_norm": 6.125, "learning_rate": 9.5e-06, "loss": 10.1997, "mean_token_accuracy": 0.035921670868992804, "num_tokens": 47773.0, "step": 20 }, { "entropy": 10.647090339660645, "epoch": 0.00026866409465573383, "grad_norm": 4.59375, "learning_rate": 1.2e-05, "loss": 9.8165, "mean_token_accuracy": 0.04100495874881745, "num_tokens": 59398.0, "step": 25 }, { "entropy": 10.562076568603516, "epoch": 0.0003223969135868806, "grad_norm": 3.328125, "learning_rate": 1.4500000000000002e-05, "loss": 9.6944, "mean_token_accuracy": 0.03505560103803873, "num_tokens": 70474.0, "step": 30 }, { "entropy": 10.566006851196288, "epoch": 0.00037612973251802736, "grad_norm": 2.828125, "learning_rate": 1.7000000000000003e-05, "loss": 9.6543, "mean_token_accuracy": 0.03815589081496, "num_tokens": 81441.0, "step": 35 }, { "entropy": 10.595672798156738, "epoch": 0.0004298625514491741, "grad_norm": 2.59375, "learning_rate": 1.95e-05, "loss": 9.6209, "mean_token_accuracy": 0.0424302164465189, "num_tokens": 92819.0, "step": 40 }, { "entropy": 10.57416124343872, "epoch": 0.0004835953703803209, "grad_norm": 2.6875, "learning_rate": 2.2e-05, "loss": 9.477, "mean_token_accuracy": 0.04498981647193432, "num_tokens": 105565.0, "step": 45 }, { "entropy": 10.500903701782226, "epoch": 0.0005373281893114677, "grad_norm": 2.453125, "learning_rate": 2.4500000000000003e-05, "loss": 9.4751, "mean_token_accuracy": 0.03739957753568888, "num_tokens": 116424.0, "step": 50 }, { "entropy": 10.49787940979004, "epoch": 0.0005910610082426144, "grad_norm": 2.3125, "learning_rate": 2.7e-05, "loss": 9.4268, "mean_token_accuracy": 0.0429843544960022, "num_tokens": 127807.0, "step": 55 }, { "entropy": 10.53837537765503, "epoch": 0.0006447938271737612, "grad_norm": 2.65625, "learning_rate": 2.95e-05, "loss": 9.2854, "mean_token_accuracy": 0.05508757047355175, "num_tokens": 139177.0, "step": 60 }, { "entropy": 10.40587682723999, "epoch": 0.000698526646104908, "grad_norm": 2.328125, "learning_rate": 3.2e-05, "loss": 9.2319, "mean_token_accuracy": 0.05228099822998047, "num_tokens": 151296.0, "step": 65 }, { "entropy": 10.370543670654296, "epoch": 0.0007522594650360547, "grad_norm": 2.359375, "learning_rate": 3.4500000000000005e-05, "loss": 9.0806, "mean_token_accuracy": 0.07307359352707862, "num_tokens": 160488.0, "step": 70 }, { "entropy": 10.382234954833985, "epoch": 0.0008059922839672015, "grad_norm": 2.34375, "learning_rate": 3.7e-05, "loss": 9.0574, "mean_token_accuracy": 0.06776703521609306, "num_tokens": 171627.0, "step": 75 }, { "entropy": 10.367051887512208, "epoch": 0.0008597251028983482, "grad_norm": 2.3125, "learning_rate": 3.95e-05, "loss": 8.8925, "mean_token_accuracy": 0.07181778848171234, "num_tokens": 182978.0, "step": 80 }, { "entropy": 10.235933113098145, "epoch": 0.000913457921829495, "grad_norm": 2.46875, "learning_rate": 4.2000000000000004e-05, "loss": 8.7913, "mean_token_accuracy": 0.07224572598934173, "num_tokens": 193362.0, "step": 85 }, { "entropy": 10.180474948883056, "epoch": 0.0009671907407606418, "grad_norm": 2.375, "learning_rate": 4.45e-05, "loss": 8.7247, "mean_token_accuracy": 0.07832827009260654, "num_tokens": 204896.0, "step": 90 }, { "entropy": 10.17861442565918, "epoch": 0.0010209235596917885, "grad_norm": 2.25, "learning_rate": 4.7000000000000004e-05, "loss": 8.6001, "mean_token_accuracy": 0.07487386986613273, "num_tokens": 215828.0, "step": 95 }, { "entropy": 10.129089546203613, "epoch": 0.0010746563786229353, "grad_norm": 2.890625, "learning_rate": 4.9500000000000004e-05, "loss": 8.454, "mean_token_accuracy": 0.0813417136669159, "num_tokens": 226311.0, "step": 100 }, { "entropy": 10.016890907287598, "epoch": 0.001128389197554082, "grad_norm": 2.703125, "learning_rate": 5.2e-05, "loss": 8.3892, "mean_token_accuracy": 0.07950438261032104, "num_tokens": 237817.0, "step": 105 }, { "entropy": 9.948394012451171, "epoch": 0.0011821220164852288, "grad_norm": 2.578125, "learning_rate": 5.45e-05, "loss": 8.2654, "mean_token_accuracy": 0.080025664716959, "num_tokens": 248778.0, "step": 110 }, { "entropy": 9.865277194976807, "epoch": 0.0012358548354163756, "grad_norm": 2.078125, "learning_rate": 5.7e-05, "loss": 8.2215, "mean_token_accuracy": 0.07951191291213036, "num_tokens": 260638.0, "step": 115 }, { "entropy": 9.790133190155029, "epoch": 0.0012895876543475224, "grad_norm": 1.7109375, "learning_rate": 5.9499999999999996e-05, "loss": 8.0775, "mean_token_accuracy": 0.0801257323473692, "num_tokens": 272223.0, "step": 120 }, { "entropy": 9.634031391143798, "epoch": 0.0013433204732786691, "grad_norm": 1.890625, "learning_rate": 6.2e-05, "loss": 7.8657, "mean_token_accuracy": 0.09108843877911568, "num_tokens": 282883.0, "step": 125 }, { "entropy": 9.479462718963623, "epoch": 0.001397053292209816, "grad_norm": 1.6171875, "learning_rate": 6.450000000000001e-05, "loss": 7.8083, "mean_token_accuracy": 0.08633529022336006, "num_tokens": 293318.0, "step": 130 }, { "entropy": 9.311678791046143, "epoch": 0.0014507861111409627, "grad_norm": 1.7578125, "learning_rate": 6.7e-05, "loss": 7.6502, "mean_token_accuracy": 0.08342773504555226, "num_tokens": 303563.0, "step": 135 }, { "entropy": 9.093393898010254, "epoch": 0.0015045189300721094, "grad_norm": 1.671875, "learning_rate": 6.950000000000001e-05, "loss": 7.5358, "mean_token_accuracy": 0.09152235686779023, "num_tokens": 313968.0, "step": 140 }, { "entropy": 8.970313549041748, "epoch": 0.0015582517490032562, "grad_norm": 1.4765625, "learning_rate": 7.2e-05, "loss": 7.5692, "mean_token_accuracy": 0.08849354460835457, "num_tokens": 325261.0, "step": 145 }, { "entropy": 8.724966049194336, "epoch": 0.001611984567934403, "grad_norm": 1.5078125, "learning_rate": 7.45e-05, "loss": 7.3732, "mean_token_accuracy": 0.09316953867673874, "num_tokens": 335803.0, "step": 150 }, { "entropy": 8.553716468811036, "epoch": 0.0016657173868655497, "grad_norm": 1.375, "learning_rate": 7.7e-05, "loss": 7.2783, "mean_token_accuracy": 0.08820799067616462, "num_tokens": 346582.0, "step": 155 }, { "entropy": 8.43663501739502, "epoch": 0.0017194502057966965, "grad_norm": 1.4765625, "learning_rate": 7.950000000000001e-05, "loss": 7.3562, "mean_token_accuracy": 0.09117907658219337, "num_tokens": 357779.0, "step": 160 }, { "entropy": 8.219385528564453, "epoch": 0.0017731830247278433, "grad_norm": 1.4140625, "learning_rate": 8.2e-05, "loss": 7.2185, "mean_token_accuracy": 0.09431424736976624, "num_tokens": 369191.0, "step": 165 }, { "entropy": 8.094470024108887, "epoch": 0.00182691584365899, "grad_norm": 1.3984375, "learning_rate": 8.450000000000001e-05, "loss": 7.2579, "mean_token_accuracy": 0.09085006713867187, "num_tokens": 381374.0, "step": 170 }, { "entropy": 8.00999412536621, "epoch": 0.0018806486625901368, "grad_norm": 1.328125, "learning_rate": 8.7e-05, "loss": 7.2359, "mean_token_accuracy": 0.09357822686433792, "num_tokens": 392152.0, "step": 175 }, { "entropy": 7.9514116764068605, "epoch": 0.0019343814815212836, "grad_norm": 1.484375, "learning_rate": 8.95e-05, "loss": 7.2057, "mean_token_accuracy": 0.09208550006151199, "num_tokens": 404121.0, "step": 180 }, { "entropy": 7.96669111251831, "epoch": 0.0019881143004524303, "grad_norm": 1.609375, "learning_rate": 9.2e-05, "loss": 7.2056, "mean_token_accuracy": 0.0923257291316986, "num_tokens": 416144.0, "step": 185 }, { "entropy": 7.824949645996094, "epoch": 0.002041847119383577, "grad_norm": 1.8359375, "learning_rate": 9.45e-05, "loss": 7.0888, "mean_token_accuracy": 0.09763017818331718, "num_tokens": 427141.0, "step": 190 }, { "entropy": 7.715742874145508, "epoch": 0.002095579938314724, "grad_norm": 1.3984375, "learning_rate": 9.7e-05, "loss": 7.0035, "mean_token_accuracy": 0.0935081422328949, "num_tokens": 439113.0, "step": 195 }, { "entropy": 7.7036233901977536, "epoch": 0.0021493127572458706, "grad_norm": 1.28125, "learning_rate": 9.95e-05, "loss": 7.0734, "mean_token_accuracy": 0.09741963669657708, "num_tokens": 450595.0, "step": 200 }, { "entropy": 7.739162731170654, "epoch": 0.0022030455761770174, "grad_norm": 1.3671875, "learning_rate": 0.000102, "loss": 7.1579, "mean_token_accuracy": 0.09232115969061852, "num_tokens": 462811.0, "step": 205 }, { "entropy": 7.705861139297485, "epoch": 0.002256778395108164, "grad_norm": 1.5234375, "learning_rate": 0.00010449999999999999, "loss": 7.1276, "mean_token_accuracy": 0.09830137938261033, "num_tokens": 473629.0, "step": 210 }, { "entropy": 7.643820524215698, "epoch": 0.002310511214039311, "grad_norm": 1.3671875, "learning_rate": 0.000107, "loss": 7.1024, "mean_token_accuracy": 0.0988999992609024, "num_tokens": 484731.0, "step": 215 }, { "entropy": 7.66978874206543, "epoch": 0.0023642440329704577, "grad_norm": 1.3359375, "learning_rate": 0.0001095, "loss": 7.0548, "mean_token_accuracy": 0.09935099259018898, "num_tokens": 496309.0, "step": 220 }, { "entropy": 7.658147382736206, "epoch": 0.0024179768519016044, "grad_norm": 1.171875, "learning_rate": 0.000112, "loss": 7.0923, "mean_token_accuracy": 0.1015954852104187, "num_tokens": 508715.0, "step": 225 }, { "entropy": 7.41760745048523, "epoch": 0.002471709670832751, "grad_norm": 1.203125, "learning_rate": 0.0001145, "loss": 6.9405, "mean_token_accuracy": 0.1079390250146389, "num_tokens": 519791.0, "step": 230 }, { "entropy": 7.54394679069519, "epoch": 0.002525442489763898, "grad_norm": 1.4921875, "learning_rate": 0.00011700000000000001, "loss": 7.083, "mean_token_accuracy": 0.09995704516768456, "num_tokens": 531897.0, "step": 235 }, { "entropy": 7.555436658859253, "epoch": 0.0025791753086950447, "grad_norm": 1.4375, "learning_rate": 0.00011949999999999999, "loss": 7.0798, "mean_token_accuracy": 0.09950428679585457, "num_tokens": 543243.0, "step": 240 }, { "entropy": 7.442711400985718, "epoch": 0.0026329081276261915, "grad_norm": 1.1953125, "learning_rate": 0.000122, "loss": 6.9189, "mean_token_accuracy": 0.10362667217850685, "num_tokens": 554139.0, "step": 245 }, { "entropy": 7.480173254013062, "epoch": 0.0026866409465573383, "grad_norm": 1.5546875, "learning_rate": 0.0001245, "loss": 6.9273, "mean_token_accuracy": 0.10886659622192382, "num_tokens": 565378.0, "step": 250 }, { "entropy": 7.426122951507568, "epoch": 0.002740373765488485, "grad_norm": 1.3515625, "learning_rate": 0.000127, "loss": 6.881, "mean_token_accuracy": 0.10440984815359115, "num_tokens": 576628.0, "step": 255 }, { "entropy": 7.444299507141113, "epoch": 0.002794106584419632, "grad_norm": 1.2421875, "learning_rate": 0.0001295, "loss": 7.0019, "mean_token_accuracy": 0.09789407551288605, "num_tokens": 588760.0, "step": 260 }, { "entropy": 7.4239896774292, "epoch": 0.0028478394033507786, "grad_norm": 1.75, "learning_rate": 0.000132, "loss": 6.9158, "mean_token_accuracy": 0.10981944426894188, "num_tokens": 600024.0, "step": 265 }, { "entropy": 7.270383596420288, "epoch": 0.0029015722222819253, "grad_norm": 1.3359375, "learning_rate": 0.00013450000000000002, "loss": 6.8775, "mean_token_accuracy": 0.10582949295639991, "num_tokens": 613150.0, "step": 270 }, { "entropy": 7.346567535400391, "epoch": 0.002955305041213072, "grad_norm": 1.1328125, "learning_rate": 0.00013700000000000002, "loss": 6.8547, "mean_token_accuracy": 0.10970969945192337, "num_tokens": 624762.0, "step": 275 }, { "entropy": 7.417334127426147, "epoch": 0.003009037860144219, "grad_norm": 1.3359375, "learning_rate": 0.0001395, "loss": 6.892, "mean_token_accuracy": 0.10366739556193352, "num_tokens": 635761.0, "step": 280 }, { "entropy": 7.223995733261108, "epoch": 0.0030627706790753656, "grad_norm": 1.2421875, "learning_rate": 0.00014199999999999998, "loss": 6.8555, "mean_token_accuracy": 0.10360193029046058, "num_tokens": 647882.0, "step": 285 }, { "entropy": 7.312860345840454, "epoch": 0.0031165034980065124, "grad_norm": 1.140625, "learning_rate": 0.0001445, "loss": 6.8848, "mean_token_accuracy": 0.1077139988541603, "num_tokens": 659749.0, "step": 290 }, { "entropy": 7.270877933502197, "epoch": 0.003170236316937659, "grad_norm": 1.3203125, "learning_rate": 0.000147, "loss": 6.8362, "mean_token_accuracy": 0.10846684277057647, "num_tokens": 672002.0, "step": 295 }, { "entropy": 7.204770469665528, "epoch": 0.003223969135868806, "grad_norm": 1.4375, "learning_rate": 0.0001495, "loss": 6.7952, "mean_token_accuracy": 0.11234059333801269, "num_tokens": 682312.0, "step": 300 }, { "entropy": 7.183935689926147, "epoch": 0.0032777019547999527, "grad_norm": 1.3828125, "learning_rate": 0.000152, "loss": 6.8246, "mean_token_accuracy": 0.10333632677793503, "num_tokens": 692188.0, "step": 305 }, { "entropy": 7.269667243957519, "epoch": 0.0033314347737310995, "grad_norm": 1.28125, "learning_rate": 0.00015450000000000001, "loss": 6.7992, "mean_token_accuracy": 0.10754085555672646, "num_tokens": 703789.0, "step": 310 }, { "entropy": 7.259969711303711, "epoch": 0.0033851675926622462, "grad_norm": 1.3359375, "learning_rate": 0.000157, "loss": 6.8807, "mean_token_accuracy": 0.11048192977905273, "num_tokens": 714752.0, "step": 315 }, { "entropy": 7.137263011932373, "epoch": 0.003438900411593393, "grad_norm": 1.1875, "learning_rate": 0.0001595, "loss": 6.8206, "mean_token_accuracy": 0.11233628690242767, "num_tokens": 726716.0, "step": 320 }, { "entropy": 7.213597440719605, "epoch": 0.0034926332305245398, "grad_norm": 1.1640625, "learning_rate": 0.000162, "loss": 6.8401, "mean_token_accuracy": 0.11278397589921951, "num_tokens": 737267.0, "step": 325 }, { "entropy": 7.222741270065308, "epoch": 0.0035463660494556865, "grad_norm": 1.3828125, "learning_rate": 0.00016450000000000001, "loss": 6.8783, "mean_token_accuracy": 0.10917454287409782, "num_tokens": 750180.0, "step": 330 }, { "entropy": 7.1152294158935545, "epoch": 0.0036000988683868333, "grad_norm": 1.203125, "learning_rate": 0.00016700000000000002, "loss": 6.6925, "mean_token_accuracy": 0.11422673463821412, "num_tokens": 761337.0, "step": 335 }, { "entropy": 7.07347264289856, "epoch": 0.00365383168731798, "grad_norm": 1.3515625, "learning_rate": 0.00016950000000000003, "loss": 6.6614, "mean_token_accuracy": 0.1183428131043911, "num_tokens": 771379.0, "step": 340 }, { "entropy": 7.18135552406311, "epoch": 0.003707564506249127, "grad_norm": 1.203125, "learning_rate": 0.00017199999999999998, "loss": 6.7586, "mean_token_accuracy": 0.11464423760771751, "num_tokens": 782508.0, "step": 345 }, { "entropy": 7.083883142471313, "epoch": 0.0037612973251802736, "grad_norm": 1.2890625, "learning_rate": 0.00017449999999999999, "loss": 6.766, "mean_token_accuracy": 0.1096316896378994, "num_tokens": 795541.0, "step": 350 }, { "entropy": 7.03632378578186, "epoch": 0.0038150301441114204, "grad_norm": 1.1640625, "learning_rate": 0.000177, "loss": 6.7017, "mean_token_accuracy": 0.11446580439805984, "num_tokens": 805665.0, "step": 355 }, { "entropy": 7.182166957855225, "epoch": 0.003868762963042567, "grad_norm": 1.2421875, "learning_rate": 0.0001795, "loss": 6.8425, "mean_token_accuracy": 0.11153884828090668, "num_tokens": 817393.0, "step": 360 }, { "entropy": 7.163691473007202, "epoch": 0.003922495781973714, "grad_norm": 1.2578125, "learning_rate": 0.000182, "loss": 6.7986, "mean_token_accuracy": 0.10896589532494545, "num_tokens": 828436.0, "step": 365 }, { "entropy": 7.033854150772095, "epoch": 0.003976228600904861, "grad_norm": 1.2578125, "learning_rate": 0.0001845, "loss": 6.653, "mean_token_accuracy": 0.11405793353915214, "num_tokens": 839223.0, "step": 370 }, { "entropy": 7.135569000244141, "epoch": 0.004029961419836007, "grad_norm": 1.359375, "learning_rate": 0.000187, "loss": 6.6199, "mean_token_accuracy": 0.12831516563892365, "num_tokens": 848953.0, "step": 375 }, { "entropy": 6.988350915908813, "epoch": 0.004083694238767154, "grad_norm": 1.3984375, "learning_rate": 0.0001895, "loss": 6.7725, "mean_token_accuracy": 0.10901687815785407, "num_tokens": 860349.0, "step": 380 }, { "entropy": 7.042834091186523, "epoch": 0.004137427057698301, "grad_norm": 1.15625, "learning_rate": 0.000192, "loss": 6.6875, "mean_token_accuracy": 0.11479247137904167, "num_tokens": 870993.0, "step": 385 }, { "entropy": 7.062792253494263, "epoch": 0.004191159876629448, "grad_norm": 1.34375, "learning_rate": 0.0001945, "loss": 6.7484, "mean_token_accuracy": 0.11023281887173653, "num_tokens": 880950.0, "step": 390 }, { "entropy": 7.0711596488952635, "epoch": 0.0042448926955605945, "grad_norm": 1.3671875, "learning_rate": 0.00019700000000000002, "loss": 6.7458, "mean_token_accuracy": 0.11763814464211464, "num_tokens": 892583.0, "step": 395 }, { "entropy": 6.909264755249024, "epoch": 0.004298625514491741, "grad_norm": 1.3515625, "learning_rate": 0.00019950000000000002, "loss": 6.5686, "mean_token_accuracy": 0.12108325287699699, "num_tokens": 902191.0, "step": 400 }, { "entropy": 6.913547658920288, "epoch": 0.004352358333422888, "grad_norm": 1.28125, "learning_rate": 0.000202, "loss": 6.6222, "mean_token_accuracy": 0.11458350345492363, "num_tokens": 914274.0, "step": 405 }, { "entropy": 6.911238813400269, "epoch": 0.004406091152354035, "grad_norm": 1.1875, "learning_rate": 0.00020449999999999998, "loss": 6.5556, "mean_token_accuracy": 0.11596038416028023, "num_tokens": 925253.0, "step": 410 }, { "entropy": 7.00830454826355, "epoch": 0.0044598239712851815, "grad_norm": 1.25, "learning_rate": 0.000207, "loss": 6.7087, "mean_token_accuracy": 0.11384080052375793, "num_tokens": 935520.0, "step": 415 }, { "entropy": 6.927305507659912, "epoch": 0.004513556790216328, "grad_norm": 1.171875, "learning_rate": 0.0002095, "loss": 6.6906, "mean_token_accuracy": 0.11692763790488243, "num_tokens": 947817.0, "step": 420 }, { "entropy": 6.889912366867065, "epoch": 0.004567289609147475, "grad_norm": 1.1171875, "learning_rate": 0.000212, "loss": 6.6066, "mean_token_accuracy": 0.11778534352779388, "num_tokens": 959474.0, "step": 425 }, { "entropy": 6.939700126647949, "epoch": 0.004621022428078622, "grad_norm": 1.1875, "learning_rate": 0.0002145, "loss": 6.5916, "mean_token_accuracy": 0.11906479597091675, "num_tokens": 971271.0, "step": 430 }, { "entropy": 6.882960844039917, "epoch": 0.004674755247009769, "grad_norm": 1.140625, "learning_rate": 0.00021700000000000002, "loss": 6.612, "mean_token_accuracy": 0.12181256487965583, "num_tokens": 981995.0, "step": 435 }, { "entropy": 6.9154595851898195, "epoch": 0.004728488065940915, "grad_norm": 1.1640625, "learning_rate": 0.0002195, "loss": 6.6914, "mean_token_accuracy": 0.11828593611717224, "num_tokens": 994346.0, "step": 440 }, { "entropy": 6.966398048400879, "epoch": 0.004782220884872062, "grad_norm": 1.140625, "learning_rate": 0.000222, "loss": 6.6802, "mean_token_accuracy": 0.1137112945318222, "num_tokens": 1005552.0, "step": 445 }, { "entropy": 6.843932342529297, "epoch": 0.004835953703803209, "grad_norm": 1.1796875, "learning_rate": 0.0002245, "loss": 6.6247, "mean_token_accuracy": 0.11204231306910514, "num_tokens": 1017202.0, "step": 450 }, { "entropy": 6.807126045227051, "epoch": 0.004889686522734356, "grad_norm": 1.1875, "learning_rate": 0.00022700000000000002, "loss": 6.5839, "mean_token_accuracy": 0.12199563458561898, "num_tokens": 1027450.0, "step": 455 }, { "entropy": 6.89690580368042, "epoch": 0.004943419341665502, "grad_norm": 1.28125, "learning_rate": 0.00022950000000000002, "loss": 6.5637, "mean_token_accuracy": 0.11613315865397453, "num_tokens": 1038990.0, "step": 460 }, { "entropy": 6.806377410888672, "epoch": 0.004997152160596649, "grad_norm": 1.1875, "learning_rate": 0.00023200000000000003, "loss": 6.5786, "mean_token_accuracy": 0.11820394694805145, "num_tokens": 1050643.0, "step": 465 }, { "entropy": 6.754554319381714, "epoch": 0.005050884979527796, "grad_norm": 1.2109375, "learning_rate": 0.00023449999999999998, "loss": 6.5004, "mean_token_accuracy": 0.12497379332780838, "num_tokens": 1061182.0, "step": 470 }, { "entropy": 6.9261133670806885, "epoch": 0.005104617798458943, "grad_norm": 1.0703125, "learning_rate": 0.000237, "loss": 6.6711, "mean_token_accuracy": 0.11877285093069076, "num_tokens": 1073074.0, "step": 475 }, { "entropy": 6.839569091796875, "epoch": 0.0051583506173900895, "grad_norm": 1.0390625, "learning_rate": 0.0002395, "loss": 6.6933, "mean_token_accuracy": 0.1182055912911892, "num_tokens": 1085061.0, "step": 480 }, { "entropy": 6.822368907928467, "epoch": 0.005212083436321236, "grad_norm": 1.15625, "learning_rate": 0.000242, "loss": 6.5495, "mean_token_accuracy": 0.11974000334739685, "num_tokens": 1096148.0, "step": 485 }, { "entropy": 6.738174152374268, "epoch": 0.005265816255252383, "grad_norm": 1.2421875, "learning_rate": 0.0002445, "loss": 6.4834, "mean_token_accuracy": 0.12004421576857567, "num_tokens": 1106159.0, "step": 490 }, { "entropy": 6.8385029315948485, "epoch": 0.00531954907418353, "grad_norm": 1.2421875, "learning_rate": 0.000247, "loss": 6.6323, "mean_token_accuracy": 0.12007313966751099, "num_tokens": 1117159.0, "step": 495 }, { "entropy": 6.834402704238892, "epoch": 0.0053732818931146765, "grad_norm": 1.1015625, "learning_rate": 0.0002495, "loss": 6.5295, "mean_token_accuracy": 0.12340744212269783, "num_tokens": 1129633.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1767305816064000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }