{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.010746563786229353, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.692043209075928, "epoch": 5.3732818931146765e-05, "grad_norm": 12.625, "learning_rate": 2e-06, "loss": 10.8501, "mean_token_accuracy": 0.0, "num_tokens": 12012.0, "step": 5 }, { "entropy": 10.69202766418457, "epoch": 0.00010746563786229353, "grad_norm": 14.3125, "learning_rate": 4.5e-06, "loss": 10.7855, "mean_token_accuracy": 0.00020087850280106067, "num_tokens": 23548.0, "step": 10 }, { "entropy": 10.69138708114624, "epoch": 0.0001611984567934403, "grad_norm": 9.8125, "learning_rate": 7e-06, "loss": 10.5161, "mean_token_accuracy": 0.016332162456819788, "num_tokens": 35237.0, "step": 15 }, { "entropy": 10.685348415374756, "epoch": 0.00021493127572458706, "grad_norm": 6.125, "learning_rate": 9.5e-06, "loss": 10.1997, "mean_token_accuracy": 0.035921670868992804, "num_tokens": 47773.0, "step": 20 }, { "entropy": 10.647090339660645, "epoch": 0.00026866409465573383, "grad_norm": 4.59375, "learning_rate": 1.2e-05, "loss": 9.8165, "mean_token_accuracy": 0.04100495874881745, "num_tokens": 59398.0, "step": 25 }, { "entropy": 10.562076568603516, "epoch": 0.0003223969135868806, "grad_norm": 3.328125, "learning_rate": 1.4500000000000002e-05, "loss": 9.6944, "mean_token_accuracy": 0.03505560103803873, "num_tokens": 70474.0, "step": 30 }, { "entropy": 10.566006851196288, "epoch": 0.00037612973251802736, "grad_norm": 2.828125, "learning_rate": 1.7000000000000003e-05, "loss": 9.6543, "mean_token_accuracy": 0.03815589081496, "num_tokens": 81441.0, "step": 35 }, { "entropy": 10.595672798156738, "epoch": 0.0004298625514491741, "grad_norm": 2.59375, "learning_rate": 1.95e-05, "loss": 9.6209, "mean_token_accuracy": 0.0424302164465189, "num_tokens": 92819.0, "step": 40 }, { "entropy": 10.57416124343872, "epoch": 0.0004835953703803209, "grad_norm": 2.6875, "learning_rate": 2.2e-05, "loss": 9.477, "mean_token_accuracy": 0.04498981647193432, "num_tokens": 105565.0, "step": 45 }, { "entropy": 10.500903701782226, "epoch": 0.0005373281893114677, "grad_norm": 2.453125, "learning_rate": 2.4500000000000003e-05, "loss": 9.4751, "mean_token_accuracy": 0.03739957753568888, "num_tokens": 116424.0, "step": 50 }, { "entropy": 10.49787940979004, "epoch": 0.0005910610082426144, "grad_norm": 2.3125, "learning_rate": 2.7e-05, "loss": 9.4268, "mean_token_accuracy": 0.0429843544960022, "num_tokens": 127807.0, "step": 55 }, { "entropy": 10.53837537765503, "epoch": 0.0006447938271737612, "grad_norm": 2.65625, "learning_rate": 2.95e-05, "loss": 9.2854, "mean_token_accuracy": 0.05508757047355175, "num_tokens": 139177.0, "step": 60 }, { "entropy": 10.40587682723999, "epoch": 0.000698526646104908, "grad_norm": 2.328125, "learning_rate": 3.2e-05, "loss": 9.2319, "mean_token_accuracy": 0.05228099822998047, "num_tokens": 151296.0, "step": 65 }, { "entropy": 10.370543670654296, "epoch": 0.0007522594650360547, "grad_norm": 2.359375, "learning_rate": 3.4500000000000005e-05, "loss": 9.0806, "mean_token_accuracy": 0.07307359352707862, "num_tokens": 160488.0, "step": 70 }, { "entropy": 10.382234954833985, "epoch": 0.0008059922839672015, "grad_norm": 2.34375, "learning_rate": 3.7e-05, "loss": 9.0574, "mean_token_accuracy": 0.06776703521609306, "num_tokens": 171627.0, "step": 75 }, { "entropy": 10.367051887512208, "epoch": 0.0008597251028983482, "grad_norm": 2.3125, "learning_rate": 3.95e-05, "loss": 8.8925, "mean_token_accuracy": 0.07181778848171234, "num_tokens": 182978.0, "step": 80 }, { "entropy": 10.235933113098145, "epoch": 0.000913457921829495, "grad_norm": 2.46875, "learning_rate": 4.2000000000000004e-05, "loss": 8.7913, "mean_token_accuracy": 0.07224572598934173, "num_tokens": 193362.0, "step": 85 }, { "entropy": 10.180474948883056, "epoch": 0.0009671907407606418, "grad_norm": 2.375, "learning_rate": 4.45e-05, "loss": 8.7247, "mean_token_accuracy": 0.07832827009260654, "num_tokens": 204896.0, "step": 90 }, { "entropy": 10.17861442565918, "epoch": 0.0010209235596917885, "grad_norm": 2.25, "learning_rate": 4.7000000000000004e-05, "loss": 8.6001, "mean_token_accuracy": 0.07487386986613273, "num_tokens": 215828.0, "step": 95 }, { "entropy": 10.129089546203613, "epoch": 0.0010746563786229353, "grad_norm": 2.890625, "learning_rate": 4.9500000000000004e-05, "loss": 8.454, "mean_token_accuracy": 0.0813417136669159, "num_tokens": 226311.0, "step": 100 }, { "entropy": 10.016890907287598, "epoch": 0.001128389197554082, "grad_norm": 2.703125, "learning_rate": 5.2e-05, "loss": 8.3892, "mean_token_accuracy": 0.07950438261032104, "num_tokens": 237817.0, "step": 105 }, { "entropy": 9.948394012451171, "epoch": 0.0011821220164852288, "grad_norm": 2.578125, "learning_rate": 5.45e-05, "loss": 8.2654, "mean_token_accuracy": 0.080025664716959, "num_tokens": 248778.0, "step": 110 }, { "entropy": 9.865277194976807, "epoch": 0.0012358548354163756, "grad_norm": 2.078125, "learning_rate": 5.7e-05, "loss": 8.2215, "mean_token_accuracy": 0.07951191291213036, "num_tokens": 260638.0, "step": 115 }, { "entropy": 9.790133190155029, "epoch": 0.0012895876543475224, "grad_norm": 1.7109375, "learning_rate": 5.9499999999999996e-05, "loss": 8.0775, "mean_token_accuracy": 0.0801257323473692, "num_tokens": 272223.0, "step": 120 }, { "entropy": 9.634031391143798, "epoch": 0.0013433204732786691, "grad_norm": 1.890625, "learning_rate": 6.2e-05, "loss": 7.8657, "mean_token_accuracy": 0.09108843877911568, "num_tokens": 282883.0, "step": 125 }, { "entropy": 9.479462718963623, "epoch": 0.001397053292209816, "grad_norm": 1.6171875, "learning_rate": 6.450000000000001e-05, "loss": 7.8083, "mean_token_accuracy": 0.08633529022336006, "num_tokens": 293318.0, "step": 130 }, { "entropy": 9.311678791046143, "epoch": 0.0014507861111409627, "grad_norm": 1.7578125, "learning_rate": 6.7e-05, "loss": 7.6502, "mean_token_accuracy": 0.08342773504555226, "num_tokens": 303563.0, "step": 135 }, { "entropy": 9.093393898010254, "epoch": 0.0015045189300721094, "grad_norm": 1.671875, "learning_rate": 6.950000000000001e-05, "loss": 7.5358, "mean_token_accuracy": 0.09152235686779023, "num_tokens": 313968.0, "step": 140 }, { "entropy": 8.970313549041748, "epoch": 0.0015582517490032562, "grad_norm": 1.4765625, "learning_rate": 7.2e-05, "loss": 7.5692, "mean_token_accuracy": 0.08849354460835457, "num_tokens": 325261.0, "step": 145 }, { "entropy": 8.724966049194336, "epoch": 0.001611984567934403, "grad_norm": 1.5078125, "learning_rate": 7.45e-05, "loss": 7.3732, "mean_token_accuracy": 0.09316953867673874, "num_tokens": 335803.0, "step": 150 }, { "entropy": 8.553716468811036, "epoch": 0.0016657173868655497, "grad_norm": 1.375, "learning_rate": 7.7e-05, "loss": 7.2783, "mean_token_accuracy": 0.08820799067616462, "num_tokens": 346582.0, "step": 155 }, { "entropy": 8.43663501739502, "epoch": 0.0017194502057966965, "grad_norm": 1.4765625, "learning_rate": 7.950000000000001e-05, "loss": 7.3562, "mean_token_accuracy": 0.09117907658219337, "num_tokens": 357779.0, "step": 160 }, { "entropy": 8.219385528564453, "epoch": 0.0017731830247278433, "grad_norm": 1.4140625, "learning_rate": 8.2e-05, "loss": 7.2185, "mean_token_accuracy": 0.09431424736976624, "num_tokens": 369191.0, "step": 165 }, { "entropy": 8.094470024108887, "epoch": 0.00182691584365899, "grad_norm": 1.3984375, "learning_rate": 8.450000000000001e-05, "loss": 7.2579, "mean_token_accuracy": 0.09085006713867187, "num_tokens": 381374.0, "step": 170 }, { "entropy": 8.00999412536621, "epoch": 0.0018806486625901368, "grad_norm": 1.328125, "learning_rate": 8.7e-05, "loss": 7.2359, "mean_token_accuracy": 0.09357822686433792, "num_tokens": 392152.0, "step": 175 }, { "entropy": 7.9514116764068605, "epoch": 0.0019343814815212836, "grad_norm": 1.484375, "learning_rate": 8.95e-05, "loss": 7.2057, "mean_token_accuracy": 0.09208550006151199, "num_tokens": 404121.0, "step": 180 }, { "entropy": 7.96669111251831, "epoch": 0.0019881143004524303, "grad_norm": 1.609375, "learning_rate": 9.2e-05, "loss": 7.2056, "mean_token_accuracy": 0.0923257291316986, "num_tokens": 416144.0, "step": 185 }, { "entropy": 7.824949645996094, "epoch": 0.002041847119383577, "grad_norm": 1.8359375, "learning_rate": 9.45e-05, "loss": 7.0888, "mean_token_accuracy": 0.09763017818331718, "num_tokens": 427141.0, "step": 190 }, { "entropy": 7.715742874145508, "epoch": 0.002095579938314724, "grad_norm": 1.3984375, "learning_rate": 9.7e-05, "loss": 7.0035, "mean_token_accuracy": 0.0935081422328949, "num_tokens": 439113.0, "step": 195 }, { "entropy": 7.7036233901977536, "epoch": 0.0021493127572458706, "grad_norm": 1.28125, "learning_rate": 9.95e-05, "loss": 7.0734, "mean_token_accuracy": 0.09741963669657708, "num_tokens": 450595.0, "step": 200 }, { "entropy": 7.739162731170654, "epoch": 0.0022030455761770174, "grad_norm": 1.3671875, "learning_rate": 0.000102, "loss": 7.1579, "mean_token_accuracy": 0.09232115969061852, "num_tokens": 462811.0, "step": 205 }, { "entropy": 7.705861139297485, "epoch": 0.002256778395108164, "grad_norm": 1.5234375, "learning_rate": 0.00010449999999999999, "loss": 7.1276, "mean_token_accuracy": 0.09830137938261033, "num_tokens": 473629.0, "step": 210 }, { "entropy": 7.643820524215698, "epoch": 0.002310511214039311, "grad_norm": 1.3671875, "learning_rate": 0.000107, "loss": 7.1024, "mean_token_accuracy": 0.0988999992609024, "num_tokens": 484731.0, "step": 215 }, { "entropy": 7.66978874206543, "epoch": 0.0023642440329704577, "grad_norm": 1.3359375, "learning_rate": 0.0001095, "loss": 7.0548, "mean_token_accuracy": 0.09935099259018898, "num_tokens": 496309.0, "step": 220 }, { "entropy": 7.658147382736206, "epoch": 0.0024179768519016044, "grad_norm": 1.171875, "learning_rate": 0.000112, "loss": 7.0923, "mean_token_accuracy": 0.1015954852104187, "num_tokens": 508715.0, "step": 225 }, { "entropy": 7.41760745048523, "epoch": 0.002471709670832751, "grad_norm": 1.203125, "learning_rate": 0.0001145, "loss": 6.9405, "mean_token_accuracy": 0.1079390250146389, "num_tokens": 519791.0, "step": 230 }, { "entropy": 7.54394679069519, "epoch": 0.002525442489763898, "grad_norm": 1.4921875, "learning_rate": 0.00011700000000000001, "loss": 7.083, "mean_token_accuracy": 0.09995704516768456, "num_tokens": 531897.0, "step": 235 }, { "entropy": 7.555436658859253, "epoch": 0.0025791753086950447, "grad_norm": 1.4375, "learning_rate": 0.00011949999999999999, "loss": 7.0798, "mean_token_accuracy": 0.09950428679585457, "num_tokens": 543243.0, "step": 240 }, { "entropy": 7.442711400985718, "epoch": 0.0026329081276261915, "grad_norm": 1.1953125, "learning_rate": 0.000122, "loss": 6.9189, "mean_token_accuracy": 0.10362667217850685, "num_tokens": 554139.0, "step": 245 }, { "entropy": 7.480173254013062, "epoch": 0.0026866409465573383, "grad_norm": 1.5546875, "learning_rate": 0.0001245, "loss": 6.9273, "mean_token_accuracy": 0.10886659622192382, "num_tokens": 565378.0, "step": 250 }, { "entropy": 7.426122951507568, "epoch": 0.002740373765488485, "grad_norm": 1.3515625, "learning_rate": 0.000127, "loss": 6.881, "mean_token_accuracy": 0.10440984815359115, "num_tokens": 576628.0, "step": 255 }, { "entropy": 7.444299507141113, "epoch": 0.002794106584419632, "grad_norm": 1.2421875, "learning_rate": 0.0001295, "loss": 7.0019, "mean_token_accuracy": 0.09789407551288605, "num_tokens": 588760.0, "step": 260 }, { "entropy": 7.4239896774292, "epoch": 0.0028478394033507786, "grad_norm": 1.75, "learning_rate": 0.000132, "loss": 6.9158, "mean_token_accuracy": 0.10981944426894188, "num_tokens": 600024.0, "step": 265 }, { "entropy": 7.270383596420288, "epoch": 0.0029015722222819253, "grad_norm": 1.3359375, "learning_rate": 0.00013450000000000002, "loss": 6.8775, "mean_token_accuracy": 0.10582949295639991, "num_tokens": 613150.0, "step": 270 }, { "entropy": 7.346567535400391, "epoch": 0.002955305041213072, "grad_norm": 1.1328125, "learning_rate": 0.00013700000000000002, "loss": 6.8547, "mean_token_accuracy": 0.10970969945192337, "num_tokens": 624762.0, "step": 275 }, { "entropy": 7.417334127426147, "epoch": 0.003009037860144219, "grad_norm": 1.3359375, "learning_rate": 0.0001395, "loss": 6.892, "mean_token_accuracy": 0.10366739556193352, "num_tokens": 635761.0, "step": 280 }, { "entropy": 7.223995733261108, "epoch": 0.0030627706790753656, "grad_norm": 1.2421875, "learning_rate": 0.00014199999999999998, "loss": 6.8555, "mean_token_accuracy": 0.10360193029046058, "num_tokens": 647882.0, "step": 285 }, { "entropy": 7.312860345840454, "epoch": 0.0031165034980065124, "grad_norm": 1.140625, "learning_rate": 0.0001445, "loss": 6.8848, "mean_token_accuracy": 0.1077139988541603, "num_tokens": 659749.0, "step": 290 }, { "entropy": 7.270877933502197, "epoch": 0.003170236316937659, "grad_norm": 1.3203125, "learning_rate": 0.000147, "loss": 6.8362, "mean_token_accuracy": 0.10846684277057647, "num_tokens": 672002.0, "step": 295 }, { "entropy": 7.204770469665528, "epoch": 0.003223969135868806, "grad_norm": 1.4375, "learning_rate": 0.0001495, "loss": 6.7952, "mean_token_accuracy": 0.11234059333801269, "num_tokens": 682312.0, "step": 300 }, { "entropy": 7.183935689926147, "epoch": 0.0032777019547999527, "grad_norm": 1.3828125, "learning_rate": 0.000152, "loss": 6.8246, "mean_token_accuracy": 0.10333632677793503, "num_tokens": 692188.0, "step": 305 }, { "entropy": 7.269667243957519, "epoch": 0.0033314347737310995, "grad_norm": 1.28125, "learning_rate": 0.00015450000000000001, "loss": 6.7992, "mean_token_accuracy": 0.10754085555672646, "num_tokens": 703789.0, "step": 310 }, { "entropy": 7.259969711303711, "epoch": 0.0033851675926622462, "grad_norm": 1.3359375, "learning_rate": 0.000157, "loss": 6.8807, "mean_token_accuracy": 0.11048192977905273, "num_tokens": 714752.0, "step": 315 }, { "entropy": 7.137263011932373, "epoch": 0.003438900411593393, "grad_norm": 1.1875, "learning_rate": 0.0001595, "loss": 6.8206, "mean_token_accuracy": 0.11233628690242767, "num_tokens": 726716.0, "step": 320 }, { "entropy": 7.213597440719605, "epoch": 0.0034926332305245398, "grad_norm": 1.1640625, "learning_rate": 0.000162, "loss": 6.8401, "mean_token_accuracy": 0.11278397589921951, "num_tokens": 737267.0, "step": 325 }, { "entropy": 7.222741270065308, "epoch": 0.0035463660494556865, "grad_norm": 1.3828125, "learning_rate": 0.00016450000000000001, "loss": 6.8783, "mean_token_accuracy": 0.10917454287409782, "num_tokens": 750180.0, "step": 330 }, { "entropy": 7.1152294158935545, "epoch": 0.0036000988683868333, "grad_norm": 1.203125, "learning_rate": 0.00016700000000000002, "loss": 6.6925, "mean_token_accuracy": 0.11422673463821412, "num_tokens": 761337.0, "step": 335 }, { "entropy": 7.07347264289856, "epoch": 0.00365383168731798, "grad_norm": 1.3515625, "learning_rate": 0.00016950000000000003, "loss": 6.6614, "mean_token_accuracy": 0.1183428131043911, "num_tokens": 771379.0, "step": 340 }, { "entropy": 7.18135552406311, "epoch": 0.003707564506249127, "grad_norm": 1.203125, "learning_rate": 0.00017199999999999998, "loss": 6.7586, "mean_token_accuracy": 0.11464423760771751, "num_tokens": 782508.0, "step": 345 }, { "entropy": 7.083883142471313, "epoch": 0.0037612973251802736, "grad_norm": 1.2890625, "learning_rate": 0.00017449999999999999, "loss": 6.766, "mean_token_accuracy": 0.1096316896378994, "num_tokens": 795541.0, "step": 350 }, { "entropy": 7.03632378578186, "epoch": 0.0038150301441114204, "grad_norm": 1.1640625, "learning_rate": 0.000177, "loss": 6.7017, "mean_token_accuracy": 0.11446580439805984, "num_tokens": 805665.0, "step": 355 }, { "entropy": 7.182166957855225, "epoch": 0.003868762963042567, "grad_norm": 1.2421875, "learning_rate": 0.0001795, "loss": 6.8425, "mean_token_accuracy": 0.11153884828090668, "num_tokens": 817393.0, "step": 360 }, { "entropy": 7.163691473007202, "epoch": 0.003922495781973714, "grad_norm": 1.2578125, "learning_rate": 0.000182, "loss": 6.7986, "mean_token_accuracy": 0.10896589532494545, "num_tokens": 828436.0, "step": 365 }, { "entropy": 7.033854150772095, "epoch": 0.003976228600904861, "grad_norm": 1.2578125, "learning_rate": 0.0001845, "loss": 6.653, "mean_token_accuracy": 0.11405793353915214, "num_tokens": 839223.0, "step": 370 }, { "entropy": 7.135569000244141, "epoch": 0.004029961419836007, "grad_norm": 1.359375, "learning_rate": 0.000187, "loss": 6.6199, "mean_token_accuracy": 0.12831516563892365, "num_tokens": 848953.0, "step": 375 }, { "entropy": 6.988350915908813, "epoch": 0.004083694238767154, "grad_norm": 1.3984375, "learning_rate": 0.0001895, "loss": 6.7725, "mean_token_accuracy": 0.10901687815785407, "num_tokens": 860349.0, "step": 380 }, { "entropy": 7.042834091186523, "epoch": 0.004137427057698301, "grad_norm": 1.15625, "learning_rate": 0.000192, "loss": 6.6875, "mean_token_accuracy": 0.11479247137904167, "num_tokens": 870993.0, "step": 385 }, { "entropy": 7.062792253494263, "epoch": 0.004191159876629448, "grad_norm": 1.34375, "learning_rate": 0.0001945, "loss": 6.7484, "mean_token_accuracy": 0.11023281887173653, "num_tokens": 880950.0, "step": 390 }, { "entropy": 7.0711596488952635, "epoch": 0.0042448926955605945, "grad_norm": 1.3671875, "learning_rate": 0.00019700000000000002, "loss": 6.7458, "mean_token_accuracy": 0.11763814464211464, "num_tokens": 892583.0, "step": 395 }, { "entropy": 6.909264755249024, "epoch": 0.004298625514491741, "grad_norm": 1.3515625, "learning_rate": 0.00019950000000000002, "loss": 6.5686, "mean_token_accuracy": 0.12108325287699699, "num_tokens": 902191.0, "step": 400 }, { "entropy": 6.913547658920288, "epoch": 0.004352358333422888, "grad_norm": 1.28125, "learning_rate": 0.000202, "loss": 6.6222, "mean_token_accuracy": 0.11458350345492363, "num_tokens": 914274.0, "step": 405 }, { "entropy": 6.911238813400269, "epoch": 0.004406091152354035, "grad_norm": 1.1875, "learning_rate": 0.00020449999999999998, "loss": 6.5556, "mean_token_accuracy": 0.11596038416028023, "num_tokens": 925253.0, "step": 410 }, { "entropy": 7.00830454826355, "epoch": 0.0044598239712851815, "grad_norm": 1.25, "learning_rate": 0.000207, "loss": 6.7087, "mean_token_accuracy": 0.11384080052375793, "num_tokens": 935520.0, "step": 415 }, { "entropy": 6.927305507659912, "epoch": 0.004513556790216328, "grad_norm": 1.171875, "learning_rate": 0.0002095, "loss": 6.6906, "mean_token_accuracy": 0.11692763790488243, "num_tokens": 947817.0, "step": 420 }, { "entropy": 6.889912366867065, "epoch": 0.004567289609147475, "grad_norm": 1.1171875, "learning_rate": 0.000212, "loss": 6.6066, "mean_token_accuracy": 0.11778534352779388, "num_tokens": 959474.0, "step": 425 }, { "entropy": 6.939700126647949, "epoch": 0.004621022428078622, "grad_norm": 1.1875, "learning_rate": 0.0002145, "loss": 6.5916, "mean_token_accuracy": 0.11906479597091675, "num_tokens": 971271.0, "step": 430 }, { "entropy": 6.882960844039917, "epoch": 0.004674755247009769, "grad_norm": 1.140625, "learning_rate": 0.00021700000000000002, "loss": 6.612, "mean_token_accuracy": 0.12181256487965583, "num_tokens": 981995.0, "step": 435 }, { "entropy": 6.9154595851898195, "epoch": 0.004728488065940915, "grad_norm": 1.1640625, "learning_rate": 0.0002195, "loss": 6.6914, "mean_token_accuracy": 0.11828593611717224, "num_tokens": 994346.0, "step": 440 }, { "entropy": 6.966398048400879, "epoch": 0.004782220884872062, "grad_norm": 1.140625, "learning_rate": 0.000222, "loss": 6.6802, "mean_token_accuracy": 0.1137112945318222, "num_tokens": 1005552.0, "step": 445 }, { "entropy": 6.843932342529297, "epoch": 0.004835953703803209, "grad_norm": 1.1796875, "learning_rate": 0.0002245, "loss": 6.6247, "mean_token_accuracy": 0.11204231306910514, "num_tokens": 1017202.0, "step": 450 }, { "entropy": 6.807126045227051, "epoch": 0.004889686522734356, "grad_norm": 1.1875, "learning_rate": 0.00022700000000000002, "loss": 6.5839, "mean_token_accuracy": 0.12199563458561898, "num_tokens": 1027450.0, "step": 455 }, { "entropy": 6.89690580368042, "epoch": 0.004943419341665502, "grad_norm": 1.28125, "learning_rate": 0.00022950000000000002, "loss": 6.5637, "mean_token_accuracy": 0.11613315865397453, "num_tokens": 1038990.0, "step": 460 }, { "entropy": 6.806377410888672, "epoch": 0.004997152160596649, "grad_norm": 1.1875, "learning_rate": 0.00023200000000000003, "loss": 6.5786, "mean_token_accuracy": 0.11820394694805145, "num_tokens": 1050643.0, "step": 465 }, { "entropy": 6.754554319381714, "epoch": 0.005050884979527796, "grad_norm": 1.2109375, "learning_rate": 0.00023449999999999998, "loss": 6.5004, "mean_token_accuracy": 0.12497379332780838, "num_tokens": 1061182.0, "step": 470 }, { "entropy": 6.9261133670806885, "epoch": 0.005104617798458943, "grad_norm": 1.0703125, "learning_rate": 0.000237, "loss": 6.6711, "mean_token_accuracy": 0.11877285093069076, "num_tokens": 1073074.0, "step": 475 }, { "entropy": 6.839569091796875, "epoch": 0.0051583506173900895, "grad_norm": 1.0390625, "learning_rate": 0.0002395, "loss": 6.6933, "mean_token_accuracy": 0.1182055912911892, "num_tokens": 1085061.0, "step": 480 }, { "entropy": 6.822368907928467, "epoch": 0.005212083436321236, "grad_norm": 1.15625, "learning_rate": 0.000242, "loss": 6.5495, "mean_token_accuracy": 0.11974000334739685, "num_tokens": 1096148.0, "step": 485 }, { "entropy": 6.738174152374268, "epoch": 0.005265816255252383, "grad_norm": 1.2421875, "learning_rate": 0.0002445, "loss": 6.4834, "mean_token_accuracy": 0.12004421576857567, "num_tokens": 1106159.0, "step": 490 }, { "entropy": 6.8385029315948485, "epoch": 0.00531954907418353, "grad_norm": 1.2421875, "learning_rate": 0.000247, "loss": 6.6323, "mean_token_accuracy": 0.12007313966751099, "num_tokens": 1117159.0, "step": 495 }, { "entropy": 6.834402704238892, "epoch": 0.0053732818931146765, "grad_norm": 1.1015625, "learning_rate": 0.0002495, "loss": 6.5295, "mean_token_accuracy": 0.12340744212269783, "num_tokens": 1129633.0, "step": 500 }, { "entropy": 6.888376379013062, "epoch": 0.005427014712045823, "grad_norm": 1.2578125, "learning_rate": 0.000252, "loss": 6.7195, "mean_token_accuracy": 0.12026305049657822, "num_tokens": 1140814.0, "step": 505 }, { "entropy": 6.8587806701660154, "epoch": 0.00548074753097697, "grad_norm": 1.2109375, "learning_rate": 0.0002545, "loss": 6.6052, "mean_token_accuracy": 0.12095662355422973, "num_tokens": 1152963.0, "step": 510 }, { "entropy": 6.571197032928467, "epoch": 0.005534480349908117, "grad_norm": 1.15625, "learning_rate": 0.000257, "loss": 6.4367, "mean_token_accuracy": 0.1233276754617691, "num_tokens": 1165092.0, "step": 515 }, { "entropy": 6.769173955917358, "epoch": 0.005588213168839264, "grad_norm": 1.1171875, "learning_rate": 0.0002595, "loss": 6.5331, "mean_token_accuracy": 0.1194583684206009, "num_tokens": 1177403.0, "step": 520 }, { "entropy": 6.709192943572998, "epoch": 0.00564194598777041, "grad_norm": 1.2890625, "learning_rate": 0.000262, "loss": 6.5345, "mean_token_accuracy": 0.11615289524197578, "num_tokens": 1187436.0, "step": 525 }, { "entropy": 6.793780326843262, "epoch": 0.005695678806701557, "grad_norm": 1.1796875, "learning_rate": 0.00026450000000000003, "loss": 6.6191, "mean_token_accuracy": 0.11863412484526634, "num_tokens": 1199906.0, "step": 530 }, { "entropy": 6.816549777984619, "epoch": 0.005749411625632704, "grad_norm": 1.2265625, "learning_rate": 0.00026700000000000004, "loss": 6.5816, "mean_token_accuracy": 0.1212506726384163, "num_tokens": 1211411.0, "step": 535 }, { "entropy": 6.711446523666382, "epoch": 0.005803144444563851, "grad_norm": 1.203125, "learning_rate": 0.00026950000000000005, "loss": 6.5452, "mean_token_accuracy": 0.12302517369389535, "num_tokens": 1223669.0, "step": 540 }, { "entropy": 6.627863168716431, "epoch": 0.0058568772634949974, "grad_norm": 1.03125, "learning_rate": 0.00027200000000000005, "loss": 6.4752, "mean_token_accuracy": 0.12178474590182305, "num_tokens": 1234931.0, "step": 545 }, { "entropy": 6.712806463241577, "epoch": 0.005910610082426144, "grad_norm": 1.171875, "learning_rate": 0.0002745, "loss": 6.4942, "mean_token_accuracy": 0.12170209959149361, "num_tokens": 1245731.0, "step": 550 }, { "entropy": 6.725653505325317, "epoch": 0.005964342901357291, "grad_norm": 1.109375, "learning_rate": 0.000277, "loss": 6.4796, "mean_token_accuracy": 0.12272765785455704, "num_tokens": 1257441.0, "step": 555 }, { "entropy": 6.729346084594726, "epoch": 0.006018075720288438, "grad_norm": 1.1953125, "learning_rate": 0.0002795, "loss": 6.5136, "mean_token_accuracy": 0.12274165153503418, "num_tokens": 1269169.0, "step": 560 }, { "entropy": 6.632570362091064, "epoch": 0.0060718085392195845, "grad_norm": 1.1484375, "learning_rate": 0.00028199999999999997, "loss": 6.4972, "mean_token_accuracy": 0.12501644492149352, "num_tokens": 1280636.0, "step": 565 }, { "entropy": 6.588498926162719, "epoch": 0.006125541358150731, "grad_norm": 1.1328125, "learning_rate": 0.0002845, "loss": 6.4233, "mean_token_accuracy": 0.1268314391374588, "num_tokens": 1292266.0, "step": 570 }, { "entropy": 6.6426673412323, "epoch": 0.006179274177081878, "grad_norm": 1.140625, "learning_rate": 0.000287, "loss": 6.5163, "mean_token_accuracy": 0.12650827020406724, "num_tokens": 1304090.0, "step": 575 }, { "entropy": 6.662691974639893, "epoch": 0.006233006996013025, "grad_norm": 1.265625, "learning_rate": 0.0002895, "loss": 6.5546, "mean_token_accuracy": 0.12577759027481078, "num_tokens": 1314758.0, "step": 580 }, { "entropy": 6.787952995300293, "epoch": 0.0062867398149441716, "grad_norm": 1.328125, "learning_rate": 0.000292, "loss": 6.528, "mean_token_accuracy": 0.1216070830821991, "num_tokens": 1326085.0, "step": 585 }, { "entropy": 6.702496099472046, "epoch": 0.006340472633875318, "grad_norm": 1.1875, "learning_rate": 0.0002945, "loss": 6.4632, "mean_token_accuracy": 0.12628382220864295, "num_tokens": 1336766.0, "step": 590 }, { "entropy": 6.507978296279907, "epoch": 0.006394205452806465, "grad_norm": 1.109375, "learning_rate": 0.000297, "loss": 6.384, "mean_token_accuracy": 0.12896264716982841, "num_tokens": 1346864.0, "step": 595 }, { "entropy": 6.745914697647095, "epoch": 0.006447938271737612, "grad_norm": 1.109375, "learning_rate": 0.0002995, "loss": 6.4981, "mean_token_accuracy": 0.1272559054195881, "num_tokens": 1357429.0, "step": 600 }, { "entropy": 6.573749780654907, "epoch": 0.006501671090668759, "grad_norm": 1.2109375, "learning_rate": 0.000302, "loss": 6.3802, "mean_token_accuracy": 0.12390858009457588, "num_tokens": 1367080.0, "step": 605 }, { "entropy": 6.646589183807373, "epoch": 0.006555403909599905, "grad_norm": 0.98046875, "learning_rate": 0.0003045, "loss": 6.5166, "mean_token_accuracy": 0.1198254756629467, "num_tokens": 1379104.0, "step": 610 }, { "entropy": 6.6281653881073, "epoch": 0.006609136728531052, "grad_norm": 1.0625, "learning_rate": 0.000307, "loss": 6.3401, "mean_token_accuracy": 0.1338522858917713, "num_tokens": 1390346.0, "step": 615 }, { "entropy": 6.481263113021851, "epoch": 0.006662869547462199, "grad_norm": 1.21875, "learning_rate": 0.0003095, "loss": 6.4714, "mean_token_accuracy": 0.12188125848770141, "num_tokens": 1401512.0, "step": 620 }, { "entropy": 6.5761816024780275, "epoch": 0.006716602366393346, "grad_norm": 1.1328125, "learning_rate": 0.000312, "loss": 6.4625, "mean_token_accuracy": 0.1254078231751919, "num_tokens": 1412410.0, "step": 625 }, { "entropy": 6.563577651977539, "epoch": 0.0067703351853244925, "grad_norm": 1.265625, "learning_rate": 0.0003145, "loss": 6.3567, "mean_token_accuracy": 0.12992686927318572, "num_tokens": 1424028.0, "step": 630 }, { "entropy": 6.653519344329834, "epoch": 0.006824068004255639, "grad_norm": 1.140625, "learning_rate": 0.000317, "loss": 6.5013, "mean_token_accuracy": 0.1232505589723587, "num_tokens": 1435275.0, "step": 635 }, { "entropy": 6.635418176651001, "epoch": 0.006877800823186786, "grad_norm": 0.97265625, "learning_rate": 0.0003195, "loss": 6.4836, "mean_token_accuracy": 0.1284290887415409, "num_tokens": 1447336.0, "step": 640 }, { "entropy": 6.5360087871551515, "epoch": 0.006931533642117933, "grad_norm": 1.09375, "learning_rate": 0.000322, "loss": 6.4281, "mean_token_accuracy": 0.12723628357052802, "num_tokens": 1459224.0, "step": 645 }, { "entropy": 6.741295862197876, "epoch": 0.0069852664610490795, "grad_norm": 1.078125, "learning_rate": 0.00032450000000000003, "loss": 6.5461, "mean_token_accuracy": 0.12568391785025596, "num_tokens": 1472077.0, "step": 650 }, { "entropy": 6.6534796237945555, "epoch": 0.007038999279980226, "grad_norm": 1.265625, "learning_rate": 0.00032700000000000003, "loss": 6.5163, "mean_token_accuracy": 0.12574814409017562, "num_tokens": 1484296.0, "step": 655 }, { "entropy": 6.606902265548706, "epoch": 0.007092732098911373, "grad_norm": 1.078125, "learning_rate": 0.00032950000000000004, "loss": 6.4744, "mean_token_accuracy": 0.12749515175819398, "num_tokens": 1495723.0, "step": 660 }, { "entropy": 6.517670679092407, "epoch": 0.00714646491784252, "grad_norm": 1.1875, "learning_rate": 0.00033200000000000005, "loss": 6.3645, "mean_token_accuracy": 0.13283996507525445, "num_tokens": 1506610.0, "step": 665 }, { "entropy": 6.611458110809326, "epoch": 0.007200197736773667, "grad_norm": 1.1875, "learning_rate": 0.00033450000000000005, "loss": 6.4832, "mean_token_accuracy": 0.1267407178878784, "num_tokens": 1519216.0, "step": 670 }, { "entropy": 6.491586589813233, "epoch": 0.007253930555704813, "grad_norm": 1.21875, "learning_rate": 0.000337, "loss": 6.446, "mean_token_accuracy": 0.12697500586509705, "num_tokens": 1529925.0, "step": 675 }, { "entropy": 6.59675145149231, "epoch": 0.00730766337463596, "grad_norm": 1.0625, "learning_rate": 0.0003395, "loss": 6.4008, "mean_token_accuracy": 0.1306189052760601, "num_tokens": 1541329.0, "step": 680 }, { "entropy": 6.4607322216033936, "epoch": 0.007361396193567107, "grad_norm": 1.1875, "learning_rate": 0.000342, "loss": 6.4265, "mean_token_accuracy": 0.12382375597953796, "num_tokens": 1552716.0, "step": 685 }, { "entropy": 6.526829433441162, "epoch": 0.007415129012498254, "grad_norm": 1.1796875, "learning_rate": 0.00034449999999999997, "loss": 6.3576, "mean_token_accuracy": 0.12638328224420547, "num_tokens": 1563170.0, "step": 690 }, { "entropy": 6.584331369400024, "epoch": 0.0074688618314294, "grad_norm": 1.1328125, "learning_rate": 0.000347, "loss": 6.5071, "mean_token_accuracy": 0.13071208000183104, "num_tokens": 1574431.0, "step": 695 }, { "entropy": 6.633341598510742, "epoch": 0.007522594650360547, "grad_norm": 1.015625, "learning_rate": 0.0003495, "loss": 6.4628, "mean_token_accuracy": 0.12467131316661835, "num_tokens": 1586173.0, "step": 700 }, { "entropy": 6.478550148010254, "epoch": 0.007576327469291694, "grad_norm": 1.2578125, "learning_rate": 0.000352, "loss": 6.4009, "mean_token_accuracy": 0.12992049753665924, "num_tokens": 1596809.0, "step": 705 }, { "entropy": 6.555624914169312, "epoch": 0.007630060288222841, "grad_norm": 1.0625, "learning_rate": 0.0003545, "loss": 6.3558, "mean_token_accuracy": 0.12971629872918128, "num_tokens": 1608033.0, "step": 710 }, { "entropy": 6.477349472045899, "epoch": 0.0076837931071539875, "grad_norm": 1.203125, "learning_rate": 0.000357, "loss": 6.4094, "mean_token_accuracy": 0.1303440511226654, "num_tokens": 1619135.0, "step": 715 }, { "entropy": 6.490011358261109, "epoch": 0.007737525926085134, "grad_norm": 1.140625, "learning_rate": 0.0003595, "loss": 6.4472, "mean_token_accuracy": 0.1352962836623192, "num_tokens": 1630162.0, "step": 720 }, { "entropy": 6.639921855926514, "epoch": 0.007791258745016281, "grad_norm": 1.0390625, "learning_rate": 0.000362, "loss": 6.4996, "mean_token_accuracy": 0.12582269459962844, "num_tokens": 1641439.0, "step": 725 }, { "entropy": 6.511112117767334, "epoch": 0.007844991563947428, "grad_norm": 1.109375, "learning_rate": 0.0003645, "loss": 6.4003, "mean_token_accuracy": 0.12877567633986473, "num_tokens": 1653615.0, "step": 730 }, { "entropy": 6.463456630706787, "epoch": 0.007898724382878575, "grad_norm": 1.15625, "learning_rate": 0.000367, "loss": 6.2878, "mean_token_accuracy": 0.1366309866309166, "num_tokens": 1663262.0, "step": 735 }, { "entropy": 6.641633558273315, "epoch": 0.007952457201809721, "grad_norm": 0.96875, "learning_rate": 0.0003695, "loss": 6.5463, "mean_token_accuracy": 0.11863012239336967, "num_tokens": 1676012.0, "step": 740 }, { "entropy": 6.5580424785614015, "epoch": 0.008006190020740869, "grad_norm": 1.1640625, "learning_rate": 0.000372, "loss": 6.4331, "mean_token_accuracy": 0.1215569481253624, "num_tokens": 1688145.0, "step": 745 }, { "entropy": 6.420039892196655, "epoch": 0.008059922839672015, "grad_norm": 1.1953125, "learning_rate": 0.0003745, "loss": 6.3624, "mean_token_accuracy": 0.13154705688357354, "num_tokens": 1698710.0, "step": 750 }, { "entropy": 6.487041378021241, "epoch": 0.008113655658603162, "grad_norm": 1.140625, "learning_rate": 0.000377, "loss": 6.3722, "mean_token_accuracy": 0.13104054182767869, "num_tokens": 1710956.0, "step": 755 }, { "entropy": 6.517988061904907, "epoch": 0.008167388477534308, "grad_norm": 0.9921875, "learning_rate": 0.0003795, "loss": 6.4403, "mean_token_accuracy": 0.1294276535511017, "num_tokens": 1722915.0, "step": 760 }, { "entropy": 6.449849367141724, "epoch": 0.008221121296465456, "grad_norm": 1.1796875, "learning_rate": 0.000382, "loss": 6.3422, "mean_token_accuracy": 0.1337424710392952, "num_tokens": 1734474.0, "step": 765 }, { "entropy": 6.4679615020751955, "epoch": 0.008274854115396602, "grad_norm": 0.89453125, "learning_rate": 0.0003845, "loss": 6.4661, "mean_token_accuracy": 0.1281263567507267, "num_tokens": 1747871.0, "step": 770 }, { "entropy": 6.52447919845581, "epoch": 0.00832858693432775, "grad_norm": 1.09375, "learning_rate": 0.00038700000000000003, "loss": 6.3677, "mean_token_accuracy": 0.13014960363507272, "num_tokens": 1759368.0, "step": 775 }, { "entropy": 6.4473429203033445, "epoch": 0.008382319753258895, "grad_norm": 1.1484375, "learning_rate": 0.00038950000000000003, "loss": 6.3219, "mean_token_accuracy": 0.12805930003523827, "num_tokens": 1770077.0, "step": 780 }, { "entropy": 6.341373634338379, "epoch": 0.008436052572190043, "grad_norm": 1.203125, "learning_rate": 0.00039200000000000004, "loss": 6.3127, "mean_token_accuracy": 0.12711255848407746, "num_tokens": 1781866.0, "step": 785 }, { "entropy": 6.420151329040527, "epoch": 0.008489785391121189, "grad_norm": 1.0703125, "learning_rate": 0.00039450000000000005, "loss": 6.3181, "mean_token_accuracy": 0.12717027962207794, "num_tokens": 1792495.0, "step": 790 }, { "entropy": 6.4637500762939455, "epoch": 0.008543518210052337, "grad_norm": 1.125, "learning_rate": 0.00039700000000000005, "loss": 6.3178, "mean_token_accuracy": 0.134869834035635, "num_tokens": 1803615.0, "step": 795 }, { "entropy": 6.361494874954223, "epoch": 0.008597251028983482, "grad_norm": 1.046875, "learning_rate": 0.0003995, "loss": 6.3092, "mean_token_accuracy": 0.13040214627981186, "num_tokens": 1814302.0, "step": 800 }, { "entropy": 6.459384536743164, "epoch": 0.00865098384791463, "grad_norm": 0.9921875, "learning_rate": 0.000402, "loss": 6.3336, "mean_token_accuracy": 0.13680917099118234, "num_tokens": 1825883.0, "step": 805 }, { "entropy": 6.427951526641846, "epoch": 0.008704716666845776, "grad_norm": 1.078125, "learning_rate": 0.0004045, "loss": 6.4295, "mean_token_accuracy": 0.12659786641597748, "num_tokens": 1837863.0, "step": 810 }, { "entropy": 6.3974611282348635, "epoch": 0.008758449485776924, "grad_norm": 1.125, "learning_rate": 0.00040699999999999997, "loss": 6.3164, "mean_token_accuracy": 0.12896919026970863, "num_tokens": 1848566.0, "step": 815 }, { "entropy": 6.373238897323608, "epoch": 0.00881218230470807, "grad_norm": 1.2109375, "learning_rate": 0.0004095, "loss": 6.4152, "mean_token_accuracy": 0.13358617648482324, "num_tokens": 1862068.0, "step": 820 }, { "entropy": 6.488036108016968, "epoch": 0.008865915123639217, "grad_norm": 1.1953125, "learning_rate": 0.000412, "loss": 6.3945, "mean_token_accuracy": 0.13050863072276114, "num_tokens": 1873985.0, "step": 825 }, { "entropy": 6.3769128799438475, "epoch": 0.008919647942570363, "grad_norm": 1.09375, "learning_rate": 0.0004145, "loss": 6.3659, "mean_token_accuracy": 0.1300532825291157, "num_tokens": 1885805.0, "step": 830 }, { "entropy": 6.389228773117066, "epoch": 0.00897338076150151, "grad_norm": 1.1640625, "learning_rate": 0.000417, "loss": 6.3363, "mean_token_accuracy": 0.12887792587280272, "num_tokens": 1897520.0, "step": 835 }, { "entropy": 6.381129407882691, "epoch": 0.009027113580432657, "grad_norm": 1.078125, "learning_rate": 0.0004195, "loss": 6.3145, "mean_token_accuracy": 0.1281817726790905, "num_tokens": 1908645.0, "step": 840 }, { "entropy": 6.377236175537109, "epoch": 0.009080846399363804, "grad_norm": 1.03125, "learning_rate": 0.000422, "loss": 6.3134, "mean_token_accuracy": 0.13246509581804275, "num_tokens": 1919933.0, "step": 845 }, { "entropy": 6.407544898986816, "epoch": 0.00913457921829495, "grad_norm": 1.0546875, "learning_rate": 0.0004245, "loss": 6.3749, "mean_token_accuracy": 0.1343151532113552, "num_tokens": 1932150.0, "step": 850 }, { "entropy": 6.402065134048462, "epoch": 0.009188312037226098, "grad_norm": 1.1953125, "learning_rate": 0.000427, "loss": 6.3266, "mean_token_accuracy": 0.13442369997501374, "num_tokens": 1944379.0, "step": 855 }, { "entropy": 6.432179164886475, "epoch": 0.009242044856157244, "grad_norm": 0.96484375, "learning_rate": 0.0004295, "loss": 6.3316, "mean_token_accuracy": 0.1368368983268738, "num_tokens": 1956156.0, "step": 860 }, { "entropy": 6.499852514266967, "epoch": 0.009295777675088391, "grad_norm": 1.140625, "learning_rate": 0.000432, "loss": 6.4659, "mean_token_accuracy": 0.1252061903476715, "num_tokens": 1968585.0, "step": 865 }, { "entropy": 6.327846670150757, "epoch": 0.009349510494019537, "grad_norm": 1.078125, "learning_rate": 0.0004345, "loss": 6.3164, "mean_token_accuracy": 0.1293796181678772, "num_tokens": 1979627.0, "step": 870 }, { "entropy": 6.394920063018799, "epoch": 0.009403243312950685, "grad_norm": 1.0390625, "learning_rate": 0.000437, "loss": 6.3903, "mean_token_accuracy": 0.1291674293577671, "num_tokens": 1993368.0, "step": 875 }, { "entropy": 6.483371686935425, "epoch": 0.00945697613188183, "grad_norm": 1.0859375, "learning_rate": 0.0004395, "loss": 6.439, "mean_token_accuracy": 0.12856033444404602, "num_tokens": 2004334.0, "step": 880 }, { "entropy": 6.250707912445068, "epoch": 0.009510708950812978, "grad_norm": 1.171875, "learning_rate": 0.000442, "loss": 6.2372, "mean_token_accuracy": 0.1328311175107956, "num_tokens": 2015328.0, "step": 885 }, { "entropy": 6.345365381240844, "epoch": 0.009564441769744124, "grad_norm": 1.0390625, "learning_rate": 0.0004445, "loss": 6.3678, "mean_token_accuracy": 0.12939499244093894, "num_tokens": 2027341.0, "step": 890 }, { "entropy": 6.272373819351197, "epoch": 0.009618174588675272, "grad_norm": 1.140625, "learning_rate": 0.000447, "loss": 6.2033, "mean_token_accuracy": 0.1377152383327484, "num_tokens": 2036774.0, "step": 895 }, { "entropy": 6.438100528717041, "epoch": 0.009671907407606418, "grad_norm": 1.140625, "learning_rate": 0.00044950000000000003, "loss": 6.2639, "mean_token_accuracy": 0.1349859781563282, "num_tokens": 2047320.0, "step": 900 }, { "entropy": 6.199841403961182, "epoch": 0.009725640226537565, "grad_norm": 1.0859375, "learning_rate": 0.00045200000000000004, "loss": 6.2053, "mean_token_accuracy": 0.1357021301984787, "num_tokens": 2058336.0, "step": 905 }, { "entropy": 6.342473936080933, "epoch": 0.009779373045468711, "grad_norm": 1.015625, "learning_rate": 0.00045450000000000004, "loss": 6.259, "mean_token_accuracy": 0.13590859845280648, "num_tokens": 2069767.0, "step": 910 }, { "entropy": 6.282735824584961, "epoch": 0.009833105864399859, "grad_norm": 1.28125, "learning_rate": 0.00045700000000000005, "loss": 6.247, "mean_token_accuracy": 0.1364621177315712, "num_tokens": 2080018.0, "step": 915 }, { "entropy": 6.3263512134552, "epoch": 0.009886838683331005, "grad_norm": 1.1328125, "learning_rate": 0.00045950000000000006, "loss": 6.3181, "mean_token_accuracy": 0.1294290691614151, "num_tokens": 2091274.0, "step": 920 }, { "entropy": 6.404293727874756, "epoch": 0.009940571502262152, "grad_norm": 1.0078125, "learning_rate": 0.000462, "loss": 6.4552, "mean_token_accuracy": 0.12284724041819572, "num_tokens": 2104780.0, "step": 925 }, { "entropy": 6.404548597335816, "epoch": 0.009994304321193298, "grad_norm": 1.15625, "learning_rate": 0.0004645, "loss": 6.4497, "mean_token_accuracy": 0.12493002042174339, "num_tokens": 2118181.0, "step": 930 }, { "entropy": 6.420569181442261, "epoch": 0.010048037140124446, "grad_norm": 1.1875, "learning_rate": 0.000467, "loss": 6.3692, "mean_token_accuracy": 0.1358141668140888, "num_tokens": 2128371.0, "step": 935 }, { "entropy": 6.301304912567138, "epoch": 0.010101769959055592, "grad_norm": 1.1484375, "learning_rate": 0.0004695, "loss": 6.1927, "mean_token_accuracy": 0.13996189907193185, "num_tokens": 2140385.0, "step": 940 }, { "entropy": 6.357480192184449, "epoch": 0.01015550277798674, "grad_norm": 1.125, "learning_rate": 0.000472, "loss": 6.4256, "mean_token_accuracy": 0.12998471185564994, "num_tokens": 2151030.0, "step": 945 }, { "entropy": 6.157267808914185, "epoch": 0.010209235596917885, "grad_norm": 1.015625, "learning_rate": 0.0004745, "loss": 6.1555, "mean_token_accuracy": 0.13839885592460632, "num_tokens": 2162977.0, "step": 950 }, { "entropy": 6.45593671798706, "epoch": 0.010262968415849033, "grad_norm": 0.98046875, "learning_rate": 0.000477, "loss": 6.4188, "mean_token_accuracy": 0.12474074959754944, "num_tokens": 2175320.0, "step": 955 }, { "entropy": 6.31116042137146, "epoch": 0.010316701234780179, "grad_norm": 0.97265625, "learning_rate": 0.0004795, "loss": 6.2703, "mean_token_accuracy": 0.13561318814754486, "num_tokens": 2187401.0, "step": 960 }, { "entropy": 6.256970357894898, "epoch": 0.010370434053711327, "grad_norm": 1.1015625, "learning_rate": 0.000482, "loss": 6.273, "mean_token_accuracy": 0.13364465087652205, "num_tokens": 2198475.0, "step": 965 }, { "entropy": 6.364040231704712, "epoch": 0.010424166872642473, "grad_norm": 1.0625, "learning_rate": 0.0004845, "loss": 6.2953, "mean_token_accuracy": 0.1304472081363201, "num_tokens": 2209401.0, "step": 970 }, { "entropy": 6.179701614379883, "epoch": 0.01047789969157362, "grad_norm": 1.2109375, "learning_rate": 0.000487, "loss": 6.2209, "mean_token_accuracy": 0.135325139015913, "num_tokens": 2220687.0, "step": 975 }, { "entropy": 6.4695775508880615, "epoch": 0.010531632510504766, "grad_norm": 1.0625, "learning_rate": 0.0004895, "loss": 6.3947, "mean_token_accuracy": 0.13351753056049348, "num_tokens": 2232876.0, "step": 980 }, { "entropy": 6.207294893264771, "epoch": 0.010585365329435914, "grad_norm": 1.234375, "learning_rate": 0.000492, "loss": 6.1782, "mean_token_accuracy": 0.13681197613477708, "num_tokens": 2243683.0, "step": 985 }, { "entropy": 6.2024573802948, "epoch": 0.01063909814836706, "grad_norm": 0.984375, "learning_rate": 0.0004945, "loss": 6.2193, "mean_token_accuracy": 0.13724667727947235, "num_tokens": 2254919.0, "step": 990 }, { "entropy": 6.28679141998291, "epoch": 0.010692830967298207, "grad_norm": 1.03125, "learning_rate": 0.000497, "loss": 6.2558, "mean_token_accuracy": 0.13715462759137154, "num_tokens": 2267583.0, "step": 995 }, { "entropy": 6.299418592453003, "epoch": 0.010746563786229353, "grad_norm": 1.171875, "learning_rate": 0.0004995, "loss": 6.3302, "mean_token_accuracy": 0.13524263501167297, "num_tokens": 2279228.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3602024976384000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }