{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.021493127572458706, "eval_steps": 500, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.692043209075928, "epoch": 5.3732818931146765e-05, "grad_norm": 12.625, "learning_rate": 2e-06, "loss": 10.8501, "mean_token_accuracy": 0.0, "num_tokens": 12012.0, "step": 5 }, { "entropy": 10.69202766418457, "epoch": 0.00010746563786229353, "grad_norm": 14.3125, "learning_rate": 4.5e-06, "loss": 10.7855, "mean_token_accuracy": 0.00020087850280106067, "num_tokens": 23548.0, "step": 10 }, { "entropy": 10.69138708114624, "epoch": 0.0001611984567934403, "grad_norm": 9.8125, "learning_rate": 7e-06, "loss": 10.5161, "mean_token_accuracy": 0.016332162456819788, "num_tokens": 35237.0, "step": 15 }, { "entropy": 10.685348415374756, "epoch": 0.00021493127572458706, "grad_norm": 6.125, "learning_rate": 9.5e-06, "loss": 10.1997, "mean_token_accuracy": 0.035921670868992804, "num_tokens": 47773.0, "step": 20 }, { "entropy": 10.647090339660645, "epoch": 0.00026866409465573383, "grad_norm": 4.59375, "learning_rate": 1.2e-05, "loss": 9.8165, "mean_token_accuracy": 0.04100495874881745, "num_tokens": 59398.0, "step": 25 }, { "entropy": 10.562076568603516, "epoch": 0.0003223969135868806, "grad_norm": 3.328125, "learning_rate": 1.4500000000000002e-05, "loss": 9.6944, "mean_token_accuracy": 0.03505560103803873, "num_tokens": 70474.0, "step": 30 }, { "entropy": 10.566006851196288, "epoch": 0.00037612973251802736, "grad_norm": 2.828125, "learning_rate": 1.7000000000000003e-05, "loss": 9.6543, "mean_token_accuracy": 0.03815589081496, "num_tokens": 81441.0, "step": 35 }, { "entropy": 10.595672798156738, "epoch": 0.0004298625514491741, "grad_norm": 2.59375, "learning_rate": 1.95e-05, "loss": 9.6209, "mean_token_accuracy": 0.0424302164465189, "num_tokens": 92819.0, "step": 40 }, { "entropy": 10.57416124343872, "epoch": 0.0004835953703803209, "grad_norm": 2.6875, "learning_rate": 2.2e-05, "loss": 9.477, "mean_token_accuracy": 0.04498981647193432, "num_tokens": 105565.0, "step": 45 }, { "entropy": 10.500903701782226, "epoch": 0.0005373281893114677, "grad_norm": 2.453125, "learning_rate": 2.4500000000000003e-05, "loss": 9.4751, "mean_token_accuracy": 0.03739957753568888, "num_tokens": 116424.0, "step": 50 }, { "entropy": 10.49787940979004, "epoch": 0.0005910610082426144, "grad_norm": 2.3125, "learning_rate": 2.7e-05, "loss": 9.4268, "mean_token_accuracy": 0.0429843544960022, "num_tokens": 127807.0, "step": 55 }, { "entropy": 10.53837537765503, "epoch": 0.0006447938271737612, "grad_norm": 2.65625, "learning_rate": 2.95e-05, "loss": 9.2854, "mean_token_accuracy": 0.05508757047355175, "num_tokens": 139177.0, "step": 60 }, { "entropy": 10.40587682723999, "epoch": 0.000698526646104908, "grad_norm": 2.328125, "learning_rate": 3.2e-05, "loss": 9.2319, "mean_token_accuracy": 0.05228099822998047, "num_tokens": 151296.0, "step": 65 }, { "entropy": 10.370543670654296, "epoch": 0.0007522594650360547, "grad_norm": 2.359375, "learning_rate": 3.4500000000000005e-05, "loss": 9.0806, "mean_token_accuracy": 0.07307359352707862, "num_tokens": 160488.0, "step": 70 }, { "entropy": 10.382234954833985, "epoch": 0.0008059922839672015, "grad_norm": 2.34375, "learning_rate": 3.7e-05, "loss": 9.0574, "mean_token_accuracy": 0.06776703521609306, "num_tokens": 171627.0, "step": 75 }, { "entropy": 10.367051887512208, "epoch": 0.0008597251028983482, "grad_norm": 2.3125, "learning_rate": 3.95e-05, "loss": 8.8925, "mean_token_accuracy": 0.07181778848171234, "num_tokens": 182978.0, "step": 80 }, { "entropy": 10.235933113098145, "epoch": 0.000913457921829495, "grad_norm": 2.46875, "learning_rate": 4.2000000000000004e-05, "loss": 8.7913, "mean_token_accuracy": 0.07224572598934173, "num_tokens": 193362.0, "step": 85 }, { "entropy": 10.180474948883056, "epoch": 0.0009671907407606418, "grad_norm": 2.375, "learning_rate": 4.45e-05, "loss": 8.7247, "mean_token_accuracy": 0.07832827009260654, "num_tokens": 204896.0, "step": 90 }, { "entropy": 10.17861442565918, "epoch": 0.0010209235596917885, "grad_norm": 2.25, "learning_rate": 4.7000000000000004e-05, "loss": 8.6001, "mean_token_accuracy": 0.07487386986613273, "num_tokens": 215828.0, "step": 95 }, { "entropy": 10.129089546203613, "epoch": 0.0010746563786229353, "grad_norm": 2.890625, "learning_rate": 4.9500000000000004e-05, "loss": 8.454, "mean_token_accuracy": 0.0813417136669159, "num_tokens": 226311.0, "step": 100 }, { "entropy": 10.016890907287598, "epoch": 0.001128389197554082, "grad_norm": 2.703125, "learning_rate": 5.2e-05, "loss": 8.3892, "mean_token_accuracy": 0.07950438261032104, "num_tokens": 237817.0, "step": 105 }, { "entropy": 9.948394012451171, "epoch": 0.0011821220164852288, "grad_norm": 2.578125, "learning_rate": 5.45e-05, "loss": 8.2654, "mean_token_accuracy": 0.080025664716959, "num_tokens": 248778.0, "step": 110 }, { "entropy": 9.865277194976807, "epoch": 0.0012358548354163756, "grad_norm": 2.078125, "learning_rate": 5.7e-05, "loss": 8.2215, "mean_token_accuracy": 0.07951191291213036, "num_tokens": 260638.0, "step": 115 }, { "entropy": 9.790133190155029, "epoch": 0.0012895876543475224, "grad_norm": 1.7109375, "learning_rate": 5.9499999999999996e-05, "loss": 8.0775, "mean_token_accuracy": 0.0801257323473692, "num_tokens": 272223.0, "step": 120 }, { "entropy": 9.634031391143798, "epoch": 0.0013433204732786691, "grad_norm": 1.890625, "learning_rate": 6.2e-05, "loss": 7.8657, "mean_token_accuracy": 0.09108843877911568, "num_tokens": 282883.0, "step": 125 }, { "entropy": 9.479462718963623, "epoch": 0.001397053292209816, "grad_norm": 1.6171875, "learning_rate": 6.450000000000001e-05, "loss": 7.8083, "mean_token_accuracy": 0.08633529022336006, "num_tokens": 293318.0, "step": 130 }, { "entropy": 9.311678791046143, "epoch": 0.0014507861111409627, "grad_norm": 1.7578125, "learning_rate": 6.7e-05, "loss": 7.6502, "mean_token_accuracy": 0.08342773504555226, "num_tokens": 303563.0, "step": 135 }, { "entropy": 9.093393898010254, "epoch": 0.0015045189300721094, "grad_norm": 1.671875, "learning_rate": 6.950000000000001e-05, "loss": 7.5358, "mean_token_accuracy": 0.09152235686779023, "num_tokens": 313968.0, "step": 140 }, { "entropy": 8.970313549041748, "epoch": 0.0015582517490032562, "grad_norm": 1.4765625, "learning_rate": 7.2e-05, "loss": 7.5692, "mean_token_accuracy": 0.08849354460835457, "num_tokens": 325261.0, "step": 145 }, { "entropy": 8.724966049194336, "epoch": 0.001611984567934403, "grad_norm": 1.5078125, "learning_rate": 7.45e-05, "loss": 7.3732, "mean_token_accuracy": 0.09316953867673874, "num_tokens": 335803.0, "step": 150 }, { "entropy": 8.553716468811036, "epoch": 0.0016657173868655497, "grad_norm": 1.375, "learning_rate": 7.7e-05, "loss": 7.2783, "mean_token_accuracy": 0.08820799067616462, "num_tokens": 346582.0, "step": 155 }, { "entropy": 8.43663501739502, "epoch": 0.0017194502057966965, "grad_norm": 1.4765625, "learning_rate": 7.950000000000001e-05, "loss": 7.3562, "mean_token_accuracy": 0.09117907658219337, "num_tokens": 357779.0, "step": 160 }, { "entropy": 8.219385528564453, "epoch": 0.0017731830247278433, "grad_norm": 1.4140625, "learning_rate": 8.2e-05, "loss": 7.2185, "mean_token_accuracy": 0.09431424736976624, "num_tokens": 369191.0, "step": 165 }, { "entropy": 8.094470024108887, "epoch": 0.00182691584365899, "grad_norm": 1.3984375, "learning_rate": 8.450000000000001e-05, "loss": 7.2579, "mean_token_accuracy": 0.09085006713867187, "num_tokens": 381374.0, "step": 170 }, { "entropy": 8.00999412536621, "epoch": 0.0018806486625901368, "grad_norm": 1.328125, "learning_rate": 8.7e-05, "loss": 7.2359, "mean_token_accuracy": 0.09357822686433792, "num_tokens": 392152.0, "step": 175 }, { "entropy": 7.9514116764068605, "epoch": 0.0019343814815212836, "grad_norm": 1.484375, "learning_rate": 8.95e-05, "loss": 7.2057, "mean_token_accuracy": 0.09208550006151199, "num_tokens": 404121.0, "step": 180 }, { "entropy": 7.96669111251831, "epoch": 0.0019881143004524303, "grad_norm": 1.609375, "learning_rate": 9.2e-05, "loss": 7.2056, "mean_token_accuracy": 0.0923257291316986, "num_tokens": 416144.0, "step": 185 }, { "entropy": 7.824949645996094, "epoch": 0.002041847119383577, "grad_norm": 1.8359375, "learning_rate": 9.45e-05, "loss": 7.0888, "mean_token_accuracy": 0.09763017818331718, "num_tokens": 427141.0, "step": 190 }, { "entropy": 7.715742874145508, "epoch": 0.002095579938314724, "grad_norm": 1.3984375, "learning_rate": 9.7e-05, "loss": 7.0035, "mean_token_accuracy": 0.0935081422328949, "num_tokens": 439113.0, "step": 195 }, { "entropy": 7.7036233901977536, "epoch": 0.0021493127572458706, "grad_norm": 1.28125, "learning_rate": 9.95e-05, "loss": 7.0734, "mean_token_accuracy": 0.09741963669657708, "num_tokens": 450595.0, "step": 200 }, { "entropy": 7.739162731170654, "epoch": 0.0022030455761770174, "grad_norm": 1.3671875, "learning_rate": 0.000102, "loss": 7.1579, "mean_token_accuracy": 0.09232115969061852, "num_tokens": 462811.0, "step": 205 }, { "entropy": 7.705861139297485, "epoch": 0.002256778395108164, "grad_norm": 1.5234375, "learning_rate": 0.00010449999999999999, "loss": 7.1276, "mean_token_accuracy": 0.09830137938261033, "num_tokens": 473629.0, "step": 210 }, { "entropy": 7.643820524215698, "epoch": 0.002310511214039311, "grad_norm": 1.3671875, "learning_rate": 0.000107, "loss": 7.1024, "mean_token_accuracy": 0.0988999992609024, "num_tokens": 484731.0, "step": 215 }, { "entropy": 7.66978874206543, "epoch": 0.0023642440329704577, "grad_norm": 1.3359375, "learning_rate": 0.0001095, "loss": 7.0548, "mean_token_accuracy": 0.09935099259018898, "num_tokens": 496309.0, "step": 220 }, { "entropy": 7.658147382736206, "epoch": 0.0024179768519016044, "grad_norm": 1.171875, "learning_rate": 0.000112, "loss": 7.0923, "mean_token_accuracy": 0.1015954852104187, "num_tokens": 508715.0, "step": 225 }, { "entropy": 7.41760745048523, "epoch": 0.002471709670832751, "grad_norm": 1.203125, "learning_rate": 0.0001145, "loss": 6.9405, "mean_token_accuracy": 0.1079390250146389, "num_tokens": 519791.0, "step": 230 }, { "entropy": 7.54394679069519, "epoch": 0.002525442489763898, "grad_norm": 1.4921875, "learning_rate": 0.00011700000000000001, "loss": 7.083, "mean_token_accuracy": 0.09995704516768456, "num_tokens": 531897.0, "step": 235 }, { "entropy": 7.555436658859253, "epoch": 0.0025791753086950447, "grad_norm": 1.4375, "learning_rate": 0.00011949999999999999, "loss": 7.0798, "mean_token_accuracy": 0.09950428679585457, "num_tokens": 543243.0, "step": 240 }, { "entropy": 7.442711400985718, "epoch": 0.0026329081276261915, "grad_norm": 1.1953125, "learning_rate": 0.000122, "loss": 6.9189, "mean_token_accuracy": 0.10362667217850685, "num_tokens": 554139.0, "step": 245 }, { "entropy": 7.480173254013062, "epoch": 0.0026866409465573383, "grad_norm": 1.5546875, "learning_rate": 0.0001245, "loss": 6.9273, "mean_token_accuracy": 0.10886659622192382, "num_tokens": 565378.0, "step": 250 }, { "entropy": 7.426122951507568, "epoch": 0.002740373765488485, "grad_norm": 1.3515625, "learning_rate": 0.000127, "loss": 6.881, "mean_token_accuracy": 0.10440984815359115, "num_tokens": 576628.0, "step": 255 }, { "entropy": 7.444299507141113, "epoch": 0.002794106584419632, "grad_norm": 1.2421875, "learning_rate": 0.0001295, "loss": 7.0019, "mean_token_accuracy": 0.09789407551288605, "num_tokens": 588760.0, "step": 260 }, { "entropy": 7.4239896774292, "epoch": 0.0028478394033507786, "grad_norm": 1.75, "learning_rate": 0.000132, "loss": 6.9158, "mean_token_accuracy": 0.10981944426894188, "num_tokens": 600024.0, "step": 265 }, { "entropy": 7.270383596420288, "epoch": 0.0029015722222819253, "grad_norm": 1.3359375, "learning_rate": 0.00013450000000000002, "loss": 6.8775, "mean_token_accuracy": 0.10582949295639991, "num_tokens": 613150.0, "step": 270 }, { "entropy": 7.346567535400391, "epoch": 0.002955305041213072, "grad_norm": 1.1328125, "learning_rate": 0.00013700000000000002, "loss": 6.8547, "mean_token_accuracy": 0.10970969945192337, "num_tokens": 624762.0, "step": 275 }, { "entropy": 7.417334127426147, "epoch": 0.003009037860144219, "grad_norm": 1.3359375, "learning_rate": 0.0001395, "loss": 6.892, "mean_token_accuracy": 0.10366739556193352, "num_tokens": 635761.0, "step": 280 }, { "entropy": 7.223995733261108, "epoch": 0.0030627706790753656, "grad_norm": 1.2421875, "learning_rate": 0.00014199999999999998, "loss": 6.8555, "mean_token_accuracy": 0.10360193029046058, "num_tokens": 647882.0, "step": 285 }, { "entropy": 7.312860345840454, "epoch": 0.0031165034980065124, "grad_norm": 1.140625, "learning_rate": 0.0001445, "loss": 6.8848, "mean_token_accuracy": 0.1077139988541603, "num_tokens": 659749.0, "step": 290 }, { "entropy": 7.270877933502197, "epoch": 0.003170236316937659, "grad_norm": 1.3203125, "learning_rate": 0.000147, "loss": 6.8362, "mean_token_accuracy": 0.10846684277057647, "num_tokens": 672002.0, "step": 295 }, { "entropy": 7.204770469665528, "epoch": 0.003223969135868806, "grad_norm": 1.4375, "learning_rate": 0.0001495, "loss": 6.7952, "mean_token_accuracy": 0.11234059333801269, "num_tokens": 682312.0, "step": 300 }, { "entropy": 7.183935689926147, "epoch": 0.0032777019547999527, "grad_norm": 1.3828125, "learning_rate": 0.000152, "loss": 6.8246, "mean_token_accuracy": 0.10333632677793503, "num_tokens": 692188.0, "step": 305 }, { "entropy": 7.269667243957519, "epoch": 0.0033314347737310995, "grad_norm": 1.28125, "learning_rate": 0.00015450000000000001, "loss": 6.7992, "mean_token_accuracy": 0.10754085555672646, "num_tokens": 703789.0, "step": 310 }, { "entropy": 7.259969711303711, "epoch": 0.0033851675926622462, "grad_norm": 1.3359375, "learning_rate": 0.000157, "loss": 6.8807, "mean_token_accuracy": 0.11048192977905273, "num_tokens": 714752.0, "step": 315 }, { "entropy": 7.137263011932373, "epoch": 0.003438900411593393, "grad_norm": 1.1875, "learning_rate": 0.0001595, "loss": 6.8206, "mean_token_accuracy": 0.11233628690242767, "num_tokens": 726716.0, "step": 320 }, { "entropy": 7.213597440719605, "epoch": 0.0034926332305245398, "grad_norm": 1.1640625, "learning_rate": 0.000162, "loss": 6.8401, "mean_token_accuracy": 0.11278397589921951, "num_tokens": 737267.0, "step": 325 }, { "entropy": 7.222741270065308, "epoch": 0.0035463660494556865, "grad_norm": 1.3828125, "learning_rate": 0.00016450000000000001, "loss": 6.8783, "mean_token_accuracy": 0.10917454287409782, "num_tokens": 750180.0, "step": 330 }, { "entropy": 7.1152294158935545, "epoch": 0.0036000988683868333, "grad_norm": 1.203125, "learning_rate": 0.00016700000000000002, "loss": 6.6925, "mean_token_accuracy": 0.11422673463821412, "num_tokens": 761337.0, "step": 335 }, { "entropy": 7.07347264289856, "epoch": 0.00365383168731798, "grad_norm": 1.3515625, "learning_rate": 0.00016950000000000003, "loss": 6.6614, "mean_token_accuracy": 0.1183428131043911, "num_tokens": 771379.0, "step": 340 }, { "entropy": 7.18135552406311, "epoch": 0.003707564506249127, "grad_norm": 1.203125, "learning_rate": 0.00017199999999999998, "loss": 6.7586, "mean_token_accuracy": 0.11464423760771751, "num_tokens": 782508.0, "step": 345 }, { "entropy": 7.083883142471313, "epoch": 0.0037612973251802736, "grad_norm": 1.2890625, "learning_rate": 0.00017449999999999999, "loss": 6.766, "mean_token_accuracy": 0.1096316896378994, "num_tokens": 795541.0, "step": 350 }, { "entropy": 7.03632378578186, "epoch": 0.0038150301441114204, "grad_norm": 1.1640625, "learning_rate": 0.000177, "loss": 6.7017, "mean_token_accuracy": 0.11446580439805984, "num_tokens": 805665.0, "step": 355 }, { "entropy": 7.182166957855225, "epoch": 0.003868762963042567, "grad_norm": 1.2421875, "learning_rate": 0.0001795, "loss": 6.8425, "mean_token_accuracy": 0.11153884828090668, "num_tokens": 817393.0, "step": 360 }, { "entropy": 7.163691473007202, "epoch": 0.003922495781973714, "grad_norm": 1.2578125, "learning_rate": 0.000182, "loss": 6.7986, "mean_token_accuracy": 0.10896589532494545, "num_tokens": 828436.0, "step": 365 }, { "entropy": 7.033854150772095, "epoch": 0.003976228600904861, "grad_norm": 1.2578125, "learning_rate": 0.0001845, "loss": 6.653, "mean_token_accuracy": 0.11405793353915214, "num_tokens": 839223.0, "step": 370 }, { "entropy": 7.135569000244141, "epoch": 0.004029961419836007, "grad_norm": 1.359375, "learning_rate": 0.000187, "loss": 6.6199, "mean_token_accuracy": 0.12831516563892365, "num_tokens": 848953.0, "step": 375 }, { "entropy": 6.988350915908813, "epoch": 0.004083694238767154, "grad_norm": 1.3984375, "learning_rate": 0.0001895, "loss": 6.7725, "mean_token_accuracy": 0.10901687815785407, "num_tokens": 860349.0, "step": 380 }, { "entropy": 7.042834091186523, "epoch": 0.004137427057698301, "grad_norm": 1.15625, "learning_rate": 0.000192, "loss": 6.6875, "mean_token_accuracy": 0.11479247137904167, "num_tokens": 870993.0, "step": 385 }, { "entropy": 7.062792253494263, "epoch": 0.004191159876629448, "grad_norm": 1.34375, "learning_rate": 0.0001945, "loss": 6.7484, "mean_token_accuracy": 0.11023281887173653, "num_tokens": 880950.0, "step": 390 }, { "entropy": 7.0711596488952635, "epoch": 0.0042448926955605945, "grad_norm": 1.3671875, "learning_rate": 0.00019700000000000002, "loss": 6.7458, "mean_token_accuracy": 0.11763814464211464, "num_tokens": 892583.0, "step": 395 }, { "entropy": 6.909264755249024, "epoch": 0.004298625514491741, "grad_norm": 1.3515625, "learning_rate": 0.00019950000000000002, "loss": 6.5686, "mean_token_accuracy": 0.12108325287699699, "num_tokens": 902191.0, "step": 400 }, { "entropy": 6.913547658920288, "epoch": 0.004352358333422888, "grad_norm": 1.28125, "learning_rate": 0.000202, "loss": 6.6222, "mean_token_accuracy": 0.11458350345492363, "num_tokens": 914274.0, "step": 405 }, { "entropy": 6.911238813400269, "epoch": 0.004406091152354035, "grad_norm": 1.1875, "learning_rate": 0.00020449999999999998, "loss": 6.5556, "mean_token_accuracy": 0.11596038416028023, "num_tokens": 925253.0, "step": 410 }, { "entropy": 7.00830454826355, "epoch": 0.0044598239712851815, "grad_norm": 1.25, "learning_rate": 0.000207, "loss": 6.7087, "mean_token_accuracy": 0.11384080052375793, "num_tokens": 935520.0, "step": 415 }, { "entropy": 6.927305507659912, "epoch": 0.004513556790216328, "grad_norm": 1.171875, "learning_rate": 0.0002095, "loss": 6.6906, "mean_token_accuracy": 0.11692763790488243, "num_tokens": 947817.0, "step": 420 }, { "entropy": 6.889912366867065, "epoch": 0.004567289609147475, "grad_norm": 1.1171875, "learning_rate": 0.000212, "loss": 6.6066, "mean_token_accuracy": 0.11778534352779388, "num_tokens": 959474.0, "step": 425 }, { "entropy": 6.939700126647949, "epoch": 0.004621022428078622, "grad_norm": 1.1875, "learning_rate": 0.0002145, "loss": 6.5916, "mean_token_accuracy": 0.11906479597091675, "num_tokens": 971271.0, "step": 430 }, { "entropy": 6.882960844039917, "epoch": 0.004674755247009769, "grad_norm": 1.140625, "learning_rate": 0.00021700000000000002, "loss": 6.612, "mean_token_accuracy": 0.12181256487965583, "num_tokens": 981995.0, "step": 435 }, { "entropy": 6.9154595851898195, "epoch": 0.004728488065940915, "grad_norm": 1.1640625, "learning_rate": 0.0002195, "loss": 6.6914, "mean_token_accuracy": 0.11828593611717224, "num_tokens": 994346.0, "step": 440 }, { "entropy": 6.966398048400879, "epoch": 0.004782220884872062, "grad_norm": 1.140625, "learning_rate": 0.000222, "loss": 6.6802, "mean_token_accuracy": 0.1137112945318222, "num_tokens": 1005552.0, "step": 445 }, { "entropy": 6.843932342529297, "epoch": 0.004835953703803209, "grad_norm": 1.1796875, "learning_rate": 0.0002245, "loss": 6.6247, "mean_token_accuracy": 0.11204231306910514, "num_tokens": 1017202.0, "step": 450 }, { "entropy": 6.807126045227051, "epoch": 0.004889686522734356, "grad_norm": 1.1875, "learning_rate": 0.00022700000000000002, "loss": 6.5839, "mean_token_accuracy": 0.12199563458561898, "num_tokens": 1027450.0, "step": 455 }, { "entropy": 6.89690580368042, "epoch": 0.004943419341665502, "grad_norm": 1.28125, "learning_rate": 0.00022950000000000002, "loss": 6.5637, "mean_token_accuracy": 0.11613315865397453, "num_tokens": 1038990.0, "step": 460 }, { "entropy": 6.806377410888672, "epoch": 0.004997152160596649, "grad_norm": 1.1875, "learning_rate": 0.00023200000000000003, "loss": 6.5786, "mean_token_accuracy": 0.11820394694805145, "num_tokens": 1050643.0, "step": 465 }, { "entropy": 6.754554319381714, "epoch": 0.005050884979527796, "grad_norm": 1.2109375, "learning_rate": 0.00023449999999999998, "loss": 6.5004, "mean_token_accuracy": 0.12497379332780838, "num_tokens": 1061182.0, "step": 470 }, { "entropy": 6.9261133670806885, "epoch": 0.005104617798458943, "grad_norm": 1.0703125, "learning_rate": 0.000237, "loss": 6.6711, "mean_token_accuracy": 0.11877285093069076, "num_tokens": 1073074.0, "step": 475 }, { "entropy": 6.839569091796875, "epoch": 0.0051583506173900895, "grad_norm": 1.0390625, "learning_rate": 0.0002395, "loss": 6.6933, "mean_token_accuracy": 0.1182055912911892, "num_tokens": 1085061.0, "step": 480 }, { "entropy": 6.822368907928467, "epoch": 0.005212083436321236, "grad_norm": 1.15625, "learning_rate": 0.000242, "loss": 6.5495, "mean_token_accuracy": 0.11974000334739685, "num_tokens": 1096148.0, "step": 485 }, { "entropy": 6.738174152374268, "epoch": 0.005265816255252383, "grad_norm": 1.2421875, "learning_rate": 0.0002445, "loss": 6.4834, "mean_token_accuracy": 0.12004421576857567, "num_tokens": 1106159.0, "step": 490 }, { "entropy": 6.8385029315948485, "epoch": 0.00531954907418353, "grad_norm": 1.2421875, "learning_rate": 0.000247, "loss": 6.6323, "mean_token_accuracy": 0.12007313966751099, "num_tokens": 1117159.0, "step": 495 }, { "entropy": 6.834402704238892, "epoch": 0.0053732818931146765, "grad_norm": 1.1015625, "learning_rate": 0.0002495, "loss": 6.5295, "mean_token_accuracy": 0.12340744212269783, "num_tokens": 1129633.0, "step": 500 }, { "entropy": 6.888376379013062, "epoch": 0.005427014712045823, "grad_norm": 1.2578125, "learning_rate": 0.000252, "loss": 6.7195, "mean_token_accuracy": 0.12026305049657822, "num_tokens": 1140814.0, "step": 505 }, { "entropy": 6.8587806701660154, "epoch": 0.00548074753097697, "grad_norm": 1.2109375, "learning_rate": 0.0002545, "loss": 6.6052, "mean_token_accuracy": 0.12095662355422973, "num_tokens": 1152963.0, "step": 510 }, { "entropy": 6.571197032928467, "epoch": 0.005534480349908117, "grad_norm": 1.15625, "learning_rate": 0.000257, "loss": 6.4367, "mean_token_accuracy": 0.1233276754617691, "num_tokens": 1165092.0, "step": 515 }, { "entropy": 6.769173955917358, "epoch": 0.005588213168839264, "grad_norm": 1.1171875, "learning_rate": 0.0002595, "loss": 6.5331, "mean_token_accuracy": 0.1194583684206009, "num_tokens": 1177403.0, "step": 520 }, { "entropy": 6.709192943572998, "epoch": 0.00564194598777041, "grad_norm": 1.2890625, "learning_rate": 0.000262, "loss": 6.5345, "mean_token_accuracy": 0.11615289524197578, "num_tokens": 1187436.0, "step": 525 }, { "entropy": 6.793780326843262, "epoch": 0.005695678806701557, "grad_norm": 1.1796875, "learning_rate": 0.00026450000000000003, "loss": 6.6191, "mean_token_accuracy": 0.11863412484526634, "num_tokens": 1199906.0, "step": 530 }, { "entropy": 6.816549777984619, "epoch": 0.005749411625632704, "grad_norm": 1.2265625, "learning_rate": 0.00026700000000000004, "loss": 6.5816, "mean_token_accuracy": 0.1212506726384163, "num_tokens": 1211411.0, "step": 535 }, { "entropy": 6.711446523666382, "epoch": 0.005803144444563851, "grad_norm": 1.203125, "learning_rate": 0.00026950000000000005, "loss": 6.5452, "mean_token_accuracy": 0.12302517369389535, "num_tokens": 1223669.0, "step": 540 }, { "entropy": 6.627863168716431, "epoch": 0.0058568772634949974, "grad_norm": 1.03125, "learning_rate": 0.00027200000000000005, "loss": 6.4752, "mean_token_accuracy": 0.12178474590182305, "num_tokens": 1234931.0, "step": 545 }, { "entropy": 6.712806463241577, "epoch": 0.005910610082426144, "grad_norm": 1.171875, "learning_rate": 0.0002745, "loss": 6.4942, "mean_token_accuracy": 0.12170209959149361, "num_tokens": 1245731.0, "step": 550 }, { "entropy": 6.725653505325317, "epoch": 0.005964342901357291, "grad_norm": 1.109375, "learning_rate": 0.000277, "loss": 6.4796, "mean_token_accuracy": 0.12272765785455704, "num_tokens": 1257441.0, "step": 555 }, { "entropy": 6.729346084594726, "epoch": 0.006018075720288438, "grad_norm": 1.1953125, "learning_rate": 0.0002795, "loss": 6.5136, "mean_token_accuracy": 0.12274165153503418, "num_tokens": 1269169.0, "step": 560 }, { "entropy": 6.632570362091064, "epoch": 0.0060718085392195845, "grad_norm": 1.1484375, "learning_rate": 0.00028199999999999997, "loss": 6.4972, "mean_token_accuracy": 0.12501644492149352, "num_tokens": 1280636.0, "step": 565 }, { "entropy": 6.588498926162719, "epoch": 0.006125541358150731, "grad_norm": 1.1328125, "learning_rate": 0.0002845, "loss": 6.4233, "mean_token_accuracy": 0.1268314391374588, "num_tokens": 1292266.0, "step": 570 }, { "entropy": 6.6426673412323, "epoch": 0.006179274177081878, "grad_norm": 1.140625, "learning_rate": 0.000287, "loss": 6.5163, "mean_token_accuracy": 0.12650827020406724, "num_tokens": 1304090.0, "step": 575 }, { "entropy": 6.662691974639893, "epoch": 0.006233006996013025, "grad_norm": 1.265625, "learning_rate": 0.0002895, "loss": 6.5546, "mean_token_accuracy": 0.12577759027481078, "num_tokens": 1314758.0, "step": 580 }, { "entropy": 6.787952995300293, "epoch": 0.0062867398149441716, "grad_norm": 1.328125, "learning_rate": 0.000292, "loss": 6.528, "mean_token_accuracy": 0.1216070830821991, "num_tokens": 1326085.0, "step": 585 }, { "entropy": 6.702496099472046, "epoch": 0.006340472633875318, "grad_norm": 1.1875, "learning_rate": 0.0002945, "loss": 6.4632, "mean_token_accuracy": 0.12628382220864295, "num_tokens": 1336766.0, "step": 590 }, { "entropy": 6.507978296279907, "epoch": 0.006394205452806465, "grad_norm": 1.109375, "learning_rate": 0.000297, "loss": 6.384, "mean_token_accuracy": 0.12896264716982841, "num_tokens": 1346864.0, "step": 595 }, { "entropy": 6.745914697647095, "epoch": 0.006447938271737612, "grad_norm": 1.109375, "learning_rate": 0.0002995, "loss": 6.4981, "mean_token_accuracy": 0.1272559054195881, "num_tokens": 1357429.0, "step": 600 }, { "entropy": 6.573749780654907, "epoch": 0.006501671090668759, "grad_norm": 1.2109375, "learning_rate": 0.000302, "loss": 6.3802, "mean_token_accuracy": 0.12390858009457588, "num_tokens": 1367080.0, "step": 605 }, { "entropy": 6.646589183807373, "epoch": 0.006555403909599905, "grad_norm": 0.98046875, "learning_rate": 0.0003045, "loss": 6.5166, "mean_token_accuracy": 0.1198254756629467, "num_tokens": 1379104.0, "step": 610 }, { "entropy": 6.6281653881073, "epoch": 0.006609136728531052, "grad_norm": 1.0625, "learning_rate": 0.000307, "loss": 6.3401, "mean_token_accuracy": 0.1338522858917713, "num_tokens": 1390346.0, "step": 615 }, { "entropy": 6.481263113021851, "epoch": 0.006662869547462199, "grad_norm": 1.21875, "learning_rate": 0.0003095, "loss": 6.4714, "mean_token_accuracy": 0.12188125848770141, "num_tokens": 1401512.0, "step": 620 }, { "entropy": 6.5761816024780275, "epoch": 0.006716602366393346, "grad_norm": 1.1328125, "learning_rate": 0.000312, "loss": 6.4625, "mean_token_accuracy": 0.1254078231751919, "num_tokens": 1412410.0, "step": 625 }, { "entropy": 6.563577651977539, "epoch": 0.0067703351853244925, "grad_norm": 1.265625, "learning_rate": 0.0003145, "loss": 6.3567, "mean_token_accuracy": 0.12992686927318572, "num_tokens": 1424028.0, "step": 630 }, { "entropy": 6.653519344329834, "epoch": 0.006824068004255639, "grad_norm": 1.140625, "learning_rate": 0.000317, "loss": 6.5013, "mean_token_accuracy": 0.1232505589723587, "num_tokens": 1435275.0, "step": 635 }, { "entropy": 6.635418176651001, "epoch": 0.006877800823186786, "grad_norm": 0.97265625, "learning_rate": 0.0003195, "loss": 6.4836, "mean_token_accuracy": 0.1284290887415409, "num_tokens": 1447336.0, "step": 640 }, { "entropy": 6.5360087871551515, "epoch": 0.006931533642117933, "grad_norm": 1.09375, "learning_rate": 0.000322, "loss": 6.4281, "mean_token_accuracy": 0.12723628357052802, "num_tokens": 1459224.0, "step": 645 }, { "entropy": 6.741295862197876, "epoch": 0.0069852664610490795, "grad_norm": 1.078125, "learning_rate": 0.00032450000000000003, "loss": 6.5461, "mean_token_accuracy": 0.12568391785025596, "num_tokens": 1472077.0, "step": 650 }, { "entropy": 6.6534796237945555, "epoch": 0.007038999279980226, "grad_norm": 1.265625, "learning_rate": 0.00032700000000000003, "loss": 6.5163, "mean_token_accuracy": 0.12574814409017562, "num_tokens": 1484296.0, "step": 655 }, { "entropy": 6.606902265548706, "epoch": 0.007092732098911373, "grad_norm": 1.078125, "learning_rate": 0.00032950000000000004, "loss": 6.4744, "mean_token_accuracy": 0.12749515175819398, "num_tokens": 1495723.0, "step": 660 }, { "entropy": 6.517670679092407, "epoch": 0.00714646491784252, "grad_norm": 1.1875, "learning_rate": 0.00033200000000000005, "loss": 6.3645, "mean_token_accuracy": 0.13283996507525445, "num_tokens": 1506610.0, "step": 665 }, { "entropy": 6.611458110809326, "epoch": 0.007200197736773667, "grad_norm": 1.1875, "learning_rate": 0.00033450000000000005, "loss": 6.4832, "mean_token_accuracy": 0.1267407178878784, "num_tokens": 1519216.0, "step": 670 }, { "entropy": 6.491586589813233, "epoch": 0.007253930555704813, "grad_norm": 1.21875, "learning_rate": 0.000337, "loss": 6.446, "mean_token_accuracy": 0.12697500586509705, "num_tokens": 1529925.0, "step": 675 }, { "entropy": 6.59675145149231, "epoch": 0.00730766337463596, "grad_norm": 1.0625, "learning_rate": 0.0003395, "loss": 6.4008, "mean_token_accuracy": 0.1306189052760601, "num_tokens": 1541329.0, "step": 680 }, { "entropy": 6.4607322216033936, "epoch": 0.007361396193567107, "grad_norm": 1.1875, "learning_rate": 0.000342, "loss": 6.4265, "mean_token_accuracy": 0.12382375597953796, "num_tokens": 1552716.0, "step": 685 }, { "entropy": 6.526829433441162, "epoch": 0.007415129012498254, "grad_norm": 1.1796875, "learning_rate": 0.00034449999999999997, "loss": 6.3576, "mean_token_accuracy": 0.12638328224420547, "num_tokens": 1563170.0, "step": 690 }, { "entropy": 6.584331369400024, "epoch": 0.0074688618314294, "grad_norm": 1.1328125, "learning_rate": 0.000347, "loss": 6.5071, "mean_token_accuracy": 0.13071208000183104, "num_tokens": 1574431.0, "step": 695 }, { "entropy": 6.633341598510742, "epoch": 0.007522594650360547, "grad_norm": 1.015625, "learning_rate": 0.0003495, "loss": 6.4628, "mean_token_accuracy": 0.12467131316661835, "num_tokens": 1586173.0, "step": 700 }, { "entropy": 6.478550148010254, "epoch": 0.007576327469291694, "grad_norm": 1.2578125, "learning_rate": 0.000352, "loss": 6.4009, "mean_token_accuracy": 0.12992049753665924, "num_tokens": 1596809.0, "step": 705 }, { "entropy": 6.555624914169312, "epoch": 0.007630060288222841, "grad_norm": 1.0625, "learning_rate": 0.0003545, "loss": 6.3558, "mean_token_accuracy": 0.12971629872918128, "num_tokens": 1608033.0, "step": 710 }, { "entropy": 6.477349472045899, "epoch": 0.0076837931071539875, "grad_norm": 1.203125, "learning_rate": 0.000357, "loss": 6.4094, "mean_token_accuracy": 0.1303440511226654, "num_tokens": 1619135.0, "step": 715 }, { "entropy": 6.490011358261109, "epoch": 0.007737525926085134, "grad_norm": 1.140625, "learning_rate": 0.0003595, "loss": 6.4472, "mean_token_accuracy": 0.1352962836623192, "num_tokens": 1630162.0, "step": 720 }, { "entropy": 6.639921855926514, "epoch": 0.007791258745016281, "grad_norm": 1.0390625, "learning_rate": 0.000362, "loss": 6.4996, "mean_token_accuracy": 0.12582269459962844, "num_tokens": 1641439.0, "step": 725 }, { "entropy": 6.511112117767334, "epoch": 0.007844991563947428, "grad_norm": 1.109375, "learning_rate": 0.0003645, "loss": 6.4003, "mean_token_accuracy": 0.12877567633986473, "num_tokens": 1653615.0, "step": 730 }, { "entropy": 6.463456630706787, "epoch": 0.007898724382878575, "grad_norm": 1.15625, "learning_rate": 0.000367, "loss": 6.2878, "mean_token_accuracy": 0.1366309866309166, "num_tokens": 1663262.0, "step": 735 }, { "entropy": 6.641633558273315, "epoch": 0.007952457201809721, "grad_norm": 0.96875, "learning_rate": 0.0003695, "loss": 6.5463, "mean_token_accuracy": 0.11863012239336967, "num_tokens": 1676012.0, "step": 740 }, { "entropy": 6.5580424785614015, "epoch": 0.008006190020740869, "grad_norm": 1.1640625, "learning_rate": 0.000372, "loss": 6.4331, "mean_token_accuracy": 0.1215569481253624, "num_tokens": 1688145.0, "step": 745 }, { "entropy": 6.420039892196655, "epoch": 0.008059922839672015, "grad_norm": 1.1953125, "learning_rate": 0.0003745, "loss": 6.3624, "mean_token_accuracy": 0.13154705688357354, "num_tokens": 1698710.0, "step": 750 }, { "entropy": 6.487041378021241, "epoch": 0.008113655658603162, "grad_norm": 1.140625, "learning_rate": 0.000377, "loss": 6.3722, "mean_token_accuracy": 0.13104054182767869, "num_tokens": 1710956.0, "step": 755 }, { "entropy": 6.517988061904907, "epoch": 0.008167388477534308, "grad_norm": 0.9921875, "learning_rate": 0.0003795, "loss": 6.4403, "mean_token_accuracy": 0.1294276535511017, "num_tokens": 1722915.0, "step": 760 }, { "entropy": 6.449849367141724, "epoch": 0.008221121296465456, "grad_norm": 1.1796875, "learning_rate": 0.000382, "loss": 6.3422, "mean_token_accuracy": 0.1337424710392952, "num_tokens": 1734474.0, "step": 765 }, { "entropy": 6.4679615020751955, "epoch": 0.008274854115396602, "grad_norm": 0.89453125, "learning_rate": 0.0003845, "loss": 6.4661, "mean_token_accuracy": 0.1281263567507267, "num_tokens": 1747871.0, "step": 770 }, { "entropy": 6.52447919845581, "epoch": 0.00832858693432775, "grad_norm": 1.09375, "learning_rate": 0.00038700000000000003, "loss": 6.3677, "mean_token_accuracy": 0.13014960363507272, "num_tokens": 1759368.0, "step": 775 }, { "entropy": 6.4473429203033445, "epoch": 0.008382319753258895, "grad_norm": 1.1484375, "learning_rate": 0.00038950000000000003, "loss": 6.3219, "mean_token_accuracy": 0.12805930003523827, "num_tokens": 1770077.0, "step": 780 }, { "entropy": 6.341373634338379, "epoch": 0.008436052572190043, "grad_norm": 1.203125, "learning_rate": 0.00039200000000000004, "loss": 6.3127, "mean_token_accuracy": 0.12711255848407746, "num_tokens": 1781866.0, "step": 785 }, { "entropy": 6.420151329040527, "epoch": 0.008489785391121189, "grad_norm": 1.0703125, "learning_rate": 0.00039450000000000005, "loss": 6.3181, "mean_token_accuracy": 0.12717027962207794, "num_tokens": 1792495.0, "step": 790 }, { "entropy": 6.4637500762939455, "epoch": 0.008543518210052337, "grad_norm": 1.125, "learning_rate": 0.00039700000000000005, "loss": 6.3178, "mean_token_accuracy": 0.134869834035635, "num_tokens": 1803615.0, "step": 795 }, { "entropy": 6.361494874954223, "epoch": 0.008597251028983482, "grad_norm": 1.046875, "learning_rate": 0.0003995, "loss": 6.3092, "mean_token_accuracy": 0.13040214627981186, "num_tokens": 1814302.0, "step": 800 }, { "entropy": 6.459384536743164, "epoch": 0.00865098384791463, "grad_norm": 0.9921875, "learning_rate": 0.000402, "loss": 6.3336, "mean_token_accuracy": 0.13680917099118234, "num_tokens": 1825883.0, "step": 805 }, { "entropy": 6.427951526641846, "epoch": 0.008704716666845776, "grad_norm": 1.078125, "learning_rate": 0.0004045, "loss": 6.4295, "mean_token_accuracy": 0.12659786641597748, "num_tokens": 1837863.0, "step": 810 }, { "entropy": 6.3974611282348635, "epoch": 0.008758449485776924, "grad_norm": 1.125, "learning_rate": 0.00040699999999999997, "loss": 6.3164, "mean_token_accuracy": 0.12896919026970863, "num_tokens": 1848566.0, "step": 815 }, { "entropy": 6.373238897323608, "epoch": 0.00881218230470807, "grad_norm": 1.2109375, "learning_rate": 0.0004095, "loss": 6.4152, "mean_token_accuracy": 0.13358617648482324, "num_tokens": 1862068.0, "step": 820 }, { "entropy": 6.488036108016968, "epoch": 0.008865915123639217, "grad_norm": 1.1953125, "learning_rate": 0.000412, "loss": 6.3945, "mean_token_accuracy": 0.13050863072276114, "num_tokens": 1873985.0, "step": 825 }, { "entropy": 6.3769128799438475, "epoch": 0.008919647942570363, "grad_norm": 1.09375, "learning_rate": 0.0004145, "loss": 6.3659, "mean_token_accuracy": 0.1300532825291157, "num_tokens": 1885805.0, "step": 830 }, { "entropy": 6.389228773117066, "epoch": 0.00897338076150151, "grad_norm": 1.1640625, "learning_rate": 0.000417, "loss": 6.3363, "mean_token_accuracy": 0.12887792587280272, "num_tokens": 1897520.0, "step": 835 }, { "entropy": 6.381129407882691, "epoch": 0.009027113580432657, "grad_norm": 1.078125, "learning_rate": 0.0004195, "loss": 6.3145, "mean_token_accuracy": 0.1281817726790905, "num_tokens": 1908645.0, "step": 840 }, { "entropy": 6.377236175537109, "epoch": 0.009080846399363804, "grad_norm": 1.03125, "learning_rate": 0.000422, "loss": 6.3134, "mean_token_accuracy": 0.13246509581804275, "num_tokens": 1919933.0, "step": 845 }, { "entropy": 6.407544898986816, "epoch": 0.00913457921829495, "grad_norm": 1.0546875, "learning_rate": 0.0004245, "loss": 6.3749, "mean_token_accuracy": 0.1343151532113552, "num_tokens": 1932150.0, "step": 850 }, { "entropy": 6.402065134048462, "epoch": 0.009188312037226098, "grad_norm": 1.1953125, "learning_rate": 0.000427, "loss": 6.3266, "mean_token_accuracy": 0.13442369997501374, "num_tokens": 1944379.0, "step": 855 }, { "entropy": 6.432179164886475, "epoch": 0.009242044856157244, "grad_norm": 0.96484375, "learning_rate": 0.0004295, "loss": 6.3316, "mean_token_accuracy": 0.1368368983268738, "num_tokens": 1956156.0, "step": 860 }, { "entropy": 6.499852514266967, "epoch": 0.009295777675088391, "grad_norm": 1.140625, "learning_rate": 0.000432, "loss": 6.4659, "mean_token_accuracy": 0.1252061903476715, "num_tokens": 1968585.0, "step": 865 }, { "entropy": 6.327846670150757, "epoch": 0.009349510494019537, "grad_norm": 1.078125, "learning_rate": 0.0004345, "loss": 6.3164, "mean_token_accuracy": 0.1293796181678772, "num_tokens": 1979627.0, "step": 870 }, { "entropy": 6.394920063018799, "epoch": 0.009403243312950685, "grad_norm": 1.0390625, "learning_rate": 0.000437, "loss": 6.3903, "mean_token_accuracy": 0.1291674293577671, "num_tokens": 1993368.0, "step": 875 }, { "entropy": 6.483371686935425, "epoch": 0.00945697613188183, "grad_norm": 1.0859375, "learning_rate": 0.0004395, "loss": 6.439, "mean_token_accuracy": 0.12856033444404602, "num_tokens": 2004334.0, "step": 880 }, { "entropy": 6.250707912445068, "epoch": 0.009510708950812978, "grad_norm": 1.171875, "learning_rate": 0.000442, "loss": 6.2372, "mean_token_accuracy": 0.1328311175107956, "num_tokens": 2015328.0, "step": 885 }, { "entropy": 6.345365381240844, "epoch": 0.009564441769744124, "grad_norm": 1.0390625, "learning_rate": 0.0004445, "loss": 6.3678, "mean_token_accuracy": 0.12939499244093894, "num_tokens": 2027341.0, "step": 890 }, { "entropy": 6.272373819351197, "epoch": 0.009618174588675272, "grad_norm": 1.140625, "learning_rate": 0.000447, "loss": 6.2033, "mean_token_accuracy": 0.1377152383327484, "num_tokens": 2036774.0, "step": 895 }, { "entropy": 6.438100528717041, "epoch": 0.009671907407606418, "grad_norm": 1.140625, "learning_rate": 0.00044950000000000003, "loss": 6.2639, "mean_token_accuracy": 0.1349859781563282, "num_tokens": 2047320.0, "step": 900 }, { "entropy": 6.199841403961182, "epoch": 0.009725640226537565, "grad_norm": 1.0859375, "learning_rate": 0.00045200000000000004, "loss": 6.2053, "mean_token_accuracy": 0.1357021301984787, "num_tokens": 2058336.0, "step": 905 }, { "entropy": 6.342473936080933, "epoch": 0.009779373045468711, "grad_norm": 1.015625, "learning_rate": 0.00045450000000000004, "loss": 6.259, "mean_token_accuracy": 0.13590859845280648, "num_tokens": 2069767.0, "step": 910 }, { "entropy": 6.282735824584961, "epoch": 0.009833105864399859, "grad_norm": 1.28125, "learning_rate": 0.00045700000000000005, "loss": 6.247, "mean_token_accuracy": 0.1364621177315712, "num_tokens": 2080018.0, "step": 915 }, { "entropy": 6.3263512134552, "epoch": 0.009886838683331005, "grad_norm": 1.1328125, "learning_rate": 0.00045950000000000006, "loss": 6.3181, "mean_token_accuracy": 0.1294290691614151, "num_tokens": 2091274.0, "step": 920 }, { "entropy": 6.404293727874756, "epoch": 0.009940571502262152, "grad_norm": 1.0078125, "learning_rate": 0.000462, "loss": 6.4552, "mean_token_accuracy": 0.12284724041819572, "num_tokens": 2104780.0, "step": 925 }, { "entropy": 6.404548597335816, "epoch": 0.009994304321193298, "grad_norm": 1.15625, "learning_rate": 0.0004645, "loss": 6.4497, "mean_token_accuracy": 0.12493002042174339, "num_tokens": 2118181.0, "step": 930 }, { "entropy": 6.420569181442261, "epoch": 0.010048037140124446, "grad_norm": 1.1875, "learning_rate": 0.000467, "loss": 6.3692, "mean_token_accuracy": 0.1358141668140888, "num_tokens": 2128371.0, "step": 935 }, { "entropy": 6.301304912567138, "epoch": 0.010101769959055592, "grad_norm": 1.1484375, "learning_rate": 0.0004695, "loss": 6.1927, "mean_token_accuracy": 0.13996189907193185, "num_tokens": 2140385.0, "step": 940 }, { "entropy": 6.357480192184449, "epoch": 0.01015550277798674, "grad_norm": 1.125, "learning_rate": 0.000472, "loss": 6.4256, "mean_token_accuracy": 0.12998471185564994, "num_tokens": 2151030.0, "step": 945 }, { "entropy": 6.157267808914185, "epoch": 0.010209235596917885, "grad_norm": 1.015625, "learning_rate": 0.0004745, "loss": 6.1555, "mean_token_accuracy": 0.13839885592460632, "num_tokens": 2162977.0, "step": 950 }, { "entropy": 6.45593671798706, "epoch": 0.010262968415849033, "grad_norm": 0.98046875, "learning_rate": 0.000477, "loss": 6.4188, "mean_token_accuracy": 0.12474074959754944, "num_tokens": 2175320.0, "step": 955 }, { "entropy": 6.31116042137146, "epoch": 0.010316701234780179, "grad_norm": 0.97265625, "learning_rate": 0.0004795, "loss": 6.2703, "mean_token_accuracy": 0.13561318814754486, "num_tokens": 2187401.0, "step": 960 }, { "entropy": 6.256970357894898, "epoch": 0.010370434053711327, "grad_norm": 1.1015625, "learning_rate": 0.000482, "loss": 6.273, "mean_token_accuracy": 0.13364465087652205, "num_tokens": 2198475.0, "step": 965 }, { "entropy": 6.364040231704712, "epoch": 0.010424166872642473, "grad_norm": 1.0625, "learning_rate": 0.0004845, "loss": 6.2953, "mean_token_accuracy": 0.1304472081363201, "num_tokens": 2209401.0, "step": 970 }, { "entropy": 6.179701614379883, "epoch": 0.01047789969157362, "grad_norm": 1.2109375, "learning_rate": 0.000487, "loss": 6.2209, "mean_token_accuracy": 0.135325139015913, "num_tokens": 2220687.0, "step": 975 }, { "entropy": 6.4695775508880615, "epoch": 0.010531632510504766, "grad_norm": 1.0625, "learning_rate": 0.0004895, "loss": 6.3947, "mean_token_accuracy": 0.13351753056049348, "num_tokens": 2232876.0, "step": 980 }, { "entropy": 6.207294893264771, "epoch": 0.010585365329435914, "grad_norm": 1.234375, "learning_rate": 0.000492, "loss": 6.1782, "mean_token_accuracy": 0.13681197613477708, "num_tokens": 2243683.0, "step": 985 }, { "entropy": 6.2024573802948, "epoch": 0.01063909814836706, "grad_norm": 0.984375, "learning_rate": 0.0004945, "loss": 6.2193, "mean_token_accuracy": 0.13724667727947235, "num_tokens": 2254919.0, "step": 990 }, { "entropy": 6.28679141998291, "epoch": 0.010692830967298207, "grad_norm": 1.03125, "learning_rate": 0.000497, "loss": 6.2558, "mean_token_accuracy": 0.13715462759137154, "num_tokens": 2267583.0, "step": 995 }, { "entropy": 6.299418592453003, "epoch": 0.010746563786229353, "grad_norm": 1.171875, "learning_rate": 0.0004995, "loss": 6.3302, "mean_token_accuracy": 0.13524263501167297, "num_tokens": 2279228.0, "step": 1000 }, { "entropy": 6.1662780284881595, "epoch": 0.0108002966051605, "grad_norm": 1.0, "learning_rate": 0.000499998026082006, "loss": 6.1837, "mean_token_accuracy": 0.142218117415905, "num_tokens": 2291213.0, "step": 1005 }, { "entropy": 6.279097414016723, "epoch": 0.010854029424091647, "grad_norm": 0.96875, "learning_rate": 0.0004999900070995136, "loss": 6.3601, "mean_token_accuracy": 0.13057726323604585, "num_tokens": 2304080.0, "step": 1010 }, { "entropy": 6.222244453430176, "epoch": 0.010907762243022794, "grad_norm": 1.09375, "learning_rate": 0.0004999758199023239, "loss": 6.1906, "mean_token_accuracy": 0.13947457447648048, "num_tokens": 2315266.0, "step": 1015 }, { "entropy": 6.173005819320679, "epoch": 0.01096149506195394, "grad_norm": 1.0625, "learning_rate": 0.0004999554648793858, "loss": 6.2185, "mean_token_accuracy": 0.13768133595585824, "num_tokens": 2327333.0, "step": 1020 }, { "entropy": 6.293088293075561, "epoch": 0.011015227880885088, "grad_norm": 1.046875, "learning_rate": 0.0004999289425887425, "loss": 6.2438, "mean_token_accuracy": 0.1401859149336815, "num_tokens": 2338356.0, "step": 1025 }, { "entropy": 6.11752758026123, "epoch": 0.011068960699816234, "grad_norm": 1.171875, "learning_rate": 0.0004998962537575161, "loss": 6.2381, "mean_token_accuracy": 0.1355143591761589, "num_tokens": 2348935.0, "step": 1030 }, { "entropy": 6.3127048969268795, "epoch": 0.011122693518747381, "grad_norm": 1.0078125, "learning_rate": 0.0004998573992818874, "loss": 6.1934, "mean_token_accuracy": 0.13663028106093406, "num_tokens": 2359588.0, "step": 1035 }, { "entropy": 6.140753889083863, "epoch": 0.011176426337678527, "grad_norm": 1.0, "learning_rate": 0.0004998123802270715, "loss": 6.1701, "mean_token_accuracy": 0.1450001023709774, "num_tokens": 2369463.0, "step": 1040 }, { "entropy": 6.160957622528076, "epoch": 0.011230159156609675, "grad_norm": 1.0078125, "learning_rate": 0.0004997611978272886, "loss": 6.1656, "mean_token_accuracy": 0.1414645403623581, "num_tokens": 2381900.0, "step": 1045 }, { "entropy": 6.255343818664551, "epoch": 0.01128389197554082, "grad_norm": 0.9453125, "learning_rate": 0.0004997038534857298, "loss": 6.1495, "mean_token_accuracy": 0.14251192957162856, "num_tokens": 2393709.0, "step": 1050 }, { "entropy": 6.2668678760528564, "epoch": 0.011337624794471968, "grad_norm": 1.046875, "learning_rate": 0.0004996403487745194, "loss": 6.3363, "mean_token_accuracy": 0.13923534750938416, "num_tokens": 2405084.0, "step": 1055 }, { "entropy": 6.220151090621949, "epoch": 0.011391357613403114, "grad_norm": 0.984375, "learning_rate": 0.000499570685434671, "loss": 6.2392, "mean_token_accuracy": 0.14038070291280746, "num_tokens": 2416174.0, "step": 1060 }, { "entropy": 6.183935499191284, "epoch": 0.011445090432334262, "grad_norm": 1.1328125, "learning_rate": 0.0004994948653760405, "loss": 6.252, "mean_token_accuracy": 0.13655493929982185, "num_tokens": 2427222.0, "step": 1065 }, { "entropy": 6.224246263504028, "epoch": 0.011498823251265408, "grad_norm": 1.0234375, "learning_rate": 0.0004994128906772729, "loss": 6.1835, "mean_token_accuracy": 0.14006806984543801, "num_tokens": 2437796.0, "step": 1070 }, { "entropy": 6.186404895782471, "epoch": 0.011552556070196555, "grad_norm": 1.0625, "learning_rate": 0.000499324763585746, "loss": 6.2269, "mean_token_accuracy": 0.13990388736128806, "num_tokens": 2449065.0, "step": 1075 }, { "entropy": 6.23367486000061, "epoch": 0.011606288889127701, "grad_norm": 1.0, "learning_rate": 0.0004992304865175085, "loss": 6.2503, "mean_token_accuracy": 0.14235268533229828, "num_tokens": 2460652.0, "step": 1080 }, { "entropy": 6.209626150131226, "epoch": 0.011660021708058849, "grad_norm": 1.0859375, "learning_rate": 0.0004991300620572138, "loss": 6.1733, "mean_token_accuracy": 0.14472328796982764, "num_tokens": 2472364.0, "step": 1085 }, { "entropy": 6.277301216125489, "epoch": 0.011713754526989995, "grad_norm": 0.93359375, "learning_rate": 0.0004990234929580494, "loss": 6.3776, "mean_token_accuracy": 0.1335189960896969, "num_tokens": 2485395.0, "step": 1090 }, { "entropy": 6.2589233875274655, "epoch": 0.011767487345921143, "grad_norm": 1.0078125, "learning_rate": 0.0004989107821416609, "loss": 6.2798, "mean_token_accuracy": 0.13312781751155853, "num_tokens": 2498081.0, "step": 1095 }, { "entropy": 6.0594724178314205, "epoch": 0.011821220164852288, "grad_norm": 1.125, "learning_rate": 0.0004987919326980723, "loss": 6.1041, "mean_token_accuracy": 0.13819077759981155, "num_tokens": 2508453.0, "step": 1100 }, { "entropy": 6.371691083908081, "epoch": 0.011874952983783436, "grad_norm": 1.0546875, "learning_rate": 0.0004986669478856011, "loss": 6.3297, "mean_token_accuracy": 0.13026287406682968, "num_tokens": 2520474.0, "step": 1105 }, { "entropy": 6.189488077163697, "epoch": 0.011928685802714582, "grad_norm": 0.98828125, "learning_rate": 0.0004985358311307688, "loss": 6.1501, "mean_token_accuracy": 0.1381780758500099, "num_tokens": 2531809.0, "step": 1110 }, { "entropy": 6.207001543045044, "epoch": 0.01198241862164573, "grad_norm": 1.078125, "learning_rate": 0.0004983985860282081, "loss": 6.2354, "mean_token_accuracy": 0.1409098967909813, "num_tokens": 2542561.0, "step": 1115 }, { "entropy": 6.184149646759034, "epoch": 0.012036151440576875, "grad_norm": 1.09375, "learning_rate": 0.0004982552163405623, "loss": 6.1751, "mean_token_accuracy": 0.13992175906896592, "num_tokens": 2554386.0, "step": 1120 }, { "entropy": 6.211317443847657, "epoch": 0.012089884259508023, "grad_norm": 0.9453125, "learning_rate": 0.0004981057259983839, "loss": 6.268, "mean_token_accuracy": 0.13457310497760772, "num_tokens": 2565765.0, "step": 1125 }, { "entropy": 6.274694538116455, "epoch": 0.012143617078439169, "grad_norm": 1.0078125, "learning_rate": 0.0004979501191000262, "loss": 6.337, "mean_token_accuracy": 0.12759412080049515, "num_tokens": 2577496.0, "step": 1130 }, { "entropy": 6.245618629455566, "epoch": 0.012197349897370317, "grad_norm": 1.125, "learning_rate": 0.0004977883999115311, "loss": 6.2108, "mean_token_accuracy": 0.1421503022313118, "num_tokens": 2588301.0, "step": 1135 }, { "entropy": 6.185357093811035, "epoch": 0.012251082716301463, "grad_norm": 1.03125, "learning_rate": 0.0004976205728665113, "loss": 6.26, "mean_token_accuracy": 0.13766290843486786, "num_tokens": 2599201.0, "step": 1140 }, { "entropy": 6.220892143249512, "epoch": 0.01230481553523261, "grad_norm": 1.015625, "learning_rate": 0.0004974466425660307, "loss": 6.1683, "mean_token_accuracy": 0.13754888027906417, "num_tokens": 2611402.0, "step": 1145 }, { "entropy": 6.261027193069458, "epoch": 0.012358548354163756, "grad_norm": 1.03125, "learning_rate": 0.0004972666137784759, "loss": 6.2672, "mean_token_accuracy": 0.1381250239908695, "num_tokens": 2623976.0, "step": 1150 }, { "entropy": 6.152841472625733, "epoch": 0.012412281173094904, "grad_norm": 1.0703125, "learning_rate": 0.0004970804914394271, "loss": 6.2529, "mean_token_accuracy": 0.13515327349305153, "num_tokens": 2635093.0, "step": 1155 }, { "entropy": 6.196397590637207, "epoch": 0.01246601399202605, "grad_norm": 0.96875, "learning_rate": 0.0004968882806515225, "loss": 6.1445, "mean_token_accuracy": 0.15016828179359437, "num_tokens": 2646262.0, "step": 1160 }, { "entropy": 6.208798456192016, "epoch": 0.012519746810957197, "grad_norm": 1.1484375, "learning_rate": 0.0004966899866843177, "loss": 6.2398, "mean_token_accuracy": 0.14184571355581282, "num_tokens": 2657325.0, "step": 1165 }, { "entropy": 6.073056030273437, "epoch": 0.012573479629888343, "grad_norm": 1.015625, "learning_rate": 0.000496485614974142, "loss": 6.1166, "mean_token_accuracy": 0.140309177339077, "num_tokens": 2669218.0, "step": 1170 }, { "entropy": 6.194371080398559, "epoch": 0.01262721244881949, "grad_norm": 0.96484375, "learning_rate": 0.0004962751711239492, "loss": 6.1338, "mean_token_accuracy": 0.14102206751704216, "num_tokens": 2681034.0, "step": 1175 }, { "entropy": 6.2010109424591064, "epoch": 0.012680945267750637, "grad_norm": 0.921875, "learning_rate": 0.0004960586609031636, "loss": 6.2307, "mean_token_accuracy": 0.13652921691536904, "num_tokens": 2692853.0, "step": 1180 }, { "entropy": 6.0191319465637205, "epoch": 0.012734678086681784, "grad_norm": 1.0078125, "learning_rate": 0.0004958360902475224, "loss": 5.9808, "mean_token_accuracy": 0.15345293283462524, "num_tokens": 2703470.0, "step": 1185 }, { "entropy": 6.1350805282592775, "epoch": 0.01278841090561293, "grad_norm": 1.0234375, "learning_rate": 0.0004956074652589125, "loss": 6.1146, "mean_token_accuracy": 0.14526959359645844, "num_tokens": 2713740.0, "step": 1190 }, { "entropy": 6.040780162811279, "epoch": 0.012842143724544078, "grad_norm": 0.953125, "learning_rate": 0.0004953727922052035, "loss": 6.052, "mean_token_accuracy": 0.15104619711637496, "num_tokens": 2724951.0, "step": 1195 }, { "entropy": 6.057363033294678, "epoch": 0.012895876543475224, "grad_norm": 1.0390625, "learning_rate": 0.0004951320775200756, "loss": 6.1079, "mean_token_accuracy": 0.15360509753227233, "num_tokens": 2735545.0, "step": 1200 }, { "entropy": 6.233933353424073, "epoch": 0.012949609362406371, "grad_norm": 1.0859375, "learning_rate": 0.0004948853278028436, "loss": 6.1821, "mean_token_accuracy": 0.14036801978945732, "num_tokens": 2747176.0, "step": 1205 }, { "entropy": 6.063135814666748, "epoch": 0.013003342181337517, "grad_norm": 1.0234375, "learning_rate": 0.0004946325498182755, "loss": 6.0523, "mean_token_accuracy": 0.14713248685002328, "num_tokens": 2757439.0, "step": 1210 }, { "entropy": 6.069062185287476, "epoch": 0.013057075000268665, "grad_norm": 0.9765625, "learning_rate": 0.0004943737504964076, "loss": 6.0739, "mean_token_accuracy": 0.14628921821713448, "num_tokens": 2768832.0, "step": 1215 }, { "entropy": 6.217538452148437, "epoch": 0.01311080781919981, "grad_norm": 1.0546875, "learning_rate": 0.000494108936932354, "loss": 6.2231, "mean_token_accuracy": 0.14129021465778352, "num_tokens": 2780557.0, "step": 1220 }, { "entropy": 6.103370571136475, "epoch": 0.013164540638130958, "grad_norm": 0.8984375, "learning_rate": 0.0004938381163861124, "loss": 6.1506, "mean_token_accuracy": 0.14464109539985656, "num_tokens": 2791630.0, "step": 1225 }, { "entropy": 6.203542852401734, "epoch": 0.013218273457062104, "grad_norm": 1.0390625, "learning_rate": 0.0004935612962823645, "loss": 6.1708, "mean_token_accuracy": 0.14704614207148553, "num_tokens": 2802920.0, "step": 1230 }, { "entropy": 6.125507640838623, "epoch": 0.013272006275993252, "grad_norm": 1.2421875, "learning_rate": 0.0004932784842102739, "loss": 6.2278, "mean_token_accuracy": 0.13306833431124687, "num_tokens": 2815119.0, "step": 1235 }, { "entropy": 6.089851427078247, "epoch": 0.013325739094924398, "grad_norm": 1.2109375, "learning_rate": 0.0004929896879232758, "loss": 6.0673, "mean_token_accuracy": 0.15316638201475144, "num_tokens": 2825475.0, "step": 1240 }, { "entropy": 6.11448221206665, "epoch": 0.013379471913855545, "grad_norm": 1.0859375, "learning_rate": 0.0004926949153388668, "loss": 6.0862, "mean_token_accuracy": 0.1438266344368458, "num_tokens": 2836751.0, "step": 1245 }, { "entropy": 6.065900611877441, "epoch": 0.013433204732786691, "grad_norm": 0.9453125, "learning_rate": 0.0004923941745383859, "loss": 6.1254, "mean_token_accuracy": 0.14495786055922508, "num_tokens": 2848396.0, "step": 1250 }, { "entropy": 6.175085210800171, "epoch": 0.013486937551717839, "grad_norm": 0.921875, "learning_rate": 0.000492087473766794, "loss": 6.1109, "mean_token_accuracy": 0.14748385846614837, "num_tokens": 2859635.0, "step": 1255 }, { "entropy": 6.036644649505615, "epoch": 0.013540670370648985, "grad_norm": 0.9609375, "learning_rate": 0.000491774821432448, "loss": 6.0927, "mean_token_accuracy": 0.14415860995650293, "num_tokens": 2871294.0, "step": 1260 }, { "entropy": 6.150858688354492, "epoch": 0.013594403189580133, "grad_norm": 1.015625, "learning_rate": 0.0004914562261068693, "loss": 6.1425, "mean_token_accuracy": 0.14190022721886636, "num_tokens": 2881877.0, "step": 1265 }, { "entropy": 6.08399338722229, "epoch": 0.013648136008511278, "grad_norm": 0.921875, "learning_rate": 0.0004911316965245098, "loss": 6.0469, "mean_token_accuracy": 0.14779358804225923, "num_tokens": 2893084.0, "step": 1270 }, { "entropy": 6.018289709091187, "epoch": 0.013701868827442426, "grad_norm": 0.92578125, "learning_rate": 0.000490801241582512, "loss": 6.0408, "mean_token_accuracy": 0.15105676501989365, "num_tokens": 2903884.0, "step": 1275 }, { "entropy": 6.206864881515503, "epoch": 0.013755601646373572, "grad_norm": 0.91796875, "learning_rate": 0.000490464870340465, "loss": 6.1785, "mean_token_accuracy": 0.14684298038482665, "num_tokens": 2916302.0, "step": 1280 }, { "entropy": 5.958971071243286, "epoch": 0.01380933446530472, "grad_norm": 0.9765625, "learning_rate": 0.0004901225920201563, "loss": 6.017, "mean_token_accuracy": 0.1494239941239357, "num_tokens": 2926945.0, "step": 1285 }, { "entropy": 6.012639570236206, "epoch": 0.013863067284235865, "grad_norm": 0.90234375, "learning_rate": 0.000489774416005319, "loss": 6.0225, "mean_token_accuracy": 0.16030077040195465, "num_tokens": 2938305.0, "step": 1290 }, { "entropy": 6.1305427074432375, "epoch": 0.013916800103167013, "grad_norm": 1.078125, "learning_rate": 0.0004894203518413742, "loss": 6.1889, "mean_token_accuracy": 0.14667668342590331, "num_tokens": 2949652.0, "step": 1295 }, { "entropy": 6.179107427597046, "epoch": 0.013970532922098159, "grad_norm": 0.9921875, "learning_rate": 0.0004890604092351701, "loss": 6.097, "mean_token_accuracy": 0.1481576070189476, "num_tokens": 2960237.0, "step": 1300 }, { "entropy": 5.984218406677246, "epoch": 0.014024265741029307, "grad_norm": 1.0546875, "learning_rate": 0.000488694598054715, "loss": 6.0083, "mean_token_accuracy": 0.14653314501047135, "num_tokens": 2971360.0, "step": 1305 }, { "entropy": 6.132961654663086, "epoch": 0.014077998559960453, "grad_norm": 0.98828125, "learning_rate": 0.0004883229283289071, "loss": 6.1534, "mean_token_accuracy": 0.1430380217730999, "num_tokens": 2981751.0, "step": 1310 }, { "entropy": 6.08388123512268, "epoch": 0.0141317313788916, "grad_norm": 0.94921875, "learning_rate": 0.00048794541024725993, "loss": 6.1837, "mean_token_accuracy": 0.13980235084891318, "num_tokens": 2993284.0, "step": 1315 }, { "entropy": 6.234730958938599, "epoch": 0.014185464197822746, "grad_norm": 1.0859375, "learning_rate": 0.0004875620541596221, "loss": 6.1498, "mean_token_accuracy": 0.14336772859096528, "num_tokens": 3004853.0, "step": 1320 }, { "entropy": 6.123141479492188, "epoch": 0.014239197016753894, "grad_norm": 1.0390625, "learning_rate": 0.00048717287057589454, "loss": 6.137, "mean_token_accuracy": 0.14076138213276862, "num_tokens": 3015875.0, "step": 1325 }, { "entropy": 5.958143711090088, "epoch": 0.01429292983568504, "grad_norm": 1.1015625, "learning_rate": 0.0004867778701657417, "loss": 6.0321, "mean_token_accuracy": 0.14536121785640715, "num_tokens": 3026180.0, "step": 1330 }, { "entropy": 5.994622421264649, "epoch": 0.014346662654616187, "grad_norm": 0.98828125, "learning_rate": 0.00048637706375829955, "loss": 6.0016, "mean_token_accuracy": 0.146102274954319, "num_tokens": 3038647.0, "step": 1335 }, { "entropy": 6.036538553237915, "epoch": 0.014400395473547333, "grad_norm": 1.09375, "learning_rate": 0.000485970462341878, "loss": 6.0033, "mean_token_accuracy": 0.14610179960727693, "num_tokens": 3050087.0, "step": 1340 }, { "entropy": 6.114994859695434, "epoch": 0.01445412829247848, "grad_norm": 0.98828125, "learning_rate": 0.00048555807706366044, "loss": 6.191, "mean_token_accuracy": 0.14669101536273957, "num_tokens": 3061962.0, "step": 1345 }, { "entropy": 6.160302257537841, "epoch": 0.014507861111409627, "grad_norm": 0.9765625, "learning_rate": 0.00048513991922939756, "loss": 6.1876, "mean_token_accuracy": 0.1374008759856224, "num_tokens": 3074375.0, "step": 1350 }, { "entropy": 6.054080057144165, "epoch": 0.014561593930340774, "grad_norm": 1.046875, "learning_rate": 0.00048471600030309744, "loss": 5.9516, "mean_token_accuracy": 0.14929106086492538, "num_tokens": 3085760.0, "step": 1355 }, { "entropy": 6.053500366210938, "epoch": 0.01461532674927192, "grad_norm": 1.03125, "learning_rate": 0.00048428633190671186, "loss": 6.1074, "mean_token_accuracy": 0.1490132227540016, "num_tokens": 3096894.0, "step": 1360 }, { "entropy": 6.08893837928772, "epoch": 0.014669059568203068, "grad_norm": 1.03125, "learning_rate": 0.0004838509258198167, "loss": 6.1199, "mean_token_accuracy": 0.14497611969709395, "num_tokens": 3108485.0, "step": 1365 }, { "entropy": 6.077220821380616, "epoch": 0.014722792387134214, "grad_norm": 1.0078125, "learning_rate": 0.00048340979397929, "loss": 6.0533, "mean_token_accuracy": 0.14355420991778373, "num_tokens": 3119499.0, "step": 1370 }, { "entropy": 6.023743915557861, "epoch": 0.014776525206065361, "grad_norm": 0.96875, "learning_rate": 0.00048296294847898386, "loss": 5.986, "mean_token_accuracy": 0.14942106306552888, "num_tokens": 3130389.0, "step": 1375 }, { "entropy": 6.09236855506897, "epoch": 0.014830258024996507, "grad_norm": 0.9375, "learning_rate": 0.0004825104015693934, "loss": 6.1202, "mean_token_accuracy": 0.14113230854272843, "num_tokens": 3141034.0, "step": 1380 }, { "entropy": 6.072746324539184, "epoch": 0.014883990843927655, "grad_norm": 0.953125, "learning_rate": 0.0004820521656573208, "loss": 6.0854, "mean_token_accuracy": 0.14430767744779588, "num_tokens": 3152438.0, "step": 1385 }, { "entropy": 6.022948694229126, "epoch": 0.0149377236628588, "grad_norm": 0.89453125, "learning_rate": 0.00048158825330553505, "loss": 6.0776, "mean_token_accuracy": 0.1505906477570534, "num_tokens": 3163994.0, "step": 1390 }, { "entropy": 6.0805083274841305, "epoch": 0.014991456481789948, "grad_norm": 1.0, "learning_rate": 0.00048111867723242763, "loss": 6.0461, "mean_token_accuracy": 0.1505217045545578, "num_tokens": 3175330.0, "step": 1395 }, { "entropy": 5.97646312713623, "epoch": 0.015045189300721094, "grad_norm": 0.91015625, "learning_rate": 0.0004806434503116637, "loss": 6.0017, "mean_token_accuracy": 0.14700844660401344, "num_tokens": 3185981.0, "step": 1400 }, { "entropy": 6.015813255310059, "epoch": 0.015098922119652242, "grad_norm": 0.98046875, "learning_rate": 0.0004801625855718296, "loss": 5.9655, "mean_token_accuracy": 0.1522893041372299, "num_tokens": 3198267.0, "step": 1405 }, { "entropy": 6.091410112380982, "epoch": 0.015152654938583388, "grad_norm": 0.97265625, "learning_rate": 0.00047967609619607477, "loss": 6.0322, "mean_token_accuracy": 0.14734495803713799, "num_tokens": 3210405.0, "step": 1410 }, { "entropy": 5.986245775222779, "epoch": 0.015206387757514536, "grad_norm": 1.0, "learning_rate": 0.0004791839955217513, "loss": 6.0579, "mean_token_accuracy": 0.1433064103126526, "num_tokens": 3220528.0, "step": 1415 }, { "entropy": 6.014886426925659, "epoch": 0.015260120576445681, "grad_norm": 1.0546875, "learning_rate": 0.00047868629704004786, "loss": 6.0343, "mean_token_accuracy": 0.14501605182886124, "num_tokens": 3231623.0, "step": 1420 }, { "entropy": 5.983619356155396, "epoch": 0.015313853395376829, "grad_norm": 0.97265625, "learning_rate": 0.00047818301439561965, "loss": 6.0083, "mean_token_accuracy": 0.14880426228046417, "num_tokens": 3242067.0, "step": 1425 }, { "entropy": 5.971679782867431, "epoch": 0.015367586214307975, "grad_norm": 1.015625, "learning_rate": 0.00047767416138621454, "loss": 5.9362, "mean_token_accuracy": 0.15313563197851182, "num_tokens": 3252898.0, "step": 1430 }, { "entropy": 6.075572872161866, "epoch": 0.015421319033239123, "grad_norm": 0.95703125, "learning_rate": 0.000477159751962295, "loss": 6.1571, "mean_token_accuracy": 0.14407433122396468, "num_tokens": 3265128.0, "step": 1435 }, { "entropy": 6.120305967330933, "epoch": 0.015475051852170268, "grad_norm": 0.9296875, "learning_rate": 0.00047663980022665507, "loss": 6.0641, "mean_token_accuracy": 0.14864805042743684, "num_tokens": 3275808.0, "step": 1440 }, { "entropy": 6.003734397888183, "epoch": 0.015528784671101416, "grad_norm": 1.0625, "learning_rate": 0.00047611432043403437, "loss": 6.0399, "mean_token_accuracy": 0.15222140848636628, "num_tokens": 3286682.0, "step": 1445 }, { "entropy": 6.070817852020264, "epoch": 0.015582517490032562, "grad_norm": 0.94140625, "learning_rate": 0.0004755833269907267, "loss": 6.0783, "mean_token_accuracy": 0.153215591609478, "num_tokens": 3299402.0, "step": 1450 }, { "entropy": 6.1345799446105955, "epoch": 0.01563625030896371, "grad_norm": 1.0078125, "learning_rate": 0.0004750468344541857, "loss": 6.1546, "mean_token_accuracy": 0.14280287623405458, "num_tokens": 3311185.0, "step": 1455 }, { "entropy": 6.167125463485718, "epoch": 0.015689983127894856, "grad_norm": 1.046875, "learning_rate": 0.00047450485753262525, "loss": 6.0728, "mean_token_accuracy": 0.14637029469013213, "num_tokens": 3322489.0, "step": 1460 }, { "entropy": 5.956501626968384, "epoch": 0.015743715946826, "grad_norm": 0.9609375, "learning_rate": 0.00047395741108461633, "loss": 6.0951, "mean_token_accuracy": 0.1488440901041031, "num_tokens": 3334731.0, "step": 1465 }, { "entropy": 6.063800287246704, "epoch": 0.01579744876575715, "grad_norm": 0.87890625, "learning_rate": 0.00047340451011867985, "loss": 6.0151, "mean_token_accuracy": 0.15109897255897523, "num_tokens": 3347107.0, "step": 1470 }, { "entropy": 6.066719198226929, "epoch": 0.015851181584688297, "grad_norm": 0.97265625, "learning_rate": 0.00047284616979287515, "loss": 6.0086, "mean_token_accuracy": 0.1461263604462147, "num_tokens": 3358640.0, "step": 1475 }, { "entropy": 6.058962821960449, "epoch": 0.015904914403619443, "grad_norm": 0.93359375, "learning_rate": 0.00047228240541438433, "loss": 6.1511, "mean_token_accuracy": 0.1421753115952015, "num_tokens": 3369743.0, "step": 1480 }, { "entropy": 6.13518762588501, "epoch": 0.01595864722255059, "grad_norm": 0.98046875, "learning_rate": 0.00047171323243909257, "loss": 6.1039, "mean_token_accuracy": 0.14061811119318007, "num_tokens": 3381413.0, "step": 1485 }, { "entropy": 6.0545531749725345, "epoch": 0.016012380041481738, "grad_norm": 0.95703125, "learning_rate": 0.00047113866647116457, "loss": 5.9629, "mean_token_accuracy": 0.15147602558135986, "num_tokens": 3391347.0, "step": 1490 }, { "entropy": 6.090392827987671, "epoch": 0.016066112860412884, "grad_norm": 0.93359375, "learning_rate": 0.0004705587232626164, "loss": 6.1731, "mean_token_accuracy": 0.14226020574569703, "num_tokens": 3403348.0, "step": 1495 }, { "entropy": 6.013070344924927, "epoch": 0.01611984567934403, "grad_norm": 0.9296875, "learning_rate": 0.00046997341871288424, "loss": 5.9502, "mean_token_accuracy": 0.15287814140319825, "num_tokens": 3414845.0, "step": 1500 }, { "entropy": 5.949804735183716, "epoch": 0.016173578498275176, "grad_norm": 1.046875, "learning_rate": 0.0004693827688683879, "loss": 5.9376, "mean_token_accuracy": 0.15804148465394974, "num_tokens": 3426105.0, "step": 1505 }, { "entropy": 5.934489631652832, "epoch": 0.016227311317206325, "grad_norm": 1.015625, "learning_rate": 0.0004687867899220914, "loss": 5.9319, "mean_token_accuracy": 0.14723418205976485, "num_tokens": 3438001.0, "step": 1510 }, { "entropy": 5.975189590454102, "epoch": 0.01628104413613747, "grad_norm": 0.93359375, "learning_rate": 0.00046818549821305846, "loss": 5.9712, "mean_token_accuracy": 0.15585855692625045, "num_tokens": 3448888.0, "step": 1515 }, { "entropy": 5.960818529129028, "epoch": 0.016334776955068617, "grad_norm": 0.9921875, "learning_rate": 0.00046757891022600494, "loss": 6.0201, "mean_token_accuracy": 0.14731887802481652, "num_tokens": 3460325.0, "step": 1520 }, { "entropy": 6.036577892303467, "epoch": 0.016388509773999763, "grad_norm": 1.078125, "learning_rate": 0.0004669670425908471, "loss": 5.9925, "mean_token_accuracy": 0.14315218701958657, "num_tokens": 3471599.0, "step": 1525 }, { "entropy": 5.994147682189942, "epoch": 0.016442242592930912, "grad_norm": 0.93359375, "learning_rate": 0.0004663499120822451, "loss": 6.0781, "mean_token_accuracy": 0.14317068159580232, "num_tokens": 3482661.0, "step": 1530 }, { "entropy": 6.0836540222167965, "epoch": 0.016495975411862058, "grad_norm": 0.9921875, "learning_rate": 0.0004657275356191437, "loss": 6.0795, "mean_token_accuracy": 0.14395593404769896, "num_tokens": 3493111.0, "step": 1535 }, { "entropy": 6.156943607330322, "epoch": 0.016549708230793204, "grad_norm": 0.98046875, "learning_rate": 0.00046509993026430804, "loss": 6.1462, "mean_token_accuracy": 0.14156040474772452, "num_tokens": 3505575.0, "step": 1540 }, { "entropy": 6.01388897895813, "epoch": 0.01660344104972435, "grad_norm": 1.125, "learning_rate": 0.0004644671132238558, "loss": 6.0175, "mean_token_accuracy": 0.14803557544946672, "num_tokens": 3515498.0, "step": 1545 }, { "entropy": 6.069819784164428, "epoch": 0.0166571738686555, "grad_norm": 0.96875, "learning_rate": 0.00046382910184678585, "loss": 5.9977, "mean_token_accuracy": 0.15337349474430084, "num_tokens": 3527280.0, "step": 1550 }, { "entropy": 5.991217470169067, "epoch": 0.016710906687586645, "grad_norm": 0.9453125, "learning_rate": 0.0004631859136245025, "loss": 6.0206, "mean_token_accuracy": 0.14981672763824463, "num_tokens": 3538979.0, "step": 1555 }, { "entropy": 6.008299779891968, "epoch": 0.01676463950651779, "grad_norm": 0.9453125, "learning_rate": 0.0004625375661903357, "loss": 6.0896, "mean_token_accuracy": 0.14561396539211274, "num_tokens": 3551193.0, "step": 1560 }, { "entropy": 6.0555739402771, "epoch": 0.016818372325448937, "grad_norm": 0.94921875, "learning_rate": 0.00046188407731905787, "loss": 5.9618, "mean_token_accuracy": 0.15235140174627304, "num_tokens": 3562052.0, "step": 1565 }, { "entropy": 5.980268669128418, "epoch": 0.016872105144380086, "grad_norm": 0.93359375, "learning_rate": 0.00046122546492639643, "loss": 6.0227, "mean_token_accuracy": 0.1535588562488556, "num_tokens": 3573378.0, "step": 1570 }, { "entropy": 6.064887428283692, "epoch": 0.016925837963311232, "grad_norm": 1.0, "learning_rate": 0.000460561747068543, "loss": 6.0716, "mean_token_accuracy": 0.15122793316841127, "num_tokens": 3584533.0, "step": 1575 }, { "entropy": 6.035519599914551, "epoch": 0.016979570782242378, "grad_norm": 0.91796875, "learning_rate": 0.0004598929419416578, "loss": 5.9443, "mean_token_accuracy": 0.1535245344042778, "num_tokens": 3595934.0, "step": 1580 }, { "entropy": 5.846812677383423, "epoch": 0.017033303601173524, "grad_norm": 1.078125, "learning_rate": 0.00045921906788137123, "loss": 5.9077, "mean_token_accuracy": 0.1490027278661728, "num_tokens": 3607704.0, "step": 1585 }, { "entropy": 6.140884160995483, "epoch": 0.017087036420104673, "grad_norm": 0.91796875, "learning_rate": 0.00045854014336228115, "loss": 6.0267, "mean_token_accuracy": 0.14754170551896095, "num_tokens": 3619135.0, "step": 1590 }, { "entropy": 5.892256498336792, "epoch": 0.01714076923903582, "grad_norm": 0.95703125, "learning_rate": 0.00045785618699744615, "loss": 5.9312, "mean_token_accuracy": 0.15658772438764573, "num_tokens": 3630128.0, "step": 1595 }, { "entropy": 5.898729991912842, "epoch": 0.017194502057966965, "grad_norm": 0.96875, "learning_rate": 0.00045716721753787543, "loss": 5.8594, "mean_token_accuracy": 0.15367861837148666, "num_tokens": 3642045.0, "step": 1600 }, { "entropy": 6.016676568984986, "epoch": 0.01724823487689811, "grad_norm": 0.95703125, "learning_rate": 0.0004564732538720148, "loss": 5.9743, "mean_token_accuracy": 0.15024706870317459, "num_tokens": 3652631.0, "step": 1605 }, { "entropy": 5.975802707672119, "epoch": 0.01730196769582926, "grad_norm": 1.046875, "learning_rate": 0.00045577431502522877, "loss": 5.988, "mean_token_accuracy": 0.15665287524461746, "num_tokens": 3663669.0, "step": 1610 }, { "entropy": 5.988212919235229, "epoch": 0.017355700514760406, "grad_norm": 0.8828125, "learning_rate": 0.0004550704201592787, "loss": 5.964, "mean_token_accuracy": 0.15508741587400438, "num_tokens": 3675425.0, "step": 1615 }, { "entropy": 5.8765256881713865, "epoch": 0.017409433333691552, "grad_norm": 0.99609375, "learning_rate": 0.0004543615885717981, "loss": 5.9864, "mean_token_accuracy": 0.1466473385691643, "num_tokens": 3687030.0, "step": 1620 }, { "entropy": 6.067311143875122, "epoch": 0.017463166152622698, "grad_norm": 1.046875, "learning_rate": 0.00045364783969576296, "loss": 5.9918, "mean_token_accuracy": 0.14988280236721038, "num_tokens": 3697597.0, "step": 1625 }, { "entropy": 6.052053213119507, "epoch": 0.017516898971553847, "grad_norm": 0.9140625, "learning_rate": 0.0004529291930989592, "loss": 6.041, "mean_token_accuracy": 0.15012367069721222, "num_tokens": 3710967.0, "step": 1630 }, { "entropy": 5.998264408111572, "epoch": 0.017570631790484993, "grad_norm": 0.90625, "learning_rate": 0.0004522056684834464, "loss": 5.9856, "mean_token_accuracy": 0.15023086369037628, "num_tokens": 3722452.0, "step": 1635 }, { "entropy": 5.971319723129272, "epoch": 0.01762436460941614, "grad_norm": 1.0078125, "learning_rate": 0.0004514772856850173, "loss": 5.9079, "mean_token_accuracy": 0.15278342962265015, "num_tokens": 3733256.0, "step": 1640 }, { "entropy": 5.9798520565032955, "epoch": 0.017678097428347285, "grad_norm": 1.0234375, "learning_rate": 0.0004507440646726542, "loss": 5.9674, "mean_token_accuracy": 0.15721064656972886, "num_tokens": 3744458.0, "step": 1645 }, { "entropy": 5.901952314376831, "epoch": 0.017731830247278434, "grad_norm": 0.94140625, "learning_rate": 0.0004500060255479818, "loss": 5.9239, "mean_token_accuracy": 0.15427957475185394, "num_tokens": 3756099.0, "step": 1650 }, { "entropy": 6.088839864730835, "epoch": 0.01778556306620958, "grad_norm": 1.015625, "learning_rate": 0.0004492631885447151, "loss": 6.0048, "mean_token_accuracy": 0.1539461597800255, "num_tokens": 3768667.0, "step": 1655 }, { "entropy": 5.9746912002563475, "epoch": 0.017839295885140726, "grad_norm": 0.96875, "learning_rate": 0.00044851557402810616, "loss": 5.925, "mean_token_accuracy": 0.15976884216070175, "num_tokens": 3779303.0, "step": 1660 }, { "entropy": 5.987901973724365, "epoch": 0.017893028704071872, "grad_norm": 1.0, "learning_rate": 0.00044776320249438444, "loss": 5.9503, "mean_token_accuracy": 0.14600329846143723, "num_tokens": 3792271.0, "step": 1665 }, { "entropy": 5.981582593917847, "epoch": 0.01794676152300302, "grad_norm": 1.0703125, "learning_rate": 0.00044700609457019565, "loss": 6.0726, "mean_token_accuracy": 0.1465673990547657, "num_tokens": 3805387.0, "step": 1670 }, { "entropy": 6.0047464847564695, "epoch": 0.018000494341934167, "grad_norm": 0.9375, "learning_rate": 0.0004462442710120359, "loss": 5.9876, "mean_token_accuracy": 0.14909646064043044, "num_tokens": 3817184.0, "step": 1675 }, { "entropy": 5.832823324203491, "epoch": 0.018054227160865313, "grad_norm": 0.9296875, "learning_rate": 0.000445477752705683, "loss": 5.8206, "mean_token_accuracy": 0.16253771334886552, "num_tokens": 3827399.0, "step": 1680 }, { "entropy": 5.989438438415528, "epoch": 0.01810795997979646, "grad_norm": 0.95703125, "learning_rate": 0.00044470656066562336, "loss": 5.8701, "mean_token_accuracy": 0.1581664875149727, "num_tokens": 3838320.0, "step": 1685 }, { "entropy": 5.9107225894927975, "epoch": 0.01816169279872761, "grad_norm": 1.0390625, "learning_rate": 0.0004439307160344765, "loss": 5.9919, "mean_token_accuracy": 0.15036764591932297, "num_tokens": 3849431.0, "step": 1690 }, { "entropy": 5.968296241760254, "epoch": 0.018215425617658754, "grad_norm": 0.91015625, "learning_rate": 0.00044315024008241473, "loss": 5.9573, "mean_token_accuracy": 0.1487127035856247, "num_tokens": 3860265.0, "step": 1695 }, { "entropy": 5.979854774475098, "epoch": 0.0182691584365899, "grad_norm": 0.92578125, "learning_rate": 0.0004423651542065806, "loss": 5.9793, "mean_token_accuracy": 0.1496817596256733, "num_tokens": 3872906.0, "step": 1700 }, { "entropy": 5.9607490539550785, "epoch": 0.018322891255521046, "grad_norm": 1.0546875, "learning_rate": 0.00044157547993050006, "loss": 5.8952, "mean_token_accuracy": 0.16413907706737518, "num_tokens": 3883592.0, "step": 1705 }, { "entropy": 5.914381790161133, "epoch": 0.018376624074452196, "grad_norm": 0.9453125, "learning_rate": 0.00044078123890349227, "loss": 5.985, "mean_token_accuracy": 0.150118912756443, "num_tokens": 3895827.0, "step": 1710 }, { "entropy": 6.05848798751831, "epoch": 0.01843035689338334, "grad_norm": 0.953125, "learning_rate": 0.00043998245290007606, "loss": 5.9976, "mean_token_accuracy": 0.15300071835517884, "num_tokens": 3906414.0, "step": 1715 }, { "entropy": 5.967066144943237, "epoch": 0.018484089712314487, "grad_norm": 0.98828125, "learning_rate": 0.00043917914381937323, "loss": 5.9985, "mean_token_accuracy": 0.15606716126203538, "num_tokens": 3917546.0, "step": 1720 }, { "entropy": 6.0117936611175535, "epoch": 0.018537822531245633, "grad_norm": 0.984375, "learning_rate": 0.00043837133368450815, "loss": 5.9883, "mean_token_accuracy": 0.15176693648099898, "num_tokens": 3930251.0, "step": 1725 }, { "entropy": 5.942166519165039, "epoch": 0.018591555350176783, "grad_norm": 0.95703125, "learning_rate": 0.0004375590446420037, "loss": 5.8854, "mean_token_accuracy": 0.15790802389383315, "num_tokens": 3940912.0, "step": 1730 }, { "entropy": 5.968822240829468, "epoch": 0.01864528816910793, "grad_norm": 1.015625, "learning_rate": 0.0004367422989611743, "loss": 5.9738, "mean_token_accuracy": 0.15192489475011825, "num_tokens": 3952163.0, "step": 1735 }, { "entropy": 6.0719554901123045, "epoch": 0.018699020988039074, "grad_norm": 0.953125, "learning_rate": 0.0004359211190335153, "loss": 6.0409, "mean_token_accuracy": 0.1489500418305397, "num_tokens": 3964747.0, "step": 1740 }, { "entropy": 6.024024391174317, "epoch": 0.01875275380697022, "grad_norm": 1.0390625, "learning_rate": 0.00043509552737208923, "loss": 5.9648, "mean_token_accuracy": 0.15161607265472413, "num_tokens": 3975789.0, "step": 1745 }, { "entropy": 5.890661907196045, "epoch": 0.01880648662590137, "grad_norm": 0.96875, "learning_rate": 0.00043426554661090853, "loss": 5.8881, "mean_token_accuracy": 0.15519577413797378, "num_tokens": 3987816.0, "step": 1750 }, { "entropy": 5.976252126693725, "epoch": 0.018860219444832516, "grad_norm": 0.98046875, "learning_rate": 0.00043343119950431516, "loss": 5.9422, "mean_token_accuracy": 0.16160201877355576, "num_tokens": 3999882.0, "step": 1755 }, { "entropy": 6.038746356964111, "epoch": 0.01891395226376366, "grad_norm": 0.94140625, "learning_rate": 0.00043259250892635644, "loss": 6.0676, "mean_token_accuracy": 0.1523244395852089, "num_tokens": 4012018.0, "step": 1760 }, { "entropy": 5.886965990066528, "epoch": 0.018967685082694807, "grad_norm": 1.109375, "learning_rate": 0.0004317494978701582, "loss": 5.9402, "mean_token_accuracy": 0.15264154970645905, "num_tokens": 4023617.0, "step": 1765 }, { "entropy": 5.93788857460022, "epoch": 0.019021417901625957, "grad_norm": 0.94921875, "learning_rate": 0.0004309021894472943, "loss": 5.932, "mean_token_accuracy": 0.1563568189740181, "num_tokens": 4035514.0, "step": 1770 }, { "entropy": 6.018500137329101, "epoch": 0.019075150720557103, "grad_norm": 0.9453125, "learning_rate": 0.0004300506068871534, "loss": 5.9049, "mean_token_accuracy": 0.15637483298778534, "num_tokens": 4046353.0, "step": 1775 }, { "entropy": 5.920236587524414, "epoch": 0.01912888353948825, "grad_norm": 1.1328125, "learning_rate": 0.00042919477353630135, "loss": 5.9225, "mean_token_accuracy": 0.15857286751270294, "num_tokens": 4056839.0, "step": 1780 }, { "entropy": 5.953616905212402, "epoch": 0.019182616358419394, "grad_norm": 1.0078125, "learning_rate": 0.000428334712857842, "loss": 5.9055, "mean_token_accuracy": 0.15334571674466133, "num_tokens": 4068501.0, "step": 1785 }, { "entropy": 5.896912384033203, "epoch": 0.019236349177350544, "grad_norm": 0.89453125, "learning_rate": 0.00042747044843077304, "loss": 5.8296, "mean_token_accuracy": 0.1632518321275711, "num_tokens": 4080234.0, "step": 1790 }, { "entropy": 5.949176025390625, "epoch": 0.01929008199628169, "grad_norm": 0.984375, "learning_rate": 0.00042660200394934047, "loss": 5.9342, "mean_token_accuracy": 0.15496103018522261, "num_tokens": 4091278.0, "step": 1795 }, { "entropy": 5.872956085205078, "epoch": 0.019343814815212836, "grad_norm": 0.9609375, "learning_rate": 0.00042572940322238844, "loss": 5.8986, "mean_token_accuracy": 0.159717920422554, "num_tokens": 4104017.0, "step": 1800 }, { "entropy": 6.045824766159058, "epoch": 0.01939754763414398, "grad_norm": 0.9296875, "learning_rate": 0.00042485267017270664, "loss": 5.9715, "mean_token_accuracy": 0.15220074355602264, "num_tokens": 4115840.0, "step": 1805 }, { "entropy": 5.957116413116455, "epoch": 0.01945128045307513, "grad_norm": 0.98828125, "learning_rate": 0.0004239718288363745, "loss": 5.9011, "mean_token_accuracy": 0.15585386604070664, "num_tokens": 4126156.0, "step": 1810 }, { "entropy": 5.921035194396973, "epoch": 0.019505013272006277, "grad_norm": 0.92578125, "learning_rate": 0.0004230869033621023, "loss": 5.9728, "mean_token_accuracy": 0.1535612739622593, "num_tokens": 4137430.0, "step": 1815 }, { "entropy": 6.0158624172210695, "epoch": 0.019558746090937423, "grad_norm": 0.98828125, "learning_rate": 0.0004221979180105688, "loss": 5.8915, "mean_token_accuracy": 0.1606772392988205, "num_tokens": 4148180.0, "step": 1820 }, { "entropy": 5.926541423797607, "epoch": 0.01961247890986857, "grad_norm": 0.96875, "learning_rate": 0.00042130489715375645, "loss": 5.9404, "mean_token_accuracy": 0.15600281357765197, "num_tokens": 4159321.0, "step": 1825 }, { "entropy": 5.989021730422974, "epoch": 0.019666211728799718, "grad_norm": 0.87109375, "learning_rate": 0.00042040786527428335, "loss": 5.9789, "mean_token_accuracy": 0.150770403444767, "num_tokens": 4171701.0, "step": 1830 }, { "entropy": 6.013437128067016, "epoch": 0.019719944547730864, "grad_norm": 0.9609375, "learning_rate": 0.0004195068469647315, "loss": 6.0031, "mean_token_accuracy": 0.1528964176774025, "num_tokens": 4182471.0, "step": 1835 }, { "entropy": 5.862358665466308, "epoch": 0.01977367736666201, "grad_norm": 0.984375, "learning_rate": 0.00041860186692697297, "loss": 5.9708, "mean_token_accuracy": 0.15291235893964766, "num_tokens": 4194524.0, "step": 1840 }, { "entropy": 6.07710747718811, "epoch": 0.019827410185593156, "grad_norm": 1.09375, "learning_rate": 0.00041769294997149264, "loss": 5.9101, "mean_token_accuracy": 0.1592467501759529, "num_tokens": 4205400.0, "step": 1845 }, { "entropy": 5.889270830154419, "epoch": 0.019881143004524305, "grad_norm": 0.9609375, "learning_rate": 0.0004167801210167081, "loss": 5.848, "mean_token_accuracy": 0.15857322067022322, "num_tokens": 4216128.0, "step": 1850 }, { "entropy": 5.9004319190979, "epoch": 0.01993487582345545, "grad_norm": 1.0, "learning_rate": 0.0004158634050882861, "loss": 5.8819, "mean_token_accuracy": 0.16485319882631302, "num_tokens": 4227338.0, "step": 1855 }, { "entropy": 5.839734077453613, "epoch": 0.019988608642386597, "grad_norm": 1.015625, "learning_rate": 0.0004149428273184569, "loss": 5.9371, "mean_token_accuracy": 0.15411941409111024, "num_tokens": 4238576.0, "step": 1860 }, { "entropy": 5.953181362152099, "epoch": 0.020042341461317743, "grad_norm": 0.90625, "learning_rate": 0.0004140184129453253, "loss": 5.8317, "mean_token_accuracy": 0.16432886570692062, "num_tokens": 4251308.0, "step": 1865 }, { "entropy": 5.920472192764282, "epoch": 0.020096074280248892, "grad_norm": 0.93359375, "learning_rate": 0.000413090187312178, "loss": 5.8803, "mean_token_accuracy": 0.16128864288330078, "num_tokens": 4262646.0, "step": 1870 }, { "entropy": 5.963524627685547, "epoch": 0.020149807099180038, "grad_norm": 1.125, "learning_rate": 0.0004121581758667898, "loss": 5.9365, "mean_token_accuracy": 0.15799531936645508, "num_tokens": 4272665.0, "step": 1875 }, { "entropy": 5.946022081375122, "epoch": 0.020203539918111184, "grad_norm": 0.9453125, "learning_rate": 0.00041122240416072533, "loss": 5.8932, "mean_token_accuracy": 0.1565667286515236, "num_tokens": 4283474.0, "step": 1880 }, { "entropy": 5.8529167652130125, "epoch": 0.02025727273704233, "grad_norm": 1.1015625, "learning_rate": 0.0004102828978486385, "loss": 5.8751, "mean_token_accuracy": 0.15843120515346526, "num_tokens": 4294294.0, "step": 1885 }, { "entropy": 5.9457238674163815, "epoch": 0.02031100555597348, "grad_norm": 0.95703125, "learning_rate": 0.0004093396826875695, "loss": 5.9155, "mean_token_accuracy": 0.15780601650476456, "num_tokens": 4304331.0, "step": 1890 }, { "entropy": 5.859744358062744, "epoch": 0.020364738374904625, "grad_norm": 0.8828125, "learning_rate": 0.00040839278453623837, "loss": 5.8213, "mean_token_accuracy": 0.16632000505924224, "num_tokens": 4315921.0, "step": 1895 }, { "entropy": 5.870091199874878, "epoch": 0.02041847119383577, "grad_norm": 0.98828125, "learning_rate": 0.0004074422293543363, "loss": 5.7803, "mean_token_accuracy": 0.16494602113962173, "num_tokens": 4326994.0, "step": 1900 }, { "entropy": 5.991072273254394, "epoch": 0.020472204012766917, "grad_norm": 1.0, "learning_rate": 0.0004064880432018137, "loss": 5.9941, "mean_token_accuracy": 0.1513021007180214, "num_tokens": 4339200.0, "step": 1905 }, { "entropy": 5.863003730773926, "epoch": 0.020525936831698066, "grad_norm": 0.953125, "learning_rate": 0.00040553025223816615, "loss": 5.8484, "mean_token_accuracy": 0.1549378976225853, "num_tokens": 4350836.0, "step": 1910 }, { "entropy": 5.78472638130188, "epoch": 0.020579669650629212, "grad_norm": 0.96875, "learning_rate": 0.00040456888272171653, "loss": 5.8385, "mean_token_accuracy": 0.15767095237970352, "num_tokens": 4362270.0, "step": 1915 }, { "entropy": 5.997738265991211, "epoch": 0.020633402469560358, "grad_norm": 1.046875, "learning_rate": 0.00040360396100889577, "loss": 5.9712, "mean_token_accuracy": 0.15071888118982316, "num_tokens": 4373342.0, "step": 1920 }, { "entropy": 5.948875188827515, "epoch": 0.020687135288491504, "grad_norm": 1.078125, "learning_rate": 0.0004026355135535202, "loss": 5.942, "mean_token_accuracy": 0.15640480518341066, "num_tokens": 4383773.0, "step": 1925 }, { "entropy": 5.982992839813233, "epoch": 0.020740868107422653, "grad_norm": 1.0703125, "learning_rate": 0.000401663566906066, "loss": 5.8646, "mean_token_accuracy": 0.1617866724729538, "num_tokens": 4395995.0, "step": 1930 }, { "entropy": 5.968017673492431, "epoch": 0.0207946009263538, "grad_norm": 0.9765625, "learning_rate": 0.00040068814771294134, "loss": 6.0062, "mean_token_accuracy": 0.1527876764535904, "num_tokens": 4407413.0, "step": 1935 }, { "entropy": 6.014474534988404, "epoch": 0.020848333745284945, "grad_norm": 1.015625, "learning_rate": 0.0003997092827157562, "loss": 5.9443, "mean_token_accuracy": 0.15978933423757552, "num_tokens": 4418250.0, "step": 1940 }, { "entropy": 5.874887323379516, "epoch": 0.02090206656421609, "grad_norm": 0.953125, "learning_rate": 0.000398726998750589, "loss": 5.8418, "mean_token_accuracy": 0.15898097455501556, "num_tokens": 4430719.0, "step": 1945 }, { "entropy": 5.90364408493042, "epoch": 0.02095579938314724, "grad_norm": 1.0390625, "learning_rate": 0.00039774132274725076, "loss": 5.8066, "mean_token_accuracy": 0.16269971579313278, "num_tokens": 4441783.0, "step": 1950 }, { "entropy": 5.900510597229004, "epoch": 0.021009532202078386, "grad_norm": 1.1015625, "learning_rate": 0.00039675228172854707, "loss": 5.8651, "mean_token_accuracy": 0.16481055617332457, "num_tokens": 4451695.0, "step": 1955 }, { "entropy": 5.877746438980102, "epoch": 0.021063265021009532, "grad_norm": 1.0234375, "learning_rate": 0.0003957599028095371, "loss": 5.908, "mean_token_accuracy": 0.15196669101715088, "num_tokens": 4463437.0, "step": 1960 }, { "entropy": 5.90544638633728, "epoch": 0.021116997839940678, "grad_norm": 0.921875, "learning_rate": 0.00039476421319679017, "loss": 5.8677, "mean_token_accuracy": 0.1617526188492775, "num_tokens": 4474805.0, "step": 1965 }, { "entropy": 5.769601202011108, "epoch": 0.021170730658871827, "grad_norm": 1.046875, "learning_rate": 0.00039376524018764, "loss": 5.7712, "mean_token_accuracy": 0.16277728527784346, "num_tokens": 4485322.0, "step": 1970 }, { "entropy": 6.03261170387268, "epoch": 0.021224463477802973, "grad_norm": 0.96875, "learning_rate": 0.00039276301116943616, "loss": 6.0065, "mean_token_accuracy": 0.14840409606695176, "num_tokens": 4498593.0, "step": 1975 }, { "entropy": 5.92830901145935, "epoch": 0.02127819629673412, "grad_norm": 0.984375, "learning_rate": 0.0003917575536187936, "loss": 5.7884, "mean_token_accuracy": 0.15990394055843354, "num_tokens": 4509791.0, "step": 1980 }, { "entropy": 5.804613447189331, "epoch": 0.021331929115665265, "grad_norm": 0.921875, "learning_rate": 0.00039074889510083894, "loss": 5.8352, "mean_token_accuracy": 0.15364052653312682, "num_tokens": 4522500.0, "step": 1985 }, { "entropy": 5.943467807769776, "epoch": 0.021385661934596414, "grad_norm": 1.046875, "learning_rate": 0.00038973706326845495, "loss": 5.8387, "mean_token_accuracy": 0.16179392337799073, "num_tokens": 4533261.0, "step": 1990 }, { "entropy": 5.8952281951904295, "epoch": 0.02143939475352756, "grad_norm": 1.0078125, "learning_rate": 0.0003887220858615225, "loss": 5.923, "mean_token_accuracy": 0.15579070299863815, "num_tokens": 4545115.0, "step": 1995 }, { "entropy": 5.916673755645752, "epoch": 0.021493127572458706, "grad_norm": 0.98828125, "learning_rate": 0.0003877039907061597, "loss": 5.9129, "mean_token_accuracy": 0.15585279166698457, "num_tokens": 4555652.0, "step": 2000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 7085774481408000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }